FUSÃO DE REPRESENTAÇÕES GERADAS POR MEIO DA APRENDIZAGEM NÃO SUPERVISIONADA VIA INTEGRAÇÃO DE MECANISMO DE ATENÇÃO EM REDES NEURAIS
INTRODUÇÃO: A representação eficiente de imagens é um desafio relevante em visão computacional, pois diferentes extratores de características capturam aspectos complementares dos dados. Redes convolucionais tendem a enfatizar texturas e padrões locais, enquanto arquiteturas baseadas em transformers representam melhor relações globais e informações semânticas. Nesse contexto, a fusão de representações pode produzir descrições visuais mais gerais e robustas, especialmente quando não há rótulos disponíveis para o pré-treinamento. OBJETIVOS: Propor e avaliar a arquitetura LaMPE (Latent Masked Prediction via Experts), destinada à fusão de representações visuais por meio de mecanismos de atenção e aprendizado autossupervisionado. Buscou-se verificar se a representação fundida poderia generalizar para diferentes tarefas de classificação e alcançar desempenho comparável ou superior ao de especialistas individuais e estratégias de concatenação. MATERIAIS E MÉTODO: A arquitetura utilizou três especialistas congelados e heterogêneos: ResNet-50, DINO ViT-S/8 e CLIP ViT-B/32. As características extraídas foram normalizadas, projetadas para uma dimensão latente comum e integradas por um Transformer Encoder com um token de agregação treinável. O treinamento foi realizado sem rótulos, por predição latente mascarada, ocultando-se um especialista e reconstruindo sua representação a partir dos demais. O pré-treinamento utilizou 118.287 imagens do MS-COCO. A avaliação foi conduzida por linear probing e MLP probing nos conjuntos DTD, CUB-200-2011, Food-101 e Kidney, além de comparações com cada backbone e com linhas de base de concatenação. RESULTADOS: A investigação experimental identificou quatro fatores que limitavam o desempenho: colapso do alvo de perda, compressão excessiva do espaço latente, taxa de aprendizado insuficiente e diluição do especialista dominante. A reconstrução de todos os especialistas a partir da representação fundida produziu o maior ganho. Na configuração final, a LaMPE superou o melhor especialista individual no DTD e no Kidney e permaneceu próxima dos melhores resultados nos demais conjuntos. Sua acurácia média foi de 80,9%, equivalente à seleção ideal do melhor especialista por domínio, estimada em 80,6%, e superior à de qualquer backbone fixo. CONSIDERAÇÕES FINAIS: Os resultados indicam que a fusão por atenção pode gerar uma representação única, autossupervisionada e robusta entre domínios. Embora a arquitetura não supere todas as linhas de base em todos os cenários, ela reduz a dependência da escolha prévia de um especialista e mantém desempenho consistente em tarefas distintas. Como continuidade, recomenda-se ampliar o corpus de pré-treinamento, utilizar backbones mais fortes, incorporar mais especialistas e avaliar cenários com modalidades ausentes.
PALAVRAS-CHAVE: Fusão de representações; Aprendizado autossupervisionado; Mecanismo de atenção.
Votação encerrada.