Logo PUCPR

EXPLORAÇÃO E AVALIAÇÃO DE ESTRATÉGIAS NEURO-SIMBÓLICAS PARA GENERALIZAÇÃO COMPOSICIONAL EM LINGUAGEM NATURAL

SILVA, Felyppe Pardino da¹; FRANCO, Bruno Leite²; SCALABRIN, Edson Emilio³
Curso do(a) Estudante: Ciência da Computação – Escola Politécnica – Câmpus Curitiba
Curso do(a) Orientador(a): Ciência da Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: A generalização composicional — a capacidade de aplicar sistematicamente o conhecimento adquirido a combinações não observadas durante o treinamento — é uma habilidade fundamental para a compreensão da linguagem natural e permanece um desafio para sistemas de processamento de linguagem natural. OBJETIVOS: Avaliar estratégias baseadas em grandes modelos de linguagem (LLMs) e em prompting estruturado para a tarefa de mapeamento de sentenças em inglês para as representações semânticas do benchmark ReCOGS. MATERIAIS E MÉTODO: Como material de avaliação, utilizou-se o benchmark ReCOGS, especificamente seus conjuntos de teste em distribuição (testset) e de generalização fora de distribuição (genset), tendo como métrica o ReCOGS Semantic Exact Match. A implementação foi realizada no framework DSPy, com um LLM de uso geral como modelo base e um módulo de Retrieval-Augmented Generation (RAG) para recuperar exemplos a partir do conjunto de treinamento. Sobre essa infraestrutura, foram implementados um baseline em DSPy e versões inspiradas em Least-to-Most Prompting (LtM), Decompose, Analyze and Rethink (DeAR), Decomposed Prompting, Successive Prompting, Skills-in-Context (SKiC) e Tree-of-Reasoning Question Decomposition (TRQA), cada uma executada em configurações com e sem RAG. Nos experimentos previstos, os prompts são associados ao GEPA como mecanismo de otimização automática. RESULTADOS: O baseline obteve 58% no testset tanto sem quanto com RAG, e passou de 26% para 36% no genset com a recuperação de exemplos. Entre as abordagens de decomposição, DeAR apresentou o melhor desempenho com RAG (45,93% no testset e 34,58% no genset), aproximando-se do baseline na generalização, enquanto LtM atingiu 22% e 16%, respectivamente. Decomposed Prompting também apresentou ganhos com RAG, ao passo que Successive Prompting e TRQA apresentaram desempenho muito baixo nas configurações avaliadas. A recuperação de exemplos mostrou-se útil em diversas abordagens, mas com efeitos variáveis conforme a estratégia. CONSIDERAÇÕES FINAIS: A decomposição explícita do raciocínio não produz, por si só, ganhos na tarefa do ReCOGS, provavelmente devido à incompatibilidade entre a estrutura dessas técnicas — formuladas majoritariamente para problemas expressos como perguntas — e o formato do ReCOGS, cuja entrada é uma sentença declarativa e cuja saída esperada é uma forma lógica exata. Como os resultados dependem fortemente da formulação manual dos prompts, conclui-se que a comparação entre métodos de prompting só se torna objetiva mediante o uso de otimizadores automáticos de prompts (como o GEPA), que reduzem o viés de engenharia manual e permitem atribuir as diferenças de desempenho ao mecanismo de prompting em si.

PALAVRAS-CHAVE: Generalização composicional; ReCOGS; Neuro-simbólico; 4Prompting; Modelos de linguagem.

APRESENTAÇÃO EM VÍDEO

Legendas:
  1. Estudante
  2. Colaborador
  3. Orientador
Esta pesquisa foi desenvolvida na modalidade voluntária no programa PIBIC.

QUERO VOTAR NESTE TRABALHO

Votação encerrada.