Logo PUCPR

AVALIAÇÃO DE DESEMPENHO DE INTELIGÊNCIAS ARTIFICIAIS NA PROVA DE TÍTULO DE HEPATOLOGIA DA SOCIEDADE BRASILEIRA DE HEPATOLOGIA

MARGRAF, Giovanna Zaniolo¹; TAFAREL, Jean Rodrigo³
Curso do(a) Estudante: Medicina – Escola de Medicina e Ciências da Vida – Câmpus Curitiba
Curso do(a) Orientador(a): Medicina – Escola de Medicina e Ciências da Vida – Câmpus Curitiba

INTRODUÇÃO: Os grandes modelos de linguagem (Large Language Models – LLMs) vêm demonstrando desempenho crescente em tarefas relacionadas à medicina, incluindo suporte ao raciocínio clínico e resolução de avaliações médicas. Entretanto, ainda existem poucos estudos que avaliem seu desempenho em provas de especialidade brasileiras, particularmente na área de Hepatologia. OBJETIVOS: Comparar o desempenho de nove LLMs generalistas e um modelo especializado em contexto médico brasileiro (Charcot) na resolução das provas de Título de Especialista em Hepatologia da Sociedade Brasileira de Hepatologia (SBH) dos anos de 2023 e 2025, avaliando acurácia, comportamento temporal, padrões de erro e justificativas produzidas pelo modelo especializado. MATERIAIS E MÉTODO: Estudo observacional, analítico e quantitativo, no qual dez modelos de linguagem foram submetidos às provas oficiais da SBH de 2023 e 2025, compostas originalmente por 50 questões de múltipla escolha. Cada prova foi executada três vezes sob parâmetros determinísticos (temperatura = 0,0 e top-p = 0,95), utilizando prompt padronizado. A questão 14 da prova de 2023, anulada pela banca examinadora, foi excluída das análises de desempenho. Foram avaliadas a acurácia, o Tempo Médio Normalizado de Resposta (TMNR), a ocorrência de Erro Convergente (EC) e realizada análise qualitativa das justificativas produzidas pelo modelo Charcot. RESULTADOS: O GPT-5 apresentou a maior acurácia global (92,9%), seguido pelo GPTo3 e pelo Charcot (90,9%), sem diferença estatisticamente significativa entre esses modelos. Todos os modelos apresentaram melhor desempenho na prova de 2025 em comparação à de 2023. Modelos com maior tempo de resposta apresentaram maior acurácia agrupada, embora a velocidade de processamento, isoladamente, não tenha se mostrado indicador de melhor desempenho. A análise de Erro Convergente identificou quatro questões nas quais diferentes modelos convergiram para a mesma alternativa incorreta, sugerindo vulnerabilidades compartilhadas entre arquiteturas distintas. A análise qualitativa evidenciou que parte das divergências esteve relacionada à interpretação de diretrizes clínicas e conceitos específicos, sendo observadas justificativas clinicamente coerentes mesmo quando divergentes do gabarito oficial. CONSIDERAÇÕES FINAIS: Os LLMs apresentaram elevado desempenho na resolução das provas de Hepatologia, com desempenho semelhante entre os modelos mais bem classificados. A incorporação de métricas complementares, como Erro Convergente, comportamento temporal e análise qualitativa das justificativas, permite avaliação mais abrangente das potencialidades e limitações desses sistemas, reforçando a necessidade de análises multidimensionais antes de sua aplicação em educação médica.

PALAVRAS-CHAVE: Inteligência artificial; Grandes modelos de linguagem; Hepatologia; Educação Médica; Avaliação de desempenho.

APRESENTAÇÃO EM VÍDEO

Legendas:
  1. Estudante
  2. Colaborador
  3. Orientador
Esta pesquisa foi desenvolvida na modalidade voluntária no programa PIBIC.

QUERO VOTAR NESTE TRABALHO

Votação encerrada.