Logo PUCPR

ESTRATÉGIAS DE ENSEMBLE PARA A DETECÇÃO DE ATAQUES DE REPRODUÇÃO DE ÁUDIO EM SISTEMAS DE AUTENTICAÇÃO POR VOZ

POLEDNA, Henrique¹; HOCHULI, Andre Gustavo³
Curso do(a) Estudante: Bacharelado em Cibersegurança – Escola Politécnica – Câmpus Curitiba
Curso do(a) Orientador(a): Ciência da Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: A autenticação biométrica por voz é amplamente utilizada em sistemas de segurança devido à sua praticidade e facilidade de integração. Entretanto, esses sistemas permanecem vulneráveis a ataques de spoofing, especialmente aos ataques de replay, nos quais gravações de fala são reproduzidas para simular um usuário legítimo. No cenário Physical Access (PA), a presença de efeitos acústicos, dispositivos de reprodução e captura e distorções do canal torna a distinção entre amostras genuínas e fraudulentas ainda mais desafiadora, motivando o desenvolvimento de contramedidas baseadas em aprendizado profundo. OBJETIVOS: Desenvolver e avaliar contramedidas para detecção de ataques de replay, analisando o impacto de diferentes representações espectrais, arquiteturas convolucionais e estratégias de ensemble, com o objetivo de aumentar a robustez e a capacidade de generalização dos sistemas de autenticação biométrica por voz. MATERIAIS E MÉTODO: Os experimentos foram conduzidos utilizando a base ASVspoof 2019 no cenário Physical Access (PA). Foram extraídas cinco representações espectrais (STFT, Log-Mel, CQT, LFCC e CQCC), utilizadas como entrada para as arquiteturas EfficientNet-B0 e ResNet-18v2. Inicialmente, realizou-se um estudo exploratório utilizando apenas as regiões extremas dos espectrogramas. Em seguida, os modelos foram treinados utilizando as representações completas e avaliados segundo o protocolo oficial da ASVspoof por meio das métricas Equal Error Rate (EER) e minimum Tandem Detection Cost Function (min-tDCF). Por fim, foi proposta uma estratégia de ensemble para combinar os modelos com melhor desempenho. RESULTADOS: A utilização apenas das regiões extremas do espectrograma não produziu ganhos de desempenho, indicando que as informações discriminativas estão distribuídas ao longo de todo o espectro de frequências. Entre os modelos individuais, as representações STFT, Log-Mel e CQT apresentaram os melhores resultados, destacando-se a combinação ResNet-18v2 com STFT, que atingiu EER de 1,45% e min-tDCF de 0,039776. A estratégia de ensemble apresentou desempenho superior aos modelos individuais, alcançando EER de 0,9122% e min-tDCF de 0,024222, correspondendo a reduções aproximadas de 37% e 39%, respectivamente. Esses resultados evidenciam que a combinação de diferentes arquiteturas e representações espectrais permite explorar características complementares do sinal de fala, tornando a classificação mais robusta. CONSIDERAÇÕES FINAIS: Os resultados demonstram que a estratégia proposta constitui uma abordagem eficaz para aumentar a robustez de contramedidas contra ataques de replay. Além de atender aos objetivos da pesquisa, o trabalho resultou na implementação de um pipeline completo para extração de características, treinamento e avaliação segundo o protocolo oficial da ASVspoof 2019, contribuindo para a reprodutibilidade dos experimentos. Como perspectivas futuras, pretende-se investigar arquiteturas mais recentes, técnicas auto-supervisionadas e estratégias mais avançadas de fusão de modelos, visando ampliar a capacidade de generalização das contramedidas em diferentes cenários de spoofing.

PALAVRAS-CHAVE: Biometria por voz; Replay Attack Detection; Deep Learning; Ensemble Learning; ASVspoof 2019.

APRESENTAÇÃO EM VÍDEO

Legendas:
  1. Estudante
  2. Colaborador
  3. Orientador
Esta pesquisa foi desenvolvida com bolsa Fundação Araucária no programa PIBIC.

QUERO VOTAR NESTE TRABALHO

Votação encerrada.