Logo PUCPR

SOLUÇÕES PARA CLASSIFICAÇÃO EM FLUXOS DE DADOS COM DESBALANCEAMENTO EXTREMO

BATISTA, Mateus Henrique Marcimiano¹; ENEMBRECK, Fabricio³
Curso do(a) Estudante: Ciência da Computação – Escola Politécnica – Câmpus Curitiba
Curso do(a) Orientador(a): Ciência da Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: Fluxos de dados (data streams) estão presentes em diversas aplicações modernas, como monitoramento de redes, sistemas financeiros, dispositivos IoT e plataformas digitais. Nesses cenários, os dados chegam continuamente e precisam ser processados em tempo real, tornando inviável o armazenamento completo das informações para treinamento posterior. Além disso, muitos desses problemas apresentam desbalanceamento de classes, situação em que exemplos de uma ou mais classes são significativamente menos frequentes que os demais, dificultando a construção de modelos de classificação capazes de identificar adequadamente eventos raros. OBJETIVOS: Nesse contexto, o presente trabalho investigou estratégias de seleção e reforço de instâncias inspiradas no conceito de Hill Climbing (HC) aplicadas à classificação de fluxos de dados desbalanceados. MATERIAIS E MÉTODO: Foram propostas e implementadas três estratégias denominadas HC-Plain, HC-ClassAware e HC-Threshold, integradas ao framework MOA (Massive Online Analysis) por meio de um classificador encapsulador capaz de operar com diferentes algoritmos de aprendizado incremental. Os experimentos foram conduzidos utilizando classificadores amplamente empregados em mineração de fluxos de dados, incluindo Adaptive Random Forest (ARF), ARTE, Naive Bayes e Hoeffding Tree. A avaliação considerou tanto conjuntos de dados sintéticos quanto conjuntos de dados reais, empregando métricas como acurácia, F1-Score e tempo de processamento. RESULTADOS: Os resultados obtidos indicaram que as estratégias propostas não produziram ganhos consistentes em todos os cenários avaliados, especialmente nos conjuntos sintéticos, nos quais os classificadores de referência frequentemente apresentaram desempenho superior. Entretanto, nos conjuntos de dados reais foram observadas melhorias relevantes em determinadas configurações, particularmente quando as estratégias de HC foram combinadas ao algoritmo Naive Bayes, resultando em aumentos de desempenho medidos pelo F1-Score. CONSIDERAÇÕES FINAIS: Esses resultados sugerem que a efetividade das estratégias de reforço de instâncias pode estar relacionada às características dos dados analisados, sendo potencialmente mais útil em cenários reais que apresentam maior complexidade, ruído e sobreposição entre classes. Como contribuição, este trabalho disponibiliza uma implementação experimental das estratégias propostas e uma análise de seu comportamento em diferentes contextos de fluxos de dados desbalanceados.

PALAVRAS-CHAVE: Fluxos de Dados; Desbalanceamento de Classes; Classificação Incremental; Hill Climbing; Data Stream Mining.

APRESENTAÇÃO EM VÍDEO

Legendas:
  1. Estudante
  2. Colaborador
  3. Orientador
Esta pesquisa foi desenvolvida com bolsa Fundação Araucária no programa PIBIC.

QUERO VOTAR NESTE TRABALHO

Votação encerrada.