Logo PUCPR

DESENVOLVIMENTO DE ENSEMBLES EFICIENTES PARA CLASSIFICAÇÃO EM FLUXOS DE DADOS

IZIDORO, Vitor Rodrigues¹; ENEMBRECK, Fabricio³
Curso do(a) Estudante: Ciência da Computação – Escola Politécnica – Câmpus Curitiba
Curso do(a) Orientador(a): Ciência da Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: A mineração de fluxos contínuos de dados tornou-se uma área de extrema relevância devido ao volume massivo de informações geradas em tempo real por sensores, redes e dispositivos móveis. Apesar de os ensembles baseados em árvores de decisão representarem o estado da arte para a classificação de fluxos de dados, lidando com desafios complexos como mudanças de conceito ao longo do tempo, esses algoritmos demandam elevado poder de processamento e uso intenso de memória. OBJETIVOS: Nesse contexto, o presente trabalho tem como objetivo desenvolver e avaliar estratégias capazes de reduzir o custo computacional em ensembles orientados a fluxos de dados de alta frequência, mantendo níveis competitivos de acurácia preditiva. MATERIAIS E MÉTODO: Para alcançar esse propósito, a pesquisa propõe uma intervenção direta no mecanismo de reamostragem interna (Online Bagging) do algoritmo Adaptive Random Forest. Em vez de utilizar filtros binários externos para aceitar ou descartar exemplos, o estudo adota a métrica de dificuldade da instância, conhecida como Instance Hardness, para calcular, de forma dinâmica e contínua, o peso de treinamento de cada nova informação que chega ao sistema. Foram desenvolvidas, implementadas e avaliadas três abordagens matemáticas distintas para controlar a intensidade do aprendizado: uma função Exponencial, focada na penalização extrema de erros; uma função Sigmoide, caracterizada por transições logísticas suaves; e uma função Linear, com limites proporcionais de corte. Os experimentos foram conduzidos utilizando a plataforma Massive Online Analysis, submetendo os modelos a baterias rigorosas de testes envolvendo bases de dados reais e sintéticas, sendo estas últimas projetadas para simular cenários de mudança abrupta e gradual de conceito. RESULTADOS: Os resultados obtidos demonstraram um claro compromisso entre o tempo de execução e a taxa de acerto. A abordagem baseada na função Exponencial alcançou os maiores picos de acurácia, especialmente em bases complexas, porém exigiu um tempo de processamento significativamente superior, inviabilizando sua aplicação em cenários com restrições severas de hardware. Por outro lado, o método Sigmoide apresentou uma notável eficiência computacional, sendo o mais rápido em diversos contextos, mas sofreu com maior instabilidade preditiva, sacrificando parte da capacidade de generalização do modelo. O grande destaque da pesquisa recaiu sobre a abordagem Linear. As análises empíricas, posteriormente consolidadas pela aplicação do teste estatístico de Nemenyi, comprovaram que a função Linear proporcionou o melhor equilíbrio geral do estudo. Ela foi capaz de manter a resiliência e as taxas de acerto sistematicamente próximas aos melhores valores registrados, apresentando perdas insignificantes de desempenho preditivo, ao mesmo tempo em que garantiu tempos de execução baixos e estatisticamente equivalentes aos dos métodos mais velozes testados. CONSIDERAÇÕES FINAIS: Conclui-se, portanto, que a intervenção arquitetural utilizando a reamostragem baseada na função Linear configura-se como uma solução robusta e altamente eficaz, garantindo a escalabilidade e a precisão necessárias para sistemas de aprendizado de máquina aplicados a fluxos de dados massivos e contínuos.

PALAVRAS-CHAVE: Fluxos de Dados; Ensembles; Reamostragem; Seleção de Instâncias; Adaptive Random Forest.

APRESENTAÇÃO EM VÍDEO

Legendas:
  1. Estudante
  2. Colaborador
  3. Orientador
Esta pesquisa foi desenvolvida com bolsa CNPq no programa PIBIC.

QUERO VOTAR NESTE TRABALHO

Votação encerrada.