Logo PUCPR

GERAÇÃO DE POLÍTICAS DE SEGURANÇA EM IAC USANDO LLM

RODRIGUES, Eduardo¹; VEIGA, Fellipe Medeiros²; SANTIN, Altair Olivo³
Curso do(a) Estudante: Engenharia de Computação – Escola Politécnica – Câmpus Curitiba
Curso do(a) Orientador(a): Ciência da Computação – Escola Politécnica – Câmpus Curitiba

INTRODUÇÃO: Definir topologias de nuvem por Infraestrutura como Código (IaC) é hoje prática corrente na indústria, e ferramentas de policy-as-code, como o Open Policy Agent (OPA) e a linguagem Rego, passaram a ser usadas para automatizar a governança. Escrever essas políticas à mão exige domínio de segurança e de linguagem declarativa ao mesmo tempo, o que motiva o uso de Large Language Models (LLMs) na tarefa. A literatura existente, porém, mede sobretudo a capacidade de detectar artefatos vulneráveis e não avalia com o mesmo cuidado a especificidade, isto é, a capacidade de não bloquear configurações legítimas. OBJETIVOS: Desenvolver e avaliar prompts de LLM para gerar políticas OPA/Rego que validem código de IaC, considerando detecção e especificidade, e confrontar as políticas geradas com infraestrutura efetivamente provisionada em nuvem. MATERIAIS E MÉTODO: Construiu-se um benchmark controlado com 30 cenários Terraform vulneráveis, organizados em três níveis de complexidade. Cada cenário recebeu dois planos seguros espelhados, um minimal pair e um Checkov-clean. As estratégias Zero-shot (ZS) e Recursive Criticism and Improvement (RCI) com Compiler-in-the-Loop foram comparadas sobre cinco LLMs, com K = 3 amostras independentes por célula, em um total de 900 execuções. A condição RCI-dual foi proposta em seguida: nela, o laço de reparo só aceita a política quando ela compila, detecta a vulnerabilidade e não bloqueia o plano seguro. Essa condição foi avaliada em 360 execuções adicionais. Um pipeline de validação dinâmica provisiona os cenários na Amazon Web Services, verifica o recurso por varredura ativa (nmap e nikto) ou por consulta à API e destrói a infraestrutura. RESULTADOS: O RCI eleva a taxa de compilação nos cinco modelos e melhora a detecção, mas degrada a métrica strict_pass@1 em quatro deles. No gpt-4o, essa métrica cai de 28,9% para 0,0%, com bloqueio de 100% dos planos minimal pair. A condição RCI-dual supera o RCI nos quatro modelos analisados: a especificidade sobe de 11,1% para 54,4% no deepseek-reasoner e de 0,0% para 18,9% no gpt-4o. A validação dinâmica provisionou 24 cenários, com destruição bem-sucedida na totalidade dos 47 pares implantados e correspondência entre política e estado real em 36 das 47 verificações CONSIDERAÇÕES FINAIS: Métricas de detecção isoladas não bastam para caracterizar a utilidade operacional de políticas geradas por LLM. O critério dual, apoiado em pares mínimos seguros, reduz a perda de especificidade induzida pelo RCI e separa de forma consistente a capacidade dos modelos.

PALAVRAS-CHAVE: Infraestrutura como Código; Open Policy Agent; Modelos de Linguagem de Grande Escala; Segurança em Nuvem; Policy-as-Code.

APRESENTAÇÃO EM VÍDEO

Legendas:
  1. Estudante
  2. Colaborador
  3. Orientador
Esta pesquisa foi desenvolvida com bolsa CNPq no programa PIBIC.

QUERO VOTAR NESTE TRABALHO

Votação encerrada.