GUARDRAIL: uma abordagem modular para sistemas de segurança em inteligência artificial generativa
| dc.contributor.advisor | Menasché, Daniel Sadoc | |
| dc.contributor.referee1 | Rossetto, Silvana | |
| dc.contributor.referee2 | Aquino, Gabriel Rodrigues Caldas de | |
| dc.creator | Bocampagni, Fábio Alves | |
| dc.date.accessioned | 2025-07-11T15:33:52Z | |
| dc.date.available | 2026-05-16T03:00:18Z | |
| dc.date.issued | 2025-06-17 | |
| dc.description.resumo | Guardrail é um framework de código aberto desenvolvido para proteger Modelos de Linguagem de Grande Escala (LLMs) contra ataques maliciosos como prompt injection e jailbreaks. Seu objetivo é fornecer uma solução de segurança baseada em IA para filtragem evalidação de consultas em tempo real. O framework adota uma arquitetura modular inovadora, inspirada no paradigma de mixture of experts, que combina eficientemente filtros leves e semânticos. Para identificar e bloquear entradas prejudiciais antes que sejam processadas pelos modelos generativos, o Guardrail utiliza uma combinação de análise de entropia, análise de similaridade com embeddings de ataques conhecidos e detecção de anomalias por meio de um modelo SVM. Avaliado em 1000 prompts, obteve um F1-score de 0,9844 no modo paralelo e 0,9711 no modo sequencial, demonstrando um desempenho superior em relação a frameworks como PromptGuard e LLM-Guard. Os resultados empíricos validam a eficácia da combinação de módulos especializados na segurança de LLMs. As principais contribuições deste trabalho incluem o desenvolvimento do Guardrail como um framework modular e de código aberto, a proposição de sua arquitetura de mixture of experts, a demonstração empírica de sua superioridade e a validação da contribuição individual de cada módulo. | pt_BR |
| dc.embargo.terms | aberto | pt_BR |
| dc.identifier.uri | http://hdl.handle.net/11422/26320 | |
| dc.language | por | pt_BR |
| dc.publisher | Universidade Federal do Rio de Janeiro | pt_BR |
| dc.publisher.country | Brasil | pt_BR |
| dc.publisher.department | Instituto de Computação | pt_BR |
| dc.publisher.initials | UFRJ | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.subject | Segurança | pt_BR |
| dc.subject | Aprendizado de máquina | pt_BR |
| dc.subject | Inteligência artificial generativa | pt_BR |
| dc.subject | Security | pt_BR |
| dc.subject | Machine learning | pt_BR |
| dc.subject | Prompt injection | pt_BR |
| dc.subject.cnpq | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO | pt_BR |
| dc.title | GUARDRAIL: uma abordagem modular para sistemas de segurança em inteligência artificial generativa | pt_BR |
| dc.type | Trabalho de conclusão de graduação | pt_BR |