<link rel="stylesheet" href="styles.f3b1fba60ec7970c.css">

GUARDRAIL: uma abordagem modular para sistemas de segurança em inteligência artificial generativa

dc.contributor.advisorMenasché, Daniel Sadoc
dc.contributor.referee1Rossetto, Silvana
dc.contributor.referee2Aquino, Gabriel Rodrigues Caldas de
dc.creatorBocampagni, Fábio Alves
dc.date.accessioned2025-07-11T15:33:52Z
dc.date.available2026-05-16T03:00:18Z
dc.date.issued2025-06-17
dc.description.resumoGuardrail é um framework de código aberto desenvolvido para proteger Modelos de Linguagem de Grande Escala (LLMs) contra ataques maliciosos como prompt injection e jailbreaks. Seu objetivo é fornecer uma solução de segurança baseada em IA para filtragem evalidação de consultas em tempo real. O framework adota uma arquitetura modular inovadora, inspirada no paradigma de mixture of experts, que combina eficientemente filtros leves e semânticos. Para identificar e bloquear entradas prejudiciais antes que sejam processadas pelos modelos generativos, o Guardrail utiliza uma combinação de análise de entropia, análise de similaridade com embeddings de ataques conhecidos e detecção de anomalias por meio de um modelo SVM. Avaliado em 1000 prompts, obteve um F1-score de 0,9844 no modo paralelo e 0,9711 no modo sequencial, demonstrando um desempenho superior em relação a frameworks como PromptGuard e LLM-Guard. Os resultados empíricos validam a eficácia da combinação de módulos especializados na segurança de LLMs. As principais contribuições deste trabalho incluem o desenvolvimento do Guardrail como um framework modular e de código aberto, a proposição de sua arquitetura de mixture of experts, a demonstração empírica de sua superioridade e a validação da contribuição individual de cada módulo.pt_BR
dc.embargo.termsabertopt_BR
dc.identifier.urihttp://hdl.handle.net/11422/26320
dc.languageporpt_BR
dc.publisherUniversidade Federal do Rio de Janeiropt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.departmentInstituto de Computaçãopt_BR
dc.publisher.initialsUFRJpt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectSegurançapt_BR
dc.subjectAprendizado de máquinapt_BR
dc.subjectInteligência artificial generativapt_BR
dc.subjectSecuritypt_BR
dc.subjectMachine learningpt_BR
dc.subjectPrompt injectionpt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOpt_BR
dc.titleGUARDRAIL: uma abordagem modular para sistemas de segurança em inteligência artificial generativapt_BR
dc.typeTrabalho de conclusão de graduaçãopt_BR

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
FABocampagni.pdf
Tamanho:
559,06 KB
Formato:
Adobe Portable Document Format

Pacote de licença

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
1,81 KB
Formato:
Item-specific license agreed upon to submission
Descrição: