<link rel="stylesheet" href="styles.f3b1fba60ec7970c.css">

Aumento de dados por mascaramento no BERT para detecção de comentários ofensivos

dc.contributor.advisorSilva, João Carlos Pereira da
dc.contributor.referee1Lopes, Giseli Rabello
dc.contributor.referee2Lima Filho, Silas Pereira
dc.creatorLima, Augusto Guimarães Rodrigues de
dc.date.accessioned2026-06-29T12:17:47Z
dc.date.available2026-07-01T03:00:12Z
dc.date.issued2026-04-07
dc.description.resumoA detecção automática de linguagem ofensiva em redes sociais tem se tornado um desafio relevante no contexto do Processamento de Linguagem Natural, especialmente em língua portuguesa, devido à escassez de recursos linguísticos rotulados e à natureza dinâmica da comunicação online. Este trabalho investiga o uso de técnicas de aumento de dados baseadas em mascaramento de palavras no modelo BERT como estratégia para aprimorar a detecção de comentários ofensivos em português brasileiro. O estudo utiliza o corpus HateBR, composto por comentários do Instagram, bem como um conjunto de dados adicional de comentários coletados da plataforma X (antigo Twitter), ampliando a diversidade de contextos discursivos analisados. Emprega-se o modelo BERTimbau como base para a geração de sentenças sintéticas semanticamente coerentes. Foram propostas e avaliadas três abordagens de enriquecimento de dados: o mascaramento tradicional de múltiplos tokens, o mascaramento controlado de palavras inteiras e uma estratégia conservadora baseada na substituição de um único token por iteração. Para garantir a preservação do significado original e dos rótulos de classe, as sentenças geradas foram filtradas por meio da similaridade do cosseno calculada com embeddings do Sentence-BERT, considerando diferentes faixas de similaridade semântica. Os experimentos demonstraram que, embora o BERTimbau apresente desempenho robusto mesmo sem aumento de dados, a estratégia de substituição de um único token aliada a uma faixa ampla de similaridade semântica produziu melhorias consistentes nas métricas de acurácia, precisão, recall e F1-score. Além disso, observou-se que os ganhos decorrentes do aumento de dados foram mais visíveis em modelos clássicos de aprendizado de máquina, como SVM, Regressão Logística e MLP, evidenciando que o enriquecimento semântico contribui de forma significativa para classificadores que não possuem mecanismos avançados de contextualização. Conclui-se que o mascaramento controlado de palavras, aliado à filtragem semântica, constitui uma estratégia eficaz para ampliar a variabilidade dos dados de treinamento, preservar a coerência linguística e melhorar o desempenho de modelos de detecção de linguagem ofensiva em português.pt_BR
dc.embargo.termsabertopt_BR
dc.identifier.urihttp://hdl.handle.net/11422/29490
dc.languageporpt_BR
dc.publisherUniversidade Federal do Rio de Janeiropt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.departmentInstituto de Computaçãopt_BR
dc.publisher.initialsUFRJpt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectProcessamento de linguagem naturalpt_BR
dc.subjectLinguagem ofensivapt_BR
dc.subjectAumento de dadospt_BR
dc.subjectAprendizado de máquinapt_BR
dc.subjectNatural language processingpt_BR
dc.subjectOffensive languagept_BR
dc.subjectData augmentationpt_BR
dc.subjectMachine learningpt_BR
dc.subjectBERTimbaupt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOpt_BR
dc.titleAumento de dados por mascaramento no BERT para detecção de comentários ofensivospt_BR
dc.typeTrabalho de conclusão de graduaçãopt_BR

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
AGRLima.pdf
Tamanho:
1,24 MB
Formato:
Adobe Portable Document Format

Pacote de licença

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
1,81 KB
Formato:
Item-specific license agreed upon to submission
Descrição: