Aumento de dados por mascaramento no BERT para detecção de comentários ofensivos
| dc.contributor.advisor | Silva, João Carlos Pereira da | |
| dc.contributor.referee1 | Lopes, Giseli Rabello | |
| dc.contributor.referee2 | Lima Filho, Silas Pereira | |
| dc.creator | Lima, Augusto Guimarães Rodrigues de | |
| dc.date.accessioned | 2026-06-29T12:17:47Z | |
| dc.date.available | 2026-07-01T03:00:12Z | |
| dc.date.issued | 2026-04-07 | |
| dc.description.resumo | A detecção automática de linguagem ofensiva em redes sociais tem se tornado um desafio relevante no contexto do Processamento de Linguagem Natural, especialmente em língua portuguesa, devido à escassez de recursos linguísticos rotulados e à natureza dinâmica da comunicação online. Este trabalho investiga o uso de técnicas de aumento de dados baseadas em mascaramento de palavras no modelo BERT como estratégia para aprimorar a detecção de comentários ofensivos em português brasileiro. O estudo utiliza o corpus HateBR, composto por comentários do Instagram, bem como um conjunto de dados adicional de comentários coletados da plataforma X (antigo Twitter), ampliando a diversidade de contextos discursivos analisados. Emprega-se o modelo BERTimbau como base para a geração de sentenças sintéticas semanticamente coerentes. Foram propostas e avaliadas três abordagens de enriquecimento de dados: o mascaramento tradicional de múltiplos tokens, o mascaramento controlado de palavras inteiras e uma estratégia conservadora baseada na substituição de um único token por iteração. Para garantir a preservação do significado original e dos rótulos de classe, as sentenças geradas foram filtradas por meio da similaridade do cosseno calculada com embeddings do Sentence-BERT, considerando diferentes faixas de similaridade semântica. Os experimentos demonstraram que, embora o BERTimbau apresente desempenho robusto mesmo sem aumento de dados, a estratégia de substituição de um único token aliada a uma faixa ampla de similaridade semântica produziu melhorias consistentes nas métricas de acurácia, precisão, recall e F1-score. Além disso, observou-se que os ganhos decorrentes do aumento de dados foram mais visíveis em modelos clássicos de aprendizado de máquina, como SVM, Regressão Logística e MLP, evidenciando que o enriquecimento semântico contribui de forma significativa para classificadores que não possuem mecanismos avançados de contextualização. Conclui-se que o mascaramento controlado de palavras, aliado à filtragem semântica, constitui uma estratégia eficaz para ampliar a variabilidade dos dados de treinamento, preservar a coerência linguística e melhorar o desempenho de modelos de detecção de linguagem ofensiva em português. | pt_BR |
| dc.embargo.terms | aberto | pt_BR |
| dc.identifier.uri | http://hdl.handle.net/11422/29490 | |
| dc.language | por | pt_BR |
| dc.publisher | Universidade Federal do Rio de Janeiro | pt_BR |
| dc.publisher.country | Brasil | pt_BR |
| dc.publisher.department | Instituto de Computação | pt_BR |
| dc.publisher.initials | UFRJ | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.subject | Processamento de linguagem natural | pt_BR |
| dc.subject | Linguagem ofensiva | pt_BR |
| dc.subject | Aumento de dados | pt_BR |
| dc.subject | Aprendizado de máquina | pt_BR |
| dc.subject | Natural language processing | pt_BR |
| dc.subject | Offensive language | pt_BR |
| dc.subject | Data augmentation | pt_BR |
| dc.subject | Machine learning | pt_BR |
| dc.subject | BERTimbau | pt_BR |
| dc.subject.cnpq | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO | pt_BR |
| dc.title | Aumento de dados por mascaramento no BERT para detecção de comentários ofensivos | pt_BR |
| dc.type | Trabalho de conclusão de graduação | pt_BR |