<link rel="stylesheet" href="styles.f3b1fba60ec7970c.css">

Automated detection of vulnerability exploitation in underground hacking forums

dc.contributor.advisorMenasché, Daniel Sadoc
dc.contributor.advisorIDhttps://orcid.org/0000-0002-8953-4003pt_BR
dc.contributor.advisorLatteshttp://lattes.cnpq.br/9931198850020140pt_BR
dc.contributor.referee1Lima, Josefino Cabral Melo
dc.contributor.referee1Latteshttp://lattes.cnpq.br/5775431994199579pt_BR
dc.contributor.referee2Farias, Claudio Miceli de
dc.contributor.referee2IDhttps://orcid.org/0000-0002-1927-7398pt_BR
dc.contributor.referee2Latteshttp://lattes.cnpq.br/6243465206463403pt_BR
dc.contributor.referee3Couto, Rodrigo de Souza
dc.contributor.referee3IDhttps://orcid.org/0000-0002-6921-7756pt_BR
dc.contributor.referee3Latteshttp://lattes.cnpq.br/2902496394823593pt_BR
dc.creatorMoreno Vera, Felipe Adrian
dc.creator.IDhttps://orcid.org/0000-0002-2477-9624pt_BR
dc.creator.Latteshttp://lattes.cnpq.br/8338395536497223pt_BR
dc.date.accessioned2026-05-06T18:26:14Z
dc.date.available2026-05-16T03:09:01Z
dc.date.issued2024-12-02
dc.description.abstractThis work proposes a machine learning-based approach to identify and classify vulnerability exploitation, the scope, and the impact of malicious software through the monitoring of underground hacker forums. The growing volume of posts discussing vulnerability exploitation demands an automated approach to process topics and posts that may trigger alarms based on their content. To illustrate the proposed system, we used the CrimeBB dataset, which contains data extracted from various underground forums, and developed a supervised machine learning model capable of filtering topics that cite CVEs and labelingthem as proof of concept (PoC), weaponization, exploitation, among others. We applied machine learning and natural language processing techniques to preprocess the texts and then trained several linear and non-linear models. To evaluate the models’ effectiveness and accuracy and compare results, we used metrics such as accuracy, precision, and recall. Additionally, to gain a better understanding and explanation of why the model can differentiate between classes, we employed model explanation methods to determine the relevance of words in predictions. Overall, this work highlights the differences in the nature of the labeled posts and their importance in vulnerability analysis.pt_BR
dc.description.resumoEste trabalho propõe uma abordagem baseada em aprendizado de máquina para identificar e classificar a exploração de vulnerabilidades, o escopo e o impacto de softwares maliciosos por meio do monitoramento de fóruns de hackers clandestinos. O volume crescente de postagens discutindo a exploração de vulnerabilidades exige uma abordagem automatizada para processar tópicos e postagens que possam acionar alarmes com base em seu conteúdo. Para ilustrar o sistema proposto, utilizamos o conjunto de dados CrimeBB, composto por dados extraídos de vários fóruns clandestinos, e desenvolvemos um modelo de aprendizado de máquina supervisionado capaz de filtrar tópicos que citam CVEs e rotulá-los como prova de conceito (PoC), armamento (Weaponization), exploração (Exploitation), entre outros. Aplicamos técnicas de aprendizado de máquina e processamento de linguagem natural para pré-processar os textos e, em seguida, treinamos diversos modelos lineares e não lineares. Para avaliar a eficácia e a precisão dos modelos e comparar os resultados, utilizamos as métricas de exatidão (accuracy), precisão (precision) e recuperação (recall). Além disso, para maior compreensão e explicação sobre o motivo de o modelo diferenciar entre as classes, utilizamos métodos de explicação de modelos para determinar a relevância das palavras nas predições. No geral, este trabalho destaca as diferenças entre as naturezas das postagens rotuladas e sua importância na análise de vulnerabilidades.pt_BR
dc.embargo.termsabertopt_BR
dc.identifier.urihttp://hdl.handle.net/11422/29139
dc.languageengpt_BR
dc.publisherUniversidade Federal do Rio de Janeiropt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.departmentInstituto de Computaçãopt_BR
dc.publisher.initialsUFRJpt_BR
dc.publisher.programPrograma de Pós-Graduação em Informáticapt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectCibersegurançapt_BR
dc.subjectFóruns onlinept_BR
dc.subjectMineração de dadospt_BR
dc.subjectProcessamento de linguagem naturalpt_BR
dc.subjectSegurança da informaçãopt_BR
dc.subjectModelos de linguagempt_BR
dc.subjectInterpretabilidadept_BR
dc.subjectCybersecuritypt_BR
dc.subjectOnline forumspt_BR
dc.subjectData miningpt_BR
dc.subjectNatural language processingpt_BR
dc.subjectInformation securitypt_BR
dc.subjectLanguage modelpt_BR
dc.subjectInterpretabilitypt_BR
dc.subject.cnpqCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOpt_BR
dc.titleAutomated detection of vulnerability exploitation in underground hacking forumspt_BR
dc.typeDissertaçãopt_BR

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
FAMorenoVera.pdf
Tamanho:
2,18 MB
Formato:
Adobe Portable Document Format

Pacote de licença

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
1,81 KB
Formato:
Item-specific license agreed upon to submission
Descrição:

Coleções