Automated detection of vulnerability exploitation in underground hacking forums
| dc.contributor.advisor | Menasché, Daniel Sadoc | |
| dc.contributor.advisorID | https://orcid.org/0000-0002-8953-4003 | pt_BR |
| dc.contributor.advisorLattes | http://lattes.cnpq.br/9931198850020140 | pt_BR |
| dc.contributor.referee1 | Lima, Josefino Cabral Melo | |
| dc.contributor.referee1Lattes | http://lattes.cnpq.br/5775431994199579 | pt_BR |
| dc.contributor.referee2 | Farias, Claudio Miceli de | |
| dc.contributor.referee2ID | https://orcid.org/0000-0002-1927-7398 | pt_BR |
| dc.contributor.referee2Lattes | http://lattes.cnpq.br/6243465206463403 | pt_BR |
| dc.contributor.referee3 | Couto, Rodrigo de Souza | |
| dc.contributor.referee3ID | https://orcid.org/0000-0002-6921-7756 | pt_BR |
| dc.contributor.referee3Lattes | http://lattes.cnpq.br/2902496394823593 | pt_BR |
| dc.creator | Moreno Vera, Felipe Adrian | |
| dc.creator.ID | https://orcid.org/0000-0002-2477-9624 | pt_BR |
| dc.creator.Lattes | http://lattes.cnpq.br/8338395536497223 | pt_BR |
| dc.date.accessioned | 2026-05-06T18:26:14Z | |
| dc.date.available | 2026-05-16T03:09:01Z | |
| dc.date.issued | 2024-12-02 | |
| dc.description.abstract | This work proposes a machine learning-based approach to identify and classify vulnerability exploitation, the scope, and the impact of malicious software through the monitoring of underground hacker forums. The growing volume of posts discussing vulnerability exploitation demands an automated approach to process topics and posts that may trigger alarms based on their content. To illustrate the proposed system, we used the CrimeBB dataset, which contains data extracted from various underground forums, and developed a supervised machine learning model capable of filtering topics that cite CVEs and labelingthem as proof of concept (PoC), weaponization, exploitation, among others. We applied machine learning and natural language processing techniques to preprocess the texts and then trained several linear and non-linear models. To evaluate the models’ effectiveness and accuracy and compare results, we used metrics such as accuracy, precision, and recall. Additionally, to gain a better understanding and explanation of why the model can differentiate between classes, we employed model explanation methods to determine the relevance of words in predictions. Overall, this work highlights the differences in the nature of the labeled posts and their importance in vulnerability analysis. | pt_BR |
| dc.description.resumo | Este trabalho propõe uma abordagem baseada em aprendizado de máquina para identificar e classificar a exploração de vulnerabilidades, o escopo e o impacto de softwares maliciosos por meio do monitoramento de fóruns de hackers clandestinos. O volume crescente de postagens discutindo a exploração de vulnerabilidades exige uma abordagem automatizada para processar tópicos e postagens que possam acionar alarmes com base em seu conteúdo. Para ilustrar o sistema proposto, utilizamos o conjunto de dados CrimeBB, composto por dados extraídos de vários fóruns clandestinos, e desenvolvemos um modelo de aprendizado de máquina supervisionado capaz de filtrar tópicos que citam CVEs e rotulá-los como prova de conceito (PoC), armamento (Weaponization), exploração (Exploitation), entre outros. Aplicamos técnicas de aprendizado de máquina e processamento de linguagem natural para pré-processar os textos e, em seguida, treinamos diversos modelos lineares e não lineares. Para avaliar a eficácia e a precisão dos modelos e comparar os resultados, utilizamos as métricas de exatidão (accuracy), precisão (precision) e recuperação (recall). Além disso, para maior compreensão e explicação sobre o motivo de o modelo diferenciar entre as classes, utilizamos métodos de explicação de modelos para determinar a relevância das palavras nas predições. No geral, este trabalho destaca as diferenças entre as naturezas das postagens rotuladas e sua importância na análise de vulnerabilidades. | pt_BR |
| dc.embargo.terms | aberto | pt_BR |
| dc.identifier.uri | http://hdl.handle.net/11422/29139 | |
| dc.language | eng | pt_BR |
| dc.publisher | Universidade Federal do Rio de Janeiro | pt_BR |
| dc.publisher.country | Brasil | pt_BR |
| dc.publisher.department | Instituto de Computação | pt_BR |
| dc.publisher.initials | UFRJ | pt_BR |
| dc.publisher.program | Programa de Pós-Graduação em Informática | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.subject | Cibersegurança | pt_BR |
| dc.subject | Fóruns online | pt_BR |
| dc.subject | Mineração de dados | pt_BR |
| dc.subject | Processamento de linguagem natural | pt_BR |
| dc.subject | Segurança da informação | pt_BR |
| dc.subject | Modelos de linguagem | pt_BR |
| dc.subject | Interpretabilidade | pt_BR |
| dc.subject | Cybersecurity | pt_BR |
| dc.subject | Online forums | pt_BR |
| dc.subject | Data mining | pt_BR |
| dc.subject | Natural language processing | pt_BR |
| dc.subject | Information security | pt_BR |
| dc.subject | Language model | pt_BR |
| dc.subject | Interpretability | pt_BR |
| dc.subject.cnpq | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO | pt_BR |
| dc.title | Automated detection of vulnerability exploitation in underground hacking forums | pt_BR |
| dc.type | Dissertação | pt_BR |