Please use this identifier to cite or link to this item: http://hdl.handle.net/11422/14053
Full metadata record
DC FieldValueLanguage
dc.contributor.advisorXexéo, Geraldo Bonorino-
dc.contributor.authorArruda, Michel Dias de-
dc.date.accessioned2021-04-05T02:24:54Z-
dc.date.available2023-12-21T03:07:33Z-
dc.date.issued2019-09-
dc.identifier.urihttp://hdl.handle.net/11422/14053-
dc.description.abstract[EN] Natural Language Plagiarism Detection (NLPD) aims to seek textual evidence of plagiarism in documents, in order to generate a list of candidate documents of being plagiarized, to further be analysed by humans. External plagiarism detection (EPD) is a NLPD task in which a set of documents is available to be queried, seeking for plagiarism. DPE is comprised of a few steps, one of them being the Heuristic Search (HR), which is the EPD stage that retrieves a set of plagiarism candidate documents from a large corpus, reducing the workload of the later stages of the EPD. The HR stage is an Information Retrieval (IR) task, and comprises two subtasks, namely, Indexing and Source Retrieval. In order to speed up the execution of IR subtasks, two partitioning methods were proposed, the permutations and vocabulary partitioning. Both use Locality-Sensitive Hashing (LSH) and are based on the mathematical concept known as partition of a set. Partitioning any set can generate remainders, and to address this issue, the Remainder at End (RaE), Remainder at Cell (RaC) and Distributed at Cell (DaC) treatment strategies were proposed. Both partitioning methods were approximately 101% faster than the IR state of art. Moreover, RaE, RaC and DaC achieved better results in document indexing, query extraction and retrieval time in comparison to a standard LSH baseline, the Minmax.pt_BR
dc.languageporpt_BR
dc.publisherUniversidade Federal do Rio de Janeiropt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectlshpt_BR
dc.subjectPartitionspt_BR
dc.subjectLocality-sensitive hashingpt_BR
dc.subjectPlagiarism detectionpt_BR
dc.titleAbordagens de particionamento utilizando locality-sensitive hashing aplicada a busca heurística na detecção de plágio externopt_BR
dc.title.alternativePartitioning approaches using locality-sensitive hashing applied to heuristic retrieval in external plagiarism detectionpt_BR
dc.typeDissertaçãopt_BR
dc.contributor.advisorLatteshttp://lattes.cnpq.br/4783565791787812pt_BR
dc.contributor.authorLatteshttp://lattes.cnpq.br/8628672465057972pt_BR
dc.contributor.referee1Silva, Eduardo Bezerra da-
dc.contributor.referee2Duarte, Fellipe Ribeiro-
dc.contributor.referee3Silva, Geraldo Zimbrão da-
dc.description.resumo[PT] A Detecção de Plágio em Linguagem Natural (NLPD) visa identificar a evidência textual que um documento contém plágio, para gerar uma lista de documentos que são plagiados para posterior avaliação humana. A detecção de plagio externo (EPD) é uma tarefa da NLPD, a qual um conjunto de documentos está disponível para consulta por plágio. EPD é formada de algumas etapas, dentre elas a Busca Heurística (HR), que é a etapa de EPD que visa recuperar um conjunto de documentos candidatos a plágio de um grande corpus, reduzindo o carga de trabalho das etapas posteriores do EPD. A etapa de Busca Heurística é uma tarefa de Recuperação de Informação (IR) e contém duas subtarefas: a indexação e a busca. Foram propostos dois métodos de particionamento, das permutações e do vocabulário, com o objetivo de tornar mais rápida a execução das subtarefas de IR. Ambos utilizam Locality-Sensitive Hashing (LSH) e são baseados no conceito matemático conhecido como partição de um conjunto. O particionamento de qualquer conjunto pode gerar resto, e a partir disso foram propostas as estratégias de tratamento Remainder at End (RaE), Remainder at Cell (RaC) e Distributed at Cell (DaC). Nos dois métodos de particionamento, RaE, RaC e DaC foram aproximadamente 101% mais rápidos que o estado da arte da IR na subtarefa de busca. Além disso, ambos alcançaram melhores resultados na indexação de documentos, extração de consultas e tempo de recuperação quando comparados com o baseline padrão do LSH, o MinMax.pt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.departmentInstituto Alberto Luiz Coimbra de Pós-Graduação e Pesquisa de Engenhariapt_BR
dc.publisher.programPrograma de Pós-Graduação em Engenharia de Sistemas e Computaçãopt_BR
dc.publisher.initialsUFRJpt_BR
dc.subject.cnpqCNPQ::ENGENHARIASpt_BR
dc.embargo.termsabertopt_BR
Appears in Collections:Engenharia de Sistemas e Computação

Files in This Item:
File Description SizeFormat 
MichelDiasDeArruda.pdf2.38 MBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.