Construção e classificação de uma base textual em português

Detalhes bibliográficos
Autor(a) principal: Oliveira, Thiago do Nascimento
Data de Publicação: 2023
Tipo de documento: Trabalho de conclusão de curso
Idioma: por
Título da fonte: Repositório Institucional da UFRJ
Texto Completo: http://hdl.handle.net/11422/20474
Resumo: A Web tornou-se um importante meio para disponibilização de informações. Entre as principais dificuldades, nesse contexto dinâmico, estão a busca por informações específicas e a categorização das mesmas. Com a facilidade de acesso à Internet e a possibilidade de qualquer pessoa publicar ou replicar conteúdo online, é preciso ter cuidado ao selecionar as fontes dessas informações. No domínio do setor elétrico não é diferente. Um importante ator, nesse cenário, é o IFE - Informativo Eletrônico do Setor Elétrico - que sintetiza resumos de notícias, obtidas a partir de fontes confiáveis, para profissionais do setor. A aspiração deste trabalho é propor uma metodologia a fim de se criar um modelo de classicação automática de notícias, para oferecer aos seus editores a possibilidade de uma análise rápida, completa e precisa do conteúdo do texto e atribuir de forma mais ágil e eciente as categorias dos resumos de notícias. Uma análise das implementações clássicas de aprendizado supervisionado de máquina empregando os algoritmos k-Vizinhos-Mais Próximos, Regressão Logística, Naïve Bayes, Máquinas de Vetores de Suporte, Floresta Randômica, e um comitê com esses classicadores foi realizada. Alguns valores candidatos para hiperparâmetros foram comparados e a melhor combinação deles para cada uma das implementações foi configurada em seu treinamento. Este trabalho conclui com a avaliação dos desempenhos alcançados por cada algoritmo na tarefa de classificação de texto no contexto de resumos de notícias do IFE.
id UFRJ_9ebc5e3bd9bb4e2549caec36ebeafb95
oai_identifier_str oai:pantheon.ufrj.br:11422/20474
network_acronym_str UFRJ
network_name_str Repositório Institucional da UFRJ
repository_id_str
spelling Oliveira, Thiago do Nascimentohttp://lattes.cnpq.br/9439416101626260Silva, João Carlos P. dahttp://lattes.cnpq.br/9413102524215939Marcelino, Carolina Gilhttp://lattes.cnpq.br/3289676418940953Paixão, João Antonio Recio dahttp://lattes.cnpq.br/5705386762324718Lopes, Giseli Rabello2023-05-16T17:38:39Z2023-11-30T03:00:41Z2023-04-26http://hdl.handle.net/11422/20474Submitted by Elaine Almeida (elaine.almeida@nce.ufrj.br) on 2023-05-16T17:38:39Z No. of bitstreams: 1 TNOliveira.pdf: 2299381 bytes, checksum: 5668757f16a4222ac50e4e1454346274 (MD5)Made available in DSpace on 2023-05-16T17:38:39Z (GMT). No. of bitstreams: 1 TNOliveira.pdf: 2299381 bytes, checksum: 5668757f16a4222ac50e4e1454346274 (MD5) Previous issue date: 2023-04-26A Web tornou-se um importante meio para disponibilização de informações. Entre as principais dificuldades, nesse contexto dinâmico, estão a busca por informações específicas e a categorização das mesmas. Com a facilidade de acesso à Internet e a possibilidade de qualquer pessoa publicar ou replicar conteúdo online, é preciso ter cuidado ao selecionar as fontes dessas informações. No domínio do setor elétrico não é diferente. Um importante ator, nesse cenário, é o IFE - Informativo Eletrônico do Setor Elétrico - que sintetiza resumos de notícias, obtidas a partir de fontes confiáveis, para profissionais do setor. A aspiração deste trabalho é propor uma metodologia a fim de se criar um modelo de classicação automática de notícias, para oferecer aos seus editores a possibilidade de uma análise rápida, completa e precisa do conteúdo do texto e atribuir de forma mais ágil e eciente as categorias dos resumos de notícias. Uma análise das implementações clássicas de aprendizado supervisionado de máquina empregando os algoritmos k-Vizinhos-Mais Próximos, Regressão Logística, Naïve Bayes, Máquinas de Vetores de Suporte, Floresta Randômica, e um comitê com esses classicadores foi realizada. Alguns valores candidatos para hiperparâmetros foram comparados e a melhor combinação deles para cada uma das implementações foi configurada em seu treinamento. Este trabalho conclui com a avaliação dos desempenhos alcançados por cada algoritmo na tarefa de classificação de texto no contexto de resumos de notícias do IFE.porUniversidade Federal do Rio de JaneiroUFRJBrasilInstituto de ComputaçãoCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAOinteligência artificialmineração de dadosmineração de textosweb scrapingConstrução e classificação de uma base textual em portuguêsinfo:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/bachelorThesisabertoinfo:eu-repo/semantics/openAccessreponame:Repositório Institucional da UFRJinstname:Universidade Federal do Rio de Janeiro (UFRJ)instacron:UFRJLICENSElicense.txtlicense.txttext/plain; charset=utf-81853http://pantheon.ufrj.br:80/bitstream/11422/20474/2/license.txtdd32849f2bfb22da963c3aac6e26e255MD52ORIGINALTNOliveira.pdfTNOliveira.pdfapplication/pdf2299381http://pantheon.ufrj.br:80/bitstream/11422/20474/1/TNOliveira.pdf5668757f16a4222ac50e4e1454346274MD5111422/204742023-11-30 00:00:41.479oai:pantheon.ufrj.br:11422/20474TElDRU7Dh0EgTsODTy1FWENMVVNJVkEgREUgRElTVFJJQlVJw4fDg08KCkFvIGFzc2luYXIgZSBlbnRyZWdhciBlc3RhIGxpY2Vuw6dhLCB2b2PDqihzKSBvKHMpIGF1dG9yKGVzKSBvdSBwcm9wcmlldMOhcmlvKHMpIGRvcyBkaXJlaXRvcyBhdXRvcmFpcyBjb25jZWRlKG0pIGFvIFJlcG9zaXTDs3JpbyBQYW50aGVvbiBkYSBVbml2ZXJzaWRhZGUgRmVkZXJhbCBkbyBSaW8gZGUgSmFuZWlybyAoVUZSSikgbyBkaXJlaXRvIG7Do28gLSBleGNsdXNpdm8gZGUgcmVwcm9kdXppciwgY29udmVydGVyIChjb21vIGRlZmluaWRvIGFiYWl4byksIGUvb3UgZGlzdHJpYnVpciBvIGRvY3VtZW50byBlbnRyZWd1ZSAoaW5jbHVpbmRvIG8gcmVzdW1vKSBlbSB0b2RvIG8gbXVuZG8sIGVtIGZvcm1hdG8gZWxldHLDtG5pY28gZSBlbSBxdWFscXVlciBtZWlvLCBpbmNsdWluZG8sIG1hcyBuw6NvIGxpbWl0YWRvIGEgw6F1ZGlvIGUvb3UgdsOtZGVvLgoKVm9jw6ogY29uY29yZGEgcXVlIGEgVUZSSiBwb2RlLCBzZW0gYWx0ZXJhciBvIGNvbnRlw7pkbywgdHJhZHV6aXIgYSBhcHJlc2VudGHDp8OjbyBkZSBxdWFscXVlciBtZWlvIG91IGZvcm1hdG8gY29tIGEgZmluYWxpZGFkZSBkZSBwcmVzZXJ2YcOnw6NvLgoKVm9jw6ogdGFtYsOpbSBjb25jb3JkYSBxdWUgYSBVRlJKIHBvZGUgbWFudGVyIG1haXMgZGUgdW1hIGPDs3BpYSBkZXNzYSBzdWJtaXNzw6NvIHBhcmEgZmlucyBkZSBzZWd1cmFuw6dhLCBiYWNrLXVwIGUgcHJlc2VydmHDp8OjbyBkaWdpdGFsLgoKRGVjbGFyYSBxdWUgbyBkb2N1bWVudG8gZW50cmVndWUgw6kgc2V1IHRyYWJhbGhvIG9yaWdpbmFsLCBlIHF1ZSB2b2PDqiB0ZW0gbyBkaXJlaXRvIGRlIGNvbmNlZGVyIG9zIGRpcmVpdG9zIGNvbnRpZG9zIG5lc3RhIGxpY2Vuw6dhLiBWb2PDqiB0YW1iw6ltIGRlY2xhcmEgcXVlIGEgc3VhIGFwcmVzZW50YcOnw6NvLCBjb20gbyBtZWxob3IgZGUgc2V1cyBjb25oZWNpbWVudG9zLCBuw6NvIGluZnJpbmdpIGRpcmVpdG9zIGF1dG9yYWlzIGRlIHRlcmNlaXJvcy4KClNlIG8gZG9jdW1lbnRvIGVudHJlZ3VlIGNvbnTDqW0gbWF0ZXJpYWwgZG8gcXVhbCB2b2PDqiBuw6NvIHRlbSBkaXJlaXRvcyBkZSBhdXRvciwgZGVjbGFyYSBxdWUgb2J0ZXZlIGEgcGVybWlzc8OjbyBpcnJlc3RyaXRhIGRvIGRldGVudG9yIGRvcyBkaXJlaXRvcyBhdXRvcmFpcyBlIGNvbmNlZGUgYSBVRlJKIG9zIGRpcmVpdG9zIHJlcXVlcmlkb3MgcG9yIGVzdGEgbGljZW7Dp2EsIGUgcXVlIGVzc2UgbWF0ZXJpYWwgZGUgcHJvcHJpZWRhZGUgZGUgdGVyY2Vpcm9zIGVzdMOhIGNsYXJhbWVudGUgaWRlbnRpZmljYWRvIGUgcmVjb25oZWNpZG8gbm8gdGV4dG8gb3UgY29udGXDumRvIGRhIHN1Ym1pc3PDo28uCgpTZSBvIGRvY3VtZW50byBlbnRyZWd1ZSDDqSBiYXNlYWRvIGVtIHRyYWJhbGhvIHF1ZSBmb2ksIG91IHRlbSBzaWRvIHBhdHJvY2luYWRvIG91IGFwb2lhZG8gcG9yIHVtYSBhZ8OqbmNpYSBvdSBvdXRybyhzKSBvcmdhbmlzbW8ocykgcXVlIG7Do28gYSBVRlJKLCB2b2PDqiBkZWNsYXJhIHF1ZSBjdW1wcml1IHF1YWxxdWVyIGRpcmVpdG8gZGUgUkVWSVPDg08gb3UgZGUgb3V0cmFzIG9icmlnYcOnw7VlcyByZXF1ZXJpZGFzIHBvciBjb250cmF0byBvdSBhY29yZG8uCgpBIFVGUkogaXLDoSBpZGVudGlmaWNhciBjbGFyYW1lbnRlIG8ocykgc2V1KHMpIG5vbWUocykgY29tbyBhdXRvcihlcykgb3UgcHJvcHJpZXTDoXJpbyhzKSBkYSBzdWJtaXNzw6NvLCBlIG7Do28gZmFyw6EgcXVhbHF1ZXIgYWx0ZXJhw6fDo28sIHBhcmEgYWzDqW0gZGFzIHBlcm1pdGlkYXMgcG9yIGVzdGEgbGljZW7Dp2EsIG5vIGF0byBkZSBzdWJtaXNzw6NvLgo=Repositório de PublicaçõesPUBhttp://www.pantheon.ufrj.br/oai/requestopendoar:2023-11-30T03:00:41Repositório Institucional da UFRJ - Universidade Federal do Rio de Janeiro (UFRJ)false
dc.title.pt_BR.fl_str_mv Construção e classificação de uma base textual em português
title Construção e classificação de uma base textual em português
spellingShingle Construção e classificação de uma base textual em português
Oliveira, Thiago do Nascimento
CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
inteligência artificial
mineração de dados
mineração de textos
web scraping
title_short Construção e classificação de uma base textual em português
title_full Construção e classificação de uma base textual em português
title_fullStr Construção e classificação de uma base textual em português
title_full_unstemmed Construção e classificação de uma base textual em português
title_sort Construção e classificação de uma base textual em português
author Oliveira, Thiago do Nascimento
author_facet Oliveira, Thiago do Nascimento
author_role author
dc.contributor.advisorLattes.pt_BR.fl_str_mv http://lattes.cnpq.br/9439416101626260
dc.contributor.advisorCo1.none.fl_str_mv Silva, João Carlos P. da
dc.contributor.advisorCo1Lattes.pt_BR.fl_str_mv http://lattes.cnpq.br/9413102524215939
dc.contributor.author.fl_str_mv Oliveira, Thiago do Nascimento
dc.contributor.referee1.fl_str_mv Marcelino, Carolina Gil
dc.contributor.referee1Lattes.fl_str_mv http://lattes.cnpq.br/3289676418940953
dc.contributor.referee2.fl_str_mv Paixão, João Antonio Recio da
dc.contributor.referee2Lattes.fl_str_mv http://lattes.cnpq.br/5705386762324718
dc.contributor.advisor1.fl_str_mv Lopes, Giseli Rabello
contributor_str_mv Marcelino, Carolina Gil
Paixão, João Antonio Recio da
Lopes, Giseli Rabello
dc.subject.cnpq.fl_str_mv CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
topic CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
inteligência artificial
mineração de dados
mineração de textos
web scraping
dc.subject.por.fl_str_mv inteligência artificial
mineração de dados
mineração de textos
web scraping
description A Web tornou-se um importante meio para disponibilização de informações. Entre as principais dificuldades, nesse contexto dinâmico, estão a busca por informações específicas e a categorização das mesmas. Com a facilidade de acesso à Internet e a possibilidade de qualquer pessoa publicar ou replicar conteúdo online, é preciso ter cuidado ao selecionar as fontes dessas informações. No domínio do setor elétrico não é diferente. Um importante ator, nesse cenário, é o IFE - Informativo Eletrônico do Setor Elétrico - que sintetiza resumos de notícias, obtidas a partir de fontes confiáveis, para profissionais do setor. A aspiração deste trabalho é propor uma metodologia a fim de se criar um modelo de classicação automática de notícias, para oferecer aos seus editores a possibilidade de uma análise rápida, completa e precisa do conteúdo do texto e atribuir de forma mais ágil e eciente as categorias dos resumos de notícias. Uma análise das implementações clássicas de aprendizado supervisionado de máquina empregando os algoritmos k-Vizinhos-Mais Próximos, Regressão Logística, Naïve Bayes, Máquinas de Vetores de Suporte, Floresta Randômica, e um comitê com esses classicadores foi realizada. Alguns valores candidatos para hiperparâmetros foram comparados e a melhor combinação deles para cada uma das implementações foi configurada em seu treinamento. Este trabalho conclui com a avaliação dos desempenhos alcançados por cada algoritmo na tarefa de classificação de texto no contexto de resumos de notícias do IFE.
publishDate 2023
dc.date.accessioned.fl_str_mv 2023-05-16T17:38:39Z
dc.date.available.fl_str_mv 2023-11-30T03:00:41Z
dc.date.issued.fl_str_mv 2023-04-26
dc.type.status.fl_str_mv info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv info:eu-repo/semantics/bachelorThesis
format bachelorThesis
status_str publishedVersion
dc.identifier.uri.fl_str_mv http://hdl.handle.net/11422/20474
url http://hdl.handle.net/11422/20474
dc.language.iso.fl_str_mv por
language por
dc.rights.driver.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.publisher.none.fl_str_mv Universidade Federal do Rio de Janeiro
dc.publisher.initials.fl_str_mv UFRJ
dc.publisher.country.fl_str_mv Brasil
dc.publisher.department.fl_str_mv Instituto de Computação
publisher.none.fl_str_mv Universidade Federal do Rio de Janeiro
dc.source.none.fl_str_mv reponame:Repositório Institucional da UFRJ
instname:Universidade Federal do Rio de Janeiro (UFRJ)
instacron:UFRJ
instname_str Universidade Federal do Rio de Janeiro (UFRJ)
instacron_str UFRJ
institution UFRJ
reponame_str Repositório Institucional da UFRJ
collection Repositório Institucional da UFRJ
bitstream.url.fl_str_mv http://pantheon.ufrj.br:80/bitstream/11422/20474/2/license.txt
http://pantheon.ufrj.br:80/bitstream/11422/20474/1/TNOliveira.pdf
bitstream.checksum.fl_str_mv dd32849f2bfb22da963c3aac6e26e255
5668757f16a4222ac50e4e1454346274
bitstream.checksumAlgorithm.fl_str_mv MD5
MD5
repository.name.fl_str_mv Repositório Institucional da UFRJ - Universidade Federal do Rio de Janeiro (UFRJ)
repository.mail.fl_str_mv
_version_ 1784097297538220032