Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores
Autor(a) principal: | |
---|---|
Data de Publicação: | 2003 |
Tipo de documento: | Dissertação |
Idioma: | por |
Título da fonte: | Repositório Institucional da UFPE |
Texto Completo: | https://repositorio.ufpe.br/handle/123456789/2496 |
Resumo: | Os Sistemas de Recuperação de Informação (SRI) têm por tarefa básica processar uma consulta feita por um usuário, e, a partir dela, recuperar um conjunto de documentos armazenados em uma coleção de dados, que são relevantes às necessidades de informação deste usuário. As bibliotecas estão entre as primeiras instituições a adotarem um SRI para facilitar o acesso às suas informações, através do uso de consultas bibliográficas. Uma das características deste tipo de sistema em bibliotecas é a manipulação controlada dos dados, ou seja, há um controle, por exemplo, de quem são os autores dos documentos existentes, em que momento estes documentos foram inseridos, modificados ou retirados da coleção. Ao contrário dos dados utilizados por um sistema para consultas bibliográficas, a Web é uma coleção não controlada de documentos, ou seja, a todo instante, estão sendo inseridos e modificados documentos por diferentes pessoas, em locais distintos. Além dessa alta dinamicidade, a Web possui um número muito grande de documentos, que vem aumentando exponencialmente. No entanto, para que um SRI possa disponibilizar informações sobre o conteúdo da Web de forma eficiente, é preciso que ele saiba lidar com esses problemas apresentados. Para isso surgiu um novo tipo de SRI, os engenhos de busca. Eles têm como um de seus grandes desafios manter as informações de sua base de dados atualizadas, principalmente, porque eles são executados sobre recursos limitados (banda passante, memória e processamento). Neste sentido, este trabalho propõe uma solução para o problema da atualização da base de dados de um engenho de busca, focando na utilização racional dos recursos utilizados por ele para a realização desta tarefa. Esta solução baseia-se no uso de uma política não-uniforme, na qual elementos mais dinâmicos são atualizados mais freqüentemente do que os menos dinâmicos. Para a utilização desta política, são utilizadas técnicas de Aprendizagem de Máquina e estatística para identificar os grupos de páginas de dinamicidade semelhantes. Um protótipo contendo esta solução é desenvolvido a fim de validar seu desempenho em um ambiente real e um estudo de caso é apresentado visando mostrar a maior eficiência desta solução em relação a uma abordagem tradicional de atualização |
id |
UFPE_ec97477e1fac1e46883726c56658a00a |
---|---|
oai_identifier_str |
oai:repositorio.ufpe.br:123456789/2496 |
network_acronym_str |
UFPE |
network_name_str |
Repositório Institucional da UFPE |
repository_id_str |
2221 |
spelling |
BARBOSA, Luciano de AndradeSALGADO, Ana Carolina Brandão2014-06-12T15:58:49Z2014-06-12T15:58:49Z2003de Andrade Barbosa, Luciano; Carolina Brandão Salgado, Ana. Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores. 2003. Dissertação (Mestrado). Programa de Pós-Graduação em Ciência da Computação, Universidade Federal de Pernambuco, Recife, 2003.https://repositorio.ufpe.br/handle/123456789/2496Os Sistemas de Recuperação de Informação (SRI) têm por tarefa básica processar uma consulta feita por um usuário, e, a partir dela, recuperar um conjunto de documentos armazenados em uma coleção de dados, que são relevantes às necessidades de informação deste usuário. As bibliotecas estão entre as primeiras instituições a adotarem um SRI para facilitar o acesso às suas informações, através do uso de consultas bibliográficas. Uma das características deste tipo de sistema em bibliotecas é a manipulação controlada dos dados, ou seja, há um controle, por exemplo, de quem são os autores dos documentos existentes, em que momento estes documentos foram inseridos, modificados ou retirados da coleção. Ao contrário dos dados utilizados por um sistema para consultas bibliográficas, a Web é uma coleção não controlada de documentos, ou seja, a todo instante, estão sendo inseridos e modificados documentos por diferentes pessoas, em locais distintos. Além dessa alta dinamicidade, a Web possui um número muito grande de documentos, que vem aumentando exponencialmente. No entanto, para que um SRI possa disponibilizar informações sobre o conteúdo da Web de forma eficiente, é preciso que ele saiba lidar com esses problemas apresentados. Para isso surgiu um novo tipo de SRI, os engenhos de busca. Eles têm como um de seus grandes desafios manter as informações de sua base de dados atualizadas, principalmente, porque eles são executados sobre recursos limitados (banda passante, memória e processamento). Neste sentido, este trabalho propõe uma solução para o problema da atualização da base de dados de um engenho de busca, focando na utilização racional dos recursos utilizados por ele para a realização desta tarefa. Esta solução baseia-se no uso de uma política não-uniforme, na qual elementos mais dinâmicos são atualizados mais freqüentemente do que os menos dinâmicos. Para a utilização desta política, são utilizadas técnicas de Aprendizagem de Máquina e estatística para identificar os grupos de páginas de dinamicidade semelhantes. Um protótipo contendo esta solução é desenvolvido a fim de validar seu desempenho em um ambiente real e um estudo de caso é apresentado visando mostrar a maior eficiência desta solução em relação a uma abordagem tradicional de atualizaçãoporUniversidade Federal de PernambucoAttribution-NonCommercial-NoDerivs 3.0 Brazilhttp://creativecommons.org/licenses/by-nc-nd/3.0/br/info:eu-repo/semantics/openAccessDesperdício de recursosClassificadoresEngenho de buscaBase de índicesUma proposta para a atualização da base de dados em engenhos de busca utilizando classificadoresinfo:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/masterThesisreponame:Repositório Institucional da UFPEinstname:Universidade Federal de Pernambuco (UFPE)instacron:UFPETHUMBNAILarquivo4714_1.pdf.jpgarquivo4714_1.pdf.jpgGenerated Thumbnailimage/jpeg1420https://repositorio.ufpe.br/bitstream/123456789/2496/4/arquivo4714_1.pdf.jpgf1732c3d508bc5e961b959f13daffbb1MD54ORIGINALarquivo4714_1.pdfapplication/pdf577288https://repositorio.ufpe.br/bitstream/123456789/2496/1/arquivo4714_1.pdf0df7b311129c3ab32b304b72880b28dbMD51LICENSElicense.txttext/plain1748https://repositorio.ufpe.br/bitstream/123456789/2496/2/license.txt8a4605be74aa9ea9d79846c1fba20a33MD52TEXTarquivo4714_1.pdf.txtarquivo4714_1.pdf.txtExtracted texttext/plain230939https://repositorio.ufpe.br/bitstream/123456789/2496/3/arquivo4714_1.pdf.txt11c9637fc4ff5034d269605ce83939c4MD53123456789/24962019-10-25 20:56:06.828oai:repositorio.ufpe.br:123456789/2496Tk9URTogUExBQ0UgWU9VUiBPV04gTElDRU5TRSBIRVJFClRoaXMgc2FtcGxlIGxpY2Vuc2UgaXMgcHJvdmlkZWQgZm9yIGluZm9ybWF0aW9uYWwgcHVycG9zZXMgb25seS4KCk5PTi1FWENMVVNJVkUgRElTVFJJQlVUSU9OIExJQ0VOU0UKCkJ5IHNpZ25pbmcgYW5kIHN1Ym1pdHRpbmcgdGhpcyBsaWNlbnNlLCB5b3UgKHRoZSBhdXRob3Iocykgb3IgY29weXJpZ2h0Cm93bmVyKSBncmFudHMgdG8gRFNwYWNlIFVuaXZlcnNpdHkgKERTVSkgdGhlIG5vbi1leGNsdXNpdmUgcmlnaHQgdG8gcmVwcm9kdWNlLAp0cmFuc2xhdGUgKGFzIGRlZmluZWQgYmVsb3cpLCBhbmQvb3IgZGlzdHJpYnV0ZSB5b3VyIHN1Ym1pc3Npb24gKGluY2x1ZGluZwp0aGUgYWJzdHJhY3QpIHdvcmxkd2lkZSBpbiBwcmludCBhbmQgZWxlY3Ryb25pYyBmb3JtYXQgYW5kIGluIGFueSBtZWRpdW0sCmluY2x1ZGluZyBidXQgbm90IGxpbWl0ZWQgdG8gYXVkaW8gb3IgdmlkZW8uCgpZb3UgYWdyZWUgdGhhdCBEU1UgbWF5LCB3aXRob3V0IGNoYW5naW5nIHRoZSBjb250ZW50LCB0cmFuc2xhdGUgdGhlCnN1Ym1pc3Npb24gdG8gYW55IG1lZGl1bSBvciBmb3JtYXQgZm9yIHRoZSBwdXJwb3NlIG9mIHByZXNlcnZhdGlvbi4KCllvdSBhbHNvIGFncmVlIHRoYXQgRFNVIG1heSBrZWVwIG1vcmUgdGhhbiBvbmUgY29weSBvZiB0aGlzIHN1Ym1pc3Npb24gZm9yCnB1cnBvc2VzIG9mIHNlY3VyaXR5LCBiYWNrLXVwIGFuZCBwcmVzZXJ2YXRpb24uCgpZb3UgcmVwcmVzZW50IHRoYXQgdGhlIHN1Ym1pc3Npb24gaXMgeW91ciBvcmlnaW5hbCB3b3JrLCBhbmQgdGhhdCB5b3UgaGF2ZQp0aGUgcmlnaHQgdG8gZ3JhbnQgdGhlIHJpZ2h0cyBjb250YWluZWQgaW4gdGhpcyBsaWNlbnNlLiBZb3UgYWxzbyByZXByZXNlbnQKdGhhdCB5b3VyIHN1Ym1pc3Npb24gZG9lcyBub3QsIHRvIHRoZSBiZXN0IG9mIHlvdXIga25vd2xlZGdlLCBpbmZyaW5nZSB1cG9uCmFueW9uZSdzIGNvcHlyaWdodC4KCklmIHRoZSBzdWJtaXNzaW9uIGNvbnRhaW5zIG1hdGVyaWFsIGZvciB3aGljaCB5b3UgZG8gbm90IGhvbGQgY29weXJpZ2h0LAp5b3UgcmVwcmVzZW50IHRoYXQgeW91IGhhdmUgb2J0YWluZWQgdGhlIHVucmVzdHJpY3RlZCBwZXJtaXNzaW9uIG9mIHRoZQpjb3B5cmlnaHQgb3duZXIgdG8gZ3JhbnQgRFNVIHRoZSByaWdodHMgcmVxdWlyZWQgYnkgdGhpcyBsaWNlbnNlLCBhbmQgdGhhdApzdWNoIHRoaXJkLXBhcnR5IG93bmVkIG1hdGVyaWFsIGlzIGNsZWFybHkgaWRlbnRpZmllZCBhbmQgYWNrbm93bGVkZ2VkCndpdGhpbiB0aGUgdGV4dCBvciBjb250ZW50IG9mIHRoZSBzdWJtaXNzaW9uLgoKSUYgVEhFIFNVQk1JU1NJT04gSVMgQkFTRUQgVVBPTiBXT1JLIFRIQVQgSEFTIEJFRU4gU1BPTlNPUkVEIE9SIFNVUFBPUlRFRApCWSBBTiBBR0VOQ1kgT1IgT1JHQU5JWkFUSU9OIE9USEVSIFRIQU4gRFNVLCBZT1UgUkVQUkVTRU5UIFRIQVQgWU9VIEhBVkUKRlVMRklMTEVEIEFOWSBSSUdIVCBPRiBSRVZJRVcgT1IgT1RIRVIgT0JMSUdBVElPTlMgUkVRVUlSRUQgQlkgU1VDSApDT05UUkFDVCBPUiBBR1JFRU1FTlQuCgpEU1Ugd2lsbCBjbGVhcmx5IGlkZW50aWZ5IHlvdXIgbmFtZShzKSBhcyB0aGUgYXV0aG9yKHMpIG9yIG93bmVyKHMpIG9mIHRoZQpzdWJtaXNzaW9uLCBhbmQgd2lsbCBub3QgbWFrZSBhbnkgYWx0ZXJhdGlvbiwgb3RoZXIgdGhhbiBhcyBhbGxvd2VkIGJ5IHRoaXMKbGljZW5zZSwgdG8geW91ciBzdWJtaXNzaW9uLgo=Repositório InstitucionalPUBhttps://repositorio.ufpe.br/oai/requestattena@ufpe.bropendoar:22212019-10-25T23:56:06Repositório Institucional da UFPE - Universidade Federal de Pernambuco (UFPE)false |
dc.title.pt_BR.fl_str_mv |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
title |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
spellingShingle |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores BARBOSA, Luciano de Andrade Desperdício de recursos Classificadores Engenho de busca Base de índices |
title_short |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
title_full |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
title_fullStr |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
title_full_unstemmed |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
title_sort |
Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores |
author |
BARBOSA, Luciano de Andrade |
author_facet |
BARBOSA, Luciano de Andrade |
author_role |
author |
dc.contributor.author.fl_str_mv |
BARBOSA, Luciano de Andrade |
dc.contributor.advisor1.fl_str_mv |
SALGADO, Ana Carolina Brandão |
contributor_str_mv |
SALGADO, Ana Carolina Brandão |
dc.subject.por.fl_str_mv |
Desperdício de recursos Classificadores Engenho de busca Base de índices |
topic |
Desperdício de recursos Classificadores Engenho de busca Base de índices |
description |
Os Sistemas de Recuperação de Informação (SRI) têm por tarefa básica processar uma consulta feita por um usuário, e, a partir dela, recuperar um conjunto de documentos armazenados em uma coleção de dados, que são relevantes às necessidades de informação deste usuário. As bibliotecas estão entre as primeiras instituições a adotarem um SRI para facilitar o acesso às suas informações, através do uso de consultas bibliográficas. Uma das características deste tipo de sistema em bibliotecas é a manipulação controlada dos dados, ou seja, há um controle, por exemplo, de quem são os autores dos documentos existentes, em que momento estes documentos foram inseridos, modificados ou retirados da coleção. Ao contrário dos dados utilizados por um sistema para consultas bibliográficas, a Web é uma coleção não controlada de documentos, ou seja, a todo instante, estão sendo inseridos e modificados documentos por diferentes pessoas, em locais distintos. Além dessa alta dinamicidade, a Web possui um número muito grande de documentos, que vem aumentando exponencialmente. No entanto, para que um SRI possa disponibilizar informações sobre o conteúdo da Web de forma eficiente, é preciso que ele saiba lidar com esses problemas apresentados. Para isso surgiu um novo tipo de SRI, os engenhos de busca. Eles têm como um de seus grandes desafios manter as informações de sua base de dados atualizadas, principalmente, porque eles são executados sobre recursos limitados (banda passante, memória e processamento). Neste sentido, este trabalho propõe uma solução para o problema da atualização da base de dados de um engenho de busca, focando na utilização racional dos recursos utilizados por ele para a realização desta tarefa. Esta solução baseia-se no uso de uma política não-uniforme, na qual elementos mais dinâmicos são atualizados mais freqüentemente do que os menos dinâmicos. Para a utilização desta política, são utilizadas técnicas de Aprendizagem de Máquina e estatística para identificar os grupos de páginas de dinamicidade semelhantes. Um protótipo contendo esta solução é desenvolvido a fim de validar seu desempenho em um ambiente real e um estudo de caso é apresentado visando mostrar a maior eficiência desta solução em relação a uma abordagem tradicional de atualização |
publishDate |
2003 |
dc.date.issued.fl_str_mv |
2003 |
dc.date.accessioned.fl_str_mv |
2014-06-12T15:58:49Z |
dc.date.available.fl_str_mv |
2014-06-12T15:58:49Z |
dc.type.status.fl_str_mv |
info:eu-repo/semantics/publishedVersion |
dc.type.driver.fl_str_mv |
info:eu-repo/semantics/masterThesis |
format |
masterThesis |
status_str |
publishedVersion |
dc.identifier.citation.fl_str_mv |
de Andrade Barbosa, Luciano; Carolina Brandão Salgado, Ana. Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores. 2003. Dissertação (Mestrado). Programa de Pós-Graduação em Ciência da Computação, Universidade Federal de Pernambuco, Recife, 2003. |
dc.identifier.uri.fl_str_mv |
https://repositorio.ufpe.br/handle/123456789/2496 |
identifier_str_mv |
de Andrade Barbosa, Luciano; Carolina Brandão Salgado, Ana. Uma proposta para a atualização da base de dados em engenhos de busca utilizando classificadores. 2003. Dissertação (Mestrado). Programa de Pós-Graduação em Ciência da Computação, Universidade Federal de Pernambuco, Recife, 2003. |
url |
https://repositorio.ufpe.br/handle/123456789/2496 |
dc.language.iso.fl_str_mv |
por |
language |
por |
dc.rights.driver.fl_str_mv |
Attribution-NonCommercial-NoDerivs 3.0 Brazil http://creativecommons.org/licenses/by-nc-nd/3.0/br/ info:eu-repo/semantics/openAccess |
rights_invalid_str_mv |
Attribution-NonCommercial-NoDerivs 3.0 Brazil http://creativecommons.org/licenses/by-nc-nd/3.0/br/ |
eu_rights_str_mv |
openAccess |
dc.publisher.none.fl_str_mv |
Universidade Federal de Pernambuco |
publisher.none.fl_str_mv |
Universidade Federal de Pernambuco |
dc.source.none.fl_str_mv |
reponame:Repositório Institucional da UFPE instname:Universidade Federal de Pernambuco (UFPE) instacron:UFPE |
instname_str |
Universidade Federal de Pernambuco (UFPE) |
instacron_str |
UFPE |
institution |
UFPE |
reponame_str |
Repositório Institucional da UFPE |
collection |
Repositório Institucional da UFPE |
bitstream.url.fl_str_mv |
https://repositorio.ufpe.br/bitstream/123456789/2496/4/arquivo4714_1.pdf.jpg https://repositorio.ufpe.br/bitstream/123456789/2496/1/arquivo4714_1.pdf https://repositorio.ufpe.br/bitstream/123456789/2496/2/license.txt https://repositorio.ufpe.br/bitstream/123456789/2496/3/arquivo4714_1.pdf.txt |
bitstream.checksum.fl_str_mv |
f1732c3d508bc5e961b959f13daffbb1 0df7b311129c3ab32b304b72880b28db 8a4605be74aa9ea9d79846c1fba20a33 11c9637fc4ff5034d269605ce83939c4 |
bitstream.checksumAlgorithm.fl_str_mv |
MD5 MD5 MD5 MD5 |
repository.name.fl_str_mv |
Repositório Institucional da UFPE - Universidade Federal de Pernambuco (UFPE) |
repository.mail.fl_str_mv |
attena@ufpe.br |
_version_ |
1802310849360035840 |