Ambiente de Dados do SIHSUS com MongoDB

Detalhes bibliográficos
Autor(a) principal: Sampaio, Rafael S.
Data de Publicação: 2019
Tipo de documento: Trabalho de conclusão de curso
Idioma: por
Título da fonte: Repositório Institucional da UFRJ
Texto Completo: http://hdl.handle.net/11422/11197
Resumo: O sistema de saúde pública do Brasil (SUS) disponibiliza dados de eventos de saúde como internações e nascimentos de forma anonimizada para uso público. Tais dados são oferecidos em padrões e tipos de arquivos oriundos de sistemas legados, e que não são adequados para análise a partir de técnicas e sistemas modernos. O objetivo deste trabalho é realizar uma extração, transformação e carga (ETL) dos dados da base de internações (SIHSUS) para um banco de dados NoSQL, produzindo um ambiente analítico adequado para a aplicação de técnicas de estatística, aprendizado de máquina e mineração de dados a fim de se extrair conhecimentos úteis para o entendimento e melhoramento da saúde pública. Foi escolhido o banco de dados orientado a documento, MongoDB, e o processo envolveu etapas de conversão dos arquivos originais, importação para o banco e agregação dos dados de tabelas auxiliares à tabela principal. Após o processo de ETL, foram obtidas as bases de internações em um ambiente analítico no MongoDB, do estado do Rio de Janeiro, entre os anos de 2010 a 2015. A metodologia pode ser estendida para a obtenção das bases do Brasil inteiro, assim como para a realização do mesmo processo em outras bases, como a de nascimento (SINASC) e mortalidade (SIM).
id UFRJ_27da450401da5e0394677a93a856a60b
oai_identifier_str oai:pantheon.ufrj.br:11422/11197
network_acronym_str UFRJ
network_name_str Repositório Institucional da UFRJ
repository_id_str
spelling Sampaio, Rafael S.http://lattes.cnpq.br/6948667770415330Costa, Myrian Christina de Aragãohttp://lattes.cnpq.br/1439066760889922Vivacqua, Adriana Santarosahttp://lattes.cnpq.br/6494676052801758Pinheiro, Rejane Sobrinohttp://lattes.cnpq.br/5914237903221204Bastos, Valeria Menezes.2020-01-31T14:40:50Z2023-11-30T03:03:48Z2019-08-28http://hdl.handle.net/11422/11197Submitted by Elaine Almeida (elaine.almeida@nce.ufrj.br) on 2020-01-31T14:40:50Z No. of bitstreams: 1 RSSampaio.pdf: 2479064 bytes, checksum: ecac4b14f58fbebe6f093426691fccb0 (MD5)Made available in DSpace on 2020-01-31T14:40:50Z (GMT). No. of bitstreams: 1 RSSampaio.pdf: 2479064 bytes, checksum: ecac4b14f58fbebe6f093426691fccb0 (MD5) Previous issue date: 2019-08-28O sistema de saúde pública do Brasil (SUS) disponibiliza dados de eventos de saúde como internações e nascimentos de forma anonimizada para uso público. Tais dados são oferecidos em padrões e tipos de arquivos oriundos de sistemas legados, e que não são adequados para análise a partir de técnicas e sistemas modernos. O objetivo deste trabalho é realizar uma extração, transformação e carga (ETL) dos dados da base de internações (SIHSUS) para um banco de dados NoSQL, produzindo um ambiente analítico adequado para a aplicação de técnicas de estatística, aprendizado de máquina e mineração de dados a fim de se extrair conhecimentos úteis para o entendimento e melhoramento da saúde pública. Foi escolhido o banco de dados orientado a documento, MongoDB, e o processo envolveu etapas de conversão dos arquivos originais, importação para o banco e agregação dos dados de tabelas auxiliares à tabela principal. Após o processo de ETL, foram obtidas as bases de internações em um ambiente analítico no MongoDB, do estado do Rio de Janeiro, entre os anos de 2010 a 2015. A metodologia pode ser estendida para a obtenção das bases do Brasil inteiro, assim como para a realização do mesmo processo em outras bases, como a de nascimento (SINASC) e mortalidade (SIM).porUniversidade Federal do Rio de JaneiroUFRJBrasilInstituto de ComputaçãoCNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::BANCO DE DADOSSaúde públicaComputação aplicadaBanco de dados não relacionaisMineração de dadosSistemas distribuídosAmbiente de Dados do SIHSUS com MongoDBinfo:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/bachelorThesisabertoinfo:eu-repo/semantics/openAccessreponame:Repositório Institucional da UFRJinstname:Universidade Federal do Rio de Janeiro (UFRJ)instacron:UFRJORIGINALRSSampaio.pdfRSSampaio.pdfapplication/pdf1482054http://pantheon.ufrj.br:80/bitstream/11422/11197/3/RSSampaio.pdf1b7bfe063a8a08f827478c6a720bc503MD53LICENSElicense.txtlicense.txttext/plain; charset=utf-81853http://pantheon.ufrj.br:80/bitstream/11422/11197/2/license.txtdd32849f2bfb22da963c3aac6e26e255MD5211422/111972023-11-30 00:03:48.448oai:pantheon.ufrj.br:11422/11197TElDRU7Dh0EgTsODTy1FWENMVVNJVkEgREUgRElTVFJJQlVJw4fDg08KCkFvIGFzc2luYXIgZSBlbnRyZWdhciBlc3RhIGxpY2Vuw6dhLCB2b2PDqihzKSBvKHMpIGF1dG9yKGVzKSBvdSBwcm9wcmlldMOhcmlvKHMpIGRvcyBkaXJlaXRvcyBhdXRvcmFpcyBjb25jZWRlKG0pIGFvIFJlcG9zaXTDs3JpbyBQYW50aGVvbiBkYSBVbml2ZXJzaWRhZGUgRmVkZXJhbCBkbyBSaW8gZGUgSmFuZWlybyAoVUZSSikgbyBkaXJlaXRvIG7Do28gLSBleGNsdXNpdm8gZGUgcmVwcm9kdXppciwgY29udmVydGVyIChjb21vIGRlZmluaWRvIGFiYWl4byksIGUvb3UgZGlzdHJpYnVpciBvIGRvY3VtZW50byBlbnRyZWd1ZSAoaW5jbHVpbmRvIG8gcmVzdW1vKSBlbSB0b2RvIG8gbXVuZG8sIGVtIGZvcm1hdG8gZWxldHLDtG5pY28gZSBlbSBxdWFscXVlciBtZWlvLCBpbmNsdWluZG8sIG1hcyBuw6NvIGxpbWl0YWRvIGEgw6F1ZGlvIGUvb3UgdsOtZGVvLgoKVm9jw6ogY29uY29yZGEgcXVlIGEgVUZSSiBwb2RlLCBzZW0gYWx0ZXJhciBvIGNvbnRlw7pkbywgdHJhZHV6aXIgYSBhcHJlc2VudGHDp8OjbyBkZSBxdWFscXVlciBtZWlvIG91IGZvcm1hdG8gY29tIGEgZmluYWxpZGFkZSBkZSBwcmVzZXJ2YcOnw6NvLgoKVm9jw6ogdGFtYsOpbSBjb25jb3JkYSBxdWUgYSBVRlJKIHBvZGUgbWFudGVyIG1haXMgZGUgdW1hIGPDs3BpYSBkZXNzYSBzdWJtaXNzw6NvIHBhcmEgZmlucyBkZSBzZWd1cmFuw6dhLCBiYWNrLXVwIGUgcHJlc2VydmHDp8OjbyBkaWdpdGFsLgoKRGVjbGFyYSBxdWUgbyBkb2N1bWVudG8gZW50cmVndWUgw6kgc2V1IHRyYWJhbGhvIG9yaWdpbmFsLCBlIHF1ZSB2b2PDqiB0ZW0gbyBkaXJlaXRvIGRlIGNvbmNlZGVyIG9zIGRpcmVpdG9zIGNvbnRpZG9zIG5lc3RhIGxpY2Vuw6dhLiBWb2PDqiB0YW1iw6ltIGRlY2xhcmEgcXVlIGEgc3VhIGFwcmVzZW50YcOnw6NvLCBjb20gbyBtZWxob3IgZGUgc2V1cyBjb25oZWNpbWVudG9zLCBuw6NvIGluZnJpbmdpIGRpcmVpdG9zIGF1dG9yYWlzIGRlIHRlcmNlaXJvcy4KClNlIG8gZG9jdW1lbnRvIGVudHJlZ3VlIGNvbnTDqW0gbWF0ZXJpYWwgZG8gcXVhbCB2b2PDqiBuw6NvIHRlbSBkaXJlaXRvcyBkZSBhdXRvciwgZGVjbGFyYSBxdWUgb2J0ZXZlIGEgcGVybWlzc8OjbyBpcnJlc3RyaXRhIGRvIGRldGVudG9yIGRvcyBkaXJlaXRvcyBhdXRvcmFpcyBlIGNvbmNlZGUgYSBVRlJKIG9zIGRpcmVpdG9zIHJlcXVlcmlkb3MgcG9yIGVzdGEgbGljZW7Dp2EsIGUgcXVlIGVzc2UgbWF0ZXJpYWwgZGUgcHJvcHJpZWRhZGUgZGUgdGVyY2Vpcm9zIGVzdMOhIGNsYXJhbWVudGUgaWRlbnRpZmljYWRvIGUgcmVjb25oZWNpZG8gbm8gdGV4dG8gb3UgY29udGXDumRvIGRhIHN1Ym1pc3PDo28uCgpTZSBvIGRvY3VtZW50byBlbnRyZWd1ZSDDqSBiYXNlYWRvIGVtIHRyYWJhbGhvIHF1ZSBmb2ksIG91IHRlbSBzaWRvIHBhdHJvY2luYWRvIG91IGFwb2lhZG8gcG9yIHVtYSBhZ8OqbmNpYSBvdSBvdXRybyhzKSBvcmdhbmlzbW8ocykgcXVlIG7Do28gYSBVRlJKLCB2b2PDqiBkZWNsYXJhIHF1ZSBjdW1wcml1IHF1YWxxdWVyIGRpcmVpdG8gZGUgUkVWSVPDg08gb3UgZGUgb3V0cmFzIG9icmlnYcOnw7VlcyByZXF1ZXJpZGFzIHBvciBjb250cmF0byBvdSBhY29yZG8uCgpBIFVGUkogaXLDoSBpZGVudGlmaWNhciBjbGFyYW1lbnRlIG8ocykgc2V1KHMpIG5vbWUocykgY29tbyBhdXRvcihlcykgb3UgcHJvcHJpZXTDoXJpbyhzKSBkYSBzdWJtaXNzw6NvLCBlIG7Do28gZmFyw6EgcXVhbHF1ZXIgYWx0ZXJhw6fDo28sIHBhcmEgYWzDqW0gZGFzIHBlcm1pdGlkYXMgcG9yIGVzdGEgbGljZW7Dp2EsIG5vIGF0byBkZSBzdWJtaXNzw6NvLgo=Repositório de PublicaçõesPUBhttp://www.pantheon.ufrj.br/oai/requestopendoar:2023-11-30T03:03:48Repositório Institucional da UFRJ - Universidade Federal do Rio de Janeiro (UFRJ)false
dc.title.pt_BR.fl_str_mv Ambiente de Dados do SIHSUS com MongoDB
title Ambiente de Dados do SIHSUS com MongoDB
spellingShingle Ambiente de Dados do SIHSUS com MongoDB
Sampaio, Rafael S.
CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::BANCO DE DADOS
Saúde pública
Computação aplicada
Banco de dados não relacionais
Mineração de dados
Sistemas distribuídos
title_short Ambiente de Dados do SIHSUS com MongoDB
title_full Ambiente de Dados do SIHSUS com MongoDB
title_fullStr Ambiente de Dados do SIHSUS com MongoDB
title_full_unstemmed Ambiente de Dados do SIHSUS com MongoDB
title_sort Ambiente de Dados do SIHSUS com MongoDB
author Sampaio, Rafael S.
author_facet Sampaio, Rafael S.
author_role author
dc.contributor.advisorLattes.pt_BR.fl_str_mv http://lattes.cnpq.br/6948667770415330
dc.contributor.advisorCo1.none.fl_str_mv Costa, Myrian Christina de Aragão
dc.contributor.advisorCo1Lattes.pt_BR.fl_str_mv http://lattes.cnpq.br/1439066760889922
dc.contributor.author.fl_str_mv Sampaio, Rafael S.
dc.contributor.referee1.fl_str_mv Vivacqua, Adriana Santarosa
dc.contributor.referee1Lattes.fl_str_mv http://lattes.cnpq.br/6494676052801758
dc.contributor.referee2.fl_str_mv Pinheiro, Rejane Sobrino
dc.contributor.referee2Lattes.fl_str_mv http://lattes.cnpq.br/5914237903221204
dc.contributor.advisor1.fl_str_mv Bastos, Valeria Menezes.
contributor_str_mv Vivacqua, Adriana Santarosa
Pinheiro, Rejane Sobrino
Bastos, Valeria Menezes.
dc.subject.cnpq.fl_str_mv CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::BANCO DE DADOS
topic CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::METODOLOGIA E TECNICAS DA COMPUTACAO::BANCO DE DADOS
Saúde pública
Computação aplicada
Banco de dados não relacionais
Mineração de dados
Sistemas distribuídos
dc.subject.por.fl_str_mv Saúde pública
Computação aplicada
Banco de dados não relacionais
Mineração de dados
Sistemas distribuídos
description O sistema de saúde pública do Brasil (SUS) disponibiliza dados de eventos de saúde como internações e nascimentos de forma anonimizada para uso público. Tais dados são oferecidos em padrões e tipos de arquivos oriundos de sistemas legados, e que não são adequados para análise a partir de técnicas e sistemas modernos. O objetivo deste trabalho é realizar uma extração, transformação e carga (ETL) dos dados da base de internações (SIHSUS) para um banco de dados NoSQL, produzindo um ambiente analítico adequado para a aplicação de técnicas de estatística, aprendizado de máquina e mineração de dados a fim de se extrair conhecimentos úteis para o entendimento e melhoramento da saúde pública. Foi escolhido o banco de dados orientado a documento, MongoDB, e o processo envolveu etapas de conversão dos arquivos originais, importação para o banco e agregação dos dados de tabelas auxiliares à tabela principal. Após o processo de ETL, foram obtidas as bases de internações em um ambiente analítico no MongoDB, do estado do Rio de Janeiro, entre os anos de 2010 a 2015. A metodologia pode ser estendida para a obtenção das bases do Brasil inteiro, assim como para a realização do mesmo processo em outras bases, como a de nascimento (SINASC) e mortalidade (SIM).
publishDate 2019
dc.date.issued.fl_str_mv 2019-08-28
dc.date.accessioned.fl_str_mv 2020-01-31T14:40:50Z
dc.date.available.fl_str_mv 2023-11-30T03:03:48Z
dc.type.status.fl_str_mv info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv info:eu-repo/semantics/bachelorThesis
format bachelorThesis
status_str publishedVersion
dc.identifier.uri.fl_str_mv http://hdl.handle.net/11422/11197
url http://hdl.handle.net/11422/11197
dc.language.iso.fl_str_mv por
language por
dc.rights.driver.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.publisher.none.fl_str_mv Universidade Federal do Rio de Janeiro
dc.publisher.initials.fl_str_mv UFRJ
dc.publisher.country.fl_str_mv Brasil
dc.publisher.department.fl_str_mv Instituto de Computação
publisher.none.fl_str_mv Universidade Federal do Rio de Janeiro
dc.source.none.fl_str_mv reponame:Repositório Institucional da UFRJ
instname:Universidade Federal do Rio de Janeiro (UFRJ)
instacron:UFRJ
instname_str Universidade Federal do Rio de Janeiro (UFRJ)
instacron_str UFRJ
institution UFRJ
reponame_str Repositório Institucional da UFRJ
collection Repositório Institucional da UFRJ
bitstream.url.fl_str_mv http://pantheon.ufrj.br:80/bitstream/11422/11197/3/RSSampaio.pdf
http://pantheon.ufrj.br:80/bitstream/11422/11197/2/license.txt
bitstream.checksum.fl_str_mv 1b7bfe063a8a08f827478c6a720bc503
dd32849f2bfb22da963c3aac6e26e255
bitstream.checksumAlgorithm.fl_str_mv MD5
MD5
repository.name.fl_str_mv Repositório Institucional da UFRJ - Universidade Federal do Rio de Janeiro (UFRJ)
repository.mail.fl_str_mv
_version_ 1784097175486070784