Agrupamento de interações não lineares em análise fatorial

Detalhes bibliográficos
Autor(a) principal: Erick da Conceição Amorim
Data de Publicação: 2020
Tipo de documento: Tese
Idioma: por
Título da fonte: Repositório Institucional da UFMG
Texto Completo: http://hdl.handle.net/1843/34608
Resumo: A análise fatorial é uma ferramenta poderosa para a redução da dimensão nos estudos de estatística multivariada. Esta tese é dedicada a estender o modelo fatorial com interações não lineares proposto em 2013. A principal contribuição do trabalho é apresentar duas abordagens para agrupar as interações não lineares, e assim desenvolver novos modelos que não são restritos à cenários extremos onde todas as interações não nulas são diferentes ou todas iguais. A primeira estratégia para lidar com os grupos envolve uma mistura finita de componentes degeneradas. A segunda opção é especificada por um processo Dirichlet. Um estudo simulado abrangente é desenvolvido para explorar as propostas e mostrar seus bons desempenhos. Uma análise de sensibilidade é realizada para avaliar as vantagens de estimar o parâmetro de suavização definido na função de covariância do processo Gaussiano que estabelece a não linearidade das interações. Em termos de aplicação, a metodologia é apresentada em análise de expressão de genes relacionados a quatro conjuntos de dados referente ao câncer de mama. Aqui, os genes pertencentes a regiões disjuntas do genoma, com alteração do número de cópias, estão conectados aos fatores principais e suas interações não lineares são estimadas e agrupadas. A investigação conjunta e a comparação desses quatro conjuntos de dados sobre câncer de mama raramente são encontradas na literatura.
id UFMG_65d86b12a7c19b0d2ed9ccf519903496
oai_identifier_str oai:repositorio.ufmg.br:1843/34608
network_acronym_str UFMG
network_name_str Repositório Institucional da UFMG
repository_id_str
spelling Vinícius Diniz Mayrinkhttp://lattes.cnpq.br/8460573638694827Vinícius Diniz MayrinkRosangela Helena LoschiFlávio Bambirra GonçalvesRafael izbickiFlorencia Graciela Leonardihttp://lattes.cnpq.br/3225417947229827Erick da Conceição Amorim2021-01-04T13:07:07Z2021-01-04T13:07:07Z2020-02-19http://hdl.handle.net/1843/34608A análise fatorial é uma ferramenta poderosa para a redução da dimensão nos estudos de estatística multivariada. Esta tese é dedicada a estender o modelo fatorial com interações não lineares proposto em 2013. A principal contribuição do trabalho é apresentar duas abordagens para agrupar as interações não lineares, e assim desenvolver novos modelos que não são restritos à cenários extremos onde todas as interações não nulas são diferentes ou todas iguais. A primeira estratégia para lidar com os grupos envolve uma mistura finita de componentes degeneradas. A segunda opção é especificada por um processo Dirichlet. Um estudo simulado abrangente é desenvolvido para explorar as propostas e mostrar seus bons desempenhos. Uma análise de sensibilidade é realizada para avaliar as vantagens de estimar o parâmetro de suavização definido na função de covariância do processo Gaussiano que estabelece a não linearidade das interações. Em termos de aplicação, a metodologia é apresentada em análise de expressão de genes relacionados a quatro conjuntos de dados referente ao câncer de mama. Aqui, os genes pertencentes a regiões disjuntas do genoma, com alteração do número de cópias, estão conectados aos fatores principais e suas interações não lineares são estimadas e agrupadas. A investigação conjunta e a comparação desses quatro conjuntos de dados sobre câncer de mama raramente são encontradas na literatura.Factor analysis is a powerful tool for dimension reduction in a multivariate statistical study. This Thesis is dedicated to extend the factor model with non-linear interactions proposed in 2013. The main contribution of our work is to present two approaches to cluster the non-linear interactions and thus develop new models that are not restricted to the extreme scenarios where all non-null interactions are different or all are the same. The first strategy to handle the clusters involves a finite mixture of degenerated components. The second option is especified via the Dirichlet process. A comprehensive simulation study is developed to explore the proposals and it shows their good performances. A sentitivity analysis is carried out to evaluate advantages of estimating a smoothness parameter defined in a covariance function of the Gaussian process establishing the non-linearity of the interactions. In terms of application, the methodology is illustrated with the analysis of gene expression related to four breast cancer data sets. Here, the genes belonging to disjoint genome regions, with copy number alteration, are connected to the main factors and their non-linear interactions are estimated and clustered. The mutual investigation and comparison of these four breast cancer data sets is rarely found in the literature.FAPEMIG - Fundação de Amparo à Pesquisa do Estado de Minas GeraisCAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível SuperiorporUniversidade Federal de Minas GeraisPrograma de Pós-Graduação em EstatísticaUFMGBrasilICX - DEPARTAMENTO DE ESTATÍSTICAEstatística. – Teses.Análise multivariada – Teses.Análise fatorial – Teses.Mamas - Câncer. – Teses.MisturaProcesso DirichletExpressão de genesCâncer de mamaAgrupamento de interações não lineares em análise fatorialinfo:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/doctoralThesisinfo:eu-repo/semantics/openAccessreponame:Repositório Institucional da UFMGinstname:Universidade Federal de Minas Gerais (UFMG)instacron:UFMGORIGINALTese.pdfTese.pdfapplication/pdf3122745https://repositorio.ufmg.br/bitstream/1843/34608/1/Tese.pdf4dc770118429ce4df8e7e51df4bd8bc3MD51LICENSElicense.txtlicense.txttext/plain; charset=utf-82119https://repositorio.ufmg.br/bitstream/1843/34608/2/license.txt34badce4be7e31e3adb4575ae96af679MD521843/346082021-01-04 10:07:07.589oai:repositorio.ufmg.br:1843/34608TElDRU7Dh0EgREUgRElTVFJJQlVJw4fDg08gTsODTy1FWENMVVNJVkEgRE8gUkVQT1NJVMOTUklPIElOU1RJVFVDSU9OQUwgREEgVUZNRwoKQ29tIGEgYXByZXNlbnRhw6fDo28gZGVzdGEgbGljZW7Dp2EsIHZvY8OqIChvIGF1dG9yIChlcykgb3UgbyB0aXR1bGFyIGRvcyBkaXJlaXRvcyBkZSBhdXRvcikgY29uY2VkZSBhbyBSZXBvc2l0w7NyaW8gSW5zdGl0dWNpb25hbCBkYSBVRk1HIChSSS1VRk1HKSBvIGRpcmVpdG8gbsOjbyBleGNsdXNpdm8gZSBpcnJldm9nw6F2ZWwgZGUgcmVwcm9kdXppciBlL291IGRpc3RyaWJ1aXIgYSBzdWEgcHVibGljYcOnw6NvIChpbmNsdWluZG8gbyByZXN1bW8pIHBvciB0b2RvIG8gbXVuZG8gbm8gZm9ybWF0byBpbXByZXNzbyBlIGVsZXRyw7RuaWNvIGUgZW0gcXVhbHF1ZXIgbWVpbywgaW5jbHVpbmRvIG9zIGZvcm1hdG9zIMOhdWRpbyBvdSB2w61kZW8uCgpWb2PDqiBkZWNsYXJhIHF1ZSBjb25oZWNlIGEgcG9sw610aWNhIGRlIGNvcHlyaWdodCBkYSBlZGl0b3JhIGRvIHNldSBkb2N1bWVudG8gZSBxdWUgY29uaGVjZSBlIGFjZWl0YSBhcyBEaXJldHJpemVzIGRvIFJJLVVGTUcuCgpWb2PDqiBjb25jb3JkYSBxdWUgbyBSZXBvc2l0w7NyaW8gSW5zdGl0dWNpb25hbCBkYSBVRk1HIHBvZGUsIHNlbSBhbHRlcmFyIG8gY29udGXDumRvLCB0cmFuc3BvciBhIHN1YSBwdWJsaWNhw6fDo28gcGFyYSBxdWFscXVlciBtZWlvIG91IGZvcm1hdG8gcGFyYSBmaW5zIGRlIHByZXNlcnZhw6fDo28uCgpWb2PDqiB0YW1iw6ltIGNvbmNvcmRhIHF1ZSBvIFJlcG9zaXTDs3JpbyBJbnN0aXR1Y2lvbmFsIGRhIFVGTUcgcG9kZSBtYW50ZXIgbWFpcyBkZSB1bWEgY8OzcGlhIGRlIHN1YSBwdWJsaWNhw6fDo28gcGFyYSBmaW5zIGRlIHNlZ3VyYW7Dp2EsIGJhY2stdXAgZSBwcmVzZXJ2YcOnw6NvLgoKVm9jw6ogZGVjbGFyYSBxdWUgYSBzdWEgcHVibGljYcOnw6NvIMOpIG9yaWdpbmFsIGUgcXVlIHZvY8OqIHRlbSBvIHBvZGVyIGRlIGNvbmNlZGVyIG9zIGRpcmVpdG9zIGNvbnRpZG9zIG5lc3RhIGxpY2Vuw6dhLiBWb2PDqiB0YW1iw6ltIGRlY2xhcmEgcXVlIG8gZGVww7NzaXRvIGRlIHN1YSBwdWJsaWNhw6fDo28gbsOjbywgcXVlIHNlamEgZGUgc2V1IGNvbmhlY2ltZW50bywgaW5mcmluZ2UgZGlyZWl0b3MgYXV0b3JhaXMgZGUgbmluZ3XDqW0uCgpDYXNvIGEgc3VhIHB1YmxpY2HDp8OjbyBjb250ZW5oYSBtYXRlcmlhbCBxdWUgdm9jw6ogbsOjbyBwb3NzdWkgYSB0aXR1bGFyaWRhZGUgZG9zIGRpcmVpdG9zIGF1dG9yYWlzLCB2b2PDqiBkZWNsYXJhIHF1ZSBvYnRldmUgYSBwZXJtaXNzw6NvIGlycmVzdHJpdGEgZG8gZGV0ZW50b3IgZG9zIGRpcmVpdG9zIGF1dG9yYWlzIHBhcmEgY29uY2VkZXIgYW8gUmVwb3NpdMOzcmlvIEluc3RpdHVjaW9uYWwgZGEgVUZNRyBvcyBkaXJlaXRvcyBhcHJlc2VudGFkb3MgbmVzdGEgbGljZW7Dp2EsIGUgcXVlIGVzc2UgbWF0ZXJpYWwgZGUgcHJvcHJpZWRhZGUgZGUgdGVyY2Vpcm9zIGVzdMOhIGNsYXJhbWVudGUgaWRlbnRpZmljYWRvIGUgcmVjb25oZWNpZG8gbm8gdGV4dG8gb3Ugbm8gY29udGXDumRvIGRhIHB1YmxpY2HDp8OjbyBvcmEgZGVwb3NpdGFkYS4KCkNBU08gQSBQVUJMSUNBw4fDg08gT1JBIERFUE9TSVRBREEgVEVOSEEgU0lETyBSRVNVTFRBRE8gREUgVU0gUEFUUk9Dw41OSU8gT1UgQVBPSU8gREUgVU1BIEFHw4pOQ0lBIERFIEZPTUVOVE8gT1UgT1VUUk8gT1JHQU5JU01PLCBWT0PDiiBERUNMQVJBIFFVRSBSRVNQRUlUT1UgVE9ET1MgRSBRVUFJU1FVRVIgRElSRUlUT1MgREUgUkVWSVPDg08gQ09NTyBUQU1Cw4lNIEFTIERFTUFJUyBPQlJJR0HDh8OVRVMgRVhJR0lEQVMgUE9SIENPTlRSQVRPIE9VIEFDT1JETy4KCk8gUmVwb3NpdMOzcmlvIEluc3RpdHVjaW9uYWwgZGEgVUZNRyBzZSBjb21wcm9tZXRlIGEgaWRlbnRpZmljYXIgY2xhcmFtZW50ZSBvIHNldSBub21lKHMpIG91IG8ocykgbm9tZXMocykgZG8ocykgZGV0ZW50b3IoZXMpIGRvcyBkaXJlaXRvcyBhdXRvcmFpcyBkYSBwdWJsaWNhw6fDo28sIGUgbsOjbyBmYXLDoSBxdWFscXVlciBhbHRlcmHDp8OjbywgYWzDqW0gZGFxdWVsYXMgY29uY2VkaWRhcyBwb3IgZXN0YSBsaWNlbsOnYS4KCg==Repositório de PublicaçõesPUBhttps://repositorio.ufmg.br/oaiopendoar:2021-01-04T13:07:07Repositório Institucional da UFMG - Universidade Federal de Minas Gerais (UFMG)false
dc.title.pt_BR.fl_str_mv Agrupamento de interações não lineares em análise fatorial
title Agrupamento de interações não lineares em análise fatorial
spellingShingle Agrupamento de interações não lineares em análise fatorial
Erick da Conceição Amorim
Mistura
Processo Dirichlet
Expressão de genes
Câncer de mama
Estatística. – Teses.
Análise multivariada – Teses.
Análise fatorial – Teses.
Mamas - Câncer. – Teses.
title_short Agrupamento de interações não lineares em análise fatorial
title_full Agrupamento de interações não lineares em análise fatorial
title_fullStr Agrupamento de interações não lineares em análise fatorial
title_full_unstemmed Agrupamento de interações não lineares em análise fatorial
title_sort Agrupamento de interações não lineares em análise fatorial
author Erick da Conceição Amorim
author_facet Erick da Conceição Amorim
author_role author
dc.contributor.advisor1.fl_str_mv Vinícius Diniz Mayrink
dc.contributor.advisor1Lattes.fl_str_mv http://lattes.cnpq.br/8460573638694827
dc.contributor.referee1.fl_str_mv Vinícius Diniz Mayrink
dc.contributor.referee2.fl_str_mv Rosangela Helena Loschi
dc.contributor.referee3.fl_str_mv Flávio Bambirra Gonçalves
dc.contributor.referee4.fl_str_mv Rafael izbicki
dc.contributor.referee5.fl_str_mv Florencia Graciela Leonardi
dc.contributor.authorLattes.fl_str_mv http://lattes.cnpq.br/3225417947229827
dc.contributor.author.fl_str_mv Erick da Conceição Amorim
contributor_str_mv Vinícius Diniz Mayrink
Vinícius Diniz Mayrink
Rosangela Helena Loschi
Flávio Bambirra Gonçalves
Rafael izbicki
Florencia Graciela Leonardi
dc.subject.por.fl_str_mv Mistura
Processo Dirichlet
Expressão de genes
Câncer de mama
topic Mistura
Processo Dirichlet
Expressão de genes
Câncer de mama
Estatística. – Teses.
Análise multivariada – Teses.
Análise fatorial – Teses.
Mamas - Câncer. – Teses.
dc.subject.other.pt_BR.fl_str_mv Estatística. – Teses.
Análise multivariada – Teses.
Análise fatorial – Teses.
Mamas - Câncer. – Teses.
description A análise fatorial é uma ferramenta poderosa para a redução da dimensão nos estudos de estatística multivariada. Esta tese é dedicada a estender o modelo fatorial com interações não lineares proposto em 2013. A principal contribuição do trabalho é apresentar duas abordagens para agrupar as interações não lineares, e assim desenvolver novos modelos que não são restritos à cenários extremos onde todas as interações não nulas são diferentes ou todas iguais. A primeira estratégia para lidar com os grupos envolve uma mistura finita de componentes degeneradas. A segunda opção é especificada por um processo Dirichlet. Um estudo simulado abrangente é desenvolvido para explorar as propostas e mostrar seus bons desempenhos. Uma análise de sensibilidade é realizada para avaliar as vantagens de estimar o parâmetro de suavização definido na função de covariância do processo Gaussiano que estabelece a não linearidade das interações. Em termos de aplicação, a metodologia é apresentada em análise de expressão de genes relacionados a quatro conjuntos de dados referente ao câncer de mama. Aqui, os genes pertencentes a regiões disjuntas do genoma, com alteração do número de cópias, estão conectados aos fatores principais e suas interações não lineares são estimadas e agrupadas. A investigação conjunta e a comparação desses quatro conjuntos de dados sobre câncer de mama raramente são encontradas na literatura.
publishDate 2020
dc.date.issued.fl_str_mv 2020-02-19
dc.date.accessioned.fl_str_mv 2021-01-04T13:07:07Z
dc.date.available.fl_str_mv 2021-01-04T13:07:07Z
dc.type.status.fl_str_mv info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv info:eu-repo/semantics/doctoralThesis
format doctoralThesis
status_str publishedVersion
dc.identifier.uri.fl_str_mv http://hdl.handle.net/1843/34608
url http://hdl.handle.net/1843/34608
dc.language.iso.fl_str_mv por
language por
dc.rights.driver.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.publisher.none.fl_str_mv Universidade Federal de Minas Gerais
dc.publisher.program.fl_str_mv Programa de Pós-Graduação em Estatística
dc.publisher.initials.fl_str_mv UFMG
dc.publisher.country.fl_str_mv Brasil
dc.publisher.department.fl_str_mv ICX - DEPARTAMENTO DE ESTATÍSTICA
publisher.none.fl_str_mv Universidade Federal de Minas Gerais
dc.source.none.fl_str_mv reponame:Repositório Institucional da UFMG
instname:Universidade Federal de Minas Gerais (UFMG)
instacron:UFMG
instname_str Universidade Federal de Minas Gerais (UFMG)
instacron_str UFMG
institution UFMG
reponame_str Repositório Institucional da UFMG
collection Repositório Institucional da UFMG
bitstream.url.fl_str_mv https://repositorio.ufmg.br/bitstream/1843/34608/1/Tese.pdf
https://repositorio.ufmg.br/bitstream/1843/34608/2/license.txt
bitstream.checksum.fl_str_mv 4dc770118429ce4df8e7e51df4bd8bc3
34badce4be7e31e3adb4575ae96af679
bitstream.checksumAlgorithm.fl_str_mv MD5
MD5
repository.name.fl_str_mv Repositório Institucional da UFMG - Universidade Federal de Minas Gerais (UFMG)
repository.mail.fl_str_mv
_version_ 1803589424223617024