An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data

Within the context of a latent class model with manifest binary variables, we propose an alternative method that solves the problem of estimating empirical distribution with sparse contingency tables and the chi-square approximation for goodness-of-fit will not be valid. We analyze sparse binary dat...

Descripción completa

Detalles Bibliográficos
Autor: Araya Alpizar, Carlomagno
Tipo de recurso: artículo
Estado:Versión publicada
Fecha de publicación:2017
País:Costa Rica
Institución:Universidad de Costa Rica
Repositorio:Portal de Revistas UCR
Idioma:inglés
OAI Identifier:oai:portal.ucr.ac.cr:article/22448
Acceso en línea:https://revistas.ucr.ac.cr/index.php/matematica/article/view/22448
Access Level:acceso abierto
Palabra clave:sparse data
latent class
goodness-of-fit
binary data
datos escasos
clases latentes
bondad de ajuste
datos binarios
id CR_157be2fd3aa0cece7ef9d33b94a2ddbf
oai_identifier_str oai:portal.ucr.ac.cr:article/22448
network_acronym_str CR
network_name_str Costa Rica
repository_id_str
dc.title.none.fl_str_mv An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
Un método alternativo para la selección de modelos de clases latentes en datos binarios escasos: una ilustración con datos sim
title An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
spellingShingle An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
Araya Alpizar, Carlomagno
sparse data
latent class
goodness-of-fit
binary data
datos escasos
clases latentes
bondad de ajuste
datos binarios
title_short An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
title_full An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
title_fullStr An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
title_full_unstemmed An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
title_sort An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated data
dc.creator.none.fl_str_mv Araya Alpizar, Carlomagno
author Araya Alpizar, Carlomagno
author_facet Araya Alpizar, Carlomagno
author_role author
dc.subject.none.fl_str_mv sparse data
latent class
goodness-of-fit
binary data
datos escasos
clases latentes
bondad de ajuste
datos binarios
topic sparse data
latent class
goodness-of-fit
binary data
datos escasos
clases latentes
bondad de ajuste
datos binarios
description Within the context of a latent class model with manifest binary variables, we propose an alternative method that solves the problem of estimating empirical distribution with sparse contingency tables and the chi-square approximation for goodness-of-fit will not be valid. We analyze sparse binary data, where there are many response patterns with very small expected frequencies in several data sets varying in degree of sparseness from 1 to 5 defined d = n/2p = n/R is a factor that is mentioned in almost all prior literature as being an important determinant of how well the distribution is represented by the chi-squared.The proposed approach produced results that were valid and reliable under the mentioned problematic data conditions. Results from the proposal presented compare the rates of Type I for traditional goodness-of-fit tests. We also show that with data density d ≤ 5, Pearson’s statistic (χ2) should not be used to select latent class models using the Patterns Method, given that this has the probability of Type I error being greater than 5%. By comparing the Patterns Method and the Parametric Bootstrap for data density d = 2, we show that the Patterns Method has more accurate Type I error probabilities since the likelihood ratio, Read-Cressie and Freeman-Tukey statistics afford values of α < 0.05. In contrast, the Parametric Bootstrap provides values in these statistics that surpass 5%.
publishDate 2017
dc.date.none.fl_str_mv 2017-04-19
dc.type.none.fl_str_mv info:eu-repo/semantics/publishedVersion
Article
artículo original
http://purl.org/coar/resource_type/c_2df8fbb1
info:eu-repo/semantics/article
format article
status_str publishedVersion
dc.identifier.none.fl_str_mv https://revistas.ucr.ac.cr/index.php/matematica/article/view/22448
10.15517/rmta.v23i1.22448
url https://revistas.ucr.ac.cr/index.php/matematica/article/view/22448
identifier_str_mv 10.15517/rmta.v23i1.22448
dc.language.none.fl_str_mv eng
language eng
dc.relation.none.fl_str_mv https://revistas.ucr.ac.cr/index.php/matematica/article/view/22448/22614
dc.rights.none.fl_str_mv Derechos de autor 2016 Revista de Matemática: Teoría y Aplicaciones
acceso abierto
http://purl.org/coar/access_right/c_abf2
info:eu-repo/semantics/openAccess
rights_invalid_str_mv Derechos de autor 2016 Revista de Matemática: Teoría y Aplicaciones
acceso abierto
http://purl.org/coar/access_right/c_abf2
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Universidad de Costa Rica, Centro de Investigación en Matemática Pura y Aplicada (CIMPA)
publisher.none.fl_str_mv Universidad de Costa Rica, Centro de Investigación en Matemática Pura y Aplicada (CIMPA)
dc.source.none.fl_str_mv Revista de Matemática: Teoría y Aplicaciones; Vol. 23 No. 1 (2016): Revista de Matemática: Teoría y Aplicaciones; 199-220
Revista de Matemática: Teoría y Aplicaciones; Vol. 23 Núm. 1 (2016): Revista de Matemática: Teoría y Aplicaciones; 199-220
Revista de Matemática; Vol. 23 N.º 1 (2016): Revista de Matemática: Teoría y Aplicaciones; 199-220
2215-3373
1409-2433
reponame:Portal de Revistas UCR
instname:Universidad de Costa Rica
instacron:UCR
instname_str Universidad de Costa Rica
instacron_str UCR
institution UCR
reponame_str Portal de Revistas UCR
collection Portal de Revistas UCR
repository.name.fl_str_mv Portal de Revistas UCR - Universidad de Costa Rica
repository.mail.fl_str_mv jorge.polanco@ucr.ac.cr
_version_ 1849325289085075456
spelling An alternative to classical latent class models selection methods for sparse binary data: an illustration with simulated dataUn método alternativo para la selección de modelos de clases latentes en datos binarios escasos: una ilustración con datos simAraya Alpizar, Carlomagnosparse datalatent classgoodness-of-fitbinary datadatos escasosclases latentesbondad de ajustedatos binariosWithin the context of a latent class model with manifest binary variables, we propose an alternative method that solves the problem of estimating empirical distribution with sparse contingency tables and the chi-square approximation for goodness-of-fit will not be valid. We analyze sparse binary data, where there are many response patterns with very small expected frequencies in several data sets varying in degree of sparseness from 1 to 5 defined d = n/2p = n/R is a factor that is mentioned in almost all prior literature as being an important determinant of how well the distribution is represented by the chi-squared.The proposed approach produced results that were valid and reliable under the mentioned problematic data conditions. Results from the proposal presented compare the rates of Type I for traditional goodness-of-fit tests. We also show that with data density d ≤ 5, Pearson’s statistic (χ2) should not be used to select latent class models using the Patterns Method, given that this has the probability of Type I error being greater than 5%. By comparing the Patterns Method and the Parametric Bootstrap for data density d = 2, we show that the Patterns Method has more accurate Type I error probabilities since the likelihood ratio, Read-Cressie and Freeman-Tukey statistics afford values of α < 0.05. In contrast, the Parametric Bootstrap provides values in these statistics that surpass 5%.En el contexto de modelos de clases latentes con variables manifiestas binarias, se propone un método alternativo para resolver el problema de la estimación de la distribución empírica con tablas de contingencias escasas, donde la aproximación de los estadísticos de bondad de ajuste por la distribución Chi-Cuadrada no es válida. Se analiza datos binarios escasos, donde muchos patrones de respuesta que tienen frecuencias esperadas pequeñas, en conjuntos de datos con grados de datos escasos de 1 a 5, donde d = n/2p = n/R es un factor es mencionado en la literatura como determinante de la bondad de ajuste a la distribución Chi-Cuadrada. La propuesta presenta resultados válidos y confiables en las condiciones de los datos mencionadas. Para los resultados se presenta tasas de error tipo I para las pruebas tradiciones de bondad de ajuste. También se muestra que para niveles de densidad de datos d ≤ 5, el estadístico Pearson (χ2) no es el apropiado para seleccionar modelos de clases latentes utilizando el Método de Patrones, dado que presenta probabilidad de error de tipo I más grandes que 5%. Al comparar el Método de Patrones y el Bootstrap Paramétrico para la densidad d = 2, se muestra que el Método de Patrones tiene probabilidades de error de tipo I menores de 5% en los estadísticos de razón de verosimilitud, Read-Cressie y Freeman-Tukey. En contraste, el Bootstrap Paramétrico produce valores en estos estadísticos que superan un 5%.Universidad de Costa Rica, Centro de Investigación en Matemática Pura y Aplicada (CIMPA)2017-04-19info:eu-repo/semantics/publishedVersionArticleartículo originalhttp://purl.org/coar/resource_type/c_2df8fbb1info:eu-repo/semantics/articleapplication/pdfhttps://revistas.ucr.ac.cr/index.php/matematica/article/view/2244810.15517/rmta.v23i1.22448Revista de Matemática: Teoría y Aplicaciones; Vol. 23 No. 1 (2016): Revista de Matemática: Teoría y Aplicaciones; 199-220Revista de Matemática: Teoría y Aplicaciones; Vol. 23 Núm. 1 (2016): Revista de Matemática: Teoría y Aplicaciones; 199-220Revista de Matemática; Vol. 23 N.º 1 (2016): Revista de Matemática: Teoría y Aplicaciones; 199-2202215-33731409-2433reponame:Portal de Revistas UCRinstname:Universidad de Costa Ricainstacron:UCRenghttps://revistas.ucr.ac.cr/index.php/matematica/article/view/22448/22614Derechos de autor 2016 Revista de Matemática: Teoría y Aplicacionesacceso abiertohttp://purl.org/coar/access_right/c_abf2info:eu-repo/semantics/openAccess2022-01-31T16:42:11Zoai:portal.ucr.ac.cr:article/22448Portal de revistashttps://revistas.ucr.ac.cr/Universidadhttp://www.ucr.ac.crhttps://revistas.ucr.ac.cr/index.php/index/oaijorge.polanco@ucr.ac.crCosta RicaNo aplicaNo aplicaNo aplicaopendoar:2025-08-13T09:45:58.075Portal de Revistas UCR - Universidad de Costa Ricafalse
score 15.812455