Imputación de datos mediante Random Forest

La información disponible es cada vez mayor y los institutos de estadística oficiales deben hacer uso de esta información para crear procesos innovadores y eficaces. El statistical lear­ning es el conjunto de técnicas usadas para la mejor comprensión de los datos. Los random forests, basados en un e...

Descripción completa

Detalles Bibliográficos
Autor: Barreñada Taleb, Lasai Alai
Tipo de recurso: tesis de maestría
Fecha de publicación:2021
País:España
Institución:Universidad Complutense de Madrid (UCM)
Repositorio:Docta Complutense
Idioma:español
OAI Identifier:oai:docta.ucm.es:20.500.14352/5138
Acceso en línea:https://hdl.handle.net/20.500.14352/5138
Access Level:acceso abierto
Palabra clave:519.22
Imputación estadística
Bosques aleatorios
Aprendizaje supervisado
Aprendizaje estadístico
Estadísticas oficiales
Índices de cifras de negocios
Estadística matemática (Matemáticas)
1209 Estadística
Descripción
Sumario:La información disponible es cada vez mayor y los institutos de estadística oficiales deben hacer uso de esta información para crear procesos innovadores y eficaces. El statistical lear­ning es el conjunto de técnicas usadas para la mejor comprensión de los datos. Los random forests, basados en un ensemble de árboles de decisión, son una de las técnicas mas utilizadas de aprendizaje supervisado. En este trabajo se han usado random forests para la imputación de datos en encuestas económicas coyunturales y mas concretamente en los Índices de Cifras de Negocios de la Industria. La imputación se trata del proceso mediante el cual se asigna un valor a un ítem para el que previamente no se tenia información. En este estudio se elabora la metodología para la imputación después de analizar los criterios de calidad necesarios para la producción de una estadística oficial. En primer lugar se realiza la selección de variables o feature selection más interesante para el cálculo de las cifras de negocios. Posteriormente, se aborda el proceso de selección de parámetros para la obtención del modelo óptimo de bos­ques aleatorios para el conjunto de datos seleccionado. Finalmente se realiza una aplicación práctica del bosque aleatorio para las imputaciones y se evalúan obteniendo un resultado satisfactorio.