Data Augmentation in imbalanced datasets: Classical Approaches and Artificial Intelligence

Esta tesis aborda el reto del desequilibrio de clases en el aprendizaje automático, habitual en campos como la clasificación de textos y la recomendación de categorías. Los conjuntos de datos desequilibrados a menudo conducen a modelos sesgados que favorecen a las clases mayoritarias, obstaculizando...

Descripción completa

Detalles Bibliográficos
Autor: Candela i Oliver, Èlia
Tipo de recurso: tesis de maestría
Fecha de publicación:2025
País:España
Institución:Universitat Politècnica de Catalunya (UPC)
Repositorio:UPCommons. Portal del coneixement obert de la UPC
Idioma:inglés
OAI Identifier:oai:upcommons.upc.edu:2117/449980
Acceso en línea:https://hdl.handle.net/2117/449980
Access Level:acceso abierto
Palabra clave:Machine learning
Artificial intelligence
data augmentation
IA
VAE
AI
Aprenentatge automàtic
Intel·ligència artificial
Àrees temàtiques de la UPC::Informàtica::Intel·ligència artificial::Aprenentatge automàtic
Descripción
Sumario:Esta tesis aborda el reto del desequilibrio de clases en el aprendizaje automático, habitual en campos como la clasificación de textos y la recomendación de categorías. Los conjuntos de datos desequilibrados a menudo conducen a modelos sesgados que favorecen a las clases mayoritarias, obstaculizando la capacidad de predecir con precisión las clases minoritarias, que suelen ser más cruciales. Las técnicas de aumento de datos han surgido como una solución prometedora, generando nuevos datos a partir de ejemplos existentes para equilibrar la distribución. Este estudio compara métodos clásicos como el aumento sencillo de datos con técnicas avanzadas basadas en IA, como los autocodificadores variacionales guiados por temas, para evaluar su eficacia a la hora de mejorar el rendimiento de los modelos de clasificación. El análisis se centra en cómo estos métodos pueden aumentar la representación de clases infrarrepresentadas y mejorar la generalización en escenarios de datos desequilibrados. En última instancia, el objetivo es ofrecer una comparación sistemática que ayude a los informáticos a seleccionar la técnica más adecuada para sus conjuntos de datos y retos específicos.