Data Augmentation in imbalanced datasets: Classical Approaches and Artificial Intelligence
Esta tesis aborda el reto del desequilibrio de clases en el aprendizaje automático, habitual en campos como la clasificación de textos y la recomendación de categorías. Los conjuntos de datos desequilibrados a menudo conducen a modelos sesgados que favorecen a las clases mayoritarias, obstaculizando...
| Autor: | |
|---|---|
| Tipo de recurso: | tesis de maestría |
| Fecha de publicación: | 2025 |
| País: | España |
| Institución: | Universitat Politècnica de Catalunya (UPC) |
| Repositorio: | UPCommons. Portal del coneixement obert de la UPC |
| Idioma: | inglés |
| OAI Identifier: | oai:upcommons.upc.edu:2117/449980 |
| Acceso en línea: | https://hdl.handle.net/2117/449980 |
| Access Level: | acceso abierto |
| Palabra clave: | Machine learning Artificial intelligence data augmentation IA VAE AI Aprenentatge automàtic Intel·ligència artificial Àrees temàtiques de la UPC::Informàtica::Intel·ligència artificial::Aprenentatge automàtic |
| Sumario: | Esta tesis aborda el reto del desequilibrio de clases en el aprendizaje automático, habitual en campos como la clasificación de textos y la recomendación de categorías. Los conjuntos de datos desequilibrados a menudo conducen a modelos sesgados que favorecen a las clases mayoritarias, obstaculizando la capacidad de predecir con precisión las clases minoritarias, que suelen ser más cruciales. Las técnicas de aumento de datos han surgido como una solución prometedora, generando nuevos datos a partir de ejemplos existentes para equilibrar la distribución. Este estudio compara métodos clásicos como el aumento sencillo de datos con técnicas avanzadas basadas en IA, como los autocodificadores variacionales guiados por temas, para evaluar su eficacia a la hora de mejorar el rendimiento de los modelos de clasificación. El análisis se centra en cómo estos métodos pueden aumentar la representación de clases infrarrepresentadas y mejorar la generalización en escenarios de datos desequilibrados. En última instancia, el objetivo es ofrecer una comparación sistemática que ayude a los informáticos a seleccionar la técnica más adecuada para sus conjuntos de datos y retos específicos. |
|---|