Generación de informes radiológicos sintéticos con LLM para aumento de datos y mejora de la extracción de información clínica con BioGPT
Este trabajo tiene como objetivo analizar si el aumento de datos mediante generación de informes sintéticos permite mejorar el rendimiento de un modelo basado en BioGPT para la extracción y clasificación de variables clínicas a partir de informes radiológicos. Para ello, se diseñaron varias estrateg...
| Autor: | |
|---|---|
| Tipo de recurso: | tesis de maestría |
| Fecha de publicación: | 2026 |
| País: | España |
| Institución: | Universidad de Cantabria (UC) |
| Repositorio: | e-spacio (DSpace). Repositorio Institucional de la UNED |
| Idioma: | español |
| OAI Identifier: | oai:e-spacio.uned.es:20.500.14468/32071 |
| Acceso en línea: | https://hdl.handle.net/20.500.14468/32071 |
| Access Level: | acceso abierto |
| Palabra clave: | 1203.04 Inteligencia artificial datos sintéticos aumento de datos BioGPT extracción clínica NLP biomédico |
| Sumario: | Este trabajo tiene como objetivo analizar si el aumento de datos mediante generación de informes sintéticos permite mejorar el rendimiento de un modelo basado en BioGPT para la extracción y clasificación de variables clínicas a partir de informes radiológicos. Para ello, se diseñaron varias estrategias de aumento de datos con informes sintéticos generados mediante técnicas zero-shot, oneshot y few-shot, variando además dos factores: el tamaño del conjunto de entrenamiento sintético (200 y 1100 informes) y el uso o no de una estructura explícita en el prompt de generación. La metodología consistió en entrenar y evaluar el modelo en dos tipos de tareas: (i) clasificación de variables categóricas/estructuradas, medida mediante accuracy y Macro F1; y (ii) extracción de variables de texto libre, evaluada con la métrica semántica BERTScore F1 y una evaluación basada en juicio experto (expert assessed score), con el fin de aproximar la utilidad clínica de las respuestas generadas. También se analizó un escenario extremo en el que el modelo se entrenó únicamente con informes sintéticos para cuantificar la dependencia de los datos reales. Los resultados muestran que el aumento de datos puede aportar mejoras, pero de forma condicionada a la calidad y al control de la generación. En clasificación, la variante few-shot con 200 ejemplos y con estructura obtuvo el mejor rendimiento en F1, mejorando al modelo de referencia y manteniendo una accuracy global alta, lo que sugiere una ganancia especialmente relevante en variables o clases más difíciles. Sin embargo, el estadístico Wilcoxon para variables categóricas arrojó un valor p = 0,077, lo que indica que la magnitud del efecto es positiva pero no es significativa con umbral estricto (α = 0,05). En variables de texto libre, la comparación mediante BERTScore F1 y expert assessed score favoreció a la mejor estrategia frente a BioGPT, especialmente en los campos con mayor variabilidad semántica. En contraste, el entrenamiento con solo datos sintéticos produjo una caída notable del rendimiento, evidenciando que los sintéticos no son capaces de sustituir la señal de los datos reales y que su utilidad depende de su integración como complemento supervisado. En conclusión, el trabajo confirma que la generación de informes sintéticos puede ser una estrategia válida para aumentar la base de datos y mejorar un modelo, pero únicamente cuando la síntesis se realiza de forma estructurada, controlada y orientada a preservar coherencia clínica. La evidencia sugiere que la estructura del prompt y el diseño del aumento son determinantes, y que futuras iteraciones deberían centrarse en mejorar la fidelidad de los datos sintéticos, priorizar variables problemáticas y reforzar la evaluación para cuantificar omisiones y alucinaciones. |
|---|