Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español

Debido a que la literatura biomédica ha ido creciendo de forma exponencial, la minería de textos biomédicos ha recibido especial atención. Los avances recientes en las técnicas de procesamiento de textos permiten ir más allá de la simple lectura de la información incluida en los textos publicados y...

Descripción completa

Detalles Bibliográficos
Autor: Sánchez Torreguitart, Jeremi
Tipo de recurso: tesis de maestría
Fecha de publicación:2022
País:España
Institución:Universidad Nacional de Educación a Distancia
Repositorio:e-spacio. Repositorio Institucional de la UNED
Idioma:español
OAI Identifier:oai:e-spacio.uned.es:20.500.14468/14661
Acceso en línea:https://hdl.handle.net/20.500.14468/14661
Access Level:acceso abierto
Palabra clave:1203.04 Inteligencia artificial
extracción de relaciones semánticas
dominio biomédico
modelo tranformers
aumento de datos
traducción Inversa
aumento de Texto
procesamiento de lenguaje natural
Entity Relation Extraction
Biomedical Domain
Transformer Model
Data Augmentation
Back Translation
Text Augmentation
NLP
Descripción
Sumario:Debido a que la literatura biomédica ha ido creciendo de forma exponencial, la minería de textos biomédicos ha recibido especial atención. Los avances recientes en las técnicas de procesamiento de textos permiten ir más allá de la simple lectura de la información incluida en los textos publicados y facilitan la extracción de datos relevantes para la toma de decisiones. La extracción de entidades (NER) y de sus relaciones semánticas (RE) son tareas clave en la extracción de información. Dada una secuencia de texto (generalmente una oración), el objetivo de estos sistemas es identificar tanto las entidades nombradas como las relaciones entre ellas. Los modelos más avanzados demuestran que todavía existe un largo recorrido para conseguir rendimientos cercanos al de un humano en la tarea de la extracción de relaciones semánticas en el campo biomédico español. El objetivo de este trabajo es proponer una metodología_y una serie de técnicas para intentar mejorar los resultados de estos modelos en el campo biomédico español. En este trabajo se indaga sobre el uso de distintas técnicas de aumento de datos y diferentes modelos de Inteligencia Artificial con el objetivo de mejorar el rendimiento a la hora de reconocer relaciones semánticas (RE). Como marco experimental se utilizara el facilitado por el desafío eHealth-KD 2021. Se implementarían y evaluarían distintos algoritmos de aprendizaje supervisado basados en transformers pre-entrenados de origen. Con estos modelos se realizara un primer entrenamiento inicial (pre-entrenamiento) con un corpus grande generado artificialmente con técnicas de aumento de datos: traducción, traducción inversa (backtranslation), alineamiento de palabras (word-aligment) y balanceo de clases. Se usará una combinación de modelos supervisados que consta de un modelo transformer pre-entrenados y una red neuronal de clasificación y se hará uso de conocimiento heurístico previo basado en función de la combinación del tipo de entidades para reducir el error en la clasificación de relaciones. Se ha demostrado que el uso de un corpus de pre-entrenamiento, el uso de técnicas de aumento de datos y el uso de incrustaciones de redes transformers multilingües (tranformer embeddings multilingual ) consiguen mejorar el rendimiento de los modelos.