Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español

Debido a que la literatura biomédica ha ido creciendo de forma exponencial, la minería de textos biomédicos ha recibido especial atención. Los avances recientes en las técnicas de procesamiento de textos permiten ir más allá de la simple lectura de la información incluida en los textos publicados y...

ver descrição completa

Detalhes bibliográficos
Autor: Sánchez Torreguitart, Jeremi
Tipo de documento: dissertação
Data de publicação:2022
País:España
Recursos:Universidad Nacional de Educación a Distancia
Repositório:e-spacio. Repositorio Institucional de la UNED
Idioma:espanhol
OAI Identifier:oai:e-spacio.uned.es:20.500.14468/14661
Acesso em linha:https://hdl.handle.net/20.500.14468/14661
Access Level:Acceso aberto
Palavra-chave:1203.04 Inteligencia artificial
extracción de relaciones semánticas
dominio biomédico
modelo tranformers
aumento de datos
traducción Inversa
aumento de Texto
procesamiento de lenguaje natural
Entity Relation Extraction
Biomedical Domain
Transformer Model
Data Augmentation
Back Translation
Text Augmentation
NLP
id ES_b907f6a5e7d7f2c8661a3d56bb8a06a1
oai_identifier_str oai:e-spacio.uned.es:20.500.14468/14661
network_acronym_str ES
network_name_str España
repository_id_str
dc.title.none.fl_str_mv Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
title Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
spellingShingle Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
Sánchez Torreguitart, Jeremi
1203.04 Inteligencia artificial
extracción de relaciones semánticas
dominio biomédico
modelo tranformers
aumento de datos
traducción Inversa
aumento de Texto
procesamiento de lenguaje natural
Entity Relation Extraction
Biomedical Domain
Transformer Model
Data Augmentation
Back Translation
Text Augmentation
NLP
title_short Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
title_full Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
title_fullStr Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
title_full_unstemmed Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
title_sort Extracción de Relaciones Semánticas entre entidades en el dominio biomédico español
dc.creator.none.fl_str_mv Sánchez Torreguitart, Jeremi
author Sánchez Torreguitart, Jeremi
author_facet Sánchez Torreguitart, Jeremi
author_role author
dc.contributor.none.fl_str_mv Montalvo Herranz, María del Soto
Martínez Unanue, Raquel
e-Spacio UNED
dc.subject.none.fl_str_mv 1203.04 Inteligencia artificial
extracción de relaciones semánticas
dominio biomédico
modelo tranformers
aumento de datos
traducción Inversa
aumento de Texto
procesamiento de lenguaje natural
Entity Relation Extraction
Biomedical Domain
Transformer Model
Data Augmentation
Back Translation
Text Augmentation
NLP
topic 1203.04 Inteligencia artificial
extracción de relaciones semánticas
dominio biomédico
modelo tranformers
aumento de datos
traducción Inversa
aumento de Texto
procesamiento de lenguaje natural
Entity Relation Extraction
Biomedical Domain
Transformer Model
Data Augmentation
Back Translation
Text Augmentation
NLP
description Debido a que la literatura biomédica ha ido creciendo de forma exponencial, la minería de textos biomédicos ha recibido especial atención. Los avances recientes en las técnicas de procesamiento de textos permiten ir más allá de la simple lectura de la información incluida en los textos publicados y facilitan la extracción de datos relevantes para la toma de decisiones. La extracción de entidades (NER) y de sus relaciones semánticas (RE) son tareas clave en la extracción de información. Dada una secuencia de texto (generalmente una oración), el objetivo de estos sistemas es identificar tanto las entidades nombradas como las relaciones entre ellas. Los modelos más avanzados demuestran que todavía existe un largo recorrido para conseguir rendimientos cercanos al de un humano en la tarea de la extracción de relaciones semánticas en el campo biomédico español. El objetivo de este trabajo es proponer una metodología_y una serie de técnicas para intentar mejorar los resultados de estos modelos en el campo biomédico español. En este trabajo se indaga sobre el uso de distintas técnicas de aumento de datos y diferentes modelos de Inteligencia Artificial con el objetivo de mejorar el rendimiento a la hora de reconocer relaciones semánticas (RE). Como marco experimental se utilizara el facilitado por el desafío eHealth-KD 2021. Se implementarían y evaluarían distintos algoritmos de aprendizaje supervisado basados en transformers pre-entrenados de origen. Con estos modelos se realizara un primer entrenamiento inicial (pre-entrenamiento) con un corpus grande generado artificialmente con técnicas de aumento de datos: traducción, traducción inversa (backtranslation), alineamiento de palabras (word-aligment) y balanceo de clases. Se usará una combinación de modelos supervisados que consta de un modelo transformer pre-entrenados y una red neuronal de clasificación y se hará uso de conocimiento heurístico previo basado en función de la combinación del tipo de entidades para reducir el error en la clasificación de relaciones. Se ha demostrado que el uso de un corpus de pre-entrenamiento, el uso de técnicas de aumento de datos y el uso de incrustaciones de redes transformers multilingües (tranformer embeddings multilingual ) consiguen mejorar el rendimiento de los modelos.
publishDate 2022
dc.date.none.fl_str_mv 2022
2022-06-01
2022
2022-06-01
2024
2024-05-20
dc.type.none.fl_str_mv master thesis
http://purl.org/coar/resource_type/c_bdcc
dc.type.openaire.fl_str_mv info:eu-repo/semantics/masterThesis
format masterThesis
dc.identifier.none.fl_str_mv https://hdl.handle.net/20.500.14468/14661
url https://hdl.handle.net/20.500.14468/14661
dc.language.none.fl_str_mv Español
spa
language_invalid_str_mv Español
language spa
dc.rights.none.fl_str_mv open access
http://purl.org/coar/access_right/c_abf2
info:eu-repo/semantics/openAccess
https://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
rights_invalid_str_mv open access
http://purl.org/coar/access_right/c_abf2
https://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Universidad Nacional de Educación a Distancia (España). Escuela Técnica Superior de Ingeniería Informática. Departamento de Inteligencia Artificial
publisher.none.fl_str_mv Universidad Nacional de Educación a Distancia (España). Escuela Técnica Superior de Ingeniería Informática. Departamento de Inteligencia Artificial
dc.source.none.fl_str_mv reponame:e-spacio. Repositorio Institucional de la UNED
instname:Universidad Nacional de Educación a Distancia
instname_str Universidad Nacional de Educación a Distancia
reponame_str e-spacio. Repositorio Institucional de la UNED
collection e-spacio. Repositorio Institucional de la UNED
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869417699424075776
spelling Extracción de Relaciones Semánticas entre entidades en el dominio biomédico españolSánchez Torreguitart, Jeremi1203.04 Inteligencia artificialextracción de relaciones semánticasdominio biomédicomodelo tranformersaumento de datostraducción Inversaaumento de Textoprocesamiento de lenguaje naturalEntity Relation ExtractionBiomedical DomainTransformer ModelData AugmentationBack TranslationText AugmentationNLPDebido a que la literatura biomédica ha ido creciendo de forma exponencial, la minería de textos biomédicos ha recibido especial atención. Los avances recientes en las técnicas de procesamiento de textos permiten ir más allá de la simple lectura de la información incluida en los textos publicados y facilitan la extracción de datos relevantes para la toma de decisiones. La extracción de entidades (NER) y de sus relaciones semánticas (RE) son tareas clave en la extracción de información. Dada una secuencia de texto (generalmente una oración), el objetivo de estos sistemas es identificar tanto las entidades nombradas como las relaciones entre ellas. Los modelos más avanzados demuestran que todavía existe un largo recorrido para conseguir rendimientos cercanos al de un humano en la tarea de la extracción de relaciones semánticas en el campo biomédico español. El objetivo de este trabajo es proponer una metodología_y una serie de técnicas para intentar mejorar los resultados de estos modelos en el campo biomédico español. En este trabajo se indaga sobre el uso de distintas técnicas de aumento de datos y diferentes modelos de Inteligencia Artificial con el objetivo de mejorar el rendimiento a la hora de reconocer relaciones semánticas (RE). Como marco experimental se utilizara el facilitado por el desafío eHealth-KD 2021. Se implementarían y evaluarían distintos algoritmos de aprendizaje supervisado basados en transformers pre-entrenados de origen. Con estos modelos se realizara un primer entrenamiento inicial (pre-entrenamiento) con un corpus grande generado artificialmente con técnicas de aumento de datos: traducción, traducción inversa (backtranslation), alineamiento de palabras (word-aligment) y balanceo de clases. Se usará una combinación de modelos supervisados que consta de un modelo transformer pre-entrenados y una red neuronal de clasificación y se hará uso de conocimiento heurístico previo basado en función de la combinación del tipo de entidades para reducir el error en la clasificación de relaciones. Se ha demostrado que el uso de un corpus de pre-entrenamiento, el uso de técnicas de aumento de datos y el uso de incrustaciones de redes transformers multilingües (tranformer embeddings multilingual ) consiguen mejorar el rendimiento de los modelos.Biomedical literature has grown exponentially, and biomedical text mining has received special attention. Recent advances in word processing techniques make it possible to go beyond simply reading the information included in published texts and facilitate the extraction of relevant data for decision-making. The extraction of entities (NER) and their semantic relations (RE) are key tasks in the extraction and retrieval of information systems. Given a sequence of text (usually a sentence), the goal of these systems to identify both the named entities and the relationships between them. The most advanced models show that there is still a long way to go to achieve performances close to that of a human in the task of extracting semantic relationships in the Spanish biomedical eld. The objective of this work is to propose a methodology and a series of techniques to try to improve the results of these models in the Spanish biomedical eld. This paper investigates the use of dierent data augmentation techniques and dierent Articial Intelligence models with the aim of improving performance when recognizing semantic relationships (RE). As an experimental framework, the one provided by the eHealth-KD 2021 challenge will be used. Dierent supervised learning algorithms based on pre-trained transformers will be implemented and evaluated. With models, a rst initial training (pre-training) is carried out with a large corpus articially generated with data augmentation techniques: translation, backtranslation, word-alignment and class balance. A combination of supervised models consisting of a pretrained transformer model and a classication neural network will be used and heuristic prior knowledge based on the combination of entity type will be used to reduce error in relationship classication. It has been shown that the use of a pretraining corpus, the use of data augmentation techniques and the use of multilingual transformer embeddings improve the performance of the models.Universidad Nacional de Educación a Distancia (España). Escuela Técnica Superior de Ingeniería Informática. Departamento de Inteligencia ArtificialMontalvo Herranz, María del SotoMartínez Unanue, Raquele-Spacio UNED20242024-05-2020222022-06-0120222022-06-01master thesishttp://purl.org/coar/resource_type/c_bdccinfo:eu-repo/semantics/masterThesisapplication/pdfhttps://hdl.handle.net/20.500.14468/14661reponame:e-spacio. Repositorio Institucional de la UNEDinstname:Universidad Nacional de Educación a DistanciaEspañolspaopen accesshttp://purl.org/coar/access_right/c_abf2info:eu-repo/semantics/openAccesshttps://creativecommons.org/licenses/by-nc-nd/4.0/deed.esoai:e-spacio.uned.es:20.500.14468/146612026-06-06T12:38:31Z
score 15,198674