Búsqueda de Respuestas sobre la COVID-19

En este trabajo se pretende abordar uno de los desafíos del TAC-2020 consistente en la respuesta a preguntas epidemiológicas (EPIC-QA). El objetivo del desafío EPIC-QA es evaluar la capacidad de los sistemas para proporcionar respuestas oportunas a preguntas sobre la enfermedad COVID-19. Este desafí...

Descripción completa

Detalles Bibliográficos
Autor: Torres Peón, Francisco Xavier
Tipo de recurso: tesis de maestría
Fecha de publicación:2021
País:España
Institución:Universidad Nacional de Educación a Distancia
Repositorio:e-spacio. Repositorio Institucional de la UNED
Idioma:español
OAI Identifier:oai:e-spacio.uned.es:20.500.14468/14289
Acceso en línea:https://hdl.handle.net/20.500.14468/14289
Access Level:acceso abierto
Palabra clave:1203 Ciencia de los ordenadores
Descripción
Sumario:En este trabajo se pretende abordar uno de los desafíos del TAC-2020 consistente en la respuesta a preguntas epidemiológicas (EPIC-QA). El objetivo del desafío EPIC-QA es evaluar la capacidad de los sistemas para proporcionar respuestas oportunas a preguntas sobre la enfermedad COVID-19. Este desafío esta dividido en dos tareas:  La Tarea A consiste en dar respuesta a las preguntas a nivel de experto. Estas preguntas están dirigidas a las comunidades científicas y medicas.  La Tarea B consiste en dar respuesta a las preguntas a nivel de consumidor. Esta preguntas están dirigidas al publico en general. En este trabajo solo se va a abordar la Tarea A. Para realizar este desafío se parte de una colección de artículos biomédicos publicados por el COVID-19 Open Research Dataset Challenge (CORD-19). Este conjunto abierto de datos de investigación fue creado por el Instituto Allen de IA en asociación con grupos de investigación líderes. La evaluación preliminar utiliza una instantánea de CORD-19 del 18 de noviembre de 2020, y consta de 129.069 artículos que se presentan como un único objeto JSON. Resolver este desafío no es tarea fácil, ya que se pretende extraer información precisa sobre determinadas cuestiones y temas científicos de un conjunto grande de recursos sin etiquetar. El desafío EPIC-QA requiere que los participantes recuperen sentencias en lugar de documentos o pasajes. La recuperación de sentencias a gran escala es un proceso difícil para los sistemas neuronales previamente entrenados debido a la falta de contexto circundante. Asimismo, es un proceso computacionalmente costoso. Se plantea un sistema de tres etapas en cascada. En la primera etapa se usa un sistema no neuronal para recuperar los k pasajes mas relevantes para una consulta determinada. Los pasajes mas relevantes se consiguen debido a que el sistema no neuronal puntúa cada resultado obtenido (scoreRI) y en función de esa puntuación obtenemos la relevancia. En una segunda etapa se extraen las sentencias de los pasajes recuperados en la etapa anterior y se usa un sistema neuronal previamente entrenado que clasifica esas sentencias también asignándole una puntuación (scoreQA). La tercera etapa es donde se reclasifican esas sentencias teniendo en cuenta la puntuación obtenida por el sistema no neuronal y la puntuación obtenida por el sistema neuronal.