Búsqueda de Respuestas sobre la COVID-19
En este trabajo se pretende abordar uno de los desafíos del TAC-2020 consistente en la respuesta a preguntas epidemiológicas (EPIC-QA). El objetivo del desafío EPIC-QA es evaluar la capacidad de los sistemas para proporcionar respuestas oportunas a preguntas sobre la enfermedad COVID-19. Este desafí...
| Autor: | |
|---|---|
| Tipo de recurso: | tesis de maestría |
| Fecha de publicación: | 2021 |
| País: | España |
| Institución: | Universidad Nacional de Educación a Distancia |
| Repositorio: | e-spacio. Repositorio Institucional de la UNED |
| Idioma: | español |
| OAI Identifier: | oai:e-spacio.uned.es:20.500.14468/14289 |
| Acceso en línea: | https://hdl.handle.net/20.500.14468/14289 |
| Access Level: | acceso abierto |
| Palabra clave: | 1203 Ciencia de los ordenadores |
| Sumario: | En este trabajo se pretende abordar uno de los desafíos del TAC-2020 consistente en la respuesta a preguntas epidemiológicas (EPIC-QA). El objetivo del desafío EPIC-QA es evaluar la capacidad de los sistemas para proporcionar respuestas oportunas a preguntas sobre la enfermedad COVID-19. Este desafío esta dividido en dos tareas: La Tarea A consiste en dar respuesta a las preguntas a nivel de experto. Estas preguntas están dirigidas a las comunidades científicas y medicas. La Tarea B consiste en dar respuesta a las preguntas a nivel de consumidor. Esta preguntas están dirigidas al publico en general. En este trabajo solo se va a abordar la Tarea A. Para realizar este desafío se parte de una colección de artículos biomédicos publicados por el COVID-19 Open Research Dataset Challenge (CORD-19). Este conjunto abierto de datos de investigación fue creado por el Instituto Allen de IA en asociación con grupos de investigación líderes. La evaluación preliminar utiliza una instantánea de CORD-19 del 18 de noviembre de 2020, y consta de 129.069 artículos que se presentan como un único objeto JSON. Resolver este desafío no es tarea fácil, ya que se pretende extraer información precisa sobre determinadas cuestiones y temas científicos de un conjunto grande de recursos sin etiquetar. El desafío EPIC-QA requiere que los participantes recuperen sentencias en lugar de documentos o pasajes. La recuperación de sentencias a gran escala es un proceso difícil para los sistemas neuronales previamente entrenados debido a la falta de contexto circundante. Asimismo, es un proceso computacionalmente costoso. Se plantea un sistema de tres etapas en cascada. En la primera etapa se usa un sistema no neuronal para recuperar los k pasajes mas relevantes para una consulta determinada. Los pasajes mas relevantes se consiguen debido a que el sistema no neuronal puntúa cada resultado obtenido (scoreRI) y en función de esa puntuación obtenemos la relevancia. En una segunda etapa se extraen las sentencias de los pasajes recuperados en la etapa anterior y se usa un sistema neuronal previamente entrenado que clasifica esas sentencias también asignándole una puntuación (scoreQA). La tercera etapa es donde se reclasifican esas sentencias teniendo en cuenta la puntuación obtenida por el sistema no neuronal y la puntuación obtenida por el sistema neuronal. |
|---|