Analizador sintáctico probabilístico con clasificador de argumentos de verbo para el idioma español.

En este trabajo de investigación se desarrolló un clasificador de argumentos de verbo basado en aprendizaje automático usando la técnica de máquinas de soporte vectorial [13, 30], y se integró en un analizador sintáctico probabilístico para el idioma español, con dos propósitos, proveer información...

Descripción completa

Detalles Bibliográficos
Autor: Vargas, John Alexander
Tipo de recurso: tesis de maestría
Estado:Versión publicada
Fecha de publicación:2015
País:Colombia
Institución:Universidad del Valle
Repositorio:Repositorio Digital Univalle
Idioma:español
OAI Identifier:oai:bibliotecadigital.univalle.edu.co:10893/21537
Acceso en línea:https://hdl.handle.net/10893/21537
Access Level:acceso abierto
Palabra clave:Analizador sintáctico
Lingüística de corpus
Análisis lingüístico
Verbo
Procesamiento del Lenguaje natural (computación)
Descripción
Sumario:En este trabajo de investigación se desarrolló un clasificador de argumentos de verbo basado en aprendizaje automático usando la técnica de máquinas de soporte vectorial [13, 30], y se integró en un analizador sintáctico probabilístico para el idioma español, con dos propósitos, proveer información semántica sobre la distinción entre argumentos de verbo de un árbol sintáctico, e intentar mejorar la precisión del árbol sintáctico obtenido por el analizador sintáctico. La integración se realizó sobre la implementación de Dan Bikel [4] usando el segundo modelo de Collins [11, 12], en el que define probabilidades basadas en marcos de subcategorización, que son conjuntos de constituyentes requeridos por otros constituyentes, en este trabajo se hace una modificación al segundo modelo para que tenga en cuenta la clasificación de los argumentos requeridos por constituyentes verbales, según los resultados de la máquina de soporte vectorial. Como resultado de la investigación se logró obtener un árbol sintáctico con información adicional sobre los argumentos verbales, clasificados entre complementos y adjuntos usando como corpus de entrenamiento el Ancora [24] anotado con más de 500.000 palabras del idioma español.