Aplicación de métodos de aprendizaje semi-supervisados para el reconocimiento del habla en personas con afasia

Tradicionalmente, los sistemas de reconocimiento automático del habla (RAH) requieren de algoritmos que utilizan bases de datos etiquetadas para su aprendizaje. Sin embargo, un reciente y novedoso enfoque desarrolla modelos semi-supervisados que tienen la capacidad de realizar una parte de su entren...

Descripción completa

Detalles Bibliográficos
Autor: Romero Ferrón, Mónica
Tipo de recurso: tesis de maestría
Fecha de publicación:2021
País:España
Institución:Universitat Oberta de Catalunya (UOC)
Repositorio:O2, repositorio institucional de la UOC
OAI Identifier:oai:openaccess.uoc.edu:10609/136086
Acceso en línea:http://hdl.handle.net/10609/136086
Access Level:acceso abierto
Palabra clave:reconocimiento automático del habla
RAH
wav2vec2.0
afasia
redes neuronales
NLP
automatic speech recognition
aphasia
neural networks
reconeixement automàtic de la parla
fàsia
xarxes neuronals
Neural networks (Computer science) -- TFM
Xarxes neuronals (Informàtica) --TFM
Redes neuronales -- TFM
Descripción
Sumario:Tradicionalmente, los sistemas de reconocimiento automático del habla (RAH) requieren de algoritmos que utilizan bases de datos etiquetadas para su aprendizaje. Sin embargo, un reciente y novedoso enfoque desarrolla modelos semi-supervisados que tienen la capacidad de realizar una parte de su entrenamiento con datos no etiquetados, facilitando así su uso en entornos donde los datos etiquetados son escasos. Este trabajo de investigación esta centrado en la aplicación de estos métodos de aprendizaje en el ámbito de la salud y, más concretamente, en voces patológicas proveniente de hablantes con diferentes tipos de afasia. Se ha trabajado con la base de datos de referencia AphasiaBank, que contiene 78 horas de audios de pacientes con diferentes grados de afasia, y que ya ha sido empleada por otros grupos de investigación. A nivel de modelado, se ha optimizado y a nado la arquitectura de aprendizaje semi-supervisado empleada sobre estos datos de dominio, a través de la aplicación de la técnica Grid Search y de la búsqueda exhaustiva de los hiperparámetros del modelo. En este estudio se comparan los resultados obtenidos con los que se reflejan en el estado del arte. Se demuestra que el modelo de reconocimiento obtenido presenta resultados que mejoran otro tipo de enfoques publicados anteriormente.