Adaptación de ASR al habla de personas con síndrome de Down

El habla de las personas con discapacidad intelectual (DI) plantea enormes retos a los sistemas de reconocimiento automático del habla (ASR), dificultando con ello el acceso de una población especialmente sensible a los servicios de información. En este trabajo se estudian las dificultades de los si...

Descripción completa

Detalles Bibliográficos
Autores: Fernández García, David, Cardeñoso Payo, Valentín, González Ferreras, César, Escudero Mancebo, David
Tipo de recurso: artículo
Estado:Versión publicada
Fecha de publicación:2024
País:España
Institución:Universidad de Valladolid
Repositorio:UVaDOC. Repositorio Documental de la Universidad de Valladolid
OAI Identifier:oai:uvadoc.uva.es:10324/82053
Acceso en línea:https://doi.org/10.26342/2024-73-15
https://uvadoc.uva.es/handle/10324/82053
Access Level:acceso abierto
Palabra clave:Reconocimiento automático del habla
Habla, Trastornos del
Speech disorders
Down, síndrome de
Personas con discapacidad
Habla
Patologia
6102.05 Patología del Lenguaje
id ES_b3a6a6b5dda1f600dff54f006fa1221f
oai_identifier_str oai:uvadoc.uva.es:10324/82053
network_acronym_str ES
network_name_str España
repository_id_str
spelling Adaptación de ASR al habla de personas con síndrome de DownASR model adaptation to the speech of people with Down syndromeFernández García, DavidCardeñoso Payo, ValentínGonzález Ferreras, CésarEscudero Mancebo, DavidReconocimiento automático del hablaHabla, Trastornos delSpeech disordersDown, síndrome dePersonas con discapacidadHablaPatologia6102.05 Patología del LenguajeEl habla de las personas con discapacidad intelectual (DI) plantea enormes retos a los sistemas de reconocimiento automático del habla (ASR), dificultando con ello el acceso de una población especialmente sensible a los servicios de información. En este trabajo se estudian las dificultades de los sistemas ASR para reconocer habla de personas DI y se muestra cómo esta limitación puede ser combatida con estrategias de ajuste fino de modelos. Se mide el rendimiento de ASR basado en whisper (v2 y v3) con un corpus de referencia de habla típica y habla DI, comprobando que hay diferencias importantes y significativas. Aplicando técnicas de fine-tuning, el rendimiento para hablantes DI mejora en al menos 30 puntos porcentuales. Nuestros resultados muestran que la inclusión de voz de personas DI en los corpus de entrenamiento es fundamental para mejorar la eficacia de los ASR.The speech of people with intellectual disabilities (ID) poses enormous challenges to automatic speech recognition (ASR) systems, making it difficult for a particularly sensitive population to access information services. This work studies the difficulties of ASR systems in recognizing the speech of ID people and shows how this limitation can be combated with model fine-tuning strategies. The performance of ASR based on whisper (v2 and v3) is measured with a reference corpus of typical speech and DI speech, verifying that there are important and significant differences. By applying fine-tuning techniques, performance for DI speakers improves by at least 30 percentage points. Our results show that the inclusion of the voice of ID people in the training corpora is essential to improve the effectiveness of ASRs.Ministerio de Ciencia, Innovación y Universidades / AEI / 10.13039/501100011033 / FEDER, Unión Europea - proyecto PID2021-126315OB-I00Sociedad Española para el Procesamiento del Lenguaje Natural2024info:eu-repo/semantics/articleinfo:eu-repo/semantics/publishedVersionapplication/pdfhttps://doi.org/10.26342/2024-73-15https://uvadoc.uva.es/handle/10324/82053reponame:UVaDOC. Repositorio Documental de la Universidad de Valladolidinstname:Universidad de ValladolidEspañolhttp://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6611info:eu-repo/semantics/openAccessoai:uvadoc.uva.es:10324/820532026-06-13T12:44:47Z
dc.title.none.fl_str_mv Adaptación de ASR al habla de personas con síndrome de Down
ASR model adaptation to the speech of people with Down syndrome
title Adaptación de ASR al habla de personas con síndrome de Down
spellingShingle Adaptación de ASR al habla de personas con síndrome de Down
Fernández García, David
Reconocimiento automático del habla
Habla, Trastornos del
Speech disorders
Down, síndrome de
Personas con discapacidad
Habla
Patologia
6102.05 Patología del Lenguaje
title_short Adaptación de ASR al habla de personas con síndrome de Down
title_full Adaptación de ASR al habla de personas con síndrome de Down
title_fullStr Adaptación de ASR al habla de personas con síndrome de Down
title_full_unstemmed Adaptación de ASR al habla de personas con síndrome de Down
title_sort Adaptación de ASR al habla de personas con síndrome de Down
dc.creator.none.fl_str_mv Fernández García, David
Cardeñoso Payo, Valentín
González Ferreras, César
Escudero Mancebo, David
author Fernández García, David
author_facet Fernández García, David
Cardeñoso Payo, Valentín
González Ferreras, César
Escudero Mancebo, David
author_role author
author2 Cardeñoso Payo, Valentín
González Ferreras, César
Escudero Mancebo, David
author2_role author
author
author
dc.subject.none.fl_str_mv Reconocimiento automático del habla
Habla, Trastornos del
Speech disorders
Down, síndrome de
Personas con discapacidad
Habla
Patologia
6102.05 Patología del Lenguaje
topic Reconocimiento automático del habla
Habla, Trastornos del
Speech disorders
Down, síndrome de
Personas con discapacidad
Habla
Patologia
6102.05 Patología del Lenguaje
description El habla de las personas con discapacidad intelectual (DI) plantea enormes retos a los sistemas de reconocimiento automático del habla (ASR), dificultando con ello el acceso de una población especialmente sensible a los servicios de información. En este trabajo se estudian las dificultades de los sistemas ASR para reconocer habla de personas DI y se muestra cómo esta limitación puede ser combatida con estrategias de ajuste fino de modelos. Se mide el rendimiento de ASR basado en whisper (v2 y v3) con un corpus de referencia de habla típica y habla DI, comprobando que hay diferencias importantes y significativas. Aplicando técnicas de fine-tuning, el rendimiento para hablantes DI mejora en al menos 30 puntos porcentuales. Nuestros resultados muestran que la inclusión de voz de personas DI en los corpus de entrenamiento es fundamental para mejorar la eficacia de los ASR.
publishDate 2024
dc.date.none.fl_str_mv 2024
dc.type.none.fl_str_mv info:eu-repo/semantics/article
info:eu-repo/semantics/publishedVersion
format article
status_str publishedVersion
dc.identifier.none.fl_str_mv https://doi.org/10.26342/2024-73-15
https://uvadoc.uva.es/handle/10324/82053
url https://doi.org/10.26342/2024-73-15
https://uvadoc.uva.es/handle/10324/82053
dc.language.none.fl_str_mv Español
language_invalid_str_mv Español
dc.relation.none.fl_str_mv http://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6611
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Sociedad Española para el Procesamiento del Lenguaje Natural
publisher.none.fl_str_mv Sociedad Española para el Procesamiento del Lenguaje Natural
dc.source.none.fl_str_mv reponame:UVaDOC. Repositorio Documental de la Universidad de Valladolid
instname:Universidad de Valladolid
instname_str Universidad de Valladolid
reponame_str UVaDOC. Repositorio Documental de la Universidad de Valladolid
collection UVaDOC. Repositorio Documental de la Universidad de Valladolid
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869417195045388288
score 15,812429