Adaptación de ASR al habla de personas con síndrome de Down
El habla de las personas con discapacidad intelectual (DI) plantea enormes retos a los sistemas de reconocimiento automático del habla (ASR), dificultando con ello el acceso de una población especialmente sensible a los servicios de información. En este trabajo se estudian las dificultades de los si...
| Autores: | , , , |
|---|---|
| Tipo de recurso: | artículo |
| Estado: | Versión publicada |
| Fecha de publicación: | 2024 |
| País: | España |
| Institución: | Universidad de Valladolid |
| Repositorio: | UVaDOC. Repositorio Documental de la Universidad de Valladolid |
| OAI Identifier: | oai:uvadoc.uva.es:10324/82053 |
| Acceso en línea: | https://doi.org/10.26342/2024-73-15 https://uvadoc.uva.es/handle/10324/82053 |
| Access Level: | acceso abierto |
| Palabra clave: | Reconocimiento automático del habla Habla, Trastornos del Speech disorders Down, síndrome de Personas con discapacidad Habla Patologia 6102.05 Patología del Lenguaje |
| id |
ES_b3a6a6b5dda1f600dff54f006fa1221f |
|---|---|
| oai_identifier_str |
oai:uvadoc.uva.es:10324/82053 |
| network_acronym_str |
ES |
| network_name_str |
España |
| repository_id_str |
|
| spelling |
Adaptación de ASR al habla de personas con síndrome de DownASR model adaptation to the speech of people with Down syndromeFernández García, DavidCardeñoso Payo, ValentínGonzález Ferreras, CésarEscudero Mancebo, DavidReconocimiento automático del hablaHabla, Trastornos delSpeech disordersDown, síndrome dePersonas con discapacidadHablaPatologia6102.05 Patología del LenguajeEl habla de las personas con discapacidad intelectual (DI) plantea enormes retos a los sistemas de reconocimiento automático del habla (ASR), dificultando con ello el acceso de una población especialmente sensible a los servicios de información. En este trabajo se estudian las dificultades de los sistemas ASR para reconocer habla de personas DI y se muestra cómo esta limitación puede ser combatida con estrategias de ajuste fino de modelos. Se mide el rendimiento de ASR basado en whisper (v2 y v3) con un corpus de referencia de habla típica y habla DI, comprobando que hay diferencias importantes y significativas. Aplicando técnicas de fine-tuning, el rendimiento para hablantes DI mejora en al menos 30 puntos porcentuales. Nuestros resultados muestran que la inclusión de voz de personas DI en los corpus de entrenamiento es fundamental para mejorar la eficacia de los ASR.The speech of people with intellectual disabilities (ID) poses enormous challenges to automatic speech recognition (ASR) systems, making it difficult for a particularly sensitive population to access information services. This work studies the difficulties of ASR systems in recognizing the speech of ID people and shows how this limitation can be combated with model fine-tuning strategies. The performance of ASR based on whisper (v2 and v3) is measured with a reference corpus of typical speech and DI speech, verifying that there are important and significant differences. By applying fine-tuning techniques, performance for DI speakers improves by at least 30 percentage points. Our results show that the inclusion of the voice of ID people in the training corpora is essential to improve the effectiveness of ASRs.Ministerio de Ciencia, Innovación y Universidades / AEI / 10.13039/501100011033 / FEDER, Unión Europea - proyecto PID2021-126315OB-I00Sociedad Española para el Procesamiento del Lenguaje Natural2024info:eu-repo/semantics/articleinfo:eu-repo/semantics/publishedVersionapplication/pdfhttps://doi.org/10.26342/2024-73-15https://uvadoc.uva.es/handle/10324/82053reponame:UVaDOC. Repositorio Documental de la Universidad de Valladolidinstname:Universidad de ValladolidEspañolhttp://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6611info:eu-repo/semantics/openAccessoai:uvadoc.uva.es:10324/820532026-06-13T12:44:47Z |
| dc.title.none.fl_str_mv |
Adaptación de ASR al habla de personas con síndrome de Down ASR model adaptation to the speech of people with Down syndrome |
| title |
Adaptación de ASR al habla de personas con síndrome de Down |
| spellingShingle |
Adaptación de ASR al habla de personas con síndrome de Down Fernández García, David Reconocimiento automático del habla Habla, Trastornos del Speech disorders Down, síndrome de Personas con discapacidad Habla Patologia 6102.05 Patología del Lenguaje |
| title_short |
Adaptación de ASR al habla de personas con síndrome de Down |
| title_full |
Adaptación de ASR al habla de personas con síndrome de Down |
| title_fullStr |
Adaptación de ASR al habla de personas con síndrome de Down |
| title_full_unstemmed |
Adaptación de ASR al habla de personas con síndrome de Down |
| title_sort |
Adaptación de ASR al habla de personas con síndrome de Down |
| dc.creator.none.fl_str_mv |
Fernández García, David Cardeñoso Payo, Valentín González Ferreras, César Escudero Mancebo, David |
| author |
Fernández García, David |
| author_facet |
Fernández García, David Cardeñoso Payo, Valentín González Ferreras, César Escudero Mancebo, David |
| author_role |
author |
| author2 |
Cardeñoso Payo, Valentín González Ferreras, César Escudero Mancebo, David |
| author2_role |
author author author |
| dc.subject.none.fl_str_mv |
Reconocimiento automático del habla Habla, Trastornos del Speech disorders Down, síndrome de Personas con discapacidad Habla Patologia 6102.05 Patología del Lenguaje |
| topic |
Reconocimiento automático del habla Habla, Trastornos del Speech disorders Down, síndrome de Personas con discapacidad Habla Patologia 6102.05 Patología del Lenguaje |
| description |
El habla de las personas con discapacidad intelectual (DI) plantea enormes retos a los sistemas de reconocimiento automático del habla (ASR), dificultando con ello el acceso de una población especialmente sensible a los servicios de información. En este trabajo se estudian las dificultades de los sistemas ASR para reconocer habla de personas DI y se muestra cómo esta limitación puede ser combatida con estrategias de ajuste fino de modelos. Se mide el rendimiento de ASR basado en whisper (v2 y v3) con un corpus de referencia de habla típica y habla DI, comprobando que hay diferencias importantes y significativas. Aplicando técnicas de fine-tuning, el rendimiento para hablantes DI mejora en al menos 30 puntos porcentuales. Nuestros resultados muestran que la inclusión de voz de personas DI en los corpus de entrenamiento es fundamental para mejorar la eficacia de los ASR. |
| publishDate |
2024 |
| dc.date.none.fl_str_mv |
2024 |
| dc.type.none.fl_str_mv |
info:eu-repo/semantics/article info:eu-repo/semantics/publishedVersion |
| format |
article |
| status_str |
publishedVersion |
| dc.identifier.none.fl_str_mv |
https://doi.org/10.26342/2024-73-15 https://uvadoc.uva.es/handle/10324/82053 |
| url |
https://doi.org/10.26342/2024-73-15 https://uvadoc.uva.es/handle/10324/82053 |
| dc.language.none.fl_str_mv |
Español |
| language_invalid_str_mv |
Español |
| dc.relation.none.fl_str_mv |
http://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6611 |
| dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess |
| eu_rights_str_mv |
openAccess |
| dc.format.none.fl_str_mv |
application/pdf |
| dc.publisher.none.fl_str_mv |
Sociedad Española para el Procesamiento del Lenguaje Natural |
| publisher.none.fl_str_mv |
Sociedad Española para el Procesamiento del Lenguaje Natural |
| dc.source.none.fl_str_mv |
reponame:UVaDOC. Repositorio Documental de la Universidad de Valladolid instname:Universidad de Valladolid |
| instname_str |
Universidad de Valladolid |
| reponame_str |
UVaDOC. Repositorio Documental de la Universidad de Valladolid |
| collection |
UVaDOC. Repositorio Documental de la Universidad de Valladolid |
| repository.name.fl_str_mv |
|
| repository.mail.fl_str_mv |
|
| _version_ |
1869417195045388288 |
| score |
15,812429 |