Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos

El comportamiento de los sistemas actuales de reconocimiento del habla se degrada rápidamente en presencia de ruido de fondo cuando las etapas de entrenamiento y de test no pueden llevarse a cabo en las mismas condiciones ambientales. El propósito de esta tesis es el estudio y la aplicación al recon...

Descripción completa

Detalles Bibliográficos
Autor: Hernando Pericás, Francisco Javier|||0000-0002-1730-8154
Tipo de recurso: tesis doctoral
Fecha de publicación:1993
País:España
Institución:Universitat Politècnica de Catalunya (UPC)
Repositorio:UPCommons. Portal del coneixement obert de la UPC
Idioma:español
OAI Identifier:oai:upcommons.upc.edu:2117/94222
Acceso en línea:https://hdl.handle.net/2117/94222
https://dx.doi.org/10.5821/dissertation-2117-94222
Access Level:acceso abierto
Palabra clave:reconocimento del habla en ambientes adversos
reconocimento del habla en presencia de ruido
parametrización de la señal de voz
analisis de la voz
reconocimento robusto del habla
reconocimento automático del habla
procesado del habla
Reconeixement automàtic de la parla
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
id ES_bf28702c2e4d2f040ea8e1e1ad2af18e
oai_identifier_str oai:upcommons.upc.edu:2117/94222
network_acronym_str ES
network_name_str España
repository_id_str
dc.title.none.fl_str_mv Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
title Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
spellingShingle Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
Hernando Pericás, Francisco Javier|||0000-0002-1730-8154
reconocimento del habla en ambientes adversos
reconocimento del habla en presencia de ruido
parametrización de la señal de voz
analisis de la voz
reconocimento robusto del habla
reconocimento automático del habla
procesado del habla
Reconeixement automàtic de la parla
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
title_short Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
title_full Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
title_fullStr Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
title_full_unstemmed Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
title_sort Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidosos
dc.creator.none.fl_str_mv Hernando Pericás, Francisco Javier|||0000-0002-1730-8154
author Hernando Pericás, Francisco Javier|||0000-0002-1730-8154
author_facet Hernando Pericás, Francisco Javier|||0000-0002-1730-8154
author_role author
dc.contributor.none.fl_str_mv Nadeu Camprubí, Climent
dc.subject.none.fl_str_mv reconocimento del habla en ambientes adversos
reconocimento del habla en presencia de ruido
parametrización de la señal de voz
analisis de la voz
reconocimento robusto del habla
reconocimento automático del habla
procesado del habla
Reconeixement automàtic de la parla
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
topic reconocimento del habla en ambientes adversos
reconocimento del habla en presencia de ruido
parametrización de la señal de voz
analisis de la voz
reconocimento robusto del habla
reconocimento automático del habla
procesado del habla
Reconeixement automàtic de la parla
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
description El comportamiento de los sistemas actuales de reconocimiento del habla se degrada rápidamente en presencia de ruido de fondo cuando las etapas de entrenamiento y de test no pueden llevarse a cabo en las mismas condiciones ambientales. El propósito de esta tesis es el estudio y la aplicación al reconocimiento automático del habla en ambientes ruidosos de nuevas representaciones de la señal de voz que sean robustas por sí mismas al ruido y reflejen exactamente las diferencias fonéticas entre espectros de voz. De forma natural, la estrecha relación existente entre el tipo de representación de la señal y la medida de distancia idónea para confrontar los vectores de parámetros ha conducido también al estudio de distancias en esta tesis.<br/><br/>Para la evaluación de las técnicas propuestas se ha utilizado un sistema de reconocimiento de palabras aisladas mediante modelos ocultos de Markov. El hecho de que el sistema sea de palabras aisladas permite prescindir de las implicaciones de los niveles de conocimiento superiores al acústico: sintáctico, semántico, pragmático,... Por otro lado, los modelos ocultos de Markov son los que en estos momentos proporcionan unas mejores prestaciones en todos los sistemas en desarrollo.<br/><br/>La aportación fundamental de esta tesis es la introducción de la predicción lineal de la parte causal de la secuencia de autocorrelación de la señal de voz como una técnica de parametrización robusta del habla en presencia de ruido. Esta técnica está estrechamente relacionada con la representación SMC y con el uso de un sistema sobredeterminado de ecuaciones de Yule-Walker. Su uso en reconocimiento de habla ruidosa es muy interesante debido a su simplicidad, su eficiencia computacional y sus altas tasas de acierto, que superan ampliamente a las técnicas mencionadas y a la clásica predicción lineal sobre la señal en condiciones severas de ruido. <br/><br/>A partir de un estudio comparativo de distintas técnicas en el caso de ruido blanco y ruido real, se han extraído las siguientes conclusiones fundamentales: es preferible el uso de un orden de predicción relativamente alto y ventanas cepstrales crecientes para desenfatizar los coeficientes de orden inferior; las representaciones instantáneas de la señal son menos robustas que a las dinámicas, por lo cual resulta de gran utilidad el uso de parámetros regresivos; el etiquetado múltiple supera ampliamente en prestaciones a la cuantificación vectorial clásica; y, finalmente, la representación cepstral basada en la predicción lineal de la parte causal de la autocorrelación alcanza excelentes resultados en condiciones severas de ruido y es menos sensible a los factores anteriores que la predicción lineal clásica.
publishDate 1993
dc.date.none.fl_str_mv 1993
1993-05-07
2011
2011-04-12
dc.type.none.fl_str_mv doctoral thesis
http://purl.org/coar/resource_type/c_db06
VoR
http://purl.org/coar/version/c_970fb48d4fbd8a85
dc.type.openaire.fl_str_mv info:eu-repo/semantics/doctoralThesis
format doctoralThesis
dc.identifier.none.fl_str_mv https://hdl.handle.net/2117/94222
https://dx.doi.org/10.5821/dissertation-2117-94222
url https://hdl.handle.net/2117/94222
https://dx.doi.org/10.5821/dissertation-2117-94222
dc.language.none.fl_str_mv Español
spa
language_invalid_str_mv Español
language spa
dc.rights.none.fl_str_mv open access
http://purl.org/coar/access_right/c_abf2
dc.rights.openaire.fl_str_mv info:eu-repo/semantics/openAccess
rights_invalid_str_mv open access
http://purl.org/coar/access_right/c_abf2
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
application/pdf
application/pdf
application/pdf
application/pdf
application/pdf
application/pdf
application/pdf
application/pdf
dc.publisher.none.fl_str_mv Universitat Politècnica de Catalunya
publisher.none.fl_str_mv Universitat Politècnica de Catalunya
dc.source.none.fl_str_mv reponame:UPCommons. Portal del coneixement obert de la UPC
instname:Universitat Politècnica de Catalunya (UPC)
instname_str Universitat Politècnica de Catalunya (UPC)
reponame_str UPCommons. Portal del coneixement obert de la UPC
collection UPCommons. Portal del coneixement obert de la UPC
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869418345967648768
spelling Técnicas de procesado y representación de la señal de voz para el reconocimiento del habla en ambientes ruidososHernando Pericás, Francisco Javier|||0000-0002-1730-8154reconocimento del habla en ambientes adversosreconocimento del habla en presencia de ruidoparametrización de la señal de vozanalisis de la vozreconocimento robusto del hablareconocimento automático del hablaprocesado del hablaReconeixement automàtic de la parlaÀrees temàtiques de la UPC::Enginyeria de la telecomunicacióEl comportamiento de los sistemas actuales de reconocimiento del habla se degrada rápidamente en presencia de ruido de fondo cuando las etapas de entrenamiento y de test no pueden llevarse a cabo en las mismas condiciones ambientales. El propósito de esta tesis es el estudio y la aplicación al reconocimiento automático del habla en ambientes ruidosos de nuevas representaciones de la señal de voz que sean robustas por sí mismas al ruido y reflejen exactamente las diferencias fonéticas entre espectros de voz. De forma natural, la estrecha relación existente entre el tipo de representación de la señal y la medida de distancia idónea para confrontar los vectores de parámetros ha conducido también al estudio de distancias en esta tesis.<br/><br/>Para la evaluación de las técnicas propuestas se ha utilizado un sistema de reconocimiento de palabras aisladas mediante modelos ocultos de Markov. El hecho de que el sistema sea de palabras aisladas permite prescindir de las implicaciones de los niveles de conocimiento superiores al acústico: sintáctico, semántico, pragmático,... Por otro lado, los modelos ocultos de Markov son los que en estos momentos proporcionan unas mejores prestaciones en todos los sistemas en desarrollo.<br/><br/>La aportación fundamental de esta tesis es la introducción de la predicción lineal de la parte causal de la secuencia de autocorrelación de la señal de voz como una técnica de parametrización robusta del habla en presencia de ruido. Esta técnica está estrechamente relacionada con la representación SMC y con el uso de un sistema sobredeterminado de ecuaciones de Yule-Walker. Su uso en reconocimiento de habla ruidosa es muy interesante debido a su simplicidad, su eficiencia computacional y sus altas tasas de acierto, que superan ampliamente a las técnicas mencionadas y a la clásica predicción lineal sobre la señal en condiciones severas de ruido. <br/><br/>A partir de un estudio comparativo de distintas técnicas en el caso de ruido blanco y ruido real, se han extraído las siguientes conclusiones fundamentales: es preferible el uso de un orden de predicción relativamente alto y ventanas cepstrales crecientes para desenfatizar los coeficientes de orden inferior; las representaciones instantáneas de la señal son menos robustas que a las dinámicas, por lo cual resulta de gran utilidad el uso de parámetros regresivos; el etiquetado múltiple supera ampliamente en prestaciones a la cuantificación vectorial clásica; y, finalmente, la representación cepstral basada en la predicción lineal de la parte causal de la autocorrelación alcanza excelentes resultados en condiciones severas de ruido y es menos sensible a los factores anteriores que la predicción lineal clásica.The performance of existing speech recognition systems degrades rapidly in the presence of background noise when training and testing cannot be done under the same ambient conditions, even in the case of isolated word recognition with small vocabularies.<br/><br/>In order to develop a speech recognizer that operates robustly and reliably in the presence of noise, a novel parameterization technique called OSALPC (One-Sided Autocorrelation Linear Predictive Coding) is proposed in this Ph.D. dissertation. This technique, closely related with the SMC (Short-Time Modified Coherence) representation and with the use of an overdetermined set of Yule-Walker equations proposed by Cadzow to seek rational models, is essentially an AR modeling of the causal part of the speech autocorrelation, that has the same poles than the speech signal itself. OSALPC performs better than standard LPC (Linear Predictive Coding) in terms of signal-to-noise ratio improvement due to the fact that the spectrum of the autocorrelation sequence, the square of the spectral envelope, strongly enhances the highest power frequency bands and attenuates the noise components lying outside those enhanced bands. Its use in noisy speech recognition is very interesting because of its simplicity, computational efficiency and high recognition accuracy. <br/><br/>The application of this technique to recognize isolated words in a multispeaker task is reported in this Ph.D. dissertation using a speech recognition system based on the HMM (Hidden Markov Models) and VQ (Vector Quantization) approaches in the presence of additive white noise and in real noisy car environment.<br/><br/>The combination of the OSALPC parameterization with several robust techniques is explored: 1) optimization of prediction order and cepstral liftering (particularly, a relatively high prediction order and a monotonically increasing lifter with the quefrency are preferable), 2) cepstral projection distance measure (only in the case of additive white noise), 3) use of energy and dynamic features and 4) independent multilabeling VQ of each feature. Regarding the latest case, a simple multilabeling method has been introduced as a deterministic version of the well known semicontinuous HMM approach using the fuzzy VQ rule, with degree of fuzziness equal to 2, to indicate the closeness of each codeword to the input vector of speech parameters.<br/><br/>Excellent results have been achieved in severe noisy conditions. Concretely, in the case of real noisy car enviroment, from a recognition accuracy of 58.2 % in the baseline recognizer, a recognition rate of 95 % has been reached by aplying those techniques.Universitat Politècnica de CatalunyaNadeu Camprubí, Climent19931993-05-0720112011-04-12doctoral thesishttp://purl.org/coar/resource_type/c_db06VoRhttp://purl.org/coar/version/c_970fb48d4fbd8a85info:eu-repo/semantics/doctoralThesisapplication/pdfapplication/pdfapplication/pdfapplication/pdfapplication/pdfapplication/pdfapplication/pdfapplication/pdfapplication/pdfhttps://hdl.handle.net/2117/94222https://dx.doi.org/10.5821/dissertation-2117-94222reponame:UPCommons. Portal del coneixement obert de la UPCinstname:Universitat Politècnica de Catalunya (UPC)Españolspaopen accesshttp://purl.org/coar/access_right/c_abf2info:eu-repo/semantics/openAccessoai:upcommons.upc.edu:2117/942222026-05-27T15:37:01Z
score 15,301629