Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi

El objetivo del presente Proyecto Fin de Máster es presentar algunas técnicas para reconocimiento de hablante empleando redes neuronales y deep learning. Como referencia se emplean vectors y un modelo universal basado en mezclas gaussianas (GMM-UBM) como método del estado del arte. El proceso de ent...

Descripción completa

Detalles Bibliográficos
Autor: Jiménez Andreu, Rubén
Tipo de recurso: tesis de maestría
Fecha de publicación:2017
País:España
Institución:Universidad Politécnica de Cartagena(UPCT)
Repositorio:Repositorio Digital UPCT
OAI Identifier:oai:repositorio.upct.es:10317/6089
Acceso en línea:http://hdl.handle.net/10317/6089
Access Level:acceso abierto
Palabra clave:Inteligencia artificial
Artificial intelligence
Kaldi (software)
Matemática Aplicada
1203.04 Inteligencia Artificial
id ES_0e73fd93d55da17c25ae01ee754e03e0
oai_identifier_str oai:repositorio.upct.es:10317/6089
network_acronym_str ES
network_name_str España
repository_id_str
spelling Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre KaldiSpeaker automatic recognition through automatic learning by means of neuronal networks and using the free software KaldiJiménez Andreu, RubénInteligencia artificialArtificial intelligenceKaldi (software)Matemática Aplicada1203.04 Inteligencia ArtificialEl objetivo del presente Proyecto Fin de Máster es presentar algunas técnicas para reconocimiento de hablante empleando redes neuronales y deep learning. Como referencia se emplean vectors y un modelo universal basado en mezclas gaussianas (GMM-UBM) como método del estado del arte. El proceso de entrenamiento es realizado con la base de datos de audiolibros LibriSpeech. Esta base también se emplea para evaluar los modelos, junto con la de Speakers in the Wild, con locuciones más próximos a situaciones reales. El software opensource Kaldi ser a la herramienta empleada para crear los modelos, junto con Python y Octave. Este proyecto se ha realizado en colaboración con la compañía de biometría de voz Biometric Vox S.L., localizada en Espinardo, Murcia. Esta empresa ofrece soluciones de reconocimiento por voz (CheckVox) y de rma biométrica de voz (FirVox). Además, ha contado con una beca de colaboración del Departamento Matemáticas Aplicada Estadística de Universidad Politécnica de Cartagena durante el curso 2015/2016. Se encuentra estructurado en ocho capí tulos. En el capítulo 1 se hace una breve introducci on a la biometría de voz, sus ventajas e inconvenientes. En el capitulo 2 se explica en qu e consiste el m etodo de los vectores y los pasos a seguir. Una descripci on general de la redes neuronales para luego explicar algunos de sus usos en reconocimiento de hablante se har a en el capítulo 3. En el capítulo 4 se expondrán las distintas formas de analizar los resultados de la biometría y en el 5 se describen detalladamente las bases de datos y el software. Para terminar, en los capíulos 6 y 7 se presentan los experimentos realizados y sus resultados, respectivamente. Por ultimo, en el capítulo 8 se exponen las conclusiones extraídas y las posibles nuevas líneas de investigación a seguir en futuros trabajos.Escuela Técnica Superior de Ingeniería IndustrialUniversidad Politécnica de CartagenaPeriago Esparza, FranciscoFont Ruiz, Roberto JavierMatemática Aplicada y Estadística201720172017info:eu-repo/semantics/masterThesisapplication/pdfapplication/pdfhttp://hdl.handle.net/10317/6089reponame:Repositorio Digital UPCTinstname:Universidad Politécnica de Cartagena(UPCT)EspañolEspañolAtribución-NoComercial-SinDerivadas 3.0 Españahttp://creativecommons.org/licenses/by-nc-nd/3.0/es/info:eu-repo/semantics/openAccessoai:repositorio.upct.es:10317/60892026-05-15T06:39:02Z
dc.title.none.fl_str_mv Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
Speaker automatic recognition through automatic learning by means of neuronal networks and using the free software Kaldi
title Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
spellingShingle Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
Jiménez Andreu, Rubén
Inteligencia artificial
Artificial intelligence
Kaldi (software)
Matemática Aplicada
1203.04 Inteligencia Artificial
title_short Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
title_full Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
title_fullStr Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
title_full_unstemmed Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
title_sort Reconocimiento automático de locutor a través de aprendizaje automático mediante redes neuronales empleando el paquete de software libre Kaldi
dc.creator.none.fl_str_mv Jiménez Andreu, Rubén
author Jiménez Andreu, Rubén
author_facet Jiménez Andreu, Rubén
author_role author
dc.contributor.none.fl_str_mv Periago Esparza, Francisco
Font Ruiz, Roberto Javier
Matemática Aplicada y Estadística
dc.subject.none.fl_str_mv Inteligencia artificial
Artificial intelligence
Kaldi (software)
Matemática Aplicada
1203.04 Inteligencia Artificial
topic Inteligencia artificial
Artificial intelligence
Kaldi (software)
Matemática Aplicada
1203.04 Inteligencia Artificial
description El objetivo del presente Proyecto Fin de Máster es presentar algunas técnicas para reconocimiento de hablante empleando redes neuronales y deep learning. Como referencia se emplean vectors y un modelo universal basado en mezclas gaussianas (GMM-UBM) como método del estado del arte. El proceso de entrenamiento es realizado con la base de datos de audiolibros LibriSpeech. Esta base también se emplea para evaluar los modelos, junto con la de Speakers in the Wild, con locuciones más próximos a situaciones reales. El software opensource Kaldi ser a la herramienta empleada para crear los modelos, junto con Python y Octave. Este proyecto se ha realizado en colaboración con la compañía de biometría de voz Biometric Vox S.L., localizada en Espinardo, Murcia. Esta empresa ofrece soluciones de reconocimiento por voz (CheckVox) y de rma biométrica de voz (FirVox). Además, ha contado con una beca de colaboración del Departamento Matemáticas Aplicada Estadística de Universidad Politécnica de Cartagena durante el curso 2015/2016. Se encuentra estructurado en ocho capí tulos. En el capítulo 1 se hace una breve introducci on a la biometría de voz, sus ventajas e inconvenientes. En el capitulo 2 se explica en qu e consiste el m etodo de los vectores y los pasos a seguir. Una descripci on general de la redes neuronales para luego explicar algunos de sus usos en reconocimiento de hablante se har a en el capítulo 3. En el capítulo 4 se expondrán las distintas formas de analizar los resultados de la biometría y en el 5 se describen detalladamente las bases de datos y el software. Para terminar, en los capíulos 6 y 7 se presentan los experimentos realizados y sus resultados, respectivamente. Por ultimo, en el capítulo 8 se exponen las conclusiones extraídas y las posibles nuevas líneas de investigación a seguir en futuros trabajos.
publishDate 2017
dc.date.none.fl_str_mv 2017
2017
2017
dc.type.none.fl_str_mv info:eu-repo/semantics/masterThesis
format masterThesis
dc.identifier.none.fl_str_mv http://hdl.handle.net/10317/6089
url http://hdl.handle.net/10317/6089
dc.language.none.fl_str_mv Español
Español
language_invalid_str_mv Español
dc.rights.none.fl_str_mv Atribución-NoComercial-SinDerivadas 3.0 España
http://creativecommons.org/licenses/by-nc-nd/3.0/es/
info:eu-repo/semantics/openAccess
rights_invalid_str_mv Atribución-NoComercial-SinDerivadas 3.0 España
http://creativecommons.org/licenses/by-nc-nd/3.0/es/
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
application/pdf
dc.source.none.fl_str_mv reponame:Repositorio Digital UPCT
instname:Universidad Politécnica de Cartagena(UPCT)
instname_str Universidad Politécnica de Cartagena(UPCT)
reponame_str Repositorio Digital UPCT
collection Repositorio Digital UPCT
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869403397953683456
score 15,301603