Introducing linguistic knowledge into statistical machine translation.

Aquesta tesi està dedicada a l'estudi de la utilització de informació morfosintàctica en el marc dels sistemes de traducció estocàstica, amb l'objectiu de millorar-ne la qualitat a través de la incorporació de informació lingüística més enllà del nivell simbòlic superficial de les paraules...

Descripción completa

Detalles Bibliográficos
Autor: Gispert Ramis, Adrià
Tipo de recurso: tesis doctoral
Fecha de publicación:2007
País:España
Institución:Universitat Politècnica de Catalunya (UPC)
Repositorio:UPCommons. Portal del coneixement obert de la UPC
Idioma:inglés
OAI Identifier:oai:upcommons.upc.edu:2117/94213
Acceso en línea:https://hdl.handle.net/2117/94213
https://dx.doi.org/10.5821/dissertation-2117-94213
Access Level:acceso abierto
Palabra clave:morfologia
modelat del llenguatge
N-grames
traduccio automatica estadistica
informacio morfosintactica
Traducció automàtica
Percepció del llenguatge
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
id ES_3daf3da2872ee6fa9a00cedac5ea60f3
oai_identifier_str oai:upcommons.upc.edu:2117/94213
network_acronym_str ES
network_name_str España
repository_id_str
dc.title.none.fl_str_mv Introducing linguistic knowledge into statistical machine translation.
title Introducing linguistic knowledge into statistical machine translation.
spellingShingle Introducing linguistic knowledge into statistical machine translation.
Gispert Ramis, Adrià
morfologia
modelat del llenguatge
N-grames
traduccio automatica estadistica
informacio morfosintactica
Traducció automàtica
Percepció del llenguatge
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
title_short Introducing linguistic knowledge into statistical machine translation.
title_full Introducing linguistic knowledge into statistical machine translation.
title_fullStr Introducing linguistic knowledge into statistical machine translation.
title_full_unstemmed Introducing linguistic knowledge into statistical machine translation.
title_sort Introducing linguistic knowledge into statistical machine translation.
dc.creator.none.fl_str_mv Gispert Ramis, Adrià
author Gispert Ramis, Adrià
author_facet Gispert Ramis, Adrià
author_role author
dc.contributor.none.fl_str_mv Mariño Acebal, José Bernardo
dc.subject.none.fl_str_mv morfologia
modelat del llenguatge
N-grames
traduccio automatica estadistica
informacio morfosintactica
Traducció automàtica
Percepció del llenguatge
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
topic morfologia
modelat del llenguatge
N-grames
traduccio automatica estadistica
informacio morfosintactica
Traducció automàtica
Percepció del llenguatge
Àrees temàtiques de la UPC::Enginyeria de la telecomunicació
description Aquesta tesi està dedicada a l'estudi de la utilització de informació morfosintàctica en el marc dels sistemes de traducció estocàstica, amb l'objectiu de millorar-ne la qualitat a través de la incorporació de informació lingüística més enllà del nivell simbòlic superficial de les paraules.<br/><br/><br/><br/>El sistema de traducció estocàstica utilitzat en aquest treball segueix un enfocament basat en tuples, unitats bilingües que permeten estimar un model de traducció de probabilitat conjunta per mitjà de la combinació, dins un entorn log-linial, de cadenes d'n-grames i funcions característiques addicionals. Es presenta un estudi detallat d'aquesta aproximació, que inclou la seva transformació des d'una implementació d'X-grames en autòmats d'estats finits, més orientada a la traducció de veu, cap a l'actual solució d'n-grames orientada a la traducció de text de gran vocabulari. La tesi estudia també les fases d'entrenament i decodificació, així com el rendiment per a diferents tasques (variant el tamany dels corpora o el parell d'idiomes) i els principals problemes reflectits en les anàlisis d'error.<br/><br/><br/><br/>La tesis també investiga la incorporació de informació lingüística específicament en aliniament per paraules. Es proposa l'extensió mitjançant classificació de formes verbals d'un algorisme d'aliniament paraula a paraula basat en co-ocurrències, amb resultats positius. Així mateix, s'avalua de forma empírica l'impacte en qualitat d'aliniament i de traducció que s'obté mitjançant l'etiquetatge morfològic, la lematització, la classificació de formes verbals i el truncament o stemming del text paral·lel.<br/><br/><br/><br/>Pel que fa al model de traducció, es proposa un model de tractament de les formes verbals per mitjà d'un model de instanciació addicional, i es realitzen experiments en la direcció d'anglès a castellà. La tesi també introdueix un model de llenguatge d'etiquetes morfològiques del destí per tal d'abordar problemes de concordança. Finalment, s'estudia l'impacte de la derivació morfològica en la formulació de la traducció estocàstica mitjançant n-grames, avaluant empíricament el possible guany derivat d'estratègies de reducció morfològica.
publishDate 2007
dc.date.none.fl_str_mv 2007
2007-01-26
2011
2011-04-12
dc.type.none.fl_str_mv doctoral thesis
http://purl.org/coar/resource_type/c_db06
VoR
http://purl.org/coar/version/c_970fb48d4fbd8a85
dc.type.openaire.fl_str_mv info:eu-repo/semantics/doctoralThesis
format doctoralThesis
dc.identifier.none.fl_str_mv https://hdl.handle.net/2117/94213
https://dx.doi.org/10.5821/dissertation-2117-94213
url https://hdl.handle.net/2117/94213
https://dx.doi.org/10.5821/dissertation-2117-94213
dc.language.none.fl_str_mv Inglés
eng
language_invalid_str_mv Inglés
language eng
dc.rights.none.fl_str_mv open access
http://purl.org/coar/access_right/c_abf2
dc.rights.openaire.fl_str_mv info:eu-repo/semantics/openAccess
rights_invalid_str_mv open access
http://purl.org/coar/access_right/c_abf2
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Universitat Politècnica de Catalunya
publisher.none.fl_str_mv Universitat Politècnica de Catalunya
dc.source.none.fl_str_mv reponame:UPCommons. Portal del coneixement obert de la UPC
instname:Universitat Politècnica de Catalunya (UPC)
instname_str Universitat Politècnica de Catalunya (UPC)
reponame_str UPCommons. Portal del coneixement obert de la UPC
collection UPCommons. Portal del coneixement obert de la UPC
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869406463035703296
spelling Introducing linguistic knowledge into statistical machine translation.Gispert Ramis, Adriàmorfologiamodelat del llenguatgeN-gramestraduccio automatica estadisticainformacio morfosintacticaTraducció automàticaPercepció del llenguatgeÀrees temàtiques de la UPC::Enginyeria de la telecomunicacióAquesta tesi està dedicada a l'estudi de la utilització de informació morfosintàctica en el marc dels sistemes de traducció estocàstica, amb l'objectiu de millorar-ne la qualitat a través de la incorporació de informació lingüística més enllà del nivell simbòlic superficial de les paraules.<br/><br/><br/><br/>El sistema de traducció estocàstica utilitzat en aquest treball segueix un enfocament basat en tuples, unitats bilingües que permeten estimar un model de traducció de probabilitat conjunta per mitjà de la combinació, dins un entorn log-linial, de cadenes d'n-grames i funcions característiques addicionals. Es presenta un estudi detallat d'aquesta aproximació, que inclou la seva transformació des d'una implementació d'X-grames en autòmats d'estats finits, més orientada a la traducció de veu, cap a l'actual solució d'n-grames orientada a la traducció de text de gran vocabulari. La tesi estudia també les fases d'entrenament i decodificació, així com el rendiment per a diferents tasques (variant el tamany dels corpora o el parell d'idiomes) i els principals problemes reflectits en les anàlisis d'error.<br/><br/><br/><br/>La tesis també investiga la incorporació de informació lingüística específicament en aliniament per paraules. Es proposa l'extensió mitjançant classificació de formes verbals d'un algorisme d'aliniament paraula a paraula basat en co-ocurrències, amb resultats positius. Així mateix, s'avalua de forma empírica l'impacte en qualitat d'aliniament i de traducció que s'obté mitjançant l'etiquetatge morfològic, la lematització, la classificació de formes verbals i el truncament o stemming del text paral·lel.<br/><br/><br/><br/>Pel que fa al model de traducció, es proposa un model de tractament de les formes verbals per mitjà d'un model de instanciació addicional, i es realitzen experiments en la direcció d'anglès a castellà. La tesi també introdueix un model de llenguatge d'etiquetes morfològiques del destí per tal d'abordar problemes de concordança. Finalment, s'estudia l'impacte de la derivació morfològica en la formulació de la traducció estocàstica mitjançant n-grames, avaluant empíricament el possible guany derivat d'estratègies de reducció morfològica.This Ph.D. thesis dissertation addresses the use of morphosyntactic information in order to improve the performance of Statistical Machine Translation (SMT) systems, providing them with additional linguistic information beyond the surface level of words from parallel corpora.<br/>The statistical machine translation system in this work here follows a tuple-based approach, modelling joint-probability translation models via log-linear combination of bilingual n-grams with additional feature functions. A detailed study of the approach is conducted. This includes its initial development from a speech-oriented Finite-State Transducer architecture implementing X-grams towards a large-vocabulary text-oriented n-grams implementation, training and decoding particularities, portability across language pairs and tasks, and main difficulties as revealed in error analyses.<br/><br/>The use of linguistic knowledge to improve word alignment quality is also studied. A cooccurrence-based one-to-one word alignment algorithm is extended with verb form classification with successful results. Additionally, we evaluate the impact in word alignment and translation quality of Part-Of-Speech, base form, verb form classification and stemming on state-of-art word alignment tools.<br/><br/><br/><br/>Furthermore, the thesis proposes a translation model tackling verb form generation through an additional verb instance model, reporting experiments in English-to-Spanish tasks. Disagreement is addressed via incorporating a target Part-Of-Speech language model. Finally, we study the impact of morphology derivation on Ngram-based SMT formulation, empirically evaluating the quality gain that is to be gained via morphology reduction.Universitat Politècnica de CatalunyaMariño Acebal, José Bernardo20072007-01-2620112011-04-12doctoral thesishttp://purl.org/coar/resource_type/c_db06VoRhttp://purl.org/coar/version/c_970fb48d4fbd8a85info:eu-repo/semantics/doctoralThesisapplication/pdfhttps://hdl.handle.net/2117/94213https://dx.doi.org/10.5821/dissertation-2117-94213reponame:UPCommons. Portal del coneixement obert de la UPCinstname:Universitat Politècnica de Catalunya (UPC)Inglésengopen accesshttp://purl.org/coar/access_right/c_abf2info:eu-repo/semantics/openAccessoai:upcommons.upc.edu:2117/942132026-05-27T15:37:01Z
score 15,301629