Language variety identification using distributed representations of words and documents

In this work we focus on the use of distributed representations of words and documents using the continuous Skip-gram model. We compare this model with three recent approaches: Information Gain Word-Patterns, TF-IDF graphs and Emotion-labeled Graphs, in addition to several baselines. We evaluate the...

Descripción completa

Detalles Bibliográficos
Autores: Franco Salvador, Marc, Rangel, Francisco, Taulé, Mariona, Martí, M. Antònia, Rosso, Paolo
Tipo de recurso: capítulo de libro
Fecha de publicación:2015
País:España
Institución:Universitat Politècnica de València (UPV)
Repositorio:RiuNet. Repositorio Institucional de la Universitat Politécnica de Valéncia
Idioma:inglés
OAI Identifier:oai:riunet.upv.es:10251/64372
Acceso en línea:https://riunet.upv.es/handle/10251/64372
Access Level:acceso abierto
Palabra clave:Author profiling
Language variety identification
Distributed representations
Information Gain Word-Patterns
TF-IDF graphs
Emotion-labeled Graphs
LENGUAJES Y SISTEMAS INFORMATICOS
id ES_cae0cbcdea72845d8a2f4571cdaefe4a
oai_identifier_str oai:riunet.upv.es:10251/64372
network_acronym_str ES
network_name_str España
repository_id_str
spelling Language variety identification using distributed representations of words and documentsFranco Salvador, MarcRangel, FranciscoTaulé, MarionaMartí, M. AntòniaRosso, PaoloAuthor profilingLanguage variety identificationDistributed representationsInformation Gain Word-PatternsTF-IDF graphsEmotion-labeled GraphsLENGUAJES Y SISTEMAS INFORMATICOSIn this work we focus on the use of distributed representations of words and documents using the continuous Skip-gram model. We compare this model with three recent approaches: Information Gain Word-Patterns, TF-IDF graphs and Emotion-labeled Graphs, in addition to several baselines. We evaluate the models introducing the Hispablogs dataset, a new collection of Spanish blogs from five different countries: Argentina, Chile, Mexico, Peru and Spain. Experimental results show state-of-the-art performance in language variety identification.This research has been carried out within the framework of the European Commis-sion WIQ-EI IRSES (no. 269180) and DIANA - Finding Hidden Knowledge in Texts (TIN2012-38603-C02) projects. The work of the second author was partially funded by Autoritas Consulting SA and by Spanish the Ministry of Economics by means of a ECOPORTUNITY IPT-2012-1220-430000 grant.Springer International PublishingDepartamento de Sistemas Informáticos y ComputaciónEscuela Técnica Superior de Ingeniería InformáticaCentro de Investigación Pattern Recognition and Human Language TechnologyEuropean CommissionMinisterio de Educación y CienciaAutoritas Consulting, S.A.Ministerio de Economía y CompetitividadRepositorio Institucional de la Universitat Politècnica de València Riunet20152015-11-20book parthttp://purl.org/coar/resource_type/c_3248VoRhttp://purl.org/coar/version/c_970fb48d4fbd8a85info:eu-repo/semantics/bookPartapplication/pdfapplication/pdfhttps://riunet.upv.es/handle/10251/64372reponame:RiuNet. Repositorio Institucional de la Universitat Politécnica de Valénciainstname:Universitat Politècnica de València (UPV)InglésengMinisterio de Economía y Competitividad http://dx.doi.org/10.13039/501100003329 TIN2012-38603-C02European Commission https://doi.org/10.13039/501100000780 FP7 269180 Web Information Quality Evaluation InitiativeMinisterio de Economía y Competitividad http://dx.doi.org/10.13039/501100003329 IPT-2012-1220-430000 ECOPORTUNITYopen accesshttp://purl.org/coar/access_right/c_abf2Reserva de todos los derechoshttp://rightsstatements.org/vocab/InC/1.0/info:eu-repo/semantics/openAccessoai:riunet.upv.es:10251/643722026-06-13T07:49:27Z
dc.title.none.fl_str_mv Language variety identification using distributed representations of words and documents
title Language variety identification using distributed representations of words and documents
spellingShingle Language variety identification using distributed representations of words and documents
Franco Salvador, Marc
Author profiling
Language variety identification
Distributed representations
Information Gain Word-Patterns
TF-IDF graphs
Emotion-labeled Graphs
LENGUAJES Y SISTEMAS INFORMATICOS
title_short Language variety identification using distributed representations of words and documents
title_full Language variety identification using distributed representations of words and documents
title_fullStr Language variety identification using distributed representations of words and documents
title_full_unstemmed Language variety identification using distributed representations of words and documents
title_sort Language variety identification using distributed representations of words and documents
dc.creator.none.fl_str_mv Franco Salvador, Marc
Rangel, Francisco
Taulé, Mariona
Martí, M. Antònia
Rosso, Paolo
author Franco Salvador, Marc
author_facet Franco Salvador, Marc
Rangel, Francisco
Taulé, Mariona
Martí, M. Antònia
Rosso, Paolo
author_role author
author2 Rangel, Francisco
Taulé, Mariona
Martí, M. Antònia
Rosso, Paolo
author2_role author
author
author
author
dc.contributor.none.fl_str_mv Departamento de Sistemas Informáticos y Computación
Escuela Técnica Superior de Ingeniería Informática
Centro de Investigación Pattern Recognition and Human Language Technology
European Commission
Ministerio de Educación y Ciencia
Autoritas Consulting, S.A.
Ministerio de Economía y Competitividad
Repositorio Institucional de la Universitat Politècnica de València Riunet
dc.subject.none.fl_str_mv Author profiling
Language variety identification
Distributed representations
Information Gain Word-Patterns
TF-IDF graphs
Emotion-labeled Graphs
LENGUAJES Y SISTEMAS INFORMATICOS
topic Author profiling
Language variety identification
Distributed representations
Information Gain Word-Patterns
TF-IDF graphs
Emotion-labeled Graphs
LENGUAJES Y SISTEMAS INFORMATICOS
description In this work we focus on the use of distributed representations of words and documents using the continuous Skip-gram model. We compare this model with three recent approaches: Information Gain Word-Patterns, TF-IDF graphs and Emotion-labeled Graphs, in addition to several baselines. We evaluate the models introducing the Hispablogs dataset, a new collection of Spanish blogs from five different countries: Argentina, Chile, Mexico, Peru and Spain. Experimental results show state-of-the-art performance in language variety identification.
publishDate 2015
dc.date.none.fl_str_mv 2015
2015-11-20
dc.type.none.fl_str_mv book part
http://purl.org/coar/resource_type/c_3248
VoR
http://purl.org/coar/version/c_970fb48d4fbd8a85
dc.type.openaire.fl_str_mv info:eu-repo/semantics/bookPart
format bookPart
dc.identifier.none.fl_str_mv https://riunet.upv.es/handle/10251/64372
url https://riunet.upv.es/handle/10251/64372
dc.language.none.fl_str_mv Inglés
eng
language_invalid_str_mv Inglés
language eng
dc.relation.none.fl_str_mv Ministerio de Economía y Competitividad http://dx.doi.org/10.13039/501100003329 TIN2012-38603-C02
European Commission https://doi.org/10.13039/501100000780 FP7 269180 Web Information Quality Evaluation Initiative
Ministerio de Economía y Competitividad http://dx.doi.org/10.13039/501100003329 IPT-2012-1220-430000 ECOPORTUNITY
dc.rights.none.fl_str_mv open access
http://purl.org/coar/access_right/c_abf2
Reserva de todos los derechos
http://rightsstatements.org/vocab/InC/1.0/
dc.rights.openaire.fl_str_mv info:eu-repo/semantics/openAccess
rights_invalid_str_mv open access
http://purl.org/coar/access_right/c_abf2
Reserva de todos los derechos
http://rightsstatements.org/vocab/InC/1.0/
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
application/pdf
dc.publisher.none.fl_str_mv Springer International Publishing
publisher.none.fl_str_mv Springer International Publishing
dc.source.none.fl_str_mv reponame:RiuNet. Repositorio Institucional de la Universitat Politécnica de Valéncia
instname:Universitat Politècnica de València (UPV)
instname_str Universitat Politècnica de València (UPV)
reponame_str RiuNet. Repositorio Institucional de la Universitat Politécnica de Valéncia
collection RiuNet. Repositorio Institucional de la Universitat Politécnica de Valéncia
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869419517649616896
score 15,301603