Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language

El español es una lengua pluricéntrica con más de 600 millones de hablantes y numerosas variedades regionales, pero la mayoría de las tecnologías del lenguaje lo tratan como una única lengua uniforme. Este trabajo estudia cómo los grandes modelos de lenguaje (LLM) reflejan esa diversidad y cómo debe...

Full description

Bibliographic Details
Author: Grandury González, María Aurora
Format: master thesis
Publication Date:2025
Country:España
Institution:Universidad Nacional de Educación a Distancia
Repository:e-spacio. Repositorio Institucional de la UNED
Language:English
OAI Identifier:oai:e-spacio.uned.es:20.500.14468/31642
Online Access:https://hdl.handle.net/20.500.14468/31642
Access Level:Open access
Keyword:5701 Lingüística aplicada
Evaluación de LLMs
PLN Multilingüe
PLN Cultural
LLM Evaluation
Multilingual LLM
Cultural NLP
id ES_0f445d612b5ea7c6cfab4349cd9b323a
oai_identifier_str oai:e-spacio.uned.es:20.500.14468/31642
network_acronym_str ES
network_name_str España
repository_id_str
dc.title.none.fl_str_mv Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
title Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
spellingShingle Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
Grandury González, María Aurora
5701 Lingüística aplicada
Evaluación de LLMs
PLN Multilingüe
PLN Cultural
LLM Evaluation
Multilingual LLM
Cultural NLP
title_short Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
title_full Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
title_fullStr Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
title_full_unstemmed Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
title_sort Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric Language
dc.creator.none.fl_str_mv Grandury González, María Aurora
author Grandury González, María Aurora
author_facet Grandury González, María Aurora
author_role author
dc.contributor.none.fl_str_mv Bosselut, Antoine
Gonzalo Arroyo, Julio Antonio
e-Spacio UNED
dc.subject.none.fl_str_mv 5701 Lingüística aplicada
Evaluación de LLMs
PLN Multilingüe
PLN Cultural
LLM Evaluation
Multilingual LLM
Cultural NLP
topic 5701 Lingüística aplicada
Evaluación de LLMs
PLN Multilingüe
PLN Cultural
LLM Evaluation
Multilingual LLM
Cultural NLP
description El español es una lengua pluricéntrica con más de 600 millones de hablantes y numerosas variedades regionales, pero la mayoría de las tecnologías del lenguaje lo tratan como una única lengua uniforme. Este trabajo estudia cómo los grandes modelos de lenguaje (LLM) reflejan esa diversidad y cómo debemos tenerla en cuenta al evaluarlos. Primero, repasamos el desarrollo del PLN en español y las iniciativas actuales que buscan servir al mundo hispanohablante. A continuación, analizamos las prácticas de evaluación estándar y mostramos por qué pueden dar una imagen incorrecta del rendimiento cuando se ignoran el contexto cultural y los usos regionales. Partiendo de esfuerzos abiertos de la comunidad, se presenta la primera leaderboard de código abierto para evaluar LLM en las lenguas de España, incluyendo resultados de 50 modelos de código abierto en 66 conjuntos de datos. El análisis muestra brechas tanto en competencia lingüística como en conocimiento cultural. Para mitigarlas, este trabajo presenta un conjunto de datos para evaluar el conocimiento de los LLM sobre las variedades del español y extiende un conjunto de datos multilingüe de conocimiento cultural para cubrir 17 países hispanohablantes. Los resultados muestran que los modelos a menudo favorecen ciertas variedades y tienen dificultades con el léxico y la morfosintaxis, a la vez que motivan la anotación por países de los conjuntos de datos. Por último, este trabajo propone próximos pasos concretos: un marco de recolección de datos impulsado por la comunidad, centrado en la inclusión y la representación justa, una tarea de evaluación compartida para la identificación de variedades del español y un taller para catalizar la creación de recursos diversos. Estas contribuciones ofrecen herramientas prácticas y evidencia para que la evaluación de los LLM en español sea más fiel a su riqueza lingüística y cultural.
publishDate 2025
dc.date.none.fl_str_mv 2025
2025-09-21
2025
2025-09-21
2026
2026-01-29
dc.type.none.fl_str_mv master thesis
http://purl.org/coar/resource_type/c_bdcc
dc.type.openaire.fl_str_mv info:eu-repo/semantics/masterThesis
format masterThesis
dc.identifier.none.fl_str_mv https://hdl.handle.net/20.500.14468/31642
url https://hdl.handle.net/20.500.14468/31642
dc.language.none.fl_str_mv Inglés
eng
language_invalid_str_mv Inglés
language eng
dc.rights.none.fl_str_mv open access
http://purl.org/coar/access_right/c_abf2
info:eu-repo/semantics/openAccess
http://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
rights_invalid_str_mv open access
http://purl.org/coar/access_right/c_abf2
http://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.source.none.fl_str_mv reponame:e-spacio. Repositorio Institucional de la UNED
instname:Universidad Nacional de Educación a Distancia
instname_str Universidad Nacional de Educación a Distancia
reponame_str e-spacio. Repositorio Institucional de la UNED
collection e-spacio. Repositorio Institucional de la UNED
repository.name.fl_str_mv
repository.mail.fl_str_mv
_version_ 1869403444605878272
spelling Multicutural LLM Evaluation: The Case of Spanish as a Pluricentric LanguageGrandury González, María Aurora5701 Lingüística aplicadaEvaluación de LLMsPLN MultilingüePLN CulturalLLM EvaluationMultilingual LLMCultural NLPEl español es una lengua pluricéntrica con más de 600 millones de hablantes y numerosas variedades regionales, pero la mayoría de las tecnologías del lenguaje lo tratan como una única lengua uniforme. Este trabajo estudia cómo los grandes modelos de lenguaje (LLM) reflejan esa diversidad y cómo debemos tenerla en cuenta al evaluarlos. Primero, repasamos el desarrollo del PLN en español y las iniciativas actuales que buscan servir al mundo hispanohablante. A continuación, analizamos las prácticas de evaluación estándar y mostramos por qué pueden dar una imagen incorrecta del rendimiento cuando se ignoran el contexto cultural y los usos regionales. Partiendo de esfuerzos abiertos de la comunidad, se presenta la primera leaderboard de código abierto para evaluar LLM en las lenguas de España, incluyendo resultados de 50 modelos de código abierto en 66 conjuntos de datos. El análisis muestra brechas tanto en competencia lingüística como en conocimiento cultural. Para mitigarlas, este trabajo presenta un conjunto de datos para evaluar el conocimiento de los LLM sobre las variedades del español y extiende un conjunto de datos multilingüe de conocimiento cultural para cubrir 17 países hispanohablantes. Los resultados muestran que los modelos a menudo favorecen ciertas variedades y tienen dificultades con el léxico y la morfosintaxis, a la vez que motivan la anotación por países de los conjuntos de datos. Por último, este trabajo propone próximos pasos concretos: un marco de recolección de datos impulsado por la comunidad, centrado en la inclusión y la representación justa, una tarea de evaluación compartida para la identificación de variedades del español y un taller para catalizar la creación de recursos diversos. Estas contribuciones ofrecen herramientas prácticas y evidencia para que la evaluación de los LLM en español sea más fiel a su riqueza lingüística y cultural.Spanish is a pluricentric language with more than 600 million speakers and many regional varieties, yet most language technologies treat it as a single, uniform language. This thesis studies how large language models (LLMs) reflect this diversity and how we should consider it when evaluating them. First, it surveys the development of Spanish NLP and current initiatives that aim to serve the Spanish-speaking world. It then analyzes standard evaluation practices and shows why they can misrepresent performance when cultural context and regional usage are ignored. Building on open community efforts, the work introduces the first open-source leaderboard for the languages of Spain and reports results for 50 opensource models across 66 datasets. The analysis hints at gaps in both linguistic proficiency and cultural knowledge. To address these gaps, the thesis presents a benchmark for assessing knowledge about Spanish varieties and extends a multilingual cultural knowledge benchmark to cover 17 Spanish-speaking countries. The results show that models often favor certain varieties and struggle with region-specific lexicon and morphosyntax, while motivating the need for country-labeled benchmarks. Finally, the thesis outlines concrete next steps: a community-driven data collection framework focused on inclusivity and fair representation, a shared task for Spanish variety identification, and a workshop to catalyze the creation of diverse resources. Together, these contributions provide practical tools and evidence to make the evaluation of LLMs in Spanish more faithful to its linguistic and cultural richness.Bosselut, AntoineGonzalo Arroyo, Julio Antonioe-Spacio UNED20262026-01-2920252025-09-2120252025-09-21master thesishttp://purl.org/coar/resource_type/c_bdccinfo:eu-repo/semantics/masterThesisapplication/pdfhttps://hdl.handle.net/20.500.14468/31642reponame:e-spacio. Repositorio Institucional de la UNEDinstname:Universidad Nacional de Educación a DistanciaInglésengopen accesshttp://purl.org/coar/access_right/c_abf2info:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-nd/4.0/deed.esoai:e-spacio.uned.es:20.500.14468/316422026-06-06T12:38:31Z
score 15.198674