The Evaluation of Artificial Intelligence as a Prediction Problem

[ES] La inteligencia artificial (IA) es cada vez más importante en nuestra vida cotidiana. Innumerables productos y servicios dependen de algún tipo de cognición artificial para funcionar. Dada su creciente relevancia, la evaluación de los sistemas de IA, es decir, medir lo bien que funcionan o lo i...

Descripción completa

Detalles Bibliográficos
Autor: Schellaert, Wout Willy M.
Tipo de recurso: tesis doctoral
Fecha de publicación:2025
País:España
Institución:Universidad de Barcelona (UB)
Repositorio:RiuNet. Repositorio Institucional de la Universitat Politécnica de Valéncia
Idioma:inglés
OAI Identifier:oai:riunet.upv.es:10251/219670
Acceso en línea:https://riunet.upv.es/handle/10251/219670
Access Level:acceso abierto
Palabra clave:Inteligencia artificial
Evaluación de inteligencia artificial (IA)
Benchmarking
Large Language Models (LLM)
Predictive evaluation
Evaluación basada en usuarios
Metodologías de evaluación
Inteligencia Artificial de propósito general
Predicción del rendimiento
Incertidumbre aleatoria
Granular Evaluation Models
Predictive Validation
User-Based Evaluation
Assessor Models
General Purpose Artificial Intelligence System (GPAIS)
Descripción
Sumario:[ES] La inteligencia artificial (IA) es cada vez más importante en nuestra vida cotidiana. Innumerables productos y servicios dependen de algún tipo de cognición artificial para funcionar. Dada su creciente relevancia, la evaluación de los sistemas de IA, es decir, medir lo bien que funcionan o lo inteligentes que son, no se encuentra, sin embargo, en el estado que nos gustaría. La precisión de las estimaciones de rendimiento se ve afectada por cambios en la distribución y la contaminación del conjunto de pruebas. Dada una nueva instancia de una tarea, la mayoría de los procedimientos de evaluación no proporcionan una estimación granular del rendimiento adaptada a esa instancia. Además, con la llegada de la IA de propósito general (GPAI), el alcance de la evaluación ha aumentado significativamente, lo que conlleva una pesada carga logística y de datos para las metodologías de evaluación comúnmente aplicadas así como una distribución desconocida de tareas sobre las que medir el rendimiento. Motivados por la importancia de la predicción en la filosofía de la ciencia, por la relevancia de la predicción para las prácticas de evaluación en otros campos, como la cognición animal y la psicometría, y por el papel de la predicción como lenguaje central en el propio campo del aprendizaje automático, enmarcamos la evaluación de la inteligencia artificial como un problema de predicción. Desarrollamos un marco formal que conceptualiza los procedimientos de evaluación como algoritmos de aprendizaje que producen modelos de predicción del rendimiento a partir de datos empíricos. Este marco nos ha ayudado a replantearnos la disciplina de la evaluación en el lenguaje de la estadística y el aprendizaje automático, aportando una solución al problema del refinamiento al condicionar los resultados de la evaluación a la variable de entrada, lo que también aborda parcialmente los problemas de cambio de distribución. Para los retos que siguen sin resolverse, analogías con la literatura AI proporciona un camino a seguir mediante el escalado de los datos, centrándose en la generalización, o introduciendo el meta-aprendizaje para la evaluación. Además, se presentan dos estudios empíricos. El primero es una investigación de los «assessor models», una técnica de aprendizaje automático desarrollada recientemente para predecir de forma granular el rendimiento de los sistemas de IA, en la que el escenario experimental se centra en los grandes modelos de lenguaje (LLM, por sus siglas en ingés) y en los factores que influyen en la predictibilidad de su rendimiento. Se constata que es posible realizar una estimación refinada de la evaluación a nivel de instancia, que la estimación de la evaluación fuera de la distribución es sistemáticamente difícil y que el uso de datos multitarea y multisistema puede mejorar la precisión de la evaluación. El segundo estudio investiga de nuevo el rendimiento de los modelos de lenguaje, pero en esta ocasión desde la perspectiva de los usuarios humanos que realizan predicciones de evaluación en su interacción directa con los sistemas de IA. En más de treinta modelos de tres familias diferentes de modelos de lenguaje, observamos que, si bien la dificultad humana se correlaciona bien con el rendimiento de los LLM, la forma escalonada del gráfico dificultad-rendimiento es demasiado pequeña para facilitar una predicción fiable. No existe una región --ni siquiera reduciendo la dificultad-- en la que el rendimiento sea perfecto, y los modelos más nuevos mejoran ganando terreno en las instancias medias y difíciles, más que en las fáciles. Llegamos a la conclusión de que una interpretación predictiva de la evaluación permitiendo que la ciencia y la práctica de la evaluación coevolucionen de forma más natural con los avances de la inteligencia artificial.