Lora Aroyo, investigadora de Google DeepMind, ha defendido en una ponencia de AI Festa celebrada el 6 de octubre que las pruebas de inteligencia artificial tengan en cuenta el idioma y el contexto cultural. Traducir preguntas del inglés puede cambiar sus palabras; evaluar desde el contexto lingüístico y cultural de destino plantea otra tarea.
Lora Aroyo pide pruebas atentas al contexto cultural
La propuesta de Aroyo es que las evaluaciones reflejen distintas lenguas y características culturales. La diferencia importa porque una respuesta puede sonar fluida y, aun así, pasar por alto normas, referencias o conocimientos propios de un contexto local.
En el uso cotidiano, esto puede afectar a una pregunta sobre historia, a una expresión habitual o a una referencia religiosa. Si una prueba solo traslada preguntas de un idioma a otro, puede conservar los supuestos culturales del conjunto original. Diseñar preguntas desde el contexto de destino permite evaluar también qué conocimientos y convenciones se dan por conocidos.
Qué midió Global MMLU
En la versión revisada el 19 de febrero de 2025 de Global MMLU, sus autores examinaron cuestiones culturales y lingüísticas de MMLU, un conjunto de preguntas empleado para evaluar modelos de IA. El estudio clasificó como culturalmente sensibles el 28% de las preguntas de MMLU que analizó. En las preguntas de geografía, el 84,9% se centraba en Norteamérica o Europa.
Global MMLU abarca 42 idiomas y separa preguntas culturalmente sensibles de otras culturalmente agnósticas. Sus autores también observaron que cambiaba el orden de los modelos cuando evaluaban por separado las preguntas culturalmente sensibles. Así, la puntuación de un examen general no necesariamente refleja el mismo rendimiento en preguntas que requieren conocimientos culturales específicos.
Para comprobar la calidad de las traducciones, el proyecto recurrió a personas anotadoras profesionales y comunitarias remuneradas. La revisión de las traducciones y la clasificación cultural de las preguntas permiten observar aspectos distintos de una evaluación: si el texto está bien traducido y qué conocimientos culturales exige responderlo.
Las cifras citadas para malayo y tamil
Aroyo mencionó cifras de acierto del 50% para preguntas originalmente en inglés traducidas al malayo y del 40% para las traducidas al tamil. Son porcentajes que atribuyó a esos casos concretos de traducción.
Cuatro ámbitos del contexto cultural
Aroyo agrupó los posibles errores culturales en cuatro áreas: el idioma y las normas culturales; las religiones y los mitos locales; la historia; y la geopolítica. Una evaluación que abarque esos ámbitos puede examinar más que la corrección lingüística de una respuesta: también puede poner a prueba si el modelo maneja referencias y convenciones propias del contexto en que se usa.