Le 6 octobre 2026, Lora Aroyo, chercheuse chez Google DeepMind, plaide à AI Festa pour une évaluation de l’IA qui tienne compte des langues et des contextes culturels. Une question traduite ne teste pas nécessairement les mêmes références que des questions conçues dans la langue et le contexte visés. AI Festa avait programmé sa keynote à cette date.
Traduire une question ne suffit pas à tester le contexte local
Traduire un questionnaire change sa langue, mais ne remplace pas la conception de questions à partir du contexte culturel visé. Une traduction peut conserver les références de départ ou créer des décalages dans la langue cible. Pour évaluer aussi les connaissances et les usages locaux, il faut examiner le contenu des questions, pas seulement leur formulation linguistique.
L’étude Global MMLU traite séparément les connaissances culturelles et les artefacts de traduction. Elle distingue, dans son jeu de questions, des sous-ensembles dits culturellement sensibles et culturellement agnostiques — autrement dit, qui reposent plus ou moins sur des connaissances culturelles particulières.
Ce que mesure Global MMLU
Dans la version de Global MMLU révisée le 19 février 2025, les auteurs indiquent que 28 % de toutes les questions du jeu MMLU étudié nécessitent des connaissances culturellement sensibles. Ils rapportent aussi que 84,9 % des questions de géographie portent sur l’Amérique du Nord ou l’Europe. Ce second chiffre concerne les questions de géographie, et non l’ensemble du jeu.
Global MMLU étend l’évaluation à 42 langues et permet d’examiner séparément les questions culturellement sensibles et culturellement agnostiques. Les auteurs indiquent que des annotateurs professionnels et communautaires rémunérés ont vérifié la qualité des traductions. Ils rapportent également que le classement des modèles change lorsque l’évaluation porte sur les questions culturellement sensibles plutôt que sur le jeu complet.
Consulter l’étude Global MMLU.
Les chiffres rapportés pour le malais et le tamoul
Lors de sa keynote, Aroyo cite 50 % de réponses correctes pour des questions anglaises traduites en malais et 40 % pour des questions anglaises traduites en tamoul. Elle présente ces résultats comme des exemples des écarts qui peuvent apparaître entre langues ; ils ne décrivent pas, à eux seuls, les performances générales des modèles en malais ou en tamoul.
Quatre domaines du contexte culturel
Aroyo répartit les erreurs liées au contexte en quatre domaines : la langue et les normes culturelles, les religions et mythes locaux, l’histoire et la géopolitique.