Il 6 ottobre 2026, ad AI Festa, Lora Aroyo, ricercatrice di Google DeepMind, ha chiesto test di intelligenza artificiale capaci di tenere conto delle lingue e dei contesti culturali. Il punto è pratico: tradurre una domanda in un’altra lingua non basta, da solo, a verificare se un sistema coglie conoscenze e riferimenti locali.
Lora Aroyo chiede test di IA attenti alle culture
Un benchmark è una prova standardizzata usata per confrontare le prestazioni dei modelli. Nel suo intervento ad AI Festa, Aroyo ha sostenuto che la valutazione dovrebbe riflettere la varietà delle lingue e delle culture, invece di limitarsi a trasferire in traduzione domande concepite in inglese.
Una domanda tradotta cambia lingua; una prova pensata nel contesto della lingua di destinazione può anche considerare riferimenti e norme locali. Sono aspetti distinti, e confonderli rischia di far apparire completa una valutazione che misura soltanto una parte delle competenze.
Tradurre una domanda non significa testare il contesto locale
La differenza non riguarda soltanto la scorrevolezza della traduzione. Una domanda può essere grammaticalmente corretta e richiedere comunque conoscenze legate a una cultura specifica. Per questo una valutazione culturalmente sensibile separa le domande che dipendono da quel contesto da quelle che non lo richiedono.
Global MMLU applica questa distinzione al benchmark MMLU: offre sottoinsiemi di domande classificati come culturalmente sensibili e culturalmente agnostici. Gli autori riferiscono inoltre che annotatori professionisti e membri delle comunità, retribuiti per il lavoro svolto, hanno verificato la qualità delle traduzioni.
Che cosa misura Global MMLU
Lo studio Global MMLU, presentato nel dicembre 2024 e aggiornato nel febbraio 2025, riporta che il 28% di tutte le domande del set MMLU esaminato richiede conoscenze culturalmente sensibili. La percentuale riguarda l’intero set di domande analizzato, non tutti i benchmark di IA.
Per le sole domande di geografia, lo studio rileva che l’84,9% riguarda il Nord America o l’Europa. Il dato ha quindi come denominatore le domande geografiche, non l’intero benchmark né tutte le conoscenze culturali.
Global MMLU copre 42 lingue. Quando gli autori hanno valutato separatamente le domande culturalmente sensibili, la graduatoria dei modelli è cambiata rispetto alla valutazione sull’intero set: il risultato mostra perché una media complessiva può nascondere differenze tra tipi di domanda.
Le cifre riportate per malese e tamil
Aroyo ha citato un’accuratezza delle risposte del 50% per domande originariamente in inglese tradotte in malese e del 40% per quelle tradotte in tamil. Sono valori riferiti a quegli esempi, non misure generali delle prestazioni dei modelli nelle due lingue.
Quattro ambiti del contesto culturale
Aroyo ha indicato quattro aree che le valutazioni dovrebbero considerare: lingua e norme culturali; religioni e miti locali; storia; geopolitica. Insieme, questi ambiti chiariscono perché un test multilingue non coincide automaticamente con un test capace di valutare il contesto culturale.