Lora Aroyo, onderzoekswetenschapper bij Google DeepMind, pleitte tijdens haar keynote op AI Festa op 6 oktober 2026 voor AI-evaluaties die rekening houden met lokale talen en culturele context. Een Engelse testvraag vertalen is volgens haar niet hetzelfde als evaluatiemateriaal ontwikkelen vanuit de doeltaal en de cultuur waarin die taal wordt gebruikt.

Aroyo pleit voor AI-tests met oog voor cultuur

Een benchmark is een vaste verzameling tests waarmee onderzoekers AI-systemen beoordelen. Als zo’n test vooral kennis en aannames uit één culturele context bevat, kan een hoge score meer zeggen over vertrouwdheid met die context dan over hoe goed een model met andere perspectieven omgaat.

Aroyo noemde vier gebieden die bij culturele evaluatie aandacht vragen: taal en culturele normen, lokale religies en mythen, geschiedenis en geopolitiek. Daarmee gaat de vraag verder dan of een model een zin grammaticaal correct kan vertalen. Ook de betekenis van woorden, gebruiken en lokale kennis speelt mee.

Een vraag vertalen is nog geen lokale evaluatie

Vertalen verandert de taal van een vraag, maar maakt de inhoud niet automatisch representatief voor de context van de nieuwe taal. Een evaluatie die in de doeltaal wordt opgebouwd, kan vragen en kennis toetsen die aansluiten bij die taal en haar culturele omgeving. Juist daarom zijn taaldekking en culturele dekking verschillende eigenschappen van een benchmark.

Wat Global MMLU onderzocht

De Global MMLU-studie onderzocht culturele en taalkundige vertekening in MMLU, een benchmark voor taalmodellen. De auteurs rapporteerden dat 28% van alle vragen in de onderzochte MMLU-set kennis vereiste die zij als cultureel gevoelig aanduidden. Van de geografische vragen ging 84,9% over Noord-Amerika of Europa.

Global MMLU bestrijkt 42 talen en bevat aparte deelverzamelingen met cultureel gevoelige en cultureel agnostische vragen. De auteurs rapporteerden ook dat de rangorde van modellen veranderde wanneer de cultureel gevoelige vragen afzonderlijk werden beoordeeld in plaats van de volledige test te gebruiken. De uitslag hangt dus mede af van welke vragen een benchmark bevat.

De gemelde cijfers voor Maleis en Tamil

Aroyo noemde tijdens haar keynote een nauwkeurigheid van 50% voor Engelse vragen die naar het Maleis waren vertaald en 40% voor Engelse vragen die naar het Tamil waren vertaald. Die cijfers hadden betrekking op de vertaalde vragen waarover zij sprak; ze beschrijven geen algemene prestatiemeting voor alle AI-modellen of alle tests in die talen.