Lora Aroyo, Forschungswissenschaftlerin bei Google DeepMind, sprach sich bei ihrer Keynote auf der AI Festa am 6. Oktober 2026 für KI-Tests aus, die neben der Sprache auch kulturelle Zusammenhänge berücksichtigen. Eine englische Testfrage einfach zu übersetzen sei nicht dasselbe, wie eine Prüfung im Zielsprachen- und Kulturkontext zu entwickeln.

Ein Benchmark ist ein festgelegter Testsatz, mit dem sich die Leistungen von KI-Modellen vergleichen lassen. Wer nur die Sprache eines bestehenden Tests ändert, prüft damit noch nicht automatisch, ob die Fragen und ihre Voraussetzungen zum kulturellen Umfeld der Zielsprache passen.

Übersetzung ist noch kein kultureller Test

Eine Übersetzung überträgt eine Frage in eine andere Sprache. Für eine kulturell fundierte Bewertung müssen auch die Bezüge und Annahmen der Fragen zum jeweiligen Kontext passen. Die Studie Global MMLU behandelt kulturelle Wissensanforderungen und mögliche Übersetzungsartefakte als unterschiedliche Aspekte mehrsprachiger KI-Bewertung.

Das ist für den Vergleich von Modellen wichtig: Ein flüssig formulierter Text sagt für sich genommen wenig darüber aus, ob ein Modell lokale Begriffe, Normen oder historische Zusammenhänge angemessen erfasst. Kulturelle Bezüge gezielt zu prüfen, macht diese Dimension der Leistung separat untersuchbar.

Was Global MMLU untersucht

Die Studie berichtet, dass 28 Prozent aller Fragen im untersuchten MMLU-Datensatz kulturell sensibles Wissen erfordern. Bei den geografischen Fragen liegt der Schwerpunkt laut den Ergebnissen besonders auf Nordamerika und Europa: 84,9 Prozent dieser Fragen beziehen sich auf eine der beiden Regionen.

Global MMLU deckt 42 Sprachen ab und teilt Fragen in kulturell sensible und kulturell agnostische Teilmengen ein. So lassen sich Ergebnisse für Fragen mit kulturellem Bezug getrennt betrachten. Die Autoren berichten außerdem, dass sich die Rangfolge der Modelle änderte, wenn nur die als kulturell sensibel gekennzeichneten Fragen ausgewertet wurden.

Die erste Fassung der Studie erschien am 4. Dezember 2024; die hier zitierte Fassung wurde am 19. Februar 2025 überarbeitet. Für die Prüfung der Übersetzungsqualität setzten die Autoren nach eigenen Angaben bezahlte Fachleute und Community-Annotierende ein.

Von Aroyo genannte Werte für Malaiisch und Tamil

Aroyo nannte eine Antwortgenauigkeit von 50 Prozent für englische Fragen, die ins Malaiische übersetzt worden waren, und 40 Prozent für ins Tamilische übersetzte englische Fragen. Sie führte die Werte bei ihrer Keynote als Beispiel für die Bewertung übersetzter Fragen an.

Vier Bereiche kultureller Fehler

Aroyo ordnete kulturelle Fehler vier Bereichen zu:

  • Sprache und kulturelle Normen
  • lokale Religionen und Mythen
  • Geschichte
  • Geopolitik