6 października 2026 r. podczas AI Festa Lora Aroyo, badaczka Google DeepMind, apeluje o ocenianie modeli AI z uwzględnieniem lokalnego języka i kultury. Przekład angielskiego pytania nie jest tym samym co test przygotowany z myślą o kontekście, w którym ma być rozumiany.

Lora Aroyo apeluje o testy AI uwzględniające kulturę

W swoim wystąpieniu Aroyo podkreśla, że płynna wypowiedź w danym języku nie wystarcza do oceny, czy model rozumie lokalne odniesienia i normy. Test może sprawdzać znajomość założeń bliskich jednej grupie, a pomijać konteksty istotne dla innych. Samo przetłumaczenie pytań nie zmienia automatycznie tego, jaką wiedzę one sprawdzają.

Tłumaczenie pytania to nie test lokalnego kontekstu

Przekład zmienia język pytania. Nie gwarantuje jednak, że jego treść, założenia i wymagany kontekst będą trafne dla odbiorców posługujących się językiem docelowym. Aroyo rozróżnia więc tłumaczenie istniejącego testu od tworzenia oceny od początku z myślą o danym języku i kulturze.

To rozróżnienie dotyczy też interpretacji wyników: model może wypaść inaczej, gdy ocenia się osobno pytania wymagające wiedzy kulturowej. Właśnie taki podział zastosowano w Global MMLU.

Co bada Global MMLU

W zrewidowanej wersji badania z 19 lutego 2025 r. autorzy Global MMLU podają, że 28% wszystkich pytań w analizowanym zbiorze MMLU wymagało wiedzy wrażliwej kulturowo. Z kolei 84,9% pytań geograficznych dotyczyło Ameryki Północnej lub Europy. Ta druga wartość odnosi się do pytań geograficznych, nie do całego zbioru.

Global MMLU obejmuje 42 języki i wyróżnia podzbiory pytań kulturowo wrażliwych oraz kulturowo agnostycznych. Autorzy opisują też weryfikację jakości tłumaczeń przez opłacanych specjalistów i osoby z lokalnych społeczności. Gdy pytania kulturowo wrażliwe oceniano osobno, rankingi modeli się zmieniały — wynik zależał więc również od tego, jaką część testu uwzględniano.

Relacjonowane wyniki dla malajskiego i tamilskiego

Aroyo przywołuje wyniki poprawności odpowiedzi: 50% w przypadku pytań angielskich przetłumaczonych na malajski i 40% w przypadku pytań przetłumaczonych na tamilski. To wartości, które podała w odniesieniu do tych przykładów; nie opisują wyników wszystkich modeli ani wszystkich testów w tych językach.

Cztery obszary kontekstu kulturowego

Aroyo wskazuje cztery obszary, które warto uwzględniać przy ocenie modeli: język i normy kulturowe, lokalne religie i mity, historię oraz geopolitykę. To szerszy zakres niż sama poprawność przekładu — pytania muszą także sprawdzać, czy model radzi sobie z kontekstem, do którego się odnoszą.