Em 6 de outubro de 2026, Lora Aroyo, pesquisadora do Google DeepMind, defendeu na AI Festa avaliações de inteligência artificial que levem em conta idiomas e contextos culturais. A ideia central: traduzir uma pergunta não basta para testar se um sistema lida bem com referências e conhecimentos locais.
Traduzir uma pergunta não é avaliar o contexto local
Um benchmark é um conjunto de testes usado para medir o desempenho de sistemas de IA. Quando suas perguntas são traduzidas, o idioma muda; as referências culturais e os pressupostos da avaliação podem continuar ligados ao contexto de origem. Criar questões no próprio idioma e contexto cultural permite examinar essas dimensões de forma mais direta.
A diferença importa porque uma resposta fluente pode não demonstrar familiaridade com normas, referências históricas ou conhecimentos locais. Na palestra, Aroyo defendeu critérios de avaliação atentos à diversidade linguística e cultural.
O que o Global MMLU examinou
O Global MMLU amplia a avaliação para 42 idiomas e identifica subconjuntos de questões culturalmente sensíveis e culturalmente agnósticas. Essa separação permite observar o desempenho dos modelos em perguntas que exigem conhecimento cultural e comparar esse resultado com a avaliação mais ampla.
No conjunto MMLU analisado pelo estudo, 28% de todas as questões exigiam conhecimento culturalmente sensível. Entre as questões de geografia, 84,9% tinham foco na América do Norte ou na Europa. São medidas de grupos diferentes: a primeira considera todas as questões do conjunto estudado; a segunda, apenas as de geografia.
Os autores também relataram que a classificação dos modelos mudou quando a avaliação foi restrita às questões marcadas como culturalmente sensíveis. O benchmark inclui ainda questões culturalmente agnósticas, e seus autores descrevem o uso de anotadores profissionais e comunitários remunerados para verificar a qualidade das traduções.
Os números citados para malaio e tâmil
Aroyo citou índices de acerto de 50% para perguntas em inglês traduzidas para o malaio e de 40% para perguntas em inglês traduzidas para o tâmil. Esses números se referem às perguntas traduzidas mencionadas por ela na palestra.
Quatro áreas do contexto cultural
Aroyo agrupou os possíveis erros culturais em quatro áreas: idioma e normas culturais; religiões e mitos locais; história; e geopolítica. Uma avaliação que considere essas dimensões examina mais do que a capacidade de produzir frases corretas no idioma solicitado.