Em outubro de 2026, a Moonshot AI conduzia uma análise interna de achados de segurança relacionados ao Kimi e conversava com a Mindgard, que relatou ter contornado salvaguardas do sistema e obtido respostas de alto risco.

A análise da Moonshot AI

A empresa disse que estava em contato com a Mindgard sobre os achados e que recebe contribuições externas como parte de seu esforço para desenvolver uma IA melhor e mais segura.

O que a Mindgard relatou sobre os testes

A Mindgard afirma que identificou vulnerabilidades em 20 de julho de 2026 e enviou detalhes à Moonshot AI em 27 de julho. A empresa publicou sua descrição dos testes em 12 de setembro.

Em segurança de IA, um jailbreak é uma tentativa de contornar as salvaguardas de um modelo para levá-lo a gerar respostas que normalmente bloquearia.

O alcance dos resultados relatados

A Mindgard relatou que conseguiu contornar proteções do Kimi e obter respostas de alto risco. A eficácia dessas respostas na prática não foi demonstrada.