Em outubro de 2026, a Moonshot AI conduzia uma análise interna de achados de segurança relacionados ao Kimi e conversava com a Mindgard, que relatou ter contornado salvaguardas do sistema e obtido respostas de alto risco.
A análise da Moonshot AI
A empresa disse que estava em contato com a Mindgard sobre os achados e que recebe contribuições externas como parte de seu esforço para desenvolver uma IA melhor e mais segura.
O que a Mindgard relatou sobre os testes
A Mindgard afirma que identificou vulnerabilidades em 20 de julho de 2026 e enviou detalhes à Moonshot AI em 27 de julho. A empresa publicou sua descrição dos testes em 12 de setembro.
Em segurança de IA, um jailbreak é uma tentativa de contornar as salvaguardas de um modelo para levá-lo a gerar respostas que normalmente bloquearia.
O alcance dos resultados relatados
A Mindgard relatou que conseguiu contornar proteções do Kimi e obter respostas de alto risco. A eficácia dessas respostas na prática não foi demonstrada.