A ottobre 2026, Moonshot AI stava conducendo una revisione interna dei risultati riferiti da Mindgard sui test di sicurezza di Kimi e discuteva con l’azienda. Mindgard ha descritto un jailbreak, cioè un tentativo di aggirare le protezioni di un modello attraverso input manipolati, che avrebbe portato alla generazione di risposte ad alto rischio.
Moonshot AI esamina i risultati riferiti
Moonshot AI ha dichiarato di accogliere i contributi esterni e di essere in discussione con Mindgard sui risultati. La revisione interna era in corso a ottobre 2026.
Che cosa ha riferito Mindgard sui test di Kimi
Mindgard ha dichiarato di aver individuato il problema il 20 luglio 2026 e di aver inviato a Moonshot AI i dettagli dei risultati il 27 luglio. Nel resoconto dei propri test, l’azienda ha riferito di aver aggirato le protezioni di Kimi e di aver ottenuto risposte su temi ad alto rischio.
Che cosa indicano i risultati
L’efficacia pratica delle risposte generate non è stata dimostrata. Il risultato riferito riguarda quindi la produzione di quei contenuti durante il test; la loro effettiva utilizzabilità è una questione distinta.