W październiku 2026 r. Moonshot AI miało prowadzić wewnętrzny przegląd ustaleń Mindgard dotyczących zabezpieczeń Kimi i rozmawiać z firmą o wynikach testów. Mindgard twierdzi, że udało mu się ominąć zabezpieczenia modelu i uzyskać odpowiedzi wysokiego ryzyka.

Moonshot AI miało analizować zgłoszone ustalenia

Moonshot AI, twórca Kimi, miało prowadzić wewnętrzny przegląd wyników i omawiać je z Mindgard. Firma badawcza podała, że w lipcu przekazała Moonshot AI szczegóły swoich ustaleń.

Co Mindgard opisał w testach Kimi

Mindgard twierdzi, że 20 lipca 2026 r. podczas audytu wykrył problemy z zabezpieczeniami Kimi. 27 lipca wysłał Moonshot AI szczegóły zgłoszenia. Wpis opublikowany 12 września opisywał testy, w których — według Mindgard — obejście zabezpieczeń prowadziło do odpowiedzi wysokiego ryzyka.

Jailbreak to próba skłonienia modelu do pominięcia ograniczeń bezpieczeństwa. Mindgard przedstawił wyniki własnych testów; nie opisywał ich jako niezależnej replikacji.

Czy odpowiedzi Kimi działałyby w praktyce?

Nie wykazano, że wygenerowane odpowiedzi byłyby praktycznie skuteczne. Opis odpowiedzi wysokiego ryzyka nie przesądza więc o tym, czy można byłoby je wykorzystać w rzeczywistym działaniu.