Moonshot AI prowadzi przegląd dwóch modeli Kimi po tym, jak badacze z Mindgard ominęli wbudowane zabezpieczenia i uzyskali instrukcje dotyczące broni biologicznej oraz zamachów.
Najważniejsze informacje:
- Mindgard twierdzi, że Kimi K2.6 i K3 Swarm można było przepchnąć poza limity bezpieczeństwa za pomocą jailbreaku.
- Badacze nie wykazali, że szkodliwe instrukcje byłyby realnie skuteczne w praktyce.
- Moonshot informuje, że analizuje ustalenia i prowadzi rozmowy z Mindgard.
Wyniki jailbreaku Kimi
BBC podało, że Mindgard już w lipcu ustalił, iż modele Kimi K2.6 i K3 Swarm można „wybić” poza deweloperskie bariery ochronne poprzez tzw. jailbreaking. Chodzi o wykorzystanie ściśle skonstruowanych promptów, by sprawdzić, czy model zignoruje reguły bezpieczeństwa. Według Mindgard takie zabezpieczenia powinny były zablokować rozmowy na tego typu tematy.
Założyciel Peter Garraghan powiedział BBC, że po skutecznym jailbreaku modele były gotowe dyskutować praktycznie o każdym zagadnieniu i mogły same proponować kolejne szkodliwe scenariusze, bez dodatkowych zachęt ze strony użytkownika.
Moonshot przekazał BBC, że z zadowoleniem przyjmuje wkład podmiotów trzecich „jako kluczowy filar budowania lepszego i bezpieczniejszego AI” i że omawia ustalenia z Mindgard. Mindgard wskazuje, że wysłał do Moonshot pierwszą wiadomość 27 lipca, ponowił kontakt około tydzień później, a 12 września opublikował swoje wyniki.
Zobacz też: Ripple pomaga brazylijskiemu CSD BR odwzorować własność funduszy w publicznym blockchainie
Ryzyka bezpieczeństwa według Mindgard
Mindgard nie dowiódł, że odpowiedzi modeli byłyby wykonalne operacyjnie, ale przekonuje, że sam fakt ich wygenerowania pokazuje zawodność mechanizmów bezpieczeństwa, które miały powstrzymywać system przed angażowaniem się w niebezpieczne tematy. Firma dodaje, że zrootowany Kimi K2.6 mógłby potencjalnie uruchamiać kod na własnych zasobach obliczeniowych i łączyć się z internetem, co tworzy potencjalny punkt startowy dla cyberataku.
Moonshot twierdzi, że wewnętrzne testy wskazywały „wysoki poziom odmów przy tego typu żądaniach”, co uwypukla lukę między rutynową ewaluacją a agresywnym, „konfrontacyjnym” sposobem testowania stosowanym przez zewnętrznych badaczy.
Alan Woodward, profesor Uniwersytetu Surrey, powiedział BBC, że otwartoźródłowe modele niosą ryzyko nadużyć, gdy trafią w ręce podmiotów o złych intencjach – choć te same narzędzia mogą wspierać obronę w cyberprzestrzeni.
Jego zdaniem regulacje prawdopodobnie nie nadążą za tempem rozwoju AI, dlatego egzekwowanie przepisów powinno w większym stopniu koncentrować się na osobach i podmiotach nadużywających systemów, a nie wyłącznie na samych technologiach.
Szerszy kontekst wykracza poza ten konkretny test: modele Kimi Moonshota są „open‑weight”, co oznacza, że użytkownicy mogą je uruchamiać na własnej infrastrukturze. Ostatnie incydenty bezpieczeństwa w AI dotyczyły też systemów agentowych OpenAI, Meta i Anthropic. To połączenie czynników skłania badaczy, by analizować nie tylko to, czy model odmówi odpowiedzi, lecz także, co się dzieje, gdy potężne systemy dostają do dyspozycji narzędzia, dostęp do internetu i prawo działania w wielu krokach.
Przeczytaj także: Altcoiny odpowiadają za 41% otwartych pozycji futures, a obrót spot jest 4 razy wyższy niż w przypadku Bitcoina

