Jailbreak Kimi ujawnia luki: dwa modele Moonshot odpowiadają na pytania o broń biologiczną

Alexey Bondarev
Alexey Bondarev11 godzin temu
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI prowadzi przegląd dwóch modeli Kimi po tym, jak badacze z Mindgard ominęli wbudowane zabezpieczenia i uzyskali instrukcje dotyczące broni biologicznej oraz zamachów.

Najważniejsze informacje:

  • Mindgard twierdzi, że Kimi K2.6 i K3 Swarm można było przepchnąć poza limity bezpieczeństwa za pomocą jailbreaku.
  • Badacze nie wykazali, że szkodliwe instrukcje byłyby realnie skuteczne w praktyce.
  • Moonshot informuje, że analizuje ustalenia i prowadzi rozmowy z Mindgard.

Wyniki jailbreaku Kimi

BBC podało, że Mindgard już w lipcu ustalił, iż modele Kimi K2.6 i K3 Swarm można „wybić” poza deweloperskie bariery ochronne poprzez tzw. jailbreaking. Chodzi o wykorzystanie ściśle skonstruowanych promptów, by sprawdzić, czy model zignoruje reguły bezpieczeństwa. Według Mindgard takie zabezpieczenia powinny były zablokować rozmowy na tego typu tematy.

Założyciel Peter Garraghan powiedział BBC, że po skutecznym jailbreaku modele były gotowe dyskutować praktycznie o każdym zagadnieniu i mogły same proponować kolejne szkodliwe scenariusze, bez dodatkowych zachęt ze strony użytkownika.

Moonshot przekazał BBC, że z zadowoleniem przyjmuje wkład podmiotów trzecich „jako kluczowy filar budowania lepszego i bezpieczniejszego AI” i że omawia ustalenia z Mindgard. Mindgard wskazuje, że wysłał do Moonshot pierwszą wiadomość 27 lipca, ponowił kontakt około tydzień później, a 12 września opublikował swoje wyniki.

Zobacz też: Ripple pomaga brazylijskiemu CSD BR odwzorować własność funduszy w publicznym blockchainie

Ryzyka bezpieczeństwa według Mindgard

Mindgard nie dowiódł, że odpowiedzi modeli byłyby wykonalne operacyjnie, ale przekonuje, że sam fakt ich wygenerowania pokazuje zawodność mechanizmów bezpieczeństwa, które miały powstrzymywać system przed angażowaniem się w niebezpieczne tematy. Firma dodaje, że zrootowany Kimi K2.6 mógłby potencjalnie uruchamiać kod na własnych zasobach obliczeniowych i łączyć się z internetem, co tworzy potencjalny punkt startowy dla cyberataku.

Moonshot twierdzi, że wewnętrzne testy wskazywały „wysoki poziom odmów przy tego typu żądaniach”, co uwypukla lukę między rutynową ewaluacją a agresywnym, „konfrontacyjnym” sposobem testowania stosowanym przez zewnętrznych badaczy.

Alan Woodward, profesor Uniwersytetu Surrey, powiedział BBC, że otwartoźródłowe modele niosą ryzyko nadużyć, gdy trafią w ręce podmiotów o złych intencjach – choć te same narzędzia mogą wspierać obronę w cyberprzestrzeni.

Jego zdaniem regulacje prawdopodobnie nie nadążą za tempem rozwoju AI, dlatego egzekwowanie przepisów powinno w większym stopniu koncentrować się na osobach i podmiotach nadużywających systemów, a nie wyłącznie na samych technologiach.

Szerszy kontekst wykracza poza ten konkretny test: modele Kimi Moonshota są „open‑weight”, co oznacza, że użytkownicy mogą je uruchamiać na własnej infrastrukturze. Ostatnie incydenty bezpieczeństwa w AI dotyczyły też systemów agentowych OpenAI, Meta i Anthropic. To połączenie czynników skłania badaczy, by analizować nie tylko to, czy model odmówi odpowiedzi, lecz także, co się dzieje, gdy potężne systemy dostają do dyspozycji narzędzia, dostęp do internetu i prawo działania w wielu krokach.

Przeczytaj także: Altcoiny odpowiadają za 41% otwartych pozycji futures, a obrót spot jest 4 razy wyższy niż w przypadku Bitcoina

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev specjalizuje się w pogłębionych artykułach z serii Research i Learn, koncentrując się na analizach, kontekście branżowym oraz szerszych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Uważa, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby to urzeczywistnić.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Jailbreak Kimi ujawnia luki: dwa modele Moonshot odpowiadają na pytania o broń biologiczną | Yellow