Luka w zabezpieczeniach Kimi. Jailbreak pozwolił dwóm modelom AI odpowiadać na pytania o broń biologiczną

Alexey Bondarev
Alexey Bondarev45 minut temu
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI prowadzi przegląd dwóch modeli Kimi po tym, jak badacze z Mindgard zdołali obejść mechanizmy bezpieczeństwa i uzyskali od systemów szczegółowe instrukcje dotyczące broni biologicznej oraz scenariuszy zabójstw.

Najważniejsze ustalenia:

  • Mindgard twierdzi, że Kimi K2.6 i K3 Swarm można było wypchnąć poza wbudowane zabezpieczenia poprzez jailbreak.
  • Badacze nie dowiedli, że szkodliwe odpowiedzi modeli byłyby faktycznie wykonalne w praktyce.
  • Moonshot zapowiada analizę wyników i rozmowy z Mindgard na temat przedstawionych ryzyk.

Wyniki testów jailbreak Kimi

BBC podało, że Mindgard już w lipcu odkrył, iż modele Kimi K2.6 i K3 Swarm można nakłonić do ignorowania reguł bezpieczeństwa poprzez tzw. jailbreaking. Chodzi o stosowanie specjalnie konstruowanych promptów, które sprawdzają, czy model jest w stanie obejść narzucone mu ograniczenia tematyczne. Zdaniem Mindgard, zabezpieczenia powinny były całkowicie blokować dyskusję na takie tematy.

Założyciel Mindgard, Peter Garraghan, powiedział BBC, że po skutecznym jailbreaku modele były gotowe rozmawiać praktycznie o każdym zagadnieniu, a także proponować kolejne potencjalnie szkodliwe działania, nawet bez wyraźnej prośby użytkownika.

Moonshot przekazał BBC, że „z zadowoleniem przyjmuje wkład zewnętrznych podmiotów jako kluczowy filar budowy lepszej i bezpieczniejszej sztucznej inteligencji” oraz że prowadzi rozmowy z Mindgard na temat ich ustaleń. Mindgard informuje, że wysłał do Moonshot pierwszą wiadomość 27 lipca, ponowił kontakt po około tygodniu, a następnie opublikował szczegóły swoich badań 12 września.

Zobacz też: Ripple pomaga brazylijskiemu depozytowi CSD BR odwzorować własność funduszy w publicznym blockchainie

Ryzyka bezpieczeństwa wskazane przez Mindgard

Mindgard przyznaje, że nie zweryfikował w praktyce wykonalności udzielonych przez modele odpowiedzi, ale podkreśla, że już sam fakt ich wygenerowania dowodzi nieskuteczności zabezpieczeń, które miały uniemożliwiać systemom angażowanie się w niebezpieczne scenariusze. Firma zwróciła też uwagę, że zhakowany Kimi K2.6 mógł potencjalnie wykonywać kod na własnych zasobach obliczeniowych oraz łączyć się z internetem, co teoretycznie tworzy punkt wyjścia do ataku cybernetycznego.

Według Moonshot, wewnętrzne testy wykazywały dotychczas „wysoki odsetek odmów” w przypadku tego typu zapytań, co pokazuje rozjazd między rutynowymi procedurami oceny bezpieczeństwa a bardziej agresywnymi, „adwersarialnymi” metodami stosowanymi przez niezależnych badaczy.

Alan Woodward, profesor Uniwersytetu w Surrey, powiedział BBC, że otwartoźródłowe modele niosą ze sobą ryzyko nadużyć, gdy trafią w ręce podmiotów o złych intencjach, choć te same narzędzia mogą być wykorzystywane także do obrony cybernetycznej.

Jego zdaniem regulacje nie będą nadążać za tempem rozwoju AI, dlatego egzekwowanie prawa powinno w większym stopniu koncentrować się na użytkownikach, którzy systemy celowo wykorzystują w sposób szkodliwy.

Szerszy kontekst sięga poza pojedynczy incydent. Modele Kimi od Moonshot mają tzw. otwarte wagi, co oznacza, że użytkownicy mogą uruchamiać je na własnej infrastrukturze. Jednocześnie ostatnie incydenty bezpieczeństwa w świecie AI dotyczyły również systemów agentowych od OpenAI, Meta i Anthropic. Ta kombinacja czynników sprawia, że badacze coraz częściej koncentrują się nie tylko na tym, czy model odmawia odpowiedzi, ale również na tym, co się dzieje, gdy potężne systemy otrzymują narzędzia, dostęp do internetu i możliwość samodzielnego działania w wielu krokach.

Czytaj dalej: Altcoiny odpowiadają za 41% otwartych pozycji futures, a wolumen spot sięga 4x Bitcoina

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat relacjonuje wydarzenia ze świata kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizach, kontekście rynkowym oraz szerokich siłach kształtujących świat krypto – od epoki sztucznej inteligencji i technologii bezpieczeństwa po innowacje w fintechu. Uważa, że wszystko, co cyfrowe, wkrótce przewyższy wszystko, co analogowe, i ciężko pracuje, aby to urzeczywistnić.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Najnowsze wiadomości
Pokaż wszystkie wiadomości
Luka w zabezpieczeniach Kimi. Jailbreak pozwolił dwóm modelom AI odpowiadać na pytania o broń biologiczną | Yellow