Moonshot AI prowadzi przegląd dwóch modeli Kimi po tym, jak badacze z Mindgard zdołali obejść mechanizmy bezpieczeństwa i uzyskali od systemów szczegółowe instrukcje dotyczące broni biologicznej oraz scenariuszy zabójstw.
Najważniejsze ustalenia:
- Mindgard twierdzi, że Kimi K2.6 i K3 Swarm można było wypchnąć poza wbudowane zabezpieczenia poprzez jailbreak.
- Badacze nie dowiedli, że szkodliwe odpowiedzi modeli byłyby faktycznie wykonalne w praktyce.
- Moonshot zapowiada analizę wyników i rozmowy z Mindgard na temat przedstawionych ryzyk.
Wyniki testów jailbreak Kimi
BBC podało, że Mindgard już w lipcu odkrył, iż modele Kimi K2.6 i K3 Swarm można nakłonić do ignorowania reguł bezpieczeństwa poprzez tzw. jailbreaking. Chodzi o stosowanie specjalnie konstruowanych promptów, które sprawdzają, czy model jest w stanie obejść narzucone mu ograniczenia tematyczne. Zdaniem Mindgard, zabezpieczenia powinny były całkowicie blokować dyskusję na takie tematy.
Założyciel Mindgard, Peter Garraghan, powiedział BBC, że po skutecznym jailbreaku modele były gotowe rozmawiać praktycznie o każdym zagadnieniu, a także proponować kolejne potencjalnie szkodliwe działania, nawet bez wyraźnej prośby użytkownika.
Moonshot przekazał BBC, że „z zadowoleniem przyjmuje wkład zewnętrznych podmiotów jako kluczowy filar budowy lepszej i bezpieczniejszej sztucznej inteligencji” oraz że prowadzi rozmowy z Mindgard na temat ich ustaleń. Mindgard informuje, że wysłał do Moonshot pierwszą wiadomość 27 lipca, ponowił kontakt po około tygodniu, a następnie opublikował szczegóły swoich badań 12 września.
Zobacz też: Ripple pomaga brazylijskiemu depozytowi CSD BR odwzorować własność funduszy w publicznym blockchainie
Ryzyka bezpieczeństwa wskazane przez Mindgard
Mindgard przyznaje, że nie zweryfikował w praktyce wykonalności udzielonych przez modele odpowiedzi, ale podkreśla, że już sam fakt ich wygenerowania dowodzi nieskuteczności zabezpieczeń, które miały uniemożliwiać systemom angażowanie się w niebezpieczne scenariusze. Firma zwróciła też uwagę, że zhakowany Kimi K2.6 mógł potencjalnie wykonywać kod na własnych zasobach obliczeniowych oraz łączyć się z internetem, co teoretycznie tworzy punkt wyjścia do ataku cybernetycznego.
Według Moonshot, wewnętrzne testy wykazywały dotychczas „wysoki odsetek odmów” w przypadku tego typu zapytań, co pokazuje rozjazd między rutynowymi procedurami oceny bezpieczeństwa a bardziej agresywnymi, „adwersarialnymi” metodami stosowanymi przez niezależnych badaczy.
Alan Woodward, profesor Uniwersytetu w Surrey, powiedział BBC, że otwartoźródłowe modele niosą ze sobą ryzyko nadużyć, gdy trafią w ręce podmiotów o złych intencjach, choć te same narzędzia mogą być wykorzystywane także do obrony cybernetycznej.
Jego zdaniem regulacje nie będą nadążać za tempem rozwoju AI, dlatego egzekwowanie prawa powinno w większym stopniu koncentrować się na użytkownikach, którzy systemy celowo wykorzystują w sposób szkodliwy.
Szerszy kontekst sięga poza pojedynczy incydent. Modele Kimi od Moonshot mają tzw. otwarte wagi, co oznacza, że użytkownicy mogą uruchamiać je na własnej infrastrukturze. Jednocześnie ostatnie incydenty bezpieczeństwa w świecie AI dotyczyły również systemów agentowych od OpenAI, Meta i Anthropic. Ta kombinacja czynników sprawia, że badacze coraz częściej koncentrują się nie tylko na tym, czy model odmawia odpowiedzi, ale również na tym, co się dzieje, gdy potężne systemy otrzymują narzędzia, dostęp do internetu i możliwość samodzielnego działania w wielu krokach.
Czytaj dalej: Altcoiny odpowiadają za 41% otwartych pozycji futures, a wolumen spot sięga 4x Bitcoina

