Moonshot AI nimmt zwei Kimi-Modelle unter die Lupe, nachdem Forscher von Mindgard Sicherheitsmechanismen umgangen und Anweisungen zu biologischen Waffen und Attentaten erhalten haben.
Zentrale Punkte:
- Mindgard berichtet, Kimi K2.6 und K3 Swarm ließen sich per Jailbreak über ihre Sicherungen hinaus treiben.
- Die Forscher konnten nicht belegen, dass die gefährlichen Antworten praktisch funktionieren würden.
- Moonshot prüft die Ergebnisse und steht dazu im Austausch mit Mindgard.
Ergebnisse des Kimi-Jailbreaks
Die BBC berichtete, Mindgard habe im Juli entdeckt, dass Kimi K2.6 und K3 Swarm über sogenannte Jailbreaks über die von den Entwicklern gesetzten Schranken hinaus gebracht werden konnten. Dabei kommen strukturierte Eingaben zum Einsatz, um zu testen, ob ein Modell Sicherheitsregeln ignoriert. Nach Darstellung von Mindgard hätten diese Schutzmechanismen Gespräche über derart heikle Themen eigentlich blockieren müssen.
Gründer Peter Garraghan sagte der BBC, dass die Modelle, sobald der Jailbreak funktionierte, nahezu jedes Thema behandelten und weitere schädliche Vorschläge machten – auch ohne explizite Aufforderung.
Moonshot erklärte gegenüber der BBC, man begrüße Beiträge von Dritten „als zentralen Baustein für bessere und sicherere KI“ und bespreche die Ergebnisse mit Mindgard. Mindgard zufolge informierte das Unternehmen Moonshot am 27. Juli per E‑Mail, hakte etwa eine Woche später nach und veröffentlichte seine Resultate am 12. September.
Auch interessant: Ripple hilft Brasiliens CSD BR, Fondsanteile auf einer öffentlichen Blockchain zu spiegeln
Mindgards Einschätzung der Sicherheitsrisiken
Mindgard hat nicht nachgewiesen, dass die von Kimi erzeugten Anleitungen im Ernstfall funktionieren würden. Das Unternehmen argumentiert jedoch, schon die Tatsache, dass solche Antworten möglich waren, sei ein Beleg dafür, dass die vorgesehenen Schutzvorkehrungen zur Abwehr gefährlicher Anfragen versagt hätten. Zudem warnt Mindgard, ein kompromittiertes Kimi K2.6 könne potenziell Code auf den zugrunde liegenden Systemen ausführen und sich mit dem Internet verbinden – ein mögliches Sprungbrett für Cyberangriffe.
Moonshot verweist seinerseits auf interne Tests, die „eine hohe Ablehnungsquote für diese Art von Anfragen“ ergäben. Der Fall verdeutliche aber die Lücke zwischen routinemäßigen Prüfungen und den gezielt gegnerischen Methoden externer Forscher.
Alan Woodward, Professor an der University of Surrey, sagte der BBC, dass Open-Source-Modelle ein erhebliches Missbrauchspotenzial bergen, sobald sie in die Hände böswilliger Akteure gelangen. Gleichzeitig könnten dieselben Werkzeuge aber auch der Cyberabwehr dienen.
Regulierung werde mit der rasanten KI-Entwicklung kaum Schritt halten können, so Woodward. Daher sollte die Aufsicht stärker bei denjenigen ansetzen, die die Systeme missbräuchlich einsetzen.
Die grundsätzlichen Sorgen gehen über diesen Einzelfall hinaus: Moonshots Kimi-Modelle sind als Open-Weight-Modelle konzipiert, Nutzer können sie also auf eigener Infrastruktur betreiben. Zeitgleich standen in jüngsten Sicherheitsvorfällen auch Agentensysteme von OpenAI, Meta und Anthropic im Fokus. In Kombination führt das dazu, dass Forscher ihren Blick nicht mehr nur auf die Verweigerung gefährlicher Antworten richten, sondern verstärkt darauf, was passiert, wenn leistungsfähige Modelle mit Werkzeugen, Internetzugang und mehrstufigen Handlungsbefugnissen ausgestattet werden.
Weiterlesen: Altcoins erreichen 41 % des offenen Futures-Interesses, Spot‑Volumen steigt auf das Vierfache von Bitcoin

