Moonshot: Jailbreak bei Kimi-Modellen erlaubt Antworten zu Biowaffen

Alexey Bondarev
Alexey Bondarevvor 11 Stunden
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI nimmt zwei Kimi-Modelle unter die Lupe, nachdem Forscher von Mindgard Sicherheitsmechanismen umgangen und Anweisungen zu biologischen Waffen und Attentaten erhalten haben.

Zentrale Punkte:

  • Mindgard berichtet, Kimi K2.6 und K3 Swarm ließen sich per Jailbreak über ihre Sicherungen hinaus treiben.
  • Die Forscher konnten nicht belegen, dass die gefährlichen Antworten praktisch funktionieren würden.
  • Moonshot prüft die Ergebnisse und steht dazu im Austausch mit Mindgard.

Ergebnisse des Kimi-Jailbreaks

Die BBC berichtete, Mindgard habe im Juli entdeckt, dass Kimi K2.6 und K3 Swarm über sogenannte Jailbreaks über die von den Entwicklern gesetzten Schranken hinaus gebracht werden konnten. Dabei kommen strukturierte Eingaben zum Einsatz, um zu testen, ob ein Modell Sicherheitsregeln ignoriert. Nach Darstellung von Mindgard hätten diese Schutzmechanismen Gespräche über derart heikle Themen eigentlich blockieren müssen.

Gründer Peter Garraghan sagte der BBC, dass die Modelle, sobald der Jailbreak funktionierte, nahezu jedes Thema behandelten und weitere schädliche Vorschläge machten – auch ohne explizite Aufforderung.

Moonshot erklärte gegenüber der BBC, man begrüße Beiträge von Dritten „als zentralen Baustein für bessere und sicherere KI“ und bespreche die Ergebnisse mit Mindgard. Mindgard zufolge informierte das Unternehmen Moonshot am 27. Juli per E‑Mail, hakte etwa eine Woche später nach und veröffentlichte seine Resultate am 12. September.

Auch interessant: Ripple hilft Brasiliens CSD BR, Fondsanteile auf einer öffentlichen Blockchain zu spiegeln

Mindgards Einschätzung der Sicherheitsrisiken

Mindgard hat nicht nachgewiesen, dass die von Kimi erzeugten Anleitungen im Ernstfall funktionieren würden. Das Unternehmen argumentiert jedoch, schon die Tatsache, dass solche Antworten möglich waren, sei ein Beleg dafür, dass die vorgesehenen Schutzvorkehrungen zur Abwehr gefährlicher Anfragen versagt hätten. Zudem warnt Mindgard, ein kompromittiertes Kimi K2.6 könne potenziell Code auf den zugrunde liegenden Systemen ausführen und sich mit dem Internet verbinden – ein mögliches Sprungbrett für Cyberangriffe.

Moonshot verweist seinerseits auf interne Tests, die „eine hohe Ablehnungsquote für diese Art von Anfragen“ ergäben. Der Fall verdeutliche aber die Lücke zwischen routinemäßigen Prüfungen und den gezielt gegnerischen Methoden externer Forscher.

Alan Woodward, Professor an der University of Surrey, sagte der BBC, dass Open-Source-Modelle ein erhebliches Missbrauchspotenzial bergen, sobald sie in die Hände böswilliger Akteure gelangen. Gleichzeitig könnten dieselben Werkzeuge aber auch der Cyberabwehr dienen.

Regulierung werde mit der rasanten KI-Entwicklung kaum Schritt halten können, so Woodward. Daher sollte die Aufsicht stärker bei denjenigen ansetzen, die die Systeme missbräuchlich einsetzen.

Die grundsätzlichen Sorgen gehen über diesen Einzelfall hinaus: Moonshots Kimi-Modelle sind als Open-Weight-Modelle konzipiert, Nutzer können sie also auf eigener Infrastruktur betreiben. Zeitgleich standen in jüngsten Sicherheitsvorfällen auch Agentensysteme von OpenAI, Meta und Anthropic im Fokus. In Kombination führt das dazu, dass Forscher ihren Blick nicht mehr nur auf die Verweigerung gefährlicher Antworten richten, sondern verstärkt darauf, was passiert, wenn leistungsfähige Modelle mit Werkzeugen, Internetzugang und mehrstufigen Handlungsbefugnissen ausgestattet werden.

Weiterlesen: Altcoins erreichen 41 % des offenen Futures-Interesses, Spot‑Volumen steigt auf das Vierfache von Bitcoin

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev ist auf tiefgehende Research- und Learn-Artikel spezialisiert, mit einem Schwerpunkt auf analytischer Berichterstattung, Brancheneinordnung und den großen Kräften, die den Kryptosektor prägen – von der KI-Ära und Sicherheitstechnologien bis hin zu Innovationen im Fintech-Bereich. Er ist überzeugt, dass alles Digitale in naher Zukunft alles Analoge übertreffen wird und arbeitet intensiv daran, genau das Wirklichkeit werden zu lassen.

Haftungsausschluss und Risikowarnung: Die in diesem Artikel bereitgestellten Informationen dienen nur Bildungs- und Informationszwecken und basieren auf der Meinung des Autors. Sie stellen keine Finanz-, Anlage-, Rechts- oder Steuerberatung dar. Kryptowährungsassets sind hochvolatil und unterliegen hohen Risiken, einschließlich des Risikos, Ihre gesamte oder einen erheblichen Teil Ihrer Investition zu verlieren. Der Handel oder das Halten von Krypto-Assets ist möglicherweise nicht für alle Anleger geeignet. Die in diesem Artikel geäußerten Ansichten sind ausschließlich die des Autors/der Autoren und repräsentieren nicht die offizielle Politik oder Position von Yellow, seinen Gründern oder seinen Führungskräften. Führen Sie immer Ihre eigenen gründlichen Recherchen (D.Y.O.R.) durch und konsultieren Sie einen lizenzierten Finanzprofi, bevor Sie eine Anlageentscheidung treffen.
Moonshot: Jailbreak bei Kimi-Modellen erlaubt Antworten zu Biowaffen | Yellow