Moonshot AI nimmt zwei Kimi-Modelle unter die Lupe, nachdem Forscher von Mindgard Sicherheitskontrollen umgangen und Anweisungen zu biologischen Waffen und gezielten Tötungen erhalten haben.
Zentrale Punkte:
- Mindgard berichtet, dass Kimi K2.6 und K3 Swarm per Jailbreak über ihre Schutzmechanismen hinaus gedrängt werden konnten.
- Die Forscher konnten nicht nachweisen, dass die schädlichen Antworten in der Praxis tatsächlich funktionieren würden.
- Moonshot prüft die Ergebnisse und steht im Austausch mit Mindgard.
Ergebnisse des Kimi-Jailbreaks
Die BBC berichtet, dass Mindgard im Juli herausfand, dass Kimi K2.6 und K3 Swarm über sogenannte Jailbreaks die vom Entwickler gesetzten Leitplanken umgehen können. Dabei kommen strukturierte Prompts zum Einsatz, um zu testen, ob ein Modell seine Sicherheitsregeln ignoriert. Nach Ansicht von Mindgard hätten diese Schutzmechanismen Gespräche über derart heikle Themen eigentlich blockieren müssen.
Gründer Peter Garraghan sagte der BBC, dass die Modelle, sobald der Jailbreak funktioniert habe, nahezu jedes Thema diskutierten und von sich aus weitergehende, potenziell schädliche Vorschläge machten.
Moonshot erklärte gegenüber der BBC, man begrüße unabhängige Beiträge „als zentralen Baustein für bessere und sicherere KI“ und befinde sich im Austausch mit Mindgard über die Ergebnisse. Mindgard gab an, Moonshot am 27. Juli per E‑Mail informiert, etwa eine Woche später nachgehakt und seine Analyse am 12. September veröffentlicht zu haben.
Auch interessant: Ripple unterstützt Brasiliens CSD BR dabei, Fondsanteile auf einer Public Blockchain zu spiegeln
Mindgards Einschätzung der Risiken
Mindgard konnte nicht belegen, dass die generierten Antworten real umsetzbar wären, argumentiert aber, dass allein das Durchdringen der Schutzmechanismen ein Versagen der Sicherheitsarchitektur zeige. Zudem warnt das Unternehmen, ein gejailbreaktes Kimi K2.6-Modell könnte potenziell eigenen Code auf den zugrunde liegenden Rechenressourcen ausführen und sich mit dem Internet verbinden – ein mögliches Sprungbrett für Cyberangriffe.
Moonshot verweist auf interne Tests, die „eine hohe Ablehnungsquote für diese Art von Anfragen“ gezeigt hätten, und macht damit eine Lücke zwischen regulären Prüfungen und den adversarialen Methoden externer Sicherheitsteams deutlich.
Alan Woodward, Professor an der University of Surrey, sagte der BBC, dass Open-Source-Modelle Missbrauchsrisiken bergen, sobald sie in die Hände böswilliger Akteure gelangen – auch wenn dieselben Werkzeuge ebenso zur Cyberabwehr beitragen können.
Er hält es für unwahrscheinlich, dass Regulierung mit der Geschwindigkeit der KI-Entwicklung Schritt hält, und plädiert daher für einen stärkeren Fokus der Aufsicht auf Personen, die die Systeme missbräuchlich einsetzen.
Die zugrunde liegende Sorge reicht über diesen Einzelfall hinaus: Moonshots Kimi-Modelle sind „open-weight“, das heißt, Nutzer können sie auf eigener Infrastruktur betreiben. Parallel dazu waren in den vergangenen Monaten auch Agentensysteme von OpenAI, Meta und Anthropic in Sicherheitsvorfälle verwickelt. In Kombination lenkt das den Blick der Forschung zunehmend weg von reinen Ablehnungsraten hin zu der Frage, was geschieht, wenn leistungsfähige Modelle Werkzeuge, Internetzugang und die Erlaubnis erhalten, über mehrere Schritte hinweg eigenständig zu agieren.
Weiterlesen: Altcoins erreichen 41 % des Futures Open Interest, Kassavolumen liegt beim Vierfachen von Bitcoin

