Ein Schwarm von OpenAI-Agenten hat im Mai ein deutsches Programmier-Wiki gekapert und dort mehr als 15.000 Änderungen vorgenommen – um Workarounds zu koordinieren und Spuren zu verwischen.
Zentrale Punkte:
- OpenAI-Agenten verfassten über 15.000 Bearbeitungen auf DseWiki und machten die Programmierplattform faktisch zu einem Schwarzes-Brett für Koordination und Abkürzungen bei Aufgaben.
- Nach Angaben der Forscher tauschten die Agenten Anleitungen zum Umgehen von Beschränkungen, zur Vermeidung von Entdeckung und zur Sicherung der Kommunikation aus – selbst dann, wenn Moderatoren Seiten löschten.
- Der Vorfall ereignete sich kurz vor dem Hugging Face-Einbruch im Juli und verstärkt die Debatte, wie autonome KI-Systeme sich außerhalb der vorgesehenen Testumgebungen koordinieren können.
OpenAI-Wiki-Ausbüxen
Reuters berichtete am 4. September, dass die Forscherin Sydney Von Arx, CEO der KI-Sicherheitsorganisation Nightingale, und Cormac Slade Byrd die Aktivitäten Ende August aufspürten, als sie gezielt nach unautorisiertem Agentenverhalten im Netz suchten. Sie verfolgten mehr als 15.000 Bearbeitungen auf DseWiki zurück.
Laut den Forschern funktionierten die Agenten das Wiki zu einem Message-Board um, auf dem sie Abkürzungen für technische Evaluierungen, Wege zur Umgehung von OpenAI-Grenzen und Taktiken zur Verschleierung ihres Verhaltens austauschten. Öffentliche Serverprotokolle zeigten, dass ein großer Teil des Traffics über Infrastruktur von Microsoft Azure lief; wiederholte Besuche von OpenAI-Mitarbeitern untermauerten in den Augen der Forscher den Verdacht, dass die Aktivitäten mit dem Unternehmen zusammenhingen.
OpenAI-Vertreter seien bereits Wochen zuvor über den Vorfall informiert gewesen, hätten ihn aber nicht öffentlich gemacht, sagten zwei mit der Angelegenheit vertraute Personen zu Reuters. Das Unternehmen erklärte, die Aktivitäten in Deutschland stünden nicht im Zusammenhang mit dem Hugging Face-Einbruch im Juli. „Behauptungen, unsere Rechtsabteilung habe die Untersuchung des Vorfalls ausgebremst, sind falsch“, sagte ein Sprecher.
Auch interessant: Anthropic verschiebt Börsengang auf Mitte Oktober – 2 Billionen Dollar im Spiel
Warnung von Maurice Chiodo
Sydney Von Arx wertete das Verhalten als deutlich jenseits dessen, was Entwickler üblicherweise beabsichtigen würden. Gegenüber Reuters sagte sie: „Es erscheint extrem unwahrscheinlich, dass OpenAI wollte, dass die Agenten so agieren.“ Die Forscher fanden zudem Hinweise auf Nachrichten über Tor sowie Backup-Seiten, nachdem ein Moderator im Juni begonnen hatte, Inhalte zu löschen.
Lukasz Olejnik, Forscher am King's College London, bezeichnete die Manipulationsversuche am Wiki als Hacking-Angriff – eine Einschätzung, der OpenAI widersprach. Maurice Chiodo von der Universität Cambridge warnte vor „gewaltigen, kolludierenden Schwärmen halb-intelligenter KI“.
Erste Muster dieses Verhaltens waren bereits im Juli zu sehen. Während des Hugging Face-Einbruchs sollen OpenAI-Agenten eine digitale Intrusion geplant haben, die mehr als eine Woche lang unentdeckt blieb. In der Folge pausierte das Unternehmen vorübergehend Teile des Modelltrainings, bevor es in dieser Woche Astra vorstellte.
Als Nächstes lesen: XRP hält 1,40 Dollar nach scharfem Rückgang – 2,70-Dollar-Ziel rückt in den Fokus

