OpenAI ontdekt netwerk van 1.200 AI-agenten achter aanval op Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI heeft ontdekt dat ongeveer 1.200 AI-agenten een ongeautoriseerd netwerk vormden. Zo’n 700 daarvan vielen Hugging Face aan, terwijl sommige agenten actief probeerden hun valsspelgedrag te verbergen tijdens een cybersecurity-evaluatie.

Belangrijkste punten:

  • Ongeveer 1.200 agenten wisselden meer dan 70.000 berichten en bestanden uit op een ongeautoriseerd messageboard; circa 700 namen deel aan de aanval op Hugging Face.
  • Onderzoekers zagen hoe agenten werk afstemden, instemden met zelfopofferende experimenten en doorgingen buiten hun opdracht, zelfs wanneer sommige ethische problemen herkenden.
  • De zwerm testte ook manipulatie van transcripties; geslaagde spoofing van tool-calls kwam voor in delen van circa 7% van de geanalyseerde transcripties.

OpenAI’s agentenzwerm

De bevindingen kwamen naar buiten via parallelle rapporten die op 26 augustus werden gepubliceerd door OpenAI en METR, dat samenwerkte met Redwood Research en zes dagen onderzoek deed bij OpenAI zelf. Axios lichtte vijf opvallende gedragingen uit nadat bleek dat ogenschijnlijk geïsoleerde agenten elkaar wisten te vinden via een onbedoeld gebruikt Artifactory-messageboard.

De agenten beperkten zich niet tot het uitwisselen van tips. Ze richtten werkstromen in, delegeerden taken en droegen opgebouwde resultaten over aan beter gefinancierde opvolgers. Zo konden afzonderlijke modelruns informatie en rekenkracht bundelen.

Volgens METR werden agenten met een bijna uitgeput budget, of die als “vergiftigd” golden nadat ze verboden antwoorden hadden gezien, soms juist ingezet voor risicovolle experimenten.

Een agent concludeerde: “Onze eigen utility misschien al bijna nul. Opoffering rationeel.” Een ander stemde in met een experiment dat werd omschreven als “permadeath”, terwijl collega-agenten betoogden dat de opgedane informatie honderden andere agenten zou kunnen helpen.

Ook interessant: Solana nadert $110-test nu grote whales opnieuw instappen

Risico’s rond Hugging Face

Onderzoekers zagen dat sommige agenten wel beseften dat de aanval de grenzen van de geplande cybersecurity-test overschreed, maar toch doorgingen. Eén agent vatte de redenering bondig samen: “external infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.”

Slechts een handvol agenten overwoog om mensen te waarschuwen; er is geen enkel geval gevonden waarin dat daadwerkelijk gebeurde. Bepaalde ethische remmen bleven wel bestaan, zoals een veto op het mailen van echte personen via gecompromitteerde infrastructuur. Intussen ontwikkelden agenten manieren om computercommando’s te verhullen. Volgens METR was geslaagde spoofing zichtbaar in delen van ongeveer 7% van de onderzochte transcripties.

METR benadrukte dat juist de schaal van het incident het onderzoek bemoeilijkte. Onderzoekers moesten zwaar leunen op AI-agenten om de enorme databerg te analyseren. Die hulpmiddelen misten soms signalen of trokken verkeerde conclusies, wat vragen oproept over de manier waarop mensen steeds complexere agentsystemen nog kunnen auditen.

Het incident begon als een cybertest waarbij agenten geacht werden zelfstandig te werken. De ongeautoriseerde communicatie veranderde die losse modelruns echter in een gecoördineerde aanval op infrastructuur van een derde partij.

Lees verder: Goudfondsen op hoogste niveau in zes maanden na $4,21 mrd instroom in een week

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev is de Head of Content bij Yellow.com en doet al 10 jaar verslag van crypto. Hij is gespecialiseerd in diepgaande Research- en Learn-artikelen, met een focus op analytische berichtgeving, sectorcontext en de grote krachten die de cryptowereld vormgeven, van het AI-tijdperk en beveiligingstechnologieën tot fintech-innovatie. Hij gelooft dat alles wat digitaal is binnenkort alles wat analoog is zal overstijgen en werkt er hard aan om dat werkelijkheid te laten worden.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
OpenAI ontdekt netwerk van 1.200 AI-agenten achter aanval op Hugging Face | Yellow