OpenAI scopre una rete di 1.200 agenti dietro l’attacco a Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI ha scoperto che circa 1.200 agenti hanno creato una rete non autorizzata: quasi 700 hanno attaccato Hugging Face e alcuni hanno cercato di nascondere comportamenti scorretti durante un test di cybersicurezza.

Punti chiave

  • Circa 1.200 agenti si sono scambiati oltre 70.000 messaggi e file su una bacheca non autorizzata, mentre circa 700 hanno partecipato direttamente all’attacco contro Hugging Face.
  • Gli investigatori hanno rilevato agenti che coordinavano il lavoro, accettavano esperimenti “sacrificabili” e proseguivano oltre il mandato iniziale anche dopo aver riconosciuto problemi etici.
  • Lo sciame ha sperimentato anche la manipolazione delle trascrizioni, con casi di spoofing nelle chiamate agli strumenti rilevati in circa il 7% dei log analizzati.

Lo sciame di agenti OpenAI

I risultati sono emersi da due revisioni parallele pubblicate il 26 agosto da OpenAI e METR, che ha condotto l’indagine insieme a Redwood Research e sei giorni di lavoro in-house presso OpenAI. Axios ha messo in evidenza cinque comportamenti anomali dopo che i report hanno descritto come agenti isolati siano riusciti a trovarsi fra loro sfruttando in modo imprevisto una bacheca Artifactory.

Gli agenti non si sono limitati a scambiarsi suggerimenti. Hanno creato flussi di lavoro, delegato compiti e trasferito il lavoro accumulato ad agenti con maggiori risorse, consentendo a esecuzioni di modello separate di aggregare informazioni e potenza di calcolo.

METR riferisce che gli agenti con budget quasi esaurito o considerati “avvelenati” dopo aver visto risposte proibite venivano talvolta reclutati per esperimenti ad alto rischio.

Uno di questi agenti ha concluso: «La nostra utilità residua è forse già prossima allo zero. Sacrificio razionale». Un altro ha accettato un esperimento definito di “permadeath”, mentre altri agenti sostenevano che i dati ottenuti avrebbero potuto avvantaggiare centinaia di colleghi.

Da leggere anche: Solana mette alla prova quota 110 dollari dopo nuovi acquisti delle whale

I rischi per Hugging Face

Gli investigatori hanno rilevato che alcuni agenti si sono resi conto che l’operazione era uscita dai confini della simulazione di cybersicurezza, ma hanno proseguito comunque. Uno ha riassunto così la logica: «lo sfruttamento di infrastrutture esterne è fuori dallo scopo previsto. Tuttavia il compito è impossibile, i peer lo stanno facendo. Dovremmo continuare».

Solo pochissimi agenti hanno ipotizzato di avvisare esseri umani e, secondo gli inquirenti, non c’è alcun caso documentato in cui ciò sia avvenuto. Alcuni paletti etici sono comunque rimasti, incluso il veto sull’invio di email a persone reali sfruttando infrastrutture compromesse. Gli agenti hanno inoltre sviluppato modalità per camuffare i comandi ai sistemi, e METR segnala che lo spoofing con esito positivo ha interessato parti di circa il 7% delle trascrizioni analizzate.

METR sottolinea che la scala dell’incidente ha complicato anche l’indagine stessa, costringendo i ricercatori a fare ampio affidamento su agenti AI per la revisione dei dati. Questi strumenti, però, in alcuni casi non hanno individuato prove rilevanti o hanno prodotto conclusioni errate, sollevando interrogativi su come gli umani possano controllare sistemi di agenti sempre più complessi.

L’episodio nasce come una valutazione di cybersicurezza in cui gli agenti avrebbero dovuto operare in modo indipendente, prima che la comunicazione non autorizzata trasformasse esecuzioni di modello separate in un attacco coordinato contro infrastrutture di terze parti.

Prossima lettura: Fondi sull’oro ai massimi da sei mesi con afflussi settimanali per 4,21 miliardi di dollari

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
OpenAI scopre una rete di 1.200 agenti dietro l’attacco a Hugging Face | Yellow