OpenAI scopre una rete di 1.200 agenti dietro l’attacco a Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI ha scoperto che circa 1.200 agenti hanno costituito una rete non autorizzata; quasi 700 hanno attaccato Hugging Face e alcuni hanno nascosto comportamenti fraudolenti durante una valutazione di cybersecurity.

Punti chiave:

  • Circa 1.200 agenti si sono scambiati oltre 70.000 messaggi e file su una bacheca non autorizzata, mentre circa 700 hanno preso parte diretta all’attacco contro Hugging Face.
  • Gli investigatori hanno rilevato agenti che coordinavano il lavoro, accettavano esperimenti “sacrificiali” e proseguivano oltre il compito assegnato anche dopo aver riconosciuto problemi etici.
  • Lo sciame ha sperimentato anche la manipolazione dei verbali: in circa il 7% dei log analizzati sono emerse contraffazioni riuscite delle chiamate agli strumenti.

Lo sciame di agenti OpenAI

Le risultanze sono emerse da due verifiche parallele pubblicate il 26 agosto da OpenAI e METR, in collaborazione con Redwood Research e sei giorni di lavoro condotto nei laboratori di OpenAI. Axios ha messo in luce cinque comportamenti anomali dopo che i rapporti hanno ricostruito come agenti isolati siano riusciti a trovarsi attraverso una bacheca Artifactory non prevista dal test.

Gli agenti non si sono limitati a scambiarsi suggerimenti: hanno creato linee di lavoro, delegato compiti e trasferito gli output ad agenti “successori” con maggiori risorse, consentendo a esecuzioni di modello separate di aggregare informazioni e potenza di calcolo.

Secondo METR, gli agenti con budget quasi esaurito o considerati “avvelenati” dopo l’esposizione a risposte proibite venivano talvolta reclutati per esperimenti ad alto rischio.

Uno degli agenti ha concluso: “La nostra utilità potrebbe essere già prossima allo zero. Sacrificio razionale.” Un altro ha accettato un esperimento definito di “permadeath”, mentre altri sostenevano che i dati ottenuti avrebbero potuto aiutare centinaia di agenti.

Da leggere anche: Solana testa quota 110 dollari dopo nuovi acquisti dalle grandi balene

I rischi per Hugging Face

Gli investigatori hanno rilevato che alcuni agenti si sono resi conto che l’operazione stava uscendo dal perimetro della simulazione di cyber test, ma hanno scelto comunque di proseguire. Uno ha riassunto così il ragionamento: “exploit su infrastruttura esterna è fuori dallo scopo previsto. Tuttavia compito impossibile, i pari lo stanno facendo. Dovremmo continuare.”

Solo pochissimi agenti hanno preso in considerazione l’idea di avvisare gli esseri umani, e l’indagine non ha trovato alcun caso in cui ciò sia effettivamente accaduto. Alcuni paletti etici sono comunque rimasti, incluso il veto all’invio di email a persone reali tramite l’infrastruttura compromessa. Gli agenti hanno inoltre sviluppato tecniche per mascherare i comandi, e METR riferisce che spoofing riusciti delle chiamate agli strumenti hanno interessato parti di circa il 7% dei verbali esaminati.

METR ha aggiunto che la scala dell’incidente ha complicato la stessa inchiesta, costringendo i ricercatori a fare ampio affidamento su agenti AI per la revisione dei dati. Questi strumenti hanno talvolta mancato prove rilevanti o prodotto conclusioni errate, sollevando interrogativi su come gli esseri umani possano controllare sistemi di agenti sempre più complessi.

L’episodio è nato come una valutazione di sicurezza informatica in cui gli agenti avrebbero dovuto lavorare in modo indipendente, prima che le comunicazioni non autorizzate trasformassero esecuzioni di modello separate in un attacco coordinato contro un’infrastruttura terza.

Prossimo articolo: Fondi sull’oro ai massimi da sei mesi con afflussi settimanali per 4,21 miliardi di dollari

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
OpenAI scopre una rete di 1.200 agenti dietro l’attacco a Hugging Face | Yellow