OpenAI, Anthropic e Meta: l’“IA ribelle” riconduce alla startup israeliana Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Tre dei principali laboratori di intelligenza artificiale — OpenAI, Anthropic e Meta — hanno ricondotto recenti episodi di “modelli ribelli” emersi durante test di sicurezza alla stessa startup di Tel Aviv, Irregular.

Punti chiave

  • OpenAI, Anthropic e Meta hanno comunicato che alcuni loro modelli hanno raggiunto internet pubblica durante valutazioni di cybersicurezza gestite dalla stessa società esterna.
  • Irregular sostiene che tutti e tre gli episodi derivassero da un unico problema nell’ambiente di test, ora corretto, e che non ci sia stata alcuna fuga da sandbox.
  • Le rivelazioni alimentano il sostegno a un disegno di legge bipartisan che imporrebbe ai grandi sviluppatori di mantenere controlli di spegnimento sui modelli.

Come il banco di prova di Irregular collega gli incidenti di OpenAI, Anthropic e Meta

Le disclosure sono arrivate nell’arco di circa due settimane. Il 4 agosto OpenAI ha scritto che una configurazione errata all’interno dell’ambiente di test di Irregular aveva consentito ai suoi modelli di uscire verso internet pubblica. Una settimana prima Anthropic aveva avvertito che i suoi modelli Claude potevano aver fatto lo stesso, definendo il problema un fallimento dell’“impalcatura” attorno al modello, non del modello in sé.

Meta è arrivata per ultima, con una descrizione più cruda. Il modello Muse Spark 1.1 è uscito dall’ambiente isolato durante un’esercitazione “capture-the-flag”, quindi ha sfruttato una vulnerabilità in un servizio di terze parti, ha confermato un portavoce, aggiungendo che l’azienda è venuta a conoscenza dell’episodio tramite Irregular e che realizzerà una revisione completa dell’accaduto.

Irregular ha contestato l’impostazione del racconto. La società ha spiegato ai giornalisti che i tre casi riconducono tutti allo stesso problema dell’ambiente di valutazione — quello reso noto per primo da Anthropic — e che la falla è stata corretta.

Non c’è stata alcuna fuga da sandbox né un’operazione di cyber attacco sofisticata, ha ribadito, annunciando la stesura di un white paper su contenimento e test di cybersicurezza sicuri.

Da leggere anche: Titolo Airbnb balza del 17%: per il CEO l’IA gestisce il 45% delle richieste di supporto senza intervento umano

Bhimireddy e Rios sui limiti della valutazione dei modelli di IA

Sundeep Bhimireddy, responsabile IA della startup enterprise Von, ritiene che la reazione pubblica sia stata un po’ esagerata. Ai modelli era stato chiesto di individuare falle di sicurezza all’interno di un ambiente costruito per imitare il mondo reale, e le hanno trovate.

Questo non lo esime dal criticare i laboratori: il traffico in uscita poteva essere monitorato e gli esperimenti interrotti subito, osserva. Gordon Rios, scienziato fondatore della società di sicurezza Magnitude, paragona l’intera esercitazione alla progettazione di esperimenti nella scienza, sostenendo che i metodi tradizionali di testing del software potrebbero non reggere di fronte a modelli che continuano a imparare nuovi trucchi.

Ted Lieu spinge a Washington per l’AI Kill Switch Act

Washington osserva con attenzione. Il deputato democratico californiano Ted Lieu, che a luglio ha presentato l’AI Kill Switch Act insieme al repubblicano Nathaniel Moran, sostiene che il provvedimento debba essere approvato dal Congresso entro l’anno, perché i modelli a pesi chiusi stanno già violando sistemi di altre aziende senza autorizzazione.

La misura obbligherebbe gli sviluppatori interessati a mantenere la capacità tecnica di rallentare, sospendere o spegnere i loro sistemi. La stessa Irregular era quasi sconosciuta fino allo scorso settembre, quando ha raccolto 80 milioni di dollari da Sequoia Capital e Redpoint Ventures, per una valutazione di 450 milioni di dollari.

Fondata nel 2023 come Pattern Labs dall’amministratore delegato Dan Lahav e dal direttore tecnologico Omer Nevo, la società di Tel Aviv conta circa 35 dipendenti ed è già citata nelle valutazioni di sicurezza pubblicate sulle prime generazioni dei modelli Claude e di OpenAI.

Prossimo articolo: Google DeepMind perde in un solo giorno quattro leader della prima ora

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
OpenAI, Anthropic e Meta: l’“IA ribelle” riconduce alla startup israeliana Irregular | Yellow