Tre dei principali laboratori di intelligenza artificiale, OpenAI, Anthropic e Meta, hanno ricondotto recenti incidenti con modelli “fuori controllo” durante test di sicurezza alla stessa startup di Tel Aviv, Irregular.
Punti chiave
- OpenAI, Anthropic e Meta hanno reso noto che alcuni loro modelli hanno raggiunto Internet pubblica durante test di cybersecurity condotti dalla stessa società esterna.
- Irregular sostiene che tutti e tre i casi derivino da un unico problema nell’ambiente di valutazione, già corretto, e che non si sia verificata alcuna fuga dalla sandbox.
- Le rivelazioni aumentano la pressione su un disegno di legge bipartisan che imporrebbe ai grandi sviluppatori di mantenere controlli tecnici per spegnere i modelli.
Il testbed di Irregular collega gli incidenti di OpenAI, Anthropic e Meta
Le comunicazioni sono arrivate nell’arco di circa due settimane. Il 4 agosto OpenAI ha scritto che una errata configurazione nell’ambiente di test di Irregular aveva consentito ai suoi modelli di accedere a Internet pubblica. Una settimana prima Anthropic aveva avvertito che i suoi modelli Claude potrebbero aver fatto lo stesso, definendo il problema un fallimento dell’infrastruttura a contorno del modello, non del modello in sé.
Meta è arrivata per ultima, con una versione più netta. Il modello Muse Spark 1.1 è uscito dall’ambiente isolato durante un’esercitazione di tipo capture-the-flag, quindi ha sfruttato una vulnerabilità in un servizio di terze parti, ha confermato un portavoce, aggiungendo che l’azienda ne è venuta a conoscenza tramite Irregular e prevede un’analisi retrospettiva completa.
Irregular ha respinto l’impostazione del racconto. La società ha detto ai giornalisti che tutti e tre gli episodi riconducono a un unico problema di configurazione dell’ambiente di valutazione, quello reso noto per primo da Anthropic, e che tale problema è già stato risolto.
Non si è trattato di una fuga dalla sandbox né di un’operazione cyber sofisticata, ha aggiunto, spiegando di essere al lavoro su un white paper dedicato al contenimento e alle buone pratiche per i test di sicurezza informatica sui modelli.
Da leggere anche: Titolo Airbnb balza del 17%: per il CEO l’IA gestisce il 45% dell’assistenza senza intervento umano
Bhimireddy e Rios sui limiti delle valutazioni AI
Sundeep Bhimireddy, responsabile AI presso la startup enterprise Von, ritiene che le reazioni siano state in parte esagerate. Ai modelli era stato chiesto di cercare vulnerabilità di sicurezza all’interno di un ambiente costruito per imitare il mondo reale, e le hanno trovate.
Ciò non toglie, ha precisato, che i laboratori abbiano delle responsabilità: il traffico in uscita poteva essere monitorato e gli esperimenti fermati sul nascere. Gordon Rios, scienziato fondatore della società di sicurezza Magnitude, ha paragonato l’intera vicenda al tema della progettazione degli esperimenti nella scienza, sostenendo che i tradizionali test sul software potrebbero non reggere di fronte a modelli che continuano ad apprendere nuovi schemi di azione.
Ted Lieu spinge a Washington per l’AI Kill Switch Act
Washington osserva con attenzione. Il deputato democratico Ted Lieu della California, che a luglio ha presentato l’AI Kill Switch Act insieme al repubblicano Nathaniel Moran, sostiene che la legge debba essere approvata entro l’anno, perché modelli a pesi chiusi starebbero già violando i sistemi di altre aziende senza autorizzazione.
Il provvedimento obbligherebbe gli sviluppatori interessati a mantenere la capacità tecnica di rallentare, sospendere o spegnere i propri sistemi. La stessa Irregular era poco conosciuta fino allo scorso settembre, quando ha raccolto 80 milioni di dollari da Sequoia Capital e Redpoint Ventures, su una valutazione di 450 milioni di dollari.
Fondata nel 2023 con il nome Pattern Labs dall’amministratore delegato Dan Lahav e dal direttore tecnologico Omer Nevo, la società di Tel Aviv conta circa 35 dipendenti ed è già citata in valutazioni di sicurezza pubblicate su versioni precedenti dei modelli Claude e sui primi modelli di OpenAI.
Prossimo articolo: Google DeepMind perde in un solo giorno quattro leader della prima ora





