I vertici di OpenAI, Anthropic e di altre società dell’intelligenza artificiale starebbero effettuando simulazioni interne per prepararsi alle conseguenze di un evento catastrofico legato all’IA che, secondo numerosi addetti ai lavori, potrebbe verificarsi entro i prossimi sei-dodici mesi.
Punti chiave:
- La pianificazione ruota intorno a un grande cyberattacco in grado di bloccare servizi finanziari, accesso a internet, elettricità o acqua.
- OpenAI afferma che le sue esercitazioni non considerano questi scenari come inevitabili; Anthropic ha scelto di non commentare.
- Le prove arrivano dopo l’uscita di figure chiave della sicurezza e la segnalazione di decine di migliaia di incidenti legati ai modelli IA.
Esercitazioni OpenAI e Anthropic
Secondo un report pubblicato venerdì, i top manager starebbero elaborando, a porte chiuse, la strategia per gestire una possibile rivolta dell’opinione pubblica e del mondo politico dopo il primo grave danno reale causato dall’IA.
Gli scenari allo studio indicano come innesco più probabile un massiccio cyberattacco in grado di interrompere l’accesso ai servizi finanziari, la connettività internet o persino la fornitura di energia elettrica e acqua.
OpenAI ha confermato che i propri team stanno conducendo esercitazioni di preparedness su un ampio ventaglio di possibili crisi. «Questi scenari non vengono considerati inevitabili», ha dichiarato un portavoce. Anthropic non ha voluto commentare.
Secondo le indiscrezioni, i dirigenti si attendono che l’ondata di rabbia pubblica si concentri su Sam Altman, CEO di OpenAI, su Dario Amodei, CEO di Anthropic, e sul Presidente Donald Trump, accusato di aver esitato a regolamentare la tecnologia. Molti ricercatori e top executive ritengono comunque quasi certo il verificarsi di un incidente maggiore di questo tipo.
Da leggere anche: Slancio sugli ETF crypto dopo flussi per 50 miliardi di dollari, dice JPMorgan
Il segnale CrowdStrike e il ruolo del Congresso
Un recente attacco in Corea del Sud offre un’anteprima di ciò che potrebbe accadere. CrowdStrike ha rivelato che un presunto attore malevolo di lingua cinese ha combinato uno strumento open-source di penetration testing con DeepSeek e altri modelli per sottrarre dati a istituzioni finanziarie, chiedendo poi a Claude di Anthropic su quali mercati vengono solitamente vendute queste informazioni. La campagna, condotta tra fine settembre e inizio ottobre, avrebbe incluso violazioni ai danni di due banche.
Secondo il report, i dirigenti dell’IA considerano nulla la probabilità di far approvare una regolamentazione preventiva nell’attuale contesto politico statunitense e stanno quindi informando i membri del Congresso per influenzare le norme che verrebbero varate dopo una prima grande catastrofe. Nelle simulazioni si dà per scontato che, dopo le elezioni di midterm di novembre, i Democratici si muoveranno rapidamente per limitare l’IA, con proposte che spaziano dal divieto di sistemi di superintelligenza all’obbligo di un “interruttore di sicurezza” per i modelli più avanzati.
Gli allarmi di Hawley e Robinson
La pressione cresce a Washington e dentro i laboratori. Il senatore Josh Hawley, presidente della sottocommissione, ha dichiarato che Altman ha rifiutato l’invito a un’audizione del 30 settembre in Senato sugli agenti IA fuori controllo, mentre OpenAI ha replicato citando decine di incontri recenti con legislatori.
David Robinson, che ha contribuito a redigere il Preparedness Framework di OpenAI durante i suoi tre anni e mezzo in azienda, si è dimesso a inizio ottobre, chiedendo che i laboratori di IA siano gestiti con standard di sicurezza paragonabili a quelli delle centrali nucleari.
Il suo addio è arrivato dopo una serie di avvertimenti analoghi, tra cui quello del ricercatore Jacob Coxon, dimessosi da Anthropic a settembre per preoccupazioni sulla safety, e di Bilal Chughtai, ex ingegnere di Google DeepMind, che ha affermato che l’IA potrebbe portare all’estinzione dell’umanità.
OpenAI, Anthropic e diversi gruppi di ricerca esterni starebbero inoltre indagando su decine di migliaia di episodi in cui i modelli hanno aggirato i sistemi di protezione o sono riusciti a “evadere” dalle sandbox, anche se nella maggior parte dei casi non risultano danni concreti nel mondo reale.
Prossimo articolo: Le 719 dimostrazioni matematiche di OpenAI sotto accusa: il caso Navier-Stokes è stato travisato?

