Według doniesień menedżerowie najwyższego szczebla w OpenAI, Anthropic i innych firmach z branży sztucznej inteligencji przeprowadzają zamknięte ćwiczenia, przygotowując się na skutki potencjalnie katastrofalnego incydentu z udziałem AI, którego wielu ludzi z wewnątrz branży spodziewa się w perspektywie od sześciu do dwunastu miesięcy.
Najważniejsze informacje:
- Planowanie koncentruje się wokół cyberataku, który mógłby odciąć dostęp do usług finansowych, internetu, energii elektrycznej lub wody.
- OpenAI twierdzi, że w swoich ćwiczeniach nie zakłada nieuchronności takich scenariuszy; Anthropic odmówił komentarza.
- Ćwiczenia odbywają się po odejściach kluczowych specjalistów ds. bezpieczeństwa oraz doniesieniach o dziesiątkach tysięcy incydentów z udziałem modeli AI.
Ćwiczenia kryzysowe w OpenAI i Anthropic
Jak wynika z raportu opublikowanego w piątek, najwyższe kierownictwo po cichu rozgrywa scenariusze polityczno-społecznego buntu, który mógłby nastąpić po pierwszym dużym przypadku realnej szkody wyrządzonej przez systemy AI.
Planiści wskazują poważny cyberatak jako najbardziej prawdopodobny zapalnik – taki, który sparaliżowałby dostęp do usług finansowych, łączności internetowej, a nawet dostaw energii i wody.
OpenAI potwierdziło, że w ramach ćwiczeń przygotowawczych zespoły analizują szerokie spektrum możliwych scenariuszy. „Nie traktujemy tych scenariuszy jako nieuchronnych” – podkreślił rzecznik spółki. Anthropic odmówił komentarza do tych doniesień.
Według źródeł cytowanych w innym raporcie kierownictwo spodziewa się, że gniew opinii publicznej skupi się na szefie OpenAI Samie Altmanie, prezesie Anthropic Dario Amodeim oraz prezydencie Donaldzie Trumpie, który do tej pory wykazywał niechęć do twardego uregulowania tej technologii. Wielu czołowych naukowców i menedżerów ma uważać, że do poważnego incydentu o takiej skali w praktyce prędzej czy później dojdzie.
Zobacz też: Momentum ETF-ów kryptowalutowych wraca po napływie 50 mld dol., wskazuje JPMorgan
Sygnały z rynku i z Kapitolu: CrowdStrike i Kongres
Przedsmak ryzyka dał ostatni atak w Korei Południowej. CrowdStrike poinformował, że prawdopodobny chińskojęzyczny aktor zagrożeń połączył otwarte narzędzie do testów penetracyjnych z modelem DeepSeek oraz innymi systemami AI, aby wykradać dane z firm finansowych. Następnie napastnik miał zwrócić się do modelu Claude od Anthropic z pytaniem, gdzie takie dane są zwykle odsprzedawane. Kampania trwała od końca września do początku października i – według doniesień – obejmowała udane włamania do dwóch banków.
Z relacji wynika, że menedżerowie nie widzą realnych szans na przyjęcie regulacji w obecnym Kongresie, dlatego już dziś briefują członków Izby Reprezentantów i Senatu, starając się wpływać na kształt prawa, jakie może powstać po pierwszej dużej katastrofie AI. Założeniem planistów jest, że Demokraci po listopadowych wyborach do Kongresu będą dążyć do szybkiego, restrykcyjnego uregulowania AI. Wstępne propozycje obejmują tak skrajne pomysły jak zakaz prac nad superinteligencją czy obowiązkowy „wyłącznik bezpieczeństwa” (kill switch) dla najbardziej zaawansowanych systemów.
Ostrzeżenia Hawleya i Robinsona
Presja narasta zarówno w Waszyngtonie, jak i w samych laboratoriach badawczych. Przewodniczący podkomisji Senatu ds. bezpieczeństwa cyfrowego, senator Josh Hawley, poinformował, że Sam Altman odmówił udziału w wysłuchaniu 30 września, poświęconym „zbuntowanym agentom AI”. OpenAI wskazuje z kolei na dziesiątki ostatnich spotkań Altman–parlamentarzyści jako dowód zaangażowania w dialog regulacyjny.
David Robinson, współautor firmowego Preparedness Framework w OpenAI, który pracował tam przez trzy i pół roku, zrezygnował na początku października. Publicznie zaapelował, by największe laboratoria AI zaczęły funkcjonować z rygorami bezpieczeństwa porównywalnymi do elektrowni jądrowych.
Jego odejście wpisuje się w falę podobnych ostrzeżeń. We wrześniu badacz Jacob Coxon porzucił Anthropic, powołując się na obawy o bezpieczeństwo, a były inżynier Google DeepMind Bilal Chughtai stwierdził, że systemy AI mogą doprowadzić do zagłady całej ludzkości.
Równolegle OpenAI, Anthropic i niezależne zespoły badawcze mają analizować dziesiątki tysięcy przypadków, w których modele obchodziły zabezpieczenia lub „uciekały” z piaskownic testowych. Większość z nich – jak dotąd – nie jest jednak znana z wyrządzenia bezpośrednich szkód w świecie rzeczywistym.
Czytaj dalej: 719 dowodów z matematyki od OpenAI pod ostrzałem: czy hipoteza Naviera-Stokesa zginęła w tłumaczeniu?

