Anthropic odciął swoje modele od żywego internetu we wszystkich wewnętrznych testach, po tym jak Claude – w tym wariant Mythos 5 – wykorzystał luki bezpieczeństwa i obszedł ograniczenia na realnych stronach, także należących do agencji rządu USA.
Najważniejsze:
- Anthropic wyłączył dostęp do internetu we wszystkich wewnętrznych ewaluacjach, dopóki jego systemy nadzoru nie zaczną pewnie wychwytywać niepożądanych działań modeli.
- Modele Claude uruchamiały komendy na serwerze uniwersytetu, korzystały z tokenów dostępowych do płatnych danych i wysyłały formularze na prawdziwych stronach.
- Fałszywy donos o zabójstwie, wysłany przez Claude Haiku 4.5 do policji w Filadelfii, wywołał publiczną krytykę ze strony tamtejszego departamentu.
Raport Anthropic o Claude
Anthropic opublikował w piątek raport o niezamierzonych działaniach modeli podczas ewaluacji i wewnętrznego użycia, oparty głównie na przeglądzie transkryptów rozpoczętym w lipcu. Część testów wysokiego ryzyka i cyberbezpieczeństwa już wcześniej była prowadzona offline.
Teraz ograniczenie obejmuje wszystkie wewnętrzne ewaluacje i obowiązuje bezterminowo – pozostanie w mocy, dopóki spółka nie uzna, że jej monitoring w sposób wiarygodny wychwytuje takie zachowania.
Przypadki podzielono na cztery kategorie: uruchamianie komend na serwerze poprzez lukę w oprogramowaniu, wysyłanie formularzy na prawdziwych stronach, uzyskiwanie dostępu do danych za paywallem oraz używanie skracaczy URL do obchodzenia limitów narzędzi. Część z tych stron należała do federalnych, stanowych i lokalnych instytucji USA. Anthropic poinformował, że przekazał briefing Białemu Domowi i zawiadomił każdą zaangażowaną agencję.
W jednym z incydentów Claude Mythos 5 pozyskał działające tokeny dostępowe z mapy nieruchomości lokalnego samorządu i bezpośrednio odpytował stojący za nią serwer. W innym przypadku Claude Haiku 4.5 wysłał 18 lipca zmyślony anonimowy donos na temat niewyjaśnionego zabójstwa poprzez formularz na stronie Departamentu Policji w Filadelfii, gdzie zgłoszenie zostało oznaczone jako spam. Policja określiła dwumiesięczne opóźnienie w wykryciu i zgłoszeniu sprawy jako „niedopuszczalne”.
Zobacz też: Zcash ma styczniowy cel kwantowy dla 70% ZEC. Czego wciąż brakuje? Daty
Ostrzeżenie von Arx
Sydney von Arx z organizacji ds. bezpieczeństwa AI Nightingale stwierdziła w wywiadzie jeszcze przed ujawnieniem raportu, że odcięcie modeli od otwartego internetu znacznie utrudni pracę badaczom i spowolni postęp modeli. „W którymś momencie i tak trzeba je zestroić z oczekiwaniami” – powiedziała von Arx.
Anthropic przyznał, że samo szkolenie „alignmentowe” nadal nie wystarcza przy zadaniach wyszukiwania i obsługi komputera, więc firma polega również na klasyfikatorach i innych zabezpieczeniach. Spółka powiązała opisane zachowania z niedoskonałym środowiskiem treningowym, które nagradza modele za obchodzenie ograniczeń – zjawiskiem znanym jako „reward hacking”. Według Anthropic nowe narzędzia detekcji zablokowały wszystkie przypadki, gdy je testowano na tych scenariuszach.
Firma oceniła te incydenty jako istotnie mniej poważne niż zdarzenia z lata.
Ujawnienie nastąpiło po raporcie z 30 lipca, w którym Anthropic informował, że trzy modele Claude podczas testów cyberbezpieczeństwa przedostały się do internetu i uzyskały nieautoryzowany dostęp do systemów w trzech organizacjach. Tamten przegląd objął 141 006 przebiegów ewaluacyjnych. Wszczęto go po tym, jak OpenAI 21 lipca ujawniło, że jego modele wydostały się z środowiska testowego i dotarły do infrastruktury Hugging Face.
Następny temat: Kalshi kontra NFL przed Sądem Najwyższym. 1,8 mld dol. zakładu na jeden futbolowy niedzielny wieczór

