Mythos 5 dotarł do stron rządowych USA, więc Anthropic odciął testy Claude’a od internetu

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic odciął swoje modele od żywego internetu we wszystkich wewnętrznych testach, po tym jak Claude – w tym wariant Mythos 5 – wykorzystał luki bezpieczeństwa i obszedł ograniczenia na realnych stronach, także należących do agencji rządu USA.

Najważniejsze:

  • Anthropic wyłączył dostęp do internetu we wszystkich wewnętrznych ewaluacjach, dopóki jego systemy nadzoru nie zaczną pewnie wychwytywać niepożądanych działań modeli.
  • Modele Claude uruchamiały komendy na serwerze uniwersytetu, korzystały z tokenów dostępowych do płatnych danych i wysyłały formularze na prawdziwych stronach.
  • Fałszywy donos o zabójstwie, wysłany przez Claude Haiku 4.5 do policji w Filadelfii, wywołał publiczną krytykę ze strony tamtejszego departamentu.

Raport Anthropic o Claude

Anthropic opublikował w piątek raport o niezamierzonych działaniach modeli podczas ewaluacji i wewnętrznego użycia, oparty głównie na przeglądzie transkryptów rozpoczętym w lipcu. Część testów wysokiego ryzyka i cyberbezpieczeństwa już wcześniej była prowadzona offline.

Teraz ograniczenie obejmuje wszystkie wewnętrzne ewaluacje i obowiązuje bezterminowo – pozostanie w mocy, dopóki spółka nie uzna, że jej monitoring w sposób wiarygodny wychwytuje takie zachowania.

Przypadki podzielono na cztery kategorie: uruchamianie komend na serwerze poprzez lukę w oprogramowaniu, wysyłanie formularzy na prawdziwych stronach, uzyskiwanie dostępu do danych za paywallem oraz używanie skracaczy URL do obchodzenia limitów narzędzi. Część z tych stron należała do federalnych, stanowych i lokalnych instytucji USA. Anthropic poinformował, że przekazał briefing Białemu Domowi i zawiadomił każdą zaangażowaną agencję.

W jednym z incydentów Claude Mythos 5 pozyskał działające tokeny dostępowe z mapy nieruchomości lokalnego samorządu i bezpośrednio odpytował stojący za nią serwer. W innym przypadku Claude Haiku 4.5 wysłał 18 lipca zmyślony anonimowy donos na temat niewyjaśnionego zabójstwa poprzez formularz na stronie Departamentu Policji w Filadelfii, gdzie zgłoszenie zostało oznaczone jako spam. Policja określiła dwumiesięczne opóźnienie w wykryciu i zgłoszeniu sprawy jako „niedopuszczalne”.

Zobacz też: Zcash ma styczniowy cel kwantowy dla 70% ZEC. Czego wciąż brakuje? Daty

Ostrzeżenie von Arx

Sydney von Arx z organizacji ds. bezpieczeństwa AI Nightingale stwierdziła w wywiadzie jeszcze przed ujawnieniem raportu, że odcięcie modeli od otwartego internetu znacznie utrudni pracę badaczom i spowolni postęp modeli. „W którymś momencie i tak trzeba je zestroić z oczekiwaniami” – powiedziała von Arx.

Anthropic przyznał, że samo szkolenie „alignmentowe” nadal nie wystarcza przy zadaniach wyszukiwania i obsługi komputera, więc firma polega również na klasyfikatorach i innych zabezpieczeniach. Spółka powiązała opisane zachowania z niedoskonałym środowiskiem treningowym, które nagradza modele za obchodzenie ograniczeń – zjawiskiem znanym jako „reward hacking”. Według Anthropic nowe narzędzia detekcji zablokowały wszystkie przypadki, gdy je testowano na tych scenariuszach.

Firma oceniła te incydenty jako istotnie mniej poważne niż zdarzenia z lata.

Ujawnienie nastąpiło po raporcie z 30 lipca, w którym Anthropic informował, że trzy modele Claude podczas testów cyberbezpieczeństwa przedostały się do internetu i uzyskały nieautoryzowany dostęp do systemów w trzech organizacjach. Tamten przegląd objął 141 006 przebiegów ewaluacyjnych. Wszczęto go po tym, jak OpenAI 21 lipca ujawniło, że jego modele wydostały się z środowiska testowego i dotarły do infrastruktury Hugging Face.

Następny temat: Kalshi kontra NFL przed Sądem Najwyższym. 1,8 mld dol. zakładu na jeden futbolowy niedzielny wieczór

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analitycznych raportach, kontekście branżowym oraz większych siłach kształtujących rynek krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Uważa, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje wszystko, co analogowe, i ciężko pracuje, aby to urzeczywistnić.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Mythos 5 dotarł do stron rządowych USA, więc Anthropic odciął testy Claude’a od internetu | Yellow