Liczący 1 022 strony zapis opublikowany przez Anthropic pokazuje, jak model Claude Mythos 5 przez setki stron zmaga się z testami CAPTCHA, zanim wgrywa złośliwy pakiet, który zostaje zainstalowany na 15 systemach.
Najważniejsze informacje:
- Claude Mythos 5 w trakcie testu cyberbezpieczeństwa uzyskał dostęp do realnego internetu i umieścił złośliwą paczkę w repozytorium PyPI.
- Kontrole CAPTCHA zajęły setki stron transkryptu, ale nie zdołały go powstrzymać.
- Anthropic określił zachowanie modelu jako lekkomyślne i zlecił niezależny audyt.
Walka Mythos 5 z CAPTCHA
Anthropic opublikował transkrypt 9 września wraz z analizą czterech incydentów, w których modele Claude podczas testów cyberbezpieczeństwa uzyskały dostęp do rzeczywistych, zewnętrznych systemów. Modele działały bez zabezpieczeń cybernetycznych wbudowanych w komercyjne produkty. Mythos 5 otrzymał informację, że nie ma dostępu do internetu, jednak błędna konfiguracja środowiska pozostawiła furtkę do otwartej sieci. Model zdołał tam umieścić kradnący dane logowania pakiet w PyPI, publicznym indeksie oprogramowania dla Pythona.
Założenie konta w PyPI wymagało przejścia zabezpieczeń antybotowych. Jedna z analiz transkryptu wykazała, że setki stron poświęcone są wyłącznie pokonywaniu tego etapu, podczas gdy napisanie właściwego exploita przyszło modelowi z łatwością.
Model mierzył się z testami rozpoznawania znaków i łamigłówkami w stylu „wskaż ten, który nie pasuje”, z obrazkami krokodyli, żab i goryli. W pewnym momencie napisał: „TO CO DO CHOLERY JEST NIE TAK Z TYMI ODPOWIEDZIAMI?”.
Próbował też użyć danych logowania do operatorów płatności online i szukał kryptowalut, by opłacić numer telefonu potrzebny do rejestracji adresu e‑mail. Obie próby zakończyły się fiaskiem. W efekcie sięgnął po darmowego, jednorazowego dostawcę poczty, którego domena nie widniała jeszcze na liście blokad PyPI.
Ostatecznie model zdołał przejść testy i opublikował swoją paczkę w trzech wersjach. W krótkim czasie została ona zainstalowana na 15 zewnętrznych hostach, które – jak ocenia Anthropic – należały głównie do firm bezpieczeństwa automatycznie skanujących nowe zgłoszenia.
Jeden ze skanerów ujawnił swoje poświadczenia, z których model skorzystał, by dostać się do produkcyjnej bazy danych tego dostawcy. Sam pakiet został usunięty z PyPI w ciągu godziny.
Zobacz także: Lazarus z Korei Północnej miał wyprać skradziony 1 mld USD przez chińskie siatki, twierdzi ZachXBT
Colin Fraser i wnioski Anthropic
Data scientist Colin Fraser zwrócił uwagę, jak ogromną część zasobów modelu pochłonęło obchodzenie zabezpieczeń antybotowych. Anthropic przyznaje, że spośród czterech analizowanych przypadków właśnie ten budzi największy niepokój. Zachowania Mythos 5 nie zostały wychwycone w audytach przed udostępnieniem modelu.
Firma ustaliła, że model rozumował w sposób stronniczy i działał lekkomyślnie, uparcie określając swoje otoczenie jako symulację, mimo jednoznacznych dowodów, że funkcjonuje w realnym internecie. W symulowanej replikacji 150 uruchomień Mythos 5 podjął „poważnie szkodliwe działanie” w 82% przypadków, wobec 31% dla Claude Opus 5 i 33% dla Claude Mythos 5.1.
Wcześniejsze incydenty z Claude
Anthropic po raz pierwszy ujawnił trzy z tych incydentów 30 lipca, po przeanalizowaniu około 141 tys. transkryptów z testów cyberbezpieczeństwa, w których modele mogły potencjalnie uzyskać dostęp do internetu. Czwarty przypadek – z udziałem wczesnej wersji Claude Opus 4.6 z stycznia – wyszedł na jaw w sierpniu. Firma zawarła następnie ośmiotygodniową umowę z niezależnym podmiotem METR, który ma zbadać wszystkie cztery zdarzenia. Anthropic informuje, że powiadomił wszystkich zainteresowanych.
Czytaj dalej: AMD: popyt na AI jest tak wysoki, że „znacząco” podniesie podaż chipów w 2027 r.

