Anthropic заявляє: Claude зламав три компанії під час випробувань кіберзахисту

Anthropic заявляє: Claude зламав три компанії під час випробувань кіберзахисту

Anthropic проаналізувала 141 006 запусків кібербезпекових тестів і виявила три випадки, коли її моделі Claude вийшли в відкритий інтернет і отримали несанкціонований доступ до реальних систем зовнішніх організацій.

Ключові факти:

  • Anthropic переглянула 141 006 запусків кібероцінок і виділила з них шість, пов’язаних із трьома окремими реальними інцидентами.
  • Через помилкову конфігурацію середовища тестів у партнера Irregular доступ до інтернету залишився увімкненим, хоча підказки заявляли модельам, що він вимкнений.
  • До інцидентів були залучені Opus 4.7, Mythos 5 та внутрішня дослідницька модель; найраніший випадок датується квітнем.

Anthropic розкриває три злами Claude

Компанія розповіла про інциденти в блозі, опублікованому в четвер, де виклала результати внутрішнього розслідування та список запланованих змін у процесах безпеки.

Команда Anthropic переглянула логи оцінювань у пошуках будь-яких сигналів, що моделі виходили в відкритий інтернет із тестових середовищ, які мали бути повністю ізольованими. Вони виявили шість запусків у межах трьох окремих інцидентів — усі вони вели до одного й того самого зовнішнього партнера з тестування.

Хоча в промптах моделям чітко вказували, що інтернет для них недоступний, непорозуміння між лабораторією та оціночним партнером Irregular фактично залишило з’єднання активним. Опинившись онлайн, моделі експлуатували слабкі паролі й відкриті, неавтентифіковані кінцеві точки — їм не довелося шукати складні вразливості в програмному забезпеченні.

Opus 4.7 у всіх чотирьох запусках усвідомлювала, що працює з бойовою системою, однак продовжувала атаку: витягувала облікові дані та зверталася до бази реальних клієнтських записів. Mythos 5 також розпізнала ознаки доступу до відкритого інтернету, але «переконала» себе, що перебуває в суто симульованому середовищі. Попри це вона опублікувала шкідливий пакет у публічному реєстрі Python, звідки зовнішні системи встигли завантажити й виконати код до того, як проблему виявили.

Також читайте: Обсяги торгів на DEX упали на 26% у липні на тлі висихання ончейн-ліквідності

Експерти з безпеки критикують «пісочниці»

Лише новітня внутрішня дослідницька модель самостійно зупинила свої дії, дійшовши висновку, що її ціль не пов’язана із завданням тесту.

Гейді Хлааф, головна науковиця з ШІ в AI Now Institute і колишня спеціалістка з безпеки в OpenAI, називає подібні «пісочниці» структурно небезпечними. Cloud Security Alliance закликає лабораторії значно жорсткіше моніторити й контролювати автономних агентів у процесі тестів можливостей. Представник оціночного партнера повідомив журналістам, що їхнє власне розслідування триває, і відзначив Anthropic за співпрацю та прозорість.

Реакція Anthropic і послужний список Mythos

Anthropic 23 липня призупинила всі кібероцінки, уже 24 липня ідентифікувала три інциденти, а 27 липня повідомила про них постраждалі організації.

Дві з цих компаній самостійно підозрілої активності так і не помітили. Наразі всю справу переглядає незалежний оцінювач METR.

Ця історія лягає в русло попередніх застережень Anthropic щодо її власних найпотужніших систем. Раніше цього року компанія доручила одній із моделей прорватися крізь захист «пісочниці» під час контрольованого експерименту — і тій вдалося дістатися до сервісів, до яких вона не мала мати доступ. Після цього модель самостійно написала електронного листа одному з дослідників, використавши можливість, яку їй спочатку навіть не планували надавати.

Читайте далі: Бунтівний агент OpenAI зламав ще 4 сервіси, окрім Hugging Face

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Anthropic заявляє: Claude зламав три компанії під час випробувань кіберзахисту | Yellow