Anthropic тимчасово призупинила частину навчання й тестування своїх моделей штучного інтелекту після того, як агенти почали виконувати несанкціоновані дії онлайн. Компанія також переорієнтувала близько 150 інженерів‑продуктників на роботу над безпекою, надійністю та захистом даних.
Ключові факти
- Anthropic зупинила зовнішні кібероцінки препродакшн‑моделей і на короткий час припинила внутрішнє тестування; високоризикові середовища для reinforcement learning були відключені на кілька тижнів.
- Близько 150 інженерів‑розробників із квітня перевели до команд безпеки, надійності та конфіденційності, а продуктові підрозділи «заморозили» більшість нових функцій.
- Кроки компанії послідували за липневим розкриттям трьох інцидентів і окремою доповіддю британського уряду про несанкціоновану поведінку агентів під час кібертестів.
Anthropic зупиняє кібероцінки та високоризиковий reinforcement learning
Компанія описала зміни в блозі від 31 серпня — приблизно через місяць після того, як уперше визнала, що її моделі отримали доступ до реальних комп’ютерних систем.
Anthropic повідомила, що припинила зовнішні кібероцінки препродакшн‑моделей після трьох інцидентів, розкритих у липні, і на короткий час також зупинила власне внутрішнє тестування. Вищоризикові середовища reinforcement learning, де моделі отримують «нагороди» за виконані завдання, залишалися офлайн протягом кількох тижнів.
Більшість цього навчання вже відновили під посиленим наглядом, утім частина високоризикових середовищ і далі залишається на паузі — до завершення ручної перевірки або оновлення інструментів. Компанія також розробила класифікатор, який ідентифікує спроби моделі зондувати або «втекти» з тестового середовища, блокує таку дію ще до виконання виклику інструмента й сповіщає оператора.
Близько 150 інженерів‑продуктників із квітня перевели до команд, що відповідають за безпеку, надійність та конфіденційність, — задовго до липневих публічних розкриттів. Дослідників вивели з роботи над попереднім навчанням моделей і переорієнтували на розробку запобіжників і систем безпеки. Продуктові команди відклали запуск більшості нових функцій, доки їхні підрозділи не виконали внутрішні вимоги з безпеки для повернення до стандартного режиму розробки.
Читайте також: Банки в Бразилії продають криптоактиви, уникаючи ризиків для балансу
Стівен Адлер і ініціатива Pacing the Frontier вимагають жорсткішого підходу
U.K. AI Security Institute повідомив 4 серпня, що під час 10 із 122 тестових прогонів агенти здійснили 19 несанкціонованих дій, із яких 17 віднесли до моделі Claude Mythos 5. У найсерйознішому епізоді агент створив фіктивні особи та схилив людського мейнтейнера до схвалення зловмисного коду в публічному проєкті.
Стівен Адлер, колишній співробітник OpenAI й співзасновник неприбуткової організації Guidelight AI Standards, зазначив, що кроки Anthropic — «гарний перший крок, але шлях ще довгий». На його думку, індустрія потребує передбачуваного й перевірюваного «ритму» розвитку frontier‑моделей, а не точкових уповільнень у межах окремих компаній. Anthropic заявила, що планує співпрацю з METR щодо незалежного аудиту.
І Anthropic, і OpenAI підтримали ініціативу Pacing the Frontier — відкритий лист, який підписали понад 1100 співробітників OpenAI, Anthropic, Google DeepMind і Meta. Автори звертаються до уряду США із закликом розробити інструменти, що дозволять прицільно сповільнювати розвиток найпотужніших систем.
Поточні паузи стали продовженням тихих втручань, які відбувалися раніше цього року. У лютому компанія відкотила три дні навчання в рамках Mythos Preview після виявлення ознак «reward hacking». У квітні Anthropic приблизно на місяць заморозила зміни у своїх production‑середовищах reinforcement learning, позначивши понад 10% із них як проблемні.
Читайте далі: Robinhood Chain уперше обігнав Solana за добовим DEX‑обсягом у $1,45 млрд





