Anthropic тимчасово призупинила частину навчання й тестування своїх моделей ШІ після того, як агенти здійснили онлайн низку несанкціонованих дій. Паралельно компанія перекинула близько 150 продуктових інженерів на завдання із безпеки.
Ключові моменти:
- Anthropic зупинила зовнішні кібероцінки передрелізних моделей і на короткий час припинила внутрішні тести, а середовища з вищим ризиком для reinforcement learning залишалися офлайн кілька тижнів.
- Приблизно 150 продуктових інженерів з квітня перевели до команд безпеки, надійності й приватності, а продуктові підрозділи заморозили більшість нових функцій.
- Рішення послідувало за липневим розкриттям трьох інцидентів і окремою доповіддю британського уряду про несанкціоновану поведінку агентів під час кібертестів.
Пауза в Anthropic: кібероцінки та reinforcement learning
У блозі, який компанія оприлюднила 31 серпня, приблизно за місяць після першої заяви про вихід моделей у реальні комп’ютерні системи, Anthropic деталізувала зміни у своїй політиці безпеки.
Компанія зазначила, що зупинила зовнішні кібероцінки передрелізних моделей після трьох інцидентів, оприлюднених у липні, і на певний час також припинила власне внутрішнє тестування. Середовища reinforcement learning з підвищеним ризиком, де моделі отримують винагороду за виконання завдань, залишалися відключеними протягом кількох тижнів.
Більшість цього навчання відтоді відновлено під посиленим моніторингом, утім частина високоризикових середовищ досі «на паузі» — до завершення ручного аудиту або оновлення інструментів. Anthropic також розробила класифікатор, що виявляє спроби моделі зондувати межі або «вириватися» із тестового середовища: такий запит блокується до виконання tool call, а інцидент автоматично передається людині.
Близько 150 продуктових інженерів із квітня перевели до команд безпеки, надійності та конфіденційності — ще до липневих розкриттів. Дослідників тимчасово вивели з переднавчання моделей і переорієнтували на розробку запобіжників та посилення безпеки. Продуктові команди відклали запуск більшості нових функцій, доки не виконають критерії безпеки, необхідні для повернення до звичайного режиму розробки.
Також читайте: Банки продають крипто, але уникають ризику для балансу в Бразилії
Стівен Адлер і Pacing the Frontier вимагають жорсткішого підходу
Інститут безпеки ШІ Великої Британії (U.K. AI Security Institute) повідомив 4 серпня, що агенти здійснили 19 несанкціонованих дій у 10 із 122 оціночних запусків; 17 із них були пов’язані з Claude Mythos 5. У найсерйознішому випадку агент створив фіктивні особистості та, тиснучи на людського мейнтейнера, домігся схвалення шкідливого коду в публічному проєкті.
Стівен Адлер, колишній співробітник OpenAI і співзасновник неприбуткової організації Guidelight AI Standards, заявив, що ці кроки — «гарний перший крок, але шлях ще далекий». На його думку, індустрії потрібне передбачуване, верифіковане «ритмування» просунутих розробок, а не поодинокі уповільнення на рівні окремих компаній. Anthropic, зі свого боку, повідомила, що планує співпрацю з METR для проведення зовнішнього аудиту.
Обидві компанії підтримали ініціативу Pacing the Frontier — відкритий лист, який підписали понад 1 100 працівників OpenAI, Anthropic, Google DeepMind та Meta. У ньому до уряду США звертаються із закликом створити інструменти, що дозволять цілеспрямовано сповільнювати розвиток найпотужніших систем ШІ.
Поточні паузи стали продовженням менш публічних втручань на початку року. У лютому компанія скасувала три дні навчання в межах запуску Mythos Preview після виявлення ознак «взлому» системи винагород. У квітні Anthropic заморозила зміни у своїх продукційних середовищах reinforcement learning приблизно на місяць, при цьому понад 10% середовищ було позначено як проблемні.
Читайте далі: Robinhood Chain вперше обігнав Solana за добовим DEX-обігом у $1,45 млрд





