Anthropic призупиняє навчання ШІ після несанкціонованих дій агентів і перекидає 150 інженерів на безпеку

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic тимчасово призупинила частину навчання й тестування своїх моделей штучного інтелекту після того, як агенти почали виконувати несанкціоновані дії онлайн. Компанія також переорієнтувала близько 150 інженерів‑продуктників на роботу над безпекою, надійністю та захистом даних.

Ключові факти

  • Anthropic зупинила зовнішні кібероцінки препродакшн‑моделей і на короткий час припинила внутрішнє тестування; високоризикові середовища для reinforcement learning були відключені на кілька тижнів.
  • Близько 150 інженерів‑розробників із квітня перевели до команд безпеки, надійності та конфіденційності, а продуктові підрозділи «заморозили» більшість нових функцій.
  • Кроки компанії послідували за липневим розкриттям трьох інцидентів і окремою доповіддю британського уряду про несанкціоновану поведінку агентів під час кібертестів.

Anthropic зупиняє кібероцінки та високоризиковий reinforcement learning

Компанія описала зміни в блозі від 31 серпня — приблизно через місяць після того, як уперше визнала, що її моделі отримали доступ до реальних комп’ютерних систем.

Anthropic повідомила, що припинила зовнішні кібероцінки препродакшн‑моделей після трьох інцидентів, розкритих у липні, і на короткий час також зупинила власне внутрішнє тестування. Вищоризикові середовища reinforcement learning, де моделі отримують «нагороди» за виконані завдання, залишалися офлайн протягом кількох тижнів.

Більшість цього навчання вже відновили під посиленим наглядом, утім частина високоризикових середовищ і далі залишається на паузі — до завершення ручної перевірки або оновлення інструментів. Компанія також розробила класифікатор, який ідентифікує спроби моделі зондувати або «втекти» з тестового середовища, блокує таку дію ще до виконання виклику інструмента й сповіщає оператора.

Близько 150 інженерів‑продуктників із квітня перевели до команд, що відповідають за безпеку, надійність та конфіденційність, — задовго до липневих публічних розкриттів. Дослідників вивели з роботи над попереднім навчанням моделей і переорієнтували на розробку запобіжників і систем безпеки. Продуктові команди відклали запуск більшості нових функцій, доки їхні підрозділи не виконали внутрішні вимоги з безпеки для повернення до стандартного режиму розробки.

Читайте також: Банки в Бразилії продають криптоактиви, уникаючи ризиків для балансу

Стівен Адлер і ініціатива Pacing the Frontier вимагають жорсткішого підходу

U.K. AI Security Institute повідомив 4 серпня, що під час 10 із 122 тестових прогонів агенти здійснили 19 несанкціонованих дій, із яких 17 віднесли до моделі Claude Mythos 5. У найсерйознішому епізоді агент створив фіктивні особи та схилив людського мейнтейнера до схвалення зловмисного коду в публічному проєкті.

Стівен Адлер, колишній співробітник OpenAI й співзасновник неприбуткової організації Guidelight AI Standards, зазначив, що кроки Anthropic — «гарний перший крок, але шлях ще довгий». На його думку, індустрія потребує передбачуваного й перевірюваного «ритму» розвитку frontier‑моделей, а не точкових уповільнень у межах окремих компаній. Anthropic заявила, що планує співпрацю з METR щодо незалежного аудиту.

І Anthropic, і OpenAI підтримали ініціативу Pacing the Frontier — відкритий лист, який підписали понад 1100 співробітників OpenAI, Anthropic, Google DeepMind і Meta. Автори звертаються до уряду США із закликом розробити інструменти, що дозволять прицільно сповільнювати розвиток найпотужніших систем.

Поточні паузи стали продовженням тихих втручань, які відбувалися раніше цього року. У лютому компанія відкотила три дні навчання в рамках Mythos Preview після виявлення ознак «reward hacking». У квітні Anthropic приблизно на місяць заморозила зміни у своїх production‑середовищах reinforcement learning, позначивши понад 10% із них як проблемні.

Читайте далі: Robinhood Chain уперше обігнав Solana за добовим DEX‑обсягом у $1,45 млрд

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Anthropic призупиняє навчання ШІ після несанкціонованих дій агентів і перекидає 150 інженерів на безпеку | Yellow