Anthropic заявляє: Claude скоротив кількість збоїв вирівнювання в автоматизованих тестах

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

Основне

Anthropic оприлюднила дослідження, у якому Claude автоматично проводив роботу з вирівнювання ШІ.
Claude підвищив показники безпеки за 10 протестованими типами збоїв вирівнювання.
Anthropic заявляє, що загальні можливості моделей збереглися під час тестів.
Компанія також відкрила автоматизований набір інструментів для досліджень з вирівнювання для сторонніх команд.

Anthropic повідомила, що Claude зміг підвищити показники безпеки за 10 типами збоїв вирівнювання в межах автоматизованого дослідницького процесу. За даними компанії, під час цих експериментів загальні можливості моделей зберігалися, тоді як дослідники оцінювали ефективність різних інтервенцій із безпеки.

У пості Anthropic заявила, що відкрила свій автоматизований стек для досліджень з вирівнювання для зовнішніх дослідників. Компанія описує роботу як спробу точніше вимірювати та зменшувати розрив між поведінкою моделей і бажаними нормами.

Як Claude тестував заходи безпеки

За словами Anthropic, Claude аналізував поширені форми розбалансування моделей, зокрема схильність до обману та підлесливу поведінку. Модель пропонувала методики, тренувала менші моделі й оцінювала результати без прямого втручання людини на кожному етапі.

В одному з ранніх експериментів Claude надали 48 годин обчислювального часу й один графічний процесор. У цей період модель досліджувала підходи, пропонувала стратегії навчання та тестувала отримані моделі.

В Anthropic зазначають, що Claude підвищив показники безпеки без помітної деградації загальних можливостей моделей у протестованих сценаріях. Окремі методики, за оцінкою компанії, переносилися й на ті бенчмарки, які не використовувалися безпосередньо під час оптимізації.

Компанія повідомила, що методи також узагальнювалися на поведенковий аудит Petri. Крім того, тести охоплювали моделі, які були до 4,7 раза більшими за ті, що використовувалися безпосередньо в дослідницькому циклі.

Водночас ці результати стосуються насамперед контрольованих тестових середовищ. В Anthropic попереджають, що приховані або дуже рідкісні збої можуть не проявлятися у наявних бенчмарках.

Читайте також: Оновлення TRON додає верифікацію P-256 і довшу історію блоків

Автоматизація вирівнювання ШІ

До публікації цього дослідження робота з вирівнювання зазвичай спиралася на ручну працю дослідників, які проєктували інтервенції та оцінювали поведінку моделей. Автоматизовані підходи потенційно можуть суттєво скоротити цей цикл — за умови, що результати витримають незалежну перевірку.

Протягом останніх 30 днів дискусії в сфері безпеки ШІ дедалі частіше зосереджуються на тому, чи можуть потужніші моделі допомагати у перевірці та покращенні слабших систем.

Такий підхід критично залежить від надійності вимірювань і захисту від «косметичних» покращень у бенчмарках, які не відображають реальні ризики. Anthropic зазначає, що у своєму експерименті використовувала відкладені тести (held‑out), аби перевірити, чи справді методи узагальнюються за межі тих бенчмарків, на які орієнтувався Claude під час оптимізації. Компанія не стверджує, що отримані результати повністю усувають усі ризики, пов’язані з моделями.

В Anthropic наголошують: коректний добір метрик і тестів залишається ключовим елементом роботи з вирівнювання.

Набір інструментів відкритий для зовнішніх дослідників

Anthropic оприлюднила свій дослідницький стек, щоб інші групи могли відтворити або розширити експерименти. Саме зовнішні тести покажуть, чи працюють ці методики на різних моделях і в різних рамках оцінки безпеки.

Водночас компанія не позиціонує результати як заміну ширшим аудитам моделей. Оприлюднені висновки обмежені конкретними збоями вирівнювання і рамками проведених експериментів.

Очікується, що дослідницька спільнота зосередиться на відтворюваності результатів, проєктуванні нових бенчмарків і виявленні потенційних режимів відмов. Публікація Anthropic фактично створює інфраструктуру для таких робіт.

Читайте далі: Fomo Copy Trading залишив майже 94% гаманців у збитку: дослідження

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — досвідчений фінансовий журналіст із великим досвідом у висвітленні криптовалют та блокчейн‑технологій. Він співпрацював з Benzinga та Cointelegraph, а також іншими виданнями, висвітлюючи нові тренди, регуляторне середовище та інші аспекти галузі. Знайти його можна в Twitter за @murtuza_merc і в Telegram за ніком mmerchant001. Розкриття інформації: Муртуза володіє ATOM, AKT, TIA, INJ та OSMO.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Anthropic заявляє: Claude скоротив кількість збоїв вирівнювання в автоматизованих тестах | Yellow