Основне
Anthropic оприлюднила дослідження, у якому Claude автоматично проводив роботу з вирівнювання ШІ.
Claude підвищив показники безпеки за 10 протестованими типами збоїв вирівнювання.
Anthropic заявляє, що загальні можливості моделей збереглися під час тестів.
Компанія також відкрила автоматизований набір інструментів для досліджень з вирівнювання для сторонніх команд.
Anthropic повідомила, що Claude зміг підвищити показники безпеки за 10 типами збоїв вирівнювання в межах автоматизованого дослідницького процесу. За даними компанії, під час цих експериментів загальні можливості моделей зберігалися, тоді як дослідники оцінювали ефективність різних інтервенцій із безпеки.
У пості Anthropic заявила, що відкрила свій автоматизований стек для досліджень з вирівнювання для зовнішніх дослідників. Компанія описує роботу як спробу точніше вимірювати та зменшувати розрив між поведінкою моделей і бажаними нормами.
Як Claude тестував заходи безпеки
За словами Anthropic, Claude аналізував поширені форми розбалансування моделей, зокрема схильність до обману та підлесливу поведінку. Модель пропонувала методики, тренувала менші моделі й оцінювала результати без прямого втручання людини на кожному етапі.
В одному з ранніх експериментів Claude надали 48 годин обчислювального часу й один графічний процесор. У цей період модель досліджувала підходи, пропонувала стратегії навчання та тестувала отримані моделі.
В Anthropic зазначають, що Claude підвищив показники безпеки без помітної деградації загальних можливостей моделей у протестованих сценаріях. Окремі методики, за оцінкою компанії, переносилися й на ті бенчмарки, які не використовувалися безпосередньо під час оптимізації.
Компанія повідомила, що методи також узагальнювалися на поведенковий аудит Petri. Крім того, тести охоплювали моделі, які були до 4,7 раза більшими за ті, що використовувалися безпосередньо в дослідницькому циклі.
Водночас ці результати стосуються насамперед контрольованих тестових середовищ. В Anthropic попереджають, що приховані або дуже рідкісні збої можуть не проявлятися у наявних бенчмарках.
Читайте також: Оновлення TRON додає верифікацію P-256 і довшу історію блоків
Автоматизація вирівнювання ШІ
До публікації цього дослідження робота з вирівнювання зазвичай спиралася на ручну працю дослідників, які проєктували інтервенції та оцінювали поведінку моделей. Автоматизовані підходи потенційно можуть суттєво скоротити цей цикл — за умови, що результати витримають незалежну перевірку.
Протягом останніх 30 днів дискусії в сфері безпеки ШІ дедалі частіше зосереджуються на тому, чи можуть потужніші моделі допомагати у перевірці та покращенні слабших систем.
Такий підхід критично залежить від надійності вимірювань і захисту від «косметичних» покращень у бенчмарках, які не відображають реальні ризики. Anthropic зазначає, що у своєму експерименті використовувала відкладені тести (held‑out), аби перевірити, чи справді методи узагальнюються за межі тих бенчмарків, на які орієнтувався Claude під час оптимізації. Компанія не стверджує, що отримані результати повністю усувають усі ризики, пов’язані з моделями.
В Anthropic наголошують: коректний добір метрик і тестів залишається ключовим елементом роботи з вирівнювання.
Набір інструментів відкритий для зовнішніх дослідників
Anthropic оприлюднила свій дослідницький стек, щоб інші групи могли відтворити або розширити експерименти. Саме зовнішні тести покажуть, чи працюють ці методики на різних моделях і в різних рамках оцінки безпеки.
Водночас компанія не позиціонує результати як заміну ширшим аудитам моделей. Оприлюднені висновки обмежені конкретними збоями вирівнювання і рамками проведених експериментів.
Очікується, що дослідницька спільнота зосередиться на відтворюваності результатів, проєктуванні нових бенчмарків і виявленні потенційних режимів відмов. Публікація Anthropic фактично створює інфраструктуру для таких робіт.
Читайте далі: Fomo Copy Trading залишив майже 94% гаманців у збитку: дослідження

