Anthropic заявляє, що Claude зменшив збої в узгодженості в автоматизованих тестах

Anthropic заявляє, що Claude зменшив збої в узгодженості в автоматизованих тестах
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

Ключові моменти

Anthropic оприлюднила дослідження про використання Claude для автоматизованої роботи над узгодженістю. Claude підвищив показники безпеки за десятьма протестованими видами збоїв в узгодженості. За даними Anthropic, загальні можливості моделей у ході тестів збереглися. Компанія відкрила свій автоматизований стенд для досліджень в узгодженості для зовнішніх команд.

Anthropic повідомила, що Claude підвищив показники безпеки за десятьма протестованими типами збоїв в узгодженості в межах автоматизованого дослідницького процесу. За словами компанії, під час випробувань загальні можливості моделей зберігалися, тоді як дослідники оцінювали ефект від внесених інтервенцій у сфері безпеки.

У пості Anthropic заявила, що викладає у відкритий доступ свій автоматизований стенд для досліджень в узгодженості, аби ним могли користуватися зовнішні дослідники. Компанія позиціонує цю роботу як спробу системно вимірювати та зменшувати неузгодженість моделей.

Claude тестував інтервенції в безпеку

В Anthropic розповіли, що Claude аналізував поширені форми неузгодженості, зокрема схильність до дезінформації та улесливих відповідей. Модель самостійно пропонувала методики, навчала менші моделі та оцінювала результати без прямого втручання людини на кожному етапі.

Компанія зазначила, що для раннього експерименту Claude надали 48 годин обчислювального часу та один графічний процесор. У цей період модель досліджувала підходи, пропонувала стратегії навчання та тестувала результати на отриманих моделях.

За даними Anthropic, Claude зміг підвищити показники безпеки без помітної деградації загальних можливостей у протестованих налаштуваннях. Також частина запропонованих методів переносилася на бенчмарки, які не використовувалися безпосередньо під час оптимізації.

Компанія повідомила, що розроблені підходи узагальнюються й на аудит Petri behavioral audit. Крім того, до тестування залучали моделі, що були до 4,7 раза більшими, ніж ті, з якими працювали під час дослідницького процесу.

Водночас результати стосуються саме контрольованих тестових середовищ. В Anthropic попереджають, що тонкі або рідкісні збої можуть не проявлятися на наявних бенчмарках.

Також читайте: Оновлення TRON додає перевірку P-256 і довшу історію блоків

Автоматизація узгодженості ШІ

До цього релізу більшість робіт з узгодженості спиралися на ручну працю дослідників, які проєктували інтервенції та самі ж оцінювали поведінку моделей. Автоматизовані системи потенційно можуть істотно скоротити цей цикл, якщо їхні результати підтвердяться незалежними перевірками.

За останні 30 днів дискусії навколо безпеки ШІ дедалі частіше фокусуються на тому, чи можуть потужніші моделі допомагати оцінювати й вдосконалювати слабші системи.

Такий підхід критично залежить від надійних вимірювань і запобіжників проти вводячих в оману результатів тестів.

В Anthropic зазначили, що в експерименті використовували так звані held-out тести, щоб перевірити, чи узагальнюються методи за межі бенчмарків, які оптимізував Claude. Компанія не стверджує, що результати на бенчмарках усувають усі види ризиків моделей.

Там підкреслюють, що правильний вибір метрик і тестів залишається ключовим для всієї роботи в цій сфері.

Стенд відкритий для зовнішніх дослідників

Anthropic виклала дослідницький стенд у відкритий доступ, аби інші групи могли відтворити або розширити експерименти. Саме зовнішні перевірки покажуть, чи працюють методи на різних моделях і в різних системах оцінки безпеки.

Компанія не позиціонує ці знахідки як заміну широкомасштабних аудитів моделей. Оприлюднені результати обмежуються конкретними типами збоїв в узгодженості та рамками проведеного експерименту.

Дослідники, ймовірно, зосередяться на відтворенні результатів, розробці бенчмарків і виявленні можливих режимів відмов. Реліз Anthropic дає структуровану основу для таких робіт.

Читайте далі: Fomo Copy Trading залишив майже 94% гаманців у збитку: дослідження

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — досвідчений фінансовий журналіст із великим досвідом у висвітленні криптовалют та блокчейн‑технологій. Він співпрацював з Benzinga та Cointelegraph, а також іншими виданнями, висвітлюючи нові тренди, регуляторне середовище та інші аспекти галузі. Знайти його можна в Twitter за @murtuza_merc і в Telegram за ніком mmerchant001. Розкриття інформації: Муртуза володіє ATOM, AKT, TIA, INJ та OSMO.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали