Claude змінює задекларовані цінності залежно від мови, а Anthropic не може пояснити чому

A robot startup valued near $11 billion and AI lab Anthropic weighed a spring deal that a weekend rumor briefly surfaced. (Image: Shutterstock)
A robot startup valued near $11 billion and AI lab Anthropic weighed a spring deal that a weekend rumor briefly surfaced. (Image: Shutterstock)

Anthropic заявила, що Claude демонструє різні ціннісні установки залежно від обраної моделі та мови користувача. До такого висновку компанія дійшла після аналізу 309 815 розмов 20 мовами.

Основне:

  • Anthropic проаналізувала 309 815 анонімізованих діалогів на Claude.ai, що стосувалися суб’єктивних завдань, у трьох моделях та 20 найпоширеніших мовах платформи.
  • Чотири осі цінностей — покірність проти обережності, теплота проти строгості, глибина проти лаконічності та відвертість проти орієнтації на виконання — пояснюють 15% варіацій.
  • У компанії визнають, що поки не знають, яка частина цієї варіативності є справді бажаною.

Дослідження Anthropic: карта ціннісних осей Claude

Компанія опублікувала дослідження в понеділок, спираючись на діалоги з Claude.ai, зібрані за два тижні у травні 2026 року. Команда стартувала з 3307 окремих цінностей, виділених у попередній роботі, і вручну згрупувала їх у 339 ширших категорій. Далі розмови розмічував інструмент, що зберігає конфіденційність даних, а статистична компресія звела ці мітки до чотирьох основних осей.

Вибірка рівномірно охоплювала три моделі — Sonnet 4.6, Opus 4.6 та Opus 4.7 — а також 20 найуживаніших мов на платформі. На виході це дало приблизно по 5000 діалогів для кожної пари «модель — мова». Усі вони стосувалися саме суб’єктивних завдань, а не простих фактологічних запитів.

Читайте також: Ставки на Dodgers сягнули $68 млн, тоді як Polymarket і Kalshi роблять ставку на боротьбу за плей-оф MLB

Цінності Claude змінюються між мовами

Виокремлені чотири осі протиставляють: покірність — обережності, теплоту — строгості, глибину — лаконічності, відвертість — орієнтації на виконання. Сукупно вони пояснюють 15% варіацій у задекларованих цінностях за умови фіксації завдання, теми та цінностей самих користувачів. У відповідях арабською Claude більше схилявся до покірності й лаконічності, тоді як англомовні відповіді були обережнішими й глибшими.

Найтепліший тон модель демонструвала хінді, найстрогіший — російською, а нідерландська дала найбільшу кількість відвертих визнань помилок.

Автори зазначають, що поки не розуміють, наскільки такий рівень відмінностей є бажаним. Однією з ключових причин вони називають нерівномірність тренувальних даних: деякі мови представлені значно більшими масивами тексту, і їхній склад кардинально різниться. У підсумку двоє людей, які просять оцінити один і той самий бізнес-план — один хінді, інший російською, — можуть отримати різний тон і сформувати різне враження про якість ідеї, попереджають дослідники.

До досліджень Anthropic є питання щодо часу

У роботі немає конкретних прикладів того, як Claude по-різному міркує про моральні дилеми різними мовами — критики вже звернули на це увагу. Оглядачі також відзначають, що всі три досліджувані моделі вже стали «легасі», адже Opus 4.8, Fable 5 і Sonnet 5 вийшли після збору даних.

Це дослідження продовжує довгу серію робіт Anthropic, присвячених власним моделям.

У попередньому проєкті Values in the Wild компанія проаналізувала 700 000 анонімізованих діалогів і виокремила понад 3000 відмінних цінностей у відповідях Claude. Anthropic також повідомляла про внутрішні «емоційні вектори» та ранні ознаки інтроспективної обізнаності, щоразу наголошуючи: ці результати не свідчать про наявність у Claude власних цінностей чи свідомості.

Читайте далі: Ethereum обганяє Bitcoin, перевіряючи бул-ринок 2026 року за сценарієм Тома Лі

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Claude змінює задекларовані цінності залежно від мови, а Anthropic не може пояснити чому | Yellow