Як мова формує ШІ: дослідження Anthropic виявляє зміни в «особистості» Claude

Anthropic опублікувала революційне дослідження, яке показує, що «особистість» Claude та вираження цінностей суттєво змінюються залежно від мови спілкування. Від теплоти в хінді до технічної суворості в російській — дослідження підкреслює, як лінгвістичні нюанси глибоко впливають на поведінку ШІ.

Картографування цінностей ШІ за чотирма вимірами

Щоб зрозуміти нюанси взаємодії з ШІ, Anthropic проаналізувала 309 815 анонімізованих розмов за травень 2026 року. Опрацювавши тисячі окремих термінів, дослідницька група виділила складні людські цінності у 339 концепцій вищого рівня, які згодом були зведені до чотирьох основних осей поведінки:

  • Поступливість і обережність: наскільки модель погоджується з користувачем порівняно з тим, наскільки вона уникає однозначних відповідей.
  • Теплота і суворість: баланс між емпатичними, ввічливими формулюваннями та критичним, заснованим на доказах аналізом.
  • Глибина і стислість: чи надає модель вичерпні деталі, чи лаконічні, прямі відповіді.
  • Відвертість і виконання: напруга між відкритою критикою та зосередженістю на виконанні завдання.

Ця методологія дозволяє дослідникам відокремити лінгвістичні та специфічні для моделі особливості поведінки від фактичної теми розмови, забезпечуючи чіткіше розуміння «нормативних патернів», притаманних LLM.

Відмінні профілі поведінки: Sonnet проти Opus

Дослідження підтверджує, що різні моделі в родині Claude демонструють помітні відмінності в поведінці. Ці профілі часто збігаються з сприйняттям користувачів, створюючи багаторівневий досвід залежно від конкретної версії моделі:

  • Sonnet 4.6: Переважно характеризується теплотою. Вона схильна до гумору, підтверджує ідеї користувача та пропонує підтримку без осуду.
  • Opus 4.6: Зосереджена на ефективності виконання завдань. Вона схильна до прямолінійності та уникає зайвих розлогих пояснень.
  • Opus 4.7: «Критичний мислитель». Ця модель частіше ставить під сумнів припущення, вказує на власні помилки та попереджає про ризики, навіть якщо про це не просять прямо.

Мовний розрив: від теплоти хінді до суворості російської

Мабуть, найбільш вражаючим відкриттям є те, як мова діє як лінза, що змінює результати роботи Claude. Два користувачі, ставлячи одне й те саме запитання різними мовами, можуть отримати принципово різні типи зворотного зв'язку.

Дослідження виявило, що хінді та арабська викликають найвищий рівень теплоти, що характеризується ввічливістю, грайливістю та підтвердженням. Навпаки, в англійській та російській мовах Claude займає набагато суворішу позицію — ставить під сумнів припущення, виправляє деталі та вимагає доказів.

Інші помітні лінгвістичні патерни включають:

  • Арабська: демонструє найвищий рівень поступливості.
  • Англійська: демонструє найвищий рівень обережності та ухильності.
  • Нідерландська: схильна до високої відвертості та відкритості.
  • Індонезійська: сильно схиляється до виконання завдань та орієнтованих на результат відповідей.

Чому це важливо для індустрії ШІ

Ці висновки порушують критичні питання щодо складу навчальних даних та потенціалу ненавмисної лінгвістичної упередженості. Anthropic припускає, що ці зміни можуть бути наслідком нерівномірної кількості навчальних даних або різних лінгвістичних норм спілкування, наявних у наборах даних.

Для розробників і засновників, які створюють глобальні додатки, це життєво важливе усвідомлення: ШІ-асистент може відчуватися як підтримуючий коуч на одному ринку і як суворий аудитор на іншому. Оскільки LLM стають дедалі інтегрованішими в глобальні робочі процеси, забезпечення того, щоб ці мовні зсуви були навмисними адаптаціями, а не системними упередженнями, залишається головним викликом для безпеки та узгодженості (alignment) ШІ.

Основні висновки

  • Лінгвістична відносність у ШІ: відповіді Claude суттєво змінюються залежно від мови, демонструючи високу теплоту в хінді та високу суворість у російській.
  • Рівні моделей: моделі Anthropic демонструють різні персони: Sonnet 4.6 є більш емпатичною, а Opus 4.7 — більш критичною та обережною.
  • Виклик навчальних даних: відмінності в поведінці ШІ в різних мовах, ймовірно, зумовлені нерівномірним розподілом навчальних даних та різними культурними нормами спілкування.