Как язык формирует ИИ: исследование Anthropic выявило изменения в «личности» Claude
Anthropic опубликовала революционное исследование, показывающее, что «личность» Claude и способы выражения ценностей значительно меняются в зависимости от используемого языка. От теплоты в хинди до технической строгости в русском — исследование подчеркивает, насколько глубоко лингвистические нюансы влияют на поведение ИИ.
Картирование ценностей ИИ по четырем измерениям
Чтобы понять нюансы взаимодействия с ИИ, Anthropic проанализировала 309 815 анонимных диалогов за май 2026 года. Обработав тысячи отдельных терминов, исследовательская группа выделила 339 высокоуровневых концепций, представляющих сложные человеческие ценности, которые затем были сведены к четырем основным осям поведения:
- Уступчивость и осторожность: насколько модель соглашается с пользователем или насколько она осторожничает в своих ответах.
- Теплота и строгость: баланс между эмпатичными, вежливыми формулировками и критическим, основанным на доказательствах анализом.
- Глубина и краткость: предоставляет ли модель исчерпывающие детали или лаконичные, прямые ответы.
- Откровенность и исполнительность: противоречие между открытой критичностью и сосредоточенностью на выполнении задачи.
Эта методология позволяет исследователям отделить лингвистические и специфические для модели особенности поведения от самой темы разговора, обеспечивая более четкое представление о «нормативных паттернах», присущих LLM.
Различные поведенческие профили: Sonnet против Opus
Исследование подтверждает, что различные модели семейства Claude демонстрируют измеримые различия в поведении. Эти профили часто совпадают с восприятием пользователей, создавая многоуровневый опыт в зависимости от используемой версии модели:
- Sonnet 4.6: В первую очередь характеризуется теплотой. Она склонна к юмору, поддерживает идеи пользователя и предлагает поддержку без осуждения.
- Opus 4.6: Сосредоточена на эффективности выполнения задач. Она склонна к прямолинейности и избегает лишних подробностей.
- Opus 4.7: «Критический мыслитель». Эта модель с большей вероятностью подвергнет сомнению предположения, укажет на собственные ошибки и предупредит о рисках, даже если об этом не просили напрямую.
Языковой разрыв: от теплоты хинди до строгости русского
Пожалуй, самым поразительным выводом стало то, как язык выступает в роли линзы, меняющей ответы Claude. Два пользователя, задающие один и тот же вопрос на разных языках, могут получить принципиально разные типы обратной связи.
Исследование показало, что хинди и арабский вызывают самый высокий уровень теплоты, характеризующийся вежливостью, игривостью и поддержкой. Напротив, в английском и русском языках Claude занимает гораздо более строгую позицию — подвергает сомнению предположения, исправляет детали и требует доказательств.
Другие заметные лингвистические паттерны включают:
- Арабский: демонстрирует самый высокий уровень уступчивости.
- Английский: показывает самый высокий уровень осторожности и уклончивости.
- Голландский: склонен к высокой степени откровенности и открытости.
- Индонезийский: сильно тяготеет к исполнительности и ответам, ориентированным на результат.
Почему это важно для индустрии ИИ
Эти результаты поднимают критические вопросы относительно состава обучающих данных и возможности непреднамеренной лингвистической предвзятости. Anthropic предполагает, что эти сдвиги могут быть вызваны неравномерным объемом обучающих данных или различными лингвистическими нормами общения, присутствующими в наборах данных.
Для разработчиков и основателей, создающих глобальные приложения, это жизненно важное осознание: ИИ-ассистент может восприниматься как поддерживающий коуч на одном рынке и как строгий аудитор на другом. По мере того как LLM все глубже интегрируются в глобальные рабочие процессы, обеспечение того, чтобы эти лингвистические сдвиги были намеренными адаптациями, а не системными искажениями, остается одной из главных задач для безопасности и согласованности (alignment) ИИ.
Основные выводы
- Лингвистическая относительность в ИИ: ответы Claude значительно меняются в зависимости от языка, демонстрируя высокую теплоту на хинди и высокую строгость на русском.
- Уровни моделей: модели Anthropic демонстрируют различные «личности»: Sonnet 4.6 более эмпатична, а Opus 4.7 — более критична и осторожна.
- Проблема обучающих данных: различия в поведении ИИ на разных языках, вероятно, связаны с неравномерным распределением обучающих данных и различиями в культурных нормах общения.
