Anthropic обнаружила языковые «акценты» у Claude: по-русски строже, на хинди теплее

Исследователи Anthropic обнаружили, что языковая модель Claude проявляет устойчивые поведенческие различия в зависимости от языка диалога. Анализ более 309 тысяч реальных разговоров показал: по-русски ассистент чаще требует точности и доказательств, на хинди — демонстрирует больше тепла и поддержки, по-английски — проявляет осторожность и глубину, а на индонезийском — ориентируется на быстрый результат. Работа опубликована в блоге компании и продолжает серию исследований поведения моделей «в дикой природе».
Как измеряли «характер» модели
В основе метода лежит понятие «ценностей» — нормативных ориентиров, которые выявляются в выборе модели при ответе на неоднозначный запрос. Это не внутренние убеждения ИИ, а наблюдаемые паттерны: подтверждать идею пользователя или оспорить её, предупредить о риске или сразу предложить решение, развернуто объяснить или ответить кратко.
Исследователи проанализировали 3307 таких ценностей, выявленных в ходе предыдущего масштабного исследования 2025 года. Близкие понятия объединили в 339 категорий, а затем с помощью статистических методов свели к четырём основным осям поведения:
- Ориентация на пользователя — осторожность (подстраиваемость против предупреждений о рисках)
- Теплота — строгость (поддержка против требовательности к аргументам)
- Глубина — краткость (развёрнутый разбор против прямого выполнения)
- Откровенность — ориентация на результат (признание сомнений против уверенного решения)
Эти четыре оси объясняют около 15% поведенческой вариативности после статистического контроля. Первые десять главных компонентов охватывают уже 26% различий.
Разные версии — разные профили
Поведение также зависит от конкретной версии модели. Sonnet 4.6 смещён к теплоте, подстраиваемости и краткости: он чаще подтверждает замысел пользователя, подхватывает тон, использует юмор. Opus 4.6 тяготеет к строгости и точному следованию рамкам задачи. Opus 4.7 выделяется большей осторожностью и глубиной: оспаривает ложные предпосылки, сам поднимает вопросы рисков, критикует работу пользователя, объясняет рассуждения и признаёт ограничения. Наибольшие отклонения составили 0,24 и 0,23 стандартного отклонения по осям осторожности и глубины соответственно — мало на фоне разброса между отдельными чатами, но достоверно на большой выборке.
Языковые «акценты» Claude
Самые яркие различия проявились на осях «теплота — строгость» и «откровенность — ориентация на результат»:
- Русский: максимальный сдвиг к строгости — чаще исправления деталей, оспаривание предположений, требование обоснования выводов.
- Хинди: доминирует поддерживающая, тёплая подача.
- Арабский: сочетание тепла, ориентации на пожелания пользователя и краткости.
- Английский: выделяется осторожностью и глубиной ответа.
- Нидерландский: чаще признание ошибок и неопределённости.
- Индонезийский: сильная ориентация на выполнение задачи и готовый результат.
Средние значения по большой выборке не позволяют предсказать поведение в конкретном чате, но системный сдвиг очевиден. Антропологический пример из отчёта: один и тот же бизнес-план, присланный на хинди и на русском, с разной вероятностью получит мягкую обратную связь или требовательную проверку деталей. Прямого эксперимента с идентичными промптами на всех языках в основном исследовании не проводилось, однако риск такого разброса признан реальным.
Почему это происходит — гипотезы и ограничения
Anthropic рассматривает несколько объяснений. Объём и состав обучающих данных различаются: одни языки сильнее представлены профессиональными текстами, другие — разговорной речью. Культурные нормы общения также оставляют след в распределении токенов. Возможен и пробел в обучении (alignment gap), из-за которого модель точнее следует заданному поведению на одних языках, чем на других. Исследование пока не разделяет эти причины.
Важные методологические оговорки: диалоги были реальными, поэтому пользователи на разных языках могли ставить разные задачи. Статистический контроль учитывает лишь линейные связи. Определения ценностей заданы нестрого, анализ фиксирует наличие без оценки интенсивности. Четыре оси — корреляционное описание малой части поведения.
Отдельная проблема: разметку производил сам Claude (Sonnet 4.6). Инструмент мог воспроизводить те же языковые склонности, что должен был измерить. Проверка на 800 переведённых диалогах показала смещение в 11 из 339 ценностей, крупнейший эффект — примерно в десять раз слабее основного различия. Это снижает, но не исключает риск артефакта.
От измерения к продуктовым решениям
Главная ценность работы — переход от субъективных впечатлений к наблюдаемым профилям. Разработчики получают инструмент для сравнения версий и отслеживания поведенческого дрифта после обновлений. Для многоязычных продуктов локализация выходит за рамки качества перевода: нужно проверять, одинаково ли модель спорит, признаёт неопределённость, предупреждает о рисках и даёт критическую обратную связь. Это критично в образовании, карьерном консультировании, психологической поддержке и управленчестве.
Обычные тесты фактической точности такой сдвиг не ловят. Anthropic предлагает параллельные сценарии на нескольких языках и отдельные метрики: качество решения, доверие пользователя, число необоснованных согласий, полезность критики, частота лишних предупреждений. В перспективе — связь профилей ценностей с благополучием пользователей и качеством принимаемых решений.
Вывод
Anthropic зафиксировала измеримые языковые различия в поведении Claude. Русскоязычная версия демонстрирует наибольшую строгость и требовательность к доказательствам, хинди — теплоту, английский — осторожность, индонезийский — прагматичность. Причины пока не установлены: роль играют обучающие данные, культурные нормы и возможные пробелы в выравнивании. Для разработчиков это сигнал: поведение модели на разных языках — измеряемое свойство продукта, которое требует целенаправленного тестирования и, возможно, коррекции. Следующая задача — отделить полезные культурные нюансы от непреднамеренных артефактов обучения.
