Исследование Anthropic: как чат-боты теряют свою роль помощника
Новое исследование показало, что AI-ассистенты могут отклоняться от заданной роли помощника во время определенных типов разговоров, особенно при обсуждении философских тем и эмоциональных проблем.
Каждый современный чат-бот, будь то ChatGPT, Claude или Gemini, изначально обучен быть полезным и честным помощником. Однако насколько устойчива эта роль? Исследователи из Anthropic, программы MATS и Оксфордского университета обнаружили, что не так сильно, как считалось ранее.
Ученые провели масштабное исследование, в ходе которого протестировали три модели: Gemma 2 от Google, Qwen 3 от Alibaba и Llama 3.3 от Meta. Они предложили моделям примерить 275 различных ролей - от аналитика и учителя до мистических персонажей.

В результате исследователи обнаружили то, что назвали "Осью ассистента" - способ измерить, насколько легко чат-бот отходит от своей базовой роли помощника. На одном конце этой оси находятся роли советника, оценщика и наставника, на другом - фантастические персонажи вроде призраков, отшельников и бардов.
Особенно интересно, что модели оставались стабильными при обсуждении технических тем, программирования и практических инструкций. Однако во время терапевтических бесед с эмоционально уязвимыми пользователями или философских дискуссий о сознании ИИ наблюдался систематический дрейф от роли помощника.

Для решения этой проблемы исследователи разработали метод "ограничения активации", который удерживает модель в нормальном диапазоне поведения. По их данным, это позволило сократить количество потенциально опасных ответов почти на 60%, не влияя на общую производительность.

Практический вывод для пользователей чат-ботов: лучше давать конкретные задания вместо открытых ролевых установок. Также стоит помнить, что эмоционально насыщенные разговоры и обсуждения самосознания ИИ с большей вероятностью заставят модель отклониться от роли помощника.
Смотрите также
-
Чат-боты·GPT-5.6: обзор нового семейства OpenAI – Sol, Terra и Luna, и какую модель выбрать
-
Чат-боты·Режим goal (/goal) в OpenAI Codex – как реально включить и работать с автономным агентом
-
Чат-боты·OpenAI запускает закрытый превью-доступ к GPT-5.6 Sol для избранных партнёров
-
Ассистенты·Журналист попробовал новую функцию Scheduled Tasks в ChatGPT — и счёл её самым близким к настоящему ИИ-ассистенту
-
Чат-боты·Gemini от Google в 2026 году: что умеет и как пользоваться из России
-
Чат-боты·OpenAI готовит к запуску семейство моделей GPT-5.6 с новыми версиями Mini и Pro
-
Чат-боты·Claude требует паспорт и селфи: что проверяют и что это значит для россиян
-
Чат-боты·Claude Fable 5 и Claude Mythos 5: самые мощные модели Anthropic вышли в общий доступ
-
Чат-боты·Lockdown Mode и метки Elevated Risk в ChatGPT: новые инструменты защиты