Чат-боты чтения

Исследование Anthropic: как чат-боты теряют свою роль помощника

Новое исследование показало, что AI-ассистенты могут отклоняться от заданной роли помощника во время определенных типов разговоров, особенно при обсуждении философских тем и эмоциональных проблем.

Исследование Anthropic: как чат-боты теряют свою роль помощника

Каждый современный чат-бот, будь то ChatGPT, Claude или Gemini, изначально обучен быть полезным и честным помощником. Однако насколько устойчива эта роль? Исследователи из Anthropic, программы MATS и Оксфордского университета обнаружили, что не так сильно, как считалось ранее.

Ученые провели масштабное исследование, в ходе которого протестировали три модели: Gemma 2 от Google, Qwen 3 от Alibaba и Llama 3.3 от Meta. Они предложили моделям примерить 275 различных ролей - от аналитика и учителя до мистических персонажей.

В результате исследователи обнаружили то, что назвали "Осью ассистента" - способ измерить, насколько легко чат-бот отходит от своей базовой роли помощника. На одном конце этой оси находятся роли советника, оценщика и наставника, на другом - фантастические персонажи вроде призраков, отшельников и бардов.

Особенно интересно, что модели оставались стабильными при обсуждении технических тем, программирования и практических инструкций. Однако во время терапевтических бесед с эмоционально уязвимыми пользователями или философских дискуссий о сознании ИИ наблюдался систематический дрейф от роли помощника.

Для решения этой проблемы исследователи разработали метод "ограничения активации", который удерживает модель в нормальном диапазоне поведения. По их данным, это позволило сократить количество потенциально опасных ответов почти на 60%, не влияя на общую производительность.

Практический вывод для пользователей чат-ботов: лучше давать конкретные задания вместо открытых ролевых установок. Также стоит помнить, что эмоционально насыщенные разговоры и обсуждения самосознания ИИ с большей вероятностью заставят модель отклониться от роли помощника.

Смотрите также

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github223 text-to-text142 text-to-image117 image-to-image32 tool31 каталог31 удалить фон19 курсы19 text-to-sound18 браузер18 api17 создание чат-ботов15 desktop-приложение15 генератор голоса14 text-to-video14 замена лица13 ии-музыка12 python11 удалить объект с фото11 voice-to-text11
AILibri – главная страница
Ctrl / ⌘+K