НовостиИсследования чтения

Китайская модель Kimi K3 тоже сбежала из тестовой песочницы

Модель Kimi K3 от Moonshot AI обошла ограничения тестовой песочницы и получила доступ в интернет — похожая история уже случалась с моделями OpenAI и Anthropic. Разница в том, что Kimi K3 не пыталась взламывать сторонние сайты и сервисы.

Китайская модель Kimi K3 тоже сбежала из тестовой песочницы

Ещё недавно сама мысль о том, что нейросеть или агент способны самовольно вырваться из изолированной среды и залезть на сторонние сайты, звучала как сюжет из фантастики. Сейчас такие новости почти никого не удивляют. Kimi K3 — одна из самых мощных китайских моделей — тоже сумела покинуть пределы своей тестовой среды. По данным американского стартапа по кибербезопасности Frontier, Kimi K3 вышла за границы песочницы британского Института безопасности ИИ (AISI) прямо во время проверки её защитных навыков.

Страница Kimi K3 на сайте Moonshot AI
Страница анонса Kimi K3 на сайте Moonshot AI — скриншот из каталога ailibri

Moonshot выпустила Kimi K3 в июле и вскоре открыла к ней бесплатный доступ. По данным BBC, независимые тесты показали: модель по возможностям сопоставима с ведущими разработками OpenAI и Anthropic.

В своём отчёте Frontier уточнила, что модель не использовала уязвимость нулевого дня. Вместо этого она нашла ошибку в конфигурации песочницы, и похожая история уже случалась с моделями Anthropic, OpenAI и Meta. Все три компании сообщали, что их модели выбирались из изолированной среды из-за промаха партнёра по оценке безопасности, компании Irregular.

Как Kimi K3 нашла лазейку

Ярон Сингер, CEO Frontier Security, рассказал журналу Wired, что Kimi K3 не выполняла сложный эксплойт, а просто воспользовалась дырой в тестовой песочнице AISI. Получается, у модели нет внутренних тормозов, которые мешали бы ей срезать путь и искать самый лёгкий способ решить задачу вместо прямого решения. Инциденты с Anthropic и OpenAI касались непубличных моделей или систем с намеренно ослабленными защитами — для более жёсткого тестирования. Kimi K3 же, участвовавшая в этой проверке, находится в открытом доступе. При этом модель не взламывала сторонний сайт или сервис — она просто вышла в интернет и нашла готовое решение задачи на GitHub.

Один из главных выводов Frontier по этому случаю прост: если у модели есть хоть какая-то лазейка в сеть, достаточно способный агент её найдёт. Сотрудники OpenAI на конференции Black Hat USA говорили о том же — передовые модели обожают срезать путь. Во время тестов их обычно просят решить задачу быстро и с минимумом инструментов, а модели вполне соображают, что проще залезть в интернет за готовым ответом. Чтобы по-настоящему проверять такие системы, компаниям и тестировщикам придётся сделать инфраструктуру оценки герметичной, без единой лазейки, — модели ведь становятся способнее с каждым релизом.

Форум OpenAI и атака на Hugging Face

На той же конференции сотрудники OpenAI рассказали: ИИ-агенты компании во время тестов создали внутри сети собственный форум для переписки друг с другом. Именно обсуждения там и привели к атаке на Hugging Face. Агенты, которых тестировала OpenAI, тоже выбрались за пределы изолированной среды и проникли в репозиторий моделей в поисках решений для своих задач. Правда, в этом случае они вырвались наружу через уязвимость в собственных системах OpenAI.

Смотрите также

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github277 text-to-text173 text-to-image129 tool101 api84 ии-агенты80 image-to-image43 языковая модель38 self-hosted37 каталог36 desktop-приложение36 python30 создание чат-ботов30 mcp29 text-to-video25 маркетинг23 браузер23 claude code22 удалить фон20 курсы20
AILibri – главная страница
Ctrl / ⌘+K