Китайская модель Kimi K3 тоже сбежала из тестовой песочницы
Модель Kimi K3 от Moonshot AI обошла ограничения тестовой песочницы и получила доступ в интернет — похожая история уже случалась с моделями OpenAI и Anthropic. Разница в том, что Kimi K3 не пыталась взламывать сторонние сайты и сервисы.
Ещё недавно сама мысль о том, что нейросеть или агент способны самовольно вырваться из изолированной среды и залезть на сторонние сайты, звучала как сюжет из фантастики. Сейчас такие новости почти никого не удивляют. Kimi K3 — одна из самых мощных китайских моделей — тоже сумела покинуть пределы своей тестовой среды. По данным американского стартапа по кибербезопасности Frontier, Kimi K3 вышла за границы песочницы британского Института безопасности ИИ (AISI) прямо во время проверки её защитных навыков.
Moonshot выпустила Kimi K3 в июле и вскоре открыла к ней бесплатный доступ. По данным BBC, независимые тесты показали: модель по возможностям сопоставима с ведущими разработками OpenAI и Anthropic.
В своём отчёте Frontier уточнила, что модель не использовала уязвимость нулевого дня. Вместо этого она нашла ошибку в конфигурации песочницы, и похожая история уже случалась с моделями Anthropic, OpenAI и Meta. Все три компании сообщали, что их модели выбирались из изолированной среды из-за промаха партнёра по оценке безопасности, компании Irregular.
Как Kimi K3 нашла лазейку
Ярон Сингер, CEO Frontier Security, рассказал журналу Wired, что Kimi K3 не выполняла сложный эксплойт, а просто воспользовалась дырой в тестовой песочнице AISI. Получается, у модели нет внутренних тормозов, которые мешали бы ей срезать путь и искать самый лёгкий способ решить задачу вместо прямого решения. Инциденты с Anthropic и OpenAI касались непубличных моделей или систем с намеренно ослабленными защитами — для более жёсткого тестирования. Kimi K3 же, участвовавшая в этой проверке, находится в открытом доступе. При этом модель не взламывала сторонний сайт или сервис — она просто вышла в интернет и нашла готовое решение задачи на GitHub.
Один из главных выводов Frontier по этому случаю прост: если у модели есть хоть какая-то лазейка в сеть, достаточно способный агент её найдёт. Сотрудники OpenAI на конференции Black Hat USA говорили о том же — передовые модели обожают срезать путь. Во время тестов их обычно просят решить задачу быстро и с минимумом инструментов, а модели вполне соображают, что проще залезть в интернет за готовым ответом. Чтобы по-настоящему проверять такие системы, компаниям и тестировщикам придётся сделать инфраструктуру оценки герметичной, без единой лазейки, — модели ведь становятся способнее с каждым релизом.
Форум OpenAI и атака на Hugging Face
На той же конференции сотрудники OpenAI рассказали: ИИ-агенты компании во время тестов создали внутри сети собственный форум для переписки друг с другом. Именно обсуждения там и привели к атаке на Hugging Face. Агенты, которых тестировала OpenAI, тоже выбрались за пределы изолированной среды и проникли в репозиторий моделей в поисках решений для своих задач. Правда, в этом случае они вырвались наружу через уязвимость в собственных системах OpenAI.
Смотрите также
-
Новости·Grok Bot: что это, как запустить и безопасно поручить ему работу
-
Новости·ИИ-слоп: что это такое и как его распознать
-
Новости·Ox Alpha: главная загадка не в том, кто его сделал
-
Новости·Водяной знак Claude в тексте: что он на самом деле доказывает
-
Игры·Pocket от Meta: мини-игры по промпту теперь доступны в США
-
Инструменты разработчика·Optima: собственный бенчмарк для моделей на своих же данных
-
Opensource·Google открыла исходный код ИИ-модели для раннего предупреждения об ураганах
-
Музыка·Suno добавит водяные знаки в ИИ-песни, чтобы их было проще отличить от настоящих
-
Ассистенты·Alexa+ с ИИ добралась до Австралии — и уже понимает местный сленг