OpenSquilla - агентный рантайм, который экономит токены
OpenSquilla - open-source рантайм для ИИ-агентов с четырёхуровневой памятью, роутингом запросов и песочницей. Обещает снизить расход токенов на 60-80%.
Очередной проект обещает решить проблему, которая реально болит у всех, кто гоняет ИИ-агентов на длинных задачах - бесконтрольный расход токенов. OpenSquilla вышла в первой публичной версии (v0.1.0, Apache-2.0), и её главный тезис прост: большинство агентных фреймворков тратят токены впустую и не дают никаких рычагов это остановить.
Проект self-hosted, open-source, заточен под разработчиков, которые крутят агентов на продолжительных сессиях - там, где счета за токены растут экспоненциально, а управление контекстом становится узким местом раньше, чем заканчиваются возможности модели.

Как экономят токены
В тестовом прогоне три промпта разной сложности - от простого фактического вопроса до полноценного конкурентного анализа - обработали 279 762 токена за $0.0094. Из них 222 848 (около 80% входных токенов) пришли из кэша. OpenSquilla переиспользует контекст между вызовами вместо того, чтобы загружать его заново каждый раз.
Экономия строится на нескольких механизмах одновременно:

- ML-классификатор оценивает сложность каждого запроса по длине сообщения, наличию кода, ключевым словам и семантическим эмбеддингам. Простые запросы уходят на дешёвые модели.
- Deep reasoning отключается для тривиальных задач - не нужно платить за цепочку рассуждений там, где достаточно прямого ответа.
- Навыки (skills) подгружаются по требованию, а не пакуются целиком в каждое контекстное окно.
- Встроенные квоты и трекинг стоимости на каждый вызов с автоматическим троттлингом.
По собственным бенчмаркам проекта, всё вместе это даёт снижение расхода токенов на 60-80% по сравнению с конфигурацией "одна модель на всё".
Четырёхуровневая память
Архитектура памяти построена по аналогии с человеческой:
- Рабочая память - текущая задача
- Эпизодическая - опыт и причинно-следственные связи между сессиями
- Семантическая - постоянные факты и правила
- Сырая - аудит и база для дообучения
Поиск комбинирует векторно-семантический и BM25 полнотекстовый, эмбеддинги считаются локально через ONNX - данные не уходят наружу. Часто вызываемые воспоминания автоматически "всплывают" наверх, устаревшие - затухают, если не помечены как постоянные. Раз в сутки запускается консолидация, которую авторы называют Memory Dream Consolidation - по аналогии со сном, который структурирует память. Звучит красиво, посмотрим, как работает на практике.

Безопасность и архитектура
Вместо обёртки над Docker используется изоляция на уровне системных вызовов - Bubblewrap на Linux, Seatbelt на macOS. Три уровня политик: стандартные операции выполняются напрямую, строгие требуют одобрения песочницы, заблокированные - ручной проверки человеком. После трёх отказов подряд агент ставится на паузу. Prompt injection закрывается XML-экранированием метаданных навыков и результатов инструментов.
Сама архитектура - микроядро: оркестратор примерно на 100 строк, всё остальное - плагины. Написать плагин - это пять строк duck-typed класса без базовых классов и SDK. Из коробки поддерживаются Slack, Discord, Telegram, MS Teams, Matrix и ещё несколько платформ.

Требуется Python 3.12+, код на GitHub. Параллельно с релизом запущен 10M Token Bill Challenge - бесплатные токены для тех, кто хочет сравнить расходы со своей текущей инфраструктурой. Идея понятная: дайте попробовать, а цифры пусть говорят сами за себя.
Смотрите также
-
Новости·Grok Bot: что это, как запустить и безопасно поручить ему работу
-
Новости·ИИ-слоп: что это такое и как его распознать
-
Инструменты разработчика·Claude + Obsidian: как собрать второй мозг на своих заметках
-
Новости·Ox Alpha: главная загадка не в том, кто его сделал
-
Инструменты разработчика·MCP в Claude Code: как подключить серверы и зачем нужны агенты
-
Новости·Водяной знак Claude в тексте: что он на самом деле доказывает
-
Инструменты разработчика·Что такое MCP (Model Context Protocol): открытый протокол для подключения ИИ к внешнему миру
-
Инструменты разработчика·Claude Skills: что это, как работают и как создать свой навык
-
Инструменты разработчика·Optima: собственный бенчмарк для моделей на своих же данных