OpenSquilla - агентный рантайм, который экономит токены

OpenSquilla - open-source рантайм для ИИ-агентов с четырёхуровневой памятью, роутингом запросов и песочницей. Обещает снизить расход токенов на 60-80%.

OpenSquilla - агентный рантайм, который экономит токены

Очередной проект обещает решить проблему, которая реально болит у всех, кто гоняет ИИ-агентов на длинных задачах - бесконтрольный расход токенов. OpenSquilla вышла в первой публичной версии (v0.1.0, Apache-2.0), и её главный тезис прост: большинство агентных фреймворков тратят токены впустую и не дают никаких рычагов это остановить.

Проект self-hosted, open-source, заточен под разработчиков, которые крутят агентов на продолжительных сессиях - там, где счета за токены растут экспоненциально, а управление контекстом становится узким местом раньше, чем заканчиваются возможности модели.

Как экономят токены

В тестовом прогоне три промпта разной сложности - от простого фактического вопроса до полноценного конкурентного анализа - обработали 279 762 токена за $0.0094. Из них 222 848 (около 80% входных токенов) пришли из кэша. OpenSquilla переиспользует контекст между вызовами вместо того, чтобы загружать его заново каждый раз.

Экономия строится на нескольких механизмах одновременно:

  • ML-классификатор оценивает сложность каждого запроса по длине сообщения, наличию кода, ключевым словам и семантическим эмбеддингам. Простые запросы уходят на дешёвые модели.
  • Deep reasoning отключается для тривиальных задач - не нужно платить за цепочку рассуждений там, где достаточно прямого ответа.
  • Навыки (skills) подгружаются по требованию, а не пакуются целиком в каждое контекстное окно.
  • Встроенные квоты и трекинг стоимости на каждый вызов с автоматическим троттлингом.

По собственным бенчмаркам проекта, всё вместе это даёт снижение расхода токенов на 60-80% по сравнению с конфигурацией "одна модель на всё".

Четырёхуровневая память

Архитектура памяти построена по аналогии с человеческой:

  • Рабочая память - текущая задача
  • Эпизодическая - опыт и причинно-следственные связи между сессиями
  • Семантическая - постоянные факты и правила
  • Сырая - аудит и база для дообучения

Поиск комбинирует векторно-семантический и BM25 полнотекстовый, эмбеддинги считаются локально через ONNX - данные не уходят наружу. Часто вызываемые воспоминания автоматически "всплывают" наверх, устаревшие - затухают, если не помечены как постоянные. Раз в сутки запускается консолидация, которую авторы называют Memory Dream Consolidation - по аналогии со сном, который структурирует память. Звучит красиво, посмотрим, как работает на практике.

Безопасность и архитектура

Вместо обёртки над Docker используется изоляция на уровне системных вызовов - Bubblewrap на Linux, Seatbelt на macOS. Три уровня политик: стандартные операции выполняются напрямую, строгие требуют одобрения песочницы, заблокированные - ручной проверки человеком. После трёх отказов подряд агент ставится на паузу. Prompt injection закрывается XML-экранированием метаданных навыков и результатов инструментов.

Сама архитектура - микроядро: оркестратор примерно на 100 строк, всё остальное - плагины. Написать плагин - это пять строк duck-typed класса без базовых классов и SDK. Из коробки поддерживаются Slack, Discord, Telegram, MS Teams, Matrix и ещё несколько платформ.

Требуется Python 3.12+, код на GitHub. Параллельно с релизом запущен 10M Token Bill Challenge - бесплатные токены для тех, кто хочет сравнить расходы со своей текущей инфраструктурой. Идея понятная: дайте попробовать, а цифры пусть говорят сами за себя.

Смотрите также

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github277 text-to-text173 text-to-image129 tool101 api84 ии-агенты80 image-to-image43 языковая модель38 self-hosted37 каталог36 desktop-приложение36 python30 создание чат-ботов30 mcp29 text-to-video25 маркетинг23 браузер23 claude code22 удалить фон20 voice-to-text20
AILibri – главная страница
Ctrl / ⌘+K