Optima: собственный бенчмарк для моделей на своих же данных
Optima от Artificial Analysis позволяет собрать бенчмарк из ваших данных и рабочих процессов, а затем сравнить модели по качеству, цене и скорости решения задач.
Artificial Analysis занимается независимыми замерами языковых моделей и известна собственными бенчмарками вроде GDPval-AA и AA-Briefcase. Теперь компания выпустила платформу Optima. Идея простая: публичные бенчмарки сравнивают модели на заранее заданных задачах, но их результаты мало говорят о том, как модель поведёт себя именно в вашем сценарии. Optima закрывает этот разрыв через сравнения, привязанные к конкретному рабочему процессу.
Пользователь собирает бенчмарк из своих данных, процессов или описания задачи, запускает его на актуальных ведущих моделях и получает сопоставление по качеству, стоимости за задачу и времени выполнения. Платформа уже доступна.
Три способа собрать свой бенчмарк
Optima работает с разным исходным материалом. Можно загрузить готовые датасеты для оценки: из своих файлов или с Hugging Face, а ещё трейсы ИИ-агентов из Arize, Braintrust или Langfuse. Для разработчиков есть отдельный скилл, который сам соберёт нужное из среды разработки и прошлых сессий.
Если данных под рукой нет, хватит описания сценария и пары примеров входов и выходов. Optima предложит тестовые запросы, критерии оценки и образцы заданий. Всё это можно отсмотреть и поправить фидбеком до запуска замера.
Результаты оцениваются двумя способами. Первый — по рубрике, сверка с объективными критериями. Второй — парное сравнение, тот же метод, что Artificial Analysis использует в GDPval-AA и AA-Briefcase: пользователь размечает пары ответов, отмечая, какой вариант ближе, а платформа выводит из этих предпочтений рейтинг по всему тестовому набору.
Стоимость и скорость как полноценные метрики
Помимо качества, Optima отдельно считает стоимость за задачу и время на задачу. Так можно проверить, оправдывает ли прирост качества более высокую цену или более долгую обработку у конкретной модели.
Для агентных сценариев цена за токен сама по себе почти ничего не говорит. Дешёвая модель легко обходится дороже, если ей нужно больше попыток, она чаще ошибается и за ней приходится подчищать. Стоимость одной завершённой задачи — куда более осмысленная цифра в таких случаях.
По данным Artificial Analysis, первые тестировщики собирали бенчмарки для агентов в финансах и бухгалтерии — искали модель, способную снизить расходы в десять раз без заметной потери качества. Другие проверяли, какая модель точнее попадает в стиль письма юристов, а какая надёжнее распознаёт объекты в закрытом наборе изображений.
При создании и запуске бенчмарков платформа берёт только фактическую стоимость токенов использованных моделей, без наценки. Оценка по рубрике стоит $0,125 за критерий на каждую модель, парное сравнение — $0,375 за сравнение. Перед сборкой бенчмарка, перед каждым запуском и перед каждым раундом оценки платформа резервирует сумму по предварительной смете, а итоговый счёт формируется по фактическому расходу.
Почему универсальные бенчмарки промахиваются
Optima берётся за старую болячку оценки моделей. Разбор от Epoch AI показал: результаты бенчмарков зависят от деталей реализации, которые почти никогда не раскрываются. Другая формулировка промпта, другое значение temperature — и та же модель набирает заметно другие баллы. В агентных бенчмарках вроде SWE-bench одна лишь замена скаффолда (управляющей обвязки агента и окружения с инструментами) давала разброс до 15 процентных пунктов.
Более масштабное исследование 445 статей о бенчмарках с ведущих ИИ-конференций нашло проблемы системного характера. Почти везде обнаружились методологические слабости хотя бы в одном месте: размытые определения, непредставительные выборки, отсутствие статистической проверки. Полноценные реальные задачи, отражающие настоящие сценарии применения, встречались лишь примерно в 10 % изученных бенчмарков. Ключевые понятия вроде reasoning или alignment часто определялись плохо, а это подрывает надёжность любых выводов.
Проблему «общий бенчмарк не описывает мой случай» Optima действительно снимает. А вот более глубокие методологические сложности остаются: даже у бенчмарка под свои задачи польза зависит от того, насколько точно описаны нужные способности, насколько представительны тест-кейсы и как устроена и задокументирована сама оценка.
Есть и ещё одно ограничение. Даже стоимость и время на задачу не отвечают на вопрос, сколько результат стоит для бизнеса. Дешёвый и быстрый ИИ-процесс всё равно окажется бесполезным, если его выход требует серьёзной переделки или почти ничего не добавляет к процессу, в который он встроен.
Смотрите также
-
Инструменты разработчика·Claude + Obsidian: как собрать второй мозг на своих заметках
-
Инструменты разработчика·MCP в Claude Code: как подключить серверы и зачем нужны агенты
-
Новости·Водяной знак Claude в тексте: что он на самом деле доказывает
-
Инструменты разработчика·Что такое MCP (Model Context Protocol): открытый протокол для подключения ИИ к внешнему миру
-
Инструменты разработчика·Claude Skills: что это, как работают и как создать свой навык
-
Инструменты разработчика·Claude Code vs Cursor vs Codex: сравнение и что выбрать в 2026
-
Инструменты разработчика·YOLO-режим в Codex: как отключить подтверждения и не потерять при этом проект
-
Инструменты разработчика·Как установить Claude Code: гайд 2026 для Windows, macOS и Linux
-
ИИ-агент·ИИ-браузеры в 2026 году: сравнение Comet, Dia, Aside и ego lite – и почему закрылся ChatGPT Atlas