Как Kaggle упрощает создание AI-бенчмарков
Kaggle теперь позволяет создавать и запускать AI-бенчмарки прямо из локальной среды разработки с помощью кода и агентов.
Kaggle 4 июня 2026 года запустил локальную разработку бенчмарков. До этого оценочные задачи для AI-моделей можно было собирать только в веб-редакторе ноутбуков на самом сайте. Теперь весь цикл живёт там, где удобно разработчику: VSCode, Cursor, Antigravity или вообще кодинг-агент, которому вы описали задачу словами.
🧪 Что такое Kaggle Benchmarks
Kaggle Benchmarks - это платформа оценочных задач для языковых моделей с публичными лидербордами. Сообщество уже написало больше 10 тысяч таких задач: от проверки арифметики до сложных сценариев с кодом и инструментами.
Зачем это нужно, если классические бенчмарки и так есть? Модели перестали быть чат-ботами: они рассуждают, пишут код, дёргают инструменты. Старые наборы тестов такие умения почти не ловят, а задачи от живого сообщества отражают то, с чем модели сталкиваются на практике. У Kaggle на этот счёт простая логика: если способность можно измерить, лаборатории бросятся её улучшать.
💻 Что изменилось: полный цикл без браузера
Раньше единственным способом создать задачу был веб-редактор Kaggle. Теперь в Kaggle CLI появилась отдельная группа команд kaggle benchmarks (короче: kaggle b), и весь конвейер выполняется из терминала:
kaggle b init- инициализация проекта: креденшалы, файл с примером задачи и справочник синтаксиса;kaggle b t push- загрузка задачи из Python-файла на платформу;kaggle b t run- запуск задачи сразу против нескольких моделей;kaggle b t statusиlog- статус и логи прогонов;kaggle b t download- выгрузка результатов к себе;kaggle b t publish- публикация задачи, чтобы её видели все.
Список доступных для прогона моделей показывает kaggle b t models. Там и Gemini, и Claude, и другие.
⚙️ Как выглядит задача в коде
Задачи пишутся на Python через SDK kaggle-benchmarks. Берёте функцию, вешаете декоратор @kbench.task, внутри: промпт модели и проверка ответа через встроенные assertions.
import kbench
@kbench.task(name="simple_riddle")
def solve_riddle(llm, riddle: str, answer: str):
response = llm.prompt(riddle)
kbench.assertions.assert_contains_regex(
f"(?i){answer}", response,
expectation="LLM should give the right answer.")
Дальше два шага в терминале:
kaggle b t push my-task -f benchmark.py --wait
kaggle b t run my-task -m gemini-2.5-pro -m claude-sonnet-4 --wait
Всё, задача гоняется против выбранных моделей, результаты забираются командой download. Проверки бывают не только текстовые: SDK умеет валидировать выполнение кода и использование инструментов.
🤖 Скилл write-kaggle-benchmarks: задачи пишет агент
Самая интересная часть анонса. Вместе с локальной разработкой Kaggle выложил скилл write-kaggle-benchmarks: набор структурированных инструкций, который учит кодинг-агента собирать задачи через SDK и CLI. Ставится одной фразой - просите своего агента установить скилл из репозитория kaggle-skills на GitHub.
После этого задачу можно описывать обычным языком. В анонсе показан пример: команда «собери задачу, которая спрашивает модель, верно ли равенство 300+140=460». Агент сам пишет код, валидирует его и пушит на платформу. Эта задача, кстати, опубликована на Kaggle как публичный пример.
В общем, порог входа упал почти до нуля. Придумать осмысленную проверку для модели теперь сложнее, чем её реализовать.
🚀 Как попробовать
- Установите Kaggle CLI и выполните
kaggle b init: получите креденшалы и готовый шаблон задачи. - Напишите задачу сами по шаблону или подключите скилл write-kaggle-benchmarks и опишите её агенту словами.
- Запушьте задачу, прогоните её против моделей из
kaggle b t modelsи заберите результаты. - Если задача получилась удачной, опубликуйте её через
kaggle b t publish, и она попадёт в общий пул.
Подробности - в официальном анонсе и на странице Kaggle Benchmarks.
🎯 Зачем это всё
Тесты для моделей перестают быть привилегией лабораторий. Когда задачу для бенчмарка любой разработчик пишет за вечер (а с агентом и за пять минут), проверки становятся разнообразнее, и у моделей остаётся меньше шансов «натаскаться» на узкий набор известных тестов. Для тех, кто выбирает нейросеть под свою работу, это хорошие новости: лидерборды будут ближе к реальным задачам, а не к академическим викторинам.
Смотрите также
-
ИИ-агент·Brain: как ИИ решает, что Azure официально упал
-
ИИ-агент·Apple встроила MCP-сервер прямо в Safari — теперь ИИ-агенты могут управлять браузером
-
ИИ-агент·Microsoft переделывает Copilot: единое приложение, агенты AutoPilot и ставка на «реальную работу»
-
ИИ-агент·Claude Science: рабочая среда Anthropic для учёных
-
ИИ-агент·Sakana AI представила Fugu Ultra — мультиагентную систему для сложных задач
-
Opensource·North Mini Code от Cohere: агентная модель для разработчиков вышла в open-source
-
ИИ-агент·Meta запускает платного ИИ-агента за $200 в месяц
-
Ассистенты·Hinge защищает ИИ-подсказки для робких зумеров
-
Автоматизация·Обновлённое приложение Samsung Health с ИИ