АвтоматизацияИИ-агентПомощники в кодинге чтения

Как Kaggle упрощает создание AI-бенчмарков

Kaggle теперь позволяет создавать и запускать AI-бенчмарки прямо из локальной среды разработки с помощью кода и агентов.

Как Kaggle упрощает создание AI-бенчмарков

Kaggle 4 июня 2026 года запустил локальную разработку бенчмарков. До этого оценочные задачи для AI-моделей можно было собирать только в веб-редакторе ноутбуков на самом сайте. Теперь весь цикл живёт там, где удобно разработчику: VSCode, Cursor, Antigravity или вообще кодинг-агент, которому вы описали задачу словами.

🧪 Что такое Kaggle Benchmarks

Kaggle Benchmarks - это платформа оценочных задач для языковых моделей с публичными лидербордами. Сообщество уже написало больше 10 тысяч таких задач: от проверки арифметики до сложных сценариев с кодом и инструментами.

Зачем это нужно, если классические бенчмарки и так есть? Модели перестали быть чат-ботами: они рассуждают, пишут код, дёргают инструменты. Старые наборы тестов такие умения почти не ловят, а задачи от живого сообщества отражают то, с чем модели сталкиваются на практике. У Kaggle на этот счёт простая логика: если способность можно измерить, лаборатории бросятся её улучшать.

💻 Что изменилось: полный цикл без браузера

Раньше единственным способом создать задачу был веб-редактор Kaggle. Теперь в Kaggle CLI появилась отдельная группа команд kaggle benchmarks (короче: kaggle b), и весь конвейер выполняется из терминала:

  • kaggle b init - инициализация проекта: креденшалы, файл с примером задачи и справочник синтаксиса;
  • kaggle b t push - загрузка задачи из Python-файла на платформу;
  • kaggle b t run - запуск задачи сразу против нескольких моделей;
  • kaggle b t status и log - статус и логи прогонов;
  • kaggle b t download - выгрузка результатов к себе;
  • kaggle b t publish - публикация задачи, чтобы её видели все.

Список доступных для прогона моделей показывает kaggle b t models. Там и Gemini, и Claude, и другие.

⚙️ Как выглядит задача в коде

Задачи пишутся на Python через SDK kaggle-benchmarks. Берёте функцию, вешаете декоратор @kbench.task, внутри: промпт модели и проверка ответа через встроенные assertions.

import kbench

@kbench.task(name="simple_riddle")
def solve_riddle(llm, riddle: str, answer: str):
    response = llm.prompt(riddle)
    kbench.assertions.assert_contains_regex(
        f"(?i){answer}", response,
        expectation="LLM should give the right answer.")

Дальше два шага в терминале:

kaggle b t push my-task -f benchmark.py --wait
kaggle b t run my-task -m gemini-2.5-pro -m claude-sonnet-4 --wait

Всё, задача гоняется против выбранных моделей, результаты забираются командой download. Проверки бывают не только текстовые: SDK умеет валидировать выполнение кода и использование инструментов.

🤖 Скилл write-kaggle-benchmarks: задачи пишет агент

Самая интересная часть анонса. Вместе с локальной разработкой Kaggle выложил скилл write-kaggle-benchmarks: набор структурированных инструкций, который учит кодинг-агента собирать задачи через SDK и CLI. Ставится одной фразой - просите своего агента установить скилл из репозитория kaggle-skills на GitHub.

После этого задачу можно описывать обычным языком. В анонсе показан пример: команда «собери задачу, которая спрашивает модель, верно ли равенство 300+140=460». Агент сам пишет код, валидирует его и пушит на платформу. Эта задача, кстати, опубликована на Kaggle как публичный пример.

В общем, порог входа упал почти до нуля. Придумать осмысленную проверку для модели теперь сложнее, чем её реализовать.

🚀 Как попробовать

  • Установите Kaggle CLI и выполните kaggle b init: получите креденшалы и готовый шаблон задачи.
  • Напишите задачу сами по шаблону или подключите скилл write-kaggle-benchmarks и опишите её агенту словами.
  • Запушьте задачу, прогоните её против моделей из kaggle b t models и заберите результаты.
  • Если задача получилась удачной, опубликуйте её через kaggle b t publish, и она попадёт в общий пул.

Подробности - в официальном анонсе и на странице Kaggle Benchmarks.

🎯 Зачем это всё

Тесты для моделей перестают быть привилегией лабораторий. Когда задачу для бенчмарка любой разработчик пишет за вечер (а с агентом и за пять минут), проверки становятся разнообразнее, и у моделей остаётся меньше шансов «натаскаться» на узкий набор известных тестов. Для тех, кто выбирает нейросеть под свою работу, это хорошие новости: лидерборды будут ближе к реальным задачам, а не к академическим викторинам.

Смотрите также

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github220 text-to-text140 text-to-image117 image-to-image32 каталог31 tool28 удалить фон19 курсы19 text-to-sound17 браузер17 создание чат-ботов15 desktop-приложение15 api14 text-to-video14 замена лица13 генератор голоса13 ии-музыка12 удалить объект с фото11 voice-to-text11 селфи10
AILibri – главная страница
Ctrl / ⌘+K