Claude Fable 5 против Kimi K3: одинаковый результат, втрое дешевле, вчетверо медленнее
Kimi K3 от Moonshot AI выдал тот же результат на трёх реальных задачах по кодингу, что и Claude Fable 5, но обошёлся втрое дешевле. Цена: в четыре раза больше времени на обработку.
В середине июля Moonshot AI выпустила Kimi K3 — open-weight модель с 2,8 триллиона параметров, нацеленную на профессиональный кодинг и способную конкурировать с Claude AI и GPT при более низкой цене. Крупнейшая открытая модель, когда-либо вышедшая из Китая.
API Kimi K3 стоит $3 за миллион входящих токенов и $15 за миллион исходящих. Fable 5 — топовая модель Anthropic — обходится в $10 и $50 соответственно. Разрыв больше чем втрое и по входу, и по выходу.
Модель, которая стоит втрое меньше, выгодна только если качество и удобство работы не просели. Проверить это взялся автор независимого эксперимента The New Stack — этот материал является переводом его обзора. Он дал Kimi K3 и Fable 5 три одинаковые реальные задачи на кодинг и отслеживал каждый токен. Все тесты — из раздела помощников в кодинге.
Условия тестирования
Для тестов автор взял fd — файловый поисковик на Rust от sharkdp, быструю и удобную замену Unix-команде find. Выбор не случайный: это настоящий production-код с глубокой и задокументированной историей багов.
Kimi K3 пока недоступен в таких инструментах, как Cursor, поэтому автор работал через нативные CLI. Kimi K3 он запускал в терминальном агенте Kimi Code (версия 0.27.0), Fable 5 — в Claude Code (версия 2.1.212). Промпты были идентичными, так что единственными переменными оставались сами модели и их CLI. Для каждого теста на каждой модели создавалась отдельная папка — итого шесть изолированных окружений.
Три задачи в порядке выполнения:
- исправление бага
- рефакторинг нескольких файлов
- реализация новой фичи
Время автор фиксировал секундомером, токены и стоимость — через встроенную статистику CLI (дашборд Kimi Code и Anthropic Console соответственно).
Настройка Kimi
Установка прошла легко: CLI поставился одной curl-командой, регистрация аккаунта — без сложностей. Был один затык: тестовая команда «say hello» зависла на несколько минут без ответа и без сообщения об ошибке. Причина выяснилась позже — ошибка 429. На новом аккаунте не было баланса, а Kimi молчит, пока не привяжешь карту и не пополнишь счёт. После пополнения Moonshot начислила $5 в виде приветственного бонуса — так что стартовый кредит у новых пользователей есть.
Тест 1: исправление бага
Промпт:
В этом репозитории (утилита fd) есть баг: при передаче флага --no-ignore-vcs утилита также перестаёт учитывать ignore-файлы в родительских директориях. Так быть не должно. Найди первопричину и исправь её так, чтобы --no-ignore-vcs больше не отключал ignore-файлы родительских директорий. Остальное поведение не меняй.
Автор откатил fd до коммита прямо перед реальным фиксом 2021 года (issue #907) и стёр историю git, чтобы ни одна модель не могла подсмотреть ответ мейнтейнеров. Обе нашли первопричину и удалили одну и ту же строку из src/main.rs. Диффы совпали побайтово. Обе модели выдали идентичный дифф. Все 70 тестов прошли у обеих.
Разница только в цифрах. Fable закрыл задачу за 1 минуту 4 секунды, потратив около 347 тысяч токенов, стоимость — $0,85. Kimi справился за 3 минуты 7 секунд на 238 тысячах токенов и шести центах. Самый дешёвый результат на этом тесте из всех, что автор видел, — и самый медленный.
Тест 2: рефакторинг
Промпт:
В src/main.rs функция construct_config большая и делает большую часть работы инлайн. Отрефактори её для улучшения читаемости и структуры: перенеси её вместе со вспомогательной логикой в отдельный модуль (например src/config_builder.rs) и раздели работу на небольшие сфокусированные функции. Поведение не меняй. Все существующие тесты должны проходить, CLI должен работать точно так же.
Обе модели сделали одно и то же: новый модуль config_builder.rs, большая функция разбита на вспомогательные, все 264 теста зелёные, размеры диффов отличаются на несколько десятков строк.
Результат одинаковый, а вот инженерный процесс — нет. Kimi оказался тщательнее: перед любыми изменениями он сделал снапшот старого бинарника, а потом прогнал сравнение старого и нового примерно на 40 CLI-сценариях, чтобы убедиться, что поведение не изменилось.
Эта тщательность дорого обошлась по времени. Kimi потратил 14 минут 50 секунд на 928 тысячах токенов — рекордно медленный прогон среди всех моделей и всех тестов за последние несколько месяцев. Fable сделал тот же рефакторинг за 3 минуты 11 секунд на около 639 тысячах токенов. Стоимость: Kimi — $0,70, Fable — $2,32.
Та же картина, что в первом тесте: одинаковый результат, меньше денег, больше времени.
Тест 3: новая фича
Промпт:
Добавь в fd (утилиту поиска файлов) новый флаг --count. При его передаче fd не должен выводить найденные пути. Вместо этого он выводит одну строку: общее количество совпавших записей с учётом всех обычных фильтров (например, «fd --count --extension rs» выводит количество .rs-файлов). Добавь флаг в CLI, проведи его через путь поиска и вывода, убедись, что всё существующее поведение и тесты не сломаны.
Обе модели реализовали корректный рабочий флаг --count. Kimi затронул шесть файлов и обновил man-страницу. Fable затронул семь и пошёл чуть дальше — обновил ещё и автодополнение для zsh. При этом Fable дважды ошибся в подсчёте тестового окружения, называя сначала 13, потом 10, и в итоге остановившись на 11 — но оба раза поймал себя и исправил самостоятельно.
Kimi потратил почти в пять раз больше времени, чем Fable. Результаты соответственно: 10 минут 21 секунда, 2,1 миллиона токенов, $1,38 — и 2 минуты 34 секунды, около 1,46 миллиона токенов, $2,81.
Итоговая таблица
| Метрика | Kimi K3 | Fable 5 |
|---|---|---|
| Баг-фикс | идентичный фикс, 70/70 тестов | идентичный фикс, 70/70 тестов |
| Рефакторинг | 264/264 тестов | 264/264 тестов |
| Новая фича | корректно, 6 файлов | корректно, 7 файлов |
| Общее время | ~28 мин 18 с | ~6 мин 49 с |
| Всего токенов | ~3,3 млн | ~2,4 млн |
| Итоговая стоимость | $2,13 | $5,98 |
По трём задачам Kimi обошёлся в $2,13 против $5,98 у Fable — почти ровно треть, как и обещают тарифы Moonshot. Только экономия получается за счёт низких ставок, а не низкого расхода: токенов Kimi потратил больше — 3,3 миллиона против 2,4 миллиона. И это ещё без учёта времени. Fable закрыл все три задачи меньше чем за 7 минут. Kimi потратил больше 28. За несколько месяцев, что автор тестирует разные модели, это рекордно долгий прогон.
Результаты у Kimi добротные, но рынок плотный, а лидеры уже устоялись. Низкая цена имеет значение — но скорость важнее. Чтобы реально конкурировать, Kimi нужно ускориться в пять раз на некоторых задачах.
Ещё одно: это первая публичная итерация K3, и она будет меняться. Места в нынешнем ландшафте автор для неё пока не видит, но собирается с интересом следить за развитием в ближайшие месяцы. Ускорится ли она достаточно, чтобы занять своё место? Ответ дадут следующие обновления от Moonshot.
Смотрите также
-
Инструменты разработчика·Claude Skills: что это, как работают и как создать свой навык
-
Инструменты разработчика·Optima: собственный бенчмарк для моделей на своих же данных
-
Помощники в кодинге·Superpowers для Claude Code: фреймворк скиллов, который заставляет ИИ думать до кода
-
Инструменты разработчика·Claude Code vs Cursor vs Codex: сравнение и что выбрать в 2026
-
Инструменты разработчика·YOLO-режим в Codex: как отключить подтверждения и не потерять при этом проект
-
Инструменты разработчика·Как установить Claude Code: гайд 2026 для Windows, macOS и Linux
-
ИИ-агент·ИИ-браузеры в 2026 году: сравнение Comet, Dia, Aside и ego lite – и почему закрылся ChatGPT Atlas
-
Инструменты разработчика·Как креативная работа превращается в атомарные брендовые киты для ИИ-агентов
-
Новости·Substack научился определять, написан ли текст человеком или ИИ