GigaAM
в каталоге с 2026Семейство open-source моделей для распознавания и анализа русской речи

GigaAM

5,01 оценка
Проверено от 07.07.2026
Модели
GigaAM-v3 GigaAM-v2 GigaAM-v1 GigaAM-Emo

GigaAM — это семейство открытых акустических моделей для распознавания русской речи, которое разработали в Sber. Не просто очередной инструмент транскрибации, а полноценная фундаментальная модель на базе архитектуры Conformer с 220–240 миллионами параметров.

Модель прошла долгий путь от первой версии до актуальной v3, которая предобучалась на 700 000 часах аудио, ASR fine-tuning — на 4 000 часах (v1 и v2 — на 50 000 и 2 000 часах соответственно). Каждое поколение — это не косметические правки, а реальный прирост качества. GigaAM-v3 показывает в среднем на 30% меньше ошибок на сложных доменах: колл-центры, музыкальный фон, нетипичная речь, голосовые сообщения. End-to-end версии с поддержкой пунктуации и нормализации текста побеждают в сравнении с Whisper large-v3 с соотношением 70 к 30.

Внутри семейства несколько линеек под разные задачи. SSL-модели дают аудиоэмбеддинги — полезно, если нужно встроить понимание речи в свой пайплайн. CTC и RNNT варианты занимаются непосредственно транскрибацией; в актуальной версии пакета (апрель 2026) для них добавлена поддержка временных меток на уровне отдельных слов. Отдельная модель GigaAM-Emo распознаёт эмоции и обходит конкурентов на 15% по метрике Macro F1-Score. Для длинных записей есть режим longform-инференса, однако базовый .transcribe работает только с аудио до 25 секунд — для более длинных файлов потребуется установить дополнительную зависимость pyannote.audio и HF-токен с доступом к модели pyannote/segmentation-3.0.

Технически всё выглядит гибко: модели доступны через pip-пакет, грузятся с Hugging Face, экспортируются в ONNX для продакшена — при этом при ONNX-экспорте по умолчанию используется fp32; для GPU-деплоя рекомендуется передать dtype=float16. Разворачиваются через Triton Inference Server с поддержкой TensorRT. CTC и RNNT модели можно дообучить на своих данных через PyTorch Lightning, примеры с разными ограничениями по VRAM уже есть в репозитории.

Лицензия MIT, код открытый, исследование принято на InterSpeech 2025. Если работаете с русской речью и хотите серьёзный инструмент без закрытых API — это один из самых сильных вариантов на рынке.

Похожие нейросети

Все нейросети →
Бесплатно

podcast.ai

Подкаст, полностью создаваемый искусственным интеллектом. Еженедельно исследуются новые темы, а слушатели могут предлагать идеи для будущих выпусков.

Обн. 12.05.2026
Freemium

Cline

Интеллектуальный помощник для кодинга со встроенной интеграцией в VS Code. Работает с полным доступом к репозиториям, ускоряя разработку и автоматизируя рутинные задачи программирования.

Обн. 04.06.2026
Бесплатно

Why Is My Wife Yelling at Me?

Симулятор, анализирующий конфликтные ситуации с партнёршей и объясняющий их с женской точки зрения в четырех эмоциональных режимах: нейтральном, злом, саркастичном и разочарованном.

Обн. 30.05.2026
Бесплатно

Manus AI AgenticSeek

Автономный AI-агент с открытым исходным кодом, который работает полностью локально на вашем компьютере, планирует задачи, ищет информацию в сети и пишет код без облачных API.

Обн. 31.05.2026

Нейросеть GigaAM была впервые опубликована 07-07-2026 12:53:04 и ещё не редактировалась.

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github223 text-to-text142 text-to-image117 image-to-image32 tool31 каталог31 удалить фон19 курсы19 text-to-sound18 браузер18 api17 создание чат-ботов15 desktop-приложение15 генератор голоса14 text-to-video14 замена лица13 ии-музыка12 python11 удалить объект с фото11 voice-to-text11
AILibri – главная страница
Ctrl / ⌘+K