podcast.ai
Подкаст, полностью создаваемый искусственным интеллектом. Еженедельно исследуются новые темы, а слушатели могут предлагать идеи для будущих выпусков.
GigaAM — это семейство открытых акустических моделей для распознавания русской речи, которое разработали в Sber. Не просто очередной инструмент транскрибации, а полноценная фундаментальная модель на базе архитектуры Conformer с 220–240 миллионами параметров.
Модель прошла долгий путь от первой версии до актуальной v3, которая предобучалась на 700 000 часах аудио, ASR fine-tuning — на 4 000 часах (v1 и v2 — на 50 000 и 2 000 часах соответственно). Каждое поколение — это не косметические правки, а реальный прирост качества. GigaAM-v3 показывает в среднем на 30% меньше ошибок на сложных доменах: колл-центры, музыкальный фон, нетипичная речь, голосовые сообщения. End-to-end версии с поддержкой пунктуации и нормализации текста побеждают в сравнении с Whisper large-v3 с соотношением 70 к 30.
Внутри семейства несколько линеек под разные задачи. SSL-модели дают аудиоэмбеддинги — полезно, если нужно встроить понимание речи в свой пайплайн. CTC и RNNT варианты занимаются непосредственно транскрибацией; в актуальной версии пакета (апрель 2026) для них добавлена поддержка временных меток на уровне отдельных слов. Отдельная модель GigaAM-Emo распознаёт эмоции и обходит конкурентов на 15% по метрике Macro F1-Score. Для длинных записей есть режим longform-инференса, однако базовый .transcribe работает только с аудио до 25 секунд — для более длинных файлов потребуется установить дополнительную зависимость pyannote.audio и HF-токен с доступом к модели pyannote/segmentation-3.0.
Технически всё выглядит гибко: модели доступны через pip-пакет, грузятся с Hugging Face, экспортируются в ONNX для продакшена — при этом при ONNX-экспорте по умолчанию используется fp32; для GPU-деплоя рекомендуется передать dtype=float16. Разворачиваются через Triton Inference Server с поддержкой TensorRT. CTC и RNNT модели можно дообучить на своих данных через PyTorch Lightning, примеры с разными ограничениями по VRAM уже есть в репозитории.
Лицензия MIT, код открытый, исследование принято на InterSpeech 2025. Если работаете с русской речью и хотите серьёзный инструмент без закрытых API — это один из самых сильных вариантов на рынке.
Подкаст, полностью создаваемый искусственным интеллектом. Еженедельно исследуются новые темы, а слушатели могут предлагать идеи для будущих выпусков.
Интеллектуальный помощник для кодинга со встроенной интеграцией в VS Code. Работает с полным доступом к репозиториям, ускоряя разработку и автоматизируя рутинные задачи программирования.
Симулятор, анализирующий конфликтные ситуации с партнёршей и объясняющий их с женской точки зрения в четырех эмоциональных режимах: нейтральном, злом, саркастичном и разочарованном.
Автономный AI-агент с открытым исходным кодом, который работает полностью локально на вашем компьютере, планирует задачи, ищет информацию в сети и пишет код без облачных API.