Hume AI выпустила TADA - сверхбыструю систему синтеза речи с открытым кодом
Новая TTS-система генерирует речь в 5 раз быстрее конкурентов и поддерживает до 700 секунд аудио. Доступна бесплатно с открытым исходным кодом.
Компания Hume AI открыла публичный доступ к TADA - системе преобразования текста в речь, которая работает по принципу двойного выравнивания текста и акустики. Код и модели уже можно скачать и использовать под открытой лицензией.
Главная фишка - скорость. TADA генерирует речь в реальном времени более чем в пять раз быстрее аналогичных систем на базе больших языковых моделей. При этом точность высокая, а ошибки в содержании практически отсутствуют.

Технология использует прямое соответствие между текстовыми и аудио-токенами в пропорции один к одному. Благодаря этому система спокойно справляется с длинными фрагментами - контекстное окно поддерживает до 700 секунд аудио. Для сравнения: большинство существующих решений буксуют на длинных текстах из-за ограничений памяти и начинают "галлюцинировать" - пропускать или выдумывать фрагменты речи.

Hume AI специализируется на исследовательской инфраструктуре для голосового ИИ и работает с AI-лабораториями и технологическими компаниями. Релиз TADA под открытой лицензией - попытка подтолкнуть развитие всей отрасли через коллективную работу.

Система поставляется в английской и мультиязычной версиях. Особенно интересна возможность запуска на локальных устройствах - это снижает задержки и решает вопросы приватности, что критично для регулируемых индустрий.
Первые технические тесты показывают высокие оценки по естественности звучания и сходству с голосом диктора. Разработчики и AI-эксперты отмечают, что такая архитектура может серьезно изменить подход к синтезу речи, особенно там, где важны ограниченные ресурсы и строгие требования к безопасности данных.
Смотрите также
-
Opensource·Google открыла исходный код ИИ-модели для раннего предупреждения об ураганах
-
Opensource·Moonshot AI открыла веса Kimi K3 — модели на 2,8 триллиона параметров против OpenAI и Anthropic
-
Нейросети 18+·Stable Nude: обзор нейросети-раздеватора для обработки фото
-
Озвучка текста·ElevenLabs: полный обзор нейросети для озвучки текста, клонирования голоса и дубляжа
-
Opensource·pxpipe: опенсорс-инструмент, который прячет текст в PNG и снижает расходы на Claude Code до 70%
-
Opensource·North Mini Code от Cohere: агентная модель для разработчиков вышла в open-source
-
Исследования·Count Anything: нейросеть, которая умеет считать объекты на любом изображении
-
Opensource·Mellum2 от JetBrains: быстрая модель для ИИ-систем
-
Opensource·Kimi K2.6 - открытая модель с роем агентов