HeyCLI
Инструмент для перевода команд с обычного языка на язык Linux. Просто опишите словами, что нужно сделать, и получите готовую команду.
NAVA — это фреймворк для совместной генерации аудио и видео, где звук и картинка создаются не по отдельности, а сразу в едином пространстве выравнивания. Никаких костылей в виде вокодеров, которые подгоняют аудио к уже готовому видео — всё рождается вместе, в синхроне.
В основе архитектура Align-then-Fuse MMDiT: сначала строится соответствие между аудио и видео, потом они объединяются в единый процесс денойзинга. 6,3 миллиарда параметров — и на выходе 720p-видео со стерео-звуком примерно за минуту на восьми GPU.
Отдельная фича — Timbre-in-Context Conditioning. Это механизм, который привязывает тембр голоса из референсного WAV-файла к конкретным речевым фрагментам. Нужно, чтобы разные спикеры звучали своими голосами — передаёшь соответствующие файлы, и NAVA это учтёт. Помимо этого, можно управлять камерой через текстовый промпт: задавать композицию кадра, движение и темп прямо в описании.
Репозиторий полностью открытый и комплектный: инференс-пайплайн, интерактивный Gradio-демо, код для обучения. Можно запускать, дообучать и строить поверх. Под разное железо есть несколько режимов запуска — от 80 ГБ VRAM без офлоада до ~18 ГБ с FP8 и тайлингом VAE. RTX 4090 тянет с group offload, RTX 5090 — из коробки по FP8-пути.
Видео можно генерировать в любом соотношении сторон — горизонталь, вертикаль, квадрат — из одного чекпоинта. Аудио-ветка и аудиовизуальное выравнивание обучены с нуля, без предобученных аудио-бэкбонов.
Инструмент для перевода команд с обычного языка на язык Linux. Просто опишите словами, что нужно сделать, и получите готовую команду.
Автоматизированная платформа для криптоинвестиций с настройкой покупок, продаж и реинвестирования на автопилоте для любого уровня опыта.
SEO-платформа, которая анализирует топ поисковой выдачи и создает оптимизированный контент на основе данных конкурентов.
Чат-платформа с персональной памятью для ChatGPT, Claude, Gemini и Grok. Переключайся между моделями, сохраняя контекст и историю разговоров.