Lablab.ai
Платформа для участия в AI-хакатонах и создания прототипов с помощью современных технологий искусственного интеллекта.
so-vits-svc-fork — это открытый форк проекта so-vits-svc, инструмента для конверсии голоса и пения: берёшь запись одного человека и переводишь её в тембр другого по обученной модели. Главное отличие от оригинала — поддержка работы в реальном времени, переделанный графический интерфейс и единый CLI. Ставится через pip и запускается на своём компьютере, так что это вариант для тех, кто готов возиться с Python и хочет разобраться в конверсии голоса.
Работает форк на ветке 4.0 (v1), и модели оттуда полностью совместимы. Модели 4.1 и от других проектов не поддерживаются — это важно проверить до того, как скачивать чужие чекпоинты. Готовые модели лежат на Hugging Face и CIVITAI, а предобученные веса подтянутся сами при первом запуске, отдельно ставить fairseq не потребуется.
Что здесь добавили поверх оригинала:
Установка на выбор: BAT-файл в один клик для Windows, pipx или обычное виртуальное окружение с Python 3.11. Для GPU-инференса нужно хотя бы 4 ГБ видеопамяти, но и на CPU скорость приемлемая. На Linux с картами AMD ставится сборка PyTorch под ROCm, на Windows AMD не поддерживается, на macOS, скорее всего, заработает через MPS. Если в микрофон лезет шум, HuBERT отреагирует и на него — авторы советуют включить шумодав вроде RTX Voice.
Для обучения своей модели есть отдельный набор подготовительных команд: svc pre-split порежет длинную запись одного спикера на куски, svc pre-sd разделит файл с несколькими голосами через pyannote.audio, а svc pre-classify поможет разложить фрагменты по папкам вручную. Фоновую музыку из датасета лучше убрать заранее сторонним вокал-ремувером. Комфортное обучение начинается от 10 ГБ VRAM, иначе остаются бесплатный Colab для лёгких экспериментов и Paperspace для серьёзных прогонов.
Проект бесплатный и лежит на GitHub, но автор больше его не развивает: обновления с 2023 года ограничены поддержкой, а в качестве живых альтернатив в README перечислены RVC-семейство (в том числе Applio), VCClient, DDSP-SVC и другие. Если нужна минимальная задержка и максимальное качество, стоит посмотреть их. so-vits-svc-fork остаётся удобной точкой входа — просто потому, что ставится легко и запускается почти сразу.
Платформа для участия в AI-хакатонах и создания прототипов с помощью современных технологий искусственного интеллекта.
Переводчик экранного текста в реальном времени для игр, фильмов и аниме. Работает с английским, японским, китайским и корейским языками с задержкой менее миллисекунды.
Китайский ИИ побил рекорды: бесплатная нейросеть с мощью суперкомпьютера
Нейросеть для превращения роботского текста в живой. Убирает ИИ-маркеры из любого контента и делает его естественным для читателя.