Клонирование голоса в ComfyUI без установки: озвучка, дубляж и замена голоса
Клонирование голоса, озвучка и замена голоса в ComfyUI — без установки, без подписки и без обучения модели. Нажимаете Start GPU на imbutus.com, ждёте пару минут и работаете: окружение, ноды и веса уже на месте, карта арендуется на время работы и платите вы посекундно. Четыре задачи подряд: создать голос по текстовому описанию, снять с записи субтитры с таймингом, озвучить эти субтитры полученным голосом и заменить голос в уже готовой записи. На каждом шаге стоит своя модель, потому что одна редко бывает лучшей во всём: Qwen3-TTS, WhisperX, Fish Audio S2 и CosyVoice 3. Каждая модель живёт в своём бандле — это готовая конфигурация на карте: модель, вспомогательные модели и веса, ставить ничего не нужно. Все четыре модели открытые, веса лежат на Hugging Face, а workflow из видео выложены на GitHub — это ровно те файлы, что открываются в бандлах, так что при желании их можно перетащить в свой ComfyUI. Разобрано каждое поле: Instruct у генерации голоса, Pause Gap и Max Chars у субтитров, Fit to Timing и Max Stretch у дубляжа, Parallel под объём видеопамяти, Speed и Seed у замены голоса. Плюс то, о чём обычно молчат: как записывать исходник, чтобы дубляж не наезжал сам на себя, и какой длины должна быть запись-образец голоса. ⏱ Тайм-коды 00:00 Четыре задачи: создать голос, субтитры, дубляж, замена голоса 00:21 Четыре модели и почему не одна 00:38 Всё открыто: веса на Hugging Face 00:54 Workflow на GitHub 01:02 Что такое бандл и как запускается GPU 01:23 Как поставить тот же workflow у себя 01:40 Qwen3-TTS — единственный, кто делает голос по описанию 02:25 Папка Examples сбрасывается при каждом старте GPU 03:07 Поле Text и поле Instruct: что сказано и кто говорит 03:30 Язык произношения, первая генерация 04:03 Второй голос для дальнейших шагов 04:34 Fish Audio S2 и выбор тарифа 05:34 Субтитры из записи: workflow на WhisperX 06:05 Language, Pause Gap и Max Chars 06:56 Запуск и как скачать SRT 07:34 Тайм-коды и правка текста, в том числе перевод на другой язык 07:49 Как записывать исходник под дубляж 08:27 SRT to Audio: озвучка субтитров 08:58 Запись-образец голоса: от 10 до 30 секунд 09:23 Reference transcript и кнопка расшифровки 10:03 Fit to Timing и Max Stretch 10:43 Parallel: сколько блоков считать одновременно 11:00 Генерация дубляжа и результат 12:01 CosyVoice 3 — замена голоса в готовой записи 12:41 Workflow Change voice 13:18 Сравнение: оригинальный голос и целевой 13:36 Поля Speed и Seed 14:09 Генерация и результат 14:55 Chatterbox Multilingual — когда он нужен 15:26 Нода How to use в каждом workflow 15:35 Итог 🔗 Workflow Все workflow из видео — https://github.com/imbutus/comfyui-workflows 🔗 Модели из этого видео Qwen3-TTS Voice Design — https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign Qwen3-TTS Base — https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base Fish Audio S2 Pro — https://huggingface.co/fishaudio/s2-pro CosyVoice 3 — https://huggingface.co/FunAudioLLM/Fun-CosyVoice3-0.5B-2512 Chatterbox Multilingual — https://huggingface.co/ResembleAI/chatterbox WhisperX — https://github.com/m-bain/whisperX 📐 Что стоит запомнить • Запись-образец голоса для Fish — от 10 до 30 секунд и желательно без музыки. • Каждый блок субтитров должен заканчиваться знаком препинания: блок без точки Fish иногда пропускает. • Pause Gap — пауза, после которой начинается новый блок; Max Chars 0 означает резать только по паузам. • Fit to Timing только ускоряет блок, который не помещается, и никогда не растягивает короткий. Max Stretch — предел этого ускорения. • Между фразами в исходнике оставляйте паузу в одну-три секунды: она и разрывает субтитры, и даёт запас на другой язык. • Parallel подбирается под видеопамять: на 24 гигабайта один поток, на 96 — три. Ошибка памяти — понижайте значение. • Замена голоса меняет только тембр: слова, паузы и ударения остаются от исходного диктора, обучать модель голоса не нужно. • CosyVoice 3 небольшой, ему хватит карты от 12 гигабайт; языков у него 10, у Chatterbox — 23. • Workflow в папке Examples возвращаются к исходному состоянию при каждом старте GPU — свои копии сохраняйте вне этой папки. ⚠️ Голос из записи-образца — это голос конкретного человека. Работайте со своим голосом или с явного согласия человека, помечайте синтетический контент при публикации и соблюдайте правила площадки. 🎨 Все модели и workflow из этого видео уже установлены и готовы к запуску, оплата посекундная, без подписки: https://imbutus.com 📖 Документация: https://imbutus.com/docs #ComfyUI #клонированиеголоса #нейросети #озвучка #ИИголос
Название:
Клонирование голоса в ComfyUI без установки: озвучка, дубляж и замена голоса
Категория:
Разное