⚔️ Спор / 🤖 Технологии и ИИ

Решил попробовать SkyReels V3 на RTX 5060 Ti 16 ГБ — вот что получилось

Автор делится опытом использования SkyReels V3 для локальной генерации видео с озвучкой. Обсуждаются настройки, процесс генерации и качество синхронизации губ.

Я запустил SkyReels V3 на своём компьютере, чтобы проверить, можно ли локально сделать небольшой ролик с озвучкой и синхронизацией губ. Для первого теста выбрал простую сцену продолжительностью 15 секунд.

Голосовую дорожку примерно той же длины подготовил через ElevenLabs. В ChatGPT создал начальный кадр и написал промпт-сценарий: описал действия персонажа, движение камеры и события в сцене.

SkyReels V3 запускал через ComfyUI. Для сборки workflow пришлось установить дополнение WanVideoWrapper, а затем отдельно скачать недостающие веса, VAE и другие модели. Все файлы заняли немало места, но после настройки генерация запустилась.

Workflow с нуля я не собирал. Взял стандартный шаблон из ComfyUI и переделал под свою задачу: добавил начальное изображение персонажа, готовую аудиодорожку и промпт со сценарием.

Главным ограничением оказалась видеопамять. На моей GeForce RTX 5060 Ti с 16 ГБ VRAM попытки увеличить разрешение быстро заканчивались ошибкой Out Of Memory. Стабильно запустить генерацию удалось в вертикальном разрешении:

480 × 864 пикселей

Для короткого видео в формате 9:16 этого достаточно. При таких настройках 16 ГБ видеопамяти хватает, чтобы генерация дошла до конца.

Быстрым процесс всё равно не назвать. Генерация видео требует много вычислительных ресурсов, особенно если увеличивать продолжительность сцены. Но SkyReels V3 действительно можно запустить локально на потребительской видеокарте с 16 ГБ памяти.

Больше всего меня интересовало, как модель работает со звуком. Синхронизация губ получилась неидеальной: в сложных фрагментах речи движения рта иногда немного расходятся с отдельными звуками и словами. Но в целом персонаж выглядит так, будто произносит текст из загруженной аудиодорожки. Для полностью локальной генерации видео результат оказался более чем достойным.

Весь процесс удалось собрать из нескольких нейросетевых инструментов. ChatGPT помог придумать сцену, создать начальный кадр и подготовить промпт, ElevenLabs сгенерировал голос, а SkyReels V3 через ComfyUI превратил исходные материалы в готовую видеосцену.

Пока это только первый тест. Дальше можно улучшать промпты, менять настройки генерации, пробовать другие голоса, разрешения и более сложные движения персонажа. Но уже после первого запуска стало понятно, что SkyReels V3 подходит для небольших сцен с говорящими персонажами.

Вот что в итоге у меня получилось:

Скачать или открыть видео
👁 109 💬 0 👍 0 👎 0