Как сделать липсинк нейросетью: пошаговый гид
Раньше, чтобы персонаж на видео убедительно открывал рот в такт речи, нужен был аниматор и много часов работы. Сегодня разобраться, как сделать липсинк нейросетью, можно за один вечер: вы даёте модели картинку или видео и звуковую дорожку, а она сама подгоняет движение губ по звуку. В этом гиде — что происходит под капотом, что нужно подготовить и как получить синхронизацию губ, которая не выглядит как дубляж старого боевика.
Что такое липсинк и как его делает нейросеть
Липсинк (от англ. lip sync) — это синхронизация движения губ с речью. Когда этим занимается нейросеть, происходит примерно следующее: модель разбивает аудио на мельчайшие звуковые единицы, фонемы, и сопоставляет каждой из них форму рта — так называемую висему.
Дальше нейросеть перерисовывает область губ и нижней части лица кадр за кадром так, чтобы артикуляция совпадала со звуком. Хорошая модель учитывает не только губы, но и подбородок, щёки и лёгкие движения головы — именно они делают картинку живой, а не «приклеенным ртом».
Важный вывод: качество липсинка на 90% зависит от двух вещей — чистого звука и внятного исходного лица. Всё остальное модель берёт на себя.
Что понадобится перед стартом
Чтобы синхронизация губ нейросетью получилась с первого раза, соберите три вещи.
- Изображение или видео с лицом. Лицо анфас или почти анфас, хорошо освещённое, без сильных теней и без руки у рта. Рот в кадре виден целиком.
- Аудиодорожку. Чистая речь без фоновой музыки, эха и шумов. Если голоса ещё нет — его можно сгенерировать из текста, об этом ниже.
- Текст реплики. Он пригодится и для озвучки, и для субтитров, и чтобы самому проверить, что нейросеть ничего не «проглотила».
Если исходник шумный или лицо повёрнуто в профиль, никакая модель не спасёт — движение губ по звуку получится смазанным. Лучше потратить пять минут на подготовку, чем десять попыток на перегенерацию.
Как сделать липсинк нейросетью: пошагово
Порядок действий почти везде одинаковый — меняются только кнопки. В Scriptly весь процесс идёт через чат с ИИ-режиссёром, поэтому опишу логику на его примере.
- Шаг 1. Подготовьте героя. Загрузите фото персонажа или опишите его словами. Нейросеть соберёт консистентного героя, которого можно использовать в нескольких сценах — подробнее об этом в гиде про ИИ-персонажа из фото.
- Шаг 2. Добавьте голос. Впишите реплику текстом и сгенерируйте озвучку персонажа или загрузите свою запись. Именно к этой дорожке нейросеть будет подгонять губы.
- Шаг 3. Запустите синхронизацию. Модель проанализирует аудио и наложит движение губ на лицо героя. Обычно доступно несколько дублей — выбираете тот, где артикуляция самая чистая.
- Шаг 4. Проверьте и доведите. Посмотрите результат на паузе в ключевых кадрах: губы должны смыкаться на звуках «м», «б», «п» и раскрываться на «а», «о». Если что-то не так — перегенерируйте только проблемный дубль.
- Шаг 5. Соберите видео. Добавьте субтитры нейросетью, музыку и склейте сцены в готовый ролик.
Как синхронизировать губы с речью без артефактов
Самые частые претензии к липсинку — «плавающий» рот, дрожание и рассинхрон на быстрой речи. Вот что реально помогает.
- Чистите звук до генерации, а не после. Уберите шум и нормализуйте громкость. Нейросеть ориентируется на форму звука — грязная дорожка даёт грязную артикуляцию).
- Не гоните темп. Скороговорки и наложенные голоса модель путает. Оставляйте между фразами короткие паузы.
- Держите лицо крупно. Чем больше рот в кадре, тем точнее нейросеть его перерисует. На дальних планах липсинк почти не читается — и это нормально.
- Совпадайте по языку. Если модель обучена на одном языке, а речь на другом, висемы могут «плыть». Для русской речи выбирайте инструмент, который её поддерживает.
- Работайте короткими репликами. Собрать ролик из нескольких аккуратных фраз проще, чем чинить одну минутную дорожку целиком.
Липсинк из одной фотографии
Отдельный сценарий — когда видео с человеком нет, а есть только фото. Здесь нейросеть сначала оживляет статичный портрет, а затем накладывает на него движение губ по звуку. Так рождается говорящий герой буквально из одного снимка.
Это удобно для аватаров, ведущих и рассказчиков: не нужно снимать себя на камеру, достаточно портрета и текста. Как собрать такого персонажа с нуля, подробно разобрано в гидах про говорящего аватара из фото и про то, как оживить персонажа из фото нейросетью.
Минус подхода один: чем меньше исходной информации о лице, тем осторожнее нейросеть с мимикой. Портрет хорошего качества анфас решает большинство проблем.
Где липсинк особенно выручает
Синхронизация губ нейросетью — это не только мемы, хотя и для них тоже.
- Дубляж и локализация. Персонаж говорит на другом языке, а губы двигаются естественно.
- Объясняющие ролики и уроки. Аватар-ведущий проговаривает сценарий без съёмки и микрофона.
- Короткометражки и сцены с диалогами. Герои реально «разговаривают» друг с другом, а не просто стоят под закадровым текстом.
- Соцсети. Быстрый говорящий контент под тренд без камеры и монтажа.
Если собираете полноценную историю со сценами и репликами, липсинк — лишь один из этапов; как выстроить весь процесс, показано в гиде о том, как сделать фильм нейросетью.
Соберите говорящего героя прямо сейчас
Липсинк перестал быть уделом аниматоров: чистый звук, внятное лицо и пара минут — этого достаточно, чтобы персонаж заговорил. Опишите героя в чате, дайте ему голос и текст, и нейросеть синхронизирует губы с речью за вас.
Попробуйте собрать своего говорящего персонажа в Scriptly — от портрета до готовой сцены в одном разговоре с ИИ-режиссёром.
Частые вопросы
FAQ
Нужно ли снимать видео, чтобы сделать липсинк?
Нет. Липсинк можно сделать даже из одной фотографии: нейросеть сначала оживляет портрет, а потом накладывает движение губ по звуку. Видео с лицом просто даёт больше исходной мимики.
Что важнее для качества — картинка или звук?
И то, и другое, но чистый звук критичнее. Нейросеть строит движение губ по фонемам, поэтому шум, эхо и музыка в дорожке напрямую портят синхронизацию.
Работает ли синхронизация губ нейросетью с русской речью?
Да, если выбрать инструмент, который поддерживает русский. Модель, обученная на другом языке, может неточно подбирать формы рта под русские звуки.
Откуда взять голос, если своей записи нет?
Голос можно сгенерировать из текста нейросетью, а затем к этой дорожке подогнать губы. Так липсинк собирается вообще без микрофона.
Почему рот на видео «плывёт» и дрожит?
Чаще всего из-за грязного звука, слишком быстрой речи или мелкого лица в кадре. Почистите аудио, замедлите темп и держите лицо крупнее — артефакты обычно уходят.
Можно ли синхронизировать губы сразу для нескольких сцен?
Да. Удобнее работать короткими репликами по сценам, а затем склеивать их в один ролик — так проще перегенерировать только проблемный фрагмент.