Wan S2VПопробовать

Поющее фото: как заставить снимок спеть

Поющая фотография — частный случай оживления портрета, но с дополнительным требованием: движение губ должно попадать не просто в речь, а в ритм и артикуляцию песни. Это заметно сложнее обычного разговора, и именно поэтому результат у разных сервисов расходится так сильно. Разбираем, что нужно на входе, откуда брать голос и почему иногда получается неубедительно.

Что происходит, когда фото начинает петь

Задача решается в два независимых этапа. Сначала модель восстанавливает по снимку объёмную структуру лица и понимает, где находятся губы, подбородок и мышцы вокруг рта. Затем она анализирует звуковую дорожку и раскладывает её на фонемы — минимальные звуковые единицы, каждой из которых соответствует своё положение рта.

Дальше кадры рисуются заново под каждый момент песни. В отличие от обычной речи, в пении гласные тянутся дольше, а рот открывается шире, и модель должна это учитывать. Если она обучалась в основном на разговорной речи, на вокале артикуляция получится вялой — губы будут двигаться, но «не петь».

Что нужно подготовить

Отдельно про звук: если взять песню прямо из плеера, вместе с голосом придёт вся аранжировка, и модель будет пытаться артикулировать в том числе барабаны. Разделение дорожки на вокал и инструментал заметно улучшает результат — эта операция делается отдельным инструментом за считанные секунды.

  • Фотография с крупным, хорошо освещённым лицом, желательно анфас и с открытым ртом или нейтральным выражением.
  • Аудиодорожка с чистым вокалом. Чем меньше в ней посторонних инструментов, тем точнее попадание в артикуляцию.
  • Длительность в пределах 10–15 секунд для первого прогона. Куплет целиком лучше собирать из нескольких фрагментов.
  • Понимание, чей это голос и есть ли у вас право его использовать.

Откуда взять голос, если петь некому

Есть три рабочих пути. Первый — записать себя: подходит, когда важна именно ваша интонация. Второй — сгенерировать песню целиком нейросетью по тексту и стилю, получив готовый вокал. Третий — синтезировать голос из текста, но для пения он подходит хуже: синтез речи звучит ровно и без музыкальной фразировки.

Для поздравлений и открыток чаще всего выбирают второй путь: сначала генерируется короткая песня с нужным текстом, потом ею оживляется фотография. Весь цикл занимает несколько минут.

Пошагово

  1. 1Подготовьте снимок: лицо крупно, глаза открыты, свет ровный.
  2. 2Подготовьте вокал — запишите, сгенерируйте или отделите от минусовки.
  3. 3Загрузите фото и аудио в кабинет.
  4. 4Ограничьте первый прогон 10–15 секундами, чтобы оценить попадание в артикуляцию.
  5. 5Посмотрите результат на паузе в нескольких местах: губы должны совпадать с гласными.
  6. 6При расхождении сократите фрагмент или очистите звук и повторите.

Почему губы не попадают в такт

Практическое правило: если результат не устроил, сначала чините звук, а не фотографию. В девяти случаях из десяти проблема на стороне дорожки.

  • В дорожке кроме голоса много инструментов — модель путается, что артикулировать.
  • Вокал обработан эффектами: сильный реверб или автотюн размывают границы фонем.
  • Лицо на снимке мелкое или повёрнуто — модели не хватает данных о форме рта.
  • Фрагмент слишком длинный: к концу накапливается рассинхрон.
  • Песня на языке, который модель отрабатывает хуже: артикуляция строится по звукам, и редкие фонемы даются тяжелее.

Где это уместно, а где нет

Поющие фотографии хорошо работают в поздравлениях, семейных открытках и небольших роликах для соцсетей — там ценится сам эффект неожиданности, а мелкие огрехи никого не смущают.

Чего делать не стоит: вкладывать слова в уста реальных людей без их согласия, и тем более публичных персон. Технически это возможно, но это уже не открытка, а подделка, и отвечать за неё придётся вам. К изображениям умерших родственников тоже стоит подходить осторожно — решение о таком видео лучше принимать всей семьёй.

Частые вопросы

Можно ли заставить петь фотографию, а не видео?
Да, именно так это и работает: на вход подаётся один неподвижный снимок и звуковая дорожка, видео генерируется целиком.
Нужна ли песня целиком?
Нет, и лучше начинать с фрагмента 10–15 секунд. Длинные ролики склонны к рассинхрону, их надёжнее собирать из кусков.
Подойдёт ли песня прямо из плеера?
Подойдёт, но результат будет хуже. Инструментал мешает модели различать фонемы — вокал лучше отделить.
Можно ли сделать так, чтобы фото пело моим голосом?
Да, если записать вокал самостоятельно. Достаточно записи с телефона в тихом помещении.

Попробуйте прямо сейчас — без VPN, оплата картой РФ

Открыть Wan S2V