Поющее фото: как заставить снимок спеть
Поющая фотография — частный случай оживления портрета, но с дополнительным требованием: движение губ должно попадать не просто в речь, а в ритм и артикуляцию песни. Это заметно сложнее обычного разговора, и именно поэтому результат у разных сервисов расходится так сильно. Разбираем, что нужно на входе, откуда брать голос и почему иногда получается неубедительно.
Что происходит, когда фото начинает петь
Задача решается в два независимых этапа. Сначала модель восстанавливает по снимку объёмную структуру лица и понимает, где находятся губы, подбородок и мышцы вокруг рта. Затем она анализирует звуковую дорожку и раскладывает её на фонемы — минимальные звуковые единицы, каждой из которых соответствует своё положение рта.
Дальше кадры рисуются заново под каждый момент песни. В отличие от обычной речи, в пении гласные тянутся дольше, а рот открывается шире, и модель должна это учитывать. Если она обучалась в основном на разговорной речи, на вокале артикуляция получится вялой — губы будут двигаться, но «не петь».
Что нужно подготовить
Отдельно про звук: если взять песню прямо из плеера, вместе с голосом придёт вся аранжировка, и модель будет пытаться артикулировать в том числе барабаны. Разделение дорожки на вокал и инструментал заметно улучшает результат — эта операция делается отдельным инструментом за считанные секунды.
- Фотография с крупным, хорошо освещённым лицом, желательно анфас и с открытым ртом или нейтральным выражением.
- Аудиодорожка с чистым вокалом. Чем меньше в ней посторонних инструментов, тем точнее попадание в артикуляцию.
- Длительность в пределах 10–15 секунд для первого прогона. Куплет целиком лучше собирать из нескольких фрагментов.
- Понимание, чей это голос и есть ли у вас право его использовать.
Откуда взять голос, если петь некому
Есть три рабочих пути. Первый — записать себя: подходит, когда важна именно ваша интонация. Второй — сгенерировать песню целиком нейросетью по тексту и стилю, получив готовый вокал. Третий — синтезировать голос из текста, но для пения он подходит хуже: синтез речи звучит ровно и без музыкальной фразировки.
Для поздравлений и открыток чаще всего выбирают второй путь: сначала генерируется короткая песня с нужным текстом, потом ею оживляется фотография. Весь цикл занимает несколько минут.
Пошагово
- 1Подготовьте снимок: лицо крупно, глаза открыты, свет ровный.
- 2Подготовьте вокал — запишите, сгенерируйте или отделите от минусовки.
- 3Загрузите фото и аудио в кабинет.
- 4Ограничьте первый прогон 10–15 секундами, чтобы оценить попадание в артикуляцию.
- 5Посмотрите результат на паузе в нескольких местах: губы должны совпадать с гласными.
- 6При расхождении сократите фрагмент или очистите звук и повторите.
Почему губы не попадают в такт
Практическое правило: если результат не устроил, сначала чините звук, а не фотографию. В девяти случаях из десяти проблема на стороне дорожки.
- В дорожке кроме голоса много инструментов — модель путается, что артикулировать.
- Вокал обработан эффектами: сильный реверб или автотюн размывают границы фонем.
- Лицо на снимке мелкое или повёрнуто — модели не хватает данных о форме рта.
- Фрагмент слишком длинный: к концу накапливается рассинхрон.
- Песня на языке, который модель отрабатывает хуже: артикуляция строится по звукам, и редкие фонемы даются тяжелее.
Где это уместно, а где нет
Поющие фотографии хорошо работают в поздравлениях, семейных открытках и небольших роликах для соцсетей — там ценится сам эффект неожиданности, а мелкие огрехи никого не смущают.
Чего делать не стоит: вкладывать слова в уста реальных людей без их согласия, и тем более публичных персон. Технически это возможно, но это уже не открытка, а подделка, и отвечать за неё придётся вам. К изображениям умерших родственников тоже стоит подходить осторожно — решение о таком видео лучше принимать всей семьёй.
Частые вопросы
- Можно ли заставить петь фотографию, а не видео?
- Да, именно так это и работает: на вход подаётся один неподвижный снимок и звуковая дорожка, видео генерируется целиком.
- Нужна ли песня целиком?
- Нет, и лучше начинать с фрагмента 10–15 секунд. Длинные ролики склонны к рассинхрону, их надёжнее собирать из кусков.
- Подойдёт ли песня прямо из плеера?
- Подойдёт, но результат будет хуже. Инструментал мешает модели различать фонемы — вокал лучше отделить.
- Можно ли сделать так, чтобы фото пело моим голосом?
- Да, если записать вокал самостоятельно. Достаточно записи с телефона в тихом помещении.
Попробуйте прямо сейчас — без VPN, оплата картой РФ
Открыть Wan S2V