Говорящее фото нейросеть делает из одного снимка: как это работает

Говорящее фото нейросеть делает из одного снимка и звуковой дорожки. Разбираем, какой портрет подходит, что получается и где предел технологии.
Говорящее фото нейросеть собирает из двух вещей: одного статичного портрета и звуковой дорожки. На выходе человек со снимка произносит текст, шевелит губами и слегка двигает головой.
Как это устроено
Модель находит на снимке лицо и строит его упрощённую подвижную схему: рот, веки, наклон головы.
Дальше она гонит по этой схеме звуковую дорожку, подбирая форму рта под звуки.
Исходное изображение при этом остаётся основой: цвет кожи, причёска и фон берутся с него.
Поэтому качество результата упирается в качество портрета сильнее, чем в модель.
Какой портрет подходит
Лицо анфас или почти анфас. Профиль модель разворачивать не умеет.
Рот закрыт или чуть приоткрыт. Широкая улыбка с зубами даёт странную анимацию.
Хорошее разрешение: мелкий снимок даёт мыло на лице в движении.
Ровный свет без глубоких теней на половине лица.
Одно лицо в кадре. Групповое фото модель обрабатывает непредсказуемо.
Говорящее фото нейросеть: где предел
Длина реплики. Всё то же ограничение, что и в обычном липсинке: на длинной фразе синхронность уходит, подробности в отдельном разборе.
Эмоции. Голос может звучать возмущённо, а лицо останется нейтральным.
Повороты. Голова покачивается, но развернуться в профиль и обратно не сможет.
Руки и корпус. Их либо нет в кадре, либо они остаются неподвижными, и это выглядит странно.
Как подготовить звук
Записывайте или синтезируйте речь до генерации: движение строится под готовую дорожку.
Режьте текст на фразы по три-четыре секунды.
Убирайте паузы в начале и конце: они дают лишние секунды, на которых лицо начинает плыть.
Проверяйте темп: слишком быстрая речь ломает артикуляцию заметнее, чем медленная.
Где это применимо
Короткое обращение от лица бренда или автора.
Оживление исторического портрета для образовательного материала.
Персонаж-ведущий в серии коротких роликов.
Чего я бы не делал: не стал бы выдавать говорящее фото за настоящую съёмку человека. Это плохо кончается даже без юридической стороны вопроса, про права и согласие писали отдельно.
И ещё: чужое лицо без разрешения человека в такую обработку отдавать нельзя. Своё, лицо сотрудника с его согласия, нарисованный персонаж это нормально.
Хотя граница тут тоньше, чем кажется. Портрет прадеда для семейного архива никого не обманывает, а тот же приём в рекламе уже вопрос.
Часто задаваемые вопросы
Что нужно, чтобы сделать говорящее фото? Один портрет анфас и звуковая дорожка. Модель строит подвижную схему лица и прогоняет по ней речь.
Какой снимок подойдёт лучше всего? Анфас, хорошее разрешение, ровный свет, закрытый или чуть приоткрытый рот, одно лицо в кадре.
Можно ли получить длинный монолог? Устойчиво работают короткие реплики. Длинный текст разбивают на фразы и собирают в монтаже.
Можно ли оживить чужой портрет? Только с согласия человека. Для рекламы и публичных материалов это обязательное условие, а не формальность.
Источники
Об авторе
Артём Соколов
Обозреватель Flami
Читайте также
Озвучка текста нейросетью: что звучит живо, а что выдаёт робота
Veo 3.1 от Google: полный обзор, на что способна и где имеет смысл использовать в 2026
Kling 3.0: китайский ответ на Veo и Sora — что он реально умеет
Runway Aleph: видеоредактор на стероидах, или почему это не «ещё одна нейросеть для видео»