← Все статьиГайды для селлеров

Говорящее фото нейросеть делает из одного снимка: как это работает

Артём Соколов2 октября 2026 г.Чтение займёт 2 мин
Говорящее фото нейросеть делает из одного снимка: как это работает

Говорящее фото нейросеть делает из одного снимка и звуковой дорожки. Разбираем, какой портрет подходит, что получается и где предел технологии.

Говорящее фото нейросеть собирает из двух вещей: одного статичного портрета и звуковой дорожки. На выходе человек со снимка произносит текст, шевелит губами и слегка двигает головой.

Как это устроено

Модель находит на снимке лицо и строит его упрощённую подвижную схему: рот, веки, наклон головы.

Дальше она гонит по этой схеме звуковую дорожку, подбирая форму рта под звуки.

Исходное изображение при этом остаётся основой: цвет кожи, причёска и фон берутся с него.

Поэтому качество результата упирается в качество портрета сильнее, чем в модель.

Изображение

Какой портрет подходит

Лицо анфас или почти анфас. Профиль модель разворачивать не умеет.

Рот закрыт или чуть приоткрыт. Широкая улыбка с зубами даёт странную анимацию.

Хорошее разрешение: мелкий снимок даёт мыло на лице в движении.

Ровный свет без глубоких теней на половине лица.

Одно лицо в кадре. Групповое фото модель обрабатывает непредсказуемо.

Говорящее фото нейросеть: где предел

Длина реплики. Всё то же ограничение, что и в обычном липсинке: на длинной фразе синхронность уходит, подробности в отдельном разборе.

Эмоции. Голос может звучать возмущённо, а лицо останется нейтральным.

Повороты. Голова покачивается, но развернуться в профиль и обратно не сможет.

Руки и корпус. Их либо нет в кадре, либо они остаются неподвижными, и это выглядит странно.

Как подготовить звук

Записывайте или синтезируйте речь до генерации: движение строится под готовую дорожку.

Режьте текст на фразы по три-четыре секунды.

Убирайте паузы в начале и конце: они дают лишние секунды, на которых лицо начинает плыть.

Проверяйте темп: слишком быстрая речь ломает артикуляцию заметнее, чем медленная.

Где это применимо

Короткое обращение от лица бренда или автора.

Оживление исторического портрета для образовательного материала.

Персонаж-ведущий в серии коротких роликов.

Чего я бы не делал: не стал бы выдавать говорящее фото за настоящую съёмку человека. Это плохо кончается даже без юридической стороны вопроса, про права и согласие писали отдельно.

И ещё: чужое лицо без разрешения человека в такую обработку отдавать нельзя. Своё, лицо сотрудника с его согласия, нарисованный персонаж это нормально.

Хотя граница тут тоньше, чем кажется. Портрет прадеда для семейного архива никого не обманывает, а тот же приём в рекламе уже вопрос.

Часто задаваемые вопросы

Что нужно, чтобы сделать говорящее фото? Один портрет анфас и звуковая дорожка. Модель строит подвижную схему лица и прогоняет по ней речь.

Какой снимок подойдёт лучше всего? Анфас, хорошее разрешение, ровный свет, закрытый или чуть приоткрытый рот, одно лицо в кадре.

Можно ли получить длинный монолог? Устойчиво работают короткие реплики. Длинный текст разбивают на фразы и собирают в монтаже.

Можно ли оживить чужой портрет? Только с согласия человека. Для рекламы и публичных материалов это обязательное условие, а не формальность.

Источники

  1. Flami: липсинк нейросетью
  2. Flami: авторские права на AI-видео
  3. Flami: нейросеть оживит фотографию

Об авторе

Артём Соколов

Обозреватель Flami

Читайте также

Получите 15 кредитов бесплатно

Их можно потратить на генерацию изображений и видео:

≈ 11 х Nano Banana 2, ≈ 12 х GPT Image 2, ≈ 1 х Seedance 2

Получить кредиты бесплатно