Реальный тест

Как сделать говорящее фото нейросетью: тест с голосом

Мы взяли один синтетический портрет, написали русский текст на 120 символов и запустили инструмент AI Аватар в Arckép. Задача была не «оживить» фотографию движением, а заставить человека на ней говорить.

Результат — видео на 12 секунд, запуск стоил 81 ₽. Лицо сохранилось хорошо, русский голос звучит нормально, губы большую часть речи попадают в слова. Но в конце ролика рот продолжал двигаться, когда речь уже закончилась.

Это отчёт об одном запуске 8 октября 2026 года, а не рейтинг AI-аватаров. Мы не сравнивали Arckép с другими сервисами в этой задаче и не берёмся утверждать, что где-то лучше или хуже.

1 синтетический портретAI Аватаррусский текст · 120 символоввидео 12 секунд81 ₽ за запуск

Короткий ответ

Да, говорящее фото из одного портрета сделать можно. В нашем запуске Arckép с инструментом AI Аватар получилось видео на 12 секунд: человек говорит русским голосом, лицо остаётся узнаваемым, а большая часть речи визуально совпадает с движением губ.

Мы загрузили синтетический портрет, написали текст на 120 символов, выбрали голос и запустили генерацию без фоновой музыки. Рядом с текстом интерфейс оценивал речь примерно в 6 секунд, готовый ролик получился 12 секунд, а запуск стоил 81 ₽.

Главный минус — в конце: после окончания речи рот продолжал двигаться ещё примерно 2–3 секунды. Для публикации такой ролик пришлось бы подрезать в конце.

Термины

Что значит «говорящее фото»

«Оживить фото» и «сделать говорящее фото» — разные задачи, хотя инструменты могут выглядеть похоже.

Обычное оживление фотографии — это image-to-video: человек на снимке начинает двигаться, поворачивать голову, моргать, камера может приближаться. Звука в такой задаче нет вообще.

Говорящее фото — это движение плюс речь: сервис озвучивает текст выбранным голосом и подстраивает артикуляцию под звук. Здесь главным критерием качества становится синхронизация губ: лицо может сохраниться идеально, но если рот живёт отдельно от слов, ролик выглядит сломанным.

Поэтому мы развели эти два теста. Движение и сохранение лица при оживлении фотографии проверяли отдельно — в материале «Как оживить фото нейросетью». Здесь речь только про голос, артикуляцию и совпадение губ со словами.

Условия

Как проводили тест

Tested. Дата запуска — 8 октября 2026 года. Сервис — Arckép, инструмент в интерфейсе называется AI Аватар. Режим ввода — «Написать текст»: загруженное аудио мы не использовали, текст озвучивал сам сервис.

Tested. Текст для озвучки: «Сегодня проверяю, насколько естественно нейросеть оживляет фотографию и синхронизирует движение губ с русской речью.» Это 120 символов — столько показал интерфейс рядом с полем ввода.

Checked. Рядом с текстом интерфейс оценивал речь примерно в 6 секунд. Это оценка длительности речи, а не обещание длины готового ролика: итоговое видео получилось 12 секунд.

Checked. Голос — Casual. Фоновую музыку не использовали, промпт анимации не заполняли: в интерфейсе это необязательное поле, и в нашем запуске оно осталось пустым.

Tested. Для теста использовали синтетический портрет, созданный специально для этой проверки. Это не фотография реального человека.

Синтетический портрет мужчины анфас, созданный специально для теста говорящего фото
ИсходникСинтетический портрет: мужчина анфас, хорошо видны рот и глаза, нейтральный свет и простой фон
Arckép AI Аватар: загруженный портрет, режим «Написать текст», 120 символов и оценка речи ~6 сек
Ввод данных120 символов текста; интерфейс оценивает речь примерно в 6 секунд
Arckép AI Аватар, шаг 4: настройки речи со скоростью, интонацией и тембром
Настройки речиШаг 4: скорость речи, интонация и тембр голоса
Arckép AI Аватар: фоновая музыка, пустое поле промпта анимации и предварительная оценка ~6 сек видео
Музыка и промпт анимацииФоновая музыка не использовалась, поле промпта анимации осталось пустым
Arckép AI Аватар: экран генерации с надписью Generating speech и прогрессом
ГенерацияЭкран во время обработки: сервис озвучивает текст и собирает видео

Как читать эту статью. Tested — то, что мы реально запускали и увидели в результате. Checked — то, что видно в интерфейсе Arckép на наших скриншотах. Documented — официальные данные сервиса; в этом тесте мы к ним не обращались, потому что описываем только собственный запуск.

Инструкция

Как сделать говорящее фото в Arckép

Порядок действий в нашем запуске выглядел так. Мы не придумываем названия кнопок: ниже — то, что было на экранах во время теста.

  1. Открыть инструмент AI Аватар.
  2. Загрузить фото лица — у нас это был синтетический портрет.
  3. Выбрать режим «Написать текст».
  4. Вставить текст, который должен произнести аватар.
  5. Выбрать голос в разделе «Настройки речи».
  6. При необходимости настроить фоновую музыку и промпт анимации — мы оставили их без изменений.
  7. Запустить генерацию.
  8. Дождаться готового MP4 и скачать его.

В подсказках сервиса на том же экране указано, что фото должно быть в хорошем качестве, лицо хорошо видно, а анфас работает лучше всего. В нашем портрете выполнялись все три условия: лицо анфас, крупно, при нейтральном свете и на простом фоне.

Отдельно отметим шаг с промптом анимации. В отличие от обычного оживления фотографии, здесь ничего описывать не нужно: речь задаётся текстом, а не промптом. Промпт анимации — дополнительная настройка, и в нашем запуске мы её не использовали.

Результат

Что получилось

Готовый ролик — MP4 на 12 секунд. Лицо сохранилось хорошо, человек остался узнаваемым, мимика выглядит достаточно естественно. Добавились движения головы и рук, поэтому видео не выглядит статичной картинкой с озвучкой.

Русский голос воспроизводится нормально: речь разборчивая, интонация ровная. Главное, что получилось по сути задачи, — это полноценное говорящее видео из одного портрета и текста, без загрузки аудио и без промпта анимации.

Ниже — сам файл. Звук в ролике не отключён: голос и есть главная часть теста. Если встроенный плеер не работает, ссылка на MP4 есть внутри блока.

Результат: говорящее фото12 секунд · русский голос · 81 ₽ за наш запуск 8 октября 2026
Экран результата Arckép AI Аватар: готовое видео 12 секунд и стоимость 81 рубль
Готовый ролик12 секунд, стоимость 81 ₽
История генераций Arckép: тип Аватар, маркер kling-avatar-standard, 81 рубль и 12 секунд
История Arcképkling-avatar-standard, 81 ₽, 12s

Качество

Насколько хорошо совпадают губы и речь

Tested. В целом синхронизация рабочая. Большую часть речи губы двигались в такт словам, и ролик не выглядит как неподвижное фото с наложенным звуком. Это главное, что мы проверяли, и базовая задача выполнена.

Где синхронизация работала

На большинстве фраз артикуляция попадала в речь достаточно точно, чтобы не отвлекать зрителя. Отдельно отметим лицо: оно не «поплыло» при движении губ, мимика осталась естественной, а человек — узнаваемым.

Главный дефект: рот двигался после окончания речи

Основная проблема появилась в конце ролика. Речь уже закончилась, но рот продолжал двигаться ещё примерно 2–3 секунды. На этом отрезке видео выглядит странно: человек молчит, а артикуляция продолжается.

Местами губы двигались немного не точно под конкретные слова — это тоже было заметно. Но если небольшие расхождения скорее мелочь, то движение рта в тишине уже портит впечатление от конца ролика.

Ограничение

Из-за этого дефекта ролик в исходном виде мы не назвали бы готовым к публикации. Практический вывод простой: перед публикацией видео стоит подрезать в конце примерно на 2–3 секунды.

Checked. Это видно и по самому файлу: аудиодорожка в MP4 заканчивается раньше видеодорожки — 10,5 секунды против 12,3 секунды. То есть последние примерно 1,8 секунды ролика идут без звука.

Идеальной синхронизацию мы не называем. В нашем тесте она хорошая, но не безупречная: для простого ролика этого достаточно, для задачи с очень точной артикуляцией — вопрос открытый.

Стоимость

Сколько стоит говорящее фото

Фактическая стоимость нашего запуска — 81 ₽. Это не «примерно»: сумма подтверждена экраном результата и историей генераций Arckép.

81 ₽ — стоимость нашего конкретного запуска 8 октября 2026 года. Тарифы и стоимость AI-аватара могут измениться.

Что было в нашем запуске:

  • Текст: 120 символов.
  • Оценка речи в интерфейсе: ~6 сек.
  • Итоговое видео: 12 сек.
  • Генерация: около 6 минут по времени между нашими скриншотами.

Checked. Перед запуском интерфейс показывал предварительную оценку ~39 ₽ и ~6 сек видео. Фактически запуск стоил 81 ₽, а ролик получился 12 секунд. Почему оценка и факт разошлись, сервис не объясняет, и мы не берёмся это утверждать. Ценой нашего запуска считаем 81 ₽ — она подтверждена экраном результата и историей генераций.

Checked. По нашим скриншотам между запуском и появлением результата прошло около шести минут. Это время по нашим скриншотам, а не серверная метрика сервиса: на снимке экрана с запуском видно 14:24, на экране результата — 14:30.

ПараметрНаш тест
СервисArckép
ИнструментAI Аватар
Исходниксинтетический портрет
Языкрусский
Текст120 символов
Оценка речи~6 сек
Итоговое видео12 сек
Стоимость81 ₽
Время генерацииоколо 6 минут
Lip-syncхороший, но не идеальный

Это стоимость одного нашего запуска, а не тариф Arckép. Цена AI-аватара зависит от параметров генерации и может измениться, поэтому перед запуском стоит смотреть актуальную сумму в интерфейсе.

Плюсы

Что понравилось

  • лицо сохранилось хорошо, человек остался узнаваемым;
  • мимика выглядит достаточно естественно;
  • добавились движения головы и рук, ролик не статичный;
  • русский голос воспроизводится нормально;
  • сценарий «фото → текст → видео» оказался простым: без промпта анимации и без загрузки аудио.

Минусы

Что не понравилось

  • местами губы двигались немного не точно под конкретные слова;
  • после окончания речи рот продолжал двигаться ещё примерно 2–3 секунды;
  • итоговая длина видео оказалась заметно больше оценки возле текста: ~6 сек против 12 сек;
  • для готовой публикации ролик желательно подрезать в конце.

Бесплатный запуск

Можно ли сделать говорящее фото бесплатно

Полностью бесплатный запуск в этом тесте мы не проверяли. Наша генерация стоила 81 ₽.

Поэтому мы не пишем, что говорящее фото можно сделать бесплатно, и не называем AI Аватар бесплатным инструментом: запуска, который это подтверждает, у нас нет. Если у сервиса есть стартовый бонус или пробный режим, его условия нужно проверять на официальном сайте на момент регистрации — в рамках этого теста мы их не проверяли.

Отдельно уточним, что бесплатность и качество — разные вопросы. Даже если пробный запуск доступен, он не отменяет ограничений, которые мы описали выше: движения рта после окончания речи и небольших расхождений артикуляции со словами.

Сценарии

Кому подойдёт такой формат

Говорящее фото из одного портрета подойдёт там, где не нужна длинная речь и идеальная артикуляция:

  • аватар для соцсетей;
  • короткое обращение к аудитории;
  • презентация или обучающий ролик;
  • персонаж или говорящий герой из изображения.

Для задач, где требуется очень точная артикуляция — например, длинная лекция или дубляж, — одного нашего теста недостаточно, чтобы рекомендовать инструмент без оговорок.

Вывод

Итог

В нашем тесте AI Аватар в Arckép сделал убедительное говорящее видео из одного синтетического портрета и русского текста. Лицо сохранилось хорошо, голос звучит нормально, синхронизация губ достаточная для простого ролика.

Без дефектов не обошлось. Главный минус — рот продолжал двигаться примерно 2–3 секунды после окончания речи, а местами губы попадали в слова неточно. Для ролика, где требуется очень точная артикуляция, одного теста недостаточно, чтобы рекомендовать инструмент без оговорок.

Итог по деньгам: 81 ₽ за 12-секундный ролик в нашем запуске 8 октября 2026 года.

О партнёрских ссылках: ссылка на Arckép в этой статье партнёрская. «Нейропроба» может получить комиссию после перехода, но это не меняет стоимость для пользователя и не влияет на выводы теста. Подробнее — в разделе о партнёрских ссылках.

Нужен подбор AI-инструментов под вашу задачу?

Если не хотите самостоятельно сравнивать сервисы, голоса и настройки, я могу подобрать конкретный набор инструментов под задачу и бюджет.

Как проходит подбор

FAQ

Частые вопросы

Тест проведён 8 октября 2026 года. Интерфейсы, цены и условия сервисов могут измениться.