Реальный тест
Как сделать говорящее фото нейросетью: тест с голосом
Мы взяли один синтетический портрет, написали русский текст на 120 символов и запустили инструмент AI Аватар в Arckép. Задача была не «оживить» фотографию движением, а заставить человека на ней говорить.
Результат — видео на 12 секунд, запуск стоил 81 ₽. Лицо сохранилось хорошо, русский голос звучит нормально, губы большую часть речи попадают в слова. Но в конце ролика рот продолжал двигаться, когда речь уже закончилась.
Это отчёт об одном запуске 8 октября 2026 года, а не рейтинг AI-аватаров. Мы не сравнивали Arckép с другими сервисами в этой задаче и не берёмся утверждать, что где-то лучше или хуже.
Короткий ответ
Да, говорящее фото из одного портрета сделать можно. В нашем запуске Arckép с инструментом AI Аватар получилось видео на 12 секунд: человек говорит русским голосом, лицо остаётся узнаваемым, а большая часть речи визуально совпадает с движением губ.
Мы загрузили синтетический портрет, написали текст на 120 символов, выбрали голос и запустили генерацию без фоновой музыки. Рядом с текстом интерфейс оценивал речь примерно в 6 секунд, готовый ролик получился 12 секунд, а запуск стоил 81 ₽.
Главный минус — в конце: после окончания речи рот продолжал двигаться ещё примерно 2–3 секунды. Для публикации такой ролик пришлось бы подрезать в конце.
Термины
Что значит «говорящее фото»
«Оживить фото» и «сделать говорящее фото» — разные задачи, хотя инструменты могут выглядеть похоже.
Обычное оживление фотографии — это image-to-video: человек на снимке начинает двигаться, поворачивать голову, моргать, камера может приближаться. Звука в такой задаче нет вообще.
Говорящее фото — это движение плюс речь: сервис озвучивает текст выбранным голосом и подстраивает артикуляцию под звук. Здесь главным критерием качества становится синхронизация губ: лицо может сохраниться идеально, но если рот живёт отдельно от слов, ролик выглядит сломанным.
Поэтому мы развели эти два теста. Движение и сохранение лица при оживлении фотографии проверяли отдельно — в материале «Как оживить фото нейросетью». Здесь речь только про голос, артикуляцию и совпадение губ со словами.
Условия
Как проводили тест
Tested. Дата запуска — 8 октября 2026 года. Сервис — Arckép, инструмент в интерфейсе называется AI Аватар. Режим ввода — «Написать текст»: загруженное аудио мы не использовали, текст озвучивал сам сервис.
Tested. Текст для озвучки: «Сегодня проверяю, насколько естественно нейросеть оживляет фотографию и синхронизирует движение губ с русской речью.» Это 120 символов — столько показал интерфейс рядом с полем ввода.
Checked. Рядом с текстом интерфейс оценивал речь примерно в 6 секунд. Это оценка длительности речи, а не обещание длины готового ролика: итоговое видео получилось 12 секунд.
Checked. Голос — Casual. Фоновую музыку не использовали, промпт анимации не заполняли: в интерфейсе это необязательное поле, и в нашем запуске оно осталось пустым.
Tested. Для теста использовали синтетический портрет, созданный специально для этой проверки. Это не фотография реального человека.





Как читать эту статью. Tested — то, что мы реально запускали и увидели в результате. Checked — то, что видно в интерфейсе Arckép на наших скриншотах. Documented — официальные данные сервиса; в этом тесте мы к ним не обращались, потому что описываем только собственный запуск.
Инструкция
Как сделать говорящее фото в Arckép
Порядок действий в нашем запуске выглядел так. Мы не придумываем названия кнопок: ниже — то, что было на экранах во время теста.
- Открыть инструмент AI Аватар.
- Загрузить фото лица — у нас это был синтетический портрет.
- Выбрать режим «Написать текст».
- Вставить текст, который должен произнести аватар.
- Выбрать голос в разделе «Настройки речи».
- При необходимости настроить фоновую музыку и промпт анимации — мы оставили их без изменений.
- Запустить генерацию.
- Дождаться готового MP4 и скачать его.
В подсказках сервиса на том же экране указано, что фото должно быть в хорошем качестве, лицо хорошо видно, а анфас работает лучше всего. В нашем портрете выполнялись все три условия: лицо анфас, крупно, при нейтральном свете и на простом фоне.
Отдельно отметим шаг с промптом анимации. В отличие от обычного оживления фотографии, здесь ничего описывать не нужно: речь задаётся текстом, а не промптом. Промпт анимации — дополнительная настройка, и в нашем запуске мы её не использовали.
Результат
Что получилось
Готовый ролик — MP4 на 12 секунд. Лицо сохранилось хорошо, человек остался узнаваемым, мимика выглядит достаточно естественно. Добавились движения головы и рук, поэтому видео не выглядит статичной картинкой с озвучкой.
Русский голос воспроизводится нормально: речь разборчивая, интонация ровная. Главное, что получилось по сути задачи, — это полноценное говорящее видео из одного портрета и текста, без загрузки аудио и без промпта анимации.
Ниже — сам файл. Звук в ролике не отключён: голос и есть главная часть теста. Если встроенный плеер не работает, ссылка на MP4 есть внутри блока.


Качество
Насколько хорошо совпадают губы и речь
Tested. В целом синхронизация рабочая. Большую часть речи губы двигались в такт словам, и ролик не выглядит как неподвижное фото с наложенным звуком. Это главное, что мы проверяли, и базовая задача выполнена.
Где синхронизация работала
На большинстве фраз артикуляция попадала в речь достаточно точно, чтобы не отвлекать зрителя. Отдельно отметим лицо: оно не «поплыло» при движении губ, мимика осталась естественной, а человек — узнаваемым.
Главный дефект: рот двигался после окончания речи
Основная проблема появилась в конце ролика. Речь уже закончилась, но рот продолжал двигаться ещё примерно 2–3 секунды. На этом отрезке видео выглядит странно: человек молчит, а артикуляция продолжается.
Местами губы двигались немного не точно под конкретные слова — это тоже было заметно. Но если небольшие расхождения скорее мелочь, то движение рта в тишине уже портит впечатление от конца ролика.
Ограничение
Из-за этого дефекта ролик в исходном виде мы не назвали бы готовым к публикации. Практический вывод простой: перед публикацией видео стоит подрезать в конце примерно на 2–3 секунды.
Checked. Это видно и по самому файлу: аудиодорожка в MP4 заканчивается раньше видеодорожки — 10,5 секунды против 12,3 секунды. То есть последние примерно 1,8 секунды ролика идут без звука.
Идеальной синхронизацию мы не называем. В нашем тесте она хорошая, но не безупречная: для простого ролика этого достаточно, для задачи с очень точной артикуляцией — вопрос открытый.
Стоимость
Сколько стоит говорящее фото
Фактическая стоимость нашего запуска — 81 ₽. Это не «примерно»: сумма подтверждена экраном результата и историей генераций Arckép.
81 ₽ — стоимость нашего конкретного запуска 8 октября 2026 года. Тарифы и стоимость AI-аватара могут измениться.
Что было в нашем запуске:
- Текст: 120 символов.
- Оценка речи в интерфейсе: ~6 сек.
- Итоговое видео: 12 сек.
- Генерация: около 6 минут по времени между нашими скриншотами.
Checked. Перед запуском интерфейс показывал предварительную оценку ~39 ₽ и ~6 сек видео. Фактически запуск стоил 81 ₽, а ролик получился 12 секунд. Почему оценка и факт разошлись, сервис не объясняет, и мы не берёмся это утверждать. Ценой нашего запуска считаем 81 ₽ — она подтверждена экраном результата и историей генераций.
Checked. По нашим скриншотам между запуском и появлением результата прошло около шести минут. Это время по нашим скриншотам, а не серверная метрика сервиса: на снимке экрана с запуском видно 14:24, на экране результата — 14:30.
| Параметр | Наш тест |
|---|---|
| Сервис | Arckép |
| Инструмент | AI Аватар |
| Исходник | синтетический портрет |
| Язык | русский |
| Текст | 120 символов |
| Оценка речи | ~6 сек |
| Итоговое видео | 12 сек |
| Стоимость | 81 ₽ |
| Время генерации | около 6 минут |
| Lip-sync | хороший, но не идеальный |
Это стоимость одного нашего запуска, а не тариф Arckép. Цена AI-аватара зависит от параметров генерации и может измениться, поэтому перед запуском стоит смотреть актуальную сумму в интерфейсе.
Плюсы
Что понравилось
- лицо сохранилось хорошо, человек остался узнаваемым;
- мимика выглядит достаточно естественно;
- добавились движения головы и рук, ролик не статичный;
- русский голос воспроизводится нормально;
- сценарий «фото → текст → видео» оказался простым: без промпта анимации и без загрузки аудио.
Минусы
Что не понравилось
- местами губы двигались немного не точно под конкретные слова;
- после окончания речи рот продолжал двигаться ещё примерно 2–3 секунды;
- итоговая длина видео оказалась заметно больше оценки возле текста: ~6 сек против 12 сек;
- для готовой публикации ролик желательно подрезать в конце.
Бесплатный запуск
Можно ли сделать говорящее фото бесплатно
Полностью бесплатный запуск в этом тесте мы не проверяли. Наша генерация стоила 81 ₽.
Поэтому мы не пишем, что говорящее фото можно сделать бесплатно, и не называем AI Аватар бесплатным инструментом: запуска, который это подтверждает, у нас нет. Если у сервиса есть стартовый бонус или пробный режим, его условия нужно проверять на официальном сайте на момент регистрации — в рамках этого теста мы их не проверяли.
Отдельно уточним, что бесплатность и качество — разные вопросы. Даже если пробный запуск доступен, он не отменяет ограничений, которые мы описали выше: движения рта после окончания речи и небольших расхождений артикуляции со словами.
Сценарии
Кому подойдёт такой формат
Говорящее фото из одного портрета подойдёт там, где не нужна длинная речь и идеальная артикуляция:
- аватар для соцсетей;
- короткое обращение к аудитории;
- презентация или обучающий ролик;
- персонаж или говорящий герой из изображения.
Для задач, где требуется очень точная артикуляция — например, длинная лекция или дубляж, — одного нашего теста недостаточно, чтобы рекомендовать инструмент без оговорок.
Вывод
Итог
В нашем тесте AI Аватар в Arckép сделал убедительное говорящее видео из одного синтетического портрета и русского текста. Лицо сохранилось хорошо, голос звучит нормально, синхронизация губ достаточная для простого ролика.
Без дефектов не обошлось. Главный минус — рот продолжал двигаться примерно 2–3 секунды после окончания речи, а местами губы попадали в слова неточно. Для ролика, где требуется очень точная артикуляция, одного теста недостаточно, чтобы рекомендовать инструмент без оговорок.
Итог по деньгам: 81 ₽ за 12-секундный ролик в нашем запуске 8 октября 2026 года.
О партнёрских ссылках: ссылка на Arckép в этой статье партнёрская. «Нейропроба» может получить комиссию после перехода, но это не меняет стоимость для пользователя и не влияет на выводы теста. Подробнее — в разделе о партнёрских ссылках.
Нужен подбор AI-инструментов под вашу задачу?
Если не хотите самостоятельно сравнивать сервисы, голоса и настройки, я могу подобрать конкретный набор инструментов под задачу и бюджет.
FAQ
Частые вопросы
Нужно загрузить портрет в инструмент, который озвучивает фото, написать текст, выбрать голос и запустить генерацию. В нашем тесте в Arckép мы использовали инструмент AI Аватар, режим «Написать текст» и русский текст на 120 символов. После генерации сервис отдал готовый MP4 на 12 секунд.
Да. В нашем запуске 8 октября 2026 года из одного синтетического портрета и русского текста получилось видео на 12 секунд, где человек говорит. Отдельное аудио мы не загружали: текст озвучил сам сервис.
Наш запуск в Arckép стоил 81 ₽. Это стоимость нашего конкретного запуска 8 октября 2026 года. Тарифы и стоимость AI-аватара могут измениться.
В нашем тесте синхронизация в целом хорошая, но не идеальная. Большая часть речи визуально совпадала с движением губ, а местами губы двигались немного не точно под конкретные слова. После окончания речи рот продолжал двигаться ещё примерно 2–3 секунды.
Полностью бесплатный запуск в этом тесте мы не проверяли. Наша генерация стоила 81 ₽.
По нашим скриншотам между запуском и появлением результата прошло около шести минут. Это время по нашим скриншотам, а не серверная метрика сервиса: на экране с запуском видно 14:24, на экране результата — 14:30.
Arckép, инструмент AI Аватар, режим «Написать текст». В истории Arckép этот запуск помечен как kling-avatar-standard. На самой странице инструмент называется AI Аватар. Мы не идентифицируем его как отдельный официальный продукт Kling Lip Sync без подтверждения разработчика.
Тест проведён 8 октября 2026 года. Интерфейсы, цены и условия сервисов могут измениться.