OmniHuman 1.5 - модель компании ByteDance, которая оживляет человека на одном фото по записи голоса. У нас это качество «Максимум» для говорящих открыток: вслед за словами двигаются не только губы, но и лицо, голова, плечи, а на групповом фото Вы просто нажимаете на того, кто будет говорить.
Обновлено 29.09.2026
С Днём Рождения! Жаль, что не могу обнять тебя сегодня, но вот моё поздравление.
Happy birthday! I wish I could hug you today - this is the next best thing.
Kling AI Avatar v2 дешевле за секунду и хороша для спокойного крупного плана. OmniHuman 1.5 - для кадра пошире, где двигается и тело, и для группового фото, где Вы сами выбираете, кто говорит.
| Модель | Сильная сторона | Длина | Качество | Цена |
|---|---|---|---|---|
| OmniHuman 1.5ByteDance | Оживает весь человек | до 15 с речи | 720p | 200 кр. за секунду речи + голос |
| Kling AI Avatar v2Kuaishou | Лицо и голова двигаются в такт словам | до 15 с речи | 71 кр. за секунду речи + голос |
Цены в кредитах, и цена всегда видна на кнопке до нажатия. Тарифы
Добавьте фото близкого человека - JPG, PNG или WebP до 10 МБ - с устройства, из «Моей библиотеки» или из раздела «Люди» и расскажите агенту, для кого открытка и что за день. Он сделает открытку, на которой этот человек в кадре. Подойдёт и готовая сцена, например «Свечи для мамы».
Когда открытка готова, нажмите под ней «Пусть заговорят». Агент набросает короткую фразу, которую произнесут вслух, - правьте её, пока она не зазвучит так, как сказал бы сам человек. Выберите голос и переключите качество на «Максимум» - это и есть OmniHuman 1.5. По умолчанию стоит Kling AI Avatar v2.
В качестве «Максимум» нажмите на лицо того, кто должен говорить, или доверьте выбор нам. Цена - на кнопке: нажмите, и говорящая открытка появится в чате. Отправьте её по email, SMS или в популярном мессенджере - сразу или в тот день, который Вы выберете.
Обе модели говорящих открыток у нас берут одну и ту же открытку и одну и ту же записанную фразу, и обе останавливаются на 15 секундах речи. Разница в том, какая часть человека приходит в движение. Kling AI Avatar v2, которая стоит по умолчанию, оживляет лицо и голову, а всё остальное на фото оставляет как было. Бабушка выше сделана именно на ней: семь секунд из одного портрета и голоса Ava, и больше ничему в кадре двигаться не требовалось.
OmniHuman 1.5 из этих двух живее. Она видит на фото целого человека, поэтому снимок по пояс, поднятый бокал или широкий семейный кадр дают ей работу помимо губ. Секунда речи здесь стоит дороже, так что включать её есть смысл там, где это лишнее движение действительно будет заметно.
Рабочее правило такое. Крупный план и тихое, нежное пожелание - Kling AI Avatar v2. Кадр пошире, тост, групповая открытка или фраза, в которой важна энергия, - OmniHuman 1.5.
Начните с чёткого лица. Рот должен быть виден - без руки, чашки или микрофона перед ним, - человек смотрит примерно в камеру, свет ровный. Для OmniHuman кадр с плечами и шире лучше тесной обрезки, как на паспорт: модель создана, чтобы двигать человека целиком, так дайте ей целого человека.
На групповой открытке лицам нужен приличный размер. На одну открытку помещаются шесть человек, но сходство лучше всего держится, когда их четыре или меньше, а крошечное лицо в дальнем конце стола трудно выбрать, и модели почти нечем двигать. Если важно, кто говорит, посадите его поближе, когда описываете открытку.
И наконец, слова. В 15 секунд речи помещается короткий тост, а не абзац. Называйте человека так, как его зовут дома, - Бабуля, Деда, Саба - и добавьте одну деталь, которую знает только он: медаль за плавание, яблочный пирог, собаку, которая съела торт. Прочитайте фразу вслух один раз, прежде чем нажать кнопку. Если Вы на ней спотыкаетесь, в его устах она тоже прозвучит натянуто.
OmniHuman 1.5 не читает Ваш текст сам. Сначала голос записывает фразу, потом модель двигает человека под этот звук. Голос - один из 8 голосов каталога ElevenLabs Eleven v3, и у каждого есть образец, который можно послушать до выбора. На тарифах Plus, Family и Pro есть и Ваш собственный голос: его делает MiniMax Speech по одной короткой записи прямо в браузере. Раз губы следуют за записью, фото говорит на том языке, на котором написана фраза: по-русски, на иврите или по-арабски.
Собственный голос открывает ещё один сценарий. Вы за границей, а у сестры День Рождения: поставьте на открытку своё фото, один раз запишите голос, и открытка поздравит её Вашим голосом, прямо с утра.
Слова всё время остаются в Ваших руках. Агент набрасывает фразу, которую произнесут вслух, любое слово в ней можно поменять, и Вы видите, сколько примерно секунд она займёт, прежде чем на кнопке появится цена. Если открытка не получилась, кредиты вернутся, а полный текст поздравления всё равно уйдёт под видео.
Говорящая открытка - это один человек, одна фраза, прямо в камеру. Если нужно, чтобы двигалась вся сцена - мама задувает свечи, звенят бокалы, весь стол аплодирует, - лучше оживить открытку как видео. MiniMax H3, которую «Авто» выбирает для видео, оживляет каждую видеосцену каталога, а Veo 3.1 умеет создавать голоса, пение и фоновые звуки в той же генерации.
Если голос важнее лица, голосовое поздравление, которое читает ElevenLabs Eleven v3, уйдёт просто звуком. А если хотите, чтобы к десерту подпевали все, песня на Google Lyria 3.5 споёт Ваши собственные слова на Вашем языке.
И пара слов о такте. Говорящая открытка лучше всего работает со словами, которые человек на фото с радостью сказал бы сам. Позвоните бабушке, спросите, что она хочет сказать, запишите это её словами - и пусть это скажет её фото. Вложите в чужие уста то, чего человек никогда бы не произнёс, и семья заметит это раньше, чем погаснут свечи.
Говорящая открытка из фото дяди Миши на День Рождения моей двоюродной сестры Ани, ей исполняется 30: он по пояс в саду, в своём парадном пиджаке, с поднятым бокалом. По-русски он говорит ей, что произносит этот тост с тех пор, как ей исполнился годик, и будет произносить дальше.
Мама, папа, мой брат и я за длинным столом в саду - открытка на рубиновую свадьбу родителей, 40 лет вместе. Потом пусть заговорит папа: он поднимает бокал и благодарит маму за сорок лет воскресных блинчиков.
На десятый День Рождения моего сына Адама: говорящая открытка с его дедушкой на футбольной трибуне, в клубном шарфе, руки вверх. На иврите дедушка обещает, что придёт на субботний матч с самым громким барабаном на стадионе.
Говорящая открытка - это фото близкого человека, который вслух произносит Ваше поздравление: до 15 секунд речи, губы двигаются в такт…
ПодробнееKlingKling - семейство нейросетей от Kuaishou, и у нас работают три из них: Kling 3.0 Pro для видео, Kling O3…
ПодробнееElevenLabsEleven v3 - нейросеть ElevenLabs, которая превращает текст в живую речь. У нас она читает Ваше поздравление одним из 8…
ПодробнееOmniHuman 1.5 - нейросеть компании ByteDance, которая превращает одно фото и запись голоса в видео, где этот человек говорит, а лицо, голова и тело двигаются в такт звуку. В Wish Generator это качество «Максимум» для говорящей открытки: Вы делаете открытку с фото, правите фразу, выбираете голос, и OmniHuman заставляет человека на ней произнести Ваше поздравление.
OmniHuman 1.5 двигает человека целиком, а Kling AI Avatar v2 - только лицо и голову. Обе модели берут одну и ту же открытку и одну и ту же записанную фразу, и обе ограничены 15 секундами речи. Секунда OmniHuman стоит дороже, зато только он позволяет нажать на того, кто говорит на групповом фото. Для спокойного крупного плана обычно хватает Kling AI Avatar v2, а для тоста, широкого кадра или семейного стола выбирайте «Максимум».
До 15 секунд речи - тот же предел, что у Kling AI Avatar v2, примерно столько длится короткий тост. Панель оценивает секунды прямо по ходу набора и не запустит фразу, которая не помещается, поэтому за слишком длинный текст Вы никогда не заплатите.
Да, с OmniHuman 1.5. Переключите качество на «Максимум» и нажмите на лицо того, кто должен говорить: это лицо отмечается для модели, и фразу произносит именно этот человек. Если ничего не нажимать, модель выберет говорящего сама. Для групповых открыток берите именно её.
Да. OmniHuman сама слов не читает: она двигает губами под запись, а запись делается на том языке, на котором Вы написали фразу. Выберите один из 8 голосов каталога ElevenLabs Eleven v3 или, на платном тарифе, свой собственный голос. Фразы на иврите и арабском делайте чуть короче: в 15 секунд их помещается меньше букв.
Да. Добавьте фото близких с устройства, из «Моей библиотеки» или из раздела «Люди» - JPG, PNG или WebP до 10 МБ. Сначала агент сделает открытку, где они в кадре, потом Вы нажмёте «Пусть заговорят». На открытке помещается до 6 человек, а лица надёжнее всего получаются, когда их 4 или меньше.
Сделайте открытку, нажмите «Пусть заговорят», переключите на «Максимум» и отправьте её в нужный день.
Сделать говорящую открытку