بطاقات ناطقة

اجعلوا الصورة تنطق تهنئتكم مع OmniHuman 1.5

OmniHuman 1.5 نموذج من ByteDance يبعث الحياة في شخص من صورة واحدة انطلاقًا من تسجيل صوتي. وهو هنا جودة «الأعلى» في بطاقاتنا الناطقة: مع الكلمات لا تتحرك الشفاه وحدها، بل الوجه والرأس والكتفان أيضًا، وفي الصورة الجماعية يكفي أن تنقروا على من سيتكلم.

  • من تطوير ByteDance
  • 71-200 رصيد لكل ثانية كلام
  • حتى 15 ثانية من الكلام

آخر تحديث 29.09.2026

جدة وجد ومحرّكان مختلفان

الجد يتحدث بالروسيةOmniHuman 1.5 · 1 photo · voice Ari · Russian
الوصف

С Днём Рождения! Жаль, что не могу обнять тебя сегодня, но вот моё поздравление.

الجدة تهنئ بنفسهاKling AI Avatar v2 · 1 photo · voice Ava
الوصف

Happy birthday! I wish I could hug you today - this is the next best thing.

OmniHuman 1.5 إلى جانب Kling AI Avatar v2 الأرخص

Kling AI Avatar v2 أرخص في الثانية ويناسب لقطة قريبة هادئة. أما OmniHuman 1.5 فللّقطة الأوسع التي يتحرك فيها الجسد أيضًا، وللصورة الجماعية التي تختارون فيها المتكلم.

النموذجنقطة القوةالمدةالدقةالسعر
OmniHuman 1.5ByteDanceالشخص كله ينبض بالحياةحتى 15 ثانية من الكلام720p200 رصيد لكل ثانية كلام + الصوت
Kling AI Avatar v2Kuaishouالوجه والرأس يتحركان مع الكلماتحتى 15 ثانية من الكلام71 رصيد لكل ثانية كلام + الصوت

الأسعار بالرصيد، ويظهر السعر دائمًا على الزر قبل الضغط. الأسعار

تحويل البطاقة إلى «الأعلى» خطوة بخطوة

  1. 1

    اصنعوا بطاقة بصورة

    أضيفوا صورة الشخص - JPG أو PNG أو WebP حتى 10 ميغابايت - من جهازكم أو من «مكتبتي» أو من «الأشخاص»، وأخبروا الوكيل لمن البطاقة وبماذا تحتفلون. سيصنع بطاقة يظهر فيها هذا الشخص. ويمكن البدء أيضًا من مشهد جاهز مثل «شموع لماما».

  2. 2

    اضغطوا «جعلهم يتكلمون»

    عندما تجهز البطاقة، اضغطوا تحتها على «جعلهم يتكلمون». يكتب الوكيل جملة قصيرة تُقال بصوت مسموع، فعدّلوها حتى تشبه كلام الشخص نفسه. اختاروا الصوت، ثم حوّلوا الجودة إلى «الأعلى» - وهذا هو OmniHuman 1.5. أما الخيار الافتراضي فهو Kling AI Avatar v2.

  3. 3

    انقروا على من يتكلم، ثم أرسلوا

    مع تفعيل «الأعلى»، انقروا على وجه الشخص الذي سيتكلم، أو اتركوا الاختيار لنا. السعر مكتوب على الزر: اضغطوه وستصل البطاقة الناطقة إلى المحادثة. أرسلوها بالبريد الإلكتروني أو برسالة SMS أو عبر تطبيقات المراسلة، الآن أو في اليوم الذي تختارونه.

أنشئوا بطاقة ناطقة

الوجه والرأس، أم الشخص كله

يأخذ نموذجا البطاقة الناطقة هنا البطاقة نفسها والجملة المسجلة نفسها، ويتوقف كلاهما عند 15 ثانية من الكلام. الفرق في مقدار ما يتحرك من الشخص. يحرّك Kling AI Avatar v2، وهو الخيار الافتراضي، الوجه والرأس ويترك بقية الصورة كما هي. الجدة التي ترونها أعلاه صُنعت به: سبع ثوانٍ من صورة شخصية واحدة وصوت Ava، ولم يكن شيء آخر في الإطار بحاجة إلى الحركة.

أما OmniHuman 1.5 فهو الأكثر حيوية بين الاثنين. يتعامل مع الصورة على أنها شخص كامل، لذا فإن لقطة حتى الخصر أو كوبًا مرفوعًا أو إطارًا عائليًا واسعًا تمنحه ما يحرّكه غير الفم. ثانية الكلام فيه أغلى، فالأجدى أن تستخدموه حيث ستظهر هذه الحركة الإضافية فعلًا.

القاعدة العملية بسيطة: لقطة قريبة ورسالة هادئة رقيقة - Kling AI Avatar v2. لقطة أوسع، أو كلمة على المائدة، أو بطاقة جماعية، أو جملة تهم فيها الحماسة - OmniHuman 1.5.

صورة فيها ما يمكن تحريكه

ابدؤوا بوجه واضح. يجب أن يظهر الفم - بلا يد أو كوب أو ميكروفون أمامه - وأن ينظر الشخص نحو الكاميرا تقريبًا في إضاءة متساوية. ومع OmniHuman، الإطار الذي يُظهر الكتفين أو أكثر أفضل من قص ضيق كصورة جواز السفر: فهو مصمم ليحرّك شخصًا كاملًا، فامنحوه شخصًا كاملًا.

تحتاج البطاقات الجماعية إلى وجوه بحجم معقول. تتسع البطاقة الواحدة لستة أشخاص، لكن الشبه يثبت أفضل مع أربعة أو أقل، والوجه الصغير جدًا في آخر المائدة يصعب النقر عليه ولا يترك للنموذج الكثير ليحرّكه. وإن كان المتكلم مهمًا، فضعوه في المقدمة حين تصفون البطاقة.

وأخيرًا، الكلمات. خمس عشرة ثانية من الكلام تكفي لكلمة قصيرة، لا لفقرة كاملة. نادوا الشخص بالاسم الذي يُنادى به في البيت فعلًا - تيتا، جدو، ستّي - وأضيفوا تفصيلًا واحدًا لا يعرفه سواه: ميدالية السباحة، فطيرة التفاح، الكلب الذي أكل الكعكة. اقرؤوا الجملة بصوت مسموع مرة واحدة قبل أن تضغطوا. إن تعثرتم فيها، فستبدو متكلفة على لسانه أيضًا.

صوت من يخرج من الصورة

لا يقرأ OmniHuman 1.5 كلماتكم بنفسه. أولًا يسجّل صوتٌ الجملة، ثم يحرّك النموذج الشخص على هذا الصوت. والصوت واحد من 8 أصوات في كتالوج ElevenLabs Eleven v3، لكل منها عيّنة تسمعونها قبل الاختيار. وفي باقات Plus وFamily وPro يتوفر صوتكم أنتم أيضًا، ويصنعه MiniMax Speech من قراءة قصيرة واحدة في المتصفح. ولأن الشفاه تتبع التسجيل، تتكلم الصورة باللغة التي كُتبت بها الجملة: العربية أو العبرية أو الروسية.

وصوتكم الخاص يفتح بابًا آخر. أنتم خارج البلاد في عيد ميلاد أختكم: ضعوا صورتكم على البطاقة، وسجّلوا صوتكم مرة واحدة، فتقول لها البطاقة التهنئة بصوتكم منذ الصباح.

وتبقى الكلمات بين أيديكم طوال الطريق. يصوغ الوكيل الجملة التي ستُقال بصوت مسموع، ويمكن تغيير كل كلمة فيها، وترون كم ثانية ستستغرق تقريبًا قبل أن يظهر السعر على الزر. وإذا فشلت البطاقة يعود الرصيد إليكم، وتبقى التهنئة المكتوبة كاملة تحت الفيديو.

لحظات لا تحملها البطاقة الناطقة

البطاقة الناطقة شخص واحد وجملة واحدة مباشرة إلى الكاميرا. إن أردتم أن يتحرك المشهد كله - الأم تطفئ الشموع، والكؤوس تتلاقى، والمائدة كلها تهتف - فحوّلوا البطاقة إلى فيديو بدلًا من ذلك. MiniMax H3، الذي يختاره «تلقائي» للفيديو، يحرّك كل مشاهد الفيديو في الكتالوج، ويستطيع Veo 3.1 أن يصنع الأصوات والغناء وأصوات الخلفية في الإنشاء نفسه.

وإن كان الصوت أهم من الوجه، فالتهنئة الصوتية التي يقرؤها ElevenLabs Eleven v3 تصل صوتًا فقط. وإن أردتم أن يدندن الجميع قبل الحلوى، فأغنية مصنوعة بـ Google Lyria 3.5 تحمل كلماتكم أنتم بلغتكم.

وكلمة عن الذوق. تنجح البطاقة الناطقة أكثر حين تحمل كلمات يسعد صاحب الصورة بقولها. اتصلوا بالجدة واسألوها ماذا تريد أن تقول، واكتبوه بطريقتها، ودعوا صورتها تقوله. أما إن وضعتم على لسان أحدهم كلمات لا يستخدمها أبدًا، فستلاحظ العائلة ذلك قبل أن تنطفئ الشموع.

طلبات فيها كوب مرفوع ووشاح كرة قدم

أريد بطاقة ناطقة من صورة العم سمير لعيد ميلاد ابنة عمي ليلى الثلاثين: يظهر حتى الخصر في الحديقة، بسترته الأنيقة، رافعًا كوب العصير. وبالعربية يقول لها إنه يلقي هذه الكلمة منذ أن أتمت عامها الأول، وسيظل يلقيها كل عام.
لقطة حتى الخصر مع كوب مرفوع تمنح OmniHuman ما يحرّكه أكثر من الفم. حوّلوا الجودة إلى «الأعلى»، وتأكدوا أن الجملة مكتوبة بالعربية: الصوت يقرأ باللغة التي كُتبت بها.
استخدم هذا الوصف
اجمعنا حول المائدة الطويلة في الحديقة، ماما وبابا وأخي وأنا، في الذكرى الأربعين لزواج والديّ، ثم اجعل بابا يتكلم: يرفع كوب الشاي ويشكر ماما على أربعين عامًا من فطائر صباح الجمعة.
أربعة وجوه هي أقصى ما تحافظ البطاقة على ملامحه بثبات. اختاروا «الأعلى» وانقروا على الأب، لتأتي الكلمة منه لا ممن كان النموذج سيختاره.
استخدم هذا الوصف
لعيد ميلاد ابني آدم العاشر: بطاقة ناطقة لجده في مدرجات الملعب، بوشاح فريقه وذراعاه مرفوعتان. يقول له جده إنه سيحضر مباراة السبت ومعه أعلى طبلة صوتًا في الملعب كله.
الذراعان المرفوعتان والوشاح تمنح OmniHuman شخصًا كاملًا يحرّكه، لا وجهًا فقط. اجعلوا الجملة قصيرة: تتسع 15 ثانية لحروف عربية أقل من الإنجليزية، والعداد يُظهر ما تبقى.
استخدم هذا الوصف

اقرأ أيضًا

OmniHuman 1.5: أسئلة وأجوبة

OmniHuman 1.5 نموذج ذكاء اصطناعي من ByteDance يحوّل صورة واحدة وتسجيلًا صوتيًا إلى فيديو يتكلم فيه ذلك الشخص، ويتحرك وجهه ورأسه وجسده مع الصوت. في Wish Generator هو جودة «الأعلى» للبطاقة الناطقة: تصنعون بطاقة بصورة، وتعدّلون الجملة، وتختارون صوتًا، فيجعل OmniHuman الشخص الذي فيها ينطق تهنئتكم.

دعوا الصورة كلها ترفع الكوب

اصنعوا البطاقة، واضغطوا «جعلهم يتكلمون»، وحوّلوا الجودة إلى «الأعلى»، ثم أرسلوها في يومها.

أنشئوا بطاقة ناطقة

تهانٍ لكل لحظة