OmniHuman 1.5 نموذج من ByteDance يبعث الحياة في شخص من صورة واحدة انطلاقًا من تسجيل صوتي. وهو هنا جودة «الأعلى» في بطاقاتنا الناطقة: مع الكلمات لا تتحرك الشفاه وحدها، بل الوجه والرأس والكتفان أيضًا، وفي الصورة الجماعية يكفي أن تنقروا على من سيتكلم.
آخر تحديث 29.09.2026
С Днём Рождения! Жаль, что не могу обнять тебя сегодня, но вот моё поздравление.
Happy birthday! I wish I could hug you today - this is the next best thing.
Kling AI Avatar v2 أرخص في الثانية ويناسب لقطة قريبة هادئة. أما OmniHuman 1.5 فللّقطة الأوسع التي يتحرك فيها الجسد أيضًا، وللصورة الجماعية التي تختارون فيها المتكلم.
| النموذج | نقطة القوة | المدة | الدقة | السعر |
|---|---|---|---|---|
| OmniHuman 1.5ByteDance | الشخص كله ينبض بالحياة | حتى 15 ثانية من الكلام | 720p | 200 رصيد لكل ثانية كلام + الصوت |
| Kling AI Avatar v2Kuaishou | الوجه والرأس يتحركان مع الكلمات | حتى 15 ثانية من الكلام | 71 رصيد لكل ثانية كلام + الصوت |
الأسعار بالرصيد، ويظهر السعر دائمًا على الزر قبل الضغط. الأسعار
أضيفوا صورة الشخص - JPG أو PNG أو WebP حتى 10 ميغابايت - من جهازكم أو من «مكتبتي» أو من «الأشخاص»، وأخبروا الوكيل لمن البطاقة وبماذا تحتفلون. سيصنع بطاقة يظهر فيها هذا الشخص. ويمكن البدء أيضًا من مشهد جاهز مثل «شموع لماما».
عندما تجهز البطاقة، اضغطوا تحتها على «جعلهم يتكلمون». يكتب الوكيل جملة قصيرة تُقال بصوت مسموع، فعدّلوها حتى تشبه كلام الشخص نفسه. اختاروا الصوت، ثم حوّلوا الجودة إلى «الأعلى» - وهذا هو OmniHuman 1.5. أما الخيار الافتراضي فهو Kling AI Avatar v2.
مع تفعيل «الأعلى»، انقروا على وجه الشخص الذي سيتكلم، أو اتركوا الاختيار لنا. السعر مكتوب على الزر: اضغطوه وستصل البطاقة الناطقة إلى المحادثة. أرسلوها بالبريد الإلكتروني أو برسالة SMS أو عبر تطبيقات المراسلة، الآن أو في اليوم الذي تختارونه.
يأخذ نموذجا البطاقة الناطقة هنا البطاقة نفسها والجملة المسجلة نفسها، ويتوقف كلاهما عند 15 ثانية من الكلام. الفرق في مقدار ما يتحرك من الشخص. يحرّك Kling AI Avatar v2، وهو الخيار الافتراضي، الوجه والرأس ويترك بقية الصورة كما هي. الجدة التي ترونها أعلاه صُنعت به: سبع ثوانٍ من صورة شخصية واحدة وصوت Ava، ولم يكن شيء آخر في الإطار بحاجة إلى الحركة.
أما OmniHuman 1.5 فهو الأكثر حيوية بين الاثنين. يتعامل مع الصورة على أنها شخص كامل، لذا فإن لقطة حتى الخصر أو كوبًا مرفوعًا أو إطارًا عائليًا واسعًا تمنحه ما يحرّكه غير الفم. ثانية الكلام فيه أغلى، فالأجدى أن تستخدموه حيث ستظهر هذه الحركة الإضافية فعلًا.
القاعدة العملية بسيطة: لقطة قريبة ورسالة هادئة رقيقة - Kling AI Avatar v2. لقطة أوسع، أو كلمة على المائدة، أو بطاقة جماعية، أو جملة تهم فيها الحماسة - OmniHuman 1.5.
ابدؤوا بوجه واضح. يجب أن يظهر الفم - بلا يد أو كوب أو ميكروفون أمامه - وأن ينظر الشخص نحو الكاميرا تقريبًا في إضاءة متساوية. ومع OmniHuman، الإطار الذي يُظهر الكتفين أو أكثر أفضل من قص ضيق كصورة جواز السفر: فهو مصمم ليحرّك شخصًا كاملًا، فامنحوه شخصًا كاملًا.
تحتاج البطاقات الجماعية إلى وجوه بحجم معقول. تتسع البطاقة الواحدة لستة أشخاص، لكن الشبه يثبت أفضل مع أربعة أو أقل، والوجه الصغير جدًا في آخر المائدة يصعب النقر عليه ولا يترك للنموذج الكثير ليحرّكه. وإن كان المتكلم مهمًا، فضعوه في المقدمة حين تصفون البطاقة.
وأخيرًا، الكلمات. خمس عشرة ثانية من الكلام تكفي لكلمة قصيرة، لا لفقرة كاملة. نادوا الشخص بالاسم الذي يُنادى به في البيت فعلًا - تيتا، جدو، ستّي - وأضيفوا تفصيلًا واحدًا لا يعرفه سواه: ميدالية السباحة، فطيرة التفاح، الكلب الذي أكل الكعكة. اقرؤوا الجملة بصوت مسموع مرة واحدة قبل أن تضغطوا. إن تعثرتم فيها، فستبدو متكلفة على لسانه أيضًا.
لا يقرأ OmniHuman 1.5 كلماتكم بنفسه. أولًا يسجّل صوتٌ الجملة، ثم يحرّك النموذج الشخص على هذا الصوت. والصوت واحد من 8 أصوات في كتالوج ElevenLabs Eleven v3، لكل منها عيّنة تسمعونها قبل الاختيار. وفي باقات Plus وFamily وPro يتوفر صوتكم أنتم أيضًا، ويصنعه MiniMax Speech من قراءة قصيرة واحدة في المتصفح. ولأن الشفاه تتبع التسجيل، تتكلم الصورة باللغة التي كُتبت بها الجملة: العربية أو العبرية أو الروسية.
وصوتكم الخاص يفتح بابًا آخر. أنتم خارج البلاد في عيد ميلاد أختكم: ضعوا صورتكم على البطاقة، وسجّلوا صوتكم مرة واحدة، فتقول لها البطاقة التهنئة بصوتكم منذ الصباح.
وتبقى الكلمات بين أيديكم طوال الطريق. يصوغ الوكيل الجملة التي ستُقال بصوت مسموع، ويمكن تغيير كل كلمة فيها، وترون كم ثانية ستستغرق تقريبًا قبل أن يظهر السعر على الزر. وإذا فشلت البطاقة يعود الرصيد إليكم، وتبقى التهنئة المكتوبة كاملة تحت الفيديو.
البطاقة الناطقة شخص واحد وجملة واحدة مباشرة إلى الكاميرا. إن أردتم أن يتحرك المشهد كله - الأم تطفئ الشموع، والكؤوس تتلاقى، والمائدة كلها تهتف - فحوّلوا البطاقة إلى فيديو بدلًا من ذلك. MiniMax H3، الذي يختاره «تلقائي» للفيديو، يحرّك كل مشاهد الفيديو في الكتالوج، ويستطيع Veo 3.1 أن يصنع الأصوات والغناء وأصوات الخلفية في الإنشاء نفسه.
وإن كان الصوت أهم من الوجه، فالتهنئة الصوتية التي يقرؤها ElevenLabs Eleven v3 تصل صوتًا فقط. وإن أردتم أن يدندن الجميع قبل الحلوى، فأغنية مصنوعة بـ Google Lyria 3.5 تحمل كلماتكم أنتم بلغتكم.
وكلمة عن الذوق. تنجح البطاقة الناطقة أكثر حين تحمل كلمات يسعد صاحب الصورة بقولها. اتصلوا بالجدة واسألوها ماذا تريد أن تقول، واكتبوه بطريقتها، ودعوا صورتها تقوله. أما إن وضعتم على لسان أحدهم كلمات لا يستخدمها أبدًا، فستلاحظ العائلة ذلك قبل أن تنطفئ الشموع.
أريد بطاقة ناطقة من صورة العم سمير لعيد ميلاد ابنة عمي ليلى الثلاثين: يظهر حتى الخصر في الحديقة، بسترته الأنيقة، رافعًا كوب العصير. وبالعربية يقول لها إنه يلقي هذه الكلمة منذ أن أتمت عامها الأول، وسيظل يلقيها كل عام.
اجمعنا حول المائدة الطويلة في الحديقة، ماما وبابا وأخي وأنا، في الذكرى الأربعين لزواج والديّ، ثم اجعل بابا يتكلم: يرفع كوب الشاي ويشكر ماما على أربعين عامًا من فطائر صباح الجمعة.
لعيد ميلاد ابني آدم العاشر: بطاقة ناطقة لجده في مدرجات الملعب، بوشاح فريقه وذراعاه مرفوعتان. يقول له جده إنه سيحضر مباراة السبت ومعه أعلى طبلة صوتًا في الملعب كله.
البطاقة الناطقة تجعل شخصًا تحبونه يقول تهنئتكم بصوت مسموع - حتى 15 ثانية من الكلام، والشفاه تتحرك مع الكلمات. يحرّك…
التفاصيلKlingKling عائلة من نماذج الذكاء الاصطناعي من Kuaishou، ويعمل ثلاثة منها لدينا: Kling 3.0 Pro للفيديو، وKling O3 للصور، وKling…
التفاصيلElevenLabsEleven v3 هو نموذج تحويل النص إلى كلام من ElevenLabs. يقرأ لدينا تهنئتكم بصوت من 8 أصوات في الكتالوج، بالعربية…
التفاصيلOmniHuman 1.5 نموذج ذكاء اصطناعي من ByteDance يحوّل صورة واحدة وتسجيلًا صوتيًا إلى فيديو يتكلم فيه ذلك الشخص، ويتحرك وجهه ورأسه وجسده مع الصوت. في Wish Generator هو جودة «الأعلى» للبطاقة الناطقة: تصنعون بطاقة بصورة، وتعدّلون الجملة، وتختارون صوتًا، فيجعل OmniHuman الشخص الذي فيها ينطق تهنئتكم.
يحرّك OmniHuman 1.5 الشخص كله، بينما يحرّك Kling AI Avatar v2 الوجه والرأس. يأخذ الاثنان البطاقة نفسها والجملة المسجلة نفسها، ويتوقف كلاهما عند 15 ثانية من الكلام. ثانية OmniHuman أغلى، وهو الوحيد بينهما الذي يتيح النقر على من يتكلم في صورة جماعية. للقطة قريبة هادئة يكفي عادةً Kling AI Avatar v2، أما للكلمة مع كوب مرفوع أو اللقطة الواسعة أو المائدة العائلية فاختاروا «الأعلى».
حتى 15 ثانية من الكلام، وهو الحد نفسه في Kling AI Avatar v2 - أي ما يعادل كلمة قصيرة على المائدة تقريبًا. تقدّر النافذة عدد الثواني أثناء الكتابة ولا تبدأ جملة تتجاوز الحد، لذلك لن يُخصم منكم شيء مقابل جملة أطول من اللازم.
نعم، مع OmniHuman 1.5. حوّلوا الجودة إلى «الأعلى» وانقروا على وجه الشخص الذي يجب أن يتكلم: يُحدَّد هذا الوجه للنموذج، ويقول ذلك الشخص الجملة. وإن لم تنقروا، يختار النموذج المتكلم بنفسه. للبطاقات الجماعية، هذا هو النموذج المناسب.
نعم. لا يقرأ OmniHuman الكلمات بنفسه، بل يحرّك الشفاه على تسجيل صوتي، وهذا التسجيل يُصنع باللغة التي كتبتم بها الجملة. اختاروا أحد الأصوات الـ 8 في كتالوج ElevenLabs Eleven v3، أو صوتكم أنتم في الباقات المدفوعة. واجعلوا الجمل العربية والعبرية أقصر قليلًا: 15 ثانية تتسع لعدد أقل من حروفهما.
نعم. أضيفوا صورة أحبائكم من جهازكم أو من «مكتبتي» أو من «الأشخاص» - JPG أو PNG أو WebP حتى 10 ميغابايت. يصنع الوكيل أولًا بطاقة بصورة يظهرون فيها، ثم تضغطون «جعلهم يتكلمون». تتسع البطاقة لما يصل إلى 6 أشخاص، وتكون الوجوه أدق ما تكون مع 4 أشخاص أو أقل.
اصنعوا البطاقة، واضغطوا «جعلهم يتكلمون»، وحوّلوا الجودة إلى «الأعلى»، ثم أرسلوها في يومها.
أنشئوا بطاقة ناطقة