البطاقة الناطقة تجعل شخصًا تحبونه يقول تهنئتكم بصوت مسموع - حتى 15 ثانية من الكلام، والشفاه تتحرك مع الكلمات. يحرّك Kling AI Avatar v2 من Kuaishou الوجه والرأس، ويبعث OmniHuman 1.5 من ByteDance الحياة في الشخص كله. أما الأصوات فمن ElevenLabs، أو منكم أنتم.
آخر تحديث 29.09.2026
Happy birthday! I wish I could hug you today - this is the next best thing.
С Днём Рождения! Жаль, что не могу обнять тебя сегодня, но вот моё поздравление.
اكتبوا للوكيل في المحادثة شيئًا مثل «بطاقة ناطقة لعيد ميلاد يوسف الثامن، من جدته هدى»، وأضيفوا صورتها حين يطلبها - JPG أو PNG أو WebP حتى 10 ميغابايت. يصنع الوكيل البطاقة بالصورة أولًا. ويمكنكم الاستغناء عنه في الوضع القياسي: صورة شخصية قرب النافذة، أو مشهد مثل «مائدة طويلة في الحديقة».
تحت البطاقة الجاهزة اضغطوا «جعلهم يتكلمون». يكتب الوكيل نسخة قصيرة من تهنئتكم تصلح للنطق - عدّلوها أو اكتبوا نسختكم، ويُظهر عدّاد تقريبًا كم ثانية ستستغرق. اختاروا الصوت. وأي نص يتجاوز 15 ثانية يُنبَّه إليه قبل أن يبدأ أي شيء.
تحت «الجودة»، الخيار «قياسي» هو Kling AI Avatar v2 الذي يحرّك الوجه والرأس، و«الأعلى» هو OmniHuman 1.5 الذي يحرّك الشخص كله - وفيه تضغطون على وجه من سيتكلم. السعر مكتوب على الزر، ولا يُخصم شيء قبل الضغط. ثم أرسلوها بالبريد الإلكتروني أو SMS أو عبر أحد تطبيقات المراسلة.
بطاقة ناطقة لعيد ميلاد حفيدي آدم الثامن، مني: صورة شخصية عند نافذة المطبخ في ضوء صباحي ناعم، أنظر إلى الكاميرا وأبتسم، وعلى حافة النافذة كعكة صغيرة عليها ثماني شموع. أريد أن أقول: عيد ميلاد سعيد يا آدم، ثماني سنوات وصرت أطول من طاولة المطبخ. احتفظ لي بقطعة، سآتي في يوليو.
بطاقة للجد سليم لعيد ميلاد ابنتي مريم السادس: من الكتفين إلى الأعلى في ورشة النجارة الخاصة به، نشارة الخشب تتطاير في أشعة الشمس، يبتسم للكاميرا ويرفع الحصان الخشبي الصغير الذي صنعه لها بيديه.
بطاقة بصورتي لعيد ميلاد دانة وهي في رحلة عمل: من الكتفين إلى الأعلى على شرفتنا عند الغسق، أحمل كب كيك عليه شمعة واحدة، وأضواء المدينة ناعمة خلفي، أنظر إلى الكاميرا.
يحصل المحرّكان منا على الشيئين نفسيهما: البطاقة، والصوت مسجلًا ومقصوصًا على عدد الثواني التي دفعتم ثمنها. الفرق في مقدار ما يتحرك من الصورة. يعمل Kling AI Avatar v2 من Kuaishou على الوجه والرأس: يتبع الفم الكلمات، ويتحرك الرأس معها، ويبقى كل ما عدا ذلك على حاله، من الملابس إلى الغرفة في الخلفية. وللصورة الشخصية لشخص واحد هذا عادةً هو المطلوب بالضبط، والثانية فيه أرخص. والجدة في هذه الصفحة صُنعت بهذه الطريقة.
أما OmniHuman 1.5 من ByteDance فيرى في الصورة شخصًا كاملًا: يتحرك الرأس والوجه والكتفان على إيقاع الصوت، فالصورة من الخصر فما فوق، أو الكأس المرفوعة، تمنحه ما يحرّكه غير الفم. والجد الذي يهنّئ بالروسية بصوت Ari في المثال أعلاه صُنع به من صورة شخصية واحدة. وهو يحلّ أيضًا مشكلة الصورة الجماعية: حوّلوا الجودة إلى «الأعلى»، واضغطوا على وجه من يجب أن يتكلم - الجد الذي يشكر الجميع مثلًا - فيكون هو المتكلم، ويبقى الآخرون في الصورة يستمعون. ومن دون ضغطة يختار النموذج المتكلم بنفسه، وهذا مقبول في الصورة الشخصية ومجازفة في الجماعية، فلا تُطيلوا المائدة: الوجه الصغير في آخرها يصعب الضغط عليه. ولأن ثانية OmniHuman أغلى، يبقى Kling AI Avatar v2 الخيار اليومي.
الوجه الذي يتكلم هو الوجه الموجود على البطاقة، لذلك يبدأ الشبه من هناك. يقدّم GPT Image 2.5 Flare، وهو ما يختاره «تلقائي» للصور، أفضل شبه، والبطاقات التي تضم حتى أربعة أشخاص تحافظ على الوجوه بأعلى موثوقية. وللجزء الناطق تساعد أمور بسيطة: وجه متجه نحو الكاميرا، وفم ظاهر لا يخفيه كوب أو يد، وإضاءة متساوية، ووجه يشغل جزءًا جيدًا من الإطار. ويفضّل OmniHuman 1.5 أن يظهر الكتفان أيضًا. شخص واحد في صورة شخصية هو الحالة السهلة، ووجه صغير في منظر واسع هو الحالة الصعبة.
وإذا كانت صورتكم الوحيدة لقطة جماعية من الطرف البعيد للحديقة، فاصنعوا أولًا بطاقة جديدة أقرب، ودعوها هي تتكلم. و«الأشخاص» يوفّر عليكم خطوة: إن كانت الجدة محفوظة هناك مع صورة، فالصورة لدى الوكيل أصلًا ولن يطلبها مجددًا.
خمس عشرة ثانية نخبٌ لا رسالة: الاسم، وتفصيل حقيقي واحد، وأمنية واحدة. جملة الجدة في هذه الصفحة تستغرق 7 ثوانٍ، فالحد يتسع لنحو جملتين مثلها. والصوت يتوقف عند النقاط، فالجملة التي تمتد ثلاثة أسطر تخرج نفَسًا واحدًا طويلًا. عبارة «عيد ميلاد سعيد لحفيدي الرائع، أتمنى لك كل الخير في يومك المميز، وأن تتحقق كل أحلامك» تقول أقل من «عيد ميلاد سعيد يا يوسف. ثماني سنوات، وما زلت مدينًا لي بمباراة إعادة في طاولة الزهر. سأحضر الكعكة يوم الجمعة».
استعملوا الأسماء التي تتنادى بها العائلة فعلًا: تيتا، جدّو، ستّي، سيدو. واجعلوا الجمل العربية والعبرية أقصر قليلًا، فالـ 15 ثانية تتسع فيهما لحروف أقل مما تتسع له بالإنجليزية. لا تكتبوا إرشادات أداء مثل [تضحك]: فالتطبيق يحذف كل ما بين قوسين مربعين قبل أن يقرأ الصوت الجملة. وأفضل الكلمات تأتي عادةً من صاحب الصورة نفسه: اتصلوا بالجدة، واسألوها ماذا كانت ستقول، واكتبوه بطريقتها. ثم اقرؤوا الجملة بصوت عالٍ مرة واحدة: إن تعثّرتم بها، فستبدو متكلّفة على لسان صاحب الصورة أيضًا.
اختاروا الصوت لمن سيستمع لا لأنفسكم: صوتًا هادئًا دافئًا للجد أو الجدة، وصوتًا مشرقًا لطفل في السادسة. ولكل صوت في الكتالوج عيّنة، فاختاروا بالأذن لا بالاسم. وقاعدة واحدة ليست تقنية: استخدموا صور أشخاص سيسعدهم أن يروا أنفسهم يتكلمون، وكلمات كانوا سيقولونها فعلًا. ضعوا على لسان الجد عبارة ما كان ليقولها أبدًا، وستلاحظ العائلة ذلك قبل أن تُطفأ الشموع.
معظم البطاقات الناطقة تنوب عن شخص غائب. في يوم الحفلة تكون الجدة على بُعد رحلتين بالطائرة، فتقول صورتها «عيد ميلاد سعيد» من هاتف مسنود إلى قالب الكعكة. وإن كان لها حساب خاص على باقة مدفوعة، تسجّل صوتها مرة واحدة، فتصبح هي من يتكلم حقًا.
وليست المسافة السبب الوحيد. تصوير أنفسكم وأنتم تقولون «عيد ميلاد سعيد» يحتاج إلى عشر محاولات، وفي أفضلها يظهر إبهامكم، أما هنا فتختارون صورة تحبونها أصلًا وتكتبون جملتين. وفروق التوقيت تجعل مكالمة عيد الميلاد أمرًا محرجًا، لذا يمكن لبطاقة بوجهكم، وبصوتكم أيضًا على باقة مدفوعة، أن تنتظرهم: جدولوها لصباحهم، لا لصباحكم.
واللغة مهمة أيضًا. الأحفاد يجيبون بالإنجليزية، والجدة ما زالت تفكر بالعربية. اكتبوا جملتها بالعربية وبالكلمات التي تستعملها هي، وستنطقها صورتها بالعربية، فالصوت يقرأ باللغة التي كُتبت بها الجملة.
البطاقة الناطقة شخص واحد، وبضع جمل، ونظرة إلى الكاميرا. إنها ليست حفلة. إذا أردتم المائدة كلها ترفع الكؤوس، مع الرنين والضحك، فأنتم تحتاجون إلى فيديو. حوّل Kling 3.0 بطاقتنا ذات المائدة الطويلة في الحديقة إلى مقطع من 5 ثوانٍ يُظهر ذلك بالضبط، مع الصوت. ويصنع Veo 3.1 الأصوات والغناء في الإنشاء نفسه - في صفحته تغني عائلة آخر أغنية Happy Birthday وتطفئ الأم الشموع. أما MiniMax H3 فيحرّك كل مشاهد الفيديو في كتالوجنا، وهو الأوفر بين الثلاثة.
إذا كان الصوت هو المهم لا الوجه، فأرسلوا تهنئة صوتية: الأصوات الثمانية نفسها، أو صوتكم، من دون صورة تُحرَّك، وبتكلفة أقل. وإذا أردتم أن تُغنّى الكلمات، فإن Lyria 3.5 يغني كلمات وافقتم عليها، بالعربية والإنجليزية والروسية والعبرية وغيرها.
كلاهما ينطق الجملة نفسها بالصوت نفسه، حتى 15 ثانية. اختاروا Kling AI Avatar v2 لوجه واحد في صورة شخصية - فثانيته أرخص. واختاروا OmniHuman 1.5 حين يجب أن يتحرك الشخص كله، أو حين تحتاجون إلى تحديد من يتكلم في صورة جماعية.
| النموذج | نقطة القوة | المدة | الدقة | السعر |
|---|---|---|---|---|
| Kling AI Avatar v2Kuaishou | الوجه والرأس يتحركان مع الكلمات | حتى 15 ثانية من الكلام | 71 رصيد لكل ثانية كلام + الصوت | |
| OmniHuman 1.5ByteDance | الشخص كله ينبض بالحياة | حتى 15 ثانية من الكلام | 720p | 200 رصيد لكل ثانية كلام + الصوت |
الأسعار بالرصيد، ويظهر السعر دائمًا على الزر قبل الضغط. الأسعار
OmniHuman 1.5 نموذج من ByteDance يبعث الحياة في شخص من صورة واحدة انطلاقًا من تسجيل صوتي. وهو هنا جودة «الأعلى»…
التفاصيلKlingKling عائلة من نماذج الذكاء الاصطناعي من Kuaishou، ويعمل ثلاثة منها لدينا: Kling 3.0 Pro للفيديو، وKling O3 للصور، وKling…
التفاصيلElevenLabsEleven v3 هو نموذج تحويل النص إلى كلام من ElevenLabs. يقرأ لدينا تهنئتكم بصوت من 8 أصوات في الكتالوج، بالعربية…
التفاصيلتهنئة صوتيةالتهنئة الصوتية بالذكاء الاصطناعي هي تهنئتكم المكتوبة وقد تحوّلت إلى رسالة صوتية تُشغّل عبر مكبّر الصوت أو في السيارة أو…
التفاصيلاصنعوا بطاقة بصورة الشخص، ثم اضغطوا «جعلهم يتكلمون» تحت البطاقة الجاهزة. عدّلوا الجملة القصيرة التي يقترحها الوكيل، واختاروا الصوت والجودة، واضغطوا الزر الذي يحمل السعر. تعود البطاقة فيديو يقول فيه هذا الشخص كلماتكم، وشفتاه تتحركان مع الصوت.
بالثواني: كل ثانية كلام إضافة إلى الصوت، وثانية OmniHuman 1.5 أغلى من ثانية Kling AI Avatar v2، فالجملة القصيرة بجودة «قياسي» هي الأقل تكلفة. والـ 1000 رصيد المجانية عند التسجيل تكفي لتجربة بطاقة قصيرة، وصوتكم الخاص يُدفع ثمنه مرة واحدة في باقة مدفوعة. التهاني النصية مجانية، والسعر يظهر على الزر قبل الضغط، والبطاقة التي تفشل يعود رصيدها إليكم.
حتى 15 ثانية من الكلام - جملتان أو ثلاث قصيرة. وجملة الجدة في هذه الصفحة تستغرق 7 ثوانٍ. يكتب الوكيل الجملة المنطوقة على هذا القدر، ويُظهر عدّاد تحتها تقريبًا كم ثانية ستستغرق، وإن كتبتم أكثر ينبّهكم التطبيق إلى أن النص طويل قبل أن يُخصم أي شيء. وتبقى تهنئتكم المكتوبة كاملةً مرفقة بالبطاقة، أسفل الفيديو.
نعم، مع OmniHuman 1.5. حوّلوا الجودة إلى «الأعلى» واضغطوا على وجه من يجب أن يتكلم: فيقول الجملة ويبقى الآخرون في الصورة. وإن لم تضغطوا، يختار النموذج المتكلم بنفسه. أما Kling AI Avatar v2، أي جودة «قياسي»، فلا يتيح هذا الاختيار، فاختاروا «الأعلى» للبطاقة الجماعية حين يهمّكم ذلك.
صورة ينظر فيها الشخص نحو الكاميرا، وفمه ظاهر لا يخفيه فنجان أو يد، والإضاءة متساوية، والوجه يشغل جزءًا لا بأس به من الإطار. ومع OmniHuman 1.5 اجعلوا الكتفين ظاهرين أيضًا. أما الوجه الصغير في صورة جماعية واسعة فهو الحالة الصعبة: اصنعوا أولًا بطاقة جديدة أقرب، ودعوها هي تتكلم.
بصوتكم نعم، في باقات Plus وFamily وPro: اقرؤوا بصوت عالٍ نصًا قصيرًا في المتصفح، نحو 20 ثانية، فيصنع MiniMax Speech صوتكم، وتدفعون ثمنه مرة واحدة. أما بصوت غيركم فلا، لأنه لا يمكن رفع التسجيلات القديمة أو الرسائل الصوتية؛ لكن الأم تستطيع أن تسجّل صوتها بنفسها على حسابها المدفوع. وفي أي باقة يمكنكم بدلًا من ذلك اختيار واحد من ثمانية أصوات من ElevenLabs والاستماع إلى كل منها أولًا.
نعم. يمكن أن تكون الجملة بالعربية أو الإنجليزية أو الروسية أو العبرية، والصوت ينطق باللغة التي كتبتموها بها. أصوات الكتالوج الثمانية من ElevenLabs Eleven v3، وعلى باقة مدفوعة يعمل صوتكم أيضًا. اكتبوا باختصار: فالـ 15 ثانية تتسع لحروف عربية وعبرية أقل مما تتسع له بالإنجليزية، والعدّاد يُظهر كم بقي من المساحة.
صورة واحدة، وجملتان أو ثلاث، وصوت - فتقول بطاقة عيد الميلاد التهنئة بصوت مسموع.
اجعلوا الصورة تتكلم