כרטיס מדבר נותן למישהו שאתם אוהבים להגיד את הברכה שלכם בקול - עד 15 שניות של דיבור, והשפתיים זזות בדיוק עם המילים. Kling AI Avatar v2 של Kuaishou מזיז את הפנים והראש, ו-OmniHuman 1.5 של ByteDance מפיח חיים באדם כולו. הקולות מגיעים מ-ElevenLabs, או מכם.
עודכן 29.09.2026
Happy birthday! I wish I could hug you today - this is the next best thing.
С Днём Рождения! Жаль, что не могу обнять тебя сегодня, но вот моё поздравление.
כתבו לסוכן בצ'אט משהו כמו "כרטיס מדבר ליום ההולדת השמיני של יונתן, מסבתא רותי", והוסיפו את התמונה שלה כשהוא מבקש - JPG, PNG או WebP עד 10MB. קודם הוא יוצר את הכרטיס עם התמונה. אפשר גם בלי הסוכן, במצב "רגיל": פורטרט ליד החלון, או סצנה כמו "שולחן ארוך בגינה".
מתחת לכרטיס המוכן לחצו על "לגרום להם לדבר". הסוכן יכתוב גרסה קצרה של הברכה שמתאימה לאמירה בקול - ערכו אותה או הקלידו משלכם, ומונה יראה בערך כמה שניות היא תיקח. בחרו קול. כל מה שעובר את 15 השניות מסומן עוד לפני שמתחילים.
תחת "איכות", "רגיל" הוא Kling AI Avatar v2, שמזיז את הפנים והראש, ו"הכי טוב" הוא OmniHuman 1.5, שמזיז את האדם כולו - שם לוחצים על הפנים של מי שמדבר. המחיר כתוב על הכפתור, ושום דבר לא מחויב לפני הלחיצה. אחר כך שלחו במייל, ב-SMS או באפליקציות המסרים הפופולריות.
כרטיס מדבר ליום ההולדת השמיני של הנכד שלי איתי, ממני: פורטרט ליד חלון המטבח באור בוקר רך, אני מסתכלת למצלמה ומחייכת, ועל אדן החלון עוגה קטנה עם שמונה נרות. אני רוצה להגיד: יום הולדת שמח, איתי, כבר בן שמונה וגבוה יותר משולחן המטבח. תשמור לי חתיכה, אני מגיעה ביולי.
כרטיס עם סבא יוסי ליום ההולדת השישי של הבת שלי מיה: מהכתפיים ומעלה בנגרייה שלו, נסורת מרחפת בקרני השמש, הוא מחייך למצלמה ומרים את סוס העץ הקטן שגילף בשבילה.
כרטיס עם התמונה שלי ליום ההולדת של דנה, כשהיא בנסיעת עבודה: מהכתפיים ומעלה במרפסת שלנו בין ערביים, ביד קאפקייק עם נר אחד, אורות העיר רכים מאחוריי, אני מסתכל למצלמה.
שני המנועים מקבלים מאיתנו אותם שני דברים: את הכרטיס ואת הקול, כבר מוקלט וחתוך בדיוק לשניות ששילמתם עליהן. ההבדל הוא כמה מהתמונה זז. Kling AI Avatar v2 של Kuaishou עובד על הפנים והראש: הפה עוקב אחרי המילים, הראש זז איתן, וכל השאר נשאר כמו שהיה, מהבגדים ועד החדר שמאחור. לפורטרט של אדם אחד זה בדרך כלל בדיוק מה שצריך, וגם השנייה זולה יותר. הסבתא בעמוד הזה נוצרה כך.
OmniHuman 1.5 של ByteDance מנפיש את האדם כולו: הראש, הפנים והכתפיים זזים בקצב של הקול, כך שבצילום מהמותניים ומעלה, או עם כוס מורמת, יש לו מה להזיז מעבר לפה. הסבא שמברך ברוסית בקול Ari בדוגמה למעלה נוצר בו מפורטרט אחד. הוא גם פותר את בעיית התמונה הקבוצתית: העבירו את האיכות ל"הכי טוב", לחצו על הפנים של מי שצריך לדבר - נגיד סבא, שמודה לכולם - והוא זה שידבר, בזמן שכל השאר נשארים בתמונה ומקשיבים. בלי לחיצה המודל בוחר לבד מי מדבר, וזה בסדר בפורטרט והימור בקבוצה, אז אל תגזימו עם השולחן: על פנים זעירות בקצה קשה ללחוץ. ומכיוון שכל שנייה ב-OmniHuman עולה יותר, Kling AI Avatar v2 הוא הבחירה היומיומית.
הפנים שמדברות הן הפנים שעל הכרטיס, אז הדמיון מתחיל שם. ל-GPT Image 2.5 Flare, מה ש"אוטומטי" בוחר לתמונות, יש את הדמיון הטוב ביותר, וכרטיסים עם עד ארבעה אנשים שומרים על הפנים בצורה הכי אמינה. לחלק המדבר עוזרים כמה דברים פשוטים: פנים מופנות למצלמה, פה גלוי ולא מוסתר מאחורי כוס או יד, תאורה אחידה, ופנים שתופסות חלק נכבד מהפריים. ל-OmniHuman 1.5 עדיף שגם הכתפיים ייראו. אדם אחד בפורטרט הוא המקרה הקל. פנים זעירות בנוף רחב הן המקרה הקשה.
אם התמונה היחידה שיש לכם היא צילום קבוצתי מהקצה השני של הגינה, צרו קודם כרטיס חדש, מקרוב, ותנו לו לדבר. "אנשים" חוסך צעד: אם סבתא שמורה שם עם תמונה, לסוכן כבר יש אותה, והוא לא יבקש שוב.
חמש עשרה שניות הן הרמת כוסית, לא מכתב: השם, פרט אמיתי אחד, איחול אחד. המשפט של סבתא בעמוד הזה אורך 7 שניות, כך שבמגבלה נכנסים בערך שניים כאלה. הקול עוצר בנקודות, ומשפט שנמשך שלוש שורות יוצא כנשימה אחת ארוכה. "יום הולדת שמח לנכד המדהים שלי, מאחלת לך כל טוב ביום המיוחד שלך, שכל החלומות שלך יתגשמו" אומר פחות מ"יום הולדת שמח, יונתן. כבר בן שמונה, ועדיין חייב לי משחק חוזר בשש-בש. בשבת אני מביאה עוגה."
השתמשו בשמות שבאמת קוראים בהם במשפחה - סבתוש, סבא, באבושקה, יוני. כתבו בעברית ובערבית קצת יותר קצר, כי ב-15 שניות נכנסות בהן פחות אותיות מאשר באנגלית. אל תכתבו הוראות במה כמו [צוחקת]: האפליקציה מוחקת כל מה שבסוגריים מרובעים לפני שהקול מקריא את המשפט. המילים הכי טובות מגיעות בדרך כלל מהאדם שבתמונה: התקשרו לסבתא, שאלו מה היא הייתה אומרת, וכתבו את זה במילים שלה. אחר כך קראו את המשפט בקול פעם אחת: אם אתם נתקעים בו, הוא יישמע נוקשה גם בפה של מי שבתמונה.
בחרו קול בשביל מי שמקשיב, לא בשבילכם: קול איטי וחם לסבא או לסבתא, קול צלול ועליז לילד בן שש. לכל קול בקטלוג יש דוגמה, אז בחרו לפי האוזן ולא לפי השם. וכלל אחד שאינו טכני: השתמשו בתמונות של אנשים שישמחו לראות את עצמם מדברים, ובמילים שהם באמת היו אומרים. שימו בפה של סבא משפט שהוא אף פעם לא היה אומר, והמשפחה תשים לב עוד לפני שהנרות כבים.
רוב הכרטיסים המדברים באים במקום מישהו שחסר. ביום עצמו סבתא נמצאת במרחק שתי טיסות, והפורטרט שלה אומר מזל טוב מטלפון שנשען על העוגה. עם חשבון משלה במסלול בתשלום היא מקליטה את הקול שלה פעם אחת, ואז זו באמת היא שמדברת.
המרחק הוא לא הסיבה היחידה. לצלם את עצמכם אומרים יום הולדת שמח לוקח תריסר ניסיונות, ובזה שיצא הכי טוב רואים את האגודל שלכם, וכאן בוחרים תמונה שכבר אוהבים ומקלידים שני משפטים. הפרשי שעות הופכים שיחת יום הולדת למסובכת, אז כרטיס עם הפנים שלכם, ובמסלול בתשלום גם עם הקול שלכם, יכול לחכות: תזמנו אותו לבוקר שלהם, לא לשלכם.
גם השפה חשובה. הנכדים עונים בעברית, וסבתא עדיין חושבת ברוסית. כתבו את המשפט שלה ברוסית, כמו שהיא הייתה אומרת אותו, והתמונה שלה תגיד אותו ברוסית: הקול מקריא בשפה שבה המשפט כתוב.
כרטיס מדבר הוא אדם אחד, כמה משפטים, מבט למצלמה. זו לא מסיבה. אם אתם רוצים את כל השולחן מרים כוסות, עם צלצולים וצחוק, אתם צריכים וידאו. Kling 3.0 הפך את הכרטיס שלנו עם השולחן הארוך בגינה לקליפ של 5 שניות בדיוק כזה, כולל סאונד. Veo 3.1 יוצר קולות ושירה באותה יצירה - בעמוד שלו משפחה שרה את סוף Happy Birthday ואמא מכבה את הנרות. MiniMax H3 מנפיש את כל סצנות הווידאו בקטלוג שלנו, והוא המשתלם מבין השלושה.
אם הקול חשוב יותר מהפנים, שלחו ברכה קולית: אותם שמונה קולות, או הקול שלכם, בלי תמונה להנפיש, וזה עולה פחות. אם אתם רוצים שהמילים יושרו, Lyria 3.5 שר מילים שאישרתם, בעברית, באנגלית, ברוסית, בערבית ועוד.
שניהם אומרים את אותו משפט באותו קול, עד 15 שניות. בחרו ב-Kling AI Avatar v2 לפנים של אדם אחד בפורטרט - השנייה בו זולה יותר. בחרו ב-OmniHuman 1.5 כשהאדם כולו צריך לזוז, או כשצריך לבחור מי מדבר בתמונה קבוצתית.
| מודל | החוזקה | אורך | איכות | מחיר |
|---|---|---|---|---|
| Kling AI Avatar v2Kuaishou | הפנים והראש זזים עם המילים | עד 15 שניות דיבור | 71 קרדיטים לשניית דיבור + הקול | |
| OmniHuman 1.5ByteDance | כל האדם מתעורר לחיים | עד 15 שניות דיבור | 720p | 200 קרדיטים לשניית דיבור + הקול |
המחירים בקרדיטים, והמחיר תמיד מופיע על הכפתור לפני הלחיצה. מחירים
OmniHuman 1.5 הוא מודל של ByteDance שמחייה אדם מתמונה אחת לפי הקלטת קול. אצלנו הוא רמת האיכות "הכי טוב" בכרטיס…
לפרטיםKlingKling היא משפחת מודלי AI של Kuaishou, ושלושה מהם עובדים אצלנו: Kling 3.0 Pro לווידאו, Kling O3 לתמונות ו-Kling AI…
לפרטיםElevenLabsEleven v3 הוא מודל ההקראה (טקסט לדיבור) של ElevenLabs. אצלנו הוא מקריא את הברכה שלכם באחד מ-8 הקולות שבקטלוג, בעברית,…
לפרטיםברכה קוליתברכה קולית ב-AI היא הברכה שכתבתם, שהופכת להודעה קולית שאפשר להשמיע ברמקול, באוטו או ליד שולחן ארוחת הבוקר. שמונת הקולות…
לפרטיםצרו כרטיס עם תמונה של האדם, ואז לחצו על "לגרום להם לדבר" מתחת לכרטיס המוכן. ערכו את המשפט הקצר שהסוכן מנסח, בחרו קול ואיכות, ולחצו על הכפתור שהמחיר כתוב עליו. הכרטיס חוזר כסרטון שבו האדם הזה אומר את המילים שלכם, והשפתיים זזות עם הקול.
לפי שניות: כל שנייה של דיבור ועוד הקול, ו-OmniHuman 1.5 עולה יותר לשנייה מ-Kling AI Avatar v2, כך שמשפט קצר באיכות "רגיל" עולה הכי פחות. 1,000 הקרדיטים החינמיים שמקבלים בהרשמה מספיקים כדי לנסות כרטיס קצר, ועל הקול שלכם משלמים פעם אחת במסלול בתשלום. ברכות טקסט הן בחינם, המחיר מופיע על הכפתור לפני הלחיצה, ואם הכרטיס נכשל הקרדיטים חוזרים.
עד 15 שניות של דיבור - שניים-שלושה משפטים קצרים. המשפט של סבתא בעמוד הזה אורך 7 שניות. הסוכן כותב את המשפט כך שייכנס בזמן, מונה מתחתיו מראה בערך כמה שניות הוא ייקח, ואם תכתבו יותר, האפליקציה תגיד שזה ארוך מדי עוד לפני שמשהו מחויב. הברכה הכתובה המלאה עדיין נשלחת עם הכרטיס, מתחת לסרטון.
כן, עם OmniHuman 1.5. מעבירים את האיכות ל"הכי טוב" ולוחצים על הפנים של מי שצריך לדבר: הוא אומר את המשפט, וכל השאר נשארים בתמונה. בלי לחיצה המודל בוחר בעצמו מי מדבר. ב-Kling AI Avatar v2, באיכות "רגיל", אין בחירה כזאת, אז לכרטיס קבוצתי שבו זה חשוב בחרו "הכי טוב".
תמונה שבה האדם מביט לכיוון המצלמה, הפה גלוי ולא מוסתר מאחורי כוס או יד, התאורה אחידה והפנים תופסות חלק נכבד מהפריים. ל-OmniHuman 1.5 עדיף שגם הכתפיים ייראו. פנים זעירות בתמונה קבוצתית רחבה הן המקרה הקשה: צרו קודם כרטיס חדש מקרוב, ותנו לו לדבר.
בקול שלכם כן, במסלולי Plus, Family ו-Pro: מקריאים בקול טקסט קצר בדפדפן, כ-20 שניות, ו-MiniMax Speech יוצר את הקול שלכם, בתשלום חד-פעמי. בקול של מישהו אחר לא, כי אי אפשר להעלות הקלטות ישנות או הודעות קוליות; אמא יכולה להקליט את הקול שלה בחשבון בתשלום משלה. בכל מסלול אפשר במקום זה לבחור אחד משמונה קולות של ElevenLabs ולהאזין לכל אחד קודם.
כן. המשפט יכול להיות בעברית, באנגלית, ברוסית או בערבית, והקול מדבר בשפה שבה כתבתם אותו. שמונת קולות הקטלוג מגיעים מ-ElevenLabs Eleven v3, ובמסלול בתשלום גם הקול שלכם עובד. כתבו קצר: ב-15 שניות נכנסות פחות אותיות בעברית ובערבית מאשר באנגלית, והמונה מראה כמה מקום נשאר.
תמונה אחת, שניים-שלושה משפטים וקול - וכרטיס יום ההולדת אומר את זה בקול רם.
ליצור תמונה מדברת