OmniHuman 1.5 הוא מודל של ByteDance שמחייה אדם מתמונה אחת לפי הקלטת קול. אצלנו הוא רמת האיכות "הכי טוב" בכרטיס המדבר: עם המילים זזים לא רק השפתיים אלא גם הפנים, הראש והכתפיים, ובתמונה קבוצתית פשוט לוחצים על מי שמדבר.
עודכן 29.09.2026
С Днём Рождения! Жаль, что не могу обнять тебя сегодня, но вот моё поздравление.
Happy birthday! I wish I could hug you today - this is the next best thing.
Kling AI Avatar v2 זול יותר לשנייה ומתאים לתקריב רגוע. OmniHuman 1.5 מיועד לפריים רחב יותר שבו גם הגוף זז, ולתמונה קבוצתית שבה אתם בוחרים מי מדבר.
| מודל | החוזקה | אורך | איכות | מחיר |
|---|---|---|---|---|
| OmniHuman 1.5ByteDance | כל האדם מתעורר לחיים | עד 15 שניות דיבור | 720p | 200 קרדיטים לשניית דיבור + הקול |
| Kling AI Avatar v2Kuaishou | הפנים והראש זזים עם המילים | עד 15 שניות דיבור | 71 קרדיטים לשניית דיבור + הקול |
המחירים בקרדיטים, והמחיר תמיד מופיע על הכפתור לפני הלחיצה. מחירים
הוסיפו תמונה של האדם - JPG, PNG או WebP עד 10MB - מהמכשיר, מ"הספרייה שלי" או מ"אנשים", וספרו לסוכן למי הכרטיס ומה חוגגים. הוא ייצור כרטיס שהאדם נמצא בו. אפשר להתחיל גם מסצנה מוכנה, כמו "נרות לאמא".
כשהכרטיס מוכן, לחצו מתחתיו על "לגרום להם לדבר". הסוכן מנסח משפט קצר שייאמר בקול - ערכו אותו עד שהוא נשמע כמו האדם עצמו. בחרו קול והעבירו את האיכות ל"הכי טוב" - זה OmniHuman 1.5. ברירת המחדל היא Kling AI Avatar v2.
כש"הכי טוב" פעיל, לחצו על הפנים של מי שצריך לדבר, או השאירו את הבחירה לנו. המחיר מופיע על הכפתור. לוחצים, והכרטיס המדבר מגיע לצ'אט. שלחו אותו במייל, ב-SMS או באפליקציות המסרים הפופולריות, עכשיו או ביום שתבחרו.
שני המודלים של הכרטיסים המדברים אצלנו מקבלים את אותו כרטיס ואת אותו משפט מוקלט, ושניהם עוצרים ב-15 שניות של דיבור. ההבדל הוא כמה מהאדם זז. Kling AI Avatar v2, ברירת המחדל, מחייה את הפנים והראש ומשאיר את שאר התמונה כמו שהייתה. הסבתא שלמעלה נוצרה איתו: שבע שניות מפורטרט אחד ומהקול Ava, ושום דבר אחר בפריים לא היה צריך לזוז.
OmniHuman 1.5 הוא החי יותר מבין השניים. הוא רואה בתמונה אדם שלם, ולכן צילום עד המותניים, כוס מורמת או פריים משפחתי רחב נותנים לו עבודה מעבר לפה. שנייה של דיבור עולה בו יותר, אז כדאי להפעיל אותו במקום שבו התנועה הנוספת הזאת באמת תיראה.
כלל אצבע: תקריב וברכה שקטה ורכה - Kling AI Avatar v2. פריים רחב יותר, הרמת כוסית, כרטיס קבוצתי או משפט שבו האנרגיה חשובה - OmniHuman 1.5.
מתחילים מפנים ברורות. הפה צריך להיראות - בלי יד, כוס או מיקרופון מולו - והאדם מסתכל בערך למצלמה, באור אחיד. ל-OmniHuman פריים שמראה את הכתפיים ויותר עדיף על חיתוך צמוד כמו בתמונת פספורט: הוא בנוי להזיז אדם שלם, אז תנו לו אחד.
בכרטיסים קבוצתיים הפנים צריכות להיות בגודל סביר. שישה אנשים נכנסים לכרטיס אחד, אבל הדמיון נשמר הכי טוב עם ארבעה או פחות, ועל פנים קטנטנות בקצה השולחן קשה ללחוץ, והן משאירות למודל מעט מאוד להזיז. אם חשוב מי מדבר, הושיבו אותו קדימה כשאתם מתארים את הכרטיס.
ולבסוף, המילים. 15 שניות של דיבור מספיקות להרמת כוסית קצרה, לא לפסקה. השתמשו בשם שבאמת קוראים לאדם בבית - סבתא'לה, סבוש, דדושקה - ובפרט אחד שרק הוא מכיר: מדליית השחייה, עוגת התפוחים, הכלב שאכל את העוגה. קראו את המשפט בקול פעם אחת לפני שלוחצים. אם אתם נתקעים בו, גם בפה שלו הוא יישמע נוקשה.
OmniHuman 1.5 לא קורא את המילים בעצמו. קודם קול מקליט את המשפט, ואז המודל מזיז את האדם לפי הצליל. הקול הוא אחד מ-8 הקולות בקטלוג של ElevenLabs Eleven v3, ולכל אחד יש דוגמה שאפשר לשמוע לפני שבוחרים. במסלולי Plus, Family ו-Pro יש גם את הקול שלכם, ש-MiniMax Speech יוצר מהקראה קצרה אחת בדפדפן. מאחר שהשפתיים עוקבות אחרי ההקלטה, התמונה מדברת בשפה שבה המשפט כתוב: עברית, רוסית או ערבית.
הקול שלכם פותח עוד אפשרות. אתם בחו"ל ביום ההולדת של אחותכם: שימו את התמונה שלכם על הכרטיס, הקליטו את הקול פעם אחת, והכרטיס יגיד לה את הברכה בקול שלכם, כבר בבוקר.
המילים נשארות אצלכם לאורך כל הדרך. הסוכן מנסח את המשפט שייאמר בקול, אפשר לשנות בו כל מילה, ורואים בערך כמה שניות הוא יימשך לפני שהמחיר מופיע על הכפתור. כרטיס שנכשל מחזיר את הקרדיטים, והברכה הכתובה המלאה עדיין נשלחת מתחת לסרטון.
כרטיס מדבר הוא אדם אחד, משפט אחד, ישר למצלמה. אם אתם רוצים שכל הסצנה תזוז - אמא מכבה את הנרות, כוסות מצלצלות, כל השולחן מריע - עדיף להפוך את הכרטיס לסרטון. MiniMax H3, מה ש"אוטומטי" בוחר לווידאו, מחייה כל סצנת וידאו בקטלוג, ו-Veo 3.1 יודע ליצור קולות, שירה ורעשי רקע באותה יצירה.
אם הקול חשוב יותר מהפנים, ברכה קולית שקורא ElevenLabs Eleven v3 נשלחת כהקלטה בלבד. ואם אתם רוצים שכולם יזמזמו עד הקינוח, שיר שנוצר עם Google Lyria 3.5 ישיר את המילים שלכם בשפה שלכם.
ומילה על טעם טוב. כרטיס מדבר עובד הכי טוב עם מילים שהאדם בתמונה היה אומר בשמחה. שאלו את סבתא בטלפון מה היא רוצה להגיד, כתבו את זה בסגנון שלה, ותנו לתמונה שלה להגיד את זה. תשימו בפה של מישהו מילים שהוא לעולם לא היה משתמש בהן, והמשפחה תשים לב עוד לפני שהנרות כבו.
כרטיס מדבר מהתמונה של הדוד מישה ליום ההולדת ה-30 של בת הדודה שלי אניה: הוא עד המותניים בגינה, בז'קט החגיגי שלו, עם כוס מורמת. ברוסית הוא אומר לה שהוא מרים את הכוסית הזאת מאז שהיא הייתה בת שנה, וימשיך להרים אותה.
אמא, אבא, אח שלי ואני סביב השולחן הארוך בגינה, ליום הנישואין ה-40 של ההורים שלי. אחר כך אבא מדבר: הוא מרים כוס ומודה לאמא על ארבעים שנה של פנקייקים בשבת בבוקר.
ליום ההולדת ה-10 של הבן שלי אדם: כרטיס מדבר של סבא שלו ביציע באצטדיון, עם צעיף של הקבוצה, ידיים למעלה. בעברית סבא אומר לו שהוא יבוא למשחק בשבת עם התוף הכי רועש באצטדיון.
כרטיס מדבר נותן למישהו שאתם אוהבים להגיד את הברכה שלכם בקול - עד 15 שניות של דיבור, והשפתיים זזות בדיוק…
לפרטיםKlingKling היא משפחת מודלי AI של Kuaishou, ושלושה מהם עובדים אצלנו: Kling 3.0 Pro לווידאו, Kling O3 לתמונות ו-Kling AI…
לפרטיםElevenLabsEleven v3 הוא מודל ההקראה (טקסט לדיבור) של ElevenLabs. אצלנו הוא מקריא את הברכה שלכם באחד מ-8 הקולות שבקטלוג, בעברית,…
לפרטיםOmniHuman 1.5 הוא מודל בינה מלאכותית של ByteDance שהופך תמונה אחת והקלטת קול לסרטון שבו האדם מדבר, והפנים, הראש והגוף זזים לפי הצליל. ב-Wish Generator הוא איכות "הכי טוב" של הכרטיס המדבר: יוצרים כרטיס עם תמונה, עורכים את המשפט, בוחרים קול, ו-OmniHuman גורם לאדם שבכרטיס להגיד את הברכה שלכם.
OmniHuman 1.5 מזיז את האדם כולו, ו-Kling AI Avatar v2 מזיז את הפנים והראש. שניהם מקבלים את אותו כרטיס ואת אותו משפט מוקלט, ושניהם עוצרים ב-15 שניות של דיבור. שנייה ב-OmniHuman עולה יותר, והוא היחיד מהשניים שמאפשר ללחוץ על מי שמדבר בתמונה קבוצתית. לתקריב שקט בדרך כלל מספיק Kling AI Avatar v2, ולכוסית, לצילום רחב או לשולחן משפחתי כדאי לבחור "הכי טוב".
עד 15 שניות של דיבור, אותה תקרה כמו ב-Kling AI Avatar v2 - בערך האורך של הרמת כוסית קצרה. הפאנל מעריך את השניות תוך כדי הקלדה ולא מתחיל משפט שחורג מהמגבלה, כך שעל משפט ארוך מדי לא תחויבו אף פעם.
כן, עם OmniHuman 1.5. העבירו את האיכות ל"הכי טוב" ולחצו על הפנים של מי שצריך לדבר: הפנים האלה מסומנות בשביל המודל, והאדם הזה אומר את המשפט. אם לא לוחצים, המודל בוחר את הדובר בעצמו. לכרטיסים קבוצתיים זה המודל שצריך.
כן. OmniHuman לא קורא את המילים בעצמו: הוא מזיז את השפתיים לפי הקלטה, וההקלטה נעשית בשפה שבה כתבתם את המשפט. בחרו אחד מ-8 הקולות בקטלוג של ElevenLabs Eleven v3, או, במסלול בתשלום, את הקול שלכם. משפטים בעברית ובערבית כדאי לקצר מעט: ב-15 שניות נכנסות פחות אותיות.
כן. הוסיפו תמונה מהמכשיר, מ"הספרייה שלי" או מ"אנשים" - JPG, PNG או WebP עד 10MB. קודם הסוכן יוצר כרטיס עם תמונה שהאנשים שלכם נמצאים בו, ואז לוחצים על "לגרום להם לדבר". בכרטיס נכנסים עד 6 אנשים, והפנים יוצאות הכי אמינות כשיש 4 או פחות.
צרו את הכרטיס, לחצו על "לגרום להם לדבר", העבירו ל"הכי טוב" ושלחו ביום עצמו.
ליצור כרטיס מדבר