Meituan פתחה בקוד פתוח את LongCat-Video-Avatar 1.5, והוא עושה בדיוק את מה ש-VisionStory עושה בליבה — להפוך תמונה סטטית בתוספת רצועת אודיו לסרטון אווטאר מדבר. זה סקרן אותנו מספיק כדי להריץ אותו באמת. זהו פירוק מעשי: מה זה, עד כמה זה באמת עובד, חמש מלכודות התקנה שנתקלנו בהן, ומה עולה להריץ לבד לעומת כלי מתארח. מקור: github.com/meituan-longcat/LongCat-Video (MIT).
מה זה LongCat-Video-Avatar, ומי יצר אותו?
LongCat-Video-Avatar 1.5 הוא מודל וידאו אנושי מונע-אודיו עם משקלים פתוחים מאת Meituan (צוות LongCat). הוא בנוי על מודל היסוד LongCat-Video ושוחרר תחת רישיון MIT המתירני — בחינם באמת לשימוש מסחרי. נכון ל-2026-07 לריפו הקוד יש בערך 5,200 כוכבי GitHub, ומשקלי 1.5 הם בין ההשקות האחרונות היותר-אהובות ב-Hugging Face.
הוא תומך בשלוש משימות מובנות: Audio + Text to Video (AT2V, בלי תמונת רפרנס), Audio + Text + Image to Video (ATI2V — תמונת רפרנס קובעת את הזהות, המקרה שמתאים לזרימת עבודה אמיתית של אווטאר), ו-המשך וידאו כדי להאריך קליפ מעבר למקטע יחיד. גרסה 1.5 החליפה למקודד אודיו Whisper-Large, וזה מה שמייצר את תנועת השפתיים. חשוב: היא מניעה שפתיים והבעות מכל אודיו שתתנו לה — היא לא מייצרת ולא משכפלת קול.
הרצנו אותו באמת (A800-40GB יחיד)
בלי קשקושים — הרצנו את כל שלוש המשימות על NVIDIA A800-SXM4-40GB יחיד (torch 2.8+cu128, דרייבר 550), בתצורה של המודל קוונטיזציה ל-INT8 + דיסטיל של 8 צעדים, שזה מה שנדרש כדי להכניס מודל וידאו-דיפיוז'ן בגודל כזה לכרטיס של 40 GB. הנה התיאור הכנה, צעד-אחר-צעד.
חמש המלכודות שנתקלנו בהן
- תלות חסרה להפרדת שירה. צינור האודיו צריך מודל Kim_Vocal_2 דרך
audio-separator, שלא נמצא בדרישות ברירת המחדל — ההרצה הראשונה נפלה עדpip install audio-separator==0.30.2. - כותב הווידאו התפוצץ. שמירת פריימים נכשלה עם השגיאה
TiffWriter got an unexpected keyword argument fpsכי imageio לא מצא כותב ffmpeg — נפתר עםpip install imageio-ffmpeg==0.6.0. - דדלוקים ב-Multi-GPU. הרצת משימה אחת על כמה כרטיסים (context-parallel size 2 או 8) נתקעה על desync בקולקטיב של NCCL — שני ה-ranks חיכו אחד לשני עד שטיימאאוט של 600s ביטל את ההרצה. הצלחנו להריץ רק כרטיס יחיד. משקלי INT8 כן נכנסים בכרטיס אחד של 40 GB, כך ש-Multi-GPU היה שימושי בעיקר להרצת משימות נפרדות במקביל, לא להאצת משימה אחת.
- Out-of-memory במקטע השני. קליפים ארוכים נבנים ע"י המשך מקטע אחרי מקטע, ושלב ההמשך השאיר KV-cache של 48 שכבות בזיכרון. בכרטיס של 40 GB המקטע השני הגיע לשיא וקרס — חסרו בערך 160 MiB כדי להיכנס. היינו צריכים לחשוף ולהפעיל דגל
--offload_kv_cache(להעביר את המטמון ל-RAM של ה-CPU ולהחזיר אותו בכל צעד) וגם להגדירPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. זה עובד, במחיר של מקטעים איטיים יותר. - יישור רזולוציה. 480p תחת מקביליות רב-כרטיסית נפל על אילוץ “מתחלק ב-64” לגובה ולרוחב; כרטיס יחיד נמנע מזה.
מהירות וזיכרון (מדוד)
זה המספר שחשוב: קליפ של 82 שניות לקח 3,586 שניות — קצת פחות משעה — על ה-A800, או בערך 44 שניות חישוב לכל 1 שנייה של וידאו גמור (בערך 138s לכל מקטע שנוצר, לאורך 26 מקטעים). קליפ קצר של 10 שניות עדיין יהיה בערך 7 דקות. וזה לא עומס קל: ה-VRAM עלה תוך שניות ואז ננעל על 40,500 MiB — 98.9% מכרטיס ה-40 GB — לכל אורך הרינדור. הנה השימוש בפועל שדגמנו פעם בשנייה:
דוגמאות שרינדרנו
כל קליפ למטה עובד אצלנו על גבי ה-A800 שתואר למעלה. כדי לבחון את המודל בתרחישים שלשמם הוא נועד, השתמשנו בקלטי הדמו הרשמיים של הפרויקט עצמו (דיוקנאות ייחוס ואודיו) במקום לאצור משלנו — כך שמדובר בתוצרים כנים, לא מסוננים ולא “נבחרים בקפידה”, ולא בסרטון הדגמה נוצץ. שני הקליפים הראשונים הונעו כל אחד מתמונת ייחוס משלו:
משמאל: תמונת הייחוס לקליפ תמונה + אודיו. מימין: תמונת הייחוס לקליפ מרובה דוברים (תמונה אחת, שני אנשים). הקליפ השלישי למטה הונע באמצעות טקסט + אודיו ללא תמונת ייחוס — המודל ממציא את האדם, ושם הוא הכי חלש.
רונדר ע"י VisionStory עם LongCat-Video-Avatar 1.5 על NVIDIA A800, בתאריך 2026-07-15, ברזולוציית 480p-קלאס (768×512 / 832×480), תוך שימוש בקלטי הדמו הרשמיים של המודל.
פסק דין כנה: חזק עם תמונה, מחוספס בלי אחת
מה שבאמת הרשים אותנו:
- הזהות נשמרת. בקליפ שמונע מתמונה, האדם נשאר אותו אדם לאורך כל 82 השניות — שיער, לבוש, פנים — בזמן שהפה עוקב אחרי האודיו. זה המקרה שחשוב לאווטארים, וזה עובד.
- מרובה-דוברים באמת עובד. שני אנשים מסצנה אחת, כשכל אחד מונע-שפתיים לפי רצועת האודיו שלו, נשארו קוהרנטיים — דבר שקשה באמת לעשות נכון.
- MIT וברמה מסחרית. משקלים פתוחים, בלי חיוב לכל רינדור, ואיכות פלט שיכולה לעבור בקליפ קצר.
איפה זה נופל — ואלה דברים אמיתיים:
- יצירה “טקסט-בלבד” נסחפת. בלי תמונת רפרנס המודל ממציא את האדם, ובקליפ ארוך הפנים מתעוותות לתקריב מוזר, שעוותי, והסצנה זזה — רואים את זה בדוגמה השלישית למעלה.
- זה איטי וכבד. ~44 שניות חישוב לכל 1 שנייה של וידאו, כשהוא “נועל” כרטיס של 40 GB לכל הזמן. קליפ של 82 שניות הוא שעה.
- 40 GB זה המינימום. ההרצה שלנו דרשה INT8 + דיסטיל רק כדי להיכנס, וקליפים מרובי-מקטעים שרדו רק ע"י offload של ה-KV-cache ל-CPU. כרטיסים קטנים יותר לא באים בחשבון.
- בפועל — כרטיס יחיד בלבד. context-parallel בריבוי GPU נתקע אצלנו, כך שאין דרך קלה להפוך קליפ אחד למהיר יותר ע"י הוספת כרטיסים.
- אין קול. הוא מניע שפתיים מהאודיו שאתם מספקים — הוא לא עושה טקסט לדיבור ולא שיבוט קול, כך שאתם עדיין צריכים מקור קול נפרד.
- 480p, על החומרה הזו. מה שהצלחנו להריץ על כרטיס יחיד של 40 GB היה פלט ברמה של 480p.
אירוח עצמי של LongCat מול כלי מתארח: מה לבחור?
שניהם מייצרים את אותו הדבר — תמונה בתוספת אודיו הופכת לסרטון מדבר. ההבדל הוא כולו במה שזה עולה לכם כדי להגיע לשם. כלי מתארח כמו VisionStory מריץ את המודל עבורכם; הנה הטרייד-אוף הכנה.
| LongCat (אירוח עצמי) | VisionStory (מתארח) | |
|---|---|---|
| חומרה | A100/A800 של 40 GB (אלפי דולרים) | אין — רץ בדפדפן |
| התקנה | CUDA, flash-attn, INT8, תיקוני תלויות, כיוונון OOM | התחברו והתחילו |
| זמן לקליפ | ~44s חישוב לכל 1s של וידאו (קליפ 82s ≈ שעה) | שניות, על GPUs מתארחים |
| רזולוציה (בהרצה שלנו) | 480p-קלאס | וידאו באיכות HD ומעלה |
| קול | אתם מספקים את האודיו (בלי TTS/שיבוט) | קולות מובנים ושיבוט קול |
| שימוש מסחרי | כן (MIT) | כן (לפי תוכנית) |
| תחזוקה | אתם מתקנים תלויות, OOM, דרייברים | אין |
| הכי מתאים כש | יש לכם GPUs ואתם צריכים אירוח עצמי/אופליין/on-prem | אתם רוצים סרטון מדבר מוכן, מהר |
בחרו ב-LongCat אם יש לכם את החומרה והעבודה באמת חייבת להיות באירוח עצמי — on-prem, אופליין, או לגמרי בשליטתכם — ואתם מרגישים בנוח לתחזק סטאק CUDA. בחרו בכלי מתארח אם אתם רוצים את אותו וידאו מדבר של תמונה+אודיו בלי שעה של חישוב ובלי GPU במחיר של חמש ספרות.
מה LongCat לימד אותנו
השיעור האמיתי מהרצת LongCat-Video-Avatar הוא ש-איכות וידאו-אווטאר פתוחה כבר כאן — עם תמונת רפרנס, המודל החינמי הזה מייצר קליפים טובים מספיק לשימוש אמיתי. המודל כבר לא החלק הקשה.
החלק הקשה הוא כל מה שמסביב: להכניס מודל וידאו-דיפיוז'ן לכרטיס שאתם יכולים להרשות לעצמכם, לשרוד OOM במקטע השני, לחכות שעה בשביל 82 שניות, ולחבר לו קול. הפער הזה — בין checkpoint מסוגל לבין וידאו מדבר גמור שכל אחד יכול ליצור — הוא בדיוק העבודה שאנחנו עושים. אם אתם רוצים לראות את הצד השני של זה, VisionStory הופך תמונה ותסריט ל-אווטאר מדבר מסונכרן-שפתיים בדפדפן תוך שניות, ואם אתם צריכים גם את הקול, הפירוק שלנו של open-source TTS מכסה איפה החצי הזה עומד היום.
