Ελληνικά

Η Meituan έκανε open-source το LongCat-Video-Avatar 1.5, και κάνει ακριβώς αυτό που κάνει το VisionStory στον πυρήνα του — μετατρέπει μια στατική φωτογραφία και ένα κομμάτι ήχου σε βίντεο talking-avatar. Αυτό μας έκανε αρκετά περίεργους ώστε να το τρέξουμε στην πράξη. Αυτή είναι μια hands-on αποδόμηση: τι είναι, πόσο καλά αποδίδει στην πραγματικότητα, οι πέντε παγίδες εγκατάστασης που συναντήσαμε, και τι κοστίζει να το τρέξετε μόνοι σας σε σύγκριση με ένα hosted εργαλείο. Πηγή: github.com/meituan-longcat/LongCat-Video (MIT).

Τι είναι το LongCat-Video-Avatar και ποιος το έφτιαξε;

Το LongCat-Video-Avatar 1.5 είναι ένα μοντέλο human video με καθοδήγηση από ήχο με ανοιχτά βάρη, από τη Meituan (την ομάδα LongCat). Είναι χτισμένο πάνω στο foundation model LongCat-Video και κυκλοφορεί με την επιτρεπτική άδεια MIT — πραγματικά δωρεάν για εμπορική χρήση. Από τον 2026-07, το repo του κώδικα έχει περίπου 5 200 stars στο GitHub και τα βάρη της 1.5 είναι ανάμεσα στις πιο δημοφιλείς πρόσφατες κυκλοφορίες στο Hugging Face.

Υποστηρίζει τρεις εγγενείς εργασίες: Audio + Text to Video (AT2V, χωρίς εικόνα αναφοράς), Audio + Text + Image to Video (ATI2V — μια φωτογραφία αναφοράς καθοδηγεί την ταυτότητα, η περίπτωση που ταιριάζει σε πραγματική ροή εργασίας avatar), και video continuation για να επεκτείνετε ένα κλιπ πέρα από ένα μόνο τμήμα. Η έκδοση 1.5 αντικατέστησε τον audio encoder με Whisper-Large, που είναι αυτό που δίνει την κίνηση στα χείλη. Σημαντικό: οδηγεί τα χείλη και την έκφραση από όποιον ήχο του δώσετε — δεν δημιουργεί ούτε κλωνοποιεί Φωνή.

Το τρέξαμε όντως (μία A800-40GB)

Χωρίς υπεκφυγές — τρέξαμε και τις τρεις εργασίες σε μία μόνο NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), στη ρύθμιση του μοντέλου INT8-quantized + distill 8 βημάτων, που είναι ό,τι χρειάζεται για να χωρέσει ένα video-diffusion μοντέλο αυτού του μεγέθους σε κάρτα 40 GB. Ακολουθεί το ειλικρινές χρονικό, βήμα-βήμα.

Οι πέντε παγίδες που συναντήσαμε

  • Λείπει εξάρτηση για διαχωρισμό φωνητικών. Η αλυσίδα ήχου χρειάζεται ένα μοντέλο Kim_Vocal_2 μέσω του audio-separator, το οποίο δεν είναι στα προεπιλεγμένα requirements — το πρώτο run «πέθανε» μέχρι να κάνουμε pip install audio-separator==0.30.2.
  • Ο video writer κατέρρευσε. Η αποθήκευση frames απέτυχε με σφάλμα TiffWriter got an unexpected keyword argument fps επειδή το imageio δεν έβρισκε ffmpeg writer — λύθηκε με pip install imageio-ffmpeg==0.6.0.
  • Αδιέξοδα σε multi-GPU. Τρέχοντας μία εργασία σε πολλαπλές κάρτες (context-parallel size 2 ή 8) «κόλλησε» σε NCCL collective desync — και τα δύο ranks περίμεναν το ένα το άλλο μέχρι που timeout 600s διέκοψε το run. Μπορούσαμε να τρέξουμε μόνο σε μία κάρτα. Τα INT8 βάρη χωρούν σε μία κάρτα 40 GB, οπότε το multi-GPU ήταν χρήσιμο μόνο για να τρέχουμε διαφορετικές εργασίες παράλληλα, όχι για να επιταχύνουμε μία εργασία.
  • Out-of-memory στο δεύτερο segment. Τα μεγάλα κλιπ χτίζονται συνεχίζοντας segment μετά από segment, και το βήμα συνέχειας κρατούσε resident ένα KV-cache 48 στρώσεων. Σε κάρτα 40 GB, το δεύτερο segment τερμάτισε την κάρτα και κράσαρε — έλειπαν περίπου 160 MiB για να χωρέσει. Χρειάστηκε να εκθέσουμε και να ενεργοποιήσουμε μια σημαία --offload_kv_cache (μεταφορά του cache στη RAM της CPU και επαναφόρτωση ανά βήμα) και να ορίσουμε PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Δουλεύει, με κόστος πιο αργά segments.
  • Ευθυγράμμιση ανάλυσης. Τα 480p με παραλληλισμό multi-card «χτύπησαν» περιορισμό διαιρετότητας-με-64 σε ύψος και πλάτος· η λειτουργία σε μία κάρτα το αποφεύγει.

Ταχύτητα και μνήμη (μετρημένα)

Αυτός είναι ο αριθμός που μετρά: ένα κλιπ 82 δευτερολέπτων πήρε 3 586 δευτερόλεπτα — λίγο κάτω από μία ώρα — στην A800, δηλαδή περίπου 44 δευτερόλεπτα υπολογισμού για κάθε 1 δευτερόλεπτο τελικού βίντεο (περίπου 138s ανά παραγόμενο segment σε 26 segments). Ένα σύντομο κλιπ 10 δευτερολέπτων θα ήταν πάλι γύρω στα 7 λεπτά. Και δεν είναι ελαφρύ φορτίο: η VRAM ανέβηκε μέσα σε δευτερόλεπτα και μετά καρφώθηκε στα 40 500 MiB — 98.9% της κάρτας 40 GB — για όλο το render. Παρακάτω είναι η πραγματική χρήση που δειγματοληπτήσαμε μία φορά ανά δευτερόλεπτο:

Χρήση VRAM σε render 82 δευτερολέπτων του LongCat-Video-Avatar, καρφωμένη κοντά στο όριο των 40 GB για όλη την ώρα

Δείγματα που κάναμε render

Κάθε απόσπασμα παρακάτω αποδόθηκε από εμάς στο A800 που περιγράφεται παραπάνω. Για να αξιολογήσουμε το μοντέλο στα σενάρια για τα οποία προορίζεται, τα «οδηγήσαμε» με τα επίσημα demo inputs του ίδιου του project (πορτραίτα αναφοράς και ήχο), αντί να επιμεληθούμε δικά μας — άρα πρόκειται για ειλικρινή, μη «κερασμένα» αποτελέσματα, όχι για ένα βίντεο με τα καλύτερα στιγμιότυπα. Τα δύο πρώτα clips τροφοδοτήθηκαν το καθένα με τη δική του φωτογραφία αναφοράς:

Οι δύο φωτογραφίες αναφοράς: ένας/μία σόλο τραγουδιστής/τραγουδίστρια για το clip με φωτογραφία+ήχο και μια σκηνή στούντιο με δύο άτομα για το clip με πολλούς ομιλητές

Αριστερά: η αναφορά για το clip με φωτογραφία + ήχο. Δεξιά: η αναφορά για το clip με πολλούς ομιλητές (μία εικόνα, δύο άτομα). Το τρίτο clip παρακάτω χρησιμοποίησε κείμενο + ήχο χωρίς φωτογραφία αναφοράς — το μοντέλο «εφευρίσκει» το άτομο, και εκεί είναι που υστερεί περισσότερο.

Φωτογραφία + ήχος (ATI2V) — η ροή εργασίας avatar. Η ταυτότητα κρατάει, το στόμα ακολουθεί το τραγούδι.
Multi-speaker — δύο άτομα, δύο κομμάτια ήχου, με κάθε στόμα να οδηγείται ανεξάρτητα.
Μόνο κείμενο + ήχος, χωρίς φωτογραφία αναφοράς (AT2V) — η αδύναμη περίπτωση: δείτε πώς το πρόσωπο παραμορφώνεται και «φεύγει».

Έγινε render από το VisionStory με το LongCat-Video-Avatar 1.5 σε NVIDIA A800, στις 2026-07-15, σε ανάλυση κατηγορίας 480p (768×512 / 832×480), χρησιμοποιώντας τα επίσημα demo inputs του μοντέλου.

Ειλικρινής ετυμηγορία: δυνατό με φωτογραφία, τραχύ χωρίς

Τι μας εντυπωσίασε πραγματικά:

  • Η ταυτότητα κρατάει. Στο κλιπ που καθοδηγείται από φωτογραφία, το άτομο παραμένει το ίδιο σε όλη τη διάρκεια των 82 δευτερολέπτων — μαλλιά, ρούχα, πρόσωπο — ενώ το στόμα ακολουθεί τον ήχο. Αυτή είναι η περίπτωση που έχει σημασία για avatars, και λειτουργεί.
  • Το multi-speaker όντως δουλεύει. Δύο άτομα από μία σκηνή, με τα χείλη του καθενός να οδηγούνται από το δικό του κομμάτι ήχου, έμειναν συνεκτικά — κάτι πραγματικά δύσκολο να πετύχει.
  • MIT και εμπορικού επιπέδου. Ανοιχτά βάρη, χωρίς χρέωση ανά render, και ποιότητα εξόδου που «περνάει» σε ένα σύντομο κλιπ.

Πού «σπάει» — και αυτά είναι αληθινά:

  • Η παραγωγή μόνο-με-κείμενο παρεκκλίνει. Χωρίς φωτογραφία αναφοράς, το μοντέλο επινοεί το άτομο, και σε μεγάλο κλιπ το πρόσωπο παραμορφώνεται σε ένα αλλόκοτο, κηρώδες κοντινό και η σκηνή αλλάζει — φαίνεται στο τρίτο δείγμα παραπάνω.
  • Είναι αργό και βαρύ. ~44s υπολογισμού ανά 1s βίντεο, με μια κάρτα 40 GB «καρφωμένη» όλη την ώρα. Ένα κλιπ 82 δευτερολέπτων είναι μία ώρα.
  • Τα 40 GB είναι το ελάχιστο. Το run μας χρειάστηκε INT8 + distill μόνο και μόνο για να χωρέσει, και τα κλιπ πολλαπλών segments επιβίωσαν μόνο με offload του KV-cache στη CPU. Μικρότερες κάρτες αποκλείονται.
  • Στην πράξη, μόνο μία κάρτα. Το context-parallel σε multi-GPU έκανε deadlock στο μηχάνημά μας, οπότε δεν υπάρχει εύκολος τρόπος να γίνει ένα κλιπ πιο γρήγορα προσθέτοντας κάρτες.
  • Χωρίς Φωνή. Οδηγεί τα χείλη από ήχο που δίνετε εσείς — δεν κάνει μετατροπή κειμένου σε ομιλία ούτε κλωνοποίηση φωνής, άρα χρειάζεστε ξεχωριστή πηγή φωνής.
  • 480p, με αυτό το hardware. Αυτό που μπορέσαμε να τρέξουμε σε μία κάρτα 40 GB ήταν έξοδος κατηγορίας 480p.

Self-host LongCat vs ένα hosted εργαλείο: τι να διαλέξετε;

Και τα δύο παράγουν το ίδιο πράγμα — μια φωτογραφία και ήχος γίνονται ένα talking βίντεο. Η διαφορά είναι αποκλειστικά στο τι σας κοστίζει για να φτάσετε εκεί. Ένα hosted εργαλείο όπως το VisionStory τρέχει το μοντέλο για εσάς· ορίστε το ειλικρινές trade-off.

 LongCat (self-host)VisionStory (hosted)
HardwareΜια A100/A800 40 GB (χιλιάδες δολάρια)Κανένα — τρέχει στο πρόγραμμα περιήγησης
SetupCUDA, flash-attn, INT8, διορθώσεις deps, ρυθμίσεις OOMΣυνδεθείτε και ξεκινήστε
Χρόνος ανά κλιπ~44s compute ανά 1s βίντεο (κλιπ 82s ≈ 1 ώρα)Δευτερόλεπτα, σε hosted GPUs
Ανάλυση (το run μας)Κατηγορίας 480pHD Βίντεο και πάνω
ΦωνήΔίνετε εσείς τον ήχο (χωρίς TTS/clone)Ενσωματωμένες Φωνές και κλωνοποίηση φωνής
Εμπορική χρήσηΝαι (MIT)Ναι (ανά πλάνο)
ΣυντήρησηΕσείς κάνετε patch deps, OOM, driversΚαμία
Ιδανικό ότανΈχετε GPUs και χρειάζεστε self-hosted/offline/on-premΘέλετε ένα ολοκληρωμένο talking βίντεο, γρήγορα

Επιλέξτε LongCat αν έχετε το hardware και η δουλειά πρέπει πραγματικά να είναι self-hosted — on-prem, offline ή πλήρως υπό τον έλεγχό σας — και νιώθετε άνετα να συντηρείτε ένα CUDA stack. Επιλέξτε ένα hosted εργαλείο αν θέλετε το ίδιο talking βίντεο φωτογραφία-συν-ήχος χωρίς μία ώρα compute και μια GPU αξίας πέντε ψηφίων.

Τι μας δίδαξε το LongCat

Το πραγματικό μάθημα από το τρέξιμο του LongCat-Video-Avatar είναι ότι η ποιότητα των open avatar-video έχει φτάσει — με μια φωτογραφία αναφοράς, αυτό το δωρεάν μοντέλο βγάζει κλιπ αρκετά καλά για πραγματική χρήση. Το μοντέλο δεν είναι πια το δύσκολο μέρος.

Το δύσκολο μέρος είναι ό,τι το περιβάλλει: να χωρέσεις ένα video-diffusion μοντέλο σε κάρτα που μπορείς να πληρώσεις, να επιβιώσεις από OOM στο δεύτερο segment, να περιμένεις μία ώρα για 82 δευτερόλεπτα, και να το συνδυάσεις με Φωνή. Αυτό το κενό — ανάμεσα σε ένα ικανό checkpoint και σε ένα ολοκληρωμένο talking βίντεο που μπορεί να φτιάξει ο καθένας — είναι ακριβώς η δουλειά που κάνουμε. Αν θέλετε να δείτε την άλλη πλευρά, το VisionStory μετατρέπει μια φωτογραφία και ένα σενάριο σε lip-synced talking avatar στο πρόγραμμα περιήγησής σας μέσα σε δευτερόλεπτα, και αν χρειάζεστε και τη Φωνή, η αποδόμησή μας για open-source TTS καλύπτει το πού βρίσκεται σήμερα αυτό το μισό.

Συχνές ερωτήσεις

  • Ναι. Το LongCat-Video-Avatar 1.5 κυκλοφορεί με άδεια MIT, η οποία επιτρέπει την εμπορική χρήση, και δεν υπάρχει χρέωση ανά απόδοση (render). Πληρώνετε μόνο για τους υπολογιστικούς πόρους GPU που καταναλώνει.