Meituan udostępnił w open source LongCat-Video-Avatar 1.5 i robi on dokładnie to, co stanowi rdzeń VisionStory — zamienia nieruchome zdjęcie oraz ścieżkę audio w wideo z gadającym awatarem. To wzbudziło naszą ciekawość na tyle, że faktycznie go uruchomiliśmy. To praktyczna analiza krok po kroku: czym jest, jak naprawdę wypada, pięć pułapek konfiguracji, na które wpadliśmy, oraz ile kosztuje uruchamianie go u siebie w porównaniu z narzędziem hostowanym. Źródło: github.com/meituan-longcat/LongCat-Video (MIT).
Czym jest LongCat-Video-Avatar i kto go stworzył?
LongCat-Video-Avatar 1.5 to model wideo człowieka sterowany dźwiękiem z otwartymi wagami od Meituan (zespół LongCat). Jest zbudowany na modelu bazowym LongCat-Video i wydany na liberalnej licencji MIT — realnie darmowej także do zastosowań komercyjnych. Na 2026-07 repozytorium kodu ma około 5 200 gwiazdek na GitHubie, a wagi 1.5 należą do bardziej lubianych ostatnich wydań na Hugging Face.
Obsługuje trzy natywne zadania: Audio + Text to Video (AT2V, bez obrazu referencyjnego), Audio + Text + Image to Video (ATI2V — zdjęcie referencyjne prowadzi tożsamość, czyli przypadek odpowiadający realnemu workflow awatara) oraz kontynuację wideo, aby wydłużyć klip poza pojedynczy segment. Wersja 1.5 podmieniła enkoder audio na Whisper-Large, który odpowiada za ruch ust. Co ważne, steruje ustami i mimiką na podstawie dowolnego audio, które mu podasz — nie generuje ani nie klonuje głosu.
Faktycznie go uruchomiliśmy (jedna A800-40GB)
Bez ściemy — uruchomiliśmy wszystkie trzy zadania na jednej karcie NVIDIA A800-SXM4-40GB (torch 2.8+cu128, sterownik 550), w konfiguracji modelu INT8-quantized + 8-step distill, bo tylko tak da się zmieścić model dyfuzji wideo tej wielkości na karcie 40 GB. Oto uczciwy zapis tego, co się działo.
Pięć pułapek, na które wpadliśmy
- Brakująca zależność do separacji wokalu. Pipeline audio wymaga modelu Kim_Vocal_2 przez
audio-separator, którego nie ma w domyślnych wymaganiach — pierwsze uruchomienie padło, dopóki nie zrobiliśmypip install audio-separator==0.30.2. - Wywalił się zapis wideo. Zapisywanie klatek kończyło się błędem
TiffWriter got an unexpected keyword argument fps, bo imageio nie potrafiło znaleźć writera ffmpeg — naprawione przezpip install imageio-ffmpeg==0.6.0. - Zakleszczenia multi-GPU. Uruchomienie jednego zadania na wielu kartach (context-parallel size 2 lub 8) zawieszało się na rozjechaniu kolektywów NCCL — oba ranki czekały na siebie, aż timeout 600 s przerwał run. Mogliśmy uruchamiać tylko na jednej karcie. Wagi INT8 faktycznie mieszczą się na jednej karcie 40 GB, więc multi-GPU miało sens tylko do odpalania wielu zadań równolegle, a nie do przyspieszania jednego.
- Brak pamięci na drugim segmencie. Długie klipy powstają przez kontynuowanie segmentu za segmentem, a krok kontynuacji trzymał w pamięci 48-warstwowy KV-cache. Na karcie 40 GB drugi segment dobił do limitu i się wysypał — zabrakło około 160 MiB. Musieliśmy ujawnić i włączyć flagę
--offload_kv_cache(przeniesienie cache do RAM-u CPU i stronicowanie z powrotem na każdy krok) oraz ustawićPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Działa, kosztem wolniejszych segmentów. - Wyrównanie rozdzielczości. 480p przy równoległości multi-card wywoływało ograniczenie „podzielne przez 64” dla wysokości i szerokości; tryb single-card tego unika.
Szybkość i pamięć (pomiary)
To liczba, która ma znaczenie: klip 82-sekundowy zajął 3 586 sekund — niecałą godzinę — na A800, czyli około 44 sekundy obliczeń na każdą 1 sekundę gotowego wideo (w przybliżeniu 138 s na wygenerowany segment, łącznie 26 segmentów). Krótki klip 10-sekundowy i tak trwałby około 7 minut. I to nie jest lekkie obciążenie: VRAM rósł do sufitu w kilka sekund, a potem trzymał się na 40 500 MiB — 98,9% karty 40 GB — przez cały render. Oto faktyczne użycie, które próbkowaliśmy raz na sekundę:
Próbki, które wyrenderowaliśmy
Każdy z poniższych klipów został przez nas wyrenderowany na opisanym wyżej A800. Aby przetestować model w docelowych scenariuszach, wykorzystaliśmy oficjalne wejścia demo projektu (portrety referencyjne i audio), zamiast dobierać własne — to więc szczere, nie „wybierane pod tezę” wyniki, a nie pokaz najlepszych ujęć. Dwa pierwsze klipy zostały wygenerowane na podstawie własnych zdjęć referencyjnych:
Po lewej: referencja dla klipu foto + audio. Po prawej: referencja dla klipu z wieloma mówcami (jedno zdjęcie, dwie osoby). Trzeci klip poniżej wykorzystuje tekst + audio bez zdjęcia referencyjnego — model wymyśla postać, i właśnie tu wypada najsłabiej.
Wyrenderowane przez VisionStory z LongCat-Video-Avatar 1.5 na NVIDIA A800, 2026-07-15, w rozdzielczości klasy 480p (768×512 / 832×480), z użyciem oficjalnych wejść demo modelu.
Uczciwy werdykt: świetny ze zdjęciem, słabszy bez niego
Co naprawdę zrobiło na nas wrażenie:
- Tożsamość się trzyma. W klipie sterowanym zdjęciem ta sama osoba pozostaje tą samą osobą przez całe 82 sekundy — włosy, strój, twarz — a usta podążają za audio. To przypadek kluczowy dla awatarów i tutaj działa.
- Multi-speaker naprawdę działa. Dwie osoby z jednej sceny, każda sterowana własną ścieżką audio, pozostały spójne — a to jest naprawdę trudne do zrobienia.
- MIT i „produkcyjna” jakość. Otwarte wagi, brak opłat za render i jakość, która przechodzi w krótkim klipie.
Gdzie się wywraca — i to są realne problemy:
- Generowanie tylko z tekstu „odpływa”. Bez zdjęcia referencyjnego model wymyśla osobę, a w długim klipie twarz zmienia się w niesamowitą, woskową zbliżkę i scena się przesuwa — widać to w trzeciej próbce powyżej.
- Jest wolny i ciężki. ~44 s obliczeń na 1 s wideo, z okupowaniem karty 40 GB przez cały czas. Klip 82-sekundowy to godzina.
- 40 GB to absolutne minimum. W naszym teście potrzebne były INT8 + distill, żeby w ogóle się zmieścić, a klipy wielosegmentowe przetrwały tylko dzięki offloadowi KV-cache na CPU. Mniejsze karty odpadają.
- W praktyce tylko jedna karta. Context-parallel na multi-GPU deadlockował na naszej maszynie, więc nie ma prostego sposobu, by przyspieszyć jeden klip, dokładając karty.
- Bez głosu. Steruje ustami na podstawie audio, które dostarczysz — nie robi tekst-na-mowę ani klonowania głosu, więc i tak potrzebujesz osobnego źródła głosu.
- 480p na tym sprzęcie. To, co byliśmy w stanie uruchomić na jednej karcie 40 GB, to wyjście klasy 480p.
Self-host LongCat vs narzędzie hostowane: co wybrać?
Oba robią to samo — zdjęcie plus audio staje się gadającym wideo. Różnica sprowadza się wyłącznie do tego, ile Cię kosztuje dotarcie do tego efektu. Narzędzie hostowane, takie jak VisionStory, uruchamia model za Ciebie; oto uczciwy kompromis.
| LongCat (self-host) | VisionStory (hostowane) | |
|---|---|---|
| Sprzęt | A100/A800 40 GB (tysiące dolarów) | Żaden — działa w przeglądarce |
| Konfiguracja | CUDA, flash-attn, INT8, poprawki zależności, strojenie OOM | Zaloguj się i działaj |
| Czas na klip | ~44 s obliczeń na 1 s wideo (klip 82 s ≈ 1 godz.) | Sekundy, na hostowanych GPU |
| Rozdzielczość (nasz test) | Klasa 480p | Wideo HD i wyżej |
| Głos | Ty dostarczasz audio (brak TTS/klonowania) | Wbudowane głosy i klonowanie głosu |
| Użycie komercyjne | Tak (MIT) | Tak (zależnie od planu) |
| Utrzymanie | Ty łatysz zależności, OOM, sterowniki | Brak |
| Najlepsze, gdy | Masz GPU i potrzebujesz self-host/offline/on-prem | Chcesz gotowe gadające wideo szybko |
Wybierz LongCat, jeśli masz sprzęt i praca naprawdę musi być self-hostowana — on-prem, offline albo w 100% pod Twoją kontrolą — oraz czujesz się pewnie w utrzymaniu stosu CUDA. Wybierz narzędzie hostowane, jeśli chcesz to samo gadające wideo ze zdjęcia i audio, ale bez godziny obliczeń i GPU za pięć cyfr.
Czego nauczył nas LongCat
Prawdziwa lekcja z uruchomienia LongCat-Video-Avatar jest taka, że jakość otwartych modeli wideo awatarów już nadeszła — ze zdjęciem referencyjnym ten darmowy model tworzy klipy wystarczająco dobre do realnego użycia. Model przestał być najtrudniejszą częścią.
Najtrudniejsze jest wszystko dookoła: zmieszczenie modelu dyfuzji wideo na karcie, na którą Cię stać, przetrwanie OOM na drugim segmencie, czekanie godziny na 82 sekundy i sparowanie tego z głosem. Ta luka — między mocnym checkpointem a gotowym gadającym wideo, które każdy może zrobić — to dokładnie to, co robimy. Jeśli chcesz zobaczyć tę „drugą stronę”, VisionStory zamienia zdjęcie i scenariusz w zsynchronizowanego z ruchem ust talking avatar w Twojej przeglądarce w kilka sekund, a jeśli potrzebujesz też głosu, nasza analiza open-source TTS pokazuje, gdzie dziś jest ta druga połowa.
