Meituan, LongCat-Video-Avatar 1.5’i open-source yaptı ve özünde VisionStory’nin yaptığı şeyin aynısını yapıyor — durağan bir fotoğraf + bir ses parçasını alıp konuşan avatar videosuna dönüştürüyor. Bu da bizi gerçekten çalıştıracak kadar meraklandırdı. Bu yazı uygulamalı bir teardown: nedir, gerçekte ne kadar iyi performans veriyor, takıldığımız 5 kurulum tuzağı ve kendiniz çalıştırmanın maliyeti ile barındırılan bir araç arasındaki fark. Kaynak: github.com/meituan-longcat/LongCat-Video (MIT).
LongCat-Video-Avatar nedir, kim yaptı?
LongCat-Video-Avatar 1.5, Meituan’dan (LongCat ekibi) gelen, açık ağırlıklı bir sesle yönlendirilen insan videosu modelidir. LongCat-Video temel modeli üzerine kuruludur ve esnek MIT lisansı altında yayınlanmıştır — ticari kullanım için gerçekten ücretsiz. 2026-07 itibarıyla kod deposu yaklaşık 5.200 GitHub yıldızına sahip ve 1.5 ağırlıkları Hugging Face’te yakın dönemin en beğenilen yayınları arasında.
Üç yerleşik görevi destekler: Ses + Metinden Videoya (AT2V, referans görsel yok), Ses + Metin + Görselden Videoya (ATI2V — kimliği bir referans fotoğraf belirler; gerçek bir avatar iş akışına uyan senaryo), ve tek bir segmentin ötesine geçmek için video devam ettirme. 1.5 sürümü, dudak hareketini sağlayan Whisper-Large ses kodlayıcısına geçti. Önemli nokta: verdiğiniz herhangi bir sesten dudakları ve ifadeyi sürüyor — ses üretmiyor veya ses klonlamıyor.
Gerçekten çalıştırdık (tek A800-40GB)
Yuvarlak konuşma yok — üç görevin de hepsini tek bir NVIDIA A800-SXM4-40GB üzerinde (torch 2.8+cu128, driver 550) çalıştırdık; modelin INT8-kuantize + 8-adımlı distill yapılandırmasıyla. Bu boyuttaki bir video-diffusion modelini 40 GB karta sığdırmanın yolu bu. İşte dürüst, adım adım yaşadıklarımız.
Takıldığımız beş tuzak
- Eksik vokal-ayırma bağımlılığı. Ses hattı,
audio-separatorüzerinden bir Kim_Vocal_2 modeline ihtiyaç duyuyor; varsayılan gereksinimlerde yok — ilk çalıştırmapip install audio-separator==0.30.2yapana kadar patladı. - Video yazıcı çöktü. Kareleri kaydetme, imageio bir ffmpeg writer bulamadığı için
TiffWriter got an unexpected keyword argument fpshatasıyla başarısız oldu —pip install imageio-ffmpeg==0.6.0ile düzeldi. - Çoklu GPU kilitlenmeleri. Bir işi birden fazla kartta çalıştırmak (context-parallel boyutu 2 veya 8) NCCL collective desync yüzünden takılı kaldı — iki rank de birbirini bekledi, 600s zaman aşımı koşuyu iptal edene kadar. Sadece tek kart çalıştırabildik. INT8 ağırlıkları zaten tek 40 GB karta sığıyor; bu yüzden çoklu GPU, tek işi hızlandırmak için değil, ayrı işleri paralel koşturmak için anlamlıydı.
- İkinci segmentte bellek taşması (OOM). Uzun klipler segment segment devam ettirilerek oluşturuluyor ve devam ettirme adımı 48 katmanlı bir KV-cache’i bellekte tutuyordu. 40 GB kartta ikinci segment kartı tepeye vurdu ve çöktü — sığmasına yaklaşık 160 MiB kalmıştı.
--offload_kv_cachebayrağını (cache’i CPU RAM’e taşıyıp her adımda geri sayfalama) açığa çıkarıp etkinleştirmek ve ayrıcaPYTORCH_CUDA_ALLOC_CONF=expandable_segments:Trueayarlamak zorunda kaldık. Çalışıyor, ama segmentler daha yavaşlıyor. - Çözünürlük hizalaması. Çoklu kart paralelliğinde 480p, yükseklik ve genişlik için 64’e bölünebilirlik kısıtına takıldı; tek kart bunu atlatıyor.
Hız ve bellek (ölçümlü)
Önemli olan sayı şu: 82 saniyelik bir klip A800 üzerinde 3.586 saniye — bir saatten biraz az sürdü; yani bitmiş videonun her 1 saniyesi için yaklaşık 44 saniye hesaplama (26 segment boyunca segment başına yaklaşık 138s). Kısa bir 10 saniyelik klip bile yine yaklaşık 7 dakika olurdu. Üstelik hafif bir yük değil: VRAM saniyeler içinde yükseldi ve sonra tüm render boyunca 40.500 MiB’de — 40 GB kartın %98,9’unda — sabitlendi. İşte saniyede bir örneklediğimiz gerçek kullanım:
Render ettiğimiz örnekler
Aşağıdaki her klip, yukarıda açıklanan A800 üzerinde tarafımızdan render edildi. Modeli hedeflenen kullanım senaryolarında kıyaslamak için, kendi içeriklerimizi seçip düzenlemek yerine projenin resmi demo girdilerini (referans portreler ve ses) kullandık — yani bunlar özenle seçilip parlatılmış bir “en iyi anlar” derlemesi değil, dürüst ve seçkisiz çıktılar. İlk iki klibin her biri kendi referans fotoğrafıyla üretildi:
Sol: fotoğraf + ses klibi için referans. Sağ: çok konuşmacılı klip için referans (tek görsel, iki kişi). Aşağıdaki üçüncü klipte referans fotoğraf olmadan metin + ses kullanıldı — model kişiyi kendisi uyduruyor ve en zayıf kaldığı yer de burası.
VisionStory tarafından, NVIDIA A800 üzerinde LongCat-Video-Avatar 1.5 ile 2026-07-15 tarihinde, 480p sınıfı çözünürlükte (768×512 / 832×480), modelin resmi demo girdileri kullanılarak render edilmiştir.
Dürüst karar: fotoğrafla güçlü, fotoğrafsız zorlu
Bizi gerçekten etkileyenler:
- Kimlik tutarlı. Fotoğrafla sürülen klipte, 82 saniyenin tamamında kişi aynı kişi kalıyor — saç, kıyafet, yüz — ve ağız sesi takip ediyor. Avatarlar için kritik olan senaryo bu; ve çalışıyor.
- Çok konuşmacılı gerçekten çalışıyor. Tek bir sahnedeki iki kişi, her biri kendi ses parçasıyla dudak senkronlu, tutarlı kaldı — bunu doğru yapmak gerçekten zor.
- MIT ve ticari seviyede. Açık ağırlıklar, render başına ücret yok; kısa klipte “olur” denecek kalite.
Tökezlediği yerler — ve bunlar gerçek:
- Sadece metinle üretim kayıyor. Referans fotoğraf olmayınca model kişiyi uyduruyor; uzun klipte yüz tekinsiz, mumsu bir yakın plana doğru bükülüyor ve sahne kayıyor — yukarıdaki üçüncü örnekte görülebilir.
- Yavaş ve ağır. Videonun 1 saniyesi için ~44s hesaplama; tüm süre boyunca 40 GB kartı sonuna kadar dolduruyor. 82 saniyelik klip bir saat.
- 40 GB alt sınır. Bizim koşuda sığması için INT8 + distill şarttı; çok segmentli klipler de ancak KV-cache’i CPU’ya offload ederek hayatta kaldı. Daha küçük kartlar olmaz.
- Pratikte tek kart. Bizde çoklu GPU context-parallel kilitlendi; yani kart ekleyerek tek klibi kolayca hızlandırmanın bir yolu yok.
- Ses yok. Dudakları sizin verdiğiniz sesten sürüyor — metinden konuşmaya ya da ses klonlama yapmıyor; dolayısıyla ayrıca bir Ses kaynağına ihtiyacınız var.
- Bu donanımda 480p. Tek 40 GB kartta çalıştırabildiğimiz şey 480p sınıfı çıktıydı.
LongCat’i self-host etmek mi, yoksa barındırılan bir araç mı: hangisini seçmelisiniz?
İkisi de aynı şeyi üretir — fotoğraf + ses, konuşan bir videoya dönüşür. Fark tamamen oraya ulaşmanın size neye mal olduğunda. VisionStory gibi barındırılan bir araç modeli sizin yerinize çalıştırır; işte dürüst karşılaştırma.
| LongCat (self-host) | VisionStory (hosted) | |
|---|---|---|
| Donanım | 40 GB A100/A800 (binlerce dolar) | Yok — tarayıcıda çalışır |
| Kurulum | CUDA, flash-attn, INT8, bağımlılık düzeltmeleri, OOM ayarı | Giriş yapın ve başlayın |
| Klip başına süre | Videonun 1 saniyesi için ~44s hesaplama (82s klip ≈ 1 saat) | Barındırılan GPU’larda saniyeler |
| Çözünürlük (bizim koşu) | 480p sınıfı | HD ve üzeri |
| Ses | Sesi siz sağlarsınız (TTS/klon yok) | Yerleşik sesler ve ses klonlama |
| Ticari kullanım | Evet (MIT) | Evet (plana göre) |
| Bakım | Bağımlılıkları, OOM’u, sürücüleri siz yamalarsınız | Yok |
| En iyi olduğu durum | GPU’larınız var ve self-host/offline/on-prem gerekiyor | Hızlıca, bitmiş bir konuşan video istiyorsunuz |
LongCat’i seçin eğer donanımınız varsa ve işin gerçekten self-host olması gerekiyorsa — on-prem, offline ya da tamamen sizin kontrolünüzde — ve bir CUDA yığınını bakımını yapmaya rahatsanız. Barındırılan bir araç seçin eğer aynı fotoğraf+ses konuşan videoyu, bir saat hesaplama ve beş haneli bir GPU masrafı olmadan istiyorsanız.
LongCat bize ne öğretti?
LongCat-Video-Avatar’ı çalıştırmanın asıl dersi şu: açık avatar-video kalitesi artık geldi — referans fotoğrafla bu ücretsiz model, gerçek kullanım için yeterince iyi klipler üretiyor. Zor olan artık model değil.
Zor olan, etrafındaki her şey: bu boyutta bir video-diffusion modelini karşılayabileceğiniz bir karta sığdırmak, ikinci segmentte OOM’dan sağ çıkmak, 82 saniye için bir saat beklemek ve bunu bir Ses ile eşleştirmek. O boşluk — yetenekli bir checkpoint ile herkesin yapabileceği bitmiş bir konuşan video arasındaki fark — bizim tam olarak yaptığımız iş. Diğer tarafını görmek isterseniz, VisionStory bir fotoğraf ve metni tarayıcınızda saniyeler içinde dudak senkronlu bir konuşan avatara dönüştürür; ses tarafına da ihtiyacınız varsa, open-source TTS incelememiz bu cephenin şu an nerede durduğunu anlatıyor.
