Meituan이 LongCat-Video-Avatar 1.5를 오픈 소스로 공개했습니다. 그리고 이 모델은 VisionStory의 핵심과 정확히 같은 일을 합니다 — 정지 사진과 오디오 트랙을 ‘말하는 아바타’ 비디오로 바꾸는 것이죠. 그래서 저희도 직접 돌려 보고 싶어졌습니다. 이번 글은 실사용 기반의 해부 리뷰입니다. 무엇인지, 실제 성능은 어떤지, 설치 과정에서 걸린 5가지 함정, 그리고 직접 운영할 때의 비용과 호스팅 툴의 차이를 솔직히 정리했습니다. 출처: github.com/meituan-longcat/LongCat-Video (MIT).
LongCat-Video-Avatar는 무엇이고, 누가 만들었나요?
LongCat-Video-Avatar 1.5는 Meituan(LongCat 팀)이 만든 오픈 웨이트 오디오 구동 사람 비디오 모델입니다. LongCat-Video 파운데이션 모델을 기반으로 하며, 관대한 MIT 라이선스로 공개되어 상업적 사용도 진짜로 자유롭습니다. 2026-07 기준 코드 저장소는 대략 GitHub 스타 5,200개 정도이고, 1.5 웨이트는 Hugging Face에서도 최근 공개본 중 반응이 좋은 편입니다.
기본적으로 3가지 작업을 지원합니다. Audio + Text to Video(AT2V, 레퍼런스 이미지 없음), Audio + Text + Image to Video(ATI2V — 레퍼런스 사진이 인물 정체성을 결정하며, 실제 아바타 워크플로와 맞는 케이스), 그리고 한 세그먼트를 넘어 클립을 늘리는 video continuation입니다. 1.5 버전은 Whisper-Large 오디오 인코더로 교체되었고, 이것이 립 모션을 만들어 냅니다. 중요한 점은, 여러분이 넣은 오디오로부터 입 모양과 표정을 구동한다는 것입니다 — 음성을 생성하거나 클론하지는 않습니다.
직접 실행해 봤습니다(단일 A800-40GB)
말만 하는 리뷰는 없습니다 — 단일 NVIDIA A800-SXM4-40GB(torch 2.8+cu128, driver 550)에서 3가지 작업을 전부 돌렸습니다. 설정은 모델의 INT8-quantized + 8-step distill 구성으로 진행했는데, 이 정도 크기의 비디오 디퓨전 모델을 40 GB 카드에 얹으려면 사실상 이게 필요합니다. 아래는 있는 그대로의 플레이 바이 플레이입니다.
우리가 겪은 5가지 함정
- 보컬 분리 의존성 누락. 오디오 파이프라인은
audio-separator를 통해 Kim_Vocal_2 모델이 필요한데, 기본 requirements에 없어서 첫 실행이 바로 죽었습니다 —pip install audio-separator==0.30.2로 해결. - 비디오 라이터가 터짐. 프레임 저장 시 imageio가 ffmpeg writer를 찾지 못해
TiffWriter got an unexpected keyword argument fps오류가 났습니다 —pip install imageio-ffmpeg==0.6.0로 해결. - 멀티 GPU 데드락. 여러 장의 카드로 하나의 작업을 돌리면(컨텍스트 병렬 크기 2 또는 8) NCCL collective desync에서 멈춰 섰습니다 — 두 rank가 서로를 기다리다가 600s 타임아웃으로 종료. 결국 단일 카드로만 가능했습니다. INT8 웨이트는 40 GB 1장에 들어가므로, 멀티 GPU는 단일 작업 가속이 아니라 여러 작업을 병렬로 돌릴 때만 의미가 있었습니다.
- 두 번째 세그먼트에서 OOM. 긴 클립은 세그먼트를 이어 붙여 만들고, continuation 단계가 48-layer KV-cache를 계속 메모리에 유지했습니다. 40 GB 카드에서는 두 번째 세그먼트에서 피크를 찍고 크래시 — 딱 약 160 MiB가 부족했습니다.
--offload_kv_cache플래그를 노출해 활성화(캐시를 CPU RAM으로 옮기고 스텝마다 다시 페이지 인)하고,PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True도 설정해야 했습니다. 동작은 하지만 세그먼트가 더 느려집니다. - 해상도 정렬. 멀티 카드 병렬 환경에서 480p는 가로/세로가 64로 나누어떨어져야 하는 제약에 걸렸습니다. 단일 카드는 이를 피할 수 있었습니다.
속도와 메모리(실측)
가장 중요한 숫자입니다. 82초 클립을 만드는 데 A800에서 3,586초 — 1시간이 채 안 되는 시간이 걸렸습니다. 즉 완성 영상 1초당 약 44초의 연산입니다(26개 세그먼트 기준, 세그먼트당 대략 138초). 10초짜리 짧은 클립도 대략 7분 정도입니다. 게다가 가벼운 작업이 아닙니다. VRAM은 몇 초 만에 치솟고, 렌더 내내 40,500 MiB — 40 GB 카드의 98.9% —에 고정됐습니다. 아래는 1초마다 샘플링한 실제 사용량입니다:
우리가 렌더링한 샘플
아래의 모든 클립은 위에서 설명한 A800에서 저희가 직접 렌더링했습니다. 모델을 의도된 사용 시나리오에서 벤치마크하기 위해, 저희가 임의로 자료를 선별하기보다 프로젝트의 공식 데모 입력(참조 인물 사진과 오디오)을 그대로 사용했습니다—즉, 이것들은 하이라이트 모음이 아니라, 꾸밈없이 있는 그대로의(체리피킹하지 않은) 결과물입니다. 처음 두 개의 클립은 각각 자체 참조 사진으로 구동했습니다:
왼쪽: 사진 + 오디오 클립의 참조 이미지. 오른쪽: 멀티 스피커 클립의 참조 이미지(한 장의 이미지, 두 사람). 아래의 세 번째 클립은 참조 사진 없이 텍스트 + 오디오로 구동했는데—모델이 인물을 새로 만들어내야 하는 구간이라 가장 약한 모습을 보입니다.
VisionStory가 NVIDIA A800에서 LongCat-Video-Avatar 1.5로 렌더링(2026-07-15). 480p급 해상도(768×512 / 832×480)로, 모델의 공식 데모 입력을 사용했습니다.
솔직한 결론: 사진이 있으면 강하고, 없으면 거칩니다
진짜 인상적이었던 점:
- 정체성이 유지됩니다. 사진 기반 클립에서는 82초 내내 인물이 같은 사람으로 유지됩니다 — 머리, 의상, 얼굴 — 그리고 입 모양이 오디오를 따라갑니다. 아바타에서 가장 중요한 케이스인데, 잘 됩니다.
- 멀티 스피커가 실제로 됩니다. 한 장면 속 두 사람을 각각 자기 오디오 트랙으로 립싱크시키는데도 일관성이 유지됩니다 — 이건 진짜 어려운 문제입니다.
- MIT, 그리고 상업 수준. 오픈 웨이트, 렌더당 과금 없음, 짧은 클립 기준으로는 통과할 만한 출력 품질.
아쉬운 점 — 그리고 전부 현실입니다:
- 텍스트만으로 생성하면 드리프트합니다. 레퍼런스 사진이 없으면 모델이 인물을 만들어내는데, 긴 클립에서는 얼굴이 기괴하고 왁스 같은 클로즈업으로 뒤틀리고, 장면도 흔들립니다 — 위의 세 번째 샘플에서 확인할 수 있습니다.
- 느리고 무겁습니다. 영상 1초당 연산 ~44초, 렌더 내내 40 GB 카드를 붙잡습니다. 82초 클립이 1시간입니다.
- 40 GB가 사실상 최소입니다. 저희는 겨우 맞추려고 INT8 + distill이 필요했고, 여러 세그먼트 클립은 KV-cache를 CPU로 오프로딩해서만 살아남았습니다. 더 작은 카드는 어렵습니다.
- 실제로는 단일 카드만. 멀티 GPU 컨텍스트 병렬이 저희 환경에서는 데드락이 나서, 카드를 추가해도 단일 클립을 쉽게 더 빠르게 만들 방법이 없었습니다.
- 음성이 없습니다. 여러분이 제공한 오디오로 입을 움직일 뿐 — 텍스트 음성 변환이나 음성 클로닝을 하지 않으니, 별도의 음성 소스가 필요합니다.
- 이 하드웨어에서는 480p. 40 GB 카드 1장으로 돌릴 수 있었던 건 480p급 출력이었습니다.
LongCat 셀프 호스팅 vs 호스팅 툴: 무엇을 고를까요?
둘 다 결과물은 같습니다 — 사진 + 오디오가 ‘말하는’ 비디오가 됩니다. 차이는 오직, 거기까지 가는 데 드는 비용입니다. VisionStory 같은 호스팅 툴은 모델 실행을 대신 해줍니다. 아래는 솔직한 트레이드오프입니다.
| LongCat (셀프 호스팅) | VisionStory (호스팅) | |
|---|---|---|
| 하드웨어 | 40 GB A100/A800(수천 달러) | 없음 — 브라우저에서 실행 |
| 설정 | CUDA, flash-attn, INT8, 의존성 수정, OOM 튜닝 | 로그인하고 바로 시작 |
| 클립당 시간 | 영상 1초당 연산 ~44초(82초 클립 ≈ 1시간) | 호스팅 GPU에서 수초 |
| 해상도(테스트 기준) | 480p급 | HD 이상 |
| 음성 | 오디오를 직접 제공(TTS/클론 없음) | 기본 음성 + 음성 클로닝 |
| 상업적 사용 | 가능(MIT) | 가능(플랜에 따라) |
| 유지보수 | 의존성, OOM, 드라이버를 직접 패치 | 없음 |
| 추천 상황 | GPU가 있고 셀프 호스팅/오프라인/온프레미스가 꼭 필요할 때 | 완성된 말하는 비디오를 빠르게 얻고 싶을 때 |
LongCat을 고르려면 하드웨어가 있고, 작업이 정말로 셀프 호스팅이어야 합니다 — 온프레미스, 오프라인, 또는 완전한 통제권이 필요할 때 — 그리고 CUDA 스택을 직접 유지보수할 수 있어야 합니다. 호스팅 툴을 고르려면 같은 ‘사진+오디오’ 말하는 비디오를, 1시간의 연산과 5자리 수 GPU 비용 없이 만들고 싶을 때입니다.
LongCat이 알려준 것
LongCat-Video-Avatar를 직접 돌려보며 얻은 진짜 교훈은, 오픈 모델의 아바타 비디오 품질이 이제 도착했다는 것입니다 — 레퍼런스 사진만 있으면, 무료 모델로도 실사용 가능한 클립이 나옵니다. 더 이상 어려운 건 모델 자체가 아닙니다.
어려운 건 그 주변의 모든 것들입니다. 감당 가능한 GPU에 비디오 디퓨전 모델을 얹는 일, 두 번째 세그먼트에서 OOM을 버티는 일, 82초를 만들려고 1시간을 기다리는 일, 그리고 음성을 붙이는 일. ‘쓸 만한 체크포인트’와 ‘누구나 만들 수 있는 완성형 말하는 비디오’ 사이의 그 간극 — 그게 바로 우리가 하는 일입니다. 반대편이 궁금하다면, VisionStory는 브라우저에서 사진과 스크립트만으로 립싱크 talking avatar를 몇 초 만에 만들어 줍니다. 그리고 음성까지 필요하다면, open-source TTS 해부 리뷰에서 그쪽의 현재 수준도 다뤘습니다.
