알리바바 Wan-Animate-2 공개, 가중치와 실행에 필요한 GPU

캐릭터 이미지 한 장과 동작이 담긴 영상을 넣으면, 그 캐릭터가 영상 속 동작을 그대로 하는 영상이 나옵니다. 알리바바 통이랩은 2026년 8월 7일 Wan-Animate-2 의 추론 코드와 가중치를 아파치 2.0 으로 공개했습니다.
저장소 기본 설정은 A800 8장 기준이고, 480p 는 A800 2장에서 시험했습니다. 받을 수 있다는 것과 내 컴퓨터에서 돌릴 수 있다는 것은 다릅니다.
캐릭터 이미지 한 장에 영상 속 동작을 입힙니다
입력은 두 가지입니다. 애니메이션으로 만들 캐릭터 이미지 한 장, 그리고 동작이 담긴 구동 영상. 출력은 그 캐릭터가 영상 속 동작을 수행하는 영상입니다. 만든 곳은 알리바바 통이랩이고, 모델 이름은 Wan-Animate-2 입니다.
넣는 것이 이미지와 영상만은 아닙니다. 저장소 예시는 캐릭터를 묘사하는 프롬프트를 함께 받고, 결과를 끌어올리려면 LLM 으로 이미지 캡션을 만들어 넣으라고 권합니다. 프롬프트 없이 두 파일만 던지는 형태는 기본 사용법이 아닙니다.
프로젝트 페이지가 앞세운 것은 세밀한 동작과 얼굴 표정의 재현입니다. 한 캐릭터를 여러 사람의 동작으로 각각 움직인 영상, 여러 캐릭터를 한 번에 움직인 영상이 예시로 올라와 있습니다. 다만 비교 항목에는 영상만 나열돼 있고 옆에 수치는 붙어 있지 않습니다.
시점은 텍스트로 지정합니다. 원본 영상이 정면에서 찍혔더라도 출력의 카메라 각도를 문장으로 따로 정할 수 있다는 뜻입니다. 포즈 같은 명시적 표현에 기대는 기존 방식에서는 보기 드문 기능입니다.
Lite 라는 경량판이 따로 있습니다. 추론 지연을 실시간 수준까지 줄여 스트리밍 캐릭터 애니메이션을 노립니다. 쓰임새로 든 것은 디지털 아바타와 라이브 진행자입니다.
포즈 전처리 없이 구동 영상 파일을 바로 넣습니다
기존 캐릭터 애니메이션은 영상에서 포즈나 스켈레톤 같은 중간 표현을 먼저 뽑고, 그 표현으로 캐릭터를 움직였습니다. Wan-Animate-2 는 구동 영상을 그대로 받습니다. 중간 표현을 만드는 단계가 사이에 없습니다.
그 덕에 뼈대에 담기지 못하던 정보가 살아남습니다. 손가락의 미묘한 각도나 입꼬리가 움직이는 정도가 그런 정보입니다. 다만 이 대목을 뒷받침하는 정량 지표는 논문에도 프로젝트 페이지에도 없습니다.
중간 추출기를 뺐을 때 올라가는 계산 비용은 Time-Align RoPE 와 Sparse-Ref Attention 두 기법으로 눌렀습니다.
Wan-Animate-2 논문중간 추출기를 없앤 이유와 Lite 의 3단계 학습 방식
가중치까지 공개됐고 라이선스는 아파치 2.0입니다
2026년 8월 7일에 추론 스크립트와 Base 가중치, Distillation 가중치가 함께 나왔습니다. 라이선스는 아파치 2.0 입니다. 영상 생성 모델 중에 상업 이용을 이만큼 열어 둔 라이선스는 흔하지 않습니다.
받는 곳은 두 군데입니다. 코드는 Wan-Video/Wan-Animate-2 저장소, 가중치는 허깅페이스 Wan-AI/Wan2.2-Animate-2-14B 입니다. 공개된 지 며칠 안 돼 커뮤니티 반응을 가늠할 단계는 아직 아닙니다.
Diffusers 로 불러올 수 있는 변환본도 같이 올라와 있습니다. Base 는 40 스텝, Distillation 은 10 스텝에 CFG 없이 돌리는 설정입니다. Diffusers 와 DiffSynth-Studio, ComfyUI 통합은 모두 끝난 상태입니다.
아래는 저장소 README 에 실린 실행 예시입니다.
# Base 모델
python wan_animate_2_demo.py \
--refer-img-file reference.png \
--refer-video-file template.mp4 \
--config wan_animate_2.yaml
# Distillation 모델 (10 스텝, CFG 없음)
python wan_animate_2_demo.py \
--config wan_animate_2_distillation.yaml \
--sample_guide_scale 1.0 --step 10
두 명령의 차이는 config 파일과 스텝 수입니다. Distillation 쪽은 스텝을 4분의 1로 줄이고, sample_guide_scale 을 1.0 으로 둬 CFG 계산도 건너뜁니다. 코드를 짜지 않고 화면으로 먼저 보고 싶다면 Gradio 데모 스크립트가 Base 용과 Distillation 용으로 따로 들어 있습니다.
라이선스가 열려 있다는 것과 마음대로 써도 된다는 것은 다른 문제입니다. 실존 인물의 얼굴이나 저작권 있는 캐릭터를 참조 이미지로 넣는 순간 걸리는 것은 모델 라이선스가 아니라 초상권과 저작권 쪽입니다.
기본 설정이 A800 8장이라 여기서 대부분 막힙니다
저장소 기본 설정은 A800 8장 기준이고 720p 생성을 지원합니다. 480p 는 A800 2장에서 시험했습니다. A800 은 데이터센터용 가속기입니다. 개인 PC 에 꽂는 카드가 아닙니다.
모델 이름의 14B 는 파라미터 규모를 가리킵니다. 실행 환경으로는 Python 3.11 과 PyTorch 2.7.0, flash_attn 설치가 필요합니다. 병렬 관련 설정은 YAML 에서 하드웨어에 맞게 직접 고칩니다.
저장소 문서에는 소비자용 GPU 한 장에서 돌리는 방법이 없습니다. 양자화나 CPU 오프로딩 이야기도 README 에 없고, 최소 VRAM 을 적은 줄도 없습니다. 몇 초짜리 영상을 뽑는 데 얼마나 걸리는지에 대한 수치 역시 마찬가지입니다.
받을 수 있다는 것과 돌릴 수 있다는 것은 다릅니다.
이 차이에 따라 계획이 달라집니다. 공개 조건만 보고 주말에 로컬에서 돌려 볼 계획을 잡으면, 30GB 넘는 가중치를 다 받은 뒤에 막히게 됩니다. 720p 를 문서 그대로 재현하려면 여덟 장짜리 인스턴스가 필요하고, 480p 로 낮추면 저장소가 시험해 본 두 장짜리 구성으로 돌릴 수 있습니다.
개인 PC 경로는 ComfyUI 재포장 가중치 쪽입니다
저장소 밖에 다른 경로가 하나 있습니다. Comfy-Org 가 ComfyUI 용으로 재포장한 Comfy-Org/Wan-Animate-2 에는 int8 양자화본이 함께 들어 있습니다. bf16 확산 모델이 32.79GB, int8 이 16.65GB 입니다.
같이 받아야 하는 부품도 있습니다. CLIP vision 1.26GB, umt5 계열 텍스트 인코더 fp8 6.74GB, VAE 253.8MB 구성입니다. Base 와 Distillation 이 각각 bf16 과 int8 로 올라와 있어 넷 중 하나를 고르면 됩니다.
ComfyUI 네이티브 노드는 두 개입니다. WanAnimate2ToVideo 가 참조 캐릭터와 구동 영상을 받는 조건화 노드이고, WanAnimate2Cache 는 포즈 브랜치를 캐시해 생성 시간을 대략 절반으로 줄이는 노드로, 선택적으로 붙입니다.
여기서 조심할 것은 파일 크기와 VRAM 요건이 다르다는 점입니다. 16.65GB 는 디스크에 놓이는 가중치 용량이지, 16GB 카드에서 돌아간다는 보증이 아닙니다. ComfyUI 쪽 안내에도 VRAM 하한이나 측정된 생성 시간은 없습니다.
전 세대에서 이 경로가 어떻게 쓰였는지는 짐작할 수 있습니다. 2025년 9월에 올라온 Wan2.2-Animate-14B 의 커뮤니티 GGUF 변환본은 2026년 8월 9일 기준 내려받은 횟수가 12만 회를 넘습니다. 소비자 GPU 에서 돌리는 길은 공식 저장소가 아니라 커뮤니티 쪽에서 났던 셈입니다.
지금 시도할 수 있는 것과 아직 없는 숫자
판단 기준은 갖고 있는 하드웨어입니다. A800 급 여덟 장이면 저장소 설정 그대로 720p 를, 두 장이면 480p 를 시도할 수 있습니다. 소비자 카드 한 장뿐이라면 ComfyUI int8 경로가 남지만 최소 VRAM 은 어디에도 없습니다.
아직 없는 숫자는 셋입니다. 소비자 GPU 최소 요건, 몇 초짜리 영상 하나를 뽑는 데 걸리는 시간, Lite 판의 요건. Lite 는 논문에 설명만 있고 가중치는 8월 7일 공개 목록에 없었습니다.
클라우드 GPU 두 장을 한 시간 빌려 480p 부터 돌려 보는 것이 첫 단계입니다.
출처: Wan-Video/Wan-Animate-2, 프로젝트 페이지, arXiv 2608.06009, Wan-AI/Wan2.2-Animate-2-14B