Design · Development · Thoughts

안녕하세요,
Practical AI Lab 입니다.

AI·에이전트·LLM 실전 연구

Wan-Animate-2 공개 — 구동 영상을 직접 읽는 캐릭터 애니메이션 AI


반응형

정지된 캐릭터 이미지 한 장을 사람의 움직임에 맞춰 자연스럽게 움직이는 기술은 영상 생성 AI의 대표적인 응용 분야입니다. 알리바바 Tongyi 계열 연구진이 2026년 8월 공개한 Wan-Animate-2는 이 문제를 포즈나 랜드마크 같은 중간 표현으로 우회하지 않고, 구동 영상을 Diffusion Transformer가 직접 읽도록 설계했습니다. 코드와 14B 모델 가중치가 함께 공개돼 연구 결과를 실제 환경에서 검증할 수 있다는 점도 눈에 띕니다.

무엇이 공개됐나

공식 GitHub 저장소의 릴리스 노트에 따르면 8월 7일 Wan-Animate-2 추론 스크립트와 Base 모델, 증류 모델 가중치가 공개됐습니다. 저장소는 Apache 2.0 라이선스를 사용하며 Hugging Face와 ModelScope 다운로드 경로, 기본 추론 예제, Diffusers 파이프라인 예제를 제공합니다.

입력은 참조 캐릭터 이미지, 움직임을 제공하는 구동 영상, 이미지의 인물과 배경을 설명하는 프롬프트입니다. 모델은 이 조합을 이용해 참조 캐릭터의 외형을 유지하면서 구동 영상의 움직임을 재현합니다. 단순한 이미지 투 비디오 모델보다 입력 역할이 명확하기 때문에 캐릭터 일관성과 동작 제어를 함께 다루려는 접근으로 볼 수 있습니다.

중간 포즈 추출기를 없앤 이유

기존 캐릭터 애니메이션 방식은 구동 영상에서 포즈, 얼굴 랜드마크, 깊이처럼 명시적인 움직임 정보를 먼저 뽑은 뒤 생성 모델에 전달하는 경우가 많았습니다. 이 과정은 제어하기 쉽지만 추출 단계의 오류가 뒤 생성 과정으로 전파되고, 미세한 몸짓이나 표정이 압축될 수 있습니다.

논문은 Wan-Animate-2가 재설계한 Diffusion Transformer 안에서 구동 영상 토큰을 직접 처리한다고 설명합니다. 참조 이미지와 참조 영상의 정보를 시간축에 정렬하는 Time-Align RoPE, 필요한 참조 구간을 효율적으로 연결하는 Sparse-Ref Attention을 사용해 캐릭터 외형과 움직임의 관계를 학습합니다. 아래 그림은 공식 저장소가 제공한 전체 구조입니다.

이미지 출처: Wan-Animate-2 공식 GitHub 저장소, Apache 2.0

카메라 시점과 실시간 변형

또 하나의 특징은 텍스트로 출력 카메라 시점을 제어하는 기능입니다. 구동 영상을 그대로 따라가는 대신, 프롬프트를 통해 결과 영상의 관점을 분리해 바꿀 수 있도록 설계했습니다. 이는 같은 동작 소스를 여러 장면 연출에 재사용하거나 가상 캐릭터의 화면 구성을 조정할 때 유용할 수 있습니다.

논문은 Wan-Animate-2-Lite도 소개합니다. 교사 강제 학습과 오류 버퍼, Self-Forcing 증류를 결합해 스트리밍 캐릭터 애니메이션이 가능한 실시간 지연 수준을 목표로 한 변형입니다. 다만 현재 공식 저장소에서 바로 내려받을 수 있다고 명시된 것은 Base와 Distillation 모델입니다. 논문의 실시간 변형과 공개 체크포인트의 범위를 혼동하지 않는 편이 안전합니다.

직접 실행할 때 확인할 점

공식 안내의 기본 환경은 가볍지 않습니다. 720p 생성 설정은 A800 GPU 8장을 기준으로 조정돼 있고, 연구진은 480p를 A800 GPU 2장에서 시험했다고 적었습니다. 다른 GPU 환경에서는 YAML의 병렬화 설정을 직접 조정해야 합니다. 로컬 PC에서 바로 실시간으로 돌리는 도구라기보다, 우선은 멀티 GPU 연구·제작 환경을 겨냥한 공개라고 보는 편이 현실적입니다.

  • Base 모델은 기본 품질 검증에 적합하며 공식 예시는 40단계 추론을 사용합니다.
  • 증류 모델 예시는 10단계, guidance scale 1.0 설정을 사용해 추론 단계를 줄입니다.
  • Diffusers 지원은 저장소 안내 시점에 소스 설치 방식이므로 안정 릴리스 포함 여부를 먼저 확인해야 합니다.
  • 참조 인물 이미지와 구동 영상의 초상권·저작권, 합성 영상 고지 여부를 배포 전에 점검해야 합니다.

실무에서는 먼저 짧고 단순한 전신 동작으로 정체성 유지와 손·얼굴 왜곡을 확인한 뒤, 카메라 제어와 긴 시퀀스로 범위를 넓히는 것이 좋습니다. 공개 데모의 결과만 보고 제작 파이프라인에 넣기보다 자신의 캐릭터, 조명, 의상, 배경 조건에서 반복 일관성을 측정해야 합니다.

정리

Wan-Animate-2의 핵심은 새로운 캐릭터 애니메이션 데모 하나가 아니라, 구동 영상을 중간 포즈 표현 없이 생성 모델 내부로 직접 가져온 설계에 있습니다. 여기에 텍스트 기반 시점 제어와 증류 모델, 공개 추론 코드가 더해졌습니다. 높은 GPU 요구량은 진입 장벽이지만, 캐릭터 영상 제작과 실시간 아바타 연구에서 어떤 부분을 최적화해야 하는지 비교할 수 있는 구체적인 기준점이 생겼다는 의미가 있습니다.

참고 자료

반응형