音楽駆動型ダンスビデオ生成モデル。Wan-Dancer がオープンソースに!

音楽駆動型ダンスビデオ生成モデル。Wan-Dancer がオープンソースに! AIラボ

Alibabaの動画生成モデル「Wan」シリーズから、音楽に合わせて人物を踊らせる「Wan-Dancer-14B」がオープンソースで公開されました。

用意するものは人物やキャラクターの画像1枚と音楽です。ModelScopeの公式発表では、最大3分、720p、30fpsのダンス動画を生成できると紹介されています。

Wan-Dancer-14Bとは

Wan-Dancer-14Bは、1枚の画像と音楽から、音楽のリズムに合わせた長時間のダンス動画を生成する14Bモデルです。

従来の動画生成モデルは、長時間になると人物の見た目が変化したり、動きが単調になったり、音楽との同期が崩れたりすることが課題でした。

Wan-Dancerでは、曲全体の構成を考える「Global」と、映像を細かく仕上げる「Local」の2段階に処理を分けることで、長時間のダンス動画に対応しています。

対応するダンススタイルとして、次の5種類が紹介されています。

  • K-POPダンス
  • ストリートダンス
  • ラテンダンス
  • タップダンス
  • 中国古典舞踊

画像と音楽に加えて、テキストプロンプトでダンススタイルを指定できます。

最大3分・720p・30fpsのダンス動画を生成

ModelScopeの公式Xでは、Wan-Dancerについて次の内容が紹介されています。

  • 入力は1枚の画像と1曲の音楽
  • 最大3分のダンス動画
  • 解像度は720p
  • フレームレートは30fps

一方、論文では1分を超える長時間生成に成功し、実験では最大160秒まで人物の一貫性を維持したと説明されています。

公式発表上の最大時間は3分、論文で具体的に示されている検証結果は最大160秒という違いがあります。

長時間生成を可能にするGlobalとLocal

Wan-Dancerの大きな特徴は、長時間の動画を最初から高解像度で一気に生成するのではなく、GlobalとLocalに役割を分けていることです。

Globalモデル

Globalモデルは音楽全体を参照し、ダンスの流れや重要なキーフレームを計画します。

曲の一部分だけを見るのではなく、曲全体の構成を利用することで、長時間でも同じ動きを繰り返しにくくし、曲調に合わせた大きな流れを作ります。

Localモデル

Localモデルは、Globalモデルが作成した動画をもとに、時間方向の動きや細部を高品質化します。

この2段階構成によって、人物の見た目や衣装を維持しながら、長時間のダンス動画を生成します。

ComfyUI用のFP8モデルも公開

ComfyUI向けには、Comfy-OrgからFP8モデルが公開されています。

モデルファイル名ファイルサイズ
Globalwan2.2_dancer_14b_global_fp8_scaled.safetensors18.3GB
Localwan2.2_dancer_14b_local_fp8_scaled.safetensors18.3GB
合計2ファイル36.7GB

GlobalとLocalで別々のモデルを使用するため、ダウンロードサイズは合計36.7GBです。

ComfyUI公式テンプレートも利用可能

Wan-Dancerのモデル公開に合わせて、ComfyUIでは公式ワークフローテンプレート「Video Wan 2.2 Dancer」を利用できるようになっています。

公式テンプレートも実際に入手できました。トップ画面は入力画像、入力音声、Wan-Dancerの処理部分、プレビュー動画と完成動画の保存というシンプルな構成です。

内部の63ノードは「Image to Video (Wan Dancer)」というサブグラフにまとめられています。その中にGlobalモデルによるキーフレーム生成と、Localモデルによる高品質化が組み込まれています。

主に使用されるWan-Dancer用の標準ノードは次のとおりです。

  • WanDancerEncodeAudio
  • WanDancerVideo
  • WanDancerPadKeyframesList

専用のカスタムノードを別途追加する必要はなく、ComfyUI本体の標準ノードだけで構成されています。テンプレート内には必要なモデルのダウンロード情報も設定されています。

公式テンプレートの主な初期設定は次のとおりです。

項目初期設定
解像度720×1280
フレーム数149フレーム
出力時間5秒
選択できる出力時間5/10/15/20/25/30秒

公式テンプレートには「149フレームを一度にサンプリングするため、大量のVRAMが必要」と注意書きがあります。

モデル自体は最大3分の動画生成に対応すると発表されていますが、今回確認したComfyUI公式テンプレートで選択できる長さは最大30秒です。

この公式テンプレートはモデルの一般公開前から準備されていましたが、当初はモデルファイルが未公開だったため、ダウンロードリンクが利用できない状態でした。Wan-Dancer-14Bの正式なオープンソース公開によって、ComfyUI用FP8モデルもダウンロードできるようになっています。

テンプレート一覧に「Video Wan 2.2 Dancer」が表示されない場合は、ComfyUI本体だけでなくcomfyui-workflow-templatesも新しいバージョンへ更新されているか確認する必要があります。

モデルのダウンロード

Comfy-Org/Wan-Dancer · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.

公式テンプレートでは、この2本に加えて次の既存Wan関連モデルも使用します。

種類ファイル名
LoRAlightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors
Text Encoderumt5_xxl_fp16.safetensors
CLIP Visionclip_vision_h.safetensors
VAEWan2_1_VAE_bf16.safetensors

Wan2.1/Wan2.2の動画生成をすでに使用している環境では、これらの補助モデルが導入済みの場合があります。

ライセンス

Wan-DancerのコードとモデルはApache 2.0ライセンスで公開されています。

ライセンス条件を守れば、改変、再配布、商用利用が可能です。

関連リンク