Alibabaの動画生成モデル「Wan」シリーズから、音楽に合わせて人物を踊らせる「Wan-Dancer-14B」がオープンソースで公開されました。
用意するものは人物やキャラクターの画像1枚と音楽です。ModelScopeの公式発表では、最大3分、720p、30fpsのダンス動画を生成できると紹介されています。
Wan-Dancer-14Bとは
Wan-Dancer-14Bは、1枚の画像と音楽から、音楽のリズムに合わせた長時間のダンス動画を生成する14Bモデルです。
従来の動画生成モデルは、長時間になると人物の見た目が変化したり、動きが単調になったり、音楽との同期が崩れたりすることが課題でした。
Wan-Dancerでは、曲全体の構成を考える「Global」と、映像を細かく仕上げる「Local」の2段階に処理を分けることで、長時間のダンス動画に対応しています。
対応するダンススタイルとして、次の5種類が紹介されています。
- K-POPダンス
- ストリートダンス
- ラテンダンス
- タップダンス
- 中国古典舞踊
画像と音楽に加えて、テキストプロンプトでダンススタイルを指定できます。
最大3分・720p・30fpsのダンス動画を生成
ModelScopeの公式Xでは、Wan-Dancerについて次の内容が紹介されています。
- 入力は1枚の画像と1曲の音楽
- 最大3分のダンス動画
- 解像度は720p
- フレームレートは30fps
一方、論文では1分を超える長時間生成に成功し、実験では最大160秒まで人物の一貫性を維持したと説明されています。
公式発表上の最大時間は3分、論文で具体的に示されている検証結果は最大160秒という違いがあります。
長時間生成を可能にするGlobalとLocal
Wan-Dancerの大きな特徴は、長時間の動画を最初から高解像度で一気に生成するのではなく、GlobalとLocalに役割を分けていることです。
Globalモデル
Globalモデルは音楽全体を参照し、ダンスの流れや重要なキーフレームを計画します。
曲の一部分だけを見るのではなく、曲全体の構成を利用することで、長時間でも同じ動きを繰り返しにくくし、曲調に合わせた大きな流れを作ります。
Localモデル
Localモデルは、Globalモデルが作成した動画をもとに、時間方向の動きや細部を高品質化します。
この2段階構成によって、人物の見た目や衣装を維持しながら、長時間のダンス動画を生成します。
ComfyUI用のFP8モデルも公開
ComfyUI向けには、Comfy-OrgからFP8モデルが公開されています。
| モデル | ファイル名 | ファイルサイズ |
|---|---|---|
| Global | wan2.2_dancer_14b_global_fp8_scaled.safetensors | 18.3GB |
| Local | wan2.2_dancer_14b_local_fp8_scaled.safetensors | 18.3GB |
| 合計 | 2ファイル | 36.7GB |
GlobalとLocalで別々のモデルを使用するため、ダウンロードサイズは合計36.7GBです。
ComfyUI公式テンプレートも利用可能
Wan-Dancerのモデル公開に合わせて、ComfyUIでは公式ワークフローテンプレート「Video Wan 2.2 Dancer」を利用できるようになっています。
公式テンプレートも実際に入手できました。トップ画面は入力画像、入力音声、Wan-Dancerの処理部分、プレビュー動画と完成動画の保存というシンプルな構成です。
内部の63ノードは「Image to Video (Wan Dancer)」というサブグラフにまとめられています。その中にGlobalモデルによるキーフレーム生成と、Localモデルによる高品質化が組み込まれています。
主に使用されるWan-Dancer用の標準ノードは次のとおりです。
WanDancerEncodeAudioWanDancerVideoWanDancerPadKeyframesList
専用のカスタムノードを別途追加する必要はなく、ComfyUI本体の標準ノードだけで構成されています。テンプレート内には必要なモデルのダウンロード情報も設定されています。
公式テンプレートの主な初期設定は次のとおりです。
| 項目 | 初期設定 |
|---|---|
| 解像度 | 720×1280 |
| フレーム数 | 149フレーム |
| 出力時間 | 5秒 |
| 選択できる出力時間 | 5/10/15/20/25/30秒 |
公式テンプレートには「149フレームを一度にサンプリングするため、大量のVRAMが必要」と注意書きがあります。
モデル自体は最大3分の動画生成に対応すると発表されていますが、今回確認したComfyUI公式テンプレートで選択できる長さは最大30秒です。
この公式テンプレートはモデルの一般公開前から準備されていましたが、当初はモデルファイルが未公開だったため、ダウンロードリンクが利用できない状態でした。Wan-Dancer-14Bの正式なオープンソース公開によって、ComfyUI用FP8モデルもダウンロードできるようになっています。
テンプレート一覧に「Video Wan 2.2 Dancer」が表示されない場合は、ComfyUI本体だけでなくcomfyui-workflow-templatesも新しいバージョンへ更新されているか確認する必要があります。
モデルのダウンロード

公式テンプレートでは、この2本に加えて次の既存Wan関連モデルも使用します。
| 種類 | ファイル名 |
|---|---|
| LoRA | lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors |
| Text Encoder | umt5_xxl_fp16.safetensors |
| CLIP Vision | clip_vision_h.safetensors |
| VAE | Wan2_1_VAE_bf16.safetensors |
Wan2.1/Wan2.2の動画生成をすでに使用している環境では、これらの補助モデルが導入済みの場合があります。
ライセンス
Wan-DancerのコードとモデルはApache 2.0ライセンスで公開されています。
ライセンス条件を守れば、改変、再配布、商用利用が可能です。


