
※本ページはプロモーションが含まれています
AI美女を「踊らせる」完全ガイド|SCAIL-2のモーション転写とSAM 3D Bodyポーズ制御【2026年最新】
参照画像1枚+ダンス動画で、同じ顔のAI美女が踊る動画を作る。ComfyUI公式SCAIL-2ワークフローの導入手順・モデル一覧・81フレーム分割の注意点と、8月23日にComfyUIコア入りしたSAM 3D Bodyによるポーズ修正・表情制御まで解説。
概要
TikTok・YouTube Shortsで数字が出やすいダンス動画は、AI美女運用では長らく鬼門でした。i2vで「踊れ」とプロンプトを書いても振り付けは制御できず、顔も崩れる。この構図を変えるのがモーション転写です。参照画像1枚+駆動動画(踊っている動画)を入力に、同じキャラが同じ振り付けで踊る動画を生成します。
本記事は2本立てです。
- SCAIL-2(2026年6月公開)— ComfyUI公式ワークフローでモーション転写を動かす手順
- SAM 3D Body(2026年8月23日、ComfyUIコアに統合)— ポーズの抽出・修正・表情制御を自分の手に取り戻す
ComfyUI自体が初めての場合はComfyUI完全入門から始めてください。
SCAIL-2とは
SCAIL(Studio-Grade Character Animation via In-Context Learning)はWan 2.1をベースにしたキャラクターアニメーション特化モデルです。v1は3Dポーズ表現を中間に挟む方式でしたが、SCAIL-2はポーズマップ・スケルトン・マスクを一切使わないend-to-end方式になり、駆動動画のモーションを参照キャラに直接転写します。
モードは2つ:
- animation: 参照キャラが駆動動画のモーションを演じる(背景は生成)
- replacement: 駆動動画に映っている人物を参照キャラに置き換える(背景は駆動動画のまま)
顔・体型の同一性はCLIP visionによる参照画像の注入で維持されます。LoRAの学習は不要で、Krea 2やSeedream 5.0で作った基準画像がそのまま入力になります。
必要なモデル(公式ワークフロー記載)
ComfyUI公式チュートリアル記載の構成です。ComfyUIはNightly(最新)版推奨。
| 配置先(ComfyUI/models/) | ファイル |
|---|---|
| diffusion_models/ | wan2.1_14B_SCAIL_2_fp16.safetensors |
| text_encoders/ | umt5_xxl_fp8_e4m3fn_scaled.safetensors |
| clip_vision/ | clip_vision_h.safetensors |
| vae/ | Wan2_1_VAE_bf16.safetensors |
| loras/ | lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors |
| loras/ | wan2.1_SCAIL_2_DPO_lora_bf16.safetensors |
| checkpoints/ | sam3.1_multiplex_fp16.safetensors(人物トラッキング用) |
VRAMの公式数値は明記されていませんが、本体がWan 2.1の14B・fp16なので24GB級(RTX 4090等)が基本線です。lightx2vのstep蒸留LoRAが同梱されており、サンプリングステップは少なく済みます。
生成手順(公式テンプレート)
- ComfyUIのテンプレートからSCAIL-2ワークフローを開く
- 駆動動画(踊っている動画)と参照キャラ画像を読み込む
- animation / replacement モードを選択
- Baseサブグラフで最初の81フレームを生成
- 長い動画はExtendサブグラフで5フレームずつ重ねながら継ぎ足す
つまずきやすい点:
- 解像度は16の倍数でないと弾かれます
- セグメントの自動連続実行は不可(公式チュートリアル明記)。Extendは1区間ずつ手動でキュー実行します
- 駆動動画は「1人がフレーム内で全身〜上半身が映り続けている」素材が安定します。自分で撮るのが最も確実で権利も明確です
なお、他人のダンス動画を駆動素材にする場合、振り付け・実演には権利があります(詳細は著作権・肖像権ガイド)。実在人物のreplacement置換はAIピンピングで解説した越えてはいけない一線です。
ComfyUIのテンプレートからお手軽に起動できますSAM 3D Body — 8月23日、ComfyUIコアに統合
MetaのSAM 3D Bodyは、1枚の画像から体・手・足を含む全身3Dメッシュ(MHR)を復元するモデルです(チェックポイント公開は2025年11月)。2026年8月23日、カスタムノード不要でComfyUI本体に統合されました。
追加されたノード:SAM3DBody_Loader / SAM3DBody_Predict / SAM3DBody_Render / SAM3DBody_Smooth / SAM3DBody_FaceExpression(補助: SAM3_VideoTrack ほか)。モデルは Comfy-Org/sam-3d-body の sam_3d_body_dinov3_bf16.safetensors(軽量版は _int8_convrot)を ComfyUI/models/detection/ に配置します。
できること:
- 動画のポーズトラッキング+フレーム間の時間方向スムージング(
SAM3DBody_Smooth) - OpenPose / SCAIL-pose形式でのレンダリング出力 — ポーズ制御系ワークフローの入力素材を自前生成できる
- 表情駆動(MediaPipeブレンドシェイプ経由)
- GLB / BVHエクスポート — 抽出したモーションをBlenderで編集し、モーション資産として使い回せる
SCAIL-2がend-to-endで「楽だが中身に手を入れられない」のに対し、SAM 3D Bodyはポーズを中間データとして触れるのが価値です。駆動動画の一部フレームで足が交差して破綻する、といった場合にポーズ段階で修正が効きます。コミュニティ製のComfyUI-SAM3DBody_utills(カスタムノード)を足すと、ブラウザ上のポーズエディタや体型プリセット、リグ付きFBX書き出しまで拡張できます。
AI美女作成イメージ運用への落とし込み
ダンス動画はSFWのままTikTok・Shortsの集客素材として最も回転が速いフォーマットです。作った動画の出口はTikTok運用ガイド・YouTube Shorts運用ガイドを参照してください。1本の駆動動画から複数キャラ・複数衣装の差分を量産できるため、「同じ振り付け×別キャラ」でアカウントを並行運用する使い方とも相性が良い構造です。
よくある質問(FAQ)
Q. i2vで踊らせるのと何が違う?
i2vはプロンプトでモーションを間接指示するため振り付けの再現ができません。モーション転写は駆動動画のモーションをそのまま演じさせるので、振り付けを完全に指定できます。顔の同一性維持も参照画像注入で行われるため、LTX-2.3のi2v同一性対策のようなプロンプト側の工夫が不要です。
Q. VRAMはどのくらい必要?
SCAIL-2の公式要件は未記載ですが、Wan 2.1 14Bのfp16一式なので24GB級が現実的です。SAM 3D Body側は軽く、int8版も配布されています。
Q. 駆動動画はどこから調達する?
自分で撮影するのが権利面で最も安全です。他人の動画を使う場合は振り付け・実演の権利に注意してください(著作権ガイド)。
Q. NSFWのダンス動画は作れる?
ローカル実行のためAPI側の検閲はありません。公開時のルールは法律ガイドを一読ください。集客はSFW・販売はプラットフォーム内、という分離が基本です。
Q. 商用利用は?
SAM 3D BodyはSAMライセンス(商用利用可、軍事等の分野制限あり)。SCAIL-2自体のライセンス表記は公式チュートリアルに明記がないため、収益化前に配布元の最新表記を確認してください。
まとめ
- SCAIL-2 = 参照画像1枚+駆動動画で同一キャラのダンス動画。ポーズマップ不要のend-to-end、ComfyUI公式テンプレートあり
- 81フレーム単位+5フレームオーバーラップで延長。解像度は16の倍数、Extendは手動キュー
- SAM 3D Bodyが8月23日にComfyUIコア入り。ポーズ抽出・スムージング・修正・表情駆動・BVH書き出しまで標準機能に
- 駆動動画は自撮りが最安全。実在人物の置換はNG
- 出口はTikTok / Shorts集客 → Fanvue
収益化の全体像はFanvue完全ガイドとAI美女副業ガイドを参照してください。
※ 本ページにはアフィリエイトリンクが含まれています。











