
※本ページはプロモーションが含まれています
AI美女でバラエティ番組風の動画を作る|ChatGPTでテロップごと画像を作り、MiniMax H3で動かす【2026年最新】
番組ロゴ・ワイプ・テロップまで1枚の画像に焼き込んでから動かすと、10秒でテレビの企画コーナーに見える動画になります。ChatGPTで画像を作り、MiniMax H3の image-to-video で喋らせるまでを、実際に作った3本のプロンプトごと公開します。カウントダウンのテロップを生成だけで動かす書き方まで。
概要
テレビのバラエティ番組を切り抜いたように見えるAI動画がXで伸びています。作り方は画像生成と動画生成の2段階だけで、編集ソフトは使いません。番組ロゴもワイプもテロップも、動かす前の画像に焼き込んでしまうのがこの形式のすべてです。
実際に3本作りました。企画・番組名・テロップはすべて架空のものです。
この形式が効く理由
見ている人が反応しているのは被写体ではなく「番組の体裁」です。 左上の番組ロゴ、右上の企画テロップ、右上隅のワイプ、画面下の袋文字、右下の「残り8秒」。この5点が揃った瞬間に、視聴者は「テレビで見たことがある画」として処理します。逆に、同じ被写体でもテロップが無いと、ただのAI画像として流されます。
作り手にとっての利点は3つあります。
- 編集が要らない。 テロップもワイプも画像生成の段階で入るので、動画編集ソフトを開く必要がない
- 企画を変えるだけで量産できる。 セットとグラフィックの指定は型として残り、差し替えるのは企画と決めゼリフだけ
- 1本10秒で完結する。 ストーリーを作る必要がなく、1カットか2カットで成立する
ステップ1:ChatGPTでテロップごと画像を作る
5つのレイヤーに分けて書く
プロンプトを「被写体の描写」としてではなく、テレビ画面の構成要素として書くと通ります。
| レイヤー | 書く内容 |
|---|---|
| 画質と撮られ方 | 放送用カメラ / 手持ちカメラ / 定点カメラ、照明の硬さ、オーバー気味かどうか |
| SET | セットの作り込み、観客の有無、床の質感、見切れているカメラ |
| CAST | 中央の演者が何をしている最中か、左右のMCのリアクション |
| GRAPHICS | ロゴ・企画テロップ・ワイプ・決めゼリフ・右下の小物を位置つきで列挙 |
| 禁止 | 実在の局名やロゴを入れない一行 |
実際のプロンプト(スタジオ企画型)
上の「ギリギリ水中クイズ」の画像は、このプロンプトで出しています。
TEXTA photorealistic 16:9 screen grab from a Japanese prime-time TV variety show, shot from a broadcast studio camera. Flat bright studio lighting, slightly overexposed, sharp, no film grain. SET: a game-show studio built around a large clear acrylic water tank in the center, lit from inside with blue light. Chrome and deep-blue panels, wave-shaped decorations, a glossy reflective floor. A tiered audience of young Japanese men and women behind, leaning forward and cheering. CAST: center, a young Japanese woman in a sporty two-piece swimsuit, head just out of the water, gasping and laughing, both hands gripping the rim of the tank. Left, a male host in a grey suit holding a card, shouting the question. Right, a female announcer in a blazer with a stopwatch, laughing. ON-SCREEN GRAPHICS (Japanese broadcast style, thick outlined type with drop shadow): - top-left: show logo 「ギリギリ水中クイズ」 in pop style, cyan-to-white gradient fill, navy outline, small bubble shapes - top-right: two stacked telops. First line bold red and black 「息が続くまで答えろ!」. Second line smaller, white on a blue banner 「正解で賞金10万円!?」 - top-right corner: a rounded-square picture-in-picture inset with a gold border, showing the male host laughing - bottom center: very large caption 「もう無理ーっ!!」 in white with a thick blue-black outline and drop shadow - bottom right: a small yellow timer box 「残り8秒」 No watermark, no real broadcaster name or logo.
効いた指定
picture-in-picture insetと書く。 「wipe」では通じません。枠の色(gold borderなど)まで書くと角丸の枠が付きますthick outline + drop shadowを必ず書く。 これが無いとフラットな字幕になり、テレビらしさが消えます- 右下の小物が効く。 「残り8秒」「取材中」「REC」「※個人の感想です」のような端の表示が、画面全体の説得力を上げます
- テロップは1行6〜12文字に切る。 長い文を1本で渡すと字が崩れます
- 位置を必ず書く。
top-lefttop-rightbottom centerを省くと、文字が1か所に固まります
外れた指定
- 手ブレとレンズフレアは静止画に効きません。 「handheld, mild camera shake」と書いてもきれいに撮れた画になります。構図で言い換えて、
shot from a slightly low handheld angle, the frame tilted a few degrees, the reporter's shoulder blocking the lower left cornerのように書くと手持ちらしくなります right of frameのような位置指定は無視されました。the woman occupies the right third of the frameと割合で言うと通ります- 衣装は「形」まで書かないと寄ります。
a form-fitting bodysuitではレオタードに寄ったので、a matte beige shaping bodysuit with visible seam lines, high neckline, hip and thigh fully covered like compression underwearのように縫い目と被覆範囲まで指定します
穴埋めの型
3本に共通する骨です。ここを差し替えれば企画はいくらでも作れます。
TEXT1行目 画質と撮られ方 … broadcast camera / handheld camcorder / fixed corner camera SET 場所と作り込み … セット・背景・観客の有無・床の質感 CAST 人の配置と動作 … 中央の演者(何をしている最中か)+ 左右のMC(リアクション) GRAPHICS 左上 番組ロゴ … 書体の雰囲気+グラデ+縁取り+小さな装飾 左上下 コーナー説明 … 角丸ピルの短い1行 右上 企画テロップ … 赤太字の1行+白抜きの補足1行 右上隅 ワイプ … rounded-square picture-in-picture inset + 枠の色 下中央 決めゼリフ … 特大の袋文字(6〜12文字) 右下 記号 … 「残り◯秒」「取材中」「REC」など 最終行 no watermark, no real broadcaster name or logo.
差し替えるのは2か所だけで足ります。 「中央の演者が何をしている最中か」と「下中央の決めゼリフ」です。セットとグラフィックは型のまま回せます。
ステップ2:MiniMax H3で動かす
できた画像を image-to-video に渡します。MiniMax H3 は4〜15秒、768Pと2K、アスペクト比は 16:9 のほか 4:3 も選べます。参照画像は9枚、参照動画3本、参照音声3本まで渡せて、プロンプトは7,000文字まで入ります。昔のテレビの画角で作りたいときは、16:9で作って切るより 4:3 を指定するほうが素直です。
公式のプロンプト形式
H3は自由文ではなく、決まった構造で書くと安定します。モデルリポジトリで共有されている image-to-video 用のシステムプロンプトが基準になります。
| 要素 | 書き方 |
|---|---|
| 0秒アンカー | For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. |
| 本体 | integrated_multimodal_description: に映像・動作・カメラ・セリフをまとめる |
| ショット分割 | [Shot 1] … [Shot 2] At 00:05.000, the camera cuts to … とカット時刻を秒で指定 |
| カメラ | 「動きの種類+振れ幅+速度」。例 The camera pushes in with small amplitude at slow speed. |
| 話者 | (S1) (S2) を登場順に固定。同じ人は全ショットで同じID |
| セリフ | <d>[Japanese] もう無理ーっ!!</d>。タグの中は言語タグとセリフだけで、言い方や動作は外に書く |
| 音 | overall_soundscape:(環境音)と non_diegetic_music:(視聴者にだけ聞こえるBGM)を分けて書く |
0秒アンカーがこの形式の生命線です。 「渡した画像を0秒のフレームそのものとして扱え」と宣言してから動きを書くことで、焼き込んだテロップとワイプが動き始めで崩れません。
実際のプロンプト(スタジオ企画型)
TEXTFor the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. Begin from this exact studio angle with the clear acrylic water tank, the male host on the left, the female announcer on the right, the tiered audience behind, and all on-screen graphics intact. The yellow timer box at the lower right reads 「残り8秒」. integrated_multimodal_description: [Shot 1] A 10-second Japanese prime-time variety-show clip begins from the exact first frame. The camera holds the front-facing medium-wide shot of the tank. The young Japanese woman in the tank (S1) gasps for air, slaps both palms on the rim and shakes her head, water droplets flying from her hair; her shoulders heave and her face alternates between squeezed-shut laughter and a desperate attempt to endure. She cries out in a breathless, playful voice (S1): <d>[Japanese] もう無理ーっ!!</d> The male host on the left (S2) leans in and thrusts the question card forward, shouting with exaggerated urgency: <d>[Japanese] あと8秒!答えて!</d> The timer box at the lower right decreases once per second in real time, counting down from 「残り8秒」 toward 「残り4秒」 across this shot, the numeral changing cleanly without warping. After the opening beat the camera pushes in with small amplitude at slow speed toward her face and the rim of the tank. [Shot 2] At 00:05.000, the camera cuts to a wider angle from the right side that includes the female announcer and the first rows of the audience. The woman keeps gripping the rim, sucks in one big breath and blurts out her answer while laughing (S1): <d>[Japanese] イルカ!</d> The female announcer (S3) throws both hands into the air and shouts: <d>[Japanese] 正解ーっ!!</d> At that exact moment the bottom caption is replaced by a new telop 「正解!!」 in huge white type with a thick red outline, and the timer box flashes twice and freezes at 「残り3秒」. The audience stands up cheering and clapping. The show logo at the upper left, the two telops at the upper right and the gold wipe frame at the upper right corner stay fixed in position and must not move or warp at any point. Each body reaction follows the visible cause; no frozen pauses, no impossible movement. overall_soundscape: Bright indoor TV studio room tone with splashing and dripping water, the woman's gasping breaths and strained laughter, the host's shouting close to the microphone, a short quiz buzzer at the answer, and the audience's cheering and applause swelling at the end. non_diegetic_music: An upbeat game-show cue with brass stabs and a ticking percussion pulse under the countdown, resolving into a bright fanfare on the correct answer.
動かすテロップと固定するテロップを分ける
最初は「グラフィックは一切動かすな」と書いていました。結果は静止画に人が動いているだけの画になり、番組には見えませんでした。テレビのテロップは動くからテレビに見えます。
| 動かす | 固定する |
|---|---|
| カウントダウンの数字(1秒ずつ減る) | 番組ロゴ |
| 途中で差し替わる決めゼリフ | コーナータイトル |
| 通販なら価格と在庫 | 右上の企画テロップ |
| ロケならタイムコードとワイプの中の人 | ワイプの枠 |
カウントダウンは「1秒ごとに減る」と数値の始点と終点を書くのがコツです。「残り8秒から残り4秒へ」のように範囲で指定すると、数字が化けにくくなります。
変化は1本の軸に絞ります。 水中クイズならタイマー、通販なら価格、ロケならワイプ。複数を同時に動かすと文字が溶けます。
出てきた失敗と直し方
焼き込んだ文字が別の字に化ける
出てきた動画では、右上のテロップが「息が続くまで答えろ!」から「息が続くまて答える!」に変わっていました。10秒のあいだに、で→て、ろ→る と化けています。長い文字列ほど化けます。
対処は2つです。上部テロップを8文字前後まで短くすること、そして不変をプロンプトで明示することです。
TEXTThe upper-right telops 「息が続くまで!」 and 「賞金10万円!?」 must keep exactly the same characters as in the first frame. Do not change, re-spell or re-draw any character.
セットに番組ロゴのゴーストが浮く
観客の上あたりに、番組ロゴの複製がぼやけて出ました。セット側に文字装飾の余地を残すと、モデルがロゴを「セットの一部」と解釈して増やします。
TEXTNo additional logos, signs, banners or text anywhere in the set or on the backdrop. The only graphics in the frame are the ones already present in the first frame.
カットの後にテロップが消えて無地になる
差し替えのタイミングを書かないと、下の帯が空白のままになる時間ができます。時刻で縛ります。
TEXTThe bottom caption 「もう無理ーっ!!」 stays visible from 0.00 until 00:08.000, at which moment it is replaced by 「正解!!」. The lower area is never left without a caption.
ComfyUIのテンプレートで動かす
H3はオープンウェイトで公開されているので、ComfyUIならテンプレートを選ぶだけでこのワークフローが手に入ります。メニューの「テンプレート」から「ビデオ」を開くと、MiniMax H3:画像から動画へ が並んでいます。
ComfyUIのテンプレート一覧。ビデオの先頭にMiniMax H3の画像から動画へが入っている
- 画像から動画へ … 上の3本で使ったもの。作った1枚を first_frame に入れて、プロンプトを貼る
- 参照から動画 … MCやセットの参照を複数渡す使い方
- テキストから動画へ … 画像を作らずに動画だけ出す
カードに付いている Int8 は量子化版のことで、VRAMに余裕がないPCでもこちらが選べます。導入手順と必要なスペックはMiniMax H3をローカルで動かすとAI美女を作るPCのスペックにまとめています。
ローカルで回せることが、この形式では効きます。 テロップは一度で決まらず、文字の化け方を見ながら2〜3回は作り直すことになるからです。1本ごとに課金を気にしていると、そこで妥協した画を使うことになります。
通販とロケのプロンプト
冒頭に置いた3本のうち、深夜通販とビーチロケの2本は作例だけを載せています。この2企画については、プロンプトと検証結果をまとめて配布しています。
- 2企画の画像プロンプトと動画プロンプトの全文(コピーしてそのまま使えます)
- 同じ画像プロンプトを Krea 2 に入れたときの仕上がり比較。衣装の形・被写体の位置・テロップの出方で差が出ます
- 崩れたときの修正パターン6種と、企画を増やすための穴埋めテンプレ・企画アイデア10本
「バラエティ番組風AI動画のプロンプト2本|深夜通販とビーチロケ」として、2つの販売先に置いています。内容は同じです。
この形式で稼ぐ
シリーズにすることが前提の形式です。 1本だけ作っても「よくできたAI動画」で終わりますが、同じ番組名・同じロゴ・同じMCで出し続けると、視聴者の側に「あの番組」という枠ができます。ロゴとMCの画像を固定して、企画だけ差し替えてください。顔を保つ手順はChatGPT Images 2.5でAI美女をつくるの方法がそのまま使えます。H3は参照画像を9枚まで渡せるので、MC・ゲスト・セットを別々に固定できます。
投稿先を増やすときは、切り抜くより比率を変えてもう一度生成するほうがきれいです。H3は 9:16 も 1:1 も指定できるので、同じ画像とプロンプトで縦型を作り直せます。テロップの位置は画像側で変える必要があります。
画像だけでも成立します。1枚絵のほうが文字が崩れず、コストもかかりません。画像で反応を見て、伸びた企画だけ動画にするのが効率的です。
収益の出口は、プロフィールに置くリンクです。AI美女でCM動画を作る方法で扱った商品紹介型と違い、この形式は番組そのものにファンが付くので、キャラクター単位の課金(Fanvueなど)と相性が良くなります。
よくある質問(FAQ)
Q. 日本語のテロップは何文字まで入りますか?
画像の段階では、1行12文字程度までなら崩れずに出ます。動画にすると長い行ほど字が化けるので、動かす予定の画面に乗せる文字は8文字前後までに抑えるのが安全です。長い説明を入れたいときは、2行に割って小さいほうを補足行にします。
Q. 水着の画像が断られます。
断られたら、水着そのものではなくシチュエーションで見せる型に寄せてください。楽屋の隠しカメラ、通販のボディスーツ、ロケのインタビューのように、着衣でも成立する企画のほうが通ります。上の3本のうち、通販とロケは着衣のまま成立しています。
Q. 同じ顔を使い回せますか?
できます。H3は参照画像を9枚まで受け取るので、MCの画像・ゲストの画像・セットの画像を別々に渡して固定します。声は参照音声を渡すとキャラクターごとに固定できます。
Q. 無料でできますか?
できます。H3はオープンウェイトで公開されていて、ComfyUIのテンプレートに MiniMax H3:画像から動画へ が入っています。VRAMが足りるPCがあれば回数の制限なく回せます。手順はMiniMax H3をローカルで動かす、必要なスペックはAI美女を作るPCのスペックにまとめています。
Q. 昔のテレビの画角(4:3)でも作れますか?
作れます。H3のアスペクト比には 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 があり、image-to-video では入力画像の比率に自動で追従します。4:3で作りたいときは、画像の段階から4:3で生成してください。
まとめ
- バラエティ番組風の動画は、テロップ・ワイプ・ロゴを画像の段階で焼き込むのが前提。編集ソフトは要らない
- 画像プロンプトは「画質と撮られ方 / SET / CAST / GRAPHICS / 禁止」の5レイヤーで書く。ワイプは
picture-in-picture inset、袋文字はthick outline + drop shadow - 動画化は0秒アンカーから書き、
[Shot N]で秒を指定し、セリフは(S1)と<d>[Japanese] …</d>で渡す - テロップは全部固定しない。 カウントダウンや差し替えだけを動かし、ロゴと枠は固定する。動かす軸は1本に絞る
- 文字化けは文字数を削って不変を明示、ロゴの増殖は「セットに文字を足すな」の一行で抑える
- ComfyUIのテンプレート(
MiniMax H3:画像から動画へ)で動く。ローカルなら回数を気にせず作り直せるので、テロップが決まるまで粘れる











