Gemini Omniの参照画像、何枚まで渡せて、10秒の縦型動画にどう効かせるのか

nana
nana

@nanabpm ・ 12本

サムネイル

Gemini Omniの参照画像って、何枚まで渡せるのか調べるほど数字がバラバラになりませんか? 公式ドキュメントを読むと、上限枚数そのものはどこにも書かれていません。代わりに載っているのが、参照画像6枚で10秒を3つの区間に割った書き方の例で、これが縦型ショートの素材づくりにそのまま使える型なんです。

参照画像の上限枚数は、公式ドキュメントに書かれていない

Gemini APIの公式ドキュメントで参照画像について書かれているのは、 というラベルの付け方と、6枚を使った書き方の例までです。「最大◯枚」と言い切った一文は見当たりません。

外部の説明は、数字が割れています。ComfyUIの日本語ドキュメントは「最大14枚」、API中継サービスのEvoLinkは「1〜10枚」と書いていますが、どちらもそのツール経由で使うときの仕様です。公式に「3」という数字が出てくるのは参照動画のほう(最大3本、各3秒まで)なので、「参照画像は3枚まで」という説明を見かけたら、そこと混ざっている可能性があります。

公式が例として出しているのは6枚までです。それより多い枚数を前提に組むなら、使う場所の仕様を先に確かめておくのが安心です。

参照画像は1コマ目にならない、始点終点との違いは?

人物、小物、部屋の背景を描いた3枚のカードから、光の線がスマホの縦画面へ集まっていくイメージ図解

Omniでは、渡した画像の使われ方が2通りあります。 と は、その画像を動画の最初や最後のコマとして置く指定です。公式ドキュメントではこちらを「Sources」として扱っています。

もう1つが「References」、つまり参照です。 を付けた画像は「この人」「この小物」「このタッチ」を指すだけで、その1枚がそのまま画面に出るわけではありません。公式の書き方例はこうなっています。

in the style of <IMAGE_REF_0> a woman <IMAGE_REF_1> is walking

1枚目は画風、2枚目は人物として使う指定です。これ何が嬉しいかっていうと、元の写真の構図に縛られないんです。自撮り1枚と商品写真1枚から、寄りのカットにも引きのカットにも「同じ人」「同じ商品」を出す組み方が狙えます。これ、ショート動画の素材づくりだとかなりヤバいです。

6枚の公式例を、縦型10秒のカット割りに置き換えると

10秒のタイムラインが3つの区間に分かれ、それぞれの区間に人物と小物のアイコンが2つずつ乗っているイメージ図解

公式ドキュメントにある6枚の例がこちらです。

[0-3s] A studio fashion sequence. Starting with woman <IMAGE_REF_0>, she is holding <IMAGE_REF_1>
[3-6s] Then we see the man <IMAGE_REF_2> holding <IMAGE_REF_3>
[6-10s] And finally another woman <IMAGE_REF_4> who is holding <IMAGE_REF_5> while walking.

ここ、ちょっと注目してください。10秒を3つの区間に割って、どの区間にも「人物1枚と小物1枚」の2つしか出していません。6枚を全部の場面に混ぜず、区間ごとに役割を分けているんです。

これをショート動画の商品紹介に置き換えると、たとえばこうなります。

[# References <IMAGE_REF_0>@Image1 <IMAGE_REF_1>@Image2 <IMAGE_REF_2>@Image3]
[0-3s] 女性 <IMAGE_REF_0> が机の上の <IMAGE_REF_1> を手に取り、カメラに見せる
[3-6s] カメラが <IMAGE_REF_1> に寄る。女性 <IMAGE_REF_0> は手元だけが映る
[6-10s] 女性 <IMAGE_REF_0> が笑ってカメラを見る。全体のタッチは <IMAGE_REF_2> に合わせる
画面に文字を入れない

書くときにつまずきやすいのは、次の4点です。

  • ラベルは0から数える。1枚目の画像が で、先頭の宣言では同じ画像を Image1 と書くので、番号が1つずれる
  • 先頭の [# References ...] の宣言は、公式では入力が多く役割が入り組むときの書き方として紹介されている
  • 縦型にするのはプロンプトではなく設定のほうで、aspect_ratio を "9:16" にする
  • ネガティブプロンプトの欄はないので、「文字を入れない」のような禁止事項は本文に書く

公式の例はすべて英語です。日本語で書いた区間の効きが弱いと感じたら、その区間だけ英語に書き直して見比べると、どちらが合うか判断しやすくなります。

Geminiアプリ、Flow、AI Studio、参照画像を渡せるのはどこ?

ラベルの書き方が公式に載っているのは、API側だけです。場所ごとに、公式発表で確認できる範囲をまとめます。

場所
公式発表で確認できること
参照画像の複数枚指定
Google AI Plus、Pro、Ultraの加入者向けにシーン延長を提供
公式に記載なし
Plus、Pro、Ultraの加入者向けにOmni 1.1を全世界で提供
枚数やラベル指定の記載なし
Google AI Studio とGemini API
モデルID gemini-omni-1.1-flash、ラベルと宣言の書き方が公式ドキュメントにある
書き方例は6枚まで

API側に無料枠はなく、使った分だけ払う有料のみです。アプリやFlowで画像を複数添付して日本語で頼む使い方ができるかどうかは公式の案内がまだないので、ラベルの書き方を正確に効かせたいならAPI側が確実です。

10秒1本、360pの下書きならいくら?

公式の料金ページでは、動画出力が100万トークンあたり17.50ドルで、720pの動画は1秒あたり5,792トークンと計算されます。1秒あたり約0.10ドルなので、10秒1本で約1ドル、1ドル150円で計算すると約150円です。

360pは、公式ブログで「720pの3分の1のコスト、最大60%速い」と案内されています。10秒1本なら約50円の計算で、ここに参照画像の入力分(100万トークンあたり1.50ドル)が少し上乗せされます。

参照の効き方を見るだけなら、画質はいりません。360pで3回作り直して区間の割り方やラベルを詰め、気に入った構成だけ720pで出せば、合計は約300円。720pで4回作り直すより安く、しかも速く回せます。

参照動画の音は無視される、BGMは編集で乗せる

画像のほかに、動画も参照として渡せます。公式の制限は、参照動画が最大3本で各3秒まで、複数の動画をまたいだ参照には対応していません。そして、参照動画に入っている音声は無視されます。

つまり、トレンド音源に合わせた動きを参照動画で渡しても、音そのものは動画に引き継がれません。音はCapCutで後から乗せる前提で、映像は無音の素材として作ると割り切ったほうが、BGM沼の人ほどカット割りと音の合わせ込みが楽になります。

顔の扱いにも決まりがあります。公式ドキュメントには、見て誰か分かる一部の人物を含む画像のアップロードや編集には対応していない、と書かれています。参照に使うのは自分の写真か、許可をもらった人の写真にしておきましょう。生成された動画には、すべてSynthIDという電子透かしが入ります。

最初の1本は、自撮り1枚と商品写真1枚の2枚から始めるのがおすすめです。10秒を3つの区間に割って、各区間に出す参照を2つまでに絞る。公式の6枚例と同じ組み方なので、枚数を増やすのはその型がつかめてからで十分です。