ショート動画のナレーション、声の演技をAIに注文するには?

nana
nana

@nanabpm ・ 12本

サムネイル

合成音声のナレーションって、どうしても棒読みに聞こえませんか? 9月23日に出たGemini 3.8 Flash TTSは、台本の1行ごとに「ここはため息まじり」「ここだけ早口」と文章で演技を注文できる音声生成AIです。

30秒のショート動画ナレーションを台本から作って、CapCutのカット割りに合わせるところまで、台本サンプルつきでまとめます。

台本に書いた演技指示は、Gemini TTSだと読み上げられる

台本に「(ため息)」「(小声で)」と書き込むと、Gemini 3.8のTTSはそれもセリフとして読み上げます。
公式ドキュメントに、テキスト欄は一字一句そのまま読む台本として扱う、とはっきり書かれているんです。

じゃあ演技はどこで頼むのか。答えは台本の外です。
効かせたい範囲によって、書く場所が3つに分かれています。

  • 1行まるごとの話し方: その行に付ける「スタイル」指示(例: 明るくテンポよく)
  • 一瞬だけの音: 台本の中に埋め込むタグ(例: でため息)
  • 声そのもの: 既成ボイスから選ぶか、文章で声を設計する

これ何が嬉しいかっていうと、台本がセリフだけのきれいな状態で残るんです。
そのままテロップの原稿にも使えるので、字幕作業まで一気にラクになります。

AIナレーションの演技指示は、短く具体的に

台本の各行にネオンカラーの付箋が貼られ、そこから音波がのびていくイメージイラスト

スタイル指示は、声優さんへのディレクションと同じ感覚で書きます。
「感情豊かに」みたいなぼんやりした指示より、「友達に秘密を打ち明けるみたいに小声で」のように場面が浮かぶ書き方のほうが、狙った演技に寄せやすいです。

速さもスタイルで頼めます。公式ドキュメントには、行全体の話す速さを speaking rapidly(早口)や speaking slowly(ゆっくり)で指定する例が載っています。
冒頭のフックだけ早口、オチの前はゆっくり、という緩急を1本の中でつけられるのが、個人的にいちばんアツいポイントです。

一瞬の音はタグで入れます。公式に載っているタグから、ショート動画で使いやすいものを抜き出しました。

タグ
入る音
ショート動画での使いどころ
ため息
「あるある」ネタの共感パート
笑い
オチの直前
息をのむ音
ビフォーアフターの切り替わり
ささやき
裏ワザを明かす行
短い間、長い間
カットの切れ目

タグは英語表記なので、日本語のセリフに混ぜたときの自然さは声やセリフによって変わります。
同じ行をタグあり、タグなしで2回生成して聴き比べると、どこまで入れていいかの感覚がつかめます。
あなたの動画で、いちばん演技が欲しい1行はどこですか? まずはその行だけにスタイルを付けてみると、効き方がはっきり分かります。

30秒ナレーションの台本サンプル

スマホ縦画面の中に5本の短い音波ブロックが積まれ、それぞれが映像のコマと線でつながる図解イラスト

ナレーションの読む速さは1分で300字前後がよく使われる目安なので、30秒なら150字くらいが上限です。
間やため息を入れる余白を残したいので、セリフは90字前後に抑えるのがおすすめ。
この枠に収めた「100均の収納ネタ」の台本がこちらです。

行
セリフ
スタイル指示
タグ
1
え、まだ引き出しの中ぐちゃぐちゃなんですか?
驚いた感じで、早口で
なし
2
毎朝ここでイヤホン探してたの、私です。
自虐っぽく、少し笑いながら
文頭に
3
でもこれ、100均のトレー3つで終わります。
秘密を明かすように、小声で
なし
4
仕切って、並べて、ラベル貼るだけ。
テンポよく、リズムを刻むように
読点の位置に
5
保存して、週末やってみてください。
明るく、ゆっくり
なし

ここがミソなんですが、1行を1カットの単位にしています。
セリフの行とカットが1対1で対応していれば、このあとCapCutに並べるときに迷いません。
APIで書く場合は、1行ごとに text へセリフを、speech_metadata の style へ指示を入れます。3行目ならこんな形です。

{
  "type": "text",
  "text": "でもこれ、100均のトレー3つで終わります。",
  "annotations": [{
    "type": "speech_metadata",
    "style": "秘密を明かすように、小声で"
  }]
}

公式の例はスタイルを英語で書いているので、狙いどおりにならない行は英語の指示でも作って聴き比べてみてください。

CapCutのカット割りにナレーションを合わせる手順

ナレーションを最後に1本で入れて、映像とのズレを何度も直していませんか? おすすめは、台本を1行ずつ別ファイルで書き出すやり方です。
APIの標準出力はWAV形式なので、そのまま編集アプリに読み込めます。

  1. 台本の各行を1ファイルずつ生成する(ファイル名に行番号を付けておく)
  2. CapCutに映像を並べ、1行目の音声をオーディオトラックに置く
  3. 音声クリップの長さに合わせて、1カット目の映像をトリミングする
  4. 2行目以降も同じように並べ、カットの切り替わりと音声の頭をそろえる
  5. 自動キャプションでテロップを付け、台本と照らし合わせて誤変換だけ直す

1本まるごと生成した場合も、 や を入れた位置が波形の切れ目になるので、そこで分割すれば同じように並べられます。
それでも1行ずつをすすめるのは、直しやすいからです。

1行だけ演技が気に入らないとき、その行だけ作り直せば済みます。
1本で出していると全体を生成し直すことになり、気に入っていた行の演技まで変わる可能性があります。

2人の掛け合いナレーション、どこまで作れる?

ツッコミ役とボケ役の掛け合い動画、作ってみたくないですか? Gemini 3.8のTTSは、1つの台本から2人の会話をまとめて生成できます。
公式ドキュメントによると、1回のリクエストで扱えるのは既成ボイスを使った2人まで。

それぞれの行に話者名とスタイルを付けて書きます。
文章で設計したオリジナルの声や、再現した声で掛け合いを作る場合は、2人分を1回では作れません。
話者ごとに1行ずつ生成してつなぐ形になりますが、さっきのCapCutの手順と同じ流れなので、1行1ファイルに慣れていれば手間はほとんど変わりません。

Gemini TTSの声の再現は、本人の同意が前提

自分の声でナレーションを量産できたら最高ですよね。
Gemini 3.8のTTSは、30秒の音声サンプルから声を再現できます。
ただし、条件がはっきり決まっています。

  • 声の持ち主本人が、口頭で同意した録音を提出する必要がある
  • その同意の録音が、サンプルの話者と一致していることが確認される
  • 米国のイリノイ州とテキサス州、EEA(欧州経済領域)、英国、スイス、インドでは使えない

つまり、推しの声や有名人の声を勝手に再現することはできない仕組みです。
使えるのは自分の声か、同意の録音をもらえる相手の声だけ。
日本は除外地域に入っていませんが、友達の声を借りるなら、動画で公開するところまで含めて話を通しておくのが安心です。

もう1つ、Gemini 3.8のTTSで作った音声には、すべてSynthIDという電子透かしが入ります。
耳では聞き取れない形で、AIが生成した音声だと判別できるようになっています。

Gemini TTSを今すぐ試せるのはAI Studio

Gemini 3.8のTTSはGemini APIとGoogle AI Studioで提供が始まっています。
コードを書かずに試すなら、AI Studioの音声生成画面が近道です。

モデルは2種類で、演技の細かさを優先するならFlash TTS、低コストで大量に作るならFlash-Lite TTSという役割分担です。
Gemini Notebookの音声解説にFlash TTS、Google VidsにFlash-Lite TTSが搭載されるとも発表されていますが、日本のアカウントでいつ、どの画面から使えるかまでは公式発表に書かれていません。

確実に触れるのはAI Studioです。
料金は、Gemini APIの無料枠なら入力も出力も無料。
有料枠のFlash TTSは、2026年12月31日まで音声出力100万トークンあたり9ドル(約1,350円)で、2027年1月1日から18ドル(約2,700円)に上がります。

30秒のナレーションを何パターンか試すくらいなら、まずは無料枠で始められます。
最初の一歩は、次に投稿する動画の台本から1行だけ選ぶこと。
その行をスタイル指示ありとなしで2回生成して、聴き比べてみてください。

同じセリフなのに、動画の空気が変わるのが分かるはずです。