Wan 3.0に資料を1本渡すと、どこまで自動になるか。

プロンプト画伯
プロンプト画伯

@promptpainter 63本

サムネイル

手元に営業資料のPPTがある。これを動画にしたい。でも編集ソフトを開いて素材を並べ直す時間はない。

Wan 3.0はそこを狙ってきたモデルです。Tongyi Labが2026年8月に公開したもので、PDFやPowerPointやExcelを「参照素材」ではなく入力そのものとして受け取れます。ただ、公開されている仕様を読み込むと「投げたら完成」ではないことがはっきり書いてあって、機械の担当と人間の担当の線が思ったよりくっきり引かれていました。

入力欄に置けるのは、資料1本かリンク1本。

まず単位の話から。1リクエストにつき添付できるファイルは1本だけです。上限は100MB、そして50ページまで。ファイルの代わりに公開Webページのリンクを1本渡す形でも動きます。

対応形式は公式APIリファレンスに列挙されていて、docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers、md。KeynoteもPagesもNumbersも入っているので、Macで作った資料をそのまま渡せる並びになっています。

制約がひとつあります。資料もWebリンクも、ログインなしで見られる状態でないと受け付けられません。社内共有ドライブに置いたままのURLを渡しても読めない。ここは最初につまずきやすいところです。

「50ページ」という数字、多いと感じますか、少ないと感じますか。30ページ級の提案書がまるごと入るサイズなので、実務の資料はだいたい収まります。むしろ問題は逆側で、50ページを30秒に圧縮したら1ページあたり0.6秒です。全部映ると思って渡すと、期待と結果がずれます。

渡せるものと、渡せないもの。

PDFやPowerPointなどの資料アイコンから矢印が伸び、動画のフレームに変換される様子を水彩タッチで描いた概念図

資料以外の参照素材にも本数の上限があります。APIリファレンスによると、参照画像は最大10枚、参照動画は最大5本で合計15秒以内、参照音声も最大5本で合計15秒以内。ブランドカラーの見本やロゴを一緒に渡して雰囲気を揃える、といった使い方は想定されている作りです。

見落としやすいのが併用の制限で、資料入力は first_framelast_frame による開始フレーム指定と同時に使えません。「この1枚から始めて、資料の内容を続きにする」という組み方はできない。どちらかを選ぶ設計です。

生成側の仕様も押さえておきます。出力は2秒から30秒まで、duration で指定する形。解像度は480p、720p、1080pの3段で、4Kはありません。フレームレートは30fpsが既定値。そして音声はセリフもBGMも効果音も同時に出てきます。既定でオンなので、要らないときは audio を false にして止めます。

モデル名は2種類あって、標準が wan3.0-video、速度重視の版が wan3.0-video-prime です。

資料が決めるのは中身、プロンプトが決めるのは見せ方。

資料の文字情報と、色や動きの指示書が、それぞれ別の入り口から動画に流れ込む構造を水彩で描いた図

資料を渡せば、プロンプトは書かなくてよくなるのか。答えは逆です。公式の使い方ガイドは、プロンプトは引き続き必須だと明記しています。見た目のスタイル、テンポ、アニメーションの付き方、話の流れは、こちら側が指示する前提になっている。

つまり役割分担がこうなっています。資料は「何が映るか」を供給する。プロンプトは「それをどう見せるか」を決める。2つは代替関係ではなく、担当が違うだけです。

この分け方が分かると、資料を渡す価値もはっきりします。これまでなら企画書の中身を自分で要約して、数字を拾って、構成に並べ直してからプロンプトに書き下していた。その一番面倒な転記作業が丸ごと消える。代わりに残るのは「どう見せたいか」だけ、という状態です。

人が直すことになるのは、どこか。

Alibaba Cloudの公式ブログは、Wan 3.0の弱点を自分から書いています。音声の質感と、画面に出る文字の描画精度は、まだ改善途中だと。

これは実務にそのまま効く注意点です。資料を動画にするとき、画面に文字が出ないケースのほうが珍しい。製品名、価格、日付、グラフの軸ラベル。開発元が精度を保証していない領域に、まさにそういう要素が集まります。では生成後にどこを見ればいいのか。数字と固有名詞です。この2つは読み飛ばさず1カットずつ目で追う、と決めておいたほうが安全です。

担当を整理するとこうなります。

工程
誰がやるか
資料の内容を読み取って構成に落とす
Wan 3.0が自動で行う
尺の見積もり
duration に -1 を渡すと自動推奨が働く
音声の生成
既定でオン、audio で切り替え
スタイル、テンポ、動きの指定
人間がプロンプトで書く
画面内テキストの正誤確認
人間が生成後に確認する
数字と固有名詞の最終チェック
人間が生成後に確認する

音声については補足があります。海外メディアの報道では、音声をオフにしても料金は変わらないとされています。だとすれば、要らないと分かっていても一度は付きで出して、使えるか判断してから捨てるほうが得です。

30秒作るといくらか。

料金は秒単位の従量制です。Alibaba Cloudの公式ブログに掲載されている単価はこうなっています。円は1ドル150円で換算した目安です。

解像度
1秒あたり
30秒フル尺の目安
480p
0.05ドル(約7.5円)
約225円
720p
0.10ドル(約15円)
約450円
1080p
0.20ドル(約30円)
約900円

1080pで30秒作って900円前後。これは高いでしょうか。構成を確かめる試し打ちなら480pで225円なので、いきなり1080pで回すより、480pで構成とテンポを固めてから解像度を上げるほうが失敗の授業料は軽く済みます。

リージョンの話も入れておきます。APIリファレンスには、モデルとエンドポイントURLとAPIキーが同じリージョンに属している必要があり、またぐと失敗すると明記されています。掲載されているリージョンにはシンガポール、北京、米国バージニア、東京、フランクフルト、香港があり、東京が含まれている点は日本から触るなら押さえておきたいところです。

オープンウェイトは、2.2で止まっている。

もうひとつ、無視できない変化があります。Wanシリーズはずっと重みを公開してきたシリーズでしたが、Wan 3.0にはそれがありません。

GitHubの Wan-Video/Wan2.2 リポジトリを見ると、Apache 2.0ライセンスで重みが公開されたのは2025年7月28日。そして旗艦モデルの公開はそこで止まっています。Hugging FaceのWan-AI、GitHubのWan-Videoのどちらを見ても、旗艦系で最も新しいバージョン番号は2.2のままです。3.0はAPI越しにしか触れません。

ただ、Alibabaがオープン公開をやめたという単純な話でもないようです。海外の検証記事によると、制御系の派生モデルは2026年8月にもApache 2.0で出ている。旗艦の最新版だけが商用API側に回った、という構図に見えます。

では手元のGPUで回したい人には何が残るのか。2.2までの系譜です。資料を動画にする機能は従量課金の側にしかなく、ここが分かれ目になりました。

まとめ 最初の1本に何を選ぶか。

日本から使う入り口について、確認できたことと、できなかったことを分けて書いておきます。確認できたのは、Alibaba Cloud Model Studioの管理画面でAPIキーを発行する形であること、リージョンに東京があること、日本語版のAPIリファレンスページが用意されていることの3点です。一方で、日本の電話番号やクレジットカードでアカウントを作る際の具体的な要件、日本円決済の可否、Qwen系の入り口が日本から制限なく使えるかどうかは、今回は確認が取れませんでした。ここは実際に登録してみないと分からない部分です。

そのうえで、最初に渡す1本をどう選ぶか。ページ数が少なく、画面に出したい文字が少なく、ログインなしで開ける資料。この3つを満たすものから始めるのが安全です。逆に、細かい数字がびっしり並んだ決算資料や、正確な表記が求められる価格表を1本目に選ぶと、人間が確認する工程が膨らんで「自動化した意味がない」という感想になりやすい。

そして最初の1回は、480pで、尺を短めに固定して回してみてください。225円より安く済みます。資料のどこが拾われてどこが落ちたかを見てから、プロンプトで見せ方を足していく。この順番なら、手持ちの資料が動画としてどう解釈されるのかを、一番安く知ることができます。