0578
SIGNAL テクノロジー
No.0578

GoogleがVeo 3に渡した「制御権」が、開発者の不満を直撃している

ADVERTISEMENT

出典:Google DeepMind Blog

AI動画生成が「すごい技術のデモ」から「実務に使えるツール」へと移行しようとするとき、必ずぶつかる壁がある。

2022年以降、テキストから動画を生成するモデルは急速に精度を上げてきた。Runwayが先行し、Soraが話題をさらい、Googleも追随する形でVeoを投入した。どれも「見せ方」は派手で、短いプロモーション映像を見るだけなら息を呑むクオリティだ。しかし実際に制作パイプラインへ組み込もうとした開発者やスタジオが口を揃えて言ってきたのは、「一発で良いものが出ても、それを繋げられない」という問題だった。

動画は静止画と違い、時間軸がある。1枚のフレームが美しくても、前後のカットと繋がらなければ使い物にならない。開始と終了をコントロールできなければ、編集点が作れない。低解像度で素早くプロトタイプを確認したくても、毎回フル解像度のレンダリングにコストと時間がかかる。これらはUXの問題ではなく、制作ワークフロー上の根本的な欠落だった。

AI企業がこれまで「すごいものを作った、使ってみろ」という姿勢でモデルを世に出してきた背景には、精度向上を最優先する開発フェーズの論理があった。制御性は後回しにされやすい。しかし市場が成熟してくると、精度よりも「自分の意図通りに動くか」を求めるユーザー層が厚くなってくる。特に業務組み込みを前提にした開発者にとって、ブラックボックスのままでは導入判断すらできない。

Googleが今回Gemini Omni 1.1 Flashで打ち出したのは、まさにその層への回答だ。シーンの延長、開始・終了フレームの指定、360pによる高速ドラフト生成、4Kへのアップスケール。個々の機能は地味に見えるが、組み合わせると「制作プロセスのどこにAIを差し込むか」を開発者が自分で設計できるようになる。

生成AIの競争は、今まさにこの「制御権の移譲」をめぐる段階に入っている。精度で横並びになりつつある各社が次の差別化として持ち出してくるのは、「どこまで細かく操れるか」だ。Adobeの製品群が長年かけて培ってきた「プロが細部まで触れる」という価値軸を、クラウドAPIで実装しようとしているとも読める。

誰が得をするかも明確になってきた。制作パイプラインにAIを組み込みたいスタジオや開発者は、今回の機能追加によって「実運用で使えるか」の判断基準がはじめて揃う。一方で、これまで人手でやっていたトランジション設計や解像度変換の工程は、自動化される範囲がそのまま広がる。

技術が「見せるもの」から「使うもの」に変わるとき、インターフェースとAPIの設計が勝負を分ける。今回のアップデートは、その転換点の一手にあたる。

3行まとめ

  • GoogleはGemini Omni 1.1 Flashを開発者向けに公開し、生成動画に対するシーン延長・キーフレーム指定・アップスケールなどの制御機能を追加した
  • 360p解像度での軽量プレビュー生成により、720p比で最大60%高速・3分の1のコストで反復制作が可能になった
  • 最大3秒の動画参照入力にも対応し、キャラクターや視覚的コンテキストの一貫性を保ちながらシーン制作ができるようになった

※以下は詳細

ADVERTISEMENT

シーンを延長して長尺のストーリーを組める

シーン延長機能では、既存の動画から続きの映像をシームレスに生成できます。

Omni 1.1はモデルが最大10秒分の直前のコンテキストを分析する仕様になっており、視覚的な一貫性とナラティブの整合性が向上しています。動画は10秒単位で延長でき、累積の最大長は40秒です。より長いストーリーや新たなクリエイティブ方向への展開に活用できます。

開始フレームと終了フレームを指定できる

ショットの開始・終了フレームを指定することで、滑らかなトランジションとカメラ動作を実現できます。

Omni 1.1は2つのキーフレーム間の連続した映像を生成します。カメラのオービット・ズームトランジション・シームレスなループクリップなど、複雑なカメラワークが必要な場面での利用を想定しています。

360pで素早くドラフトを確認できる

360p解像度での軽量プレビュー生成が新たに利用できます。標準の720p解像度と比べて最大60%高速、コストは3分の1です。

ラピッドプロトタイピング・ストーリーボードの反復・開発プラットフォームでのクイックレンダリングを想定した機能で、フル解像度での本番生成前の確認フローに組み込めます。

1080pおよび4Kへのアップスケールに対応

Omni 1.1では、1080pまたは4Kの高解像度出力を生成できます。プロフェッショナルなプロダクション用途を対象とした機能です。

マルチモーダル入力で動画を参照素材として使える

シーン制作時に最大3秒分の動画を参照として入力できます。参照動画に基づいた視覚的なコンテキストやキャラクターの一貫性を維持しながら映像を生成できます。

全体まとめ

Gemini Omni 1.1 Flashは、Google AI StudioのGemini APIを通じて利用できます。生成動画ワークフロー・クリエイティブツール・メディア編集ソフトウェアの構築を対象に、シーン延長・キーフレーム指定・低解像度ドラフト生成・4Kアップスケール・動画参照入力の5つの機能が追加されています。コントロール性の向上・反復速度の改善・実運用環境への対応が今回のアップデートの中心です。

ADVERTISEMENT
NEXT READS
SIGNALへ戻る
— END OF ARTICLE —
SIGNAL