Ashutosh Shrivastavaの5月のGemini Omni Flashデモは5時間の上限を使い切った。
Ashutosh Shrivastavaの5月25日のデモでは、Gemini Omni Flashが個人用アバター動画を生成する様子が示されたが、報告によれば単一のプロンプトで5時間分の使用許容量が使い果たされた。
By RuntimeWire Staff · Published
Primary source: Aligned News - AI Intelligence
Why it matters
Google put personal-avatar video inside Gemini and planned availability for YouTube Shorts and YouTube Create. Shrivastava's test showed that failed generations and compute limits could still keep the feature from becoming a dependable production workflow.

2026年5月25日、AIコンサルタント兼テクノロジークリエイターの Ashutosh Shrivastava は、プロンプトに応じてビデオを演じる自身の合成バージョンを示す Gemini Omni Flash クリップを投稿した。このデモは、Google (https://google.com/?ref=runtimewire) の「any input から何でも作れる」という包括的な売り文句の中に、実用的な製品を露出させた:一度自分を録画し、プロンプトを書き、合成された自分をカメラの前に送り出す。
Shrivastava は Google の従業員ではなく、AI コンサルタント兼テクノロジークリエイターだ。His website によれば、彼は150以上のクライアントと仕事をしており、Gemini やその他の生成メディア製品の早期アクセスプログラムに参加している。これは、未完成の製品をテストし、わかりやすいユースケースを特定し、モデルカードでは説明しづらい機能に「人の顔」を与えるクリエイターという、AI ラボにとってますます重要になる流通層の一部であることを意味する。 (Ashutosh Shrivastava)
Shrivastava の場合、人の顔自体が製品の入力にもなっている。Google のアバターワークフローは、ユーザーに顔と声の短いサンプルを録画するよう求め、それを Gemini のプロンプト内で個人のアバターとして選択するようになっている。Gemini Apps では、アバター作成はユーザーが少なくとも18歳で、個人の Google アカウントにサインインしており、Google AI プランを契約していることが必要だ。Eligible Google Workspace users can also use personal avatars in Google Vids。Gemini Apps における個人アカウントのビデオ生成は Google AI プランが必要であり、職場または学校のアカウントではqualifying Google Workspace license が必要となる。 (Google Gemini Apps Help)
幅広いビデオモデルが特定の役割を見つける
Google は 2026年5月19日に Gemini Omni Flash を Gemini Omni ファミリーの最初のモデルとして導入した。このモデルはテキスト、画像、音声、ビデオの組み合わせを受け取り、音声付きの短いビデオを生成する。ユーザーは継続的な会話を通じて、オブジェクト、動作、カメラ位置、環境、スタイルの変更を要求できる。Google は Gemini アプリと Google Flow を通じて段階的に提供を開始し、YouTube Shorts と YouTube Create への対応も計画していると述べた。 (Google)
アバター機能は「Gemini Avatar」と呼ばれる別個に発表された製品ではなく、Gemini Apps 内のワークフローであるという点が重要だ。Google の優位性は、既に配布している製品内に複数の生成モードを組み合わせることにある。ユーザーは自分自身のアイデンティティを提供し、シーンを生成してプロンプトで編集を続けることができ、専用のプレゼンタービデオサービスに移行する必要がない。
専門企業はこの役割のより狭いバージョンを中心に構築してきた。HeyGen's Avatar IV は単一の画像を同期した音声、顔の動き、手のジェスチャでアニメーション化する。Synthesia はスクリプト、翻訳、ブランド管理、コラボレーションを伴うavatars をビジネスビデオ向けにパッケージ化している。Google のモデルはそこまで目的特化されていない。個人用アバターから映画的な生成、ビデオ編集、マルチモーダル参照までをカバーするのがその売りだ。 (HeyGen)
この幅広さは Google に市場参入の複数のルートを与えるが、Shrivastava のクリップは「any input から何でも作れる」という表現よりも明確な販売論拠を提供する。創業者や小規模なマーケティングチームは再利用可能なデジタルプレゼンターを理解しやすい。スクリプトを製品アップデート、ローカリゼーションテスト、ソーシャルクリップに変え、別の録画セッションなしで済ませられる可能性がある。このデモがワークフローを生産プロセスに置き換えるほど信頼できるかどうかは示していない。
同じテストが到達にかかるコストも露呈した
5月26日、Shrivastava はあるアバタービデオのプロンプトが約4分間実行され、彼の5時間の Gemini 使用枠を全て消費し、最初はビデオを生成できなかったと報告した(ComputerBaseによる)。報告によれば、そのクリップは制限が切れた後に完成したという。
この出来事は、印象的な出力と信頼できるツールとの間にあるギャップを捉えている。ビデオ生成はテキストや画像生成よりも計算コストが大きく、失敗した試行でユーザーの利用可能なキャパシティを使い果たしてしまうと、そのワークフローは構築しにくくなる。Google は Gemini Omni Flash を開発者向けにプレビューで開放したが、公開されている API の制限は控えめだ:出力は3~10秒、720p、24fps に制限される。プレビューモデルは ID gemini-omni-flash-preview を使用する。 (Google AI for Developers)
Google 自身の Gemini Omni Flash model card は、磨かれたデモの周囲に境界を設定している。そこでは、編集間の完全な一貫性、複雑な動き、正確なテキストレンダリングは依然として課題であると述べられている。 (Google DeepMind)
これらの注意書きは、Shrivastava が作り出したものを消すものではない。むしろ、個人用アバターがルーティンな制作インフラになるまでに残された作業を定義している。最も即効性のある用途は短尺の実験であり、クリエイターが再試行を容認でき、短いクリップでもメッセージを伝えられる場合だ。より長期で反復可能なキャンペーンには、生成時間の予測可能性、より明確な容量制限、および複数シーンにわたる連続性が求められる。
クリエイターは Google のローンチ機構の一部である
Shrivastava は自身の仕事を、初期製品をテストし、フィードバックを提供し、新しい機能を観客向けの物語に翻訳することだと説明している。Gemini Omni Flash はその役割が重要である理由を示している。Google の発表はマルチモーダル入力と会話型編集を説明していたが、Shrivastava はその売り文句を、人が指示を入力して自分のバージョンがそれを演じるのを見る、という形に還元した。 (Ashutosh Shrivastava)
その関係は双方向でもある。クリエイターはモデルを理解しやすくするデモを作り、その後、公式のローンチビデオが省くであろう失敗生成やレート制限の問題を公開することができる。それは完璧なサンプルよりもビルダーにとって有用だ。目的地とそこに到達するための現時点でのコストの両方を示すからだ。
Google の急速なリリースのテンポは、外部によるテストをますます重要にしている。Gemini Omni Flash は同社の最近の他のモデルリリースとは異なる製品ラインだが、運用パターンは馴染み深い:モデルは迅速にユーザーに届き、実際のワークロードが到来して初めて本番での挙動が可視化される。
Shrivastava のアバタービデオはユースケースが即応性を持つため、依然として説得力のあるデモである。同時にそれは単一のクリエイターによる結果であり、独立してベンチマークされた条件で作られたわけではない。Google のより大きな賭けは、汎用のマルチモーダルモデルが個別のアバター、ビデオ生成、編集製品が担ってきた仕事を吸収できるかどうかだ。今回のクリップはその統合が始まっていることを示している。使用枠を使い果たしたことは、専門特化したツールが依然として余地を持つ理由を示している。