Ashutosh Shrivastava 的五月 Gemini Omni Flash 演示耗尽了五小时的时长限制。
Ashutosh Shrivastava 5月25日的演示显示,Gemini Omni Flash 生成了一个个人头像视频,而据报道,单个提示就耗尽了五小时的使用额度。
By RuntimeWire Staff · Published
Primary source: Aligned News - AI Intelligence
Why it matters
Google put personal-avatar video inside Gemini and planned availability for YouTube Shorts and YouTube Create. Shrivastava's test showed that failed generations and compute limits could still keep the feature from becoming a dependable production workflow.

2026年5月25日,人工智能顾问兼技术创作者 Ashutosh Shrivastava 发布了一段 Gemini Omni Flash 片段,展示了一个合成的他本人根据提示呈现的视频。该演示揭示了 Google 在其宣称可以“从任何输入创建任何东西”的宏大主张中所包含的一个实用产品:只需录制一次自己,写一个提示,然后让合成的自己出现在镜头前。
Shrivastava 是一名人工智能顾问和技术创作者,而非 Google 员工。他的网站 表示他曾与 150 多位客户合作,并参与了 Gemini 和其他生成媒体产品的抢先使用计划。这使他成为 AI 研究机构日益重要的分发层的一部分:那些测试未完成产品、识别可行用例并为模型难以在模型卡中解释的功能赋予人类面孔的创作者。(Ashutosh Shrivastava)
在 Shrivastava 的案例中,人脸也是产品输入。Google 的头像工作流程要求用户录制一段短的面部和声音样本,然后在 Gemini 提示中选择该个人头像。在 Gemini Apps 中,创建头像要求用户至少 18 岁并登录带有 Google AI 计划的个人 Google 帐户。符合条件的 Google Workspace 用户也可以在 Google Vids 中使用个人头像。Gemini Apps 中的个人账号视频生成功能需要 Google AI 计划,而工作或学校账号则需要符合条件的 Google Workspace 许可证。(Google Gemini Apps Help)
一个广泛的视频模型找到具体工作
Google 于 2026 年 5 月 19 日推出了 Gemini Omni Flash,作为其 Gemini Omni 家族中的首个模型。该模型接受文本、图像、音频和视频的组合输入,然后生成带音频的短视频。用户可以通过持续对话对物体、动作、摄像机位置、环境和风格提出更改请求。Google 已开始通过 Gemini 应用和 Google Flow 推出该功能,并表示计划在 YouTube Shorts 和 YouTube Create 上提供。(Google)
头像功能是 Gemini Apps 内的一个工作流程,而不是名为 “Gemini Avatar” 的单独发布产品。这个区分很重要,因为 Google 的优势来自于将几种创作模式结合到其已分发的产品中。用户可以提供自己的身份、生成场景并通过提示继续编辑,而无需转到专门的演示者视频服务。
专门公司在更窄的版本上构建了类似的工作流程。HeyGen 的 Avatar IV 将单张图像动画化,并同步语音、面部动作和手势。Synthesia 将 avatars 与脚本、翻译、品牌控制和协作功能打包,面向企业视频。Google 的模型则不那么为单一用途而生。它的宣传覆盖个人头像以及电影级生成、视频编辑和多模态引用。(HeyGen)
这种广度为 Google 提供了多条进入市场的路径,但 Shrivastava 的片段比“从任何输入创建任何东西”这类说法更具说服力。创始人和小型营销团队能理解可重复使用的数字主持人:它可以将脚本变成产品更新、本地化测试或社交短片,而无需再次录制。演示并不能证明该工作流程足够可靠以替代生产流程。
同一次测试也暴露了实现它的成本
2026 年 5 月 26 日,Shrivastava 报告称一次头像视频提示运行了大约四分钟,消耗了他整整五小时的 Gemini 使用配额,并且最初未能生成视频,据 ComputerBase 报道。报道说该片段在限制到期后完成。
这一事件捕捉到了令人印象深刻的输出与可靠工具之间的差距。视频生成比文本或图像生成带来更高的计算成本,当一次失败的尝试就可能耗尽用户可用容量时,围绕该工作流程构建就变得困难。到 6 月 30 日,Google 已经向开发者预览开放了 Gemini Omni Flash,但公开的 API 限制仍然有限:输出时长为 3 到 10 秒,分辨率为 720p,帧率为每秒 24 帧。预览模型使用 ID 为 gemini-omni-flash-preview。(Google AI for Developers)
Google 自己的 Gemini Omni Flash model card 对这些光鲜演示划定了边界。它表示在编辑一致性、复杂运动和精确文本渲染方面仍存在挑战。(Google DeepMind)
这些警告并不抹杀 Shrivastava 所生成的内容。它们界定了在个人头像成为常规生产基础设施之前仍需完成的工作。最有力的即时用途是短格式的试验,创作者可以容忍再尝试一次,而且简短的片段仍能传达信息。更长、更可重复的活动则需要可预测的生成时间、更明确的容量限制以及跨多个场景的连续性。
创作者是 Google 启动机制的一部分
Shrivastava 将他的工作描述为测试早期产品、提供反馈并将新功能转化为面向受众的故事。Gemini Omni Flash 展示了这一角色为何重要。Google 的公告解释了多模态输入和会话式编辑,而 Shrivastava 将这些说辞压缩为:一个人在键入一条指令,然后看着一个自己的版本去执行它。(Ashutosh Shrivastava)
这种关系也是双向的。创作者可以制作让模型变得容易理解的演示,然后发布官方启动视频会省略的失败生成和速率限制问题。这对开发者比另一个完美样本更有用。它既展示了目的地,也展示了到达目的地当前的成本。
Google 的快速发布节奏使得外部测试变得越来越重要。Gemini Omni Flash 属于与公司近期其他模型发布不同的产品线,但其运行模式熟悉:模型快速到达用户端,只有真实工作负载出现后,生产行为才会显现。
Shrivastava 的头像视频之所以仍然有说服力,是因为其用例是立刻可用的。它也仍然只是单一创作者的成果,在尚未经过独立基准测试的条件下生成。Google 更大的赌注是,一个通用的多模态模型能够吸收由独立的头像、视频生成和编辑产品承担的任务。该片段显示了这种整合的开始,而耗尽的使用配额则表明专业化工具仍有存在的空间。