Pika 在四月披露中详细介绍了用于降低成本的实时视频的单 GPU 架构

创始人 Demi Guo 和 Chenlin Meng 将 Pika 的创作者定价与单 GPU 流式架构挂钩,同时对模型成本保密。

By · Published

Primary source: Pika

Why it matters

Pika is turning model efficiency into a distribution strategy: one-GPU serving can support lower prices, faster iteration and live video agents without letting compute costs scale unchecked.

Pika details the engineering behind cheaper audio-driven video — Founders Demi Guo and Chenlin Meng are tying Pika's creator pricing to a one-GPU streaming architecture, while keeping full model costs private.

Pika 的后续视频将其音频定价与训练和推理效率的变化联系起来,开始解释单个模型的经济学。

经济学很重要,因为 Pika 试图将生成视频转入对话产品和高频创作者工作流,在这些场景中每增加一块 GPU 和每增加一秒的延迟都会成倍地增加为用户提供服务的成本。Pika 的公开解释从单个模型层面开始,尽管它没有提供训练账单、每生成秒的推理成本、利用率或毛利率。

该披露将 Meng 的研究背景置于 Pika 产品策略的核心位置。在共同创立 Pika 之前,Meng 在 Stanford 学习数学,并在 Stefano Ermon 的指导下攻读计算机科学博士。她的 已发表的工作 包括 DDIM,一种早期的扩散采样方法,旨在减少生成图像所需的去噪步骤,以及后续关于将引导扩散模型蒸馏为需要较少评估的系统的研究。

Pika 的 CEO Guo 对创意工具也有平行的兴趣。她在 Harvard 学习数学和计算机科学,随后在 Stanford 开始了涵盖自然语言处理和图形学的博士研究。Guo 曾将技术和诗歌描述为她最早的两个兴趣,并在接受 Forbes 采访时表示,她想在 AI 与创意生产交汇的地方工作。Guo 和 Meng 在 2023 年离开 Stanford,此前他们发现当时可用的 AI 视频工具难以使用。

The cost story starts with one GPU

Pika 在 2026 年 4 月 2 日给出了其论点最清晰的技术依据,当日其 Fundamental Research Team 发布了 PikaStream1.0 背后的架构、训练过程和推理管道

PikaStream 是一个以音频为条件的视频系统,旨在为实时 AI 代理生成连续且身份一致的面部视频。Pika 表示它可以在单块 Nvidia H100 GPU 上以 480p、24 帧每秒的速度生成视频,从语音输入到视频响应开始大约需要 1.5 秒。

据 Pika 称,其前身 Pikaformance 需要八块 GPU,并且每次响应大约需要 4.5 秒。该比较为较低的推理成本提供了最清晰的解释:PikaStream 在一次响应中使用的 GPU 仅为原来的八分之一,并将报告的延迟减少了三分之二。Pika 还没有将这些收益换算成每生成分钟的美元成本,因此计算节省与终端用户价格之间的关系仍不完整。

该系统结合了一个流式 Transformer 变分自编码器、一个 90 亿参数的扩散 Transformer 和旨在保持人物身份的参考图像注入。Pika 表示 FlashVAE 解码器在 480p 下可达每秒 441 帧,单块 H100 的峰值内存使用约为 1.1 GB。

Pika 先将扩散模型训练为可以考虑整个序列的双向教师(bidirectional teacher),然后将其蒸馏为按序列生成块的因果学生(causal student)。固定的上下文窗口使得随着视频增长,每个新块的处理成本保持恒定。Pika 还表示其优化的 self-forcing 方法通过重用来自最终去噪步骤的缓存键值状态,消除了每个块额外的一次前向传递。

这些决策针对 Pika 正在讨论的两个成本中心:生产可部署模型所需的工作量以及每次有人使用它时消耗的 GPU 容量。蒸馏将工作转移到训练端,以便服务模型能以更少的步骤运行。流式处理避免了等待完整序列。融合的推理管道并行运行语音识别、语言模型推理、文本转语音和视频生成,而不是串行执行。

Pika 表示其预训练语料大约包含 1000 万个片段,之后的更有选择性的微调语料级别约为 100 万个片段。Pika 尚未公布处理这些片段所用的计算量或数据集的获取与过滤成本。片段数量和性能数据仍为 Pika 的测量结果,而非独立审计的结果。

Consumer pricing makes efficiency a product constraint

Pika 的当前定价页面 对每秒 Pikaformance 音频收费 3 积分。一个 10 秒的讲话片段因此消耗 30 积分,而付费产品支持最长 30 秒的音频。Pika 列出了从 $10 到 $95 的月订阅选项,同时有一个提供 80 个视频积分的免费计划。

这种结构在推理变得更便宜时直接奖励 Pika。Pika 可以保留积分价格同时提高每次生成的利润率、减少每次生成收取的积分数量,或者将节省下来的成本用于更快的排队和更高的使用配额。Pika 尚未说明其效率改进中的哪一部分正在传递给创作者。

该产品也揭示了为什么延迟是经济模型的一部分。当创作者生成社交短片时,6 秒的等待可能是可以接受的,但它会破坏一次实时对话。将响应时间缩短到大约 1.5 秒为 Pika 提供了一条从编辑功能进入持久视频代理的路径,在那种情况下推理可能持续运行,低效的服务很快会变得昂贵。

Meng's research is becoming Pika's operating model

Pika 的做法延续了 Meng 学术工作的脉络:减少使扩散生成缓慢的重复评估,然后围绕部署约束设计模型。后续的解释将这一研究谱系转化为商业论点。Pika 希望创作者和开发者将其定价视为工程结果,而不是入门补贴。

Pika 有资金来训练和提供大型视频系统。2024 年 6 月 5 日,Pika 宣布了由 Spark Capital 领投的 8000 万美元 B 轮融资,参与方包括 GreycroftLightspeedNeoMakers Fund。Pika 表示此次融资使其累计融资总额达到 1.35 亿美元。

这笔资金为 Pika 追求基础模型研究提供了空间,但从八块 GPU 到一块的转变才是可以将技术演示变为能够承受持续使用的产品的关键。Guo 和 Meng 正在将这种效率作为 Pika 的销售论点的一部分。剩下的考验是 Pika 是否会披露足够多的成本曲线数据,以便让创作者和开发者能够在不同模型、工作负载和竞争对手之间比较这些主张。

Reader comments

Conversation for this story loads after sign-in.