Pikaの4月の開示、低コストのリアルタイム動画向け単一GPUアーキテクチャを詳述
創業者のDemi GuoとChenlin Mengは、Pikaのクリエイター向け価格を1 GPUのストリーミングアーキテクチャに連動させつつ、モデルのコストは非公開にしている。
By RuntimeWire Staff · Published
Primary source: Pika
Why it matters
Pika is turning model efficiency into a distribution strategy: one-GPU serving can support lower prices, faster iteration and live video agents without letting compute costs scale unchecked.

Pikaのフォローアップ動画は、その音声料金をトレーニングと推論効率の変化と結びつけ、個々のモデルの経済性の説明を始めている。
経済性が重要なのは、Pikaが生成された動画を会話型製品や高頻度のクリエイター向けワークフローに移行させようとしているためで、そこで追加されるGPUや遅延の1秒ごとにユーザーへのサービス提供コストが累積する。Pikaの公開説明は個々のモデルレベルから始まるが、トレーニング費用、生成秒あたりの推論コスト、利用率、もしくは粗利は提示していない。
この開示はMengの研究的背景をPikaの製品戦略の中心近くに置いている。Pikaを共同創業する前、MengはStanfordで数学を学び、Stefano Ermonの指導の下でコンピュータサイエンスのPhDを追求した。Her published work には、DDIMという、画像生成に必要なデノイジングステップ数を減らすことを目的とした初期の拡散サンプリング手法や、ガイド付き拡散モデルをより少ない評価で動作するシステムに蒸留する後の研究が含まれる。
Guo、PikaのCEOは創作ツールに対する並行した関心をもたらした。彼女はHarvardで数学とコンピュータサイエンスを学び、Stanfordで自然言語処理とグラフィックスを横断する博士課程の研究を開始した。Guoは技術と詩を自身の二つの初期の関心事として述べており、Forbes に対してAIが創作生産と出会う場所で働きたいと語っている。GuoとMengは、利用可能なAIビデオツールが使いにくいと感じたため2023年にStanfordを離れた。
The cost story starts with one GPU
Pikaはその主張の最も明確な技術的根拠を、2026年4月2日にFundamental Research Teamがarchitecture, training process and inference pipeline behind PikaStream1.0を公開したときに提示した。
PikaStreamは、ライブAIエージェント向けに連続的でアイデンティティの一貫性を保つ顔を生成するよう構築された音声条件付きビデオシステムである。Pikaによれば、単一のNvidia H100 GPUで24fpsの480pビデオを生成し、音声入力と動画応答の開始の間に約1.5秒あるという。
Pikaの説明によれば、その前身であるPikaformanceは1レスポンスあたり8GPUを必要とし、応答に約4.5秒かかった。Pikaはこの比較を、推論コストが低くなる最も明確な説明として提示している:PikaStreamは1レスポンスあたりのGPUを8分の1に削減し、報告されたレイテンシを3分の1に短縮している。Pikaはこれらの改善を生成分あたりのドルコストに換算して提示しておらず、したがって計算リソースの節約とエンドユーザー価格の関係は不完全なままである。
システムは、ストリーミングTransformer変分オートエンコーダ、90億パラメータの拡散トランスフォーマ、そして人物のアイデンティティを保持することを目的とした参照画像注入を組み合わせている。PikaはFlashVAEデコーダが単一H100で480p時にピークメモリ1.1GBを使用しながら441fpsに到達すると述べている。
Pikaはまず拡散モデルをシーケンス全体を考慮できる双方向のteacherとしてトレーニングし、それを順にチャンクを生成する因果的なstudentに蒸留した。固定のコンテキストウィンドウにより、ビデオが伸びるにつれて各新しいチャンクの処理コストは一定に保たれる。Pikaはまた、最適化されたself-forcing手法により、最終デノイジングステップからキャッシュされたkey-value状態を再利用することで各チャンクごとの追加のフォワードパスを排除していると述べている。
これらの決定はPikaが論じている二つのコストセンターに対処している:デプロイ可能なモデルを生成するために必要な作業と、誰かがモデルを使用するたびに消費されるGPU容量だ。蒸留はサービングモデルがより少ないステップで動作できるようにトレーニング側に労力を移す。ストリーミングは完全なシーケンスを待つことを避ける。統合された推論パイプラインは音声認識、言語モデルによる推論、テキスト読み上げ、ビデオ生成を逐次ではなく同時に実行する。
Pikaによれば、事前学習コーパスには約1,000万クリップが含まれ、より選択的なファインチューニング用コーパスはおおよそ100万クリップ規模であった。Pikaはそれらのクリップを処理するために使用した計算量や、データセットの取得およびフィルタリングのコストを公開していない。クリップ数と性能数値は独立した監査結果ではなく、Pika自身の計測値のままである。
Consumer pricing makes efficiency a product constraint
Pika's current pricing page はPikaformanceの音声1秒ごとに3クレジットを課金している。したがって10秒の会話クリップは30クレジットを消費し、有料製品は最大30秒の音声をサポートしている。Pikaは月額のサブスクリプションを$10から$95まで提示しており、80ビデオクレジットの無料プランも併せて提供している。
その構造は推論が安くなるとPikaに直接的に報いる。Pikaはクレジット価格を維持して各生成のマージンを改善するか、請求されるクレジット数を減らすか、あるいは節約をより速いキューやより高い使用許容量に充てることができる。Pikaは効率改善のどの部分をクリエイターに還元しているかについては述べていない。
製品はまた、なぜレイテンシが経済モデルの一部であるかを露呈している。ソーシャルクリップを生成する場合、6秒の待ち時間は許容されることがあるが、ライブ会話では致命的だ。応答時間を約1.5秒に短縮することは、編集機能から恒常的なビデオエージェントへの道をPikaに与える。そこで推論は継続的に実行され、不効率なサービングは急速に高コストになる。
Meng's research is becoming Pika's operating model
PikaのアプローチはMengの学術的仕事に見られる流れに従っている:拡散生成を遅くしている繰り返し評価を減らし、次に展開の制約に沿ってモデルを設計する。フォローアップの説明はその研究系譜を商業的な主張に変える。Pikaはクリエイターや開発者に対して、その価格設定を導入期の補助金ではなく工学的な成果として見てほしいと考えている。
Pikaは大規模なビデオシステムをトレーニングし提供するための資本を持っていた。2024年6月5日、PikaはSpark Capitalが主導し、Greycroft、Lightspeed、Neo、Makers Fundが参加する$80 million Series Bを発表した。Pikaはこの資金調達により調達総額が$135 millionになったと述べた。
その資金はPikaにファウンデーションモデル研究を追求する余地を与えたが、8GPUから1GPUへの移行こそが技術的デモンストレーションを持続的な使用に耐える製品へと変え得るものだ。GuoとMengはその効率性をPikaのセールスケースの一部にしている。残された試験は、Pikaがクリエイターや開発者に対して、モデル、ワークロード、競合他社間で主張を比較できるだけのコスト曲線を十分に開示するかどうかだ。