Pokee AIが28Bのエージェントモデルを発表、1台のRTX 4090で1000万トークンを処理できると主張
Pokeeはモデルの重み、詳細なテスト構成、あるいはその長文コンテキストとスループットに関する主張を独立して評価するのに十分なアーキテクチャ情報を公開していません。
By Ryan Merket · Published · Updated
Primary source: Pokee AI on X
Why it matters
A usable 10-million-token model on one GPU could cut agent inference costs and keep sensitive enterprise data on private hardware. Pokee's claims still need independent replication.

Zheqing (Bill) Zhu (@ZheqingZhu)、Pokee AI の創業者兼CEOであるZhuは、8月4日火曜日にPokee-Isaac 28Bを発表しました。ベンダーが報告する結果によれば、この独自のエージェントモデルは単一のNvidia RTX 4090-class GPUで1000万トークンのコンテキストを処理できる可能性が示唆されています。
In its announcement on X、Pokeeはこの280億パラメータモデルがRULERでフルの1000万トークン長において93.3%を記録し、1台のGPUで事前入力(prefill)速度が最大137,000トークン/秒に達したと発表しました。同社はPokee-Isaacを、独自の「non-decoder-only」アーキテクチャに基づく「frontier-class agentic model」と説明しています。
これらの性能数値はPokeeの社内テストに由来します。同社はモデルの重みや詳細なテスト構成、非常に長いプロンプトに伴うメモリと計算要求をどのように低減しているかを評価者が判断できるだけの十分なアーキテクチャ情報を公開していません。Pokeeは発表への返信で将来バージョンをオープンソース化する意図があると述べていますが、そのリリースが同一の重みを使うかどうかや日付については明言していません。
今回主張されるコンテキスト長が発表の中心です。独立して再現されれば、1000万トークンのウィンドウは、エージェントが大規模な文書コレクション、コードリポジトリ、ツールカタログ、会話履歴を1セッションで検査できる可能性を開き、データを小さなチャンクに分割するリトリーバルシステムへの依存を減らせます。Pokeeのウェブサイトによれば、このモデルは顧客のインフラ内で動作しながら長期タスクを計画、実行、レビューするよう設計されています。
RULERはPokeeの見出しスコアの背後にあるベンチマークで、長い入力にわたるリトリーバル、多段追跡、および集約をテストする合成評価です。その原研究論文は、広告されるコンテキストウィンドウとモデルが実際に効果的に使用できるコンテキスト量を区別するように設計されました。強いRULERの結果は、テスト条件下でPokeeの長コンテキスト主張を支持しますが、企業のマルチステップワークフローにおける一般的な推論品質や信頼性を確立するものではありません。
Pokeeのローンチ用グラフィックはまた、同社のモデルがTerminal-Bench 2.1およびMCP-AtlasでGPT-5.6-Lunaと比較して遅れを取っている一方、同社が報告するBFCL v4およびtau3の平均ではわずかにリードしていることを示しています。グラフィックは比較を社内または外部ベンダー由来としてマークしています。Pokeeは主張する1000万トークン性能や単一GPUスループットの独立した再現を提供していません。
価格表示はPokeeのローンチ資料で一貫していません。ベンチマークのグラフィックでは入力トークン100万あたり$0.15、出力トークン100万あたり$1と宣伝されています。API documentation(8月4日アクセス)では、標準のPokee-Isaac層が入力トークン100万あたり$0.30、出力トークン100万あたり$5と記載されています。高推論レベルの層はそれぞれ$3と$15と記載されています。
Zhu's enterprise deployment bet
このモデルは、ZhuがMeta AIで応用強化学習を率いた後にPokeeにもたらした仮説を拡張するものです。Zhu's public biographyによれば、彼はMetaのPearl生産強化学習プロジェクトを率い、フルタイムで働きながらスタンフォードで強化学習のPhDを修了しました。彼は2024年に、生成されたテキストで止まるのではなく、アプリケーションを横断して計画しツールを使うエージェントを中心に据えてPokeeを創業しました。
その背景はPokeeの初期製品に反映されています。シアトル地域の同社はGoogle Workspace、Slack、GitHub、Notionなどのサービスにわたるツール選択とタスクのシーケンスに強化学習を適用しています。2025年7月、GeekWire reportedによれば、PokeeはPoint72 Venturesが主導する1200万ドルのシードラウンドを調達し、Qualcomm Ventures、Samsung NEXTなどが参加したと報じられました。報道時点でPokeeは収益を上げておらず、パブリックベータを運用していました。
単一GPUでの主張はZhuにとって潜在的なエンタープライズ向けセールス上の利点を与えますが、その重要性は独立した検証に依存します。Pokeeはホステッドアクセスと顧客のクラウドアカウント内でのprivate deploymentsを提供しており、同社のエージェントインフラはオンプレミスやエアギャップ環境で動作できると述べています。Pokeeが挙げるハードウェア上で真に1000万トークンを扱えるモデルは、大規模推論クラスタへの依存を減らし、企業が機密文書やワークフローデータをより厳密に管理することを可能にする可能性があります。
Pokeeは開発者が独自に検査・実行できる重みを公開する代わりに、APIおよびカスタムデプロイを通じてアクセスを提供しています。したがって、顧客がワークロードを自社ネットワーク内に保持している場合でも、同社はモデルとその配布に対するコントロールを保持します。
商業的な議論は現在、外部の開発者が開示された条件下で見出しの性能を再現できるかどうかに一部依存しています。それまでは、1000万トークンのRULERスコア、137,000トークン/秒のprefillレート、およびRTX 4090-classでのデプロイはすべてベンダー報告の結果にとどまります。