Pokee AI 推出 28B 代理模型,声称在一块 RTX 4090 上可处理 1000 万个 tokens

Pokee 并未发布模型的权重、详细的测试配置或足够的架构信息,无法独立评估其关于长上下文和吞吐量的说法。

By · Published · Updated

Primary source: Pokee AI on X

Why it matters

A usable 10-million-token model on one GPU could cut agent inference costs and keep sensitive enterprise data on private hardware. Pokee's claims still need independent replication.

Pokee AI ships closed-source (for now) 28B model designed for 10-million-token workloads — Isaac is closed source, starts on RTX 4090-class hardware and targets private enterprise deployments, according to Pokee.

Zheqing (Bill) Zhu (@ZheqingZhu)Pokee AI 的创始人兼首席执行官,于 8 月 4 日星期二推出了 Pokee-Isaac 28B,供应商报告的结果显示该专有代理模型在单块 Nvidia RTX 4090-class GPU 上可处理 1000 万 token 的上下文。

在其在 X 上的公告中,Pokee 表示这款 280 亿参数模型在完整 1000 万 token 长度下在 RULER 上得分为 93.3%,并在一块 GPU 上达到了最高每秒 137,000 token 的预填充速率。公司将 Pokee-Isaac 描述为基于专有“非仅解码器”架构的“前沿级具代理能力的模型”。

这些性能数据来自 Pokee 的内部测试。公司尚未公开模型权重、详细测试配置或足够的架构信息,供外界评估其如何降低与非常长的提示相关的内存和计算需求。Pokee 在对公告的回复中表示,打算在未来开源一个版本,但未说明该发布是否会使用相同的权重或给出日期。

此次发布的核心在于所宣称的上下文长度。如果能被独立复现,1000 万 token 的窗口可以让代理在一次会话中检查大型文档集合、代码仓库、工具目录和对话历史,而不必像以前那样在很大程度上依赖将数据拆分为较小块的检索系统。Pokee 的网站称该模型旨在在客户基础设施内计划、执行并审查长期运行的任务。

RULER,是支撑 Pokee 头条分数的基准,是一种合成评估,用于测试在长输入上检索、多跳追踪和聚合。其原始研究论文旨在区分宣传的上下文窗口大小与模型能有效利用的上下文量。强劲的 RULER 结果将在被测试条件下支持 Pokee 的长上下文主张,但它并不能确立在多步骤企业工作流中的总体推理质量或可靠性。

Pokee 的发布图表还显示其模型在 Terminal-Bench 2.1 和 MCP-Atlas 上落后于标为 GPT-5.6-Luna 的系统,而在公司报告的 BFCL v4 和 tau3 平均分上则略微领先。图表将比较标注为内部或来自外部供应商。Pokee 尚未提供对所宣称的 1000 万 token 性能或单 GPU 吞吐量的独立复现。

在 Pokee 的发布材料中,定价存在不一致。基准图表宣传为每百万输入 token 收费 $0.15,每百万输出 token 收费 $1。Pokee 的API 文档(2025 年 8 月 4 日访问)将标准 Pokee-Isaac 等级列为每百万输入 token $0.30、每百万输出 token $5。一个高推理等级分别列为 $3 和 $15。

Zhu 的企业部署押注

该模型延续了 Zhu 在加入 Pokee 时带来的论点,此前他在 Meta AI 负责应用强化学习。根据Zhu 的公开传记,他领导了 Meta 的 Pearl 生产强化学习项目,并在全职工作的同时完成了斯坦福的强化学习博士学位。他于 2024 年创办了 Pokee,围绕可在各类应用中规划并使用工具的代理展开,而不仅仅停留在生成文本。

这一背景塑造了 Pokee 的初始产品。这家位于西雅图地区的公司将强化学习应用于跨 Google Workspace、Slack、GitHub 和 Notion 等服务的工具选择与任务排序。2025 年 7 月,GeekWire 报道称 Pokee 完成了一轮由 Point72 Ventures 领投的 1200 万美元种子轮,参与方包括 Qualcomm Ventures、Samsung NEXT 及其他投资者。报道指出,Pokee 当时尚未实现营收,并在运营公开测试版。

单 GPU 的声明为 Zhu 提供了一个潜在的企业销售论点,但其重要性取决于独立验证。Pokee 提供托管访问以及在客户云账户中的私人部署,并表示其代理基础设施可以在本地或隔离网络环境中运行。若模型确实能在 Pokee 指定的硬件上处理 1000 万 token,可能会减少对大型推理集群的依赖,并让公司对敏感文档和工作流数据拥有更严格的控制。

Pokee 通过其 API 和定制部署提供访问,而不是发布开发者可检视和独立运行的权重。因此,即便客户将工作负载保留在自己的网络边界内,公司仍保留对模型及其分发的控制权。

商业论点在一定程度上现在取决于外部开发者能否在披露的条件下复现头条性能。在那之前,1000 万 token 的 RULER 得分、每秒 137,000 token 的预填充速率以及 RTX 4090-class 部署仍为供应商报告的结果。

Reader comments

Conversation for this story loads after sign-in.