SpaceXAI 发布 Grok 4.6,拥有 500,000 令牌的上下文窗口

该模型保留了 Grok 4.5 的 $2/$6 基础 API 价格,增加了 500,000 标记的上下文窗口,并在 Cursor 和 Grok Build 上线。

By · Published

Primary source: VentureBeat

Why it matters

SpaceXAI is pairing Grok 4.6 with its Grok Build agent environment and Cursor distribution while SpaceX's proposed Anysphere acquisition remains pending. Its larger context window, benchmark gains and long-context price increase give developers concrete factors to assess against production reliability and total workload cost.

Illustration of SpaceXAI's Grok 4.6 being deployed across platforms, powering many autonomous agents and integrating into Cursor and Grok Build.

Elon Musk's SpaceXAI (on X) 在 8 月 12 日星期三宣布了 Grok 4.6,延续其快速模型发布节奏,推出了一个旨在在更长的编码和知识型工作任务中保持专注的系统。

8 月 12 日的公告 将 Grok 4.6 定位为一个实用的 agent 模型:能够研究不熟悉的主题、浏览代码库、操作工具,并通过一系列步骤将一个宽泛的产品想法转化为可运行的软件。其基础 API 价格仍为每百万输入 tokens 收费 2 美元、每百万输出 tokens 收费 6 美元,这与 SpaceXAI 为 Grok 4.5 设定的费率相同。

这些基准提升、不变的基础定价以及通过 Cursor 的分发,为开发者评估 Grok 4.6 用于更长的编码和知识工作提供了多个理由。性能提升为工程组织重新运行模型评估提供了动机,而不变的入门价格则允许对更大规模的工作负载进行测试。

VentureBeat 报道 指出 Grok 4.6 在 Artificial Analysis Intelligence Index 上得分为 61,比 Grok 4.5 高出五分。据报道,该分数使 Grok 超过了 Moonshot AI 的 Kimi K3,并与 OpenAI 的 GPT-5.6 Sol Max 持平。SpaceXAI 的 已公布评估表 显示 Grok 4.6 在 Artificial Analysis Intelligence Index 上得分为 61,并详列了其基准结果。

SpaceXAI 的公告确认 Grok 4.6 在发布时已在 Cursor 和 Grok Build 中提供。该发布另列出了 API、OpenRouter、Vercel 和 Cloudflare 作为分发渠道,但并未确定在所有列出的合作方中均实现首日可用性。

一位创始人整合其技术栈

SpaceX 在 2026 年 2 月 2 日宣布收购 xAI。xAI 在 2026 年 1 月宣布了一轮 200 亿美元的 Series E 融资,参与方包括 Valor Equity Partners、StepStone Group、Fidelity、Qatar Investment Authority、MGX、Baron Capital、NVIDIA 和 Cisco Investments。

Musk 的经营历史横跨软件、支付、电动汽车和火箭。Tesla 的公司简介 将其列为宾夕法尼亚大学物理和商学毕业生,曾共同创办 Zip2 和 PayPal,随后领导 SpaceX 和 Tesla,并创立了 Neuralink 和 The Boring Company。

二月的合并使 SpaceXAI 纳入更大的 SpaceX 公司结构。SpaceXAI 通过其 API 提供 Grok 4.6,而 Grok Build 提供 agent 环境。Cursor 为软件开发者提供访问途径,不过 SpaceX 提议收购其母公司一事仍在待决中。

AP 报道 称 SpaceX 同意以约 600 亿美元的股票收购 Cursor 的母公司 Anysphere。该交易预计将在 2026 年第三季度完成,但需满足交割条件并获得监管批准,因此 Grok 4.6 在 Cursor 中的可用性早于任何已完成的收购。

Cursor 支持来自多个前沿实验室的模型,包括与 SpaceXAI 直接竞争的公司。因此 Grok 在一个同时为开发者提供对竞争模型访问权的编码环境中争夺使用率。

在上下文变长前,价格保持较低

SpaceXAI 报价的 API 费率需要一个限定条件。该 $2 输入和 $6 输出的价格 适用于提示长度低于 200,000 tokens 的情况。在达到或超过该阈值时,费率将翻倍,变为每百万输入 tokens 收费 4 美元、每百万输出 tokens 收费 12 美元。一旦提示越过该阈值,较高的费率将适用于请求中的所有 tokens。

模型文档 列出 500,000-token 的上下文窗口、文本和图像输入、结构化输出、推理和函数调用能力。

对于一个需要反复读取代码仓库、工具结果及其先前工作的 agent 来说,200,000-token 的界限可能会实质性地改变费用。SpaceXAI 仍将 Grok 4.6 的定价置于 VentureBeat 比较中若干高级前沿模型之下,但购买方需要测试完整的任务轨迹,而不是仅比较定价表的首行。

SpaceXAI 还提供了一个更快的 Grok 4.6 变体,价格为标准价的两倍。这为那些对延迟更敏感、愿意为更低延迟支付更高 token 账单的工作负载创造了第二种商业选项。

基准提升仍留终端工作缺口

SpaceXAI 表示 Grok 4.6 比 Grok 4.5 接受了更长时间的补充训练。SpaceXAI 使用了经过策划的模型生成推理和技术数据、工程数据、更新的优化器和修订的训练配方。随后 Grok 4.5 生成了跨推理、软件工程、STEM 和知识工作的新监督微调轨迹,并通过基于模型的检查过滤有问题的轨迹。

强化学习侧重于编码、网页开发、计算机辅助设计、内核优化和通用知识工作。SpaceXAI 表示,结果模型在长时任务中做了更多的自我测试和验证。这些行为声明来自内部测试,需要在实际部署中得到验证。

SpaceXAI 的 已公布评估表 显示出显著的代际改进,但并非全面领先。Grok 4.6 在 DeepSWE v1.1 上得分 65.9%,高于 Grok 4.5 的 54%,而 GPT-5.6 Sol Max 得分为 73%。在 CursorBench v3.2 上其得分为 69.9%,相比之下 Fable 5 Max 为 70.5%。在 APEX-Agents 上,Grok 4.6 提升了 10.4 个百分点,达到 57.5%,击败了列出的 GPT-5.6 Sol Max(56.7%),但落后于 Fable 5 Max(59.2%)。

Terminal-Bench v3.0 仍然是一个明显弱项。Grok 4.6 从 15.7% 提升到 26%,而 GPT-5.6 Sol Max 和 Fable 5 Max 的对比得分分别为 34.6% 和 34.1%。该模型在终端工作方面变得更有能力,但尚未缩小差距。

Artificial Analysis 将其能力指标描述为独立运行基准的复合结果,并警告任何指数都可能无法直接映射到特定的生产用例。61 分对进行试用是有用的证据,但并不能确立其在组织的代码仓库、工具、权限和审查流程中的可靠性。

Grok 4.6 比 Grok 4.5 晚四周发布

Grok 4.6 紧随 7 月 16 日发布的 Grok 4.5,并保留其前身的基础 token 定价。RuntimeWire 之前将 Grok 4.5 描述为 Musk 针对高级编码模型的价格武器。此次新版本在保持基础定价的同时提升了基准得分。

发布公告确认 Grok 4.6 在 Cursor 和 Grok Build 中可用,并在首周在两款产品中均提供两倍的包含使用量。其入门部分还将 API、OpenRouter、Vercel 和 Cloudflare 列为分发渠道。Grok Build 的访问从每月 30 美元的 SuperGrok 计划开始。

Agent 的性能受模型周边软件的塑造:上下文如何组装、何时调用工具、如何检测失败以及哪些事项需要人工批准。Grok Build 为 SpaceXAI 提供了一个产品层,使其可以围绕 Grok 4.6 调整该 agent 体验。

SpaceXAI 现在负责训练模型,提供 Grok Build agent 环境,销售推理服务,并在 SpaceX 推进对 Cursor 母公司 Anysphere 的收购过程中在 Cursor 内部分发 Grok。Grok 4.6 的基准结果支持进一步评估,但持续使用将取决于生产可靠性、总体工作负载成本以及在各个编码 agent 内的表现。

Reader comments

Conversation for this story loads after sign-in.