GitHub 将 xAI 的 Grok 4.6 添加到 Copilot,以支持长时间运行的编码代理

xAI 的 Grok 4.6 在发布两天后进入 GitHub 的 IDE、命令行和企业工作流,并以按使用量计费的方式提供。

By · Published

Primary source: GitHub Changelog

Why it matters

Grok 4.6 reached GitHub Copilot two days after launch, giving xAI a route into established developer and enterprise workflows. The integration makes distribution, cost and agent reliability as important as provider-published benchmark scores.

GitHub adds xAI's Grok 4.6 to Copilot for long-running coding agents

Elon Musk (@elonmusk) 的 xAI 在 8 月 14 日将 Grok 4.6 引入 GitHub Copilot,将这款两天前发布的推理模型扩展到 GitHub 的编辑器、命令行工具和云端编码代理。

GitHub 正在向 Copilot Pro、Pro+、Max、Business 和 Enterprise 订阅用户推出 Grok 4.6。开发者将能够在 Visual Studio Code、Visual Studio、Copilot CLI、Copilot 云代理、Copilot 应用、JetBrains IDEs、Xcode 和 Eclipse 中选择它。GitHub 表示可用性将逐步扩展,而不会立即覆盖所有合资格账户。

对 Musk 而言,Copilot 的集成为 xAI 提供了一个直接进入既有开发环境的路径。Musk 于 2023 年创立 xAI,使命是构建推动科学发现和对宇宙理解的 AI。SpaceX 于 2026 年 2 月 2 日收购了 xAI,xAI 的官方网站现在使用 SpaceXAI 品牌,同时继续以 Grok 名称发布模型。

GitHub 的领导层页面将 Mario Rodriguez 列为其首席产品官。Microsoft 于 2018 年以 75 亿美元收购了 GitHub,为 Copilot 提供了一个与开发者已经使用的代码托管、审查和部署工作流相绑定的分发基础。

xAI 正通过他人的工作流交付

xAI 在 8 月 12 日发布了 Grok 4.6,重点是长时间运行的代理、编码和多步知识工作。发布时,Grok 4.6 可通过 Cursor、Grok Build、xAI 的 API、OpenRouter、Vercel 和 Cloudflare 使用。GitHub Copilot 在两天后跟进。

这一发布顺序显示了 Musk 在吸引开发者采用方面的策略。xAI 将 Grok 放入那些已经拥有开发者关系的独立工具中,包括 GitHub 的 IDE、命令行、云代理和企业产品。

GitHub 的模型目录也已成为一个独立的分发市场。其支持的模型文档 列出了来自 OpenAI、Anthropic、Google、Microsoft、Moonshot AI 和 xAI 的模型。开发者可以在它们之间进行选择,而 GitHub 控制着界面、计费和策略设置。

因此,Grok 4.6 作为拥挤选择器中的一个选项进入 Copilot。xAI 可以在不替换开发者开发环境的情况下接触到 GitHub 的客户。GitHub 则在 Copilot 中获得了另一个在能力和价格上竞争的提供方。

基准测试结果喜忧参半

GitHub 表示其内部测试在 Visual Studio Code 和 Copilot CLI 的基于终端的编码任务上取得了强劲结果,尤其是在需要持续推理和工具使用的较长工作流中。GitHub 没有公布该评估背后的任务集、错误率、样本量或直接对比。

xAI 自身的发布 提供了更详细的一组由提供方发布的得分。xAI 报告称 Grok 4.6 在 CursorBench v3.2 上得分为 69.9%,领先于其列出的 GPT-5.6 Sol 的 67.2%,但落后于 Claude Fable 5 的 70.5%。在 DeepSWE v1.1 上,xAI 报告 Grok 4.6 得分为 65.9%,而 GPT-5.6 Sol 为 73%,Fable 5 为 70%。

终端结果与 GitHub 的公告尤其相关。xAI 报告 Grok 4.6 在 Terminal-Bench v3.0 的得分为 26%,低于它为 GPT-5.6 Sol 和 Fable 5 公布的 34.6% 和 34.1%。在 Artificial Analysis Intelligence Index 上,xAI 报告 Grok 4.6 的得分为 61,与其公布的 GPT-5.6 Sol 结果相同,落后 Fable 5 一分。xAI 表示其表格中的第三方模型得分来自开发者发布的 system cards 或公开基准排行榜。

这些由提供方发布的结果将 Grok 4.6 置于具有竞争力的编码模型之列,但并未独立确立其为该类别的领导者。GitHub 的推出为开发者提供了一个实际的方法来测试 xAI 报告的优势是否能从基准环境转移到代码仓库工作、调试会话和依赖大量工具的代理运行中。

xAI 表示 Grok 4.6 比 Grok 4.5 进行了更长时间的补充训练,使用了模型生成的推理数据、工程数据和涵盖通用编码、内核优化、网页开发与计算机辅助设计的强化学习任务。xAI 还表示在更长的轨迹中观察到更多的自我测试与验证。这两项说法均来自 xAI 自身的评估过程。

令牌使用将决定实际成本

GitHub 正在向 Copilot Pro、Pro+、Max、Business 和 Enterprise 订阅用户推出 Grok 4.6。该模型在 Copilot 的按使用量计费系统下按提供方列示价格计费。

GitHub 的当前定价表 设定了适用的模型和请求费率。该表对 Grok 4.5 和 Grok 4.6 列出相同的费率,这使得在性能提升而列示的令牌价格未上升的情况下,新模型可以作为直接替代候选。

长时间运行的编码代理仍可能产生高额账单,因为它们会反复读取文件、调用工具、消耗测试输出并修改代码。模型的标示价格无法反映代理循环的时长与行为。

Business 和 Enterprise 管理员必须明确启用 Grok 4.6 策略,该策略默认处于关闭状态。这个门槛让组织有机会在开发者通过新的提供方将仓库上下文发送出去之前评估成本、数据处理和模型行为。

Musk 的分发押注

xAI 在 2026 年 1 月表示其从 Valor Equity Partners、StepStone Group、Fidelity Management & Research、Qatar Investment Authority、MGX 和 Baron Capital 筹得了 200 亿美元的 Series E 融资,NVIDIA 和 Cisco Investments 作为战略投资者参与其中。xAI 表示这笔融资将支持计算基础设施和产品部署。不到一个月后,SpaceX 收购了 xAI。

Grok 4.6 进入 Copilot 将这些资金支持到了一个直接的产品策略上:训练出具备足够推理能力以应对更长代理运行的模型,然后将它们放到开发者已经工作的地方。GitHub 提供客户访问和企业控制。xAI 为 GitHub 的多提供方编码层提供了另一个模型。

下一个考验将体现在 GitHub 和 xAI 尚未公布的使用数据中:开发者选择 Grok 4.6 的频率、其代理运行持续的时长、这些运行的成本,以及团队在将其代码和工具使用与 Copilot 中的其他模型比较后是否继续启用它。

Reader comments

Conversation for this story loads after sign-in.