Microsoft 在推出10周后升级其 Copilot 编程模型
这款拥有1380亿参数的混合专家(mixture-of-experts)模型增加了图像输入,并在Microsoft首个内部Copilot代码模型发布后10周到来。
By Ryan Merket · Published
Primary source: Microsoft AI
Why it matters
Microsoft is using Copilot usage and its production harness to compress model iteration into weeks, lowering inference costs while reducing its dependence on outside model vendors.

Microsoft 在 8 月 11 日 发布 了 MAI-Code-1.1-Flash,并将该编码模型投入到 GitHub Copilot 的生产中,仅在推出 10 周后就替换了其内部编码模型的第一个版本。
在其 公告 中,Microsoft 表示此次更新使 token 的流式传输速度提高了 25%,完成任务所用的 token 减少了 25%,成本仅为 6 月 2 日推出的 MAI-Code-1-Flash 的四分之一。Microsoft 还增加了图像输入,允许模型将屏幕截图、图表和界面设计转换为代码。
这一异常短的发布周期展示了 Microsoft 在编码模型方面的竞争策略:将 Copilot 既作为分发渠道又作为训练环境,然后随着生产数据揭示开发者的困难点快速替换模型。公司在收到反馈识别出命令行和 .NET 工作为弱点后,将新版本的训练重点放在了这些领域。
大型模型但活跃占用小
MAI-Code-1.1-Flash 模型卡 将其描述为一个稀疏的 mixture-of-experts 模型,总参数约 1380 亿,活跃参数约 50 亿。它接受文本和图像输入,具有 256,000-token 的上下文窗口,并在 2026 年 3 月至 8 月之间进行了训练。
这种设计使 Microsoft 能够将模型的活跃计算需求维持在接近小模型的水平,同时保留更大规模的参数池。MAI-Code-1.1-Flash 从 MAI-Thinking-1 的一个压缩的、活跃参数为 50 亿的检查点开始构建,并依赖于最初的编码模型。
Microsoft 在一个中间训练阶段使用了大约 200 万个合成代理任务,随后在超过 150,000 个环境中进行了强化学习。公司在用于生产流量的同一 GitHub Copilot 测试环境中评估了由此产生的检查点,包括仓库导航、工具调用和端到端任务验证。
模型最明显的基准提升出现在 Terminal-Bench 2.1(衡量代理通过终端完成工作的能力)。MAI-Code-1.1-Flash 的通过率为 62.9%,而其前代为 51.7%。这就是 Microsoft 引用的 22% 相对提升。
在 SWE-Bench Verified 上的提升则更小。新模型得分 72.6%,而 6 月的模型为 71.6%。它在每个任务上平均使用 8,600 个解决方案 token,低于此前的 10,800 个。Microsoft 的结果在这两项测试中也将其置于 GPT-5.4 mini 之上,尽管这些数据是使用 Microsoft 的 Copilot 生产测试环境生成的,而不是中立的第三方评估。
Microsoft 另行报告在 .NET 任务上有 15% 的提升。其生产指标显示通过提交存活的生成代码增加了 4%,开发者回访率增加了 9%。这些数据是内部自报指标,公告并未指明其基线或测量窗口。
Copilot 数据为下一代模型提供数据
此次模型更新更具体地展示了 Microsoft 在 6 月推出 MAI-Code-1-Flash 时 描述的训练闭环。Microsoft 可以在 Copilot 测试环境内进行训练,将模型路由给开发者,观察汇总的产品结果,并在下一轮训练中聚焦那些降低接受率或留存率的任务。
数据摘要 表示,Microsoft 使用了来自未选择退出模型训练的 GitHub Copilot Free、Pro 和 Pro+ 订阅者的对话提示及相关上下文。过滤后的数据被用于强化学习的滚动部署和训练内部奖励模型。Microsoft 表示已移除识别性信息、图像、工具使用痕迹和安全敏感内容,并且未将生产响应用作监督训练目标。
摘要称训练数据包含超过 10 万亿 个文本 token 和不足 100 万 张图像。语料库结合了公共仓库、网页数据、书籍、学术材料、商业采购数据以及合成的软件工程任务。其最新收集的数据集截至 2026 年 7 月,即发布前一个月。
这一生产反馈循环是此次发布经济学的核心。Microsoft 在 7 月表示,已有数百万开发者在使用首个 MAI-Code 模型,且其产生的代码接受率和回访率高于 GPT-5.4 mini 和 Claude Haiku 4.5。将更多 Copilot 流量迁移到成本更低的 Microsoft 自研模型,可以降低为大规模代理会话提供服务的成本,同时让 Microsoft 对延迟、训练和产品特定行为拥有更严格的控制。
各处发布材料中对定价的表述仍不一致。模型卡将定价标注为“待定”,而 GitHub 的 实时模型计费表 当前将更广泛的 MAI-Code-1-Flash 条目列为每百万输入 token $0.75、缓存输入 $0.075、每百万输出 token $4.50。Microsoft 的公告并未对其所称的 75% 降低附上具体美元费率。
MAI-Code-1.1-Flash 可通过 GitHub Copilot 使用。Microsoft 还为发布信息和开发者反馈开放了一个 官方仓库。