Microsoft 发布了一个开源浏览器代理,该代理在 64 台 B200s 上进行了为期六天的后训练。
Fara1.5-27B 使用屏幕截图而不是 DOM,并以 MIT 许可证发布,使开发者能够控制 Microsoft 的浏览器代理。
By Ryan Merket · Published
Primary source: X - @0xSero
Why it matters
Fara1.5 shows that competitive browser automation can come from focused post-training of an existing open model, lowering the compute barrier for developer-controlled agents.

Microsoft 在 7 月 22 日 将 Fara1.5(基于 Qwen3.5 构建的一系列浏览器使用模型)的权重在 MIT 许可证下公开可用。此次发布包含具有 40 亿、90 亿和 270 亿参数的模型,每个模型都经过训练以通过读取屏幕截图并生成鼠标、键盘和导航操作来操作网站。

根据其Hugging Face 模型卡,最大型号在监督微调阶段使用了 64 块 Nvidia B200 GPU,训练时长为六天。那相当于 9,216 GPU 小时,对于微软将其定位为与专有计算使用系统竞争的模型来说,是一次相对紧凑的后训练运行。
一条来自 0xSero (@0xSero) 的 7 月 27 日线程估计该计算量约为 4 万到 6 万美元。当前Lambda 的定价列出八卡 B200 实例的价格为每 GPU 小时 6.69 美元,这会把 9,216 GPU 小时的租赁成本推到大约 61,655 美元。该比较仅作为租赁价格的参照。它并不能代表微软的内部基础设施成本,也不包括生成数据、运行教师模型、评估轨迹以及支付构建该系统的研究人员和工程师的费用。
有用的数字是规模:微软用不到一周的后训练计算时间,将一个现有的 270 亿参数模型转换为一个专用的浏览器代理。对于希望构建窄域计算使用系统而又不资助基础模型预训练运行的开发者来说,这提供了更清晰的参考点。
The training pipeline behind the six-day run
Fara1.5 来自 Microsoft Research AI Frontiers,该实验室由 Ece Kamar 领导。技术论文最初于 6 月 18 日提交,并于 7 月 22 日修订,列出了 Ahmed Awadallah 和项目中的 14 位合著者。
研究人员使用来自 FaraGen1.5 的数据对 Qwen3.5 模型进行了监督微调。FaraGen1.5 是一个生成网页任务、记录完成尝试并过滤由此产生轨迹的管道。微软同时使用了真实网站和六个合成环境,这些环境覆盖了诸如电子邮件、日历、市场和实验管理工具等服务。
这些复制环境解决了计算使用代理的一个基本训练问题。研究人员不能安全地无限制收集涉及账户登录、消息、购买和其他会更改真实数据的操作的实时示范。在合成环境中,微软可以控制界面、数据库和预期结果,从而允许自动验证器比较代理操作前后的状态。
微软表示,最终的训练混合大约包含 200 万个样本。27B 的模型卡描述了大约 10 亿个文本标记和少于 10 亿张训练图像。由 GPT-5.4 驱动的求解器生成了任务轨迹,而单独的验证器对正确性、效率以及代理在需要缺失信息、澄清或对不可逆操作征得批准时是否停止进行了评分。
这种教师-学生结构是经济模型的核心。一个大型的专有模型执行任务并产生示范,然后一个小得多的开源权重模型学习这种专用行为。开发者在数据生成阶段为大型模型付费,而不是在每次部署代理点击浏览网站时都付费。
Microsoft's benchmark claims need context
微软报告称 Fara1.5-27B 在 Online-Mind2Web(一个在实时网站上执行任务的基准)上达到了 72.3%。微软的研究文章在同一对比表中列出 OpenAI Operator 为 58.3%、Google 的 Gemini 2.5 Computer Use 为 57.3%,以及 Yutori Navigator n1 为 64.7%。
这些结果仍然是微软报告的评估,而非独立测试。微软使用 Browserbase 来稳定会话,并对 Fara 的结果进行了三次运行的平均。浏览器代理的得分可能会随网站变化、被阻断的会话、评估器设计以及每个系统可用的确切工具而变化,这限制了单一表格对真实部署能证明的程度。
微软自己的材料也包含一个差异。研究论文和模型卡报告 Fara1.5-27B 在 Online-Mind2Web 上为 72.3%。一篇 5 月 21 日的微软博客文章称该模型在该基准上超过了 90%。72.3% 这一数字是在技术论文、研究文章、存储库和模型卡中反复出现的那个。
WebVoyager 的报告也略有不同。研究文章给 Fara1.5-27B 的分数为 88.6%,而当前的模型卡列为 89.3%。两个来源都将 27B 模型置于比更小的 Fara 变体更高的位置,尽管版本差异使得假精确没有多大意义。
An agent developers can inspect and contain
Fara1.5-27B 拥有 262,144 标记的上下文窗口,观察浏览器截图但不读取文档对象模型(document object model)或可访问性树(accessibility tree)。它预测点击和拖拽的基于坐标的位置,并且可以输入、滚动、访问 URL、执行搜索、向用户提问并结束任务。
微软建议通过其 Fara 仓库 或 MagenticLite 运行该模型,后者将浏览器放入容器并添加域允许列表、操作日志、监控和暂停控制。模型卡明确警告不要在包含敏感文件或凭据的机器上给予 Fara 不受限制的浏览器访问权限。
MIT 许可证为开发者提供了检查和调整权重的空间,而 27B 的大小使得在可以跨一个小型 GPU 集群提供模型的组织范围内可部署变得可行。微软表示该模型已在 A6000、A100、H100 和 B200 硬件上进行了测试,且建议进行 BF16 推理时至少使用两块 GPU。
Fara1.5 仍然存在使计算使用代理具有风险的失败模式:来自页面内容的提示注入(prompt injection)、在长任务中错误累积、对页面状态的幻觉式描述以及由模糊界面引起的混淆。微软将未沙箱化使用以及高风险的法律、医疗和金融任务排除在模型的预期使用范围之外。
此次发布为追求浏览器自动化的团队确立了一个实用配方:使用前沿模型生成并验证交互数据,专门化一个更小的开源模型,然后将其约束在专用构建的执行框架内。六天的训练运行是可见的费用。合成环境、教师模型调用和验证系统则是更难复制的资产。