Z.ai 推出面向编程和防御性安全的 GLM-5.3 API

这款仅文本模型保持 GLM-5.2 的定价,增加了 100 万标记的上下文窗口,并在其延迟发布的公开权重之前推出。

By · Published

Primary source: Z.ai on X

Why it matters

Hosted access lets Z.ai monetize and monitor a model it says can chain exploits while postponing the harder-to-control open-weight release.

Z.ai launches GLM-5.3 API for coding and defensive security — The text-only model keeps GLM-5.2 pricing, adds a 1M-token context window, and arrives before its delayed public weights.

Z.ai 于 8 月 18 日开放了对 GLM-5.3 的 API 访问,将其新的编码和网络安全模型置于托管接口之下,同时实验室将模型权重留在内部以进行额外的安全工作。

这家北京 AI 实验室对输入令牌收取每百万 1.40 美元,对输出令牌收取每百万 4.40 美元,与 GLM-5.2 列出的费率相同。缓存输入的费用为每百万 0.26 美元。Z.ai 表示 GLM-5.3 也可通过合作伙伴的模型网关使用,但其公告并未指明这些提供方。

Z.ai 源自清华大学的知识工程组,成立于 2019 年。联合创始人 Jie Tang 和 Juanzi Li 围绕 GLM 研究项目建立了该实验室,该项目在 2021 年推出了首个预训练框架,并在次年发布了开源的 GLM-130B 模型,详见 Z.ai 的企业历史

通过后训练升级并带有强制推理模式

Z.ai 表示 GLM-5.3 使用与 GLM-5.2 相同的基础模型,其性能提升完全来自后训练。这使得此次发布是对 Z.ai 在六月发布的模型的改进,而不是新的基础模型训练运行。

该模型仅接受文本输入,拥有 100 万令牌的上下文窗口,最大输出为 128,000 令牌。它支持函数调用、结构化输出、上下文缓存和流式工具调用。开发者可以通过兼容 OpenAI 的 Chat Completions 和 Responses 协议或 Anthropic 的 Messages 协议的接口进行连接。

推理始终处于启用状态。Z.ai 提供低、中和最大三档推理努力设置,默认是最大档。发送带有禁用推理的请求的应用将收到错误,因此现有的 GLM 集成在更换模型标识符前必须检查其参数。Z.ai 发布了涵盖该变更的 迁移指南

强制推理设置对成本和延迟有影响。Z.ai 建议在迁移长上下文工作负载时测试两种设置,尽管每令牌价格没有上调。

在更长任务上的基准增益最大

Z.ai 报告称 GLM-5.3 在 Terminal-Bench 3.0 上从 4.6 提升到 28.3,在 DeepSWE v1.1 上从 46.2 提升到 66.9,在 Agents' Last Exam 上从 23.8 提升到 28.5。这些为公司报告的结果,尚未在此处独立复现。

在 Z.ai Code Bench(一个围绕本地开发环境构建的私有测试)上,公司表示 GLM-5.3 在最大努力等级下实现了 34.5% 的完成率,同时每个任务大约使用了 75,000 个输出令牌。GLM-5.2 得分为 23.4%,消耗约 96,000 个输出令牌。私有基准可以减少公开测试集污染的暴露,但其设计和评估无法像公开基准那样被仔细检视。

Z.ai 自身的比较也显示了 GLM-5.3 的短板。公司报告称 Claude Fable 5 在其编码基准上得分为 39.5%,比 GLM-5.3 在最大努力时高出五个百分点。

在公开权重之前先提供 API 访问

网络安全是此次发布更关键的部分。Z.ai 表示它在 GLM-5.3 的后训练数据中加入了漏洞发现环境,并发现随着任务从识别缺陷转向构建完整的利用链,模型的提升效果更为显著。

据 Z.ai 称,在 CyberGym 上 GLM-5.3 得分为 84.5%,而 GLM-5.2 为 77.2%。其 ExploitBench 得分从 24.4% 上升到 54.4%。更深度的利用测试仍然使 GLM-5.3 明显落后于 Z.ai 评估的闭源模型,后者得分均在 76% 以上。

Z.ai 还表示,经过安全专家的审查和去重后,GLM 模型在 269 个真实项目中识别出 2,436 个漏洞,其中 1,097 个问题被归类为中度或高度严重。这些项目涵盖了操作系统、浏览器引擎、基础设施软件、Web 应用和网络协议。

这些能力解释了分阶段分发的原因。Z.ai 在 8 月 14 日介绍 GLM-5.3 时表示,将推迟公开发布权重两周以测试额外的防护措施,Axios 报道。在此期间,选定的安全合作伙伴被提供了受控访问。

8 月 18 日的 API 上线让开发者可以立即访问,但不会交付可自由修改的模型副本。这也使 Z.ai 能够在延迟期间看到使用情况并执行访问控制。如果 Z.ai 按计划发布权重,这种安排是临时的,但它也揭示了由更强网络安全模型带来的核心问题:当权重离开实验室时,托管的防护就会终止。

对于接受强制推理模式的开发者,GLM-5.3 可按与其前身相同的 令牌价格 使用。对于 Z.ai 来说,更困难的发布将在可下载版本跟进时到来。

Reader comments

Conversation for this story loads after sign-in.