Z.ai 在未提供文档化访问路径的情况下发布了 GLM-5.3 的研究
Z.ai 报告称在编码和漏洞利用方面取得进展,但其产品文档将 GLM-5.1 标识为最新发布版本,并且未提供访问 GLM-5.3 的路径。
By RuntimeWire Staff · Published · Updated
Primary source: Z.ai
Why it matters
Z.ai links long-horizon coding training to sharp claimed gains in vulnerability exploitation. Developers and security researchers still lack a confirmed GLM-5.3 endpoint, model identifier or downloadable artifact for reproducing those results.

Z.ai,这家由 Zhang Peng、Tang Jie 和 Liu Debing 共同创立的北京人工智能开发商,于 8 月 14 日发布了一篇研究文章,介绍了 GLM-5.3,作为面向编码代理和漏洞研究的后训练更新。GLM-5.3 帖子 表示该模型使用与 GLM-5.2 相同的基础模型,性能提升来自又一个月的强化学习、扩展的任务环境以及额外的后训练计算。
产品记录则不那么清晰。截至 8 月 14 日,Z.ai 的官方发行说明 将 GLM-5.1 标识为最新记录的 GLM-5 版本,并未列出 GLM-5.3。Z.ai 的GLM-5 文档 将 GLM-5 描述为可通过 GLM Coding Plan 获取的开权重基础模型,但并未标明 GLM-5.3 的 API 端点、托管模型标识符或可下载工件。
Z.ai 在 8 月 14 日的帖子中表示,将在发布两周后公开 GLM-5.3 的权重,前提是安全评估和加固完成。该帖子将读者引导至 Z.ai 的 Coding Plan 和 ZCode(Z.ai 的编码代理),同时将 Hugging Face 的访问标注为“即将推出”。帖子没有公布 API 端点、模型标识符或权重下载。因此,截至 8 月 14 日,开发者缺乏确认的 GLM-5.3 访问路径或可复现的生产配置。
8 月 14 日的页面是一篇由 Z.ai 撰写的研究文章,包含详细的训练和基准测试声明。在独立评估复现这些结果之前,其分数和网络安全发现应被视为 Z.ai 的声明。该帖子与 Z.ai 产品文档之间的差距也使得 GLM-5.3 最终的许可和服务配置仍未确定。
Tang(清华大学计算机系教授、Z.ai 联合创始人)创建了 AMiner,一个自 2006 年起运行的学术搜索和知识图谱系统。他的研究涵盖数据挖掘、社交网络、知识图谱和基础模型,他的团队参与了 GLM-130B、ChatGLM、CogView、CogVideo 和 CodeGeeX 等项目。他的清华简介 表示他于 2006 年在该校获得计算机科学博士学位。在他的研究主页上,Tang 将他的使命描述为“教会机器像人类一样思考”。
Zhang,Z.ai 的 CEO,曾在清华的 Knowledge Engineering Group 及其数据科学研究中心工作,随后参与将这些研究商业化。Liu,Z.ai 的董事长,专注于公司与资本运作。创始团队围绕起源于清华的研究建立了 Z.ai,之前在中国境外以 Zhipu AI 知名。
Z.ai 在模型工作上拥有可观资源。其香港招股说明书 报告称,截至 2025 年 6 月 30 日共有 883 名员工,其中 657 名从事研发工作。2024 年收入达到人民币 3.124 亿元,2025 年上半年收入为人民币 1.909 亿元。年中时,Z.ai 表示其服务超过 8,000 家机构客户和约 8,000 万台设备。
同一份招股说明书称,截至 2025 年 9 月 30 日止九个月内,Z.ai 拥有超过 12,000 家机构客户,并报告 2025 年 11 月平均每日令牌消耗约为 4.2 万亿。这些是 Z.ai 为上市披露的报告性指标,而非独立审计的活跃使用量指标。
招股说明书报告其 Pre-IPO 投资约为人民币 83.64 亿元,覆盖天使轮至 B6 轮。最新列示的融资轮筹得人民币 43.77 亿元,隐含上市后估值约为人民币 243.77 亿元。招股书中披露的知名投资方包括 Meituan、Qiming Venture Partners、Legend Capital、Ant Group 和 Aramco Ventures。全球发售覆盖 37,419,500 股,发行价为每股港币 116.20,暗示募集总额约为 5.57 亿美元。
CB Insights 报告 称 Z.ai 在私募阶段筹资超过 14 亿美元。据 Forbes 报道,其他披露的投资方包括 Alibaba、Tencent、Hillhouse 和中国政府基金。Z.ai 于 2026 年 1 月 8 日在香港上市,Dealroom 报道 募集约 5.58 亿美元。
Post-training drives the reported gains
Z.ai 表示,GLM-5.3 的训练堆栈使用了在 GLM-5.2 中引入的三项组件:IndexShare 用于高效的长上下文处理、SAO 用于长期任务的强化学习,以及其开源的异步强化学习训练框架 slime。
帖子中描述的训练环境更像是专业工程工作单元,而非短小的编码练习。举例而言,模型可访问计算集群、存储、文档、代码和实验结果。它必须定位机器学习基础设施瓶颈,修改实现,运行测试并在不破坏正确性的情况下产生可衡量的速度提升。
构建足够多这样的环境本身已成为工程难题。Z.ai 表示,研究代理会收集任务模式并将其转化为具有隐藏状态和多步依赖的可执行场景。一个独立的评测者会尝试每个任务以确认该任务可解,而生成的验证器会测试结果并试图封堵那些可能让模型在未完成实际工作的情况下仍能获得奖励的捷径。
人工仍然是该流程的一部分。Z.ai 承认环境创建和验证仍需大量人工参与。除非 Z.ai 能比专家手工设计和审计更快地产生可靠的任务和奖励,否则该方法将难以规模化。
Z.ai 的编码基准表 报告在 Terminal-Bench 3.0 上从 4.6 提升到 28.3,在 DeepSWE v1.1 上从 46.2 提升到 66.9,在 Agents' Last Exam 上从 23.8 提升到 28.5。在其私有的 Code Bench 上,Z.ai 宣称有 50% 的改进。在最大努力设置下,Z.ai 表示 GLM-5.3 在每个任务大约使用 75,000 个输出令牌时完成了 34.5% 的任务,而 GLM-5.2 在使用 96,000 个令牌时完成率为 23.4%。该私有测试的任务集和方法论无法通过帖文独立检查,且这些结果均未在所提供材料中被独立复现。
比较表并未产生单一领先者。它将 GLM-5.3 与 Moonshot AI、DeepSeek、Alibaba、Anthropic 和 OpenAI 的模型进行对比。GLM-5.3 在某些评估上领先列出的开权重替代方案,而竞争对手在若干编码和利用测试上取得更高结果。Z.ai 将 GLM-5.3 描述为最强的开权重编码模型,取决于其所选的评估和设置。
Z.ai reports an unexpected cyber gain
更具影响力的主张出现在编码推介之外。Z.ai 表示,随着后训练规模的扩大,GLM-5.3 在发现和利用软件漏洞方面的能力比预期提升得更快。该帖子描述了从识别孤立缺陷向形成多阶段利用计划的进展。
在其网络安全基准结果中,Z.ai 报告 GLM-5.3 在 CyberGym 上的得分为 84.5,高于 GLM-5.2 的 77.2。它列出 ExploitBench 得分为 54.4,而 GLM-5.2 为 24.4。在 ExploitGym 上,Z.ai 报告在两小时和六小时限制下分别有 105 和 130 次成功结果,而 GLM-5.2 在相同限制下分别为 29 和 39 次。这些结果需要独立复现。
比较中存在内部命名不一致。Z.ai 的表格将 Anthropic 的 78.0 ExploitBench 结果标记为 "Fable 5",而正文则称该模型为 "Mythos 5"。帖子并未说明 Z.ai 测试的是哪个配置,因此该结果不能可靠地分配给任一名称。相同表格将 GPT-5.6 Sol 列为 76.5。
这些网络数据的实际意义取决于每个基准的分母、工具访问、重试策略和执行条件。没有那些协议细节,原始漏洞利用计数尤其难以比较。Z.ai 的评估栈仍然记录了其在从漏洞发现到可行利用路径上更靠后阶段的最大相对收益。
超出受控基准之外,Z.ai 报告其模型在专家复审、筛选和去重后识别了 269 个项目中的 2,436 个漏洞,其中包括被描述为严重或高危的 1,097 项发现。Z.ai 表示 53 项发现已公开披露,2,383 项仍处于禁运期,更新记录在 Z.ai Security Disclosure Ledger。
Z.ai 将这些发现归因于与若干中国安全团队的合作。列出的目标包括系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议。这些仍然是 Z.ai 报告的总计,而非独立审计的测量,且各单项发现仍需经专家复审和协调披露。
Open weights and coding distribution are separate contests
Z.ai 在开放权重模型领域与 DeepSeek、Moonshot AI 的 Kimi 和 Alibaba 的 Qwen 竞争。其商业分发也依赖将模型直接置入开发者工作流的编码产品。ZCode 和 Z.ai 的 Coding Plan 提供了该产品层,而下游工具如 Cursor 则通过控制集成编码环境来竞争,而不是仅仅提供一个基础模型。
在其 subscription page 上,Z.ai 宣传其 Lite coding plan 起价为每月 $16.2,并表示该计划支持 20 多种编码工具。托管订阅使 Z.ai 与开发者建立直接的计费关系。开放权重部署服务那些希望在自有基础设施上运行和修改模型的购买者。Z.ai 的官方材料将 GLM-5 描述为开放权重,而 GLM-5.3 的文章承诺仅在为期两周的安全评估和加固期后提供权重。
研究文章中描述的模型旨在处理可消耗数万令牌并在终端、代码仓库和基础设施之间运行的任务。更好的基准分数可能有助于 Z.ai 推销这一用例。采纳将取决于对长时运行工作的可靠完成、可复现的评估以及到模型的有文档化路径。
报告的网络结果揭示了相同训练方法中的安全代价。被训练为检查不熟悉代码、操作工具、检验假设并在失败中坚持的代理,会获得可支持攻击性安全工作的机制。Z.ai 表示其研究人员在追求更强编码性能的过程中遇到了这种能力增长。
目前,Z.ai 已发布了关于 GLM-5.3 的详细训练、编码和网络声明,但尚未将 GLM-5.3 添加到官方发行说明中。研究文章承诺在为期两周的审查后提供权重,而截至 8 月 14 日,Z.ai 的文档尚未提供任何 GLM-5.3 的 API 端点、托管模型标识符或可下载工件。在研究人员能够确定哪种工件或服务配置对应于所报道结果之前,独立测试无法验证这些基准声明。