Huawei 发布了在 Ascend 芯片上训练的 5050亿参数 openPangu 模型

512K 上下文发布检验的是 Huawei 是否能把其芯片、模型和推理堆栈打造成对以 Nvidia 为中心的 AI 的可信替代方案。

By · Published

Primary source: X - Poe Zhao

Why it matters

Huawei is using an open-weight model to validate a vertically integrated AI stack built around Ascend instead of Nvidia GPUs. Adoption will depend on tooling, reproducibility and a license that bars use in the EU.

Huawei releases 505B-parameter openPangu model trained on Ascend chips

Huawei 已发布 openPangu 2.0 Pro,这是一种 Mixture-of-Experts(专家混合)语言模型,Huawei 表示该模型完全在其 Ascend AI 处理器上训练,将在非-Nvidia 计算栈上构建的最大模型之一的权重交到开发者手中。

模型说明卡列出约 5050 亿(505 billion)总参数,每个 token 激活 180 亿(18 billion),具有 512K-token 的上下文窗口,以及大约 34 万亿(34 trillion)训练 token。该仓库大约在 7 月 30 日出现,此前 Huawei 在其 6月12日的开发者大会 上介绍了 openPangu 2.0 系列。Poe Zhao (@poezhao0605) 在 7 月 31 日引起了对完整 Pro 版本发布的关注。

参数计数需要说明。Huawei 的模型说明卡和 technical report 标注为 505 billion,而 Hugging Face 的自动元数据报告为 541 billion。仓库并未调和这一差异。其文件大约占用 1.08 TB。

围绕 Ascend 构建的模型

此次发布将 openPangu 变成了 Huawei 垂直 AI 战略的公开检验。Ren Zhengfei 于 1987 年以 CNY21,000 创立了 Huawei,据其公司传记记载。近四十年后,Huawei 正将自己的处理器、训练系统、模型、云基础设施和设备软件组装成一个完整的栈。

该栈是 openPangu 2.0 Pro 背后的核心主张。Huawei 表示该模型是在 Ascend NPUs 上训练的,并通过其 omni-infer 框架提供 Ascend-native inference code。该推理仓库采用 Apache 2.0 许可。

Huawei 的架构使用稀疏性来使每个 token 的实际计算远低于模型的总参数量。它将多头潜在注意力与两种注意力模式结合:用于局部上下文的滑动窗口注意力和用于长程信息的动态稀疏注意力。Huawei 表示它将这些层按 2:1 的比例排列。一个四流残差设计、Muon 优化器和三个多 token 预测头旨在提高训练和推理效率。

该模型提供“思考”与“非思考”模式,目标领域为推理、编码、工具使用和 agent 任务。Huawei 报告称思考版本在 SWE-bench Verified 上得分 68.5、在 LiveCodeBench V6 上得分 85.7,均为三次运行平均值。这些数字是 Huawei 自行评估的,应在其模型说明卡公布的测试配置范围内理解。

公开规格将 openPangu 2.0 Pro 列为较大规模的开权重 MoE 发布之一。DeepSeek-V3 列出 671 billion 总参数、37 billion 激活参数和 128K 的上下文窗口。Alibaba's Qwen3-235B-A22B 列出 235 billion 总参数和 22 billion 激活参数,而 Moonshot AI's Kimi K2 列出 1 trillion 总参数和 32 billion 激活参数。上述每个已发布的配置都具有 128K 的上下文窗口,仅为 Huawei 声称的 openPangu 2.0 Pro 长度的四分之一。

原始模型大小并不能确立性能或可用性。Huawei 更具意义的断言是,它在 Ascend 上训练了此规模的模型,并已发布权重、架构代码和部署路径,供外部开发者检验该说法。

开放权重,受限许可

Huawei 正在其自定义的 OpenPangu Model License Agreement 2.0 下分发权重,而不是标准的开源许可。该协议授予使用、修改和再分发模型的权利,同时明确禁止在欧盟境内访问、部署或使用。

该许可还要求基于模型的产品或服务展示“Powered by openPangu”鸣谢和 Huawei 商标声明。这些条件缩小了可触及的开发者群体,使此次发布在实质上比使用 Apache 2.0 的模型(如 Qwen3)限制更多,尽管 openPangu 的推理代码本身采用 Apache 2.0。

Huawei 有足够的资产负债表将该模型视为其更广泛计算业务的基础设施。在其 2025 年度报告公告 中,Huawei 报告营业收入为 CNY8809 亿元,研发支出为 CNY1923 亿元,占收入的 21.8%。Huawei 表示将继续投资于 AI,并围绕 Ascend、Kunpeng 和 HarmonyOS 建立开发者采用。

OpenPangu 2.0 Pro 为该战略提供了一个开发者可以下载并检查的模型。接下来的检验是操作性的:Huawei 之外的团队能否复现报告的性能、能否在 Ascend 基础设施上高效运行这一万亿字节规模的发布,以及能否在排除欧盟的许可下构建产品。

Reader comments

Conversation for this story loads after sign-in.