AMD 发布 Instella-MoE 以展示在 Instinct GPUs 上的端到端训练

具有 16B 参数的模型在每个令牌上激活 2.8B 个参数,并随附六个检查点、训练配方和代码。

By · Published

Primary source: X

Why it matters

Instella-MoE gives AI teams a reproducible test of AMD's stack for sparse-model training and RL, though its research-only weight license limits commercial use.

Illustration of an AMD Instinct GPU with flowing abstract data streams representing Instella-MoE model training

AMD 的研究人员由 Jiang LiuPrakamya Mishra (@PrakamyaMishra) 领导,于 7 月 24 日 发布了 Instella-MoE,向开发者提供了在 AMD Instinct GPU 上从零开始构建的混合专家(mixture-of-experts)语言模型的权重和训练工件。Mishra 在星期一 在 X 的一条线程中 将此次发布描述为 AMD 首个完全开放的 MoE 模型。

此次发布将两位参与该工作的 AMD 研究人员公之于众。Liu 是 Instella-MoE 的项目负责人,他在 2024 年完成 Johns Hopkins University 的电气与计算工程博士学位后加入了 AMD。Mishra 是 AMD 位于西雅图的 GenAI 团队的一名应用研究工程师,负责大规模训练技术的工作。他此前在 UMass Amherst 从事自然语言处理研究,并曾在 Amazon 的 NLU 和语音语言理解团队工作。

Instella-MoE 包含 160 亿参数,而其稀疏架构在每个 token 上激活 28 亿参数。其 27 层解码器使用两个共享的专家,并将每个 token 路由通过 64 个可用专家中的 6 个,这一结构旨在在不为每个 token 激活所有参数的计算成本下保持模型容量。

AMD 表示他们使用 Instinct MI300X 和 MI325X 加速器、ROCm 及其 Primus 训练框架在 7.1 万亿 token 上训练了该模型。数据混合覆盖了通用网页文本、代码、数学与科学。AMD 随后分别进行了中期训练、长上下文训练、监督微调、直接偏好优化和强化学习阶段。长上下文训练将支持的窗口从 4,000 扩展到 64,000 个 token。

此次发布的范围与最终检查点一样重要。AMD 在 Hugging Face 上发布了一个 六模型集合,涵盖了预训练、中期训练、长上下文基础模型、监督微调、偏好优化和强化学习。 Instella-MoE 存储库 包含训练配置、数据混合细节、推理工具以及用于复现该流水线的代码。

该套件使 Instella-MoE 成为在 AMD 硬件上训练现代稀疏模型的参考实现。来自芯片制造商的模型发布即便本身偏向研究,也有商业目的:它们为潜在客户提供可运行的代码、性能数据和可供检查的架构,便于在评估替代主导的 Nvidia 软件堆栈时进行审查。

AMD 测试完整训练流水线

Instella-MoE 还为 AMD 提供了围绕混合专家模型通信成本开发的两项系统技术的载体。第一项,Gated Multi-head Latent Attention,增加了一个学习门控,用以控制每个注意力输出有多少部分被传递下去。第二项,FarSkip-Collective,在专家并行训练与服务期间实现了跨 GPU 的通信与计算重叠。

AMD 报告称 FarSkip-Collective 将预训练速度提高了 12.7%。在使用专家并行提供模型服务时,AMD 还测得“首次 token 时间”最多减少 39.2%。这些数据来自 AMD 自行测试,并取决于指定的并行服务配置。

这些基准也是公司自报的。AMD 表示基础检查点在其选定的标准评估中平均得分为 76.7,领先于其比较中包含的完全开放的 OLMo-3-7B 和 OLMoE-1B-7B 模型。AMD 经强化学习优化的最终 Think checkpoint 在后训练表中得到 73.22 的平均值,并在 IFEval 上获得 83.70 分。比较显示 Instella-MoE 在基础模型平均分上落后于 Qwen3.5-4B-Base,而 AMD 的 Think 检查点在其后训练表中领先所选的完全开放模型。

模型的开放性也带来了许可边界。AMD 在 MIT License 下发布了训练代码,而检查点使用的是限制在学术与研究用途的 ResearchRAIL 许可。开发者可以检查配方、数据混合和中间权重,但该模型许可并非不受限制的商业开源授权。

AMD 还警告称,这些检查点不提供安全保证,尚未经过多语言性能测试,不适用于安全关键、医疗或高精度应用。这些限制使 Instella-MoE 更像是一个研究工件,而非面向立即部署的生产模型。

对 AMD 来说,最具影响力的输出是证据表明 ROCm 与 Instinct 加速器能够支持一个 MoE 项目完成预训练、偏好调优和强化学习。Instella-MoE 为外部团队提供了在代码和检查点上测试该主张的工件,而不只是单靠硬件基准。

Reader comments

Conversation for this story loads after sign-in.