Alibaba 发布开源的 Qwen3.8,总计 2.4T,活跃参数 95B

Alibaba 发布了其 2.4 万亿参数的 Qwen3.8 模型作为开放权重,为运营者提供了一个仅限文本的检查点,每个 token 大约有 950 亿参数处于激活状态。

By · Published

Primary source: Hugging Face

Why it matters

Qwen3.8 gives AI teams access to the weights for a Qwen-Max-class model, but its scale requires substantial serving infrastructure. The downloadable checkpoint is text-only, always uses thinking mode and activates about 95 billion parameters per token.

Illustration of Alibaba Qwen3.8 depicted as a monumental data structure with labeled access points and networked connections, highlighting 2.4T total and 95B active parameters.

开发者和基础设施团队现在可以下载 Qwen3.8 的模型权重,该版本是 Alibaba 大型模型计划的最新发布。Alibaba 于 8 月 12 日发布了 Qwen3.8-2.4T-A95B 权重。Qwen 在其 Qwen3.8 公告 中称其为首个公开发布的 Qwen-Max 级模型。

仓库以 Hugging Face Transformers 格式提供 Qwen3.8-2.4T-A95B 的模型权重和配置文件,兼容 vLLM、SGLang 和 TokenSpeed。Qwen 另通过 Qwen Cloud 提供 Qwen3.8-Max。根据 Qwen 的仓库和云端文档,该托管版本支持视觉输入、非思考模式和内置工具。

Qwen 发布了什么

Qwen 的仓库将 Qwen3.8-2.4T-A95B 描述为一个 2.4 万亿参数的稀疏专家混合(sparse mixture-of-experts)模型,约有 950 亿参数在每个 token 上被激活。它的 92 层包含 512 个专家,每次路由时有 10 个专家和 1 个共享专家被激活。该设计提高了模型的存储容量,而无需在每次推理步骤中使用全部 2.4 万亿参数。

仓库称该开放检查点仅支持文本,需要思考模式,并支持本地 262,144 token 的上下文,且可扩展到 1,010,000 token。其 reasoning_effort 设置默认支持 xhigh,还支持 mediumlow。另有一个 preserve_thinking 控件可保留来自先前消息的推理上下文。

模型卡列出了对 Hugging Face Transformers、SGLangvLLM 和 TokenSpeed 的支持。

这与更小规模 Qwen 版本用于本地开发的情况相去甚远。RuntimeWire 在 6 月报道说 Qwen 3.6 27B 已变得适用于本地编码工作。Qwen3.8 的巨量参数在运营者考虑服务内存、计算和推理吞吐之前就已经带来了大量的存储需求。

公开检查点不及 Qwen3.8-Max 全面

可下载的检查点仅支持文本,并始终以思考模式运行。它不接受图片或视频输入,开发者无法通过文档化的接口禁用其推理模式。

根据 Qwen 的模型仓库,Qwen3.8-Max 增加了视觉输入、非思考模式、内置工具以及默认的一百万 token 上下文窗口。同一仓库将那些寻求无需维护基础设施的托管、可扩展推理的用户指向 Qwen Cloud。

这两种发布为开发者提供了一个可下载的文本模型和一个带有额外输入模式与工具的托管 Max 产品。

仓库链接到一个模型特定的许可证

仓库链接到一个 Qwen3.8 特定许可证文件。所提供的材料不包含许可证文本,因此无法在此处概述其商业使用条件。

已发布基准确立了什么

所提供的材料未为可下载的 Qwen3.8-2.4T-A95B 检查点确立独立的基准结果,而 Qwen 的模型卡则报告了针对托管 Qwen3.8-Max 版本的公司运行对比测试。这些对比涵盖了在不同测试框架、运行次数和评估条件下的编码、代理和通用能力测试。因此,对于第三方部署该可下载检查点的性能和运营成本,所提供的证据仍未能确立结论。

Reader comments

Conversation for this story loads after sign-in.