Alibaba 的 Qwen3.8-Max 预览让开发者缺乏稳定的测试目标

QwenCloud 将 `qwen3.8-max` 列为仅限 Token Plan 的预览版,其能力可能会发生变化,这为正在评估其视觉和智能体功能的开发者带来了版本管理方面的问题。

By · Published

Primary source: Qwen / Alibaba

Why it matters

Developers evaluating Qwen3.8-Max need stable version identifiers to distinguish model updates from changes in prompts or test design. Alibaba's hosted preview provides access, but its documented ability to change makes reproducible comparisons harder.

Illustration of Alibaba's Qwen3.8-Max model observing and analyzing a real-world scene during external vision testing.

Alibaba 在其托管的开发者产品中预览了 Qwen3.8-Max,向工程师提供了一个声称具有 2.4 万亿参数的多模态模型的访问权限,但该模型以“预览”身份记录,导致可复现测试变得复杂。

Qwen 是阿里巴巴的内部模型系列,而非单独融资的初创公司。Alibaba Group 总部位于中国杭州,其备案文件未标明独立的 Qwen 企业实体或外部融资轮。Junyang Lin 是该项目最知名的技术负责人,他于 2019 年加入阿里巴巴的 DAMO Academy,并在 2023 年成为 Qwen 的技术负责人,随后在 2026 年 3 月辞职

有限可重复性的托管预览

SiliconANGLE 关于该活动的报道,阿里巴巴于 7 月 19 日在上海的世界人工智能大会上预览了 Qwen3.8-Max。阿里在其会议公告中将该模型描述为最初通过 Token Plan、Qoder 和 QoderWork 提供。

阿里巴巴将 Qwen3.8-Max 描述为一个用于文本、图像、视频和文档的 2.4 万亿参数多模态模型。该参数数字仍为阿里巴巴的宣称。SiliconANGLE 报道称阿里在预览时未提供模型卡、已激活参数计数或基准数据。没有已激活参数数量,开发者无法可靠地从总参数量估计模型的推理特性。

截至 8 月 7 日,QwenCloud 的开发者文档qwen3.8-max 标识为仅限 Token Plan 的模型。阿里巴巴的其他会议资料也描述了通过 Qoder 和 QoderWork 访问的方式。

QwenCloud 的 Token Plan 文档将该模型定义为一个预览,说明其能力可能会持续改进,并且未来可能下线或由生产版本替代。该表述使比较变得复杂:在不同时间进行的测试可能会在相同标识下到达变化的终点。带有日期快照或明确版本号将帮助开发者确定某个结果在更新后是否仍然适用。

试用还采用促销定价。SiliconANGLE 报道称在预览期内访问费用约为标准费率的 10%。这些条款使初始测试更便宜,但并不确定生产模型最终的使用成本。

Qwen3.8-Max 延续了开放权重的扩展

在 2 月 16 日的一份公告中,Alibaba 表示已开源 Qwen3.5,从 Qwen3.5-397B-A17B(也名为 Qwen3.5-Plus)开始。公司强调了视觉、视频、图形界面交互和推理效率。本文审阅的 Qwen3.8-Max 材料通过阿里巴巴的托管产品继续了对多模态和面向代理工作的关注。

开源权重帮助早期 Qwen 模型触及阿里云之外的开发者。阿里巴巴表示截至 2026 年 1 月 21 日,Qwen 家族在 Hugging Face 上累计下载量已超过 10 亿次。该数字涵盖整个 Qwen 家族,并不代表 Qwen3.8-Max 的下载量、用户或客户数量。

固定的检查点可以让研究人员重新运行评估、比较硬件需求并测量量化行为。明确的许可条款将决定公司如何在阿里服务之外修改和部署模型。托管预览目前为开发者提供了检查 Qwen3.8-Max 的途径,但其不断变化的能力使带日期的结果和版本标识尤其重要。

阿里巴巴的性能主张缺乏支持性结果

阿里巴巴声称 Qwen3.8-Max 的排名仅次于 Anthropic 的 “Fable 5”,这一点可见于公司的公告SiliconANGLE。该主张未附带支持的基准表格,因此无法从已发布的材料中独立评估该排名。

对于编码、工具使用和较长运行时间的代理工作,部署细节可能与总体分数同等重要。开发者需要成本、延迟、接口可靠性和版本稳定性来判断模型能否稳定运行软件。阿里的促销定价解决了初始测试成本问题,但“预览”这一表述使版本稳定性仍未解决。

视觉准确性决定代理能否采取行动

视觉能力正成为软件代理控制层的一部分。操作浏览器或桌面的模型必须识别小图标、读取文本、区分界面状态并理解某次操作后发生了什么变化。即便模型的规划和代码生成能力很强,视觉错误也可能使代理运行偏离方向。

同样的问题也出现在视频和文档工作中。模型必须在帧间保持空间关系,将图表与附近标签关联起来,并在提取文本时不对所见内容进行静默纠正。这些任务暴露的失败可能会在宽泛的汇总得分中消失。

评估这些能力需要固定的模型版本、披露的提示、评分标准以及足够的输出以识别失败案例。托管访问可以支持这项工作,但不断变化的端点会使每个结果更难保存。没有稳定的版本标识,开发者无法判断评估之间的差异是反映测试设计的不同,还是底层模型的更新。

Reader comments

Conversation for this story loads after sign-in.