Alibaba 提供 21 亿 QwenCloud 代币以换取代理反馈
Qwen Growth Plan 要求开发者在 8 月 7 日之前提交成功和失败的 Qwen3.8-Max-Preview 代理任务。
By Ryan Merket · Published
Primary source: Qwen / Alibaba
Why it matters
Alibaba is using token incentives to collect the real task traces and failure cases that agent benchmarks miss, while pulling developers deeper into its QwenCloud distribution channel.

Qwen, Alibaba's large-model operation,周二发起了一项面向开发者的活动,提供高达 21 亿 QwenCloud 使用代币,用于征集 Qwen3.8 在真实代理任务中完成或失败的示例。
Qwen Growth Plan 在 Alibaba 在上海的 World Artificial Intelligence Conference 上预览 Qwen3.8-Max 九天后推出。开发者需在 8 月 7 日之前提交任务场景、提示、输出和评估。Alibaba 明确要求同时提交失败结果和成功结果,将一场宣传性比赛变成短期、结构化的评估循环。
这种做法符合 Eddie Wu 的技术直觉。Eddie Wu 毕业于 Zhejiang University of Technology 的信息工程学院,并在 1999 年公司创立时担任 Alibaba 的技术总监。此后他曾担任 Alipay 和 Taobao 的 CTO,直至 2023 年 9 月回归领导 Alibaba。在 Wu 的领导下,Alibaba 把战略重心集中在商业与 AI 加上云计算上。
该活动为 Wu 的模型组织提供了单靠基准公告无法独立提供的东西:有关开发者如何构造任务、代理在何处丢失工作流程以及哪些输出被人们认为足够有用以部署的详细记录。
A contest built as an evaluation loop
Alibaba 将奖励分为三档。十个精选作品将各获得 1 亿代币,并可能出现在官方宣传视频中。五十个优秀奖每个含 2000 万代币,其中包括有助于识别问题的失败案例奖。首批 10 个符合条件的参赛作品将各获得 1000 万代币的参与奖。
在这 70 项奖项中,Alibaba 共提供 21 亿代币。这些奖金鼓励开发者运行更长、更复杂的工作流,同时将消费保持在 Alibaba 的 QwenCloud 服务内。它们也为 Qwen 提供了一批可用于营销的精心展示示例和用于模型评估的困难案例。
参赛作品需发送至 QwenOfficial@alibabacloud.com,主题为 "#QwenGrowthPlan + Task Description." Alibaba 要求参赛者提供代理场景、提示、Qwen 的实际表现、评估或建议及联系方式。接受截图、代码和压缩文件。
低摩擦的提交流程有一个实际优势:开发者可以报告失败,而无需把它们转化为正式的基准、可复现仓库或公开漏洞报告。Alibaba 随后可以根据任务类型和严重性对这些示例进行分类,再决定哪些行为值得在训练后改进。
Qwen3.8 is still a preview product
QwenCloud's model documentation 将 qwen3.8-max-preview 列为通过 Token Plan 可用的预览模型,具有 100 万代币的上下文窗口、思考支持(thinking support)、函数调用和内置工具。单独的 Token Plan documentation 表示 Alibaba 可能在预览期间改进该模型,并在之后下线或以正式版本替换它。
Qwen3.8 可以通过 QwenCloud's hosted tool system 调用网络搜索、代码解释器、网页抓取、反向图像搜索和文本到图像搜索。这些能力增加了代理可能出错的环节。一个有用的答案依赖于规划、工具选择、检索、执行和最终综合,而不是单一模型回应。
Alibaba 的 WAIC summary 将 Qwen3.8-Max-Preview 描述为一个 2.4 万亿参数的模型,并称初步测试显示它仅次于 Anthropic 的 Claude Fable 5。这些是 Alibaba 的说法。目前的预览通过 Token Plan、Qoder 和 QoderWork 分发。
Growth Plan 为 Alibaba 在生产模型到来之前围绕这些声明建立任务级别证据提供了一种途径。它也把讨论转向可重复的工作:跨仓库编码、来自多源的研究、处理文档或完成需要多个工具的任务。
这比排行榜上的名次更为苛刻。在 Alibaba 在 WAIC 上声称将 Qwen3.8-Max 与其他前沿系统直接比较之后,预览版必须把相似性的讨论转化为开发者的信任。
Developer feedback serves Alibaba's cloud strategy
该活动规模相较于 Alibaba's infrastructure spending 很小,但服务于相同的目标。2025 年 2 月,Alibaba 承诺在三年内至少投入人民币 3800 亿元(在公告时约合 530 亿美元)用于 AI 和云基础设施。Wu 将 AI 视为“一代人的机会”,并将云计算确定为 Alibaba 最明确的 AI 收入路径。
Alibaba 可以内部资助模型开发,通过其云产品分发 Qwen,并用代币奖励补贴实验。Growth Plan 将这些资产连接起来:开发者获得算力,Alibaba 获得使用量和反馈,而最有力的示例则成为该模型的销售材料。
Wu 的职业生涯是在已有分发渠道的业务内部构建技术,从 Taobao 到 Alipay。Qwen 遵循相同模式。Alibaba 无需发起独立的模型创业或筹集外部资本。它可以把 Qwen 嵌入到编码工具、云订阅及其自身的互联网产品中,然后利用像本次这样的活动来发现哪些任务值得投入额外工程。
该项目中如实包含失败案例是最有用的部分。代理模型在受控演示中常常看起来很有能力,但在任务跨越工具、文件和不断变化的指令时会崩溃。当 Alibaba 能将这些失败转化为生产版本中的可衡量改进时,Qwen3.8 才能赢得开发者的信任。