Webml-community 在浏览器中使用 WebGPU 本地运行三个 Qwen3.5 模型
Webml-community 的演示通过 Transformers.js 和 WebGPU 在本地运行 Alibaba 的 0.8B、2B 和 4B 多模态模型,无需云端 API。
By RuntimeWire Staff · Published
Primary source: Qwen / Alibaba
Why it matters
The webml-community demo turns downloadable Qwen weights into a local browser application, showing how runtimes and deployment tooling influence which open models developers can test and use without a cloud API.

Qwen3.5 Small于2026年3月2日发布,根据Qwen 的 Qwen3.5 发布公告。一个 WebGPU 演示现在展示了其 0.8B、2B 和 4B 模型如何在浏览器中本地运行。该演示由 webml-community 维护,并由与 Transformers.js 相关的 Hugging Face 工程师 Joshua Lochner (@xenovacom) 突出介绍。该浏览器演示是独立于 Alibaba 的 Qwen3.5 发布公告的另一个部署项目。
Joshua Lochner 在 X 上的 Qwen3.5 浏览器演示
Qwen3.5 WebGPU 演示 为 Alibaba 这款已发布五个半月的小型模型家族提供了一条直接的部署路径:打开网页、选择模型、在需要时附加图像并开始对话。根据演示,推理在浏览器内运行,无需云端 API,聊天内容保留在用户设备上。
该演示将 Qwen3.5 Small 的可下载权重 转换为基于浏览器的测试。Transformers.js 提供了 JavaScript 运行时层,而 WebGPU 则将兼容的模型放在用户自己的图形硬件上。这降低了从找到模型到无需搭建服务器或为推理付费即可尝试之间的门槛。
RuntimeWire 8 月 17 日关于 Qwen3.8 的报告涵盖了新发布的模型权重和许可条款。本次演示涉及的是旧一代模型家族的另一路径:webml-community 将三个 Qwen3.5 Small 模型打包,通过 Transformers.js 和 WebGPU 在本地浏览器中推理。
浏览器是部署目标
该演示提供了参数量为 0.8B、2B 和 4B 的 Qwen3.5 模型。用户可以提交文本或图像,模型支持以推理为导向的任务。
这些细节使得该演示比一个托管的聊天机器人皮肤更具意义。本地推理可以使私有输入不经过外部 API、消除按请求计费,并在所需文件下载完成后无需持续连接即可继续使用。它也将计算开销从模型提供方转移到用户的硬件上,这对为频繁且定义明确的任务服务的应用开发者具有吸引力。
浏览器演示有一个明确的边界。Alibaba 在 2026 年 3 月 2 日发布了四个 Qwen3.5 Small 模型:0.8B、2B、4B 和 9B。webml-community 的界面止于 4B。它并未说明最小内存配置、在不同笔记本上的生成速度,也没有承诺每一台支持 WebGPU 的设备都会提供相同的体验。
缺少 9B 版本很有启发性。模型权重可以是可下载的,但对浏览器标签页来说仍然不够方便。本地模型市场越来越由完整的部署路径决定:量化、运行时支持、内存使用、内核性能和可用的界面。仅凭参数量并不能告诉开发者某个模型是否能舒适地适配到实际产品中。
Transformers.js 仓库 支持语言、视觉、音频和其他模型类别,而无需服务器。对于 Qwen 来说,这项工作将可下载的权重变成开发者在打开终端前可以测试的东西。
关于“前沿”的宣称需要有机器支撑
Alibaba 的帖子重复了关于前沿性能的宣称,但没有指明支持该宣称的具体模型、笔记本硬件或基准。浏览器演示支持更狭义的说法:较小的模型可以通过 WebGPU 在本地运行。
Alibaba 的 Qwen3.5-9B model card 发布了公司运行的基准对比,涵盖知识、编码、推理、长上下文和 agent 任务。它还列出了原生 262,144 token 的上下文窗口、多模态输入和 Apache 2.0 许可。这些规格描述了一个在其规模上异常广泛的模型,但它们并不能证明该浏览器配置在消费级硬件上的表现。
这种区分很重要,因为该界面对较小模型进行了优化以适配浏览器推理。浏览器运行时、数值精度、可用内存和 GPU 实现都可能影响速度和输出。一个在线演示证明了软件栈可行,但并不将 Alibaba 的广泛前沿比较转化为独立复现的结果。
这留下了一个有用的、更狭义的结论:Qwen3.5 Small 可以通过浏览器界面提供本地多模态聊天,并且模型选择足够小以面向消费级硬件。开发者可以直接测试这一命题,尽管该演示并未提供硬件矩阵或每秒 token 数的结果。
独立工具链缩短了部署差距
该演示展示了本地 AI 竞争中有多大一部分属于独立工具构建者。研究机构可以发布模型卡和权重文件,而被广泛采用则取决于那些将这些文件转换、支持新架构、优化内核并使结果在研究环境之外可用的人。
Alibaba 提供了模型。webml-community 维护了浏览器部署,Lochner 将其带到开发者的注意中。Qwen3.5 Small 发布五个半月后,重新审视该家族的技术理由在于从可下载权重到本地应用的路径更短。