Meta 在 Apache 2.0 许可证下开源 Muse Glimmer 代理模型

Meta 正在以 Apache 2.0 许可发布可下载的 Muse Glimmer 权重,赋予开发者对一个多模态代理模型的控制,该模型可在 24 GB 或 32 GB 内存下运行。

By · Published

Primary source: AI at Meta

Why it matters

Muse Glimmer gives engineering teams an Apache 2.0 agent model they can run and modify locally. Meta documents full-precision memory use above 55 GB, quantized weights below 20 GB, 24 GB and 32 GB deployment options, and RTX 5090 throughput reaching 233.4 tokens per second with speculative decoding.

Deconstructed AI model architecture and local hardware integration (exploded-view technical diagram — clean isolated parts on white, callout labels with leader lines)

Meta 于 8 月 10 日发布了 Muse Glimmer,作为一个可下载的、Apache 2.0 许可的用于多模态代理和编码工作的模型。通过公布该约 296 亿参数模型的权重,Meta 为开发者提供了一个可替代其托管 Muse Spark 模型的选项,开发者可以在自己的基础设施上评估、修改并运行该模型。

这些权重可通过 Hugging Face 模型卡 获取,并有单独的 开发者资源 涵盖部署细节。Meta 在一篇 技术文章 中详细介绍了此次发布,并通过 AI at Meta 宣布了可下载事宜。

Apache 2.0 权重让开发者掌控

Glimmer 的 Apache 2.0 许可证 允许团队在许可条款下检查并修改可下载的模型。采用这种分发模式会将部署、性能和基础设施的责任转移给运营方,但也让他们可以在自己的硬件上评估模型,而不是只能通过托管服务访问。

Glimmer 是 Meta 的内部项目,而非独立融资的公司。发布材料未识别任何个人创始人或模型创建者,也未披露与 Glimmer 相关的特定资金、客户、使用数据或定价信息。

Meta 表示它将 Glimmer 从 Muse Spark 提炼而来,将较大教师模型的行为转移到一个旨在本地部署的封装中。Muse Spark 1.1Meta Superintelligence Labs 于 7 月 9 日发布,仍作为一个托管的多模态推理模型通过 Meta AI 的 Thinking mode 以及 Meta Model API 的公开预览提供。

Spark 1.1 支持编码、调用工具、计算机使用和多模态理解。Meta 表示它可以泛化到新的原生工具、Model Context Protocol 服务器和自定义技能,然后规划工作并将执行分配到并行子代理。Glimmer 将相关的代理行为打包进一个 Apache 许可的包中,基础设施由运营方控制,并具有固定的本地内存需求。

量化版本面向 24 GB 和 32 GB 系统

Muse-Glimmer-30B 这一名称表示其 30B 模型类别。官方模型卡 报告了大约 296 亿个总参数,其中包括一个 18 亿参数的感知编码器。Glimmer 采用密集因果 Transformer 架构,具有 52 层、6656 维的隐藏状态、32 个查询注意力头和两个键值注意力头。

相关的 Muse-Glimmer-30B-GGUF 仓库 打包了从同一 30B 类基础模型派生的量化权重。全精度推理需要超过 55 GB 的内存,模型卡将 64 GB VRAM 作为部署目标。

Meta 的大约 4 位量化版本将语言模型权重减少到低于 20 GB。文档中列出的硬件包线为 K-Quant-Dynamic 的 32 GB VRAM 和 K-Quant-17GB 变体的 24 GB。这些配置为键值缓存、图像处理、感知编码器以及单独的猜测解码模型保留了容量,根据 Meta 的 技术材料

Glimmer 随附一个 DFlash drafter,为主模型提议 16 个 token 的区块以供验证。在 Meta 的 Nvidia RTX 5090 测试中,DFlash 将 K-Quant-17GB 的生成速度从 74.9 提高到 233.4 tokens/秒,提升约 3.1 倍。模型卡 还报告在 Apple M4 Max 上从 23.7 提升到 37.8 tokens/秒,在 M5 Max 上从 26.6 提升到 50.2。以上为 Meta 的测量结果,可能随提示、运行时设置和可用内存而变化。

Hugging Face 列出了通过 llama.cpp、vLLM、SGLang、Ollama、Unsloth Studio、OpenClaw 和 Hermes Agent 进行本地部署的路径。发布时,Meta 表示已计划在随后的几天内提供针对 llama.cpp、MLX 和 ExecuTorch 的优化集成。团队仍需根据自身工作负载测试延迟、工具调用可靠性、内存消耗和持续吞吐量。

开放模型支持多模态代理工作

Glimmer 接受文本和图像输入并生成文本。Meta 文档显示其上下文窗口至少为 131,072 个 token,知识截止日期为 2026 年 1 月 4 日。根据 模型卡,其披露的训练来源包括公开可用的多模态数据、第三方数据、Meta 的产品和服务,以及由外部供应商和 Meta 人员策划或丰富的材料。

Meta 描述该模型具备多步规划、基于 schema 的函数调用和长周期任务执行能力。它可以诊断失败的工具调用并重试,编写和调试代码,并解释截图、图表和文档。公司还记录了可控的推理强度、与 OpenClaw 及类似代理脚手架的兼容性,以及在其 发布文章 中提到对 100 多种语言的支持。

Meta 的 Glimmer 模型卡 报告了在 MCP Atlas 上得分 75.5、DeepSearch QA 上 74.6、SWE-Bench Pro 上 51.2、SWE-Bench Verified 上 76.0、TerminalBench 2.1 上 51.7 以及 Beam128K 上 65.1。这些结果涵盖了工具使用、软件工程、终端操作和长上下文行为。它们是公司报告的数据,而非独立评估。

对于工程团队而言,核心权衡是控制权与运营负担之间的平衡。Glimmer 的 Apache 授权权重使模型可用于本地评估和修改,而其内存需求、服务栈和工具调用的可靠性仍由运营方负责。

Reader comments

Conversation for this story loads after sign-in.