MemTensor 发布 Metis 模型,可在主干网络内写入记忆

基于 Qwen3.5 的研究预览包含 4B、9B 和 27B 检查点,同时不公开训练数据,并将代码限制为仅供非商业使用。

By · Published

Primary source: X

Why it matters

Persistent state is becoming a core constraint for agents that operate across days and applications. Metis tests whether some of that state can move from vector databases and prompts into the model's computation itself.

Illustration of MemTensor's Metis models shown as flowing neural pathways inside a backbone, representing memory for the Qwen3.5-based 4B, 9B, and 27B checkpoints.

MemTensor,这家由前 Alibaba 数据高管 Xiong Feiyu 创立的上海 AI 开发公司,发布了一系列模型,设计目标是在模型主干内部保持记忆,而不是反复从外部数据库检索旧文本。

The Metis 发布,作为一篇 研究论文 于 7 月 29 日提交,其中包含标注为 4B、9B 和 27B 的模型。Hugging Face 收藏 列出它们的完整规模分别约为 50 亿、90 亿和 280 亿参数,并表示该系列基于 Qwen3.5。Adina Yakup (@AdinaYakup) 在 7 月 31 日的一条 X 帖文串中重点介绍了此次发布。

Metis 是 Xiong 自 2024 年 11 月成立 MemTensor 后所追求论点在模型层面的体现:长期运行的 AI agent 需要跨交互保持的状态。根据 36Kr 对 MemTensor 的报道,Xiong 此前负责 Alibaba 业务平台的数据智能以及为 Taobao 和 Tmall 服务的数据平台。他在 2023 年 7 月于 Shanghai Algorithm Innovation Research Institute 建立了 Large Model Center,随后将该团队拆分成 MemTensor。

“记忆正在成为 Agent 时代的新基础设施,”Xiong 对 36Kr 说道。

在不重播对话记录的情况下的记忆

大多数 agent 记忆系统将信息存储在语言模型之外,检索选定记录并将其插入后续提示中。这种方法为开发者提供了可检查的存储,但每次查询可能都需要检索、排序并再次通过所选文本。

Metis 则将记忆块插入 Transformer 层。一个本地记忆块在交互步骤间维护一个动态矩阵。第二个组件从隐藏状态中选择信息,更新该矩阵并通过专用的 memory-attention 路径在稍后读取。模型的学习到的权重在推理期间保持冻结;记忆状态通过前向计算发生变化,而无需梯度更新。

在实践中,开发者可以在一次交互中向 Metis 提供信息,将该交流提交到模型的记忆状态中,并在稍后查询时不必重新发送原始文本。该状态具有固定大小,因此查询其成本不会直接随完整对话记录的增长而增长。

作者将 Metis 描述为“记忆基础模型”(memory foundation model)的第一个原型——他们将这一类别定义为具有持久内部状态和用于记忆、更新与遗忘的学习程序的模型。这个首创性主张属于研究者。早期工作已经探讨了循环状态、测试时自适应、参数化记忆和记忆增强神经网络,论文花了相当篇幅将 Metis 与这些方法区分开来。

有可见限制的研究预览

MemTensor 自身的发布在已交付内容上划定了明确界限。GitHub 仓库 包含架构、推理示例、训练与评估框架、代码以及官方检查点,但省略了训练数据。仓库代码采用 PolyForm Noncommercial License,该许可禁止在未另行达成协议的情况下用于商业用途。仓库还说明模型权重和数据集的管理条款与该软件许可是分开的。

论文报告称 Metis 在研究者的记忆操作评估上表现强劲,并能迁移到分布外的记忆任务。然而这些结果尚未积累广泛的独立复现。作者也记录了核心权衡:将历史压缩到固定大小的状态会随着任务变长而丢失信息。他们报告在多个信息在潜在记忆空间混合时偶有混淆,并且实验表明在若干记忆操作上,访问完整源文本仍然是最强的设置。

这些特点使 Metis 更像是一种架构实验,而非检索增强生成(retrieval-augmented generation)的成品替代方案。MemTensor 的路线图明确将混合系统放在视野中,当精确记录、长时间历史或可审计的源材料很重要时,会将内部状态与外部存储结合起来。

MemTensor 在两个层面上追求记忆

Metis 延续了 MemTensor 的另一个独立框架 MemOS,后者用于为模型和 agents 存储、检索和治理外部记忆。这两款产品为 Xiong 提供了进入同一市场的两条并行路径。MemOS 可以作为基础设施围绕现有模型运行,而 Metis 要求开发者采用围绕原生记忆训练的模型架构。

这一策略吸引了与硬件和设备相关的资本。根据 36Kr 的报道,MemTensor 在 7 月完成了来自 Huawei's Hubble Investment、Honor Strategic Investment、SenseTime Guoxiang Capital、Shenzhen Venture Capital 和 Yu Capital 的 1 亿元人民币 Pre-A 轮融资。之前近 1 亿元人民币的天使轮包括 Fusion Capital、Suanfeng Information 和 CICC Capital。MemTensor 尚未公布投后估值。

这一投资者组合契合该技术押注。设备和持久运行的 agents 无法在每次行为时都重放不断增长的对话。紧凑的内部状态可以降低重复的上下文处理并在计算和延迟更受限制的硬件上保持连续性。Metis 仍需证明其压缩状态在那些记忆最重要的长期工作流程中能够保持准确、可控且可恢复。

Reader comments

Conversation for this story loads after sign-in.