Cactus 发布 14MB 的 Needle 2,用于在廉价设备上进行工具调用

Henry Ndubuaku 和 Roman Shemet 设计了 Needle 2,旨在将语音转化为可以在 CPUs 上执行的类型化操作;Pebble 已经在本地运行 Needle。

By · Published

Primary source: Cactus Compute

Why it matters

Needle 2 tests whether useful device agents can be specialized enough to run locally on cheap CPUs, cutting cloud costs without handing routine actions to a general-purpose model.

Illustration of Cactus Needle 2 converting spoken input into typed actions on a low-cost CPU, shown running on a Pebble device.

Cactus Compute founders Henry Ndubuaku (@Henry_Ndubuaku) and Roman Shemet (@RomanShemet) introduced Needle 2, a 14MB language model for tool calling on low-memory devices. 提供的产品页面未显示单独的发布日期。Cactus Compute 表示该模型可以在没有 GPU 或 NPU 的手机、可穿戴设备、家用设备、机器人和更新的微控制器上运行。

创始人们在追求一种不同的边缘 AI 定义。Ndubuaku(他放弃了在 Nvidia 的 AI 和机器学习岗位以建立 Cactus Compute)和 Shemet(一名前量化分析师与经济学家)在 2025 年成立公司之前就开始合作。Cactus Compute 加入了 Y Combinator 的 2025 年夏季批次,其论点围绕位于旗舰手机和笔记本级计算机下方的廉价硬件展开。

Needle 2 是该论点最清晰的体现。这个拥有 4500 万参数的模型不能作为通用聊天助手。它会读取用户请求,从声明的一组函数中选择并填充所需参数。例如,将客厅灯调暗的请求会变成包含房间、状态和亮度的结构化调用,而不是一段散文式的回复。

这一更狭窄的任务让 Cactus Compute 有空间去追求文件大小、内存使用和速度,而不是广泛的知识。 Needle 仓库 描述 Needle 2 大约使用 28MB 的 RAM。Cactus Compute 在公开发布说明中报告,在 Raspberry Pi 5 上为每秒 500 个 token,在低于 200 美元的手机上为每秒 300 到 700 个 token。上述性能数据来自 Cactus Compute 自身的测试,尚未得到独立复现。

更小范围的代理定义

Needle 2 将设备的能力视为带类型的工具。开发者使用 schema 描述函数和参数,然后模型将自然语言请求映射到这些 schema。开源仓库 包含用于控制灯光、调整恒温器、提取发票字段、在工具间路由以及将后续参数依赖于先前结果的动作串联的示例。

Cactus Compute 以从声明的 schema 编译出的字节级语法来约束每个输出。该设计可防止格式错误的调用,并在开发者指定范围、格式或枚举选项时将模型限制为有效值。与可用工具不匹配的请求会返回一个空调用。

Needle 2 还为其输出附加置信度评分。产品可以执行高于设定阈值的调用、在指令不确定时询问用户澄清,或将请求发送到更大的云端模型。该升级路径将 Needle 2 连接到 Cactus Compute 更广泛的 设备端 AI 平台,该平台的构建思路是将常规工作放在本地处理,而将更难的请求保留给远程推理。

Cactus Compute 提供本地微调代码,便于制造商将 Needle 2 适配到产品自己的功能名称和语言中。公开列出的模型和权重可通过 Hugging Face 以 MIT 许可证获得。

对 Ndubuaku 和 Shemet 来说,专门化正是重点。恒温器、手表或机器人已经有执行其可用动作的代码。Needle 2 处理人类话语与那些函数之间的混乱层面,而不携带写作论文、回答广泛问题或模仿通用助手所需的参数。

Pebble 将 Needle 放入真实产品

Pebble 通过其 Index 01 智能戒指为 Cactus Compute 提供了早期的生产测试。该无屏可穿戴设备将录音发送到 Pebble 的手机应用,在那里请求可以变成提醒、笔记、闹钟或其他操作。

Pebble 创始人 Eric Migicovsky 写道,Index 01 应用在本地运行 Cactus Needle 来处理诸如提醒、笔记、闹钟和计时器等语音操作。Pebble 将这些操作以 MCP 工具的形式暴露,同时云端处理仍可用于更高质量的结果。

该部署与 Ndubuaku 和 Shemet 设计时所围绕的约束相匹配。无屏戒指需要语音指令能快速且始终如一地产生正确操作,即使在连接性较差时也是如此。Pebble 的 生产更新 将 Index 01 描述为一款售价 75 美元、设计为可离线工作且无需付费订阅的设备,尽管需要一个免费的 Pebble 账户且云选项依然可用。

Pebble 为 Needle 2 提供了比浏览器演示更有力的证明点。它展示了一个小型动作模型如何位于本地语音识别与消费产品内部的确定性应用代码之间。但这并不能证明该模型在 Cactus Compute 针对的更广泛手机、机器人和智能家居硬件上的可靠性。

Cactus Compute 正在对抗模型膨胀下注

大型平台供应商也在将函数调用移至设备端。Google 的 AI Edge 软件 将受支持的小模型与设备端函数调用、检索和多模态输入相结合。Apple 的 Foundation Models 框架为开发者提供了访问更大规模的设备端模型的能力,带有引导生成和工具支持。

Cactus Compute 在内存和硬件要求上与这些系统展开竞争,目标是在更低层次。Needle 2 的架构借鉴了由 Ndubuaku 牵头的一篇 2026 年 7 月研究论文。在论文的受控、参数匹配实验中,将从前馈层释放出来的参数重新分配到额外的 attention 深度上,使得报告的损失差异降至 0.006 nats。Cactus Compute 将这项工作与其自身的量化和推理引擎配对,针对其发布所采用的两位格式训练 Needle 2,而不是在训练完成后的全精度检查点上进行压缩。

Cactus Compute 的基准和速度宣称仍来自 Cactus Compute 自身的测量。商业化测试将取决于制造商是否愿意在用户话语与物理动作之间放置一个 14MB 的模型。一次错误的聊天回答是令人不便的;一次错误的设备命令可能会改变恒温器设置、发送消息或移动机器人。

Ndubuaku 和 Shemet 选择了一个可行的起点。Needle 2 放弃了对话广度,以适配那些大型模型无法经济服务的硬件。如果其置信度评分和 schema 约束在 Cactus Compute 的测试之外也能经受住考验,创始人们将为一类在设备端 AI 推进中大多被忽视的设备构建出一个实用的控制层。

Reader comments

Conversation for this story loads after sign-in.