Castform 和 Neon 表示,一款 4B 模型以 100 倍更低的成本达到了与 GPT-5.6 Sol 相匹配的表现。

Neon 的一项案例研究称,这种专用的开放权重模型在检索准确性方面与 GPT-5.6 Sol 相当,而每次推理工作负载的成本约低 100 倍。

By · Published

Primary source: Neon

Why it matters

Castform's result suggests task-specific post-training can make inexpensive open models competitive on narrow production workflows, though the 100x claim rests on a vendor-authored benchmark with limited methodology.

Illustration of Castform and Neon's 4B model compared with GPT-5.6 Sol, with data streams and a gauge showing matching retrieval accuracy at much lower inference cost

Castform 联合创始人 Ying Hang Seah 和 Neon 表示,一款经过 Castform 后训练的 40 亿参数开放权重模型在检索结果准确性上与 OpenAI's GPT-5.6 Sol 相当,同时每次推理的成本约低 100 倍。该说法来自 Neon 与 Seah、Databricks 产品高管 Pranav Aurora 以及 Angel Pan 共同撰写并于 2026 年 8 月 5 日发布的 案例研究

Seah 在斯坦福学习计算机科学和管理科学与工程,联合创办了实时代码协作初创公司 Tym,且在 Roblox 收购 Tym 后曾担任软件工程师。

“多数团队最好的训练数据就摆在他们的数据库里,”Seah 在 Neon 案例研究 中表示。Castform 的押注是,团队可以将那些数据库、文档和生产跟踪记录转化为专用模型,而无需构建内部机器学习平台。

一项在经济性上有意义但范围有限的胜利

该基准是由供应商撰写的、针对特定任务的评估。Neon 和 Castform 表示,他们的 40B 开放权重模型在检索准确性上与 GPT-5.6 Sol 相当,同时每次推理工作负载的成本约低 100 倍。该比较出现在 Neon 的案例研究

Castform 和 Neon 未披露该开放权重模型的名称或确切检查点。它们也没有发布完整的评估语料、测试查询数量、详细评分方法、运行间方差或置信区间。这些省略阻止了对该头条结果的独立复现。

Neon 的陪同文字为成本论点提供了一个参考点:公司称一次典型的多轮搜索请求使用 GPT-5.6 Sol 需要超过 10 秒,端到端成本约为 $0.03。案例研究并未说明其 “100x” 比较是否包括数据准备、合成示例生成、强化学习训练、搜索基础设施或工程成本。

该结果为任务特定的后训练(post-training)示例提供了一个具体说明,表明经过特定任务后训练可以缩小小型开放权重模型与更大 API 模型之间的性能差距。其适用范围仍局限于 Neon 与 Castform 评估的检索工作流。

教一个小模型如何搜索

Castform 的系统训练模型去决定要搜索什么、何时再次搜索以及如何使用返回的证据。这与传统的检索增强生成管道不同,后者通常由开发者执行一次嵌入检索(embedding lookup)并将得到的片段放入提示中。

Lakebase Search 将通过 lakebase_text 的 BM25 关键词搜索与通过 lakebase_vector 的向量检索结合起来。

在每次强化学习 rollout 中,模型发出搜索查询并根据是否检索到正确来源、引用了正确段落并生成了正确答案来获得奖励。来自这些尝试的反馈调整了模型的行为。Castform 随后在生产推理期间使用相同的搜索接口,减少了训练环境与部署系统之间的差异。

Castform 和 Neon 在 GitHub 上发布了一个 retrieval-training example on GitHub。Castform 的 文档 描述了如何从生产代理跟踪中进行训练,允许部署后观察到的失败和边缘情况成为新的示例。该示例展示了工作流,但并未提供足够的信息来复现 Neon 基准。

在训练期间,Neon 的作用变得更重要,因为成千上万的并行 rollout 可能各自多次调用数据库。Neon 表示,其存储与计算分离使系统能够在这些突发期间扩展并在其间缩减。Castform 可以重复使用 Postgres 作为文档存储、关键词索引、向量索引和训练时的搜索服务,而不必为每项工作维护单独的系统。

Seah 对专用模型的押注

Castform 在 2026 年 6 月 11 日进入 公开测试版,在发布 Neon 结果前不到两个月。

Castform 要求开发者定义任务、模型可用的工具以及代表良好结果的奖励信号。Castform 负责数据集生成、GPU 配置、强化学习算法、检查点保存和监控。其文档也支持从生产代理跟踪中训练,允许部署后观察到的失败和边缘情况成为新的示例。

该产品为自助式并按使用计费。Castform 的 定价页面 将 Qwen3.5 4B 的训练列在启动价格为每 100 万训练 tokens $0.10。这是列出的训练速率,而非产生 Neon 基准中模型的总成本,且 Castform 并未确认 Qwen3.5 4B 就是那里使用的模型。Castform 也未披露基准的训练 tokens 数量、rollout 次数或数据生成调用次数。

Castform 正进入一个年轻的后训练市场,该市场包括 OpenPipePredibasePrime Intellect。OpenPipe、Predibase 和 Prime Intellect 共享一个前提:许多生产代理在一个已知工具集和专有数据的单一工作流上需要可靠的性能,而不是在编码、推理和知识等更广泛领域的整体改进。

Seah 的测试为该前提提供了一个具体的检索示例。所报告的与 GPT-5.6 Sol 的匹配提供了价格与性能的参考,尽管未披露的方法论和任务的狭窄性并不能支持关于在其他检索工作负载上取代 Sol 的主张。

对 Castform 来说,这个边界符合其产品战略。Seah 正在出售对特定行为的控制权,包括导出训练权重并在其他地方部署的能力。可靠的训练循环可以让团队将需要更广泛能力的工作保留给前沿模型,同时把重复性、高流量的代理步骤迁移到他们可控的模型上。

Reader comments

Conversation for this story loads after sign-in.