Fermisense 表示,花费 500 美元对 Qwen 进行微调,在目录审核中击败了前沿模型
9B specialist 在 Fermisense 的模拟中得分为 87.3%,但该测试仅使用了 200 个验证回合,且缺乏独立复现。
By Ryan Merket · Published
Primary source: Fermisense
Why it matters
Fermisense's test shows how workflow data and a scored simulator can turn a small open model into cheaper, task-specific infrastructure, reducing dependence on frontier APIs at high volume.

Justinas Zaliaduonis (@JZaliaduonis) and four collaborators at Fermisense trained a 9-billion-parameter Qwen model for roughly $500 and said it outperformed five frontier-model configurations on a simulated e-commerce catalog-review workflow.
Fermisense reported the result in a July 27th technical write-up authored by Zaliaduonis, Joris Zilinskis, Fabian Hildesheim, Joel Hainzl, and Gediminas Pazera. Zaliaduonis has conducted machine-learning research at Stanford, while Hildesheim recently completed research at Stanford's Institute for Human-Centered Artificial Intelligence. Fermisense's website says its personnel have also worked or studied at MIT, Lyft, Skyscanner and the University of Waterloo.
The result supports a narrower and commercially consequential claim than the usual benchmark contest: a small model trained against a company's own rules can beat a larger general-purpose model on a repetitive, measurable workflow. The comparison remains a Fermisense-designed experiment conducted with Fermisense's data construction, scoring system and cost assumptions. It has not been independently reproduced.
一个带有不对称惩罚的模拟目录
Fermisense 使用 Amazon Berkeley Objects dataset 构建了一个市场目录的数字孪生体,该数据集包含真实的产品图片和商品信息。Fermisense 将这些材料转换为 177,767 个审查情景,并加入了受控的政策案例、图片不匹配、冲突的品牌声明以及旨在测试误报的合法声明。
对于每个商品列表,模型必须在大约 13,000 个产品类别的分类法中进行搜索,核验所声称的品牌、检索所需属性并提交结构化决策。Fermisense 的评分器将漏报违规的惩罚设为误报的七倍,反映了允许违规列表通过比将有效列表送审成本更高的经济假设。
Fermisense 在 200 个分层的验证情景上评估了这些模型。根据该说明,前沿模型组包括 GPT-5.5、GPT-5.6-sol、Gemini 3.1 Pro、Claude Opus 4.8 和 Claude Fable 5。每个模型收到相同的图片、工具、评分器和轮次预算。Fermisense 同时测试了普通提示和包含约 2,800 字符的程序与示例的优化指令。
在 Fermisense 的评分规则下,表现最强的前沿配置达到了可实现最高分的 76.9%。经训练的 9B 模型达到了 87.3%,而其未经训练的基模型为 64.2%。该百分比是 Fermisense 评分上限的归一化份额,而非传统的准确率;且该基准的规模使其在更广泛的市场商品分布上的表现仍是一个开放问题。
公开的 merged model 在发布说明中将该版本标识为以 BF16 格式的 9B-parameter Qwen3.5 模型。Fermisense 还发布了 training adapter。两个 Hugging Face 页面上的 model-card 字段为空白,因此 Fermisense 的文章成为数据集构建、评估和训练的主要叙述来源。
两张 GPU 和 三天半
Fermisense 表示他们租用了两张 Nvidia RTX PRO 6000 GPU,一张用于生成强化学习的 rollout,另一张用于更新模型。训练通过 Prime Intellect 的开源 prime-rl framework 运行了大约三天半,进行了 1,000 次优化器步长。
Fermisense 表示,模型在大约 250 步(约一天)后就超过了前沿系统达到的范围。整个运行的 GPU 时间成本大约为 500 美元。Fermisense 使用了 group relative policy optimization,或 GRPO,以奖励产生正确类别、属性和政策决策的行为,同时惩罚错误和不必要的工具调用。
该方法将关于模拟市场分类法和决策规则的知识移入了模型权重中。前沿模型必须在每个情景中从提示中重建这些规则。Fermisense 表示,较长的指令使前沿模型的输入成本增加了 28% 到 55%,视模型而定。
这一差异推动了成本比较。Fermisense 估算该专用模型每审查 1,000 条列表的成本约为 $0.50,而最便宜的前沿配置为 $19,最贵的则高达 $172。在 Fermisense 的假设下,得分最高的前沿配置每 1,000 条列表的成本约为 $34,与经训练模型相比声称存在 68 倍的差异。
这些数字是基于模型推理成本的模拟估算,而非来自 Fermisense 现场客户部署的账单。Fermisense 使用每天 4,000 万 次决策的场景将比较年化,估算专用模型大约为 700 万美元,而更强的前沿配置约为 5 亿美元。该流量规模来自 Shopify 发布的关于在大规模下运营微调目录模型的说明,而非 Fermisense 自身的流量。
基准测试也是 Fermisense 的产品论证
Fermisense 销售本地部署的基础设施,用于索引公司电子邮件、文档、电子表格和其他内部材料,以便 AI 系统检索机构知识。Fermisense 表示客户保留对其数据的控制权,并可以将本地模型或前沿 API 连接到索引。
该目录实验将这一主张从检索扩展到了模型所有权。Fermisense 认为,公司应先使用前沿 API 建立基线并收集轨迹、修正记录和评分结果。一旦某项工作流达到足够的量,这些记录就可以用来训练一个较小的专用模型来处理可重复的部分,而对于需要更广泛能力的任务则仍保留前沿模型可用。
这种方法适用于决策量高、工具稳定且结果可自动校验的工作流。目录分类满足这些条件,因为每项决策都可以针对分类法、属性架构和政策规则进行评分。开放式研究、战略和其他没有公认答案的工作提供的训练信号要弱得多。
Fermisense 的结果并不证明 9B 模型在一般情况下比其测试的前沿系统更有能力。它表明,一旦窄任务拥有模拟器、专有规则和反映运营者成本的奖励函数,模型规模的重要性可能降低。在这种设置中,有价值的资产是完整的训练闭环:工作流数据、工具、评估装置和运营者可以在不为每次决策向前沿供应商付费的情况下运行的权重。