J-Space 表示其文本测试框架使 DeepSeek V4 Pro 超越了 Fable 5

报告显示的增益很可观,但这一广为传播的说法超出了采用混合厂商基准方法的单次运行测试所能得出的结论。

By · Published

Primary source: X

Why it matters

J-Space's results suggest agent performance depends heavily on orchestration, but single-run, mixed-method scores cannot support claims that DeepSeek beat Fable everywhere.

J-Space says its text harness pushed DeepSeek V4 Pro past Fable 5 — The reported gains are substantial, but the viral claim outruns single-run tests that mix vendor benchmark methods.

开源开发者 Tiger380 发布了一份基准测试报告,声称一个基于文本的控制层显著提高了 DeepSeek V4 Pro 在推理和 agent 任务上的表现。该发现于 8 月 17 日引起关注,此前 Jun Song (@jun_song)X 上的一条线程 中写道,该 harness “在每个任务上都完全超越了 Fable”。

基础的 DeepSeek V4 and J-Space report 支持的结论更为有限。其结果显示当与 J-Space 配对时 DeepSeek V4-Pro-0813 在九个测试基准上均有所提升,但并未显示它在每个任务上都击败了 Anthropic 的 Fable 5。测试也是单次运行,跨模型比较合并了在不同评估方法下发布的分数。

Tiger380 的 J-Space Cognition Suite V3.6 并不更改模型权重或微调 DeepSeek。它将指令、任务路由规则和一个可选的 Python 状态控制器打包成一个推理时层,旨在在长时间任务中保持目标和约束的活跃状态。

该套件将工作路由到 fastfullloop 模式。对于较长的任务,它维护一份账本,涵盖目标、活动事实、已验证发现、未决问题和下一步行动。它还指示模型对进度进行检查点保存,将诊断带入重试并验证测试实际覆盖了任务的多少。仓库包含九个可选择加载的协议模块以及可选的控制器。

把那称为“一个简单的 harness”低估了被测试的内容。J-Space 是一个结构化的 agent 操作协议,包含状态管理、验证规则和恢复行为。其核心押注是,一些模型失误来自于在工具调用和上下文变化中丢失对任务的跟踪,而不是缺乏底层的推理能力。

The DeepSeek gains are large

报告比较了在官方 DeepSeek Harness 最小配置下的 DeepSeek V4-Pro-0813 与 在相同设置下加上 J-Space 的情况。报告称该模型在启用工具的 Humanity's Last Exam 上的得分从 60.0 提升到 67.7,在 Terminal Bench 2.1 上从 87.9 提升到 90.1,在 NL2Repo 上从 61.5 提升到 73.4。

报告的 DeepSWE 分数从 62.7 升至 72.0。CyberGym 从 83.3 提升到 86.8,而 Toolathlon-Verified 则从 74.1 提升到 79.5。Agents' Last Exam 和 AutomationBench 上也出现了较小但仍为正的提升。在未使用工具的 Humanity's Last Exam 上,J-Space 将报告分数从 42.7 提高到 48.0。

这些结果使得同模型比较成为报告中最有说服力的部分。根据 Tiger380 的说法,基础模型、任务、工具条件和评分规则都保持不变,操作协议作为实验变量。

然而方法论仍留下相当大的不确定性。每个结果代表一次运行而不是多次试验的平均值,报告也未提供置信区间。报告还指出 DeepSeek 的 API 可能会在 thinking 模式中忽略提交的 temperaturetop_p 值。因此小幅差异可能反映运行间变异,而较大的增益则需要独立复现才能被视为稳定。

The Fable claim does not survive the table

Tiger380 自身的比较显示在未使用工具的 Humanity's Last Exam 上 Fable 5 领先,得分为 53.3,而带有 J-Space 的 DeepSeek V4-Pro-0813 为 48.0。GLM-5.3 在 AutomationBench 上也领先,为 48.2,而 J-Space 为 38.2。NL2Repo 未列出任何 Fable 结果。

报告描述 J-Space 配置在参考列上领先七个基准,这一点与“在每个任务上击败 Fable”这一说法有实质性差别。作者还警告说,对照分数保留了各模型供应商发布的评估方法。Fable、GLM、Kimi 和 Opus 并未在统一的 J-Space 评估中重新运行。

这使得跨模型表格更像一组参考点,而不是受控的正面对决测试。它可以显示 DeepSeek 报告分数在公开结果中的位置,但不能证明在相同条件下 J-Space 已经将 Fable 取而代之。

J-Space borrows a research term for a different layer

该项目名称来源于 Anthropic 7 月 6 日的研究,描述了一组与概念相关的内部模型表征,这些表征可以被报告、有意保持并用于推理。Anthropic 使用一种名为 Jacobian lens 的技术研究了这些神经激活。

Tiger380 的套件并不检查或编辑那些隐藏的激活。它应用文本指令和外部状态管理机制,借鉴 Anthropic 的发现来说明 agent 如何维护工作集并协调多步骤计算。该套件本身声明并不主张文本指令可以直接暴露每一个隐藏激活。

这种区分很重要,因为如果基准增益可复现,则它们将证明更好的推理时编排的价值,而不是对模型内部 J-space 的直接控制。DeepSeek 的 官方 V4 Pro 模型说明卡 描述了一个 mixture-of-experts 模型,具有 1.6 万亿总参数、490 亿激活参数和一百万令牌的上下文窗口。这样的模型在代理包装 mishandle 工具、上下文或验证时仍可能表现不均衡。

J-Space 的报告提供了包装器可以显著改变结果的证据。它尚未证明 DeepSeek V4 Pro 击败了 Fable 5,更谈不上在每个任务上都如此。更为站得住脚的发现也是更有用的发现:当 harness 改变时模型排名可能会移动,这意味着 agent 构建者在基准测试时实际上是在评估一个组合系统,即便排行榜上只标注了模型的名字。

Reader comments

Conversation for this story loads after sign-in.