BOSS Zhipin 发布 3B Agent 模型,采用复用的 Transformer 堆栈

Apache-2.0 模型使用了两遍的 Looped Transformer,并在 28 万亿个标记上进行了训练,用于编码、办公和工具工作流。

By · Published

Primary source: X

Why it matters

BOSS Zhipin is using recruiting revenue and internal workflow experience to compete in general agent models. If Nanbeige's results hold outside its own tests, startups could run useful coding and office agents with a far smaller memory footprint.

BOSS Zhipin releases 3B agent model with a reused transformer stack — The Apache-2.0 model uses a two-pass Looped Transformer and was trained on 28 trillion tokens for coding, office and tool workflows.

Nanbeige LLM Lab, 位于中国招聘平台 BOSS Zhipin 内部的 AI 研究组,于 7 月 24 日发布了一个紧凑型 agent 模型,该模型将相同的 transformer 层重复使用两次,以在不增加参数的情况下提高其有效深度。

该发布使由 Peng Zhao 创立的 BOSS Zhipin 在应用型互联网平台中处于一个不同寻常的位置。BOSS Zhipin 为招聘工作流构建了 Nanbeige,然后将该研究项目扩展为用于运行编码 agent、办公工具和个人助理的一般模型。Zhao 之前领导过竞争对手招聘平台 Zhaopin,并拥有北京大学的法学学位。

由 Chen Yang 在论文中牵头的 24 位作者研究团队,与 Nanbeige4.2-3B 技术报告 一起发布了 Apache-2.0 模型权重。Nanbeige4.2-3B 总参数量为 40 亿,其中嵌入层以外为 30 亿,并支持英文和中文,最大上下文窗口可达 262,144 个 token。

该发布在 7 月 27 日超出 Nanbeige 自有渠道传播,Tanishq Mathew Abraham, Ph.D. (@iScienceLuvr) 在 X 上转发了模型和论文。Abraham 与 Nanbeige 无关。

Smaller weights, repeated computation

Nanbeige 从头训练了基础模型,训练语料达 28 万亿 token,并在数据混合中增加了数学、代码和合成问答数据的比重。论文还指出,语料中包含较少量的 agent 轨迹数据。

其主要的架构押注是 Looped Transformer。隐藏状态先通过模型的层堆栈,然后再次通过同样的层。这为模型在保持参数量不变的情况下提供了更大的有效计算深度。

参数节约仍然带来了计算成本。Nanbeige 发现,两遍设置保留了标准 transformer 大约 75% 的 token 效率。额外的遍数带来了更小的收益、更慢的训练和更不稳定的优化。实验室还测试了在遍次之间共享键-值缓存,这将缓存需求减半但降低了性能,因此他们为发布模型选择了不共享缓存的完整配置。

训练后,团队将监督微调与若干强化学习阶段结合。Nanbeige 从真实和合成环境中组装了软件工程、工具使用和办公任务的轨迹,然后使用执行结果和基于量表的评估进行筛选。其强化学习流程针对幻觉、重复输出、指令错误、推理长度以及多步工具使用中的失败等问题进行优化。

模型卡提供了通过 Transformers、vLLM 和 SGLang 运行 Nanbeige4.2-3B 的说明。Nanbeige 还发布了 GGUF 和 int4 量化的路径,以及用于本地推理的 llama.cpp 和 Ollama 的修改分支。对于评估小模型的开发者来说,这种打包很重要,因为名义参数数并不意味着模型容易部署。

Strong vendor benchmarks, with caveats

Nanbeige 报告称该模型在 SWE-bench Verified 上得分 63.6,在 SWE-bench Pro 上得分 46.9,在 Terminal-Bench 2.0 上得分 44.1。它还在 GPQA-Diamond 上得分 87.4,在 Claw-Eval 上得分 52.2。

在实验室的对比中,Nanbeige4.2-3B 在列出的所有通用 agent 和代码 agent 评测中,均击败了更大规模的 Qwen3.5-9B 和 Gemma4-12B 模型。它在比较表中还领先了六项推理测试中的五项。Gemma4-12B 在两项对齐评估中保持领先地位,其中包括 BOSS Zhipin 的内部 Recruit-Bench。

这些数据来自 Nanbeige 的自我评估。一些办公和协同测试使用了内部搭建的 scaffold,而 Recruit-Bench 是围绕雇主和求职者任务在内部设计的。Nanbeige 表示,对于主要的编码基准,它使用了既有的 agent 框架,包括用于 SWE-bench Verified 的 OpenHands 和用于 SWE-bench Pro 的 SWE-agent。

训练设计也暴露了紧凑模型的限制。在 agent 强化学习阶段,Nanbeige 偏好相对简单、轨迹较短且通过率较高的任务,因为这些示例比困难的长时域任务带来更稳定的训练和更大的提升。模型卡还单独警告输出可能包含不准确、有偏见或有害的内容。

BOSS Zhipin turns an internal model into a broader platform bet

BOSS Zhipin 自 2024 年开始在搜索、推荐、AI 辅助沟通和面试中部署 Nanbeige。招聘平台将该专有模型与第三方基础模型结合使用,详见 Kanzhun 的 2025 年年报

该模型项目隶属于由 Tao Zhang 监管的技术组织,Tao Zhang 自公司成立以来担任 BOSS Zhipin 的 首席技术官。Zhang 之前曾在 IBM 集团公司、Renren 和 Baidu 工作,负责研究、开发和 IT 基础设施。

BOSS Zhipin 有规模在内部资助这项工作的能力。Kanzhun 报告称 2026 年第一季度平均月活跃用户为 60.9 million,截止 3 月 31 日的 12 个月内付费企业客户为 7.1 million。根据其 May 20th results,第一季度营收达到 RMB2.07 billion,或 $299.9 million,而研发费用为 RMB423.8 million。

Kanzhun 也告诉投资者,Nanbeige 需要持续的资本和人员投入,并且可能永远无法生成足够的直接收入来覆盖这些成本。开源 Nanbeige4.2-3B 为 BOSS Zhipin 对该投资提供了另一种回报:来自外部的采用、反馈以及对这一始于招聘应用内部的模型项目的技术信誉。

对于 agent 开发者来说,实际考验在于报告的性能能否在 Nanbeige 的评估设置之外继续成立。一个具有竞争力的 30 亿参数模型可以降低内存需求,并使私有、低延迟部署更易实现,即便其循环架构对每个 token 需要额外计算。

Reader comments

Conversation for this story loads after sign-in.