BOSS Zhipin、再利用したトランスフォーマースタックを用いる3Bエージェントモデルを公開
Apache-2.0モデルは、2パスのLooped Transformerを使用し、コーディング、オフィス、ツールのワークフロー向けに28兆トークンでトレーニングされました。
By Ryan Merket · Published
Primary source: X
Why it matters
BOSS Zhipin is using recruiting revenue and internal workflow experience to compete in general agent models. If Nanbeige's results hold outside its own tests, startups could run useful coding and office agents with a far smaller memory footprint.

Nanbeige LLM Lab、中国の採用プラットフォーム BOSS Zhipin 内の AI 研究グループは、7月24日に、同じトランスフォーマーレイヤーを2回使用してパラメータを増やさずに有効な深さを高めるコンパクトなエージェントモデルを公開した。
この公開により、BOSS Zhipin(創業者は Peng Zhao)は、応用インターネットプラットフォームの中で異例の立場に置かれることになった。BOSS Zhipin は採用ワークフロー向けに Nanbeige を構築し、その後研究プログラムを拡張して、コーディングエージェント、オフィスツール、パーソナルアシスタントを動かすことを意図した汎用モデルへと発展させた。Zhao は以前、競合する採用プラットフォーム Zhaopin を率いており、Peking University の法学位を保持している。
論文で Chen Yang が主導した24名の著者からなる研究チームは、Nanbeige4.2-3B 技術レポート を Apache-2.0 モデル重み とともに公開した。Nanbeige4.2-3B は総パラメータ数が40億で、そのうち埋め込み層外に30億を含み、英語と中国語をサポートし、コンテキストウィンドウは最大262,144トークンに対応する。
小さな重み、繰り返される計算
Nanbeige は事前学習を一から行い、コーパスは28兆トークンで構成され、数学、コード、合成の質問応答データの比率を増やした。論文によれば、コーパスにはエージェント軌跡データも少量含まれている。
その主要なアーキテクチャ上の賭けは Looped Transformer である。隠れ状態はモデルのレイヤースタックを通過した後、同じレイヤー群をもう一度通過する。これにより、パラメータ数を固定したままモデルの有効な計算深度を高めることができる。
パラメータの節約は計算コストを伴う。Nanbeige は、2パス構成が標準的なトランスフォーマーのトークン効率のおよそ75%を保持することを確認した。さらにパスを増やすと利得は小さくなり、学習は遅くなり、最適化は不安定になった。研究室はパス間でキー・バリューキャッシュを共有する試験も行い、キャッシュ要件は半分になったが性能は低下するため、公開モデルでは共有しない完全な構成を選んだ。
事後学習では、教師ありファインチューニングと複数段階の強化学習を組み合わせた。Nanbeige は実環境と合成環境からソフトウェアエンジニアリング、ツール使用、オフィスタスクの軌跡を組み立て、それらを実行結果とルーブリックベースの評価でフィルタリングした。強化学習プロセスは幻覚、反復的な出力、指示誤り、推論の長さ、および多段階ツール使用中の失敗をターゲットにした。
モデルカードには、Transformers、vLLM、SGLang を通じて Nanbeige4.2-3B を実行するための指示が記載されている。Nanbeige はまた GGUF と int4 量子化のパス、さらにローカル推論用の llama.cpp と Ollama の修正版ブランチも公開した。そのパッケージ化は、小型モデルを評価する開発者にとって重要である。名目上のパラメータ数だけではモデルのデプロイが容易であるとは限らないからだ。
強力なベンダーベンチマーク、ただし留意点あり
Nanbeige は、モデルが SWE-bench Verified で63.6、SWE-bench Pro で46.9、Terminal-Bench 2.0 で44.1 を記録したと報告している。また GPQA-Diamond で87.4、Claw-Eval で52.2 を報告している。
研究室の比較では、Nanbeige4.2-3B は掲載されている一般エージェントおよびコードエージェントの評価のすべてにおいて、より大きな Qwen3.5-9B および Gemma4-12B のモデルを上回った。比較表では推論に関するテストのうち5つで先行した。Gemma4-12B は BOSS Zhipin の内部 Recruit-Bench を含む2つのアラインメント評価で引き続き優位に立った。
これらの数値は Nanbeige 自身による評価である。いくつかのオフィスおよび共同作業のテストは社内のスキャフォールドを使用しており、Recruit-Bench は雇用主と求職者のタスクを中心に内部で設計されたものだ。Nanbeige は主要なコーディングベンチマークに対しては確立されたエージェントフレームワークを使用したと述べており、SWE-bench Verified には OpenHands、SWE-bench Pro には SWE-agent を用いている。
トレーニング設計はまた、コンパクトモデルがどこで制約を受けるかも明らかにしている。エージェント型強化学習では、Nanbeige は比較的短い軌跡で合格率の高い、比較的容易なタスクを好んだ。これらの例は、困難で長期的なタスクよりも学習を安定させ大きな利得を生んだからである。モデルカードは別途、出力に不正確、偏った、または有害な内容が含まれる可能性があると警告している。
BOSS Zhipin は内部モデルをより広いプラットフォーム賭けへと転換する
BOSS Zhipin は 2024 年に Nanbeige を検索、レコメンデーション、AI 支援コミュニケーション、面接向けに展開し始めた。採用プラットフォームは独自モデルとサードパーティのファウンデーションモデルを組み合わせていると、Kanzhunの2025年年次報告書 は述べている。
このモデルプログラムは、設立以来 BOSS Zhipin の Tao Zhang が監督する技術組織の下にある。Tao Zhang は以降、IBM グループ企業、Renren、Baidu で働いており、研究、開発、IT インフラを担当している。彼は同社の 最高技術責任者 である。
BOSS Zhipin は社内で作業を資金援助するスケールを持っている。Kanzhun は 2026 年第1四半期に平均月間アクティブユーザー数が6,090万人、2026年3月31日に終了した12か月間で有料法人顧客が710万であったと報告した。第1四半期の収益は人民元20.7億元(約2億9,990万ドル)に達し、研究開発費は人民元4.238億元であったと 5月20日の決算結果 は記している。
Kanzhun はまた投資家に対して、Nanbeige には継続的な資本と人員支出が必要であり、これらの費用を直接的な収益で賄えるとは限らないと伝えている。Nanbeige4.2-3B をオープンソース化することは、採用アプリ内で始まったモデルプログラムに対する別の投資回収手段を BOSS Zhipin に与える:外部の採用、フィードバック、および技術的信頼性である。
エージェント開発者にとって実際の試験は、報告された性能が Nanbeige の評価環境外でも維持されるかどうかだ。有能な30億パラメータのモデルは、メモリ要件を削減し、プライベートで低レイテンシなデプロイをより現実的にする可能性がある。たとえそのループ構造がトークンごとに追加の計算を要求したとしても。