Fermisenseは、$500のQwenファインチューニングがカタログレビューで最先端モデルを上回ったと述べている
The 9B specialistはFermisenseのシミュレーションで87.3%を記録したが、このテストは200の検証エピソードを使用しており、独立した再現が行われていない。
By Ryan Merket · Published
Primary source: Fermisense
Why it matters
Fermisense's test shows how workflow data and a scored simulator can turn a small open model into cheaper, task-specific infrastructure, reducing dependence on frontier APIs at high volume.

Justinas Zaliaduonis (@JZaliaduonis) and four collaborators at Fermisense trained a 9BパラメータのQwenモデルを約500ドルでトレーニングし、模擬的なeコマースのカタログレビューのワークフローにおいて5つのフロンティアモデル構成を上回ったと報告した。
Fermisenseはその結果を、Zaliaduonis、Joris Zilinskis、Fabian Hildesheim、Joel Hainzl、およびGediminas Pazeraによる7月27日の技術レポートで報告した。ZaliaduonisはStanfordで機械学習の研究を行っており、Hildesheimは最近StanfordのInstitute for Human-Centered Artificial Intelligenceで研究を終えたとされる。Fermisenseのウェブサイトによれば、同社のスタッフはMIT、Lyft、Skyscanner、University of Waterlooでも働いたり学んだりした経験があるという。
この結果は、通常のベンチマーク競争よりも狭く商業的に重要な主張を支持するものだ:企業自身のルールに対してトレーニングされた小規模モデルは、反復的で計測可能なワークフローにおいてより大きな汎用モデルを上回り得る、という主張である。比較はFermisenseが設計した実験であり、Fermisenseのデータ構築、採点システム、コスト想定に基づいて行われたもので、独立した再現はなされていない。
非対称ペナルティのある模擬カタログ
Fermisenseは実際の製品画像とリスティング情報を含むAmazon Berkeley Objects datasetを使ってマーケットプレイスのデジタルツインを構築した。Fermisenseはその素材を177,767件のレビューエピソードに変換し、制御されたポリシーケース、画像の不一致、ブランドの主張の矛盾、および誤検出をテストするための正当な主張を追加した。
各リスティングについて、モデルは約13,000の製品カテゴリのタクソノミーを検索し、主張されたブランドを確認し、必要な属性を取得して構造化された判断を下さなければならなかった。Fermisenseのスコアラーは、見逃しの違反に対して誤検知の7倍の重みでペナルティを課し、禁止された出品を野放しにするコストが、有効な出品をレビューに回すコストよりも大きいという経済的仮定を符号化している。
Fermisenseはモデルを200件の層化検証エピソードで評価した。レポートによれば、フロンティア群はGPT-5.5、GPT-5.6-sol、Gemini 3.1 Pro、Claude Opus 4.8、およびClaude Fable 5で構成されている。各モデルは同じ画像、ツール、スコアラー、ターン予算を与えられた。Fermisenseはプレーンなプロンプトと、手順や例を含む約2,800文字の最適化された指示の両方をテストした。
最も強力なフロンティア構成は、Fermisenseのルーブリック下で到達可能な最大スコアの76.9%に達した。トレーニング済みの9Bモデルは87.3%に達し、未トレーニングのベースは64.2%だった。この割合は従来の正確度率ではなくFermisenseのスコア上限に対する正規化された比率であり、ベンチマークの規模からマーケットプレイス上のより広い分布での性能は未解決の問題である。
パブリックなmerged modelはリリースをBF16形式の9BパラメータQwen3.5モデルとして識別している。Fermisenseはtraining adapterも公開した。両方のHugging Faceページはモデルカードのフィールドが空であり、データセット構築、評価、トレーニングに関する主要な説明はFermisenseの記事が担っている。
GPU2台と3日半
FermisenseはNvidia RTX PRO 6000 GPUを2台レンタルし、1台を強化学習のロールアウト生成に、もう1台をモデル更新に使ったと述べた。トレーニングはPrime Intellectのオープンソースのprime-rl frameworkを通じて約3日半にわたり1,000ステップのオプティマイザーステップで実行された。
Fermisenseによれば、モデルは約250ステップ、つまり概ね1日でフロンティアシステムが達成した範囲を越えた。フルランのGPU時間コストは約500ドルだった。Fermisenseはgroup relative policy optimization(GRPO)を用い、正しいカテゴリ、属性、およびポリシー判断を生成した行動に報酬を与え、誤りや不要なツール呼び出しにはペナルティを与えた。
この手法は模擬マーケットプレイスのタクソノミーと判断ルールに関する知識をモデルの重みへ移し替えた。フロンティアモデルは各エピソードでプロンプトからそれらのルールを再構築しなければならなかった。Fermisenseは、長い指示によりフロンティアモデルの入力コストがモデルによって28%から55%増加したと述べた。
その違いがコスト比較を駆動した。Fermisenseの推定では、専用モデルは1,000件の出品を約0.50ドルでレビューできるのに対し、最も安いフロンティア構成では19ドル、最も高いものでは172ドルに上るとされた。Fermisenseの想定下で、最もスコアの高いフロンティア構成は1,000件あたり約34ドルで、トレーニング済みモデルとの間に主張される68倍の差を生んだ。
これらの数値は実稼働するFermisense顧客の請求額ではなく、モデル化された推論コストである。Fermisenseは1日あたり4,000万件の意思決定というシナリオで比較を年率化し、専用モデルで約700万ドル、より強力なフロンティア構成で約5億ドルと推定した。このボリュームはFermisense自身のトラフィックではなく、ファインチューニングされたカタログモデルを大規模に運用しているというShopifyの公表情報に基づいて導出された。
ベンチマークは同時にFermisenseの製品論点でもある
Fermisenseはオンプレミスのインフラを販売しており、企業のメール、文書、スプレッドシートその他の内部資料をインデックス化してAIシステムが組織知を検索できるようにする。Fermisenseは顧客が自分のデータの管理権を保持し、ローカルモデルまたはフロンティアAPIのいずれかをインデックスに接続できると述べている。
このカタログ実験は、検索からモデル所有へとその売り文句を拡張するものだ。Fermisenseは企業がまずフロンティアAPIでベースラインを確立し、トレース、修正、スコア付き結果を収集すべきだと主張する。ワークフローが十分なボリュームに達したら、それらの記録で小さな専用モデルを訓練し、反復可能な部分を専用モデルが処理する一方で、より広範な能力を要するタスクにはフロンティアモデルを利用可能にしておく、という流れである。
このアプローチは、意思決定量が多く、ツールが安定しており、結果が自動的に検査可能なワークフローに適合する。各決定をタクソノミー、属性スキーマ、ポリシールーブリックに照らしてスコア化できるため、カタログ分類はこれらの条件を満たす。合意された答えのないオープンエンドな研究、戦略立案、その他の業務は、はるかに弱い学習信号しか提供しない。
Fermisenseの結果は、9Bモデルがテストされたフロンティアシステムより一般に有能であることを示すものではない。狭いタスクにシミュレータ、独自ルール、そしてオペレーターのコストを反映する報酬関数があれば、モデルのスケールは重要性を失うことがあり得ることを示している。その設定で価値ある資産は完全なトレーニングループである:ワークフローデータ、ツール、評価用ハーネス、そしてオペレーターがフロンティアプロバイダに毎回支払うことなく運用できる重みである。