CTGTは、DeepSeekの知識蒸留が検閲の移転を伴うことなく金融スコアを引き上げたと述べた。

CTGTは、教師の政治的拒否なしに財務上の利益を報告しているが、未公開のアダプターが完全な独立再現を妨げている。

By · Published

Primary source: CTGT

Why it matters

CTGT's company-published study suggests U.S. developers could extract specialized capability from Chinese models without inheriting unrelated political censorship. The test covers one finance task, and unreleased adapters limit independent reproduction and broader procurement conclusions.

The ethical implications and technical transfer of political bias during AI model distillation for financial gain. (Layered felt and embroidered textile patch with visible threadwork and slight dimensional puffiness.)

CTGT の共同設立者 Cyril Gorlla と研究者の Johnny Yu および Siddarth Mamidanna は、7月29日に蒸留が教師モデルの政治的行動を伝播するかどうかを検証する実験を発表した。CTGT は、DeepSeek V4 Flash を用いて金融推論向けに訓練された GPT-OSS-120B モデルが、教師モデルの中国に関する拒否応答を再現することなくタスクで改善したと述べている

この結果は、経済的理由で中国発のオープンモデルを利用したいが、その政治的制約は取り込みたくないと考える米国企業にとっての問いに対する具体的なテストを Gorlla に提供する。CTGT は、学生モデルが金融推論で改善し、中国に敏感な内容を含まないデータで訓練した後に同様の検閲を示さなかったと述べている。研究者らは、安全性制御、セキュリティ上の拒否、その他望ましい振る舞いが同じプロセスで維持されるかどうかは検証していない。

Gorlla は、モデルの能力とモデルの行動を区別するという点を中心に CTGT を構築した。彼と共同設立者の Trevor Tuttle は UC San Diego の機械学習研究から出ている。Y Combinator は Gorlla の効率的で解釈可能な AI に関する研究が大学在学中に ICLR で発表され、Endowed Chair's Fellow であったと述べており、Tuttle は大規模機械学習ワークロード向けの分散システムを構築してきたと説明している。YC は Gorlla と Tuttle を CTGT の現役創業者として挙げ、サンフランシスコに拠点を置く10人の組織であると記載している。CTGT は YC の 2024年秋 のバッチに参加した。

この若いラボは最初の2年間で、企業が有能なモデルを利用するにはその行動を検査・制約できることが必要だと主張してきた。商業的な訴求点は規制対象組織向けのポリシー施行にある。今週の研究はその前提を上流に持ち上げ、ポリシーエンジンが適用される前にどのような行動がモデルに入り込むかを問うものである。

A censored teacher, an uncensored student

the research post で、Yu、Mamidanna、Gorlla は DeepSeek V4 Flash が作成した修正を用いて GPT-OSS-120B を定量的金融向けに訓練したことを記述している。CTGT は訓練データに中国に敏感な政治的内容は含まれていないと述べている。

CTGT は次に、教師モデル、訓練を受けた学生モデル、およびいくつかの対照モデルを 152 の対応するプロンプト対でテストした。各中国に敏感な質問には、別の国や政治体制に関する構造的に類似した対照が用意された。例えば新疆の労働移転プログラムに関するプロンプトは、ウズベキスタンの綿花産業における強制労働に関するものと組になっている。

DeepSeek V4 Flash は新疆の質問を拒否した一方で、ウズベキスタンの対照には回答した。Flash で教えられた GPT-OSS モデルは両方に回答した。76の主要な政治的対にわたり、CTGT は 中国に敏感なプロンプトと対応する対照における教師の検閲スコアの間で 45.45 ポイントの差を測定した。CTGT は Flash で教えられた GPT-OSS モデルが同様の中国に敏感な拒否パターンを示さなかったと述べている。

CTGT は審査役として xAI の Grok 4.20、Google の Gemini 3.5 Flash、OpenAI の GPT-5 Mini、および Anthropic's Claude Sonnet 4.6 の四つのモデルを使用した。審査役は各応答に対して 0 から 100 の検閲スコアを割り当てた。

CTGT は本実験を、訓練データから中国に敏感な政治的資料を除外することで潜在的な転移を隔離するように設計したと述べている。DeepSeek の教師は学生が誤ったときにターゲットを絞ったヒントを与え、学生が模倣する政治的回答を提供したわけではない。

研究者らは、この結果が安全性訓練、セキュリティ行動、または一般的な拒否ポリシーに当てはまると主張してはいない。

The teacher was optional

CTGT は自己蒸留実行が金融タスクで DeepSeek に教えられたバージョンと実質的に匹敵したと述べ、この実験においてより大きな教師が必須ではなかったという狭い主張を支持している。

この金融タスクでは、モデルは自己学習に十分に有用なヒントを生成できた。

8,000 トークンの予算では、CTGT は自己蒸留した 120B モデルが FinanceReasoning で 83.61% を記録し、Kimi K3 が 81.93%、Inkling が 65.13% だったと述べている。CTGT は自己蒸留した 120B 実行が同じ 8,000 トークン予算で Inkling よりクエリあたり 62 倍安く、Kimi K3 より 160 倍安かったと述べている。

運用者にとって、この実験は狭い主張を支持する。生産環境のトークン予算内で確実に完了する専門化されたモデルは、予算内でタスクを完了する前に消費してしまうより大きなモデルよりも優れる場合がある。

The release stops short of full reproduction

CTGT は LineageEval benchmark and evaluation harness を公開し、304 のプロンプト、6 つのモデルアーム、1,824 の応答、および 7,296 の分類を含めた。さらに、基盤となる evaluation data を公開し、教師と学生の応答を比較するための playground を開き、Hugging Face 上の gpt-oss-20b-finance ウェイトへのリンクも掲載した。

公開リポジトリには、研究で使用された 3 つの訓練済みアダプタは含まれていない。完成した出力は検査可能だが、外部の研究者はリポジトリだけではアダプタ応答や主要な比較を再現することはできない。

Gorlla のより大きな賭けは、企業がモデルの行動をベースモデルを訓練した者の不可分な特性ではなく、計測可能で編集可能なものとして扱えるということだ。この実験は意図的に狭い設定でその主張を前進させるものである。同時に、共有モデル系統、安全性制御、研究対象となる行動を直接含む訓練データといった、より困難な継承のテストは未解決のままである。

Reader comments

Conversation for this story loads after sign-in.