CTGT 表示 DeepSeek 的蒸馏提升了金融评分,而没有发生审查迁移
CTGT 报告了财务收益,并且没有遭到该教师的政治性拒绝,尽管未发布的适配器阻碍了完全独立的复现。
By Ryan Merket · Published
Primary source: CTGT
Why it matters
CTGT's company-published study suggests U.S. developers could extract specialized capability from Chinese models without inheriting unrelated political censorship. The test covers one finance task, and unreleased adapters limit independent reproduction and broader procurement conclusions.

CTGT 联合创始人 Cyril Gorlla 以及研究人员 Johnny Yu 和 Siddarth Mamidanna 在 7 月 29 日发布了一项实验,考察蒸馏是否会传递教师模型的政治行为。CTGT 表示,使用 DeepSeek V4 Flash 为金融推理训练的 GPT-OSS-120B 模型在该任务上有所提升,且未再现教师模型对中国相关话题的拒绝。
该结果为 Gorlla 提供了一个具体检验:针对那些希望在不引入政治约束的情况下,获得中国开源模型经济性优势的美国公司,这个问题至关重要。CTGT 表示,学生模型在财务推理上有所改进,并在训练数据中不包含涉华敏感内容后未显示出类似的审查行为。研究人员并未测试安全控制、安全拒绝或其他期望行为是否也会在同一过程中得以保留。
Gorlla 围绕模型能力与模型行为之间的这种区别建立了 CTGT。他与联合创始人 Trevor Tuttle 来自 UC San Diego 的机器学习研究。Y Combinator 表示 Gorlla 在高效且可解释 AI 方面的工作在他担任该校的 Endowed Chair's Fellow 时曾发表于 ICLR,而 Tuttle 则为大规模机器学习工作负载构建分布式系统。YC 将 Gorlla 与 Tuttle 列为 CTGT 的在职创始人,并将其描述为一个 10 人的旧金山团队。CTGT 加入了 YC 的 2024 年秋季班。
这家年轻的实验室在其前两年一直主张,企业只有在能够检查并约束模型行为时,才能使用有能力的模型。其商业主张侧重于为受监管的组织提供策略执行。 本周的研究将这一前提上游化,探究在应用策略引擎之前,哪些行为已经进入模型。
被审查的教师,未被审查的学生
在研究文章中,Yu、Mamidanna 和 Gorlla 描述了使用 DeepSeek V4 Flash 编写的更正对 GPT-OSS-120B 进行定量金融训练的过程。CTGT 表示训练数据不包含涉华敏感的政治内容。
CTGT 随后用 152 对匹配提示对教师模型、训练后的学生模型及若干对照模型进行了测试。每个涉华敏感问题都有一个在结构上相似的对照,涉及另一个国家或政治体系。例如,一个关于新疆劳动力转移项目的提示被配对为关于乌兹别克斯坦棉花行业强迫劳动的提示。
DeepSeek V4 Flash 对新疆的问题予以拒答,但对乌兹别克斯坦的对照回答了该问题。由 Flash 教导的 GPT-OSS 模型对两者均予以回答。在 76 对核心政治提示中,CTGT 测得 教师在涉华敏感提示与匹配对照上的审查得分存在 45.45 分的差距。CTGT 表示,由 Flash 教导的 GPT-OSS 模型未表现出相同的涉华敏感拒答模式。
CTGT 使用了另外四个模型作为评判:xAI 的 Grok 4.20、Google 的 Gemini 3.5 Flash、OpenAI 的 GPT-5 Mini 以及 Anthropic's Claude Sonnet 4.6。评判模型为每个回复分配 0 到 100 的审查得分。
CTGT 表示,该实验在设计上通过将涉华敏感政治材料排除在训练数据之外,以试图隔离隐性转移。DeepSeek 作为教师在学生出错后提供有针对性的提示;它并未提供供学生模仿的政治答案。
研究人员并未声称该结果适用于安全训练、安全行为或一般拒绝策略。
教师是可选的
CTGT 表示,其自蒸馏运行在金融任务上有效地匹配了由 DeepSeek 教导的版本,从而支持了一个更狭义的主张:在此实验中,并不需要一个更大的教师模型。
对于该金融任务,模型能够产生足够有用的提示以自我教学。
在 8,000 token 的预算下,CTGT 表示其自蒸馏的 120B 模型在 FinanceReasoning 上得分为 83.61%,而 Kimi K3 为 81.93%,Inkling 为 65.13%。CTGT 表示,在相同的 8,000 token 预算下,自蒸馏的 120B 运行每次查询的成本比 Inkling 低 62 倍,比 Kimi K3 低 160 倍。
对于运营方而言,该实验支持一个狭义结论:在生产 token 预算内可靠完成任务的专用模型,可能优于在耗尽预算之前无法完成任务的更大模型。
该发布未能完全再现
CTGT 发布了 LineageEval 基准和评估工具,包括 304 条提示、六个模型分支、1,824 条回复和 7,296 次分类。它还发布了底层的评估数据、开放了用于比较教师与学生回复的在线演示,并链接了在 Hugging Face 上的 gpt-oss-20b-finance 权重(https://huggingface.co/ctgt-inc/gpt-oss-20b-finance?ref=runtimewire)。
公开仓库不包括研究中使用的三个已训练适配器。已完成的输出可供检查,但外部研究者无法仅通过该仓库重新生成适配器的回复或头条比较结果。
Gorlla 更大的赌注是,企业可以将模型行为视为可测量且可编辑的东西,而不是基模型训练者不可分割的属性。该实验在一个刻意狭窄的环境中推进了这一论点。它也将更困难的继承性测试留了下来:共享的模型谱系、安全控制以及直接包含所研究行为的训练数据。