CTGT afirma que la destilación de DeepSeek mejoró las puntuaciones financieras sin transferencia de censura

CTGT reporta ganancias financieras sin los rechazos políticos del docente, aunque los adaptadores no publicados impiden la reproducción independiente completa.

By · Published

Primary source: CTGT

Why it matters

CTGT's company-published study suggests U.S. developers could extract specialized capability from Chinese models without inheriting unrelated political censorship. The test covers one finance task, and unreleased adapters limit independent reproduction and broader procurement conclusions.

The ethical implications and technical transfer of political bias during AI model distillation for financial gain. (Layered felt and embroidered textile patch with visible threadwork and slight dimensional puffiness.)

CTGT cofundador Cyril Gorlla y los investigadores Johnny Yu y Siddarth Mamidanna publicaron un experimento el 29 de julio que examina si la destilación transfiere el comportamiento político de un modelo maestro. CTGT dice que un modelo GPT-OSS-120B entrenado para razonamiento financiero con DeepSeek V4 Flash mejoró en la tarea sin reproducir los rechazos del modelo maestro sobre temas relacionados con China.

El resultado le da a Gorlla una prueba concreta para una pregunta que pesa sobre las empresas estadounidenses que quieren la economía de los modelos abiertos chinos sin importar sus restricciones políticas. CTGT dice que el modelo alumno mejoró en razonamiento financiero y no mostró censura similar después de entrenar con datos sin contenido sensible sobre China. Los investigadores no probaron si los controles de seguridad, los rechazos por seguridad u otro comportamiento deseable sobrevivirían el mismo proceso.

Gorlla construyó CTGT alrededor de esa distinción entre capacidad del modelo y comportamiento del modelo. Él y el cofundador Trevor Tuttle provienen de investigación en machine learning en UC San Diego. Y Combinator dice que el trabajo de Gorlla sobre IA eficiente e interpretable fue presentado en ICLR mientras era Endowed Chair's Fellow en la universidad, mientras que Tuttle construyó sistemas distribuidos para cargas de trabajo grandes de machine learning. YC lista a Gorlla y Tuttle como los fundadores activos de CTGT y describe una operación de 10 personas en San Francisco. CTGT se unió al grupo de Fall 2024 de YC.

El joven laboratorio ha pasado sus primeros dos años sosteniendo que las empresas solo pueden usar modelos capaces cuando pueden inspeccionar y restringir su comportamiento. Su propuesta comercial se centra en la aplicación de políticas para organizaciones reguladas. La investigación de esta semana lleva esa premisa corriente arriba, preguntando qué comportamiento entra a un modelo antes de que se aplique un motor de políticas.

Un maestro censurado, un alumno sin censura

En la publicación de investigación, Yu, Mamidanna y Gorlla describen el entrenamiento de GPT-OSS-120B para finanzas cuantitativas usando correcciones redactadas por DeepSeek V4 Flash. CTGT dice que los datos de entrenamiento no contenían material político sensible sobre China.

CTGT luego probó al maestro, al modelo alumno entrenado y a varios modelos de control con 152 pares de prompts emparejados. Cada pregunta sensible sobre China tenía un control estructuralmente similar que involucraba otro país o sistema político. Un prompt sobre programas de transferencia laboral en Xinjiang, por ejemplo, se emparejó con uno sobre trabajo forzado en la industria algodonera de Uzbekistán.

DeepSeek V4 Flash se negó a la pregunta sobre Xinjiang mientras respondía el control de Uzbekistán. El modelo GPT-OSS enseñado por Flash respondió a ambos. En los 76 pares políticos centrales, CTGT midió una brecha de 45.45 puntos entre las puntuaciones de censura del maestro en prompts sensibles sobre China y los controles emparejados. CTGT dice que el modelo GPT-OSS enseñado por Flash no mostró el mismo patrón de rechazo sensible sobre China.

CTGT usó cuatro otros modelos como jueces: Grok 4.20 de xAI, Gemini 3.5 Flash de Google, GPT-5 Mini de OpenAI y Claude Sonnet de Anthropic 4.6. Los jueces asignaron a cada respuesta una puntuación de censura de cero a 100.

CTGT dice que el experimento fue diseñado para aislar la transferencia subliminal al excluir material político sensible sobre China de los datos de entrenamiento. El maestro DeepSeek suministró pistas dirigidas después de que el alumno cometiera errores; no proporcionó respuestas políticas para que el alumno las imitara.

Los investigadores no afirman que el resultado se aplique al entrenamiento de seguridad, al comportamiento de seguridad o a políticas generales de rechazo.

El maestro era opcional

CTGT dice que su ejecución autodestilada igualó efectivamente a la versión enseñada por DeepSeek en la tarea financiera, apoyando la afirmación más limitada de que un maestro más grande no era necesario para este experimento.

Para esta tarea financiera, el modelo pudo generar pistas lo suficientemente útiles como para enseñarse a sí mismo.

Con un presupuesto de 8,000 tokens, CTGT dice que su modelo 120B autodestilado obtuvo 83.61% en FinanceReasoning, en comparación con 81.93% para Kimi K3 y 65.13% para Inkling. CTGT dice que la ejecución 120B autodestilada fue 62 veces más barata por consulta que Inkling y 160 veces más barata que Kimi K3 con el mismo presupuesto de 8,000 tokens.

Para los operadores, el experimento respalda una afirmación limitada. Un modelo especializado que termina de manera confiable dentro de un presupuesto de tokens de producción puede superar a un modelo mucho más grande que consume su presupuesto antes de completar la tarea.

El lanzamiento no llega a la reproducción completa

CTGT publicó el benchmark LineageEval y el arnés de evaluación, incluyendo 304 prompts, seis ramas de modelos, 1,824 respuestas y 7,296 clasificaciones. También lanzó los datos subyacentes de evaluación, abrió un playground para comparar respuestas del maestro y del alumno, y vinculó los pesos gpt-oss-20b-finance en Hugging Face.

El repositorio público no incluye los tres adaptadores entrenados usados en el estudio. Los resultados completos están disponibles para inspección, pero los investigadores externos no pueden regenerar las respuestas de los adaptadores ni la comparación principal solo con el repositorio.

La apuesta más grande de Gorlla es que las empresas pueden tratar el comportamiento del modelo como algo medible y editable, en lugar de una propiedad indivisible de quien haya entrenado el modelo base. Este experimento avanza ese caso en un entorno deliberadamente estrecho. También deja abiertas las pruebas de herencia más difíciles: linajes de modelos compartidos, controles de seguridad y datos de entrenamiento que contienen directamente el comportamiento que se estudia.

Reader comments

Conversation for this story loads after sign-in.