Ingeniería inversa de Claude Code alega conmutadores ocultos del modelo Fable 5
Lon dice que una ruta de Claude Code puede enrutar solicitudes a Opus 4.8 sin el aviso y la opción de exclusión que promete la propia página de ayuda de Anthropic.
By Ryan Merket · Published
Primary source: X
Why it matters
AI coding tools increasingly act on entire repositories for hours at a time. An undisclosed model switch can change capability, behavior and audit trails in the middle of production work.

Lon (@Lon) publicó un hilo de 27 publicaciones el 30 de julio alegando que el cliente Claude Code de Anthropic puede mover silenciosamente solicitudes de Claude Fable 5 a Claude Opus 4.8, eludiendo tanto la advertencia en la interfaz de usuario como una configuración diseñada para desactivar el cambio automático de modelo.
La acusación afecta la promesa de producto hecha por Anthropic, el laboratorio de IA fundado por los hermanos Dario Amodei y Daniela Amodei con el objetivo de construir sistemas confiables y dirigibles. Anthropic enruta abiertamente algunas solicitudes de Fable 5 a Opus 4.8 como medida de seguridad. La disputa es si Claude Code contiene una ruta de respaldo adicional que los usuarios no pueden ver ni controlar.
Lon dijo que el hallazgo provino de la ingeniería inversa del código cliente minimizado dentro del binario compilado de Claude Code y de la comparación de versiones distribuidas a través de npm. Una captura de pantalla adjunta al hilo describe tres posibles mecanismos: un fallback visible que muestra un diálogo y respeta la preferencia del usuario para cambiar, un reintento silencioso del lado del cliente y un cambio de modelo dirigido por el servidor.

Según el análisis de Lon, la ruta visible verifica la configuración switchModelsOnFlag de Claude Code. La supuesta ruta silenciosa no lo hace. Lon también identificó un evento de telemetría etiquetado tengu_convolute_arcades_retry, que el hilo presenta como evidencia de que el cliente puede reintentar una solicitud mediante un mecanismo de fallback sin mostrar una notificación.
Lon rastreó el código de fallback silencioso hasta Claude Code versión 2.1.157 y dijo que se añadió una capacidad refusal_fallback al registro de modelos de Fable 5 en la versión 2.1.216, lanzada el 20 de julio. Esos hallazgos a nivel de versión siguen siendo una alegación basada en el código cliente incluido. Las capturas de pantalla establecen, como máximo, que Claude Code contiene rutas capaces de procesar eventos de fallback. No establecen con qué frecuencia los servidores de Anthropic invocan esas rutas ni cuántos usuarios han recibido una sustitución no revelada.
Anthropic promete un cambio visible
La documentación de Anthropic describe un comportamiento distinto. En un artículo del centro de ayuda del 1 de julio, Anthropic dice que un fallback automático debería mostrar un aviso que explique el cambio y etiquetar la respuesta con el modelo que respondió. El selector de modelo debería entonces permanecer en Opus 4.8 hasta que el usuario cambie de nuevo.
El mismo artículo dice que los usuarios pueden desactivar el cambio automático a través de la configuración Switch models when a message is flagged. Con esa opción desactivada, Anthropic dice que una solicitud bloqueada para Fable 5 debería pausar la conversación en lugar de ejecutarse de nuevo en Opus. La afirmación central de Lon es que una ruta del lado del cliente ignora ese control.
Anthropic nunca ha presentado todo el enrutamiento de Fable a Opus como un bug. Cuando la compañía de Dario y Daniela Amodei lanzó Fable 5 el 9 de junio, dijo que los clasificadores redirigirían solicitudes relacionadas con ciberseguridad, biología y química, destilación de modelos y algo de trabajo de desarrollo de modelos de frontera. Anthropic dijo que los clasificadores eran deliberadamente conservadores y podrían detectar solicitudes inofensivas.
La compañía también prometió que los usuarios serían informados siempre que una solicitud hiciera fallback a Opus 4.8. Esa promesa hace que el tema de la visibilidad sea importante incluso si el enrutamiento subyacente es parte del diseño de seguridad previsto de Fable 5.
Otros usuarios han reportado problemas de fallback
Reportes en el repositorio público de Claude Code de Anthropic corroboran el problema más amplio de cambios inesperados o disruptivos, aunque no verifican de forma independiente la supuesta ruta oculta de Lon. En un issue abierto el 10 de junio, un usuario dijo que trabajo ordinario de programación en Rust activó un clasificador de Fable 5 y movió la sesión a Opus 4.8. El reporte incluyó un banner de cambio visible, a diferencia del comportamiento que describió Lon, y dijo que el fallback se volvió persistente durante el resto de la sesión.
Otro reporte del 9 de junio describió a Fable 5 cambiando a Opus mientras un desarrollador revisaba código de arranque en busca de vulnerabilidades. Esas quejas encajan con la advertencia de Anthropic de que el trabajo defensivo de seguridad puede generar falsos positivos. También muestran por qué la identidad del modelo importa dentro de sesiones de codificación de larga duración: un cambio altera el sistema que maneja el repositorio, su comportamiento de razonamiento y potencialmente la continuidad de una tarea en progreso.
Los modelos también ocupan diferentes niveles de producto. Anthropic llama a Fable 5 su modelo más capaz publicado ampliamente y lo tarifa en $10 por millón de tokens de entrada y $50 por millón de tokens de salida. Opus 4.8 cuesta $5 y $25, respectivamente. Anthropic dice que las solicitudes bloqueadas por entrada se facturan completamente a las tarifas de Opus, mientras que los cambios a mitad de flujo pueden producir un cargo dividido entre los dos modelos.
Para los desarrolladores que seleccionan Fable por su capacidad más que por su precio, una sustitución oculta socavaría la reproducibilidad y la auditabilidad incluso cuando la facturación se ajuste correctamente. La pregunta factual inmediata es más estrecha que la acusación inicial de Lon: si los servidores de producción de Anthropic usan las rutas silenciosas del cliente que la ingeniería inversa identificó. El código cliente por sí solo no puede responder eso. Sí expone una brecha entre el comportamiento que Claude Code parece ser capaz de soportar y el fallback visible y controlado por el usuario que documenta Anthropic.