Superwhisper agrega Cohere Transcribe para dictado privado en el dispositivo
El modelo de 2B parámetros, con licencia Apache 2.0, se descarga dentro de Superwhisper y mantiene el audio en el dispositivo en 14 idiomas compatibles.
By Ryan Merket · Published
Primary source: X
Why it matters
The integration gives Cohere an end-user channel for its open speech model and lets Superwhisper improve private voice input without training its own frontier ASR system.

Neil Chudleigh (@neilsuperduper), el fundador de Superwhisper, ha añadido el modelo de reconocimiento de voz Transcribe de Cohere, con pesos abiertos, a la aplicación para dictado local sin conexión. Superwhisper anunció la integración el 28 de julio y promovió la asociación en una publicación en X el 29 de julio. (superwhisper.com)
La incorporación avanza la tesis de producto que Chudleigh ha perseguido desde que construyó Superwhisper para uso personal: la entrada por voz debería funcionar a través de aplicaciones sin enviar cada grabación a un servidor remoto. Chudleigh cofundó anteriormente PartnerStack, la plataforma de gestión de socios B2B que pasó por Y Combinator en 2015 y fue adquirida por AppDirect el 14 de abril de 2026. (appdirect.com)
Chudleigh ha dicho que empezó Superwhisper después de encontrar que la función de dictado de Apple era inexacta e inconsistente entre aplicaciones. Inicialmente construyó el producto alrededor de modelos offline, aceptando el trabajo de ingeniería adicional requerido para gestionar modelos grandes y el procesamiento de audio en hardware de consumo. Esa arquitectura también le dio a Chudleigh una posición clara para flujos de trabajo sensibles en ámbitos legales, médicos, gubernamentales y de desarrollo de software donde los usuarios pueden no querer o no poder subir el audio. (deepgram.com)
Un modelo de 1.3GB dentro de la aplicación
Los usuarios pueden instalar Cohere Transcribe desde la biblioteca de modelos de Superwhisper como una descarga de 1.3GB, seleccionarlo como su modelo de voz y dictar sin conexión a internet. Superwhisper afirma que el audio permanece en la máquina del usuario. La integración también aplica la capa de vocabulario de Superwhisper, diseñada para reconocer nombres definidos por el usuario, términos de producto, fragmentos y jerga técnica. (superwhisper.com)
Cohere lanzó Transcribe el 26 de marzo como un modelo Conformer de 2 mil millones de parámetros entrenado para 14 idiomas, incluidos English, French, German, Spanish, Mandarin, Japanese, Korean y Arabic. Los pesos del modelo están disponibles bajo la licencia Apache 2.0, lo que permite a los desarrolladores usar y modificar el modelo según los términos de la licencia. (cohere.com)
La tabla de referencia de Cohere situó a Transcribe en primer lugar en el Hugging Face Open ASR Leaderboard en su lanzamiento de marzo, con una tasa de error de palabra promedio en inglés de 5.42%. La tabla mostró Whisper Large v3 de OpenAI en 7.44% y Scribe v2 de ElevenLabs en 5.83%. Esas cifras describen una colección estandarizada de conjuntos de datos en inglés más que todos los entornos de dictado, acentos o configuraciones de micrófono. (cohere.com)
El modelo también conlleva restricciones prácticas. La ficha del modelo de Cohere indica que Transcribe funciona mejor cuando los usuarios seleccionan de antemano un idioma soportado. Carece de detección automática de idioma, marcas de tiempo y diarización de hablantes, y Cohere advierte sobre resultados inconsistentes en audio con cambio de código. El modelo también puede intentar transcribir el ruido de fondo a menos que una aplicación coloque detección de actividad de voz o una compuerta de ruido antes de él. La capa de vocabulario de Superwhisper aborda palabras especializadas, aunque no elimina esas limitaciones subyacentes del modelo. (huggingface.co)
Cohere obtiene un canal de distribución para usuarios finales
Para Superwhisper, la asociación añade un modelo abierto competitivo sin requerir que Chudleigh entrene desde cero un sistema de voz de vanguardia. Superwhisper puede, en cambio, competir mediante la selección de modelos, la inferencia local, los controles de vocabulario y el flujo de trabajo que inserta el texto finalizado en correo electrónico, entornos de codificación y aplicaciones de productividad.
Para Cohere, Superwhisper pone Transcribe directamente frente a personas que usan la voz como entrada diaria en la computadora, cuatro meses después del lanzamiento del modelo. Cohere presentó Transcribe como el primer paso hacia la inteligencia de voz dentro de North, su plataforma de agentes empresariales. La distribución a través de una aplicación de dictado orientada al consumidor da al modelo una vía separada hacia flujos de trabajo reales al tiempo que preserva el énfasis de Cohere en el despliegue privado y el control de la infraestructura. (cohere.com)
La conexión con Toronto también brinda a ambas empresas un argumento de soberanía. Superwhisper describe la integración como un modelo canadiense que se ejecuta dentro de una aplicación construida en Canadá, con el procesamiento mantenido en el hardware del usuario. Esa presentación es útil para organizaciones preocupadas por dónde se procesa el audio, aunque el beneficio inmediato del producto es más sencillo: los usuarios pueden instalar un modelo de voz comparativamente preciso sin configurar Python, descargar pesos manualmente u operar infraestructura de inferencia.
La apuesta de Chudleigh es que la voz se convierta en una capa de entrada general para el software, en lugar de un destino de transcripción separado. Añadir Cohere Transcribe fortalece la parte de ese argumento que los usuarios encuentran primero. El dictado solo ahorra tiempo cuando la transcripción requiere menos correcciones de las que habría tomado escribir la frase.