Google añade edición de voz a nivel del sistema a la aplicación de Gemini para Mac
El atajo de la tecla Fn puede dictar texto pulido o usar el contexto de la pantalla y de los archivos para reescribir selecciones, resumir documentos e insertar imágenes.
By Ryan Merket · Published
Primary source: Google Gemini on X
Why it matters
Google is using Gemini's reach to claim the Mac cursor as an AI interface, raising the bar from transcription to context-aware editing, file analysis and generation.

Google agregó escritura y edición por voz a la aplicación Gemini para macOS el 29 de julio, dando a los usuarios un atajo con la tecla Fn que puede colocar texto dictado, reescrituras, resúmenes de archivos e imágenes generadas directamente en una ventana activa.
La función, llamada Speak to Window, se está implementando en inglés para todos los usuarios de Gemini en Mac, dijo Google en un hilo de tres publicaciones en X y en sus notas de la versión. La dictación estándar está habilitada de forma predeterminada. Los usuarios mantienen presionada la tecla Fn mientras hablan y luego la sueltan para insertar la salida de Gemini en el cursor. Un doble toque inicia la grabación manos libres para pasajes más largos.
Google dice que el modo de dictado elimina muletillas, sigue correcciones a mitad de frase y formatea el habla en párrafos o viñetas. Eso lleva a Gemini más allá de la transcripción literal: el modelo está editando las palabras del hablante antes de que lleguen al documento.
El modo de razonamiento se adentra en la ventana activa
Una opción de razonamiento separada, que los usuarios deben habilitar en la configuración de Speak to Window de la aplicación, permite que Gemini use el contexto de la pantalla. Un usuario puede resaltar texto en un correo, documento u otra app y pedir verbalmente a Gemini que cambie su tono, lo reescriba o lo reformatee. El mismo flujo de trabajo puede extraer información de documentos seleccionados, PDFs e imágenes, o generar un elemento visual e insertarlo donde el usuario esté trabajando.
Google afirma que Gemini distingue entre la dictación ordinaria y las solicitudes que requieren razonamiento. La compañía también limita el acceso a archivos locales al material que el usuario selecciona o a directorios que el usuario conecta explícitamente. Leer páginas completas del navegador o archivos en una carpeta compartida requiere el permiso de Accesibilidad de macOS.
Esa distinción importa porque Google está poniendo un modelo de propósito general detrás de un atajo normalmente asociado con la dictación básica del sistema operativo. El producto puede transformar el material alrededor del cursor en lugar de obligar al usuario a abrir un chatbot, proporcionar contexto y copiar el resultado de nuevo en otra aplicación.
El despliegue sigue al lanzamiento, el 15 de abril, de la app nativa Gemini para Mac. La aplicación gratuita funciona en máquinas Apple Silicon con macOS Sequoia 15.0 o posterior. Ya ofrecía un mini chat con Option+Space, un chat completo abierto con Option+Shift+Space y compartición de ventana mediante un atajo que usa ambas teclas Command.
El empuje de escritorio está bajo la responsabilidad de Josh Woodward, el vicepresidente de Google que dirige Google Labs, la app Gemini y AI Studio. Woodward anteriormente ayudó a iniciar la iniciativa Next Billion Users de Google y trabajó en Chromebooks. Su ámbito ahora cubre el esfuerzo de Google para convertir a Gemini en una interfaz persistente a través del escritorio en lugar de un destino que los usuarios visitan en una pestaña del navegador.
Los asistentes de IA compiten por el atajo del Mac
Google está entrando en una disputa concurrida por la capa entre el usuario y la aplicación. Quick Entry de Claude Desktop puede abrirse desde cualquier app, capturar capturas de pantalla y aceptar dictado por voz mediante un atajo de Caps Lock. El flujo de trabajo actual de Anthropic transcribe el mensaje para revisión antes de que el usuario lo envíe a Claude.
Work with Apps de ChatGPT puede leer el contexto desde editores compatibles, terminales y herramientas de programación, y puede aplicar ediciones propuestas en entornos de desarrollo integrados. OpenAI también admite voz al trabajar con apps conectadas, aunque su documentación indica que el modo de voz no admite ediciones de código.
La propuesta de Gemini es más amplia en el punto de entrada: habla en un campo de texto activo, selecciona contenido cercano cuando se necesita contexto y recibe el resultado en el cursor. Su capacidad para generar e insertar imágenes desde el mismo atajo de voz le da a Google otra forma de vincular sus modelos multimodales al trabajo ordinario del escritorio.
Google tiene amplia distribución para la función. Sundar Pichai dijo durante la llamada de resultados del 22 de julio de Alphabet que la app Gemini había alcanzado 950 millones de usuarios activos mensuales y que los usuarios activos diarios se habían triplicado respecto al año anterior. Esas son cifras reportadas por la compañía y no desglosan la adopción en macOS.
La actualización para Mac muestra dónde Google está tratando de convertir ese alcance en hábito. La contienda se está moviendo de cuál chatbot produce la mejor respuesta independiente a cuál asistente puede situarse más cerca de los archivos, la pantalla y el cursor del usuario con la menor fricción. Speak to Window le da a Google una ruta directa hacia ese flujo de trabajo en el propio sistema operativo de Apple.