Webml-community ejecuta tres modelos Qwen3.5 localmente en navegadores con WebGPU
La demostración de Webml-community ejecuta los modelos multimodales de Alibaba de 0.8B, 2B y 4B localmente mediante Transformers.js y WebGPU, sin necesidad de una API en la nube.
By RuntimeWire Staff · Published
Primary source: Qwen / Alibaba
Why it matters
The webml-community demo turns downloadable Qwen weights into a local browser application, showing how runtimes and deployment tooling influence which open models developers can test and use without a cloud API.

Qwen3.5 Small se lanzó el 2 de marzo de 2026, según el anuncio de lanzamiento de Qwen3.5 de Qwen. Una demostración WebGPU ahora muestra cómo sus modelos de 0.8B, 2B y 4B pueden ejecutarse localmente en un navegador. La demostración es mantenida por webml-community y fue destacada por Joshua Lochner (@xenovacom), el ingeniero de Hugging Face asociado con Transformers.js. La demostración en el navegador es un proyecto de despliegue separado del anuncio de lanzamiento de Qwen3.5 de Alibaba.
Demostración en navegador de Qwen3.5 de Joshua Lochner en X
La demostración WebGPU de Qwen3.5 ofrece a la familia de modelos pequeños de Alibaba, con cinco meses y medio desde su lanzamiento, una ruta de despliegue sencilla: abrir una página web, elegir un modelo, adjuntar una imagen si es necesario y comenzar una conversación. Según la demostración, la inferencia se ejecuta dentro del navegador sin una API en la nube, y los chats permanecen en el dispositivo del usuario.
La demostración convierte los pesos descargables de Qwen3.5 Small en una prueba basada en navegador. Transformers.js proporciona la capa de tiempo de ejecución en JavaScript, mientras que WebGPU coloca los modelos compatibles en el propio hardware gráfico del usuario. Eso reduce la barrera entre encontrar un modelo y probarlo sin configurar un servidor o pagar por la inferencia.
El informe de RuntimeWire del 17 de agosto sobre Qwen3.8 cubrió pesos de modelo y términos de licencia recién publicados. Esta demostración concierne una ruta de despliegue separada para una familia de modelos más antigua: webml-community empaqueta tres modelos Qwen3.5 Small para inferencia local en el navegador a través de Transformers.js y WebGPU.
El navegador es el objetivo de despliegue
La demostración ofrece modelos Qwen3.5 en 0.8B, 2B y 4B parámetros. Los usuarios pueden enviar texto o imágenes, y los modelos soportan tareas orientadas al razonamiento.
Esos detalles hacen que la demostración sea más relevante que una interfaz de chatbot alojada. La inferencia local puede mantener entradas privadas fuera de una API externa, eliminar cargos por solicitud y continuar sin una conexión permanente después de descargar los archivos necesarios. También traslada el costo de cómputo del proveedor del modelo al hardware del usuario, lo que puede atraer a desarrolladores de aplicaciones que atienden tareas frecuentes y de ámbito reducido.
La demostración en el navegador tiene un límite claro. Alibaba lanzó cuatro modelos Qwen3.5 Small el 2 de marzo de 2026: 0.8B, 2B, 4B y 9B. La interfaz de webml-community se detiene en 4B. No indica una configuración mínima de memoria, no proporciona velocidades de generación en distintos laptops ni promete que todos los dispositivos compatibles con WebGPU ofrecerán la misma experiencia.
La omisión de la versión 9B es instructiva. Los pesos del modelo pueden ser descargables pero aun así resultar inconvenientes para una pestaña del navegador. El mercado de modelos locales se decide cada vez más por la ruta de despliegue completa: cuantización, soporte de tiempo de ejecución, uso de memoria, rendimiento de los kernels y una interfaz usable. El conteo de parámetros por sí solo dice poco a los desarrolladores sobre si un modelo encajará con comodidad en un producto real.
El repositorio Transformers.js admite clases de modelos de lenguaje, visión, audio y otras sin requerir un servidor. Para Qwen, ese trabajo convierte los pesos descargables en algo que un desarrollador puede probar antes de abrir una terminal.
La afirmación de vanguardia necesita una máquina conectada
La publicación de Alibaba repite una afirmación de rendimiento de vanguardia sin identificar el modelo, el hardware del laptop ni el benchmark detrás de ella. La demostración en el navegador respalda la afirmación más acotada de que los modelos más pequeños pueden ejecutarse localmente mediante WebGPU.
La ficha del modelo Qwen3.5-9B de Alibaba publica comparaciones de benchmark realizadas por la compañía que abarcan conocimientos, codificación, razonamiento, contexto largo y tareas de agente. También enumera una ventana de contexto nativa de 262,144 tokens, entradas multimodales y una licencia Apache 2.0. Esas especificaciones describen un modelo inusualmente amplio para su tamaño, aunque no establecen el rendimiento de la configuración del navegador en hardware de consumo.
La distinción importa porque la interfaz empaqueta versiones optimizadas de los modelos más pequeños para la inferencia en el navegador. El runtime del navegador, la precisión numérica, la memoria disponible y la implementación de la GPU pueden afectar la velocidad y la salida. Una demostración en vivo prueba que la pila de software funciona. No convierte la amplia comparación de vanguardia de Alibaba en un resultado reproducido de forma independiente.
Eso deja una afirmación útil y más acotada: Qwen3.5 Small puede ofrecer chat multimodal local a través de una interfaz de navegador, con opciones de modelo lo suficientemente pequeñas como para apuntar al hardware de consumo. Los desarrolladores pueden probar esa proposición directamente, aunque la demostración no suministra una matriz de hardware ni resultados de tokens por segundo.
Las herramientas independientes cierran la brecha de despliegue
La demostración muestra cuánto del concurso de IA local pertenece a los constructores de herramientas independientes. Los laboratorios pueden publicar fichas de modelo y archivos de pesos, mientras que la adopción depende de personas que conviertan esos archivos, soporten nuevas arquitecturas, optimicen kernels y hagan que el resultado sea utilizable fuera de un entorno de investigación.
Alibaba suministró los modelos. Webml-community mantiene el despliegue en el navegador, y Lochner lo dio a conocer a los desarrolladores. Cinco meses y medio después de que se lanzara Qwen3.5 Small, la razón técnica para revisitar la familia es el camino más corto desde los pesos descargables hasta una aplicación local.