Alibaba presenta Qwen3.8-Max con los pesos del modelo planeados para la próxima semana
Alibaba dice que su modelo de 2,4 billones de parámetros está programado para su lanzamiento la próxima semana a través de Model Studio, con la publicación de los pesos del modelo planeada y los términos de la licencia aún sin resolverse.
By Ryan Merket · Published
Primary source: CNBC
Why it matters
Eddie Wu is using Qwen releases to drive demand for Alibaba Cloud. Qwen3.8-Max matters if its performance produces recurring inference and agent usage beyond Alibaba's own products.

Alibaba, dirigida por el cofundador y CEO Eddie Wu, presentó Qwen3.8-Max el lunes 3 de agosto, diciendo que el modelo de 2.4 billones de parámetros está programado para su lanzamiento la próxima semana a través de Alibaba Cloud Model Studio. Alibaba también planea publicar los pesos del modelo la próxima semana, aunque la licencia exacta y la fecha siguen sin resolverse. CNBC reported que las acciones de Hong Kong de Alibaba subieron 7% y sus acciones listadas en Nueva York ganaron aproximadamente 4.5% en la negociación previa al mercado.
El anuncio del modelo forma parte del impulso más amplio de Wu hacia la IA y la nube en Alibaba. Wu ha sido CEO de Alibaba desde septiembre de 2023, y Alibaba Cloud distribuye la familia de modelos Qwen a través de Model Studio. Qwen3.8-Max le da a Wu un nuevo producto emblemático para los servicios alojados de Alibaba, con el lanzamiento programado para la próxima semana.
La historia de Wu con Alibaba se remonta a su fundación. Se desempeñó como director tecnológico de Alibaba en 1999, convirtiéndose después en director de tecnología de Alipay y Taobao. Tras ayudar a construir los sistemas técnicos bajo la operación comercial de Jack Ma, Wu está usando modelos fundacionales para reconformar Alibaba alrededor de la IA y la computación en la nube.
El anuncio del 3 de agosto dejó más explícito el plan de lanzamiento de Alibaba y mantuvo sin resolver la licencia exacta de los pesos y la fecha de publicación.
Un modelo muy grande con un núcleo activo más pequeño
Alibaba says que Qwen3.8-Max contiene 2.4 billones de parámetros en total, mientras que su arquitectura dispersa de mezcla de expertos activa 95 mil millones de parámetros para una carga de trabajo dada. Esa distinción importa para los desarrolladores que evalúan los costos de inferencia y los requisitos de hardware. El conteo total describe la capacidad distribuida entre los expertos del modelo; el conteo activo se acerca más a la cantidad de cómputo usada mientras el modelo procesa cada token.
Qwen3.8-Max acepta texto, imágenes y otros insumos visuales, con una ventana de contexto de hasta 1 millón de tokens. Alibaba lo posiciona para codificación, investigación, revisión legal, análisis financiero, procesamiento de documentos y diseño 3D. Esas cargas de trabajo coinciden estrechamente con las tareas de agentes de larga duración que los laboratorios de vanguardia usan cada vez más para vender sus modelos de mayor precio.
Las afirmaciones visuales de Alibaba son amplias. Alibaba dice que Qwen3.8-Max puede procesar documentos de cien páginas, series de televisión completas y transmisiones en vivo de 100 horas, y luego convertir el material en bases de conocimiento consultables. El rendimiento práctico dependerá de la precisión en entradas largas, la fiabilidad de las herramientas y el costo de procesar tanto material.
Wu necesita el modelo para vender uso en la nube
En el informe de mayo de Alibaba sobre sus resultados del trimestre de marzo, Alibaba dijo que el crecimiento de los ingresos en la nube se aceleró al 40% a medida que su estrategia de IA dio resultados.
Esa cifra la reportó Alibaba, pero muestra por qué Wu está lanzando modelos a un ritmo rápido. Cada lanzamiento de Qwen puede generar demanda de inferencia, almacenamiento, herramientas para agentes y los chips de Alibaba. Eso le da a Wu varias formas de convertir la adopción del modelo en ingresos sin depender de una suscripción a un chatbot independiente.
Qwen3.8-Max encaja en ese enfoque. El acceso hospedado puede generar ingresos por uso, mientras que la publicación prevista de los pesos podría atraer a desarrolladores que quieran inspeccionar, personalizar o ejecutar el modelo en otros entornos. La publicación de los pesos también debería aclarar los términos de la licencia y la carga práctica de hardware que enfrentan los equipos que quieran desplegar por sí mismos un modelo de 2.4 billones de parámetros.
La comparación con Anthropic requiere pruebas independientes
Alibaba dice que Qwen3.8-Max ocupa el quinto lugar en Text Arena y el segundo en Vision Arena, quedando solo por detrás de Claude Fable 5 de Anthropic en el ranking de visión. Anthropic describe Fable 5 como un modelo para sus trabajos más difíciles de conocimiento y codificación, incluyendo tareas de varios días, investigación profunda y flujos de trabajo con muchos documentos en finanzas, derecho, analítica y arquitectura. Esos casos de uso lo convierten en un objetivo para la propuesta de nube empresarial de Alibaba.
La comparación debe tratarse como una afirmación de Alibaba. La previa de Qwen3.8-Max publicada anteriormente llegó sin una ficha del modelo ni resultados de benchmarks reproducidos de forma independiente, como informó TechTimes el 21 de julio. El anuncio del lunes de Alibaba incluye gráficos de tablas de clasificación, pero los desarrolladores necesitarán evaluaciones externas en codificación, uso de herramientas, precisión en contextos largos y tareas multimodales antes de considerar el modelo como un sustituto consistente de Fable.
Los recuentos de parámetros ofrecen una guía limitada en esa comparación. Kimi K3 de Moonshot AI declara un total mayor de 2.8 billones de parámetros, mientras que Qwen3.8-Max usa 2.4 billones. La arquitectura, los datos de entrenamiento, el aprendizaje por refuerzo, las configuraciones de inferencia y la integración de herramientas pueden importar tanto como la escala bruta.
La ventaja de Wu proviene de la distribución que ya rodea a Qwen. Alibaba posee la infraestructura de nube, la plataforma de modelos, las operaciones de chips y grandes servicios de consumo donde Qwen puede desplegarse. El repunte de las acciones del lunes muestra que los inversores premiaron esa estructura al menos por una sesión. Las ganancias duraderas dependerán de si desarrolladores externos reproducen las afirmaciones de rendimiento de Alibaba y siguen pagando por ejecutar el modelo después de que la atención del anuncio disminuya.