Huawei lanza el modelo openPangu de 505 mil millones de parámetros entrenado en chips Ascend

El 512K-context release prueba si Huawei puede convertir su chip, modelo y pila de inferencia en una alternativa creíble a la IA centrada en Nvidia.

By · Published

Primary source: X - Poe Zhao

Why it matters

Huawei is using an open-weight model to validate a vertically integrated AI stack built around Ascend instead of Nvidia GPUs. Adoption will depend on tooling, reproducibility and a license that bars use in the EU.

Huawei releases 505B-parameter openPangu model trained on Ascend chips

Huawei ha lanzado openPangu 2.0 Pro, un modelo de lenguaje Mixture-of-Experts que, según Huawei, fue entrenado íntegramente en sus procesadores Ascend AI, poniendo los pesos de uno de los modelos más grandes construidos sobre una pila de cómputo no-Nvidia en manos de los desarrolladores.

La ficha del modelo indica aproximadamente 505 mil millones de parámetros totales, con 18 mil millones activados por cada token, una ventana de contexto de 512K tokens y aproximadamente 34 billones de tokens de entrenamiento. El repositorio apareció alrededor del 30 de julio, después de que Huawei presentara la familia openPangu 2.0 en su conferencia de desarrolladores del 12 de junio. Poe Zhao (@poezhao0605) llamó la atención sobre el lanzamiento completo Pro el 31 de julio.

El recuento de parámetros requiere una aclaración. La ficha del modelo de Huawei y su informe técnico dicen 505 mil millones, mientras que los metadatos automatizados de Hugging Face informan 541 mil millones. El repositorio no reconcilia la diferencia. Sus archivos ocupan aproximadamente 1.08 TB.

Un modelo construido alrededor de Ascend

El lanzamiento convierte a openPangu en una prueba pública de la estrategia de IA vertical de Huawei. Ren Zhengfei fundó Huawei en 1987 con CNY21,000, según su biografía corporativa. Casi cuatro décadas después, Huawei está ensamblando sus propios procesadores, sistemas de entrenamiento, modelos, infraestructura en la nube y software de dispositivos en una sola pila.

Esa pila es la afirmación central detrás de openPangu 2.0 Pro. Huawei afirma que el modelo fue entrenado en NPUs Ascend y proporciona código de inferencia nativo para Ascend a través de su framework omni-infer. El repositorio de inferencia está licenciado bajo Apache 2.0.

La arquitectura de Huawei usa esparsidad para mantener el cómputo activo por token muy por debajo del recuento total de parámetros del modelo. Combina atención latente multi-cabeza con dos patrones de atención: atención de ventana deslizante (sliding-window) para contexto local y atención dinámica dispersa (dynamic sparse attention) para información de largo alcance. Huawei dice que organizó esas capas en una proporción de 2 a 1. Un diseño residual de cuatro flujos, el optimizador Muon y tres cabezas de predicción multitonoken están destinados a mejorar la eficiencia del entrenamiento y la inferencia.

El modelo ofrece modos de thinking y non-thinking y está orientado a tareas de razonamiento, codificación, uso de herramientas y agentes. Huawei reporta puntuaciones de 68.5 en SWE-bench Verified y 85.7 en LiveCodeBench V6 para la versión thinking, ambas medidas usando promedios de tres ejecuciones. Esas cifras son evaluaciones propias de Huawei y deben leerse dentro de las configuraciones de prueba publicadas en su ficha del modelo.

Las especificaciones publicadas sitúan a openPangu 2.0 Pro entre los lanzamientos MoE de pesos abiertos más grandes. DeepSeek-V3 lista 671 mil millones de parámetros totales, 37 mil millones de parámetros activos y una ventana de contexto de 128K. Alibaba's Qwen3-235B-A22B lista 235 mil millones totales y 22 mil millones activos, mientras que Moonshot AI's Kimi K2 lista 1 billón de parámetros totales y 32 mil millones activos. Cada una de esas configuraciones publicadas tiene una ventana de contexto de 128K, una cuarta parte de la longitud que Huawei afirma para openPangu 2.0 Pro.

El tamaño bruto del modelo no establece rendimiento ni usabilidad. La afirmación más relevante de Huawei es que entrenó un modelo de esta escala en Ascend y ha publicado los pesos, el código de arquitectura y la ruta de despliegue necesarios para que desarrolladores externos examinen esa afirmación.

Pesos abiertos, licencia restringida

Huawei está distribuyendo los pesos bajo su OpenPangu Model License Agreement 2.0, en lugar de una licencia estándar de código abierto. El acuerdo otorga derechos para usar, modificar y redistribuir el modelo, al tiempo que prohíbe explícitamente el acceso, despliegue o uso dentro de la Unión Europea.

La licencia también requiere que los productos o servicios basados en el modelo muestren un reconocimiento "Impulsado por openPangu" y un aviso de marca registrada de Huawei. Esas condiciones reducen la base de desarrolladores a la que se puede dirigir y hacen que el lanzamiento sea materialmente menos permisivo que modelos con Apache 2.0 como Qwen3, aun cuando el propio código de inferencia de openPangu usa Apache 2.0.

Huawei tiene la capacidad financiera para tratar el modelo como infraestructura para su negocio informático más amplio. En su anuncio del informe anual 2025, Huawei reportó CNY880.9 mil millones en ingresos y CNY192.3 mil millones en gastos de investigación y desarrollo, equivalentes al 21.8% de los ingresos. Huawei dijo que continuaría invirtiendo en IA y fomentaría la adopción por parte de desarrolladores alrededor de Ascend, Kunpeng y HarmonyOS.

OpenPangu 2.0 Pro da a esa estrategia un modelo que los desarrolladores pueden descargar e inspeccionar. La siguiente prueba es operacional: si equipos fuera de Huawei pueden reproducir el rendimiento reportado, ejecutar eficientemente el lanzamiento de un billón de bytes en la infraestructura Ascend y construir productos bajo una licencia que excluye a la Unión Europea.

Reader comments

Conversation for this story loads after sign-in.