Wafer dice que la MI355X de AMD supera a la B300 de Nvidia en eficiencia de costos del Kimi K3

Wafer reporta 952 tokens por segundo desde un solo nodo MI355X de ocho GPU, sosteniendo que la memoria de 288 GB por GPU de AMD puede reducir los costos de inferencia de modelos abiertos.

By · Published

Primary source: Wafer

Why it matters

Kimi K3's size turns GPU memory into a deployment constraint. Wafer's self-reported benchmark shows how software tuning and larger HBM capacity could make AMD economical for frontier-scale open models, even when Nvidia retains the raw-speed lead.

Illustration of an AMD MI355X eight-GPU node in a server rack, highlighting the GPUs and 288 GB memory per GPU.

Wafer, founded by Emilio Andere (@gpuemi) and Steven Arellano (@gpusteve), dice que ejecutó Kimi K3 en ocho GPUs AMD MI355X con mejor rendimiento por dólar que un sistema Nvidia B300, usando la capacidad de memoria y un par de correcciones de software para reducir la brecha de inferencia de AMD.

El proveedor de infraestructura de IA de San Francisco informó 952 tokens de salida por segundo en rendimiento agregado pico y 118 tokens por segundo en un solo flujo. Wafer divulgó los resultados en una publicación técnica del 31 de julio escrita por el miembro del personal técnico Ian Ye.

El rendimiento absoluto de Wafer se mantuvo por debajo de la configuración B300, que alcanzó 1,568 tokens por segundo en la misma prueba. El resultado económico fue al contrario: Wafer calculó 48 tokens por segundo por dólar para el MI355X, frente a 33 para el B300 y 7 para un despliegue B200 de dos nodos.

Esas cifras usan los precios horarios de alquiler asumidos por Wafer de $2.50 por GPU MI355X, $6 por un B300 y $4.25 por un B200. Wafer produjo las cifras usando su propio montaje de prueba.

La memoria cambia la elección de hardware

El informe técnico de Kimi K3 describe un modelo mixture-of-experts con 2.8 billones de parámetros totales, 104 mil millones de parámetros activos y una ventana de contexto de un millón de tokens. Wafer estima que los pesos requieren más de 1.5 terabytes de memoria GPU antes de asignar memoria para la caché key-value usada durante la inferencia.

Ese tamaño crea la oportunidad que Wafer está explotando. Un AMD MI355X lleva 288 GB de HBM3E, dando a un nodo de ocho GPUs aproximadamente 2.3 TB de memoria de alto ancho de banda. Wafer dice que el mismo modelo y la caché de un millón de tokens no cabrían en un solo nodo B200 de ocho GPUs, forzando su prueba B200 a desplegarse en 16 GPUs en dos nodos.

Las configuraciones importan. El despliegue B200 de Wafer pagó el costo de latencia de comunicarse entre nodos en la ruta de decodificación, mientras que los sistemas MI355X y B300 se quedaron dentro de un nodo. Wafer reportó 498 tokens agregados por segundo en todo el despliegue B200 de 16 GPUs, o aproximadamente 249 por nodo.

Eso hace que la comparación con B200 sea estructuralmente desfavorable. También captura la restricción práctica que Wafer quiere que los clientes noten: una GPU con suficiente memoria puede evitar la coordinación entre nodos requerida por un acelerador nominalmente más rápido. A medida que los modelos de pesos abiertos crecen, la capacidad de memoria puede determinar la arquitectura de servicio antes de que el cómputo bruto entre en la ecuación.

Arellano escribió en X que Wafer logró "3.8x higher throughput and 71% lower cost" en el MI355X comparado con su configuración B200. El múltiplo de rendimiento se mide por nodo, mientras que el porcentaje de costo sigue las suposiciones de alquiler por hora listadas por Wafer.

Steven Arellano en X

Dos correcciones pequeñas produjeron la mayor parte de la ganancia

Kimi K3 pudo correr en el software ROCm de AMD sin un puerto desde cero, según Wafer, pero el despliegue inicial dejó un rendimiento sustancial sin usar.

Wafer primero añadió decodificación especulativa usando RadixArk's Kimi-K3-DSpark, un modelo borrador externo diseñado para proponer varios tokens que Kimi K3 puede verificar juntos. La versión CUDA funcionó directamente. En ROCm, una definición faltante de top_k_renorm_prob en el verificador accept-sampling de SGLang causó que el scheduler fallara.

Wafer implementó la operación en PyTorch seleccionando los tokens de mayor probabilidad, enmascarando el resto y reescalando los valores retenidos. Wafer dice que esa corrección aumentó el rendimiento en un solo flujo aproximadamente 2.2x, mejoró el rendimiento por flujo alrededor de 1.7x con carga moderada y elevó el rendimiento agregado pico en 18%.

El segundo problema apareció durante el prefill, la etapa en la que el modelo procesa la entrada del usuario antes de producir su primer token de salida. Wafer midió inicialmente alrededor de 51 segundos para un prefill en frío de 172,000 tokens en el MI355X, comparado con aproximadamente 23 segundos en el B300.

Wafer rastreó la mayor parte del retraso a un desajuste en la forma del kernel de atención. Kimi K3 producía 12 attention heads por rank bajo paralelismo tensorial a través de ocho GPUs, mientras que la ruta AITER más rápida de AMD soportaba cuatro, ocho o múltiplos de 16. Wafer rellenó el conteo de heads de 12 a 16, ejecutó el kernel más rápido y descartó las salidas extra.

El cambio elevó el rendimiento de prefill en estado estable de aproximadamente 4,000–7,000 tokens por segundo a cerca de 13,000, según Wafer. Mejoró el tiempo antes de que apareciera el primer token.

Un benchmark construido alrededor de la tesis fundacional de Wafer

Andere y Arellano se conocieron durante su primer año en la University of Chicago, se convirtieron en compañeros de cuarto y desarrollaron Wafer alrededor de la idea de que la escasez de ingenieros de rendimiento estaba limitando cuán eficientemente se podía usar el hardware de IA. Andere estudió matemáticas, investigó seguridad en machine learning en UChicago y trabajó en modelos meteorológicos en Argonne National Laboratory. Arellano estudió ciencias de la computación y trabajó en computación de alto rendimiento e infraestructura de IA en Google, Two Sigma y Sei Labs.

Wafer ahora ofrece agentes de software que perfilan cargas de trabajo y buscan entre modelos, motores de inferencia, kernels y configuraciones de hardware. Y Combinator incluye a Wafer como una empresa del Summer 2025 con siete personas en San Francisco.

El trabajo con MI355X es una demostración directa de la afirmación de los fundadores de que la optimización de software puede hacer que aceleradores alternativos sean económicamente competitivos para modelos exigentes. También es un argumento de venta para las APIs serverless y los despliegues de inferencia dedicados de Wafer: los clientes pueden darle a Wafer un modelo y una carga de trabajo en lugar de comprometerse de antemano con un vendedor de chips en particular.

Wafer levantó una ronda semilla de $4 millones el 14 de abril de 2026, liderada por Fifty Years con participación de Liquid 2 y Y Combinator. El anuncio del financiamiento enmarcó el objetivo de Wafer como maximizar la "inteligencia por vatio" automatizando trabajo tradicionalmente realizado por un pequeño grupo de especialistas en kernels y sistemas.

Kimi K3 somete ese argumento a una prueba de esfuerzo útil. Su tamaño recompensa el diseño de 288 GB de AMD, mientras que los problemas de software que encontró Wafer fueron lo suficientemente estrechos como para solucionarse sin escribir nuevos kernels personalizados. Esa combinación favorece a Wafer y a AMD: AMD obtiene evidencia de que su hardware puede servir un modelo abierto a escala frontera, y Wafer obtiene un ejemplo concreto de por qué los compradores de inferencia pueden necesitar optimización a través de distintos proveedores de chips.

El resultado no establece al MI355X como la GPU más rápida. La propia corrida de Wafer con B300 entregó 65% más rendimiento agregado y un solo flujo más rápido. El hallazgo de Wafer es más estrecho y comercialmente relevante: bajo sus configuraciones y precios de alquiler, un nodo MI355X manejó Kimi K3 a un menor costo por unidad de rendimiento.

Reader comments

Conversation for this story loads after sign-in.