Lucebox se asocia con AMD para una caja de inferencia de IA local de $6,499
El fundador Alessandro Puppo dice que el sistema Radeon R9700-Strix Halo ejecutó DeepSeek V4 Flash 3.63x más rápido que un DGX Spark.
By Ryan Merket · Published
Primary source: X
Why it matters
Lucebox is testing whether software tuned for mismatched consumer processors can give AMD a credible position against Nvidia's integrated desktop AI systems.

Lucebox fundador Alessandro "Sandro" Puppo (@pupposandro) anunció una asociación con AMD el 30 de julio para vender una computadora de inferencia de IA local que combina una GPU discreta Radeon AI PRO R9700 con el Ryzen AI MAX+ 395 de AMD, comúnmente conocido como Strix Halo.
Puppo, que anteriormente trabajó en Notion y ayudó a construir Cua, un proyecto de infraestructura respaldado por Y Combinator para agentes de uso en computadora, está llevando la misma apuesta subyacente al hardware: los agentes de IA necesitarán una fuente privada y predecible de inferencia que los desarrolladores puedan ejecutar continuamente sin enviar cada solicitud a una API en la nube.
La empresa con sede en San Francisco, Lucebox, lista la máquina con tecnología AMD en $6,499 hasta el 31 de agosto, después de lo cual el precio sube a $7,900. El sistema incluye 128GB de memoria unificada LPDDR5X conectada al procesador Strix Halo, 32GB de memoria GDDR6 en la R9700, una unidad NVMe de 2TB y una carcasa de aluminio de 11.97 litros. Según Lucebox, Ubuntu, modelos afinados y el motor de inferencia de Lucebox llegan preinstalados.
El producto expone endpoints compatibles con OpenAI y Anthropic, permitiendo que herramientas para desarrolladores y frameworks de agentes envíen solicitudes a la máquina usando interfaces modeladas a partir de las APIs en la nube. Lucebox dice que el sistema puede operar sin conexión una vez que los pesos del modelo estén cargados.
Lucebox divide un modelo entre dos procesadores AMD diferentes
El núcleo técnico es el enfoque de Lucebox hacia la computación heterogénea. En lugar de dividir cada capa del modelo de manera uniforme entre dos aceleradores idénticos, Lucebox asigna trabajo diferente a la R9700 y al Strix Halo basándose en su capacidad y velocidad de memoria.
En un informe técnico publicado junto con el anuncio de Puppo, Lucebox dijo que cargó una compilación comprimida de 102.3GB del modelo DeepSeek V4 Flash de 284 mil millones de parámetros a través de los dos procesadores. La R9700 almacenó la ruta densa, bloques de expertos seleccionados con frecuencia, un modelo auxiliar de decodificación especulativa de 11.3GB y la caché de trabajo. La mayor memoria unificada del Strix Halo contenía los expertos restantes.
Ambos procesadores ejecutan los expertos seleccionados concurrentemente antes de que la R9700 combine sus salidas. La arquitectura está diseñada en torno a modelos de mezcla de expertos, que activan solo una fracción de sus parámetros totales para cada token. Lucebox llama a la técnica paralelismo asimétrico de expertos.
Lucebox reportó una tasa mediana de generación de 51.1 tokens por segundo para una única solicitud usando un prompt de aproximadamente 2,000 tokens y 128 tokens generados. El resultado fue la mediana de tres solicitudes medidas después de dos ejecuciones de calentamiento. Puppo dijo en X que el resultado fue 3.63x el rendimiento que Lucebox midió en un NVIDIA DGX Spark.
Esa cifra titular requiere matices. Lucebox midió el DGX Spark en un promedio de 14.09 tokens por segundo en cuatro longitudes de contexto, mientras que la cifra de 51.1 tokens de Lucebox provino de una prueba de servicio separada. En la barrida emparejada de Lucebox a 2,000, 4,000, 8,000 y 16,000 tokens de contexto, su máquina promedió 47.75 tokens por segundo, produciendo una aceleración de 3.39x sobre el resultado del DGX Spark.
Los dos sistemas también ejecutaron diferentes formatos de compresión de modelo y configuraciones de software optimizadas para su hardware respectivo. Lucebox utilizó una compilación ROCmFPX, cuatro expertos enrutados por token y decodificación especulativa. El DGX Spark utilizó un modelo comprimido Q2. Lucebox describe el resultado como una comparación de sistema completo más que como una prueba únicamente de GPU.
El benchmark fue ejecutado por Lucebox y no por un laboratorio de pruebas independiente. Lucebox ha publicado la configuración de la prueba, los nombres de los modelos y la implementación a través de su repositorio de código abierto, dando a los desarrolladores una vía para inspeccionar y reproducir el trabajo.
AMD consigue otra vía hacia los escritorios de los desarrolladores de IA
La asociación le da a AMD un proveedor de hardware pequeño pero focalizado que construye directamente alrededor de la combinación de una APU de alta memoria y una GPU discreta Radeon. AMD posiciona la R9700, que tiene 32GB de memoria de video y usa su arquitectura RDNA 4, para inferencia local y cargas de trabajo de desarrollo intensivas en memoria.
El enfoque de Lucebox también aborda una desventaja persistente para AMD en sistemas de IA para desarrolladores: gran parte del mercado de software de inferencia se ha construido alrededor del stack de CUDA de Nvidia. Lucebox está intentando cerrar parte de esa brecha mediante núcleos específicos por modelo, decodificación especulativa y lógica de colocación escrita para la configuración exacta de hardware de AMD.
Los precios colocan a Lucebox entre una y dos unidades DGX Spark. Nvidia actualmente lista un DGX Spark en $4,699 con 128GB de memoria unificada del sistema y 4TB de almacenamiento. Con sus precios listados, el Lucebox cuesta aproximadamente 38% más que un DGX Spark y aproximadamente 31% menos que dos.
La apuesta de Puppo es que los desarrolladores que ejecuten cargas sostenidas de agentes pagarán la prima por mayor rendimiento medido, control local de datos y una pila de software preconfigurada. El hardware es solo la mitad de esa propuesta. La capacidad de Lucebox para seguir ajustando modelos abiertos individuales entre los dos procesadores de AMD determinará si la caja sigue siendo más rápida después de que el modelo de referencia cambie.