Lucebox 与 AMD 合作推出售价 6,499 美元的本地 AI 推理盒

创始人 Alessandro Puppo 表示,Radeon R9700-Strix Halo 系统运行 DeepSeek V4 Flash 的速度比单台 DGX Spark 快 3.63 倍。

By · Published

Primary source: X

Why it matters

Lucebox is testing whether software tuned for mismatched consumer processors can give AMD a credible position against Nvidia's integrated desktop AI systems.

Illustration of the Lucebox Radeon R9700-Strix Halo local AI inference box, presented as a revered device highlighting faster DeepSeek V4 Flash performance over a DGX Spark.

Lucebox 创始人 Alessandro "Sandro" Puppo (@pupposandro) 于 7月30日 宣布与 AMD 合作,销售一款将 Radeon AI PRO R9700 独立 GPU 与 AMD 的 Ryzen AI MAX+ 395(通常称为 Strix Halo)结合在一起的本地 AI 推理计算机。

Puppo 曾在 Notion 工作,并参与构建了由 Y Combinator 支持的计算代理基础设施项目 Cua。他在硬件上押注了相同的基本观点:AI 代理将需要一个私有且可预测的推理来源,开发者可以持续运行而不必将每个请求都发送到云 API。

总部位于旧金山的 Lucebox 在 8 月 31 日之前将这款 AMD 驱动的机器标价为 $6,499,之后价格上调至 $7,900。根据 Lucebox 的说法,该系统包括附加到 Strix Halo 处理器的 128GB LPDDR5X 统一内存、R9700 上的 32GB GDDR6 显存、一个 2TB NVMe 驱动器和一个铝制 11.97 升机箱。Ubuntu、调优的模型和 Lucebox 的推理引擎预装在系统中。

该产品暴露出与 OpenAI 和 Anthropic 兼容的端点,允许开发工具和代理框架使用以云 API 为模型的接口向该机器发送请求。Lucebox 表示,一旦模型权重加载完成,系统即可离线运行。

Lucebox 将一个模型分布在两种不同的 AMD 处理器上

技术核心是 Lucebox 在异构计算方面的方法。Lucebox 并非将每个模型层均匀地在两个相同的加速器之间划分,而是根据内存容量和速度将不同的工作分配给 R9700 和 Strix Halo。

与 Puppo 公布同时发布的技术报告 中,Lucebox 表示他们将一个压缩后的、102.3GB 的 2840 亿参数的 DeepSeek V4 Flash 模型构建体分布加载到两颗处理器上。R9700 存储了 dense path、经常被选中的 expert 块、一个 11.3GB 的 speculative-decoding 辅助模型以及工作缓存。Strix Halo 更大的统一内存则保存了剩余的 experts。

在将选定的 experts 并行执行之后,两颗处理器会由 R9700 合并它们的输出。该架构围绕 mixture-of-experts 模型设计,这类模型在每个 token 上只激活其总参数的一小部分。Lucebox 将该技术称为 asymmetric expert parallelism。

Lucebox 报告称,在使用约 2,000-token 的提示和 128 个生成 token 的情况下,单次请求的中位生成速率为每秒 51.1 个 token。该结果是两次预热运行后测量的三次请求的中位值。Puppo 在 X 上表示,该结果是 Lucebox 在一台 NVIDIA DGX Spark 上测得性能的 3.63 倍。

该头条比率需要说明。Lucebox 在四个上下文长度上将 DGX Spark 测得的平均值为每秒 14.09 个 token,而 51.1 token 的 Lucebox 数值来自一次单独的服务测试。在 Lucebox 匹配的扫描测试中,在 2,000、4,000、8,000 和 16,000 token 的上下文下,其机器的平均值为每秒 47.75 个 token,相对于 DGX Spark 的结果带来了 3.39 倍的加速。

两套系统还运行了不同的模型压缩格式和针对各自硬件优化的软件配置。Lucebox 使用了 ROCmFPX 构建、每个 token 四个路由的 experts 和 speculative decoding。DGX Spark 使用了 Q2 压缩模型。Lucebox 将该结果描述为一次整机比较,而非仅针对 GPU 的测试。

该基准测试由 Lucebox 而非独立测试实验室运行。Lucebox 已通过其 开源代码库 发布了测试设置、模型名称和实现,为开发者提供了检查和复现该工作的途径。

AMD 获得了另一条进入 AI 开发者桌面的途径

该合作为 AMD 提供了一个小而专注的硬件厂商,该厂商直接围绕高内存 APU 与独立 Radeon GPU 的组合进行构建。AMD 将 R9700(具有 32GB 显存并采用 RDNA 4 架构)定位于本地推理和内存密集型开发工作负载。

Lucebox 的方法也解决了 AMD 在开发者 AI 系统方面的一个持续劣势:大量推理软件市场都是围绕 Nvidia 的 CUDA 堆栈构建的。Lucebox 正试图通过为确切的 AMD 硬件配置编写的模型特定内核、speculative decoding 和放置逻辑来缩小这一部分差距。

定价使 Lucebox 介于一台到两台 DGX Spark 之间。Nvidia 当前将一台 DGX Spark 标价为 $4,699,配备 128GB 统一系统内存和 4TB 存储。按其标价计算,Lucebox 的价格比一台 DGX Spark 高约 38%,但比两台低约 31%。

Puppo 的赌注是,运行持续代理工作负载的开发者会为更高的实际吞吐量、本地数据控制和预配置的软件栈支付溢价。硬件只是该命题的一半。Lucebox 能否在两颗 AMD 处理器上持续为各个开源模型进行调优,将决定当基准模型改变后这台机器是否仍然更快。

Reader comments

Conversation for this story loads after sign-in.