Lamb Labs 推出 AI 芯片计划,目标是每秒处理 20,000 个令牌

Lamb Labs 表示一款 8B FPGA 原型在低于 10 瓦的功耗下运行,而其 63 倍的能效主张缺乏可复现的基准测试。

By · Published

Primary source: X

Why it matters

Sub-watt inference could move capable language models into robots and consumer devices, but Lamb Labs must translate FPGA experiments and internal metrics into tested silicon.

Lamb Labs unveils AI chip plan targeting 20,000 tokens a second

Lamb Labs,由 Niki KotechaThomas Lanning 创立,在 X 上的一条线程 中(8月4日)表示其计划中的定制推理芯片每秒可生成超过 20,000 个标记,并在“每瓦智能(Intelligence per Watt)”上达到传统 GPU 的 63 倍。

https://x.com/LambLabs/status/2084692794388418746

poster=/api/storage/public-objects/tweet-videos/lamb-labs-custom-ai-inference-chip-20000-tokens-poster-561c0d6f.jpg|来自 @LambLabs 在 X 的视频

这些数字是 Lamb Labs 的目标,而非经过独立测试的结果。Lamb Labs 尚未公布用于比较的模型、批次大小、精度、延迟方法或 GPU 基线。它也未详述为复现该结果所需的芯片架构、制造工艺或生产计划。

这些基准声明强化了 Kotecha 和 Lanning 在他们 于七月将 Lamb Labs 公之于众 时阐述的硬件论点。Lamb Labs 是 Y Combinator 2026 年夏季批次的一部分,正在为机器人、类人机器人、手机、可穿戴设备和工业设备的本地推理设计芯片。其宣称的目标是无需云连接或数据中心级别电力预算即可运行有能力的模型。

Kotecha 通过 AI 研究进入芯片项目,而非半导体制造领域。她在 University of Cambridge 获得化学工程的 BA 和 MEng 学位,随后在 Imperial College London 攻读博士学位。她的工作将多智能体强化学习和图神经网络应用于去中心化的供应链决策,包括关于库存控制的研究。根据一份 Imperial College profile,她此前创立了 Transpexa,使用相关方法进行库存、物流和需求预测。

Lanning 的公开资料显示他曾宣布计划以学生研究员身份在 Google DeepMind 工作。最近,他的更新记录了 Lamb Labs 在 FPGA 上的实验,包括一个约耗电六瓦的 70 亿参数模型,以及一个量化后的 270 亿参数模型,能装在同一类开发板上但运行缓慢。

这些原型工作显示了 Lamb Labs 仍需弥合的差距。一个 在 Lamb Labs 的 LinkedIn 页面转载的 Y Combinator 帖子 称,目前的 80 亿参数 FPGA 原型功耗低于 10 瓦。Lamb Labs 的目标是实现低于 1 瓦的部署,这对电池供电设备来说是一个显著更紧的功耗限制。

Y Combinator 表示,Lamb Labs 的方法结合了模型专用硬件、激进量化和基于扩散的推理。该加速器将长期论点描述为为每个 AI 模型提供其专用的定制硅片。这将以围绕更窄的模型和工作负载调优的硬件来交换通用 GPU 的部分灵活性。

Lamb Labs 将其核心度量称为每瓦智能(Intelligence per Watt,或 IPW)。这种表述试图同时考虑模型能力、速度和电力使用,但 Lamb Labs 尚未公布用于评分智能的公式。在没有定义评估方法和统一硬件基线的情况下,63 倍的数字无法与常规的每瓦性能测量进行比较。

专用推理处理器的市场已从数据中心系统扩展到低功耗设备。Groq 围绕确定性执行和片上存储构建其 LPU,而 Cerebras 在晶圆级系统上销售高速推理。Hailo 针对边缘设备提供低功耗 AI 加速器。Lamb Labs 则做出更为狭窄的押注,围绕模型专用芯片和足够小以支持嵌入式生成式 AI 的功耗预算展开。

Lamb Labs 在 YC 的地位为 Kotecha 和 Lanning 在推进该硬件周期时提供了初始融资。YC 的标准协议 通过两份 safe 投资 500,000 美元:125,000 美元换 7%,以及 375,000 美元的无上限最惠国条款 safe。

一块已流片并在指定条件下运行命名模型的芯片,将决定 Lamb Labs 的数字是描述一个产品还是一个设计目标。FPGA 结果证明 Kotecha 和 Lanning 正在可编程硬件上运行量化的语言模型。要验证 20,000 标记和 63 倍的主张,仍然需要可重复的速度、模型质量和整机功率测量作为证据。

Reader comments

Conversation for this story loads after sign-in.