Lamb Labs presenta un plan de chip para IA que apunta a 20,000 tokens por segundo
Lamb Labs dice que un prototipo FPGA de 8B funciona con menos de 10 vatios, mientras que su afirmación de eficiencia de 63x carece de un punto de referencia reproducible.
By Ryan Merket · Published
Primary source: X
Why it matters
Sub-watt inference could move capable language models into robots and consumer devices, but Lamb Labs must translate FPGA experiments and internal metrics into tested silicon.

Lamb Labs, founded by Niki Kotecha and Thomas Lanning, said in un hilo en X on August 4th that its planned custom inference chips could generate more than 20,000 tokens per second and deliver 63 times the "Intelligence per Watt" of traditional GPUs.
https://x.com/LambLabs/status/2084692794388418746
Esas cifras son objetivos de Lamb Labs, no resultados probados de forma independiente. Lamb Labs no ha publicado el modelo, el tamaño de lote, la precisión, la metodología de latencia ni la línea base de GPU detrás de la comparación. Tampoco ha detallado la arquitectura del chip, el proceso de fabricación ni el cronograma de producción necesarios para reproducir el resultado.
Las afirmaciones del benchmark afinan la tesis de hardware que Kotecha y Lanning esbozaron cuando dieron a conocer a Lamb Labs en julio. Lamb Labs forma parte de la generación de verano 2026 de Y Combinator y está diseñando chips para inferencia local en robots, humanoides, teléfonos, wearables y equipos industriales. El objetivo declarado es ejecutar modelos capaces sin una conexión a la nube ni un presupuesto de energía a escala de centro de datos.
Kotecha llegó al proyecto de chips mediante la investigación en IA más que por la fabricación de semiconductores. Obtuvo títulos BA y MEng en ingeniería química por la University of Cambridge antes de cursar un PhD en Imperial College London. Su trabajo aplicó aprendizaje por refuerzo multiagente y redes neuronales de grafos a decisiones descentralizadas de la cadena de suministro, incluyendo investigación sobre el control de inventario. Anteriormente fundó Transpexa, que utilizó métodos relacionados para inventario, logística y pronóstico de demanda, según un perfil de Imperial College.
El perfil público de Lanning indica que anunció planes para trabajar como investigador estudiante en Google DeepMind. Más recientemente, sus actualizaciones han documentado los experimentos de Lamb Labs con FPGA, incluyendo un modelo de 7.000 millones de parámetros que consumía alrededor de seis vatios y un modelo cuantizado de 27.000 millones de parámetros que cabía en la misma clase de placa de desarrollo pero se ejecutaba lentamente.
Ese trabajo prototipo muestra la brecha que Lamb Labs aún debe cerrar. Una publicación de Y Combinator reproducida en la página de LinkedIn de Lamb Labs dice que el prototipo actual en FPGA de 8.000 millones de parámetros funciona por debajo de los 10 vatios. Lamb Labs apunta a despliegues por debajo de un vatio, un margen de potencia considerablemente más ajustado para dispositivos con batería.
Y Combinator dijo que el enfoque de Lamb Labs combina hardware específico para cada modelo, cuantización agresiva e inferencia basada en difusión. El acelerador describió la tesis a largo plazo como dotar a cada modelo de IA de su propio silicio personalizado. Eso implicaría sacrificar parte de la flexibilidad de las GPUs de propósito general a cambio de hardware ajustado alrededor de un modelo y una carga de trabajo más estrechos.
Lamb Labs denomina su métrica central Intelligence per Watt, o IPW. Ese planteamiento intenta tener en cuenta la capacidad del modelo así como la velocidad y el consumo eléctrico, pero Lamb Labs no ha publicado la fórmula usada para puntuar la inteligencia. Sin una evaluación definida y una base común de hardware, la cifra de 63x no puede compararse con las mediciones convencionales de rendimiento por vatio.
El mercado de procesadores de inferencia especializados ya abarca sistemas de centros de datos y dispositivos de bajo consumo. Groq construyó su LPU en torno a la ejecución determinista y la memoria en chip, mientras que Cerebras vende inferencia de alta velocidad en sistemas a escala de oblea. Hailo apunta a equipos edge con aceleradores de IA de menor consumo. Lamb Labs está haciendo una apuesta más estrecha en torno a chips específicos para modelos y presupuestos de energía lo suficientemente pequeños para IA generativa embebida.
La inclusión de Lamb Labs en YC les da a Kotecha y Lanning financiación inicial mientras atraviesan ese ciclo de hardware. El acuerdo estándar de YC invierte $500,000 a través de dos safes: $125,000 por 7% y $375,000 en un safe sin tope con cláusula de nación más favorecida.
Un chip con diseño finalizado que ejecute un modelo nombrado bajo condiciones especificadas determinará si las cifras de Lamb Labs describen un producto o un objetivo de diseño. Los resultados en FPGA establecen que Kotecha y Lanning están ejecutando modelos de lenguaje cuantizados en hardware programable. Mediciones reproducibles de velocidad, calidad del modelo y consumo eléctrico desde la toma de corriente siguen siendo la prueba requerida para las afirmaciones de 20,000 tokens y 63x.