Pokee AI lanza modelo de agente de 28B, afirma 10 millones de tokens en una sola RTX 4090
Pokee no ha publicado los pesos del modelo, configuraciones detalladas de prueba ni suficiente información de la arquitectura para evaluar de manera independiente sus afirmaciones sobre el manejo de contextos largos y el rendimiento.
By Ryan Merket · Published · Updated
Primary source: Pokee AI on X
Why it matters
A usable 10-million-token model on one GPU could cut agent inference costs and keep sensitive enterprise data on private hardware. Pokee's claims still need independent replication.

Zheqing (Bill) Zhu (@ZheqingZhu), fundador y CEO de Pokee AI, lanzó Pokee-Isaac 28B el martes 4 de agosto, con resultados reportados por el proveedor que sugieren que el modelo agente propietario puede manejar 10 millones de tokens de contexto en una sola GPU de la clase Nvidia RTX 4090.
En su anuncio en X, Pokee dijo que el modelo de 28 mil millones de parámetros obtuvo 93.3% en RULER con la longitud completa de 10 millones de tokens y alcanzó velocidades de prellenado de hasta 137,000 tokens por segundo en una GPU. La compañía describió a Pokee-Isaac como un "modelo agentivo de vanguardia" construido sobre una arquitectura propietaria "no exclusivamente decodificadora".
Esas cifras de rendimiento provienen de pruebas internas de Pokee. La compañía no ha publicado los pesos del modelo, configuraciones de prueba detalladas ni suficiente información de arquitectura para que terceros evalúen cómo reduce las demandas de memoria y cómputo asociadas con prompts muy largos. Pokee dijo en respuestas al anuncio que tiene la intención de abrir el código de una versión en el futuro, sin especificar si esa publicación usaría los mismos pesos ni fijar una fecha.
La longitud de contexto afirmada es el centro del lanzamiento. Si se reproduce de forma independiente, una ventana de 10 millones de tokens podría permitir a un agente inspeccionar grandes colecciones de documentos, repositorios de código, catálogos de herramientas e historiales de conversación en una sola sesión sin depender tanto de sistemas de recuperación que dividen los datos en fragmentos más pequeños. El sitio web de Pokee dice que el modelo está diseñado para planear, ejecutar y revisar tareas de larga duración mientras opera dentro de la infraestructura del cliente.
RULER, el benchmark detrás del resultado principal de Pokee, es una evaluación sintética que prueba recuperación, trazado multi-hop y agregación a través de entradas largas. Su artículo de investigación original fue diseñado para distinguir una ventana de contexto anunciada de la cantidad de contexto que un modelo puede usar de manera efectiva. Un buen resultado en RULER respaldaría la afirmación de Pokee sobre contexto largo bajo las condiciones probadas, pero no establecería la calidad general de razonamiento ni la fiabilidad en flujos de trabajo empresariales de múltiples pasos.
El gráfico del lanzamiento de Pokee también muestra su modelo quedando por detrás de un sistema etiquetado GPT-5.6-Luna en Terminal-Bench 2.1 y MCP-Atlas, mientras lo supera por un estrecho margen en los promedios BFCL v4 y tau3 reportados por la compañía. El gráfico marca las comparaciones como internas o provenientes de proveedores externos. Pokee no ha proporcionado replicación independiente del rendimiento reclamado de 10 millones de tokens ni del rendimiento por GPU única.
Los precios son inconsistentes en los materiales del lanzamiento de Pokee. El gráfico del benchmark anuncia $0.15 por millón de tokens de entrada y $1 por millón de tokens de salida. La documentación de la API, consultada el 4 de agosto, lista el nivel estándar de Pokee-Isaac en $0.30 por millón de tokens de entrada y $5 por millón de tokens de salida. Un nivel de alto razonamiento figura en $3 y $15, respectivamente.
La apuesta de Zhu por el despliegue empresarial
El modelo extiende la tesis que Zhu llevó a Pokee tras dirigir aprendizaje por refuerzo aplicado en Meta AI. Según la biografía pública de Zhu, dirigió el proyecto de producción Pearl de reinforcement learning en Meta y completó un doctorado en Stanford en aprendizaje por refuerzo mientras trabajaba a tiempo completo. Fundó Pokee en 2024 en torno a agentes que planifican y usan herramientas a través de aplicaciones en lugar de detenerse en texto generado.
Ese antecedente dio forma al producto inicial de Pokee. La compañía del área de Seattle aplica aprendizaje por refuerzo a la selección de herramientas y la secuenciación de tareas a través de servicios que incluyen Google Workspace, Slack, GitHub y Notion. En julio de 2025, GeekWire informó que Pokee había recaudado una ronda semilla de $12 millones liderada por Point72 Ventures, con participación de Qualcomm Ventures, Samsung NEXT y otros inversionistas. Pokee estaba en fase previa a ingresos en ese momento y operando una beta pública, según el informe.
La afirmación de GPU única le da a Zhu un posible argumento de ventas empresariales, pero su importancia depende de una validación independiente. Pokee ofrece acceso alojado junto con despliegues privados en la cuenta en la nube del cliente, y dice que su infraestructura de agentes puede ejecutarse on-premise o en un entorno aislado de la red. Un modelo que de verdad pueda manejar 10 millones de tokens en el hardware que Pokee menciona podría reducir la dependencia de grandes clústeres de inferencia y dar a las empresas mayor control sobre documentos sensibles y datos de flujo de trabajo.
Pokee está ofreciendo acceso a través de su API y despliegues personalizados en lugar de publicar pesos que los desarrolladores puedan inspeccionar y ejecutar de forma independiente. Por lo tanto, la compañía conserva el control sobre el modelo y su distribución, incluso cuando los clientes mantienen las cargas de trabajo dentro de sus propios límites de red.
El caso comercial ahora depende, en parte, de si desarrolladores externos pueden reproducir el rendimiento destacado bajo las condiciones reveladas. Hasta entonces, la puntuación RULER de 10 millones de tokens, la tasa de prellenado de 137,000 tokens por segundo y el despliegue en clase RTX 4090 siguen siendo resultados reportados por el proveedor.