Tokenless 在生成过程中对 LLM 请求进行路由以降低推理成本
Tokenless 创始人 Rohit Agarwal、Andrew Liu 和 Kevin W. 押注,观察多个模型开始执行一项任务胜过事先选择其中一个。
By Ryan Merket · Published
Primary source: Tokenless
Why it matters
Inference routing is becoming a valuable control point in the AI stack. Tokenless is betting that partial model output can guide routing more accurately than prompt inspection alone, while its economics depend on making that decision fast enough to offset parallel inference costs.

Rohit Agarwal, Andrew Liu and Kevin W. are building Tokenless, an LLM router that starts each request on several models, watches their early work and keeps the model that appears most likely to finish successfully. Kevin W. publicly announced Tokenless on LinkedIn in July.
旧金山的创始团队在 AI 成本上押了一个精确的注:开发者常常在不知道请求难度之前就支付前沿模型的价格。Tokenless 将自身插入应用与模型提供商之间,尝试在生成开始之后再做出决策。Tokenless 暴露与 OpenAI 和 Anthropic 兼容的端点,允许开发者重定向现有的 API 调用,而无需围绕新的接口重构他们的应用。
Agarwal 与该问题有最清晰的研究联系。他是普林斯顿的计算机科学博士生,导师是 Elad Hazan,Agarwal 的研究侧重于 AI 的数学、代理对齐和推理流水线。Agarwal 之前在 UC Berkeley 完成了电气工程与计算机科学学位,Liu 和 Kevin W. 也在那里学习过。他的已发表工作包括一个将现成模型结合用于竞赛数学的推理流水线,这在学术上对应于 Tokenless 正在商业化的同一底层问题:如何将可用模型组装成在给定成本下表现更好的系统。
在他的 LinkedIn 帖子中,Kevin W. 表示 Tokenless 将成为 Y Combinator 2026 年夏季批次的一部分。Tokenless 网站 则单独将 Tokenless 描述为受到 YC 支持。YC 表示其标准条款 向每家被接受的公司承诺 500,000 美元,分为以 7% 换取 125,000 美元以及一项无限上限的最惠国条款的 375,000 美元。
让模型先开始再选择
大多数 LLM 路由器在生成开始前会检查提示、估计其难度并将其发送到某个模型。例如,开源的 RouteLLM 框架 是一个用于服务和评估 LLM 路由器的成本与质量路由框架。
Tokenless 表示它会更晚做出选择。Tokenless 将一个请求并发发送给多个模型,观察它们的部分响应或推理轨迹,在某个模型看起来有望完成时选择该模型并取消其余模型的运行。Tokenless 将这种方法称为自动模型切换,尽管其机制更像是在模型之间进行的一场短暂的试探性竞赛。
这一区别为创始团队提供了提示式路由器所缺乏的信息。两个起初看起来相似的请求在模型尝试后可能会分道扬镳。较弱的模型在某些任务上可能很快找到可行路径,而在另一些任务上卡住。Tokenless 的目标是在还有时间终止昂贵运行时检测出这种差异。
经济效益取决于 Tokenless 多快能做出选择。每一次并行尝试都会消耗推理资源,即便 Tokenless 不把被丢弃的工作计入客户账单。通过选择更便宜模型带来的节省必须覆盖那些被取消尝试的成本、路由基础设施以及任何额外的延迟。Tokenless 也会成为请求路径中的另一个系统,其故障、提供商变更和错误选择都可能影响生产应用。
这些权衡说明了兼容层为何重要。开发者可以创建账户 并在有限的集成工作下测试 Tokenless,然后再决定节省是否值得增加另一个依赖。
基准宣称随模型变化
Tokenless 的主页说其路由器能在保持前沿质量的同时将推理账单砍掉一半。Tokenless 报告称,一种名为 PRO 的配置在 TerminalBench 2.1 上解决了 72% 的任务,单任务成本为 0.32 美元,而它列出的 Opus 4.8 在单任务 2.41 美元时的解决率也是相同的。在 LiveCodeBench 上,Tokenless 报告 PRO 的解决率为 89%,而 Opus 4.8 为 88.9%。
这些是 Tokenless 自己的基准结果。Tokenless 还展示了一个跨越 tau3-Banking、Terminal-Bench 2.1 和 DeepSWE 1.1 的不同比较,使用了更新的模型标签,并显示 Tokenless Pro 的平均解决率为 40.2%。这些不断变化的表格显示了随着提供商发布新模型和调整价格,路由产品的参考集老化速度有多快。
公开的编程和代理基准提供了受控的比较,但能否成立还要看客户流量。提示分布、缓存命中率、响应长度、延迟限制和重试行为都能显著影响账单。围绕编程代理训练的路由器在支持、信息抽取或对话工作负载上的表现也可能不同。
Tokenless 的计算器 用一个假设性客户每月在 LLM 上花费 40,000 美元来说明销售论点。在可编辑的路由假设下,Tokenless 估计账单为 26,000 美元,混合节省率为 34%,并且 42% 的请求被重路由。Tokenless 明确表示结果取决于客户的流量和已公布的模型价格。
在应用与模型提供商之间的有价值位置
Tokenless 正进入一个已经吸引大量基础设施投资的模型路由市场。OpenRouter 在 5 月 28 日宣布完成 1.13 亿美元的 B 轮融资,此前它已从模型接入扩展到质量感知路由、故障切换和企业控制。Portkey 于 2 月 19 日完成了 1,500 万美元的 A 轮融资,用于其 AI 网关和控制平面,随后 Palo Alto Networks 在 5 月 29 日完成了对 Portkey 的收购。
这种吸引力很直接。路由层可以看到应用使用了哪些模型、每个请求的成本以及故障发生的位置。这个位置可以扩展到可观测性、预算、安全策略、回退和采购。Tokenless 从更窄的承诺开始:在观察模型工作之后再选择模型。
Tokenless 在其计算器中还使用了 Ramp's AI Index,应用了 2025 年 6 月到 2026 年 6 月的 11.0% 月度 AI 支出趋势,以说明未受管理的模型成本如何复利增长。确切的节省案例将取决于工作负载组合、提供商价格以及 Tokenless 多快能阻止那些失败的运行。
这为 Tokenless 定义了初始客户:运行足够多代理流量的开发者,使得小幅的路由改进就能带来实质性节省。Agarwal、Liu 和 Kevin W. 现在需要证明,在并行竞赛消耗其设计来节省的钱之前,观察模型的第一步能否产生可靠的信号。