Inco AI 发布 DFlash 2,报告接受的 token 序列长度增加了 21%
Inco AI 在 DFlash 2 中添加了路径选择器和局部卷积,报告称被接受的草稿长度增加了 21%,同时带来 1.3% 的额外周期延迟。
By RuntimeWire Staff · Published
Primary source: Inco AI
Why it matters
Agent workloads multiply token demand and serving costs. If Inco AI's gains hold across production stacks, DFlash 2 can reduce target-model passes without changing model output.

Zhijian Liu 是与 UC San Diego 相关的学术作者,他参与了 DFlash —— 一种并行推测解码方法,Inco AI 在 8 月 18 日发布了该方法的更新版本。DFlash 2 添加了两个小组件,旨在从每次代价高昂的 LLM 验证过程中获得更多被接受的标记。
Inco AI 报告称,与原始 DFlash 相比,平均接受长度提高了 21%。其发布的 Qwen 基准在 GSM8K 上使用了五层 Qwen3-4B DFlash 模型。为报告中的增益负责的路径选择器和卷积在 Inco AI 的测试中使起草-验证循环延迟增加了 1.3%。Inco AI 表示最终输出保持不变,因为更大的目标模型仍然会验证每个被提出的标记。
DFlash 论文在作者中列出了 Liu 以及与 UC San Diego 有关的作者 Jian Chen 和 Yesheng Liang。该论文于二月提交到 arXiv。他们的核心做法是将起草阶段并行化,用一次前向生成的整块提议替换小模型逐标记的猜测。
Inco AI 正在围绕 DFlash 方法构建其第一个面向公众的产品。Inco AI 将 DFlash 2 描述为为 agent 工作负载构建的端到端推理栈的第一块,其中单个任务可能运行数小时,并生成远多于传统聊天会话的标记量。
并行起草学会“读”自己的猜测
推测解码使用较小的模型来提出若干未来标记,然后让更大的目标模型一起检验它们。被接受的猜测可以节省前向计算。被拒绝的猜测则被丢弃,从而保留目标模型的输出。
大多数推测解码系统仍然按顺序生成草稿。DFlash 在每个位置并行提出候选,这消除了该起草循环,但也带来了不同的问题:独立上看合理的标记放在一起时可能构成一段糟糕的序列。
DFlash 2 增加了一个路径选择器,在每个位置保留前 16 个候选项,对相邻标记对进行评分,并遍历这些预计算评分以选择连贯的序列。Inco AI 表示该选择器增加了 200 万参数和 0.6% 的循环延迟。在 Inco AI 的 Qwen3-4B 测试中,它生成的被接受草稿比使用 DSpark 校正模块的结果更长,同时使用的参数大约少 40 倍。
第二项改进针对 Inco AI 所称的后缀衰减。原始起草器在提议块的末尾附近变得不那么准确,从而减少了通过验证的标记数。DFlash 2 在每个注意力和前馈子层周围插入了一个局部两抽头卷积,允许每个位置与其紧邻的前一位置混合信息,同时保留并行计算。
Inco AI 表示该卷积增加了 1650 万参数,约占五层起草器的 3%,并增加了 0.7% 的循环延迟。Inco AI 的实验发现,这个小的局部操作恢复了通过将起草器从五层扩展到 15 层所获得的大部分块尾准确性,而后者带来了 15.2% 的延迟代价。
在 Inco AI 的基准套件中,路径选择器和卷积使平均接受长度比 DFlash 提高了 21%,各项增益范围为 16% 到 25%。附加的起草-验证循环延迟为 1.3%。
这些是 Inco AI 的基准结果,报道的吞吐量指标取决于模型、任务、采样设置、硬件和并发。在新发布的 Qwen3.8-27B drafter 上,Inco AI 报告称在 SGLang、批大小为 1 时,其吞吐量为自回归解码的 2.7 倍到 3.4 倍。其 Muse Glimmer drafter 在 Inco AI 的测试中实现了 3.1 倍到 4.6 倍的吞吐量。
集成在做“销售”工作
原始的 open-source DFlash repository 在 SGLang、vLLM、TensorRT-LLM 和 llama.cpp 中受到支持。DFlash 2 的发布包含了 SGLang、vLLM、llama.cpp 的配置以及一个面向 Apple Silicon 的 oMLX 构建。
独立硬件厂商也测试了首个 DFlash。NVIDIA 报告 在相同交互性目标下,八卡 Blackwell 系统上对 gpt-oss-120b 的吞吐量最高提高了 15 倍。Google 报告 在 TPU v5p 上对一个独立的 JAX DFlash 基准的平均加速为 3.13 倍。其 vLLM TPU-pipeline 比较显示相对于自回归解码端到端加速了 2.29 倍。这些结果在不同加速器上验证了原始架构,但并不能独立证实 DFlash 2 所宣称的 21% 接受长度提升。
CoreWeave 默认在其 Kimi K2.7 Code 端点使用 DFlash,而 Inco AI 表示 NVIDIA、Red Hat、Modal、Meta、Poolside 和 Xiaomi 已发布或交付了兼容的起草器。Inco AI 还报告称 DFlash 模型在 Hugging Face 上的下载量在 2026 年 8 月已超过 350 万次。
DFlash 通过开发者已在使用的推理引擎和模型仓库进行分发,这为 Inco AI 提供了一条进入现有服务栈的路径,同时其围绕该方法构建更广泛的推理产品。
时机与工作负载相符。那些会规划、调用工具并修改输出的 agent 将推理效率变成了一项运营开支,而非仅仅是响应性特征。每增加一个被接受的标记,就减少了完成任务所需的完整目标模型前向次数。DFlash 2 试图通过改进并行起草器来降低这一成本,同时保留目标模型的验证步骤。