webAI 发布 TwiL 模型以在消费者硬件上检查 AI 推理
webAI 表示,其 3B 模型在五项内部测试中有四项击败了 gpt-oss-120b,而一个 1.06 GB 的构建可以在消费级硬件上本地运行。
By Ryan Merket · Published
Primary source: PR Newswire
Why it matters
webAI is betting that narrow, local models can become a checking layer for enterprise AI. The results remain self-reported, but the 1.06 GB build makes that thesis testable on ordinary hardware.

webAI 的联合创始人兼首席执行官 David Stout (@Davidstout) 于 8 月 10 日发布了一对小型形式逻辑模型,延续了他六年来的赌注:有用的企业级 AI 应该在私有数据附近运行,而不是在遥远的云端。
TwiL-LM release 包括 17 亿参数和 30 亿参数的变体,旨在将普通英语翻译为形式逻辑、判断结论是否从前提出发并处理多步推理。webAI 表示两者均可通过 Hugging Face 以 Transformers 和 llama.cpp 使用,受 webAI 的非商业模型许可约束。
根据一篇 Austin Business Journal 的人物报道,Stout 在密歇根的一个牧场长大,后搬到奥斯汀。他于 2019 年与 Ethan Baird(现任首席研究官)和 Tyler Mauer (@TylerMauer4)(webAI 的首席产品官)共同创立了 webAI。webAI 将原始团队描述为一群密歇根工程师,他们得出结论:敏感的 AI 工作负载需要在本地运行。
TwiL 将这一创始观念转化为一个定义明确的产品。这些模型并不试图回答所有类型的提示,而是集中于合规策略、合同条款、定理陈述和基于规则的决策背后的结构化任务。在该发布中,Stout 将该模型描述为“几乎像 AI 的自动校正”,是一个可以检查并重构其他专业模型输出的推理层。
基准测试声明
webAI 的头条比较将 TwiL-LM3(3B 变体)与 OpenAI 的 gpt-oss-120b 进行对比。在 webAI 的形式推理套件中,TwiL-LM3 在报告的五项测试中有四项得分更高:规则归纳、语义解析、Lean 形式化和精确格式回答。gpt-oss-120b 在蕴涵标注上保持领先,得分为 77.5,而 TwiL-LM3 为 68.7。
报告中差距最大的项目出现在语义解析,webAI 测得 TwiL-LM3 为 87.6,gpt-oss-120b 为 43.3;以及精确格式回答,得分分别为 52.0 和 7.0。webAI 还表示在吞吐量测试中 TwiL-LM3 的产出为每秒 32.9 个答案,而 120B 模型为 12.6。
这些数字衡量的是 webAI 自己的测试套件上的表现。它们尚未被独立复现,模型卡也说明这些测试不应被解读为通用智能的证据。比较还涵盖了具有不同架构、训练方法、输出限制和参数数量的模型,因此它更适合作为产品演示,而不是受控的规模研究。
1.7B 版本的详细模型卡对这些限制表述得相当直接。webAI 报告称,较小的模型将其 SmolLM2-1.7B 基础从 0.185 提升到 webAI 的聚合形式逻辑得分 0.361。在该专长之外,提升是混合的:该 adapter 提升了 LogicBench 表现,但在 GSM8K 和两次 ARC-Challenge 评估中得分低于基础模型。
webAI 还警告称 TwiL 并非一个验证器。形式表达仍可能在语法上有效但逻辑上错误,因此涉及法律、医疗、金融或安全关键决策的部署需要符号求解器、定理证明器或人工审查。
一个 289 MB 的微调
较小的 TwiL 模型是为 SmolLM2-1.7B-Instruct 构建的 LoRA adapter,而不是从头训练的。该 adapter 增加了大约 72.35M 个参数,占用约 289 MB。webAI 表示,该 adapter 在一个由开源构建的、为目的工程化的专有形式逻辑数据引擎上训练。
这种方法使可部署的软件包保持小巧。推荐的 Q4 量化构建为 1.06 GB,同时还列出了更大的 Q5、Q8 和 FP16 版本。该模型支持 8,192-token 的上下文窗口,并支持本地 llama.cpp 部署。webAI 在其评估中测得聚合生成吞吐量为每秒 366.8 个 token,尽管模型卡提醒该数字取决于硬件、批处理、提示长度、精度和后端配置。
训练语料本身并未公开,限制了独立复现和污染分析。发布工件也缺少优化器设置、学习率调度、种子数据、训练硬件和置信区间。这些遗漏很重要,因为 TwiL 最有力的销售论点依赖于基准效率:webAI 要求开发者接受一个针对性的数 据引擎可以在一类已定义工作的场景下替代数十亿个通用参数。
Stout 的专家网络
TwiL 符合 Stout 和其联合创始人在 2026 年贯穿始终所描述的架构。在一次 3 月的 webAI 演示 中,webAI 主张组织应该拥有围绕本地知识训练的专业模型网络。每个模型处理一个定义好的任务,网络将这些输出结合起来,而无需将私有数据发送到计量 API。
TwiL 为该网络提供了一个潜在的裁判。合同模型可以提取条款,检索模型可以查找支持文档,而 TwiL 可以将结果转换为形式规则或测试某一结论是否成立。较小的占用允许该校验步骤在本地硬件上持续运行,这也是 Stout 所说“自动校正”类比背后的实际价值。
商业使用将需要单独安排,因为 webAI 在其 Non-Commercial License v1.0 下发布了权重。该许可允许开发者在 Hugging Face 上检查和测试模型,而商业部署需要 webAI 的许可。该结构使得此次发布既是一个研究成果,也是通往 webAI 私有 AI 平台的潜在切入点。
Stout 在该策略背后拥有可观的资本。webAI 表示在 2024 年 9 月 前已累计融资 6000 万美元,其 A 轮估值为 7 亿美元。2026 年 1 月,webAI 宣布了另一轮融资,估值为 25 亿美元(投前),TIME Ventures、Atreides Management、Forerunner Ventures 和 OXCART Ventures 参与其中。Axios 报道 表示该轮融资总额为高双位数百万美元。
这笔资金还建立了由 Paul J. Maykish 领导的 Intelligence Lab,该小组被认为负责 TwiL。该发布是该投资迄今为止最清晰的技术产出:一个可下载的模型,开发者可以针对自己的规则和文档进行基准测试。其价值将取决于在 webAI 测试套件之外的表现,尤其是在形式逻辑遇到长合同、不完整政策和不一致的现实世界数据时。