webAI、消費者向けハードウェアでAIの推論を検証するTwiLモデルをリリース

webAIによると、同社の3Bモデルは社内の5つのテストのうち4つでgpt-oss-120bを上回ったという。一方、1.06 GBのビルドは消費者向けハードウェア上でローカルに動作する。

By · Published

Primary source: PR Newswire

Why it matters

webAI is betting that narrow, local models can become a checking layer for enterprise AI. The results remain self-reported, but the 1.06 GB build makes that thesis testable on ordinary hardware.

Illustration of webAI's TwiL models depicted as a compact model architecture running on consumer hardware, highlighting the 3B model and the 1.06 GB local build.

webAI の共同創業者であり CEO の David Stout (@Davidstout) は、2026年8月10日に一対の小さな形式論理モデルを公開し、有用なエンタープライズAIは遠隔のクラウド内ではなくプライベートなデータの近くで動作するという自身の6年間の賭けを拡張した。

TwiL-LM のリリース には、プレーンな英語を形式論理に翻訳し、前提から結論が導かれるかを判定し、複数段階の演繹を処理するよう設計された1.7 billion と3 billion パラメータのバリアントが含まれる。webAI は両モデルを Transformers と llama.cpp 向けに Hugging Face 上で webAI の非商用モデルライセンスの下で提供していると述べている。

Stout はミシガンの牧場で育ち、その後オースティンに移ったと Austin Business Journal のプロフィール にある。彼は2019年に Ethan Baird(現 Chief Research Officer)と Tyler Mauer (@TylerMauer4)(webAI の Chief Product Officer)とともに webAI を創業した。webAI は、元のチームを機密性の高い AI ワークロードはローカルで動かす必要があると結論づけたミシガン出身のエンジニアたちとして説明している。

TwiL はその創業時の見解を狭く定義された製品へと落とし込んでいる。あらゆる種類のプロンプトに答えようとするのではなく、モデルはコンプライアンス方針、契約条項、定理命題、ルールベースの意思決定の背後にある構造化されたタスクに集中する。リリース において、Stout はこのモデルを「ほとんど AI のオートコレクトのようなもの」と表現しており、他の専門化モデルの出力を検査・再構築できる推論レイヤーと説明している。

The benchmark claim

webAI の見出し比較は、3B バリアントの TwiL-LM3 を OpenAI の gpt-oss-120b と対比させている。webAI の形式推論スイートでは、TwiL-LM3 は報告された5つのテスト中4つで高スコアを出した:ルール導出、セマンティックパーシング、Lean の形式化、および正確なフォーマットでの応答。gpt-oss-120b は含意ラベリングでリードを維持し、77.5 に対して TwiL-LM3 は68.7 だった。

最大の差はセマンティックパーシングで、webAI は TwiL-LM3 を87.6、gpt-oss-120b を43.3 と測定し、また正確なフォーマットでの応答ではスコアが52.0 対7.0 だった。webAI はさらに、スループットテストで TwiL-LM3 が1秒あたり32.9回答を生成したのに対し、120B モデルは12.6 だったとも述べている。

これらの数値は webAI 独自のスイートでの性能を測ったものだ。独立した再現はされておらず、モデルカードにはこれらのテストを汎用知能の証拠として読み取るべきではないと記されている。比較はまた、アーキテクチャ、学習方法、出力制限、パラメータ数が異なるモデル同士を扱っており、これは統制されたスケーリング研究というよりは製品デモンストレーションとして有用である。

1.7B 版の詳細なモデルカードはこれらの制限について異例に率直だ。webAI は小型モデルが SmolLM2-1.7B のベースを webAI の集約形式論理スコアで0.185 から0.361 に改善したと報告している。その専門分野外では成果は混在しており、アダプタは LogicBench の性能を改善した一方で、GSM8K と2つの ARC-Challenge 評価ではベースモデルを下回った。

webAI はまた、TwiL は検証器ではないと警告している。形式表現は構文的に有効であっても論理的に誤っている可能性があるため、法務、医療、金融、または安全に重要な決定を含む展開には、記号的ソルバ、定理証明器、または人間のレビューが必要だと述べている。

A 289 MB fine-tune

小型の TwiL モデルはゼロから訓練されたのではなく、SmolLM2-1.7B-Instruct 用の LoRA アダプタとして構築された。アダプタは約72.35 million のパラメータを追加し、容量はおよそ289 MB である。webAI はアダプタがオープンソースから構築された目的設計の専有形式論理データエンジンで訓練されたと述べている。

このアプローチにより配布可能なパッケージを小さく保てた。推奨される Q4 量子化ビルドは1.06 GB で、より大きな Q5、Q8、および FP16 バージョンも記載されている。モデルは8,192 トークンのコンテキストウィンドウとローカルの llama.cpp 展開をサポートする。webAI は評価で集約生成スループットを1秒あたり366.8トークンと測定したが、モデルカードはこの数値がハードウェア、バッチ処理、プロンプト長、精度、バックエンド構成に依存すると注意を促している。

訓練コーパス自体は公開されておらず、独立した再現や汚染分析が制限される。リリース成果物は最適化器の設定、学習率スケジュール、シードデータ、訓練ハードウェア、信頼区間も欠いている。これらの省略は重要で、なぜなら TwiL の最も強力な販売論拠はベンチマーク効率に基づいており、webAI は開発者に対して、ターゲットを絞ったデータエンジンが定義された作業クラスにおいて数十億規模の汎用パラメータに代わり得ると受け入れるよう求めているからだ。

Stout's network of experts

TwiL は Stout と彼の共同創業者たちが2026年を通じて説明してきたアーキテクチャに適合する。3月の webAI プレゼンテーション で、webAI は組織がローカル知識を中心に訓練された専門化モデルのネットワークを所有すべきだと主張した。各モデルは定義されたタスクを処理し、そのネットワークはプライベートデータを課金制 API に送ることなくそれらの出力を組み合わせる。

TwiL はそのネットワークに潜在的な審判を与える。契約モデルが条項を抽出し、検索モデルが裏付け文書を見つけ、TwiL が結果を形式的なルールに変換したり、結論が導かれるかを検査したりできる。小さなフットプリントにより、その検査ステップをローカルハードウェアで継続的に実行できる点が、Stout のオートコレクトの比喩の実用的価値である。

商用利用は別途の取り決めが必要となる。webAI は重みを Non-Commercial License v1.0 の下でリリースした。ライセンスは開発者が Hugging Face 上でモデルを検査・テストすることを許可する一方、商用展開には webAI の許可を要する。その構造により、このリリースは研究成果物であると同時に webAI のプライベートAIプラットフォームへの潜在的な入口にもなっている。

Stout はこの戦略の背後に相当な資本を有している。webAI は 2024年9月時点 で6,000万ドルを調達したと述べており、その時点で Series A は webAI の評価額を7億ドルとしていた。2026年1月、webAI はさらに別のラウンドを $2.5 billion pre-money valuation で発表し、TIME Ventures、Atreides Management、Forerunner Ventures、OXCART Ventures が参加した。Axios は その資金調達が数千万台後半に達したと報じた。

その資金はまた Paul J. Maykish が率いる Intelligence Lab の設立ももたらし、TwiL に功績が帰されているグループとなっている。このリリースはその投資からの最も明確な技術的アウトプットであり、開発者が自らのルールや文書に対してベンチマークできるダウンロード可能なモデルを提供している。その価値は webAI のテストハーネス外での性能、特に形式論理が長文契約、不完全な方針、矛盾する現実世界のデータに直面したときにどう機能するかに依存するだろう。

Reader comments

Conversation for this story loads after sign-in.