Deltix、AIによるアプリ探索と再実行可能なiOS回帰テストを組み合わせる
そのMac用エージェントはアプリのバイナリをローカルに保持する一方で、スクリーンショットとインターフェースデータは依然としてDeltixのクラウドおよびAnthropicに送信される。
By RuntimeWire Staff · Published
Primary source: Deltix
Why it matters
Deltix is testing whether AI can discover a mobile flow once, then convert it into a repeatable regression check without sending the app binary to a testing cloud.

Deltixは、iOS開発者向けに、ローカルで動作するシミュレータ内で平易な英語のタスクを実行し、成功や行き詰まりを記録し、成功した実行を再利用可能な回帰チェックに変換するAIテストエージェントを提供している。
このオープンベータ製品はDeltixの構築者たちの明確な賭けを反映している:探索的な作業を従来のテストとして保存できるようになると、AIテスターはより有用になる。開発者はエージェントに「サインアップして最初のメッセージを送る」と頼み、インターフェイスをナビゲートする様子を見て、完了した経路を後のビルドのためにPlaybookとして保存できる。
Deltixは意図的に制約されたセットアップから始めている。開発者はネイティブのMac Agentをインストールし、マシン上で既に実行中のiOS Simulatorに接続し、Deltixを通じてタスクを送信する。アプリのバイナリ、ソースコード、および署名情報はローカルにとどまる。エージェントは出会ったインターフェイスに基づいて操作を行うため、開発者は初めてのユーザーが見慣れないフローをどのように進むかを把握できる。
このアプローチは、Deltixにモバイルテストへの実用的な入口を与える。当面の製品は品質保証スタックのすべての層を置き換えようとはしていない。フォーカスしているのは、しばしばユニットテストがすべて通っている(グリーンの)状態でも残る問いである:ユーザーはその製品がサポートするよう設計されたタスクを実行できるか?
探索をテストに変える
Deltixは製品を3つのモードで構成している。Taskは一回限りの探索を処理する。Playbookは成功した経路を保存して繰り返す。Experimentは同じタスクを2つのビルドで実行し、提案されたインターフェイスがエージェントの完了を助けるか妨げるかを比較できるようにする。
探索から再生へのシーケンスが重要な設計上の選択だ。エージェント的なテストはインターフェイスに適応し、開発者が明示的にスクリプト化していなかったルートに遭遇することがある。一方で回帰テストは別の要件を持つ:チームは、失敗がモデルの判断の変化ではなく製品の変更を指すような、再現可能なチェックを必要とする。
Deltixは、探索で成功した実行は後続のビルドで同じ相互作用とターゲットを使う決定論的なPlaybookになると述べている。それはXCUITestスイートに伴うロケータやアサーションのメンテナンスの一部を取り除く可能性がある。Deltixはランディングページ上で比較信頼性データを公開していないため、この主張は最終的にレイアウト、ラベル、タイミング、およびモデル依存が変わった後のPlaybooksの振る舞いによって判断されるだろう。
Deltixのベータ規約はより慎重な境界を設定している。それらは検証結果が助言的なものであり、正確、完全、または実行ごとに安定していることは保証されないと述べている。また、偽陽性および偽陰性に対する責任は開発者にあると規定している。魅力的なアーキテクチャは確率的な探索と固定された再生経路を分離している;Deltixはその分離を十分に明確にして、どの結果がリリースプロセスで信頼できるかを開発者が理解できるようにする必要があるだろう。
ローカル実行でもインターフェイスデータはクラウドへ送信される
Deltixのローカルエージェントモデルは、新しいテストサービスを試す際の大きなコストの一つを制限する:開発者はビルドやソースリポジトリをアップロードする必要がない。ただしプライバシーの境界は完全なローカルテストよりも狭い。
Deltixのプライバシー通知によれば、スクリーンショット、アクセシビリティツリーのキャプチャ、アクションの説明、および実行メタデータはMacを離れる。これらの情報はDeltixのクラウドインフラとAnthropic's Claude APIを通じてナビゲーション、スコアリング、自己修復のために処理される。発見事項、保存されたPlaybooks、および実行データはDeltixのデータベースに保存される。
区別は重要だ。テスト画面は、基になっているバイナリが開発者のラップトップを離れない場合でも、認証情報、顧客記録、健康情報、内部製品の詳細を露呈する可能性がある。Deltixはユーザーに対してテスト環境を利用し、本番の顧客データ、認証情報、保護された健康情報、教育記録、および13歳未満の子どもに関わるデータを避けるよう指示している。
Deltixによれば、開発者は独自のモデルキーを提供できるが、公開資料は完全にオフラインで推論するモードを説明していない。したがってローカルエージェントは、完全にデバイス上で完結するテストシステムというよりは、クラウド支援の推論を伴うローカル実行として理解するのが最適だ。
Deltixの公開ページは異なるアクセスルールも説明している。ランディングページは招待不要のオープンベータとして製品を紹介している。だがプライバシー通知とベータ規約(いずれも2026年5月6日付)は、米国とカナダを中心とした招待制ベータを説明している。この不一致はベータの拡張を反映している可能性があるが、現在の法的記述は誰がサインアップできるかについて潜在的な参加者に矛盾する説明を与えている。
混み合ったテスト分野での狭い切り口
Deltixは、自然言語によるテスト作成と自己修復的な実行がすでに標準の売り文句になりつつある市場に参入している。Momenticはウェブ、iOS、Androidに跨るテストを文書化しており、ローカルおよびリモート実行とCIサポートを提供している。QualGentはクラウド上の実機iOSおよびAndroidデバイスで自然言語テストを実行する。Waldoは手動のモバイル探索とリモートインフラ上での自動テストを組み合わせている。
Deltixの初期製品はより小さな範囲だ。現時点ではMac上のiOS Simulatorをサポートしている。実機のiPhoneテストは進行中とされており、Android、継続的インテグレーション用のコマンドラインインターフェイス、React NativeおよびFlutterのサポートはロードマップ上に残っている。
その狭さがDeltixに整合性のあるベータを与えている。Mac Agentはセットアップを簡素化し、最も機密性の高いソフトウェアアーティファクトを開発者のマシンに保持する。探索からPlaybookへのワークフローは、各エージェント実行に、開発者を別の動画と観察リストだけに残すのではなく、再現可能なエンジニアリングプロセスへの経路を与える。
製品の次の試験は信頼性だ。Deltixは、ビルドが正当な理由で変わってもPlaybookが有用であり続けること、ユーザージャーニーが壊れたときに回帰を検出すること、そしてエンジニアが原因を診断できる十分に明確な失敗を示すことを示さなければならない。Deltixがその基準を満たせれば、そのエージェントは非公式な製品テストと、ソフトウェアが出荷準備ができているかを判断するためにチームが既に使用している自動チェックとの橋渡しとなる。