TestMu AI、Agent Assuranceを立ち上げ、AIエージェントをその影響でテスト

かつての LambdaTest は、ファイルを書き、ツールを呼び出し、API にアクセスするエージェントに対して、その品質保証スタックを拡張している。

By · Published

Primary source: PR Newswire

Why it matters

AI agents can produce convincing transcripts while taking the wrong action. TestMu AI is trying to make observable system changes and criteria it cannot verify part of the release decision.

TestMu AI's Agent Assurance interface on a vast digital network, displaying a diff view of an AI agent's changes to code, files, and API calls.

TestMu AI、Asad Khan、Jay Singh、Mayank Bhola によって設立された同社は、ファイルの変更、ツールの呼び出し、API へのアクセス、プルリクエストの作成ができる AI エージェント向けにソフトウェアテストプラットフォームを拡張する Agent Assurance を立ち上げた。

新製品 はエージェントの作業の観察可能な影響を評価する。TestMu AI によれば、エージェントのコードベースを読み取り、機能的、非機能的、敵対的なシナリオを生成し、エージェントを実行して結果として生じたファイル、アーティファクト、ツール呼び出しをチェックするという。これは、エージェントの最終回答や自己申告の活動からテストを離し、実際に触れたシステムに向ける動きだ。

Khan にとって、この発表は彼がキャリアを開始した分野への深い進出を意味する。TestMu AI の経歴によれば、彼は GlobalLogic でリードエンジニアを務め、その後ソフトウェアテストのサービス企業 360logica を共同設立し、同社は後に Saksoft に買収された。Khan と Singh は 2017 年に LambdaTest を立ち上げ、異なるブラウザ、OS、デバイスでの Web とモバイルテストを実行するクラウドサービスを提供した。

TestMu AI の共同創業者でプロダクト責任者の Bhola は、以前 Zomato、PressPlay TV、Juggernaut Books でプロダクトおよびエンジニアリングの役割を務めていた。Singh はセールスと顧客面を担い、BusinessMojos と VisualMojos を創業し、LeadSquared や Harman International での経験を持つ。

そのような人材構成が製品の方向性を説明している。TestMu AI は、リグレッションテスト、スモークテスト、CI ゲート、証拠の保持など、馴染みある品質保証の手法を、実行ごとに振る舞いが変わり得て、チャットウィンドウの外まで障害が広がり得るエージェントに適用している。

システムが検証できないものに対する第三の判定

Agent Assurance の最も有用な部分は、欠落した証拠への扱いかもしれない。

TestMu AI の発表資料は検証基準に対して 3 つの結果のいずれかを割り当てる:Pass、Fail、Unable to Verify、そして検証できなかった部分を assurance gap(保証のギャップ)と説明している。そのギャップは合格率から除外され、エージェントをより観察可能にすることで縮小できる。

この区別は重要だ。というのも、エージェントは成功しているように見えても、何が起きたかの証拠がほとんど残らない場合があるからだ。テストハーネスは最終の応答を目にしても、正しいファイルが変更されたか、承認された API が呼ばれたか、未申告のツールが使われたかを確立できないことがある。ある基準を Unable to Verify とマークすることは、その不確かさを可視化したままにし、それを合格として扱うことを避ける。

「エージェントが自身の行ったことについて語る物語は、その行動に関する最も弱い証拠だ」と TestMu AI の senior vice president of group engineering、Vipul Verma は発表文で述べている。

Unable to Verify の結果はまた、TestMu AI の主張に対する限界を示す。これはテストシステムに基準を確認するのに十分な証拠が欠けていたことを示すものであり、エージェントが本番環境で安全であることを確立するものではない。TestMu AI は自身の検証結果とセキュリティ事故や運用障害の減少を結びつける独立した結果を公表していない。より強固な証拠は、実際の企業システムを横断して動作するエージェントに対するテストから得られる必要がある。

要件から CI パイプラインへ

TestMu AI が文書化したエージェントテストのワークフローは、エージェントの API エンドポイントと、プロンプト、製品要件ドキュメント、ナレッジベース、PDF や DOCX ファイルといった要件資料から始まる。プラットフォームはこれらの資料を用いてテストシナリオを生成する。発表によれば、チームはコマンド、HTTP エンドポイント、MCP サーバー、あるいは n8n のようなプラットフォーム上で構築されたワークフローを通じてエージェントを呼び出せるという。

発表によると、生成されるシナリオにはデフォルトでプロンプトインジェクション、指示の上書き、ツールの誤用が含まれる。TestMu AI はまた、レポートが新たに失敗したシナリオ、新たに修正されたシナリオ、フレーク(不安定)なシナリオを区別すると述べている。発表資料は、CI コマンドがエージェントの失敗と環境の失敗を区別すると述べている。

これは評価や可観測性製品が既に提供している領域への意図的な進出だ。たとえば LangSmith は、プレデプロイと本番での評価、リグレッションテスト、エージェントの軌跡とツール呼び出しの評価をサポートしている。

TestMu AI の提案する差異は「証拠レイヤー」にある。発表は Agent Assurance がファイル、アーティファクト、ツール呼び出しをエージェントの宣言したツールインターフェースに対してチェックし、製品資料は確認できない検証基準をフラグ付けすると述べている。これらの主張はいまのところ TestMu AI の製品資料に基づいており、ローンチには自律エージェントシステムの顧客事例、比較テスト、独立監査は含まれていない。

LambdaTest のリブランドが名前に相応しい動きに

Agent Assurance は 1 月 12 日の LambdaTest の rebrand as TestMu AI に続くものだ。リネームは、ブラウザとデバイスのテストから、エージェントがテストを計画、作成、実行、分析する AI ネイティブな品質プラットフォームへのシフトを約束していた。

創業者らはリブランド前にその拡張を資金面で支えた。2024 年 12 月、LambdaTest は Avataar Venture Partners が主導し Qualcomm Ventures や既存投資家が参加したラウンドで $38 million を調達した。Singh は Moneycontrol に対し、その資本が AI 製品ラインのためのエンジニアリングと研究に充てられると述べていた。TestMu AI が名を挙げる以前の支援者には Peak XV、Premji Invest、Blume Ventures、Titanium Ventures が含まれる。

元々のクロスブラウザサービスは同社に次の一手のための導入基盤を与えた。TestMu AI は more than 3 million users globally を擁すると述べている。この同社発表の数値はより広いプラットフォームを対象としており、Agent Assurance の採用を立証するものではない。

TestMu AI は会話型エージェントのカテゴリーがチャット、音声、電話、画像、ビデオに対応していると述べている。 同社の video-agent testing product は、ライブビデオセッションにシミュレートされた人物を配置し、各判定を録画の該当する瞬間に結びつける。発表は、自律エージェントのテストは Rook というターミナルツールから実行され、モデルは TestMu AI の controller を通じて動作するため、開発者がローカルのプロバイダキーを必要としないと述べている。

創業者らは、ブラウザとモバイルデバイス向けに構築したテスト層が、自律的に動作するソフトウェアの制御点になり得ると賭けている。Agent Assurance はその賭けに説得力ある整理された発想を与える:合格基準は観察可能な証拠を伴うべきであり、システムが確認できない基準は明確にマークされたままであるべきだ。困難な仕事は、チームがこれを実際の企業システムを変更し得るエージェントに適用し始めたときに始まる。

Reader comments

Conversation for this story loads after sign-in.