TestMu AI 推出 Agent Assurance,通过评估其影响来测试 AI 代理

前 LambdaTest 正在将其质量保证技术栈扩展到可以写入文件、调用工具和访问 API 的代理。

By · Published

Primary source: PR Newswire

Why it matters

AI agents can produce convincing transcripts while taking the wrong action. TestMu AI is trying to make observable system changes and criteria it cannot verify part of the release decision.

TestMu AI's Agent Assurance interface on a vast digital network, displaying a diff view of an AI agent's changes to code, files, and API calls.

TestMu AI, 由 Asad Khan、Jay Singh 和 Mayank Bhola 创立,已推出 Agent Assurance,将其软件测试平台扩展到可以更改文件、调用工具、访问 API 并打开拉取请求的 AI 代理。

这一new product 评估代理工作的可观测影响。TestMu AI 表示它会读取代理的代码库,生成功能性、非功能性和对抗性场景,运行代理并检查生成的文件、工件和工具调用。这使测试从代理的最终回答或其自述活动,转向其实际触及的系统。

对于 Khan 来说,此次发布将 TestMu AI 带入他职业生涯开始的领域更深处。TestMu AI 的简介称他曾在 GlobalLogic 担任首席工程师,随后联合创办了软件测试服务公司 360logica,该公司后来被 Saksoft 收购。Khan 和 Singh 于 2017 年创立了 LambdaTest,作为一个在不同浏览器、操作系统和设备上运行网络和移动测试的云服务。

TestMu AI 的联合创始人兼产品负责人 Bhola 此前在 Zomato、PressPlay TV 和 Juggernaut Books 担任产品与工程相关职务。Singh 带来了销售和客户端经验,曾创办 BusinessMojos 和 VisualMojos,并在 LeadSquared 和 Harman International 任职。

这种组合解释了产品的方向。TestMu AI 正在将熟悉的质量保证实践(包括回归测试、冒烟测试、CI 门控和证据保留)应用于那些行为可能在运行间发生变化且其失败后果可能超出聊天窗口的代理。

一个对系统无法验证之处的第三种裁决

Agent Assurance 最有用的部分可能是它对缺失证据的处理。

TestMu AI 的发布材料将验证标准分配为三种结果之一:通过、失败或无法验证,并将结果中未验证的部分描述为保证差距。该差距不计入通过率,并可以通过提高代理的可观测性来缩小。

这种区分很重要,因为代理可能看起来成功,但却几乎没有留下发生了什么的证据。测试工具可能只看到了最终响应,却无法确定正确的文件是否被更改、是否调用了经过批准的 API,或是否使用了未声明的工具。将某一标准标记为“无法验证”可以让这种不确定性保持可见,而不是将其视为通过。

“代理讲述自己所做事情的故事,是关于其行为可获得的最弱证据,”TestMu AI 集团工程高级副总裁 Vipul Verma 在发布公告中表示。

“无法验证”的结果也为 TestMu AI 的主张设定了一个限制。它表明测试系统缺乏足够证据以确认某项标准。它并不证明代理在生产环境中是安全的,且 TestMu AI 尚未公布将其验证结果与更少的安全事件或运行故障相关联的独立数据。更有力的证据需要来自对在真实企业系统中运行的代理进行的测试。

从需求到 CI 流水线

TestMu AI 文档化的代理测试工作流始于代理 API 端点和需求材料,例如提示、产品需求文档、知识库、PDF 或 DOCX 文件。该平台使用这些材料来生成测试场景。发布公告称,团队可以通过命令、HTTP 端点、MCP 服务器或基于如 n8n 这样平台构建的工作流来调用代理。

公告称,生成的场景默认包括提示注入、指令覆盖和工具误用。TestMu AI 还表示其报告区分新出现的失败、新修复的问题和不稳定(flaky)的场景。发布稿称其 CI 命令能将代理失败与环境失败区分开来。

这是有意进军已由评估与可观测性产品覆盖的领域。例如,LangSmith 支持预部署和生产评估、回归测试以及对代理轨迹和工具调用的评估。

TestMu AI 提出的区别在于证据层。发布公告称 Agent Assurance 会将文件、工件和工具调用与代理声明的工具接口进行核对,同时其产品资料会标记出无法确认的验证标准。这些主张目前基于 TestMu AI 的产品资料;发布中没有包含任何客户案例研究、比较测试或对该自治代理系统的独立审计。

LambdaTest 的改名开始兑现其名称

Agent Assurance 紧随 LambdaTest 在 1 月 12 日作为 rebrand as TestMu AI。这一更名承诺公司从浏览器与设备测试向一个以 AI 为原生的质量平台转变,在该平台上代理会规划、编写、执行并分析测试。

创始人在更名前就为这一扩张提供了资金。2024 年 12 月,LambdaTest 在由 Avataar Venture Partners 领投的一轮融资中筹集了 3800 万美元,Qualcomm Ventures 和现有投资者也参与其中。Singh 告诉 Moneycontrol,这笔资金将用于资助 AI 产品线的工程和研究。TestMu AI 提到的早期投资者还包括 Peak XV、Premji Invest、Blume Ventures 和 Titanium Ventures。

最初的跨浏览器服务为公司下一步行动提供了已安装的用户基础。TestMu AI 表示其全球拥有超过 300 万用户。该公司报告的数据覆盖更广泛的平台,并不证明 Agent Assurance 的采用情况。

TestMu AI 表示其会话代理类别可用于聊天、语音、电话、图像和视频。其视频代理测试产品 会将一个模拟人物放入实时视频会话,并将每个裁决与录制中的相关时刻关联。发布公告称自治代理测试通过名为 Rook 的终端工具运行,模型通过 TestMu AI 的控制器操作,因此开发者无需本地提供商密钥。

创始团队押注他们为浏览器和移动设备构建的测试层可以成为对自主行动软件的控制点。Agent Assurance 为这一赌注提供了一个可信的组织理念:通过的标准应具有可观测的证据,而系统无法确认的标准应保持明显标记。当团队将其指向能够更改真实企业系统的代理时,艰难的工作才刚刚开始。

Reader comments

Conversation for this story loads after sign-in.