首页 > 财商 > 正文

TestMu AI 推出 Agent Assurance,验证 AI 智能体能否安全上线

2026-08-19 21:58:00 来源:TestMu AI (Formerly LambdaTest)

新产品覆盖面向客户的对话式智能体和执行系统操作的自主智能体,可直接基于代码生成测试场景,依据实际证据评估每项操作,并量化呈现所有未能验证的“验证缺口”

旧金山和印度诺伊达2026年8月19日 美通社 -- 全球首个 Agentic AI 原生质量工程平台 TestMu AI(前身为 LambdaTest)今日宣布推出 Agent Assurance,旨在回答当前每个准备上线 AI 智能体的工程团队都面临的关键问题:该智能体能否安全上线?Agent Assurance 通过单一产品同时覆盖两类智能体:对话式智能体用于评估通过聊天、语音、电话、视频和图像与用户互动的智能体;全新推出的自主智能体则用于验证能够操作系统的智能体,包括:调用工具、写入文件、调用 API 以及创建拉取请求。

目前,大多数团队在测试自主智能体时,主要依据智能体对自身行为的陈述:例如操作记录,或评审模型根据其最终回复给出的评分。Agent Assurance 则侧重评估智能体实际执行操作后产生的结果。接入代码库后,Agent Assurance 会识别智能体的功能,自动生成一套端到端测试套件,涵盖功能测试、非功能测试和对抗性场景。随后,系统会实际调用智能体,并依据观测到的证据逐项评估。相关证据包括:磁盘上发生变更的文件、生成的输出产物,以及根据智能体所声明的可用工具范围核验的工具调用记录。

除“通过”和“未通过”外,Agent Assurance 还会给出第三种判定无法验证。此类结果不计入通过率,而是以验证缺口这一数值单独呈现。报告中的每项结论均有实际观测证据作为依据。由于验证缺口反映了智能体记录自身操作的完整程度,团队可以通过提升智能体的可观测性来缩小这一缺口。

“工程团队正在风险最高的环节不断积累验证债务。智能体对自身行为的陈述,是用于判断其实际行为的最薄弱证据,因为它本身正是最有可能出错的一方。”TestMu AI 集团工程高级副总裁 Vipul Verma 表示。“当前该领域的所有工具都会报告通过率。Agent Assurance 不仅给出通过率,还会说明自身的盲区有多大。只有同时呈现二者,这一数字才足以赢得团队的信任,并支持其据此推进上线。”

借助 Agent Assurance,团队能够:

  • 无需编写测试用例即可开展测试测试套件直接从代码库自动生成,从而实现智能体自动化测试。团队只需提供智能体的调用方式,例如命令、HTTP 端点、MCP 服务器,或基于 n8n 等平台构建的工作流。
  • 默认覆盖对抗性场景提示词注入、工具滥用和指令覆盖等场景将作为核心测试类别自动生成,而非作为附加功能提供。
  • 在 CI 流程中设置发布门禁在每条流水线中持续测试智能体,覆盖从每次代码提交时的智能体冒烟测试,到正式发布前的完整测试;支持无界面运行的命令及退出码,可明确区分“智能体执行错误”与“测试框架无法完成测试”。
  • 可靠追踪变更智能体回归测试会对比不同运行批次之间的差异,分别呈现新增失败项、新修复项和不稳定结果,因为测试不稳定与功能回归需要采取截然不同的处理方式。

对话式智能体类别也正在扩展至软件与用户交互的最新场景:出现在镜头中的智能体。借助平台全新的 Video Agent Testing(Link功能,一名具有逼真面容和声音的虚拟用户将加入视频智能体的实时会话,与其展开自然对话,并按照团队设定的成功标准对智能体进行评估。每项判定均可追溯至录像中支持该结论的具体时刻。任何无法通过录像核实的项目都会被判定为未达标。对于以录像作为证据的测试类别而言,这是一项严格标准:凡评估者未能观察到的表现,视频智能体均不会得分。

对话式智能体类别现已在 TestMu AI 平台正式开放使用。自主智能体类别目前处于早期访问阶段,可通过终端使用 rook 运行。相关模型由 TestMu AI 控制器执行,因此本地无需配置任何模型供应商的 API 密钥。如需开始使用,请访问 Link