代理评估差距:企业 AI 组织面临的是现实对齐问题,而非覆盖问题——而大多数组织仍在向生产环境交付。
组织正日益赋予 AI 代理更高的自主权,却对旨在管控该自主权的评估体系逐渐失去信任。显著地,50% 的企业已部署了通过内部评估但在生产环境中未能满足客户需求的 AI 代理。目前,仅有微薄的 5% 组织完全信任其自动化评估流程。主要识别出的弱点在于,这些评估无法准确反映现实世界的结果。尽管如此,仍有约三分之二的企业已允许或正在开发系统,仅凭自动化评估(无需人工监督)便将代理变更直接部署至生产环境。这种差异形成了“评估差距”,意指授予代理的自主权与用于监控它们的测试所获得的不足信任之间的落差。该研究考察了领导者如何衡量代理性能、所采用的平台,以及允许无监督代理运行的意愿。一半的组织曾遭遇通过内部检查但在面向客户时失败的代理事件,其中四分之一经历了多次此类情况。仅 5% 的组织完全信任自动化评估,主要原因在于其与现实结果的对齐度较差。然而,66% 的组织正转向或已允许零人工介入(zero-human-in-the-loop)的代理部署。评估与可靠性工具生态呈现碎片化特征,其中供应商原生工具和“无专用工具”最为常见。此外,仅约四分之一的企业对实时生产流量进行质量检查,导致在监控代理输出正确性方面存在显著盲区。企业在选择评估工具时主要基于成本与集成能力,一致性被视为成功的关键指标。未来预计将在人工监督及 AI 代理可观测性方面增加投资。