企业人工智能正面临评估鸿沟:智能体的自主性提升速度远超企业对其验证的能力。
企业 AI 团队正在赋予智能体更高的自主权,即便对自动化测试的信心正在下降。相当一部分企业报告称,智能体在面向客户的角色中表现失败,尽管它们通过了内部评估。许多组织允许未经人工审查即可部署到生产环境,或计划很快实施。这造成了“评估差距”,即智能体的自主权超过了保障能力。传统测试方法不足以应对具备动态决策能力的智能体。企业不信任自动化评估,因其与真实世界结果对齐不佳、存在偏差且缺乏可解释性。核心问题在于,能力并不等同于一致性或可靠性。因此,可重复性必须成为首要指标,生产环境中的事件应反馈至测试环节。自主权的扩展应基于已证明的可靠性以及失败后果。低风险操作可容忍更广泛的自主权,而高风险操作则需要更严格的阈值和人工升级路径。市场将继续青睐更高的自主权,但成功的关键在于将可重复性和回归测试置于部署速度之上。