LangChain、Conviva 和 CoreWeave ... 笔记

LangChain、Conviva 和 CoreWeave 的负责人表示,在 VB Transform 2026 上,单个 AI 代理对话可能看似完美,实则存在缺陷。

人工智能行业正在转变其评估智能体的方式,从对单个对话进行评分,转向将用户群体与基线进行比较。这一变革旨在解决这样一个问题:单个对话评分良好,但仍可能反映出产品缺陷。专家主张基于用户群组而非孤立轨迹来评估 AI 智能体。这种新方法将评估标准视为动态的产品规范,类似于产品需求文档。团队们逐渐认识到,详尽的发布前测试未必能捕捉到所有现实世界中的故障。相反,持续且广泛的监控对于及时发现出现的问题至关重要。对比分析通过将用户群体与基线进行比较,能够揭示在评估单个交互时会被遗漏的问题。例如,增多的澄清问题或在对话之外完成的购买行为,若仅评估单条交互则可能无法察觉。此类分析有助于精准定位特定类别相关的问题。行业也在转向使用更小、更经济的裁判模型来评估 AI 智能体。此类评估应首先从能力最强的模型开始,以确认可解决性,随后逐步过渡到使用较小的模型。此外,护栏机制也可通过更简单的方法(如正则表达式)实施,而不仅仅依赖复杂的 AI 模型。尽管 AI 裁判能力取得进展,但人工监督的需求依然关键。人类对于问责制至关重要,尤其是在法律、金融和医疗等敏感领域。人工审查还有助于建立信任,并促进 AI 系统内的记忆与学习。