前沿与中心:谁来评估评估?
AI 智能体通常使用固定基准进行测试,仅产生单一分数,这对其能力的洞察有限。这种方法不足,因为它无法揭示智能体性能下降的位置,或其成功所需的努力程度。对于数据智能体而言,理解这些细微差别对于有效的数据发现至关重要,这是一个“大海捞针”问题,智能体必须从模糊的人类查询中识别相关数据集。为此,提出了一种基于信息论的方法,称为 Discovery Bench,旨在为基准测试增加保真度。该框架通过生成每个查询的难易变体来调节评估案例的难度,从而更细致地理解智能体的性能。调节难度的核心概念是“惊异度”(surprisal),即在给定查询的情况下,关于正确数据集的剩余不确定性。查询中的信息量高的术语具有惊异度,能显著区分目标与其他选项。通过添加或删除具有不同信息量的术语,可以调整评估案例的难度。这种方法称为基于惊异度的迭代查询优化(iSQR),生成具有校准后的模糊度水平(高、中、低)的查询,其依据是比特数而非主观判断。这使得难度评估更加客观,并能解释为何添加或删除特定词汇。Discovery Bench 揭示了智能体性能中的“悬崖”现象,即模糊度轻微增加就会导致完全失败,这是传统通过/失败评估所遗漏的现象。它还识别出了模糊度的“甜蜜点”,表明更高的特异性并不总是有利于智能体性能。这为改进智能体提供了可操作的信号,例如解决特定失败模式,如时间分片表或上下文爆炸。该领域正朝着元基准测试方向发展,其他研究也在探索项目反应理论以及直接审计真实答案。实施 Discovery Bench 的一项关键发现是在既定基准 KramaBench-astronomy 中发现了重大错误。这凸显了“评估你的评估”的必要性,因为有缺陷的基准会导致关于智能体性能的错误结论。此外,生成模糊度扫描的方法本身也需要评估。当比较由大语言模型生成的引导术语与基于 TF-IDF 惊异度的术语时,结果差异巨大,这强调了需要对其评估方法进行稳健评估。结论是,评估应产生信号,而不仅仅是裁决,提供连续的评估轴,并对评估者本身进行与智能体同等程度的审查。