为何不应始终信任大语言模型作为裁判:理解自动化评估中的偏见 笔记

为何不应始终信任大语言模型作为裁判:理解自动化评估中的偏见

在急于实现评估自动化的过程中,从学生代码评分到研究论文排名,我们已广泛采用大语言模型作为裁判。它们速度快。这些单元成本低。它们可扩展。然而,在 DHS 2026 的一次研讨会上,Bhaskarjit Sarmah 提出了一点令我印象深刻:“你不能信任 LLM 作为裁判。我 […]"