LLM을 항상 판사로 신뢰해서는 안 되는 이유: 자동 평가에서의 편향 이해
학생들의 코드를 채점하는 것부터 연구 논문의 순위를 매기는 것까지, 평가를 자동화하려는 서두름 속에서 우리는 대규모 언어 모델을 심판으로 받아들였습니다. 그것들은 빠릅니다. 이 유닛들은 저렴합니다. 그것들은 확장 가능합니다. 그러나 DHS 2026 워크숍에서 Bhaskarjit Sarmah는 제 마음에 깊이 남는 한 가지를 지적했습니다: “LLM을 심판으로 신뢰할 수 없습니다. 저는 […]