跳到正文
原文
arXiv · Education + AI· 自如教育观察·· 2026-08-30精选

同一批作文换个模型或版本,评分严厉度就变了

AI 导读

预注册审计比较2377篇作文、12个LLM评委,发现不同模型严厉度差异很大,五组版本变化都改变评分;重复性尚可,却未达到人类评分准确度。更公平地比较模型,需要把它当成会漂移的评分者。

推荐理由

Reviewed Edu@AI import

正文

这项预注册审计把大模型当作评分者,而不是只看它与人工分数的一次相关。研究覆盖两种语言的2,377篇作文、12个模型评委和多个供应商版本,检查严厉度、光环效应、可靠性、版本变化和差异功能。

模型评委之间的严厉度差异很大;五组版本比较都出现超出随机波动的变化。重复评分的一致性可以不错,但不等于达到人工评分准确度;研究也报告了两个预注册检验的零结果,并撤回自己关于光环效应的强结论。评分系统要做版本监测和校准,不能只看排行榜上的单次分数。

来源:arXiv · Education + AI · arxiv.org