跳到正文
原文
arXiv · Education + AI· 自如教育观察·· 27 天前精选

短答题评分总给同一个分,不等于总给对分

AI 导读

996份科学短答交给三种模型,每种评三遍:DeepSeek更稳定,GPT与官方标签对齐更好,通义千问更严格。原来“稳定”“准确”“严格”根本不是一回事。这是特定模型与题库的结果,也不能当成所有版本的总排名。

推荐理由

Reviewed Edu@AI import

正文

研究使用SciEntsBank中的996份短答,让GPT、DeepSeek和通义千问分别独立评分三轮,并比较一致性、官方标签对齐、诊断能力及传统文本基线。量规关注概念覆盖、关系准确、推理完整、矛盾控制和领域相关性。

三种模型重复评分的一致性都较高,DeepSeek最稳定;GPT与官方标签的AUC最高,通义千问评分更严格、精确率较高但召回较低。重复性、对齐程度和评分严厉度是不同指标,不能把一个模型的高分当成总体可靠。作者建议将大模型用于辅助评分,而不是替代人的判断。

来源:arXiv · Education + AI · arxiv.org