arXiv · Education + AI· 自如教育观察·· 27 天前精选
短答题评分总给同一个分,不等于总给对分
AI 导读
996份科学短答交给三种模型,每种评三遍:DeepSeek更稳定,GPT与官方标签对齐更好,通义千问更严格。原来“稳定”“准确”“严格”根本不是一回事。这是特定模型与题库的结果,也不能当成所有版本的总排名。
推荐理由
Reviewed Edu@AI import
正文
研究使用SciEntsBank中的996份短答,让GPT、DeepSeek和通义千问分别独立评分三轮,并比较一致性、官方标签对齐、诊断能力及传统文本基线。量规关注概念覆盖、关系准确、推理完整、矛盾控制和领域相关性。
三种模型重复评分的一致性都较高,DeepSeek最稳定;GPT与官方标签的AUC最高,通义千问评分更严格、精确率较高但召回较低。重复性、对齐程度和评分严厉度是不同指标,不能把一个模型的高分当成总体可靠。作者建议将大模型用于辅助评分,而不是替代人的判断。
来源:arXiv · Education + AI · arxiv.org