arXiv · Education + AI· 自如教育观察·· 29 天前精选
一万份作文交给AI初评,老师更该盯住分歧
AI 导读
一项全国性测评框架分析两届、每届约5000份短文,AI与人工评分在多数维度达到中高一致。流程将不一致案例分给人工复核,降低专家用力在重复评分上的浪费;一致性仍不等于无偏。
推荐理由
Reviewed Edu@AI import
正文
这项研究基于两届全国测评、每届约5,000份150至200字的学生短文,设计AI辅助评分与人工复核流程。作者比较模型与人工评分在多个量规维度上的一致程度,并观察流程如何分配复核工作。
多数维度达到中高一致,系统还可把评分不一致的案例优先交给人工,尝试让专家时间用于更值得判断的答卷。研究来自真实测评场景,但一致性不等于评分没有偏差,也不自动证明及格决定公平;部署仍需持续监测模型与人工意见如何变化。
来源:arXiv · Education + AI · arxiv.org