跳到正文
原文
arXiv · Education + AI· 自如教育观察·· 11 天前精选

自动评分“100%一致”的漂亮数字,要连条件一起读

AI 导读

研究测试大模型自动生成实用判断题、给开放回答评分并生成反馈。题目内部一致性为0.78,某些条件下机器与人工评分一致率达100%;反馈被评为同样有用,但不是所有条件都完美。

推荐理由

Reviewed Edu@AI import

正文

分层诊断推理要求学生读案例、找出错误并解释判断,能测较高阶的实践能力,却很费教师时间。研究者用提示设计,让大模型生成案例题、评判开放回答并按错误给出结构化反馈,再与人工评价比较。

题目得分的内部一致性为0.78;某些评分条件下,机器与教师判断达到完全一致,受试者也认为反馈有说服力、实用。摘要并未支持所有情况下都100%一致,不能把特定条件推广到所有题型。它是评估自动化可行性的研究,不等于自动评分已可替代教师判断。

来源:arXiv · Education + AI · arxiv.org