arXiv cs.HC· 自如教育观察·· 13 天前精选
AI打分和人几乎一致,为什么研究结论仍可能算错?
AI 导读
用AI给大量材料打分,再拿分数做统计,看起来很省事。一篇方法论文提醒,AI和人高度一致,也不保证后面的显著性检验可靠。作者用模拟和案例展示误报风险,并提出利用少量人工评分进行校准。
推荐理由
Reviewed Edu@AI import
正文
这篇预印本考察以AI裁判分数进行统计推断的风险。作者发现,在一些评价指标与条件下,直接使用原始模型分数会增加假阳性,即把没有可靠支持的差异误判为发现;高人机一致率本身不足以排除这种风险。
论文通过模拟和案例提出校准方法,并发布evalstats工具。这里介绍的是方法研究,具体风险取决于样本、指标和检验设置,不能理解为所有AI评分都无效。本次核读公开摘要,未复算其统计程序。
来源:arXiv cs.HC · arxiv.org