跳到正文
原文
arXiv · Education + AI· 自如教育观察·· 8 天前精选

小模型也能答中学科学题,题目本身还得有人把关

AI 导读

研究用NGSS对齐的中学科学基准比较9个开源模型,发现模型大小不稳定预测成绩;人工审题还发现,合成题并非都符合课程标准。模型能答题和题目适合教学,是两件事。

推荐理由

Reviewed Edu@AI import

正文

研究者建立一个对应美国NGSS标准的初高中科学题基准,比较9个开源模型在不同科学领域和题型上的表现。结果显示,模型规模并不能稳定预测准确率,一些体量较小、可本地运行的模型也表现不错。

不过,人工检查发现合成题并非都与课程标准完全一致。基准的答案分数因此不能简单等同于教学可用性:如果题目本身偏离目标,测出来的能力也会偏。文章评估的是模型在合成题上的表现,没有学生学习结果;它强调标准对齐和人工审题仍不可少。

来源:arXiv · Education + AI · arxiv.org