arXiv · Education + AI· 自如教育观察·· 12 天前精选
AI说这篇文章适合孩子,判断的尺子从哪儿来?
AI 导读
这项基准研究比较多种开源模型评估英语与斯洛文尼亚语文本难度。显式推理和推理型模型表现更好;每个难度级别给一个标注范例,就能提升预测,继续加例子的收益递减。
推荐理由
Reviewed Edu@AI import
正文
文章难度需要因读者调整,但传统公式跨语言、跨文体时不总是可靠。这项基准研究比较多种开源大模型评估英语和资源较少的斯洛文尼亚语文本,预测教育框架中的离散可读级别,并与传统指标和监督模型比较。
加入显式推理后,预测更好;给每个难度类别一个标注范例,也比零样本表现提升明显,继续增加示例的收益则减小。研究说明模型可能成为跨语言可读性评估工具,但模型判定难度不等于真实读者理解,也没有测试教师如何用它调整材料。
来源:arXiv · Education + AI · arxiv.org