原始来源· 自如教育观察·· 24 天前精选
预测题没变,换个奖励规则,AI就换了种犯错方式
AI 导读
同一个基础模型,同一批预测题,五种计分规则训练出了不同表现:有的更会区分结果,有的概率更贴近实际。总分相近,背后的偏差却未必相同。这篇预印本提醒我们,奖励模型什么,也在塑造它怎样判断。
推荐理由
Reviewed Edu@AI import
正文
作者固定基础模型、预测题数据和训练设置,用五种“适当评分规则”作为强化学习奖励,训练GPT-OSS-120B预测已发生结果的真实新闻事件。数据共8,041题:7,076题训练、965题留出测试,覆盖政治、经济、商业、科学和体育。五种奖励训练版本整体都优于未训练基线,但各有侧重:Brier版本的Brier分数最低(0.1648),AUC最高(0.7511);Log版本的对数分数最好,校准误差最低(0.0434)。偏差—信息—噪声分解还显示,相近的总成绩可由不同误差结构实现。
这说明理论上都鼓励如实报概率的评分规则,在有限训练中并非可互换;它们可能塑造不同的预测风格。边界也很清楚:主比较只用一个基础模型、一套二元新闻预测数据和每种奖励一个随机种子;Log与Brier的三种子补充复核保留了误差结构差异,但总分差距对种子敏感。不同奖励实际生成的token量最高相差约七倍,研究不能据此断言哪种规则普遍最好,也未检验学生学习或教育成效。
来源:原始来源 · arxiv.org