arXiv cs.HC· 自如教育观察·· 2026-08-03精选
AI自己这样判断,却转头责怪做出同样判断的人
AI 导读
五项实验让GPT-4o和Claude 3.7 Sonnet一边做贝叶斯判断,一边评价做出相同判断的假想人物。模型出现了“自己这样做,却贬低别人这样做”的不一致。逾5000次指的是模型试验,不是5000名受试者,也不是证明AI真有道德情绪。
推荐理由
Reviewed Edu@AI import
正文
五项实验覆盖48种条件、超过5000次试验,考察GPT‑4o和Claude 3.7 Sonnet的两类贝叶斯任务,并让模型评价一个作出相同推理的假想人物。模型在贝叶斯任务上的表现接近人类,但更依赖规则式、僵硬的推理;在评价他人时,模型比人类更明显地出现“自己使用贝叶斯判断、却贬低使用同一判断者”的不一致。研究比较的是任务输出与既有的人类实验,不意味着模型具有人的道德心理。
来源:arXiv cs.HC · arxiv.org