跳到正文
原文
arXiv cs.HC· 自如教育观察·· 2026-08-03精选

AI自己这样判断,却转头责怪做出同样判断的人

AI 导读

五项实验让GPT-4o和Claude 3.7 Sonnet一边做贝叶斯判断,一边评价做出相同判断的假想人物。模型出现了“自己这样做,却贬低别人这样做”的不一致。逾5000次指的是模型试验,不是5000名受试者,也不是证明AI真有道德情绪。

推荐理由

Reviewed Edu@AI import

正文

五项实验覆盖48种条件、超过5000次试验,考察GPT‑4o和Claude 3.7 Sonnet的两类贝叶斯任务,并让模型评价一个作出相同推理的假想人物。模型在贝叶斯任务上的表现接近人类,但更依赖规则式、僵硬的推理;在评价他人时,模型比人类更明显地出现“自己使用贝叶斯判断、却贬低使用同一判断者”的不一致。研究比较的是任务输出与既有的人类实验,不意味着模型具有人的道德心理。

来源:arXiv cs.HC · arxiv.org