arXiv · Education + AI· 自如教育观察·· 28 天前精选
情绪识别模型错了,可能是题目本身没有唯一答案
AI 导读
一句话到底是生气、委屈,还是故作轻松?模型常在否定和感叹句上栽跟头。研究请4位人工标注者重看一批材料,只有35%的案例形成强一致。也许不只是模型不会读情绪,而是评分表太想给每句话一个唯一答案。
推荐理由
Reviewed Edu@AI import
正文
对话情绪识别常把每句话标成一个明确情绪,模型也按这套答案判分。研究者发现,错误经常出现在带否定、感叹或语气词的句子,而且不同模型都有类似问题。随后,四位人工标注者重新标注部分材料,强一致的案例仅占35%。
高一致案例多是中性话语,许多情绪类别本身就难形成唯一共识。作者因此指出,所谓模型错误可能部分来自标注任务把复杂语境压成单选题,并提出按不同情绪分别判断其合理性的评测方式。标注者人数少且属于受控样本,这不等于模型已经理解情绪,也不能直接推断现实对话中的情感识别能力。
来源:arXiv · Education + AI · arxiv.org