arXiv cs.HC· 自如教育观察·· 2026-04-28精选
给聊天机器人112个精神科分诊案例,低估急症仍会发生
AI 导读
研究用112个合成病例测试15种模型。总体上,它们更容易把情况判得过急,但415次预设急诊测试里,仍有23次低估紧急程度。“大多能认出来”还不能等于安全;真实患者的描述,往往也没测试材料这么完整。
推荐理由
Reviewed Edu@AI import
正文
研究让15种聊天机器人处理112个合成精神科情境,共约1,680次单轮测试,比较紧急程度判断。以预设标签计,415次急诊试验中23次被低估;总体错误主要偏向判得更紧急。
测试用的是整理完整的病例文本,不是真实患者对话,更不是“漏诊率”的临床估计。研究还比较了临床人员的评分口径,结果依参照标准而变。这里反映的是受控模拟中的风险,不能作为让聊天机器人替代实际分诊的依据。
来源:arXiv cs.HC · arxiv.org