GPT-4在诊断推理任务中的得分高于借助AI的医生,但这一结果并不能证明聊天机器人能提供更好的医疗照护。这种差异指向一个更棘手的问题:人与模型可能以削弱推理能力的方式相互影响,而真实的临床决策依赖完整病历、沟通和责任承担。
诊断试验发现了什么
一项发表于npj Digital Medicine的随机试验测试了70名执业医生的诊断工作流程。两种引入AI的方式,准确率都高于使用传统医疗资源。然而,GPT-4独立作答的得分在数值上高于与其协作的医生。该研究报告的结果未提供用于这一比较的GPT-4独立作答准确率百分比。
| 研究 | 参与者 | 报告结果 |
|---|---|---|
| npj Digital Medicine诊断工作流程试验 | 70名执业医生 | 以AI作为第一意见时,准确率为85%;以AI作为第二意见时为82%;使用传统资源时为75%。GPT-4独立作答的得分在数值上高于人机协作流程。 |
| JAMA Network Open诊断推理试验 | 50名医生 | 大语言模型独立作答的得分比医生对照组高约16个百分点。 |
| Nature Medicine关于面向公众的AI助手的研究 | 1295名参与者 | 模型独立作答时,在94.9%的情境中识别出了病症;有AI可用的人识别疾病的准确率低于没有AI可用的人。 |
大语言模型(LLM)根据训练过程中学到的模式生成回答。这些研究衡量的是特定任务中的表现,而不是AI系统能否承担患者照护责任。研究还表明,将能力较强的模型纳入人的工作流程,并不会自动保留模型独立作答时的得分。

▲ 模型与医生的推理差距
为什么强大的模型可能不是好搭档
一种解释是迎合倾向:对话模型可能附和问题中暗含的假设,即使那个假设是错的。临床医生或普通人也可能过早认定某种可能性,对其他解释关注不足。这样一来,模型就可能强化最初的想法,而不是提供独立核查。
是否熟悉相关工作流程同样关键。早期试验中的许多临床医生此前从未使用过对话式AI聊天机器人。因此,试验考察的是人们在特定工作流程中使用工具的表现,而不只是人与机器医学知识的较量。仅凭这一点,无法确定究竟是什么造成了表现差距。
Nature Medicine的研究结果尤其清楚地说明了这种区别。模型独立运行时识别病症的高准确率,并未延续到使用模型的人身上。令人安心或语气笃定的回答会影响用户接下来怎么提问,正如带有诱导性的问题会影响模型如何回答。这两种交互都不能替代临床评估。
病历带来另一类风险
即使模型能处理好简短的诊断病例,面对漫长的患者病史时也可能力不从心。JAMA Network Open一项研究考察了Gemini 2.5 Pro生成的住院诊疗过程摘要,发现遗漏重要临床细节是报告中最主要的错误。总结冗长病历必须决定省略哪些内容;摘要越流畅,这些取舍就越不容易被察觉。
长篇病历还会带来上下文退化,即模型难以在大量材料中持续追踪相关信息。日期、事件先后顺序和不断变化的检验数值,可能尤其难以准确记住。另一个问题是病历传言:未经核实的假设在临床记录中反复出现,直到看起来像是有大量既往记录支持。读取这些记录的AI系统可能重复该假设,而不是独立核实它是否属实。

▲ 病历遗漏与重复假设
这些局限之所以重要,是因为遗漏一个细节或沿袭一处错误,都可能改变一个病例呈现出的含义。因此,AI生成的病历摘要应当是需要对照原始信息核查的草稿,不能取代病历本身或临床医生的判断。
安全不止是一项准确率得分
斯坦福医学院一项名为noHARM的安全基准,评估了20个大语言模型在4249种临床管理方案上的表现。结果发现,综合不同模型的输出,比依赖单一模型能给出更安全、更稳健的建议。模型之间的一致意见可能有助于发现不一致之处,但这并不意味着任何模型能为决策承担专业责任。
工作流程中人的能力也需要保护。发表于The Lancet Gastroenterology & Hepatology的一项观察性研究发现,内镜医生使用AI辅助检测息肉后,在不使用AI时的表现比使用AI之前更差。这一发现给临床团队提出了一个实际问题:AI应当支持哪些技能,哪些技能又必须由临床医生继续独立练习?
医疗专业能力也不只是找出一个看似合理的答案。值得信赖的专业人员必须解释不确定性、与患者沟通,并对决策负责。模型即使在推理练习中表现出色,这些责任也不会消失。
如何将AI用于就诊沟通
这些研究表明,对话式AI更适合承担范围有限的实用角色:帮助解释现有临床记录中的术语,或整理就诊时要问的问题。与其提供自己写的摘要,不如提供原始病历记录和客观的化验结果;描述症状时应保持中立,而不是以“这是疥疮吗?”这样的问题预设诊断。让模型假定怀疑的疾病已被排除,再列出其他解释,有助于抵消迎合倾向。把同一个问题分别交给两三个模型,例如ChatGPT、Claude和Gemini,也有助于发现回答中的不一致。就诊时间往往有限,事先简要整理最重要的发现和问题,有助于确定讨论重点。AI输出应与原始病历明确区分,尤其是在它概括多年记录时。即使解释写得流畅,也仍可能遗漏某项发现,或重复缺乏依据的假设。
核心结论并不是医生应该忽视AI,也不是高分模型应该独自作出决定。独立作答的准确率、有效的人机协作与安全的医疗照护,是三种不同的衡量标准。如果借助AI准备就诊讨论,应把原始信息和尚未解决的问题带给有资质的临床医生。诊断、治疗及其他重大医疗决策应由医疗专业人员负责。