虎嗅

Nature重磅:AI智能体医生:MIRA,首次在完整诊疗流程中超越人类医生

核心内容总结

德国海德堡大学医院开发的AI智能体MIRA,是首个能在完整急诊诊疗流程(从问诊、开检查到诊断、治疗、手术安排)中直接操作电子健康档案(EHR)系统的AI医生。在574个真实急诊病例的模拟测试中,MIRA在诊断准确率、治疗合规性、用药安全等多维度全面超越人类医生(包括资深专科医生和混合资历团队),标志着医疗AI从“聊天工具”向“实用助手”的关键跨越,但未来仍需真实世界验证。

一、MIRA不是“纸上谈兵”的AI,而是能“动手干活”的真医生

之前的医疗AI(比如ChatGPT)更像“顾问”——只会用文字回答问题,没法实际操作医疗系统;而MIRA是“有处方权的医生”:

  • 能直接操作EHR系统:像人类医生一样开检查单(血液、影像等)、下医嘱、安排手术,所有操作都符合国际医疗数据标准(FHIR),用统一编码(比如ICD诊断码),确保和医院系统兼容。
  • 工具库超全:可调用85000+临床工具,覆盖急诊科几乎所有选择(比如不同化验项目、手术方式),不会“缺工具”。
  • 流程完整:从问病史(和模拟患者对话)→开检查→解读结果→诊断→治疗→入院决策,一步不落,逻辑和人类医生一致,但更规范(比如97.1%的病例会请求体格检查,人类医生只有87.8%)。

二、“人机对决”有多公平?实验设计够严谨

为了测试MIRA的真实水平,研究团队做了一场“硬碰硬”的对比:

  • 病例真实:从国际知名的MIMIC-IV数据库选了574个急诊病例,涵盖8种常见急症(阑尾炎、肺炎、肺栓塞等),每个病例都有完整的真实临床数据(病史、检查结果、治疗方案)。
  • 对手专业:对照组是两批人类医生——4名有7-11年经验的资深专科医生,6名混合资历医生(2专科+4住院医,模拟德国急诊科真实配置)。
  • 条件相同:MIRA和医生面对完全一样的病例,用相同的工具界面(人类用图形界面,MIRA用API接口),在相同信息下独立完成诊疗。
  • 评价全面:不止看诊断对不对,还查检查是否合理(有没有过度/遗漏)、治疗是否符合指南、用药是否安全、入院决策是否正确,甚至测试抗干扰能力(比如患者焦虑、说外语时的表现)。

三、MIRA赢在哪里?全面超越人类医生的具体表现

1. 诊断更准:整体准确率87.8%,比资深专科医生(78.1%)高近10个百分点。分病种看:阑尾炎98.6%(人类医生更低)、胰腺炎95.2%(人类78.6%),胰腺癌也显著领先,只有胆囊炎和肺栓塞和人类差不多。

2. 检查更合理:担心AI过度检查?数据显示MIRA很“克制”:血液检查只请求了数据库中51.1%的项目(比人类医生的28.3%多,但比真实临床实际做的少),影像检查和人类相当甚至略少,微生物检查和人类无差异——既没漏必要检查,也没乱开。

3. 治疗更规范:指南依从性比资深医生高35个百分点!比如胰腺炎患者,MIRA更常按指南给静脉补液;镇痛治疗更符合推荐方案;抗生素使用合规率更高。手术推荐也精准:阑尾炎100%推荐腹腔镜切除,整体手术召回率(识别需要手术的病例)53.5% vs 人类38.3%。

4. 用药几乎零差错:审查468条医嘱,99.8%有正确给药说明,97.6%剂量对,99.6%治疗周期对,只有给药途径(97%)略低,没发现严重安全问题(比如药物相互作用、过敏风险)。

5. 入院决策谨慎:该收的患者100%没漏掉(召回率100%),不需要收的也能识别(特异性70%-86%),唯一小问题是肺栓塞病例有点“过度收治”,但这种“宁可错收也不放过”的态度在临床是可接受的。

6. 抗干扰能力强:改变患者性别、患者焦虑/说外语、甚至患者坚称自己没病/得癌症,MIRA的诊断准确率几乎不变,没有偏见。

四、AI会替代医生吗?落地前景和冷思考

MIRA的突破不是为了替代医生,而是帮医生“减负”:

  • 落地场景:未来可能承担重复性任务——比如核对用药清单、自动组合化验套餐、草拟会诊申请、提指南建议等,让医生把时间留给患者沟通(毕竟AI没有“温度”)。
  • 挑战仍在:目前只是模拟测试,还需要真实世界试验(比如在医院实际使用)验证安全性、泛化能力(比如处理更多病种、不同地区患者),以及AI的治疗机制是否透明(为什么这么诊断?)。

总的来说,MIRA是医疗AI的里程碑——第一次证明AI能在完整诊疗流程中超过人类专家,但它只是医生的“助手”,不是“替代者”。未来的医疗,会是AI和医生协作的时代。

一句话总结

MIRA不是只会聊天的AI,而是能实际操作医疗系统的“真医生助手”,在模拟测试中全面超越人类医生,但最终目标是帮医生省时间,让医患沟通更有温度。