尧图网站建设 尧图网络
  • 首页
  • 关于我们
  • 服务项目
  • 案例展示
  • 建站流程
  • 资讯中心
  • 联系我们
首页/资讯中心/详情

医生与AI评估LLM临床能力存在系统性分歧:400+医生7专科多中心研究揭示评估标准不可互换

医生与AI评估LLM临床能力存在系统性分歧:400+医生7专科多中心研究揭示评估标准不可互换
📅 发布时间:2026/8/2 9:30:31
← 行业趋势

一、研究背景

大语言模型(LLM)在医疗领域的应用正从实验室走向临床一线,然而一个根本性问题始终悬而未决:谁来评估AI的临床能力?如何评估?

当前主流的评估范式存在三重偏差。其一,多数基准测试依赖选择题或合成病例(synthetic vignettes),将复杂的临床推理压缩为单一正确选项,这种"考试思维"与实际床旁决策之间存在深刻鸿沟。其二,评估者往往是少数几位临床专家,其判断未必能代表更广泛医生群体的观点。其三,随着AI智能体技术的兴起,越来越多研究开始用AI评估AI——但这种方式是否可靠,此前从未被系统验证。

2026年7月2日,首都医科大学附属北京友谊医院放射介入科金龙/栗荐团队联合北京同仁医院王宁利团队、复旦大学附属中山医院葛均波/李晨光团队,以及英国帝国理工学院、伦敦大学学院、香港中文大学、香港科技大学等17家国内外机构,在Nature旗下数字医学顶刊npj Digital Medicine(IF=15.1)发表了一项里程碑式研究DOI: 10.1038/s41746-026-02942-6,首次以大规模实证数据揭示了医生与AI智能体在评估LLM时存在的系统性认知分歧。

二、研究创新点

这项研究的突破性体现在三个层面:

第一,规模空前。研究纳入超过400名执业医生,跨越7个医学专科(心内科、神经内科、肝胆外科、眼科、放射科、介入放射科等),覆盖中国从东部沿海到西部高原的多个地理区域,是迄今为止规模最大的LLM临床评估研究。

第二,真枪实弹。不同于选择题或合成病例,研究使用的是2024年多中心收集的真实、去标识化临床病例。5个通用LLM(GPT-4o、Claude 3.5、Qwen-Max、DeepSeek-R1、OpenAI o1)需要对病例生成自然语言解读,医生再从全面性、连贯性、准确性、有用性、无害性和结构性六个维度进行盲法评分。

第三,人机对账。研究部署了与医生数量相等的AI评估智能体作为平行对照组,使用完全相同的病例材料和评估维度。这种配对设计使得人机评估差异得以被精确量化,这在既往文献中尚无先例。

三、技术原理

本研究的核心设计是"双轨评估框架",其架构如下图所示。

人类评估轨(Human Evaluation Track):

  • 400余位医生按年资分为初级、中级、高级三组
  • 按执业地域分为平原地区组和高原地区组
  • 每位医生对LLM输出在6个维度上进行Likert量表评分
  • 采用盲法设计,医生不知晓输出来自哪个模型

AI评估轨(Agentic Evaluation Track):

  • 部署等量的AI评估智能体
  • 智能体被配置为模拟特定医生特征(年资、专科等)
  • 使用相同的评估提示词和评分标准
  • 所有评估输出被记录用于一致性分析

数据分析层:

  • 组内一致性采用Kendall’s W系数
  • 人机一致性采用跨组比较
  • 排名稳定性通过Bootstrap重采样验证
  • 亚组分析按年资、地域、专科分层

该设计的精妙之处在于:它不仅回答了"哪个LLM最好"的问题,更追问了"谁的标准才算数"——这一通常被AI评估研究所忽视的元问题。

四、实验结果

研究结果呈现出一幅远比"AI赢"或"人类赢"更为复杂的图景。

发现一:年资塑造评估偏好。初级医生最青睐Qwen-Max,而高年资专家在连贯性、准确性和临床有用性维度上对GPT-4o和DeepSeek-R1给予更高评价。最受青睐的模型在不同年资组之间并不稳定,提示临床经验的积累深刻改变了医生对AI输出的判断标准。

发现二:地域导致排名逆转。高原地区与平原地区医生的评估模式存在显著差异——部分模型的相对排名甚至出现方向性逆转。这一发现表明,临床实践环境(资源可及性、疾病谱差异、转诊模式等)可能深刻影响医生对LLM生成内容的判断标准,未来LLM评估研究应将执业环境作为重要的分层变量。

发现三:AI评估者高度"自洽"但与人不同。在平行评估中,AI智能体在所有六个维度上均将OpenAI o1视为最优解,而人类医生则更青睐DeepSeek-R1和GPT-4o。虽然人机之间存在中等程度的整体一致性(Kendall’s W=0.798),但AI智能体在不同模拟经验水平下产生的排名高度一致(76.7%),而人类医生中这一比例仅为3.3%。

发现四:AI评估者无法捕获人类判断的异质性。人类医生的评估呈现出丰富的异质性——不同年资、不同地域、不同专科的医生有着不同的判断标准。这种异质性不是"噪声",而是临床多样性的真实反映。AI智能体虽然高效,但输出的"整齐划一"恰恰暴露了其无法模拟人类临床判断结构化差异的根本局限。

五、应用前景

这项研究的结论对医疗AI产业有三个直接启示:

对AI开发者而言,评估标准不可"一刀切"。一个在选择题基准上表现优异的模型,可能在真实临床环境中被不同医生群体给出截然不同的评价。未来的医疗LLM评测应纳入多中心、多专科、多年资的医生评估,而非仅依赖自动化基准测试。

对医院采购决策者而言,AI评估工具不应替代医生试用。本研究明确显示,AI评估者与人类医生的偏好存在系统性偏差——如果医院仅凭自动化评测选择LLM产品,可能选到一个"AI认为好"但临床医生实际用不上的系统。

对AI智能体研究者而言,这项研究提示了一个深层问题:我们究竟希望AI评估者模拟"人类平均判断",还是"人类判断的多样性"?从临床安全角度看,后者才是正确答案——但当前技术显然还做不到。这也为下一代专科AI智能体的开发指明了方向:不是追求一个"万能评估器",而是开发能够适配不同临床场景的分层评估体系DOI: 10.1038/s41746-026-02942-6。

六、结论

当医疗AI从"能不能用"走向"好不好用"的阶段,评估问题就不再是技术问题,而是认识论问题。金龙/栗荐团队的这项研究用超过400位医生的真实声音告诉我们:LLM的临床价值不存在唯一答案,它取决于谁来问、在哪里问、为谁而问。

AI智能体可以作为高效的辅助筛选工具,帮助在数以千计的LLM输出中初步分诊——但临床相关性、安全性和实用性的最终判断,仍必须锚定于真实医生的多样化视角。临床评估需要的不是一个"标准答案裁判",而是一个能够包容并反映临床异质性的多维框架。

论文原文详细信息:https://www.simoagent.com/blog/2026-08-01-llm-evaluation-divergence/

参考文献

  1. Shi P, Li J, Yang Z, et al. Physicians and artificial intelligence diverge in evaluating large language models on real clinical cases.npj Digital Medicine, 2026. PMID: 42393197 DOI: 10.1038/s41746-026-02942-6

  2. Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents.Nature, 2026. PMID: 42310457 DOI: 10.1038/s41586-026-10675-5

  3. Liu Y, Carrero ZI, Jiang X, et al. Benchmarking large language model-based agent systems for clinical decision tasks.npj Digital Medicine, 2026. PMID: 41708802 DOI: 10.1038/s41746-026-02443-6

相关新闻

  • Unity性能优化实战:八叉树实现视锥体剔除提升帧率
  • GHO镜像转VMDK虚拟机:物理机系统备份迁移至VMware全攻略
  • 2026年广州电商客服外包厂家推荐:口碑与实力深度评测 - 优质品牌商家

最新新闻

  • 黑苹果配置革命:如何用OpCore-Simplify在30分钟内完成专业级EFI配置
  • 嵌入式RTC模块深度解析:从DS1307原理到数据记录与定时任务实战
  • 2026 年苏州非急救医疗转运市场深度分析及本地合规服务商实操白皮书 - 官方推广
  • 实测 6 款 AI PPT Skill:同一主题,同一提示词,输出差距有多大?
  • 医院食堂系统与HIS对接技术方案:HL7/FHIR接口适配与营养医嘱数据闭环架构设计
  • BetterNCM插件管理器安装问题全攻略:从快速诊断到完美解决

日新闻

  • 怀化母婴除甲醛公司测甲醛中心怎么选:康之居母婴除甲醛标准、流程、避坑指南 - 信誉隆金银铂奢回收
  • 三步打造你的终极音乐中心:foobox-cn网络电台功能完整指南
  • Lance湖仓格式:为多模态AI工作流设计的终极数据存储方案

周新闻

  • 怀化母婴除甲醛公司测甲醛中心怎么选:康之居母婴除甲醛标准、流程、避坑指南 - 信誉隆金银铂奢回收
  • 三步打造你的终极音乐中心:foobox-cn网络电台功能完整指南
  • Lance湖仓格式:为多模态AI工作流设计的终极数据存储方案

月新闻

  • ClickHouse版本管理深度实战:4步构建零风险升级与回滚体系
  • Java 23 种设计模式:从踩坑到精通 | 番外:责任链模式 —— 物流审批流程实战
  • 华硕笔记本性能解放指南:G-Helper轻量级控制工具全面解析

关于尧图

  • 公司简介
  • 团队介绍
  • 企业文化
  • 荣誉资质

服务项目

  • 定制开发
  • 电商建站
  • UI 设计
  • 运维服务

快速链接

  • 案例展示
  • 建站流程
  • 常见问题
  • 资讯中心

联系方式

  • 📍北京市朝阳区互联网产业园 A 座 10 层
  • 📞400-888-8888
  • ✉️contact@rkmt.cn
  • 🕐周一至周日 9:00-21:00

© 2024 北京尧图网络科技有限公司 版权所有 | 京 ICP 备 XXXXXXXX 号