ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models

Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models 该文章提出了用于评估大型语言模型(LLMs)临床推理能力的多轮基准测试VivaBench,通过模拟口试场景暴露了当前LLMs在诊断不确定性处理上的缺陷,为医疗AI的临床应用提供了标准化评估工具。一、文章主要内容总结研究背景:现有医疗LLM基准多为单轮问答,仅评估知识回忆能力,无法模拟临床中医生通过多轮信息收集(病史询问、体格检查、诊断检查)逐步完善诊断的动态过程,存在评估缺口。核心方案:VivaBench基准数据集设计:包含1152个由医生整理的临床案例,每个案例以交互式场景呈现,要求模型主动探查关键信息、选择合适检查项目,逐步推导诊断结果。评估框架:分为“回顾阶段”(病史询问+体格检查)和“检查阶段”(实验室/影像学检查),模型需先提交初步诊断,再结合检查结果给出最终诊断,通过准确率、信息获取效率等指标评估性能。实验结果性能表现:6个主流LLM(如Gemini 2.5 Pro、o4-mini)在“全信息直接诊断”场景中表现较好,但在“多轮交互式诊断”中性能显著下降,其中Gemini 2.5 Pro表现最优(最终诊断Top-1准确率35%)。核心缺陷:模型存在4类典型故障模式,与临床常见认知错误一致:一是锚定初始假设,二是过度开具检查单,三是过早确定诊断,四是遗漏关键
返回列表