指南知识
采用单项最佳选择题,围绕明确的临床决策点设置唯一最佳答案,并以现行权威指南的原始推荐语句和证据等级复核。干扰项依据常见混淆、过时建议或不适用人群设计。
由指南知识、标准化临床场景与真实世界临床场景组成的三级递进式评测体系。
MedEvidenceBench 将任务形式从选择题逐步推进至开放式临床解读,逐级提升指南知识要求、信息复杂度与临床真实性;所有层级均以统一评分框架评价模型的循证决策质量。
从可控的指南知识,到保留真实信息冗余的检验报告,逐步逼近真实临床工作流。
采用单项最佳选择题,围绕明确的临床决策点设置唯一最佳答案,并以现行权威指南的原始推荐语句和证据等级复核。干扰项依据常见混淆、过时建议或不适用人群设计。
从指南和专家共识中提取适用人群、输入变量、判定阈值与推荐处置,构建信息充分、证据明确的理想化病例,仅保留完成目标判断所必需的临床变量。
以去标识化的真实医学检验记录为载体,保留检验项目、结果、单位、参考区间及可用的患者背景信息,检验模型在信息冗余、异常共存和背景不完整条件下的循证推理。
所有评测场景按临床问题组织,覆盖从识别到决策的核心任务类型。
统一组织评测场景与任务标签
真实检验场景中的循证推理被拆解为六个连续且可独立评价的环节。
识别与当前问题相关的关键临床信息和异常指标。
识别复合指标、校正指标或临床评分,完成计算及阈值判断。
整合临床信息与计算结果,匹配能够解释或判定问题的权威证据。
判断证据适用性,并将循证规则应用于具体患者和临床情境。
基于循证判断提出检查、复查、转诊、治疗、用药或随访建议。
识别阈值误用、遗漏计算前提、误读缺失数据及证据冲突等严重错误。
在每一个评测层级中,使用同一套能力框架进行细粒度评价。
掌握现行指南、专家共识及规范性医学知识,并从病例或检验报告中识别与当前问题相关的关键信息和异常指标。
定位指南、共识及权威文献中的诊断标准、分型分期规则、临床阈值和推荐依据,判断证据与患者及场景的适用性。
主动识别需要计算的指标,完成计算和阈值判断,将循证规则应用于具体病例,形成诊断、鉴别、分型、分期及风险判断并提出建议。
识别并规避阈值或分型规则误用、遗漏必要计算、误读缺失数据,以及与关键医学证据冲突或具有潜在危害的临床建议。
测评内容遵循循证医学原则,由临床专家从现行指南和专家共识中提炼,并经过原始推荐语句、证据等级与适用条件复核;真实世界任务基于去标识化检验记录构建,确保评价结果可测量、可核验、可追溯。