STANDARD SUBSET
标准化临床场景
基于指南与专家共识,构建目标清晰、采用开放式问答的标准病例。
开放式问答 · 15 个临床科室 · 2992 个证据考察点基于指南与专家共识,构建目标清晰、采用开放式问答的标准病例。
开放式问答 · 15 个临床科室 · 2992 个证据考察点在信息冗余、异常共存和背景不完整时,检验模型的全链路证据能力。
复杂环境验证 · 53 种检验场景 · 3100 个证据考察点基于权威医学指南与标准知识库,检验模型对核心医学知识的掌握与准确应用能力。
139 道医学知识考题




以医学证据为核心,构建全方位、多层次的医疗大模型能力评估框架
所有评测任务均锚定权威医学证据,确保评测结果客观、可溯源。
掌握扎实的医学基础知识与术语体系,准确理解临床语境。
模拟临床思维,进行逻辑推导、鉴别诊断与决策分析。
检索、评价并应用最佳证据,指导临床实践与决策。
识别潜在风险,确保输出内容符合安全规范与伦理要求。
覆盖从检验、影像到慢病管理、智能体等多元临床任务
医疗 AI 循证评测的黄金标准 —— 每个判断都有据可查、有源可溯
支持随指南、专家共识及临床规范的更新,动态修订和扩充评测任务、评分条目与循证依据,确保测评内容的时效性与有效性。
建立评分条目、医学主张、循证证据、原文片段的全链路追溯关系,并由医生核验证据与病例适用条件的一致性,确保每项评分有据可查。
将开放式回答拆解为可独立判定的原子化评分条目,并按临床场景、能力维度汇总得分,确保评分结果可解释、可复核。
联合权威机构,共建可信评测标准
山东第一医科大学
山东大学
国家超级计算济南中心
山东省健康卫生委员会
山东省立医院
山东第一医科大学
山东大学
国家超级计算济南中心
山东省健康卫生委员会
山东省立医院
面向中文医疗 AI,开放评测标准与高质量循证数据,欢迎各界伙伴共同参与。