胸外科专科评估集
包含92个非小细胞肺癌真实临床案例的AI评估基准,用于评估AI模型在胸外科术前评估、诊断、分期、治疗决策等方面的准确性。
基本信息
资源简介
GAPS胸外科专科评估数据集是一个基于临床指南和专家知识的AI评估基准,包含92个非小细胞肺癌(NSCLC)分期与治疗规划的真实临床案例。数据集采用多维度正负评分系统(A级加分,S级扣分),评估AI模型在术前评估、诊断、分期、治疗决策等方面的临床准确性。提供标准化Excel格式,涵盖多个主流AI模型(如GPT-4、Gemini、Claude)的回答及详细评分标准,支持AI临床决策支持系统的性能基准测试、医学教育与质量评估。所有病例经多学科团队验证,确保高质量与临床相关性。
下载信息
注册下载
Tips: 该数据集需要在对应的数据源网站注册通过后,才能进行数据下载,注册有对应要求,或者需要收费。
暂未开放公开下载
Tips: 该数据集属于公开下载,应该可以免费公开下载。
免登录有偿下载
Tips: 该数据集 Qianfanghub 可以协助提供有偿下载服务,注意,服务不针对数据相关产权,只是技术服务费。
提供高速下载与技术交付服务(收技术服务费,非数据销售)
暂未开放千方医数集,医疗数据集部分,是为社区服务的公开医疗数据集搜索引擎,并不存储或者下载原始的任何数据。 如果您有其他医疗数据需求,可以和客服联系,或者下工单。我们有强大的三甲医疗机构帮助您提供个性化的医疗数据定制、采集、标注服务。
使用方式
数据集获取(ModelScope)
方式一:MsDataset(Python)
# 前置依赖: pip install modelscope
from modelscope.msdatasets import MsDataset
ds = MsDataset.load("AQ-MedAI/ThoracicSurgeryEvaluationSet", subset_name="default", split="train")
print(ds)
方式二:CLI(命令行)
pip install modelscope
modelscope download dataset AQ-MedAI/ThoracicSurgeryEvaluationSet
数据集卡片摘录(源站)
GAPS医疗AI评估数据集 - 肺癌专病评测集
数据集简介
GAPS医疗AI评估数据集是一个专门用于评估AI模型在临床场景下表现的综合评估系统。本数据集基于GAPS(Grounded, Automated, Personalized, Scalable)方法论,提供了经过精心策划的临床基准数据集和自动化评估流水线。
核心特色
- 🏥 医疗专业评估: 基于真实医疗指南和专家知识的临床评估标准
- 📊 胸外科专科数据: 包含92个精心策划的肺癌专病临床案例,专注于非小细胞肺癌(NSCLC)分期和治疗规划
- 🎯 多维度评分: 采用正负分评分系统,全面评估AI模型的临床决策能力
- ⚙️ 标准化格式: 提供统一的Excel格式,包含问题、评分标准和多模型响应
数据集结构
主要字段说明
| 字段名 | 描述 | 数据类型 |
|---|---|---|
| question | 涵盖肺癌专病的临床问题 | 文本 |
| 分类 | 医学专科分类 | 文本 |
| rubrics | JSON格式的评估标准,包含评分等级 | JSON数组 |
| gpt_5_answer | GPT-4模型对临床问题的回答 | 文本 |
| gemini_2_5_pro_answer | Gemini 2.5 Pro模型回答 | 文本 |
| claude_opus_4_answer | Claude Opus模型回答 | 文本 |
评分系统
正向评分(A级):
- A1 (5分): 影响患者安全的关键医学知识
- A2 (3分): 重要的临床考虑因素
- A3 (1分): 额外的相关信息
负向评分(S级):
- S1 (-1分): 不影响核心治疗的轻微错误
- S2 (-2分): 可能误导的错误信息
- S3 (-3分): 严重的医学错误
- S4 (-4分): 可能伤害患者的危险错误信息
临床覆盖领域
数据集涵盖胸外科的关键方面:
- 术前评估: NSCLC患者(IIB-IIIA分期)的综合评估方案
- 诊断程序: EBUS-TBNA、纵隔镜检查、PET-CT解读
- 分期评估: TNM分期、纵隔淋巴结评估
- 治疗规划: 手术vs非手术方法、新辅助治疗决策
- 风险评估: 肺功能评估、心脏风险分层
- 分子诊断: EGFR、ALK、PD-L1检测策略
数据质量保证
- 总病例数: 92个临床场景
- 数据完整性: 所有列100%数据覆盖
- 临床多样性: 涵盖IIB-IIIA期NSCLC的完整表现谱
- 专家验证: 所有病例均经多学科临床团队审查
应用场景
- AI临床决策支持: 评估AI模型提供准确临床建议的能力
- 医学教育: 临床推理技能的培训和评估
- 质量保证: 根据既定临床标准对AI系统进行基准测试
- 比较分析: 专业医学领域的跨模型性能评估
引用信息
如果您在研究中使用此数据集,请引用我们的论文:
@article{chen2025gaps,
title={GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians},
author={Chen, Xiuyuan and Sun, Tao and Su, Dexin and Yu, Ailing and Liu, Junwei and Chen, Zhe and Jin, Gangzeng and Wang, Xin and Liu, Jingnan and Xiao, Hansong and Zhou, Hualei and Tao, Dongjie and Guo, Chunxiao and Yang, Minghui and Xia, Yuan and Zhao, Jing and Fan, Qianrui and Wang, Yanyun and Zhen, Shuai and Chen, Kezhong and Wang, Jun and Sun, Zewen and Zhao, Heng and Guan, Tian and Wang, Shaodong and Chang, Geyun and Deng, Jiaming and Chen, Hongchengcheng and Feng, Kexin and Li, Ruzhen and Geng, Jiayi and Zhao, Changtai and Wang, Jun and Lin, Guihu and Li, Peihao and Liu, Liqi and Wei, Peng and Wang, Jian and Gu, Jinjie and Wang, Ping and Yang, Fan},
journal={arXiv preprint arXiv:2510.13734},
year={2025}
}
## 许可
MIT License
## 数据加载示例(表格/文本类)
```python
import pandas as pd, glob, os
files = (glob.glob(os.path.join(path, "**", "*.csv"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.tsv"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.xlsx"), recursive=True))
print("数据文件:", files)
df = pd.read_csv(files[0])
print(df.shape); print(df.columns.tolist()); print(df.head(3))
源站:modelscope.cn/datasets/AQ-MedAI/ThoracicSurgeryEvaluationSet
精度瓶颈?数据缺失?
当前公开数据无法满足您的算法精度?千方提供针对 其他 的高质量、多模态真实临床数据定制解决方案。




