即取即用的 AI-Ready 医疗数据集库

千方医数集致力于为医疗 AI 研究人员找到合适的数据集,让你的 AI 感知模型能够更快地学习、更准确地运行,并无缝适应现实世界的环境。

数据标签

医学影像 AI-Ready 数据集

电子病历与文本数据集

病灶分割与标注数据集

共 277 个数据集

TREC PM — 精准医学信息检索评测基准 AI-Ready Wikipedia | 千方医数集
信息检索精准医学肿瘤学临床试验匹配

TREC PM — 精准医学信息检索评测基准 AI-Ready Wikipedia | 千方医数集

约 29GB(含语料库)155 个癌症案例4 轮年度评测免费获取155 个合成癌症案例
Quilt-1M — 病理组织学百万图文对数据集 AI-Ready Wikipedia | 千方医数集
病理组织学视觉-语言模型多模态图文对齐

Quilt-1M — 病理组织学百万图文对数据集 AI-Ready Wikipedia | 千方医数集

约 100 万图文对~110GB教育视频来源
MedQA — 中美医学执照考试问答数据集 AI-Ready Wikipedia | 千方医数集
医疗 NLP问答系统医学考试LLM 评测多语言

MedQA — 中美医学执照考试问答数据集 AI-Ready Wikipedia | 千方医数集

6.1 万道多语言选择题18 本医学教科书语料61,097 道医学考试题
PubMedQA — 生物医学文献问答推理数据集 AI-Ready Wikipedia | 千方医数集
生物医学 NLP问答系统文献推理LLM 评测

PubMedQA — 生物医学文献问答推理数据集 AI-Ready Wikipedia | 千方医数集

1000 专家标注 + 27.3 万自动生成MIT 开源许可证免费获取YesNoMaybe 三分类27.4 万条 QA 实例
MedReCo-DB — 大规模对比影像推理数据库 AI-Ready Wikipedia | 千方医数集
多模态影像对比推理病例检索视觉语言模型VQA

MedReCo-DB — 大规模对比影像推理数据库 AI-Ready Wikipedia | 千方医数集

约 69 万张图像7 种影像模态139 个临床实体4 国 8 机构16 万+ 名患者
MIMIC-IV-Note — 去标识化临床自由文本语料库 AI-Ready Wikipedia | 千方医数集
临床自然语言处理电子健康记录出院摘要放射报告

MIMIC-IV-Note — 去标识化临床自由文本语料库 AI-Ready Wikipedia | 千方医数集

约 45GB(压缩 CSV)331794 份出院摘要2321355 份放射报告HIPAA 去标识化14.6 万名患者
TrialBench — 多模态临床试验预测数据集 | 千方医数集
临床试验预测多模态融合药物研发SMILES分子图NLP文本

TrialBench — 多模态临床试验预测数据集 | 千方医数集

约 480000+ 临床试验记录23 个 AI-Ready 子数据集8 大预测任务48 万+ 试验记录
Open-PMC-18M | 生物医学多模态视觉-语言数据集 | 千方医数集
多模态视觉-语言文献挖掘图像-文本对

Open-PMC-18M | 生物医学多模态视觉-语言数据集 | 千方医数集

约 1800 万对图文对放射学显微镜VLP 三模态PMC 来源文献来源数据集
HMP 人类微生物组计划 | 千方医数集
基因组多组学微生物组

HMP 人类微生物组计划 | 千方医数集

约 42 TB 大小11174+ 样本2000+ 参考基因组300+ 健康成人 + 1,500+ 疾病队列
PDB 蛋白质数据银行 | 千方医数集
蛋白质结构结构生物学药物发现分子对接

PDB 蛋白质数据银行 | 千方医数集

约21万+结构约500GB压缩X-raycryo-EMNMR分子级数据
GEO 基因表达综合数据库 | 千方医数集
转录组学功能基因组学公共数据库

GEO 基因表达综合数据库 | 千方医数集

约 200TB+ 数据量650 万+ 样本20 万+ 研究650 万+ 样本
ENCODE — DNA 元素百科全书 AI-Ready Wikipedia | 千方医数集
功能基因组学表观基因组基因调控多组学

ENCODE — DNA 元素百科全书 AI-Ready Wikipedia | 千方医数集

23,000+ 功能基因组学实验2,373,014 人类 cCRE1.3 PB 数据总量人类与小鼠基因组

定制数据集服务

无法找到所需数据?我们提供个性化的临床数据采集与高精度人工标注服务,满足您的特定算法研发需求。