fastMRI

fastMRI — 全球最大的原始 k 空间 MRI 重建数据集 | 千方病案医数集

来源 NYU Langone Health CAI2R + Meta AI Research (FAIR) · https://fastmri.med.nyu.edu/发布时间: 2026-08-03最后更新: 2026-08-03 阅读 2

信息速览

数据集名称fastMRI
数据类型约 1.45 TB HDF5, 8876+ 例全采样, 20000+ 例 DICOM, 12+ 扫描仪, 代码 MIT 开源
规模8,876+ 人
接入方式NYU Langone Health CAI2R + Meta AI Research (FAIR) · https://fastmri.med.nyu.edu/
AI 就绪度

INFOBOX

数据集名称 fastMRI
英文全称 fastMRI: An Open Dataset and Benchmarks for Accelerated MRI
别名 / 简称 NYU fastMRI、fastMRI Knee/Brain/Prostate/Breast
疾病分类 多解剖区域覆盖。膝部:FA30–FA3Z 半月板与韧带损伤、FA20–FA2Z 关节软骨病变;脑部:8A00–8E2Z 脑血管病与颅内肿瘤;前列腺:2C82 前列腺恶性肿瘤
SNOMED CT 239873007 Meniscal tear / 55561003 Fracture of bone / 126906006 Neoplasm of brain / 399068003 Malignant tumor of prostate / 128462008 Abscess 等跨区域多疾病映射(详见 §2.2)
数据模态 MRI(原始 k 空间复数数据 + DICOM 重建图像,覆盖 4 个解剖区域)
AI 任务类型 图像重建(k 空间→图像域)、超分辨率、迁移学习、病灶检测(fastMRI+)、分类(Prostate PI-RADS)、联合重建-诊断
样本总数 完全采样原始 k 空间:1,594 膝部 + 6,970 脑部 + 312 前列腺 + 300 乳腺 = 9,176 例全采样;临床 DICOM:10,012 膝部 + 10,000 脑部 = 20,012 例
数据大小 HDF5 原始 k 空间约 1.35 TB(multicoil_train 931 GB + multicoil_val 192 GB + multicoil_test 109 GB);DICOM 图像额外数十 TB
数据格式 HDF5(复数 k 空间,含 ISMRMRD XML 头信息)/ DICOM / CSV(标签)/ NIfTI(转换后)
许可证 NYU fastMRI Data Sharing Agreement(仅限内部研究与教育用途,禁止再分发);GitHub 代码仓库 MIT 开源
访问级别 申请审核(在线签署 DUA,填写研究用途,逐数据集单独申请)
DUO 标签 HMB, NPUNCU
语言 英文(ISMRMRD 元数据、数据集文档)
首发日期 2018-11-22(arXiv 预印本,膝部 + 脑部初始发布)
最后更新 2024-04-20(前列腺数据集正式发表,Sci Data 11:404;乳腺数据集同期扩展)
发布机构 NYU Langone Health, Center for Advanced Imaging Innovation and Research (CAI2R) × Meta AI Research (FAIR)
官方主页 https://fastmri.med.nyu.edu/
下载地址 https://fastmri.med.nyu.edu/(在线申请)/ AWS S3 Open Data: s3://fastmri-dataset/
DOI 膝部:10.1148/ryai.2020190007;脑部挑战:arXiv:2012.06318;前列腺:10.1038/s41597-024-03252-w
引用次数 4,800+(arXiv 1811.08839 主论文,Google Scholar,截至 2026-07);Knoll et al. 2020 膝部论文 1,200+
AI 就绪度评分 ⭐⭐⭐⭐⭐(5/5)— 官方 train/val/test 划分 + PyTorch 数据加载器 + 基准模型 + 云端(AWS)分发 + 挑战赛排行榜 + 前瞻性临床验证
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、多解剖区域临床任务定义、RSS 金标准合理性)、§7 偏倚分析。

数据工程审核者:[千方病案医学编辑部]交叉审核,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-07-29

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。fastMRI 数据受 NYU Data Sharing Agreement 约束,仅限内部研究和教育用途,严禁再分发。各子集(膝部/脑部/前列腺/乳腺)有独立 DUA,需分别申请。GitHub 代码仓库(MIT 许可证)与数据集的许可条款相互独立。

§1 数据集概览

§1.0 📌 30 秒速览

fastMRI 是由 NYU Langone Health 与 Meta AI Research(前 Facebook AI Research)于 2018 年联合发布的全球最大原始 MRI k 空间数据集。它覆盖膝部、脑部、前列腺和乳腺四大解剖区域,提供了超过 9,000 例完全采样的原始复数 k 空间数据(HDF5 格式)以及 20,000 余例临床 DICOM 重建图像,总规模约 1.45 TB。

它的独特价值在于提供了 MRI 成像链条中最底层的"原材料"——未被任何后处理算法加工过的 k 空间复数数据。这意味着研究者可以从零开始构建和验证 AI 加速 MRI 重建算法,而不受厂商特定重建管道的限制。fastMRI 配套的官方 PyTorch 工具链、基准模型(U-Net / E2E-VarNet)和在线排行榜直接定义了 AI 加速 MRI 研究的标准化范式。更关键的是,Johnson et al.(2023,Radiology)完成的前瞻性临床试验证明,基于 fastMRI 训练的 DL 重建可将膝部 MRI 扫描时间缩减近一半(9:56 → 5:33),且诊断等效——这是 AI 医学影像公开数据集中极少见的"闭环验证"。

你可以用它来:训练多线圈/单线圈 MRI 重建模型并提交在线排行榜、研究不同欠采样模式和加速因子下的重建质量、或者利用 fastMRI+ 的专家病灶标注探索重建-诊断联合学习范式。前列腺和乳腺扩展将 fastMRI 推向了癌症影像领域。

§1.1 摘要

fastMRI 将临床 MRI 扫描仪直接输出的 ISMRMRD 原始 k 空间文件转换为简化的 HDF5 格式,每个文件包含多线圈复数 k 空间张量(形状:slices × coils × height × width)、根平方和(RSS)重建图像(作为金标准),以及完整的 ISMRMRD XML 采集参数头信息。膝部数据还包括通过最小二乘线性组合模拟的单线圈 ESC(Emulated Single-Coil)数据,以降低入门门槛。

数据集的核心创新在于"k 空间优先"的设计哲学——几乎所有公开医学影像数据集都只提供经过厂商重建和临床后处理的 DICOM 图像,而 fastMRI 保留了测量层面的原始信息,使研究者可以直接操控欠采样掩模、线圈灵敏度、重建算法等关键变量。2020 年挑战赛引入的 Transfer Track(训练 Siemens 数据 → 测试 GE/Philips 数据)进一步推动了跨厂商泛化研究。

fastMRI+(Zhao et al., 2022)补充了 23,724 个放射科专家的病灶边界框标注,将数据集从"纯重建"升级为"重建+诊断"双任务平台。前列腺子集(Tibrewala et al., 2024)则提供了 PI-RADS v2.1 分级标签,将 fastMRI 框架延伸至癌症影像。

§1.2 战略价值分析

维度一:技术范式 —— k 空间革命的"标准语料"

在 fastMRI 之前,AI 加速 MRI 重建研究高度碎片化——每个研究组使用自采数据、自定义指标和不统一的评估协议。fastMRI 通过"统一数据格式(HDF5)+ 标准指标(SSIM/NMSE/PSNR)+ 公共排行榜 + 开源基准"四件套,直接定义了该领域的实验标准。2020 年挑战赛收到来自全球 44 个团队的 224 份提交,其影响力堪比 ImageNet 之于计算机视觉。截至 2026 年,几乎所有提出新 MRI 重建算法的论文都至少用 fastMRI 做一次实验对比。

维度二:临床转化 —— 从回顾性实验到前瞻性验证的"全链条"

fastMRI 的独特之处在于它不仅是一个算法训练数据集,还直接驱动了临床部署。Johnson et al.(2023,Radiology)用 fastMRI 训练的模型在 170 名患者的前瞻性试验中实现了膝部 MRI 扫描时间近半缩减,且六名肌骨放射科医生评定为诊断等效、图像质量更优(P < 0.001)。这是公开医学影像数据集中极为罕见的"从训练数据到 FDA 可循证的前瞻性临床试验"完整闭环,为 AI 数据集的设计提供了范本。

维度三:生态扩展 —— 从重建到诊断的多维平台

fastMRI+(病理标注)、fastMRI Prostate(PI-RADS 分级)、fastMRI Breast(DCE 动态增强)和社区衍生的多项跨任务研究(联合重建-分类、不确定性量化、自监督预训练)将 fastMRI 从单一重建基准推进为多任务、多脏器、多序列的 MRI AI 研究生态系统。

§1.3 同类数据集对比

数据集 k 空间 样本量 解剖区域 多线圈 MRI 序列 标注 差异化
fastMRI ✅ 复数 9,176 例全采样 + 20,000+ DICOM 膝/脑/前列腺/乳腺 ✅ 4-32 通道 12+ fastMRI+ 病灶框 + PI-RADS 唯一含临床验证的原始 k 空间数据集
Calgary-Campinas ✅ 复数 167 例 ✅ 12 通道 T1 脑分割 mask 多厂商(Siemens/GE/Philips)但规模小
mridata.org ✅ 复数 ~200 例 膝/脑/心脏 ✅ 多通道 多样 社区驱动但无标准划分
SKM-TEA DICOM 272 例 多样 手术金标准 + qMRI 量化 外科金标准但无 k 空间
OAI DICOM 4,796 例 多样 骨关节炎评分 纵向队列但无 k 空间
CMRxRecon ✅ 复数 300 例 心脏 ✅ 多通道 电影/延迟增强 心脏功能参数 心脏专用,2024 年新发布
IXI NIfTI 600 例 T1/T2/PD/MRA 多模态但仅 NIfTI

§1.4 版本演进时间轴

时间 事件
2018-11 首次发布:arXiv 1811.08839,膝部 k 空间(~1,500 例)+ 膝部 DICOM(10,000 例)+ 脑部 k 空间(~6,970 例)
2019-12 膝部重建挑战赛(2019 挑战赛),首次建立公共排行榜
2020-01 Knoll et al. 膝部数据集正式发表,Radiology: Artificial Intelligence 2(1): e190007
2020-07 2020 挑战赛启动:脑部 3 赛道(4× / 8× / Transfer),894 例挑战评估数据,44 支团队
2020-10 E2E-VarNet 论文(Sriram et al.),官方基准模型发布
2020-12 2020 挑战赛结果公布,AIRS Medical 包揽全部三赛道冠军
2021-12 2020 挑战赛结果论文(Muckley et al.)发表
2022-03 fastMRI+(Zhao et al.,Scientific Data):膝部 16,154 + 脑部 7,570 个病灶边界框标注
2023-01 数据版本 v2.0 发布,HDF5 格式统一化,新增 manifest 文件;Johnson et al. 前瞻性临床验证发表于 Radiology 307: e220425
2023-04 fastmri.org 域名从 Meta 转移至 NYU,排行榜暂时下线
2023-05 fastMRI Prostate 数据集发布(arXiv 2304.09254),含 PI-RADS v2.1 标注
2024-04 fastMRI Prostate 正式发表于 Scientific Data 11:404;fastMRI Breast(DCE GRASP)数据集扩展
2024-05 FI-VarNet(Giannakopoulos et al.,Scientific Reports):开源模型中最优,fastMRI 排行榜第 2 名

§1.5 典型应用场景

  • AI 加速 MRI 重建:在 4×/8×/10× 欠采样因子的条件下,训练从不足一半的 k 空间数据恢复高质量图像的深度网络

  • 跨厂商迁移学习:使用 Siemens 膝部/脑部数据训练,在 GE/Philips 数据上评估泛化性能(Transfer Track 场景)

  • 低场强 MRI 增强:利用 1.5T 和 3T 的配对知识辅助低场强(如 0.55T)设备图像质量提升

  • 重建-诊断联合学习:利用 fastMRI+ 的病理标注和 Prostate 的 PI-RADS 分级训练"加速重建同时保留病变信息"的联合任务模型

  • 自监督/无监督预训练:利用 HDF5 中的全采样 k 空间金标准构造大规模自监督信号,作为 MRI 通用特征提取器的预训练语料

  • MRI 物理模拟研究:用复数 k 空间数据验证新型采样轨迹(螺旋、径向、泊松圆盘)和压缩感知重建的理论性质

§2 医学背景

§2.1 疾病分类(ICD-11)

由于 fastMRI 覆盖四个解剖区域和多种临床场景,疾病分类按子集分别映射:

子集 ICD-11 编码 疾病分类 典型临床关联
膝部 FA30-FA3Z 半月板与韧带损伤 前交叉韧带撕裂、半月板桶柄样撕裂
FA20-FA2Z 关节软骨病变 骨关节炎、软骨磨损
NC72 骨折 胫骨平台骨折、骨挫伤
脑部 8A00-8E2Z 脑血管病 缺血性卒中、颅内出血
2A00 颅内肿瘤(原发) 胶质瘤、脑膜瘤
6D80 白质病变 微血管缺血性改变
前列腺 2C82 前列腺恶性肿瘤 临床显著性前列腺癌
乳腺 2C60-2C6Z 乳腺恶性肿瘤 乳腺癌

§2.2 SNOMED CT 映射

数据集涉及病理 ICD-11 SNOMED CT SNOMED CT 术语
Meniscal Tear FA36 239873007 Tear of meniscus of knee (disorder)
Anterior Cruciate Ligament Rupture FA32 444470001 Complete tear of anterior cruciate ligament (disorder)
Osteoarthritis of Knee FA20 239873007 Osteoarthritis of knee (disorder)
Intracranial Tumor 2A00 126906006 Neoplasm of brain (disorder)
Ischemic Stroke 8B11 422504002 Ischemic encephalopathy (disorder)
White Matter Disease 6D80 230753003 Cerebral white matter disease (disorder)
Prostate Cancer 2C82 399068003 Malignant tumor of prostate (disorder)
Breast Cancer 2C60 254837009 Malignant tumor of breast (disorder)

§2.3 临床任务定义

fastMRI 覆盖的临床任务按子集和数据类型分层:

子集 数据类型 临床任务 AI 任务
膝部 (raw k-space) PD/PDFS 全采样 加速重建——在减少扫描时间的同时保持解剖结构清晰度 图像重建(欠采样 k 空间 → 全质量图像)
膝部 (DICOM) 多对比度临床序列 通过常规 MRI 评估半月板、韧带和软骨损伤 重建增强 / 迁移学习源
膝部 (fastMRI+) 22 类病理标注 在加速重建后的图像上检测半月板撕裂、骨髓水肿、骨折等 重建图像上的病灶检测
脑部 (raw k-space) T1/T1POST/T2/FLAIR 全采样 加速重建——在各种对比度下保持病理细节(肿瘤、卒中、白质病变) 图像重建 + 跨对比度泛化
脑部 (fastMRI+) 30 类病理标注 检测颅内肿瘤、卒中、微血管缺血等 重建图像上的病灶检测
前列腺 T2 + DWI,PI-RADS v2.1 加速重建后的前列腺癌风险评估 重建 + slice/volume/exam 三级 PI-RADS 分类
乳腺 径向 3D DCE 动态增强 MRI 加速重建 + 对比动力学提取 4D (x,y,z,time) 重建 + 恶性/良性分类

关键区分:fastMRI 的核心 AI 任务是图像重建(从欠采样的 k 空间恢复图像),而非传统的检测或分类。这是它与 CheXpert、DeepLesion 等数据集的根本区别——它不提供"这张图有什么病"的答案,而是提供"如何从更少的测量中得到和完全采样一样好的图"的实验平台。

§2.4 患者人群特征

维度 膝部 (raw k-space) 脑部 (raw k-space) 前列腺 乳腺
患者数 约 1,200(估算) 约 6,500(估算) 312 300
年龄 成人为主,≥18 岁 成人为主,≥18 岁 中老年男性 成年女性
性别 男女均有分布 男女均有分布 男性 女性
数据来源 NYU Langone Health 临床 MRI 检查(2016-2019) NYU Langone Health 临床 MRI 检查,5 个院区 NYU Langone Health 临床前列腺 MRI(2016-2022) NYU Langone Health 临床乳腺 DCE-MRI
扫描仪 Siemens Skyra 3T (663), Prisma 3T (83), Biograph mMR 3T (153), Aera 1.5T (695) Siemens 3T Prisma/Skyra/Biograph/Tim Trio + 1.5T Avanto/Aera (11 磁体) Siemens 3T (多种型号) Siemens 3T
入排标准 常规临床标准,含正常和病理病例 常规临床标准,覆盖广泛神经病理学谱系 临床前列腺 MRI 指征 临床乳腺 DCE-MRI 指征
地域 美国纽约大都会区 美国纽约大都会区(5 个临床院区) 美国纽约大都会区 美国纽约大都会区

§2.5 临床意义

MRI 是软组织成像的金标准,但其主要瓶颈是扫描时间长——一次完整的膝关节 MRI 检查通常需要 15-25 分钟,脑部多序列检查甚至可达 30-45 分钟。长扫描时间导致患者不适(导致运动伪影)、低患者通量(增加医疗成本)以及幽闭恐惧症和儿科等特殊人群的使用受限。AI 加速 MRI 的核心临床价值是:用更少的 k 空间测量重建出诊断等效的图像,从而缩减扫描时间、降低成本、改善患者体验。fastMRI 正是这一转化路线的"发射台"——从原始 k 空间到挑战赛排行榜,再回到前瞻性临床试验,展示了数据集驱动医学影像技术变革的可能性。

§2.6 金标准 / 参考标准

子集 数据类型 金标准 标注者资质
膝部 (raw) 多线圈 k 空间 Root-Sum-of-Squares (RSS) 全采样重建 数学定义——无需人工标注
膝部 (single-coil) ESC 模拟数据 ESC 重建(单线圈 IFFT)+ RSS 重建(双通道 gtruth) 数学定义
脑部 (raw) 多线圈 k 空间 RSS 全采样重建 数学定义
fastMRI+ 膝部 16,154 个边界框 放射科专家(board-certified,10+ 年经验) 1 名标注者(单读者,无 IAA)
fastMRI+ 脑部 7,570 个边界框 + 643 研究级标签 放射科亚专科专家 1 名标注者
前列腺 PI-RADS v2.1 切片/容积/检查三级标签 专科培训放射科医生(fellowship-trained) 1 名标注者
乳腺 检查级恶性/良性标签 临床诊断结果 临床金标准

⚠️ 金标准局限性:RSS 重建虽然无偏(不依赖特定线圈灵敏度估计算法),但存在清晰的背景噪声且丢弃了相位信息。2020 挑战赛报告已明确承认,RSS 金标准中的背景噪声会影响排名。挑战赛通过在第二阶段引入放射科医师人工评审来弥补这一局限。

§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 理由
“我要入门做 MRI 重建,最简单上手” Knee single-coil (ESC) 单线圈去掉并行成像复杂性;320×320 固定分辨率;U-Net 基准开箱即用
“我要复现 SOTA 重建方法” Knee/Brain multicoil (HDF5) 15-32 通道真实多线圈数据;E2E-VarNet / FI-VarNet 全部基于此
“我要研究跨厂商泛化” 2020 挑战赛 Transfer Track 数据 Siemens→GE/Philips 的分布迁移挑战;GE 数据无频率过采样(独特的适应难点)
“我要做重建+诊断联合学习” Knee/Brain + fastMRI+ 在 RSS 重建图像上叠加 22/30 类病理边界框
“我是前列腺癌 AI 研究者” fastMRI Prostate (312 例) 唯一的公开前列腺 k 空间数据集 + PI-RADS v2.1 切片级标签
“我做动态增强/DCE 重建” fastMRI Breast (300 例) 径向 k 空间 4D 数据 + GRASP 重建代码

§3.1 膝部 k 空间数据规格

参数
扫描数 1,594 个全采样容积(PD 796 + PDFS 798),不含挑战赛保留数据
扫描仪 Siemens Magnetom Skyra 3T (663), Prisma 3T (83), Biograph mMR 3T (153), Aera 1.5T (695)
线圈通道 15 通道膝关节线圈阵列
序列 冠状位质子密度加权,含/不含脂肪抑制(CORPD / CORPDF),笛卡尔二维 TSE
矩阵 320 × 320(频率编码 × 相位编码,中心裁剪后)
分辨率 0.5 mm × 0.5 mm 平面内,3 mm 层厚,无层间距
TR/TE TR 2,200–3,000 ms,TE 27–34 ms(因系统而异)
ETL 4
单线圈(ESC) 通过最小二乘线性组合模拟

§3.2 膝部 DICOM 数据规格

参数
检查数 10,012 例,来自 9,290 名患者
包含序列 冠状 PD ± 脂肪抑制 / 轴向 PD 脂肪抑制 / 矢状 PD / 矢状 T2 脂肪抑制
扫描仪 多厂商、多型号(比 raw 数据更广泛的多样性)
重建方式 使用各厂商的并行成像算法进行临床加速重建
与 raw 数据关系 不同患者队列——DICOM 和 HDF5 中的患者不重叠

§3.3 脑部 k 空间数据规格

参数
容积数 6,970 例全采样,合计 7,002 个扫描(部分容积含多个对比度)
扫描仪 Siemens 3T (Prisma/Skyra/Biograph/Tim Trio) + Siemens 1.5T (Avanto/Aera),共 11 磁体、5 临床院区
线圈通道 主要为 32 通道头部线圈
序列 轴位 T1 加权 / T1 增强后 (T1POST) / T2 加权 / FLAIR,二维采集
矩阵 因协议而异(未统一为 320×320)
频率过采样 Siemens 机器有(频率编码方向 2× over-sampling);某些 GE 机器无——影响 Transfer Track
去标识化 将眶缘以下 ~5 mm 的 k 空间切片替换为零矩阵后重建,经认证 MR 技师逐一目视确认面部特征不可辨识
脑部序列分布
场强 T1 T1POST T2 FLAIR 合计
1.5T 382 849 1,655 126 3,012
3T 409 646 2,524 411 3,990
合计 791 1,495 4,179 537 7,002

§3.4 脑部 DICOM 数据规格

参数
检查数 10,000 例(10,000 名独立受试者)
序列 轴位 T1 / T2 / T2 FLAIR
与 raw 数据关系 零患者重叠——DICOM 和 HDF5 是完全独立的人群

§3.5 前列腺数据规格

参数
患者数 312
检查数 312
容积数 1,560(T2 + DWI 各 312 个检查,每检查平均 2.5 个容积)
切片数 47,468
扫描仪 3T Siemens
序列 轴位 T2 加权 TSE + 轴位扩散加权 EPI
标注 切片/容积/检查三级 PI-RADS v2.1(专科培训放射科医师,回顾性标注)
推荐划分 train 218 / val 48 / test 46
PI-RADS 检查级分布 PI-RADS 1 12% / 2 24% / 3 11% / 4 35% / 5 18%(训练集近似于此比例)

§3.6 乳腺数据规格

参数
患者数 300
扫描仪 3T Siemens
序列 Golden-angle 径向 3D 动态对比增强(DCE),自由呼吸采集
k 空间类型 径向采样(非笛卡尔),与膝部/脑部的笛卡尔数据不同
数据维度 4D (x, y, z, time)
样本数 300 个独立 HDF5 文件(每检查一个,含 GRASP 重建参数)
标签 检查级恶性/良性临床标签
配套代码 GitHub: demo_dce_recon(GPU 加速 GRASP/ESPIRiT 径向重建)

§3.7 fastMRI+ 标注规格

参数 膝部 脑部
病灶边界框数 16,154 7,570
研究级标签数 13 643
病理类别 22 类(半月板撕裂、骨髓水肿、骨折、软骨病变等) 30 类(颅内肿瘤、卒中、白质病变、水肿等)
标注者 Board-certified 放射科亚专科专家(10+ 年) Board-certified 神经放射科亚专科专家
标注工具 MD.ai 平台 MD.ai 平台
标注字段 filename, slice, x, y, width, height (pixel), label 同上
许可证 CC-BY 4.0(独立于 fastMRI 数据 DUA) CC-BY 4.0

§3.8 数据划分策略

数据集 训练 验证 测试 方式
膝部 multicoil 973 scans 199 scans 118 scans (public) + 挑战保留 扫描级随机划分
膝部 singlecoil 与 multicoil 对应(ESC 衍生) 与 multicoil 对齐
脑部 multicoil ~4,500 scans ~700 scans ~558 scans (public test) + 894 (challenge eval) 扫描级随机划分
前列腺 218 patients 48 patients 46 patients 患者级随机(PI-RADS 分布均衡)
乳腺 未标准化划分 需自行划分
膝部 DICOM 10,012 exams 无预定义划分
脑部 DICOM 10,000 exams 无预定义划分

⚠️ 关键注意:挑战赛保留的评估数据不会公开释放,以维护排行榜完整性。研究者可以使用公共测试集提交到在线排行榜获取反馈。

§3.9 数据大小与存储

数据集 训练 验证 测试
膝部+脑部 multicoil HDF5 ~931 GB ~192 GB ~109 GB
小计 HDF5 ~1,232 GB
膝部 DICOM 数十 TB(10,012 检查)
脑部 DICOM 数十 TB(10,000 检查)
前列腺 HDF5 + DICOM 下载即包含全部 312 例
乳腺 HDF5 下载即包含全部 300 例
估算总计 ~1.45 TB (HDF5) + 数十 TB (DICOM)

数据可通过 NYU 下载门户(签署 DUA 后获取链接)或 AWS S3 开放数据(s3://fastmri-dataset/)获取。AWS 访问无需 AWS 账号即可匿名列出和下载。

§3.10 深度溯源链

MRI 扫描仪 (Siemens 1.5T/3T, GE, Philips)
    │
    ├── 原始 ISMRMRD 数据(厂商原始 k 空间 + XML 头信息)
    │       │
    │       ├── 转换:ISMRMRD → 简化 HDF5(kspace + reconstruction_rss + ismrmrd_header)
    │       │       │
    │       │       ├── HDF5 train/val/test 包 → 研究者下载
    │       │       │       │
    │       │       │       ├── 欠采样掩模生成(Cartesian equispaced + autocalibration)
    │       │       │       ├── DL 重建模型 (U-Net / E2E-VarNet / FI-VarNet)
    │       │       │       └── 评估 (SSIM / NMSE / PSNR) → 排行榜
    │       │       │
    │       │       └── RSS 重建 → DICOM 导出 → PACS → 放射科医师人工审阅 (PHI 检查)
    │       │               │
    │       │               └── fastMRI+ 标注 (MD.ai → CSV 边界框)
    │       │
    │       └── ESC 模拟:多线圈 → 线性组合 → 单线圈复数 k 空间(仅膝部)
    │
    └── 临床重建 (厂商并行成像) → DICOM → PHI 清理 (RSNA CTP) → 人工核查 → 发布
            │
            └── 膝部 DICOM (10,012 exams) + 脑部 DICOM (10,000 exams)

§4 数据结构详解

§4.1 HDF5 文件结构(膝部/脑部 multicoil)

每个 .h5 文件代表一个 MRI 容积,包含以下结构:

数据集(Datasets):

# 训练/验证文件
{
    "kspace":              ndarray[complex64]  # 形状: (n_slices, n_coils, height, width)
    "reconstruction_rss":  ndarray[float32]    # 形状: (n_slices, cropped_H, cropped_W)
                                               # 膝部裁剪至 320×320, 脑部因序列而异
}

# 测试文件(额外含欠采样掩模)
{
    "kspace":              ndarray[complex64]  # 欠采样后的 k 空间
    "mask":                ndarray[int8]       # 形状: (width,) 笛卡尔采样轨迹
                                               # 1 = 获取的 k 空间线, 0 = 未获取
}

属性(Attributes):

属性键 类型 训练/验证 测试 说明
acquisition string 采集协议:CORPD / CORPDF (膝部); AXFLAIR / AXT1 / AXT1POST / AXT2 (脑部)
patient_id string 匿名患者标识符(UUID 风格)
ismrmrd_header XML string 完整 ISMRMRD XML 头信息(扫描仪参数、FOV、矩阵大小、序列参数)
norm float32 目标容积的欧几里得范数(仅用于归一化)
max float32 目标容积的最大像素值(仅用于归一化)
acceleration int 欠采样加速因子(4 或 8)
num_low_frequency int 欠采样轨迹中低频校准线的数量

单线圈(膝部)文件的额外字段:

{
    "kspace":              ndarray[complex64]  # 形状: (n_slices, height, width) 单线圈
    "reconstruction_rss":  ndarray[float32]    # 多线圈 RSS 重建(金标准之一)
    "reconstruction_esc":  ndarray[float32]    # ESC IFFT 重建(另一金标准)
}

§4.2 ISMRMRD 头信息的关键字段(示例)

ISMRMRD XML 头信息完整保留了采集参数,以下为关键可提取字段:

XML 路径 含义 示例值
acquisitionSystemInformation/systemFieldStrength_T 场强 1.5 / 3.0
encoding/encodedSpace/matrixSize/x 频率编码矩阵 640
encoding/encodedSpace/matrixSize/y 相位编码矩阵 320–370
encoding/encodedSpace/matrixSize/z 层面编码 1(二维采集)
encoding/encodingLimits/kspace_encoding_step_1/minimum 最小 PE 步 0
encoding/encodingLimits/kspace_encoding_step_1/maximum 最大 PE 步 319
encoding/trajectory k 空间轨迹类型 cartesian
sequenceParameters/TR 重复时间 2200-3000 ms
sequenceParameters/TE 回波时间 27-34 ms
sequenceParameters/ETL 回波链长度 4

§4.3 前列腺 HDF5 结构

前列腺 HDF5 文件遵循相似的格式,但文件名约定不同:

  • 文件名格式: file_prostate_<sequence>_<fastmri_id>.h5
    • 示例: file_prostate_AXT2_001.h5 / file_prostate_AXDIFF_042.h5
  • 序列: AXT2(T2 加权) / AXDIFF(扩散加权)
  • 每个检查包含 2 个 HDF5 文件(T2 + DWI)
  • PI-RADS 标签以 CSV 文件提供(切片级/容积级/检查级)

§4.4 乳腺 HDF5 结构

乳腺数据采用不同的组织方式:

  • 每检查一个独立 HDF5 文件
  • 含 4D k 空间数据 (x, y, z, time)
  • 包含径向特定的采集参数——k 空间轨迹坐标、GRASP 重建参数
  • 配套代码支持径向 k 空间的非笛卡尔重建(网格化 + ESPIRiT + GRASP)

§4.5 fastMRI+ CSV 标注格式

Filename,Slice,x,y,Width,Height,Label,Study Level
file_brain_AXT1_200_2000322.h5,8,120,85,45,38,Mass,No
file_brain_AXT2_201_2010306.h5,0,,,,Stroke,Yes
字段 说明
Filename 对应该切片的 fastMRI HDF5 文件名
Slice 切片编号(0 索引,对应 kspace 的第一维)
x, y 边界框左上角坐标(像素,基于 RSS 重建图像坐标系)
Width, Height 边界框宽高(像素)
Label 病理类别标签
Study Level “Yes” 表示研究级标签(Slice=0 时使用,无边界框)

§5 数据划分与使用建议

§5.1 官方划分策略

fastMRI 使用扫描级(scan-level)随机划分,而非患者级。官方原因:同一患者的多次扫描可能间隔数月,且不同的脉冲序列组合使同一患者的扫描在视觉和物理特性上差异显著——因此按扫描划分被认为是合理的。

优势 注意事项
最大化了训练数据的多样性 同一患者的不同扫描可能分别出现在训练集和验证集
与挑战赛评估设计一致 如果研究目标是严格的患者级泛化,需额外设计患者级划分
官方加载器直接支持 前列腺子集提供了患者级划分(train 218 / val 48 / test 46)

§5.2 训练/验证/测试常用组合策略

策略 描述 用途
官方划分(推荐) train.tar.gz → val.tar.gz → test.tar.gz 标准基准,可提交排行榜
训练+验证联合训练 train + val 合并训练 → test 评估 排行榜常用策略(HUMUS-Net 等)——通常带来 0.002-0.005 SSIM 提升
患者级自定义划分 从 raw 数据元数据提取 patient_id → 按患者分组 独立研究泛化性(需额外脚本)
跨序列泛化 训练 PD → 测试 PDFS(膝部);训练 T1 → 测试 FLAIR(脑部) 评估对比度域迁移能力
Transfer Track 模式 训练 Siemens → 测试 GE/Philips 跨厂商泛化研究

§5.3 评估指标

fastMRI 官方使用以下三个指标进行定量评估:

指标 公式 方向 说明
SSIM 亮度+对比度+结构三项乘积 ↑ 越好(0-1) 2020 挑战赛主指标;window=7×7,与 scikit-image 默认参数一致
NMSE ‖x̂ - x‖²₂ / ‖x‖²₂ ↓ 越好(0-∞) 归一化均方误差,能惩罚大误差
PSNR 10·log₁₀(max² / MSE) ↑ 越好(dB) 峰值信噪比,MRI 社区常用补充指标

⚠️ SSIM 的局限:2020 挑战赛报告指出,SSIM 与放射科医师对病理细节的评估不一定完全一致。挑战赛因此设计为"SSIM 筛选前 3 → 6 名放射科医生盲审"的两阶段流程。

§5.4 放射科医师质量评估量表

2020 挑战赛定性评估使用了 4 点 Likert 量表:

评分 伪影 清晰度 CNR(对比噪声比) 病理呈现质量
1(最佳) 无伪影 极锐利 极高 完全等同金标准
2 轻微,不影响诊断 锐利 良好 轻微差异
3 中等,可能影响诊断 中等模糊 可接受 可诊断但有差异
4(最差) 不可接受 严重模糊 诊断困难

6 名放射科医生(9-16 年经验,来自 Mayo Clinic、Stanford、UCLA、NYU、Pittsburgh、Baylor)对所有决赛提交进行了独立盲审。

§6 AI 就绪指南

§6.0 云端快速启动

官方 Colab/Jupyter 入门:fastMRI GitHub 仓库提供了 fastMRI_tutorial.ipynb,包含数据加载、欠采样掩模、U-Net 训练的完整入门代码。MONAI 框架直接内置了 FastMRIReader 类,一行导入即可读取 HDF5 文件。

加载器安装

pip install h5py
git clone https://github.com/facebookresearch/fastMRI.git
cd fastMRI
pip install -e .

AWS 匿名直接下载(无需 AWS 账号)

aws s3 ls no-sign-request s3://fastmri-dataset/
aws s3 cp no-sign-request s3://fastmri-dataset/... ./local_data/

§6.1 PyTorch 数据加载器

import h5py
import torch
import numpy as np
from torch.utils.data import Dataset
import xml.etree.ElementTree as ET

class FastMRIDataset(Dataset):
    """fastMRI 膝部/脑部 multicoil HDF5 Dataset。

    Args:
        file_list: list of .h5 file paths
        acceleration: None for fully-sampled (train/val), int for undersampled (test)
        center_fractions: autocalibration region sizes, e.g. [0.08, 0.04]
    """
    def __init__(self, file_list, acceleration=None, center_fractionevent-blocked=None):
        self.files = file_list
        self.acceleration = acceleration
        self.center_fractionevent-blocked= center_fractions or [0.08]

    def __len__(self):
        return len(self.files)

    def _generate_mask(self, kspace):
        """生成笛卡尔欠采样掩模(equispaced + autocalibration region)。"""
        width = kspace.shape[-1]
        num_low = int(round(width * np.random.choice(self.center_fractions)))
        mask = np.zeros(width, dtype=np.float32)

        # 中心低频校准区域(全采样)
        pad = (width - num_low + 1) // 2
        mask[pad: pad + num_low] = 1

        # 等距高频欠采样
        if self.acceleration:
            num_high = (width - num_low) // self.acceleration
            high_indices = np.random.choice(
                np.concatenate([np.arange(0, pad), np.arange(pad + num_low, width)]),
                num_high, replace=False
            )
            mask[high_indices] = 1

        return mask[np.newaxis, np.newaxis, :]  # (1, 1, width)

    def __getitem__(self, idx):
        with h5py.File(self.files[idx], ''''''''''''''''r'''''''''''''''') as f:
            # 复数 k 空间 → 两通道实数表示
            kspace = torch.from_numpy(np.array(f[''''''''''''''''kspace'''''''''''''''']))  # (slices, coils, H, W)
            kspace = torch.view_as_real(kspace)  # → (slices, coils, H, W, 2)
            kspace = kspace.permute(0, 1, 4, 2, 3)  # → (slices, coils, 2, H, W)

            # 金标准图像
            target = torch.from_numpy(np.array(f[''''''''''''''''reconstruction_rss''''''''''''''''])).unsqueeze(1)  # (slices, 1, H, W)

            if self.acceleration:
                mask = torch.from_numpy(np.array(f[''''''''''''''''mask'''''''''''''''']))  # (width,)
                # 将全采样 k 空间应用掩模模拟欠采样
                mask_4d = mask[None, None, None, :]  # (1, 1, 1, width)
                kspace_und = kspace.permute(0, 1, 3, 4, 2)  # complex at last
                kspace_und = kspace_und * mask_4d[..., None]
                kspace_und = kspace_und.permute(0, 1, 4, 2, 3)
                return kspace_und, target, mask, f.attrs[''''''''''''''''max''''''''''''''''], f.attrs[''''''''''''''''acquisition'''''''''''''''']

            return kspace, target, f.attrs[''''''''''''''''max''''''''''''''''], f.attrs[''''''''''''''''acquisition'''''''''''''''']

    def _read_ismrmrd_params(self, filepath):
        """提取 ISMRMRD XML 头信息中的关键参数。"""
        with h5py.File(filepath, ''''''''''''''''r'''''''''''''''') as f:
            xml_str = f.attrs[''''''''''''''''ismrmrd_header'''''''''''''''']

        root = ET.fromstring(xml_str)
        ns = {''''''''''''''''ismrmrd'''''''''''''''': ''''''''''''''''http://www.ismrm.org/ISMRMRD''''''''''''''''}

        params = {}
        # 场强
        field = root.find(''''''''''''''''.//ismrmrd:acquisitionSystemInformation/ismrmrd:systemFieldStrength_T'''''''''''''''', ns)
        params[''''''''''''''''field_strength''''''''''''''''] = float(field.text) if field is not None else None

        # 矩阵大小
        for dim in [''''''''''''''''x'''''''''''''''', ''''''''''''''''y'''''''''''''''', ''''''''''''''''z'''''''''''''''']:
            el = root.find(f''''''''''''''''.//ismrmrd:encoding/ismrmrd:encodedSpace/ismrmrd:matrixSize/ismrmrd:{dim}'''''''''''''''', ns)
            if el is not None:
                params[f''''''''''''''''matrix_{dim}''''''''''''''''] = int(el.text)

        return params

§6.2 预处理管道

import torch
import numpy as np

def ifft2c(kspace):
    """中心化二维 IFFT(复数输入 → 复数图像域)。"""
    # kspace 形状: (..., H, W) 复数
    kspace = torch.fft.ifftshift(kspace, dim=(-2, -1))
    image = torch.fft.ifft2(kspace, dim=(-2, -1))
    image = torch.fft.fftshift(image, dim=(-2, -1))
    return image

def fft2c(image):
    """中心化二维 FFT(复数图像域 → 复数 k 空间)。"""
    image = torch.fft.ifftshift(image, dim=(-2, -1))
    kspace = torch.fft.fft2(image, dim=(-2, -1))
    kspace = torch.fft.fftshift(kspace, dim=(-2, -1))
    return kspace

def rss(coil_images, coil_dim=1):
    """多线圈图像的根平方和 (Root-Sum-of-Squares) 复合。

    用于将重建后的多线圈图像合并为单张幅值图像。
    """
    return torch.sqrt(torch.sum(torch.abs(coil_images) ** 2, dim=coil_dim))

def complex_abs(x):
    """复数张量取幅值。输入形状: (..., 2) 最后维为 (real, imag)。"""
    return torch.sqrt(x[..., 0] ** 2 + x[..., 1] ** 2)

def normalize_instance(volume, eps=1e-11):
    """按容积归一化至零均值单位方差。"""
    mean = volume.mean()
    std = volume.std()
    return (volume - mean) / (std + eps)

def center_crop(volume, target_size=320):
    """中心裁剪。卷积极形状: (..., H, W)。"""
    _, h, w = volume.shape[-3:]
    start_h = (h - target_size) // 2
    start_w = (w - target_size) // 2
    return volume[..., start_h:start_h + target_size, start_w:start_w + target_size]

§6.3 模型推荐表

模型 参数量 膝部 8× SSIM 类型 开源 推荐场景
U-Net 214M 0.8640 图像域 CNN ✅ 官方基准 入门学习、快速实验
E2E-VarNet ~30M 0.8920 物理驱动展开网络 ✅ 官方基准 标准基线、方法对比
FI-VarNet ~28M 0.896 (4× 脑部) 特征-图像交叉域 VarNet ✅ 开源 追求开源最佳性能
HUMUS-Net 109M 0.8945 Transformer+多尺度展开 ✅ 开源 混合架构探索
HUMUS-Net-L 228M 0.8951 大模型版本 ✅ 开源 数据充足时的精度上限
XPDNet 155M 0.8893 交叉域预训练 ❌ 闭源 概念验证参考
Σ-Net 676M 0.8877 大量级 CNN ❌ 闭源 大模型效果上限参考

§6.4 计算资源建议

任务 GPU 显存 单次训练时间 备注
U-Net (膝部 4× single-coil) RTX 3090 12 GB ~12 h 入门级需求
E2E-VarNet (膝部 8× multicoil) A100 40GB 32 GB ~48 h 标准基准
E2E-VarNet (脑部 4× multicoil) A100 80GB 60 GB ~72 h 切片数多,内存压力大
FI-VarNet (脑部 4×) A100 80GB 60 GB ~60 h 开源最佳
HUMUS-Net (膝部 8×) 2× A100 80GB 80 GB ~96 h 大模型训练

§6.5 数据增强策略

fastMRI 的 MRI 特定数据增强:

增强方法 说明 物理合理性
随机翻转 左右翻转(k 空间共轭对称保证有效性) ✅ 完全物理合理
随机伽马校正 调整图像对比度(模拟不同接收增益) ✅ 近似合理
随机亮度偏移 模拟背景噪声水平变异 ✅ 合理
随机旋转 图像域旋转 ⚠️ 在 k 空间域进行比在图像域更复杂
随机弹性变形 非刚性变形 ❌ 一般不用于 MRI 重建
MixUp / CutMix 图像域混合 ⚠️ 失去物理一致性,仅作为正则化尝试

§6.6 ⚠️ 常见坑点与应对方案

坑点 影响程度 应对方案
频率过采样方向不匹配 🔴 严重 Siemens 数据在频率编码方向有 2× 过采样(k 空间维度 640 但 RSS 重建 320×320),GE Transfer Track 数据可能无过采样——直接迁移模型可能导致 SSIM 骤降 0.1-0.4。务必检查每个 .h5 文件的 kspace 维度,根据 ISMRMRD 头信息的 oversampling 标志进行中心裁剪
HDF5 复数数据格式 🟡 中等 kspace 存储为 complex64(np.complex64),PyTorch 需要转换为两通道实数(.view_as_real())或使用 torch.complex64。错误的数据类型转换是新手最常见的报错来源
RSS 金标准噪声偏置 🟡 中等 RSS 金标准的背景区域存在结构性噪声(non-central chi 分布),模型学会"重建噪声"而非"抑制噪声"。使用 L1 损失在背景区域加权可减轻。部分研究建议在评估阶段使用 SSIM 的对比度相关分量而非全局 SSIM
卷积极性裁剪后果 🟡 中等 膝部 k 空间的频率编码方向在中心裁剪前是 640(而非 320)。如果你在裁剪前的 k 空间上操作欠采样掩模,掩模维度必须与未裁剪的 k 空间匹配(640 而非 320)
切片独立 vs 容积级训练 🟡 中等 大多数基准模型按切片训练(2D),但相邻切片高度相关。简单打乱所有切片会导致验证集信息泄漏——始终按容积分折后再提取切片
多线圈到单线圈的降级路径 🟢 轻微 ESC(Emulated Single-Coil)数据是从多线圈线性拟合而来,并非真实单线圈采集。基于 ESC 训练的模型在真实单线圈数据上的表现无保证
DICOM 数据与 HDF5 数据不可联合 🔴 严重 膝部和脑部的 DICOM 与 HDF5 来自完全不同的患者队列——不能假设 DICOM 数据包含 HDF5 患者的"临床参考"。如果做重建-诊断联合训练,需使用 fastMRI+(在 HDF5 数据上标注)而非临床 DICOM
Facebook → Meta 品牌更名和域名转移 🟢 轻微 fastmri.org 域名于 2023-04-17 从 Meta 转移至 NYU。旧 URL 可能重定向失败,排行榜目前不可用。论文应引用 fastmri.med.nyu.edu 而非旧地址
脑部去标识化的切片跳过 🟡 中等 脑部 k 空间数据约在眶缘以下 5 mm 处被零填充,意味着某些颅底结构的重建是不完整的。如果研究关注颅底病变或鼻窦,需要注意这些切片不可用

§7 质量评估与局限性

§7.1 数据质量验证

维度 验证方式 结果
k 空间完整性 ISMRMRD 头信息与张量维度的交叉校验 所有发布的 HDF5 文件经验证一致
去标识化 自动:ISMRMRD 转换+RSNA CTP;人工:逐一 DICOM 图像 PHI 检查+k 空间元数据抽查 无已知 PHI 泄露(脑部额外人工核查面部特征)
重建保真度 RSS 重建与原厂并行成像重建对比 RSS 通常质量更高(全采样 vs 临床加速)
病灶标注质量 Board-certified 放射科医师使用 MD.ai 平台 单读者标注,无 IAA 统计(fastMRI+ 的限制)
伦理合规 NYU IRB 批准,独立 DUA 合规

§7.2 RSS 金标准的内在局限

RSS 作为一种无偏的线圈复合方法有两个不容忽视的短板:

  1. 相位信息丢弃:RSS 只保留幅值,丢弃了复数图像的相位分量。相位在定量 MRI(如 SWI、相位对比流速测量、温度测量)中至关重要——在这些任务中 RSS 不是合适的金标准。
  2. 背景噪声偏置:在无信号的背景区域,RSS 将多个线圈的独立噪声非相干叠加,产生非零的、纹理化的背景"信号"。这导致两个问题:
    • 训练时模型试图重建这种背景"噪声纹理",浪费容量
    • 评估时 SSIM/NMSE 受到背景区域的污染,可能不能真实反映解剖结构保真度

§7.3 扫描仪和厂商偏倚

偏倚维度 程度 详情
厂商偏倚 🔴 严重 训练/验证/测试的核心数据几乎全部来自 Siemens 系统——仅 2020 Transfer Track 引入了 GE 和 Philips 数据作为评估
场强偏倚 🟡 中等 1.5T 比例约为 40%(膝部 Aera 695/1,594),社区大多数模型在 3T 数据上报告结果
单中心偏倚 🟡 中等 所有数据来自 NYU Langone Health——患者人群特征、临床实践、扫描协议可能不适用于其他机构
地域偏倚 🟢 轻微 纽约大都会区——对全球多样性代表不足

§7.4 DICOM 与 Raw 数据的"鸿沟"

fastMRI 中最大的结构性限制之一是 DICOM 和原始 k 空间数据来自不同患者(膝部和脑部):

  • 如果你想训练一个"重建加速图像 → 诊断分类"的端到端系统,你不能简单地将 raw 中的金标准图像与临床 DICOM 的诊断报告配对
  • fastMRI+ 部分弥补了这一鸿沟——在 raw 数据上直接标注了病理框,但标注量远小于 DICOM 的规模
  • 前列腺和乳腺数据集不存在此问题——HDF5 和 DICOM 来自同一检查

§7.5 排行榜现状

截至 2026-07,fastMRI 公共排行榜因 2023 年域名转移(Meta → NYU)而不可用。社区通过 GitHub Discussions (#293) 使用替代方案:在 arXiv / OpenReview 上公开报告结果。NYU 表示正在重建排行榜网站但未公布时间表。

§7.6 标注局限性

局限 详情
fastMRI+ 单读者 所有边界框和标签仅由 1 名放射科医师提供——缺乏观察者间一致性(IAA/Cohen’‘’‘’‘’‘’‘’‘’‘’'s κ)数据
前列腺 PI-RADS 单读者 同样只有 1 名 fellowship-trained 放射科医师标注
切片孤立标注 前列腺 PI-RADS 标注在切片级独立完成(非标准临床流程——标准流程是综合全部切片后给出检查级评分)
无分割 mask fastMRI+ 提供边界框而非像素级分割——无法直接评估 Dice 分数

§7.7 DAIMS 24 项数据就绪度评估

# 维度 得分 评估
1 数据来源清晰记录 MRI 采集协议、扫描仪型号、序列参数均在 ISMRMRD 头和论文中完整记录
2 患者人口统计公开 仅报告了年龄范围和性别的一般信息,无详细的人口统计分布表
3 数据去标识化方法 三阶段去标识化:ISMRMRD 转换 + RSNA CTP + 人工核查(脑部额外零矩阵面部替换)
4 伦理审批(IRB) NYU IRB 批准,每子集独立 DUA
5 标注者资质 Board-certified 放射科医师(单读者),专科培训放射科医师(前列腺)
6 标注者间一致性(IAA) 无 IAA 报告——所有标注为单读者
7 标注指南公开 fastMRI+ 和前列腺的精确标注指南未公开(仅一般性描述)
8 数据划分策略 训练/验证/测试划分公开,文件级别明确
9 数据格式标准化 HDF5 + CSV 标准化格式,官方 Python 加载器支持
10 数据大小和下载方式 大小明确(~1.35 TB),AWS S3 和 NYU 门户双通道下载
11 基准模型与代码 U-Net、E2E-VarNet 官方开源实现,完整训练/评估脚本
12 评估指标标准化 SSIM/NMSE/PSNR 三指标,官方评估脚本开源
13 金标准合理性 ⚠️ RSS 数学定义明确,但存在背景噪声偏置和相位信息丢弃——挑战赛引入人工评审作为补充
14 数据偏倚分析 厂商偏倚(主要 Siemens)、单中心、场强偏倚在论文中讨论
15 已知质量问题 RSS 背景噪声、DICOM/raw 患者不重叠、去标识化影响均在论文中说明
16 代表性(人群多样性) 单中心(NYU),纽约大都会区,美国人群——全球代表性不足
17 数据完整性 ISMRMRD 头信息与张量维度交叉验证通过
18 版本控制 v2.0 数据 manifest,GitHub 版本管理
19 外部验证 2020 挑战赛 Transfer Track(GE/Philips);2023 年前瞻性临床试验(Radiology 307: e220425)
20 跨任务通用性 重建 + 检测(fastMRI+)+ 分类(Prostate PI-RADS)多任务支持
21 数据使用许可清晰 DUA 明确——仅限内部研究和教育,禁止再分发;代码 MIT 开源
22 社区生态 活跃的 GitHub(246 commits, 346 open issues)、arXiv 论文持续更新、第三方工具链广泛(MONAI, BART, SigPy)
23 纵向/多时间点数据 数据集为横截面采集,不追踪同一患者的多次检查
24 数据贡献者多样性 5 临床院区 / 12+ 扫描仪 / 4 种解剖区域——采集条件多样性优秀

DAIMS 评估总结:fastMRI 18.5/24 —— 优秀

核心优势:fastMRI 在"AI 就绪度"维度几乎达到数据集设计的理论上限——从原始 k 空间格式到官方 PyTorch 加载器到排行榜评估,整个实验管道完全标准化。加上 2023 年的前瞻性临床验证(Radiology),它实现了"数据集 → 算法 → 临床"的完整闭环,这是公开医学影像数据集中极为罕见的成就。

核心短板:(1)标注者间一致性(IAA)完全缺失——fastMRI+ 和前列腺标注均为单读者,作为临床数据集这是明显的质量信号缺口;(2)患者人口统计信息不公开——阻碍公平性研究;(3)单中心单厂商(Siemens 主导)限制全球泛化性评估;(4)RSS 金标准的内在局限限制了重建精度上限。

建议改进:补充至少 2 名放射科医师的子集双读标注(100-200 example-level 即可报告 κ 系数);公开年龄/性别/种族的基本人口统计分布表;收录或资助其他厂商(GE、Philips、Canon)的训练数据以平衡厂商偏倚。

§7.8 外部验证矩阵

验证场景 验证数据集/方式 方法 关键发现
跨厂商泛化(Siemens→GE/Philips) 2020 挑战赛 Transfer Track E2E-VarNet 等 GE 数据无过采样导致 SSIM 降 0.1-0.4(需专门适配)
前瞻性临床验证(膝部) 170 名患者,3T 膝部 MRI DL 重建 vs 常规加速重建 × 6 位放射科医生 扫描时间 9:56→5:33(~2×),诊断等效,图像质量更优(P<0.001)
外部 2D MRI 数据集 Stanford2D FSE(89 例,多解剖部位) HUMUS-Net 迁移 验证 SSIM 0.8934(与 fastMRI 膝部验证性能相当)
外部 3D MRI 数据集 Stanford3D MRI HUMUS-Net 迁移 验证 SSIM 0.9449——3D 场景甚至优于 2D
不确定性量化 Ensemble + NLL loss(Küstner et al., 2024 MRM 5 种架构 预测不确定性可检测疾病流行率偏移,与 NMSE 良好相关
低场强对比 无公开数据 1.5T→低场强迁移是未来方向(fastMRI 仅提供 1.5T/3T)

§8 基准性能与生态

§8.1 2020 挑战赛排行榜(脑部 multicoil)

4× 加速赛道(定量 SSIM)
排名 团队 平均 SSIM T1 T1POST T2 FLAIR
🥇 1 AIRS Medical 0.964 0.967 0.969 0.965 0.930
🥈 2 ATB 0.960 0.964 0.965 0.961 0.924
🥉 3 Neurospin 0.959 0.963 0.965 0.960 0.920
  • 放射科医师定性评估:AIRS Medical 提交在所有 3 个赛道中均排名第一
8× 加速赛道(定量 SSIM)
排名 团队 平均 SSIM T1 T1POST T2 FLAIR
🥇 1 AIRS Medical 0.952 0.953 0.963 0.951 0.918
🥈 2 ATB 0.944 0.943 0.954 0.943 0.905
🥉 3 Neurospin 0.942 0.940 0.953 0.942 0.898
Transfer Track(Siemens→GE/Philips,4×)
排名 团队 平均 SSIM T1 T1POST T2 FLAIR
🥇 1 AIRS Medical 0.940 0.902 0.960 0.975 0.910
🥈 2 MRRecon 0.930 0.946 0.956 0.950 0.897
🥉 3 ResoNNance 0.913 0.936 0.939 0.957 0.855

💡 关键观察:FLAIR 序列在所有赛道和所有方法中表现最差——其更复杂的组织对比度和固有的低信噪比使 AI 重建更具挑战性。T1POST(增强后)通常表现最好。

§8.2 膝部 multicoil 排行榜(8× 加速)

方法 参数量 SSIM ↑ PSNR ↑ (dB) NMSE ↓ 训练数据 年份
HUMUS-Net-L (train+val) 228M 0.8951 37.4 0.0080 train+val 2022
HUMUS-Net (train+val) 109M 0.8945 37.3 0.0081 train+val 2022
E2E-VarNet (train+val) 30M 0.8920 37.1 0.0085 train+val 2020
XPDNet 155M 0.8893 37.2 0.0083 train 2020
Σ-Net 676M 0.8877 36.7 0.0091 train 2019
i-RIM 300M 0.8875 36.7 0.0091 train 2019
U-Net (官方基准) 214M 0.8640 34.7 0.0132 train 2019

§8.3 脑部 multicoil 排行榜(4× 加速)

方法 SSIM ↑ PSNR ↑ (dB) 开源 年份
AIRS Medical (挑战赛) 0.964 2020
FI-VarNet 0.896 (开源最佳) 38.5 2024
E2E-VarNet (官方基准) ~0.880 ~36.5 2020

§8.4 前列腺重建基准

基于 Tibrewala et al. (2024) 报告的 4× 欠采样 E2E-VarNet 基准:

序列 SSIM
T2 加权 ~0.92
扩散加权 (DWI b=0) ~0.90
扩散加权 (DWI b=1000) ~0.82

DWI 的重建难度显著高于 T2——高 b 值的低信噪比特性加剧了重建挑战。

§8.5 临床放射科医师评估结果(2023 前瞻性试验)

6 名肌骨放射科医师对 170 名患者的前瞻性试验评估(Johnson et al., 2023):

评估维度 常规协议 DL 加速协议 P 值
半月板撕裂检测 等效 等效 诊断等效
韧带撕裂检测 等效 等效 诊断等效
软骨异常检测 等效 等效 诊断等效
骨髓异常检测 等效 等效 诊断等效
全局图像质量 (1-4) 参考 显著更优 P < 0.001
扫描时间 9 min 56 s 5 min 33 s

§8.6 fastMRI 论文引用排名

论文 期刊/平台 引用次数 核心贡献
Zbontar et al. 2018 arXiv 1811.08839 4,800+ 数据集总览、基准模型
Knoll et al. 2020 Radiol Artif Intell 2(1): e190007 1,200+ 膝部数据详细描述
Sriram et al. 2020 arXiv 800+ E2E-VarNet
Zhao et al. 2022 Sci Data 200+ fastMRI+
Muckley et al. 2021 IEEE TMI 450+ 2020 挑战赛结果
Johnson et al. 2023 Radiology 307: e220425 300+ 前瞻性临床验证
Tibrewala et al. 2024 Sci Data 11: 404 100+ 前列腺数据集

引用次数截至 2026-07,来源为 Google Scholar。

§8.7 生态快照

fastMRI 生态全景
│
├── 数据层
│   ├── fastMRI Core(膝部/脑部 k-space + DICOM)
│   ├── fastMRI Prostate(312 例 + PI-RADS v2.1)
│   ├── fastMRI Breast(300 例 DCE GRASP)
│   └── fastMRI+(膝部 16,154 + 脑部 7,570 边界框)
│
├── 工具层
│   ├── 官方 Python 包: pip install fastmri (PyTorch)
│   ├── MONAI FastMRIReader(医疗 AI 框架原生支持)
│   ├── BART Toolbox(经典 CS/PI 重建基准)
│   ├── SigPy(Python 压缩感知工具包)
│   └── AWS S3 Open Data(免登录直接下载)
│
├── 模型层
│   ├── 官方基准: U-Net / E2E-VarNet
│   ├── 社区开源: FI-VarNet / HUMUS-Net / SwinMR
│   ├── 挑战赛: AIRS Medical / ATB / Neurospin(闭源)
│   └── 新兴方向: 扩散模型 / NeRF / 隐式神经表示
│
├── 评估层
│   ├── 定量: SSIM / NMSE / PSNR(官方脚本)
│   ├── 定性: 放射科医师 Likert 评分(2020 挑战赛 6 位专家)
│   └── 临床: 前瞻性诊断等效试验(2023, Radiology)
│
└── 社区层
    ├── GitHub: facebookresearch/fastMRI(246 commits, 2.1k stars)
    ├── 挑战赛: NeurIPS ML4H Workshop 2020
    ├── 衍生物: 低场 MRI / 儿科 MRI / 心脏 MRI 的 fastMRI 启发性方案
    └── 国际参考: ISMRM / MICCAI 论文中 fastMRI 为标准基准

§8.8 关键社区资源

资源 链接
官方数据主页 https://fastmri.med.nyu.edu/
GitHub 仓库 https://github.com/facebookresearch/fastMRI
AWS Open Data https://registry.opendata.aws/nyu-fastmri/
fastMRI+ 标注 https://github.com/microsoft/fastmri-plus
Prostate GitHub https://github.com/cai2r/fastMRI_prostate
Breast GitHub https://github.com/eddysolo/demo_dce_recon
MONAI 集成 monai.apps.reconstruction.fastmri_reader.FastMRIReader
入门教程 fastMRI_tutorial.ipynb(GitHub 仓库内)
论坛 GitHub Discussions (#293 排行榜替代方案讨论)

§9 相关资源与引用

§9.1 关键参考论文

# 引用 关注点
1 Zbontar, J., Knoll, F., Sriram, A., et al. (2018). fastMRI: An Open Dataset and Benchmarks for Accelerated MRI. arXiv:1811.08839. 数据集总览、U-Net 基准、指标定义
2 Knoll, F., Zbontar, J., et al. (2020). fastMRI: A Publicly Available Raw k-Space and DICOM Dataset of Knee Images for Accelerated MR Image Reconstruction Using Machine Learning. Radiology: Artificial Intelligence, 2(1), e190007. 膝部数据详细描述
3 Muckley, M., Riemenschneider, B., et al. (2021). Results of the 2020 fastMRI Challenge for Machine Learning MR Image Reconstruction. IEEE Transactions on Medical Imaging, 40(9), 2306-2317. 2020 挑战赛详细结果和放射科医师评估
4 Sriram, A., Zbontar, J., et al. (2020). End-to-End Variational Networks for Accelerated MRI Reconstruction. MICCAI 2020. E2E-VarNet 基准模型
5 Zhao, R., Yaman, B., Zhang, Y., et al. (2022). fastMRI+, Clinical pathology annotations for knee and brain fully sampled magnetic resonance imaging data. Scientific Data, 9, 155. fastMRI+ 病理边界框
6 Johnson, P. M., Lin, D. J., Zbontar, J., et al. (2023). Deep Learning Reconstruction Enables Prospectively Accelerated Clinical Knee MRI. Radiology, 307(2), e220425. 前瞻性临床验证
7 Tibrewala, R., Dutt, T., Tong, A., et al. (2024). FastMRI Prostate: A Publicly Available, Biparametric MRI Dataset to Advance Machine Learning for Prostate Cancer Imaging. Scientific Data, 11, 404. 前列腺数据集 + PI-RADS
8 Giannakopoulos, I. I., Muckley, M. J., Kim, J., et al. (2024). Accelerated MRI reconstructions via variational network and feature domain learning. Scientific Reports, 14, 10991. FI-VarNet — 开源模型最优
9 Solomon, E., et al. (2024). FastMRI Breast: A Publicly Available Radial k-Space Dataset of Dynamic Contrast-Enhanced Breast MRI. Radiology: Artificial Intelligence. 乳腺 DCE 数据集

§9.2 BibTeX 引用

% 主论文(必须引用)
@article{zbontar2018fastmri,
  title={{fastMRI}: An Open Dataset and Benchmarks for Accelerated {MRI}},
  author={Zbontar, Jure and Knoll, Florian and Sriram, Anuroop and
          Murrell, Tullie and Huang, Zhengnan and Muckley, Matthew J. and
          Defazio, Aaron and Stern, Ruben and Johnson, Patricia and
          Bruno, Mary and Parente, Marc and Geras, Krzysztof J. and
          Katsnelson, Joe and Chandarana, Hersh and Zhang, Zizhao and
          Drozdzal, Michal and Romero, Adriana and Rabbat, Michael and
          Vincent, Pascal and Yakubova, Nafissa and Pinkerton, James and
          Wang, Duo and Owens, Erich and Zitnick, C. Lawrence and
          Recht, Michael P. and Sodickson, Daniel K. and Lui, Yvonne W.},
  journal={arXiv preprint arXiv:1811.08839},
  year={2018}
}

% 膝部数据(使用膝部数据时引用)
@article{knoll2020fastmri,
  title={fast{MR}{I}: A Publicly Available Raw k-Space and {DICOM} Dataset
         of Knee Images for Accelerated {MR} Image Reconstruction Using
         Machine Learning},
  author={Knoll, Florian and Zbontar, Jure and Sriram, Anuroop and
          Muckley, Matthew J. and Bruno, Mary and Defazio, Aaron and
          Parente, Marc and Geras, Krzysztof J. and Katsnelson, Joe and
          Chandarana, Hersh and Zhang, Zizhao and Drozdzal, Michal and
          Romero, Adriana and Rabbat, Michael and Vincent, Pascal and
          Pinkerton, James and Wang, Duo and Yakubova, Nafissa and
          Owens, Erich and Zitnick, C. Lawrence and Recht, Michael P. and
          Sodickson, Daniel K. and Lui, Yvonne W.},
  journal={Radiology: Artificial Intelligence},
  volume={2},
  number={1},
  pages={e190007},
  year={2020},
  doi={10.1148/ryai.2020190007}
}

% 2020 挑战赛(提及挑战赛结果时引用)
@article{muckley2021fastmri,
  title={Results of the 2020 fast{MR}{I} Challenge for Machine Learning
         {MR} Image Reconstruction},
  author={Muckley, Matthew J. and Riemenschneider, Bruno and
          Radmanesh, Alireza and Kim, Sunwoo and Jeong, Geunu and
          Ko, Jingyu and Jun, Yohan and Shin, Hyungseob and Hwang, Dosik
          and Mostapha, Mahmoud and others},
  journal={IEEE Transactions on Medical Imaging},
  volume={40},
  number={9},
  pages={23062317},
  year={2021}
}

% 前列腺数据(使用前列腺数据时引用)
@article{tibrewala2024fastmri,
  title={{FastMRI Prostate}: A Publicly Available, Biparametric {MRI}
         Dataset to Advance Machine Learning for Prostate Cancer Imaging},
  author={Tibrewala, Radhika and Dutt, Tarun and Tong, Angela and
          Ginocchio, Luke and Keerthivasan, Mahesh B and Baete, Steven H
          and Chopra, Sumit and Lui, Yvonne W and Sodickson, Daniel K and
          Chandarana, Hersh and Johnson, Patricia M},
  journal={Scientific Data},
  volume={11},
  pages={404},
  year={2024},
  doi={10.1038/s41597-024-03252-w}
}

% E2E-VarNet(使用 VarNet 时引用)
@inproceedings{sriram2020varnet,
  title={End-to-End Variational Networks for Accelerated {MRI} Reconstruction},
  author={Sriram, Anuroop and Zbontar, Jure and Murrell, Tullie and
          Defazio, Aaron and Zitnick, C. Lawrence and Yakubova, Nafissa
          and Knoll, Florian and Johnson, Patricia},
  booktitle={International Conference on Medical Image Computing and
             Computer-Assisted Intervention (MICCAI)},
  year={2020}
}

§9.3 衍生工作与扩展

方向 代表性工作
主动 k 空间采样 Zhang et al. (2019) — 强化学习驱动自适应采样策略
欠采样轨迹优化 Defazio (2019) — 偏移采样利用对称性提升 DL 重建
条带伪影去除 Defazio et al. (2020) — 对抗训练消除并行成像条带噪声
不确定性量化 Küstner et al. (2024, MRM) — 深度集成预测重建不确定性
低场强迁移 多项研究利用 fastMRI 3T/1.5T 知识增强 0.55T 设备重建
自监督重建 利用全采样金标准作为监督信号的各种自监督预训练方案
扩散模型重建 Sanda et al. (2025) — 基于补丁的扩散求解器
联合重建-分割 利用 fastMRI+ 边界框进行重建-诊断多任务学习

§10 AI 使用声明卡

§10.1 页面编制说明

本 Wikipedia 页面由 AI 辅助(WorkBuddy / Claude)根据 fastMRI 公开发表的论文、官方数据文档和社区资源综合编写,经千方病案医学编辑部交叉审核。页面内容的准确性和完整性基于截至 2026-07 的公开文献。

§10.2 使用建议

  • AI 训练用途:本页面的技术描述(ICD-11 映射、SNOMED CT 编码、DAIMS 评估框架、数据字典、预处理 Pipeline、代码示例)可自由引用,无需额外授权
  • 研究引用:在学术论文中引用 fastMRI 数据集时,请使用 §9.2 提供的 BibTeX 引用格式,并遵循 NYU Data Sharing Agreement 中的引用政策
  • 商业用途(重要):fastMRI 数据和本页面中所有非原创性的数据集技术描述均受 NYU DUA 约束。将 fastMRI 数据用于商业产品(包括用于训练商业 AI 模型)需要与 NYU 另行商议许可,默认 DUA 仅允许内部研究和教育用途

§10.3 数据使用合规提示

  1. 逐数据集申请:膝部、脑部、前列腺、乳腺各有独立的 DUA,需通过 fastmri.med.nyu.edu 分别申请
  2. 下载链接保密:下载链接不得共享——团队每个成员需独立注册
  3. 使用完毕销毁:完成研究后须销毁所有 fastMRI 数据副本
  4. 禁止再分发:不得以任何形式再分发 fastMRI 数据(包括衍生产物中含原始 k 空间信息的数据集)
  5. fastMRI+ 例外:fastMRI+ 标注文件(CC-BY 4.0)和 GitHub 代码(MIT)的许可比原始影像数据更宽松

§10.4 页面状态

页面状态:published

审核人:千方病案医学编辑部交叉审核

审核通过日期:2026-07-29

审核范围:§2 医学背景(ICD-11 四解剖区域映射、SNOMED CT 编码验证、RSS 金标准合理性分析)、§4 DAIMS 数据字典(HDF5 结构、ISMRMRD 头字段、fastMRI+ CSV 格式)、§5 数据划分策略适用性、§6 预处理 Pipeline 和坑点、§7 DAIMS 评估表

利益冲突声明:千方病案医数集与 NYU Langone Health、Meta AI Research 及 fastMRI 项目无任何商业或学术隶属关系。本页面内容仅基于公开文献的客观汇编,不涉及原始数据的访问或使用。

返回 AI Ready 数据集