IXI 脑 MRI 多序列 — 健康脑影像基准数据集 AI-Ready Wikipedia

581 例健康受试者的五序列脑 MRI 开放基准数据集

来源 帝国理工学院(Imperial College London)Biomedical Image Analysis Group url: https://brain-development.org/ixi-dataset/发布时间: 2026-09-16最后更新: 2026-09-25 阅读 35
IXI 脑 MRI 多序列 — 健康脑影像基准数据集 AI-Ready Wikipedia

信息速览

数据集名称IXI 脑 MRI 多序列 — 健康脑影像基准数据集 AI-Ready Wikipedia
数据类型581 例健康受试者 T1,T1/T2/PD/MRA/DTI 五序列,约 30 GB NIfTI,CC BY-SA 3.0 开放下载
规模581 名健康受试者(官方口径近 600)
接入方式帝国理工学院(Imperial College London)Biomedical Image Analysis Group url: https://brain-development.org/ixi-dataset/
AI 就绪度

数据集封面

IXI 脑影像(Information eXtraction from Images)

INFOBOX

字段 内容
数据集名称 IXI 脑影像
英文全称 Information eXtraction from Images(IXI)
别名/简称 IXI dataset;Brain Development IXI;IXI Brain Development Dataset
疾病分类(ICD-11) 无疾病标签(健康受试者;对照研究场景关联 8A00 阿尔茨海默病等退行性病变对照)
SNOMED CT 17621005(Normal,健康对照状态)
数据模态 脑 MRI(T1/T2/PD/MRA/DTI 多序列)
AI 任务类型 超分辨率、跨模态合成、分割、重建、配准、脑龄估计、DTI 纤维束评价
样本总数 581 例健康受试者(T1 加权像计数;官方口径"近 600")
数据大小 约 27—30 GB(五模态 NIfTI 全量,第三方镜像实测)
数据格式 NIfTI(.nii.gz)+ XLS 人口学表
许可证 CC BY-SA 3.0
访问级别 开放(无需注册、无需伦理审批)
DUO 标签 NRES(无限制使用;署名 + 相同方式共享条款)
语言 英语(元数据与文档)
首发日期 2005—2006(数据采集);2015-03-06(NITRC-IR 分发)
最后更新 2015-03(NITRC-IR 版本,官方数据此后未变更)
发布机构 帝国理工学院(Imperial College London)
官方主页 https://brain-development.org/ixi-dataset/
下载地址 https://biomedic.doc.ic.ac.uk/brain-development/downloads/IXI/
DOI 无(官方未分配,按 CC BY-SA 要求引用官网)
引用次数 无单一官方论文可计(社区按官网要求标注来源;截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— NIfTI 格式标准、TorchIO/Clinica 生态成熟,但无官方划分与预处理脚本,需手动实现模态配对与划分
页面状态 published

§0 E-E-A-T 审核声明

编写者:千方病案医学编辑部数据集百科撰稿组。本词条基于 IXI 官方网站(brain-development.org)、NITRC 官方登记页、Clinica 官方转换器文档及多篇同行评审论文交叉核实编写,全部事实条目与来源见研究阶段事实清单。

医学审核:千方病案医学编辑部交叉审核:§2 医学背景(健康脑老化与对照研究场景的 ICD-11/SNOMED CT 映射)、§7 偏倚分析(站点、年龄与人群代表性)。

数据工程审核:千方病案医学编辑部交叉审核(医疗 AI 数据工程师):§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

最后人工审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。IXI 按 CC BY-SA 3.0 许可发布,使用时须注明 IXI 数据来源(官方建议引用 brain-development.org 网站);衍生数据须以相同许可共享,官方人口学表中的出生日期等字段应视为准标识符、不得二次分发。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? IXI(Information eXtraction from Images)是伦敦帝国理工学院在 EPSRC 基金(GR/S21533/02)支持下建设的健康人脑 MRI 开放数据集:2005—2006 年间,约 600 名(T1 加权像实际 581 例)无神经系统疾病的健康志愿者在伦敦三家医院(Hammersmith 医院 3T、Guy’s 医院 1.5T、精神病学研究所 1.5T)接受了 T1、T2、PD 加权、MRA 与 15 方向 DTI 五类序列扫描,全部以 NIfTI 格式免费公开。

为什么重要? 它是神经影像领域最早的大规模多序列健康对照数据集之一:受试者横跨 20—86 岁、附带人口学信息、无任何使用门槛,使它成为分割、超分辨率、跨模态合成、配准与 DTI 算法开发最常用的公共基准之一,也是大量疾病研究中"健康对照"数据的事实来源。

我能用它做什么? 你可以直接下载五个模态的压缩包与人口学表(IXI.xls),用 TorchIO/Clinica 等成熟工具加载;用于训练分割与超分网络、构建 T1↔T2 合成模型、评估 DTI 配准算法、做脑龄建模,或作为外部验证的健康对照队列。它不能用于疾病检测或任何临床诊断——数据中没有患者、没有疾病标签。

§1.1 摘要

IXI 项目(Information eXtraction from Images,EPSRC GR/S21533/02)由帝国理工学院生物医学图像分析组牵头,联合伦敦多家医院在 2005—2006 年完成数据采集,目标是支持图像分析技术与网格计算性能研究。每名受试者的采集协议固定包含五类序列:T1 加权(MPRAGE,3T 站点 TR/TE 为 9.6/4.6 ms)、T2 加权与 PD 加权(共享 TR、仅 TE 不同)、MRA 血管成像以及 15 个梯度方向、b=1000 s/mm² 的扩散加权成像。数据分别来自 Hammersmith 医院(Philips Intera 3T)、Guy’s 医院(Philips Gyroscan Intera 1.5T)与精神病学研究所(GE 1.5T),其中 GE 站点扫描参数官方未公开。官方以 NIfTI 格式分发 5 个模态压缩包及人口学表 IXI.xls,许可为 CC BY-SA 3.0;T1 加权像覆盖 581 人,T2 约 578 人,各模态存在少量缺漏。2015 年 3 月数据集被官方发布到 NITRC-IR 影像仓库;社区内通过 Clinica 的 ixi-to-bids 转换器、TorchIO 数据接口及多个第三方镜像(约 27—30 GB)广泛流通。由于不含疾病标签与官方划分,IXI 的核心价值在方法学基准与健康对照参考,而非疾病建模。

一句话总结其生态位:IXI 是"健康人脑的方法学公共擂台"——不管你的算法论文提出什么新分割网络、新超分结构、新配准损失,审稿人都默认你能在 IXI 上给出一个公开可复现的数字;而它零门槛、无标签、无划分的特性,也恰恰要求使用者自己完成工程闭环(划分冻结、模态配对、站点分层),这正是本词条 §5 与 §6 的存在意义。

§1.2 战略价值

维度一:多序列健康参考谱系。 IXI 是少数同时提供 T1、T2、PD、MRA、DTI 五种序列、且受试者完全健康、年龄横跨 20—86 岁的公共数据集。同一受试者可获取结构、血管与扩散三种互补信息,使它天然适配跨模态合成(T1↔T2 互译)、多序列超分辨率与"以健康人建模板"类任务——这正是它长期作为超分辨率与图像翻译论文标配数据集的原因。

维度二:零门槛 + 宽松许可的方法学公共品。 官方下载无需注册、无需伦理审批、无数据使用协议,CC BY-SA 3.0 允许共享与改编(需署名且同许可共享)。对比需凭证申请的 ADNI、MIMIC 等队列,IXI 把获取成本降到接近零,非常适合教学、方法快速验证与可复现性研究;NITRC-IR、brainlife.io 及国内镜像(ModelScope、OpenDataLab)进一步降低了获取门槛。

维度三:健康对照的"公共底座"。 在疾病影像研究中,健康对照队列往往难以获得或无法共享。IXI 以其规模(581 例)与人口学跨度成为事实上的"公共对照组":配准评估、模板构建(如 Lead-DBS 的年龄匹配 AC/PC↔MNI 坐标转换库)、异常检测训练(以健康分布学异常)等场景均把它当作健康基线使用。

维度四:跨模态监督的稀缺供给。 大多数公开脑影像集只有 T1 一种结构像;IXI 的 T1/T2/PD 三结构序列来自同一批受试者,意味着"以真实 T2 为教师学 T1 超分/合成"这类需要跨模态对齐监督的任务可以真正落地。这解释了为什么 2022 年后的医学超分论文几乎人手一份 IXI——它同时满足规模、对齐与许可三个条件,替代品极少。

§1.3 同类数据集横向对比

数据集 规模 模态 人群/标注 与 IXI 的差异化
IXI 581 例健康人(T1) T1/T2/PD/MRA/DTI 健康志愿者,20—86 岁,无疾病标签 五序列齐全 + 零门槛 + CC BY-SA;无官方划分
ABIDE 1,000+ 例 结构 + 静息态 fMRI 自闭症谱系与典型发育对照 有临床分组与功能像;IXI 序列更全但纯健康
ADNI 2,000+ 例 MRI + PET + 体液 阿尔茨海默病纵向队列 纵向 + 疾病标签;获取需凭证,IXI 免申请
OASIS 数百例起 T1 为主 认知正常与痴呆横断/纵向 痴呆标签 + FreeSurfer 衍生指标;IXI 模态更多
ADHD-200 900+ 例 结构 + fMRI 多动症多站点竞赛数据 疾病分类竞赛导向;IXI 无疾病任务
Cam-CAN 约 700 例 结构/弥散/功能 + 认知 全生命周期老化队列 认知-影像耦合更深;IXI 更早、更易获取
1000 Functional Connectomes 1,000+ 例 静息态 fMRI 多站点健康/临床混合 功能连接导向;IXI 聚焦结构与扩散

横向看,IXI 填补的位置非常清晰:比单序列健康集(如多数 UK Biobank 子集外流样本)序列全,比疾病队列(ADNI/OASIS)易得,比儿童队列(HBN)年龄跨度大。选型经验法则:要疾病标签 → ADNI/OASIS/ABIDE;要功能像 → ABIDE/1000FC/AOMIC;只要结构+扩散的健康基线且不想填申请表 → IXI 几乎是唯一解。

§1.4 版本时间轴

时间 事件 说明
2005—2006 数据采集 EPSRC GR/S21533/02 资助,伦敦三家医院完成约 600 名健康受试者多序列 MRI 采集
2008 前后 官方网站上线 brain-development.org 发布 NIfTI 压缩包与 IXI.xls 人口学表(CC BY-SA 3.0)
2015-03-06 NITRC-IR 发布 官方宣布数据集进入 NITRC-IR(XNAT 影像仓库),登记项目名 ixi_dataset
2017 前后 生态扩展 Lead-DBS 发布 IXI 预处理版(年龄匹配 AC/PC↔MNI 坐标转换);Clinica 提供 ixi-to-bids 转换器
2021—2022 深度学习库接入 TorchIO 内置 IXI/IXITiny 下载类;超分辨率研究(Georgescu et al., 2022)采用 IXI 基准
2022—2024 第三方镜像 ModelScope(29.41 GB)、OpenDataLab(27.4 GB)、Kaggle FreeSurfer 8 预处理版等陆续上架

时间轴的两点解读:其一,IXI 是"先采集、后生态"的典型——核心数据十余年不变,价值由社区工具(转换器、数据类、预处理版)持续增值,评估其可用性时应看生态而非更新日期;其二,官方从未发布版本号,时间轴上所有"事件"都是分发渠道与衍生形态的演进,数据本体以 2015-03-06 NITRC-IR 登记为最权威的固化时点。

§1.5 典型应用场景

  1. 跨模态合成与超分辨率:以 581 例 T1 与 578 例 T2 训练 T1↔T2 互译、2D/3D 超分网络(如 MTVNet 采用 500/6/75 划分),并用对方模态做监督信号。
  2. 脑分割与教学基准:TorchIO IXITiny 提供 566 例 T1 + 衍生脑分割标签(83×44×55),是入门 3D 医学分割的标准教学集。
  3. DTI 算法评估:15 方向、b=1000 s/mm² 的张量数据配以公开 bvecs/bvals,被广泛用于 DTI 配准与纤维束追踪算法的横向比较。
  4. 健康模板与坐标转换:Lead-DBS 用 IXI 构建年龄匹配的 AC/PC↔MNI 坐标转换库,服务深部脑刺激定位研究。
  5. 异常检测与外部验证:以健康分布建模(如标准化流)训练后,在 OASIS-1、BraTS2021 等病灶数据上验证异常定位能力;或作为疾病研究的健康对照组。

§2 医学背景

§2.1 ICD-11 编码映射

IXI 本身不含疾病标签,全部受试者为健康志愿者。下表给出的是该数据集在研究与临床语境中的对照场景映射(即 IXI 作为健康对照、模板或训练底座时,相关研究关注的 ICD-11 类目),而非数据集自带的诊断编码。

编码映射的正确用法是"研究语境对照"而非"数据标注":当你的论文使用 IXI 作为阿尔茨海默病研究的健康对照时,引用 8A00 说明研究语境;当用 IXI 估计正常白质 FA 范围时,对应多发性硬化(8A40)的对照需求。反过来,任何把 IXI 记录为"含 8A00 标签数据集"的写法都是错误的——它一条疾病标注都没有。这种"场景在研究侧、数据侧为空"的结构,是健康对照数据集在医学编码体系中的普遍处境。

标签/场景 ICD-11 编码 ICD-11 中文名 与 IXI 的关系
健康对照/正常状态 无对应疾病编码 健康查体人群 全部 581 例的官方属性
阿尔茨海默病(对照场景) 8A00 阿尔茨海默病 IXI 作年龄匹配健康对照,辅助萎缩定量
轻度神经认知障碍(对照场景) 6D71 轻度神经认知障碍 健康老化基线,用于识别 MCI 偏离
多发性硬化(白质研究场景) 8A40 多发性硬化 DTI 白质完整性研究的健康参照

§2.1b SNOMED CT 映射

标签/场景 ICD-11 SNOMED CT 码 术语
健康对照状态 — 17621005 Normal(正常,限定值)
阿尔茨海默病(对照场景) 8A00 26929004 Alzheimer’s disease(阿尔茨海默病)
轻度神经认知障碍(对照场景) 6D71 712860001 Mild cognitive impairment(轻度认知障碍)
多发性硬化(白质研究场景) 8A40 90543006 Multiple sclerosis(多发性硬化)

注:编码值以 ICD-11 与 SNOMED CT 官方浏览器现行版本为准;IXI 数据文件本身不携带以上任何编码。

§2.2 医学背景与流行病学

IXI 的医学语境是正常脑发育与衰老。健康人脑在 20—86 岁区间呈现可量化的形态学变化:灰质体积与皮层厚度随年龄大致二次型下降,白质各向异性分数(FA)在中年后持续走低,脑室与脑沟随萎缩扩大。理解这些"正常轨迹"是识别疾病偏离的前提——阿尔茨海默病的内侧颞叶萎缩、多发性硬化的白质脱髓鞘等征象,都必须先与年龄匹配的正常参照比较。全球老龄化背景下,65 岁以上人群痴呆患病率约为 5%—8%,对健康对照影像的需求持续增长;而健康对照数据共享受伦理与成本约束,这正是 IXI 的价值所在。它把一个横跨成年的健康人脑影像谱系(含人口学)以 CC BY-SA 开放,使任何团队都能获得年龄匹配的正常参照,而不必重复招募。

从成像物理角度,IXI 五序列覆盖了临床 MRI 的主干信息类型:T1 加权突出灰白质对比(解剖基准),T2 加权对水含量敏感(病变高信号检测的基础),PD 加权提供质子密度参考(与 T2 组成双回波,利于组织分类),MRA 呈现颅内大血管走形(无对比剂血管成像),DTI 则量化水分子扩散的各向异性(白质微结构探针)。多序列同人群采集使算法可以学习"同一解剖的多参数表达",这是单序列数据集无法提供的监督信号。

在正常老化研究语境下,IXI 的横断设计(每人单次扫描、年龄连续覆盖)使其特别适合拟合形态学指标的年龄轨迹:皮层复杂度、皮层厚度、脑室体积等指标与年龄的函数关系均可直接在 581 例上估计,并按性别分层检验。多条轨迹研究已直接采用 IXI 全集或其 3T 子集(如皮层复杂度随年龄下降的二次型关系、白质 FA 与皮层厚度的耦合分析),形成了一条可复用的"健康参照曲线"研究范式。对 AI 而言,这条曲线本身就是监督信号——脑龄回归、老化模拟生成、年龄条件化合成等任务都以它为先验。

§2.3 临床任务定义

IXI 不定义疾病筛查、诊断、分级或预后任务——它没有患者、没有结局。它在临床方法学链条中的位置是:

任务类型 IXI 中的形态 说明
筛查/诊断/分级/预后 不适用 无疾病标签、无临床结局
正常解剖建模 581 例健康人跨 20—86 岁 形态学正常范围、模板与图谱构建
方法学金标准开发 多序列 + 多站点 分割/配准/超分/合成算法的训练与基准
对照组供给 CC BY-SA 可共享 疾病研究中年龄/性别匹配的健康参照
预处理链验证 五序列全覆盖 颅骨剥离/配准/偏置场校正的零成本测试床
域协调研究 三站点双厂商 ComBat/直方图协调算法的开发与验证
脑龄与老化建模 年龄连续 + 人口学齐全 正常老化轨迹拟合与脑龄回归基准

§2.4 受试人群画像

维度 内容
来源 伦敦三家医院:Hammersmith 医院(3T)、Guy’s 医院(1.5T)、精神病学研究所(1.5T)
采集时间 2005—2006 年
年龄 20—86 岁,覆盖青年、中年与老年
性别 两性均参与;577 例 T1+T2 双全子集中约 55% 为女性
种族 官方 IXI.xls 提供种族编码(ETHNIC_ID),反映伦敦本地招募人群构成
就医类型 健康志愿者查体入组,无神经系统疾病史、神经学检查正常
排除标准 神经系统疾病史、神经学检查异常(官方描述)
扫描会话 每人 1 次横断扫描,无纵向随访
设备经历 每人单站点单机完成全部五序列(站点可由文件名判定)

解读该画像时须注意招募框架的隐性筛选:志愿者多为响应大学/医院招募的健康人群,其教育、职业构成(可由 QUALIFICATION_ID/OCCUPATION_ID 复核)与普通人群存在偏差;这一偏差不影响方法学基准的内部效度,但会传导到任何"以 IXI 估计人群正常范围"的应用中。

§2.5 临床价值

对临床 AI 而言,IXI 的价值体现在三处。其一,泛化锚点:疾病模型常因训练分布狭窄而把"正常"误判为异常,IXI 提供的大样本健康分布可作为校准或负样本来源。其二,预处理链验证:任何新提出的脑影像预处理流程(颅骨剥离、配准、偏置场校正)都应在健康数据上先验证不引入伪变化,IXI 是零成本的首选测试床。其三,教学与复现:无门槛 + 宽许可使课堂、综述与论文复现都能直接运行,缩短方法从论文到应用的验证周期。

还需指出 IXI 在比较研究中的"第三方裁判"角色:当两个算法在专有数据上各执一词时,双方都可以在 IXI 上跑同一协议给出公开可比的数字,这在 DTI 配准(Wang 2017 六算法对比)与超分辨率(多篇论文同用 500/6/75 划分)中已经形成惯例。这种"公共擂台"效应放大了零门槛数据集的方法学价值——它不仅提供训练数据,更提供了争论得以收敛的公共场地。

§2.6 金标准对照表

维度 内容
划分 官方未提供任何划分;社区惯例为受试者级随机划分(如 500/6/75)或交叉验证
标注方式 原始数据无人工标注;第三方衍生标签(如 TorchIO IXITiny 脑分割)来自自动/半自动流程
标注者 不适用(无人工金标准);使用衍生标签时应引用其生成流程论文
性质 健康人群成像数据 + 自报人口学;结构像可借助公开工具(FreeSurfer/FSL)生成组织概率图作为弱参考

使用衍生标签的红线只有两条:一是明示来源(“FreeSurfer 7.3.2 自动分割,未人工修订”),二是禁止把自动产物表述为专家金标准。审稿人对"用自动标签训练又用同一标签评测"的循环论证高度敏感——如果评测标签与训练标签同源,必须引入第三个独立工具或小规模人工复核作为参照。


§3 数据集规格

§3.0 版本抉择矩阵

IXI 官方只有一个静态发布版(NIfTI 压缩包 + IXI.xls),无版本号体系。实际使用时需要在"获取渠道"上做选择:

你的需求 推荐版本 大小 理由
官方原始数据、写论文需权威来源 官网五模态 .tar + IXI.xls 约 27—30 GB 官方直出,引用最稳
BIDS 流水线(fMRIPrep/Clinica) Clinica ixi-to-bids 自行转换 与原始等量 官方无 BIDS 发布版,转换器最规范
教学快速上手、不想配对文件 TorchIO IXI/IXITiny 类 数 GB 一行代码下载、自动配对模态
国内网络环境 ModelScope / OpenDataLab 镜像 29.41 GB / 27.4 GB 下载稳定,内容对应官方版
需要 skull-strip/分割 mask 起步 Kaggle FreeSurfer 8 预处理版 约 21 GB 附 brainmask、aseg 与 MNI 配准

§3.1 模态详情

每名受试者的协议固定包含五类序列(实际各模态例数略有缺漏,见 §3.2):

序列 加权/类型 作用 常见矩阵(3T 站点) 备注
T1 MPRAGE 结构像 解剖基准、灰白质对比 208×208 3T 站点 TR/TE 9.6/4.6 ms,FA 8°
T2 FSE T2 加权 水敏感、病变高信号 192×187 TR/TE 5,725.79/100 ms,ETL 16
PD 质子密度加权 组织分类参考 192×187 与 T2 同 TR、TE 8 ms(双回波)
MRA 血管成像 颅内大血管走形 288×286 TR/TE 16.72/5.75 ms,FA 16°
DTI 扩散加权 白质微结构 112×110 15 方向、b=1000 s/mm²、TR/TE 11,894.44/51 ms

五个序列构成一套"自洽的多参数协议":T1 给解剖骨架,T2/PD 双回波给组织对比的两极,MRA 给血管对照,DTI 给微结构——同一批受试者同一台机器一次完成,使跨模态学习无需处理"采集时间差"这一干扰变量。这是 IXI 相对"多研究拼凑式"数据集(不同模态来自不同研究)的根本优势,也是它在跨模态合成领域不可替代的原因。

§3.2 按子集样本数

各模态实际可下载例数不同(论文实测口径),全部为同一批受试者:

例数差异的三个来源值得记住:其一,扫描完成度——个别受试者未完成全部协议(MRA 与 DTI 缺漏最多,因其序列时间最长);其二,发布取舍——官方打包时剔除了个别 QC 不合格卷;其三,统计时点——不同论文在不同年份清点镜像文件,得到 576/578 等相邻数字。任何精确到个位的"N 例"表述都应给出清点方法(如"逐文件计数 2026-09 官方包"),否则建议采用官方口径"近 600"。

子集 例数 口径来源
T1 加权像 581 官方 T1 压缩包逐文件计数(HuggingFace 镜像同口径)
T2 加权像 578(另有论文记 576) 同上;差异源于个别文件缺漏的统计时点
T1+T2 双全 577 TorchIO 及多篇论文采用
全体受试者(官方口径) “近 600” brain-development.org
T1+T2 双全按站点 Guy’s 320 / Hammersmith 184 / IoP 73 同行评审论文实测
brainlife.io 收录 583 sub / 1,553 objects brainlife.io 项目页

§3.3 数据格式

内容 格式 说明
五模态影像 NIfTI-1(.nii.gz) 每序列单文件;DTI 每梯度方向一卷(DTI-00 起编号)
扩散梯度表 bvecs.txt / bvals.txt FSL 风格,行/列为方向与 b 值
人口学表 IXI.xls(Excel) 一行一受试者,字段见 §4.1
第三方衍生 NIfTI + CSV/TSV、NumPy npy Kaggle/TorchIO/HF 镜像附带各自衍生格式

§3.4 存储大小

官方未公布总大小;第三方镜像实测全量约 27—30 GB(ModelScope 29.41 GB、OpenDataLab 27.4 GB)。单受试者五模态约 45—55 MB。TorchIO IXITiny 子集(566 例 T1 + 分割标签)仅约数百 MB,适合教学场景快速下载。

各压缩包的相对体量可由序列数量粗估:T1 与 T2 各占约 6—9 GB(581/578 个 3D 体),PD 与 T2 同量级,DTI 因每方向一卷、卷数最多而通常为最大的单包,MRA 卷数与 T1 相当但矩阵更大。精确字节数以官方服务器实际返回为准(镜像重压缩可能引入 ±10% 偏差),下载前建议记录官方页各 .tar 的文件大小作为校验基准。磁盘规划按"解压后 1.5 倍"预留即可(tar 内已为 .nii.gz 压缩格式,解压仅去壳)。

§3.5 标注方式

IXI 原始发布不含任何人工标注。围绕它存在三类社区衍生"标注":其一,工具链自动产物——FreeSurfer 分割/皮层厚度、FSL BET 脑掩膜等,可由用户自行计算;其二,打包衍生版——TorchIO IXITiny 的脑分割标签(自动流程生成)、Kaggle FreeSurfer 8 版的 aseg/brainmask 与 DKT 皮层分区厚度表;其三,人口学元数据——官方 IXI.xls 提供 11 个字段(性别、年龄、利手、种族、婚姻、职业、学历等),是官方直接分发的唯一"标签型"数据。引用任何衍生标签时必须引用其生成流程而非 IXI 本身。

§3.6 标注者资质与一致性

不适用(无人工标注环节)。官方未发布任何质量控制报告或标注者协议;使用衍生标签时,一致性取决于对应工具的已发表验证(如 FreeSurfer 与人工分割的一致性研究),IXI 官方对此无额外背书。

§3.7 采集周期

数据于 2005—2006 年采集(NeuroImage 2016 论文明确记载);官方页面未给出逐月时间表,IXI.xls 中的 STUDY_DATE 字段记录每名受试者的具体扫描日期,可用于精确重建采集时间线。

§3.8 地域覆盖

全部受试者在英国伦敦招募与扫描,覆盖三个医疗中心:Hammersmith 医院、Guy’s 医院、精神病学研究所(Institute of Psychiatry,属 King’s College London 体系)。无其他地区数据,人群代表性限于伦敦招募框架。

§3.9 设备规格

站点 扫描仪 场强 序列参数要点
Hammersmith 医院 Philips Medical Systems Intera 3T T1 TR 9.6/TE 4.6 ms、矩阵 208×208、FA 8°;T2 TR 5,725.79/TE 100 ms;PD TE 8 ms;MRA TR 16.72/TE 5.75 ms、FA 16°;DTI TR 11,894.44/TE 51 ms、NEX 2、体素约 1.74×1.74×1.98 mm
Guy’s 医院 Philips Medical Systems Gyroscan Intera 1.5T T1 TR 9.813/TE 4.603 ms、FA 8°;T2 TR 8,178.34/TE 100 ms;PD TE 8 ms;MRA TR 20/TE 6.9 ms、FA 25°;DTI TR 9,054.01/TE 80 ms、NEX 3
精神病学研究所 GE 1.5T 扫描参数官方未公开

T1 加权像常见分辨率约 0.9375×0.9375×1.2 mm,体积 256×256×150(多数)或 256×256×146(少数);DTI(3T)重建矩阵 112×110、128×128×64 体素。

两台 Philips 机型的完整官方参数(数值直引自官方参数页,TR/TE 单位 ms):

Hammersmith 医院 — Philips Intera 3T:

序列 TR TE 采集矩阵 相位编码步数 回波链长 重建直径 翻转角 备注
T1 9.6 4.6 208×208 208 208 240.0 mm 8° MPRAGE
T2 5,725.79 100.0 192×187 187 16 240.0 mm 90° 与 PD 同 TR
PD 5,725.79 8.0 192×187 187 16 240.0 mm 90° 双回波第二回波
MRA 16.72 5.75 288×286 286 0 240.0 mm 16° —
DTI 11,894.44 51.0 112×110 110 0 224.0 mm 90° 平均次数 2

Guy’s 医院 — Philips Gyroscan Intera 1.5T:

序列 TR TE 相位编码步数 回波链长 重建直径 翻转角 备注
T1 9.813 4.603 192 0 240 mm 8° —
T2 8,178.34 100.0 187 16 240 mm 90° 与 PD 同 TR
PD 8,178.34 8.0 187 16 240 mm 90° 双回波第二回波
MRA 20.0 6.9 286 0 240 mm 25° —
DTI 9,054.01 80.0 94 0 224 mm 90° 平均次数 3

GE 1.5T(IoP)全序列参数官方未公开。跨站点使用参数差异做研究时,上述官方页数值应作为唯一引用依据,二次转引的参数表(含本词条)在正式论文中应回溯核对原始页面。

§3.10 深度溯源链

EPSRC(资助号 GR/S21533/02)→ 帝国理工学院生物医学图像分析组(项目主持,联系人 Daniel Rueckert)→ 三家伦敦医院采集 → 官方网站 brain-development.org 分发(文件服务器 biomedic.doc.ic.ac.uk)→ NITRC 官方登记(ixi_dataset,2015-03-06 入 NITRC-IR)→ 社区生态(Clinica 转换器、TorchIO 接口、Lead-DBS 预处理版、ModelScope/OpenDataLab/Kaggle 镜像)。整条链路无中间商业再授权环节,所有分发均沿用 CC BY-SA 3.0。

溯源链的使用方式:写论文致谢时按"资助方 → 采集机构 → 分发渠道"三级表述(“EPSRC GR/S21533/02 资助、帝国理工学院牵头采集、brain-development.org 分发”);报 bug 或申请镜像授权时直接联系链条第二级(Biomedical Image Analysis Group);做数据引用审计时以 NITRC 登记页为锚点确认机构归属。链条中不存在"IXI 基金会"或商业持有人,任何声称"官方授权费"的中介均可判定为诈骗。


§4 数据结构

§4.0 目录树

官方下载为五个模态压缩包加一个人口学表,解压后为平铺文件(无子目录):

ixi_root/
├── IXI-T1.tar          # 581 个 T1 加权体
│   ├── IXI002-Guys-0828-T1.nii.gz
│   ├── IXI012-HH-1214-T1.nii.gz
│   └── ...
├── IXI-T2.tar          # 578 个 T2 加权体
│   └── IXI002-Guys-0828-T2.nii.gz
├── IXI-PD.tar          # PD 加权体(与 T2 同批受试者)
├── IXI-MRA.tar         # MRA 血管成像体
├── IXI-DTI.tar         # DTI:每方向一卷,同受试者以 -00/-01/… 区分
│   ├── IXI002-Guys-0828-DTI-00.nii.gz
│   ├── IXI002-Guys-0828-DTI-01.nii.gz
│   └── ...
├── bvecs.txt           # 扩散梯度方向(FSL 格式)
├── bvals.txt           # 对应 b 值(b=1000 s/mm²)
└── IXI.xls             # 人口学表:一行一受试者

文件命名规则:IXI{序号}-{站点}-{受试者ID}-{模态}.nii.gz。序号是三位数字的受试者流水号;站点取 Guys / HH / IoP;第三段数字是受试者招募 ID(与 IXI.xls 的 IXI_ID 对应关系需在表中核对,两者并非同一字段,见坑点 8)。

目录树的两个注意点:其一,官方 tar 解压行为因 tar 版本与打包层级而异,有的直接释放文件、有的带一层目录,脚本不要硬编码相对深度,用 glob 全局匹配;其二,DTI 的分卷文件名以 -DTI-00 这类后缀结尾,与结构像的 -DTI 前缀规则不同,解析正则需单独处理。

§4.1 DAIMS 字段字典

以官方 IXI.xls 人口学表(11 个字段)与文件名元数据为核心:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
IXI_ID 整数 受试者招募 ID,一行一例 828 主键,关联影像文件 无 无 正整数
SEX_ID 整数 性别编码:1=男,2=女 1 协变量、公平性分析 自报 无 1—2
AGE_ID 浮点 扫描时年龄(岁) 24.76 脑龄建模、年龄匹配 自报生日推算 无 20—86
HANDEDNESS_ID 整数 利手编码 1 协变量 自报 无 编码整数
ETHNIC_ID 整数 种族编码:1=白人,3=亚裔,4=黑人,5=华裔,6=其他(2 无图例) 1 公平性分析 自报 2 含义不明 1—6
MARITAL_ID 整数 婚姻状况:1=单身,2=已婚,3=同居,4=离异/分居,5=丧偶 2 人口学分析 自报 无 1—5
OCCUPATION_ID 整数 职业:1=全职外出,2=兼职,3=求学,4=全职家务,5=退休,6=失业,7=居家办公,8=其他 5 人口学分析 自报 无 1—8
QUALIFICATION_ID 整数 学历:1=无,2=O-levels,3=A-levels,4=继续教育,5=大学 5 社会经济协变量 自报 无 1—5
DOB 日期 出生日期 1981-06-01 计算精确年龄 自报 无 1919—1986 区间
STUDY_DATE 日期 扫描日期 2005-06-13 重建采集时间线 记录误差 无 2005—2006
文件名元数据 文本 序号/站点/ID/模态,从 .nii.gz 文件名解析 IXI002-Guys-0828-T1 模态配对、站点分层 命名不一致风险 无 枚举站点 3 类
文件名.序号 整数(派生) 受试者流水号(文件名第 1 段,三位补零) 2 排序、跨包对齐 — 无 1—999 区间
文件名.站点 枚举(派生) 采集站点令牌(第 2 段) Guys 站点分层、场强建模 — 无 Guys / HH / IoP
文件名.DTI 分卷号 整数(派生) DTI 方向分卷序号(DTI-xx 的 xx) 0 DTI 4D 合并排序 — 无 0 起连续整数

注:表中日期示例为示意格式,实际值以下载的 IXI.xls 为准;ETHNIC_ID 的编码图例缺失"2",含义官方未说明。派生字段由文件名解析产生,官方未提供独立元数据表,解析逻辑须与 Clinica 转换器口径一致(见坑点 1)。

与临床数据字典的差异提示:IXI.xls 是研究用人口学表而非临床电子病历表——没有诊断码、检验值、用药记录;它的 11 个字段全部围绕"受试者是谁"(性别/年龄/利手/种族/婚姻/职业/学历)与"何时扫的"(DOB/STUDY_DATE)展开。因此 DAIMS 评价中"标签标识""罕见类分组"两项天然失分,这不是数据质量问题,而是数据集定位使然:想要临床标签的用户应转向 ADNI/OASIS 类队列。

§4.2 标签分布

无疾病标签。人口学维度(577 例 T1+T2 双全子集口径):女性约 55%;站点分布 Guy’s 320 / Hammersmith 184 / IoP 73;年龄 20—86 岁连续覆盖,Hammersmith 3T 子集实测呈青年与老年双峰(20—40 岁 69 例、41—60 岁 52 例、61—85 岁 56 例,该站共 177 例含 DTI 者)。学历、职业等字段为自报类别变量,官方未发布分布统计,使用前应自行统计并报告。

关键人口学切片(可核验口径汇总):

维度 口径 数值
女性占比 577 例 T1+T2 双全子集 约 55%
站点分布 同上 Guy’s 320(55%)、Hammersmith 184(32%)、IoP 73(13%)
年龄范围 全体(NeuroImage 2016 口径) 20—86 岁
年龄范围 Hammersmith DTI 子集(177 例) 20—85 岁(男 88 / 女 89)
年龄范围 配准 QC 论文实测子集(577 例) 21—74 岁
种族 IXI.xls ETHNIC_ID 字段 五类有图例 + 一类含义不明

注意三个"年龄范围"口径并不矛盾:它们分别来自不同论文对各自可用子集的统计,全谱以 20—86 岁为准。任何论文声称的"IXI 共 N 例"都应先确认其计数口径(T1 全量 581、双全 577 或其他),再决定是否可比。

§4.3 关键统计

统计项 数值 备注
受试者总数 581(T1 口径) 官方口径"近 600"
模态数 5(T1/T2/PD/MRA/DTI) 每人协议,实际有缺漏
DTI 梯度方向 15 个 b=1000 s/mm²,bvecs/bvals 公开
T1 典型分辨率 0.9375×0.9375×1.2 mm 256×256×150 或 ×146
DTI 典型体素 约 1.74×1.74×1.98 mm 128×128×64(3T 站点)
扫描次数 每人 1 次 无纵向随访
扫描站点 3(2 家场强、2 家厂商) Hammersmith 3T / Guy’s 1.5T / IoP 1.5T
官方衍生数据 无 分割/指标均需自行计算或取第三方
社区收录口径 577—583 例 TorchIO 577(T1+T2)、brainlife 583 sub

§4.4 数据层级

受试者(IXI_ID,581 例)
└── 扫描会话(每人 1 次,STUDY_DATE 记录日期)
    └── 序列(T1 / T2 / PD / MRA / DTI,共 5 类)
        ├── 体数据(.nii.gz,一个序列一个 3D 体;DTI 每方向一卷)
        │   └── 体素(轴向切片堆叠,含 HDR 元数据:TR/TE/FA/矩阵)
        └── 扩散梯度表(仅 DTI:bvecs.txt / bvals.txt,全数据集共用一份)
层级 单元 数量级 键
L1 受试者 人 581 IXI_ID / 文件名第三段
L2 会话 人×日 581(1:1) STUDY_DATE
L3 序列 人×模态 2,700—2,900 卷 文件名序号+站点+模态
L4 体素 mm³ 级 每卷 3M—10M 体素 体素坐标(i,j,k)

层级要点:L1→L3 是一对多的稀疏矩阵(模态缺漏使其不规则),构建多模态批数据时先在 L1 取交集再展开到 L3,避免"隐式对齐";L4 的物理坐标受站点/序列影响(FOV 240 mm 与 224 mm 两类重建直径并存),跨站点逐体素运算前必须重采样到公共网格。

§4.5 缺失值与信息性缺失

缺失情形 位置 处理建议
模态级缺漏 T2/PD/MRA/DTI 各比 T1 少数例 构建多模态训练集时按受试者取交集(≈577 例 T1+T2)
GE 1.5T 站点参数缺失 官方未公开该站扫描协议 站点分层分析时以"协议未知"标注,勿虚构参数
ETHNIC_ID=2 图例无此编码含义 归入"其他/未说明"并在论文中注明
DOB/STUDY_DATE 部分为空 个别受试者 以 AGE_ID 为准做年龄协变量,勿强行推算出生日期
年龄字段命名陷阱 AGE_ID 为扫描时年龄 需精确年龄时用 STUDY_DATE 与 DOB 重算并交叉校验

官方不使用任何"信息性缺失"哨兵值;缺失以"文件不存在/单元格为空"呈现,解析时以存在性检查而非特殊编码判断。

这个设计对工程实现有一个直接推论:数据加载器必须容忍"目录里的文件清单 ≠ 人口学表的行清单"。安全模式是以"实际存在的影像文件"为主键反查人口学表(找不到元数据的文件报警而非崩溃),而不是以表行为主键去找文件——后者会让缺漏模态在批处理中途炸掉。同时,把每次运行发现的缺漏清单写进实验日志,作为可复现性材料的一部分。


§5 划分与使用建议

§5.1 官方划分

官方不提供任何训练/验证/测试划分,也不提供参赛协议——IXI 是资源型数据集而非竞赛数据集。任何论文报告的划分均为作者自定,复现时必须沿用对应论文的划分清单而非自行随机重划。

这带来一个文献阅读技巧:看到"在 IXI 上取得 XX 指标"的表述,先翻其实现细节找划分定义与受试者数(581 还是 577 还是子集),找不到划分细节的结果一律视为不可比。社区里同一模型名下的 IXI 成绩相差数个百分点,多数不是算法差异而是划分差异。

§5.2 社区惯例划分

场景 惯例划分 出处
3D 超分辨率/重建(全量 T1) 500 训练 / 6 验证 / 75 测试(受试者级) MTVNet(arXiv 2024)
2D 重建(T1+T2 组合切片) 866 训练 / 290 验证(2D 切片级) Quaternion Wavelet Networks(arXiv 2023)
3D 分割教学 IXITiny 固定 566 例 T1 + 衍生标签 TorchIO
老化/形态学研究 按站点分层或仅用单一站点(如仅 Hammersmith 3T)以规避跨场强漂移 多篇论文做法

§5.3 泄漏风险(重点)

IXI 的最大泄漏源不是标签(没有标签),而是同一受试者的多份衍生样本跨集。三类高频事故:其一,2D 切片级划分——同一 3D 体积的相邻切片被拆入训练与测试,切片间近乎复制导致指标虚高;其二,成对任务(T1↔T2 合成、超分监督对)中按"文件"而非"受试者"划分,同一个人的 T1 在训练集、T2 在测试集,解剖信息完全一致;其三,数据增强类泄漏——对测试集做过拟合式增强选择。规则只有一条:一切划分以 IXI_ID 为最小单元,先按受试者分组再抽样。

还有两类更隐蔽的泄漏值得点名。预处理统计泄漏:若对全数据集统一估计归一化均值/直方图匹配参数,测试集的强度统计已进入训练;正确做法是所有统计仅在训练折内估计。模板泄漏:把全部受试者一起配准到"从全体构建的模板"上再划分,模板本身携带了测试受试者的解剖;正确做法是模板只用训练折构建。这两种泄漏在跨模态合成与配准论文中出现频率极高,审稿时应主动核对。

§5.4 划分策略建议

推荐流程:解析文件名得到受试者清单 → 按站点分层抽样(保持 Guy’s/Hammersmith/IoP 比例)→ 在每个站点内按年龄段分箱抽样(保持 20—86 岁覆盖)→ 8:1:1 或按论文惯例 500/6/75。测试集建议固定冻结并发布受试者清单,便于社区横向比较。

# 受试者级分层划分:站点 × 年龄段 双变量分层
import pandas as pd
from sklearn.model_selection import train_test_split

meta = pd.read_excel("data_root/IXI.xls")
meta["age_bin"] = pd.cut(meta["AGE_ID"], bins=[20, 40, 60, 87],
                         labels=["young", "middle", "old"])
meta["stratum"] = meta["SITE"].astype(str) + "_" + meta["age_bin"].astype(str)

train_df, temp_df = train_test_split(meta, test_size=0.2,
                                     stratify=meta["stratum"], random_state=42)
val_df, test_df = train_test_split(temp_df, test_size=0.5,
                                   stratify=temp_df["stratum"], random_state=42)
# 保存冻结清单:此后所有实验共用,禁止重新随机
train_df["IXI_ID"].to_csv("split_train.csv", index=False)
val_df["IXI_ID"].to_csv("split_val.csv", index=False)
test_df["IXI_ID"].to_csv("split_test.csv", index=False)

注:IXI.xls 官方无 SITE 列时,站点需先从文件名解析并按 ID 合并后再分层;分箱边界可按研究人群调整,但必须随划分清单一并发布。

§5.5 交叉验证建议

方法学论文可用 5 折受试者级交叉验证报告均值±标准差,折间保持站点与年龄分布一致;DTI 类小样本任务(如仅用 3T 子集)建议 10 折。禁止在折间共享任何预处理统计量(如归一化均值),统计量只能在训练折内估计。

§5.6 外部验证建议

IXI 训练的模型建议在至少一个分布外数据集验证:疾病对照(OASIS-1 的认知正常老年组)、不同扫描仪(HCP 的 Siemens 3T、ABIDE 的多站点)、不同场强(1.5T 临床常规数据)。由于 IXI 三站点仅 Philips/GE 两家厂商,任何"跨厂商泛化"结论都必须在 Siemens 数据上另行验证。相关站内词条:ADNI、ABIDE、OASIS。


§6 AI 就绪指南

§6.0 云端快速启动

不想下载数十 GB?三条零安装路径:其一,Kaggle Notebook 直接挂载 FreeSurfer 8 预处理版(含 skull-strip 后的 T1 与 aseg 分割);其二,HuggingFace 数据集 pzarzycki/mri-oasis-1-ixi-pre 提供逐卷 NumPy 数组(96×128×96,float32),hf_hub_download 一行取一卷;其三,TorchIO 的 IXI 类按需下载单受试者单模态,首次调用自动缓存。国内环境优先选 ModelScope/OpenDataLab 镜像。

§6.1 快速上手

📁 目录结构预期:以下代码假设官方压缩包已解压到 data_root,五个模态文件平铺在同名目录中(data_root/IXI-T1/*.nii.gz 等),人口学表位于 data_root/IXI.xls。data_root 可为任意本地路径,代码中所有拼接均以它为根。

📌 data_root 拼接关系:data_root / "IXI-{MODALITY}" / "{stem}.nii.gz",其中 stem 形如 IXI002-Guys-0828-T1。

📌 最小可用子集:只需 IXI-T1.tar(约数百卷)+ IXI.xls 即可跑通本节代码;多模态任务再加 T2。

# pip install nibabel pandas numpy torch torchio
from pathlib import Path
import pandas as pd

DATA_ROOT = Path("data_root")          # 五个解压目录与 IXI.xls 的共同父目录

# 1) 读取官方人口学表(一行一受试者)
demo = pd.read_excel(DATA_ROOT / "IXI.xls")
print(demo[["IXI_ID", "SEX_ID (1=m, 2=f)", "AGE_ID"]].head())

# 2) 建立 受试者 -> T1 文件 的索引
t1_files = sorted((DATA_ROOT / "IXI-T1").glob("*.nii.gz"))
t1_index = {}
for f in t1_files:                      # 文件名形如 IXI002-Guys-0828-T1.nii.gz
    _, site, sid, _ = f.stem.split("-") # ("IXI002", "Guys", "0828", "T1")
    t1_index[int(sid)] = f
print(f"T1 受试者数: {len(t1_index)}")   # 预期 581

# 3) 取 T1+T2 双全的受试者(多模态任务的最小安全子集)
t2_index = {int(f.stem.split("-")[2]): f
            for f in (DATA_ROOT / "IXI-T2").glob("*.nii.gz")}
paired_ids = sorted(set(t1_index) & set(t2_index))
print(f"T1+T2 双全: {len(paired_ids)} 例")   # 预期 577

§6.2 数据获取

渠道 链接 大小 门槛
官方(推荐) brain-development.org/ixi-dataset 页内 5 个 .tar + IXI.xls 约 27—30 GB 无需注册
NITRC-IR nitrc.org/projects/ixi_dataset(影像仓库 XNAT) 同官方 NITRC 免费账号
ModelScope 镜像 modelscope.cn/datasets/OmniData/IXI 29.41 GB 免费账号
OpenDataLab 镜像 opendatalab.com/OpenDataLab/IXI 27.4 GB 免费账号
Kaggle 预处理版 kaggle.com/datasets/kingpowa/preprocessed-ixi-dataset-with-fs8 约 21 GB Kaggle 账号
TorchIO 接口 tio.datasets.IXI(root, download=True) 按需 无
# 官方渠道:T1、T2 与人口学表(其余模态同理替换文件名)
mkdir -p data_root && cd data_root
BASE=https://biomedic.doc.ic.ac.uk/brain-development/downloads/IXI
wget -c $BASE/IXI-T1.tar && tar xf IXI-T1.tar -C IXI-T1 --strip-components=0
wget -c $BASE/IXI-T2.tar && tar xf IXI-T2.tar
wget -c $BASE/IXI.xls
wget -c $BASE/bvecs.txt $BASE/bvals.txt   # DTI 梯度表
# 备选:TorchIO 一键下载(自动配对模态,首次运行较慢)
import torchio as tio
ixi = tio.datasets.IXI(root="ixi_root", modalities=("T1", "T2"), download=True)
print(len(ixi))                          # T1+T2 双全约 577

常见获取问题排查:官方服务器偶发限速,大包下载建议断点续传(wget -c)并校验 tar 完整性(tar tf IXI-T1.tar >/dev/null 无报错);镜像站内容与官方同源但可能重压缩,严格实验一律以官方包为准;TorchIO 下载类在部分版本对 DTI 的 bvals/bvecs 组织有自己的约定,与官方文件直接混用前先读其源码确认,避免坑点 4 的梯度错配。

§6.3 预处理全流程

标准结构像流水线:NIfTI 读取 → 方向规范化 → 强度截断与 N4 偏置场校正 → 颅骨剥离 → 重采样到 1 mm 各向同性 → 受试者级 z-score。DTI 流水线:分卷合并 → 梯度表构建 → 涡流/运动校正 → 张量拟合 → FA/MD 图。

# --- 结构像预处理(T1 为例,T2/PD 同理) ---
import numpy as np, nibabel as nib
from dipy.segment.mask import median_otsu

def load_t1(path):
    img = nib.load(path)
    data = img.get_fdata(dtype=np.float32)
    data = np.clip(data, 0, np.percentile(data, 99.5))   # 截断亮斑噪声
    data /= data.max() + 1e-8                            # 归一到 [0, 1]
    return img, data

def skull_strip(data):
    _, mask = median_otsu(data, median_radius=4, numpass=4)
    return data * mask

# --- DTI 预处理:分卷合并 + 梯度表 + 张量拟合 ---
from glob import glob
from dipy.core.gradients import gradient_table
from dipy.reconst.dti import TensorModel

def load_dti(subject_id, data_root):
    """IXI 的 DTI 每方向一卷(DTI-00、DTI-01、…),梯度表为全档案共用文件,
    行/列与卷的对应关系需按官方 bvals.txt 的实际布局核对(见坑点 4)。"""
    vols = sorted(glob(f"{data_root}/IXI-DTI/IXI*-{subject_id}-DTI*.nii.gz"))
    bvals = np.loadtxt(f"{data_root}/bvals.txt")
    bvecs = np.loadtxt(f"{data_root}/bvecs.txt")
    gtab = gradient_table(bvals[:len(vols)], bvecs=bvecs[:, :len(vols)])
    data4d = np.stack([nib.load(v).get_fdata() for v in vols], axis=-1)
    tenfit = TensorModel(gtab).fit(data4d)
    return tenfit.fa, tenfit.md          # 各向异性分数图 / 平均扩散率图
# 更稳健的 DTI 前置校正(涡流 + 运动智正)建议用 FSL:
# flirt/eddy 需要原始 DICOM 或带方向的 NIfTI;IXI 官方只发 NIfTI,
# eddy 可直接运行,但 GE 站点参数未知时校正参数需保守设置。
eddy --imain=dwi --mask=nodif_brain_mask --acqp=acqparams.txt \
     --index=index.txt --bvecs=bvecs --bvals=bvals --out=eddy_out

跨站点强度协调(可选但推荐):训练集跨三站点时,先做"直方图 Landmark 匹配"或 nyul 标准化,把三个站点的强度分布拉到公共尺度,再进模型。最简实现是按站点统计 1—99 分位的 10 个分位 landmark,线性插值映射到训练折平均 landmark;注意全部统计量只能在训练折内估计(见 §5.3 模板/统计泄漏),验证与测试集用训练折学到的映射做变换。

§6.4 PyTorch DataLoader

# 完整可运行:受试者级配对 + 3D 随机裁剪 + DataLoader
import torch
from torch.utils.data import Dataset, DataLoader
import torchio as tio

class IXIPairedT1T2(Dataset):
    """T1+T2 双全受试者(约 577 例)。每个样本返回 {'t1':..., 't2':...}。"""
    def __init__(self, ids, t1_index, t2_index, patch=(96, 96, 96)):
        self.ids, self.t1, self.t2, self.patch = ids, t1_index, t2_index, patch
        # 训练期增强(对 T1/T2 施加同一随机空间变换,保证配对对齐)
        self.train_tf = tio.Compose([
            tio.ToCanonical(),                 # RAS 方向统一
            tio.Resample((1, 1, 1)),           # 1 mm 各向同性
            tio.CropOrPad(self.patch),
            tio.RandomFlip(axes=("LR",)),      # 左右翻转安全
            tio.RandomBiasField(),             # 模拟磁场不均匀
            tio.RandomNoise(std=(0, 0.02)),
        ])

    def __len__(self):
        return len(self.ids)

    def __getitem__(self, i):
        sid = self.ids[i]
        subj = tio.Subject(
            t1=tio.ScalarImage(self.t1[sid]),
            t2=tio.ScalarImage(self.t2[sid]),
        )
        subj = self.train_tf(subj)
        return {"t1": subj["t1"].data, "t2": subj["t2"].data,
                "sid": sid}

train_set = IXIPairedT1T2(paired_ids[:520], t1_index, t2_index)
val_set   = IXIPairedT1T2(paired_ids[520:], t1_index, t2_index)
# 注意:val_set 不要传入训练期随机增强(生产代码中应分离 train/eval transform)

train_loader = DataLoader(train_set, batch_size=2, shuffle=True,
                          num_workers=4, pin_memory=True)
for batch in train_loader:
    t1, t2 = batch["t1"].cuda(), batch["t2"].cuda()   # [B, 1, 96, 96, 96]
    break

两个工程细节:其一,验证与测试必须换用无随机项的 transform(只保留 ToCanonical/Resample/CropOrPad),示例中为简洁未分离,生产代码应以 train_tf 与 eval_tf 两个对象显式区分;其二,num_workers>0 时 nibabel/torchio 的句柄在 fork 后偶发出错,Linux 下建议配合 persistent_workers=True 并把异常卷列入 §7.2 的 QC 黑名单而非运行时跳过。

§6.5 坑点 8 个

⚠️ 坑点 1:按文件名第三段数字当"年龄"用(分类:标签理解)

问题:文件名 IXI002-Guys-0828-T1 中的 0828 是受试者招募 ID,不是年龄、也不是日期;把三位/四位数当年龄或时间会造成特征污染。
症状:画年龄分布时出现 800+ 岁的离群点;按"年龄"分层时层内人数与 IXI.xls 完全对不上。
解决:

  1. 简单方法:年龄一律从 IXI.xls 的 AGE_ID 读取;文件名只解析序号、站点、ID、模态四段。
  2. 进阶方法:用 IXI_ID 与文件名第三段做 join 校验:assert set(demo.IXI_ID) >= set(int(s) for s in name_ids),不一致的样本进入人工核对清单。
  3. SOTA 方法:写一个统一的 parse_ixi_filename() 工具函数入库测试(含边界:序号补零、站点大小写、模态枚举),所有下游代码只从它取元数据。
    参考:官方下载页文件示例与 Clinica ixi-to-bids 文档中的目录树(aramislab.paris.inria.fr/clinica/docs)。

⚠️ 坑点 2:2D 切片级划分导致同一体积跨集(分类:数据泄漏)

问题:把 3D 体积切成 2D 切片后再随机划分 train/test,同一受试者的相邻切片几乎复制,测试集信息提前进入训练。
症状:重建/分割指标异常地高(如 SSIM 普遍 0.97+),换到受试者级划分立刻掉 5—15 个百分点。
解决:

  1. 简单方法:先按受试者聚合成组(groupby(IXI_ID)),再做 train/test 划分,切片跟随受试者。
  2. 进阶方法:sklearn.model_selection.GroupShuffleSplit(groups=ids),或 GroupKFold 做受试者级交叉验证。
  3. SOTA 方法:冻结一份受试者级划分清单(JSON/CSV)随代码发布,社区复现直接引用,杜绝"每次随机重划"。
    参考:MTVNet(arXiv:2412.03379)采用的 500/6/75 受试者级划分。

⚠️ 坑点 3:忽视三站点场强/厂商差异,模型学会"认站点"(分类:偏倚陷阱)

问题:Hammersmith 3T 与 Guy’s 1.5T 的对比度、噪声、几何畸变系统性不同,IoP 的 GE 1.5T 又是第三种风格;标签无关任务里模型可用纹理判断站点并当作捷径特征。
症状:站点作为输入特征可被模型近乎完美分类;测试集站点比例一变,指标大幅波动;仅用单一站点训练的模型跨站点明显退化。
解决:

  1. 简单方法:划分时按站点分层抽样,保证三个集合站点比例一致;报告分站点指标。
  2. 进阶方法:训练期加域随机化(随机伽马、偏置场、直方图匹配到公共模板);或做站点级 z-score/直方图标准化。
  3. SOTA 方法:对抗域自适应或 ComBat 类站点协调后再训练;论文中报告"留一站点"(leave-one-site-out)泛化结果。
    参考:多站点 MRI 协调文献通行做法;IXI 站点构成见同行评审实测(320/184/73)。

⚠️ 坑点 4:DTI 梯度表与分卷对不上 / bvecs 坐标系误用(分类:预处理陷阱)

问题:官方 DTI 每方向一卷、梯度表 bvecs/bvals 是全档案共用文件,卷数、方向顺序与表行/列的对应需要自行核对;且 bvecs 采用 FSL 图像坐标系(相对扫描轴),直接当世界坐标用会得到错误的 FA 方向。
症状:FA 图出现方向翻转或扇形错乱;张量主特征向量与解剖走向明显不符(如胼胝体纤维方向异常);不同受试者间 FA 方向毫无一致性。
解决:

  1. 简单方法:核对 bvals.shape 与 bvecs.shape(通常一方为 3×N、另一方为 N),按官方文件实际布局取对应受试者的那一段;方向数与分卷数必须相等。
  2. 进阶方法:FSL 流程内保持 bvecs 与 eddy/flirt 参数联动;若在 Python 中重定向图像,用 dipy.align 后同步旋转 bvecs(dipy.core.gradients.reorient_vectors)。
  3. SOTA 方法:改用输出世界坐标的管线(如 dipy 全流程或 qsiprep),从源头消除坐标系歧义;15 方向 b=1000 的张量拟合建议保留残差图做质检。
    参考:FSL/dipy 官方文档对 bvecs 坐标系的说明;IXI 官方下载页 bvecs/bvals 条目。

⚠️ 坑点 5:T2 与 PD 混淆加载(分类:工程陷阱)

问题:T2 与 PD 共享同一 TR(3T 站点 5,725.79 ms)且矩阵相同,仅 TE 不同(100 ms 对 8 ms);批量读取时若按目录顺序或文件哈希配对,容易把两者装错。
症状:"T2→PD"合成模型在全部样本上表现出恒定映射(两者本来就是同一批受试者的不同回波);视觉抽检发现"PD"里脑室是亮的。
解决:

  1. 简单方法:永远以文件名末段模态令牌(-T2/-PD)为准配对,禁止按修改时间或 glob 顺序。
  2. 进阶方法:加载后做一次统计校验——PD 图脑室信号低于 T2 图(TE 短、T2 衰减小),抽样断言通过率应为 100%。
  3. SOTA 方法:把"模态-TE 对照表"(3T:T2 TE 100 / PD TE 8;1.5T:T2 TE 100 / PD TE 8)写进数据卡,任何脚本改动跑 CI 校验。
    参考:官方扫描参数页(wp.doc.ic.ac.uk/brain-development 下两台 Philips 机型页面)。

⚠️ 坑点 6:把 IXI 成绩直接与 HCP/BraTS 等数据集横向比较(分类:评估误用)

问题:IXI 的 T1 分辨率约 0.94×0.94×1.2 mm(非各向同性)、三站点混合、无标注金标准;与 HCP(0.7 mm 各向同性、Siemens 3T 单协议)或 BraTS(1 mm、肿瘤分割)的数字不在同一评估框架。
症状:审稿意见直接指出"baseline 选择不可比";同一模型在两个数据集上排名颠倒。
解决:

  1. 简单方法:论文中单列"数据集协议表"(分辨率、站点、划分、指标定义),明确声明数字不可跨集比较。
  2. 进阶方法:把 IXI 结果重采样到与对比数据集相同网格与指标实现下重测;或直接在两数据集上分别微调后报告。
  3. SOTA 方法:引用采用相同划分(如 500/6/75)的已发表数字做同框架对比,并公开推理脚本。
    参考:MTVNet(arXiv:2412.03379)与 Quaternion Wavelet Networks(arXiv:2310.10224)各自的协议描述。

⚠️ 坑点 7:把"健康分布模型"直接外推到患者(分类:偏倚陷阱)

问题:IXI 全部为健康人、伦敦招募、20—86 岁;用它训练的异常检测/合成模型隐含"正常 = 伦敦健康成年人的扫描风格"。
症状:在真实临床数据上大量假阳性(扫描仪差异被判为"异常");年龄外推到 <20 岁或 >86 岁时输出不可信。
解决:

  1. 简单方法:在论文与应用中明确适用域(健康成人、多序列 MRI、三站点风格),异常阈值仅在目标域数据上重标定。
  2. 进阶方法:以 IXI 为"正常"预训练,再用目标域健康子集做域适应;对扫描风格差异做直方图匹配。
  3. SOTA 方法:训练时显式加入扫描风格随机化(合成伪偏置场/噪声/分辨率),使"正常"模型对采集协议不敏感。
    参考:以 IXI 训练、OASIS-1/BraTS2021 验证的异常检测工作(PLOS Digital Health, 2024, doi:10.1371/journal.pdig.0000874)。

⚠️ 坑点 8:IXI.xls 与影像 ID 关联断裂 / CC BY-SA 传染性(分类:工程陷阱)

问题:人口学表的 IXI_ID 与文件名第三段(招募 ID)需要核对后 join,直接按行序合并会把 A 的年龄配给 B;同时 CC BY-SA 3.0 要求衍生数据集同样以 BY-SA 共享,把 IXI 混入闭源训练集再分发会违反许可。
症状:人口学-影像联合分析出现系统性年龄错位(性别与年龄分布对不上);法务/开源合规审查要求补披露。
解决:

  1. 简单方法:以 int(文件名第三段) 与 IXI.xls 的 IXI_ID 列为键做显式 merge,行数必须等于影像数。
  2. 进阶方法:merge 后做三重校验——样本数守恒、SEX/AGE 与既有文献分布一致(约 55% 女性、20—86 岁)、随机抽 10 例人工核名。
  3. SOTA 方法:发布衍生数据时附 LICENSE(CC BY-SA 3.0)+ 来源声明页(官方建议措辞:Data provided by the IXI project, Imperial College London),并保持 DOB 等准标识符不再分发。
    参考:官方下载页许可说明;Clinica 文档中 IXI.xls 作为 CLINICAL_DATA_DIRECTORY 的用法。

§6.6 数据增强

安全 ✅(不改变解剖与标签一致性):左右翻转(脑近似左右对称,注意配对任务对 T1/T2 施加同一翻转)、随机仿射/弹性小形变、随机伽马、随机噪声、随机偏置场、随机降分辨率再超分(超分任务的经典构造方式)。

危险 ❌:绕头方向大幅旋转(破坏 RAS 一致性与 bvecs 对应)、独立增强 T1 与 T2(破坏跨模态配对)、灰度反转(MRI 强度语义无意义)、对测试集做"挑过"的增强、在 DTI 中独立于 bvecs 旋转体积而不旋转梯度方向。

一条通用判断标准:任何改变"空间朝向"的增强必须同时作用于配对的所有输入(影像、掩膜、梯度方向),任何改变"强度语义"的增强必须保持跨模态相对关系(T2 脑室亮于 T1 这一事实不能被翻转)。把这条写进增强管线的单元测试,能拦下九成增强事故。

§6.7 模型推荐

任务 推荐起点 升级方向
3D 分割 nnU-Net / TorchIO IXITiny + 3D U-Net Swin UNETR、nnFormer
超分辨率 mDCSRN 类 3D 收缩网络 + GAN 判别器 MTVNet 类长程 Transformer
T1↔T2 合成 2.5D pix2pix / CycleGAN 3D 条件扩散模型
配准 VoxelMorph(IXI 多序列可作多模态配准对) TransMorph、微分同胚版
DTI 处理 dipy 张量拟合 + TBSS MSMT-CSD 类(需注意 IXI 仅 15 方向,多壳模型受限)
脑龄回归 FreeSurfer 影像组学 + XGBoost 3D ResNet 端到端(注意按受试者划分)

§6.8 硬件需求

场景 显存 存储 说明
2D 切片训练 8 GB 500 GB HDD 逐切片加载,最轻量
3D patch 训练(96³) 11—24 GB 1 TB SSD 本节 §6.4 配置
全体积 3D 训练 40 GB+ 1 TB SSD 建议离线重采样到 1 mm
DTI 张量流水线 CPU 即可 500 GB dipy/FSL,无需 GPU

多机/多人协作时的额外开销主要在预处理缓存:重采样与颅骨剥离结果约再占原数据 1—1.5 倍空间,建议把 preprocessed/ 目录与原始数据分开管理并在团队内共享只读缓存,避免每人重复计算一遍(581 例全流程在单机 16 核上约数小时)。

§6.9 评估指标

import torch

def psnr(pred, target, data_range=1.0):
    mse = torch.mean((pred - target) ** 2)
    return 10 * torch.log10(data_range ** 2 / (mse + 1e-12))

def ssim(pred, target, win=7, data_range=1.0):
    """按体积逐切片计算 2D SSIM 后平均(工程惯例),或用 monai.metrics.SSIMMetric。"""
    from monai.metrics import SSIMMetric
    return SSIMMetric(win_size=win, data_range=data_range)(pred, target)

def dice(pred_bin, gt_bin, eps=1e-7):
    inter = (pred_bin & gt_bin).sum(dim=(1, 2, 3, 4))
    card  = pred_bin.sum(dim=(1, 2, 3, 4)) + gt_bin.sum(dim=(1, 2, 3, 4))
    return (2 * inter / (card + eps)).mean()

def hausdorff95(pred_bin, gt_bin):
    """95% Hausdorff 距离(mm),用 MONAI 实现避免自己写距离变换。"""
    from monai.metrics import HausdorffDistanceMetric
    hd = HausdorffDistanceMetric(percentile=95)
    return hd(pred_bin, gt_bin)   # 输入需 one-hot / channel 维

# 脑龄任务:MAE(岁)+ 按年龄分箱报告,警惕年龄相关shortcut(站点-年龄相关时更甚)
def brain_age_report(pred_ages, true_ages, site_ids):
    import pandas as pd
    df = pd.DataFrame({"pred": pred_ages, "true": true_ages, "site": site_ids})
    overall = (df["pred"] - df["true"]).abs().mean()
    by_site = df.groupby("site").apply(
        lambda g: (g["pred"] - g["true"]).abs().mean())
    print(f"总体 MAE: {overall:.2f} 岁")
    print(by_site)   # 站点间 MAE 差异大 = 模型在利用站点风格特征
    return overall, by_site

§6.10 MLOps 笔记

数据版本:官方数据静态不变,建议把"下载 URL + 文件 SHA256 清单"纳入版本控制,镜像来源写入数据卡。划分冻结:受试者级划分清单随代码提交(坑点 2 的 SOTA 做法)。许可链:任何衍生模型/数据发布须带 CC BY-SA 3.0 声明(坑点 8)。监控:上线类应用(如异常检测)需监控输入扫描协议漂移——IXI 训练的"正常"模型对场强与厂商极敏感(坑点 3/7)。


§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解建议
站点/设备偏倚 三站点两种场强、两家厂商,扫描风格系统差异(320/184/73 分布不均) 高 站点分层划分、留一站点评估、ComBat/直方图协调
人群代表性 仅伦敦招募,种族/社会经济构成限于招募框架 中 外部验证须纳入其他地区队列,慎下全球性结论
年龄覆盖缺口 20—86 岁,不含未成年人 中 明确适用域;儿童研究需换数据集
健康选择偏倚 志愿者自选入组,非"完全正常"人群 中 结合神经心理筛查报告;对亚临床改变保持审慎
模态缺漏 各模态 576—581 例不等,MRA/DTI 缺漏更多 低 受试者级交集;报告实际 N
无标注金标准 无人工分割/标签,衍生标签口径不一 高(分割任务) 引用衍生标签生成流程;多工具交叉验证

自查建议:把上表压缩成训练前 checklist——划分前先跑"站点 × 年龄段 × 性别"三维交叉表,任何一格占比偏离全体 ±10% 即触发重新分层;每份实验报告附该交叉表,使偏倚可见而非依赖口头声明。这套动作成本低,却能拦住绝大多数"站点捷径学习"与"年龄分布漂移"事故。

§7.2 标注质量

官方数据无人工标注,因此不存在标注一致性可评估。需要注意的质量点在元数据:IXI.xls 为自报信息(年龄由 DOB 推算、种族/职业/学历为自报类别),官方未发布核查说明;年龄字段 AGE_ID 与 DOB/STUDY_DATE 间存在个别不一致的可能,使用前应做交叉校验。影像侧质量由社区工具链间接背书——十余年来大量论文将 IXI 用于配准/分割基准而未报告系统性坏卷,但官方无逐卷 QC 报告,首次使用建议跑一遍自动 QC(如信噪比、运动伪影、颅内外轮廓检查)并剔除异常卷。

实操层面可按三步搭建轻量 QC:第一步统计侧,逐卷检查体素尺寸、矩阵与理论值(256×256×150/146 等)的偏离清单;第二步强度侧,画灰度直方图并按站点分组比对,离群者标记人工复核;第三步解剖侧,抽 5% 用 FreeSurfer recon-all 跑通率检查,报错卷回溯原始 tar 校验 MD5。三步合计约一个工作日,可换后续数月训练的安心。

§7.3 泛化性

目标场景 失效风险 证据
其他厂商/协议扫描(如 Siemens 1.5T 临床常规) 高 IXI 仅覆盖 Philips/GE 两家、协议固定;风格差异可被模型误读为病理
患者群体(萎缩、病灶、术后) 高 健康分布外推是异常检测类模型的已知失败模式(坑点 7)
儿童/青少年 高 年龄下限 20 岁,发育期脑形态不在覆盖内
伦敦健康成人、Philips/GE 扫描 低 与训练分布同域,可放心用于方法学基准
多站点疾病研究对照组 中 年龄匹配后可用,但站点构成需与病例组协调

降低泛化风险的投资顺序:先修数据侧(站点分层 + 直方图协调,几乎零算法成本),再做训练侧(域随机化与留一站点验证),最后才考虑对抗对齐等重型方法。经验上,仅前三步就能解决大部分"换数据集即崩"的问题;重型方法应留给确有分布差距证据的场景。

§7.4 伦理

数据由参与医院伦理框架下的健康志愿者研究产生,官方公开时已去除直接标识符,且明确受试者无神经系统疾病史。按 CC BY-SA 3.0 分发,无需用户再签协议。两点合规注意:IXI.xls 含 DOB 与扫描日期,属准标识符,二次分发时应删除或模糊化;任何衍生数据集必须以相同许可(BY-SA)共享,不得转为专有许可。

与当代数据集(如 HCP 要求签署受限数据条款、ABIDE 按站点分别授权)相比,IXI 的伦理合规负担属于最轻一档,这既是教学场景的加分项,也意味着"合规自查"完全落在使用者身上——没有官方条款兜底,署名、同许可共享、准标识符处理三件事需要自行写入团队的数据管理计划。

§7.5 公平性

种族字段(ETHNIC_ID)允许按群体分析模型表现,但官方未发布分布统计,且"编码 2 无图例"提示字段质量有限。性别构成相对均衡(双全子集约 55% 女性);年龄连续覆盖成年全谱。风险点在于"站点-年龄"耦合:3T 站点青年样本多、老年样本相对集中于部分站点,跨年龄泛化实验应同时控制站点变量。

公平性评估的可操作做法:以 ETHNIC_ID/SEX_ID/年龄段做分组分性能(如脑龄 MAE 按性别、分割 Dice 按站点),报告组间极差而非只报总体均值;样本量小于 20 的分组不给结论只给警示;ETHNIC_ID=2 的不明编码样本单列不并入任何组。这些约定写进实验模板,比事后补救便宜得多。

§7.6 数据漂移

官方数据静态不变,无版本漂移。真实漂移发生在应用端:以 IXI 为"正常"基线的模型,面对 2020 年代扫描仪(压缩感知重建、新序列)会出现协议漂移,表现为假阳性率上升。建议在部署前用目标环境健康样本重标定阈值,并把扫描协议元数据纳入输入特征监控。

监控落地清单:输入侧记录扫描仪型号/场强/序列名并做分布看板;强度侧监控均值-方差漂移(相对 IXI 训练分布的 z 偏移);输出侧监控异常分数分布的周环比,突变先查协议再查模型。IXI 时代的协议多样性已具雏形,这套监控在任何"健康基线"模型上都值得直接复用。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 ✅ IXI.xls 一行一受试者,无长表混杂
2 唯一标识 ✅ IXI_ID 主键 + 文件名含 ID,可稳定关联
3 特殊字符 ⚠️ 列名自带编码说明(如 “SEX_ID (1=m, 2=f)”),解析需容错
4 重复行 ✅ 无重复受试者记录
5 缺失编码 ⚠️ 以空单元格表达缺失,无哨兵值,需存在性判断
6 标签标识 ❌ 无疾病/任务标签,监督学习需外部构造
7 罕见类分组 ⚠️ 无类别标签,不适用;人口学小类(如某些职业)需自行合并
8 偏倚评估 ✅ 本词条 §7.1 给出结构化偏倚清单
9 数据字典 ✅ §4.1 提供 11 字段完整字典
10 信息性缺失解释 ⚠️ 官方无文档,§4.5 为本词条推断性说明
11 设备记录 ⚠️ 站点可从文件名解析;参数两站点公开、GE 站点缺失
12 共线性 ✅ T2/PD 同 TR 属协议设计而非数据缺陷,记录即可
13 编码映射 ⚠️ ETHNIC_ID=2 无官方图例,语义不明
14 时间戳处理 ⚠️ DOB/STUDY_DATE 部分缺失且为准标识符
15 划分建议 ✅ §5 给出受试者级分层划分流程
16 泄漏讨论 ✅ §5.3 明确受试者级最小划分单元
17 标签分布 ⚠️ 官方无人口学分布报告,需自行统计
18 测量偏倚 ✅ 站点/场强/协议差异可完整标注(除 GE 参数)
19 外部验证建议 ✅ §5.6 与 §7.8 给出分布外验证路径
20 版本记录 ❌ 官方无版本号与变更日志
21 预处理脚本 ❌ 官方未提供,需社区工具链(TorchIO/Clinica)
22 合规要求 ✅ CC BY-SA 3.0 清晰,署名与同许可共享义务明确
23 多模态对齐 ⚠️ 同受试者五序列齐全,但无逐体素配准保证,需自行对齐
24 去标识化 ⚠️ 无直接标识符;DOB 为准标识符,再分发需处理

DAIMS 评分:15 / 24(✅×10、⚠️×10、❌×4)

评分解读:15/24 属于"元数据规范、标注与运维缺位"的典型资源型数据集画像。失分集中在三类:无任务标签(❌ 6/7)、无官方工程配套(❌ 20/21,版本与脚本)、以及人口学字段的语义缺口(⚠️ 3/13/14)。加分项是标识体系、划分与泄漏指引、许可清晰度——这些恰恰是很多临床数据集的短板。

对你意味着什么:如果你的任务是方法学基准(分割/超分/合成/配准),IXI 可以直接开工,按 §5 冻结受试者级划分、按 §6.3 跑预处理即可;如果需要监督信号,标签必须自建(FreeSurfer 衍生或第三方衍生集),并在论文中说明生成流程;如果你要把它用于临床对照,先做站点分层与年龄匹配,再考虑协调算法;无论哪条路,交付物里都要带上 CC BY-SA 声明与 DOB 处理策略,避免合规返工。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
DTI 配准基准(IXI 3T 子集自评) 西北工业大学等(BioMed Eng OnLine 2017) 六种 DTI 配准算法横向比较 纤维距离 MSE/RMSE、束间相似度 — DTI-TK 在张量配准上占优;IXI 15 方向数据足以区分算法差异
BraTS2021(异常检测) 见 PLOS Digital Health, 2024 以 IXI T2 训练的标准化流异常定位 图像级/像素级异常分数 域外病灶数据 健康分布模型可定位胶质瘤异常区,T2 优于 T1
OASIS-1 圣路易斯华盛顿大学 同上模型的外部验证 同上 跨机构/跨扫描仪 验证健康基线跨站点泛化的可行性
自身多序列(T1↔T2) 各超分/重建论文 跨模态监督重建 PSNR/SSIM(2D 切片级) 模态间 IXI 是少数能做"真跨模态监督"的公开集
HCP 对照 华盛顿大学圣路易斯分校 超分辨率协议对比 PSNR/SSIM(受试者级) 分辨率/场强不同 数字不可直接比较(坑点 6),论文需声明

注:表内"—"表示原文未提供可比内部基线;各行列数值口径不同,不构成横向排名。

这张矩阵的读法:IXI 在外部验证中的角色几乎全是"训练侧健康分布"或"待评估算法的公共测试场",而非被验证对象本身。若你的研究要反向使用该矩阵(例如"我的模型在 IXI 上训练后在 OASIS-1 掉了多少分"),务必同时报告站点协调前后的两套数字——IXI 三站点的内部异质性常常比"IXI→OASIS"的跨库差异还大,只报一个数会误导读者。


§8 基准性能与生态

§8.1 社区基准(无官方排行榜)

IXI 没有官方榜单与统一评测服务;下表汇总使用 IXI 的代表性量化研究,其数字基于各自协议,不可直接比较(划分、分辨率、指标实现均不同):

排名 模型/研究 任务与 IXI 用法 年份 关键技术 完整引用 代码
— MTVNet 3D 超分辨率(IXI 581 例 T1,500/6/75 受试者级划分) 2024 体积 Transformer 长程交互 MTVNet: Mapping using Transformers for Volumes, 2024, arXiv:2412.03379 论文附
— QWN 多模态重建(T1 581 + T2 578,2D 切片 866/290) 2023 四元数小波网络 Generalizing Medical Image Representations via Quaternion Wavelet Networks, 2023, arXiv:2310.10224 论文附
— 多核注意力超分 医学图像超分辨率(IXI 为主要基准之一) 2022 多头多核卷积注意力 Georgescu MI, et al., 2022, arXiv:2204.04218 论文附
— 标准化流异常检测 健康分布建模→病灶检测(IXI 训练,BraTS/OASIS 验证) 2024 条件标准化流 PLOS Digital Health, 2024. DOI 10.1371/journal.pdig.0000874 论文附
— 六算法 DTI 配准评估 DTI 配准横向基准(IXI 3T 子集) 2017 张量配准 + 纤维束评价 Wang Y, et al., 2017, BioMedical Engineering OnLine 16:9. DOI 10.1186/s12938-016-0299-2 —

§8.2 SOTA 总结与选型建议

以 IXI 为主战场的活跃方向依次是:超分辨率/重建(2D 与 3D 均有成熟基线)、T1↔T2 跨模态合成、DTI 配准与纤维束评估、以及"健康分布"异常检测。选型建议:追超分/重建 SOTA 读 MTVNet 与 QWN 两篇的协议表(划分最规范);做合成任务优先复用 Georgescu 2022 的多模态注意力框架;DTI 任务从 dipy 张量管线起步,配准对比直接复用 Wang 2017 的六算法框架。所有任务的第一步都是按坑点 2 冻结受试者级划分。

§8.3 评测协议

社区通行的做法可归纳为四条:受试者级划分(500/6/75 或 8:1:1,站点分层);预处理统一到 1 mm 各向同性 + 颅骨剥离 + 受试者级归一化;指标以 PSNR/SSIM(重建/超分)、Dice/Hausdorff(分割)、纤维距离与 FA 相关性(DTI 配准)为主;跨论文比较必须附协议表。IXI 无官方指标实现,推荐直接用 MONAI/TorchIO 的标准实现并在代码中固定版本号。

如果要发起新的 IXI 基准(如新超分任务),三条建议能让协议被更快采纳:发布划分清单的机器可读版本(CSV + SHA256);提供 eval 服务或容器,使指标实现与论文严格一致;在协议表里显式写明"与既往工作的不可比点"。IXI 上历史遗留的 2D 切片级协议至今仍被新论文无意复制,主动声明差异能省去大量审稿拉锯。

数据集 与 IXI 的互补关系
ABIDE 功能像 + 自闭症标签,补 IXI 无 fMRI/无疾病的短板
ADNI 纵向阿尔茨海默病队列,IXI 常作其年龄匹配对照来源
OASIS 痴呆横断/纵向 + 认知量表,异常检测最常用的外部验证集
ADHD-200 多站点疾病分类竞赛数据,含健康对照
Cam-CAN 更深的全生命周期老化队列(含认知-影像耦合)
AOMIC 任务态 + 生理记录的多模态健康样本
ENIGMA 网络级病例-对照汇总,IXI 可作参与式对照贡献
1000 Functional Connectomes 大规模静息态 fMRI 汇总池
Healthy Brain Network 儿童青少年临床谱系样本,补 IXI 年龄缺口
BigBrain 微米级组织学图谱,与 IXI 形成尺度互补

§8.5 关键论文 Top 6

  1. 官方项目本体:IXI – Information eXtraction from Images(EPSRC GR/S21533/02),brain-development.org/ixi-dataset/。数据获取与许可的唯一权威来源。
  2. Wang Y, et al. Evaluations of diffusion tensor image registration based on fiber tractography. BioMedical Engineering OnLine, 2017, 16:9. DOI 10.1186/s12938-016-0299-2。用 IXI DTI 建立六算法配准基准。
  3. Georgescu MI, Ionescu RT, Miron AI, et al. Multimodal Multi-Head Convolutional Attention with Various Kernel Sizes for Medical Image Super-Resolution. arXiv:2204.04218, 2022。确立 IXI 在超分基准中的地位。
  4. Pérez-García F, Sparks R, Ourselin S. TorchIO: a Python library for efficient loading, preprocessing, interpolation and augmentation of multiple 3D medical images. Computer Methods and Programs in Biomedicine, 2021, 208:106236. DOI 10.1016/j.cmpb.2021.106236。IXI/IXITiny 生态接入的标准入口。
  5. Routier A, et al. Clinica: An open-source software platform for reproducible clinical neuroscience studies. Frontiers in Neuroinformatics, 2021, 15:689675. DOI 10.3389/fninf.2021.689675。提供 ixi-to-bids 官方转换器。
  6. PLOS Digital Health, 2024. DOI 10.1371/journal.pdig.0000874。以 IXI 581 例 T1 + 576 例 T2 训练异常检测并在 BraTS2021/OASIS-1 验证的代表性应用。

§8.6 社区活跃度

IXI 的社区热度稳定而分散:官方渠道十年未更新但下载持续可用;NITRC 项目页自 2015 年登记后成为标准引用点;深度学习侧由 TorchIO(内置数据类)、Clinica(转换器)与大量超分论文维持曝光;中文社区经 ModelScope/OpenDataLab 镜像广泛传播。无官方论坛,问题多流向 Clinica Google Group、TorchIO GitHub Issues 及 NITRC 论坛。

判断"该数据集还值得投入吗"的三个信号均为正面:其一,2023—2024 年仍有论文以 IXI 为主要基准(MTVNet、QWN),说明它在方法学评审语境中未被替代;其二,TorchIO/Clinica 的维护使其接入成本持续走低;其三,衍生预处理版(FreeSurfer 8、NumPy 化)不断出现,反映长尾需求仍在增长。风险信号同样明确:分辨率与协议已落后于 HCP 一代,纯精度导向的任务应考虑 HCP 而把 IXI 留给跨站点与对照场景。

§8.7 生态快照

资源 类型 链接 规模/活跃度(截至 2026-09) 推荐理由
官方网站 数据门户 brain-development.org/ixi-dataset/ 静态,长期可用 权威来源与许可文本
NITRC 项目 登记/镜像 nitrc.org/projects/ixi_dataset/ 2015-03-06 入 NITRC-IR 标准引用与 XNAT 下载
Clinica 转换器 工具 aramislab.paris.inria.fr/clinica/docs(IXItoBIDS) 随 Clinica 版本维护 BIDS 化最规范路径
TorchIO 数据类 工具 dokk.org/documentation/torchio(datasets.IXI/IXITiny) 随 TorchIO 维护 一行代码加载配对模态
Lead-DBS IXI 库 衍生资源 lead-dbs.org(IXI Database) Horn et al., 2017 方法 年龄匹配坐标转换
ModelScope 镜像 镜像 modelscope.cn/datasets/OmniData/IXI 29.41 GB,188+ 下载 国内下载稳定
OpenDataLab 镜像 镜像 opendatalab.com/OpenDataLab/IXI 27.4 GB 国内下载稳定
Kaggle FS8 版 衍生数据 kaggle.com/datasets/kingpowa/preprocessed-ixi-dataset-with-fs8 约 21 GB 免预处理的 skull-strip 起步
HF 预处理 NumPy 版 衍生数据 huggingface.co/datasets/pzarzycki/mri-oasis-1-ixi-pre 581 卷 T1 npy 逐卷流式读取,教学友好

§9 相关资源与引用

§9.1 官方资源清单

§9.2 BibTeX 引用块

@misc{ixi_dataset,
  author       = {{Biomedical Image Analysis Group, Imperial College London}},
  title        = {{IXI -- Information eXtraction from Images}},
  howpublished = {\url{https://brain-development.org/ixi-dataset/}},
  note         = {EPSRC GR/S21533/02; accessed 2026-09}
}

@article{torchio2021,
  author  = {P{\'e}rez-Garc{\'i}a, Fernando and Sparks, Rachel and Ourselin, S{\'e}bastien},
  title   = {{TorchIO}: a {Python} library for efficient loading, preprocessing, interpolation and augmentation of multiple {3D} medical images},
  journal = {Computer Methods and Programs in Biomedicine},
  volume  = {208},
  pages   = {106236},
  year    = {2021},
  doi     = {10.1016/j.cmpb.2021.106236}
}

@article{clinica2021,
  author  = {Routier, Alexandre and Burgos, Ninon and D{\'i}az, Mauricio and others},
  title   = {{Clinica}: An open-source software platform for reproducible clinical neuroscience studies},
  journal = {Frontiers in Neuroinformatics},
  volume  = {15},
  pages   = {689675},
  year    = {2021},
  doi     = {10.3389/fninf.2021.689675}
}

@article{wang2017dtireg,
  author  = {Wang, Yi and Shen, Yu and Liu, Dongyang and Li, Guoqin and Guo, Zhe and Fan, Yangyu and Niu, Yilong},
  title   = {Evaluations of diffusion tensor image registration based on fiber tractography},
  journal = {BioMedical Engineering OnLine},
  volume  = {16},
  pages   = {9},
  year    = {2017},
  doi     = {10.1186/s12938-016-0299-2}
}

@article{georgescu2022sr,
  author  = {Georgescu, Mariana-Iuliana and Ionescu, Radu Tudor and Miron, Andreea-Iuliana and Savencu, Olivian and Ristea, Nicolae-Catalin and Verga, Nicolae and Khan, Fahad Shahbaz},
  title   = {Multimodal Multi-Head Convolutional Attention with Various Kernel Sizes for Medical Image Super-Resolution},
  journal = {arXiv preprint arXiv:2204.04218},
  year    = {2022}
}

§9.3 引用指南

使用 IXI 数据时,官方要求的最小引用义务是"注明 IXI 数据来源"(如引用 brain-development.org 网站)。推荐实践:正文引用 @misc{ixi_dataset},工具链分别引用 TorchIO/Clinica 对应条目;使用任何第三方衍生标签或预处理版时,额外引用该衍生版的说明页或论文;本词条的对比数字与协议描述可引用千方病案医数集页面作为导航来源,但数据本身的权威引用始终指向官方。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • CodeBuddy Code(fast-model):负责资料检索汇总、初稿撰写、表格结构化与代码示例编写。

§10.2 AI 参与范围

AI 参与了全部章节的初稿撰写与整合;事实核查由 AI 初检 + 编辑部复核完成;扫描参数、样本数、许可条款等关键数字均回溯至官方页面或同行评审文献(见 §10.3);代码示例由 AI 生成后经数据工程审核人工走查。

责任边界:AI 产出的任何数字在未经 §10.4 校验前视为"候选事实",不得直接引用;本词条中所有"(截至 YYYY-MM)"类时效表述以人工复核日为生效时点;如读者发现事实与官方页面不符,以官方页面为准并向编辑部反馈。

§10.3 输入来源列表

  1. IXI 官方数据集页(含许可与下载链接)— https://brain-development.org/ixi-dataset/
  2. 官方 Philips Intera 3T 扫描参数页 — http://wp.doc.ic.ac.uk/brain-development/scanner-philips-medical-systems-intera-3t/
  3. 官方 Philips Gyroscan Intera 1.5T 扫描参数页 — http://wp.doc.ic.ac.uk/brain-development/scanner-philips-medical-systems-gyroscan-intera-1-5t/
  4. NITRC 项目登记页(机构与联系人)— https://www.nitrc.org/projects/ixi_dataset/
  5. NITRC-IR 发布公告(2015-03-06)— https://www.nitrc.org/forum/forum.php?forum_id=4899
  6. Clinica ixi-to-bids 官方文档(目录树与 DTI 合并行为)— https://aramislab.paris.inria.fr/clinica/docs/public/v0.9.1/Converters/IXItoBIDS/
  7. brainnet R 包 dataset_ixi.R 源码(IXI.xls 字段与编码图例)— https://rdrr.io/github/dfsp-spirit/brainnet/src/R/dataset_ixi.R
  8. Quaternion Wavelet Networks(T1 581/T2 578、2D 协议)— https://ar5iv.arxiv.org/html/2310.10224
  9. MTVNet(T1 体素分布、500/6/75 划分)— https://arxiv.org/html/2412.03379v1
  10. PLOS Digital Health 异常检测(T1 581/T2 576、预处理)— https://journals.plos.org/digitalhealth/article/file?id=10.1371%2Fjournal.pdig.0000874&type=manuscript
  11. 3D 稀疏自编码配准 QC(577 例站点分布 320/184/73、55% 女性、年龄 21—74 子集)— https://pmc.ncbi.nlm.nih.gov/articles/pmid/38343221/
  12. DTI 配准评估(b=1000、15 方向、体素 1.74×1.74×1.98 mm)— https://pmc.ncbi.nlm.nih.gov/articles/PMC5234117/
  13. 白质完整性老化研究(Hammersmith 3T 子集 181 人、MPRAGE 确认)— https://d.docksci.com/age-related-differences-in-white-matter-integrity-in-healthy-human-brain-evidenc_5a0c05bbd64ab2c9ca6352cc.html
  14. 皮层复杂度研究(NeuroImage 2016:581 例、20—86 岁、2005—2006 采集)— https://www.sciencedirect.com/science/article/abs/pii/S1053811916300519
  15. 阿尔茨海默病多模态融合综述(项目 2005 年启动、UCL 与 Imperial 联合发布口径)— https://eprints.whiterose.ac.uk/id/eprint/235920/
  16. brainlife.io 项目页(583 sub 收录口径)— https://brainlife.io/projects
  17. HuggingFace 预处理镜像(581 个 T1 文件计数)— https://huggingface.co/datasets/pzarzycki/mri-oasis-1-ixi-pre
  18. ModelScope 镜像页(29.41 GB、CC BY-SA 3.0)— https://www.modelscope.cn/datasets/OmniData/IXI/summary
  19. OpenDataLab 镜像页(27.4 GB)— https://opendatalab.com/OpenDataLab/IXI
  20. Kaggle FreeSurfer 8 预处理版(半 BIDS 组织与人口学分布)— https://www.kaggle.com/datasets/kingpowa/preprocessed-ixi-dataset-with-fs8/data
  21. Lead-DBS IXI Database(坐标转换衍生资源)— https://www.lead-dbs.org/helpsupport/knowledge-base/atlasesresources/ixi-database/
  22. TorchIO 文档(IXI/IXITiny 数据类)— https://dokk.org/documentation/torchio/v0.19.3/datasets/

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
样本数与站点分布 千方病案医学编辑部 官方页 + 3 篇同行评审文献交叉核对 ✅ 已通过
扫描参数(3T/1.5T 全序列) 千方病案医学编辑部 逐项对照官方扫描参数页 ✅ 已通过
许可与引用义务 千方病案医学编辑部 官方许可声明 + CC BY-SA 3.0 全文核对 ✅ 已通过
代码示例(§6 全部) 数据工程审核 本地走查 + 依赖版本确认 ✅ 已通过
DAIMS 24 项与偏倚分析 医学审核 对照本词条 §4/§5 逐项复核 ✅ 已通过
ICD-11/SNOMED 映射 医学审核 官方浏览器术语核对 ✅ 已通过

§10.5 AI 生成章节标注

全部章节由 AI 生成初稿,经上述人工校验流程逐模块复核后定稿;事实类陈述可追溯至 §10.3 所列来源,代码示例经人工走查,观点类内容(战略价值、选型建议)经编辑复核。

§10.6 最后人工审核日期

2026-09-05(与 §0.3 一致)

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • ulf-enc — 共享标签:医学影像 / MRI / 脑影像
  • mr-art — 共享标签:医学影像 / MRI / 脑影像
  • oasis — 共享标签:医学影像 / MRI / 脑影像
  • fastmri — 共享标签:医学影像 / MRI / 脑影像
  • human-connectome-project — 共享标签:医学影像 / 脑影像
  • enigma — 共享标签:医学影像 / 脑影像
  • intra — 共享标签:医学影像 / MRI / 脑影像
  • aims-tbi — 共享标签:医学影像 / MRI / 脑影像
  • atlas-v2 — 共享标签:医学影像 / MRI / 脑影像
  • topbrain2026 — 共享标签:医学影像 / 脑影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集