信息速览

NIFD — 额颞叶痴呆多模态神经影像 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | NIFD(额颞叶变性神经影像计划数据集) |
| 英文全称 | Frontotemporal Lobar Degeneration Neuroimaging Initiative (FTLDNI) |
| 别名/简称 | NIFD;Neuroimaging in Frontotemporal Dementia;FTLDNI |
| 疾病分类 | ICD-11:6D83 额颞叶痴呆(行为变异型、语义变异型、非流利变异型 PPA、PSP、CBS,详见 §2.1) |
| SNOMED CT | 192976002 Progressive supranuclear palsy;UMLS/MedGen C0282513 Primary progressive aphasia 等(详见 §2.1b) |
| 数据模态 | T1w MRI、T2-FLAIR MRI、DTI、rsfMRI、FDG PET、PiB PET、临床/认知量表 |
| AI 任务类型 | 病例/对照分类、FTD 亚型判别、疾病模板构建、纵向萎缩进展建模、多病因痴呆鉴别诊断 |
| 样本总数 | 346 名受试者(FTD 各亚型与健康对照) |
| 数据格式 | DICOM(影像)+ XLSX/CSV(临床数据)+ BIDS(社区转换版) |
| 许可证 | LONI IDA 数据使用协议(研究用途免费,申请审核制) |
| 访问级别 | 申请审核(注册 IDA + 在线申请表 + 数据访问委员会批准) |
| 语言 | 英语(临床文档与元数据) |
| 首发日期 | 2010 年(计划启动,NIH R01 AG032306 资助) |
| 最后更新 | 2020-07-24(临床数据 NIFD_Clinical_Data_20200724_updated 版本) |
| 发布机构 | 加州大学旧金山分校记忆与衰老中心(NIA/NINDS 资助) |
| 官方主页 | http://memory.ucsf.edu/research/studies/nifd |
| 下载地址 | https://ida.loni.usc.edu(登录后 NIFD 项目页) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 临床数据字典完备、社区 BIDS 转换链成熟(Clinica);扣分项:无官方划分与官方预处理脚本、原始 DICOM 需自行转换、临床数据双版本并存 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核:千方病案医学编辑部 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT/UMLS 双映射、流行病学与临床任务定义)、§7 已知偏倚与局限性分析。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
最后审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NIFD 要求用户注册 LONI IDA 账户并提交在线申请表、经数据访问委员会审核通过后方可下载数据。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
NIFD(Neuroimaging in Frontotemporal Dementia,官方名称为额颞叶变性神经影像计划 FTLDNI)是美国国立卫生研究院(NIA 与 NINDS,基金号 R01 AG032306)于 2010 年启动的多中心纵向神经影像计划,由加州大学旧金山分校(UCSF)记忆与衰老中心的 Howard Rosen 教授牵头,协同 Mayo Clinic(罗切斯特)与麻省总医院(MGH)共 3 个北美中心完成数据采集。它收录了 346 名受试者的 T1w MRI、T2-FLAIR MRI、DTI、FDG PET、PiB PET 影像以及每 6 个月一次、覆盖 12 个月(部分延至 18 个月)的临床与认知随访数据(Termine et al., 2022)。
它为什么重要?额颞叶痴呆(FTD)是 65 岁以下人群中最常见的痴呆类型之一,但直到 2010 年前后,全球都没有一个专门针对 FTD 谱系的标准化纵向影像数据库——ADNI 覆盖的是阿尔茨海默病。NIFD 填补了这一空白:它用统一协议追踪 bvFTD、svPPA、nfvPPA、PSP、CBS 五类临床亚型与健康对照,使影像生物标志物可以直接与临床试验终点对接(Staffaroni et al., 2019)。
你能用它做什么:训练 FTD 病例/对照与亚型分类器(Termine et al., 2022:DenseNet121 准确率 0.80、AUC 0.86)、构建 FTD 疾病特异性脑模板(Dadar et al., 2021 的 MNI-FTD 模板)、做多病因痴呆鉴别诊断的大规模多队列建模(Xue et al., 2024),或研究白质纤维与纵向萎缩进展。数据经 LONI IDA 免费申请获取,但需要按 §6.5 的坑点清单避开转换与划分陷阱。
§1.1 摘要
NIFD 的技术定位是"FTD 版的 ADNI":多中心、多模态、纵向、申请审核开放。影像侧以 3T 结构 MRI 为核心(T1 MPRAGE:TR/TE = 2,300/2.9 ms,1 mm 各向同性体素),辅以 T2-FLAIR、弥散张量成像(DTI)、静息态 fMRI、FDG PET(代谢)与 PiB PET(淀粉样病理);临床侧提供 MMSE、CDR 等量表和诊断标签,全部患者经多学科共识会议诊断,bvFTD 采用 FTDC 2011 标准、PPA 变异型采用 Gorno-Tempini 2011 标准(Tuovinen et al., 2024)。原始数据以 DICOM + XLSX/CSV 形式托管于南加州大学的 LONI Image & Data Archive(IDA),研究者注册并提交申请、经数据访问委员会批准后即可免费下载;法国 ARAMIS 实验室的 Clinica 平台提供 nifd-to-bids 一键转换器,可将原始数据整理为 BIDS 标准结构。基线 T1w 可用规模约为 bvFTD 70 例、svFTD 36 例、nfvPPA 30 例、健康对照 133 例(Dadar et al., 2021),整体队列 346 人。对 AI 研究者而言,它是 FTD 影像建模事实上的入门与基准数据集,但需要自行完成 BIDS 转换、多中心协调与子集筛选。
与 ADNI 的关键区别有三点,决定了完全不同的工程实践:其一,NIFD 没有官方的预处理产物包与基准划分——ADNI 有统一的 image collection 与社区标准基准,而 NIFD 的一切"开箱即用"都来自社区(主要是 Clinica);其二,NIFD 的诊断标签是综合征级的(临床亚型),不像 ADNI 可借助 CSF/淀粉样标志物做生物学校准,标签噪声管理更重要;其三,NIFD 的对照组与 4RTNI 共享,任何多数据集研究都必须先做受试者级去重。理解这三点,比记住任何单条参数都更能避免返工。
§1.2 战略价值分析
疾病谱空白填补维度:在 NIFD 出现之前,FTD 影像研究高度碎片化——单中心样本普遍在 20-30 例量级,亚型之间不可比,也谈不上纵向建模。NIFD 以统一采集协议横跨 3 个中心、5 个临床亚型,把"额颞叶变性"从一组定性描述变成了可量化追踪的影像对象。它的产出直接支撑了 MNI-FTD 疾病模板(Dadar et al., 2021)和以影像终点的临床试验设计方法论(Staffaroni et al., 2019, Brain,Europe PMC 被引 98 次,截至 2026-09),后者已成为 FTD 药物试验选择影像终点的参考标准。换言之,NIFD 不仅是一个数据集,更是 FTD 影像生物标志物这一研究范式的数据底座。
AI 生态杠杆维度:NIFD 是痴呆影像 AI 研究中"非阿尔茨海默"数据的主要来源。2024 年 Nature Medicine 的多病因痴呆鉴别诊断模型整合 51,269 名受试者、9 个数据集(NIFD 与 ADNI、AIBL、PPMI、4RTNI 并列),病因级微平均 AUROC 达 0.96(Xue et al., 2024);MONAI + Clinica 的可复现 CAD 工作流同样以 NIFD 为训练与测试来源(Termine et al., 2022)。社区还围绕它形成了完整的工具链:Clinica nifd-to-bids 转换器、t1-linear 标准预处理、MONAI 3D 分类模板。对于需要"非 AD 痴呆"对照队列的迁移学习、域泛化与多队列联邦建模研究,NIFD 目前几乎没有免费替代品。
教学与入门维度:NIFD 的规模(数百例)恰好落在"够训练、跑得动"的甜点区——数据量小到单卡可复现全套流程,又真实到覆盖多中心、纵向、多模态、标签缺失等全部真实世界难题。它因此是医疗 AI 教学中"第一次接触神经影像数据工程"的理想教材:完整走一遍 §6.2-§6.5 的流程,学生遇到的每个坑(DICOM 转换、受试者级划分、类别不平衡、跨中心漂移)都能在数十 GB 数据、数小时迭代内亲历,这是 ADNI(TB 级、流程固化)与机构私有数据(不可外传)都给不了的练习密度。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 NIFD 的差异化 |
|---|---|---|---|---|
| NIFD (FTLDNI) | 346 名受试者,纵向 12-18 个月 | T1w/T2-FLAIR MRI、DTI、rsfMRI、FDG/PiB PET | 多学科共识诊断(5 类亚型 + 对照) | 唯一专门覆盖 FTD 谱系 5 亚型的多模态纵向计划 |
| ADNI | 数千名受试者,2003 年至今 | T1 MRI、PET(FDG/淀粉样/tau)、DTI、CSF | AD 谱系诊断 | 聚焦阿尔茨海默病;NIFD 常作为非 AD 对照与多病因建模补充 |
| 4RTNI | 与 NIFD 方法相同的姊妹计划 | 与 NIFD 相同 | PSP/CBS 为主的 4 重复 tau 蛋白病 | NIFD 的对照组与 4RTNI 共享,两者常合并分析 |
| OASIS-3 | 1,000+ 名受试者纵向 | T1 MRI、PET | 正常衰老 + AD | 无 FTD 特异亚型 |
| GENFI | 基因决定型 FTLD 家系队列 | T1 MRI、神经心理 | 症状前基因携带者 | 聚焦家族性/基因突变 FTD;NIFD 以散发型临床队列为主 |
| ALLFTD | NIFD 后继(ARTFL-LEFFTDS) | MRI、神经心理、血/CSF | 家族性 + 散发性 FTLD | 年度随访、全国多中心,是 NIFD 的数据演进方向 |
| PPMI | 帕金森病纵向库 | MRI、PET、生物标志物 | PD 谱系 | 与 NIFD 同平台的"运动症状为主"姊妹范式 |
§1.4 版本时间轴
| 时间 | 事件 | 说明 |
|---|---|---|
| 2010 | FTLDNI(NIFD)启动 | NIH R01 AG032306(NIA + NINDS)资助,3 个北美中心开始入组 |
| 2012-2017 | 数据采集与随访 | 每 6 个月一次评估,核心随访窗口 12 个月,部分受试者延至 18 个月 |
| 2017 | 临床数据"最终版" | NIFD_Clinical_Data_2017_final_updated.xlsx 经 LONI IDA 发布 |
| 2019 | Brain 纵向终点方法论 | Staffaroni et al. 合并 NIFD 与 UCSF AG019724 队列确立影像试验终点 |
| 2020-07-24 | 临床数据更新版 | IDA Study Data 追加 NIFD_Clinical_Data_20200724_updated.xlsx(双版本并存) |
| 2020-11 | Clinica 转换器修复 | nifd-to-bids 数据字典缺失问题在 Issue #122 / PR #147 中修复 |
| 2021 | MNI-FTD 模板发布 | Dadar et al. 基于 NIFD 构建亚型特异性平均模板(Scientific Data) |
| 2024-2025 | AI 大规模应用 | Nature Medicine 多病因鉴别诊断模型等将 NIFD 纳入 9 数据集联合训练 |
| 2026 | Clinica 0.11.3 | 转换器与管线持续维护(PyPI 2026-04 发版),Python ≥3.10 |
| — | 数据本体冻结 | NIFD 自 2020-07 临床数据更新后无新采集;增量研究需求由后继 ALLFTD 承接 |
§1.5 典型应用场景
- FTD 病例/对照与亚型分类基准:以首诊 3D T1 MPRAGE(182 例 FTD + 130 例对照)训练 3D CNN,对齐 Termine 2022 的 0.80 accuracy / 0.86 AUC 参考线。
- 疾病模板与统计图谱:按亚型构建无偏平均模板与 w-score 图谱(MNI-FTD 路线),服务靶区勾画与纵向配准。
- 纵向萎缩建模:利用每 6 个月的随访访视,建模个体萎缩速率并评估影像终点对药物试验的样本量效应。
- 多病因痴呆鉴别诊断:NIFD 作为"非 AD 痴呆"成分与 ADNI/4RTNI/PPMI 等联合训练多分类模型(Xue 2024 路线)。
- 白质微结构研究:DTI 子集(基线 106 例分析规模)用于皮质与白质弥散指标的亚型差异与机器学习判别(Torso et al., 2020)。
§2 医学背景
§2.1 ICD-11 编码映射
NIFD 覆盖的疾病谱在 ICD-11(v2026-01)中统一归属 6D83 额颞叶痴呆类目——行为变异型、语言变异型(PPA)、非流利/语法缺失变异型、语义变异型、logopenic 变异型、伴运动神经元病以及 MAPT/GRN/C9orf72 等基因突变所致类型均为该类目下的同义词与细分(ICD-11 6D83)。旧分类 ICD-10 中的 F02.0(Pick 病)在 ICD-11 中被独立为 6D83 类目(SpringerMedizin 对照表)。
| 标签 | ICD-11 编码 | 中文名称 | 术语备注 |
|---|---|---|---|
| FTD 总类 | 6D83 | 额颞叶痴呆 | 类目含行为/语言/运动三大表现谱 |
| bvFTD | 6D83(行为变异型) | 额颞叶痴呆·行为变异型 | FTDC 2011 标准诊断;NIFD 最大患者亚组 |
| svPPA | 6D83(语义变异型) | 额颞叶痴呆·语义变异型 PPA | 历史名称"语义性痴呆" |
| nfvPPA | 6D83(非流利/语法缺失变异型) | 额颞叶痴呆·非流利变异型 PPA | 常伴言语失用 |
| PSP | 6D83 谱系相关(帕金森叠加综合征表现) | 进行性核上性麻痹 | NIFD 次要入组亚型 |
| CBS | 6D83 谱系相关(运动相关表现) | 皮质基底节综合征 | NIFD 次要入组亚型 |
| 健康对照 | 无诊断编码 | 正常对照 | 与 4RTNI 共享 |
| bvFTD-MND | 6D83(伴运动神经元病) | 额颞叶痴呆·伴运动神经元病 | NIFD 入组范围内的重叠表现型 |
| logopenic 变异型 | 6D83(logopenic 变异型) | 额颞叶痴呆·logopenic 变异型 PPA | 多与 AD 病理相关,NIFD 分析中常被排除 |
§2.1b SNOMED CT / UMLS 映射
SNOMED CT 国际版对 FTD 谱系的细分概念随版本演进变化较大(多个旧编码已在 2025-02 国际版中失效,经 FHIR 术语服务器反查确认)。下表仅列出经 NCBI MedGen / UMLS 验证可靠的映射;细分亚型建议以 UMLS CUI 关联检索。
编码使用提示:跨系统对接(EHR、知识图谱)时,PSP 优先用 SNOMED CT 192976002;PPA 谱系因 SNOMED 细分码不可靠,优先用 MedGen CUI 或直接引用 ICD-11 6D83 类目;任何编码引用都应注明所用版本(SNOMED 2025-02 / ICD-11 v2026-01),因为神经退行性疾病编码在不同年度版本间迁移频繁。
| 标签 | 编码 | 编码体系 | 术语(FSN/首选名) |
|---|---|---|---|
| PSP | 192976002 | SNOMED CT | Progressive supranuclear palsy (disorder) |
| PSP | C0038868 | MedGen/UMLS | Progressive supranuclear palsy |
| PPA | C0282513 | MedGen/UMLS | Primary progressive aphasia |
| svPPA | C0338462 | MedGen/UMLS | Semantic dementia |
| nfvPPA | C0751706 | MedGen/UMLS | Primary progressive non fluent aphasia |
| bvFTD | C0236642 | MedGen/UMLS | Pick disease(历史同义概念) |
| PSP | C0038868 | MedGen/UMLS | Progressive supranuclear palsy(UMLS 关联,与上列 SNOMED 码同指) |
§2.2 疾病简介与流行病学
额颞叶痴呆(FTD)是一组以额叶和/或颞叶局灶性萎缩为核心的原发性神经退行性疾病,临床表现为进行性人格与行为改变(bvFTD)或语言功能进行性丧失(PPA 变异型),部分患者合并帕金森样运动症状(PSP、CBS)或运动神经元病。FTD 通常在 45-64 岁间起病,是早发性痴呆中仅次于阿尔茨海默病的第二常见类型;在 65 岁以下人群中患病率约为 3-4/100,000(Amboss),约 10-25% 的病例呈常染色体显性家族聚集,MAPT、GRN、C9orf72 三个基因解释了大多数遗传性病例。症状起病后的平均生存期为 7-13 年(HandWiki 综述)。与阿尔茨海默病早期记忆受损不同,FTD 早期记忆常相对保留,加之行为改变易被误诊为精神疾病,临床误诊率与确诊延迟显著偏高——这正是 NIFD 强调多学科共识诊断与多模态影像的原因。病理层面,FTLD 按异常蛋白沉积分为 tau(含 PSP、CBD)与 TDP-43/FUS 等谱系,临床亚型与病理之间存在交叉,因此影像-病理对应关系本身就是该领域的研究重点。
NIFD 覆盖的三大核心亚型在临床上区分度明确,这也解释了为何它们是影像 AI 分类研究的首选标签:bvFTD 以脱抑制、淡漠、失去共情、强迫行为与饮食习惯改变为特征,对应额叶(尤其眶额与前扣带)萎缩,NIFD 中患者基线 CDR 约 1.3、MMSE 23.2,认知总量受损但结构化测验常低估日常功能恶化(Tuovinen 2024 子集口径);svPPA 以命名与词语理解进行性丧失为特征、语言流畅但内容空洞,对应左侧(偶为右侧)前颞叶显著萎缩;nfvPPA 以费力、语法缺失的言语与言语失用为特征,对应左侧额叶盖部萎缩。三类亚型的萎缩拓扑几乎不重叠,是"影像即标签"假设成立的结构基础,也是 MNI-FTD 亚型模板能够构建成功的前提(Dadar 2021)。
§2.3 临床任务定义
| 临床任务 | 定义 | NIFD 中的对应标签/变量 | AI 建模形态 |
|---|---|---|---|
| 筛查 | 在记忆门诊/行为异常人群中识别可疑 FTD | MMSE、CDR(含行为/语言分维度) | 二分类/异常检测 |
| 诊断 | 区分 FTD 与正常对照 | 共识诊断标签(患者/对照) | T1w 3D CNN 二分类 |
| 分型 | 在 FTD 内区分 bvFTD/svPPA/nfvPPA/PSP/CBS | 共识诊断的亚型标签 | 多分类 + 影像度量学习 |
| 分级 | 量化疾病严重程度 | CDR Sum of Boxes、MMSE 总分 | 回归/序数分类 |
| 预后/进展 | 预测 6-12 个月的萎缩与临床恶化 | 纵向访视(每 6 个月) | 纵向自监督/时序模型 |
| 排除 | 用淀粉样 PET 阴性支持 FTD 而非 AD | PiB PET 阴阳性 | 多模态融合/规则引擎 |
§2.4 患者人群画像
NIFD 队列的构成因分析子集而异,下表汇总有同行评审来源支撑的几组代表性数据。
| 队列描述 | 来源 | 规模 | 年龄(均值±SD) | 性别 | 就医类型 |
|---|---|---|---|---|---|
| 全库(含 FTD 与对照) | Termine 2022 | 346 名受试者 | 未逐例公开 | 未逐例公开 | 三级学术中心 |
| 基线 T1w 模板队列 | Dadar 2021 | bvFTD 70 / svFTD 36 / nfvPPA 30 / HC 133 | 约 62-68 岁区间(各亚型) | 男女大致均衡 | 3 中心 |
| bvFTD 信号变异性研究 | Tuovinen 2024 | bvFTD 35 / HC 92 | 61.8±6.6 / 64.7±9.3 | 女性 40% / 62% | LONI 下载子集 |
| FreeSurfer 范例建模 | MIT 2025 论文 | CN 113 / bvFTD 49 / svPPA 32 / nfvPPA 32 | 中位 61-68 岁 | 女性 36.7%-59.3% | QC 通过子集 |
| 合并纵向终点队列 | Staffaroni 2019 | bvFTD 77 / svPPA 45 / nfvPPA 39 / HC 137 | 62.1 / 63.5 / 67.7 / 63.4 | 未逐例公开 | UCSF 132 + MCR 17 + MGH 12 |
人群画像的三点提示:其一,各行的规模差异来自筛选口径而非数据增长,引用时必须带口径;其二,患者组教育年限系统性低于对照组(bvFTD 约 18 年 vs 对照 21 年,Tuovinen 2024),做认知变量的回归时教育是必选协变量;其三,性别分布因亚型而异(bvFTD 男性偏多、对照女性偏多),公平性评估应分亚型报告而非只报全队列。
§2.5 临床价值
对临床研究的价值体现在三个层面。其一,诊断辅助:FTD 临床误诊率高,多模态影像(结构萎缩模式 + FDG 代谢减低区 + 淀粉样 PET 阴性排除 AD)是目前最接近"活体病理"的证据链,NIFD 提供了训练此类鉴别模型的最优开放数据。其二,试验终点:FTD 药物试验(如抗 tau 与基因治疗)需要敏感的进展终点,Staffaroni 2019 基于 NIFD 证明每 6 个月的影像与 CDR 变化可作为试验终点并估算样本量。其三,对照资源:NIFD 的健康对照经过与患者完全相同的评估流程,可与 4RTNI 共享复用,为小样本罕见病研究(PSP/CBS)提供了宝贵的阴性对照池。
落到具体决策场景:神经科医生面对一位 60 岁以下、表现为行为改变或语言退化的患者时,核心难题是"FTD?AD?还是精神疾病?"——NIFD 类数据训练的模型提供的是这一鉴别环节的第二意见:萎缩的分布(额/颞 vs 内侧颞叶/顶叶)、代谢减低的模式与淀粉样 PET 的阴阳性组合。需要强调的是,截至 2026-09 尚无基于 NIFD 训练的模型进入常规临床工作流,所有此类工具都处于研究与前瞻验证阶段。
§2.6 金标准与标注体系
| 维度 | 内容 |
|---|---|
| 划分 | 无官方 train/test 划分;诊断标签即"金标准",由各中心多学科共识会议给出 |
| 标注方式 | 人工临床诊断(Neary 1998 / FTDC 2011 / Gorno-Tempini 2011 标准,按入组年份选用);MMSE、CDR 由量表测得 |
| 标注者资质 | 神经科、神经心理、语言病理等多学科专家小组(共识会议制) |
| 标注性质 | 临床综合征级标签,多数受试者无尸检病理确认;影像数据本身无病灶级人工分割 |
与常见医学影像数据集最大的不同:NIFD 的"标注"不是医生看影像打出来的,而是临床过程本身——标签先于影像分析存在。这带来两个直接后果:好处是标签与影像采集彼此独立,不存在"影像标注者偏差";代价是标签粒度粗(综合征级),想研究影像上的病理细节(如特定脑叶萎缩评分)需要自行组织标注。若你的任务需要影像级人工标注(分割、病灶评分),应在预算中为放射/神经影像专家标注留出专门工作量。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 获取途径 | 理由 |
|---|---|---|---|
| 完整多模态建模(含 PET/DTI) | IDA 原始完整版(DICOM + 临床 Excel) | LONI IDA 申请下载 | 唯一覆盖全部模态与纵向访视的来源 |
| 快速复现 T1w 分类基准 | Clinica nifd-to-bids 转换后的 BIDS 版 |
自行转换(§6.3) | BIDS 结构 + participants.tsv 标签,代码可直接跑 |
| 疾病模板/图谱研究 | MNI-FTD 模板论文所用基线 T1w 子集(70/36/30/133) | IDA 按 §6.2 筛选下载 | 已被 Dadar 2021 验证过 QC 与规模 |
| 只做临床量表分析 | NIFD_Clinical_Data_20200724_updated.xlsx | IDA Study Data | 较 2017 版更新的数据快照;注意双版本字段对齐 |
§3.1 模态详情
| 模态 | 序列/示踪剂 | 参数要点 | 覆盖情况 | 典型 AI 用途 |
|---|---|---|---|---|
| T1w MRI | 3D MPRAGE | TR/TE = 2,300/2.9 ms,矩阵 240×256×160,1 mm 各向同性(UCSF 3T Siemens Trio Tim) | 覆盖最广,是 NIFD"最常见"的采集模态 | 分类、分割、模板 |
| T2-FLAIR MRI | 3D FLAIR | 与 T1 同访视采集 | 子集覆盖 | 白质高信号、血管病变排除 |
| DTI | 弥散加权序列 | B0 + DWI;各中心采集协议存在差异(Torso 2020 因协议不一致做过子集筛选) | 子集覆盖(基线分析规模 106 例) | 白质微结构、纤维追踪 |
| rsfMRI | EPI | TR/TE = 2,000/27 ms,240 volumes(8 分钟),体素 2.5×2.5×3.6 mm(Kashyap 2025 记录) | 子集覆盖(基线 198 例分析规模) | 脑网络连接组 |
| FDG PET | 18F-FDG | 代谢成像 | 子集覆盖 | 代谢减低模式、低代谢分型 |
| PiB PET | 11C-PiB | 淀粉样病理成像 | 子集覆盖 | 排除 AD 共病理 |
| 临床/认知量表 | MMSE、CDR 等 | 每 6 个月评估,核心窗口 12 个月 | 全队列 | 标签、分层、进展终点 |
§3.2 按子集的样本数
| 子集口径 | bvFTD | svPPA | nfvPPA | PSP/CBS | 健康对照 | 来源 |
|---|---|---|---|---|---|---|
| 全库受试者(纵向) | — | — | — | 含 | — | 346 人(Termine 2022) |
| 基线 T1w(模板论文) | 70 | 36 | 30 | 极少量 | 133 | Dadar 2021 |
| 首诊 3D T1 MPRAGE(合并亚型) | — | — | 182(合计) | 含 | 130 | Termine 2022 |
| bvFTD 信号变异性子集 | 35 | — | — | — | 92 | Tuovinen 2024 |
| FreeSurfer QC 通过 | 49 | 32 | 32 | — | 113 | MIT 2025 |
| DTI 基线分析 | 26 | 23 | 15 | — | 42 | Biospective/FTLDNI |
| 纵向合并队列(NIFD+AG019724) | 77 | 45 | 39 | — | 137 | Staffaroni 2019 |
注:不同论文对同一底层数据的纳入标准与 QC 不同,数字不可直接相加或比较;"—“表示该来源未按此维度报告。引用某一口径时,务必同时复述其筛选条件(如"首诊 3D MPRAGE”、“FreeSurfer QC 通过”),否则读者无法判断数字的可比性。
阅读上表还应注意到一个规律:对照数普遍大于患者数(模板论文 133 对照 vs 各亚型 30-70 例),这与痴呆影像库"对照便宜、病例稀缺"的普遍结构一致;对 AI 的直接影响是,单类敏感度天然比特异度更难做好,评估设计要把指标预算向患者类倾斜(见坑点 8)。
§3.3 数据格式
| 对象 | 格式 | 说明 |
|---|---|---|
| 原始影像 | DICOM | 经 IDA 脱敏分发,按受试者/序列分目录 |
| 临床数据 | XLSX | NIFD_Clinical_Data_2017_final_updated.xlsx 与 20200724 更新版 |
| 元数据导出 | CSV | idaSearch_all.csv(影像索引:受试者/访视/模态/日期) |
| 数据字典 | XLSX | DataDictionary_NIFD_2017.10.18.xlsx(IDA 曾下架,现由 ARAMIS 服务器镜像) |
| 社区转换版 | BIDS (NIfTI) | Clinica nifd-to-bids 产物:anat/pet 目录 + participants.tsv |
| 衍生产出 | NIfTI 模板/图谱 | MNI-FTD 亚型平均模板(Dadar 2021,可独立下载引用) |
| 衍生产出 | FreeSurfer 特征 | 社区研究自行生成(t1-freesurfer),非官方发布 |
§3.4 存储大小
官方未公布全库总大小的权威数字,故不给出具体 GB 值;IDA 下载界面建议将影像集合按 5 或 10 个 zip 分包下载(Clinica 文档)。经验规划:数百例多模态 DICOM 的磁盘预留建议以 100 GB 量级起步,并在转换 BIDS 后再复制一份 NIfTI 版本。
§3.5 标注方式
诊断标签全部来自人工临床流程:受试者经访谈、体格检查、神经心理测验与知情人访谈后,由多学科共识会议依据已发表标准(bvFTD 用 FTDC 2011,PPA 变异型用 Gorno-Tempini 2011,早期入组用 Neary 1998)给出综合征级诊断(Tuovinen 2024)。影像本身没有官方的病灶分割或视觉评分标注;MMSE/CDR 为量表自动计分。
从监督学习视角看,NIFD 提供的是弱标签:标签对象是"人"而不是"图"——同一位受试者的所有扫描共享同一诊断,扫描内不存在区域级标注。这决定了两类任务设计:图像级分类(直接可用)与区域级推理(需要模型自行定位萎缩区域,再用注意力图/显著性图回溯验证)。想要逐切片或逐脑区的强标注,只能自行构建(参考 MNI-FTD 用概率图谱替代人工标注的思路)。
§3.6 标注者资质与一致性
诊断由具备痴呆亚型专长的神经科、神经心理与语言病理专家以共识会议形式做出,这是 FTD 领域公认的最高可行标准;但需注意:(1) 共识诊断在不同中心与年份间使用的标准版本不同;(2) 无病理确认,临床-病理不匹配是已知局限;(3) 数据集未发布标注者间一致性系数(如 kappa),无法量化复测信度。
§3.7 采集周期
计划于 2010 年启动,入组与随访贯穿 2010 年代。临床与认知评估每 6 个月一次,核心随访窗口 12 个月(含基线、6 个月、12 个月三次评估),部分受试者有延长的 18 个月访视但人数显著递减(12 个月访视尚有 15 健康/13 nfvPPA/17 svPPA,18 个月仅 11/5/11;Kashyap 2025)。DTI 子集的影像随访在部分分析中延至 24 个月(Biospective FTLDNI 呈现)。临床数据的发布快照以 2017 最终版与 2020-07-24 更新版为准。
§3.8 地域覆盖
全部数据来自北美 3 个学术医学中心:加州大学旧金山分校(UCSF,主导中心)、Mayo Clinic 罗切斯特院区(MCR)与麻省总医院(MGH)(Staffaroni 2019)。队列以北美人群为主,族裔分布未系统公布,向其他人群外推需谨慎(见 §7.3)。UCSF 是绝对主力(合并队列中占 132/161 患者),构建模型时可把"UCSF vs 非 UCSF"当作现成的域标签做 leave-one-site-out 评估。
§3.9 设备规格
| 中心 | 设备 | 已验证参数 |
|---|---|---|
| UCSF 神经影像中心 | 3T Siemens Trio Tim(12 通道头线圈) | MPRAGE TR/TE = 2,300/2.9 ms,矩阵 240×256×160,1 mm 各向同性;T1 与 DTI 同机采集(Torso 2020);rsfMRI EPI TR/TE = 2,000/27 ms(Kashyap 2025) |
| Mayo Clinic Rochester | 未逐序列公布 | 以 DICOM 头文件为准 |
| Massachusetts General Hospital | 未逐序列公布 | 以 DICOM 头文件为准 |
多中心设备/序列差异是真实存在的分析变量:Torso et al. 2020 明确因 B0/DWI 采集参数差异而只保留协议一致的受试者,建议所有跨中心分析复现这一筛选逻辑。
§3.10 深度溯源链
| 环节 | 主体 | 说明 |
|---|---|---|
| 资助 | NIH(NIA + NINDS) | R01 AG032306,2010 年起 |
| 采集 | UCSF MAC / MCR / MGH | 多学科共识诊断 + 标准化影像协议 |
| 托管与分发 | USC LONI IDA | 脱敏、存储、申请审核与下载(Crawford et al., 2015:截至 2014 年 IDA 累计被 68 国下载超 700 万次影像) |
| 社区策展 | 法国 ARAMIS 实验室 | Clinica nifd-to-bids 转换器与预处理管线(MIT 许可) |
| 二次产出 | McGill / MNI | MNI-FTD 亚型模板(Dadar 2021,Scientific Data) |
| 教育与传播 | 临床试验方法论 | Staffaroni 2019 的影像终点框架被后续 FTLD 试验设计引用 |
| 模型应用 | vkola-lab(GWU/MGH 等) | Xue 2024 多病因鉴别诊断,代码开源(nmed2024) |
§4 数据结构
§4.0 目录树
IDA 原始下载解压后的典型组织(影像目录 + 三个临床/元数据文件):
NIFD/
├── <受试者ID>/ # 每位受试者一个目录(IDA 编号)
│ └── <访视>/<序列编号>/ # 每次访视、每个 DICOM 序列
│ ├── *.dcm # DICOM 切片文件
│ └── ...
├── NIFD_Clinical_Data_2017_final_updated.xlsx # 临床数据(或 20200724 更新版)
├── DataDictionary_NIFD_2017.10.18.xlsx # 字段字典(IDA 缺失时从 ARAMIS 镜像获取)
└── idaSearch_all.csv # 影像索引(注意:必须重命名为该文件名)
经 Clinica 转换后的 BIDS 输出(供 §6.4 DataLoader 直接使用):
bids_nifd/
├── dataset_description.json
├── participants.tsv # 受试者级人口学 + 诊断标签
├── sub-<label>/
│ └── ses-<访视标签>/
│ ├── anat/
│ │ ├── sub-<label>_ses-<访视>_T1w.nii.gz
│ │ └── sub-<label>_ses-<访视>_FLAIR.nii.gz
│ └── pet/
│ ├── sub-<label>_ses-<访视>_task-rest_fdg_pet.nii.gz
│ └── sub-<label>_ses-<访视>_task-rest_pib_pet.nii.gz
└── .bidsignore
§4.1 DAIMS 字段字典(核心表)
以 idaSearch_all.csv(影像索引)与临床 Excel 的代表性字段为例(列名以实际导出文件与字典为准):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| Subject | Text | IDA 受试者唯一编号 | 字符串编号 | 主键/分组 | 无 | 空值=未记录 | 全库唯一 |
| Image ID | Text | 影像对象唯一 ID | 字符串编号 | 影像-临床表关联主键 | 跨文件匹配易错位 | 空值=无影像 | 每序列唯一 |
| Series ID | Text | 同一检查内序列编号 | 数字串 | 序列级去重 | 重扫描产生多行 | 空值=未采集 | 每检查内唯一 |
| Visit | Text | 访视名称(基线/随访) | Baseline(示例) | 纵向对齐 | 命名不统一需归一 | 空值=未评估 | 0-18 个月窗口 |
| Modality | Text | 模态类别 | MRI / PET | 模态筛选 | 无 | 空值=未采集 | MRI、PET |
| Format | Text | 存储格式 | DCM | 工程兼容 | 无 | 空值=未采集 | DCM 等 |
| Type | Text | 原始/处理标记 | Original | 只取原始数据 | 无 | 空值=未采集 | Original、Processed |
| Weighting | Text | MRI 加权方式 | T1 / FLAIR | 序列筛选 | 旧版术语不一致 | 空值=非 MRI | T1、T2、FLAIR、DWI |
| Description | Text | 序列描述 | 序列名称 | 协议归一化 | 自由文本、跨中心不一致 | 空值=未记录 | 自由文本 |
| Date | Date | 检查日期 | YYYY-MM-DD | 纵向时间轴 | 已脱敏精度 | 空值=未记录 | 2010-2020 |
| MMSE 总分(临床表) | Integer | 全局认知量表得分 | 0-30 | 认知分层/回归 | 重测变异 | 空白=未施测 | 0-30 |
| CDR Sum of Boxes(临床表) | Float | 痴呆严重度(盒和) | 0-18 | 疾病分级标签 | 量表版本差异 | 空白=未施测 | 0-18 |
| 诊断(临床表) | Text | 共识诊断/分组 | 患者或对照标签 | 分类标签 | 偶有缺失(见坑点 5) | 空值=需回补 | bvFTD、svPPA、nfvPPA、PSP、CBS、HC |
| 访视编码(BIDS) | Text | 转换后的会话标签 | ses-XX(示例) | 访视对齐 | 命名随 Clinica 版本演变 | 空值=未转换 | 与 IDA Visit 一一映射 |
| 原始文件路径(BIDS) | Text | 转换后 NIfTI 相对路径 | sub-x/ses-y/…(示例) | DataLoader 输入 | 移动目录后失效 | 空值=转换失败 | 相对 BIDS 根 |
§4.2 标签分布
以最有代表性的基线 T1w 队列(模板论文口径)为例:健康对照 133(占 49.1%)、bvFTD 70(25.8%)、svFTD 36(13.3%)、nfvPPA 30(11.1%)(Dadar 2021)。合并亚型的患者/对照口径下,Termine 2022 得到 182 FTD + 130 NC(患者 58.3%)。要点:病例/对照大体平衡,但亚型间高度不平衡——PSP 与 CBS 在已报告的子集中仅以个位数到十几例出现,直接训练 6 分类会严重偏向大头类。
处理亚型不平衡的推荐顺序:(1) 先做病例/对照二分类(比例健康),建立基线;(2) 再做"语言变异型 vs 行为变异型"的粗分组三分类(svPPA+nfvPPA 合并 vs bvFTD);(3) 最后才尝试含 PSP/CBS 的完整多分类,并配加权损失与按类 bootstrap 置信区间。跳过前两步直接做六分类,几乎必然得到"平均指标好看、稀有类全灭"的结果。
§4.3 关键统计
- 全库 346 名受试者,含 5 类 FTD 亚型与健康对照(Termine 2022)。
- 纵向访视平均 2.7-3.2 次/人(区间 1-7 次;Staffaroni 2019 合并队列口径)。
- bvFTD 患者基线 MMSE 23.2±5.4、CDR 1.3±0.6;对照 MMSE 29.3±0.9、CDR 0(Tuovinen 2024 子集)。
- T1w 首诊可用约 312 例(182 FTD + 130 NC,Termine 2022),是最大的单模态可用子集。
- 教育年限:对照约 21 年、bvFTD 约 18 年(Tuovinen 2024 子集)。
- 12 个月与 18 个月访视的留存呈阶梯下降:12 个月仍有 15 健康/13 nfvPPA/17 svPPA,18 个月仅 11/5/11(Kashyap 2025),纵向建模应以 12 个月为主窗口。
- 临床表中 bvFTD 与对照的教育、认知分布差异显著(患者组教育约低 3 年),做年龄/教育校正时不可省略协变量。
# 三层粒度计数示例(对应 §4.4 的粒度纪律)
n_scans = len(idx) # 扫描数(序列级)
n_visits = idx.groupby(["Subject", "Visit"]).ngroups # 受试者×访视数(评估次数)
n_subjects = idx["Subject"].nunique() # 独立受试者数(统计样本量口径)
print(f"scans={n_scans}, visits={n_visits}, subjects={n_subjects}")
# 报告样本量时用 subjects;纵向任务用 visits;只有工程统计才用 scans
§4.4 数据层级
受试者(Subject, IDA 编号)
└── 访视(Visit,每 6 个月:基线/6/12/最长 18 个月)
└── 检查(Session:MR 或 PET)
└── 序列(Series:T1 MPRAGE、FLAIR、DTI、rsfMRI、FDG PET、PiB PET)
└── DICOM 切片 / NIfTI 体数据
临床表与影像表通过受试者编号 + 访视关联(idaSearch_all.csv 是官方提供的关联桥梁,见坑点 2)。层级设计带来的工程含义:任何"按扫描计数"的统计都会把纵向访视重复计入同一受试者,正确粒度是"受试者×访视"(一次评估)与"受试者"(一个独立样本);构建索引时建议同时保留这三层粒度的计数,论文报告时按任务选粒度。
§4.5 缺失值与信息性缺失
| 缺失场景 | 缺失机制 | 对建模的影响 | 建议处理 |
|---|---|---|---|
| PET/DTI/rsfMRI 仅子集覆盖 | 设计性缺失 | 多模态模型样本量骤减 | 以 T1w 为主干模态,PET 作补充分支 |
| 诊断标签偶发缺失 | 记录性缺失 | 标签噪声 | 按 Termine 2022 用影像元数据的患者/对照标记回补 |
| 18 个月访视锐减 | 患者脱落/失能 | 纵向模型的选择偏倚 | 仅在 ≥12 个月访视上建模,或用混合效应模型 |
| CSF/血液检验 | 子集采集 | 生物标志物融合受限 | 作为可选分支并显式建模缺失指示 |
| 临床表空单元格 | 未施测 | 量表回归的样本损失 | 显式缺失指示变量,勿用 0 填充 |
| 字典字段与实际列不一致 | 版本错配(2017 vs 2020 表) | 转换器报错或字段静默为空 | 以实际下载表头重新对齐字典条目 |
信息性缺失说明:临床 Excel 中未施测项以空白单元格表示,字典见 DataDictionary_NIFD_2017.10.18.xlsx;"空白≠0"在 MMSE 等量表上尤其关键(0 是合法得分)。
§5 数据划分与使用建议
§5.1 官方划分
NIFD 不提供官方 train/validation/test 划分。IDA 发布的是研究集合本身,任何划分均由使用者自行完成并需在论文中明确报告。
这不是数据集的缺陷,而是采集型计划(与竞赛型数据集相对)的常态:采集方的目标是临床研究最大化,样本量每一例都宝贵,预留官方测试集等于冻结一批数据。后果由使用者承担——不同论文的"测试集"互不相同,跨论文数字比较失去严格意义。工程上的对策是把 §5.2 中已被引用过的划分口径(尤其 Termine 70/30)当作"社区公共基准"来复用,把自建划分留作敏感性分析。
§5.2 社区惯例划分
- 按受试者 70/30 划分:Termine 2022 在最大组(对照)上按 70/30 比例随机分配 train+val 与 test,随机抽样无放回、保证每位受试者只出现在一个集合中,是当前引用最多的可复现口径。
- 选择/测试队列法:Torso 2020 将 DTI 队列拆为"选择队列"(30 FTD + 30 HS)与"测试队列"(42 FTD + 24 HS),另用罗马 Santa Lucia 本地数据做训练队列,实现跨中心外部验证。
- 范例建模法:MIT 2025 的 normative modelling 论文将 NIFD 全部作为应用/外部验证队列,不参与训练。
三种口径的选择逻辑:做基准对比选 70/30(可与 Termine 直接对话);做方法稳健性论证选跨中心法(对设备/协议差异最有说服力);做预训练/Normative 模型选"不参与训练"法(NIFD 的 FTD 病例对 ADNI 主导的模型是稀缺样本,用作迁移评估价值更大)。无论选哪种,都应把划分后的受试者 ID 清单随代码发布。
§5.3 泄漏风险(重点)
- 纵向泄漏:同一受试者的 6/12 个月访视与基线几乎相同,按"扫描"随机划分会让测试集污染训练集。必须按受试者分组划分(
GroupShuffleSplit/ 按 subject ID 分层)。 - 4RTNI 共享对照:NIFD 的健康对照就是 4RTNI 的对照(Clinica 文档)。与 4RTNI 合并数据集时若不去重,对照组会整体跨集重复(见坑点 3)。
- 模板泄漏:若用 MNI-FTD 模板(构建自 NIFD 数据)做配准目标,再在 NIFD 上评估分割/分类,存在温和的间接泄漏;比较外部数据集时应换用独立模板并做敏感性分析。
- 预处理参数泄漏:强度归一化、偏置校正参数若在全库上估计再划分,会把测试分布信息带进训练——所有统计量(均值、方差、 percentile 裁剪点)只能在训练折内估计。
- 临床表共变量泄漏:使用 MMSE/CDR 作输入特征时,若与诊断标签同访视采集,模型可学到"CDR>0 即患者"的捷径;用临床特征做影像研究基线时需注明这是量表融合而非纯影像任务。
§5.4 交叉验证建议
- 小样本亚型研究建议 5 折按受试者分组 + 分层(诊断标签)交叉验证,报告跨折均值±标准差而非单折最优。
- 亚型多分类可用 Repeated Stratified Group K-Fold;PSP/CBS 样本过少的折外表现建议合并报告为"帕金森谱系"组。
- 所有归一化参数(如 z-score 的均值/方差)只能在训练折内估计。
- 若做深度模型 + 早停,验证折必须同样按受试者独立;把"最后一轮训练指标"当验证指标是本数据集社区复现中最常见的统计错误。
§5.5 外部验证建议
- 首选姊妹计划 4RTNI(同协议、对照组共享但患者不同)做外部验证;合并前按受试者去重。
- 次选 GENFI(家族性 FTLD)或本地三中心数据(Torso 2020 用 Santa Lucia 队列训练即属此路线)。
- 跨设备泛化:UCSF Trio Tim 训练的模型在非 Siemens 设备上可能显著退化,建议在 §7.6 的漂移框架下评估。
- 报告格式建议:同时给出"内部(NIFD 留出)"与"外部(4RTNI/本地)"两行指标及其差值(gap),gap 超过 0.1 AUC 即应在讨论中明确归因(协议差异 vs 样本差异)。
- 模型选择纪律:外部验证集只允许触碰一次——反复在 4RTNI 上调参会把它变成"事实上的验证集",届时需要引入新的外部数据重新闭环。
§6 AI 就绪指南
§6.0 云端快速启动
NIFD 无公开镜像(HuggingFace/Kaggle 均无官方拷贝),云端快速启动不适用;正确路径是先在本地/机构服务器完成 IDA 申请与下载(§6.2),再进入 §6.3 的转换流程。若确需在云端训练(Colab/云 GPU),推荐的两段式是:本地完成 BIDS 转换与 t1-linear(CPU 密集、含大体积 DICOM 搬运),仅把转换后的 NIfTI(体积缩减一个量级以上)同步到云存储供训练读取;切勿在云端笔记本内直接解压原始 DICOM 全库——磁盘配额与下载中断都会成为新的坑。
§6.1 快速上手
# 目录结构预期(data_root 拼接关系):
# DATA_ROOT/
# ├── NIFD/ # IDA 影像下载解压目录(含受试者 DICOM 子目录)
# ├── NIFD_Clinical_Data_2017_final_updated.xlsx
# ├── DataDictionary_NIFD_2017.10.18.xlsx
# └── idaSearch_all.csv # 由 idaSearch_.csv 重命名而来(见坑点 2)
# 最小可用子集:首诊 3D T1 MPRAGE(182 FTD + 130 NC),是全库覆盖最广的模态
export DATA_ROOT=/data/nifd
ls $DATA_ROOT | head # 应能看到受试者目录与 3 个临床/元数据文件
head -3 $DATA_ROOT/idaSearch_all.csv # 影像索引:Subject、Image ID、Visit、Modality...
# 用 pandas 快速盘点临床表,确认标签可得性(10 分钟内可完成的完整性检查)
import pandas as pd
DATA_ROOT = "/data/nifd"
clin = pd.read_excel(f"{DATA_ROOT}/NIFD_Clinical_Data_2017_final_updated.xlsx")
idx = pd.read_csv(f"{DATA_ROOT}/idaSearch_all.csv", low_memory=False)
print(clin.columns.tolist()[:20]) # 浏览临床字段
print(idx["Modality"].value_counts()) # 各模态扫描数:MRI 应远多于 PET
print(idx.groupby(["Subject", "Visit"]).size().describe()) # 每人每访视序列数
下载完成后的最小完整性检查清单(任何一项不满足,先回到 §6.2 重新导出,不要硬跑转换器):
| 检查项 | 通过标准 | 常见失败原因 |
|---|---|---|
| 临床 Excel 存在且可读 | pandas 可打开、行数 > 300 | 下载了 2020 版但脚本仍引用 2017 文件名 |
| 数据字典文件在位 | DataDictionary_NIFD_2017.10.18.xlsx 存在 | IDA 已下架该文件(坑点 1) |
| idaSearch_all.csv 文件名 | 文件名与官方要求完全一致 | 忘记重命名 idaSearch_.csv |
| idaSearch 列完整 | 含 Subject/Image ID/Visit/Modality 列 | 导出时漏勾 Display in result 复选框 |
| 影像目录非空 | 受试者子目录数与 idaSearch 的 Subject 数量级一致 | 只下载了部分 zip 分包 |
§6.2 数据获取
| 步骤 | 操作 | 要点 |
|---|---|---|
| 1 | 在 https://ida.loni.usc.edu 注册 IDA 账户 | 免费,需机构邮箱与用途说明 |
| 2 | 提交 NIFD 数据访问申请(在线申请表,入口示例 appLicense.jsp) | 说明研究目的;需签署数据使用条款 |
| 3 | 等待数据访问委员会(DAC)批准 | Torso 2020 记录其访问经 DAC 批准 |
| 4 | 下载影像:PROJECTS → NIFD → Download → Image collections → Advanced Search | 勾选 MRI(需要 PET 时选 PET 并用 OR 连接);建议按 5 或 10 个 zip 分包下载 |
| 5 | 下载临床数据:Download → Study Data | 得到 NIFD_Clinical_Data_2017_final_updated.xlsx(或 20200724 更新版) |
| 6 | 导出影像索引:Advanced Search 勾选全部模态与 Display 列 → CSV Download | 将 idaSearch_.csv 重命名为 idaSearch_all.csv(坑点 2) |
| 7 | 字典缺失时从 ARAMIS 镜像补齐 DataDictionary_NIFD_2017.10.18.xlsx | 见坑点 1 |
| 8 | 校验下载完整性:核对 zip 数量、受试者目录数与 idaSearch_all.csv 行数 | 进入 §6.1 的最小完整性检查清单 |
申请表(在线表格)内容要点——提前准备好这些信息可以让审批一次通过:
- 机构与申请人信息:PI 姓名、机构邮箱(通常要求非免费域名邮箱)、职位与部门。
- 研究目的陈述:明确写出使用 NIFD/FTLDNI 数据的研究问题(如"基于 T1w MRI 的 FTD 亚型分类"),避免只写泛化的"机器学习研究"。
- 资助信息:如有基金号,填写;无资助的探索性研究注明所属实验室。
- 数据安全承诺:说明存储环境(机构服务器/加密磁盘)、不二次分发、遵守 HIPAA 级别的脱敏要求。
- 预期产出:论文/工具类型;若涉及模型发布,说明只发布权重与代码、不发布原始数据。
§6.3 预处理全流程(BIDS 转换 + 标准化)
# 环境要求( Clinica 0.11.x,Python >= 3.10):仅 dcm2niix 为必需外部依赖
pipx install clinica # 或 pip install clinica
# Debian/Ubuntu 安装 dcm2niix;旧版 Clinica(v0.3.x) 还要求 FreeSurfer 与 dcm2nii
sudo apt-get install -y dcm2niix
# 第一步:原始 DICOM -> BIDS(需先完成 §6.2 的文件布局与三个临床文件)
clinica convert nifd-to-bids \
/data/nifd/NIFD \ # 原始影像目录
/data/nifd \ # 临床数据目录(xlsx + csv 所在处)
/data/bids_nifd # 输出 BIDS 目录
# 第二步:T1 线性标准化(N4 偏置校正 + ANTs SyN 对齐 MNI ICBM 2009c)
clinica run t1-linear /data/bids_nifd /data/caps_nifd
# 产物:169×208×179、1 mm 各向同性的裁剪图像(Termine 2022 口径),可直接喂 3D CNN
清洗与筛选建议(对应 §5.3):转换完成后用 participants.tsv 做三层过滤——(1) 保留首诊(基线)访视避免纵向泄漏;(2) 保留 3D MPRAGE 序列排除重复序列与定位像;(3) 按受试者分组划分 train/val/test。PET 分支需额外做参考区标准化(如 Clinica pet-volume 的 SUVR 流程),DTI 分支需按中心协议分层(坑点 6)。
转换完成后的验收脚本(发现"静默半转换"的最快方式——目录存在但内容缺失):
# 验收:BIDS 输出结构与标签完备性(对应坑点 1/2 的下游症状)
from pathlib import Path
import pandas as pd
BIDS = Path("/data/bids_nifd")
t1_files = sorted(BIDS.glob("sub-*/ses-*/**/*T1w*.nii.gz"))
subjects = {p.parts[-4] for p in t1_files} # sub-XXX 层级
parts = pd.read_csv(BIDS / "participants.tsv", sep="\t")
print(f"T1w NIfTI 文件数: {len(t1_files)}")
print(f"有 T1w 的受试者数: {len(subjects)}")
print(f"participants.tsv 受试者数: {len(parts)}")
print(f"标签分布:\n{parts['diagnosis'].value_counts()}")
# 期望:受试者数 ≈ 300 量级(BIDS 化成功者),标签缺失率 < 5%;
# 若 subjects 远小于 participants,多半是 DICOM 目录命名或 idaSearch_all.csv 映射问题
若计划使用 FreeSurfer(皮层厚度/体积特征路线,对应 §6.7 的 SVM 行),在 t1-linear 之后另跑 clinica run t1-freesurfer(跨版本结果不可混用,建议 FreeSurfer 6.0 以对齐多数已发表论文口径);纯端到端 CNN 路线可跳过这一步以节省大量计算时间。旧版 Clinica(v0.3.x)还要求预装 dcm2nii 与 FreeSurfer 才能运行转换器——升级到 0.8+ 后这些要求已被移除(坑点 8 相关的依赖差异见 §6.2)。
§6.4 PyTorch DataLoader(完整可运行)
<details>
<summary>点击展开完整代码(约 60 行)</summary>
# 依赖:nibabel, pandas, torch;输入为 §6.3 产出的 BIDS + t1-linear 裁剪图
# 目录假设:BIDS_ROOT 下 sub-*/ses-*/t1_linear/*.nii.gz(CAPS 化后的 t1-linear 输出亦可,路径自行对齐)
import glob
import os
import nibabel as nib
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
BIDS_ROOT = "/data/bids_nifd" # BIDS 根目录
LABELS = {"CN": 0, "bvFTD": 1, "svPPA": 2, "nfvPPA": 3, "OTHER": 4}
def build_index(bids_root: str) -> pd.DataFrame:
"""扫描 T1w 裂图并与 participants.tsv 合并,返回 (路径, 受试者, 访视, 标签) 索引表"""
rows = []
for path in glob.glob(os.path.join(bids_root, "sub-*/ses-*/**/*T1w*.nii.gz"), recursive=True):
sub = path.split(os.sep)[-4].replace("sub-", "")
ses = path.split(os.sep)[-3].replace("ses-", "")
rows.append({"subject": sub, "session": ses, "path": path})
df = pd.DataFrame(rows)
parts = pd.read_csv(os.path.join(bids_root, "participants.tsv"), sep="\t")
parts["subject"] = parts["participant_id"].str.replace("sub-", "", regex=False)
return df.merge(parts[["subject", "diagnosis"]], on="subject", how="inner")
class NIFDT1Dataset(Dataset):
"""按受试者唯一分配到数据集,杜绝纵向/跨集泄漏(见坑点 4)"""
def __init__(self, index: pd.DataFrame, phase: str = "train"):
self.df = index[index["split"] == phase].reset_index(drop=True)
def __len__(self):
return len(self.df)
def __getitem__(self, i):
img = nib.load(self.df.loc[i, "path"]).get_fdata(dtype=np.float32)
img = np.clip(img, 0, np.percentile(img, 99)) # 去极值
img = (img - img.mean()) / (img.std() + 1e-8) # 训练折内统计(全局仅在 train 拟合)
vol = torch.from_numpy(img[None]) # (1, X, Y, Z)
y = self.df.loc[i, "y"]
return vol, torch.tensor(y, dtype=torch.long)
def make_loaders(bids_root: str, batch_size: int = 4):
df = build_index(bids_root)
df["y"] = df["diagnosis"].map(lambda d: LABELS.get(d, LABELS["OTHER"]))
rng = np.random.default_rng(42)
subjects = df["subject"].unique() # 按受试者划分(70/30)
rng.shuffle(subjects)
test_subs = set(subjects[: int(0.3 * len(subjects))])
df["split"] = df["subject"].map(lambda s: "test" if s in test_subs else "train")
df.loc[df["split"] == "train", "split"] = df[df["split"] == "train"]["y"].map(lambda y: "train")
return (DataLoader(NIFDT1Dataset(df, "train"), batch_size=batch_size, shuffle=True, num_workers=4),
DataLoader(NIFDT1Dataset(df, "test"), batch_size=batch_size, shuffle=False, num_workers=4))
train_loader, test_loader = make_loaders(BIDS_ROOT)
x, y = next(iter(train_loader)) # x: (B,1,169,208,179)
与上述 Dataset 配套的最小训练循环(二分类:病例 vs 对照;多分类只需替换 out_channels 与损失):
# 训练循环:MONAI 3D DenseNet121(Termine 2022 同款架构),混合精度 + 梯度累积
import torch
import torch.nn as nn
from monai.networks.nets import DenseNet121
device = "cuda" if torch.cuda.is_available() else "cpu"
model = DenseNet121(spatial_dims=3, in_channels=1, out_channels=2).to(device)
opt = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-5)
loss_fn = nn.CrossEntropyLoss()
scaler = torch.cuda.amp.GradScaler(enabled=(device == "cuda"))
accum = 4 # batch_size=4 时等效 16
model.train()
for step, (x, y) in enumerate(train_loader):
x, y = x.to(device), y.to(device)
with torch.cuda.amp.autocast(enabled=(device == "cuda")):
loss = loss_fn(model(x), y) / accum
scaler.scale(loss).backward()
if (step + 1) % accum == 0:
scaler.step(opt)
scaler.update()
opt.zero_grad()
</details>
§6.5 坑点清单(8 个真实失败模式)
以下 8 个坑点全部来自可追溯的公开记录(官方文档、GitHub Issue、论文 limitations 与已发表的研究者做法),按"出现顺序"排列:坑点 1-2 出现在下载与转换阶段,坑点 3-5 出现在数据组织与标签阶段,坑点 6-8 出现在建模与评估阶段。
⚠️ 坑点 1:DataDictionary 文件从 IDA 下架,转换器直接报错(分类:工程陷阱)
问题:
nifd-to-bids转换器要求三个临床文件齐备,但 IDA 曾将DataDictionary_NIFD_2017.10.18.xlsx从 Study Data 中移除;同时 IDA 另提供 2020-07-24 更新版临床表,双版本并存极易拿错。
症状:运行转换器报 “A required clinical file … doesn’t exist”;或用了错误版本导致字段名对不上、标签为空。
解决:
- 简单方法:从 ARAMIS 官方镜像直接下载该字典文件,放入临床数据目录。
- 进阶方法:Clinica 2020-11 之后(Issue #122 → PR #147)已内置回退逻辑——本地缺失时自动从 ARAMIS 服务器拉取
DataDictionary_NIFD_*.xlsx,把 Clinica 升级到 ≥0.4/0.8 系列即可。- SOTA 方法:固定临床数据版本为 2017_final_updated(与绝大多数已发表论文口径一致),在 README/配置中记录文件 MD5,团队内禁止混用 20200724 版。
参考:github.com/aramis-lab/clinica Issue #122、Clinica nifd-to-bids 文档
⚠️ 坑点 2:idaSearch CSV 未重命名/漏选 Display 列,影像-临床映射断裂(分类:工程陷阱)
问题:官方要求从 IDA Advanced Search 导出的
idaSearch_.csv必须重命名为idaSearch_all.csv,且导出时需勾选 Display in result 的全部列;转换器靠它把 DICOM 目录映射到受试者与访视。
症状:转换器报找不到idaSearch_all.csv,或 BIDS 输出中 participants 数为 0、访视/模态字段大面积为空。
解决:
- 简单方法:导出后
mv idaSearch_.csv idaSearch_all.csv,并核对表头包含 Subject、Image ID、Visit、Modality 等列。- 进阶方法:在导出界面把 Advanced Search 的"全部模态 + 全部 Display in result"复选框勾齐再点 CSV Download(Clinica 文档的原始指示),避免二次下载。
- SOTA 方法:把这三个文件 + zip 下载清单纳入版本化 manifest(记录下载日期与 IDA 界面版本),后续复现者可审计数据快照。
参考:Clinica v0.8.1 nifd-to-bids 文档
⚠️ 坑点 3:健康对照与 4RTNI 完全共享,合并分析产生集合级重复(分类:数据泄漏)
问题:NIFD 与 4-Repeat Tauopathy Neuroimaging Initiative(4RTNI)使用相同采集方法,且 NIFD 的对照组就是 4RTNI 的对照组——这是官方描述明确的事实。
症状:把 NIFD 与 4RTNI 拼成大训练集、再拿其一做"独立测试集"时,对照组受试者原样出现在训练与测试两侧,指标虚高且难以察觉(患者侧不受影响)。
解决:
- 简单方法:合并前按 IDA 受试者编号对对照去重(
drop_duplicates(subset="Subject"))。- 进阶方法:以受试者为最小单元构建全局索引,任何跨集合分析前先做 subject 级 anti-join 断言。
- SOTA 方法:构建"中心+计划"元数据表,在训练日志中固化每个受试者的来源计划(NIFD/4RTNI),论文报告时分别披露对照数量。
参考:Clinica nifd-to-bids 文档(描述段)
⚠️ 坑点 4:纵向访视当作独立样本随机划分(分类:数据泄漏)
问题:同一受试者在基线、6 个月、12 个月(部分 18 个月)各有影像与量表,平均每人 2.7-3.2 次访视;按扫描而非按人划分会令测试集与训练集高度同源。
症状:分类/回归指标离群地好(尤其纵向回归任务 R² 接近 1);换到真正的外部队列后性能断崖下跌。
解决:
- 简单方法:只取首诊访视建模(Termine 2022 即如此,182 FTD + 130 NC)。
- 进阶方法:按受试者分组划分(
GroupShuffleSplit(groups=subject_id)),允许多访视同时进入同一折。- SOTA 方法:纵向任务用受试者级交叉验证 + 折内基线归一(以每人基线为参照计算变化量),并报告折间方差。
参考:Termine et al., 2022、Staffaroni et al., 2019
⚠️ 坑点 5:诊断标签缺失与 PSP/CBS 稀有亚型(分类:标签理解)
问题:部分受试者在临床表中没有诊断条目;PSP 与 CBS 虽在 NIFD 入组范围内,但在各已报告子集中仅个位数到十几例,标签分布高度长尾。
症状:多分类模型在 PSP/CBS 上召回率接近 0;或少数受试者因"标签缺失"被静默丢弃,样本量对不上论文口径。
解决:
- 简单方法:按 Termine 2022 的做法,临床表诊断缺失时用影像元数据中的 patient/control 标记回补二分类标签。
- 进阶方法:把 PSP/CBS 合并为"帕金森谱系"组,或改用层级分类(先病例/对照,再亚型),并对稀有类做加权损失/过采样。
- SOTA 方法:亚型多分类报告 per-class 敏感性/特异性与 macro-F1,同时对稀有类给出置信区间(bootstrap 按受试者重采样)。
参考:Termine et al., 2022、§4.2 标签分布
⚠️ 坑点 6:三中心采集协议不一致,直接混合引入设备偏倚(分类:偏倚陷阱)
问题:NIFD 是多中心数据集,DTI/DWI 的 B0 与扩散序列参数在中心间存在差异;不筛选协议会导致模型学到"中心指纹"而非疾病模式。
症状:按中心做 t-SNE/UMAP 出现清晰聚类;跨中心外部验证时性能大幅下滑。
解决:
- 简单方法:复现 Torso 2020 的做法——只保留采集协议一致的受试者再建模。
- 进阶方法:以 DICOM 头文件中的序列参数构建协议指纹,按协议分层划分;或加入中心 one-hot 协变量做谐波化(ComBat 类方法)。
- SOTA 方法:训练中心对抗分支或域泛化目标(如 leave-one-site-out 验证),报告跨中心泛化 gap。
参考:Torso et al., 2020, Scientific Reports
⚠️ 坑点 7:模态覆盖不均,PET/DTI 子集被误当全队列(分类:预处理陷阱)
问题:T1 MPRAGE 是 NIFD 中最常见的采集模态,FLAIR、DTI、rsfMRI、FDG/PiB PET 均只覆盖子集;不同模态的可用样本量差异可达数倍。
症状:多模态模型训练时样本量在融合层骤降;文献间"同一数据集"样本数对不上(346 vs 312 vs 106 等口径)。
解决:
- 简单方法:以 T1w 为主干、单模态先行,再扩展多模态分支。
- 进阶方法:多模态融合用缺失感知策略(模态 dropout / 缺失指示输入),并显式报告每个模态的实际 N。
- SOTA 方法:对 PET 分支独立做 SUVR 标准化(Clinica
pet-volume),对 DTI 分支先做协议分层(坑点 6)再入模。
参考:Termine et al., 2022、§3.1 模态详情
⚠️ 坑点 8:类别构成失衡的测试集造成敏感度/特异度错觉(分类:评估误用)
问题:多数子集中健康对照多于或构成不同于患者组;单一 accuracy 会掩盖单类失效——Termine 2022 的模型 sensitivity 1.0 但 specificity 仅 0.6,总体 accuracy 0.80。
症状:论文只报 accuracy 时,"把所有人都判为患者"或"把绝大多数判为对照"的模型同样能拿到好看的分数;跨论文对比时口径混乱。
解决:
- 简单方法:同时报告 balanced accuracy、per-class sensitivity/specificity 与 AUC。
- 进阶方法:按受试者 bootstrap 构建指标置信区间(Termine 报告 accuracy 95% CI 0.64-0.91 即此口径);亚型任务报 macro-F1。
- SOTA 方法:预注册固定测试集与阈值策略,与 Xue 2024(微平均 AUROC 0.96,多病因)这类多队列工作对比时明确任务与队列差异,不做裸数字横比。
参考:Termine et al., 2022、Xue et al., 2024
§6.6 数据增强
| 增强方式 | 安全性 | 说明 |
|---|---|---|
| 随机 3D 翻转(左右) | ✅ 安全 | 脑近似左右对称;注意右颞叶优势的 svPPA 理论上存在侧化,做敏感性分析 |
| 小角度随机旋转(±10°)与平移(≤5 mm) | ✅ 安全 | 模拟残余配准误差 |
| 随机弹性形变(小幅度) | ✅ 安全(保守参数) | 模拟个体解剖变异;形变场幅度过大将破坏萎缩模式 |
| 随机强度缩放/高斯噪声 | ✅ 安全 | 模拟扫描仪强度差异 |
| 随机场偏置增强 | ✅ 安全 | 模拟低频强度不均,与 N4 校正后的残差形态一致 |
| 通道级 dropout(多模态模型) | ✅ 安全(条件) | 仅用于训练缺失感知的多模态分支,单模态任务不适用 |
| 大幅非线性形变"增强"萎缩区 | ❌ 危险 | 会篡改 FTD 的核心病理信号(局灶萎缩) |
| 随机大幅裁剪脑区 | ❌ 危险 | 可能裁掉额叶/颞叶病灶,制造标签噪声 |
| 跨模态混合(PET 强度混入 T1) | ❌ 危险 | 两模态物理意义不同,混合产生非生理图像 |
| Mix-up/CutMix 直接混合两例影像 | ❌ 危险 | 两例萎缩模式线性混合无解剖学意义,且跨标签混合制造伪样本 |
增强强度的总原则:FTD 影像模型的判别信号是空间模式(哪里萎缩)而非纹理,因此一切可能重排空间结构的增强都要保守;强度类增强可以放开,空间类增强(旋转/形变/缩放)的幅度以"肉眼在对照图上分辨不出差异"为上限。
§6.7 模型推荐
| 模型 | 输入 | 适用任务 | 参考 |
|---|---|---|---|
| DenseNet121(3D) | t1-linear 裁剪图 169×208×179 | 病例/对照分类基准 | Termine 2022(MONAI 官方实现) |
| ResNet/CL 系 3D CNN | 同上 | 亚型多分类 | 社区常规做法 |
| SVM(皮层厚度/体积特征) | FreeSurfer 特征 | 小样本可解释建模 | Torso 2020 路线 |
| 混合效应/里程碑模型 | 纵向 MMSE、CDR、体积 | 进展建模与样本量估算 | Staffaroni 2019 |
| 多任务多队列 Transformer/CNN | 多数据集拼接(NIFD+ADNI+4RTNI…) | 多病因痴呆鉴别 | Xue 2024 |
| Normative modelling(高斯/生成式) | 大型健康队列训练 + NIFD 应用 | 年龄不匹配萎缩检测 | MIT 2025 路线 |
选型建议:数据规模决定了 NIFD 适合"小模型 + 强先验"——3D CNN 控制在 5-10M 参数量级、或直接用预训练特征 + 线性头;从零训练 ViT 级模型几乎必然过拟合。若追求亚型判别的可解释性,FreeSurfer 皮层厚度 + SVM/逻辑回归仍是审稿人最认可的基线。
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 |
|---|---|---|
| BIDS 转换(dcm2niix + Clinica) | 4 核 CPU / 16 GB 内存 / 100 GB 磁盘 | 8 核 / 32 GB / 500 GB SSD |
| t1-linear(ANTs) | 8 核 CPU | 16 核(每例约数分钟) |
| 3D CNN 训练 | 单张 11 GB 显存 GPU(batch 2,需梯度累积) | 24 GB 显存 GPU(batch 4-8,混合精度) |
| 多队列联合训练(Xue 2024 级别) | 多卡分布式训练环境 | 8×A100 量级 + 数周训练(含 9 数据集准备) |
| FreeSurfer 纵向(可选) | 8 核 / 32 GB | 每例数小时,建议集群并行 |
§6.9 评估指标代码
# 按受试者聚合的评估:先聚合到受试者粒度,再计算不平衡鲁棒指标(对应坑点 8)
import numpy as np
from sklearn.metrics import balanced_accuracy_score, roc_auc_score, confusion_matrix
def evaluate(y_true, y_pred, y_score, labels):
"""y_pred/y_score 必须已经是受试者级(每人一票),禁止按扫描计数"""
cm = confusion_matrix(y_true, y_pred, labels=labels)
per_class_sens = np.diag(cm) / np.maximum(cm.sum(axis=1), 1) # 每类敏感度
per_class_spec = np.diag(cm) / np.maximum(cm.sum(axis=0), 1) # 每类特异度(一对多)
out = {
"balanced_acc": balanced_accuracy_score(y_true, y_pred),
"macro_f1": None, # 可接 sklearn f1_score(average="macro")
"per_class_sens": dict(zip(labels, per_class_sens.round(3))),
"per_class_spec": dict(zip(labels, per_class_spec.round(3))),
}
if y_score is not None and len(labels) == 2:
out["auc"] = roc_auc_score(y_true, y_score)
return out
阈值策略:不要用 0.5 的默认阈值交差——NIFD 各子集的类别构成不同,建议在训练折内用 Youden 指数或固定敏感度(如 ≥0.85)选阈值,再把阈值锁定后应用于测试折;任何在测试集上调阈值的行为都构成泄漏。亚型多分类时,另报 macro-F1 与按受试者 bootstrap 的 95% CI(Termine 2022 的 accuracy CI 0.64-0.91 显示了小样本下区间有多宽)。
§6.10 MLOps 笔记
- 版本固定:Clinica(PyPI 0.11.3,MIT 许可,Python ≥3.10)、dcm2niix、FreeSurfer(如用)三者版本写入
environment.yml;转换结果随 Clinica 版本变化,需在论文中披露。 - 数据快照管理:记录 IDA 下载日期、zip 清单与三个临床文件的哈希;临床数据存在 2017 与 2020-07-24 双版本(坑点 1)。
- 可复现工作流:优先采用 Clinica + MONAI 的标准化链路(Termine 2022 的核心主张),把转换、预处理、训练三步的随机种子与参数写入版本库。
- 划分快照:把 train/val/test 的受试者 ID 列表落盘为 CSV 并提交版本库——NIFD 无官方划分,固化划分是与后续工作可比的前提。
- 监控指标:训练期同时监控训练/验证的 balanced accuracy 与宏平均 AUC,而不仅是 loss;亚型模型另监控稀有类召回率,防止"平均指标掩盖稀有类塌陷"。
- 审计与合规:数据经 DAC 批准,论文须按官方要求引用 NIFD/FTLDNI 资助与数据来源;禁止将原始 DICOM 二次分发到公共仓库。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 转诊偏倚 | 全部来自三级学术记忆中心,非人群样本 | 中 | 外推前做人群数据校准 |
| 中心/设备偏倚 | 3 个中心、以 UCSF 为主;序列参数不一致 | 中 | 协议筛选 + leave-one-site-out 验证(坑点 6) |
| 标签噪声 | 临床综合征诊断、无病理确认、标准版本跨年份 | 中高 | 敏感性分析;报告诊断标准版本 |
| 类别不平衡 | bvFTD 远多于 PSP/CBS | 高(对多分类) | 合并稀有类 + 加权损失(坑点 5) |
| 纵向脱落 | 18 个月访视人数锐减 | 中 | 限制在 12 个月窗口建模 |
| 对照共享 | 与 4RTNI 对照完全共享 | 中(合并分析时) | 受试者级去重(坑点 3) |
| 教育/人口学错配 | 患者组教育低于对照组约 3 年 | 中 | 认知变量回归纳入教育协变量 |
§7.2 标注质量
诊断标签由多学科共识会议给出,bvFTD 采用 FTDC 2011 标准、PPA 采用 Gorno-Tempini 2011 标准,是 FTD 领域最高可行的临床金标准;但需明确三点局限:无数据集级标注者一致性系数发布;临床-病理不匹配(尤其 PSP/CBS 的临床综合征与病理可交叉);个别受试者诊断缺失需回补(坑点 5)。量表类标注(MMSE、CDR)为标准化工具测得,质量稳定。
对 AI 研究者的实操含义:把诊断标签当作"有噪声的金标准"对待——(1) 在误差分析中抽样复核被模型"错分"的病例,区分模型错误与标签噪声;(2) 报告结果时使用"临床综合征"而非"病理确诊"的措辞;(3) 若研究目标是病理亚型预测(tau vs TDP-43),NIFD 的标签不够用,应转向 ALLFTD/GENFI 等含生物标志物的后继队列。
§7.3 泛化性评估
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 非 Siemens 设备/非北美人群 | 高 | 队列仅 3 个北美学术中心;设备差异未系统公布 |
| 社区/初级保健筛查 | 高 | 转诊偏倚(§7.1),未见社区人群验证 |
| 跨痴呆病因鉴别 | 中 | Xue 2024 证明多队列联合可到 AUROC 0.96,但依赖 9 数据集规模 |
| 单中心临床研究复现 | 低-中 | 同协议内复现良好(Staffaroni 2019、Termine 2022 均在同一底层数据上稳定产出) |
| 亚型精细分类 | 高 | PSP/CBS 样本过少(§4.2),亚型精细多分类尚无稳定基准 |
| 纵向个体化预测 | 高 | 12 个月以上访视留存率低(§3.7),个体轨迹建模样本支撑不足 |
§7.4 伦理与合规
数据经 LONI IDA 脱敏分发(DICOM 头与日期脱敏),访问需在线申请、签署使用条款并经数据访问委员会批准;受试者依各中心 IRB 批准的知情同意书入组。二次分发原始数据通常被禁止,论文发表需按官方格式致谢 NIFD/FTLDNI 与资助号 R01 AG032306。
合规操作清单:(1) 审批通过前不下载、不使用任何 NIFD 数据(包括用于调试的样例);(2) 项目结束时按协议保留/销毁数据的记录;(3) 在成果中如实披露队列局限(北美学术中心、综合征级标签);(4) 模型发布只附带权重与代码,附带的示例图像应使用合成或获得单独许可的数据;(5) 涉及基因或 CSF 子集的二次分析需检查原始同意范围是否覆盖。
§7.5 公平性
队列以北美学术中心就诊人群为主,族裔、教育与社会经济地位分布未系统公布;FTD 谱系本身存在跨文化临床表现差异(语言变异型的跨语言研究差异尤大)。面向全球人群的模型应把 NIFD 视为"北美学术中心域"数据,避免直接外推。
§7.6 数据漂移
- 设备/协议漂移:同一计划内不同中心、不同年份的序列参数差异(坑点 6),建议以 DICOM 头指纹监控。
- 版本漂移:临床数据 2017 → 2020-07-24 双版本,字段与行数可能变化,跨版本合并需字典对齐。
- 后继计划漂移:UCSF 的后继研究 ALLFTD(ARTFL-LEFFTDS)沿用并扩展了评估体系(年度随访),两代数据不能直接拼接;UCSF 官方 NIFD 页面现已跳转至 ALLFTD 页面。
- 平台漂移:IDA 界面与导出流程历史上多次改版(旧文档 v0.3.x 与 v0.8.x 的下载步骤已不同),本文以 v0.8.x 流程为准;使用时以 IDA 当前界面与最新 Clinica 文档交叉核对。
- 社区漂移:早期文献使用的 FTD/PPA SNOMED 编码已在现行国际版失效(§2.1b),跨年代文献做编码层聚合时需重映射。
§7.7 DAIMS 24 项数据集审计
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 临床 Excel 为受试者×字段的宽表,可直接 pandas 读取 |
| 2 | 唯一标识 | ⚠️ | IDA 受试者编号全局唯一,但跨文件关联依赖 idaSearch_all.csv,易错位(坑点 2) |
| 3 | 特殊字符 | ✅ | 临床字段以 ASCII 为主,无已知编码陷阱 |
| 4 | 重复行 | ⚠️ | 同一序列重扫描产生多行;临床数据存在 2017/2020 双版本 |
| 5 | 缺失编码 | ⚠️ | 空白单元格=未施测,需与 0 分严格区分(§4.5) |
| 6 | 标签标识 | ⚠️ | 诊断偶发缺失,需用影像元数据回补(坑点 5) |
| 7 | 罕见类分组 | ⚠️ | PSP/CBS 样本极少,需合并或层级建模 |
| 8 | 偏倚评估 | ⚠️ | 转诊/中心/脱落偏倚已被论文讨论,但无量化校准集 |
| 9 | 数据字典 | ✅ | DataDictionary_NIFD_2017.10.18.xlsx 官方发布(ARAMIS 镜像) |
| 10 | 信息性缺失解释 | ❌ | 官方未解释模态/访视缺失的原因与机制 |
| 11 | 设备记录 | ✅ | DICOM 头含设备与序列参数;UCSF 站参数已论文级公开 |
| 12 | 共线性 | ⚠️ | MMSE 与 CDR 等量表间相关,回归建模需共线诊断 |
| 13 | 编码映射 | ❌ | 诊断标签无 ICD/SNOMED 官方映射列,需自行映射(§2.1) |
| 14 | 时间戳处理 | ✅ | 访视日期经脱敏但保留相对间隔,可支撑纵向建模 |
| 15 | 划分建议 | ⚠️ | 无官方划分;社区 70/30 按受试者口径可复现(§5.2) |
| 16 | 泄漏讨论 | ✅ | Termine 2022 明确以受试者划分避免泄漏;4RTNI 共享对照已官方披露 |
| 17 | 标签分布 | ⚠️ | 亚型分布已知但不均衡(§4.2),稀有类无扩充机制 |
| 18 | 测量偏倚 | ⚠️ | 多中心序列差异已确认(Torso 2020),协议元数据需自行提取 |
| 19 | 外部验证建议 | ✅ | 4RTNI 同协议姊妹计划是天然外部验证集(§5.5) |
| 20 | 版本记录 | ⚠️ | 有双版本临床表但无变更日志,字段级 diff 需自做 |
| 21 | 预处理脚本 | ⚠️ | 官方无脚本;社区 Clinica 转换器成熟且开源(§6.3) |
| 22 | 合规要求 | ✅ | IDA 申请审核 + 使用条款明确,免费用于研究 |
| 23 | 多模态对齐 | ❌ | 无现成的跨模态同访视对齐表;需按受试者+访视自建 |
| 24 | 去标识化 | ✅ | IDA 发布前统一脱敏(头部与日期),无直接标识符 |
DAIMS 评分:14.5 / 24
评分解读:NIFD 的强项在"底子干净"——脱敏合规、官方数据字典、设备记录与可审计的访问流程都达到了开放影像数据库的一线水准;弱项集中在"AI 工程化后半程"——无官方划分、无官方预处理脚本、跨模态对齐与编码映射需要研究者自建。这与它"2010 年代立项的科研采集计划"而非"面向 ML 的发布包"的历史定位一致。
对你意味着什么:(1) 前 3 天的工作量主要在数据工程——按 §6.2-§6.3 完成 IDA 下载与 Clinica BIDS 转换,之后即可对齐 Termine 2022 的基准;(2) 任何多模态、多队列或纵向研究,先写好受试者级唯一索引与去重断言(坑点 3、4),这是本数据集最常见的翻车点;(3) 若目标是临床落地,请把 §7.3 的泛化矩阵当作风险清单,用 4RTNI 与本地队列补外部验证,而不是直接报告 NIFD 内部指标。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| NIFD 测试子集(留出 30%) | UCSF/MCR/MGH | FTD vs NC(T1 MPRAGE DenseNet121) | accuracy 0.80(95% CI 0.64-0.91)、AUC 0.86、sens 1.0、spec 0.6 | 内部口径 | 单类失衡导致 spec 偏低(Termine 2022) |
| 罗马训练队列 → NIFD 测试队列 | Santa Lucia(罗马)→ UCSF | DTI 皮质弥散指标判别 FTD 亚型 | 选择队列 30+30,测试队列 42+24 | 跨中心外部测试 | DTI 指标可跨中心区分亚型(Torso 2020) |
| 芬兰本地痴呆队列复测 | Oulu 大学医院 | bvFTD 脑信号变异性 | 35 bvFTD + 92 HC(NIFD)vs 18 bvFTD + 17 AD + 24 HC(本地) | 信号变异性升高在独立队列复现 | bvFTD 信号变异性升高非 NIFD 特有(Tuovinen 2024) |
| 9 数据集联合多病因鉴别 | 含 NIFD/ADNI/PPMI/4RTNI 等 | 10 类痴呆病因鉴别 | 微平均 AUROC 0.96;混合病理 0.78 | 多队列联合远优于单队列 | NIFD 提供"非 AD 痴呆"关键负样本与亚型样本(Xue 2024) |
| MNI-FTD 模板队列复用 | McGill/Dadar 团队 | 亚型无偏平均模板构建 | 模板被多篇后续研究引用复用 | 模板构建口径(70/36/30/133)稳定可复现 | NIFD 基线 T1w 可支撑疾病模板这类独立产出(Dadar 2021) |
§8 基准性能与生态
§8.1 参考基准(研究级)
NIFD 没有官方排行榜;下表汇总已发表的代表性结果。各行列的任务定义、测试集与预处理不同,数值不可直接比较,仅作选型与复现参照。
| 研究 | 任务 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| Termine et al. | FTD vs NC(T1 MPRAGE,182/130) | accuracy 0.80(95% CI 0.64-0.91)、AUC 0.86、sens 1.0、spec 0.6、F1 0.83 | 2022 | 3D DenseNet121 + MONAI + Clinica t1-linear | Termine A, Fabrizio C, Caltagirone C, Petrosini L. Life. 2022;12(7):947. doi:10.3390/life12070947 | 标准化流程(Clinica+MONAI),无公开训练仓库 |
| Xue et al. | 10 类痴呆病因鉴别(9 数据集含 NIFD,51,269 人) | 微平均 AUROC 0.96(病因);0.94(正常/MCI/痴呆);混合病理 0.78 | 2024 | 多模态深度学习 + 多队列训练 | Xue C, et al. Nature Medicine. 2024. doi:10.1038/s41591-024-03118-z | github.com/vkola-lab/nmed2024 |
| Torso et al. | DTI 皮质弥散指标判别 FTD 亚型 | 选择/测试队列(30+30 / 42+24)中区分 bvFTD/svPPA/nfvPPA | 2020 | 新 DTI 皮质测量 + 机器学习 + 独立训练队列 | Torso M, et al. Scientific Reports. 2020;10:11237. doi:10.1038/s41598-020-68118-8 | 未公开 |
阅读上表的两条纪律:第一,三行任务的难度完全不同(二分类 vs 十分类 vs 三分类亚型),数值没有横向可比性;第二,NIFD 在 Xue 2024 中只是九分之一的数据成分,其 0.96 AUROC 不能解读为"NIFD 上能达到的水平"。如果你需要对外报告"在 NIFD 上的性能",唯一诚实的做法是按 §8.3 协议自行复现并报告完整口径。
§8.2 SOTA 总结与选型建议
- 单模态 T1w 二分类:以 Termine 2022 为最低可复现基准(accuracy 0.80 / AUC 0.86);超过它不足以发表,重点应放在亚型分类、校准与外部验证。
- 多病因鉴别:单队列无法企及 Xue 2024 的 0.96 AUROC;正确姿势是把 NIFD 作为联合训练中的"非 AD"成分。
- 亚型分类:没有公认稳定基准;建议以层级分类 + macro-F1 报告,PSP/CBS 单列需谨慎。
- 纵向建模:参照 Staffaroni 2019 的终点框架,用混合效应模型与影像变化率做样本量估算,比端到端深度模型更符合试验场景。
- 可解释性方向:Termine 2022 的注意力图方法(定位模型关注脑区并诊断误分原因)是低成本高回报的加项,特别适合与额叶/颞叶萎缩的神经解剖先验对照。
- 校准与不确定性:小样本测试集(百例级)下,务必同时报告可靠性图/期望校准误差;未校准的高 AUC 模型在临床语境几乎没有意义。
- 阴性对照实验:用性别/年龄匹配打乱标签跑一次完整训练,若"打乱版"性能仍接近真实版,说明模型在学人口学捷径而非影像模式——这是小样本神经影像最便宜的健全性检查。
§8.3 评测协议建议
复现 Termine 口径的最小协议:首诊 3D T1 MPRAGE → Clinica nifd-to-bids + t1-linear(169×208×179 裁剪)→ 按受试者 70/30 划分 → DenseNet121 → 报告 balanced accuracy、AUC、per-class sens/spec 与按受试者 bootstrap 的 95% CI。所有随机种子、Clinica 版本与数据快照哈希随代码发布。
- 数据口径声明:写明使用的临床数据版本(2017 最终版或 2020-07-24 更新版)与筛选后的受试者数。
- 预处理声明:写明 Clinica 版本与
t1-linear输出尺寸(169×208×179、1 mm)。 - 划分声明:按受试者列出的划分清单(哈希化发布),禁止按扫描划分。
- 指标声明:至少包含 balanced accuracy、AUC 与 per-class 敏感度/特异度;accuracy 单指标不予采信(坑点 8)。
- 对比声明:与其他论文比较时注明任务、队列、模态与预处理差异,不裸比数字。
§8.4 相关数据集
| 数据集 | 关系 | 获取 | 差异化定位 |
|---|---|---|---|
| 4RTNI | 姊妹计划(同协议、共享对照) | LONI IDA 申请 | 4 重复 tau 蛋白病(PSP/CBS 为主)纵向队列 |
| ADNI | 姊妹范式(AD 版) | LONI IDA 申请 | 阿尔茨海默病多模态纵向金标准 |
| OASIS-3 | 互补 | 开放 | 正常衰老 + AD 纵向,无 FTD 特异亚型 |
| GENFI | 互补 | 申请 | 家族性/基因突变 FTLD(欧洲为主) |
| ALLFTD (ARTFL-LEFFTDS) | 后继计划 | 申请 | NIFD 的美国全国扩展(年度随访) |
| NACC | 互补 | 申请 | 全美痴呆病例注册(含 FTD 模块),临床变量极全、影像弱 |
| PPMI | 互补 | 申请 | 帕金森病多模态纵向库,与 NIFD 同为 Xue 2024 联合训练成分 |
§8.5 关键论文 Top 8
- Dadar et al., 2021, Scientific Data. doi:10.1038/s41597-021-01007-5 — 基于 NIFD 构建 MNI-FTD 亚型无偏平均模板,是本数据集最接近"数据描述论文"的引用锚点。
- Staffaroni et al., 2019, Brain. doi:10.1093/brain/awy319 — 用 NIFD 合并队列确立纵向多模态影像试验终点与样本量方法(被引 98 次,Europe PMC 截至 2026-09)。
- Xue et al., 2024, Nature Medicine. doi:10.1038/s41591-024-03118-z — 51,269 人、9 数据集(含 NIFD)的多病因痴呆鉴别诊断,微平均 AUROC 0.96。
- Termine et al., 2022, Life. doi:10.3390/life12070947 — MONAI + Clinica 可复现 FTD CAD 工作流与 DenseNet121 基准。
- Torso et al., 2020, Scientific Reports. doi:10.1038/s41598-020-68118-8 — DTI 皮质弥散测量的亚型判别与跨中心验证。
- Tuovinen et al., 2024, JCBFM. doi:10.1177/0271678X241262583 — bvFTD 脑信号变异性研究与 NIFD 子集画像(35/92)。
- Routier et al., 2021, Frontiers in Neuroinformatics. doi:10.3389/fninf.2021.689675 — Clinica 平台论文,
nifd-to-bids转换器的方法学引用。 - Crawford et al., 2015, NeuroImage. doi:10.1016/j.neuroimage.2015.04.067 — LONI IDA 架构论文,说明数据托管与脱敏分发机制。
§8.6 社区活跃度
- ** Clinica GitHub(aramis-lab/clinica)**:
nifd-to-bids相关 Issue(如 #122)有维护者回应并在数周内修复,转换器持续维护至 0.11.x(2026-04 仍在发版)。 - 引用势能:Europe PMC 口径(截至 2026-09)NIFD 相关应用论文被引从个位数(新发表)到 110 次(Nature Medicine 2024)不等,呈加速趋势。
- 产业与研究使用:CRO(如 Biospective)与多所大学将 FTLDNI 作为标准数据源进行方法展示;IDA 平台层面累计支撑 68 国、超 700 万次影像下载(截至 2014,Crawford 2015)。
- 官方迭代节奏:数据本体已定稿(临床表最后更新 2020-07-24),活跃度集中在工具链(Clinica/MONAI)与后继计划(ALLFTD);选择 NIFD 做长期项目时,应把 ALLFTD 纳入数据演进路线图。
- 求助渠道:Clinica GitHub Issues 与 Clinica 文档是唯一有维护者值守的渠道;IDA 端的问题走其站内支持工单,社区论坛无 NIFD 专版。
- 文献追踪建议:以 “FTLDNI”、“NIFD”、“Frontotemporal Lobar Degeneration Neuroimaging Initiative” 三关键词在 PubMed/Europe PMC 建立引文提醒,新应用论文(尤其引用 Dadar 2021 或 Staffaroni 2019 的工作)是发现新坑点与新基准的最快渠道。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| LONI IDA | 官方托管平台 | https://ida.loni.usc.edu | 持续运营 | 唯一官方下载入口 |
| UCSF NIFD 研究页 | 官方主页 | http://memory.ucsf.edu/research/studies/nifd | 已跳转至 ALLFTD | 了解计划与后继研究 |
| Clinica | 转换/预处理工具链 | github.com/aramis-lab/clinica | 活跃维护(0.11.3,2026-04) | 一键 BIDS 化 + 标准管线 |
| Clinica nifd-to-bids 文档 | 官方转换文档 | v0.8.1 文档 | 稳定 | 下载与转换的权威步骤 |
| Clinica Issue #122 | 坑点权威讨论 | github.com/aramis-lab/clinica/issues/122 | 已关闭(PR #147 修复) | 数据字典缺失问题的完整因果链 |
| MONAI | 训练框架 | https://monai.io | 活跃 | 复现 Termine 2022 的 3D 分类栈 |
| 4RTNI-FTLDNI 官网 | 计划介绍 | https://4rtni-ftldni.ini.usc.edu/ | 持续可访问 | 协议与参与信息 |
| MNI-FTD 模板 | 二次产出数据 | Scientific Data 2021 | 已发布 | 亚型模板与图谱的引用锚点 |
| DataDictionary 镜像 | 数据字典文件 | https://aramislab.paris.inria.fr/files/data/databases/converters/DataDictionary_NIFD_2017.10.18.xlsx | ARAMIS 托管 | IDA 下架后的权威获取点(坑点 1) |
§9 相关资源与引用
§9.1 官方与社区资源
- LONI IDA 数据申请与下载:https://ida.loni.usc.edu(注册 → NIFD 项目 → 申请审核)
- UCSF 记忆与衰老中心研究页(NIFD,现跳转 ALLFTD):http://memory.ucsf.edu/research/studies/nifd
- 4RTNI-FTLDNI 计划官网:https://4rtni-ftldni.ini.usc.edu/
- Clinica 转换文档(v0.8.1):nifd-to-bids
- Clinica GitHub(Issue #122 为数据字典缺失的权威讨论):github.com/aramis-lab/clinica/issues/122
- DataDictionary 官方镜像:https://aramislab.paris.inria.fr/files/data/databases/converters/DataDictionary_NIFD_2017.10.18.xlsx
- MNI-FTD 模板论文(含基线规模口径):Scientific Data 2021
- ICD-11 6D83 类目(WHO v2026-01 镜像):Find-A-Code ICD-11 6D83
- NCBI MedGen(SNOMED CT/UMLS 编码核验):https://www.ncbi.nlm.nih.gov/medgen/
- FHIR 术语服务器(SNOMED 编码有效性反查):https://tx.fhir.org/r4/CodeSystem/$lookup?system=http://snomed.info/sct&code=192976002
§9.2 BibTeX 引用
@article{dadar2021mni,
title = {MNI-FTD templates, unbiased average templates of frontotemporal dementia variants},
author = {Dadar, Mahsa and Manera, Alix Luca and Fonov, Vladimir S. and Ducharme, Simon and Collins, D. Louis},
journal = {Scientific Data},
year = {2021},
doi = {10.1038/s41597-021-01007-5}
}
@article{staffaroni2019longitudinal,
title = {Longitudinal multimodal imaging and clinical endpoints for frontotemporal dementia clinical trials},
author = {Staffaroni, Adam M. and Ljubenkov, Peter A. and Kornak, John and Cobigo, Yann and Datta, Sapna and Marx, Gil and Walters, Rachel and Chiang, Karen and Olney, Niko and Elahi, Fanny M. and Knopman, David S. and Dickerson, Bradford C. and Boeve, Bradley F. and Gorno-Tempini, Maria Luisa and Spina, Salvatore and Grinberg, Lea T. and Seeley, William W. and Miller, Bruce L. and Kramer, Joel H. and Boxer, Adam L. and Rosen, Howard J.},
journal = {Brain},
year = {2019},
doi = {10.1093/brain/awy319}
}
@article{xue2024ai,
title = {AI-based differential diagnosis of dementia etiologies on multimodal data},
author = {Xue, Christina and Kowshik, Sai S. and Lteif, Diala and Puducheri, Shreya and Jasodanand, Vaneesha H. and Zhou, Olivia T. and Walia, Amanpreet S. and Guney, Osman B. and Zhang, J. D. and others},
journal = {Nature Medicine},
year = {2024},
doi = {10.1038/s41591-024-03118-z}
}
@article{termine2022reproducible,
title = {A Reproducible Deep-Learning-Based Computer-Aided Diagnosis Tool for Frontotemporal Dementia Using MONAI and Clinica Frameworks},
author = {Termine, Andrea and Fabrizio, Carlo and Caltagirone, Carlo and Petrosini, Laura and on behalf of the Frontotemporal Lobar Degeneration Neuroimaging Initiative},
journal = {Life},
volume = {12},
number = {7},
pages = {947},
year = {2022},
doi = {10.3390/life12070947}
}
@article{torso2020dti,
title = {Using diffusion tensor imaging to detect cortical changes in fronto-temporal dementia subtypes},
author = {Torso, Matteo and Bozzali, Marco and Cercignani, Mara and Jenkinson, Mark and Chance, Philip S.},
journal = {Scientific Reports},
volume = {10},
pages = {11237},
year = {2020},
doi = {10.1038/s41598-020-68118-8}
}
@article{tuovinen2024relative,
title = {The relative brain signal variability increases in the behavioral variant of frontotemporal dementia and Alzheimer's disease but not in schizophrenia},
author = {Tuovinen, Timo and H{\"a}kli, Jenna and Rytty, Riina and Kr{\"u}ger, Jan and Korhonen, Vesa and J{\"a}rvel{\"a}, Miika and Helakari, Heli and Kananen, Jussi and Nikkinen, Juha and Veijola, Juha and Remes, Anne M. and Kiviniemi, Vesa and Frontotemporal Lobar Degeneration Neuroimaging Initiative},
journal = {Journal of Cerebral Blood Flow \& Metabolism},
year = {2024},
doi = {10.1177/0271678X241262583}
}
@article{kashyap2025longitudinal,
title = {Longitudinal evaluation of common and unique brain-networks in variants of primary progressive aphasia},
author = {Kashyap, Rajan and Bharath, Rose Dawn and Zhou, Chen and Tsapkini, Kyrana and Desmond, John E. and Chen, Susan H. A. and Udupa, Kaviraja and Sivakumar, Palanivel Thangaraj and Bhattacharjee, Supriya},
journal = {Alzheimer's Research \& Therapy},
year = {2025},
doi = {10.1186/s13195-025-01800-z}
}
@article{routier2021clinica,
title = {Clinica: An open-source software platform for reproducible clinical neuroscience studies},
author = {Routier, Alexandre and Burgos, Ninon and D{\'i}az, Mauricio and Bacci, Marco and Bottani, Samuel and El-Rifai, Oumar and Fontanella, Simone and Gori, Pierre and Guillon, Jacques and Guyot, Antoine and Hassanaly, Rahma and Jacquemont, Th{\'e}o and Lu, Penghao and Marcoux, Alexandre and Moreau, Thomas and Samper-Gonz{\'a}lez, Jorge and Teichmann, Marie and Thibeau-Sutre, Elina and Vaillant, Ghislain and Wen, Jiayi and Wild, Amber and Habert, Marie-Odile and Durrleman, Stanley and Colliot, Olivier},
journal = {Frontiers in Neuroinformatics},
year = {2021},
doi = {10.3389/fninf.2021.689675}
}
@article{crawford2015ida,
title = {The Image and Data Archive at the Laboratory of Neuro Imaging},
author = {Crawford, Karen L. and Neu, Scott C. and Toga, Arthur W.},
journal = {NeuroImage},
volume = {124},
pages = {1080--1083},
year = {2015},
doi = {10.1016/j.neuroimage.2015.04.067}
}
@article{rascovsky2011sensitivity,
title = {Sensitivity of revised diagnostic criteria for the behavioural variant of frontotemporal dementia},
author = {Rascovsky, Katya and Hodges, John R. and Knopman, David and Mendez, Mario F. and Kramer, Joel H. and Neuhaus, John and van Swieten, John C. and others},
journal = {Brain},
volume = {134},
number = {9},
pages = {2456--2477},
year = {2011},
doi = {10.1093/brain/awr079}
}
@article{gornotempini2011classification,
title = {Classification of primary progressive aphasia and its variants},
author = {Gorno-Tempini, Maria Luisa and Hillis, Argye E. and Weintraub, Sandra and Kertesz, Andrew and Mendez, Mario and Cappa, Stefano F. and Ogar, Jennifer M. and Rohrer, Jonathan D. and Black, Sandra and Brambati, Manuela and others},
journal = {Neurology},
volume = {76},
number = {11},
pages = {1006--1014},
year = {2011},
doi = {10.1212/WNL.0b013e31821103e6}
}
§9.3 引用指南
- 使用影像数据:论文中引用 FTLDNI 计划与资助号(R01 AG032306),并致谢 UCSF MAC 与 LONI IDA(官方要求以 IDA 项目页最新致谢格式为准)。
- 使用 BIDS 转换:引用
nifd-to-bids转换器(Routier 2021)与 BIDS 标准(Gorgolewski et al., 2016)。 - 使用 MNI-FTD 模板:引用 Dadar 2021。
- 建议的数据使用声明模板:“Data used in the preparation of this work were obtained from the Frontotemporal Lobar Degeneration Neuroimaging Initiative (FTLDNI/NIFD; NIH R01 AG032306) through the LONI Image & Data Archive.”
- 引用频次参考(Europe PMC,截至 2026-09):本数据集没有单一"数据描述论文"锚点,引用势能分散在应用论文中(Xue 2024 = 110 次、Staffaroni 2019 = 98 次、Torso 2020 = 19 次、Dadar 2021 = 14 次、Termine 2022 = 9 次、Tuovinen 2024 = 7 次、Kashyap 2025 = 1 次)。首次使用时建议同时引用计划资助号与你实际使用的子集口径对应论文。
§10 AI 使用声明卡
§10.1 AI 模型列表
- 大语言模型(内部代号 fast-model)负责本条目的初稿撰写、结构组织与代码示例生成。
§10.2 AI 参与范围
- 参与:全文结构与文字生成、§6 代码示例起草、表格整理、BibTeX 格式化、JSON-LD 序列化。
- 不参与:医学事实判断(全部硬事实经 WebSearch/WebFetch 核实并附来源)、结论性医学表述、最终发布审核。
- 事实核查方式:规模数字、模态参数、基准指标、医学编码均逐条与原始来源(论文摘要/API/官方文档/Issue 原文)比对,未核实的信息一律省略而非填充。
- 已知残余风险:SNOMED CT 细分概念随版本演进,正文只保留经 MedGen/术语服务器验证的编码;IDA 下载界面流程可能随平台改版变化,使用时以最新界面为准。
§10.3 输入来源列表
- Dadar M, et al. MNI-FTD templates, unbiased average templates of frontotemporal dementia variants. Scientific Data, 2021. doi:10.1038/s41597-021-01007-5
- Staffaroni AM, et al. Longitudinal multimodal imaging and clinical endpoints for frontotemporal dementia clinical trials. Brain, 2019. doi:10.1093/brain/awy319
- Xue C, et al. AI-based differential diagnosis of dementia etiologies on multimodal data. Nature Medicine, 2024. doi:10.1038/s41591-024-03118-z
- Termine A, et al. A Reproducible Deep-Learning-Based Computer-Aided Diagnosis Tool for Frontotemporal Dementia Using MONAI and Clinica Frameworks. Life, 2022;12(7):947. doi:10.3390/life12070947
- Torso M, et al. Using diffusion tensor imaging to detect cortical changes in fronto-temporal dementia subtypes. Scientific Reports, 2020;10:11237. doi:10.1038/s41598-020-68118-8
- Tuovinen T, et al. The relative brain signal variability increases in the behavioral variant of frontotemporal dementia and Alzheimer’s disease but not in schizophrenia. JCBFM, 2024. doi:10.1177/0271678X241262583
- Kashyap R, et al. Longitudinal evaluation of common and unique brain-networks in variants of primary progressive aphasia. Alzheimer’s Research & Therapy, 2025. doi:10.1186/s13195-025-01800-z
- Routier A, et al. Clinica: An open-source software platform for reproducible clinical neuroscience studies. Frontiers in Neuroinformatics, 2021. doi:10.3389/fninf.2021.689675
- Crawford KL, Neu SC, Toga AW. The Image and Data Archive at the Laboratory of Neuro Imaging. NeuroImage, 2015;124:1080-1083. doi:10.1016/j.neuroimage.2015.04.067
- Rascovsky K, et al. Sensitivity of revised diagnostic criteria for the behavioural variant of frontotemporal dementia. Brain, 2011;134:2456-2477. doi:10.1093/brain/awr079
- Gorno-Tempini ML, et al. Classification of primary progressive aphasia and its variants. Neurology, 2011;76:1006-1014. doi:10.1212/WNL.0b013e31821103e6
- ARAMIS Lab. nifd-to-bids – Conversion of Neuroimaging in Frontotemporal Dementia (NIFD) to BIDS. Clinica Documentation v0.8.1. https://aramislab.paris.inria.fr/clinica/docs/public/v0.8.1/Converters/NIFD2BIDS
- aramis-lab/clinica. Issue #122: A required clinical file of NIFD_to_BIDS converter doesn’t exist! 2020. https://github.com/aramis-lab/clinica/issues/122
- LONI Image & Data Archive (USC). https://ida.loni.usc.edu
- WHO ICD-11 6D83 Frontotemporal dementia (v2026-01,经 Find-A-Code 镜像核实). https://www.findacode.com/icd-11/code-831337417.html
- NCBI MedGen(PSP SNOMED CT 192976002 与各 CUI 的核验来源). https://www.ncbi.nlm.nih.gov/medgen/
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED/UMLS 映射、流行病学) | 千方病案医学编辑部 | 与 WHO ICD-11 镜像、NCBI MedGen、tx.fhir.org 逐码比对 | ✅ 已通过 |
| §3/§4 数据规格与字段字典 | 千方病案医学编辑部 | 与 Clinica 官方文档、LONI IDA 发布文件逐项核对 | ✅ 已通过 |
| §6 预处理代码与坑点 | 医疗 AI 数据工程师 | 对照 Clinica 文档与 Issue #122/#147 复核命令与依赖 | ✅ 已通过 |
| §8 基准数字 | 千方病案医学编辑部 | 与 Europe PMC 摘要原文核对(Termine 0.80/0.86;Xue 0.96) | ✅ 已通过 |
| §5/§6 划分与泄漏策略 | 医疗 AI 数据工程师 | 对照 Termine 2022 划分描述与 4RTNI 共享对照的官方声明复核 | ✅ 已通过 |
| §0/§10 合规声明 | 千方病案医学编辑部 | 与 IDA 申请流程官方描述比对 | ✅ 已通过 |
§10.5 AI 生成章节标注
- 全文初稿由 AI 生成;§2 医学背景、§6.5 坑点、§7.7 DAIMS 评分与 §8 基准数字经人工逐条复核修订。
§10.6 最后人工审核日期
- 2026-09-05(与 §0 审核声明一致)
- 审核范围覆盖全部章节;下次复审触发条件:IDA 数据版本变更、Clinica 转换器破坏性更新、或 FTD 诊断标准/编码体系修订。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- oasis — 共享标签:医学影像 / MRI / PET / 队列研究
- rosmap — 共享标签:医学影像 / 电子健康记录 / 神经退行性疾病 / 队列研究
- copdgene — 共享标签:医学影像 / 电子健康记录 / 队列研究
- oai — 共享标签:医学影像 / 电子健康记录 / 队列研究
- chest-imagenome — 共享标签:医学影像 / 电子健康记录 / 队列研究
- hrs — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究
- tcia — 共享标签:医学影像 / MRI / PET
- idc — 共享标签:医学影像 / MRI / PET
- nacc — 共享标签:电子健康记录 / 神经退行性疾病 / 队列研究
- chest-ct-sepsis-er — 共享标签:医学影像 / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

