信息速览

Cam-CAN — 跨寿命多模态脑影像队列 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | Cam-CAN(CamCAN) |
| 英文全称 | Cambridge Centre for Ageing and Neuroscience |
| 别名/简称 | CC700(Phase 2 主队列);CC280(Phase 3 复扫队列);CCFrail(Phase 2 Arm 2 增补队列);CC3000(Phase 1 家访队列) |
| 疾病分类(ICD-11) | 健康人群队列,无单一疾病纳入编码;研究背景关联 ICD-11 QE40(衰老)与 8A00(阿尔茨海默病,对照方向) |
| SNOMED CT | 26929004(阿尔茨海默病,对照方向);273247007(简易精神状态检查 MMSE,认知筛查观测) |
| 数据模态 | 结构 MRI(T1/T2)、功能 MRI(静息/电影/感觉运动)、DWI、MTI、306 通道 MEG、认知行为测验、心血管生理测量 |
| AI 任务类型 | 脑龄回归、认知能力预测、多模态融合、功能连接估计、寿命神经建模、影像方法学基准 |
| 样本总数 | 影像主队列约 700 名(原始 T1 653 名);家访队列约 2,700 名;复扫队列约 280 名 |
| 数据大小 | 按模态拆分为多个 BIDS 仓库分发,官方未公开单一总量(单次静息 BOLD 体积约 37 MB) |
| 数据格式 | NIfTI(BIDS)、FIF(MEG)、TSV/TXT(行为学与生理数据) |
| 许可证 | Cam-CAN Data Use Agreement(在线签署后免费获取,限非商业伦理研究) |
| 访问级别 | 申请审核(在线 DUA + 官方逐案审批,经 SSH/SFTP 下载) |
| DUO 标签 | GRU(对应其协议条款:通用研究使用、非商业、须开放发表论文;官方未发布 DUO 机读标注) |
| 语言 | 英语 |
| 首发日期 | 2016-11 |
| 最后更新 | 2026-02(新门户 opendata.mrc-cbu.cam.ac.uk 上线并新增 Phase 3 与 Arm 2 数据) |
| 发布机构 | 剑桥大学 Cam-CAN 项目(MRC 认知与脑科学单元,MRC CBU) |
| 官方主页 | cam-can.mrc-cbu.cam.ac.uk |
| 下载地址 | camcan-archive.mrc-cbu.cam.ac.uk/dataaccess |
| DOI | 10.1016/j.neuroimage.2015.09.018(数据仓库论文) |
| 引用次数 | 820+(Google Scholar,截至 2026-09,Taylor et al. 2017) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— BIDS 标准化、采集参数齐全且预处理管线有论文级文档,但无官方任务划分与一键训练脚本,需自行设计年龄分层交叉验证 |
| 页面状态 | published |
§0 E-E-A-T 审核与可信度声明
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、认知老化流行病学)、§7 偏倚分析(幸存者偏倚、测量偏倚与公平性)。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。Cam-CAN 要求用户在线签署 Data Use Agreement 并经官方审批后获取数据(学生须由导师代为申请)。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? Cam-CAN(Cambridge Centre for Ageing and Neuroscience,剑桥老龄神经科学中心)是英国剑桥大学从 2010 年 10 月启动的大型人群队列。它先对剑桥地区约 2,700 名 18-90 岁居民做 2 小时家访,再从中选出约 700 人(每个十年年龄段约 100 人,18-88 岁),每人完成约 1 小时 3T MRI、半小时脑磁图(MEG)与合计约 7 小时的认知测验,其中约 280 人还在 1-3 年后复扫(见 官方数据门户)。
为什么重要? 绝大多数脑影像数据集只覆盖窄年龄带(如 HCP 青年组 22-37 岁),而大脑老化是横贯整个成年生命的连续过程。Cam-CAN 是少数把「同一套扫描协议 + 同一套认知测验」均匀铺满 18-88 岁、且同时拥有 MRI 与 MEG 两种模态的开放队列,因此成为脑龄预测与寿命神经科学的公认基准(Taylor et al., 2017, NeuroImage,DOI)。
我能用它做什么? 典型任务包括:用 T1 形态学或 MEG 信号做脑龄回归、建立认知能力(流体智力、记忆、语言等五域)与脑结构/功能的跨寿命关联模型、评测 fMRI/MEG 预处理新方法、做 MRI-MEG 多模态融合。数据免费,但需在线签署数据使用协议并通过逐案审批(见 §6.2)。
§1.1 摘要
Cam-CAN 采用三阶段漏斗式设计:Phase 1(2010-2012)经 GP 初级保健名册招募约 2,700 名社区成人,完成人口学、健康、生活方式与基础认知的家访;Phase 2 Arm 1(2011-2013,即 CC700)从家访人群抽取每十年年龄段约 100 名、共约 700 名受试者,在 MRC CBU 完成两到访,采集 T1/T2/DWI/MTI 结构像、静息+电影观看+感觉运动三种 fMRI、静息+感觉运动+被动感觉三种 MEG,以及覆盖注意、情绪、动作、语言、记忆五域的认知实验与生理测量;Phase 2 Arm 2(2015-2017,CCFrail)增补约 80 人(半数为 MMSE/ACER 低分者);Phase 3(2012-2014,CC280)对约 280 名 Arm 1 受试者用更复杂任务复扫。影像数据按 BIDS 标准拆分为按模态独立的多仓库发布(2016-11 首发原始数据,2019-03 全面 BIDS 化,2025-12 新门户纳入 Phase 3 与 Arm 2)。所有规模与流程数字见 Shafto et al., 2014, BMC Neurology 与 Taylor et al., 2017, NeuroImage。
§1.2 战略价值
维度一:寿命神经科学的方法学基础设施。 Cam-CAN 的核心设计优势是「年龄均匀 + 人群代表性」:以 GP 名册为抽样框架(邀请约 9,000 户、含退出机制),使样本相对接近英国人口普查结构,而非典型的便利样本。这让它成为分离「正常老化效应」与「疾病效应」的参照谱——例如 Tsvetanov 等(2015)正是用它联合 fMRI 与 MEG 证明血管反应随年龄独立于神经活动变化,为 fMRI 老化研究提供了必须校正的混杂(见 Taylor et al., 2017 及其引用工作)。
维度二:多模态 AI 基准。 对机器学习社区而言,Cam-CAN 同时提供约 646-653 名受试者的 MEG 与 MRI,且年龄跨 70 年,是罕见的「跨寿命 + 多模态」测试床。Engemann 等(2022)将其作为 M/EEG 脑龄预测可复用基准的核心队列(filterbank-riemann 管线 MAE 7.30 年);Pinamonti 等(2025)用它训练 25 种模型并向 HCP-Aging 外推,系统量化了跨站点和谐化的收益。这两个基准的完整数字见 §8.1。
维度三:认知表型深度。 多数开放影像队列的认知评估止于简短筛查,Cam-CAN 则在 Phase 2 投入约 7 小时计算机化与桌面测验,衍生出覆盖注意、情绪、动作、语言、记忆五域的分数体系,并与约 2,700 人的家访生活方式数据贯通。这使「脑影像 → 认知能力」的映射研究拥有足够的因变量分辨率,也支持把影像特征嵌入流行病学协变量网络(血压、睡眠、体力活动等)做联合建模。对以「认知衰退早期标志」为目标的医疗 AI 团队,这套深度表型是同规模数据集中最完整的。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 年龄带 | 模态 | 标注/衍生 | 与 Cam-CAN 的差异化 |
|---|---|---|---|---|---|
| Cam-CAN | 影像约 700 名;家访约 2,700 名 | 18-88 岁均匀覆盖 | 结构/功能 MRI、DWI、MTI、MEG、认知五域、生理 | 年龄、认知衍生分数、生理测量 | 唯一「均匀寿命 + MRI/MEG 双模态 + 深度认知表型」的开放队列 |
| UK Biobank | 基线约 50 万名,影像子集约 10 万名(目标) | 40-69 岁 | 结构/功能 MRI、DWI、心率节律 | 海量生活方式与结局随访 | 样本量碾压但无 MEG、年龄带窄、影像协议不同 |
| HCP-YA(S1200) | 1,113 名 | 22-37 岁 | 高精度 MRI(含 MEG 子研究于后续计划) | 行为个体差异全套 | 青年专属,不适合老化建模 |
| IXI | 567 名 | 19-86 岁 | 结构 MRI(T1/T2/PD) | 基本人口学 | 常作脑龄外部验证集(见 §7.8),无 fMRI/MEG 深表型 |
| ABCD | 约 11,800 名 | 9-10 岁儿童 | MRI + 认知 + 随访 | 纵向成长轨迹 | 覆盖寿命另一端,与 Cam-CAN 互补 |
| NKI-Rockland | 约 1,000 名 | 4-85 岁 | MRI(部分 MEG/EEG 子集) | 复访纵向 | 复访设计;但年龄分布不均匀、MEG 覆盖远小于 Cam-CAN |
对比说明:各数据集规模与年龄带为公开文献常用口径,具体以各自官方文档为准;性能数字不可直接跨数据集比较(采集协议与预处理不同)。
§1.4 版本时间轴
| 版本/里程碑 | 时间 | 关键变化 |
|---|---|---|
| 项目启动 | 2010-10 | 剑桥大学立项,BBSRC BB/H008217/1 资助(Aalto DataHub 转述官方简介) |
| Phase 1 家访 | 2010-2012 | 约 2,700 名成人 2 小时家访 |
| 原始数据首发 | 2016-11 | 约 650 名 Phase 2 原始 MRI(NIfTI/伪 BIDS)+ MEG(FIF)+ 行为数据开放(MRC CBU 公告) |
| BIDS 标准化重发 | 2019-03-29 | dcm2bids/FieldTrip 转换;修正 fMRI TR 头错误;剔除 QC 不合格受试者(Historical Issues 页) |
| 新门户扩容 | 2025-12 | opendata.mrc-cbu.cam.ac.uk 上线:新增 Phase 3(CC280)与 Arm 2(CCFrail);补 MEG-MRI fiducials(News 页) |
| Phase 4/5 | 计划 2027 | 复测认知、生活方式与影像(官方门户) |
§1.5 典型应用场景
- 脑龄预测(Brain Age Gap):T1 形态学 + SVR/XGBoost 内部 MAE 可达约 5.9 年;MEG 信号约 7.3 年(§8.1)。
- 寿命认知建模:以流体智力、记忆等衍生分数为因变量,拟合灰质体积、白质微结构与功能连接的年龄路径(Kievit et al., 2014, Nature Communications;Henson et al., 2016, Scientific Reports)。
- fMRI/MEG 预处理方法评测:均匀年龄覆盖使其成为检验「某方法是否特异性改善老年数据质量」的理想测试床。
- 血管-神经解耦研究:静息 fMRI + 静息 MEG 联合建模,校正神经血管耦合的年龄混杂(Tsvetanov et al., 2015, Human Brain Mapping)。
- 多模态融合原型:同一受试者的 MRI 空间骨架 + MEG 时间动力学,支持结构-功能耦合的深度学习融合研究。
- 心血管-脑健康研究:血压、体重等生理变量与白质微结构(DWI/MTI)的关联建模,为血管性认知风险提供影像生物标志候选。
- 教学与方法课教材:BIDS 规范、伪 BIDS→BIDS 迁移史与公开问题台账使其成为「队列数据治理」教学的活案例。
§2 医学背景
§2.1 ICD-11 与 SNOMED CT 编码映射
Cam-CAN 是健康人群队列:受试者经筛查排除重大神经/精神疾病,本身不携带「疾病标签」。下表给出其研究与建模场景中最常关联的编码(对照/排除方向)。
| 标签/概念 | ICD-11 编码 | SNOMED CT | 术语说明 |
|---|---|---|---|
| 健康认知老化(队列主表型) | 无疾病编码;衰老相关背景归入 QE40(衰老,第 21 章症状类目) | 无单一概念;以量表观测表达(如 MMSE) | 队列以健康成人为基线,老化为连续表型而非疾病 |
| 阿尔茨海默病(对照方向) | 8A00(阿尔茨海默病) | 26929004 | Arm 2 半数受试者因 MMSE/ACER 低分入选,为痴呆前驱研究提供过渡样本 |
| 认知筛查 | 无 | 273247007 | MMSE 于 Phase 1 家访与认知评估中施测 |
| 脑影像采集 | 无 | 77477000 | MRI 检查操作概念 |
| 血压测量(心血管风险轴) | 无 | 75367002 | 血压为队列核心生理协变量(UA-774 连测 3 次) |
§2.1b SNOMED CT 映射补充说明
上述编码仅覆盖「研究关联概念」。Cam-CAN 不发布疾病诊断字段;若需把队列用作痴呆研究的对照谱,应以 MMSE/ACER 分数自建切点,并引用 Shafto et al. (2014) 的排除标准原文。禁止把队列样本直接当作「健康对照诊断标签」用于临床声称。
§2.2 疾病背景与流行病学
Cam-CAN 的科学问题是健康认知老化:为何有人到 80 多岁仍保持流体智力,而有人在 60 岁即出现下滑?全球人口老龄化使该问题具有公共卫生紧迫性——英国及多数高收入国家 65 岁以上人口占比持续上升,年龄相关认知下降与痴呆是失能的主要驱动之一。痴呆领域最大宗的阿尔茨海默病(ICD-11 8A00)在出现临床症状前有数十年的脑结构/功能改变窗口(淀粉样蛋白沉积、灰质萎缩、血管负担累积),因此「正常老化参照谱」是识别异常轨迹的前提。Cam-CAN 用人群代表性样本刻画这一参照谱:从 18 岁起均匀覆盖,使年龄效应可与发育-老化连续体分离,并以 MMSE/ACER 等工具在群体层面监测认知健康边界(Shafto et al., 2014)。
认知表型按五大域组织,各域的核心观测如下(任务全表见协议论文):
| 认知域 | 代表性任务/量表 | 产出 | 与脑影像的典型联动 |
|---|---|---|---|
| 注意 | 注意任务族(含反应时类测验) | 准确率/反应时衍生分 | 与额顶网络功能连接关联 |
| 情绪 | 情绪记忆与情绪识别测验 | 情绪增强效应 d’ | 杏仁核-海马结构与功能指标 |
| 动作 | 感觉运动任务、动作适应类测验 | 运动学习/适应参数 | 基底节与运动皮层形态学 |
| 语言 | 词汇与语义处理任务 | 语义/词汇分数 | 左侧语言网络年龄重塑 |
| 记忆 | WMS-III UK、情景记忆实验 | 记忆合成分 | 海马体积与 MEG 频谱功率 |
| 流体智力(横切) | Cattell 文化公平量表 2A(四子测验 PCA 合成) | 合成 IQ 分 | 全脑灰质与白质微结构 |
§2.3 临床任务定义
| 任务 | 输入 | 输出 | 在 Cam-CAN 上的形态 |
|---|---|---|---|
| 筛查(认知健康监测) | 认知测验分数、人口学 | 认知健康/低分风险分层 | 家访 MMSE + ACER;Arm 2 以低分入组 |
| 诊断支持(对照谱构建) | 脑影像 + 认知 | 正常老化范围界定 | 均匀年龄分布提供分年龄段的影像-认知正常范围 |
| 分级(老化严重度量化) | T1/DTI/MEG 特征 | 脑龄(连续) | 脑龄回归是 Cam-CAN 上最主流 AI 任务(§8) |
| 预后(风险轨迹) | 基线影像/认知 + Phase 3-5 复访 | 认知下滑预测 | Phase 3 已开放,Phase 4/5 于 2027 年发布后可做纵向预测 |
§2.4 患者人群画像
| 维度 | 描述 |
|---|---|
| 来源 | 剑桥地区 GP 初级保健名册(邀请约 9,000 户,社区招募,非临床转诊) |
| 时间窗 | Phase 1:2010-2012;Phase 2 Arm 1:2011-2013;Phase 3:2012-2014;Arm 2:2015-2017 |
| 年龄 | 家访 18-90 岁;影像主队列 18-88 岁(Taylor 2017 论文口径 18-87 岁,实测含 18.5-88.9 岁,见 Engemann et al., 2022) |
| 性别 | 设计上男女均衡;Cole et al. (2018) 使用 648 名子集为男/女 324/324 |
| 种族/族群 | 官方未系统公开分布;样本限于剑桥地区,族群多样性有限(§7.5) |
| 就医类型 | 社区人群(GP 名册),经健康筛查排除重大神经/精神疾病史 |
§2.5 临床价值
对临床 AI 而言,Cam-CAN 的价值不在直接诊断,而在三点:其一,提供分年龄正常范围——任何「老年脑影像异常检测」模型都需要同龄参照,Cam-CAN 是英文文献中引用最多的参照谱之一;其二,提供老化混杂的量化先验(如血管反应随年龄变化),帮助校正临床 fMRI 研究的年龄效应;其三,Arm 2 纳入认知低分者、Phase 3-5 提供纵向数据,使「正常老化 → 认知障碍过渡」的模型可在同一队列内孕育。随着 2027 年 Phase 4/5 发布,其临床预后建模价值将进一步显现。
对卫生政策与流行病学分析者,家访队列(约 2,700 人)与影像子集的嵌套结构支持「生活方式暴露 → 脑健康结局」的两阶段设计:先在大样本上建立暴露-认知关联,再在影像子集上定位中介脑机制——这一设计在心血管风险与白质完整性的研究中已有先例(Fuhrmann et al., 2019, Neurobiology of Aging,见 Taylor 2017 引文网络)。
§2.6 金标准与参考真值
| 要素 | 内容 |
|---|---|
| 参考真值类型 | 实际年龄(由出生日期精确计算,误差为零);认知测验衍生分数(标准化测验计分);生理测量(血压 3 次取值、身高体重) |
| 标注方式 | 年龄为登记事实;认知分数来自标准化任务(Cattell 文化公平量表 2A、WMS-III UK、ACE-R、MMSE 等)由受试者表现直接计分 |
| 标注者 | 结构化施测:训练有素的访问员与心理测量师;影像无人工诊断标注,QC 由管线自动 + 人工核查完成 |
| 性质 | 年龄标签为客观事实(非金标准「诊断」);认知分数具备心理测量学信度;适合回归/协变量建模而非诊断分类 |
§3 数据集规格
§3.0 版本抉择矩阵
Cam-CAN 按「Phase × 模态」拆分成多个仓库,先选对子集再下载(官方明确拒绝「全都要」式申请,见 §6.2)。
| 你的需求 | 推荐版本/子集 | 体量级别 | 理由 |
|---|---|---|---|
| 快速跑通脑龄回归 | Phase 2 Arm 1 原始 T1(CC700,653 名) | 单模态 BIDS 仓库 | 样本最全、年龄均匀、文献可对标(Cole 2018;Pinamonti 2025) |
| M/EEG 深度学习基准 | CC700 原始 MEG(静息 647 名) | 单模态 BIDS 仓库 | 与 Engemann et al. (2022) 基准同款数据口径 |
| 纵向变化研究 | Phase 3 CC280(约 280 名复扫) | 邮件申请 | 同人 1-3 年复测(官方需邮件单独申请) |
| 认知-生活方式流行病学 | Phase 1 家访数据(约 2,700 名) | 文本/表格 | 样本最大、变量最广(含 EPAQ 问卷与衍生分) |
| 痴呆前驱/低认知研究 | Phase 2 Arm 2 CCFrail(约 80 名) | 邮件/门户 | 含 MMSE/ACER 低分半组,补齐认知衰退端 |
| 多模态融合原型 | CC700 MRI + MEG + 认知三仓库联用 | 多仓库 | 同人跨模态对齐(注意 §4.5 的模态间 N 差异) |
§3.1 模态详情
MRI(3T Siemens TIM Trio,32 通道头线圈)(官方参数页):
- T1:3D MPRAGE,TR=2250 ms,TE=2.99 ms,TI=900 ms,FA=9°,FOV 256×240×192 mm,1 mm 各向同性,GRAPPA=2,TA=4 分 32 秒。
- T2:3D SPACE,TR=2800 ms,TE=408 ms,TI=900 ms,1 mm 各向同性。
- DWI:弥散加权成像(方向数与 b 值见 BIDS sidecar),含 bval/bvec。
- MTI:磁化传递成像,用于计算 MTR 图。
- fMRI 三 run:静息(TR=1970 ms,TE=30 ms,FA=78°,32 层,FOV 192 mm,261 个体积,时长 8 分 40 秒);电影观看(TR=2470 ms);感觉运动任务(视听线索按键)。
MEG(Elekta/Neuromag VectorView,306 通道 = 102 磁力计 + 204 平面梯度计)(bioRxiv 2024.07.15.602693 转述官方协议):
- 三 run:静息闭眼、感觉运动任务(与 fMRI 同款)、被动感觉任务(视觉/听觉分开刺激)。
- 采样率 1 kHz,0.03 Hz 高通;时长 8 分 40 秒;4 个 HPI 线圈连续追踪头位;同步 ECG/EOG。
- 官方预处理版本使用 MaxFilter 2.2(tSSS,10 秒窗,0.98 相关限)。
认知行为测验(约 7 小时,Phase 2):覆盖注意、情绪、动作、语言、记忆五域,含 Cattell 流体智力、WMS-III UK 记忆、ACE-R/MMSE 筛查与多项自然性桌面任务(Taylor et al., 2017)。
生理测量:A&D UA-774 血压计连测 3 次、便携测距仪身高、电子秤体重、唾液样本留存备基因分析。
§3.2 按子集样本数
Phase 2 Arm 1(CC700)原始数据每模态可用人数(官方数据政策页):
| 模态/序列 | 原始 N |
|---|---|
| T1 结构像 | 653 |
| T2 结构像 | 653 |
| DWI | 642 |
| MTI | 623 |
| 静息 fMRI | 652 |
| 电影 fMRI | 649 |
| 感觉运动 fMRI | 651 |
| 静息 MEG | 647 |
| 感觉运动 MEG | 647 |
| 被动感觉 MEG | 639 |
其他子集:Phase 1 家访约 2,700 名;Phase 3 CC280 约 280 名;Phase 2 Arm 2 约 80 名。
§3.3 数据格式
| 数据 | 格式 | 说明 |
|---|---|---|
| MRI | NIfTI + JSON sidecar(BIDS) | 2019-03 起严格 BIDS;不提供 DICOM |
| DWI | NIfTI + bval/bvec(BIDS) | 24 名 QC 不合格者已剔除 |
| MEG | FIF(BIDS meg 扩展) | 原始 run 与官方 MaxFilter 产物并存(注意 坑点 4) |
| 行为学/认知 | TXT(ASCII 自由表格)、TSV | 变量清单随申请提供可检索列表 |
| participants 元数据 | participants.tsv(BIDS) | 含 participant_id、年龄、性别、coil-type 等 |
§3.4 存储大小
官方按模态拆分仓库分发(影像体量过大无法单仓库分享),未公开各仓库精确总量。参考量级:单个静息 BOLD 体积约 37 MB(261 个体积,Neurostars 用户实测),单受试者全模态影像在 GB 级。规划磁盘时建议按「所需模态 × 653 名 × GB 级/人」估算并预留 2 倍冗余。
§3.5 标注方式
- 年龄:登记事实型标签(出生日期推导),无标注误差。
- 认知衍生分数:标准化任务表现自动计分 + 官方衍生指标(如 Cattell 四子测验主成分合成流体智力分数,Sci Rep 2022 应用实例)。
- 影像质量控制:管线自动 QC + 人工核查(DWI 剔除 24 人名单公开于 Historical Issues 页)。
- 无影像诊断标注:队列不含病灶分割、疾病分期等医学标注。
§3.6 标注者资质与一致性
认知测验由 MRC CBU 训练的访问员与心理测量师按统一协议施测;血压连测 3 次以保证信度;影像由 CBU 放射技师与 MEG 操作员采集。队列未发布认知测验的评分者间一致性系数(任务多为计算机自动计分,人为主观评分占比低)。
§3.7 采集周期
| 阶段 | 时间窗 | 节奏说明 |
|---|---|---|
| Phase 1 家访 | 2010-2012 | 2 小时上门访谈,覆盖人口学/健康/生活方式/基础认知 |
| Phase 2 Arm 1(CC700) | 2011-2013 | 2 次到访 MRC CBU:认知+影像+生理 |
| Phase 3(CC280) | 2012-2014 | Arm 1 受试者 1-3 年后复扫,3 次到访,更复杂任务 |
| Phase 2 Arm 2(CCFrail) | 2015-2017 | 增补约 80 人(半数为 MMSE/ACER 低分者) |
| Phase 4 | 计划 2027 发布 | 复测认知与生活方式 |
| Phase 5 | 计划 2027 发布 | 复测认知、生活方式与神经影像 |
单一站点、约 7 年的连续采集使「采集年份」本身成为可用协变量(与 coil-type 批次联动,见 坑点 6)。
§3.8 地域覆盖
英国剑桥郡及周边(单一采集站点:MRC CBU 的 3T MRI 与屏蔽室 MEG)。单站点设计消除了站点间差异,但限制了族群与地域多样性(§7.1)。
§3.9 设备规格
| 设备 | 规格 | 备注 |
|---|---|---|
| MRI | Siemens TIM Trio 3T,32 通道头线圈 | 2011-10 前 97 名使用原梯度线圈,其后更换(B0 频率与匀场配置不同;coil-type 二值变量已入表,见 坑点 6) |
| MEG | Elekta VectorView 306 通道(102 磁力计 + 204 梯度计),磁屏蔽室 | 1 kHz 采样,4 HPI 线圈,同步 ECG/EOG |
| 血压计 | A&D Medical UA-774 数字血压计 | 每人连测 3 次 |
| 身高体重 | 便携测距仪 + 电子秤 | 标准化施测 |
§3.10 深度溯源链
| 环节 | 主体 | 可核查证据 |
|---|---|---|
| 资助 | BBSRC(BB/H008217/1)、MRC CBU、EU Horizon 2020 LifeBrain | DUA 强制致谢语、论文致谢节 |
| 立项与设计 | 剑桥大学 Cam-CAN 项目组(Tyler、Henson、Brayne、Matthews 等) | Shafto et al., 2014 协议论文 |
| 采集 | MRC CBU 设施(3T MRI + 306 通道 MEG + 认知实验室) | 官方参数页、Taylor et al., 2017 |
| 治理与审批 | Cambridgeshire 2 伦理委员会(现 East of England-Cambridge Central) | 论文伦理声明、DUA 条款 |
| 发布 | camcan-archive 存档门户 → opendata 新门户(2025-12 起) | 门户数据集清单(14 个子数据集) |
| 使用 | 签署 DUA 的学术研究者(1,000+ 名,截至 2022-01) | 数据使用协议、强制致谢要求 |
每一级均有公开记录可回溯:协议论文(Shafto 2014)、仓库论文(Taylor 2017)、历史问题台账(Historical Issues 页)与新闻页(News 页)构成完整证据链。
§4 数据结构
§4.0 目录树
以下为 Phase 2 Arm 1 MRI 仓库(BIDS)解压后的典型结构(文件名为示意,以实际下载为准):
camcan-mri-bids/
├── dataset_description.json # BIDS 数据集描述(Name、BIDSVersion 等)
├── participants.tsv # 受试者级元数据:participant_id/age/sex/coil-type
├── participants.json # 列说明
├── sub-CC110045/
│ ├── anat/
│ │ ├── sub-CC110045_T1w.nii.gz
│ │ ├── sub-CC110045_T1w.json # TR/TE/TI/FOV 等采集参数
│ │ ├── sub-CC110045_T2w.nii.gz
│ │ └── sub-CC110045_T2w.json
│ ├── fmap/
│ │ ├── sub-CC110045_fmap.nii.gz # 相位差图
│ │ ├── sub-CC110045_run-01_fmap.nii.gz # 短 TE 幅度图
│ │ └── sub-CC110045_run-02_fmap.nii.gz # 长 TE 幅度图
│ └── func/
│ ├── sub-CC110045_task-Rest_bold.nii.gz
│ ├── sub-CC110045_task-Rest_bold.json # RepetitionTime=1.97(以此为准,见坑点 1)
│ ├── sub-CC110045_task-Movie_bold.nii.gz
│ └── sub-CC110045_task-SMT_bold.nii.gz
├── sub-CC110046/
│ └── ...
└── sub-CC723395/
└── ...
MEG 仓库结构同构(sub-CC*/meg/sub-CC*_task-rest_meg.fif + sidecar JSON);行为学数据为独立 TXT 表(含 homeint_、epaq_、additional_ 三类前缀变量)。
§4.1 DAIMS 字段字典
核心字段 8 列视图(观测误差与信息性缺失编码基于 §7.1 与 Historical Issues):
| 字段 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| participant_id | Text | 匿名受试者 ID | sub-CC110045 | 主键/分组 CV | 无 | 无(人人有值) | sub-CC + 6 位数字 |
| age | Integer/Float | 采集时实足年龄 | 54 | 回归目标/分层变量 | 零(出生日期推导) | 无 | 18-88 |
| sex | Text | 生物学性别 | f / m | 分层/公平性分析 | 自报 | 无 | f, m |
| coil-type(tabular 附件) | Binary | MRI 梯度线圈批次(2011-10 前/后) | 0 / 1 | 批次协变量/分组 CV | 无 | 无 | 0, 1 |
| RepetitionTime(fMRI JSON) | Float | 静息 BOLD 重复时间 | 1.97 | 预处理参数 | 头文件曾错标 1 s(坑点 1) | 无 | 约 1.97-2.47 s |
| T1w 体积 | ImageObject | 1 mm 各向同性结构像 | 256×240×192 | 形态学/分割输入 | 运动与噪声伪影 | 整人缺失=未采或 QC 剔除 | 653 名有值 |
| SamplingFrequency(MEG JSON) | Float | MEG 采样率 | 1000 | 频域分析参数 | 无 | 无 | 1000 Hz |
| 认知衍生分数(fluid intelligence 等) | Float | 标准化任务计分/合成 | 4.2(合成分) | 认知预测目标 | 测量误差(心理测量学) | 空缺=未完成该任务 | 视具体量表 |
| 血压(SBP/DBP) | Integer | UA-774 连测 3 次 | 128 / 76 | 心血管风险协变量 | 3 次取值可算变异性 | 空缺=未测 | 生理范围 |
| MMSE | Integer | 认知筛查总分 | 29 | 健康边界/Arm 2 分组 | 天花板效应(健康样本) | 空缺=家访未含 | 0-30 |
| DWI bval/bvec | Text/List | 弥散梯度表 | b=1000, 61 方向 | 白质微结构(FA/MD) | 运动致梯度错配 | 整人缺失=QC 剔除 | 642 名有值 |
| MTR 图 | ImageObject | 磁化传递率 | 0.4(无量纲) | 髓鞘相关组织对比 | MTI 样本最少(623 名) | 整人缺失=未采 | 623 名有值 |
| ECG/EOG 通道 | Signal | MEG 同步生理通道 | 1 kHz 连续 | 心跳/眼动伪影检测 | 通道质量个体差异 | 空缺=未记录 | 随 MEG run |
§4.2 标签分布
年龄分布:设计目标为每十年段(18-28、28-38…78-88)约 100 名,男女均衡,实际达成约 646-653 名有效影像样本(各模态 623-653 不等)。Engemann et al. (2022) 实测其 646 名 MEG 子样本:18.5-88.9 岁,均值 54.9 ± 18.4(女 54.5 / 男 55.4),年龄直方图近似矩形——这与绝大多数「中年偏多」的影像队列截然不同,是分层 CV 设计的天然沃土。认知分数:健康样本的 MMSE 呈天花板聚集(多数 28-30),流体智力随年龄呈倒 U 形,建模时应按 §6.6 处理年龄混淆。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 影像主队列设计规模 | 约 700 名(每十年段约 100 名) | 官方门户 |
| T1 可用数 | 653 | 数据政策页 |
| 静息 fMRI | 652 名,261 个体积,8 分 40 秒 | 官方参数页 及 Sci Rep 2022 |
| MEG 静息 | 647 名(Engemann 子样本 646 名:18.5-88.9 岁,54.9±18.4) | Engemann et al., 2022 |
| T1 脑龄研究常用子集 | 648 名(男/女 324/324,54.28±18.56) | Cole et al., 2018 |
| 认知测验总时长 | 约 7 小时 | Henson 2023 课程材料 |
| 全库被申请量 | 1,000+ 名研究者(截至 2022-01);下载 2,000+ 次、发文 100+ 篇(截至 2023-09) | 同上 |
| 复扫队列 | 约 280 名(Phase 3,间隔 1-3 年) | 官方门户 |
| 增补队列 | 约 80 名(Arm 2,半数 MMSE/ACER 低分) | 同上 |
| MEG 采集 | 306 通道(102 磁力计 + 204 梯度计),1 kHz,闭眼静息 8 分 40 秒 | bioRxiv 2024.07.15.602693 |
§4.4 数据层级
项目(CamCAN)
└── Phase(1 家访 / 2 Arm 1 / 2 Arm 2 / 3 / 4 / 5)
└── 受试者(sub-CC*,Phase 2/3 之间同人跨仓库出现)
└── 到访/会话(家访、影像到访 1、影像到访 2、复扫到访)
└── 序列/run(T1、T2、DWI、MTI、task-Rest、task-Movie、task-SMT、MEG 各 run)
└── 数据单元(BOLD 体积、MEG 试次/时间片、测验条目)
关键点:Phase 2 与 Phase 3 仓库中同一自然人以同一 participant_id 出现两次扫描——合并分析时必须以 ID 为组做分组划分(见 坑点 2)。
一个受试者的跨 Phase 数据旅程示例:
| 层级 | Phase 2(CC700) | Phase 3(CC280) |
|---|---|---|
| 受试者 | sub-CC110045 | sub-CC110045(同一人) |
| 会话 | 影像到访 1/2(2012) | 复扫到访 1-3(2013-2014) |
| 序列 | T1/T2/DWI/MTI + 3×fMRI + 3×MEG | 复扫 MRI + MEG(复杂任务版) |
| 数据单元 | 261 体积 BOLD、1 kHz MEG 片段、测验条目 | 同构 |
跨 Phase 重建「同人双记录」时,除了分组划分,还应把两次扫描的间隔(1-3 年)作为协变量考虑——复扫间隔与年龄的交互可能携带老化速率信息。
§4.5 缺失值与信息性缺失
| 缺失类型 | 表现 | 机制 | 建议 |
|---|---|---|---|
| 模态间 N 差异 | T1 653 vs DWI 642 vs MTI 623 vs MEG 647 | QC 剔除(如 DWI 24 人名单公开)或采集失败 | 多模态分析前按 ID 求交集,勿假设各模态人数一致 |
| 任务级缺失 | 部分受试者缺某个 fMRI/MEG run | 采集故障(如 fMRI SMT 剔除 CC610462、CC220519) | 逐 run 检查存在性,缺 run 属随机缺失可丢弃 |
| 行为学空缺 | 认知表内空缺 | 任务未完成/不适用 | 缺失模式与年龄相关(老年段任务完成率略低),敏感性分析 |
| 信息性缺失 | 被 QC 剔除者多为运动多/噪声大 | 缺失非随机(MAR/MNAR) | 对比「全样本」与「QC 后样本」的年龄分布,防止 QC 引入年龄偏倚(Sci Rep 2022 实例:306 名中剔除 3 名) |
官方未定义统一哨兵值;缺失以「行缺失/文件缺失」为主,建议以文件存在性检查替代空值填充。
§5 划分与使用建议
§5.1 官方划分
无。Cam-CAN 是研究队列而非竞赛数据集,官方不提供训练/验证/测试划分,也不设排行榜。任何论文中的划分都是作者自定的,跨论文数字不可直接比较(§8.3)。
§5.2 社区惯例划分
- 脑龄回归:多数工作用 5-10 折交叉验证并按年龄分层(分箱或分位数),保证每折年龄分布一致;Pinamonti et al. (2025) 采用稳健 CV 内部评估 + HCP-Aging 整套外测。
- M/EEG 基准:Engemann et al. (2022) 使用聚合交叉验证报告均值±标准差,且全程不做人次剔除(「无排除」原则)。
- 完全外测:以 IXI 或 HCP-Aging 作外测集,配合 ComBat 站点和谐化(Pinamonti 2025 显示和谐化将 SVM-RBF 外测 MAE 从 7.45 改善到 7.05)。
§5.3 泄漏风险(重点)
- 同人跨 Phase:Phase 2(CC700)与 Phase 3(CC280)为同一批人的两次扫描。若把两个仓库的记录都放进样本并随机划分,同人将同时出现在训练与测试集——脑龄等任务上这是严重的乐观偏置。必须按
participant_id做GroupKFold/分组留出。 - 年龄信息泄漏到特征:形态学特征与年龄高度共线,任何「去年龄化」预处理(如回归掉年龄)都必须只在训练折内拟合,否则测试折信息回流。
- 预处理模板泄漏:若用全样本构建 study-specific 模板(DARTEL 等)后再划分,测试折已参与模板。请在训练折内建模板,或直接用 MNI 标准模板。
- 特征选择泄漏:跨折做特征筛选(如选与年龄最相关的 100 个 ROI)同样造成泄漏,应纳入 Pipeline 内嵌 CV。
§5.4 划分策略建议
推荐三层结构:内层 GroupKFold(10)(组 = participant_id,层 = 年龄十分位箱)做模型选择;外层留出 2 个整十年段(如 60-78 岁组)做内部漂移测试;最后以 IXI/HCP-Aging 做站点外测并报告和谐化前/后双版本。
§5.5 交叉验证与外部验证建议
- 报告 MAE、Pearson r 与校正 R² 的均值±标准差,附 dummy 回归基线(Engemann 2022 的 dummy MAE 15.90 年是很好的下界参照)。
- 外部验证集推荐:IXI(19-86 岁)、HCP-Aging、LEMON(EEG)、UK Biobank 影像子集;跨站点务必报告 ComBat 前后对比。
- 若使用认知分数做预测目标,先确认该任务在目标人群上的信度与天花板效应。
- 纵向扩展:Phase 3 复扫数据可做「基线 → 1-3 年变化」的增量预测,划分仍以人为组;Phase 4/5(2027)发布后建议先在 Phase 2 内定型管线、再冻结模型做真前瞻评估。
- 诚实报告:声明样本量口径(653/648/646 等)与 QC 规则,避免与其他论文数字直接比较。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
Cam-CAN 无官方云镜像/沙箱:数据须申请后经 SSH/SFTP 下载到自有机构服务器(DUA 禁止复制到 Dropbox/网盘/移动硬盘)。建议工作流:申请获批 → 机构服务器挂载数据盘 → 用 VS Code Remote-SSH 或 JupyterHub 远程开发。以下代码假设你已完成审批并持有账号(USERNAME 为官方分配)。
# 环境(建议 Python 3.10+,独立 conda/venv)
pip install nibabel nilearn mne pandas scikit-learn torch matplotlib
# 神经影像 QC 与预处理工具(按需)
pip install mriqc # 影像 QC
# fMRIPrep 建议用容器化安装(Docker/Singularity),见 https://fmriprep.org
开工前 60 秒检查清单:
| 检查项 | 通过标准 |
|---|---|
| DUA 已签署、审批邮件在手 | 官方审批通过记录 |
| 数据在机构服务器(非网盘/移动硬盘) | df -h 确认挂载点 |
| 仓库版本与下载日期已记录 | 记入实验日志 |
| Historical Issues 已通读 | 知悉坑点 1/3/4/6/7 |
| participants.tsv 可读、人数符合预期 | T1 约 653 名量级 |
§6.1 快速上手
目录结构预期:假设你把 MRI 仓库放在
DATA_ROOT/mri/,MEG 仓库放在DATA_ROOT/meg/,行为学放在DATA_ROOT/behav/;DATA_ROOT即下方代码中的data_root,所有路径由data_root拼接而来。
最小可用子集:participants.tsv+ 各受试者anat/*_T1w.nii.gz——仅这两样即可跑通「T1 → 脑龄」最小管线。
运行前置:数据须已通过官方审批下载到本地机构服务器。
# 快速验证:遍历 participants.tsv 并定位每个人的 T1 文件
import pandas as pd
from pathlib import Path
data_root = Path("/data/camcan") # ← 你的 DATA_ROOT
mri_dir = data_root / "mri" # MRI BIDS 仓库根
participants = pd.read_csv(mri_dir / "participants.tsv", sep="\t")
def find_t1(subject_id: str) -> Path | None:
"""定位某受试者的 T1;返回 None 表示该模态缺失(勿假设人人都有)。"""
p = mri_dir / subject_id / "anat"
hits = sorted(p.glob(f"{subject_id}_T1w.nii.gz"))
return hits[0] if hits else None
participants["t1_path"] = participants["participant_id"].map(find_t1)
have_t1 = participants.dropna(subset=["t1_path"])
print(len(participants), "总人数;", len(have_t1), "人有 T1") # 653 名量级
print(have_t1["age"].describe()) # 年龄应覆盖 18-88
§6.2 数据获取
申请流程(数据访问门户):
| 步骤 | 内容 | 注意 |
|---|---|---|
| 1 | 填写在线申请:学术隶属、假设、所需数据子集 | 只勾选与假设直接相关的模态;「全都要 + AI 数据挖掘」式申请会被拒 |
| 2 | 签署 Data Use Agreement(非商业研究、不外传、不复制到外部存储、成果开放获取、强制致谢) | 学生须由导师代为申请 |
| 3 | 等待官方逐案审批(可能要求补充说明) | 官方声明会拒绝大量不合规申请 |
| 4 | 获批后经 SSH/SFTP 下载所选仓库 | Phase 3(CC280)需邮件单独申请 |
下载示例(获批后):
# 断点续传式拉取单个模态仓库(rsync over ssh)
rsync -avP USERNAME@camcan-archive.mrc-cbu.cam.ac.uk:/data/mri/ /data/camcan/mri/
# 下载完成后校验 BIDS 结构
ls /data/camcan/mri/sub-CC110045/anat/
行为学/认知数据结构速览(获批后官方提供完整可检索变量清单):
| 变量前缀 | 类别 | 典型内容 | 建模建议 |
|---|---|---|---|
homeint_ |
家访访谈 | 人口学、健康史、生活方式、社会活动 | 协变量/分层因子 |
epaq_ |
电子问卷(EPAQ) | 体力活动等自报问卷 | 流行病学协变量(自报测量误差需注意) |
additional_ |
官方衍生分 | 教育年限、MMSE 分等衍生变量 | 优先使用官方衍生分而非自行重算 |
| 认知实验表 | 五域任务 | 各任务准确率/反应时/合成分 | 预测目标或中介变量 |
| 生理表 | 心血管+体格 | 血压 3 次、身高、体重 | 风险协变量(血压取均值与变异性双口径) |
§6.3 预处理全流程
MRI 结构像(脑龄最小管线)——两种路线:
# 路线 A:nilearn 轻量路线(crf 脑提取 + DARTEL 外的标准空间对齐),适合基线实验
python - <<'PY'
from nilearn import image, masking
from nilearn.image import resample_img
import nibabel as nib
t1 = nib.load("/data/camcan/mri/sub-CC110045/anat/sub-CC110045_T1w.nii.gz")
print(t1.shape, t1.header.get_zooms()) # (256, 240, 192), 1mm 各向同性
PY
# 路线 B:FreeSurfer 形态学路线(文献主流,Cole 2018 / Pinamonti 2025 同款思想)
# recon-all -subjid sub-CC110045 -i sub-CC110045_T1w.nii.gz -all -qcache
# 输出皮层厚度/面积/体积 → Desikan-Killiany 68 区 + 皮层下 16 区特征
fMRI(功能连接路线):
# 推荐 fMRIPrep(容器化)。注意:TR 以 JSON sidecar 为准(坑点 1)
# fmriprep /data/camcan/mri /out participant --participant-label CC110045 \
# --output-spaces MNI152NLin2009cAsym --fs-license-file license.txt
# 之后 nilearn/Nilearn-style 提取 ROI 时间序列 → 连接组特征
体素级形态学(VBM 风格,Cole 2018 路线):
# VBM 式灰质特征提取。前置假设:每人已由外部分割工具产出灰质概率图。
# 生产建议用 SPM12+DARTEL;此处用 nilearn 演示特征矩阵组装。
from nilearn import masking
from pathlib import Path
import numpy as np
gm_dir = Path("/data/camcan/derivatives/gm")
gm_imgs = sorted(str(p) for p in gm_dir.glob("sub-CC*_gm.nii.gz"))
# 组掩膜:严格防泄漏应在训练折内生成(见 §5.3),此处演示全流程
mask = masking.compute_background_mask(gm_imgs[0])
X = masking.apply_mask(gm_imgs, mask_img=mask) # (n_subjects, n_voxels)
print(X.shape) # 例:(648, ~500000)
# 之后接 StandardScaler + SVR(RBF),按年龄十分位分层的 GroupKFold(§5.4)
MEG(MNE-Python):
import mne
raw_path = "/data/camcan/meg/sub-CC110045/meg/sub-CC110045_task-rest_meg.fif"
raw = mne.io.read_raw_fif(raw_path, preload=True)
print(raw.info["sfreq"]) # 1000 Hz
# 官方 tSSS/MaxFilter 产物勿再次 MaxFilter(坑点 4);原始数据可自做:
# raw_sss = mne.preprocessing.maxwell_filter(raw) # 仅对未滤波原始数据
raw.pick(["mag", "grad"]).filter(l_freq=1.0, h_freq=40.0)
# 电图/眼图伪影用 ICA 处理(配套 ECG/EOG 通道已随数据提供)
ica = mne.preprocessing.ICA(n_components=15, random_state=97)
ica.fit(raw)
# 静息段前 30-40 秒无 cHPI(坑点 3):用于头位校正前请先 crop 掉
raw.crop(tmin=40.0)
§6.4 PyTorch DataLoader(完整可运行)
<details>
<summary>展开:基于 BIDS participants.tsv 的脑龄回归 Dataset(含分组划分与缓存预处理)</summary>
import numpy as np
import pandas as pd
import nibabel as nib
import torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path
from sklearn.model_selection import GroupShuffleSplit
class CamCanBrainAge(Dataset):
"""T1 脑龄回归最小数据集。
目录预期:
DATA_ROOT/mri/participants.tsv # BIDS 元数据
DATA_ROOT/mri/sub-CC*/anat/*_T1w.nii.gz # 1mm 各向同性 T1
标签:age(18-88 岁,回归任务)。
预处理:重采样至 2mm 立方 + 裁剪到固定形状 + z-score(强度)。
"""
def __init__(self, data_root: str, target_shape=(96, 112, 96)):
self.mri = Path(data_root) / "mri"
df = pd.read_csv(self.mri / "participants.tsv", sep="\t")
records = []
for _, row in df.iterrows():
t1 = self.mri / row["participant_id"] / "anat" / f"{row['participant_id']}_T1w.nii.gz"
if t1.exists():
records.append({"path": str(t1), "age": float(row["age"]),
"sid": row["participant_id"]})
self.records = records
def __len__(self):
return len(self.records)
def __getitem__(self, idx):
rec = self.records[idx]
vol = nib.load(rec["path"]).get_fdata(dtype=np.float32)
vol = vol[::2, ::2, ::2] # 1mm→2mm 粗降采样
vol = vol[:self._ts[0], :self._ts[1], :self._ts[2]]
vol = np.pad(vol, [(0, self._ts[i] - vol.shape[i]) for i in range(3)])
mu, sd = np.mean(vol), np.std(vol) + 1e-6
vol = ((vol - mu) / sd).astype(np.float32)[None] # (1, H, W, D)
return torch.from_numpy(vol), torch.tensor(rec["age"]), rec["sid"]
_ts = target_shape = (96, 112, 96)
def make_loaders(data_root: str, batch_size: int = 8, seed: int = 97):
"""分组划分:组=participant_id,防止同人跨仓库/跨折泄漏(坑点 2)。"""
ds = CamCanBrainAge(data_root)
sids = np.array([r["sid"] for r in ds.records])
ages = np.array([r["age"] for r in ds.records])
bins = pd.qcut(ages, q=5, labels=False) # 年龄分层
tr, te = next(GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=seed)
.split(sids, bins, groups=sids))
class _Sub(Dataset):
def __init__(self, idxs): self.idxs = idxs
def __len__(self): return len(self.idxs)
def __getitem__(self, i): return ds[self.idxs[i]]
return (DataLoader(_Sub(tr), batch_size=batch_size, shuffle=True, num_workers=4),
DataLoader(_Sub(te), batch_size=batch_size, num_workers=4))
if __name__ == "__main__":
train_loader, test_loader = make_loaders("/data/camcan")
x, y, sid = next(iter(train_loader))
print(x.shape, y[:4], sid[:4]) # torch.Size([8, 1, 96, 112, 96]) …
</details>
§6.5 坑点 8 个
⚠️ 坑点 1:fMRI 的 NIfTI 头 TR 曾错标,务必以 JSON sidecar 为准(分类:预处理陷阱)
问题:早期转换版本将 fMRI 的 TR 写入 NIfTI 头时出错(标成 1 秒,而实际约为 2 秒),2019-03 BIDS 版已在 JSON sidecar 中给出正确值(静息 1.97 s、电影 2.47 s)。旧版下载或某些工具链直接读头文件会得到错误时间轴。
症状:BIDS Validator 报「Repetition time did not match between the scan’s header and the associated JSON metadata file」;fSL 滤波/高频噪声谱异常;事件级 GLM 时间错位。
解决:
- 简单方法:读取 sidecar JSON 的
RepetitionTime字段并覆盖工具链中的 TR 设置(如nilearn.maskers前手动设定t_r)。- 进阶方法:写一个 BIDS 一致性预检脚本,逐受试者比对头文件与 JSON 的 TR/维度,输出不匹配清单后统一以 JSON 为准;fMRIPrep 等现代工具默认信任 JSON,直接用新版工具链即可。
- SOTA 方法:把 2019-03-29 的 Historical Issues 记录纳入数据卡片,任何下游再分发都附带「以 JSON sidecar 为时间真值」的说明,并在 QC 报告中固定该检查项。
参考:Cam-CAN Historical Issues(2019-03-29 条目);Neurostars 讨论:TR mismatch
⚠️ 坑点 2:Phase 2 与 Phase 3 是同一批人的两次扫描,合并即泄漏(分类:数据泄漏)
问题:CC280(Phase 3)受试者全部来自 CC700(Phase 2 Arm 1),同一
participant_id在两个仓库各有一条扫描记录。合并后随机划分会把同人分进训练与测试集,脑龄/认知预测指标虚高。
症状:合并数据集后 CV 成绩显著好于单仓库基线;按被试统计发现测试集中出现训练集已有的 ID。
解决:
- 简单方法:只用 Phase 2 做横断面建模;如需纵向分析,同人两条记录要么同折、要么测试集只留 Phase 3。
- 进阶方法:
sklearn.model_selection.GroupKFold以participant_id为组参数划分(见 §6.4 代码),并在数据卡片中记录组数。- SOTA 方法:为跨期数据设计「人内-人间」双层 CV:内层同人数据永远同侧,外层按十年段分层,同时报告 Phase 2-only 与合并两种口径的指标差。
参考:官方门户对 Phase 3 招募的说明;Shafto et al., 2014, BMC Neurology, DOI
⚠️ 坑点 3:每个 MEG run 前 30-40 秒没有 cHPI,静息段受影响(分类:预处理陷阱)
问题:连续头位指示(cHPI)线圈在每段 MEG 开始时才打开,前 30-40 秒无头位信息。这不影响任务试次(事件总在 cHPI 开启后),但静息整段分析若不处理,会把无头位监控的时段混入。
症状:用 cHPI 做头动校正时报错或丢弃前段;运动参数统计在段首出现缺失/异常。
解决:
- 简单方法:
raw.crop(tmin=40.0)直接丢弃前 40 秒(静息 8 分 40 秒仍余约 8 分钟)。- 进阶方法:对任务 run 保留全段、对静息 run 定向 crop;把 crop 规则写进版本化预处理配置。
- SOTA 方法:以
mne.preprocessing.maxwell_filter(..., st_duration=10)的 tSSS + movement compensation 处理原始数据时显式声明 cHPI 可用时段,并在 QC 报告中输出每 run 的有效时长。
参考:Historical Issues:MEG Head Position Indicators(2019-03-29 条目)
⚠️ 坑点 4:官方 MaxFilter 产物不要二次 MaxFilter,且注意 SSP 投影已内置(分类:预处理陷阱)
问题:仓库同时存在原始 FIF 与官方 tSSS/MaxFilter 产物;历史上还出现过把全部原始文件误命名
proc-sss的事故(2019-08-27 已修正)。MaxFilter 是非线性操作,重复施加会破坏信号统计;官方产物的 cHPI 通道已被清空并携带默认 SSP 投影。
症状:对 tSSS 文件再次 MaxFilter 后功率谱出现异常尖峰或信号过度平滑;PSD 图中残留 cHPI 串扰峰。
解决:
- 简单方法:检查文件名中的
proc-sss/tsss_mc/_megtransdef标记——若为 MaxFilter 产物,跳过滤波步骤,只做带通滤波与 ICA。- 进阶方法:读入后检查
raw.info["projs"]是否非空、raw.info["comps"]状态,据此分支处理;对残留线频串扰用 ICA(约 60 个梯度计分量级分量)而非过宽陷波。- SOTA 方法:整条管线以「原始数据 + 自管 MaxFilter 参数」为唯一入口,将官方产物仅作对照基准;所有滤波参数写入 BIDS derivative 的 JSON。
参考:Brainstorm 论坛:PSD of CamCAN MEG;Historical Issues:proc-sss 修正
⚠️ 坑点 5:认知行为数据是自由格式 TXT,无集中机读字典(分类:标签理解)
问题:认知/生理数据以 ASCII TXT 分发,变量按
homeint_/epaq_/additional_前缀组织,完整可检索变量列表需在申请获批后获取;没有统一的关系型 schema。直接按列名猜测合并会错位。
症状:同一概念多列(原始分/衍生分/版本变体);不同批次文件的行数或 ID 顺序不一致;把自报变量当成实测变量。
解决:
- 简单方法:先以
participant_id建索引表,再逐文件左连接;数值列统一pd.to_numeric(errors="coerce")。- 进阶方法:为用到的每个变量建立迷你数据字典(来源文件、单位、施测版本、缺失模式),并冻结为 YAML 配置随代码提交。
- SOTA 方法:把行为学 ETL 固化为带单元测试的转换包,输出 Parquet 宽表 + 自动化缺失率报告,纳入 CI。
参考:数据政策页对 Phase 1 变量清单的说明;Taylor et al., 2017, NeuroImage, DOI
⚠️ 坑点 6:2011-10 后扫描仪梯度线圈更换,批次效应必须建模(分类:偏倚陷阱)
问题:前 97 名受试者采集后 3T TRIO 梯度线圈故障,此后 B0 频率与被动匀场配置改变。前 97 人更偏老年段(采集顺序上早年先扫),若忽略批次,年龄效应会与批次效应部分纠缠。
症状:按 coil-type 分组后 ROI 体积/信号分布漂移;加入 coil-type 协变量后模型系数明显变化。
解决:
- 简单方法:把官方提供的 coil-type 二值变量作为协变量放入回归/CV 分层因子。
- 进阶方法:CV 时按「年龄箱 × coil-type」复合分层;对敏感指标报告含/不含批次校正的双版本。
- SOTA 方法:跨数据集外测时用 ComBat 类和谐化(Pinamonti 2025 证明其将 SVM-RBF 外测 MAE 从 7.45 降至 7.05),本数据集内先把 coil-type 当作「站点」变量试跑 ComBat。
参考:Historical Issues:MRI Coil Indicator(2019-05-03 条目);Pinamonti et al., 2025, IEEE EMBC, DOI
⚠️ 坑点 7:QC 剔除名单造成模态间样本不一致,且缺失非随机(分类:工程陷阱)
问题:DWI 累计剔除 24 人、fMRI SMT 剔除 2 人、MEG 剔除 2 人(含已下载旧版者需自行移除的 ID),另有 FieldMap/多 run 目录的历史错误修正。QC 剔除与运动量相关,而运动量与年龄、认知相关——直接取「有值的人」会引入信息性缺失。
症状:多模态合并后各表行数对不上;QC 后样本的年龄均值悄悄偏移;复现他人论文样本量困难(如 648/653/646 并存)。
解决:
- 简单方法:先按
participant_id求各模态交集,再对照 Historical Issues 的剔除名单核对。- 进阶方法:编写「存在性审计」脚本输出每模态人数矩阵(应得 653/652/651/647/642/623 量级),并对比 QC 前后年龄分布(KS 检验)。
- SOTA 方法:在论文中固定一个「分析样本快照」(人数 + 名单哈希 + 年龄直方图),复现包内附带审计脚本;敏感性分析加回被剔除者。
参考:Historical Issues 全部剔除条目;Sci Rep 2022 的样本处理实例
⚠️ 坑点 8:年龄与几乎一切变量共线,评估必须防年龄混淆(分类:评估误用)
问题:横断面寿命样本中,年龄与灰质体积、连接强度、认知分数、甚至运动量全面相关。若验证划分未按年龄分层,模型可能学到年龄代理特征并在「看似没问题」的 CV 中高估泛化;跨十年段外推能力则被掩盖。
症状:随机划分 MAE 很好,但按十年段分桶后误差单调恶化;预测的脑龄与实际年龄高度相关(r>0.9)而脑龄差无解释力。
解决:
- 简单方法:CV 划分按年龄十分位分层;报告按十年段的分组误差表。
- 进阶方法:用「留出整十年段」的漂移测试(如训练不含 70+,测试全 70+);脑龄差分析采用与年龄正交化的 delta 校正。
- SOTA 方法:报告 dummy 基线(Engemann 2022 的 dummy MAE 15.90 年)+ 聚合 CV 置信区间;跨站点外测做 ComBat 前后双报告(Pinamonti 2025 范式)。
参考:Engemann et al., 2022, NeuroImage;Pinamonti et al., 2025, IEEE EMBC, DOI
§6.6 数据增强(安全 ✅ / 危险 ❌)
| 操作 | 建议 | 理由 |
|---|---|---|
| 强度缩放/直方图匹配 | ✅ | 模拟扫描仪强度差异 |
| 随机裁剪与重采样(各向同性) | ✅ | 空间不变的常规手段 |
| 左右翻转 | ❌ | 脑功能显著偏侧化(语言/优势手),翻转破坏年龄-偏侧化关系 |
| 大角度旋转 | ❌ | 破坏与年龄相关的脑形态方向性(如脑萎缩模式) |
| fMRI 时间轴打乱 | ❌ | 破坏血氧动力学时间结构,连接组特征失效 |
| MEG 信号加高斯噪声 | ⚠️ 慎用 | 会改变与年龄相关的信噪比结构,等于注入年龄混淆 |
| Mixup/CutMix(跨被试) | ❌ | 制造生理上不存在的形态组合,年龄标签失去意义 |
§6.7 模型推荐
| 任务 | 推荐起点 | 理由与对标 |
|---|---|---|
| T1 脑龄回归 | FreeSurfer/nilearn 形态学特征 + SVR(RBF) | 内部 MAE 5.89 年(Pinamonti 2025,n=627) |
| T1 深度学习 | 3D ResNet/ViT + 强度标准化 | 需大量增强与正则;对标社区榜单 FFCL MAE 8.5(截至 2026-02) |
| MEG 脑龄 | filterbank + 黎曼协方差 + 岭回归 | MAE 7.30 年(Engemann 2022),优于同数据深度模型 |
| fMRI 认知预测 | ROI 时间序列 → 连接组特征 + 弹性网/梯度提升 | 特征可解释、样本量友好 |
| 多模态融合 | 晚融合(各模态 embedding 拼接)起步 | 早融合易过拟合;注意模态间 N 不一致(§4.5) |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐 |
|---|---|---|
| BIDS 校验/行为学 ETL | 8 GB 内存 CPU | 16 GB |
| FreeSurfer recon-all(全队列) | 4 核/16 GB,约 6-10 小时/人 | 多机并行(653 人 × 数小时,建议集群) |
| fMRIPrep | 8 核/32 GB + 容器 | 16 核/64 GB |
| MEG 预处理(MNE) | 16 GB 内存 | 32 GB(ICA + tSSS 内存开销大) |
| 3D CNN 训练 | 1×11 GB GPU | 1×24-40 GB GPU(batch 8-16) |
§6.9 评估指标代码
import numpy as np
from scipy import stats
def brain_age_metrics(y_true, y_pred):
"""脑龄回归标准指标集。y_true/y_pred:1D 数组(岁)。"""
y_true, y_pred = np.asarray(y_true), np.asarray(y_pred)
mae = np.mean(np.abs(y_true - y_pred))
r, p = stats.pearsonr(y_true, y_pred)
r2 = 1 - np.sum((y_true - y_pred) ** 2) / np.sum((y_true - y_true.mean()) ** 2)
# 脑龄差delta 简单版;严格版应在训练折内回归掉年龄依赖后再计算
delta = y_pred - y_true
return {"MAE_years": round(float(mae), 2),
"Pearson_r": round(float(r), 3), "p": float(p),
"R2": round(float(r2), 3),
"delta_bias": round(float(delta.mean()), 2),
"delta_corr_with_age": round(float(stats.pearsonr(y_true, delta)[0]), 3)}
# 参照量级:结构像 SVM-RBF 内部 MAE≈5.89(Pinamonti 2025);
# MEG filterbank-riemann MAE≈7.30(Engemann 2022);dummy 基线 MAE≈15.90。
§6.10 MLOps 笔记
- 合规即配置:DUA 禁止把数据复制到外部存储/网盘——CI 只跑代码不跑数据;数据处理留在机构服务器,产物(权重、特征表)脱敏后才可外传。
- 版本化:以 DVC/git-annex 管理衍生数据;记录数据来源仓库(mri/meg/behav)、下载日期与 Historical Issues 快照哈希。
- 致谢自动化:把 DUA 强制致谢语(BBSRC BB/H008217/1)写进论文模板与 README 模板。
- 可复现性:固定 FreeSurfer/fMRIPrep/MNE 版本;官方管线论文(Taylor 2017)与 DUA 要求衍生数据及脚本公开——发布时附预处理代码。
- 监控:QC 剔除率按批次(coil-type、采集年)监控;外测 MAE 漂移超过 10% 触发复核。
- 审计脚本模板:把「模态人数矩阵 + 年龄分布对比 + 剔除名单核对」三件套固化为仓库内的
audit_camcan.py,任何数据版本变更先跑审计再进实验。 - 数据卡片:为每个衍生数据集生成卡片(来源、版本、QC 规则、已知局限),与 §7 的偏倚表联动,满足 NeurIPS D&B 类投稿要求。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 幸存者偏倚 | 老年段受试者为健康存活者,最老的十年段代表性偏「精英化」 | 高 | 解读 70+ 结果时只下「健康老化」结论;与人群死亡登记数据校准 |
| 志愿者/健康志愿者偏倚 | GP 名册招募 + 自愿参与,排除重大疾病史 | 中 | 引用 Shafto 2014 排除标准;避免外推到临床人群 |
| 地域与族群局限 | 单一剑桥郡采样,族群与社经多样性有限 | 中 | 外测时配合多站点数据(IXI/HCP-Aging/LEMON) |
| 扫描批次效应 | 2011-10 后梯度线圈/匀场更换(前 97 人 vs 其后) | 中 | coil-type 协变量/分层(坑点 6) |
| 横断面不可推断个体轨迹 | 年龄效应≠个体老化速率 | 高 | 用 Phase 3/4/5 纵向子样本校验 |
| 信息性缺失(QC 相关) | QC 剔除与运动/年龄相关 | 中 | QC 前后年龄分布对比(坑点 7) |
§7.2 标注质量
年龄标签为登记事实,零误差;认知分数来自标准化测验,计分自动化程度高,信度依赖施测协议统一性(血压 3 次连测、任务有练习与指导语标准化)。影像方面无人工诊断标注,质量以管线 QC(自动 + 人工核查名单公开)保证。队列未发布评分者间信度系数——对健康样本的自动化计分任务而言影响有限,但用行为学衍生分做预测目标时应做天花板效应检查(MMSE 尤甚)。
| 质量维度 | 机制 | 公开程度 | 建模含义 |
|---|---|---|---|
| 年龄标签 | 出生日期推导,逐人核对 | 全量可得 | 可作为零误差回归目标 |
| 影像 QC | 管线自动 + 人工核查,剔除名单公开(Historical Issues) | 名单级公开 | 复现样本量需对照剔除 ID |
| 认知施测 | 统一协议、计算机化计分为主 | 协议论文级 | 计分规则可溯源至 Shafto 2014 |
| 生理测量 | 血压 3 次连测、设备标准化 | 协议论文级 | 可计算测量变异性做稳健性分析 |
| 数据修正台账 | Historical Issues + News 页 | 全量公开 | 预处理前必读(坑点 1/3/4/6/7 来源) |
§7.3 泛化性
| 部署场景 | 失效风险 | 证据 |
|---|---|---|
| 跨站点(多扫描仪临床数据) | 中-高:MAE 从 5.89 恶化到 7.45 年 | Pinamonti et al., 2025:Cam-CAN 训练 → HCP-Aging 外测;ComBat 后 7.05 |
| 跨年龄带外推(训练缺 70+) | 高:老年段误差显著上升 | 坑点 8 机理;Engemann 2022 聚合 CV 年龄分层设计 |
| 临床痴呆人群 | 高:队列不含确诊患者,脑龄差在疾病端的绝对定位需疾病队列 | 官方排除标准(Shafto 2014);BrainFTFCN 等基准均限健康样本 |
| EEG 设备迁移 | 高:MEG→EEG 表示差异大 | Engemann 2022 在 LEMON/CHBP/TUAB 上同管线成绩显著不同 |
| 族群多样性迁移 | 中-高:UK 单地区样本 | §7.1 地域偏倚;官方未提供族群分布 |
§7.4 伦理
研究获 Cambridgeshire 2 研究伦理委员会(现 East of England-Cambridge Central)批准,并含「数据可匿名公开」的知情同意授权;数据去标识化后经 DUA 受控开放。使用者义务:非商业研究、不再分发、成果开放获取、衍生数据与脚本公开、强制致谢 BBSRC BB/H008217/1(完整条款见数据门户)。
§7.5 公平性
年龄与性别在设计层面均衡(每十年段约 100 名、男女基本对半);但族群、社经与地域多样性未系统公开,模型在非英/欧裔人群上的外推需额外验证。脑龄类模型已知可能携带性别形态学差异——建议按性别分层报告误差并在公平性审查中覆盖两性 MAE 差异。此外,教育年限是认知分数的重要社会经济协变量,家访数据中的教育变量应在认知预测模型中显式纳入或做敏感性分析,避免把教育差异误读为脑老化差异。
§7.6 数据漂移
| 漂移源 | 类型 | 检测方式 | 缓解 |
|---|---|---|---|
| 扫描批次(coil-type,2011-10) | 设备漂移 | 按批次对比 ROI 分布 | coil-type 协变量/分层(坑点 6) |
| BIDS 化与命名修正(2019-03/2019-08) | 格式漂移 | 版本哈希对比 | 固定下载日期与仓库版本 |
| fiducial 修正(2025-12,CC110056/CC110087) | 元数据漂移 | MEG-MRI 配准残差复查 | 下载新版仓库重跑配准 |
| 数据扩容(Phase 3/Arm 2 纳入、2027 Phase 4/5) | 覆盖漂移 | 版本间样本量审计 | 重跑 §6.10 的存在性审计脚本 |
§7.7 DAIMS 24 项检查
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | participants.tsv + 行为学宽表;影像按 BIDS 层级组织 |
| 2 | 唯一标识 | ✅ | sub-CC* 全库唯一,跨 Phase 一致 |
| 3 | 特殊字符 | ⚠️ | 行为学自由文本含非结构字段,需清洗后入库 |
| 4 | 重复行 | ✅ | 表内无重复行;同人跨 Phase 为合法双记录(以 ID 组管理) |
| 5 | 缺失编码 | ⚠️ | 无统一哨兵值;以行/文件缺失为主 |
| 6 | 标签标识 | ✅ | 年龄为登记事实;认知分数可溯源至具体任务 |
| 7 | 罕见类分组 | ✅ | 每十年段约 100 名,无极端稀有类 |
| 8 | 偏倚评估 | ✅ | 协议论文与多篇后续研究系统讨论招募/幸存者偏倚 |
| 9 | 数据字典 | ⚠️ | 变量清单需获批后获取,无集中公开机读字典 |
| 10 | 信息性缺失解释 | ⚠️ | QC 剔除名单公开,但未逐字段标注缺失机制 |
| 11 | 设备记录 | ✅ | 序列参数 JSON + coil-type 变量 + MEG 系统元数据 |
| 12 | 共线性 | ⚠️ | 年龄与几乎所有表型共线,建模需显式处理(坑点 8) |
| 13 | 编码映射 | ⚠️ | 认知测验跨 Phase 的变量版本映射需研究者自建 |
| 14 | 时间戳处理 | ⚠️ | 采集日期未集中公开;Phase/年份可推断;fMRI TR 曾错标(坑点 1) |
| 15 | 划分建议 | ✅ | 本 Wiki §5 提供分组/分层/外测三层方案 |
| 16 | 泄漏讨论 | ✅ | 同人跨 Phase 泄漏与预处理泄漏已明确(§5.3) |
| 17 | 标签分布 | ✅ | 年龄直方图近似矩形(54.9±18.4,n=646 实测) |
| 18 | 测量偏倚 | ⚠️ | 血压 3 次连测部分缓解;量表存在练习/天花板效应 |
| 19 | 外部验证建议 | ✅ | IXI/HCP-Aging/LEMON 先例充分(§7.8) |
| 20 | 版本记录 | ✅ | Historical Issues + News 页完整台账(2016-2026) |
| 21 | 预处理脚本 | ✅ | 官方管线有论文级文档(Taylor 2017);DUA 要求衍生脚本公开 |
| 22 | 合规要求 | ✅ | DUA 条款明确(非商业、不再分发、开放发表、致谢语) |
| 23 | 多模态对齐 | ⚠️ | 模态间 N 不一致(623-653);MEG-MRI fiducials 2025-12 才补齐并修正 2 人 |
| 24 | 去标识化 | ✅ | 匿名 ID + 无直接标识符 + DUA 受控访问 |
DAIMS 评分:19.5 / 24
评分解读:核心工程基础(唯一标识、设备记录、版本台账、合规条款、去标识化)扎实,达到队列数据的第一梯队水平;扣分集中在「可机读自服务」维度——行为学数据字典、缺失编码统一性与跨 Phase 变量映射需要研究者自行补齐,这部分是 9 个 ⚠️ 的主要来源。
对你意味着什么:如果你的任务只用影像模态 + participants.tsv,可以按本 Wiki §6.4 代码直接开工,预期 1-2 天跑通基线;如果你的任务依赖行为学变量,先为所用变量建立自管字典与 ETL 测试(坑点 5),并把 QC 剔除名单审计(坑点 7)与年龄分层 CV(坑点 8)写进实验模板——这三件事决定了你的结果能否被复现。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| HCP-Aging(n=607) | 华盛顿大学等 HCP 联盟 | T1 形态学脑龄 | 外测 MAE 7.45 年(XGB,未和谐化);7.05 年(SVM-RBF,ComBat 后) | 内部 5.89 年(SVM-RBF)→ 外测 +1.2~+1.6 年 | 跨站点是主要损失源;ComBat 使核方法反超树模型(Pinamonti et al., 2025, IEEE EMBC, DOI) |
| IXI(n=547) | 伦敦多中心 | SVR 脑龄(BrainSuite 特征) | 外测保持可解释特征贡献 | Cam-CAN 内部训练 n=609 | 形态学脑龄特征跨站点语义稳定(Insights into Imaging, 2024, DOI) |
| LEMON/CHBP/TUAB(EEG,共 2,500+ 记录) | 马普所等四国队列 | 同管线 M/EEG 脑龄 | Cam-CAN MEG 最优 MAE 7.30 年;跨数据集 R² 0.60-0.74 | 跨设备/模态差异显著 | 空间感知表示(黎曼/滤波组)跨队列最稳(Engemann et al., 2022, NeuroImage, DOI) |
§8 基准性能与生态
§8.1 排行榜
| 排名 | 模型 | 性能 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | SVM-RBF(T1 形态学) | MAE 5.89 年,R² 0.84(内部 CV,n=627) | 2025 | Desikan-Killiany 形态学 + 核回归 | Pinamonti, M. et al., 2025, IEEE EMBC. DOI 10.1109/EMBC58623.2025.11254883 | 未公开 |
| 2 | filterbank-riemann(MEG) | MAE 7.30±0.72 年,R² 0.74 | 2022 | 滤波组 + 黎曼协方差 + 岭回归 | Engemann, D.A. et al., 2022, NeuroImage 262:119521. DOI 10.1016/j.neuroimage.2022.119521 | 开源(MNE 生态) |
| 3 | FFCL(fMRI) | MAE 8.5(社区榜单,截至 2026-02) | 2026 | fMRI 时空特征 | wizwand SOTA 社区榜单(链接),社区维护、协议不统一 | 未公开 |
| 4 | BrainFTFCN(fMRI) | 较既有 SOTA 降 MAE 28.21% | 2025(在审预印) | 时间注意力自编码 + 连接图注意力 + SVR | BrainFTFCN, 2025, OpenReview 预印(PDF) | 未公开 |
| — | dummy 基线 | MAE 15.90±1.22 年 | 2022 | 均值预测 | Engemann et al., 2022, NeuroImage(同上) | 同上 |
⚠️ 数值不可直接比较的原因:各工作使用不同模态(T1/MEG/fMRI)、不同样本子集(601/627/646/648 名)、不同 CV 协议与预处理路线;仅 Engemann 2022 与 Pinamonti 2025 提供了可复现协议与外部验证。榜单排名仅表示「同模态同协议内」的相对位置。
§8.2 SOTA 总结与选型建议
结构形态学 + 核方法仍是 Cam-CAN 脑龄任务的最强基线(内部 MAE 约 5.9 年),且特征可解释、计算便宜——建议一切深度学习工作先以此为对照。MEG 信号上空间感知的经典管线(黎曼几何)显著优于深度模型(7.30 vs 8.74 年),说明 646 名样本对端到端学习仍偏小。fMRI 榜单(MAE 8.5-16)整体落后于结构像,受限于单次 8 分 40 秒采集。多模态融合尚未有公认 SOTA,是明确的空白机会区。
选型速查:追求最高精度 → T1 形态学 + SVM-RBF(Pinamonti 2025 范式);追求时域信息 → MEG filterbank-riemann(Engemann 2022 范式,开源协议可复用);做深度学习创新 → 先在形态学基线上证明增量,再考虑 3D CNN/Transformer 并配合强年龄分层与外测;跨站点应用 → 预算 ComBat 和谐化步骤,其收益已被外测证据量化(MAE 7.45→7.05)。
§8.3 评测协议
社区可复现协议要点(Engemann 2022 / Pinamonti 2025 共识):全程不做人次剔除或固定剔除规则并声明;按年龄分层(分箱/分位数)的聚合 CV;报告 MAE、r、R² 的均值±标准差与 dummy 基线;外测集(IXI/HCP-Aging)用 ComBat 前后双版本;CoRRECT 报告预处理参数。自行设计协议时至少满足 §5.3 的四条泄漏红线。
最小可复现报告清单:数据版本与下载日期 → 样本量口径与 QC 规则 → CV 协议(组、分层因子、折数)→ 预处理版本号 → 内部指标(均值±SD)→ 外测指标(和谐化前/后)→ dummy 基线。七项齐全,你的数字才能进入跨论文比较的讨论。
§8.4 相关数据集
| 数据集 | 机构 | 模态 | 与 Cam-CAN 关系 |
|---|---|---|---|
| IXI | 伦敦多中心(UCL/KCL 等) | 结构 MRI | 常用外测集(n=567,19-86 岁) |
| HCP-YA S1200 | 华盛顿大学联盟 | 高精度 MRI | 青年参照(1,113 名,22-37 岁) |
| HCP-Aging | HCP 联盟 | MRI | 跨站点外测标准集(Pinamonti 2025) |
| LEMON | 马普人类认知与脑科学所 | EEG + MRI | M/EEG 脑龄跨队列对照(Engemann 2022) |
| NKI-Rockland | 纽约州精神病学研究所 | MRI(部分 MEG/EEG) | 宽年龄带(约 1,000 名,4-85 岁)对照 |
| UK Biobank | UK Biobank 联盟 | MRI + 海量表型 | 更大规模但中年带(40-69 岁) |
§8.5 关键论文 Top 8
- Shafto, M.A. et al., 2014, BMC Neurology 14:204. DOI 10.1186/s12883-014-0204-1 — 队列协议总纲:招募、排除、测验与影像协议。
- Taylor, J.R. et al., 2017, NeuroImage 144:262-269. DOI 10.1016/j.neuroimage.2015.09.018 — 数据仓库论文:模态清单、参数与获取方式(引用 820+,截至 2026-09)。
- Tsvetanov, K.A. et al., 2015, Human Brain Mapping 36:2248-2269 — 联合 fMRI/MEG 证明血管反应随年龄变化,fMRI 老化研究必校正混杂。
- Kievit, R.A. et al., 2014, Nature Communications 5:5000 系 — 额叶结构中介年龄相关流体智力与多任务差异(寿命结构-认知建模范例)。
- Henson, R.N. et al., 2016, Scientific Reports 6:39030 系 — 寿命记忆差异的多决定因素分析(认知五域应用范例)。
- Cole, J.H. et al., 2018, Frontiers in Aging Neuroscience 10:28. DOI 10.3389/fnagi.2018.00028 — 贝叶斯优化预处理 + SVR 脑龄(648 名)。
- Engemann, D.A. et al., 2022, NeuroImage 262:119521. DOI 10.1016/j.neuroimage.2022.119521 — M/EEG 脑龄可复用基准(Cam-CAN MEG 646 名)。
- Pinamonti, M. et al., 2025, IEEE EMBC. DOI 10.1109/EMBC58623.2025.11254883 — 25 种模型对比 + HCP-Aging 外测 + ComBat 和谐化。
注:第 4、5 条为该队列代表性应用论文(期刊卷期以出版社页面为准);其余各条卷期/DOI 均已核对。
§8.6 社区活跃度
- 数据申请:1,000+ 名研究者 worldwide(截至 2022-01,Henson 课程材料)。
- 下载与产出:下载 2,000+ 次、基于 Cam-CAN 的论文 100+ 篇(截至 2023-09,同上)。
- 数据仓库论文 Taylor 2017 引用 820+(Google Scholar,截至 2026-09)。
- 维护状态:数据门户 2025-12 迁移更新,News 页 2026-02 仍有数据条目增补,项目进入 Phase 4/5 收尾期(2027 年发布)。
- 问题响应:Historical Issues 台账持续记录用户反馈发现的数据问题(2019-2020 密集修正期),表明官方对社区报告有正式响应通道。
- 生态位置:在 M/EEG 脑龄基准(Engemann 2022)与多站点和谐化研究(Pinamonti 2025)中被选为核心训练队列,属于「被基准依赖」的一线队列。
§8.7 生态快照
| 资源 | 类型 | 链接 | 活跃度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| Cam-CAN 数据门户(存档) | 官方获取入口 | camcan-archive.mrc-cbu.cam.ac.uk | 长期稳定 | 申请与下载主入口 |
| Cam-CAN 新门户 | 官方数据门户 | opendata.mrc-cbu.cam.ac.uk | 2026-02 有更新 | Phase 3/Arm 2 与最新修正 |
| Historical Issues 页 | 官方问题台账 | 链接 | 累积式 | 坑点 1/3/4/6/7 的第一手出处 |
| MNE-Python | M/EEG 工具库 | mne.tools | 活跃维护 | MEG 基准同款生态 |
| fMRIPrep | fMRI 预处理管线 | fmriprep.org | 活跃维护 | BIDS 原生、信任 JSON sidecar(坑点 1 免疫) |
| Engemann M/EEG 基准论文 | 基准与脚本 | DOI | 可复现协议 | MEG 脑龄起点 |
| Atlas of Longitudinal Datasets | 队列元目录 | 条目页 | 持续维护 | 纵向设计速查 |
§9 相关资源与引用
§9.1 官方资源
- 数据访问门户(申请与条款) — 申请表、DUA 全文、数据集清单(14 个子数据集)。
- 项目主页 — 项目介绍、出版物列表、材料下载。
- 材料与补充文档 — Phase 2 Arm 2 与 Phase 3 的详细评估与序列说明。
- Historical Issues 数据问题台账 — 2019-2020 全部修正与剔除记录。
- News 页(新门户) — 2025-12 起的最新更新。
- 采集参数与数据政策页(官方) — 各序列完整参数表与变量分类说明。
- Atlas of Longitudinal Datasets 条目 — 纵向设计速查与数据共享政策摘要。
§9.2 BibTeX 引用块
@article{shafto2014camcan,
title = {The Cambridge Centre for Ageing and Neuroscience (Cam-CAN) study protocol:
a cross-sectional, lifespan, multidisciplinary examination of healthy cognitive ageing},
author = {Shafto, Meredith A. and Tyler, Lorraine K. and Dixon, Marie and Taylor, Jason R. and
Rowe, James B. and Cusack, Rhodri and Calder, Andrew J. and Marslen-Wilson, William D. and
Duncan, John and Dalgleish, Tim and Henson, Richard N. and Brayne, Carol and
Matthews, Fiona E. and Cam-CAN},
journal = {BMC Neurology},
volume = {14},
pages = {204},
year = {2014},
doi = {10.1186/s12883-014-0204-1}
}
@article{taylor2017camcan,
title = {The Cambridge Centre for Ageing and Neuroscience (Cam-CAN) data repository:
Structural and functional MRI, MEG, and cognitive data from a cross-sectional
adult lifespan sample},
author = {Taylor, Jason R. and Williams, Nitin and Cusack, Rhodri and Auer, Tibor and
Shafto, Meredith A. and Dixon, Marie and Tyler, Lorraine K. and Cam-CAN and
Henson, Richard N.},
journal = {NeuroImage},
volume = {144},
pages = {262--269},
year = {2017},
doi = {10.1016/j.neuroimage.2015.09.018}
}
@article{cole2018brainage,
title = {Predicting brain age with deep learning from uncorrected, corrected, and
optimized neuroimaging preprocessing pipelines},
author = {Cole, James H. and Poudel, Rudi and Tsagkrasoulis, Dimosthenis and
Caan, Matthan W. A. and Steves, Claire and Spector, Tim D. and Montana, Giovanni},
journal = {Frontiers in Aging Neuroscience},
volume = {10},
pages = {28},
year = {2018},
doi = {10.3389/fnagi.2018.00028}
}
@article{engemann2022reusable,
title = {A reusable benchmark of brain-age prediction from M/EEG resting-state signals},
author = {Engemann, Denis A. and Mellot, Apolline and H{\"o}chenberger, Richard and
Banville, Hubert and Sabbagh, David and Gemein, Lukas and Ball, Tonio and
Gramfort, Alexandre},
journal = {NeuroImage},
volume = {262},
pages = {119521},
year = {2022},
doi = {10.1016/j.neuroimage.2022.119521}
}
@inproceedings{pinamonti2025comparison,
title = {Comparison of Statistical Methods for Brain Age Prediction Using Neuroimaging Data},
author = {Pinamonti, Marco and Sammassimo, Valentina and Moretto, Manuela and Veronese, Mattia},
booktitle = {2025 47th Annual International Conference of the IEEE Engineering in Medicine
and Biology Society (EMBC)},
pages = {1--6},
year = {2025},
doi = {10.1109/EMBC58623.2025.11254883}
}
§9.3 引用指南
使用 Cam-CAN 数据发表论文时,DUA 要求:① 引用 Shafto et al. (2014) 与 Taylor et al. (2017);② 在方法节包含数据获取声明(数据来源于 Cam-CAN repository);③ 在致谢中包含官方致谢语:数据采集与共享由 Cam-CAN 提供,资金来自英国 BBSRC(grant number BB/H008217/1)及英国 MRC 与剑桥大学的支持;④ 成果开放获取并公开衍生数据与脚本。
官方还要求在方法节使用与下述等义的表述(英文原文见 DUA 模板):「Data used in this work were obtained from the CamCAN repository, based on the CamCAN study」。两条致谢/声明缺一可能导致下一轮数据申请被拒——官方明确将「未遵守条款」列为终止访问权限的情形。若同时使用了 Phase 3 或 Arm 2 数据,请在声明中明确写出对应子集名称(CC280/CCFrail)以便溯源。
§10 AI 使用声明卡
§10.1 AI 模型列表
- 主写作模型:大语言模型(fast-model),负责资料综合、正文起草与代码示例生成。
- 辅助检索:WebSearch 检索代理(6 次主题检索 + 1 次文献元数据核验)。
§10.2 AI 参与范围
AI 负责检索结果综合、章节起草、表格与代码示例编写;全部事实性数字均要求检索来源支撑并在 FACTS 简报中登记;章节结构与格式规范由人工维护的写作宪法约束。最终内容由编辑部人工复核后发布。
§10.3 输入来源列表
- Shafto, M.A. et al., 2014, BMC Neurology 14:204. DOI
- Taylor, J.R. et al., 2017, NeuroImage 144:262-269. DOI
- Cam-CAN 数据门户(存档)
- Cam-CAN 数据政策与参数页
- Cam-CAN Historical Issues 页
- Cam-CAN 新门户 News 页
- MRC CBU 博客:2016-11 原始数据发布
- Henson 2023 课程材料(COGNESTIC)
- Engemann, D.A. et al., 2022, NeuroImage 262:119521. DOI
- Pinamonti, M. et al., 2025, IEEE EMBC. DOI
- Cole, J.H. et al., 2018, Frontiers in Aging Neuroscience 10:28. DOI
- Sensors, 2022, 22(20):8077. DOI
- Insights into Imaging, 2024. DOI
- Scientific Reports, 2022. DOI
- Neurostars:TR mismatch 讨论
- Brainstorm 论坛:CamCAN MEG PSD 讨论
- bioRxiv 2024.07.15.602693(MEG 采集与预处理协议转述)
- Aalto DataHub:Cam-CAN 条目
- Atlas of Longitudinal Datasets:Cam-CAN 条目
- wizwand 社区 SOTA 榜单(截至 2026-02)
- OpenReview:BrainFTFCN 预印
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 事实字段 | 千方病案医学编辑部 | 逐项对照 FACTS 简报与来源 URL | ✅ 已通过 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | ICD-11/SNOMED 术语核对 | ✅ 已通过 |
| §3-§4 规格与数据结构 | 千方病案医学编辑部 | 对照官方数据政策页逐项核对 | ✅ 已通过 |
| §6 代码与坑点 | 医疗 AI 数据工程师 | 代码逻辑走查 + 官方台账比对 | ✅ 已通过 |
| §7-§8 质量评估与基准 | 医疗 AI 数据工程师 | 基准数字逐条溯源 | ✅ 已通过 |
| §9-§10 引用与声明卡 | 千方病案医学编辑部 | 引用格式与致谢语核对 | ✅ 已通过 |
§10.5 AI 生成章节标注
本文正文由 AI 依规范起草,人工完成事实抽查、术语核对与结构把关;其中 §6.5 坑点与 §7.7 DAIMS 表为 AI 依据官方台账与文献归纳,关键论断均可回溯至 §10.3 所列来源。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
