信息速览
INFOBOX — MR-ART 一屏速览
维度 内容 本质 同一批 148 人的配对结构脑 MRI 运动伪影数据集(非挑战赛、非模拟合成) 团队 Research Centre for Natural Sciences 脑成像中心(匈牙利布达佩斯)+ University of Surrey,通讯 Ádám Nárai / Zoltán Vidnyánszky 论文 Sci Data 9, 630 (2022),doi:10.1038/s41597-022-01694-8,CC BY 4.0 数据 148 人 × 3 套 T1w MPRAGE(STAND / HM1 / HM2);1 mm³;1173 文件;约 4.22 GiB 采集 2019-2021;Siemens Prismas 3T;TR 2300/TE 3/TI 900/FA 9°;FOV 256×256 运动范式 注视定点;HM1 提示 5 次点头、HM2 提示 10 次点头(每次 5 秒) 标注 两位 >10 年经验神经放射科医师盲评,3 分制临床可用性评分(1 良好 / 2 中等 / 3 差) 质量指标 MRIQC v0.16.1 全量报告;重点 total SNR / EFC / CJV 去脸 PyDeface v2.0.0;BIDS 组织 dcm2bids v2.1.6 获取 CC0 公开直链(OpenNeuro ds004173 v1.0.2,DataLad/Git,无门槛) 许可 数据集 CC0|论文 CC BY 4.0(两份资产两套许可) 生态定位 运动校正算法的真实世界验证集(多篇论文用 IXI/HCP 训练 + MR-ART 验证) 库内互链 OpenNeuro(100)、IXI(482)、ADNI(101)、OASIS(21)、HBN(245)、CMRxMotion(687)
MR-ART 解决的问题一句话说不清:MRI 对头部运动极其敏感,一次微小点头就能在图像上留下重影与模糊,进而污染脑体积与皮层厚度的自动测量,甚至被误读为"脑萎缩"。但真正棘手的是——真实运动伪影的配对数据极其稀缺。深度学习运动校正方法需要"同一颗头、同一把扫描仪、同一套参数下,一张干净图配一张运动图"这种成对数据,而现实里几乎不存在:你能拿到干净扫描时,病人没有动;病人动了,你就没有干净的参照。于是绝大多数方法只能在模拟合成的运动伪影上训练和验证——而模拟有多真实,一直是个开放问题。
MR-ART 的贡献正是填这个洞:它把 148 名健康成人请进扫描仪,让每个人按指令分别做"完全静止"“轻度点头(5 次)”"重度点头(10 次)"三次采集,用同一套 MPRAGE 参数、同一台 Siemens Prismas 3T 扫描仪拍下三套 T1 图像。于是每一颗头都有了天然的运动-干净配对,且运动强度分了两档。更进一步,它给每一张图配了两位资深神经放射科医师的临床可用性评分(这张图临床能不能用)和 MRIQC 的通用图像质量指标(SNR/EFC/CJV)——两套互补的质量标签,一套从临床视角、一套从工程视角。
导语读法三则:
- 只想下数据:直奔 §6——数据集 CC0、OpenNeuro 公开直链、DataLad 一行拉取,没有申请墙,这是它与库内多数请求制数据集的最大区别。
- 要做运动校正/质控算法:直奔 §4 的数据规格与 §7 的评估协议——注意"配对"和"两档运动强度"是这个数据集的核心资产。
- 关心它能撑起什么研究:直奔 §7 与 §9——它是运动模拟真实性验证、分割鲁棒性评测、自动质控算法开发三条线的共同试验场。
§0 导读:这个数据集解决什么问题
医学影像领域有一个耐人寻味的悖论:运动伪影是 MRI 最常见的质量问题,但"带运动的真值配对数据"是最稀缺的资源。原因很简单——你可能拍到一张病人完全没动的图(干净),也可能拍到一张病人动得很厉害的图(运动),但你几乎不可能同时拥有"同一时刻、同一姿势、同一序列"的干净版和运动版。深度学习运动校正(motion correction)方法本质上是一个"运动图 → 干净图"的翻译任务,翻译模型的训练与评测都要求配对样本。缺了配对数据,社区只能退而求其次:用模拟合成的运动伪影(在 k-space 或 magnitude 图上人为加运动)来制造配对。
模拟方法的软肋在于真实性无法自证。你在算法里加上 5 度旋转、3 mm 平移,产出的重影模式是否真的像真人点头?这个"像不像"的问题,恰恰需要一套真实的、带标注的运动伪影数据来回答——用真实数据当裁判,去检验模拟数据够不够真。这就是 MR-ART 的核心定位。
MR-ART 的设计可拆成三层:
- 配对层:同一名被试,静止(STAND)、轻度点头(HM1)、重度点头(HM2)三次采集,参数完全一致。这提供了"同源配对"——排除了个体解剖差异这个最大的混杂因素。做任何"运动导致什么变化"的分析时,被试内配对是统计效力最高、结论最干净的设计。
- 标注层:两位 >10 年经验的神经放射科医师对每张图给出 3 分制临床可用性评分(1 良好 / 2 中等 / 3 差),且对采集条件盲(不知道这张图是 STAND 还是 HM2)。这层标注回答的是"这个伪影在临床上到底有多严重"——不是算法指标,而是放射科医生会不会退回重扫的判断。
- 指标层:MRIQC v0.16.1 对每次扫描输出全套图像质量指标(IQM),其中论文重点分析 total SNR、EFC(熵聚焦准则)、CJV(联合变异系数)三个。这层回答的是"通用的工程质控指标能不能反映运动损伤"。
三层合起来,MR-ART 的价值可以写给三类人:做运动校正的(拿真实配对做验证,检验你的模型在真运动上是否有效)、做分割/形态测量的(研究运动伪影如何偏移脑体积估计与分割结果)、做自动质控的(用临床评分当标签,训练一个"这张图该不该重扫"的分类器)。
§0 读法三则:
- 本条目是"采集协议 + 临床标注 + 工程指标"三合一的真实数据资产:本体是 436 卷左右的 T1 图像(8 人缺一采),增量资产是评分与 IQM——三者的许可其实有细微差别(数据集 CC0,论文 CC BY 4.0),见 §6。
- 全文硬数字(148 人、95 女、1173 文件、4.22 GiB、1 mm³、TR 2300 等)均经论文 + OpenNeuro API + 第三方研究三源互证;唯一需要当心的口径差异(4.22 GiB vs 4.53 GB、CC0 vs CC BY 4.0)已在 §10 与附录 S 存照。
- 检索时务必区分**官方本体(OpenNeuro ds004173,CC0)**与 Kaggle 上的第三方 2D 派生集(mdfaisalkarim/mr-art-dataset,CC BY-NC 4.0,非官方)——两者许可与粒度都不同,见坑 4。
§1 数据集速览:十五问十五答
Q1:MR-ART 的"配对"到底配的是什么?
配的是同一个人。每名被试都拍了三套 T1 结构像:完全静止(STAND)、轻度点头(HM1)、重度点头(HM2)。三套之间只有"有没有动、动多少"这一个变量不同——扫描仪、线圈、序列参数、被试的头型与脑解剖全部相同。这种被试内配对设计排除了解剖差异,是研究运动效应最干净的设计。
Q2:148 人是怎么采样、怎么运动的?
2019-2021 年招募的 148 名健康成人(95 女、53 男,18-75 岁,中位 25.16 岁),无神经或精神疾病史,均签署书面知情同意。采集时屏幕中央有注视点;STAND 时要求完全不动;HM1/HM2 时每次屏幕出现匈牙利语"MOVE"提示就点一次头(矢状面方向:低头再抬头),每次提示持续 5 秒。HM1 提示 5 次、HM2 提示 10 次,均匀分布在整个采集过程中。选点头作为运动范式,是因为点头被报道为最主要、贡献最多伪影的头部运动形式。
Q3:图像是什么规格?
T1 加权 3D MPRAGE,2 倍平面内 GRAPPA 加速,各向同性 1 mm³ 分辨率。参数:TR 2300 ms、TE 3 ms、TI 900 ms、翻转角 9°、FOV 256×256 mm。扫描仪是 Siemens Magnetom Prismas 3T,配标准 20 通道头颈接收线圈,在匈牙利布达佩斯 Research Centre for Natural Sciences 脑成像中心完成。
Q4:谁是"真值",谁说了算?
没有单一的"真值"标签,而是两套互补的质量标注:(a)临床伪影评分——两位 >10 年经验的神经放射科医师视觉检查每张图,对采集条件盲,给 1(临床良好)/2(中等)/3(差,临床不可用)三档;(b)MRIQC 的通用 IQM。前者是"临床能不能用",后者是"工程上质量如何"。
Q5:临床评分怎么保证一致性?
两位医师先在 100 张独立结构扫描上协调了评分标准,然后在整个标注过程中被鼓励讨论不确定的病例,以尽量提高评分的稳健性。每张扫描由其中一位医师评定。
Q6:图像里能不能认出人脸?隐私怎么处理?
面部信息已用 PyDeface v2.0.0 去除;图像按 BIDS(Brain Imaging Data Structure)组织并去标识;被试在 OpenNeuro 上传时确认了结构扫描已去脸。数据集采用 CC0 公共领域奉献,这也是隐私伦理与开放共享的平衡结果。
Q7:有多少数据、多大?
1173 个文件,约 4.22 GiB(4,526,466,554 字节)。148 人 × 3 条件理论上 444 卷,但有 8 名被试的 HM1 或 HM2 之一因采集问题缺失,实际扫描卷数略低于 444(OpenNeuro 未单列扫描卷数,论文只说明缺失事实)。
Q8:数据在哪、怎么拿?
OpenNeuro,登录号 ds004173,最新版本 v1.0.2(2022-10-18)。直接网页下载、或用 DataLad/Git 从 https://github.com/OpenNeuroDatasets/ds004173.git 拉取。无需注册、无需申请、无 DUA——许可 CC0。
Q9:为什么这个数据集被反复引用?
因为它是真实运动配对数据的稀有样本。多篇运动校正论文(PLOS ONE 2024 的运动模拟真实性评估、arXiv 2608.10170 的 SSRL-MAR、Phys Med Biol 的 Res-MoCoDiff、Int J Biomed Imaging 2024 的 MACS-Net)都用它做 in-vivo 验证或运动模拟校准——这些研究大多用 IXI/HCP 合成运动来训练,再用 MR-ART 的真实运动来检验。
Q10:它对 AI-Ready 的意义是什么?
它是库内少见的"全开放 + 高标注密度"样本:CC0 无门槛、BIDS 标准格式、配对设计自带对照、两套质量标注互补。AI-Ready 检查单上几乎全绿——唯一的小扣分是单中心单扫描仪带来的泛化性边界。
Q11:数据里有没有不止这三套扫描?
本体是每人的三套 T1w 采集;此外每卷都配了 MRIQC 的派生指标(JSON+HTML)与临床评分(TSV)。这些派生品不改变"三条件 × 148 人"的主结构,但显著提升了每卷的信息密度——这是 MR-ART 相对普通脑影像集的标注优势。
Q12:它用的是哪台扫描仪,这会成为问题吗?
Siemens Magnetom Prismas 3T、20 通道头颈线圈,全部数据来自这一台机器、一个中心。好处是参数一致性极高;坏处是跨厂商/跨场强的泛化性从未被验证——你在 Prismas 上导出的运动伪影模式,未必在 GE/Philips 或 1.5T 上一样。做跨中心部署研究时要显式声明这一约束。
Q13:能不能只研究"两档运动强度"的效应?
可以,这是它的设计初衷之一。HM1(5 次点头)与 HM2(10 次点头)构成一个天然的两水平运动强度自变量,你可以直接比较两档下的 IQM 与临床评分差异,把 STAND 当作零运动基线。
Q14:数据集发布后有过更新吗?
有。OpenNeuro 上经历了 Draft(2022-06-22)→ v1.0.0 → v1.0.1 → v1.0.2(2022-10-18)四个快照,此后未再更新。当前标准引用版本是 v1.0.2。
Q15:如果我只想要"干净"的脑图,MR-ART 合适吗?
未必最优。它的 STAND 图确实是配对里的"干净"参照,但因含自发微动,未必都达到临床高分(score 1)。若你的目标是纯干净训练集,建议用临床评分筛选 score 1 的 STAND 图,或考虑专门的健康脑 MRI 集(如库内 IXI,rid 482)。
§2 数据构成与规格
2.1 规模与被试构成
MR-ART 的基础单元是"被试 × 采集条件"。核心硬数字(三源互证)如下:
| 维度 | 数值 | 来源 |
|---|---|---|
| 被试数 | 148 名健康成人 | 论文 + OpenNeuro API subjects 列表(148) |
| 性别 | 95 女 / 53 男 | 论文(“95 female”);第三方研究转述明确 53 男 |
| 年龄 | 18–75 岁;中位 25.16 岁;IQR 10.50 岁 | 论文 Methods |
| 采集时间窗 | 2019–2021 | 论文 Methods |
| 每人扫描数 | 3 套(STAND / HM1 / HM2) | 论文 |
| 缺失 | 8 名被试 HM1 或 HM2 之一缺失 | 论文 Methods |
| 文件总数 | 1173 | OpenNeuro API totalFiles |
| 体积 | 4,526,466,554 字节 ≈ 4.22 GiB ≈ 4.53 GB | OpenNeuro API size |
| 模态 | MRI(结构 T1w) | OpenNeuro summary.modalities |
三点值得注意:
- 年龄偏年轻:中位 25.16 岁、IQR 10.50 岁,虽覆盖 18-75 岁全成人跨度,但明显偏向年轻成人。运动行为(尤其是按指令点头的依从性)在年轻人与老年人之间可能有系统差异,跨年龄结论要小心。
- 健康样本:所有被试无神经/精神疾病史。这意味着数据里的运动是"健康人刻意做的运动",而非病人(如帕金森、痴呆、儿童)不受控的自发运动。临床场景的运动模式可能更复杂、更不规则——这是泛化性的一条硬边界。
- 缺失是随机的还是系统的:论文只说"因采集问题,8 名被试的 HM1 或 HM2 之一缺失",未指明是 HM1 还是 HM2 更多、也未给被试编号。对配对分析而言,这 8 人只能做二人配对(STAND + 一个运动档),使用者需自行在数据里识别。
2.2 采集协议:三条件如何制造两档运动
三套扫描的唯一设计差异是头部运动的指令强度:
| 条件 | BIDS acquisition 标签 | 运动指令 | 提示次数 | 每次时长 |
|---|---|---|---|---|
| 静止 | standard |
完全不动,注视屏幕中央定点 | — | — |
| 轻度运动 | headmotion1(HM1) |
每次提示点一次头(矢状面) | 5 次 | 5 秒 |
| 重度运动 | headmotion2(HM2) |
每次提示点一次头(矢状面) | 10 次 | 5 秒 |
协议细节:患者眼前屏幕中央有固定注视点,要求注视;“MOVE”(匈牙利语)字样出现即点头;受试者被要求点头时不要把头部抬离扫描床,每次点头后回到原位。选"点头"作为运动范式,是因为文献报道点头是最主要的头部运动类型,贡献了多数运动伪影。
这里有一个容易被忽略的设计分野:指令运动 ≠ 自发运动。指令运动(nod on cue)是受控的、可重复的、时间可控的,这让"两档运动强度"成为一个可解释的自变量。但真实临床里病人不会按提示点头——他们是随机、渐进、可能持续的自发运动。所以 MR-ART 测的是"受控运动下的伪影行为",对未来做运动程度分级质控的研究尤为合适,对"完全复现临床运动"则要打折扣。
2.3 文件结构与 BIDS 组织
数据严格按 BIDS 组织,工具链为:
- dcm2bids v2.1.6:DICOM 转换 + BIDS 目录组织
- PyDeface v2.0.0:面部信息去除(保护隐私)
- MRIQC v0.16.1:图像质量指标生成
关键目录/文件:
| 路径 | 内容 |
|---|---|
sub-<ID>/ |
每名被试的目录,内含结构像与 scans 文件 |
| acquisition 标签 | standard / headmotion1 / headmotion2 |
participants.tsv |
被试级信息(含年龄、性别,按 BIDS 标准) |
/derivatives/mriqc-0.16.1/ |
MRIQC 全量报告 |
/derivatives/scores.tsv |
逐扫描临床伪影评分汇总(1/2/3) |
group_T1w.tsv / group_T1w.html |
MRIQC 组级汇总表与报告 |
| 每扫描 JSON | 该扫描的 IQM(BIDS 惯例) |
MRIQC 报告的文件名与结构像文件名一一对应,便于程序化关联"这张图 ↔ 它的质量指标"。临床评分则同时落在被试文件夹内的 scans 文件与 /derivatives/scores.tsv 汇总,编码为 1=临床上良好、2=中等、3=差质量。
2.4 三重标注体系:把"质量"拆成三个视角
MR-ART 最耐看的部分是它的标注密度——同一批图像被三套标准同时刻画:
| 标注层 | 产出 | 视角 | 粒度 |
|---|---|---|---|
| 临床可用性 | 3 分制伪影评分(1/2/3) | 神经放射科医师的诊断视角 | 逐扫描 |
| 工程质量 | MRIQC 全套 IQM(重点 total SNR / EFC / CJV) | 图像处理的量化视角 | 逐扫描 |
| 采集条件 | standard / headmotion1 / headmotion2 | 实验设计的自变量视角 | 逐扫描 |
三套标签的交集才是这个数据集的真正用法:你可以问"当临床医师说这张图’差’(score 3)时,MRIQC 的 CJV 涨了多少"(Fig 3),也可以问"HM2 条件下有多少比例的图被判为 score 3"(Fig 4),还可以反过来——用临床评分训练一个自动质控模型,再看它在 MRIQC 指标上的表现。论文的 Technical Validation 节正是围绕这三层交叉展开的(详见 §7)。
2.5 与模拟运动数据集的关系边界
MR-ART 常被拿来与"模拟运动数据集"对照,两者的差异是本质性的:
| 维度 | MR-ART(真实) | 模拟运动数据集 |
|---|---|---|
| 运动来源 | 真实受试者按指令点头 | 算法在 k-space 或 magnitude 域人为添加 |
| 配对保证 | 同人同机构同参数的三次采集 | 由干净图合成,配对天然完美 |
| 真实性 | 天然真实(就是真运动) | 依赖模拟模型的逼真度,需外部验证 |
| 可扩展性 | 受试者招募成本高,规模受限 | 可无限生成,覆盖任意运动参数 |
| 典型用法 | 验证/校准模拟与模型 | 训练数据主力 |
正因为两者互补,社区形成了"用模拟数据训练 + 用 MR-ART 验证"的标准套路——这也是 MR-ART 被高频引用的直接原因(§7、§9 详述)。
2.6 一份给复现者的清单:数据到手后先做什么
初次拿到 MR-ART 的人容易一头扎进建模,先把数据摸清楚会更稳。建议按以下顺序做一次"数据体检":
| 步骤 | 动作 | 目的 |
|---|---|---|
| 1 | 读 dataset_description.json 与 README |
确认版本、许可、作者 |
| 2 | 统计 sub-* 目录数 |
核对是否为 148 |
| 3 | 打开 participants.tsv |
核对年龄/性别,验证 95 女 53 男的构成 |
| 4 | 遍历各 anat 目录 | 识别只有两套扫描的被试(8 人缺失) |
| 5 | 加载 derivatives/scores.tsv |
确认评分覆盖所有扫描、编码 1/2/3 |
| 6 | 关联 MRIQC JSON | 确认每卷都有对应 IQM 文件 |
| 7 | 抽样目视 | 直观看 STAND/HM1/HM2 的伪影差异 |
| 8 | 画 IQM 分布 | 按条件与评分分组,感受趋势 |
完成这八步,你对数据的分布、缺失、标注边界就有了第一手认识——后续任何研究问题的建模都建立在这个基础之上。
2.7 数据集的"最小可用切片"
如果你的研究只关心一个窄问题,MR-ART 可以裁成更小的可用切片:
| 研究问题 | 最小所需数据 |
|---|---|
| 运动校正算法验证 | 全部 148 人的配对(STAND + HM1/HM2) |
| 两档运动强度效应 | 140 人三人配对(剔除缺一采的 8 人) |
| 自动质控分类 | 全部扫描 + scores.tsv 评分 |
| MRIQC 指标校准 | IQM JSON + 采集条件标签 |
| 分割鲁棒性 | STAND/HM1/HM2 三条件 + 你的分割工具 |
这种"按问题切片"的用法,正是高标注密度数据集的价值所在——同一份数据能支撑多种粒度的研究,而不必为每个问题重新采集。
§3 采集协议与标注流程
3.1 采集的完整参数表
对复现者而言,MR-ART 的采集参数是它"可复现性"的物理基础——相同的参数意味着你拍的图与数据集里的图在信号层可比:
| 参数 | 值 |
|---|---|
| 扫描仪 | Siemens Magnetom Prismas 3T(Siemens Healthcare GmbH, Erlangen, Germany) |
| 线圈 | 标准 Siemens 20 通道头颈接收线圈 |
| 序列 | T1 加权 3D MPRAGE(磁化准备快速梯度回波) |
| 加速 | 2 倍平面内 GRAPPA |
| 空间分辨率 | 各向同性 1 mm³ |
| TR(重复时间) | 2300 ms |
| TE(回波时间) | 3 ms |
| TI(翻转时间) | 900 ms |
| FA(翻转角) | 9° |
| FOV | 256 × 256 mm |
| 采集地点 | Brain Imaging Centre, Research Centre for Natural Sciences(匈牙利布达佩斯) |
| 采集时间 | 2019–2021 |
对比常见的临床 T1 协议,这套 MPRAGE 参数是标准的"研究级高分辨结构像"配置:1 mm³ 各向同性保证可以做精细的皮层与亚皮层分割,2 倍 GRAPPA 缩短采集时间(也间接影响对运动的敏感性)。TR/TE/TI/FA 的取值属于 Prismas 上 T1 MPRAGE 的常见档位。
3.2 运动指令的实操流程
运动制造是一个"提示-响应"的闭环:
- 注视:屏幕中央持续显示固定注视点,受试者被要求始终注视该点(这本身是减少自发运动的手段)。
- 提示:Hungarian 语单词 “MOVE” 出现在屏幕上,每次持续 5 秒。
- 响应:受试者看到提示即做一次点头——头部沿矢状面(低头再抬头)。
- 归位:要求每次点头后把头恢复到原始位置,且点头过程中不将头抬离扫描床。
- 次数:HM1 全程提示 5 次,HM2 全程提示 10 次,均匀间隔分布在整个采集时序中。
这套设计的巧妙之处在于运动的数量是唯一被操纵的变量:HM1 与 HM2 的差别只是"点几次头",而非"怎么点"。因此两档运动的伪影差异可归因于运动次数(累积运动量),而非运动模式的改变。代价是运动幅度没有被独立控制——每个被试点头的幅度(角度)是自发的、不可控的,这让 HM1/HM2 的实际运动量在被试间有一定散布。
3.3 临床评分:盲评 + 一致性协调
临床伪影评分是 MR-ART 相对多数运动数据集的关键增量。其流程设计如下:
| 环节 | 做法 |
|---|---|
| 评分者 | 两位神经放射科医师,均 >10 年经验 |
| 盲法 | 对采集条件(STAND/HM1/HM2)盲——看图时不知道这是哪一档 |
| 量表 | 3 分制:1=临床良好;2=中等;3=差(临床诊断不可用) |
| 评分分配 | 每张扫描由其中一位医师评定(非双评) |
| 一致性协调 | 先在 100 张独立结构扫描上统一评分标准;全程鼓励讨论不确定病例 |
三个要点:
- 盲评是关键。如果医师知道"这张图来自 HM2 条件",评分会被条件预期锚定(倾向于给差评)。盲评让评分反映的是图像本身呈现的质量,而非采集条件的先验。
- "差"的定义带临床分量:score 3 被明确定义为"对临床诊断不可用"——这是一个真正影响临床决策的阈值(医生看到这样的图会要求重扫)。因此这套评分天然适合训练"该不该重扫"的分类器。
- 协调程序降低但未消除异质性:100 张的校准 + 讨论机制提高了评分一致性,但论文未报告评分者间 Kappa(因为每张图只由一人评),也未披露每张图是哪位医师评的。这意味着使用者无法评估评分的评分者间可靠度——这是一个真实的信息缺口(见 §10 坑 6)。
3.4 两类质量标签的关系:为什么两者都要
临床评分(医师主观)与 MRIQC 指标(算法客观)看似冗余,实则互补:
| 维度 | 临床评分 | MRIQC IQM |
|---|---|---|
| 判据 | 诊断可用性(整体、语义) | 图像统计量(局部、物理) |
| 优势 | 贴近临床决策,综合判断 | 可自动计算,逐扫描可扩展 |
| 弱点 | 主观、人力密集、3 档粗粒度 | 无参照标准,绝对值难解读 |
| 典型用途 | 训练/评测自动质控模型 | 大规模质控初筛 |
论文明确点出 MRIQC 的解读难点:MRIQC 不参照任何标准数据集,因此单个 IQM 的绝对值不好解释。而 MR-ART 的配对设计恰好补上这一环——你可以把同一名被试的 STAND 图当作它自己 HM1/HM2 图的内部参照,从而把"绝对值"转成"被试内差异",使 IQM 的变化变得可解释。这正是论文 Technical Validation 节的分析思路(§7)。
3.5 一个方法论注脚:配对设计为何比横断面设计更强
如果把 MR-ART 想象成一项实验,它的设计是被试内(within-subject)三水平设计:每名被试都经历 STAND/HM1/HM2 三种处理。相比"招募一组不动的人和另一组动的人"的横断面设计,被试内设计有两个决定性优势:
- 消除个体差异混杂:脑解剖的个体差异巨大(脑体积、皮层厚度因人而异),横断面设计里这些差异会淹没运动效应;被试内设计里,个体是它自己的对照,运动效应直接以差值的形态浮现。
- 统计效力更高:同一批被试做重复测量,样本量相当于被"放大"——148 人做 3 条件的配对比较,等效于更大规模的横断面研究。
代价是顺序效应与疲劳效应的可能:三套扫描的先后顺序若固定(如总是先 STAND 再 HM1 再 HM2),后采集的图可能受被试疲劳、头动习惯改变影响。论文未详细披露三条件的随机化/轮换方案,这是复现设计时的注意点(§10)。
3.6 与临床采集现实的差距:一张对照表
复现者最容易犯的判断错误,是把 MR-ART 的运动分布当作临床现实的代表。下表把二者并置:
| 维度 | MR-ART 采集 | 临床真实采集 |
|---|---|---|
| 运动触发 | 屏幕提示(被动响应) | 自发(无提示) |
| 运动次数 | HM1 = 5、HM2 = 10(固定) | 随机、不可预测 |
| 运动幅度 | 由被试自行决定(有散布) | 从微动到剧烈,分布未知 |
| 运动持续时间 | 单次点头(秒级) | 可能持续整个扫描 |
| 被试状态 | 健康、配合、知情 | 可能疼痛、焦虑、认知障碍、儿童老人 |
| 场强/线圈 | 单一(3T,20ch) | 多厂商多场强多线圈 |
这张表不是要贬低 MR-ART,而是要标定它在方法学光谱上的位置:它测的是"受控运动"的效应,而非"临床运动"的分布。研究者若要用它训练能在真实临床图像上工作的模型,必须清楚这条边界——否则会出现"验证集上表现好、临床部署时失灵"的典型落差。
3.7 一个常被忽视的细节:注视点本身也是控制变量
论文特别提到采集期间屏幕中央有固定注视点、受试者被要求注视该点。这个细节有两层意义:
- 减少自发运动:注视一个固定点是标准的减少头动手段——被试有事可看,就不会东张西望带出额外运动。这保证了 STAND 条件尽量"干净"。
- 任务一致性:三个条件下被试都做同一件事(看注视点),只有"是否按提示点头"这一个变量被操纵。这让三条件的对比真正是"单变量"的。
对复现者的启示:如果你要复刻这套协议,注视点不是可选项——它是让"静止条件确实静止"的必要装置。
§4 数据规格与质量指标
4.1 逐扫描的数据单元
MR-ART 的原子单元不是"被试",而是"被试 × 采集条件"的这一卷扫描。每卷扫描携带:
| 数据项 | 载体 | 说明 |
|---|---|---|
| T1w 结构像 | NIfTI(BIDS) | 3D MPRAGE 体积,1 mm³ |
| 临床伪影评分 | scans 文件 + /derivatives/scores.tsv |
1 / 2 / 3 |
| MRIQC IQM | 每扫描 JSON | 全套图像质量指标 |
| acquisition 标签 | 文件名/JSON | standard / headmotion1 / headmotion2 |
| 被试级信息 | participants.tsv |
年龄、性别 |
结构像与 IQM 通过文件名一一对应——这是"图像 ↔ 质量指标"可程序化关联的设计,也是做大规模质控研究的基础。
4.2 三个重点 IQM:SNR / EFC / CJV
MRIQC 输出大量指标,论文选择三个重点展示运动与质量的关联:
| 指标 | 全称 | 物理含义 | 运动会怎样影响它 |
|---|---|---|---|
| total SNR | 总信噪比(Signal-to-Noise Ratio) | 信号强度与噪声水平之比 | 运动导致信号弥散与重影,通常降低有效 SNR |
| EFC | 熵聚焦准则(Entropy Focus Criterion) | 图像在空间上的"聚焦"程度;伪影使图像发散、背景能量上升 | 运动使背景出现鬼影,熵上升、聚焦变差 |
| CJV | 联合变异系数(Coefficient of Joint Variation) | 类内强度变异之和除以类间均值之差;衡量组织对比的"干净"程度 | 运动模糊组织边界,使类内变异增大 |
论文用这三个指标做了两类对比:
- 跨采集条件(Fig 2a):STAND vs HM1 vs HM2 下三个 IQM 的分布——看运动越多,指标是否系统性变差。
- 跨临床评分(Fig 3a):score 1 vs 2 vs 3 下三个 IQM 的分布——看临床判"差"的图,工程指标是否也判差。
并各自配上被试内差异版本(Fig 2b:相对 STAND 的差异;Fig 3b:相对临床良好扫描的差异),把绝对值不可解读的问题转化为相对量。
4.3 Fig 4:两套分类的交叉
Fig 4 呈现每个采集条件下临床评分的分布(3 个并列条形图,每图内三家 score 1/2/3 的计数)。这张图回答一个关键问题:采集条件(客观操纵)与临床评分(主观判断)到底有多同步?
按设计预期:STAND 图应以 score 1 为主,HM2 图应以 score 3 为主,HM1 居中。但真实的分布不会是干净的台阶——总会有一部分 STAND 图因自发微动被判中等、一部分 HM2 图因受试者点得轻而被判良好。这种"不干净的对应"恰恰是数据集的价值:它反映了指令运动与实际伪影程度之间的解耦,也说明单靠采集条件无法替代逐图的临床评分。
(论文 Fig 2/3/4 的具体分布数值仅以图形呈现,正文未给逐格计数,本条目不臆造具体数字——见 §10 遗留疑点。)
4.4 规格速查:复现者必须记住的六个数
| 数 | 值 | 意义 |
|---|---|---|
| 1 mm³ | 各向同性体素 | 高分辨,支持精细分割与形态测量 |
| 2300 / 3 / 900 / 9° | TR/TE/TI/FA | MPRAGE 序列指纹,跨数据集比较时的参数锚 |
| 3T | 场强 | 单中心单场强,泛化边界 |
| 148 / 95 / 53 | 人数 / 女 / 男 | 样本构成 |
| 5 / 10 | HM1 / HM2 提示次数 | 两档运动强度的操纵量 |
| 1/2/3 | 临床评分量表 | 良好 / 中等 / 差(不可用) |
4.5 数据完备性与使用前置检查
拿到数据后、正式使用前,建议做四项前置检查:
- 被试计数核对:确认
sub-*目录数为 148;核对participants.tsv行数一致。 - 缺失识别:找出只含两套扫描的被试(8 名缺失 HM1 或 HM2 之一),决定这些被试是排除、还是用剩余的二人配对。
- 评分对齐:把
/derivatives/scores.tsv与被试目录内的 scans 文件对齐,确认评分覆盖所有扫描且无漏标。 - IQM 关联:验证每张结构像都有对应的 MRIQC JSON,文件名可程序化匹配。
这四项检查做完,你才能干净地回答研究问题"运动条件如何影响临床评分与 IQM"——否则可能把缺失或错配当成信号。
§5 技术验证:论文如何证明数据集可用
5.1 验证三问
Scientific Data 的 Technical Validation 节要求作者证明数据"经得起使用"。MR-ART 的验证围绕三个问题展开:
- 运动是否真的改变了图像质量?(采集条件 → IQM)
- 临床评分是否与图像质量一致?(临床评分 → IQM)
- 两套质量分类彼此吻合吗?(采集条件 ↔ 临床评分的分布)
5.2 采集条件对 IQM 的影响(Fig 2)
论文用 total SNR、EFC、CJV 三个指标,比较 STAND/HM1/HM2 三条件下的分布(Fig 2a),并给出被试内差异(Fig 2b:HM1−STAND、HM2−STAND)。
方法学关键点在于配对比较:MRIQC 的 IQM 绝对值难解读(无参照标准),但同一名被试的两次扫描之差排除了个体差异,让"运动使 IQM 变差"的判断变得可靠。论文据此论证:配对设计使 MR-ART 的 IQM 具有可比性,弥补了 MRIQC 单独使用时"绝对值无参照"的缺陷。
5.3 临床评分与 IQM 的关系(Fig 3)
第二组分析把 IQM 按临床评分分组(Fig 3a:score 1/2/3 的分布),并给相对临床良好扫描的被试内差异(Fig 3b:score 2−score 1、score 3−score 1)。
这组分析的意义是双重验证:如果临床判"差"的图在工程指标上也系统性偏离,说明两套质量体系互相印证;如果两者不完全一致,则说明临床判断捕捉到了工程指标遗漏的东西(或反之)。无论结果如何,这都为"用 IQM 做自动质控"提供了校准依据。
5.4 采集条件与临床评分的交叉(Fig 4)
Fig 4 是两套分类的交叉分布——每个采集条件下 score 1/2/3 的计数。它量化了"指令运动"与"临床可用性"的对应强度,也暴露了二者之间的松动(如 STAND 条件下仍可能有被判中等的图)。
5.5 验证的边界与诚实说明
论文在 Usage Notes 中对数据的异质性做了正面说明,值得原样转述其精神:测量条件对应真实世界场景,因此数据本身存在异质性——而这种异质性保证了案例的良好表征,对生成泛化模型至关重要。同时论文指出,使用者可以借助 MRIQC IQM 与临床评分按自己的质量标准筛选子集(例如只用 score 1 的图做干净训练集,或只用 score 3 的图做困难测试集),从而主动控制异质性程度。
这是 MR-ART 设计哲学的核心:它不假装自己是"完美干净的基准",而是提供带质量标签的真实数据,把"要多干净"的选择权交给使用者。
§6 获取与许可:无门槛的 CC0 直链
6.1 三件资产、三种许可、一个直链
MR-ART 涉及的许可与获取方式如下:
| 资产 | 入口 | 许可 | 门槛 |
|---|---|---|---|
| 数据集本体 | OpenNeuro ds004173 v1.0.2 |
CC0(公共领域奉献) | 无(网页下载或 DataLad/Git) |
| 论文 | doi:10.1038/s41597-022-01694-8 | CC BY 4.0(Scientific Data 开放获取) | 无 |
| Kaggle 第三方 2D 派生集 | mdfaisalkarim/mr-art-dataset |
CC BY-NC 4.0(个人上传,非官方) | Kaggle 账号 |
关键区分:数据集本体是 CC0(可自由使用、修改、再分发、商用,法律上无需署名),而描述它的论文是 CC BY 4.0(署名即可自由使用)。两者是不同资产、不同许可——引用时不要混为一谈(见坑 5)。
6.2 数据集本体:三种获取方式
- 网页直接下载:访问
https://openneuro.org/datasets/ds004173/versions/1.0.2,可选下载整个数据集或按需选取文件。 - DataLad / Git 克隆(推荐,支持增量与版本管理):
若只想要结构像,可用# 通过 GitHub 镜像仓库(OpenNeuro 官方提供) datalad clone https://github.com/OpenNeuroDatasets/ds004173.git cd ds004173 datalad get . # 拉取所有文件内容datalad get sub-*/*/anat/*.nii.gz选择性拉取。 - 程序化获取:OpenNeuro 提供 GraphQL API 用于枚举快照、文件清单与元数据;也可借助 Brainlife.io、NEMAR、CBRAIN、Neurodesk 等第三方平台挂载数据。
版本选择建议:论文引用的是 v1.0.2(最新,2022-10-18)。历史版本 v1.0.0(2022-06-28)、v1.0.1(2022-08-23)可用但不推荐——除非你要复现某个特定时点的分析。
6.3 数据集 DOI 与版本链
| 版本 | 快照日期 | DOI 后缀 |
|---|---|---|
| Draft | 2022-06-22 | — |
| v1.0.0 | 2022-06-28 | ds004173.v1.0.0 |
| v1.0.1 | 2022-08-23 | ds004173.v1.0.1 |
| v1.0.2 | 2022-10-18 | ds004173.v1.0.2 |
数据集的正式 DOI 形如 doi:10.18112/openneuro.ds004173.v1.0.2——OpenNeuro 为每个快照分配可引用的 DOI。论文转引 v1.0.2,这是当前标准引用版本。
6.4 引用规范
数据集团队明确要求:若使用这些数据,请引用数据集本身以及发表于 Scientific Data 的论文。规范做法是同时给出两条引用:
- 数据引用:Nárai Á, Hermann P, Auer T, et al. Movement-related artefacts (MR-ART) dataset. OpenNeuro. doi:10.18112/openneuro.ds004173.v1.0.2
- 论文引用:Nárai Á, Hermann P, Auer T, et al. Movement-related artefacts (MR-ART) dataset of matched motion-corrupted and clean structural MRI brain scans. Sci Data 9, 630 (2022). doi:10.1038/s41597-022-01694-8
即便 CC0 法律上不强制署名,学术惯例仍要求引用——这既是对数据生产者的尊重,也是让数据可追溯、可复现的基础。
6.5 AI-Ready 评估:库内的"全绿样本"
用库内 AI-Ready 检查单逐项过一遍:
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | 数据集 DOI(每快照一个)+ 论文 DOI |
| F2 富元数据 | ✅ | BIDS 组织 + participants.tsv + IQM JSON + 评分 TSV |
| A1 可访问协议 | ✅ | CC0 + OpenNeuro 直链 + DataLad,无任何门槛 |
| A2 元数据可访问 | ✅ | 元数据完全开放 |
| I1 互操作格式 | ✅ | NIfTI(神经影像通用)+ JSON/TSV(标准格式) |
| I2 词汇表引用 | ✅ | BIDS 标准 + MRIQC 标准指标 + 临床评分明确定义 |
| R1 来源溯源 | ✅ | 采集协议、参数、伦理批号全公开 |
| R3 可复现流程 | ✅ | 工具链(dcm2bids/PyDeface/MRIQC)版本明确 |
综合评级:极高(库内罕见)。MR-ART 是"开放科学最理想形态"的一个样本:CC0 无门槛、BIDS 标准、标注密度高、工具链透明。它唯一的边界不是"可获取性"而是"泛化性"——单中心、单扫描仪、健康成人、指令运动,这些是数据科学价值的内在约束,而非文档缺陷。
6.6 与库内可获取性光谱的对照
库内数据集的可获取性从"注册墙"到"公开直链"形成光谱。MR-ART 落在最开放的端点:
| 档位 | 库内参照 | 本条目 |
|---|---|---|
| 注册墙(最严) | LMC2 类(注册+审批) | — |
| 请求制 | PANDA-PLUS 掩码类 | — |
| 平台托管 | Zenodo 型 | — |
| 公开直链 + 无版权限制 | HF/Zenodo 直链型 | MR-ART(CC0 + OpenNeuro) |
对照库内 OpenNeuro 平台条目(rid 100),MR-ART 是 OpenNeuro 生态里"CC0 + 高标注 + 配对设计"的典型代表。与同为脑 MRI 的 IXI(rid 482)相比,两者都开放,但 MR-ART 的独特性在于配对设计 + 临床评分——IXI 是注释较少的横断面多序列集,MR-ART 是标注密集的纵向配对集。
6.7 获取失败时的排查清单
即便 CC0 无门槛,实际下载也可能遇到问题。常见情况与处置:
| 症状 | 可能原因 | 处置 |
|---|---|---|
| DataLad clone 无内容 | 只 clone 了 git 元数据,未 datalad get |
进入目录执行 datalad get . |
| 下载中断 | 大文件 4.22 GiB 网络抖动 | 用 datalad get 续传,或分批按路径取 |
| GitHub 镜像不可达 | 网络/代理限制 | 改用 OpenNeuro 网页端下载或 S3 网关 |
| 文件校验失败 | 传输损坏 | 用 DataLad 重新 get 该文件(有校验机制) |
| 版本对不上论文 | 取了旧快照 | 明确 checkout v1.0.2 |
DataLad 的价值在于内容寻址 + 可续传 + 版本可切——对 4 GiB 级的神经影像数据,这是比裸下载更稳的方式。
§7 生态与影响:它撑起了哪些研究线
7.1 三条被高频使用的下游研究线
MR-ART 的引用生态可以归为三条线,每条都揭示了它的一个侧面:
线 1:运动模拟的真实性验证。最典型的是 PLOS ONE (2024) 的研究(doi:10.1371/journal.pone.0301132)——它先用 148 名 MR-ART 被试的真实运动数据评估"在 magnitude 域模拟运动"到底有多真,用 CJV/SNR/CNR 三个 IQM 比较真实运动图与模拟运动图。关键结论:修改后的运动模拟框架比原始 TorchIO 模拟更接近真实(CJV/SNR/CNR 平均差异从 0.015±0.061 / 0.2±2.0 / −0.29±0.62 降到 0.004±0.054 / −0.7±1.8 / −0.09±0.55);在分割 Dice 系数上,修改版模拟与真实运动的差异(0.03±0.06)也小于原始模拟(−0.15±0.09)。研究还发现 SynthSeg+ 对真实与模拟运动都最鲁棒。这条线说明 MR-ART 是"裁判"角色——用真值检验模拟的有效性。
线 2:运动校正算法的 in-vivo 验证。arXiv 2608.10170 的 SSRL-MAR(自监督表征学习做 3D 脑 MRI 运动校正)用 IXI(581 卷)+ HCP(1113 卷)的模拟运动训练,用 MR-ART(148 卷)的真实运动做外部验证。Res-MoCoDiff(Phys. Med. Biol.,IOPscience 10.1088/1361-6560/ae1110)同样:IXI 训练 + MR-ART 148 例 in-vivo 评估,报告 NMSE/SSIM/PSNR 三个指标。MACS-Net(Int J Biomed Imaging 2024,PMC11081754,Swin + UNet)则把 MR-ART 的 148 例(95 女 53 男)按 80 训练 / 48 验证 / 20 测试划分,每例取 179 张矢状 256×256 切片。这条线的共同模式是"合成训练 + 真实验证"——MR-ART 是那个不可替代的"真实考场"。
线 3:分割与形态测量的鲁棒性研究。MR-ART 自己的相关前作 Kemenczky et al.(Sci. Rep. 12, 1618, 2022)就用本数据集的图像证明:不同深度学习全脑分割方法对运动伪影的可靠性存在差异。这条线把运动伪影从"图像质量问题"提升为"下游量化偏差问题"——运动不仅让图难看,还系统性地偏移脑体积、皮层厚度的估计,甚至制造"假萎缩"。
7.2 为什么"配对 + 真实"是稀缺品
三条研究线都指向同一个事实:MR-ART 的不可替代性来自"配对"与"真实"这两个属性的叠加。
| 属性组合 | 代表数据 | 能否做运动校正的真值验证 |
|---|---|---|
| 真实 + 非配对 | 临床常规扫描(运动图多,干净图少) | 不能(缺配对真值) |
| 合成 + 配对 | 模拟运动数据集(如 DS004795 类) | 部分(真值来自合成,需外部校准) |
| 真实 + 配对 | MR-ART | 能(唯一直接回答) |
这个 2×2 表格解释了 MR-ART 的生态位:它是唯一能同时提供"真实运动"与"干净配对"的公开数据集。模拟数据集可以无限生成、可以精确控制运动参数,但它的真值终究是合成出来的;临床数据是真实的,但没有配对参照。MR-ART 用"请健康人按指令运动"这一招,人工制造出了本该不存在的配对。
7.3 与其他脑 MRI 数据集的库内对照
| 数据集 | 库内 rid | 模态/对象 | 核心特征 | 与 MR-ART 的关系 |
|---|---|---|---|---|
| IXI | 482 | 结构脑 MRI(多序列) | 近 600 例健康脑,注释少 | 常与 MR-ART 配对使用(IXI 训练 + MR-ART 验证) |
| ADNI | 101 | 阿尔茨海默病队列 | 纵向、多模态、临床 | 运动伪影是弱势人群采集的核心质控痛点 |
| OASIS | 21 | 脑影像系列 | 横断面+纵向,多年龄 | 结构脑 MRI 家族 |
| HBN | 245 | 儿童青少年脑队列 | 高运动人群 | 论文引文明确关注 developing population 运动问题 |
| UK Biobank | 569 | 人群队列超大规模 | 数万人影像 | 运动伪影是规模化质控首要难题 |
| CMRxMotion | 687 | 心脏 MRI 呼吸运动 | 运动伪影主题 | 同主题不同器官/模态 |
| BigBrain | 285 | 超高分辨率脑图谱 | 组织学图谱 | 神经科学家族 |
其中 IXI(rid 482)与 MR-ART 的耦合最紧——多篇运动校正论文把两者配成一对(合成训练集 + 真实验证集)。如果读者研究运动校正,这两个条目应连读。
7.4 生态影响的一句话概括
MR-ART 在神经影像社区扮演的是"配对标尺"的角色:它自己不是最亮眼的模型或最大的数据集,但没有它,整个"模拟训练、真实验证"的方法学范式就缺少可比的基准面。它的被引广度(运动校正、分割鲁棒性、质控算法、运动模拟校准)正说明了这种基础设施式的价值——好数据集不总是最耀眼的,而是最被依赖的。
7.5 从引用图谱看数据集的生命周期
把 MR-ART 的引用生态按时间摊开,能看到一个数据集从"发布"到"基础设施化"的典型曲线:
| 阶段 | 时间 | 典型用法 | 代表工作 |
|---|---|---|---|
| 自发使用 | 2022-2023 | 同组自用 + 首批外部引用 | Kemenczky 2022(分割鲁棒性) |
| 方法验证标配 | 2024 | 运动校正论文的 in-vivo 验证集 | MACS-Net、Res-MoCoDiff、PLOS ONE 模拟验证 |
| 基准化 | 2025-2026 | 成为"真实运动"的标准对照 | SSRL-MAR(arXiv 2608.10170) |
这条曲线的意义在于:一个数据集的价值往往不在发布当年,而在它被后续工作"默认采用"之后。MR-ART 的 2022 年发布只是起点,它真正的生态位是 2024 年后随着运动校正方法爆发而确立的——当越来越多论文需要"真实运动真值"时,MR-ART 成了默认的那一个。
7.6 一个反直觉的观察:为什么"小"数据集反而引用广
148 人看似不多,但 MR-ART 的引用广度超过许多更大规模的脑影像集。原因有三:
- 稀缺性 > 规模:干净-运动配对的真实数据本身稀缺,供给远小于需求;而普通结构脑 MRI 供给充足,替代品多。
- 验证需求是刚性的:任何运动校正方法都必须回答"在真实运动上行不行",这个问题无法用合成数据回避,MR-ART 是几乎唯一的选择。
- 标注密度高:临床评分 + IQM 双标注让它同时服务算法验证与质控研究两类需求,一鱼多吃。
这个观察对所有数据集生产者有启示:规模不是唯一的护城河,独特的设计属性(配对、真实、标注密度)可能带来更高的实际使用率。
§8 方法学启示:六条可迁移的经验
8.1 "指令运动"把不可控问题变成可控变量
运动伪影研究的根本困难是运动的不可控性——你无法命令一个临床病人"这次动 5 秒、下次动 10 秒"。MR-ART 的解法是用健康受试者 + 提示-响应范式:让被试在屏幕提示下按次数点头,把运动从"背景噪声"变成"实验自变量"。这一招的可迁移性极高:任何需要研究"某种干扰如何影响结果"的场景,都可以考虑用"可指令的替代任务"来制造可控干扰,代价是牺牲一部分真实场景的复杂性(自发运动 vs 指令运动)。
8.2 配对设计是质量研究的统计引擎
MR-ART 的分析之所以能给出干净结论,核心是被试内配对设计。这对所有质量研究是普适启示:当你想研究"某种处理对图像质量的影响",个体差异是最大的混杂因素,配对是消除它最直接的杠杆。如果预算允许,宁可少招被试、多拍条件(同一人多套),也不要多招被试、每人单拍——前者的统计效力远高于后者。
8.3 多重标注的"三角互证"
MR-ART 用"采集条件 + 临床评分 + 工程指标"三套标签刻画同一批图。这种三角结构让数据集同时服务三类使用者的同时,也让任何单一标签的可靠性可被另外两套交叉检验:临床评分与工程指标的一致性,可以对冲单一视角的偏差。可迁移的经验是:高质量数据集的价值往往不在数据量,而在标注的层次与视角互补性。
8.4 开放许可与隐私伦理的平衡
MR-ART 采用 CC0 的同时,用 PyDeface 去除面部信息。这体现了一条可操作的原则:在去除可识别信息(de-facing)之后,结构脑影像的开放共享在伦理上是可接受的。Project 的伦理批号(OGYÉI/70184/2017)与知情同意流程的公开披露,也让"开放"与"合规"并不矛盾——这是 AI-Ready 数据集在隐私敏感场景下的合规范本。
8.5 数据集设计的"标注经济学"
MR-ART 的标注投入值得单独算一笔账:两位资深神经放射科医师对每张扫描逐图打分(148 人 × 约 3 卷 ≈ 436 卷),外加 100 张的校准。这是一笔可观的人力投入,但换来的是数据集的不可替代性。对比"只放原始图像、不做临床评分"的做法,MR-ART 的增量标注让它从"又一份脑 MRI"变成"运动质控的标注基准"。
这里的方法学教训是:标注的价值不在数量,而在它解锁了哪些研究问题。临床 3 分制评分看似简单(就三档),却恰好是训练自动质控分类器最直接的监督信号——投入产出比极高。数据集生产者若在预算有限,应优先投入"能解锁新研究问题"的标注,而非无差别地扩大规模。
8.6 从 MR-ART 看"数据集的诚实性"
Scientific Data 的 Usage Notes 里,作者主动承认了数据的异质性(测量条件对应真实场景,因此存在异质性)。这种"自曝局限"的做法值得提倡,因为它避免了使用者误用。对比那些把"局限"藏在附录角落的数据集,MR-ART 的诚实性让它的使用边界一开始就清晰。
对 AI-Ready 数据集的启示:主动声明局限不是减分项,而是可信度的加分项。使用者最怕的不是数据集有边界,而是不知道边界在哪——把边界写清楚,反而降低了误用风险和由此产生的"复现失败"投诉。
§9 与库内条目的关系
9.1 家族图谱
- OpenNeuro(rid 100):托管平台。MR-ART 是 OpenNeuro 上 BIDS + CC0 的代表性数据集,两者应互相提示。
- IXI 脑 MRI 多序列(rid 482):最紧密的方法学伙伴。多篇运动校正论文用 IXI(合成/训练)+ MR-ART(真实验证)配对,两者连读才能理解"合成训练、真实验证"范式。
- ADNI(rid 101):结构脑 MRI 大队列。运动伪影是 ADNI 类弱势人群(老年人)采集的核心质量挑战。
- HBN 儿童青少年脑队列(rid 245):高运动人群代表。儿童青少年的高运动率是 MRI 质控的头号难题,MR-ART 提供的运动评分方法论可直接迁移。
- OASIS(rid 21):脑影像系列(多年龄跨度),结构脑 MRI 家族成员。
- UK Biobank(rid 569):人群规模影像,运动伪影是规模化采集的核心质控指标。
- CMRxMotion(rid 687):呼吸运动极端心脏 MRI——同属"运动伪影"主题,不同器官与模态。
- TopBrain 2.0(rid 632):全脑血管分割挑战,运动伪影是脑分割类任务的重要鲁棒性维度。
- BigBrain(rid 285)/ Allen Brain Atlas(rid 275):脑影像图谱,神经科学家族背景。
9.2 检索路径建议
- 精确检索词:“MR-ART” 或 “Movement-related artefacts” + “OpenNeuro ds004173”;避免仅用 “MR-art”(大小写混写会命中无关条目)。
- 若目标是数据:OpenNeuro ds004173 v1.0.2(CC0 直链);注意区分 Kaggle 第三方 2D 派生集(坑 4)。
- 若目标是方法学对照:读论文 Technical Validation 节 + Fig 2/3/4;与 IXI(rid 482)联读理解"合成训练、真实验证"。
- 若目标是临床质控:关注临床 3 分制评分与 score 3 的定义(临床不可用)。
9.3 与库内相关条目的差异声明
MR-ART 与库内其他脑 MRI 条目的核心差异是配对纵向设计 + 临床运动评分。IXI/OASIS/ADNI 是"多人各一次"的横断面或纵向临床队列;MR-ART 是"同人多条件"的实验性配对设计,其目的不是刻画人群,而是刻画"运动"这一个变量的效应。因此它更适合做方法验证,而非人群建模——使用者不该拿它做大样本训练集,而该拿它做小样本的、高精度的真值检验。
9.4 库内检索时的连带提示
在库内浏览到以下条目时,若研究主题涉及"影像质量/运动伪影/结构脑 MRI 鲁棒性",应连带提示 MR-ART:
| 触发条目 | 连带提示理由 |
|---|---|
| OpenNeuro(100) | 平台条目,MR-ART 是其 CC0 代表数据集 |
| IXI(482) | 常与 MR-ART 配对用于运动校正论文 |
| ADNI(101)/OASIS(21) | 结构脑 MRI 家族,同样面临运动质控问题 |
| HBN(245) | 高运动人群,MR-ART 的评分方法论可迁移 |
| UK Biobank(569) | 规模化影像,运动伪影是首要质控指标 |
| CMRxMotion(687) | 运动伪影主题(心脏呼吸运动)的横向对照 |
| TopBrain 2.0(632) | 脑分割任务,运动伪影是鲁棒性维度 |
这种"连带提示"是知识库互链的价值:用户不必预先知道 MR-ART 的存在,也能从相邻主题被引导过来。
§10 避坑清单:十个已踩过的坑
坑 1:体积口径——4.22 GiB 还是 4.53 GB?
OpenNeuro 页面显示 “Size: 4.22GB”,但 API 返回的字节数是 4,526,466,554。二者其实一致:4.22 GiB(4,526,466,554 / 1024³ ≈ 4.22),换算成十进制是 4.53 GB。引用时注明二进制(GiB)口径,避免把它当成"数据集有两个不同体积"。
坑 2:许可混淆——数据集 CC0,论文 CC BY 4.0
数据集本体是 CC0(公共领域),描述它的 Scientific Data 论文是 CC BY 4.0。二者是不同资产。常见错误是看到一个许可就套用到全部——你要用数据,看数据集的 CC0;你要转载论文图表,看论文的 CC BY 4.0。
坑 3:指令运动不等于自发运动
MR-ART 的运动是健康受试者按屏幕提示做的受控点头。这与临床病人的自发、不受控、可能持续的运动有本质差异。把 MR-ART 当作"临床运动分布"的代表会高估模型在真实病人上的表现。它的正确用法是受控条件下的方法验证。
坑 4:Kaggle 上有第三方 2D 派生集,别当官方本体
Kaggle 上存在 mdfaisalkarim/mr-art-dataset(CC BY-NC 4.0,2025-08-08),是从 MR-ART 抽取的轴向/冠状/矢状中层 2D 切片派生集。它是第三方个人上传,与官方团队无关,许可(BY-NC,非商用)也比官方 CC0 更严。检索 MR-ART 时若只找到 Kaggle,需回到 OpenNeuro ds004173 拿官方全量 3D 数据。
坑 5:版本与 DOI 要对齐
数据集有 Draft/v1.0.0/v1.0.1/v1.0.2 四个快照,DOI 后缀随版本变化。论文引用 v1.0.2。用旧版本会与论文描述不符(尽管核心内容大体一致),复现分析时应锁定 v1.0.2。
坑 6:临床评分没有评分者间一致性指标
两位医师在 100 张上协调了标准,但每张图只由一人评,论文未报告评分者间 Kappa,也未披露每张图的评分者身份。这意味着评分的评分者间可靠度未知——用评分训练模型时,标签噪声的上界不可量化。这是一个真实的信息缺口。
坑 7:Fig 2/3/4 的具体数字只在图里
论文的技术验证主要靠 Fig 2/3/4 三张图,正文未给逐条件、逐评分的完整 IQM 统计表。想要精确数值需从原始 IQM JSON 自行计算,或联系作者。不要在无来源的情况下臆造这些分布数字。
坑 8:8 名被试缺一套扫描——配对不完整
148 名被试中 8 人的 HM1 或 HM2 之一缺失(采集问题)。做三条件配对分析时,这 8 人只有二人配对;做全量三人配对时样本是 140 人而非 148。务必先识别这些被试,避免把缺失当成"运动条件本身没差异"。
坑 9:单中心单扫描仪——泛化性天花板
全部数据来自匈牙利一个中心的同一台 Siemens Prismas 3T。跨厂商(GE/Philips)、跨场强(1.5T/7T)、跨线圈的通路从未验证。若你的目标是"跨中心通用",MR-ART 只能证明方法在 Prismas 上有效,不能证明普适。
坑 10:把 MR-ART 与"运动伪影数据集"泛称混为一谈
中文检索"运动伪影数据集"会同时命中 MR-ART、CMRxMotion(心脏呼吸运动,rid 687)甚至腹腔镜运动识别(rid 762)。三者模态、器官、任务完全不同。检索时用精确英文名 “MR-ART” / “ds004173” 避免误命中。
FAQ(高频问答 47 问)
A. 基础认知
Q1:MR-ART 是什么的缩写?
Movement-Related ARTefacts——“运动相关伪影”。数据集全称是 “Movement-related artefacts (MR-ART) dataset”,官方描述中 MR-ART 作为简称广泛使用。
Q2:它是挑战赛吗?
不是。它没有 leaderboard、没有竞赛任务,是一个采集 + 标注的公开数据集,用于研究、验证和评测运动伪影相关方法。
Q3:它和普通脑 MRI 数据集有什么本质区别?
普通脑影像数据集通常是"每个被试一张(或纵向几次)“,关注人群或疾病;MR-ART 是"每个被试三套、只操纵运动这一个变量”,关注运动本身。前者用于建模人群,后者用于验证方法。
Q4:谁做的?
匈牙利布达佩斯 Research Centre for Natural Sciences 脑成像中心(9 位作者)+ 英国 University of Surrey(1 位作者 Tibor Auer)。通讯作者 Ádám Nárai 与 Zoltán Vidnyánszky。
Q5:发表在哪?
Scientific Data(Nature Portfolio),2022 年第 9 卷第 630 篇,doi:10.1038/s41597-022-01694-8,开放获取 CC BY 4.0。
Q6:数据在哪?
OpenNeuro,登录号 ds004173,最新版本 v1.0.2。
Q7:名字里的"配对"(matched)什么意思?
同一名被试采集了静止与两种运动程度的扫描,因此"干净图"和"运动图"来自同一颗头、同一台机器、同一参数——这是它的核心价值。
Q8:它最有名的一句话卖点是什么?
唯一能同时提供"真实运动"与"干净配对"的公开结构脑 MRI 数据集——填补了运动校正方法验证的真值空白。
Q9:数据规模算大还是小?
以"被试数"看是小数据集(148 人);以"配对样本的价值"看是稀缺资源。它不适合当大样本训练集,适合当高价值验证集。
Q10:它自曝了什么局限?
健康成人样本、单中心单扫描仪、指令运动非自发运动、8 人配对不完整、临床评分 3 档粗粒度、评分者间一致性未报告。论文在 Usage Notes 中主动说明了数据的异质性。
B. 数据与获取
Q11:怎么下载?
最简单是网页下载(openneuro.org/datasets/ds004173/versions/1.0.2);推荐用 DataLad 克隆 https://github.com/OpenNeuroDatasets/ds004173.git 后 datalad get 拉取内容。
Q12:需要注册或申请吗?
不需要。CC0 许可 + OpenNeuro 公开直链,无任何门槛。
Q13:能商用吗?
能。CC0 是公共领域奉献,允许自由使用、修改、再分发、商用。学术惯例仍建议引用,但法律上无强制。
Q14:数据是什么格式?
NIfTI(神经影像标准格式,.nii.gz),按 BIDS 组织;质量指标是 JSON/TSV,临床评分在 /derivatives/scores.tsv。
Q15:图像去脸了吗?
去了。用 PyDeface v2.0.0 去除面部信息,保护隐私。
Q16:有多少文件、多大?
1173 个文件,约 4.22 GiB(4,526,466,554 字节)。
Q17:能不能只下部分数据?
可以。DataLad 支持按路径选择性拉取(如只取某被试的 anat 目录),网页端也可选文件下载。
Q18:Kaggle 上的 MR-ART 是不是官方的?
不是。Kaggle 上的 mdfaisalkarim/mr-art-dataset 是第三方个人抽取的 2D 中层切片派生集(CC BY-NC 4.0),粒度与许可都与官方不同(坑 4)。要官方 3D 全量数据去 OpenNeuro。
C. 采集与技术
Q19:三套扫描的区别到底是什么?
只有运动指令不同:STAND 完全不动、HM1 提示 5 次点头、HM2 提示 10 次点头。扫描仪、序列参数、被试完全相同。
Q20:为什么选"点头"作为运动范式?
文献报道点头是最主要、贡献最多运动伪影的头部运动类型。选择它使数据更贴近现实中占主导的运动形态。
Q21:运动幅度可控吗?
不完全。次数可控(5 次 vs 10 次),但每次点头的幅度(角度)由被试自发决定,被试间有散布。这是"指令运动"的固有局限。
Q22:图像参数是什么?
T1w 3D MPRAGE,1 mm³ 各向同性,TR 2300 / TE 3 / TI 900 ms,FA 9°,FOV 256×256 mm,Siemens Prismas 3T。
Q23:临床评分怎么给的?
两位 >10 年经验的神经放射科医师,对采集条件盲,按 1(良好)/2(中等)/3(差,临床不可用)三档评。每张由一人评,先在 100 张上协调标准。
Q24:MRIQC 指标有哪些?
全套 IQM;论文重点分析 total SNR、EFC(熵聚焦准则)、CJV(联合变异系数)三个。
Q25:为什么 MRIQC 绝对值不好解读?
MRIQC 不参照标准数据集,单个指标绝对值缺乏参照系;MR-ART 的配对设计让你能用被试内差异代替绝对值,使解读成为可能。
D. 研究与应用
Q26:能拿它训练运动校正模型吗?
可以但不推荐作为主要训练集——148 人规模偏小。更常见的用法是"合成数据训练 + MR-ART 验证",因为它提供真实配对真值。
Q27:它对运动模拟研究有什么用?
当"裁判"。用真实运动数据检验模拟运动是否逼真——PLOS ONE 2024 的研究就是范式(用 CJV/SNR/CNR 比较真实与模拟的差异)。
Q28:它能用于分割鲁棒性研究吗?
能。同组前作(Kemenczky 2022)就用它证明不同全脑分割方法对运动伪影的敏感度不同,且运动会导致体积估计偏差(假萎缩)。
Q29:能拿它训练自动质控分类器吗?
能,而且很合适——临床 3 分制评分天然是"该不该重扫"的分类标签(score 3 = 临床不可用)。
Q30:它和 IXI 怎么配着用?
典型范式:IXI(或 HCP)生成合成运动做训练,MR-ART 的真实运动做外部验证。库内 IXI 见 rid 482。
Q31:它对儿童/老年 MRI 研究有价值吗?
方法论可迁移——儿童青少年(高运动)与老年人(神经退行)是运动伪影的高发人群。但数据本身是健康成人(偏年轻),不代表这些群体。
Q32:论文里的 115,000 美元/年的成本数字从哪来?
引自 Andre et al. 2015(J Am Coll Radiol)——估算运动伪影导致重复扫描的成本。这是背景动机,不是本数据集自身的统计。
E. 统计与解读
Q33:临床评分和采集条件完全对应吗?
不完全是。STAND 图大多 score 1、HM2 图大多 score 3,但会有交叉(如 STAND 图因自发微动被判中等)。Fig 4 呈现这种交叉分布。
Q34:为什么临床评分和 IQM 都要看?
两者视角互补:临床评分贴近诊断决策但主观;IQM 客观可扩展但无参照。两者一致时互相印证,不一致时提示对方遗漏了信息。
Q35:论文给了具体的数值表吗?
没有给完整的逐条件/逐评分统计表,主要靠 Fig 2/3/4 三张图呈现(坑 7)。需要精确数值要自己从 IQM JSON 算。
Q36:评分者间一致性是多少?
论文未报告(每张图只由一人评,无重复评分的配对)。这是已知缺口(坑 6)。
Q37:8 人缺一套扫描会影响分析吗?
会影响"全量三人配对"的样本量(从 148 降到 140)。做配对分析前需识别这些被试(坑 8)。
Q38:运动次数(5 vs 10)和伪影严重度成正比吗?
方向上是——HM2 的伪影总体比 HM1 重。但因个体点头幅度不可控,二者并非严格线性,分布有重叠。
F. 生产与库内
Q39:本条目为什么叫 mr-art?
沿用官方简称与 OpenNeuro 数据集名中的 “MR-ART”,slug 为 mr-art。与库内其他条目无撞库(正文 §1 已给查重结论)。
Q40:本条目与库内哪些条目应连读?
运动校正研究:IXI(482)+ 本条目;脑 MRI 家族:OASIS(21)/ADNI(101);主题互链:CMRxMotion(687);平台:OpenNeuro(100)。
G. 延伸与进阶
Q41:运动伪影为什么会造成"假萎缩"?
头部运动在 k-space 上引入相位错误,重建后表现为重影与模糊,并对脑组织边界产生系统性偏移。形态测量工具(如 FreeSurfer)在运动图上可能低估灰质体积、高估脑脊液空间——看起来像脑萎缩。论文引用的多项研究(Reuter 2015、Alexander-Bloch 2016 等)都证实了这种系统性偏差。
Q42:为什么说"运动校正方法缺乏真实数据"是个老大难?
因为配对真值在现实中几乎无法获得——你有干净图时病人没动,病人动了你就没有干净参照。深度学习方法要在模拟数据上训练,但模拟是否逼真需要真实数据验证,这就形成"验证需要真实数据、真实数据稀缺"的循环。MR-ART 打破循环的方式是"请健康人按指令运动",人工制造配对。
Q43:MRIQC 的 IQM 能直接用来判断"该不该重扫"吗?
不能单独用。论文指出 MRIQC 无参照标准、绝对值难解读。判断"该不该重扫",更好的信号是临床评分(score 3 = 临床不可用);IQM 适合大规模初筛,再结合临床判断。MR-ART 的价值恰在于提供两者对照。
Q44:这个数据集对脑机接口(BCI)或功能 MRI(fMRI)研究有用吗?
间接有用。虽然 MR-ART 是结构 T1w 数据,但头部运动是 fMRI 的头号噪声源(运动引入虚假功能连接)。MR-ART 建立的运动-伪影-IQM 关系对理解 fMRI 运动伪影的物理机制有参考价值,但它本身不含功能数据。
Q45:如果我要做跨数据集的运动鲁棒性评测,怎么用 MR-ART?
典型设计:在同一分割/测量工具上,分别跑 IXI(干净基准)与 MR-ART 三条件,比较工具输出的一致性漂移。MR-ART 提供的配对真值让你能精确量化"运动导致多少偏差",这是单用 IXI 做不到的。
Q46:MR-ART 的"两档运动"够用吗?
对"有没有运动效应"这类定性问题足够;对"运动量与伪影严重度的精细剂量-反应关系"则偏粗——只有 0/5/10 三次提示三个水平,且个体点头幅度不可控。若要精细剂量-反应曲线,需结合模拟数据或自行采集更多水平。
Q47:本条目如何保证信息准确?
关键硬数字(148 人、95 女、1173 文件、4,526,466,554 B、1 mm³、TR 2300 等)经论文 + OpenNeuro API + 多篇第三方研究三源互证;口径差异(GiB/GB、CC0/CC BY)在附录 L 存照;无法查证的(Fig 具体数值、评分者间一致性)明确标注为遗留疑点而非臆造。
事实清单(硬事实 40 条)
- MR-ART 全称 Movement-related artefacts (MR-ART) dataset,是 T1 加权 3D 结构脑 MRI 的配对运动伪影数据集。
- 含 148 名健康成人(95 女 / 53 男),年龄 18-75 岁,中位 25.16 岁,IQR 10.50 岁。
- 采集于 2019-2021 年,地点为匈牙利布达佩斯 Research Centre for Natural Sciences 脑成像中心。
- 每人采集三套 T1w 图像:STAND(静止)、HM1(轻度点头,5 次)、HM2(重度点头,10 次)。
- 8 名被试的 HM1 或 HM2 之一因采集问题缺失。
- 扫描仪 Siemens Magnetom Prismas 3T,20 通道头颈接收线圈。
- 序列 T1w 3D MPRAGE,2 倍 GRAPPA 加速,各向同性 1 mm³。
- 参数 TR 2300 ms / TE 3 ms / TI 900 ms / FA 9° / FOV 256×256 mm。
- 运动范式为屏幕提示"MOVE"(匈牙利语)时点头,每次提示 5 秒,HM1 提示 5 次、HM2 提示 10 次,均匀分布。
- 受试者被要求点头时不抬头离床、每次后归位;屏幕中央有注视点。
- 临床伪影评分由两位 >10 年经验神经放射科医师给出,对采集条件盲。
- 评分 3 分制:1=临床良好,2=中等,3=差(临床诊断不可用)。
- 两位医师先在 100 张独立扫描上协调标准,全程讨论不确定病例。
- 每张扫描由其中一位医师评定(非双评);评分者间一致性未报告。
- 临床评分存于被试文件夹 scans 文件与
/derivatives/scores.tsv汇总。 - MRIQC v0.16.1 生成全量图像质量指标,存于
/derivatives/mriqc-0.16.1。 - IQM 以每扫描 JSON + 组级 group_T1w.tsv / group_T1w.html 呈现。
- 论文重点分析三个 IQM:total SNR、EFC(熵聚焦准则)、CJV(联合变异系数)。
- 面部信息用 PyDeface v2.0.0 去除。
- BIDS 组织用 dcm2bids v2.1.6 完成。
- 结构像 acquisition 标签为 standard / headmotion1 / headmotion2。
- participants.tsv 含每名被试的年龄与性别,按 BIDS 标准。
- OpenNeuro 登录号 ds004173;最新版本 v1.0.2(2022-10-18)。
- 版本链:Draft(2022-06-22)→ v1.0.0(2022-06-28)→ v1.0.1(2022-08-23)→ v1.0.2(2022-10-18)。
- 数据集 DOI 形如 doi:10.18112/openneuro.ds004173.v1.0.2。
- 数据集文件总数 1173。
- 数据集体积 4,526,466,554 字节 ≈ 4.22 GiB ≈ 4.53 GB。
- 数据集许可为 CC0(公共领域奉献)。
- 论文为 Sci Data 9, 630 (2022),doi:10.1038/s41597-022-01694-8。
- 论文许可为 CC BY 4.0(与数据集 CC0 不同)。
- 论文 Received 2022-04-19 / Accepted 2022-09-12 / Published 2022-10-17。
- 伦理批准:National Institute of Pharmacy and Nutrition,批号 OGYÉI/70184/2017。
- 资助:Hungarian NRDI Office(GINOP-2.2.1-18-2018-00001)+ Hungarian Brain Research Program(2017-1.2.1-NKP-2017-00002)。
- 数据上传者 Ádám Nárai(2022-06-22)。
- 通讯作者 Ádám Nárai(narai.adam@ttk.hu)与 Zoltán Vidnyánszky(vidnyanszky.zoltan@ttk.hu)。
- 全部 10 位作者,其中 9 人属 Research Centre for Natural Sciences,Tibor Auer 属 University of Surrey。
- 论文 Technical Validation 用 Fig 2(IQM×采集条件)、Fig 3(IQM×临床评分)、Fig 4(临床评分×采集条件)三图。
- 论文指出 MRIQC 无参照标准、绝对值难解读,配对设计使其可比。
- 论文强调数据存在异质性但对应真实场景,使用者可用 IQM 与评分筛选子集。
- 相关前作 Kemenczky et al. Sci Rep 12, 1618 (2022) 用本数据集证明分割方法对运动伪影的敏感度差异。
术语表(30 条)
| 术语 | 释义 |
|---|---|
| MR-ART | Movement-Related ARTefacts,本数据集简称 |
| 运动伪影(motion artefact) | 头部运动导致的图像重影、模糊、振铃等失真 |
| 结构 MRI(structural MRI) | 刻画解剖结构的 MRI,此处为 T1 加权 |
| T1 加权(T1-weighted) | 突出组织 T1 弛豫差异的对比,脑结构像常用 |
| MPRAGE | 磁化准备快速梯度回波,一种 3D T1 序列 |
| GRAPPA | 并行成像加速技术;此处 2 倍平面内加速 |
| 各向同性分辨率 | 三个方向体素尺寸相同(此处 1 mm³) |
| TR / TE / TI / FA | 重复时间 / 回波时间 / 翻转时间 / 翻转角 |
| FOV | 视野(Field of View),此处 256×256 mm |
| STAND | 静止条件(BIDS 标签 standard) |
| HM1 | 轻度点头条件(headmotion1),提示 5 次 |
| HM2 | 重度点头条件(headmotion2),提示 10 次 |
| 点头(nodding) | 矢状面低头再抬头的运动,本数据集使用的运动范式 |
| 配对设计(matched design) | 同一被试多条件采集,可做被试内比较 |
| 被试内设计(within-subject) | 每个被试经历所有处理条件,消除个体差异 |
| BIDS | Brain Imaging Data Structure,神经影像目录组织标准 |
| dcm2bids | DICOM 转换 + BIDS 组织工具(v2.1.6) |
| PyDeface | 去除面部信息的工具(v2.0.0) |
| MRIQC | MRI 质量控制工具,输出图像质量指标(v0.16.1) |
| IQM | 图像质量指标(Image Quality Metric) |
| total SNR | 总信噪比,信号强度与噪声水平之比 |
| EFC | 熵聚焦准则(Entropy Focus Criterion),度量图像聚焦程度 |
| CJV | 联合变异系数(Coefficient of Joint Variation),度量组织对比干净度 |
| CNR | 对比噪声比(Contrast-to-Noise Ratio) |
| 临床伪影评分 | 神经放射科医师的 3 分制临床可用性评分(1/2/3) |
| 盲评(blinded rating) | 评分者不知道采集条件的设计 |
| 运动校正(motion correction) | 从运动污染图像恢复干净图像的方法 |
| 运动模拟(motion simulation) | 在 k-space 或 magnitude 域人为添加运动 |
| 泛化性(generalizability) | 模型跨机构/扫描仪/人群的适用程度 |
| 深度分割(segmentation) | 自动划分脑结构的方法,对运动敏感 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | MR-ART |
| url_name | mr-art |
| 类型 | 配对结构脑 MRI 运动伪影数据集 |
| 论文 | Sci Data 9, 630 (2022) |
| 团队 | Research Centre for Natural Sciences(布达佩斯)+ University of Surrey |
| 规模 | 148 人 × 3 条件(8 人缺一采);1173 文件;约 4.22 GiB |
| 许可 | 数据集 CC0 | 论文 CC BY 4.0 |
| 抓取时点 | 2026-09-30 |
| 库内互链 | openneuro(100)/ixi-brain(482)/adni(101)/oasis(21)/hbn(245)/cmrxmotion(687) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 9 | OpenNeuro 平台索引 + 论文 DOI + BIDS 标准命名;“MR-ART” 名称唯一不易混淆 |
| A 可获取性 | 10 | CC0 + 公开直链 + DataLad,无任何门槛——库内最高档 |
| I 可互操作 | 9 | NIfTI + BIDS + JSON/TSV 标准;广泛工具支持,无专有格式 |
| M 元数据质量 | 8 | 采集参数/评分/IQM 完整;扣分项为评分者间一致性缺失、Fig 数值仅图形 |
| S 可持续性 | 9 | OpenNeuro(BRAIN Initiative 指定归档)长期托管 + 每快照 DOI;扣分项为单中心依赖 |
| 综合评级 | 9.0/10(极高) | 开放科学的理想样本;边界在泛化性而非可获取性 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 148 被试 / 95 女 | 论文 Methods | Sci Data 9:630 |
| 18-75 岁 / 中位 25.16 / IQR 10.50 | 论文 Methods(Participants) | Sci Data 9:630 |
| 2019-2021 采集 | 论文 Methods | Sci Data 9:630 |
| TR 2300/TE 3/TI 900/FA 9°/FOV 256 | 论文 Methods(Image acquisition) | Sci Data 9:630 |
| HM1 5 次 / HM2 10 次点头 | 论文 Methods | Sci Data 9:630 |
| 8 人缺一采 | 论文 Methods | Sci Data 9:630 |
| 3 分制评分 + 100 张协调 | 论文 Methods(Artefact labelling) | Sci Data 9:630 |
| PyDeface/MRIQC/dcm2bids 版本 | 论文 Code availability 段 | Sci Data 9:630 |
| 1173 文件 / 4,526,466,554 B / 148 subjects | OpenNeuro GraphQL API 实测 | openneuro.org 2026-09-30 |
| License CC0 | OpenNeuro API description.License | openneuro.org 2026-09-30 |
| 版本链 Draft/v1.0.0/1/2 | OpenNeuro 版本页 | openneuro.org 2026-09-30 |
| 运动模拟真实性(CJV/SNR/CNR 差异) | PLOS ONE 2024 doi:10.1371/journal.pone.0301132 | journals.plos.org |
| IXI+HCP 训练 / MR-ART 验证 | arXiv 2608.10170(SSRL-MAR) | arxiv.org |
| Res-MoCoDiff 用 MR-ART 148 例 | Phys Med Biol 10.1088/1361-6560/ae1110 | iopscience.iop.org |
| MACS-Net 80/48/20 划分 | Int J Biomed Imaging 2024 PMC11081754 | pmc.ncbi.nlm.nih.gov |
| 19.8% 重复率 / 115,000 美元 | 论文引用 Andre et al. 2015 | J Am Coll Radiol 12:689 |
附录 D:数据获取决策树
你想用 MR-ART 做什么?
├── 直接下数据
│ ├── 网页:openneuro.org/datasets/ds004173/versions/1.0.2
│ └── DataLad:clone github.com/OpenNeuroDatasets/ds004173.git → datalad get
├── 训练运动校正模型
│ ├── 主力训练:IXI/HCP 合成运动(规模大)
│ └── 外部验证:MR-ART 真实运动(本数据集)
├── 评测分割鲁棒性
│ └── 用 STAND/HM1/HM2 三条件对同一脑做分割,比较指标漂移
├── 训练自动质控分类器
│ └── 用 3 分制临床评分当标签(score 3 = 需重扫)
└── 验证运动模拟真实性
└── 用真实运动图 + IQM 检查模拟图是否逼真
附录 E:三条件对照表
| 项 | STAND | HM1 | HM2 |
|---|---|---|---|
| BIDS acquisition 标签 | standard | headmotion1 | headmotion2 |
| 运动指令 | 不动 | 点头 | 点头 |
| 提示次数 | 0 | 5 | 10 |
| 提示时长 | — | 5 s/次 | 5 s/次 |
| 预期临床评分 | 多为 1 | 中间(1-2 混合) | 多为 2-3 |
| 参数 | 与另两条件完全相同 | 同左 | 同左 |
附录 F:临床评分速查
| 分数 | 含义 | 临床处置暗示 |
|---|---|---|
| 1 | 临床良好 | 可正常诊断使用 |
| 2 | 中等 | 可读但质量下降,视需求决定 |
| 3 | 差(临床诊断不可用) | 通常需重扫 |
附录 G:MRIQC 三重点 IQM 速查
| 指标 | 全称 | 运动时趋势 | 主要用途 |
|---|---|---|---|
| total SNR | 总信噪比 | 通常降低 | 通用噪声水平 |
| EFC | 熵聚焦准则 | 通常升高 | 背景鬼影/聚焦 |
| CJV | 联合变异系数 | 通常升高 | 組織对比干净度 |
附录 H:BIDS 目录骨架
ds004173/
├── dataset_description.json
├── participants.tsv # 年龄/性别
├── sub-<ID>/
│ ├── anat/
│ │ ├── sub-<ID>_acq-standard_T1w.nii.gz
│ │ ├── sub-<ID>_acq-headmotion1_T1w.nii.gz
│ │ └── sub-<ID>_acq-headmotion2_T1w.nii.gz
│ └── sub-<ID>_scans.tsv # 逐扫描临床评分
└── derivatives/
├── mriqc-0.16.1/ # IQM JSON + group_T1w.tsv/html
└── scores.tsv # 临床评分汇总
附录 I:统计口径与公式备注
| 项 | 说明 |
|---|---|
| 被试内差异 | 同一被试两条件的 IQM 之差(如 HM1 − STAND) |
| 评分对齐 | score 1/2/3 对应临床良好/中等/差 |
| 配对样本量 | 三人配对 140 人(8 人缺一采);二人配对可含全部 148 人 |
| 缺失处理 | 需先识别仅含两套扫描的被试 |
附录 J:库内互链登记
| 互链条目 | rid | 关系 |
|---|---|---|
| OpenNeuro | 100 | 托管平台 |
| IXI 脑 MRI 多序列 | 482 | 方法学伙伴(合成训练/真实验证配对) |
| ADNI | 101 | 结构脑 MRI 大队列,运动质控痛点 |
| OASIS | 21 | 结构脑 MRI 家族 |
| HBN 儿童青少年脑队列 | 245 | 高运动人群,方法论迁移 |
| UK Biobank | 569 | 规模化影像质控 |
| CMRxMotion | 687 | 同主题(运动伪影)不同器官 |
| BigBrain | 285 | 脑影像图谱家族 |
| Allen Brain Atlas | 275 | 脑影像图谱家族 |
| TopBrain 2.0 | 632 | 脑分割下游任务 |
附录 K:引用规范
@article{narai2022mrart,
title = {Movement-related artefacts (MR-ART) dataset of matched
motion-corrupted and clean structural MRI brain scans},
author = {Nárai, Ádám and Hermann, Petra and Auer, Tibor and
Kemenczky, Péter and Szalma, János and Homolya, István and
Somogyi, Eszter and Vakli, Pál and Weiss, Béla and
Vidnyánszky, Zoltán},
journal = {Scientific Data},
volume = {9},
pages = {630},
year = {2022},
doi = {10.1038/s41597-022-01694-8}
}
@dataset{narai2022mrartdata,
title = {Movement-related artefacts (MR-ART) dataset},
author = {Nárai, Ádám and Hermann, Petra and Auer, Tibor and
Kemenczky, Péter and Szalma, János and Homolya, István and
Somogyi, Eszter and Vakli, Pál and Weiss, Béla and
Vidnyánszky, Zoltán},
year = {2022},
publisher = {OpenNeuro},
doi = {10.18112/openneuro.ds004173.v1.0.2}
}
附录 L:双口径登记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 体积 | 4.22 GB(OpenNeuro 页面,二进制/实际 GiB) | 4.53 GB(字节十进制换算) | 双记,注明 GiB/GB |
| 2 | 许可 | 数据集 CC0(OpenNeuro) | 论文 CC BY 4.0(Sci Data) | 按资产分别引用 |
| 3 | 数据来源 | 官方 OpenNeuro ds004173(CC0,3D) | Kaggle 第三方 2D 派生集(CC BY-NC 4.0) | 官方为准,派生集仅提示 |
| 4 | 版本 | v1.0.2(最新,论文引用) | v1.0.0/1.0.1(历史) | 锁定 v1.0.2 |
附录 M:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 新版本发布 | OpenNeuro 出现 v1.0.3+ | 更新 §6 版本链与 DOI | 1 |
| 后续研究扩表 | 新论文用 MR-ART 做验证 | §7 生态线扩行 | 2 |
| 评分者间一致性补充 | 作者发布评分者信息/Kappa | §3.3、§10 坑 6 更新 | 3 |
| 派生数据集规范化 | 官方发布 2D 切片集 | §6 获取节增补 | 4 |
附录 N:使用检查清单(12 项)
- 许可确认:数据集 CC0,可自由使用(含商用);论文 CC BY 4.0 仅约束论文文本/图表。
- 版本锁定:用 v1.0.2,DOI 对应该快照。
- 被试计数:核对 sub-* 目录数 = 148,participants.tsv 行数一致。
- 缺失识别:找出 8 名只含两套扫描的被试,决定排除或二人配对。
- 评分对齐:scores.tsv 与被试 scans 文件对齐,确认全覆盖。
- IQM 关联:验证每张结构像有对应 MRIQC JSON,文件名可匹配。
- 运动范式意识:记住是指令运动(受控点头),非临床自发运动。
- 人群边界:健康成人(偏年轻),不代表儿童/老年/病人。
- 配对统计:优先被试内配对分析,发挥设计优势。
- 多指标合看:临床评分 + IQM 双视角,勿只看一个。
- 数值来源:论文给图不给全表(坑 7),精确数值自行从 IQM JSON 算。
- 引用完整:数据引数据集 DOI + 论文,两条都给。
附录 O:缩写速查
| 缩写 | 全称 |
|---|---|
| MR-ART | Movement-Related ARTefacts |
| MRI | Magnetic Resonance Imaging(磁共振成像) |
| MPRAGE | Magnetization-Prepared Rapid Gradient Echo |
| BIDS | Brain Imaging Data Structure |
| IQM | Image Quality Metric |
| SNR | Signal-to-Noise Ratio |
| EFC | Entropy Focus Criterion |
| CJV | Coefficient of Joint Variation |
| CNR | Contrast-to-Noise Ratio |
| TR/TE/TI/FA | 重复时间/回波时间/翻转时间/翻转角 |
| FOV | Field of View |
| GRAPPA | Generalized Autocalibrating Partially Parallel Acquisition |
| CC0 | Creative Commons Zero(公共领域奉献) |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
附录 P:遗留疑点登记(诚实清单)
| # | 疑点 | 状态 | 影响 |
|---|---|---|---|
| 1 | 临床评分的评分者间一致性(Kappa)未报告 | 论文未给 | 评分标签噪声上界未知 |
| 2 | 每张扫描具体由哪位医师评定未披露 | 论文未给 | 无法做评分者效应分析 |
| 3 | Fig 2/3/4 的逐格数值仅图形呈现 | 论文未给 | 精确统计需自行从 IQM JSON 计算 |
| 4 | 8 名缺一采被试的具体编号未列出 | 论文未给 | 需从数据中自行识别 |
| 5 | 三条件采集的先后顺序/随机化方案未详述 | 论文未详述 | 顺序效应无法评估 |
| 6 | HM1/HM2 的实际点头角度分布未量化 | 论文未给 | "运动量"仅有次数这个代理变量 |
以上六点均为论文未披露而非"本条目未查到"——它们是数据集使用时的真实边界,如实列出以免使用者误以为信息完备。
附录 Q:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | 体积 4.22 GiB vs 4.53 GB(口径不同非矛盾) | 引用/换算 |
| 坑 2 | 数据集 CC0 vs 论文 CC BY 4.0 | 许可引用 |
| 坑 3 | 指令运动 ≠ 自发运动 | 泛化外推 |
| 坑 4 | Kaggle 第三方 2D 派生集非官方 | 数据获取 |
| 坑 5 | 版本 v1.0.2 与 DOI 对齐 | 复现 |
| 坑 6 | 评分者间一致性未报告 | 标签噪声 |
| 坑 7 | Fig 数值仅图形 | 数字抽取 |
| 坑 8 | 8 人配对不完整 | 配对分析 |
| 坑 9 | 单中心单扫描仪泛化天花板 | 跨中心部署 |
| 坑 10 | "运动伪影数据集"泛称误命中 | 检索 |
附录 R:检索路径示范(关键词组合)
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 本体论文 | “Movement-related artefacts” AND “MR-ART” AND “structural MRI” | Sci Data 9:630 |
| 数据集 | OpenNeuro ds004173 / “MR-ART” site:openneuro.org | openneuro.org ds004173 |
| 运动校正用法 | “MR-ART” AND (“motion correction” OR “artifact reduction”) | MACS-Net / Res-MoCoDiff / SSRL-MAR |
| 运动模拟验证 | “MR-ART” AND (“simulation” OR “TorchIO”) | PLOS ONE 2024 |
| 分割鲁棒性 | “MR-ART” AND (“segmentation” OR “morphometry”) | Kemenczky 2022 |
| 反例(勿用) | “运动伪影数据集”(中文泛称) | 混杂 CMRxMotion/腹腔镜条目 |
检索卫生两条:一、用精确英文名 “MR-ART” 或登录号 “ds004173” 避免与心脏/腹腔镜运动数据混淆;二、区分官方 OpenNeuro(CC0,3D)与 Kaggle 第三方派生集(CC BY-NC,2D)。
附录 S:与模拟运动数据集的联用协议
典型"合成训练 + 真实验证"工作流
├── 1. 训练集构造
│ ├── 取 IXI(rid 482)或 HCP 的干净 T1
│ └── 用 TorchIO RandomMotion 合成运动伪影(覆盖多档强度)
├── 2. 模型训练
│ └── 在合成配对(运动图 -> 干净图)上训练校正网络
├── 3. 真实验证
│ ├── 取 MR-ART 三条件配对
│ └── 输入 HM1/HM2,与 STAND 比较(NMSE/SSIM/PSNR 或分割 Dice)
└── 4. 稳健性核查
├── 用 MR-ART 临床评分分层(score 1/2/3)
└── 检查模型在 score 3(最差)图上的表现衰减
附录 T:逐条件分析模板(伪代码)
import pandas as pd
# 假设已从 OpenNeuro 取得 scores.tsv 与 MRIQC JSON 汇总
df = pd.read_csv("derivatives/scores.tsv", sep="\t") # 逐扫描评分
# 关联 acquisition 标签(standard/headmotion1/headmotion2)
# 关联 IQM(total SNR / EFC / CJV)
# 分析 1:采集条件 -> 临床评分分布(对应论文 Fig 4)
dist = df.groupby(["acquisition", "score"]).size().unstack(fill_value=0)
# 分析 2:临床评分 -> IQM 分布(对应论文 Fig 3a)
iqm_by_score = df.groupby("score")[["snr_total", "efc", "cjv"]].describe()
# 分析 3:被试内差异(对应论文 Fig 2b/3b)
# 需按 subject 配对,计算 HM1-STAND、HM2-STAND 的 IQM 差
以上骨架仅示意分析结构;字段名以实际 MRIQC JSON 为准,IQM 的具体键名需查 MRIQC v0.16.1 文档。
附录 U:版本历史与变更点
| 版本 | 日期 | 变更推测 |
|---|---|---|
| Draft | 2022-06-22 | 首次上传 |
| v1.0.0 | 2022-06-28 | 首个公开快照 |
| v1.0.1 | 2022-08-23 | 修正/增补 |
| v1.0.2 | 2022-10-18 | 论文发表月定稿,当前标准引用 |
OpenNeuro 未公开各版本的逐项变更日志;引用时锁定 v1.0.2 即可与论文对齐。
附录 V:常见误用与纠正
| 误用 | 问题 | 纠正 |
|---|---|---|
| 当大样本训练集用 | 仅 148 人 | 当验证集;训练用 IXI/HCP 等 |
| 当作临床运动分布 | 是指令运动 | 明确"受控运动"边界 |
| 忽略缺失被试 | 8 人配对不全 | 先识别再分析 |
| 只报一个 IQM | 三指标互补 | SNR/EFC/CJV 合看 |
| 混用数据集许可 | CC0 ≠ CC BY 4.0 | 按资产分别引用 |
| 用 Kaggle 派生集当官方 | 第三方、2D、BY-NC | 用 OpenNeuro ds004173 |
附录 W:术语中英对照补充
| 中文 | 英文 |
|---|---|
| 运动伪影 | motion artefact / artifact |
| 头部运动 | head motion |
| 配对设计 | matched design |
| 被试内 | within-subject |
| 指令运动 | cued / instructed motion |
| 自发运动 | spontaneous motion |
| 临床可用性 | clinical usability |
| 图像质量指标 | image quality metric (IQM) |
| 运动校正 | motion correction |
| 运动模拟 | motion simulation |
| 分割鲁棒性 | segmentation robustness |
| 形态测量 | morphometry |
| 假萎缩 | pseudo-atrophy |
| 去脸 | de-facing |
| 公共领域 | public domain |
附录 X:本条目生产档案
- 生产通道:任务头 mr-art 正选,开工三查通过(锁创建、ps=6、无撞库)
- 存在性核验:WebSearch×4 + Nature 全文抓取 + OpenNeuro GraphQL API 实测 + 多篇第三方研究交叉(PLOS ONE 2024 / arXiv 2608.10170 / Phys Med Biol / Int J Biomed Imaging 2024)
- 硬数字三源互证:148 人、95 女、1173 文件、4,526,466,554 B、1 mm³、TR 2300/TE 3/TI 900/FA 9°
- 查重:DB
url_name ILIKE '%mr-art%'/'%artefact%'/'%motion%'仅命中无关条目 - FACTS.md:writing/mr-art/FACTS.md 九节
- 成稿方式:五块直写拼接(part1-5),私有区
.parts_agent-c-mrart_1790776175 - 坑点:§10 十则(坑 1-10"坑 N:"编号制)
- description:成稿时即 ≤170 字符
- 互链计划:OpenNeuro(100)/IXI(482)/ADNI(101)/OASIS(21)/HBN(245)/CMRxMotion(687) 等
附录 Y:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | OpenNeuro DOI(每快照)+ 论文 DOI |
| F2 富元数据 | ✅ | BIDS + participants.tsv + IQM + 评分 |
| A1 可访问协议 | ✅ | CC0 + 公开直链 + DataLad |
| A2 元数据可访问 | ✅ | 完全开放 |
| I1 互操作格式 | ✅ | NIfTI + JSON + TSV |
| I2 词汇表引用 | ✅ | BIDS + MRIQC 标准 |
| R1 来源溯源 | ✅ | 采集协议/参数/伦理批号公开 |
| R3 可复现流程 | ✅ | 工具链版本明确 |
| AI-Ready 综合 | 极高 | 库内最开放样本之一 |
附录 Z:致谢与数据来源声明
本条目所依据的一手来源:
- 论文:Nárai Á, Hermann P, Auer T, et al. Movement-related artefacts (MR-ART) dataset of matched motion-corrupted and clean structural MRI brain scans. Sci Data 9, 630 (2022). doi:10.1038/s41597-022-01694-8(开放获取 CC BY 4.0)
- 数据集:OpenNeuro ds004173 v1.0.2(CC0),doi:10.18112/openneuro.ds004173.v1.0.2
- 平台元数据:OpenNeuro GraphQL API(2026-09-30 实测:1173 文件、4,526,466,554 B、148 subjects、License CC0)
- 第三方研究:PLOS ONE 2024(doi:10.1371/journal.pone.0301132)、arXiv 2608.10170、Phys Med Biol(doi:10.1088/1361-6560/ae1110)、Int J Biomed Imaging 2024(PMC11081754)
所有事实陈述基于上述来源;未能在三源中互证的信息标注为遗留疑点(附录 P)。
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文(Scientific Data 9:630, 2022)、OpenNeuro ds004173 元数据(GraphQL API 实测 2026-09-30)与多篇第三方研究(PLOS ONE 2024、arXiv 2608.10170、Phys Med Biol、Int J Biomed Imaging 2024)为源。体积口径(GiB vs GB)与许可分层(数据集 CC0 vs 论文 CC BY 4.0)已在坑点与附录 L 存照;评分者间一致性缺失、Fig 数值仅图形、8 人配对不完整等原始文档边界已在 §10 与遗留疑点中声明。条目与库内 OpenNeuro(rid 100)、IXI(rid 482)、ADNI(rid 101)、OASIS(rid 21)、HBN(rid 245)、CMRxMotion(rid 687)等条目互链,构成结构脑 MRI 与运动伪影研究的完整检索面。后续维护触发点见附录 M。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- intra — 共享标签:医学影像 / MRI / 脑影像 / 医学图像分割 / 评测基准
- ulf-enc — 共享标签:医学影像 / MRI / 脑影像 / 评测基准
- prostate158 — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
- mitoem — 共享标签:医学影像 / 脑影像 / 医学图像分割 / 评测基准
- adam-aneurysm — 共享标签:医学影像 / 脑影像 / 医学图像分割 / 评测基准
- ixi-brain — 共享标签:医学影像 / MRI / 脑影像
- topbrain2026 — 共享标签:医学影像 / 脑影像 / 医学图像分割
- 3dreasonknee — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
- acdc — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
- aims-tbi — 共享标签:医学影像 / MRI / 脑影像 / 医学图像分割
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

