IntrA (intra) — AI-Ready Wikipedia

东京大学 Igarashi 实验室与神经外科合作构建的首个开放 3D 颅内动脉瘤数据集——103 个 TOF-MRA 重建全脑血管模型、1909 血管段、116 专家逐点标注段与测地矩阵,CVPR 2020 Oral 大规模基准,瘤颈提取直连夹闭手术规划

来源 东京大学医院患者 TOF-MRA(每例 512×512×180~300 张切片,体素 0.469×0.469×1 mm)经单阈值法重建 + 双神经外科医生 Amira 交互修复(约 50 工作日)+ MeshLab 流形清洗 + 自研标注工具逐点勾画(116 段,8 小时)的 3D 点云/网格:103 完整模型、1909 自动血管段(1694 健康 + 215 动脉瘤)、116 手工标注段 + N×N 测地距离矩阵(原始 2D MRA 因伦理不发布)发布时间: 2026-09-29最后更新: 2026-09-29 阅读 16
IntrA (intra) — AI-Ready Wikipedia

信息速览

数据集名称IntrA (intra) — AI-Ready Wikipedia
数据类型人工标注,影像数据,派生数据
规模103 个 3D 全脑血管模型(患者级数量未披露);1909 血管段(1694 健康 + 215 动脉瘤);116 手工标注动脉瘤段
接入方式东京大学医院患者 TOF-MRA(每例 512×512×180~300 张切片,体素 0.469×0.469×1 mm)经单阈值法重建 + 双神经外科医生 Amira 交互修复(约 50 工作日)+ MeshLab 流形清洗 + 自研标注工具逐点勾画(116 段,8 小时)的 3D 点云/网格:103 完整模型、1909 自动血管段(1694 健康 + 215 动脉瘤)、116 手工标注段 + N×N 测地距离矩阵(原始 2D MRA 因伦理不发布)
AI 就绪度

INFOBOX — IntrA 一屏速览

维度 内容
本质 首个开放获取的 3D 颅内动脉瘤数据集:点云+网格表示,非体数据、非 2D 影像
团队 东京大学 Igarashi 实验室 + 神经外科(Taichi Kin);Ding Xia 双挂华南理工大学
论文 CVPR 2020 Oral(DOI 10.1109/CVPR42600.2020.00273;arXiv:2003.02920,v1 2020-03-02)
数据 103 完整脑血管模型 / 1909 血管段(1694 健康+215 动脉瘤)/ 116 手工标注段
来源 TOF-MRA(512×512×180~300 切片,0.469×0.469×1 mm)重建;原始 2D MRA 因伦理不发布
修复成本 双神经外科医生 Amira 交互修复约 50 工作日;116 段标注一名医生 8 小时
附加资产 每个标注段附 N×N 测地距离矩阵(热方程快速近似法);标注/段生成/可视化工具
分类基准 2025 段 5 折:PN++(1024)动脉瘤准确率 88.51%;PointCNN(2048)血管 98.95%、F1 0.9044
分割基准 116 段 5 折:SO-Net(2048)瘤体 IoU 81.40%/DSC 88.76%;PointConv 血管 IoU 94.65%
效率 PN++ 5 s/epoch 最快;PointCNN 24 s/epoch 最慢;总训练超 92 小时
动脉瘤类型 分叉型/主干型/水泡型/混合型四型全覆盖
获取 官方 Google Drive 直链|OpenDataLab 镜像 2.3GB|HuggingFace 无官方镜像
许可 无正式 license 文件——引用论文惯例;商用合规自评
生命周期 2019-11 数据先行公开;2020-04-08 后仓库静默;数据无版本号(§8.5)
库内互链 两轮 DB 实证共 18 条(§10/附录 V):imagecas(549)、drive(241)、brats(24)、luna16(237)、medmnist(716)、totalsegmentator(422) 等

IntrA 是一个"把颅内动脉瘤从 2D 切片抬到 3D 表面"的数据集工程:东京大学团队把 103 例患者 TOF-MRA 的数百张 2D 切片重建为完整脑血管表面模型,由两名神经外科医生花费约 50 个工作日手工修复,再自动切分为 1909 个血管段、由专家逐点勾画出 116 个动脉瘤段,并附上每个标注段的测地距离矩阵。它是医学影像里少见的"点云/网格原生"数据集——用 PointNet++、MeshCNN 这类 3D 深度学习网络直接在血管表面上做诊断分类与瘤体分割,而非在体数据上跑 3D 卷积。

导语读法三则:

  1. 只想下数据:直奔 §7 获取与许可——注意官方只有 Google Drive 直链且无 LICENSE 文件,引用与商用问题先想清楚。
  2. 关心 3D 深度学习选型:直奔 §4 基准——17 种网络的分类/分割全表与"测地信息到底值不值"的定量答案。
  3. 做神经外科 CAD 系统:直奔 §3 构建流水线与 §5——50 工作日的修复成本、8 小时的标注效率、四型动脉瘤的覆盖面,决定了这个数据集能支撑什么级别的临床宣称。

§0 导读:这个数据集解决什么问题

颅内动脉瘤是脑血管壁的气球状膨出,破裂即蛛网膜下腔出血,死亡率极高;主流外科治疗是夹闭(clipping)——在瘤颈处夹一枚微夹子把它从血流中隔离。术前规划的关键动作是看清瘤颈边界:夹子位置和姿态的决策至今高度依赖医生基于 2D MRA/CT 影像的"临床判断"。在模拟真实神经外科的手术支持系统中,动脉瘤分割精度直接决定瘤颈提取质量,是整条链路最要命的一环。

为什么此前没有好的自动方法?两个结构性原因。其一,2D 影像把算法锁死在像素/体素范式里:基于 MRA 体数据的 3D 卷积方法把血管、颅骨背景、噪声一起喂进网络,血管本身只占体数据的极小部分,算力浪费且精度受限(后续对比实验中 voxel 法 DSC 仅 46%)。其二,3D 表面数据集是空白:计算机视觉的 3D 基准(ModelNet、ShapeNet)全是 CAD 刚体,医学侧几乎没有开放的结构化 3D 表面标注——数据采集贵、标注主观、医学共享难,三重门槛叠加。

IntrA 的回答是"把战场搬到血管表面"。第一层是数据:103 个完整脑血管 3D 表面模型 + 1909 个自动切分血管段 + 116 个专家逐点标注的动脉瘤段,全部以点云/网格发布,每个标注段附测地距离矩阵——直接对接 PointNet/PointNet++/MeshCNN 等 3D 网络。第二层是工具:段自动生成、交互式边界标注、可视化质控三件套开源,流水线可复制。第三层是基准:17 种当时最先进的 3D 网络(点/体素/网格三派)在同一划分下 5 折交叉验证,给出分类与分割两个任务的完整基线——这是该领域第一个系统性 benchmark。

§0 读法三则:

  1. 这个条目是"数据集+标注工具箱+基准"三合一:本体是 103+1909+116 三层数据结构,工具是开源 Python 脚本,基准覆盖 17 网络——三者许可与获取方式见 §7。
  2. 全文统计数字均出自论文正文与表格(arXiv v2 全文核对);页码、引用数等存在多口径冲突处在坑点与附录 L 存照。
  3. 检索时注意:官方 GitHub 组织是 intra3d2019——CVF 官方摘要页转写成了 intra2d2019,照着错误地址找仓库会一无所获(坑 1)。

§1 数据集速览:十问十答

Q1:IntrA 到底有哪几层数据?
三层:①103 个完整脑血管 3D 模型(TOF-MRA 重建+人工修复);②1909 个自动生成的血管段(1694 健康+215 含动脉瘤),供分类;③116 个动脉瘤段由医学专家手工逐点标注(0=健康血管/1=动脉瘤),供部件分割。分类任务实际把②③合并为 2025 段使用。

Q2:3D 模型怎么来的?原始影像在哪?
每例患者的 TOF-MRA 包含 512×512×180~300 张 2D 切片(体素 0.469×0.469×1 mm),用单阈值法重建表面,再由两名神经外科医生在 Amira 里交互式多阈值修复+高斯平滑——约 50 个工作日。原始 2D MRA 因医学伦理不发布,你拿到手的只有修复后的表面模型。

Q3:血管段是怎么切出来的?
随机在完整模型上选点,沿血管表面取测地距离小于阈值的邻域生成段;为提高含瘤段数量,部分点由人工指定;生成后用可视化工具剔除形态模糊或只含琐碎组件的段。段内点数约 500~1700。

Q4:116 个标注段怎么标的?
自研交互标注工具:专家点击若干边界点,系统沿最短路径连成闭合曲线,再在瘤内选一个点,算法沿表面网格从该点向边界泛洪传播,圈定动脉瘤区域。支持多条边界线(可处理多动脉瘤段)。一名神经外科医生共花 8 小时完成全部 116 段。

Q5:测地距离矩阵是干什么用的?
血管是细长蜿蜒的管状流形,两个在欧氏空间很近的点沿血管壁可能很远。矩阵按"表面最短路"存储 N×N 点对距离(热方程快速近似法预计算),供网络把测地信息作为特征——PN++g 就是这么来的。代价是内存:点数上千的段,矩阵本身就是大对象。

Q6:分类基准谁最强?
分两列看:识别动脉瘤(临床最关心)是 PointNet++(1024 采样点)88.51%;识别健康血管与 F1 是 PointCNN(2048)98.95%/0.9044。PointNet 系在采样点充足时始终强势,PointNet 最弱(动脉瘤侧 69.50%)。

Q7:分割基准谁最强?
同样分两列:瘤体 IoU/DSC 最高是 SO-Net(2048)81.40%/88.76%;血管侧 IoU/DSC 最高是 PointConv(2048)94.65%/97.18%。体素派(SSCN/PointGrid)与 PointNet 明显落后(瘤体 IoU 40-61%)。

Q8:测地信息(-g 版本)提升多大?
有限但关键场景有用:PN++g 相比 PN++,瘤体 IoU 76.21→76.95、DSC 84.64→85.18——均值层面不到 1 个点;但在双动脉瘤等复杂拓扑段上,PN++g 与 PointConv 是唯二保持良好分割的方法。测地信息的价值在难例不在均值。

Q9:我现在能拿到什么?
官方 Google Drive 文件夹直链(数据+工具+论文+补充材料);OpenDataLab 镜像 2.3GB(需注册);HuggingFace 无官方镜像。注意没有 LICENSE 文件——使用许可是"引用论文"的学术惯例,商用要自评风险。

Q10:为什么它对 AI-Ready 重要?
它是"小而精、表面原生、临床直达"的 3D 医学数据集样本:数据+工具+基准三件套全开源可复现,但 license 缺位与单一直链托管是其 AI-Ready 短板;103 例的体量也提醒使用者——它是基准和原型工具,不是大规模预训练语料。

Q11:数据集"年龄"影响使用吗?
数据与基准成稿于 2019-2020:参与对比的是 2017-2019 年的 3D 网络(§6.1)。作为"经典基准+方法学切片"仍有效,第三方 2024-2025 年的工作仍在对照(§8.3);但把它当 SOTA 清单用就过时了——新方法需要自己补测。

Q12:103 例来自同一台设备吗?
不可知——设备型号、扫描机构、患者年龄/性别分布论文均未披露(只能从临床合作单位推断东大医院)。做跨设备泛化研究时这是硬空白(§2.9)。

Q13:测地矩阵覆盖所有段吗?
不。矩阵只随 116 个标注段提供;1909 个生成段没有测地矩阵(§2.5)。想在生成段上用测地特征需要自己按热方程法重算(FAQ Q28)。

Q14:能查到每个动脉瘤的类型(分叉/主干/水泡/混合)吗?
论文宣称四型全覆盖(§2.6),但数据包未提供逐段类型标签——按段查类型不可行。类型信息只体现在论文的覆盖声明与形态图示里。

Q15:这个数据集"还活着"吗?
官方维护自 2020-04 静默(§8.5),但三条生命线还在:直链与镜像可获取、社区持续使用(2024-2025 年仍有第三方工作)、基准协议可完整复现。“没人维护"不等于"不能用”,但意味着出了问题没人修——复核清单见附录 S。

§2 数据构成与规格:三层数据结构

2.1 三层结构总览

IntrA 的数据组织是一个自上而下的三层金字塔,每层服务不同任务:

层 内容 数量 来源 主要用途
L1 完整模型 全脑血管表面 3D 模型 103 TOF-MRA 重建+双神经外科医生修复 段生成原料;全脑血管形态学研究
L2 生成段 自动切分血管段 1909(1694 健康 + 215 动脉瘤) 随机选点+测地阈值邻域 二分类诊断(与 L3 合并成 2025 段)
L3 标注段 专家逐点标注动脉瘤段 116 交互工具闭合边界+泛洪勾画 部件分割(瘤体 vs 血管);瘤颈提取研究

三层是严格的生产关系:没有 L1 就没有 L2/L3;L2 的切分质量靠可视化工具人工把关;L3 的 116 段是全数据集标注密度最高的部分——每个点都有二分类标签。研究者最容易犯的错是把三层混为一谈:"103 个模型"与"1909 个段"是不同粒度的对象,论文图表里三类数据并列展示但语义不同。

2.2 L1 完整模型:从切片到表面

属性 规格
原始影像 TOF-MRA(时间飞跃法磁共振血管造影),人体全脑
切片数/例 512×512×180~300 张 2D 切片
体素间距 0.469×0.469×1 mm
重建方法 单阈值法(Hoogeveen 等 1998 的经典阈值分割流程)
修复流程 双神经外科医生交互式多阈值法(Kin 等 2012)分离动脉瘤段+高斯平滑,Amira 2019(Thermo Fisher)
修复成本 约 50 个工作日(全部 103 例)
后处理 MeshLab 去重复面/顶点、手工分离孤立碎片、消除非流形边、逐点生成法向量
发布状态 表面模型发布;原始 2D MRA 因医学伦理不发布

50 个工作日的修复成本是这个数据集最被低估的数字。单阈值重建得到的表面充满噪声、破洞与非流形结构,直接可用于深度学习的"干净"表面完全依赖神经外科医生逐例手工修复——两名医生、50 个工作日、103 例,折算约每人每例 2 个工作日。这也是 3D 医学表面数据集稀缺的根本原因:采集可以批量,修复无法批量。

2.3 L2 生成段:自动切分与人工筛选

血管段生成的算法逻辑两行就能说完:在完整模型上随机选种子点,收集沿血管表面测地距离小于阈值的邻近点,构成一个段。但三个工程细节决定了段的实际质量:

  1. 阈值即尺度:测地距离阈值决定段的大小——论文统计段内点数约 500~1700(对应测地距离 30 的采样密度)。阈值选小了段太碎(看不出解剖语境),选大了段太整(健康区稀释瘤体信号)。
  2. 手动补选:纯随机选点命中的含瘤段比例有限(动脉瘤在全脑血管表面占比很小),团队对部分种子点做人工指定以提高 215 个动脉瘤段的产出。
  3. 可视化质控:用自研 show_ann_data.py/show_result.py 逐段检查,剔除形态模糊或只含琐碎组件的段——"生成 1909 个"是筛选后的存活数,不是生成总数。

2.4 L3 标注段:116 段的逐点工艺

标注的对象是"动脉瘤段"——含瘤的血管片段,专家在段内逐点划分"健康血管"与"动脉瘤"两类。工具交互三步:点击若干边界点→最短路径连成闭合曲线→段内任选一点向边界泛洪传播圈定瘤区。多边界线支持让同一工具能同时完成"动脉瘤与血管分离"和"动脉瘤段与整模型分离"两级任务。

116 段由一名神经外科医生 8 小时完成。对比修复的 50 工作日,标注环节快得多——因为工具把"画每个点"压缩成"画一条闭合曲线+点一下",泛洪算法接管了曲线内部的所有点。这是交互式标注工具价值的最直接量化:同样的逐点标签,人工成本差出一个数量级以上。

需要注意标注粒度的临床含义:116 段的标签是"每个点属于瘤体还是血管",因此能直接训练逐点分割网络并提取瘤颈(瘤体与血管交界线);但它不包含瘤颈的显式曲线标注、破裂与否、位置解剖命名、尺寸测量等临床细粒度信息——后者仍需研究者自行派生。

2.5 附加资产:测地距离矩阵

每个标注段附带 N×N 测地距离矩阵(N=该段点数),由求解表面热方程的快速近似测地法(Crane 等 2013)预计算。设计动机有三:血管形状下测地距离比欧氏距离更真实;预计算把训练时的重复计算一次性前置;N×N 直接可查无需运行时构建。

使用成本提示:点数 1700 的段,矩阵约 290 万个浮点值;全部 116 段的矩阵体积不可忽略。若你的网络只用 K 近邻而不需要全点对测地值,可以做稀疏化裁剪再喂给训练管线。

2.6 动脉瘤类型学:四型全覆盖

论文宣称覆盖医学上全部四种颅内动脉瘤形态类型:

类型 形态学特征 分割难度要点
分叉型 bifurcation 发生于血管分叉处 多支血管汇流,边界曲率变化剧烈
主干型 trunk 沿血管主干壁膨出 瘤体与载瘤血管管径渐变,边界模糊
水泡型 blister 血管壁局部菲薄隆起 体积小、隆起浅,最易漏检漏分
混合型 combined 上述形态并存 多瘤体共存段,一段双瘤是公认难例

论文强调数据"小而多样"(small but diverse):绝对数量不大(103 例),但形状与尺度差异大,段内瘤体占比从微小到显著均有分布。这直接决定了基准成绩的解读方式——均值数字掩盖了难例,见 §4.5。

2.7 与 2D/体数据的关系边界

使用前必须明确三件事不是 IntrA 提供的:原始 2D MRA 切片(伦理限制不发布,做 2D MRA/MIP 研究请另寻数据集);体素级血管分割掩码(本数据集只有表面模型,无体数据掩码);患者级元数据(年龄、性别、病程、设备型号、扫描机构均未披露)。IntrA 是"表面模型+逐点标签"的数据集,任何需要回到原始影像或体数据的用法都不在其设计范围内。

2.8 数字-文件映射:下载后核对什么

IntrA 发布没有逐文件 manifest,也没有 checksum——下载完整性只能靠"层数量-文件粒度-可加载性"三步间接核对。对照表如下:

检查对象 论文口径数量 文件粒度 核对方法 不符时的第一反应
L1 完整模型 103 逐模型 3D 表面文件(OBJ 系) 逐个可加载、顶点/面数非零 核对下载源是否完整(对照 OpenDataLab 2.3GB 口径)
L2 生成段 1909(1694 健康 + 215 含瘤) 逐段文件,健康/含瘤分列 分列计数相加是否等于 1909 确认健康与动脉瘤两个子集都数了
L3 标注段 116 逐段点 + 逐点标签(0/1) 数量核对 + 标签值域检查 区分"含瘤生成段"与"标注段"两套口径(坑 3)
测地矩阵 与标注段一一对应 逐段 N×N 矩阵 形状对齐段点数、对角为 0 矩阵与段文件版本是否配套
工具 4 件套脚本 annotation / random_pick / selection / 可视化 直接运行自测 与仓库 tools 目录及 README 对读

三条解读:

  1. 没有 manifest 的代价:无法做哈希级校验,只能按数量与可加载性核对;OpenDataLab 镜像同样未公布 checksum。对跑基准影响有限,对需要长期归档的团队,建议下载后自建 manifest 再入库。
  2. 两套"215/116"别混:215 个含瘤生成段(只有段级标签)与 116 个标注段(逐点标签+测地矩阵)是不同对象;数文件时按目录语义分桶,不要用总数一刀切。
  3. 工具栈有年代:仓库成稿于 2019-2020 年,工具按当时 Python 生态编写;现代环境运行前先做依赖隔离(虚拟环境),不要在系统 Python 里直接跑。

2.9 数据包边界:什么不在里面(完整清单)

§2.7 讲了"与 2D/体数据的关系边界",这里把"不随数据包发布"的内容一次列全,每项给替代路径:

不在包里 原因 替代路径
原始 2D MRA 切片 医学伦理,明确不发布 体数据研究转 ADAM(TOF-MRA)/LargeIA(CTA),见 §6.4
体素级血管/瘤体掩码 只有表面表示 同上;或自行从表面模型栅格化(注意范式差异,§6.5)
患者级元数据(年龄/性别/例数/机构/设备) 论文未披露 无替代;人群亚组分析不可行
瘤颈显式曲线、破裂状态、位置解剖标签 标注只到逐点二分类 可基于 116 段自派生(瘤体-血管交界线即瘤颈近似,FAQ Q30)
逐文件 manifest 与 checksum 官方未提供 自建(见 §2.8)
官方训练/评测代码 只发布工具+协议描述 各网络用原作者开源实现接入(§4.1 协议)
HuggingFace 镜像 无官方镜像(2026-09-29 核实) 自行下载后转 HF 格式
LICENSE 文件 仓库无 license、镜像标未知 引用论文惯例;商用先联系作者(§7.2)

一句话总结:IntrA 给的是"重建+修复+切分+标注"这条流水线的最终产物与工具,上游原始数据与下游训练代码都留白了——留白处分别由 ADAM/LargeIA(上游体数据)与各网络官方实现(下游训练)补位。

§3 构建流水线:从 2D 切片到可训练表面

3.1 五阶段流水线总览

论文给出的处理流水线(Pipeline)可拆为五个阶段,每阶段的产物与质量责任:

阶段 动作 工具/方法 产物
1 重建 单阈值法从 TOF-MRA 切片重建表面 经典阈值分割(Hoogeveen 1998) 噪声表面模型
2 修复 交互式多阈值分离动脉瘤段+高斯平滑 Amira 2019,双神经外科医生,~50 工作日 解剖学正确的完整模型
3 清洗 去重复面/顶点、去孤立碎片、消除非流形边、生成法向量 MeshLab 滤器+手工分离 流形网格
4 切分与标注 血管段生成+116 段逐点标注 自研 random_pick/selection/annotation 工具,8 小时 1909 段+116 标注段
5 测地预计算 每个标注段计算 N×N 测地矩阵 热方程快速近似法(Crane 2013) 测地距离矩阵

3.2 为什么必须人工修复

重建得到的原始表面有三个医学上不可接受的问题:噪声(阈值分割把伪影当血管)、破洞(血流慢的区域信号弱)、解剖残缺(细小分支断裂)。论文明确指出非流形网格无法直接喂给 MeshCNN 这类网格卷积网络,而现有自动流形化算法(如 Huang 等 2018)“不删除孤立组件且明显改变模型形状”——对医学应用不可接受。因此选择全人工修复:这 50 个工作日买来的是"每个模型都解剖学正确"的质量保证,也是论文敢把数据集称为 ideal dataset for algorithm research 的底气。

对复用者的含义:想复制 IntrA 流程到新机构数据,预算里最大头不是标注(8 小时)而是修复(50 工作日)。任何"自动化修复"的改进都值得做,但别指望零人工。

3.3 MeshLab 清洗的技术细节

清洗环节处理四类问题:重复面/顶点(重建算法副产物)、孤立碎片(噪声组件)、非流形边(一条边被三个以上面共享,网格卷积的数学前提被破坏)、缺失法向量(PointNet 系网络的输入特征之一)。论文特意对比了自动化方案并给出不用的理由——这个选择让数据集对 MeshCNN 等网格方法真正可用,也让"点云+网格双表示"的承诺成立。

3.4 工具箱盘点:四件套全开源

工具 文件 功能
标注 annotation/main.py 闭合边界线绘制+泛洪圈定+多边界线分离
段生成 random_pick.py, selection.py 随机/手动种子点+测地阈值邻域切分
可视化 show_ann_data.py 标注数据渲染检查
结果查看 show_result.py 分割结果渲染对比

工具的意义超出"这四个脚本"本身:它公开了从完整模型到标注段的可复制生产路径,第三方机构可以用同一套流程标注自己的 MRA 重建数据——这是数据集之外的方法论贡献,论文把它列为三大贡献之一。

3.5 成本结构:50 个工作日与 8 小时的账本

IntrA 的生产成本可以拆成一层账,各环节的人工密度完全不同:

环节 人工投入 折算 密度感受
采集(隐含) 患者扫描(TOF-MRA) 103 例 临床常规检查,边际成本低——但受伦理约束不可再分发
修复 两名神经外科医生约 50 个工作日 ~0.5 人·工作日/例 成本大头:Amira 交互式多阈值+高斯平滑逐例进行
清洗 MeshLab 滤器+手工分离 未单列 混在修复环节内
段生成 自动切分+人工筛选 未单列 算力可忽略,质控走查耗人工
逐点标注 一名医生 8 小时 ~4 分钟/段(116 段) 交互工具把"画点"压缩成"画线+泛洪"
测地预计算 自动 — 热方程法一次性完成

两个结构性结论:

  1. 成本瓶颈在"修复"不在"标注"——修复与标注的投入差约两个数量级(50 工作日 vs 8 小时)。3D 医学表面数据集稀缺的根因即在此:采集可以随临床流程批量产生,把表面修到"解剖学正确+流形干净"无法批量(§3.2)。
  2. 标注效率是工具红利:8 小时/116 段的效率来自"闭合边界线+泛洪传播"的交互设计(§2.4)。任何把 IntrA 流水线迁移到自有数据的团队,预算排序应为:修复 > 质控 > 标注(§9.6 复用清单)。

§4 基准:17 种 3D 网络的同题测试

4.1 评测协议

协议细节决定基准数字的可比性,逐条列出:

  • 划分:数据 shuffle 后分 5 个子样本,5 折交叉验证(4 训 1 测);所有方法用同一划分——排除了划分随机性对方法排名的干扰
  • 重复:分割任务每个子样本测试重复 3 次,取各次最优结果的均值
  • 实现:接各网络原作者的开源实现,超参数与损失函数保持原论文设置——测的是"原味"性能
  • 硬件:GeForce RTX 2080 Ti×2 + GTX 1080 Ti×1;全部方法总训练时长超 92 小时
  • 指标:分类=血管准确率(V.)/动脉瘤准确率(A.)/F1(均折间均值);分割=Jaccard(IoU)与 Sørensen-Dice(DSC),血管(V.)与动脉瘤(A.)分列,附 95% 置信区间
  • 输入:各方法按自身设计喂 512/1024/2048 采样点(DGCNN 另需 K 近邻参数;MeshCNN 按面数 750/1500/2250;体素方法按分辨率 24/32/40)

4.2 分类基准全表(2025 段)

网络 输入点数 V. 健康段准确率 (%) A. 动脉瘤段准确率 (%) F1
PointNet++ 512 98.52 86.69 0.8928
PointNet++ 1024 98.52 88.51(A 最高) 0.9029
PointNet++ 2048 98.76 87.31 0.9016
SpiderCNN 512 98.05 84.58 0.8692
SpiderCNN 1024 97.28 87.90 0.8722
SpiderCNN 2048 97.82 84.89 0.8662
SO-Net 512 98.76 84.24 0.8840
SO-Net 1024 98.88 81.21 0.8684
SO-Net 2048 98.88 83.94 0.8850
PointCNN 512 98.38 78.25 0.8494
PointCNN 1024 98.79 81.28 0.8748
PointCNN 2048 98.95(V 最高) 85.81 0.9044(F1 最高)
DGCNN 512/10 95.22 60.73 0.6578
DGCNN 1024/20 95.34 72.21 0.7376
DGCNN 2048/40 97.93 83.40 0.8594
PointNet 512 94.45 67.66 0.6909
PointNet 1024 94.98 64.96 0.6835
PointNet 2048 93.74 69.50 0.6916

三个规律:①几乎所有方法的准确率与 F1 随采样点增加而上升——点云任务"点多信息多";②例外是 SpiderCNN(1024 点时动脉瘤检出最高 87.90%)与 PointNet(总体最弱);③多数误分类样本是小体积或不完整动脉瘤——与健康血管难以区分,这是任务本身的难度上界而非方法缺陷。

4.3 分割基准全表(116 段)

派别 网络 输入 IoU V. (%) IoU A. (%) DSC V. (%) DSC A. (%)
点 SO-Net 512 94.22 80.14 96.95 87.90
点 SO-Net 2048 94.46 81.40(A 最高) 97.09 88.76(最高)
点 PointConv 512 94.16 79.09 96.89 86.01
点 PointConv 2048 94.65(V 最高) 79.53 97.18(最高) 86.52
点 PN++g 512 93.34 75.74 96.47 83.90
点 PN++g 1024 93.28 76.53 96.43 84.82
点 PN++g 2048 93.60 76.95 96.62 85.18
点 PN++ 512 93.42 76.22 96.48 83.92
点 PN++ 1024 93.35 76.38 96.47 84.62
点 PN++ 2048 93.24 76.21 96.40 84.64
点 PointCNN 512 92.49 70.65 95.97 78.55
点 PointCNN 1024 93.47 74.11 96.53 81.74
点 PointCNN 2048 93.59 73.58 96.62 81.36
网格 MeshCNN 750 85.43 55.63 91.71 68.65
网格 MeshCNN 1500 90.86 71.32 95.10 82.21
网格 MeshCNN 2250 90.34 71.60 94.77 81.87
点 SpiderCNN 512 90.16 67.25 94.53 75.82
体素 SSCN-F 24 87.95 56.56 93.35 66.04
体素 SSCN-F 32 88.08 55.26 93.44 64.05
体素 SSCN-F 40 90.09 61.45 94.62 70.54
体素 SSCN-U 24 87.43 55.78 93.00 65.03
体素 SSCN-U 32 86.13 53.52 92.24 64.01
体素 SSCN-U 40 88.66 57.94 93.78 67.39
体素 PointGrid 16/2 78.32 35.82 87.36 47.33
体素 PointGrid 16/4 79.49 38.23 88.08 49.14
体素 PointGrid 32/2 80.11 42.42 88.50 53.52
点 PointNet 512 73.99 37.30 84.05 48.96
点 PointNet 1024 75.23 37.07 — —

(PointNet 1024/2048 与 PointGrid 部分行的完整数值见论文 Table 2 原表;上表为主流行转。)

4.4 分割结果的四条解读

  1. 点云派整体领先:SO-Net/PointConv/PN++ 系在瘤体 IoU 上把体素派(SSCN 55-61%、PointGrid 36-42%)甩开 15-25 个点——管状流形上逐点特征远比体素栅格高效。
  2. 两列指标必分开看:血管侧(面积占优)全体网络 93%+,瘤体侧才区分高下(37-81%)。只看均值或血管列会得出"都差不多"的错误结论。
  3. MeshCNN 的相对优势在难例:整体成绩中等,但论文指出它"每个动脉瘤都分得体面"——网格卷积自带的流形信息在复杂拓扑上起作用。
  4. PointNet 的断崖是教学样本:同是逐点方法,PointNet(无层级特征)瘤体 IoU 37% vs PN++ 76%——层级聚合(sampling & grouping)在细长结构上不是锦上添花而是生死线。

4.5 难例解剖:什么情况下所有方法都翻车

论文用对比图给出三类公认难例:

  • 小尺寸比瘤体:动脉瘤占段的比例(瘤体对角线/全局段对角线定义)很小时,各方法准确率齐跌——瘤体信号被健康血管淹没。
  • 双动脉瘤段:一段两瘤,多数方法失败;唯二保持良好表现的是 PointConv 与带测地信息的 PN++g——前者靠可学习空间滤波器,后者靠测地距离提供非欧邻域信息。
  • 微小/不完整动脉瘤(分类任务):与健康血管在形态上几乎无差,是误分类主体。

4.6 训练效率谱:5 秒与 24 秒的差距

网络 每 epoch 耗时 收敛 epoch 硬件
PN++ 5 s(最快) ~115 GTX 1080 Ti
PointCNN 24 s(最慢) ~500 GTX 1080 Ti

PN++ 的效率+准确率组合(最快且瘤体检出最高)是论文点名的临床可用性证据——准实时诊断对算力的要求由此变得现实。PointCNN 精度高但训练成本是 PN++ 的近 20 倍。附带记录:3D CapsuleNet 尝试失败——把所有点判为健康血管,跨数据集泛化能力受限,论文以此提醒"在 ShapeNet 上有效的 3D 方法不能自动迁移到血管表面"。

4.7 引用这些数字前的检查单

§4 的基准表格是本条目被引用最多的部分,引用前逐项过一遍:

  • [ ] 划分声明:你自己的实验是否沿用"shuffle 后 5 等分、所有方法同划分"协议?未声明划分来源的数字与表内不可比(FAQ Q17)。
  • [ ] 输入档位:每行数字绑定特定输入(点云法 512/1024/2048 点;DGCNN 另带 K 近邻档;MeshCNN 按面数 750/1500/2250;体素法按分辨率 24/32/40)——引用"PN++ 88.51%“必须带上”(1024 点)"。
  • [ ] 两列指标:V./A. 分列是本基准的设计核心,只引一列会系统性误导(坑 8)。
  • [ ] 重复口径:分割每折重复 3 次取最优均值——单次运行数字不在同一口径上。
  • [ ] 指标定义:IoU=Jaccard、DSC=Sørensen-Dice、CI95 为折间/重复间置信区间。
  • [ ] 硬件语境:效率数字(5 s/epoch 等)绑定 GTX 1080 Ti;换硬件只保序不保值。
  • [ ] 四个"最高"别串:分类动脉瘤准确率最高=PN++(1024)88.51%;分类血管/F1 最高=PointCNN(2048)98.95%/0.9044;分割瘤体 IoU/DSC 最高=SO-Net(2048)81.40%/88.76%;分割血管 IoU/DSC 最高=PointConv(2048)94.65%/97.18%。

§5 测地信息与非欧几何:3D 医学表面的方法论课

5.1 为什么欧氏距离在血管上失灵

血管是细长蜿蜒的管状流形:两个空间坐标很近的点可能分属两支相邻血管,或同一血管的内外壁——欧氏近邻会"跨管"连接语义上无关的区域。逐点方法(PointNet 系)默认用欧氏距离估计点间相关性,这个假设在 CAD 模型上无害,在血管表面上有害。PN++ 的典型错误是把紧贴血管的瘤体点判给血管——空间上近,沿壁传播的语义却已越过边界。

5.2 测地信息的两种注入方式与定量答案

IntrA 验证了注入表面测地结构的三条路径:

路径 机制 代表 瘤体 IoU
预计算矩阵作输入特征 PN++g 把测地距离加进逐点特征 PN++g 2048 76.95(vs PN++ 76.21)
网格卷积自带流形结构 MeshCNN 在边上做卷积,邻域沿表面展开 MeshCNN 2250 71.60
可学习空间滤波器 PointConv 学局部空间权重,间接捕获几何 PointConv 2048 79.53

定量结论要诚实:均值层面测地增强只带来不到 1 个点的提升(76.21→76.95),单看均值会以为测地矩阵白算了。但难例层面(双动脉瘤、复杂拓扑)测地信息+空间滤波是唯二稳定解。这是 3D 医学表面学习的普遍规律:附加几何信息不改均值、改下限。

5.3 超出动脉瘤的辐射面

论文明确列出数据集可支撑的其他 3D 任务:法向估计(数据带法向量)、测地估计(带测地矩阵)、3D 表面重建、医学几何统计。跨领域研究者把它当作"小规模、高保真、带非欧标注的管状流形基准"使用——后续对比学习工作(把 2025 段用于无监督预训练)即属此类。

5.4 可迁移的三条方法论结论

把 IntrA 的测地/非欧几何实验从"动脉瘤"这个具体对象上抽象出来,得到三条能带到其他 3D 医学表面任务的结论:

  1. 局部邻域聚合是管状流形上的生死线:PointNet(无邻域)瘤体 IoU 37% vs PN++(层级邻域)76%——细长弯曲结构上,"哪些点相邻"必须沿表面定义,全局池化不够(§4.4/§6.2)。
  2. 附加几何信息"不改均值、改下限":测地增强只把均值推高不到 1 个 IoU 点,但在双动脉瘤等复杂拓扑难例上是唯二稳定解(§5.2)——为均值上不了榜的几何先验辩护时,用难例指标说话。
  3. 表面先验能兑现为临床收益:同团队后续把表面范式做成两步法临床流水线,DSC 72% vs 体素法 46%(CVMJ 2023,§8.2)——基准里的范式优势可以穿越到部署环境,但需要重新工程化(分类+分割两步、临床级输出)。

反例也值得记住:3D CapsuleNet 在 ShapeNet 上有效、在血管表面全判健康(§4.6)——表面基准的"小而多样"不豁免跨域验证,反之亦然。

§6 方法综述:血管分割与动脉瘤检测的基准方法谱系

IntrA 的 17 网络基准(§4)横跨三个表示派别,正好是 2017-2019 年 3D 深度学习方法演进的切片。本节先按谱系梳理 10 个核心网络(venue 全部经第二轮补核逐一定位,见附录 K),再放进血管分割与动脉瘤检测的更广基准版图——回答"我的任务该去哪一族方法里找基线、找数据"。

6.1 三派范式与 10 网络档案

网络 派别 发表 venue 在 IntrA 基准中的角色
PointNet 点 CVPR 2017 逐点 MLP 开山作;本基准最弱基线(瘤体 IoU 37.30%)
PointNet++(PN++) 点 NIPS 2017 层级采样分组;分类动脉瘤准确率最高(88.51%,1024 点)+训练最快
SO-Net 点 CVPR 2018 SOM 建模点云分布;分割瘤体 IoU/DSC 最高(81.40%/88.76%)
PointConv 点 NeurIPS 2018 可学习连续卷积;血管 IoU/DSC 最高(94.65%/97.18%),难例稳定
SpiderCNN 点 ECCV 2018 泰勒展开参数化图卷积(venue 常被误记为 TOG,勘误存照附录 L)
PointCNN 点 NIPS 2018 X-Conv 学习化卷积;分类血管/F1 最高(98.95%/0.9044),训练最慢
DGCNN 点 ACM TOG 2019(SIGGRAPH) 动态图 EdgeConv;协议中需额外 K 近邻参数档
MeshCNN 网格 SIGGRAPH 2019 边卷积+边坍缩;网格派唯一代表,难例鲁棒
SSCN 体素 CVPR 2018 亚流形稀疏卷积;体素派主力(瘤体 IoU 55-61%)
PointGrid 体素 CVPR 2018 体素栅格内嵌点混合表示(瘤体 IoU 36-42%),pp. 9204-9214

6.2 点云派内部:局部邻域聚合的进化线

  • PointNet(CVPR 2017):逐点共享 MLP + 全局池化,没有局部邻域概念。血管表面上瘤体与血管的区分恰恰依赖局部几何——这解释了它在 IntrA 上的断崖(§4.4 第 4 条)。
  • PointNet++(NIPS 2017):引入层级 sampling & grouping 做局部邻域聚合。IntrA 上瘤体检出最高+训练最快,论文点名的实用化首选;测地增强版 PN++g 额外读入 N×N 测地矩阵(§5.2)。
  • PointCNN(NIPS 2018):把卷积学习成 X 变换再作用于邻域特征。分类血管列最强,但 24 s/epoch 的训练成本约为 PN++ 的 5 倍(§4.6)。
  • SO-Net(CVPR 2018):自组织映射(SOM)建模点云空间分布后再逐点卷积。分割瘤体 IoU 最高——其 SOM 结构对小目标的敏感性被认为是瘤体侧领先的来源之一(§9.3)。
  • PointConv(NeurIPS 2018):把卷积推广为连续集合上的可学习权重+密度补偿。血管侧最优,且是双动脉瘤难例上唯二稳定者之一(§4.5)。
  • SpiderCNN(ECCV 2018):在图上做泰勒展开式参数化卷积。注意 venue:部分二手资料误记为 ACM TOG,实为 ECCV 2018(附录 K/L)。
  • DGCNN(TOG 2019):EdgeConv 在动态构造的 K 近邻图上提取边特征;IntrA 协议为其单列 K 参数档(512/10、1024/20、2048/40)。

共同规律:凡是带局部邻域聚合的逐点方法,瘤体侧都不差;唯一无邻域的 PointNet 垫底。管状流形上的"局部性"就是生死线——这是 IntrA 基准对 3D 方法论最干净的一条贡献。

6.3 网格派与体素派:各自的成立条件

  • MeshCNN(SIGGRAPH 2019):在网格边(edge)上做卷积与边坍缩池化,天然携带流形连接信息。整体成绩中等(瘤体 IoU 71.60%,2250 面),但论文指出它"每个动脉瘤都分得体面"——复杂拓扑难例上的鲁棒性是网格结构信息的直接证据。成立前提是输入必须是干净流形网格:这正是 IntrA 花 50 个工作日清洗的原因(§3.2/§3.3)。
  • SSCN(CVPR 2018):亚流形稀疏卷积——只对占用体素计算卷积,绕开稠密栅格的算力浪费。IntrA 上是体素派最好成绩(分辨率 40 时瘤体 IoU 61.45%),但分辨率敏感(24→40 波动约 8 个点,其他方法约 2 个点)。
  • PointGrid(CVPR 2018, pp. 9204-9214, DOI 10.1109/CVPR.2018.00959):每个体素格子内嵌入固定数量点,混合体素+点表示。原论文推荐 N=16/K=2,IntrA 实测 N=32/K=2 最优(瘤体 IoU 42.42%)——超参敏感,仍是全体倒数第二。

体素派的共同困境:血管只占体数据的极小部分,栅格化既浪费算力又破坏管状几何语义。它们的合理主场是本来就以体数据为输入的任务(ADAM 式体分割),而非表面基准——场景错配是"体素方法为什么这么差"(FAQ Q15)的完整答案。

6.4 血管与动脉瘤任务的更广基准版图

把 IntrA 放进"输入表示 × 任务"二维谱系,一眼看清邻居与出口:

谱系 代表基准(库内 rid) 表示 任务
2D 眼底血管分割 drive(241)、chase-db1(251)、hrf(261) 2D 彩照/荧光造影 2D 血管网分割
2D 眼底病变分割 deepdrid(211)、drishti-gs(301) 2D 彩照 病灶分级/视杯视盘分割
体数据分割挑战赛 brats(24)、luna16(237)、retouch(321)、verse-spine(435)、selma3d(681) 3D 体数据 病灶/器官分割(多含榜单)
体数据动脉瘤 ADAM(库内无条目)、LargeIA(库内无条目) TOF-MRA / CTA 体数据 检测 + 体分割
表面动脉瘤 IntrA(本条目) 点云/网格表面 段级分类 + 部件分割
大规模器官分割 totalsegmentator(422)、btcv(377) CT 体数据 多器官分割

两个库外对照数据集(均经第二轮补核实核,档案见附录 M/N):

  • ADAM(Aneurysm Detection And segMentation):挑战赛数据全部为 TOF-MRA——常被讹传为 4D-DSA/CTA 混合,勘误见坑 9 与附录 L。训练 113 例/129 个未破裂动脉瘤(UIA)、测试 141 例/153 UIA,检出+分割双任务,在线榜单持续开放(官方论文 Timmins et al., NeuroImage;官网 adam.isi.uu.nl)。
  • LargeIA:内部 1338 例 CTA(1489 个 IA)+ 外部测试 138 例(101 IA),血管+动脉瘤双标签体素掩码;Zenodo 记录 6801397/6801398,申请制、非商用(论文 An intracranial aneurysm labeling dataset with both vessel and aneurysm labels, Patterns 2(10):100197, 2021,DOI 10.1016/j.patter.2020.100197)。

6.5 表面范式 vs 体素范式:两条定量证据

  1. 同数据对照(IntrA 基准内):点云派瘤体 IoU 76-81% vs 体素派 36-61%——差距 15-25 个点(§4.4 第 1 条)。
  2. 临床流水线对照(团队后续):同一批 TOF-MRA 上,surface 两步法 DSC 72% vs pixel 法 46%(CVMJ 2023,§8.2)——表面范式优势在真实临床链路里复现。
  3. 反例警示(双向):3D CapsuleNet 在 IntrA 上全判健康血管(§4.6)——表面基准的领先不会自动迁移给任意 3D 方法;反过来,ADAM 榜单上的体数据强方法搬到表面任务同样需要重新验证。范式优势是"任务-表示匹配"的函数,不是方法本身的绝对属性。

6.6 选型速查

你的输入是什么?
├── 已有 3D 表面模型(血管/器官表面)
│   └── 点云族起手:PN++(快)/ PointConv(血管列)/ SO-Net(瘤体列)
│       网格可用时加 MeshCNN 验难例鲁棒性
├── 只有体数据(MRA/CTA)
│   └── 体素族:3D U-Net 系 / SSCN;动脉瘤检测+分割直接对表 ADAM 榜单
├── 2D 影像血管分析
│   └── 转库内 2D 谱系:drive(241) / chase-db1(251) / hrf(261)
└── 表面+体数据都想覆盖
    └── IntrA(表面)+ ADAM/LargeIA(体)双轨,
        注意模态与粒度差异(FAQ Q20/Q25)

§7 获取与许可:一条直链、一个镜像、零 license 文件

7.1 三条获取路径

路径 地址/入口 内容 门槛
官方直链 Google Drive 文件夹(README “download here”,ID 1yjLdofRRqyklgwFOC0K4r7ee1LPKstPh) 完整数据+工具+论文+补充材料 需访问 Google 服务(大陆网络受限)
国内镜像 OpenDataLab OpenDataLab/IntrA 2.3GB 数据包(标签:图像/CV/3D 点云/分类/医学诊断/三维部件分割) 需注册 OpenDataLab 账号
反馈表单 forms.gle/rvMRsQ8t8Z6J8rdq8 可选:向团队登记使用信息 非强制

HuggingFace 无官方镜像(hf-mirror API 检索确认,抓取时点 2026-09-29)——习惯了 HF datasets 一键加载的用户需要退回"下载文件+本地解析"模式。

7.2 license 状态细读:这是本数据集最大的合规暗礁

逐层盘点:

  1. 官方 GitHub 仓库无 LICENSE 文件:目录仅 fileSplit/images/paper/tools/README,README 只写"使用请引用论文"(Please cite our paper if you use it)——这是学术惯例层面的授权,不是法律文本意义上的 license。
  2. OpenDataLab 镜像 license 栏标注为未知:镜像方也无法确认原始许可。
  3. arXiv 论文文本:nonexclusive-distrib 1.0(arXiv 标准非独占分发许可)——这只约束论文本身,不约束数据。
  4. 原始 TOF-MRA 影像:来自患者数据、受医学伦理约束,原始 2D 数据明确不发布;重建表面模型的二次使用边界论文未作声明。

对使用者的实际建议:学术研究、方法对比、基准复现——引论文即可,社区无异议;任何商用或再分发行为缺乏明确法律基础,需要自行联系作者获取书面授权(团队有公开反馈表单可作入口)。

7.3 数据包内部结构(据官方仓库与论文整理)

IntrA/
├── complete_models/      # 103 个完整脑血管表面模型
├── generated_segments/   # 1909 个自动生成血管段(健康/动脉瘤分列)
├── annotated_segments/   # 116 个逐点标注动脉瘤段
├── geodesic_matrices/    # 每个标注段的 N×N 测地距离矩阵
├── annotation/           # 标注工具(main.py)
├── fileSplit/            # 段切分辅助
├── tools/                # random_pick.py / selection.py / 可视化脚本
├── paper/                # 论文 PDF + 补充材料 supp.pdf
└── images/               # README 配图

(目录名以上传仓库结构为准,下载后请以实际清单核对——官方未发布数据字典,此为按仓库文件与论文描述整理的示意。)

7.4 AI-Ready 评估:DAIMS 五维

维度 评分(1-10) 依据
D 可发现性 6 论文/CVPR/arXiv 均可索引,但"IntrA"检索歧义大(坑 2),CVF 摘要页 org 转写错误误导检索(坑 1),无独立数据集主页
A 可获取性 5 有官方直链与国内镜像,但依赖 Google Drive(大陆受限)、HF 无镜像、无 LICENSE 文件构成合规不确定性
I 可互操作 6 标准网格/点云格式可用主流 3D 库加载,工具为原生 Python;无数据字典、无标准元数据 schema、无 HF/Dataset 标准化接口
M 元数据质量 7 论文统计与协议描述完整(5 折划分/硬件/指标定义均明示);患者级元数据缺失、无逐例清单
S 可持续性 5 单一直链托管+个人课题组维护(2019-2020 年后仓库无活跃更新),镜像单一,长期可用性存疑
综合评级 5.8/10(中等) 数据与基准质量高于均值,可获取性与可持续性被单链托管+license 缺位拖低

7.5 与库内可获取性光谱的对照

把 IntrA 放进本库的可获取性光谱:它属于"公开直链但许可模糊"型——比请求制数据集(如掩码需邮件申请的类型)获取门槛低,比 CC 授权数据集(公开直链+明确许可)合规确定性差。同类 3D 医学表面数据集中,这种"数据开放、许可沉默"的状态在 2019-2020 年 CVPR 时代的医学数据集里相当典型,IntrA 是该时代切片的一个清晰样本。

7.6 下载后五步校验

拿到数据包(官方直链或镜像)后,按序执行:

  1. 数量核对:L1=103、L2 分列计数相加=1909(健康 1694+含瘤 215)、L3=116——任何对不上先怀疑下载不完整(官方无 manifest/checksum,见 §2.8)。
  2. 可加载性:抽取 5-10 个模型用主流 3D 库加载,确认顶点/面数非零、法向量存在(PointNet 系的输入特征之一,§3.3)。
  3. 流形性抽查:计划使用 MeshCNN 的用户必须检查非流形边——官方已清洗,但二次处理(重采样/裁剪/合并)会重新引入非流形结构。
  4. 标签值域:116 个标注段逐点值域应为 {0,1}(0=健康血管/1=动脉瘤);出现其他值说明文件版本错乱。
  5. 矩阵形状:测地矩阵 N×N 与对应段点数一致、对角为 0;不一致说明矩阵与段文件不配套。

镜像对照提示:官方直链与 OpenDataLab 镜像(2.3GB)均未公布一致性校验手段;若两源核对结果不一致,以官方直链为准,并在使用声明中注明实际取用源。

§8 生态与影响:一个实验室的连续剧

8.1 团队谱系

IntrA 诞生于东京大学 Takeo Igarashi 实验室(STLAB,人机交互与计算机图形学重镇)与临床神经外科(Taichi Kin)的合作。一作 Xi Yang 的作者轨迹(dblp:早年岩手大学,之后东大序列)显示这是一条"计算机图形学方法进入医学影像"的路线;二作 Ding Xia(东大+华南理工双单位,现为东大研究者)是 arXiv 提交人与后续工作主力。资助方为日本医疗研究开发机构 AMED(JP18he1602001)——注意这不是中国内地机构资助的项目,尽管有华南理工合作单位且部分中文资料把团队误记为内地院校。

8.2 同团队后续工作:三部曲结构

时间 工作 发表 关键数字
2020-03 IntrA 数据集论文 CVPR 2020 Oral 本条目主体
2020-06 Surface-based 3D Deep Learning Framework for Segmentation of Intracranial Aneurysms from TOF-MRA Images arXiv 2006.16161(扩展版见下行) surface 法 DSC 72% vs pixel 法 46%
2023 A Two-step Surface-based 3D Deep Learning Pipeline for Segmentation of Intracranial Aneurysms Computational Visual Media 9(1):57-69 两步法 DSC 72%;PointNet++ 分类+SO-Net 分割的实用化流水线
2022 Data-Driven Multi-modal Partial Medical Image Preregistration by Template Space Patch Mapping MICCAI 2022 同团队医学影像延伸

三部曲的逻辑:先建数据集(CVPR 2020)→ 再把数据集变成可用诊断流水线(arXiv/CVMJ 2023)→ 横向扩展医学几何问题(MICCAI 2022)。CVMJ 2023 的 72% vs 46% 是"表面范式优于体素范式"主张在临床流程里的落锤。

8.3 第三方使用:谁在用它做什么

按可查证的使用方式分类(采样,非穷举):

  1. IA 自动测量的几何分类器(Nature Scientific Reports 2024,s41598-024-65825-4):人机动脉瘤尺寸测量一致性研究中,用 IntrA 训练 PointNet++ 做瘤体隔离的几何分类器,点分类 TPR 达 0.96,再迁移到自有 CTA 数据——IntrA 当"几何先验训练场"用。
  2. 无监督表示学习的预训练语料(arXiv 2201.02198):把 2025 个血管段喂给双分支对比学习编码器,下游做分类/分割微调——IntrA 当小规模 3D 医学自监督基准用。
  3. 点云分割新方法的必测基准(中科院软件所 2025,片序列注意力分割;及多篇中文核心):IntrA 已成为中文文献里 3D 动脉瘤分割论文的标准对照数据集。
  4. 跨域 3D 生成特征迁移(TRELLIS-Enhanced Surface Features,2025-09):用非医学 3D 生成模型的几何嵌入做 IA 分析,跨越"医学数据稀缺"的障碍——IntrA 提供迁移效果的检验场。

四种用法共同点:没有人在 IntrA 上做大规模预训练——103 例的体量决定了它是基准与先验,不是语料。

8.4 在颅内动脉瘤数据集景观中的位置

数据集 模态 规模 表面/体素 开放度
IntrA TOF-MRA 重建表面 103 模型/1909 段/116 标注段 表面(点云+网格) 直链开放(无 license 文件)
ADAM TOF-MRA(全部) 训练 113 例/129 UIA + 测试 141 例/153 UIA 体数据+掩码 挑战赛注册制
LargeIA 3D CTA 1338 例内部+138 例外部(1489+101 个 IA) 体数据+体素掩码 Zenodo 申请制(非商用)
各单中心队列 CTA/MRA/DSA 数十至千余例 体数据 多为不公开

IntrA 在这个景观里独占"表面原生"生态位:它是唯一把血管当作可计算流形(而非体素集合)发布的数据集。体数据派与表面派做的是不同任务(检测/分割 vs 表面分类/部件分割/几何分析),互补而非竞争。检索者常犯的错是用"颅内动脉瘤数据集"的关键词只搜到 ADAM/LargeIA 就止步——表面范式的入口在 CVPR 的论文列表里,不在放射学文献里。

8.5 生命周期与可持续性:一个 2020 年数据集的今天

IntrA 有"两个生日":数据与工具先行(2019-11-20 上传仓库),论文后发(2020-03-02 arXiv v1)——这是"先公开数据再投会议"的典型节奏,也意味着 2019 年底起就有人拿到数据。完整时间线(可精确到天):

时点 事件
2019-11-20 fileSplit/images/tools 上传官方仓库,数据先行公开
2020-03-02 arXiv v1 提交(8,212 KB;分类 eess.IV/cs.CV/cs.LG/stat.ML)
2020-04-06 arXiv v2(8,521 KB,camera-ready 对应);论文 PDF+补充材料入库 paper/
2020-06-14~19 CVPR 2020(Seattle)正式发表,Oral 报告
2020-04-08 README 最后更新——此后仓库静默
2026-09-29 本条目抓取时点:无数据扩容、无版本迭代、HF 仍无官方镜像

可持续性三问的答案都不乐观:

  1. 托管:官方单一直链(Google Drive)+单一镜像(OpenDataLab),无冗余备份。直链可用性受 Google 服务可达性影响(大陆网络受限),镜像 2.3GB 与官方包体积一致性未验证(遗留疑点,附录 O 存照)。
  2. 维护:个人课题组 2020-04 后无更新;论文结语"计划持续扩充新处理的临床数据"截至抓取时点未兑现(FAQ Q22)。
  3. 版本:数据本体无版本号——arXiv v1/v2 只是论文版本链;下载者无法声明"我用的哪一版数据",只能声明下载时点与取用源。

给使用者的四条存档建议:

  • 下载后立即自建 manifest(文件名+大小+哈希+下载日期+取用源),归档进项目仓库——这是对"无 checksum 发布"的唯一自救(§2.8)。
  • 引用时锚定 DOI(10.1109/CVPR42600.2020.00273)与官方 org(intra3d2019),不要把 GitHub 页面 URL 当唯一标识(页面可能转移,DOI 不会)。
  • 数字核对一律以 arXiv v2/CVF 版论文为准(版本链见附录 G);补充材料 supp.pdf 在仓库 paper/ 目录,含基准实现细节。
  • 镜像与直链若出现不一致(镜像方可能重打包),以官方直链为准并在使用声明中注明取用源(§7.6 校验流程同理)。

引用热度仅供语境参考:Google Scholar 120-161、Semantic Scholar 82-117(不同时点/主页口径不一,附录 G)——任何"高被引/低被引"的表述请绑定平台与时点,不要裸引。

§9 使用指南:从下载到跑通第一个模型

9.1 任务定义速查

任务 数据 输入 输出 临床对应
二分类(诊断) 2025 段(1909 生成+116 标注) 逐段点云(坐标+法向量) 段级标签(含瘤/健康) 从全脑血管模型发现可疑段
部件分割 116 标注段 逐段点云/网格 逐点标签(0=血管/1=瘤体) 瘤颈提取→夹闭规划

9.2 快速上手三步

  1. 数据就位:官方 Google Drive 或 OpenDataLab 下载;核对 103/1909/116 三个数字与文件夹结构。
  2. 格式转换:点云网络(PN++ 系)直接读坐标+法向量;网格网络(MeshCNN)确认网格为流形(官方已清洗,二次处理过的模型需重新检查非流形边)。
  3. 划分复现:论文划分方式为 shuffle 后 5 等分、所有方法同划分——自行复现基准时必须固定随机种子并声明划分;否则与表内数字不可比。

9.3 类别不平衡的三层应对

IntrA 的不平衡是双重的,应对也要分层:

  • 段级(215 vs 1694,约 1:7.9):分类任务用分层采样或加权损失;评估永远分 V./A. 两列看,别只看总体准确率——把所有段判为健康就有约 88.7% 的"准确率"。
  • 点级(段内瘤体点占比通常远小于血管点):分割任务加逐点类权重或 Dice 损失;SO-Net 在瘤体 IoU 上的领先部分来自其 SOM 结构对小目标的敏感性。
  • 模型级:论文证实 3D CapsuleNet 全判血管的失败模式——选网络时排除无空间层级的设计(PointNet 瘤体 IoU 37% 是同族下限警示)。

9.4 常见误用清单

  1. 把 116 当成动脉瘤总数:116 是"被标注的动脉瘤段数",215 是"自动切分出的含瘤段数",两者口径不同(116 段逐点标注;215 段只有段级标签)。
  2. 用测地矩阵做欧氏近邻查询:矩阵是表面测地距离,不是三维欧氏距离,语义不能混用。
  3. 把完整模型直接切成段去对号 1909:段的生成含随机性与人工筛选,无法从模型机械推导;官方 fileSplit 与工具只保证流程可复制,不保证逐段一一对应。
  4. 在原始 TOF-MRA 影像上做体数据实验却引 IntrA:原始 2D MRA 不在发布范围,体数据实验请用 ADAM/LargeIA 等体数据集。
  5. 忽略 license 缺位直接商用:见 §7.2,商用前先拿书面授权。

9.5 划分与泄漏:按段划分的隐含风险

论文协议是"数据 shuffle 后 5 等分、所有方法同划分"——划分单元是段,不是患者。这带来一个协议文本里没有写、但使用者必须心里有数的问题:

  • 同一患者的段高度相关:1909 个段来自 103 个模型,同一模型的段共享扫描噪声、重建偏差与血管形态——它们不是独立样本。
  • 患者级元数据未披露:论文没有给出 103 个模型与患者的对应关系(一名患者可能贡献多个模型),想按患者分组划分也做不到。
  • 后果:段级 5 折指标可能高估"对新患者"的泛化——测试折里的段可能来自训练折见过的患者/模型。

务实应对(按宣称强度分层):

你的宣称 最低要求
“在本协议下优于基线 X” 照抄协议(同划分 5 折)即可,如实引用段级口径
“对动脉瘤分割有效” 段级指标 + 难例分析(§4.5/附录 D)+ CI95
“可泛化到新患者/新中心” 需外部验证:自有数据、ADAM/LargeIA 或跨中心队列——IntrA 内部无法支撑此宣称

这不是吹毛求疵:103 例的小体量让"模型内切分"与"患者间泛化"的差距比大数据集更显著。FAQ Q8 说的"模型级泛化受 103 例限制"就是这件事的另一面。

9.6 把 IntrA 流水线迁移到自有数据:复用清单

IntrA 的方法论贡献(数据集之外的第二大贡献)是一条可复制的生产路径。迁移到自建 MRA/CTA 数据时逐项核对:

环节 可复用资产 迁移要点 成本锚点
表面重建 单阈值法(Hoogeveen 1998) 模态/场强变化时阈值需重标定;序列参数差异会改变表面噪声特性 论文 §3 流程
人工修复 多阈值交互修复+高斯平滑(Amira 或替代软件) 预算大头:IntrA 口径约每例 0.5 人·工作日(两名医生 50 工作日/103 例) ~0.5 工作日/例
流形清洗 MeshLab 滤器清单(去重/去碎片/去非流形/法向量) MeshCNN 用户必须逐项执行;自动化替代慎用(论文明确否决过,§3.2) 每例数十分钟量级
段生成 random_pick/selection(随机+测地阈值邻域) 阈值按你的血管口径重调;含瘤段产出率低时手动补选 §2.3
逐点标注 annotation/main.py(闭合边界+泛洪) 效率锚点:一名专家 8 小时标 116 段 ~4 分钟/段
测地矩阵 热方程快速近似法(Crane 2013) 开源实现可复现;N×N 内存按段点数平方预算 §2.5
质控 show_ann_data/show_result 可视化筛除 别省略:1909 是"筛后存活数",无质控环节的产出与基准不可比 §2.3

两条红线:①复用的是方法不是数据——把 IntrA 数据与自有数据混合发布或再分发,回到 §7.2 的 license 问题;②自建标注时保留"可视化质控筛除"环节,没有这一步的段集合与 IntrA 基准数字不具可比性。

§10 与库内条目的关系

10.1 家族图谱

库内条目 rid 关系 联动阅读价值
ImageCAS 549 同赛道(血管分割):冠脉 CTA 血管树 冠脉 vs 脑血管的表面/体素两派对照
DRIVE 241 同任务(血管结构分割):眼底 2D 2D 血管分割的经典起点,与 3D 表面法互为镜像
MedMNIST 716 同定位(轻量医学基准家族) 含 3D 模态子集的基准化思路对照
IXI-brain 482 同模态(脑 MRI) 健康人脑 MRI 结构数据,理解 TOF-MRA 采集语境
TotalSegmentator 422 同任务(大规模 3D 分割) 体数据大规模分割 vs 表面小样本精分割
BTCV 377 同任务(CT 多器官分割) 体素派基准的代表
FairSeg 371 同方法论(分割公平性) 小样本医学分割的偏差控制视角
WMH Challenge 501 同模态(脑 MRI 挑战赛基准) 挑战赛制基准 vs 论文自带基准的组织差异

10.2 检索路径建议

  • 查"血管分割"全景:intra(本条目) → imagecas(549) → drive(241)
  • 查"3D 医学基准"谱系:intra → medmnist(716) → totalsegmentator(422) → btcv(377)
  • 查"脑血管临床语境":intra → ixi-brain(482) → wmh-challenge(501)
  • 查"小样本医学分割方法论":intra → fairseg(371)

10.3 第二轮互链扩充:分割谱系十条(DB 实证)

第二轮补核(2026-09-29,只读查询库内 ai_ready_dataset 表,验证记录见附录 P)在第一轮 8 条之外新增 10 条库内互链,覆盖"2D 血管分割—3D 分割挑战赛—显微尺度"三条主线:

库内条目 rid 关系 联动阅读价值
BraTS 24 同范式(体数据病灶分割挑战赛) 脑肿瘤 MRI 体分割 vs 脑血管表面分割——"脑部任务"的两种表示路线
DeepDRiD 211 同器官域(眼底:质量评估+DR 分级) 眼底影像从"血管分割"到"质量/分级"的任务谱扩展
CHASE_DB1 251 同任务(视网膜血管分割,儿童队列) DRIVE 之外的 2D 血管分割基准,双观察者标注设计
HRF 261 同任务(高分辨率眼底血管分割) 健康/DR/青光眼三分组——血管分割叠加疾病背景的对照设计
DRISHTI-GS 301 同器官域(青光眼视盘/视杯分割) 眼底结构分割与多专家软标注方法学
RETOUCH 321 同范式(体数据病变分割挑战,OCT) 三厂商跨设备体数据挑战——挑战赛制与 ADAM 可对照
LUNA16 237 同任务范式(体数据病灶检测挑战) 检测+候选过滤协议、多折榜单——ADAM 检出任务的先行者
VerSe 435 同范式(体数据实例分割挑战) 大视野 CT 实例分割与骨折分级
CT-RATE 546 同模态邻域(胸部 CT 多模态语料) "5 万体积大语料"与"103 表面模型小基准"的规模两极
SELMA3D 681 同任务(3D 显微血管等结构分割)+自/半监督范式 光片显微尺度的血管分割——与 IntrA 构成血管任务的尺度两极

配套检索路径(接 §10.2):

  • 查"2D 眼底血管分割"谱系:drive(241) → chase-db1(251) → hrf(261);病变/结构侧延伸 deepdrid(211) → drishti-gs(301)
  • 查"3D 体数据分割挑战赛"谱系:brats(24) → luna16(237) → retouch(321) → verse-spine(435)
  • 查"显微尺度 3D 分割/自监督":selma3d(681)
  • 查"医学影像规模两极":ct-rate(546)(数万体积语料)↔ intra(103 表面模型基准)

注意事项:动脉瘤体数据两大基准 ADAM 与 LargeIA 在库内均无条目(title 模糊检索 0 行,附录 P 存照),本条目对它们的引用保持"库外锚点"状态(档案见附录 M/N)——若后续建条,应回填 §6.4 与此处互链。

§11 避坑清单:十一个已踩过的坑

坑 1:GitHub 组织名转写错误(intra2d2019 vs intra3d2019)。CVF 官方摘要页与 HypePaper 等聚合站把仓库写成 github.com/intra2d2019/IntrA,实际官方仓库是 github.com/intra3d2019/IntrA。论文正文、ar5iv、README 一致口径为 intra3d2019。照错误地址找仓库会撞 404 或撞到无关 fork。

坑 2:"IntrA"检索歧义。该词在搜索引擎里与 intraday 金融数据、INTERPRET workshop、各类"intra"缩写混战。有效检索式:IntrA aneurysm dataset、IntrA CVPR 2020、intra3d2019。中文检索建议加"颅内动脉瘤 点云 数据集"。

坑 3:数字口径三连(103/215/116/1909/2025)。103=完整模型;1909=生成段总数(1694 健康+215 动脉瘤段);116=逐点标注动脉瘤段;2025=分类任务实际用的合并段数(1909+116)。二手资料里"116 个动脉瘤"或"103 例动脉瘤"都是口径错乱。另注意 brief 常见的"102 例"——三源核验均为 103。

坑 4:以为有原始影像。原始 2D MRA 因医学伦理不发布——只有重建+修复后的表面模型。计划做 2D MRA/MIP、体素分割或影像质量研究的人,此数据集无法满足,请转 ADAM(TOF-MRA 体数据,训练 113 例/测试 141 例)或 LargeIA(1338 例 CTA,Zenodo 申请制)。

坑 5:license 缺位。官方仓库无 LICENSE 文件、镜像标注未知。学术引用惯例(引 CVPR 2020 论文)是社区默认,但没有任何文本授权商用与再分发。引用格式见附录 F。

坑 6:页码双口径。dblp/NSTL/Mendeley 记 pp. 2653-2663,OpenDataLab 引文记 pp. 2656-2666;CVF 官方页不显示页码。引用时任选其一并保持一致,无需纠结——DOI 10.1109/CVPR42600.2020.00273 才是唯一可靠锚点。

坑 7:测地矩阵的内存与语义。N×N 密集矩阵随段点数平方膨胀(1700 点约 290 万浮点值);且矩阵语义是表面测地距离——拿它当欧氏距离用(KNN、空间坐标对齐)是错的。均值层面测地增强收益 <1 个 IoU 点,别为它放弃更快的欧氏基线;但双动脉瘤等复杂拓扑难例上它是稳定解之一。

坑 8:只看总体准确率会漏掉全部关键信息。分类任务的"健康段准确率"被类别不平衡抬高(全判健康≈88.7%);分割任务的血管列 93%+ 不分高下。论文把 V./A. 分列的用意即在此——动脉瘤侧的数字才是任务难度与临床价值的真实刻度。

坑 9:把 ADAM 模态记成"4D-DSA/CTA/MRA 混合"。本条目第一轮档案曾如此误记——实核(ADAM 官方期刊论文 Timmins et al., NeuroImage;挑战赛官网 adam.isi.uu.nl)证实 ADAM 数据全部为 TOF-MRA。讹传可能源于把"动脉瘤影像常用模态"泛化到具体数据集头上。影响:按模态筛选体数据集时会错误排除或错误纳入 ADAM;与 IntrA 的"同源模态(TOF-MRA)、不同粒度(体 vs 表面)"对照关系也会讲错。正确口径:训练 113 例/129 个未破裂动脉瘤(UIA)、测试 141 例/153 UIA,检出+分割双任务,在线榜单开放(附录 M 存照)。

坑 10:超参数照抄各网络原论文推荐值。基准实测与原论文推荐不一致的三处:①PointGrid 原论文推荐 N=16/K=2,IntrA 实测 N=32/K=2 最优(瘤体 IoU 42.42% vs 38.23%);②SSCN 分辨率 24→40 提升明显,且 IoU 波动约 8%(其他方法约 2%)——分辨率敏感型;③MeshCNN 面数 750 档瘤体 IoU 55.63%,1500/2250 档 71.32%/71.60%——面数过少直接崩溃。复现与引用时数字必须绑定输入档位(§4.7 检查单);“用了原论文推荐超参却跑不出论文数字”,先查这三处再怀疑自己。

坑 11:把 116 段标签当"多标注者共识"。116 段由一名神经外科医生单人 8 小时标注,数据集未提供重复标注,因此没有 inter-rater 一致性指标可引用(修复环节为双人协作,但同样未公布一致性数字)。描述标签质量时请避免"专家共识"类表述;需要标注一致性分析的,请自设重复标注实验并单独报告(FAQ Q43)。

§12 总结

12.1 三句话总结

  1. IntrA 是首个开放获取的 3D 颅内动脉瘤数据集:103 个 TOF-MRA 重建全脑血管模型(50 个工作日人工修复)、1909 个自动血管段、116 个专家逐点标注段加测地矩阵,CVPR 2020 Oral 发表。
  2. 它把颅内动脉瘤研究从体素范式拉到表面范式:17 种 3D 网络同划分 5 折基准证明逐点方法(PN++/SO-Net/PointConv)显著优于体素方法,测地信息在均值上收益小、在复杂拓扑难例上是稳定解。
  3. 它的短板同样是信息:无 LICENSE 文件、单一直链托管、患者级元数据缺失、103 例的体量——是基准与先验训练场,不是大规模训练语料。

12.2 适合谁

  • 做 3D 点云/网格深度学习方法研究、需要小而精医学基准验证泛化性的团队
  • 神经外科手术规划/CAD 系统开发者——瘤体分割与瘤颈提取是直接对口的任务
  • 医学几何分析(血管形态统计、测地度量、法向估计)研究者
  • 需要跨域迁移检验场的 3D 生成模型与自监督学习研究者

12.3 不适合谁

  • 需要 2D MRA 原始影像或体素掩码的研究(原始数据不发布)——转 ADAM/LargeIA
  • 追求大规模预训练语料的团队(103 例量级)
  • 对 license 合规要求严格的商用场景(无 LICENSE 文件,需书面授权)
  • 需要患者级人口统计学元数据的临床回归研究(未披露)

12.4 30 秒决策卡

你的需求是?
├── 训练/评测 3D 点云或网格网络的医学基准
│   └── ✅ 用 IntrA:Google Drive 直链,5 折协议照抄论文
├── 神经外科瘤颈提取/手术规划原型
│   └── ✅ 用 IntrA 116 标注段 + SO-Net/PointConv 基线
├── 体数据血管分割/动脉瘤检测
│   └── ❌ 转 ADAM / LargeIA(IntrA 无体数据)
├── 2D MRA 影像研究
│   └── ❌ 原始影像不发布
├── 大规模预训练
│   └── ❌ 103 例体量不足
└── 商用产品集成
    └── ⚠️ 先联系作者获书面授权(无 LICENSE 文件)

12.5 三分钟阅读路线(按角色)

  • 3D 方法研究者:§6(方法谱系)→ §4(基准全表+检查单 §4.7)→ §5(测地课+§5.4 迁移结论)→ 附录 K。核心问题:“我的方法在管状流形上会不会翻车。”
  • 工程/落地团队:§9(使用指南+泄漏 §9.5)→ §7(获取+license)→ §11 坑点全表 → 附录 C 决策树。核心问题:“从下载到跑通与合规的完整路径。”
  • 临床信息学/数据管理:§0(问题定义)→ §2(数据构成+边界 §2.9)→ §6.4/§8.4(数据集景观)→ 附录 M/N。核心问题:“它在动脉瘤数据版图里补了哪块。”
  • 标注方法论研究者:§3(流水线+§3.5 成本结构)→ §9.6(迁移复用清单)→ §2.4(标注工艺)。核心问题:“这套 50 工作日+8 小时的生产账本如何复制。”
  • 数据集审稿/采购评估:§7.4(DAIMS 五维)→ 附录 I(FAIR 检查单)→ 附录 R(修订史)。核心问题:“AI-Ready 成色与可持续性。”

每条路线 10 分钟内可走完;决定深入后按 § 索引展开。

FAQ(高频问答 48 问)

A. 基础认知

Q1:IntrA 的名字是什么的缩写?
Intracranial Aneurysm 的缩合(IntrA),注意中间的 A 大写。

Q2:论文发在哪?是 MICCAI 吗?
不是。CVPR 2020(IEEE/CVF 计算机视觉与模式识别会议),Oral 报告,DOI 10.1109/CVPR42600.2020.00273。MICCAI 2018 的 INTERPRET workshop(可解释性主题)与此数据集无关。

Q3:团队是哪家机构?
东京大学(Igarashi 实验室+神经外科),二作 Ding Xia 双挂华南理工大学。不是苏州大学——部分中文资料有此误记。

Q4:数据是什么形式?DICOM 吗?
不是。3D 表面模型(点云+网格)+测地矩阵+Python 工具,没有 DICOM,也没有原始 2D MRA。

B. 数据与获取

Q5:怎么下载?
官方 Google Drive 文件夹(README 内链)或 OpenDataLab 镜像(2.3GB,需注册)。大陆网络访问 Google Drive 受限时走镜像。

Q6:HuggingFace 上有吗?
没有官方镜像(2026-09-29 检索确认)。需要自行下载后转 HF 格式。

Q7:数据能商用吗?
没有 LICENSE 文件,无法从文本上获得商用授权。学术引用惯例成立,商用请通过反馈表单联系作者获取书面许可。

Q8:103 例能划分出足够的测试集吗?
基准协议是段级而非模型级:分类用 2025 段、分割用 116 段做 5 折,每折测试集有数百段/二十余段。但模型级泛化(跨患者)评估受 103 例限制,需自行注意患者级数据泄漏风险(论文按段划分,未声明按患者分组)。

Q9:段是怎么保证质量的?
自动生成后经可视化工具人工筛除模糊/琐碎段;含瘤段有手动补选机制。1909 是筛选后存活数。

C. 标注与基准

Q10:116 个标注段的标签长什么样?
逐点二分类:0=健康血管,1=动脉瘤。没有瘤颈曲线、破裂状态、解剖位置等附加标签。

Q11:谁标注的?花了多久?
一名神经外科医生用自研交互工具 8 小时完成。工具逻辑是闭合边界线+泛洪传播。

Q12:分类基准为什么分 V. 和 A. 两列?
类别不平衡(215:1694)下,总体准确率会向多数类(健康段)倾斜;分列才能看出动脉瘤侧真实性能。全判健康的退化模型也有约 88.7% 总体准确率。

Q13:哪个网络最强?
分类:PN++(1024 点)动脉瘤准确率 88.51% 最高;PointCNN(2048)血管准确率 98.95% 与 F1 0.9044 最高。分割:SO-Net(2048)瘤体 IoU 81.40%/DSC 88.76% 最高;PointConv(2048)血管 IoU 94.65%/DSC 97.18% 最高。

Q14:测地信息(PN++g)值得用吗?
均值上瘤体 IoU 只提 0.74 点(76.21→76.95);但双动脉瘤段等复杂拓扑难例上 PN++g 是唯二稳定方法之一。预计算矩阵已随数据提供,增量成本可接受。

Q15:体素方法为什么这么差?
血管只占体数据的极小部分,栅格化浪费算力且破坏管状流形的几何语义;SSCN 瘤体 IoU 55-61%、PointGrid 36-42% vs 点云派 76-81%。CVMJ 2023 的对照实验(72% vs 46% DSC)进一步确认。

D. 工程与复现

Q16:点云格式是什么?要自己采样吗?
表面模型附法向量;段内点数约 500-1700。基准按 512/1024/2048 点采样,采样方式遵循各网络原实现。

Q17:5 折划分有官方种子吗?
论文只说明 shuffle 后 5 等分、所有方法同划分,未公开种子文件。复现请固定自己的种子并声明——逐数字复现不可行,但方法排名可复现。

Q18:训练要多少算力?
基准用 RTX 2080 Ti×2 + GTX 1080 Ti×1,总时长超 92 小时(全部方法)。单方法 PN++ 在 GTX 1080 Ti 上 5 s/epoch、约 115 epoch 收敛——单卡数小时内可复现一个基线。

Q19:有官方训练代码吗?
仓库提供工具(标注/切分/可视化)与基准协议描述;各网络用原作者开源实现接入。没有统一的"一键复现"脚本。

E. 生态与库内

Q20:和 ADAM 数据集什么关系?
互补不竞争:ADAM 是 TOF-MRA 体数据的检测+分割挑战赛数据(训练 113 例/129 UIA、测试 141 例/153 UIA),IntrA 是 TOF-MRA 重建表面模型的分类+部件分割基准。表示(体 vs 表面)与任务(检测/体分割 vs 表面分类/部件分割)双重不同,模态同源(都是 TOF-MRA)但粒度不同。

Q21:库内哪些条目和它最相关?
imagecas(549) 冠脉血管分割、drive(241) 眼底血管分割、medmnist(716) 3D 医学基准、ixi-brain(482) 脑 MRI、totalsegmentator(422) 大规模 3D 分割。第二轮补核后库内互链共 18 条,最新全表见 §10.3 与 FAQ Q34。

Q22:后续还有新版本吗?
2020 年 4 月后官方仓库无更新;团队后续以 CVMJ 2023 两步法流水线延续方法线,数据集未见扩容声明。论文结语提到计划持续扩充新处理的临床数据,尚未兑现。

Q23:引用格式是什么?
见附录 F:Yang, Xi; Xia, Ding; Kin, Taichi; Igarashi, Takeo. IntrA: 3D Intracranial Aneurysm Dataset for Deep Learning. CVPR 2020, pp. 2653-2663(页码存在双口径,见坑 6),DOI 10.1109/CVPR42600.2020.00273。

Q24:为什么 brief/资料里常出现"102 例"的说法?
三源核验(论文全文/GitHub README/CVF)一致为 103 个完整模型。"102"无出处,属二手转写讹误;若在某资料中见到 102,应以论文原文与官方 README 为准。

F. 模态对照、划分陷阱与补核勘误(第二轮新增)

Q25:ADAM、LargeIA 与 IntrA 到底怎么选?
按输入表示与任务选,不按"哪个大"选:要做检测+体分割、手上有 MRA 体数据 → ADAM(TOF-MRA,训练 113 例/129 UIA+测试 141 例/153 UIA,挑战赛注册制、榜单开放);要做体素级血管+动脉瘤双标签分割、能走申请流程 → LargeIA(CTA,内部 1338 例/1489 IA+外部 138 例/101 IA,非商用);要做表面分类/部件分割/几何分析、方法在点云网格侧 → IntrA(103 表面模型)。三者模态与粒度差异见 §6.4/§8.4;ADAM 模态讹传问题见坑 9。

Q26:同一患者的多个段会不会跨折泄漏?
存在这个风险:协议按段 shuffle 划分、未声明按患者分组,且患者级元数据未披露——想分组也做不到(§9.5)。段级指标可能高估对新患者的泛化。报告时如实写"段级 5 折协议";宣称患者级泛化需外部验证。

Q27:我能自己重新划分数据吗?
可以,但必须固定随机种子并声明划分方式——你的数字与论文表内不可比(Q17 同理)。跑分割时别忘了"每折重复 3 次取最优均值"的口径(§4.1),单次运行不在同一口径上。

Q28:测地矩阵能自己重算吗?
能:方法即热方程快速近似测地法(Crane 等 2013),输入为流形网格,开源实现可复现。注意两点:语义是表面测地距离而非欧氏距离(坑 7);自算结果与官方矩阵可能存在数值差,报告中注明矩阵来源。

Q29:除了动脉瘤任务,这个数据集还能干什么?
论文明列:法向估计(自带法向量)、测地距离估计(自带矩阵)、3D 表面重建、医学几何统计(§5.3)。社区另有用法:作为小规模 3D 医学自监督预训练语料(对比学习,§8.3)、几何先验训练场(SciRep 2024 用它训练 PointNet++ 几何分类器,TPR 0.96 后迁移到自有 CTA 数据)。

Q30:标签只有逐点 0/1,瘤颈怎么得到?
从 116 段逐点标签派生:瘤体点与血管点的交界线即瘤颈的近似(§2.4)。但破裂状态、解剖位置命名、瘤体尺寸测量等临床细粒度信息不可派生(§2.9),需要时请转临床队列或 LargeIA 式双标签数据。

Q31:分割结果向临床报告时还要给什么?
IoU/DSC 之外附 95% 置信区间(协议自带 CI95);难例单独报告——小尺寸比瘤体与双动脉瘤段是全方法滑坡区(§4.5、附录 D);记住瘤体列才是临床刻度(坑 8)。

Q32:为什么我的复现数字比论文低?
先过 §4.7 检查单,再查三处超参陷阱(坑 10):PointGrid 用了原论文推荐 N=16/K=2(实测最优 32/2)、SSCN 分辨率档给低了(24→40 差异显著且波动 ~8%)、MeshCNN 面数档给到 750(1500 起步才正常)。

Q33:SpiderCNN 发表在哪?是 ACM TOG 吗?
不是。ECCV 2018。部分二手资料与汇总表把它误记为 ACM TOG——本条目两处存照(附录 K/L),引用时以 ECCV 2018 为准。

Q34:库内还有哪些相关条目?
共 18 条:第一轮 8 条见 §10.1(imagecas/drive/medmnist/ixi-brain/totalsegmentator/btcv/fairseg/wmh-challenge);第二轮 10 条见 §10.3(brats/deepdrid/luna16/chase-db1/hrf/drishti-gs/retouch/verse-spine/ct-rate/selma3d)。脑部任务看 brats(24),眼底血管看 drive(241)/chase-db1(251)/hrf(261)。

Q35:本条目数据核验到什么时点?后续会更新吗?
两轮核验均在 2026-09-29:成稿轮(WebSearch×5+ar5iv 全文+官方仓库+CVF+OpenDataLab+hf-mirror API+DB 查重)与补核轮(ADAM/LargeIA 档案、10 网络 venue、18 条 rid 实证)。年度复核建议清单见附录 S;发现直链失效或新版本发布时,优先信官方仓库与论文 v2。

Q36:数据可以在课堂上教学使用吗?
学术引用惯例覆盖教学场景(引 CVPR 2020 论文即可)。但若课程需要向学生再分发数据包(而非各自从官方下载),严格说落入 §7.2 的许可空白——稳妥做法是引导学生自行下载,或先通过反馈表单征得作者同意。

Q37:为什么分类用 2025 段,分割只有 116 段?
标注成本结构决定的:段级标签(含瘤/健康)可随段生成流程低成本获得(自动切分+人工筛选),而逐点标签需要专家在自研工具上手工勾画——8 小时只覆盖 116 段(§2.4)。两类段的口径差异见坑 3。

Q38:IntrA 的"段"是解剖学分段吗?
不是。段是算法切分的研究单元(随机种子点+测地阈值邻域,500-1700 点),不是解剖命名的血管分段;一段可能横跨多个解剖区域。做解剖学定位研究时不能用段的编号反推解剖位置——数据集不携带此类标签。

Q39:法向量是原始数据还是算出来的?
算出来的:MeshLab 清洗环节逐点生成(§3.3),属于派生属性。它服务点云网络的输入需求(PointNet 系特征之一);需要原始信号强度/灰度的研究不适用——表面模型已经丢失了体数据灰度信息。

Q40:为什么说它是"小而多样"?
论文自述 small but diverse:绝对数量小(103 例),但动脉瘤形态四型全覆盖、段内瘤体占比从微小到显著均有分布。这直接决定解读方式——均值数字掩盖难例(§4.5),引用基准成绩时难例分析比均值更能说明方法成色。

Q41:能只下载其中一层吗(比如只要 116 标注段)?
官方 Google Drive 是文件夹形式,可按子目录选择性下载;OpenDataLab 镜像是 2.3GB 整包。选择性使用没问题,但引用时声明用了哪层(103/1909/116 口径见坑 3)。

Q42:215 个含瘤段的段级标签可靠吗?
215 段的"含瘤"属性来自段生成流程(随机+手动补选种子点)与可视化质控筛除,不是独立专家逐段复核的产物,粒度低于 116 段的逐点标注。严格结论优先以 116 段为据;215 段适合分类任务的规模统计(§2.3)。

Q43:能测标注者间一致性吗?
不能——116 段单人标注(8 小时),无重复标注数据;修复为双人协作但未公布一致性指标。需要 inter-rater 分析请自设实验并单独报告(坑 11)。

Q44:为什么有的资料把发布机构写成华南理工大学?
OpenDataLab 镜像的"发布机构"栏转写为"华南理工大学·东京大学";第一单位口径为东京大学,Ding Xia 双挂华南理工(§8.1/FAQ Q3)。引用机构信息以论文作者栏为准。

Q45:引用数为什么各平台差这么多?
Google Scholar 120-161、Semantic Scholar 82-117——平台、时点、主页口径都不同(附录 G)。热度数字不入本条目正文结论;引用时绑定平台与时点。

Q46:做动脉瘤"检测"(有定位输出的那种)能用 IntrA 吗?
不能直接做。IntrA 的段级二分类是"给定血管段判断含瘤与否",没有体数据意义上的位置输出;检测任务(找到瘤在哪里)请用 ADAM(TOF-MRA 体数据)或 LargeIA(CTA)——两者的任务定义就是检出+分割(§6.4;ADAM 模态口径见坑 9)。

Q47:跨域特征迁移(TRELLIS 类)的用法说明什么?
说明 IntrA 还承担"几何检验场"角色:非医学 3D 生成模型的几何嵌入能否迁移到医学表面任务,IntrA 提供小而干净的测试床(§8.3)。对一般研究者的启示:几何预训练特征值得在小样本医学任务上先试,再决定是否投入标注。

Q48:想要"血管+动脉瘤双标签"的体素数据去哪找?
LargeIA(Patterns 2021):血管+动脉瘤双标签体素掩码,内部 1338 例 CTA+外部 138 例,Zenodo 申请制、非商用(附录 N)。IntrA 只有表面逐点二分类,无体素双标签。

事实清单(硬事实 45 条)

  1. IntrA 全称 IntrA: 3D Intracranial Aneurysm Dataset for Deep Learning,首个开放获取 3D 颅内动脉瘤数据集。

  2. 论文发表于 CVPR 2020(Oral),DOI 10.1109/CVPR42600.2020.00273,arXiv:2003.02920(v1 2020-03-02,v2 2020-04-06)。

  3. 作者:Xi Yang、Ding Xia、Taichi Kin、Takeo Igarashi;单位:东京大学(Ding Xia 另挂华南理工大学)。

  4. 数据三层:103 完整脑血管 3D 模型;1909 自动生成血管段(1694 健康+215 动脉瘤段);116 手工逐点标注动脉瘤段。

  5. 分类任务实际使用 2025 段(1909+116 合并),论文 §4.1 明示。

  6. 每个完整模型来自 512×512×180~300 张 TOF-MRA 2D 切片,体素 0.469×0.469×1 mm。

  7. 重建用单阈值法(Hoogeveen 1998);修复用交互式多阈值法(Kin 2012)+高斯平滑,软件 Amira 2019(Thermo Fisher)。

  8. 修复由两名神经外科医生完成,共约 50 个工作日。

  9. 表面清洗在 MeshLab 完成:去重复面/顶点、手工分离碎片、消除非流形边、生成法向量。

  10. 测地矩阵用热方程快速近似法(Crane 2013)预计算,逐标注段 N×N。

  11. 段生成:随机种子点+测地距离阈值邻域,手动补选提高含瘤段量,可视化工具人工筛除。

  12. 标注工具为自研交互式工具(annotation/main.py):闭合边界线+泛洪传播;支持多边界线。

  13. 116 段标注由一名神经外科医生 8 小时完成。

  14. 段内点数约 500~1700(测地距离 30 采样口径)。

  15. 动脉瘤形态覆盖四型:分叉型/主干型/水泡型/混合型。

  16. 原始 2D MRA 因医学伦理不发布。

  17. 基准协议:shuffle 后 5 等分 5 折交叉验证,所有方法同划分;分割每折重复 3 次取最优均值;总训练超 92 小时(RTX 2080 Ti×2 + GTX 1080 Ti)。

  18. 分类基准 6 方法(含多输入档):PN++(1024)动脉瘤准确率 88.51% 最高;PointCNN(2048)血管 98.95% 与 F1 0.9044 最高;PointNet 最弱(动脉瘤侧 69.50%)。

  19. 分割基准 11 网络:SO-Net(2048)瘤体 IoU 81.40%/DSC 88.76% 最高;PointConv(2048)血管 IoU 94.65%/DSC 97.18% 最高;PointNet 瘤体 IoU 37.30% 垫底。

  20. PN++ 训练最快(5 s/epoch,GTX 1080 Ti,约 115 epoch 收敛);PointCNN 最慢(24 s/epoch,约 500 epoch)。

  21. 测地增强 PN++g 瘤体 IoU 76.21→76.95(vs PN++),均值提升 <1 点;双动脉瘤难例上与 PointConv 唯二稳定。

  22. 3D CapsuleNet 在本数据集失败(全判健康血管),论文用作跨域泛化警示。

  23. 官方 GitHub 组织为 intra3d2019;CVF 摘要页等误转写为 intra2d2019。

  24. 官方数据托管 Google Drive(文件夹 ID 1yjLdofRRqyklgwFOC0K4r7ee1LPKstPh);OpenDataLab 镜像 2.3GB;HuggingFace 无官方镜像。

  25. 官方仓库无 LICENSE 文件;OpenDataLab license 栏未知;arXiv 论文 nonexclusive-distrib 1.0。

  26. 资助:AMED JP18he1602001。

  27. 团队后续:arXiv 2006.16161(2020-06)→ CVMJ 2023 两步法流水线(DSC 72% vs voxel 46%)→ MICCAI 2022 部分预配准。

  28. 第三方使用:Nature Sci Rep 2024(PointNet++ 几何分类器 TPR 0.96)、对比学习(arXiv 2201.02198)、中文核心分割方法(2025)、TRELLIS 跨域特征迁移(2025)。

  29. 页码双口径:2653-2663(dblp/NSTL/Mendeley)vs 2656-2666(OpenDataLab)。

  30. 引用数多口径:Google Scholar 120-161、Semantic Scholar 82-117(时点不一)。

  31. GitHub 仓库时间线:fileSplit/images/tools 2019-11-20 上传;paper(含补充材料)2020-04-06;README 最后更新 2020-04-08,此后静默。

  32. arXiv 版本链:v1 2020-03-02(8,212 KB)→ v2 2020-04-06(8,521 KB),分类 eess.IV/cs.CV/cs.LG/stat.ML;arXiv license 为 nonexclusive-distrib 1.0。

  33. ADAM 挑战赛数据全部为 TOF-MRA(Timmins et al., NeuroImage;官网 adam.isi.uu.nl),训练 113 例/129 UIA、测试 141 例/153 UIA——"4D-DSA/CTA/MRA 混合"系讹传(坑 9)。

  34. LargeIA:Zenodo 记录 6801397/6801398;论文 An intracranial aneurysm labeling dataset with both vessel and aneurysm labels, Patterns 2(10):100197, 2021,DOI 10.1016/j.patter.2020.100197;内部 1338 例 CTA/1489 IA+外部 138 例/101 IA;申请制、非商用。

  35. 10 网络 venue 存照:PointNet CVPR 2017;PN++ NIPS 2017;SO-Net CVPR 2018;PointGrid CVPR 2018(pp. 9204-9214, DOI 10.1109/CVPR.2018.00959);SSCN CVPR 2018(Graham 等);SpiderCNN ECCV 2018;PointCNN NIPS 2018;PointConv NeurIPS 2018;DGCNN ACM TOG 2019;MeshCNN SIGGRAPH 2019。

  36. 第二轮 DB 实证(只读查询 ai_ready_dataset 表,主键 record_id,2026-09-29,10/10 命中):新增库内互链 10 条——brats=24、deepdrid=211、luna16=237、chase-db1=251、hrf=261、drishti-gs=301、retouch=321、verse-spine=435、ct-rate=546、selma3d=681。

  37. 库内无 aneurysm/ADAM 专属条目(title 模糊检索 0 行);ADAM 与 LargeIA 在本条目中为库外锚点(档案附录 M/N)。

  38. 患者级元数据(数量/年龄/性别/设备/机构)论文未披露;基准按段划分、未声明按患者分组(泄漏风险与应对见 §9.5)。

  39. 论文结语提出计划持续扩充新处理的临床数据,截至 2026-09-29 未兑现;官方仓库 2020-04-08 后无更新。

  40. 遗留疑点存照:Google Drive 直链可用性未实测(沙箱网络限制);OpenDataLab 镜像 2.3GB 与官方包体积一致性未验证;仓库 star/fork 数未获取(API 受限)。

  41. 超参实测存照:PointGrid 原论文推荐 N=16/K=2、IntrA 实测 N=32/K=2 最优;SSCN 分辨率 24→40 时 IoU 波动约 8%(其他方法约 2%)(坑 10)。

  42. MeshCNN 面数档效应:750 面瘤体 IoU 55.63%,1500/2250 面 71.32%/71.60%——面数过少崩溃。

  43. 尺寸比定义:动脉瘤对角线/全局段对角线;分类误分类主体为小体积或不完整动脉瘤。

  44. CVPR 2020 于 2020-06-14~19(Seattle)举行;补充材料 supp.pdf 随仓库 paper/ 目录发布;官方另有用户反馈表单(forms.gle/rvMRsQ8t8Z6J8rdq8)。

  45. 团队后续链存照:arXiv 2006.16161(2020-06-29,dblp 只录 CoRR 版,其是否正式发表于 workshop 无法证实)→ 期刊版 CVMJ 9(1):57-69, 2023(surface DSC 72% vs voxel 46%)。

术语表(34 条)

术语 英文 释义
颅内动脉瘤 Intracranial Aneurysm (IA) 脑血管壁局部膨出,破裂致蛛网膜下腔出血
瘤颈 Aneurysm neck 动脉瘤与载瘤血管交界区,夹闭手术的作用位点
夹闭 Clipping 夹闭瘤颈隔离血流的外科治疗
TOF-MRA Time-Of-Flight MRA 时间飞跃法磁共振血管造影,无创成像
单阈值法 Single threshold method 按强度阈值分割血管体素的重建法
多阈值法 Multi-threshold method 交互调整阈值分离动脉瘤的修复法
点云 Point cloud 以离散点集(坐标+法向量)表示的 3D 表面
网格 Mesh 以三角形面片连接的表面表示,流形性是卷积前提
流形边 Manifold edge 至多被两面共享的边;网格卷积的数学前提
部件分割 Part segmentation 把对象逐点划分为语义部件的任务
测地距离 Geodesic distance 沿表面最短路径的距离,优于欧氏距离刻画管状结构
热方程法 Heat equation method Crane 2013 的快速近似测地计算
V./A. Vessel/Aneurysm accuracy 分类基准中健康段/动脉瘤段各自的准确率
IoU/JI Jaccard Index 交并比,分割重叠度指标
DSC Sørensen-Dice Coefficient Dice 系数,分割相似性指标
CI95 95% Confidence Interval 折间/重复间的 95% 置信区间
PN++ PointNet++ 层级采样分组的逐点网络
PN++g PN++ + geodesic 输入含测地距离特征的 PN++ 变体
SSCN Submanifold Sparse CNN 亚流形稀疏卷积(体素派)
DGCNN Dynamic Graph CNN 动态图卷积逐点网络
SOM Self-Organizing Map SO-Net 用自组织映射建模点云分布
AMED Japan Agency for Medical Research and Development 日本医疗研究开发机构(资助方)
CVMJ Computational Visual Media 团队后续论文的发表期刊
ADAM Aneurysm Detection And segMentation 体数据模态的动脉瘤挑战赛数据集(互补条目)

| UIA | Unruptured Intracranial Aneurysm | 未破裂颅内动脉瘤(ADAM/LargeIA 的标注对象口径) |
| 表面范式 | Surface-based paradigm | 以点云/网格流形为输入的 3D 方法路线(本条目主角) |
| 体素范式 | Voxel-based paradigm | 以体素栅格为输入的 3D 方法路线(SSCN/PointGrid;ADAM 榜单主流) |
| 挑战赛基准 | Challenge benchmark | 固定划分+官方评测+在线榜单的社区评测制(ADAM/LUNA16/BraTS 等) |
| 数据泄漏 | Data leakage | 同患者样本跨训练/测试折导致的评估偏倚风险(§9.5) |
| manifest | 数据清单 | 逐文件名/大小/哈希的校验清单(IntrA 未提供,需自建,§2.8) |
| 申请制数据 | Application-gated dataset | 需提交用途申请、获批后发下载的数据(LargeIA 制) |
| EdgeConv | Edge Convolution | DGCNN 的边特征卷积算子(动态 K 近邻图上提取边特征) |
| 边坍缩 | Edge collapse | MeshCNN 的池化操作,与其"网格边上卷积"机制配套 |
| Zenodo | — | CERN 运营的开放科研仓储(LargeIA 托管处,记录 6801397/6801398) |

附录

附录 A:条目信息速查卡

项 值
条目名 IntrA
url_name intra
类型 3D 数据集+标注工具箱+基准(三合一)
论文 CVPR 2020 Oral(DOI 10.1109/CVPR42600.2020.00273)
团队 东京大学 Igarashi 实验室+神经外科(合作:华南理工大学)
规模 103 模型 / 1909 段(1694+215)/ 116 标注段
表示 点云+网格(表面原生,非体数据)
许可 无 LICENSE 文件(引用惯例);arXiv nonexclusive-distrib 1.0
抓取时点 2026-09-29
库内互链 第一轮 8 条(imagecas(549)/drive(241)/medmnist(716)/ixi-brain(482)/totalsegmentator(422)/btcv(377)/fairseg(371)/wmh-challenge(501))+ 第二轮 10 条(brats(24)/deepdrid(211)/luna16(237)/chase-db1(251)/hrf(261)/drishti-gs(301)/retouch(321)/verse-spine(435)/ct-rate(546)/selma3d(681)),共 18 条(附录 P/V)

附录 B:逐项证据链自证

关键数字 来源 位置
103/1909/1694/215/116 论文 §3.1 + GitHub README Data 节 ar5iv 全文、仓库页面(双源一致)
512×512×180~300、0.469×0.469×1 mm 论文 §3.3 Processing pipeline ar5iv 全文
单阈值法/多阈值法/Amira 2019/50 工作日 论文 §3.3 ar5iv 全文
MeshLab 清洗+法向量 论文 §3.3 Data clean and re-meshing ar5iv 全文
测地矩阵 N×N、热方程法 论文 §3.1、§3.3 ar5iv 全文
一名医生 8 小时标注 论文 §3.3 Generation and annotation ar5iv 全文
分类 Table 1 全部数字 论文 §4.1 Table 1 ar5iv 全文
分割 Table 2 全部数字 论文 §4.2 Table 2 ar5iv 全文
5 s/24 s 每 epoch、92 小时总量 论文 §4、§4.2 ar5iv 全文
CapsuleNet 失败、PointGrid 参数观察 论文 §4.2 讨论段 ar5iv 全文
DOI 与页码 CVF Open Access、dblp、NSTL、Mendeley 多源交叉
无 LICENSE 文件 GitHub 仓库目录列表 仓库页面抓取 2026-09-29
Google Drive 直链与表单 README 下载链接与表单链接 仓库页面抓取
OpenDataLab 2.3GB 与 license 未知 OpenDataLab 条目页 页面抓取 2026-09-29
HF 无官方镜像 hf-mirror API datasets 检索 API 实查 2026-09-29
AMED JP18he1602001 GitHub README Acknowledgements 仓库页面抓取
CVMJ 2023 72% vs 46% CVMJ 9(1):57-69 摘要与 arXiv 2006.16161 多源交叉
SciRep 2024 TPR 0.96 s41598-024-65825-4 正文 页面抓取

附录 C:数据获取决策树

你的网络是什么派别?
├── 点云派(PointNet/PN++/PointCNN/SO-Net/PointConv/DGCNN)
│   ├── 只跑分类基准 → 2025 段(生成段+标注段合并),按论文 5 折
│   └── 跑分割基准 → 116 标注段(含测地矩阵可选加载)
├── 网格派(MeshCNN/MeshNet)
│   └── 确认流形性(官方已清洗)→ 116 标注段 + MeshCNN 原生输入
├── 体素派(SSCN/PointGrid)
│   └── 表面转体素栅格(分辨率 24-40)→ 注意 §4.3 的性能差距
└── 需要 2D MRA / 体数据
    └── ❌ IntrA 不提供 → 转 ADAM / LargeIA

附录 D:动脉瘤类型与难例对照

难例来源 表现 受影响方法 论文证据
小尺寸比瘤体 各方法准确率齐跌 全体 §4.2 讨论+Fig 9
双动脉瘤段 多数方法失败 仅 PointConv/PN++g 稳定 §4.2+Fig 9 末行
微小/不完整动脉瘤(分类) 误分类主体 全体(A. 列低分主因) §4.1 讨论
跨数据集泛化 CapsuleNet 全判健康 无层级设计的网络 §4.2 附加实验

附录 E:检索关键词映射

目标 建议检索式 避坑提示
官方仓库 intra3d2019 IntrA / IntrA CVPR 2020 别用 intra2d2019(坑 1)
论文 arXiv 2003.02920 / DOI 10.1109/CVPR42600.2020.00273 页码有双口径(坑 6)
中文文献 颅内动脉瘤 3D 点云数据集 IntrA 注意 102 例讹误(Q24)
互补数据集 ADAM aneurysm challenge / Large IA segmentation Zenodo 体数据与表面数据别混装
团队后续 Two-step Surface-based Pipeline CVMJ 2023 扩展版才是期刊正式版

附录 F:引文规范

BibTeX(论文+数据集联合引用):

@InProceedings{Yang_2020_CVPR,
  author    = {Yang, Xi and Xia, Ding and Kin, Taichi and Igarashi, Takeo},
  title     = {IntrA: 3D Intracranial Aneurysm Dataset for Deep Learning},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month     = {June},
  year      = {2020},
  pages     = {2653-2663}
}
@misc{intra2020dataset,
  author = {Xi Yang and Ding Xia and Taichi Kin and Takeo Igarashi},
  title  = {IntrA: 3D Intracranial Aneurysm Dataset},
  howpublished = {\url{https://github.com/intra3d2019/IntrA}},
  year   = {2020}
}

页码按 dblp/NSTL 口径写 2653-2663;若引用源采用 OpenDataLab 口径(2656-2666)请注明出处(坑 6)。

附录 G:双口径登记表

事项 口径 A 口径 B 处置
论文页码 2653-2663(dblp/NSTL/Mendeley) 2656-2666(OpenDataLab/部分聚合) 两口径并存,正文标注;DOI 为唯一锚点
引用数 120/127/161(Google Scholar) 82/117(Semantic Scholar) 仅作热度参考,不入正文数字
GitHub org intra3d2019(官方正确) intra2d2019(CVF/HypePaper 转写错误) 正文按 intra3d2019,坑 1 存照
数据规模 103 模型(论文/README/CVF 一致) 102 例(部分二手资料) 按 103,讹误存照
complete models 发布量 103(README) 无其他口径 单口径

附录 H:生产档案

项 值
代理 agent-b-intra
开工时间 2026-09-29T00:22(锁文件为准)
开工三查 锁不存在→新建;ps 留痕=5;writing/ 无同名目录
核验轮次 WebSearch×5 + ar5iv 全文解析 + CVF/OpenDataLab/GitHub 实抓 + hf-mirror API + DB 查重(0 命中)
brief 证伪 机构(苏州大学→东京大学+华南理工)、会议(MICCAI 2018 INTERPRET→CVPR 2020)、规模(102+1352→103/1909/116)
成稿方式 5 part 直写 /tmp/intra_agent-b-intra_part*.md 后 cat 拼接
自检 check_md.py + preflight_check.py(双零要求)

附录 I:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 元数据可检 部分 论文级元数据完整;数据集级无标准 schema
F2 全局唯一标识 是 DOI(论文)+GitHub(数据)
F3 引用元数据 是 CVF/dblp/GS 可索引
A1 可获取 是 直链+镜像(Google Drive 受限时有 OpenDataLab)
A2 协议开放 部分 无 LICENSE 文件——合规暗礁
I1 开放格式 是 标准网格/点云格式+Python 工具
I2 词典/本体 否 无逐例数据字典
R1 版本化 弱 arXiv v1/v2 论文版本可考;数据无版本号
R2 溯源 部分 构建流水线论文可溯;逐例元数据缺失
S1 持续维护 弱 2020-04 后无仓库更新

附录 J:缩写速查

缩写 全称
IA Intracranial Aneurysm
MRA Magnetic Resonance Angiography
TOF Time-Of-Flight
PN++ PointNet++
SSCN Submanifold Sparse Convolutional Network
DGCNN Dynamic Graph Convolutional Neural Network
IoU/JI Intersection over Union / Jaccard Index
DSC Dice Similarity Coefficient
OA Overall Accuracy
CVPR IEEE/CVF Conference on Computer Vision and Pattern Recognition
AMED Japan Agency for Medical Research and Development
CVMJ Computational Visual Media

附录 K:基准网络 venue 档案(第二轮补核)

10 个核心网络的正式发表 venue 逐一补核如下(检索时点 2026-09-29):

网络 正式 venue 常被误记为 存照说明
PointNet CVPR 2017 — Qi 等
PointNet++(PN++) NIPS 2017 NeurIPS 2017 年会议官方名仍为 NIPS
SO-Net CVPR 2018 — Li 等
PointGrid CVPR 2018 — pp. 9204-9214, DOI 10.1109/CVPR.2018.00959
SSCN CVPR 2018 — Graham 等(Submanifold Sparse ConvNet)
SpiderCNN ECCV 2018 ACM TOG 高频误记,勘误存照见附录 L
PointCNN NIPS 2018 — Li 等
PointConv NeurIPS 2018 NIPS 2018 年起会议官方名更替为 NeurIPS
DGCNN ACM TOG 2019 — SIGGRAPH 2019 期刊轨
MeshCNN SIGGRAPH 2019 ACM TOG SIGGRAPH 2019 会议论文

(注:NIPS 与 NeurIPS 为同一会议的先后官方名称,本条目按发表当年官方名书写;DGCNN 的期刊版与 MeshCNN 的会议版在二手资料中常被互相写串。)

附录 L:第二轮勘误存照

事项 旧口径(已废弃) 实核口径 出处 正文落点
ADAM 模态 4D-DSA/CTA/MRA 混合 全部为 TOF-MRA Timmins 等,NeuroImage(ADAM 挑战赛论文)+ 官网 adam.isi.uu.nl §6.4/§8.4/坑 4/坑 9/FAQ Q20/Q25
SpiderCNN venue ACM TOG ECCV 2018 ECCV 2018 官方论文 §6.1/§6.2/附录 K/FAQ Q33
brief 机构(第一轮存照) 苏州大学 东京大学+华南理工 论文作者单位页 §8.1/FAQ Q3
brief 规模(第一轮存照) 102 例+1352 投影 103/1909/116 论文+README+CVF 三源 坑 3/FAQ Q24

勘误原则:旧口径只在附录存照,不进正文;两轮口径冲突时一律以"实核口径+一手出处"为准。

附录 M:ADAM 数据集档案(库外锚点)

项 值
全称 Aneurysm Detection And segMentation(ADAM)challenge
模态 TOF-MRA(全部)——坑 9 的勘误对象
规模 训练 113 例扫描/129 个 UIA;测试 141 例/153 UIA
任务 动脉瘤检出 + 分割双任务
机制 挑战赛注册制;在线榜单持续开放
官方出处 Timmins 等,Aneurysm Detection And segMentation (ADAM) challenge, NeuroImage(Elsevier)
官网 adam.isi.uu.nl
与 IntrA 关系 模态同源(TOF-MRA)、表示不同(体 vs 表面)、任务互补(检测/体分割 vs 分类/部件分割)

附录 N:LargeIA 数据集档案(库外锚点)

项 值
论文 An intracranial aneurysm labeling dataset with both vessel and aneurysm labels, Patterns 2(10):100197, 2021
DOI 10.1016/j.patter.2020.100197
托管 Zenodo 记录 6801397/6801398
模态 3D CTA
规模 内部 1338 例(1489 个 IA)+ 外部测试 138 例(101 IA)
标签 血管+动脉瘤双标签体素掩码
许可 申请制、非商用
与 IntrA 关系 体数据对照锚点(§6.4/§8.4);模态(CTA vs TOF-MRA)与粒度(体素 vs 表面)双重不同

附录 O:第二轮补核方法论

轮次 手段 覆盖对象
1 WebSearch:ADAM aneurysm challenge 模态 ADAM 模态勘误(坑 9)
2 WebSearch:adam.isi.uu.nl + Timmins et al. NeuroImage ADAM 双源确认
3 WebSearch:LargeIA Zenodo + Patterns 100197 LargeIA 档案(附录 N)
4 WebSearch:10 网络逐一 venue 检索 venue 表(附录 K)
5 DB 只读查询(qf_psql) rid 互链实证(附录 P)+ aneurysm 条目反向查无

原则:每个可改动结论至少两源互证;无法两源的(如 Google Drive 直链可用性)不入正文结论,存照为遗留疑点(事实清单 40)。

附录 P:第二轮互链 rid 验证记录

查询:SELECT record_id, url_name, title FROM ai_ready_dataset WHERE record_id IN (24,211,237,251,261,301,321,435,546,681)(只读,2026-09-29,10/10 命中):

rid url_name 关系标签
24 brats 体数据病灶分割挑战赛(脑肿瘤 MRI)
211 deepdrid 眼底质量评估+DR 分级挑战
237 luna16 体数据病灶检测挑战赛(肺结节)
251 chase-db1 视网膜血管分割(儿童队列)
261 hrf 高分辨率眼底血管分割
301 drishti-gs 青光眼视盘/视杯分割
321 retouch 视网膜 OCT 积液分割挑战
435 verse-spine 脊柱 CT 椎体分割挑战
546 ct-rate 胸部 CT-报告多模态语料
681 selma3d 显微光片 3D 自/半监督分割(含血管结构)

反向查证:title ILIKE '%aneurysm%' OR title ILIKE '%ADAM%' → 0 行(库内确无动脉瘤专属条目,§10.3 注意事项的依据)。

附录 Q:第二轮生产档案

项 值
代理 agent-b-intraex(续 agent-b-intra)
锁 writing/intra/.lock = agent-b-intraex 2026-09-29T22:52:37+0800
任务链 租约锁 → 自检双零 → 结构对齐金标准(panda-plus 1207 行)→ 章节重编号 → part 扩写 → 锚点拼接 → 终检
part 清单 part2(§2.8/2.9)、part4(§4.7)、part6(新 §6 方法综述)、part7(§7.6)、part8(§8.5)、part9(§9.5/9.6)、part10(§10.3)、part11(坑 9/10)、part12(FAQ Q25-Q40)、part13/14(事实+术语扩充)、part15(附录 K-T)
拼接方式 按章节标题锚点插入(非行号),python 脚本执行后核行数
自检 check_md.py + preflight_check.py(双零要求,结果见终检汇报)

附录 R:条目修订史

版本 时点 内容
v1 成稿 2026-09-29(agent-b-intra) 863 行:§0-§11+FAQ 24 问+事实 30 条+术语 24 条+附录 A-J
v2 重编号 2026-09-29(agent-b-intraex) §6-§11 顺移为 §7-§12,为新方法综述章(§6)让位;正文交叉引用同步
v3 扩写 2026-09-29(agent-b-intraex) 新增 §2.8/2.9、§4.7、§6 全章、§7.6、§8.5、§9.5/9.6、§10.3、坑 9/10、FAQ Q25-Q40、事实 31-45、术语 +10、附录 K-T;勘误:ADAM 模态、SpiderCNN venue

附录 S:维护者复核检查单(建议年度执行)

  • [ ] Google Drive 直链与反馈表单可达性
  • [ ] OpenDataLab 镜像在线状态与体积口径(2.3GB 是否变化)
  • [ ] HuggingFace 是否出现官方/高星镜像(2026-09-29 时点为无)
  • [ ] 官方仓库是否有新 commit(数据扩容承诺是否兑现,FAQ Q22)
  • [ ] 引用数时点更新(Google Scholar/Semantic Scholar,仅热度参考)
  • [ ] ADAM 榜单与 LargeIA Zenodo 记录状态
  • [ ] 库内是否新建 aneurysm/ADAM/LargeIA 条目——若有,回填 §6.4/§10.3 互链并摘掉"库外锚点"标记
  • [ ] 基准数字若有官方勘误或修订,同步 §4 与附录 G

附录 T:常见二手讹误对照表

讹误 实核 高发场景
“102 例” 103 个完整模型 中文二手资料、brief 转写
苏州大学团队 东京大学+华南理工 中文百科/新闻
MICCAI 2018 INTERPRET CVPR 2020 Oral 会议混淆(同名 workshop 干扰)
intra2d2019 intra3d2019 CVF 摘要页/聚合站转写
ADAM=4D-DSA/CTA/MRA 全部 TOF-MRA 模态泛化讹传(坑 9)
页码 2656-2666 与 2653-2663 并存(双口径) OpenDataLab 引文(坑 6)
SpiderCNN=ACM TOG ECCV 2018 汇总表转抄(附录 K)
“116 个动脉瘤” 116 个标注动脉瘤段 数字口径压缩(坑 3)

附录 U:数字-章节速查索引

你要找的数字 在哪
103/1909/1694/215/116/2025 §2.1 三层结构表;坑 3 口径辨析
512×512×180~300、0.469×0.469×1 mm §2.2
50 工作日 / 8 小时 / ~4 分钟每段 §3.5 成本账本;§2.4
分类基准全部数字 §4.2 全表;四个"最高"见 §4.7 检查单
分割基准全部数字 §4.3 全表
5 s / 24 s 每 epoch、92 小时总量 §4.6
测地增强提升(76.21→76.95) §5.2;难例价值 §4.5
ADAM/LargeIA 规模与模态 §6.4、附录 M/N
72% vs 46%(CVMJ 2023) §8.2、§6.5
引用数/页码双口径 附录 G
18 条库内互链 rid §10.1/§10.3、附录 P/V
仓库时间线与可持续性 §8.5
标注一致性的可得性 坑 11、FAQ Q43

附录 V:库内互链总表(18 条,两轮 DB 只读实证)

第一轮(成稿轮,§10.1)8 条:

rid 条目 关系
241 drive 眼底血管分割金标准
371 fairseg 分割公平性方法论
377 btcv CT 多器官分割
422 totalsegmentator 大规模 3D 分割
482 ixi-brain 脑 MRI(健康人结构)
501 wmh-challenge 脑 MRI 挑战赛基准
549 imagecas 冠脉 CTA 血管树分割
716 medmnist 轻量医学基准家族(含 3D)

第二轮(补核轮,§10.3)10 条:

rid 条目 关系
24 brats 体数据病灶分割挑战赛(脑肿瘤 MRI)
211 deepdrid 眼底质量评估+DR 分级挑战
237 luna16 体数据病灶检测挑战赛(肺结节)
251 chase-db1 视网膜血管分割(儿童队列)
261 hrf 高分辨率眼底血管分割
301 drishti-gs 青光眼视盘/视杯分割
321 retouch 视网膜 OCT 积液分割挑战
435 verse-spine 脊柱 CT 椎体分割挑战
546 ct-rate 胸部 CT-报告多模态语料
681 selma3d 显微光片 3D 自/半监督分割(含血管结构)

验证方式与反向查证(aneurysm/ADAM 条目 0 行)见附录 P;动脉瘤体数据两大数据集 ADAM/LargeIA 为库外锚点(附录 M/N)。

尾注

本条目由千方病案医数集 AI-Ready Wikipedia 写手代理(agent-b-intra)于 2026-09-29 基于三源互证成稿:论文全文(arXiv:2003.02920v2,ar5iv HTML 解析)、官方仓库(github.com/intra3d2019/IntrA)、CVF Open Access 官方页、OpenDataLab 镜像页、hf-mirror API 检索、以及库内 DB 只读查重。所有硬数字在附录 B 登记出处与位置;brief 与实核的出入(机构/会议/规模)在 §11 坑点与附录 G 全量存照。条目口径以论文原文与官方仓库为准,二手聚合站信息仅作旁证并标注冲突。

第二轮补核与扩写(agent-b-intraex,2026-09-29):勘误 ADAM 模态(实为全 TOF-MRA,坑 9)与 SpiderCNN venue(实为 ECCV 2018),补核 LargeIA 档案与 10 网络 venue 表;新增 §6 方法综述全章及 §2.8/2.9、§3.5、§4.7、§5.4、§7.6、§8.5、§9.5/9.6、§10.3、坑 10-11、FAQ Q25-Q48、事实 31-45、术语 25-34、附录 K-V;库内互链两轮 DB 只读实证共 18 条(附录 P/V)。勘误存照见附录 L,补核方法论见附录 O,修订史见附录 R。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • mr-art — 共享标签:医学影像 / MRI / 医学图像分割 / 脑影像 / 评测基准
  • ulf-enc — 共享标签:医学影像 / MRI / 脑影像 / 评测基准
  • hyperkvasir — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 评测基准
  • prostate158 — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
  • adam-aneurysm — 共享标签:医学影像 / 医学图像分割 / 脑影像 / 评测基准
  • selma3d — 共享标签:医学影像 / 医学图像分割 / 图像分类 / 脑影像
  • 3dreasonknee — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
  • acdc — 共享标签:医学影像 / MRI / 医学图像分割 / 评测基准
  • cardiac-atlas-project — 共享标签:医学影像 / MRI / 医学图像分割 / 图像分类
  • aims-tbi — 共享标签:医学影像 / MRI / 医学图像分割 / 脑影像

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集