OAI — 骨关节炎计划 AI-Ready Wikipedia

NIH 主导的十年膝骨关节炎纵向队列 · 4,796 名参与者 · 约 2,662 万张影像免费公开

来源 NIH(NIAMS 牵头)与 FNIH 协调的公私合作联盟;UCSF 数据协调中心 url: {oai}/0发布时间: 2026-09-13最后更新: 2026-09-25 阅读 29
OAI — 骨关节炎计划 AI-Ready Wikipedia

信息速览

数据集名称OAI — 骨关节炎计划 AI-Ready Wikipedia
数据类型约 2,662 万张影像,4,796 名参与者,2004 年起随访 96 个月以上,3T MRI + 固定屈曲位 X 光,SAS/ASCII + DICOM (GZIP),NDA 注册免费获取
规模4,796 名参与者
接入方式NIH(NIAMS 牵头)与 FNIH 协调的公私合作联盟;UCSF 数据协调中心 url: {oai}/0
AI 就绪度

数据集封面

OAI(骨关节炎计划)— 膝骨关节炎纵向队列 AI-Ready Wikipedia

INFOBOX

数据集名称 Osteoarthritis Initiative (OAI) Database
英文全称 Osteoarthritis Initiative
别名/简称 OAI、OAI Online、NDA-OAI
疾病分类 膝骨关节炎及高危人群(ICD-10:M17.0-M17.9 膝骨关节炎;ICD-11:FA00-FA0Z 骨关节炎段,按部位与原发/继发细分)
SNOMED CT 396275006 Osteoarthritis of knee(详见 §2.2)
数据模态 影像(标准化固定屈曲位 X 光、3T MRI)、结构化临床数据、自报告结局、生物标志物(血清/血浆/尿/DNA)
AI 任务类型 膝骨/软骨分割、软骨形态定量、KL 分级自动评估、OA 进展与发病预测、半定量评分回归(WORMS/BLOKS/MOAKS)、多模态纵向风险建模
样本总数 4,796 名参与者 / 431,000+ 次临床与影像访问 / 约 26,626,000 张图像
数据大小 临床数据集为 SAS/ASCII;影像为 DICOM(按 series GZIP 打包,约 2,662 万张,全量下载需规划大容量存储)
数据格式 SAS v7 transport / ASCII / DICOM(GZIP,按 series)/ NDA 在线查询
许可证 开放获取(注册 NDA 账户并遵守数据使用政策,免费;生物样本需单独申请)
访问级别 注册获取(NDA 账户 + 登记 OAI 访问;生物样本走申请审批)
DUO 标签 GRU, PUB
语言 英文
首发日期 2004(基线招募启动,数据与影像自 2004 年起公开发布)
最后更新 持续更新(NDA 永久归档;新增影像与生物样本分析结果按季度发布)
发布机构 NIH(NIAMS 牵头,多所 NIH 研究所参与)与 FNIH 协调的公私合作联盟;私营资助方含 Pfizer、Merck、GSK、Novartis
官方主页 /oai/391
下载地址 /oai/391
DOI NCT00080171(临床注册号)/ doi:10.1371/journal.pone.0219902(队列 profile 论文)
引用次数 超过 400 篇基于 OAI 数据的论文(NDA 归档统计,截至 2025)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 免费开放、数据字典与官方教程完备、影像-临床-生物标志物多模态纵向;扣分项:半定量与分割标注仅覆盖子集、无官方 ML 划分、影像下载与目录工程量大
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-10/ICD-11/SNOMED CT 映射、膝 OA 临床任务定义、KL/WORMS 金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 数据结构与 DAIMS 字段字典(数据集家族、四级键体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

利益冲突声明:千方病案医数集与 NIH、NIAMS、FNIH、UCSF 及 NDA 无任何商业利益关联。本页面不销售 OAI 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。OAI 要求用户注册 NIMH Data Archive(NDA)账户并登记 OAI 访问、遵守数据使用政策;生物样本需按官方流程单独申请。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 30 秒速览

这是什么数据? OAI 是美国 NIH(NIAMS 牵头)与私营药企(Pfizer、Merck、GSK、Novartis,经 FNIH 协调)共同资助的多中心、纵向前瞻性膝骨关节炎观察研究,2002 年启动、2004 年起在 4 个城市的 5 个临床设施招募 4,796 名 45-79 岁社区人群,随访超过 96 个月。它同时提供标准化 X 光、四中心同型号 3T 膝部 MRI、血/尿生物标志物与年度临床功能评估,全部经 NDA 免费开放。

适合做什么 AI 任务? 三类任务定义了它的 AI 生态:膝关节骨与软骨分割(OAI-ZIB 507 例手动分割基准、IWOAI 2019 挑战赛)、膝 OA 进展与发病预测(KL 分级与症状定义标签、每年随访)、多模态纵向建模(影像 + 临床 + 生物标志物对齐)。它也是检验膝 OA 模型外部效度的标准参照队列(与姊妹研究 MOST 常被联合分析)。

上手有多难? 临床数据容易:注册 NDA 账户后下载 SAS/ASCII 即可,配套数据字典与官方教程完善。影像不容易:约 2,662 万张 DICOM 按 series 打包、按时间点分发,全量下载与目录整理工程量大;半定量评分与手动分割只覆盖子集,监督学习样本量需要规划。整体难度中等偏上,但不存在付费或许可壁垒。

§1.1 摘要

OAI(Osteoarthritis Initiative,骨关节炎计划)于 2002 年 7 月启动,是 NIH 与私营部门公私合作的旗舰成果,目标是为膝骨关节炎(OA)生物标志物研究建立公共领域研究资源,加速影像与分子标志物作为疾病发生与进展替代终点的科学评价与监管认定(ClinicalTrials.gov NCT00080171)。2004 年起,巴尔的摩(马里兰大学与约翰霍普金斯)、哥伦布(俄亥俄州立大学)、匹兹堡与波塔基特(罗德岛纪念医院/布朗大学)4 个城市 5 个临床设施共招募 4,796 名 45-79 岁参与者(达招募目标的 96%),其中 58% 为女性、21% 为少数族裔。队列由三个子队列构成:进展队列(progression,约 1,390 人,基线即有症状性放射学膝 OA)、发病高危队列(incidence,约 3,280 人,尚无 OA 但具备明确危险因素)与正常对照(non-exposed,122 人,无 OA 亦无危险因素)。48 个月时总保留率达 90%(临床随访 81%)。

与大多数「单时点影像集」不同,OAI 的核心价值在于纵向密度:基线、12、24、36、48、72 个月为含影像与生物样本的临床访问,60 与 84 个月为问卷/电话随访,96 个月再次进行含影像的临床访问;进展子队列另在 18 个月(n=288)与 30 个月(n=494)接受额外 MRI 与血样采集。数据与影像自 2004 年起经 OAI Online 公开发布,现永久归档于 NIMH Data Archive(NDA),归档规模为 431,000+ 次临床与影像访问、约 26,626,000 张图像,基于该数据资源的论文超过 400 篇。NIH 分别于 2024 年发布专项资助公告(NOSI NOT-AR-24-019),并资助建立 OAI CORE Knowledgebase 作为官方支持枢纽,足见其在 OA 研究版图中的长期地位。

§1.2 战略价值分析

对医疗 AI 团队而言,OAI 的战略价值体现在四个层面:

第一,标签的科学可信度。 进展/发病定义由「频繁膝痛 + 放射学证据(OARSI 骨赘分级)」共同构成,KL 分级由盲法中心读片产生,双读 + 仲裁机制控制读片者间方差;这一标签生产流程比自采集标注更适合作为监管级替代终点研究的基础。事实上,OAI 的立项动机之一就是为 DMOAD(疾病修饰 OA 药物)试验提供经过验证的影像生物标志物——使用该数据集训练的模型,天然继承「面向药物试验终点」这一高标准的任务定义。

第二,纵向密度。 同一受试者长达 96 个月以上的重复影像与临床评估(临床访问 00/12/24/36/48/72/96 个月),使疾病进展轨迹建模、进展时间-事件分析成为可能。横断面影像集只能回答「这张片子看起来像什么」,OAI 能回答「这个人接下来会发生什么」——这是预测类医疗 AI 的核心命题。进展子队列的 18/30 个月加密访问进一步提供了高分辨率进展轨迹样本。

第三,多模态对齐。 同一访问内完成 X 光、3T MRI 与血/尿样本采集,天然支持「影像 + 分子」多模态融合研究;四中心同型号扫描仪(Siemens Trio 3T)与每月 phantom 质控保证了跨中心数据可池化,省去了多中心影像研究最常见的设备域适应负担。

第四,零成本与可复现性。 免费注册获取、无使用费;协议文档、数据字典、评分体系(WORMS/BLOKS/MOAKS)全部公开;衍生基准(OAI-ZIB、IWOAI 2019)提供现成标签与划分。NIH 甚至以 NOSI(NOT-AR-24-019,2024-08)官方动员社区使用该资源——对需要「数据合法性与可复现性」论证的论文与产品,这几乎是最稳的选择。

其局限同样清晰:半定量 MRI 评分(WORMS/BLOKS/MOAKS)与手动软骨分割仅覆盖子集(OAI-ZIB 基准为 507 例),全队列级别的高密度像素级标注并不存在;60/84 个月无影像造成纵向断层;入组时 X 光为本地读片而随访为集中读片,基线与随访分级口径不完全一致。选择 OAI 的团队应将其定位为「纵向多模态研究基础设施」,而非「大标注影像集」。

不同使用者画像下的价值排序:

使用者 首要价值 应放弃的期待 建议起步路径
分割算法研究者 OAI-ZIB 507 例手动分割 + IWOAI 标准化划分 全队列像素级标注 直接用衍生基准,全队列仅做预训练
进展预测建模者 纵向设计 + 官方复合标签口径 官方 ML 划分 按 §5.2 自建划分,MOST 外部验证
多模态/生物标志物研究者 同访问影像-样本-临床对齐 生物样本即时可得(需单独申请) 先用公开临床+影像跑通,再申请样本
卫生经济/流行病学者 社区人群 + 长随访 + TKR 硬终点 全国代表性(危险因素过采样) 声明队列构成,加权校正

§1.3 横向对比

维度 OAI MOST(姊妹研究) OAI-ZIB(衍生基准) SKI10(挑战赛数据)
定位 纵向多模态观察队列 与 OAI 互补的纵向队列 OAI 的手动分割子集 独立膝 MRI 分割挑战
样本规模 4,796 人 3,026 人(50-79 岁) 507 例 MR 检查 677 例膝 MRI(训练+测试)
影像 X 光 + 3T MRI(双膝) X 光为主,MRI 子集 3D DESS 水激发(右膝基线) 手动分割膝 MRI
随访 96 个月以上 84 个月(4 次访问) 无(单时点) 无
标注 中心读片 KL/OARSI + 子集评分 中心读片(波士顿大学) 骨/软骨像素级分割 软骨分割
获取 NDA 注册免费 NDA/官方渠道注册 公开下载 挑战赛历史数据
与 OAI 关系 — 协议相近,常联合分析与外部验证 由 OAI 影像加工而来 独立人群,可用于泛化测试

选型建议:需要纵向与多模态,选 OAI;需要影像协议几乎一致的外部验证集,加 MOST;需要开箱即用的分割标签,先下 OAI-ZIB,再考虑 IWOAI 2019 标准化划分;需要在 OAI 之外检验泛化性,用 SKI10。

§1.4 版本演进时间轴

  • 2002-07:OAI 项目启动(NIH 与私营部门公私合作,NCT00080171 注册)。
  • 2004:四城市 5 个临床设施开始基线招募(最终 4,796 人);临床数据与影像自同年起经 OAI Online 公开发布。
  • 2004-2006:基线(00M)与年度访问(12M/24M)陆续完成;早期数据发布采用 0.x.y 版本号(如 clinical 0.1.1、image 0.B.1/1.B.1),仅覆盖部分受试者。
  • 2008:MRI 协议设计论文发表(Peterfy 等,Osteoarthritis and Cartilage),正式报告 5 序列膝部 MRI 协议的遴选依据。
  • 2011:全队列完成 48 个月临床随访(保留率 90%,临床随访 81%)。
  • 2015-01-01:基线至 96 个月全部计划访问完成(60/84 个月为问卷/电话,72 个月含样本与影像,96 个月含影像)。
  • 2014:十年影像研究综述发表(Eckstein 等,Annals of the Rheumatic Diseases),系统总结 OAI 影像研究成果。
  • 2016-03:NIAMS 统计显示 4,114 名注册用户来自 90 余个国家,下载数据集 30,260+ 次、分发影像集 507 套。
  • 2019:队列 profile 论文发表于 PLoS ONE(doi:10.1371/journal.pone.0219902);OAI-ZIB 507 例手动分割基准(Ambellan 等)公开发布。
  • 2019-2023:IWOAI 2019 膝 MRI 分割挑战赛及后续纵向评估(Dam 等 2023)建立标准化 OAI 划分并公开 9,040 个深度学习分割结果。
  • 2024-08:NIH 发布 NOSI NOT-AR-24-019,鼓励社区利用 OAI 资源申请课题。
  • 至今:OAI 永久归档托管于 NDA;OAI CORE Knowledgebase 提供官方教程、答疑与月度网络研讨会;新增影像/生物样本分析结果按季度发布。

§1.5 典型 AI 应用场景

  1. 膝关节骨与软骨分割:以 OAI-ZIB 507 例(标签:背景/股骨/股软骨/胫骨/胫软骨)训练 U-Net、nnU-Net 类模型,在 IWOAI 2019 标准化划分上对比 Dice;研究显示顶级方法已达到与人工读片间差异相当的精度(§8.1)。
  2. 放射学 OA 进展预测:以基线影像 + 人口学特征预测 24-48 个月 KL 进展或症状性 OA 发病,进展队列提供充足阳性样本。
  3. MRI 半定量评分回归:在带 WORMS/BLOKS/MOAKS 读片的子集上训练评分回归/分类,替代昂贵的人工读片。
  4. 多模态纵向风险建模:对齐年度临床评估(WOMAC、体测)、影像定量指标与血/尿生物标志物,构建疾病轨迹与危险分层模型。
  5. 外部验证基准:作为 MOST、SKI10 等研究/数据集的互验参照;OAI 训练的分割与进展模型常以 MOST 做协议近似的独立验证。
  6. 教学与方法学训练:官方数据字典、OAI CORE 教程与月度答疑使其成为纵向队列数据工程的标准教学资源。

场景-所需数据-起点资源对照表:

应用场景 所需数据家族 最小可用起点 关键陷阱(对应坑点)
软骨/骨分割 OAI-ZIB 或 OAI 影像(DESS 序列) OAI-ZIB 507 例 + IWOAI 划分 坑点 2(侧别)、坑点 7(子集标注)
KL 分级/进展预测 AllImages(X 光读片)+ AllClinical 中心读片 KL + 基线临床表 坑点 1(读片口径)、坑点 4(队列捷径)
症状性 OA 发病 AllClinical(WOMAC)+ AllImages 复合标签构造(§6.3 步骤 3) 坑点 3(复合定义口径)
TKR 预测 AllClinical + 手术记录 长表 + TKR 事件列 TKR 截断与信息性缺失
半定量评分替代 WORMS/BLOKS/MOAKS 评分子集 评分子集 + 多任务头 子集规模小,勿全队列泛化声明
生物标志物融合 生物样本(单独申请)+ 影像定量 先用 FNIH 项目公开结果 坑点 8(版本锚定)

§2 医学背景

§2.1 ICD-11 疾病分类锚定

OAI 聚焦膝骨关节炎(knee osteoarthritis)。在 ICD-10-CM 中,膝骨关节炎对应 M17.0-M17.9(双侧/单侧、原发性/继发性、创伤后等细分);在 ICD-11 中,骨关节炎位于肌肉骨骼系统章节的骨关节炎段(FA00-FA0Z,按受累部位与原发/继发细分),膝部为其最主要的目标关节之一。OAI 队列本身按「症状 + 放射学」标准而非疾病编码招募:进展队列要求至少一侧膝在「过去 12 个月内多数日子」存在疼痛、酸痛或僵硬,且同侧膝存在明确胫股骨赘(OARSI 图集骨赘分级 ≥1);双膝均出现重度关节间隙狭窄(OARSI 3 级或「骨对骨」)者被排除,以保证进展空间。发病队列纳入无OA 但具备明确危险因素(超重、膝症状史、膝外伤/手术史、TKR 家族史、Heberden 结节、反复屈膝劳动等)的个体。研究 AI 标签时务必以 OAI 自身的招募与读片定义为准,而非事后 ICD 编码。

§2.2 SNOMED CT 映射

膝骨关节炎在 SNOMED CT 中的核心概念为 396275006(Osteoarthritis of knee,膝关节骨关节炎),上位概念为骨关节炎(disorder 轴),相关形态学发现包括软骨破坏与骨赘形成;相关的评估性概念包括 Kellgren-Lawrence 分级(grading scale 轴)与关节间隙宽度测量(observable entity 轴)。将 OAI 读片结果映射到电子病历或本体系统时,建议以 396275006 作为膝 OA 诊断锚点、以 KL 分级作为严重度轴,并在映射表中注明 OAI 的「症状性 OA」为复合定义(KL ≥2 放射学证据 + WOMAC 疼痛 >0),不等同于任何单一 SNOMED 编码。

§2.3 疾病简介

骨关节炎是最常见的关节炎形式,以关节软骨进行性破坏、软骨下骨重塑、骨赘形成、半月板退变与滑膜炎症为病理特征,临床表现为慢性膝痛、晨僵、活动受限乃至残疾。膝 OA 的确诊与分期长期依赖负重位 X 光(关节间隙狭窄反映软骨丢失)与 KL 0-4 分级;MRI 则能直接显示软骨形态与成分、骨髓水肿样病灶(BML)、半月板损伤与滑膜炎等 X 光不可见结构,是当前 OA 影像生物标志物研究的主战场。OAI 的立项动机正是缺乏客观、可测量的 OA 诊断与进展标准导致疾病修饰药物(DMOAD)试验难以为继——通过公共资源加速影像与分子标志物的鉴定与监管认定。

对 AI 而言,膝 OA 建模有三个结构性特点:(1) 双关节间室不对称——内侧间室承担更多负荷,进展更快,也是模型误差最集中的区域(IWOAI 发现的髁间切迹/内侧间室系统性误差即与此解剖复杂性相关);(2) 进展缓慢——放射学进展以年为单位,横断面数据难以与年龄性退变区分,这正是纵向队列的不可替代性;(3) 标签层次多——症状、放射学、MRI 结构、生物化学四层证据互不等价,任何「单一 OA 标签」的提法都过度简化。

§2.4 临床任务定义

OAI 支持以下被社区反复定义的临床-影像任务,每类任务的标签口径在官方读片文档中均有明确记载:

  1. 放射学 OA 发病(incidence):基线 KL ≤1 的膝关节在随访中出现 KL ≥2。标签单位是「膝 × 访视对」;基线分级应使用中心读片而非本地读片(坑点 1)。
  2. 症状性 OA 发病:放射学发病 + 同侧膝「过去 12 个月内多数日子」疼痛(WOMAC 疼痛问题 >0)。这是与临床最相关的复合终点,也是 DMOAD 试验的常用主终点。
  3. 放射学进展:KL 升级(通常 ≥1 级)或最小关节间隙宽度(mJSW)下降超过阈值(文献常用 0.7 mm 量级口径,应以所选读片协议为准)。敏感度取决于 X 光摆位标准化——SynaFlexer 架即为压缩这项方差而设。
  4. 软骨丢失定量:3D DESS 序列上股骨/胫骨软骨体积与厚度变化。标准响应均值(SRM = 均值变化 / 变化的标准差)为该任务的核心灵敏度指标;IWOAI 后续评估显示顶级深度学习方法可达 SRM 0.38(§8.1)。
  5. 半定量评分预测:以基线影像预测随访 WORMS/BLOKS/MOAKS 组分(软骨缺损、BML、半月板损伤、滑膜炎、骨赘等)。标注覆盖子集,任务是「以贵换廉」——用影像模型替代昂贵的人工读片。
  6. 全膝置换(TKR)预测:以长程随访中的 TKR 事件作为硬终点。TKR 兼有「疾病终点的代理」与「删失事件」双重身份:作结局时是标签,作随访终止时是信息性缺失源(§7.1)。

AI 团队应在论文中显式声明采用哪一种终点、哪一个访视窗口、以及标签由中心读片还是本地读片构造——这三项决定了与既往文献的可比性。

§2.5 患者人群特征

OAI 基线人群:4,796 名社区居住成人,入组年龄 45-79 岁,58% 女性,21% 少数族裔,按三个子队列构成——进展队列约 1,390 人(29%)、发病高危队列约 3,280 人(69%)、正常对照 122 人(2%)。先经电话初筛,再赴筛选访视完成 MRI 禁忌证核查与基线胫股膝 X 光;入组时 X 光由各中心本地读片(用于队列划分与双侧终末期排除),全部基线与随访片随后由中心统一盲法读片。48 个月保留率 90%(其中临床到访 81%);约 7% 未参加追加的 5 年随访,无接触率稳定在 15-18%。随访期间记录的 TKR 事件构成纵向终点之一;分析身体功能轨迹时,TKR 前缺失具有信息性(informative missingness),需插补与 pre-TKR 处理(Øiestad 等 2016 提供了 MOST+OAI 的标准做法)。

§2.6 金标准/参考标准

OAI 的标签金标准体系分四层:(1) 放射学层:双侧 PA 固定屈曲位膝片(SynaFlexer 架标准化摆位:约 20° 膝屈曲、足 10° 外旋、球管 10° 尾向成角),中心盲法读片给出 KL 0-4、OARSI 图集骨赘与关节间隙狭窄分级、解剖轴线与 mJSW;(2) MRI 半定量层:子集上由资深肌肉骨骼影像医师按 WORMS、BLOKS 或 MOAKS 读片(OAI 子队列曾用于 WORMS 与 BLOKS 的头对头比较,促成 MOAKS 的诞生);(3) MRI 定量层:3D DESS 水激发序列上的软骨形态定量(体积、厚度),OAI-ZIB 提供 507 例骨/软骨像素级手动参考分割(由模型辅助分割经专家修订产生);(4) 临床层:WOMAC 疼痛与功能、20 米步行、5 次坐立等表现测试,以及 TKR 事件。任何论文的标签口径都应落到以上四层之一,并注明进展队列的过采样背景。


§3 数据集规格

§3.0 版本抉择矩阵

OAI 的「版本」分为四个相互独立的轴,选错轴是新手最常见的返工原因:

版本轴 取值 覆盖范围 适用场景 注意事项
临床数据发布 早期 0.1.x / 全量正式版 早期版仅覆盖部分受试者;正式版覆盖全队列 4,796 人 复现早期论文须用 0.1.1 等历史版本;新项目一律用正式版 早期论文(如 PMC2734969)显式声明使用 clinical 0.1.1
影像发布 早期 0.B.1 / 1.B.1 / 全量 早期影像发布仅含便利样本(如 160 例进展队列);全量覆盖全部影像访问 分割/定量新项目用全量;历史对照用早期版本 版本号与临床版本独立演进,不可混引
托管平台 OAI Online(历史) / NDA 查询与下载 NDA 为当前唯一永久归档 一律经 NDA 注册获取 NDA 提供查询、批量下载与影像包三种路径
衍生基准 OAI-ZIB 507 例 / IWOAI 2019 划分 / AKOA 48 例 均由 OAI 影像加工 分割与进展子任务开箱即用 衍生集有自己的许可与引用要求,须回溯引用 OAI

决策树:做临床建模 → NDA 查询接口拉取全量临床数据集;做分割 → 先下 OAI-ZIB,需要更多标签再用 IWOAI 划分;做进展预测 → 全量临床 + 全量影像读片评估文件;复现 2010 年前后论文 → 锁定论文声明的 0.x.y 版本。

§3.1 模态详细说明

  • 标准化 X 光:双侧 PA 固定屈曲位膝片(SynaFlexer 定位架)为全队列核心模态,另有手部与髋部 X 光;入组本地读片、随访集中读片。
  • 3T 膝部 MRI:四中心各配一台同型号 Siemens Magnetom Trio 3T,双膝 75 分钟内完成 5 个采集序列;每月 phantom 质控确认跨中心一致性与纵向稳定性,支持跨中心池化与纵向比较。
  • 3T 大腿 MRI:轴位 T1(自旋回波)评估大腿肌肉脂肪浸润,覆盖肌肉维度分析。
  • 生物标志物:血清、血浆、尿与 DNA,覆盖基线、12、24、36、48 与 72 个月;生物样本使用需单独申请。
  • 临床与功能评估:年度结构化访视(问卷、查体、体测、营养与用药记录),60/84 个月转为问卷/电话。
  • 辅助研究数据:accelerometry 体力活动、骨质量 MRI 与 DEXA、POMA(Pivotal OAI MRI Analyses)、皮肤自体荧光等,随附属研究发布。

§3.2 样本量拆分

数据集家族(NDA 归档口径) 内容 覆盖
Enrolment / Participant Information 人口学、队列归属、措施清单 4,796 人
AllClinical 风险因素、关节症状与功能、病史、查体、营养、生物样本采集摘要 全队列 × 各临床访问
AllImages(X 光与 MRI 评估) KL/OARSI 中心读片、软骨形态定量、半定量评分(子集) 全队列读片;评分子集
Medication Inventory 用药清单 全队列
Knee MR / Knee XR Metaanalysis 膝 MRI 与 X 光的元分析与定量结果汇总 相应模态
FNIH Project 子队列的影像后处理结果与血清/尿评估 子集
Ancillary Studies accelerometry、Bone Quality MRI+DEXA、POMA、Sage 等 各附属研究样本
影像归档 固定屈曲位 X 光与 3T MRI DICOM 约 26,626,000 张图像、431,000+ 次访问

访问规模口径:NDA 归档统计为「4,796 名受试者的纵向评估、431,000+ 次临床与影像访问、近 26,626,000 张图像」;任何论文引用样本量时应区分「人」「访问」「图像」三个口径。

随访访问与数据可得性矩阵(规划纵向建模前必查):

访视(距基线月数) 临床访问/查体 X 光 膝 MRI 生物样本 备注
00(基线) ✅ ✅ 双膝 ✅ 双膝 ✅ 入组本地读片用于队列划分
12 / 24 / 36 / 48 ✅ ✅ ✅ ✅ 年度核心访问;48 个月保留率 90%
18 / 30 ✅ — ✅(子队列) ✅(子队列) 仅进展子队列(n=288 / n=494)
60 / 84 问卷/电话 — — — 结构性影像断层(坑点 6)
72 ✅ ✅ ✅ ✅ 追加随访
96 ✅ ✅ ✅ — 全队列最后一次影像访问;截至 2015-01-01 完成

该矩阵的含义:跨 60/84 个月的外推(如 48M → 72M)之间存在 24 个月的观测空窗;任何「每 12 个月一次影像」的假设都是错的。进展子队列的 18/30 个月访问使进展轨迹的时间分辨率不均匀,纵向模型应显式编码访视月份而非假设等间隔。

§3.3 数据格式详情

  • 临床数据:SAS v7 传输格式(.xpt)与 ASCII(空格/制表分隔)双格式发布;NDA 另提供在线查询与过滤后的再格式化下载。
  • 影像:DICOM,按 series 以 GZIP 打包;整套影像亦可按时间点以 ZIP 形式获取;目录按 受试者 → 访视 → 模态/序列 组织。
  • 文档:每份临床数据集配有官方格式定义(数据字典)与附录;X 光读片、MRI 采集与评分协议文档公开。
  • 衍生基准:OAI-ZIB 以 3D 体素数据(160×384×384)与标签(0 背景/1 股骨/2 股软骨/3 胫骨/4 胫软骨)发布;IWOAI 2019 提供标准化划分与评估框架。

§3.4 存储大小

临床数据集为 SAS/ASCII,体量在常规工作站的承受范围内;影像归档近 2,662 万张 DICOM(按 series GZIP 打包),全量下载前应按「时间点 × 序列」拆分需求,规划 TB 级存储与分批下载策略。建议新手路径:先以 NDA 查询接口拉取临床表格与影像元数据,再按研究需要定向下载特定访视与序列的影像包,避免全量镜像。

§3.5 标注方式

  • 中心盲法读片:全部基线与随访 X 光由中心统一读片(KL、OARSI 骨赘与关节间隙狭窄、mJSW、解剖轴线),双读片 + 仲裁机制(波士顿大学团队模式,见 MOST+OAI 联合研究)。
  • MRI 半定量读片:WORMS/BLOKS/MOAKS 由资深肌肉骨骼影像医师在子集上独立读片,读片会话分特征进行以降低相互干扰。
  • 手动分割:OAI-ZIB 507 例由经验分析师以模型辅助分割起步、逐例修订;IWOAI 2019 挑战赛在此基础上提供标准化划分。
  • 临床标签:症状性 OA、进展、发病与 TKR 均由官方定义组合生成(见 §2.4),非单列「标签列」。

§3.6 标注者资质

中心读片由肌肉骨骼影像医师与风湿病学家双读并仲裁(如 MOST+OAI 联合功能研究中 X 光由波士顿大学的肌肉骨骼影像医师与风湿病学家独立阅读、分歧经仲裁小组解决);MRI 半定量读片由深度参与评分体系开发(如 BLOKS)的资深读者执行;手动分割由受肌骨解剖训练的分析师完成并接受资深分析师监督。具体每个数据文件的读片人员与协议在官方评估文档中记录。

§3.7 数据采集时间范围

基线招募于 2004 年启动(2004-2006 完成入组);结构化年度临床访问覆盖基线至 48 个月(2011 年全队列完成),随后追加随访至 96 个月以上;全部计划访问(含 60/84 个月问卷与 96 个月影像访问)截至 2015-01-01 完成,此后子队列随访继续、新增分析结果按季度发布。temporalCoverage 按 2004/2016 理解为宜(2016 年后为 NDA 托管与增量发布阶段)。

§3.8 地理覆盖

美国 4 城市 5 个临床设施:马里兰州巴尔的摩(马里兰大学医学院 + 约翰霍普金斯大学)、俄亥俄州哥伦布(俄亥俄州立大学)、宾夕法尼亚州匹兹堡(匹兹堡大学)、罗德岛州波塔基特(罗德岛纪念医院/布朗大学);UCSF(Michael Nevitt 博士)为数据协调与影像分析中心。社区人群抽样,非单中心转诊人群(但见 §7.1 的危险因素过采样偏倚)。

临床设施与协调中心一览:

  1. University of Maryland + Johns Hopkins(Baltimore, MD)
  2. Ohio State University(Columbus, OH)
  3. University of Pittsburgh(Pittsburgh, PA)
  4. Memorial Hospital of Rhode Island / Brown(Pawtucket, RI)
  5. UCSF(协调与影像分析中心,Michael Nevitt 博士领衔)

§3.9 采集设备规格

  • MRI:4 台同型号 Siemens Magnetom Trio 3T(各中心一台),正交膝关节线圈;膝部协议含 3D DESS 水激发(4.7ms TE / 16.3ms TR / 25° 翻转角,软骨形态定量主序列)、冠状中间权重 2D TSE(IW TSE)、冠状 3D FLASH(7.6ms TE / 20ms TR / 12°)、矢状多回波自旋回波 T2 mapping(10ms TE / 2700ms TR)、3D true FISP(4.9ms TE / 29ms TR / 50°,骨小梁结构);大腿轴位 T1(10ms TE / 600ms TR)。每月 phantom 质控。
  • X 光:SynaFlexer 定位架(Synarc)实现标准化摆位——约 20° 固定膝屈曲、足部 V 型支架 10° 外旋、球管 10° 尾向成角;双侧 PA 同时曝光。
  • 体测与问卷:标准化查体、WOMAC、20 米步行、5 次坐立、PASE 体力活动、Block Brief 2000 食物频率问卷等。

§3.10 深度溯源链

受试者招募(电话初筛 → 筛选访视 → 本地 X 光读片入组)→ 影像采集(各中心同型号设备 + 每月 phantom 质控)→ 中心统一盲法读片(KL/OARSI;双读 + 仲裁)→ 定量影像分析(软骨形态、T2、骨与半月板,经 NIAMS 2010 年三项分析合同与 FNIH 项目生成)→ 公共发布(OAI Online 自 2004 年起 → NDA 永久归档)→ 社区加工(OAI-ZIB、IWOAI 等衍生基准)。每一环节的协议文档、质控记录与版本说明在 NDA 归档中均可追溯,构成了从受试者到下游基准的完整证据链。


§4 数据结构详解

§4.0 目录结构预览

以下为按 OAI 数据家族组织的下载目录示意(实际命名以 NDA 当前发布为准):

oai_download/
├── Enrolment/                    # 入组与人口学
│   ├── enrolment.xlsx?           # 措施清单(各数据集覆盖的访问)
│   └── participant/              # 队列归属、人口学基线
├── AllClinical/                  # 全队列临床评估(按访问组织)
│   ├── allclinical00/            # 基线(00M)
│   ├── allclinical12/            # 12M
│   ├── allclinical24/
│   ├── allclinical36/
│   ├── allclinical48/
│   ├── allclinical72/
│   └── allclinical96/
├── AllImages/                    # 影像评估文件(X 光与 MRI 读片/定量)
│   ├── knee_xr/                  # KL、OARSI、mJSW 中心读片
│   ├── knee_mr/                  # 半定量评分(子集)与定量结果
│   └── metaanalysis/             # Knee XR / Knee MR Metaanalysis
├── Medication_Inventory/
├── FNIH_Project/                 # 子队列后处理影像与血清/尿评估
├── Ancillary/                    # accelerometry、DEXA、POMA、Sage 等
└── images/                       # DICOM 影像(按受试者→访视→序列)
    ├── 9000000/                  # 受试者 ID
    │   ├── 00m/                  # 访视(月)
    │   │   ├── MRSSAG/           # MRI 序列目录(GZIP DICOM per series)
    │   │   └── XRWIPAI/          # X 光检查目录
    │   └── 12m/
    └── 9000001/
# 关键约定(速记)
# 1. 受试者 ID 与访视月份数(00/12/24/36/48/72/96;进展子队列另有 18/30)
# 2. 每个临床数据集 = 一个「访问 × 主题」矩阵,SAS (.xpt) 与 ASCII 双格式
# 3. 影像按 series GZIP 打包,series 内为标准 DICOM 文件

§4.1 DAIMS 标准化字段描述表

字段/键 类型 层级 说明 AI 用途
P_ID(受试者 ID) 文本 人 全归档唯一受试者标识 分组划分的根键(GroupShuffleSplit)
访视(00/12/…/96M) 整数(月) 访视 距基线月数;60/84 无影像 纵向对齐与时间窗构造
SIDE(左/右膝) 分类 膝 双膝独立评估与读片 膝级建模的样本单位
COHORT(队列归属) 分类 人 progression / incidence / non-exposed 分层划分与患病率校正
KL 分级 0-4 序数 膝 × 访视 中心盲法读片 发病/进展标签主干
OARSI 骨赘/狭窄分级 0-3 序数 膝 × 访视 OARSI 图集口径 进展定义的组成项
mJSW(最小关节间隙宽) 连续 膝 × 访视 X 光定量 连续化进展终点
WOMAC 疼痛/功能 0-68 等 膝 × 访视 症状性 OA 复合定义的疼痛轴 症状标签与纵向结局
序列代码(如 DESS/IW-TSE) 分类 影像系列 MRI 序列标识 分割输入选择

§4.2 标签分布统计

队列层面:进展队列约 1,390 人(29%)、发病高危队列约 3,280 人(69%)、正常对照 122 人(2%),合计 4,796 人。这一构成意味着「基线症状性放射学 OA」的表观患病率被设计性放大,任何以全队统计疾病患病率的模型输出都不能外推到一般人群;正确的用法是以队列归属为分层变量,在各子队列内部估计发病/进展。膝级任务中,双膝独立评估使膝数约为人数的 2 倍,但同受试者双膝高度相关,统计检验与划分必须以人为单位聚类。其余如 KL 分布、WOMAC 基线均值等精确频数以官方读片评估文件为准(本条目不转载频数表,避免与当前发布版本漂移)。

§4.3 关键字段描述性统计

  • 年龄:入组 45-79 岁;性别:58% 女性;族裔:21% 少数族裔/非白人。
  • 访问密度:431,000+ 次临床与影像访问(人均约 90 次,含问卷与电话接触);影像访问集中在 00/12/24/36/48/72/96 个月(进展子队列另有 18/30 个月)。
  • 影像体量:约 26,626,000 张图像(X 光 + 3T MRI + 大腿 MRI + 手/髋 X 光)。
  • 保留率:48 个月 90%(临床到访 81%);约 7% 未参加追加随访,无接触率稳定于 15-18%。

描述性统计速查表:

维度 取值/规模 使用提示
年龄 45-79 岁(入组时) 无 45 岁以下样本,年轻 OA 人群不可用
性别 58% 女性 与 OA 流行病学一致,男性亚组仍超 2,000 人
族裔 21% 少数族裔/非白人 亚组分析报告区间而非点估计
队列构成 29% / 69% / 2% 患病率类结论禁止外推
访视跨度 00-96 个月(影像 7 个时点) 60/84 个月为结构空洞
人均访问 约 90 次(含问卷/电话) 「访问」≠「影像访问」,引用需注明
图像总量 约 26,626,000 张 含手/髋 X 光与大腿 MRI,非全为膝部

§4.4 数据层级关系(四级键体系)

OAI 的层级为「人(P_ID)→ 访视(月份)→ 膝(左/右)→ 影像系列/读片记录」。三个推论:(1) 任何跨表合并都应从 P_ID + 访视出发,再进入膝级;(2) 膝级样本量约为人数的 2 倍,但左右膝共享个体(人口学、遗传、生活方式),推断统计须按人聚类;(3) 影像文件与读片评估通过「受试者 + 访视 + 膝 + 序列」四元组对齐,缺失任一元组的对齐尝试都会产生静默错配。与 MIMIC-III 的三级「患者-住院-ICU」体系类比,OAI 多出的「膝」层级是其特有的泄漏与统计陷阱来源。

§4.5 缺失值情况与信息性缺失编码

  • 设计性缺失:60/84 个月无临床影像(仅问卷/电话);生物样本仅覆盖基线至 48 个月加 72 个月;MRI 半定量评分与手动分割仅覆盖子集。这些缺失是协议设计使然,应作为结构空洞建模而非插补。
  • 信息性脱落:随访无接触率 15-18%,脱落与健康状态相关;TKR 事件后纵向影像随访终止,功能分析需 pre-TKR 处理与多重插补(Øiestad 等 2016 的 MOST+OAI 方法是参考实现)。
  • 口径断层:入组 X 光为本地读片、随访为中心读片,基线与随访 KL 之间存在口径差异;跨访问合并分级时应优先使用中心统一读片结果。
  • 编码约定:临床数据集中缺失以 SAS/ASCII 的标准缺失码表示;每份数据集的格式文档列有取值范围与缺失码,载入后应先按字典恢复缺失语义再做统计。

§5 数据划分与使用建议

§5.1 官方数据划分

OAI 官方不提供机器学习意义的训练/验证/测试划分;官方「发布版本」仅按数据内容与时间组织(§3.0)。社区事实标准有二:IWOAI 2019 挑战赛提供的标准化 OAI 分割划分(按人口学平衡设计,随评估框架公开);以及各论文自行声明、以 OAI-ZIB 507 例为标签池的随机划分。复现分割论文时务必核对所用划分,否则 Dice 不可比。

「官方无划分」的正面解读:OAI 交付的是原始研究资源而非竞赛数据集,划分权留给使用者意味着任务定义自由——同一份影像既可支撑分割(用 OAI-ZIB 标签池),也可支撑进展预测(用纵向读片构造标签)。代价是每个团队都要自己承担划分纪律:凡以「人」为分组键、按队列分层、冻结划分并随代码发布的做法,都等价于自建了可复现的「官方划分」。

§5.2 推荐划分策略

  1. 以人为单位分组划分(GroupShuffleSplit / GroupKFold,groups = P_ID):杜绝同一受试者(及其双膝、跨访视影像)同时出现在训练与测试集。
  2. 队列分层:按 progression / incidence / non-exposed 分层,保持各子集队列构成一致;若任务为进展预测,可在进展队列内分层以稳定阳性率。
  3. 纵向外推验证:以访视切分(如训练 00-48M、测试 72-96M)评估时间外推能力,检测扫描仪老化与协议漂移。
  4. 膝级去重检查:划分后断言任意两个子集的 P_ID 集合交集为空。
# 分层分组划分:先按队列分层,再在人级分组,最后双膝去重断言
# 说明:OAI 的样本单位争议(人 vs 膝)必须以「人为分组键」终结——
#       双膝共享一人,膝级随机划分几乎必然把同一人的两膝分进两个子集
import pandas as pd
from sklearn.model_selection import StratifiedGroupKFold

# kl: 「人-访视-膝」长表,含 P_ID / cohort(队列) / label 列
sgkf = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
for fold, (tr, te) in enumerate(sgkf.split(kl, kl["label"], groups=kl["P_ID"])):
    tr_ids, te_ids = set(kl.iloc[tr]["P_ID"]), set(kl.iloc[te]["P_ID"])
    assert not (tr_ids & te_ids), f"fold {fold} 发生人级泄漏"
    # 检查各折队列构成是否稳定(进展/高危/对照比例)
    print(fold, kl.iloc[te]["cohort"].value_counts(normalize=True).round(3).to_dict())

§5.3 数据泄漏风险防御

OAI 特有的四种泄漏模式:(1) 双膝泄漏——左右膝来自同一人,膝级随机划分导致近重复样本跨集;(2) 纵向泄漏——同一膝 00M 与 48M 影像高度相似,按「影像」随机划分即泄漏;(3) 标签构造泄漏——进展标签由随访读片生成,若将随访读片衍生特征(如基线后 mJSW 变化)混入基线特征集即泄漏;(4) 衍生基准泄漏——OAI-ZIB 与自行下载影像可能重叠同一受试者,联合使用时未按 P_ID 去重。防御方法统一为「以人为唯一分组键 + 特征时间戳审计」。

§5.4 交叉验证建议

小样本标签任务(如 507 例分割、子集评分读片)建议 5 折 GroupKFold(按 P_ID),报每折均值 ± 标准差并冻结折划分随代码发布;纵向模型建议「按人 5 折 + 按时间外推」双评估。数据增强(翻转、随机裁剪、弹性形变)应在训练折内拟合,禁止以测试折统计量归一化。

# 时间外推评估:训练早期访视,测试晚期访视
# 说明:这是 OAI 特有的免费外推测试——扫描仪老化、协议漂移、人群老化
#       全部包含在「时间」这一个维度里,比随机划分更能暴露真实部署风险
train = kl[kl["visit_month"].isin([0, 12, 24, 36, 48])]   # 前 4 年
test  = kl[kl["visit_month"].isin([72, 96])]               # 6-8 年
# 注意:60/84 个月无影像访问,不要写进 im.isin 的候选清单
assert set(test["visit_month"]) <= {72, 96}
# 双评估口径:内部随机划分报告「理论性能」,时间外推报告「部署性能」,
# 两者差值即模型对纵向漂移的敏感度,应随论文一起报告

§5.5 外部验证

首选外部验证集为姊妹研究 MOST(3,026 人,Birmingham 与 Iowa City,84 个月 4 次访问):影像协议(SynaFlexer 固定屈曲位 X 光等)与读片体系(波士顿大学中心读片 + 仲裁)与 OAI 高度近似,历史上有大量 MOST+OAI 联合分析与互验先例(如功能轨迹研究、体力活动与 OA 发病研究)。影像分割任务可用 SKI10 与 IWOAI 后续纵向评估集(556 例、1,130 膝)做人群与扫描环境迁移检验。跨大洲/跨设备泛化评估应另行选择非美国队列,并在 §7.8 矩阵中报告性能衰减。

§5.6 划分与复现自检清单

任何 OAI 实验启动前,逐项打钩:

  • [ ] 划分以 P_ID 为分组键,双膝与跨访视影像未跨集;
  • [ ] 各子集的队列构成(29/69/2)已报告或已按任务重新分层;
  • [ ] 标签构造声明了终点类型(放射学/症状性/定量/TKR)与读片口径(中心);
  • [ ] 访视月份作为显式特征或分层变量,60/84 空窗未被静默插值;
  • [ ] 所用发布版本(NDA 下载日期 + 版本号)与衍生基准(OAI-ZIB/IWOAI)划分已记录;
  • [ ] 与衍生基准混用时已按 P_ID 去重并核对影像序列参数一致;
  • [ ] 评估按 P_ID 聚类/分组,置信区间不以膝为独立单位;
  • [ ] 内部划分指标与时间外推指标(训练 ≤48M / 测试 72/96M)分别报告。

§6 AI 就绪指南

§6.0 云端快速启动

在云端开始使用 OAI 的推荐路径:

# 云端环境准备(以 Linux + Python 3.11 为例)
# 1. 在 NDA 网站注册账户并登记 OAI 访问(免费,见 §6.2)
# 2. 选择实例规格:分割/定量任务建议 16 核 + 1 张 GPU + 500GB SSD;
#    仅临床表格任务 4 核 + 50GB 即可
# 3. 安装依赖(pandas 读 SAS 传输文件无需 SAS 环境)
pip install pandas pyreadstat pydicom nibabel matplotlib scikit-learn
# 云上数据组织建议:临床数据与影像分开挂载
# /data/oai/clinical/    <- SAS/ASCII 临床数据集(小,可全量)
# /data/oai/images/      <- DICOM 影像(大,按需分批下载)
# NDA 为注册用户提供云访问与下载工具链,具体配额以官方文档为准

§6.1 快速上手(本地 Python 版)

# 最小可用示例:读取一份 OAI 临床数据集(SAS 传输格式)并查看结构
# 说明:OAI 临床数据集以 SAS v7 transport (.xpt) 与 ASCII 双格式发布,
#       pandas 经 pyreadstat 即可直读,无需安装 SAS
import pandas as pd

df = pd.read_sas("AllClinical/allclinical00.xpt", format="xport")  # 基线临床表
print(df.shape)            # 行数 x 列数(每行一名受试者)
print(df.columns[:20])     # 列名即官方数据字典中的变量名
print(df["P_ID"].head())   # 受试者唯一标识(示例名,以当前发布为准)
# 队列归属与基本画像:三子队列构成是所有分析的第一张表
# 说明:cohort 变量区分 progression / incidence / non-exposed,
#       决定了后续一切分层与患病率校正
import pandas as pd

demo = pd.read_sas("Enrolment/participant.xpt", format="xport")
print(demo["cohort"].value_counts())            # 三子队列人数
print(demo["sex"].value_counts(normalize=True)) # 58% 女性(官方口径核对)
print(demo["age"].describe())                   # 45-79 岁

§6.2 数据获取流程

  1. 在 NDA 网站创建账户(免费),按官方教程登记 OAI 访问权限。
  2. 两条取数路径:(a) 查询路径——用 NDA 查询工具过滤再格式化的 OAI 临床与影像元数据,导出所需子集;(b) 批量路径——直接下载按数据家族组织的 SAS/ASCII 数据集与按时间点组织的影像 ZIP 包。
  3. 影像按 series 以 GZIP DICOM 打包,按「受试者 → 访视 → 序列」解包后由 pydicom/dcmstack 类工具读取。
  4. 生物样本(血清/血浆/尿/DNA)按官方流程单独申请,不随数据包发放。
  5. 官方 OAI Tutorials 页面提供「获取账户、下载 SAS/ASCII、获取影像、查询 NDA-OAI」四套教程;OAI CORE Knowledgebase 提供答疑与月度网络研讨会。

下载优先级建议(控制磁盘与时间成本):第一优先拉取临床数据家族(SAS/ASCII,小而全,支撑一切表格基线);第二优先按任务拉取影像——分割任务只要 DESS 序列对应访视(通常基线 + 48/72/96),X 光任务只拉 AllImages 读片结果对应的 DICOM 访视;第三优先再考虑全量镜像。每次下载完成后立即记录下载日期与文件清单哈希,作为版本锚定(坑点 8)的证据。

获取完成自查清单:

  • [ ] NDA 账户已注册并完成 OAI 访问登记(免费);
  • [ ] 已下载官方格式定义文档(每份临床数据集一份)与影像协议文档;
  • [ ] 临床数据家族(Enrolment/AllClinical/AllImages/Medication Inventory)齐套;
  • [ ] 影像下载范围与任务匹配(序列 × 访视矩阵已事先画好);
  • [ ] 下载日期、版本号、文件清单哈希已写入 manifest;
  • [ ] 生物样本需求已单独走 NIAMS 申请流程(如任务需要);
  • [ ] OAI CORE 教程与月度研讨会日程已收藏(首次使用强烈推荐)。

§6.3 预处理 Pipeline

# 步骤 1:构建「人-访视」纵向主表
# 说明:把各访问的临床表纵向拼接,加入访视月份列,形成长表;
#       OAI 的层级是 人(P_ID) -> 访视(月份) -> 膝(SIDE) -> 影像/读片
import pandas as pd

visits = {"allclinical00": 0, "allclinical12": 12, "allclinical24": 24,
          "allclinical36": 36, "allclinical48": 48,
          "allclinical72": 72, "allclinical96": 96}   # 60/84M 无临床影像
frames = []
for name, month in visits.items():
    d = pd.read_sas(f"AllClinical/{name}.xpt", format="xport")
    d["visit_month"] = month
    frames.append(d)
long_tbl = pd.concat(frames, ignore_index=True)
long_tbl = long_tbl.sort_values(["P_ID", "visit_month"])
# 步骤 2:合并膝级读片评估(KL 分级)并区分左右膝
# 说明:X 光读片文件按「受试者 + 访视 + 膝」组织;读双侧终末期排除等
#       入组规则已在招募阶段执行,此处直接用中心读片结果
xr = pd.read_sas("AllImages/knee_xr/kl_grades.xpt", format="xport")  # 示例名
kl = long_tbl.merge(xr, on=["P_ID", "visit_month"], how="left")
# 双膝各一行:MODEL 中 SIDE 必须作为样本单位的显式维度
# 步骤 3:构造进展/发病标签(严格按官方复合定义)
# 说明:症状性 OA = KL>=2(中心读片)+ WOMAC 疼痛>0(多数日子疼痛口径);
#       放射学进展 = KL 升级或 mJSW 超阈值下降;二选一并写进论文
kl["symptomatic_oa"] = ((kl["kl_grade"] >= 2) & (kl["womac_pain"] > 0)).astype(int)
# 进展标签示例:同一膝后续访问 KL 比基线升高 >=1 级
kl = kl.sort_values(["P_ID", "visit_month"])
kl["kl_baseline"] = kl.groupby(["P_ID", "side"])["kl_grade"].transform("first")
kl["progression"] = (kl["kl_grade"] > kl["kl_baseline"]).astype(int)
# 步骤 4:以人为单位的分组划分(防双膝与纵向泄漏)
# 说明:OAI 特有泄漏源是「双膝共享一人」与「同一膝跨访视」,
#       任何膝级/影像级随机划分都会泄漏,必须 GroupShuffleSplit
from sklearn.model_selection import GroupShuffleSplit

gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
groups = kl["P_ID"]
train_idx, test_idx = next(gss.split(kl, groups=groups))
train_df, test_df = kl.iloc[train_idx], kl.iloc[test_idx]
assert set(train_df["P_ID"]) & set(test_df["P_ID"]) == set()   # 零交集校验
# 步骤 5:DICOM 影像读取与 DESS 序列定位
# 说明:影像按 series GZIP 打包;3D DESS 水激发是软骨定量与分割的主序列,
#       目录名/序列描述以官方影像文档为准,读取时校验序列参数
import pydicom, gzip, pathlib

series_dir = pathlib.Path("images/9000000/00m/MRSSAG")     # 示例路径
dcm = pydicom.dcmread(gzip.open(sorted(series_dir.glob("*.gz"))[0]))
print(dcm.SeriesDescription, dcm.Rows, dcm.Columns)        # 校验为 DESS 类序列

§6.4 框架加载

# 选项 A:MONAI / PyTorch 3D 分割工作流对接 OAI-ZIB 基准
# 说明:OAI-ZIB 提供 507 例 160x384x384 体素与 0-4 标签(背景/股骨/股软骨/
#       胫骨/胫软骨),可用 nibabel 读取后直接接入 nnU-Net 或 MONAI
import nibabel as nib

img = nib.load("oai_zib/case_0000_image.nii.gz")
lbl = nib.load("oai_zib/case_0000_label.nii.gz")
print(img.shape, lbl.shape)   # (160, 384, 384) 量级,右膝基线 DESS
# 选项 B:纵向表格建模(scikit-learn / lifelines)
# 说明:以「人-访视」长表直接训练进展预测;时间-事件分析(TKR 预测)
#       用 lifelines 的 CoxPHFitter,以人为聚类单位做稳健标准误
from lifelines import CoxPHFitter

cph = CoxPHFitter()
cph.fit(train_df[["age", "sex", "bmi", "kl_baseline", "tkr_event", "months"]],
        duration_col="months", event_col="tkr_event",
        cluster_col="P_ID")          # 按人聚类,防双膝相关膨胀显著性

§6.5 常见坑点

⚠️ 坑点 1:发布版本错配——0.x.y 早期版与全量正式版不可混用(分类:工程陷阱)

问题:OAI 早期数据发布(如 clinical 0.1.1、image 0.B.1/1.B.1)仅覆盖部分受试者(0.B.1 只含 160 例进展队列便利样本),与全量正式版在覆盖范围上差异巨大。复现 2010 年前后论文时用全量版会对不上样本量,反之亦然。

症状:样本量与论文对不上;「官方明明说全队列都有」但某表只有几百人;早期论文的基线率无法重算。

解决:复现前先读论文方法节的数据版本声明,锁定对应 0.x.y 版本(NDA 归档保留历史发布);新项目一律用当前正式版并在论文中记录下载日期与版本号。

参考:Eckstein 等 2014 综述对早期/全量发布历史的梳理;PMC2734969(显式使用 clinical 0.1.1 与 image 0.B.1/1.B.1 的范例)。

⚠️ 坑点 2:双膝与 index-knee 选择偏差——膝级样本不是独立样本(分类:统计陷阱)

问题:OAI 双膝独立评估,膝数约为人数的 2 倍;但左右膝共享同一人的遗传、代谢与行为因素。许多经典研究只分析「index knee」(按症状与分级规则挑选一膝),直接把公开研究集的膝级样本当作独立样本合并统计,会低估标准误并产生不可比的样本构成。

症状:统计显著性虚高;把自己的全膝结果与论文的 index-knee 结果对比时基线分布对不上;膝级随机划分模型测试分数虚高。

解决:推断统计按 P_ID 聚类(稳健标准误/混合效应模型);建模划分以人为组(§6.3 步骤 4);与文献对比时先确认其用双膝还是 index knee,并复刻其选膝规则。

参考:PMC2771759(index knee 选择规则全流程);Øiestad 等 2016(MOST+OAI 联合分析中的膝级处理)。

⚠️ 坑点 3:60/84 个月影像断层——「年度随访」不等于「每年都有影像」(分类:预处理陷阱)

问题:OAI 的年度随访在 60 与 84 个月为问卷/电话,无临床影像与生物样本;含影像的访问是 00/12/24/36/48/72/96 个月(进展子队列另有 18/30 个月)。把随访当成「每年一张影像」做时间序列插值,会在两个空洞处产生系统性伪影。

症状:插值出的 60/84 个月软骨指标违反生物演化逻辑;纵向模型在这两个时间点的预测误差显著升高;按「访问序号」而非「月份数」对齐时 72 个月被误当第 6 次年度访问。

解决:一律以「距基线月数」为时间轴;纵向建模把 60/84 设为缺失而非插值;需要每年影像的研究改用「影像访问序列」定义时间窗(0-48M 连续、72M、96M 三段),并在论文中画访视-时间轴图。

参考:NIAMS OAI 官方页面的访问计划表;OAI Tutorials 访视结构说明。

⚠️ 坑点 4:本地读片 vs 中心读片——基线 KL 两套口径(分类:标签理解)

问题:入组阶段 X 光由各中心本地读片(用于队列划分与双侧终末期排除),基线与随访影像随后统一由中心盲法读片。两套读片的 KL/OARSI 判读存在差异,直接把「招募用的本地读片」与「随访的中心读片」放进同一序列计算进展,会混入读片口径跳变。

症状:基线后第一次随访 KL 「下降」的假性改善;进展率在 12 个月点异常高;不同中心子集的基线分布有系统差。

解决:进展/发病标签一律基于中心统一读片结果;如需使用本地读片(如复现入组规则),显式声明并只用于队列划分;将「读片来源」作为敏感性分析变量。

参考:NIH NOSI NOT-AR-24-019 对「本地读片入组、后续中心读片」的描述;MOST+OAI 联合研究的双读 + 仲裁流程。

⚠️ 坑点 5:进展队列过采样——患病率与阳性率不能外推(分类:评估误用)

问题:队列设计性过采样:29% 进展队列(症状性放射学 OA)、69% 高危、2% 正常对照。在全队列上训练疾病分类器后报告「准确率」,或把模型输出当患病率解释,都是口径错误。

症状:分类器阳性率远高于真实人群;跨论文比较 AUROC 时因阳性率不同而不可比;审稿意见直接质疑外推效度。

解决:报告敏感度/特异度/AUROC 而非准确率,并注明验证集队列构成;按子队列分层评估;如需人群患病率口径,用发病率队列或做重要性加权校正,并引用官方队列构成(29%/69%/2%)。

参考:NOSI NOT-AR-24-019 队列构成表;§7.1 偏倚清单。

⚠️ 坑点 6:TKR 截断与信息性脱落——纵向终点静默缺失(分类:评估误用)

问题:接受全膝置换后受试者的影像随访终止,且 TKR 与病情恶化强相关(信息性缺失)。把 TKR 后当「普通失访」处理会低估晚期进展率;把 TKR 前最后一次观测当随机缺失插补会低估恶化速度。

症状:长时程进展曲线在 72-96 个月被人为压平;Cox 模型中 TKR 事件处理不一致导致与文献效应量不可比;功能轨迹研究显示「稳定」而真实趋势为恶化。

解决:把 TKR 作为硬终点建模(生存分析)或作为删失事件显式处理;功能分析采用 pre-TKR 值估计 + 多重插补(Øiestad 等 2016 的 MOST+OAI 标准做法);报告各时间点风险人数表。

参考:Øiestad 等 2016(doi:10.1002/acr.22674)。

⚠️ 坑点 7:半定量评分与分割标注只覆盖子集——监督信号比影像稀疏得多(分类:标签理解)

问题:WORMS/BLOKS/MOAKS 读片、定量软骨形态与 OAI-ZIB 507 例手动分割都是子集级标注,且 OAI-ZIB 仅覆盖右膝基线 3D DESS。把「全队列影像」默认为「全队列有标签」来设计监督学习方案,会在数据准备阶段卡死或静默缩小样本。

症状:训练集远小于预期;左膝影像找不到分割标签;不同论文的「OAI 分割数据集」规模对不上(507 例 vs 88 例追加软骨标注 vs IWOAI 划分)。

解决:先在官方评估文件中盘点目标标注的可用子集与膝别/访视覆盖,再定任务规模;需要更大标注量时用 IWOAI 2019 标准化划分或半监督/自监督预训练 + 少量标签微调;引用衍生集时回溯 OAI 并遵守其引用要求。

参考:OAI-ZIB(Ambellan 等,MIA);Desai 等 2021(IWOAI 2019,标准化划分)。

⚠️ 坑点 8:影像组织与下载工程——series 级 GZIP 与深层目录(分类:工程陷阱)

问题:影像按「受试者 → 访视 → 序列」深层目录组织,DICOM 按 series 以 GZIP 打包;全队列近 2,662 万张图像。新手按「受试者文件夹整体下载」会在磁盘与带宽上双双碰壁,且解包后的序列命名与读片评估文件的序列代码对不上。

症状:磁盘写满、断点续传混乱;读片表里「DESS」与目录名对不上号;批量读取时因部分序列缺失(子集采集)而中断。

解决:按「访视 × 序列」需求清单分批下载,用官方影像文档建立「序列代码 ↔ 读片评估列」映射表;解包后以清单文件记录 已下载/缺失/校验和;管道中对缺失序列显式跳过并记录,禁止静默跳读。

参考:OAI Tutorials「Getting OAI Images」;NDA 下载管理工具文档。

§6.6 数据增强

分割与定量任务推荐:随机 3D 翻转(注意左右膝别标签与侧别校验)、随机平移/旋转(小角度,保持膝关节解剖合理性)、随机裁剪与重采样到统一体素间距、弹性形变与灰度抖动(模拟轻度运动伪影与对比差异)。X 光任务推荐随机平移/缩放与对比度抖动。所有增强仅在训练折内拟合;左右翻转增强必须与「左/右膝」元数据联动翻转,否则引入侧别标签错误。纵向多时点输入可加「访视顺序打乱」作为正则化手段(仅限非进展任务)。

# OAI 分割任务增强清单(MONAI 风格伪代码,标注了膝部特有约束)
from monai.transforms import (
    Compose, RandFlipd, RandAffined, RandAdjustContrastd, RandCropByPosNegLabeld,
)

train_tf = Compose([
    # 侧别联动翻转:OAI-ZIB 提供右膝基线,全队列含双膝——
    # 翻转后必须同步交换 SIDE 元数据,或将「左膝」预镜像到右膝坐标系
    RandFlipd(keys=["image", "label"], spatial_axis=1, prob=0.5),
    # 小角度仿射:膝为承重关节,大角度旋转产生不存在的解剖形态
    RandAffined(keys=["image", "label"], rotate_range=(0.1, 0.1, 0.1),
                translate_range=(10, 10, 10), prob=0.8),
    # 灰度抖动:模拟轻度运动伪影与跨访视对比差异(phantom 质控已压低大漂移)
    RandAdjustContrastd(keys=["image"], gamma=(0.9, 1.1), prob=0.3),
    # 以软骨/骨前景为中心裁剪,统一到 160x384x384(OAI-ZIB 网格口径)
    RandCropByPosNegLabeld(keys=["image", "label"], label_key="label",
                           spatial_size=(160, 384, 384), pos=1, neg=0),
])
# 禁用清单:3D 中的大幅弹性形变(软骨厚度是毫米级目标,形变会破坏标签)、
#           任何改变体素各向异性的重采样(DESS 层厚/层内分辨率不对称)

§6.7 模型推荐

  • 骨/软骨分割:nnU-Net(自配置 3D U-Net 系)是当前默认起点;IWOAI 2019 参赛网络与 SSM+CNN 混合方法(Ambellan 等)为已验证基线,集成投票可进一步稳定 Dice。
  • 放射学分级/进展:卷积骨干(ResNet/DenseNet 系)+ 序数回归头适配 KL 0-4;进展预测建议加入基线临床特征与队列归属的混合模型。
  • 半定量评分回归:多任务输出头(各组织特征分别回归/分类),子集标注下优于单任务模型。
  • 纵向多模态:以「人-访视」长表驱动的时序模型(GRU/Transformer)或联合影像潜变量 + 临床变量的多模态融合;以 P_ID 为分组单位做评估。
  • 自监督预训练:全队列无标签影像体量大,MAE/DINO 类自监督预训练 + 子集标签微调是应对「标注稀疏」的合理路径。

任务-模型-起点配置速查:

任务 推荐起点 输入口径 首选评估 已验证参照
骨/软骨分割 nnU-Net 3D 全配置 3D DESS,160×384×384 按组织 Dice + 厚度 IWOAI 2019 Dice 0.95-0.96 区间
分割稳健化 nnU-Net 集成 + SSM 形状后处理 同上 亚体素表面误差 Ambellan 等(MIA)
KL 分级 ResNet/DenseNet + 序数回归 PA 固定屈曲位膝片 加权 Kappa / MAE 无官方排行,自建基线
进展/发病预测 影像骨干 + 临床特征混合 基线影像 + AllClinical AUROC + 校准 MOST 外部验证
TKR 预测 Cox / 离散时间生存模型 纵向长表 + 影像评分 C-index / 时间 AUROC lifelines 实现
评分替代 多任务回归头 WORMS/BLOKS/MOAKS 子集 加权 Kappa + ICC 子集规模约束

§6.8 计算资源需求

临床表格建模:任意笔记本即可。膝 MRI 3D 分割:单张 12-24GB 显存 GPU 可跑 nnU-Net 标准配置;507 例 OAI-ZIB 规模训练 1-2 天量级。全队列影像衍生计算(软骨定量、自监督预训练)建议多 GPU 或云端弹性资源,并按 §6.5 坑点 8 的分批策略管理磁盘(TB 级规划)。每月 phantom 质控意味着跨中心数据分布相对同质,训练期不需要按中心做大规模域适应,但跨到 OAI 外部数据集时仍需完整外部验证。

工作负载 数据规模 建议配置 预期量级
临床表格探索/画像 SAS/ASCII 全量(GB 级) 4 核 / 16GB 内存笔记本 分钟级
OAI-ZIB 分割训练 507 例 3D 体素 1×12-24GB GPU + 500GB SSD 1-2 天
IWOAI 划分复现评测 标准化划分 + 公开框架 同上 + CPU 并行评估 小时级
全队列 DESS 预处理 数千访视 × DESS 序列 16 核 + 多 GPU 流水线 天级(分批)
自监督预训练 全队列影像(TB 级磁盘) 4-8×GPU + 分批数据加载 周级
纵向表格建模 「人-访视」长表 笔记本 + 8GB 内存 分钟级

§6.9 评估指标

# 分割任务:Dice 系数(按组织分别报告)+ 软骨厚度误差
# 说明:IWOAI 2019 框架同时报告 Dice 与厚度指标;经验表明 Dice 接近的
#       模型在厚度误差上可能分化,二者都报
import numpy as np

def dice(y_true, y_pred, k):
    t, p = (y_true == k), (y_pred == k)
    return 2 * (t & p).sum() / max(t.sum() + p.sum(), 1)
# 进展/发病预测:AUROC + 敏感度/特异度(固定工作点)+ 校准曲线
# 说明:队列构成被设计性过采样(29/69/2),必须避开 accuracy,
#       并按子队列分层报告;以 P_ID 为分组单位做 Bootstrap 置信区间
from sklearn.metrics import roc_auc_score, confusion_matrix

auc = roc_auc_score(y_test, y_prob)              # 测试集 AUROC
tn, fp, fn, tp = confusion_matrix(y_test, (y_prob >= 0.5).astype(int)).ravel()

定量软骨任务以标准响应均值(SRM)衡量纵向测量灵敏度——IWOAI 后续评估中顶级深度学习方法在胫骨外侧间室达到 SRM 0.38、高于人工金标准的 0.34,可作为方法学灵敏度的参照点;半定量评分任务报加权 Kappa(序数)与组内相关系数。

§6.10 MLOps 笔记

  • 数据版本锚定:记录 NDA 下载日期、发布版本号与衍生基准(OAI-ZIB/IWOAI)的具体划分哈希;OAI 持续更新,无版本锚定的复现不可信。
  • 标签口径入仓库:把进展/发病的复合定义实现为带单元测试的纯函数(§6.3 步骤 3),与论文定义一一对应。
  • 访视结构常量化:影像访问月份数(0-48 连续、72、96)作为共享常量,避免 60/84 断层被静默插值。
  • 外部验证流水线:预留 MOST/SKI10 的加载接口与特征对齐测试,模型注册表中记录内部与外部指标。
  • PII 边界:公开数据已脱敏,但自产衍生标注(如读片截图)不得回填可识别信息;引用社区分享的受试者级结果表时核对去标识化状态。

推荐的最小 MLOps 骨架(适合 3-5 人团队起步):数据层一个 oai_manifest.yaml(下载日期、版本、文件哈希、队列计数断言);特征层一个纯函数库(复合标签、访视常量、四级键校验,全部带单元测试);实验层一个运行配置模板(划分种子、折哈希、环境锁文件);评估层强制输出「内部划分 + 时间外推 + MOST」三列指标表。仅此四件套即可让任何后续复现者在一小时内核对数据的完整血统。


§7 质量评估与局限性

§7.1 已知偏倚

偏倚 来源 对 AI 的影响 缓解
危险因素过采样 69% 发病高危 + 29% 进展队列设计 患病率、阳性率、基线分布不可外推 按子队列分层;加权校正
年龄与性别构成 45-79 岁、58% 女性 模型在年轻人群与男性为主人群中泛化未验证 外部验证时报告亚组性能
族裔构成 21% 少数族裔,四城市样本 跨族裔公平性证据有限 公平性评估 + 谨慎外推
幸存者/保留偏倚 48 个月保留 90%,无接触 15-18% 脱落与健康相关,晚期随访低估恶化 信息性缺失建模、敏感性分析
TKR 截断 置换后影像随访终止 晚期进展被删失 TKR 作硬终点/显式删失
读片口径断层 本地读片入组 vs 中心读片随访 基线-随访分级比较混入口径跳变 统一用中心读片构造标签

§7.2 标注质量评估

OAI 标签的可靠性来源有三:中心盲法读片 + 双读/仲裁机制(KL、OARSI、mJSW);评分体系本身有发表的信度研究(WORMS、BLOKS 及其 OAI 子队列头对头比较,进而催生 MOAKS);OAI-ZIB 手动分割由经验分析师修订模型辅助结果并接受监督。需要注意的质量边界:MRI 半定量评分与分割标注为子集覆盖(坑点 7);mJSW 等定量指标对摆位标准化敏感(SynaFlexer 架即为控制这一方差而设);不同评估文件的读片人员与协议以官方文档记录为准。总体而言,OAI 的标签质量属于队列研究的第一梯队,但其「广度」与「密度」呈反比——覆盖越广的标签,粒度越粗。

落地到 AI 标签验收,建议三级抽检:(1) 一致性层——对同规格读片文件,核对 KL 与 OARSI 骨赘分级的联合分布是否出现系统性矛盾(如 KL 0 但骨赘 3 级的行需回查读片版本);(2) 纵向合理性层——同一膝的 KL 轨迹出现非单调跳变(降级 ≥1 级)时,标记为读片噪声或摆位差异候选,勿直接当作进展标签的负样本;(3) 衍生基准对齐层——将自行下载影像与 OAI-ZIB 507 例的交集受试者做体素级对照,确认序列参数一致后再混用标签。

§7.3 泛化性讨论

OAI 为社区人群队列(非单中心转诊),且四中心设备同型号、每月 phantom 质控,使「OAI 内部跨中心泛化」相对容易;真正的泛化挑战在 OAI 之外:(1) 向不同扫描仪/序列(其他厂家、不同场强)迁移;(2) 向不同年龄段(OAI 最低 45 岁)与其他关节迁移;(3) 向不同医疗体系人群迁移。IWOAI 2019 挑战的跨机构评估与 Dam 等 2023 的纵向盲评表明:标准化 OAI 内部训练的深度分割在同类单扫描仪纵向试验中可用,但泛化声明必须落在具体外部数据集上。涉及一般人群患病率解释的研究应直接改用设计为代表性抽样的数据源。

分层泛化验证设计(由易到难):第一层,OAI 内部四中心留一(Leave-One-Site-Out)——验证中心残余差异;第二层,时间外推(训练 ≤48M、测试 72/96M)——验证纵向漂移;第三层,MOST 外部验证——验证协议近似但独立的队列;第四层,SKI10 或非美国队列——验证跨人群与跨环境的真实部署差距。每一层的性能衰减都应单独报告,合并成单一「泛化分数」没有意义。

§7.4 伦理考量

OAI 经各临床中心 IRB 批准,全部受试者签署知情同意;数据经 HIPAA 合规去标识后公开发布,直接标识符移除;生物样本使用需单独申请并受额外政策约束。二次使用要求:注册 NDA 账户并遵守数据使用政策;在论文中引用数据资源与官方要求;不得尝试重识别。2025 年起 NIH 对受控访问数据的政策持续收紧(含 DUC 指南更新与受关注国家访问限制),跨国团队在使用前应核实最新合规要求(§9)。

团队合规自查清单:(1) 数据访问账户登记人与实际使用团队一致,访问权限不转借;(2) 衍生数据集(嵌入、特征、预测分数)继续按去标识化要求管理,不得回填任何直接标识符;(3) 生物样本衍生的基因组类结果确认是否落入受控数据范围;(4) 跨国部署前核实 NIH 受控访问政策与所在司法辖区约束(含 EO 14117 后的受关注国家限制);(5) 论文与产品文案中的引用注明官方数据资源与 NCT 注册号(NCT00080171)。

§7.5 公平性评估

建议按以下切面对模型做公平性审计:性别(58% 女性,OA 流行病学上女性负担更重,需检查模型在男性中的校准)、年龄段(45-79 分层,尤其高龄段进展更快导致的混淆)、族裔(21% 少数族裔,子集样本量有限,报告不确定性而非点估计)、临床中心(四中心分层验证设备/流程残余差异)、队列归属(进展/高危/对照,防止模型学到队列捷径特征)。OAI 未以公平性审计为目的设计采样,因此任何公平性结论都应标注「观察性、受样本量约束」。

最小公平性报告模板(纵向预测任务):按上述五个切面分别报告 AUROC 与校准斜率,附各切面样本量与置信区间;切面间性能差超过 0.05 AUROC 时,回到 §7.1 偏倚表寻找结构性解释(如进展队列排除双膝重度狭窄对晚期患者的系统性排除),而非直接调参修补。

§7.6 数据漂移提示

纵向跨度十年以上,三类漂移值得监控:扫描仪硬件老化与升级(phantom 质控缓解但仍需按月份漂移检验);读片协议与评分体系演进(WORMS→BLOKS→MOAKS);临床随访从临床访问降级为问卷/电话(60/84 个月)造成的测量频率漂移。建议在纵向模型中加入访视月份与中心的固定效应做敏感性分析,并对 72/96 个月预测单独报告。

实操监控建议:(1) 以每月 phantom 影像的定量特征(信噪比、对比度)为「设备漂移哨兵」,先于患者数据发现硬件漂移;(2) 以「同批受试者相邻访视 mJSW 变化分布」为测量方差指标——该分布在无进展人群中应近似零中心,右尾变宽往往提示摆位/读片方差增大而非真实进展;(3) 对 2015-01-01(全队列计划访问完成)前后的衍生分析结果做断点对照,区分「数据采集期」与「NDA 托管增量发布期」的口径变化。

§7.7 DAIMS 24 项数据就绪度评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) ✅ 临床表按「受试者×访问」、读片按「膝×访问」组织
2 有唯一标识符列 ✅ P_ID + 访视月份 + SIDE 四级键
3 无 Unicode 或特殊字符 ⚠️ SAS/ASCII 主体规范;个别文本字段需按字典清洗
4 无重复行 ⚠️ 纵向长表拼接时易产生跨版本重复,需按版本去重
5 缺失值已识别并编码 ✅ 每份数据集配格式文档,缺失码明确
6 标签列被明确标识 ⚠️ 无单一「标签列」;进展/发病为复合定义需自行构造
7 已对罕见类别(<3%)进行分组 ⚠️ 评分与分级类别的低频段需自行归组
8 偏倚评估已完成 ✅ §7.1 六类偏倚与缓解措施
9 有完整的数据字典 ✅ 官方格式定义文档 + OAI Tutorials + OAI CORE
10 对「信息性缺失」有明确编码解释 ✅ §4.5 设计性缺失/信息性脱落/TKR 截断分类
11 数据采集设备和设置已记录 ✅ 四中心同型号 Siemens Trio 3T + SynaFlexer,协议文档完整
12 已移除完全共线性变量 ⚠️ 发布数据保留全部原始列,需自行筛查
13 对编码的映射标准已说明 ✅ KL/OARSI/WORMS/BLOKS/MOAKS 口径均有协议文档
14 对时间戳的处理已明确说明 ⚠️ 以距基线月数组织;精确日期粒度有限,60/84 月为结构空洞
15 训练/验证/测试划分建议已给出 ❌ 官方无 ML 划分;IWOAI 2019 标准化划分仅覆盖分割子任务
16 数据泄漏风险已被讨论 ✅ §5.3 四种 OAI 特有泄漏模式
17 标签分布已被分析 ✅ §4.2 队列构成与膝级口径
18 选择性测量偏倚已被讨论 ✅ §4.5 + §6.5 坑点
19 外部验证建议已给出 ✅ §5.5 MOST / SKI10 / IWOAI 纵向评估
20 数据更新和版本信息已记录 ✅ 发布版本史完整(0.x.y → 全量 → NDA 永久归档)
21 最小必要预处理脚本已提供 ⚠️ 无官方派生概念层;OAI CORE 提供教程,社区工具补位
22 合规使用要求已明确 ✅ NDA 注册 + 数据使用政策;生物样本单独申请
23 多模态对齐方法已说明 ⚠️ 同访问内影像-临床-样本天然对齐;跨模态时间窗需自定义
24 去标识化方法已被记录 ✅ HIPAA 合规公开、直接标识符移除、DICOM 脱敏

DAIMS 评分:19 / 24

评分解读:良好偏上——免费开放、设备与协议文档化程度高、四级键体系清晰、真实随访时间轴无日期偏移,是纵向队列中工程可用性最好的范例;扣分集中在标签密度(子集标注、无单一标签列)与官方 ML 划分缺失。

对你意味着什么:OAI 的 15 个 ✅ 项几乎全部来自其「队列研究基础设施」属性——四级键、官方数据字典、设备与质控记录、HIPAA 级去标识化与持续版本管理。作为使用者,你获得的开箱即用部分是「临床表格 + 影像归档 + 子集金标准」;需要自己承担的部分是「复合标签构造、以人为单位的划分、子集标注的规模规划」。与 MIMIC-III(18.5/24)相比,OAI 在时间戳与设备记录上更干净(无日期偏移、单型设备),在标签列明确性上反而更弱——这决定了它是「建模成本中等、标签工程成本中高」的纵向资源,而非即插即用的基准集。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部测试集变化 关键发现
MOST(3,026 人) 波士顿大学主导,Birmingham + Iowa City OA 发病/进展、功能轨迹(WOMAC、体测) OR/AUROC + 混合效应模型 协议近似,衰减小 与 OAI 联合分析的经典组合:SynaFlexer X 光与波士顿中心读片同源,是最贴近的独立验证集
MOST(联合队列) 同上 体力活动与 OA 发病 OR(调整后) 非 AUROC 任务 MOST 30 个月 + OAI 48 个月随访合并分析,检验危险因素效应的一致性
IWOAI 2019 纵向评估集(556 例、1,130 膝) OAI 子集,跨机构盲评 软骨分割纵向灵敏度 SRM(胫骨外侧 DL 0.38 vs 人工 0.34) 盲评口径 顶级深度学习分割的纵向灵敏度达到并局部超过人工金标准
SKI10 挑战数据 独立人群与扫描环境 膝骨/软骨分割 Dice 跨数据集下降 用于检验「OAI 单型设备内训练」向异质环境的泛化

OAI 在 2026 年还值得用吗? 值得——而且不可替代。它仍是膝 OA 纵向多模态 AI 的默认基础设施:免费、协议同质、随访超 96 个月、官方支持体系(OAI CORE + NOSI)持续投入。它的角色不是「大标注分割集」(那是 OAI-ZIB/IWOAI 的分工),而是「疾病进展科学的数据底座」。需要全新标注密度或跨关节泛化时,把 OAI 当验证锚点而非唯一来源即可。


§8 基准性能与生态

§8.1 排行榜(IWOAI 2019 膝 MRI 分割挑战)

OAI 生态中最接近「官方排行榜」的是 International Workshop on Osteoarthritis Imaging(IWOAI)2019 膝软骨分割挑战赛:组织方将 OAI 分割数据标准化(平衡人口学的划分、统一评估框架),6 支队伍提交深度学习分割方法,在胫骨、股骨、髌骨软骨与半月板上统一评测(Desai 等 2021,The International Workshop on Osteoarthritis Imaging Knee MRI Segmentation Challenge,Radiology: Artificial Intelligence)。公开的核心结果:

指标 结果 出处口径
参赛队伍 6 支 全部为深度学习方法
队间分割 Dice 相关 软骨(股/胫/髌)与半月板 0.95-0.96 最优真阳性/真阴性 ensemble 之间
组织覆盖 软骨 + 半月板 标准化 OAI 划分
系统性误差区 髁间切迹与内侧间室 所有网络共同的失败区域,与 OA 好发部位重叠
纵向灵敏度(后续评估) 胫骨外侧 SRM 0.38(人工金标准 0.34) Dam 等 2023,556 例/1,130 膝/9,040 个分割
历史参照 SSM+CNN 混合方法在 OAI-ZIB 507 例达亚体素精度、SKI10 上达到人工读片间差异水平 Ambellan 等(MIA)

不可直接比较说明:上表混合了不同划分、不同标签版本(OAI-ZIB 507 例 vs IWOAI 标准化划分 vs 556 例纵向评估)与不同任务口径(静态 Dice vs 纵向 SRM)。任何两个数字都不构成同一坐标系下的排名;比较前必须核对划分哈希、标签版本与评估脚本。髁间切迹与内侧间室的系统性误差提示: Dice 整体分数接近时,进展相关亚区(内侧间室)的表现可能显著分化,做进展任务前应先做亚区误差审计。

§8.2 SOTA 总结与选型建议

  • 分割:nnU-Net 类自配置 3D U-Net 是 2026 年的默认起点;在 OAI-ZIB 507 例上其性能已进入人工读片间差异区间。追求更强稳健性可用网络集成(投票/平均)与形状先验(SSM 后处理)。
  • 进展预测:无统一排行榜;建议自建基线(影像骨干 + 临床特征混合模型),并在 MOST 上做外部验证;解读时区分「放射学进展」「症状性发病」「TKR」三种终点。
  • 半定量评分替代:多任务回归 + 子集标注,评估用加权 Kappa;可作为读片预算受限时的筛查层。
  • 务实路线:自监督预训练(全队列影像)→ OAI-ZIB/IWOAI 标签微调 → MOST 外部验证 → 纵向 SRM 报告。这条链路全部免费且可复现。

按目标选择路线:

你的目标 推荐路线 对应资源 参照基准
发分割方法论文 nnU-Net 基线 → 结构创新 → IWOAI 框架评测 OAI-ZIB + IWOAI 划分 Dice 0.95-0.96、亚区误差审计
发纵向定量论文 分割 → 厚度流水线 → SRM 报告 Dam 2023 协议与公开分割 SRM 0.38(胫骨外侧)
做进展预测产品原型 表格基线 → 影像融合 → MOST 外验 AllClinical + AllImages 内部/外推双报告
做多模态方法研究 公开影像定量 + 临床 + (申请)样本 FNIH 项目结果先行 子集口径,勿全队列声明
教学演示 OAI-ZIB 单膝小数据起步 507 例体素数据 一天内可跑通端到端

§8.3 官方评测协议

OAI 本身无官方 ML 评测协议;社区事实标准为 IWOAI 2019 评估框架(标准化划分 + Dice 与厚度双指标 + 公开脚本)。纵向定量任务的公认灵敏度指标为 SRM(标准响应均值),见 Dam 等 2023 的实现。自行评测时应:冻结划分与随机种子;按组织/间室分别报告;报告以 P_ID 为单位的置信区间;公开预处理与评估代码。

数据集 关系 用途
MOST 姊妹队列(3,026 人,84 个月) 外部验证、联合分析
OAI-ZIB OAI 衍生分割基准(507 例) 分割训练与评测
IWOAI 2019 数据 OAI 标准化划分 分割对比与复现
OAI AKOA OAI 衍生「加速 OA」子集(48 例 MR,24 人两时点) 进展亚型研究
SKI10 独立膝分割挑战数据 跨人群泛化
MIMIC-III / eICU 等临床数据库 不同模态(EHR vs 影像队列) 多数据集方法学互验

§8.5 关键论文 Top 10

  1. Peterfy 等 2008,Osteoarthritis and Cartilage——膝部 MRI 协议设计依据(5 序列遴选与 75 分钟约束)。
  2. Eckstein、Kwoh、Link 2014,Annals of the Rheumatic Diseases——OAI 影像研究十年综述(队列结构、协议、成果与教训)。
  3. PLoS ONE 2019 队列 profile 论文(doi:10.1371/journal.pone.0219902)——队列与数据资源的标准引用。
  4. Ambellan 等 2019,Medical Image Analysis——SSM+CNN 膝骨/软骨分割,公开 507 例手动参考分割(OAI-ZIB)。
  5. Desai 等 2021,Radiology: Artificial Intelligence——IWOAI 2019 挑战赛多机构评估与标准化划分。
  6. Dam 等 2023,Osteoarthritis and Cartilage Imaging——IWOAI 方法的纵向软骨定量评估(9,040 个分割公开)。
  7. Øiestad 等 2016,Arthritis Care & Research——MOST+OAI 症状性 OA 功能轨迹(TKR/缺失处理范本)。
  8. Felson 等 2013,Osteoarthritis and Cartilage——MOST+OAI 体力活动与 OA 发病(联合队列分析范例)。
  9. NIH NOSI NOT-AR-24-019(2024)——NIAMS/NIA 对 OAI 资源研究的官方动员与资源描述。
  10. OAI CORE Knowledgebase(oaiknowledgebase.com)——官方支持的教程、答疑与方法学知识库(R24 资助)。

§8.6 社区活跃度

截至 2016-03 的官方统计:4,114 名注册用户、90 余个国家、30,260+ 次数据集下载、507 套影像集分发;NDA 归档统计基于 OAI 的论文超过 400 篇。当前活跃通道:OAI CORE Knowledgebase(教程与每周一对一答疑)、月度网络研讨会、NDA 帮助台。NIH 以 NOSI(2024-2025)持续鼓励新课题使用 OAI,学术社区的新方法论文(分割、进展预测、多模态融合)仍以 OAI 为默认评测场。

判断一个队列数据集「社区是否还活着」,OAI 提供了教科书式的信号组合:官方 NOSI 动员(2024-08)、常设知识库与答疑(R24 资助)、持续的新增分析结果季度发布、以及 IWOAI 系列带来的标准化评测遗产。对担心「数据集弃坑」的团队,这些信号表明 OAI 的维护等级显著高于一般结题归档数据集——它是 NIH 明确保养并向社区推荐的活性公共研究资源。

§8.7 生态快照

典型工作流(2026 年视角):NDA 注册 → 拉取临床表格与影像元数据 → OAI-ZIB/IWOAI 分割基线 → 全队列自监督预训练 → 进展预测 + MOST 外部验证。工具层:pandas/pyreadstat(表格)、pydicom/nibabel(影像)、MONAI/nnU-Net(分割)、lifelines(生存分析)。支持层:官方数据字典、OAI Tutorials 四件套、OAI CORE 答疑、NDA 下载与云访问工具。基线层:OAI-ZIB(亚体素精度)、IWOAI 2019(Dice 0.95-0.96 区间)、SRM 参照(0.38)。这一多层生态意味着新团队可以在一周内完成从注册到首个分割基线的全流程,而无任何许可摩擦。


§9 相关资源与引用

§9.1 官方资源入口

  • NDA-OAI 永久归档(官方主页与下载):/oai/391
  • 官方教程(账户/表格/影像/查询四件套):/oai/391
  • OAI CORE Knowledgebase(答疑与教程中心):/oai/391
  • NIAMS 项目页(研究概述与资助信息):/oai/391
  • ClinicalTrials.gov 注册页(NCT00080171):/oai/391
  • NIH NOSI NOT-AR-24-019(2024):/oai/391
  • 生物样本申请(Biospecimens Access Policy):/oai/391

§9.2 数据引用格式

使用 OAI 时应同时引用:(1) 数据资源本身(经 NDA 获取的 OAI 永久归档);(2) 协议/设计论文(Peterfy 等 2008 的 MRI 协议报告与 PLoS ONE 2019 队列 profile 论文);(3) 所用衍生基准的原始论文(如 OAI-ZIB 引 Ambellan 等 2019,IWOAI 评测引 Desai 等 2021)。BibTeX 示例:

@article{peterfy2008oai,
  title   = {The osteoarthritis initiative: report on the design rationale
             for the magnetic resonance imaging protocol for the knee},
  author  = {Peterfy, Charles G and others},
  journal = {Osteoarthritis and Cartilage},
  year    = {2008},
  doi     = {10.1016/j.joca.2008.08.026}
}

@article{oai2019profile,
  title   = {Cohort profile: the Osteoarthritis Initiative},
  journal = {PLoS ONE},
  year    = {2019},
  doi     = {10.1371/journal.pone.0219902}
}

§9.3 许可证与使用政策摘要

OAI 数据免费开放,获取条件为注册 NDA 账户、登记 OAI 访问并遵守数据使用政策;数据按 HIPAA 标准去标识;生物样本(血清、血浆、尿、DNA)需按官方政策单独申请。以下情形需额外注意:二次分发原始数据受政策约束;与第三方数据联合使用需核对两边的使用条款;2025 年起 NIH 对受控访问数据的使用者所在司法辖区有新的合规要求(DUC 指南更新),跨国团队应事先核实。具体限制以 NDA 当前官方文本为准,本页面不构成法律建议。

常见使用情形速判:(1) 学术论文 + 公开发布模型权重——允许,引用官方数据资源与 NCT00080171,权重不得嵌入可识别信息;(2) 商业产品内部评估——数据免费且无使用费,但应自行留存政策合规记录;(3) 与私有影像库联合训练——联合使用前核对私有数据条款与去标识化一致性,训练管线按 P_ID 防泄漏;(4) 数据再分发——原始数据包原则上不再分发,指向 NDA 官方入口让第三方自行注册;(5) 衍生标注(如新读片)发布——作为社区贡献值得鼓励,但需沿用去标识化标准并注明所用发布版本。

§9.4 联系与支持

  • 数据获取与技术问题:NDA Help Desk(官方工单体系,入口见 NDA 网站)。
  • 方法学与使用问题:OAI CORE Knowledgebase 的一对一答疑与月度网络研讨会。
  • 生物样本申请:NIAMS 生物样本访问流程(官方申请指南与表单)。

§9.5 引用本页面

千方病案医数集,《OAI(骨关节炎计划)— 膝骨关节炎纵向队列 AI-Ready Wikipedia》,审核日期 2026-09-05。本页面为二次文献:所有事实性陈述均指向 §9.1 与 §8.5 所列原始来源,引用时应回溯至对应一手资源。


§10 AI 使用声明卡

§10.1 AI 模型使用

本页面撰写过程使用了大语言模型辅助,用于:资料结构化整理、初稿生成与格式规范化。所有医学事实、统计口径与合规表述均由编辑流程对照官方来源(NIAMS 项目页、NDA 归档页、官方教程与同行评议论文)核验后定稿;代码示例为教学用途的参考实现,未在原始数据上执行验证,使用前应自行测试。

§10.2 AI 参与范围

AI 在本页面的工作中负责:(1) 从 NIAMS、NDA 官方页面与检索核实的同行评议文献中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。人工负责:(1) 事实核验(参与人数、随访轮次、影像协议、获取方式的逐项溯源);(2) 医学背景与标签定义的口径把关;(3) DAIMS 评分的逐项裁定;(4) 全文终审。

§10.3 输入来源

本页面的主要信息来源:NIAMS OAI 项目页(队列构成、随访计划、资助与发布统计);NDA-OAI 归档页与 OAI Tutorials(数据获取、格式与影像组织);NIH NOSI NOT-AR-24-019(队列描述与官方动员);Peterfy 等 2008(MRI 协议);Eckstein 等 2014(十年影像综述);PMC 收录的 OAI 原始研究(子队列划分、index knee 规则、读片协议);Øiestad 等 2016 与 Felson 等 2013(MOST+OAI 联合分析);Ambellan 等 2019、Desai 等 2021、Dam 等 2023(分割基准与挑战赛);Atlas of Longitudinal Datasets 条目(profile 论文 DOI 与获取政策)。所有来源均为公开发布的官方页面或同行评议文献。

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§1 概览(队列构成、随访计划、版本时间轴) 千方病案医学编辑部 与 NIAMS 项目页及 NOSI 原文交叉比对 ✅ 已验证
§2 医学背景(ICD/SNOMED 映射、任务定义、金标准) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格(模态、格式、设备、溯源链) 千方病案医学编辑部 与 OAI Tutorials 及协议论文交叉比对 ✅ 已验证
§4 数据结构(数据家族、四级键、缺失分类) 千方病案医学编辑部 与官方数据组织文档交叉比对 ✅ 已验证
§5 划分策略与泄漏防御 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与 8 个坑点 千方病案医学编辑部 逻辑审查 + 与官方教程/原始研究比对 ✅ 已通过
§7 质量评估与 DAIMS 评分 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与基准数字表述 千方病案医学编辑部 与原文(Desai 2021/Dam 2023/Ambellan 2019)交叉比对 ✅ 已验证
§9 引用与合规表述 千方病案医学编辑部 与 NDA 官方政策文本交叉比对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.1 排行榜与不可直接比较说明、§8.7 生态快照、§C JSON-LD。

§10.6 最后审核

最后一次人工审核日期:2026-09-05

页面状态:published(全部内容已完成审核并发布)


§C 机器可读元数据(JSON-LD)

以下统一 JSON-LD @graph 供检索引擎与 AI Agent 直接消费,与页面正文及 frontmatter 声明保持一致(Schema v3.9):


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • copdgene — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • chest-imagenome — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • chest-ct-sepsis-er — 共享标签:医学影像 / 电子健康记录
  • rosmap — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • nifd — 共享标签:医学影像 / 电子健康记录 / 队列研究
  • ribfrac — 共享标签:医学影像 / 电子健康记录 / 骨骼肌肉影像
  • health-data-nexus — 共享标签:医学影像 / 电子健康记录
  • fracatlas — 共享标签:医学影像 / 骨骼肌肉影像
  • rsna-bone-age — 共享标签:医学影像 / 骨骼肌肉影像
  • all-of-us-nih — 共享标签:电子健康记录 / 队列研究

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集