信息速览
肾病病理 NEPTUNE — 肾小球疾病多组学队列与数字病理库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | NEPTUNE (Nephrotic Syndrome Study Network) Data Resources |
| 英文全称 | Nephrotic Syndrome Study Network Data Resources(含 NEPTUNE Digital Pathology Repository) |
| 别名/简称 | NEPTUNE、NEPTUNE Digital Pathology Repository、NDPSS(NEPTUNE Digital Pathology Scoring System) |
| 疾病分类 | 肾小球微小病变(MCD)、局灶节段性肾小球硬化(FSGS)、膜性肾病(MN)、Alport 综合征、儿童初发肾病综合征(ICD-11:N04 肾病综合征谱系;多为罕见病范畴) |
| 数据模态 | 肾活检 WSI(常规临床染色多切面)、免疫荧光/电镜数字图像、NDPSS 形态学描述符、纵向临床数据、患者报告结局、基因组/转录组/蛋白组 |
| AI 任务类型 | 肾小球检测与分割、病变 descriptor 预测、形态学聚类分型、蛋白尿缓解/肾功能预后建模、形态-基因多模态建模 |
| 样本总数 | 1,049 名同意入组参与者(截至 2024-10);507 例活检分析队列(FSGS 203 / MCD 193 / MN 111);儿童无活检队列 170+ |
| 数据大小 | 数百例肾活检 WSI(单张整片切片为千兆级)+ 电镜/免疫荧光数字图像 + 纵向临床与多组学数据(总体量以官方交付为准) |
| 数据格式 | WSI 整片数字切片 + 电镜 JPEG + CSV(tranSMART)/ 受控基因数据(dbGaP)/ 表达矩阵(GEO) |
| 许可证 | 受控访问:NEPTUNE 辅助研究协议 / dbGaP Data Use Agreement / NIDDK Central Repository 数据请求条款 |
| 访问级别 | 申请审核(辅助研究申请须 ASC + Steering Committee 双重审批;WGS 走 dbGaP authorized access) |
| 语言 | 英文 |
| 首发日期 | 2010(联盟创立,NCT01209000 注册)/ 2013(数字病理管线论文发表) |
| 最后更新 | 持续更新中(2024-10 ASN 报告累计 1,049 人入组;NIDDK-CR 数据包 Version 1 于 2023-02-07 发布) |
| 发布机构 | NEPTUNE Study Consortium(DACC 设于密歇根大学;NIH NCATS + NIDDK 联合资助,U54DK083912) |
| 官方主页 | https://www.neptune-study.org/ |
| 下载地址 | https://www.neptune-study.org/ancillary-studies(申请入口;无公开下载渠道) |
| DOI | 10.58020/f2ae-n094(NIDDK Central Repository 数据包 Version 1) |
| 引用次数 | 58+(Scopus/PlumX 记录,Barisoni 2016 NDPSS 可重复性论文) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 形态学标注体系(NDPSS)顶尖、多模态贯通;扣分项:完全受控访问、无公开基准与官方划分、无公开预处理脚本 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(肾病综合征与 FSGS/MCD/MN 病理定义、ICD-11 映射、NDPSS 描述符学)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 数据结构(NDPSS 描述符体系与多模态链接键)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 NEPTUNE Study Consortium、密歇根大学、NIH(NCATS/NIDDK)、dbGaP 均无任何商业利益关联。本页面不销售 NEPTUNE 数据集本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述任何机构的资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议基于公开资料整理,不保证在特定环境下的准确性和适用性。NEPTUNE 数据的实际文件组织、字段命名与分发格式以官方数据字典与交付介质为准。使用者应自行验证代码安全性和数据预处理流程的正确性。
数据使用合规:NEPTUNE 全部资源(WSI、NDPSS 描述符、临床数据、生物样本、组学数据)均为受控访问资源。使用前必须通过 NEPTUNE Ancillary Studies Program 申请(或对基因组数据申请 dbGaP authorized access),并遵守批准范围内的人文受试者保护与数据安全条款。严禁将获批数据再分发至协议外第三方。
§1 数据集概览
§1.0 30 秒速览
它是什么:NEPTUNE(Nephrotic Syndrome Study Network,肾病综合征研究网络)是 NIH 罕见病临床研究网络(RDCRN)旗下的多中心精准医学队列,2010 年创立,由密歇根大学 DACC 协调、NCATS 与 NIDDK 联合资助(U54DK083912),在 31 个北美中心招募 FSGS、MCD、MN 及 Alport 综合征患者。截至 2024-10 已入组 1,049 人。
AI 研究者为什么关心它:它拥有肾病理领域最系统的数字病理基础设施之一——NEPTUNE Digital Pathology Repository 存放肾活检 WSI,并由 NDPSS(NEPTUNE Digital Pathology Scoring System)提供最多 51 个肾小球描述符的标准化人工评分;同一个患者还贯通 30X 全基因组、肾活检 RNA-seq、蛋白组与 36 个月纵向临床结局,是"形态学-组学-预后"多模态建模的稀缺样本源。
怎么拿到:没有公开下载。WSI、描述符与临床数据经 Ancillary Studies Program 申请(至少提前 2-3 个月,双重审批);WGS 经 dbGaP(phs003210.v1.p1);RNA-seq 已存 GEO(GSE219185、GSE197307);存档数据包在 NIDDK Central Repository(DOI 10.58020/f2ae-n094)。
§1.1 摘要
NEPTUNE 的核心主张是:同一个病理诊断(如 FSGS)背后是异质性疾病,必须用"深度表型 + 分子机制"拆解。为此,联盟在入组时即采集研究性活检组织核心,将常规临床染色的玻片整片扫描为 WSI(本地扫描或 NIH 中央扫描),上传至 web 端病理信息管理系统完成元数据与图像质控;病理医生为每个肾小球赋予跨切面唯一的编号,再以"描述符"(descriptor,记录损伤模式而非诊断)逐一定量评分,形成 NDPSS 形态学档案。与 WSI 并行的还有免疫荧光与电镜数字图像、血液/尿液生物样本库、患者报告结局与 SMS 随访,以及全基因组/转录组/蛋白组三层分子数据。截至 2024-10,累计 1,049 名参与者入组,507 例活检分析队列中 FSGS 203 例、MCD 193 例、MN 111 例;官方显示 105 篇论文发表、205 项辅助研究获准,资源已被 216+ 项研究使用。
对 AI 研究者而言,NEPTUNE 的独特价值不在"量大"而在"对得齐":形态学描述符、分子谱与临床复合结局锚定在同一名患者身上,使形态-基因联合建模(如 Hodgin 2022 的 NDPSS 聚类研究)成为可能。代价是门槛:一切数据受控分发,申请周期以月计,且不存在官方 AI 划分。
如何使用本页:如果你在立项前评估,按 §1 → §3 → §7 的顺序读(是什么 → 有什么 → 质量如何);如果你已经获批数据,直接跳 §4 → §5 → §6(结构 → 划分 → 代码与坑点);如果你在写论文方法学部分,§8.1 的文献基线表与 §9.2 的 BibTeX 是为这一步准备的。全页的每一条硬事实都可在 §10.3 输入来源清单里溯源。
§1.1.1 关键数字速查卡
写标书或论文背景时最常被引用的一组数字,集中放一张卡(每条都标注口径与来源,禁止跨口径相加):
| 数字 | 口径 | 来源 |
|---|---|---|
| 2010 | 联盟创立(NCATS+NIDDK 资助,U54DK083912) | 官网数字栏 |
| 31 | 北美入组中心(现行阶段) | 官网数字栏 / ASN 2024 |
| 1,049 | 同意入组且符合条件者(截至 2024-10) | ASN Kidney Week 2024 |
| 507 | 活检分析队列(FSGS 203 / MCD 193 / MN 111) | Drexler 2025 |
| 170+ | 儿童无活检队列(Cohort B) | Kidney News 14(4) |
| 51 | 肾小球 NDPSS 描述符数 | Barisoni 2016 |
| 36 个月 | 标准随访窗(≥) | NCT01209000 / ASN 摘要 |
| 105 / 205 | 发表论文数 / 获准辅助研究数 | 官网数字栏 |
| 216+ | 使用联盟资源的研究总数 | ASN Kidney Week 2024 |
§1.2 战略价值分析
范式开创维度:NEPTUNE 把临床试验级的数字病理审查流程搬进了罕见病纵向队列——病理材料统一扫描、集中质控、多病理医生独立阅片、网络共识会议取代玻片邮寄。Barisoni 等 2013 年在 CJASN 上发表的方法学论文证明,WSI 工作流能在预算中性的前提下提升肾小球计数准确性与阅片一致性;其 2016 年 Modern Pathology 可重复性研究进一步给出 51 个肾小球描述符的读者间/读者内 kappa 分布,为"定量肾病理"提供了可审计的标注协议。这套 descriptor-based(基于描述符而非诊断)的评分理念后来成为肾脏数字病理与 AI 标注设计的参照系。
临床影响维度:Hodgin 等 2022 年发表于 American Journal of Kidney Diseases 的研究将 NDPSS 应用于 221 例 FSGS/MCD 数字活检,用 37 个描述符把患者聚成 X/Y/Z 三个形态学亚型——亚型横跨传统诊断边界,Y/Z 型蛋白尿缓解概率显著更高,X 型则伴随 1,920 个差异表达基因与免疫/炎症通路激活。这是"形态学定量 → 分子分型 → 预后分层"完整链条的示范性证据,也直接定义了该数据集上最有价值的 AI 任务形态。
数据生态维度:NEPTUNE 把"数据可用性"做成了制度化产品——辅助研究申请通道、tranSMART 在线侦察、官方数据字典、每周固定的研究者 office hours、与 CureGN 的联合申请模板。205 项获准辅助研究覆盖"从方法学开发到 II 期临床试验"的完整光谱(官方描述),说明这套生态对真实研究需求的吞吐能力。对 AI 团队而言,这意味着申请不是"石沉大海的邮件",而是有模板、有流程、有专人对接的标准化管线。
方法学外溢维度:NDPSS 的"描述符优先于诊断"理念、跨切面肾小球编号协议、webinar 共识培训机制,已作为可复用方法论输出到肾脏病理学界——官方明确将 NDPSS 定位为"可扩展到 NEPTUNE 联盟之外、支撑国际协作的肾活检解读标准化模型"。对做医学影像标注体系设计的团队,这三件套(操作手册 + 共识培训 + 一致性审计)本身就是一份值得研读的标注工程范文。
§1.3 横向对比
| 数据集 | 规模 | 模态 | 人群 | 访问方式 | 核心差异化 |
|---|---|---|---|---|---|
| NEPTUNE | 1,049 人入组(活检队列 507 例) | WSI + NDPSS 描述符 + 电镜/IF + 多组学 + 纵向临床 | 北美 31 中心,FSGS/MCD/MN/Alport,成人+儿童 | 全受控(辅助研究/dbGaP) | 描述符级人工形态学定量 + 形态-组学-结局贯通 |
| CureGN | 多中心国际队列(规模更大) | 临床数据 + WSI + 生物样本 | 成人+儿童,含 IgA 肾病 | 全受控(辅助研究) | 病种更广(含 IgAN),与 NEPTUNE 有联合申请通道 |
| KPMP(Kidney Precision Medicine Project) | 数百例活检 | WSI + 单细胞/空间组学 | 美国多中心,CKD/AKI | 受控 + 部分开放门户 | 侧重正常参照组织与单细胞分辨率分子图谱 |
| 公开肾病理/泛癌 WSI 集(如 TCGA、PANDA 挑战集) | 数千至数万张 | 仅 H&E WSI | 肿瘤或前列腺穿刺为主 | 公开下载 | 规模大、门槛低,但无纵向结局与多组学锚定 |
一句话定位:要规模和免费,用公开 WSI 集;要"每张图背后都有分子谱和 36 个月结局",NEPTUNE 是肾病理领域少有的选项之一。
§2 医学背景
§2.1 肾病综合征与三大病理实体
肾病综合征(nephrotic syndrome, NS)由肾小球滤过屏障受损引起,典型表现为大量蛋白尿(研究语境中常以 >3.5 g/day 或 UPCR 等价物界定)、低白蛋白血症、水肿与高脂血症,部分患者进展至终末期肾病(ESRD)。NEPTUNE 官方背景材料指出,MCD、FSGS、MN 等非炎症性肾小球疾病约占美国流行 ESRD 病例的 15%。三个病理实体的形态学语言是理解本数据集标注体系的前提:
- 微小病变(MCD):光镜下肾小球基本正常,免疫荧光无显著沉积,诊断锚点在电镜下的足细胞足突弥漫融合。临床上对激素敏感但易复发,儿童初发 NS 的主要类型。
- 局灶节段性肾小球硬化(FSGS):部分肾小球(局灶)出现部分毛细血管袢(节段)硬化与玻璃样变,伴足细胞损伤;激素抵抗比例高,肾衰竭进展风险在三个病种中最高。ICD-11 归类于肾小球疾病(临床表现编码为肾病综合征 N04 谱系)。
- 膜性肾病(MN):以肾小球基底膜外侧上皮下免疫复合物沉积、基底膜增厚为特征,抗 PLA2R 抗体相关的原发性 MN 常见;部分患者自发缓解,部分进展。
三者共享"肾病综合征"这一临床表现,却对应完全不同的机制、治疗与预后——这正是 NEPTUNE 选择它们作为精准医学研究对象的原因,也是 AI 建模时"诊断标签 ≠ 疾病实体"的根本来源。
从 AI 任务的角度再补一层形态学-诊断的对应关系:MCD 的诊断高度依赖电镜(光镜近于正常),FSGS 的"局灶节段"本质是取样问题(未受累的肾小球在光镜下完全正常),MN 的分期则依赖基底膜形态演变的观察。这意味着任何"单张 H&E 切片 → 诊断"的端到端模型在肾病理语境下都有结构性盲区——这也是 NDPSS 强调跨切面、多染色、多模态(含电镜)综合评分的原因。为这个数据集设计模型时,把"多切面证据聚合"作为一等公民对待,才与病理学现实对齐。
§2.2 Alport 综合征与儿童队列
Alport 综合征是由 IV 型胶原(COL4A3/4A4/4A5 基因)编码缺陷导致的遗传性肾小球疾病,表现为血尿、进行性肾功能下降,可伴听力与眼部异常,属罕见病。NEPTUNE 在后续资助阶段将 Alport 综合征纳入研究范围,并连接 Alport Syndrome Foundation 患者组织。此外,NEPTUNE 设有儿童初发 NS 队列(内部称 Cohort B):患儿在临床诊断后、肾活检之前入组,随访最长 5 年,通过短信等方式密集采集蛋白尿、用药与复发事件——该队列提供疾病自然史数据,但没有病理切片,做影像研究时不可混入。
两个队列的分工值得细读:Cohort A(活检队列)回答"形态学 + 分子如何决定结局",Cohort B(无活检儿童队列)回答"初发疾病在不依赖组织的条件下如何演变"。后者引入了短信随访(SMS)这种低成本高频采集模式——每天或每周询问蛋白尿、水肿、用药、感染与缺课事件,用于捕捉复发前驱信号。这类"高频轻量纵向数据"在常规影像队列中几乎不存在,做复发预测类研究时是独特资源,但要注意它与活检队列的入组逻辑完全不同。
§2.3 NDPSS:从"诊断"到"描述符"的病理学语言
传统肾病理报告以诊断结论 + 半定量分级(如 0-3+)为主,读者间一致性有限。NEPTUNE 的 NDPSS 换了一套语言:病理医生在 WSI 上先枚举并编号所有肾小球(跨所有切面水平跟踪同一个肾小球),然后对每个肾小球按"损伤模式描述符"逐一记录有/无——例如节段硬化、球性硬化、足突融合、微绒毛转化、小管萎缩/间质纤维化(IFTA)等,共定义 51 个肾小球描述符,外加 IFTA 与超微结构(电镜)描述符。可重复性研究(Barisoni 2016)对其中可评估的 48/51 个肾小球描述符计算了读者间 Cohen’s kappa:52% 达中等(0.40<kappa≤0.60)或以上,其余偏低;IFTA 一致性优秀,电镜足突融合等常用描述符达良好-优秀。这套定量语言把"病理图像 → 结构化变量"的过程显式化了,天然构成 AI 任务的监督信号设计蓝本。
从机器学习视角再拆一层,NDPSS 把病理学家的工作流切成了两个可监督的阶段:检测/枚举(在整片上找到所有肾小球并按切面关联)与分类/评分(对每个已定位的肾小球判定 51 个二元属性)。前者对应目标检测与分割任务,后者对应多标签分类任务——两阶段各自有明确的输入输出契约,比"端到端输出诊断"的任务设计更可审计。同时,描述符粒度足够细,使得"模型错在哪类形态上"可以精确到特征级归因,这是诊断级标签做不到的。
§2.4 APOL1 与人群结构
APOL1 风险单倍型与非洲裔人群 FSGS/高血压相关肾病的易感性相关,是肾病遗传学的标志性发现之一。NEPTUNE 的样本库包含 APOL1 基因型数据,且第二资助周期有意富集"非洲血统 + 大量蛋白尿"的高风险成人入组(NIDDK 官方描述)。这对队列是科学设计,对 AI 建模则是必须显式处理的人群构成漂移:不同入组阶段的 ancestry 分布与蛋白尿阈值都不同(见坑点 8)。
实操层面的三个提醒:① APOL1 基因型在 dbGaP 资源里可直接取用,做 FSGS 结局建模时建议作为分层因子而非删除项——它是已知机制变量,屏蔽它会引入残余混杂;② 富集设计使 NEPTUNE 成为研究 APOL1 相关肾病的少数可用队列之一,这是资源优势;③ 任何涉及 ancestry 的分析都应在论文里报告样本构成随入组阶段的变化,避免把"设计出的构成"误读为"自然分布"。
§2.5 缓解结局的临床语言
NEPTUNE 的主要结局用肾病综合征临床试验的标准语言定义:完全缓解(蛋白尿降至阈值以下,通常对应 uPCR < 0.3 g/g 量级)、部分缓解(蛋白尿较基线显著下降但未达完全缓解)、未缓解(未达上述标准)。三者构成三分类,加上时间维度后变成"达到缓解的时间"——即文献中 Cox 模型的分析对象。这套语言贯穿联盟的临床论文(如 507 例活检队列分析中 FSGS 36 个月首次缓解累计概率 50%)。
对 AI 建模者,这条临床语言带来两个硬约束:其一,任何"缓解预测"任务的标签定义必须与联盟口径逐字对齐,否则结果无法与已发表文献对话;其二,缓解状态是时变终点——同一患者在随访期内可能从"未缓解"转为"部分缓解"再转为"完全缓解",静态快照式建模会把动态过程压扁,生存分析框架是更忠实的表达。
§2.6 数字病理的范式背景
理解 NEPTUNE 数字病理库的行业位置,需要知道它起步之早:2013 年(CJASN 论文发表)时,美国 FDA 尚未批准任何 WSI 系统用于临床主诊断(FDA 首次批准是在 2017 年)。NEPTUNE 在 WSI 还是"研究工具"而非"临床器械"的年代,就把多中心试验级病理审查全流程搬上了数字平台——扫描、上传、质控、标注、共识全部在线完成。这解释了该库为何自带"研究级质控基因":它的每一层设计(元数据审查、图像质量审查、肾小球跨切面编号、描述符手册)都不是为存储而生,而是为多读者一致性与可审计性而生。
十年后再看,这套设计恰好踩中了计算病理学的两个核心需求:其一,器官级标准化标注协议(肾病理长期缺乏像肿瘤领域那样的统一分级语言);其二,图像与纵向结局的可联结性。对准备在肾病理方向做 AI 的团队,NEPTUNE 数字病理库 + NDPSS 是绕不开的方法学参照——即使你的数据来自别处。
§2.7 中英术语对照
本领域文献以英文为主,但中文语境下术语翻译不统一(同一 FSGS 有"局灶节段性肾小球硬化/局灶节段性肾小球硬化症"等多种写法)。为避免歧义,本页统一使用下表译法:
| 英文 | 本页译法 | 常见别名 |
|---|---|---|
| Nephrotic Syndrome (NS) | 肾病综合征 | 肾综合征 |
| Focal Segmental Glomerulosclerosis (FSGS) | 局灶节段性肾小球硬化 | 局灶性节段性肾小球硬化症 |
| Minimal Change Disease (MCD) | 微小病变 | 微小病变性肾病、类脂性肾病 |
| Membranous Nephropathy (MN) | 膜性肾病 | 膜性肾小球肾炎 |
| Alport Syndrome | Alport 综合征 | 奥尔波特综合征、遗传性肾炎 |
| Whole Slide Image (WSI) | 整片数字切片/全切片图像 | 数字病理切片 |
| Descriptor | 描述符 | 描述项、形态学观察项 |
| Remission | 缓解 | 完全缓解/部分缓解按上文分级 |
| Interstitial Fibrosis / Tubular Atrophy (IFTA) | 间质纤维化/小管萎缩 | 肾间质纤维化与肾小管萎缩 |
| Podocyte | 足细胞 | 足突细胞 |
| Glomerulus | 肾小球 | —— |
| Cohort | 队列 | —— |
引用本页或撰写双语材料时,建议以英文术语为锚、中文译法为辅,避免别名混淆。
§2.8 儿童与成人的结构差异
同一"肾病综合征"标签下,儿科与成人人群的结构差异贯穿整个数据集:
- 病种构成:儿童初发 NS 以 MCD 为主(多数不做活检即按 MCD 经验性治疗),成人则 FSGS 与 MN 占比显著更高——这直接造成活检队列的年龄-病种关联结构。
- 病理可及性:儿童 Cohort B 无活检(伦理与临床惯例使然),成人几乎全部有组织——多模态研究在儿科侧天然缺失影像臂。
- 测量方式:儿科采血量按体重分档、24 小时尿在低龄儿童依从性差(常以 UPCR 替代)——同一变量在两个年龄段的测量精度与载体不同。
- 随访内容:儿童队列叠加 SMS 高频随访捕捉复发;成人的 PRO 问卷侧重生活质量与负担。
建模含义:把年龄段作为首要分层维度不是"锦上添花",而是结构必需——任何跨年龄段池化都应附带分层结果作为对照。
§3 数据集规格
§3.0 版本/入口抉择矩阵
NEPTUNE 不是"一个下载包",而是同一批患者的多条资源线。先想清楚要什么,再去对应的入口:
| 你想要… | 正确入口 | 访问方式 | 周期预期 |
|---|---|---|---|
| 肾活检 WSI + NDPSS 描述符 + histopathology 数据 | NEPTUNE Ancillary Studies Program | 向 neptune-study@umich.edu 提交申请,ASC + Steering Committee 审批 | 提前 2-3 个月递交,审批+交付以月计 |
| 30X 全基因组测序(WGS/WES/APOL1) | dbGaP phs003210.v1.p1 | dbGaP authorized access(机构 PI 持证 + 申请) | 数周至数月 |
| 肾活检 RNA-seq 表达数据 | GEO GSE219185 / GSE197307 | GEO 受控/公开通道(以 GEO 页面标注为准) | 天级 |
| 临床+生物标志数据在线探索 | NEPTUNE tranSMART | 申请 tranSMART 访问 | 周级 |
| 单细胞/分层表达探索(NEPTUNE-OCEAN) | NEPTUNE cellxgene 实例 | 网页访问 | 即时 |
| 存档数据包与标本请求(引用锚点) | NIDDK Central Repository(DOI 10.58020/f2ae-n094) | R4R 平台数据/标本申请 | 数周至数月 |
| 与 CureGN 联合的多网络研究 | Joint NEPTUNE-CureGN 申请表 | 同辅助研究通道 | 更长 |
经验法则:影像 + 形态学 + 结局建模走辅助研究通道;纯基因组问题走 dbGaP;两者都要时在一份辅助研究申请里一次讲清,避免二次评审。
§3.1 队列设计与随访
- 注册与设计:前瞻性观察性队列,ClinicalTrials.gov 注册号 NCT01209000(2010-07-29 首次提交);观察模型为队列、时间取向为前瞻。
- 入组时点:首次临床指征肾活检时(活检队列入组时即采集研究性组织核心);儿童初发 NS 无活检队列在诊断 30 天内、治疗启动早期入组。
- 蛋白尿入组阈值:第一阶段 >500 mg/day,第二/三阶段提高至 >1,500 mg/day(第二阶段另有意富集非洲血统与重度蛋白尿者)。
- 随访:至少 36 个月(首年最多 3 次访视,此后每年约 2 次);儿童无活检队列随访最长 5 年。
- 主要结局:尿蛋白排泄变化与肾功能变化的复合缓解终点(完全缓解 / 部分缓解 / 未缓解);次要结局包括生活质量、新发糖尿病、感染、血栓栓塞、住院、AKI 与死亡等。
- 排除:狼疮性肾炎等继发性肾小球病、实体器官移植受者、无诊断性活检的临床肾小球病(活检队列)。
访视节奏的数据含义值得展开:基线访视采集人口学、临床史、体检、活检组织与首轮生物样本,是"横断面最深"的一个时点;此后每 4-6 个月的随访访视以肾功能、蛋白尿、用药与样本更新为主,首年最多 3 次、此后每年约 2 次。对时序建模者,这意味着基线特征最稠密、随访特征渐稀——特征工程时"基线预测结局"是天然设计,而"随访中途动态预测"则要处理访视间隔不规则的问题(生存框架 + 时间依变量是最对齐的处理方式)。
§3.2 规模与病种分布
| 指标 | 数值 | 来源与口径 |
|---|---|---|
| 同意入组且符合条件者 | 1,049 | ASN Kidney Week 2024 信息摘要(31 个北美站点) |
| 累计入组(2019 年口径) | 796(26 站点) | ASN Kidney Week 2019 信息摘要 |
| 累计同意(2022 年口径) | 1,100+(34 中心,第三阶段) | Kidney News 14(4) 特稿——口径含各阶段 |
| 活检分析队列 | 507(FSGS 203 / MCD 193 / MN 111) | Drexler 2025(Glomerular Diseases),23 中心 |
| 儿童无活检队列 | 170+ | Kidney News 14(4) |
| 发表论文 / 获准辅助研究 | 105 / 205 | neptune-study.org 官网数字 |
| 资源被使用的研究总数 | 216+ | ASN Kidney Week 2024 |
注意各口径统计时点与"入组/同意/活检"定义不同,引用时必须标注来源与年份,禁止跨口径相加。
§3.3 数据资源清单
| 类别 | 内容(据官方辅助研究页面) |
|---|---|
| 临床 | 人口学与健康史、环境暴露、患者报告结局与信息、随访访视、社会经济与普查区(census tract)数据、医疗利用、肾功能与蛋白尿、中心化血清/尿液检验、用药、家族史、终点事件 |
| 遗传 | 全基因组测序(WGS 30X)、全外显子测序(WES)、APOL1 基因型 |
| 基因表达 | Affymetrix 芯片表达、肾活检 RNA-seq、单核 RNA 测序(snRNA-seq) |
| 蛋白组 | 54-Plex 细胞因子/趋化因子/TIMP/MMP 靶向板、尿 EGF(肌酐归一化)ELISA、SomaScan |
| 数字病理库 | 肾活检 WSI、NDPSS 描述符形态学档案(经 tranSMART 提供) |
| 生物样本 | 血清/血浆(EDTA、SST、枸橼酸、肝素管分型)、24 小时尿、点尿(防腐分型)、RNA later 尿沉渣 pellet;基线与随访分批采集 |
§3.4 数字病理工作流
Barisoni 2013(CJASN 8(8):1449-1459)定义的多中心 WSI 流程沿用至今:① 玻片在本地中心扫描,或邮寄至 NIH 图像管理协调站点中央扫描;② WSI 连同电镜/免疫荧光数字图像与病理报告 PDF 上传至密码保护的 web 端病理信息管理系统;③ 通过元数据与图像质量双重质控后进入分诊;④ 病理医生标注所有切面水平上的全部肾小球——每个肾小球获得唯一编号并在其出现的所有切面中保持该编号,直至肾小球消失或切面结束;⑤ 按 NDPSS 以"描述符"记录损伤模式(而非诊断),支持多病理医生独立评分与网络共识会议。这套流程的意义在于:标注结构天然是多切面、多染色、按肾小球编号组织的三级结构(患者 → 切片 → 肾小球),第 4 节与坑点 3 都建立在这个结构之上。
两条扫描通路的取舍:本地扫描快(无需邮寄玻片),但设备与操作参数依赖各中心;中央扫描(NIH 协调站点)统一设备与流程,代价是物流周期。对申请者,这意味着你拿到的 WSI 批内可能同时存在两种通路的产物——预处理时按"通路"分组检查染色与扫描参数,是坑点 6 的前置功课。
§3.5 临床变量组详表
官方数据指南将临床资源按主题分组组织(经 tranSMART 本体化呈现)。下表按主题归纳并注明建模含义:
| 变量组 | 代表内容(据官方资源指南) | 建模用途 |
|---|---|---|
| 人口学与社会经济 | 年龄、性别、人种/族裔、普查区(census tract)衍生社会经济指标 | 分层因子、公平性审计维度 |
| 肾功能与蛋白尿 | 血清肌酐/eGFR、UPCR、24 小时尿蛋白 | 结局定义与纵向轨迹建模 |
| 中心化检验 | 统一实验室的血清/尿液指标(白蛋白、血脂等) | 协变量;注意中心化 vs 本地检验的口径差异 |
| 用药 | 免疫抑制剂、激素等处方记录 | 治疗混杂变量;治疗模式研究 |
| 终点事件 | 完全/部分/未缓解、AKI、住院、死亡等 | 生存/多分类建模的标签层 |
| 患者报告数据 | PRO 问卷(生活质量、健康自评)与患者报告信息 | 纵向患者层结局;共病负担分析 |
| 家族史与遗传 | 家族肾病史、APOL1 风险单倍型、WGS/WES | 遗传分层与机制研究 |
| 环境与医疗利用 | 环境暴露、医疗利用记录 | 敏感性分析中的外生变量 |
| SMS 随访衍生 | 短信采集的蛋白尿/水肿/用药/缺课事件(儿童队列) | 高频复发前驱信号挖掘 |
引用变量时以官方 Data Dictionary 的字段定义与版本为准——上表是主题级归纳,不是字段级规格。
§3.6 生物样本矩阵
官方生物样本指南按"样本类型 × 采集管型 × 访视"组织。要点摘录:
- 血液:血清/血浆双轨采集,覆盖 EDTA 血浆、SST 血清、枸橼酸钠血浆、肝素钠血浆四类管型;儿科按体重分档(如 21-51 磅、>52 磅)规定采血量。
- 尿液:24 小时 untreated 尿(蛋白尿定量的金标准载体)、防腐点尿(防腐剂分 NaN3 与蛋白酶抑制剂 PI 两类)、RNA later 保存的尿沉渣 pellet——对应不同的分析用途(生化定量 vs 沉渣细胞学 vs RNA 提取)。
- 访视安排:基线(全部参与者)与随访访视(全部参与者)双节点采集;部分管型仅在基线采集。
- 取用逻辑:样本申请需在辅助研究申请中逐管型列明,资源有限、由委员会按"参与者负担最小化 + 谨慎使用"原则审查。
对 AI 建模者的启示:生物样本决定了多组学数据为什么会有——每种组学数据的背后是一条具体的采样-处理链。理解这条链(如尿沉渣 RNA 与血转录组的采集时间差)是多模态对齐不出错的前提。
§3.7 多组学矩阵与区室分离
NEPTUNE 组学资源的独特结构在于区室分离设计:活检组织核心经手工显微解剖(manual micro-dissection)分离为肾小球与肾小管间质两个区室,分别提取 RNA 测序。这带来三个直接后果:
- 转录组数据自带空间区室先验——"某个基因在小球还是间质表达"是数据结构内生的,不用从混合信号里反解;
- 形态学描述符(小球级/间质级)与转录组(小球/间质)存在天然的对齐轴——Hodgin 2022 能把 X 簇的差异基因映射回免疫/炎症通路,正是靠这条轴;
- 区室分离牺牲了通量(手工解剖费时费力),因此不是每例都有全区间室数据——做多组学建模前先统计各模态的参与例数,避免假设"所有患者全模态齐备"。
§3.8 数据引用与口径规范
联盟数据的引用有两套规范,混用是文献里最常见的低级错误:
- 引用数据本身:使用 NIDDK-CR 资源时,引用数据包 DOI(10.58020/f2ae-n094,Kretzler 2023 引用格式)并附官方致谢声明;基因组数据引用 dbGaP accession(phs003210.v1.p1);表达数据引用 GEO 编号。
- 引用设计与方法:联盟设计论文(Gadegbeku 2013)+ 数字病理方法学论文(Barisoni 2013)+ 所用描述符相关论文(如 Barisoni 2016)。
- 规模口径:引用参与者规模必须注明统计时点与口径(“同意入组”/“入组”/"活检分析队列"是三个不同集合);推荐引用 2024-10 口径 1,049 人并注明来源。
§4 数据结构详解
§4.0 资源组织示意
NEPTUNE 资源按研究申请分别交付(tranSMART、dbGaP、GEO 各自成体系),不存在统一的公开目录树。以下为按官方资源清单归纳的逻辑组织示意,实际文件命名与层级以官方数据字典和交付介质为准:
NEPTUNE Data Resources (controlled access)
├── clinical/ # 纵向临床数据(tranSMART 本体化组织)
│ ├── demographics_socioeconomics # 人口学、社会经济、普查区
│ ├── renal_function_proteinuria # 肾功能与蛋白尿随访
│ ├── lab_results # 中心化血清/尿液检验
│ ├── medications # 用药记录
│ ├── endpoints # 缓解复合终点(完全/部分/未缓解)
│ └── patient_reported_outcomes # PRO 与 SMS 随访衍生指标
├── digital_pathology/
│ ├── wsi/ # 肾活检整片数字切片(多染色、多切面水平)
│ ├── if_em_images/ # 免疫荧光与透射电镜数字图像
│ └── ndpss/ # NDPSS 描述符评分(descriptor-based profiles)
├── genomics/
│ ├── wgs_30x/ # dbGaP phs003210.v1.p1
│ ├── wes_apol1/ # WES 与 APOL1 基因型
│ └── expression_affymetrix/
├── transcriptomics/
│ ├── biopsy_rnaseq/ # GEO GSE219185 / GSE197307
│ └── snrnaseq/ # 单核 RNA 测序(cellxgene/NEPTUNE-OCEAN 可探索)
├── proteomics/
│ ├── cytokine_54plex/
│ ├── urine_egf_elisa/
│ └── somascan/
└── biospecimens/ # 血清/血浆/24h 尿/点尿沉渣库存(经申请取用)
§4.1 NDPSS 描述符体系
NDPSS 的分析单元是肾小球 × 描述符,辅以间质小管(IFTA)与超微结构(电镜)两层。核心结构维度:
| 维度 | 内容 | 建模含义 |
|---|---|---|
| 肾小球枚举 | 每个肾小球跨切面唯一编号(glom_id),在所有染色/切面中保持 | 同一肾小球的多切面观测是同源样本,不可当独立样本 |
| 肾小球描述符 | 51 个有/无型损伤模式变量(节段硬化、足突融合等) | 标签空间是 51 维稀疏 0/1,而非单一诊断列 |
| IFTA | 全片水平的间质纤维化/小管萎缩评分(244 例 WSI 评估中一致性优秀) | 片级预后特征,与患者级结局强关联 |
| 超微结构 | 电镜 4 个足细胞描述符(足突融合、微绒毛转化等,178 例 JPEG 评估) | 亚细胞标签,与电镜图像配对 |
| 患者级汇总 | 每个描述符的肾小球占比 → 形态学档案(morphologic profile) | Hodgin 2022 用该档案做聚类(37 个描述符、221 例) |
字段命名以官方 Data Dictionary 为准(辅助研究材料中提供完整数据字典与描述符参考手册);上表给出的是文献可稽核的结构维度,而非逐字段文件规格。
§4.2 关键链接键与标识体系
- 参与者(participant):全资源线的根键。临床访视、生物样本、WSI、组学数据通过同一化名 ID 贯通。
- 切片(slide/level):一次活检对应多张玻片、多染色(H&E、PAS、银染等常规临床染色)、多切面水平;每张扫描片在质控后有唯一标识。
- 肾小球(glomerulus):跨切面唯一编号是 NEPTUNE 数字病理最独特的资产——它使得"同一个肾小球在连续切面上的演变"可被追踪(Rosenberg 2016 专门验证了 WSI 肾小球计数的准确性提升)。
- 访视(visit):基线 + 每 4-6 个月访视,临床变量与样本类型按访视组织。
- 多模态对齐:活检组织核心经手工显微解剖分离肾小球与小管间质两个区室后分别做 RNA 测序——转录组数据自带区室标签,可与同一患者的形态学档案直接联结。
§4.3 组学资源的外部锚点
- dbGaP:phs003210.v1.p1 承载 NEPTUNE WGS 数据,受控访问,需要机构与 PI 资质认证。
- GEO:GSE219185 与 GSE197307 存放肾活检 RNA-seq 衍生数据(表达矩阵级)。
- NIDDK Central Repository:DOI 10.58020/f2ae-n094(Version 1,2023-02-07)是可引用的存档数据包锚点,支持数据与标本双通道申请。
- tranSMART / cellxgene:前者提供本体化组织的临床-生物标志-描述符联合探索,后者(NEPTUNE-OCEAN 实例)支持单细胞分辨率的在线分层分析,两者都是申请正式数据前的低成本侦察工具。
§4.4 数据质量防线
数字病理侧的质控在 2013 年管线中明确定义:元数据完整性 + 图像质量审查,未过质控的案例不进入评分。病理标注侧的质控是流程性的:描述符参考手册 + 网络共识培训(webinar cross-training)——可重复性研究显示读者间一致性随共识培训提升、与医生年资无关。临床侧:中心化检验(统一实验室流程)+ 标准化访视窗。这些防线决定了"拿到数据后能自查什么":图像元数据、描述符分布、访视时间窗都可以在本地复检,但标注质量无法复检到超过人工 kappa 天花板(见坑点 4)。
把三层质控翻译成 AI 工程语言:图像层质控对应"拿到数据先跑一遍完整性校验脚本"(能否打开、金字塔层数、元数据字段);标注层质控对应"以 kappa 报告为依据裁剪任务空间"(低一致性描述符不进主指标);临床层质控对应"访视窗对齐再算纵向特征"(4-6 个月窗口外的记录要显式处理)。三层各自独立,缺一层就会在论文评审时被对应领域的审稿人抓住。
§4.5 NDPSS 描述符的功能分组(示例性)
51 个肾小球描述符的完整定义以随申请交付的描述符参考手册为准(公开文献仅披露结构与部分示例)。从可重复性研究披露的分析组织方式,可归纳出两大功能簇及其建模含义:
| 功能簇 | 文献依据 | 典型语义方向 | 建模提示 |
|---|---|---|---|
| 硬化相关描述符 | Mod Pathol 2016 Figure 1a(“glomerular descriptors indicating sclerosis or associated with sclerosis”) | 球性/节段硬化、粘连等结构性毁损方向 | 与 FSGS 分型、预后强相关;在 FSGS 队列中支撑度相对充足 |
| 其他形态描述符 | Mod Pathol 2016 Figure 1b(其余肾小球描述符) | 细胞增生、足细胞损伤、毛细血管袢形态等 | 支撑度差异大;需按 kappa 与观测数逐项裁剪 |
| IFTA(间质小管) | 244 例 WSI 单独评估 | 间质纤维化、小管萎缩 | 片级特征,一致性优秀,预后建模首选特征之一 |
| 超微结构描述符 | 178 例电镜 JPEG,4 个足细胞描述符 | 足突融合、微绒毛转化等亚细胞形态 | 与电镜图像配对使用;临床常用项一致性良好-优秀 |
再加一层组织学知识:Hodgin 2022 的聚类分析显示,基于 37 个描述符的患者级形态学档案可聚成三个横跨 MCD/FSGS 诊断的亚型——这意味着描述符簇(而非单个描述符)才是与预后挂钩的自然单元。做特征工程时,按临床语义先验把描述符分组成"特征束",往往比 51 维直接丢进模型更稳。
§4.6 申请交付材料清单
获批辅助研究后,通常随数据交付一整套配套材料(以 DACC 实际交付为准):
- 数据文件本体:按申请范围交付的 WSI/描述符/临床/组学文件集
- 数据字典:字段定义、编码规范、访视窗说明(官网亦挂有 Data Dictionary 导览)
- NDPSS 描述符参考手册:每个描述符的定义、判定标准与示例图
- 协议与致谢文本:发表引用义务、NIDDK-CR 官方致谢声明(如适用)
- 数据安全条款:存储、访问控制与再分发禁令
拿到交付的第一周建议只做三件事:逐文件核对申请清单、跑数据字典对齐的字段级完整性校验、抽 3-5 张 WSI 手工验证"肾小球编号 → 像素位置"的可追溯性。这三步做完,后面所有建模工作才有可复现的地基。
§4.7 侦察平台的数据形态
正式申请前在 tranSMART 与 cellxgene 上能"摸到"的数据形态与正式交付不同,提前了解有助于设定预期:
| 平台 | 数据形态 | 能做什么 | 不能做什么 |
|---|---|---|---|
| tranSMART | 本体化组织的聚合/记录级临床与描述符数据 | 队列计数、变量分布探索、申请需求验证 | 下载原始 WSI;患者级导出(按权限) |
| cellxgene(NEPTUNE-OCEAN) | 单核/单细胞表达矩阵的在线交互视图 | 细胞类型构成检查、分层表达验证 | 批量下载矩阵;跨平台患者级链接 |
两个平台都要求登录/访问申请,但门槛远低于正式辅助研究——把"侦察 → 立项 → 申请"做成三段式,每段的产出物(侦察报告 → 分析计划 → 申请书)自然衔接。
§4.8 多模态对齐的实操要点
把十个模态层拼到患者身上,实操上要过四道对齐关卡:
- ID 对齐:所有资源线的患者键是否同一命名体系(DACC 交付时提供链接键表);跨 dbGaP/GEO/tranSMART 三源时要逐源核对。
- 时间对齐:组学样本的采集访视与临床变量所属访视要对齐到同一时间窗——RNA-seq 来自活检时点,用 24 个月访视的临床变量与之配对就是错配。
- 区室对齐:转录组的肾小球/小管间质区室标签要与形态学描述符的解剖层级对应(小球描述符 × 小球转录组、IFTA × 间质转录组)。
- 粒度对齐:肾小球级描述符聚合到患者级再与患者级分子谱配对(Hodgin 2022 的口径);若要做肾小球级分子映射,需确认所用 snRNA-seq/解剖材料的粒度支持。
四道关卡中任何一道失守,多模态模型学到的都是"对齐噪声"——这也是为何 §7.7 DAIMS 把"多模态对齐"列为独立评估维度。
§5 数据划分与使用建议
§5.1 官方划分:不存在
NEPTUNE 没有提供任何官方 train/val/test 划分——它本质是研究资源而非基准数据集。所有划分须自行构建并写进论文方法学。建议的最小合规划分:
- 按参与者分组(必须):同一患者的所有切片、所有染色、所有肾小球、所有访视样本只能落在同一侧。用
GroupShuffleSplit(group=participant_id)或按站点分层后的组划分。 - 按站点分层(强烈建议):31 个中心间染色协议与扫描来源存在天然差异,按站点分层划分可避免"训练集全是 A 类扫描仪"的隐性偏倚;更严格的做法是留出数个完整站点做站点外验证。
- 按入组阶段校准(谨慎):第一/二/三阶段的蛋白尿阈值与人群富集策略不同;如果研究问题涉及跨阶段推广,把阶段做时序外验证(train 早期阶段、test 晚期阶段)是免费的稳健性检查。
划分之外还有两个容易忽视的配套动作:其一,划分协议写进论文——受控数据无公开划分,审稿人对划分细节的审视会加倍严格,把分组键、分层因子、随机种子与三侧构成表全部列出;其二,划分前快照数据版本——联盟资源持续更新,论文发表时他人拿到的新版数据可能与你的版本不同,明确记录数据版本(NIDDK-CR Version 1 或申请交付日期)才能让复现讨论有共同基础。
§5.2 任务设定建议
- 形态学任务:肾小球检测/分割(弱监督可用编号框);descriptor 预测(51 维多标签,注意稀有 descriptor 支撑度);片级 IFTA 回归/分级。
- 预后任务:以复合缓解终点为目标时用生存分析/多类缓解建模(完全/部分/未缓解),不要把"是否缓解"简化成单点二分类后忽略删失(见坑点 7)。
- 多模态任务:NDPSS 档案 + 肾小球/小管间质 RNA-seq 联合建模(Hodgin 2022 的聚类-通路分析是该路线的文献锚点);WGS/APOL1 作为协变量或分层因子。
- 儿童队列:Cohort B 无病理,仅可用于临床结局/复发预测语境,不得与影像任务混合。
§5.3 外部对照
NEPTUNE 与 CureGN 共享病种谱(CureGN 另含 IgA 肾病)并提供联合申请通道——把 CureGN 当作形态学模型的外部验证队列是最顺理成章的设计;官方也明确将 NDPSS 定位为"可向联盟外推广的肾活检标准化评分模型"。公开 WSI 集(如泛癌或前列腺穿刺数据)因染色与器官差异过大,只适合作泛化性压力测试,不适合作同域验证。
§5.4 常见任务设计反例
反向清单同样有信息量——以下是该数据集上容易踩坑的任务设计:
- 反例 1:tile 级二分类"病变 vs 非病变"——描述符是肾小球级属性,把片上随机 tile 都标成病变/正常会制造大量伪负样本(间质区域天然无肾小球描述符)。
- 反例 2:以病理诊断为唯一标签训练图像模型——丢弃了 51 维描述符的细粒度监督,且诊断本身受观察者变异影响;至少应同时输出描述符级预测。
- 反例 3:把 Cohort B 儿童的临床缓解数据与活检队列影像"对齐"——前者无组织,强行多模态等于对齐空集。
- 反例 4:跨入组阶段混训后直接报告总体指标——入组协议漂移会吞掉模型真实性能差异(见坑点 8),必须分层报告。
- 反例 5:以"切片"为单位做 k 折交叉验证——同患者切片散落在各折,泄漏程度与按 tile 划分相当。
每条反例的正面方案都已在前文(§5.1、§5.2 与坑点 3/8)给出,此处集中列出供立项评审时快速对照。
§6 AI 就绪指南
§6.0 建模任务全景
动手写代码前,先看这张任务全景表——NEPTUNE 上被文献验证过或结构上自然成立的 AI 任务:
| 任务 | 输入 → 输出 | 监督来源 | 文献锚点 |
|---|---|---|---|
| 肾小球检测/枚举 | WSI → 肾小球位置与编号 | NDPSS 跨切面肾小球标注 | Rosenberg 2016(WSI 计数准确性) |
| 描述符预测 | 肾小球 tile → 51 维多标签 | NDPSS 描述符评分 | Barisoni 2016(kappa 审计) |
| 形态学聚类/分型 | 患者级描述符占比 → 形态亚型 | 无监督 + 结局验证 | Hodgin 2022(X/Y/Z 三型) |
| 缓解/进展预后建模 | 形态学 + 临床基线 → 复合终点 | 36 个月随访结局 | Hodgin 2022(Cox 框架);Mariani 2018(IFTA) |
| 形态-分子关联 | 描述符档案 + RNA-seq → 通路映射 | 配对转录组 | Hodgin 2022(1,920 DEG) |
| IFTA 自动评分 | WSI → 片级 IFTA | NDPSS IFTA 评分(一致性优秀) | Mariani 2018 |
表中没有"诊断分类"任务——不是不能做,而是它不是这套数据结构的核心资产(理由见坑点 2)。
§6.1 环境准备
# Python 3.10+ 环境(conda 或 venv 均可)
python -m venv .venv && source .venv/bin/activate
pip install openslide-python pyvips tifffile pillow numpy pandas scikit-learn
pip install torch torchvision # 建模侧
pip install squidpy scanpy # 空间/单细胞侧探索(可选)
# 系统依赖:openslide 需安装本机库(Ubuntu: apt install openslide-tools)
WSI 生态注意:NEPTUNE 的 WSI 由各中心或 NIH 中央站点扫描,具体扫描仪型号与文件格式未在公开文献中统一枚举;OpenSlide 支持 SVS/NDPI/VMS 等常见整片格式,tifffile 可兜底金字塔 TIFF。拿到数据后第一件事是逐片校验 openslide.OpenSlide 能否打开、读出 level 金字塔,再谈其他。
§6.2 获取流程(辅助研究通道)
- 需求澄清:先在 tranSMART/cellxgene 上做侦察,确认所需队列规模、描述符与访视字段真实存在(每周三 12:00-13:00 东部时间有官方 office hours 可约)。
- 撰写申请:按官方模板填写辅助研究申请书,明确科学假设、所需数据/样本/WSI 清单、分析计划与人文受试者保护;须自带外部经费(人员、提取、交付成本由申请方承担)。
- 递交与沟通:发送至 neptune-study@umich.edu,至少在拟议外部经费申请提交日前 2-3 个月递交;期间与 DACC 确认数据可得性与预算。
- 双重审批:Ancillary Studies Committee(ASC)评审科学价值与资源占用,Steering Committee(SC)终审;获批后签署协议与数据安全条款。
- 交付与合规:DACC 准备数据文件并交付;批准范围之外不得留存、再分发或二次共享;成果发表需遵守致谢与数据引用规范(NIDDK-CR 资源须使用官方致谢声明)。
基因组子需求并行走 dbGaP:机构 PI 取得 dbGaP 账号资质 → 提交 DAR(Data Access Request)→ 签署 Data Use Agreement → 本地合规环境(不得上传公共云盘/外部计算节点)。
申请材料组成清单(按官方政策文件归纳,便于对照准备):
| 材料 | 作用 | 官方审查关注点(据政策文件) |
|---|---|---|
| 辅助研究申请书(官方模板) | 陈述假设、资源需求与分析计划 | 科学价值与可行性 |
| 预算与经费说明 | 证明外部经费可覆盖提取/交付成本 | 须有足够非 NEPTUNE 经费(含 DACC 管理成本) |
| 数据安全计划 | 说明存储、访问控制与销毁安排 | 人文受试者与数据保密合规 |
| 人文受试者保护说明 | 说明 IRB/伦理路径 | 对参与者的负担最小化 |
| 附件:合作者 CV/发表计划 | 支撑科学价值评估 | 与既有研究的项目范围重叠度 |
| 生物样本请求(如适用) | 逐管型列明样本需求 | 有限生物材料的谨慎使用与批准期限 |
审查规则全部出自官方政策文件(ASC + SC 双审、负担最小化、资源谨慎使用、外部经费要求);表中"关注点"为政策原文的归纳,具体表述以最新版政策文件为准。提前 2-3 个月的递交窗口里,最花时间的通常是预算核对与 DACC 的数据可得性确认——这两项都需要邮件往返,务必预留两周以上。
§6.3 WSI 读取与切图骨架
import openslide
import numpy as np
def load_slide_tiles(slide_path, tile=1024, level=0, tissue_thresh=0.15, max_tiles=256):
"""从单张 WSI 按网格抽取组织区域 tile。
参数名是通用的;slide_path 以官方实际分发的文件与命名为准。
"""
slide = openslide.OpenSlide(slide_path)
w, h = slide.level_dimensions[level]
step = tile # 无重叠网格;如需重叠自行调整
kept = []
for y in range(0, h - tile, step):
for x in range(0, w - tile, step):
patch = slide.read_region((x, y), level, (tile, tile)).convert("RGB")
arr = np.asarray(patch)
# 组织判定:饱和度/亮度粗筛,剔除背景玻片
sat = arr.max(axis=2).astype(int) - arr.min(axis=2).astype(int)
if (sat > 24).mean() < tissue_thresh:
continue
kept.append((x, y, arr))
if len(kept) >= max_tiles:
return kept
return kept
# 用法(示意):
# tiles = load_slide_tiles("neptune_biopsy_HE.svs") # 文件名以实际交付为准
# 每张切片返回带坐标的 tile 列表,坐标要随 NPZ/parquet 一起落盘,供后续对齐 NDPSS 注释
要点:① tile 坐标必须持久化,后续把 NDPSS 肾小球级注释映射回像素域全靠它;② 背景剔除阈值要按本批染色强度重新标定(不同中心染色深浅不同);③ 千兆级整片不要一次读入内存。
多染色序列是肾活检的独特之处——同一活检常规含 H&E、PAS、银染(如 Jones)等多个染色切面,各自突出不同结构。以下是一个跨染色对齐意识检查的最小示例:
import openslide
def slide_fingerprint(slide_path):
"""交付验收用的单切片指纹:格式、尺寸、金字塔与放大率元数据。"""
slide = openslide.OpenSlide(slide_path)
props = slide.properties
return {
"path": slide_path,
"format": slide.format, # 扫描格式(SVS/NDPI/…)
"dims": slide.dimensions, # Level-0 像素尺寸
"levels": slide.level_count, # 金字塔层数
"mpp_x": props.get("openslide.mpp-x"), # 微米/像素(标定用)
"mpp_y": props.get("openslide.mpp-y"),
"objective": props.get("openslide.objective-power"),
}
# 对每张切片输出指纹后:按"染色 × 中心 × 扫描通路"分组核对 mpp 与 objective 的一致性,
# 漂移明显的组要在 stain normalization 与空间标定中单独处理。
把指纹表打印出来人工过一遍,是识别坑点 6(染色/扫描漂移)成本最低的手段——比训练后分析特征分布便宜一个数量级。
§6.4 按参与者分组的训练管线(PyTorch)
<details>
<summary>展开完整 DataLoader 代码(约 60 行,点击查看)</summary>
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from sklearn.model_selection import GroupShuffleSplit
class GlomDescriptorDataset(Dataset):
"""肾小球 tile → NDPSS 多标签 descriptor 向量(示意实现)。
df 行 = 肾小球级记录:participant_id, slide_id, glom_id, tile_path, desc_* 列
1) 划分在参与者级完成;2) 样本级键是 (participant, glom),不是 tile。
"""
def __init__(self, df, desc_cols, transform=None):
self.df = df.reset_index(drop=True)
self.desc_cols = desc_cols
self.transform = transform
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
img = self._load(row.tile_path) # 你的 tile 读取/缓存实现
if self.transform:
img = self.transform(img)
target = torch.tensor(
row[self.desc_cols].to_numpy(dtype=np.float32))
# 组键与元信息随样本返回,便于聚合到肾小球/患者级
meta = (row.participant_id, row.slide_id, row.glom_id)
return img, target, meta
@staticmethod
def _load(path):
from PIL import Image
return Image.open(path).convert("RGB")
def patient_level_split(df, test_size=0.2, val_size=0.1, seed=42):
"""两级分组划分:先切出 test,再从剩余里切 val;组键均为 participant_id。"""
gss1 = GroupShuffleSplit(n_splits=1, test_size=test_size, random_state=seed)
trainval_idx, test_idx = next(gss1.split(df, groups=df.participant_id))
trainval = df.iloc[trainval_idx]
rel_val = val_size / (1 - test_size)
gss2 = GroupShuffleSplit(n_splits=1, test_size=rel_val, random_state=seed + 1)
train_idx, val_idx = next(gss2.split(trainval, groups=trainval.participant_id))
return (df.iloc[trainval_idx].iloc[train_idx],
df.iloc[trainval_idx].iloc[val_idx],
df.iloc[test_idx])
def make_loaders(df, desc_cols, batch_size=16, num_workers=4, seed=42):
train_df, val_df, test_df = patient_level_split(df, seed=seed)
# 划分后自检:三侧参与者必须零交集(防泄漏的最后防线)
s = lambda d: set(d.participant_id)
assert not (s(train_df) & s(val_df)) and not (s(train_df) & s(test_df)) \
and not (s(val_df) & s(test_df)), "participant leakage detected"
common = dict(desc_cols=desc_cols, num_workers=num_workers,
batch_size=batch_size, pin_memory=True)
train_loader = DataLoader(GlomDescriptorDataset(train_df, desc_cols),
shuffle=True, drop_last=True, **{k: v for k, v in common.items() if k != "desc_cols"},
collate_fn=None)
val_loader = DataLoader(GlomDescriptorDataset(val_df, desc_cols),
shuffle=False, **{k: v for k, v in common.items() if k != "desc_cols"})
test_loader = DataLoader(GlomDescriptorDataset(test_df, desc_cols),
shuffle=False, **{k: v for k, v in common.items() if k != "desc_cols"})
return train_loader, val_loader, test_loader
</details>
设计说明:① 样本聚合层级要显式——tile → 肾小球(跨切面平均/投票)→ 患者(描述符占比,即官方 morphologic profile 的口径);② 损失建议 BCEWithLogitsLoss + 每描述符正样本权重(稀有 descriptor 支撑度低);③ 评估按患者级聚合后再算指标,tile 级指标只作诊断用。
§6.5 八大坑点
⚠️ 坑点 1:没有"下载按钮"——把 NEPTUNE 当公开集规划项目直接翻车(分类:工程陷阱)
问题:NEPTUNE 所有资源(WSI、描述符、临床、样本)均受控分发:辅助研究申请要外部经费、双重审批、提前 2-3 个月;dbGaP 要机构资质。不少团队按"本周下载下周训"排期,结果卡在合规流程上数月。
症状:项目排期里"数据获取 1 周";论文投稿在即数据还没获批;审稿人问"数据是否可公开复现"无法回答。
解决:简单方法——立项时把申请周期(≥3 个月)写进甘特图,同步用 tranSMART/cellxgene 做侦察确认数据可得;进阶方法——一份辅助研究申请里捆绑影像+临床+基因组所有需求,避免二次评审;SOTA 方法——先用 GEO 已存的 RNA-seq(GSE219185/GSE197307)与公开方法学文献做方法预研,数据到位即切换。
参考:https://www.neptune-study.org/ancillary-studies ;NEPTUNE Ancillary Studies Policy and Procedures。
⚠️ 坑点 2:NDPSS 是"损伤模式描述符",不是诊断标签(分类:标签理解)
问题:描述符记录的是有/无型形态学观察(节段硬化、足突融合……),与疾病诊断是两个正交维度。直接把 51 维描述符当"FSGS 分类器"的输入特征并用病理诊断做监督,等于把两种语言混着用;反之,把描述符当"真值诊断"解释也会出错——同一诊断下患者的描述符组合高度异质。
症状:模型"预测 FSGS"的 AUROC 看着不错,但逐描述符误差分析发现模型学到的是簇发共现模式;解释图(saliency)指向的形态学特征与描述符手册对不上。
解决:简单方法——任务定义先分家:descriptor 预测是多标签任务,诊断分型是分类任务,缓解预后是生存任务,三件事三套评估;进阶方法——学 Hodgin 2022,用患者级描述符占比做无监督聚类得到形态型(X/Y/Z),再检验其与临床结局/分子通路的关联;SOTA 方法——多任务头(descriptor + cohort + outcome)共享主干,让形态学语言与临床语言在表示层对齐。
参考:Barisoni 2016(Mod Pathol 29:671-684);Hodgin 2022(AJKD 79:807-819)。
⚠️ 坑点 3:同一患者的多切片/多染色/多肾小球全是同源样本(分类:数据泄漏)
问题:一次活检产生多张 WSI(多染色、多切面),每张上几十个肾小球,全部挂在同一 participant_id 下。按切片或按肾小球随机划分,训练集与测试集会共享患者的染色风格、扫描来源与个体形态——指标虚高且不可复现。
症状:tile 级 AUROC 0.95+,患者级聚合后骤降;换一个站点的外部数据性能腰斩;审稿人用
participant追问划分协议时无法自证。
解决:简单方法——
GroupShuffleSplit(groups=participant_id),划分后断言参与者零交集(§6.4 代码已内置);进阶方法——按站点分层 + 留出完整站点做站点外验证;SOTA 方法——时序外验证(早期入组阶段训练、晚期阶段测试),同时检验入组协议漂移下的鲁棒性。
参考:Barisoni 2013(CJASN 8:1449-1459)跨切面编号协议;§5.1 划分建议。
⚠️ 坑点 4:人工描述符的 kappa 天花板——你的"金标准"本身有噪声(分类:评估误用)
问题:Mod Pathol 2016 可重复性研究中,48/51 个可评估肾小球描述符的读者间一致性仅 52% 达到中等(kappa>0.40)或以上;IFTA 与常用电镜描述符一致性优秀,但稀有/复杂描述符一致性偏低。把单一读者评分当无噪声真值训练与评测,模型性能被标注噪声卡住上限。
症状:加大模型/数据后指标停滞在某个平台;不同描述符的预测性能差异极大且与描述符难度(kappa)相关;多人重标测试集时指标波动明显。
解决:简单方法——评测集只保留一致性有据可查的描述符(如 IFTA、足突融合等优秀-良好区间),并在论文中报告描述符级 kappa;进阶方法——软标签(评分概率化)或多人评分取多数/加权;SOTA 方法——噪声感知训练(co-teaching/标签平滑)+ 把"读者一致性"作为校准目标的一部分报告。
参考:Barisoni 2016(Mod Pathol 29:671-684,含 kappa 分布);Zee 2018(Arch Pathol Lab Med 142:613-625)。
⚠️ 坑点 5:类别不平衡与稀有描述符支撑不足(分类:偏倚陷阱)
问题:病种分布天然偏斜(507 例活检队列:FSGS 203 / MCD 193 / MN 111);描述符层面更严重——可重复性研究里部分描述符因"观测不足"根本无法评估一致性,说明其在队列中出现极少。稀有 descriptor 的正样本可能只有个位数患者。
症状:多标签训练里稀有描述符 F1 恒为 0;过采样后训练集反复出现同几个患者的切片,等于变相泄漏; MN 类在小型测试集上指标方差巨大。
解决:简单方法——按宪法式做法先做支撑度审计,支撑度不足的描述符合并为父类(如"硬化相关")或不建任务;进阶方法——focal loss/加权采样按患者级而非 tile 级实施;SOTA 方法——罕见类少样本评估协议(每类独立报告支撑度与置信区间),必要时与 CureGN 合并队列增援。
参考:Drexler 2025(Glomerular Diseases 5:288-303)病种分布;Barisoni 2016 描述符支撑度。
⚠️ 坑点 6:多中心多染色的预处理陷阱—— stain shift 比你想的大(分类:预处理陷阱)
问题:WSI 来自本地扫描与 NIH 中央扫描两条通路,染色由各中心常规临床流程完成——H&E/PAS/银染的色调、扫描仪响应、分辨率都存在中心间漂移。跨中心训练的模型容易把"染色风格"当特征。
症状:模型在训练站点表现好、换站点性能下滑;对同一肾小球跨切面预测不一致;t-SNE 上样本按站点而非病理特征聚簇。
解决:简单方法——每张片的背景/归一化参数独立标定,训练前做 stain normalization(Macenko/Reinhard 类方法);进阶方法——颜色增广(hue/saturation jitter)+ 强度归一化按染色类型分组;SOTA 方法——染色不变表征(自监督预训练 + 染色域对抗),并把"站点"作为评估分组的显式维度。
参考:Barisoni 2013 流程(local/central 双通路);§4.4 质控描述。
⚠️ 坑点 7:结局是"复合缓解终点 + 36 个月删失",不是二分类(分类:评估误用)
问题:NEPTUNE 主要结局是尿蛋白与肾功能变化的复合缓解指标(完全/部分/未缓解),随访 36 个月且存在删失。把结局压成"某时间点是否缓解"的二分类,既丢失缓解质量信息,也把删失患者错误计入"未缓解"。
症状:模型"预测缓解"的表观性能不错,但 KM 曲线分层看不出风险分离;与已发表 NDPSS-结局关联研究(HR 值)无法对标。
解决:简单方法——按文献口径复现三分类缓解建模或 Cox 生存模型(结局定义、时间窗完全对齐原论文);进阶方法——联合建模缓解状态与 eGFR 纵轨迹(joint modeling);SOTA 方法——机器学习生存模型(如随机生存森林/DeepSurv)+ 时间依赖 AUROC(IPCW 校正)报告。
参考:NCT01209000 结局定义;Hodgin 2022(Cox 模型 + eGFR 混合效应模型的分析框架)。
⚠️ 坑点 8:队列构成随资助阶段漂移——时序与人群偏倚叠加(分类:偏倚陷阱)
问题:第一阶段蛋白尿入组阈值 >500 mg/day,第二/三阶段提高到 >1,500 mg/day 并有意富集非洲血统 + 重度蛋白尿(APOL1 相关)人群;儿童 Cohort B 无活检。跨阶段混合训练时,"入组协议"本身成了最强混杂变量。
症状:加入"入组年份"后模型性能大幅变化;ancestry 相关特征重要性异常高;儿童临床数据混进影像任务导致对齐失败。
解决:简单方法——数据表里保留入组阶段/年份与 Cohort 标签,任何分析先按阶段分层描述;进阶方法——把阶段做时序外验证(坑点 3 的 SOTA 方案);SOTA 方法——敏感性分析矩阵(阶段 × 病种 × 年龄段),并在迁移评估中显式报告人群构成差异。
参考:Kidney News 14(4) 各阶段入组标准;NIDDK-CR 页面第二周期富集设计描述。
§6.6 评估协议设计
NEPTUNE 上的评估协议要与三个"文献锚点"对齐,否则结果无处安放:
- 标注质量锚点:报告描述符级预测时,逐项附上该描述符在 Barisoni 2016 中的读者间 kappa——让读者能判断"模型上限是否被标注噪声限制"。
- 临床结局锚点:缓解/进展模型用与 Hodgin 2022 相同的口径(Cox 调整模型 + eGFR 纵向混合效应),报告 HR 而非只有 C-index。
- 结构层级锚点:指标按 肾小球级 → 患者级 两级分别报告;tile 级指标只能出现在消融表里。
推荐的分层评估表骨架:
| 评估层级 | 指标 | 分组维度 | 必报项 |
|---|---|---|---|
| 肾小球级 | 多标签 AUROC/F1(逐描述符) | 病种、染色 | 支撑度、95% CI |
| 患者级 | 形态档案误差、聚类一致性 | 入组阶段 | 与 X/Y/Z 文献聚类的对应率 |
| 结局级 | HR(95% CI)、时间依赖 AUC | 病种 × 阶段 | 删失处理说明 |
| 泛化性 | 站点外/阶段外性能衰减 | 留出站点 | 训练/测试构成对比 |
§6.7 落地检查清单
- [ ] 申请范围(数据项、样本量、用途)与协议完全一致,无超范围留存
- [ ] 划分键 = participant_id,三侧零交集断言通过
- [ ] 描述符支撑度与读者间 kappa 已审计,任务空间据此裁剪
- [ ] tile 坐标与肾小球编号映射已落盘并抽检
- [ ] 染色归一化按染色类型与通路分参数标定
- [ ] 结局建模对齐文献口径(复合缓解 + 删失处理)
- [ ] 评估报告含站点分层与阶段敏感性分析
- [ ] 发表致谢与数据引用符合 NEPTUNE/NIDDK-CR 官方要求
§6.8 三个典型工作流配方
把前述组件组装成三条端到端路线。每条给出阶段拆解与产出物,便于直接映射成项目计划:
配方 A:NDPSS 描述符预测(纯影像)
输入 : 获批 WSI + NDPSS 肾小球级注释
阶段 1 交付验收 → 切片指纹表 + 肾小球编号抽检报告
阶段 2 预处理 → tile 化 + 坐标落盘 + 染色归一化参数表
阶段 3 划分 → 按参与者的三级划分 + 构成表
阶段 4 建模 → tile 编码器 + 肾小球聚合 + 51 维多标签头
阶段 5 评估 → 逐描述符 AUC(附 kappa 对照)+ 站点分层
产出物: 描述符预测模型 + 一致性审计附录
配方 B:形态学预后建模(影像 + 临床)
输入 : 配方 A 的患者级形态档案 + 基线临床变量 + 缓解结局
阶段 1 变量对齐 → 访视窗对齐 + 结局定义逐字核对
阶段 2 特征工程 → 描述符占比(官方口径)+ 临床基线协变量
阶段 3 建模 → Cox(缓解时间)+ eGFR 纵向混合效应
阶段 4 评估 → HR(95% CI)+ 时间依赖 AUC(IPCW)
阶段 5 敏感性 → 阶段 × 病种 × 年龄段分层矩阵
产出物: 预后模型 + 与 Hodgin 2022 对标的关联表
配方 C:形态-分子多模态(影像 + 转录组)
输入 : 配方 A/B 产出 + 肾活检 RNA-seq(区室分离)
阶段 1 模态清点 → 各模态参与例数统计(避免全模态假设)
阶段 2 对齐 → §4.8 四道关卡逐项通过记录
阶段 3 联合建模 → 形态聚类 × 差异表达 × 通路富集
阶段 4 解释 → 簇特异通路 → 描述符 → 图像区域的归因链
产出物: 多模态 atlas + 机制假设清单(可对接 NEPTUNE Match 语境)
三条配方的共同前提都是 §6.2 的合规获取与 §6.7 的检查清单——先地基后楼层。
§7 质量评估与局限性
§7.1 偏倚与局限速览
| 偏倚/局限 | 表现 | 对 AI 建模的影响 | 缓解 |
|---|---|---|---|
| 选择偏倚 | 三级学术中心转诊人群,重症过度代表 | 轻症谱外推能力未知 | 论文显式声明适用域 |
| 入组协议漂移 | 阶段间蛋白尿阈值与人群富集不同 | 阶段成为混杂变量 | 阶段分层 + 时序外验证 |
| 人群构成 | Phase 2 有意富集非洲血统重度蛋白尿者 | ancestry 与结局关联需谨慎解释 | APOL1 作为协变量显式建模 |
| 标注噪声 | 描述符读者间 kappa 52% 达中等以上 | 标签天花板 | 一致性感知评测(坑点 4) |
| 类别不平衡 | FSGS/MN 比例失衡、稀有 descriptor 支撑不足 | 稀有类不可训 | 支撑度审计 + 父类合并 |
| 结构性缺口 | Cohort B 无病理;随访 36 个月封顶 | 长期结局不可见 | 任务设计阶段规避 |
表中六项并非同等权重:选择偏倚与入组协议漂移是队列级的(影响所有任务),标注噪声与类别不平衡是任务级的(影响监督学习),结构性缺口是设计级的(决定哪些任务根本不存在)。立项时按层级自查:先确认任务在队列级偏倚下仍有外部效度,再谈任务级优化。
§7.2 标注质量细节
可重复性研究的具体数字值得全文记住:12 名病理医生(8 名 NEPTUNE + 4 名非联盟)参与;51 个肾小球描述符中 48 个有足够观测可计算读者间 kappa(17 个中等 0.40-0.60、8 个良好 0.60-0.80,52% 达中等或更好);读者内一致性基于 131 个肾小球 × 3 轮测试;IFTA 在 244 例 WSI 上一致性优秀;电镜 4 个足细胞描述符(178 例)达中-优秀,足突融合与微绒毛转化等临床常用项良好-优秀。结论:NEPTUNE 标注是肾病理领域可复现性证据最充分的协议之一,但"充分"不等于"完美"——把它当有噪声的金标准来设计实验。
§7.3 覆盖与时效
队列自 2010 年持续招募,2024-10 口径 1,049 人;组织学与影像资源仅覆盖活检队列(约半数参与者),儿童无活检队列只有临床维度;36 个月随访窗意味着更晚发生的结局(如远期 ESRD)覆盖不全;NIDDK-CR 存档包为 Version 1(2023-02-07),后续新增数据以联盟现行交付为准。
§7.4 合规与伦理
数据经 HIPAA 合规脱敏并受控分发;基因组数据因其再识别风险走 dbGaP 严格通道;患者报告结局与 SMS 数据按知情同意条款限定用途;辅助研究须 ASC + SC 双重审批并接受参与者负担审查;发表须使用官方致谢声明(NIDDK-CR 资源明确要求声明"本稿件非 NEPTUNE 研究官方产出"类文本)。
§7.5 已知短板清单
- 无公开下载与公开基准,AI 复现门槛全行业最高档
- 无官方 train/test 划分、无公开预处理脚本
- 扫描仪型号与染色库存未系统公开,预处理参数需实测标定
- 描述符参考手册随申请交付,公开文献只覆盖部分描述符定义
- 队列以北美人群为主,跨人群外推证据有限
§7.6 适用性判断
选 NEPTUNE 如果:你的研究问题需要"形态学定量 + 分子谱 + 纵向结局"三者锚定同一患者;你愿意为合规获取投入 3 个月以上;你的目标模型以临床转化(而非刷榜)为导向。
不选 NEPTUNE 如果:你只是需要一个公开肾病理数据集练手(用公开 WSI 集更合适);你的课题依赖大规模无标注预训练语料;你的项目周期容不下受控申请流程。
灰区情形的两个判据:① 如果你的核心贡献是"方法"而非"规模"(如新的弱监督形态学习算法),NEPTUNE 的高质量描述符标注能放大方法优势,值得申请;② 如果你的核心贡献是"预训练"(病理基础模型),数百例受控切片的数据量无法支撑,建议改用公开 WSI 语料预训练 + NEPTUNE 做下游微调验证的组合路线——但注意这同样需要走申请流程拿到微调数据。
§7.7 DAIMS 数据质量评估
下表按 DAIMS(Data AI-readiness Information Management Standard)24 项逐条评估 NEPTUNE:
| # | 维度 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式数据集 | ✅ | tranSMART 本体化组织 + 各资源线结构化交付 |
| 2 | 唯一标识符 | ✅ | participant → slide → glomerulus 三级唯一键贯穿 |
| 3 | 特殊字符处理 | ✅ | 官方交付为英文结构化数据,无编码问题记录 |
| 4 | 重复行 | ⚠️ | 跨切面/多染色同肾小球系设计性重复,须按分析单元去重 |
| 5 | 缺失值编码 | ✅ | 临床访视缺失有统一访视窗编码 |
| 6 | 标签标识 | ✅ | 描述符参考手册 + 网络共识培训定义标签语义 |
| 7 | 罕见类分组 | ⚠️ | 稀有 descriptor 支撑不足部分无法评估(官方研究已明示) |
| 8 | 偏倚评估 | ✅ | 队列论文系统报告入组协议与人群构成 |
| 9 | 数据字典 | ✅ | 官方 Data Dictionary 随申请材料提供 |
| 10 | 信息性缺失解释 | ⚠️ | 缺失机制(如儿童无活检)可推断但未逐字段文档化 |
| 11 | 设备记录 | ⚠️ | 扫描仪型号与染色库存未系统公开 |
| 12 | 共线性讨论 | ⚠️ | 描述符间聚类结构见于文献但无官方共线性报告 |
| 13 | 编码映射 | ✅ | 描述符术语标准化(descriptor reference manual) |
| 14 | 时间戳处理 | ✅ | 标准化访视窗(4-6 个月间隔)与随访日程 |
| 15 | 划分建议 | ❌ | 无官方划分,须自建 |
| 16 | 泄漏讨论 | ✅ | 跨切面同肾小球的设计性同源在方法文献中有明确说明 |
| 17 | 标签分布 | ✅ | 病种分布(507 例三病种计数)公开可稽 |
| 18 | 测量偏倚 | ⚠️ | 中心化检验降低但未消除站点间测量差异 |
| 19 | 外部验证建议 | ✅ | 官方支持 NDPSS 联盟外推广并提供 CureGN 联合通道 |
| 20 | 版本记录 | ✅ | NIDDK-CR Version 1 + 各资助阶段协议变更均有公开记录 |
| 21 | 预处理脚本 | ⚠️ | 描述符手册随申请交付;公开脚本生态缺失 |
| 22 | 合规要求 | ✅ | dbGaP/辅助研究协议/致谢声明链条完整 |
| 23 | 多模态对齐 | ✅ | 形态学-组学-结局按参与者贯通(Hodgin 2022 即范例) |
| 24 | 去标识化 | ✅ | HIPAA 脱敏 + 受控分发 + 基因组单独管控 |
DAIMS 评分:16.5 / 24
评分解读:良好偏上——标识体系、标签语义、多模态对齐与合规链条是本数据集的强项(这在受控医学影像资源中属于第一梯队);失分集中在"公开生态"维度:无官方划分、无公开脚本、设备与字典不完全公开——这些恰恰是受控资源难以两全的部分。
对你意味着什么:如果你有能力走完合规流程,NEPTUNE 给你的是"标注语义清晰 + 多模态锚定"的高质量底座;但你要自带三样东西——划分协议、预处理标定与外部验证设计。把它当"需要自己装配的高档零件箱",而不是"开箱即用的基准"。
§7.8 外部验证矩阵
| 验证场景 | 数据来源 | 评估任务 | 结果/状态 | 关键发现 |
|---|---|---|---|---|
| 非 NEPTUNE 病理医生一致性 | 4 名联盟外病理医生(Mod Pathol 2016) | NDPSS 描述符评分一致性 | 与联盟内医生一致,kappa 随共识培训提升 | 协议可推广性的直接证据 |
| 形态型与分子通路内部交叉验证 | 库内 RNA-seq(Hodgin 2022) | 聚类 × 差异表达 | X 簇 1,920 个 DEG,免疫/炎症通路激活 | 形态-分子关联在库内闭环 |
| CureGN 联合队列 | CureGN(含 IgAN) | 队列迁移/联合研究 | 官方联合申请通道在运行 | 最现实的 Prospect 外部验证路径 |
| 联盟外机构评分推广 | 国际合作(官方定位) | NDPSS 标准化评分 | 官方声明可扩展至联盟外 | 尚无公开的性能对照报告 |
一句话总结:NDPSS 作为协议的外部可推广性有方法学证据,但基于 NEPTUNE 数据训练的 AI 模型目前没有公开的跨队列性能基准——如果你的论文宣称泛化,请自己补上外部验证这一环。
§7.9 质量常见问答
Q1:NDPSS 描述符能当"ground truth"直接用吗?
能,但要带上噪声模型。它是多中心共识协议的产物,一致性有系统审计(这是多数医学影像数据集做不到的);同时它有已知的 kappa 分布——按描述符分层使用,把低一致性项从主指标里剔除。
Q2:标注里有没有"肾小球编号错了/跨切面关联断了"的可能?
跨切面编号协议本身就定义了关联规则(同一肾小球在各切面保持唯一编号直到消失),且 Rosenberg 2016 专门验证过数字肾小球计数的准确性改进。拿到数据后仍建议抽样人工复核关联一致性——任何人工流程都有个案错误。
Q3:临床数据的时间戳精度够做时序建模吗?
访视按 4-6 个月标准窗组织,窗口内的检验统一中心化测定——做"访视级"时序建模没问题;但不要假设访视内事件有精确到小时的前后顺序(这与重症监护数据库完全不同)。
Q4:儿童数据能训练成人模型吗?
儿科与成人肾小球形态、病种构成、激素反应谱差异显著;按年龄分层是底线,更推荐儿科作为独立评估域报告。
§8 基准性能与生态
§8.1 关键定量结果(文献基线,非排行榜)
NEPTUNE 没有公开排行榜(受控数据决定的结构性特征)。有意义的"性能锚点"来自其自身方法学文献:
| 研究 | 任务 | 关键定量结果 | 发表 |
|---|---|---|---|
| Barisoni 2013 | 数字病理管线可行性 | 多中心 WSI 流程落地:扫描-质控-标注-描述符评分闭环;肾小球计数准确性提升 | CJASN 8(8):1449-1459, DOI 10.2215/CJN.08370812 |
| Rosenberg 2016 | WSI 肾小球计数准确性 | 数字病理显著改善肾小球枚举准确性 | PLoS One 11(6):e015644, DOI 10.1371/journal.pone.0156441 |
| Barisoni 2016 | NDPSS 可重复性 | 48/51 描述符读者间 kappa:52% 中等以上;IFTA 优秀;电镜常用项良好-优秀;论文获 58+ 次 Scopus 引用 | Mod Pathol 29(7):671-684, DOI 10.1038/modpathol.2016.58 |
| Zee 2018 | 评分策略可行性 | 不同评估策略(全片 vs 采样)可重复性与工作量权衡 | Arch Pathol Lab Med 142(5):613-625, DOI 10.5858/arpa.2017-0181-OA |
| Mariani 2018 | IFTA 预后价值 | WSI 上 IFTA 评分预测蛋白尿性肾小球病结局 | Nephrol Dial Transplant 33(2):310-318 |
| Royal 2020 | 超微结构预后 | 电镜足细胞特征预测临床结局 | J Am Soc Nephrol 31(4):841-854 |
| Hodgin 2022 | 形态学聚类 + 分子关联 | 221 例、37 描述符 → X/Y/Z 三型(56/68/97 人);Y/Z 缓解 HR 1.95/3.29,进展 HR 0.22/0.11;X 簇 1,920 DEG | Am J Kidney Dis 79(6):807-819, DOI 10.1053/j.ajkd.2021.10.004 |
复现提示:上表数值全部锚定已发表论文;你在受控数据上的复现结果应与"读者内一致性 + kappa 分布 + 聚类 HR"三级证据对话,而不是与某个 leaderboard 分数对话。
与这些基线对话的正确姿势:先把任务映射到上表的某一行(同一输入、同一结局定义),再谈性能比较——例如你的"描述符预测模型"应报告与 Barisoni 2016 相同描述符子集上的表现,并讨论一致性上限;你的"缓解预测模型"应使用与 Hodgin 2022 相同的 Cox 调整变量集合。脱离口径的数字对比在评审中不但无效,还会被认定为方法学不严谨。
§8.2 生态工具
tranSMART——申请前的侦察平台。官方 web 平台,以本体化组织提供临床、生物标志与生物样本数据的多维探索;NDPSS 描述符形态学档案(descriptor-based morphologic profile)也在其中呈现。它解决的是辅助研究申请里最常见的信息不对称:“我到底能不能拿到足够多的 X 类患者 + Y 描述符?”——在 tranSMART 上跑一遍队列计数,申请书里的数据需求就从拍脑袋变成了可验证清单。访问需申请,官方每周三中午(东部时间)开设 office hours 答疑。
cellxgene(NEPTUNE-OCEAN)——单细胞分辨率的在线探索。官方 cellxgene 实例支持从单基因分析到三-四层患者分层的完整谱系操作。对 snRNA-seq 相关课题,它是零成本验证"数据里有没有我要的细胞类型与分层信号"的第一站,避免把单细胞需求写进正式申请后才发现数据形态不符。
NEPTUNE Match——机制匹配的工程化样板。作为联盟最新的子研究,NEPTUNE Match 用参与者的研究数据与样本寻找匹配的临床试验,把"机制生物标志 → 试验入组"做成了面向患者的管线。对 AI 团队,它是"这类数据在精准医学管线里如何被消费"的活案例,也提示了与试验匹配相关的建模机会空间。
NIDDK-CR 与 dbGaP——存档与基因组双通道。NIDDK Central Repository 的 R4R 平台承载数据包与标本请求(附带官方致谢声明义务);dbGaP 承载 WGS/WES 的合规访问。两者与辅助研究通道共同构成"影像/临床/基因组"全需求的三路分发网络,且相互之间在参与者 ID 层可链接(链接规则随申请交付)。
§8.3 影响力画像
105 篇论文、205 项获准辅助研究、216+ 项研究使用(官方口径);方法学论文(Barisoni 2013/2016)成为肾脏数字病理的引用基础;NDPSS 被官方定位为"可向联盟外推广的肾活检标准化评分模型"。在肾病理 AI 的语境里,NEPTUNE 的生态位是"协议与标注标准的策源地",而非"算力竞技场"。
引用影响的一个可核对锚点:NDPSS 可重复性论文(Barisoni 2016)在 PlumX 记录中已有 58 次 Scopus/CrossRef 引用——对一篇标注协议论文,这是其方法论被持续使用的直接信号;联盟层面的累计引用远高于此,但没有公开的统一计数,引用时请逐论文核对。
§8.4 辅助研究的使用光谱
官方对 205 项获准辅助研究的描述是"从方法学开发到 II 期临床试验"。把这条光谱翻译成 AI 研究者可参照的项目类型:
| 光谱位置 | 项目类型 | 对 AI 团队的启示 |
|---|---|---|
| 方法开发端 | 形态学评分策略、一致性方法学(Zee 2018 即属此类) | 标注协议本身可以是研究贡献 |
| 观察性分析端 | 形态-结局-组学关联(Hodgin 2022、Mariani 2018) | 数据集的核心产出模式 |
| 技术转化端 | 数字病理工具验证、计数准确性(Rosenberg 2016) | 工程改进有明确的发表路径 |
| 临床试验端 | 以队列为基础招募的 II 期试验 | 影像 AI 若进入试验层,NEPTUNE 是合规样本源 |
| 训练与教育端 | 肾小球疾病研究者培养项目 | 方法论文档(如本页引用的手册)即教学材料 |
申请选题若能落位在光谱的"尚无人区"(例如多模态基础模型在 NDPSS 协议上的系统评测),获批讨论空间更大——委员会评审关注科学价值与资源占用,"有人做过且只差一个变体"的选题相对吃亏。
§8.5 与开放资源的组合策略
受控与开放不是二选一,实操中有两条成熟的组合路线:
- 开放预训练 + 受控微调:用公开 WSI 语料(如 TCGA 肾癌、公开肾活检集)预训练编码器,NEPTUNE 数据用于 NDPSS 描述符层面的下游评测——既省算力又满足"方法在高质标注上验证"的叙事。
- GEO 先行 + 全栈跟进:先用公开通道的 RNA-seq(GSE219185/GSE197307)完成通路分析预研,辅助研究获批后再补齐形态学与临床维度,一次性产出完整的多模态论文。
两条路线共同的合规红线:预训练语料与 NEPTUNE 数据之间不得存在未获批的患者级链接;公开语料的切片若与 NEPTUNE 来源重叠(同一患者参与多研究),须以 DACC 的链接规则为准逐例核对。
§8.6 跟进联盟动态的入口
NEPTUNE 是活跃联盟,规模、资源与协议都会持续演进。四个值得收藏的动态入口:
- 官网数字栏(neptune-study.org 首页):中心数、论文数、辅助研究数的官方滚动更新——引用规模时以这里为最新口径。
- ASN Kidney Week 年度信息摘要:每年 11 月的 INFO 海报是入组总数最系统的年度快照(2019 年 796 人、2024 年 1,049 人都出自此处)。
- office hours:每周三 12:00-13:00(美国东部时间),申请前答疑的最短路径。
- RDCRN 生态:NEPTUNE 隶属的罕见病临床研究网络会不定期发布跨联盟的数据共享机会,儿童肾病相关的新联盟项目(如 Nephrotic Syndrome 的后续网络)通常在此先公告。
对论文作者,还有一条隐性规范:联盟产出以 105 篇计,其中方法学与临床论文持续更新中——投稿前用官方论文列表核对是否有与你课题直接相关的最新发表,避免"不知情复现"。
§9 相关资源与引用
§9.1 官方与数据入口
| 资源 | URL |
|---|---|
| 官方主页 | https://www.neptune-study.org/ |
| 联盟介绍 | https://www.neptune-study.org/about |
| 辅助研究申请入口 | https://www.neptune-study.org/ancillary-studies |
| ClinicalTrials.gov 注册页 | https://clinicaltrials.gov/study/NCT01209000 |
| NIDDK Central Repository(数据包 DOI 10.58020/f2ae-n094) | https://repository.niddk.nih.gov/study/115 |
| dbGaP(WGS) | phs003210.v1.p1 |
| GEO(RNA-seq) | GSE219185 / GSE197307 |
| 辅助研究政策文件 | https://med.stanford.edu/content/dam/sm/mchri/documents/kidney-innovation-fund/neptune/NEPTUNEAncillaryStudiesPolicyandProcedures.pdf |
使用说明:① 官方主页与辅助研究页是唯一权威的申请信息来源,本页仅为导航摘要,申请前务必以官网最新版本为准;② dbGaP 与 GEO 条目为 accession 记录,访问方式以其页面标注为准;③ NIDDK-CR 页面同时承载官方致谢声明全文——用其资源发表时逐字采用,不要自行改写。
§9.2 BibTeX
@article{gadegbeku2013design,
title = {Design of the Nephrotic Syndrome Study Network (NEPTUNE) to evaluate primary glomerular nephropathy by a multidisciplinary approach},
author = {Gadegbeku, Crystal A and Gipson, Debbie S and Holzman, Lawrence B and others},
journal = {Kidney International},
volume = {83},
number = {5},
pages = {749--756},
year = {2013},
doi = {10.1038/ki.2012.446}
}
@article{barisoni2013digital,
title = {Digital pathology evaluation in the multicenter Nephrotic Syndrome Study Network (NEPTUNE)},
author = {Barisoni, Laura and Nast, Cynthia C and Jennette, J Charles and others},
journal = {Clinical Journal of the American Society of Nephrology},
volume = {8},
number = {8},
pages = {1449--1459},
year = {2013},
doi = {10.2215/CJN.08370812}
}
@article{barisoni2016reproducibility,
title = {Reproducibility of the NEPTUNE descriptor-based scoring system on whole-slide images and histologic and ultrastructural digital images},
author = {Barisoni, Laura and Troost, Jonathan P and Nast, Cynthia and others},
journal = {Modern Pathology},
volume = {29},
number = {7},
pages = {671--684},
year = {2016},
doi = {10.1038/modpathol.2016.58}
}
@article{hodgin2022quantification,
title = {Detailed Quantification of Glomerular Structural Lesions Associates with Clinical Outcomes and Transcriptomic Profiles in Nephrotic Syndrome},
author = {Hodgin, Jeffrey B and Mariani, Laura H and Zee, Jarcy and others},
journal = {American Journal of Kidney Diseases},
volume = {79},
number = {6},
pages = {807--819},
year = {2022},
doi = {10.1053/j.ajkd.2021.10.004}
}
@misc{kretzler2023neptune,
title = {Nephrotic Syndrome Study Network (NEPTUNE) (Version 1)},
author = {Kretzler, Matthias},
year = {2023},
publisher = {NIDDK Central Repository},
doi = {10.58020/f2ae-n094}
}
§9.3 引用与致谢义务
使用 NEPTUNE 资源的发表需:① 引用设计与/或方法学论文(上列);② 使用 NIDDK-CR 资源时附官方致谢声明(声明稿件非 NEPTUNE 官方产出、资源由 NIDDK-CR 提供);③ 遵守辅助研究协议中的发表与预告条款。医疗语境引用建议同时给出 dbGaP accession(phs003210.v1.p1)与 GEO 编号以便溯源。
致谢文本的具体措辞以 NIDDK-CR 页面与批准协议提供的版本为准——官方声明的语义是精确的(明确区分"资源提供方"与"内容责任方"),改写可能违反数据使用条款的引用要求。若研究同时使用 NEPTUNE 与 CureGN 资源,两个联盟的致谢与引用义务要分别履行,联合申请通道简化的是审批流程,不是引用义务。
§9.4 许可证要点
NEPTUNE 无单一开源许可证:WSI/临床/描述符按 NEPTUNE 辅助研究协议交付;基因组数据按 NIH Genomic Data Sharing 政策经 dbGaP 受控访问;存档包按 NIDDK Central Repository 数据请求条款分发。三条通道的共同内核是:获批范围内的使用 + 禁止再分发 + 结果回馈义务。
§10 AI 使用声明卡
§10.1 工具与模型记录
| 工具/模型 | 使用时间 | 用途 |
|---|---|---|
| WebSearch(多源检索) | 2026-09-17 | 6 组检索:① 官方站点与联盟概况(neptune-study.org 主页/About)② dbGaP/NIDDK-CR 获取途径与资源清单 ③ 数字病理管线与 NDPSS 论文(Barisoni 2013/2016、Hodgin 2022)④ 队列规模口径(ASN 2019/2024、Kidney News)⑤ 引用快照与 NDPSS 衍生论文 ⑥ CureGN 联合通道与申请材料 |
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 汇编、§1-§10 结构化写作、§6 代码示例、JSON-LD 构建 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 neptune-study.org 官方页面、NIDDK Central Repository、dbGaP/GEO 记录与已发表论文中整理结构化信息;(2) 生成 §6 的 WSI 读取与 DataLoader 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
AI 未参与的工作:对官方政策文件的效力判断、对临床医学内容的最终认定、以及任何超出公开文献范围的数据推断。本页面所有规模数字均保留原始口径与来源标注,AI 在整理时被明确禁止跨口径换算或合并——这一约束同样适用于未来基于本页的二次创作。
§10.3 输入来源
- NEPTUNE 官方主页与 About 页(联盟概况、31 中心、105 论文/205 辅助研究数字)— https://www.neptune-study.org/ 、 https://www.neptune-study.org/about
- NEPTUNE Ancillary Studies 页(资源清单、tranSMART/cellxgene、NDPSS profile)— https://www.neptune-study.org/ancillary-studies
- NEPTUNE Ancillary Studies Policy and Procedures(审批流程、成本条款)— Stanford Medicine 托管 PDF
- NIDDK Central Repository NEPTUNE 页(DOI 10.58020/f2ae-n094、dbGaP phs003210.v1.p1、GEO GSE219185/GSE197307、两周期招募计划)— https://repository.niddk.nih.gov/study/115
- ClinicalTrials.gov NCT01209000(设计、结局、排除标准)— https://clinicaltrials.gov/study/NCT01209000
- Gadegbeku et al. 2013, Kidney Int 83:749-756(联盟设计论文)
- Barisoni et al. 2013, CJASN 8:1449-1459(数字病理管线)
- Barisoni et al. 2016, Mod Pathol 29:671-684(NDPSS 可重复性;PlumX 引用快照 58)
- Hodgin et al. 2022, AJKD 79:807-819(NDPSS 定量聚类研究;medRxiv 预印本 2021.09.16.21263706)
- Zee et al. 2018, Arch Pathol Lab Med 142:613-625;Mariani et al. 2018, NDT 33:310-318;Royal et al. 2020, JASN 31:841-854;Rosenberg et al. 2016, PLoS One 11:e015644
- ASN Kidney Week 2019/2024 信息摘要(796 与 1,049 人口径)
- Kidney News 6(7) 与 14(4) 特稿(阶段史、1,100+ 口径、儿童队列 170+)
- Drexler et al. 2025, Glomerular Diseases 5:288-303(507 例活检病种分布)
- Stanford Medicine Funding Resources 页(NEPTUNE-CureGN 联合申请材料)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(NS/FSGS/MCD/MN 病理与 ICD-11 映射) | 千方病案医学编辑部 | 与教科书及 NEPTUNE 官方描述交叉比对 | 已完成 |
| §3 队列设计与规模口径 | 千方病案医学编辑部 | NCT01209000 + ASN 摘要 + NIDDK-CR 三源交叉核对 | 已完成 |
| §4 NDPSS 结构与链接键 | 千方病案医学编辑部 | Barisoni 2013/2016 方法学原文比对 | 已完成 |
| §6 获取流程与代码示例 | 千方病案医学编辑部 | 官方辅助研究政策文件 + 代码静态走查 | 已完成 |
| §7 DAIMS 24 项评估 | 千方病案医学编辑部 | 逐项溯源至 FACTS 清单来源 | 已完成 |
| §C JSON-LD 结构 | 千方病案医学编辑部 | 与 frontmatter schema_org 一致性核对 | 已完成 |
§10.5 更新记录
| 版本 | 日期 | 变更 | 依据 |
|---|---|---|---|
| 1.0 | 2026-09-05 | 首次发布:全条目 10 章 + INFOBOX + JSON-LD | 6 组 WebSearch 多源核实(2026-09-17 记录),FACTS 清单 40+ 条溯源 |
后续更新触发条件(任一满足即应修订):① 联盟公布新的累计入组口径(ASN Kidney Week 年度信息摘要);② dbGaP/NIDDK-CR 发布新版本数据包;③ NDPSS 相关基准或手册公开;④ 辅助研究申请流程条款变更。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- rosmap — 共享标签:医学影像 / 病理图像 / 队列研究
- panda — 共享标签:医学影像 / 病理图像 / 图像分类
- acevedo-blood — 共享标签:医学影像 / 病理图像 / 图像分类
- bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类
- breakhis — 共享标签:医学影像 / 病理图像 / 图像分类
- bracs — 共享标签:医学影像 / 病理图像 / 图像分类
- breastpathq — 共享标签:医学影像 / 病理图像 / 图像分类
- palm — 共享标签:医学影像 / 病理图像 / 图像分类
- camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类
- unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

