信息速览

ProteomeXchange — 全球蛋白质组学数据开放联盟 AI-Ready Wikipedia | 千方病案医数集
INFOBOX
| 数据集名称 | ProteomeXchange |
| 英文全称 | ProteomeXchange Consortium |
| 别名/简称 | PX、PX Consortium、ProteomeCentral(统一检索门户) |
| 疾病分类 | 多疾病谱聚合(ICD-11:5A11 2 型糖尿病 / 2C60 乳腺癌 / 8A80 阿尔茨海默病 / 1G4Z 脓毒症 / 1D92 COVID-19 等均在库内有对应数据集) |
| SNOMED CT | 73211009 Diabetes mellitus / 254837009 Malignant neoplasm of breast / 26929004 Alzheimer’s disease / 91302008 Sepsis(详见 §2.2) |
| 数据模态 | 质谱蛋白质组学:LC-MS/MS 谱图(DDA/DIA)、靶向质谱(SRM/PRM)、肽段鉴定与定量表、谱库 |
| AI 任务类型 | 谱图强度预测、保留时间预测、肽段鉴定与重打分、DIA 定量解析、生物标志物发现、跨数据集再分析 |
| 样本总数 | 64,330 个数据集(截至 2025-06),其中公开 44,248 个(69%) |
| 数据大小 | 无统一总量统计(单数据集从数百 MB 至数 TB 不等,按 PXD 单库下载) |
| 数据格式 | mzML、mzIdentML、mzTab、mzXML、厂商专有 raw、SDRF-Proteomics、PX-XML |
| 许可证 | CC0 1.0(多数资源库默认;Panorama Public 默认 CC-BY,可选 CC0) |
| 访问级别 | 开放(公开数据集无需注册即可下载;提交者需注册账号) |
| DUO 标签 | NRES |
| 语言 | 英文 |
| 首发日期 | 2012-05(首个数据集提交)/ 2014-03(Nat Biotechnol 奠基论文发表) |
| 最后更新 | 持续滚动更新(官方统计截至 2025-06;2026 NAR 更新论文已发布) |
| 发布机构 | ProteomeXchange 联盟(EMBL-EBI / Institute for Systems Biology / UCSD / jPOST 项目 / 国家蛋白质科学中心(北京)/ University of Washington) |
| 官方主页 | http://www.proteomexchange.org |
| 下载地址 | https://proteomecentral.proteomexchange.org/ |
| DOI | 10.1038/nbt.2839(奠基论文;每个 PXD 数据集另有独立解析 DOI) |
| 引用次数 | 2,957+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— PSI 标准格式齐全、开放下载、PROXI API 完善;扣分项:无官方数据划分、Partial 提交结果不可机读、厂商 raw 需格式转换、约三分之一数据集实验设计标注缺失 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、蛋白质组学临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(PXD 标识符体系、PSI 标准格式层级)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 EMBL-EBI、Institute for Systems Biology、UCSD、ProteomeXchange 联盟无任何商业利益关联。本页面不销售数据或服务,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。ProteomeXchange 公开数据集默认适用 CC0 许可(Panorama Public 默认 CC-BY,要求署名),敏感人类数据目前不支持受控访问渠道。DUO 标签仅供参考,具体使用限制以各资源库官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? ProteomeXchange(PX)是质谱蛋白质组学领域的全球数据共享联盟:世界各地实验室在论文发表时,把质谱原始数据、鉴定结果和实验元数据提交到联盟旗下的六大资源库之一,获得一个持久的 PXD 编号,任何人 thereafter 都可以凭编号免费下载这批数据。截至 2025-06,累计 64,330 个数据集进入该体系,其中 44,248 个(69%)已公开(Deutsch et al., 2026, Nucleic Acids Research. DOI 10.1093/nar/gkaf1146)。
为什么重要? 在 PX 出现之前,质谱数据散落在作者硬盘和期刊补充材料里,绝大多数无法复用。PX 用统一的提交标准、PXD 标识符和 ProteomeCentral 检索门户,让"发表即共享"成为领域文化:现在主流蛋白质组学期刊普遍要求投稿时提供 PXD 编号,全球 80 多个国家的研究者受益于此。
我能用它做什么? 如果你做蛋白质组学 AI,PX 就是你的训练数据金矿:谱图预测、保留时间预测、肽段鉴定重打分、DIA 定量、生物标志物发现,几乎每个任务的公开训练语料最终都溯源到某个 PXD 编号。本 Wiki 教你如何选库、下载、解析标准格式,以及避开 8 个真实工程坑点。
§1.1 摘要
ProteomeXchange 于 2012 年由欧盟 FP7 项目(资助号 260558)支持启动,2014 年在 Nature Biotechnology 发表奠基论文(Vizcaíno et al., 2014, Nature Biotechnology. DOI 10.1038/nbt.2839),核心机制是"统一提交、分布存储":研究者向任一成员库提交数据,元数据以 PX-XML 格式同步到 ProteomeCentral 门户实现跨库检索。六大成员库各司其职:PRIDE(EMBL-EBI,英国)承担了 77% 的提交,是通用存档主力;MassIVE(UCSD,美国)与 iProX(中国)分别占 7.4% 与 11%;jPOST(日本)占 3.8%;PeptideAtlas 与 Panorama Public 则聚焦谱库与靶向蛋白质组学。数据集以持久 PXD 标识符管理,再分析版本使用 RPXD 标识符。联盟持续维护 PSI 开放标准——mzML(谱图)、mzIdentML(鉴定)、mzTab(定量表)、SDRF-Proteomics(样本-文件映射)与 USI(通用谱标识符,2021 年正式化)——并不断扩展数据复用生态(quantms、MassIVE.quant 重分析流程,ProteomicsML 机器学习社区资源)。近三年提交量占总量的 47%,2025-06 单月即新增 1,156 个数据集,增长仍在加速。
§1.2 战略价值
维度一:AI 训练语料的规模化与标准化。 蛋白质组学深度学习模型的性能上限由训练数据的规模与一致性决定。PX 把 64,330 个数据集统一到 mzML/USI 等机器可读标准之下,使跨实验室的数百万张谱图可以合并训练。谱图预测工具 Prosit 与保留时间预测工具 DeepLC 的训练语料均大规模取自 PX 公开数据。USI(mzspec: 前缀)让任意一张谱图获得全球唯一地址,为构建"谱图级"而非"文件级"的数据集提供索引基础。
维度二:FAIR 原则在生命科学领域的样板工程。 PX 被视为"发表文化 + 基础设施"双轮驱动的典范:期刊强制数据可用性声明保证了供给侧,PSI 标准与 ProteomeCentral 门户保证了机器侧。2026 年更新论文的核心主题正是"making proteomics data FAIR"——联盟正在推进受控访问人类数据资源与非 MS 蛋白质组学支持,将覆盖面扩展到临床蛋白质组学。对医疗 AI 团队而言,理解 PX 的元数据体系(尤其 SDRF)等于掌握了该领域数据合规复用的通用语法。
§1.3 同类数据集横向对比
| 维度 | ProteomeXchange | PRIDE(单库) | MassIVE | UniProt | Human Protein Atlas |
|---|---|---|---|---|---|
| 性质 | 多库联盟 + 统一门户 | PX 成员库(欧洲) | PX 成员库(美国) | 蛋白序列/功能知识库 | 组织表达图谱 |
| 规模 | 64,330 数据集(截至 2025-06) | 约 77% 的 PX 提交 | 约 7.4% 的 PX 提交 | 覆盖 2,700+ 万序列(UniProtKB) | 组织/细胞级蛋白表达 |
| 数据模态 | 质谱原始数据 + 鉴定/定量结果 | 同左(承接大部分提交) | 同左 + MassIVE.quant 再分析 | 序列、注释、交叉引用 | 免疫组化/转录组影像 |
| 标注深度 | 提交者自述元数据 + PSI 标准 | 同左 | 同左 | 专家策展 | 病理学家审核 |
| 许可 | CC0(Panorama 默认 CC-BY) | CC0(2018-06 起) | CC0 | CC-BY 4.0 | 各资源页单独声明 |
| 对 AI 的独特价值 | 跨库统一检索、PXD/USI 可寻址 | 原始谱图存档最全 | 内置再分析流水线 | 提供蛋白序列先验/检索库 | 提供组织定位先验 |
说明:PRIDE/MassIVE 的份额为 PX 全部提交中的相对占比(Deutsch et al., 2026, NAR),各自绝对数量随时间变化。
§1.4 版本时间轴
| 时间 | 里程碑 | 说明 |
|---|---|---|
| 2012-05 | 首个数据集提交,联盟启动 | EU FP7 资助(260558),PRIDE 与 ProteomeCentral 上线(2014 论文图 1) |
| 2014-03 | Nature Biotechnol 奠基论文 | Vizcaíno/Deutsch 等,确立 PXD 标识符与统一提交工作流 |
| 2017-01 | NAR 2017 更新 | “支持公共数据存放的文化变革”,MassIVE/jPOST 等成员库扩展(Deutsch et al., 2017, NAR. DOI 10.1093/nar/gkw936) |
| 2020-01 | NAR 2020 更新 | 聚焦"big data"方法:USI 推进、USI 可视化与再分析(Deutsch et al., 2020, NAR. DOI 10.1093/nar/gkz969) |
| 2021 | USI 正式化 | PSI 通用谱标识符定稿,mzspec: 前缀注册 identifiers.org |
| 2023-01 | 十周年更新(NAR 2023) | 七资源功能矩阵、SDRF-Proteomics 推广(Deutsch et al., 2023, NAR. DOI 10.1093/nar/gkac1040) |
| 2024 | PRIDE 新增 Globus 传输 | 针对超大文件与 Aspera 受限机构(PRIDE Globus 文档) |
| 2026-01 | NAR 2026 FAIR 更新 | ProteomeCentral 基于 PROXI/OpenAPI 全面重写;累计 64,330 数据集(DOI 10.1093/nar/gkaf1146) |
§1.5 典型应用场景
- 谱图预测模型训练:从 PX 公开数据提取肽段-碎片谱图对,训练 Transformer 类谱图预测器(如 Prosit 范式),用于数据库搜索重打分与 DIA 谱库生成。
- 保留时间(iRT)预测:跨数据集提取肽段保留时间标注,训练 DeepLC 类回归模型,提升搜索与靶向方法转移效率。
- 生物标志物发现再分析:对同疾病多 PXD 数据集做联合定量再分析(如 PXD012174 联合再分析 110 个人类磷酸化数据集),扩大样本量、验证标志物稳健性。
- 搜索引擎与流水线基准评测:在固定 PXD 基准集上比较 DDA/DIA 搜索参数与工具性能,形成可复现的评测协议。
- 谱库构建与共享:将多个 DDA 数据集的鉴定结果合并为谱库(SWATH/DIA 分析的前置资产),经 Panorama Public 或 PeptideAtlas 发布。
§2 医学背景
§2.1 疾病标签与 ICD-11 映射
ProteomeXchange 是多疾病聚合基础设施,疾病标签由提交者在数据集元数据中自述。下表列出库内高频研究疾病及其标准编码映射(编码依据 ICD-11 MMS 浏览器与 SNOMED CT 国际版通用条目):
| 研究标签 | ICD-11 编码 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 2 型糖尿病 | 5A11 | 73211009 | Diabetes mellitus |
| 乳腺癌 | 2C60 | 254837009 | Malignant neoplasm of breast |
| 阿尔茨海默病 | 8A80 | 26929004 | Alzheimer’s disease |
| 脓毒症 | 1G4Z | 91302008 | Sepsis |
| 心力衰竭 | CB4Z | 84114007 | Heart failure |
| COVID-19 | 1D92 | 840539006 | COVID-19 |
使用提示:以 ICD-11/SNOMED 编码检索 PX 数据集时,应同时使用疾病俗名与规范术语(如 “Alzheimer” + “AD” + “dementia”),因为提交者自由文本中术语不统一,这是 §6.5 坑点 4 的成因之一。
§2.2 疾病简介与流行病学
蛋白质组学研究的对象是"基因组表达的全部蛋白质在特定时空状态下的集合"。与基因组不同,蛋白质组直接反映疾病状态下的功能执行层:翻译后修饰(磷酸化、乙酰化、糖基化)和蛋白丰度变化往往先于或伴随病理进程,因此质谱蛋白质组学成为生物标志物发现(biomarker discovery)、药物靶点验证与疾病分型的核心技术。PX 数据库中的疾病相关数据集覆盖了从肿瘤(癌与癌旁对照)、代谢性疾病(糖尿病队列血浆/组织)、神经退行性疾病(脑脊液标志物)到感染性疾病(COVID-19 病程血浆蛋白组)的主要门类。
从方法论角度,PX 数据集常见两类设计:病例-对照(case-control,比较疾病与健康对照组的蛋白丰度差异)与队列追踪(cohort,纵向采样寻找预后相关蛋白)。前者多见于小样本深度测序式 DDA 实验,后者随 DIA/SWATH 技术普及而增长。理解数据集的实验设计类型,是选择 ML 建模范式(分类 vs 生存分析)的前提,相关结构化信息依赖 SDRF-Proteomics 元数据(见 §4)。
从技术形态看,PX 内的主流采集策略分两条路线:DDA(数据依赖采集,Data-Dependent Acquisition)——每个扫描周期挑选强度最高的前体离子打碎,谱图与肽段对应关系明确,适合发现式鉴定与谱图级 ML 训练;DIA(数据独立采集,Data-Independent Acquisition)——按 m/z 窗口把所有离子一起打碎,谱图是混合信号,需要谱库解卷积,定量重现性更好,适合大队列。靶向路线(SRM/PRM)则对预设肽段做定向监测,数据主要存于 PASSEL 与 Panorama Public。三条路线的谱图形态、分析工具与复用方式各不相同,建模前必须先确认目标 PXD 的采集策略(记录于元数据 InstrumentList 与描述文本)。翻译后修饰(PTM)是另一条关键维度:磷酸化、乙酰化、糖基化等修饰数据集在库内以 modificationList 字段标注,是疾病机制研究(如信号通路激活)最常复用的子集。
§2.3 临床任务定义
| 任务 | 定义 | 在 PX 数据上的形态 | 成熟度 |
|---|---|---|---|
| 生物标志物发现 | 在病例-对照设计中寻找区分群体的蛋白/肽段组合 | 差异丰度分析 + ML 特征选择;跨 PXD 验证 | 高(大量已发表) |
| 诊断分类 | 以蛋白谱判定疾病状态 | 监督分类器(SVM/RF/梯度提升/深度网络) | 中高 |
| 预后建模 | 以基线蛋白谱预测生存/复发 | Cox 回归 + 蛋白特征;队列型 PXD | 中 |
| 谱图鉴定辅助 | 深度学习重打分提升 PSM 数量 | Prosit/MS²Rescore 范式,训练语料取自 PX | 高(工程成熟) |
| 定量解析(DIA) | 从混合谱图中解卷积肽段定量 | DIA-NN/Spectronaut 类工具,谱库源自 PX 数据 | 高 |
§2.4 数据贡献者人群
PX 数据由研究实验室自愿提交,无统一的人口学结构。可核实的分布事实如下(截至 2025-06,Deutsch et al., 2026, NAR):
| 维度 | 分布事实 |
|---|---|
| 提交来源国家 | 80+ 个国家或地区 |
| 接收库份额 | PRIDE 77% / iProX 11% / MassIVE 7.4% / jPOST 3.8% / Panorama Public 与 PeptideAtlas 极少 |
| 物种 | 人类(Homo sapiens)数据集占比最高,其次为常见模式生物(小鼠、大鼠、酵母等,官方 Figure 1B 呈现 top 15 物种) |
| 仪器 | 以 Orbitrap 系列为绝对主流(官方 Figure 1C 呈现 top 15 仪器) |
| 时间分布 | 近 3 年提交占总量的 47%;2025-06 单月 1,156 个 |
注意:PX 不采集患者级人口学字段(年龄/性别/种族在库级不统一),§7 的公平性分析基于此结构性限制。
§2.5 临床价值定位
PX 本身不产生临床结论,其价值在于让临床蛋白质组学结论可验证:任何"某蛋白是某癌种标志物"的声明,只要数据存于 PX,其他团队就能下载原始数据独立复算。对医疗 AI 而言,这意味着三层价值:其一,训练数据可溯源(PXD 编号写入论文方法学即可复现);其二,外部验证数据可低成本获取(用同疾病其他 PXD 做独立验证集);其三,负结果与数据异质性本身构成对模型泛化性的压力测试。联盟 2026 年路线图中的受控访问人类数据资源一旦落地,临床级蛋白质组学 AI 的合规训练数据通道将进一步打通。
§2.6 金标准描述
蛋白质组学数据的"金标准"指:原始谱图(raw 或 mzML)+ 符合 PSI 开放标准的鉴定结果(mzIdentML/mzTab)+ 完整实验设计元数据(SDRF-Proteomics)三者齐备,且以 Complete 工作流提交、经过宿主库审核后公开发布的 PXD 数据集。此类数据集支持从原始数据到结论的全链路复现。其质量锚点包括:PSM/肽段/蛋白水平的 1% FDR 控制、搜库参数完整披露(软件、版本、序列库、酶切规则)、以及标注者即原始实验室的领域专家。相对地,仅有原始文件而无标准格式结果的 Partial 提交,在复用性上属于次级标准(量化证据见 §7.2 与 Leite, 2026, Proteomics. DOI 10.1002/pmic.70175)。
§3 数据集规格
§3.0 版本/资源库抉择矩阵
ProteomeXchange 不是单一文件而是"联盟 + 六库"体系,选对入口库是第一步:
| 你的需求 | 推荐入口 | 覆盖范围 | 理由 |
|---|---|---|---|
| 跨库检索全部 PX 数据 | ProteomeCentral | 全联盟 | 统一门户 + PROXI API,元数据全覆盖 |
| 下载通用 DDA/DIA 原始数据 | PRIDE | 约 77% 提交 | 存档最全,FTP/Aspera/Globus 多通道 |
| 获取再分析 + 定量工作区 | MassIVE | 美国节点 | MassIVE.quant 提供可复算的定量再分析 |
| 日本团队数据 / 数据描述论文 | jPOST | 日本节点 | 配套数据期刊 JPDM,PRESTO 上传协议 |
| 中国团队数据 | iProX | 中国节点 | 份额 11%,HTTPS/Aspera 通道 |
| 靶向方法(SRM/PRM)与 Skyline 项目 | Panorama Public | 靶向专属 | 支持色谱图可视化,WebDAV/HTTPS |
| 肽段/蛋白一致性谱库 | PeptideAtlas | 谱库层 | PASSEL 靶向存档 + 跨数据集共识构建 |
§3.1 数据模态详情
| 模态 | 内容 | 典型格式 | AI 可用性 |
|---|---|---|---|
| MS/MS 谱图 | 每个前体离子的碎片离子质荷比-强度曲线 | mzML(开放)、mzXML(旧)、厂商 raw(Thermo .raw、Waters .raw、Bruker .d 等) | 转换 mzML 后高 |
| 肽段鉴定结果 | PSM、肽段、蛋白三级鉴定列表及打分 | mzIdentML、mzTab、CSV(Partial 提交时) | mzTab/mzIdentML 高 |
| 定量结果 | 标记(TMT/iTRAQ)或无标记(LFQ/DIA)强度矩阵 | mzTab、MaxQuant txt、Skyline 导出 | 中高(列名不统一) |
| 实验设计元数据 | 样本-文件-分组映射、采集参数 | SDRF-Proteomics(TSV)、PX-XML、IDF | SDRF 高;自由文本低 |
| 色谱图 | 靶向方法的保留时间-强度曲线 | mzML(chromatogram)、Skyline .skyd | Panorama 库内高 |
| 谱库 | 共识谱图库 | SpectraST .splib、DIA-NN .dia、mzML | 高 |
§3.1b 六大资源库对照详表
选库与下载前值得逐库了解的运营细节(据 2026 NAR Table 1 与各库官方页):
| 资源库 | 运营机构 | 定位 | 提交份额 | 默认许可 | 特色能力 |
|---|---|---|---|---|---|
| PRIDE | EMBL-EBI(英国 Hinxton) | 通用 MS 存档主库 | 77% | CC0(2018-06 起强制) | 通道最全(FTP/Aspera/Globus/HTTPS/Streaming API),审稿私有访问 |
| PeptideAtlas / PASSEL | Institute for Systems Biology(美国西雅图) | 共识谱库 + 靶向存档 | 极少 | CC0 | 跨数据集一致性谱库构建,蛋白中心视图 |
| MassIVE | UCSD(美国) | 通用存档 + 再分析 | 7.4% | CC0 | MassIVE.quant 工作区,再分析可复算 |
| jPOST | 日本 jPOST 项目 | 日本国家级存档 | 3.8% | CC0 | PRESTO 上传协议、TripleStore 检索,配套数据期刊 JPDM(强制 SDRF) |
| iProX | 国家蛋白质科学中心(中国北京) | 中国国家级存档 | 11% | CC0 | HTTPS/Aspera 通道,服务中国团队(含国家重点研发计划资助项目) |
| Panorama Public | University of Washington(美国) | 靶向/Skyline 专属 | 极少 | CC-BY 默认(可选 CC0) | 色谱图可视化、WebDAV 通道,支持靶向方法发表 |
份额为 PX 全部历史提交的相对占比(截至 2025-06 官方统计);另注意 MassIVE/jPOST/iProX 在 PXD 编号之外同时维护本地编号体系。
§3.2 数据集构成与规模
| 维度 | 数值 | 来源与口径 |
|---|---|---|
| 累计提交数据集 | 64,330 | 截至 2025-06,全部 PX 资源(2026 NAR) |
| 已公开数据集 | 44,248(69%) | 同上 |
| 近 3 年新增 | 30,097(占总量的 47%) | 2022-06 至 2025-06 |
| 2025-06 单月新增 | 1,156 | 同上,官方 Figure 1A |
| 提交国家 | 80+ | 同上 |
| 成员库数量 | 6 个正式成员 + PASSEL 靶向分支 | 同上 Table 1 |
§3.3 文件格式表
| 格式 | 角色 | 维护方 | 备注 |
|---|---|---|---|
| mzML | 谱图/色谱图开放标准 | PSI | 1.1.0 为主流版本,全库通用 |
| mzIdentML | 鉴定结果开放标准 | PSI | PSM/肽段/蛋白层级 |
| mzTab | 鉴定+定量表格标准 | PSI | 表格化,对 pandas/Python 友好 |
| SDRF-Proteomics | 样本-文件关系表 | PSI(2020 起推广) | TSV;MaxQuant 等工具开始支持 |
| PX-XML | 数据集级元数据(公共模型) | ProteomeXchange | proteomeXchange-1.4.0.xsd |
| USI | 谱图寻址语法 | PSI | mzspec:PXDxxxxxx:file:scan:n,identifiers.org 注册 mzspec |
| mzXML / mgf | 旧版谱图格式 | 社区遗留 | 历史数据常见,需转换 |
| 厂商 raw | Thermo/Bruker/Waters/SCIEX 专有 | 仪器厂商 | 须用 ProteoWizard msconvert 转 mzML |
§3.4 存储与传输规格
PX 无统一总量公布;单个 PXD 从数百 MB(少量 LC-MS run)到数 TB(大型 TMT 队列、DIA 矩阵)不等。下载通道按库各异(2026 NAR Table 1):
| 资源库 | 传输协议 |
|---|---|
| PRIDE | FTP、Aspera、Globus(2024 新增)、HTTPS |
| MassIVE | FTP |
| jPOST | FTP、HTTPS、PRESTO、TripleStore |
| iProX | HTTPS、Aspera |
| Panorama Public | WebDAV、HTTPS |
| PeptideAtlas | FTP |
§3.5 标注方式
PX 的"标注"由三层构成:机器层——搜库引擎(Mascot、MaxQuant、MSFragger、Spectronaut 等)在给定序列库上自动产出 PSM 打分与 FDR 过滤结果;人工层——原始实验室领域专家负责实验设计描述、样本注释与结果解释,这是唯一的人工标注来源;审核层——宿主资源库对 Complete 提交做元数据完整性与格式审核后发布。PX 不存在独立第三方标注者,也不提供一致性指标(如标注者间 kappa),一致性由文献复现率间接体现。这意味着标注质量与提交实验室的专业水平强相关——它是 §7.1 偏倚表的首要条目。
§3.6 标注者资质与审核一致性
提交者须为数据产出实验室成员(通常为博土后/博士研究生级别研究者),PI 为通讯责任人;宿主库(如 PRIDE 团队)对 Complete 提交执行格式与元数据审核,对公开化请求执行发表关联校验(PubMed ID/DOI 须存在于 Europe PMC,预印本不算发表,PRIDE FAQ)。私有数据集最长保留 2 年,到期前 60/30/7 天发送提醒。审核通过的 Complete 提交可保证"结果可解析、谱图可关联",但其生物解释(分组、生物学标记)仍以提交者自述为准,无独立复核。
§3.7 采集周期
数据采集时间跨度自 2012-05 首次提交持续至今(官方 Figure 1A 时间轴,2026 NAR)。个别数据集的样本采集可追溯更早(如 2012 年前产生的实验数据补提交)。PX 为滚动增长型资源,无版本冻结概念;官方每三年发布一次 NAR 数据库更新论文作为统计快照(2017/2020/2023/2026)。
§3.8 地域覆盖
提交来源覆盖 80+ 个国家或地区,欧洲(PRIDE 承接 77%)、东亚(iProX 11% + jPOST 3.8%)与北美(MassIVE 7.4% + Panorama/PeptideAtlas)为主要枢纽(2026 NAR)。数据内容本身无地理边界限制,但物种与疾病分布反映全球科研资助结构:人类与模式生物数据占绝对多数。
§3.9 仪器与设备规格
库内主流为高分辨 LC-MS/MS 平台,Orbitrap 系列占据主导(官方 Figure 1C top 15 仪器),配套纳升级液相(nanoLC)分离;靶向方法(SRM/PRM)数据多来自三重四极杆平台;离子淌度(timsTOF)与 DIA 专用平台近年增速明显。每个 PXD 的仪器型号在元数据 InstrumentList 字段记录,是跨数据集批效应建模的关键协变量。
§3.10 深度溯源链
完整的溯源链为:联盟(ProteomeXchange)→ 成员库(如 PRIDE)→ 数据集(PXD 号)→ 提交历史(AnnounceDate、Submission XML)→ 文件(raw/result/additional 分类)→ 单张谱图(USI:mzspec:{PXD}:{file}:scan:{index})。ProteomeCentral 为每个 PXD 维护 Dataset History(版本号 + 时间戳 + 变更日志),再分析产物以 RPXD 号并注明来源 PXD。对 AI 工程,推荐把 PXD 号 + 文件级 checksum + 下载日期写入实验记录,实现训练数据级可追溯(工具链见 §6.10)。
§4 数据结构
§4.0 目录树
以 PRIDE 上一个典型 Complete 提交 PXD000001(解压后视图)为例:
PXD000001/ # 数据集根目录 = PXD 号
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_01.raw
│ # 厂商原始谱图文件(Thermo raw)
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_01.mzml
│ # PSI mzML 开放格式谱图
├── *.mzid # mzIdentML 鉴定结果
├── *.mztab # mzTab 鉴定/定量表(Complete 提交)
├── SDRF-Proteomics.tsv # 样本-文件-实验设计映射(新提交常见)
├── submission.px # PX-XML 数据集级元数据
├── checksum.txt # 全部文件 MD5 校验和
├── additional/ # 提交者的补充文件(参数表、脚本、日志)
└── result/ # 处理结果文件分类目录(部分提交)
PRIDE 服务器端的规范 URL 模式(YYYY/MM 为公布年月,可用于 wget/Globus 直接拼路径):
https://ftp.pride.ebi.ac.uk/pride/data/archive/{YYYY}/{MM}/{PXD 编号}/{文件名}
示例:https://ftp.pride.ebi.ac.uk/pride/data/archive/2012/03/PXD000001/
§4.1 DAIMS 字段字典
PX 数据集的"字段"以 ProteomeCentral 元数据模型(PX-XML 1.4.0)为骨架,下表列出 AI 工程最常用的 12 个核心字段:
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| identifier | Text | PXD 数据集编号 | PXD000001 | 主键、下载定位 | 无(受控分配) | 无 | PXD + 6 位数字 |
| title | Text | 数据集标题 | (提交者自拟) | 检索、主题分类 | 自述性偏差 | 无 | 自由文本 |
| description | Text | 方法与设计摘要 | (提交者自拟) | 判断任务适配性 | 详略不一 | 无 | 自由文本 |
| hostingRepository | Text | 宿主库 | PRIDE | 选下载通道 | 无 | 无 | PRIDE/MassIVE/jPOST/iProX/Panorama Public/PeptideAtlas |
| speciesList | List[Text] | 物种(NCBI 分类名) | Homo sapiens (Human); NCBI TaxID 9606 | 域过滤 | 提交者拼写不一致 | 无 | NCBI Taxonomy |
| instrumentList | List[Text] | 仪器型号 | Q Exactive | 批效应协变量 | 型号别名不统一 | 无 | 厂商型号名 |
| modificationList | List[Text] | 翻译后修饰 | Phospho; TMT6plex | 任务筛选(PTM 研究) | 命名法混用(PSI-MOD/俗名) | 无 | PSI-MOD 术语或俗名 |
| publicationList | List[Text] | 关联论文 | PMID 24574591 | 文献溯源 | 可后补 | 无 | PMID/DOI |
| announceDate | Date | 公开发布日 | 2019-02-14 | 时间切片防泄漏 | 无 | 无 | ISO 日期 |
| datasetHistory | List | 版本与变更日志 | Revision 0-3 | 数据版本控制 | 无 | 无 | 整数修订号 |
| ftpLocation | Text | 归档目录 URL | ftp://ftp.pride.ebi.ac.uk/pride/data/archive/… | 程序化下载 | 协议随浏览器演进失效 | 无 | URL |
| keywords | List[Text] | 关键词(含 reanalysis/ML 标签) | deep learning, benchmarking | 复用类型筛选 | 自由标注 | 无 | 自由标签 |
§4.1b 核心标准格式结构示例
mzML 谱图文件的骨架(简化示意,cvParam 为 PSI 受控词汇):
<indexedmzML xmlns="http://psi.hupo.org/ms/mzml">
<mzML version="1.1.0">
<run id="Run1" defaultInstrumentConfigurationRef="IC1">
<spectrumList count="25000">
<spectrum index="1234" id="scan=1235" msLevel="2">
<cvParam accession="MS:1000511" name="ms level" value="2"/>
<cvParam accession="MS:1000580" name="MSn spectrum" value=""/>
<cvParam accession="MS:1000514" name="collision induced dissociation" value=""/>
<precursorList count="1">
<precursor>
<selectedIon>
<cvParam accession="MS:1000744" name="selected ion m/z" value="512.2601"/>
<cvParam accession="MS:1000041" name="charge state" value="2"/>
</selectedIon>
</precursor>
</precursorList>
<binaryDataArrayList count="2">
<binaryDataArray>
<cvParam accession="MS:1000523" name="64-bit float" value=""/>
<cvParam accession="MS:1000576" name="no compression" value=""/>
<cvParam accession="MS:1000515" name="m/z array" value=""/>
<binary>...</binary>
</binaryDataArray>
<binaryDataArray>
<cvParam accession="MS:1000523" name="64-bit float" value=""/>
<cvParam accession="MS:1000576" name="no compression" value=""/>
<cvParam accession="MS:1000516" name="intensity array" value=""/>
<binary>...</binary>
</binaryDataArray>
</binaryDataArrayList>
</spectrum>
</spectrumList>
</run>
</mzML>
</indexedmzML>
结构要点:每个
<spectrum>携带前体 m/z 与电荷态(selectedIon),碎片数据以<binaryDataArray>存放——m/z 数组(MS:1000515)与强度数组(MS:1000516)各一个,均为 64-bit float、zlib 压缩后 base64 编码;cvParam 引用 PSI-MS 受控词汇(如MS:1000041电荷态、MS:1000514CID 碎裂)。
SDRF-Proteomics 表的核心列族(TSV,每行 = 一个数据文件):
comment[data file] characteristics[organism] characteristics[disease]
factor value[treatment] comment[technical replicate] comment[fraction identifier]
sample1_A01.raw Homo sapiens (Human) breast carcinoma
paclitaxel 1 1
sample1_B01.raw Homo sapiens (Human) breast carcinoma
vehicle 1 1
| 代码 | 补充要点 |
|---|---|
| mzIdentML | 鉴定结果全量:<SpectrumIdentificationList> 内每条 <SpectrumIdentificationResult> 对应一张谱图的候选 PSM,<PeptideEvidence> 记录肽段-蛋白映射与 decoy 标记 |
| SDRF-Proteomics | 实验设计映射:comment[data file] ↔ characteristics[*] ↔ factor value[*] 的行级关系,是分组建模的直接输入 |
解析优先级建议:mzTab(pandas 友好)> mzIdentML(鉴定细节全)> mzML(谱图本体);SDRF 是样本-文件映射的唯一结构化来源,缺失时按 §4.5 回退处理。
§4.2 标签分布
PX 数据集不存在统一标签体系,可统计的"标签"包括:公开/私有状态(44,248 公开 vs 20,082 未公开,截至 2025-06)、提交工作流类型(Complete/Partial)、复用相关关键词(reanalysis、machine learning、benchmarking 等出现在数据集关键词与 PXD012174 之类的条目中)。疾病/物种标签由元数据字段承载而非受控词表,使用前建议按 §6.3 的方法做规范化清洗。
§4.3 关键统计
- 公开率 69%:44,248/64,330(截至 2025-06);未公开部分处于审稿期私有状态或超过 PRIDE 2 年保留期规则约束。
- 增长斜率:近 3 年占历史总量 47%,即年均新增约 1 万个数据集,且逐年加速(官方 Figure 1A)。
- 集中度:前四库占提交总量 99%+(PRIDE 77% + iProX 11% + MassIVE 7.4% + jPOST 3.8%)。
- 复用瓶颈:对 2025 年发布的 500 个人类 PX 数据集的审计显示,仅 27.0% 具备元数据级实验设计标注、49.0% 提供完整定量输出(Leite, 2026, Proteomics. DOI 10.1002/pmic.70175)。
§4.4 数据层级
Consortium(ProteomeCentral 统一索引)
└── Repository(PRIDE / MassIVE / jPOST / iProX / Panorama Public / PeptideAtlas)
└── Dataset(PXD 编号,唯一持久标识)
├── File(raw / result / additional 分类;文件级 checksum)
│ └── Spectrum(USI 寻址:mzspec:{PXD}:{file}:scan:{n})
└── Submission(PX-XML 元数据 + 版本 History)
§4.5 缺失值与信息性缺失
PX 元数据无"N/A 哨兵"约定,缺失表现为三种形态:字段缺省(如早期提交无 SDRF 文件)、自由文本代替结构化字段(species 写成句子)、以及 Complete/Partial 差异导致的结果文件缺位。下表给出工程化处理建议:
| 缺失形态 | 检测方法 | 处理建议 |
|---|---|---|
| SDRF 文件缺失 | 列目录无 *.sdrf.tsv |
回退解析 PX-XML + 论文补充表;无法恢复则归入"仅原始数据"类 |
| speciesList 空缺 | PROXI API 返回空数组 | 用 title/description 正则提取 + NCBI Taxonomy 校验 |
| 定量矩阵缺列 | mzTab 解析后列为空 | 检查是否 Partial 提交;改用原始数据重定量 |
| publicationList 滞后 | 元数据无 PMID | 检索 PXD 号在 Europe PMC 的正文提及 |
§5 划分与使用建议
§5.1 官方划分
ProteomeXchange 不提供任何官方训练/验证/测试划分——它是持续增长的存档联盟而非基准数据集。使用者须自行构建划分,且应将 announceDate 纳入切片逻辑(见 §5.3)。
§5.2 社区惯例划分
蛋白质组学 ML 文献的常见做法:按任务从 PX 抽取数据集子集(如取人类、Orbitrap、DDA、TMT 标记的谱图),在 PSM 级按 80/10/10 随机划分并控制同一肽段不跨集(避免肽段级泄漏);谱图预测类任务常以 2018 年前/后发布日期做时间切片,与 Prosit 原始论文的协议一致(Gessulat et al., 2019, Nature Methods. DOI 10.1038/s41592-019-0426-7)。跨 PXD 划分(leave-dataset-out)被视为更严格的泛化评测。
三类惯例的适用边界:随机 PSM 划分只适合做模型迭代期的快速验证,报告外推结论时应升级;时间切片适合回答"模型对新数据的适应力",但要求你记录每个 PXD 的 announceDate;leave-dataset-out 代价最大(折间方差高),适合作为论文主表的严格口径。三类结果同时报告、并解释差异来源,是当前社区越来越普遍的做法。
§5.3 泄漏风险(重点)
三大泄漏通道必须主动封堵:肽段级——同一肽段序列(不同修饰/电荷态)出现在训练与测试两侧,使模型"背题";数据集级——同一实验室把相近样本拆成多个 PXD,或同一论文的再分析版本(RPXD)与原始版本(PXD)同时入选,导致近重复样本跨集;时间级——测试集发布晚于训练集发布时,若模型/参数曾在测试集年代的数据上迭代过,评测被隐性污染。缓解策略:以 PXD 为分组键做 group split、以 announceDate 做时间切分、合并去重 peptide+charge+collision-energy 键。
§5.4 交叉验证建议
小样本疾病分类任务建议按 PXD 分组的 5 折交叉验证,保证同一数据集的所有样本同折;报告折间标准差而非单点最优。谱图级回归任务可用分层抽样(按前体电荷态或 m/z 区间分层)降低折间分布漂移。两类任务的共同纪律:交叉验证内的一切统计量(蛋白列表、FDR 阈值、归一化参数)必须在训练折内估计后冻结应用到验证折——任何"全库先过滤再划折"的流程都是隐性泄漏。
§5.5 外部验证建议
推荐以"同疾病、不同库"原则构建外部验证集:训练用 PRIDE 数据集,验证用 MassIVE 或 jPOST 的同类数据,检验跨库通道差异(传输与格式转换链不同)是否引入系统偏移;再以第三方再分析产出(如 MassIVE.quant、quantms 流水线输出)核对定量稳定性。若目标是临床场景,最终一级验证应选"跨仪器 + 跨实验室"双重不同的数据(如训练 Orbitrap-DDA、验证 timsTOF 或三重四极杆数据),并预设性能可接受的下限而非事后解释;报告时把"绝对性能"与"相对内部变化"分开陈述,后者(如 AUROC 下降幅度)对部署决策更有参考价值。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
在 Google Colab(或任何 Jupyter 环境)中验证环境并拉取一个 PXD 的元数据:
# Colab 一键环境:ProteomeXchange 元数据 API + 标准格式解析
!pip -q install requests pyteomics pandas
import requests
# ProteomeCentral 公开 PROXI API(2026 NAR 论文确认的官方端点)
r = requests.get(
"https://proteomecentral.proteomexchange.org/api/proxi/v0.1/datasets",
params={"query": "PXD000001"},
timeout=30,
)
meta = r.json()[0]
print(meta["identifier"], "|", meta["title"]) # PXD000001 | 数据集标题
§6.1 快速上手
目录结构预期:以下代码假设你已按 §6.2 把目标 PXD 下载到本地,目录形如
data/PXD000001/*.mzml与data/PXD000001/*.mztab。data_root是唯一需要修改的路径变量,代码内所有文件定位都通过os.path.join(data_root, ...)拼接,与 §4.0 目录树一致。最小可用子集:一个 PXD 的 1 个 mzML 文件 + 1 个 mzTab 文件即可跑通全流程,无需下载完整数据集。
import os
import pandas as pd
from pyteomics import mzml
# data_root 指向 PXD 数据集目录(§4.0 目录树)
data_root = os.path.join("data", "PXD000001")
# 1) 读取第一个 mzML 谱图文件,枚举谱图
mzml_path = next(
os.path.join(data_root, f) for f in os.listdir(data_root) if f.endswith(".mzml")
)
spectra = mzml.read(mzml_path)
first = next(spectra)
print("scan id:", first["id"])
print("ms level:", first["ms level"])
print("peaks:", len(first["m/z array"])) # 碎片离子数
# 2) 读取 mzTab 鉴定/定量表(PSI 开放标准,pandas 友好)
mztab_path = next(
os.path.join(data_root, f) for f in os.listdir(data_root) if f.endswith(".mztab")
)
# mzTab 以表头注释块开头,psm 段由 "PSH" 行定义列名
rows, header, in_psm = [], None, False
with open(mztab_path) as fh:
for line in fh:
if line.startswith("PSH"):
header = line.rstrip("\n").split("\t")
elif line.startswith("PSM") and header:
rows.append(line.rstrip("\n").split("\t"))
psm_df = pd.DataFrame(rows, columns=header)
print(psm_df[["sequence", "charge", "search_engine_score[1]"]].head())
§6.2 数据获取
获取通道对照表:
| 通道 | 适用场景 | 命令/入口 | 大小上限 |
|---|---|---|---|
| HTTPS + wget | 单文件/中小数据集,脚本化 | wget -c {URL} |
无硬限制,单线程 |
| FTP + FileZilla | 批量目录下载(浏览器已不支持 FTP 链接) | ftp.pride.ebi.ac.uk,匿名 |
无硬限制 |
| Aspera (ascp) | 大文件最快通道 | ascp 命令行客户端 |
无硬限制 |
| Globus | 超大数据集、断点续传(2024 起推荐) | Globus Web/Connect Personal | 无硬限制 |
| PRIDE Streaming API | 单文件按需流式获取 | archive-file-downloader REST | 文件级 |
申请流程:公开数据集无需申请——在 ProteomeCentral 检索 PXD 号,直接下载即可;私有数据集在审稿期仅对提交者与受邀审稿人开放(密码控制)。提交者侧需注册 PRIDE/MassIVE 等库账号。
脚本化下载(HTTPS/wget 路径拼接法,来自 PRIDE 官方下载文档):
import json
import subprocess
from pathlib import Path
# PXD000001 于 2012-03 公布;YYYY/MM 来自 PXD 的 announceDate
archive_base = "https://ftp.pride.ebi.ac.uk/pride/data/archive"
pxd, announce = "PXD000001", ("2012", "03")
out_dir = Path("data") / pxd
out_dir.mkdir(parents=True, exist_ok=True)
# 列出目录内全部文件(HTML 目录索引的轻量解析)
import requests
listing = requests.get(f"{archive_base}/{announce[0]}/{announce[1]}/{pxd}/", timeout=60).text
import re
files = re.findall(r'href="([^"]+\.(?:raw|mzml|mzid|mztab|txt|gz))"', listing, flags=re.I)
for fname in files:
url = f"{archive_base}/{announce[0]}/{announce[1]}/{pxd}/{fname}"
# -c 断点续传,--quiet 静默
subprocess.run(["wget", "-c", "-P", str(out_dir), url], check=True)
print(f"下载完成:{len(files)} 个文件 -> {out_dir}")
其他成员库的获取要点:MassIVE 提供网页端(ProteoSAFe 平台)与 FTP 目录(ftp://massive.ucsd.edu/)两种方式,其 MassIVE.quant 工作区可直接在线浏览再分析结果;jPOST 通过 repository.jpostdb.org 检索后按页面指引经 FTP 下载,数据描述论文(JPDM)条目附带 SDRF 表;iProX 在数据集页提供 HTTPS 直链与 Aspera 通道,中文界面友好;Panorama Public 走 WebDAV/HTTPS,Skyline 用户可在软件内直接按 PXD/发布链接加载色谱图;PeptideAtlas 的谱库与蛋白视图经网页导出。跨库通用原则:先在 ProteomeCentral 找到 PXD 的 hostingRepository,再跳转对应库的原始页面获取该库的专属链接。
Aspera 大文件通道(最快):
# ascp 语法:ascp [选项] 源 目标;匿名用户 + 免密 key 随 Aspera Connect 安装
ascp -i ~/.aspera/connect/etc/asperaweb_id_dsa.openssh -k 2 -Q -l 500m \
anonymous@ftp.pride.ebi.ac.uk:/pride/data/archive/2012/03/PXD000001/ ./data/
# -k 2 断点续传校验;-l 500m 限速 500Mbps;完整参数见 Aspera 文档
§6.3 预处理全流程
步骤一:厂商 raw → mzML 统一转换(ProteoWizard msconvert,跨库一致性的前提):
# ProteoWizard:保留谱峰、去噪关闭(保真转换)、输出 mzML
msconvert data/PXD000001/*.raw \
--mzML --filter "peakPicking false 1-" --out data/PXD000001/mzml/
# 注意:Thermo .raw 转换只能在 Windows 或安装了对应厂商库的环境执行
步骤二:下载完整性校验(checksum 比对,在任何解析之前执行):
import hashlib
import os
from pathlib import Path
def md5sum(path, chunk=1024 * 1024):
h = hashlib.md5()
with open(path, "rb") as fh:
for block in iter(lambda: fh.read(chunk), b""):
h.update(block)
return h.hexdigest()
# PRIDE 每个 PXD 目录自带 checksum.txt(文件名 + MD5)
pxd_dir = Path("data/PXD000001")
checksums = {}
for line in (pxd_dir / "checksum.txt").read_text().splitlines():
digest, name = line.split(maxsplit=1)
checksums[name.strip("*")] = digest
bad = [name for name, digest in checksums.items()
if not (pxd_dir / name).exists()
or md5sum(pxd_dir / name) != digest]
print(f"缺失或不一致文件数:{len(bad)}", bad[:5])
# 校验失败先用 wget -c / ascp -k 2 续传再复查(见坑点 5)
步骤三:元数据规范化(物种/疾病/分组 → 统一受控词表):
import pandas as pd
# 读取 SDRF-Proteomics 表(TSV;新提交的实验设计标准)
sdrf = pd.read_csv("data/PXD000001/SDRF-Proteomics.tsv", sep="\t")
# SDRF 固定列族:comment[data file]、characteristics[organism]、characteristics[disease] 等
spec_col = [c for c in sdrf.columns if c.startswith("characteristics[organism")][0]
disease_col = [c for c in sdrf.columns if c.startswith("characteristics[disease")]
data_col = [c for c in sdrf.columns if c.startswith("comment[data file")][0]
sdrf["organism"] = sdrf[spec_col].str.strip()
if disease_col:
sdrf["disease"] = sdrf[disease_col[0]].str.strip()
else:
sdrf["disease"] = "not reported" # §4.5 缺失处理
print(sdrf[[data_col, "organism", "disease"]].head())
步骤四:谱图张量化(峰列表 → 固定长度数组,供深度模型消费):
import numpy as np
MAX_PEAKS, MAX_MZ = 200, 2000.0 # 常用截断配置:top-200 峰,m/z ≤ 2000
def spectrum_to_array(peaks_mz, peaks_int, max_peaks=MAX_PEAKS, max_mz=MAX_MZ):
keep = peaks_mz <= max_mz
mz, it = peaks_mz[keep], peaks_int[keep]
if len(mz) > max_peaks: # 按强度取 top-N 峰
idx = np.argsort(it)[-max_peaks:]
mz, it = mz[idx], it[idx]
it = it / (it.max() if it.max() > 0 else 1.0) # 强度归一化到 [0,1]
order = np.argsort(mz) # m/z 升序,固定顺序
return np.stack([mz[order], it[order]], axis=1)
步骤五:定量矩阵对齐(mzTab → 样本×蛋白矩阵,仅对 Complete 提交可行):
# 从 §6.1 的 psm_df 出发,构造样本级强度矩阵
# mzTab 列名按 PSI 规范:protein_abundance_assay[1:n] 为各通道强度
ab_cols = [c for c in psm_df.columns if c.startswith("protein_abundance_assay")]
if ab_cols:
quant = psm_df[["accession"] + ab_cols].dropna().groupby("accession").median()
quant = np.log2(quant.replace(0, np.nan)) # log2 变换,0 强度视为缺失
print(quant.shape) # (蛋白数, 通道数)
§6.4 PyTorch DataLoader
import os
import numpy as np
import torch
from torch.utils.data import Dataset, DataLoader
from pyteomics import mzml
class PXSpectrumDataset(Dataset):
"""PXD 目录内全部 mzML 谱图的最小 Dataset。
目录结构预期(与 §4.0 一致):
data_root/
└── PXD000001/*.mzml # data_root 为唯一需修改的路径变量
标签策略:以 MS 级别作占位任务(1=MS1, 2=MS2);替换为 mzTab 序列编码
即可改造为肽段鉴定/谱图预测任务。
"""
def __init__(self, data_root, pxd="PXD000001", max_peaks=200, max_mz=2000.0):
self.files = [
os.path.join(data_root, pxd, f)
for f in os.listdir(os.path.join(data_root, pxd))
if f.endswith(".mzml")
]
self.max_peaks, self.max_mz = max_peaks, max_mz
self._cache = [] # 小数据集内存缓存
for path in self.files:
for spec in mzml.read(path):
if spec["ms level"] != 2: # 仅保留 MS2 碎片谱
continue
arr = spectrum_to_array(
np.asarray(spec["m/z array"], dtype=np.float32),
np.asarray(spec["intensity array"], dtype=np.float32),
self.max_peaks, self.max_mz,
)
self._cache.append((arr, 1)) # (谱图张量, 标签)
def __len__(self):
return len(self._cache)
def __getitem__(self, idx):
spec, label = self._cache[idx]
if len(spec) < self.max_peaks: # 峰数不足则 padding
pad = np.zeros((self.max_peaks - len(spec), 2), dtype=np.float32)
spec = np.concatenate([spec, pad], axis=0)
return torch.from_numpy(spec[:self.max_peaks]), label
def collate_batch(batch):
specs = torch.stack([b[0] for b in batch]) # (B, max_peaks, 2)
labels = torch.tensor([b[1] for b in batch])
return specs, labels
dataset = PXSpectrumDataset("data", pxd="PXD000001")
loader = DataLoader(dataset, batch_size=32, shuffle=True,
num_workers=0, collate_fn=collate_batch)
for specs, labels in loader: # 冒烟测试一个 epoch
print(specs.shape, labels.shape)
break
§6.5 坑点清单(8 个)
⚠️ 坑点 1:浏览器点击 PXD 页面的 FTP 链接毫无反应(分类:工程陷阱)
问题:主流浏览器已移除原生 FTP 协议支持,PXD 元数据页上的
ftp://ftp.pride.ebi.ac.uk/...链接点击后无任何响应,新手极易误判为"数据不可用"而放弃。
症状:链接点击无反应或报ERR_UNKNOWN_URL_SCHEME;ProteomeCentral 数据集页提示"需要安装 FTP 应用"。
解决:
- 简单方法:把 URL 协议头从
ftp://换成https://(同一路径在 HTTPS 网关同样可访问,如https://ftp.pride.ebi.ac.uk/pride/data/archive/2012/03/PXD000001/)。- 进阶方法:安装 FileZilla,主机
ftp.pride.ebi.ac.uk,用户名留空或填anonymous,按pride/data/archive/{YYYY}/{MM}/{PXD}路径进入目录批量下载。- SOTA 方法:脚本化场景直接用
wget -c(断点续传)遍历 §6.2 的目录索引,或对超大数据集改用 Asperaascp -k 2与 Globus(自动断点续传)。
参考:PRIDE Data Download 官方文档;PXD012174 页面的 FTP 使用提示
⚠️ 坑点 2:PXD 编号前导零与 RPXD/本地编号混淆(分类:工程陷阱)
问题:PXD 编号为
PXD+ 6 位定宽数字(如 PXD012174),正则写成PXD\d{5}或PXD\d+会导致漏配或误配;同时再分析数据集使用 RPXD 前缀,MassIVE/jPOST/iProX 还维护各自的本地编号(如 MSV 前缀),跨库对账时极易张冠李戴。
症状:下载清单少数据集;把再分析结果当成原始数据入库;同一样本在两库出现两个"不同 ID"。
解决:
- 简单方法:统一用定宽正则
PXD\d{6}捕获原始数据集,RPXD\d{6}单独归类再分析。- 进阶方法:以 ProteomeCentral/PROXI API 为主数据源做 ID 归并(其元数据含 hostingRepository 与全部关联标识)。
- SOTA 方法:为每个 PXD 建"身份卡"(PXD + 宿主库 + announceDate + publicationList),再分析产物挂 RPXD 并回链原始 PXD,形成 §3.10 溯源链的工程落地。
参考:Deutsch et al., 2026, NAR. DOI 10.1093/nar/gkaf1146
⚠️ 坑点 3:Partial 提交没有机器可读的鉴定结果(分类:预处理陷阱)
问题:PX 允许两种提交工作流——Complete 要求结果文件为 PSI 开放标准格式(mzIdentML/mzTab),Partial 则允许任意分析输出。大量历史与工具特异性数据集为 Partial,下载后只有 raw + 提交者私有的 CSV/Excel 结果,无法直接进入标准解析链路。
症状:目录里没有.mzid/.mztab;结果表列名与软件绑定(如 MaxQuanttxt输出),pandas 读取后语义不明。
解决:
- 简单方法:在 ProteomeCentral 检索时优先筛 Complete 提交,或在下载前核对目录文件列表。
- 进阶方法:对 Partial 数据集的 raw 文件用开源流水线重搜——MSFragger(Kong et al., 2017, Nature Methods. DOI 10.1038/nmeth.4256)或 SearchGUI + PeptideShaker。
- SOTA 方法:用 quantms / MassIVE.quant 可复算工作流做标准化再分析,产出统一 mzML+mzIdentML+mzTab 三件套。
参考:Deutsch et al., 2023, NAR. DOI 10.1093/nar/gkac1040(Complete/Partial 定义)
⚠️ 坑点 4:实验设计元数据缺失,八成数据集无法直接做矩阵级复用(分类:标签理解)
问题:ML 复用需要"样本-文件-分组"三要素映射。对 2025 年发布的 500 个人类 PX 数据集的审计显示:39.0% 只能靠样本名猜测分组、34.0% 无可靠设计信息、仅 27.0% 有元数据级标注;把定量输出与设计信息都算上,仅 37.8% 支持直接矩阵级复用,严格标准下只剩 12.8%。
症状:数据下载成功却拼不出哪个文件属于病例组/对照组;定量矩阵列名与生物学分组对不上。
解决:
- 简单方法:选数据集时先看是否附 SDRF-Proteomics 文件,有 SDRF 的优先。
- 进阶方法:用 lesSDRF 类工具依据论文方法学补建 SDRF;自由文本分组做规范化清洗(§6.3 步骤二)。
- SOTA 方法:纳入 jPOST 的 JPDM 数据描述论文体系——其要求 SDRF 作为发表材料,天然携带结构化设计。
参考:Leite, 2026, Proteomics. DOI 10.1002/pmic.70175;Deutsch et al., 2026, NAR
⚠️ 坑点 5:大文件批量下载中断后从头再来(分类:工程陷阱)
问题:单个 PXD 可达数 TB,普通
wget/浏览器下载遇到网络抖动即失败,部分环境(校园网/防火墙)还会封锁 Aspera 的 UDP 通道。
症状:下载进度回零;解压时报 CRC 错误;文件数少于服务器目录列表。
解决:
- 简单方法:
wget -c(续传)+ 下载完成后对照checksum.txt逐文件校验 MD5。- 进阶方法:Aspera
ascp -k 2 -Q启用断点续传与校验;受限网络环境先测 443 端口 HTTPS 通道。- SOTA 方法:Globus(PRIDE 官方 2024 年起推荐)——Web 端点选择
EMBL-EBI Public Datacollection,路径/pride-archive/{YYYY}/{MM}/{PXD},断网自动恢复且多线程并行。
参考:PRIDE Data Download 文档(Globus 章节);PRIDE Globus 说明页
⚠️ 坑点 6:提交端 PX 工具 Aspera 卡死与 checksum 计算失败(分类:工程陷阱)
问题:向 PRIDE 提交数据时,PX 提交工具的 Aspera 上传可能长期停滞,checksum 计算步骤可能卡住——工具需要目标目录的写权限来生成校验文件,权限不足或代理未配置都会挂起。
症状:进度条停滞;log 目录里报权限错误;公司内网环境连接超时。
解决:
- 简单方法:在提交工具第 9 步把传输协议从 Aspera 切回 FTP 后重新提交。
- 进阶方法:为
px-submission-tool目录授予写权限后重算 checksum;内网用户编辑config.properties配置px.proxy.host/px.proxy.port(去掉#注释后重启工具)。- SOTA 方法:超大提交改走 Globus 通道,规避桌面端工具的不稳定性。
参考:PRIDE FAQ(提交工具章节)
⚠️ 坑点 7:私有数据集请求公开发布被拒(分类:工程陷阱)
问题:PRIDE 的发布流程要求关联的 PubMed ID/DOI 存在于 Europe PMC,预印本(preprint)不算发表;提交时填入 preprint DOI 或尚未来得及入库的 PMID 会导致发布请求失败。私有数据集最长保留 2 年,超期需主动申请延期。
症状:Publish 请求报"PubMed ID/DOI 不存在";数据集临近 2 年保留期收到提醒邮件。
解决:
- 简单方法:请求发布时若正式论文尚未被 Europe PMC 收录,先省略 PMID/DOI 字段提交,发表后联系 pride-support@ebi.ac.uk 补挂。
- 进阶方法:在 PRIDE Web 的访问控制页调整 release date,利用 60/30/7 天提醒节奏主动管理。
- SOTA 方法:把"数据发布 + 论文见刊"排进投稿计划(期刊通常在审稿阶段就要 PXD 号),避免发表即断链。
参考:PRIDE FAQ;PRIDE 数据政策 v1.0
⚠️ 坑点 8:跨 PXD 训练/测试泄漏——同源样本与再分析版本混入(分类:数据泄漏)
问题:PX 是"按数据集"组织的,同一批生物样本常被拆成多个 PXD(方法学对照、批量补交),再分析版本(RPXD)又与原始 PXD 并存;按数据集随机划分训练/测试集时,同源谱图两侧各半,模型指标虚高。
症状:跨数据集验证时性能骤降;同一肽段+电荷+碰撞能量组合出现在训练与测试两侧。
解决:
- 简单方法:以 PXD 为最小划分单元做 group split(leave-dataset-out),绝不在谱图级随机划分后跨集抽样。
- 进阶方法:合并去重键
(peptide_sequence, charge, collision_energy, instrument),测试集仅保留训练集未见的键组合;RPXD 全部划入训练侧并在文档中声明。- SOTA 方法:仿照 Prosit 的时间切片协议(Gessulat et al., 2019, Nature Methods. DOI 10.1038/s41592-019-0426-7)——以 announceDate 划分时间窗,测试集完全由窗口外发布的数据构成,同时报告 leave-dataset-out 结果。
参考:Mann et al., 2021, Cell Systems. DOI 10.1016/j.cels.2021.06.006;Deutsch et al., 2026, NAR
§6.6 数据增强
| 操作 | 判定 | 说明 |
|---|---|---|
| 强度抖动(±5% 高斯噪声) | ✅ 安全 | 模拟仪器随机噪声,不改变峰位置语义 |
| 峰强度 top-N 重采样 | ✅ 安全 | 与 §6.3 步骤三一致,属标准化而非增强 |
| m/z 平移 | ❌ 危险 | m/z 是物理量,平移破坏化学语义 |
| 谱图镜像/旋转 | ❌ 危险 | 对二维谱图套用视觉增强无物理意义 |
| 合并不同碰撞能量谱图 | ⚠️ 有条件 | 仅在以碰撞能量为条件变量时安全,否则引入 HCD/CID 混淆 |
| 电荷态重标签 | ❌ 危险 | 电荷态是标签的一部分,篡改等同换样本 |
§6.7 模型推荐
| 任务 | 推荐模型/工具 | 输入 | 首选场景 |
|---|---|---|---|
| 谱图强度预测 | Prosit(Transformer) | 肽段序列+电荷+碰撞能量 | 搜索重打分、DIA 谱库 |
| 保留时间预测 | DeepLC(卷积) | 序列+修饰 | 靶向方法转移、重打分 |
| 谱图鉴定重打分 | MS²Rescore / Percolator | PSM 特征 | 提升 PSM 数量 10-30% 量级 |
| DDA 数据库搜索 | MSFragger / Comet | mzML + 序列库 | 大规模再分析 |
| DIA 定量解析 | DIA-NN / Spectronaut | mzML + 谱库 | 队列定量 |
| 无参定量流水线 | quantms / MassIVE.quant | PX raw 全套 | Partial 数据集标准化 |
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 元数据检索(PROXI API) | 任意笔记本 | — | 纯 HTTP 请求 |
| 单 PXD 下载与解析 | 4 核 16 GB + 500 GB 磁盘 | 8 核 32 GB + 2 TB SSD | 大 PXD 优先 SSD |
| raw → mzML 转换 | 4 核 16 GB | 16 核 64 GB | CPU 密集,可并行按文件 |
| 谱图模型训练 | 1 × 16 GB 显存 GPU | 2-4 × A100 40 GB | Prosit 级 Transformer 需大显存 |
| 全库级再分析(quantms) | — | HPC 集群或云批处理 | 按数据集并行,磁盘 IO 瓶颈 |
§6.9 评估指标代码
import numpy as np
def psm_fdr_filter(scores, is_decoy, q=0.01):
"""按 target-decoy 策略计算 PSM 级 FDR 并过滤到 q 值阈值。
scores: 模型/引擎打分(越大越好);is_decoy: 布尔数组(诱骗命中=True)。
返回通过 1% FDR 的 PSM 掩码 —— 蛋白质组学鉴定的金标准质量控制。
"""
order = np.argsort(-scores)
decoy = np.asarray(is_decoy, dtype=float)[order]
cum_decoy = np.cumsum(decoy)
n_total = np.arange(1, len(decoy) + 1)
fdr = cum_decoy / n_total
passed_rank = np.argmax(fdr <= q) if (fdr <= q).any() else -1
mask = np.zeros(len(scores), dtype=bool)
if passed_rank >= 0:
mask[order[: passed_rank + 1]] = True
return mask
def topk_hit_rate(pred, true, k=1, tol=0.5):
"""谱图预测任务的 top-k 峰命中率(m/z 误差 ≤ tol Da 计为命中)。"""
hits = []
for p, t in zip(pred, true):
t = t[t > 0]
match = 0
for peak in t:
if len(p) and np.min(np.abs(p - peak)) <= tol:
match += 1
hits.append(match / len(t) if len(t) else 0.0)
return float(np.mean(hits))
def dataset_level_pcc(sample_pccs):
"""跨 PXD 报告定量一致性的规范方式:
先在每个数据集内计算预测强度与观测强度的 Pearson r,
再汇总各数据集的分布(中位数 + 四分位距),
避免 PSM 数量悬殊导致的加权偏倚。
"""
arr = np.asarray(sample_pccs, dtype=float)
return {"median": float(np.median(arr)),
"iqr": [float(np.percentile(arr, 25)), float(np.percentile(arr, 75))],
"n_datasets": int(len(arr))}
# 用法:mask = psm_fdr_filter(psm_df["search_engine_score[1]"].astype(float),
# psm_df["is_decoy"].eq("true"))
§6.10 MLOps 笔记
- 数据版本化:PX 滚动更新且元数据会被修订(Dataset History 可见多次 announce),建议用 DVC/pip 缓存固定"下载快照":记录 PXD 清单 + announceDate + checksum.txt + 下载日期四元组。
- 可复现切分:把 §5.3 的 group split 键(PXD 号列表)持久化为 CSV 并纳入版本控制,禁止运行时动态重采样。
- 增量更新策略:以 announceDate 为水位线,每月拉取新增 PXD 做增量评估;模型版本与数据水位线绑定发布。
- 许可证传播:CC0 数据无署名义务,但Panorama Public 默认 CC-BY 的子集须在模型卡(model card)中标注来源 PXD 列表。
- 监控漂移:按 §3.9 的 instrumentList 维护仪器分布基线,新数据中未见过的新型仪器(如 timsTOF 增量)触发训练集扩充评审。
- 结果对账:引用或复算任何公开结论时,把 PXD 号写入实验记录并回链 ProteomeCentral 页面快照(announceDate 之后的元数据可能被修订,Dataset History 是对账依据)。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 提交选择偏倚 | 负结果、失败实验极少入库;高影响期刊导向的实验室提交更活跃 | 高 | 再分析任务明确声明语料为"已发表正结果";避免把 PX 分布当作蛋白质组学全景 |
| 机构/地域集中 | PRIDE 承接 77%,欧美日中四大枢纽主导 | 中 | 跨库采样,报告库别分布 |
| 物种偏倚 | 人类与经典模式生物占绝对多数 | 中 | 跨物种任务显式分层采样 |
| 仪器偏倚 | Orbitrap 主导,非高分辨平台数据稀缺 | 中 | 按 instrumentList 分层,或限定任务域 |
| 元数据质量偏倚 | 提交者自述、无第三方标注审核;仅 27% 数据集有元数据级设计标注 | 高 | 优先 SDRF 数据集;标注缺失者降级为"仅原始数据"用途 |
| 存活偏倚(时间) | 公开率 69%,私有 2 年到期未延期的数据集退出可见池 | 低 | 统计口径固定"公开数据集" |
§7.2 标注质量评估
PX 的标注质量分层明显:Complete 提交经宿主库格式审核 + PSI 标准约束,鉴定结果可机读、FDR 策略可核查;Partial 提交的标注实质是"提交者私有格式",复用需重搜库。第三方审计给出了量化画像——500 个 2025 年发布的人类数据集中,49.0% 有完整定量输出、33.6% 部分可得、17.4% 完全缺失(Leite, 2026, Proteomics)。实践建议:凡进入训练集的样本,其 PSM 必须能回链到原始谱图(USI 可寻址),且搜库参数在元数据或 additional 文件中完整披露。
§7.3 泛化性评估
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 同库同任务(训练与测试同为 PRIDE 人类 DDA) | 低-中 | 社区大量成功复用(谱图预测、重打分均以 PX 语料训练并发表于 Nature Methods 级期刊) |
| 跨库(PRIDE 训练 → jPOST/iProX 测试) | 中 | 通道与格式转换链不同;SDRF 普及度不一 |
| 跨仪器(Orbitrap → timsTOF 离子淌度) | 高 | 谱图形态与采集模式差异大,top 15 仪器列表之外的平台数据稀疏 |
| 跨疾病域(常见病 → 罕见病队列) | 高 | 罕见病 PXD 样本量小,阳性类稀疏 |
| 临床定量绝对值外推 | 高 | 各数据集标准化流程不一,强度矩阵跨集不可直接比较 |
§7.4 伦理与隐私
PX 坚持"完全开放":公开数据集为去标识化的实验数据,不含患者身份信息,CC0 许可下可自由复用。结构性限制同样明确——目前 PX 无法承载需要受控访问的敏感人类数据(PRIDE FAQ 明确答复 “For now, NO”),因此含可识别风险的临床基因组配对数据走了其他通道(如 EGA),PX 生态内的人类蛋白质组数据均为可公开层级。联盟已把"受控访问人类蛋白质组学资源"列入未来计划(Deutsch et al., 2026, NAR),落地后本节内容需相应更新。
§7.5 公平性
PX 不收集患者级人口学字段,库级层面无法直接评估种族/性别代表性;物种与疾病分布的偏倚(§7.1)会传导到下游模型——以 PX 语料训练的疾病分类器隐式继承了"研究活跃疾病"的过采样。缓解路径:任务设计时按 SDRF 协变量(年龄、性别若在数据集级可得)分层评测;引用第三方审计结论时注明其为人类数据集样本,不外推全库。
§7.6 数据漂移
PX 处于持续加速状态:近 3 年新增占总量 47%,DIA、离子淌度与新兴修饰类型持续改变数据分布的构成比例。对长期部署的模型,推荐漂移监控三板斧:监控提交量的月度构成(按库/物种/仪器);对新 PXD 抽样跑固定锚定样本的模型推理,跟踪分数分布偏移;在 instrumentList 出现新型号时触发再训练评审(联动 §6.10)。
§7.7 DAIMS 数据质量评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | 数据以谱图(mzML)+ 标准表(mzTab)为主,定量矩阵形态因提交者而异,无统一宽表 |
| 2 | 唯一标识 | ✅ | PXD 持久唯一,USI 提供谱图级寻址,RPXD 标记再分析 |
| 3 | 特殊字符 | ⚠️ | 文件名约束仅 A-Za-z0-9_(PRIDE 政策),但元数据自由文本含多语言字符 |
| 4 | 重复行 | ⚠️ | 谱图无重复;跨库镜像与 RPXD/PXD 并存导致样本级近重复 |
| 5 | 缺失编码 | ✅ | XML/TSV 标准格式语义明确,空缺即缺省,无哨兵值混淆 |
| 6 | 标签标识 | ⚠️ | 疾病/分组标签为提交者自由文本,无受控词表强制 |
| 7 | 罕见类分组 | ❌ | 罕见病/稀有修饰数据集样本量小,类别极不均衡 |
| 8 | 偏倚评估 | ✅ | 官方论文持续披露提交分布(库别/物种/仪器),第三方审计补充复用性画像 |
| 9 | 数据字典 | ✅ | PSI 标准即数据字典:mzML/mzIdentML/mzTab/SDRF 均有 schema 与文档 |
| 10 | 信息性缺失解释 | ⚠️ | Complete/Partial 差异实质是"结果文件缺失",但库页面提示不统一 |
| 11 | 设备记录 | ✅ | instrumentList 元数据字段 + 官方统计(top 15 仪器) |
| 12 | 共线性 | ⚠️ | TMT/iTRAQ 多通道设计易产生通道共线,需按实验设计核查 |
| 13 | 编码映射 | ✅ | PSI-MOD 修饰术语 + NCBI TaxID 物种 ID 提供标准化映射 |
| 14 | 时间戳处理 | ✅ | announceDate/Dataset History 完整,支持时间切片 |
| 15 | 划分建议 | ❌ | 无官方划分;社区惯例不统一,需自行设计并文档化 |
| 16 | 泄漏讨论 | ✅ | 肽段级/数据集级泄漏模式在社区文献中有明确讨论与协议(§5.3) |
| 17 | 标签分布 | ⚠️ | 库级统计可得(公开率、库别份额),任务级标签分布需自查 |
| 18 | 测量偏倚 | ⚠️ | 仪器/批次效应显著且跨集不一致,需协变量建模 |
| 19 | 外部验证建议 | ✅ | 跨库/跨仪器验证路径清晰(§5.5),公开数据获取零成本 |
| 20 | 版本记录 | ✅ | Dataset History 逐条记录修订时间与变更 |
| 21 | 预处理脚本 | ⚠️ | 官方无统一脚本;quantms/MassIVE.quant 社区流水线可复算 |
| 22 | 合规要求 | ✅ | CC0 为主,PRIDE 数据政策成文,公开数据无使用限制 |
| 23 | 多模态对齐 | ⚠️ | 谱图-鉴定-定量三层对齐依赖 Complete 提交;Partial 需重建 |
| 24 | 去标识化 | ✅ | 人类数据提交前由实验室完成去标识化,公开层级无直接标识符 |
DAIMS 评分:14.5 / 24
评分解读:ProteomeXchange 在"基础设施层"表现接近满分——唯一标识、标准格式、版本记录、时间戳、合规要求均由联盟级机制保证,这是任何单一机构数据集难以企及的。失分集中在"语料层":PX 是千万异质实验的聚合体而非策划数据集,标签自由文本、无官方划分、类别失衡与跨集测量偏倚是结构性属性,不会随时间自行消失。约三分之一的公开数据集缺乏机器可读的实验设计标注(27% 元数据级标注率)是 AI 视角下最痛的短板。
对你意味着什么:第一,把 PX 当作"带索引的原始数据海洋"而非"整理好的表格"——你的工程预算应主要花在元数据清洗与泄漏防护(§5.3、坑点 4、坑点 8),而不是数据获取本身。第二,用"PXD 为组、SDRF 为纲、announceDate 为界"三原则构建训练集,可直接规避最贵的返工。第三,优先复用 Complete 提交与社区再分析流水线(quantms/MassIVE.quant)的产出,把重搜库成本转嫁给流水线。第四,任何据此训练的临床向模型,必须走 §5.5 的跨库外部验证,并在模型卡中声明训练 PXD 清单与版本水位线。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 110 个人类磷酸化 PXD 联合再分析(PXD012174) | EMBL-EBI 等多机构 | 磷酸化位点图谱整合 | 252,189 位点 @1% PSM FDR,其中 121,896 过位点定位 FDR | — | 跨 PXD 联合再分析可显著扩大位点覆盖(Ochoa et al., 2020, Nature Biotechnology. DOI 10.1038/s41587-019-0344-3) |
| 500 个人类 PX 数据集(2025 年发布)可复用性审计 | 独立学术团队(Proteomics) | 实验设计可复用性 | 27.0% 元数据级标注;37.8% 矩阵级可复用 | — | 复用瓶颈在元数据而非数据本身(Leite, 2026, Proteomics. DOI 10.1002/pmic.70175) |
| PX 公开语料 → 谱图预测(Prosit 范式) | TUM 等多机构 | PSM 重打分增益 | 论文报告跨多种工具一致的鉴定提升 | 任务相关 | 公共数据训练的谱图预测器已成为搜索流水线标配(Gessulat et al., 2019, Nature Methods) |
注:PX 为基础设施型资源,"外部验证"以复用研究的量化结论呈现;各研究口径不同,指标不可跨行直接比较。
§8 基准性能与生态
§8.1 代表性模型/工具榜(基于 PX 公开数据训练或评测)
ProteomeXchange 无官方排行榜。下表列出直接以 PX 公开语料训练/评测、且在社区广泛使用的代表模型,性能列给出定性结论(任务口径各异,数值不可直接比较):
| 排名 | 模型/工具 | 性能(定性) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Prosit | 谱图强度预测成为重打分标配,跨引擎通用 | 2019 | GRU→Transformer 序列模型 | Gessulat S et al., 2019, Nature Methods. DOI 10.1038/s41592-019-0426-7 | github.com/kusterlab/prosit |
| 2 | DeepLC | 保留时间预测精度领先且跨修饰泛化 | 2021 | 深度卷积 + 迁移 | Bouwmeester R et al., 2021, Nature Methods. DOI 10.1038/s41592-021-01301-2 | github.com/compomics/DeepLC |
| 3 | MSFragger | 开放搜索/常规搜索速度与灵敏度标杆 | 2017 | 离子索引超快搜库 | Kong AT et al., 2017, Nature Methods. DOI 10.1038/nmeth.4256 | github.com/Nesvilab/MSFragger |
| 4 | DIA-NN | DIA 定量精度与速度兼顾的开源方案 | 2020 | 深度谱图预测嵌入搜库 | Demichev V et al., 2020, Nature Methods. DOI 10.1038/s41592-019-0731-1 | github.com/vdemichev/DiaNN |
| 5 | MaxQuant | 经典 LFQ/TMT 全流程,社区事实标准之一 | 2008 | 仔细的匹配间扫描与 ANDROMEDA 搜库 | Cox J & Mann M, 2008, Nature Biotechnology. DOI 10.1038/nbt.1511 | maxquant.net |
说明:各模型训练/评测子集、任务定义与指标互不相同,本表仅提供选型线索,不构成统一基准排名。
§8.2 SOTA 总结与选型建议
蛋白质组学 ML 的选型逻辑与 CV/NLP 不同:先选"数据形态"再选模型。已有 Complete 提交 + 标准格式时,MSFragger/DIA-NN 类工具链开箱即用;要做谱图/保留时间预测,Prosit/DeepLC 提供成熟范式与预训练权重;要从 Partial 数据救回价值,quantms 再分析是默认解。工程上优先复用社区预训练权重,把自训练留给分布外仪器或新型修饰。
时间维度上还有一条选型经验:越新的任务(如跨通道强度对齐、修饰位点定位预测)社区方案越不成熟,此时"自建基准"的价值高于"刷已有基准"——而 PX 的规模保证了自建基准的样本量下限。反之,谱图预测与保留时间预测已是红海,除非有明确的新仪器/新修饰场景,不建议从零重训。
§8.3 评测协议
社区公认的评测要素:target-decoy 1% PSM/肽段 FDR 作为统一质量闸门(§6.9 代码);训练/测试按 PXD 分组 + announceDate 时间切片(§5.3);报告指标时注明搜库软件、序列库版本与 FDR 层级(PSM/peptide/protein)。跨工具比较还须固定译码条件——同一 mzML 转换参数(峰值挑选、去噪开关)与同一 UniProt 序列库版本,否则搜索引擎间的差异会被格式链差异污染。ProteomicsML 社区平台汇集了基于 PX 语料的 ML 基准数据集,可作为协议参考。
§8.4 相关数据集
| 数据集 | 与 PX 的关系 | 适用任务 |
|---|---|---|
| PRIDE Archive | PX 最大成员库(77% 提交) | 通用 DDA/DIA 存档检索 |
| MassIVE.quant | MassIVE 的再分析层 | 定量复算与工作区共享 |
| PeptideAtlas / PASSEL | 谱库与靶向存档成员库 | 谱库构建、SRM/PRM 方法迁移 |
| ProteomicsML | 基于 PX 语料的 ML 基准聚合 | 谱图/保留时间/鉴定模型训练 |
| UniProtKB | 蛋白序列参考库 | 搜库序列库来源(非 PX 成员) |
§8.5 关键论文 Top 8
- Vizcaíno JA, Deutsch EW, Wang R et al. ProteomeXchange provides globally coordinated proteomics data submission and dissemination. Nature Biotechnology, 32(3):223-226, 2014. DOI 10.1038/nbt.2839 —— 奠基论文,确立 PXD 标识符与统一提交工作流。
- Deutsch EW, Csordas A, Sun Z et al. The ProteomeXchange consortium in 2017: supporting the cultural change in proteomics public data deposition. Nucleic Acids Research, 45(D1):D1100-D1106, 2017. DOI 10.1093/nar/gkw936 —— 记录"发表即共享"文化变革与成员库扩展。
- Deutsch EW, Bandeira N, Sharma V et al. The ProteomeXchange consortium in 2020: enabling ‘big data’ approaches in proteomics. Nucleic Acids Research, 48(D1):D1145-D1152, 2020. DOI 10.1093/nar/gkz969 —— 大数据时代的能力扩展与 USI 推进。
- Deutsch EW, Bandeira N, Perez-Riverol Y et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucleic Acids Research, 51(D1):D1539-D1548, 2023. DOI 10.1093/nar/gkac1040 —— 十周年快照,七资源功能矩阵与 SDRF 推广。
- Deutsch EW, Bandeira N, Perez-Riverol Y et al. The ProteomeXchange consortium in 2026: making proteomics data FAIR. Nucleic Acids Research, 2026. DOI 10.1093/nar/gkaf1146 —— 最新更新:ProteomeCentral 重写、复用生态与受控访问路线图。
- Mann M, Kumar C, Zeng WF et al. Artificial intelligence for proteomics and biomarker discovery. Cell Systems, 12(8):759-770, 2021. DOI 10.1016/j.cels.2021.06.006 —— 综述蛋白质组学 AI 的任务版图,PX 数据是其中训练语料底座。
- Ochoa D, Jarnuczak AF, Viéitez C et al. The functional landscape of the human phosphoproteome. Nature Biotechnology, 38(3):365-373, 2020. DOI 10.1038/s41587-019-0344-3 —— 联合再分析 110 个 PX 数据集的旗舰案例。
- Leite GGF et al. How reusable are public proteomics datasets in practice? Proteomics, 2026. DOI 10.1002/pmic.70175 —— 500 个 PX 数据集的复用性审计,量化元数据缺口。
§8.6 社区活跃度
PX 生态的活跃度有三重信号:数据增长(2025-06 单月 1,156 个新提交、近 3 年占总量 47%);论文矩阵(每三年一篇 NAR 数据库更新论文,奠基论文引用 2,957+,截至 2026-09,Google Scholar);治理机制(HUPO-PSI 定期会议制定标准,PRIDE/MassIVE/jPOST/iProX 各自维护文档与 FAQ,GitHub 上有 PRIDE-Archive 讨论区与 proxi-schemas 等开放仓库)。对使用者,最活跃的求助入口是各库 FAQ 与支持邮箱(如 pride-support@ebi.ac.uk)。
学术侧的跟进信号同样密集:联盟每个里程碑都伴随方法论跟进(USI 定稿后出现一批 USI 原生的可视化与检索工具;SDRF 推广后主要搜索引擎陆续宣布支持)。对工程团队,把 PSI 标准邮件列表与联盟更新论文(每三年一篇)纳入技术雷达,是成本最低的生态追踪方式。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| ProteomeCentral | 统一检索门户 + PROXI API | proteomecentral.proteomexchange.org | 全联盟元数据单一入口,OpenAPI 可编程 |
| PRIDE 文档站 | 官方文档 | ebi.ac.uk/pride | 下载/提交/数据政策最完整的操作手册 |
| PRIDE-Archive GitHub Discussions | 社区问答 | github.com/orgs/PRIDE-Archive/discussions | 团队成员直接答疑 |
| HUPO-PSI | 标准组织 | hupo.org/psi | mzML/mzIdentML/mzTab/USI/SDRF 标准源头 |
| quantms | 再分析流水线 | github.com/bigbio/quantms | Partial 数据标准化的开源方案 |
| ProteomicsML | ML 基准聚合 | 社区平台(2026 NAR 论文列名) | 蛋白质组学 ML 数据集与教程聚合 |
| lesSDRF | 元数据编写工具 | 社区 Web 工具(2026 NAR 论文列名) | 交互式生成合规 SDRF-Proteomics 表 |
| Aspera Connect | 传输客户端 | IBM 官网分发 | PRIDE 大文件最快通道客户端 |
§9 相关资源与引用
§9.1 官方资源索引
| 资源 | 说明 | 链接 |
|---|---|---|
| ProteomeXchange 官网 | 联盟总览与论文列表 | http://www.proteomexchange.org |
| ProteomeCentral | 统一检索门户(元数据 + 下载入口) | https://proteomecentral.proteomexchange.org/ |
| PX-XML Schema | 数据集级元数据公共模型 | http://proteomecentral.proteomexchange.org/schemas/proteomeXchange-1.4.0.xsd |
| PRIDE 数据下载文档 | HTTPS/FTP/Aspera/Globus/Streaming 全通道说明 | https://www.ebi.ac.uk/pride/markdownpage/pridefiledownload |
| PRIDE 数据政策 | 许可、私有期、发布与撤回规则 | https://ebi.ac.uk/pride/markdownpage/datapolicy |
| PRIDE FAQ | 提交工具、发布请求、文件命名常见问题 | https://ebi.ac.uk/pride/markdownpage/faq |
| MassIVE 文档 | 提交与 MassIVE.quant 使用 | https://ccms-ucsd.github.io/MassIVEDocumentation/ |
| jPOST 帮助 | 提交流程与 JPDM 数据期刊 | https://jpostdb.org/ |
| iProX 帮助页 | 中文团队数据入口 | https://www.iprox.org/page/helpEn.html |
| Panorama Public 文档 | 靶向数据与 Skyline 项目共享 | https://panoramaweb.org/public_docs.url |
§9.2 BibTeX 引用块
@article{vizcaino2014proteomexchange,
title = {ProteomeXchange provides globally coordinated proteomics data submission and dissemination},
author = {Vizca{\'i}no, Juan Antonio and Deutsch, Eric W and Wang, Rui and Csordas, Attila and Reisinger, Florian and R{\'i}os, Daniel and Dianes, Jos{\'e} A and Sun, Zhi and Farrah, Terry and Bandeira, Nuno and others},
journal = {Nature Biotechnology},
volume = {32},
number = {3},
pages = {223--226},
year = {2014},
doi = {10.1038/nbt.2839}
}
@article{deutsch2026proteomexchange,
title = {The ProteomeXchange consortium in 2026: making proteomics data {FAIR}},
author = {Deutsch, Eric W and Bandeira, Nuno and Perez-Riverol, Yasset and others},
journal = {Nucleic Acids Research},
year = {2026},
doi = {10.1093/nar/gkaf1146},
note = {PMID: 41206473; PMCID: PMC12807779}
}
@article{deutsch2023proteomexchange,
title = {The ProteomeXchange consortium at 10 years: 2023 update},
author = {Deutsch, Eric W and Bandeira, Nuno and Perez-Riverol, Yasset and Sharma, Vishal and Carver, Jeremy J and others},
journal = {Nucleic Acids Research},
volume = {51},
number = {D1},
pages = {D1539--D1548},
year = {2023},
doi = {10.1093/nar/gkac1040}
}
@article{leite2026reusable,
title = {How reusable are public proteomics datasets in practice?},
author = {Leite, Giuseppe G F},
journal = {Proteomics},
year = {2026},
doi = {10.1002/pmic.70175}
}
@article{ochoa2020phosphoproteome,
title = {The functional landscape of the human phosphoproteome},
author = {Ochoa, David and Jarnuczak, Andrew F and Vi{\'e}itez, Ceire and others},
journal = {Nature Biotechnology},
volume = {38},
number = {3},
pages = {365--373},
year = {2020},
doi = {10.1038/s41587-019-0344-3}
}
§9.3 引用指南
在论文中引用 PX 数据时遵循三段式:其一,引用对应资源库论文(如 PRIDE 更新论文)与 PX 联盟奠基论文(上方 BibTeX 第一条);其二,在数据可用性声明中写明 PXD 编号(“The mass spectrometry proteomics data have been deposited to the ProteomeXchange Consortium via the PRIDE partner repository with the dataset identifier PXD000001”);其三,若使用了第三方再分析产出(如 MassIVE.quant 工作区),同时引用对应再分析论文并注明 RPXD/工作区编号。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型
| 模型 | 用途 |
|---|---|
| fast-model(CodeBuddy Code 内置) | 检索结果归纳、条目撰写、代码示例组织 |
§10.2 AI 参与范围
AI 负责执行检索计划、汇总事实、起草全部章节文本与代码示例;所有规模数字、日期与论文引用均要求来自检索获得的公开来源并标注出处。章节结构、行数预算与发布门槛依据千方病案医数集写作宪法 v1.0 执行。代码示例以可读性优先,按"最小可运行"标准编写并在无网络依赖处使用开源库(pyteomics、pandas、PyTorch),生产环境使用前需按 §0 技术免责声明自行验证。
§10.3 输入来源列表
- Deutsch EW, Bandeira N, Perez-Riverol Y et al. The ProteomeXchange consortium in 2026: making proteomics data FAIR. Nucleic Acids Research, 2026. DOI 10.1093/nar/gkaf1146. PMID 41206473. PMCID PMC12807779.
- Vizcaíno JA, Deutsch EW, Wang R et al. ProteomeXchange provides globally coordinated proteomics data submission and dissemination. Nature Biotechnology, 32(3):223-226, 2014. DOI 10.1038/nbt.2839.
- Deutsch EW, Bandeira N, Perez-Riverol Y et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucleic Acids Research, 51(D1):D1539-D1548, 2023. DOI 10.1093/nar/gkac1040.
- Deutsch EW, Csordas A, Sun Z et al. The ProteomeXchange consortium in 2017: supporting the cultural change in proteomics public data deposition. Nucleic Acids Research, 2017. DOI 10.1093/nar/gkw936.
- PRIDE Data Download. EMBL-EBI. https://www.ebi.ac.uk/pride/markdownpage/pridefiledownload
- PRIDE data policy v1.0 (May 2022). EMBL-EBI. https://ebi.ac.uk/pride/markdownpage/datapolicy
- PRIDE FAQ. EMBL-EBI. https://ebi.ac.uk/pride/markdownpage/faq
- Leite GGF. How reusable are public proteomics datasets in practice? Proteomics, 2026. DOI 10.1002/pmic.70175.
- Ochoa D, Jarnuczak AF et al. The functional landscape of the human phosphoproteome. Nature Biotechnology, 38(3):365-373, 2020. DOI 10.1038/s41587-019-0344-3(案例数据集 PXD012174-3).
- ProteomeCentral 数据集条目 PXD012174-3. https://proteomecentral.proteomexchange.org/cgi/GetDataset?ID=PXD012174-3
- Gessulat S et al. Prosit: proteomic-wide prediction of peptide tandem mass spectra. Nature Methods, 2019. DOI 10.1038/s41592-019-0426-7.
- Mann M, Kumar C, Zeng WF et al. Artificial intelligence for proteomics and biomarker discovery. Cell Systems, 12(8):759-770, 2021. DOI 10.1016/j.cels.2021.06.006.
- Global proteomics data sharing grows fast as ProteomeXchange scales up. News-Medical, 2026-04-20. https://www.news-medical.net/news/20260420/Global-proteomics-data-sharing-grows-fast-as-ProteomeXchange-scales-up.aspx
- ProteomeXchange 联盟 2026:推动蛋白质组学数据迈向 FAIR 化新纪元. 生物通, 2025-11. https://news.ebiotrade.com/2025-11/20251107084151626.htm
- Google Scholar 作者主页(Juan Antonio Vizcaíno,引用计数,截至 2026-09). https://scholar.google.ae/citations?hl=en&oi=sra&user=tFCEGicAAAAJ
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 schema_org | 千方病案医学编辑部 | 对照写作宪法逐字段核验 | ✅ 已通过 |
| §1 概览与 §1.4 时间轴 | 千方病案医学编辑部 | 与 2026 NAR 论文逐项比对 | ✅ 已通过 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | ICD-11/SNOMED CT 编码复核 | ✅ 已通过 |
| §3-§4 规格与数据结构 | 千方病案医学编辑部 | 与官方文档/论文 Table 1 核对 | ✅ 已通过 |
| §5 划分策略与 §6 坑点 | 千方病案医学编辑部 | 与 PRIDE FAQ/下载文档逐条溯源 | ✅ 已通过 |
| §7 DAIMS 与偏倚分析 | 千方病案医学编辑部 | 引用第三方审计原文核验 | ✅ 已通过 |
| §8-§9 引用与生态 | 千方病案医学编辑部 | DOI 与论文题录逐条核对 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页面全部章节由 AI 起草(模型与范围见 §10.1-§10.2),经千方病案医学编辑部按 §10.4 记录的方式逐模块人工校验后发布;§0 三段免责声明为编辑部固定模板文本。
§10.6 最后人工审核日期
2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- pride — 共享标签:基因组学与多组学 / 代谢组学 / 蛋白质组学
- string — 共享标签:基因组学与多组学 / 蛋白质组学
- metabolights — 共享标签:基因组学与多组学 / 代谢组学
- metabolomics-workbench — 共享标签:基因组学与多组学 / 代谢组学
- uniprot — 共享标签:基因组学与多组学 / 蛋白质组学
- alphafold — 共享标签:基因组学与多组学 / 蛋白质组学
- cptac — 共享标签:基因组学与多组学 / 蛋白质组学
- kegg — 共享标签:基因组学与多组学 / 蛋白质组学
- alphafold — 共享标签:基因组学与多组学 / 蛋白质组学
- tcga — 共享标签:基因组学与多组学 / 蛋白质组学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
