信息速览

PRIDE — 质谱蛋白质组学数据仓库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | PRIDE Archive |
| 英文全称 | PRoteomics IDEntifications database (PRIDE) |
| 别名/简称 | PRIDE、PRIDE Archive、PRIDE Database |
| 疾病分类 | 全疾病谱(无单一 ICD-11 映射;代表性研究覆盖 2A00-2F9Z 恶性肿瘤、8A00 阿尔茨海默病、BA00-BE2Z 心血管疾病等,详见 §2.1) |
| SNOMED CT | 275926006 Mass spectroscopy (procedure) / 118969006 High throughput nucleotide sequencing analysis 之外的非测序组学方法 / 385388002 Proteomics (procedure)(详见 §2.2) |
| 数据模态 | 质谱谱图(MS1/MS2)、肽段与蛋白质识别、定量矩阵、交联质谱、实验元数据(SDRF-Proteomics) |
| AI 任务类型 | 谱图预测与解析、肽段保留时间预测、翻译后修饰位点鉴定、疾病分型、生物标志物发现、蛋白质基因组学、谱库构建 |
| 样本总数 | 50,804 个数据集(截至 2025-07);早期 USI 索引覆盖 5.4 亿+ 条 PSM |
| 数据大小 | 数百 TB 量级(以 vendor RAW 为主;2022-2024 月均下载约 100 TB) |
| 数据格式 | RAW(Thermo/Bruker/SCIEX 等厂商私有)、mzML、mzIdentML、mzTab、MGF/peak lists、SDRF-Proteomics |
| 许可证 | Creative Commons CC0 1.0 Universal(2018-06 起提交的数据集;此前数据集适用 EBI Terms of Use) |
| 访问级别 | 开放(无需注册即可下载全部公开数据集) |
| DUO 标签 | NRES, GRU |
| 语言 | 英文 |
| 首发日期 | 2004(Proteomics 创始论文 2005-08 发表) |
| 最后更新 | 持续滚动更新(月均新增约 534 个数据集,截至 2026-09) |
| 发布机构 | 欧洲生物信息学研究所(EMBL-EBI) |
| 官方主页 | https://www.ebi.ac.uk/pride |
| 下载地址 | https://www.ebi.ac.uk/pride/archive/ |
| DOI | 10.1093/nar/gkae1011(2025 更新论文) |
| 引用次数 | 2019 更新论文 5,515+(Mendeley 记录,截至 2026-09);原始 2005 论文 687+(Google Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— API/pridepy/文档/再分析工作流生态完善且完全开放;扣分项:无官方标签划分、RAW 为厂商私有格式需转换、跨数据集元数据质量参差 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、蛋白质组学临床任务定义)、§7 偏倚分析(仪器偏倚、提交偏倚、泛化性评估)。
数据工程审核:千方病案医学编辑部交叉审核。医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典(文件类别与元数据字段)、§5 数据划分策略、§6 预处理 Pipeline(RAW 转换、FDR 过滤)和坑点(API 断裂、限速、泄漏控制)。
审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。PRIDE Archive 中 2018 年 6 月起提交的数据集适用 CC0 公共领域许可,此前提交的数据集适用 EBI Terms of Use;部分具体数据集页面可能附带更细化的使用说明。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? PRIDE(PRoteomics IDEntifications database)是欧洲生物信息学研究所(EMBL-EBI)运营的全球最大质谱蛋白质组学公开数据仓库。全世界实验室做完质谱实验后,把原始谱图文件、肽段/蛋白质识别结果和实验设计元数据提交到 PRIDE,获得一个 PXD 登录号;论文发表时,这个登录号就是"数据可获取性声明"指向的标准地址。截至 2025 年 7 月,它已归档 50,804 个数据集,并且仍在以每月约 534 个的速度增长。
为什么重要? 质谱数据是蛋白质组学的"原始影像"——它记录了每个肽段被电离和碎裂后的物理信号,是一切下游识别、定量与建模的证据基础。PRIDE 把这些数据永久、免费、以 CC0 许可开放给所有人,使二次分析、方法基准评测和 AI 模型训练成为可能。没有它,深度学习预测谱图与保留时间(如 DeepLC 等)这类成果就没有规模化训练语料。
我能用它做什么? 典型用途包括:下载某篇论文对应的 PXD 数据集复现结果;把数百个数据集重新搜索一遍做泛癌/泛组织比较;训练谱图强度、保留时间或碎片离子预测模型;构建任务特异的谱库;把肽段映射回基因组做蛋白质基因组学分析。注意 PRIDE 是"仓库"而不是"整理好的表格"——它保留每个实验室提交的原始状态,统一清洗需要你自己完成。
§1.1 摘要
PRIDE 由 EMBL-EBI 于 2004 年建立(Martens 等,2005),2011 年起作为 ProteomeXchange 联盟创始成员提供统一的 PXD 登录号与提交基础设施(Vizcaíno 等,2014)。数据以"数据集"(原"experiment",现 project)为单位组织:每个数据集含一组文件——厂商 RAW 原始文件、转换后的开放格式(mzML 谱图、mzIdentML/mzTab 识别与定量结果、MGF peak lists)以及 SDRF-Proteomics 实验设计表。2018-2019 年基础设施重写后,元数据迁至 MongoDB/Solr 双数据中心分片集群,公开文件迁入 EMBL-EBI 的 FIRE 对象存储(与 ENA、EGA 共用)。数据获取有 5 条通道:网页界面、PRIDE Inspector 桌面工具、REST API(v2/v3)、FTP/HTTPS/Aspera/Globus 文件仓库与 Streaming API。自 2018 年 6 月起提交的数据集统一适用 CC0。最新状态(Perez-Riverol 等,2025):截至 2025-07 归档 50,804 个数据集,2024-07 至 2025-07 提交量同比增长 23%(1,557 个),月均下载量约 100 TB,超过 8,000 个数据集已系统链接到 GEO、MetaboLights、ENA、EGA 等多组学资源。
§1.2 战略价值
维度一:领域基础设施与合规入口。 PRIDE 是质谱蛋白质组学发表生态的"默认终点"——主要期刊与资助机构要求质谱数据在 ProteomeXchange 资源中存档,而 PRIDE 承接了其中最大份额(PXD 登录号持久唯一,可经 identifiers.org 解析)。对 AI 团队而言,这意味着按 PXD 号即可追溯到论文-数据-方法的完整链条,为构建带文献标注的训练集提供天然的弱监督信号来源。
维度二:AI 训练语料与基准生态。 PRIDE 是谱图级深度学习模型的事实训练源:保留时间预测(DeepLC,Nature Methods 2021)等模型依赖跨数据集的规模化谱图-肽段配对语料。USI(Universal Spectrum Identifier)机制让任一谱图可以被统一寻址——PRIDE Archive USI 已能实时访问超过 80% 的存量 RAW 文件(Thermo 仪器部分,经 ThermoRawFileParser 抽取),这为"按谱图 ID 训练"的流式训练管线提供了基础设施。
维度三:医学再分析的底座。 面向临床的蛋白质组学结论(生物标志物、疾病分型)高度依赖统计功效,单一研究通常样本不足。PRIDE 保存的原始级别数据使跨研究合并再分析成为可能:EMBL-EBI 团队基于 SDRF-Proteomics 与 quantms 工作流已再分析 100+ 数据集、13,000 个人类样本,产出迄今最大的人类蛋白质定量集合,并系统性回流 UniProt 与 Expression Atlas。
维度四:全开放的可编程性。 五条下载通道 + 版本化 REST API + 官方 Python 客户端 pridepy(Apache 2.0)+ 持久 PXD/USI 标识,构成 AI 团队偏好的"基础设施形态":匿名可读、无请求配额外的门槛、公开数据永久不可变(checksum 固定),可直接嵌入 CI 级别的数据版本化管线。相比之下多数临床数据仓库(如凭证化 EHR 库)需要长期合规流程,PRIDE 是蛋白质组学域"当天即可开工"的少数选择。
§1.2b 战略价值速记表
| 价值维度 | 一句话 | 支撑事实 |
|---|---|---|
| 领域地位 | 蛋白质组学的"默认发布终点" | 50,804 数据集、PX 创始成员、PXD 持久标识 |
| AI 语料 | 谱图级深度学习的事实训练源 | 5.4 亿+ PSM 索引、USI 实时抽谱 >80% Thermo RAW |
| 医学再分析 | 跨研究合并的原始级底座 | quantms 100+ 数据集/13,000 人样本再分析 |
| 工程友好 | 开放 + 可编程 + 不可变 | CC0、5 种传输通道、REST API v3、pridepy |
§1.3 同类数据集横向对比
| 维度 | PRIDE | MassIVE | PeptideAtlas / PASSEL | jPOST | iProX |
|---|---|---|---|---|---|
| 运营机构 | EMBL-EBI(英国) | UCSD(美国) | Institute for Systems Biology(美国) | jPOST 项目(日本) | 国家蛋白质科学中心(北京) |
| 定位 | ProteomeXchange 主仓库、最大份额 | ProteomeXchange 成员、第二大资源 | 靶向蛋白质组学(PASSEL)+ 一致性库 | ProteomeXchange 成员 | ProteomeXchange 成员 |
| 数据许可 | CC0(2018-06 起) | CC0 | CC0 | CC0 | CC-BY(默认) |
| 文件传输 | FTP/Aspera/Globus/HTTPS/Streaming | FTP | FTP | FTP, HTTPS | HTTP, Aspera |
| 独有优势 | USI 实时谱图访问、quantms/SDRF 再分析生态、Crosslinking 专区 | 与搜索引擎生态(Skyline 等)集成深 | 高置信一致性肽段库 | 亚洲区提交枢纽 | 中国区提交枢纽 |
| PXD 登录号 | ✅ 持久唯一 | ✅ | ✅ | ✅ | ✅ |
差异化要点:五个资源共享 PXD 登录号体系且元数据互相同步,规模与工具生态上 PRIDE 领先;如果你的训练语料需要"谱图可按 USI 实时抽取",PRIDE 是唯一具备该能力规模的资源。
§1.4 版本时间轴
| 时间 | 里程碑 | 说明 |
|---|---|---|
| 2004 | PRIDE 上线 | EMBL-EBI 内部立项,首个年度提交 20 个数据集 |
| 2005-08 | 创始论文 | Martens 等,Proteomics 5(13):3537-3545 |
| 2006 | NAR 数据库专刊论文 | Jones 等,Nucleic Acids Res 34:D659-D663 |
| 2011-2012 | 加入 ProteomeXchange | 统一 PXD 登录号与跨仓提交规范;PX 论文 2014 发表 |
| 2016 | API 与量化支持 | v2 REST API;量化数据支持改进(2016 NAR update) |
| 2018-06 | CC0 默认许可 | 此后提交数据集统一 CC0 |
| 2019 | 基础设施重写 | MongoDB/Solr 双数据中心分片;分布式架构论文(2019 NAR update) |
| 2020 | PX 联盟统一 CC0 | 联盟层面以 CC0 为基础许可 |
| 2024 | PRIDE Chatbot 与 Crosslinking | 开源 LLM 问答助手上线;XL-MS 专区发布 |
| 2025-07 | 50,804 个数据集 | 2024-07~2025-07 提交 1,557 个(+23%);pridepy JOSS 论文发表 |
§1.5 典型应用场景
- 论文复现与结果验证:按 PXD 号下载论文配套数据,用结果文件(mzIdentML/mzTab)直接核对表格数字,或重新搜索 RAW 验证关键肽段证据(USI 可实时抽谱)。
- 跨研究泛疾病再分析:以 SDRF-Proteomics 筛选同疾病域数据集,用 quantms(Nextflow/OpenMS/DIA-NN)批量重搜索,构建合并定量矩阵做荟萃分析(参考:191 癌细胞系 + 246 肿瘤样本的泛癌蛋白质图谱,PXD013455)。
- 深度学习谱图建模:抽取大规模谱图-肽段配对语料,训练/微调碎片离子强度、保留时间、电荷态预测模型,用于搜索引擎打分升级。
- 蛋白质基因组学:将非典型肽段映射回基因组坐标(PepGenome 生成 BED),发现变异肽段与新抗原候选(参考数据集 PXD029362/PXD029360)。
- 谱库构建:从海量 DDA 数据集中抽取高置信 PSM 构建任务特异性谱库,提升 DIA 分析灵敏度。
§2 医学背景
PRIDE 不是单一疾病数据集,而是覆盖全疾病谱的蛋白质组学证据仓库。本节从医学建模视角说明:哪些疾病域的数据最丰富、对应的标准术语编码、蛋白质组学在临床任务链中的位置,以及使用者应建立的人群预期。
§2.1 ICD-11 疾病映射
PRIDE 数据集由提交者自行标注疾病关键词,无统一疾病轴;下表列出 repository 中研究密度较高的疾病域及其 ICD-11 编码,供检索与分层参考。
| 疾病域(中文) | 疾病域(英文) | ICD-11 编码 | PRIDE 中的典型形态 |
|---|---|---|---|
| 恶性肿瘤(总类) | Malignant neoplasms | 2A00-2F9Z | 癌/癌旁组织配对定量、癌细胞系图谱、泛癌 meta 分析 |
| 乳腺恶性肿瘤 | Malignant neoplasm of breast | 2C60 | 肿瘤组织 FFPEG/新鲜冻存样本、受体分型亚组 |
| 肺恶性肿瘤 | Malignant neoplasm of lung | 2C25 | 组织与血浆外泌体蛋白组、化疗耐药比较 |
| 阿尔茨海默病 | Alzheimer disease | 8A00 | 脑脊液/脑组织蛋白组、神经退行性病变队列 |
| 2 型糖尿病 | Type 2 diabetes mellitus | 5A11 | 胰岛/肝脏/脂肪组织、血浆生物标志物筛选 |
| 脓毒症 | Sepsis | 1G40 | 血浆急相蛋白组、预后分层标志物 |
| 心血管疾病(总类) | Diseases of circulatory system | BA00-BE2Z | 心肌组织、动脉粥样斑块、心衰血浆蛋白组 |
| 呼吸系统疾病(总类) | Diseases of respiratory system | CA00-CB7Z | 支气管肺泡灌洗液、COVID-19 血浆蛋白组 |
注:PRIDE 检索疾病字段为提交者自由/受控词汇混合,同一疾病可能以多种写法出现(如 “Alzheimer”、“AD”、“dementia”)。建议以 disease 关键词检索 API 后人工复核样本描述,勿直接以编码做严格统计。
§2.2 SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 阿尔茨海默病 | 8A00 | 26929004 | Alzheimer’s disease (disorder) |
| 2 型糖尿病 | 5A11 | 44054006 | Diabetes mellitus type 2 (disorder) |
| 乳腺恶性肿瘤 | 2C60 | 254837009 | Malignant tumor of breast (disorder) |
| 肺恶性肿瘤 | 2C25 | 363358000 | Malignant tumor of lung (disorder) |
| 脓毒症 | 1G40 | 10001005 | Septic disorder (disorder) |
| 质谱(方法学程序) | — | 275926006 | Mass spectroscopy (procedure) |
§2.3 疾病与生物学背景
蛋白质是基因组的直接功能执行者:药物靶点约九成是蛋白质,而 mRNA 丰度对蛋白丰度的解释力有限——在 191 个癌细胞系与 246 个临床肿瘤样本的合并分析中,转录组与蛋白质组基线表达的中位相关系数仅 0.58(Jarnuczak 等,2021)。这决定了蛋白质组学在医学 AI 中的独特位置:它是"功能读出层",对药效预测、耐药机制、分泌型标志物发现等任务往往比转录组更接近表型。
技术路线上,当前主流为液相色谱-串联质谱(LC-MS/MS):DDA(数据依赖采集)灵敏度高、适合建库与识别;DIA(数据独立采集)重现性好、适合大队列定量。PRIDE 对两者均有覆盖,2025 年前后的新增数据集中 DIA 与单细胞蛋白质组学比例持续上升(reanalysis 生态同步演化,quantms 已同时支持两条路线)。免疫肽组学(immunopeptidomics)、交联质谱(PRIDE Crosslinking 专区)等亚方向也有专门数据积累。
| 采集路线 | 识别能力 | 定量重现性 | PRIDE 中的典型数据 | 再分析建议 |
|---|---|---|---|---|
| DDA | 强(打分驱动) | 弱-中 | 历史数据主体,谱库训练语料 | 重搜索成本高,可复用 mzIdentML |
| DIA | 依赖谱库/DNN 库 | 强 | 2018 年后快速上升 | 需按提交者谱库或共用库重提取 |
| 靶向(PRM/SRM) | 精确 | 强 | 与 PASSEL 生态交叉 | 通常引用而非重跑 |
| XL-MS | 交联对鉴定 | — | PRIDE Crosslinking 专区 | 用 Crosslinking API + xiVIEW |
流行病学意义上,PRIDE 数据的"人群"是"实验"而非"个体":每个数据集对应一项研究的设计(病例-对照、配对组织、时间序列治疗等),样本量从数例到上千例不等。这正是二次分析的价值来源——单一研究功效不足,跨数据集合并才能支撑稳健的医学结论。
§2.4 患者人群构成
| 维度 | 构成 | 说明 |
|---|---|---|
| 数据来源 | 全球各国实验室投稿 | 欧美机构占主导,jPOST(日本)、iProX(北京)分流亚洲提交 |
| 样本类型 | 组织、血浆/血清、脑脊液、细胞系、类器官、单细胞 | 临床样本需提交机构自行完成脱敏 |
| 疾病覆盖 | 全疾病谱 + 健康/模式生物对照 | 无统一疾病轴;疾病字段为关键词 |
| 时间跨度 | 2004 年至今连续采集 | 早期数据以 DDA/低分辨仪器为主,近年 DIA/高分辨为主 |
| 年龄/性别/种族 | 仅在 SDRF 元数据存在时可用 | 历史数据集普遍缺失人口学字段,跨数据集对齐困难 |
| 就医类型 | 不适用 | PRIDE 记录的是实验样本,非就诊事件 |
§2.5 临床价值与转化路径
- 生物标志物发现:跨数据集合并定量矩阵 + 独立验证集,是血浆蛋白标志物研究的标准工作流;PRIDE 提供的原始级数据允许统一重搜索,消除批次内搜索引擎差异。
- 药物靶点验证:蛋白质表达与共表达模块可直接对接 Open Targets 平台(定量蛋白质组学整合工作正在进行中,EMBL-EBI 2025 年报)。
- 诊断模型预训练:谱图-肽段配对语料支撑基础模型预训练(保留时间、碎片强度、电荷预测),下游微调到临床实验小数据集。
- 蛋白质基因组学:变异肽段证据回流基因组注释(Ensembl TrackHubs 已覆盖 184 个数据集的 400 万+ 典型肽段),服务新抗原与罕见变异研究。
§2.6 金标准对照表
| 项目 | PRIDE 的现状 | 对 AI 建模的含义 |
|---|---|---|
| 数据划分 | 无官方划分(仓库性质) | 必须自行设计 train/val/test,警惕跨数据集泄漏(§5.3) |
| 标注方式 | 搜索引擎自动鉴定 + FDR 控制(通常 1%)+ 部分人工审阅 | "标签"是算法输出而非临床金标准,FDR 口径须统一 |
| 标注者 | 各提交实验室 + PRIDE Pipelines 自动验证 | 不同数据集的打分体系不可直接比较 |
| 数据单元 | PXD 数据集(论文对应物) | 以研究为单位复现/合并,可追溯到原始文献 |
| 质量门控 | 提交时完整性校验、公开后原则上不可修改 | 公开 ≠ 高质量;需按 §7 DAIMS 自行评估 |
§3 数据集规格
§3.0 版本抉择矩阵
PRIDE 是持续滚动更新的仓库,不存在"单一下载版本"。以下矩阵帮你选择正确的获取口径:
| 你的需求 | 推荐口径 | 大小预期 | 理由 |
|---|---|---|---|
| 复现一篇论文 | 单个 PXD 数据集(原始提交) | 数 GB 至数百 GB | 与文献一一对应,含全部原始文件与结果 |
| 跨研究再分析 | Complete 提交 + SDRF 元数据优先 | 按筛选规模 | SDRF 使实验设计机器可读,quantms 可直接消费 |
| 谱图级 AI 训练 | USI API / Streaming API 按谱抽取 | 流式,不落全量 | 覆盖 >80% Thermo 原始文件,避免下载数十 TB RAW |
| 元数据普查/数据集发现 | REST API v3 + OmicsDI 镜像 | MB 级 JSON | 分页检索全部 50,804 个数据集的元数据 |
| 交联质谱研究 | PRIDE Crosslinking 专区 | 22 个精选数据集 | 经结构生物学视角整理,联动 PDB/AlphaFoldDB |
§3.1 数据模态详情
原始谱图(RAW/MS1/MS2):厂商二进制文件(Thermo .raw、Bruker .d、SCIEX .wiff、Waters .raw 等)是物理信号的第一手记录,包含母离子扫描(MS1)与碎裂谱(MS2)。RAW 不跨平台通用,Unix 生态需经 ThermoRawFileParser 等工具转换为 mzML(PRIDE Archive USI 正是以此方式实现对 Thermo 文件的实时谱图抽取,覆盖超过 80% 存量 RAW)。
识别与定量结果(mzIdentML/mzTab):PSM 级(谱图-肽段匹配)、peptide 级、protein 级三层的标准化鉴定输出,含打分、q-value/FDR、修饰位点。Complete 提交必须包含转换后的标准格式;Supported 提交可仅含原始文件。mzTab 额外承载定量列(label-free、TMT、SILAC 等)。
实验元数据(SDRF-Proteomics):行=样本/因子组合的实验设计表,声明样本来源、疾病/组织/细胞类型因子值、仪器、搜索参数与文件映射。SDRF 是 quantms 等 reanalysis 工作流的机器可读入口,lesSDRF 工具辅助生成,FragPipe 可导出草稿。
交联质谱(XL-MS):PRIDE Crosslinking 专区(2024 年上线)收录交联数据集,集成 xiVIEW 可视化,并交叉引用 PDBe、PDB-Dev 与 AlphaFoldDB;截至 2024 年 8 月含 22 个数据集、9 个物种、524,443 条肽段、4,905 个蛋白质。
§3.2 子集与规模构成
| 子集口径 | 规模 | 来源/说明 |
|---|---|---|
| 归档数据集总数 | 50,804 个 | 截至 2025-07(EMBL-EBI 2025 年报) |
| 年度新增(2023) | 4,701 个 | 官方存档统计 |
| 年度新增(2024) | 4,449 个 | 官方存档统计 |
| 近 12 个月新增 | 1,557 个(+23%) | 2024-07 至 2025-07,Globus 大文件通道推动增长 |
| USI 可实时抽谱 | >80% 存量 RAW | Thermo 仪器部分,经 ThermoRawFileParser |
| 早期 USI 索引 PSM | 5.4 亿+ | ‘Complete’ 提交的索引规模 |
| Crosslinking 专区 | 22 个数据集 | 截至 2024-08 |
| 已链接多组学资源 | >8,000 个数据集 | GEO/MetaboLights/ENA/EGA,Gemini 2.5 辅助标注 |
| quantms 已再分析 | 100+ 数据集 / 13,000 人样本 | 人类蛋白质定量最大集合 |
§3.3 文件格式表
| 格式 | 层级 | 内容 | AI 可读性 | 备注 |
|---|---|---|---|---|
| RAW(各厂商) | 原始 | 二进制谱图 | ❌ 需转换 | Thermo/Bruker/SCIEX/Waters 私有格式 |
| mzML | 原始转换 | XML 谱图(含峰列表) | ✅ pymzML/pyteomics | PSI 标准;转换推荐 ThermoRawFileParser |
| mzIdentML | 识别 | PSM/peptide/protein 鉴定 | ✅ pyteomics | PSI 标准;v3 API 已移除 PSM 端点需本地解析 |
| mzTab | 识别+定量 | 表格制输出 | ✅ pandas 直读 | 最适合快速建表 |
| MGF / peak lists | 中间 | 文本峰列表 | ✅ | 谱库训练常用 |
| SDRF-Proteomics | 元数据 | 实验设计表 | ✅ 直接映射 factor | reanalysis 工作流入口 |
| BED(PepGenome) | 衍生 | 肽段基因组坐标 | ✅ | 可视化于 Ensembl |
§3.4 存储规模
PRIDE 未公布单一总容量数字,可佐证的规模锚点:公开文件存于 EMBL-EBI 的 FIRE 对象存储(与 ENA、EGA 共用基础设施);2022-2024 期间月均下载量约 100 TB,2022 年 9 月单月峰值超 450 TB。单数据集体积跨度极大——小型标签-free 研究数 GB,TMT 多通道大队列(含 RAW)可达数百 GB。规划磁盘时建议:先经 API 拉取文件清单并按 fileCategory 汇总字节数(fileSizeBytes 字段,v3 API),再决定只取 RESULT/PEAK 还是全量 RAW。
§3.5 标注方式
识别"标注"由提交实验室以搜索引擎(Mascot、MaxQuant、FragPipe、Proteome Discoverer、DIA-NN 等)自动产生,受 FDR 目标(通常 PSM 级 1%)控制;PRIDE Pipelines 在提交时执行格式与完整性自动验证。定量矩阵分 label-free、TMT/iTRAQ、SILAC、DIA 等,均由提交者生成——PRIDE 不做统一再处理,这正是"仓库"而非"图谱"的定位。
§3.6 标注者资质与一致性
不适用人工标注员范式。一致性由三层机制保障:PSI 标准格式(mzML/mzIdentML/mzTab)约束结构、ProteomeXchange 提交规范约束完整性、PRIDE 团队人工审核元数据(标题/摘要/样本描述)。跨数据集的语义一致性(如疾病命名)依赖 SDRF 受控词汇,历史数据集覆盖不全。
§3.7 采集周期
2004 年收录首批 20 个数据集起持续运行至今:2005-2012 年缓慢爬坡,2012 年 PX 规范上线后加速,2023 年达 4,701 个/年峰值水平,2024 年 4,449 个,2024-07~2025-07 同比再增 23%。数据一旦公开即永久可用(数据政策 v1.0,2022-05)。
§3.8 地域覆盖
全球性仓库:提交来自世界各国实验室,文件下载流量分布全球(Aspera 在全球各地区提供最稳定的传输性能,EMBL-EBI 2025 年报)。无地理限制字段;语言以英文为主。
§3.9 设备与仪器构成
主要厂商生态:Thermo Scientific(Orbitrap 系列,存量 RAW 的主体,占 USI 可访问部分的全部)、Bruker(timsTOF 系列,DIA-PASEF 增长最快)、SCIEX、Waters、Agilent。仪器字段为数据集元数据的一部分,可经 REST API instruments 参数过滤检索。
§3.10 深度溯源链
PXD 登录号(持久,identifiers.org 可解析)
└─ dataset 元数据(REST API v3:标题/摘要/物种/仪器/提交者/DOI)
├─ 论文 DOI / PubMed 链接(文献溯源)
├─ 文件清单(/projects/{PXD}/files:name、fileCategory、fileSizeBytes、checksum)
│ ├─ RAW / mzML(谱图层)
│ ├─ mzIdentML / mzTab(识别与定量层)
│ └─ SDRF-Proteomics(实验设计层)
├─ USI(peptide:accession:run:index 形式 → 实时抽取单张谱图)
└─ 派生记录(RPXD 再分析、OmicsDI、UniProt/Expression Atlas 回流)
§4 数据结构
§4.0 目录树
每个公开数据集在文件仓库中有固定路径 pride/data/archive/<发布年>/<发布月>/<PXD登录号>/。以官方教程示例 PXD000001(TMT 标记的 Erwinia 蛋白组,最常被引用的入门数据集)为例:
pride/data/archive/2012/03/PXD000001/
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_01.raw # Thermo RAW(GB 级)
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_01.mzml # 转换后谱图
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_02.raw
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_02.mzml
├── ... # 其余谱图文件对(raw + mzml)
├── TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_sdrf.proteomics.xls
│ # SDRF-Proteomics 实验设计表
├── analysis.summary.txt # 提交者分析摘要(识别软件与参数线索)
├── Pride_Reviewer_Template.xls # 审稿人模板(实验-文件映射)
├── README.txt # 提交说明(可选)
├── checksum.md5 # 文件校验和
└── feedback/ # PRIDE Pipelines 自动验证反馈
└── PXD000001_validation_feedback.pdf
不同数据集的文件构成差异很大:Complete 提交必有开放格式结果文件;Supported 提交可能只有 RAW 与 PDF 摘要。拿到任何 PXD 后第一步永远是拉文件清单而不是直接开下载。
§4.1 DAIMS 数据字典(元数据核心字段)
以 REST API v3 /projects/{accession} 与 /projects/{accession}/files 返回的字段为准(8 列 DAIMS 格式):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| accession | string | PXD 登录号,持久唯一 | PXD000001 | 分组键/引用锚点 | 无 | 无 | PXD + 6 位数字 |
| title | string | 数据集标题 | TMT-based Erwinia… | 弱监督信号(文本) | 提交者措辞不一致 | 无 | 自由文本 |
| submissionDate | date | 提交日期 | 2012-03-21 | 时间分层/漂移监测 | 无 | 无 | 2004-01-01 至今 |
| organisms | list[string] | 物种(NCBI 分类名) | Homo sapiens | 分层抽样键 | 提交者拼写差异 | 空数组=未声明 | NCBI Taxonomy |
| diseases | list[string] | 疾病关键词 | breast cancer | 疾病分层(需清洗) | 命名不统一 | 空数组=健康/未声明 | 自由/受控混合 |
| instruments | list[string] | 质谱仪器 | Orbitrap Fusion | 技术偏倚控制 | 型号写法不一 | 空数组 | 厂商型号名 |
| fileCategory.value | string | 文件类别 | RAW / RESULT / PEAK / SEARCH / SDRF / OTHER | 下载过滤主键 | 分类准确 | 无 | 受控枚举 |
| fileSizeBytes | integer | 文件字节数(v3) | 3221225472 | 磁盘预算估算 | 无 | 无 | ≥0(v2 为 fileSize) |
| submissionType | string | 提交类型 | COMPLETE / SUPPORTED | 质量先验 | 无 | 无 | 受控枚举 |
| labHead | object | 通讯 PI(姓名/机构) | {“name”: “…”, “affiliation”: “…”} | 跨数据集同实验室聚类(泄漏检测) | 英文拼写变体 | 空对象 | 自由文本 |
| publicationDate | date | 公开日期 | 2012-04-02 | "公开后龄期"计算 | 无 | 无 | ISO 日期 |
| projectTags | list[string] | 提交者自选标签 | Biomedical、Human | 快速域过滤 | 词汇自由度高 | 空数组 | 受控+自由混合 |
| doi | string | 关联论文 DOI | 10.1074/… | 文献回溯 | 无 | 空串 | DOI 格式 |
§4.2 文件类别分布与标签语义
fileCategory 是工程上最重要的"标签",典型构成与语义如下(单数据集文件数可达数百,类别跨度从 GB 级 RAW 到 KB 级表格):
| 类别 | 典型扩展名 | 内容 | 体量级 |
|---|---|---|---|
| RAW | .raw, .d, .wiff | 厂商原始谱图 | GB/文件 |
| mzML(常计入 RAW 或 OTHER) | .mzml | 转换谱图 | 数百 MB/文件 |
| RESULT | .mzid, .mztab(.gz) | 识别/定量输出 | MB 级 |
| PEAK | .mgf, .dta | 文本峰列表 | 十 MB 级 |
| SEARCH | .fasta, 参数文件 | 搜库蛋白库与参数 | KB-MB 级 |
| SDRF | .sdrf.*, .xls | 实验设计表 | KB 级 |
| OTHER/QUANT | .tsv, .pdf, .xlsx | 补充材料 | 不定 |
§4.3 关键统计速览
- 数据集单元:50,804 个(截至 2025-07);月均新增约 534 个。
- 单数据集文件数:从 <10(小研究)到数百(TMT 大队列)不等;先查清单再下载。
- USI 实时抽谱覆盖:>80% 存量 RAW(Thermo 部分);Bruker/SCIEX 扩展中。
- Crosslinking 专区:22 个数据集、524,443 条肽段、4,905 个蛋白质(截至 2024-08)。
- 多组学链接:>8,000 个数据集已关联 GEO/MetaboLights/ENA/EGA。
- 复用密度:多数数据集在文献中被再分析 2-5 次(EuropePMC 提及统计)。
一个常用的"规模体检"脚本(建立你自己的语料画像):
def corpus_profile(keywords: list[str], page_size: int = 100) -> dict:
"""对一批关键词检索结果统计物种/仪器/提交类型分布,输出语料画像。"""
from collections import Counter
org, ins, styp = Counter(), Counter(), Counter()
for kw in keywords:
for p in search_projects(kw, page_size=page_size):
styp[p.get("submissionType", "UNKNOWN")] += 1
for o in p.get("organisms") or ["(未声明)"]:
org[o] += 1
for i in p.get("instruments") or ["(未声明)"]:
ins[i] += 1
time.sleep(1.2)
return {"organisms": org.most_common(10),
"instruments": ins.most_common(10),
"submissionType": dict(styp)}
# 输出示例字段:Thermo 系占比(仪器偏倚)、Homo sapiens 占比(物种偏倚)、
# COMPLETE/SUPPORTED 比例(索引质量先验)——三者直接对应 §7.1 的三大偏倚。
### §4.4 数据层级 {#sec-hierarchy}
研究(project = PXD)
└─ 实验/运行(run:一次 LC-MS 注入 ≈ 一个 RAW 文件)
└─ 谱图(spectrum:MS2 事件,可经 USI 寻址)
└─ PSM(peptide-spectrum match:谱图 × 肽段候选 × 打分/q-value)
└─ 肽段(peptide:含修饰状态)
└─ 蛋白组(protein group:蛋白质推断产物,存在共享肽歧义)
层级间的计数不可加和比较:PSM 数 ≠ 肽段数 ≠ 蛋白数;从 PSM 折叠到蛋白时发生"蛋白质推断"(protein inference),共享肽段使同名蛋白在不同搜索引擎下分组不同——这是跨数据集合并时的核心歧义点(详见坑点 5)。
### §4.5 缺失值与信息性缺失 {#sec-missing-values}
| 缺失形态 | 典型表现 | 是否信息性 | 建模处理 |
| --- | --- | --- | --- |
| 元数据未声明 | diseases/instruments 为空数组 | ✅(与健康对照混同) | 单设"未声明"类别,勿当作健康 |
| 定量矩阵缺失值 | label-free/DIA 矩阵中空单元格 | ✅(低于检出限) | 区分 MNAR 与 MCAR;downshift+宽度扩展插补 |
| SDRF 缺失 | 历史数据集无 SDRF 文件 | ✅(reanalysis 摩擦信号) | 优先选带 SDRF 的数据集 |
| 人口学缺失 | 年龄/性别字段缺省 | ✅(公平性评估受限) | 不得跨数据集推断人口学 |
| RESULT 缺失 | Supported 提交无标准格式结果 | ✅(需自行搜库) | 按需重搜索或换 Complete 数据集 |
> 量化蛋白质组学的"缺失"多为 MNAR(缺失非随机):低丰度肽段更易缺席。把空值当零或简单均值插补都会引入强度分布偏移,这是跨数据集建模最常见的翻车点之一。
---
## §5 数据划分与使用建议 {#sec-splits}
### §5.1 官方划分 {#sec-official-split}
无。PRIDE 是按研究组织的仓库,不存在 train/val/test 官方切分。任何"基准比较"都必须自己定义划分并声明协议。
### §5.2 社区惯例划分 {#sec-community-splits}
- **按 PXD 分层**:以数据集(=研究)为单位切分 train/test,最接近"泛化到新实验"的真实目标,也是 reanalysis 文献的主流做法。
- **按 run/谱图分层**:同一数据集内按文件切分,适合谱图级预测任务(保留时间/强度),但会低估跨批方差。
- **按物种/疾病分层**:leave-one-disease-out、leave-one-organism-out,用于检验医学泛化性。
- **quantms/SDRF 惯例**:以 SDRF 的 factor value 为分组依据,保证同一生物学因子不跨集合泄漏。
**划分策略对比与选型**:
| 策略 | 分组键 | 防泄漏强度 | 典型用途 | 主要风险 |
| --- | --- | --- | --- | --- |
| 按 PXD 切分 | PXD 登录号 | 强 | 泛化到新研究的建模 | 有效样本量骤减 |
| 按 run/文件切分 | RAW 文件 | 中 | 谱图级预训练 | 同样本跨集合 |
| 按 peptide 切分 | 序列+修饰 | 强(序列任务) | RT/强度回归 | 分布覆盖不均 |
| 按时间切分 | submissionDate | 强(前瞻模拟) | 漂移压力测试 | 时代方法混杂 |
| 按疾病域切分 | disease 关键词 | 强 | 医学域外验证 | 标签噪声(命名不统一) |
实践建议:主实验用"按 PXD + 按 peptide 双分组",稳健性检验追加"按时间切分"对照(§5.5)。
### §5.3 泄漏风险 ⭐ {#sec-leakage}
1. **同一生物样本跨数据集**:大规模联盟研究常把同一批样本拆成多个 PXD 提交(主研究 + 方法学附录),按数据集切分时同一样本同时出现在两侧。缓解:提交者/实验室字段 + 样本描述做重复检测,重叠者并入同一侧。
2. **肽段/蛋白泄漏**:序列级模型(保留时间、强度预测)中,同一肽段修饰态在 train/test 重复出现会造成记忆化。缓解:按 peptide sequence + modifications 组合去重切分,或按蛋白家族切分。
3. **谱库复用泄漏**:用 A 库训练的评分模型再去评 A 库来源的搜索结果。缓解:严格区分谱库构建集与评测集。
4. **FDR 信息泄漏**:在全集上统一选阈值再切分。缓解:阈值选择只能在 train 折内完成。
### §5.4 交叉验证建议 {#sec-cv}
医学分组建模建议 5 折按 PXD 分组交叉验证(GroupKFold,group=PXD),折内再按 SDRF 因子分层;谱图级回归任务在 GroupKFold 之上加 peptide 序列分组,防止近邻肽段(仅差一个修饰)跨折。
### §5.5 外部验证建议 {#sec-external-validation}
以"时间切分"模拟前瞻性:用 2022 年前数据集训练、2023-2024 数据集外测(仪器与方法分布已显著漂移);或以 PX 生态做跨仓验证——同一研究的 MassIVE 镜像用于核对文件一致性,PeptideAtlas 一致性库作为识别正确性的独立参考。正式论文级验证建议采用 §7.8 所列同行评审再分析结论作为外部对照。
---
## §6 AI 就绪指南 ⭐ {#sec-ai-ready}
### §6.0 云端快速启动 {#sec-cloud-quickstart}
适合"先看一眼再决定"的场景。三条免安装路径:
1. **网页界面**:访问 https://www.ebi.ac.uk/pride/archive/ 按 PXD 号或关键词检索,页面内直接预览文件清单与结果表。
2. **PRIDE Chatbot**:https://www.ebi.ac.uk/pride/chatbot/ 用自然语言查询文档与数据集(开源 LLM 驱动,2024 年上线)。
3. **USI 在线抽谱**:https://www.ebi.ac.uk/pride/archive/usi 输入 USI(形如 `mzspec:PXD000001:run:index`)实时查看单张谱图,无需下载 RAW。
### §6.1 快速上手 {#sec-quickstart}
以下代码假设:`pip install requests pandas`;不需要注册或 API key(公开数据完全匿名可读)。目录规划建议——PRIDE 下载体积弹性极大,先建清单再分批拉取:
```python
# 目录结构预期(自建工作区,PRIDE 无固定解包结构):
# data_root/
# └── {PXD登录号}/ # 每个数据集一个目录,与 FTP 路径同名
# ├── *.raw / *.mzml # 谱图层(按需)
# ├── *.mzid / *.mztab # 识别与定量层(AI 建模首选)
# └── *.sdrf.* # 实验设计表(分层切分依据)
# data_root = 你自己指定的本地根目录;PRIDE API 返回的
# publicFileLocations 是完整 URL,basename 即文件名,需自行拼接
# 到 data_root/{PXD}/ 下。
# 最小可用子集:一个 Complete 提交数据集的 RESULT 文件
# (mzTab 可被 pandas 直接读),总量通常仅数十 MB。
import requests
PRIDE_V3 = "https://www.ebi.ac.uk/pride/ws/archive/v3"
def file_summary(pxd: str) -> None:
"""打印单个数据集的文件类别清单与体积,估算下载预算。"""
files = requests.get(f"{PRIDE_V3}/projects/{pxd}/files/all", timeout=60).json()
by_cat: dict[str, list] = {}
for f in files:
cat = (f.get("fileCategory") or {}).get("value", "OTHER")
by_cat.setdefault(cat, [0, 0])
by_cat[cat][0] += 1
by_cat[cat][1] += (f.get("fileSizeBytes") or 0) / 1e9 # v3 字段是 fileSizeBytes
print(f"{pxd} 文件清单:")
for cat, (n, gb) in sorted(by_cat.items()):
print(f" {cat:<8} {n:>4} 个文件, 共 {gb:8.2f} GB")
file_summary("PXD000001")
§6.2 数据获取
五种下载通道对比(来源:官方下载页):
| 通道 | 适用场景 | 命令形态 | 速度 |
|---|---|---|---|
| HTTPS/wget | 少量文件、脚本化 | wget <url> |
中 |
| FTP | 批量目录下载 | FileZilla / wget -r ftp://... |
中 |
| Aspera | 大文件/远距离,最快 | ascp -TQ -P33001 ... |
高 |
| Globus | 超大数据集、断点续传 | Globus Connect Personal GUI | 高 |
| Streaming API | 流式按需读文件 | GET /ws/archive-file-downloader/... |
中 |
通道 1:HTTPS 直链(最常用)——文件 URL 规律固定,可直接构造:
# 结构: https://ftp.pride.ebi.ac.uk/pride/data/archive/<年>/<月>/<PXD>/<文件名>
# 文件名从 REST API 文件清单获得;FTP 匿名下载时用户名填 anonymous
wget -c "https://ftp.pride.ebi.ac.uk/pride/data/archive/2012/03/PXD000001/TMT_Erwinia_1uLSike_Top10HCD_isol2_45stepped_60min_01.mzml"
通道 2:Aspera(大文件首选)——官方提供 ascp 命令与 Docker 镜像:
# 安装 Aspera Connect 后;私钥文件随安装包提供
ascp -TQ -P33001 -l 100M \
-i ~/Applications/Aspera\ Connect.app/Contents/Resources/asperaweb_id_dsa.openssh \
prd_ascp@fasp.ebi.ac.uk:/pride/data/archive/2017/05/PXD005207/CDPK1_TP_10_R5.raw ./
# Docker 替代(免装客户端):
docker pull ghcr.io/pride-archive/aspera
docker run -v $(pwd):/data ghcr.io/pride-archive/aspera \
ascp -i /home/aspera/.aspera/cli/etc/asperaweb_id_dsa.openssh -TQ -P33001 \
prd_ascp@fasp.ebi.ac.uk:/pride/data/archive/2017/02/PXD004683/20150820_Haura-Pilot-TMT2-bRPLC06-2.raw /data
通道 3:pridepy(官方 Python 客户端,Apache 2.0)——封装 REST API 与 FTP/Aspera/Globus 传输,支持公开与私有数据集:
pip install pridepy # PyPI 安装;conda 亦有 recipe
# 检索数据集元数据 + 批量下载,用法见官方 GitHub(PRIDE-Archive/pridepy)
通道 4:Globus(超大数据集首选)——断点自动续传,适合数百 GB 级 TMT 队列与跨洲链路:
# 步骤(官方下载页完整流程的命令行视角):
# 1) 本地安装并运行 Globus Connect Personal,创建个人 Collection
# 2) Web 端登录 Globus,FILE MANAGER 中搜索集合 "EMBL-EBI Public Data"
# 3) 目标路径按固定结构定位:
# /pride-archive/<发布年>/<发布月>/<PXD登录号>/
# 示例: /pride-archive/2024/04/PXD014361/
# 4) 另一侧选择你的个人 Collection,开始传输;断线自动恢复
# 5) 命令行用户可用 Globus CLI:
# globus transfer \
# "EMBL-EBI Public Data"的endpoint-id \
# "<你的personal-collection-endpoint-id>" \
# --path "/pride-archive/2024/04/PXD014361/"
通道 5:Streaming API——按 chunk 流式读取公开文件,无需落盘完整 RAW:
# 服务与 Swagger: https://www.ebi.ac.uk/pride/ws/archive-file-downloader/swagger-ui/index.html
# 典型用法:以文件流形式边下边解析(适合谱图级训练语料的采样式读取)
curl -L "https://www.ebi.ac.uk/pride/ws/archive-file-downloader/stream/{文件路径参数}" -o part.bin
# 官方提供 FTP/HTTPS/Streaming 三通道下载基准对比,见下载页 benchmarking 小节
数据集发现 API(分页遍历,注意 §6.5 坑点 1/2):
import requests, time
def search_projects(keyword: str, page_size: int = 100, max_pages: int = 20):
"""按关键词翻页检索;v3 无 totalElements,须迭代到空页。"""
all_records, page = [], 0
while page < max_pages:
r = requests.get(f"{PRIDE_V3}/search/projects",
params={"keyword": keyword, "pageSize": page_size, "page": page},
timeout=30)
if r.status_code == 429: # 限速 ~50 req/min
time.sleep(30); continue
batch = r.json()
if not batch: # 空页即结束
break
all_records.extend(batch)
page += 1
time.sleep(1.2) # 低于限速阈值
return all_records
diabetes_sets = search_projects("type 2 diabetes proteomics")
§6.3 预处理全流程
从 RAW 到可建模特征的四步流水线(格式转换 → 校验 → 过滤 → 特征表):
# 步骤 1:RAW → mzML(在 Linux 上唯一可靠路径;PRIDE 的 mzML 缺失时自行转换)
# ThermoRawFileParser(官方 USI 管线同款工具):
# docker run -v $(pwd):/data chrisbielski/thermorawfileparser \
# java -jar /ThermoRawFileParser.jar -i=/data/*.raw -o=/data/mzml
# 步骤 2:校验完整性(对比 checksum.md5 与 API 元数据)
import hashlib, pathlib
def verify_md5(path: pathlib.Path, expected: str) -> bool:
h = hashlib.md5()
with open(path, "rb") as fh:
for chunk in iter(lambda: fh.read(1 << 20), b""):
h.update(chunk)
return h.hexdigest() == expected
# 步骤 3:mzTab 结果表 → 特征 DataFrame(PSM/peptide/protein 三层自选)
import pandas as pd
def read_mztab_protein(path: str) -> pd.DataFrame:
"""mzTab-M 的 PRT 段转 DataFrame;以 'PRT' 行起始,tab 分隔。"""
rows = [l.rstrip("\n").split("\t") for l in open(path) if l.startswith("PRT\t")]
header = [l.rstrip("\n").split("\t") for l in open(path) if l.startswith("PRH\t")][0]
return pd.DataFrame(rows, columns=header)
# 步骤 4:FDR 过滤 + log2 强度(q-value 列名因搜索引擎而异,见坑点 7)
# prot = prot[prot["best_search_engine_score[1]"] <= 0.01]
# intensity_cols = [c for c in prot.columns if c.startswith("protein_abundance")]
# prot[f"log2"] = np.log2(prot[intensity_cols].astype(float).clip(lower=1e-6))
清洗要点:跨数据集合并前统一蛋白标识(UniProt accession 版本对齐)、统一修饰命名(PSI-MOD/UniMod accession,查 unimod.org 翻译)、以中位数/分位数归一化处理批效应。
§6.4 PyTorch DataLoader
以"谱图-肽段配对语料"为例(谱图强度预测/预训练任务的标准输入形态):
# 前置目录预期:data_root/{PXD}/mzml/*.mzml + data_root/{PXD}/*.mztab
# 依赖: pip install torch pymzML pandas
import torch
from torch.utils.data import Dataset, DataLoader
import pymzml
AA_ALPHABET = {aa: i + 1 for i, aa in enumerate("ACDEFGHIKLMNPQRSTVWY")} # 20 标准氨基酸
class SpectrumDataset(Dataset):
"""每个样本 = (肽段序列编码, 归一化谱图峰列表)。
最小可用子集:单个数据集的 mzTab(取 PSM 层高置信行)+ 对应 mzML。"""
def __init__(self, psm_table, data_root, max_peaks=150):
self.df = psm_table.reset_index(drop=True)
self.data_root = data_root
self.max_peaks = max_peaks
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
seq = [AA_ALPHABET.get(aa, 0) for aa in row["sequence"]] # 未知字符→0
run = self.data_root / row["pxd"] / "mzml" / f"{row['run']}.mzml"
spectrum = pymzml.run(str(run))[int(row["scan"])] # USI 的 index 即此 scan
peaks = sorted(spectrum.peaks("centroided"), key=lambda p: -p[1])[: self.max_peaks]
peaks = sorted(peaks) # 恢复 m/z 升序
mz = torch.tensor([p[0] for p in peaks] or [[0.0]]).float()
it = torch.tensor([p[1] for p in peaks] or [[0.0]]).float()
it = it / (it.max() + 1e-9) # 基峰归一化
return {"sequence": torch.tensor(seq), "mz": mz, "intensity": it,
"precursor_charge": torch.tensor(float(row.get("charge", 2)))}
loader = DataLoader(SpectrumDataset(psm_table, "data_root"),
batch_size=64, shuffle=True, num_workers=4)
# 变长序列在 collate_fn 中 pad;示例从略(按最长者 pad mz/intensity 两个维度)
§6.5 坑点实录(8 个)
⚠️ 坑点 1:REST API v2/v3 断裂(分类:工程陷阱)
问题:网上大量教程基于 v2 API(
ws/archive/v2),v3 移除了 HAL+JSON 的_embedded包装和/peptides、/psms端点,字段fileSize改名fileSizeBytes;旧代码迁到 v3 会静默拿到空结果或 KeyError。
症状:r.json()["_embedded"]["compactprojects"]抛 KeyError;访问/peptides?peptideSequence=...返回 404;文件体积字段全为 0/None。
解决:
- 简单方法:v3 响应直接是列表——
projects = r.json(),不要再拆_embedded。- 进阶方法:肽段/PSM 级数据改走"下载 RESULT 文件本地解析"路线(mzIdentML/mzTab);蛋白存在性查询用 v3 的路径参数端点
/proteins/{accession}。- SOTA 方法:用 pridepy 客户端屏蔽 v2/v3 差异;字段访问统一写防御式
f.get("fileSizeBytes") or 0。
参考:PRIDE API v3(https://www.ebi.ac.uk/pride/ws/archive/v3);Perez-Riverol 等 2025 update 论文 §API。
⚠️ 坑点 2:API 限速与无元数据分页(分类:工程陷阱)
问题:REST API 限速约 50 请求/分钟,批量脚本超限即收 HTTP 429;且 v3 分页响应不含 totalElements/totalPages,无法预知总页数。
症状:大规模普查脚本跑几十秒后集体 429;分页循环因"永远拿不到总页数"而提前终止或死循环。
解决:
- 简单方法:每次请求间
time.sleep(1.2);翻页迭代到返回空数组为止。- 进阶方法:遇 429 捕获后指数退避(30s → 60s → 120s);把页大小开到上限 100。
- SOTA 方法:请求合并 + 本地缓存(把元数据落 SQLite),100+ 项目规模的普查任务一次性完成;或改用 OmicsDI 联邦 API 一次取跨仓元数据。
参考:PRIDE API 文档;社区实测(50 req/min、pageSize 上限 100)。
⚠️ 坑点 3:RAW 体积陷阱——不按 fileCategory 过滤(分类:工程陷阱)
问题:单数据集文件可达数百个,RAW 文件单个 GB 级而结果表仅 KB 级;直接"全量下载"一个 TMT 大队列可误拉数百 GB。
症状:磁盘迅速耗尽;只想核对识别表却排队下载几十个 RAW;带宽被占满导致其余任务超时。
解决:
- 简单方法:下载前先调
/projects/{pxd}/files/all按fileCategory.value汇总体积(§6.1 函数),只拉 RESULT/PEAK/SDRF。- 进阶方法:批量任务先跑一遍"清单-预算"脚本,生成只含目标类别的 URL 清单再交给 aria2c/wget 批处理。
- SOTA 方法:谱图级需求走 Streaming API/USI 按需抽谱,完全不落 RAW;大规模再分析才用 Globus 整目录传输。
参考:官方下载页(pridefiledownload);Perez-Riverol 等 2025 update(Streaming API 与 FTP/HTTPS 基准对比)。
⚠️ 坑点 4:厂商 RAW 在 Linux 无法直读(分类:预处理陷阱)
问题:Thermo/Bruker/SCIEX 的 RAW 是 Windows 私有二进制,PRIDE 大量历史数据集不带 mzML(尤其 Supported 提交),Linux 集群无法直接消费。
症状:pymzml打开 .raw 报格式错误;Windows 工作站与 HPC 之间反复倒腾数据;转换后 checksum 与原提交不符引发困惑。
解决:
- 简单方法:优先挑选带 mzML 的 Complete 提交(文件清单里直接可见)。
- 进阶方法:用 ThermoRawFileParser(Java)Docker 镜像在 Linux 上转换 Thermo RAW → mzML,参数
-p输出 peak-picked 谱图。- SOTA 方法:把转换嵌入 Nextflow/quantms 流水线(BioContainers 镜像),转换与搜索一步完成;Bruker/SCIEX 借助厂商 SDK 容器或转用 vendor=neutral 的第三方转换工具。
参考:Perez-Riverol 等 2025 update(PRIDE Archive USI 即依赖 ThermoRawFileParser);quantms 文档。
⚠️ 坑点 5:蛋白质推断歧义(分类:标签理解)
问题:从 PSM 折叠到蛋白时,共享肽段(同一肽段映射到多个蛋白)使"蛋白数量"依赖推断算法与分组策略;不同搜索引擎(MaxQuant、FragPipe、PD)对同一数据的蛋白分组不一致。
症状:两篇论文同数据集的"鉴定蛋白数"对不上;跨数据集合并蛋白矩阵后同一名词(accession)含义漂移;以蛋白组为标签的分类模型复现失败。
解决:
- 简单方法:只用 PSM/peptide 层做合并(序列级歧义远小于蛋白层)。
- 进阶方法:统一重搜索(同一引擎同一参数)再折叠;矩阵对齐时以 protein group 的主 accession(majority protein IDs)为键,并为每行记录歧义组大小。
- SOTA 方法:采用显式概率推断工具(如 PIA toolbox,PRIDE-Utilities 系)保留推断证据;或改预测肽段级属性回避蛋白层歧义。
参考:Perez-Riverol 等 2019 update(PIA / ms-data-core-api);protein inference 文献传统。
⚠️ 坑点 6:跨数据集样本重复导致泄漏(分类:数据泄漏)
问题:同一批生物样本常被拆成多个 PXD(主文 + 方法学/附录提交),或被不同再分析团队重复上传(RPXD);按数据集切分 train/test 时两侧出现同一样本。
症状:测试集指标虚高(AUC/相关系数异常漂亮);独立复现者在新数据集上性能骤降;去掉"重复源"后结果波动巨大。
解决:
- 简单方法:以数据集标题/摘要做去重扫描,合并标题近似且提交者相同的 PXD。
- 进阶方法:用 SDRF 的 sample 描述与源组织字段做指纹比对;把重叠数据集强制归入同一 fold(GroupKFold)。
- SOTA 方法:以"时间切分"(按 submissionDate 切 train/外测)+ 跨仓验证(PX 镜像仓对照)双保险;关键结论同时报告按样本去重前后的指标差。
参考:§5.3;Perez-Riverol 等 2025 update(数据集复用统计)。
⚠️ 坑点 7:FDR 口径不一致(分类:评估误用)
问题:“1% FDR” 可指 PSM 级、peptide 级或 protein 级,三者对同一数据给出截然不同的通过集;不同搜索引擎输出的分数列(score、e-value、q-value)语义也不同。
症状:合并多个数据集后"蛋白数"暴涨/暴跌;以分数列直接当概率使用;模型训练集混入未达阈值的低置信 PSM。
解决:
- 简单方法:只用 q-value 列且明确声明层级(推荐 PSM 与 protein 双报告);无 q-value 的数据集用 decoy 计数重算。
- 进阶方法:统一重搜索并统一 FDR 层级(如全部 peptide 级 1%)后再合并;保留目标-诱饵计数作为置信度证据。
- SOTA 方法:在 quantms 等工作流中固化 FDR 策略参数随流水线版本一起提交,保证可复现。
参考:PSI mzIdentML/mzTab 规范;quantms 工作流文档。
⚠️ 坑点 8:USI 实时抽谱只覆盖 Thermo(分类:评估误用)
问题:PRIDE Archive USI 通过 ThermoRawFileParser 实时抽取谱图,仅覆盖超过 80% 的存量 RAW(Thermo 仪器部分);Bruker/SCIEX 文件不在实时覆盖内,需要持续扩展。
症状:流式训练管线在 Bruker(timsTOF)或 SCIEX 数据集上批量抽谱失败/返回空;误以为"该谱图不存在"而丢弃有效数据;训练集仪器分布被静默偏置为 Thermo。
解决:
- 简单方法:构建训练集前按
instruments字段过滤,明确当前语料的仪器构成并写入数据卡片。- 进阶方法:非 Thermo 数据集改走"下载 + 本地转换"路线;混合语料时对仪器因子做分层采样。
- SOTA 方法:在实验记录中同时报告"USI 可达子集"与"全量子集"的模型指标,量化仪器偏倚影响;关注 PRIDE 官方对 Bruker/SCIEX 的覆盖扩展公告。
参考:Perez-Riverol 等 2025 update(USI 节:over 80% of stored MS raw files)。
§6.6 数据增强
- ✅ 安全:谱图基峰归一化、随机 top-K 峰采样、m/z 微扰(±ppm 级,模拟质量校准误差)、随机保留时间窗口平移(序列模型上下文)、电荷态 one-hot 扰动(预训练阶段)。
- ❌ 危险:对谱图峰强度做任意缩放后仍声称"绝对定量"(破坏 TMT 比值语义);跨数据集混合后不做批次校正直接训练临床分类器;对肽段序列做随机氨基酸替换(破坏理化约束,与保留时间/碎裂规律冲突);用增强后的谱图与原始谱图分属 train/test 制造"完美基线"。
§6.7 模型与工具推荐
| 任务 | 推荐起点 | 类型 | 说明 |
|---|---|---|---|
| 批量再搜索/定量 | quantms | Nextflow 工作流 | OpenMS + DIA-NN,SDRF 驱动,云/HPC 可扩展 |
| 谱图转换 | ThermoRawFileParser | CLI | RAW → mzML,USI 官方同款 |
| 下载自动化 | pridepy | Python 客户端 | REST API 封装 + FTP/Aspera/Globus |
| 保留时间预测 | DeepLC | 深度学习 | Nature Methods 2021,支持未见修饰的泛化 |
| 谱图检索/评估 | PRIDE Inspector | 桌面 GUI | 可视化谱图/肽段/蛋白,打开 mzIdentML/mzTab |
| 交联数据 | xiVIEW + Crosslinking API | Web/API | PRIDE Crosslinking 专区配套可视化 |
| 蛋白质基因组学 | PepGenome + pypgatk | Java/Python CLI | 肽段 → 基因组 BED,变异肽段数据库构建 |
§6.8 硬件需求
| 用途 | CPU | 内存 | 磁盘 | GPU |
|---|---|---|---|---|
| 单数据集结果表分析 | 4 核 | 16 GB | 100 GB | 不需要 |
| 单数据集重搜索(quantms) | 16+ 核 | 64 GB | 1 TB SSD | 不需要 |
| 10-100 数据集再分析 | HPC 集群/云 | 每 worker 64 GB | 5-50 TB(视 RAW 比例) | 可选(DIA-NN 推理) |
| 谱图深度学习预训练 | 云实例 | 128 GB+ | 语料按需流式 | 1×A100 40GB 起 |
| 元数据普查/画像 | 笔记本 | 8 GB | <1 GB(仅 JSON) | 不需要 |
| 全量 PX 镜像归档 | 存储服务器 | — | 数百 TB 起 | 不需要 |
磁盘预算估算惯例:先跑 §6.1 的 file_summary 得到各 PXD 的 RAW/RESULT 字节数;经验上"只取 RESULT+PEAK+SDRF"约为全量的 1-2%(依提交类型浮动,Supported 提交无结果文件需另行换算)。
§6.9 评估指标代码
谱图级任务最常用余弦相似度(预测谱 vs 实测谱);肽段级任务用序列精度;定量任务用 Pearson/Spearman 相关:
import numpy as np
from scipy.stats import pearsonr, spearmanr
def spectral_cosine(mz_a, it_a, mz_b, it_b, tol=0.02, bins=None):
"""谱图余弦相似度:m/z 对齐容差默认 0.02 Da(离子阱级精度可放宽)。"""
lo, hi = min(mz_a[0], mz_b[0]), max(mz_a[-1], mz_b[-1])
bins = bins or np.arange(lo, hi + tol, tol)
va = np.histogram(mz_a, bins=bins, weights=it_a)[0]
vb = np.histogram(mz_b, bins=bins, weights=it_b)[0]
return float(va @ vb / (np.linalg.norm(va) * np.linalg.norm(vb) + 1e-12))
def quantitative_agreement(true_ab, pred_ab):
"""定量复现一致性:报告 Pearson 与 Spearman 双指标。"""
return {"pearson": pearsonr(true_ab, pred_ab)[0],
"spearman": spearmanr(true_ab, pred_ab)[0]}
def identification_metrics(tp: int, fp: int, fn: int):
"""识别任务(如变异肽段检出)的 P/R/F1:以 target-decoy 或人工复核为参照。"""
precision = tp / (tp + fp + 1e-12)
recall = tp / (tp + fn + 1e-12)
return {"precision": precision,
"recall": recall,
"f1": 2 * precision * recall / (precision + recall + 1e-12)}
def psm_level_confusion(pred_scores, labels, q_threshold=0.01):
"""按 q-value 阈值划分正负例的混淆统计——阈值选择必须在 train 折内(坑点 7)。"""
called = pred_scores <= q_threshold
return {"n_called": int(called.sum()),
"n_total": len(labels),
"estimated_fdr": float((~labels[called]).mean()) if called.any() else 0.0}
指标口径注意:谱图余弦相似度依赖 bin 宽度(0.02 Da 为高分辨 Orbitrap 量级惯例),跨论文比较必须统一 binning;定量一致性在小强度段用 Spearman 更稳(对 MNAR 缺失插补敏感度低)。
### §6.10 MLOps 笔记 {#sec-mlops}
1. **数据版本化**:以 PXD 号 + 文件 checksum(各数据集自带 checksum.md5)作为数据集指纹入库;PRIDE 公开数据原则上不可变,天然适合不可变版本引用。
2. **可复现链路**:把"清单 → 下载 → 转换 → 搜索 → 折叠"全链路封装为容器化流水线(quantms 即此范式),FDR 策略与蛋白分组参数随代码版本提交。
3. **监控**:跟踪 API 配额(429 频次)、转换失败率(RAW 兼容性)、训练语料的仪器/物种分布漂移(新增数据集月均 534 个,分布持续移动)。
4. **成本控制**:优先 USI 流式抽谱避免 RAW 落盘;Globus 断点续传降低大任务重试成本。
---
## §7 质量评估与局限性 {#sec-quality}
### §7.1 已知偏倚 {#sec-bias}
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
| --- | --- | --- | --- |
| 仪器偏倚 | Thermo Orbitrap 系占存量 RAW 主体,USI 实时抽谱亦只覆盖 Thermo | 高 | 按 instruments 分层采样;非 Thermo 走本地转换 |
| 物种偏倚 | 人类与常用模式生物、经典细胞系过度代表 | 高 | 用 NCBI Taxonomy 字段做配额抽样 |
| 提交选择偏倚 | 数据集随论文产出,阳性结果与"可发表设计"占比高 | 中 | 结论跨独立数据集族验证;关注方法学提交 |
| 提交类型偏倚 | Complete 提交索引/检索体验优于 Supported | 中 | 优先 Complete + SDRF 数据集 |
| 时代偏倚 | 早期(2004-2015)低分辨/小队列数据占比高 | 中 | 按 submissionDate 分代处理 |
| 语义偏倚 | 疾病/组织字段命名不统一 | 中 | 受控词表清洗后再分层 |
### §7.2 标注质量 {#sec-annotation-quality}
识别"标签"由各实验室搜索引擎自动生成并受 FDR 控制,PRIDE Pipelines 在提交时做格式与完整性自动验证;元数据(标题/摘要/样本)由 PRIDE 团队人工审核。质量总体可靠但口径异质:FDR 层级、搜索引擎版本、蛋白库版本均随数据集而变。量化使用时的稳妥做法是统一重搜索(§6.3),或至少把 FDR 策略作为协变量记录。
### §7.3 泛化性评估 {#sec-generalization}
| 场景 | 预期表现 | 失效风险 | 证据 |
| --- | --- | --- | --- |
| 同仪器同物种再分析 | 好 | 批效应残留 | 大量文献级复现惯例 |
| 跨仪器(Thermo→Bruker)谱图模型 | 中-差 | 谱图形态/采集逻辑差异(TIMS 离子淌度) | USI 覆盖范围即例证 |
| 跨疾病域分类迁移 | 中-差 | 因子定义与人群构成不同 | 疾病字段异质(§2.1 注) |
| 时间外推(2022→2024 方法) | 中 | DDA→DIA、单细胞方法演进 | 提交通成结构漂移(§3.2) |
| 人类敏感数据场景 | 不适用 | PRIDE 不承载受控访问数据 | 数据政策 v1.0 |
### §7.4 伦理与合规 {#sec-ethics}
PRIDE 只承载完全开放数据:2018-06 起提交数据集适用 CC0,公开数据集永久可访问且原则上不可修改/移除;需受控访问的敏感人类数据被明确排除在外(数据政策 v1.0,2022-05)。人类来源样本的脱敏由提交机构负责(常以匿名编号如 patient_1 报告)。私有期规则:数据集默认私有,最长 2 年,释放前 60/30/7 天提醒。二次使用者仍应遵守论文引用礼仪与原始文献的任何附加声明。
合规要点清单:
1. **许可归属确认**:2018-06 是分水岭——之前的数据集查数据集页的 license 字段(EBI Terms of Use),之后的默认 CC0。
2. **移除/更正预期管理**:公开后原则上不可修改,发现错误的正道是联系 PRIDE 团队并引用更正文献,而非假设数据会"下架"。
3. **预印本数据**:官方不建议公开预印本配套数据集;引用此类数据集时注意其结果可能在同行评审中被修改。
4. **再分发**:CC0 允许自由再分发,但再打包后应保留原始 PXD 号与 checksum 以维持溯源链。
### §7.5 公平性 {#sec-fairness}
人群代表性不可知于仓库层级:多数历史数据集缺人口学字段(年龄/性别/祖源),跨数据集公平性评估受限于 SDRF 覆盖。做医学相关建模时,应显式声明"人群构成未知"而非默认通用;对带 SDRF 的现代数据集尽量按样本描述子集分析。
### §7.6 数据漂移 {#sec-drift}
三条漂移轴:方法漂移(DDA 主导 → DIA/单细胞快速上升)、仪器漂移(Orbitrap 代际迭代、timsTOF 类离子淌度平台增长)、规模漂移(月均 534 个新数据集、Globus 通道推动大文件时代)。长期服务建议按 submissionDate 建立监控分桶,任何静态阈值/校准曲线都要定期重估。
```python
def drift_watch(recent_days: int = 365, current_date: str = "2026-09-05"):
"""漂移监控:按提交日期分桶比较近一年 vs 历史全体的分布差。"""
import datetime as dt
from collections import Counter
cutoff = dt.date.fromisoformat(current_date) - dt.timedelta(days=recent_days)
# 空关键词检索全量时须配合长退避;生产中建议改用固定关键词集合增量拉取
recent = search_projects("", page_size=100, max_pages=50)
def bucket(p):
d = dt.date.fromisoformat(str(p.get("submissionDate", ""))[:10] or str(cutoff))
return "recent" if d >= cutoff else "baseline"
stats = {"recent": Counter(), "baseline": Counter()}
for p in recent:
b = bucket(p)
for i in p.get("instruments") or ["(未声明)"]:
stats[b][i] += 1
time.sleep(1.2)
# 建议输出:近一年仪器占比 - 历史占比 的差值表,>10 个百分点即触发重校准
return stats
监控告警线示例:某仪器族占比变化 >10 个百分点、新物种进入 top-5、SUPPORTED 提交比例上升——三者分别提示谱图模型重训、语料扩充与索引质量退化风险。
§7.7 DAIMS 24 项检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ⚠️ | mzTab 定量矩阵为宽格式,但结构随搜索引擎/提交者而异,非统一 schema |
| 2 | 唯一标识 | ✅ | PXD 登录号持久唯一,可经 identifiers.org 解析;文件级有 checksum |
| 3 | 特殊字符 | ✅ | XML/表格式遵循 PSI 规范,转义规范 |
| 4 | 重复行 | ⚠️ | 仓库不去重;同一生物样本可拆多个 PXD(§5.3),跨数据集去重由使用者完成 |
| 5 | 缺失编码 | ⚠️ | 定量缺失多为 MNAR,无统一占位码;元数据缺失以空数组表示 |
| 6 | 标签标识 | ✅ | PSM/peptide/protein 三层 q-value/FDR 体系清晰(口径需自查,见坑点 7) |
| 7 | 罕见类分组 | ❌ | 仓库层级无疾病/表型受控分层,罕见因子需自行聚类 |
| 8 | 偏倚评估 | ⚠️ | 官方论文提供复用/下载统计,但单数据集级偏倚未审计 |
| 9 | 数据字典 | ✅ | REST API 字段文档 + SDRF-Proteomics 规范 + PSI 标准文档齐备 |
| 10 | 信息性缺失解释 | ⚠️ | Supported 提交/缺失 SDRF 的含义可推断但未在单数据集页显式标注 |
| 11 | 设备记录 | ✅ | instruments 元数据字段 + API 可过滤检索 |
| 12 | 共线性 | ❌ | 无特征共线性审查(跨数据集合并后的蛋白共表达结构需自检) |
| 13 | 编码映射 | ✅ | PSI-MOD/UniMod 修饰码、NCBI Taxonomy、PSI-MS 受控词表 |
| 14 | 时间戳处理 | ✅ | submissionDate/publicationDate/release 更新历史可查 |
| 15 | 划分建议 | ❌ | 无官方 train/val/test 划分(仓库性质使然) |
| 16 | 泄漏讨论 | ⚠️ | 跨数据集样本重复风险存在;官方文档未系统讨论,社区文献有涉及 |
| 17 | 标签分布 | ✅ | fileCategory/物种/仪器分布可经 API 统计;存档页有逐年数字 |
| 18 | 测量偏倚 | ⚠️ | 仪器/方法偏倚有论文级描述(§7.1),无逐数据集量化 |
| 19 | 外部验证建议 | ⚠️ | 再分析基准(quantms 等)存在,但非逐数据集配套 |
| 20 | 版本记录 | ✅ | 公开数据集不可变;提交-释放-更新全程有日期记录 |
| 21 | 预处理脚本 | ✅ | quantms、pridepy、ThermoRawFileParser 等官方/半官方开源工具链 |
| 22 | 合规要求 | ✅ | 数据政策 v1.0 明确许可(CC0)、私有期、移除与敏感数据边界 |
| 23 | 多模态对齐 | ⚠️ | >8,000 数据集已链接 GEO/MetaboLights/ENA/EGA,但为研究级而非样本级行对齐 |
| 24 | 去标识化 | ⚠️ | 政策明确禁止敏感数据入库、脱敏责任在提交方;无集中化审计 |
DAIMS 评分:16 / 24
评分解读:16/24 处于"基础设施优秀、语义质量中等"的典型仓库形态。得分集中在工程侧(标识、时间戳、字典、合规、工具链),失分集中在语义侧(无划分、无罕见类分组、缺失/重复/共线性需使用者自行治理)——这与 PRIDE"保存原始状态"的仓库定位一致,而非数据集本身缺陷。
对你意味着什么:(1) 可以放心把 PRIDE 作为"数据源事实标准"接入 MLOps(标识/校验/合规三项满分级);(2) 不要期望直接加载即用——划分、清洗、去重、FDR 统一必须自建(预算 2-4 周工程时间);(3) 医学结论的严谨性取决于你对 §5.3/§7.1 偏倚的治理程度,而非仓库本身;(4) 若你的任务对"标签质量"敏感(如临床分类),优先选择带 SDRF 的 Complete 提交子集。
§7.8 外部验证矩阵
| 外部研究/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 泛癌蛋白质图谱(PXD013455) | EMBL-EBI | 11 个 PRIDE 数据集合并:191 癌细胞系 + 246 肿瘤样本 | 转录-蛋白表达中位相关 | 细胞系 vs 肿瘤内部相似度高于跨类型 | 首个癌症公开蛋白组 meta 分析;mRNA 对蛋白丰度解释力有限 |
| quantms 大规模再分析 | EMBL-EBI | 100+ 数据集、13,000 人样本定量重搜索 | 人类蛋白质覆盖规模 | 较单研究覆盖显著扩大 | 产出迄今最大人类蛋白质定量集合,回流 UniProt/Expression Atlas |
| 蛋白质基因组学再分析(PXD029362/PXD029360) | EMBL-EBI + 合作方 | 非典型/变异肽段鉴定 | 43,501 非典型肽段、786 变异肽段 | 常规搜索无法发现该层信号 | pypgatk+quantms 定制库路径可行,BED 回流 Ensembl |
| 泛基因组肽段研究 | EMBL-EBI | 五个人群泛基因组蛋白组 | 4,991 新肽段、3,921 SAAV(2,367 基因) | 参考库增补后新鉴定显著增加 | 人群泛基因组对蛋白组实验设计有实质影响 |
§8 基准性能与生态
§8.1 排行榜与基准现状
PRIDE 是数据仓库,不存在单一官方排行榜或 SOTA 榜单。社区基准以两种形态存在:其一,方法学论文以固定 PRIDE 数据集为测试床报告指标(保留时间/谱图强度预测等);其二,再分析工作流(quantms)以产出规模与一致性为验收标准。由于各论文选择的测试集、搜索参数与 FDR 口径不同,跨论文数值不可直接比较。
| 方法 | 任务 | 发表 | 完整引用 | 代码 |
|---|---|---|---|---|
| DeepLC | 肽段保留时间预测(含未见修饰泛化) | Nature Methods 2021 | Bouwmeester R, Gabriels R, Hulstaert N, Martens L, Degroeve S., 2021, Nature Methods 18(11):1363-1369. DOI: 10.1038/s41592-021-01301-5 | 开源 |
| quantms | 大规模再分析工作流 | EMBL-EBI 技术生态 | nf-core 系 Nextflow 流水线,OpenMS + DIA-NN | 开源(nf-core) |
| PRIDE Archive USI | 谱图实时抽取与可视化 | NAR 2025 update | Perez-Riverol Y 等, 2025, Nucleic Acids Res 53(D1):D543-D553. DOI: 10.1093/nar/gkae1011 | 服务化 API |
注:DeepLC 的 DOI 为其 Nature Methods 论文 DOI;表中性能数值因评测口径差异不在本表列示,请回读各论文原文协议。
社区常用测试床数据集组合(可复现论文对比的起点):
| 测试床 | PXD | 常见用法 |
|---|---|---|
| PXD000001(TMT Erwinia,官方教程数据集) | PXD000001 | 下载链路验证、文档示例对齐 |
| 官方下载页示例 PXD005207 / PXD004683 | 见 §6.2 | ascp/Docker 命令逐字可跑 |
| 再分析产出集 | PXD029362、PXD029360 | 蛋白质基因组学管道回归测试 |
| 泛癌合并图谱 | PXD013455 | 定量矩阵合并与跨库对齐演练 |
| 多组学标注样例 | PXD063552 | Gemini 辅助多组学标注的官方示例 |
测试床之外的正式实验请自行声明数据集清单与切分协议(§8.3),避免"教程数据集泄漏"——这些 PXD 的识别结果已被大量论文与方法文档引用。
§8.2 SOTA 总结与选型建议
- 谱图/序列建模:从 DeepLC 类序列回归模型入手建立基线;预训练语料用 USI 流式抽取以控制存储成本。
- 再分析管线:直接采用 quantms(SDRF 驱动),避免自研搜索脚本的可复现性债。
- 评测纪律:报告指标必须附协议(引擎/参数/FDR 层级/划分方式),否则不具备可比性(§8.1 注)。
§8.3 评测协议建议
- 固定蛋白库版本与 contaminant 处理;2. 声明 FDR 层级与阈值;3. 划分采用 PXD 分组 + peptide 序列分组双 GroupKFold;4. 报告按仪器/物种分层指标;5. 引用数据集全部 PXD 号与处理代码仓链接。
协议逐条展开:
- 蛋白库冻结:写明 UniProt release 号与 reviewed 状态;污染库(contaminants)追加方式统一。
- FDR 声明:PSM/peptide/protein 三层中报告哪一层、阈值多少、由 target-decoy 还是后验错误概率驱动。
- 双重分组切分:GroupKFold(group=PXD) 外层,GroupKFold(group=peptide sequence) 内层,两层种子固定。
- 分层报告:至少按仪器族与物种分层报告主指标;时间切分对照作为稳健性附录。
- 溯源三件套:PXD 清单 + 代码仓 tag + quantms/流水线版本号,缺一即视为不可复现。
- 统计检验:跨数据集比较用配对设计(同一数据集族内比较方法),并做多重校正。
§8.4 相关数据集与资源
| 资源 | 类型 | 与 PRIDE 的关系 | 适用场景 |
|---|---|---|---|
| MassIVE | PX 数据仓库(UCSD) | 第二大 PX 资源,元数据同步 | 跨仓验证、USI 互查 |
| jPOST | PX 数据仓库(日本) | 亚洲提交枢纽 | 亚洲研究溯源 |
| iProX | PX 数据仓库(北京) | 中国区枢纽 | 同上 |
| PeptideAtlas/PASSEL | 一致性库 + 靶向库(ISB) | PX 成员 | 高置信肽段参考、靶向方法 |
| Expression Atlas | 表达图谱(EMBL-EBI) | PRIDE 再分析数据回流目的地 | 蛋白表达可视化 |
| OmicsDI | 数据集发现索引(EMBL-EBI) | 聚合 PX 与其他组学元数据 | 跨组学数据集检索 |
| MetaboLights | 代谢组仓库(EMBL-EBI) | 多组学链接对象(>8,000 数据集) | 蛋白-代谢联合研究 |
| PRIDE Crosslinking | XL-MS 专区 | PRIDE 子资源 | 结构蛋白质组学 |
§8.5 关键论文 Top 8
- Martens L, Hermjakob H, Jones P, et al., 2005, PRIDE: The PRoteomics IDEntifications database, Proteomics 5(13):3537-3545. DOI: 10.1002/pmic.200401303 —— 创始论文,定义"把公开数据变成可公开访问数据"的使命。
- Jones P, Côté RG, Martens L, et al., 2006, PRIDE: a public repository of protein and peptide identifications for the proteomics community, Nucleic Acids Res 34:D659-D663. DOI: 10.1093/nar/gkl138 —— 数据库专刊早期扩展(查询/提交设施)。
- Vizcaíno JA, Deutsch EW, Wang R, et al., 2014, ProteomeXchange provides globally coordinated proteomics data submission and dissemination, Nature Biotechnology 32(3):223-226. DOI: 10.1038/nbt.2839 —— PX 联盟奠基,统一 PXD 体系(Google Scholar 2,955 次,截至 2026-09)。
- Vizcaíno JA, Csordas A, del-Toro N, et al., 2016, 2016 update of the PRIDE database and its related tools, Nucleic Acids Res 44(D1):D447-D456. DOI: 10.1093/nar/gkv1145 —— 量化数据支持与工具更新(Mendeley 3,012 次)。
- Perez-Riverol Y, Csordas A, Bai J, et al., 2019, The PRIDE database and related tools and resources in 2019: improving support for quantification data, Nucleic Acids Res 47(D1):D442-D450. DOI: 10.1093/nar/gky1106 —— 基础设施重写与分布式架构(Mendeley 5,515 次)。
- Deutsch EW, Bandla C, et al., 2023, The ProteomeXchange consortium at 10 years: 2023 update, Nucleic Acids Res 51(D1) —— PX 十年:CC0 统一、许可与资源矩阵。
- Perez-Riverol Y, Bandla C, Bludau I, et al., 2025, The PRIDE database at 20 years: 2025 update, Nucleic Acids Res 53(D1):D543-D553. DOI: 10.1093/nar/gkae1011 —— 20 年里程碑:50,804 数据集、USI/Crosslinking/Chatbot、复用统计。
- Kamatchinathan JK, Hewapathirana S, Bandla C, et al., 2025, pridepy: A Python package to download and search data from PRIDE database, Journal of Open Source Software. DOI: 10.21105/joss.07563 —— 官方 Python 客户端与存储架构(FIRE/NFS)说明。
§8.6 社区活跃度
- 提交节奏:月均约 534 个新数据集(截至 2025-07 前后统计窗口);2024-07~2025-07 同比 +23%。
- 下载节奏:2022-2024 月均约 100 TB,2022-09 峰值超 450 TB。
- 文献复用:多数数据集被再分析 2-5 次(EuropePMC 提及统计)。
- 官方支持:pride-support@ebi.ac.uk;PRIDE Chatbot(2024 年上线的文档问答助手)。
- 演进方向:Gemini 2.5 辅助多组学数据集标注、USI 扩展 Bruker/SCIEX、Open Targets 定量蛋白组整合(进行中)。
- 再分析前沿(2025):宏蛋白质组数据接入 MGnify 试点、RNA 编辑来源 SAAV 接入 REDIportal 试点——PRIDE 正从"存档"走向"派生知识节点"。
- 用户入口多元化:网页检索、PRIDE Inspector 桌面端、Chatbot 自然语言入口并行,覆盖从生信工程师到湿实验人员的全谱系用户。
§8.7 生态快照
| 资源 | 类型 | 链接 | 推荐理由 |
|---|---|---|---|
| pridepy | Python 客户端(Apache 2.0) | https://github.com/PRIDE-Archive/pridepy | 官方下载/检索自动化首选 |
| PRIDE-Utilities | Java 库族 | https://github.com/PRIDE-Utilities | jmzML/mzIdentML/mzTab 读写标准件 |
| ThermoRawFileParser | 转换工具 | 开源(Java) | RAW→mzML 事实标准,USI 同款 |
| quantms | Nextflow 工作流 | nf-core 生态 | SDRF 驱动的大规模再分析 |
| PepGenome / py-pgatk | 蛋白质基因组学 CLI | https://github.com/bigbio/pepgenome | 肽段→基因组 BED |
| PRIDE Chatbot | LLM 问答服务 | https://www.ebi.ac.uk/pride/chatbot/ | 文档导航与数据集检索辅助 |
§9 相关资源与引用
§9.1 官方资源导航
| 资源 | 链接 | 说明 |
|---|---|---|
| PRIDE 主页 | https://www.ebi.ac.uk/pride | 门户与新闻 |
| PRIDE Archive 检索 | https://www.ebi.ac.uk/pride/archive/ | 数据集网页检索 |
| 提交指南 | https://www.ebi.ac.uk/pride/markdownpage/submitdatapage | PX Submission Tool 流程 |
| 下载页 | https://www.ebi.ac.uk/pride/markdownpage/pridefiledownload | 5 种下载通道与命令 |
| 数据政策 | https://www.ebi.ac.uk/pride/markdownpage/datapolicy | 许可/私有期/移除规则 |
| REST API v3 | https://www.ebi.ac.uk/pride/ws/archive/v3 | 元数据与文件检索 |
| PRIDE Archive USI | https://www.ebi.ac.uk/pride/archive/usi | 谱图实时抽取 |
| PRIDE Crosslinking | https://www.ebi.ac.uk/pride/archive/crosslinking | XL-MS 专区 |
| PRIDE Chatbot | https://www.ebi.ac.uk/pride/chatbot/ | LLM 文档问答 |
| Pride Inspector 教程 | https://www.ebi.ac.uk/training/online/ | 桌面工具可视化课程 |
| ProteomeCentral | https://proteomecentral.proteomexchange.org/ | PX 联盟数据集总览与 USI 互查 |
| OmicsDI | https://www.omicsdi.org/ | 跨组学数据集发现索引 |
| 培训教程 | https://www.ebi.ac.uk/training/online/courses/pride-quick-tour/ | 官方快速导览课 |
| ProteomeXchange | https://www.proteomexchange.org/ | 联盟门户与 PTMeXchange |
| 用户支持 | pride-support@ebi.ac.uk | 邮件支持 |
§9.2 BibTeX 引用
@article{martens2005pride,
title = {PRIDE: The {PR}oteomics {ID}entifications database},
author = {Martens, Lennart and Hermjakob, Henning and Jones, Philip and Adamski, Marcin and Taylor, Chris and States, David and Gevaert, Kris and Vandekerckhove, Jo{\"e}l and Apweiler, Rolf},
journal = {Proteomics},
volume = {5},
number = {13},
pages = {3537--3545},
year = {2005},
doi = {10.1002/pmic.200401303}
}
@article{jones2006pride,
title = {PRIDE: a public repository of protein and peptide identifications for the proteomics community},
author = {Jones, Philip and C{\^o}t{\'e}, Richard G. and Martens, Lennart and Quinn, Antony F. and Taylor, Chris F. and Derache, Wahida and Hermjakob, Henning and Apweiler, Rolf},
journal = {Nucleic Acids Research},
volume = {34},
pages = {D659--D663},
year = {2006},
doi = {10.1093/nar/gkl138}
}
@article{vizcaino2014proteomexchange,
title = {ProteomeXchange provides globally coordinated proteomics data submission and dissemination},
author = {Vizca{\'i}no, Juan Antonio and Deutsch, Eric W. and Wang, Rui and Csordas, Attila and Reisinger, Florian and R{\'i}os, Daniel and Dianes, Jos{\'e} A. and Sun, Zhi and Farrah, Terry and Bandeira, Nuno and others},
journal = {Nature Biotechnology},
volume = {32},
number = {3},
pages = {223--226},
year = {2014},
doi = {10.1038/nbt.2839}
}
@article{perezriverol2019pride,
title = {The {PRIDE} database and related tools and resources in 2019: improving support for quantification data},
author = {Perez-Riverol, Yasset and Csordas, Attila and Bai, Jing and Bernal-Llinares, Manuel and Hewapathirana, Suresh and Kundu, Deepti J. and Inuganti, Ananth and Griss, Johannes and Mayer, Gerhard and Eisenacher, Martin and others},
journal = {Nucleic Acids Research},
volume = {47},
number = {D1},
pages = {D442--D450},
year = {2019},
doi = {10.1093/nar/gky1106}
}
@article{perezriverol2025pride,
title = {The {PRIDE} database at 20 years: 2025 update},
author = {Perez-Riverol, Yasset and Bandla, Chakradhar and Bludau, Isaiah and others},
journal = {Nucleic Acids Research},
volume = {53},
number = {D1},
pages = {D543--D553},
year = {2025},
doi = {10.1093/nar/gkae1011},
pmid = {39494541}
}
@article{kamatchinathan2025pridepy,
title = {pridepy: A Python package to download and search data from {PRIDE} database},
author = {Kamatchinathan, Selvakumar and Hewapathirana, Suresh and Bandla, Chakradhar and Insua, Santiago and Vizca{\'i}no, Juan Antonio and Perez-Riverol, Yasset},
journal = {Journal of Open Source Software},
year = {2025},
doi = {10.21105/joss.07563}
}
@article{jarnuczak2021cancer,
title = {An integrated landscape of protein expression in human cancer},
author = {Jarnuczak, Andrew F. and Najgebauer, Hanna and Barzine, Mitra and Kundu, Deepti J. and Ghavidel, Fatemeh and Perez-Riverol, Yasset and Papatheodorou, Irene and Brazma, Alvis and Vizca{\'i}no, Juan Antonio},
journal = {(见 PubMed: 33893311)},
year = {2021},
note = {整合 11 个 PRIDE 数据集的泛癌蛋白质图谱,PXD013455}
}
@misc{pridedatapolicy,
title = {PRIDE data policy (Version 1.0)},
author = {{EMBL-EBI PRIDE Team}},
howpublished = {\url{https://www.ebi.ac.uk/pride/markdownpage/datapolicy}},
year = {2022},
note = {2022 年 5 月发布;CC0 与私有期规则}
}
§9.3 引用指南
- 引用数据仓库:引用最新更新论文(Perez-Riverol 等 2025)+ 具体数据集的原始文献(经数据集页面的 DOI 字段获取)。
- 引用数据集本身:正文以 PXD 登录号引用(如 PXD000001),并注明访问日期(公开数据虽不可变,但镜像/统计口径会变)。
- 引用本条目:引用千方病案医数集页面并注明审核日期 2026-09-05。
§10 AI 使用声明卡
§10.1 本条目使用的 AI 模型
| 模型 | 用途 | 版本/说明 |
|---|---|---|
| 大语言模型(CodeBuddy 内置模型) | 条目初稿撰写、结构组织、代码示例生成 | 2026-09 生成;技术术语与代码经人工复核 |
§10.2 AI 参与范围
AI 参与范围:全文初稿撰写(结构、叙述、表格组织、代码示例)、事实素材汇总。AI 不参与:事实核查的最终裁定、医学内容的审核签字、许可与合规判断。所有硬数字均来自 §10.3 所列公开来源,检索于 2026-09-13 前后,并在正文中附来源链接。
边界声明:正文中所有规模数字(50,804 数据集、月均 534、月均 100 TB 等)均标注"截至"日期;代码示例以官方文档端点为准但未经端到端运行验证(依赖版本可能变化);ICD-11/SNOMED CT 映射用于检索分层参考,不构成临床编码建议。
§10.3 输入来源清单
- Martens L, et al., 2005, PRIDE: The PRoteomics IDEntifications database, Proteomics 5(13):3537-3545. DOI: 10.1002/pmic.200401303.
- Jones P, et al., 2006, PRIDE: a public repository of protein and peptide identifications, Nucleic Acids Res 34:D659-D663. DOI: 10.1093/nar/gkl138.
- Vizcaíno JA, et al., 2014, ProteomeXchange provides globally coordinated proteomics data submission and dissemination, Nature Biotechnology 32(3):223-226. DOI: 10.1038/nbt.2839.
- Perez-Riverol Y, et al., 2019, The PRIDE database and related tools and resources in 2019, Nucleic Acids Res 47(D1):D442-D450. DOI: 10.1093/nar/gky1106.
- Deutsch EW, et al., 2023, The ProteomeXchange consortium at 10 years: 2023 update, Nucleic Acids Res 51(D1). PMID: 36370099.
- Perez-Riverol Y, et al., 2025, The PRIDE database at 20 years: 2025 update, Nucleic Acids Res 53(D1):D543-D553. DOI: 10.1093/nar/gkae1011. PMID: 39494541.
- Kamatchinathan JK, et al., 2025, pridepy: A Python package to download and search data from PRIDE database, JOSS. DOI: 10.21105/joss.07563.
- Jarnuczak AF, et al., 2021, An integrated landscape of protein expression in human cancer. PMID: 33893311.
- EMBL-EBI, 2025, EMBL’s European Bioinformatics Institute (EMBL-EBI) in 2025, Nucleic Acids Res 54(D1):D10(PRIDE 2025 年度进展节).
- PRIDE Team, 2022, PRIDE data policy v1.0, https://www.ebi.ac.uk/pride/markdownpage/datapolicy.
- PRIDE Team, PRIDE Data Download, https://www.ebi.ac.uk/pride/markdownpage/pridefiledownload.
- EMBL-EBI Training, PRIDE quick tour: Downloading data from PRIDE Archive, https://www.ebi.ac.uk/training/online/courses/pride-quick-tour/.
- PRIDE REST API v3 文档与服务端点, https://www.ebi.ac.uk/pride/ws/archive/v3.
- Google Scholar / Mendeley 引用统计页面(Martens 主页条目与 PRIDE 2019 update 条目),检索于 2026-09-13.
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与规模数字 | 千方病案医学编辑部 | 对照 FACTS.md 与来源 URL 逐条核对 | ✅ 已通过 |
| §2 医学背景与 ICD-11/SNOMED 映射 | 千方病案医学编辑部 | 编码对照 ICD-11/SNOMED CT 官方术语 | ✅ 已通过 |
| §3-§4 规格与数据结构 | 千方病案医学编辑部 | 对照官方下载页/API 文档核验字段与路径 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 代码逻辑审读 + 端点/参数与官方文档比对 | ✅ 已通过 |
| §7-§8 DAIMS 与基准生态 | 千方病案医学编辑部 | 24 项逐项评估 + 引用完整性核对 | ✅ 已通过 |
| §9-§10 引用与声明 | 千方病案医学编辑部 | BibTeX 字段与来源逐一比对 | ✅ 已通过 |
§10.5 AI 生成章节标注
全文初稿由 AI 生成(§10.1 所列模型),经 §10.4 所列人工校验流程后发布;无"仅人工"或"仅 AI"的独立章节。
§10.6 最后人工审核
最后人工审核日期:2026-09-05(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- proteomexchange — 共享标签:基因组学与多组学 / 代谢组学 / 蛋白质组学
- alphafold — 共享标签:基因组学与多组学 / 蛋白质组学
- cptac — 共享标签:基因组学与多组学 / 蛋白质组学
- string — 共享标签:基因组学与多组学 / 蛋白质组学
- metabolights — 共享标签:基因组学与多组学 / 代谢组学
- metabolomics-workbench — 共享标签:基因组学与多组学 / 代谢组学
- alphafold — 共享标签:基因组学与多组学 / 蛋白质组学
- iedb — 共享标签:基因组学与多组学 / 蛋白质组学
- uniprot — 共享标签:基因组学与多组学 / 蛋白质组学
- kegg — 共享标签:基因组学与多组学 / 蛋白质组学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

