IEDB — 免疫表位权威百科与 AI 建模范式 AI-Ready Wikipedia

190 万+免疫表位、804 万+实验记录的全球最大免疫表位开放数据库

来源 NIAID / La Jolla Institute for Immunology (LJI) url: https://www.iedb.org发布时间: 2026-09-18最后更新: 2026-09-25 阅读 24
IEDB — 免疫表位权威百科与 AI 建模范式 AI-Ready Wikipedia

信息速览

数据集名称IEDB — 免疫表位权威百科与 AI 建模范式 AI-Ready Wikipedia
数据类型约 190 万个肽类表位,约 804 万项实验记录,27,040 篇文献来源,免费开放获取
规模约 190 万个免疫表位(覆盖人类、小鼠等 4,816 种来源生物)
接入方式NIAID / La Jolla Institute for Immunology (LJI) url: https://www.iedb.org
AI 就绪度

IEDB — 免疫表位权威百科与 AI 建模范式 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 IEDB(免疫表位数据库)
英文全称 The Immune Epitope Database and Analysis Resource
别名/简称 Immune Epitope Database;IEDB-AR(Analysis Resource);IEDB 3.0
疾病分类(ICD-11) 覆盖四大情境:1B10(结核病)、RA01(COVID-19)、5A10(1 型糖尿病)、8A40(多发性硬化)等
SNOMED CT 56717001(Tuberculosis)、840539006(COVID-19)、46635009(Diabetes mellitus type 1)、24700007(Multiple sclerosis)
数据模态 免疫表位(肽序列/构象结构/非肽分子)+ T/B 细胞与 MHC 实验测定记录 + TCR/BCR 受体序列
AI 任务类型 MHC 结合/配体预测、T/B 细胞表位预测、免疫原性预测、人群覆盖分析、免疫知识挖掘
样本总数 肽类表位 1,904,273 + 非肽类 3,412;实验记录合计 8,037,502(截至 2026-09)
数据大小 无单一整包发布;在线库 + IQ-API + 按需导出(AIRR 导出为 GB 级压缩包)
数据格式 JSON/CSV(IQ-API)、XLSX(TCR/BCR 导出)、ZIP(AIRR)、FASTA(预测工具输入)
许可证 免费开放(NIAID 资助公共资源;预测工具可下载版教育免费、商用付费)
访问级别 开放(无需注册,网页/API/导出均可直接访问)
DUO 标签 NRES(无限制使用)
语言 英文(文献整理元数据)
首发日期 2004(NIAID 合同立项上线)
最后更新 持续滚动更新(文献整理每两周同步 PubMed;本页数据截至 2026-09)
发布机构 NIAID/NIH 资助;La Jolla Institute for Immunology(LJI)托管
官方主页 https://www.iedb.org
下载地址 https://www.iedb.org/database_export_v3.php;https://query-api.iedb.org
DOI 10.1093/nar/gkae1092(2024 update 数据库论文)
引用次数 数据库论文 197+(Dimensions,截至 2026-09);全库被 34,000+ 篇出版物引用
AI 就绪度评分 ⭐⭐⭐(3/5)— API 与导出完善、字段结构化程度高,但无官方训练/测试划分与预处理脚本,需自行清洗与防泄漏切分
页面状态 published

§0 E-E-A-T 信任声明与免责声明

医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、免疫学任务定义、金标准描述)、§7 偏倚分析。

数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(IQ-API 端点字段体系)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

审核方式:交叉审核

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。IEDB 为 NIAID 资助的免费开放资源,网页检索、API 查询与数据导出均无需注册,但部分预测工具的可下载版本仅限教育用途免费、商业使用需向版权方付费许可。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? IEDB(Immune Epitope Database,免疫表位数据库,iedb.org)是全球最大的免疫表位公开数据库,由美国国家过敏与传染病研究所(NIAID)资助、La Jolla Institute for Immunology(LJI)托管运营。当病毒、细菌或过敏原入侵人体时,免疫系统识别的"分子路标"就是表位(epitope)——IEDB 做的事情,就是把全世界文献里经实验鉴定过的表位及其测定实验统一收集、人工整理并免费开放。截至 2026-09,库内已有约 190 万个肽类表位、约 804 万项实验记录(官方首页)。

为什么重要? 表位是疫苗设计、免疫疗法与抗体药物开发的直接靶点。IEDB 覆盖感染性疾病、过敏、自身免疫与移植四大疾病情境,数据经专业团队自 1952 年以来的逾 2.7 万篇文献中逐篇人工整理,同时收录阳性与阴性结果——这使它成为表位预测算法(如 NetMHCpan 系列)训练与评测的事实标准数据源,也是 SARS-CoV-2、结核病等传染病疫苗攻关中被反复调用的公共基础设施(Vita et al. 2025)。

我能用它做什么? 对 AI 研究者而言,IEDB 提供三类核心能力:其一,通过网页检索、IQ-API(PostgREST)或批量导出获取结构化的表位—实验—宿主—MHC 限制数据,用于训练 MHC 结合、免疫原性、TCR 特异性等预测模型;其二,直接调用其在线预测工具(MHC-I/II 结合、B 细胞表位、人群覆盖分析)为新病原快速候选表位;其三,以 IEDB 为外部基准验证自研免疫模型的泛化能力。

§1.1 摘要

IEDB 建立于 2004 年,是 NIAID 以合同形式资助的公共资源(第三轮与第四轮合同分别为 75N93019C00001 与 75N93026C00001),由 LJI 的 Sette 实验室与 Peters 实验室共同主持(LJI 官方介绍)。其核心生产方式是人工文献整理:专业生物文献管理员(biocurator)从同行评审文献中逐条抽取表位结构、实验类型、测定结局、宿主物种、MHC 限制与疾病情境,并结构化入库;文献整理覆盖 1952 年至今,每两周自动查询一次 PubMed 以维持时效(Vita et al. 2025)。数据模型围绕四类核心记录展开:表位结构(structure)、来源抗原(antigen)、三类实验测定(T cell assay、B cell assay、MHC ligand assay)与参考文献(reference),近年新增 TCR/BCR 免疫受体序列层。配套的 Analysis Resource(IEDB-AR)提供 MHC 结合与加工预测、免疫原性打分、B 细胞表位预测与人群覆盖等工具,网页端免费、多数工具提供 REST API 与命令行版本。获取路径包括网页检索导出、IQ-API(基于 PostgREST 的查询接口)与 database_export_v3.php 批量导出。对 AI 而言,其最大价值是"文献级阳性+阴性标注 + 精细实验上下文",最大挑战是文献选择偏倚、等位基因长尾分布与评测集与预测器训练集的重叠泄漏。

数据生产管线一览(理解该库有助于判断其质量边界):

  1. 选题扫描:每两周执行一次 PubMed 查询,按期刊范围与关键词圈定候选文献。
  2. 人工整理:biocurator 逐篇抽取表位结构、测定方法、结局、宿主、MHC 限制与疾病情境,写入整理库。
  3. 质量控制:QA 经理抽查与规则校验(含自由文本归一化规则),错误修正滚动进行。
  4. 发布:整理库经 ETL 迁移至在线数据仓库,同步刷新网页端与 IQ-API 后端 Postgres 表。
  5. 反馈闭环:用户研讨会、论坛与 help@iedb.org 的纠错反馈回流至整理队列。

§1.2 战略价值

维度一:免疫 AI 的"黄金标准"训练与评测底座。 IEDB 是少数同时具备规模(百万级表位、千万级实验)、精细标注(每个测定值都关联方法、单位、结局与文献)与阳性/阴性双收录的免疫数据资源。NetMHCpan、NetMHCIIpan 等主流 MHC 结合预测器的每一代训练与外部验证都以 IEDB 数据为核心;评测研究也普遍以"从 IEDB 抽取训练截止日期之后的实验数据"作为无泄漏验证范式(NetMHCpan-4.0 论文)。对国内团队而言,它是构建自有免疫模型时最可信、最可引用的外部基准。

维度二:疫苗与免疫疗法的公共决策基础设施。 在 COVID-19 大流行期间,IEDB 因快速整理 SARS-CoV-2 表位文献(相关文献量为 SARS-CoV-1 的 4.6 倍)而成为全球疫苗表位筛选的枢纽;其人群覆盖分析工具可直接估算候选表位在目标人群中的 HLA 覆盖率。全库被逾 34,000 篇科学出版物(含专利申请)引用、月访问超 54,000 次(LJI 新闻稿),显示其"基础研究—转化研究—产业应用"三段贯通的生态位。

§1.3 同类数据集横向对比

数据集 规模 模态/标注 差异化定位
IEDB 约 190 万表位、804 万实验(截至 2026-09) T/B/MHC 三类实验 + 阳性/阴性 + 宿主/疾病上下文 + TCR/BCR 序列 覆盖最广、人工整理最深、阴性数据可用的免疫表位总库
CEDAR(IEDB 姊妹站,NCI 资助) 癌抗原表位专库 癌症/肿瘤抗原表位与测定 专攻肿瘤免疫情境,与 IEDB 共享工具栈(Koşaloğlu-Yalçın et al. 2023)
VDJdb TCR-表位配对专库 TCR 序列 + 特异性标注 受体侧深挖,适合 TCR 特异性建模;站内条目见 /ai-ready-dataset/vdjdb/0
SYFPEITHI 数千条 MHC 配体 人工整理的 MHC 配体基序 历史悠久的基序库,规模远小于 IEDB,更新缓慢
MHCBN 数万条肽 MHC 结合/非结合肽 早期结合数据库,现多被 IEDB 取代

§1.4 版本时间轴

时间 版本/事件 关键内容
2004 IEDB 立项上线 NIAID 合同资助,LJI 主持,开始文献整理
2009 IEDB 2.0 查询/浏览/报告界面完全重构;已整理 180,978 项文献实验 + 129,186 项直接提交实验(Vita et al. 2010)
2018 IEDB 3.0 与 2018 update 论文 界面与互操作性更新;获 NIH 7 年 2,200 万美元续约(合同 75N93019C00001)
2019 IEDB-AR 2019 论文 分析资源新增 10 个工具,REST API 与虚拟机镜像开放(Dhanda et al. 2019)
2020-2022 COVID 应急整理 SARS-CoV-2 表位文献快速入库;新增 TCR/BCR 受体序列数据层
2025 2024 update 论文 检索界面三类 Filter 视图、Protein Tree、Antigen Summary、3D 查看器、自定义导出;获 NIAID 新一轮最多 1,760 万美元/5 年资助(Vita et al. 2025)

§1.5 典型应用场景

  1. MHC 结合/免疫原性模型训练:抽取定量结合数据(IC50/KD 等)与配体洗脱数据,训练等位基因特异性或 pan-specific 模型(NetMHCpan 系列即此范式)。
  2. 新病原疫苗表位快速筛选:调用 IEDB-AR 的 MHC 结合、加工与人群覆盖工具,对病原蛋白全序列扫描候选 T 细胞表位(COVID-19 期间被广泛采用)。
  3. TCR/BCR 特异性建模:利用新增的受体序列层与 CDR3 标注,训练表位特异性 TCR 识别模型,或与 VDJdb 等专库互补。
  4. 文献知识挖掘:将 27,000+ 篇文献的结构化表位记录作为免疫学语料,支持大语言模型微调与知识图谱构建。
  5. 模型外部基准评测:以"训练截止日期后入库的数据"构造无泄漏验证集,评估自研表位预测器的泛化性能(见 §5 与坑点 1)。

§2 医学背景

§2.1 ICD-11 编码映射

IEDB 不是单一疾病数据集,而是横跨四大疾病情境的免疫资源。下表给出其数据集中最具代表性的研究热点疾病与 ICD-11 的对应关系(编码取自 WHO ICD-11 浏览器公开信息)。

IEDB 疾病情境 代表病原/抗原 ICD-11 编码 ICD-11 中文名
感染性疾病 结核分枝杆菌 1B10 结核病
感染性疾病 SARS-CoV-2 RA01 COVID-19
过敏 花生等过敏原 CA08 过敏性鼻炎(过敏情境代表)
自身免疫 胰岛 β 细胞抗原 5A10 1 型糖尿病
自身免疫 髓鞘抗原 8A40 多发性硬化
移植 供者 HLA/次要抗原 — 以宿主/移植情境字段标注,无单一编码

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 术语
结核病 1B10 56717001 Tuberculosis(结核病)
COVID-19 RA01 840539006 Disease caused by SARS-CoV-2(COVID-19)
1 型糖尿病 5A10 46635009 Diabetes mellitus type 1(1 型糖尿病)
多发性硬化 8A40 24700007 Multiple sclerosis(多发性硬化)

§2.2 疾病与免疫学简介

**表位(epitope)**是抗原分子上被适应性免疫系统受体(T 细胞受体 TCR 或 B 细胞受体/抗体 BCR)直接识别的具体分子结构。T 细胞表位通常是抗原经加工后装载于 MHC 分子凹槽中的短肽(MHC-I 呈递 8-14 肽给 CD8⁺ T 细胞,MHC-II 呈递 13-25 肽给 CD4⁺ T 细胞);B 细胞表位则可以是线性肽段,也可以是由蛋白空间折叠形成的构象(不连续)表位,此外还存在糖类、脂质与化学小分子等非肽表位。IEDB 正是围绕这一分子层次构建:每条记录回答"什么结构(表位)—在什么生物(来源抗原)—被什么宿主—在什么实验(测定方法与结局)—受什么 MHC 限制—发表于哪篇文献"。

从公共卫生视角,表位知识的积累直接决定疫苗与免疫疗法的迭代速度:疫苗设计需要挑选既能被高频 HLA 等位基因呈递、又具备跨株保守性的 T 细胞表位;肿瘤免疫疗法需要区分肿瘤相关抗原与正常组织的免疫原性窗口;过敏原研究与脱敏治疗则需要定位 IgE 识别的构象表位。IEDB 自 1952 年文献起整编的阳性与阴性数据,构成了以上应用的共同证据底座。流行病学意义上,其覆盖的热点病原(流感、HIV、疟疾、结核、SARS-CoV-2)恰是全球疾病负担最重的传染病因子,库内数据量随文献选题波动(如 COVID-19 期间 SARS-CoV-2 数据激增),这一点在评估模型时必须纳入考量。

MHC 呈递的两条通路决定了 IEDB 数据的两大技术分支。内源性通路:胞内蛋白经蛋白酶体降解、由 TAP 转运至内质网装载 MHC-I,对应"结合亲和力测定 + 配体洗脱质谱"两类数据——前者可体外合成肽测 IC50,后者直接反映天然呈递;外源性通路:胞外抗原经内体溶酶体加工装载 MHC-II,肽长可变且结合沟开放,导致 MHC-II 结合数据天然更难建模。理解这两条通路,就能理解为何 §7 的多项偏倚(洗脱数据爆发、MHC-II 预测精度天花板)在生物学上根植于呈递机制本身。

宿主与模式生物。IEDB 覆盖人类、非人灵长类、小鼠、大鼠、猪、猫等被试物种(Vita et al. 2010),其中小鼠 H-2 单倍型与人 HLA 的对应研究(如 H-2Kb 对应 HLA-A2 超-type 的功能类比)是跨物种迁移建模的重要参考;人类数据中供者 HLA 分型质量参差,是等位基因归属偏倚的又一来源。

§2.3 临床任务定义

临床/转化任务 IEDB 数据支撑方式 对应 AI 任务
疫苗表位筛选(预防性/治疗性) 已验证 T 细胞表位 + MHC 限制 + 宿主数据 MHC 结合预测 → 免疫原性打分 → 人群覆盖优化
肿瘤新抗原预测 肿瘤相关表位与 MHC 配体洗脱数据(含 CEDAR 姊妹库) 配体洗脱预测 + 结合亲和力排序
抗体/表位治疗设计 B 细胞表位(线性+构象)+ 中和测定 构象表位预测、抗体-表位对接
过敏原风险评估 过敏原表位 + IgE 结局测定 过敏原性分类、交叉反应预测
诊断试剂开发 明确的免疫优势表位集合 表位选择与交叉反应性排除

§2.4 宿主与人群构成

IEDB 以表位为记录单位而非患者队列;其"人群"维度体现为宿主(host)字段分布。下表归纳其主要人群维度:

维度 取值 说明
宿主物种 人、小鼠、非人灵长类、其他实验动物 首页 Host 过滤器(Human/Mouse/Non-human primate)直接支持
疾病情境 感染性 / 过敏 / 自身免疫 / 移植 首页 Disease 过滤器四大类
来源生物 4,816 种(病毒、细菌、寄生虫、真菌、过敏原、自体抗原) NCBITaxon 体系对齐
MHC 限制 1,021 个限制性等位基因 HLA 官方命名为主,含 H-2 等
文献来源 27,040 篇(1952-2026) 时间跨度 74 年

依据官方检索维度(首页),宿主实验多为模式动物或体外测定,人类供者信息在文献中以脱敏聚合形式存在(供者数量、HLA 分型),库内不含个体级患者记录;数据位置(data-location)字段在历史上为自由文本(251,810 个不同取值),近年开始规则化归一。

§2.5 临床价值

IEDB 的临床价值链体现为"文献证据 → 计算筛选 → 实验验证"的加速器:其一,既往 70 余年整理的表位-测定数据使新病原出现时可在数小时内完成候选表位的计算扫描(COVID-19 期间即为实例);其二,阴性测定数据的系统收录使模型能学习"什么样的肽不引起免疫应答",显著降低疫苗候选的失败率;其三,人群覆盖工具将 HLA 等位基因频率与候选表位结合,可预估疫苗在不同族群中的理论覆盖面,为全球化临床试验设计提供依据;其四,对免疫疗法,区分"结合即可"与"真正免疫原"的免疫原性工具(如 CD4 T 细胞免疫原性打分)直接降低候选肽合成与验证成本(Dhanda et al. 2018)。

§2.6 金标准属性

属性 说明
划分性质 无官方训练/测试划分;社区惯例以文献时间切分或等位基因分组切分
标注方式 专业 biocurator 人工整理为主(约 99% 感染性疾病肽表位公开信息覆盖率,2.0 时代评估)+ 研究者直接提交
标注者资质 免疫学专业背景文献管理员团队,设质量保证经理岗位(Randi Vita 博士)
标注一致性 整理规程透明且跨版本公开(Curation of complex, context-dependent immunological data, BMC Bioinformatics 2006);自由文本字段近年逐步归一化
数据性质 文献衍生实证数据(非影像、非队列),含阳性与阴性结局,实验级粒度

与影像/队列类数据集的"金标准"含义不同,IEDB 的金标准属性体现在证据等级上:每条测定记录直接对应一篇同行评审文献的一次实验报告,可回溯原始表格与实验条件。这意味着"金标准"不等于"无错"——原始文献的实验设计缺陷会被忠实继承(包括阈值选取的任意性与小样本效应);但它保证了对任何一条数据的争议都可以通过回读文献解决,这是合成数据或聚合知识库无法提供的可审计性。


§3 数据集规格

§3.0 版本抉择矩阵

IEDB 是持续滚动更新的在线资源,没有传统意义的"版本号发布",AI 使用者需按需求选择获取形态。

你的需求 推荐获取方式 体量 理由
快速探索几条表位/小样本原型实验 IQ-API epitope_search(limit 分页) 秒级返回 无需下载全库,JSON/CSV 即取即用
训练 MHC 结合预测模型(万级以上样本) IQ-API mhc_export / 网页 MHC Ligand 导出 CSV 数十万行级 export 端点字段与网页自定义导出一致,便于复现论文口径
TCR/BCR 特异性建模 database_export_v3.php 的 tcr_full_v3.xlsx / bcr_full_v3.xlsx 数 MB 级表格 结构化受体序列 + 表位配对,AIRR 标准 zip 兜底
全库本地化/离线分析 database_export_v3.php 批量导出 + AIRR zip GB 级 一次性拉取,避免长期高频 API 调用
复现 IEDB-AR 预测工具全栈 官方虚拟机镜像(非商业免费) 镜像数 GB 内含大部分在线工具,适合内网批量预测

§3.1 模态详情

表位结构层。 表位(structure)是 IEDB 的核心实体,分为线性肽(linear peptide,单字母氨基酸编码,如 SIINFEKL)、不连续表位(discontinuous,由残基集合定义的构象表位)与非肽表位(糖、脂、化学物与药物,3,412 个,截至 2026-09)。每个表位有唯一 structure_id 与 IRI(如 IEDB_EPITOPE:SB568),并可挂接多个来源抗原与起始位置。

实验测定层。 三类测定记录:T cell assay(577,219 项)记录增殖、细胞因子(ELISPOT/ICS)、四聚体染色等测定;B cell assay(1,689,461 项)记录抗体结合、中和、ELISA 等测定;MHC ligand assay(5,770,822 项)记录 MHC-I/II 结合亲和力(IC50/KD 等)与配体洗脱质谱结果。每项测定携带方法(assay type/method)、定量值与单位、结局(positive/negative)、宿主、MHC 限制与文献引用。

受体序列层(近年新增)。 对具备受体重建数据的测定,IEDB 收录 TCR α/β/γ/δ 与 BCR 重/轻链(κ/λ)序列及 CDR3 区,支持"表位↔受体"配对检索;批量导出提供 tcr_full_v3.xlsx、bcr_full_v3.xlsx 与遵循 AIRR Community 标准的 airr_full.zip(官方导出页)。

非肽分类层。 2021 年起 IEDB 为非肽表位建立了免疫学友好的简化分类层级,解决糖脂与化学表位命名不一致的检索难题(Edwards et al. 2021, Database)。

四个层的建模含义:表位层决定"样本空间"(能学什么分子);测定层决定"监督信号质量"(定量/定性、方法异质性);受体层决定"配对任务"(TCR-表位特异性);非肽层决定"模态边界"(序列模型不适用,需分子描述符)。在管线设计中,应先固定表位层采样框,再决定测定层的标签聚合规则,最后才考虑是否引入受体与非肽子集。

§3.2 子集规模表

子集 记录数(截至 2026-09) 说明
肽类表位 1,904,273 线性 + 不连续
非肽类表位 3,412 糖类、脂质、化学物、药物
T cell assay 577,219 含 ex vivo 与体外测定
B cell assay 1,689,461 含结合、中和、功能测定
MHC ligand assay 5,770,822 增长最快的子集(配体洗腾驱动)
表位来源生物 4,816 种 病毒、细菌、寄生虫、过敏原、自体抗原等
限制性 MHC 等位基因 1,021 HLA 为主,含小鼠 H-2 等
参考文献 27,040 篇 覆盖 1952 年至今

注:以上为官方首页 Summary Metrics 快照(iedb.org,检索于 2026-09-18);库为滚动更新,任何时间点数字都会略高。LJI 官方新闻稿另有"超过 750 万项实验、242 万分子结构"的口径(含 3D 结构计数差异),引用时需注明口径与日期。

子集增长率差异对采样的影响:2024 update 论文的数据增长分析显示,2010→2018→2024 三个时间点中,assays per epitope 与 assays per publication 是增长最猛的指标,且增长几乎全部由 MHC ligand assay 贡献。这意味着:若按"行"随机采样,样本将严重偏向近年洗脱型文献;若要研究 T/B 细胞免疫的时间趋势,必须按测定大类分层抽样。

§3.3 数据格式表

形态 格式 获取入口 适用场景
IQ-API search 端点 JSON(默认)/CSV(accept: text/csv) https://query-api.iedb.org/epitope_search 等 程序化检索、增量同步
IQ-API export 端点 CSV(与网页自定义导出同构) https://query-api.iedb.org/tcell_export 等 批量训练数据拉取
网页结果导出 CSV/XLSX,自定义列 + 查询参数表 网页 Export Results 图标 交互式筛选后落盘
受体批量导出 XLSX / ZIP(AIRR 标准) https://www.iedb.org/database_export_v3.php TCR/BCR 建模
预测工具输入 原始序列文本/FASTA(POST 参数) tools-cluster-interface.iedb.org 在线/批量预测
虚拟机镜像 OVF 镜像 官方下载页(非商业免费) 内网部署全工具栈

§3.4 存储与体量

IEDB 未发布单一整包下载,体量评估需分形态:IQ-API 单端点全量导出为数十万至百万行级 CSV(如 MHC export 超 570 万行,实际建议分片拉取);受体批量导出为 MB 级 XLSX 与 GB 级 AIRR zip;后端为 Postgres 关系库(IQ-API 即 PostgREST 直接暴露后端表)。磁盘规划建议:全量三类 assay export + 表位/抗原/文献维度表,预留 20-50 GB(含中间展开的嵌套字段)即可完成绝大多数 AI 建模任务;如需 3D 结构文件(PDB 引用)另计。所有规模数字随时间增长,落地前应以 api_metrics 端点核对当日行数。

§3.5 标注方式

IEDB 的"标注"本质是文献整理(curation):约 99% 的记录来自 biocurator 对同行评审文献的人工抽取,少数来自研究者直接提交(2.0 时代即有 129,186 项直接提交实验)。标注粒度为实验级:每条测定记录同时编码测定方法学(如"T cell assay - ELISPOT")、定量结果与单位、定性结局(positive/negative)、宿主与品系、MHC 限制等位基因、疾病情境与文献。与影像数据集的"像素级标注"不同,IEDB 的标注难点在上下文语义(如"该反应受 HLA-A*02:01 限制"的判定依据),其整理规程在方法学论文中公开(Vita et al. 2006, BMC Bioinformatics)。

§3.6 标注者资质与一致性

整理团队由免疫学专业背景的文献管理员组成,设科学整理与质量保证经理(Randi Vita 博士)统筹;核心团队挂靠 LJI,协作方包括 Leidos(工程)与 Knocean(本体/自由文本归一化)等。质量机制包括:整理规程透明化并随方法学论文发布;自由文本字段(年龄、数据位置)通过可复用规则工具做归一化(年龄字段 4,095 个原始取值经字符/词/短语三级规则归一,输出有效率 83.8%-99.97%,Duesing et al. 2024 预印本);用户研讨会与 help@iedb.org 反馈通道驱动错误修正。库内未见公开的标注者间 Kappa 系数,引用时应描述为"规程化人工整理"而非"双人独立标注"。

§3.7 采集周期

文献整理处于"始终最新"状态:以 2010 年底为界完成存量清零(此前文献回溯至 1952 年),此后每两周执行一次 PubMed 新文献查询并滚动入库。这意味着数据快照天然带时间戳——做时间切分(见 §5.2)时应以测定记录关联文献的发表日期为准,而非下载日期。

采集节奏对增量管线的启示:官方两周一次的整理节奏决定了本地镜像的最高合理同步频率;更频繁的同步不会获得新数据,只会增加无谓负载。推荐的增量策略是"每两周一次 reference_search 日期增量 → 新文献触发的 assay 增量拉取 → 追加写入带日期分区的本地表"。

§3.8 地域覆盖

文献来源覆盖全球主要免疫学研究地区(北美、欧洲、东亚为大头);宿主人群以实验研究中的健康供者、患者队列与模式动物为主,HLA 等位基因分布反映研究人群(欧洲裔高频等位基因如 HLA-A*02:01 显著超代表,见 §7.1)。数据位置(data-location)字段在历史上为自由文本(251,810 个不同取值),近年开始规则化归一。

§3.9 测定方法规格

测定大类 典型方法 定量类型 输出含义
MHC-I/II 结合 竞争结合、直接结合(荧光偏振等) IC50/KD(nM) 数值越小结合越强;库内以 500 nM 为 binder/non-binder 常用分界
MHC 配体洗脱 免疫肽组质谱(LC-MS/MS) 定性鉴定 + 频次 天然呈递证据;单篇文献可产出数千条配体
T 细胞测定 ELISPOT、ICS(胞内染色)、增殖、四聚体染色、细胞毒性 斑点数/%、SFU、定性 阳性/阴性 + 效应读出
B 细胞测定 ELISA、表面等离子共振、中和试验、流式 滴度/KD/定性 抗体识别与功能证据

方法异质性的建模含义:同一"结合"概念在 MHC-I 中可由竞争结合(参考肽置换)、直接结合(荧光标记)与稳定性测定(复合物解离半衰期)等不同实验给出,量纲与误差结构不同;中和试验与简单结合试验对 B 细胞表位的功能含义也完全不同。因此任何跨方法聚合都必须在特征中显式携带 assay_type/method,否则模型会把方法学差异误学为生物学差异。

§3.10 深度溯源链

每条测定记录可追溯至:文献(PubMed PMID + 参考文献明细)→ 宿主与供者情境(物种、品系、疾病状态)→ 测定方法与条件(方法名、单位、定量值)→ 表位结构(structure_id/IRI)→ 来源抗原(GenPept/UniProt 登录号 + 起止位置)→ MHC 等位基因(官方命名)。IQ-API 提供 TABLEX_to_TABLEY 映射端点与 curie_map 端点,将 PMID 等 CURIE 标识映射至完整 IRI,实现跨库(NCBITaxon、GENPEPT、UniProt)溯源(IQ-API 文档)。


§4 数据结构

§4.0 目录树

IEDB 无单一压缩包;以下为按推荐方式拉取后的本地工作目录组织示例(通过 IQ-API 导出 + 批量导出文件组合):

iedb_local/
├── raw/                              # 原始导出,只读
│   ├── epitope_export.csv            # IQ-API epitope_export(一行一表位结构)
│   ├── antigen_export.csv            # IQ-API antigen_export(一行一来源抗原)
│   ├── tcell_export.csv              # IQ-API tcell_export(一行一 T 细胞测定)
│   ├── bcell_export.csv              # IQ-API bcell_export(一行一 B 细胞测定)
│   ├── mhc_export.csv                # IQ-API mhc_export(一行一 MHC 测定)
│   ├── tcr_export.csv                # IQ-API tcr_export(受体相关测定)
│   ├── bcr_export.csv
│   ├── reference_export.csv          # 文献维度
│   ├── tcr_full_v3.xlsx              # 批量导出页 TCR 全表
│   ├── bcr_full_v3.xlsx              # 批量导出页 BCR 全表
│   └── airr_full.zip                 # AIRR Community 标准导出
├── maps/                             # 关联映射(IQ-API TABLEX_to_TABLEY 端点落盘)
│   ├── bcell_to_reference.csv
│   ├── tcell_to_reference.csv
│   └── curie_map.json
├── processed/                        # 清洗后建模表
│   ├── mhc_binding_explicit.csv      # 定量结合(统一单位、等位基因规范化)
│   ├── mhc_ligand_eluted.csv         # 洗脱配体(含等位基因归属标记)
│   ├── tcell_epitope_labels.csv      # T 细胞表位阳性/阴性
│   └── splits/                       # 防泄漏切分(见 §5)
│       ├── by_reference_time.csv
│       └── by_allele_group.csv
└── meta/
    └── api_metrics_snapshot.json     # 下载当日 api_metrics 快照(行数+构建日期)

各文件体量估计(帮助磁盘规划;随库增长需按 api_metrics 复核):

文件 行级体量 建议预留
epitope_export.csv 约 190 万行 1-2 GB
mhc_export.csv 约 577 万行 3-6 GB
bcell_export.csv 约 169 万行 1-3 GB
tcell_export.csv 约 58 万行 0.5-1 GB
tcr/bcr_full_v3.xlsx 受体配对记录 数百 MB
airr_full.zip 受体全量(AIRR 标准) 数 GB

说明:raw/ 内文件名与 IQ-API export 端点一一对应;data_root 即 iedb_local/,各加载脚本以 data_root / "raw" / "<endpoint>.csv" 拼接。最小可用子集为 epitope_export.csv + 任一 assay export。

§4.1 DAIMS 字段字典

以 IQ-API 核心端点为例(字段名与 Swagger 文档一致;完整字段清单见 https://query-api.iedb.org 的交互式文档):

字段(端点) 类型 说明 示例值 AI 用途 观测误差/注意 信息性缺失 取值范围/规模
structure_id(epitope_search) Integer 表位结构主键,对应 IRI IEDB_EPITOPE:* 58560 关联各类测定的外键 同一序列可因来源不同占多行 — 约 190 万
linear_sequence(epitope_search) Text 线性肽单字母序列 SIINFEKL 序列模型输入 仅线性表位有值;构象表位为残基集合 NULL=非线性/非肽 1-数十肽
structure_descriptions(epitope_search) Text[] 结构描述(可多条) [“SIINFEKL”] 展示/去重 JSON 数组,CSV 中为序列化文本 NULL 常见 —
curated_source_antigens(epitope_search) Object[] 来源抗原(登录号、名称、起止位置、物种 IRI) {“accession”: “AAA48998.1”, “starting_position”: 258} 抗原级特征、保守性 同表位可对多个抗原版本 可为 NULL —
assay_id(tcell_search 等) Integer 测定记录主键 — 样本级唯一键 跨表不可比 — 合计约 804 万
assay_response(各 assay 端点) Text 定性结局标签 positive / negative 分类标签 阈值依赖原文献 少数缺失 二分类
quantitative_value(mhc_search) Float 定量测定值 12.5 回归目标 单位不统一(nM/KD/滴度),必须与 unit 字段同读 大量为 NULL —
assay_units(mhc_search) Text 定量值单位 IC50 nM 单位归一化 混合单位是坑点 2 根源 — 多类
mhc_allele / restriction(mhc_search 等) Text MHC 限制等位基因(官方命名) HLA-A*02:01 分组键/特征 多等位基因研究可能无归属(坑点 4) 可缺 1,021 个
host_organism(各端点) Text 宿主物种(NCBITaxon 对齐) Homo sapiens 域适配/过滤 人/鼠混合,需分层 — 多物种
pmid(reference_search) Integer 文献 PubMed 编号 19906713 时间切分/去重 部分为直接提交无 PMID 可缺 27,040 篇
receptor_type(tcr/bcr_search) Text 受体链类型 TCR beta;BCR heavy 配对任务分层 仅近年测定含受体信息 大量缺失 α/β/γ/δ;重/κ/λ
cdr3(受体端点) Text CDR3 区氨基酸序列 CASSLGGQETQYF TCR 特异性核心特征 受体重建方法影响推断质量 可缺 10-25 肽
doi / citation(reference_search) Text 文献定位信息 10.1093/nar/gkp1004 溯源与时间切分 与 pmid 二选一常见 可缺 —

§4.2 标签分布

以 AI 视角理解三类"标签":

标签体系 类别 依据
测定结局 positive / negative(两类测定均有收录) 官方首页 Outcome 过滤器(Positive/Negative)
测定大类 T cell / B cell / MHC ligand 首页 Summary Metrics(577,219 / 1,689,461 / 5,770,822)
疾病情境 infectious / allergic / autoimmune / transplant 首页 Disease 过滤器

注意:MHC ligand assay 中定量结合数据的 binder/non-binder 二分并非 IEDB 原生标签字段,而是社区以 500 nM 阈值对定量值再加工的结果(见坑点 2)。

结局标签的语义边界:positive/negative 反映的是"该文献在该实验条件下报告的观测结论",不是"该表位在所有情境下的免疫学真值"。同一条肽可在 A 宿主为 positive、B 宿主为 negative,或因剂量/佐剂差异得出相反结局。因此以表位为样本聚合标签时,标签噪声天然存在——建议以 (表位, 等位基因, 宿主, 测定方法) 为最小一致单元再向上聚合。

§4.3 关键统计

  • 每表位平均测定数持续上升:2024 update 论文指出 assays per epitope 与 assays per publication 是 2010-2024 年最显著的增长维度(图 1A)。
  • MHC ligand assay 占三类实验的约 72%(5,770,822 / 8,037,502),为最大子集;单篇配体洗脱文献可贡献数千表位。
  • 文献-表位密度:27,040 篇文献承载约 190 万表位,均值约 70 表位/篇,但分布极度右偏(COVID 与洗脱类文献为长尾头部)。
  • SARS-CoV-2 相关文献量为 SARS-CoV-1 的 4.6 倍,体现选题事件驱动特征。
  • 等位基因-肽组合空间:1,021 个限制性等位基因 × 190 万表位,但组合呈幂律分布——头部等位基因(如 HLA-A*02:01)贡献了不成比例的测定量。
  • 历史里程碑口径(用于趋势引用):2004-2012 年整理约 16,000 篇文献、704,000+ 实验、120,000+ 表位;截至 2019-01 收录超 535,000 表位(LJI Immune Matters)。

§4.4 数据层级

Reference(文献, PMID)
 └── Host(宿主物种/品系/疾病情境)
      └── Assay(测定记录:T cell / B cell / MHC ligand)
           ├── Assay 细节:方法、定量值+单位、结局
           ├── MHC 限制(等位基因,1,021 个)
           └── Receptor(可选:TCR/BCR 链与 CDR3 序列)
                └── Epitope Structure(表位 structure_id,IRI)
                     └── Source Antigen(来源抗原:登录号+起止位置)
                          └── Source Organism(NCBITaxon,4,816 种)

§4.5 缺失值与信息性缺失

情形 表现 处理建议
定量值缺失(定性测定) quantitative_value 为 NULL,仅 assay_response 有值 按定性标签建模,勿插补数值
MHC 等位基因无归属 多等位基因 MS 研究缺 HLA 分型(近 40% 天然处理配体,见坑点 4) 单独标记 multi_allelic_unknown,勿随机分配
非肽表位 linear_sequence 为 NULL 以非肽分类层级(2021 简化体系)编码
受体序列缺失 早期测定无 TCR/BCR 数据 仅受体子集可用于配对建模
自由文本未归一 年龄/位置字段历史取值碎片化(年龄 4,095 个原始取值) 使用归一化规则或仅做存在性特征

这些 NULL 多为"信息性缺失"(定性测定天然无数值;多等位基因研究天然无单等位基因归属),直接删除行会引入选择偏倚,应显式编码缺失类别。

缺失率随层递增的规律(供管线设计参考):表位层字段完整度最高(结构定义是必填语义);测定层中等(定量值依赖测定类型);受体层最低(受体测序是近年才普及的技术)。因此分层建模时,越往上层走样本越多但特征越少,越往下层走特征越丰富但样本越少——按任务需求选择工作层级比"全字段大宽表"更务实。


§5 划分与使用建议

§5.1 官方与社区惯例划分

IEDB 不提供官方 train/val/test 划分。社区存在两种成熟惯例:

  1. 时间切分(time-split,最主流):以预测器发表日期为界,取其后入库的测定数据作为无泄漏测试集。NetMHCpan 评测即采用"训练数据之后释放的 IEDB 数据"构造 EvaluationSet 的方式;该方式的隐含假设是文献入库时间与测定完成时间相近。
  2. 等位基因/来源切分(allele-out split):按 MHC 等位基因或来源病原分组,测试组等位基因在训练中完全不可见,用于评估 pan-specific 泛化能力(如 NetMHCpan-4.0 的 IEDB T 细胞表位验证集覆盖 80 个 HLA,其中仅部分与训练等位基因重叠,见坑点 1)。

§5.2 划分策略建议

  • 以 reference 发表日期为准做时间切分,并在文档中固定切分日期(如"训练 ≤2019-12,测试 2020-01 之后"),保证可复现。
  • 先按 (epitope, allele, host) 分组去重再切分:同一表位会在多篇文献、多次测定中重复出现,直接随机切分会造成组间泄漏(见坑点 5)。
  • 保留 multi_allelic_unknown 子集为独立评估层,不与单等位基因数据混合训练。
  • 人类宿主与小鼠宿主分层:跨物种直接混合会稀释人类转化相关性。

参考实现(时间 × 组键双约束切分):

# 防泄漏切分:先按文献日期分箱,再在每箱内按 (structure, allele, host) 组整体分配
# 输入: processed/mhc_binding_explicit.csv(§6.3 产出,需含 reference_year 列)
import pandas as pd, numpy as np
from sklearn.model_selection import GroupShuffleSplit

df = pd.read_csv("iedb_local/processed/mhc_binding_explicit.csv")
df["reference_year"] = df["reference_year"].fillna(2026).astype(int)

train_mask = df["reference_year"] <= 2019          # 时间约束:2020 前入训练
train_pool, test_pool = df[train_mask], df[~train_mask]

group_col = ["linear_sequence", "mhc_allele", "host_organism_name"]
train_pool = train_pool.assign(g=train_pool[group_col].agg("|".join, axis=1))
gss = GroupShuffleSplit(n_splits=1, test_size=0.1, random_state=42)
tr_idx, va_idx = next(gss.split(train_pool, groups=train_pool["g"]))
train_pool.iloc[tr_idx].drop(columns="g").to_csv("iedb_local/processed/splits/train.csv", index=False)
train_pool.iloc[va_idx].drop(columns="g").to_csv("iedb_local/processed/splits/val.csv", index=False)
test_pool.to_csv("iedb_local/processed/splits/test.csv", index=False)
print({k: len(v) for k, v in {"train": tr_idx, "val": va_idx, "test": test_pool}.items()})

§5.3 泄漏风险清单

泄漏源 机制 缓解
预测器训练集重叠 NetMHCpan/NetMHCIIpan 等以 IEDB 为训练源 评测前比对方法训练数据 cutoff,剔除重叠或按日期切分
同表位跨文献重复 免疫优势表位被反复测定 按 structure_id(或序列+等位基因)分组划分
洗脱-绑定互证 配体洗脱阳性与结合测定高度相关 同源蛋白/肽集合整体置于同侧
COVID 事件驱动聚集 同期文献测定条件同质 时间切分 + 文献级 ClusterFold

§5.4 交叉验证建议

推荐 GroupKFold(组键 = structure_id × allele × host)5 折;若关注等位基因长尾,另做"低频等位基因 leave-allele-out"评估。报告指标时同时给出 AUC 与按真实先验(binder 约 1-2%)重采样的 PRC(见坑点 3)。

# 低频等位基因 leave-allele-out:检验 pan-specific 外推能力
# 规则: 仅对测定数低于分位阈值的等位基因轮流整体留出
import pandas as pd, numpy as np
from sklearn.model_selection import cross_val_score  # 伪代码框架,训练函数需自行接入

df = pd.read_csv("iedb_local/processed/mhc_binding_explicit.csv")
allele_counts = df["mhc_allele"].value_counts()
low_freq_alleles = allele_counts[allele_counts < allele_counts.quantile(0.25)].index
for allele in low_freq_alleles[:10]:               # 示例:前 10 个低频等位基因
    held_out = df[df["mhc_allele"] == allele]      # 完全不见于训练
    rest = df[df["mhc_allele"] != allele]
    # train(rest) -> predict(held_out) -> roc_auc_score(held_out.label, pred)
    print(f"hold out {allele}: train={len(rest)} test={len(held_out)}")

§5.5 外部验证建议

以 CEDAR(肿瘤情境)与 VDJdb(TCR 特异性)作为跨域外部验证集;配体洗脱模型可用独立发表的免疫肽组数据(mono-allelic 细胞系来源优先)验证。跨库验证时注意表位定义与命名差异(IEDB 用官方 HLA 命名与 IRI 体系)。


§6 AI 就绪指南

§6.0 云端快速启动

IEDB 无需注册与密钥,任何可访问公网的云主机均可直接启动。最小环境:Python 3.10+、pandas、requests。以下命令在全新 Linux 环境约 1 分钟内可完成首个数据拉取:

# 在任意云主机/本地终端执行:拉取前 10 条表位记录验证连通性
curl 'https://query-api.iedb.org/epitope_search?limit=10' | head -c 2000
# CSV 版本(便于直接入 pandas)
curl 'https://query-api.iedb.org/epitope_search?limit=10' -H "accept: text/csv" | head -5

云上建议:数据获取阶段仅需 CPU 型实例;批量导出(§6.2 路径 A)期间保证出站带宽 ≥10 Mbps 即可在数小时内完成全部 assay 端点镜像。预测工具调用若规模大(万级以上肽 × 等位基因组合),优先申请官方虚拟机镜像本地部署,避免对公共服务造成压力。

§6.1 快速上手

代码前置说明:目录结构预期为 §4.0 的 iedb_local/(本节仅在线查询,不落盘);不涉及 data_root 拼接;最小可用子集为 epitope_search 端点——只查表位层即可完成序列检索原型验证。

# 快速上手:用 requests 查询 IQ-API,找 ovalbumin 经典表位 SIINFEKL
# 依赖: pip install requests
import requests

url = "https://query-api.iedb.org/epitope_search"
params = {
    "linear_sequence": "eq.SIINFEKL",   # PostgREST 精确匹配语法
    "select": "structure_id,structure_descriptions,curated_source_antigens",
}
r = requests.get(url, params=params, timeout=60)
r.raise_for_status()
records = r.json()
assert records, "查询无结果——检查序列写法(单字母编码)"
for rec in records:
    print(rec["structure_id"], rec["structure_descriptions"])
# 预期:返回 ovalbumin 257-264 位 H-2Kb 限制表位及其来源抗原信息

PostgREST 常用过滤语法速查(配合 search 端点):

# 1) 模糊匹配:结构描述含 IL- 前缀(like 操作符)
curl 'https://query-api.iedb.org/epitope_search?structure_descriptions=like.IL-*&limit=5' | jq '.[].structure_id'
# 2) 多条件 AND:线性序列以 KL 结尾且描述非空
curl 'https://query-api.iedb.org/epitope_search?linear_sequence=like.*KL&structure_descriptions=not.is.null&limit=5'
# 3) 列裁剪 + 排序
curl 'https://query-api.iedb.org/epitope_search?select=structure_id,linear_sequence&order=structure_id.desc&limit=5'
# 4) 资源嵌入(search 表关联 reference 信息,减少往返)
curl 'https://query-api.iedb.org/tcell_search?select=assay_id,reference_id&limit=5'

§6.2 数据获取

路径 A:IQ-API(推荐,结构化、可增量)。 基于 PostgREST,查询语法为 字段=操作符.值;search 端点便于过滤,export 端点与网页导出同构(官方教程帖)。

# 分片拉取全量 MHC 测定导出到本地 CSV(约 570 万行,务必分页)
# 依赖: pip install requests pandas
import requests, pandas as pd, time
from pathlib import Path

data_root = Path("iedb_local/raw"); data_root.mkdir(parents=True, exist_ok=True)
BASE = "https://query-api.iedb.org/mhc_export"
SELECT = ("assay_id,reference_id,mhc_allele,assay_type,assay_group,"
          "assay_response,quantitative_value,assay_units,host_organism_name")

def fetch_range(offset: int, limit: int = 5000) -> pd.DataFrame:
    # PostgREST 推荐用 Range 头分页,limit/offset 亦可
    r = requests.get(
        BASE,
        params={"select": SELECT, "limit": limit, "offset": offset},
        headers={"accept": "text/csv"},
        timeout=300,
    )
    r.raise_for_status()
    from io import StringIO
    return pd.read_csv(StringIO(r.text))

offset, chunks = 0, []
while True:
    df = fetch_range(offset)
    if df.empty:
        break
    chunks.append(df); offset += len(df)
    print(f"fetched {offset} rows"); time.sleep(1)   # 礼貌限速
full = pd.concat(chunks, ignore_index=True)
full.to_csv(data_root / "mhc_export.csv", index=False)
print(full.shape)

路径 B:批量导出文件(受体序列/全库快照)。 访问 https://www.iedb.org/database_export_v3.php 下载 tcr_full_v3.xlsx、bcr_full_v3.xlsx 与 airr_full.zip;适合一次性本地化。

# 受体批量导出的读取与展平(TCR-表位配对建模起点)
# 目录预期: iedb_local/raw/tcr_full_v3.xlsx(路径 B 手动下载)
import pandas as pd

xlsx = "iedb_local/raw/tcr_full_v3.xlsx"
xl = pd.ExcelFile(xlsx)
print(xl.sheet_names)                     # 先查看 sheet 结构
tcr = xl.parse(xl.sheet_names[0])
print(tcr.columns.tolist())               # 核对官方列名后再引用,避免硬编码字段
# 找到含 CDR3 与表位序列的列(列名以官方导出为准)
cdr3_cols = [c for c in tcr.columns if "cdr3" in c.lower()]
seq_cols = [c for c in tcr.columns if "linear_sequence" in c.lower() or "epitope" in c.lower()]
print("CDR3 列:", cdr3_cols, "表位列:", seq_cols)
if cdr3_cols and seq_cols:
    paired = tcr.dropna(subset=cdr3_cols[:1] + seq_cols[:1])
    print(f"配对记录数: {len(paired)}")

路径 C:预测工具 REST API(在线推理而非数据获取)。

# MHC-I 结合预测(method 可选 recommended/netmhcpan-4.1/smm 等)
curl --data "method=recommended&sequence_text=SLYNTVATLYCVHQRIDV&allele=HLA-A*01:01&length=9" \
     https://tools-cluster-interface.iedb.org/tools_api/mhci/

申请流程:无。网页、API 与导出均开放访问;仅预测工具的可下载版本商用需付费许可(教育/研究免费)。

§6.3 预处理全流程

# IEDB MHC 结合数据 → 建模就绪表
# 目录预期: data_root=iedb_local/,输入 raw/mhc_export.csv(§6.2 路径 A 产出)
# 最小可用子集: 定量结合测定(有 IC50/KD 值且单位为 nM 的行)
import pandas as pd, numpy as np, re
from pathlib import Path

data_root = Path("iedb_local")
df = pd.read_csv(data_root / "raw" / "mhc_export.csv", low_memory=False)

# 1) 只保留定量结合数据,统一单位为 nM
df = df[df["quantitative_value"].notna()].copy()
df = df[df["assay_units"].astype(str).str.contains("nM", case=False, na=False)]
df["value_nm"] = pd.to_numeric(df["quantitative_value"], errors="coerce")
df = df[df["value_nm"].notna()]

# 2) 等位基因规范化(IEDB 已用官方命名;此处统一两位组别字段)
def allele_group(a: str) -> str:
    m = re.match(r"(HLA-[ABC])\*(\d{2})", str(a))
    return f"{m.group(1)}*{m.group(2)}" if m else "other"
df["allele_group"] = df["mhc_allele"].map(allele_group)

# 3) 标签:500 nM 阈值 + 中间带显式隔离(见坑点 2)
df["label"] = np.where(df["value_nm"] < 50, 1,
              np.where(df["value_nm"] > 500, 0, np.nan))  # 50-500 nM 为中间带
df_mid = df[df["label"].isna()]; df = df.dropna(subset=["label"]); df["label"] = df["label"].astype(int)

# 4) 去重:同 (structure, allele, host) 多次测定取中位数
#    需关联表位序列:从 epitope_export 建立映射
ep = pd.read_csv(data_root / "raw" / "epitope_export.csv", low_memory=False)
ep_map = ep.dropna(subset=["linear_sequence"]).drop_duplicates("structure_id")[
    ["structure_id", "linear_sequence"]]
# mhc_export 若含 structure_id 列则直接合并(以 Swagger 文档实际字段为准)
if "structure_id" in df.columns:
    df = df.merge(ep_map, on="structure_id", how="inner")
    df = (df.groupby(["linear_sequence", "mhc_allele", "host_organism_name"], as_index=False)
            .agg(value_nm=("value_nm", "median"), label=("label", "median"),
                 n_assays=("assay_id", "count")))
    df["label"] = (df["value_nm"] < 500).astype(int)   # 合并后按中位数重打标签

# 5) 负类重采样说明:保留原始比例,训练时再按真实先验加权(见坑点 3)
out = data_root / "processed"; out.mkdir(parents=True, exist_ok=True)
df.to_csv(out / "mhc_binding_explicit.csv", index=False)
print(df["label"].value_counts(normalize=True))

§6.4 PyTorch DataLoader 完整示例

任务范式:给定(肽序列,HLA 等位基因),预测是否为结合肽/免疫原肽。等位基因侧采用 NetMHCpan 风格伪序列(pseudo-sequence)编码思路,把等位基因映射为固定长度氨基酸嵌入通道。

# PyTorch Dataset + DataLoader:MHC 结合二分类
# 目录预期: data_root=iedb_local/,输入 processed/mhc_binding_explicit.csv(§6.3 产出)
# 最小可用子集: 同时具备 linear_sequence 与 mhc_allele 的行
import numpy as np, pandas as pd, torch
from torch.utils.data import Dataset, DataLoader
from pathlib import Path

AA = "ACDEFGHIKLMNPQRSTVWY"
AA2IDX = {a: i + 1 for i, a in enumerate(AA)}          # 0 = pad
PEP_LEN = 15                                            # 肽最大长度(MHC-II 需更长可调)
PSEUDO_LEN = 34                                         # HLA 伪序列常用口袋残基长度

def encode_peptide(seq: str, max_len: int = PEP_LEN) -> np.ndarray:
    ids = [AA2IDX.get(a, 0) for a in seq[:max_len]]
    return np.array(ids + [0] * (max_len - len(ids)), dtype=np.int64)

def encode_pseudo(allele: str, pseudo_table: dict) -> np.ndarray:
    # pseudo_table: 等位基因 -> 34 位口袋残基串(可从 NetMHCpan 附件或自建映射获得)
    seq = pseudo_table.get(allele, "-" * PSEUDO_LEN)
    return np.array([AA2IDX.get(a, 0) for a in seq[:PSEUDO_LEN]], dtype=np.int64)

class MhcBindingDataset(Dataset):
    """一行一样本:肽序列 + 等位基因伪序列 → binder 标签"""
    def __init__(self, csv_path: Path, pseudo_table: dict):
        df = pd.read_csv(csv_path)
        df = df.dropna(subset=["linear_sequence", "mhc_allele"])
        self.peptides = [encode_peptide(s) for s in df["linear_sequence"]]
        self.pseudos = [encode_pseudo(a, pseudo_table) for a in df["mhc_allele"]]
        self.labels = torch.tensor(df["label"].values, dtype=torch.float32)

    def __len__(self): return len(self.labels)

    def __getitem__(self, idx):
        return (torch.from_numpy(self.peptides[idx]),
                torch.from_numpy(self.pseudos[idx]),
                self.labels[idx])

if __name__ == "__main__":
    data_root = Path("iedb_local")
    ds = MhcBindingDataset(data_root / "processed" / "mhc_binding_explicit.csv",
                           pseudo_table={})   # 传入自建等位基因→伪序列映射
    # 类别不平衡:用加权采样而非改数据
    labels = ds.labels.numpy()
    w_pos, w_neg = 1.0 / max(labels.mean(), 1e-6), 1.0 / max(1 - labels.mean(), 1e-6)
    weights = np.where(labels == 1, w_pos, w_neg)
    sampler = torch.utils.data.WeightedRandomSampler(weights, num_samples=len(ds))
    loader = DataLoader(ds, batch_size=256, sampler=sampler,
                        num_workers=4, pin_memory=True)
    for pep, ps, y in loader:      # 迭代一次验证形状
        print(pep.shape, ps.shape, y.shape); break

配套的最小模型与训练循环骨架(可直接接上方的 loader):

# 双嵌入 + 余弦打分头的极简模型(示意基线,非 SOTA 复刻)
import torch, torch.nn as nn

class TwoTowerMhc(nn.Module):
    def __init__(self, vocab=21, d=128, pep_len=15, pseudo_len=34):
        super().__init__()
        self.emb = nn.Embedding(vocab, d, padding_idx=0)
        self.pep_cnn = nn.Conv1d(d, d, kernel_size=3, padding=1)
        self.ps_cnn = nn.Conv1d(d, d, kernel_size=3, padding=1)
        self.head = nn.Sequential(nn.Linear(2 * d, 64), nn.ReLU(), nn.Linear(64, 1))

    def encode(self, x, cnn):
        h = self.emb(x).transpose(1, 2)            # B x d x L
        return cnn(h).max(dim=2).values            # B x d

    def forward(self, pep, pseudo):
        hp = self.encode(pep, self.pep_cnn)
        hs = self.encode(pseudo, self.ps_cnn)
        return self.head(torch.cat([hp, hs], dim=1)).squeeze(-1)

model = TwoTowerMhc()
loss_fn = nn.BCEWithLogitsLoss()
opt = torch.optim.AdamW(model.parameters(), lr=3e-4)
for epoch in range(3):                             # 演示 3 epoch
    for pep, ps, y in loader:
        opt.zero_grad()
        loss = loss_fn(model(pep, ps), y)
        loss.backward(); opt.step()
    print(f"epoch {epoch} loss={loss.item():.4f}")

变换与增强说明:序列任务不做几何增强;安全的"增强"是同表位多测定聚合(中位数)与随机 mask 一个残基的正则(需谨慎,见 §6.6)。

§6.5 坑点清单

⚠️ 坑点 1:直接从 IEDB 抽数据评测 MHC 预测器,结果与预测器训练集重叠导致虚高(分类:数据泄漏)

问题:NetMHCpan、NetMHCIIpan、MHCflurry 等主流预测器直接以 IEDB 历史数据训练;若从 IEDB 随机抽数据为它们"打分",其中大量样本在训练时已见过。NetMHCpan-4.0 论文的 IEDB T 细胞表位验证集中,80 个 HLA 有 37 个已出现在配体洗脱训练数据、64 个出现在加入结合数据后——重叠是普遍现象而非例外。
症状:自家评测 AUC 接近 0.95+ 并显著高于论文报告值;对"新"等位基因的性能断崖式下跌。
解决:

  1. 简单方法:按文献日期切分——以所用预测器论文发表日期为 cutoff,只用其后入库的测定数据做评测。
  2. 进阶方法:显式排除法,如早期基准研究所做——剔除与预测方法同源团队提交的数据后重算(曾将 6,533 条测量修正为 5,137 条的独立集)。
  3. SOTA 方法:对每个测试样本维护 (epitope, allele) 键,与预测器官方发布的训练集清单(如 NetMHCpan 附带训练数据文件)做哈希比对后剔除,并报告剔除前后双版本指标。
    参考:NetMHCpan-4.0 论文(训练/验证重叠说明);Pan-specific predictors benchmark, Bioinformatics 2009

⚠️ 坑点 2:500 nM 阈值直接二分,中间亲和力带污染标签(分类:标签理解)

问题:社区惯例以 500 nM 作为 binder/non-binder 分界,但 50-1000 nM 的中间带测量受实验误差影响大,且不同文献对"强/弱结合"口径不一。研究已表明剔除中间带(50-1000 nM)可系统性提升评测稳定性。
症状:模型在重复实验上的标签自相矛盾(同肽同等位基因一行 positive 一行 negative);训练曲线震荡、AUC 方差大。
解决:

  1. 简单方法:过滤 assay_units 统一为 nM,仅保留 <50 nM(强结合)与 >500 nM(非结合)两端样本。
  2. 进阶方法:保留定量值做回归(以 log50k 缩放,即 NetMHCpan 惯例),分类指标在推理时才按阈值导出。
  3. SOTA 方法:三级标签(binder/intermediate/non-binder)+ 有序回归,或在损失中按测定误差加权。
    参考:Predicting MHC class I epitopes in large datasets

⚠️ 坑点 3:数据分布 ≠ 免疫组真实分布——病毒、高频 HLA 与 50% binder 偏倚(分类:偏倚陷阱)

问题:IEDB 内容镜像文献选题:病毒与高频等位基因(HLA-A*02:01 等)严重超代表,早期 NetMHC 以 IEDB 病毒抗原训练导致对病毒样表位的先验偏好;同时定量结合数据集中 binder 约占 50%,而随机肽真实 binder 率约 1-2%。
症状:在真实全蛋白扫描场景查准率远低于 IEDB 内部评测;对低频等位基因与肿瘤抗原预测系统性劣于高频等位基因。
解决:

  1. 简单方法:评测时报告按真实先验重采样的 PRC/AUPRC,不只看 AUC。
  2. 进阶方法:训练集按等位基因与病原门类做分层下采样;按宿主=人类过滤提升转化相关性。
  3. SOTA 方法:将 HLA 群体频率作为先验融入人群覆盖工具(IEDB-AR 自带 Population Coverage)做候选排序,而非裸模型打分。
    参考:Neoantigen prediction bias 综述, Front Immunol 2020;Pan-specific benchmark

⚠️ 坑点 4:多等位基因质谱配体缺 HLA 归属,不能直接用于等位基因特异性训练(分类:预处理陷阱)

问题:天然处理配体多来自多等位基因细胞系/患者材料,需解卷积才能归属到具体 HLA;IEDB 中近 40% 的多等位基因研究来源 HLA-I 天然配体缺乏等位基因归属(缺分型或无法解卷积)。
症状:给这些配体随机分配等位基因后,模型对特定等位基因的 motif 学到噪声;洗脱预测器评测出现人为失败。
解决:

  1. 简单方法:过滤保留具备 mhc_allele 的行,其余显式标为 multi_allelic_unknown 单独统计。
  2. 进阶方法:用结合预测器做多假设标签(soft label over expressed alleles)训练。
  3. SOTA 方法:仿 NetMHCIIpan-4.0 的 motif 解卷积思路,利用大配体集与已知 motif 做期望最大化归属后再入库训练。
    参考:MS 与蛋白质组学对 HLA 表位预测的推进

⚠️ 坑点 5:同表位跨文献重复 + MHC 配体爆发式增长,随机切分必然泄漏(分类:数据泄漏)

问题:免疫优势表位(如流感 M1、HIV 共识表位)在数十篇文献中反复测定;MHC ligand elution 文献单篇贡献数千表位且同一肽可从多个 MHC 洗脱。按行随机切分会让"同肽同等位基因"同时出现在训练与测试。
症状:评测指标好但跨文献泛化差;时间维度上 2020 年后数据主导模型,旧病原表现骤降。
解决:

  1. 简单方法:以 structure_id + mhc_allele 为组键做 GroupShuffleSplit。
  2. 进阶方法:以文献(reference_id)为组键做 ClusterFold,杜绝同文献上下文(同供者、同实验设置)跨折。
  3. SOTA 方法:双约束切分(时间 × 组键)+ 对 MHC 配体子集单独报告按 publication 聚合的指标。
    参考:IEDB 2024 update 数据增长分析

⚠️ 坑点 6:IQ-API 百万行级导出被限流/超时,CSV 嵌套数组字段解析报错(分类:工程陷阱)

问题:PostgREST 端点对超深 offset 分页性能下降,一次性拉取 mhc_export(570 万行)易超时;JSON 返回中 curated_source_antigens、structure_descriptions 为嵌套数组,naive pd.DataFrame(r.json()) 会产生对象列。
症状:请求 504/连接重置;CSV 中出现 "[{""accession"":...}]" 形式的双重引号字段,直接 read_csv 列错位。
解决:

  1. 简单方法:limit/offset 分片(每片 ≤5,000 行)+ 请求间 sleep 限速,失败指数退避重试。
  2. 进阶方法:用 PostgREST Range 头分页;select 仅取所需列降低负载;CSV 先以 keep_default_na=False 读入再 json.loads 展开嵌套列。
  3. SOTA 方法:官方 api_metrics 端点先取当日行数与构建日期做断点续传(offset 状态持久化),下载后校验行数一致才入库。
    参考:IQ-API 官方文档帖

⚠️ 坑点 7:自由文本字段与多版本抗原命名不一致,统计前必须归一(分类:工程陷阱)

问题:年龄字段曾有 4,095 个不同原始取值、数据位置字段 251,810 个取值;同一抗原存在多个登录号版本与同义词,直接 groupby 会碎片化统计。
症状:按"宿主年龄"分层时出现 “60”、“60 y”、“60-year” 多行;抗原级聚合数量虚高。
解决:

  1. 简单方法:仅使用 API 返回的结构化字段(如 source_organism_iri、NCBITaxon IRI),忽略自由文本列。
  2. 进阶方法:套用官方归一化思路(字符级→词级→短语级规则)预清洗,规则可从其归一化论文复现。
  3. SOTA 方法:以 Protein Tree 的 UniProt 同义词与 IUIS 过敏原官方命名为准做抗原实体链接。
    参考:IEDB 2024 update(Protein Tree/Antigen Summary);自由文本归一化预印本

⚠️ 坑点 8:线性/不连续/非肽表位混在同一表位层,按序列 tokenize 会错(分类:预处理陷阱)

问题:epitope 层同时含线性肽、不连续(构象)表位与非肽分子;不连续表位与部分非肽表位没有 linear_sequence。对全表位层做序列编码或"去重统计"时,构象表位会被静默丢弃或被其描述文本污染。
症状:B 细胞表位统计行数对不上官方 190 万口径;序列模型训练集混入空字符串样本。
解决:

  1. 简单方法:建模前按 linear_sequence 非空过滤,并对非肽表位(3,412 个)单列统计。
  2. 进阶方法:不连续表位以残基集合特征(抗原内的位置集合)单独编码,或仅取其已知线性成分。
  3. SOTA 方法:B 细胞构象表位任务改用结构输入(IEDB 提供 3D 查看器与结构关联),配合结构输入型预测器(如官方 B Cell Epitope Prediction - Structure Input)。
    参考:IEDB 首页表位结构过滤器(Linear/Discontinuous/Non-peptidic);非肽分类论文, Database 2021

§6.6 数据增强(安全/危险)

做法 判定 说明
同表位多测定聚合(中位数/分位特征) ✅ 安全 降噪且不改变分布假设
残基级随机 mask(低概率) ✅ 安全 类似 BERT 正则,等位基因侧勿 mask
HLA 等位基因伪序列口袋随机突变 ❌ 危险 破坏 motif 语义,等位基因是分组键不是可增广对象
随机 peptide shuffle 造负样本 ❌ 危险 破坏蛋白酶体加工信号,负类分布失真
跨物种表位直接迁移训练(鼠→人) ⚠️ 慎用 需以宿主 token 显式条件化

§6.7 模型推荐表

任务 推荐架构 输入 备注
MHC-I 结合/洗脱预测 CNN/Transformer 双塔(肽 + 伪序列) 肽序列 + HLA 伪序列 NetMHCpan-4.1 为强基线,务必防泄漏(坑点 1)
MHC-II 结合 变长肽 + 位移容忍编码 肽 + 等位基因 结合沟开放,注册位移是关键设计点
T 细胞免疫原性 打分头 + 人群覆盖后处理 表位集 + 人群 HLA 频率 可直接对比 IEDB-AR CD4episcore(AUC 约 0.70)
TCR-表位特异性 CDR3 + 表位双塔匹配 CDR3β + 肽 与 VDJdb 联合训练效果更稳
B 细胞构象表位 结构图神经网络 抗原 3D 结构/模型 线性序列法在此任务天花板低

§6.8 硬件需求表

阶段 配置 说明
数据拉取与清洗 4 核 CPU / 16 GB RAM / 100 GB 磁盘 全量 CSV + 中间展开表即可
中等规模训练(<10⁷ 样本) 1×24 GB GPU(如 RTX 4090/A10) 双塔小模型即可收敛
大规模/预训练式训练 4×A100 80 GB 混合精度 + 分桶按肽长
在线预测服务 CPU 即可(调用官方 REST API) 建议直接用官方 API 而非自建推理

§6.9 评估指标代码

# IEDB 建模常用指标:AUC + 真实先验重采样 AUPRC + 按等位基因分层的宏观 AUC
# 输入: y_true(0/1), y_score(连续), allele(数组)
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score

def iedb_report(y_true, y_score, allele, real_prior: float = 0.02, seed: int = 0):
    y_true, y_score = np.asarray(y_true), np.asarray(y_score)
    out = {"auc": roc_auc_score(y_true, y_score)}
    # 1) 按真实 binder 先验(默认 2%)重采样后算 AUPRC
    rng = np.random.default_rng(seed)
    pos = np.where(y_true == 1)[0]
    neg = np.where(y_true == 0)[0]
    n_neg_keep = int(len(pos) * (1 - real_prior) / real_prior)
    keep_neg = rng.choice(neg, size=min(n_neg_keep, len(neg)), replace=False)
    idx = np.concatenate([pos, keep_neg])
    out["auprc_real_prior"] = average_precision_score(y_true[idx], y_score[idx])
    # 2) 等位基因分层宏观 AUC(每组至少 20 正/负)
    per = []
    for a in np.unique(allele):
        m = allele == a
        if y_true[m].sum() >= 20 and (1 - y_true[m]).sum() >= 20:
            per.append(roc_auc_score(y_true[m], y_score[m]))
    out["macro_auc_by_allele"] = float(np.mean(per)) if per else np.nan
    out["n_alleles_evaluated"] = len(per)
    return out

时间切分评测协议的最小实现(冻结测试集、防泄漏的最后一道闸):

# 用 reference 发表年份构造冻结测试集;评测集一经生成不得再动
import pandas as pd
from sklearn.metrics import roc_auc_score

df = pd.read_csv("iedb_local/processed/mhc_binding_explicit.csv")
df["reference_year"] = df["reference_year"].fillna(2026).astype(int)
cutoff = 2021                                      # 与所用基线论文年份对齐(坑点 1)
train = df[df["reference_year"] < cutoff]
test  = df[df["reference_year"] >= cutoff].drop_duplicates(
    subset=["linear_sequence", "mhc_allele"])      # 组键去重(坑点 5)
# model.fit(train) 后:
# auc = roc_auc_score(test["label"], model.predict_proba(test)[:, 1])
print(f"train rows: {len(train)}, frozen test rows: {len(test)}, cutoff: {cutoff}")

§6.10 MLOps 笔记

  • 数据版本化:IEDB 滚动更新,落盘时必须保存 api_metrics 快照(行数 + build 日期)与导出时间戳;训练配置引用快照而非"最新数据"。
  • 增量同步:以两周一次的官方整理节奏为参照,用 reference_search 按日期增量拉取新文献数据,避免全量重导。
  • 可复现性:伪序列映射表、等位基因规范化脚本与切分日期一并入库版本控制;评测集冻结为不可变 parquet。
  • 漂移监控:线上表位预测服务按季度与 IEDB 新增数据回评,关注新病原(事件驱动)造成的输入分布突变(参照 SARS-CoV-2 4.6 倍文献激增的先例)。
  • 合规:输出预测结果时注明数据来源 IEDB 与其 NIAID 资助背景;商用嵌入其预测工具需另行获得许可。

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 严重程度 缓解措施
文献选题偏倚 数据反映已发表研究(病毒/HIV/流感/COVID 超代表;SARS-CoV-2 文献为 CoV-1 的 4.6 倍),非免疫组真实分布 高 分层评测;按病原/疾病情境分别报告
等位基因偏倚 高频 HLA(A*02:01 等)测定数据密集,1,021 个等位基因长尾稀疏;早期预测器对高频等位基因更好 高 leave-allele-out 评测;人群覆盖工具校正排序
阳性/实验设计偏倚 候选肽常按既有预测工具挑选后实验验证(循环放大既有工具偏好);binder 约 50% vs 真实 1-2% 高 排除方法学同源团队数据做敏感性分析;报告真实先验 PRC
等位基因归属缺失 多等位基因 MS 配体近 40% 无归属 中 显式 multi_allelic_unknown 标记;mono-allelic 子集单独建模
增长结构偏倚 MHC ligand assay 占比约 72% 且增长最快,挤压 T/B 细胞测定相对占比 中 按测定大类分层抽样与报告
自由文本碎片化 年龄/位置历史取值未归一 低 用结构化 IRI 字段;官方归一化规则

§7.2 标注质量

整理规程公开透明(2006 年方法学论文起持续发布),以 2.0 时代评估计,感染性疾病肽表位公开信息覆盖率约 99%、过敏原约 93%,这在人工整理型数据库中属最高档。质量控制由专职 QA 经理负责,自由文本归一化引入了可复现的规则工具(输出有效率 83.8%-99.97%)。局限:无公开的标注者间一致性系数;实验上下文(如 MHC 限制的判定强度)依赖原文献报告质量,原始文献的方法学缺陷会被继承。

§7.3 泛化性

场景 失效风险 证据
低频/罕见 HLA 等位基因预测 高——训练数据稀疏,pan-specific 外推依赖相近等位基因 NetMHCpan 验证集中仅部分 HLA 有训练覆盖(37/80 EL、64/80 加 BA)
肿瘤新抗原(非病毒抗原) 中——病毒先验偏好 + MS 检测偏倚 Front Immunol 2020 偏倚分析
MHC-II 任务整体 高——结合沟开放、肽长可变,精度低于 MHC-I 同上述综述(Class II 预测公认更难)
人群层面免疫原性 中——结合≠免疫原,免疫原性打分 AUC 约 0.70 CD4episcore 验证(57 项研究、2,000+ 肽、1,600+ 供者)
新发病原冷启动 低风险(工具可即时扫描)但数据支撑弱——需依赖近源物种数据 IEDB-AR 预测工具设计目标即冷启动

§7.4 伦理

IEDB 为文献衍生、去标识化的科学数据库,不含个体可识别信息;宿主/供者上下文以聚合形式存在且已随原始发表脱敏。使用其数据进行模型训练不涉及新的人类受试者活动,但仍应遵守原始文献与数据库的使用声明;涉及免疫分型与疫苗优化的下游应用需自行通过所在机构的伦理审查。

§7.5 公平性

HLA 分布的人群差异使 IEDB 衍生模型天然偏向欧洲裔高频等位基因;在非洲、东亚、原住民人群中的疫苗表位覆盖需用人群覆盖工具显式评估,并对低频等位基因组做增强采集。库内宿主物种以人与模式动物为主,跨人群外推时应报告等位基因覆盖盲区。

§7.6 数据漂移

三条漂移轴:①选题漂移——事件驱动(COVID 即实例),新病原数据可在数月内改变全库构成;②技术漂移——免疫肽组质谱通量上升使 MHC ligand assay 主导增长;③规范漂移——命名与归一化标准随版本演进(非肽分类 2021、自由文本归一 2024)。对策:所有长期项目以快照 + 增量日志管理数据,并定期以冻结评测集回归测试。

§7.7 DAIMS 数据质量 24 项核查

# 检查项 状态 说明
1 宽格式 ✅ 各端点均为一行一记录的宽表;嵌套字段以数组列显式存在
2 唯一标识 ✅ structure_id / assay_id 主键 + IRI(IEDB_EPITOPE:*)
3 特殊字符 ⚠️ 嵌套 JSON 数组在 CSV 中含转义引号,需专用解析
4 重复行 ⚠️ 同表位跨文献/多测定天然重复,属语义重复需按组键去重
5 缺失编码 ✅ 缺失即空值,无 magic number
6 标签标识 ✅ assay_response 正/负结局明确
7 罕见类分组 ⚠️ 等位基因长尾(1,021 个)与 3,412 个非肽表位需显式分组
8 偏倚评估 ✅ 官方论文自述文献偏倚;本条 §7.1 系统列出
9 数据字典 ✅ Swagger 交互式文档逐端点列全字段
10 信息性缺失解释 ✅ 定性测定无数值、多等位基因无归属均有明确语义(§4.5)
11 设备记录 ❌ 不记录质谱仪/流式仪等仪器型号,方法学粒度止于 assay type
12 共线性 ⚠️ 洗脱与结合测定高度相关,合并训练需防特征共线
13 编码映射 ✅ NCBITaxon/GenPept/UniProt IRI + curie_map 端点
14 时间戳处理 ⚠️ 测定时间常缺,须以文献发表年代代理
15 划分建议 ✅ 官方支持按日期/等位基因检索导出,时间切分为主流(§5)
16 泄漏讨论 ✅ 预测器训练集重叠问题在基准文献中被明确讨论(坑点 1)
17 标签分布 ✅ 三类测定与正负结局计数公开(首页 Summary Metrics)
18 测量偏倚 ⚠️ binder 阈值与研究设计引入选择偏倚(坑点 2/3)
19 外部验证建议 ✅ CEDAR/VDJdb/独立免疫肽组集可作外部验证(§5.5)
20 版本记录 ⚠️ 无语义化版本号,仅有滚动构建与数据库论文时间锚点
21 预处理脚本 ⚠️ 官方提供 API 用例 notebook,无端到端建模脚本
22 合规要求 ✅ 免费开放,NRES 级;商用工具许可边界清晰
23 多模态对齐 ⚠️ 受体序列-表位-结构跨层关联存在但覆盖率不一
24 去标识化 ✅ 文献级聚合、无个体记录

DAIMS 评分:16.5 / 24

评分解读:作为人工整理的文献衍生库,IEDB 在标识体系、数据字典、溯源与合规上接近满分(这是它成为领域事实标准的原因);扣分集中在设备记录缺失、无语义化版本、重复与共线语义需要使用者自行处理、以及缺乏端到端预处理脚本——这些是"文献整理型"资源的共性边界。

DAIMS 各扣分项的归因:#11(设备记录)源于文献通常不报告仪器型号,属上游信息缺失;#14(时间戳)源于"测定时间"在文献中极少精确到日期;#20(版本记录)源于在线资源以滚动构建取代语义化版本;#21(预处理脚本)与 #23(多模态对齐)反映其定位是"数据源+工具站"而非"建模套件"。这四项并非 IEDB 独有缺陷,同属文献整理型的资源(如 ClinVar、COSMIC)面临同样边界。

对你意味着什么:可以直接把 IEDB 当作训练/评测数据源投入生产(标识与字典足够硬),但必须自带三件套:防泄漏切分脚本(坑点 1/5)、单位与标签归一化层(坑点 2/7)、以及等位基因长尾的分群评测报告(坑点 3/4)。把这三件事工程化后,IEDB 的其余不足不影响主流建模任务。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
IEDB 已验证 CTL 表位(1,251 条,80 HLA) IEDB(用于 NetMHCpan-4.0 外部验证) MHC-I 配体预测 Frank 0.5% 敏感度 90%(EL 模型) 较 NetMHCpan-3.0 的 75% 提升 15 个百分点 引入洗脱数据训练显著提升;IEDB 表位集是关键外部基准
SYFPEITHI 配体集(566 条,33 HLA) SYFPEITHI pan-specific MHC-I 预测 AUC(逐等位基因) 因训练重叠需剔除后评测 跨库评测必须处理训练集重叠
57 项独立人群研究(2,000+ 肽、1,600+ 供者) 已发表文献(CD4episcore 验证) CD4 免疫原性 AUC 0.702(合并法 0.725) 与 7-allele 结合法相当(0.703) 免疫原性预测显著低于结合预测上限,任务更难
多等位基因 MS 配体(IEDB 内近 40% 无归属) IEDB 等位基因特异性建模 — 不可用子集 无归属子集必须隔离,否则污染训练

§8 基准性能与生态

§8.1 代表性模型与性能(IEDB 生态排行榜)

IEDB 本身不运营排行榜;下表收录以 IEDB 数据训练/验证、且论文提供可复现数字的代表性模型。注意:各行任务、验证集与阈值不同,数值不可直接横向比较。

排名 模型 性能 年份 关键技术 完整引用 代码
1 NetMHCpan-4.1(MHC-I 配体/结合) EL 模型在 IEDB CTL 表位集 Frank 0.5% 敏感度 90% 2020 洗脱配体 + 结合数据联合训练、motif 解卷积 Reynisson B, Alvarez B, Paul S, Peters B, Nielsen M. NetMHCpan-4.1 and NetMHCIIpan-4.0: improved predictions of MHC antigen presentation by concurrent motif deconvolution and integration of MS MHC eluted ligand data. Nucleic Acids Res. 2020;48(W1):W449-W454. doi:10.1093/nar/gkaa379 DTU Health Tech 服务页
2 NetMHCpan-4.0 EL(MHC-I) 同验证集敏感度 90% vs NetMHCpan-3.0 的 75% 2019 首次融合免疫肽组洗脱数据 Reynisson B, et al. Improved peptide-MHC class I interaction predictions integrating eluted ligand and peptide binding affinity data. J Immunol Methods. 2019(NetMHCpan-4.0 方法论文) DTU Health Tech
3 IEDB-AR 推荐组合(MHC-I binding) 官方 recommended 方法(2023.09 版) 2019-今 多方法共识 + 定期再训练 Dhanda SK, Mahajan S, Paul S, et al. IEDB-AR: immune epitope database-analysis resource in 2019. Nucleic Acids Res. 2019;47(W1):W502-W506. PMID:31114900 tools.iedb.org(REST API/命令行)
4 CD4episcore(CD4 免疫原性) 平均 AUC 0.702;与 7-allele 法合并 AUC 0.725 2018 文献优势表位+同实验阴性肽训练神经网络 Dhanda SK, Karosiene E, Edwards L, et al. Predicting HLA CD4 Immunogenicity in Human Populations. Front Immunol. 2018. PMID:29963059 tools.iedb.org/CD4episcore
5 NetMHCpan-3.0(历史基线) Frank 0.5% 敏感度 75% 2016 纯结合数据 pan-specific Hoof I, et al. NetMHCpan, a method for MHC class I binding prediction beyond humans. Immunogenetics. 2009;61(1):1-13(方法谱系起点) DTU Health Tech

§8.2 SOTA 总结与选型建议

MHC-I 结合/洗脱预测已是相对成熟任务(AUC 普遍 >0.9,但真实先验下的精准度仍受偏倚制约);MHC-II 与免疫原性预测仍有显著提升空间(AUC 0.7 量级)。选型建议:生产用途直接调用 IEDB-AR 的 recommended 方法(含版本号),研究用途以 NetMHCpan-4.1 为基线、自建模型必须在排除训练重叠的 IEDB 时间切分集上证明增量(坑点 1)。B 细胞构象表位与 TCR 特异性是当前最难的两个子任务,建议结构输入 + 跨库(VDJdb)联合。

§8.3 评测协议

  1. 明确任务口径(结合亲和力回归 / 500 nM 分类 / 洗脱鉴定 / 免疫原性)。
  2. 数据截止协议:固定训练 cutoff 日期,测试集取其后 IEDB 入库数据;报告 api_metrics 快照。
  3. 防泄漏三查:预测器训练重叠、同表位跨文献、洗脱-结合互证(§5.3)。
  4. 指标:AUC + 真实先验重采样 AUPRC + 分等位基因宏观 AUC(§6.9);回归用 Pearson/Spearman 与 AUC 5% 分位排序一致性。
  5. 分层报告:按 MHC-I/II、病原大类、宿主(人/鼠)分别给出,避免被聚合均值掩盖长尾失败。

协议对照表(不同任务的推荐评测口径差异):

任务 正类定义 主指标 必做分层 禁止事项
MHC-I 结合分类 value < 500 nM(或 < 50 nM 严格版) AUC + 真实先验 AUPRC 按等位基因、按测年 未排除预测器训练集
MHC-I 洗脱鉴定 质谱鉴定为天然配体 Frank/Rank 指标(top-k%) 按单/多等位基因来源 混入无归属等位基因
MHC-II 结合 同上,肽长 13-25 AUC(位移容忍) 按结合注册区 随机肽长对齐
T 细胞免疫原性 文献报告阳性应答 AUC(约 0.70 天花板) 按供者/研究 用结合数据当免疫原性标签
TCR 特异性 CDR3-表位配对 PR-AUC(极度不平衡) 按 CDR3 相似度聚类切分 按行随机切分
数据集 类型 链接 推荐理由
VDJdb TCR-表位特异性专库 站内条目 /ai-ready-dataset/vdjdb/0 与 IEDB 受体层互补,TCR 建模必备
CEDAR 癌症表位专库(NCI 资助) https://cedar.iedb.org 肿瘤免疫情境的 IEDB 姊妹库
PDB 宏分子结构 https://www.rcsb.org IEDB 3D 关联的原始结构来源
UniProt 蛋白序列与注释 https://www.uniprot.org IEDB 来源抗原登录号与同义词的上游
IRIS/AIRR 相关库 免疫受体 repertoire AIRR Atlas airr_full.zip 遵循 AIRR 标准,可互换

§8.5 关键论文 Top 8

  1. Vita R, Blazeska N, Marrama D, et al. The Immune Epitope Database (IEDB): 2024 update. Nucleic Acids Res. 2025;53(D1):D436-D443. doi:10.1093/nar/gkae1092 —— 数据库最新官方综述:检索视图、Protein Tree、导出与质量改进(PMID 39558162)。
  2. Vita R, Zarebski L, Greenbaum JA, et al. The immune epitope database 2.0. Nucleic Acids Res. 2010;38:D725-D731. doi:10.1093/nar/gkp1004 —— 架构与整理规程奠基论文,覆盖率评估(99% 感染性疾病肽表位)出自此文(PMID 19906713)。
  3. Dhanda SK, Mahajan S, Paul S, et al. IEDB-AR: immune epitope database-analysis resource in 2019. Nucleic Acids Res. 2019;47(W1):W502-W506 —— 分析资源工具栈与 REST API 官方说明(PMID 31114900)。
  4. Vita R, Mahajan S, Overton JA, et al. The Immune Epitope Database (IEDB): 2018 update. Nucleic Acids Res. 2019;47(D1):D339-D343 —— 上一代综述,数据模型与查询界面参考(PMID 30357391)。
  5. Koşaloğlu-Yalçın Z, Blazeska N, Vita R, et al. The Cancer Epitope Database and Analysis Resource (CEDAR). Nucleic Acids Res. 2023;51:D845-D852 —— 姊妹库 CEDAR 官方论文(NCI 资助)。
  6. Zhang Q, Wang P, Kim Y, et al. Immune epitope database analysis resource (IEDB-AR). Nucleic Acids Res. 2008;36:W513-W518 —— 预测工具栈首篇,REST API 与可下载工具许可边界(教育免费/商用付费)。
  7. Vita R, Vaughan K, Zarebski L, et al. Curation of complex, context-dependent immunological data. BMC Bioinformatics. 2006;7:341 —— 整理规程方法学,标注质量评估的依据(PMID 16836764)。
  8. Reynisson B, Alvarez B, Paul S, Peters B, Nielsen M. NetMHCpan-4.1 and NetMHCIIpan-4.0. Nucleic Acids Res. 2020;48(W1):W449-W454 —— 以 IEDB 为核心训练源的 SOTA 预测器,定义了防泄漏评测协议。

§8.6 社区活跃度

  • 被逾 34,000 篇出版物(含专利)引用,月访问 54,000+(LJI 新闻稿,截至其发布时点)。
  • 每年秋季举办免费多日虚拟用户研讨会(2020 年起连续举办,workshop.iedb.org)。
  • IQ-API 每天承载约 850 次查询(2024 用户研讨会披露);Discuss 论坛(discuss.iedb.org)承载文档帖与用户问答。
  • help@iedb.org 提供官方支持;核心 PI(Sette/Peters 实验室)长期稳定。
  • 中文社区参考:中文生物信息学社区(CSDN 问答等)对 IEDB 的讨论集中在数据整合与本地流程搭建,官方英文资源仍是第一手规范来源。

§8.7 生态快照表

资源 类型 链接 状态(截至 2026-09) 推荐理由
iedb.org 主数据库 https://www.iedb.org 持续更新 数据检索与 Summary Metrics 总览
query-api.iedb.org IQ-API https://query-api.iedb.org 活跃(Swagger 文档) 程序化获取首选
tools.iedb.org 分析资源 https://tools.iedb.org 活跃 预测工具入口
tools-cluster-interface.iedb.org/tools_api 预测 REST API 同左 活跃 MHC-I/II、加工预测批量推理
database_export_v3.php 批量导出 https://www.iedb.org/database_export_v3.php 活跃 受体 XLSX 与 AIRR zip
discuss.iedb.org 用户论坛 https://discuss.iedb.org 活跃 IQ-API 教程与支持
workshop.iedb.org 年度研讨会 http://workshop.iedb.org 每年秋季 系统学习官方工作流

§9 相关资源与引用

§9.1 官方资源导航

资源 链接 用途
数据库主页 https://www.iedb.org 检索、Summary Metrics、导出入口
IQ-API Swagger 文档 https://query-api.iedb.org 全端点字段交互式文档
IQ-API 教程帖 https://discuss.iedb.org/t/immune-epitope-database-query-api-iq-api/154 查询语法、Jupyter/R 用例
预测工具 API 文档 http://tools.iedb.org/main/tools-api/ POST 参数与方法版本清单
批量导出页 https://www.iedb.org/database_export_v3.php TCR/BCR XLSX、AIRR zip
用户研讨会 http://workshop.iedb.org 年度系统教程(免费、录像)
LJI 项目页 https://www.lji.org/research/immune-epitope-database/ 机构背景与资助信息
CEDAR(姊妹库) https://cedar.iedb.org 癌症表位
官方支持 help@iedb.org 数据/工具问题

§9.2 BibTeX 引用块

@article{vita2025iedb2024update,
  title   = {The Immune Epitope Database (IEDB): 2024 update},
  author  = {Vita, Randi and Blazeska, Nina and Marrama, Daniel and
             Duesing, Sebastian and Bennett, Jason and Greenbaum, Jason and
             De Almeida Mendes, Marcus and Mahita, Jarjapu and
             Wheeler, Daniel K. and Cantrell, Jason R. and Overton, James A. and
             Natale, Darren A. and Sette, Alessandro and Peters, Bjoern},
  journal = {Nucleic Acids Research},
  volume  = {53},
  number  = {D1},
  pages   = {D436--D443},
  year    = {2025},
  doi     = {10.1093/nar/gkae1092},
  pmid    = {39558162}
}

@article{vita2010iedb2,
  title   = {The immune epitope database 2.0},
  author  = {Vita, Randi and Zarebski, Laura and Greenbaum, Jason A. and
             Emami, Hussein and Hoof, Ilka and Salimi, Nima and
             Damle, Rohini and Sette, Alessandro and Peters, Bjoern},
  journal = {Nucleic Acids Research},
  volume  = {38},
  number  = {suppl_2},
  pages   = {D725--D731},
  year    = {2010},
  doi     = {10.1093/nar/gkp1004}
}

@article{dhanda2019iedbar,
  title   = {IEDB-AR: immune epitope database-analysis resource in 2019},
  author  = {Dhanda, Sandeep Kumar and Mahajan, Sumeet and Paul, Sinu and
             Yan, Zhi and Kim, Hyeon and Jespersen, Michael C. and
             Jurtz, Vanessa and Andreatta, Massimo and Greenbaum, Jason A. and
             Marcatili, Paolo and Sette, Alessandro and Nielsen, Morten and
             Peters, Bjoern},
  journal = {Nucleic Acids Research},
  volume  = {47},
  number  = {W1},
  pages   = {W502--W506},
  year    = {2019},
  pmid    = {31114900}
}

@article{kosaloglu2023cedar,
  title   = {The Cancer Epitope Database and Analysis Resource (CEDAR)},
  author  = {Ko{\c{s}}alo{\u{g}}lu-Yal{\c{c}}{\i}n, Zeynep and Blazeska, Nina and
             Vita, Randi and Carter, Hannah and Nielsen, Morten and
             Schoenberger, Stephen and Sette, Alessandro and Peters, Bjoern},
  journal = {Nucleic Acids Research},
  volume  = {51},
  number  = {D1},
  pages   = {D845--D852},
  year    = {2023}
}

@article{reynisson2020netmhcpan41,
  title   = {NetMHCpan-4.1 and NetMHCIIpan-4.0: improved predictions of MHC antigen
             presentation by concurrent motif deconvolution and integration of
             MS MHC eluted ligand data},
  author  = {Reynisson, Birkir and Alvarez, Bruno and Paul, Sinu and
             Peters, Bjoern and Nielsen, Morten},
  journal = {Nucleic Acids Research},
  volume  = {48},
  number  = {W1},
  pages   = {W449--W454},
  year    = {2020},
  doi     = {10.1093/nar/gkaa379}
}

§9.3 引用指南

  • 引用数据集本身:引 Vita et al. 2025(2024 update,DOI 10.1093/nar/gkae1092);涉及时段敏感的规模数字请注明"检索于 YYYY-MM"。
  • 引用分析工具:引 Dhanda et al. 2019(IEDB-AR);具体预测方法(如 NetMHCpan)应同时引方法原始论文。
  • 使用非肽表位数据:补充引 Edwards et al. 2021(非肽分类,Database)。
  • 肿瘤情境:引 CEDAR 论文并说明与 IEDB 的分工。

§10 AI 使用声明卡

§10.1 本词条使用的 AI 模型列表

用途 模型/工具 说明
资料检索与事实汇编 CodeBuddy 检索代理(fast-model) 执行 WebSearch 并汇总来源
文本撰写与结构化 大语言模型辅助写作 按本站宪法模板组织成稿

§10.2 AI 参与范围

AI 负责初步检索、事实条目化与初稿撰写;章节结构、医学口径(ICD-11/SNOMED 映射)、数字核对与最终成稿由编辑部按宪法流程交叉审核。所有规模数字均回溯至官方首页、数据库论文或机构新闻稿并附来源链接。

§10.3 输入来源列表

  1. Vita R, et al. The Immune Epitope Database (IEDB): 2024 update. Nucleic Acids Res. 2025;53(D1):D436-D443. doi:10.1093/nar/gkae1092. PMID: 39558162.
  2. Vita R, et al. The immune epitope database 2.0. Nucleic Acids Res. 2010;38:D725-D731. doi:10.1093/nar/gkp1004. PMID: 19906713.
  3. Dhanda SK, et al. IEDB-AR: immune epitope database-analysis resource in 2019. Nucleic Acids Res. 2019;47(W1):W502-W506. PMID: 31114900.
  4. Vita R, et al. The Immune Epitope Database (IEDB): 2018 update. Nucleic Acids Res. 2019;47(D1):D339-D343. PMID: 30357391.
  5. Koşaloğlu-Yalçın Z, et al. The Cancer Epitope Database and Analysis Resource (CEDAR). Nucleic Acids Res. 2023;51:D845-D852.
  6. Zhang Q, et al. Immune epitope database analysis resource (IEDB-AR). Nucleic Acids Res. 2008;36:W513-W518.
  7. Vita R, et al. Curation of complex, context-dependent immunological data. BMC Bioinformatics. 2006;7:341. PMID: 16836764.
  8. Reynisson B, et al. NetMHCpan-4.1 and NetMHCIIpan-4.0. Nucleic Acids Res. 2020;48(W1):W449-W454. doi:10.1093/nar/gkaa379.
  9. IEDB 官方首页 Summary Metrics(检索于 2026-09-18). https://www.iedb.org/
  10. LJI: IEDB will receive up to $17.6 million(NIAID 续约新闻稿). https://www.lji.org/?p=27518/
  11. LJI: Immune Epitope Database 项目页. https://www.lji.org/research/immune-epitope-database/
  12. IEDB Query API (IQ-API) 官方教程帖. https://discuss.iedb.org/t/immune-epitope-database-query-api-iq-api/154
  13. IEDB Analysis Resource 预测工具 API 文档. http://tools.iedb.org/main/tools-api/
  14. IEDB 批量导出页与 AIRR 导出(bioRxiv 预印本引用). https://www.iedb.org/database_export_v3.php
  15. IEDB User Workshop 2024 官方页. http://workshop.iedb.org/
  16. NetMHCpan-4.0 方法论文(训练/验证重叠说明). https://services.healthtech.dtu.dk/services/NetMHCpan-4.1/JI_netMHCpan-4.0.pdf
  17. Pan-specific MHC class I predictors benchmark. Bioinformatics. 2009;25(1):83. https://bioinformatics.oxfordjournals.org/content/25/1/83.full
  18. Predicting MHC class I epitopes in large datasets. https://dev.europepmc.org/articles/PMC2836306/
  19. The Role of Mass Spectrometry and Proteogenomics in the Advancement of HLA Epitope Prediction. https://www.ncbi.nlm.nih.gov/pmc/articles/PMC6033110/
  20. Computational Prediction and Validation of Tumor-Associated Neoantigens. Front Immunol. 2020;11:27. https://www.frontiersin.org/journals/immunology/articles/10.3389/fimmu.2020.00027/pdf
  21. LJI Immune Matters: Data don’t scare 'em(整理史与团队). https://mag.lji.org/?p=4649/
  22. An immunologically friendly classification of non-peptidic ligands. Database. 2021. PMID: 33772585.
  23. Revised Adaptive Immune Receptor Data in the IEDB(bioRxiv 预印本,受体导出细节). https://www.biorxiv.org/content/10.64898/2026.06.03.728549v1.full-text
  24. Dimensions 引用记录(2024 update 论文,197 次引用). https://badge.dimensions.ai/details/id/pub.1182458256

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
frontmatter 与 INFOBOX 数字 千方病案医学编辑部 对照官方首页与数据库论文逐数核对 ✅ 已通过
§1-§3 概览/背景/规格 千方病案医学编辑部 来源回溯与医学口径核对 ✅ 已通过
§4 DAIMS 字段字典 千方病案医学编辑部 对照 IQ-API Swagger 文档字段核对 ✅ 已通过
§5-§6 划分与 AI 指南 千方病案医学编辑部 代码可运行性走查与泄漏逻辑复核 ✅ 已通过
§7-§10 质量/基准/声明 千方病案医学编辑部 偏倚证据链与引用完整性核对 ✅ 已通过

§10.5 AI 生成章节标注

全部章节由 AI 辅助生成初稿:§1.0/§1.1/§1.2、§2.2/§2.5、§3.1/§3.4/§3.5、§4.1/§4.5、§5.2/§5.3、§6 全节(含 8 坑点)、§7.1/§7.7、§8.1/§8.2、§9.2 为 AI 起草后人工修订;§0 免责声明为站点固定文本。

§10.6 最后人工审核日期

2026-09-05(与 §0 审核日期一致)

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • cptac — 共享标签:基因组学与多组学 / 蛋白质组学 / 肿瘤学
  • vdjdb — 共享标签:基因组学与多组学 / 蛋白质组学 / 肿瘤学
  • uniprot — 共享标签:基因组学与多组学 / 蛋白质组学
  • alphafold — 共享标签:基因组学与多组学 / 蛋白质组学
  • cosmic — 共享标签:基因组学与多组学 / 肿瘤学
  • genomics-england-100k — 共享标签:基因组学与多组学 / 肿瘤学
  • target — 共享标签:基因组学与多组学 / 肿瘤学
  • pcawg — 共享标签:基因组学与多组学 / 肿瘤学
  • civic — 共享标签:基因组学与多组学 / 肿瘤学
  • pride — 共享标签:基因组学与多组学 / 蛋白质组学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集