信息速览
INFOBOX
| 数据集名称 | AlphaFold Protein Structure Database (AFDB) |
| 英文全称 | AlphaFold Protein Structure Database |
| 别名 / 简称 | AFDB、AlphaFold DB、AlphaFold 数据库 |
| 疾病分类 | 非疾病特定——全蛋白质组结构预测资源。覆盖所有 ICD-11 章节相关蛋白的药物靶点、致病变异和功能注释 |
| SNOMED CT | 不直接映射——AFDB 为结构生物学参考资源,非临床诊断数据 |
| 数据模态 | AI 预测蛋白质三维结构坐标(PDB/mmCIF/binaryCIF)+ 逐残基置信度(pLDDT)+ 域间误差(PAE)+ 域注释(TED/CATH) |
| AI 任务类型 | 蛋白质结构预测、变异效应预测(AlphaMissense)、蛋白质-蛋白质/配体相互作用建模、药物靶点发现、功能注释 |
| 结构总数 | 214,683,829 (v4, 2024) / 241,070,489 (v6, 2025 含 40,054 isoforms) |
| 数据大小 | ~23 TiB (v4 完整数据集, Google Cloud) / ~500 GB (48 种模式生物蛋白质组 FTP) |
| 数据格式 | PDB / mmCIF (modelCIF) / binaryCIF / PAE JSON / FASTA |
| 许可证 | CC-BY 4.0(学术与商业均可免费使用,需署名) |
| 访问级别 | 完全开放(网站 + FTP + API + Google Cloud + 批量下载) |
| DUO 标签 | N/A (非人类受试者数据,无隐私限制) |
| 语言 | 英文 (元数据与文档) |
| 首发日期 | 2021-07-22 (360,000 结构, 人类蛋白质组 + 20 种模式生物) |
| 最后更新 | 2025-06 (v6, 同步 UniProt 2025_03, 241M+ 结构含 isoforms) |
| 发布机构 | Google DeepMind + EMBL-EBI |
| 官方主页 | https://alphafold.ebi.ac.uk/ |
| 下载地址 | https://ftp.ebi.ac.uk/pub/databases/alphafold/ |
| API 文档 | https://alphafold.ebi.ac.uk/api-docs |
| DOI | 10.1038/s41586-021-03819-2 (AlphaFold2 方法) / 10.1093/nar/gkad1011 (AFDB 2024) |
| 引用次数 | 40,000+ (Jumper et al. Nature 2021, Google Scholar, 截至 2026-07) |
| AI 就绪度评分 | ⭐⭐⭐⭐⭐ (5/5) — 全球最大蛋白质结构预测数据库;CC-BY 4.0 完全开放;多格式多渠道访问;pLDDT/PAE 置信度系统;持续更新 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
权威来源:本条目所有事实、统计数字与方法学描述均直接溯源至以下一手权威来源:
- AlphaFold2 方法论文:Jumper J, Evans R, Pritzel A, et al. Highly accurate protein structure prediction with AlphaFold. Nature 596:583–589, 2021. DOI: 10.1038/s41586-021-03819-2. (40,000+ 引用)
- AFDB 数据库论文 (2021):Varadi M, Anyango S, Deshpande M, et al. AlphaFold Protein Structure Database: massively expanding the structural coverage of protein-sequence space with high-accuracy models. Nucleic Acids Research 50(D1):D439–D444, 2021. DOI: 10.1093/nar/gkab1061.
- AFDB 数据库论文 (2024):Varadi M, Bertoni D, Magana P, et al. AlphaFold Protein Structure Database in 2024: providing structure coverage for over 214 million protein sequences. Nucleic Acids Research 42(D1):D368–D375, 2024. DOI: 10.1093/nar/gkad1011.
- AlphaFold 3 论文:Abramson J, Adler J, Dunger J, et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 630:493–500, 2024. DOI: 10.1038/s41586-024-07487-w.
- AlphaMissense 论文:Cheng J, Novati G, Pan J, et al. Accurate proteome-wide missense variant effect prediction with AlphaMissense. Science 381:eadg7492, 2023. DOI: 10.1126/science.adg7492.
- AFDB 2025 论文:Bertoni D, et al. AlphaFold Protein Structure Database 2025: a redesigned interface and updated structural coverage. Nucleic Acids Research, 2025.
- AlphaFold-Multimer 论文:Evans R, O’‘’‘’‘’'Neill M, Pritzel A, et al. Protein complex prediction with AlphaFold-Multimer. bioRxiv, 2021. DOI: 10.1101/2021.10.04.463034.
- 诺贝尔奖:2024 年诺贝尔化学奖授予 Demis Hassabis 和 John Jumper(AlphaFold),与 David Baker(计算蛋白质设计)共享。
- 官方数据库:https://alphafold.ebi.ac.uk/ — Google DeepMind + EMBL-EBI 联合维护。
作者团队来自 Google DeepMind (Demis Hassabis, John Jumper) 和 EMBL-EBI (Mihaly Varadi, Sameer Velankar) 等国际顶尖 AI 与生物信息学机构。Demis Hassabis 和 John Jumper 因 AlphaFold 工作获 2024 年诺贝尔化学奖。
医学审核者:[千方病案医学编辑部]交叉审核:§2 蛋白质折叠与结构生物学背景(变异效应、药物靶点)、§7 已知偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 结构生物信息学数据工程师,审核范围:§3 AlphaFold2 架构与预测流程、§4 数据格式与置信度系统、§6 AI 就绪指南代码和坑点。
审核日期:2026-08-04
利益冲突声明:千方病案医数集与 Google DeepMind、EMBL-EBI 或 Isomorphic Labs 无商业利益关联。本页面不销售 AFDB 数据集本身,仅提供 AI 就绪指南与学术信息服务。
医疗免责声明:本页面提供的结构生物学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。AlphaFold 预测结构为理论模型,未经实验验证,不应用于临床决策。蛋白质-药物相互作用预测必须结合实验验证和专业药理学评估。
技术免责声明:本页面的代码示例、预处理建议和置信度解读基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和结构预测结果的正确性。AlphaFold 预测为静态结构,不反映蛋白质动力学和构象灵活性。
数据使用合规:AFDB 数据在 CC-BY 4.0 许可下完全开放,学术与商业使用均免费,需署名引用 Jumper et al. Nature 2021 和 Varadi et al. NAR 2024。AlphaMissense 数据版权为 DeepMind 2023,同样在 CC-BY 4.0 下开放。
§1 数据集概览
1.1 30 秒速览
AlphaFold Protein Structure Database(AFDB,AlphaFold 蛋白质结构数据库)是由 Google DeepMind 与 EMBL-EBI 联合创建的全球最大蛋白质三维结构预测数据库。2021 年 7 月上线时包含 360,000 个结构(人类蛋白质组 + 20 种模式生物),2022 年 7 月扩展至 2 亿+ 结构——覆盖几乎所有已知蛋白质序列,2025 年 v6 版本进一步扩展至 2.41 亿+ 结构(含 40,054 个蛋白质异构体 isoforms)。
AFDB 的核心引擎是 AlphaFold2——在 CASP14(第 14 届蛋白质结构预测关键评估竞赛)中以中位骨架精度 0.96 Å (RMSD95) 大幅领先所有竞争方法的 AI 系统,被 CASP 组织者认定为"解决了 50 年蛋白质折叠问题"。2024 年 10 月,Demis Hassabis 和 John Jumper 因 AlphaFold 工作获诺贝尔化学奖。Nature 2021 旗舰论文已被引用 40,000+ 次,全球 300 万+ 研究者使用 AFDB。
AFDB 的革命性在于它将结构生物学从"实验瓶颈"转变为"计算即时获取":过去解析一个蛋白质结构需要数月至数年、花费数万美元,而 AlphaFold 在数分钟内即可完成预测,且精度接近实验水平。这使得蛋白质结构数据从 ~200,000 个实验结构(PDB 50 年积累)跃升至 2 亿+ 预测结构——千倍增长。
1.2 战略价值分析
| 价值维度 | 具体体现 | 影响范围 |
|---|---|---|
| 结构覆盖革命 | 将已知蛋白质结构覆盖从 ~200K (PDB 实验结构) 提升至 214M+,增长 1,000 倍 | 全球结构生物学研究的默认起点 |
| 药物靶点发现 | 为 GPCR、激酶、离子通道等药物靶点家族提供结构模板,加速先导化合物设计 | 制药行业广泛采用,Isomorphic Labs 基于 AF3 开发药物 |
| 变异效应预测 | AlphaMissense 预测 7,100 万+ 错义变异的致病性,填补 ClinVar 与 gnomAD 之间的结构-功能鸿沟 | 罕见病遗传诊断、ACMG 变异分类 |
| 功能注释 | 为 2 亿+ 蛋白质提供结构基础的功能推断,特别是未表征蛋白质 | UniProt 交叉引用,覆盖所有新发现序列 |
| 蛋白质工程 | 为酶工程、抗体设计、蛋白质从头设计提供结构模板 | 合成生物学、工业生物技术 |
| AI 训练数据 | 作为 ESM-2、ProteinMPNN 等蛋白质 AI 模型的预训练结构数据 | 蛋白质语言模型、逆折叠模型 |
| 教育普及 | 免费开放、直观可视化的 3D 结构降低结构生物学门槛 | 全球 190+ 国家 300 万+ 用户 |
1.3 横向对比:AFDB 与主要蛋白质结构资源
| 维度 | AlphaFold DB (v6) | PDB (RCSB) | ESM Atlas | UniProt |
|---|---|---|---|---|
| 结构数量 | 241M+ (预测) | ~240K (实验) | 772M+ (预测) | ~2.5 亿序列 (无结构) |
| 结构来源 | AlphaFold2 AI 预测 | X 射线/NMR/Cryo-EM 实验解析 | ESMFold AI 预测 | N/A (纯序列) |
| 精度水平 | 接近实验 (RMSD95 0.96 Å) | 实验真值 | 略低于 AlphaFold2 | N/A |
| 覆盖范围 | UniProt 几乎所有序列 | 实验解析的蛋白 (~0.1%) | MGnify 宏基因组蛋白 | 所有已知蛋白质序列 |
| 置信度系统 | pLDDT + PAE (逐残基+域间) | B-factor / R-factor / 分辨率 | pLDDT (逐残基) | N/A |
| 许可 | CC-BY 4.0 (完全开放) | CC0 (公共领域) | CC-BY 4.0 | CC-BY 4.0 |
| 数据格式 | PDB / mmCIF / binaryCIF | PDB / mmCIF | PDB / mmCIF | FASTA / JSON / RDF |
| 复合物支持 | AlphaFold-Multimer (有限) | 所有类型实验复合物 | 无 | N/A |
| 非蛋白分子 | AlphaFold3 (DNA/RNA/配体) | 全面 (蛋白+核酸+小分子) | 无 | N/A |
| 更新频率 | 随 UniProt 版本 (~每年) | 持续 (每周新增) | 随 MGnify 更新 | 持续 (每 8 周) |
| 引用数 | 40,000+ (AlphaFold2) | ~100,000+ (PDB 历史总计) | 1,500+ (ESMFold) | 6,400+ (UniProt 2025) |
| 核心用途 | 结构预测/功能注释/药物发现 | 实验结构金标准 | 宏基因组蛋白结构 | 序列注释/功能信息 |
关键区别:PDB 是实验结构金标准(~240K 结构,精度最高但覆盖极低),AFDB 是预测结构的最大资源(214M+,覆盖广且精度接近实验),ESM Atlas 覆盖宏基因组蛋白(772M+,但精度略低且无 PAE)。三者互补:PDB 提供"真值",AFDB 提供"高精度预测",ESM Atlas 提供"广覆盖预测"。
1.4 版本演进时间轴
| 版本 | 日期 | 结构数量 | 关键里程碑 | 论文 |
|---|---|---|---|---|
| v1 | 2021-07 | 360,000 | 人类蛋白质组 + 20 种模式生物;AlphaFold2 CASP14 冠军 | Jumper et al. Nature 2021 |
| v2 | 2021-12 | ~1M | 加入 Swiss-Prot 手工审核序列 | Varadi et al. NAR 2021 |
| v3 | 2022-01 | ~1M | 加入 WHO 全球健康优先病原体蛋白质组 | — |
| v4 | 2022-07 | 200M+ | 覆盖几乎所有已知蛋白质序列;人类 MANE Select 转录本 | Varadi et al. NAR 2024 |
| v4 修正 | 2022-11 | 214M | 修复 v4 中 ~4% 结构的数值 bug | — |
| AlphaMissense | 2023-09 | 71M 变异 | 全蛋白质组错义变异效应预测 | Cheng et al. Science 2023 |
| AlphaFold 3 | 2024-05 | — | 预测所有生命分子(蛋白+DNA+RNA+配体)的结构和相互作用 | Abramson et al. Nature 2024 |
| TED 集成 | 2025-03 | 214M | TED 域注释 + CATH 分类集成 + 批量下载 | — |
| 蛋白复合物 | 2026-03 | ~31M 预测 | ~2.2M 同源二聚体 + ~79K 异源二聚体高置信结构 | EMBL-EBI/DeepMind/NVIDIA |
| v6 | 2025-06 | 241M+ | 同步 UniProt 2025_03;加入 40K isoforms;MSA 下载;API 重构 | Bertoni et al. NAR 2025 |
1.5 典型 AI 应用场景
| 应用场景 | 描述 | 依赖的 AFDB 特性 |
|---|---|---|
| 蛋白质功能注释 | 利用预测结构推断未表征蛋白质的功能域、活性位点和配体结合口袋 | 214M+ 结构 + pLDDT 置信度 + TED 域注释 |
| 药物靶点结构 | 为药物设计提供靶蛋白结构模板,进行虚拟筛选和分子对接 | 高 pLDDT 区域的高精度坐标 |
| 变异致病性评估 | AlphaMissense 预测错义变异对蛋白质稳定性和功能的影响 | 71M 变异效应预测 |
| 蛋白质-蛋白质相互作用 | AlphaFold-Multimer 预测蛋白质复合物结构和界面 | PAE 域间置信度 |
| 结构基序搜索 | 使用 Foldseek 等工具在 2 亿+ 结构中搜索结构相似蛋白质 | 全蛋白质组结构覆盖 |
| 蛋白质工程 | 为酶工程和抗体设计提供结构模板和活性位点信息 | 高精度结构 + 域注释 |
| 分子替换 | 将 AlphaFold 模型作为 X 射线晶体学分子替换的搜索模型 | 高精度坐标 (RMSD95 0.96 Å) |
| AI 模型预训练 | 作为蛋白质语言模型和逆折叠模型的训练数据 | 大规模结构-序列对 |
§2 蛋白质折叠与结构生物学背景
2.1 蛋白质折叠问题
蛋白质是生命活动的分子机器,由氨基酸通过肽键连接形成多肽链,再折叠成特定的三维空间构象。蛋白质的三维结构决定其功能——酶的催化活性、抗体的抗原识别、信号分子的受体结合都依赖于精确的空间构型。
Anfinsen 法则(1972 年诺贝尔化学奖):Christian Anfinsen 通过核糖核酸酶变性-复性实验证明,蛋白质的天然三维结构由其氨基酸序列 thermodynamically 决定。这一发现奠定了"蛋白质折叠问题"的理论基础——如果序列决定结构,那么从序列预测结构在原理上是可行的。
然而,从 Anfinsen 法则到实际预测跨越了 50 年。蛋白质折叠问题的核心难点在于:
| 难点 | 描述 | AlphaFold 的突破 |
|---|---|---|
| 构象空间爆炸 | 100 个氨基酸的蛋白质有 ~10^40 种可能构象,穷举不可行 | 深度学习直接从序列+MSA 学习折叠模式,避免穷举 |
| 能量函数不准 | 物理力场(分子动力学)的能量函数精度不足以区分天然构象 | 数据驱动学习,不依赖显式物理能量函数 |
| 多序列比对信息利用 | 共进化信号(协方差分析)可推断残基接触,但传统方法精度有限 | Evoformer 模块端到端学习 MSA 中的共进化模式 |
| 模板信息整合 | 同源结构模板(PDB)可提供重要先验,但传统方法模板选择脆弱 | 自动学习何时使用模板、何时忽略模板 |
| 侧链精度 | 即使骨架正确,侧链堆积模式难以预测 | 结构模块联合预测骨架和侧链原子坐标 |
2.2 结构层次与置信度体系
蛋白质结构分为四个层次,AlphaFold2 可预测至第三层次(三级结构),AlphaFold3 进一步预测四级结构(复合物):
| 结构层次 | 定义 | AlphaFold 预测能力 |
|---|---|---|
| 一级结构 | 氨基酸序列 | 输入(不预测) |
| 二级结构 | α 螺旋、β 折叠、无规卷曲等局部构象 | 高精度(pLDDT > 70 区域可靠) |
| 三级结构 | 整条多肽链的三维空间构象 | 高精度(单域内 RMSD95 0.96 Å) |
| 四级结构 | 多条多肽链组装成复合物 | AlphaFold-Multimer(有限精度) / AlphaFold3(高精度) |
pLDDT 置信度体系:
pLDDT(predicted Local Distance Difference Test)是 AlphaFold 的逐残基置信度评分,范围 0–100,表示模型对该残基位置预测的可信度:
| pLDDT 范围 | 置信度等级 | 含义 | 建议用途 |
|---|---|---|---|
| > 90 | 非常高 (Very High) | 原子级精度,可信赖侧链构象 | 活性位点分析、配体对接、分子替换 |
| 70 – 90 | 高 (High) | 骨架可靠,侧链大体可信 | 结构比对、功能域分析 |
| 50 – 70 | 低 (Low) | 骨架方向大致正确但细节不可靠 | 谨慎使用,需实验验证 |
| < 50 | 极低 (Very Low) | 可能为内在无序区 (IDR),预测呈"面条状"伪影 | 不应据此设计实验 |
PAE(Predicted Aligned Error)域间置信度:
PAE 是 AlphaFold 预测的残基对间位置误差矩阵,衡量结构域间相对位置的置信度:
| PAE 特征 | 含义 | 使用建议 |
|---|---|---|
| 对角线上深色方块 | 域内残基位置置信度高 | 域内结构可靠 |
| 非对角线区域浅色 | 域间相对位置不确定 | 域间排列不可靠,不应解读为生物学意义 |
| 非对角线区域深色 | 域间相对位置置信度高 | 域间排列可靠(较少见) |
| PAE 不对称 | (x,y) ≠ (y,x),常见于柔性环 | 以较大值为准 |
2.3 ICD-11 疾病关联与药物靶点
AlphaFold 结构对理解疾病机制和药物设计有直接价值。以下为 AFDB 结构在主要疾病类别中的应用:
| ICD-11 章节 | 代表疾病 | AFDB 应用 | 关键蛋白示例 |
|---|---|---|---|
| 肿瘤 (Chapter 2) | 肺癌/乳腺癌/结直肠癌 | 突变导致的结构变化 → 药物抗性机制 | EGFR (P00533)、BRCA1 (P38398)、KRAS (P01116) |
| 内分泌 (Chapter 5) | 糖尿病/甲状腺疾病 | 激素受体结构 → 小分子药物设计 | INS (P01308)、INSR (P06213)、TSHR (P16473) |
| 神经系统 (Chapter 8) | 阿尔茨海默/帕金森 | 淀粉样蛋白聚集结构 → 靶向降解策略 | APP (P05067)、SNCA (P37840)、LRRK2 (Q5S007) |
| 心血管 (Chapter 11) | 心律失常/心肌病 | 离子通道结构 → 抗心律失常药物 | SCN5A (Q14524)、KCNQ1 (P51787)、MYH7 (P12883) |
| 感染性疾病 (Chapter 1) | COVID-19/疟疾/结核 | 病原体蛋白结构 → 疫苗和药物靶点 | Spike (P0DTC2)、PfHT (Q0PD55)、KatG (P9WIE5) |
| 免疫系统 (Chapter 4) | 自身免疫/免疫缺陷 | MHC-肽复合物 → 免疫疗法设计 | HLA-A (P04439)、IL2RA (P01589)、FOXP3 (Q9BZS1) |
| 遗传性 (Chapter 17) | 囊性纤维化/镰状细胞 | 致病突变的结构效应 → 精准治疗 | CFTR (P13569)、HBB (P68871)、DMD (P11532) |
| 代谢 (Chapter 5) | 溶酶体贮积症 | 酶缺陷结构基础 → 酶替代疗法 | GBA (P04062)、IDS (P22304)、GALNS (P34059) |
2.4 AlphaMissense 与变异效应
AlphaMissense 是 AFDB 生态中最具临床转化价值的工具之一,由 DeepMind 于 2023 年发布(Cheng et al. Science 2023):
| 维度 | 详情 |
|---|---|
| 覆盖范围 | 全蛋白质组 71,000,000+ 错义变异效应预测 |
| 方法 | AlphaFold2 结构 + 蛋白质语言模型 → 微调预测致病性 |
| 输出 | 每个变异的致病性概率 (0–1) + 分类 (likely benign / ambiguous / likely pathogenic) |
| 分类阈值 | < 0.1 = likely benign; 0.1–0.564 = ambiguous; > 0.564 = likely pathogenic |
| 性能 | ClinVar 验证 AUROC ~0.94 (优于 REVEL/CADD/PrimateAI) |
| 许可 | CC-BY 4.0 (学术与商业均可使用) |
| 与 gnomAD 关系 | gnomAD 提供群体频率过滤,AlphaMissense 提供结构-功能致病性评估,互补使用 |
| 与 ACMG 关系 | 可作为 ACMG PP3 (Pathogenic Predictive) 的计算证据 |
2.5 蛋白质动力学与 AlphaFold 的局限
蛋白质不是刚性分子——在生理条件下,蛋白质不断进行构象波动和功能运动。AlphaFold 预测的是热力学稳定的单一构象,不反映动力学信息:
| 动力学维度 | AlphaFold 能力 | 替代/补充方法 |
|---|---|---|
| 构象系综 | ❌ 仅预测单一构象 | 分子动力学模拟 (MD)、NMR 集合 |
| 别构效应 | ❌ 无法预测配体诱导的构象变化 | 实验结构 + MD 模拟 |
| 折叠路径 | ❌ 仅预测终态结构 | Markov State Models (MSM) |
| 内在无序区 (IDR) | ⚠️ pLDDT < 50 标记为无序,但不提供构象系综 | IDR 预测工具 (IUPred/DisEMBL) |
| 翻译后修饰影响 | ❌ 不模拟磷酸化/泛素化等修饰 | 实验结构 + MD |
| 膜环境 | ❌ 不模拟脂质双分子层 | 膜蛋白 MD (CHARMM-GUI) |
2.6 蛋白质折叠的历史与 CASP 竞赛
蛋白质结构预测的历史跨越 50 余年,CASP(Critical Assessment of Protein Structure Prediction)竞赛是这一领域最重要的里程碑事件:
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 1961 | Anfinsen 核糖核酸酶实验 | 证明序列决定结构(1972 诺贝尔化学奖) |
| 1970s | 同源建模 (Homology Modeling) | 利用已知结构模板预测同源蛋白 |
| 1994 | CASP1 启动 | 蛋白质结构预测的盲测评估竞赛开始 |
| 1994–2018 | CASP1–CASP13 | 精度缓慢提升,GDT_TS 从 ~40 到 ~60 |
| 2018 | CASP13: AlphaFold 第 1 名 | 首次证明深度学习可竞争结构预测 (GDT_TS ~60) |
| 2020 | CASP14: AlphaFold2 突破 | RMSD95 0.96 Å,被认定"解决蛋白质折叠问题" |
| 2021-07 | AFDB 上线 | 360K 结构开放获取 |
| 2021-10 | AlphaFold2 开源 | 代码 + 权重公开发布 (Apache 2.0) |
| 2022-07 | AFDB 扩展至 2 亿+ | 覆盖几乎所有已知蛋白质序列 |
| 2024-05 | AlphaFold 3 发布 | 扩展至所有生命分子结构和相互作用 |
| 2024-10 | 诺贝尔化学奖 | Hassabis + Jumper 因 AlphaFold 获奖 |
| 2025-06 | AFDB v6 | 241M+ 结构含 isoforms |
| 2026-03 | 蛋白复合物发布 | ~31M 复合物预测 |
CASP14 的意义:CASP14 组织者 John Moult 在竞赛总结中写道:"AlphaFold2 的表现达到了实验精度,这可以说是解决了 50 年蛋白质折叠问题。"这一声明震动了整个结构生物学界——一个困扰科学界半个世纪的问题被 AI 解决了。
2.7 AlphaFold 对结构生物学的影响
AlphaFold 的影响远超技术突破本身,它从根本上改变了结构生物学的研究范式:
| 变革维度 | 前 AlphaFold 时代 | AlphaFold 时代 |
|---|---|---|
| 结构获取 | 实验解析需数月至数年 | 数分钟内从 AFDB 获取 |
| 覆盖范围 | ~200K 实验结构(50 年积累) | 214M+ 预测结构(覆盖几乎所有已知蛋白) |
| 研究起点 | 从实验结构出发 | 从 AlphaFold 预测出发,实验验证关键残基 |
| 药物设计 | 需先解析靶蛋白结构 | 直接使用 AFDB 结构进行虚拟筛选 |
| 未表征蛋白 | 无结构信息,功能未知 | AFDB 结构 + TED 域注释 → 功能推断 |
| 研究成本 | 实验结构解析 $10K–$100K/蛋白 | AFDB 免费获取 |
| 结构-序列关系 | ~0.1% 蛋白有实验结构 | ~100% 蛋白有预测结构 |
| 教育 | 结构生物学门槛高 | 免费在线 3D 可视化降低门槛 |
§3 技术规格与方法学
3.1 AlphaFold2 架构详解
AlphaFold2 是一个端到端的深度学习系统,核心由两个模块组成:Evoformer 和结构模块。
输入:
- 目标蛋白质氨基酸序列
- 多序列比对 (MSA)——通过 JackHMMER 搜索遗传数据库获得
- 结构模板——通过 HHsearch 搜索 PDB 获得同源结构
Evoformer 模块:
Evoformer 是 AlphaFold2 的核心创新,包含 48 个 Evoformer 层,同时处理两种表征:
- MSA 表示:行=序列、列=残基位置,捕捉共进化信号
- 对表示 (Pair Representation):残基对间的空间关系,捕捉距离/接触信息
两个表征之间通过三角更新机制 (Triangular Updates) 交换信息——MSA 中的共进化信号更新对表示中的距离约束,对表示中的空间约束反过来修正 MSA 中的对齐。
结构模块:
结构模块接收 Evoformer 输出的 MSA 表示和对表示,直接预测每个残基所有原子的 3D 坐标。使用不变点注意力 (Invariant Point Attention, IPA) 确保预测对全局旋转和平移不变。结构模块迭代 8 次,每次 refine 结构。
输出:
- 全原子 3D 坐标(所有非氢原子)
- pLDDT 逐残基置信度 (0–100)
- PAE 残基对误差矩阵 (N×N)
3.2 AlphaFold2 性能基准
CASP14 (2020 年) 是蛋白质结构预测领域的"奥运会",AlphaFold2 的表现震惊了整个结构生物学界:
| 指标 | AlphaFold2 | 第二名 | 实验精度参考 |
|---|---|---|---|
| 中位 RMSD95 (骨架) | 0.96 Å | 2.8 Å | ~1.0 Å (X 射线) |
| 中位 GDT_TS | 92.4 | 75.2 | ~95 (实验结构) |
| T0 第一名数 | 87/97 (89.7%) | — | — |
| Z-score | 2.7 (远超群体) | ~1.0 | — |
精度含义:0.96 Å 的 RMSD95 意味着 AlphaFold2 预测的骨架结构与实验结构在 95% 残基上的偏差不到 1 Å——而一个碳原子的直径约为 1.4 Å。这在大多数应用场景下达到了"实验级"精度。
3.3 AlphaFold3 架构演进
2024 年 5 月发布的 AlphaFold3 将结构预测从"蛋白质"扩展到"所有生命分子":
| 维度 | AlphaFold2 | AlphaFold3 |
|---|---|---|
| 预测范围 | 仅蛋白质 | 蛋白质 + DNA + RNA + 小分子配体 + 离子 + 化学修饰 |
| 核心架构 | Evoformer + 结构模块 (IPA) | 改进 Evoformer + 扩散网络 (Diffusion Module) |
| 复合物 | AlphaFold-Multimer (有限) | 原生支持任意分子复合物 |
| 蛋白质-配体 | 不支持 | 50%+ 优于传统对接工具 (PoseBusters 基准) |
| 蛋白质-核酸 | 不支持 | 远超专用核酸预测器 |
| 抗体-抗原 | AlphaFold-Multimer | 显著优于 AF-Multimer v2.3 |
| 开放性 | 开源代码 + 权重 | 代码+权重开源 (2024-11 学术使用) + AlphaFold Server 免费在线 |
| Nature 论文 | Jumper et al. 2021 | Abramson et al. 2024 |
3.4 置信度系统详解
| 置信度指标 | 粒度 | 范围 | 文件位置 | 解读规则 |
|---|---|---|---|---|
| pLDDT | 逐残基 | 0–100 | PDB B-factor / mmCIF _ma_qa_metric_local | >90 非常高,70-90 高,50-70 低,<50 极低 |
| PAE | 残基对 | 0–31.5 Å | PAE JSON (predicted_aligned_error) | 对角线方块=域内;非对角线=域间;<5 Å 高置信 |
| pTM | 全局 | 0–1 | API metadata | >0.5 预测整体可靠 |
| ipTM | 界面 | 0–1 | API metadata | >0.6 蛋白复合物界面可靠 (AF-Multimer) |
3.5 数据格式与访问方式
| 格式 | 用途 | 文件特征 | 推荐场景 |
|---|---|---|---|
| PDB | 传统结构文件 | 逐行原子坐标,pLDDT 在 B-factor 字段 | PyMOL/ChimeraX 可视化,分子对接 |
| mmCIF (modelCIF) | 扩展结构格式 | 含 PAE、pLDDT、元数据完整信息 | 程序化分析,数据挖掘 |
| binaryCIF | 高压缩格式 | 二进制编码,体积为 mmCIF 的 1/5-1/10 | 大规模结构搜索,Web 可视化 |
| PAE JSON | 域间误差矩阵 | N×N 矩阵,N=残基数 | 域间排列分析 |
| FASTA | 序列文件 | 纯氨基酸序列 | 序列搜索,MSA 构建 |
四种访问渠道:
| 渠道 | URL | 适用场景 | 特点 |
|---|---|---|---|
| 网站 | https://alphafold.ebi.ac.uk/ | 单个结构查看/下载 | 交互式 3D 可视化 + pLDDT/PAE 热图 + TED 域注释 |
| FTP | ftp://ftp.ebi.ac.uk/pub/databases/alphafold/ | 批量下载模式生物蛋白质组 | 48 种模式生物 TAR 文件;含历史版本;无 PAE |
| API | https://alphafold.ebi.ac.uk/api-docs | 程序化访问单个/批量结构 | 返回 JSON 含下载 URL;按 UniProt accession 查询 |
| Google Cloud | gs://public-datasets-deepmind-alphafold/ | 下载完整数据集 (~23 TiB) | v4 完整数据集;1 Gbps 需 ~2.5 天 |
3.6 AlphaFold 生态系统
| 工具/资源 | 类型 | 描述 | 许可 |
|---|---|---|---|
| AlphaFold2 | 开源代码 | 蛋白质结构预测(单链/多链) | Apache 2.0 |
| AlphaFold3 | 开源代码 (2024-11) | 所有生命分子结构和相互作用 | 学术使用 |
| AlphaFold Server | 在线平台 | 免费 AF3 预测(非商业) | 非商业 |
| AlphaFold-Multimer | 开源代码 | 蛋白质复合物预测 | Apache 2.0 |
| AlphaMissense | 数据库 | 71M 错义变异效应预测 | CC-BY 4.0 |
| ColabFold | 社区工具 | 在线 AlphaFold2 + MMseqs2 快速 MSA | MIT |
| Foldseek | 结构搜索 | 在 AFDB 中快速结构相似性搜索 | MIT |
| ESMFold | 替代工具 | Meta 蛋白质结构预测(无 MSA,速度快) | MIT |
| RoseTTAFold | 替代工具 | Baker 实验室三轨网络结构预测 | 免费 |
| 3D-Beacons | 联邦网络 | 蛋白质结构数据联邦查询 | 免费 |
| TED (Encyclopedia of Domains) | 域注释 | AFDB 结构的自动域划分和 CATH 分类 | 免费 |
| AFDB 蛋白复合物 | 数据库 (2026-03) | ~31M 蛋白复合物预测 | CC-BY 4.0 |
§4 数据结构与条目组成
4.1 AFDB 条目标识系统
每个 AFDB 条目有唯一的标识符,格式为 AF-{UniProt Accession}-F{Fragment Number}:
| 标识符组成 | 说明 | 示例 |
|---|---|---|
| AF- | AlphaFold 前缀 | AF- |
| UniProt Accession | UniProt 蛋白质登录号 | P00533 (EGFR) |
| -F | 片段标识符 | -F1 |
| 片段号 | 片段序号(>2700aa 蛋白质按 1400aa 重叠片段拆分) | 1, 2, 3… |
完整示例:AF-P00533-F1 = EGFR 蛋白质的 AlphaFold 预测结构,第 1 片段。
4.2 单条目数据组成
每个 AFDB 条目包含以下数据组件:
| 组件 | 格式 | 内容 | 大小(典型) |
|---|---|---|---|
| 结构坐标 | PDB / mmCIF / binaryCIF | 全原子 3D 坐标 + pLDDT (B-factor) | ~50–500 KB (PDB) / ~20–100 KB (binaryCIF) |
| PAE 矩阵 | JSON | N×N 残基对预测对齐误差 | ~10–200 KB (取决于序列长度) |
| MSA | A3M / Stockholm (v6 新增) | 用于预测的多序列比对 | ~100 KB – 10 MB |
| 元数据 | JSON | 条目创建日期、序列版本、UniProt 链接、pLDDT 分布 | ~2 KB |
| 域注释 | TED (mmCIF) | 自动域划分 + CATH 分类 | ~5 KB |
| AlphaMissense | TSV (可选) | 该蛋白质的错义变异效应预测 | ~10–100 KB |
4.3 PDB 文件结构详解
HEADER PROTEIN STRUCTURE PREDICTION 01-JUN-2022
TITLE ALPHAFLIGHT PREDICTION FOR EGFR (P00533)
COMPND MOL_ID: 1; MOLECULE: EPIDERMAL GROWTH FACTOR RECEPTOR;
CHAIN: A; FRAGMENT: 1
SOURCE MOL_ID: 1; ORGANISM_SCIENTIFIC: HOMO SAPIENS;
ORGANISM_COMMON: HUMAN; ORGANISM_TAXID: 9606
REMARK 1 REFERENCE 1
REMARK 1 AUTH Jumper,J., Evans,R., Pritzel,A.
REMARK 1 TITL Highly accurate protein structure prediction
REMARK 1 JOUR NATURE 596:583-589 2021
REMARK 2 RESOLUTION. NOT APPLICABLE.
REMARK 3 PROGRAM. ALPHAFLIGHT
REMARK 4 ALPHAFLIGHT VERSION. 2.0
REMARK 5 ALPHAFLIGHT DATA VERSION. 4
REMARK 465 C-alpha MODEL ONLY.
ATOM 1 N MET A 1 27.340 24.440 28.120 1.00 94.32
ATOM 2 CA MET A 1 26.170 23.520 28.450 1.00 94.32
ATOM 3 C MET A 1 26.400 22.200 27.690 1.00 94.32
...
关键字段说明:
| 字段 | 含义 | AFDB 特定说明 |
|---|---|---|
| ATOM / HETATM | 原子坐标行 | 所有原子为 ATOM(无配体/水分子) |
| 第 11-12 列 | 原子名称 | CA = C-alpha;N/C/O = 骨架原子 |
| 第 13 列 | 链标识 | A/B/C…(多链复合物) |
| 第 14-17 列 | 残基序号 | 从 1 开始,按序列顺序 |
| 第 31-38 列 | X 坐标 (Å) | 笛卡尔坐标 |
| 第 39-46 列 | Y 坐标 (Å) | 笛卡尔坐标 |
| 第 47-54 列 | Z 坐标 (Å) | 笛卡尔坐标 |
| 第 55-60 列 | 占据率 | 1.00 |
| 第 61-66 列 | B-factor | pLDDT 值 (0-100) — AFDB 的关键特征 |
4.4 PAE JSON 格式
{
"predicted_aligned_error": [
[0, 1.2, 2.3, ...],
[1.1, 0, 1.5, ...],
[2.5, 1.4, 0, ...],
...
],
"max_predicted_aligned_error": 31.75
}
predicted_aligned_error:N×N 矩阵,每个值表示残基 x 在对齐残基 y 时的预期位置误差 (Å)max_predicted_aligned_error:PAE 的最大可能值 (31.75 Å)
4.5 数据覆盖统计
| 维度 | 数量 | 说明 |
|---|---|---|
| 总结构 | 214,683,829 (v4) / 241,070,489 (v6) | 覆盖 UniProt 几乎所有序列 |
| Swiss-Prot 结构 | ~570,000 | 手工审核蛋白质 |
| 人类蛋白质组 | ~23,000 | MANE Select 转录本 + isoforms |
| 模式生物蛋白质组 | 48 种 | 含 WHO 优先病原体 |
| 蛋白复合物 | ~31,000,000 (2026-03) | ~2.2M 同源二聚体 + ~79K 异源二聚体高置信 |
| AlphaMissense 变异 | 71,000,000+ | 全蛋白质组错义变异效应 |
| TED 域注释 | ~200M+ | 自动域划分 + CATH 分类 |
| 覆盖物种 | ~200,000+ | 覆盖 UniProt 中所有物种 |
4.6 不覆盖的序列
AFDB 明确不覆盖以下序列:
| 不覆盖类型 | 原因 | 替代方案 |
|---|---|---|
| <16 氨基酸 | 太短,结构预测无意义 | 使用实验结构或从头设计 |
| >2700aa (Swiss-Prot/蛋白质组) | 超出模型内存限制 | 按 1400aa 重叠片段拆分 (F1, F2, …) |
| >1280aa (其他 UniProt) | 超出模型内存限制 | 使用 ColabFold 或本地 AlphaFold2 |
| 含非标准氨基酸 | 模型不支持 | 使用实验结构 (PDB) |
| 病毒蛋白(部分) | 历史覆盖不全,逐步改善 | BFVD / Viro3D 预测数据库 |
§5 数据划分与基准协议
5.1 CASP 基准评估协议
AlphaFold 的性能基准通过 CASP(Critical Assessment of Protein Structure Prediction)竞赛评估,这是蛋白质结构预测领域的"金标准"评估:
| CASP 届次 | 年份 | AlphaFold 排名 | 关键指标 | 意义 |
|---|---|---|---|---|
| CASP13 | 2018 | 第 1 名 (A7D) | 中位 GDT_TS ~60 | 首次证明 AI 可竞争结构预测 |
| CASP14 | 2020 | 第 1 名 (AlphaFold2) | 中位 RMSD95 0.96 Å | 认定"解决蛋白质折叠问题" |
| CASP15 | 2022 | 第 1 名 (AlphaFold2) | 持续领先 | 多聚体/复合物预测改进 |
| CASP16 | 2024 | AlphaFold3 表现参差 | 蛋白-配体对接未显著超越物理方法 | 复合物/配体预测仍有挑战 |
5.2 推荐数据划分策略
对于使用 AFDB 结构开发机器学习模型的研究者:
| 策略 | 划分方式 | 用途 | 注意事项 |
|---|---|---|---|
| 按序列同源性划分 | <30% 序列同一性训练/测试分离 | 防止同源泄漏 | 使用 MMseqs2 或 CD-HIT 聚类 |
| 按蛋白质组划分 | 人类蛋白质组训练,其他物种测试 | 评估跨物种泛化 | 不同物种蛋白质组结构偏倚 |
| 按 pLDDT 分层 | 高置信度 (pLDDT>90) vs 低置信度 (<70) 分开 | 评估模型对置信度的敏感性 | 低 pLDDT 区域可能为 IDR |
| 按 SCOP/CATH 折叠类型 | 按折叠类型分层划分 | 确保测试集含未见折叠 | 需 SCOP/CATH 注释 |
| PDB 实验结构交叉验证 | AFDB 预测 vs PDB 实验结构对比 | 评估预测精度 | PDB 仅覆盖 ~240K 结构 |
5.3 AlphaMissense 基准
AlphaMissense 的性能基准(ClinVar 验证集):
| 方法 | AUROC | AUPRC | 数据来源 | 核心优势 |
|---|---|---|---|---|
| AlphaMissense | 0.940 | 0.680 | AFDB + UniProt | 结构+序列联合预测 |
| REVEL | 0.932 | 0.621 | ClinVar | 集成方法 |
| CADD | 0.923 | 0.580 | 全基因组 | 广泛使用 |
| PrimateAI-3D | 0.918 | 0.595 | 灵长类基因组 | 跨物种进化 |
| ESM1b | 0.897 | 0.503 | UniProt | 蛋白质语言模型 |
| PolyPhen-2 | 0.892 | 0.471 | ClinVar | 经典方法 |
| SIFT | 0.875 | 0.420 | UniProt | 序列保守性 |
§6 AI 就绪指南
6.1 数据获取与预处理管道
6.1.1 API 单结构下载
# Python: 通过 AlphaFold DB API 下载单个蛋白质结构
import requests
import os
def download_alphafold_structure(uniprot_id, output_dir=''''''''.'''''''', format=''''''''pdb''''''''):
"""
通过 AFDB API 下载 AlphaFold 预测结构
:param uniprot_id: UniProt 登录号 (如 ''''''''P00533'''''''' = EGFR)
:param format: pdb / mmcif / bcif / pdb_model / predicted_aligned_error
"""
# API 端点
api_url = f"https://alphafold.ebi.ac.uk/api/prediction/{uniprot_id}"
responevent-blocked= requests.get(api_url)
if response.status_code != 200:
raise Exception(f"API 请求失败: {response.status_code}")
data = response.json()
# 获取下载 URL
if format == ''''''''pdb'''''''':
file_url = data[0][''''''''pdbUrl'''''''']
ext = ''''''''.pdb''''''''
elif format == ''''''''mmcif'''''''':
file_url = data[0][''''''''mmcifUrl'''''''']
ext = ''''''''.cif''''''''
elif format == ''''''''bcif'''''''':
file_url = data[0][''''''''bcifUrl'''''''']
ext = ''''''''.bcif''''''''
elif format == ''''''''predicted_aligned_error'''''''':
file_url = data[0][''''''''predictedAlignedErrorUrl'''''''']
ext = ''''''''.json''''''''
# 下载文件
output_path = os.path.join(output_dir, f"AF-{uniprot_id}-F1{ext}")
file_responevent-blocked= requests.get(file_url)
with open(output_path, ''''''''wb'''''''') as f:
f.write(file_response.content)
# 打印元数据
print(f"UniProt ID: {uniprot_id}")
print(f"UniProt Accession: {data[0][''''''''uniprotAccession'''''''']}")
print(f"平均 pLDDT: {data[0][''''''''meanPlddt'''''''']:.2f}")
print(f"序列长度: {data[0][''''''''sequenceLength'''''''']} aa")
print(f"模型版本: {data[0][''''''''modelVersion'''''''']}")
print(f"创建日期: {data[0][''''''''modelCreatedDate'''''''']}")
print(f"文件已保存至: {output_path}")
return output_path, data
# 示例:下载 EGFR 的 AlphaFold 结构
path, metadata = download_alphafold_structure(''''''''P00533'''''''', output_dir=''''''''.'''''''')
6.1.2 批量下载模式生物蛋白质组
# Bash: 通过 FTP 批量下载人类蛋白质组
# 人类蛋白质组 TAR 文件包含所有人类蛋白质的 PDB + mmCIF 文件
wget -c https://ftp.ebi.ac.uk/pub/databases/alphafold/latest/UP000005640_9606_HUMAN_v4.tar
# 解压
mkdir -p human_proteome
tar -xf UP000005640_9606_HUMAN_v4.tar -C human_proteome/
# 查看文件列表
ls human_proteome/ | head -20
# AF-P00533-F1-model_v4.pdb
# AF-P00533-F1-model_v4.cif
# AF-P01116-F1-model_v4.pdb
# ...
# 下载其他模式生物蛋白质组
# 小鼠
wget -c https://ftp.ebi.ac.uk/pub/databases/alphafold/latest/UP000000589_10090_MOUSE_v4.tar
# 大肠杆菌
wget -c https://ftp.ebi.ac.uk/pub/databases/alphafold/latest/UP000000625_83333_ECOLI_v4.tar
# 酿酒酵母
wget -c https://ftp.ebi.ac.uk/pub/databases/alphafold/latest/UP000002311_559292_YEAST_v4.tar
6.1.3 pLDDT 置信度解析与可视化
# Python: 解析 PDB 文件中的 pLDDT 并可视化
import numpy as np
import matplotlib.pyplot as plt
from Bio.PDB import PDBParser
def parse_plddt(pdb_file):
"""从 AlphaFold PDB 文件中提取 pLDDT 分数"""
parser = PDBParser()
structure = parser.get_structure(''''''''alphafold'''''''', pdb_file)
plddt_scores = []
positionevent-blocked= []
for model in structure:
for chain in model:
for residue in chain:
if residue.has_id(''''''''CA''''''''):
ca_atom = residue[''''''''CA'''''''']
plddt = ca_atom.get_bfactor() # pLDDT 存储在 B-factor 字段
plddt_scores.append(plddt)
positions.append(residue.id[1])
return np.array(positions), np.array(plddt_scores)
def visualize_plddt(positions, plddt_scores, protein_name=''''''''''''''''):
"""可视化 pLDDT 分布"""
fig, axes = plt.subplots(1, 2, figsize=(16, 5))
# 左图:逐残基 pLDDT 线图
colors = []
for p in plddt_scores:
if p > 90:
colors.append(''''''''#0053D6'''''''') # 非常高 - 蓝
elif p > 70:
colors.append(''''''''#65CBF3'''''''') # 高 - 浅蓝
elif p > 50:
colors.append(''''''''#FFDB13'''''''') # 低 - 黄
else:
colors.append(''''''''#FF7D45'''''''') # 极低 - 橙
axes[0].bar(positions, plddt_scores, color=colors, width=1.0)
axes[0].axhline(y=90, color=''''''''#0053D6'''''''', linestyle='''''''''''''''', alpha=0.5, label=''''''''Very High (90)'''''''')
axes[0].axhline(y=70, color=''''''''#65CBF3'''''''', linestyle='''''''''''''''', alpha=0.5, label=''''''''High (70)'''''''')
axes[0].axhline(y=50, color=''''''''#FFDB13'''''''', linestyle='''''''''''''''', alpha=0.5, label=''''''''Low (50)'''''''')
axes[0].set_xlabel(''''''''Residue Position'''''''')
axes[0].set_ylabel(''''''''pLDDT Score'''''''')
axes[0].set_title(f''''''''{protein_name} — Per-residue pLDDT'''''''')
axes[0].legend(fonevent-blocked=8)
axes[0].set_ylim(0, 100)
# 右图:pLDDT 分布饼图
categories = [''''''''Very High (>90)'''''''', ''''''''High (70-90)'''''''', ''''''''Low (50-70)'''''''', ''''''''Very Low (<50)'''''''']
counts = [
(plddt_scores > 90).sum(),
((plddt_scores > 70) & (plddt_scores <= 90)).sum(),
((plddt_scores > 50) & (plddt_scores <= 70)).sum(),
(plddt_scores <= 50).sum()
]
pie_colors = [''''''''#0053D6'''''''', ''''''''#65CBF3'''''''', ''''''''#FFDB13'''''''', ''''''''#FF7D45'''''''']
axes[1].pie(counts, labels=categories, colors=pie_colors, autopct=''''''''%1.1f%%'''''''', startangle=90)
axes[1].set_title(f''''''''{protein_name} — pLDDT Distribution'''''''')
plt.tight_layout()
plt.savefig(f''''''''{protein_name}_plddt.png'''''''', dpi=150)
plt.show()
# 统计信息
print(f"\n{protein_name} pLDDT 统计:")
print(f" 平均 pLDDT: {plddt_scores.mean():.2f}")
print(f" 非常高 (>90): {counts[0]} ({counts[0]/len(plddt_scores)*100:.1f}%)")
print(f" 高 (70-90): {counts[1]} ({counts[1]/len(plddt_scores)*100:.1f}%)")
print(f" 低 (50-70): {counts[2]} ({counts[2]/len(plddt_scores)*100:.1f}%)")
print(f" 极低 (<50): {counts[3]} ({counts[3]/len(plddt_scores)*100:.1f}%)")
# 示例使用
positions, plddt = parse_plddt(''''''''AF-P00533-F1-model_v4.pdb'''''''')
visualize_plddt(positions, plddt, ''''''''EGFR'''''''')
6.1.4 PAE 矩阵解析与可视化
# Python: 解析和可视化 PAE 矩阵
import json
import numpy as np
import matplotlib.pyplot as plt
def load_and_plot_pae(pae_json_path, protein_name=''''''''''''''''):
"""加载 PAE JSON 并可视化"""
with open(pae_json_path) as f:
pae_data = json.load(f)
# 提取 PAE 矩阵
pae_matrix = np.array(pae_data[''''''''predicted_aligned_error''''''''])
max_pae = pae_data[''''''''max_predicted_aligned_error'''''''']
# 可视化
fig, ax = plt.subplots(figsize=(8, 7))
im = ax.imshow(pae_matrix, cmap=''''''''Greens_r'''''''', vmin=0, vmax=max_pae, aspect=''''''''auto'''''''')
ax.set_xlabel(''''''''Aligned Residue'''''''')
ax.set_ylabel(''''''''Scored Residue'''''''')
ax.set_title(f''''''''{protein_name} — Predicted Aligned Error (PAE)'''''''')
plt.colorbar(im, ax=ax, label=''''''''Expected Position Error (Å)'''''''')
plt.tight_layout()
plt.savefig(f''''''''{protein_name}_pae.png'''''''', dpi=150)
plt.show()
# 分析域间置信度
n = pae_matrix.shape[0]
# 提取非对角线区域(域间)的平均 PAE
off_diagonevent-blocked= ~np.eye(n, dtype=bool)
off_diag_pae = pae_matrix[off_diagonal_mask]
print(f"\n{protein_name} PAE 统计:")
print(f" 矩阵大小: {n}x{n}")
print(f" 对角线(域内)平均 PAE: {np.diag(pae_matrix).mean():.2f} Å")
print(f" 非对角线(域间)平均 PAE: {off_diag_pae.mean():.2f} Å")
print(f" 最大 PAE: {pae_matrix.max():.2f} Å")
if off_diag_pae.mean() > 15:
print(" ⚠️ 域间置信度低 — 域间相对位置不可靠,不应解读为生物学意义")
elif off_diag_pae.mean() > 8:
print(" ⚡ 域间置信度中等 — 域间排列大体可信但需谨慎")
else:
print(" ✅ 域间置信度高 — 域间相对位置可靠")
return pae_matrix
# 示例使用
pae = load_and_plot_pae(''''''''AF-P00533-F1-pae.json'''''''', ''''''''EGFR'''''''')
6.1.5 Foldseek 结构搜索
# Bash: 使用 Foldseek 在 AFDB 中搜索结构相似蛋白质
# 前提: 已安装 Foldseek (https://github.com/steineggerlab/foldseek)
# 1. 创建 Foldseek 数据库 (首次使用需下载 AFDB 索引)
foldseek databases AlphafoldDB afdb /tmp/afdb_tmp
# 2. 用查询结构搜索 AFDB
foldseek search query.pdb afdb results.m8 tmp_folder \
format-output "query,target,qstart,qend,tstart,tend,alntmscore,rmsd,pident,evalue"
# 3. 解析结果 (按 TM-score 排序)
# 格式: query\ttarget\tqstart\tqend\ttstart\ttend\talntmscore\trmsd\tpident\tevalue
sort -k7 -nr results.m8 | head -20
# 4. 搜索 PDB 数据库
foldseek databases Alphafold-Swissprot swissprot /tmp/swissprot_tmp
foldseek search query.pdb swissprot pdb_results.m8 tmp_folder
# 5. 批量搜索 (多个查询结构)
foldseek search query_batch/ afdb batch_results.m8 tmp_folder \
format-output "query,target,alntmscore,rmsd,pident,evalue" \
threads 32
6.1.6 AlphaMissense 变异效应查询
# Python: 查询 AlphaMissense 变异效应预测
import pandas as pd
import requests
def query_alphamissense(uniprot_id, output_file=None):
"""
下载指定蛋白质的 AlphaMissense 预测数据
数据来源: https://storage.googleapis.com/dm_alphamissense/
"""
# AlphaMissense HGVS 格式下载 URL
# 文件名: AF-{uniprot_id}-F1_model_v2_am.tsv
url = f"https://storage.googleapis.com/dm_alphamissense/AlphaMissense_am_proteins.tsv.gz"
# 注意: 完整 AlphaMissense 文件 ~30 GB
# 推荐使用 Google Cloud 或按蛋白质查询
# 以下是按单个蛋白质查询的示例逻辑
# 方法 1: 下载完整 AlphaMissense 文件并过滤
# 推荐使用 Google Cloud BigQuery 进行大规模查询
# 方法 2: 使用 AlphaMissense API (如果可用)
# 或从 GCS 下载单蛋白质文件
protein_url = f"https://storage.googleapis.com/dm_alphamissense/hgvs/AF-{uniprot_id}-F1_model_v2.tsv.gz"
try:
df = pd.read_csv(protein_url, sep=''''''''\t'''''''', compression=''''''''gzip'''''''')
print(f"AlphaMissense 数据加载完成: {len(df)} 个变异")
print(f"\n列名: {df.columns.tolist()}")
print(f"\n前 10 行:")
print(df.head(10))
# 分类统计
if ''''''''am_pathogenicity'''''''' in df.columns:
benign = (df[''''''''am_pathogenicity''''''''] < 0.1).sum()
ambiguous = ((df[''''''''am_pathogenicity''''''''] >= 0.1) & (df[''''''''am_pathogenicity''''''''] < 0.564)).sum()
pathogenic = (df[''''''''am_pathogenicity''''''''] >= 0.564).sum()
print(f"\n变异分类:")
print(f" Likely benign (<0.1): {benign} ({benign/len(df)*100:.1f}%)")
print(f" Ambiguous (0.1-0.564): {ambiguous} ({ambiguous/len(df)*100:.1f}%)")
print(f" Likely pathogenic (>=0.564): {pathogenic} ({pathogenic/len(df)*100:.1f}%)")
return df
except Exception as e:
print(f"下载失败: {e}")
print("建议: 从 https://storage.googleapis.com/dm_alphamissense/ 下载完整数据集")
# 示例
am_df = query_alphamissense(''''''''P00533'''''''') # EGFR
6.1.7 使用 ColabFold 进行自定义预测
# Python: 使用 ColabFold 对 AFDB 未覆盖的序列进行结构预测
# ColabFold = AlphaFold2 + MMseqs2 (快速 MSA)
# 方法 1: ColabFold 在线版 (推荐非用户)
# 访问: https://github.com/sokrypton/ColabFold
# 方法 2: 本地安装 ColabFold
# pip install colabfold[alphafold]_colab
from colabfold.batch import run
# 输入: FASTA 文件或序列字符串
sequences = [
("target_protein", "MKTVTQASFL...")
]
# 运行 AlphaFold2 预测
run(
queries=sequences,
result_dir=''''''''./colabfold_results/'''''''',
use_templates=True, # 使用 PDB 模板
use_amber=True, # AMBER 能量最小化
num_recycles=3, # 回收次数
model_type=''''''''auto'''''''', # 自动选择模型
num_models=5, # 运行 5 个模型取最优
stop_at_score=90, # pLDDT > 90 停止
zip_results=True
)
# 输出文件:
# - ranked_0.pdb (最佳模型)
# - ranked_1.pdb ~ ranked_4.pdb
# - timings.json
# - unrelaxed_model_*.pdb
6.2 推荐模型与计算资源
| 任务 | 推荐工具/方法 | 输入 | 输出 | 计算资源 |
|---|---|---|---|---|
| 单个结构查看 | AFDB 网站 | UniProt ID | 3D 可视化 + 下载 | 浏览器 |
| 批量结构下载 | FTP / Google Cloud | 蛋白质组列表 | PDB/mmCIF 文件集 | 100 GB 磁盘/蛋白质组 |
| 结构相似性搜索 | Foldseek | PDB 查询文件 | 结构匹配列表 | 32 GB RAM + AFDB 索引 |
| 自定义结构预测 | ColabFold / AlphaFold2 | 氨基酸序列 | 预测结构 PDB | GPU (NVIDIA 16GB+) |
| 变异效应预测 | AlphaMissense (GCS) | UniProt ID + 变异 | 致病性分数 | 30 GB 磁盘 (完整数据) |
| 复合物预测 | AlphaFold-Multimer / AF3 | 多链序列 | 复合物结构 | GPU (NVIDIA 32GB+) |
| 分子对接 | AutoDock Vina / HDOCK | AFDB 结构 + 配体 | 对接构象 | 8 GB RAM |
| 结构聚类 | Foldseek cluster | 多个 PDB 文件 | 聚类结果 | 64 GB RAM |
| 域划分 | TED / Merizo | AFDB PDB/mmCIF | 域边界 + CATH 分类 | 8 GB RAM |
| MD 模拟 | GROMACS / OpenMM | AFDB 结构 | 构象系综 | GPU + 16 GB RAM |
| 结构比对 | TM-align / DALI | 两个 PDB 文件 | RMSD + TM-score | 4 GB RAM |
| 口袋检测 | CASTp / fpocket | AFDB PDB | 结合口袋坐标 | 8 GB RAM |
| 蛋白质设计 | ProteinMPNN / RFdiffusion | AFDB 结构骨架 | 新序列设计 | GPU (NVIDIA 16GB+) |
6.4 PyMOL 可视化与结构分析
# PyMOL 命令脚本: 可视化 AlphaFold 结构并按 pLDDT 着色
# 1. 加载 AlphaFold PDB 文件
load AF-P00533-F1-model_v4.pdb, egfr
# 2. 按 pLDDT (B-factor) 着色
spectrum b, blue_white_red, minimum=50, maximum=100
# 3. 仅显示高置信区域 (pLDDT > 70)
# 隐藏低 pLDDT 残基
select low_conf, b < 70
hide everything, low_conf
# 4. 显示活性位点残基 (示例: EGFR 激酶域)
select active_site, resi 792-793+845+855
show sticks, active_site
color yellow, active_site
# 5. 导出高质量图片
ray 2400, 1800
png egfr_plddt.png, dpi=300
# 6. 结构比对 (AlphaFold vs PDB 实验结构)
fetch 1IVO, egfr_experimental # PDB 实验结构
align egfr, egfr_experimental
print "RMSD:", cmd.rms_cur
# 7. 域间 PAE 分析
# 加载 PAE 数据 (需 PyMOL 插件或脚本)
import json
pae_data = json.load(open("AF-P00533-F1-pae.json"))
pae_matrix = pae_data["predicted_aligned_error"]
# 计算域间平均 PAE
domain1_range = range(1, 621) # 胞外域
domain2_range = range(622, 644) # 跨膜区
domain3_range = range(645, 1186) # 激酶域
inter_pae = []
for i in domain1_range:
for j in domain3_range:
if i-1 < len(pae_matrix) and j-1 < len(pae_matrix[0]):
inter_pae.append(pae_matrix[i-1][j-1])
print(f"胞外域-激酶域平均 PAE: {sum(inter_pae)/len(inter_pae):.2f} Å")
6.5 结构比对与功能推断
# Python: 使用 BioPython 进行 AlphaFold 结构比对和功能推断
from Bio.PDB import PDBParser, Superimposer
from Bio.PDB.Polypeptide import three_to_one
import numpy as np
def compare_with_pdb(af_pdb, experimental_pdb, chain_id=''''''''A''''''''):
"""
比对 AlphaFold 预测结构与 PDB 实验结构
计算 RMSD 和结构差异
"""
parser = PDBParser()
af_struct = parser.get_structure(''''''''alphafold'''''''', af_pdb)
exp_struct = parser.get_structure(''''''''experimental'''''''', experimental_pdb)
# 获取 CA 原子
af_ca = [res[''''''''CA''''''''] for res in af_struct[0][chain_id] if res.has_id(''''''''CA'''''''')]
exp_ca = [res[''''''''CA''''''''] for res in exp_struct[0][chain_id] if res.has_id(''''''''CA'''''''')]
# 确保长度一致
min_len = min(len(af_ca), len(exp_ca))
af_ca = af_ca[:min_len]
exp_ca = exp_ca[:min_len]
# 结构叠加
sup = Superimposer()
sup.set_atoms(exp_ca, af_ca)
sup.apply(af_ca)
rmsd = sup.rms
print(f"RMSD (AlphaFold vs Experimental): {rmsd:.3f} Å")
# 逐残基偏差分析
deviationevent-blocked= []
for i, (af_atom, exp_atom) in enumerate(zip(af_ca, exp_ca)):
af_coord = np.array(af_atom.get_coord())
exp_coord = np.array(exp_atom.get_coord())
dev = np.linalg.norm(af_coord - exp_coord)
deviations.append({
''''''''position'''''''': i + 1,
''''''''deviation'''''''': dev,
''''''''plddt'''''''': af_atom.get_bfactor()
})
# 找出最大偏差区域
deviations.sort(key=lambda x: x[''''''''deviation''''''''], reverse=True)
print(f"\n偏差最大的 10 个残基:")
for d in deviations[:10]:
print(f" 位置 {d[''''''''position'''''''']}: 偏差 {d[''''''''deviation'''''''']:.2f} Å, pLDDT {d[''''''''plddt'''''''']:.1f}")
# pLDDT 与实际偏差的相关性
plddts = [d[''''''''plddt''''''''] for d in deviations]
actual_devs = [d[''''''''deviation''''''''] for d in deviations]
correlation = np.corrcoef(plddts, [-d for d in actual_devs])[0, 1]
print(f"\npLDDT 与实际偏差的相关系数: {correlation:.3f}")
print("(正值表示 pLDDT 高的残基偏差小,验证 pLDDT 的预测能力)")
return rmsd, deviations
# 示例: 比对 EGFR 的 AlphaFold 预测与 PDB 实验结构 (1IVO)
# rmsd, devs = compare_with_pdb(''''''''AF-P00533-F1-model_v4.pdb'''''''', ''''''''1IVO.pdb'''''''')
6.6 AlphaFold 结构用于药物发现管道
# Python: 使用 AlphaFold 结构进行虚拟筛选管道示例
# 前提: 安装 RDKit + AutoDock Vina + BioPython
from Bio.PDB import PDBParser
import subprocess
import os
def prepare_receptor_for_docking(af_pdb, output_pdbqt, high_conevent-blocked=True):
"""
准备 AlphaFold 结构用于分子对接
关键: 仅使用高 pLDDT 区域,排除低置信残基
"""
parser = PDBParser()
struct = parser.get_structure(''''''''receptor'''''''', af_pdb)
# 过滤低 pLDDT 残基
filtered_lines = []
for model in struct:
for chain in model:
for residue in chain:
if residue.has_id(''''''''CA''''''''):
ca = residue[''''''''CA'''''''']
plddt = ca.get_bfactor()
if high_conf_only and plddt < 70:
continue # 跳过低置信残基
for atom in residue:
line = atom.format_pdb()
filtered_lines.append(line)
# 保存过滤后结构
filtered_pdb = output_pdbqt.replace(''''''''.pdbqt'''''''', ''''''''_filtered.pdb'''''''')
with open(filtered_pdb, ''''''''w'''''''') as f:
f.writelines(filtered_lines)
print(f"高置信结构已保存: {filtered_pdb}")
print(f" 原始残基数: {len(list(struct.get_residues()))}")
print(f" 过滤后残基数: {len([l for l in filtered_lines if l.startswith(''''''''ATOM'''''''') and ''''''''CA'''''''' in l[12:16]])}")
# 使用 ADFR Suite 的 prepare_receptor 转换为 PDBQT
# subprocess.run([''''''''prepare_receptor'''''''', ''''''''-r'''''''', filtered_pdb, ''''''''-o'''''''', output_pdbqt])
print(f"请使用 prepare_receptor 转换为 PDBQT: prepare_receptor -r {filtered_pdb} -o {output_pdbqt}")
def run_docking(receptor_pdbqt, ligand_pdbqt, center_x, center_y, center_z,
size_x=20, size_y=20, size_z=20, exhaustiveness=32):
"""
使用 AutoDock Vina 进行分子对接
"""
conevent-blocked= f"""
receptor = {receptor_pdbqt}
ligand = {ligand_pdbqt}
center_x = {center_x}
center_y = {center_y}
center_z = {center_z}
size_x = {size_x}
size_y = {size_y}
size_z = {size_z}
exhaustiveness = {exhaustiveness}
num_modes = 10
"""
with open(''''''''docking_config.txt'''''''', ''''''''w'''''''') as f:
f.write(config.strip())
subprocess.run([''''''''vina'''''''', ''''''''config'''''''', ''''''''docking_config.txt'''''''', ''''''''out'''''''', ''''''''docking_results.pdbqt''''''''])
print("对接完成,结果保存至 docking_results.pdbqt")
# 示例: 使用 EGFR AlphaFold 结构进行药物对接
# prepare_receptor_for_docking(''''''''AF-P00533-F1-model_v4.pdb'''''''', ''''''''egfr_receptor.pdbqt'''''''')
# run_docking(''''''''egfr_receptor.pdbqt'''''''', ''''''''erlotinib.pdbqt'''''''',
# center_x=-22.5, center_y=-18.2, center_z=35.7) # 激酶活性位点坐标
### 6.3 关键坑点与注意事项
| 坑点 | 描述 | 解决方案 |
| --- | --- | --- |
| **pLDDT 误读** | 将低 pLDDT 理解为"预测错误"而非"可能无序" | pLDDT < 50 通常表示内在无序区 (IDR),是生物学信号而非算法失败 |
| **PAE 忽视** | 仅看 pLDDT 不看 PAE,过度信任域间排列 | 域间 PAE > 15 Å 时域间排列不可靠,不应解读为生物学界面 |
| **静态结构误用** | 将 AlphaFold 预测当作蛋白质的唯一构象 | 蛋白质是动态的,AlphaFold 仅预测一个低能态构象 |
| **侧链过度信任** | 高 pLDDT 区域的侧链不完全可靠 | pLDDT > 90 时侧链大体可信,但关键残基需实验验证 |
| **大蛋白片段化** | >2700aa 蛋白被拆分为 1400aa 重叠片段,片段间连接不可靠 | 使用 ColabFold 本地预测完整序列(需大内存 GPU) |
| **膜蛋白偏倚** | AlphaFold2 训练集偏向可溶性蛋白,膜蛋白精度有限 | 结合 OPM/OPM-PDB 膜蛋白数据库验证跨膜区预测 |
| **MSA 深度影响** | MSA 深度不足时预测精度显著下降 | 检查 MSA 深度 (序列数),浅 MSA 使用 ColabFoldpairmode |
| **版本不一致** | AFDB 版本与 UniProt 版本不同步,序列可能已更新 | 检查 AFDB 条目的 sequence version date 与 UniProt 最新版本 |
| **非标准残基** | AlphaFold 不预测非标准氨基酸(如硒半胱氨酸) | 手动修改或使用实验结构 |
| **AlphaFold3 限制** | AF3 蛋白-配体预测在 CASP16 中未显著超越物理方法 | AF3 最适合蛋白质-蛋白质/核酸复合物,配体对接仍需验证 |
| **商业化限制** | AlphaFold Server 仅限非商业使用 | 商业用途使用 AlphaFold2 开源代码或 Isomorphic Labs 合作 |
| **Stereochemistry 违反** | AlphaFold 可能产生不合理的键长/键角 | 使用 AMBER/OpenMM 进行能量最小化修正 |
-
## §7 质量评估与已知偏倚 {#sec-quality}
### 7.1 已知偏倚与局限性
AFDB 作为革命性的结构预测资源,仍存在多个已知偏倚和局限:
| 偏倚类型 | 严重程度 | 详细描述 | 影响范围 | 缓解措施 |
| --- | --- | --- | --- | --- |
| **低 pLDDT 区域** | ⭐⭐⭐ 高 | 30–40% 的残基 pLDDT < 70,其中多数 < 50(IDR),预测呈面条状伪影 | 功能注释、药物设计 | 标注低置信区域,仅使用 pLDDT > 70 的结构 |
| **域间排列不确定** | ⭐⭐⭐ 高 | PAE 矩阵显示多数多域蛋白质的域间相对位置误差 > 15 Å | 复合物分析、域-域相互作用 | 检查 PAE 矩阵,高 PAE 区域不应解读为生物学界面 |
| **静态结构** | ⭐⭐⭐ 高 | AlphaFold 仅预测单一构象,不反映构象动力学和别构效应 | 功能机制推断、药物设计 | 结合 MD 模拟和实验数据 |
| **训练集偏倚** | ⭐⭐ 中 | 训练数据来自 PDB 实验结构,偏向可溶性蛋白和稳定折叠 | 膜蛋白、IDR、多聚体精度 | 膜蛋白结合 OPM 数据库验证 |
| **MSA 依赖** | ⭐⭐ 中 | MSA 深度不足时精度显著下降(孤儿序列/快速进化蛋白) | 新序列、病毒蛋白 | 使用 ColabFoldpairmode 或 ESMFold(无 MSA) |
| **大蛋白截断** | ⭐⭐ 中 | >2700aa 蛋白被拆分为 1400aa 片段,片段间连接不可靠 | 大型多域蛋白 | 本地运行 AlphaFold2 完整序列(需大 GPU) |
| **AlphaFold3 局限** | ⭐⭐ 中 | AF3 在 CASP16 蛋白-配体预测中未显著超越物理方法 | 药物设计、分子对接 | AF3 适合蛋白质-蛋白质/核酸复合物 |
| **非标准氨基酸** | ⭐ 低 | 不预测硒半胱氨酸、吡咯赖氨酸等非标准氨基酸 | 含非标准残基蛋白 | 使用实验结构 (PDB) |
| **翻译后修饰** | ⭐⭐ 中 | 不模拟磷酸化、泛素化、糖基化等修饰的结构效应 | 信号传导、调控机制 | 结合实验结构 + MD |
| **构象状态选择** | ⭐⭐ 中 | 可能预测非活性构象(如酶的开放态而非关闭态) | 药物设计(活性位点构象) | 与实验结构/配体结合态对比 |
| **版本滞后** | ⭐ 低 | AFDB 版本与 UniProt 不同步(~6–12 月延迟) | 新发现序列 | 使用 ColabFold 对新序列做自定义预测 |
| **数值 bug 历史** | ⭐ 低 | v4 (2022-07) 中 ~4% 结构因数值 bug 有低精度(v4 修正版已修复) | 历史分析 | 使用最新版本(v6 或 v4 修正版) |
### 7.2 质量控制指标
| QC 指标 | 阈值 | 含义 |
| --- | --- | --- |
| **平均 pLDDT** | > 70 = 高质量 | 全蛋白质平均置信度 |
| **高置信残基比例** | > 50% (pLDDT > 90) | 结构可用性评估 |
| **低置信残基比例** | < 30% (pLDDT < 50) | IDR/无序区域占比 |
| **PAE 域内平均** | < 5 Å | 单域结构可靠性 |
| **PAE 域间平均** | < 8 Å (高置信域间) | 多域排列可靠性 |
| **Clashscore** | < 10 (MolProbity) | 原子碰撞评分 |
| **Ramachandran favored** | > 95% | 主链构象合理性 |
### 7.3 DAIMS 数据就绪度评估
| 评估维度 | 评分 | 说明 |
| --- | --- | --- |
| **D1 数据可发现性** | ⭐⭐⭐⭐⭐ | AFDB 官网 + EMBL-EBI FTP + Google Cloud + API + UniProt 交叉引用 |
| **D2 数据可访问性** | ⭐⭐⭐⭐⭐ | 完全开放,无申请流程,网站/FTP/API/GCS 四种渠道 |
| **D3 数据格式标准化** | ⭐⭐⭐⭐⭐ | PDB / mmCIF / binaryCIF / PAE JSON,社区标准格式 |
| **D4 元数据完整性** | ⭐⭐⭐⭐⭐ | UniProt ID + 物种 + pLDDT 分布 + 创建日期 + 版本 |
| **D5 文档质量** | ⭐⭐⭐⭐⭐ | Nature/NAR 论文 + EMBL-EBI 培训材料 + FAQ + API 文档 |
| **D6 数据版本控制** | ⭐⭐⭐⭐⭐ | v1–v6 明确版本 + CHANGELOG + 历史版本 FTP 可访问 |
| **D7 数据许可** | ⭐⭐⭐⭐⭐ | CC-BY 4.0(学术与商业均可免费使用) |
| **D8 数据溯源** | ⭐⭐⭐⭐⭐ | 每个条目链接到 UniProt 序列 + AlphaFold2 模型版本 |
| **D9 数据一致性** | ⭐⭐⭐⭐ | v4→v6 版本间有增删,旧版本 FTP 可访问 |
| **D10 数据时效性** | ⭐⭐⭐⭐⭐ | v6 (2025-06) 同步 UniProt 2025_03,持续更新 |
| **A1 任务适配性** | ⭐⭐⭐⭐⭐ | 结构预测 + 功能注释 + 药物设计 + 变异效应 + AI 训练 |
| **A2 特征完整性** | ⭐⭐⭐⭐ | 结构 + pLDDT + PAE + TED 域注释,但无动力学信息 |
| **A3 标注质量** | ⭐⭐⭐⭐⭐ | pLDDT 逐残基 + PAE 残基对 + UniProt 交叉引用 |
| **A4 样本多样性** | ⭐⭐⭐⭐⭐ | 覆盖 ~200,000+ 物种,214M+ 结构 |
| **A5 数据量充分性** | ⭐⭐⭐⭐⭐ | 214M+ 结构,千倍于 PDB 实验结构 |
| **A6 数据平衡性** | ⭐⭐⭐ | 偏向可溶性蛋白,膜蛋白/IDR 覆盖有限 |
| **I1 互操作性** | ⭐⭐⭐⭐⭐ | PDB/mmCIF 与所有结构生物学工具兼容 |
| **I2 可机器读取性** | ⭐⭐⭐⭐⭐ | PDB/mmCIF/binaryCIF + JSON API + GCS |
| **I3 API 可用性** | ⭐⭐⭐⭐⭐ | REST API 无需认证,返回 JSON + 下载 URL |
| **I4 数据链接性** | ⭐⭐⭐⭐⭐ | UniProt + PDB + InterPro + TED/CATH + AlphaMissense |
| **M1 数据维护** | ⭐⭐⭐⭐⭐ | Google DeepMind + EMBL-EBI 持续合作维护 |
| **M2 社区支持** | ⭐⭐⭐⭐⭐ | 300 万+ 用户,190+ 国家,ColabFold/Foldseek 生态 |
| **M3 方法基准** | ⭐⭐⭐⭐⭐ | CASP14 金标准 + 广泛基准评估 |
| **M4 可复现性** | ⭐⭐⭐⭐⭐ | 完全开放数据 + 开源代码 (AlphaFold2) + 可复现预测 |
**总评分**:⭐⭐⭐⭐⭐ (5/5) — 全球蛋白质结构预测的 AI 就绪度标杆
-
## §8 基准与生态 {#sec-benchmark}
### 8.1 蛋白质结构预测方法对比
| 方法 | 团队 | CASP14 排名 | 需要 MSA | 速度 | 精度 | 开源 |
| --- | --- | --- | --- | --- | --- | --- |
| **AlphaFold2** | Google DeepMind | 第 1 名 (RMSD95 0.96 Å) | 是 | 慢 (~分钟) | 最高 | ✅ Apache 2.0 |
| **AlphaFold3** | Google DeepMind + Isomorphic | N/A (2024) | 是 | 慢 | 最高 (含复合物) | ✅ 学术 |
| **RoseTTAFold** | Baker 实验室 | 第 2 名区 | 是 | 中 | 高 | ✅ 免费 |
| **ESMFold** | Meta AI | 第 3 名区 | 否 (语言模型) | 快 (~秒) | 中高 | ✅ MIT |
| **OmegaFold** | Helixon | — | 否 | 快 | 中 | ✅ |
| **ColabFold** | Sokrypton 社区 | (AlphaFold2 wrapper) | 是 (MMseqs2) | 快 (MSA 搜索快) | 高 (≈AlphaFold2) | ✅ MIT |
| **INTFOLD** | InstaDeep | — | 是 | 中 | 中 | ✅ |
### 8.2 关键论文 Top 10
| 排名 | 论文 | 引用数 | 核心贡献 |
| --- | --- | --- | --- |
| 1 | Jumper et al., Nature 596:583, 2021 | 40,000+ | AlphaFold2 方法——CASP14 冠军,解决蛋白质折叠问题 |
| 2 | Baek et al., Science 373:871, 2021 | 5,500+ | RoseTTAFold——三轨网络结构预测 |
| 3 | Varadi et al., NAR 50(D1):D439, 2021 | 2,800+ | AFDB 初版——36 万结构数据库发布 |
| 4 | Abramson et al., Nature 630:493, 2024 | 1,200+ | AlphaFold 3——所有生命分子结构和相互作用 |
| 5 | Cheng et al., Science 381:eadg7492, 2023 | 900+ | AlphaMissense——7100 万错义变异效应预测 |
| 6 | Mirdita et al., Nat Methods 19:679, 2022 | 3,000+ | ColabFold——在线 AlphaFold2 + MMseqs2 |
| 7 | Varadi et al., NAR 42(D1):D368, 2024 | 400+ | AFDB 2024 更新——2.14 亿结构 |
| 8 | Lin et al., Science 379:1126, 2023 | 1,800+ | ESMFold——无 MSA 快速结构预测 |
| 9 | van Kempen et al., Nat Methods 21:117, 2024 | 500+ | Foldseek——快速结构相似性搜索 |
| 10 | Evans et al., bioRxiv, 2021 | 2,000+ | AlphaFold-Multimer——蛋白质复合物预测 |
### 8.3 AFDB 在 AI 生态中的位置
AFDB 不仅是一个数据库,更是 AI 驱动的结构生物学革命的枢纽:
| 生态层 | AFDB 角色 | 代表案例 |
| --- | --- | --- |
| **AI 训练数据** | 为蛋白质 AI 模型提供大规模结构训练集 | ESM-2 蛋白质语言模型 (571K Swiss-Prot 结构);ProteinMPNN 逆折叠 |
| **功能注释引擎** | 为未表征蛋白质提供结构基础的功能推断 | UniProt 已集成 AFDB 结构链接 |
| **药物发现平台** | 为药物设计提供靶蛋白结构模板 | Isomorphic Labs + Novartis/Lilly 合作 |
| **变异解释工具** | AlphaMissense 为罕见病变异提供致病性评估 | ClinVar 变异解释补充 |
| **结构搜索基础设施** | Foldseek 在 2 亿+ 结构中搜索结构相似性 | AFDB-Foldseek 集成 |
| **教育平台** | 免费开放的可视化工具降低结构生物学门槛 | 300 万+ 全球用户 |
| **方法学基准** | CASP 等评估的标准参考 | CASP14 AlphaFold2 突破 |
### 8.4 AlphaFold 的真实世界影响案例
AlphaFold 已在多个领域产生实际影响,以下为已发表的代表案例:
| 领域 | 案例 | AFDB 角色 | 论文/来源 |
| --- | --- | --- | --- |
| **抗疟疾药物** | 疟原虫蛋白质结构解析 | 为 ~5,000 个疟原虫蛋白提供结构,加速靶点发现 | Wellcome Sanger Institute |
| **塑料降解酶** | PET 塑料降解酶工程 | 基于结构优化酶活性和热稳定性 | Prof. John McGeehan, CEI |
| **作物抗病** | 水稻 NLR 免疫受体结构 | 预测 NLR 蛋白结构,理解抗病机制 | 多篇 Plant Cell 论文 |
| **抗生素抗性** | 结核杆菌蛋白结构 | 预测结核杆菌药物靶点结构,发现新靶点 | MRC LMB Cambridge |
| **罕见病诊断** | 未确诊遗传病 | AlphaMissense 辅助变异解释,诊断疑难罕见病 | NHS Genomic Medicine |
| **COVID-19** | SARS-CoV-2 蛋白结构 | 疫情早期提供 Spike 等蛋白结构,加速疫苗设计 | DeepMind 2020 |
| **蛋白质设计** | 全新蛋白质从头设计 | AlphaFold 结构验证 Baker 实验室设计蛋白 | Science 2023 |
| **核孔复合体** | 人类核孔复合体结构 | AFDB 结构 + Cryo-EM = 完整 NPC 模型 | Science 2022 |
| **泛素系统** | 泛素连接酶家族 | 系统性分析 600+ E3 连接酶结构 | Nature 2023 |
### 8.5 AFDB 与全球蛋白质结构资源生态
┌─────────────────────────────────────────┐
│ 蛋白质结构数据生态 │
└────────────────────┬────────────────────┘
│
┌────────────────────────────┼────────────────────────────┐
│ │ │
┌───────▼───────┐ ┌────────▼────────┐ ┌────────▼────────┐
│ 实验结构 │ │ AI 预测结构 │ │ 衍生资源 │
│ (金标准) │ │ (大规模覆盖) │ │ (功能/域/变异) │
│ │ │ │ │ │
│ PDB (~240K) │ │ AFDB (214M+) │ │ AlphaMissense │
│ EMDB (~25K) │ │ ESM Atlas (772M)│ │ (71M 变异) │
│ PDB-Dev │ │ BFVD (病毒) │ │ TED/CATH (域) │
│ │ │ Viro3D (病毒) │ │ InterPro (域) │
└───────┬───────┘ │ AFDB 复合物 │ │ ClinVar (临床) │
│ │ (31M 复合物) │ │ gnomAD (频率) │
│ └────────┬────────┘ └────────┬────────┘
│ │ │
└────────────────────────────┼────────────────────────────┘
│
┌────────▼────────┐
│ 整合与搜索 │
│ │
│ UniProt (序列) │
│ 3D-Beacons (联邦)│
│ Foldseek (搜索) │
│ PDBe-KB (知识库) │
│ ColabFold (预测) │
└───────────────────┘
**生态关系**:
- PDB 是实验真值(~240K),训练了 AlphaFold2 → AFDB 产生 214M+ 预测 → ESM Atlas 进一步扩展至宏基因组蛋白
- AFDB + AlphaMissense 为 ClinVar/gnomAD 提供结构-功能解释
- TED/CATH 基于 AFDB 结构进行域划分和折叠分类
- 3D-Beacons 联邦网络将 PDB + AFDB + ESM Atlas 统一查询
- Foldseek 使 2 亿+ 结构的快速搜索成为可能
-
## §9 参考文献 {#sec-references}
### 9.1 核心论文 BibTeX
```bibtex
@article{jumper2021highly,
title={Highly accurate protein structure prediction with {AlphaFold}},
author={Jumper, John and Evans, Richard and Pritzel, Alexander and Green, Tim and Figurnov, Michael and Ronneberger, Olaf and Tunyasuvunakool, Kathryn and Bates, Russ and {\v{Z}}{\''''''''\i}dek, Augustin and Potapenko, Anna and others},
journal={Nature},
volume={596},
number={7873},
pages={583589},
year={2021},
doi={10.1038/s41586-021-03819-2}
}
@article{varadi2021alphafold,
title={AlphaFold Protein Structure Database: massively expanding the structural coverage of protein-sequence space with high-accuracy models},
author={Varadi, Mihaly and Anyango, Stephen and Deshpande, Mandar and Nair, Sreenath and Natassia, Cindy and Yordanova, Galabina and Yuan, David and Stroe, Oana and Wood, Gemma and Laydon, Agata and others},
journal={Nucleic Acids Research},
volume={50},
number={D1},
pages={D439D444},
year={2021},
doi={10.1093/nar/gkab1061}
}
@article{varadi2024alphafold,
title={AlphaFold Protein Structure Database in 2024: providing structure coverage for over 214 million protein sequences},
author={Varadi, Mihaly and Bertoni, Domenico and Magana, Pauline and Paramval, Urmila and Pidruchewsky, Ivanna and Agirre, May and Beasley, Maddaly and Bosco, Colin and Burgess, Andrew and Cain, Kirstin and others},
journal={Nucleic Acids Research},
volume={42},
number={D1},
pages={D368D375},
year={2024},
doi={10.1093/nar/gkad1011}
}
@article{abramson2024accurate,
title={Accurate structure prediction of biomolecular interactions with {AlphaFold 3}},
author={Abramson, Josh and Adler, Jonas and Dunger, Jack and Evans, Richard and Green, Tim and Pritzel, Alexander and Ronneberger, Olaf and Willmore, Lindsay and Ballard, Andrew J and Bambrick, Joshua and others},
journal={Nature},
volume={630},
pages={493500},
year={2024},
doi={10.1038/s41586-024-07487-w}
}
@article{cheng2023accurate,
title={Accurate proteome-wide missense variant effect prediction with {AlphaMissense}},
author={Cheng, Jun and Novati, Guido and Pan, Jun and Bycroft, Clare and Zemgulyte, Akvilė and Applebaum, Taylor and Pritzel, Alexander and Wong, Li Hong and Zielinski, Michal and Steinegger, Martin and others},
journal={Science},
volume={381},
number={6664},
pages={eadg7492},
year={2023},
doi={10.1126/science.adg7492}
}
@article{evans2021protein,
title={Protein complex prediction with {AlphaFold-Multimer}},
author={Evans, Richard and O''''''''Neill, Miles and Pritzel, Alexander and Antropova, Natasha and Senior, Andrew and Green, Tim and {\v{Z}}{\''''''''\i}dek, Augustin and Bates, Russ and Blackwell, Sarah and Yim, Jason and others},
journal={bioRxiv},
year={2021},
doi={10.1101/2021.10.04.463034}
}
@article{mirdita2022colabfold,
title={ColabFold: making protein folding accessible to all},
author={Mirdita, Milot and Sch{\"u}tze, Konstantin and Moriwaki, Yoshitaka and Heo, Lim and Ovchinnikov, Sergey and Steinegger, Martin},
journal={Nature Methods},
volume={19},
number={6},
pages={679682},
year={2022},
doi={10.1038/s41592-022-01488-1}
}
@article{lin2023evolutionary,
title={Evolutionary-scale prediction of atomic-level protein structure with a language model},
author={Lin, Zeming and Akin, Halil and Rao, Roshan and Hie, Brian and Zhu, Zhongkai and Lu, Wenting and dos Santos Costa, Allan and Fazel-Yavari, Maryam and Yang, Tomer and Barber, Ravan and others},
journal={Science},
volume={379},
number={6637},
pages={11261133},
year={2023},
doi={10.1126/science.ade2574}
}
@article{baek2021accurate,
title={Accurate prediction of protein structures and interactions using a three-track neural network},
author={Baek, Minkyung and DiMaio, Frank and Anishchenko, Ivan and Dauparas, Justas and Ovchinnikov, Sergey and Lee, Gyu Rie and Wang, Jue and Cong, Qian and Kinch, Lisa N and Schaeffer, R Dustin and others},
journal={Science},
volume={373},
number={6557},
pages={871876},
year={2021},
doi={10.1126/science.abj8754}
}
@article{vankempen2024fast,
title={Fast and accurate protein structure search with {Foldseek}},
author={van Kempen, Michel and Kim, Stephanie S and Tumescheit, Charlotte and Mirdita, Milot and Lee, Jeongjae and Gilchrist, Cameron LM and S{\"o}ding, Johannes and Steinegger, Martin},
journal={Nature Biotechnology},
volume={42},
pages={243246},
year={2024},
doi={10.1038/s41587-023-01773-0}
}
@article{bertoni2025alphafold,
title={AlphaFold Protein Structure Database 2025: a redesigned interface and updated structural coverage},
author={Bertoni, Domenico and others},
journal={Nucleic Acids Research},
year={2025},
note={In press}
}
@article{fleming2025alphafold,
title={AlphaFold Protein Structure Database and 3D-Beacons: New Data and Capabilities},
author={Fleming, James and others},
journal={Journal of Molecular Biology},
year={2025},
note={In press}
}
9.2 资源索引
§10 声明卡
| 项目 | 内容 |
|---|---|
| 数据集名称 | AlphaFold Protein Structure Database (AFDB) |
| 数据维护方 | Google DeepMind + EMBL-EBI |
| 数据许可 | CC-BY 4.0(学术与商业均可免费使用,需署名) |
| 商业使用 | 允许(CC-BY 4.0);AlphaFold Server 仅限非商业 |
| 数据引用格式 | Jumper J, et al. Highly accurate protein structure prediction with AlphaFold. Nature 596:583–589, 2021. + Varadi M, et al. NAR 2024. |
| DOI | 10.1038/s41586-021-03819-2 (AlphaFold2) / 10.1093/nar/gkad1011 (AFDB 2024) |
| 数据下载 | https://ftp.ebi.ac.uk/pub/databases/alphafold/ |
| 在线浏览 | https://alphafold.ebi.ac.uk/ |
| API | https://alphafold.ebi.ac.uk/api-docs |
| 数据格式 | PDB / mmCIF / binaryCIF / PAE JSON |
| 版本 | v6 (2025-06, 241M+ 结构) |
| 更新频率 | 随 UniProt 版本(约每年一次大版本更新) |
| 最后审核日期 | 2026-08-04 |
| 审核者 | 千方病案医学编辑部 |
| 利益冲突 | 无 |
| 版本 | v1.0 |
