信息速览
# AlphaFold DB — 蛋白质结构预测数据库 AI-Ready Wiki DB — 蛋白质结构预测数据库 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | AlphaFold Protein Structure Database(AFDB) |
| 发布方 | EMBL-EBI + Google DeepMind 合作(2021-07 首发并持续维护) |
| 现行口径 | 约 2.14 亿单蛋白结构预测(2025-10 对齐 约 2.14 亿单蛋白结构预测*(2025-10 对齐 UniProt 2025_03);官网通用口径「over 200 mill 2025_03);官网通用口径「over 200 million」 |
| 复合物扩展 | 2026-03:约 220 万同源二聚体 + 约 7.9 万异源二聚体高置信 entries;全套约 3,100 万复合物预测开放下载(4,777 proteomes) |
| isoforms/MSA | 2025-10 首次纳入蛋白 isoform 模型 + MSA(多序列比对)下载 |
| 覆盖范围 | 几乎全部 UniProt 已知蛋白序列;16 模式生物 + 30 个 WHO 优先 proteomes |
| 置信机制 | 残基级 pLDDT(0-100)+ 复合物 pTM/ipTM 接口置信 |
| 质量 | 约 35% entries 高准确 + 约 45% 多数用途可靠(官方口径) |
| 许可 | CC-BY-4.0(学术与商业可用,需署名;AF Data © 2022 DeepMind) |
| 用户规模 | 190+ 国 300 万+ 研究者;支撑 2 万+ 篇论文引用 |
| 生成模型 | 常规条目由 AlphaFold2 / AF-Multimer 生成(AF3 走 AlphaFold Server,见 §2.6) |
| 姊妹收录 | Kinetoplastid、AllTheBacteria、BFVD(病毒)、Viro3D 专题数据集 |
| 本库关联 | D(病毒)、Viro3D 专题数据集 |
| 本库关联 | PDBbind(实验结构对照)、DrugBank(成药靶点)、gnomAD(实验结构对照)、据集 |
| 本库关联 | PDBbind(实验结构对照)、DrugBank(成药靶点)、gnomAD(变异×结构) |
§0 (成药靶点)、gnomAD(变异×结构) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、版本信息与许可表述均核实自一手来源:AlphaFold DB 官网(alphafold.ebi.ac.uk,2026-09-19 检索)、EMBL 官方新闻稿(EBI-DeepMind 合作续约与 UniProt 2025_03 同步更新)、NAR 2025 数据库论文(Bertoni et al. NAR 54:D358-D362, 2026;DOI 10.1093/nar/gkaf1226;PMID 41273079)、DeepMind AlphaFold 页面,以及 Jumper 2021 / Abramson 2024(AlphaFold 3)原始论文。检索核实时间为 2026-09-19。
AFDB 的数字随更新滚动(「2 亿+」「2.14 亿」「复合物 220 万」并存),本页在各处显式标注口径时点;第三方转引的「2.41 亿」「180 万复合物」等数字来自不同统计时点,本页在 §3.6 口径对齐表逐条澄清。本页为技术参考文档,不构成生物学或医学决策依据——结构预测不是实验结构:任何基于 AFDB 模型的结合位点、突变效应或药物设计结论都应经实验验证(§2.3、§5)。
关于 AI 预测的边界:AFDB 常规条目由 AlphaFold2/AF-Multimer 生成,AlphaFold 3 的能力(配体/DNA/RNA 复合预测)与 AFDB 是两套发布体系——本页 §2.6 专述这一容易混淆的边界。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:结构生物学的「折叠革命」公共底座——几乎每个已知蛋白序列都有一条对应的预测三维结构,免费开放。
- 体量:约 2.14 亿单蛋白预测(2025-10)+ 约 220 万高置信二聚体复合物 entries(2026-03,全套约 3,100 万预测可下载)。
- 许可:CC-BY-4.0——学术与商业都能用,署名即可(与 AlphaFold 3 权重/服务的非商业限制形成鲜明对比,§2.6)。
- 杀手锏:proteome 级覆盖 + 残基级 pLDDT 置信——「序列空间的结构化」一次性完成,无序区都可读。
- 适用:结构注释与功能推断、口袋预测与虚拟筛选准备、突变效应解释、蛋白质设计参照、复合物界面假设。
- 不适用:高分辨率实验细节(配体/水分子/构象系综——用 PDB/PDBbind)、AF3 级别的蛋白-配体预测(走 AlphaFold Server)。
§1.1 摘要
2020 年 11 月,DeepMind 的 AlphaFold2 在 CASP14 上以 median GDT 92.4 的成绩「基本解决」了困扰结构生物学五十年的蛋白质折叠问题;2021 年 7 月,EMBL-EBI 与 DeepMind 合作把这一能力变成公共数据库——AlphaFold DB 上线,首期发布人类与 20 种模式生物的 35 万条结构预测。到 2025-10,AFDB 对齐 UniProt 2025_03,收录约 2.14 亿条预测,覆盖几乎全部已知蛋白序列,并首次纳入 isoform 模型与 MSA 下载;2026-03 的复合物扩展又把「分子间的相互作用」带进库:约 220 万同源二聚体与 7.9 万异源二聚体高置信结构入 entries,全套约 3,100 万复合物预测开放批量下载。
对 AI 团队,AlphaFold DB 的价值在三个维度:
- 结构表征的零成本基线:2.14 亿结构使「这个蛋白长什么样」从「数年晶体/电镜工程」变成「一次下载」——功能注释、口袋预测、突变解释的先验全部就位;canSAR 分析显示 AF 模型使可成药蛋白比例从 19.8% 翻倍到 41.8%。
- 置信度自带的诚实协议:每条结构的每个残基带 pLDDT 置信分——「哪里可信、哪里存疑」内嵌在数据格式里(b-factor 列),这是「AI 生成数据公共化」的置信工程教科书。
- 开放许可的极限规模:CC-BY-4.0 + 190 国 300 万用户——AFDB 是「AI 大模型产物作为公共科研基础设施」的全球首例与标杆。
数据的第一性事实:预测结构 ≠ 实验结构——pLDDT 高只说明模型自洽,不保证物理正确;无序区低 pLDDT 是信息不是缺陷。用 AFDB 的方法论核心是「带置信度用结构」(§2.2、§6.5)。
§1.2 战略价值
- 实验结构空白的系统性填补:PDB 实验结构约 23 万条 vs AFDB 2.14 亿预测——三个数量级的缺口被一次填平;结构生物学从「选靶点解析」转向「对预测结果做实验验证」的范式迁移。
- 药物发现的靶点面扩容:可及口袋预测从实验结构扩展到全蛋白质组——canSAR 口径的可成药蛋白比例翻倍(19.8% → 41.8%);虚拟筛选的对接准备不再受限于「有没有晶体」。
- 变异解释的结构层:gnomAD/没有晶体」。
- 变异解释的结构层:gnomAD/ClinVar 的变异位点落到 AFDB 结构上做定位(活性位点/界面/折 的变异位点落到 AFDB 结构上做定位(活性位点/界面/折叠核)——变异性状解释的结构证据层从「少数有结构的蛋白」扩展到全组。
- 蛋白质设计的对照空间:设计新蛋白(Baker 线 RFdiffusion 等)需要「天然结构长什么样」的参照分布——AFDB 是最大的天然结构经验库。
§1.3 同类数据集横向对比
| 资源 | 定位 | 规模量级 | 与 AFDB 的关系 |
|---|---|---|---|
| AlphaFold DB | AF2/Multimer 预测结构(全 proteome) | 2.14 亿 + 复合物 | — |
| PDB | 实验解析结构(X-ray/冷冻电镜/NMR) | ~23 万条 | 实验金标准;AFDB 的验证与对照面 |
| PDBbind | 实验复合物结合常数 | 数万条 | 结合研究用实验数据;AFDB 提供口袋准备 |
| AlphaFold Server(AF3) | 蛋白-配体/DNA/RNA 交互预测 | 在线按条 | 能力更强但学术限制、无批量 |
| ESM Atlas(Meta) | 语言模型预测结构(宏基因组) | 6 亿+(大肠杆菌 6.5 亿序列库等) | 更大更粗——AFDB 策展度与置信工程更强 |
| BFVD / Viro3D | 病毒蛋白预测结构 | 数十万-百万级 | 已被 AFDB 收录为专题数据集 |
| ModBase/SWISS-MODEL | 同源建模 | 百万级 | 旧一代同源建模——精度与覆盖远不及 AFDB |
| AlphaMissense | 错义变异效应预测 | 全蛋白组变异 | AFDB 页面关联的变异效应层 |
§1.4 版本时间轴
2020-11 AlphaFold2 CASP14 登顶(median GDT 92.4)
2021-07 AFDB Phase 1 上线(人类 + 20 模式生物,35 万结构;Jumper Nature 2021)
2021-12 Phase 2:Swiss-Prot 全库 + 热带病 proteomes
2022-07 Phase 3:2 亿+(几乎全 UniProt 覆盖)
2024-05 AlphaFold 3 发布(Nature;AF3 与 AFDB 分轨)
2024-10 AlphaFold 化学 Nobel(Hassabis/Jumper/Baker)
2025-10 UniProt 2025_03 同步:2.14 亿 + 首次 isoforms + MSA 下载 + 入口页重设计
2026-01 NAR 2025 数据库论文(Bertoni et al. NAR 54:D358-D362)
2026-03 复合物扩展:220 万二聚体 entries + 全套约 3,100 万预测开放(EBI+DeepMind+NVIDIA+SNU)
§1.5 应用场景矩阵
- 结构注释与功能推断:未知功能蛋白 → AFDB 模型 → 域/口袋/定位比对(UniProt/InterPro 联查)。
- 口袋预测与筛选准备:可成药口袋扫描(fpocket/siteMap 类工具)→ 对接库准备 → 虚拟筛选。
- 变异效应解释:变异位点映射到结构(活性位点/界面/折叠核/IDR)——临床变异分类的结构证据。
- 复合物界面假设:二聚体 entries(ipTM 过滤)→ 蛋白互作的结构假设 → 实验验证队列。
- 蛋白质设计参照:天然结构分布参照 + 设计结果的结构合理性检查。
- 结构 ML 语料:2 亿级「序列→结构」监督对——结构预测模型/折叠评分器的训练与评测数据。
§1.6 组件全景
AFDB 的六个数据层:
- 单蛋白结构层:约 2.14 亿 mmCIF/PDB 条目——坐标 + 残基级 pLDDT(b-factor 列)+ 序列比对元数据。
- 复合物结构层:2026-03 起——约 220 万高置信二聚体 entries(同源 ~220 万/异源 ~7.9 万),全套约 3,100 万预测 bulk 下载;pTM/ipTM 置信。
- isoform 层(2025-10 新增):蛋白 isoform 模型——组织特异/剪接变体的结构差异。
- MSA 层(2025-10 新增):每条预测的多序列比对下载——进化约束分析、重评分与自定义再预测的原料。
- 专题收录层:Kinetoplastid(锥虫/利什曼)、AllTheBacteria(细菌组)、BFVD/Viro3D(病毒)——第三方 AF2/Multimer 数据集经资格审查入库。
- 服务与 API 层:网页检索/3D viewer、FTP bulk、Google Cloud 公共数据集、API(经 PDBe,2025-2026 变更中)。
§1.7 开放许可的经济学
AFDB 是「大模型产物公共化」的独特案例,其经济学结构与任何公共策展库都不同:
- 成本结构:预测算力由 DeepMind 承担(一次性批量推理),存储与运维由 EMBL-EBI 承担(公共科研经费)——没有人工策展的持续成本(对比 ChEMBL 的文献抽取与 DrugBank 的卡片维护),这是 2.14 亿条目能完全开放的物质基础。
- 许可对齐:数据 CC-BY-4.0(学术+商业)——但上游模型 AlphaFold 3 的权重与服务是学术限制/商业授权——「数据库开放、模型限制」的错位(§2.6)要求使用者区分「用数据」与「用模型」两条合规线。
- 网络效应:UniProt/PDBe/InterPro 内嵌 AF 模型——AFDB 成为蛋白质信息学的默认结构层;190 国 300 万用户形成事实标准,替代性资源(ESM Atlas)难以撼动。
- 使用者的隐性成本:数据免费但「用对」有成本——pLDDT 解读、IDR 处理、预测-实验边界的方法学投入是真实工作量(§5、§6.5)。
§1.8 AFDB 在研究流程中的定位
序列获得 → 结构表征 → 功能假设 → 药物发现 → 实验验证
│ │ │ │
│ ├─ AFDB:预测结构(秒级替代数年解析工程)
│ ├─ AFDB:口袋与域注释(可成药性初筛)
│ ├─ AFDB:复合物界面(互作假设生成)
│ └─ AFDB:变异定位(结构证据层)
└─ UniProt(序列与注释主源)→ PDB/PDBbind(实验结构验证层)
| 流程阶段 | AFDB 角色 | 典型用法 | 验收标准 |
|---|---|---|---|
| 靶点评估 | 结构可得性画像 | 有无高置信结构/口袋(pLDDT>70 区域) | 可成药性初筛有数 |
| 功能注释 | 域与定位参照 | 与已知结构比对(DALI/TM-score) | 注释可溯源到比对打分 |
| 变异解释 | 结构证据层 | 变异落点(活性/界面/核/IDR)分类 | 分类规则与 pLDDT 联动 |
| 筛选准备 | 对接结构源 | 口袋识别 + 侧链修整 + 对接库 | 与实验结构对照过偏差 |
| 实验对接 | 假设生成器 | 截短体设计/构建选择/突变验证队列 | 预测假设进入实验清单 |
定位纪律:AFDB 覆盖「结构假设」最厚,「物理化学细节」最薄——结合常数与复合物热力学交给 PDBbind/PDB(§2.3),别让预测结构背实验的锅。
§2 医学与科学背景
§2.1 结构预测革命:从 CASP 到 proteome
- CASP14 的分水岭(2020-11):AlphaFold2 median GDT 92.4——「与实验结构难以区分」的水平;此前 50 年蛋白质折叠是未解难题,GDT 从 CASP13 的 ~60 跳升近 30 分。
- 从论文到数据库(2021-07):DeepMind 开源 AF2 代码与权重的同时,与 EMBL-EBI 建库——「能力公共化」与「产物公共化」同步发生,后者影响更大(不是每个实验室都有批量推理算力)。
- proteome 级覆盖的三阶段:35 万(人类+模式生物)→ Swiss-Prot+热带病 → 2 亿+(全 UniProt)——热带病 proteomes 的 Phase 2 优先是全球健康导向的公共政策决策(利什曼/查加斯等被忽视疾病的研究者最先受益)。
- Nobel 的加冕(2024-10):Hassabis 与 Jumper(与 Baker 共享)获诺贝尔化学奖——AI 结构预测从工具变成学科基础设施。
§2.2 pLDDT:内嵌的诚实协议
- 定义:pLDDT(predicted lDDT)是残基级置信分(0-100)——预测的局部结构与「真值」的相似度期望;存储在 PDB/mmCIF 的 b-factor 列——所有结构查看器直接按色彩渲染。
- 四级语义:very high(>90,蓝):骨架与多数侧链可信;confident(70-90,青):骨架可信、侧链细节谨慎;low(50-70,黄):拓扑可能对、细节不可信;very low(<50,橙):多半是无序区(IDR)。
- 工程读法:pLDDT 是「模型自洽度」不是「物理正确性」——低同源区的高 pLDDT 也可能是系统性错误;统计口径约 35% 条目高准确、45% 多数用途可靠——剩余 20% 不是废料而是「带警示的假设」。
- 复合物的两把尺:pTM(整体折叠)与 ipTM(接口)——2026-03 复合物发布用「联合 cutoff 优先接口置信」筛假阳性:接口置信不够的二聚体预测不进 entries(但仍在 bulk 下载集里)。
§2.3 预测 ≠ 实验:边界管理
- 缺的东西:配体、水分子、离子、辅因子、翻译后修饰、构象系综、膜环境的取向——AFDB 模型是「 apo 蛋白的静态快照」。
- 对接研究的偏差:用 AF 模型做口袋对接,侧链构象是「预测态」不是「结合态」——induced fit 效应全靠对接软件自己补;文献共识是:AF 模型对接可做初筛,命中复核必须回到实验结构或重新对接(侧链重排 + 柔性)。
- ** cryptic pockets 的两面**:AF 模型能揭示实验结构没见过的口袋(canSAR 的可成药性翻倍就来自这里),但「预测有口袋」≠「物理上有口袋」——分子动力学与片段筛选是必要验证。
- 边界协议:报告 AF 模型结论时,pLDDT 域标注 + 「未考虑配体/柔性」声明 + 与最近实验结构的 RMSD 对照(若存在)三件套——审稿人查的就是这个。
§2.4 无序区(IDR):低置信是信息
- 生物学背景:真核蛋白 30%+ 区段是内在无序区(IDR)——不折叠、靠无序发挥功能(信号转导/翻译调控)。
- AF2 的读出:IDR 的 pLDDT 天然 <50——这不是预测失败,而是模型「知道这里没有唯一结构」;IDR 段的坐标应视为「示意」而非结构。
- 常见误用:把 IDR 当坏数据裁掉 → 丢失功能位点(很多磷酸化位点/线性 motif 在 IDR);把 IDR 坐标当真结构做对接/界面分析 → 假阳性。
- 正确姿势:IDR 段用「有无 + 长度 + 位置」做特征(不是坐标);IDR 区变异解释走序列层(AlphaMissense)不走结构层。
§2.5 复合物与界面:2026-03 扩展的科学意义
- 从单体到互作组:蛋白功能多在复合物中实现——AF-Multimer(AF2 时代)与 AF3(扩散架构)使多链预测成为可能;AFDB 2026-03 把它做成 proteome 级公共供给。
- 发布口径:4,777 proteomes 上的 ~19M 同源多聚体 + ~8M 异源多聚体系统预测;经接口置信联合 cutoff 筛出约 220 万同源二聚体 + 约 7.9 万异源二聚体高置信 entries;全套约 3,100 万预测(含未入 entries 的)开放 bulk——「金标准层」与「全量探索层」分开发布。
- 覆盖设计:16 模式生物 + 30 个 WHO 优先 proteomes(全球健康导向,延续 Phase 2 热带病传统)——被忽视病原体的互作组结构首次成规模可查。
- 使用纪律:entries 里的二聚体可信度高但仍是预测——界面残基的突变验证实验(丙氨酸扫描)是确认路径;bulk 全集里的低置信预测只做探索假设。
§2.6 AF3 与 AFDB:容易混淆的边界
- 两条发布线:AFDB 常规条目 = AF2/AF-Multimer 生成(批量、proteome 级、CC-BY-4.0);AlphaFold 3 = 交互预测(蛋白-配体/DNA/RNA/离子),经 AlphaFold Server 提供——学术免费、非商业限制、权重不开放。
- 2024 年的开放争议:AF3 论文(Nature 2024-05)发布时权重不公开——1000+ 科学家联名公开信抗议;DeepMind 后续开放学术使用但商业授权仍受限。
- 工程后果:想用 AF3 能力做商业产品的团队只能走授权谈判(或等待开放替代品如 Boltz 类开源模型)——而用 AFDB 数据商业落地完全合法(CC-BY)——「数据开放、模型限制」的错位是 AFDB 生态最重要的合规事实。
- AFDB 收录资格审查:第三方专题数据集必须是 AF2/AF-Multimer 生成(不是 AF3)、主题连贯、经 afdbhelp@ebi.ac.uk 审查——收录层保持「同代模型 + 统一置信协议」的一致性。
§2.7 AI 视角的科学定位
对医疗 AI,AFDB 是「序列空间的结构化先验」:任何涉及蛋白的任务(靶点评估、突变效应、互作预测、设计)都可以从 AFDB 拿到结构层的初始条件。它的短板(静态、无配体、置信≠正确)都是「预测产物」的固有属性——用它的方法论核心与 ChEMBL 同构:「带置信度用数据」——pLDDT/ipTM 过滤是 AFDB 世界的 confidence score,实验验证是唯一的闭环。
§2.8 变异 × 结构:精准医学的连接层
- 变异分类的结构证据:ACMG/AMP 分类里 PM1(热点无变异区)/PS3(功能破坏)等证据可从结构层获得——变异落点是否在活性位点/折叠核/界面(pLDDT>90 域内)直接影响致病性判断。
- AFDB 的扩展:2.14 亿结构使「任何基因的变异都能落结构」——gnomAD/ClinVar 变异 × AFDB 结构的交集分析成为临床解释的标准动作(本库 gnomAD 条目 §2 详述)。
- AlphaMissense 的衔接:DeepMind 的错义效应预测(Science 2023)与 AFDB 同源共享置信工程——序列层(AlphaMissense)+ 结构层(AFDB pLDDT)双证据是当前变异解释的最强 AI 组合。
- 陷阱:IDR 区变异别用结构层解释(§2.4);pLDDT<70 域内的「界面/口袋落点」不足以支撑 PM1 类证据。
§2.9 膜蛋白与多跨螺旋:结构质量的特殊地带
膜蛋白(GPCR/离子通道/转运体)是药物靶点的最大富集带,也是 AF 预测的特殊地带:
- 预测质量分层:单跨/少跨膜蛋白质量接近球蛋白;多跨螺旋(7-TM GPCR 等)的整体折叠普遍可信但螺旋内细节与环区(药理学关键)置信偏低——保守性来自序列(TM 段疏水约束)而非同源深度。
- 缺膜语境:AF2 无膜环境——膜蛋白的「活化态构象空间」(GPCR 的 inactive/active 切换)是预测模型的盲区;活性态研究靠实验结构(G 蛋白复合物晶体)或定制预测协议。
- 工程应对:① 多跨螺旋域的 pLDDT 门槛放宽到「TM 段>80、环区不设限」——一刀切 90 会丢掉全部 GPCR;② 构象假设(active/inactive)显式声明来源(预测 vs 实验);③ 与实验 GPCR 结构(PDB 丰富)的对照是膜蛋白项目的必做项。
- 可成药性影响:口袋扫描在 TM 束内的正交口袋(allosteric)值得跑——但「预测有」到「构象稳定有」的验证链比球蛋白更长(MD 采样 + 配体结合实验)。
§2.10 复合物生物学:为什么二聚体 entries 是里程碑
- 功能在复合物里:约半数真核蛋白以复合物形式行使功能——同源二聚体(对称/寡聚化)与异源二聚体(信号转导/酶-调节亚基)是最基本的互作单元;此前复合物结构只能靠 PDB 实验数据(覆盖 <1% 已知互作)或逐对 AF-Multimer 自跑。
- 2,700 万系统预测的意义:互作组(PPI 网络)的结构化——「哪些蛋白对可能形成稳定复合物」从实验列表变成全组画像;entries 的 ~8% 入选率本身就是「系统预测 → 高置信子集」的诚实分层。
- 假阳性的结构语义:同一细胞里不同时空调表达的蛋白对「能折叠在一起」≠「生物上相遇」——结构置信(ipTM)回答「能不能」,共表达/定位数据回答「遇不遇得到」——两类证据要分开报。
- 与 PPI 数据库的关系:BioGRID/IntAct 的实验互作是「已知互作验证面」(§5.6 L4)——AFDB entries 与实验互作的交集是双向增强:entries 给实验互作结构解释,实验互作给 entries 生物学可信度。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格 |
|---|---|
| 当前版本 | 2025-10(UniProt 2025_03 同步);复合物扩展 2026-03 |
| 单蛋白结构 | 约 2.14 亿(官网口径 over 200 million) |
| 复合物 entries | 约 220 万同源二聚体 + 约 7.9 万异源二聚体(2026-03) |
| 复合物全量 | 约 3,100 万预测(bulk 下载;含未入 entries 的低置信) |
| 系统预测底数 | ~19M 同源 + ~8M 异源多聚体预测 across 4,777 proteomes |
| isoforms | 2025-10 首次纳入 |
| MSA | 每条预测可下载(2025-10 起) |
| 置信机制 | pLDDT(残基级 0-100)+ pTM/ipTM(复合物) |
| 文件格式 | mmCIF/PDB(pLDDT 在 b-factor 列);批量 tar 包 |
| 分发 | 网页 + FTP + Google Cloud + API(经 PDBe) |
| 许可 | CC-BY-4.0(学术+商业;AF Data © 2022 DeepMind) |
| 用户规模 | 190+ 国 300 万+ 研究者;2 万+ 引用 |
| 专题收录 | Kinetoplastid / AllTheBacteria / BFVD / Viro3D |
§3.2 2025-2026 双更新的增量地图
| 维度 | 2024-05 时点 | 2025-10 更新 | 2026-03 复合物扩展 |
|---|---|---|---|
| 单蛋白 | ~2.14 亿(对齐 UniProt 2024_03) | 对齐 UniProt 2025_03 + isoforms | 持续同步 |
| 复合物 | 无(AF-Multimer 单机自跑) | 无 | 220 万二聚体 entries + 3,100 万 bulk |
| MSA | 未开放 | 开放下载 | 持续 |
| 入口页 | 旧版 | 全面重设计(domains/summary tabs) | 持续 |
| 第三方收录 | 少量 | 扩容(AllTheBacteria 等) | 持续 |
解读:2025-2026 的主题是「从单体库到互作库 + 从结构库到结构-进化联合库」——isoforms 补剪接多样性、MSA 补进化约束、复合物补相互作用——AFDB 正在从「结构查询工具」变成「蛋白质组结构-进化-互作的联合基础设施」。对使用协议的含义:2025-10 之前的老方法段要补「无 isoform/MSA 层」的版本声明,2026-03 之后的复合物结论要指明 entries/bulk 层级。
跨版本对比的警告:复合物 entries 是 2026-03 新增层——「2025 年 AFDB 复合物召回率」这类回溯性统计不存在(当时没有该层),文献综述引用旧口径复合物数字时要核查时点。
§3.3 DAIMS 数据AI就绪度评估
| 维度 D | 数据完整性 | 评分 | 说明 |
|---|---|---|---|
| D1 | 结构覆盖 | 10/10 | 几乎全 UniProt——序列空间的结构化上限 |
| D2 | 复合物深度 | 8/10 | 二聚体成规模;更高聚体在 bulk 层 |
| D3 | 置信元数据 | 10/10 | 残基级 pLDDT + pTM/ipTM——置信工程教科书 |
| D4 | 语境元数据 | 8/10 | UniProt 对齐 + MSA;缺配体/修饰语境(固有) |
| A1 | 机器可读 | 10/10 | mmCIF/PDB 标准格式 + FTP/GCloud/API |
| A2 | 文档完备 | 9/10 | FAQ + 培训模块 + NAR 论文 |
| A3 | 接入成本 | 10/10 | 免注册零门槛 |
| A4 | 更新机制 | 9/10 | UniProt 同步节奏 + 复合物大版本 |
| I1 | 指标标准化 | 9/10 | pLDDT 全库统一;跨版本可比性随 UniProt 漂移 |
| I2 | 可复现性 | 9/10 | 批量快照固定;API 变更期需锁版本 |
| M1 | 多模态对齐 | 9/10 | 序列-结构-MSA-注释四层对齐(UniProt 锚) |
| M2 | 时间序列 | 7/10 | UniProt 同步滚动;历史版本不回溯 |
| S1 | 数据安全 | 10/10 | 无个体数据 |
| S2 | 合规负担 | 10/10 | CC-BY-4.0——署名即可 |
总分:A 级(覆盖与置信工程双满分档;扣分项全部来自「预测产物」的固有边界——无配体语境与版本漂移)
§3.4 存储与计算需求
| 数据件 | 体量 | 最小分析环境 |
|---|---|---|
| 单条结构 mmCIF | 数 MB | 笔记本 + PyMOL/ChimeraX |
| 物种 proteome 批量包 | 数 GB-数十 GB | 单机 64GB 磁盘 |
| 全库 bulk | 数 TB | 对象存储 + 脚本流式处理 |
| 复合物全量(3,100 万) | 数 TB 级 | 对象存储 + 并行解析 |
| pLDDT 批量统计 | 自解析 b-factor 列 | 单机 Biopython 可行 |
AFDB 是「按需取用」友好型资源——绝大多数任务只需几个 proteome 包;全库下载只在全组统计/ML 语料场景需要。
§3.5 获取通道
- 网页:alphafold.ebi.ac.uk——UniProt accession/基因名检索、3D viewer、pLDDT 色彩渲染、域与注释标签页。
- FTP bulk:alphafold.ebi.ac.uk/downloads——按物种/ proteome 的 tar 包 + 复合物数据集(2026-03)。
- Google Cloud:公共数据集桶——云上工作流免下载(gs 路径见官方 downloads 页)。
- API:经 EBI PDBe——单条元数据与文件 URL;2025-2026 API 变更期注意公告。
- UniProt 内嵌:UniProt 条目页直接显示 AF 模型——序列注释与结构一页联查。
§3.6 口径对齐表
| 数字 | 出处口径 | 澄清 |
|---|---|---|
| over 200 million | 官网通用口径(Phase 3 起) | 稳态表述 |
| ~2.14 亿 | 2025-10 UniProt 2025_03 同步(媒体转述官方) | 精确时点口径 |
| 35 万(Phase 1)/ 2 亿+(Phase 3) | 官方发布史 | 时间轴节点 |
| ~220 万同源二聚体 + ~7.9 万异源二聚体 | 2026-03 复合物扩展(官网/官方页) | 高置信 entries |
| ~3,100 万复合物预测 | 2026-03(官网) | 全量 bulk 层 |
| ~19M 同源 + ~8M 异源系统预测 | 2026-03 合作研究口径 | 底数(含未入 entries) |
| 「2.41 亿结构 / 180 万复合物」 | 第三方媒体统计(不同时点混合) | 与官方口径不一致——不采用 |
| 300 万+ 研究者 / 190+ 国 | 官方(2025-10) | 用户规模 |
| 可成药蛋白 19.8% → 41.8% | canSAR 团队分析(第三方研究) | 口袋可及性统计 |
§3.7 版本选择纪律
- 快照锁定:批量分析锁 FTP 快照日期——UniProt 同步使条目集合滚动漂移(新序列入、旧序列合并/删除)。
- API 变更期:2025-2026 API 迁移(经 PDBe 公告)——生产代码对 API 做适配层,别裸调。
- 复合物双层的用法:entries(高置信)用于结论与发表;bulk 全量用于探索假设——两层混用是审稿雷区(§6.5)。
§3.8 pLDDT 分级工程详表
pLDDT 是 AFDB 世界的「confidence score」——按分值带建协议:
| 分值带 | 语义 | 典型情形 | 使用建议 |
|---|---|---|---|
| >90(very high) | 骨架+多数侧链可信 | 折叠域核心、有同源序列支撑区 | 结构结论/口袋/界面分析金标准 |
| 70-90(confident) | 骨架可信、侧链谨慎 | 域外围、环区 | 对接前侧链重排;结论带警示 |
| 50-70(low) | 拓扑存疑 | 跨域连接区、弱同源区 | 只做拓扑假设;别取坐标细节 |
| <50(very low) | 多半为 IDR | 无序区 | 用「有无/长度/位置」特征;不用坐标 |
| ipTM(复合物) | 接口置信 | 二聚体 entries 筛选用 | entries 已过联合 cutoff;bulk 需自行过滤 |
- 统计基准:全库约 35% 高准确 + 45% 多数用途可靠——你的子集分布若显著偏离(如全高置信的热门蛋白),先检查选择偏倚。
- 域级联动:pLDDT 与 UniProt 域注释(InterPro/Pfam)联查——「域内 >90」是结构证据的最低门槛(§2.8)。
- pLDDT ≠ RMSD:pLDDT 是自洽期望不是与实验的偏差——有实验结构的蛋白,对照 RMSD 才是校准(§5.6)。
§4 数据结构
§4.1 文件与条目结构
AlphaFold DB 条目结构(mmCIF 视角)
├── 条目 ID:AF-{UniProt accession}-F1(复合物:多链 F 模型)
├── _atom_site
│ ├── 坐标 x/y/z # 全原子(重原子;AF2 无氢键力场语境)
│ └── B_iso_or_equiv # ★ pLDDT(0-100)——AFDB 的置信列
├── _entity / _struct_asym # 链与实体(复合物多链)
├── 元数据
│ ├── 序列(与 UniProt 一致)
│ ├── pLDDT 直方图 / 全局 pLDDT
│ ├── MSA 下载链接(2025-10 起)
│ └── 版本与生成模型标识(AF2/AF-Multimer)
└── 分发形态
├── 单条:网页下载 / API
├── 物种包:proteome tar(UP{taxid} 命名)
├── 复合物:entries + 全量 bulk(2026-03)
└── 云:Google Cloud 公共桶
pLDDT 在 b-factor 列是 AFDB 的关键设计——所有标准结构工具(PyMOL/ChimeraX/Biopython)零改造即可读置信度。
§4.2 批量下载与 proteome 包处理
#!/usr/bin/env bash
# 从 AFDB FTP 拉取一个物种的 proteome 包并解压(以人类为例;以官方 downloads 页路径为准)
set -euo pipefail
BASE="https://ftp.ebi.ac.uk/pub/databases/alphafold/"
# v4 形态:按 UP{taxid} 命名的 proteome 包
wget -c "${BASE}v4/UP000005640_9606_human.tar" # 人类 proteome(数十 GB)
mkdir -p human_af && tar -xf UP000005640_9606_human.tar -C human_af
ls human_af | head -3
# AF-P00533-F1-model_v4.cif ← EGFR;文件名含 UniProt accession 与模型版本
# 复合物数据集(2026-03):entries 与全量 bulk 分开发布(路径见官方 downloads 页)
- 版本对齐:文件名
model_v4是 AFDB 模型版本——跨版本比较结构时锁定 v 号。 - 磁盘策略:tar 包不解压也能流式读取(
tar -xOf取单条)——全组扫描别全解压。
§4.3 单条抽取与 pLDDT 解析
#!/usr/bin/env python3
"""AFDB 单条结构下载 + pLDDT 统计:任何靶点 30 秒画像。"""
import urllib.request
import io
import numpy as np
def fetch_af_entry(uniprot_acc: str, version: int = 4) -> bytes:
url = (f"https://alphafold.ebi.ac.uk/files/"
f"AF-{uniprot_acc}-F1-model_v{version}.cif")
return urllib.request.urlopen(url, timeout=60).read()
def plddt_stats(cif_bytes: bytes) -> dict:
"""从 mmCIF 的 B-factor 列抽 pLDDT(b-factor 列即 pLDDT)。"""
import gemmi # pip install gemmi;或用 Biopython MMCIF2Dict
st = gemmi.cif.read_string(cif_bytes.decode()).sole_block()
b = np.array([float(x) for x in st.get_mmcif_category("_atom_site")["B_iso_or_equiv"]])
return {
"mean_plddt": round(float(b.mean()), 1),
"pct_above_90": round(float((b > 90).mean() * 100), 1),
"pct_above_70": round(float((b > 70).mean() * 100), 1),
"pct_below_50": round(float((b < 50).mean() * 100), 1), # IDR 占比
}
if __name__ == "__main__":
raw = fetch_af_entry("P00533") # EGFR
print(plddt_stats(raw))
# {'mean_plddt': 91.x, 'pct_above_90': ~86, 'pct_below_50': ~1} —— 胞内激酶域高置信的典型画像
§4.4 变异位点结构映射
#!/usr/bin/env python3
"""把变异列表映射到 AFDB 结构:残基落点的 pLDDT 域分类(§2.8 协议)。"""
import numpy as np
def classify_variant(position: int, plddt_arr: np.ndarray) -> str:
"""plddt_arr: 按残基序号对齐的 pLDDT 数组(1-based)。"""
p = plddt_arr[position - 1]
if p > 90: return "structured_high" # 结构证据可用(域内)
if p > 70: return "structured_caution" # 可用但带警示
if p > 50: return "topology_only" # 只做拓扑参考
return "idr_or_low" # IDR——转序列层证据(AlphaMissense)
def plddt_by_residue(cif_path: str) -> np.ndarray:
"""从 mmCIF 提取逐残基 pLDDT(CA 原子代表)。"""
import gemmi
st = gemmi.read_structure(cif_path)
return np.array([res[0][ "CA" ].b_iso if "CA" in res[0] else np.nan
for res in st[0]["A"]])
- 临床衔接:分类结果对接 ACMG 证据(structured_high + 活性位点/界面 → PM1 候选);IDR 落点显式转序列层。
- 对齐陷阱:AFDB 序列与转录本 isoform 一致性要核(2025-10 起 isoform 模型分列)——错 isoform 会整体错位。
§4.5 与 UniProt/PDBe 的对齐
- 键:UniProt accession 是 AFDB 的主键——序列注释、域(InterPro)、变异(UniProt 变异页)都在同一 ID 下联查。
- 实验结构对照:PDBe 按 UniProt 取实验结构列表——AF 模型与实验结构的 RMSD 对照是校准协议(§5.6)的第一步。
- 域对齐:InterPro/Pfam 域边界 × pLDDT 分布——「域内高置信」画像的原料。
§4.6 元数据与版本指纹
- 模型版本:文件名 model_v{N} + 官方公告——方法段写「AFDB v4(2025-10 快照,UniProt 2025_03)」。
- 复合物双层声明:用 entries 还是 bulk——结论层必须写明(§2.5)。
- 第三方收录标注:BFVD/Viro3D 等专题集的数据版权归属各自团队——引用时分开标注。
§4.7 完整性清单
- [ ] 模型版本(v4)+ 快照日期写入方法段
- [ ] pLDDT 过滤门槛(>70?>90?)声明
- [ ] IDR 处理协议(裁剪 or 特征化)说明
- [ ] 与实验结构(若存在)的 RMSD 对照
- [ ] 复合物用 entries/bulk 哪层声明
- [ ] isoform 一致性核对
- [ ] 专题收录(BFVD 等)与主库分开标注
- [ ] 「预测非实验」limitation 段落
§4.8 数据血缘
UniProt 序列库(2025_03)
→ AlphaFold2 / AF-Multimer 批量推理(DeepMind 算力)
→ pLDDT/pTM/ipTM 置信计算
→ 复合物接口置信联合 cutoff(2026-03 筛选)
→ EMBL-EBI 托管与分发(FTP/GCloud/API/网页)
→ 第三方专题集(AF2/Multimer 资格审查后收录)
「序列 → 预测 → 置信 → 分发」四级血缘全部可追溯——与实验库(PDB 的实验方法/分辨率元数据)对照使用时,两条血缘各自独立成立。
§4.9 复合物 entries 解析:界面残基提取
#!/usr/bin/env python3
"""AFDB 复合物 entry(2026-03)解析:链、界面残基与 ipTM 处理。
复合物文件同样为 mmCIF;pLDDT 仍在 b-factor 列,界面分析需先识别链间接触。"""
import numpy as np
import gemmi
def parse_complex(cif_path: str) -> dict:
st = gemmi.read_structure(cif_path)
model = st[0]
chains = [ch.name for ch in model]
# 链间界面粗筛:CA-CA 距离 < 8Å 的残基对数(全原子精算前的低成本两级实现)
ca = {ch.name: np.array([[p.pos.x, p.pos.y, p.pos.z] for p in ch if "CA" in p[0]])
for ch in model}
interface = {}
for i, a in enumerate(chains):
for b in chains[i + 1:]:
if a in ca and b in ca:
d = np.linalg.norm(ca[a][:, None, :] - ca[b][None, :, :], axis=-1)
n_pairs = int((d < 8.0).sum())
interface[f"{a}-{b}"] = {"n_ca_pairs_lt8A": n_pairs,
"candidate_interface": bool(n_pairs > 30)}
return {"chains": chains, "interfaces": interface}
def residue_plddt_profile(cif_path: str, chain: str = "A") -> np.ndarray:
st = gemmi.read_structure(cif_path)
return np.array([res[0]["CA"].b_iso if "CA" in res[0] else np.nan
for res in st[0][chain]])
- 工程要点:复合物的界面判定用「CA 距离粗筛 + 全原子精算」两级——直接全原子逐对在 2,200 万 entries 规模下不可行。
- 与置信联动:界面残基的 pLDDT 分布(是否 >70)是「界面假设质量」的第二道筛——ipTM 高但界面残基低置信的 entry 仍需谨慎。
- 规模提示:entries 批量处理是万级 mmCIF——用对象存储 + 流式解析(gemmi 读单文件内存友好);bulk 全量 3,100 万只建议抽取子集。
§4.10 MSA 下载与重评分的最小示例
#!/usr/bin/env python3
"""AFDB 官方 MSA 的获取与基本使用(2025-10 起开放)。
MSA 是 A3M 格式——可喂给重评分器/自定义预测管线/共进化分析。"""
import urllib.request, gzip, io
def fetch_msa(uniprot_acc: str) -> str:
"""拉取官方 MSA(A3M)。具体 URL 模板以 AFDB 条目页/文档为准(API 迁移期)。"""
url = (f"https://alphafold.ebi.ac.uk/api/prediction/{uniprot_acc}")
import json
meta = json.loads(urllib.request.urlopen(url, timeout=60).read())
msa_url = meta[0].get("msaUrl") or meta[0].get("annotationsUrl")
return gzip.decompress(urllib.request.urlopen(msa_url, timeout=120).read()).decode()
def msa_summary(a3m_text: str) -> dict:
lines = [l for l in a3m_text.splitlines() if l and not l.startswith("#")]
seqs, depth = lines[1::2], 0
for s in seqs:
if not s.startswith(">"):
depth += 1
return {"n_sequences": depth,
"first_target_len": len(seqs[0]) if seqs else 0}
if __name__ == "__main__":
text = fetch_msa("P00533")
print(msa_summary(text)) # depth 高 = 同源深 = 预测更可信的间接信号
- MSA 深度是置信的第二来源:同源序列数(depth)与 pLDDT 正相关——「高 pLDDT + 深 MSA」双证据的结构假设最硬。
- API 迁移期注意:2025-2026 API 变更期 URL 模板以官方文档为准——生产代码对 API 响应字段做防御性解析(§5.5 坑点 7 关联)。
- 重评分的边界:官方模型 + 官方 MSA + 自定义重排的产物不再是「AFDB 产物」——报告时要区分原始快照与再处理层(§6.7 之 3)。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用哪些数据件 | 关键过滤 | 陷阱 |
|---|---|---|---|
| 结构画像 | 单条 mmCIF + pLDDT | >70 区域统计 | IDR 当坏数据裁掉 |
| 口袋预测 | pLDDT>90 域 | fpocket/siteMap | 侧链不重排直接对接 |
| 变异解释 | pLDDT_by_residue + UniProt 变异 | 域内>90 | IDR 区做结构解释 |
| 互作假设 | 复合物 entries | ipTM cutoff | bulk 低置信当结论 |
| 设计参照 | proteome 包子集 | 与设计目标同家族 | 新颖性误判(同源入库) |
| ML 语料 | bulk 子集 + MSA | 按版本快照 | 跨快照混合训练 |
§5.2 结构获取与准备协议
- 取结构:UniProt accession → AFDB 单条下载(§4.3)→ pLDDT 画像先行(判断可用域)。
- 域裁剪:pLDDT>70 连续段为分析域;<50 段默认裁剪(除非研究 IDR 本身)。
- 侧链修整:对接前对 70-90 区做侧链重构(旋转异构库)+ 能量最小化——预测态侧链是最大偏差源。
- 实验对照:有实验结构的域——先算 RMSD,偏差大(>2Å Cα)的域用实验结构替换。
- 记录协议:裁剪边界/修整步骤/对照结果全进方法段——可复现三件套。
§5.3 口袋与对接协议
- 口袋扫描:fpocket/DoGSiteScorer 在高置信域上跑——pLDDT<70 区的口袋不进候选。
- cryptic 口袋协议:AF 模型口袋 + MD 松弛(10-100ns)复核——「预测有」与「动力学稳定有」分两步报。
- 对接管线:口袋侧链重排 → 刚性对接初筛 → 柔性精修 → 与实验结构(若有)的对接模式对照。
- 富集评估:已知活性分子(ChEMBL/PDBbind)做早期富集(EF1%)——AF 结构对接管线的标准评估。
§5.4 成本模型
| 场景 | 技术路线 | 成本量级 |
|---|---|---|
| 单蛋白画像 | API + gemmi | 零;秒级 |
| 物种 proteome 扫描 | FTP 包 + 并行解析 | 单机;小时级 |
| 口袋+对接管线 | AF 结构 + MD 松弛 | 工作站/GPU;天级 |
| 复合物假设队列 | entries + 界面分析 | 单机;天级 |
| 全库 ML 语料 | GCloud + 对象存储 | 云存储费;周级 |
§5.5 失败模式清单
- pLDDT 当准确率:高置信区也可能系统性错误(无同源支撑的新折叠)——有实验结构必对照。
- IDR 当废料:裁掉 IDR 丢功能位点——IDR 特征化(§2.4)不是删除。
- 预测侧链直接对接:结合态侧链构象偏差——重排+最小化是前置步骤。
- bulk 低置信复合物当结论:3,100 万全量里大量假阳性——结论只用 entries 层。
- isoform 错位:变异映射到错 isoform 模型——序列一致性必核。
- 跨快照混拼:新旧版本条目集合漂移——锁单一快照。
- AF3 能力误挂 AFDB:AFDB 没有配体/核酸复合预测——AF3 需求走 Server/授权(§2.6)。
- 新颖性误判:设计结果与 AFDB 同源不判新——同源检索(TM-score)前置。
§5.6 校准与验证协议
| 验证层 | 数据源 | 指标 | 通过线(参考) |
|---|---|---|---|
| L1 域级校准 | PDBe 实验结构对照 | Cα RMSD(pLDDT>90 域) | 中位 <1Å;>2Å 域替换 |
| L2 口袋校准 | PDBbind 口袋注释 | 口袋检出率/重叠率 | 高置信域检出 ≥80% |
| L3 对接校准 | PDBbind 复合物 | EF1%/top-1 姿态 | 与实验结构管线差距可解释 |
| L4 互作校准 | BioGRID/IntAct 已知互作 | entries 复合物召回 | 分层报告(同源/异源) |
| L5 变异校准 | ClinVar 致病/良性分层 | 结构特征分离度 | 致病变异富集于功能域 |
| L6 前瞻衔接 | 实验合作/文献对照 | 假设验证率 | 与预测排序正相关 |
- L1 是根基:任何「AF 结构做重大结论」的研究,L1 对照表是审稿第一问——按域报 RMSD 分布而不是全链均值。
- L4 的分层:已知互作中「有复合物 entry 的召回率」是 2026-03 数据集实用性的直接度量——同源/异源分开(异源更难)。
- L5 的谨慎:结构特征分离度是关联证据不是因果——ACMG 证据等级按规则映射,不越级。
§6 实证结果与方法学分析
§6.1 2026-03 复合物扩展的核心信号
- 规模信号:4,777 proteomes 上约 2,700 万系统预测(~19M 同源 + ~8M 异源)——蛋白质互作组的结构化第一次达到 proteome 级公共供给。
- 方法信号:接口置信联合 cutoff 的筛选设计——「宁可 entries 少、不可假阳性混入」的金标准纪律;~220 万 entries 只占系统预测的 ~8%——保守筛选是这份数据可信度的来源。
- 合作信号:NVIDIA(算力)+ 首尔国立大学(Steinegger 团队,线性时间互作预测方法)加入——公共数据库的「多主体工程协作」新模式。
- 公平信号:30 个 WHO 优先 proteomes 的覆盖——全球健康导向延续 Phase 2 传统。
§6.2 结构预测公共化的实证教训
- 「预测过剩」不成立:2.14 亿结构发布后,实验结构生物学没有失业——PDB 沉积量上升(验证+复合物+动态过程)——预测与实验是互补分工不是替代。
- 置信工程的胜利:pLDDT 内嵌 b-factor 的设计使「AI 产物可信度」成为数据格式的一部分——后来的 AI 数据集(包括本库各条目)都在复制这个模式。
- 可成药性的翻倍:canSAR 19.8% → 41.8% 的口径变化改写了靶点评估的默认假设——「没有结构」不再是不做的理由。
- AF3 争议的教训:能力开放(Server)≠ 产物开放(AFDB)≠ 权重开放(未)——三层开放度要分开评价,社区抗议聚焦的「可复现性」权重层至今未解。
§6.3 方法学三层框架(gsm)
- G(Ground layer):序列与预测坐标 + pLDDT——机器产物,自洽可证。
- S(Synthesis layer):域注释/口袋/界面/变异落点——分析推断层(依赖工具与协议)。
- M(Medical layer):变异致病性/可成药结论/互作功能——临床与药理语义层(需实验证据闭环)。
越层引用是常见错误:拿 G 层高 pLDDT 说「界面存在」(S 层要有 ipTM 与对照)、拿 S 层口袋说「可成药」(M 层要有活性证据)——审稿按层问责。
§6.4 接力实验设计
- AFDB → PDB/PDBbind:假设结构 → 实验结构/结合常数复核(L1/L3 协议)。
- AFDB → ChEMBL/DrugBank:口袋假设 → 已知配体/成药语义检索(虚拟筛选闭环)。
- AFDB → gnomAD/ClinVar:变异落点 → 群体频率与致病分类(§2.8)。
- AFDB → AlphaFold Server(AF3):单体假设 → 加配体/DNA 的交互精修(学术范围内)。
§6.5 八个真实坑点
- 坑点 1:pLDDT 当正确率——高置信 ≠ 物理正确;无实验对照的结论降级为「假设」。
- 坑点 2:IDR 全裁——丢功能位点与线性 motif;IDR 是特征层。
- 坑点 3:预测侧链直接对接——结合态偏差;重排+最小化前置。
- 坑点 4:bulk 复合物当 entries 用——低置信互作进结论;双层纪律(§3.7)。
- 坑点 5:isoform 错配——变异映射整体错位;序列一致性核对前置。
- 坑点 6:跨快照混用——UniProt 同步漂移;锁快照日期。
- 坑点 7:AFDB/AF3 混淆——能力与许可两套体系;商用方案分开规划。
- 坑点 8:新颖性不查同源——设计/筛选结果先过 AFDB 同源检索再谈「新」。
§6.6 审稿人自查清单
- [ ] AFDB 模型版本 + 快照日期写入方法段?
- [ ] pLDDT 过滤门槛与 IDR 处理协议声明?
- [ ] 有实验结构的域做了 RMSD 对照?
- [ ] 对接前侧链修整步骤报告?
- [ ] 复合物结论用 entries 层(非 bulk)?
- [ ] 「预测非实验」limitation 段落?
- [ ] AFDB(数据)与 AF3(服务)的使用边界分开声明?
- [ ] 复现包含结构版本与脚本哈希?
§6.7 版本演进的方法学含义
- UniProt 同步的漂移:条目集合随序列库滚动——跨版本的全组统计(口袋数/IDR 占比)不可直接比,要声明快照对。
- isoforms 的加层(2025-10):剪接变体进入结构层——组织特异变异解释的分辨率提高,但「主链 vs isoform 模型」的选择要写进协议。
- MSA 开放的连锁:第三方可用官方 MSA 重评分/再预测——「官方模型 + 官方 MSA + 自定义重排」的混合管线兴起,置信协议要区分模型产物与再处理产物。
- 复合物双层发布(2026-03):「金标准 entries + 全量 bulk」的发布模式很可能成为后续大库的模板——使用协议里两层的边界就是未来的审稿标准。
§7 AI 就绪指南与应用场景
§7.1 AFDB 在医疗 AI 中的四种喂法
- 结构表征喂法:pLDDT 分域特征 + 几何描述子——靶点画像/可成药性模型的输入层。
- 空间先验喂法:变异落点/口袋/界面的空间关系——临床变异解释与互作预测模型的先验。
- 监督对喂法:「序列→结构」2 亿级对——结构预测/折叠评分模型的训练语料(ESM 类模型的评测域)。
- 复合物图喂法:二聚体 entries 的界面残基图——PPI 预测/界面设计的图神经网络语料。
四种喂法与 §6.5 坑点的对应:喂法 1 踩坑 1(pLDDT)与坑 2(IDR);喂法 2 踩坑 5(isoform);喂法 3 踩坑 6(快照);喂法 4 踩坑 4(bulk)——建模前回读对号。
§7.2 靶点结构画像管线实操配方
#!/usr/bin/env python3
"""批量靶点结构画像:AFDB 下载 → pLDDT 分域 → 口袋可成药特征 → TSV。"""
import concurrent.futures as cf
import urllib.request, io, json
import numpy as np
import gemmi
TARGETS = ["P00533", "P15056", "P04637"] # EGFR / BRAF / p53
def fetch(acc: str, version: int = 4) -> bytes:
url = f"https://alphafold.ebi.ac.uk/files/AF-{acc}-F1-model_v{version}.cif"
return urllib.request.urlopen(url, timeout=60).read()
def profile(acc: str) -> dict:
st = gemmi.cif.read_string(fetch(acc).decode()).sole_block()
b = np.array([float(x) for x in
st.get_mmcif_category("_atom_site")["B_iso_or_equiv"]])
return {"uniprot": acc,
"n_res": int(b.size),
"mean_plddt": round(float(b.mean()), 1),
"pct_high": round(float((b > 90).mean() * 100), 1), # 金标准域
"pct_mid": round(float(((b > 70) & (b <= 90)).mean() * 100), 1),
"pct_idr": round(float((b < 50).mean() * 100), 1)} # IDR 占比
if __name__ == "__main__":
with cf.ThreadPoolExecutor(4) as ex:
rows = list(ex.map(profile, TARGETS))
json.dump(rows, open("afdb_profiles.tsv.json", "w"), ensure_ascii=False, indent=1)
print(*rows, sep="\n")
(画像输出直接对接 §5.2 协议——pct_idr 高的靶点先做 IDR 策略决策再进下游。)
§7.3 模型选型与迁移决策
- 口袋/可成药性:几何特征(pocket 描述子)+ 梯度提升——小样本可成药标注(canSAR 类)下 GBDT 王道。
- 变异效应:结构特征 + 序列特征(AlphaMissense 分)+ 进化保守性融合——单一来源都逊于组合。
- PPI/界面预测:entries 复合物图 + 语言模型嵌入——图模型在 ipTM 分层监督下收益最大。
- 结构生成/设计:AFDB 作天然分布参照——设计评估的「天然性」判别器训练域。
- 不确定性:pLDDT 本身是不确定性——下游模型应把它当输入特征而不是丢掉,等价于 ChEMBL 的 confidence 协变量(§7.4 对应)。
§7.4 公平性:覆盖不均的工程应对
- 家族偏倚:球蛋白/酶类结构质量优于膜蛋白/多跨螺旋——分家族报性能,膜蛋白结论降级。
- 物种偏倚:模式生物 proteome 质量高于边缘物种(同源深度)——跨物种迁移时按同源深度分层。
- 长度偏倚:长链蛋白(多域+IDR)的 mean pLDDT 系统性偏低——按「pLDDT>90 域数」而不是均值做比较。
- 权威声明:AFDB 无个体数据——公平性维度是「生物类群覆盖」不是人群公平;但下游医学应用(变异解释)的人群公平要单独评估(gnomAD 条目 §7.4)。
§7.5 任务×资源速查表
| AI 任务 | AFDB 数据 | 输出形态 | 验收 |
|---|---|---|---|
| 可成药性分类 | 画像特征 + 口袋 | 分类器 | canSAR 口径对照 |
| 变异致病融合 | 落点特征 + AM 分 | 融合分类器 | ClinVar 分层验证 |
| PPI 预测 | entries 界面图 | 链接预测 | BioGRID 召回分层 |
| 结构质量评估 | pLDDT + 几何 | 回归/评分 | 与 RMSD 相关性 |
| 设计天然性判别 | proteome 子集 | 判别器 | 与实验结构区分度 |
| MSA 重评分 | 官方 MSA | 重评分器 | 官方模型对照 |
§7.6 端到端案例:冷门激酶的可成药性评估
- 输入:某被忽视病原体激酶(WHO 优先 proteome 内)——无实验结构。
- 画像:§7.2 管线 → 催化域 pLDDT>90(金标准)、ATP 口袋区高置信、C 端 IDR 15%。
- 口袋:fpocket 扫描高置信域 → ATP 位点检出 → 与人源激酶口袋对比(选择性设计空间)。
- 对照:同家族人源激酶实验结构(PDB)做 RMSD 对照 → 激酶域 <1.2Å → 结构假设升级。
- 筛选:ChEMBL 已知激酶抑制剂相似度检索 → 命中列表 → 实验验证队列。
- 报告:版本快照 + pLDDT 域图 + 对照表 + 「预测假设待实验确认」声明——四件套齐。
§7.7 报告模板:方法学段落骨架
结构预测来自 AlphaFold DB(EMBL-EBI/Google DeepMind;模型版本 v4,2025-10 快照对齐 UniProt 2025_03;Bertoni et al., NAR 54:D358-D362, 2026)。分析限定 pLDDT > 90 的连续结构域;pLDDT < 50 区段按内在无序区(IDR)处理,仅保留「有无/长度/位置」特征。存在实验结构的对应域(PDB 检索于 2026-XX-XX)先行 Cα RMSD 对照(中位 X.XÅ)。口袋预测采用 fpocket(参数 P1)于高置信域;对接前对 pLDDT 70-90 区侧链进行旋转异构重构与能量最小化。复合物分析仅采用 AlphaFold DB 2026-03 发布的高置信二聚体 entries(接口置信联合 cutoff)。预测结构与实验结构的差异及配体/柔性语境的缺失已在局限中声明;复现包含模型版本、快照日期与全部脚本哈希。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 取结构 | 单条/包下载 + 画像 | 存储 | 0.5-1 天 |
| 域裁剪 | pLDDT 分域 + 对照 | 人力 | 2-3 天 |
| 口袋/对接 | 扫描 + 修整 + 对接 | 工作站/GPU | 1 周 |
| 复合物 | entries 界面分析 | 单机 | 3-5 天 |
| 校准 | L1-L5 协议 | 算力 + 人力 | 1 周 |
| 复现包 | 版本 + 脚本 + 对照表 | 人力 | 1-2 天 |
AFDB 项目的瓶颈在校准不在获取——「结构假设 → 实验对照」的闭环质量决定工作档次。
§7.9 消融案例:变异致病分类的结构特征贡献
变异解释是 AFDB 医学价值最集中的场景——结构特征的边际贡献一组典型消融:
| 配置 | 特征集 | ClinVar 分层 AUC(示意) | 诊断 |
|---|---|---|---|
| R1 | 仅序列保守性 | 基线 | 传统进化证据 |
| R2 | R1 + AlphaMissense 分 | 显著提升 | 序列层 AI 证据强 |
| R3 | R2 + 结构落点(域/位置类别) | 小幅稳定提升 | 结构层在功能域内增益 |
| R4 | R3 + IDR 处理协议(落点重分类) | 消除 IDR 假阳性 | 协议修正比加特征更值钱 |
- 方法:同一 ClinVar 子集(错义、pLDDT 全域覆盖),五折分层 CV;结构特征按 §4.4 协议提取;R4 把 IDR 落点从「结构特征缺失」改为显式类别。
- 读数:R2→R3 的增益集中在 pLDDT>90 的功能域内变异——结构层价值不是全局的,是「域条件化」的;R3→R4 说明 IDR 协议错误是这类管线最常见的隐性 bug。
- 结论:结构特征进临床分类器必须带 pLDDT 条件化与 IDR 协议——「裸落点特征」的增益会被 IDR 假阳性吃掉。
§8 伦理、许可与合规
§8.1 许可结构
- 数据 CC-BY-4.0:学术与商业均可使用、可再分发、可修改——义务是署名(引用 Bertoni 2025 + 「AlphaFold Data © 2022 DeepMind Technologies Limited」)。
- 模型 ≠ 数据:AF2 代码/权重按其开源许可(可商用);AF3 权重与 Server 非商业限制——「用 AFDB 数据」与「用 AF3 预测新结构」是两条合规线,产品方案里分开写。
- 第三方专题集:BFVD/Viro3D/Kinetoplastid 等的版权归属各自团队——再分发时逐集核对声明。
§8.2 引用与致谢模板
致谢模板(按需裁剪):
Structure predictions were obtained from the AlphaFold Protein Structure
Database (EMBL-EBI and Google DeepMind; Bertoni D, et al. AlphaFold Protein
Structure Database 2025. Nucleic Acids Res 54, D358-D362, 2026. DOI
10.1093/nar/gkaf1226), distributed under CC-BY-4.0. AlphaFold Data
Copyright (2022) DeepMind Technologies Limited. We thank EMBL-EBI and
Google DeepMind for making proteome-scale predictions openly available.
§8.3 国内合规路径
- 数据性质:预测结构数据——无个体信息、无 HGRAC 问题;下载与使用无额外审批需求。
- 产品化:CC-BY-4.0 允许商用——结构服务/注释工具内嵌 AFDB 合法,署名义务写进产品文档。
- 红线:① 学术诚信——预测结构标注「预测」出售或冒充实验解析是造假;② AF3 非商业限制不可绕过(境内同样适用其服务条款)。
§8.4 商业使用边界
AFDB 的 CC-BY-4.0 使「结构数据商业化」无许可摩擦——商业产品的 attribution 页(版本 + 论文 + 许可链接)是标配。需要商业评估的是上游:基于 AF3 权重/Server 的商业服务(授权谈判)与基于 AF2 的自建管线(开源许可,可行)——三条路径的成本结构完全不同,选型先于开发。
§8.5 合规台账最小模板
| 台账项 | 记录内容 | 示例 |
|---|---|---|
| 数据快照 | 模型版本 + 快照日期 | v4;2025-10(UniProt 2025_03) |
| 署名位置 | attribution 页 + 论文引用 | 产品「关于」页;Bertoni 2026 |
| AF 数据声明 | DeepMind 版权声明位置 | 文档页固定条款 |
| AFDB/AF3 分界 | 用了哪些能力、哪些是 AF3 | AFDB 数据;无 AF3 依赖 |
| 第三方专题集 | BFVD 等的版权核对 | 逐集声明存档 |
| 版本升级策略 | UniProt 同步触发 | 半年评估;基线重跑 |
| 复现包存档 | 快照指纹 + 脚本哈希 | 对象存储路径 |
§9 谱系与生态
§9.1 结构资源时间线
1971 PDB 创立(实验结构库;此后 50 年的结构金标准)
2018 AlphaFold1(CASP13;DeepMind 入场)
2020 AlphaFold2 CASP14 登顶(GDT 92.4)
2021-07 AFDB Phase 1(人类+20 模式生物;35 万)
2022-07 AFDB Phase 3(2 亿+;全 UniProt 覆盖)
2024-05 AlphaFold 3(Nature;Server 学术限制)
2024-10 AlphaFold 化学 Nobel
2025-10 UniProt 2025_03 同步 + isoforms + MSA 开放
2026-01 NAR 2025 数据库论文
2026-03 复合物扩展(220 万二聚体 entries;3,100 万 bulk)
§9.2 术语表
| 术语 | 定义 |
|---|---|
| AFDB | AlphaFold Protein Structure Database |
| pLDDT | 残基级预测置信分(0-100;存于 b-factor 列) |
| pTM / ipTM | 全局/接口折叠置信(复合物) |
| IDR | 内在无序区(pLDDT<50 的常见来源) |
| isoform | 剪接变体蛋白(2025-10 入库) |
| MSA | 多序列比对(进化约束的原料) |
| proteome 包 | 按物种打包的全蛋白结构集(UP{taxid}) |
| entries / bulk | 复合物高置信层 / 全量层(2026-03) |
| AF-Multimer | AF2 的多链复合物扩展 |
| cryptic pocket | 实验结构未见的潜在口袋 |
| GDT | 全局折叠相似度打分(CASP 指标) |
| RMSD | 坐标均方根偏差(与实验对照的度量) |
| canSAR | 癌症药物发现集成平台(可成药统计来源) |
| AlphaMissense | DeepMind 错义变异效应预测 |
| BFVD / Viro3D | AFDB 收录的病毒预测结构专题集 |
| CC-BY-4.0 | AFDB 数据许可(学术+商业) |
§9.3 资源选型决策树
你的需求是什么?
├─ 「看一个蛋白的结构」
│ → AFDB 网页(秒级;UniProt accession 直查)
├─ 「可成药口袋/对接准备」
│ → AFDB 高置信域 + fpocket + 侧链修整(§5.3)
├─ 「结合常数/复合物热力学」
│ → PDBbind(实验数据;AFDB 不提供)
├─ 「蛋白-配体/DNA 交互预测」
│ → AlphaFold Server(学术)或授权(商业)——非 AFDB
├─ 「变异致病结构证据」
│ → AFDB pLDDT 分域 + AlphaMissense(§2.8)
├─ 「互作组假设」
│ → 2026-03 复合物 entries(bulk 只做探索)
├─ 「宏基因组/病毒结构」
│ → AllTheBacteria / BFVD / Viro3D 专题集
└─ 「实验结构下载」
→ PDB/PDBe(AFDB 是预测库不是实验库)
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| PDBbind | 实验结合常数——AFDB 口袋假设的验证层 |
| drugbank | 成药语义——AFDB 可成药画像的语义核对 |
| gnomad | 群体变异——AFDB 结构落点的变异来源 |
| chembl | 已知活性——口袋假设的配体验证面 |
| UniProt(外部) | 序列与注释主源——AFDB 的对齐锚 |
| clinicaltrials-gov | 靶点药物的现实性核查 |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| 靶点评估全链 | AFDB(结构)+ ChEMBL(配体)+ DrugBank(语义) | 假设 + 证据 + 叙事 |
| 变异解释 | AFDB(结构层)+ gnomAD(频率)+ AlphaMissense(序列层) | 空间 + 群体 + 效应 |
| 虚拟筛选 | AFDB(口袋)+ PDBbind(校准)+ ChEMBL(富集集) | 结构 + 校准 + 评估 |
| PPI 研究 | AFDB entries(界面)+ BioGRID(已知互作) | 假设 + 召回验证 |
| 蛋白设计 | AFDB(天然参照)+ PDB(细节模板) | 分布 + 工程 |
组合纪律:版本快照统一——AFDB 快照与 PDB 检索日期、ChEMBL 版本同期锁定,跨库结论才可复现。
§9.6 大模型产物公共化的生态角色
AFDB 是「AI 大模型批量产物作为公共科研基础设施」的全球首例:DeepMind 承担算力、EBI 承担运维、CC-BY-4.0 保证任何研究者零门槛取用——300 万用户/190 国是这一模式的验证。它改变了结构生物学的经济学:结构信息从「稀缺资源(每个结构一个博士论文)」变成「公共品(秒级下载)」,研究重心从「解析」移向「解释与验证」。对 AI 数据生态,AFDB 的置信工程(pLDDT 内嵌格式)、双层发布(entries/bulk)、版本同步协议都是后续 AI 生成数据集的事实标准——包括本库的其他条目在内,都在这个模式的影响之下。
§9.7 开放-限制混合模式的工程样本
DeepMind 生态里同时存在三种开放度——AFDB(CC-BY 数据,全开放)、AF2(开源代码+权重,可商用)、AF3(Server 学术限制,权重未开放)——这个「混合栈」的工程含义:
| 层 | 开放度 | 商业可行性 | 对使用者 |
|---|---|---|---|
| AFDB 数据 | 全开放(CC-BY-4.0) | 直接产品化 | 署名即可 |
| AF2 模型 | 开源(Apache 系) | 自建管线可行 | 算力自理 |
| AF3 模型/Server | 学术限制 | 授权谈判 | 商业方案悬置 |
- 策略:把「数据依赖」与「模型依赖」解耦——产品尽量建立在 AFDB/AF2 层(合规确定性高),AF3 能力留作学术增值或待开源替代(Boltz 类)成熟。
- 风险对冲:AFDB 的持续开放由 EBI-DeepMind 合作续约保障(2025 已续)——严肃产品仍应做本地快照(FTP 全量或子集),不把生产链挂在在线服务上。
§10 资源导航与 FAQ
§10.1 官方资源导航
- 主站 https://alphafold.ebi.ac.uk/;下载页 https://alphafold.ebi.ac.uk/downloads
- DeepMind 页 https://deepmind.google/science/alphafold/
- API/变更公告 https://www.ebi.ac.uk/pdbe/
- 收录申请:afdbhelp@ebi.ac.uk(AF2/Multimer 生成 + 主题连贯)
- 培训模块:EBI on-demand training(AFDB 导航与解读)
上手指引(第一次接入的推荐顺序):
- 网页查 EGFR(P00533)——读 pLDDT 色彩与域标签页,感受置信渲染。
- 用 §4.3 脚本拉同一条结构——跑 pLDDT 统计,对照网页直方图。
- 下载一个小 proteome 包(如酵母)——批量画像(§7.2)。
- 对一个有实验结构的蛋白做 RMSD 对照(§5.6 L1)——体会预测-实验边界。
- 复合物需求再上 2026-03 entries;全库场景再谈对象存储。
§10.2 关键文献
- Jumper, J. et al. Highly accurate protein structure prediction with AlphaFold. Nature 596, 583-589 (2021). DOI 10.1038/s41586-021-03819-2
- Tunyasuvunakool, K. et al. Highly accurate protein structure prediction for the human proteome. Nature 596, 590-596 (2021). DOI 10.1038/s41586-021-03828-1
- Varadi, M. et al. AlphaFold Protein Structure Database: massively expanding the structural coverage of protein-sequence space with high-accuracy models. Nucleic Acids Res 50, D439-D444 (2022). DOI 10.1093/nar/gkab1061
- Abramson, J. et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 630, 493-500 (2024). DOI 10.1038/s41586-024-07487-w
- Bertoni, D. et al. AlphaFold Protein Structure Database 2025: a redesigned interface and updated structural coverage. Nucleic Acids Res 54, D358-D362 (2026). DOI 10.1093/nar/gkaf1226
- Cheng, J. et al. Accurate proteome-wide missense variant effect prediction with AlphaMissense. Science 381 (2023).
- Kim, R.S. et al. BFVD—a large repository of predicted viral protein structures. Nucleic Acids Res (2024).
§10.3 站内延伸阅读
- PDBbind — 结合亲和力数据库:实验结合常数(AFDB 的验证层)
- DrugBank — 药物知识库:成药语义与靶点知识
- ChEMBL — 生物活性数据库:已知活性配体(口袋验证面)
- gnomAD — 基因组频率数据库:变异频率(结构落点的来源)
- MoleculeNet — 分子基准套件:分子 ML 基准(对接管线评估)
- ClinVar — 临床变异注释库:致病分类(结构证据的归宿)
§10.4 FAQ
Q1:AlphaFold DB 完全免费吗?商用合法吗?
A:完全免费且商用合法(CC-BY-4.0)——义务是署名(论文 + DeepMind 版权声明);无注册门槛。
Q2:到底多少结构?2 亿还是 2.14 亿?
A:官网稳态口径「over 200 million」;2.14 亿是 2025-10 对齐 UniProt 2025_03 的时点口径——引用写时点。
Q3:pLDDT 是什么?怎么看?
A:残基级置信分(0-100),存在 b-factor 列;>90 金标准、70-90 骨架可信、50-70 拓扑存疑、<50 多半 IDR——结构查看器按色彩渲染。
Q4:pLDDT 高就等于结构正确吗?
A:不——pLDDT 是模型自洽度;无同源支撑的高置信区也可能系统性错误。有实验结构的域务必做 RMSD 对照。
Q5:黄色/橙色区域(低 pLDDT)要删掉吗?
A:不要无脑删——那多半是 IDR(内在无序区),低置信是模型「知道这里没有唯一结构」;把 IDR 特征化(有无/长度/位置),不是当坏数据。
Q6:能用 AFDB 结构直接做分子对接吗?
A:可以但要修——预测态侧链是最大偏差源;对 70-90 区做侧链重构+能量最小化,有实验结构优先用实验结构。
Q7:复合物的 220 万和 3,100 万两个数字什么关系?
A:220 万二聚体是过接口置信联合 cutoff 的高置信 entries(可做结论);3,100 万是全量 bulk(只做探索假设)——两层别混用。
Q8:AlphaFold 3 和 AFDB 什么关系?
A:两条发布线——AFDB 常规条目由 AF2/Multimer 生成(开放);AF3 的配体/DNA/RNA 预测走 Server(学术限制、权重不开放)。AFDB 里没有 AF3 模型。
Q9:AF3 可以商用吗?
A:Server 学术免费、非商业限制、权重未开放——商用需授权谈判;商业方案建议先建立在 AFDB 数据 + AF2 自建管线上。
Q10:isoform 模型是什么?怎么用?
A:2025-10 首次纳入的剪接变体结构——组织特异变异解释分辨率更高;用前核对变异与 isoform 序列一致性(错 isoform 会整体错位)。
Q11:MSA 下载有什么用?
A:进化约束的原料——重评分、自定义再预测、共进化分析都用它;官方 MSA + 自定义重排的混合管线要区分产物归属。
Q12:AFDB 和 PDB 怎么选?
A:要实验精度(配体/水/热力学)用 PDB/PDBbind;要覆盖与可得性用 AFDB;理想流程是 AFDB 全覆盖 + PDB 对照校准。
Q13:和 ESM Atlas(Meta)怎么比?
A:ESM Atlas 规模更大(宏基因组)但粗(单链、置信工程弱);AFDB 策展、置信、生态集成全面占优——严肃任务用 AFDB。
Q14:批量下载全库多大?本地怎么放?
A:全库数 TB 级——绝大多数任务用 proteome 包(GB 级)或 API 单条;全库仅全组统计/ML 语料场景需要,建议对象存储流式处理。
Q15:变异解释怎么接 AFDB?
A:变异位点 → AFDB 结构落点(pLDDT 分域分类,§4.4)→ 域内>90 的落点给结构证据(ACMG PM1 候选);IDR 落点转 AlphaMissense 序列层。
Q16:为什么我的变异映射对不上号?
A:十有八九是 isoform 错配——AFDB 模型对应的序列要与你引用的转录本一致;2025-10 起 isoform 模型分列,别用主链模型硬套某 isoform。
Q17:api 变更会影响生产代码吗?
A:2025-2026 API 迁移期(经 PDBe 公告)——生产代码做适配层;批量需求优先走 FTP 快照,少依赖在线 API。
Q18:能贡献自己的预测结构进 AFDB 吗?
A:能——资格:AF2/AF-Multimer 生成、主题连贯、科学审查(afdbhelp@ebi.ac.uk);AF3 产物暂不收。
Q19:BFVD/Viro3D 这些专题集是官方生成的吗?
A:不是——第三方团队用 AF2/Multimer 生成、经资格审查入库,版权归各自团队;引用时分开标注。
Q20:可成药蛋白翻倍(19.8%→41.8%)是怎么来的?
A:canSAR 团队统计——AF 模型使可及口袋覆盖的蛋白比例近翻倍;这是「口袋可及性」口径,不等于「都能做成药」。
Q21:2026-03 复合物覆盖哪些物种?
A:4,777 proteomes——含 16 模式生物 + 30 个 WHO 优先 proteomes(全球健康导向);被忽视病原体的互作结构首次成规模。
Q22:论文里怎么引用 AFDB?
A:官方要求引 Bertoni et al. NAR 2026(数据库论文)+ 声明「AlphaFold Data © 2022 DeepMind」;用了 AlphaMissense 另引 Cheng 2023。
Q23:本地快照要不要定期更新?
A:按需求——序列集合漂移影响全组统计(要更新);单靶点结构基本稳定(少更新);复合物 entries 随大版本扩展(按需增量)。
Q24:AFDB 结构能用于蛋白质设计的训练吗?
A:能(CC-BY 允许)——但注意与设计结果的同源检查(坑点 8);训练语料锁单一快照(坑点 6)。
Q25:怎么判断一个域是「可信域」?
A:pLDDT>90 的连续段(≥30 残基级经验门槛)+ 与 InterPro 域注释重合——两条件同时满足才进结构证据层。
Q26:AFDB 会包含配体结合态吗?
A:AF2 架构不含配体——配体/DNA/RNA 交互是 AF3 能力(Server 层);AFDB 的静态 apo 快照定位短期不变。
Q27:膜蛋白(GPCR 等)的预测要特别注意什么?
A:TM 束整体可信但环区与活化态构象是盲区——pLDDT 门槛分层设(TM 段>80、环区不设限);活性态假设显式声明来源;有实验 GPCR 结构必对照(§2.9)。
Q28:复合物「能折叠在一起」就等于「生物上真实互作」吗?
A:不等——ipTM 回答结构可行性;时空共表达/亚细胞定位回答「是否相遇」——结构证据与生物学证据分开报(§2.10)。
Q29:MSA 深度低说明什么?
A:同源序列少——预测更依赖模型先验、系统性错误风险更高;「高 pLDDT + 浅 MSA」要比「高 pLDDT + 深 MSA」多留一层怀疑。
Q30:临床 AI 产品里用 AFDB 要做什么声明?
A:三件套——模型版本与快照日期、「预测非实验」免责条款、变异解释的结构证据等级标注(域内>90 才算结构证据)——监管问询的第一轮就是这三条。
§10.5 要点回顾
- 全开放:CC-BY-4.0——学术商用署名即可;与 AF3 的限制分开规划。
- 覆盖即价值:2.14 亿结构填平实验结构三个数量级缺口——「没有结构」不再是理由。
- pLDDT 是协议不是装饰:四级分带 + IDR 特征化——置信工程是使用方法的核心。
- 预测 ≠ 实验:静态、无配体、自洽≠正确——校准协议(§5.6)是严肃使用的门槛。
- 复合物分两层:entries 做结论、bulk 做探索——混用是审稿雷区。
- isoform 与快照纪律:序列一致性核对 + 锁快照日期——两处最常见的隐性 bug。
- AFDB/AF2/AF3 三层开放度:数据/开源模型/限制服务——合规线分开画。
- 组合锁主源:AFDB(结构)+ PDBbind(实验)+ ChEMBL(配体)+ gnomAD(变异)各管一层。
- 基线打不过再说深度:几何特征+GBDT 是可成药性任务的及格线。
- 偏倚声明是义务:家族/物种/长度偏倚——limitation 固定条款。
口径存照(数字均注明口径与来源,写入正文前已核对)
- over 200 million 结构预测 = 官网通用口径(alphafold.ebi.ac.uk,2026-09-19 检索)
- ~2.14 亿 / UniProt 2025_03 同步 / isoforms + MSA 首次开放 = 2025-10 更新(EMBL 官方新闻稿 + NAR 2025 论文)
- Phase 1 35 万(人类+20 模式生物)→ Phase 2(Swiss-Prot+NTD)→ Phase 3 2 亿+ = 官方发布史
- 复合物:~19M 同源 + ~8M 异源系统预测 across 4,777 proteomes;~220 万同源二聚体 + ~79,000 异源二聚体高置信 entries;全套 ~3,100 万预测 bulk = 2026-03 官方页(EBI+DeepMind+NVIDIA+首尔国立大学)
- 300 万+ 研究者 / 190+ 国 / 2 万+ 引用 = 官方 2025-10 口径
- 质量 ~35% 高准确 + ~45% 多数用途可靠 = 官方口径(媒体转述)
- CASP14 median GDT 92.4 = Jumper et al. Nature 596:583-589, 2021
- 可成药蛋白 19.8% → 41.8% = canSAR 团队分析(第三方研究口径)
- 许可 CC-BY-4.0 + AF Data © 2022 DeepMind = 官网许可页
- AF3(Nature 630:493-500, 2024)Server 学术限制/权重未开放 = Abramson et al. 2024 + 官方 FAQ
- 专题收录 BFVD(NAR 2024)/Viro3D(Mol Syst Biol 2025)/Kinetoplastid(PLoS One 2021)/AllTheBacteria(2025)= 官网收录页
- NAR 2025:Bertoni et al. NAR 54:D358-D362(2026-01-06),DOI 10.1093/nar/gkaf1226,PMID 41273079
- 第三方「2.41 亿/180 万复合物」数字与官方口径不一致——本页不采用(§3.6)
- EBI-DeepMind 合作续约(2025)与 API 变更公告 = EMBL 官方新闻稿/PDBe 页
- 收录资格(AF2/Multimer 生成 + 主题连贯审查)= 官网 FAQ(afdbhelp@ebi.ac.uk)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- alphafold — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
- pdb — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
- intact — 共享标签:基因组学与多组学 / 药物发现与化学
- msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
- lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
- binding-moad — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
- plinder — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
- pride — 共享标签:基因组学与多组学 / 蛋白质组学
- proteomexchange — 共享标签:基因组学与多组学 / 蛋白质组学
- disgenet — 共享标签:基因组学与多组学 / 药物发现与化学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

