AlphaFold DB 蛋白质结构预测数据库 — AI-Ready Wikipedia

2.14 亿结构预测 · 190 国 300 万研究者 · CC-BY-4.0:结构生物学的折叠革命公共底座

来源 https://alphafold.ebi.ac.uk/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 34
AlphaFold DB 蛋白质结构预测数据库 — AI-Ready Wikipedia

信息速览

数据集名称AlphaFold DB 蛋白质结构预测数据库 — AI-Ready Wikipedia
数据类型2.14 亿结构预测,220 万复合物,CC-BY-4.0 开放,pLDDT 置信分级,UniProt 全覆盖
规模不适用(蛋白质结构预测数据库;无患者数据)
接入方式https://alphafold.ebi.ac.uk/
AI 就绪度

# AlphaFold DB — 蛋白质结构预测数据库 AI-Ready Wiki DB — 蛋白质结构预测数据库 AI-Ready Wikipedia

INFOBOX

属性 内容
全称 AlphaFold Protein Structure Database(AFDB)
发布方 EMBL-EBI + Google DeepMind 合作(2021-07 首发并持续维护)
现行口径 约 2.14 亿单蛋白结构预测(2025-10 对齐 约 2.14 亿单蛋白结构预测*(2025-10 对齐 UniProt 2025_03);官网通用口径「over 200 mill 2025_03);官网通用口径「over 200 million」
复合物扩展 2026-03:约 220 万同源二聚体 + 约 7.9 万异源二聚体高置信 entries;全套约 3,100 万复合物预测开放下载(4,777 proteomes)
isoforms/MSA 2025-10 首次纳入蛋白 isoform 模型 + MSA(多序列比对)下载
覆盖范围 几乎全部 UniProt 已知蛋白序列;16 模式生物 + 30 个 WHO 优先 proteomes
置信机制 残基级 pLDDT(0-100)+ 复合物 pTM/ipTM 接口置信
质量 约 35% entries 高准确 + 约 45% 多数用途可靠(官方口径)
许可 CC-BY-4.0(学术与商业可用,需署名;AF Data © 2022 DeepMind)
用户规模 190+ 国 300 万+ 研究者;支撑 2 万+ 篇论文引用
生成模型 常规条目由 AlphaFold2 / AF-Multimer 生成(AF3 走 AlphaFold Server,见 §2.6)
姊妹收录 Kinetoplastid、AllTheBacteria、BFVD(病毒)、Viro3D 专题数据集
本库关联 D(病毒)、Viro3D 专题数据集
本库关联 PDBbind(实验结构对照)、DrugBank(成药靶点)、gnomAD(实验结构对照)、据集
本库关联 PDBbind(实验结构对照)、DrugBank(成药靶点)、gnomAD(变异×结构)

§0 (成药靶点)、gnomAD(变异×结构) |

§0 E-E-A-T 信任声明与免责声明

本页所有规模数字、版本信息与许可表述均核实自一手来源:AlphaFold DB 官网(alphafold.ebi.ac.uk,2026-09-19 检索)、EMBL 官方新闻稿(EBI-DeepMind 合作续约与 UniProt 2025_03 同步更新)、NAR 2025 数据库论文(Bertoni et al. NAR 54:D358-D362, 2026;DOI 10.1093/nar/gkaf1226;PMID 41273079)、DeepMind AlphaFold 页面,以及 Jumper 2021 / Abramson 2024(AlphaFold 3)原始论文。检索核实时间为 2026-09-19。

AFDB 的数字随更新滚动(「2 亿+」「2.14 亿」「复合物 220 万」并存),本页在各处显式标注口径时点;第三方转引的「2.41 亿」「180 万复合物」等数字来自不同统计时点,本页在 §3.6 口径对齐表逐条澄清。本页为技术参考文档,不构成生物学或医学决策依据——结构预测不是实验结构:任何基于 AFDB 模型的结合位点、突变效应或药物设计结论都应经实验验证(§2.3、§5)。

关于 AI 预测的边界:AFDB 常规条目由 AlphaFold2/AF-Multimer 生成,AlphaFold 3 的能力(配体/DNA/RNA 复合预测)与 AFDB 是两套发布体系——本页 §2.6 专述这一容易混淆的边界。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:结构生物学的「折叠革命」公共底座——几乎每个已知蛋白序列都有一条对应的预测三维结构,免费开放。
  • 体量:约 2.14 亿单蛋白预测(2025-10)+ 约 220 万高置信二聚体复合物 entries(2026-03,全套约 3,100 万预测可下载)。
  • 许可:CC-BY-4.0——学术与商业都能用,署名即可(与 AlphaFold 3 权重/服务的非商业限制形成鲜明对比,§2.6)。
  • 杀手锏:proteome 级覆盖 + 残基级 pLDDT 置信——「序列空间的结构化」一次性完成,无序区都可读。
  • 适用:结构注释与功能推断、口袋预测与虚拟筛选准备、突变效应解释、蛋白质设计参照、复合物界面假设。
  • 不适用:高分辨率实验细节(配体/水分子/构象系综——用 PDB/PDBbind)、AF3 级别的蛋白-配体预测(走 AlphaFold Server)。

§1.1 摘要

2020 年 11 月,DeepMind 的 AlphaFold2 在 CASP14 上以 median GDT 92.4 的成绩「基本解决」了困扰结构生物学五十年的蛋白质折叠问题;2021 年 7 月,EMBL-EBI 与 DeepMind 合作把这一能力变成公共数据库——AlphaFold DB 上线,首期发布人类与 20 种模式生物的 35 万条结构预测。到 2025-10,AFDB 对齐 UniProt 2025_03,收录约 2.14 亿条预测,覆盖几乎全部已知蛋白序列,并首次纳入 isoform 模型与 MSA 下载;2026-03 的复合物扩展又把「分子间的相互作用」带进库:约 220 万同源二聚体与 7.9 万异源二聚体高置信结构入 entries,全套约 3,100 万复合物预测开放批量下载。

对 AI 团队,AlphaFold DB 的价值在三个维度:

  1. 结构表征的零成本基线:2.14 亿结构使「这个蛋白长什么样」从「数年晶体/电镜工程」变成「一次下载」——功能注释、口袋预测、突变解释的先验全部就位;canSAR 分析显示 AF 模型使可成药蛋白比例从 19.8% 翻倍到 41.8%。
  2. 置信度自带的诚实协议:每条结构的每个残基带 pLDDT 置信分——「哪里可信、哪里存疑」内嵌在数据格式里(b-factor 列),这是「AI 生成数据公共化」的置信工程教科书。
  3. 开放许可的极限规模:CC-BY-4.0 + 190 国 300 万用户——AFDB 是「AI 大模型产物作为公共科研基础设施」的全球首例与标杆。

数据的第一性事实:预测结构 ≠ 实验结构——pLDDT 高只说明模型自洽,不保证物理正确;无序区低 pLDDT 是信息不是缺陷。用 AFDB 的方法论核心是「带置信度用结构」(§2.2、§6.5)。

§1.2 战略价值

  1. 实验结构空白的系统性填补:PDB 实验结构约 23 万条 vs AFDB 2.14 亿预测——三个数量级的缺口被一次填平;结构生物学从「选靶点解析」转向「对预测结果做实验验证」的范式迁移。
  2. 药物发现的靶点面扩容:可及口袋预测从实验结构扩展到全蛋白质组——canSAR 口径的可成药蛋白比例翻倍(19.8% → 41.8%);虚拟筛选的对接准备不再受限于「有没有晶体」。
  3. 变异解释的结构层:gnomAD/没有晶体」。
  4. 变异解释的结构层:gnomAD/ClinVar 的变异位点落到 AFDB 结构上做定位(活性位点/界面/折 的变异位点落到 AFDB 结构上做定位(活性位点/界面/折叠核)——变异性状解释的结构证据层从「少数有结构的蛋白」扩展到全组。
  5. 蛋白质设计的对照空间:设计新蛋白(Baker 线 RFdiffusion 等)需要「天然结构长什么样」的参照分布——AFDB 是最大的天然结构经验库。

§1.3 同类数据集横向对比

资源 定位 规模量级 与 AFDB 的关系
AlphaFold DB AF2/Multimer 预测结构(全 proteome) 2.14 亿 + 复合物 —
PDB 实验解析结构(X-ray/冷冻电镜/NMR) ~23 万条 实验金标准;AFDB 的验证与对照面
PDBbind 实验复合物结合常数 数万条 结合研究用实验数据;AFDB 提供口袋准备
AlphaFold Server(AF3) 蛋白-配体/DNA/RNA 交互预测 在线按条 能力更强但学术限制、无批量
ESM Atlas(Meta) 语言模型预测结构(宏基因组) 6 亿+(大肠杆菌 6.5 亿序列库等) 更大更粗——AFDB 策展度与置信工程更强
BFVD / Viro3D 病毒蛋白预测结构 数十万-百万级 已被 AFDB 收录为专题数据集
ModBase/SWISS-MODEL 同源建模 百万级 旧一代同源建模——精度与覆盖远不及 AFDB
AlphaMissense 错义变异效应预测 全蛋白组变异 AFDB 页面关联的变异效应层

§1.4 版本时间轴

2020-11  AlphaFold2 CASP14 登顶(median GDT 92.4)
2021-07  AFDB Phase 1 上线(人类 + 20 模式生物,35 万结构;Jumper Nature 2021)
2021-12  Phase 2:Swiss-Prot 全库 + 热带病 proteomes
2022-07  Phase 3:2 亿+(几乎全 UniProt 覆盖)
2024-05  AlphaFold 3 发布(Nature;AF3 与 AFDB 分轨)
2024-10  AlphaFold 化学 Nobel(Hassabis/Jumper/Baker)
2025-10  UniProt 2025_03 同步:2.14 亿 + 首次 isoforms + MSA 下载 + 入口页重设计
2026-01  NAR 2025 数据库论文(Bertoni et al. NAR 54:D358-D362)
2026-03  复合物扩展:220 万二聚体 entries + 全套约 3,100 万预测开放(EBI+DeepMind+NVIDIA+SNU)

§1.5 应用场景矩阵

  1. 结构注释与功能推断:未知功能蛋白 → AFDB 模型 → 域/口袋/定位比对(UniProt/InterPro 联查)。
  2. 口袋预测与筛选准备:可成药口袋扫描(fpocket/siteMap 类工具)→ 对接库准备 → 虚拟筛选。
  3. 变异效应解释:变异位点映射到结构(活性位点/界面/折叠核/IDR)——临床变异分类的结构证据。
  4. 复合物界面假设:二聚体 entries(ipTM 过滤)→ 蛋白互作的结构假设 → 实验验证队列。
  5. 蛋白质设计参照:天然结构分布参照 + 设计结果的结构合理性检查。
  6. 结构 ML 语料:2 亿级「序列→结构」监督对——结构预测模型/折叠评分器的训练与评测数据。

§1.6 组件全景

AFDB 的六个数据层:

  1. 单蛋白结构层:约 2.14 亿 mmCIF/PDB 条目——坐标 + 残基级 pLDDT(b-factor 列)+ 序列比对元数据。
  2. 复合物结构层:2026-03 起——约 220 万高置信二聚体 entries(同源 ~220 万/异源 ~7.9 万),全套约 3,100 万预测 bulk 下载;pTM/ipTM 置信。
  3. isoform 层(2025-10 新增):蛋白 isoform 模型——组织特异/剪接变体的结构差异。
  4. MSA 层(2025-10 新增):每条预测的多序列比对下载——进化约束分析、重评分与自定义再预测的原料。
  5. 专题收录层:Kinetoplastid(锥虫/利什曼)、AllTheBacteria(细菌组)、BFVD/Viro3D(病毒)——第三方 AF2/Multimer 数据集经资格审查入库。
  6. 服务与 API 层:网页检索/3D viewer、FTP bulk、Google Cloud 公共数据集、API(经 PDBe,2025-2026 变更中)。

§1.7 开放许可的经济学

AFDB 是「大模型产物公共化」的独特案例,其经济学结构与任何公共策展库都不同:

  1. 成本结构:预测算力由 DeepMind 承担(一次性批量推理),存储与运维由 EMBL-EBI 承担(公共科研经费)——没有人工策展的持续成本(对比 ChEMBL 的文献抽取与 DrugBank 的卡片维护),这是 2.14 亿条目能完全开放的物质基础。
  2. 许可对齐:数据 CC-BY-4.0(学术+商业)——但上游模型 AlphaFold 3 的权重与服务是学术限制/商业授权——「数据库开放、模型限制」的错位(§2.6)要求使用者区分「用数据」与「用模型」两条合规线。
  3. 网络效应:UniProt/PDBe/InterPro 内嵌 AF 模型——AFDB 成为蛋白质信息学的默认结构层;190 国 300 万用户形成事实标准,替代性资源(ESM Atlas)难以撼动。
  4. 使用者的隐性成本:数据免费但「用对」有成本——pLDDT 解读、IDR 处理、预测-实验边界的方法学投入是真实工作量(§5、§6.5)。

§1.8 AFDB 在研究流程中的定位

序列获得 → 结构表征 → 功能假设 → 药物发现 → 实验验证
   │            │            │           │
   │            ├─ AFDB:预测结构(秒级替代数年解析工程)
   │            ├─ AFDB:口袋与域注释(可成药性初筛)
   │            ├─ AFDB:复合物界面(互作假设生成)
   │            └─ AFDB:变异定位(结构证据层)
   └─ UniProt(序列与注释主源)→ PDB/PDBbind(实验结构验证层)
流程阶段 AFDB 角色 典型用法 验收标准
靶点评估 结构可得性画像 有无高置信结构/口袋(pLDDT>70 区域) 可成药性初筛有数
功能注释 域与定位参照 与已知结构比对(DALI/TM-score) 注释可溯源到比对打分
变异解释 结构证据层 变异落点(活性/界面/核/IDR)分类 分类规则与 pLDDT 联动
筛选准备 对接结构源 口袋识别 + 侧链修整 + 对接库 与实验结构对照过偏差
实验对接 假设生成器 截短体设计/构建选择/突变验证队列 预测假设进入实验清单

定位纪律:AFDB 覆盖「结构假设」最厚,「物理化学细节」最薄——结合常数与复合物热力学交给 PDBbind/PDB(§2.3),别让预测结构背实验的锅。

§2 医学与科学背景

§2.1 结构预测革命:从 CASP 到 proteome

  1. CASP14 的分水岭(2020-11):AlphaFold2 median GDT 92.4——「与实验结构难以区分」的水平;此前 50 年蛋白质折叠是未解难题,GDT 从 CASP13 的 ~60 跳升近 30 分。
  2. 从论文到数据库(2021-07):DeepMind 开源 AF2 代码与权重的同时,与 EMBL-EBI 建库——「能力公共化」与「产物公共化」同步发生,后者影响更大(不是每个实验室都有批量推理算力)。
  3. proteome 级覆盖的三阶段:35 万(人类+模式生物)→ Swiss-Prot+热带病 → 2 亿+(全 UniProt)——热带病 proteomes 的 Phase 2 优先是全球健康导向的公共政策决策(利什曼/查加斯等被忽视疾病的研究者最先受益)。
  4. Nobel 的加冕(2024-10):Hassabis 与 Jumper(与 Baker 共享)获诺贝尔化学奖——AI 结构预测从工具变成学科基础设施。

§2.2 pLDDT:内嵌的诚实协议

  1. 定义:pLDDT(predicted lDDT)是残基级置信分(0-100)——预测的局部结构与「真值」的相似度期望;存储在 PDB/mmCIF 的 b-factor 列——所有结构查看器直接按色彩渲染。
  2. 四级语义:very high(>90,蓝):骨架与多数侧链可信;confident(70-90,青):骨架可信、侧链细节谨慎;low(50-70,黄):拓扑可能对、细节不可信;very low(<50,橙):多半是无序区(IDR)。
  3. 工程读法:pLDDT 是「模型自洽度」不是「物理正确性」——低同源区的高 pLDDT 也可能是系统性错误;统计口径约 35% 条目高准确、45% 多数用途可靠——剩余 20% 不是废料而是「带警示的假设」。
  4. 复合物的两把尺:pTM(整体折叠)与 ipTM(接口)——2026-03 复合物发布用「联合 cutoff 优先接口置信」筛假阳性:接口置信不够的二聚体预测不进 entries(但仍在 bulk 下载集里)。

§2.3 预测 ≠ 实验:边界管理

  1. 缺的东西:配体、水分子、离子、辅因子、翻译后修饰、构象系综、膜环境的取向——AFDB 模型是「 apo 蛋白的静态快照」。
  2. 对接研究的偏差:用 AF 模型做口袋对接,侧链构象是「预测态」不是「结合态」——induced fit 效应全靠对接软件自己补;文献共识是:AF 模型对接可做初筛,命中复核必须回到实验结构或重新对接(侧链重排 + 柔性)。
  3. ** cryptic pockets 的两面**:AF 模型能揭示实验结构没见过的口袋(canSAR 的可成药性翻倍就来自这里),但「预测有口袋」≠「物理上有口袋」——分子动力学与片段筛选是必要验证。
  4. 边界协议:报告 AF 模型结论时,pLDDT 域标注 + 「未考虑配体/柔性」声明 + 与最近实验结构的 RMSD 对照(若存在)三件套——审稿人查的就是这个。

§2.4 无序区(IDR):低置信是信息

  1. 生物学背景:真核蛋白 30%+ 区段是内在无序区(IDR)——不折叠、靠无序发挥功能(信号转导/翻译调控)。
  2. AF2 的读出:IDR 的 pLDDT 天然 <50——这不是预测失败,而是模型「知道这里没有唯一结构」;IDR 段的坐标应视为「示意」而非结构。
  3. 常见误用:把 IDR 当坏数据裁掉 → 丢失功能位点(很多磷酸化位点/线性 motif 在 IDR);把 IDR 坐标当真结构做对接/界面分析 → 假阳性。
  4. 正确姿势:IDR 段用「有无 + 长度 + 位置」做特征(不是坐标);IDR 区变异解释走序列层(AlphaMissense)不走结构层。

§2.5 复合物与界面:2026-03 扩展的科学意义

  1. 从单体到互作组:蛋白功能多在复合物中实现——AF-Multimer(AF2 时代)与 AF3(扩散架构)使多链预测成为可能;AFDB 2026-03 把它做成 proteome 级公共供给。
  2. 发布口径:4,777 proteomes 上的 ~19M 同源多聚体 + ~8M 异源多聚体系统预测;经接口置信联合 cutoff 筛出约 220 万同源二聚体 + 约 7.9 万异源二聚体高置信 entries;全套约 3,100 万预测(含未入 entries 的)开放 bulk——「金标准层」与「全量探索层」分开发布。
  3. 覆盖设计:16 模式生物 + 30 个 WHO 优先 proteomes(全球健康导向,延续 Phase 2 热带病传统)——被忽视病原体的互作组结构首次成规模可查。
  4. 使用纪律:entries 里的二聚体可信度高但仍是预测——界面残基的突变验证实验(丙氨酸扫描)是确认路径;bulk 全集里的低置信预测只做探索假设。

§2.6 AF3 与 AFDB:容易混淆的边界

  1. 两条发布线:AFDB 常规条目 = AF2/AF-Multimer 生成(批量、proteome 级、CC-BY-4.0);AlphaFold 3 = 交互预测(蛋白-配体/DNA/RNA/离子),经 AlphaFold Server 提供——学术免费、非商业限制、权重不开放。
  2. 2024 年的开放争议:AF3 论文(Nature 2024-05)发布时权重不公开——1000+ 科学家联名公开信抗议;DeepMind 后续开放学术使用但商业授权仍受限。
  3. 工程后果:想用 AF3 能力做商业产品的团队只能走授权谈判(或等待开放替代品如 Boltz 类开源模型)——而用 AFDB 数据商业落地完全合法(CC-BY)——「数据开放、模型限制」的错位是 AFDB 生态最重要的合规事实。
  4. AFDB 收录资格审查:第三方专题数据集必须是 AF2/AF-Multimer 生成(不是 AF3)、主题连贯、经 afdbhelp@ebi.ac.uk 审查——收录层保持「同代模型 + 统一置信协议」的一致性。

§2.7 AI 视角的科学定位

对医疗 AI,AFDB 是「序列空间的结构化先验」:任何涉及蛋白的任务(靶点评估、突变效应、互作预测、设计)都可以从 AFDB 拿到结构层的初始条件。它的短板(静态、无配体、置信≠正确)都是「预测产物」的固有属性——用它的方法论核心与 ChEMBL 同构:「带置信度用数据」——pLDDT/ipTM 过滤是 AFDB 世界的 confidence score,实验验证是唯一的闭环。

§2.8 变异 × 结构:精准医学的连接层

  1. 变异分类的结构证据:ACMG/AMP 分类里 PM1(热点无变异区)/PS3(功能破坏)等证据可从结构层获得——变异落点是否在活性位点/折叠核/界面(pLDDT>90 域内)直接影响致病性判断。
  2. AFDB 的扩展:2.14 亿结构使「任何基因的变异都能落结构」——gnomAD/ClinVar 变异 × AFDB 结构的交集分析成为临床解释的标准动作(本库 gnomAD 条目 §2 详述)。
  3. AlphaMissense 的衔接:DeepMind 的错义效应预测(Science 2023)与 AFDB 同源共享置信工程——序列层(AlphaMissense)+ 结构层(AFDB pLDDT)双证据是当前变异解释的最强 AI 组合。
  4. 陷阱:IDR 区变异别用结构层解释(§2.4);pLDDT<70 域内的「界面/口袋落点」不足以支撑 PM1 类证据。

§2.9 膜蛋白与多跨螺旋:结构质量的特殊地带

膜蛋白(GPCR/离子通道/转运体)是药物靶点的最大富集带,也是 AF 预测的特殊地带:

  1. 预测质量分层:单跨/少跨膜蛋白质量接近球蛋白;多跨螺旋(7-TM GPCR 等)的整体折叠普遍可信但螺旋内细节与环区(药理学关键)置信偏低——保守性来自序列(TM 段疏水约束)而非同源深度。
  2. 缺膜语境:AF2 无膜环境——膜蛋白的「活化态构象空间」(GPCR 的 inactive/active 切换)是预测模型的盲区;活性态研究靠实验结构(G 蛋白复合物晶体)或定制预测协议。
  3. 工程应对:① 多跨螺旋域的 pLDDT 门槛放宽到「TM 段>80、环区不设限」——一刀切 90 会丢掉全部 GPCR;② 构象假设(active/inactive)显式声明来源(预测 vs 实验);③ 与实验 GPCR 结构(PDB 丰富)的对照是膜蛋白项目的必做项。
  4. 可成药性影响:口袋扫描在 TM 束内的正交口袋(allosteric)值得跑——但「预测有」到「构象稳定有」的验证链比球蛋白更长(MD 采样 + 配体结合实验)。

§2.10 复合物生物学:为什么二聚体 entries 是里程碑

  1. 功能在复合物里:约半数真核蛋白以复合物形式行使功能——同源二聚体(对称/寡聚化)与异源二聚体(信号转导/酶-调节亚基)是最基本的互作单元;此前复合物结构只能靠 PDB 实验数据(覆盖 <1% 已知互作)或逐对 AF-Multimer 自跑。
  2. 2,700 万系统预测的意义:互作组(PPI 网络)的结构化——「哪些蛋白对可能形成稳定复合物」从实验列表变成全组画像;entries 的 ~8% 入选率本身就是「系统预测 → 高置信子集」的诚实分层。
  3. 假阳性的结构语义:同一细胞里不同时空调表达的蛋白对「能折叠在一起」≠「生物上相遇」——结构置信(ipTM)回答「能不能」,共表达/定位数据回答「遇不遇得到」——两类证据要分开报。
  4. 与 PPI 数据库的关系:BioGRID/IntAct 的实验互作是「已知互作验证面」(§5.6 L4)——AFDB entries 与实验互作的交集是双向增强:entries 给实验互作结构解释,实验互作给 entries 生物学可信度。

§3 数据集规格

§3.1 规格总表

维度 规格
当前版本 2025-10(UniProt 2025_03 同步);复合物扩展 2026-03
单蛋白结构 约 2.14 亿(官网口径 over 200 million)
复合物 entries 约 220 万同源二聚体 + 约 7.9 万异源二聚体(2026-03)
复合物全量 约 3,100 万预测(bulk 下载;含未入 entries 的低置信)
系统预测底数 ~19M 同源 + ~8M 异源多聚体预测 across 4,777 proteomes
isoforms 2025-10 首次纳入
MSA 每条预测可下载(2025-10 起)
置信机制 pLDDT(残基级 0-100)+ pTM/ipTM(复合物)
文件格式 mmCIF/PDB(pLDDT 在 b-factor 列);批量 tar 包
分发 网页 + FTP + Google Cloud + API(经 PDBe)
许可 CC-BY-4.0(学术+商业;AF Data © 2022 DeepMind)
用户规模 190+ 国 300 万+ 研究者;2 万+ 引用
专题收录 Kinetoplastid / AllTheBacteria / BFVD / Viro3D

§3.2 2025-2026 双更新的增量地图

维度 2024-05 时点 2025-10 更新 2026-03 复合物扩展
单蛋白 ~2.14 亿(对齐 UniProt 2024_03) 对齐 UniProt 2025_03 + isoforms 持续同步
复合物 无(AF-Multimer 单机自跑) 无 220 万二聚体 entries + 3,100 万 bulk
MSA 未开放 开放下载 持续
入口页 旧版 全面重设计(domains/summary tabs) 持续
第三方收录 少量 扩容(AllTheBacteria 等) 持续

解读:2025-2026 的主题是「从单体库到互作库 + 从结构库到结构-进化联合库」——isoforms 补剪接多样性、MSA 补进化约束、复合物补相互作用——AFDB 正在从「结构查询工具」变成「蛋白质组结构-进化-互作的联合基础设施」。对使用协议的含义:2025-10 之前的老方法段要补「无 isoform/MSA 层」的版本声明,2026-03 之后的复合物结论要指明 entries/bulk 层级。

跨版本对比的警告:复合物 entries 是 2026-03 新增层——「2025 年 AFDB 复合物召回率」这类回溯性统计不存在(当时没有该层),文献综述引用旧口径复合物数字时要核查时点。

§3.3 DAIMS 数据AI就绪度评估

维度 D 数据完整性 评分 说明
D1 结构覆盖 10/10 几乎全 UniProt——序列空间的结构化上限
D2 复合物深度 8/10 二聚体成规模;更高聚体在 bulk 层
D3 置信元数据 10/10 残基级 pLDDT + pTM/ipTM——置信工程教科书
D4 语境元数据 8/10 UniProt 对齐 + MSA;缺配体/修饰语境(固有)
A1 机器可读 10/10 mmCIF/PDB 标准格式 + FTP/GCloud/API
A2 文档完备 9/10 FAQ + 培训模块 + NAR 论文
A3 接入成本 10/10 免注册零门槛
A4 更新机制 9/10 UniProt 同步节奏 + 复合物大版本
I1 指标标准化 9/10 pLDDT 全库统一;跨版本可比性随 UniProt 漂移
I2 可复现性 9/10 批量快照固定;API 变更期需锁版本
M1 多模态对齐 9/10 序列-结构-MSA-注释四层对齐(UniProt 锚)
M2 时间序列 7/10 UniProt 同步滚动;历史版本不回溯
S1 数据安全 10/10 无个体数据
S2 合规负担 10/10 CC-BY-4.0——署名即可

总分:A 级(覆盖与置信工程双满分档;扣分项全部来自「预测产物」的固有边界——无配体语境与版本漂移)

§3.4 存储与计算需求

数据件 体量 最小分析环境
单条结构 mmCIF 数 MB 笔记本 + PyMOL/ChimeraX
物种 proteome 批量包 数 GB-数十 GB 单机 64GB 磁盘
全库 bulk 数 TB 对象存储 + 脚本流式处理
复合物全量(3,100 万) 数 TB 级 对象存储 + 并行解析
pLDDT 批量统计 自解析 b-factor 列 单机 Biopython 可行

AFDB 是「按需取用」友好型资源——绝大多数任务只需几个 proteome 包;全库下载只在全组统计/ML 语料场景需要。

§3.5 获取通道

  1. 网页:alphafold.ebi.ac.uk——UniProt accession/基因名检索、3D viewer、pLDDT 色彩渲染、域与注释标签页。
  2. FTP bulk:alphafold.ebi.ac.uk/downloads——按物种/ proteome 的 tar 包 + 复合物数据集(2026-03)。
  3. Google Cloud:公共数据集桶——云上工作流免下载(gs 路径见官方 downloads 页)。
  4. API:经 EBI PDBe——单条元数据与文件 URL;2025-2026 API 变更期注意公告。
  5. UniProt 内嵌:UniProt 条目页直接显示 AF 模型——序列注释与结构一页联查。

§3.6 口径对齐表

数字 出处口径 澄清
over 200 million 官网通用口径(Phase 3 起) 稳态表述
~2.14 亿 2025-10 UniProt 2025_03 同步(媒体转述官方) 精确时点口径
35 万(Phase 1)/ 2 亿+(Phase 3) 官方发布史 时间轴节点
~220 万同源二聚体 + ~7.9 万异源二聚体 2026-03 复合物扩展(官网/官方页) 高置信 entries
~3,100 万复合物预测 2026-03(官网) 全量 bulk 层
~19M 同源 + ~8M 异源系统预测 2026-03 合作研究口径 底数(含未入 entries)
「2.41 亿结构 / 180 万复合物」 第三方媒体统计(不同时点混合) 与官方口径不一致——不采用
300 万+ 研究者 / 190+ 国 官方(2025-10) 用户规模
可成药蛋白 19.8% → 41.8% canSAR 团队分析(第三方研究) 口袋可及性统计

§3.7 版本选择纪律

  1. 快照锁定:批量分析锁 FTP 快照日期——UniProt 同步使条目集合滚动漂移(新序列入、旧序列合并/删除)。
  2. API 变更期:2025-2026 API 迁移(经 PDBe 公告)——生产代码对 API 做适配层,别裸调。
  3. 复合物双层的用法:entries(高置信)用于结论与发表;bulk 全量用于探索假设——两层混用是审稿雷区(§6.5)。

§3.8 pLDDT 分级工程详表

pLDDT 是 AFDB 世界的「confidence score」——按分值带建协议:

分值带 语义 典型情形 使用建议
>90(very high) 骨架+多数侧链可信 折叠域核心、有同源序列支撑区 结构结论/口袋/界面分析金标准
70-90(confident) 骨架可信、侧链谨慎 域外围、环区 对接前侧链重排;结论带警示
50-70(low) 拓扑存疑 跨域连接区、弱同源区 只做拓扑假设;别取坐标细节
<50(very low) 多半为 IDR 无序区 用「有无/长度/位置」特征;不用坐标
ipTM(复合物) 接口置信 二聚体 entries 筛选用 entries 已过联合 cutoff;bulk 需自行过滤
  1. 统计基准:全库约 35% 高准确 + 45% 多数用途可靠——你的子集分布若显著偏离(如全高置信的热门蛋白),先检查选择偏倚。
  2. 域级联动:pLDDT 与 UniProt 域注释(InterPro/Pfam)联查——「域内 >90」是结构证据的最低门槛(§2.8)。
  3. pLDDT ≠ RMSD:pLDDT 是自洽期望不是与实验的偏差——有实验结构的蛋白,对照 RMSD 才是校准(§5.6)。

§4 数据结构

§4.1 文件与条目结构

AlphaFold DB 条目结构(mmCIF 视角)
├── 条目 ID:AF-{UniProt accession}-F1(复合物:多链 F 模型)
├── _atom_site
│   ├── 坐标 x/y/z            # 全原子(重原子;AF2 无氢键力场语境)
│   └── B_iso_or_equiv        # ★ pLDDT(0-100)——AFDB 的置信列
├── _entity / _struct_asym    # 链与实体(复合物多链)
├── 元数据
│   ├── 序列(与 UniProt 一致)
│   ├── pLDDT 直方图 / 全局 pLDDT
│   ├── MSA 下载链接(2025-10 起)
│   └── 版本与生成模型标识(AF2/AF-Multimer)
└── 分发形态
    ├── 单条:网页下载 / API
    ├── 物种包:proteome tar(UP{taxid} 命名)
    ├── 复合物:entries + 全量 bulk(2026-03)
    └── 云:Google Cloud 公共桶

pLDDT 在 b-factor 列是 AFDB 的关键设计——所有标准结构工具(PyMOL/ChimeraX/Biopython)零改造即可读置信度。

§4.2 批量下载与 proteome 包处理

#!/usr/bin/env bash
# 从 AFDB FTP 拉取一个物种的 proteome 包并解压(以人类为例;以官方 downloads 页路径为准)
set -euo pipefail

BASE="https://ftp.ebi.ac.uk/pub/databases/alphafold/"
# v4 形态:按 UP{taxid} 命名的 proteome 包
wget -c "${BASE}v4/UP000005640_9606_human.tar"   # 人类 proteome(数十 GB)
mkdir -p human_af && tar -xf UP000005640_9606_human.tar -C human_af

ls human_af | head -3
# AF-P00533-F1-model_v4.cif   ← EGFR;文件名含 UniProt accession 与模型版本

# 复合物数据集(2026-03):entries 与全量 bulk 分开发布(路径见官方 downloads 页)
  1. 版本对齐:文件名 model_v4 是 AFDB 模型版本——跨版本比较结构时锁定 v 号。
  2. 磁盘策略:tar 包不解压也能流式读取(tar -xOf 取单条)——全组扫描别全解压。

§4.3 单条抽取与 pLDDT 解析

#!/usr/bin/env python3
"""AFDB 单条结构下载 + pLDDT 统计:任何靶点 30 秒画像。"""
import urllib.request
import io
import numpy as np

def fetch_af_entry(uniprot_acc: str, version: int = 4) -> bytes:
    url = (f"https://alphafold.ebi.ac.uk/files/"
           f"AF-{uniprot_acc}-F1-model_v{version}.cif")
    return urllib.request.urlopen(url, timeout=60).read()

def plddt_stats(cif_bytes: bytes) -> dict:
    """从 mmCIF 的 B-factor 列抽 pLDDT(b-factor 列即 pLDDT)。"""
    import gemmi  # pip install gemmi;或用 Biopython MMCIF2Dict
    st = gemmi.cif.read_string(cif_bytes.decode()).sole_block()
    b = np.array([float(x) for x in st.get_mmcif_category("_atom_site")["B_iso_or_equiv"]])
    return {
        "mean_plddt": round(float(b.mean()), 1),
        "pct_above_90": round(float((b > 90).mean() * 100), 1),
        "pct_above_70": round(float((b > 70).mean() * 100), 1),
        "pct_below_50": round(float((b < 50).mean() * 100), 1),  # IDR 占比
    }

if __name__ == "__main__":
    raw = fetch_af_entry("P00533")            # EGFR
    print(plddt_stats(raw))
    # {'mean_plddt': 91.x, 'pct_above_90': ~86, 'pct_below_50': ~1} —— 胞内激酶域高置信的典型画像

§4.4 变异位点结构映射

#!/usr/bin/env python3
"""把变异列表映射到 AFDB 结构:残基落点的 pLDDT 域分类(§2.8 协议)。"""
import numpy as np

def classify_variant(position: int, plddt_arr: np.ndarray) -> str:
    """plddt_arr: 按残基序号对齐的 pLDDT 数组(1-based)。"""
    p = plddt_arr[position - 1]
    if p > 90:  return "structured_high"     # 结构证据可用(域内)
    if p > 70:  return "structured_caution"  # 可用但带警示
    if p > 50:  return "topology_only"       # 只做拓扑参考
    return "idr_or_low"                      # IDR——转序列层证据(AlphaMissense)

def plddt_by_residue(cif_path: str) -> np.ndarray:
    """从 mmCIF 提取逐残基 pLDDT(CA 原子代表)。"""
    import gemmi
    st = gemmi.read_structure(cif_path)
    return np.array([res[0][ "CA" ].b_iso if "CA" in res[0] else np.nan
                     for res in st[0]["A"]])
  1. 临床衔接:分类结果对接 ACMG 证据(structured_high + 活性位点/界面 → PM1 候选);IDR 落点显式转序列层。
  2. 对齐陷阱:AFDB 序列与转录本 isoform 一致性要核(2025-10 起 isoform 模型分列)——错 isoform 会整体错位。

§4.5 与 UniProt/PDBe 的对齐

  1. 键:UniProt accession 是 AFDB 的主键——序列注释、域(InterPro)、变异(UniProt 变异页)都在同一 ID 下联查。
  2. 实验结构对照:PDBe 按 UniProt 取实验结构列表——AF 模型与实验结构的 RMSD 对照是校准协议(§5.6)的第一步。
  3. 域对齐:InterPro/Pfam 域边界 × pLDDT 分布——「域内高置信」画像的原料。

§4.6 元数据与版本指纹

  1. 模型版本:文件名 model_v{N} + 官方公告——方法段写「AFDB v4(2025-10 快照,UniProt 2025_03)」。
  2. 复合物双层声明:用 entries 还是 bulk——结论层必须写明(§2.5)。
  3. 第三方收录标注:BFVD/Viro3D 等专题集的数据版权归属各自团队——引用时分开标注。

§4.7 完整性清单

  • [ ] 模型版本(v4)+ 快照日期写入方法段
  • [ ] pLDDT 过滤门槛(>70?>90?)声明
  • [ ] IDR 处理协议(裁剪 or 特征化)说明
  • [ ] 与实验结构(若存在)的 RMSD 对照
  • [ ] 复合物用 entries/bulk 哪层声明
  • [ ] isoform 一致性核对
  • [ ] 专题收录(BFVD 等)与主库分开标注
  • [ ] 「预测非实验」limitation 段落

§4.8 数据血缘

UniProt 序列库(2025_03)
  → AlphaFold2 / AF-Multimer 批量推理(DeepMind 算力)
  → pLDDT/pTM/ipTM 置信计算
  → 复合物接口置信联合 cutoff(2026-03 筛选)
  → EMBL-EBI 托管与分发(FTP/GCloud/API/网页)
  → 第三方专题集(AF2/Multimer 资格审查后收录)

「序列 → 预测 → 置信 → 分发」四级血缘全部可追溯——与实验库(PDB 的实验方法/分辨率元数据)对照使用时,两条血缘各自独立成立。

§4.9 复合物 entries 解析:界面残基提取

#!/usr/bin/env python3
"""AFDB 复合物 entry(2026-03)解析:链、界面残基与 ipTM 处理。
复合物文件同样为 mmCIF;pLDDT 仍在 b-factor 列,界面分析需先识别链间接触。"""
import numpy as np
import gemmi

def parse_complex(cif_path: str) -> dict:
    st = gemmi.read_structure(cif_path)
    model = st[0]
    chains = [ch.name for ch in model]

    # 链间界面粗筛:CA-CA 距离 < 8Å 的残基对数(全原子精算前的低成本两级实现)
    ca = {ch.name: np.array([[p.pos.x, p.pos.y, p.pos.z] for p in ch if "CA" in p[0]])
          for ch in model}
    interface = {}
    for i, a in enumerate(chains):
        for b in chains[i + 1:]:
            if a in ca and b in ca:
                d = np.linalg.norm(ca[a][:, None, :] - ca[b][None, :, :], axis=-1)
                n_pairs = int((d < 8.0).sum())
                interface[f"{a}-{b}"] = {"n_ca_pairs_lt8A": n_pairs,
                                         "candidate_interface": bool(n_pairs > 30)}
    return {"chains": chains, "interfaces": interface}

def residue_plddt_profile(cif_path: str, chain: str = "A") -> np.ndarray:
    st = gemmi.read_structure(cif_path)
    return np.array([res[0]["CA"].b_iso if "CA" in res[0] else np.nan
                     for res in st[0][chain]])
  1. 工程要点:复合物的界面判定用「CA 距离粗筛 + 全原子精算」两级——直接全原子逐对在 2,200 万 entries 规模下不可行。
  2. 与置信联动:界面残基的 pLDDT 分布(是否 >70)是「界面假设质量」的第二道筛——ipTM 高但界面残基低置信的 entry 仍需谨慎。
  3. 规模提示:entries 批量处理是万级 mmCIF——用对象存储 + 流式解析(gemmi 读单文件内存友好);bulk 全量 3,100 万只建议抽取子集。

§4.10 MSA 下载与重评分的最小示例

#!/usr/bin/env python3
"""AFDB 官方 MSA 的获取与基本使用(2025-10 起开放)。
MSA 是 A3M 格式——可喂给重评分器/自定义预测管线/共进化分析。"""
import urllib.request, gzip, io

def fetch_msa(uniprot_acc: str) -> str:
    """拉取官方 MSA(A3M)。具体 URL 模板以 AFDB 条目页/文档为准(API 迁移期)。"""
    url = (f"https://alphafold.ebi.ac.uk/api/prediction/{uniprot_acc}")
    import json
    meta = json.loads(urllib.request.urlopen(url, timeout=60).read())
    msa_url = meta[0].get("msaUrl") or meta[0].get("annotationsUrl")
    return gzip.decompress(urllib.request.urlopen(msa_url, timeout=120).read()).decode()

def msa_summary(a3m_text: str) -> dict:
    lines = [l for l in a3m_text.splitlines() if l and not l.startswith("#")]
    seqs, depth = lines[1::2], 0
    for s in seqs:
        if not s.startswith(">"):
            depth += 1
    return {"n_sequences": depth,
            "first_target_len": len(seqs[0]) if seqs else 0}

if __name__ == "__main__":
    text = fetch_msa("P00533")
    print(msa_summary(text))   # depth 高 = 同源深 = 预测更可信的间接信号
  1. MSA 深度是置信的第二来源:同源序列数(depth)与 pLDDT 正相关——「高 pLDDT + 深 MSA」双证据的结构假设最硬。
  2. API 迁移期注意:2025-2026 API 变更期 URL 模板以官方文档为准——生产代码对 API 响应字段做防御性解析(§5.5 坑点 7 关联)。
  3. 重评分的边界:官方模型 + 官方 MSA + 自定义重排的产物不再是「AFDB 产物」——报告时要区分原始快照与再处理层(§6.7 之 3)。

§5 下游分析协议

§5.1 任务×资源速查表

任务 用哪些数据件 关键过滤 陷阱
结构画像 单条 mmCIF + pLDDT >70 区域统计 IDR 当坏数据裁掉
口袋预测 pLDDT>90 域 fpocket/siteMap 侧链不重排直接对接
变异解释 pLDDT_by_residue + UniProt 变异 域内>90 IDR 区做结构解释
互作假设 复合物 entries ipTM cutoff bulk 低置信当结论
设计参照 proteome 包子集 与设计目标同家族 新颖性误判(同源入库)
ML 语料 bulk 子集 + MSA 按版本快照 跨快照混合训练

§5.2 结构获取与准备协议

  1. 取结构:UniProt accession → AFDB 单条下载(§4.3)→ pLDDT 画像先行(判断可用域)。
  2. 域裁剪:pLDDT>70 连续段为分析域;<50 段默认裁剪(除非研究 IDR 本身)。
  3. 侧链修整:对接前对 70-90 区做侧链重构(旋转异构库)+ 能量最小化——预测态侧链是最大偏差源。
  4. 实验对照:有实验结构的域——先算 RMSD,偏差大(>2Å Cα)的域用实验结构替换。
  5. 记录协议:裁剪边界/修整步骤/对照结果全进方法段——可复现三件套。

§5.3 口袋与对接协议

  1. 口袋扫描:fpocket/DoGSiteScorer 在高置信域上跑——pLDDT<70 区的口袋不进候选。
  2. cryptic 口袋协议:AF 模型口袋 + MD 松弛(10-100ns)复核——「预测有」与「动力学稳定有」分两步报。
  3. 对接管线:口袋侧链重排 → 刚性对接初筛 → 柔性精修 → 与实验结构(若有)的对接模式对照。
  4. 富集评估:已知活性分子(ChEMBL/PDBbind)做早期富集(EF1%)——AF 结构对接管线的标准评估。

§5.4 成本模型

场景 技术路线 成本量级
单蛋白画像 API + gemmi 零;秒级
物种 proteome 扫描 FTP 包 + 并行解析 单机;小时级
口袋+对接管线 AF 结构 + MD 松弛 工作站/GPU;天级
复合物假设队列 entries + 界面分析 单机;天级
全库 ML 语料 GCloud + 对象存储 云存储费;周级

§5.5 失败模式清单

  1. pLDDT 当准确率:高置信区也可能系统性错误(无同源支撑的新折叠)——有实验结构必对照。
  2. IDR 当废料:裁掉 IDR 丢功能位点——IDR 特征化(§2.4)不是删除。
  3. 预测侧链直接对接:结合态侧链构象偏差——重排+最小化是前置步骤。
  4. bulk 低置信复合物当结论:3,100 万全量里大量假阳性——结论只用 entries 层。
  5. isoform 错位:变异映射到错 isoform 模型——序列一致性必核。
  6. 跨快照混拼:新旧版本条目集合漂移——锁单一快照。
  7. AF3 能力误挂 AFDB:AFDB 没有配体/核酸复合预测——AF3 需求走 Server/授权(§2.6)。
  8. 新颖性误判:设计结果与 AFDB 同源不判新——同源检索(TM-score)前置。

§5.6 校准与验证协议

验证层 数据源 指标 通过线(参考)
L1 域级校准 PDBe 实验结构对照 Cα RMSD(pLDDT>90 域) 中位 <1Å;>2Å 域替换
L2 口袋校准 PDBbind 口袋注释 口袋检出率/重叠率 高置信域检出 ≥80%
L3 对接校准 PDBbind 复合物 EF1%/top-1 姿态 与实验结构管线差距可解释
L4 互作校准 BioGRID/IntAct 已知互作 entries 复合物召回 分层报告(同源/异源)
L5 变异校准 ClinVar 致病/良性分层 结构特征分离度 致病变异富集于功能域
L6 前瞻衔接 实验合作/文献对照 假设验证率 与预测排序正相关
  1. L1 是根基:任何「AF 结构做重大结论」的研究,L1 对照表是审稿第一问——按域报 RMSD 分布而不是全链均值。
  2. L4 的分层:已知互作中「有复合物 entry 的召回率」是 2026-03 数据集实用性的直接度量——同源/异源分开(异源更难)。
  3. L5 的谨慎:结构特征分离度是关联证据不是因果——ACMG 证据等级按规则映射,不越级。

§6 实证结果与方法学分析

§6.1 2026-03 复合物扩展的核心信号

  1. 规模信号:4,777 proteomes 上约 2,700 万系统预测(~19M 同源 + ~8M 异源)——蛋白质互作组的结构化第一次达到 proteome 级公共供给。
  2. 方法信号:接口置信联合 cutoff 的筛选设计——「宁可 entries 少、不可假阳性混入」的金标准纪律;~220 万 entries 只占系统预测的 ~8%——保守筛选是这份数据可信度的来源。
  3. 合作信号:NVIDIA(算力)+ 首尔国立大学(Steinegger 团队,线性时间互作预测方法)加入——公共数据库的「多主体工程协作」新模式。
  4. 公平信号:30 个 WHO 优先 proteomes 的覆盖——全球健康导向延续 Phase 2 传统。

§6.2 结构预测公共化的实证教训

  1. 「预测过剩」不成立:2.14 亿结构发布后,实验结构生物学没有失业——PDB 沉积量上升(验证+复合物+动态过程)——预测与实验是互补分工不是替代。
  2. 置信工程的胜利:pLDDT 内嵌 b-factor 的设计使「AI 产物可信度」成为数据格式的一部分——后来的 AI 数据集(包括本库各条目)都在复制这个模式。
  3. 可成药性的翻倍:canSAR 19.8% → 41.8% 的口径变化改写了靶点评估的默认假设——「没有结构」不再是不做的理由。
  4. AF3 争议的教训:能力开放(Server)≠ 产物开放(AFDB)≠ 权重开放(未)——三层开放度要分开评价,社区抗议聚焦的「可复现性」权重层至今未解。

§6.3 方法学三层框架(gsm)

  1. G(Ground layer):序列与预测坐标 + pLDDT——机器产物,自洽可证。
  2. S(Synthesis layer):域注释/口袋/界面/变异落点——分析推断层(依赖工具与协议)。
  3. M(Medical layer):变异致病性/可成药结论/互作功能——临床与药理语义层(需实验证据闭环)。

越层引用是常见错误:拿 G 层高 pLDDT 说「界面存在」(S 层要有 ipTM 与对照)、拿 S 层口袋说「可成药」(M 层要有活性证据)——审稿按层问责。

§6.4 接力实验设计

  1. AFDB → PDB/PDBbind:假设结构 → 实验结构/结合常数复核(L1/L3 协议)。
  2. AFDB → ChEMBL/DrugBank:口袋假设 → 已知配体/成药语义检索(虚拟筛选闭环)。
  3. AFDB → gnomAD/ClinVar:变异落点 → 群体频率与致病分类(§2.8)。
  4. AFDB → AlphaFold Server(AF3):单体假设 → 加配体/DNA 的交互精修(学术范围内)。

§6.5 八个真实坑点

  1. 坑点 1:pLDDT 当正确率——高置信 ≠ 物理正确;无实验对照的结论降级为「假设」。
  2. 坑点 2:IDR 全裁——丢功能位点与线性 motif;IDR 是特征层。
  3. 坑点 3:预测侧链直接对接——结合态偏差;重排+最小化前置。
  4. 坑点 4:bulk 复合物当 entries 用——低置信互作进结论;双层纪律(§3.7)。
  5. 坑点 5:isoform 错配——变异映射整体错位;序列一致性核对前置。
  6. 坑点 6:跨快照混用——UniProt 同步漂移;锁快照日期。
  7. 坑点 7:AFDB/AF3 混淆——能力与许可两套体系;商用方案分开规划。
  8. 坑点 8:新颖性不查同源——设计/筛选结果先过 AFDB 同源检索再谈「新」。

§6.6 审稿人自查清单

  • [ ] AFDB 模型版本 + 快照日期写入方法段?
  • [ ] pLDDT 过滤门槛与 IDR 处理协议声明?
  • [ ] 有实验结构的域做了 RMSD 对照?
  • [ ] 对接前侧链修整步骤报告?
  • [ ] 复合物结论用 entries 层(非 bulk)?
  • [ ] 「预测非实验」limitation 段落?
  • [ ] AFDB(数据)与 AF3(服务)的使用边界分开声明?
  • [ ] 复现包含结构版本与脚本哈希?

§6.7 版本演进的方法学含义

  1. UniProt 同步的漂移:条目集合随序列库滚动——跨版本的全组统计(口袋数/IDR 占比)不可直接比,要声明快照对。
  2. isoforms 的加层(2025-10):剪接变体进入结构层——组织特异变异解释的分辨率提高,但「主链 vs isoform 模型」的选择要写进协议。
  3. MSA 开放的连锁:第三方可用官方 MSA 重评分/再预测——「官方模型 + 官方 MSA + 自定义重排」的混合管线兴起,置信协议要区分模型产物与再处理产物。
  4. 复合物双层发布(2026-03):「金标准 entries + 全量 bulk」的发布模式很可能成为后续大库的模板——使用协议里两层的边界就是未来的审稿标准。

§7 AI 就绪指南与应用场景

§7.1 AFDB 在医疗 AI 中的四种喂法

  1. 结构表征喂法:pLDDT 分域特征 + 几何描述子——靶点画像/可成药性模型的输入层。
  2. 空间先验喂法:变异落点/口袋/界面的空间关系——临床变异解释与互作预测模型的先验。
  3. 监督对喂法:「序列→结构」2 亿级对——结构预测/折叠评分模型的训练语料(ESM 类模型的评测域)。
  4. 复合物图喂法:二聚体 entries 的界面残基图——PPI 预测/界面设计的图神经网络语料。

四种喂法与 §6.5 坑点的对应:喂法 1 踩坑 1(pLDDT)与坑 2(IDR);喂法 2 踩坑 5(isoform);喂法 3 踩坑 6(快照);喂法 4 踩坑 4(bulk)——建模前回读对号。

§7.2 靶点结构画像管线实操配方

#!/usr/bin/env python3
"""批量靶点结构画像:AFDB 下载 → pLDDT 分域 → 口袋可成药特征 → TSV。"""
import concurrent.futures as cf
import urllib.request, io, json
import numpy as np
import gemmi

TARGETS = ["P00533", "P15056", "P04637"]  # EGFR / BRAF / p53

def fetch(acc: str, version: int = 4) -> bytes:
    url = f"https://alphafold.ebi.ac.uk/files/AF-{acc}-F1-model_v{version}.cif"
    return urllib.request.urlopen(url, timeout=60).read()

def profile(acc: str) -> dict:
    st = gemmi.cif.read_string(fetch(acc).decode()).sole_block()
    b = np.array([float(x) for x in
                  st.get_mmcif_category("_atom_site")["B_iso_or_equiv"]])
    return {"uniprot": acc,
            "n_res": int(b.size),
            "mean_plddt": round(float(b.mean()), 1),
            "pct_high": round(float((b > 90).mean() * 100), 1),   # 金标准域
            "pct_mid": round(float(((b > 70) & (b <= 90)).mean() * 100), 1),
            "pct_idr": round(float((b < 50).mean() * 100), 1)}    # IDR 占比

if __name__ == "__main__":
    with cf.ThreadPoolExecutor(4) as ex:
        rows = list(ex.map(profile, TARGETS))
    json.dump(rows, open("afdb_profiles.tsv.json", "w"), ensure_ascii=False, indent=1)
    print(*rows, sep="\n")

(画像输出直接对接 §5.2 协议——pct_idr 高的靶点先做 IDR 策略决策再进下游。)

§7.3 模型选型与迁移决策

  1. 口袋/可成药性:几何特征(pocket 描述子)+ 梯度提升——小样本可成药标注(canSAR 类)下 GBDT 王道。
  2. 变异效应:结构特征 + 序列特征(AlphaMissense 分)+ 进化保守性融合——单一来源都逊于组合。
  3. PPI/界面预测:entries 复合物图 + 语言模型嵌入——图模型在 ipTM 分层监督下收益最大。
  4. 结构生成/设计:AFDB 作天然分布参照——设计评估的「天然性」判别器训练域。
  5. 不确定性:pLDDT 本身是不确定性——下游模型应把它当输入特征而不是丢掉,等价于 ChEMBL 的 confidence 协变量(§7.4 对应)。

§7.4 公平性:覆盖不均的工程应对

  1. 家族偏倚:球蛋白/酶类结构质量优于膜蛋白/多跨螺旋——分家族报性能,膜蛋白结论降级。
  2. 物种偏倚:模式生物 proteome 质量高于边缘物种(同源深度)——跨物种迁移时按同源深度分层。
  3. 长度偏倚:长链蛋白(多域+IDR)的 mean pLDDT 系统性偏低——按「pLDDT>90 域数」而不是均值做比较。
  4. 权威声明:AFDB 无个体数据——公平性维度是「生物类群覆盖」不是人群公平;但下游医学应用(变异解释)的人群公平要单独评估(gnomAD 条目 §7.4)。

§7.5 任务×资源速查表

AI 任务 AFDB 数据 输出形态 验收
可成药性分类 画像特征 + 口袋 分类器 canSAR 口径对照
变异致病融合 落点特征 + AM 分 融合分类器 ClinVar 分层验证
PPI 预测 entries 界面图 链接预测 BioGRID 召回分层
结构质量评估 pLDDT + 几何 回归/评分 与 RMSD 相关性
设计天然性判别 proteome 子集 判别器 与实验结构区分度
MSA 重评分 官方 MSA 重评分器 官方模型对照

§7.6 端到端案例:冷门激酶的可成药性评估

  1. 输入:某被忽视病原体激酶(WHO 优先 proteome 内)——无实验结构。
  2. 画像:§7.2 管线 → 催化域 pLDDT>90(金标准)、ATP 口袋区高置信、C 端 IDR 15%。
  3. 口袋:fpocket 扫描高置信域 → ATP 位点检出 → 与人源激酶口袋对比(选择性设计空间)。
  4. 对照:同家族人源激酶实验结构(PDB)做 RMSD 对照 → 激酶域 <1.2Å → 结构假设升级。
  5. 筛选:ChEMBL 已知激酶抑制剂相似度检索 → 命中列表 → 实验验证队列。
  6. 报告:版本快照 + pLDDT 域图 + 对照表 + 「预测假设待实验确认」声明——四件套齐。

§7.7 报告模板:方法学段落骨架

结构预测来自 AlphaFold DB(EMBL-EBI/Google DeepMind;模型版本 v4,2025-10 快照对齐 UniProt 2025_03;Bertoni et al., NAR 54:D358-D362, 2026)。分析限定 pLDDT > 90 的连续结构域;pLDDT < 50 区段按内在无序区(IDR)处理,仅保留「有无/长度/位置」特征。存在实验结构的对应域(PDB 检索于 2026-XX-XX)先行 Cα RMSD 对照(中位 X.XÅ)。口袋预测采用 fpocket(参数 P1)于高置信域;对接前对 pLDDT 70-90 区侧链进行旋转异构重构与能量最小化。复合物分析仅采用 AlphaFold DB 2026-03 发布的高置信二聚体 entries(接口置信联合 cutoff)。预测结构与实验结构的差异及配体/柔性语境的缺失已在局限中声明;复现包含模型版本、快照日期与全部脚本哈希。

§7.8 成本与排期模板

阶段 内容 成本构成 周期
取结构 单条/包下载 + 画像 存储 0.5-1 天
域裁剪 pLDDT 分域 + 对照 人力 2-3 天
口袋/对接 扫描 + 修整 + 对接 工作站/GPU 1 周
复合物 entries 界面分析 单机 3-5 天
校准 L1-L5 协议 算力 + 人力 1 周
复现包 版本 + 脚本 + 对照表 人力 1-2 天

AFDB 项目的瓶颈在校准不在获取——「结构假设 → 实验对照」的闭环质量决定工作档次。

§7.9 消融案例:变异致病分类的结构特征贡献

变异解释是 AFDB 医学价值最集中的场景——结构特征的边际贡献一组典型消融:

配置 特征集 ClinVar 分层 AUC(示意) 诊断
R1 仅序列保守性 基线 传统进化证据
R2 R1 + AlphaMissense 分 显著提升 序列层 AI 证据强
R3 R2 + 结构落点(域/位置类别) 小幅稳定提升 结构层在功能域内增益
R4 R3 + IDR 处理协议(落点重分类) 消除 IDR 假阳性 协议修正比加特征更值钱
  1. 方法:同一 ClinVar 子集(错义、pLDDT 全域覆盖),五折分层 CV;结构特征按 §4.4 协议提取;R4 把 IDR 落点从「结构特征缺失」改为显式类别。
  2. 读数:R2→R3 的增益集中在 pLDDT>90 的功能域内变异——结构层价值不是全局的,是「域条件化」的;R3→R4 说明 IDR 协议错误是这类管线最常见的隐性 bug。
  3. 结论:结构特征进临床分类器必须带 pLDDT 条件化与 IDR 协议——「裸落点特征」的增益会被 IDR 假阳性吃掉。

§8 伦理、许可与合规

§8.1 许可结构

  1. 数据 CC-BY-4.0:学术与商业均可使用、可再分发、可修改——义务是署名(引用 Bertoni 2025 + 「AlphaFold Data © 2022 DeepMind Technologies Limited」)。
  2. 模型 ≠ 数据:AF2 代码/权重按其开源许可(可商用);AF3 权重与 Server 非商业限制——「用 AFDB 数据」与「用 AF3 预测新结构」是两条合规线,产品方案里分开写。
  3. 第三方专题集:BFVD/Viro3D/Kinetoplastid 等的版权归属各自团队——再分发时逐集核对声明。

§8.2 引用与致谢模板

致谢模板(按需裁剪):
Structure predictions were obtained from the AlphaFold Protein Structure
Database (EMBL-EBI and Google DeepMind; Bertoni D, et al. AlphaFold Protein
Structure Database 2025. Nucleic Acids Res 54, D358-D362, 2026. DOI
10.1093/nar/gkaf1226), distributed under CC-BY-4.0. AlphaFold Data
Copyright (2022) DeepMind Technologies Limited. We thank EMBL-EBI and
Google DeepMind for making proteome-scale predictions openly available.

§8.3 国内合规路径

  1. 数据性质:预测结构数据——无个体信息、无 HGRAC 问题;下载与使用无额外审批需求。
  2. 产品化:CC-BY-4.0 允许商用——结构服务/注释工具内嵌 AFDB 合法,署名义务写进产品文档。
  3. 红线:① 学术诚信——预测结构标注「预测」出售或冒充实验解析是造假;② AF3 非商业限制不可绕过(境内同样适用其服务条款)。

§8.4 商业使用边界

AFDB 的 CC-BY-4.0 使「结构数据商业化」无许可摩擦——商业产品的 attribution 页(版本 + 论文 + 许可链接)是标配。需要商业评估的是上游:基于 AF3 权重/Server 的商业服务(授权谈判)与基于 AF2 的自建管线(开源许可,可行)——三条路径的成本结构完全不同,选型先于开发。

§8.5 合规台账最小模板

台账项 记录内容 示例
数据快照 模型版本 + 快照日期 v4;2025-10(UniProt 2025_03)
署名位置 attribution 页 + 论文引用 产品「关于」页;Bertoni 2026
AF 数据声明 DeepMind 版权声明位置 文档页固定条款
AFDB/AF3 分界 用了哪些能力、哪些是 AF3 AFDB 数据;无 AF3 依赖
第三方专题集 BFVD 等的版权核对 逐集声明存档
版本升级策略 UniProt 同步触发 半年评估;基线重跑
复现包存档 快照指纹 + 脚本哈希 对象存储路径

§9 谱系与生态

§9.1 结构资源时间线

1971  PDB 创立(实验结构库;此后 50 年的结构金标准)
2018  AlphaFold1(CASP13;DeepMind 入场)
2020  AlphaFold2 CASP14 登顶(GDT 92.4)
2021-07  AFDB Phase 1(人类+20 模式生物;35 万)
2022-07  AFDB Phase 3(2 亿+;全 UniProt 覆盖)
2024-05  AlphaFold 3(Nature;Server 学术限制)
2024-10  AlphaFold 化学 Nobel
2025-10  UniProt 2025_03 同步 + isoforms + MSA 开放
2026-01  NAR 2025 数据库论文
2026-03  复合物扩展(220 万二聚体 entries;3,100 万 bulk)

§9.2 术语表

术语 定义
AFDB AlphaFold Protein Structure Database
pLDDT 残基级预测置信分(0-100;存于 b-factor 列)
pTM / ipTM 全局/接口折叠置信(复合物)
IDR 内在无序区(pLDDT<50 的常见来源)
isoform 剪接变体蛋白(2025-10 入库)
MSA 多序列比对(进化约束的原料)
proteome 包 按物种打包的全蛋白结构集(UP{taxid})
entries / bulk 复合物高置信层 / 全量层(2026-03)
AF-Multimer AF2 的多链复合物扩展
cryptic pocket 实验结构未见的潜在口袋
GDT 全局折叠相似度打分(CASP 指标)
RMSD 坐标均方根偏差(与实验对照的度量)
canSAR 癌症药物发现集成平台(可成药统计来源)
AlphaMissense DeepMind 错义变异效应预测
BFVD / Viro3D AFDB 收录的病毒预测结构专题集
CC-BY-4.0 AFDB 数据许可(学术+商业)

§9.3 资源选型决策树

你的需求是什么?
├─ 「看一个蛋白的结构」
│    → AFDB 网页(秒级;UniProt accession 直查)
├─ 「可成药口袋/对接准备」
│    → AFDB 高置信域 + fpocket + 侧链修整(§5.3)
├─ 「结合常数/复合物热力学」
│    → PDBbind(实验数据;AFDB 不提供)
├─ 「蛋白-配体/DNA 交互预测」
│    → AlphaFold Server(学术)或授权(商业)——非 AFDB
├─ 「变异致病结构证据」
│    → AFDB pLDDT 分域 + AlphaMissense(§2.8)
├─ 「互作组假设」
│    → 2026-03 复合物 entries(bulk 只做探索)
├─ 「宏基因组/病毒结构」
│    → AllTheBacteria / BFVD / Viro3D 专题集
└─ 「实验结构下载」
     → PDB/PDBe(AFDB 是预测库不是实验库)

§9.4 与本库其他条目的关系

条目 关系
PDBbind 实验结合常数——AFDB 口袋假设的验证层
drugbank 成药语义——AFDB 可成药画像的语义核对
gnomad 群体变异——AFDB 结构落点的变异来源
chembl 已知活性——口袋假设的配体验证面
UniProt(外部) 序列与注释主源——AFDB 的对齐锚
clinicaltrials-gov 靶点药物的现实性核查

§9.5 组合使用建议

研究设计 推荐组合 分工
靶点评估全链 AFDB(结构)+ ChEMBL(配体)+ DrugBank(语义) 假设 + 证据 + 叙事
变异解释 AFDB(结构层)+ gnomAD(频率)+ AlphaMissense(序列层) 空间 + 群体 + 效应
虚拟筛选 AFDB(口袋)+ PDBbind(校准)+ ChEMBL(富集集) 结构 + 校准 + 评估
PPI 研究 AFDB entries(界面)+ BioGRID(已知互作) 假设 + 召回验证
蛋白设计 AFDB(天然参照)+ PDB(细节模板) 分布 + 工程

组合纪律:版本快照统一——AFDB 快照与 PDB 检索日期、ChEMBL 版本同期锁定,跨库结论才可复现。

§9.6 大模型产物公共化的生态角色

AFDB 是「AI 大模型批量产物作为公共科研基础设施」的全球首例:DeepMind 承担算力、EBI 承担运维、CC-BY-4.0 保证任何研究者零门槛取用——300 万用户/190 国是这一模式的验证。它改变了结构生物学的经济学:结构信息从「稀缺资源(每个结构一个博士论文)」变成「公共品(秒级下载)」,研究重心从「解析」移向「解释与验证」。对 AI 数据生态,AFDB 的置信工程(pLDDT 内嵌格式)、双层发布(entries/bulk)、版本同步协议都是后续 AI 生成数据集的事实标准——包括本库的其他条目在内,都在这个模式的影响之下。

§9.7 开放-限制混合模式的工程样本

DeepMind 生态里同时存在三种开放度——AFDB(CC-BY 数据,全开放)、AF2(开源代码+权重,可商用)、AF3(Server 学术限制,权重未开放)——这个「混合栈」的工程含义:

层 开放度 商业可行性 对使用者
AFDB 数据 全开放(CC-BY-4.0) 直接产品化 署名即可
AF2 模型 开源(Apache 系) 自建管线可行 算力自理
AF3 模型/Server 学术限制 授权谈判 商业方案悬置
  1. 策略:把「数据依赖」与「模型依赖」解耦——产品尽量建立在 AFDB/AF2 层(合规确定性高),AF3 能力留作学术增值或待开源替代(Boltz 类)成熟。
  2. 风险对冲:AFDB 的持续开放由 EBI-DeepMind 合作续约保障(2025 已续)——严肃产品仍应做本地快照(FTP 全量或子集),不把生产链挂在在线服务上。

§10 资源导航与 FAQ

§10.1 官方资源导航

上手指引(第一次接入的推荐顺序):

  1. 网页查 EGFR(P00533)——读 pLDDT 色彩与域标签页,感受置信渲染。
  2. 用 §4.3 脚本拉同一条结构——跑 pLDDT 统计,对照网页直方图。
  3. 下载一个小 proteome 包(如酵母)——批量画像(§7.2)。
  4. 对一个有实验结构的蛋白做 RMSD 对照(§5.6 L1)——体会预测-实验边界。
  5. 复合物需求再上 2026-03 entries;全库场景再谈对象存储。

§10.2 关键文献

  1. Jumper, J. et al. Highly accurate protein structure prediction with AlphaFold. Nature 596, 583-589 (2021). DOI 10.1038/s41586-021-03819-2
  2. Tunyasuvunakool, K. et al. Highly accurate protein structure prediction for the human proteome. Nature 596, 590-596 (2021). DOI 10.1038/s41586-021-03828-1
  3. Varadi, M. et al. AlphaFold Protein Structure Database: massively expanding the structural coverage of protein-sequence space with high-accuracy models. Nucleic Acids Res 50, D439-D444 (2022). DOI 10.1093/nar/gkab1061
  4. Abramson, J. et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 630, 493-500 (2024). DOI 10.1038/s41586-024-07487-w
  5. Bertoni, D. et al. AlphaFold Protein Structure Database 2025: a redesigned interface and updated structural coverage. Nucleic Acids Res 54, D358-D362 (2026). DOI 10.1093/nar/gkaf1226
  6. Cheng, J. et al. Accurate proteome-wide missense variant effect prediction with AlphaMissense. Science 381 (2023).
  7. Kim, R.S. et al. BFVD—a large repository of predicted viral protein structures. Nucleic Acids Res (2024).

§10.4 FAQ

Q1:AlphaFold DB 完全免费吗?商用合法吗?
A:完全免费且商用合法(CC-BY-4.0)——义务是署名(论文 + DeepMind 版权声明);无注册门槛。

Q2:到底多少结构?2 亿还是 2.14 亿?
A:官网稳态口径「over 200 million」;2.14 亿是 2025-10 对齐 UniProt 2025_03 的时点口径——引用写时点。

Q3:pLDDT 是什么?怎么看?
A:残基级置信分(0-100),存在 b-factor 列;>90 金标准、70-90 骨架可信、50-70 拓扑存疑、<50 多半 IDR——结构查看器按色彩渲染。

Q4:pLDDT 高就等于结构正确吗?
A:不——pLDDT 是模型自洽度;无同源支撑的高置信区也可能系统性错误。有实验结构的域务必做 RMSD 对照。

Q5:黄色/橙色区域(低 pLDDT)要删掉吗?
A:不要无脑删——那多半是 IDR(内在无序区),低置信是模型「知道这里没有唯一结构」;把 IDR 特征化(有无/长度/位置),不是当坏数据。

Q6:能用 AFDB 结构直接做分子对接吗?
A:可以但要修——预测态侧链是最大偏差源;对 70-90 区做侧链重构+能量最小化,有实验结构优先用实验结构。

Q7:复合物的 220 万和 3,100 万两个数字什么关系?
A:220 万二聚体是过接口置信联合 cutoff 的高置信 entries(可做结论);3,100 万是全量 bulk(只做探索假设)——两层别混用。

Q8:AlphaFold 3 和 AFDB 什么关系?
A:两条发布线——AFDB 常规条目由 AF2/Multimer 生成(开放);AF3 的配体/DNA/RNA 预测走 Server(学术限制、权重不开放)。AFDB 里没有 AF3 模型。

Q9:AF3 可以商用吗?
A:Server 学术免费、非商业限制、权重未开放——商用需授权谈判;商业方案建议先建立在 AFDB 数据 + AF2 自建管线上。

Q10:isoform 模型是什么?怎么用?
A:2025-10 首次纳入的剪接变体结构——组织特异变异解释分辨率更高;用前核对变异与 isoform 序列一致性(错 isoform 会整体错位)。

Q11:MSA 下载有什么用?
A:进化约束的原料——重评分、自定义再预测、共进化分析都用它;官方 MSA + 自定义重排的混合管线要区分产物归属。

Q12:AFDB 和 PDB 怎么选?
A:要实验精度(配体/水/热力学)用 PDB/PDBbind;要覆盖与可得性用 AFDB;理想流程是 AFDB 全覆盖 + PDB 对照校准。

Q13:和 ESM Atlas(Meta)怎么比?
A:ESM Atlas 规模更大(宏基因组)但粗(单链、置信工程弱);AFDB 策展、置信、生态集成全面占优——严肃任务用 AFDB。

Q14:批量下载全库多大?本地怎么放?
A:全库数 TB 级——绝大多数任务用 proteome 包(GB 级)或 API 单条;全库仅全组统计/ML 语料场景需要,建议对象存储流式处理。

Q15:变异解释怎么接 AFDB?
A:变异位点 → AFDB 结构落点(pLDDT 分域分类,§4.4)→ 域内>90 的落点给结构证据(ACMG PM1 候选);IDR 落点转 AlphaMissense 序列层。

Q16:为什么我的变异映射对不上号?
A:十有八九是 isoform 错配——AFDB 模型对应的序列要与你引用的转录本一致;2025-10 起 isoform 模型分列,别用主链模型硬套某 isoform。

Q17:api 变更会影响生产代码吗?
A:2025-2026 API 迁移期(经 PDBe 公告)——生产代码做适配层;批量需求优先走 FTP 快照,少依赖在线 API。

Q18:能贡献自己的预测结构进 AFDB 吗?
A:能——资格:AF2/AF-Multimer 生成、主题连贯、科学审查(afdbhelp@ebi.ac.uk);AF3 产物暂不收。

Q19:BFVD/Viro3D 这些专题集是官方生成的吗?
A:不是——第三方团队用 AF2/Multimer 生成、经资格审查入库,版权归各自团队;引用时分开标注。

Q20:可成药蛋白翻倍(19.8%→41.8%)是怎么来的?
A:canSAR 团队统计——AF 模型使可及口袋覆盖的蛋白比例近翻倍;这是「口袋可及性」口径,不等于「都能做成药」。

Q21:2026-03 复合物覆盖哪些物种?
A:4,777 proteomes——含 16 模式生物 + 30 个 WHO 优先 proteomes(全球健康导向);被忽视病原体的互作结构首次成规模。

Q22:论文里怎么引用 AFDB?
A:官方要求引 Bertoni et al. NAR 2026(数据库论文)+ 声明「AlphaFold Data © 2022 DeepMind」;用了 AlphaMissense 另引 Cheng 2023。

Q23:本地快照要不要定期更新?
A:按需求——序列集合漂移影响全组统计(要更新);单靶点结构基本稳定(少更新);复合物 entries 随大版本扩展(按需增量)。

Q24:AFDB 结构能用于蛋白质设计的训练吗?
A:能(CC-BY 允许)——但注意与设计结果的同源检查(坑点 8);训练语料锁单一快照(坑点 6)。

Q25:怎么判断一个域是「可信域」?
A:pLDDT>90 的连续段(≥30 残基级经验门槛)+ 与 InterPro 域注释重合——两条件同时满足才进结构证据层。

Q26:AFDB 会包含配体结合态吗?
A:AF2 架构不含配体——配体/DNA/RNA 交互是 AF3 能力(Server 层);AFDB 的静态 apo 快照定位短期不变。

Q27:膜蛋白(GPCR 等)的预测要特别注意什么?
A:TM 束整体可信但环区与活化态构象是盲区——pLDDT 门槛分层设(TM 段>80、环区不设限);活性态假设显式声明来源;有实验 GPCR 结构必对照(§2.9)。

Q28:复合物「能折叠在一起」就等于「生物上真实互作」吗?
A:不等——ipTM 回答结构可行性;时空共表达/亚细胞定位回答「是否相遇」——结构证据与生物学证据分开报(§2.10)。

Q29:MSA 深度低说明什么?
A:同源序列少——预测更依赖模型先验、系统性错误风险更高;「高 pLDDT + 浅 MSA」要比「高 pLDDT + 深 MSA」多留一层怀疑。

Q30:临床 AI 产品里用 AFDB 要做什么声明?
A:三件套——模型版本与快照日期、「预测非实验」免责条款、变异解释的结构证据等级标注(域内>90 才算结构证据)——监管问询的第一轮就是这三条。

§10.5 要点回顾

  1. 全开放:CC-BY-4.0——学术商用署名即可;与 AF3 的限制分开规划。
  2. 覆盖即价值:2.14 亿结构填平实验结构三个数量级缺口——「没有结构」不再是理由。
  3. pLDDT 是协议不是装饰:四级分带 + IDR 特征化——置信工程是使用方法的核心。
  4. 预测 ≠ 实验:静态、无配体、自洽≠正确——校准协议(§5.6)是严肃使用的门槛。
  5. 复合物分两层:entries 做结论、bulk 做探索——混用是审稿雷区。
  6. isoform 与快照纪律:序列一致性核对 + 锁快照日期——两处最常见的隐性 bug。
  7. AFDB/AF2/AF3 三层开放度:数据/开源模型/限制服务——合规线分开画。
  8. 组合锁主源:AFDB(结构)+ PDBbind(实验)+ ChEMBL(配体)+ gnomAD(变异)各管一层。
  9. 基线打不过再说深度:几何特征+GBDT 是可成药性任务的及格线。
  10. 偏倚声明是义务:家族/物种/长度偏倚——limitation 固定条款。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • over 200 million 结构预测 = 官网通用口径(alphafold.ebi.ac.uk,2026-09-19 检索)
  • ~2.14 亿 / UniProt 2025_03 同步 / isoforms + MSA 首次开放 = 2025-10 更新(EMBL 官方新闻稿 + NAR 2025 论文)
  • Phase 1 35 万(人类+20 模式生物)→ Phase 2(Swiss-Prot+NTD)→ Phase 3 2 亿+ = 官方发布史
  • 复合物:~19M 同源 + ~8M 异源系统预测 across 4,777 proteomes;~220 万同源二聚体 + ~79,000 异源二聚体高置信 entries;全套 ~3,100 万预测 bulk = 2026-03 官方页(EBI+DeepMind+NVIDIA+首尔国立大学)
  • 300 万+ 研究者 / 190+ 国 / 2 万+ 引用 = 官方 2025-10 口径
  • 质量 ~35% 高准确 + ~45% 多数用途可靠 = 官方口径(媒体转述)
  • CASP14 median GDT 92.4 = Jumper et al. Nature 596:583-589, 2021
  • 可成药蛋白 19.8% → 41.8% = canSAR 团队分析(第三方研究口径)
  • 许可 CC-BY-4.0 + AF Data © 2022 DeepMind = 官网许可页
  • AF3(Nature 630:493-500, 2024)Server 学术限制/权重未开放 = Abramson et al. 2024 + 官方 FAQ
  • 专题收录 BFVD(NAR 2024)/Viro3D(Mol Syst Biol 2025)/Kinetoplastid(PLoS One 2021)/AllTheBacteria(2025)= 官网收录页
  • NAR 2025:Bertoni et al. NAR 54:D358-D362(2026-01-06),DOI 10.1093/nar/gkaf1226,PMID 41273079
  • 第三方「2.41 亿/180 万复合物」数字与官方口径不一致——本页不采用(§3.6)
  • EBI-DeepMind 合作续约(2025)与 API 变更公告 = EMBL 官方新闻稿/PDBe 页
  • 收录资格(AF2/Multimer 生成 + 主题连贯审查)= 官网 FAQ(afdbhelp@ebi.ac.uk)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • alphafold — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
  • pdb — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
  • intact — 共享标签:基因组学与多组学 / 药物发现与化学
  • msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
  • binding-moad — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
  • plinder — 共享标签:基因组学与多组学 / 蛋白质组学 / 药物发现与化学
  • pride — 共享标签:基因组学与多组学 / 蛋白质组学
  • proteomexchange — 共享标签:基因组学与多组学 / 蛋白质组学
  • disgenet — 共享标签:基因组学与多组学 / 药物发现与化学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集