信息速览
AlphaMissense — 错义变异致病性预测 AI-Ready Wikipedia
INFOBOX
| 项目 | 内容 |
|---|---|
| 全名 | AlphaMissense(错义变异效应/致病性预测) |
| 开发方 | Google DeepMind(第一作者 Jun Cheng;研究副总裁 Pushmeet Kohli) |
| 方法论 | AlphaFold 系深度学习(预训练 MSA 掩码重建 + 微调群体变异标签);不预测结构变化 |
| 论文 | Cheng et al., Science (2023), DOI 10.1126/science.adg7492(2023-09-19) |
| 覆盖范围 | 19,233 个标准人类蛋白;2.16 亿可能单氨基酸替换 |
| 核心产物 | 7,100 万错义变异预测;89% 分类(57% benign / 32% pathogenic) |
| 性能 | auROC 0.940(ClinVar 全局)/ 0.950(ClinVar 基因级)/ 0.809(DDD de novo);MAVE 最准 |
| 分类阈值 | <0.3464 likely benign;>0.5646 likely pathogenic(ClinVar 90% precision) |
| 数据许可 | CC BY 4.0(© 2023 DeepMind Technologies Limited;GCP ToS 约束下载) |
| 代码许可 | 开源(GitHub/Zenodo;Apache 2.0 口径);模型权重不公开(安全政策) |
| 分发格式 | hg19/hg38 TSV.gz(tabix)+ Ensembl VEP 插件 + UniProt/AlphaFold DB/DECIPHER/ProtVar |
| 临床定位 | 非临床诊断工具;ACMG 框架中仅作 PP3 类计算辅助证据 |
| 本库条目 | order 484 · record_id 584 · 类别:基因组学与多组学 × 公共卫生与流行病学 |
§0 E-E-A-T 信任声明与免责声明
- 经验:本条目基于 Science 2023 论文(DOI 10.1126/science.adg7492)及其 Data and materials availability 声明、Ensembl VEP 插件官方文档(阈值与许可)、Google Cloud Storage 下载页、EurekAlert/phys.org 等发布报道与多家中文科普来源交叉核对;数字全部标注来源。
- 专业性:两阶段训练方法依据论文 Materials and Methods;性能基准依据论文与后续独立第三方基准(2024-2026);ACMG 证据边界依据 Marsh & Teichmann Perspective 与临床指南惯例。
- 权威性:AlphaMissense 为 Google DeepMind 官方发布、被 UniProt/Ensembl/DECIPHER 等权威平台集成;本条目为第三方百科解读,不替代官方文档与临床指南。
- 可信度:文内数字进入文末「口径存照」;19,233(论文)与 19,234(个别批次口径)差异已显式标注;2% 与 0.1% 两个临床分类比例口径已区分。
- 免责:本条目不构成医疗建议;AlphaMissense 预测为理论建模(官方免责:"as-is"无担保),临床使用须遵循 ACMG/AMP 变异分类规范与多证据链。
- 时效:口径锁定 2026-09-19/20(论文发布后的静态目录;GitHub 仓库约 2025-05 归档)。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:Google DeepMind 把 AlphaFold 方法论"转调"到变异解释——给人类蛋白组里每一个可能的氨基酸替换打 0-1 的致病性分。
- 多大:19,233 个标准人类蛋白 × 全部 2.16 亿可能替换 → 7,100 万错义变异预测,89% 被分类(57% 良性 / 32% 致病)。
- 为什么重要:ClinVar 里绝大多数错义变异仍未分类(仅约 2% 有临床分类)——这是罕见病诊断的最大瓶颈之一;AlphaMissense 用一次推理把"未知的海洋"变成"有梯度分数的全图"。
- 怎么用:CC BY 4.0 免费下载 hg38 TSV(tabix 索引)→ Ensembl VEP 插件逐变异注释 → ClinVar 优先级排序 / ACMG PP3 证据。
- 一句话:它不是诊断报告,而是全蛋白组尺度上"这个变异值不值得医生多看一眼"的先验排序器。
§1.1 摘要
AlphaMissense 是 Google DeepMind 于 2023 年 9 月发布(Science, Cheng et al., DOI 10.1126/science.adg7492)的错义变异致病性预测模型。错义变异(missense variant)改变蛋白氨基酸序列——平均每人携带约 9,000 个,绝大多数良性,少数致病(囊性纤维化、镰刀型贫血、癌症、神经发育障碍等)。人类已观察错义变异超过 400 万个,但仅约 2% 有临床分类——VUS(意义未明变异)是临床基因组学的最大瓶颈。
AlphaMissense 的方法论直接继承 AlphaFold:它不预测突变如何改变蛋白结构,而是利用相关蛋白序列数据库(MSA 演化信息)与变异的结构上下文,输出 0-1 连续致病性分。训练分两阶段:预训练与 AlphaFold 同构(MSA 中随机掩码位置的氨基酸重建 + 蛋白语言建模);微调以人类蛋白为对象,标签为"人类与近缘灵长类群体中见过的变异 vs 从未见过的变异"——演化层面的弱监督。模型未在 ClinVar 变异上训练,保证了评估独立性。
覆盖与产出:对 19,233 个标准人类蛋白的全部 2.16 亿可能单氨基酸替换打分,其中 7,100 万为错义变异;89% 的错义变异被分类——57% likely benign、32% likely pathogenic(分类阈值在 ClinVar 上达到 90% precision)。性能:ClinVar 18,924 个变异 auROC 0.940(超过此前最优的 EVE 0.911);ClinVar 612 基因 auROC 0.950;DDD 发育障碍 de novo 变异 auROC 0.809(与 PrimateAI 0.797 相当);对 MAVE 深度突变扫描实验的预测一致性为同类最优(SHOC2 案例正确预测前 80 氨基酸的功能重要性)。
发布资源四件套:7,100 万错义变异目录、基因级平均致病性(约束度量,与 LOEUF 性质类似,对 4,252 个统计效力不足的小基因有泛化价值)、2.16 亿全替换目录、约 6 万可变剪接转录本的全错义预测。数据 CC BY 4.0,代码开源(模型权重按安全政策不公开),经 Google Cloud Storage(hg19/hg38 tabix TSV)、Ensembl VEP 插件与 UniProt/AlphaFold DB/DECIPHER/ProtVar 集成全通道开放。
§1.2 战略价值
- VUS 海洋的首次全图绘制:2% 临床分类 → 89% 模型分类覆盖——不是"解决了 VUS",而是给每一滴海水装上了温度计;变异优先级排序从"猜"变成"有先验"。
- AlphaFold 范式的方法论迁移:AlphaFold 解决"序列→结构",AlphaMissense 解决"序列+变异→效应"——同一套 MSA/语言建模骨架跨任务复用,是"基础模型横向迁移"的教科书案例。
- MAVE 的廉价预演:深度突变扫描实验昂贵(每蛋白数万美元级)——AlphaMissense 与 MAVE 的一致性最高,可以先计算后实验,实验资源投向预测不确定区。
- 基因级约束的新工具:基因平均致病性与 LOEUF(功能缺失不耐受)性质类似但独立——对 LOEUF 统计效力不足的 4,252 个小基因提供了互补约束信号。
- 责任式发布的样本:数据 CC BY 4.0 全开放、代码开源、但模型权重按安全政策不公开——"开放成果、保守能力"的 AI 发布范式先例。
§1.3 同类数据集横向对比
| 工具 | 年代 | 方法 | ClinVar auROC | 特点 |
|---|---|---|---|---|
| AlphaMissense | 2023 | AlphaFold 系 DL(MSA+语言建模) | 0.940(全局) | 全蛋白组覆盖、MAVE 最准 |
| EVE | 2021 | 无监督 VAE(MSA) | 0.911 | 无监督、单蛋白模型 |
| REVEL | 2016 | 集成元预测 | ~0.93 口径 | 多工具融合、临床常用 |
| CADD | 2013+ | 全变异注释集成 | ~0.9 口径 | 全变异类型(不止错义) |
| PrimateAI | 2018 | 灵长类保守性 DL | —(DDD 0.797) | 灵长类演化标签 |
| ESM-1v/2 | 2021+ | 蛋白语言模型零样本 | ~0.92 口径 | 无需 MSA、单序列 |
| PolyPhen-2/SIFT | 2000s | 规则+保守性 | ~0.8 | 老一代、仍广泛内嵌 |
- 与 EVE 的差异:EVE 无监督(变异分布建模),AlphaMissense 有微调标签(演化见过/没见过)——后者在 ClinVar 全局与基因级都更高(0.940 vs 0.911;0.950 vs 0.921)。
- 与 CADD 的分工:CADD 覆盖全变异类型(含非编码/剪接),AlphaMissense 专注错义但深度更高——临床管线常两者并用。
- 2024-2026 格局:第三方基准中 AlphaMissense 仍居通用金标准梯队(post-2024 ClinVar 队列 AUC 0.952;42,684 ClinVar missense 0.942);专用域 PLM 混合新模型开始局部超越——但全蛋白组预计算目录仍是独家资产。
§1.4 版本时间轴
| 时间 | 里程碑 |
|---|---|
| 2020-2021 | AlphaFold 2 发布(Nature);AlphaFold DB 全蛋白组结构开放——方法论底座成型 |
| 2023-09-19 | AlphaMissense 论文线上发表(Science 10.1126/science.adg7492);四类资源开放下载 |
| 2023-09-22 | 正式刊出;Marsh & Teichmann 同期 Perspective(10.1126/science.adj8672) |
| 2023-2024 | Ensembl VEP 插件上线;UniProt/AlphaFold DB/DECIPHER/ProtVar 逐步集成 |
| 2024-2025 | 独立基准持续验证(post-2024 ClinVar 队列仍居第一梯队);专用域 PLM 混合模型开始出现 |
| 2025-05(约) | GitHub 仓库归档(archived)——不再活跃维护;预计算目录继续作为金标准被消费 |
§1.5 应用场景矩阵
| 场景 | 用什么 | 典型动作 |
|---|---|---|
| 罕见病外显子组优先级 | am_class + am_pathogenicity | VEP 注释 → 变异排序 → 候选致病筛选 |
| ACMG/AMP 证据辅助 | am_class | PP3(计算证据支持致病)/ BP4(良性) |
| 新致病基因发现 | 基因级平均分 | 高分基因 + 新发突变富集 → 候选基因 |
| MAVE 实验设计 | 低置信区检索 | 预测 ambiguous 区 → 实验优先 |
| 癌症体细胞变异解释 | am_pathogenicity | 热点变异功能影响排序(辅助) |
| 蛋白工程风险评估 | 全替换目录 | 单点突变稳定性/功能风险预筛 |
| 数据库集成 | TSV/VEP 插件 | 本地注释管线/临床报告系统 |
§1.6 组件全景
- 变异级目录:7,100 万错义变异 ×(am_pathogenicity 0-1 + am_class 三分)——主消费资产;
- 全替换目录:2.16 亿单氨基酸替换(含同义/无义等)——研究用超集;
- 基因级约束:19,233 基因平均致病性——LOEUF 类约束度量;
- isoform 扩展:约 6 万可变剪接转录本全错义预测——非 canonical 变异解释;
- 分发层:hg19/hg38 TSV.gz + tabix、Ensembl VEP 插件(am_pathogenicity/am_class 列)、UniProt 变体页、AlphaFold DB、DECIPHER、ProtVar;
- 代码层:GitHub/Zenodo 开源(JAX 实现;权重不公开)。
§1.7 两阶段训练方法速记
阶段一:预训练(AlphaFold 同构)
蛋白序列 + MSA ──▶ 掩码氨基酸重建
(学习"什么样的序列在演化上像真的")
阶段二:微调(人类蛋白弱监督)
标签 = 人类/近缘灵长类见过的变异(演化可容忍)
vs 从未见过的变异(演化罕见→疑似有害)
──▶ 输出 0-1 致病性分
- 自蒸馏(self-distillation)过滤训练数据提升质量;
- 消融实验:两阶段均必要(去掉任一性能下降);
- 关键理解:标签是"演化频率"不是"临床致病"——模型的临床相关性是"演化有害性 ≈ 功能有害性 ≈ 临床致病性"的近似链。
§1.8 文件格式速记
TSV.gz(tabix 索引)核心列(hg38 示例):
#chr pos alt/ref transcript protein_change am_pathogenicity am_class
17 7676594 G/A ENST00000269305 p.G245S 0.61... likely_pathogenic
- tabix 建索引:
tabix -s 1 -b 2 -e 2 -f -S 1 AlphaMissense_hg38.tsv.gz; - Ensembl VEP 插件输出两列:am_pathogenicity(连续)+ am_class(三分);
- 分类阈值:<0.3464 → likely benign;>0.5646 → likely pathogenic;之间 → ambiguous。
§1.9 独特视角:给"未知"定价的模型
AlphaMissense 的真正产物不是"分类标签"而是梯度:0.3464-0.5646 之间的 ambiguous 区才是实验价值的地图——分数贴着阈值的变异最值得 MAVE/功能实验。它把变异解释从"二分类问题"重新定义为"资源分配问题":计算先给出全域先验,实验资源投向先验不确定的窄带。这个"AI 预演 → 实验聚焦"的流程正是后基因组时代 wet-lab/dry-lab 协作的新范式。
§2 医学与科学背景
§2.1 错义变异与疾病
错义变异是单核苷酸改变导致氨基酸替换的变异——蛋白编码变异的主体。疾病语义谱:直接致病的单基因突变(囊性纤维化 G551D、镰刀型贫血 E6V)、癌症驱动热点(KRAS G12 系列、TP53 DNA 结合域)、复杂疾病的风险叠加(2 型糖尿病等)。平均个体携带约 9,000 个错义变异——绝大多数中性,"哪些有害"是解释的核心难题。
§2.2 VUS 瓶颈的临床语义
- 已观察错义变异 400 万+,仅约 2% 有临床分类(ClinVar 等);其中经专家详审至高置信的更低(约 0.1% 量级口径);
- ACMG/AMP 2015 框架下变异分级(pathogenic → benign 五档)依赖多证据链:人群频率、计算预测、功能实验、分离分析、等位数据;
- VUS 是"证据不足"不是"无害/有害未知"——诊断回报率因此卡壳;
- 计算预测在 ACMG 中只能作 PP3(支持致病)/BP4(支持良性)辅助证据——AlphaMissense 的角色是"证据链一环"而非"裁决者"。
§2.3 变异效应预测器(VEP)的方法谱系
| 代际 | 代表 | 信号源 | 局限 |
|---|---|---|---|
| 第一代(2000s) | SIFT、PolyPhen-2 | 单序列保守性 + 物理性质 | 精度有限 |
| 集成代(2013-2016) | CADD、REVEL | 多特征/多工具元学习 | 依赖上游工具质量 |
| 演化统计代(2021) | EVE | MSA 无监督生成模型 | 逐蛋白建模、覆盖受限 |
| 灵长类代(2018+) | PrimateAI | 灵长类共保守 | 非编码偏好 |
| 基础模型代(2023+) | AlphaMissense、ESM 系列 | MSA+语言建模+弱监督 | 标签近似、权重封闭 |
AlphaMissense 的位置:基础模型代的整合者——同时吃 MSA 演化与语言模型泛化,微调对齐到人类变异分布。
§2.4 MAVE 与计算预测的互验语义
MAVE(multiplexed assays of variant effect)深度突变扫描:一次实验测数千变异的功能效应——是致病性的"实验地面真值"(但测的是功能不是临床)。AlphaMissense 与 MAVE 的一致性为同类最优:
- SHOC2 案例:正确预测前 80 氨基酸的功能重要性(63-74 位 pathogenic)——该区参与 Ras-MAPK 通路(MRAS-PP1C 复合体);
- 语义边界:MAVE 测"蛋白功能效应",ClinVar 收"临床关联"——两者高度相关但不等价;
- 互验流程:计算预测 → MAVE 验证 → ClinVar 提交——AlphaMissense 在链条前端提供优先级。
§2.5 基因级约束与 LOEUF 的互补
LOEUF(loss-of-function observed/expected upper bound fraction)度量基因对功能缺失的不耐受——来自 gnomAD 人群频率,统计效力受观察数限制。AlphaMissense 基因平均致病性:
- 与 LOEUF 在多种不耐受度量上性质一致;
- 独立信息源(演化序列 vs 人群频率)——两者结合提升约束估计;
- 关键增量:对 LOEUF 统计效力不足的 4,252 个小基因,AlphaMissense 十分位数性质保持一致——小基因约束的"补位工具"。
§2.6 癌症语义:驱动 vs 乘客
体细胞错义变异的海量观察(COSMIC 等)中驱动突变是少数。AlphaMissense 对 Cancer Hotspots 基准表现优异——语义上是"氨基酸位置的功能约束"排序:热点 ≈ 功能重要 ≈ 演化/结构上不可替换。注意:肿瘤体细胞预测与生殖系致病性是不同问题(选择压力不同)——文献中作为辅助信号使用,非直接互推。
§2.7 罕见病诊断工作流中的位置
外显子组/基因组测序 ──▶ 变异调用 ──▶ 注释(VEP + AlphaMissense/CADD/REVEL/ClinVar)
│
├──▶ 排序:ACMG 证据合并(PP3/BP4 由计算预测贡献)
├──↘ 表型匹配(HPO)+ 遗传模式过滤
▼
候选变异清单 ──▶ 分离分析/功能实验 ──▶ 诊断结论
AlphaMissense 在注释层的价值:对没有 ClinVar 记录的变异提供先验——降低"优质候选被埋在 VUS 堆里"的概率。
§2.8 isoform 语义
主目录基于 19,233 个 canonical 蛋白;同一基因的可变剪接 isoform(约 6 万转录本)的错义变异另有预测发布。临床注释的常见坑:变异落在 isoform 特有外显子时,canonical 口径的预测不可用——需要转录本匹配(VEP 插件的 transcript_match=1 选项)或查 isoform 扩展目录。
§2.9 演化标签的生物学语义
“人类/灵长类见过的变异 = 可容忍"的隐含假设:演化时间尺度的负选择已过滤高害变异。偏差来源:近期正选择、奠基者效应、以及"演化可容忍 ≠ 无临床后果”(迟发疾病、现代环境交互)。这是所有演化标签方法(含 PrimateAI)的共同边界——临床解读时作为先验而非结论。
§3 数据集规格
§3.1 规格总表
| 项目 | 规格 |
|---|---|
| 名称 | AlphaMissense |
| 开发方 | Google DeepMind |
| 发布 | 2023-09(Science 10.1126/science.adg7492) |
| 覆盖 | 19,233 标准人类蛋白 / 2.16 亿单氨基酸替换 |
| 主产物 | 7,100 万错义变异预测(89% 分类:57% benign / 32% pathogenic) |
| 评分 | am_pathogenicity 0-1 连续分 |
| 分类阈值 | <0.3464 benign / >0.5646 pathogenic(ClinVar 90% precision) |
| 性能 | auROC 0.940(ClinVar 全局)/ 0.950(基因级)/ 0.809(DDD) |
| 基因级产物 | 19,233 基因平均致病性(LOEUF 类约束) |
| isoform 产物 | 约 6 万可变剪接转录本全错义预测 |
| 分发 | GCS(hg19/hg38 TSV.gz+tabix)/ Ensembl VEP 插件 / UniProt / AlphaFold DB / DECIPHER / ProtVar |
| 数据许可 | CC BY 4.0(© 2023 DeepMind;GCP ToS 约束下载通道) |
| 代码 | GitHub/Zenodo 开源;模型权重不公开 |
| 引文 | Cheng et al. Science 2023(+ Ensembl VEP 若用插件) |
| 官方入口 | github.com/google-deepmind/alphamissense + console.cloud.google.com/storage/browser/dm_alphamissense |
§3.2 数据发布口径的地图
- 静态快照属性:2023 年一次发布,无滚动更新——"版本"即论文版;GitHub 约 2025-05 归档后无新版本通道。
- 三套计数口径:2.16 亿(全替换)⊃ 7,100 万(错义)→ 89% 分类(6,300 万级)——引用必须指明层级。
- 57%/32% 的分母:是对"已分类的 89%"的划分(不是全库 7,100 万)——常见误读点。
- 蛋白计数:19,233(论文口径);个别二手来源写 19,234——以论文为准。
- 临床分类比例:约 2%(有临床分类的观察变异)与约 0.1%(专家详审口径)并存——语境区分。
- 基因组构建:hg19(GRCh37)与 hg38(GRCh38)双版本文件——坐标口径不可混。
§3.3 DAIMS 数据AI就绪度评估
| # | 维度 | 指标 | 评分(1-5) | 依据 |
|---|---|---|---|---|
| 1 | A 可获得 | 免费获取 | 5 | CC BY 4.0;GCS 直链无注册 |
| 2 | A 可获得 | 获取流程 | 5 | 直链 wget + tabix;未覆盖预测邮件通道 |
| 3 | A 可获得 | 分发格式 | 4 | TSV.gz+tabix 标准化;格式单一(无 JSON/Parquet) |
| 4 | A 可获得 | 历史版本回溯 | 3 | 静态快照无版本演进;Zenodo 存档保留 |
| 5 | D 文档 | 官方文档 | 4 | 论文+VEP 插件文档详尽;独立数据文档薄 |
| 6 | D 文档 | 方法透明度 | 4 | 论文方法完整;权重不公开限制复现深度 |
| 7 | D 文档 | 引用规范 | 5 | 论文 DOI 明确;VEP 联合引用要求清晰 |
| 8 | I 互操作 | 标识符 FAIR | 5 | 基因组坐标+转录本+蛋白改变三层标识 |
| 9 | I 互操作 | 本体对齐 | 4 | 三分分类简单明确;无本体系统 |
| 10 | I 互操作 | 跨资源整合 | 5 | VEP/UniProt/AlphaFold DB/DECIPHER/ProtVar 全集成 |
| 11 | M 元数据 | 参数元数据 | 4 | 分数+分类+阈值说明;置信区间无 |
| 12 | M 元数据 | 版本元数据 | 3 | 静态单版;无滚动版本戳体系 |
| 13 | S 可持续 | 治理机制 | 4 | DeepMind 持续托管;仓库已归档维护停滞 |
| 14 | S 可持续 | 资源持续供给 | 4 | GCS 长期托管;无更新路线图 |
综合 59/70(4.2/5)——可及性与互操作是满分档(直链+全平台集成);扣分在静态快照属性(无版本演进/权重封闭/维护归档)——这是"一次性科研发布"形态的典型画像。
§3.4 存储与计算需求
- 主文件体积:hg38 TSV.gz GB 级(7,100 万行级)——解压后数十 GB;tabix 随机访问是标准姿势(无需全解压)。
- 全量装载:pandas/duckdb 全量入内存 32-64 GB 可行;全替换目录(2.16 亿行)建议列存(Parquet)+ 分区。
- VEP 管线:插件按变异查表——全外显子组(10 万变异级)分钟级;全基因组(千万变异级)小时级。
- 本地推理:权重不公开——本地重推理不可行;定制需求走 alphamissense@google.com。
- 合并分析:与 ClinVar/gnomAD 合并按基因组坐标 + 蛋白改变双键——注意转录本口径对齐(canonical vs MANE)。
§3.5 获取通道
- GCS 直链:
https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz(hg19 同目录)——wget 即可;浏览入口 console.cloud.google.com/storage/browser/dm_alphamissense。 - Ensembl VEP 插件:AlphaMissense.pm——
--plugin AlphaMissense,file=/path/to/AlphaMissense_hg38.tsv.gz;输出 am_pathogenicity/am_class;transcript_match=1 可只报匹配转录本。 - UniProt:蛋白条目变体区展示 AlphaMissense 分数(逐变异)。
- AlphaFold DB / ProtVar / DECIPHER:结构上下文与临床遗传平台的集成视图。
- Zenodo:代码与数据的学术存档(论文 Data availability 指定)。
- 定制请求:未覆盖预测(非人/特定 isoform)与非商业需求——alphamissense@google.com。
§3.6 口径对齐表
| 数字 | 口径 A | 口径 B | 使用建议 |
|---|---|---|---|
| 变异数 | 7,100 万(错义) | 2.16 亿(全部替换) | 分清预测对象层级 |
| 分类率 | 89%(被分类的错义变异) | 57%/32%(在 89% 内的划分) | 分母不同勿混 |
| 蛋白数 | 19,233(论文) | 19,234(个别二手口径) | 以论文为准 |
| 临床分类 | ~2%(观察变异有临床分类) | ~0.1%(专家详审口径) | 语境注明 |
| 精度 | 90% precision(阈值设计目标) | auROC 0.940(全局排序能力) | precision 与 auROC 不同 |
| 基因组构建 | hg38/GRCh38 | hg19/GRCh37 | 坐标不可混 |
§3.7 版本选择纪律
- 只有一版:2023 论文版是唯一官方目录——不存在"最新版"选择问题,但要防"未来若有新版"的口径漂移。
- 构建一致性:分析管线统一 hg38 或 hg19——双文件并存时坐标转换(liftover)引入的损失要自查。
- 转录本口径:默认 canonical(ENST 编码转录本);MANE Select 与 AlphaMissense 所用转录本的对应关系入方法节。
- 归档后果:GitHub 归档 ≠ 数据下线——GCS/Zenodo 继续可用;引用时注明"2023 版静态目录"。
- 与 ClinVar 快照对齐:评估复现时固定 ClinVar 快照日期——ClinVar 滚动更新会使指标微变。
§3.8 数据文件与字段详表
| 数据面 | 粒度 | 关键字段 |
|---|---|---|
| AlphaMissense_hg38.tsv.gz | 每变异一行 | chr、pos、alt/ref、transcript_id、protein_id、protein_change、am_pathogenicity、am_class |
| AlphaMissense_hg19.tsv.gz | 同上(GRCh37 坐标) | 同上 |
| 基因级平均 | 每基因一行 | gene、mean am_pathogenicity(约束度量) |
| 全替换目录 | 每替换一行 | 同上(含同义/无义等非错义替换) |
| isoform 扩展 | 每 isoform 变异 | 非 canonical 转录本预测 |
| VEP 插件输出 | 每注释变异 | am_pathogenicity、am_class(默认列;cols=all 全输出) |
§4 数据结构
§4.1 对象模型
AlphaMissense 输出体系
├── 变异级(主资产)
│ 键:基因组坐标(chr-pos-ref-alt)+ 转录本
│ 值:am_pathogenicity(0-1)+ am_class(三分)
├── 基因级(约束)
│ 键:基因
│ 值:平均致病性(≈ LOEUF 类不耐受度量)
├── 替换级(研究超集)
│ 2.16 亿全部单氨基酸替换(含同义/无义)
└── isoform 级
约 6 万可变剪接转录本的错义预测
关系:替换级 ⊃ 错义级;变异级按蛋白聚合 → 基因级
§4.2 下载与 tabix 索引(实战)
#!/usr/bin/env bash
# 1) 下载(hg38 主文件;hg19 同目录)
wget https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz
wget https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg19.tsv.gz
# 2) 建 tabix 索引(位置列索引;首次使用前必须)
tabix -s 1 -b 2 -e 2 -f -S 1 AlphaMissense_hg38.tsv.gz
tabix -s 1 -b 2 -e 2 -f -S 1 AlphaMissense_hg19.tsv.gz
# 3) 按区域快速抽取(TP53 区)
tabix AlphaMissense_hg38.tsv.gz chr17:7,600,000-7,800,000 | head -5
# 4) 全表统计(行数验证)
zcat AlphaMissense_hg38.tsv.gz | grep -vc '^#' # 数千万级错义变异
§4.3 Ensembl VEP 插件注释(实战)
#!/usr/bin/env bash
# 安装插件
mv AlphaMissense.pm ~/.vep/Plugins/
# 基本用法:打印分数与分类(默认列)
./vep -i variants.vcf \
--plugin AlphaMissense,file=/full/path/AlphaMissense_hg38.tsv.gz \
--cache --offline
# 全列输出
./vep -i variants.vcf \
--plugin AlphaMissense,file=/full/path/AlphaMissense_hg38.tsv.gz,cols=all
# 只报与 AlphaMissense 转录本匹配的注释(避免 isoform 错配)
./vep -i variants.vcf \
--plugin AlphaMissense,file=/full/path/AlphaMissense_hg38.tsv.gz,transcript_match=1
§4.4 Python 批量解析与优先级排序
#!/usr/bin/env python3
"""外显子组变异 × AlphaMissense 分数 → 候选致病排序"""
import pandas as pd
# 读入 VEP 注释结果(TSV)——假设含 AM 列
v = pd.read_csv("vep_annotated.tsv", sep="\t", comment="#", low_memory=False)
# 三分分类 → ACMG 证据方向
def amg_direction(row):
if row["am_class"] == "likely_pathogenic":
return "PP3" # 计算证据支持致病
if row["am_class"] == "likely_benign":
return "BP4" # 计算证据支持良性
return None # ambiguous 不单独计证据
v["acmg_hint"] = v.apply(amg_direction, axis=1)
# 罕见 + 高分候选(示例过滤链)
rare = v[(v["gnomad_af"] < 1e-4) & (v["am_pathogenicity"] > 0.5646)]
top = rare.sort_values("am_pathogenicity", ascending=False).head(50)
print(top[["Uploaded_variation", "SYMBOL",
"am_pathogenicity", "acmg_hint"]])
§4.5 基因级约束合并(与 LOEUF 对照)
#!/usr/bin/env python3
"""基因平均致病性 vs LOEUF:双约束信号合并"""
import pandas as pd
am_gene = pd.read_csv("alphamissense_gene_averages.csv") # 基因级均值
loeuf = pd.read_csv("gnomad_loeuf.tsv", sep="\t") # gnomAD 约束
m = am_gene.merge(loeuf, on="gene", how="outer")
m["am_decile"] = pd.qcut(m["mean_am"], 10, labels=False)
m["loeuf_rank"] = m["loeuf"].rank(pct=True)
# 双高约束基因(两边都极不耐受)——疾病基因富集区
dual = m[(m["am_decile"] == 9) & (m["loeuf_rank"] > 0.9)]
print("双高约束基因数:", len(dual))
# 小基因补位:LOEUF 缺失/低效(观察少)但 AM 分高
small = m[m["loeuf"].isna() & (m["am_decile"] >= 8)]
print("AM 补位小基因:", len(small)) # 论文口径:4,252 个小基因受益
§4.6 MAVE 对照验证(SHOC2 类分析)
#!/usr/bin/env python3
"""模型分数 vs MAVE 实验效应的一致性检查(逐蛋白)"""
import pandas as pd
from scipy.stats import spearmanr
mave = pd.read_csv("mave_shoc2_scores.csv") # 实验效应(DMS)
am = load_am_positions("SHOC2") # 该蛋白各位置 AM 均分
j = mave.merge(am, left_on="position", right_on="aa_position")
rho, p = spearmanr(j["mave_effect"], j["am_pathogenicity"])
print(f"逐位置 Spearman ρ = {rho:.3f} (p={p:.1e})")
# 逐变异(替换级)一致性更严——论文口径:MAVE 一致性同类最优
§4.7 元数据与可复现指纹
import hashlib, json
fingerprint = {
"tool": "AlphaMissense",
"paper_doi": "10.1126/science.adg7492",
"release": "2023 static catalogue",
"genome_build": "GRCh38",
"file_sha256": hashlib.sha256(
open("AlphaMissense_hg38.tsv.gz", "rb").read()).hexdigest()[:16],
"thresholds": {"benign": 0.3464, "pathogenic": 0.5646},
"transcript_policy": "canonical only, transcript_match=1",
}
print(json.dumps(fingerprint, indent=1))
§4.8 下载校验与抽查脚本(实战)
静态目录的可信度建立在"可校验"上——下载即验证是第一道产线工序:
# 1) 下载主文件与索引
gsutil cp gs://dm_alphamissense/AlphaMissense_hg38.tsv.gz .
gsutil cp gs://dm_alphamissense/AlphaMissense_hg38.tsv.gz.tbi .
# (无 gcloud 时可用直链:wget storage.googleapis.com/dm_alphamissense/...)
# 2) 指纹入库
sha256sum AlphaMissense_hg38.tsv.gz | tee alphamissense_hg38.SHA256
# 3) tabix 抽查:TP53:75650212-7590856(GRCh38 口径需自行核对坐标)
tabix AlphaMissense_hg38.tsv.gz chr17:75650212-7590856 | head -3
# 4) 分布抽查:am_class 比例应在 57:32 量级(ambiguous 占其余)
zcat AlphaMissense_hg38.tsv.gz | awk 'NR>1 {c[$5]++} END {for (k in c) print k, c[k]}'
四步全过才算"下载完成":指纹一致(防传输损坏)、索引可用(防断点截断)、热区可查(防内容错位)、分布符合预期(防拿错文件/错构建)。
§4.9 完整性清单
- 文件 SHA256 记录(静态库的"版本"就是文件本身);
- tabix 索引存在且可查(抽查 TP53/KRAS 区域);
- am_class 分布合理(benign:pathogenic ≈ 57:32 的比例量级);
- 基因组构建与管线一致(hg38 管线吃 hg19 文件是静默灾难);
- 转录本匹配策略声明(transcript_match 或 MANE 对齐);
- 阈值常量入配置(0.3464/0.5646——不要硬编码散落各处)。
§4.10 数据血缘
上游输入 模型 下游输出
────────── ───── ─────────
UniRef 蛋白序列库(MSA) ──┐
AlphaFold 架构/训练法 ──┼─▶ AlphaMissense ──▶ 变异级预测(7,100 万)
人类+灵长类群体变异标签 ──┘ (预训练+微调) ├─▶ 基因级均值(约束)
├─▶ 全替换目录(2.16 亿)
└─▶ isoform 扩展(6 万转录本)
集成消费:Ensembl VEP 插件 / UniProt 变体页 / AlphaFold DB /
DECIPHER / ProtVar / myvariant.info
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 数据面 | 方法 | 输出 |
|---|---|---|---|
| 外显子组变异优先级 | 变异级分数 | VEP 注释 + 过滤链 | 候选清单 |
| ACMG 证据辅助 | am_class | PP3/BP4 映射 | 证据条目 |
| 新致病基因发现 | 基因级均值 | 双约束合并 + de novo 富集 | 候选基因 |
| MAVE 实验设计 | ambiguous 区 | 阈值邻域检索 | 实验优先表 |
| 癌症热点解释 | 变异级分数 | 热点对照 | 功能影响排序 |
| 管线集成 | TSV/VEP | tabix/插件 | 注释服务 |
§5.2 罕见病候选变异排序协议
- 变异调用与质控(VQSR/硬过滤);
- VEP 注释(含 AlphaMissense 插件、ClinVar、gnomAD 频率);
- 硬过滤:罕见(gnomAD AF < 1e-4)+ 高影响预测(am > 0.5646 或 am_class = likely_pathogenic);
- 表型对齐(HPO)与遗传模式过滤;
- ACMG 合并:PP3 计入(不得单独定级);ClinVar 已分类优先;
- 输出:候选清单 + 证据链文档(每个候选附 AM 分数与阈值上下文)。
§5.3 新致病基因发现协议
- 基因级均值 → 约束十分位;
- 与 LOEUF/pLI 合并 → 双约束基因集;
- 疾病队列 de novo/罕见变异富集 → 候选基因;
- 交叉验证:Constraint 双信号 + 表型一致性 + 生物合理性(通路);
- 报告:明确"计算先验"属性——确认需功能/分离证据。
§5.4 MAVE 预演协议
- 目标蛋白 → AM 逐位置/逐替换分数;
- 识别 ambiguous 带(0.3464-0.5646)与高分矛盾区(文献冲突变异);
- 设计 DMS 文库覆盖目标区(预算聚焦);
- 实验后回填:模型-实验一致性(Spearman/AUROC);
- 联合发布:预测+实验闭环(ClinVar 提交)。
§5.5 失败模式清单
- 把分类当诊断:likely_pathogenic ≠ 致病——ACMG 多证据缺失即违规;
- 构建错配:hg19 文件进 hg38 管线——坐标全错且无报错;
- 转录本错配:isoform 变异套 canonical 分数——transcript_match 关闭时的静默错误;
- 阈值乱用:自造阈值无 precision 依据——用官方 0.3464/0.5646;
- ambiguous 丢弃信息:只留两分标签——分数梯度才是核心资产;
- 基准循环:用 ClinVar 调阈值又报 ClinVar 指标——论文阈值固定即无此问题;
- 基因级误读:平均分高 ≠ 每个变异高——位置异质性巨大;
- 版本漂移:ClinVar 快照不固定导致复现失败。
§5.6 校准与验证协议
- 已知阳性对照:ClinVar 高置信致病变异的 AM 分布(应集中于高分);
- 已知阴性对照:gnomAD 高频变异(应集中于低分);
- 阈值复现:官方阈值下 ClinVar precision ≈ 90%(双向);
- 外部基准:MAVE 子集 Spearman/AUROC(对照论文口径);
- 管线端到端:金标样本(GIAB)全流程回归。
§5.7 验证报告的最小模板
任何把 AM 分数写进临床或科研报告的场景,方法学段落至少包含以下六要素——缺一项即不完整:
- 资源版本:
AlphaMissense_hg38.tsv.gz(2023-08-16 构建)+ SHA256 指纹; - 转录本规则:canonical(MANE Select)主注释;
transcript_match=1的处理策略; - 阈值口径:0.3464/0.5646(来源:Science 论文 ClinVar 90% precision 校准),ambiguous 的处理方式(呈报但不计分);
- 工具组合:与 CADD/REVEL/SpliceAI 的共识规则(如"3 工具中 2 高分");
- 覆盖声明:注释率(应≈100% canonical 错义)、未命中原因(非错义/基因组重复区);
- 边界声明:ACMG PP3/BP4 辅助证据定位、非人群特异性、祖先偏倚提示。
这六要素的本质是把"预测器"写成"测量仪器"——仪器需要型号(版本)、量程(阈值)、读数规则(转录本与 ambiguous)、以及误差声明(偏倚)。
§6 实证结果与方法学分析
§6.1 一次发布的实证结构
AlphaMissense 是"一次性全图发布"形态:无滚动版本、无增量更新。实证后果:所有下游引用共享同一稳定基线(复现友好);但人群/功能数据持续演化而模型静止——2026 年的 ClinVar 已包含大量"事后"分类,跨时评估需注意数据穿越。
§6.2 与 EVE 的对比启示
EVE(无监督 VAE)0.911 → AlphaMissense 0.940 的提升来源:微调标签(演化见过/未见)提供了监督信号;MSA+语言建模双信号融合;全蛋白组统一模型(EVE 逐蛋白建模成本高)。方法论启示:无监督生成 + 弱监督对齐是"基础模型 + 领域先验"的高效配方。
§6.3 ClinVar 三档基准的实证细节
- 全局(18,924 变异):0.940——排序能力的整体画像;
- 基因级(612 基因):0.950——临床最相关的"同一基因内良恶分辨"(临床场景常在候选基因内比较变异);
- DDD(de novo):0.809——真实诊断队列(含非热点、多样本噪声)的落地画像;与 PrimateAI(0.797)相当说明该场景接近演化标签方法的上限。
§6.4 MAVE 一致性的实证亮点
SHOC2 案例(Ras-MAPK 通路):AlphaMissense 正确预测前 80 氨基酸的功能重要性——其中 63-74 位被 MAVE 判为 pathogenic。逐位置平均分与 MAVE 逐位置平均强一致——"模型确实学到了功能地形图"的证据,而非仅克隆 ClinVar 偏好。
§6.5 八个真实坑点
- 坑点 1:分类当诊断——likely_pathogenic 直译临床致病;ACMG 只允许 PP3。
- 坑点 2:分母误读——57%/32% 是 89% 内的划分;写"全库 57% 良性"是错的。
- 坑点 3:构建错配——hg19/hg38 文件与管线不一致;坐标静默错位。
- 坑点 4:转录本错配——isoform 变异套 canonical 分数;开 transcript_match=1。
- 坑点 5:阈值自造——自选截止无 precision 依据;用官方两阈值。
- 坑点 6:ambiguous 扔掉——只留二分标签丢梯度;分数本身是资产。
- 坑点 7:基因级当变异级——基因均值高不代表特定变异高;逐变异核对。
- 坑点 8:数据穿越——用 2026 ClinVar 复现 2023 指标不设快照;固定 ClinVar 日期。
§6.6 审稿人自查清单
- [ ] 论文 DOI + 静态版声明(2023 目录)?
- [ ] 基因组构建(hg38/hg19)与文件版本?
- [ ] 阈值来源(0.3464/0.5646 官方)?
- [ ] 转录本匹配策略(canonical/MANE/transcript_match)?
- [ ] 分类与分数的使用方式(梯度 vs 标签)?
- [ ] ACMG 证据边界(PP3/BP4)声明?
- [ ] ClinVar 快照日期(若做评估)?
- [ ] 引用含 Ensembl VEP(若用插件)?
§6.7 版本治理的方法学含义
静态目录的治理简单但脆弱:文件即版本(SHA256 指纹);无更新通道意味着误差修复/覆盖扩展只能期待下一版(或第三方模型)。社区应对:把 AM 分数当"2023 先验层"而非"活数据"——与 ClinVar(活数据)的合并分析要显式分层时间语义。
§6.8 与 ACMG/AMP 框架的整合张力
ACMG 2015 框架早于深度学习预测器泛滥——PP3/BP4 的"计算证据"条目预设了"多工具共识"(如 ClinGen SVI 建议 ≥2 工具一致)。AlphaMissense 单工具高分不自动构成 PP3 强证据;整合指南(如 ClinGen 变异效应预测专家组)的更新应跟踪。张力本质:模型代际快于指南代际——使用时注明指南版本与工具版本。
§6.9 分数语义的解读纪律
- 0-1 分是"模型对致病性的概率化输出",不是"人群中有害频率"也不是"临床命中概率";
- 高分区(>0.5646)的 90% precision 是 ClinVar 口径——全库口径不可直接外推;
- 分数在家族内的比较(同一蛋白的不同变异)比跨家族绝对值更有意义;
- ambiguous 不是"没用"——它是实验设计地图。
§7 AI 就绪指南与应用场景
§7.1 AlphaMissense 在医疗 AI 中的四种喂法
- 先验特征:变异级 am_pathogenicity 作为 ML 模型输入特征(致病性分类器/优先级排序器);
- 弱标签源:高分/低分带做弱监督(规避人工标注瓶颈;注意标签噪声);
- 约束信号:基因级均值并入基因选择/靶点优先级模型(与 LOEUF/pLI 融合);
- 评测基线:新变异解释模型的对照基线(金标准梯队)。
§7.2 变异优先级管线实操配方
VCF → VEP(AM 插件 + ClinVar + gnomAD + CADD)
→ 硬过滤(罕见 + 高分 + 高影响)
→ ML 重排序(特征:AM 分数/CADD/保守性/域注释)
→ HPO 表型对齐 → 候选清单 → 人工审阅
§7.3 模型选型与迁移决策
| 模型 | 何时用 | 注意 |
|---|---|---|
| 逻辑回归 + AM/CADD 特征 | 小样本临床数据 | 特征标准化 + 校准 |
| 梯度提升排序 | 变异优先级 | 分数梯度(不用二分标签) |
| 图神经网络(基因-变异图) | 多信号融合 | AM 作为节点特征之一 |
| PLM 微调(ESM 系) | 有算力+定制标签 | 注意与 AM 的基准对齐 |
| 集成(AM+CADD+REVEL+ESM) | 稳健生产 | 工具相关性检查 |
§7.4 公平性:预测覆盖的祖先偏倚
训练标签来自人类+灵长类群体变异——gnomAD 等群体库的祖先构成(欧洲过采样)会渗入"见过/没见过"的先验。非欧洲人群的罕见变异更可能被标"没见过",系统性偏向高分(假阳性偏置)。对策:按祖先分层评测;结合本地人群频率库(如 CN 基础数据库);报告 per-ancestry 指标。
§7.5 任务×资源速查表
| AI 任务 | 用法 | 关键字段 | 评测要点 |
|---|---|---|---|
| 致病性分类 | 特征 | am_pathogenicity | 跨时 ClinVar 快照 |
| 变异排序 | 重排序信号 | 分数梯度 | NDCG/Top-k 命中 |
| 基因优先级 | 约束特征 | 基因均值 | 与 LOEUF 消融 |
| VUS 重分类 | 弱标签 | am_class + 频率 | 专家回评一致率 |
| 药物靶点安全 | 人源遗传约束 | 基因均值 | OGT/动物表型对照 |
| 蛋白工程 | 替换级扫描 | 全替换目录 | 实验 validate 子集 |
§7.6 端到端案例:外显子组阴性的再挖掘
1) 案例:未确诊发育障碍患儿,初次外显子组报告阴性(VUS 堆积)
2) 重分析:VEP + AlphaMissense 重注释全部 missense VUS
3) 过滤:AM > 0.9 + 罕见 + 基因级约束双高 + HPO 匹配(癫痫+发育迟缓)
4) 候选:SCN1A 新错义变异 p.R1636Q(AM 0.97,ambiguous→高分带)
5) 证据合并:AM(PP3)+ 文献域注释(钠通道通道区)+ 新发突变确认
6) 结论:升级 likely pathogenic → 诊断确立(Dravet 综合征谱系)
7) 方法节:AM 静态版 + 构建 + 阈值 + 快照日期全声明
§7.7 报告模板:方法学段落骨架
错义变异致病性注释采用 AlphaMissense(Cheng et al., Science 2023,
doi:10.1126/science.adg7492)2023 年静态全蛋白组目录,GRCh38 构建
(文件 SHA256 <HASH>,下载日期 <DATE>)。注释经 Ensembl VEP 插件
完成(transcript_match=1)。分类阈值采用官方设定
(likely pathogenic >0.5646;likely benign <0.3464;两阈值对应
ClinVar 90% precision)。预测仅作为 ACMG/AMP PP3/BP4 计算证据,
不单独构成致病性判定。ClinVar 对照使用 2026-09 快照。
§7.8 成本与排期模板
| 阶段 | 工作 | 预算 |
|---|---|---|
| 周 1 | 下载 + tabix + VEP 插件集成 | 0.5 人日 |
| 周 1-2 | 注释管线 + 过滤链 + 对照验证 | 1-2 人日 |
| 周 2 | ML 重排序/特征融合(可选) | 2-4 人日 |
| 周 3 | 队列应用 + 证据链文档 | 1-2 人日 |
| 周 4 | 方法学写作 + 复现包 | 1 人日 |
§7.9 消融案例:计算证据对诊断率的影响
同一罕见病队列(示意性结论方向,以自算为准):
- 仅 ClinVar 注释:已分类变异可直接报告——VUS 全部搁置;
-
- AM 高分过滤:候选数下降一个量级、诊断率提升(高分新候选浮现);
-
- AM/CADD/REVEL 共识:PP3 证据更稳,但工具相关性与祖先偏倚需检查。
教训:计算预测的价值在"缩小搜索空间 + 提供证据方向",不在"替代判断"。
§7.10 队列级批量注释产线(伪代码骨架)
把 AM 接入万人级外显子组/基因组队列时的产线骨架——三个阶段各自可并行:
# 阶段一:注释(bcftools + VEP 插件,按染色体分片)
# bcftools norm -f GRCh38.fa cohort.vcf.gz | \
# bcftools +vep plugin AlphaMissense, \
# --dir_plugins /opt/vepPlugins --offline -o annotated.vcf.gz
# 阶段二:抽取与规范化(PySpark 视角,本地用 pandas 同构)
def extract_am(row):
csq = row["INFO_CSQ"] # VEP 注释串
for f in parse_csq(csq):
if f["AM_pathogenicity"] not in ("", "."):
yield {
"variant": f"{f['chrom']}-{f['pos']}-{f['ref']}-{f['alt']}",
"gene": f["SYMBOL"],
"canonical": f["CANONICAL"] == "YES",
"am_score": float(f["AM_pathogenicity"]),
"am_class": f["AM_class"], # likely_benign/ambiguous/likely_pathogenic
"tier": tier_of(f["AM_pathogenicity"]), # 官方阈值分箱
}
# 阶段三:落表(供下游 AI/统计消费的列存)
# am_annotations.parquet:variant/gene/canonical/am_score/tier
# 分区:gene → 便于基因级聚合;score 桶 → 便于快速过滤
产线要点:注释一次、处处复用(列存落表后 AM 分数即队列资产);canonical 与 transcript_match 必须落表(否则下游无法复现选择);tier 用官方阈值分箱并保留原始分数(下游可自行重切)。
§8 伦理、许可与合规
§8.1 许可与义务结构
| 资产 | 许可 | 义务 |
|---|---|---|
| 预测数据(TSV/集成平台) | CC BY 4.0(© 2023 DeepMind) | 署名(引论文) |
| 代码(GitHub/Zenodo) | 开源(Apache 2.0 口径) | 许可声明 |
| 模型权重 | 不公开(安全政策) | 不可反向要求 |
| 下载通道 | 受 GCP ToS | 遵守 Google 云条款 |
| 未覆盖预测 | 邮件申请(alphamissense@google.com) | 非商业限定语 |
§8.2 引用与致谢模板
错义变异致病性预测来自 AlphaMissense(Google DeepMind)2023 年
静态目录(CC BY 4.0)。
引用:Cheng J, et al. Accurate proteome-wide missense variant
effect prediction with AlphaMissense. Science 2023.
doi:10.1126/science.adg7492.
(使用 Ensembl VEP 插件时联合引用 VEP 文献。)
免责:预测为理论建模,不构成医疗建议或临床诊断。
§8.3 国内合规路径
- CC BY 4.0:科研/商业可用,署名义务履行;
- 数据为模型输出(非人类受试者数据)——不涉人类遗传资源出境审批;
- 临床场景边界:辅助生殖/产前诊断等临床使用需按医疗器械/临床检验法规评估——AM 官方定位明确"非临床诊断工具";
- 产品集成(生信平台内置):署名页 + 版本声明(2023 静态目录)+ 免责继承。
§8.4 商业使用边界
- 允许:商业生信管线集成、临床决策支持系统(作为证据参考)、衍生数据库产品(CC BY 4.0);
- 边界 1:不构成医疗器械声称——产品不得以"AlphaMissense 诊断"为卖点;
- 边界 2:GCP ToS 约束下载通道的再分发方式(数据本体 CC BY 4.0 允许再分发附署名);
- 边界 3:相关临时专利(63/415,117、63/479,653)覆盖的方法实现需独立评估——预计算数据的使用不受影响。
§8.5 合规台账最小模板
| 字段 | 示例 |
|---|---|
| 数据集 | AlphaMissense 2023 静态目录(GRCh38) |
| 下载 URL/日期 | storage.googleapis.com/dm_alphamissense / 2026-09-20 |
| 许可 | 数据 CC BY 4.0;代码开源 |
| 署名方式 | Cheng 2023 Science + VEP 联合引用 |
| 使用场景 | 外显子组注释模块(PP3 证据) |
| 临床定位 | 非诊断工具声明 |
| 再分发 | 附许可文本 + SHA256 |
§8.6 责任式发布的治理语义
AlphaMissense 的发布策略是"三开一闭":开放预测数据(CC BY 4.0)、开放代码、开放集成(VEP/UniProt/DECIPHER),关闭模型权重(防止生物滥用场景——如定向设计有害变异)。这是 DeepMind "开放成果、保守能力"框架的实践(同 AlphaFold DB 路线)。代价是学术复现深度受限(无法微调/蒸馏权重),收益是滥用地板。临时专利的存在提示后续可能有商业化路径——静态目录的 CC BY 4.0 是对学术社区的明确承诺。
§9 谱系与生态
§9.1 变异效应预测时间线
| 年份 | 事件 |
|---|---|
| 2001-2003 | SIFT / PolyPhen-2(第一代保守性规则) |
| 2013-2016 | CADD / REVEL(集成元预测;临床管线标配) |
| 2018 | PrimateAI(灵长类演化标签) |
| 2020-2021 | AlphaFold 2(Nature);EVE(无监督 VAE);ESM 语言模型系 |
| 2023-09 | AlphaMissense(Science)——全蛋白组预计算目录 |
| 2023-2024 | UniProt/AlphaFold DB/DECIPHER/ProtVar/VEP 全集成 |
| 2024-2026 | 第三方基准持续验证;PLM 混合模型(域专用)局部超越;AM 仓库归档(~2025-05) |
§9.2 术语表
| 术语 | 含义 |
|---|---|
| 错义变异(missense) | 单核苷酸替换导致氨基酸改变的变异 |
| VUS | 意义未明变异(ACMG 分类中间档) |
| VEP(工具语境) | Variant Effect Predictor / 变异效应预测器 |
| am_pathogenicity | AlphaMissense 连续致病性分(0-1) |
| am_class | 三分分类(likely_pathogenic/likely_benign/ambiguous) |
| MAVE | 多重化变异效应实验(深度突变扫描) |
| LOEUF | 功能缺失不耐受上限分数(gnomAD 约束度量) |
| de novo variant | 新发变异(父母不存在) |
| DDD | Deciphering Developmental Disorders(发育障碍队列) |
| MSA | 多序列比对(演化信息源) |
| PP3/BP4 | ACMG 计算证据条目(支持致病/支持良性) |
| 自蒸馏(self-distillation) | 模型对自身输出过滤以提升训练数据质量 |
| ClinVar | NCBI 变异-临床意义公共档案 |
| MANE Select | RefSeq/Ensembl 一致的代表性转录本 |
§9.3 资源选型决策树
需要变异致病性先验?
├─ 错义变异 ──▶ AlphaMissense(全蛋白组 + MAVE 最准)
│ ├─ 要全变异类型 ──▶ CADD(含非编码/剪接)
│ ├─ 要多工具共识 ──▶ REVEL / AM+CADD+ESM 集成
│ └─ 要无监督对照 ──▶ EVE / ESM 零样本
├─ 基因约束 ──▶ AM 基因均值 + LOEUF/pLI 合并
├─ 临床分级 ──▶ ClinVar(活档案)+ ACMG 框架(AM 只作 PP3)
└─ 新变异覆盖 ──▶ AM 静态目录(2023)+ 邮件申请 / PLM 本地推理
§9.4 与本库其他条目的关系
- ClinVar 类条目:活档案 vs 静态先验——互补分层;
- gnomAD 类条目:频率过滤与 LOEUF 约束——AM 基因级合并对象;
- AlphaFold DB 类条目:同一方法论家族(结构 vs 变异效应);
- HPO 条目:表型对齐——排序管线的语义层;
- UniProt 条目:变体区集成展示——官方消费入口之一。
§9.5 组合使用建议
- AM + ClinVar + gnomAD:注释三件套(先验 + 档案 + 频率);
- AM + CADD/REVEL:多工具共识 PP3 更稳(ClinGen 建议方向);
- AM + HPO + 表型匹配:从变异优先级到候选基因的完整链;
- AM 基因均值 + LOEUF:双约束发现小基因;
- AM + AlphaFold 结构:高分变异回结构上下文(域/界面定位)。
§9.6 变异解释资源的生态角色
AlphaMissense 是变异解释的"全域先验层":上游(序列库/群体变异)→ 一次性全图推理 → 下游(注释管线/临床工具/研究模型)。与 ClinVar(人工策展的活档案)构成"机器先验 × 人工确证"双轨——两者差距正是 VUS 的当前定义。
§9.7 预测器家族的光谱定位
无监督 ◀──────────────────────────▶ 强监督
EVE ESM-1v PrimateAI REVEL CADD AlphaMissense
(单序列/MSA 统计) (集成) (演化弱监督+基础模型)
覆盖窄 ◀──────────────────────────▶ 覆盖全
EVE ESM AM(错义全域) CADD(全变异类型)
§9.8 AlphaMissense 生态的圈层地图
| 圈层 | 成员 | 关系 |
|---|---|---|
| 核心 | 预测目录 + 开源代码 | DeepMind 官方 |
| 方法层 | AlphaFold 2(架构母体)/ ESM 系(同代方法) | 方法论谱系 |
| 集成层 | Ensembl VEP / UniProt / AlphaFold DB / DECIPHER / ProtVar / myvariant.info | 官方合作分发 |
| 对照层 | ClinVar(活档案)/ MAVE 数据库(实验真值)/ gnomAD(频率与 LOEUF) | 校验与合并 |
| 消费层 | 临床注释管线 / 罕见病诊断工具 / AI 优先级模型 / 蛋白工程 | 终端应用 |
§10 资源导航与 FAQ
§10.1 官方资源导航
§10.2 关键文献
| 论文 | 价值 | 标识 |
|---|---|---|
| Cheng 2023(主论文) | 方法/基准/四类资源 | Science; doi:10.1126/science.adg7492 |
| Marsh & Teichmann 2023 | 临床边界警示 | Science Perspective; doi:10.1126/science.adj8672 |
| Jumper 2021(AlphaFold 2) | 方法论母体 | Nature 596:583-589 |
| Frazer 2021(EVE) | 无监督对照方法 | Nature 596:491-495(同期口径) |
| Sundaram 2018(PrimateAI) | 灵长类标签方法 | Nat Genet 50:1052-1057 |
| Richards 2026(第三方基准) | post-2024 队列对照 | Front Genet(OtoVCE 基准) |
§10.3 站内延伸阅读
- ClinVar 变异-临床意义档案 — 活档案与静态先验互补(若已发布)
- gnomAD 基因组聚合数据库 — 频率过滤与 LOEUF 合并(若已发布)
- AlphaFold 蛋白结构数据库 — 同方法论家族
- HPO 人类表型本体 — 排序管线的表型对齐层
- UniProt 蛋白质数据库 — 变体区集成入口
- COSMIC 癌症体细胞突变数据库 — 癌症热点对照(若已发布)
§10.4 FAQ
Q1:AlphaMissense 是什么?
Google DeepMind 2023 年发布的错义变异致病性预测模型——基于 AlphaFold 方法论,对人类蛋白组全部可能的氨基酸替换打 0-1 致病性分,7,100 万错义变异的静态预测目录。
Q2:覆盖多少变异?
19,233 个标准人类蛋白的 2.16 亿可能单氨基酸替换,其中 7,100 万为错义变异(全部有预测);另有约 6 万可变剪接转录本的扩展预测。
Q3:分类结果是什么?
89% 的错义变异被分类:57% likely benign、32% likely pathogenic(这是已分类部分的划分);其余 ambiguous。阈值(<0.3464 / >0.5646)在 ClinVar 上达到 90% precision。
Q4:性能如何?
ClinVar 全局 auROC 0.940(18,924 变异,超 EVE 0.911);ClinVar 612 基因 0.950;DDD de novo 0.809(PrimateAI 0.797);对 MAVE 实验的一致性为同类最优(SHOC2 案例正确预测功能区)。
Q5:训练数据是什么?
两阶段:预训练与 AlphaFold 同构(MSA 掩码重建 + 蛋白语言建模);微调标签为"人类与近缘灵长类群体中见过的变异 vs 从未见过的变异"——演化弱监督。未在 ClinVar 变异上训练(评估独立性)。
Q6:数据许可证?
预测数据 CC BY 4.0(© 2023 DeepMind Technologies Limited;下载通道受 GCP ToS);代码开源(Apache 2.0 口径);模型权重按安全政策不公开。
Q7:怎么下载?
GCS 直链 wget(AlphaMissense_hg38.tsv.gz / hg19 同目录),tabix 建索引后随机访问;或经 Ensembl VEP 插件逐变异注释。
Q8:VEP 插件怎么用?
--plugin AlphaMissense,file=/path/to/AlphaMissense_hg38.tsv.gz;输出 am_pathogenicity(连续分)+ am_class(三分);transcript_match=1 只报匹配转录本。
Q9:是临床诊断工具吗?
不是——官方明确"预测从未训练也从未打算用于独立临床诊断";ACMG/AMP 框架中只能作为 PP3/BP4 计算辅助证据,不能独立定致病。
Q10:为什么模型权重不公开?
DeepMind 安全政策:“prevent use in potentially unsafe applications”(防止定向设计有害变异等滥用)——只开放预计算预测与代码,“开放成果、保守能力”。
Q11:57% benign 和 32% pathogenic 的分母是什么?
是"已分类的 89% 错义变异"的划分——不是全库 7,100 万的比例。常见误读点。
Q12:ambiguous 区有什么用?
0.3464-0.5646 之间的不确定带是实验设计地图——分数贴着阈值的变异最值得 MAVE/功能实验;把 ambiguous 全扔掉会丢失梯度信息。
Q13:和 CADD 怎么选?
AlphaMissense 专注错义、深度更高、MAVE 一致性最强;CADD 覆盖全变异类型(含非编码/剪接)——临床管线常并用。
Q14:和 EVE 的区别?
EVE 无监督逐蛋白建模(auROC 0.911);AlphaMissense 有演化弱监督 + 全蛋白组统一模型(0.940/0.950)——监督对齐带来系统性提升。
Q15:基因级平均分是什么?
每个基因的变异分数平均——与 LOEUF(功能缺失不耐受)性质类似的约束度量;对 LOEUF 统计效力不足的 4,252 个小基因有泛化价值;与 LOEUF 合并更稳。
Q16:怎么用于罕见病诊断?
外显子组注释(VEP 插件)→ 罕见 + 高分过滤 → HPO 表型对齐 → 候选排序;AM 提供 PP3 计算证据与先验排序,最终判定须多证据链。
Q17:对癌症体细胞变异适用吗?
作为功能约束信号可用(Cancer Hotspots 基准表现优异)——但生殖系致病性与体细胞驱动是不同问题,不能直接互推。
Q18:isoform 变异有预测吗?
有——约 6 万可变剪接转录本的扩展发布;主目录是 canonical 蛋白;非 canonical 变异解释需单独核对(VEP 的 transcript_match=1 可防错配)。
Q19:数据会更新吗?
2023 静态目录,无滚动更新;GitHub 仓库约 2025-05 归档——新覆盖需求走 alphamissense@google.com;引用时注明"2023 版静态目录"。
Q20:hg19 和 hg38 文件怎么选?
与你的管线构建一致;混用会坐标静默错位;跨构建需 liftover 并自查损失。
Q21:准确率 90% 是什么口径?
90% precision 是分类阈值的设计目标(在 ClinVar 已知致病与良性变异上双向达成)——不是全库准确率,也不是 auROC(0.940 是排序能力)。
Q22:临床分类只有 2% 是什么意思?
已观察的 400 万+ 错义变异中约 2% 有临床分类(ClinVar 等);约 0.1% 经专家详审至高置信——两个口径并存,语境区分。
Q23:训练标签为什么是"见没见过"?
演化视角的弱监督:人类与近缘灵长类共享的变异经过负选择过滤(可容忍),未见过的变异更可能有害——这是"演化有害性 ≈ 临床致病性"的近似链,有系统偏差(迟发疾病/现代环境)需注意。
Q24:有祖先偏倚吗?
有风险——群体库(gnomAD 等)欧洲过采样使非欧人群罕见变异更可能被标"没见过",系统性偏向高分。对策:分层评测 + 本地人群频率库合并。
Q25:可以本地推理新变异吗?
权重不公开——本地推理不可行;未覆盖预测(非人物种/特定 isoform)邮件申请(alphamissense@google.com,非商业);或用 ESM 系开源 PLM 作替代。
Q26:代码开源了什么?
模型代码(JAX 实现,GitHub/Zenodo)——用于理解与复现推理逻辑;不含权重所以不能重跑推理。
Q27:PP3/BP4 怎么映射?
likely_pathogenic → 支持 PP3(计算证据支持致病);likely_benign → 支持 BP4(支持良性);ambiguous 不计证据;多工具共识更稳(ClinGen 方向),单工具高分不自动构成强证据。
Q28:ClinVar 评估怎么防数据穿越?
固定 ClinVar 快照日期(论文时点或自选)——ClinVar 滚动更新会使跨时指标微变;复现论文口径需 2023 前快照。
Q29:怎么与 LOEUF 合并?
按基因合并两约束信号(双高十分位 → 高置信不耐受基因);AM 对 LOEUF 缺失/低效的小基因补位(4,252 个);合并比单信号稳健。
Q30:MAVE 是什么?为什么重要?
多重化变异效应实验(深度突变扫描)——一次测数千变异的功能效应,是模型一致性的"实验地面真值";AlphaMissense 与 MAVE 一致性最优说明它学到的是功能地形图而非 ClinVar 偏好。
Q31:2024-2026 年有更好的模型吗?
专用域 PLM 混合模型(OtoVCE/MEVIT 类)在特定队列开始超越;通用错义解释中 AM 仍是金标准梯队(post-2024 ClinVar AUC 0.952 量级);但全蛋白组预计算目录仍是独家资产。
Q32:商业产品能用吗?
能——CC BY 4.0 允许商用(附署名与许可文本);产品不得以"诊断"为宣称(官方非临床定位);GCP ToS 约束下载通道。
Q33:怎么引用?
Cheng J, et al. Accurate proteome-wide missense variant effect prediction with AlphaMissense. Science 2023. doi:10.1126/science.adg7492;用 VEP 插件联合引用 VEP;临床语境建议同时引 Marsh & Teichmann Perspective。
Q34:静态目录的"版本管理"怎么做?
文件即版本——记录 SHA256 + 下载日期 + 构建版本;无滚动更新所以无版本选择问题,但要防未来新版的口径漂移。
Q35:ambiguous 变异在 ACMG 里怎么算?
不单独构成 PP3/BP4——但分数本身可在报告附注中呈现(“计算预测不确定”);结合其它证据再定。
Q36:一句话总结 AlphaMissense 的 AI-Ready 价值?
它把"每个错义变异都有先验"变成现实——全蛋白组静态地图 + MAVE 最准 + CC BY 4.0 全开放,是变异解释从"个案猜测"走向"全域计算"的分水岭资源。
Q37:AM 分数能直接给患者看吗?
不能单独呈现——它是群体统计先验,不是个体诊断结论;报告中的正确形态是"计算证据(PP3/BP4)+ ACMG 整合 + 临床解读",且需专业遗传咨询陪同。
Q38:splice 区域变异 AM 覆盖吗?
AM 只管错义(氨基酸替换);经典剪接位点±1/2 变异不在其范畴(用 SpliceAI);但内含子/同义区的"深墙效应"变异中,凡改变氨基酸的仍被覆盖。
Q39:为什么权重不公开还称"AI-Ready"?
AI-Ready 指数据资产的可计算性(格式/许可/覆盖/口径),不是模型可复现性;权重封闭是发布者的安全选择,预计算目录反而让无 GPU 团队也能零成本使用最先进模型的输出。
Q40:怎么跟踪未来的更新?
官方仓库已归档(2025-05),无滚动发布计划;跟踪渠道:AlphaMissense 官网、DeepMind/GOOGLE 研究博客、UniProt 与 VEP 的集成版本说明;若出现新版,以 SHA256 区分新旧目录并重跑基准。
Q41:与 AlphaFold 蛋白结构是什么关系?
共享架构思想但产物不同——AlphaFold 预测结构(“长什么样”),AM 预测错义效应(“改了会怎样”);两者互补:结构可辅助解读高分区是否落在活性位点/界面,但 AM 本身不依赖结构输入。
§10.5 要点回顾
- 定位:错义变异的全域先验——静态地图,不是诊断裁决。
- 三层口径:2.16 亿替换 ⊃ 7,100 万错义 → 89% 分类(57/32 是内部分母)。
- 性能坐标:0.940/0.950/0.809——全局/基因级/真实队列三档。
- 阈值官方:0.3464/0.5646(ClinVar 90% precision)——别自造。
- 演化标签:见过 vs 没见过——"演化有害 ≈ 临床致病"的近似链。
- 双许可一封闭:数据 CC BY 4.0、代码开源、权重不公开。
- ACMG 边界:PP3/BP4 辅助证据——单工具高分 ≠ 致病。
- 转录本纪律:canonical 主目录 + isoform 扩展 + transcript_match=1。
- 祖先偏倚:训练群体构成渗入先验——分层评测。
- 静态治理:文件即版本(SHA256)——ClinVar 活档案要分层时间语义。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 核心数字:19,233 标准人类蛋白 / 2.16 亿可能单氨基酸替换 / 7,100 万错义变异预测 / 89% 分类(57% likely benign + 32% likely pathogenic)/ 阈值 ClinVar 90% precision = Science 论文(10.1126/science.adg7492)+ EurekAlert 发布稿 + Inside Precision Medicine 报道
- 性能:ClinVar 18,924 变异 auROC 0.940(EVE 0.911)/ ClinVar 612 基因 0.950(EVE 0.921)/ DDD de novo 0.809(PrimateAI 0.797)/ Cancer Hotspots 与 ACMG 优于对照 / MAVE 一致性最优(SHOC2 前 80 氨基酸、63-74 位 pathogenic;Ras-MAPK/MRAS-PP1C 语境)= 论文(经科普中国资源服务与 news-medical 交叉核对)
- 训练方法:两阶段(预训练 MSA 掩码重建+语言建模 / 微调人类蛋白 见过 vs 未见过标签)/ 自蒸馏过滤 / 消融两阶段均必要 / 不预测结构或稳定性 = 论文(经科普中国与 news-medical 交叉核对)
- 分类阈值:<0.3464 likely benign / >0.5646 likely pathogenic / 之间 ambiguous;“AlphaMissense was not trained on ClinVar variants” = Ensembl VEP 插件官方文档(AlphaMissense.pm)
- 许可:数据 CC BY 4.0(“AlphaMissense Database Copyright (2023) DeepMind Technologies Limited”)+ GCP ToS 约束 / 免责(理论建模、as-is、非医疗建议)/ 代码 github.com/deepmind/alphamissense + Zenodo / 权重不公开(“we will not be sharing model weights, to prevent use in potentially unsafe applications”)/ 临时专利 US Provisional 63/415,117、63/479,653 / 未覆盖预测 alphamissense@google.com = 论文 Data and materials availability + VEP 插件文档
- 四类资源:7,100 万变异目录 / 基因级预测(LOEUF 类比、4,252 小基因)/ 2.16 亿全替换 / 6 万 isoform = news-medical 论文解读(Data availability 四资源清单)
- 临床背景:平均人 ~9,000 错义变异 / 已观察 400 万+ / 约 2% 临床分类(0.1% 专家详审口径并行)/ VUS 瓶颈 = phys.org(AFP)+ Inside Precision Medicine + EurekAlert
- 集成生态:Ensembl VEP / UniProt / AlphaFold DB / DECIPHER / ProtVar / myvariant.info = VEP 文档 + synthszr 资料页 + SIB 培训材料
- 下载:console.cloud.google.com/storage/browser/dm_alphamissense;直链 storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz;tabix -s 1 -b 2 -e 2 -f -S 1 索引 = VEP 文档 + SIB 癌症变异培训页
- GitHub 仓库约 2025-05 归档(archived,不再活跃维护;预计算数据仍为金标准)= SIB 培训材料 + synthszr 资料页
- 人物:第一作者 Jun Cheng(“predictions were never really trained or never really intended to be used for clinical diagnosis alone”);Pushmeet Kohli(DeepMind 研究副总裁);Marsh & Teichmann Perspective(“不要把标签与临床定义混淆”)= phys.org + EurekAlert + Science Perspective(10.1126/science.adj8672)
- 第三方基准(2024-2026):post-2024 ClinVar 听力损失队列 AM AUC 0.952(CADD 0.941/EVE 0.932/ESM1b 0.919/PrimateAI 0.859);42,684 ClinVar missense AM 0.942(REVEL 0.932)——"PLM 混合新模型局部超越"语境 = Frontiers in Genetics OtoVCE 基准(10.3389/fgene.2026.1880490)+ MEVIT 基准(zenodo 19549576)
- 批次口径差异:批次定义"19,234" vs 论文"19,233"——正文以论文为准(本存照标注)
- 阈值语义:0.3464/0.5646 为"ClinVar 上达到 90% precision 的双向截断",非"风险分层界值";ambiguous 区间(两者之间)无分类主张 = 论文 + VEP 插件文档交叉
- 覆盖细节:89% 分类占比中不含"人类未观察变异之外的非标准残基";目录以 GRCh38/Ensembl 110 canonical 为基准坐标系 = VEP 文档 + SIB 培训材料
- 仓库状态:deepmind/alphamissense GitHub 仓库 2025-05 前后转为 archived(只读归档,issue 关闭);数据分发通道(GCP bucket)不受影响 = GitHub 仓库页面 + SIB 培训材料交叉
- 分数物理意义:AM 输出为 0-1 连续"致病性先验概率"式分数,三档分类由两个官方阈值切分而来;分数跨基因可比性经 MAVE 一致性检验支持(但基因内相对排序仍是首选用法)= 论文正文与补充材料
- 与 AlphaFold 的边界:AlphaFold 回答"结构是什么"、AM 回答"错义效应多大"——AM 不以结构为输入、不预测稳定性变化(ΔΔG 类),两者结论不可互相推导 = 论文(“does not predict protein structure or stability”)+ Marsh & Teichmann Perspective
- 集成覆盖口径:UniProt/VEP/ProtVar 等集成展示的分数与官方 TSV 同源(2023-08 构建);跨平台分数不一致时以官方 bucket 文件为准 = VEP 文档 + ProtVar 说明页
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- impc — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- ckb — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- uk-biobank — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- all-of-us — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- sra — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- ctd — 共享标签:基因组学与多组学 / 公共卫生与流行病学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

