AlphaMissense 错义变异致病性预测 — AI-Ready Wikipedia

7,100 万错义变异 · 2.16 亿氨基酸替换 · 89% 变异被分类:AlphaFold 系方法把全蛋白组变异解释变成可计算问题

来源 https://github.com/google-deepmind/alphamissense发布时间: 2026-09-20最后更新: 2026-09-25 阅读 29
AlphaMissense 错义变异致病性预测 — AI-Ready Wikipedia

信息速览

数据集名称AlphaMissense 错义变异致病性预测 — AI-Ready Wikipedia
数据类型7100 万错义变异,2.16 亿氨基酸替换,89% 变异分类,CC BY 4.0,AlphaFold 系方法
规模不适用(预测模型输出目录;无人类患者数据)
接入方式https://github.com/google-deepmind/alphamissense
AI 就绪度

AlphaMissense — 错义变异致病性预测 AI-Ready Wikipedia

INFOBOX

项目 内容
全名 AlphaMissense(错义变异效应/致病性预测)
开发方 Google DeepMind(第一作者 Jun Cheng;研究副总裁 Pushmeet Kohli)
方法论 AlphaFold 系深度学习(预训练 MSA 掩码重建 + 微调群体变异标签);不预测结构变化
论文 Cheng et al., Science (2023), DOI 10.1126/science.adg7492(2023-09-19)
覆盖范围 19,233 个标准人类蛋白;2.16 亿可能单氨基酸替换
核心产物 7,100 万错义变异预测;89% 分类(57% benign / 32% pathogenic)
性能 auROC 0.940(ClinVar 全局)/ 0.950(ClinVar 基因级)/ 0.809(DDD de novo);MAVE 最准
分类阈值 <0.3464 likely benign;>0.5646 likely pathogenic(ClinVar 90% precision)
数据许可 CC BY 4.0(© 2023 DeepMind Technologies Limited;GCP ToS 约束下载)
代码许可 开源(GitHub/Zenodo;Apache 2.0 口径);模型权重不公开(安全政策)
分发格式 hg19/hg38 TSV.gz(tabix)+ Ensembl VEP 插件 + UniProt/AlphaFold DB/DECIPHER/ProtVar
临床定位 非临床诊断工具;ACMG 框架中仅作 PP3 类计算辅助证据
本库条目 order 484 · record_id 584 · 类别:基因组学与多组学 × 公共卫生与流行病学

§0 E-E-A-T 信任声明与免责声明

  • 经验:本条目基于 Science 2023 论文(DOI 10.1126/science.adg7492)及其 Data and materials availability 声明、Ensembl VEP 插件官方文档(阈值与许可)、Google Cloud Storage 下载页、EurekAlert/phys.org 等发布报道与多家中文科普来源交叉核对;数字全部标注来源。
  • 专业性:两阶段训练方法依据论文 Materials and Methods;性能基准依据论文与后续独立第三方基准(2024-2026);ACMG 证据边界依据 Marsh & Teichmann Perspective 与临床指南惯例。
  • 权威性:AlphaMissense 为 Google DeepMind 官方发布、被 UniProt/Ensembl/DECIPHER 等权威平台集成;本条目为第三方百科解读,不替代官方文档与临床指南。
  • 可信度:文内数字进入文末「口径存照」;19,233(论文)与 19,234(个别批次口径)差异已显式标注;2% 与 0.1% 两个临床分类比例口径已区分。
  • 免责:本条目不构成医疗建议;AlphaMissense 预测为理论建模(官方免责:"as-is"无担保),临床使用须遵循 ACMG/AMP 变异分类规范与多证据链。
  • 时效:口径锁定 2026-09-19/20(论文发布后的静态目录;GitHub 仓库约 2025-05 归档)。

§1 数据集概览

§1.0 📌 30 秒速览

  1. 是什么:Google DeepMind 把 AlphaFold 方法论"转调"到变异解释——给人类蛋白组里每一个可能的氨基酸替换打 0-1 的致病性分。
  2. 多大:19,233 个标准人类蛋白 × 全部 2.16 亿可能替换 → 7,100 万错义变异预测,89% 被分类(57% 良性 / 32% 致病)。
  3. 为什么重要:ClinVar 里绝大多数错义变异仍未分类(仅约 2% 有临床分类)——这是罕见病诊断的最大瓶颈之一;AlphaMissense 用一次推理把"未知的海洋"变成"有梯度分数的全图"。
  4. 怎么用:CC BY 4.0 免费下载 hg38 TSV(tabix 索引)→ Ensembl VEP 插件逐变异注释 → ClinVar 优先级排序 / ACMG PP3 证据。
  5. 一句话:它不是诊断报告,而是全蛋白组尺度上"这个变异值不值得医生多看一眼"的先验排序器。

§1.1 摘要

AlphaMissense 是 Google DeepMind 于 2023 年 9 月发布(Science, Cheng et al., DOI 10.1126/science.adg7492)的错义变异致病性预测模型。错义变异(missense variant)改变蛋白氨基酸序列——平均每人携带约 9,000 个,绝大多数良性,少数致病(囊性纤维化、镰刀型贫血、癌症、神经发育障碍等)。人类已观察错义变异超过 400 万个,但仅约 2% 有临床分类——VUS(意义未明变异)是临床基因组学的最大瓶颈。

AlphaMissense 的方法论直接继承 AlphaFold:它不预测突变如何改变蛋白结构,而是利用相关蛋白序列数据库(MSA 演化信息)与变异的结构上下文,输出 0-1 连续致病性分。训练分两阶段:预训练与 AlphaFold 同构(MSA 中随机掩码位置的氨基酸重建 + 蛋白语言建模);微调以人类蛋白为对象,标签为"人类与近缘灵长类群体中见过的变异 vs 从未见过的变异"——演化层面的弱监督。模型未在 ClinVar 变异上训练,保证了评估独立性。

覆盖与产出:对 19,233 个标准人类蛋白的全部 2.16 亿可能单氨基酸替换打分,其中 7,100 万为错义变异;89% 的错义变异被分类——57% likely benign、32% likely pathogenic(分类阈值在 ClinVar 上达到 90% precision)。性能:ClinVar 18,924 个变异 auROC 0.940(超过此前最优的 EVE 0.911);ClinVar 612 基因 auROC 0.950;DDD 发育障碍 de novo 变异 auROC 0.809(与 PrimateAI 0.797 相当);对 MAVE 深度突变扫描实验的预测一致性为同类最优(SHOC2 案例正确预测前 80 氨基酸的功能重要性)。

发布资源四件套:7,100 万错义变异目录、基因级平均致病性(约束度量,与 LOEUF 性质类似,对 4,252 个统计效力不足的小基因有泛化价值)、2.16 亿全替换目录、约 6 万可变剪接转录本的全错义预测。数据 CC BY 4.0,代码开源(模型权重按安全政策不公开),经 Google Cloud Storage(hg19/hg38 tabix TSV)、Ensembl VEP 插件与 UniProt/AlphaFold DB/DECIPHER/ProtVar 集成全通道开放。

§1.2 战略价值

  1. VUS 海洋的首次全图绘制:2% 临床分类 → 89% 模型分类覆盖——不是"解决了 VUS",而是给每一滴海水装上了温度计;变异优先级排序从"猜"变成"有先验"。
  2. AlphaFold 范式的方法论迁移:AlphaFold 解决"序列→结构",AlphaMissense 解决"序列+变异→效应"——同一套 MSA/语言建模骨架跨任务复用,是"基础模型横向迁移"的教科书案例。
  3. MAVE 的廉价预演:深度突变扫描实验昂贵(每蛋白数万美元级)——AlphaMissense 与 MAVE 的一致性最高,可以先计算后实验,实验资源投向预测不确定区。
  4. 基因级约束的新工具:基因平均致病性与 LOEUF(功能缺失不耐受)性质类似但独立——对 LOEUF 统计效力不足的 4,252 个小基因提供了互补约束信号。
  5. 责任式发布的样本:数据 CC BY 4.0 全开放、代码开源、但模型权重按安全政策不公开——"开放成果、保守能力"的 AI 发布范式先例。

§1.3 同类数据集横向对比

工具 年代 方法 ClinVar auROC 特点
AlphaMissense 2023 AlphaFold 系 DL(MSA+语言建模) 0.940(全局) 全蛋白组覆盖、MAVE 最准
EVE 2021 无监督 VAE(MSA) 0.911 无监督、单蛋白模型
REVEL 2016 集成元预测 ~0.93 口径 多工具融合、临床常用
CADD 2013+ 全变异注释集成 ~0.9 口径 全变异类型(不止错义)
PrimateAI 2018 灵长类保守性 DL —(DDD 0.797) 灵长类演化标签
ESM-1v/2 2021+ 蛋白语言模型零样本 ~0.92 口径 无需 MSA、单序列
PolyPhen-2/SIFT 2000s 规则+保守性 ~0.8 老一代、仍广泛内嵌
  1. 与 EVE 的差异:EVE 无监督(变异分布建模),AlphaMissense 有微调标签(演化见过/没见过)——后者在 ClinVar 全局与基因级都更高(0.940 vs 0.911;0.950 vs 0.921)。
  2. 与 CADD 的分工:CADD 覆盖全变异类型(含非编码/剪接),AlphaMissense 专注错义但深度更高——临床管线常两者并用。
  3. 2024-2026 格局:第三方基准中 AlphaMissense 仍居通用金标准梯队(post-2024 ClinVar 队列 AUC 0.952;42,684 ClinVar missense 0.942);专用域 PLM 混合新模型开始局部超越——但全蛋白组预计算目录仍是独家资产。

§1.4 版本时间轴

时间 里程碑
2020-2021 AlphaFold 2 发布(Nature);AlphaFold DB 全蛋白组结构开放——方法论底座成型
2023-09-19 AlphaMissense 论文线上发表(Science 10.1126/science.adg7492);四类资源开放下载
2023-09-22 正式刊出;Marsh & Teichmann 同期 Perspective(10.1126/science.adj8672)
2023-2024 Ensembl VEP 插件上线;UniProt/AlphaFold DB/DECIPHER/ProtVar 逐步集成
2024-2025 独立基准持续验证(post-2024 ClinVar 队列仍居第一梯队);专用域 PLM 混合模型开始出现
2025-05(约) GitHub 仓库归档(archived)——不再活跃维护;预计算目录继续作为金标准被消费

§1.5 应用场景矩阵

场景 用什么 典型动作
罕见病外显子组优先级 am_class + am_pathogenicity VEP 注释 → 变异排序 → 候选致病筛选
ACMG/AMP 证据辅助 am_class PP3(计算证据支持致病)/ BP4(良性)
新致病基因发现 基因级平均分 高分基因 + 新发突变富集 → 候选基因
MAVE 实验设计 低置信区检索 预测 ambiguous 区 → 实验优先
癌症体细胞变异解释 am_pathogenicity 热点变异功能影响排序(辅助)
蛋白工程风险评估 全替换目录 单点突变稳定性/功能风险预筛
数据库集成 TSV/VEP 插件 本地注释管线/临床报告系统

§1.6 组件全景

  • 变异级目录:7,100 万错义变异 ×(am_pathogenicity 0-1 + am_class 三分)——主消费资产;
  • 全替换目录:2.16 亿单氨基酸替换(含同义/无义等)——研究用超集;
  • 基因级约束:19,233 基因平均致病性——LOEUF 类约束度量;
  • isoform 扩展:约 6 万可变剪接转录本全错义预测——非 canonical 变异解释;
  • 分发层:hg19/hg38 TSV.gz + tabix、Ensembl VEP 插件(am_pathogenicity/am_class 列)、UniProt 变体页、AlphaFold DB、DECIPHER、ProtVar;
  • 代码层:GitHub/Zenodo 开源(JAX 实现;权重不公开)。

§1.7 两阶段训练方法速记

阶段一:预训练(AlphaFold 同构)
    蛋白序列 + MSA ──▶ 掩码氨基酸重建
    (学习"什么样的序列在演化上像真的")

阶段二:微调(人类蛋白弱监督)
    标签 = 人类/近缘灵长类见过的变异(演化可容忍)
         vs 从未见过的变异(演化罕见→疑似有害)
    ──▶ 输出 0-1 致病性分
  • 自蒸馏(self-distillation)过滤训练数据提升质量;
  • 消融实验:两阶段均必要(去掉任一性能下降);
  • 关键理解:标签是"演化频率"不是"临床致病"——模型的临床相关性是"演化有害性 ≈ 功能有害性 ≈ 临床致病性"的近似链。

§1.8 文件格式速记

TSV.gz(tabix 索引)核心列(hg38 示例):

#chr    pos     alt/ref      transcript        protein_change    am_pathogenicity  am_class
17      7676594 G/A          ENST00000269305   p.G245S           0.61...           likely_pathogenic
  • tabix 建索引:tabix -s 1 -b 2 -e 2 -f -S 1 AlphaMissense_hg38.tsv.gz;
  • Ensembl VEP 插件输出两列:am_pathogenicity(连续)+ am_class(三分);
  • 分类阈值:<0.3464 → likely benign;>0.5646 → likely pathogenic;之间 → ambiguous。

§1.9 独特视角:给"未知"定价的模型

AlphaMissense 的真正产物不是"分类标签"而是梯度:0.3464-0.5646 之间的 ambiguous 区才是实验价值的地图——分数贴着阈值的变异最值得 MAVE/功能实验。它把变异解释从"二分类问题"重新定义为"资源分配问题":计算先给出全域先验,实验资源投向先验不确定的窄带。这个"AI 预演 → 实验聚焦"的流程正是后基因组时代 wet-lab/dry-lab 协作的新范式。

§2 医学与科学背景

§2.1 错义变异与疾病

错义变异是单核苷酸改变导致氨基酸替换的变异——蛋白编码变异的主体。疾病语义谱:直接致病的单基因突变(囊性纤维化 G551D、镰刀型贫血 E6V)、癌症驱动热点(KRAS G12 系列、TP53 DNA 结合域)、复杂疾病的风险叠加(2 型糖尿病等)。平均个体携带约 9,000 个错义变异——绝大多数中性,"哪些有害"是解释的核心难题。

§2.2 VUS 瓶颈的临床语义

  • 已观察错义变异 400 万+,仅约 2% 有临床分类(ClinVar 等);其中经专家详审至高置信的更低(约 0.1% 量级口径);
  • ACMG/AMP 2015 框架下变异分级(pathogenic → benign 五档)依赖多证据链:人群频率、计算预测、功能实验、分离分析、等位数据;
  • VUS 是"证据不足"不是"无害/有害未知"——诊断回报率因此卡壳;
  • 计算预测在 ACMG 中只能作 PP3(支持致病)/BP4(支持良性)辅助证据——AlphaMissense 的角色是"证据链一环"而非"裁决者"。

§2.3 变异效应预测器(VEP)的方法谱系

代际 代表 信号源 局限
第一代(2000s) SIFT、PolyPhen-2 单序列保守性 + 物理性质 精度有限
集成代(2013-2016) CADD、REVEL 多特征/多工具元学习 依赖上游工具质量
演化统计代(2021) EVE MSA 无监督生成模型 逐蛋白建模、覆盖受限
灵长类代(2018+) PrimateAI 灵长类共保守 非编码偏好
基础模型代(2023+) AlphaMissense、ESM 系列 MSA+语言建模+弱监督 标签近似、权重封闭

AlphaMissense 的位置:基础模型代的整合者——同时吃 MSA 演化与语言模型泛化,微调对齐到人类变异分布。

§2.4 MAVE 与计算预测的互验语义

MAVE(multiplexed assays of variant effect)深度突变扫描:一次实验测数千变异的功能效应——是致病性的"实验地面真值"(但测的是功能不是临床)。AlphaMissense 与 MAVE 的一致性为同类最优:

  • SHOC2 案例:正确预测前 80 氨基酸的功能重要性(63-74 位 pathogenic)——该区参与 Ras-MAPK 通路(MRAS-PP1C 复合体);
  • 语义边界:MAVE 测"蛋白功能效应",ClinVar 收"临床关联"——两者高度相关但不等价;
  • 互验流程:计算预测 → MAVE 验证 → ClinVar 提交——AlphaMissense 在链条前端提供优先级。

§2.5 基因级约束与 LOEUF 的互补

LOEUF(loss-of-function observed/expected upper bound fraction)度量基因对功能缺失的不耐受——来自 gnomAD 人群频率,统计效力受观察数限制。AlphaMissense 基因平均致病性:

  • 与 LOEUF 在多种不耐受度量上性质一致;
  • 独立信息源(演化序列 vs 人群频率)——两者结合提升约束估计;
  • 关键增量:对 LOEUF 统计效力不足的 4,252 个小基因,AlphaMissense 十分位数性质保持一致——小基因约束的"补位工具"。

§2.6 癌症语义:驱动 vs 乘客

体细胞错义变异的海量观察(COSMIC 等)中驱动突变是少数。AlphaMissense 对 Cancer Hotspots 基准表现优异——语义上是"氨基酸位置的功能约束"排序:热点 ≈ 功能重要 ≈ 演化/结构上不可替换。注意:肿瘤体细胞预测与生殖系致病性是不同问题(选择压力不同)——文献中作为辅助信号使用,非直接互推。

§2.7 罕见病诊断工作流中的位置

外显子组/基因组测序 ──▶ 变异调用 ──▶ 注释(VEP + AlphaMissense/CADD/REVEL/ClinVar)
        │
        ├──▶ 排序:ACMG 证据合并(PP3/BP4 由计算预测贡献)
        ├──↘ 表型匹配(HPO)+ 遗传模式过滤
        ▼
候选变异清单 ──▶ 分离分析/功能实验 ──▶ 诊断结论

AlphaMissense 在注释层的价值:对没有 ClinVar 记录的变异提供先验——降低"优质候选被埋在 VUS 堆里"的概率。

§2.8 isoform 语义

主目录基于 19,233 个 canonical 蛋白;同一基因的可变剪接 isoform(约 6 万转录本)的错义变异另有预测发布。临床注释的常见坑:变异落在 isoform 特有外显子时,canonical 口径的预测不可用——需要转录本匹配(VEP 插件的 transcript_match=1 选项)或查 isoform 扩展目录。

§2.9 演化标签的生物学语义

“人类/灵长类见过的变异 = 可容忍"的隐含假设:演化时间尺度的负选择已过滤高害变异。偏差来源:近期正选择、奠基者效应、以及"演化可容忍 ≠ 无临床后果”(迟发疾病、现代环境交互)。这是所有演化标签方法(含 PrimateAI)的共同边界——临床解读时作为先验而非结论。

§3 数据集规格

§3.1 规格总表

项目 规格
名称 AlphaMissense
开发方 Google DeepMind
发布 2023-09(Science 10.1126/science.adg7492)
覆盖 19,233 标准人类蛋白 / 2.16 亿单氨基酸替换
主产物 7,100 万错义变异预测(89% 分类:57% benign / 32% pathogenic)
评分 am_pathogenicity 0-1 连续分
分类阈值 <0.3464 benign / >0.5646 pathogenic(ClinVar 90% precision)
性能 auROC 0.940(ClinVar 全局)/ 0.950(基因级)/ 0.809(DDD)
基因级产物 19,233 基因平均致病性(LOEUF 类约束)
isoform 产物 约 6 万可变剪接转录本全错义预测
分发 GCS(hg19/hg38 TSV.gz+tabix)/ Ensembl VEP 插件 / UniProt / AlphaFold DB / DECIPHER / ProtVar
数据许可 CC BY 4.0(© 2023 DeepMind;GCP ToS 约束下载通道)
代码 GitHub/Zenodo 开源;模型权重不公开
引文 Cheng et al. Science 2023(+ Ensembl VEP 若用插件)
官方入口 github.com/google-deepmind/alphamissense + console.cloud.google.com/storage/browser/dm_alphamissense

§3.2 数据发布口径的地图

  1. 静态快照属性:2023 年一次发布,无滚动更新——"版本"即论文版;GitHub 约 2025-05 归档后无新版本通道。
  2. 三套计数口径:2.16 亿(全替换)⊃ 7,100 万(错义)→ 89% 分类(6,300 万级)——引用必须指明层级。
  3. 57%/32% 的分母:是对"已分类的 89%"的划分(不是全库 7,100 万)——常见误读点。
  4. 蛋白计数:19,233(论文口径);个别二手来源写 19,234——以论文为准。
  5. 临床分类比例:约 2%(有临床分类的观察变异)与约 0.1%(专家详审口径)并存——语境区分。
  6. 基因组构建:hg19(GRCh37)与 hg38(GRCh38)双版本文件——坐标口径不可混。

§3.3 DAIMS 数据AI就绪度评估

# 维度 指标 评分(1-5) 依据
1 A 可获得 免费获取 5 CC BY 4.0;GCS 直链无注册
2 A 可获得 获取流程 5 直链 wget + tabix;未覆盖预测邮件通道
3 A 可获得 分发格式 4 TSV.gz+tabix 标准化;格式单一(无 JSON/Parquet)
4 A 可获得 历史版本回溯 3 静态快照无版本演进;Zenodo 存档保留
5 D 文档 官方文档 4 论文+VEP 插件文档详尽;独立数据文档薄
6 D 文档 方法透明度 4 论文方法完整;权重不公开限制复现深度
7 D 文档 引用规范 5 论文 DOI 明确;VEP 联合引用要求清晰
8 I 互操作 标识符 FAIR 5 基因组坐标+转录本+蛋白改变三层标识
9 I 互操作 本体对齐 4 三分分类简单明确;无本体系统
10 I 互操作 跨资源整合 5 VEP/UniProt/AlphaFold DB/DECIPHER/ProtVar 全集成
11 M 元数据 参数元数据 4 分数+分类+阈值说明;置信区间无
12 M 元数据 版本元数据 3 静态单版;无滚动版本戳体系
13 S 可持续 治理机制 4 DeepMind 持续托管;仓库已归档维护停滞
14 S 可持续 资源持续供给 4 GCS 长期托管;无更新路线图

综合 59/70(4.2/5)——可及性与互操作是满分档(直链+全平台集成);扣分在静态快照属性(无版本演进/权重封闭/维护归档)——这是"一次性科研发布"形态的典型画像。

§3.4 存储与计算需求

  1. 主文件体积:hg38 TSV.gz GB 级(7,100 万行级)——解压后数十 GB;tabix 随机访问是标准姿势(无需全解压)。
  2. 全量装载:pandas/duckdb 全量入内存 32-64 GB 可行;全替换目录(2.16 亿行)建议列存(Parquet)+ 分区。
  3. VEP 管线:插件按变异查表——全外显子组(10 万变异级)分钟级;全基因组(千万变异级)小时级。
  4. 本地推理:权重不公开——本地重推理不可行;定制需求走 alphamissense@google.com。
  5. 合并分析:与 ClinVar/gnomAD 合并按基因组坐标 + 蛋白改变双键——注意转录本口径对齐(canonical vs MANE)。

§3.5 获取通道

  1. GCS 直链:https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz(hg19 同目录)——wget 即可;浏览入口 console.cloud.google.com/storage/browser/dm_alphamissense。
  2. Ensembl VEP 插件:AlphaMissense.pm——--plugin AlphaMissense,file=/path/to/AlphaMissense_hg38.tsv.gz;输出 am_pathogenicity/am_class;transcript_match=1 可只报匹配转录本。
  3. UniProt:蛋白条目变体区展示 AlphaMissense 分数(逐变异)。
  4. AlphaFold DB / ProtVar / DECIPHER:结构上下文与临床遗传平台的集成视图。
  5. Zenodo:代码与数据的学术存档(论文 Data availability 指定)。
  6. 定制请求:未覆盖预测(非人/特定 isoform)与非商业需求——alphamissense@google.com。

§3.6 口径对齐表

数字 口径 A 口径 B 使用建议
变异数 7,100 万(错义) 2.16 亿(全部替换) 分清预测对象层级
分类率 89%(被分类的错义变异) 57%/32%(在 89% 内的划分) 分母不同勿混
蛋白数 19,233(论文) 19,234(个别二手口径) 以论文为准
临床分类 ~2%(观察变异有临床分类) ~0.1%(专家详审口径) 语境注明
精度 90% precision(阈值设计目标) auROC 0.940(全局排序能力) precision 与 auROC 不同
基因组构建 hg38/GRCh38 hg19/GRCh37 坐标不可混

§3.7 版本选择纪律

  1. 只有一版:2023 论文版是唯一官方目录——不存在"最新版"选择问题,但要防"未来若有新版"的口径漂移。
  2. 构建一致性:分析管线统一 hg38 或 hg19——双文件并存时坐标转换(liftover)引入的损失要自查。
  3. 转录本口径:默认 canonical(ENST 编码转录本);MANE Select 与 AlphaMissense 所用转录本的对应关系入方法节。
  4. 归档后果:GitHub 归档 ≠ 数据下线——GCS/Zenodo 继续可用;引用时注明"2023 版静态目录"。
  5. 与 ClinVar 快照对齐:评估复现时固定 ClinVar 快照日期——ClinVar 滚动更新会使指标微变。

§3.8 数据文件与字段详表

数据面 粒度 关键字段
AlphaMissense_hg38.tsv.gz 每变异一行 chr、pos、alt/ref、transcript_id、protein_id、protein_change、am_pathogenicity、am_class
AlphaMissense_hg19.tsv.gz 同上(GRCh37 坐标) 同上
基因级平均 每基因一行 gene、mean am_pathogenicity(约束度量)
全替换目录 每替换一行 同上(含同义/无义等非错义替换)
isoform 扩展 每 isoform 变异 非 canonical 转录本预测
VEP 插件输出 每注释变异 am_pathogenicity、am_class(默认列;cols=all 全输出)

§4 数据结构

§4.1 对象模型

AlphaMissense 输出体系
├── 变异级(主资产)
│     键:基因组坐标(chr-pos-ref-alt)+ 转录本
│     值:am_pathogenicity(0-1)+ am_class(三分)
├── 基因级(约束)
│     键:基因
│     值:平均致病性(≈ LOEUF 类不耐受度量)
├── 替换级(研究超集)
│     2.16 亿全部单氨基酸替换(含同义/无义)
└── isoform 级
      约 6 万可变剪接转录本的错义预测

关系:替换级 ⊃ 错义级;变异级按蛋白聚合 → 基因级

§4.2 下载与 tabix 索引(实战)

#!/usr/bin/env bash
# 1) 下载(hg38 主文件;hg19 同目录)
wget https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz
wget https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg19.tsv.gz

# 2) 建 tabix 索引(位置列索引;首次使用前必须)
tabix -s 1 -b 2 -e 2 -f -S 1 AlphaMissense_hg38.tsv.gz
tabix -s 1 -b 2 -e 2 -f -S 1 AlphaMissense_hg19.tsv.gz

# 3) 按区域快速抽取(TP53 区)
tabix AlphaMissense_hg38.tsv.gz chr17:7,600,000-7,800,000 | head -5

# 4) 全表统计(行数验证)
zcat AlphaMissense_hg38.tsv.gz | grep -vc '^#'   # 数千万级错义变异

§4.3 Ensembl VEP 插件注释(实战)

#!/usr/bin/env bash
# 安装插件
mv AlphaMissense.pm ~/.vep/Plugins/

# 基本用法:打印分数与分类(默认列)
./vep -i variants.vcf \
      --plugin AlphaMissense,file=/full/path/AlphaMissense_hg38.tsv.gz \
      --cache --offline

# 全列输出
./vep -i variants.vcf \
      --plugin AlphaMissense,file=/full/path/AlphaMissense_hg38.tsv.gz,cols=all

# 只报与 AlphaMissense 转录本匹配的注释(避免 isoform 错配)
./vep -i variants.vcf \
      --plugin AlphaMissense,file=/full/path/AlphaMissense_hg38.tsv.gz,transcript_match=1

§4.4 Python 批量解析与优先级排序

#!/usr/bin/env python3
"""外显子组变异 × AlphaMissense 分数 → 候选致病排序"""
import pandas as pd

# 读入 VEP 注释结果(TSV)——假设含 AM 列
v = pd.read_csv("vep_annotated.tsv", sep="\t", comment="#", low_memory=False)

# 三分分类 → ACMG 证据方向
def amg_direction(row):
    if row["am_class"] == "likely_pathogenic":
        return "PP3"          # 计算证据支持致病
    if row["am_class"] == "likely_benign":
        return "BP4"          # 计算证据支持良性
    return None               # ambiguous 不单独计证据
v["acmg_hint"] = v.apply(amg_direction, axis=1)

# 罕见 + 高分候选(示例过滤链)
rare = v[(v["gnomad_af"] < 1e-4) & (v["am_pathogenicity"] > 0.5646)]
top = rare.sort_values("am_pathogenicity", ascending=False).head(50)
print(top[["Uploaded_variation", "SYMBOL",
           "am_pathogenicity", "acmg_hint"]])

§4.5 基因级约束合并(与 LOEUF 对照)

#!/usr/bin/env python3
"""基因平均致病性 vs LOEUF:双约束信号合并"""
import pandas as pd

am_gene = pd.read_csv("alphamissense_gene_averages.csv")   # 基因级均值
loeuf   = pd.read_csv("gnomad_loeuf.tsv", sep="\t")        # gnomAD 约束

m = am_gene.merge(loeuf, on="gene", how="outer")
m["am_decile"]  = pd.qcut(m["mean_am"], 10, labels=False)
m["loeuf_rank"] = m["loeuf"].rank(pct=True)

# 双高约束基因(两边都极不耐受)——疾病基因富集区
dual = m[(m["am_decile"] == 9) & (m["loeuf_rank"] > 0.9)]
print("双高约束基因数:", len(dual))

# 小基因补位:LOEUF 缺失/低效(观察少)但 AM 分高
small = m[m["loeuf"].isna() & (m["am_decile"] >= 8)]
print("AM 补位小基因:", len(small))   # 论文口径:4,252 个小基因受益

§4.6 MAVE 对照验证(SHOC2 类分析)

#!/usr/bin/env python3
"""模型分数 vs MAVE 实验效应的一致性检查(逐蛋白)"""
import pandas as pd
from scipy.stats import spearmanr

mave = pd.read_csv("mave_shoc2_scores.csv")   # 实验效应(DMS)
am   = load_am_positions("SHOC2")             # 该蛋白各位置 AM 均分

j = mave.merge(am, left_on="position", right_on="aa_position")
rho, p = spearmanr(j["mave_effect"], j["am_pathogenicity"])
print(f"逐位置 Spearman ρ = {rho:.3f} (p={p:.1e})")

# 逐变异(替换级)一致性更严——论文口径:MAVE 一致性同类最优

§4.7 元数据与可复现指纹

import hashlib, json
fingerprint = {
    "tool": "AlphaMissense",
    "paper_doi": "10.1126/science.adg7492",
    "release": "2023 static catalogue",
    "genome_build": "GRCh38",
    "file_sha256": hashlib.sha256(
        open("AlphaMissense_hg38.tsv.gz", "rb").read()).hexdigest()[:16],
    "thresholds": {"benign": 0.3464, "pathogenic": 0.5646},
    "transcript_policy": "canonical only, transcript_match=1",
}
print(json.dumps(fingerprint, indent=1))

§4.8 下载校验与抽查脚本(实战)

静态目录的可信度建立在"可校验"上——下载即验证是第一道产线工序:

# 1) 下载主文件与索引
gsutil cp gs://dm_alphamissense/AlphaMissense_hg38.tsv.gz .
gsutil cp gs://dm_alphamissense/AlphaMissense_hg38.tsv.gz.tbi .
# (无 gcloud 时可用直链:wget storage.googleapis.com/dm_alphamissense/...)

# 2) 指纹入库
sha256sum AlphaMissense_hg38.tsv.gz | tee alphamissense_hg38.SHA256

# 3) tabix 抽查:TP53:75650212-7590856(GRCh38 口径需自行核对坐标)
tabix AlphaMissense_hg38.tsv.gz chr17:75650212-7590856 | head -3

# 4) 分布抽查:am_class 比例应在 57:32 量级(ambiguous 占其余)
zcat AlphaMissense_hg38.tsv.gz | awk 'NR>1 {c[$5]++} END {for (k in c) print k, c[k]}'

四步全过才算"下载完成":指纹一致(防传输损坏)、索引可用(防断点截断)、热区可查(防内容错位)、分布符合预期(防拿错文件/错构建)。

§4.9 完整性清单

  1. 文件 SHA256 记录(静态库的"版本"就是文件本身);
  2. tabix 索引存在且可查(抽查 TP53/KRAS 区域);
  3. am_class 分布合理(benign:pathogenic ≈ 57:32 的比例量级);
  4. 基因组构建与管线一致(hg38 管线吃 hg19 文件是静默灾难);
  5. 转录本匹配策略声明(transcript_match 或 MANE 对齐);
  6. 阈值常量入配置(0.3464/0.5646——不要硬编码散落各处)。

§4.10 数据血缘

上游输入                       模型                     下游输出
──────────                    ─────                   ─────────
UniRef 蛋白序列库(MSA) ──┐
AlphaFold 架构/训练法   ──┼─▶ AlphaMissense ──▶ 变异级预测(7,100 万)
人类+灵长类群体变异标签 ──┘   (预训练+微调)      ├─▶ 基因级均值(约束)
                                                  ├─▶ 全替换目录(2.16 亿)
                                                  └─▶ isoform 扩展(6 万转录本)

集成消费:Ensembl VEP 插件 / UniProt 变体页 / AlphaFold DB /
          DECIPHER / ProtVar / myvariant.info

§5 下游分析协议

§5.1 任务×资源速查表

任务 数据面 方法 输出
外显子组变异优先级 变异级分数 VEP 注释 + 过滤链 候选清单
ACMG 证据辅助 am_class PP3/BP4 映射 证据条目
新致病基因发现 基因级均值 双约束合并 + de novo 富集 候选基因
MAVE 实验设计 ambiguous 区 阈值邻域检索 实验优先表
癌症热点解释 变异级分数 热点对照 功能影响排序
管线集成 TSV/VEP tabix/插件 注释服务

§5.2 罕见病候选变异排序协议

  1. 变异调用与质控(VQSR/硬过滤);
  2. VEP 注释(含 AlphaMissense 插件、ClinVar、gnomAD 频率);
  3. 硬过滤:罕见(gnomAD AF < 1e-4)+ 高影响预测(am > 0.5646 或 am_class = likely_pathogenic);
  4. 表型对齐(HPO)与遗传模式过滤;
  5. ACMG 合并:PP3 计入(不得单独定级);ClinVar 已分类优先;
  6. 输出:候选清单 + 证据链文档(每个候选附 AM 分数与阈值上下文)。

§5.3 新致病基因发现协议

  1. 基因级均值 → 约束十分位;
  2. 与 LOEUF/pLI 合并 → 双约束基因集;
  3. 疾病队列 de novo/罕见变异富集 → 候选基因;
  4. 交叉验证:Constraint 双信号 + 表型一致性 + 生物合理性(通路);
  5. 报告:明确"计算先验"属性——确认需功能/分离证据。

§5.4 MAVE 预演协议

  1. 目标蛋白 → AM 逐位置/逐替换分数;
  2. 识别 ambiguous 带(0.3464-0.5646)与高分矛盾区(文献冲突变异);
  3. 设计 DMS 文库覆盖目标区(预算聚焦);
  4. 实验后回填:模型-实验一致性(Spearman/AUROC);
  5. 联合发布:预测+实验闭环(ClinVar 提交)。

§5.5 失败模式清单

  1. 把分类当诊断:likely_pathogenic ≠ 致病——ACMG 多证据缺失即违规;
  2. 构建错配:hg19 文件进 hg38 管线——坐标全错且无报错;
  3. 转录本错配:isoform 变异套 canonical 分数——transcript_match 关闭时的静默错误;
  4. 阈值乱用:自造阈值无 precision 依据——用官方 0.3464/0.5646;
  5. ambiguous 丢弃信息:只留两分标签——分数梯度才是核心资产;
  6. 基准循环:用 ClinVar 调阈值又报 ClinVar 指标——论文阈值固定即无此问题;
  7. 基因级误读:平均分高 ≠ 每个变异高——位置异质性巨大;
  8. 版本漂移:ClinVar 快照不固定导致复现失败。

§5.6 校准与验证协议

  1. 已知阳性对照:ClinVar 高置信致病变异的 AM 分布(应集中于高分);
  2. 已知阴性对照:gnomAD 高频变异(应集中于低分);
  3. 阈值复现:官方阈值下 ClinVar precision ≈ 90%(双向);
  4. 外部基准:MAVE 子集 Spearman/AUROC(对照论文口径);
  5. 管线端到端:金标样本(GIAB)全流程回归。

§5.7 验证报告的最小模板

任何把 AM 分数写进临床或科研报告的场景,方法学段落至少包含以下六要素——缺一项即不完整:

  1. 资源版本:AlphaMissense_hg38.tsv.gz(2023-08-16 构建)+ SHA256 指纹;
  2. 转录本规则:canonical(MANE Select)主注释;transcript_match=1 的处理策略;
  3. 阈值口径:0.3464/0.5646(来源:Science 论文 ClinVar 90% precision 校准),ambiguous 的处理方式(呈报但不计分);
  4. 工具组合:与 CADD/REVEL/SpliceAI 的共识规则(如"3 工具中 2 高分");
  5. 覆盖声明:注释率(应≈100% canonical 错义)、未命中原因(非错义/基因组重复区);
  6. 边界声明:ACMG PP3/BP4 辅助证据定位、非人群特异性、祖先偏倚提示。

这六要素的本质是把"预测器"写成"测量仪器"——仪器需要型号(版本)、量程(阈值)、读数规则(转录本与 ambiguous)、以及误差声明(偏倚)。

§6 实证结果与方法学分析

§6.1 一次发布的实证结构

AlphaMissense 是"一次性全图发布"形态:无滚动版本、无增量更新。实证后果:所有下游引用共享同一稳定基线(复现友好);但人群/功能数据持续演化而模型静止——2026 年的 ClinVar 已包含大量"事后"分类,跨时评估需注意数据穿越。

§6.2 与 EVE 的对比启示

EVE(无监督 VAE)0.911 → AlphaMissense 0.940 的提升来源:微调标签(演化见过/未见)提供了监督信号;MSA+语言建模双信号融合;全蛋白组统一模型(EVE 逐蛋白建模成本高)。方法论启示:无监督生成 + 弱监督对齐是"基础模型 + 领域先验"的高效配方。

§6.3 ClinVar 三档基准的实证细节

  • 全局(18,924 变异):0.940——排序能力的整体画像;
  • 基因级(612 基因):0.950——临床最相关的"同一基因内良恶分辨"(临床场景常在候选基因内比较变异);
  • DDD(de novo):0.809——真实诊断队列(含非热点、多样本噪声)的落地画像;与 PrimateAI(0.797)相当说明该场景接近演化标签方法的上限。

§6.4 MAVE 一致性的实证亮点

SHOC2 案例(Ras-MAPK 通路):AlphaMissense 正确预测前 80 氨基酸的功能重要性——其中 63-74 位被 MAVE 判为 pathogenic。逐位置平均分与 MAVE 逐位置平均强一致——"模型确实学到了功能地形图"的证据,而非仅克隆 ClinVar 偏好。

§6.5 八个真实坑点

  1. 坑点 1:分类当诊断——likely_pathogenic 直译临床致病;ACMG 只允许 PP3。
  2. 坑点 2:分母误读——57%/32% 是 89% 内的划分;写"全库 57% 良性"是错的。
  3. 坑点 3:构建错配——hg19/hg38 文件与管线不一致;坐标静默错位。
  4. 坑点 4:转录本错配——isoform 变异套 canonical 分数;开 transcript_match=1。
  5. 坑点 5:阈值自造——自选截止无 precision 依据;用官方两阈值。
  6. 坑点 6:ambiguous 扔掉——只留二分标签丢梯度;分数本身是资产。
  7. 坑点 7:基因级当变异级——基因均值高不代表特定变异高;逐变异核对。
  8. 坑点 8:数据穿越——用 2026 ClinVar 复现 2023 指标不设快照;固定 ClinVar 日期。

§6.6 审稿人自查清单

  • [ ] 论文 DOI + 静态版声明(2023 目录)?
  • [ ] 基因组构建(hg38/hg19)与文件版本?
  • [ ] 阈值来源(0.3464/0.5646 官方)?
  • [ ] 转录本匹配策略(canonical/MANE/transcript_match)?
  • [ ] 分类与分数的使用方式(梯度 vs 标签)?
  • [ ] ACMG 证据边界(PP3/BP4)声明?
  • [ ] ClinVar 快照日期(若做评估)?
  • [ ] 引用含 Ensembl VEP(若用插件)?

§6.7 版本治理的方法学含义

静态目录的治理简单但脆弱:文件即版本(SHA256 指纹);无更新通道意味着误差修复/覆盖扩展只能期待下一版(或第三方模型)。社区应对:把 AM 分数当"2023 先验层"而非"活数据"——与 ClinVar(活数据)的合并分析要显式分层时间语义。

§6.8 与 ACMG/AMP 框架的整合张力

ACMG 2015 框架早于深度学习预测器泛滥——PP3/BP4 的"计算证据"条目预设了"多工具共识"(如 ClinGen SVI 建议 ≥2 工具一致)。AlphaMissense 单工具高分不自动构成 PP3 强证据;整合指南(如 ClinGen 变异效应预测专家组)的更新应跟踪。张力本质:模型代际快于指南代际——使用时注明指南版本与工具版本。

§6.9 分数语义的解读纪律

  • 0-1 分是"模型对致病性的概率化输出",不是"人群中有害频率"也不是"临床命中概率";
  • 高分区(>0.5646)的 90% precision 是 ClinVar 口径——全库口径不可直接外推;
  • 分数在家族内的比较(同一蛋白的不同变异)比跨家族绝对值更有意义;
  • ambiguous 不是"没用"——它是实验设计地图。

§7 AI 就绪指南与应用场景

§7.1 AlphaMissense 在医疗 AI 中的四种喂法

  1. 先验特征:变异级 am_pathogenicity 作为 ML 模型输入特征(致病性分类器/优先级排序器);
  2. 弱标签源:高分/低分带做弱监督(规避人工标注瓶颈;注意标签噪声);
  3. 约束信号:基因级均值并入基因选择/靶点优先级模型(与 LOEUF/pLI 融合);
  4. 评测基线:新变异解释模型的对照基线(金标准梯队)。

§7.2 变异优先级管线实操配方

VCF → VEP(AM 插件 + ClinVar + gnomAD + CADD)
   → 硬过滤(罕见 + 高分 + 高影响)
   → ML 重排序(特征:AM 分数/CADD/保守性/域注释)
   → HPO 表型对齐 → 候选清单 → 人工审阅

§7.3 模型选型与迁移决策

模型 何时用 注意
逻辑回归 + AM/CADD 特征 小样本临床数据 特征标准化 + 校准
梯度提升排序 变异优先级 分数梯度(不用二分标签)
图神经网络(基因-变异图) 多信号融合 AM 作为节点特征之一
PLM 微调(ESM 系) 有算力+定制标签 注意与 AM 的基准对齐
集成(AM+CADD+REVEL+ESM) 稳健生产 工具相关性检查

§7.4 公平性:预测覆盖的祖先偏倚

训练标签来自人类+灵长类群体变异——gnomAD 等群体库的祖先构成(欧洲过采样)会渗入"见过/没见过"的先验。非欧洲人群的罕见变异更可能被标"没见过",系统性偏向高分(假阳性偏置)。对策:按祖先分层评测;结合本地人群频率库(如 CN 基础数据库);报告 per-ancestry 指标。

§7.5 任务×资源速查表

AI 任务 用法 关键字段 评测要点
致病性分类 特征 am_pathogenicity 跨时 ClinVar 快照
变异排序 重排序信号 分数梯度 NDCG/Top-k 命中
基因优先级 约束特征 基因均值 与 LOEUF 消融
VUS 重分类 弱标签 am_class + 频率 专家回评一致率
药物靶点安全 人源遗传约束 基因均值 OGT/动物表型对照
蛋白工程 替换级扫描 全替换目录 实验 validate 子集

§7.6 端到端案例:外显子组阴性的再挖掘

1) 案例:未确诊发育障碍患儿,初次外显子组报告阴性(VUS 堆积)
2) 重分析:VEP + AlphaMissense 重注释全部 missense VUS
3) 过滤:AM > 0.9 + 罕见 + 基因级约束双高 + HPO 匹配(癫痫+发育迟缓)
4) 候选:SCN1A 新错义变异 p.R1636Q(AM 0.97,ambiguous→高分带)
5) 证据合并:AM(PP3)+ 文献域注释(钠通道通道区)+ 新发突变确认
6) 结论:升级 likely pathogenic → 诊断确立(Dravet 综合征谱系)
7) 方法节:AM 静态版 + 构建 + 阈值 + 快照日期全声明

§7.7 报告模板:方法学段落骨架

错义变异致病性注释采用 AlphaMissense(Cheng et al., Science 2023,
doi:10.1126/science.adg7492)2023 年静态全蛋白组目录,GRCh38 构建
(文件 SHA256 <HASH>,下载日期 <DATE>)。注释经 Ensembl VEP 插件
完成(transcript_match=1)。分类阈值采用官方设定
(likely pathogenic >0.5646;likely benign <0.3464;两阈值对应
ClinVar 90% precision)。预测仅作为 ACMG/AMP PP3/BP4 计算证据,
不单独构成致病性判定。ClinVar 对照使用 2026-09 快照。

§7.8 成本与排期模板

阶段 工作 预算
周 1 下载 + tabix + VEP 插件集成 0.5 人日
周 1-2 注释管线 + 过滤链 + 对照验证 1-2 人日
周 2 ML 重排序/特征融合(可选) 2-4 人日
周 3 队列应用 + 证据链文档 1-2 人日
周 4 方法学写作 + 复现包 1 人日

§7.9 消融案例:计算证据对诊断率的影响

同一罕见病队列(示意性结论方向,以自算为准):

  • 仅 ClinVar 注释:已分类变异可直接报告——VUS 全部搁置;
    • AM 高分过滤:候选数下降一个量级、诊断率提升(高分新候选浮现);
    • AM/CADD/REVEL 共识:PP3 证据更稳,但工具相关性与祖先偏倚需检查。

教训:计算预测的价值在"缩小搜索空间 + 提供证据方向",不在"替代判断"。

§7.10 队列级批量注释产线(伪代码骨架)

把 AM 接入万人级外显子组/基因组队列时的产线骨架——三个阶段各自可并行:

# 阶段一:注释(bcftools + VEP 插件,按染色体分片)
# bcftools norm -f GRCh38.fa cohort.vcf.gz | \
#   bcftools +vep plugin AlphaMissense, \
#   --dir_plugins /opt/vepPlugins --offline -o annotated.vcf.gz

# 阶段二:抽取与规范化(PySpark 视角,本地用 pandas 同构)
def extract_am(row):
    csq = row["INFO_CSQ"]          # VEP 注释串
    for f in parse_csq(csq):
        if f["AM_pathogenicity"] not in ("", "."):
            yield {
                "variant": f"{f['chrom']}-{f['pos']}-{f['ref']}-{f['alt']}",
                "gene": f["SYMBOL"],
                "canonical": f["CANONICAL"] == "YES",
                "am_score": float(f["AM_pathogenicity"]),
                "am_class": f["AM_class"],   # likely_benign/ambiguous/likely_pathogenic
                "tier": tier_of(f["AM_pathogenicity"]),  # 官方阈值分箱
            }

# 阶段三:落表(供下游 AI/统计消费的列存)
#   am_annotations.parquet:variant/gene/canonical/am_score/tier
#   分区:gene → 便于基因级聚合;score 桶 → 便于快速过滤

产线要点:注释一次、处处复用(列存落表后 AM 分数即队列资产);canonical 与 transcript_match 必须落表(否则下游无法复现选择);tier 用官方阈值分箱并保留原始分数(下游可自行重切)。

§8 伦理、许可与合规

§8.1 许可与义务结构

资产 许可 义务
预测数据(TSV/集成平台) CC BY 4.0(© 2023 DeepMind) 署名(引论文)
代码(GitHub/Zenodo) 开源(Apache 2.0 口径) 许可声明
模型权重 不公开(安全政策) 不可反向要求
下载通道 受 GCP ToS 遵守 Google 云条款
未覆盖预测 邮件申请(alphamissense@google.com) 非商业限定语

§8.2 引用与致谢模板

错义变异致病性预测来自 AlphaMissense(Google DeepMind)2023 年
静态目录(CC BY 4.0)。
引用:Cheng J, et al. Accurate proteome-wide missense variant
effect prediction with AlphaMissense. Science 2023.
doi:10.1126/science.adg7492.
(使用 Ensembl VEP 插件时联合引用 VEP 文献。)
免责:预测为理论建模,不构成医疗建议或临床诊断。

§8.3 国内合规路径

  • CC BY 4.0:科研/商业可用,署名义务履行;
  • 数据为模型输出(非人类受试者数据)——不涉人类遗传资源出境审批;
  • 临床场景边界:辅助生殖/产前诊断等临床使用需按医疗器械/临床检验法规评估——AM 官方定位明确"非临床诊断工具";
  • 产品集成(生信平台内置):署名页 + 版本声明(2023 静态目录)+ 免责继承。

§8.4 商业使用边界

  • 允许:商业生信管线集成、临床决策支持系统(作为证据参考)、衍生数据库产品(CC BY 4.0);
  • 边界 1:不构成医疗器械声称——产品不得以"AlphaMissense 诊断"为卖点;
  • 边界 2:GCP ToS 约束下载通道的再分发方式(数据本体 CC BY 4.0 允许再分发附署名);
  • 边界 3:相关临时专利(63/415,117、63/479,653)覆盖的方法实现需独立评估——预计算数据的使用不受影响。

§8.5 合规台账最小模板

字段 示例
数据集 AlphaMissense 2023 静态目录(GRCh38)
下载 URL/日期 storage.googleapis.com/dm_alphamissense / 2026-09-20
许可 数据 CC BY 4.0;代码开源
署名方式 Cheng 2023 Science + VEP 联合引用
使用场景 外显子组注释模块(PP3 证据)
临床定位 非诊断工具声明
再分发 附许可文本 + SHA256

§8.6 责任式发布的治理语义

AlphaMissense 的发布策略是"三开一闭":开放预测数据(CC BY 4.0)、开放代码、开放集成(VEP/UniProt/DECIPHER),关闭模型权重(防止生物滥用场景——如定向设计有害变异)。这是 DeepMind "开放成果、保守能力"框架的实践(同 AlphaFold DB 路线)。代价是学术复现深度受限(无法微调/蒸馏权重),收益是滥用地板。临时专利的存在提示后续可能有商业化路径——静态目录的 CC BY 4.0 是对学术社区的明确承诺。

§9 谱系与生态

§9.1 变异效应预测时间线

年份 事件
2001-2003 SIFT / PolyPhen-2(第一代保守性规则)
2013-2016 CADD / REVEL(集成元预测;临床管线标配)
2018 PrimateAI(灵长类演化标签)
2020-2021 AlphaFold 2(Nature);EVE(无监督 VAE);ESM 语言模型系
2023-09 AlphaMissense(Science)——全蛋白组预计算目录
2023-2024 UniProt/AlphaFold DB/DECIPHER/ProtVar/VEP 全集成
2024-2026 第三方基准持续验证;PLM 混合模型(域专用)局部超越;AM 仓库归档(~2025-05)

§9.2 术语表

术语 含义
错义变异(missense) 单核苷酸替换导致氨基酸改变的变异
VUS 意义未明变异(ACMG 分类中间档)
VEP(工具语境) Variant Effect Predictor / 变异效应预测器
am_pathogenicity AlphaMissense 连续致病性分(0-1)
am_class 三分分类(likely_pathogenic/likely_benign/ambiguous)
MAVE 多重化变异效应实验(深度突变扫描)
LOEUF 功能缺失不耐受上限分数(gnomAD 约束度量)
de novo variant 新发变异(父母不存在)
DDD Deciphering Developmental Disorders(发育障碍队列)
MSA 多序列比对(演化信息源)
PP3/BP4 ACMG 计算证据条目(支持致病/支持良性)
自蒸馏(self-distillation) 模型对自身输出过滤以提升训练数据质量
ClinVar NCBI 变异-临床意义公共档案
MANE Select RefSeq/Ensembl 一致的代表性转录本

§9.3 资源选型决策树

需要变异致病性先验?
├─ 错义变异 ──▶ AlphaMissense(全蛋白组 + MAVE 最准)
│   ├─ 要全变异类型 ──▶ CADD(含非编码/剪接)
│   ├─ 要多工具共识 ──▶ REVEL / AM+CADD+ESM 集成
│   └─ 要无监督对照 ──▶ EVE / ESM 零样本
├─ 基因约束 ──▶ AM 基因均值 + LOEUF/pLI 合并
├─ 临床分级 ──▶ ClinVar(活档案)+ ACMG 框架(AM 只作 PP3)
└─ 新变异覆盖 ──▶ AM 静态目录(2023)+ 邮件申请 / PLM 本地推理

§9.4 与本库其他条目的关系

  • ClinVar 类条目:活档案 vs 静态先验——互补分层;
  • gnomAD 类条目:频率过滤与 LOEUF 约束——AM 基因级合并对象;
  • AlphaFold DB 类条目:同一方法论家族(结构 vs 变异效应);
  • HPO 条目:表型对齐——排序管线的语义层;
  • UniProt 条目:变体区集成展示——官方消费入口之一。

§9.5 组合使用建议

  1. AM + ClinVar + gnomAD:注释三件套(先验 + 档案 + 频率);
  2. AM + CADD/REVEL:多工具共识 PP3 更稳(ClinGen 建议方向);
  3. AM + HPO + 表型匹配:从变异优先级到候选基因的完整链;
  4. AM 基因均值 + LOEUF:双约束发现小基因;
  5. AM + AlphaFold 结构:高分变异回结构上下文(域/界面定位)。

§9.6 变异解释资源的生态角色

AlphaMissense 是变异解释的"全域先验层":上游(序列库/群体变异)→ 一次性全图推理 → 下游(注释管线/临床工具/研究模型)。与 ClinVar(人工策展的活档案)构成"机器先验 × 人工确证"双轨——两者差距正是 VUS 的当前定义。

§9.7 预测器家族的光谱定位

无监督 ◀──────────────────────────▶ 强监督
EVE    ESM-1v   PrimateAI   REVEL   CADD   AlphaMissense
(单序列/MSA 统计)            (集成)  (演化弱监督+基础模型)
覆盖窄 ◀──────────────────────────▶ 覆盖全
EVE                ESM        AM(错义全域)  CADD(全变异类型)

§9.8 AlphaMissense 生态的圈层地图

圈层 成员 关系
核心 预测目录 + 开源代码 DeepMind 官方
方法层 AlphaFold 2(架构母体)/ ESM 系(同代方法) 方法论谱系
集成层 Ensembl VEP / UniProt / AlphaFold DB / DECIPHER / ProtVar / myvariant.info 官方合作分发
对照层 ClinVar(活档案)/ MAVE 数据库(实验真值)/ gnomAD(频率与 LOEUF) 校验与合并
消费层 临床注释管线 / 罕见病诊断工具 / AI 优先级模型 / 蛋白工程 终端应用

§10 资源导航与 FAQ

§10.1 官方资源导航

资源 URL
GitHub(代码) https://github.com/google-deepmind/alphamissense
GCS 数据浏览 https://console.cloud.google.com/storage/browser/dm_alphamissense
hg38 直链 https://storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz
论文 https://doi.org/10.1126/science.adg7492
Perspective https://doi.org/10.1126/science.adj8672
VEP 插件文档 https://ensembl.org/info/docs/tools/vep/script/vep_plugins.html
DeepMind 博客 https://deepmind.google/discover/blog/alphamissense/
ProtVar https://www.ebi.ac.uk/protvar/

§10.2 关键文献

论文 价值 标识
Cheng 2023(主论文) 方法/基准/四类资源 Science; doi:10.1126/science.adg7492
Marsh & Teichmann 2023 临床边界警示 Science Perspective; doi:10.1126/science.adj8672
Jumper 2021(AlphaFold 2) 方法论母体 Nature 596:583-589
Frazer 2021(EVE) 无监督对照方法 Nature 596:491-495(同期口径)
Sundaram 2018(PrimateAI) 灵长类标签方法 Nat Genet 50:1052-1057
Richards 2026(第三方基准) post-2024 队列对照 Front Genet(OtoVCE 基准)

§10.4 FAQ

Q1:AlphaMissense 是什么?
Google DeepMind 2023 年发布的错义变异致病性预测模型——基于 AlphaFold 方法论,对人类蛋白组全部可能的氨基酸替换打 0-1 致病性分,7,100 万错义变异的静态预测目录。

Q2:覆盖多少变异?
19,233 个标准人类蛋白的 2.16 亿可能单氨基酸替换,其中 7,100 万为错义变异(全部有预测);另有约 6 万可变剪接转录本的扩展预测。

Q3:分类结果是什么?
89% 的错义变异被分类:57% likely benign、32% likely pathogenic(这是已分类部分的划分);其余 ambiguous。阈值(<0.3464 / >0.5646)在 ClinVar 上达到 90% precision。

Q4:性能如何?
ClinVar 全局 auROC 0.940(18,924 变异,超 EVE 0.911);ClinVar 612 基因 0.950;DDD de novo 0.809(PrimateAI 0.797);对 MAVE 实验的一致性为同类最优(SHOC2 案例正确预测功能区)。

Q5:训练数据是什么?
两阶段:预训练与 AlphaFold 同构(MSA 掩码重建 + 蛋白语言建模);微调标签为"人类与近缘灵长类群体中见过的变异 vs 从未见过的变异"——演化弱监督。未在 ClinVar 变异上训练(评估独立性)。

Q6:数据许可证?
预测数据 CC BY 4.0(© 2023 DeepMind Technologies Limited;下载通道受 GCP ToS);代码开源(Apache 2.0 口径);模型权重按安全政策不公开。

Q7:怎么下载?
GCS 直链 wget(AlphaMissense_hg38.tsv.gz / hg19 同目录),tabix 建索引后随机访问;或经 Ensembl VEP 插件逐变异注释。

Q8:VEP 插件怎么用?
--plugin AlphaMissense,file=/path/to/AlphaMissense_hg38.tsv.gz;输出 am_pathogenicity(连续分)+ am_class(三分);transcript_match=1 只报匹配转录本。

Q9:是临床诊断工具吗?
不是——官方明确"预测从未训练也从未打算用于独立临床诊断";ACMG/AMP 框架中只能作为 PP3/BP4 计算辅助证据,不能独立定致病。

Q10:为什么模型权重不公开?
DeepMind 安全政策:“prevent use in potentially unsafe applications”(防止定向设计有害变异等滥用)——只开放预计算预测与代码,“开放成果、保守能力”。

Q11:57% benign 和 32% pathogenic 的分母是什么?
是"已分类的 89% 错义变异"的划分——不是全库 7,100 万的比例。常见误读点。

Q12:ambiguous 区有什么用?
0.3464-0.5646 之间的不确定带是实验设计地图——分数贴着阈值的变异最值得 MAVE/功能实验;把 ambiguous 全扔掉会丢失梯度信息。

Q13:和 CADD 怎么选?
AlphaMissense 专注错义、深度更高、MAVE 一致性最强;CADD 覆盖全变异类型(含非编码/剪接)——临床管线常并用。

Q14:和 EVE 的区别?
EVE 无监督逐蛋白建模(auROC 0.911);AlphaMissense 有演化弱监督 + 全蛋白组统一模型(0.940/0.950)——监督对齐带来系统性提升。

Q15:基因级平均分是什么?
每个基因的变异分数平均——与 LOEUF(功能缺失不耐受)性质类似的约束度量;对 LOEUF 统计效力不足的 4,252 个小基因有泛化价值;与 LOEUF 合并更稳。

Q16:怎么用于罕见病诊断?
外显子组注释(VEP 插件)→ 罕见 + 高分过滤 → HPO 表型对齐 → 候选排序;AM 提供 PP3 计算证据与先验排序,最终判定须多证据链。

Q17:对癌症体细胞变异适用吗?
作为功能约束信号可用(Cancer Hotspots 基准表现优异)——但生殖系致病性与体细胞驱动是不同问题,不能直接互推。

Q18:isoform 变异有预测吗?
有——约 6 万可变剪接转录本的扩展发布;主目录是 canonical 蛋白;非 canonical 变异解释需单独核对(VEP 的 transcript_match=1 可防错配)。

Q19:数据会更新吗?
2023 静态目录,无滚动更新;GitHub 仓库约 2025-05 归档——新覆盖需求走 alphamissense@google.com;引用时注明"2023 版静态目录"。

Q20:hg19 和 hg38 文件怎么选?
与你的管线构建一致;混用会坐标静默错位;跨构建需 liftover 并自查损失。

Q21:准确率 90% 是什么口径?
90% precision 是分类阈值的设计目标(在 ClinVar 已知致病与良性变异上双向达成)——不是全库准确率,也不是 auROC(0.940 是排序能力)。

Q22:临床分类只有 2% 是什么意思?
已观察的 400 万+ 错义变异中约 2% 有临床分类(ClinVar 等);约 0.1% 经专家详审至高置信——两个口径并存,语境区分。

Q23:训练标签为什么是"见没见过"?
演化视角的弱监督:人类与近缘灵长类共享的变异经过负选择过滤(可容忍),未见过的变异更可能有害——这是"演化有害性 ≈ 临床致病性"的近似链,有系统偏差(迟发疾病/现代环境)需注意。

Q24:有祖先偏倚吗?
有风险——群体库(gnomAD 等)欧洲过采样使非欧人群罕见变异更可能被标"没见过",系统性偏向高分。对策:分层评测 + 本地人群频率库合并。

Q25:可以本地推理新变异吗?
权重不公开——本地推理不可行;未覆盖预测(非人物种/特定 isoform)邮件申请(alphamissense@google.com,非商业);或用 ESM 系开源 PLM 作替代。

Q26:代码开源了什么?
模型代码(JAX 实现,GitHub/Zenodo)——用于理解与复现推理逻辑;不含权重所以不能重跑推理。

Q27:PP3/BP4 怎么映射?
likely_pathogenic → 支持 PP3(计算证据支持致病);likely_benign → 支持 BP4(支持良性);ambiguous 不计证据;多工具共识更稳(ClinGen 方向),单工具高分不自动构成强证据。

Q28:ClinVar 评估怎么防数据穿越?
固定 ClinVar 快照日期(论文时点或自选)——ClinVar 滚动更新会使跨时指标微变;复现论文口径需 2023 前快照。

Q29:怎么与 LOEUF 合并?
按基因合并两约束信号(双高十分位 → 高置信不耐受基因);AM 对 LOEUF 缺失/低效的小基因补位(4,252 个);合并比单信号稳健。

Q30:MAVE 是什么?为什么重要?
多重化变异效应实验(深度突变扫描)——一次测数千变异的功能效应,是模型一致性的"实验地面真值";AlphaMissense 与 MAVE 一致性最优说明它学到的是功能地形图而非 ClinVar 偏好。

Q31:2024-2026 年有更好的模型吗?
专用域 PLM 混合模型(OtoVCE/MEVIT 类)在特定队列开始超越;通用错义解释中 AM 仍是金标准梯队(post-2024 ClinVar AUC 0.952 量级);但全蛋白组预计算目录仍是独家资产。

Q32:商业产品能用吗?
能——CC BY 4.0 允许商用(附署名与许可文本);产品不得以"诊断"为宣称(官方非临床定位);GCP ToS 约束下载通道。

Q33:怎么引用?
Cheng J, et al. Accurate proteome-wide missense variant effect prediction with AlphaMissense. Science 2023. doi:10.1126/science.adg7492;用 VEP 插件联合引用 VEP;临床语境建议同时引 Marsh & Teichmann Perspective。

Q34:静态目录的"版本管理"怎么做?
文件即版本——记录 SHA256 + 下载日期 + 构建版本;无滚动更新所以无版本选择问题,但要防未来新版的口径漂移。

Q35:ambiguous 变异在 ACMG 里怎么算?
不单独构成 PP3/BP4——但分数本身可在报告附注中呈现(“计算预测不确定”);结合其它证据再定。

Q36:一句话总结 AlphaMissense 的 AI-Ready 价值?
它把"每个错义变异都有先验"变成现实——全蛋白组静态地图 + MAVE 最准 + CC BY 4.0 全开放,是变异解释从"个案猜测"走向"全域计算"的分水岭资源。

Q37:AM 分数能直接给患者看吗?
不能单独呈现——它是群体统计先验,不是个体诊断结论;报告中的正确形态是"计算证据(PP3/BP4)+ ACMG 整合 + 临床解读",且需专业遗传咨询陪同。

Q38:splice 区域变异 AM 覆盖吗?
AM 只管错义(氨基酸替换);经典剪接位点±1/2 变异不在其范畴(用 SpliceAI);但内含子/同义区的"深墙效应"变异中,凡改变氨基酸的仍被覆盖。

Q39:为什么权重不公开还称"AI-Ready"?
AI-Ready 指数据资产的可计算性(格式/许可/覆盖/口径),不是模型可复现性;权重封闭是发布者的安全选择,预计算目录反而让无 GPU 团队也能零成本使用最先进模型的输出。

Q40:怎么跟踪未来的更新?
官方仓库已归档(2025-05),无滚动发布计划;跟踪渠道:AlphaMissense 官网、DeepMind/GOOGLE 研究博客、UniProt 与 VEP 的集成版本说明;若出现新版,以 SHA256 区分新旧目录并重跑基准。

Q41:与 AlphaFold 蛋白结构是什么关系?
共享架构思想但产物不同——AlphaFold 预测结构(“长什么样”),AM 预测错义效应(“改了会怎样”);两者互补:结构可辅助解读高分区是否落在活性位点/界面,但 AM 本身不依赖结构输入。

§10.5 要点回顾

  1. 定位:错义变异的全域先验——静态地图,不是诊断裁决。
  2. 三层口径:2.16 亿替换 ⊃ 7,100 万错义 → 89% 分类(57/32 是内部分母)。
  3. 性能坐标:0.940/0.950/0.809——全局/基因级/真实队列三档。
  4. 阈值官方:0.3464/0.5646(ClinVar 90% precision)——别自造。
  5. 演化标签:见过 vs 没见过——"演化有害 ≈ 临床致病"的近似链。
  6. 双许可一封闭:数据 CC BY 4.0、代码开源、权重不公开。
  7. ACMG 边界:PP3/BP4 辅助证据——单工具高分 ≠ 致病。
  8. 转录本纪律:canonical 主目录 + isoform 扩展 + transcript_match=1。
  9. 祖先偏倚:训练群体构成渗入先验——分层评测。
  10. 静态治理:文件即版本(SHA256)——ClinVar 活档案要分层时间语义。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 核心数字:19,233 标准人类蛋白 / 2.16 亿可能单氨基酸替换 / 7,100 万错义变异预测 / 89% 分类(57% likely benign + 32% likely pathogenic)/ 阈值 ClinVar 90% precision = Science 论文(10.1126/science.adg7492)+ EurekAlert 发布稿 + Inside Precision Medicine 报道
  • 性能:ClinVar 18,924 变异 auROC 0.940(EVE 0.911)/ ClinVar 612 基因 0.950(EVE 0.921)/ DDD de novo 0.809(PrimateAI 0.797)/ Cancer Hotspots 与 ACMG 优于对照 / MAVE 一致性最优(SHOC2 前 80 氨基酸、63-74 位 pathogenic;Ras-MAPK/MRAS-PP1C 语境)= 论文(经科普中国资源服务与 news-medical 交叉核对)
  • 训练方法:两阶段(预训练 MSA 掩码重建+语言建模 / 微调人类蛋白 见过 vs 未见过标签)/ 自蒸馏过滤 / 消融两阶段均必要 / 不预测结构或稳定性 = 论文(经科普中国与 news-medical 交叉核对)
  • 分类阈值:<0.3464 likely benign / >0.5646 likely pathogenic / 之间 ambiguous;“AlphaMissense was not trained on ClinVar variants” = Ensembl VEP 插件官方文档(AlphaMissense.pm)
  • 许可:数据 CC BY 4.0(“AlphaMissense Database Copyright (2023) DeepMind Technologies Limited”)+ GCP ToS 约束 / 免责(理论建模、as-is、非医疗建议)/ 代码 github.com/deepmind/alphamissense + Zenodo / 权重不公开(“we will not be sharing model weights, to prevent use in potentially unsafe applications”)/ 临时专利 US Provisional 63/415,117、63/479,653 / 未覆盖预测 alphamissense@google.com = 论文 Data and materials availability + VEP 插件文档
  • 四类资源:7,100 万变异目录 / 基因级预测(LOEUF 类比、4,252 小基因)/ 2.16 亿全替换 / 6 万 isoform = news-medical 论文解读(Data availability 四资源清单)
  • 临床背景:平均人 ~9,000 错义变异 / 已观察 400 万+ / 约 2% 临床分类(0.1% 专家详审口径并行)/ VUS 瓶颈 = phys.org(AFP)+ Inside Precision Medicine + EurekAlert
  • 集成生态:Ensembl VEP / UniProt / AlphaFold DB / DECIPHER / ProtVar / myvariant.info = VEP 文档 + synthszr 资料页 + SIB 培训材料
  • 下载:console.cloud.google.com/storage/browser/dm_alphamissense;直链 storage.googleapis.com/dm_alphamissense/AlphaMissense_hg38.tsv.gz;tabix -s 1 -b 2 -e 2 -f -S 1 索引 = VEP 文档 + SIB 癌症变异培训页
  • GitHub 仓库约 2025-05 归档(archived,不再活跃维护;预计算数据仍为金标准)= SIB 培训材料 + synthszr 资料页
  • 人物:第一作者 Jun Cheng(“predictions were never really trained or never really intended to be used for clinical diagnosis alone”);Pushmeet Kohli(DeepMind 研究副总裁);Marsh & Teichmann Perspective(“不要把标签与临床定义混淆”)= phys.org + EurekAlert + Science Perspective(10.1126/science.adj8672)
  • 第三方基准(2024-2026):post-2024 ClinVar 听力损失队列 AM AUC 0.952(CADD 0.941/EVE 0.932/ESM1b 0.919/PrimateAI 0.859);42,684 ClinVar missense AM 0.942(REVEL 0.932)——"PLM 混合新模型局部超越"语境 = Frontiers in Genetics OtoVCE 基准(10.3389/fgene.2026.1880490)+ MEVIT 基准(zenodo 19549576)
  • 批次口径差异:批次定义"19,234" vs 论文"19,233"——正文以论文为准(本存照标注)
  • 阈值语义:0.3464/0.5646 为"ClinVar 上达到 90% precision 的双向截断",非"风险分层界值";ambiguous 区间(两者之间)无分类主张 = 论文 + VEP 插件文档交叉
  • 覆盖细节:89% 分类占比中不含"人类未观察变异之外的非标准残基";目录以 GRCh38/Ensembl 110 canonical 为基准坐标系 = VEP 文档 + SIB 培训材料
  • 仓库状态:deepmind/alphamissense GitHub 仓库 2025-05 前后转为 archived(只读归档,issue 关闭);数据分发通道(GCP bucket)不受影响 = GitHub 仓库页面 + SIB 培训材料交叉
  • 分数物理意义:AM 输出为 0-1 连续"致病性先验概率"式分数,三档分类由两个官方阈值切分而来;分数跨基因可比性经 MAVE 一致性检验支持(但基因内相对排序仍是首选用法)= 论文正文与补充材料
  • 与 AlphaFold 的边界:AlphaFold 回答"结构是什么"、AM 回答"错义效应多大"——AM 不以结构为输入、不预测稳定性变化(ΔΔG 类),两者结论不可互相推导 = 论文(“does not predict protein structure or stability”)+ Marsh & Teichmann Perspective
  • 集成覆盖口径:UniProt/VEP/ProtVar 等集成展示的分数与官方 TSV 同源(2023-08 构建);跨平台分数不一致时以官方 bucket 文件为准 = VEP 文档 + ProtVar 说明页

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • impc — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • ckb — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • uk-biobank — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • all-of-us — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • sra — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • ctd — 共享标签:基因组学与多组学 / 公共卫生与流行病学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集