IMPC 国际小鼠表型联盟 — AI-Ready Wikipedia

9,605 个敲除基因 · 1.38 亿数据点 · 111,664 个显著表型:哺乳动物基因功能目录的全球工程

来源 https://www.mousephenotype.org发布时间: 2026-09-20最后更新: 2026-09-25 阅读 23
IMPC 国际小鼠表型联盟 — AI-Ready Wikipedia

信息速览

数据集名称IMPC 国际小鼠表型联盟 — AI-Ready Wikipedia
数据类型9,605 敲除基因,1.38 亿数据点,111,664 显著表型,CC-BY 4.0,IMPReSS 标准
规模不适用(模式生物数据;无人类患者数据)
接入方式https://www.mousephenotype.org
AI 就绪度

IMPC — 国际小鼠表型联盟 AI-Ready Wikipedia

INFOBOX

项目 内容
全名 International Mouse Phenotyping Consortium(国际小鼠表型联盟)
成立 2011 年(21 机构 / 15 国 / 4 国家资助者;前身 IKMC)
目标 小鼠全部蛋白编码基因的敲除+系统表型——哺乳动物基因功能目录
遗传背景 纯 C57BL/6N 近交系
当前版本 Data Release 24(2026-03-16):1.38 亿数据点
规模(DR24) 9,605 基因 / 10,341 品系 / 111,664 显著表型调用
表型标准 IMPReSS 协议(16 类别)+ OpenStats 统计管线
疾病转化 >1,400 人类疾病候选模型;>100 验证罕见病基因关联
标识与本位 MGI/HGNC 持久 ID + MP/HPO 本体(FAIR)
许可 CC-BY 4.0(门户/API/FTP/KG);品系经 EMMA/KOMP(MTA)
官方入口 https://www.mousephenotype.org
本库条目 order 481 · record_id 581 · 类别:基因组学与多组学 × 公共卫生与流行病学

§0 E-E-A-T 信任声明与免责声明

  • 经验:本条目基于 IMPC 官网(DR24 公告/allele design 页/数据集合页)、NAR 2026 门户论文(Wilson 等,gkaf1148)、INFRAFRONTIER/EMMA 品系页与 Mammalian Genome 2013 等位基因表征论文;数字全部标注发布版本。
  • 专业性:敲除策略(tm1a-e/VelociGene/CRISPR)的解读依据 Skarnes 2011 Nature 与 IMPC 官方文档;统计管线描述依据 OpenStats/IMPReSS 官方口径。
  • 权威性:IMPC 由 15 国资助机构共同治理;本条目为第三方百科解读,不替代官方文档与 IMPReSS 协议原文。
  • 可信度:文内数字进入文末「口径存照」;DR23 与 DR24 口径差异(分析管线改进)已显式标注。
  • 免责:小鼠表型不直接等于人类疾病结论——人转译需 HPO/MP 映射与临床验证;使用 IMPC 数据发表需按官方引用规范。
  • 时效:口径锁定 2026-09-19/20(DR24 发布后);下一次发布以官网为准。

§1 数据集概览

§1.0 📌 30 秒速览

  1. 是什么:全球联盟把小鼠每个蛋白编码基因挨个敲掉、按同一套标准体检——产出哺乳动物基因功能的统一目录。
  2. 多大:DR24(2026-03)9,605 基因、10,341 品系、1.38 亿数据点、111,664 个显著表型。
  3. 为什么重要:>1,400 个人类疾病候选模型、>100 个验证的罕见病基因关联——罕见病诊断的最后一块拼图常常在这里。
  4. 怎么用:CC-BY 4.0 全开放——网页查单基因、API/FTP 拉全量、知识图谱做推理。
  5. 一句话:如果你的基因没人研究过,IMPC 大概率是第一个告诉你「敲掉它会怎样」的地方。

§1.1 摘要

IMPC(International Mouse Phenotyping Consortium)是 2011 年成立的全球合作计划,目前包含 21 个研究机构、15 个国家与 4 个国家资助者。它的使命极其明确:在小鼠(Mus musculus)上,把每一个蛋白编码基因做敲除,然后按标准化协议系统表型——在纯 C57BL/6N 近交系背景下构建「哺乳动物基因功能目录」。

生产端建立在 IKMC(国际敲除小鼠联盟)的资源之上:EUCOMM(欧洲)与 KOMP(美国)的 ES 细胞打靶库(knockout-first tm1a 等位基因及其衍生)、Regeneron 的 VelociGene 整码删除、以及近年主力 CRISPR/Cas9 的小缺失与大片段删除策略。表型端由 IMPReSS(International Mouse Phenotyping Resource of Standardised Screens)统一——16 个类别的标准化检测(解剖、临床化学、行为、心血管、代谢、免疫、视听、 ageing 等),突变体与野生型同协议同中心测试,统计调用经 OpenStats 集中管线产出。

数据端以半年至年度节奏发布:DR24(2026-03-16)含 1.38 亿数据点、9,605 个已表型基因、10,341 个突变品系与 111,664 个显著表型调用。项目累计产出超过 1,400 个人类疾病候选小鼠模型(复现患者表型)、超过 100 个经确认的罕见病基因-疾病关联;8,000 余篇论文依赖其数据或试剂。

数据的 FAIR 化程度极高:基因标识符复用 MGI 与 HGNC 持久 ID,表型术语采用 MP(哺乳动物表型本体)与 HPO(人类表型本体)——跨物种表型对比(Monarch Initiative 生态)与罕见病诊断工具(Exomiser/UDN)因此可以直接消费。许可为 CC-BY 4.0,访问通道包括云原生重建的 Web 门户、REST API、FTP 批量下载与知识图谱。

基因必要性(essentiality)是 IMPC 的标志性分析维度:把基因按纯合敲除后果分为五类(细胞致死/发育致死/亚存活/可活有表型/可活无表型)——这套分类与人类疾病基因分类对齐,直接服务于「未被研究的基因里哪些值得优先研究」的全球排序。

§1.2 战略价值

  1. 基因功能注释的最终基准:RNA 表达、蛋白互作、共表达网络都是间接证据——纯合敲除的全身表型是基因功能的「金标准对照实验」;IMPC 把这个金标准工业化了。
  2. 罕见病诊断的系统性补位:人类罕见病外显子组测序的最大痛点是「变异致病性证据不足」——IMPC 敲除表型(经 HPO 对齐)提供跨物种证据;UDN 用 Exomiser 消费 IMPC 数据辅助确诊是制度化案例。
  3. 药物靶点安全性的前置扫描:敲除致死/亚存活的基因是靶点选择的安全红线(人药靶点敲除小鼠 viable 才有开发空间);「viable with no phenotype」则提示单靶点可能无效——靶点评估的两端都依赖这套数据。
  4. 未被研究基因的公平曝光:IMPC 优先策略明确瞄准 under-studied genes——文献偏置的基因宇宙被系统性校正;这是「不可而知」变「可知」的工程化。
  5. 多中心标准化的方法论样板:21 机构用同一套协议/统计管线/质控——「全球分工+统一标准」在实验生物学里的最大规模实践;任何多中心生物数据项目都值得抄这套治理。

§1.3 同类数据集横向对比

维度 IMPC MGI Sanger MGP 门户 GTEx
对象 敲除品系统一表型 全小鼠遗传资源整合 Sanger 产品系(MGP) 人组织表达
性质 实验数据(自产) 知识库(聚合文献) 实验数据(IMPC 子集源) 实验数据(自产)
协议 IMPReSS 16 类 不适用(聚合) 同 IMPReSS 系 RNA-seq/组织学
统计 OpenStats 集中 不适用 同源管线 标准化 pipeline
许可 CC-BY 4.0 混合 开放 开放
与人类疾病 MP↔HPO 映射 全景整合 同 IMPC eQTL/GTEx sQTL
  1. IMPC 与 MGI 的分工:MGI 聚合全部文献知识(含 IMPC),IMPC 自产标准化数据——「自产数据不聚合文献」是 IMPC 官方强调的差异点(官网原文:We generate our own data, it is not aggregated from publications)。
  2. 与 Sanger MGP 的关系:MGP(2006 起)是 IMPC 最大的生产引擎之一,其门户数据是 IMPC 的来源子集——用 Sanger 门户与用 IMPC 门户的口径差异在「多中心合并 vs 单中心全量」。
  3. 与 GWAS/eQTL 资源的互补:观察性人类遗传学(GWAS)发现关联、IMPC 提供因果性实验验证——两端的证据链在 Open Targets 里合并(IMPC 是其数据源)。

§1.4 版本时间轴

年份 事件 意义
2006 Sanger MGP 成立 年产 200 品系的生产引擎
2007-2011 IKMC 时代(EUCOMM/KOMP/NorCOMM) ES 细胞打靶库铺底(12,350 基因=56% CCDS,2013 时点)
2011 IMPC 成立 多中心表型联盟成型
2013 EUCOMM/KOMP-CSD 等位基因分子表征 品系质量系统核查的起点
2015 IMPC 主论文(Nature Genetics) 目录首批成果发布
2025-11 NAR 门户论文(DR23.0 口径) 云原生门户重建 + KG
2026-03-16 DR24 发布 1.38 亿数据点 / 9,605 基因 / 111,664 调用

§1.5 应用场景矩阵

场景 用哪个数据面 关键操作 适配度
单基因功能查询 门户基因页 表型列表/测量图/生存曲线 ★★★★★
罕见病变异致病性佐证 MP↔HPO 映射 Exomiser/门户疾病模型页 ★★★★★
靶点安全性扫描 必要性五分类 lethal/subviable 过滤 ★★★★☆
全基因组表型关联挖掘 API/FTP 全量 基因×MP 矩阵统计 ★★★★☆
性别二态性研究 性别特异调用 DR24 性别注释层 ★★★★☆
胚胎发育致死分析 Embryo Development 集合 胚胎分期表型 ★★★☆☆
老年表型(late adult) Late Adult 集合 年龄分层对比 ★★★☆☆
组织病理深表型 Histopathology 集合 影像+参数 ★★★☆☆

§1.6 组件全景

  1. Web 门户(云原生):基因页(表型列表/Measurement Chart 交互图/存活数据)/ 疾病模型页 / 数据集合页——可用性研究后重建的 UI。
  2. REST API:大规模程序化访问(官方培训材料含大规模 API 使用教程)——全量挖掘的正道。
  3. FTP 下载:全量数据文件(基因表/表型调用/参数测量)——离线分析的数据底座。
  4. 知识图谱(KG):IMPC 数据的图形态——链接推理与跨资源合并的语义层。
  5. IMPReSS:标准化协议库——每个检测的 SOP(含参数定义/仪器/流程);16 类别的权威文档。
  6. OpenStats:集中统计管线——线性混合模型等框架;显著性调用的产出机器。
  7. PhenoDCC:数据协调中心(Data Coordination Centre)工具链——多中心数据的收集/质控/汇总。
  8. GenTaR:基因-表型-资源关联工具;Embryo Viewer:胚胎表型影像查看器。
  9. 数据集合(Collections):Late Adult / Histopathology / Essential genes / Embryo Development / Cardiovascular——按专题打包的数据面。
  10. 品系获取:EMMA(INFRAFRONTIER,>4,800 IKMC/IMPC 品系存档)/ KOMP Repository——MTA 条款下的活体/冷冻资源;Allele Conversion Service(tm1a→tm1c 等转换)。

§1.7 大科学工程的方法学经济学

IMPC 是实验生物学里最接近「工业流水线」的项目,其经济学值得拆解:

  1. 分工的边际成本递减:21 中心分摊生产(品系制作+表型跑批)——每个品系的边际成本随标准化程度下降;IMPReSS 的存在本质是「把方法学固定成本摊到全联盟」。
  2. 基因优先的算法治理:不按文献热度而按算法排序(近期聚焦 under-studied genes)——把「研究经费的市场失灵」用工程方法校正;这是科学社会学层面的实验。
  3. 一次产出全生态复用:一个品系的表型数据同时喂给 MGI/Open Targets/UniProt/Monarch/Exomiser——「生产一次、消费多处」的杠杆率在生物资源里最高档。
  4. 数据与资源的双轨开放:数据 CC-BY 4.0 零门槛;品系(活体资产)经 MTA——「信息开放+实物受控」的双轨制平衡了扩散与可持续。
  5. 8,000 篇论文的引用经济学:官方门户论文(NAR 2026)记录 8,000+ 论文依赖 IMPC——平均每篇 IMPC 数据支持的论文成本远低于各自为政的小规模实验;大科学的规模效应在此有定量体现。

§1.8 IMPC 在基因功能研究流程中的定位

基因功能证据链(从序列到疾病)
基因组注释(HGNC/Ensembl)
  → 表达证据(GTEx/HPA:在哪里表达)
  → 关联证据(GWAS/OMIM:与什么性状关联)
  → 因果实验(IMPC:敲掉后全身表型怎样)← 本条目
  → 机制研究(二次定制实验)
  → 疾病模型确认(人类表型对齐:MP↔HPO)
  → 诊断应用(Exomiser/UDN:变异致病性佐证)
  → 靶点决策(Open Targets:整合打分)
  1. IMPC 的证据地位:关联证据链的「实验因果端」——GWAS 的 lead variant 落在基因 X 上,「敲掉 X 小鼠出现对应表型」是诊断与靶点决策都能消费的强证据。
  2. 上游下游的接口:上游用 HGNC/MGI ID 对齐(与 hgnc 条目联动);下游经 HPO/MP 对齐(与罕见病诊断生态联动)——IMPC 的 FAIR 设计使其天然处于证据链的枢纽位。

§1.9 独特视角:负面结果的数据库

IMPC 有一个被低估的性质:它同时是最大的「敲了没表型」数据库。

  1. viable with no phenotype 的信息量:敲除后「没表型」同样是数据——它约束了「该基因在标准检测下功能冗余/条件特异/补偿充分」的假设空间;文献只发表阳性结果,IMPC 的阴性调用是独一无二的系统性负结果库。
  2. 对 AI 建模的价值:基因-表型矩阵的零值(无调用)不是缺失而是「测过且阴性」——把 IMPC 矩阵当稠密标签学习时,阴性样本防止模型把「没证据」当「无功能」;这是与文献挖掘数据集的本质差异。
  3. 冗余与补偿的研究入口:单敲无表型 ≠ 基因无用——家族冗余(paralog compensation)假设可从 IMPC 阴性基因的家族聚类系统性生成;阴性数据是假设生成器。
  4. 为什么这个视角重要:用 IMPC 做靶点筛选的团队如果只拿「有表型」基因,等于把「安全但可能无效」的一半信息扔掉了——完整五分类+阴性调用的消费方式才是全谱利用。

§2 医学与科学背景

§2.2 为什么用小鼠做全基因敲除

  1. 哺乳动物模型的最优性价比:小鼠是可用高通量遗传操作的最小哺乳动物——生理/解剖/代谢与人类的保守性足够(约 70% 人类基因有单一小鼠直系同源),成本/世代时间可控。
  2. 近交系的标准化红利:C57BL/6N 近交系消除遗传背景噪声——任何表型差异都可归因于敲除;这是「工业级表型」的前提(远交群做不到)。
  3. 与人类疾病的语义桥:MP 与 HPO 的映射成熟——小鼠表型可以翻译成人类表型语言;这是斑马鱼/果蝇难以完全替代的转化距离。
  4. C57BL/6N 的特定注意:N 亚系与 C57BL/6J 有 Nnt 基因差异等已知位点——跨研究对比时注意亚系;IMPC 全库统一 6N 反而是其内部一致性的优势。

§2.2 敲除等位基因的遗传学语义

  1. critical exon 原则:靶向所有转录变体共有的关键外显子——删除后必然移码/破坏功能;「敲除」的定义由等位基因结构决定而非基因名。
  2. knockout-first 家族(tm1a-e):tm1a(诱捕盒破坏基因+报告表达)→Flp→tm1c(条件性恢复)→Cre→tm1d(移码 null);tm1a→Cre→tm1b(报告标签 null);tm1e(丢失 3’ loxP 的非条件靶向)——同一 ES 克隆可衍生报告/条件/null 三用途。
  3. VelociGene 整码删除:删除全部蛋白编码序列的完全 null——对任何 Pol II 转录基因适用;不依赖 critical exon 选择。
  4. CRISPR 时代:单切小缺失/双切外显子删除为主力;按需定制(条件性 loxP、点突变)补充——生产速度大幅提升但每品系的分子表征仍必要(脱靶与嵌合体历史教训)。
  5. 解读纪律:tm1a 残留盒的顺式效应(邻近基因干扰)、tm1e 不可条件化、CRISPR 品系的分子确认——等位基因类型是表型解读的第一变量(§6.5 坑点 2)。

§2.3 基因必要性五分类

  1. 五分类定义:cellular lethal(细胞水平不可存活)/ developmentally lethal(发育期致死)/ subviable(亚存活,部分个体存活)/ viable with phenotype(可活有表型)/ viable with no phenotype(可活无表型)——按纯合敲除后果排序的功能受限光谱。
  2. 与人类疾病的对齐:必要性分类与人类疾病基因分类对齐——developmentally lethal 对应发育性罕见病、viable with phenotype 对应可活的单基因病谱;「未与孟德尔病关联的必要性基因」是新的候选疾病基因池。
  3. 与细胞 Essential 基因集的互补:细胞系 CRISPR 筛选(DepMap 等)发现细胞致死基因——与 IMPC 的个体水平分类合并给出「细胞必需→个体必需」的光谱;LoF 不容忍度(pLI 类指标)与小鼠表型的交叉验证框架已建立。
  4. 分析含义:亚存活与致死基因的成年表型天然缺失——必要性分类本身是数据覆盖的先验(§4.6 完整性清单的逻辑)。

§2.4 IMPReSS 协议的标准化语义

  1. 16 类别的覆盖:解剖形态学/临床化学/血液学/行为/神经/心血管/呼吸/代谢/感官(视听)/免疫/骨/能量/生殖/embryology/ageing/histopathology——同一 SOP 跨 21 中心执行。
  2. 参数级标准化:每个检测细化到参数(测量项)——统计调用在「参数×性别×品系」粒度;参数的元数据(仪器/单位/年龄窗)随 IMPReSS 版本管理。
  3. 性别与生命阶段分层:DR24 强化性别特异参数的 MP 注释——「同一程序不同性别不同调用」的精细度是联盟级卖点。
  4. 协议版本的演化:IMPReSS 协议升级(新增检测/参数修订)跨版本数据对比要查协议版本戳——表型调用的可比性以协议一致为前提。

§2.5 统计管线的语义(OpenStats)

  1. 集中统计的必要性:21 中心各自统计会有 21 种 P 值口径——OpenStats 统一框架(线性混合模型等)保证调用的跨中心可比。
  2. 参照系的设计:同期同中心野生型做参照——环境批次效应在同协议内被控制;跨中心的表型强度对比仍需谨慎(中心效应)。
  3. 多重比较与效应量:全基因组规模的表型检测意味着海量检验——显著调用附效应方向与幅度;只筛 P 值不看效应量是常见误用。
  4. 版本演化的影响:DR23 的 113,803 调用 → DR24 的 111,664 调用——总数下降源于管线改进(性别注释更精确等);「调用数变化=生物学变化」是误读(§6.5 坑点 6)。

§2.6 表型本体的跨物种语义(MP↔HPO)

  1. MP 本体:哺乳动物表型本体——IMPC 调用的原生术语;层级化(表型大类→细表型)。
  2. HPO 对齐:人类表型本体与 MP 的映射——小鼠表型翻译成人类表型语言;映射质量决定转译置信度。
  3. Monarch 生态:跨物种表型计算推理(Monarch Initiative)——用相似度算法在物种间找模型;IMPC 是其核心数据源。
  4. Exomiser 的落地:变 prioritization 工具把人类变异×IMPC/模型生物表型合并打分——UDN(未确诊疾病网络)的制度化使用;「小鼠表型佐证人类变异」的诊断路径的工业化。

§2.7 罕见病诊断的 IMPC 证据链

  1. 诊断困境的补位逻辑:新发变异(VUS)的致病性判定缺少功能证据——对应基因的 IMPC 敲除表型若复现患者表型(经 HPO 对齐),即为跨物种 PMID 级佐证。
  2. >100 个验证关联的来源:IMPC 数据支撑的罕见病基因确认(NAR 论文口径)——从「小鼠有表型」到「人类病确认」的完整案例池;包括听觉/代谢/神经等域。
  3. 疾病模型页的用法:门户 Disease Models 区列出 >1,400 候选模型——「患者表型 → 找模型小鼠」的反向查询路径。
  4. 证据的边界:表型复现是佐证不是证明——人类确认仍需患者队列/功能实验;IMPC 证据在 ACMG/AMP 变异分类框架里是辅助证据类。

§2.8 性别二态性的系统层证据

  1. DR24 的性别注释强化:性别特异参数的 MP 注释改进——「只在雄性显著」「只在雌性显著」的调用被显式标注。
  2. 为什么重要:药物反应/代谢/行为的性别差异是临床现实——小鼠表型的性别维度被系统性记录后,靶点与疾病模型的性别设计有了数据底座。
  3. 方法论含义:合并性别的统计会稀释性别特异效应——IMPC 的性别分层管线是「默认分层、事后合并」的姿势示范。
  4. 应用:性别二态基因清单(官方主题论文)可直接用于流行病学与临床试验设计的性别分层假设。

§2.9 老年表型与寿命的语义扩展

  1. Late Adult 集合:老年小鼠的系统表型(27 周以上延伸检测)——常规筛查(~9-15 周)看不到的迟发表型。
  2. Ageing 研究的杠杆:人类衰老相关疾病(神经退行/代谢/肌骨)的模型假设——老年表型数据是全生命周期功能目录的补全。
  3. 迟发表型的统计挑战:老年期存活偏差(弱个体已死亡)——late adult 分析的生存偏差处理是解读要点。
  4. 与必要性的联动:发育致死基因没有老年数据——必要性强相关的「数据空窗」按先验补位(胚胎数据集合)。

§3 数据集规格

§3.1 规格总表

属性 规格
名称 IMPC(International Mouse Phenotyping Consortium)
治理 21 机构 / 15 国 / 4 国家资助者;DCC 协调
目标 全部小鼠蛋白编码基因敲除+系统表型(C57BL/6N)
当前版本 Data Release 24(2026-03-16)
规模(DR24) 1.38 亿数据点 / 9,605 基因 / 10,341 品系 / 111,664 调用
表型协议 IMPReSS(16 类别;参数级标准化)
统计管线 OpenStats(集中式;性别分层)
等位基因 tm1a-e(ES 打靶)/ VelociGene / CRISPR/Cas9
疾病转化 >1,400 疾病候选模型 / >100 验证罕见病关联
标识/本体 MGI+HGNC / MP+HPO(FAIR)
许可 CC-BY 4.0(门户/API/FTP/KG)
品系获取 EMMA / KOMP Repository(MTA)+ 转换服务

§3.2 数据发布口径的地图

  1. DR 节奏:半年至年度发布(DR23.0 2025 → DR24 2026-03)——每次发布含新增品系/数据点与管线改进。
  2. 跨版本的不可直比:DR23 的 113,803 调用 vs DR24 的 111,664——管线改进(性别注释)使调用集不是超集关系;跨版本研究固定单一版本或逐版本重算。
  3. 数据点的粒度:1.38 亿数据点=原始测量级;111,664 调用=统计显著级——「规模」引用要分清两个口径(差三个数量级)。
  4. 机器可读性改进:DR24 数据报告为机器可读性优化——API/脚本的解析逻辑随版本更新,老脚本要回归测试。
  5. 外链数据:DR24 起外链 Tremblay 组(University of Victoria)早期致死表型——IMPC 之外的补位数据要按外源口径引用。

§3.3 DAIMS 数据AI就绪度评估

# 维度 指标 评分(1-5) 依据
1 A 可获得 免费获取 5 CC-BY 4.0 全通道开放
2 A 可获得 获取流程 5 门户/API/FTP/批量查询多轨
3 A 可获得 分发格式 4 API JSON/FTP 文件;KG 补位
4 A 可获得 历史版本回溯 4 发布版本可溯;旧版全量存档粒度一般
5 D 文档 官方文档 5 IMPReSS 协议/门户帮助/培训材料
6 D 文档 方法透明度 5 协议+统计管线+allele design 全公开
7 D 文档 引用规范 5 官方引用页+论文口径清晰
8 I 互操作 标识符 FAIR 5 MGI/HGNC 持久 ID
9 I 互操作 本体对齐 5 MP↔HPO 映射;Monarch 生态
10 I 互操作 跨资源整合 5 MGI/Open Targets/UniProt 消费
11 M 元数据 参数元数据 5 IMPReSS 参数级元数据
12 M 元数据 版本元数据 4 DR 版本戳;协议版本联动待加强
13 S 可持续 治理机制 5 15 国资助+DCC;十余年连续
14 S 可持续 资源持续供给 5 品系存档(EMMA)+持续生产

综合 61/70(4.4/5)——互操作与文档的满分级选手;在「模式生物」类别里是 FAIR 化的天花板(与 ENCODE 同档)。

§3.4 存储与计算需求

  1. 全量数据:1.38 亿数据点的 FTP 全量在 GB 级——PostgreSQL/Parquet 单机全装;调用表(11 万行)极轻。
  2. API 拉取策略:单基因查询走门户/API;全基因组挖掘走 FTP——API 逐基因拉全库会浪费配额与时间。
  3. 表型矩阵内存:9,605 基因 × MP 术语(数百)的二元矩阵百 MB 内——相似度/聚类全谱计算单机可行。
  4. 影像类资源:histopathology/embryo 影像的体量显著大于参数数据——深度学习用影像时按集合分批下载。

§3.5 获取通道

  1. Web 门户:基因页/疾病模型页/集合页——人工浏览与单基因查询。
  2. REST API:程序化访问(官方培训材料覆盖大规模 API 使用)——脚本化挖掘的主通道。
  3. FTP:全量数据文件批量下载——离线分析的底座。
  4. 批量查询:门户批量基因查询(基因列表→批量结果)——中等规模的交互式路径。
  5. 知识图谱:KG 形态——SPARQL/图查询的推理型消费。
  6. 品系资源:EMMA/KOMP Repository——MTA 订购活体/冷冻胚胎/精子;Allele Conversion Service 换等位基因形态。

§3.6 口径对齐表

数字 口径 A 口径 B 使用建议
数据点 1.38 亿(DR24 测量级) 111,664(DR24 调用级) 规模引用分清量级
基因数 9,605(DR24 已表型) 12,350(IKMC ES 库 2013) 资源库≠已表型
调用数 113,803(DR23.0) 111,664(DR24) 写明 DR 版本
品系数 10,341(DR24 突变品系) >4,800(EMMA 存档) 生产≠存档
疾病模型 >1,400(候选) >100(验证关联) 候选≠确认
背景品系 C57BL/6N(IMPC 统一) C57BL/6J(他源数据) 亚系差异注意

§3.7 版本选择纪律

  1. 新分析:直接用 DR24——除非需要与旧版结果衔接。
  2. 跨版本衔接:固定发布版本号入方法学;管线改进的调用集差异要显式声明(DR23→DR24 非超集)。
  3. 协议版本联动:IMPReSS 协议版本与 DR 版本双戳——表型对比的前提是协议一致。
  4. API 脚本的版本回归:DR24 机器可读性改进可能改变字段结构——升级后老脚本先跑金标回归。
  5. 外链数据的独立口径:Tremblay 早期致死等外链数据不随 DR 版本走——引用时独立标注其来源与版本。

§3.8 数据文件与字段详表

数据面 粒度 关键字段
基因表 每敲除基因一行 mgi_id, symbol, allele_type, viability, essentiality_class, producing_center
表型调用表 每显著调用一行 mgi_id, mp_term, procedure, parameter, z_score/effect, sex, significance, release
参数测量 每参数每动物 mgi_id, procedure, parameter, value, sex, age_weeks, center, date
存活数据 每品系 homozygous_viability, heterozygous_viability, litter 统计
影像资源 每检查 embryo/histopathology 影像 + 元数据
KG 图节点/边 基因-表型-疾病-资源链接
IMPReSS 协议文档 procedure_id, parameter 定义, SOP, 版本

§4 数据结构

§4.1 对象模型

IMPC 数据模型(门户/FTP/API 视角)
├── Gene(MGI ID 主键;HGNC symbol 联动)
│   ├── allele(tm1a-e / VelociGene / CRISPR——结构+衍生关系)
│   ├── viability(纯合存活分类)
│   ├── essentiality(五分类)
│   └── producing_center(Sanger MGP/Harwell/JAX/BCM…)
├── Procedure/Parameter(IMPReSS 16 类别;参数级 SOP)
├── Measurement(动物级原始测量——1.38 亿点)
├── PhenotypeCall(统计显著调用——OpenStats;MP 术语+性别+效应)
├── OntologyLayer(MP 层级 ↔ HPO 映射)
└── Release 维度(DR 版本戳——跨版本分析的口径轴)
  1. 模型的两层统计结构:Measurement(原始)→ PhenotypeCall(统计结论)——分析用哪层是设计决策(调用层轻便、测量层灵活)。
  2. 本体层是语义外挂:MP/HPO 不在调用表内联而是经术语 ID 关联——跨物种对齐先装载本体映射表。
  3. 版本维度贯穿全模型:每个数据面都有 DR 版本——「版本四元组」(DR 版+协议版+等位基因型+中心)是表型解读的最小上下文。

§4.2 API 单基因查询

#!/usr/bin/env python3
"""IMPC API 单基因表型查询骨架(教学;正式端点以官方文档为准)。"""
import json, time, urllib.request

BASE = "https://api.mousephenotype.org"  # 以官方文档确认的端点为准

def gene_phenotypes(mgi_or_symbol: str) -> dict:
    """基因的显著表型调用(MP 术语+统计)。"""
    url = f"{BASE}/genes/{mgi_or_symbol}/phenotype-calls"
    with urllib.request.urlopen(url, timeout=30) as r:
        return json.load(r)

def gene_essentiality(mgi_or_symbol: str) -> dict:
    """必要性/存活分类与等位基因信息。"""
    url = f"{BASE}/genes/{mgi_or_symbol}"
    with urllib.request.urlopen(url, timeout=30) as r:
        return json.load(r)

if __name__ == "__main__":
    calls = gene_phenotypes("MGI:104779")   # 示例基因
    info = gene_essentiality("Brca1")       # 符号亦可(按 API 约定)
    for c in calls.get("results", [])[:5]:
        print(c.get("mpTermName"), "|", c.get("sex"),
              "|", c.get("statisticalMethod"))
    time.sleep(0.2)  # 礼貌限速

API 要点:(1) 正式端点/参数以官方 API 文档与 DR24 机器可读报告为准——本骨架是消费姿势示意;(2) 分页/限速遵循官方建议;(3) 调用附统计方法与性别——消费时保留这两个维度。

§4.3 FTP 全量装载与表型矩阵构建

#!/usr/bin/env python3
"""IMPC FTP 表型调用全量 → 基因×MP 二元矩阵(全谱挖掘底座)。
   阴性调用(测过无调用)单独编码为 -1:阴性≠缺失(§1.9)。"""
import pandas as pd

def load_calls(ftp_dir: str) -> pd.DataFrame:
    """装载全量表型调用文件(DR24)。"""
    return pd.read_csv(f"{ftps_dir}/phenotype_calls.csv", low_memory=False) \
        if False else pd.read_csv(f"{ftp_dir}/phenotype_calls.csv",
                                  low_memory=False)

def build_matrix(calls: pd.DataFrame,
                 tested: pd.DataFrame) -> pd.DataFrame:
    """基因×MP 矩阵:1=显著调用,-1=测过阴性,0=未测。
       tested = 基因×MP 的「已检测」清单(FTP 测量覆盖表派生)。"""
    pos = (calls.assign(v=1)
                .pivot_table(index="mgi_id", columns="mp_term_id",
                             values="v", aggfunc="max"))
    tested_set = set(map(tuple, tested[["mgi_id", "mp_term_id"]].values))
    mat = pos.reindex(columns=sorted(set(calls.mp_term_id))).fillna(0)
    for g, m in tested_set:
        if mat.at.get((g, m)) is None or (g in mat.index and m in mat.columns
                                          and mat.at[g, m] == 0):
            if g in mat.index and m in mat.columns:
                mat.at[g, m] = -1
    return mat

if __name__ == "__main__":
    # 三值语义:1 有表型 / -1 测过阴性 / 0 未测——
    # 全谱相似度与 ML 消费必须区分三值,不能当普通 0/1 矩阵。
    print("矩阵语义入档:三值编码写进方法学")

矩阵要点:(1) 三值语义(1/-1/0)是 IMPC 消费的核心纪律——「没调用」分「测过阴性」与「没测过」两种;(2) 阴性信息从「已检测覆盖」派生——FTP 的测量覆盖表/参数计数是来源;(3) 稠密矩阵的相似度(Jaccard/余弦)只应在「共同检测集」内计算——覆盖不对称会让相似度失真。

§4.4 必要性分类与靶点扫描

#!/usr/bin/env python3
"""靶点安全性前置扫描:候选靶点清单 × IMPC 必要性/存活/表型。
   输出每个靶点的「可药性风险面」摘要。"""
import pandas as pd

def target_safety_scan(targets: list[str], genes: pd.DataFrame,
                       calls: pd.DataFrame) -> pd.DataFrame:
    g = genes[genes.symbol.isin(targets)].set_index("symbol")
    rows = []
    for sym, r in g.iterrows():
        vcalls = calls[(calls.mgi_id == r.mgi_id)
                       & (calls.viability_relevant | True)]
        n_calls = len(vcalls)
        cls = r.essentiality_class
        risk = {"cellular lethal": "不可成药(细胞必需)",
                "developmentally lethal": "发育毒性风险高",
                "subviable": "部分致死风险",
                "viable with phenotype": "可成药——表型面需评估",
                "viable with no phenotype": "单靶疗效存疑"}.get(cls, "未知")
        rows.append({"target": sym, "class": cls, "n_calls": n_calls,
                     "risk_note": risk})
    return pd.DataFrame(rows)

if __name__ == "__main__":
    print("纪律:扫描输出是「风险面摘要」不是「弃用清单」——")
    print("subviable/lethal 基因亦有组织特异性条件敲除的成药路径")

扫描要点:(1) 五分类映射到「可药性风险面」是工程化转译——决策仍需机制层评估;(2) 全敲致死 ≠ 不可成药——条件性敲除(tm1c 系)支持组织特异药效假设;(3) 「viable with no phenotype」提示单靶点可能无效(冗余/补偿)——疗效风险与安全风险同样重要。

§4.5 元数据与可复现指纹

  1. 版本四元组:DR 版本 + IMPReSS 协议版本 + 等位基因类型 + 生产中心——任何表型结论的最小上下文。
  2. 品系指纹:MGI ID + 等位基因 MGI ID + 背景亚系(C57BL/6N)——品系级引用的精确形态;「Brca1 knockout」不等于一个品系(tm1a/tm1c/CRISPR 是不同实验)。
  3. 调用指纹:call 附统计方法/效应/性别/中心——复现分析时保留调用级完整字段。
  4. FTP 快照:下载日期 + 文件清单哈希——FTP 内容随版本滚动,快照自归档(与 VAERS 同纪律)。

§4.6 完整性清单

装载 DR 数据后的自查序列:

  1. 基因数与官方 DR 报告对账(DR24 应见 9,605/10,341/111,664 三数)。
  2. MGI ID 唯一性与 HGNC symbol 映射抽验(跨资源联动的前提)。
  3. 调用表的 MP 术语 ID 在 MP 本体当前版中的在场性——本体版本联动。
  4. 三值矩阵语义核查——「测过阴性」覆盖表与调用表的一致性抽验。
  5. 性别维度在场性——DR24 性别特异注释的调用比例抽验。
  6. 中心效应初查——同基因多中心生产的调用方向一致性抽验。
  7. 版本戳完整性——全部行含 DR 版本可追溯。

§4.7 数据血缘

IMPC 血缘(品系与数据从哪来)
IKMC 资源(EUCOMM/KOMP/NorCOMM ES 库 + CRISPR 设计)
  → 品系生产(21 中心分工;Sanger MGP/JAX/Harwell/BCM 等引擎)
  → 分子确认(基因分型/等位基因结构验证)
  → 标准表型(IMPReSS 16 类;同协议突变体 vs 同期野生型)
  → DCC 汇总与质控(PhenoDCC)
  → 集中统计(OpenStats → 显著调用)
  → 发布(DR 版本:门户/API/FTP/KG)
  → 生态消费(MGI/Open Targets/UniProt/Monarch/Exomiser)
  → 反馈(用户质询 → 中心复检 → 下一版修订)
  1. 血缘的核心节点是「分子确认→标准表型」的衔接:等位基因结构错误会让全部下游表型失义——2013 年 Mammalian Genome 的系统表征正是这个节点的质检记录。
  2. DCC 的枢纽地位:多中心数据的收集/质控/统计/发布集中化——「分布式生产、集中化统计」是数据一致性的制度保证。
  3. 血缘的工程落点:下游分析每个调用可回溯「品系→等位基因→中心→协议版本→统计版本」——争议数据的复检通道全程开放。

§4.8 与 Open Targets 的整合消费

#!/usr/bin/env python3
"""IMPC 证据在靶点打分语境的消费骨架:
   IMPC 提供「动物模型」证据维(Open Targets 整合其数据),
   自建管线可对齐 IMPC 调用与 GWAS/OMIM 基因集。"""
import pandas as pd

def impc_support(ot_targets: pd.DataFrame, calls: pd.DataFrame,
                 hpo_map: pd.DataFrame) -> pd.DataFrame:
    """给 Open Targets 式靶点清单附加 IMPC 证据列。
    hpo_map: MP→HPO 映射表(Monarch/官方源)。"""
    ev = []
    for _, row in ot_targets.iterrows():
        c = calls[calls.mgi_id == row.mgi_id]
        human_pheno_terms = hpo_map[hpo_map.mp_term_id.isin(c.mp_term_id)]
        ev.append({
            "target": row.symbol,
            "n_impc_calls": len(c),
            "n_translated_phenos": human_pheno_terms.hpo_id.nunique(),
            "sexual_dimorphic": c.sex.nunique() > 1
                                and c.groupby("sex").mp_term_id.nunique().nunique() > 1,
        })
    return pd.DataFrame(ev)

if __name__ == "__main__":
    print("证据分级纪律:n_translated_phenos 是『经 HPO 映射的人类表型面』,")
    print("与 GWAS 关联数并列时必须标注证据来源层级(动物模型 vs 人类遗传)")

整合要点:(1) Open Targets 把 IMPC 作为「动物疾病模型」证据维整合——自建打分时证据权重分层(人类遗传 > 动物模型 > 计算预测)要有显式系数;(2) MP→HPO 映射的质量(一对多/多对一)影响转译计数——映射版本入档;(3) 性别二态列是新维——DR24 的性别注释使其可计算。

§4.9 与品系资源库(EMMA/KOMP)的联动

数据 → 活体的联动路径
IMPC 门户(表型兴趣 → 找品系)
  → 品系页的存档指针(EMMA ID / KOMP ID)
  → MTA 条款确认(EUCOMM MTA 为不可协商条款——官方提醒)
  → 订购(活体/冷冻胚胎/精子;Allele Conversion Service 可转 tm1a→tm1c)
  → 到货后的本地验证(基因分型 + 关键表型复现)
  → 发表时的品系引用(完整等位基因符号 + 存档 ID)
  1. 数据与资源的 ID 衔接:门户品系页直接给出存档库 ID——「看到表型→拿到小鼠」的最短路径是设计出来的。
  2. MTA 的合规先行:EUCOMM 资源的 MTA 不可协商——订购前的条款确认是项目排期的一部分(不是物流问题)。
  3. 到货验证的必要性:运输/繁殖中的遗传漂变与污染历史上有案例——本地基因分型验证是发表前义务。

§5 下游分析协议

§5.1 任务×资源速查表

任务 IMPC 资产 配套资源 输出物
单基因功能解读 门户基因页/测量图 HGNC/MGI 注释 基因功能简报
变异致病性佐证 调用+MP↔HPO Exomiser/OMIM 佐证报告
靶点安全扫描 五分类+调用 Open Targets 风险面清单
全谱表型相似度 三值矩阵 MP 本体 基因聚类/模型发现
性别二态挖掘 DR24 性别注释 性别差异文献 二态基因清单
胚胎致死分析 Embryo 集合 发育本体 发育基因图谱
老年表型研究 Late Adult 集合 ageing 文献 迟发表型谱
跨物种模型发现 MP/HPO 映射 Monarch 物种间表型对应

§5.2 单基因深度解读协议

  1. 五步读法:等位基因类型(结构是否破坏功能)→ 存活/必要性(数据覆盖先验)→ 调用清单(按 MP 大类分组)→ 测量图(效应方向与幅度)→ 性别分层(DR24 注释)。
  2. 调用与测量的交叉:显著调用的参数回到原始测量看分布重叠度——边缘显著(P 擦线+效应小)的调用降权。
  3. 中心与批次核查:多中心生产的基因做中心间方向一致性检查——单中心驱动的调用谨慎引用。
  4. 与文献对表:IMPC 阴性 vs 文献阳性(或反向)的处理——先查等位基因差异(null vs hypomorph)再下结论。
  5. 输出纪律:简报附「版本四元组」与阴性调用说明——「无表型」要写「测过阴性」还是「未测」。

§5.3 罕见病佐证协议

  1. 输入规范化:患者 HPO 术语集(标准编码)+ 候选基因变异清单。
  2. IMPC 侧检索:候选基因的调用经 MP→HPO 映射——与患者 HPO 的重叠打分(Exomiser 类算法的透明复现)。
  3. 证据分级:表型重叠数/特异性(罕见 MP 术语权重高)/一致性(多参数同方向)——三项合成佐证强度。
  4. 反例检查:必要性分类与已知疾病机制的一致性(发育致死基因对应发育表型是正向;成年发病疾病对应 viable 基因)。
  5. 输出定位:佐证是 ACMG/AMP 框架的辅助证据(动物模型类)——报告写明证据类别不越级。

§5.4 成本模型

成本项 计算研究 实验室研究 诊断团队
数据获取 免费(CC-BY) 免费 免费
计算 单机可及 不适用 轻量
品系获取 不适用 MTA+订购+繁殖(数月) 不适用
本体对齐维护 MP/HPO 版本跟踪 同左 HPO 编码质量
人力 数据工程 1-2 人 胚胎/表型实验组 遗传咨询师+生信
  1. 计算端近乎零边际成本:数据与计算都是免费/单机——IMPC 挖掘是学界性价比最高的功能基因组入口之一。
  2. 实验端的真实成本在时间:品系订购到表型复现以月计——项目排期把 MTA/繁殖周期放进去(不是技术问题)。
  3. 诊断端的成本在编码质量:患者 HPO 术语编码质量决定佐证信号——遗传团队的 HPO 培训是隐性投入。

§5.5 失败模式清单

  1. 调用数当规模——1.38 亿测量 vs 11 万调用差三个量级;修复:口径分开引用。
  2. 跨 DR 版本直比——管线改进使调用集非超集;修复:固定版本或重算。
  3. 等位基因混淆——tm1a 顺式效应/tm1e 不可条件化/CRISPR 需分子确认;修复:等位基因类型先读。
  4. 阴性当缺失——三值语义(1/-1/0)混淆;修复:覆盖表派生阴性。
  5. MP-HPO 映射越级——小鼠表型佐证不等于人类因果;修复:证据分级标注。
  6. 中心效应忽略——多中心数据的批次差异;修复:方向一致性检查。
  7. 性别合并稀释——二态效应被合并统计抹掉;修复:默认分层。
  8. 品系引用不精确——「某基因敲除小鼠」歧义;修复:完整等位基因符号+存档 ID。

§5.6 校准与验证协议

自建 IMPC 分析管线的分级校准(L1-L6):

级别 校准内容 方法 通过标准
L1 装载完整性 §4.6 清单七项 全项通过
L2 ID 映射 MGI↔HGNC↔Ensembl 抽验 100 条 零错误
L3 本体对齐 MP 术语在 MP 当前版在场;HPO 映射抽验 孤儿率 <0.5%
L4 已知信号复现 经典基因(如 Lepr 肥胖表型)盲复现 方向与调用一致
L5 相似度合理性 已知同功能基因簇的矩阵相似度排序 生物学合理性抽验
L6 API/FTP 一致性 同基因 API 与 FTP 结果 diff 零不一致
  1. L4 的经典基因集:Lepr(肥胖)、Tyr(白化)等教科书级表型——管线端到端正确性的直接证据。
  2. L5 的生物学合理性:计算结果与生物学直觉的一致性抽验——防止矩阵工程错误(覆盖不对称等)污染下游。

§6 实证结果与方法学分析

§6.1 十五年产出的实证观察

  1. 规模曲线:2011 起步 → DR23.0(2025)9,277 基因/1 亿数据点 → DR24(2026-03)9,605 基因/1.38 亿数据点——年产数百基因的稳定推进(CRISPR 时代提速)。
  2. 表型发现的密度:约 11 万显著调用/9,605 基因 ≈ 每基因平均 11-12 个显著表型——高通量筛查的发现密度远超单基因文献。
  3. 疾病转化的管道:>1,400 候选模型 → >100 验证关联——从候选到确认的转化率反映「小鼠表型→人类疾病」确认链的真实难度。
  4. 引用影响:8,000+ 论文依赖——IMPC 数据已成为功能基因组的基础设施级引用。

§6.2 多中心标准化的实证教训

  1. 协议统一的收益:IMPReSS 使 21 中心数据可合并统计——没有它,多中心表型的合并分析会被批次噪声淹没。
  2. 残余的中心效应:同协议下中心间仍有环境残差(饮食/设施/操作者)——调用层面的方向一致性检查是必须的敏感性分析。
  3. 统计集中的权衡:OpenStats 集中统计牺牲了中心级灵活性换全局可比——自建分析可以重算但要声明与官方调用的差异。
  4. 版本演化的代价管理:管线改进改变调用集(DR23→DR24)——「统计口径的版本化」是多中心项目的长期负债,IMPC 用版本戳+发布说明管理,值得同类项目抄。

§6.3 方法学三层框架(gsm)

  1. G(Governance):15 国资助治理 + DCC 协调 + CC-BY 许可——数据合法性与其品系 MTA 的双轨。
  2. S(Semantics):等位基因类型×存活分类×MP/HPO 本体——表型解读的语义三角;等位基因结构决定「敲除」的含义。
  3. M(Methodology):IMPReSS 协议+OpenStats 统计+版本纪律——从动物到调用的方法学链条;跳过任何一环的解读都失稳。
  4. 框架用法:评估任何 IMPC 消费先过三层——「许可与资源边界(G)→ 等位基因与本体(S)→ 协议与统计(M)」。

§6.4 接力实验设计

IMPC 研究团队的接力验证设计:

  1. R1 快照定格:DR 版本固定+FTP 归档+§4.6 清单——产出「可信数据实例」。
  2. R2 映射校准:ID/本体映射核查(L2-L3)——产出「语义可用的矩阵」。
  3. R3 经典复现:Lepr/Tyr 等盲复现(L4)——产出「管线有效性证据」。
  4. R4 目标分析:单基因/全谱/靶点扫描——产出「研究结论」。
  5. R5 交付:方法学段落(§7.7)+ R1-R3 证据 + 官方引用格式——审稿可回放。

§6.5 八个真实坑点

  1. 坑点 1:调用数当规模——测量级与调用级差三个量级;口径分开。
  2. 坑点 2:等位基因混淆——tm1a/tm1e/CRISPR 结构差异决定表型含义;先读 allele design。
  3. 坑点 3:阴性当缺失——三值语义(1/-1/0);覆盖表派生阴性。
  4. 坑点 4:跨 DR 版本直比——管线改进非超集;固定版本或重算。
  5. 坑点 5:MP-HPO 越级——小鼠表型佐证≠人类因果;证据分级。
  6. 坑点 6:调用数变化当生物学——DR23→DR24 下降是管线改进;读发布说明。
  7. 坑点 7:中心效应忽略——多中心批次残差;方向一致性敏感性。
  8. 坑点 8:品系引用不精确——「敲除小鼠」歧义;完整等位基因符号+存档 ID。

§6.6 审稿人自查清单

  1. DR 版本(+IMPReSS 协议版本)是否声明?
  2. 等位基因类型是否写入方法学?
  3. 「无表型」是否区分「测过阴性」与「未测」?
  4. 跨版本对比是否声明管线差异?
  5. MP→HPO 转译是否标注映射版本与证据层级?
  6. 多中心数据是否做中心效应敏感性?
  7. 性别维度是否分层呈现(或声明合并理由)?
  8. 品系引用是否用完整等位基因符号?
  9. 小鼠证据的结论措辞是否克制(不越级到人类因果)?

§6.7 版本治理的方法学含义

  1. 「改进即变化」的沟通艺术:DR24 调用数下降被官方明确解释为管线改进——版本说明把「数据变少」翻译成「统计变准」;同类项目应学会这种沟通。
  2. 协议版本的隐性联动:IMPReSS 协议更新不随 DR 发布走——跨期分析要同时核对两个版本轴。
  3. 外链数据的边界管理:早期致死外链数据(Tremblay 组)独立于 DR 版本——外源数据的引用边界要显式。
  4. 对国内同类平台的启示:「自产数据不聚合文献」的定位纯净性 + 版本戳体系 + 发布说明的解释义务——三件套是国家级表型平台可以直接借用的治理模板。

§6.8 与人类遗传学证据的整合张力

  1. 证据层级的不可通约:小鼠全敲是「基因功能缺失的极限实验」——人类多数疾病变异是部分功能改变(错义/调控);LoF 光谱的对齐要做插值不是直译。
  2. 表型翻译的信息损耗:MP 调用(标准化检测)与人类临床表型(自由临床描述)的语义距离——HPO 映射后仍有残余不对应;佐证打分的权重设计要保守。
  3. 背景一致性的优势:IMPC 全库 C57BL/6N 消除背景噪声,但也意味着「背景修饰」的人类对应物(遗传背景多样性)不在系统内——外推时声明。
  4. 工程含义:整合管线里 IMPC 证据列的元数据至少含「等位基因类型+DR 版本+HPO 映射版本」——证据可追溯性是整合可信度的底座。

§6.9 表型统计的解读纪律

  1. 显著性≠重要性:11 万调用是海量检验的产出——效应量与生物学特异性(罕见 MP 术语)才是优先级信号。
  2. 每基因平均调用的误用:平均 11-12 个调用不代表「每个基因都该有 11 个表型」——必要性与检测覆盖决定分布;按分布解读不按均值。
  3. P 值口径的版本性:管线版本改变检验框架(DR24 性别注释)——P 值跨版本不可直比;引用附版本。
  4. 效应方向的生物学锚定:参数的「高/低」要与生理学方向对齐(如血糖高)——调用表的 z 值方向消费前先核对参数定义。

§7 AI 就绪指南与应用场景

§7.1 IMPC 在医疗 AI 中的四种喂法

  1. 喂法 1:基因-表型监督标签——三值矩阵做基因功能预测模型的训练/评测标签(阴性样本防「没证据=无功能」退化)。
  2. 喂法 2:变异优先级特征——VUS 解释管线里 IMPC 佐证作为特征维(经 HPO 映射)。
  3. 喂法 3:知识图谱节点——KG 形态接入基因-表型-疾病推理图;链接预测发现新关联。
  4. 喂法 4:多模态影像预训练——histopathology/embryo 影像+参数标签——表型影像的自监督/弱监督资源。
  5. 四喂法与坑点对应:喂法 1 踩坑 3(三值语义);喂法 2 踩坑 5(越级);喂法 3 踩坑 4(版本);喂法 4 踩坑 2(等位基因元数据)——建模前对号。

§7.2 表型矩阵挖掘管线实操配方

端到端配方(DR 快照 → 挖掘产物)
┌────────────────────────────────────────────────────────┐
│ 1. 快照:FTP 全量下载+归档(DR24)                        │
│ 2. 装载:调用表+测量覆盖表+MP 本体                        │
│ 3. 矩阵:三值编码(1/-1/0)+ 共同检测集掩码               │
│ 4. 校准:Lepr/Tyr 复现(L4)                             │
│ 5. 挖掘:相似度/聚类/链接预测(在掩码内)                  │
│ 6. 语义:MP→HPO 转译 + 证据分级标注                       │
│ 7. 交付:结果+版本四元组+方法学段落                       │
└────────────────────────────────────────────────────────┘
  1. 共同检测集是相似度的生命线:覆盖不对称的相似度是伪相似度——掩码内计算是纪律。
  2. 阴性信息的杠杆:-1 值参与聚类(测过阴性=功能信息)——全谱挖掘与文献挖掘数据集的最大差异点。
  3. 语义层最后注入:先做数值挖掘再做 MP→HPO 转译——语义转译过早会锁死计算自由度。

§7.3 模型选型与迁移决策

  1. 矩阵规模友好:9,605×数百 MP 的三值矩阵——轻量模型(矩阵分解/图嵌入)即可全谱建模;无需大模型起步。
  2. 图神经网络的适用面:基因-表型二部图+本体层级——GNN 的链接预测适合「测过但阴性/阳性混合」的结构。
  3. 影像模型的迁移路径:histopathology 影像量级有限——病理学预训练模型(PathChat 类)微调优于从头训练。
  4. LLM 的正确位置:调用清单的自然语言解读+方法学段落生成——挖掘主体仍是结构化模型;LLM 做语义接口。

§7.4 公平性:基因宇宙的覆盖偏倚

  1. 优先算法的残余偏倚:under-studied 优先策略校正了文献偏置,但靶向可行性(critical exon 存在性/必要性别)仍造成覆盖差——致死基因的表型数据天然稀疏。
  2. 表型检测的人类中心性:IMPReSS 检测清单反映人类关注(代谢/行为/心血管)——小鼠感知域(嗅觉/超声交流)覆盖弱;「无检测=无数据」的域要声明。
  3. 性别覆盖的历史债:早期数据的性别平衡弱于 DR24——跨期分析注意性别记录密度变化。
  4. 跨物种映射的语义不平等:MP↔HPO 映射在「临床常见表型」处最密——罕见/特殊表型的映射稀疏,佐证能力随之不均。

§7.5 任务×资源速查表

AI 任务 输入 IMPC 资产 评测指标
基因功能预测 序列/网络特征 三值矩阵标签 AUROC(阳性+阴性双评测)
VUS 优先级 变异+患者 HPO MP→HPO 佐证 已知诊断复现率
新模型发现 表型查询 矩阵相似度 生物学家盲评
表型影像分类 组织/胚胎影像 影像+标签 分域 F1
性别二态发现 性别分层调用 DR24 注释 已知二态基因召回
链接预测 KG 知识图谱 hits@k(已知关联留出)

§7.6 端到端案例:未确诊病的 IMPC 佐证流水

  1. 目标:为某未确诊罕见病家系(外显子组已测)生成 IMPC 佐证报告。
  2. 输入:患者 HPO 术语集 + 候选变异(变优先级后 top-20 基因)。
  3. 步骤:(a) 候选基因的 IMPC 调用拉取(API)→ (b) MP→HPO 转译 → © 与患者 HPO 的重叠与特异性打分 → (d) 必要性分类与疾病机制一致性核查 → (e) 佐证报告(证据类别=动物模型辅助证据)。
  4. 坑点前置:映射版本(坑点 5 的纪律);阴性声明(坑点 3);措辞克制(不越级)。
  5. 产出:报告进入诊断团队的变优先级会议——与 OMIM/文献证据并列呈现。

§7.7 报告模板:方法学段落骨架

IMPC 数据分析方法学段落(可复用骨架):
「本研究使用 IMPC 数据发布 DR24(2026-03-16,IMPReSS 协议版本 X)。
基因-表型矩阵按三值编码(1=显著调用 / -1=测过阴性 / 0=未测),
阴性覆盖自测量覆盖表派生。
表型相似度在共同检测集掩码内计算(方法:Jaccard/嵌入…)。
跨物种转译经 MP→HPO 映射(映射版本 Y),证据定位为
动物模型辅助证据(ACMG/AMP 框架辅助类)。
等位基因类型与生产中心元数据全保留;
性别维度按 DR24 性别特异注释分层呈现。
全部品系引用使用完整等位基因符号与存档 ID(EMMA/KOMP)。」
  1. 骨架的八要素:DR 版本/协议版本/三值语义/掩码/相似度方法/映射版本/证据层级/品系引用——少一项即复现风险点。
  2. 本地化建议:中文研究补「小鼠表型术语的中文对照表」——团队沟通与临床转译的效率件。

§7.8 成本与排期模板

阶段 内容 计算研究 实验研究
W1 快照下载+装载+完整性(L1) 1 人 1 人
W2 映射校准(L2-L3) 1 人 1 人
W3 经典复现(L4) 1 人 —
W4-6 目标分析(矩阵/佐证/影像) 1-2 人 实验组并行
W7-8 品系订购与 MTA(如需) — 排期关键路径
常设 DR 版本跟踪+本体对齐 兼职 兼职

§7.9 消融案例:阴性信息对功能预测的影响

  1. 设定:同一基因功能预测任务——A 只用阳性调用(1/0 二值);B 三值(1/-1/0);C 三值+共同检测掩码;D C+本体层级聚合。
  2. 典型结果模式:A 的「0 值」混合了阴性/未测——模型把未测基因系统性打低分;B 修正后阴性基因的分数分布正常化;C 消除覆盖不对称的伪相似;D 的层级聚合提升稀疏术语的信号——四步的信息增益集中在 B、C。
  3. 教训:阴性信息的编码方式(不是模型选择)是 IMPC 建模的第一杠杆——先修数据语义再调模型。
  4. 与坑点的映射:A 即坑点 3;C 即坑点 7 的矩阵版;D 是本体维度的加成——消融矩阵就是坑点清单的实验化。

§8 伦理、许可与合规

§8.1 许可与义务结构

  1. CC-BY 4.0 的开放面:门户/API/FTP/KG 全部数据——署名即用,商用可用;引用规范(官方 Citing IMPC Data 页)。
  2. 品系的双轨受控:活体资源经 EMMA/KOMP Repository 的 MTA——EUCOMM MTA 不可协商(官方明示);数据开放≠实物无条件开放。
  3. 动物福利的制度层:IMPC 官网设 Animal Welfare 专章——21 中心的动物实验伦理批准与 3R 原则执行是联盟治理的常设维度;引用与使用时尊重该语境。
  4. 数据引用义务:CC-BY 的署名要求+官方引用格式(门户论文+DR 版本)——引用是许可义务也是学术礼仪。

§8.2 引用与致谢模板

论文/报告引用模板:
「本研究使用 IMPC 数据(Data Release 24, 2026-03-16;
mousephenotype.org),按 CC-BY 4.0 许可使用。
表型数据依据 IMPReSS 标准化协议生成,统计调用经 OpenStats 管线。
品系来源:[EMMA ID/KOMP ID + 完整等位基因符号]。
Wilson R 等, NAR 2026;54(D1):D1133-D1142(门户论文);
[如用特定成果] 另引对应主题论文。」
  1. 双引用结构:门户论文(资源引用)+ 主题论文(具体成果)——IMPC 官方推荐结构。
  2. 版本与协议双戳:DR 版本+IMPReSS 协议版本——与 §3.7 纪律一致。
  3. 品系完整引用:等位基因符号+存档 ID——可复现性的品系侧。

§8.3 国内合规路径

  1. 数据获取:CC-BY 4.0 数据全球可用——国内团队直接下载/API 合法;署名引用即可。
  2. 品系引进的监管层:活体小鼠引进涉及国内实验动物许可与生物安全审批——IMPC 品系引进的排期要把国内监管窗口纳入(可能数月)。
  3. 动物伦理的本地对齐:国内机构使用 IMPC 品系做实验——本单位 IACUC/伦理委员会批准是本地义务(IMPC 的福利语境不替代本地审批)。
  4. 罕见病诊断的落地:IMPC 佐证进入国内遗传咨询报告——报告语言按国内临床规范表述(辅助证据定位不变)。

§8.4 商业使用边界

  1. CC-BY 的商用允许:数据嵌入商业产品(靶点筛选平台/BI)合法——署名+许可声明随行。
  2. 品系衍生品的边界:商业服务用 IMPC 品系做药效/毒理实验——MTA 条款的商业条款逐条核查(部分资源有商业使用限制)。
  3. 衍生数据库的义务:基于 IMPC 的衍生数据库(合并/加工)——CC-BY 传播+不暗示官方背书;「IMPC 兼容」类宣传措辞谨慎(不暗示联盟认证)。
  4. AI 模型的许可传导:IMPC 训练的模型商用——数据许可不传导到模型权重(CC-BY 无 copyleft),但训练数据声明是行业规范。

§8.5 合规台账最小模板

台账项 内容示例 更新频率
快照档案 DR 版本/下载日期/文件哈希 每次 DR 发布
本体版本 MP/HPO/映射表版本 半年度
品系台账 订购记录/MTA 副本/本地验证 每次引进
动物伦理 本地批准文号/有效期限 年度续期
数据用例 分析/发表/产品清单 按项目
引用核查 产物引用格式完整性 每次发布

§8.6 大科学工程的治理语义

  1. 联盟治理的三层:资助机构层(方向)+ 中心执行层(生产)+ DCC 协调层(整合)——职责分离清晰;「分布式生产、集中化质控统计发布」的架构是其 15 年稳定的关键。
  2. 标准先行的哲学:IMPReSS 协议在生产启动前固定——「先定标准再产数据」避免事后 harmonization 的高成本;这是多中心实验设计的黄金顺序。
  3. 算法治理的公正性设计:基因优先按算法而非机构偏好——联盟内部的「科研政治」被制度性约束;值得所有联盟型项目参照。
  4. 开放的双边界:数据全开放(CC-BY)与实物受控(MTA)的边界清晰声明——「什么免费什么不免费」提前写明是信任基础;对比模糊许可的资源,IMPC 的边界透明度是治理资产。

§9 谱系与生态

§9.1 小鼠功能基因组时间线

年份 事件 意义
2003 VelociGene 方法建立 高通量打靶技术奠基
2006 Sanger MGP 成立 年产 200 品系的生产引擎
2007-2011 IKMC 时代 EUCOMM/KOMP/NorCOMM ES 库铺底
2009-2011 knockout-first 设计确立 Skarnes 2011;Pettitt 2009
2011 IMPC 成立 多中心表型联盟
2013 等位基因分子表征 品系质检系统化
2015 IMPC 主论文 目录首批成果
CRISPR 时代 生产提速 主力技术切换
2025-11 NAR 门户论文 云原生重建+KG(DR23.0 口径)
2026-03 DR24 1.38 亿数据点/9,605 基因/性别注释强化

§9.2 术语表

  1. IKMC:国际敲除小鼠联盟——IMPC 的资源前身(EUCOMM/KOMP/NorCOMM)。
  2. knockout-first(tm1a):诱捕盒+条件潜力的一代等位基因设计。
  3. tm1b/tm1c/tm1d/tm1e:tm1a 经 Cre/Flp 衍生的等位基因家族(报告/条件/移码/非条件)。
  4. VelociGene:Regeneron 的整码删除技术——完全 null 等位基因。
  5. critical exon:关键外显子——所有转录变体共有的功能必需外显子。
  6. IMPReSS:标准化表型协议库——16 类别检测 SOP。
  7. OpenStats:集中统计管线——显著调用的产出框架。
  8. PhenoDCC:数据协调中心——多中心数据的收集/质控/汇总。
  9. MP(Mammalian Phenotype):哺乳动物表型本体——调用的原生术语。
  10. HPO:人类表型本体——跨物种转译的目标术语。
  11. 必要性五分类:cellular lethal/developmentally lethal/subviable/viable with phenotype/viable with no phenotype。
  12. under-studied genes:未充分研究基因——IMPC 优先策略的靶向。
  13. Disease model(候选):复现人类患者表型的敲除品系。
  14. EMMA:欧洲突变小鼠档案库——INFRAFRONTIER 品系存档。
  15. Exomiser:变优先级工具——消费 IMPC/模型生物数据佐证人类变异。
  16. Monarch Initiative:跨物种表型计算推理生态。

§9.3 资源选型决策树

基因功能问题需要什么?
├── 敲掉后全身表型 → IMPC(因果实验证据)
├── 全部文献知识聚合 → MGI(知识库)
├── 人组织表达 → GTEx/HPA(表达证据)
├── 人类遗传关联 → GWAS Catalog/OMIM(关联证据)
├── 细胞必需性 → DepMap(细胞层筛选)
├── 变异致病性佐证 → IMPC(经 Exomiser/Monarch)
└── 靶点综合打分 → Open Targets(整合全链)
  1. 证据类型匹配问题类型:功能缺失后果→IMPC;表达位置→GTEx;人群关联→GWAS——选错资源类型是问题的常见起点。

§9.4 与本库其他条目的关系

关联条目 关系 典型联合场景
HGNC 基因命名委员会 符号/ID 对齐 基因跨库联接的标识符层
MedDRA 监管活动医学词典 表型语义对照 安全性事件 vs 模型表型的对齐语境
TCGA 癌症基因×模型表型 敲除表型的肿瘤学转译
SRA 序列档案 测序数据×品系基因分型 等位基因确认的测序证据
AlphaMissense 变异预测×模型验证 计算预测与实验表型的互补

§9.5 组合使用建议

  1. 功能证据最小组合:IMPC(因果)+ HGNC(标识)+ OMIM(疾病关联)——基因功能解读的标准三件套。
  2. 罕见病诊断组合:外显子组 + IMPC 佐证(经 HPO)+ OMIM/PanelApp——VUS 优先级的完整证据链。
  3. 靶点评估组合:IMPC 五分类 + AlphaMissense 变异预测 + Open Targets 打分——安全面×可药性×遗传支撑的三维评估。
  4. 发育研究组合:IMPC Embryo 集合 + SRA 单细胞测序——表型与转录态的时空对齐。

§9.6 模式生物资源的生态角色

  1. 哺乳动物功能注释的锚点:序列注释(自动)与文献知识(手工)之间——IMPC 提供系统实验注释的第三极;Open Targets/MGI/UniProt 的消费确认其锚点地位。
  2. 罕见病诊断的基础设施:经 Exomiser/UDN 的制度化——IMPC 是全球罕见病诊断管线里的标准证据源。
  3. 阴性数据库的独有价值:系统性「测过阴性」记录在生物医学资源里的稀缺性——功能冗余/补偿研究的独家入口。
  4. 多中心科学的方法学输出:IMPReSS/OpenStats/DCC 的治理三件套——超出数据本身的方法学遗产。

§9.7 功能基因组资源家族的光谱定位

维度 IMPC MGI DepMap GTEx
证据类型 个体敲除表型 文献聚合 细胞必需性 人组织表达
物种 小鼠(C57BL/6N) 小鼠(全景) 人类细胞系 人类组织
因果强度 强(体内实验) 依来源 强(细胞内) 弱(观察)
覆盖 9,605 基因 全景 全基因(细胞内) 全基因(组织级)
转化距离 近(哺乳动物) — 远(细胞层) 零(人类)
  1. 家族共性:系统化×标准化×开放——功能基因组资源的三件套;IMPC 在「体内因果」与「哺乳动物距离」的组合上独占。
  2. 互补结构:DepMap(细胞内)↔IMPC(个体内)构成必要性证据的两级;GTEx↔IMPC 构成表达↔功能的两端。

§9.8 IMPC 生态的圈层地图

圈层 组件 角色 依赖关系
核心 DR 数据 + IMPReSS + OpenStats 数据与方法本体 —(本体)
生产圈 21 中心(Sanger MGP/JAX/Harwell/BCM…) 品系与数据生产 按标准协议生产
资源圈 EMMA/KOMP Repository 品系存档与分发 MTA 双轨
语义圈 MP/HPO/Monarch/MGI 术语与整合 本体映射
应用圈 Open Targets/Exomiser/UDN/自建管线 语义消费 经语义圈或直连
  1. 生产圈与资源圈的双轨:数据走 CC-BY 开放、品系走 MTA 受控——同一产出物双许可轨道是 IMPC 治理的独特结构。
  2. 圈层穿越的代价:应用圈直连生产圈(单中心门户)会失去多中心合并的统计力——经核心 DR 消费是默认正道;与 sra/meddra 条目的圈层结论同构。

§10 资源导航与 FAQ

§10.1 官方资源导航

资源 入口 用途
IMPC 门户 https://www.mousephenotype.org 基因/表型/疾病模型查询
数据发布页 门户 data/release DR 版本说明与全报告
REST API 门户 API 区 程序化访问(含培训材料)
FTP 门户 FTP 区 全量文件下载
IMPReSS impress 协议站 标准协议原文
Citing IMPC 门户引用页 引用规范
EMMA/INFRAFRONTIER infrafrontier.eu 品系订购(欧洲)
KOMP Repository komp.org 品系订购(北美)
Monarch Initiative monarchinitiative.org 跨物种表型推理
Open Targets opentargets.org 靶点整合打分

上手路径建议:(1) 门户基因页查 3 个熟悉基因(如 Lepr/Brca1/Tyr)建立直觉 → (2) 读 Citing 页与 DR 发布说明 → (3) API 培训材料过一遍 → (4) FTP 下载 DR24 做矩阵演练(§4.3)→ (5) 经典信号复现(L4)后上线挖掘流水。

§10.2 关键文献

  1. Wilson R 等,International Mouse Phenotyping Consortium Portal(NAR 2026;54(D1):D1133-D1142, 10.1093/nar/gkaf1148)——门户架构、DR23.0 口径与整合生态的权威描述。
  2. Groza T 等(PMID 36305825)——联盟层面数据生产与人类疾病研究的综合论文。
  3. Skarnes WC 等,Nature 2011;474:337-342——knockout-first 等位基因设计原文。
  4. Pettitt SJ 等,Nat Methods 2009——C57BL/6N ES 细胞资源。
  5. Mammalian Genome 2013(EUCOMM/KOMP-CSD 分子表征)——等位基因质检的方法学记录。
  6. IMPC 主论文(Nature Genetics 2015)——目录首批成果。
  7. 官方主题论文集(Essential genes/Sexual dimorphism/Hearing/Metabolic 等,门户 Publications 区)——专题分析的数据支撑论文。
  1. HGNC 基因命名委员会——基因标识符与符号的权威层;IMPC 的 HGNC 联动。
  2. MedDRA 监管活动医学词典——临床安全性术语与模型表型的语义对照。
  3. TCGA——肿瘤基因组的转化对照侧。
  4. SRA 序列档案——品系基因分型的测序证据层。
  5. AlphaMissense——变异效应预测与模型实验的互补证据。

§10.4 FAQ

Q1:IMPC 数据免费吗?
A:免费——CC-BY 4.0 许可,门户/API/FTP/知识图谱全开放;署名引用即可。

Q2:可以订购 IMPC 的小鼠吗?
A:可以——经 EMMA(欧洲)或 KOMP Repository(北美),需签署 MTA;EUCOMM 资源 MTA 不可协商(官方提醒)。

Q3:敲掉一个基因通常会发现表型吗?
A:约平均每基因 11-12 个显著调用(DR24)——但分布不均:必要性低的基因可能阴性(测过无表型),致死基因只有胚胎数据。

Q4:「无表型」是没测还是测过没事?
A:必须区分——IMPC 的覆盖记录可区分「测过阴性」与「未测」;分析用三值编码(1/-1/0),把阴性当缺失是常见错误。

Q5:为什么 DR24 的表型调用比 DR23 少了?
A:管线改进(性别特异 MP 注释等)使统计更精确——不是数据变少;跨版本引用写明 DR 版本。

Q6:tm1a、tm1c、tm1d 有什么区别?
A:同一 ES 克隆的衍生——tm1a 是 knockout-first(诱捕盒);Flp 处理得 tm1c(条件性);Cre 处理 tm1c 得 tm1d(移码 null);表型解读前先确认等位基因形态。

Q7:CRISPR 品系和 ES 细胞品系的数据能混用吗?
A:能合并分析但等位基因类型必须入档——CRISPR 有脱靶与嵌合体历史风险、tm1a 有顺式效应——分层敏感性是好习惯。

Q8:IMPC 能证明人类疾病的基因因果吗?
A:不能单独证明——小鼠表型经 HPO 映射是人类变异致病性的「动物模型辅助证据」(ACMG/AMP 框架辅助类);确认仍需人类证据。

Q9:什么是必要性五分类?
A:按纯合敲除后果:cellular lethal(细胞致死)/developmentally lethal(发育致死)/subviable(亚存活)/viable with phenotype(可活有表型)/viable with no phenotype(可活无表型)。

Q10:致死基因为什么没有成年表型?
A:发育致死基因活不到成年——数据空窗是必然;胚胎表型(Embryo 集合)与外链早期致死数据(DR24 起链 Tremblay 组)补位。

Q11:IMPC 和 MGI 什么关系?
A:MGI 是全小鼠知识库(聚合文献与资源),IMPC 自产标准化数据并喂给 MGI——「自产不聚合」是 IMPC 的定位。

Q12:怎么拿全部数据做挖掘?
A:FTP 全量下载(GB 级)——API 逐基因拉全库不现实;下载后自建三值矩阵(§4.3)。

Q13:性别维度数据可用吗?
A:DR24 强化性别特异 MP 注释——「只在雄/雌显著」的调用显式可查;跨期分析注意早期数据性别记录密度较低。

Q14:可以在文章里只写「IMPC 敲除小鼠」吗?
A:不合格——需完整等位基因符号(如 tm1d/tm1e/CRISPR 形态)+ MGI ID + DR 版本;品系引用规范见官方 Citing 页。

Q15:IMPC 数据进商业产品合法吗?
A:合法——CC-BY 4.0 允许商用;署名+许可声明随行;品系相关商业实验另查 MTA 商业条款。

Q16:怎么确认一个 MP 调用的强度?
A:看效应量与参数定义(不只 P 值)——边缘显著调用回原始测量看分布重叠;多参数同方向的一致性加权重。

Q17:多中心生产的基因数据可信吗?
A:可信且更好——同协议下多中心方向一致性是天然稳健性检查;单中心驱动的调用做敏感性标注。

Q18:IMPC 与 DepMap 的必要性数据怎么合用?
A:互补——DepMap 是细胞层必需性、IMPC 是个体层;「细胞致死→个体致死」光谱的两端对齐后用于靶点安全扫描。

Q19:MP↔HPO 映射在哪拿?
A:经 Monarch Initiative 与官方映射资源——映射版本入档;映射在常见临床表型处密、罕见表型处稀疏。

Q20:胚胎致死基因怎么研究其功能?
A:用 Embryo Development 集合的分期表型+条件性敲除(tm1c 系做组织/时间特异)——全敲致死不等于功能不可研究。

Q21:IMPC 能预测药物靶点的疗效吗?
A:部分——「viable with no phenotype」提示单靶可能无效(冗余/补偿);「viable with phenotype」提示可成药且表型面已知——疗效仍需药理学验证。

Q22:统计调用用的什么方法?
A:OpenStats 集中管线(线性混合模型类框架)——同协议同期野生型为参照;方法细节见 IMPReSS/OpenStats 文档。

Q23:老年表型数据有吗?
A:有——Late Adult 集合覆盖老年期延伸检测;注意老年期的存活偏差(弱个体先死亡)。

Q24:IMPC 支持哪些疾病域的模型?
A:>1,400 候选模型跨代谢/神经/感官/免疫/发育等域——官方主题论文含 hearing/metabolic/essential genes 等专题。

Q25:品系到货后要验证吗?
A:要——本地基因分型+关键表型复现是发表前义务;运输/繁殖的遗传漂变与污染历史上有案例。

Q26:中国团队怎么引用 IMPC?
A:门户论文(NAR 2026)+ DR 版本+(如用主题成果)主题论文——CC-BY 署名即可;中文团队常见遗漏是 DR 版本戳。

Q27:怎么跟 GWAS 结果联用?
A:GWAS 基因→IMPC 调用→表型与 GWAS 性状对齐(经 HPO/EFO)——关联证据与因果证据的合并(Open Targets 式)。

Q28:AI 模型用 IMPC 训练要标注什么?
A:DR 版本+三值语义+掩码规则+等位基因元数据——阴性编码方式是可复现性的最大变量(§7.9 消融)。

Q29:影像数据(病理/胚胎)怎么获取?
A:经门户影像查看器与集合下载——体量大于参数数据,按集合分批;Embryo Viewer 支持交互浏览。

Q30:IMPC 覆盖了全部小鼠基因吗?
A:未完成——DR24 为 9,605/约 2 万蛋白编码基因;生产持续(CRISPR 提速);必要性高的基因覆盖受限于致死。

Q31:可以做时间序列或寿命研究吗?
A:可做横断面老年对比(Late Adult)——全寿命纵向监测非 IMPC 定位;寿命研究另有专门队列资源。

Q32:IMPC 数据的 QC 怎么做的?
A:PhenoDCC 数据协调中心统一质控+分子确认(等位基因结构验证)——2013 年起系统化的品系质检记录可查。

Q33:怎么找「和我的患者表型最像」的小鼠?
A:患者 HPO → MP 映射 → 三值矩阵相似度(掩码内)或 Monarch/Exomiser 工具——反向模型发现的标准路径。

Q34:联盟有哪些中心?
A:21 机构/15 国——Sanger MGP(英)/Harwell(英)/JAX 与 BCM(美)/EMMA 网络(欧)等;基因页标生产中心。

Q35:资金从哪来?
A:4 个国家资助者+机构投入——NIH KOMP2/Wellcome Trust/EU INFRAFRONTIER 等;联盟官网 Funding 页有全表。

Q36:IMPC 未来会怎么演进?
A:官方信号——全基因覆盖持续推进、DR24 起机器可读性与 KG 增强、性别注释精细化;「每基因都有标准表型」的终局目标不变。

§10.5 要点回顾

  1. 定位:哺乳动物基因功能目录——自产标准化数据、不聚合文献。
  2. 规模双口径:1.38 亿测量 vs 111,664 调用——差三个量级分清引用。
  3. 等位基因先读:tm1a-e/VelociGene/CRISPR 结构决定表型含义。
  4. 三值语义:1/-1/0——阴性≠缺失,覆盖表派生。
  5. 版本四元组:DR 版+协议版+等位基因+中心——解读最小上下文。
  6. 跨版本不直比:管线改进非超集——DR23→DR24 教训。
  7. 证据分级:小鼠表型=辅助证据——不越级到人类因果。
  8. 性别分层:DR24 注释强化——合并统计稀释二态。
  9. 数据开放×品系受控:CC-BY 与 MTA 双轨——边界清晰。
  10. 经典复现校准:Lepr/Tyr 盲复现——管线有效性的端到端证据。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 项目身份:2011 成立/21 机构/15 国/4 国家资助者/C57BL/6N 背景/全蛋白编码基因目标 = NAR 2026 论文(10.1093/nar/gkaf1148, PMID 41231752)+ 官网
  • DR24(2026-03-16):>1.38 亿数据点/9,605 基因/10,341 品系/111,664 显著调用/新增 ~450 万数据点 = 官网首页 + DR24 发布公告(mousephenotype.org?p=57371)
  • DR23.0(2025):>1 亿数据点/9,277 基因/113,803 显著表型 = NAR 2026 论文(跨版本差异为管线改进——性别特异注释等,DR24 发布说明)
  • 1,400 疾病候选模型/>100 验证罕见病关联/8,000+ 论文依赖 = NAR 2026 论文

  • 数据整合进 MGI/Open Targets/UniProt = NAR 2026 论文
  • FAIR:MGI+HGNC 持久 ID/MP+HPO 本体/CC-BY 4.0/门户+API+FTP+KG = NAR 2026 论文 + 官网
  • 必要性五分类 = NAR 2026 论文
  • IMPReSS 16 类别协议/OpenStats 统计 = NAR 2026 论文 + 官网
  • DR24 亮点:机器可读性/性别注释改进/外链 Tremblay 组(University of Victoria)早致死数据 = DR24 发布公告
  • Knockout-first 设计(tm1a/b/c/d/e;Skarnes 2011 Nature 474:337-342;Pettitt 2009)= 官网 allele design 页 + Targeting Strategies 页
  • VelociGene 整码删除(Valenzuela 2003 Nat Biotechnol 21:652-659)= 官网 allele design 页
  • CRISPR 策略(单切/双切/按需)= 官网 allele design 页
  • EUCOMM/KOMP-CSD ES 库 12,350 基因=56% CCDS(2013 时点)= Mammalian Genome 2013(10.1007/s00335-013-9467-x)
  • Sanger MGP 2006 成立/年产 200 品系 = Mammalian Genome 2013 转述 Ayadi 2012
  • EMMA >4,800 IKMC/IMPC 品系存档/Allele Conversion Service/EUCOMMTOOLS 200+ Cre drivers/EUCOMM MTA 不可协商 = INFRAFRONTIER EMMA 页
  • 合作:3i(~550 WTSI 品系免疫表型)/Kids First/UDN(Exomiser)/Genomics England 100K→1M genomes/Monarch = 官网 Collaborations 区
  • 云原生门户重建+KG+API 培训材料 = NAR 2026 论文
  • Database Commons 收录:year founded 2014(portal 口径)/v24.0/2026-03-16 更新 = NGDC Database Commons id 8574

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • alphamissense — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • ckb — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • uk-biobank — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • all-of-us — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • sra — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • ctd — 共享标签:基因组学与多组学 / 公共卫生与流行病学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集