信息速览
IMPC — 国际小鼠表型联盟 AI-Ready Wikipedia
INFOBOX
| 项目 | 内容 |
|---|---|
| 全名 | International Mouse Phenotyping Consortium(国际小鼠表型联盟) |
| 成立 | 2011 年(21 机构 / 15 国 / 4 国家资助者;前身 IKMC) |
| 目标 | 小鼠全部蛋白编码基因的敲除+系统表型——哺乳动物基因功能目录 |
| 遗传背景 | 纯 C57BL/6N 近交系 |
| 当前版本 | Data Release 24(2026-03-16):1.38 亿数据点 |
| 规模(DR24) | 9,605 基因 / 10,341 品系 / 111,664 显著表型调用 |
| 表型标准 | IMPReSS 协议(16 类别)+ OpenStats 统计管线 |
| 疾病转化 | >1,400 人类疾病候选模型;>100 验证罕见病基因关联 |
| 标识与本位 | MGI/HGNC 持久 ID + MP/HPO 本体(FAIR) |
| 许可 | CC-BY 4.0(门户/API/FTP/KG);品系经 EMMA/KOMP(MTA) |
| 官方入口 | https://www.mousephenotype.org |
| 本库条目 | order 481 · record_id 581 · 类别:基因组学与多组学 × 公共卫生与流行病学 |
§0 E-E-A-T 信任声明与免责声明
- 经验:本条目基于 IMPC 官网(DR24 公告/allele design 页/数据集合页)、NAR 2026 门户论文(Wilson 等,gkaf1148)、INFRAFRONTIER/EMMA 品系页与 Mammalian Genome 2013 等位基因表征论文;数字全部标注发布版本。
- 专业性:敲除策略(tm1a-e/VelociGene/CRISPR)的解读依据 Skarnes 2011 Nature 与 IMPC 官方文档;统计管线描述依据 OpenStats/IMPReSS 官方口径。
- 权威性:IMPC 由 15 国资助机构共同治理;本条目为第三方百科解读,不替代官方文档与 IMPReSS 协议原文。
- 可信度:文内数字进入文末「口径存照」;DR23 与 DR24 口径差异(分析管线改进)已显式标注。
- 免责:小鼠表型不直接等于人类疾病结论——人转译需 HPO/MP 映射与临床验证;使用 IMPC 数据发表需按官方引用规范。
- 时效:口径锁定 2026-09-19/20(DR24 发布后);下一次发布以官网为准。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:全球联盟把小鼠每个蛋白编码基因挨个敲掉、按同一套标准体检——产出哺乳动物基因功能的统一目录。
- 多大:DR24(2026-03)9,605 基因、10,341 品系、1.38 亿数据点、111,664 个显著表型。
- 为什么重要:>1,400 个人类疾病候选模型、>100 个验证的罕见病基因关联——罕见病诊断的最后一块拼图常常在这里。
- 怎么用:CC-BY 4.0 全开放——网页查单基因、API/FTP 拉全量、知识图谱做推理。
- 一句话:如果你的基因没人研究过,IMPC 大概率是第一个告诉你「敲掉它会怎样」的地方。
§1.1 摘要
IMPC(International Mouse Phenotyping Consortium)是 2011 年成立的全球合作计划,目前包含 21 个研究机构、15 个国家与 4 个国家资助者。它的使命极其明确:在小鼠(Mus musculus)上,把每一个蛋白编码基因做敲除,然后按标准化协议系统表型——在纯 C57BL/6N 近交系背景下构建「哺乳动物基因功能目录」。
生产端建立在 IKMC(国际敲除小鼠联盟)的资源之上:EUCOMM(欧洲)与 KOMP(美国)的 ES 细胞打靶库(knockout-first tm1a 等位基因及其衍生)、Regeneron 的 VelociGene 整码删除、以及近年主力 CRISPR/Cas9 的小缺失与大片段删除策略。表型端由 IMPReSS(International Mouse Phenotyping Resource of Standardised Screens)统一——16 个类别的标准化检测(解剖、临床化学、行为、心血管、代谢、免疫、视听、 ageing 等),突变体与野生型同协议同中心测试,统计调用经 OpenStats 集中管线产出。
数据端以半年至年度节奏发布:DR24(2026-03-16)含 1.38 亿数据点、9,605 个已表型基因、10,341 个突变品系与 111,664 个显著表型调用。项目累计产出超过 1,400 个人类疾病候选小鼠模型(复现患者表型)、超过 100 个经确认的罕见病基因-疾病关联;8,000 余篇论文依赖其数据或试剂。
数据的 FAIR 化程度极高:基因标识符复用 MGI 与 HGNC 持久 ID,表型术语采用 MP(哺乳动物表型本体)与 HPO(人类表型本体)——跨物种表型对比(Monarch Initiative 生态)与罕见病诊断工具(Exomiser/UDN)因此可以直接消费。许可为 CC-BY 4.0,访问通道包括云原生重建的 Web 门户、REST API、FTP 批量下载与知识图谱。
基因必要性(essentiality)是 IMPC 的标志性分析维度:把基因按纯合敲除后果分为五类(细胞致死/发育致死/亚存活/可活有表型/可活无表型)——这套分类与人类疾病基因分类对齐,直接服务于「未被研究的基因里哪些值得优先研究」的全球排序。
§1.2 战略价值
- 基因功能注释的最终基准:RNA 表达、蛋白互作、共表达网络都是间接证据——纯合敲除的全身表型是基因功能的「金标准对照实验」;IMPC 把这个金标准工业化了。
- 罕见病诊断的系统性补位:人类罕见病外显子组测序的最大痛点是「变异致病性证据不足」——IMPC 敲除表型(经 HPO 对齐)提供跨物种证据;UDN 用 Exomiser 消费 IMPC 数据辅助确诊是制度化案例。
- 药物靶点安全性的前置扫描:敲除致死/亚存活的基因是靶点选择的安全红线(人药靶点敲除小鼠 viable 才有开发空间);「viable with no phenotype」则提示单靶点可能无效——靶点评估的两端都依赖这套数据。
- 未被研究基因的公平曝光:IMPC 优先策略明确瞄准 under-studied genes——文献偏置的基因宇宙被系统性校正;这是「不可而知」变「可知」的工程化。
- 多中心标准化的方法论样板:21 机构用同一套协议/统计管线/质控——「全球分工+统一标准」在实验生物学里的最大规模实践;任何多中心生物数据项目都值得抄这套治理。
§1.3 同类数据集横向对比
| 维度 | IMPC | MGI | Sanger MGP 门户 | GTEx |
|---|---|---|---|---|
| 对象 | 敲除品系统一表型 | 全小鼠遗传资源整合 | Sanger 产品系(MGP) | 人组织表达 |
| 性质 | 实验数据(自产) | 知识库(聚合文献) | 实验数据(IMPC 子集源) | 实验数据(自产) |
| 协议 | IMPReSS 16 类 | 不适用(聚合) | 同 IMPReSS 系 | RNA-seq/组织学 |
| 统计 | OpenStats 集中 | 不适用 | 同源管线 | 标准化 pipeline |
| 许可 | CC-BY 4.0 | 混合 | 开放 | 开放 |
| 与人类疾病 | MP↔HPO 映射 | 全景整合 | 同 IMPC | eQTL/GTEx sQTL |
- IMPC 与 MGI 的分工:MGI 聚合全部文献知识(含 IMPC),IMPC 自产标准化数据——「自产数据不聚合文献」是 IMPC 官方强调的差异点(官网原文:We generate our own data, it is not aggregated from publications)。
- 与 Sanger MGP 的关系:MGP(2006 起)是 IMPC 最大的生产引擎之一,其门户数据是 IMPC 的来源子集——用 Sanger 门户与用 IMPC 门户的口径差异在「多中心合并 vs 单中心全量」。
- 与 GWAS/eQTL 资源的互补:观察性人类遗传学(GWAS)发现关联、IMPC 提供因果性实验验证——两端的证据链在 Open Targets 里合并(IMPC 是其数据源)。
§1.4 版本时间轴
| 年份 | 事件 | 意义 |
|---|---|---|
| 2006 | Sanger MGP 成立 | 年产 200 品系的生产引擎 |
| 2007-2011 | IKMC 时代(EUCOMM/KOMP/NorCOMM) | ES 细胞打靶库铺底(12,350 基因=56% CCDS,2013 时点) |
| 2011 | IMPC 成立 | 多中心表型联盟成型 |
| 2013 | EUCOMM/KOMP-CSD 等位基因分子表征 | 品系质量系统核查的起点 |
| 2015 | IMPC 主论文(Nature Genetics) | 目录首批成果发布 |
| 2025-11 | NAR 门户论文(DR23.0 口径) | 云原生门户重建 + KG |
| 2026-03-16 | DR24 发布 | 1.38 亿数据点 / 9,605 基因 / 111,664 调用 |
§1.5 应用场景矩阵
| 场景 | 用哪个数据面 | 关键操作 | 适配度 |
|---|---|---|---|
| 单基因功能查询 | 门户基因页 | 表型列表/测量图/生存曲线 | ★★★★★ |
| 罕见病变异致病性佐证 | MP↔HPO 映射 | Exomiser/门户疾病模型页 | ★★★★★ |
| 靶点安全性扫描 | 必要性五分类 | lethal/subviable 过滤 | ★★★★☆ |
| 全基因组表型关联挖掘 | API/FTP 全量 | 基因×MP 矩阵统计 | ★★★★☆ |
| 性别二态性研究 | 性别特异调用 | DR24 性别注释层 | ★★★★☆ |
| 胚胎发育致死分析 | Embryo Development 集合 | 胚胎分期表型 | ★★★☆☆ |
| 老年表型(late adult) | Late Adult 集合 | 年龄分层对比 | ★★★☆☆ |
| 组织病理深表型 | Histopathology 集合 | 影像+参数 | ★★★☆☆ |
§1.6 组件全景
- Web 门户(云原生):基因页(表型列表/Measurement Chart 交互图/存活数据)/ 疾病模型页 / 数据集合页——可用性研究后重建的 UI。
- REST API:大规模程序化访问(官方培训材料含大规模 API 使用教程)——全量挖掘的正道。
- FTP 下载:全量数据文件(基因表/表型调用/参数测量)——离线分析的数据底座。
- 知识图谱(KG):IMPC 数据的图形态——链接推理与跨资源合并的语义层。
- IMPReSS:标准化协议库——每个检测的 SOP(含参数定义/仪器/流程);16 类别的权威文档。
- OpenStats:集中统计管线——线性混合模型等框架;显著性调用的产出机器。
- PhenoDCC:数据协调中心(Data Coordination Centre)工具链——多中心数据的收集/质控/汇总。
- GenTaR:基因-表型-资源关联工具;Embryo Viewer:胚胎表型影像查看器。
- 数据集合(Collections):Late Adult / Histopathology / Essential genes / Embryo Development / Cardiovascular——按专题打包的数据面。
- 品系获取:EMMA(INFRAFRONTIER,>4,800 IKMC/IMPC 品系存档)/ KOMP Repository——MTA 条款下的活体/冷冻资源;Allele Conversion Service(tm1a→tm1c 等转换)。
§1.7 大科学工程的方法学经济学
IMPC 是实验生物学里最接近「工业流水线」的项目,其经济学值得拆解:
- 分工的边际成本递减:21 中心分摊生产(品系制作+表型跑批)——每个品系的边际成本随标准化程度下降;IMPReSS 的存在本质是「把方法学固定成本摊到全联盟」。
- 基因优先的算法治理:不按文献热度而按算法排序(近期聚焦 under-studied genes)——把「研究经费的市场失灵」用工程方法校正;这是科学社会学层面的实验。
- 一次产出全生态复用:一个品系的表型数据同时喂给 MGI/Open Targets/UniProt/Monarch/Exomiser——「生产一次、消费多处」的杠杆率在生物资源里最高档。
- 数据与资源的双轨开放:数据 CC-BY 4.0 零门槛;品系(活体资产)经 MTA——「信息开放+实物受控」的双轨制平衡了扩散与可持续。
- 8,000 篇论文的引用经济学:官方门户论文(NAR 2026)记录 8,000+ 论文依赖 IMPC——平均每篇 IMPC 数据支持的论文成本远低于各自为政的小规模实验;大科学的规模效应在此有定量体现。
§1.8 IMPC 在基因功能研究流程中的定位
基因功能证据链(从序列到疾病)
基因组注释(HGNC/Ensembl)
→ 表达证据(GTEx/HPA:在哪里表达)
→ 关联证据(GWAS/OMIM:与什么性状关联)
→ 因果实验(IMPC:敲掉后全身表型怎样)← 本条目
→ 机制研究(二次定制实验)
→ 疾病模型确认(人类表型对齐:MP↔HPO)
→ 诊断应用(Exomiser/UDN:变异致病性佐证)
→ 靶点决策(Open Targets:整合打分)
- IMPC 的证据地位:关联证据链的「实验因果端」——GWAS 的 lead variant 落在基因 X 上,「敲掉 X 小鼠出现对应表型」是诊断与靶点决策都能消费的强证据。
- 上游下游的接口:上游用 HGNC/MGI ID 对齐(与 hgnc 条目联动);下游经 HPO/MP 对齐(与罕见病诊断生态联动)——IMPC 的 FAIR 设计使其天然处于证据链的枢纽位。
§1.9 独特视角:负面结果的数据库
IMPC 有一个被低估的性质:它同时是最大的「敲了没表型」数据库。
- viable with no phenotype 的信息量:敲除后「没表型」同样是数据——它约束了「该基因在标准检测下功能冗余/条件特异/补偿充分」的假设空间;文献只发表阳性结果,IMPC 的阴性调用是独一无二的系统性负结果库。
- 对 AI 建模的价值:基因-表型矩阵的零值(无调用)不是缺失而是「测过且阴性」——把 IMPC 矩阵当稠密标签学习时,阴性样本防止模型把「没证据」当「无功能」;这是与文献挖掘数据集的本质差异。
- 冗余与补偿的研究入口:单敲无表型 ≠ 基因无用——家族冗余(paralog compensation)假设可从 IMPC 阴性基因的家族聚类系统性生成;阴性数据是假设生成器。
- 为什么这个视角重要:用 IMPC 做靶点筛选的团队如果只拿「有表型」基因,等于把「安全但可能无效」的一半信息扔掉了——完整五分类+阴性调用的消费方式才是全谱利用。
§2 医学与科学背景
§2.2 为什么用小鼠做全基因敲除
- 哺乳动物模型的最优性价比:小鼠是可用高通量遗传操作的最小哺乳动物——生理/解剖/代谢与人类的保守性足够(约 70% 人类基因有单一小鼠直系同源),成本/世代时间可控。
- 近交系的标准化红利:C57BL/6N 近交系消除遗传背景噪声——任何表型差异都可归因于敲除;这是「工业级表型」的前提(远交群做不到)。
- 与人类疾病的语义桥:MP 与 HPO 的映射成熟——小鼠表型可以翻译成人类表型语言;这是斑马鱼/果蝇难以完全替代的转化距离。
- C57BL/6N 的特定注意:N 亚系与 C57BL/6J 有 Nnt 基因差异等已知位点——跨研究对比时注意亚系;IMPC 全库统一 6N 反而是其内部一致性的优势。
§2.2 敲除等位基因的遗传学语义
- critical exon 原则:靶向所有转录变体共有的关键外显子——删除后必然移码/破坏功能;「敲除」的定义由等位基因结构决定而非基因名。
- knockout-first 家族(tm1a-e):tm1a(诱捕盒破坏基因+报告表达)→Flp→tm1c(条件性恢复)→Cre→tm1d(移码 null);tm1a→Cre→tm1b(报告标签 null);tm1e(丢失 3’ loxP 的非条件靶向)——同一 ES 克隆可衍生报告/条件/null 三用途。
- VelociGene 整码删除:删除全部蛋白编码序列的完全 null——对任何 Pol II 转录基因适用;不依赖 critical exon 选择。
- CRISPR 时代:单切小缺失/双切外显子删除为主力;按需定制(条件性 loxP、点突变)补充——生产速度大幅提升但每品系的分子表征仍必要(脱靶与嵌合体历史教训)。
- 解读纪律:tm1a 残留盒的顺式效应(邻近基因干扰)、tm1e 不可条件化、CRISPR 品系的分子确认——等位基因类型是表型解读的第一变量(§6.5 坑点 2)。
§2.3 基因必要性五分类
- 五分类定义:cellular lethal(细胞水平不可存活)/ developmentally lethal(发育期致死)/ subviable(亚存活,部分个体存活)/ viable with phenotype(可活有表型)/ viable with no phenotype(可活无表型)——按纯合敲除后果排序的功能受限光谱。
- 与人类疾病的对齐:必要性分类与人类疾病基因分类对齐——developmentally lethal 对应发育性罕见病、viable with phenotype 对应可活的单基因病谱;「未与孟德尔病关联的必要性基因」是新的候选疾病基因池。
- 与细胞 Essential 基因集的互补:细胞系 CRISPR 筛选(DepMap 等)发现细胞致死基因——与 IMPC 的个体水平分类合并给出「细胞必需→个体必需」的光谱;LoF 不容忍度(pLI 类指标)与小鼠表型的交叉验证框架已建立。
- 分析含义:亚存活与致死基因的成年表型天然缺失——必要性分类本身是数据覆盖的先验(§4.6 完整性清单的逻辑)。
§2.4 IMPReSS 协议的标准化语义
- 16 类别的覆盖:解剖形态学/临床化学/血液学/行为/神经/心血管/呼吸/代谢/感官(视听)/免疫/骨/能量/生殖/embryology/ageing/histopathology——同一 SOP 跨 21 中心执行。
- 参数级标准化:每个检测细化到参数(测量项)——统计调用在「参数×性别×品系」粒度;参数的元数据(仪器/单位/年龄窗)随 IMPReSS 版本管理。
- 性别与生命阶段分层:DR24 强化性别特异参数的 MP 注释——「同一程序不同性别不同调用」的精细度是联盟级卖点。
- 协议版本的演化:IMPReSS 协议升级(新增检测/参数修订)跨版本数据对比要查协议版本戳——表型调用的可比性以协议一致为前提。
§2.5 统计管线的语义(OpenStats)
- 集中统计的必要性:21 中心各自统计会有 21 种 P 值口径——OpenStats 统一框架(线性混合模型等)保证调用的跨中心可比。
- 参照系的设计:同期同中心野生型做参照——环境批次效应在同协议内被控制;跨中心的表型强度对比仍需谨慎(中心效应)。
- 多重比较与效应量:全基因组规模的表型检测意味着海量检验——显著调用附效应方向与幅度;只筛 P 值不看效应量是常见误用。
- 版本演化的影响:DR23 的 113,803 调用 → DR24 的 111,664 调用——总数下降源于管线改进(性别注释更精确等);「调用数变化=生物学变化」是误读(§6.5 坑点 6)。
§2.6 表型本体的跨物种语义(MP↔HPO)
- MP 本体:哺乳动物表型本体——IMPC 调用的原生术语;层级化(表型大类→细表型)。
- HPO 对齐:人类表型本体与 MP 的映射——小鼠表型翻译成人类表型语言;映射质量决定转译置信度。
- Monarch 生态:跨物种表型计算推理(Monarch Initiative)——用相似度算法在物种间找模型;IMPC 是其核心数据源。
- Exomiser 的落地:变 prioritization 工具把人类变异×IMPC/模型生物表型合并打分——UDN(未确诊疾病网络)的制度化使用;「小鼠表型佐证人类变异」的诊断路径的工业化。
§2.7 罕见病诊断的 IMPC 证据链
- 诊断困境的补位逻辑:新发变异(VUS)的致病性判定缺少功能证据——对应基因的 IMPC 敲除表型若复现患者表型(经 HPO 对齐),即为跨物种 PMID 级佐证。
- >100 个验证关联的来源:IMPC 数据支撑的罕见病基因确认(NAR 论文口径)——从「小鼠有表型」到「人类病确认」的完整案例池;包括听觉/代谢/神经等域。
- 疾病模型页的用法:门户 Disease Models 区列出 >1,400 候选模型——「患者表型 → 找模型小鼠」的反向查询路径。
- 证据的边界:表型复现是佐证不是证明——人类确认仍需患者队列/功能实验;IMPC 证据在 ACMG/AMP 变异分类框架里是辅助证据类。
§2.8 性别二态性的系统层证据
- DR24 的性别注释强化:性别特异参数的 MP 注释改进——「只在雄性显著」「只在雌性显著」的调用被显式标注。
- 为什么重要:药物反应/代谢/行为的性别差异是临床现实——小鼠表型的性别维度被系统性记录后,靶点与疾病模型的性别设计有了数据底座。
- 方法论含义:合并性别的统计会稀释性别特异效应——IMPC 的性别分层管线是「默认分层、事后合并」的姿势示范。
- 应用:性别二态基因清单(官方主题论文)可直接用于流行病学与临床试验设计的性别分层假设。
§2.9 老年表型与寿命的语义扩展
- Late Adult 集合:老年小鼠的系统表型(27 周以上延伸检测)——常规筛查(~9-15 周)看不到的迟发表型。
- Ageing 研究的杠杆:人类衰老相关疾病(神经退行/代谢/肌骨)的模型假设——老年表型数据是全生命周期功能目录的补全。
- 迟发表型的统计挑战:老年期存活偏差(弱个体已死亡)——late adult 分析的生存偏差处理是解读要点。
- 与必要性的联动:发育致死基因没有老年数据——必要性强相关的「数据空窗」按先验补位(胚胎数据集合)。
§3 数据集规格
§3.1 规格总表
| 属性 | 规格 |
|---|---|
| 名称 | IMPC(International Mouse Phenotyping Consortium) |
| 治理 | 21 机构 / 15 国 / 4 国家资助者;DCC 协调 |
| 目标 | 全部小鼠蛋白编码基因敲除+系统表型(C57BL/6N) |
| 当前版本 | Data Release 24(2026-03-16) |
| 规模(DR24) | 1.38 亿数据点 / 9,605 基因 / 10,341 品系 / 111,664 调用 |
| 表型协议 | IMPReSS(16 类别;参数级标准化) |
| 统计管线 | OpenStats(集中式;性别分层) |
| 等位基因 | tm1a-e(ES 打靶)/ VelociGene / CRISPR/Cas9 |
| 疾病转化 | >1,400 疾病候选模型 / >100 验证罕见病关联 |
| 标识/本体 | MGI+HGNC / MP+HPO(FAIR) |
| 许可 | CC-BY 4.0(门户/API/FTP/KG) |
| 品系获取 | EMMA / KOMP Repository(MTA)+ 转换服务 |
§3.2 数据发布口径的地图
- DR 节奏:半年至年度发布(DR23.0 2025 → DR24 2026-03)——每次发布含新增品系/数据点与管线改进。
- 跨版本的不可直比:DR23 的 113,803 调用 vs DR24 的 111,664——管线改进(性别注释)使调用集不是超集关系;跨版本研究固定单一版本或逐版本重算。
- 数据点的粒度:1.38 亿数据点=原始测量级;111,664 调用=统计显著级——「规模」引用要分清两个口径(差三个数量级)。
- 机器可读性改进:DR24 数据报告为机器可读性优化——API/脚本的解析逻辑随版本更新,老脚本要回归测试。
- 外链数据:DR24 起外链 Tremblay 组(University of Victoria)早期致死表型——IMPC 之外的补位数据要按外源口径引用。
§3.3 DAIMS 数据AI就绪度评估
| # | 维度 | 指标 | 评分(1-5) | 依据 |
|---|---|---|---|---|
| 1 | A 可获得 | 免费获取 | 5 | CC-BY 4.0 全通道开放 |
| 2 | A 可获得 | 获取流程 | 5 | 门户/API/FTP/批量查询多轨 |
| 3 | A 可获得 | 分发格式 | 4 | API JSON/FTP 文件;KG 补位 |
| 4 | A 可获得 | 历史版本回溯 | 4 | 发布版本可溯;旧版全量存档粒度一般 |
| 5 | D 文档 | 官方文档 | 5 | IMPReSS 协议/门户帮助/培训材料 |
| 6 | D 文档 | 方法透明度 | 5 | 协议+统计管线+allele design 全公开 |
| 7 | D 文档 | 引用规范 | 5 | 官方引用页+论文口径清晰 |
| 8 | I 互操作 | 标识符 FAIR | 5 | MGI/HGNC 持久 ID |
| 9 | I 互操作 | 本体对齐 | 5 | MP↔HPO 映射;Monarch 生态 |
| 10 | I 互操作 | 跨资源整合 | 5 | MGI/Open Targets/UniProt 消费 |
| 11 | M 元数据 | 参数元数据 | 5 | IMPReSS 参数级元数据 |
| 12 | M 元数据 | 版本元数据 | 4 | DR 版本戳;协议版本联动待加强 |
| 13 | S 可持续 | 治理机制 | 5 | 15 国资助+DCC;十余年连续 |
| 14 | S 可持续 | 资源持续供给 | 5 | 品系存档(EMMA)+持续生产 |
综合 61/70(4.4/5)——互操作与文档的满分级选手;在「模式生物」类别里是 FAIR 化的天花板(与 ENCODE 同档)。
§3.4 存储与计算需求
- 全量数据:1.38 亿数据点的 FTP 全量在 GB 级——PostgreSQL/Parquet 单机全装;调用表(11 万行)极轻。
- API 拉取策略:单基因查询走门户/API;全基因组挖掘走 FTP——API 逐基因拉全库会浪费配额与时间。
- 表型矩阵内存:9,605 基因 × MP 术语(数百)的二元矩阵百 MB 内——相似度/聚类全谱计算单机可行。
- 影像类资源:histopathology/embryo 影像的体量显著大于参数数据——深度学习用影像时按集合分批下载。
§3.5 获取通道
- Web 门户:基因页/疾病模型页/集合页——人工浏览与单基因查询。
- REST API:程序化访问(官方培训材料覆盖大规模 API 使用)——脚本化挖掘的主通道。
- FTP:全量数据文件批量下载——离线分析的底座。
- 批量查询:门户批量基因查询(基因列表→批量结果)——中等规模的交互式路径。
- 知识图谱:KG 形态——SPARQL/图查询的推理型消费。
- 品系资源:EMMA/KOMP Repository——MTA 订购活体/冷冻胚胎/精子;Allele Conversion Service 换等位基因形态。
§3.6 口径对齐表
| 数字 | 口径 A | 口径 B | 使用建议 |
|---|---|---|---|
| 数据点 | 1.38 亿(DR24 测量级) | 111,664(DR24 调用级) | 规模引用分清量级 |
| 基因数 | 9,605(DR24 已表型) | 12,350(IKMC ES 库 2013) | 资源库≠已表型 |
| 调用数 | 113,803(DR23.0) | 111,664(DR24) | 写明 DR 版本 |
| 品系数 | 10,341(DR24 突变品系) | >4,800(EMMA 存档) | 生产≠存档 |
| 疾病模型 | >1,400(候选) | >100(验证关联) | 候选≠确认 |
| 背景品系 | C57BL/6N(IMPC 统一) | C57BL/6J(他源数据) | 亚系差异注意 |
§3.7 版本选择纪律
- 新分析:直接用 DR24——除非需要与旧版结果衔接。
- 跨版本衔接:固定发布版本号入方法学;管线改进的调用集差异要显式声明(DR23→DR24 非超集)。
- 协议版本联动:IMPReSS 协议版本与 DR 版本双戳——表型对比的前提是协议一致。
- API 脚本的版本回归:DR24 机器可读性改进可能改变字段结构——升级后老脚本先跑金标回归。
- 外链数据的独立口径:Tremblay 早期致死等外链数据不随 DR 版本走——引用时独立标注其来源与版本。
§3.8 数据文件与字段详表
| 数据面 | 粒度 | 关键字段 |
|---|---|---|
| 基因表 | 每敲除基因一行 | mgi_id, symbol, allele_type, viability, essentiality_class, producing_center |
| 表型调用表 | 每显著调用一行 | mgi_id, mp_term, procedure, parameter, z_score/effect, sex, significance, release |
| 参数测量 | 每参数每动物 | mgi_id, procedure, parameter, value, sex, age_weeks, center, date |
| 存活数据 | 每品系 | homozygous_viability, heterozygous_viability, litter 统计 |
| 影像资源 | 每检查 | embryo/histopathology 影像 + 元数据 |
| KG | 图节点/边 | 基因-表型-疾病-资源链接 |
| IMPReSS | 协议文档 | procedure_id, parameter 定义, SOP, 版本 |
§4 数据结构
§4.1 对象模型
IMPC 数据模型(门户/FTP/API 视角)
├── Gene(MGI ID 主键;HGNC symbol 联动)
│ ├── allele(tm1a-e / VelociGene / CRISPR——结构+衍生关系)
│ ├── viability(纯合存活分类)
│ ├── essentiality(五分类)
│ └── producing_center(Sanger MGP/Harwell/JAX/BCM…)
├── Procedure/Parameter(IMPReSS 16 类别;参数级 SOP)
├── Measurement(动物级原始测量——1.38 亿点)
├── PhenotypeCall(统计显著调用——OpenStats;MP 术语+性别+效应)
├── OntologyLayer(MP 层级 ↔ HPO 映射)
└── Release 维度(DR 版本戳——跨版本分析的口径轴)
- 模型的两层统计结构:Measurement(原始)→ PhenotypeCall(统计结论)——分析用哪层是设计决策(调用层轻便、测量层灵活)。
- 本体层是语义外挂:MP/HPO 不在调用表内联而是经术语 ID 关联——跨物种对齐先装载本体映射表。
- 版本维度贯穿全模型:每个数据面都有 DR 版本——「版本四元组」(DR 版+协议版+等位基因型+中心)是表型解读的最小上下文。
§4.2 API 单基因查询
#!/usr/bin/env python3
"""IMPC API 单基因表型查询骨架(教学;正式端点以官方文档为准)。"""
import json, time, urllib.request
BASE = "https://api.mousephenotype.org" # 以官方文档确认的端点为准
def gene_phenotypes(mgi_or_symbol: str) -> dict:
"""基因的显著表型调用(MP 术语+统计)。"""
url = f"{BASE}/genes/{mgi_or_symbol}/phenotype-calls"
with urllib.request.urlopen(url, timeout=30) as r:
return json.load(r)
def gene_essentiality(mgi_or_symbol: str) -> dict:
"""必要性/存活分类与等位基因信息。"""
url = f"{BASE}/genes/{mgi_or_symbol}"
with urllib.request.urlopen(url, timeout=30) as r:
return json.load(r)
if __name__ == "__main__":
calls = gene_phenotypes("MGI:104779") # 示例基因
info = gene_essentiality("Brca1") # 符号亦可(按 API 约定)
for c in calls.get("results", [])[:5]:
print(c.get("mpTermName"), "|", c.get("sex"),
"|", c.get("statisticalMethod"))
time.sleep(0.2) # 礼貌限速
API 要点:(1) 正式端点/参数以官方 API 文档与 DR24 机器可读报告为准——本骨架是消费姿势示意;(2) 分页/限速遵循官方建议;(3) 调用附统计方法与性别——消费时保留这两个维度。
§4.3 FTP 全量装载与表型矩阵构建
#!/usr/bin/env python3
"""IMPC FTP 表型调用全量 → 基因×MP 二元矩阵(全谱挖掘底座)。
阴性调用(测过无调用)单独编码为 -1:阴性≠缺失(§1.9)。"""
import pandas as pd
def load_calls(ftp_dir: str) -> pd.DataFrame:
"""装载全量表型调用文件(DR24)。"""
return pd.read_csv(f"{ftps_dir}/phenotype_calls.csv", low_memory=False) \
if False else pd.read_csv(f"{ftp_dir}/phenotype_calls.csv",
low_memory=False)
def build_matrix(calls: pd.DataFrame,
tested: pd.DataFrame) -> pd.DataFrame:
"""基因×MP 矩阵:1=显著调用,-1=测过阴性,0=未测。
tested = 基因×MP 的「已检测」清单(FTP 测量覆盖表派生)。"""
pos = (calls.assign(v=1)
.pivot_table(index="mgi_id", columns="mp_term_id",
values="v", aggfunc="max"))
tested_set = set(map(tuple, tested[["mgi_id", "mp_term_id"]].values))
mat = pos.reindex(columns=sorted(set(calls.mp_term_id))).fillna(0)
for g, m in tested_set:
if mat.at.get((g, m)) is None or (g in mat.index and m in mat.columns
and mat.at[g, m] == 0):
if g in mat.index and m in mat.columns:
mat.at[g, m] = -1
return mat
if __name__ == "__main__":
# 三值语义:1 有表型 / -1 测过阴性 / 0 未测——
# 全谱相似度与 ML 消费必须区分三值,不能当普通 0/1 矩阵。
print("矩阵语义入档:三值编码写进方法学")
矩阵要点:(1) 三值语义(1/-1/0)是 IMPC 消费的核心纪律——「没调用」分「测过阴性」与「没测过」两种;(2) 阴性信息从「已检测覆盖」派生——FTP 的测量覆盖表/参数计数是来源;(3) 稠密矩阵的相似度(Jaccard/余弦)只应在「共同检测集」内计算——覆盖不对称会让相似度失真。
§4.4 必要性分类与靶点扫描
#!/usr/bin/env python3
"""靶点安全性前置扫描:候选靶点清单 × IMPC 必要性/存活/表型。
输出每个靶点的「可药性风险面」摘要。"""
import pandas as pd
def target_safety_scan(targets: list[str], genes: pd.DataFrame,
calls: pd.DataFrame) -> pd.DataFrame:
g = genes[genes.symbol.isin(targets)].set_index("symbol")
rows = []
for sym, r in g.iterrows():
vcalls = calls[(calls.mgi_id == r.mgi_id)
& (calls.viability_relevant | True)]
n_calls = len(vcalls)
cls = r.essentiality_class
risk = {"cellular lethal": "不可成药(细胞必需)",
"developmentally lethal": "发育毒性风险高",
"subviable": "部分致死风险",
"viable with phenotype": "可成药——表型面需评估",
"viable with no phenotype": "单靶疗效存疑"}.get(cls, "未知")
rows.append({"target": sym, "class": cls, "n_calls": n_calls,
"risk_note": risk})
return pd.DataFrame(rows)
if __name__ == "__main__":
print("纪律:扫描输出是「风险面摘要」不是「弃用清单」——")
print("subviable/lethal 基因亦有组织特异性条件敲除的成药路径")
扫描要点:(1) 五分类映射到「可药性风险面」是工程化转译——决策仍需机制层评估;(2) 全敲致死 ≠ 不可成药——条件性敲除(tm1c 系)支持组织特异药效假设;(3) 「viable with no phenotype」提示单靶点可能无效(冗余/补偿)——疗效风险与安全风险同样重要。
§4.5 元数据与可复现指纹
- 版本四元组:DR 版本 + IMPReSS 协议版本 + 等位基因类型 + 生产中心——任何表型结论的最小上下文。
- 品系指纹:MGI ID + 等位基因 MGI ID + 背景亚系(C57BL/6N)——品系级引用的精确形态;「Brca1 knockout」不等于一个品系(tm1a/tm1c/CRISPR 是不同实验)。
- 调用指纹:call 附统计方法/效应/性别/中心——复现分析时保留调用级完整字段。
- FTP 快照:下载日期 + 文件清单哈希——FTP 内容随版本滚动,快照自归档(与 VAERS 同纪律)。
§4.6 完整性清单
装载 DR 数据后的自查序列:
- 基因数与官方 DR 报告对账(DR24 应见 9,605/10,341/111,664 三数)。
- MGI ID 唯一性与 HGNC symbol 映射抽验(跨资源联动的前提)。
- 调用表的 MP 术语 ID 在 MP 本体当前版中的在场性——本体版本联动。
- 三值矩阵语义核查——「测过阴性」覆盖表与调用表的一致性抽验。
- 性别维度在场性——DR24 性别特异注释的调用比例抽验。
- 中心效应初查——同基因多中心生产的调用方向一致性抽验。
- 版本戳完整性——全部行含 DR 版本可追溯。
§4.7 数据血缘
IMPC 血缘(品系与数据从哪来)
IKMC 资源(EUCOMM/KOMP/NorCOMM ES 库 + CRISPR 设计)
→ 品系生产(21 中心分工;Sanger MGP/JAX/Harwell/BCM 等引擎)
→ 分子确认(基因分型/等位基因结构验证)
→ 标准表型(IMPReSS 16 类;同协议突变体 vs 同期野生型)
→ DCC 汇总与质控(PhenoDCC)
→ 集中统计(OpenStats → 显著调用)
→ 发布(DR 版本:门户/API/FTP/KG)
→ 生态消费(MGI/Open Targets/UniProt/Monarch/Exomiser)
→ 反馈(用户质询 → 中心复检 → 下一版修订)
- 血缘的核心节点是「分子确认→标准表型」的衔接:等位基因结构错误会让全部下游表型失义——2013 年 Mammalian Genome 的系统表征正是这个节点的质检记录。
- DCC 的枢纽地位:多中心数据的收集/质控/统计/发布集中化——「分布式生产、集中化统计」是数据一致性的制度保证。
- 血缘的工程落点:下游分析每个调用可回溯「品系→等位基因→中心→协议版本→统计版本」——争议数据的复检通道全程开放。
§4.8 与 Open Targets 的整合消费
#!/usr/bin/env python3
"""IMPC 证据在靶点打分语境的消费骨架:
IMPC 提供「动物模型」证据维(Open Targets 整合其数据),
自建管线可对齐 IMPC 调用与 GWAS/OMIM 基因集。"""
import pandas as pd
def impc_support(ot_targets: pd.DataFrame, calls: pd.DataFrame,
hpo_map: pd.DataFrame) -> pd.DataFrame:
"""给 Open Targets 式靶点清单附加 IMPC 证据列。
hpo_map: MP→HPO 映射表(Monarch/官方源)。"""
ev = []
for _, row in ot_targets.iterrows():
c = calls[calls.mgi_id == row.mgi_id]
human_pheno_terms = hpo_map[hpo_map.mp_term_id.isin(c.mp_term_id)]
ev.append({
"target": row.symbol,
"n_impc_calls": len(c),
"n_translated_phenos": human_pheno_terms.hpo_id.nunique(),
"sexual_dimorphic": c.sex.nunique() > 1
and c.groupby("sex").mp_term_id.nunique().nunique() > 1,
})
return pd.DataFrame(ev)
if __name__ == "__main__":
print("证据分级纪律:n_translated_phenos 是『经 HPO 映射的人类表型面』,")
print("与 GWAS 关联数并列时必须标注证据来源层级(动物模型 vs 人类遗传)")
整合要点:(1) Open Targets 把 IMPC 作为「动物疾病模型」证据维整合——自建打分时证据权重分层(人类遗传 > 动物模型 > 计算预测)要有显式系数;(2) MP→HPO 映射的质量(一对多/多对一)影响转译计数——映射版本入档;(3) 性别二态列是新维——DR24 的性别注释使其可计算。
§4.9 与品系资源库(EMMA/KOMP)的联动
数据 → 活体的联动路径
IMPC 门户(表型兴趣 → 找品系)
→ 品系页的存档指针(EMMA ID / KOMP ID)
→ MTA 条款确认(EUCOMM MTA 为不可协商条款——官方提醒)
→ 订购(活体/冷冻胚胎/精子;Allele Conversion Service 可转 tm1a→tm1c)
→ 到货后的本地验证(基因分型 + 关键表型复现)
→ 发表时的品系引用(完整等位基因符号 + 存档 ID)
- 数据与资源的 ID 衔接:门户品系页直接给出存档库 ID——「看到表型→拿到小鼠」的最短路径是设计出来的。
- MTA 的合规先行:EUCOMM 资源的 MTA 不可协商——订购前的条款确认是项目排期的一部分(不是物流问题)。
- 到货验证的必要性:运输/繁殖中的遗传漂变与污染历史上有案例——本地基因分型验证是发表前义务。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | IMPC 资产 | 配套资源 | 输出物 |
|---|---|---|---|
| 单基因功能解读 | 门户基因页/测量图 | HGNC/MGI 注释 | 基因功能简报 |
| 变异致病性佐证 | 调用+MP↔HPO | Exomiser/OMIM | 佐证报告 |
| 靶点安全扫描 | 五分类+调用 | Open Targets | 风险面清单 |
| 全谱表型相似度 | 三值矩阵 | MP 本体 | 基因聚类/模型发现 |
| 性别二态挖掘 | DR24 性别注释 | 性别差异文献 | 二态基因清单 |
| 胚胎致死分析 | Embryo 集合 | 发育本体 | 发育基因图谱 |
| 老年表型研究 | Late Adult 集合 | ageing 文献 | 迟发表型谱 |
| 跨物种模型发现 | MP/HPO 映射 | Monarch | 物种间表型对应 |
§5.2 单基因深度解读协议
- 五步读法:等位基因类型(结构是否破坏功能)→ 存活/必要性(数据覆盖先验)→ 调用清单(按 MP 大类分组)→ 测量图(效应方向与幅度)→ 性别分层(DR24 注释)。
- 调用与测量的交叉:显著调用的参数回到原始测量看分布重叠度——边缘显著(P 擦线+效应小)的调用降权。
- 中心与批次核查:多中心生产的基因做中心间方向一致性检查——单中心驱动的调用谨慎引用。
- 与文献对表:IMPC 阴性 vs 文献阳性(或反向)的处理——先查等位基因差异(null vs hypomorph)再下结论。
- 输出纪律:简报附「版本四元组」与阴性调用说明——「无表型」要写「测过阴性」还是「未测」。
§5.3 罕见病佐证协议
- 输入规范化:患者 HPO 术语集(标准编码)+ 候选基因变异清单。
- IMPC 侧检索:候选基因的调用经 MP→HPO 映射——与患者 HPO 的重叠打分(Exomiser 类算法的透明复现)。
- 证据分级:表型重叠数/特异性(罕见 MP 术语权重高)/一致性(多参数同方向)——三项合成佐证强度。
- 反例检查:必要性分类与已知疾病机制的一致性(发育致死基因对应发育表型是正向;成年发病疾病对应 viable 基因)。
- 输出定位:佐证是 ACMG/AMP 框架的辅助证据(动物模型类)——报告写明证据类别不越级。
§5.4 成本模型
| 成本项 | 计算研究 | 实验室研究 | 诊断团队 |
|---|---|---|---|
| 数据获取 | 免费(CC-BY) | 免费 | 免费 |
| 计算 | 单机可及 | 不适用 | 轻量 |
| 品系获取 | 不适用 | MTA+订购+繁殖(数月) | 不适用 |
| 本体对齐维护 | MP/HPO 版本跟踪 | 同左 | HPO 编码质量 |
| 人力 | 数据工程 1-2 人 | 胚胎/表型实验组 | 遗传咨询师+生信 |
- 计算端近乎零边际成本:数据与计算都是免费/单机——IMPC 挖掘是学界性价比最高的功能基因组入口之一。
- 实验端的真实成本在时间:品系订购到表型复现以月计——项目排期把 MTA/繁殖周期放进去(不是技术问题)。
- 诊断端的成本在编码质量:患者 HPO 术语编码质量决定佐证信号——遗传团队的 HPO 培训是隐性投入。
§5.5 失败模式清单
- 调用数当规模——1.38 亿测量 vs 11 万调用差三个量级;修复:口径分开引用。
- 跨 DR 版本直比——管线改进使调用集非超集;修复:固定版本或重算。
- 等位基因混淆——tm1a 顺式效应/tm1e 不可条件化/CRISPR 需分子确认;修复:等位基因类型先读。
- 阴性当缺失——三值语义(1/-1/0)混淆;修复:覆盖表派生阴性。
- MP-HPO 映射越级——小鼠表型佐证不等于人类因果;修复:证据分级标注。
- 中心效应忽略——多中心数据的批次差异;修复:方向一致性检查。
- 性别合并稀释——二态效应被合并统计抹掉;修复:默认分层。
- 品系引用不精确——「某基因敲除小鼠」歧义;修复:完整等位基因符号+存档 ID。
§5.6 校准与验证协议
自建 IMPC 分析管线的分级校准(L1-L6):
| 级别 | 校准内容 | 方法 | 通过标准 |
|---|---|---|---|
| L1 | 装载完整性 | §4.6 清单七项 | 全项通过 |
| L2 | ID 映射 | MGI↔HGNC↔Ensembl 抽验 100 条 | 零错误 |
| L3 | 本体对齐 | MP 术语在 MP 当前版在场;HPO 映射抽验 | 孤儿率 <0.5% |
| L4 | 已知信号复现 | 经典基因(如 Lepr 肥胖表型)盲复现 | 方向与调用一致 |
| L5 | 相似度合理性 | 已知同功能基因簇的矩阵相似度排序 | 生物学合理性抽验 |
| L6 | API/FTP 一致性 | 同基因 API 与 FTP 结果 diff | 零不一致 |
- L4 的经典基因集:Lepr(肥胖)、Tyr(白化)等教科书级表型——管线端到端正确性的直接证据。
- L5 的生物学合理性:计算结果与生物学直觉的一致性抽验——防止矩阵工程错误(覆盖不对称等)污染下游。
§6 实证结果与方法学分析
§6.1 十五年产出的实证观察
- 规模曲线:2011 起步 → DR23.0(2025)9,277 基因/1 亿数据点 → DR24(2026-03)9,605 基因/1.38 亿数据点——年产数百基因的稳定推进(CRISPR 时代提速)。
- 表型发现的密度:约 11 万显著调用/9,605 基因 ≈ 每基因平均 11-12 个显著表型——高通量筛查的发现密度远超单基因文献。
- 疾病转化的管道:>1,400 候选模型 → >100 验证关联——从候选到确认的转化率反映「小鼠表型→人类疾病」确认链的真实难度。
- 引用影响:8,000+ 论文依赖——IMPC 数据已成为功能基因组的基础设施级引用。
§6.2 多中心标准化的实证教训
- 协议统一的收益:IMPReSS 使 21 中心数据可合并统计——没有它,多中心表型的合并分析会被批次噪声淹没。
- 残余的中心效应:同协议下中心间仍有环境残差(饮食/设施/操作者)——调用层面的方向一致性检查是必须的敏感性分析。
- 统计集中的权衡:OpenStats 集中统计牺牲了中心级灵活性换全局可比——自建分析可以重算但要声明与官方调用的差异。
- 版本演化的代价管理:管线改进改变调用集(DR23→DR24)——「统计口径的版本化」是多中心项目的长期负债,IMPC 用版本戳+发布说明管理,值得同类项目抄。
§6.3 方法学三层框架(gsm)
- G(Governance):15 国资助治理 + DCC 协调 + CC-BY 许可——数据合法性与其品系 MTA 的双轨。
- S(Semantics):等位基因类型×存活分类×MP/HPO 本体——表型解读的语义三角;等位基因结构决定「敲除」的含义。
- M(Methodology):IMPReSS 协议+OpenStats 统计+版本纪律——从动物到调用的方法学链条;跳过任何一环的解读都失稳。
- 框架用法:评估任何 IMPC 消费先过三层——「许可与资源边界(G)→ 等位基因与本体(S)→ 协议与统计(M)」。
§6.4 接力实验设计
IMPC 研究团队的接力验证设计:
- R1 快照定格:DR 版本固定+FTP 归档+§4.6 清单——产出「可信数据实例」。
- R2 映射校准:ID/本体映射核查(L2-L3)——产出「语义可用的矩阵」。
- R3 经典复现:Lepr/Tyr 等盲复现(L4)——产出「管线有效性证据」。
- R4 目标分析:单基因/全谱/靶点扫描——产出「研究结论」。
- R5 交付:方法学段落(§7.7)+ R1-R3 证据 + 官方引用格式——审稿可回放。
§6.5 八个真实坑点
- 坑点 1:调用数当规模——测量级与调用级差三个量级;口径分开。
- 坑点 2:等位基因混淆——tm1a/tm1e/CRISPR 结构差异决定表型含义;先读 allele design。
- 坑点 3:阴性当缺失——三值语义(1/-1/0);覆盖表派生阴性。
- 坑点 4:跨 DR 版本直比——管线改进非超集;固定版本或重算。
- 坑点 5:MP-HPO 越级——小鼠表型佐证≠人类因果;证据分级。
- 坑点 6:调用数变化当生物学——DR23→DR24 下降是管线改进;读发布说明。
- 坑点 7:中心效应忽略——多中心批次残差;方向一致性敏感性。
- 坑点 8:品系引用不精确——「敲除小鼠」歧义;完整等位基因符号+存档 ID。
§6.6 审稿人自查清单
- DR 版本(+IMPReSS 协议版本)是否声明?
- 等位基因类型是否写入方法学?
- 「无表型」是否区分「测过阴性」与「未测」?
- 跨版本对比是否声明管线差异?
- MP→HPO 转译是否标注映射版本与证据层级?
- 多中心数据是否做中心效应敏感性?
- 性别维度是否分层呈现(或声明合并理由)?
- 品系引用是否用完整等位基因符号?
- 小鼠证据的结论措辞是否克制(不越级到人类因果)?
§6.7 版本治理的方法学含义
- 「改进即变化」的沟通艺术:DR24 调用数下降被官方明确解释为管线改进——版本说明把「数据变少」翻译成「统计变准」;同类项目应学会这种沟通。
- 协议版本的隐性联动:IMPReSS 协议更新不随 DR 发布走——跨期分析要同时核对两个版本轴。
- 外链数据的边界管理:早期致死外链数据(Tremblay 组)独立于 DR 版本——外源数据的引用边界要显式。
- 对国内同类平台的启示:「自产数据不聚合文献」的定位纯净性 + 版本戳体系 + 发布说明的解释义务——三件套是国家级表型平台可以直接借用的治理模板。
§6.8 与人类遗传学证据的整合张力
- 证据层级的不可通约:小鼠全敲是「基因功能缺失的极限实验」——人类多数疾病变异是部分功能改变(错义/调控);LoF 光谱的对齐要做插值不是直译。
- 表型翻译的信息损耗:MP 调用(标准化检测)与人类临床表型(自由临床描述)的语义距离——HPO 映射后仍有残余不对应;佐证打分的权重设计要保守。
- 背景一致性的优势:IMPC 全库 C57BL/6N 消除背景噪声,但也意味着「背景修饰」的人类对应物(遗传背景多样性)不在系统内——外推时声明。
- 工程含义:整合管线里 IMPC 证据列的元数据至少含「等位基因类型+DR 版本+HPO 映射版本」——证据可追溯性是整合可信度的底座。
§6.9 表型统计的解读纪律
- 显著性≠重要性:11 万调用是海量检验的产出——效应量与生物学特异性(罕见 MP 术语)才是优先级信号。
- 每基因平均调用的误用:平均 11-12 个调用不代表「每个基因都该有 11 个表型」——必要性与检测覆盖决定分布;按分布解读不按均值。
- P 值口径的版本性:管线版本改变检验框架(DR24 性别注释)——P 值跨版本不可直比;引用附版本。
- 效应方向的生物学锚定:参数的「高/低」要与生理学方向对齐(如血糖高)——调用表的 z 值方向消费前先核对参数定义。
§7 AI 就绪指南与应用场景
§7.1 IMPC 在医疗 AI 中的四种喂法
- 喂法 1:基因-表型监督标签——三值矩阵做基因功能预测模型的训练/评测标签(阴性样本防「没证据=无功能」退化)。
- 喂法 2:变异优先级特征——VUS 解释管线里 IMPC 佐证作为特征维(经 HPO 映射)。
- 喂法 3:知识图谱节点——KG 形态接入基因-表型-疾病推理图;链接预测发现新关联。
- 喂法 4:多模态影像预训练——histopathology/embryo 影像+参数标签——表型影像的自监督/弱监督资源。
- 四喂法与坑点对应:喂法 1 踩坑 3(三值语义);喂法 2 踩坑 5(越级);喂法 3 踩坑 4(版本);喂法 4 踩坑 2(等位基因元数据)——建模前对号。
§7.2 表型矩阵挖掘管线实操配方
端到端配方(DR 快照 → 挖掘产物)
┌────────────────────────────────────────────────────────┐
│ 1. 快照:FTP 全量下载+归档(DR24) │
│ 2. 装载:调用表+测量覆盖表+MP 本体 │
│ 3. 矩阵:三值编码(1/-1/0)+ 共同检测集掩码 │
│ 4. 校准:Lepr/Tyr 复现(L4) │
│ 5. 挖掘:相似度/聚类/链接预测(在掩码内) │
│ 6. 语义:MP→HPO 转译 + 证据分级标注 │
│ 7. 交付:结果+版本四元组+方法学段落 │
└────────────────────────────────────────────────────────┘
- 共同检测集是相似度的生命线:覆盖不对称的相似度是伪相似度——掩码内计算是纪律。
- 阴性信息的杠杆:-1 值参与聚类(测过阴性=功能信息)——全谱挖掘与文献挖掘数据集的最大差异点。
- 语义层最后注入:先做数值挖掘再做 MP→HPO 转译——语义转译过早会锁死计算自由度。
§7.3 模型选型与迁移决策
- 矩阵规模友好:9,605×数百 MP 的三值矩阵——轻量模型(矩阵分解/图嵌入)即可全谱建模;无需大模型起步。
- 图神经网络的适用面:基因-表型二部图+本体层级——GNN 的链接预测适合「测过但阴性/阳性混合」的结构。
- 影像模型的迁移路径:histopathology 影像量级有限——病理学预训练模型(PathChat 类)微调优于从头训练。
- LLM 的正确位置:调用清单的自然语言解读+方法学段落生成——挖掘主体仍是结构化模型;LLM 做语义接口。
§7.4 公平性:基因宇宙的覆盖偏倚
- 优先算法的残余偏倚:under-studied 优先策略校正了文献偏置,但靶向可行性(critical exon 存在性/必要性别)仍造成覆盖差——致死基因的表型数据天然稀疏。
- 表型检测的人类中心性:IMPReSS 检测清单反映人类关注(代谢/行为/心血管)——小鼠感知域(嗅觉/超声交流)覆盖弱;「无检测=无数据」的域要声明。
- 性别覆盖的历史债:早期数据的性别平衡弱于 DR24——跨期分析注意性别记录密度变化。
- 跨物种映射的语义不平等:MP↔HPO 映射在「临床常见表型」处最密——罕见/特殊表型的映射稀疏,佐证能力随之不均。
§7.5 任务×资源速查表
| AI 任务 | 输入 | IMPC 资产 | 评测指标 |
|---|---|---|---|
| 基因功能预测 | 序列/网络特征 | 三值矩阵标签 | AUROC(阳性+阴性双评测) |
| VUS 优先级 | 变异+患者 HPO | MP→HPO 佐证 | 已知诊断复现率 |
| 新模型发现 | 表型查询 | 矩阵相似度 | 生物学家盲评 |
| 表型影像分类 | 组织/胚胎影像 | 影像+标签 | 分域 F1 |
| 性别二态发现 | 性别分层调用 | DR24 注释 | 已知二态基因召回 |
| 链接预测 | KG | 知识图谱 | hits@k(已知关联留出) |
§7.6 端到端案例:未确诊病的 IMPC 佐证流水
- 目标:为某未确诊罕见病家系(外显子组已测)生成 IMPC 佐证报告。
- 输入:患者 HPO 术语集 + 候选变异(变优先级后 top-20 基因)。
- 步骤:(a) 候选基因的 IMPC 调用拉取(API)→ (b) MP→HPO 转译 → © 与患者 HPO 的重叠与特异性打分 → (d) 必要性分类与疾病机制一致性核查 → (e) 佐证报告(证据类别=动物模型辅助证据)。
- 坑点前置:映射版本(坑点 5 的纪律);阴性声明(坑点 3);措辞克制(不越级)。
- 产出:报告进入诊断团队的变优先级会议——与 OMIM/文献证据并列呈现。
§7.7 报告模板:方法学段落骨架
IMPC 数据分析方法学段落(可复用骨架):
「本研究使用 IMPC 数据发布 DR24(2026-03-16,IMPReSS 协议版本 X)。
基因-表型矩阵按三值编码(1=显著调用 / -1=测过阴性 / 0=未测),
阴性覆盖自测量覆盖表派生。
表型相似度在共同检测集掩码内计算(方法:Jaccard/嵌入…)。
跨物种转译经 MP→HPO 映射(映射版本 Y),证据定位为
动物模型辅助证据(ACMG/AMP 框架辅助类)。
等位基因类型与生产中心元数据全保留;
性别维度按 DR24 性别特异注释分层呈现。
全部品系引用使用完整等位基因符号与存档 ID(EMMA/KOMP)。」
- 骨架的八要素:DR 版本/协议版本/三值语义/掩码/相似度方法/映射版本/证据层级/品系引用——少一项即复现风险点。
- 本地化建议:中文研究补「小鼠表型术语的中文对照表」——团队沟通与临床转译的效率件。
§7.8 成本与排期模板
| 阶段 | 内容 | 计算研究 | 实验研究 |
|---|---|---|---|
| W1 | 快照下载+装载+完整性(L1) | 1 人 | 1 人 |
| W2 | 映射校准(L2-L3) | 1 人 | 1 人 |
| W3 | 经典复现(L4) | 1 人 | — |
| W4-6 | 目标分析(矩阵/佐证/影像) | 1-2 人 | 实验组并行 |
| W7-8 | 品系订购与 MTA(如需) | — | 排期关键路径 |
| 常设 | DR 版本跟踪+本体对齐 | 兼职 | 兼职 |
§7.9 消融案例:阴性信息对功能预测的影响
- 设定:同一基因功能预测任务——A 只用阳性调用(1/0 二值);B 三值(1/-1/0);C 三值+共同检测掩码;D C+本体层级聚合。
- 典型结果模式:A 的「0 值」混合了阴性/未测——模型把未测基因系统性打低分;B 修正后阴性基因的分数分布正常化;C 消除覆盖不对称的伪相似;D 的层级聚合提升稀疏术语的信号——四步的信息增益集中在 B、C。
- 教训:阴性信息的编码方式(不是模型选择)是 IMPC 建模的第一杠杆——先修数据语义再调模型。
- 与坑点的映射:A 即坑点 3;C 即坑点 7 的矩阵版;D 是本体维度的加成——消融矩阵就是坑点清单的实验化。
§8 伦理、许可与合规
§8.1 许可与义务结构
- CC-BY 4.0 的开放面:门户/API/FTP/KG 全部数据——署名即用,商用可用;引用规范(官方 Citing IMPC Data 页)。
- 品系的双轨受控:活体资源经 EMMA/KOMP Repository 的 MTA——EUCOMM MTA 不可协商(官方明示);数据开放≠实物无条件开放。
- 动物福利的制度层:IMPC 官网设 Animal Welfare 专章——21 中心的动物实验伦理批准与 3R 原则执行是联盟治理的常设维度;引用与使用时尊重该语境。
- 数据引用义务:CC-BY 的署名要求+官方引用格式(门户论文+DR 版本)——引用是许可义务也是学术礼仪。
§8.2 引用与致谢模板
论文/报告引用模板:
「本研究使用 IMPC 数据(Data Release 24, 2026-03-16;
mousephenotype.org),按 CC-BY 4.0 许可使用。
表型数据依据 IMPReSS 标准化协议生成,统计调用经 OpenStats 管线。
品系来源:[EMMA ID/KOMP ID + 完整等位基因符号]。
Wilson R 等, NAR 2026;54(D1):D1133-D1142(门户论文);
[如用特定成果] 另引对应主题论文。」
- 双引用结构:门户论文(资源引用)+ 主题论文(具体成果)——IMPC 官方推荐结构。
- 版本与协议双戳:DR 版本+IMPReSS 协议版本——与 §3.7 纪律一致。
- 品系完整引用:等位基因符号+存档 ID——可复现性的品系侧。
§8.3 国内合规路径
- 数据获取:CC-BY 4.0 数据全球可用——国内团队直接下载/API 合法;署名引用即可。
- 品系引进的监管层:活体小鼠引进涉及国内实验动物许可与生物安全审批——IMPC 品系引进的排期要把国内监管窗口纳入(可能数月)。
- 动物伦理的本地对齐:国内机构使用 IMPC 品系做实验——本单位 IACUC/伦理委员会批准是本地义务(IMPC 的福利语境不替代本地审批)。
- 罕见病诊断的落地:IMPC 佐证进入国内遗传咨询报告——报告语言按国内临床规范表述(辅助证据定位不变)。
§8.4 商业使用边界
- CC-BY 的商用允许:数据嵌入商业产品(靶点筛选平台/BI)合法——署名+许可声明随行。
- 品系衍生品的边界:商业服务用 IMPC 品系做药效/毒理实验——MTA 条款的商业条款逐条核查(部分资源有商业使用限制)。
- 衍生数据库的义务:基于 IMPC 的衍生数据库(合并/加工)——CC-BY 传播+不暗示官方背书;「IMPC 兼容」类宣传措辞谨慎(不暗示联盟认证)。
- AI 模型的许可传导:IMPC 训练的模型商用——数据许可不传导到模型权重(CC-BY 无 copyleft),但训练数据声明是行业规范。
§8.5 合规台账最小模板
| 台账项 | 内容示例 | 更新频率 |
|---|---|---|
| 快照档案 | DR 版本/下载日期/文件哈希 | 每次 DR 发布 |
| 本体版本 | MP/HPO/映射表版本 | 半年度 |
| 品系台账 | 订购记录/MTA 副本/本地验证 | 每次引进 |
| 动物伦理 | 本地批准文号/有效期限 | 年度续期 |
| 数据用例 | 分析/发表/产品清单 | 按项目 |
| 引用核查 | 产物引用格式完整性 | 每次发布 |
§8.6 大科学工程的治理语义
- 联盟治理的三层:资助机构层(方向)+ 中心执行层(生产)+ DCC 协调层(整合)——职责分离清晰;「分布式生产、集中化质控统计发布」的架构是其 15 年稳定的关键。
- 标准先行的哲学:IMPReSS 协议在生产启动前固定——「先定标准再产数据」避免事后 harmonization 的高成本;这是多中心实验设计的黄金顺序。
- 算法治理的公正性设计:基因优先按算法而非机构偏好——联盟内部的「科研政治」被制度性约束;值得所有联盟型项目参照。
- 开放的双边界:数据全开放(CC-BY)与实物受控(MTA)的边界清晰声明——「什么免费什么不免费」提前写明是信任基础;对比模糊许可的资源,IMPC 的边界透明度是治理资产。
§9 谱系与生态
§9.1 小鼠功能基因组时间线
| 年份 | 事件 | 意义 |
|---|---|---|
| 2003 | VelociGene 方法建立 | 高通量打靶技术奠基 |
| 2006 | Sanger MGP 成立 | 年产 200 品系的生产引擎 |
| 2007-2011 | IKMC 时代 | EUCOMM/KOMP/NorCOMM ES 库铺底 |
| 2009-2011 | knockout-first 设计确立 | Skarnes 2011;Pettitt 2009 |
| 2011 | IMPC 成立 | 多中心表型联盟 |
| 2013 | 等位基因分子表征 | 品系质检系统化 |
| 2015 | IMPC 主论文 | 目录首批成果 |
| CRISPR 时代 | 生产提速 | 主力技术切换 |
| 2025-11 | NAR 门户论文 | 云原生重建+KG(DR23.0 口径) |
| 2026-03 | DR24 | 1.38 亿数据点/9,605 基因/性别注释强化 |
§9.2 术语表
- IKMC:国际敲除小鼠联盟——IMPC 的资源前身(EUCOMM/KOMP/NorCOMM)。
- knockout-first(tm1a):诱捕盒+条件潜力的一代等位基因设计。
- tm1b/tm1c/tm1d/tm1e:tm1a 经 Cre/Flp 衍生的等位基因家族(报告/条件/移码/非条件)。
- VelociGene:Regeneron 的整码删除技术——完全 null 等位基因。
- critical exon:关键外显子——所有转录变体共有的功能必需外显子。
- IMPReSS:标准化表型协议库——16 类别检测 SOP。
- OpenStats:集中统计管线——显著调用的产出框架。
- PhenoDCC:数据协调中心——多中心数据的收集/质控/汇总。
- MP(Mammalian Phenotype):哺乳动物表型本体——调用的原生术语。
- HPO:人类表型本体——跨物种转译的目标术语。
- 必要性五分类:cellular lethal/developmentally lethal/subviable/viable with phenotype/viable with no phenotype。
- under-studied genes:未充分研究基因——IMPC 优先策略的靶向。
- Disease model(候选):复现人类患者表型的敲除品系。
- EMMA:欧洲突变小鼠档案库——INFRAFRONTIER 品系存档。
- Exomiser:变优先级工具——消费 IMPC/模型生物数据佐证人类变异。
- Monarch Initiative:跨物种表型计算推理生态。
§9.3 资源选型决策树
基因功能问题需要什么?
├── 敲掉后全身表型 → IMPC(因果实验证据)
├── 全部文献知识聚合 → MGI(知识库)
├── 人组织表达 → GTEx/HPA(表达证据)
├── 人类遗传关联 → GWAS Catalog/OMIM(关联证据)
├── 细胞必需性 → DepMap(细胞层筛选)
├── 变异致病性佐证 → IMPC(经 Exomiser/Monarch)
└── 靶点综合打分 → Open Targets(整合全链)
- 证据类型匹配问题类型:功能缺失后果→IMPC;表达位置→GTEx;人群关联→GWAS——选错资源类型是问题的常见起点。
§9.4 与本库其他条目的关系
| 关联条目 | 关系 | 典型联合场景 |
|---|---|---|
| HGNC 基因命名委员会 | 符号/ID 对齐 | 基因跨库联接的标识符层 |
| MedDRA 监管活动医学词典 | 表型语义对照 | 安全性事件 vs 模型表型的对齐语境 |
| TCGA | 癌症基因×模型表型 | 敲除表型的肿瘤学转译 |
| SRA 序列档案 | 测序数据×品系基因分型 | 等位基因确认的测序证据 |
| AlphaMissense | 变异预测×模型验证 | 计算预测与实验表型的互补 |
§9.5 组合使用建议
- 功能证据最小组合:IMPC(因果)+ HGNC(标识)+ OMIM(疾病关联)——基因功能解读的标准三件套。
- 罕见病诊断组合:外显子组 + IMPC 佐证(经 HPO)+ OMIM/PanelApp——VUS 优先级的完整证据链。
- 靶点评估组合:IMPC 五分类 + AlphaMissense 变异预测 + Open Targets 打分——安全面×可药性×遗传支撑的三维评估。
- 发育研究组合:IMPC Embryo 集合 + SRA 单细胞测序——表型与转录态的时空对齐。
§9.6 模式生物资源的生态角色
- 哺乳动物功能注释的锚点:序列注释(自动)与文献知识(手工)之间——IMPC 提供系统实验注释的第三极;Open Targets/MGI/UniProt 的消费确认其锚点地位。
- 罕见病诊断的基础设施:经 Exomiser/UDN 的制度化——IMPC 是全球罕见病诊断管线里的标准证据源。
- 阴性数据库的独有价值:系统性「测过阴性」记录在生物医学资源里的稀缺性——功能冗余/补偿研究的独家入口。
- 多中心科学的方法学输出:IMPReSS/OpenStats/DCC 的治理三件套——超出数据本身的方法学遗产。
§9.7 功能基因组资源家族的光谱定位
| 维度 | IMPC | MGI | DepMap | GTEx |
|---|---|---|---|---|
| 证据类型 | 个体敲除表型 | 文献聚合 | 细胞必需性 | 人组织表达 |
| 物种 | 小鼠(C57BL/6N) | 小鼠(全景) | 人类细胞系 | 人类组织 |
| 因果强度 | 强(体内实验) | 依来源 | 强(细胞内) | 弱(观察) |
| 覆盖 | 9,605 基因 | 全景 | 全基因(细胞内) | 全基因(组织级) |
| 转化距离 | 近(哺乳动物) | — | 远(细胞层) | 零(人类) |
- 家族共性:系统化×标准化×开放——功能基因组资源的三件套;IMPC 在「体内因果」与「哺乳动物距离」的组合上独占。
- 互补结构:DepMap(细胞内)↔IMPC(个体内)构成必要性证据的两级;GTEx↔IMPC 构成表达↔功能的两端。
§9.8 IMPC 生态的圈层地图
| 圈层 | 组件 | 角色 | 依赖关系 |
|---|---|---|---|
| 核心 | DR 数据 + IMPReSS + OpenStats | 数据与方法本体 | —(本体) |
| 生产圈 | 21 中心(Sanger MGP/JAX/Harwell/BCM…) | 品系与数据生产 | 按标准协议生产 |
| 资源圈 | EMMA/KOMP Repository | 品系存档与分发 | MTA 双轨 |
| 语义圈 | MP/HPO/Monarch/MGI | 术语与整合 | 本体映射 |
| 应用圈 | Open Targets/Exomiser/UDN/自建管线 | 语义消费 | 经语义圈或直连 |
- 生产圈与资源圈的双轨:数据走 CC-BY 开放、品系走 MTA 受控——同一产出物双许可轨道是 IMPC 治理的独特结构。
- 圈层穿越的代价:应用圈直连生产圈(单中心门户)会失去多中心合并的统计力——经核心 DR 消费是默认正道;与 sra/meddra 条目的圈层结论同构。
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | 入口 | 用途 |
|---|---|---|
| IMPC 门户 | https://www.mousephenotype.org | 基因/表型/疾病模型查询 |
| 数据发布页 | 门户 data/release | DR 版本说明与全报告 |
| REST API | 门户 API 区 | 程序化访问(含培训材料) |
| FTP | 门户 FTP 区 | 全量文件下载 |
| IMPReSS | impress 协议站 | 标准协议原文 |
| Citing IMPC | 门户引用页 | 引用规范 |
| EMMA/INFRAFRONTIER | infrafrontier.eu | 品系订购(欧洲) |
| KOMP Repository | komp.org | 品系订购(北美) |
| Monarch Initiative | monarchinitiative.org | 跨物种表型推理 |
| Open Targets | opentargets.org | 靶点整合打分 |
上手路径建议:(1) 门户基因页查 3 个熟悉基因(如 Lepr/Brca1/Tyr)建立直觉 → (2) 读 Citing 页与 DR 发布说明 → (3) API 培训材料过一遍 → (4) FTP 下载 DR24 做矩阵演练(§4.3)→ (5) 经典信号复现(L4)后上线挖掘流水。
§10.2 关键文献
- Wilson R 等,International Mouse Phenotyping Consortium Portal(NAR 2026;54(D1):D1133-D1142, 10.1093/nar/gkaf1148)——门户架构、DR23.0 口径与整合生态的权威描述。
- Groza T 等(PMID 36305825)——联盟层面数据生产与人类疾病研究的综合论文。
- Skarnes WC 等,Nature 2011;474:337-342——knockout-first 等位基因设计原文。
- Pettitt SJ 等,Nat Methods 2009——C57BL/6N ES 细胞资源。
- Mammalian Genome 2013(EUCOMM/KOMP-CSD 分子表征)——等位基因质检的方法学记录。
- IMPC 主论文(Nature Genetics 2015)——目录首批成果。
- 官方主题论文集(Essential genes/Sexual dimorphism/Hearing/Metabolic 等,门户 Publications 区)——专题分析的数据支撑论文。
§10.3 站内延伸阅读
- HGNC 基因命名委员会——基因标识符与符号的权威层;IMPC 的 HGNC 联动。
- MedDRA 监管活动医学词典——临床安全性术语与模型表型的语义对照。
- TCGA——肿瘤基因组的转化对照侧。
- SRA 序列档案——品系基因分型的测序证据层。
- AlphaMissense——变异效应预测与模型实验的互补证据。
§10.4 FAQ
Q1:IMPC 数据免费吗?
A:免费——CC-BY 4.0 许可,门户/API/FTP/知识图谱全开放;署名引用即可。
Q2:可以订购 IMPC 的小鼠吗?
A:可以——经 EMMA(欧洲)或 KOMP Repository(北美),需签署 MTA;EUCOMM 资源 MTA 不可协商(官方提醒)。
Q3:敲掉一个基因通常会发现表型吗?
A:约平均每基因 11-12 个显著调用(DR24)——但分布不均:必要性低的基因可能阴性(测过无表型),致死基因只有胚胎数据。
Q4:「无表型」是没测还是测过没事?
A:必须区分——IMPC 的覆盖记录可区分「测过阴性」与「未测」;分析用三值编码(1/-1/0),把阴性当缺失是常见错误。
Q5:为什么 DR24 的表型调用比 DR23 少了?
A:管线改进(性别特异 MP 注释等)使统计更精确——不是数据变少;跨版本引用写明 DR 版本。
Q6:tm1a、tm1c、tm1d 有什么区别?
A:同一 ES 克隆的衍生——tm1a 是 knockout-first(诱捕盒);Flp 处理得 tm1c(条件性);Cre 处理 tm1c 得 tm1d(移码 null);表型解读前先确认等位基因形态。
Q7:CRISPR 品系和 ES 细胞品系的数据能混用吗?
A:能合并分析但等位基因类型必须入档——CRISPR 有脱靶与嵌合体历史风险、tm1a 有顺式效应——分层敏感性是好习惯。
Q8:IMPC 能证明人类疾病的基因因果吗?
A:不能单独证明——小鼠表型经 HPO 映射是人类变异致病性的「动物模型辅助证据」(ACMG/AMP 框架辅助类);确认仍需人类证据。
Q9:什么是必要性五分类?
A:按纯合敲除后果:cellular lethal(细胞致死)/developmentally lethal(发育致死)/subviable(亚存活)/viable with phenotype(可活有表型)/viable with no phenotype(可活无表型)。
Q10:致死基因为什么没有成年表型?
A:发育致死基因活不到成年——数据空窗是必然;胚胎表型(Embryo 集合)与外链早期致死数据(DR24 起链 Tremblay 组)补位。
Q11:IMPC 和 MGI 什么关系?
A:MGI 是全小鼠知识库(聚合文献与资源),IMPC 自产标准化数据并喂给 MGI——「自产不聚合」是 IMPC 的定位。
Q12:怎么拿全部数据做挖掘?
A:FTP 全量下载(GB 级)——API 逐基因拉全库不现实;下载后自建三值矩阵(§4.3)。
Q13:性别维度数据可用吗?
A:DR24 强化性别特异 MP 注释——「只在雄/雌显著」的调用显式可查;跨期分析注意早期数据性别记录密度较低。
Q14:可以在文章里只写「IMPC 敲除小鼠」吗?
A:不合格——需完整等位基因符号(如 tm1d/tm1e/CRISPR 形态)+ MGI ID + DR 版本;品系引用规范见官方 Citing 页。
Q15:IMPC 数据进商业产品合法吗?
A:合法——CC-BY 4.0 允许商用;署名+许可声明随行;品系相关商业实验另查 MTA 商业条款。
Q16:怎么确认一个 MP 调用的强度?
A:看效应量与参数定义(不只 P 值)——边缘显著调用回原始测量看分布重叠;多参数同方向的一致性加权重。
Q17:多中心生产的基因数据可信吗?
A:可信且更好——同协议下多中心方向一致性是天然稳健性检查;单中心驱动的调用做敏感性标注。
Q18:IMPC 与 DepMap 的必要性数据怎么合用?
A:互补——DepMap 是细胞层必需性、IMPC 是个体层;「细胞致死→个体致死」光谱的两端对齐后用于靶点安全扫描。
Q19:MP↔HPO 映射在哪拿?
A:经 Monarch Initiative 与官方映射资源——映射版本入档;映射在常见临床表型处密、罕见表型处稀疏。
Q20:胚胎致死基因怎么研究其功能?
A:用 Embryo Development 集合的分期表型+条件性敲除(tm1c 系做组织/时间特异)——全敲致死不等于功能不可研究。
Q21:IMPC 能预测药物靶点的疗效吗?
A:部分——「viable with no phenotype」提示单靶可能无效(冗余/补偿);「viable with phenotype」提示可成药且表型面已知——疗效仍需药理学验证。
Q22:统计调用用的什么方法?
A:OpenStats 集中管线(线性混合模型类框架)——同协议同期野生型为参照;方法细节见 IMPReSS/OpenStats 文档。
Q23:老年表型数据有吗?
A:有——Late Adult 集合覆盖老年期延伸检测;注意老年期的存活偏差(弱个体先死亡)。
Q24:IMPC 支持哪些疾病域的模型?
A:>1,400 候选模型跨代谢/神经/感官/免疫/发育等域——官方主题论文含 hearing/metabolic/essential genes 等专题。
Q25:品系到货后要验证吗?
A:要——本地基因分型+关键表型复现是发表前义务;运输/繁殖的遗传漂变与污染历史上有案例。
Q26:中国团队怎么引用 IMPC?
A:门户论文(NAR 2026)+ DR 版本+(如用主题成果)主题论文——CC-BY 署名即可;中文团队常见遗漏是 DR 版本戳。
Q27:怎么跟 GWAS 结果联用?
A:GWAS 基因→IMPC 调用→表型与 GWAS 性状对齐(经 HPO/EFO)——关联证据与因果证据的合并(Open Targets 式)。
Q28:AI 模型用 IMPC 训练要标注什么?
A:DR 版本+三值语义+掩码规则+等位基因元数据——阴性编码方式是可复现性的最大变量(§7.9 消融)。
Q29:影像数据(病理/胚胎)怎么获取?
A:经门户影像查看器与集合下载——体量大于参数数据,按集合分批;Embryo Viewer 支持交互浏览。
Q30:IMPC 覆盖了全部小鼠基因吗?
A:未完成——DR24 为 9,605/约 2 万蛋白编码基因;生产持续(CRISPR 提速);必要性高的基因覆盖受限于致死。
Q31:可以做时间序列或寿命研究吗?
A:可做横断面老年对比(Late Adult)——全寿命纵向监测非 IMPC 定位;寿命研究另有专门队列资源。
Q32:IMPC 数据的 QC 怎么做的?
A:PhenoDCC 数据协调中心统一质控+分子确认(等位基因结构验证)——2013 年起系统化的品系质检记录可查。
Q33:怎么找「和我的患者表型最像」的小鼠?
A:患者 HPO → MP 映射 → 三值矩阵相似度(掩码内)或 Monarch/Exomiser 工具——反向模型发现的标准路径。
Q34:联盟有哪些中心?
A:21 机构/15 国——Sanger MGP(英)/Harwell(英)/JAX 与 BCM(美)/EMMA 网络(欧)等;基因页标生产中心。
Q35:资金从哪来?
A:4 个国家资助者+机构投入——NIH KOMP2/Wellcome Trust/EU INFRAFRONTIER 等;联盟官网 Funding 页有全表。
Q36:IMPC 未来会怎么演进?
A:官方信号——全基因覆盖持续推进、DR24 起机器可读性与 KG 增强、性别注释精细化;「每基因都有标准表型」的终局目标不变。
§10.5 要点回顾
- 定位:哺乳动物基因功能目录——自产标准化数据、不聚合文献。
- 规模双口径:1.38 亿测量 vs 111,664 调用——差三个量级分清引用。
- 等位基因先读:tm1a-e/VelociGene/CRISPR 结构决定表型含义。
- 三值语义:1/-1/0——阴性≠缺失,覆盖表派生。
- 版本四元组:DR 版+协议版+等位基因+中心——解读最小上下文。
- 跨版本不直比:管线改进非超集——DR23→DR24 教训。
- 证据分级:小鼠表型=辅助证据——不越级到人类因果。
- 性别分层:DR24 注释强化——合并统计稀释二态。
- 数据开放×品系受控:CC-BY 与 MTA 双轨——边界清晰。
- 经典复现校准:Lepr/Tyr 盲复现——管线有效性的端到端证据。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 项目身份:2011 成立/21 机构/15 国/4 国家资助者/C57BL/6N 背景/全蛋白编码基因目标 = NAR 2026 论文(10.1093/nar/gkaf1148, PMID 41231752)+ 官网
- DR24(2026-03-16):>1.38 亿数据点/9,605 基因/10,341 品系/111,664 显著调用/新增 ~450 万数据点 = 官网首页 + DR24 发布公告(mousephenotype.org?p=57371)
- DR23.0(2025):>1 亿数据点/9,277 基因/113,803 显著表型 = NAR 2026 论文(跨版本差异为管线改进——性别特异注释等,DR24 发布说明)
-
1,400 疾病候选模型/>100 验证罕见病关联/8,000+ 论文依赖 = NAR 2026 论文
- 数据整合进 MGI/Open Targets/UniProt = NAR 2026 论文
- FAIR:MGI+HGNC 持久 ID/MP+HPO 本体/CC-BY 4.0/门户+API+FTP+KG = NAR 2026 论文 + 官网
- 必要性五分类 = NAR 2026 论文
- IMPReSS 16 类别协议/OpenStats 统计 = NAR 2026 论文 + 官网
- DR24 亮点:机器可读性/性别注释改进/外链 Tremblay 组(University of Victoria)早致死数据 = DR24 发布公告
- Knockout-first 设计(tm1a/b/c/d/e;Skarnes 2011 Nature 474:337-342;Pettitt 2009)= 官网 allele design 页 + Targeting Strategies 页
- VelociGene 整码删除(Valenzuela 2003 Nat Biotechnol 21:652-659)= 官网 allele design 页
- CRISPR 策略(单切/双切/按需)= 官网 allele design 页
- EUCOMM/KOMP-CSD ES 库 12,350 基因=56% CCDS(2013 时点)= Mammalian Genome 2013(10.1007/s00335-013-9467-x)
- Sanger MGP 2006 成立/年产 200 品系 = Mammalian Genome 2013 转述 Ayadi 2012
- EMMA >4,800 IKMC/IMPC 品系存档/Allele Conversion Service/EUCOMMTOOLS 200+ Cre drivers/EUCOMM MTA 不可协商 = INFRAFRONTIER EMMA 页
- 合作:3i(~550 WTSI 品系免疫表型)/Kids First/UDN(Exomiser)/Genomics England 100K→1M genomes/Monarch = 官网 Collaborations 区
- 云原生门户重建+KG+API 培训材料 = NAR 2026 论文
- Database Commons 收录:year founded 2014(portal 口径)/v24.0/2026-03-16 更新 = NGDC Database Commons id 8574
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- alphamissense — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- ckb — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- uk-biobank — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- all-of-us — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- sra — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- ctd — 共享标签:基因组学与多组学 / 公共卫生与流行病学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

