信息速览
HGNC — 基因命名数据库 AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | HUGO Gene Nomenclature Committee(HGNC) |
| 运营 | 英国剑桥大学(HUGO 国际框架下的命名权威) |
| 定位 | 人类基因命名的全球权威标准——批准唯一符号与描述性名称 |
| 规模 | 44,476 已批准符号(2025-09-03):蛋白编码 19,294 / 假基因 14,603 / ncRNA 9,574 |
| 核心机制 | HGNC ID 稳定唯一——符号可变、ID 永不变;Stable tag 标记临床基因符号 |
| 策展 | Symbol Reports 人工策展 + Gene Group Reports(家族/组层级) |
| 外部映射 | 15+ 资源:Entrez/组层级) |
| 外部映射 | 15+ 资源:Entrez/Ensembl/Vega/UCSC/RefSeq/CCDS/UniProt/Vega/UCSC/RefSeq/CCDS/Ensembl/Vega/UCSC/RefSeq/CCDS/UniProt/MANE/AlphaFold/GenCC/COSMIC/M/MANE/UCSC/RefSeq/CCDS/UniProt/MANE/AlphaFold/GenCC/COSMIC/MGI/RGD/LSDB/ENA/GenCC/COSMIC/MGI/RGD/LSDB/ENA |
| 访问 | 完全开放:REST API / 完整集 TXT-JSON / OWL / 月季归档 / Globus / Custom Downloads |
| 数据政策 | 无限制使用(No restrictions;无担保免责) |
| 更新节奏 | 每月首批更新;symbol-changes 文件(2021-09 起月/季度) |
| 扩展项目 | PGNC(2024 成立;杨树命名)/ VGNC(脊椎动物;REST 同源查询) |
| 资助 | NIH NHGRI(U24HG003345)+ US DOE + SciBite(Elsevier) |
| 本库关联 | Ensembl/GENCODE(注释)、 |
| 本库关联 | Ensembl/GENCODE(注释)、ClinVar(变异语义)、AlphaFold DB(结构)、DrugBa(变异语义)、AlphaFold DB(结构)、linVar(变异语义)、AlphaFold DB(结构)、DrugBank/ChEMBL(靶点符号归宿) |
§0 E-E-A/ChEMBL(靶点符号归宿) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、字段清单与访问口径均核实自一手来源:HGNC 官方 NAR 年度论文(Seal et al., Genenames.org: the HGNC and PGNC resources in 2026, NAR gkaf1229, 2025-11-25 在线;PMID 41287213)、genenames.org 官网与下载页(hgnc_complete_set.json 31.6 MB,2026-09-15 更新)、HGNC data archive 帮助页(字段全集与归档策略)与 2023 年度论文(REST API/symbol-changes/GenCC/AlphaFold/MANE 链接,PMC9825485)。检索核实时间为 2026-09-19。
HGNC 的符号总数随批准节奏滚动(约每月首批更新)——本页采用 2025-09-03 精确数(44,476)与 NAR 2026 论文摘要口径(over 44,400)双轨标注;「19,294 蛋白编码」是同日快照,引用时注明时点。
本页为技术参考文档:HGNC 提供「命名与 ID 语义」——不提供基因功能验证(功能有效性见 GenCC/ClinVar 层)、不提供序列本体(序列见 RefSeq/Ensembl)、不构成临床决策依据;数据无限制使用但无担保(官方 Data release policy 原文)。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:人类基因命名的全球权威——「每个基因一个唯一符号 + 一个永不变的 ID」的官方注册处。
- 体量:44,476 符号(19,294 蛋白编码 / 14,603 假基因 / 9,574 ncRNA);15+ 外部资源人工映射。
- 访问:完全开放——REST API / JSON-TXT 完整集(16-32 MB)/ OWL / 月季归档 / Globus。
- 杀手锏:HGNC ID 的稳定性——符号可以改、ID 永不变;这是所有下游数据库(ClinVar/Ensembl/DrugBank)的基因身份锚点。
- 适用:基因实体链接(NLP)、跨数据库 ID 归一、变异注释的基因语义层、临床报告的标准符号、基因家族分析。
- 不适用:基因功能查询(用 UniProt/GO)、序列获取(用 RefSeq/Ensembl)、变异数据(用 ClinVar/dbSNP)、非人物种命名(动物用 VGNC/植物用 PGNC,覆盖度有限)。
§1.1 摘要
人类基因组约有 19,000 个蛋白编码基因——但它们在文献里有过多少个名字?同一个基因,一个团队叫它 A,另一个叫它 B,第三个拼写错了——基因命名混乱曾是基因组学的系统性公害。HUGO 基因命名委员会(HGNC)就是这个公害的官方解:基于剑桥大学的委员会逐个批准「唯一符号 + 描述性名称」,到 2025 年 9 月已批准 44,476 个符号(蛋白编码 19,294、假基因 14,603、非编码 RNA 9,574)。每个基因携带一个稳定不变的 HGNC ID——符号可以随科学认识更新,但 ID 永不改变;这个设计使 HGNC 成为全球基因组数据库的「基因身份锚点」。
对 AI 团队,HGNC 的价值在四个维度:
- 实体链接的金标准:医疗 NLP 的基因名识别(NER)之后的规范化(normalization)环节,alias/prev_symbol 表是回溯历史的唯一权威映射——「文献里出现的符号 → 当前标准符号」的桥梁。
- 跨库 ID 归一的中枢:Entrez/Ensembl/UniProt/RefSeq/CCDS/UCSC/MGI/RGD/COSMIC 的 15+ 映射人工维护——多库数据整合的 join 键不必再各自维护映射表。
- 临床语义的命名层:MANE Select 转录本标准、GenCC 有效性链接、Stable tag——临床报告「写哪个基因名、报哪个转录本」的规范出处。
- 命名治理的活样本:占位符替换(C#orf → 功能命名)、withdrawn 语义(撤回符号的去向追踪)、符号变更公开(月度文件)——「命名系统如何管理自己的演化」的工程范本。
数据的第一性事实:符号是易变的、ID 是稳定的——生产系统以 HGNC ID 为主键、符号为索引、alias/prev 表为回溯层——「三键结构」是用好 HGNC 的第一课。
§1.2 战略价值
- 消除同义混乱的公共品:命名混乱的直接代价是「文献检索漏检/数据库 join 错行」——HGNC 的唯一符号标准使全球基因组文献与数据库有了共同语言;期刊(Nature Genetics/Genome Research)与数据库(Ensembl/NCBI/MGI/OMIM)是它的强制推广层。
- 历史兼容的工程智慧:prev_symbol/alias_symbol/date_symbol_changed 的全程记录——「旧文献里的基因」在今天的数据库里仍可回溯;这是「标准如何尊重历史」的范本。
- 人工策展的信任层:44,476 个 Symbol Report 逐个人工维护——「基因家族归属/命名依据/外部映射」的策展质量是纯自动管道无法替代的信任资产。
- 命名生态的扩展:PGNC(2024,杨树)与 VGNC(脊椎动物)把「唯一符号 + 稳定 ID」范式输出到植物与比较基因组——命名标准的可复制性证明。
§1.3 同类数据集横向对比
| 资源 | 定位 | 规模量级 | 与 HGNC 的关系 |
|---|---|---|---|
| HGNC | 人类基因命名权威 | 44,476 符号 | — |
| Ensembl/GENCODE | 基因注释(转录本/外显子) | 6 万+ 基因座 | 注释层(HGNC ID 是其标准输出字段) |
| NCBI Gene | 基因综合信息(Entrez) | 数万人类基因 | Entrez ID 与 HGNC ID 双向映射 |
| UniProt | 蛋白序列与功能 | 2 万+ 人类 reviewed | 蛋白层(Symbol Report 内建映射) |
| MGI/RGD | 小鼠/大鼠同源命名 | 数万同源 | 同源映射(跨物种比较的桥) |
| OMIM | 遗传病表型-基因 | 数千表型 | 表型符号承接方(2019 HGNC 撤回后) |
| GenCC | 基因-疾病有效性分级 | 数千评估 | 临床有效性层(HGNC 链接内建) |
| GO | 功能本体 | 数万条目 | 功能语义层(与命名正交) |
§1.4 版本时间轴
1990s HUGO 框架下命名委员会工作展开(Doyle 等 FUSE 会议推动统一)
1997 HGNC 数据库成体系运营(剑桥大学驻地)
2010s NAR 年度论文系列确立(每年一报的数据库综述传统)
2019 phenotype 符号撤回(表型命名移交 OMIM);GenCC 协作启动
2021-09 symbol-changes 月度文件上线(符号变更全程可追溯)
2022 REST API 发布(HGNC + VGNC 同源查询);Globus endpoint
2023 GenCC/AlphaFold/MANE 链接内建 Symbol Report;auto-suggest 检索升级
2024 PGNC 成立(DOE 资助;杨树命名;plant.genenames.org 上线)
2025 44,476 符号(2025-09-03);NAR 2026 论文提交(gkaf1229)
2026 数据文件迁入 Google Storage Bucket(下载链接全量更新)
§1.5 应用场景矩阵
- 基因实体链接(NLP):文献/EHR 文本中的基因名 → 标准符号——alias/prev 表是回溯层。
- 跨库 ID 归一:Entrez/Ensembl/UniProt 多源 join——HGNC 映射列是现成桥表。
- 变异注释管线:VEP/ANNOVAR 类工具的基因语义层——HGNC ID 进注释输出。
- 临床报告生成:MANE Select 转录本标准 + 稳定符号——临床分子报告的命名规范。
- 基因家族分析:Gene Group/Gene Family 字段——家族级聚合的现成分组。
- 数据治理:内部数据库以 HGNC ID 为主键——符号漂移免疫的架构决策。
§1.6 组件全景
HGNC 数据的六个层:
- 符号核心层:hgnc_id / symbol / name / status(Approved | Entry Withdrawn)/ locus_group / locus_type / location(细胞遗传位置)。
- 历史回溯层:alias_symbol / alias_name / prev_symbol / prev_name / date_approved_reserved / date_symbol_changed / date_name_changed / date_modified。
- 家族组织层:gene_family / gene_family_id + Gene Group Reports(层级聚合)。
- 外部映射层:entrez_id / ensembl_gene_id / vega_id / ucsc_id / ena / refseq_accession / ccds_id / uniprot_ids / pubmed_id / mgd_id / rgd_id / cosmic / lsdb。
- 撤回与变更层:withdrawn.txt(撤回符号去向)/ symbol-changes 月度文件(2021-09 起)。
- 分发层:REST API(rest.genenames.org)/ TXT-JSON 完整集 / OWL / 月季归档(GCS)/ Globus / Custom Downloads。
§1.7 完全开放的数据经济学
- 无限制使用:官方 Data release policy 明文「No restrictions on access to, or use of, the data」——好意提供、无担保免责;这让 HGNC 成为商业工具链(临床报告软件/注释服务)可直接内建的基础设施。
- 分发成本的外包:下载文件迁入 Google Storage Bucket——静态分发的带宽成本由云承担;Globus 供批量传输(网络故障免疫)。
- 人工策展的成本结构:NIH NHGRI 核心资助(U24HG003345)+ DOE(PGNC)+ SciBite 捐赠(OWL)——「公共资助 + 企业公益」的混合模式。
- 治理成本的同构:命名请求来自全球科学家/期刊/数据库——委员会评审是人工瓶颈但也是质量来源;「慢审批换高信任」是 HGNC 与自动注释库的本质差异。
§1.8 HGNC 在研究流程中的定位
基因发现 → 命名批准 → 注释分发 → 语义应用 → 跨库整合
│ │ │ │ │
│ ├─ HGNC:唯一符号 + 稳定 ID(命名权威)
│ ├─ HGNC:15+ 外部 ID 映射(整合中枢)
│ ├─ HGNC:alias/prev 回溯(历史兼容)
│ └─ HGNC:withdrawn 去向(生命周期闭环)
└─ Ensembl/RefSeq(注释)→ ClinVar/COSMIC(变异)→ 临床报告
| 流程阶段 | HGNC 角色 | 典型用法 | 验收标准 |
|---|---|---|---|
| 基因发现 | 命名入口 | 新基因符号请求 | 符号唯一且合规 |
| 注释分发 | 语义锚点 | HGNC ID 进 GFF3/注释表 | ID 与符号一致 |
| 语义应用 | 规范层 | 临床报告/MANE 选择 | Stable tag 核验 |
| 跨库整合 | 桥表 | 多源 ID 归一 | 映射无歧义 |
| 历史回溯 | 兼容层 | 旧文献符号解析 | prev/alias 命中 |
定位纪律:HGNC 管「名字与身份」——功能找 UniProt/GO、序列找 RefSeq/Ensembl、变异找 ClinVar、有效性找 GenCC;把 HGNC 当「基因百科」用是角色错位。
§1.9 命名治理的独特设计
- 「符号唯一、ID 永恒」的双轨:符号是面向人类的(要好记好读),ID 是面向机器的(要绝对稳定)——HGNC 用双轨制解了「可读性 vs 稳定性」的对立。
- 占位符的生命周期:C#orf/FAM# 类占位符在功能明确后替换——替换计划公开、变更日期入档;「诚实的不完美」优于「伪装的完整」。
- 撤回不是删除:Entry Withdrawn 状态 + withdrawn.txt 去向映射——「错误的命名」以可追溯方式退场;数据系统里的「删除」哲学:标记而非抹除。
- 对 AI 的含义:命名治理预示知识系统设计的一般原则——「实体身份与实体标签分离 + 全程变更日志 + 生命周期状态机」;这三件套是任何实体链接系统的架构模板。
§2 医学与科学背景
§2.1 为什么基因命名是医学问题
- 临床报告的歧义代价:分子诊断报告里「同一个基因两个名字」会引发检测差异/治疗误判——临床实验室的命名一致性依赖 HGNC 标准;Stable tag 标记「临床场景下不要随意改动的符号」。
- 药物靶点的语义统一:药企靶点数据库/文献/专利中的基因名各异——ChEMBL/DrugBank 的靶点字段以 HGNC 符号为标准;「靶点 = 基因 = 蛋白」的三方对齐靠 HGNC ID。
- 遗传病文献的检索完整性:旧符号命名的文献在新符号检索下漏检——MEDLINE 检索用 alias/prev 表扩展是系统综述的标准动作。
- 多组学数据整合:转录组(Ensembl)× 蛋白组(UniProt)× 突变(COSMIC)的三方 join——HGNC 映射列是「同人 join 键」的事实标准。
§2.2 符号漂移的语义与工程应对
- 漂移的三种形态:正式变更(prev_symbol 记录,date_symbol_changed 入档)、别名并存(alias_symbol,非官方但普遍)、拼写变体(文献噪声,无官方记录)——三层噪声需要三种处理。
- alias 表的边界:alias 是「曾经用于指代该基因的符号」——但不保证「该符号在别处不指代其他基因」;一对多歧义是实体链接的核心难点(同符号异基因/异符号同基因并存)。
- 工程三键结构:HGNC ID(主键)/ symbol(当前索引)/ alias+prev(回溯索引)——查询优先级「ID > symbol > alias」;歧义命中(一个 alias 对多个 HGNC ID)时降级为人工核验队列。
- 版本纪律:每月首批更新——生产系统锁快照(季度归档)+ 变更文件增量同步;「实时追最新」与「锁快照可复现」的取舍要显式声明。
§2.3 占位符符号的治理语义
- 占位符的产生:新基因功能未明时以 C#orf(chromosome N open reading frame)/FAM#(family with sequence similarity)命名——诚实标注「我们还不知道它是什么」。
- 替换的触发:功能文献发表后委员会批准新符号(如 MLDHR 替换微肽编号类命名、SMIM10L3 按家族归位)——替换是「例外情况」,需功能证据。
- 生产系统的影响:占位符进入生产(报告/数据库)后替换会造成下游断裂——工程对策是「以 ID 为主键 + 占位符替换监听(date_symbol_changed 字段)」。
- 注释时代的边际变化:蛋白编码命名已相对完备(官方口径),新命名增量转向 lncRNA/假基因与注释器发现的基因(Ribo-Seq/phyloCSF 证据)——「命名前沿」在暗物质层。
§2.4 非编码 RNA 与假基因的命名语义
- ncRNA 的 9,574:lncRNA 6,236 为主体——lncRNA 命名的系统协议(HGNC 与 Gencode/GENCODE 协作);miRNA 1,912 沿用 miRBase 协调命名;tRNA/snoRNA 按注释规则。
- 假基因的三类:duplicated(未加工)/ processed(反转录插入)/ unitary(单一化)——14,603 的假基因目录是「基因组暗物质」的命名化;假基因符号在注释管线里常被误当蛋白编码——locus_type 过滤是铁律。
- 分析含义:表达定量/变异注释对假基因区域的映射歧义(processed 假基因与母基因序列同源)——HGNC locus_type + 基因组坐标双确认是防错配的标准动作。
§2.5 与临床资源的三重链接
- MANE Select:RefSeq 与 Ensembl/GENCODE 联合标注的「标准转录本」——临床报告「报哪个转录本」的官方答案;HGNC Symbol Report 内建版本化链接(NM_xxx.3 + ENSTxxx.12)。
- GenCC:基因-疾病有效性分级(Definitive/Strong/…)——「这个基因和这个病的关系有多确凿」的官方评估层;HGNC 2023 起内建链接。
- LSDB:位点特异性突变数据库(基因专病数据库)——临床变异的深度资源入口;lsdb_links 文件提供全表。
- 组合纪律:HGNC(命名)→ MANE(转录本)→ GenCC(有效性)→ ClinVar(变异证据)——临床语义链的四层各司其职;跨层直连是误用。
§2.6 与 OMIM 的分工演变
2019 年 HGNC 撤回 phenotype 符号(无基因归属的表型命名)——表型命名职责移交 OMIM;「基因符号」与「表型符号」的边界从此清晰:HGNC 只命名已确认的基因座,OMIM 命名表型/座位。历史 phenotype 符号在 withdrawn 文件有去向记录——旧文献检索时注意这一历史断层。
§2.7 AI 视角的科学定位
对医疗 AI,HGNC 是「基因实体消歧的地面真值」:NER 模型的输出规范化、知识图谱的基因节点 ID 化、多组学数据的 join 键、临床 NLP 的报告语义层。它的短板(命名不覆盖功能/映射人工维护的滞后)都是「人工策展」的固有代价——用它的方法论核心是「ID 主键 + alias 回溯 + 快照锁定」三件套,外加 GenCC/UniProt 层补足语义。
§2.8 跨物种命名的边界
- VGNC(脊椎动物):HGNC 的姊妹委员会——命名脊椎动物(非人/鼠主流模式生物)基因;REST API 同源查询(2022 起支持 VGNC)。
- MGI/RGD 同源映射:人类基因的小鼠(MGI)/大鼠(RGD)同源 ID 内建于 Symbol Report——跨物种比较的现成桥。
- PGNC(植物):2024 成立——杨树(Populus trichocarpa)先行;DOE 能源植物研究语境;plant.genenames.org 独立站点。
- 工程含义:跨物种数据整合时「符号相同 ≠ 基因相同」——大写(人类)/首大写(鼠类)惯例之外仍有同符号异物种陷阱;同源映射用 MGI/RGD ID 而非符号。
§2.9 符号的语言学:命名法的构词法
HGNC 符号不是随机字符串——它有一套演化了数十年的构词法,理解构词法是实体链接与生成模型的基础:
- 基因家族词根:SMIM(small integral membrane protein)/RNF(ring finger)——家族词根 + 序号后缀(SMIM10L1/L2A/L2B/L3 的亚型语义);家族归属变化会触发符号重命名。
- 功能描述缩写:TP53(tumor protein p53)/BRCA1(breast cancer 1)——历史功能命名保留即使功能认识更新(「名不副实」是常态——BRCA1 不只与乳腺癌相关)。
- 物种前缀惯例:人类全大写、鼠类首大写(Traf6 vs TRAF6)——大小写在跨物种检索中不可靠但仍是强先验信号。
- 禁用模式:氨基酸残基数(MP31 被拒)、基因型名(病名缩写被拒)——MLDHR 案例展示「作者命名 → 委员会重命名」的标准流;NER 模型应学习「候选符号的构词合法性」作为置信特征。
- 对生成式 AI 的含义:LLM 幻觉基因名(不存在的符号)是医疗 QA 的真实风险——生成后用 HGNC 词典校验(词法 + 存在性双查)是落地底线。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格(2025-09-03 快照 / 2026-09 数据文件) |
|---|---|
| 总符号 | 44,476 |
| 蛋白编码 | 19,294 |
| 假基因 | 14,603(duplicated/processed/unitary 三类) |
| ncRNA | 9,574(lncRNA 6,236 / miRNA 1,912 / tRNA 591 / snoRNA 568) |
| 主键 | HGNC ID(HGNC:nnnnn;跨符号变更不变) |
| 状态机 | Approved / Entry Withdrawn |
| 外部映射 | 15+ 资源(Entrez/Ensembl/Vega/UCSC/ENA/RefSeq/CCDS/UniProt/PubMed/MGI/RGD/LSDB/COSMIC) |
| 分发 | REST API / TXT 16.1 MB / JSON 31.6 MB / OWL / 月季归档 / Globus / Custom Downloads |
| 许可 | 无限制使用(无担保) |
| 更新 | 每月首批;symbol-changes 文件(2021-09 起月/季) |
| 扩展 | PGNC(2024 杨树)/ VGNC(脊椎动物 REST 同源) |
§3.2 数据文件的构成地图
| 文件 | 内容 | 体量(2026-09-15) |
|---|---|---|
| hgnc_complete_set.txt | 全部已批准符号(全字段 TSV) | 16.1 MB |
| hgnc_complete_set.json | 同上(JSON) | 31.6 MB |
| withdrawn.txt / .json | 撤回符号与去向 | 252.9 KB / 642.4 KB |
| genes_within_groups | 组/家族层级展开 | TXT+JSON |
| lsdb_links.txt.gz | 位点特异数据库链接 | 14.6 KB |
| symbol-changes 月/季文件 | 符号变更事件(2021-09 起) | 小文件组 |
| hgnc.owl | 本体化(SciBite) | 浅层级 OWL |
解读:单文件即全量(32 MB 级)——HGNC 是「一个文件装下的命名宇宙」;归档在 GCS bucket,月度文件 365 天后删除(季度归档长期保留)——快照纪律的政策出处。
§3.3 DAIMS 数据AI就绪度评估
| 维度 D | 数据完整性 | 评分 | 说明 |
|---|---|---|---|
| D1 | 覆盖完整性 | 9/10 | 人类基因命名全覆盖;蛋白编码近完备 |
| D2 | 语义深度 | 7/10 | 命名+家族+位置;功能语义不覆盖(角色边界) |
| D3 | 历史兼容 | 10/10 | prev/alias/date 全程记录——档案类满分 |
| D4 | 多组学 | 6/10 | ID 映射层覆盖多组学键;本体层无表达/序列 |
| A1 | 机器可读 | 10/10 | REST/JSON/TXT/OWL/Globus 全通道 |
| A2 | 文档完备 | 9/10 | 字段说明/归档帮助/命名指南齐备 |
| A3 | 接入成本 | 10/10 | 免注册免限制;32 MB 单文件全量 |
| A4 | 更新机制 | 9/10 | 月度节奏 + 变更文件增量——复现友好 |
| I1 | 指标标准化 | 9/10 | 命名标准本体;字段语义文档化 |
| I2 | 可复现性 | 9/10 | 归档快照 + 变更日志——时间旅行可复现 |
| M1 | 多模态对齐 | 7/10 | ID 映射即对齐层;语义对齐靠外层 |
| M2 | 时间序列 | 8/10 | 变更日志即时间序列(命名域) |
| S1 | 数据安全 | 9/10 | 无人类数据——安全负担近零 |
| S2 | 合规负担 | 10/10 | 无限制使用——合规负担最轻档 |
总分:A 级(机器可读/接入成本/合规负担三项满分——「小而完美的基础设施」的 DAIMS 典型;扣分项只在语义深度与角色边界——它本来就不管那些)
§3.4 存储与计算需求
| 场景 | 体量 | 建议 |
|---|---|---|
| 全量快照 | 32 MB JSON | 单机内存级——直接加载 |
| REST 单点查询 | KB 级 | 实时查询(限速礼仪) |
| 实体链接服务 | 32 MB + 索引 | 进程内哈希表(百万查询/秒级) |
| 跨库映射表 | 数 MB 抽取 | Custom Downloads 自选字段 |
| 历史研究 | 月/季归档 | GCS 批量(Globus 传输) |
HGNC 的工程重心是「小数据大语义」——无需分布式;索引结构(alias → ID 的多值哈希)才是工程重点。
§3.5 获取通道
- REST API:rest.genenames.org——单点查询(/fetch/hgnc_id/HGNC:9588)/ 批量(/fetch/symbol/TP53 类);VGNC 同服务。
- 完整集下载:genenames.org/download/statistics-and-files → GCS bucket——TXT/JSON 双格式;引用页标日期。
- Custom Downloads:自选字段导出——只要映射列的轻量集成。
- OWL:hgnc.owl——本体工具链(Protégé/SPARQL)接入。
- Globus:批量文件传输——多文件/大文件推荐(网络故障免疫)。
- 归档:月度(365 天)/季度(长期)快照——历史复现用季度档。
§3.6 口径对齐表
| 数字 | 出处口径 | 澄清 |
|---|---|---|
| 44,476 总符号 | NAR 2026 论文(2025-09-03 精确数) | 本页主口径 |
| over 44,400 / over 19,250 蛋白编码 | NAR 2026 摘要抽象口径 | 同源抽象表述 |
| almost 43,000 | genenames.org/about 页 | 历史时点(页面更新滞后) |
| 19,294 / 14,603 / 9,574 | NAR 2026(2025-09-03) | 三大类精确数 |
| lncRNA 6,236 / miRNA 1,912 / tRNA 591 / snoRNA 568 | NAR 2026 | ncRNA 细分 |
| 548 named pseudogenes(自上次报告起) | NAR 2026 | 假基因命名增量 |
| 31.6 MB / 16.1 MB | 下载页(2026-09-15) | 文件体量快照 |
§3.7 版本选择纪律
- 快照锁定:生产系统锁季度归档——「2026Q3 快照」进复现包;月度追新的服务声明追新策略。
- 变更同步:symbol-changes 文件做增量监听(date_symbol_changed/prev_symbol 字段)——占位符替换/家族重命名的下游断点预警。
- 归档期限:月度文件 365 天删除——长期研究一律季度归档(政策明文)。
- 双状态语义:Approved 与 Entry Withdrawn 同文件共存(status 字段)——「withdrawn 是状态不是删除」;withdrawn.txt 是撤回专属表。
§3.8 字段与映射详表
| 字段组 | 字段 | 用途 |
|---|---|---|
| 身份 | hgnc_id / symbol / name / status | 主键与当前命名 |
| 位置 | location / location_sortable | 细胞遗传位置(排序变体) |
| 类型 | locus_group / locus_type | 蛋白编码/假基因/ncRNA 细分 |
| 历史 | alias_symbol / alias_name / prev_symbol / prev_name | 实体链接回溯层 |
| 变更 | date_approved_reserved / date_symbol_changed / date_name_changed / date_modified | 全程时间戳 |
| 家族 | gene_family / gene_family_id | 家族/组聚合 |
| 序列库 | ena / refseq_accession / ccds_id | 核酸层映射 |
| 注释库 | ensembl_gene_id / vega_id / ucsc_id / entrez_id | 基因注释层映射 |
| 蛋白层 | uniprot_ids | Swiss-Prot/TrEMBL 映射 |
| 同源 | mgd_id(小鼠)/ rgd_id(大鼠) | 跨物种桥 |
| 临床/文献 | pubmed_id / lsdb / cosmic | 文献/专病库/COSMIC 符号 |
- 多值字段:双引号包裹 + 竖线分隔(官方格式约定)——解析器的第一个坑。
- 映射列的空值语义:无映射 ≠ 数据缺失——「该基因在目标库无对应」是真实状态;映射覆盖率按 locus_type 分层统计。
§4 数据结构
§4.1 对象模型
HGNC 数据模型
├── Gene(HGNC:nnnnn)
│ ├── identity(symbol/name/status/locus_type/location)
│ ├── history(alias*/prev*/date_* 四时间戳)
│ ├── family(gene_family/gene_family_id → Gene Group Report)
│ ├── xrefs
│ │ ├── sequence(ena/refseq/ccds)
│ │ ├── annotation(ensembl/vega/ucsc/entrez)
│ │ ├── protein(uniprot_ids)
│ │ ├── homolog(mgd_id/rgd_id)
│ │ └── clinical/literature(lsdb/cosmic/pubmed_id)
│ └── lifecycle(Approved ⇄ Entry Withdrawn + withdrawn 去向)
├── SymbolChange(月/季文件:hgnc_id/old/new/date)
└── Withdrawn(withdrawn.txt:旧符号 → 去向/HGNC ID 或 OMIM)
§4.2 完整集加载与快照管理
#!/usr/bin/env python3
"""HGNC 完整集加载:JSON 全量 → 内存索引(三键结构)。
快照纪律:锁季度归档文件 + 记录下载日期。"""
import json, datetime
from collections import defaultdict
SNAPSHOT = "hgnc_complete_set_2026Q3.json" # 季度归档(长期保留)
with open(SNAPSHOT) as f:
genes = json.load(f)["response"]["docs"]
print(f"genes: {len(genes)}; snapshot date: 2026-09-15")
# 三键索引:ID 主键 / symbol 索引 / alias+prev 回溯索引
by_id = {g["hgnc_id"]: g for g in genes if g["status"] == "Approved"}
by_symbol = {g["symbol"]: g["hgnc_id"] for g in genes if g["status"] == "Approved"}
alias_index = defaultdict(set) # alias 可多对多——集合语义
for g in genes:
if g["status"] != "Approved":
continue
for a in g.get("alias_symbol", []) + g.get("prev_symbol", []):
alias_index[a].add(g["hgnc_id"])
def resolve(token: str):
"""实体链接解析:ID > symbol > alias;歧义返回候选集。"""
if token.startswith("HGNC:"):
return ("id", {token} if token in by_id else set())
if token in by_symbol:
return ("symbol", {by_symbol[token]})
return ("alias", alias_index.get(token, set()))
print(resolve("TP53")) # ('symbol', {'HGNC:11998'})
print(resolve("C11orf53")) # 占位符 → 当前符号(已替换则回溯命中)
§4.3 REST API 查询
#!/usr/bin/env bash
# REST API:单点与批量查询(rest.genenames.org)
# 1) 按 ID 查
curl -s "https://rest.genenames.org/fetch/hgnc_id/HGNC:11998" | python3 -m json.tool | head -20
# 2) 按符号查
curl -s "https://rest.genenames.org/fetch/symbol/TP53" -H "Accept: application/json"
# 3) 按前符号查(实体链接回溯)
curl -s "https://rest.genenames.org/fetch/prev_symbol/MLDHR"
# 4) 按 locus_type 批量(蛋白编码全表)
curl -s "https://rest.genenames.org/fetch/locus_type/gene%20with%20protein%20product" | \
python3 -c "import json,sys; d=json.load(sys.stdin); print(d['response']['numFound'])"
# 5) VGNC 同源查询(2022 起支持)
curl -s "https://rest.genenames.org/fetch/vgnc_id/VGNC:1" -H "Accept: application/json"
§4.4 变更监听(symbol-changes 增量)
#!/usr/bin/env python3
"""月度 symbol-changes 文件 → 下游断点预警。
场景:生产数据库的符号列同步(占位符替换/家族重命名)。"""
import csv, glob
def load_changes(month_glob="symbol-changes_2026-*.tsv"):
changes = []
for path in sorted(glob.glob(month_glob)):
with open(path) as f:
for row in csv.DictReader(f, delimiter="\t"):
changes.append({
"hgnc_id": row["hgnc_id"],
"old": row["symbol_old"],
"new": row["symbol_new"],
"date": row["date_of_change"],
})
return changes
for ch in load_changes():
# 生产表里命中旧符号 → 触发更新工单(不静默改写——审计留痕)
hit = my_db.query_symbol(ch["old"])
if hit:
print(f"[ALERT] {ch['hgnc_id']}: {ch['old']} -> {ch['new']} @ {ch['date']}")
§4.5 元数据与可复现指纹
- 快照三元组:文件名 + 官方日期(下载页标注)+ 检索日期——复现包第一件。
- 变更基线:symbol-changes 起始月份——「基线之后的所有变更」可增量回放。
- 解析器版本:多值字段分隔符/字段名——HGNC 字段扩展(2023 加 MANE/GenCC 链接)会破旧解析器——「宽松解析 + 未知字段保留」的健壮姿势。
§4.6 完整性清单
- [ ] 快照文件 + 官方日期 + 检索日期三戳
- [ ] ID 主键架构(非符号主键)确认
- [ ] alias/prev 回溯索引构建
- [ ] 多值字段分隔符解析正确
- [ ] locus_type 过滤显式(假基因/ncRNA 边界)
- [ ] withdrawn 状态处理(状态机而非删除)
- [ ] 变更监听机制(月度文件)
- [ ] 歧义命中的人工核验队列
§4.7 数据血缘
全球基因发现(文献/注释/测序)
→ 命名请求(科学家/期刊/数据库提交)
→ HGNC 委员会评审(人工批准)
→ Symbol Report 策展(外部映射人工维护)
→ 数据文件发布(月度 + 归档 GCS)
→ 下游库同步(Ensembl/NCBI/ClinVar/UniProt 引用)
→ 命名应用(文献/临床报告/注释管线/实体链接)
「发现 → 请求 → 评审 → 策展 → 发布 → 同步 → 应用」七段血缘——HGNC 的血缘核心是「人工评审节点」:这是它与全自动注释库的本质区别,也是它的信任来源。
§4.8 跨库 ID 归一(桥表构建)
#!/usr/bin/env python3
"""多源基因 ID 归一:Entrez/Ensembl/UniProt → HGNC ID 桥表。
数据:HGNC 快照 xref 列(官方人工维护映射——不要自建符号 fuzzy 匹配)。"""
import json
import pandas as pd
docs = json.load(open("hgnc_complete_set_2026Q3.json"))["response"]["docs"]
rows = []
for g in docs:
if g["status"] != "Approved":
continue
rows.append({
"hgnc_id": g["hgnc_id"], "symbol": g["symbol"],
"locus_type": g["locus_type"],
"entrez": g.get("entrez_id"), "ensembl": g.get("ensembl_gene_id"),
"uniprot": g.get("uniprot_ids"), # 多值映射:JSON 中已是 list
})
bridge = pd.DataFrame(rows)
# 1) 展开多值列(uniprot 可一基因多蛋白登录号)
bridge = bridge.explode("uniprot")
# 2) 归一函数:任意 ID → hgnc_id(歧义返回全部候选)
def to_hgnc(value: str, col: str):
hits = bridge[bridge[col] == value]["hgnc_id"].tolist()
if len(hits) == 1:
return hits[0], "unique"
if len(hits) > 1:
return hits, "AMBIGUOUS" # 进人工队列(罕见但必须处理)
return None, "unmapped" # 真实缺口(按 locus_type 审计)
print(to_hgnc("P04637", "uniprot")) # TP53 → HGNC:11998
print(bridge.groupby("locus_type").hgnc_id.count().sort_values(ascending=False).head())
# 3) 覆盖率审计:蛋白编码应近全映射;ncRNA 缺口是真实状态(非数据错误)
(桥表的原则是「官方映射优先、模糊匹配禁用」——符号 fuzzy 匹配会引入假链接;「unmapped ≠ 错误」——ncRNA/假基因在部分库的缺口是真实覆盖率,审计按 locus_type 分层报告。)
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用哪些层 | 关键动作 | 陷阱 |
|---|---|---|---|
| 文献实体链接 | alias/prev + symbol | 三键解析 + 歧义队列 | 一对多 alias 直取 |
| 跨库整合 | xref 映射列 | ID 归一 join | 空映射当缺失 |
| 变异注释 | hgnc_id + MANE | 临床报告规范 | 符号漂移断裂 |
| 家族分析 | gene_family/group | 家族聚合 | 家族边界人工性 |
| 数据治理 | ID 主键 + 变更监听 | 快照 + 增量 | 月度文件过期 |
| 跨物种映射 | mgd_id/rgd_id | 同源 ID join | 同符号异物种 |
§5.2 医疗 NLP 实体链接协议
- 词典构建:完整集 symbol/name/alias/prev 全展平 → 词典(token → ID 集)——多值歧义保留集合。
- 消歧规则:上下文窗口内的共现信号(基因-疾病/基因-蛋白搭配)+ 大小写规范(人类基因全大写惯例)——规则层先行,模型层兜底。
- 歧义队列:一对多命中(如同一 alias 指多个基因)进人工核验——抽样评估词典质量(PPV ≥95%)。
- 评估:标准测试集(如 BioCreative/NCBI Disease 语料)上的 precision/recall——词典消歧与模型消歧分层报告。
- 更新:季度快照重载 + 变更文件增量——「词典也是版本化的数据产品」。
§5.3 跨库 ID 归一协议
- 源字段识别:各源库的基因标识(符号/Entrez/Ensembl/UniProt)——先分型再映射。
- HGNC 桥接:全部映射到 HGNC ID——冲突时以「映射列多数 + 手工核验」仲裁。
- 歧义处理:一对多映射(旧符号指向多基因)→ 版本时间戳仲裁(变更前的文献用 prev 语义)。
- 覆盖率审计:每 locus_type 的映射覆盖率——蛋白编码应近 100%,ncRNA 部分缺口是真实状态。
- 落表:归一表(source_id → hgnc_id → 各层 ID)+ 仲裁日志——审计可回放。
§5.4 成本模型
| 场景 | 技术路线 | 成本量级 |
|---|---|---|
| 单文件集成 | JSON 全量加载 | $0(分钟级) |
| 实体链接服务 | 内存索引 | 单机即可 |
| 全库归一 | 映射表 + 仲裁 | 人力为主(数天) |
| 变更监听 | 月度文件 cron | 近零 |
(HGNC 是「零数据成本、纯人力成本」的资源——预算全花在解析器健壮性与歧义仲裁上。)
§5.5 失败模式清单
- 符号当主键:漂移断裂——ID 主键是架构底线。
- alias 一对多直取:假链接丛生——集合语义 + 歧义队列。
- 占位符进生产:C#orf 替换后下游断裂——变更监听。
- locus_type 不滤:假基因当蛋白编码——显式过滤。
- 月度快照过期:365 天删除——季度归档纪律。
- 多值字段解析错:竖线分隔未处理——格式约定先读。
- 同符号跨物种混淆:人类大写 ≠ 鼠类——MGI/RGD ID 桥接。
- withdrawn 复活引用:撤回符号被旧文献引用——withdrawn.txt 去向核查。
§5.6 校准与验证协议
| 验证层 | 数据源 | 指标 | 通过线(参考) |
|---|---|---|---|
| L1 解析完整性 | 完整集全字段 | 解析错误率 | 0(硬线) |
| L2 词典覆盖 | symbol+alias+prev 全展平 | 歧义率 | 报告并分层 |
| L3 实体链接 PPV | 人工核验子集 | precision | ≥95%(词典层) |
| L4 映射覆盖率 | xref 列 × locus_type | 覆盖率 | 蛋白编码近全 |
| L5 变更同步 | symbol-changes | 断点预警率 | 100% 命中 |
| L6 跨库一致性 | 桥表抽查 | ID 一致率 | ≥99%(人工仲裁兜底) |
- L3 是 NLP 应用的灵魂:词典消歧的 PPV 抽检成本低于模型误链的下游代价——200 条人工抽检是性价比拐点。
- L6 的仲裁日志:跨库不一致不是「修掉」而是「记录 + 仲裁」——映射决策可回放是复现性的一部分。
§6 实证结果与方法学分析
§6.1 命名批准节奏的实证观察
- 蛋白编码近完备:官方口径「relatively complete」——新增命名集中在占位符替换与注释器发现基因(Ribo-Seq/phyloCSF 证据);MLDHR/SMIM10L3/RNF228/NPIPA9 是近年新命名的四种典型路径。
- 假基因命名加速:自上次年度报告新增 548 个命名——「暗物质命名化」的持续进程;三类假基因(duplicated/processed/unitary)的系统协议。
- lncRNA 的命名前沿:6,236 已命名但存量更大——「定义规则自动命名」的探索(官方 FUTURE PLANS 明文)——人工评审与规则化的混合演化。
- PGNC 的横向扩张:2024 年把命名范式输出到植物(杨树先行)——「命名委员会」组织形态的可复制性证明。
§6.2 符号稳定性的量化语义
- Stable tag 的机制:临床相关基因符号的稳定性标记(GenCC 协作配套)——「临床场景不要动这个符号」的官方声明。
- 变更率的工程读法:date_symbol_changed 字段的分布显示——多数变更集中在占位符替换与家族重命名;成熟基因符号多年不变——「漂移风险与基因成熟度负相关」。
- alias 表的治理边界:alias 不做官方消歧(官方只保证 prev_symbol 的权威语义)——文献噪声型别名依赖词典工程自担。
- 对知识图谱的含义:基因节点的「合并/拆分」事件以 HGNC ID 生命周期为准——节点稳定性设计引用它的状态机。
§6.3 方法学三层框架(gsm)
- G(Ground layer):符号字符串/ID 数字——机器可测的标识层。
- S(Synthesis layer):映射列/家族归属/变更日志——标准化推断层(人工策展产出)。
- M(Medical layer):临床报告命名规范/MANE 选择/GenCC 有效性——临床语义层(需链接外层资源)。
越层引用:把 alias 命中(G/S 层)当「确认是同一基因」(M 层语义)——一对多歧义的临床误链是 NLP 落地最贵的错误;按层问责 + 歧义降级是纪律。
§6.4 接力实验设计
- HGNC → Ensembl/GENCODE:命名 → 注释(转录本/外显子)。
- HGNC → ClinVar/COSMIC:命名 → 变异证据(临床/体细胞)。
- HGNC → UniProt/AlphaFold:命名 → 蛋白功能与结构。
- HGNC → GenCC/OMIM:命名 → 疾病有效性与表型。
- HGNC → MGI/RGD:人类命名 → 模式生物同源。
§6.5 八个真实坑点
- 坑点 1:符号当主键——漂移断裂;HGNC ID 主键是底线。
- 坑点 2:alias 一对多直取——假链接;集合语义 + 歧义队列。
- 坑点 3:占位符进生产——C#orf 替换断裂;变更监听。
- 坑点 4:locus_type 不滤——假基因/ncRNA 混入蛋白编码分析。
- 坑点 5:月度快照过期——365 天删除;季度归档。
- 坑点 6:多值字段解析错——竖线分隔约定先读。
- 坑点 7:同符号跨物种——大小写惯例不可靠;MGI/RGD 桥接。
- 坑点 8:withdrawn 复活——撤回符号去向核查(withdrawn.txt)。
§6.6 审稿人自查清单
- [ ] 基因命名引用 HGNC 符号 + HGNC ID?
- [ ] 快照版本与检索日期声明?
- [ ] 实体链接的消歧方法(词典/模型)描述?
- [ ] locus_type 过滤声明?
- [ ] 跨物种分析用同源 ID 而非符号?
- [ ] 旧文献符号的回溯(prev/alias)说明?
- [ ] 命名变更事件的时点处理(变更前后的文献引用)?
§6.7 命名系统演进的方法学含义
- REST/OWL/Globus 的分发演进(2022-):「一个 32 MB 文件」到「多通道分发」——基础设施的小而美不排斥通道多样性。
- symbol-changes 文件(2021-09):变更从「藏在 prev 字段」到「一等事件流」——数据系统把「演化本身」产品化的样板。
- MANE/GenCC/AlphaFold 链接(2023):命名报告成为「临床语义链的路由器」——小库嵌入大生态的生存策略。
- PGNC/VGNC 扩张(2022-2024):命名范式的跨物种复制——「委员会评审 + 稳定 ID」模式的通用性证明。
§6.8 命名评审与自动化注释的张力
- 人工评审的不可替代性:命名批准涉及「领域可接受性」(工作人员偏好/家族语义/历史兼容)——纯算法无法裁决;这是 HGNC 慢的根源也是它的价值。
- 自动化的合理边界:lncRNA 系统命名/假基因批量协议——规则可枚举的部分自动化(官方 FUTURE PLANS 明文);「规则内自动、规则外人工」的混合架构。
- 对 AI 数据策展的启示:「快」与「信」的取舍——HGNC 用 40 年证明「人工策展 + 稳定 ID」的信任资产随时间复利;医疗 AI 的数据产品应保留人工策展节点。
§7 AI 就绪指南与应用场景
§7.1 HGNC 在医疗 AI 中的四种喂法
- 实体链接喂法:NER 输出 → 三键解析 → 标准符号/ID——文献挖掘与临床 NLP 的规范化层。
- 知识图谱喂法:基因节点 ID 化 + xref 跨库边——多源知识整合的骨干标识。
- 注释管线喂法:变异注释输出的基因语义层——VEP/ANNOVAR 结果的 HGNC 归一。
- 数据治理喂法:内部库 ID 主键 + 变更监听——符号漂移免疫的架构层。
四种喂法与 §6.5 坑点对应:喂法 1 踩坑 2(alias 一对多);喂法 2 踩坑 7(跨物种符号);喂法 3 踩坑 1(符号主键);喂法 4 踩坑 3(占位符)——建模前回读对号。
§7.2 实体链接服务实操配方
#!/usr/bin/env python3
"""基因实体链接服务:词典 + 消歧规则 + 歧义队列(生产骨架)。
数据:HGNC 快照(季度归档)+ 别名展平词典。"""
import json, re
from collections import defaultdict
class GeneLinker:
def __init__(self, snapshot_json: str):
docs = json.load(open(snapshot_json))["response"]["docs"]
self.by_symbol = {}
self.alias_map = defaultdict(set)
self.by_id = {}
for g in docs:
if g["status"] != "Approved":
continue
hid = g["hgnc_id"]
self.by_id[hid] = g
self.by_symbol[g["symbol"].upper()] = hid
for tok in ([g["symbol"]] + g.get("alias_symbol", [])
+ g.get("prev_symbol", [])):
if tok and re.fullmatch(r"[A-Za-z][A-Za-z0-9@\-\.]{1,14}", tok):
self.alias_map[tok.upper()].add(hid)
def link(self, token: str, context_genes=None):
"""返回 (类型, 候选集);歧义时可用上下文基因集相交消歧。"""
t = token.upper()
if t in self.by_symbol:
return "symbol", {self.by_symbol[t]}
cands = self.alias_map.get(t, set())
if len(cands) > 1 and context_genes:
narrowed = cands & context_genes
if len(narrowed) == 1:
return "alias_ctx", narrowed
return ("alias" if len(cands) == 1 else "ambiguous"), cands
lk = GeneLinker("hgnc_complete_set_2026Q3.json")
print(lk.link("TP53")) # ('symbol', {'HGNC:11998'})
print(lk.link("ABC")) # 多歧义 → ('ambiguous', {...}) 进队列
§7.3 模型选型与迁移决策
- 词典优先:基因名规范化 90%+ 场景词典即可——先词典后模型是成本纪律。
- 上下文消歧模型:歧义项(~10%)用 SciBERT 类上下文分类——训练数据由「无歧义命中」弱监督生成。
- NER 联动:GeneTagger 类 NER + HGNC 词典规范化——「识别与归一」分离架构。
- 不确定性:ambiguous 队列的置信度阈值——临床场景宁可弃链(NULL)不可错链。
- 知识图谱嵌入:xref 层做实体对齐预训练(TransE 类)——多库节点的向量统一。
§7.4 公平性:命名的边缘地带
- 新基因的冷启动:新命名基因无 alias 历史——文献检索的召回在时间维度不均;「命名日期」字段是偏差审计的协变量。
- 领域不平衡:热门基因(肿瘤/免疫)的别名生态远比冷门基因丰富——词典覆盖的领域偏差进 limitation。
- 语言偏差:非英语文献的基因名变体(全角/连字符惯例)——多语种 NLP 的额外映射层。
- 假基因/ncRNA 的二等公民效应:词典工程常忽略非蛋白编码——locus_type 分层评估是公平性自查。
§7.5 任务×资源速查表
| AI 任务 | HGNC 数据 | 输出形态 | 验收 |
|---|---|---|---|
| 实体链接 | symbol/alias/prev | token → HGNC ID | PPV ≥95% |
| 知识图谱 | hgnc_id + xrefs | 节点/边 | ID 一致率 |
| 变异注释归一 | hgnc_id + MANE | 注释标准层 | 无符号断裂 |
| 文献时间线 | date_* + prev | 历史语义图 | 变更事件对齐 |
| 跨物种迁移 | mgd_id/rgd_id | 同源映射 | ID 级桥接 |
| 词典生成 | 全字段展平 | NLP 词典 | 歧义率报告 |
§7.6 端到端案例:临床文献的基因-疾病抽取管线
- 取数:HGNC 季度快照 → GeneLinker 词典(32 MB 进程内)。
- NER:PubMed 摘要流 → 基因名识别(大小写规范 + 词典 gazzetteer 特征)。
- 归一:三键解析 → 歧义项上下文消歧 → 人工队列(预期 ~5%)。
- 抽取:基因-疾病共现 + 触发词(mutate/associate)→ 关系分类。
- 落图:HGNC ID 为节点主键 → 与 ClinVar/GenCC 边对齐。
- 验收:实体链接 PPV ≥95% + 关系抽取 F1 分层报告 + 快照/词典版本声明——三件套齐。
§7.7 报告模板:方法学段落骨架
基因实体链接基于 HUGO 基因命名委员会(HGNC)数据库(genenames.org,2026Q3 季度快照,下载日期 2026-09-15;44,476 已批准符号)。词典由 approved symbol、alias_symbol 与 prev_symbol 字段展平构建,歧义别名保留候选集并以文献上下文共现信号消歧,未决项进入人工核验(占链接总数 [x]%)。全部基因以稳定 HGNC ID 为主键,跨库映射采用官方 xref 字段(Entrez/Ensembl/UniProt 等)。非编码 RNA 与假基因按 locus_type 字段分层处理。符号变更事件通过官方 symbol-changes 文件(2021-09 起)回放校准;撤回符号经 withdrawn 文件核查去向。词典质量经 200 例人工抽检(precision [x]%);全部快照与映射表随复现包发布。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 集成 | 快照下载 + 解析器 | 人力 1-2 天 | 2 天 |
| 词典 | 展平 + 索引 + 歧义分析 | 人力 | 3 天 |
| 消歧 | 规则 + 弱监督模型 | 算力(小) | 1-2 周 |
| 抽检 | 200 例人工 PPV | 人力 | 3 天 |
| 服务化 | API/队列/监听 | 工程 | 1 周 |
| 复现包 | 快照+词典+抽检集 | 人力 | 1 天 |
HGNC 项目的排期风险不在算力在「歧义仲裁的人力排期」——人工核验的吞吐是第一排期项。
§7.9 消融案例:实体链接词典策略的必要性
基因实体链接的词典策略消融(文献 NLP 场景,示意量级):
| 配置 | 词典策略 | 链接质量(示意) | 诊断 |
|---|---|---|---|
| R1 | 仅当前 symbol | 召回 60%;旧文献大量漏链 | 无回溯层 |
| R2 | + alias/prev 展平 | 召回 90%;歧义误链 +8% | 回溯增益与歧义代价并存 |
| R3 | R2 + 一对多保留集合 + 上下文消歧 | 误链回落;弃链率 3% | 歧义队列生效 |
| R4 | R3 + locus_type 分层 + withdrawn 去向核查 | 临床场景零错链 | 生命周期语义闭合 |
- 方法:同一文献流(含 2010 前旧文献 30%);评估锁人工标注集;R3 的上下文用共现基因集相交。
- 读数:R1→R2 的召回增益主要来自旧文献(prev_symbol 命中);R2→R3 的误链回落证明「歧义保留 + 上下文」优于「直取最优」。
- 结论:HGNC 的价值 = 当前命名 + 历史回溯 + 生命周期语义的三位一体——只用 symbol 字段等于用了它三分之一的资产。
§8 伦理、许可与合规
§8.1 许可与使用结构
- 无限制使用:官方 Data release policy——访问与使用零限制;「good faith + 无担保」的公共数据标准条款。
- 学术规范:引用 NAR 年度论文(gkaf1229 等)+ 快照日期——无强制注册/协议;「引用即合规」的轻义务模型。
- 再分发的边界:无限制许可下再分发合法——但「与第三方数据合并后的产品」责任在合并者;下游产品的数据质量声明不可转嫁 HGNC。
- 错误反馈义务:命名错误的官方更正走委员会流程——使用者发现映射错误应反馈(help 渠道)而非私改。
§8.2 引用与致谢模板
致谢模板(按需裁剪):
Gene nomenclature and identifiers were obtained from the HUGO Gene
Nomenclature Committee (HGNC) database at www.genenames.org
(quarterly archive 2026Q3, downloaded 2026-09-15; 44,476 approved
symbols). Citation: Seal RL et al., Genenames.org: the HGNC and PGNC
resources in 2026, Nucleic Acids Research (2026), DOI 10.1093/nar/gkaf1229.
The HGNC is funded by NIH NHGRI (U24HG003345) and the US DOE.
§8.3 国内合规路径
- 数据性质:纯命名/元数据资源——无人类受试者数据/无遗传资源语义——数据层面合规负担近零。
- 使用场景:临床报告软件内嵌 HGNC 词典(无限制许可允许)——但临床报告本身受医疗器械软件监管(与数据来源无关的独立义务)。
- 学术引用:中文文献引用 HGNC 符号时保持英文符号原样(不翻译)——命名标准的国际一致性是引用规范。
§8.4 商业使用边界
- 可以直接商用:无限制许可覆盖商业产品内嵌(注释服务/临床软件/数据库产品)——这是 HGNC 与「CC-BY-NC 类」资源的关键差异。
- 无担保的商业含义:官方明文不承担使用责任——商业产品的错误链接/过期快照风险自担;SLA 设计要内建「季度快照更新 + 变更监听」。
- 竞争性替代的误区:商业命名库(如专有版本)的价值在「增值策展」不在「基础命名」——基础层已被 HGNC 公共品化。
§8.5 合规台账最小模板
| 台账项 | 记录内容 | 示例 |
|---|---|---|
| 快照版本 | 文件 + 官方日期 + 检索日 | 2026Q3(2026-09-15) |
| 词典版本 | 展平规则 + 歧义统计 | 歧义率 x% |
| 更新机制 | 月度监听 + 季度重载 | cron 配置 |
| 错误反馈 | 上报记录 | help 渠道工单 |
| 商用声明 | 无担保知晓 + SLA | 快照更新 SLA |
| 抽检记录 | PPV 人工核验 | 200 例批次 |
§8.6 数据治理的架构语义
把 HGNC 的治理设计抽象为可复用的数据治理模式:
- 身份与标签分离:HGNC ID(身份)/ symbol(标签)——任何实体系统的第一原则;「改标签不动身份」。
- 变更即事件:symbol-changes 文件把演化变成数据——审计/回放/监听三种消费形态。
- 撤回即状态:Entry Withdrawn + 去向映射——「删除」在数据系统里应是状态迁移而非物理抹除。
- 策展即服务:人工评审节点是信任的来源——全自动管道应保留「人工评审节点」作为信任锚。
§9 谱系与生态
§9.1 基因命名时间线
1970s-80s 基因符号混乱时代(各实验室自命名)
1990s HUGO 框架下命名协调启动
1997 HGNC 数据库成体系(剑桥驻地)
2010s NAR 年度论文传统确立
2019 phenotype 符号撤回(移交 OMIM);GenCC 启动
2021-09 symbol-changes 月度文件上线
2022 REST API(HGNC+VGNC);Globus
2023 MANE/GenCC/AlphaFold 链接内建
2024 PGNC 成立(杨树;DOE)
2025 44,476 符号;NAR 2026 论文(gkaf1229)
2026 下载迁入 GCS Bucket;数据政策页重申无限制
§9.2 术语表
| 术语 | 定义 |
|---|---|
| HGNC | HUGO Gene Nomenclature Committee——人类基因命名委员会 |
| HGNC ID | 稳定唯一基因标识(HGNC:nnnnn)——跨符号变更不变 |
| Symbol Report | 单基因人工策展报告页 |
| Gene Group Report | 基因家族/组聚合报告 |
| locus_type | 基因座类型(protein-coding/pseudogene/ncRNA 细分) |
| alias_symbol | 别名符号(非官方但普遍的历史用名) |
| prev_symbol | 前官方符号(HGNC 曾批准、后变更) |
| placeholder | 占位符符号(C#orf/FAM#——功能未明命名) |
| Entry Withdrawn | 撤回状态(符号退场的状态机语义) |
| symbol-changes | 官方符号变更事件文件(2021-09 起月度) |
| MANE Select | RefSeq+Ensembl 联合标准转录本 |
| GenCC | 基因-疾病有效性分级联盟 |
| LSDB | 位点特异性突变数据库 |
| MGI / RGD | 小鼠/大鼠基因组信息学(同源映射) |
| VGNC | 脊椎动物基因命名委员会(REST 同源查询) |
| PGNC | 植物基因命名委员会(2024;杨树先行) |
§9.3 资源选型决策树
你的需求是什么?
├─ 「基因名规范化/实体链接」
│ → HGNC(alias/prev + ID 主键——唯一权威)
├─ 「转录本/外显子注释」
│ → Ensembl/GENCODE(注释层)
├─ 「蛋白功能/结构」
│ → UniProt / AlphaFold DB(蛋白层)
├─ 「变异证据」
│ → ClinVar/COSMIC(变异层)
├─ 「基因-疾病有效性」
│ → GenCC(评估层)+ OMIM(表型)
├─ 「小鼠/大鼠同源」
│ → MGI/RGD(HGNC xref 内建桥)
├─ 「脊椎动物新物种命名」
│ → VGNC(REST 同服务)
└─ 「植物基因命名」
→ PGNC(plant.genenames.org;杨树先行)
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| gencode / ensembl | 注释层——HGNC ID 是其标准字段 |
| clinvar | 变异语义层——基因身份锚点共用 |
| alphafold / uniprot | 蛋白层——Symbol Report 内建结构链接 |
| drugbank / chembl | 靶点层——靶点符号的命名归宿 |
| omim | 表型层——2019 后表型符号的承接方 |
| cosmos(库内) | 体细胞突变——COSMIC 符号字段互查 |
| sra / geo | 数据层——其元数据的基因语义源 |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| 文献基因挖掘 | HGNC(词典)+ PubMed 语料 + ClinVar(验证) | 归一 + 语料 + 证据 |
| 多组学整合 | HGNC(桥表)+ Ensembl + UniProt + PRIDE | ID 归一 + 各层 |
| 临床报告系统 | HGNC(符号)+ MANE(转录本)+ GenCC(有效性) | 命名 + 标准 + 分级 |
| 知识图谱 | HGNC(节点)+ GO/KEGG(通路)+ DisGeNET(疾病) | 身份 + 语义 + 关联 |
| 跨物种比较 | HGNC(人类)+ MGI/RGD(模式生物)+ VGNC(其他) | 同源 ID 桥接 |
组合纪律:ID 为键、符号为面——组合中所有基因以 HGNC ID 连接;符号仅作展示层;快照版本统一声明。
§9.6 命名基础设施的生态角色
HGNC 证明了「人工策展 + 稳定标识 + 完全开放」可以在全球尺度运转 40 年:命名评审保证了「一个基因一个名字」的语义秩序,HGNC ID 的稳定性保证了下游系统的架构安全,无限制许可保证了它被写进每一个工具链。它把「命名」从学术礼仪升级为数据基础设施——全球基因组数据的 join 键因此有了公共品。对医疗 AI,HGNC 是基因语义的「地面真值」:任何涉及基因实体的系统都应以 HGNC ID 为身份层——这是「用公共标准锚定系统架构」的最小成本路径。
§9.7 小库大生态的生存策略
HGNC 的数据体量只有 32 MB——它是本库中最小的数据集之一,却是被引用最广的基础设施之一:
| 维度 | HGNC | 典型大库(SRA 级) |
|---|---|---|
| 体量 | 32 MB | 47 PB |
| 角色 | 语义锚点 | 数据海洋 |
| 更新 | 每月首批 | 持续滚动 |
| 信任来源 | 人工评审 | 规模与官方 |
| 集成成本 | 分钟级 | 天-周级 |
- 生态位原理:数据系统里「被依赖的密度」比「体量」更决定地位——HGNC 是全球基因数据的 join 键密度之王。
- 工程启示:小而关键的基础设施值得专门的工程投入(快照纪律/变更监听/歧义仲裁)——「32 MB 的认真」是高杠杆工程。
§10 资源导航与 FAQ
§10.1 官方资源导航
- 主站 https://www.genenames.org/;下载页 https://www.genenames.org/download/statistics-and-files
- REST API https://rest.genenames.org/;归档帮助 https://hgnc.genenames.org/download/archive
- 命名指南与符号请求 https://www.genenames.org/about(含 guidelines 入口)
- PGNC https://plant.genenames.org/;OWL https://storage.googleapis.com/public-download-files/hgnc/owl/owl/hgnc.owl
上手指引(第一次接入的推荐顺序):
- 下载季度归档完整集(JSON)→ 验证记录数与字段(第一天)。
- 构建三键索引(ID/symbol/alias)→ 歧义率统计。
- 接 REST API 单点查询 → 与本地快照一致性抽查。
- 订阅月度 symbol-changes → 断点预警机制。
- 词典抽检 200 例 → PPV 报告进复现包。
§10.2 关键文献
- Seal, R.L., Braschi, B., Gray, K., McClay, J., Tweedie, S. & Bruford, E. Genenames.org: the HGNC and PGNC resources in 2026. Nucleic Acids Research, gkaf1229 (2025-11-25 在线). DOI 10.1093/nar/gkaf1229
- Seal, R.L. et al. Genenames.org: the HGNC resources in 2023. Nucleic Acids Research 51, D1002-D1009 (2023).
- Braschi, B. et al. Genenames.org: the HGNC resources in 2019. Nucleic Acids Research 47, D693-D698 (2019).
- Yates, B. et al. Genenames.org: the HGNC resources in 2017. Nucleic Acids Research 45, D619-D625 (2017)(历史口径参考).
§10.3 站内延伸阅读
- GENCODE — 基因注释数据库:注释层对位(HGNC ID 标准字段)
- ClinVar — 临床变异知识库:变异证据层的基因锚点
- AlphaFold DB — 蛋白结构数据库:Symbol Report 内建结构链接
- DrugBank — 药物知识库:靶点符号的命名归宿
- UniProt — 蛋白知识库:蛋白层映射(Swiss-Prot reviewed)
- SRA — 测序档案数据库:数据层元数据的基因语义源
§10.4 FAQ
Q1:HGNC 数据真的完全免费吗?
A:是——官方政策明文「No restrictions on access or use」;无注册/无协议/可商用;仅无担保免责。
Q2:HGNC ID 和基因符号什么区别?
A:ID 是永久身份(HGNC:11998 永远指 TP53 基因座);符号是可变标签——工程上 ID 做主键、符号做索引。
Q3:TP53 之外为什么还有别名?
A:历史用名(alias)与旧官方名(prev_symbol)——文献与旧数据库仍在用;检索需要回溯层。
Q4:占位符(C#orf)是什么?
A:功能未明基因的临时命名(如 C11orf53)——功能明确后替换;生产系统要监听替换事件防断裂。
Q5:44,476 里只有 19,294 是蛋白编码?
A:是——其余是假基因(14,603)与 ncRNA(9,574);分析时按 locus_type 过滤。
Q6:假基因也要命名吗?
A:要——假基因是基因组真实结构(三类);命名化使注释/表达分析可精确指代。
Q7:符号会改吗?改了旧文献怎么办?
A:会改(例外情况);旧官方名进 prev_symbol + date_symbol_changed 入档 + 月度变更文件——旧文献可回溯。
Q8:withdrawn 符号还能引用吗?
A:不建议——它是被撤回的命名;withdrawn.txt 提供去向(转移至某 HGNC ID 或 OMIM);引用走新语义。
Q9:怎么批量下载?
A:完整集 JSON/TXT(GCS bucket)或 Globus(多文件推荐);REST 适合单点/小批量。
Q10:REST API 有限速吗?
A:官方未公布硬限速——批量场景仍建议用下载文件(礼仪 + 效率);大规模实时查询自建快照服务。
Q11:HGNC 覆盖非编码 RNA 吗?
A:覆盖——9,574 个(lncRNA 6,236 为主);miRNA 与 miRBase 协调命名。
Q12:lncRNA 命名还在快速增长吗?
A:是——6,236 已命名但存量更大;官方在探索规则化自动命名(FUTURE PLANS 明文)。
Q13:怎么查基因的小鼠同源?
A:Symbol Report 的 mgd_id 字段(MGI ID)——跨物种比较用 ID 不用符号。
Q14:HGNC 管基因功能吗?
A:不管——功能找 UniProt/GO;HGNC 只管「名字与身份」;角色边界是正确用法的起点。
Q15:clinical 基因有特殊标记吗?
A:Stable tag(临床相关基因的稳定性标记)+ GenCC 有效性链接——临床报告场景的官方语义。
Q16:MANE Select 是什么?
A:RefSeq 与 Ensembl 联合标注的标准转录本——临床报告「报哪个转录本」的官方答案;Symbol Report 内建版本化链接。
Q17:phenotype 符号去哪了?
A:2019 年 HGNC 撤回——表型命名职责移交 OMIM;历史符号在 withdrawn 文件有去向。
Q18:数据多久更新一次?
A:每月首批更新完整集;月度/季度归档;symbol-changes 文件月度——变更可全程追溯。
Q19:月度归档会删除吗?
A:会——365 天后删除;长期快照研究用季度归档(官方政策明文)。
Q20:多值字段怎么解析?
A:双引号包裹 + 竖线(|)分隔——TSV 解析器必须处理;JSON 天然数组。
Q21:能查脊椎动物(非人鼠)基因吗?
A:VGNC——REST 同服务(2022 起);覆盖非模式脊椎动物的命名。
Q22:植物呢?
A:PGNC(2024 成立)——杨树(Populus trichocarpa)先行;plant.genenames.org 独立站点;DOE 资助。
Q23:HGNC 与 Ensembl/GENCODE 什么关系?
A:HGNC 批准命名——GENCODE 注释引用 HGNC ID(标准字段);命名与注释两层分工。
Q24:实体链接遇到一对多 alias 怎么办?
A:保留候选集 → 上下文消歧(共现基因/疾病信号)→ 未决进人工队列——「宁弃链不错链」是临床底线。
Q25:怎么引用 HGNC?
A:NAR 年度论文(gkaf1229)+ 快照日期 + 记录数;数据可用性声明写快照版本。
Q26:AI 大模型训练可以用 HGNC 吗?
A:可以——无限制许可覆盖;商用基础模型亦可;产物责任自担(无担保条款)。
Q27:发现自己的基因符号不合适能改吗?
A:向委员会申请——「领域可接受」是准则;占位符替换与功能命名是常见路径;变更全程入档。
Q28:HGNC 和 NCBI Gene 重复吗?
A:不重复——NCBI Gene 是综合信息库(含 HGNC 之外的内容);两者 ID 互映射;命名权威唯一在 HGNC。
Q29:快照和 REST 该用哪个?
A:批处理/生产用快照(季度归档锁版本);单点/交互用 REST——「快照保复现、REST 保新鲜」。
Q30:词典工程的歧义率多大算正常?
A:alias 展平词典的一对多比例在个位数百分比——但集中在高频缩写词(如 ABC/HR 类);分层报告比单数字更有用。
Q31:数据文件迁到 Google Storage 有影响吗?
A:仅 URL 更新(2026)——内容与政策不变;旧书签需更新;Globus/REST 不受影响。
Q32:未来 HGNC 会扩大到哪些物种?
A:官方路线——VGNC 扩脊椎动物覆盖、PGNC 从杨树扩展作物物种(DOE 能源植物语境);「委员会评审」模式是扩张的可复制内核。
Q33:LLM 生成的基因名怎么校验?
A:HGNC 词典双查——存在性(symbol/alias 命中)+ 构词合法性(家族词根模式);幻觉符号是医疗 QA 真实风险(§2.9)。
Q34:一个基因多个 UniProt 登录号怎么处理?
A:uniprot_ids 是多值字段——桥表 explode 展开;映射方向决定唯一性(基因→蛋白一对多正常,反向需消歧)。
Q35:HGNC 的 OWL 文件怎么用?
A:本体工具链(Protégé/SPARQL)——浅层级(locus type/gene group 分类);SciBite 制作维护。
Q36:符号里的特殊字符(@/-/.)合法吗?
A:部分合法(官方命名指南约束)——但多数系统工具对特殊字符敏感;生产系统建议符号标准化 + 保留官方原样的双轨。
§10.5 要点回顾
- ID 主键:符号漂移免疫的架构底线——HGNC ID 永不变。
- 三键结构:ID/symbol/alias+prev——查询优先级与歧义队列。
- locus_type 过滤:假基因/ncRNA ≠ 蛋白编码——显式分层。
- 变更即事件:symbol-changes 月度文件——监听防断裂。
- 季度归档:月度文件 365 天删除——快照纪律。
- 撤回是状态:Entry Withdrawn + 去向映射——不物理删除。
- 多值字段:竖线分隔约定——解析器第一坑。
- 跨物种用 ID:同符号 ≠ 同基因——MGI/RGD 桥接。
- 角色边界:命名归 HGNC、功能归 UniProt、变异归 ClinVar。
- 引用即合规:NAR 年度论文 + 快照日期——轻义务模型。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 44,476 总符号 / 19,294 蛋白编码 / 14,603 假基因 / 9,574 ncRNA(lncRNA 6,236 / miRNA 1,912 / tRNA 591 / snoRNA 568)(2025-09-03)= Seal et al., Genenames.org: the HGNC and PGNC resources in 2026(NAR gkaf1229, 2025-11-25;PMID 41287213)
- 摘要口径 over 44,400 / over 19,250 / ~14,500 / over 9,500 = 同上 NAR 2026 论文摘要
- almost 43,000 = genenames.org/about 页(历史时点口径)
- 新命名案例(MLDHR HGNC:55481 / SMIM10L3 HGNC:56768 / RNF228 HGNC:55809 / NPIPA9 HGNC:41984)与 548 新命名假基因 = NAR 2026 论文正文
- 数据文件体量(JSON 31.6 MB / TXT 16.1 MB / withdrawn 252.9 KB / 2026-09-15)与字段全集 = genenames.org 下载页与 archive 帮助页
- REST API(HGNC+VGNC)/ Globus / symbol-changes(2021-09 起)/ GenCC-AlphaFold-MANE 链接 = Seal et al., NAR 51(2023,PMC9825485)
- 数据政策(无限制使用/无担保)= genenames.org Data release policy 原文
- PGNC(2024 成立;Populus trichocarpa;DOE/橡树岭;plant.genenames.org)= NAR 2026 论文与官网
- 资助(NIH NHGRI U24HG003345 + US DOE + SciBite)= NAR 2026 论文致谢与 Apollo 存档元数据
- 下载链接迁移(GCS Bucket,2026)与归档策略(月度 365 天删除/季度长期保留)= genenames.org 首页公告与 archive 帮助页
- 命名准则要点(占位符替换/禁用模式/家族命名)= genenames.org guidelines 页与 NAR 2026 论文命名案例章节
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- pharos — 共享标签:基因组学与多组学 / 医疗NLP
- omim — 共享标签:基因组学与多组学 / 医疗NLP
- reactome — 共享标签:基因组学与多组学 / 医疗NLP
- gene-ontology — 共享标签:基因组学与多组学 / 医疗NLP
- mtsamples — 共享标签:基因组学与多组学 / 医疗NLP
- mondo — 共享标签:基因组学与多组学 / 医疗NLP
- pharmgkb — 共享标签:基因组学与多组学 / 医疗NLP
- hpo — 共享标签:基因组学与多组学 / 医疗NLP
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

