HGNC 基因命名数据库 — AI-Ready Wikipedia

44,476 个已批准符号 · 19,294 蛋白编码基因 · 稳定 HGNC ID:人类基因命名的全球权威标准

来源 https://www.genenames.org/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 30
HGNC 基因命名数据库 — AI-Ready Wikipedia

信息速览

数据集名称HGNC 基因命名数据库 — AI-Ready Wikipedia
数据类型44,476 已批准符号,19,294 蛋白编码,稳定 HGNC ID,15+ 外部资源映射,完全开放
规模不适用(基因命名标准资源;无患者数据)
接入方式https://www.genenames.org/
AI 就绪度

HGNC — 基因命名数据库 AI-Ready Wikipedia

INFOBOX

属性 内容
全称 HUGO Gene Nomenclature Committee(HGNC)
运营 英国剑桥大学(HUGO 国际框架下的命名权威)
定位 人类基因命名的全球权威标准——批准唯一符号与描述性名称
规模 44,476 已批准符号(2025-09-03):蛋白编码 19,294 / 假基因 14,603 / ncRNA 9,574
核心机制 HGNC ID 稳定唯一——符号可变、ID 永不变;Stable tag 标记临床基因符号
策展 Symbol Reports 人工策展 + Gene Group Reports(家族/组层级)
外部映射 15+ 资源:Entrez/组层级)
外部映射 15+ 资源:Entrez/Ensembl/Vega/UCSC/RefSeq/CCDS/UniProt/Vega/UCSC/RefSeq/CCDS/Ensembl/Vega/UCSC/RefSeq/CCDS/UniProt/MANE/AlphaFold/GenCC/COSMIC/M/MANE/UCSC/RefSeq/CCDS/UniProt/MANE/AlphaFold/GenCC/COSMIC/MGI/RGD/LSDB/ENA/GenCC/COSMIC/MGI/RGD/LSDB/ENA
访问 完全开放:REST API / 完整集 TXT-JSON / OWL / 月季归档 / Globus / Custom Downloads
数据政策 无限制使用(No restrictions;无担保免责)
更新节奏 每月首批更新;symbol-changes 文件(2021-09 起月/季度)
扩展项目 PGNC(2024 成立;杨树命名)/ VGNC(脊椎动物;REST 同源查询)
资助 NIH NHGRI(U24HG003345)+ US DOE + SciBite(Elsevier)
本库关联 Ensembl/GENCODE(注释)、
本库关联 Ensembl/GENCODE(注释)、ClinVar(变异语义)、AlphaFold DB(结构)、DrugBa(变异语义)、AlphaFold DB(结构)、linVar(变异语义)、AlphaFold DB(结构)、DrugBank/ChEMBL(靶点符号归宿)

§0 E-E-A/ChEMBL(靶点符号归宿) |

§0 E-E-A-T 信任声明与免责声明

本页所有规模数字、字段清单与访问口径均核实自一手来源:HGNC 官方 NAR 年度论文(Seal et al., Genenames.org: the HGNC and PGNC resources in 2026, NAR gkaf1229, 2025-11-25 在线;PMID 41287213)、genenames.org 官网与下载页(hgnc_complete_set.json 31.6 MB,2026-09-15 更新)、HGNC data archive 帮助页(字段全集与归档策略)与 2023 年度论文(REST API/symbol-changes/GenCC/AlphaFold/MANE 链接,PMC9825485)。检索核实时间为 2026-09-19。

HGNC 的符号总数随批准节奏滚动(约每月首批更新)——本页采用 2025-09-03 精确数(44,476)与 NAR 2026 论文摘要口径(over 44,400)双轨标注;「19,294 蛋白编码」是同日快照,引用时注明时点。

本页为技术参考文档:HGNC 提供「命名与 ID 语义」——不提供基因功能验证(功能有效性见 GenCC/ClinVar 层)、不提供序列本体(序列见 RefSeq/Ensembl)、不构成临床决策依据;数据无限制使用但无担保(官方 Data release policy 原文)。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:人类基因命名的全球权威——「每个基因一个唯一符号 + 一个永不变的 ID」的官方注册处。
  • 体量:44,476 符号(19,294 蛋白编码 / 14,603 假基因 / 9,574 ncRNA);15+ 外部资源人工映射。
  • 访问:完全开放——REST API / JSON-TXT 完整集(16-32 MB)/ OWL / 月季归档 / Globus。
  • 杀手锏:HGNC ID 的稳定性——符号可以改、ID 永不变;这是所有下游数据库(ClinVar/Ensembl/DrugBank)的基因身份锚点。
  • 适用:基因实体链接(NLP)、跨数据库 ID 归一、变异注释的基因语义层、临床报告的标准符号、基因家族分析。
  • 不适用:基因功能查询(用 UniProt/GO)、序列获取(用 RefSeq/Ensembl)、变异数据(用 ClinVar/dbSNP)、非人物种命名(动物用 VGNC/植物用 PGNC,覆盖度有限)。

§1.1 摘要

人类基因组约有 19,000 个蛋白编码基因——但它们在文献里有过多少个名字?同一个基因,一个团队叫它 A,另一个叫它 B,第三个拼写错了——基因命名混乱曾是基因组学的系统性公害。HUGO 基因命名委员会(HGNC)就是这个公害的官方解:基于剑桥大学的委员会逐个批准「唯一符号 + 描述性名称」,到 2025 年 9 月已批准 44,476 个符号(蛋白编码 19,294、假基因 14,603、非编码 RNA 9,574)。每个基因携带一个稳定不变的 HGNC ID——符号可以随科学认识更新,但 ID 永不改变;这个设计使 HGNC 成为全球基因组数据库的「基因身份锚点」。

对 AI 团队,HGNC 的价值在四个维度:

  1. 实体链接的金标准:医疗 NLP 的基因名识别(NER)之后的规范化(normalization)环节,alias/prev_symbol 表是回溯历史的唯一权威映射——「文献里出现的符号 → 当前标准符号」的桥梁。
  2. 跨库 ID 归一的中枢:Entrez/Ensembl/UniProt/RefSeq/CCDS/UCSC/MGI/RGD/COSMIC 的 15+ 映射人工维护——多库数据整合的 join 键不必再各自维护映射表。
  3. 临床语义的命名层:MANE Select 转录本标准、GenCC 有效性链接、Stable tag——临床报告「写哪个基因名、报哪个转录本」的规范出处。
  4. 命名治理的活样本:占位符替换(C#orf → 功能命名)、withdrawn 语义(撤回符号的去向追踪)、符号变更公开(月度文件)——「命名系统如何管理自己的演化」的工程范本。

数据的第一性事实:符号是易变的、ID 是稳定的——生产系统以 HGNC ID 为主键、符号为索引、alias/prev 表为回溯层——「三键结构」是用好 HGNC 的第一课。

§1.2 战略价值

  1. 消除同义混乱的公共品:命名混乱的直接代价是「文献检索漏检/数据库 join 错行」——HGNC 的唯一符号标准使全球基因组文献与数据库有了共同语言;期刊(Nature Genetics/Genome Research)与数据库(Ensembl/NCBI/MGI/OMIM)是它的强制推广层。
  2. 历史兼容的工程智慧:prev_symbol/alias_symbol/date_symbol_changed 的全程记录——「旧文献里的基因」在今天的数据库里仍可回溯;这是「标准如何尊重历史」的范本。
  3. 人工策展的信任层:44,476 个 Symbol Report 逐个人工维护——「基因家族归属/命名依据/外部映射」的策展质量是纯自动管道无法替代的信任资产。
  4. 命名生态的扩展:PGNC(2024,杨树)与 VGNC(脊椎动物)把「唯一符号 + 稳定 ID」范式输出到植物与比较基因组——命名标准的可复制性证明。

§1.3 同类数据集横向对比

资源 定位 规模量级 与 HGNC 的关系
HGNC 人类基因命名权威 44,476 符号 —
Ensembl/GENCODE 基因注释(转录本/外显子) 6 万+ 基因座 注释层(HGNC ID 是其标准输出字段)
NCBI Gene 基因综合信息(Entrez) 数万人类基因 Entrez ID 与 HGNC ID 双向映射
UniProt 蛋白序列与功能 2 万+ 人类 reviewed 蛋白层(Symbol Report 内建映射)
MGI/RGD 小鼠/大鼠同源命名 数万同源 同源映射(跨物种比较的桥)
OMIM 遗传病表型-基因 数千表型 表型符号承接方(2019 HGNC 撤回后)
GenCC 基因-疾病有效性分级 数千评估 临床有效性层(HGNC 链接内建)
GO 功能本体 数万条目 功能语义层(与命名正交)

§1.4 版本时间轴

1990s  HUGO 框架下命名委员会工作展开(Doyle 等 FUSE 会议推动统一)
1997  HGNC 数据库成体系运营(剑桥大学驻地)
2010s  NAR 年度论文系列确立(每年一报的数据库综述传统)
2019  phenotype 符号撤回(表型命名移交 OMIM);GenCC 协作启动
2021-09  symbol-changes 月度文件上线(符号变更全程可追溯)
2022  REST API 发布(HGNC + VGNC 同源查询);Globus endpoint
2023  GenCC/AlphaFold/MANE 链接内建 Symbol Report;auto-suggest 检索升级
2024  PGNC 成立(DOE 资助;杨树命名;plant.genenames.org 上线)
2025  44,476 符号(2025-09-03);NAR 2026 论文提交(gkaf1229)
2026  数据文件迁入 Google Storage Bucket(下载链接全量更新)

§1.5 应用场景矩阵

  1. 基因实体链接(NLP):文献/EHR 文本中的基因名 → 标准符号——alias/prev 表是回溯层。
  2. 跨库 ID 归一:Entrez/Ensembl/UniProt 多源 join——HGNC 映射列是现成桥表。
  3. 变异注释管线:VEP/ANNOVAR 类工具的基因语义层——HGNC ID 进注释输出。
  4. 临床报告生成:MANE Select 转录本标准 + 稳定符号——临床分子报告的命名规范。
  5. 基因家族分析:Gene Group/Gene Family 字段——家族级聚合的现成分组。
  6. 数据治理:内部数据库以 HGNC ID 为主键——符号漂移免疫的架构决策。

§1.6 组件全景

HGNC 数据的六个层:

  1. 符号核心层:hgnc_id / symbol / name / status(Approved | Entry Withdrawn)/ locus_group / locus_type / location(细胞遗传位置)。
  2. 历史回溯层:alias_symbol / alias_name / prev_symbol / prev_name / date_approved_reserved / date_symbol_changed / date_name_changed / date_modified。
  3. 家族组织层:gene_family / gene_family_id + Gene Group Reports(层级聚合)。
  4. 外部映射层:entrez_id / ensembl_gene_id / vega_id / ucsc_id / ena / refseq_accession / ccds_id / uniprot_ids / pubmed_id / mgd_id / rgd_id / cosmic / lsdb。
  5. 撤回与变更层:withdrawn.txt(撤回符号去向)/ symbol-changes 月度文件(2021-09 起)。
  6. 分发层:REST API(rest.genenames.org)/ TXT-JSON 完整集 / OWL / 月季归档(GCS)/ Globus / Custom Downloads。

§1.7 完全开放的数据经济学

  1. 无限制使用:官方 Data release policy 明文「No restrictions on access to, or use of, the data」——好意提供、无担保免责;这让 HGNC 成为商业工具链(临床报告软件/注释服务)可直接内建的基础设施。
  2. 分发成本的外包:下载文件迁入 Google Storage Bucket——静态分发的带宽成本由云承担;Globus 供批量传输(网络故障免疫)。
  3. 人工策展的成本结构:NIH NHGRI 核心资助(U24HG003345)+ DOE(PGNC)+ SciBite 捐赠(OWL)——「公共资助 + 企业公益」的混合模式。
  4. 治理成本的同构:命名请求来自全球科学家/期刊/数据库——委员会评审是人工瓶颈但也是质量来源;「慢审批换高信任」是 HGNC 与自动注释库的本质差异。

§1.8 HGNC 在研究流程中的定位

基因发现 → 命名批准 → 注释分发 → 语义应用 → 跨库整合
   │           │           │           │           │
   │           ├─ HGNC:唯一符号 + 稳定 ID(命名权威)
   │           ├─ HGNC:15+ 外部 ID 映射(整合中枢)
   │           ├─ HGNC:alias/prev 回溯(历史兼容)
   │           └─ HGNC:withdrawn 去向(生命周期闭环)
   └─ Ensembl/RefSeq(注释)→ ClinVar/COSMIC(变异)→ 临床报告
流程阶段 HGNC 角色 典型用法 验收标准
基因发现 命名入口 新基因符号请求 符号唯一且合规
注释分发 语义锚点 HGNC ID 进 GFF3/注释表 ID 与符号一致
语义应用 规范层 临床报告/MANE 选择 Stable tag 核验
跨库整合 桥表 多源 ID 归一 映射无歧义
历史回溯 兼容层 旧文献符号解析 prev/alias 命中

定位纪律:HGNC 管「名字与身份」——功能找 UniProt/GO、序列找 RefSeq/Ensembl、变异找 ClinVar、有效性找 GenCC;把 HGNC 当「基因百科」用是角色错位。

§1.9 命名治理的独特设计

  1. 「符号唯一、ID 永恒」的双轨:符号是面向人类的(要好记好读),ID 是面向机器的(要绝对稳定)——HGNC 用双轨制解了「可读性 vs 稳定性」的对立。
  2. 占位符的生命周期:C#orf/FAM# 类占位符在功能明确后替换——替换计划公开、变更日期入档;「诚实的不完美」优于「伪装的完整」。
  3. 撤回不是删除:Entry Withdrawn 状态 + withdrawn.txt 去向映射——「错误的命名」以可追溯方式退场;数据系统里的「删除」哲学:标记而非抹除。
  4. 对 AI 的含义:命名治理预示知识系统设计的一般原则——「实体身份与实体标签分离 + 全程变更日志 + 生命周期状态机」;这三件套是任何实体链接系统的架构模板。

§2 医学与科学背景

§2.1 为什么基因命名是医学问题

  1. 临床报告的歧义代价:分子诊断报告里「同一个基因两个名字」会引发检测差异/治疗误判——临床实验室的命名一致性依赖 HGNC 标准;Stable tag 标记「临床场景下不要随意改动的符号」。
  2. 药物靶点的语义统一:药企靶点数据库/文献/专利中的基因名各异——ChEMBL/DrugBank 的靶点字段以 HGNC 符号为标准;「靶点 = 基因 = 蛋白」的三方对齐靠 HGNC ID。
  3. 遗传病文献的检索完整性:旧符号命名的文献在新符号检索下漏检——MEDLINE 检索用 alias/prev 表扩展是系统综述的标准动作。
  4. 多组学数据整合:转录组(Ensembl)× 蛋白组(UniProt)× 突变(COSMIC)的三方 join——HGNC 映射列是「同人 join 键」的事实标准。

§2.2 符号漂移的语义与工程应对

  1. 漂移的三种形态:正式变更(prev_symbol 记录,date_symbol_changed 入档)、别名并存(alias_symbol,非官方但普遍)、拼写变体(文献噪声,无官方记录)——三层噪声需要三种处理。
  2. alias 表的边界:alias 是「曾经用于指代该基因的符号」——但不保证「该符号在别处不指代其他基因」;一对多歧义是实体链接的核心难点(同符号异基因/异符号同基因并存)。
  3. 工程三键结构:HGNC ID(主键)/ symbol(当前索引)/ alias+prev(回溯索引)——查询优先级「ID > symbol > alias」;歧义命中(一个 alias 对多个 HGNC ID)时降级为人工核验队列。
  4. 版本纪律:每月首批更新——生产系统锁快照(季度归档)+ 变更文件增量同步;「实时追最新」与「锁快照可复现」的取舍要显式声明。

§2.3 占位符符号的治理语义

  1. 占位符的产生:新基因功能未明时以 C#orf(chromosome N open reading frame)/FAM#(family with sequence similarity)命名——诚实标注「我们还不知道它是什么」。
  2. 替换的触发:功能文献发表后委员会批准新符号(如 MLDHR 替换微肽编号类命名、SMIM10L3 按家族归位)——替换是「例外情况」,需功能证据。
  3. 生产系统的影响:占位符进入生产(报告/数据库)后替换会造成下游断裂——工程对策是「以 ID 为主键 + 占位符替换监听(date_symbol_changed 字段)」。
  4. 注释时代的边际变化:蛋白编码命名已相对完备(官方口径),新命名增量转向 lncRNA/假基因与注释器发现的基因(Ribo-Seq/phyloCSF 证据)——「命名前沿」在暗物质层。

§2.4 非编码 RNA 与假基因的命名语义

  1. ncRNA 的 9,574:lncRNA 6,236 为主体——lncRNA 命名的系统协议(HGNC 与 Gencode/GENCODE 协作);miRNA 1,912 沿用 miRBase 协调命名;tRNA/snoRNA 按注释规则。
  2. 假基因的三类:duplicated(未加工)/ processed(反转录插入)/ unitary(单一化)——14,603 的假基因目录是「基因组暗物质」的命名化;假基因符号在注释管线里常被误当蛋白编码——locus_type 过滤是铁律。
  3. 分析含义:表达定量/变异注释对假基因区域的映射歧义(processed 假基因与母基因序列同源)——HGNC locus_type + 基因组坐标双确认是防错配的标准动作。
  1. MANE Select:RefSeq 与 Ensembl/GENCODE 联合标注的「标准转录本」——临床报告「报哪个转录本」的官方答案;HGNC Symbol Report 内建版本化链接(NM_xxx.3 + ENSTxxx.12)。
  2. GenCC:基因-疾病有效性分级(Definitive/Strong/…)——「这个基因和这个病的关系有多确凿」的官方评估层;HGNC 2023 起内建链接。
  3. LSDB:位点特异性突变数据库(基因专病数据库)——临床变异的深度资源入口;lsdb_links 文件提供全表。
  4. 组合纪律:HGNC(命名)→ MANE(转录本)→ GenCC(有效性)→ ClinVar(变异证据)——临床语义链的四层各司其职;跨层直连是误用。

§2.6 与 OMIM 的分工演变

2019 年 HGNC 撤回 phenotype 符号(无基因归属的表型命名)——表型命名职责移交 OMIM;「基因符号」与「表型符号」的边界从此清晰:HGNC 只命名已确认的基因座,OMIM 命名表型/座位。历史 phenotype 符号在 withdrawn 文件有去向记录——旧文献检索时注意这一历史断层。

§2.7 AI 视角的科学定位

对医疗 AI,HGNC 是「基因实体消歧的地面真值」:NER 模型的输出规范化、知识图谱的基因节点 ID 化、多组学数据的 join 键、临床 NLP 的报告语义层。它的短板(命名不覆盖功能/映射人工维护的滞后)都是「人工策展」的固有代价——用它的方法论核心是「ID 主键 + alias 回溯 + 快照锁定」三件套,外加 GenCC/UniProt 层补足语义。

§2.8 跨物种命名的边界

  1. VGNC(脊椎动物):HGNC 的姊妹委员会——命名脊椎动物(非人/鼠主流模式生物)基因;REST API 同源查询(2022 起支持 VGNC)。
  2. MGI/RGD 同源映射:人类基因的小鼠(MGI)/大鼠(RGD)同源 ID 内建于 Symbol Report——跨物种比较的现成桥。
  3. PGNC(植物):2024 成立——杨树(Populus trichocarpa)先行;DOE 能源植物研究语境;plant.genenames.org 独立站点。
  4. 工程含义:跨物种数据整合时「符号相同 ≠ 基因相同」——大写(人类)/首大写(鼠类)惯例之外仍有同符号异物种陷阱;同源映射用 MGI/RGD ID 而非符号。

§2.9 符号的语言学:命名法的构词法

HGNC 符号不是随机字符串——它有一套演化了数十年的构词法,理解构词法是实体链接与生成模型的基础:

  1. 基因家族词根:SMIM(small integral membrane protein)/RNF(ring finger)——家族词根 + 序号后缀(SMIM10L1/L2A/L2B/L3 的亚型语义);家族归属变化会触发符号重命名。
  2. 功能描述缩写:TP53(tumor protein p53)/BRCA1(breast cancer 1)——历史功能命名保留即使功能认识更新(「名不副实」是常态——BRCA1 不只与乳腺癌相关)。
  3. 物种前缀惯例:人类全大写、鼠类首大写(Traf6 vs TRAF6)——大小写在跨物种检索中不可靠但仍是强先验信号。
  4. 禁用模式:氨基酸残基数(MP31 被拒)、基因型名(病名缩写被拒)——MLDHR 案例展示「作者命名 → 委员会重命名」的标准流;NER 模型应学习「候选符号的构词合法性」作为置信特征。
  5. 对生成式 AI 的含义:LLM 幻觉基因名(不存在的符号)是医疗 QA 的真实风险——生成后用 HGNC 词典校验(词法 + 存在性双查)是落地底线。

§3 数据集规格

§3.1 规格总表

维度 规格(2025-09-03 快照 / 2026-09 数据文件)
总符号 44,476
蛋白编码 19,294
假基因 14,603(duplicated/processed/unitary 三类)
ncRNA 9,574(lncRNA 6,236 / miRNA 1,912 / tRNA 591 / snoRNA 568)
主键 HGNC ID(HGNC:nnnnn;跨符号变更不变)
状态机 Approved / Entry Withdrawn
外部映射 15+ 资源(Entrez/Ensembl/Vega/UCSC/ENA/RefSeq/CCDS/UniProt/PubMed/MGI/RGD/LSDB/COSMIC)
分发 REST API / TXT 16.1 MB / JSON 31.6 MB / OWL / 月季归档 / Globus / Custom Downloads
许可 无限制使用(无担保)
更新 每月首批;symbol-changes 文件(2021-09 起月/季)
扩展 PGNC(2024 杨树)/ VGNC(脊椎动物 REST 同源)

§3.2 数据文件的构成地图

文件 内容 体量(2026-09-15)
hgnc_complete_set.txt 全部已批准符号(全字段 TSV) 16.1 MB
hgnc_complete_set.json 同上(JSON) 31.6 MB
withdrawn.txt / .json 撤回符号与去向 252.9 KB / 642.4 KB
genes_within_groups 组/家族层级展开 TXT+JSON
lsdb_links.txt.gz 位点特异数据库链接 14.6 KB
symbol-changes 月/季文件 符号变更事件(2021-09 起) 小文件组
hgnc.owl 本体化(SciBite) 浅层级 OWL

解读:单文件即全量(32 MB 级)——HGNC 是「一个文件装下的命名宇宙」;归档在 GCS bucket,月度文件 365 天后删除(季度归档长期保留)——快照纪律的政策出处。

§3.3 DAIMS 数据AI就绪度评估

维度 D 数据完整性 评分 说明
D1 覆盖完整性 9/10 人类基因命名全覆盖;蛋白编码近完备
D2 语义深度 7/10 命名+家族+位置;功能语义不覆盖(角色边界)
D3 历史兼容 10/10 prev/alias/date 全程记录——档案类满分
D4 多组学 6/10 ID 映射层覆盖多组学键;本体层无表达/序列
A1 机器可读 10/10 REST/JSON/TXT/OWL/Globus 全通道
A2 文档完备 9/10 字段说明/归档帮助/命名指南齐备
A3 接入成本 10/10 免注册免限制;32 MB 单文件全量
A4 更新机制 9/10 月度节奏 + 变更文件增量——复现友好
I1 指标标准化 9/10 命名标准本体;字段语义文档化
I2 可复现性 9/10 归档快照 + 变更日志——时间旅行可复现
M1 多模态对齐 7/10 ID 映射即对齐层;语义对齐靠外层
M2 时间序列 8/10 变更日志即时间序列(命名域)
S1 数据安全 9/10 无人类数据——安全负担近零
S2 合规负担 10/10 无限制使用——合规负担最轻档

总分:A 级(机器可读/接入成本/合规负担三项满分——「小而完美的基础设施」的 DAIMS 典型;扣分项只在语义深度与角色边界——它本来就不管那些)

§3.4 存储与计算需求

场景 体量 建议
全量快照 32 MB JSON 单机内存级——直接加载
REST 单点查询 KB 级 实时查询(限速礼仪)
实体链接服务 32 MB + 索引 进程内哈希表(百万查询/秒级)
跨库映射表 数 MB 抽取 Custom Downloads 自选字段
历史研究 月/季归档 GCS 批量(Globus 传输)

HGNC 的工程重心是「小数据大语义」——无需分布式;索引结构(alias → ID 的多值哈希)才是工程重点。

§3.5 获取通道

  1. REST API:rest.genenames.org——单点查询(/fetch/hgnc_id/HGNC:9588)/ 批量(/fetch/symbol/TP53 类);VGNC 同服务。
  2. 完整集下载:genenames.org/download/statistics-and-files → GCS bucket——TXT/JSON 双格式;引用页标日期。
  3. Custom Downloads:自选字段导出——只要映射列的轻量集成。
  4. OWL:hgnc.owl——本体工具链(Protégé/SPARQL)接入。
  5. Globus:批量文件传输——多文件/大文件推荐(网络故障免疫)。
  6. 归档:月度(365 天)/季度(长期)快照——历史复现用季度档。

§3.6 口径对齐表

数字 出处口径 澄清
44,476 总符号 NAR 2026 论文(2025-09-03 精确数) 本页主口径
over 44,400 / over 19,250 蛋白编码 NAR 2026 摘要抽象口径 同源抽象表述
almost 43,000 genenames.org/about 页 历史时点(页面更新滞后)
19,294 / 14,603 / 9,574 NAR 2026(2025-09-03) 三大类精确数
lncRNA 6,236 / miRNA 1,912 / tRNA 591 / snoRNA 568 NAR 2026 ncRNA 细分
548 named pseudogenes(自上次报告起) NAR 2026 假基因命名增量
31.6 MB / 16.1 MB 下载页(2026-09-15) 文件体量快照

§3.7 版本选择纪律

  1. 快照锁定:生产系统锁季度归档——「2026Q3 快照」进复现包;月度追新的服务声明追新策略。
  2. 变更同步:symbol-changes 文件做增量监听(date_symbol_changed/prev_symbol 字段)——占位符替换/家族重命名的下游断点预警。
  3. 归档期限:月度文件 365 天删除——长期研究一律季度归档(政策明文)。
  4. 双状态语义:Approved 与 Entry Withdrawn 同文件共存(status 字段)——「withdrawn 是状态不是删除」;withdrawn.txt 是撤回专属表。

§3.8 字段与映射详表

字段组 字段 用途
身份 hgnc_id / symbol / name / status 主键与当前命名
位置 location / location_sortable 细胞遗传位置(排序变体)
类型 locus_group / locus_type 蛋白编码/假基因/ncRNA 细分
历史 alias_symbol / alias_name / prev_symbol / prev_name 实体链接回溯层
变更 date_approved_reserved / date_symbol_changed / date_name_changed / date_modified 全程时间戳
家族 gene_family / gene_family_id 家族/组聚合
序列库 ena / refseq_accession / ccds_id 核酸层映射
注释库 ensembl_gene_id / vega_id / ucsc_id / entrez_id 基因注释层映射
蛋白层 uniprot_ids Swiss-Prot/TrEMBL 映射
同源 mgd_id(小鼠)/ rgd_id(大鼠) 跨物种桥
临床/文献 pubmed_id / lsdb / cosmic 文献/专病库/COSMIC 符号
  1. 多值字段:双引号包裹 + 竖线分隔(官方格式约定)——解析器的第一个坑。
  2. 映射列的空值语义:无映射 ≠ 数据缺失——「该基因在目标库无对应」是真实状态;映射覆盖率按 locus_type 分层统计。

§4 数据结构

§4.1 对象模型

HGNC 数据模型
├── Gene(HGNC:nnnnn)
│   ├── identity(symbol/name/status/locus_type/location)
│   ├── history(alias*/prev*/date_* 四时间戳)
│   ├── family(gene_family/gene_family_id → Gene Group Report)
│   ├── xrefs
│   │   ├── sequence(ena/refseq/ccds)
│   │   ├── annotation(ensembl/vega/ucsc/entrez)
│   │   ├── protein(uniprot_ids)
│   │   ├── homolog(mgd_id/rgd_id)
│   │   └── clinical/literature(lsdb/cosmic/pubmed_id)
│   └── lifecycle(Approved ⇄ Entry Withdrawn + withdrawn 去向)
├── SymbolChange(月/季文件:hgnc_id/old/new/date)
└── Withdrawn(withdrawn.txt:旧符号 → 去向/HGNC ID 或 OMIM)

§4.2 完整集加载与快照管理

#!/usr/bin/env python3
"""HGNC 完整集加载:JSON 全量 → 内存索引(三键结构)。
快照纪律:锁季度归档文件 + 记录下载日期。"""
import json, datetime
from collections import defaultdict

SNAPSHOT = "hgnc_complete_set_2026Q3.json"   # 季度归档(长期保留)
with open(SNAPSHOT) as f:
    genes = json.load(f)["response"]["docs"]
print(f"genes: {len(genes)}; snapshot date: 2026-09-15")

# 三键索引:ID 主键 / symbol 索引 / alias+prev 回溯索引
by_id = {g["hgnc_id"]: g for g in genes if g["status"] == "Approved"}
by_symbol = {g["symbol"]: g["hgnc_id"] for g in genes if g["status"] == "Approved"}
alias_index = defaultdict(set)               # alias 可多对多——集合语义
for g in genes:
    if g["status"] != "Approved":
        continue
    for a in g.get("alias_symbol", []) + g.get("prev_symbol", []):
        alias_index[a].add(g["hgnc_id"])

def resolve(token: str):
    """实体链接解析:ID > symbol > alias;歧义返回候选集。"""
    if token.startswith("HGNC:"):
        return ("id", {token} if token in by_id else set())
    if token in by_symbol:
        return ("symbol", {by_symbol[token]})
    return ("alias", alias_index.get(token, set()))

print(resolve("TP53"))            # ('symbol', {'HGNC:11998'})
print(resolve("C11orf53"))        # 占位符 → 当前符号(已替换则回溯命中)

§4.3 REST API 查询

#!/usr/bin/env bash
# REST API:单点与批量查询(rest.genenames.org)
# 1) 按 ID 查
curl -s "https://rest.genenames.org/fetch/hgnc_id/HGNC:11998" | python3 -m json.tool | head -20
# 2) 按符号查
curl -s "https://rest.genenames.org/fetch/symbol/TP53" -H "Accept: application/json"
# 3) 按前符号查(实体链接回溯)
curl -s "https://rest.genenames.org/fetch/prev_symbol/MLDHR"
# 4) 按 locus_type 批量(蛋白编码全表)
curl -s "https://rest.genenames.org/fetch/locus_type/gene%20with%20protein%20product" | \
  python3 -c "import json,sys; d=json.load(sys.stdin); print(d['response']['numFound'])"
# 5) VGNC 同源查询(2022 起支持)
curl -s "https://rest.genenames.org/fetch/vgnc_id/VGNC:1" -H "Accept: application/json"

§4.4 变更监听(symbol-changes 增量)

#!/usr/bin/env python3
"""月度 symbol-changes 文件 → 下游断点预警。
场景:生产数据库的符号列同步(占位符替换/家族重命名)。"""
import csv, glob

def load_changes(month_glob="symbol-changes_2026-*.tsv"):
    changes = []
    for path in sorted(glob.glob(month_glob)):
        with open(path) as f:
            for row in csv.DictReader(f, delimiter="\t"):
                changes.append({
                    "hgnc_id": row["hgnc_id"],
                    "old": row["symbol_old"],
                    "new": row["symbol_new"],
                    "date": row["date_of_change"],
                })
    return changes

for ch in load_changes():
    # 生产表里命中旧符号 → 触发更新工单(不静默改写——审计留痕)
    hit = my_db.query_symbol(ch["old"])
    if hit:
        print(f"[ALERT] {ch['hgnc_id']}: {ch['old']} -> {ch['new']} @ {ch['date']}")

§4.5 元数据与可复现指纹

  1. 快照三元组:文件名 + 官方日期(下载页标注)+ 检索日期——复现包第一件。
  2. 变更基线:symbol-changes 起始月份——「基线之后的所有变更」可增量回放。
  3. 解析器版本:多值字段分隔符/字段名——HGNC 字段扩展(2023 加 MANE/GenCC 链接)会破旧解析器——「宽松解析 + 未知字段保留」的健壮姿势。

§4.6 完整性清单

  • [ ] 快照文件 + 官方日期 + 检索日期三戳
  • [ ] ID 主键架构(非符号主键)确认
  • [ ] alias/prev 回溯索引构建
  • [ ] 多值字段分隔符解析正确
  • [ ] locus_type 过滤显式(假基因/ncRNA 边界)
  • [ ] withdrawn 状态处理(状态机而非删除)
  • [ ] 变更监听机制(月度文件)
  • [ ] 歧义命中的人工核验队列

§4.7 数据血缘

全球基因发现(文献/注释/测序)
  → 命名请求(科学家/期刊/数据库提交)
  → HGNC 委员会评审(人工批准)
  → Symbol Report 策展(外部映射人工维护)
  → 数据文件发布(月度 + 归档 GCS)
  → 下游库同步(Ensembl/NCBI/ClinVar/UniProt 引用)
  → 命名应用(文献/临床报告/注释管线/实体链接)

「发现 → 请求 → 评审 → 策展 → 发布 → 同步 → 应用」七段血缘——HGNC 的血缘核心是「人工评审节点」:这是它与全自动注释库的本质区别,也是它的信任来源。

§4.8 跨库 ID 归一(桥表构建)

#!/usr/bin/env python3
"""多源基因 ID 归一:Entrez/Ensembl/UniProt → HGNC ID 桥表。
数据:HGNC 快照 xref 列(官方人工维护映射——不要自建符号 fuzzy 匹配)。"""
import json
import pandas as pd

docs = json.load(open("hgnc_complete_set_2026Q3.json"))["response"]["docs"]
rows = []
for g in docs:
    if g["status"] != "Approved":
        continue
    rows.append({
        "hgnc_id": g["hgnc_id"], "symbol": g["symbol"],
        "locus_type": g["locus_type"],
        "entrez": g.get("entrez_id"), "ensembl": g.get("ensembl_gene_id"),
        "uniprot": g.get("uniprot_ids"),   # 多值映射:JSON 中已是 list
    })
bridge = pd.DataFrame(rows)

# 1) 展开多值列(uniprot 可一基因多蛋白登录号)
bridge = bridge.explode("uniprot")

# 2) 归一函数:任意 ID → hgnc_id(歧义返回全部候选)
def to_hgnc(value: str, col: str):
    hits = bridge[bridge[col] == value]["hgnc_id"].tolist()
    if len(hits) == 1:
        return hits[0], "unique"
    if len(hits) > 1:
        return hits, "AMBIGUOUS"          # 进人工队列(罕见但必须处理)
    return None, "unmapped"               # 真实缺口(按 locus_type 审计)

print(to_hgnc("P04637", "uniprot"))       # TP53 → HGNC:11998
print(bridge.groupby("locus_type").hgnc_id.count().sort_values(ascending=False).head())
# 3) 覆盖率审计:蛋白编码应近全映射;ncRNA 缺口是真实状态(非数据错误)

(桥表的原则是「官方映射优先、模糊匹配禁用」——符号 fuzzy 匹配会引入假链接;「unmapped ≠ 错误」——ncRNA/假基因在部分库的缺口是真实覆盖率,审计按 locus_type 分层报告。)

§5 下游分析协议

§5.1 任务×资源速查表

任务 用哪些层 关键动作 陷阱
文献实体链接 alias/prev + symbol 三键解析 + 歧义队列 一对多 alias 直取
跨库整合 xref 映射列 ID 归一 join 空映射当缺失
变异注释 hgnc_id + MANE 临床报告规范 符号漂移断裂
家族分析 gene_family/group 家族聚合 家族边界人工性
数据治理 ID 主键 + 变更监听 快照 + 增量 月度文件过期
跨物种映射 mgd_id/rgd_id 同源 ID join 同符号异物种

§5.2 医疗 NLP 实体链接协议

  1. 词典构建:完整集 symbol/name/alias/prev 全展平 → 词典(token → ID 集)——多值歧义保留集合。
  2. 消歧规则:上下文窗口内的共现信号(基因-疾病/基因-蛋白搭配)+ 大小写规范(人类基因全大写惯例)——规则层先行,模型层兜底。
  3. 歧义队列:一对多命中(如同一 alias 指多个基因)进人工核验——抽样评估词典质量(PPV ≥95%)。
  4. 评估:标准测试集(如 BioCreative/NCBI Disease 语料)上的 precision/recall——词典消歧与模型消歧分层报告。
  5. 更新:季度快照重载 + 变更文件增量——「词典也是版本化的数据产品」。

§5.3 跨库 ID 归一协议

  1. 源字段识别:各源库的基因标识(符号/Entrez/Ensembl/UniProt)——先分型再映射。
  2. HGNC 桥接:全部映射到 HGNC ID——冲突时以「映射列多数 + 手工核验」仲裁。
  3. 歧义处理:一对多映射(旧符号指向多基因)→ 版本时间戳仲裁(变更前的文献用 prev 语义)。
  4. 覆盖率审计:每 locus_type 的映射覆盖率——蛋白编码应近 100%,ncRNA 部分缺口是真实状态。
  5. 落表:归一表(source_id → hgnc_id → 各层 ID)+ 仲裁日志——审计可回放。

§5.4 成本模型

场景 技术路线 成本量级
单文件集成 JSON 全量加载 $0(分钟级)
实体链接服务 内存索引 单机即可
全库归一 映射表 + 仲裁 人力为主(数天)
变更监听 月度文件 cron 近零

(HGNC 是「零数据成本、纯人力成本」的资源——预算全花在解析器健壮性与歧义仲裁上。)

§5.5 失败模式清单

  1. 符号当主键:漂移断裂——ID 主键是架构底线。
  2. alias 一对多直取:假链接丛生——集合语义 + 歧义队列。
  3. 占位符进生产:C#orf 替换后下游断裂——变更监听。
  4. locus_type 不滤:假基因当蛋白编码——显式过滤。
  5. 月度快照过期:365 天删除——季度归档纪律。
  6. 多值字段解析错:竖线分隔未处理——格式约定先读。
  7. 同符号跨物种混淆:人类大写 ≠ 鼠类——MGI/RGD ID 桥接。
  8. withdrawn 复活引用:撤回符号被旧文献引用——withdrawn.txt 去向核查。

§5.6 校准与验证协议

验证层 数据源 指标 通过线(参考)
L1 解析完整性 完整集全字段 解析错误率 0(硬线)
L2 词典覆盖 symbol+alias+prev 全展平 歧义率 报告并分层
L3 实体链接 PPV 人工核验子集 precision ≥95%(词典层)
L4 映射覆盖率 xref 列 × locus_type 覆盖率 蛋白编码近全
L5 变更同步 symbol-changes 断点预警率 100% 命中
L6 跨库一致性 桥表抽查 ID 一致率 ≥99%(人工仲裁兜底)
  1. L3 是 NLP 应用的灵魂:词典消歧的 PPV 抽检成本低于模型误链的下游代价——200 条人工抽检是性价比拐点。
  2. L6 的仲裁日志:跨库不一致不是「修掉」而是「记录 + 仲裁」——映射决策可回放是复现性的一部分。

§6 实证结果与方法学分析

§6.1 命名批准节奏的实证观察

  1. 蛋白编码近完备:官方口径「relatively complete」——新增命名集中在占位符替换与注释器发现基因(Ribo-Seq/phyloCSF 证据);MLDHR/SMIM10L3/RNF228/NPIPA9 是近年新命名的四种典型路径。
  2. 假基因命名加速:自上次年度报告新增 548 个命名——「暗物质命名化」的持续进程;三类假基因(duplicated/processed/unitary)的系统协议。
  3. lncRNA 的命名前沿:6,236 已命名但存量更大——「定义规则自动命名」的探索(官方 FUTURE PLANS 明文)——人工评审与规则化的混合演化。
  4. PGNC 的横向扩张:2024 年把命名范式输出到植物(杨树先行)——「命名委员会」组织形态的可复制性证明。

§6.2 符号稳定性的量化语义

  1. Stable tag 的机制:临床相关基因符号的稳定性标记(GenCC 协作配套)——「临床场景不要动这个符号」的官方声明。
  2. 变更率的工程读法:date_symbol_changed 字段的分布显示——多数变更集中在占位符替换与家族重命名;成熟基因符号多年不变——「漂移风险与基因成熟度负相关」。
  3. alias 表的治理边界:alias 不做官方消歧(官方只保证 prev_symbol 的权威语义)——文献噪声型别名依赖词典工程自担。
  4. 对知识图谱的含义:基因节点的「合并/拆分」事件以 HGNC ID 生命周期为准——节点稳定性设计引用它的状态机。

§6.3 方法学三层框架(gsm)

  1. G(Ground layer):符号字符串/ID 数字——机器可测的标识层。
  2. S(Synthesis layer):映射列/家族归属/变更日志——标准化推断层(人工策展产出)。
  3. M(Medical layer):临床报告命名规范/MANE 选择/GenCC 有效性——临床语义层(需链接外层资源)。

越层引用:把 alias 命中(G/S 层)当「确认是同一基因」(M 层语义)——一对多歧义的临床误链是 NLP 落地最贵的错误;按层问责 + 歧义降级是纪律。

§6.4 接力实验设计

  1. HGNC → Ensembl/GENCODE:命名 → 注释(转录本/外显子)。
  2. HGNC → ClinVar/COSMIC:命名 → 变异证据(临床/体细胞)。
  3. HGNC → UniProt/AlphaFold:命名 → 蛋白功能与结构。
  4. HGNC → GenCC/OMIM:命名 → 疾病有效性与表型。
  5. HGNC → MGI/RGD:人类命名 → 模式生物同源。

§6.5 八个真实坑点

  1. 坑点 1:符号当主键——漂移断裂;HGNC ID 主键是底线。
  2. 坑点 2:alias 一对多直取——假链接;集合语义 + 歧义队列。
  3. 坑点 3:占位符进生产——C#orf 替换断裂;变更监听。
  4. 坑点 4:locus_type 不滤——假基因/ncRNA 混入蛋白编码分析。
  5. 坑点 5:月度快照过期——365 天删除;季度归档。
  6. 坑点 6:多值字段解析错——竖线分隔约定先读。
  7. 坑点 7:同符号跨物种——大小写惯例不可靠;MGI/RGD 桥接。
  8. 坑点 8:withdrawn 复活——撤回符号去向核查(withdrawn.txt)。

§6.6 审稿人自查清单

  • [ ] 基因命名引用 HGNC 符号 + HGNC ID?
  • [ ] 快照版本与检索日期声明?
  • [ ] 实体链接的消歧方法(词典/模型)描述?
  • [ ] locus_type 过滤声明?
  • [ ] 跨物种分析用同源 ID 而非符号?
  • [ ] 旧文献符号的回溯(prev/alias)说明?
  • [ ] 命名变更事件的时点处理(变更前后的文献引用)?

§6.7 命名系统演进的方法学含义

  1. REST/OWL/Globus 的分发演进(2022-):「一个 32 MB 文件」到「多通道分发」——基础设施的小而美不排斥通道多样性。
  2. symbol-changes 文件(2021-09):变更从「藏在 prev 字段」到「一等事件流」——数据系统把「演化本身」产品化的样板。
  3. MANE/GenCC/AlphaFold 链接(2023):命名报告成为「临床语义链的路由器」——小库嵌入大生态的生存策略。
  4. PGNC/VGNC 扩张(2022-2024):命名范式的跨物种复制——「委员会评审 + 稳定 ID」模式的通用性证明。

§6.8 命名评审与自动化注释的张力

  1. 人工评审的不可替代性:命名批准涉及「领域可接受性」(工作人员偏好/家族语义/历史兼容)——纯算法无法裁决;这是 HGNC 慢的根源也是它的价值。
  2. 自动化的合理边界:lncRNA 系统命名/假基因批量协议——规则可枚举的部分自动化(官方 FUTURE PLANS 明文);「规则内自动、规则外人工」的混合架构。
  3. 对 AI 数据策展的启示:「快」与「信」的取舍——HGNC 用 40 年证明「人工策展 + 稳定 ID」的信任资产随时间复利;医疗 AI 的数据产品应保留人工策展节点。

§7 AI 就绪指南与应用场景

§7.1 HGNC 在医疗 AI 中的四种喂法

  1. 实体链接喂法:NER 输出 → 三键解析 → 标准符号/ID——文献挖掘与临床 NLP 的规范化层。
  2. 知识图谱喂法:基因节点 ID 化 + xref 跨库边——多源知识整合的骨干标识。
  3. 注释管线喂法:变异注释输出的基因语义层——VEP/ANNOVAR 结果的 HGNC 归一。
  4. 数据治理喂法:内部库 ID 主键 + 变更监听——符号漂移免疫的架构层。

四种喂法与 §6.5 坑点对应:喂法 1 踩坑 2(alias 一对多);喂法 2 踩坑 7(跨物种符号);喂法 3 踩坑 1(符号主键);喂法 4 踩坑 3(占位符)——建模前回读对号。

§7.2 实体链接服务实操配方

#!/usr/bin/env python3
"""基因实体链接服务:词典 + 消歧规则 + 歧义队列(生产骨架)。
数据:HGNC 快照(季度归档)+ 别名展平词典。"""
import json, re
from collections import defaultdict

class GeneLinker:
    def __init__(self, snapshot_json: str):
        docs = json.load(open(snapshot_json))["response"]["docs"]
        self.by_symbol = {}
        self.alias_map = defaultdict(set)
        self.by_id = {}
        for g in docs:
            if g["status"] != "Approved":
                continue
            hid = g["hgnc_id"]
            self.by_id[hid] = g
            self.by_symbol[g["symbol"].upper()] = hid
            for tok in ([g["symbol"]] + g.get("alias_symbol", [])
                        + g.get("prev_symbol", [])):
                if tok and re.fullmatch(r"[A-Za-z][A-Za-z0-9@\-\.]{1,14}", tok):
                    self.alias_map[tok.upper()].add(hid)

    def link(self, token: str, context_genes=None):
        """返回 (类型, 候选集);歧义时可用上下文基因集相交消歧。"""
        t = token.upper()
        if t in self.by_symbol:
            return "symbol", {self.by_symbol[t]}
        cands = self.alias_map.get(t, set())
        if len(cands) > 1 and context_genes:
            narrowed = cands & context_genes
            if len(narrowed) == 1:
                return "alias_ctx", narrowed
        return ("alias" if len(cands) == 1 else "ambiguous"), cands

lk = GeneLinker("hgnc_complete_set_2026Q3.json")
print(lk.link("TP53"))            # ('symbol', {'HGNC:11998'})
print(lk.link("ABC"))             # 多歧义 → ('ambiguous', {...}) 进队列

§7.3 模型选型与迁移决策

  1. 词典优先:基因名规范化 90%+ 场景词典即可——先词典后模型是成本纪律。
  2. 上下文消歧模型:歧义项(~10%)用 SciBERT 类上下文分类——训练数据由「无歧义命中」弱监督生成。
  3. NER 联动:GeneTagger 类 NER + HGNC 词典规范化——「识别与归一」分离架构。
  4. 不确定性:ambiguous 队列的置信度阈值——临床场景宁可弃链(NULL)不可错链。
  5. 知识图谱嵌入:xref 层做实体对齐预训练(TransE 类)——多库节点的向量统一。

§7.4 公平性:命名的边缘地带

  1. 新基因的冷启动:新命名基因无 alias 历史——文献检索的召回在时间维度不均;「命名日期」字段是偏差审计的协变量。
  2. 领域不平衡:热门基因(肿瘤/免疫)的别名生态远比冷门基因丰富——词典覆盖的领域偏差进 limitation。
  3. 语言偏差:非英语文献的基因名变体(全角/连字符惯例)——多语种 NLP 的额外映射层。
  4. 假基因/ncRNA 的二等公民效应:词典工程常忽略非蛋白编码——locus_type 分层评估是公平性自查。

§7.5 任务×资源速查表

AI 任务 HGNC 数据 输出形态 验收
实体链接 symbol/alias/prev token → HGNC ID PPV ≥95%
知识图谱 hgnc_id + xrefs 节点/边 ID 一致率
变异注释归一 hgnc_id + MANE 注释标准层 无符号断裂
文献时间线 date_* + prev 历史语义图 变更事件对齐
跨物种迁移 mgd_id/rgd_id 同源映射 ID 级桥接
词典生成 全字段展平 NLP 词典 歧义率报告

§7.6 端到端案例:临床文献的基因-疾病抽取管线

  1. 取数:HGNC 季度快照 → GeneLinker 词典(32 MB 进程内)。
  2. NER:PubMed 摘要流 → 基因名识别(大小写规范 + 词典 gazzetteer 特征)。
  3. 归一:三键解析 → 歧义项上下文消歧 → 人工队列(预期 ~5%)。
  4. 抽取:基因-疾病共现 + 触发词(mutate/associate)→ 关系分类。
  5. 落图:HGNC ID 为节点主键 → 与 ClinVar/GenCC 边对齐。
  6. 验收:实体链接 PPV ≥95% + 关系抽取 F1 分层报告 + 快照/词典版本声明——三件套齐。

§7.7 报告模板:方法学段落骨架

基因实体链接基于 HUGO 基因命名委员会(HGNC)数据库(genenames.org,2026Q3 季度快照,下载日期 2026-09-15;44,476 已批准符号)。词典由 approved symbol、alias_symbol 与 prev_symbol 字段展平构建,歧义别名保留候选集并以文献上下文共现信号消歧,未决项进入人工核验(占链接总数 [x]%)。全部基因以稳定 HGNC ID 为主键,跨库映射采用官方 xref 字段(Entrez/Ensembl/UniProt 等)。非编码 RNA 与假基因按 locus_type 字段分层处理。符号变更事件通过官方 symbol-changes 文件(2021-09 起)回放校准;撤回符号经 withdrawn 文件核查去向。词典质量经 200 例人工抽检(precision [x]%);全部快照与映射表随复现包发布。

§7.8 成本与排期模板

阶段 内容 成本构成 周期
集成 快照下载 + 解析器 人力 1-2 天 2 天
词典 展平 + 索引 + 歧义分析 人力 3 天
消歧 规则 + 弱监督模型 算力(小) 1-2 周
抽检 200 例人工 PPV 人力 3 天
服务化 API/队列/监听 工程 1 周
复现包 快照+词典+抽检集 人力 1 天

HGNC 项目的排期风险不在算力在「歧义仲裁的人力排期」——人工核验的吞吐是第一排期项。

§7.9 消融案例:实体链接词典策略的必要性

基因实体链接的词典策略消融(文献 NLP 场景,示意量级):

配置 词典策略 链接质量(示意) 诊断
R1 仅当前 symbol 召回 60%;旧文献大量漏链 无回溯层
R2 + alias/prev 展平 召回 90%;歧义误链 +8% 回溯增益与歧义代价并存
R3 R2 + 一对多保留集合 + 上下文消歧 误链回落;弃链率 3% 歧义队列生效
R4 R3 + locus_type 分层 + withdrawn 去向核查 临床场景零错链 生命周期语义闭合
  1. 方法:同一文献流(含 2010 前旧文献 30%);评估锁人工标注集;R3 的上下文用共现基因集相交。
  2. 读数:R1→R2 的召回增益主要来自旧文献(prev_symbol 命中);R2→R3 的误链回落证明「歧义保留 + 上下文」优于「直取最优」。
  3. 结论:HGNC 的价值 = 当前命名 + 历史回溯 + 生命周期语义的三位一体——只用 symbol 字段等于用了它三分之一的资产。

§8 伦理、许可与合规

§8.1 许可与使用结构

  1. 无限制使用:官方 Data release policy——访问与使用零限制;「good faith + 无担保」的公共数据标准条款。
  2. 学术规范:引用 NAR 年度论文(gkaf1229 等)+ 快照日期——无强制注册/协议;「引用即合规」的轻义务模型。
  3. 再分发的边界:无限制许可下再分发合法——但「与第三方数据合并后的产品」责任在合并者;下游产品的数据质量声明不可转嫁 HGNC。
  4. 错误反馈义务:命名错误的官方更正走委员会流程——使用者发现映射错误应反馈(help 渠道)而非私改。

§8.2 引用与致谢模板

致谢模板(按需裁剪):
Gene nomenclature and identifiers were obtained from the HUGO Gene
Nomenclature Committee (HGNC) database at www.genenames.org
(quarterly archive 2026Q3, downloaded 2026-09-15; 44,476 approved
symbols). Citation: Seal RL et al., Genenames.org: the HGNC and PGNC
resources in 2026, Nucleic Acids Research (2026), DOI 10.1093/nar/gkaf1229.
The HGNC is funded by NIH NHGRI (U24HG003345) and the US DOE.

§8.3 国内合规路径

  1. 数据性质:纯命名/元数据资源——无人类受试者数据/无遗传资源语义——数据层面合规负担近零。
  2. 使用场景:临床报告软件内嵌 HGNC 词典(无限制许可允许)——但临床报告本身受医疗器械软件监管(与数据来源无关的独立义务)。
  3. 学术引用:中文文献引用 HGNC 符号时保持英文符号原样(不翻译)——命名标准的国际一致性是引用规范。

§8.4 商业使用边界

  1. 可以直接商用:无限制许可覆盖商业产品内嵌(注释服务/临床软件/数据库产品)——这是 HGNC 与「CC-BY-NC 类」资源的关键差异。
  2. 无担保的商业含义:官方明文不承担使用责任——商业产品的错误链接/过期快照风险自担;SLA 设计要内建「季度快照更新 + 变更监听」。
  3. 竞争性替代的误区:商业命名库(如专有版本)的价值在「增值策展」不在「基础命名」——基础层已被 HGNC 公共品化。

§8.5 合规台账最小模板

台账项 记录内容 示例
快照版本 文件 + 官方日期 + 检索日 2026Q3(2026-09-15)
词典版本 展平规则 + 歧义统计 歧义率 x%
更新机制 月度监听 + 季度重载 cron 配置
错误反馈 上报记录 help 渠道工单
商用声明 无担保知晓 + SLA 快照更新 SLA
抽检记录 PPV 人工核验 200 例批次

§8.6 数据治理的架构语义

把 HGNC 的治理设计抽象为可复用的数据治理模式:

  1. 身份与标签分离:HGNC ID(身份)/ symbol(标签)——任何实体系统的第一原则;「改标签不动身份」。
  2. 变更即事件:symbol-changes 文件把演化变成数据——审计/回放/监听三种消费形态。
  3. 撤回即状态:Entry Withdrawn + 去向映射——「删除」在数据系统里应是状态迁移而非物理抹除。
  4. 策展即服务:人工评审节点是信任的来源——全自动管道应保留「人工评审节点」作为信任锚。

§9 谱系与生态

§9.1 基因命名时间线

1970s-80s  基因符号混乱时代(各实验室自命名)
1990s  HUGO 框架下命名协调启动
1997  HGNC 数据库成体系(剑桥驻地)
2010s  NAR 年度论文传统确立
2019  phenotype 符号撤回(移交 OMIM);GenCC 启动
2021-09  symbol-changes 月度文件上线
2022  REST API(HGNC+VGNC);Globus
2023  MANE/GenCC/AlphaFold 链接内建
2024  PGNC 成立(杨树;DOE)
2025  44,476 符号;NAR 2026 论文(gkaf1229)
2026  下载迁入 GCS Bucket;数据政策页重申无限制

§9.2 术语表

术语 定义
HGNC HUGO Gene Nomenclature Committee——人类基因命名委员会
HGNC ID 稳定唯一基因标识(HGNC:nnnnn)——跨符号变更不变
Symbol Report 单基因人工策展报告页
Gene Group Report 基因家族/组聚合报告
locus_type 基因座类型(protein-coding/pseudogene/ncRNA 细分)
alias_symbol 别名符号(非官方但普遍的历史用名)
prev_symbol 前官方符号(HGNC 曾批准、后变更)
placeholder 占位符符号(C#orf/FAM#——功能未明命名)
Entry Withdrawn 撤回状态(符号退场的状态机语义)
symbol-changes 官方符号变更事件文件(2021-09 起月度)
MANE Select RefSeq+Ensembl 联合标准转录本
GenCC 基因-疾病有效性分级联盟
LSDB 位点特异性突变数据库
MGI / RGD 小鼠/大鼠基因组信息学(同源映射)
VGNC 脊椎动物基因命名委员会(REST 同源查询)
PGNC 植物基因命名委员会(2024;杨树先行)

§9.3 资源选型决策树

你的需求是什么?
├─ 「基因名规范化/实体链接」
│    → HGNC(alias/prev + ID 主键——唯一权威)
├─ 「转录本/外显子注释」
│    → Ensembl/GENCODE(注释层)
├─ 「蛋白功能/结构」
│    → UniProt / AlphaFold DB(蛋白层)
├─ 「变异证据」
│    → ClinVar/COSMIC(变异层)
├─ 「基因-疾病有效性」
│    → GenCC(评估层)+ OMIM(表型)
├─ 「小鼠/大鼠同源」
│    → MGI/RGD(HGNC xref 内建桥)
├─ 「脊椎动物新物种命名」
│    → VGNC(REST 同服务)
└─ 「植物基因命名」
     → PGNC(plant.genenames.org;杨树先行)

§9.4 与本库其他条目的关系

条目 关系
gencode / ensembl 注释层——HGNC ID 是其标准字段
clinvar 变异语义层——基因身份锚点共用
alphafold / uniprot 蛋白层——Symbol Report 内建结构链接
drugbank / chembl 靶点层——靶点符号的命名归宿
omim 表型层——2019 后表型符号的承接方
cosmos(库内) 体细胞突变——COSMIC 符号字段互查
sra / geo 数据层——其元数据的基因语义源

§9.5 组合使用建议

研究设计 推荐组合 分工
文献基因挖掘 HGNC(词典)+ PubMed 语料 + ClinVar(验证) 归一 + 语料 + 证据
多组学整合 HGNC(桥表)+ Ensembl + UniProt + PRIDE ID 归一 + 各层
临床报告系统 HGNC(符号)+ MANE(转录本)+ GenCC(有效性) 命名 + 标准 + 分级
知识图谱 HGNC(节点)+ GO/KEGG(通路)+ DisGeNET(疾病) 身份 + 语义 + 关联
跨物种比较 HGNC(人类)+ MGI/RGD(模式生物)+ VGNC(其他) 同源 ID 桥接

组合纪律:ID 为键、符号为面——组合中所有基因以 HGNC ID 连接;符号仅作展示层;快照版本统一声明。

§9.6 命名基础设施的生态角色

HGNC 证明了「人工策展 + 稳定标识 + 完全开放」可以在全球尺度运转 40 年:命名评审保证了「一个基因一个名字」的语义秩序,HGNC ID 的稳定性保证了下游系统的架构安全,无限制许可保证了它被写进每一个工具链。它把「命名」从学术礼仪升级为数据基础设施——全球基因组数据的 join 键因此有了公共品。对医疗 AI,HGNC 是基因语义的「地面真值」:任何涉及基因实体的系统都应以 HGNC ID 为身份层——这是「用公共标准锚定系统架构」的最小成本路径。

§9.7 小库大生态的生存策略

HGNC 的数据体量只有 32 MB——它是本库中最小的数据集之一,却是被引用最广的基础设施之一:

维度 HGNC 典型大库(SRA 级)
体量 32 MB 47 PB
角色 语义锚点 数据海洋
更新 每月首批 持续滚动
信任来源 人工评审 规模与官方
集成成本 分钟级 天-周级
  1. 生态位原理:数据系统里「被依赖的密度」比「体量」更决定地位——HGNC 是全球基因数据的 join 键密度之王。
  2. 工程启示:小而关键的基础设施值得专门的工程投入(快照纪律/变更监听/歧义仲裁)——「32 MB 的认真」是高杠杆工程。

§10 资源导航与 FAQ

§10.1 官方资源导航

上手指引(第一次接入的推荐顺序):

  1. 下载季度归档完整集(JSON)→ 验证记录数与字段(第一天)。
  2. 构建三键索引(ID/symbol/alias)→ 歧义率统计。
  3. 接 REST API 单点查询 → 与本地快照一致性抽查。
  4. 订阅月度 symbol-changes → 断点预警机制。
  5. 词典抽检 200 例 → PPV 报告进复现包。

§10.2 关键文献

  1. Seal, R.L., Braschi, B., Gray, K., McClay, J., Tweedie, S. & Bruford, E. Genenames.org: the HGNC and PGNC resources in 2026. Nucleic Acids Research, gkaf1229 (2025-11-25 在线). DOI 10.1093/nar/gkaf1229
  2. Seal, R.L. et al. Genenames.org: the HGNC resources in 2023. Nucleic Acids Research 51, D1002-D1009 (2023).
  3. Braschi, B. et al. Genenames.org: the HGNC resources in 2019. Nucleic Acids Research 47, D693-D698 (2019).
  4. Yates, B. et al. Genenames.org: the HGNC resources in 2017. Nucleic Acids Research 45, D619-D625 (2017)(历史口径参考).

§10.4 FAQ

Q1:HGNC 数据真的完全免费吗?
A:是——官方政策明文「No restrictions on access or use」;无注册/无协议/可商用;仅无担保免责。

Q2:HGNC ID 和基因符号什么区别?
A:ID 是永久身份(HGNC:11998 永远指 TP53 基因座);符号是可变标签——工程上 ID 做主键、符号做索引。

Q3:TP53 之外为什么还有别名?
A:历史用名(alias)与旧官方名(prev_symbol)——文献与旧数据库仍在用;检索需要回溯层。

Q4:占位符(C#orf)是什么?
A:功能未明基因的临时命名(如 C11orf53)——功能明确后替换;生产系统要监听替换事件防断裂。

Q5:44,476 里只有 19,294 是蛋白编码?
A:是——其余是假基因(14,603)与 ncRNA(9,574);分析时按 locus_type 过滤。

Q6:假基因也要命名吗?
A:要——假基因是基因组真实结构(三类);命名化使注释/表达分析可精确指代。

Q7:符号会改吗?改了旧文献怎么办?
A:会改(例外情况);旧官方名进 prev_symbol + date_symbol_changed 入档 + 月度变更文件——旧文献可回溯。

Q8:withdrawn 符号还能引用吗?
A:不建议——它是被撤回的命名;withdrawn.txt 提供去向(转移至某 HGNC ID 或 OMIM);引用走新语义。

Q9:怎么批量下载?
A:完整集 JSON/TXT(GCS bucket)或 Globus(多文件推荐);REST 适合单点/小批量。

Q10:REST API 有限速吗?
A:官方未公布硬限速——批量场景仍建议用下载文件(礼仪 + 效率);大规模实时查询自建快照服务。

Q11:HGNC 覆盖非编码 RNA 吗?
A:覆盖——9,574 个(lncRNA 6,236 为主);miRNA 与 miRBase 协调命名。

Q12:lncRNA 命名还在快速增长吗?
A:是——6,236 已命名但存量更大;官方在探索规则化自动命名(FUTURE PLANS 明文)。

Q13:怎么查基因的小鼠同源?
A:Symbol Report 的 mgd_id 字段(MGI ID)——跨物种比较用 ID 不用符号。

Q14:HGNC 管基因功能吗?
A:不管——功能找 UniProt/GO;HGNC 只管「名字与身份」;角色边界是正确用法的起点。

Q15:clinical 基因有特殊标记吗?
A:Stable tag(临床相关基因的稳定性标记)+ GenCC 有效性链接——临床报告场景的官方语义。

Q16:MANE Select 是什么?
A:RefSeq 与 Ensembl 联合标注的标准转录本——临床报告「报哪个转录本」的官方答案;Symbol Report 内建版本化链接。

Q17:phenotype 符号去哪了?
A:2019 年 HGNC 撤回——表型命名职责移交 OMIM;历史符号在 withdrawn 文件有去向。

Q18:数据多久更新一次?
A:每月首批更新完整集;月度/季度归档;symbol-changes 文件月度——变更可全程追溯。

Q19:月度归档会删除吗?
A:会——365 天后删除;长期快照研究用季度归档(官方政策明文)。

Q20:多值字段怎么解析?
A:双引号包裹 + 竖线(|)分隔——TSV 解析器必须处理;JSON 天然数组。

Q21:能查脊椎动物(非人鼠)基因吗?
A:VGNC——REST 同服务(2022 起);覆盖非模式脊椎动物的命名。

Q22:植物呢?
A:PGNC(2024 成立)——杨树(Populus trichocarpa)先行;plant.genenames.org 独立站点;DOE 资助。

Q23:HGNC 与 Ensembl/GENCODE 什么关系?
A:HGNC 批准命名——GENCODE 注释引用 HGNC ID(标准字段);命名与注释两层分工。

Q24:实体链接遇到一对多 alias 怎么办?
A:保留候选集 → 上下文消歧(共现基因/疾病信号)→ 未决进人工队列——「宁弃链不错链」是临床底线。

Q25:怎么引用 HGNC?
A:NAR 年度论文(gkaf1229)+ 快照日期 + 记录数;数据可用性声明写快照版本。

Q26:AI 大模型训练可以用 HGNC 吗?
A:可以——无限制许可覆盖;商用基础模型亦可;产物责任自担(无担保条款)。

Q27:发现自己的基因符号不合适能改吗?
A:向委员会申请——「领域可接受」是准则;占位符替换与功能命名是常见路径;变更全程入档。

Q28:HGNC 和 NCBI Gene 重复吗?
A:不重复——NCBI Gene 是综合信息库(含 HGNC 之外的内容);两者 ID 互映射;命名权威唯一在 HGNC。

Q29:快照和 REST 该用哪个?
A:批处理/生产用快照(季度归档锁版本);单点/交互用 REST——「快照保复现、REST 保新鲜」。

Q30:词典工程的歧义率多大算正常?
A:alias 展平词典的一对多比例在个位数百分比——但集中在高频缩写词(如 ABC/HR 类);分层报告比单数字更有用。

Q31:数据文件迁到 Google Storage 有影响吗?
A:仅 URL 更新(2026)——内容与政策不变;旧书签需更新;Globus/REST 不受影响。

Q32:未来 HGNC 会扩大到哪些物种?
A:官方路线——VGNC 扩脊椎动物覆盖、PGNC 从杨树扩展作物物种(DOE 能源植物语境);「委员会评审」模式是扩张的可复制内核。

Q33:LLM 生成的基因名怎么校验?
A:HGNC 词典双查——存在性(symbol/alias 命中)+ 构词合法性(家族词根模式);幻觉符号是医疗 QA 真实风险(§2.9)。

Q34:一个基因多个 UniProt 登录号怎么处理?
A:uniprot_ids 是多值字段——桥表 explode 展开;映射方向决定唯一性(基因→蛋白一对多正常,反向需消歧)。

Q35:HGNC 的 OWL 文件怎么用?
A:本体工具链(Protégé/SPARQL)——浅层级(locus type/gene group 分类);SciBite 制作维护。

Q36:符号里的特殊字符(@/-/.)合法吗?
A:部分合法(官方命名指南约束)——但多数系统工具对特殊字符敏感;生产系统建议符号标准化 + 保留官方原样的双轨。

§10.5 要点回顾

  1. ID 主键:符号漂移免疫的架构底线——HGNC ID 永不变。
  2. 三键结构:ID/symbol/alias+prev——查询优先级与歧义队列。
  3. locus_type 过滤:假基因/ncRNA ≠ 蛋白编码——显式分层。
  4. 变更即事件:symbol-changes 月度文件——监听防断裂。
  5. 季度归档:月度文件 365 天删除——快照纪律。
  6. 撤回是状态:Entry Withdrawn + 去向映射——不物理删除。
  7. 多值字段:竖线分隔约定——解析器第一坑。
  8. 跨物种用 ID:同符号 ≠ 同基因——MGI/RGD 桥接。
  9. 角色边界:命名归 HGNC、功能归 UniProt、变异归 ClinVar。
  10. 引用即合规:NAR 年度论文 + 快照日期——轻义务模型。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 44,476 总符号 / 19,294 蛋白编码 / 14,603 假基因 / 9,574 ncRNA(lncRNA 6,236 / miRNA 1,912 / tRNA 591 / snoRNA 568)(2025-09-03)= Seal et al., Genenames.org: the HGNC and PGNC resources in 2026(NAR gkaf1229, 2025-11-25;PMID 41287213)
  • 摘要口径 over 44,400 / over 19,250 / ~14,500 / over 9,500 = 同上 NAR 2026 论文摘要
  • almost 43,000 = genenames.org/about 页(历史时点口径)
  • 新命名案例(MLDHR HGNC:55481 / SMIM10L3 HGNC:56768 / RNF228 HGNC:55809 / NPIPA9 HGNC:41984)与 548 新命名假基因 = NAR 2026 论文正文
  • 数据文件体量(JSON 31.6 MB / TXT 16.1 MB / withdrawn 252.9 KB / 2026-09-15)与字段全集 = genenames.org 下载页与 archive 帮助页
  • REST API(HGNC+VGNC)/ Globus / symbol-changes(2021-09 起)/ GenCC-AlphaFold-MANE 链接 = Seal et al., NAR 51(2023,PMC9825485)
  • 数据政策(无限制使用/无担保)= genenames.org Data release policy 原文
  • PGNC(2024 成立;Populus trichocarpa;DOE/橡树岭;plant.genenames.org)= NAR 2026 论文与官网
  • 资助(NIH NHGRI U24HG003345 + US DOE + SciBite)= NAR 2026 论文致谢与 Apollo 存档元数据
  • 下载链接迁移(GCS Bucket,2026)与归档策略(月度 365 天删除/季度长期保留)= genenames.org 首页公告与 archive 帮助页
  • 命名准则要点(占位符替换/禁用模式/家族命名)= genenames.org guidelines 页与 NAR 2026 论文命名案例章节

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • pharos — 共享标签:基因组学与多组学 / 医疗NLP
  • omim — 共享标签:基因组学与多组学 / 医疗NLP
  • reactome — 共享标签:基因组学与多组学 / 医疗NLP
  • gene-ontology — 共享标签:基因组学与多组学 / 医疗NLP
  • mtsamples — 共享标签:基因组学与多组学 / 医疗NLP
  • mondo — 共享标签:基因组学与多组学 / 医疗NLP
  • pharmgkb — 共享标签:基因组学与多组学 / 医疗NLP
  • hpo — 共享标签:基因组学与多组学 / 医疗NLP

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集