信息速览
UMLS — 统一医学语言系统 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | UMLS Knowledge Sources(统一医学语言系统知识源) |
| 英文全称 | Unified Medical Language System(Metathesaurus + Semantic Network + SPECIALIST Lexicon) |
| 别名/简称 | UMLS、Metathesaurus(元叙词表/超级叙词表)、CUI 体系 |
| 领域定位 | 跨词表概念集成与术语互操作枢纽;医学 NLP 的词法与语义基础设施 |
| 数据模态 | 术语集成库(RRF 制表符分隔)+ 语义类型/关系分类层 + 词法语料 + 定制子集工具 |
| AI 任务类型 | 概念链接与归一(CUI)、跨词表映射、同义词扩展、语义类型分类、文本抽取(MetaMap/SemRep)、检索扩展 |
| 样本总数 | 2026AA:约 344 万概念(CUI)/ 1370 万唯一名称 / 199 源词表;语义网络 125 类型 + 54 关系;SPECIALIST 25 万+ 词条 |
| 数据大小 | Full Release 5.3 GB 压缩 / 40.1 GB 解压;MRCONSO.RRF 单文件 2.2 GB 解压;MetamorphoSys 需 40 GB+ 磁盘 |
| 数据格式 | RRF(Rich Release Format,制表符分隔)+ MySQL/Oracle 载入脚本 + UTS REST API |
| 许可证 | UMLS Metathesaurus License(免费签署制);附录 2 为 esaurus License(免费签署制);附录 2 为 SNOMED CT 美国分发的法律载体;源词表分 Level 0-3+ 限制层 美国分发的法律载体;源词表分 Level 0-3+ 限制层 |
| 访问级别 | UTS 注册签署后免费下载;UTS REST API 在线访问 |
| 语言 | 英语为主;含多语言源词表名称 |
| 首发日期 | 1986 年立项(NLM 馆长 Donald Lindberg 发起);1989 年首版 |
| 最后更新 | 2026AA(2026-05-04 发布;半年节奏,2026AB 约 11 月) |
| 发布机构 | 美国国家医学图书馆(NLM) |
| 官方主页 | https://www.nlm.nih.gov/research/umls/ |
§0 E-E-A-T 信任声明与免责声明
- 经验(Experience):本文基于 NLM 官方下载页与 2026AA 发布文档、NLM 新闻公告(2026-05-04 2026AA 发布)、ScienceDirect 术语学综述与 John Snow Labs 数据卡撰写,关键数字均注明版本口径。
- 专业性(Expertise):内容覆盖 UMLS 三大组件架构、CUI/AUI 标识符体系、RRF 文件规范、许可分层(Level 0-3+)与 NLP 实践(MetaMap、概念链接)。
- 权威性(Authoritativeness):UMLS 由 NLM 维护逾 35 年,是 PubMed 与 ClinicalTrials.gov 官方使用的基础设施,也是美国法定分发 SNOMED CT 的通道。
- 可信度(Trustworthiness):概念归组质量的已知局限(过归组/欠归组)在本文显式说明;许可结论不构成法律意见。
- 免责声明:UMLS 数据使用须遵守 UMLS Metathesaurus License;涉及 SNOMED CT 与其他受限源词表时以附录条款为准。
- 数字口径说明:本文规模数字统一采用 2026AA 版官方口径(2026-05-04);语义类型数量存在 125(当前)与 133(历史文献)两个口径,均予标注。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:把 199 个医学词表「焊接」成一个概念体系的跨词表枢纽——344 万 CUI 概念、1370 万名称。
- 为什么重要:它让 SNOMED、LOINC、MeSH、RxNorm、ICD 彼此可翻译——医疗数据互操作的罗塞塔石碑。
- AI 价值:概念链接的目标空间、同义词扩展器、语义类型分类器与词法工具箱四位一体。
- 获取方式:UTS 注册签署 License → RRF 下载或 REST API;Level 0 子集最低摩擦。
- 成本:免费(签署制);全量加载需 40 GB+ 磁盘与数小时。
- 一句话:做医学 NLP 不用 UMLS,就像做搜索不用倒排索引。
§1.1 摘要
统一医学语言系统(UMLS,Unified Medical Language System)是美国国家医学图书馆(NLM)自 1986 年发起、1989 年首次发布的跨词表知识源体系,旨在弥合生物医学领域数百个受控词表之间的语义鸿沟。2026AA 版(2026-05-04 发布)的核心组件 Metathesaurus 收录约 344 万个概念(以 CUI 唯一标识)、1370 万个唯一概念名称,覆盖来自 CPT、ICD-10-CM、LOINC、MeSH、RxNorm、SNOMED CT 等 199 个源词表的原子数据。
UMLS 由三大组件构成。Metathesaurus 是核心数据库:它把不同源词表中表达同一含义的名称归组到同一 CUI 下,并保留每个原子(atom)的源词表(SAB)、源编码(CODE)与词目/字符串层级(LUI/SUI/AUI),从而实现「同一概念的多词表视图」。Semantic Network 提供统一分类层:125 个语义类型(Semantic Type,如 Clinical Drug、Disease or Syndrome、Anatomical Structure)以 is-a 层级组织,54 种语义关系(causes、treats、diagnoses 等)定义类型间的合法连接;每个 Metathesaurus 概念至少被赋予一个语义类型(MRSTY 表)。SPECIALIST Lexicon 与 Lexical Tools 是 NLP 词法基础设施:25 万+ 词条、40 万+ 变体的句法/形态/拼写信息,支撑词形归一与拼写变体处理。
数据以 RRF(Rich Release Format)制表符分隔文件分发,每半年一个大版本(2026AA、2026AB)。2026AA Full Release 压缩包 5.3 GB(解压 40.1 GB),其中最常用单文件 MRCONSO.RRF 解压后 2.2 GB,包含 200+ 源词表的名称、编码与概念映射。配套的 MetamorphoSys 工具支持按源词表、语义类型、抑制状态定制子集;NLM 亦提供免安装的预计算子集(Full Subset、Level 0 Subset 等)与 UTS REST API 在线访问。
许可采用签署制免费模式:用户在 UTS(Unified Terminology System)注册并签署 UMLS Metathesaurus License 后即可下载。源词表按限制程度分为 Level 0(无附加限制)至 Level 3+(额外限制);SNOMED CT 的美国分发以 UMLS License 附录 2(SNOMED CT Affiliate Licence Agreement)为法律载体——这使 UMLS 成为美国用户获取 SNOMED CT 的法定通道。NLM 自身亦在 PubMed(MeSH 检索扩展)与 ClinicalTrials.gov 中使用该体系。
对 AI 团队而言,UMLS 的价值集中在四个场景:其一,概念链接的目标空间——临床文本实体归一到 CUI,天然获得跨词表覆盖;其二,同义词扩展——检索与匹配任务的低成本增强;其三,语义类型分类——125 类型为实体分类提供弱监督标签;其四,词法工具链——SPECIALIST 使医学文本的词形归一摆脱通用 NLP 工具的领域失配。
§1.2 战略价值
- 互操作的罗塞塔石碑:医院内部多系统(HIS/LIS/RIS)各自使用不同词表,UMLS 的 CUI 与跨词表映射是编码互转的事实工具。
- 医学 NLP 的公共分母:MetaMap、SemRep 等经典工具以 UMLS 为目标空间;三十余年文献中大量 NLP 基准以 CUI 为标注单元——可比性无可替代。
- 同义词扩展的低成本方案:一个 CUI 平均挂 4 个名称(1370 万/344 万),检索召回扩展几乎零成本。
- 语义类型弱监督:125 个语义类型为实体分类、关系抽取预训练提供大规模免费标签。
- 法定通道属性:美国用户获取 SNOMED CT 必经 UMLS License;这使得 UMLS 成为术语基础设施的法律与工程双重枢纽。
§1.3 同类数据集横向对比
| 体系 | 维护方 | 规模 | 组织方式 | 定位差异 |
|---|---|---|---|---|
| UMLS Metathesaurus | NLM | 344 万 CUI | 跨词表归组集成 | 集成枢纽(映射层) |
| SNOMED CT | SNOMED International | 约 36 万概念 | 单词表本体 | 临床表达(可推理本体) |
| MeSH | NLM | 约 3 万主题词 | 层级叙词表 | 文献标引(PubMed) |
| LOINC | Regenstrief/HL7 | 10 万+ 术语 | 检验观察编码 | 实验室语义 |
| RxNorm | NLM | 约 13 万规范名 | 药物规范化 | 处方归一(本身也是 UMLS 源) |
| ICD-10-CM | CDC/NCHS | 约 7 万码 | 统计分类 | 报销/统计(UMLS 源) |
| CPT | AMA | 约 1 万码 | 操作编码 | 美国计费(UMLS 源) |
与本文互链的站内条目:snomed-ct、loinc、
与本文互链的站内条目:snomed-ct、loinc、mimic-iii、mimic-iv、clinicaltrials-gov、p、mimic-iv、d-ct、loinc、mimic-iii、mimic-iv、clinicaltrials-gov、pubmedqa、medqa、radgraph、drugb、i、mimic-iv、clinicaltrials-gov、pubmedqa、medqa、radgraph、drugbank、faers、medqa、radgraph、s-gov、pubmedqa、medqa、radgraph、drugbank、faers、gwas-catalog、open-targe、faers、gwas-catalog、open-targets。
§1.4 版本时间轴
| 时间 | 事件 |
|---|---|
| 1986 | NLM 馆长 Donald Lindberg 发起 UMLS 项目 |
| 1989 | 首版发布(实验性) |
| 1990s | Metathesaurus/Semantic Network/SPECIALIST 三组件定型 |
| 2004AA | 历史文件(MRCONSO_HISTORY 等)机制建立 |
| 2000s | RRF 成为标准分发格式;MetamorphoSys 定制工具发布 |
| 2010s | 半年发布节奏(AA/AB)定型;UTS REST API 上线 |
| 2024AB | 预计算子集开始包含 obsolete/suppressible 内容 |
| 2026-05-04 | 2026AA 发布:344 万概念 / 1370 万名称 / 199 源词表(本文口径) |
§1.5 典型应用场景
- 医院编码互转:ICD-10-CM ↔ SNOMED CT ↔ LOINC 经 CUI 桥接,支撑报表与临床数据复用。
- 临床文本概念链接:病历实体 → CUI 归一 → 跨院语义对齐(医疗 NLP 标配管线)。
- 文献检索扩展:以 CUI 同义词扩展查询词,PubMed 类系统的基础做法。
- 药物知识联动:RxNorm 为枢纽连接处方、药品库与不良事件(FAERS)。
- 语义类型分类器:以 MRSTY 标签训练生物医学实体分类模型。
- 术语学治理:医院术语服务器(如 Epic/Siemens 类产品)以 UMLS 做跨词表底座。
§1.6 组件全景与标识符体系
| 组件 | 内容 | 角色 |
|---|---|---|
| Metathesaurus | 概念/名称/关系/映射(RRF 文件族) | 跨词表数据层 |
| Semantic Network | 125 语义类型 + 54 语义关系 | 统一分类层 |
| SPECIALIST Lexicon | 词条/变体/句法信息 | NLP 词法层 |
| Lexical Tools | 词形归一、拼写变体工具 | NLP 工具层 |
| MetamorphoSys | 子集定制/安装器 | 分发工具层 |
| UTS REST API / Browser | 在线查询 | 服务层 |
标识符层级(四层嵌套):
| 标识符 | 格式 | 层级 | 语义 |
|---|---|---|---|
| CUI | C+7 位 | 概念层 | 同义名称的归组单元(跨词表) |
| LUI | L+7 位 | 词目层 | 词形变体归组 |
| SUI | S+7 位 | 字符串层 | 精确字符串 |
| AUI | A+7 位 | 原子层 | 源词表×编码×字符串的最小单元 |
| TUI | T+3 位 | 语义类型 | Semantic Network 类型标识 |
- 归组逻辑:同义字符串 → 同一 CUI;每个原子(AUI)携带源词表(SAB)与源编码(CODE)——「概念的多词表视图」由此实现。
§1.7 UMLS 与 SNOMED CT 的法律-数据双重关系
UMLS 与 SNOMED CT 的关系是医学术语工程中最容易被误读的一组关系——它同时是法律通道关系与数据集成关系,两条线索的适用场景不同,混为一谈会导致合规判断与架构设计双双出错。
线索一:法律通道(美国属地)
- 美国(及其领地)的用户获取 SNOMED CT 国际版与美国版的法定通道之一就是 UMLS Metathesaurus License——签署 UMLS License 时,附录 2 即为 SNOMED CT Affiliate Licence Agreement,一次签署同时生效。
- 这意味着:若项目同时需要 CUI 词典与 SNOMED 概念,从 UMLS Full Release 一并获取是法律成本最低的路径(一次尽调、一份协议)。
- 但反方向不成立:签 UMLS License 不等于获得了 SNOMED 在其他属地的分发资格——非美国属地仍需通过当地 Member Licensee(国家中心)渠道,UMLS 附录 2 不覆盖。
- 工程留痕:凡产品说明中提及「SNOMED CT 数据来自 UMLS 2026AA」,应同时注明「美国属地分发,经附录 2」——这句话在合规审计中是免罚性陈述,缺失则是风险敞口。
线索二:数据集成(全球通用)
- SNOMED CT 是 Metathesaurus 的 199 个源词表之一(SAB=SNOMEDCT_US / SNOMEDCT_VET 等变体):SNOMED 的每个进入 Metathesaurus 的概念获得 CUI,其层级(is-a)以 CHD/PAR 关系进入 MRREL。
- 集成的粒度是概念级而非表达式级:SNOMED 的后组配表达式(如「阑尾切除术伴腹腔镜入路」的组合编码)在 Metathesaurus 中以预组配概念出现——表达式级组合逻辑不随行。
- 集成的时差:SNOMED 国际版 2026 起月度发布,UMLS 半年打包——UMLS 2026AA 中携带的 SNOMED 版本落后于 SNOMED 官网最新版,做「最新 SNOMED 概念」类应用必须直连 SNOMED 官方分发(MLDS)而非 UMLS。
- 集成的取舍:NLM 编辑会对 SNOMED 原子做 suppressible 处理(废弃/抑制概念不进默认视图)——以 UMLS 为 SNOMED 数据源时,看到的 SNOMED 是「NLM 剪辑版」,与 SNOMED 官方 RF2 快照的行数对不上是正常现象,不是数据丢失。
工程决策表:从哪里取 SNOMED
| 场景 | 推荐数据源 | 理由 |
|---|---|---|
| 美国属地 + 需要跨词表 CUI | UMLS Full Release | 一次签署双词表 |
| 任意属地 + 只要 SNOMED | SNOMED MLDS 官方 RF2 | 版本最新、属地许可直达 |
| 概念链接任务(输出 CUI) | UMLS MRCONSO | SNOMED 原子自带 CUI |
| 本体推理(表达式/引用集合) | SNOMED RF2 + Snowstorm | UMLS 不含表达式层 |
| 跨词表映射工程 | UMLS MRMAP/MRREL | 官方映射在此 |
| 非美国属地 + 要 UMLS | UTS 签署 + 属地 SNOMED 渠道并行 | 两份许可各管各的 |
- 一句话判据:把 UMLS 当「法律+数据的一站式美国通道」,把 SNOMED 官方分发当「最新全量本体」——两个角色各自成立,互相不可替代。
§2 医学背景
§2.1 概念归组的方法论与已知局限
- 归组机制:编辑团队 + 自动化流程基于源词表映射、词汇规则与人工评审将跨源原子归入同一 CUI。
- 过归组(over-merging):语义相近但临床有别的名称被并入同一 CUI(如某些同名异义药物条目)。
- 欠归组(under-merging):同一概念的不同拼写/译名分属多个 CUI。
- 工程对策:以 suppressible 标记(OBS/S 原子)过滤噪声;关键应用以人工评审的映射子集为准;2024AB 起预计算子集包含 obsolete/suppressible 内容,便于自行清洗。
§2.1b Semantic Network 的分类哲学
- 与源词表层级的关系:语义类型独立于源词表层级——「Addison 病」无论来自哪个词表都被赋予 Disease or Syndrome 类型;这提供跨词表的一致分类。
- 五大非层级关系族:物理相关(physical_related)、空间相关(spatially_related)、时间相关(temporally_related)、功能相关(functionally_related)、概念相关(conceptually_related)——54 种关系按族组织。
- 使用边界:语义关系是「类型间合法连接」的元层定义,不是概念级因果知识——把「treats」当作药物-疾病因果事实直接用于决策是常见误用。
§2.2 SPECIALIST Lexicon 与词法处理
- 内容:常见英文词汇 + 生物医学术语,含形态(单复数/时态/派生)、拼写(英美变体)、句法(补语结构)信息。
- Lexical Tools:词形归一(norm)、拼写变体生成、词汇变体程序(LVG)等——医学文本预处理的公共底座。
- NLP 价值:医学文本大量存在拉丁复数(nucleus/nuclei)、药物名拼写变体(estrogen/oestrogen),通用分词与词干化工具失配严重,SPECIALIST 是领域修正的标准答案。
§2.3 AI 任务定义
| 任务 | 输入 | 输出 | 评测思路 |
|---|---|---|---|
| 概念链接(CUI 归一) | 实体表面形式 + 上下文 | CUI | 人工标注病历集 CUI F1 |
| 语义类型分类 | 实体文本 | TUI | MRSTY 标签作弱监督金标 |
| 跨词表映射 | 源词表编码 | 目标词表编码 | MRREL/MRMAP 映射文件做金标 |
| 同义词扩展 | 查询词/编码 | 同 CUI 名称集合 | 检索召回率提升验证 |
| 词形归一 | 医学词形 | 规范形式 | SPECIALIST 工具输出为基线 |
| 关系抽取预标注 | 文献句子 | 语义关系候选 | SemRep 输出 + 人工评审 |
§2.4 覆盖领域
- 强项:疾病/症状、药物(RxNorm 全量)、检验(LOINC 全量)、解剖(含 FMA)、微生物、文献标引(MeSH 全量)。
- 相对薄弱:护理过程语义、中医证候、部分区域特有编码体系(以国家扩展补位)。
- 语言:英语为主;部分源词表带多语言名称(西班牙语、法语、德语、荷兰语等)但覆盖不均。
§2.5 临床与研究价值
- 对医院信息科:多系统编码对账(reconciliation)的公共工具;数据仓库术语层的事实底座。
- 对研究者:跨词表研究人口与方法的公共映射层;系统性综述检索扩展。
- 对 AI 团队:CUI 是医疗 NLP 结果可比性的公共键——发布模型结果标注 CUI 版本(如 2026AA)已成为领域惯例。
§2.6 金标准与参考实现
- 金标准定位:CUI 归组本身即「跨词表同义」的工作金标(有已知误差但无替代者);MRMAP/MRREL 官方映射文件是映射类任务金标。
- 参考实现:MetaMap(文本→CUI 抽取)、SemRep(语义三元组)、MetamorphoSys(子集定制)为 NLM 官方工具链。
- 学术基线:概念链接任务以 n2c2/MedMentions 类标注语料(CUI 标注)为基准;MedMentions 是大规模 CUI 链接公开基准。
§2.7 MetaMap 与 SemRep:NLM 官方工具链
UMLS 不只是数据集——NLM 围绕它维护了两件「官方参考实现」,它们定义了「UMLS 该怎么用」的社区共识基线,也是绝大多数医学 NLP 论文的预处理起点。
MetaMap:文本 → UMLS 概念
- 定位:把生物医学文本中的名词短语映射到 Metathesaurus 概念(CUI)——是「概念链接/实体链接」任务的祖师爷级参考实现(Java 版 MetaMap、轻量 MetaMapLite 两个发行)。
- 管线:分句 → 浅句法解析 → 名词短语生成 → 变体生成(SPECIALIST 词法)→ 候选检索 → 以中心词匹配与歧义消解打分 → 输出概念映射(含 CUI、语义类型、评分)。
- 为什么仍是基线:结果可复现、语义类型过滤内置、评分可调——20 余年的论文都用它做预处理,可比性是其生命线;深度学习链接器(SapBERT 类)论文同样以 MetaMap 输出做召回对照。
- 工程注意:MetaMap 版本与 UMLS 版本必须配对(2026AA 数据配 2026AA 版 MetaMap);默认词典是全量 Metathesaurus,内存与速度代价大——生产中通常用 Semantic Type 过滤参数缩小候选空间。
SemRep:文本 → 语义关系三元组
- 定位:在 MetaMap 之上做关系抽取——以 Semantic Network 的 54 种关系为输出空间,从句子中抽取「主语概念 - 语义关系 - 宾语概念」三元组(如 药物-TREATS-疾病)。
- 价值:把文献(PubMed 千万级摘要)转成结构化知识的大规模管道——NLM 的 SemMedDB 类资源即由此产生;对知识图谱预训练与 RAG 语料构建是免费的弱监督来源。
- 边界(呼应坑点 4):SemRep 输出的 TREATS/CAUSES 是「文本中出现过这种陈述」的证据,不是临床验证的因果——入图谱时必须保留出处的 PMID 级溯源。
工具链协作全景
PubMed 摘要 / 病历文本
│
├─ SPECIALIST Lexical Tools(词形归一 norm / 变体生成 varcon)
│ ↓
├─ MetaMap / MetaMapLite(概念链接 → CUI + TUI + 评分)
│ ↓
├─ SemRep(关系抽取 → 三元组,54 关系空间)
│ ↓
└─ 产物:CUI 标注语料 / 三元组知识库
(训练数据:为深度学习链接器与图谱模型供料)
- 自建 vs 官方:新模型(编码器链接器、LLM 链接)应把 MetaMap 输出当「召回下界」对照——若自建管线在精确率上不及 MetaMap,先怀疑自己的词法处理没对齐 SPECIALIST,再怀疑模型。
§2.8 NLM 官方自用:PubMed 与 ClinicalTrials.gov
「UMLS 有什么用」最有说服力的答案来自 NLM 自己的旗舰系统——两个全球最大规模的医学信息基础设施都把它作为核心语义层,这既是压力测试也是最佳实践参考。
PubMed:文献检索的语义底座
- 查询处理:用户输入的自由文本查询经词法归一(SPECIALIST)与概念映射(Metathesaurus/MeSH 交叉表)转换为受控检索表达式——「heart attack」类口语词被映射到 MeSH 副主题树,实现召回扩展。
- 同义词扩展的规模参照:PubMed 每日处理百万级查询,其扩展逻辑长期依赖 UMLS 的同义词面——这是「同义词扩展」配方(§5.6 配方 1)在工业规模上的官方验证。
- 复制提示:站内检索系统复制 PubMed 模式时,扩展词典直接用 MRCONSO(过滤后),不必重新标注。
ClinicalTrials.gov:注册数据的归一层
- 病种归一:注册的 conditions 字段是自由文本(研究者手填),NLM 用 UMLS 语义工具将其链接到 MeSH/CUI,支撑「按疾病检索试验」——这正是本库 clinicaltrials-gov 条目中「conditions 自由文本需归一」坑点的官方解法。
- 干预归一:interventions 字段同理——药物名经 RxNorm(UMLS 源词表)归一,器械与术式经各自词表归一。
- 对 AI 的启示:试验-患者匹配(trial matching)系统的标准架构就是在这一归一层上做语义对齐——CUI 是患者诊断编码与试验入组标准之间的公共键。
两个系统的共同经验
| 经验 | 说明 | 对自建系统的启示 |
|---|---|---|
| 词典过滤从严 | 官方系统只用未抑制、首选形式的原子 | TS=P + SUPPRESS=N 是起点而非可选项 |
| 版本锁定 | 系统升级随 UMLS 半年节奏显式切换 | 检索质量回归测试纳入版本升级流程 |
| 人工反馈闭环 | 检索点击/注册纠错反馈回 NLM 编辑 | 自建系统保留人工纠错队列 |
| 扩展有界 | 同义词扩展限制在映射置信度高的 CUI | 盲目全量扩展引入噪声召回 |
- 引用价值:写方案/论文时,「PubMed 与 ClinicalTrials.gov 的语义层即 UMLS」是最强的工程背书——它证明这套数据与工具在生产规模(十亿级日查询、百万级注册试验)下可靠。
§3 数据集规格
§3.0 版本抉择矩阵
| 使用目标 | 推荐通道 | 理由 |
|---|---|---|
| 概念链接/NLP | MRCONSO.RRF(单文件起步) | 名称/编码/概念一表打尽 |
| 术语映射工程 | Full Subset + MRREL/MRMAP | 关系与映射全量 |
| 快速原型 | Level 0 Subset | 无附加限制源,1.9 GB |
| 在线查询 | UTS REST API / Browser | 免安装 |
| 词法归一 | SPECIALIST + Lexical Tools | 独立下载使用 |
| 需要历史回溯 | History Files | 2004AA 起删除记录 |
§3.1 模态详情
| 数据层 | 内容 | 核心文件 | AI 可用形态 |
|---|---|---|---|
| 概念-名称层 | 原子/词目/字符串/概念层级 | MRCONSO.RRF | 同义词词典、归一目标空间 |
| 关系层 | 概念间关系(跨源+源内) | MRREL.RRF | 知识图谱三元组 |
| 语义类型层 | CUI→TUI 标注 | MRSTY.RRF | 分类弱监督标签 |
| 映射层 | 源词表间官方映射 | MRMAP.RRF / MAPRESTY | 编码互转规则 |
| 源词表元数据 | 版本/层级/许可属性 | MRSAB.RRF | 许可合规检查 |
| 词法层 | 词条/变体/句法 | SPECIALIST 文件族 | 词形归一工具 |
| 语义网络层 | 类型定义/关系定义 | SRDEF/SRSTR | 元层知识 |
§3.2 按子集样本数
| 子集 | 数量 | 口径 |
|---|---|---|
| 概念(CUI) | 约 344 万 | 2026AA |
| 唯一名称 | 1370 万 | 2026AA |
| 源词表 | 199 | 2026AA |
| 语义类型 | 125 | Semantic Network 当前 |
| 语义关系 | 54 | Semantic Network |
| SPECIALIST 词条 | 25 万+(40 万+ 变体) | 2026AA |
| 历史文件起始 | 2004AA | 官方 |
§3.3 格式对照
| 通道 | 格式 | 适用 | 注意 |
|---|---|---|---|
| Full Release | RRF zip | 全量研究 | 40.1 GB 解压;MetamorphoSys 需 40 GB+ 磁盘 |
| Full Subset | RRF(含载入脚本) | 直接入库 | MySQL/Oracle 脚本就绪 |
| Level 0 Subset | RRF | 低摩擦起步 | 仅无附加限制源 |
| MRCONSO.RRF 单文件 | RRF | NLP 快速起步 | 2.2 GB 解压 |
| UTS REST API | JSON/XML | 在线查询 | 限额;需 UTS 账号 |
| Metathesaurus Browser | 网页 | 人工查证 | 版本随最新发布 |
§3.4 存储大小
| 项目 | 量级 | 说明 |
|---|---|---|
| Full Release | 5.3 GB 压缩 / 40.1 GB 解压 | 2026AA |
| Metathesaurus Full Subset | 5.4 GB / 38.0 GB | 含 MySQL/Oracle 脚本 |
| Level 0 Subset | 1.9 GB / 10.5 GB | 最低摩擦 |
| MRCONSO.RRF | 492 MB / 2.2 GB | 最常用单文件 |
| MetamorphoSys 运行 | 40 GB+ 磁盘 / 2-10 小时 | 定制子集成本 |
| 入库后数据库 | 60-100 GB 级 | MySQL 全量经验值 |
§3.5 标注方式
- 概念归组:NLM 编辑团队 + 自动化流程(源映射继承、词汇规则、人工评审)。
- 语义类型:每概念至少一个 TUI(规则 + 人工校正)。
- 源词表内容:由各源(SNOMED International、Regenstrief、AMA 等)按协议供给,NLM 做归组与格式统一。
- 抑制标记:过时/冗余原子标 suppressible,保留但不推荐使用。
§3.6 标注者资质与一致性
- NLM 术语学编辑 + 各源词表维护机构协作;医学索引与词表学专业性要求高。
- 归组一致性依赖评审流程;跨源语义边界判断(尤其药物与疾病细粒度概念)存在已知争议区。
- 语义类型分配以规则为主、人工为辅,边缘概念存在多类型争议。
§3.7 采集周期
- 半年大版本(AA = 约 5 月;AB = 约 11 月);各源词表按自身节奏供给,NLM 统一打包。
- 历史文件按版本累积(2004AA 起)。
§3.8 地域覆盖
- 全球使用;英语为主干,含多语言源名称(西/法/德/荷等)。
- 美国法定词表(ICD-10-CM、CPT、RxNorm)全量覆盖是 UMLS 在美国卫生系统渗透率高的直接原因。
§3.9 设备规格
- 个人分析:MRCONSO.RRF + pandas/SQLite(16 GB 内存可处理)。
- 全量入库:MySQL/Oracle 60-100 GB 级数据库,16-32 GB 内存服务器。
- MetamorphoSys 定制:40 GB+ 空闲磁盘、2-10 小时处理时间。
§3.10 深度溯源链
| 层级 | 实体 | 溯源要点 |
|---|---|---|
| L0 | 立项 | 1986 年 NLM(Donald Lindberg)发起 |
| L1 | 治理 | NLM 编辑 + 源词表协议(授权协议逐源签署) |
| L2 | 源词表 | SNOMED CT(附录 2)、LOINC、MeSH、RxNorm、ICD-10-CM、CPT 等 199 源 |
| L3 | 分发 | UTS 下载 / REST API / Browser |
| L4 | 本文口径 | 2026AA 官方文档与下载页(2026-05-04) |
§3.11 RRF 核心文件清单
| 文件 | 一行 = | 关键列 | AI 用途 |
|---|---|---|---|
| MRCONSO.RRF | 一个原子 | CUI/LUI/SUI/AUI/STR/SAB/CODE/ISPREF | 词典构建 |
| MRREL.RRF | 一条关系 | CUI1/REL/CUI2/SAB/RELA | 三元组/映射网络 |
| MRSTY.RRF | 一条类型标注 | CUI/TUI | 语义分类标签 |
| MRMAP.RRF | 一条映射 | MAPSETCUI/MAPSETSID/FROM/TO | 编码互转 |
| MRSAB.RRF | 一个源版本 | RSAB/VCUI/VSAB/SRL | 源版本/许可层级 |
| MRDEF.RRF | 一条定义 | CUI/DEF/SAB | 概念定义文本 |
| MRXW_* / MRXNS_* | 词汇索引 | LAT/TERM/CUI/LUI/SUI | 大小写/词形索引入口 |
| SRDEF | 语义类型/关系定义 | TUI/RTN/DEF | 语义网络元层 |
§3.12 源词表许可分层
| 层级 | 含义 | 代表源 | 对 AI 的意义 |
|---|---|---|---|
| Level 0 | 无附加限制 | MeSH 等 | 可自由再分发(遵循主许可) |
| Level 1 | 需报告中报 | 部分专科源 | 用途申报义务 |
| Level 2 | 附加用途限制 | CPT 类商业源 | 商用需额外授权 |
| Level 3+ | 更严格限制 | 含 SNOMED CT(附录 2) | 属地许可叠加 |
- 工程建议:仅做通用 NLP 时优先 Level 0 子集;需 SNOMED 时按附录 2 完成属地确认;CPT 类计费编码商用前必须单独授权。
§3.13 与 SNOMED CT 分发的法律关系
- UMLS License 附录 2 = SNOMED CT Affiliate Licence Agreement——美国用户签 UMLS License 即同时获得 SNOMED 美国分发的法律资格。
- 这一条款使 UMLS 成为「一次签署、双词表到手」的通道;但 SNOMED 部分的用途限制以附录 2 为准(更严格)。
- 对 AI 的意义:训练数据含 SNOMED 原子时,合规依据是附录 2 而非主许可。
§3.14 MetamorphoSys 操作手册(子集定制)
MetamorphoSys 是官方子集定制器——从 Full Release 出发,按源词表、语言、suppressible 策略裁剪出贴合业务的 Metathesaurus 子集。它是 Java 桌面程序,随 Full Release 打包(目录树中的 mmsys/)。
标准操作序列
1. 解压 Full Release(40 GB 级磁盘余量,先 df -h 确认)
2. 运行 mmsys/install.sh(Linux/macOS)或 install.bat(Windows)
3. 选择 「Create UMLS Metathesaurus Subset」
4. 指定输入目录(2026AA-full 所在路径)与输出目录
5. 载入默认配置后进入 Options:
a. Source List:勾选保留的源词表(SAB 清单)
—— 删 CPT/SNOMED 可同时解决许可与体积问题
b. Suppressibility: Exclude suppressed concepts
—— TS=S/OBS 原子出局(词典干净化关键开关)
c. Language:仅保留 ENG 可砍掉约半数原子
d. Relationships:默认保留全部;做链接任务可只留 CHD/PAR/RO
6. Begin Subsetting → 等待(2-10 小时,取决于裁剪力度与磁盘)
7. 产物校验:输出目录含 RRF 文件族 + 载入脚本 + 统计日志
参数决策参考
| 决策点 | 保守(全保) | 激进(瘦子集) | 风险 |
|---|---|---|---|
| 源词表 | 仅删 Level 2/3 受限源 | 只留 MeSH+RxNorm+SNOMED | 激进后跨源映射能力下降 |
| suppressible | 保留(自行过滤) | 排除 | 排除后无法复现官方全口径统计 |
| 语言 | 全留 | 仅 ENG | 多语言评测无法进行 |
| 关系 | 全留 | 仅层级 | RO 类关联消失影响图谱任务 |
| 定义 | 全留 | 仅 MMSO 首选定义 | 定义覆盖下降 |
故障与对策
-
中途磁盘写满:MetamorphoSys 无断点续跑——清理后从头再来;先给输出目录双倍预估空间。
-
Java 堆不足:定制大子集时
install.sh内默认 JVM 参数不够,改_JAVA_OPTIONS="-Xmx16g"再启动。 -
容器内运行:需图形界面(Swing),无头环境用 Xvfb 转发;更工程化的替代是放弃 MetamorphoSys、直接用脚本按 MRSAB.SRL 与 SUPPRESS 过滤 RRF——效果等价且可版本化(多数 AI 团队的实际选择)。
-
产物验证清单:行数对账(输出 MRCONSO 行数 = 输入 × 预期保留率);许可对账(输出 MRSAB 无未授权源);抽样 100 CUI 检查原子完整性。
-
决策建议:AI 团队可以把 MetamorphoSys 视为「一次性学习工具」——用它理解过滤语义,然后脚本化复刻其逻辑进 CI;长期依赖桌面式定制器不利于可重复研究。
§4 数据结构
§4.0 目录树
umls-2026AA-full/
├── 2026AA-full/ # 解压后根目录
│ ├── META/ # Metathesaurus RRF 文件族
│ │ ├── MRCONSO.RRF # 概念名称(最常用)
│ │ ├── MRREL.RRF # 概念关系
│ │ ├── MRSTY.RRF # 语义类型标注
│ │ ├── MRMAP.RRF # 映射
│ │ ├── MRSAB.RRF # 源词表元数据
│ │ ├── MRDEF.RRF # 定义
│ │ └── MRXW_ENG.RRF 等 # 词汇索引
│ ├── NET/ # Semantic Network
│ │ ├── SRDEF # 类型/关系定义
│ │ ├── SRSTR # 层级结构
│ │ └── SRSTRE1 # 关系实例
│ ├── LEX/ # SPECIALIST Lexicon
│ │ ├── LEX # 词库主文件
│ │ └── ...
│ ├── ETCSUBSET/ # 示例子集
│ ├── etc/ # 配置
│ ├── mmsys/ # MetamorphoSys 程序
│ └── README / RELEASE NOTES
§4.1 DAIMS 字段字典
| 字段 | 类型 | 语义 | AI 提示 |
|---|---|---|---|
| CUI | C+7 位 | 概念唯一标识 | 全局主键;跨源归组单元 |
| STR | 文本 | 名称字符串 | 词典主体;含大小写变体 |
| SAB | 缩写 | 源词表(RSAB) | 源过滤与许可检查 |
| CODE | 文本 | 源编码 | 与源系统对账的桥 |
| ISPREF | Y/N | 源内是否首选 | 词典排序 |
| TS | 缩写 | 原子状态(P/S) | 抑制过滤 |
| STT | 缩写 | 字符串类型 | PF=首选形式 |
| REL | 缩写 | 关系类型(CHD/PAR/RO/RB/RN) | 层级(CHD/PAR)与关联(RO)分流 |
| RELA | 缩写 | 附加关系限定(broader/narrower/xd 等) | 映射方向性 |
| TUI | T+3 位 | 语义类型 ID | 分类标签(125 类) |
| DEF | 文本 | 概念定义(MRDEF) | 定义文本资产 |
| SRL | 整数 | 源限制层级(0-3+) | 许可合规过滤 |
§4.2 标签分布
- 语义类型分布:高度长尾——Disease or Syndrome、Pharmacologic Substance、Sign or Symptom 等头部类型占概念大头;稀有类型(如 Manufactured Object 子类)仅数千概念。
- 源词表分布:MeSH/RxNorm/SNOMED CT/CSP 等大源贡献多数原子;长尾源仅数百原子。
- 关系分布:CHD/PAR 层级关系与 RO 关联关系为主;跨源映射关系(XD/XS 类 RELA)集中于映射源。
§4.3 关键统计
| 统计项 | 数值 | 口径 |
|---|---|---|
| 概念(CUI) | 约 344 万 | 2026AA |
| 唯一名称 | 1370 万 | 2026AA |
| 源词表 | 199 | 2026AA |
| 语义类型 / 关系 | 125 / 54 | Semantic Network |
| SPECIALIST 词条 / 变体 | 25 万+ / 40 万+ | 2026AA |
| Full Release 大小 | 5.3 GB 压缩 / 40.1 GB 解压 | 2026AA |
| MRCONSO.RRF | 492 MB 压缩 / 2.2 GB 解压 | 2026AA |
| 发布节奏 | 半年(AA/AB) | 官方 |
§4.4 数据层级
- 原子层(AUI):源词表×编码×字符串的最小事实单元。
- 概念层(CUI):同义归组后的语义单元——绝大多数 AI 任务的键空间。
- 类型层(TUI):125 语义类型的分类标注。
- 元层(Semantic Network):类型/关系的定义与约束。
§4.5 缺失值处理与信息性缺失编码
- suppressible 原子:标 TS=S/OBS 的原子不参与默认统计——过滤与否必须显式声明(2024AB 起子集包含它们)。
- 无定义概念:MRDEF 仅覆盖部分概念;无定义是常态而非数据缺失。
- 多语义类型概念:一概念多 TUI 属正常(如某些化学物质兼具药物类型);分类任务需多标签处理。
- 映射缺失:并非所有源间都有 MRMAP 映射;跨源对齐需经 CUI 中转(两跳映射)。
- STR 大小写变体:同一词目的大小写/词序变体共享 SUI 之外的变体标记——词典去重应在 LUI/SUI 层而非字符串字面层。
§4.6 原子-词目-字符串三层模型
CUI C0001613(concept)
├── LUI L0001613(词目:nitric oxide)
│ ├── SUI S0001613a(字符串:"Nitric Oxide")
│ │ ├── AUI A0001613a(MeSH 原子:D019336)
│ │ └── AUI A0001613b(RxNorm 原子:…)
│ └── SUI S0001613b(字符串:"nitric oxide")
└── LUI L0001614(词目:nitrogen monoxide)
└── SUI ...(AUI 来自 SNOMED CT 原子)
- 这一四层标识符模型是 UMLS 精度的来源:NLP 的词典匹配在 SUI 层做,编码对账在 AUI 层做,语义任务在 CUI 层做——层级混用是事故之源。
§4.7 MRCONSO.RRF 十八列逐列详解
MRCONSO 是 UMLS 的「门面文件」——概念链接、词典构建、编码对账全部从它开始。它没有表头、以竖线分隔、每行一个原子,共 18 列。逐列语义与工程含义:
| # | 列名 | 类型/示例 | 语义 | 工程含义 |
|---|---|---|---|---|
| 1 | CUI | C0001613 | 概念 ID | 全局主键;分组键 |
| 2 | LAT | ENG/SPA/GER… | 原子语言 | 语言过滤第一列 |
| 3 | TS | P/S | 词目状态 | S=抑制词目,默认滤除 |
| 4 | LUI | L0001613 | 词目 ID | 词形变体归组 |
| 5 | STT | PF/VC/VW… | 字符串类型 | PF=首选形式;归一选它 |
| 6 | SUI | S0016248 | 字符串 ID | 精确字符串去重键 |
| 7 | ISPREF | Y/N | 源内首选 | 词典展示名选择 |
| 8 | AUI | A0001613 | 原子 ID | 行级主键(唯一) |
| 9 | SAUI | 源内原子码 | 源原子标识 | 极少用;对账源细节时用 |
| 10 | SCUI | 源内概念码 | 源概念标识 | 与源官方「概念」对账 |
| 11 | SDUI | 源内描述码 | 源描述标识 | SNOMED 类描述学源有用 |
| 12 | SAB | SNOMEDCT_US/RXNORM… | 源词表 RSAB | 源过滤 + 许可(配 MRSAB) |
| 13 | TTY | PT/SY/EN/MH… | 源内术语类型 | PT=首选术语;SY=同义词 |
| 14 | CODE | 40464003 等 | 源编码 | 与源系统互转的桥 |
| 15 | STR | nitric oxide | 名称字符串 | 词典正文 |
| 16 | SRL | 0-4 | 源限制层级 | 许可过滤(≥1 需查条款) |
| 17 | SUPPRESS | N/E/O/Y | 抑制标志 | Y/O 默认滤除;E=可编辑抑制 |
| 18 | (行尾竖线) | — | 分隔符收尾 | 解析时忽略最后空字段 |
五条高频解析错误与自检
- 列位错一:跳过任何一列(如把 SAUI 当 SCUI)——所有后续列左移一格,STR 读到 TTY。自检:断言第 12 列取值在 SAB 枚举内。
- 竖线出现在 STR 内:官方保证 RRF 内竖线已转义,但历史版本偶见裸竖线——按 18 列切分后校验行内字段数=18(含末尾空字段 19 段)。
- 把 TTY 当许可信息:TTY 是源内术语类型(PT/SY),与许可无关——许可看 SRL(16 列)与 MRSAB。
- LAT 过滤遗漏:只过滤 SUPPRESS 不过滤 LAT,会把西班牙语名称混进英语词典——词典构建双过滤必须同时声明。
- AUI 重复假设:AUI 在文件内唯一,但跨版本会重排——以 AUI 做跨版本追踪不可靠,跨版本用 CUI+(SAB,CODE)或 HISTORY 文件。
常用派生视图
视图 A(概念链接输出层):LAT=ENG AND TS=P AND SUPPRESS=N AND ISPREF=Y
→ 每个 CUI 一行首选英文名(约 1/10 体量)
视图 B(编码对账层):SAB ∈ {目标源} AND SUPPRESS=N
→ (SAB, CODE, CUI) 三列即跨源对账表
视图 C(词典全文层):LAT=ENG AND SUPPRESS=N(含同义词)
→ CUI-STR 倒排索引,供候选召回
§4.8 MRSAB 与周边文件速查
MRCONSO 之外,四个文件承担「元数据+关系+类型+映射」职责——按使用频率排序速查:
MRSAB.RRF(源词表元数据,许可合规核心)
- 每行一个「源词表×版本」记录:RSAB(缩写,如 SNOMEDCT_US)、VCVER(版本)、SRL(限制层级 0-4)、CUI(词表自身概念化)、ORIGIN/RESTRICTION 等列。
- 高频查询:
SELECT RSAB, SRL, VCVER FROM MRSAB WHERE CURVER='Y'——当前版本全源清单,许可尽调第一步。 - 陷阱:一个 RSAB 会有多行历史版本记录(CURVER=Y 过滤);SRL 与 MRCONSO 第 16 列数值一致但以 MRSAB 为准。
MRREL.RRF(概念间关系)
- 每行一个关系对:CUI1/REL/RELA/CUI2/SAB——CHD/PAR 为层级、RO 为关联、RB/RN 为更宽/更窄、XD/XS 为跨源映射标记。
- 体量最大(亿行级),加载与索引成本高于 MRCONSO;做知识图谱前先按 SAB 与 SUPPRESS 过滤。
- 陷阱:REL 与 RELA 是两级语义(REL=RO 时 RELA 才是 has_form 之类细粒度)——只用 REL 会丢失关系含义。
MRSTY.RRF(语义类型标注)
- 每行一个「CUI-TUI」对:C0001613|T121|Pharmacologic Substance|…——多标签(一概念多行)。
- 高频用法:类型过滤(只要药物/疾病/检验概念)、分类弱监督、语义类型先验(§6.3 重排)。
MRMAP.RRF(官方映射,有向)
- 每行一个映射规则:MAPFROM/MAPTO/MAPTYPE/MAPRULE/MAPSET——SNOMED↔ICD-10-CM、MeSH↔CPT 等高价值映射在此。
- 陷阱:MAPRULE 是条件逻辑(TRUE { 编码 })不是查表——需要规则引擎解释;映射有方向(FROMSAB→TOSAB)。
四文件联合使用模式
词典构建:MRCONSO(名称) + MRSTY(类型过滤)
知识图谱:MRREL(三元组) + MRSTY(节点类型) + MRSAB(源过滤)
编码互转:MRMAP(官方映射优先) + MRCONSO(CUI 中转兜底)
许可审计:MRSAB(SRL 分层) + MRCONSO.SRL(行级复核)
§5 划分与使用建议
§5.1 官方划分
- UMLS 无 ML 划分;官方提供的是子集机制:Level 0(许可最松)、Full Subset(全量)、语义类型过滤子集(MetamorphoSys 生成)。
§5.2 社区惯例划分
- MedMentions 型划分:以文献摘要为文档单元,随机划分训练/开发/测试——同文档 CUI 不得跨集。
- 按源词表切分:训练于 MeSH/RxNorm 源原子、测试于 SNOMED 源——检验跨源泛化。
- 按语义类型切分:留出完整 TUI(如全部 Laboratory Procedure)评估类型外推。
- 按版本切分:2025AB 训练、2026AA 测试——检验新概念时代的退化。
§5.3 泄漏风险(重点)
- 同义词泄漏:同一 CUI 的不同名称若分属训练与测试,词典模型直接作弊——以 CUI 分组划分。
- 同文档泄漏:MedMentions 类文献标注中,同篇文档反复出现的同一 CUI 必须同侧。
- 版本泄漏:历史文件(HISTORY)含被删除原子,混入训练会引入「现代不存在的概念」。
- 映射泄漏:映射补全任务中,MRMAP 的映射对若与测试对共享源/目标概念簇,会产生家族性泄漏。
§5.4 交叉验证建议
# 概念链接任务:按 CUI 分组 + 按文档分组的双约束划分
from sklearn.model_selection import GroupKFold
# groups1 = 文档 ID(同文档同侧)
# groups2 = CUI(同概念同侧)——GroupKFold 只能单约束,
# 实践中先按文档分折,再在折内检查 CUI 重叠并调折。
- 长尾 CUI(仅 1-2 个名称)是划分脆弱点:建议把「unseen surface form」与「unseen CUI」两类指标分开报告。
§5.5 外部验证建议
- 跨语料:MedMentions 训练 → 病历文本测试(体裁迁移:摘要→病历)。
- 跨语言:英语训练 → 西/法/德名称测试(UMLS 多语言原子)。
- 时间外推:2026AA 训练的链接模型在 2026AB 新概念上的表现(术语演化鲁棒性)。
- 下游对账:编码互转系统的输出与医院编码员人工对账结果的一致率。
§5.6 任务配方
配方 1:同义词扩展检索增强
- 索引侧:CUI→名称集合(MRCONSO 过滤 ISPREF 与 suppressible)。
- 查询侧:文本→初步实体→CUI→扩展名称→检索。
- 评测:医学检索基准的召回提升 + 扩展噪声率(错义扩展比例)。
配方 2:语义类型多标签分类
- 数据:MRSTY 弱监督(344 万概念全量标签)。
- 模型:生物医学编码器 + 多标签头;125 类长尾用分层采样。
- 校验:抽 1000 概念人工复核类型正确性(归组误差是标签噪声主源)。
配方 3:跨词表映射补全
- 训练:MRMAP 官方映射对 + MRREL 共现特征。
- 测试:时间留出(新版本新增映射)。
- 输出:映射候选 + 置信度,人工评审入库。
配方 4:概念定义生成(LLM)
- 输入:概念名称 + 语义类型 + 邻接关系。
- 目标:MRDEF 风格定义文本。
- 评测:人工盲评 + 与真定义的 ROUGE;用途是补全无定义概念的元数据。
§5.7 MedMentions 评测协议详解
MedMentions 是当前最大规模的公开 CUI 链接基准(约 4700 篇 PubMed 摘要、30 万+ 标注 span),其协议已成为「UMLS 概念链接」论文的事实标准——复现榜单前必须理解它的三个版本差异。
三个版本
| 版本 | 标注类型 | 候选空间 | 难度定位 |
|---|---|---|---|
| Full | 全部 Semantic Network 类型 | 全部 344 万 CUI | 最难(长尾概念主导) |
| st21pv | 21 个精选类型(TUI 白名单) | 预筛选子集(约 12 万) | 主流榜单口径 |
| random/ sample | 抽样子集 | 子集 | 快速实验用 |
协议要点
- 划分:train/dev/test = 3712/478/473 篇摘要,按文档划分——同篇摘要的 span 不跨集(防同文档泄漏)。
- 标注对象:每篇摘要人工标注提及 span 及其 CUI(含链接到 UMLS 的锚定);一个 span 可能链接到特定 CUI,未在 UMLS 中的实体不标注(这本身是协议边界)。
- 评测指标:微平均精确率/召回率/F1,端到端(NER+归一联合)与 given-span(只归一)两种口径——比较论文时先确认口径一致。
- st21pv 细节:21 类型白名单砍掉了 Chemical 之外的多数噪音类型,候选空间缩小到约 12 万概念——「在 st21pv 上 90%」与「在 Full 上 90%」完全不可比。
复现榜单的工程检查单
- [ ] 版本声明:Full 还是 st21pv;候选字典构建的 UMLS 版本(2017AA 原版 vs 2026AA 复刻)。
- [ ] 字典口径:是否过滤 suppressible/LAT——不同字典的召回上限差异可达数个百分点。
- [ ] 口径声明:端到端 or given-span;微平均 or 宏平均。
- [ ] unseen 分析:测试集中概念在训练集出现比例——跨版本复刻时未见概念比例显著更高。
- [ ] 基线对照:BM25+重排、SapBERT 类编码器、LLM 提示三档基线至少复现一档。
与站内任务的对齐
- 榜单数字(st21pv F1 约 85-90% 区间)代表「文献摘要、白名单类型、候选有界」的理想条件;病历场景(缩写、错拼、口语化)通常会掉 10-20 个点——引用文献数字做产品预期时必须打折并注明体裁差异。
§6 AI 就绪指南
§6.0 云端快速启动
# 1) UTS 注册 + 签署 UMLS Metathesaurus License(免费)
# https://uts.nlm.nih.gov/
# 2) 下载路径(二选一)
# A. 完整版: umls-2026AA-full.zip (5.3 GB)
# B. 快速起步: MRCONSO.RRF 单文件 (492 MB)
# 3) 在线 API(免下载)
curl -H "Content-Type: application/json" \
-d '{"string":"heart attack","search":"2"}' \
"https://uts-ws.nlm.nih.gov/rest/search/current?apiKey=$UTS_KEY&string=heart%20attack"
§6.1 快速上手(RRF 解析)
# ============================================================
# MRCONSO.RRF → 同义词词典最小构建(英语、非抑制原子)
# ============================================================
import pandas as pd
cols = ["CUI","LAT","TS","LUI","STT","SUI","ISPREF","AUI","SAUI",
"SCUI","SDUI","SAB","TTY","CODE","STR","SRL","SUPPRESS"]
df = pd.read_csv("MRCONSO.RRF", sep="|", header=None,
names=cols, dtype=str, low_memory=False)
eng = df[(df.LAT == "ENG") & (df.TS == "P") & (df.SUPPRESS == "N")]
print("概念数:", eng.CUI.nunique(), "名称数:", len(eng))
# CUI → 首选名称映射(概念链接的输出可读化)
pref = eng[eng.ISPREF == "Y"].drop_duplicates("CUI", keep="first")
cui2name = dict(zip(pref.CUI, pref.STR))
§6.2 SQL 入库与分析
-- MySQL 全量载入(官方脚本)后:
-- 1) 某药物概念的全部跨源编码
SELECT SAB, CODE, STR
FROM MRCONSO
WHERE CUI = (SELECT CUI FROM MRCONSO
WHERE STR = 'aspirin' AND TS='P' AND LAT='ENG' LIMIT 1)
AND SUPPRESS = 'N'
ORDER BY SAB;
-- 2) 各语义类型概念计数(MRSTY)
SELECT TUI, COUNT(DISTINCT CUI) AS n
FROM MRSTY GROUP BY TUI ORDER BY n DESC;
-- 3) 层级关系抽样(CHD/PAR)
SELECT CUI1, CUI2 FROM MRREL
WHERE REL IN ('CHD','PAR') AND SUPPRESS='N' LIMIT 100;
§6.3 概念链接管线(与 SNOMED/词典协同)
文本 → 句子切分 → NER(实体 span)
→ 候选生成:SPECIALIST 归一 + MRCONSO 精确匹配 + BM25 模糊召回
→ 候选重排:上下文相似度 + 语义类型先验(MRSTY)+ 源偏好(SAB 权重)
→ 输出:CUI + 可读名称(ISPREF=Y)+ 置信度
- SPECIALIST 归一是第一道闸:nitric oxide vs Nitric Oxide 的词形差异在词法层消除,降低候选数。
- 语义类型先验:「检验值升高」类上下文应偏向 Laboratory Procedure 类型候选。
- 源偏好:临床场景提高 SNOMED/RxNorm 源权重,文献场景提高 MeSH 权重。
§6.4 表格层建模建议
- 映射补全:以 MRMAP 已知映射对训练,特征 = 名称相似度 + 语义类型匹配 + 层级(MRREL CHD/PAR)距离。
- 归组质量审计:同一 CUI 内原子语义一致性建模——发现过归组簇(如同名异义药物)。
- 概念流行度预测:以文献共现预测概念在真实 EHR 中的使用频率。
§6.5 坑点(Pitfalls)
坑点 1:RRF 是竖线分隔且无表头
MRCONSO 等 RRF 文件用 | 分隔、无 header——pd.read_csv(sep=',') 或假设 header 会全盘错位。必须显式指定列名清单(官方 Columns and Data Elements 文档)。
坑点 2:suppressible 原子污染词典
不过滤 SUPPRESS/TS 字段会把废弃概念、历史名称混入词典——归一结果会指向「不存在于任何现行词表」的名称。默认策略:TS=P 且 SUPPRESS=N。
坑点 3:同一 CUI 的跨源编码不是等价编码
CUI 归组表示「同义」,但源编码各自属于不同计费/统计体系——把 RxNorm 码直接当 ICD 码写回计费系统是典型的集成事故。
坑点 4:语义关系 ≠ 因果知识
MRREL 的 RO/RB/RN 与 Semantic Network 的 treats/causes 是词表级关系,不是经过验证的因果事实——直接当知识图谱做推理会放大词表编纂偏差。
坑点 5:版本切换的原子蒸发
大版本会删除原子(进入 HISTORY 文件);跨版本累积词典时必须以 HISTORY 补齐,否则旧查询在新版本上静默失败。
坑点 6:多语义类型的多标签现实
一概念多 TUI 是常态;把 MRSTY 当单标签处理会丢类型——分类任务应多标签建模。
坑点 7:许可分层被忽略
从 Full Release 直接抓取含 CPT/SNOMED 的原子用于商业产品,可能违反 Level 2/3+ 附加条款——管线内以 MRSAB.SRL 字段做许可过滤并留档。
坑点 8:MetamorphoSys 内存与时间
定制子集需 40 GB+ 磁盘、2-10 小时;在容器内运行时忘记挂载大磁盘或超时杀死是新手常见事故——优先用官方预计算子集。
§6.6 UTS REST API 要点
- 端点族:search(文本→CUI)、concept(CUI→原子/定义/关系)、crosswalk(跨源编码转换)、semantic-network(类型/关系元层)。
- 认证:UTS API key(账户中心生成);限额按 key 计。
- 版本参数:
/rest/search/current或指定版本(如 2026AA)——生产系统应锁定版本,防 API 悄然升级。
§6.7 与 LLM 的集成模式
- 约束解码:CUI 词表约束生成(同 SNOMED 条目模式);MRCONSO 词典做输出校验。
- 同义词注入:RAG 检索前以 CUI 扩展查询词(344 万概念的同义词面)。
- 定义增强:MRDEF 定义文本作为概念上下文注入 prompt(覆盖约部分概念;无定义概念回退到 STR + 语义类型名)。
- 评测:以 MedMentions 等 CUI 基准评测 LLM 概念链接能力;报告 unseen CUI 子指标。
§6.8 大规模加载的性能实践
- MySQL 全量:官方 load 脚本 +
innodb_flush_log_at_trx_commit=0(加载期临时);全量约数小时。 - 索引策略:MRCONSO 的 (STR)、(CUI)、(SAB,CODE) 三索引是查询热路径;MRREL 的 (CUI1) 与 (CUI2) 各一。
- 增量更新:UMLS 无官方增量文件——半年大版本建议全量重建(词典类资产重建成本低)。
§6.9 医院编码互转实战(crosswalk 工程)
医院多系统并存是常态:HIS 用 ICD-10-CM、检验系统用 LOINC、药房用 RxNorm、病案首页要 SNOMED——「编码互转」是信息科最日常也最易踩坑的工程。UMLS 提供两条互转通道,各有适用面。
通道一:CUI 中转(通用但有两跳误差)
ICD-10-CM 码 ─MRCONSO→ CUI ─MRCONSO→ SNOMED CT 码
- 优点:任意源对任意源都通(344 万概念的归组即桥梁)。
- 代价:CUI 归组是「同义」粒度,不是「编码体系等价」粒度——ICD 的计费特异分类(如并发症分档)在 CUI 层被拉平,转回去时会丢失分档信息。
- 自检:对每对互转码抽查 50 例请编码员复核——「同 CUI 不同编码」的医学可互换率通常 70-90%,直接当 100% 用是事故。
通道二:MRMAP 官方映射(保真但覆盖有限)
-- 例:SNOMED → ICD-10-CM 官方映射(MRMAP)
SELECT MAPFROM, MAPTO, MAPTYPE, MAPRULE
FROM MRMAP
WHERE FROMSAB = 'SNOMEDCT_US' AND TOSAB = 'ICD10CM'
AND MAPSUPPRESS = 'N';
- 优点:官方编码员维护,映射类型(MAPTYPE)与规则(MAPRULE,含 TRUE/FALSE 条件逻辑)保留语义精度——SNOMED↔ICD-10-CM 这类高价值映射对基本都有官方覆盖。
- 代价:只覆盖「有官方映射」的源对;规则引擎(MAPRULE 的条件判断)需要自行实现——纯查表会得到错误映射。
- 实现:MAPRULE 形如
TRUE { 51950009 }或带 ICD 主诊断语境的条件——建议把规则编译成谓词表达式引擎(如 Pythonsimpleeval)而非正则替换。
实战管线与对账
1. 建映射优先级表:MRMAP 官方映射 > CUI 两跳 > 名称相似度兜底
2. 映射质量分级输出:每个转换结果带「来源通道 + 置信度」
3. 人工对账闭环:低置信度结果进编码员队列,复核结果回写训练对
4. 版本锁定:映射随 UMLS 版本(2026AA)+ 源词表版本(如 ICD-10-CM 2026)双重锁定
5. 审计留痕:医疗计费相关转换必须可回溯(输入码、输出码、通道、版本、时间)
三条红线
- 计费编码(CPT/DRG 类)转换结果不得自动入账——必须人工确认(Level 2 许可 + 临床责任双重原因)。
- 映射方向性:MRMAP 的 FROMSAB→TOSAB 是有向的;反向使用需检查 RELA(XD/XS 类双向标记)或重查反向映射表。
- 版本漂移:ICD-10-CM 年度更新、SNOMED 月度更新——映射表每半年随 UMLS 更新一次,期间新增源码会「无映射可查」,需名称兜底路径并标记为待审。
§7 评估基准与 DAIMS 评估
§7.1 DAIMS 评估(24 项)
| # | 维度 | 评估项 | 得分 | 说明 |
|---|---|---|---|---|
| 1 | 可得性 | 注册后免费下载 | 4/5 | 签署制免费;无费用但需账号 |
| 2 | 可得性 | 机器可读许可 | 3/5 | 分层许可(Level 0-3+)复杂 |
| 3 | 可得性 | 稳定持久标识(CUI) | 5/5 | CUI 是文献级公共键 |
| 4 | 结构化 | 受控结构完备度 | 5/5 | 四层标识符+RRF 规范严格 |
| 5 | 结构化 | 关系型就绪 | 5/5 | MySQL/Oracle 脚本直载 |
| 6 | 结构化 | schema 稳定性 | 4/5 | RRF 长期稳定;列扩展需跟踪 |
| 7 | 文本 | 名称/定义文本资产 | 5/5 | 1370 万名称+定义 |
| 8 | 文本 | 文本规范化程度 | 3/5 | 跨源字符串风格不一 |
| 9 | 版本 | 历史保留 | 4/5 | HISTORY 文件机制(2004AA 起) |
| 10 | 版本 | 发布节奏 | 4/5 | 半年;无增量文件 |
| 11 | 结果 | 跨词表映射覆盖 | 4/5 | MRMAP 官方映射 |
| 12 | 结果 | 映射质量一致性 | 3/5 | 映射源质量不均 |
| 13 | 结果 | 多语言覆盖 | 3/5 | 多语言名称覆盖不均 |
| 14 | 质量 | 归组准确性 | 3/5 | 过归组/欠归组已知 |
| 15 | 质量 | 类型标注一致性 | 4/5 | 规则为主,边缘有争议 |
| 16 | 质量 | 机构 ID 化 | 5/5 | CUI/AUI 即标识 |
| 17 | 治理 | 更新频率 | 4/5 | 半年 |
| 18 | 治理 | 变更通告 | 4/5 | 发布文档+What’s New |
| 19 | 治理 | 法规锚定 | 5/5 | NLM 官方基础设施 |
| 20 | AI 任务 | 概念链接适用性 | 5/5 | MedMentions 等基准生态 |
| 21 | AI 任务 | NLP 词法适用性 | 5/5 | SPECIALIST 独一份 |
| 22 | AI 任务 | 大模型适配适用性 | 4/5 | 定义+名称语料;许可需确认 |
| 23 | 伦理 | 个体隐私风险 | 5/5 | 纯术语无患者数据 |
| 24 | 伦理 | 二次使用许可清晰度 | 3/5 | 分层条款需法律尽调 |
DAIMS 综合:101/120(4.21/5)——结构化与 AI 任务维度近满分;许可分层与归组质量是主要短板。
§7.2 可复现分析路线
- 复现概念规模:MRCONSO 过滤(ENG/TS=P/SUPPRESS=N)后 CUI 计数对照官方统计。
- 复现类型分布:MRSTY 按 TUI 计数对照 Semantic Network 统计页。
- 复现源构成:MRSAB 按 SRL 分层计数,验证 Level 0/1/2/3+ 构成。
§7.3 外部评测资源
- MedMentions:大规模文献 CUI 链接基准(约 30 万标注 span)。
- n2c2 系列共享任务:病历 NER+归一(CUI/SNOMED 标注子集)。
- ShARe/CLEF eHealth:临床文本 disorder 归一(CUI)。
§7.4 质量审计清单(发布前)
- [ ] 版本号(2026AA)写入产物元数据。
- [ ] 词典过滤策略(TS/ISPREF/SUPPRESS/LAT)显式声明。
- [ ] 许可过滤(MRSAB.SRL)与用途匹配留档。
- [ ] 同义词扩展的错义率抽样报告(≥200 样本人工评审)。
- [ ] 跨版本词典合并使用了 HISTORY 文件。
- [ ] 语义关系未被当作因果知识输出。
- [ ] 多标签语义类型正确处理(非 argmax 单标签)。
§7.5 模型卡要点
| 卡片项 | 建议声明内容 |
|---|---|
| UMLS 版本 | 2026AA(必填) |
| 过滤策略 | LAT/TS/ISPREF/SUPPRESS/SRL |
| 训练标注源 | MedMentions/n2c2/自有标注及许可 |
| 已知偏差 | 归组误差、英语中心、源词表风格差异 |
| 评测协议 | unseen CUI/ surface form 双指标 |
| 许可声明 | 主许可 + 受限源(SNOMED/CPT)处理方式 |
§7.6 与站内数据集的联合分析建议
| 联合对象 | 键 | 分析价值 |
|---|---|---|
| snomed-ct | SCTID ↔ CUI(MRCONSO/SAB=SNOMEDCT) | 单本体 vs 集成层的精度对照 |
| loinc | LOINC 码 ↔ CUI | 检验语义双体系对齐 |
| mimic-iii / mimic-iv | 诊断/操作编码 ↔ CUI | EHR 概念化的标准路径 |
| clinicaltrials-gov | conditions ↔ CUI | 注册病种归一 |
| drugbank | 药物 ↔ RxNorm ↔ CUI | 分子-临床三层联动 |
| faers | 药物/事件 ↔ CUI | 安全信号归一 |
| radgraph | 实体 ↔ CUI | 放射文本结构化 |
| gwas-catalog | 性状 ↔ MeSH/CUI | 遗传证据的表型归一 |
§7.7 CUI 与 SCTID 双键治理对照
当机构同时使用 UMLS(CUI)与 SNOMED CT(SCTID)时,「双键并存」是常态也是事故温床——两键的粒度、稳定性、更新节奏都不同,治理策略必须显式区分。
两键特性对照
| 特性 | CUI | SCTID |
|---|---|---|
| 粒度 | 跨词表同义归组(344 万) | 单本体临床概念(约 36 万活跃) |
| 稳定性 | 半年批量调整(归组会变) | 月度演进;概念不删除只弃用 |
| 粒度变化 | 归组边界会随版本移动 | 概念边界稳定、层级演进 |
| 分发渠道 | UMLS Full Release | MLDS/成员中心 |
| 表达能力 | 无组合逻辑 | 后组配表达式/引用集合 |
| 适合做主键的场景 | 跨源对账、文献链接、检索扩展 | 临床本体推理、EHR 结构化录入 |
双键治理五原则
- 主键选一、副键跟随:临床数据仓主键选 SCTID(粒度细、本体强),文献/映射层副键用 CUI;两键间以 MRCONSO(SAB=SNOMEDCT_US)映射表衔接,映射版本随 UMLS 版本锁定。
- 不假设一一对应:多个 SCTID 可归入同一 CUI(同义归组),同一 SCTID 的不同原子也可能分属不同 CUI(欠归组)——映射表永远多对多,做 1:1 断言的迁移脚本必炸。
- 版本三重锁:记录(UMLS 版本, SNOMED 版本, 映射抽取日期)三元组——只记 UMLS 版本会在 SNOMED 月度演进时无法解释差异。
- 归组变更监控:半年版本升级时 diff 映射表——新增「SCTID→CUI」合并说明 NLM 归组策略变化,下游统计口径需要重算。
- 弃用语义对齐:SNOMED 弃用概念(inactive)在 UMLS 中可能仍以 suppressible 原子存在——两侧的「删除/弃用/抑制」语义不同,对账报表需显式声明各侧口径。
典型故障案例
- 报表口径漂移:某院以 CUI 做统计主键,UMLS 半年升级后若干概念被重新归组,季度同比报表突然跳变——根因是未锁版本 + 未做归组 diff。对策:版本锁定 + 归组变更日志 + 报表重算声明。
- 双键重复计数:同一诊断在 SCTID 层有两个特异概念、CUI 层被归为一个——按 SCTID 统计得 2 例、按 CUI 统计得 1 例,两套报表打架。对策:明确「统计粒度即报表语义」,双键报表各自标注粒度。
§8 伦理、隐私与合规
- 无患者数据:纯术语/词法资产,隐私风险为零。
- 许可分层是核心合规面:Level 0 自由;Level 1 申报;Level 2+(CPT 等)商用需额外授权;SNOMED 走附录 2——AI 产品商业化前必须逐源确认。
- 归组误差的临床边界:CUI 归一结果用于临床决策支持时,需明示「同义归组存在已知误差」并提供编码回查。
- 禁背书:NLM 提供数据不等于认可衍生产品。
§8.1 许可尽调操作清单(商业化前)
UMLS「免费」的名声掩盖了其分层条款的复杂性——商业化(尤其 SaaS/出海产品)前按本清单逐项过一遍,可将法律风险压缩到可审计的水平。
[ ] 第 1 步:签署状态确认
- UTS 账号有效,UMLS Metathesaurus License 已签署且条款版本在有效期
- 签署主体(公司名)与产品运营主体一致——代签不可
[ ] 第 2 步:源词表清单导出
- 从实际使用的数据导出 DISTINCT SAB 清单(不是从文档抄)
- 对照 MRSAB:每源记录 SRL / VCVER / RESTRICTION 列
[ ] 第 3 步:受限源逐项处置
- Level 0(SRL=0):放行,留档即可
- Level 1(SRL=1):完成 NLM 申报义务(报告中报路径)
- Level 2(SRL=2,含 CPT 类):确认商用授权或从数据中剔除
- Level 3+(含 SNOMED,附录 2):确认属地(美国走附录 2;
其他属地走当地 Member Licensee)并留属地证据
[ ] 第 4 步:产品边界核对
- 数据再分发?Level 0 可(遵循主许可);受限源不可
- API 输出含源编码与名称?确认各受限源「展示/输出」条款
- 模型权重含受限源训练痕迹?按各源条款确认「衍生品」定义
[ ] 第 5 步:留痕与复检
- 本清单执行结果存档(SAB 清单、决策、证据链接)
- 每半年随 UMLS 版本升级复检一次(源清单会变)
- 最常见翻车点:第 3 步的「以为 Level 0」——MRSAB 里同名源有多个 RSAB 变体(如 SNOMEDCT_US 与 SNOMEDCT_VET 许可属性不同),按 SAB 前缀模糊匹配会漏掉变体源的限制。
§9 版本历史与演进
| 时间 | 演进 | 对 AI 用户的影响 |
|---|---|---|
| 1986-1989 | 立项到首版 | 跨词表集成路线确立 |
| 1990s | 三组件定型 | Metathesaurus/Network/SPECIALIST 分工明确 |
| 2004AA | 历史文件机制 | 跨版本研究成为可能 |
| 2000s | RRF + MetamorphoSys | 机器可解析与子集定制 |
| 2010s | 半年节奏 + UTS API | 生产化服务 |
| 2024AB | 子集含 obsolete/suppressible | 自行清洗策略需更新 |
| 2026-05-04 | 2026AA 发布(本文口径) | 344 万概念/1370 万名称/199 源 |
§9.1 未来演进方向
- 子集策略重塑:NLM 正在征求意见,可能以新式预计算子集或浏览器端配置取代 MetamorphoSys——定制流程或将大幅简化。
- 与 SNOMED 月度节奏的衔接:SNOMED 月度化后,UMLS 半年打包与源词表节奏的时间差管理愈发重要。
- LLM 时代的定位:概念归一与跨词表对账仍是 LLM 的确定性短板,UMLS 的「确定性映射层」价值反而上升。
§9.2 使用本条目时的维护提示
- 规模数字随半年版本浮动,引用必须带版本号(如 2026AA)。
- 源词表数量与许可层级每版复核(MRSAB)。
- MetamorphoSys 的子集策略正在评估变更,跟踪官方公告。
- 语义类型数量以 Semantic Network 当前版本为准(历史文献中的 133 类口径已过时,现为 125 类 + 54 关系)。
- MRCONSO 列位若在后续版本扩展(新增列追加在 SUPPRESS 之前的历史惯例不可依赖),解析器应以官方 Columns 文档为准重新校准。
§10 引用与资源
§10.1 官方资源
| 资源 | 链接 | 说明 |
|---|---|---|
| UMLS 官网 | https://www.nlm.nih.gov/research/umls/ | 总入口 |
| 下载页 | https://www.nlm.nih.gov/research/umls/licensedcontent/umlsknowledgesources.html | Full/Subsets/API(2026AA) |
| 发布文档 | https://www.nlm.nih.gov/research/umls/knowledge_sources/metathesaurus/release/index.html | What’s New/统计/许可附录 |
| UTS 账号 | https://uts.nlm.nih.gov/ | 注册/签署/API key |
| 新闻页 | https://www.nlm.nih.gov/research/umls/news/ | 版本发布公告 |
§10.2 学术引用
- Bodenreider O. The Unified Medical Language System (UMLS): integrating biomedical terminology. Nucleic Acids Res. 2004;32(Database issue):D267-270.
- Lindberg DA, Humphreys BL, McCray AT. The Unified Medical Language System. Methods Inf Med. 1993;32(4):281-291.
- Sung M, Jeon H, Lee S, Kang J. Biomedical entity representations with synonym marginalization. ACL 2020.(MedMentions 相关)
- National Library of Medicine. UMLS Knowledge Sources, 2026AA Release Documentation. 2026-05-04.
§10.3 站内互链
- snomed-ct:集成层最大源词表;美国分发经 UMLS 附录 2(见 §3.13)
- loinc:检验语义的互补体系(同为源词表)
- mimic-iii / mimic-iv:EHR 概念化的主战场
- clinicaltrials-gov:NLM 官方系统使用 UMLS 的实例
- pubmedqa / medqa:医疗 NLP 评测语境
- radgraph:同为「临床文本结构化」范式
- drugbank / faers / gwas-catalog / open-targets:分子与证据层扩展
- eicu-crd / gossis-1:ICU 数据库的诊断编码 CUI 化路径
- medmcqa / emrqa:考试与问答基准中的术语归一语境
- umls 数据资产与源词表条目(snomed-ct/loinc)形成「集成层-源层」双视图
§10.4 建议引用格式
@misc{umls_2026aa,
title = {Unified Medical Language System (UMLS) Knowledge Sources},
author = {{U.S. National Library of Medicine}},
howpublished = {https://www.nlm.nih.gov/research/umls/},
note = {2026AA release, May 4 2026; 3.44M concepts, 199 source vocabularies},
year = {2026}
}
§10.5 常见问题 FAQ
Q1:UMLS 与 SNOMED CT 什么关系?
A:两个层面——法律上美国用户经 UMLS License(附录 2)合法获取 SNOMED;数据上 SNOMED CT 是 UMLS Metathesaurus 的源词表之一,其概念在 Metathesaurus 内与 198 个其他词表互联。
Q2:做概念链接用 UMLS 还是 SNOMED?
A:目标空间更广、跨词表可比选 UMLS(CUI);需要本体推理与临床组合表达选 SNOMED(SCTID)。工程上常见 CUI-SCTID 双键并存(MRCONSO 含映射)。
Q3:为什么我统计的概念数与官方不一致?
A:过滤口径——是否含 suppressible 原子、是否限定英语、是否含 obsolete;官方「344 万概念」有自己的统计口径,务必对齐后再比较。
Q4:能直接把 MRREL 当医疗知识图谱训练推理模型吗?
A:谨慎——MRREL 大部分是词表层级/映射关系,因果类关系稀疏且未经临床验证;知识图谱推理建议以「层级+映射」为主,因果声明需外部证据源补充。
Q5:全量加载有必要吗?
A:多数 NLP 任务 MRCONSO+MRSTY+MRDEF 三文件即可起步(约 3 GB 解压);全量(40 GB)只在需要全部关系与映射时才有必要。
Q6:CUI 会变吗?我能把 CUI 当长期主键吗?
A:CUI 的设计意图是长期稳定,但归组边界确实会随版本微调(合并/拆分)。短中期(1-3 年)以 CUI 做研究主键是学界惯例;长期系统建议「CUI + (SAB,CODE)源锚点」双记录——源锚点来自源词表、比 CUI 归组更稳定,跨版本对账时以锚点为轴。凡引用 CUI 的成果必须带 UMLS 版本号(如 2026AA),无版本号的 CUI 引用不可复现。
Q7:为什么我的映射结果和商业术语服务不一样?
A:三个常见原因——①商业服务叠加了人工评审映射或私有规则(UMLS 的 MRMAP 是机器+人工混合产物);②版本不同步(商业服务可能基于旧版 UMLS 或新版 SNOMED);③MAPRULE 规则引擎实现不同(条件映射的规则解释差异)。对账时先对齐版本与规则解释,再谈质量差异。
Q8:LLM 时代还需要 UMLS 吗?
A:恰恰更需要——LLM 的概念输出是概率的、版本漂移的、不可核查的;CUI 提供的是确定性归一与可验证锚点。主流实践是「LLM 生成候选 → UMLS 词典约束校验」:LLM 负责语言理解(缩写、错拼、口语),UMLS 负责概念对账(编码、版本、跨词表)。纯 LLM 无词表约束的医疗归一系统在医院审计中基本过不了关。
(全文完;本文共 §0-§10 十一个章节,规模数字以 UMLS 2026AA 官方口径为准,版本日期 2026-05-04。)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- distemist — 共享标签:医疗NLP / 知识图谱 / 临床文本 / 命名实体识别
- cometa — 共享标签:医疗NLP / 知识图谱 / 命名实体识别
- pharmaconer — 共享标签:医疗NLP / 临床文本 / 命名实体识别
- medmentions — 共享标签:医疗NLP / 知识图谱 / 命名实体识别
- meddoprof — 共享标签:医疗NLP / 临床文本 / 命名实体识别
- cantemist — 共享标签:医疗NLP / 临床文本 / 命名实体识别
- snomed-ct — 共享标签:医疗NLP / 知识图谱 / 临床文本
- loinc — 共享标签:医疗NLP / 知识图谱 / 临床文本
- radgraph — 共享标签:医疗NLP / 临床文本 / 命名实体识别
- maccrobat — 共享标签:医疗NLP / 临床文本 / 命名实体识别
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

