SNOMED CT — 全球临床健康术语集 AI-Ready Wikipedia

约 36 万概念的全球统一临床术语本体,2026 年起月度发布的医疗互操作语言基座

来源 https://www.snomed.org/ ;MLDS 分发:https://mlds.ihtsdotools.org/ ;美国版:https://www.nlm.nih.gov/healthit/snomedct/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 32
SNOMED CT — 全球临床健康术语集 AI-Ready Wikipedia

信息速览

数据集名称SNOMED CT — 全球临床健康术语集 AI-Ready Wikipedia
数据类型约 36 万活跃概念,RF2 月度发布(2026 起),ICD-10-CM 映射 12.6 万+ 概念,75+ 国家使用 · 会员国免费
规模术语集本身不含患者数据;用于结构化全球电子病历中的临床陈述
接入方式https://www.snomed.org/ ;MLDS 分发:https://mlds.ihtsdotools.org/ ;美国版:https://www.nlm.nih.gov/healthit/snomedct/
AI 就绪度

SNOMED CT — 全球临床健康术语集 AI-Ready Wikipedia

INFOBOX

数据集名称 SNOMED CT(医学系统命名法——临床术语)
英文全称 Systematized Nomenclature of Medicine Clinical Terms
别名/简称 SNOMED CT、SCT;前身为 SNOMED RT 与英国 Clinical Terms(Read Codes v3)
领域定位 全球最全面的临床健康术语集与机器可读本体;EHR 语义互操作的语言基座
数据模态 术语本体:概念(Concept)/ 描述(Description)/ 关系(Relationship)三核心表 + 历史表 + 60+ 参考集(语言/映射/组件标注)
AI 任务类型 命名实体链接(概念归一)、同义词归一、层级推理(IS-A 传递)、ICD 自动映射、多语言对齐、EHR 文本结构化、大模型领域适配与 RAG
样本总数 活跃概念约 36 万个(国际版,2026 口径);描述逾百万条;IS-A 与定义关系合计逾百万条;美国版叠加 30 万+ 唯一概念与 ICD-10-CM 映射 12.6 万+ 源概念
数据大小 国际版 RF2 全包约 1-2 GB(压缩);解压后含数十张制表符分隔文件
数据格式 RF2(Release Format 2)制表符分隔文本;Snowstorm 服务器提供 JSON API;OWL 转换用于推理
许可证 分层许可:成员国免费;美国经 UMLS Metathesaurus License 免费(NLM 分发);其他用途 Affiliate License(免费注册制)
访问级别 注册获取(MLDS 分发站);训练模型前必须完成属地许可尽调
语言 英语源术语;13+ 成员国语言翻译(挪威约 13 万概念已译等)
首发日期 2002 年(SNOMED RT 与 Clinical Terms 合并发布首版 SNOMED CT)
最后更新 国际版 2026-09-01(月度节奏);US Edition 20260301(半年节奏)
发布机构 SNOMED International(原 IHTSDO,2007 年从美国病理学家学会 CAP 收购,非营利协会)
官方主页 https://www.snomed.org/ ;美国版:https://www.nlm.nih.gov/healthit/snomedct/

§0 E-E-A-T 信任声明与免责声明

  • 经验(Experience):本文基于 SNOMED International 官方发布说明(2026 年 2/5/9 月国际版)、NLM Tech Bull(2026 年 3 月美国版公告)、挪威卫生局 2025-2026 大模型报告与 BioPortal 分发元数据撰写,关键数字均注明口径来源。
  • 专业性(Expertise):内容覆盖术语学本体结构(RF2/MRCM/OWL)、许可体系(成员国/UMLS/Affiliate 三层)、工程部署(Snowstorm)与 AI 实践(概念链接、层级推理)。
  • 权威性(Authoritativeness):SNOMED CT 由 SNOMED International 维护,是全球 75+ 国家使用的临床术语标准,也是美国 EHR 认证指定的问题列表国家标准。
  • 可信度(Trustworthiness):规模数字在不同来源间存在口径差异(国际版/美国版/含扩展),本文逐处标注;许可结论不构成法律意见,商用前应咨询属地国家发布中心(NRC)。
  • 免责声明:SNOMED CT 为属地许可数据,本文不提供数据文件本体;所有下载行为须自行完成许可注册。
  • 数字口径说明:「约 36 万概念」综合官方 350,000+ 与挪威卫生局 2026 年「近 37 万」口径;关系数因统计范围(仅 IS-A 或含定义关系)而异,本文注明区间。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:全球最全面的临床健康术语本体——约 36 万活跃概念、逾百万描述与语义关系,机器可推理。
  • 为什么重要:它是 EHR 语义互操作的「世界语」——75+ 国家使用,美国 EHR 认证的法定标准之一。
  • AI 价值:为临床文本提供概念归一的目标空间;IS-A 层级支持推理;ICD 映射桥接统计口径。
  • 获取方式:MLDS 注册下载 RF2;美国经 UMLS 免费许可;Snowstorm 开源服务器一键部署。
  • 成本:数据免费(注册制),许可属地化——训练模型前务必确认属地条款。
  • 一句话:想让模型理解「急性阑尾炎」与「阑尾穿孔」的层级关系,绕不开 SNOMED CT。

§1.1 摘要

SNOMED CT(Systematized Nomenclature of Medicine — Clinical Terms)是全球覆盖面最广、概念粒度最细的临床健康术语集。它由 SNOMED International(原国际卫生术语标准制定组织 IHTSDO,2007 年 4 月从美国病理学家学会 CAP 收购 SNOMED CT 后运营的非营利协会)维护,2002 年由 SNOMED RT 与英国 NHS 的 Clinical Terms(Read Codes v3)合并而成。截至 2026 年,其国际版含约 36 万个活跃概念、逾百万条描述(Fully Specified Name 与同义词)以及构成机器可读本体的百万级语义关系,被 75 个以上国家与地区采用。

从组织结构看,SNOMED CT 是一个多轴、多层的定向无环图(DAG)而非简单列表。19 个顶层层级覆盖临床发现(Clinical Finding)、操作(Procedure)、机体结构(Body Structure)、药物/生物制品(Pharmaceutical/Biologic Product)、标本(Specimen)、观测(Observable Entity)等;概念间以 IS-A 层级关系与定义属性关系(如「关联形态学」「方法」)连接,配合 OWL-DL 表达与推理机(ELK)可实现自动分类——新概念只要给出充分定义,其层级位置即由机器推导。这一「充分定义优先」的本体工程路线,使 SNOMED CT 与 ICD 类统计分类(枚举式)有本质区别:前者支持组合表达与推理,后者支持计数与报销。

从发布机制看,SNOMED CT 以 RF2(Release Format 2)制表符分隔文件分发,2026 年起国际版升级为月度发布(此前每年 1 月/7 月),美国版保持 3 月/9 月半年节奏。每次发布包含概念、描述、关系三核心表的全量与增量快照、历史表(concept history 与 inactivation 依据)以及 60 余种参考集(Reference Set)——涵盖语言偏好(Language Refset)、ICD-10/ICD-O 映射、组件标注等。2026 年的两次重要技术变化:描述字段上限从 255 字符升至 4096 字符(2026 年 7 月,驱动因素为多价疫苗等超长药物术语),以及 CNC(Concept Non Current)指示符的弃用。

从 AI 视角看,SNOMED CT 提供三类核心资产。其一是归一目标空间:临床 NER 输出的疾病/症状/操作表面字符串,经概念链接对齐到 SNOMED 概念 ID,是 UMLS、LOINC 等术语基础设施协同工作的枢纽。其二是推理骨架:IS-A 传递闭包与定义关系支持层级推理(「阑尾炎」IS-A「胃肠道疾病」),可用于弱监督扩展标签与构建知识图谱。其三是跨语言锚点:成员国语言参考集(挪威约 13 万概念翻译等)使同一概念 ID 贯穿多语言病历。美国版额外提供 12.6 万+ 概念的 ICD-10-CM 映射,直接支撑统计编码自动化。

许可采用属地化三层结构:成员国免费(含翻译资产);美国经 UMLS Metathesaurus License 由 NLM 免费分发;其余用途适用 SNOMED International 的 Affiliate License(多数用途免费但须注册)。这一「免费但不自由」的许可形态意味着:AI 团队在使用前必须完成属地尽调,尤其是涉及模型发布、跨境部署与商业化场景。

§1.2 战略价值

  • 语义互操作的法定基座:美国 ONC EHR 认证将 SNOMED CT 指定为问题列表与公共卫生报告标准;欧盟、加拿大、澳大利亚、中国等均将其纳入国家卫生信息框架。
  • 临床粒度的不可替代性:ICD 以统计统计为目的(数万码),SNOMED 以临床表达为目的(36 万概念)——「重症急性坏死性胰腺炎」在 ICD 是一个码,在 SNOMED 是可组合的概念链。
  • 本体的推理能力:OWL 定义关系 + 推理机构成「活的层级」——内容更新月度进行,层级自动重算,避免了人工维护层级的漂移。
  • AI 训练合规样本:挪威官方报告确认 SNOMED CT 术语已用于医疗大模型训练、本体结构用于 RAG;其 36 万概念与百万关系是医疗领域适配(domain adaptation)的权威语料。
  • 统计口径的桥梁:ICD-10-CM 映射(12.6 万+ 源概念)使临床级数据可以半自动转成统计/报销口径,弥合「临床表达」与「卫生统计」的鸿沟。
  • 版本化数据治理的教科书:失活不删除、历史关联、月度发布、早期可见性通知——SNOMED 的版本治理体系是所有长期运行医疗数据系统的范本。
  • 组合表达的工程标尺:后组配表达式与 ECL 检索语法把「临床自由文本的语义精度」与「结构化数据的机器可处理性」连接起来,是医疗语义搜索的技术上限所在。

§1.3 同类数据集横向对比

术语/分类体系 维护方 规模 表达力 许可 定位
SNOMED CT SNOMED International 约 36 万概念 本体(可组合、可推理) 属地化免费/注册 临床表达与互操作
ICD-10/11 WHO 约 5.5 万(ICD-11) 统计分类(枚举) 开放 死因/疾病统计与报销
LOINC Regenstrief/HL7 约 10 万+ 术语 实验室/观察标识 CC BY 4.0 检验与临床观察
UMLS Metathesaurus NLM 440 万+ 概念(集成) 多词表映射层 UMLS 许可 跨词表集成枢纽
MeSH NLM 约 3 万主题词 文献标引层 公共领域 PubMed 检索
RxNorm NLM 约 13 万规范化名称 药物名称归一 UMLS 许可 处方与药物映射
Orphanet Orphanet 联盟 罕见病专用 罕见病枚举+本体 免费 罕见病编码(已入 SNOMED 协作)

与本文互链的站内条目:umls、loinc、作) |

与本文互链的站内条目:umls、loinc、mimic-iii、mimic-iv、clinicaltrials-gov、o、mimic-iv、umls、loinc、mimic-iii、mimic-iv、clinicaltrials-gov、open-targets、gwas-catalog、fae、i、mimic-iv、clinicaltrials-gov、open-targets、gwas-catalog、faers、drugbank。
、inicaltrials-gov、open-targets、gwas-catalog、faers、drugbank。

§1.4 版本时、faers、en-targets、gwas-catalog、faers、drugbank。

§1.4 版本时间轴 {#sec-versio。

§1.4 版本时间轴

时间 事件
1965 SNOP 由美国病理学家学会(CAP)发布(SNOMED 前身)
1974 更名 SNOMED
2000 SNOMED RT(Reference Terminology)发布,引入概念/关系结构
2002 SNOMED RT 与英国 NHS Clinical Terms 合并,SNOMED CT 首版发布
2007-04 IHTSDO(现 SNOMED International)从 CAP 收购 SNOMED CT
2014 起 RF2 发布格式全面替代原格式;成员国扩展与翻译加速
2016-2017 IHTSDO 更名 SNOMED International;美国版经 NLM/UMLS 免费分发常态化
2023 Snowstorm 开源术语服务器成为官方推荐部署形态
2026-01 国际版改为月度发布;CNC 指示符开始弃用
2026-03 US Edition 20260301 发布(含 114 个新美国扩展概念、12.6 万+ ICD-10-CM 映射)
2026-07 描述字段上限 255 → 4096 字符正式实施
2026-09-01 本文口径:最新国际版月度发布

§1.5 典型应用场景

  • EHR 问题列表与病程记录:以 SNOMED 概念编码诊断与发现,实现跨系统语义一致(美国 ONC 认证要求)。
  • 临床文本 NER + 概念链接:从病历文本抽取实体后归一到 SNOMED 概念,是 UMLS/SNOMED 双词表 NLP 管线的标配。
  • ICD 自动编码:以 SNOMED→ICD-10-CM 映射为骨架,结合文本分类将病历半自动转为统计编码。
  • 药物安全监测:不良事件术语归一后与药物层级联动(配合 RxNorm/FAERS)。
  • 知识图谱与 RAG:IS-A 层级 + 定义关系构成医疗知识图谱骨干;大模型检索增强(挪威官方实践)。
  • 多语言病历归一:同一概念 ID 贯穿英/挪/西/中等多语言术语参考集。
  • 队列检索:以概念层级表达「所有糖尿病并发症」类检索意图,避免逐码枚举。

§1.6 顶层层级全景

顶层层级 代表概念 AI 相关性
Clinical Finding(临床发现) 急性心肌梗死、发热 病史 NER 主战场
Procedure(操作) 阑尾切除术 手术/操作编码
Body Structure(机体结构) 阑尾(结构) 解剖锚定与部位归一
Pharmaceutical / Biologic Product 具体剂量药物产品 与 RxNorm 协同
Substance(物质) 青霉素(物质) 过敏与成分联动
Observable Entity(观测实体) 收缩压 与 LOINC 观察项互补
Specimen(标本) 全血标本 检验上下文
Situation with Explicit Context 家族史:糖尿病 语境化陈述
Organism(有机体) 肺炎链球菌 病原学
Event(事件) 流行病暴发 公共卫生
Environment / Geographical Location 疫区 暴露史
Social Context(社会语境) 独居 社会决定因素
Staging / Scales(分期/量表) TNM 分期值 肿瘤分期结构化
Qualifier Value(限定值) 轻度/中度/重度 修饰语义
Special Concept(特殊概念) 数值概念 元概念
Record Artifact(记录工件) 病历文书类型 文档管理
SNOMED CT Model Component 元模型组件 术语服务内部
Foundation Metadata Component 元数据 术语服务内部
Linkage Concept IS-A 等链接 本体机制

§1.7 从 Read Codes 到 SNOMED CT:历史断层与资产继承

  • 英国 Read Codes:英国 NHS 自 1980 年代维护的初级保健术语(4 字节与 5 字节两代),2002 年其 v3(Clinical Terms)与 SNOMED RT 合并——这就是名称中「CT(Clinical Terms)」的由来。
  • 合并的实际意义:RT 提供了本体化的概念/关系骨架(多轴、多层级、关系定义),Clinical Terms 提供了英国全科医疗场景的丰富术语覆盖——两者互补造就了 SNOMED CT「本体结构 + 全科覆盖」的双重性格。
  • 资产继承的技术痕迹:RF2 中英国来源概念保留独立moduleId;英国国家扩展(UK Extension)延续至今;部分 Read Codes 时代同义词仍作为描述条目存在。
  • 对 AI 的启示:术语表面形式存在英美拼写与措辞差异(oedema/edema、paracetamol/acetaminophen 类比),历史同义词是跨地域文本归一的低成本词典来源。

§1.8 术语服务的民主化:从商业系统到开源栈

  • 2014 年前:SNOMED 部署以商业术语服务器与自研解析为主,RF2 尚未定型,AI 团队接入成本高。
  • RF2 定型(2014 前后):制表符分隔的简单格式让任何 pandas 脚本都能解析——这是 SNOMED 成为 AI 可用数据集的分水岭。
  • 开源服务器栈(2023 起):Snowstorm(Java/Elasticsearch)成为官方推荐,配合 SnowOwl、FHIR 术语服务适配层,术语服务从「供应商能力」变成「CI 管道组件」。
  • AI 原生接入(2024-2026):概念/描述文本直接进入 LLM 语料;层级与属性进入 RAG 图索引;挪威官方报告将 SNOMED 列为已用于训练与 RAG 的国家级语言资源——术语集的「AI 就绪」身份被官方确认。

§1.9 与典型 AI 系统的对接模式速查

AI 系统形态 对接点 关键资产 反模式
病历 NER+归一 描述表词典 + 概念重排 同义词/首选词/层级 直接用 FSN 当展示词
自动 ICD 编码 映射参考集 + 文本分类 ICD-10-CM 12.6 万映射 忽略映射的一对多方向性
队列检索 ECL + 闭包表 IS-A 传递闭包 运行时递归查询
临床决策规则 概念 ID 常量化 moduleId/活跃位 硬编码失活概念
医疗 LLM RAG 概念上下文注入 文本定义+层级 把术语表当普通文档切块
多语言病历归一 语言参考集 首选词偏好序 假设全语言覆盖
药物安全联动 药物产品层级 + Substance 与 RxNorm/FAERS 桥 混淆产品与物质层级
  • 这张速查表可作为评审 AI 方案时「SNOMED 集成是否做对了」的快速清单——反模式一列是最常见的工程事故来源。

§2 医学背景

§2.1 与 ICD 的体系差异

维度 SNOMED CT ICD-10/11
设计目的 临床表达与语义互操作 死因/疾病统计与报销
概念数量 约 36 万 约 1.4 万(ICD-10)/ 约 5.5 万(ICD-11)
结构 多轴 DAG,本体(可组合、可推理) 单轴枚举树
表达复合临床陈述 支持(组合表达 post-coordination) 不支持(靠残留码)
更新节奏 月度(2026 起) 年度/多年
归属 SNOMED International(属地许可) WHO(开放)
典型用途 病程记录、问题列表、临床检索 死因登记、DRG、流行病学统计
  • 组合表达(post-coordination):单一概念不足以表达「车祸导致的闭合性股骨骨折」(损伤+机制+闭合性),SNOMED 以概念组合表达式(如概念引用 + 属性关系)表达;这对 NLP 输出的结构化提出了「表达式而非单码」的要求。
  • ICD-11 的靠拢:ICD-11 的基础层(Foundation Component)吸收了本体工程思想,与 SNOMED CT 的映射持续维护(Orphanet、ILAE 等协作同样体现多体系融合)。

§2.1b 与 UMLS/LOINC 的协同

  • UMLS:美国用户获取 SNOMED CT 的法定通道即 UMLS Metathesaurus License;UMLS 将 SNOMED 概念映射到 CUI,实现与 MeSH、RxNorm、LOINC 的跨词表检索。站内条目 umls 详述该映射层。
  • LOINC:检验/观察维度上,SNOMED 的 Observable Entity 与 LOINC 术语互补——LOINC 精于检验项目语义(分析物+方法+标本),SNOMED 精于临床发现的层级;两者映射是 EHR 实验室数据结构化的国际惯例。
  • RxNorm/DrugBank:药物产品层级与 RxNorm 规范化名称映射,衔接处方数据与分子信息。

§2.2 本体工程背景

  • 充分定义(Sufficiently Defined)vs 原始(Primitive):定义状态是概念的核心属性——充分定义概念由属性关系唯一决定其父类(机器可分类),原始概念则需人工放置层级。SNOMED 的长期路线是提高充分定义比例。
  • MRCM(Machine Readable Concept Model):机器可读概念模型约束每个层级可用的属性域(如「临床发现」可用「关联形态学」「方法」),是内容合法性的形式化契约。
  • 历史机制:概念不删除只失活(inactive),历史表记录替代概念与失活原因(ambiguous/duplicate/outdated 等)——版本间数据连续性的关键。
  • 参考集(Refset)机制:60+ 种参考集以「概念集合 + 附加属性」的形式承载语言偏好、映射、组件标注等,是 SNOMED 可扩展性的核心设计。
  • 具体值关系(Concrete Values):除概念间关系外,SNOMED 支持数值/字符串具体值关系(如药物强度 5 mg)——构建药品属性图谱时勿遗漏 RelationshipConcreteValues 文件。
  • 分区与校验位:SCTID 的分区数字段标识概念/描述/关系与命名空间,校验位允许传输错误检测——ID 服务层的输入校验应实现完整校验算法。
  • 模块化(moduleId):国际模块、模型模块与各国家扩展模块并存,是权限、发布与归属的技术边界——跨模块数据合并时的第一分组键。

§2.3 AI 任务定义

任务 输入 输出 评测思路
概念链接(Concept Linking) 临床文本中的实体表面形式 SNOMED 概念 ID 人工标注病历集的概念级 F1
同义词归一 多源编码/术语 规范概念 ID 跨 EHR 系统映射基准
层级推理 概念对/属性声明 IS-A 蕴含判定 推理机输出为金标
ICD 自动映射 SNOMED 概念 ICD-10-CM 目标码 官方映射文件做金标
多语言对齐 非英语病历术语 概念 ID 成员国语言参考集
组合表达解析 后组配表达式 结构化属性图 表达式规范化测试集
术语增强训练 病历文本 + 概念标注 领域适配模型 下游任务迁移增益

§2.4 覆盖人群与领域

  • SNOMED 不含患者数据;「覆盖」指其概念空间对临床领域的覆盖深度。
  • 强项:内科、外科操作、解剖、微生物、药物产品、检验观测。
  • 相对薄弱区:中医证候(中国扩展正在推进)、部分专科细化手术入路、心理治疗细粒度过程。
  • 多语言:英语为源语言;丹麦语(起源国之一)、西班牙语、法语、挪威语(约 13 万概念翻译)等成员国翻译成熟度不一。

§2.5 临床与研究价值

  • 对医院:统一电子病历语义,支撑临床决策支持(CDS)规则的跨院复用。
  • 对公卫:症候群监测以 SNOMED 编码的上游数据为源,比 ICD 报告更及时。
  • 对研究:队列定义以层级检索表达(如「全部缺血性脑卒中亚型」),减少漏检。
  • 对 AI:提供临床语义的「坐标系」——任何医疗 NLP 系统若要跨院、跨语言泛化,概念归一到 SNOMED 是工程上最稳的公共分母。

§2.6 金标准与参考实现

  • 金标准定位:SNOMED 概念 ID 本身即临床概念的金标准标识;概念间的层级与定义关系由官方发布并经 OWL 分类器验证。
  • 参考实现:Snowstorm(官方开源术语服务器,Elasticsearch 后端)与 Snowowl 是部署参考;官方 Editorial Guide 是内容语义的权威解释。
  • 学术基线:概念链接任务以人工标注病历(如 n2c2 类共享任务语料的 SNOMED 标注子集)为评测基准;UMLS 集成版可作快速基线词表。

§2.7 术语学工作流:一个概念从请求到发布

理解内容生产流程有助于评估数据质量边界:

阶段 机制 质量控制
1. 内容请求 CRS(Content Request System)提交新概念需求 请求方提供临床依据
2. 编辑评审 术语学家按 Editorial Guide 起草 FSN/同义词/定义关系 MRCM 约束校验
3. 协作评审 涉及专科时引入协作组织(ILAE/Orphanet 等) 专科语义审查
4. OWL 分类 充分定义概念经 ELK 分类确定层级 层级合法性自动验证
5. 发布 月度国际版打包(Full/Snapshot/Delta) 发布说明记录全部变更
6. 国家本地化 NRC 翻译/扩展/语言参考集 国家级评审
  • AI 启示 1:概念发布有明确的时间戳(effectiveTime),可精确回放任意历史版本的术语空间——版本化数据治理的典范。
  • AI 启示 2:「请求-评审-发布」的滞后意味着最前沿临床概念(如新发传染病早期)会先出现在文献而非术语集,NER 系统需容忍 OOV 概念窗口期。
  • AI 启示 3:失活与合并是常态(2026-05 版单版即有肥胖概念重构 90 个、WAS_A 历史关联修订 224 个)——长期依赖 SNOMED 的系统必须内建历史关联处理。

§2.8 2026 年度版本内容抽样

2026 年发布说明中的典型内容工作(展示术语集的演化颗粒度):

版本 内容工作 颗粒度
2026-05 肥胖概念重构(以体脂定义替代体重定义;中央肥胖以脂肪分布重定义;High body weight 失活) 约 90 概念
2026-05 间质性肺病对齐 2025 ERS/ATS 国际多学科分类(pneumonia 替代 pneumonitis 语义) 新增概念归属 ERS/ATS
2026-05 原发性骨关节炎建模(Idiopathic→Primary 改名、双侧关节概念新增) 7 概念重定父类
2026-05 气管支气管树壁结构细化(壁/支气管壁/细支气管壁/黏膜/肌/软骨重组) 约 30 概念
2026-05 WAS_A 历史关联修订(失活原因改为现行允许原因) 224 概念
2026-09 鼓室结构层级更新;SEP 与侧化解剖参考集验证 结构层级
2026-09 Percent (property) 限定值失活 限定值清理
2026-09 CMT/Orphanet/ILAE 协作内容持续并入 协作增量
  • 这份抽样揭示:术语集不是静态词典,而是随临床分类学(如 ERS/ATS 肺病分类 2025 更新)同步演化的活本体。
  • AI 数据治理建议:以「版本-变更日志」双层记录 SNOMED 依赖,任何下游模型升级时对照变更日志评估重训必要性。

§2.9 本土化与区域语义缺口

  • 英语中心性:SNOMED 的内容深度反映英语世界医学实践;任何非英语地区部署都会遇到「概念存在但偏好词缺失」与「本土概念无对应」两类缺口。
  • 国家扩展机制:成员国以扩展模块补充本土概念(如澳大利亚药品参考集、加拿大法语扩展);非成员国以 Affiliate 模式自建本地词典(不回流国际版)。
  • 传统医学:国际版以现代医学为主轴,传统医学概念(如中医证候)主要依赖本土扩展与行业协作——中国相关标准化工作正在推进(含 2026 年国内数据集构建标准引用 SNOMED 作为参照术语之一)。
  • AI 工程对策:本土概念缺口以「本地词典 + 国际概念映射表」双层结构处理;映射表以人工评审为准,避免机器直译污染本体语义。

§3 数据集规格

§3.0 版本抉择矩阵

使用目标 推荐版本/通道 理由
美国 EHR 项目 US Edition(NLM/UMLS) 含 ICD-10-CM 映射与美国扩展,法定免费
欧洲成员国项目 成员国版(国家扩展 + 国际版) 含国家翻译与本地扩展
全球研究(非美非成员国) 国际版(MLDS,Affiliate 注册) 最小许可摩擦
NLP 概念链接 国际版 + UMLS 集成版 UMLS 提供跨词表同义词
层级推理/知识图谱 国际版 + OWL 派生文件 + ELK 官方 OWL 转换保证推理一致性
大模型领域适配 国际版概念/描述文本 + 语言参考集 文本资产为主,层级作约束
多语言项目 国际版 + 成员国语言参考集 概念 ID 跨语言锚定

§3.1 模态详情

数据层 内容 AI 可用形态
概念表(Concept) 概念 ID、有效时间、活跃位、定义状态 节点集与标签空间
描述表(Description) FSN、同义词、语言码、大小写敏感位 文本资产与同义词词典
关系表(Relationship) 源概念-属性-目标概念三元组 知识图谱三元组
历史表 失活原因、替代概念(SAME-AS/MOVED-TO 等) 版本对齐与链接回填
语言参考集 各语言偏好同义词与接受度 多语言词典
映射参考集 ICD-10/ICD-10-CM/ICD-O 映射 统计编码桥
OWL 派生 公理文件(国际版提供) 推理机输入

§3.2 按子集样本数

子集 数量 口径
国际版活跃概念 约 36 万 官方 350,000+;挪威 2026 报告「近 37 万」
国际版描述(含同义词) 逾百万条 US Edition 口径 100 万+ 描述
语义关系 逾百万条(IS-A 为主 + 定义关系) RF2 全量
美国版唯一概念 30 万+ BioPortal/NLM 口径(国际版+美国扩展)
ICD-10-CM 映射源概念 12.6 万+ US Edition 20260301
挪威语翻译概念 约 13 万 挪威卫生局 2026 报告
语言参考集 13+ 成员国语言 各 NRC 发布

§3.3 格式对照

通道 格式 适用 注意
MLDS 下载 RF2 zip 全量获取(国际/成员国版) 注册免费;许可签署
NLM UMLS 下载 RF2 + UMLS 集成 美国用户法定通道 需 UTS 账号
Snowstorm API JSON 在线查询/推理服务 需自部署(Elasticsearch)
FHIR 术语服务 FHIR CodeSystem/ValueSet HL7 FHIR 生态集成 经 Snowstorm FHIR 包
OWL 文件 功能语法 OWL2 推理机(ELK/HermiT) 国际版官方派生
翻译资产 RF2 语言参考集 多语言项目 覆盖度随国家而异

§3.4 存储大小

项目 量级 说明
国际版 RF2 全包 约 1-2 GB(压缩) 含全量+增量快照与参考集
解压后 数 GB 数十张制表符分隔文件
Snowstorm + Elasticsearch 部署 约 8-16 GB 内存/磁盘组合 生产建议 16 GB+
US Edition 包 与国际版同量级 附 ICD-10-CM 映射与 transitive closure 资源
传递闭包(Transitive Closure)资源 单独下载 IS-A 全量传递表,加速层级查询

§3.5 标注方式

  • 概念由术语编辑团队按 Editorial Guide 创建:FSN(语义无歧义全称)+ 常用同义词 + 属性关系定义。
  • 内容来源多元:国家扩展贡献(如美国扩展 2026-03 新增 114 活跃概念)、协作组织(Kaiser CMT、Orphanet、ILAE、GMDNA)、内容请求系统(CRS)。
  • 质量保障:每版发布前有内容质量保证(QA)流程与内部 QA;OWL 分类器校验层级合法性。
  • 语言参考集由各成员国国家发布中心(NRC)维护,承载同义词偏好与排序。

§3.6 标注者资质与一致性

  • 编辑团队为 SNOMED International 与各 NRC 的术语学家(terminologist),遵循统一的 Editorial Guide 与 MRCM 约束。
  • 跨组织协作(Orphanet/ILAE 等)通过归一化评审引入外部专业语义。
  • 一致性风险:历史遗留概念的定义状态混合(primitive/defined 并存);同义表达的编辑判断存在地域差异(由语言参考集吸收)。

§3.7 采集周期

  • 国际版月度发布(2026-01 起);每版含概念/描述/关系的全量快照与增量文件。
  • US Edition 半年发布(3 月/9 月),基于最近的 1 月/7 月国际版叠加美国扩展。
  • 映射派生物(ICD-10/ICD-O)随国际版同步更新。

§3.8 地域覆盖

  • 使用范围:75+ 国家与地区;50+ 国接受为通用卫生术语。
  • 成员国体系:各国国家发布中心(NRC)发布国家版(如 SNOMED CT-AU 澳大利亚版月度滚动)。
  • 非成员国使用:经 Affiliate License 注册(多数非商业用途免费)。

§3.9 设备规格

  • 术语集本身无设备要求;生产部署建议:Snowstorm(Java/Elasticsearch)+ 8-16 GB 内存服务器。
  • 推理场景:OWL 分类(ELK)在桌面级 CPU 即可完成国际版规模分类(分钟级)。
  • 传递闭包资源可直接导入关系库,免去运行时推理。

§3.10 深度溯源链

层级 实体 溯源要点
L0 产权 CAP(1965-2007)→ IHTSDO/SNOMED International(2007-)
L1 内容治理 Editorial Guide + MRCM + 内容请求系统(CRS)
L2 协作来源 Kaiser CMT / Orphanet / ILAE / GMDNA / 国家扩展
L3 分发 MLDS(国际)+ NLM UTS(美国)+ 各国 NRC
L4 本文口径 官方发布说明(2026-02/05/09)+ NLM Tech Bull(2026-03)+ 挪威卫生局报告(2026)

§3.11 RF2 核心文件清单

文件模式 名称模式 行粒度 AI 用途
sct2_Concept_* Concept_Snapshot/Full 一行一概念 节点集/活跃过滤
sct2_Description_* Description_Snapshot-en 一行一描述 同义词词典/FSN
sct2_TextDefinition_* TextDefinition_Snapshot 一行一定义文本 概念文本定义
sct2_Relationship_* Relationship_Snapshot 一行一关系 三元组/IS-A 图
sct2_RelationshipConcreteValues_* 具体值关系 一行一具体值 数量/单位属性
der2_Refset_* 各类参考集 一行一参考集成员 映射/语言/标注
der2_sRefset_Map_ ICD 映射参考集 一行一映射 ICD 桥接
文件名后缀 _INT / _DK / _US 等 语言/国家范围 版本范围选择
effectiveTime 列 YYYYMMDD 版本生效日 版本对齐

§3.12 国家版对照

国家版 发布中心 节奏 特色
US Edition NLM(美国 NRC) 半年(3/9 月) ICD-10-CM 映射 + 美国扩展;UMLS 免费分发
SNOMED CT-AU 澳大利亚 NCTS 月度滚动(31 日戳) 澳大利亚扩展 + 药品参考集
西班牙语版 西班牙 NRC 随国际版 全量西语翻译
丹麦语版 丹麦健康数据局 随国际版 SNOMED 起源国资产
挪威语版 挪威卫生局 随国际版 约 13 万概念翻译;经语言库开放
加拿大法语扩展 Canada Health Infoway 随国际版 法语加拿大化
中国本土化 行业协作推进中 —— 中医证候等本地概念探索
  • 工程启示:跨国部署以「国际版 + 国家扩展双模块」为准;moduleId 字段区分来源模块,跨版本合并时不得混淆模块边界。

§3.13 获取成本与账期对照

用户类型 通道 费用 时限 许可动作
成员国机构 国家 NRC 免费 即时下载 国家许可框架
美国机构/居民 NLM UTS 免费 账号即时 签 UMLS License
非成员国研究 MLDS Affiliate 免费(注册制) 1-3 日审核 在线签署 Affiliate License
非成员国商业 MLDS Affiliate 免费(需申报用途) 1-3 日 用途变更须更新申报
翻译资产 各 NRC 国别不一 —— 随国家许可

§3.14 版本获取操作手册(逐步)

美国用户路径(NLM/UMLS)

  1. 在 UTS(uts.nlm.nih.gov)注册账号。
  2. 阅读并签署 UMLS Metathesaurus License(含 SNOMED CT 条款)。
  3. 从 NLM SNOMED CT 页面下载当前 US Edition(含 RF2 全包、传递闭包、ICD-10-CM 映射资源)。
  4. 记录 MD5 与版本号(如 20260301),归档许可文书。

成员国用户路径

  1. 联系本国国家发布中心(NRC)或在 MLDS 以成员属地区域注册。
  2. 获取国际版 + 国家扩展 + 语言参考集的组合包。

其他用户路径(MLDS Affiliate)

  1. 在 MLDS 注册组织账号,在线填写用途声明签署 Affiliate License。
  2. 下载目标版本(生产版本选 PRODUCTION 包,勿误下模拟/预览包)。
  3. 用途变更(如由研究转商用)需更新申报——License 是动态文件。

共同注意事项

  • 下载包的 MD5 必须校验(发布页提供)。
  • 每个版本目录名内嵌时间戳(YYYYMMDDTHHMMSSZ),作为数据资产版本号。
  • 许可文书与版本归档建议与数据同库存放——审计时「版本-许可」成对出现。

§4 数据结构

§4.0 目录树

SnomedCT_InternationalRF2_PRODUCTION_YYYYMMDDTHHMMSSZ/
├── Full/                              # 全量历史(含每个 effectiveTime 版本)
│   ├──Terminology/
│   │   ├── sct2_Concept_Full_INT_*.txt
│   │   ├── sct2_Description_Full-en_INT_*.txt
│   │   └── sct2_Relationship_Full_INT_*.txt
│   └── Refset/                        # 60+ 参考集(语言/映射/标注)
│       ├── Language/
│       ├── Map/                       # ICD-10 / ICD-O 映射
│       └── Metadata/
├── Snapshot/                          # 最新有效版本快照(AI 首选)
│   ├──Terminology/
│   │   ├── sct2_Concept_Snapshot_INT_*.txt
│   │   ├── sct2_Description_Snapshot-en_INT_*.txt
│   │   ├── sct2_Relationship_Snapshot_INT_*.txt
│   │   └── sct2_TextDefinition_Snapshot_INT_*.txt
│   └── Refset/
├── Delta/                             # 上一版以来的增量
└── release_package_information.json   # 2026 起新增元数据文件

§4.1 DAIMS 字段字典

字段(RF2 列) 类型 语义 AI 提示
id(Concept) SCTID 概念唯一标识(分区校验位) 全局主键;字符串处理防科学计数
effectiveTime YYYYMMDD 该版本生效日 版本对齐与历史重建键
active 1/0 活跃位 概念空间过滤第一步
moduleId SCTID 归属模块(国际/国家扩展) 扩展内容区分
definitionStatusId SCTID 充分定义/原始 推理可行性判定
term(Description) 文本 FSN/同义词文本 文本资产;2026-07 起上限 4096
typeId SCTID 描述类型(FSN/Synonym/TextDefinition) FSN 不宜直接展示给用户
languageCode ISO 码 语言 多语言过滤
caseSignificanceId SCTID 大小写敏感 品牌药名等需精确匹配
sourceId / destinationId(Relationship) SCTID 关系源/目标 三元组构建
typeId(Relationship) SCTID 关系类型(IS-A=116680003 等) IS-A 与定义关系分流
characteristicTypeId SCTID 推断/限定/附加特征 推理输出 vs 人工声明
modifierId SCTID 存在性修饰 OWL 建模细节

§4.2 标签分布

  • 定义状态:原始(primitive)概念占比高(临床发现等层级),充分定义概念集中于解剖/形态学等结构化层级。
  • 关系类型:IS-A 层级关系占绝对多数;定义属性关系(关联形态学、方法、直接部位等)集中于充分定义概念。
  • 活跃度:活跃概念约 36 万,失活概念保留在历史表中(不删除)。
  • 语言:英语描述全量;成员国语言按参考集覆盖(挪威约 13 万概念)。

§4.3 关键统计

统计项 数值 口径
国际版活跃概念 约 36 万 官方 350,000+;挪威 2026「近 37 万」
描述条数(US Edition) 100 万+ BioPortal/NLM
语义关系(US Edition 口径) 约 90.3 万 BioPortal(叠加部分)
顶层层级 19 个 官方模型
语言参考集 13+ 成员国语言 各 NRC
ICD-10-CM 映射(美国版) 12.6 万+ 源概念 20260301
使用国家 75+ 官方
发布节奏 国际版月度(2026 起);美国版半年 官方

§4.4 数据层级

  • 概念层:36 万节点的标签空间。
  • 关系层:IS-A 传递闭包 + 定义属性关系的有向无环图。
  • 表达层:参考集承载的映射、语言、组件标注。
  • 派生层:OWL 公理、传递闭包资源、ICD 映射。

§4.5 缺失值处理与信息性缺失编码

  • 失活 ≠ 删除:inactive 概念必须保留并经历史表链接到替代概念;直接过滤 inactive 会丢失版本连续性。
  • 定义状态缺失的语义:原始概念并非「标注缺失」,而是本体工程的有意设计(不可由属性唯一决定)。
  • 多语言缺失:未翻译概念在语言参考集中无条目——多语言管线需回退到英语 FSN。
  • 关系缺失:原始概念的属性关系不完整是「信息性」的(表示语义尚待精化),不可当作数据错误。
  • 映射缺失:并非所有 SNOMED 概念都有 ICD-10-CM 映射(12.6 万/36 万);自动编码系统需对「无映射」概念设计显式回退。

§4.6 概念链接管道的数据结构

病历文本 ──NER──▶ 实体表面形式列表
                      │
                      ▼
          ┌─ 同义词词典(Description 表 + 语言 Refset)
          ├─ 缩写词典(领域扩充)
          └─ 上下文消歧(Situation 层级/属性约束)
                      │
                      ▼
              候选概念 Top-K
                      │
                      ▼
     ┌─ IS-A 层级特征(传递闭包表)
     ├─ 语义类型先验(顶层层级)
     └─ 多数投票/学习型重排
                      │
                      ▼
              最终概念 ID + 置信度
  • 描述表的 term 列 + 语言参考集构成零样本基线词典;实体链接模型在此之上做上下文重排。
  • 层级特征(传递闭包)是消歧的关键信号:「糖化血红蛋白升高」应链到 Observable Entity 层而非 Substance 层。

§4.7 概念失活与历史关联全解

概念「失活」是 SNOMED 版本治理的核心机制,AI 系统必须正确处理:

历史关联类型 语义 处理建议
SAME-AS 失活概念被另一概念完全替代 引用重定向到替代概念
REPLACED-BY 语义拆分后的主要替代 配合 MOVED-TO 系列处理
MOVED-TO 概念移至其他层级/模块 更新模块归属
WAS-A 层级归属变更的历史痕迹 仅作溯源,不作活跃引用
失活原因 ambiguous / duplicate / outdated / erroneous 等 数据清洗审计字段
  • 脏数据陷阱:旧病历/映射中引用的失活概念若不做历史重定向,会静默丢失临床语义——任何长期运行的编码系统都应内建「失活概念月度重定向」任务。
  • 统计口径陷阱:以历史快照统计概念总数时,Full 目录行数 ≠ 概念数(含历史行);必须按 effectiveTime 分组取每概念最新行。

§4.8 语言参考集结构

字段 语义 AI 用途
referencedComponentId 描述条目 ID 关联到具体同义词
acceptabilityId 可接受/首选 词典权重排序
languageReferenceSet 语言标识 多语言词典切换
  • 首选(preferred)与可接受(acceptable)两级构成「术语偏好序」:生成场景(如结构化报告转文本)用首选词,识别场景全部收录但按偏好加权。
  • 成员国翻译即以语言参考集发布——同一概念 ID 在不同语言参考集中有各自的偏好词。

§4.9 传递闭包与查询性能

  • 问题:IS-A 递归查询在百万级边上代价高;ECL 的 << 语义需要「全部后代」——运行时递归不可接受。
  • 官方方案:Transitive Closure 资源(美国版单独提供;国际版可自算)——一张「祖先-后代」全对表,任何层级查询退化为一次索引查表。
  • 自算方法:递归 CTE(§6.2)一次性物化;或 ELK 分类器输出的推断层级全量导出。
  • 维护:月度版本增量重算——闭包表行数与版本间变更成正比,CI 内分钟级完成。
  • 存储量级:闭包表行数约为 IS-A 边数的 5-10 倍(数十 GB 级关系库表),生产环境建议独立表空间与专门索引。

§4.10 数据完整性校验脚本

# RF2 加载后的完整性五查
def integrity(concepts, descriptions, relationships):
    ids = set(concepts.id)
    assert not concepts.id.duplicated().any(), "概念行重复"
    orphan_desc = ~descriptions.conceptId.isin(ids)     # 悬空描述
    orphan_rel = (
        ~relationships.sourceId.isin(ids) |
        ~relationships.destinationId.isin(ids)          # 悬空关系
    )
    return {
        "n_concepts": len(concepts),
        "n_active": int((concepts.active == "1").sum()),
        "orphan_descriptions": int(orphan_desc.sum()),  # 应为 0
        "orphan_relationships": int(orphan_rel.sum()),  # 应为 0
        "isa_edges": int(((relationships.typeId == "116680003") &
                          (relationships.active == "1")).sum()),
    }
  • 五查任意一项异常通常意味着包不完整、混版本或解析参数错误——先修数据再建模。

§5 划分与使用建议

§5.1 官方划分

术语集无机器学习划分;工程上按模块(moduleId)与层级天然分区:

  • 国际模块 vs 国家扩展模块:跨国项目只用国际模块可避免属地许可纠缠。
  • 层级切分:跨层级泛化测试(训练于临床发现、测试于操作)暴露模型对本体结构的真实理解。

§5.2 社区惯例划分

  • 按 effectiveTime 时间切分:以某发布日期为界,测试「新概念能否被既有语料预测」——术语演化研究。
  • 按层级切分:层级留出(hierarchy hold-out)评估组合泛化。
  • 按概念频次切分:高频概念(常见病)与长尾概念(罕见病)分层评测,长尾性能是概念链接系统的真实短板。
  • 按语言切分:英语训练 → 成员语言测试,检验多语言迁移。

§5.3 泄漏风险(重点)

  • 词典泄漏:概念链接评测若以描述表构建词典特征,词典本身已覆盖大部分测试表面形式——需划分「词典可见/不可见」表面形式分别报告。
  • 层级泄漏:IS-A 关系预测任务中,同一子树的概念对若分属训练/测试,模型可能记住局部模式而非推理规则。
  • 版本泄漏:跨版本一致性实验中,旧版本已含新概念的历史行(Full 目录含全部历史)——必须按 effectiveTime 严格过滤。
  • UMLS 集成泄漏:UMLS 同义词映射含 SNOMED 概念本身,作为「外部知识」引入时需与评测金标的关系透明化。

§5.4 交叉验证建议

# 概念链接任务:按「表面形式是否在词典出现」分层的评测协议
def evaluate(df, dictionary_terms: set):
    seen = df[df.surface_form.isin(dictionary_terms)]
    unseen = df[~df.surface_form.isin(dictionary_terms)]
    return {
        "macro_f1_seen": f1(seen),      # 词典可覆盖部分(应接近上限)
        "macro_f1_unseen": f1(unseen),  # 真实泛化能力(核心指标)
        "unseen_ratio": len(unseen) / len(df),
    }
  • 医院级部署建议再按科室分层(ICU/门诊/手术记录),各科室术语分布差异显著。
  • 多语言项目按语言分层,报告各语言的 unseen F1。

§5.5 外部验证建议

  • 跨 EHR 系统:以不同厂商 EHR 导出的病历做域外测试(编码习惯差异)。
  • 跨语言:以挪威/西班牙语参考集为桥,验证概念 ID 的跨语言一致性。
  • 与 ICD 映射对齐:自动映射输出与官方 ICD-10-CM 映射(12.6 万+ 概念)的一致率作为外部校准。
  • 临床下游:概念链接质量应以下游任务(队列检索召回、CDS 规则命中率)的增益验证,而非停留于 F1。

§5.6 术语集特有任务的任务配方

配方 1:同义词聚类质量评估

  • 样本:同一概念下的全部同义词(描述表按概念分组)。
  • 检验:聚类纯度(语义单义性)与冗余率(跨概念重复表面形式)。
  • 价值:评估词典召回的假阳性源;跨概念重复词(如缩写 ICU)是概念链接歧义的主因。

配方 2:层级一致性压力测试

  • 方法:以 IS-A 闭包检验「推理一致性」——同一概念在不同发布版本的深度变化应可由变更日志解释。
  • 价值:监控月度版本对下游层级敏感功能(ECL 队列)的影响面。

配方 3:多语言锚定回归

  • 方法:以挪威语等参考集为锚,检验同一概念集合在跨语言词典切换下的召回稳定性。
  • 价值:多语言部署的回归门禁。

配方 4:ICD 映射补全学习

  • 训练:官方映射 12.6 万+ 概念(特征:文本 + 层级 + 属性)。
  • 测试:时间留出(新月度版本的新增映射)。
  • 价值:为无映射概念(约 23 万)提供候选映射,人工评审后入库。

配方 5:LLM 概念约束解码

  • 方法:以概念 ID 词表约束 LLM 解码(trie 受限采样),强制输出合法概念。
  • 评测:约束解码后输出 100% 为活跃概念(结构合法性);语义正确性由概念链接评测承接。
  • 价值:结构化输出场景(自动编码、队列定义)的工程合规保障。

§5.7 评测金标构建指南(自建标注)

术语类任务的人工金标往往不足,自建标注的建议规格:

项 建议值 理由
标注单元 病历句段 + 表面形式 span 与概念链接任务对齐
标注目标 SCTID(活跃概念)+ 可链性标记 不可链(OOV)显式标记
双标比例 ≥20% 双标 + Kappa 报告 术语标注主观性高
分层 按顶层层级 × 概念频次分层抽样 防止常见病偏置
规模 3-5k span 起步(unseen ≥1k) unseen 子集是核心指标
仲裁 术语学专家终审 概念边界争议需专业判断
  • 不可链 span 的价值:显式标注「无对应概念」比强行链接更能暴露术语覆盖缺口——这类样本同时是本体扩展需求的输入。
  • 版本锁定:金标必须绑定 SNOMED 版本号;版本升级后金标需按历史关联迁移并重新抽样验证。

§6 AI 就绪指南

§6.0 云端快速启动

# 路径 A:美国用户(法定免费通道)
# 1) 注册 UTS 账号并签署 UMLS Metathesaurus License
# 2) 从 https://www.nlm.nih.gov/healthit/snomedct/ 下载 US Edition RF2

# 路径 B:成员国/国际用户
# 1) 在 MLDS(https://mlds.ihtsdotools.org/)注册并接受属地许可
# 2) 下载 SnomedCT_InternationalRF2_PRODUCTION_YYYYMMDD.zip

# 路径 C:Snowstorm 术语服务器(Docker)
docker run -d -p 8080:8080 \
  -e elasticsearch_urls=es:9200 \
  snomED International 官方镜像 snowstorm
# 导入 RF2 后即获得 REST 术语服务(概念查询/层级推理/表达式校验)

§6.1 快速上手(RF2 解析)

# ============================================================
# SNOMED CT RF2 → 概念/描述/关系三表最小加载
# ============================================================
import pandas as pd

RF2 = "SnomedCT_InternationalRF2_PRODUCTION_20260901T120000Z/Snapshot/Terminology"

concepts = pd.read_csv(
    f"{RF2}/sct2_Concept_Snapshot_INT_20260901.txt", sep="\t", dtype=str)
descriptions = pd.read_csv(
    f"{RF2}/sct2_Description_Snapshot-en_INT_20260901.txt", sep="\t", dtype=str)
relationships = pd.read_csv(
    f"{RF2}/sct2_Relationship_Snapshot_INT_20260901.txt", sep="\t", dtype=str)

# 1) 活跃概念标签空间
active = concepts[concepts.active == "1"]
print("活跃概念:", len(active))

# 2) FSN + 首选同义词
fsn = descriptions[
    (descriptions.active == "1") & (descriptions.typeId == "900000000000003001")]
print("FSN 条数:", len(fsn))

# 3) IS-A 层级三元组(116680003 = IS-A)
isa = relationships[
    (relationships.active == "1") &
    (relationships.typeId == "116680003")]
print("IS-A 边数:", len(isa))

§6.2 层级推理与传递闭包

-- 传递闭包资源已随美国版提供;无资源时以递归 CTE 计算
-- 查询「缺血性心脏病」全部子类概念
WITH RECURSIVE subtree(root_id, child_id) AS (
  SELECT '414545008', '414545008'
  UNION
  SELECT r.sourceId, r.sourceId FROM subtree s
  JOIN sct2_relationship_snap r ON r.destinationId = s.child_id
  WHERE r.typeId = '116680003' AND r.active = 1
)
SELECT child_id FROM subtree;
  • 生产环境推荐直接导入官方 Transitive Closure 资源(无递归开销)。
  • 推理场景(充分定义概念自动归类)使用 ELK 分类器处理官方 OWL 派生。

§6.3 文本层特征工程

  • 同义词词典:Description 表(active=1)+ 语言参考集偏好位 → 多词典融合(FSN 语义锚 + 同义词召回面)。
  • 形态学特征:FSN 的括号语义标签((disorder)/(procedure)/(body structure))是强先验。
  • 层级特征:候选概念的顶层层级分布、IS-A 深度——消歧学习的主流特征。
  • 组合表达:后组配表达式解析(expression constraints,如 ECL 语法)可枚举复杂语义集合(如「全部梅毒性心脏瓣膜病」)。

§6.4 表格层建模建议

  • ICD 映射补全:以 12.6 万+ 官方映射为训练集,预测无映射概念的 ICD 目标——层级特征 + 文本相似度双通道。
  • 失活预测/建议替代:历史表中的失活案例可构造「重复/歧义检测」任务。
  • 多语言零样本:以概念 ID 为锚的多任务训练(各语言参考集为标签源),可零样本迁移到未覆盖语言。

§6.5 坑点(Pitfalls)

坑点 1:SCTID 被数值化
概念 ID 是带校验位的字符串(最长 18 位),pandas 默认解析为 int64 会溢出且丢失前导结构——必须 dtype=str 读入。

坑点 2:FSN 不是展示术语
FSN 含语义消歧后缀(如「Pneumonia (disorder)」),直接作为用户展示或 NLP 语料会引入噪声——应使用语言参考集的偏好同义词。

坑点 3:Snapshot ≠ 全量语义
Snapshot 目录只含每个概念当前有效版本;做版本演化必须用 Full 目录(含历史行),并按 effectiveTime 排序。

坑点 4:描述长度上限变更(2026-07)
FSN/同义词上限从 255 升至 4096 字符——下游 schema 仍按 255 建列的会截断药品/疫苗层术语。升级版本后务必回归测试。

坑点 5:许可属地化
美国版经 UMLS 免费但仅限美国许可持有人;成员国翻译资产随国家版分发;Affiliate License 要求注册报告用途——模型训练前不确认属地条款是合规红线。

坑点 6:原始概念的推理局限
对 primitive 概念运行推理不会得到其全部逻辑后果——层级查询必须基于官方闭包资源或 OWL 分类输出,不能只看显式 IS-A 边。

坑点 7:CNC 指示符弃用
依赖「Concept Non Current」指示符做数据清理的旧脚本在 2026-02 后失效——改用历史表的历史关联(SAME-AS/MOVED-TO)。

坑点 8:映射文件的方向性
ICD 映射参考集是「SNOMED → ICD」方向且非一一对应(一个 SNOMED 概念可映射多个 ICD 码,映射块含映射类型);反向构建 ICD→SNOMED 需处理多对多歧义。

§6.6 Snowstorm 部署要点

  • 组件:Snowstorm(Java 应用)+ Elasticsearch(索引后端)+ RF2 导入器。
  • 导入:首次全量导入国际版 RF2 约 30-60 分钟(16 GB 内存级别)。
  • API 形态:概念查询、ECL 表达式求值、FHIR CodeSystem/ValueSet 接口。
  • 版本管理:支持多代码系统与多版本共存;月度发布下建议 CI 化自动导入。
  • 备选:SnowOwl(老牌)、FHIR 术语服务适配层、或直接以传递闭包 + 三表入库自建轻量查询。

§6.7 ECL 表达式:队列语义的官方语法

ECL(Expression Constraint Language)是 SNOMED 官方的概念集合约束语法,是「检索意图」的机器可读表达:

<< 404684003 |临床发现|            -- 间接子类(含自身):全部临床发现
<  64572000 |疾病| :               -- 直接子类且
   116676008 |关联形态学| = << 44132006 |坏死|
                                    -- 属性约束:形态学含「坏死」的疾病
(<< 22298006 |心肌梗死|) OR
(<< 414545008 |缺血性心脏病|)      -- 集合并集
语法 含义 典型用途
<< X X 及全部间接子类 层级检索
< X 全部子类(不含 X) 严格子集
: 属性 = 值 属性约束(后组配检索) 精细队列
AND / OR / MINUS 集合运算 队列交集/排除
{{ term = “…” }} 术语过滤 文本辅助约束
  • AI 启示:ECL 可作为队列检索系统的「查询 IR」——LLM 生成 ECL,术语服务执行,天然获得层级正确性;这比自由文本检索的语义精度高一个数量级。

§6.8 概念链接双塔模型配方

表面形式塔:  同义词词典召回(BM25/编辑距离)
             → 候选 Top-50(含 FSN/同义词/缩写扩展)
上下文塔:    病历句子 + 邻句窗口
             → 医疗领域编码器(BERT 系/医疗 LLM)
                              │
             交叉打分层:      词典匹配特征 + 层级特征(顶层分布/IS-A 深度)
                              + 上下文-概念描述语义相似度
                              │
             重排输出:        Top-1 概念 ID + 置信度 + 置信度校准
  • 训练数据:人工标注病历(少量)+ 以同义词表构造的弱监督对(大规模)——注意 §5.3 词典泄漏,弱监督样本不得与测试表面形式重叠。
  • 长尾策略:低频概念以描述文本与层级邻居增强(邻居概念的同义词作辅助监督)。
  • 校准:医疗编码场景漏链代价高于错链(人工复核可纠错链)——按业务代价选择阈值而非纯 F1 最优。

§6.9 版本升级流水线(月度节奏)

# 月度升级 CI 步骤骨架(bash 伪流程)
# 1) 下载新月度包并校验 MD5
# 2) Diff 报告:新增/失活/修改概念计数 + 高层影响面(按顶层层级聚合)
# 3) 下游影响面:检索词典重载、向量库增量更新、闭包资源重导入
# 4) 回归测试:核心查询集(ECL 用例)前后版本结果一致性
# 5) 灰度切换:双版本并行服务,按流量切换
  • 月度节奏下,手工升级必然失控——官方早期可见性页(Early Visibility)+ 发布说明应订阅进 CI 通知。

§6.10 与大模型/RAG 的集成模式

模式 A:约束输出(结构化编码)

用户病历片段 → LLM → 受限解码(只允许输出活跃 SCTID)
            → ID 服务校验(active/版本/历史重定向)
            → 编码结果 + 复核建议
  • 适合自动编码、队列定义等结构化输出场景;ID 校验层必须独立于模型(模型幻觉的最后防线)。

模式 B:图增强 RAG(层级上下文注入)

用户问题 → 实体识别 → 概念链接
        → 闭包表取祖先/子孙各 N 层
        → 「概念 + 层级上下文 + 首选同义词」打包进 prompt
        → LLM 生成带概念引用的回答
  • 挪威官方实践即此路线;层级上下文显著改善「类别级问题」(如「哪些疾病属于心肌病」)的答案完整性。

模式 C:术语增强预训练/继续预训练

  • 以描述表文本(FSN+同义词+文本定义)构造自然语句对(「X 是一种 Y」由 IS-A 边生成)。
  • 注意许可:训练用途在多数 Affiliate License 下允许,但属地差异大——训练前完成属地尽调(坑点 5)。
  • 数据配比:术语合成语句仅作调味(<5%),过量会引入文体偏移。

模式 D:评测基准集成

  • 以概念层级构造「类别成员判定」与「关系真假」评测集(自动生成 + 抽样人工验证)。
  • 用于量化医疗 LLM 的结构化医学知识边界,跨版本重复评测可观测模型退化。

§7 评估基准与 DAIMS 评估

§7.1 DAIMS 评估(24 项)

# 维度 评估项 得分 说明
1 可得性 注册后免费下载 4/5 免费但有属地注册门槛
2 可得性 机器可读许可 3/5 许可分层复杂(成员国/UMLS/Affiliate)
3 可得性 稳定持久标识(SCTID) 5/5 校验位 SGTID 全球唯一
4 结构化 受控结构完备度 5/5 三表+参考集+历史表
5 结构化 关系型/图结构就绪 5/5 三元组+闭包资源
6 结构化 schema 稳定性 4/5 RF2 长期稳定;描述上限变更需迁移
7 文本 同义词/FSN 文本资产 5/5 百万级描述
8 文本 文本规范化程度 4/5 编辑指南严格;FSN 需后处理
9 版本 概念历史保留 5/5 失活不删除+历史关联
10 版本 发布节奏 5/5 2026 起月度
11 结果 映射派生物(ICD) 4/5 12.6 万+ ICD-10-CM(美国版)
12 结果 映射覆盖率 3/5 非全概念覆盖,需回退设计
13 结果 多语言参考集 4/5 13+ 语言,覆盖不均
14 质量 编辑一致性 4/5 MRCM 约束+QA 流程
15 质量 推理一致性 4/5 OWL 分类校验;primitive 混杂
16 质量 机构 ID 化 5/5 概念 ID 即标识
17 治理 更新频率 5/5 月度
18 治理 变更通告 5/5 发布说明+早期可见性页
19 治理 法规锚定 5/5 ONC 认证/多国卫生框架
20 AI 任务 概念链接适用性 5/5 归一目标空间的行业标准
21 AI 任务 层级推理适用性 5/5 本体推理是原生能力
22 AI 任务 大模型适配适用性 4/5 已有国家级实践;许可需确认
23 伦理 个体隐私风险 5/5 纯术语无患者数据
24 伦理 二次使用许可清晰度 3/5 属地化条款复杂,需法律尽调

DAIMS 综合:102/120(4.25/5)——结构、版本与 AI 任务维度接近满分;许可复杂度是唯一显著短板。

§7.2 可复现分析路线

  • 复现概念规模:Snapshot Concept 表 active=1 计数(应约 36 万,随月度版本浮动)。
  • 复现层级深度:以 IS-A 边构建 DAG,统计各顶层层级最大深度。
  • 复现映射覆盖:美国版 ICD-10-CM 映射参考集源概念计数(12.6 万+)。

§7.3 外部评测资源

  • 概念链接:临床 NLP 共享任务的 SNOMED 标注子集(病历级人工标注)。
  • 多语言:成员国 NRC 的翻译质量报告与语言参考集。
  • 推理正确性:官方 OWL 分类输出(每月版)作为层级金标。

§7.4 质量审计清单(发布前)

  • [ ] 概念 ID 全链路字符串化(SCTID 校验位保留)。
  • [ ] 版本号(effectiveTime/发布包名)写入产物元数据。
  • [ ] 许可属地确认:训练/部署/发布三环节各自的许可依据留档。
  • [ ] FSN 未被直接用于用户展示或无后处理的语料。
  • [ ] inactive 概念的历史关联已处理(无悬空 ID)。
  • [ ] 描述字段 schema 已支持 4096 字符(2026-07 后)。
  • [ ] 层级查询基于官方闭包资源而非裸 IS-A 边。
  • [ ] ICD 映射的方向性与一对多已显式建模。

§7.5 与站内数据集的联合分析建议

联合对象 键 分析价值
umls CUI ↔ SCTID 跨词表集成与同义词扩展
loinc Observable Entity ↔ LOINC 码 检验数据双词表结构化
mimic-iii / mimic-iv 诊断/操作编码 EHR 概念归一的目标空间
clinicaltrials-gov conditions 文本 注册病种归一与试验检索
open-targets 疾病概念 靶点证据与临床概念的桥接
faers 不良事件术语 安全信号的术语归一
drugbank 药物产品层级 药物知识联动

§7.6 模型卡要点(基于本数据集训练/评测时建议声明)

卡片项 建议声明内容
术语版本 SNOMED CT International Edition YYYYMMDD(必填)
覆盖范围 涉及的顶层层级与模块(国际/国家扩展)
许可依据 属地许可类型与许可文书编号
训练语料 使用的描述表子集/外部病历语料及其许可
已知偏差 英语中心性、翻译覆盖缺口、primitive 概念占比
评测协议 unseen surface form F1 + 层级留出测试
版本升级策略 月度对齐节奏与回归测试门槛

§7.7 与 UMLS 联合使用的口径对照

维度 纯 SNOMED RF2 UMLS 集成版
概念标识 SCTID CUI(附映射)
同义词面 描述表 + 语言参考集 跨词表同义词合并
更新节奏 月度 每年(UMLS 年度版)
适用场景 术语精确工程 跨词表快速原型
风险 —— 同义词合并引入跨词表噪声
  • 建议:生产系统以 RF2 为准(月度新鲜度),原型阶段可用 UMLS 快速起步;两者混用时以 SCTID 为最终锚。

§8 伦理、隐私与合规

  • 无患者数据:纯术语资产,无个体隐私风险。
  • 许可属地化是伦理与合规交叉点:忽略属地条款而训练/发布模型可能构成违约;涉及成员国翻译资产时更需谨慎(翻译版权归 NRC 或 SNOMED International)。
  • 模型输出的临床边界:基于 SNOMED 的自动编码/归一系统应声明「辅助用途」,最终编码责任在临床编码员。
  • 偏见与覆盖:术语覆盖反映英语世界医学实践;非英语地区特有概念依赖国家扩展——跨语言部署应评估覆盖缺口而非假设完备。
  • 禁背书:不得暗示 SNOMED International 认可衍生产品。

§8.1 合规操作清单(AI 团队版)

环节 合规动作 留档物
获取 属地许可签署 License 文书 + 账号凭证
训练 用途申报覆盖「模型训练」 申报截图/编号
内部部署 版本号与许可范围一致 数据资产目录
对外发布模型 确认发布行为在许可覆盖内 法务确认函(建议)
商业化 用途变更申报更新 更新申报记录
引用 引用官方版本号与发布日期 论文/模型卡引用块
  • 一条工程红线:许可文书更新(如条款修订)后,已归档的旧版本数据仍按获取时条款执行,但新获取版本适用新条款——合规系统按「版本-条款」双维度管理。

§8.2 术语偏见的公平性提示

  • 覆盖偏见:术语深度与英语世界临床实践对齐,罕见病/区域病有 Orphanet 与国家扩展补位但仍不均衡。
  • 编码偏见:历史编码习惯(同一临床情形选择不同概念)会在下游模型中固化——跨院训练时建议以概念共现做偏差审计。
  • 语言权力:首选词由参考集决定,多语言部署时「哪个词是标准」本质上是治理问题而非技术问题——涉及患者可见的输出务必由属地临床人员终审。

§9 版本历史与演进

时间 演进 对 AI 用户的影响
1965-2000 SNOP→SNOMED→SNOMED RT 概念/关系结构确立
2002 SNOMED CT 首版(RT + Clinical Terms 合并) 现代版本起点
2007 IHTSDO 收购,国际化治理 成员国扩展机制建立
2014 前后 RF2 成为标准发布格式 机器解析门槛大幅降低
2023 Snowstorm 成为主流部署 术语服务民主化
2026-01 国际版月度化;CNC 弃用启动 版本管理 CI 化压力上升
2026-07 描述上限 255→4096 下游 schema 迁移
2026-09-01 本文口径最新国际版 ——

§9.1 未来演进方向

  • 月度节奏下的版本自动化:成员国与商业系统需建立月度升级流水线(差异报告+回归测试)。
  • 与 ICD-11 基础层的深度映射:本体对本体的映射将比 ICD-10 时代更精细。
  • 生成式 AI 的双向融合:术语辅助 LLM 结构化输出(约束解码到概念 ID);LLM 辅助术语候选生成(经 CRS 人工评审)。
  • 覆盖扩张:罕见病(Orphanet 协作)、肿瘤分期、公共卫生事件语义持续增补。

§9.2 使用本条目时的维护提示

  • 概念规模每季度复核(月度版本累计新增/失活)。
  • 许可条款以 SNOMED International 与属地 NRC 最新文本为准;本文不构成许可建议。
  • 技术变化(如描述上限、CNC 弃用)跟踪官方 Early Visibility 页。

§9.3 引用本条目时的核查顺序

  1. 概念规模:以你使用的实际版本 Snapshot 表 active 计数为准(本条目口径 2026-09-01 前后)。
  2. 发布节奏:确认国际版月度、美国版半年的现行策略未变。
  3. 许可条款:以 SNOMED International 与属地 NRC 当前文本为准。
  4. 技术变更:描述上限、CNC 弃用等以官方 Early Visibility 页为准。

§10 引用与资源

§10.1 官方资源

资源 链接 说明
SNOMED International 官网 https://www.snomed.org/ 标准、会员与许可
MLDS 发布分发 https://mlds.ihtsdotools.org/ 国际版/成员国版 RF2 下载
美国版(NLM) https://www.nlm.nih.gov/healthit/snomedct/ UMLS 通道与归档
发布说明(国际版) SNOMED 官方 Confluence/Atlassian 逐版变更(含 2026-05/09)
Snowstorm GitHub(snomed-ict/snomed-storm 系) 官方推荐术语服务器
Editorial Guide SNOMED Confluence 内容语义权威解释

§10.2 学术引用

  • SNOMED International. SNOMED CT International Edition Release Notes, 2026 Monthly Releases. https://www.snomed.org/ (访问日期 2026-09-19).
  • National Library of Medicine. March 2026 SNOMED CT US Edition Available for Download. NLM Tech Bull. 2026 Mar-Apr;(469):b2.
  • Norwegian Directorate of Health. Report on Large Language Models in Norwegian Health and Care Services — Professional Language Resources. 2025-2026.
  • Donnelly K. SNOMED-CT: The advanced terminology and coding system for eHealth. Stud Health Technol Inform. 2006;121:279-290.
  • Stearns MQ, Price C, Spackman KA, Wang AY. SNOMED clinical terms: overview of the development process and project status. Proc AMIA Symp. 2001:662-666.
  • umls:跨词表集成枢纽——美国法定获取通道(见 §2.1b)
  • loinc:检验/观察术语互补(Observable Entity 联动)
  • mimic-iii / mimic-iv:EHR 编码应用主战场
  • clinicaltrials-gov:注册病种文本的归一出口
  • open-targets / gwas-catalog:疾病概念的证据层扩展
  • faers:不良事件术语归一
  • drugbank:药物产品层级联动

§10.4 建议引用格式

@misc{snomedct_2026,
  title        = {SNOMED CT International Edition (RF2)},
  author       = {{SNOMED International}},
  howpublished = {https://www.snomed.org/},
  note         = {Monthly releases since January 2026; edition 20260901},
  year         = {2026}
}

§10.5 常见问题 FAQ

Q1:我可以直接用 SNOMED CT 训练商用模型吗?
A:需按属地许可判断:成员国属地、美国 UMLS 许可、Affiliate License 三条路径各有条款;商用发布前应取得书面许可确认——本文不构成法律意见。

Q2:SNOMED CT 与 ICD-11 选哪个?
A:临床表达与互操作选 SNOMED;统计/报销/死因归报选 ICD。两者经映射衔接而非互斥——成熟卫生信息系统两者并用。

Q3:为什么概念数说法不一(32 万/35 万/37 万)?
A:版本时间点、是否含国家扩展、是否只计活跃概念的口径差异;引用时务必写明版本日期与范围。

Q4:月度发布是否必须每月升级?
A:技术上无强制;但映射派生物与国家扩展随月度演进,建议至少季度对齐并跟踪重大变更(如描述上限)。

Q5:如何做中文支持?
A:中文非官方成员国语言参考集覆盖范围(截至本文口径);工程上可经 UMLS CUI 或直接以英语概念为锚自建中文同义词词典,并关注中国本土扩展进展。

Q6:成员国的国家扩展会不会破坏互操作?
A:设计上不会——扩展概念挂在国际模块层级下,moduleId 区分来源;但跨国数据交换仍建议以国际模块概念为主,扩展概念仅在属地系统内使用。

Q7:处理失活概念最稳的工程模式是什么?
A:ID 服务层做「时间感知解析」:给定引用时的版本日期,按该版本历史表重定向到当时有效的替代概念——这比「一律重定向到最新」更忠实于原始临床语义。

Q8:术语集能否直接当知识图谱用?
A:可以且常用:三表即三元组、闭包即预计算可达性;但注意属性关系多为本体内部语义(关联形态学等),做开放域推理时需补充属性语义定义(MRCM 与 Editorial Guide)。

(全文完;本文共 §0-§10 十一个章节,规模数字以官方发布说明与 NLM/挪威官方口径为准,版本口径 2026-09-01。)

结语提示:SNOMED CT 的价值随使用深度递增——当作同义词表用时它只是个大词典,当作本体用时它是可推理的临床知识库,当作治理体系用时它教会医疗数据团队如何用版本化思维管理语义资产。建议新团队按「词典 → 层级 → ECL → 历史关联」的顺序分四个季度逐步吃透,每一步都有独立的工程回报。

本条目与 umls、loinc 条目构成站内「术语基础设施」三部曲;三条目的 DAIMS 评估可横向对照阅读,以理解不同许可模式下术语类数据集的工程取舍差异。
术语类数据集与影像类数据集的最大差异在于「版本活性」:影像数据集发布后基本冻结,而 SNOMED 每月都在生长与修剪——这既是维护成本,也是它能持续保鲜的根本原因。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集