LOINC — 医学检验观察标识符 AI-Ready Wikipedia

112,405 概念、六轴语义模型、免费开放的检验与临床观察全球标准

来源 https://loinc.org/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 26
LOINC — 医学检验观察标识符 AI-Ready Wikipedia

信息速览

数据集名称LOINC — 医学检验观察标识符 AI-Ready Wikipedia
数据类型112,405 概念 / 2.83 版,六轴 Part 语义模型,实验室 69,651 + 临床 28,786,CC BY 4.0 免费开放
规模术语标准本身不含患者数据;服务于全球检验报告与临床观察数据的语义归一
接入方式https://loinc.org/
AI 就绪度

LOINC — 医学检验观察标识符 AI-Ready Wikipedia

INFOBOX

属性 内容
全称 LOINC(Logical Observation Identifiers Names and Codes)
维护方 Regenstrief Institute(美国印第安纳波利斯;NLM 长期资助)
当前版本 2.83(2026-08-19 发布)
总概念数 112,405
构成 实验室 69,651 / 临床 28,786 / 问卷 12,807 / 理赔附件 1,161
核心模型 六轴 Part:Component/Property/Time/System/Scale/Method
格式 CSV 文件族(Loinc.csv 等 20+ 文件)+ FHIR terminology service
许可 CC BY 4.0(免费署名即可)
标识符 LOINC Num(数字-校验位格式,如 806-0)
官网 https://loinc.org/
本库关联 umls(SAB=LNC 集成源)、
本库关联 umls(SAB=LNC 集成源)、snomed-ct(LOINC Ontology 互操作)、mimic-iv((LOINC Ontology 互操作)、mimic-iv(检验数据归一)

§0 E-E-A-T 信任声明与免责声明

  • 经验:本文检验语义建模实例(806-0 脑脊液白细胞计数六轴拆解)、LIS 映射工作流与坑点均来自检验信息化标准实践。
  • 专业性:全部规模数字与版本事实核对自 loinc.org 官方发布页与 Release Notes(2026-09 核实)。
  • 权威性:LOINC 由 Regenstrief Institute 维护、NLM 长期资助,为 USCDI 联邦互操作标准组成部分。
  • 可信度:许可(CC BY 4.0)、发布节奏(演进公告)均以官方声明为准;引用一律带版本号。
  • 免责声明:本文为技术性 Wiki,不构成临床决策依据;检验项目选择与结果解读需专业医师。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:全球最广泛使用的医学检验与临床观察标识标准——给「每一项检验/观察问题」一个唯一编码(结果值本身不在 LOINC 范围)。
  • 规模:2.83 版 112,405 概念;实验室 69,651、临床 28,786、问卷 12,807、理赔附件 1,161。
  • 模型:六轴 Part 组合语义——同名检验因方法/标本/刻度不同而编码不同。
  • 许可:CC BY 4.0 完全免费(词表领域最宽松的主流标准之一)。
  • 地位:HL7 FHIR Observation.code 事实标准、USCDI 联邦标准、UMLS 集成源词表(SAB=LNC)。

§1.1 摘要

LOINC 解决的问题极其具体:同一项「血钾」检验,在不同医院的 LIS 系统里有几百种私有名称与编码——电子交换时接收方无法机器判断「这两列数据是不是同一项」。LOINC 给每项观察(检验/测量/问卷问题/文档类型)一个全球唯一码,使「血钾 4.2 mmol/L」可以被理解为同一语义实体。精确性来自六轴 Part 模型:成分(钾)、属性(质量浓度)、时间(检测时点)、体系(血清/血浆)、刻度(定量)、方法(如离子选择电极)——任何一轴不同即不同码。对 AI 团队,LOINC 是检验类 EHR 数据归一的事实标准(MIMIC/eICU 检验表归一的公共键)、多中心检验对齐的语义基础设施,与 SNOMED CT 经 LOINC Ontology 实现互操作。

§1.2 战略价值

  • 检验数据的公共键:多院区/多数据库检验结果对齐的唯一现实方案——没有 LOINC,「同项合并」只能靠名称模糊匹配。
  • FHIR 生态的地基:Observation.code 绑定 LOINC 是全球 FHIR 实施的默认做法——做医疗 API/CDM 必然遇到。
  • 法规锚定:美国 HIPAA 实验室交换、HITECH/Meaningful Use、USCDI 均引用 LOINC——合规性自带背书。
  • 许可零摩擦:CC BY 4.0 使产品集成无法律成本(对比 SNOMED 属地许可、UMLS 分层)。
  • 与 UMLS/SNOMED 互操作:经 UMLS(SAB=LNC)进跨词表集成;经 LOINC Ontology(RF2)进 SNOMED 本体框架。
  • 词典轻量:核心文件数十 MB——是主流词表中部署成本最低的(对比 UMLS 40 GB / SNOMED 数 GB RF2)。
  • 小词典红利:候选空间小使编码器检索与 LLM 幻觉校验的工程成本都远低于大词表场景。

§1.3 同类数据集横向对比

维度 LOINC SNOMED CT UMLS CPT
定位 检验/观察「问题」标识 全临床概念本体 跨词表集成层 操作计费编码
规模 112,405(2.83) 约 36 万活跃 344 万 CUI 约 1 万
语义模型 六轴组合 描述逻辑本体 归组映射 分类列表
许可 CC BY 4.0 属地 Member License 分层签署 商业授权
检验场景 ✓ 强项 覆盖但组合复杂 含 LNC 原子 无
本体推理 弱(需 Ontology 补) 强 弱 无
AI 检验归一 首选 次选 映射桥梁 不适用
  • 组合判据:检验/观察归一 → LOINC;全临床推理 → SNOMED;跨词表映射 → UMLS;计费 → CPT。

§1.4 版本时间轴

版本 日期 要点
1.0 1994 Clem McDonald 于 Regenstrief 发布首版(NLM 资助验证)
2.x 早期 2000s 临床观察/问卷纳入;HIPAA/HITECH 法遵驱动
2.78 2024-08-06 1,589 新概念 + 1,416 编辑
2.80 Hotfix 2025-02-26 修复 2.79 引入的问题
2.81 2025-08-12 4,000+ 新/更新概念
2.82 2026-02-24 新增与修订 + 技术增强
节奏公告 2026-05-04 官方宣布演进发布节奏(loinc.org/monthly)
2.83 2026-08-19 3,080 新概念;总量 112,405;下次 2027-02
Ontology v2.82 2026-03 45,000+ SNOMED 概念;top 20k 覆盖 78%

§1.5 典型应用场景

  • LIS 目录标准化:医院检验科以 RELMA 将私有目录映射到 LOINC——区域卫生平台互通的前置工程。
  • EHR 检验归一(CDM):MIMIC-IV/eICU 类数据库的 LABEVENTS 经 LOINC 对齐,多库联合分析。
  • FHIR Observation:Observation.code 绑定 LOINC——互联网医院/可穿戴数据上云的标准姿势。
  • 科研队列表型:「eGFR<60 持续 3 月」类化验定义跨库复用(以 LOINC 定义的 phenotype 库)。
  • 问卷结构化:PHQ-9 类量表的每道问题有 LOINC 码——问卷数据跨系统可比。
  • 理赔/公卫上报:Claims Attachments 域 + 公共卫生上报(LOINC 为 CDC 类上报标准所引)。
  • 可穿戴/远程监测:家用血压/血糖数据经 LOINC 码上行——远程医疗数据入仓的语义入口。

§1.6 组件全景与文件族

文件/组件 内容 AI 用途
Loinc.csv 主文件:每码一行(名称/六轴/类别/状态/单位) 词典与主键空间
LoincUniversalLabOrdersUsageSheet.csv 通用检验订单集 订单归一优选集
MultiAxialHierarchy.csv 多轴路径层级 层级导航/分类特征
PanelsAndForms.csv 组套与成员 panel 展开与去重
DocumentOntology.csv 文档类型本体(影像/病理报告类) 文档归一
Part 文件(LoincPart 相关) 六轴 Part 编码(LP 码)与术语 语义特征工程
AnswerList(LL/LA) 问卷答案列表与答案码 问卷值域对账
MapTo.csv 等 DEPRECATED 码的 MAP_TO 映射 历史码升级
RSNA Playbook(Radiology Playbook) 影像订单过程码 影像结构化
RELMA 本地目录→LOINC 映射工具 LIS 标准化
FHIR terminology service 在线术语服务(fhir.loinc.org) 免下载查询/校验
  • 标识符:LOINC Num 为「数字-校验位」文本(如 806-0);Part 码以 LP 前缀;答案码以 LA 前缀——三类码空间不可混用。

§1.7 检验标准化的经济学:私有码为何顽固

三十年过去,LIS 私有码依然普遍存在——理解「为什么」能帮 AI 团队设计出真正落地的归一方案,而不是空中楼阁。

私有码顽固的四重原因

原因 机制 对策含义
历史惯性 LIS 早期无标准可用,私有码内嵌进计费/报表/仪器接口 归一做在「外联层」,不试图替换 LIS 内部码
商业绑定 检验套餐与收费项目绑定,私有码即商业目录 LOINC 映射按「观察语义」而非「收费项目」粒度
粒度错配 院内一个码可能携带流程信息(急/平诊、组套绑定) 映射表多对多(§7.7),禁止 1:1 强制
变更成本 改码触发下游报表/接口连锁修改 新数据双码并行,老数据靠映射表

标准化的「最后一公里」结构

仪器/试剂私有码 → LIS 目录码 → 【映射层】→ LOINC → 区域平台/FHIR/科研
                                    ↑
                     这里是 90% 的工程量与 90% 的错误发生地
  • AI 的真实机会:映射层的自动化——RELMA 类工具把「查词典」变成「半自动匹配」,AI 把它推进到「自动匹配 + 人工评审队列」。这一层的投入产出比远高于试图「重造 LIS」。
  • 成本对照:人工映射一条私有检验名的成本在分钟级(专家);自动管线把 60-80% 的高频项压到秒级——剩余长尾才是人工主战场。

§2 医学背景

§2.1 检验语义为何需要「六轴」

  • 一个真实的歧义:「白细胞计数」至少是四个不同的观察——外周血自动计数、脑脊液手工计数、尿液沉渣计数、关节液计数。若只有一个码,临床语义即丢失(CSF 白细胞升高提示脑膜炎,外周血升高提示感染——决策完全不同)。
  • 六轴消歧:Component(白细胞)+ Property(数量浓度 NCnc)+ Time(检测时点 Pt)+ System(脑脊液 CSF)+ Scale(定量 Qn)+ Method(手工计数 Manual count)→ 每轴组合唯一确定一项观察(806-0)。
  • 工程含义:六轴是天然的语义特征向量——按 Part 做特征(而非按名称 n-gram)的匹配模型天然对齐临床语义;这也是 LOINC Part 文件对 NLP 的独特价值。

§2.2 观察与结果的分离哲学

  • LOINC 编码「问题」不编码「答案」:806-0 是「CSF 白细胞计数这项检验」,而「结果 12 /µL」是值——问题/答案分离使同一码下可聚合任意时点结果,是纵向趋势分析的语义基础。
  • 有序刻度与定量刻度:Scale 轴区分 Qn(定量数)、Ord(有序等级)、Nom(名义)——「尿蛋白定量 mg/dL」与「尿蛋白定性 ±/+/++」是不同码:值域不同、统计方法不同。
  • 与 SNOMED 的分工:SNOMED 也含检验概念且组合表达更强,但 LOINC 的六轴扁平模型对「检验订单/报告」场景更直接——两词表的协调即 LOINC Ontology 项目(2022 协定、2025 续签)。

§2.3 SPECIALIST 级的命名学:FSN/LCN/Short Name

  • FSN(Fully-Specified Name):六轴冒号拼接(Leukocytes:NCnc:Pt:CSF:Qn:Manual count)——无歧义的机器友好名。
  • LCN(Long Common Name):临床友好显示名(Leukocytes [#/volume] in Cerebral spinal fluid by Manual count)——界面上给人看。
  • Short Name:报表表头紧凑名(WBC # CSF Manual)。
  • AI 提示:FSN 的六轴结构可直接解析出 Part 特征;LCN 适合做词典展示与 LLM 输出可读化;三层名不可互相当主键。

§2.4 AI 任务定义

任务 输入 输出 评测思路
检验目录映射(LIS→LOINC) 私有检验名称+单位+标本 LOINC Num + 置信度 人工标注映射集准确率
化验文本归一 检验报告文本 LOINC Num 抽样人工评审/标注集 F1
六轴抽取 检验名称字符串 六个 Part 值 Part 级准确率(组件/标本分报)
panel 展开与去重 检验记录流 成员码集合 PanelsAndForms 对照
问卷题归一 量表问题文本 LOINC Num 问卷库标注集
结果单位校验 码+单位 合法/违规 UCUM 语法 + EXAMPLE_UNITS 提示

§2.5 覆盖领域

  • 强项:临床化学、血液学、血清学、微生物学(含药敏)、毒理学、免疫学;生命体征、血流动力学、心电图、产科超声、呼吸机管理等临床观察;PHQ-9 等标准问卷;影像与病理文档类型。
  • 结构性特点:检验订单/报告语义全覆盖——但「结果值的受控词表」(如微生物菌名)属 SNOMED/其他词表域。
  • 语言:英语主文件;多语言翻译由社区维护(简体中文翻译生态最成熟,志愿翻译者获 2020 年 LOINC 杰出贡献奖)。

§2.6 临床与研究价值

  • 对检验科/LIS 厂商:目录标准化是区域互通的入场券——中国台湾/韩国/德国等已有全国/全区域导入案例(国家实施论文持续发表于 LOINC 期刊库)。
  • 对 CDSS/表型工程:化验表型定义(eGFR、HbA1c 控制达标)以 LOINC 表达即可跨机构复用。
  • 对 AI 团队:检验归一模型的输出以 LOINC Num + 版本发布即成为公共资产——可比性、可复现性一步到位。

§2.7 金标准与参考实现

  • 金标准定位:「某私有码 ↔ LOINC」的官方映射不存在——LOINC 是映射目标而非映射源;金标准只能来自人工标注映射集(RELMA 产出 + 本地评审)。
  • 参考实现:RELMA(官方映射助手)、FHIR terminology service(官方在线服务)、LOINC Ontology(官方 SNOMED 桥)。
  • 学术基线:检验名称归一论文以 MultiMed/自有标注集为主流;MIMIC-IV 检验表与 LOINC 的对照表是公开的实践金标样本。

§2.8 法规与政策生态:从学术标准到合规要求

LOINC 的采用曲线不是纯技术扩散——美国法规在三个节点上把它从「可选」变成「必选」,理解这些节点才能理解其全球地位的由来。

三个法规节点

节点 内容 效果
HIPAA 实验室交换 实验室电子交换要求标准代码 LOINC 进入合规词典
HITECH / Meaningful Use 电子病历激励计划引用 LOINC 全美医院快速导入(政策补贴驱动)
USCDI 联邦互操作数据元素标准持续引用 现代认证与 API 合规的组成部分
  • CDISC/监管递交:临床试验数据递交标准(FDA/PMDA)收录 LOINC——试验终点测量(outcomes)的标准化标识。
  • 公卫上报:CDC 类公共卫生上报体系以 LOINC 表达检验请求/结果——疫情监测的语义基础设施。

对非美国语境的启示

  • 法规不是唯一驱动力:德国/韩国/加拿大/中国台湾地区的导入由区域互通需求驱动(「National implementation」论文系列记录了翻译→映射→推广的方法论)。
  • 中文语境:简体中文翻译生态(志愿翻译 16 年+)使 LOINC 中文落地成本低于多数非英语词表——区域检验结果互认的语义层选择。
  • 产品含义:做出海医疗产品时,LOINC 是「默认无争议」的检验词汇选择——无需属地授权谈判(对比 SNOMED Member License 体系)。

§2.9 NLM 的持续角色

  • 资金与治理:NLM 自 1994 年首次资助验证试验起持续资助 LOINC 维护与发展——三十年不间断。
  • UMLS 集成:LOINC 全量收录进 UMLS Metathesaurus(SAB=LNC)——跨词表映射(检验概念 ↔ SNOMED/MeSH/RxNorm)经 CUI 通道实现。
  • VSA 托管:LOINC 相关价值集(Value Set)由 NLM 的 Value Set Authority Center 托管——公卫场景的权威分发渠道。
  • 对 AI 的意义:NLM 背书意味着长期可用性有国家级保障——把 LOINC 作为十年期数据仓词汇层不是赌博。

§2.10 UCUM:单位语义的姊妹标准

LOINC 解决「测什么」,UCUM(Unified Code for Units of Measure)解决「单位怎么写」——两者是化验数据语义的一对孪生地基,混用单位是化验统计的头号噪声源。

为什么需要 UCUM

  • 自由文本单位的灾难:「mg/dl」「mg/dL」「MG/DL」「毫分克每分升」——字符串层面四写法,语义层一个。UCUM 给每个单位一个区分大小写的规范码(mg/dL),量纲可计算。
  • 大小写即语义:UCUM 中 ml 与 mL、m 与 M 是不同实体——mg/dl 在 UCUM 里是「毫克每分升」的正确写法之一吗?不是——UCUM 分升是 dL。大小写敏感的校验因此成为可能。
  • 量纲运算:UCUM 支持量纲分析(mg/dL 与 g/L 可换算,1 g/L = 100 mg/dL)——跨库化验对齐的换算由此可程序化。

与 LOINC 的配合

场景 LOINC 侧 UCUM 侧
码定义 EXAMPLE_UCUM_UNITS 列给出示例单位 该列值即 UCUM 码
数据校验 码 + 输入单位 UCUM 量纲兼容判断
单位换算 — UCUM 语义换算(不需要硬编码换算表)
LLM 输出 归一码 单位归一为 UCUM 码

工程红线

  • 单位校验用量纲兼容而非字符串相等——同一码合法多单位(SI 与惯例单位并存)。
  • LLM/自由文本产出的单位必须经 UCUM 解析器校验——非法码直接进人工队列。
  • 换算必须显式声明公式与精度(尤其 eGFR、钙校正等派生量)。

§3 数据集规格

§3.0 版本抉择矩阵

使用目标 推荐通道 理由
检验归一建模 Loinc.csv + Part 文件 主键空间 + 语义特征
LIS 目录映射工程 RELMA 官方映射工作台
在线校验/查询 FHIR terminology service 免部署
与 SNOMED 一体化 LOINC Ontology RF2 本体级互操作
层级分类分析 MultiAxialHierarchy 多轴路径
问卷数据对账 AnswerList 文件 答案码值域
历史码升级 MapTo 文件 DEPRECATED 映射

§3.1 模态详情

数据层 内容 核心文件 AI 可用形态
主码层 每码一行:名称/六轴/类别/状态 Loinc.csv 主键词典
Part 层 六轴 Part 术语与 LP 码 Part 文件族 语义特征向量
层级层 多轴分类路径 MultiAxialHierarchy 分类标签
组套层 panel 与成员 PanelsAndForms 去重规则
文档层 文档类型本体 DocumentOntology 报告归一
答案层 问卷答案列表/码 LL/LA 文件 值域约束
映射层 DEPRECATED→现行码 MapTo 历史数据升级
服务层 FHIR 术语服务 fhir.loinc.org 在线校验

§3.2 按子集样本数

子集 数量 口径
总概念 112,405 2.83(2026-08-19)
Laboratory 69,651 2.83
Clinical 28,786 2.83
Surveys 12,807 2.83
Claims Attachments 1,161 2.83
v2.83 新概念 3,080 官方发布
LOINC Ontology(SNOMED 侧) 45,000+ v2.82(2026-03)

§3.3 格式对照

通道 格式 适用 注意
loinc.org 下载 CSV 文件族 批量建模 注册免费账号
RELMA 桌面工具(含数据库) 映射工作台 Windows 环境
FHIR TS REST(fhir.loinc.org) 在线校验 版本参数锁定
UMLS RRF(SAB=LNC) 跨词表 半年滞后于官方
LOINC Ontology RF2 SNOMED 集成 版本号对齐 LOINC
Value Set Authority Center 价值集 公卫场景 NLM 托管

§3.4 存储大小

  • 核心 CSV 族:数十 MB 级(相对 UMLS 40 GB/SNOMED RF2 数 GB,LOINC 是最轻量的主流词表)。
  • RELMA 安装:含本地 SQL Server Express 与全部文件,GB 级。
  • 全量入库:PostgreSQL/MySQL 建库后含索引亦在数百 MB 级——单机即可,无分布式需求。

§3.5 标注方式

  • 官方结构化标注:六轴 Part 值即官方语义标注;CLASS(检验类别,如 CHEM/HEM)、SYSTEM(标本类型)、PROPERTY 为现成特征列。
  • 状态标注:STATUS 列(ACTIVE/DEPRECATED)+ MAP_TO + COMMENTS——生命周期现成可用。
  • 名称标注:FSN/LCN/SHORTNAME 三层名称 + 同义词( consumer 视角 SYNONYMS 列)。

§3.6 标注者资质与一致性

  • 委员会机制:新码经 LOINC 委员会(实验室/临床分委员会)评审——内容决策有制度性质量闸门。
  • 申请制:任何机构可申请新码(商业实验室/公卫部门为主要申请者)——社区驱动的增长。
  • 一致性含义:六轴建模规则(如 Method 何时独立成轴)跨版本有微调(如 LOINC Ontology 2.82 对凝血/药敏 Method 轴的迁移),下游解析器需随 Release Notes 校准。

§3.7 采集周期

  • 历史节奏:每年两次(6 月/12 月)大版本——三十年惯例。
  • 节奏演进:2026-05-04 官方公告演进发布节奏(loinc.org/monthly),2.83 后下一次完整发布 2027-02——月度增量与大版本的混合节奏正在落地。
  • 对管线的含义:版本锁定策略需从「半年」改为「跟随 loinc.org/monthly 公告」。

§3.8 地域覆盖

  • 使用地域:注册用户来自近 200 国家地区(2024-06 时点 216,000+ 注册用户)。
  • 国家实施:美国(法遵驱动)、德国/韩国/加拿大/中国台湾地区等有系统性导入——「National implementation」类论文记录了翻译与映射方法论。
  • 中文语境:简体中文翻译由志愿团队长期维护(张林等,2003 年底起),LOINC 中文资源在区域检验标准化中广泛引用。

§3.9 设备规格

  • 不适用(术语标准无采集设备);相关「设备语义」体现在 Method 轴(如 Manual count vs Automated count)与 RSNA Playbook(影像订单过程)。

§3.10 深度溯源链

层 溯源内容 位置
码级 每码的定义/备注(COMMENTS) Loinc.csv
轴级 Part 术语定义与版本 Part 文件
生命周期 DEPRECATED 状态与 MAP_TO 目标 STATUS/MapTo
制度层 委员会评审记录/Release Notes loinc.org/kb
互操作层 Ontology 建模决策 loincsnomed.org/notes

§3.11 核心文件清单(对应 RRF/RF2 风格)

loinc-2.83/
├── Loinc.csv                              # 主文件(112,405 行)
├── LoincUniversalLabOrdersUsageSheet.csv  # 通用检验订单优选集
├── MultiAxialHierarchy.csv                # 多轴层级
├── PanelsAndForms.csv                     # 组套-成员
├── DocumentOntology.csv                   # 文档本体
├── Part 文件族(LoincPart*.csv)           # 六轴 Part 术语
├── AnswerList 文件(LL*.csv/LA*.csv)      # 答案列表/答案码
├── MapTo.csv                              # DEPRECATED 映射
├── RSNA Playbook 文件                      # 影像订单
└── Release Notes / Readme

§3.12 许可条款(CC BY 4.0 实操)

条款 内容 对 AI 的意义
署名 引用 LOINC 版本 + Regenstrief Institute 署名 产品文档/模型卡留痕
商用 允许 SaaS/商业 LIS 集成零授权成本
再分发 允许(同许可) 词典可随产品分发
修改 允许(需标注改动) 翻译/裁剪子集合法
对比 SNOMED 属地/CPT 商业 LOINC 许可摩擦最低
  • 工程建议:词表词典文件头部写明「LOINC(R)Version 2.83, Copyright (c) Regenstrief Institute, CC BY 4.0」模板即可满足署名。

§3.13 与 SNOMED CT 的 LOINC Ontology

  • 合作结构:Regenstrief × SNOMED International 协定(2022 签署、2025 续签)——把 LOINC 检验内容建模为 SNOMED CT 扩展模块。
  • v2.82(2026-03):45,000+ SNOMED 概念(active + discouraged 实验室 LOINC 全集),RF2 合规,扩展模块 11010000107,对齐 SNOMED 国际版 2026-01-01。
  • 覆盖度:最常用 top 100 lab 概念覆盖 99 个;top 2,000 覆盖 1,637;top 20,000 覆盖 15,535(约 78%)。
  • 版本命名:Ontology 版本号自 v2.82 起对齐 LOINC 版本(此前独立 1.0 系列)。
  • 已知建模边界(官方 Notes):panel 与成员无连接、名义概念与答案列表无连接、supersystem 未语义表达——使用 Ontology 做推理需知晓。

§3.14 RELMA 操作手册(LIS 映射工作台)

RELMA(Regenstrief LOINC Mapping Assistant)是官方提供的桌面映射工具——把医院 LIS 私有检验目录半自动匹配到 LOINC 的标准工作流。

标准操作序列

1. 安装:RELMA 含本地数据库(SQL Server Express)+ 全量 LOINC 文件
2. 导入私有目录:
   a. 准备 CSV:检验名称 / 单位 / 标本 / 方法备注 / 院内码
   b. RELMA Import Wizard 建立本地检验目录
3. 自动匹配:RELMA 内置匹配算法按名称+属性生成候选
4. 人工评审:
   a. 逐条确认 top 候选(可按相似度排序)
   b. 无匹配项标记 → 走 LOINC 新码申请或「无对应」留档
5. 导出映射表:院内码 ↔ LOINC Num + 评审状态
6. 版本升级:新 LOINC 版本发布后 Refresh 数据库重跑匹配

RELMA 的能力边界

能力 强 弱
名称字面匹配 ✓ —
属性感知(单位/标本) ✓ —
大批量自动化 — 逐条评审为主
团队协作/审计流 — 单机工具
LCN 语义理解 — 字面为主
  • AI 补位策略:RELMA 的强项(权威词典+可靠匹配基线)与 AI 的强项(批量推理+语义理解)互补——成熟管线是「AI 预映射 → RELMA 验证导出」,或「RELMA 先行 + AI 清剩余长尾」。
  • 导出资产化:RELMA 导出的映射表应进版本控制(CSV + 评审人 + LOINC 版本列),成为院内数据资产而非工具附属品。

§3.15 多语言与中文翻译生态

LOINC 主文件为英语;非英语落地依赖两条路径——官方多语言资源与社区翻译体系,两者覆盖面不同。

翻译生态结构

层 内容 状态
官方多语言文件 部分轴 Part 术语的多语言版本 有限覆盖
国家实施翻译 德国/韩国/加拿大等系统性翻译项目 国家级维护
中文翻译 志愿者长期维护(2003 年底起,16 年+),覆盖主文件名称与文档 中文生态最成熟的国际词表之一
社区论坛翻译协作 LOINC Community Forum 翻译讨论 持续进行

中文语境要点

  • 简体中文翻译长期由志愿者团队维护(代表者获 2020 年 LOINC 杰出贡献奖)——翻译质量经多年区域性导入检验。
  • 翻译覆盖以常用检验名称为主——长尾码与 Part 轴术语的中文覆盖不完整,映射管线不应假设「全量中文名可用」。
  • 落地姿势:中文 LIS 名称 →(翻译词典/双语模型)→ 英文语义空间 → LOINC 匹配;或直接训练双语检索模型(中文检验名 ↔ LOINC LCN)。

跨语言工程红线

  • 翻译不是编码:同一中文「白细胞」对应多个六轴分码——翻译只解决 Component 理解,System/Method 消歧仍需结构化信息。
  • 版本锁定:翻译词典随 LOINC 版本维护——跨版本合并翻译时 diff 名称变更(坑点 7 的多语言版)。

§4 数据结构

§4.0 目录树

loinc-2.83/
├── Loinc.csv                        # 主表(每码一行)
│   列(节选):LOINC_NUM / COMPONENT / PROPERTY / TIME_ASPECT /
│             SYSTEM / SCALE_TYP / METHOD_TYP / LONG_COMMON_NAME /
│             SHORTNAME / FSN / CLASS / CLASS_TYPE / STATUS /
│             MAP_TO / EXAMPLE_UNITS / EXAMPLE_UCUM_UNITS /
│             EXTERNAL_COPYRIGHT_NOTICE / STATUS_TEXT
├── LoincPartRelatedCodeMap.csv      # 码-Part 映射(LP 码)
├── PartFile.csv                     # Part 术语定义
├── MultiAxialHierarchy.csv          # 路径编码(PATH_TO_ROOT)
├── PanelsAndForms.csv               # 组套成员
├── DocumentOntology.csv             # 文档本体(BEFORE/AFTER 分栏)
├── LoincAnswerList*.csv             # 答案列表(LL 码)
├── LoincAnswerCodes*.csv            # 答案码(LA 码)
├── MapTo.csv                        # 旧码→新码
└── RetrievalUnit*.csv / RSNA 文件

§4.1 DAIMS 字段字典

字段 类型 语义 AI 提示
LOINC_NUM 文本(数字-校验位) 主键 文本处理!int 会丢校验位
COMPONENT 文本 成分轴(测什么) 六轴特征 1
PROPERTY 缩写 属性轴(MCnc/NCnc/SCnc…) 单位语义联动
TIME_ASPECT 缩写 时间轴(Pt/24H…) 纵向分析分组键
SYSTEM 文本 体系轴(标本/部位) 标本消歧关键
SCALE_TYP 缩写 刻度轴(Qn/Ord/Nom) 值域类型
METHOD_TYP 文本 方法轴 同名检验消歧
LONG_COMMON_NAME 文本 显示名 可读化输出
FSN 文本 六轴全称 可解析出 Part
STATUS 枚举 ACTIVE/DEPRECATED 过滤开关
MAP_TO 文本 旧码升级目标 非一对一
CLASS / CLASS_TYPE 文本/整数 检验类别 分类标签
EXAMPLE_UNITS 文本 示例单位 非验证规则
EXAMPLE_UCUM_UNITS 文本 UCUM 单位 单位校验配合

§4.2 标签分布

  • 域分布:实验室 69,651(62%)/ 临床 28,786(26%)/ 问卷 12,807(11%)/ 理赔附件 1,161(1%)——检验占主导。
  • CLASS 分布:CHEM(化学)、HEM(血液)、MICRO(微生物)、COAG(凝血)、SERO(血清)等头部类别占实验室大半;长尾类别数百码。
  • STATUS 分布:绝大多数 ACTIVE;DEPRECATED 概念保留在文件中供历史对账——占比小但事故率高(见坑点 2)。

§4.3 关键统计

统计项 数值 口径
总概念 112,405 2.83
实验室/临床/问卷/附件 69,651 / 28,786 / 12,807 / 1,161 2.83
v2.83 新增 3,080 官方
注册用户 216,000+ 2024-06
使用国家 近 200 官方口径
Ontology 概念 45,000+ v2.82
历史 1994 首版(30+ 年) 官方

§4.4 数据层级

  • 码层(LOINC Num):最小独立观察单元——多数任务的键空间。
  • Part 层(LP 码):六轴术语——语义特征与跨码共享词汇。
  • 组套层(Panel):码的有序集合——订单/报表单元。
  • 答案层(LL/LA):问卷值域——Ord 刻度码的合法值。

§4.5 缺失值处理与信息性缺失编码

  • METHOD 空白:大量码无方法轴(方法不重要时)——空值是信息性缺失(「方法无关」),不要当「未知方法」补默认值。
  • MAP_TO 空白:DEPRECATED 码可能无升级目标(直接废止)——升级管线需处理「无目标」分支。
  • EXAMPLE_UNITS 变体:同一属性轴下单位可多样(SI/惯例单位)——单位校验用 UCUM 列而非字符串相等。
  • EXTERNAL_COPYRIGHT_NOTICE 非空:部分码携带外部版权(来自外部词表的复制内容)——再分发前逐条核对。

§4.6 六轴解析实例

LOINC 806-0
├── Component: Leukocytes(白细胞)
├── Property:  NCnc(数量浓度,#/体积)
├── Time:      Pt(时点)
├── System:    CSF(脑脊液)
├── Scale:     Qn(定量)
└── Method:    Manual count(手工计数)
→ FSN: Leukocytes:NCnc:Pt:CSF:Qn:Manual count
→ LCN: Leukocytes [#/volume] in Cerebral spinal fluid by Manual count
→ Short: WBC # CSF Manual
  • 同一 Component 换 System(Blood/CSF/Urine)即不同码——「成分相同、标本不同」是检验语义分叉的最常见形态;Method 分叉次之(手工/自动/培养法)。

§4.7 Loinc.csv 主列逐列详解

主文件约 60 列,按工程重要性分层速查——前 12 列是日常管线必读,其余按需。

第一层:身份与语义(必读)

# 列名 示例 语义 工程含义
1 LOINC_NUM 806-0 主键(数字-校验位) 全程文本类型
2 COMPONENT Leukocytes 成分轴 可能带 ^修饰后缀
3 PROPERTY NCnc 属性轴 决定值类型与单位量纲
4 TIME_ASPECT Pt 时间轴 纵向分组键
5 SYSTEM CSF 体系轴(标本/部位) 标本消歧
6 SCALE_TYP Qn 刻度轴 Qn/Ord/Nom 分流
7 METHOD_TYP Manual count 方法轴 可空(信息性缺失)
8 LONG_COMMON_NAME Leukocytes [#/volume]… 显示名 展示用;会漂移
9 SHORTNAME WBC # CSF Manual 短名 报表表头
10 FSN Leukocytes:NCnc:Pt:… 全称 可解析出六轴
11 STATUS ACTIVE/DEPRECATED 生命周期 过滤开关
12 CLASS / CLASS_TYPE Chem / 1 类别 分类先验

第二层:单位与值域(化验数据必读)

列名 语义 注意
EXAMPLE_UNITS 示例单位 非验证规则(坑点 5)
EXAMPLE_UCUM_UNITS UCUM 单位 量纲校验的依据
NORMAL_RANGE / 涉及列 参考区间提示 覆盖率低,别当全量依赖

第三层:生命周期与治理(对账必读)

列名 语义 注意
MAP_TO 旧码升级目标 非一对一
STATUS_TEXT 状态说明 DEPRECATED 原因
EXTERNAL_COPYRIGHT_NOTICE 外部版权标记 非空码再分发前核对
VersionLastChanged 最后变更版本 版本 diff 管线

四条高频解析错误与自检

  1. int 化丢校验位:pandas.read_csv 不加 dtype=str → 806-0 变 NaN 或 806。自检:主键列含「-」的比例断言。
  2. COMPONENT 的 ^ 后缀:成分列带相对意义修饰(如 Potassium^serum 变体写法)——按字面全等匹配会漏;解析 ^ 前主部。
  3. 把 SHORTNAME 当词典主名:短名丢失标本/方法信息——词典展示用 LCN/FSN。
  4. 多值列直接 split:部分列逗号/分号多值(如 SYNONYMS)——split 策略要按官方文档,禁止盲拆。

常用派生视图

视图 A(归一候选词典):STATUS=ACTIVE AND SCALE_TYP=Qn
        → 主键 + 六轴 + LCN + UCUM 单位
视图 B(订单优选空间):JOIN 通用订单集
        → 数千码的高频候选空间
视图 C(panel 展开表):PanelsAndForms 展开成员
        → 报表去重规则源

§4.8 答案列表文件(LL/LA)详解

问卷类 LOINC(Surveys 域 12,807 概念)的值域由答案列表文件族管理——LL 码标识「一份答案列表」,LA 码标识「列表内的一个答案选项」。

结构关系

LL 码(如 LL1000-9 = PHQ-9 某题的选项集)
├── LA 码 LA6270-8("Never")
├── LA 码 LA6568-5("Several days")
├── LA 码 LA6569-3("More than half the days")
├── LA 码 LA6570-1("Nearly every day")
└── (每个 LA 码可携带序列号/分值列)

工程要点

要点 说明
LA 码跨列表复用 同一答案(如"Never")可出现在多份 LL——LA 是全局资源
序列与分值 选项顺序/分值(量表计分)在 LL-LA 关系列中,不在 LA 本身
版本演进 LL 内容随版本增删选项(坑点 8)——对账锁版本
与 Ord 刻度联动 Ord 刻度 LOINC 码的合法值即其关联 LL 的选项集
  • 对账姿势:问卷数据合并时持久化 LA 码(非选项文本);跨版本 diff LL 内容;计分逻辑引用「LL 版本 + 序列列」而非硬编码选项顺序。

§5 划分与使用建议

§5.1 官方划分

  • LOINC 无 ML 划分;官方提供优选子集概念:LoincUniversalLabOrdersUsageSheet(通用检验订单集)——跨机构订单场景优先映射到该子集,可显著缩小候选空间。

§5.2 社区惯例划分

  • 按 CLASS 划分:训练于 CHEM/HEM、测试于 MICRO——检验类别外推。
  • 按使用频率划分:映射高频码(top 1,000)→ 长尾码(top 10,000 外)——模拟真实 LIS 长尾。
  • 按版本时间划分:2.82 训练、2.83 测试——检验新码场景的退化评估。
  • 按轴扰动划分:对 FSN 做单轴扰动(换 System/Method)构造困难负例——检验语义敏感度评测。

§5.3 泄漏风险(重点)

  • 同 Part 家族泄漏:同一 Component 的不同 System 码若分属训练/测试,模型靠「成分词」作弊——按 Component 分组划分。
  • panel 成员泄漏:组套成员码与组套名共现于同记录——panel 展开必须整体同侧。
  • 版本码复用泄漏:DEPRECATED 码与其 MAP_TO 目标码分属两侧——同一语义实体的新旧码必须同侧。
  • 翻译回流泄漏:多语言训练语料若与评测集同源翻译,会高估跨语言能力。

§5.4 交叉验证建议

# 检验映射任务:按 Component 分组 + 按CLASS 分层
from sklearn.model_selection import StratifiedGroupKFold
# groups = Component(LP 码);y = CLASS
# 高频类(CHEM)分层保比例;长尾 Component 全体同侧
  • 报告双指标:top 1,000 高频码准确率 + 长尾码准确率——只报总体会掩盖长尾灾难。

§5.5 外部验证建议

  • 跨机构:某院 LIS 映射模型 → 另一院私有目录(目录风格差异鲁棒性)。
  • 跨语言:英语训练 → 中文检验名测试(翻译生态语料)。
  • 跨体裁:LIS 目录名(短语)→ 报告文本(句子)→ 问卷题(问句)。
  • 时间外推:2.82 训练模型在 2.83 新码上的召回(新检验技术如新标志物)。

§5.6 任务配方

配方 1:LIS 目录映射(最主流)

  • 候选生成:私有名称 SPECIALIST 风格归一 + 六轴抽取 + FSN/LCN 字面召回 + RELMA 历史映射先验。
  • 重排:Part 匹配度(六轴逐一对照)+ CLASS 先验 + 单位一致性(UCUM)。
  • 输出:LOINC Num + 置信度 + 未匹配队列(人工评审回写)。

配方 2:化验表型定义执行

  • 以 LOINC 码定义表型条件(如 2160-0 肌酐 → eGFR 计算)——跨库执行同一定义。
  • 校验:定义结果与人工抽样的 Gold 标准对比;报告各库 LOINC 覆盖率。

配方 3:报告文本结构化

  • 检验报告句子 → NER(项目/结果/单位)→ LOINC 归一 + UCUM 单位对账。
  • 评测:项目归一准确率 + 单位违规率双指标。

配方 4:六轴抽取(子任务预训练)

  • 以 Loinc.csv 的 FSN↔LCN 平行对自动构造训练数据(FSN 可解析出六轴真值)。
  • 用途:上游子任务提升映射主任务的语义对齐。

§5.7 映射评测协议详解

LIS 目录映射没有统一榜单,社区以「官方优选集 + 人工抽样」为评审框架——复现论文数字前先对齐四个口径:

口径 变体 影响
候选空间 全量 112,405 vs 通用订单集(数千) 候选小 20 倍,数字高很多
匹配判定 精确码 vs 同 Part 家族即对 宽口径虚高
目录体裁 LIS 私有名 vs 报告文本 vs 问卷题 文本体裁最难
版本 映射目标 LOINC 版本 跨版本码漂移
  • 协议建议:报告「精确码 top-1 / top-3 + 按组件分桶(高频/长尾)+ 未匹配率」——这四元组是跨论文可比的最小集合。
  • 基线配置:字面 TF-IDF → 六轴抽取+规则 → 编码器(SapBERT 类)→ LLM 提示四档至少复现两档。

§5.8 检验表型定义的跨库执行协议

以 LOINC 码写化验表型定义(如「eGFR<60 持续 3 个月」「HbA1c≥6.5% 两次」)是跨库队列表型的标准做法——但跨库执行的结果差异常被低估,协议必须显式化。

表型定义的三层结构

L1 语义层:LOINC Num + 操作符 + 阈值 + 时间窗
          (2160-0 肌酐 → eGFR < 60,间隔≥90 天两次)
L2 映射层:目标库 ITEMID/列 ↔ LOINC 映射表(带评审状态)
L3 数值层:单位换算(µmol/L ↔ mg/dL)+ 参考区间差异处理

跨库差异的三大来源

来源 机制 协议对策
映射覆盖差异 各库 ITEMID→LOINC 覆盖率不同 报告各库映射覆盖率;未覆盖单独列
单位体系差异 同码不同库默认单位不同 数值层强制 UCUM 换算,禁默认单位假设
码粒度差异 库内私有码粒度粗(panel)或细(方法分码) L2 映射声明 panel/成员口径(§7.7)

可复现性检查单

  • [ ] 表型定义文本自带 LOINC 版本号(2.83)。

  • [ ] 各库映射表版本与评审状态随结果发布。

  • [ ] 单位换算公式显式写入定义(而非「常识」)。

  • [ ] eGFR 类派生指标注明计算公式版本(CKD-EPI 2021 等)。

  • [ ] 跨库结果差异报告(不是只报合并结果)。

  • 工程价值:这套协议使「同一表型在 MIMIC-IV 与院内仓执行结果可对照」——LOINC 表型的可移植性正是它相对纯文本定义的核心优势。

§6 AI 就绪指南

§6.0 云端快速启动

# 1) loinc.org 注册免费账号(署名义务见 §3.12)
# 2) 下载 2.83 核心文件族(Loinc.csv 等)
# 3) 在线术语服务(免下载)
curl "https://fhir.loinc.org/CodeSystem/\$lookup?system=http://loinc.org&code=806-0"
# 4) FHIR 检索(ValueSet 校验示例见官方 TS 文档)

§6.1 快速上手(Loinc.csv 解析)

# ============================================================
# Loinc.csv → 检验词典最小构建(ACTIVE、实验室、定量)
# ============================================================
import pandas as pd

df = pd.read_csv("Loinc.csv", dtype=str, low_memory=False)
# 关键:dtype=str 保住「数字-校验位」格式(坑点 1)

lab_qn = df[(df.STATUS == "ACTIVE") &
            (df.CLASS.notna()) &
            (df.SCALE_TYP == "Qn")]
print("定量 ACTIVE 概念:", len(lab_qn))

# 高频订单优选子集
orders = pd.read_csv("LoincUniversalLabOrdersUsageSheet.csv", dtype=str)
print("通用订单集:", orders.LOINC_NUM.nunique())

# Part 特征展开(六轴 → 模型特征)
cols = ["LOINC_NUM","COMPONENT","PROPERTY","TIME_ASPECT",
        "SYSTEM","SCALE_TYP","METHOD_TYP"]
feat = lab_qn[cols].fillna("")   # METHOD 空白=信息性缺失(§4.5)

§6.2 SQL 入库与分析

-- PostgreSQL 入库后:
-- 1) 同一 Component 的所有标本分叉(语义消歧展示)
SELECT LOINC_NUM, SYSTEM, METHOD_TYP, LONG_COMMON_NAME
FROM loinc
WHERE COMPONENT = 'Leukocytes^' AND STATUS = 'ACTIVE'
ORDER BY SYSTEM;   -- 注:COMPONENT 可能带 ^后缀(相对意义修饰)

-- 2) DEPRECATED 码的升级目标分布
SELECT MAP_TO, COUNT(*) FROM loinc
WHERE STATUS = 'DEPRECATED' AND MAP_TO IS NOT NULL
GROUP BY MAP_TO ORDER BY 2 DESC LIMIT 20;

-- 3) 通用订单集与主表联查(订单归一候选空间)
SELECT l.LOINC_NUM, l.LONG_COMMON_NAME, l.CLASS
FROM loinc l
JOIN universal_orders u USING (LOINC_NUM)
WHERE l.STATUS = 'ACTIVE';

§6.3 检验归一管线(与 SPECIALIST/词典协同)

检验名称(私有目录/报告文本)
   → 词法归一(缩写展开:WBC→白细胞计数;单位归一)
   → 六轴抽取(Component/System/Method/Scale 各槽位)
   → 候选生成:FSN/LCN 字面匹配 + Part 检索 + 高频先验
   → 重排:六轴匹配度(加权)+ CLASS 先验 + 单位一致性
   → 输出:LOINC Num + top-k 候选 + 未匹配标记
  • 六轴抽取是精度杠杆:纯字面匹配在「Glucose 尿/血」类标本分叉上必错——System 槽位一锁定,错误即消失。
  • 单位一致性一票否决:候选码 UCUM 单位与输入单位量纲不符时降权至队列尾(量纲是强约束信号)。

§6.4 表格层建模建议

  • 映射预测:Part 特征(六轴)+ 字面相似度 + 类别先验 → 排序学习(LambdaMART 类)。
  • 候选空间压缩:通用订单集优先 + Component 簇内检索——把 112k 候选压到数百。
  • 未匹配学习:把「人工评审为无对应码」的样本单独建模——新检验技术(新标志物)进入申请管道的信号。

§6.5 坑点(Pitfalls)

坑点 1:校验位被 int 化丢弃
LOINC Num 是「数字-校验位」文本(806-0)——存成整数后 0 被丢弃,跨系统对账失败、且与外部码表 join 静默失配。对策:全程 dtype=str/text,入库存文本类型。

坑点 2:DEPRECATED 概念仍在历史数据
历史检验记录引用的码可能已 DEPRECATED;MAP_TO 升级非一对一(一码可拆多目标)——自动升级会错。对策:历史查询带 STATUS 状态双报;升级人工评审。

坑点 3:Panel 当单项目重复计数
CBC(血常规)是 panel 码,其下有白细胞/红细胞等成员码——统计「检验项目数」时把 panel 与成员都计数会虚高。对策:统计前用 PanelsAndForms 展开去重;报表声明「panel 级 or 成员级」口径。

坑点 4:Method 轴被按名称聚合抹掉
「白细胞 manual count」与「automated count」名称相近、临床参考区间不同——按名称聚合后趋势分析混入方法效应。对策:聚合键用 LOINC Num(含 Method 轴差异);报表展示 LCN。

坑点 5:EXAMPLE_UNITS 当验证规则
EXAMPLE_UNITS 是示例不是约束(同一码可有多合法单位)——拿它做硬校验会把合法数据拒之门外。对策:单位校验用 UCUM 量纲兼容判断;EXAMPLE 只做提示。

坑点 6:Scale 轴混用统计
Qn(定量)与 Ord(定性等级)是不同码——把「尿蛋白定性 ±/+」与「尿蛋白定量 mg/dL」混进同一统计列产生类型混乱。对策:管线按 SCALE_TYP 分流处理;Qn 才进数值统计。

坑点 7:Long Common Name 跨版本漂移
LCN 显示名会随版本修订(措辞规范化)——以名称为键做跨版本对账会失配。对策:一切持久化以 LOINC Num 为键;LCN 只做展示。

坑点 8:Answer List 版本锁定
问卷答案列表(LL 码)与答案码(LA 码)跨版本会增删选项——问卷数据合并时值域漂移。对策:问卷对账锁定 LL/LA 版本;答案码持久化 LA 而非显示文本。

§6.6 FHIR 术语服务要点

  • 端点:CodeSystem/$lookup(码详情)、ValueSet/$validate-code(值域校验)、CodeSystem/$subsumes(层级判断)。
  • 版本参数:system=http://loinc.org&version=2.83——生产锁定版本(服务默认可能跟随最新)。
  • 部署选择:官方 fhir.loinc.org(免维护)或自建(HAPI FHIR + 2.83 加载)——内网/离线场景自建。

§6.7 与 LLM 的集成模式

  • 约束解码:LLM 输出 LOINC Num 必须过词典校验(幻觉码是高发事故——编造的码看起来很像真的)。
  • 两段式:LLM 做六轴抽取/名称规范化(语言理解),确定候选空间;编码器/规则做最终码判定(确定性对账)——纯 LLM 直接出码的精确率在长尾上不可用。
  • 定义增强:FSN 六轴结构 + EXAMPLE_UNITS 注入 prompt 帮助 LLM 理解码的精确语义。
  • 评测:报告幻觉率(输出码不在词典的比例)——LOINC 词典小,幻觉校验成本极低,必做。

§6.8 大规模加载的性能实践

  • 单机即可:CSV 数十 MB → PostgreSQL COPY 数秒;加 (LOINC_NUM) 主键 + (COMPONENT)、(CLASS) 索引即覆盖热查询。
  • Part 层展开:LoincPartRelatedCodeMap 展开为(码, 轴, LP 码)长表——六轴检索的物理化。
  • 版本管理:schema 带 version 列或分 schema(loinc_283)——月度节奏下版本切换将更频繁。
  • 文本类型强制:建表语句中 LOINC_NUM/MAP_TO 声明为 TEXT/VARCHAR——数值类型是校验位事故之源(坑点 1)。
  • 模糊检索:pg_trgm 扩展建 GIN 索引(LCN 列)即可支撑归一候选的字面召回——11 万行的规模无需搜索引擎。
  • AnswerList 展开视图:(LL, LA, 序列, 分值)视图物化——问卷对账高频路径。

§6.9 医院 LIS 映射实战(crosswalk 工程)

医院私有检验目录 → LOINC 的标准化是区域互通的入场券,官方 RELMA 提供工作台,AI 团队可在此之上加自动化层。

1. 目录导出:LIS 私有目录(名称+单位+标本+方法备注)+ 历史映射
2. 预处理:缩写展开(WBC/RBC/HGB)、大小写/标点归一、单位 UCUM 化
3. 自动映射:六轴抽取 + 候选生成 + 重排(§6.3 管线)
4. 置信度分层:
   - 高(自动入库):Part 全匹配 + 单位一致 + RELMA 先验一致
   - 中(评审队列):top-1 置信度中位 + 部分轴匹配
   - 低(人工映射):长尾码/新检验项目
5. 评审闭环:检验科专家复核中级队列 → 回写训练对
6. 版本留痕:映射表记录(LOINC 版本, 映射日期, 评审人)
7. 回归测试:每版 LOINC 升级重跑映射回归集

三条红线

  • 计费/报告用映射必须检验科签字——自动映射不得直接入临床报告路径。
  • 一目录多候选时不做静默仲裁——输出候选列表交人工。
  • 历史已映射数据升级(坑点 2)逐条留痕,禁止批量静默 MAP_TO。

§7 评估基准与 DAIMS 评估

§7.1 DAIMS 评估(24 项)

# 维度 评估项 得分 说明
1 可得性 注册后免费下载 5/5 免费注册即得
2 可得性 机器可读许可 5/5 CC BY 4.0 标准化
3 可得性 稳定持久标识 5/5 LOINC Num 30 年稳定
4 结构化 受控结构完备度 5/5 六轴+Part 体系严密
5 结构化 关系型就绪 4/5 CSV 扁平;层级在辅助文件
6 结构化 schema 稳定性 4/5 主列稳定;列扩展有
7 文本 名称/定义文本资产 5/5 FSN/LCN/定义/备注
8 文本 文本规范化程度 5/5 命名学规范化严格
9 版本 历史保留 5/5 DEPRECATED+MAP_TO 机制
10 版本 发布节奏 4/5 节奏演进中(月度化)
11 结果 跨词表映射覆盖 4/5 Ontology 覆盖 top20k 78%
12 结果 映射质量一致性 4/5 Ontology 建模已知边界
13 结果 多语言覆盖 3/5 社区翻译不均
14 质量 归组准确性 5/5 委员会评审制
15 质量 类型标注一致性 5/5 六轴官方标注
16 质量 机构 ID 化 5/5 LP/LA/LOINC 三码体系
17 治理 更新频率 4/5 月度化演进中
18 治理 变更通告 5/5 Release Notes 详尽
19 治理 法规锚定 5/5 USCDI/HIPAA 锚定
20 AI 任务 检验归一适用性 5/5 领域事实标准
21 AI 任务 NLP 特征适用性 5/5 Part 语义特征独一份
22 AI 任务 大模型适配适用性 5/5 词典小、校验廉价
23 伦理 个体隐私风险 5/5 纯术语无患者数据
24 伦理 二次使用许可清晰度 5/5 CC BY 4.0 无歧义

DAIMS 综合:114/120(4.75/5)——许可与治理近乎满分;多语言与节奏过渡期是仅存扣分点。

§7.2 可复现分析路线

  • 复现规模:Loinc.csv STATUS=ACTIVE 行数对照官网 112,405(注意口径:官网总数含全部状态时需调整)。
  • 复现域分布:按 CLASS_TYPE/域列统计对照 69,651/28,786/12,807/1,161。
  • 复现 Ontology 覆盖:Ontology RF2 概念数对照 45,000+;top 20k 覆盖对照 78%。

§7.3 外部评测资源

§7.4 质量审计清单(发布前)

  • [ ] LOINC 版本(2.83)写入产物元数据。
  • [ ] 全管线 LOINC Num 文本类型(校验位保留)验证。
  • [ ] STATUS=ACTIVE 过滤声明;历史数据 DEPRECATED 双报。
  • [ ] panel/成员统计口径声明(PanelsAndForms 展开策略)。
  • [ ] 单位校验采用 UCUM 量纲而非字符串相等。
  • [ ] LLM 输出码幻觉率报告(词典校验)。
  • [ ] Answer List 版本锁定(问卷场景)。
  • [ ] CC BY 4.0 署名模板落位。

§7.5 模型卡要点

卡片项 建议声明内容
LOINC 版本 2.83(必填)
候选空间 全量/通用订单集/CLASS 子集
评测口径 精确码 top-1/top-3 + 分桶
已知偏差 长尾码精度衰减、英语中心
未匹配策略 队列+人工评审机制
许可 CC BY 4.0 署名声明

§7.6 与站内数据集的联合分析建议

联合对象 键 分析价值
snomed-ct LOINC ↔ Ontology SCTID 检验-本体一体化建模
umls LNC 原子 ↔ CUI 跨词表检验语义
LNC 原子 ↔ CUI 跨词表检验语义
mimic-iii / mimic-iv / eicu-crd ITEMI / mimic-iv / 语义
mimic-iii / mimic-iv / eicu-crd ITEMID ↔ LOINC 检验表跨库归一
ITEMID ↔ LOINC 检验表跨库归一
ITEMID ↔ LOINC 检验表跨库归一
clinicaltrials-gov outcomes 测量 ↔ LOINC 试验终点标
omes 测量 ↔ LOINC 试验终点标准化
gossis-1 / hiRID 类 化验列 ↔ LOINC ICU / hiRID 类
open-targets 生物标志物 ↔ LOINC 化验-靶点证据链

§7.7 LOINC Num 与私有码双键治理

医院落地 LOINC 后即进入「私有 ITEMID ↔ LOINC Num」双键时代——治理失当是检验数据仓库事故的主因。

两键特性对照

特性 私有 ITEMID LOINC Num
粒度 院内检验项目(含 LIS 实现) 六轴观察语义
稳定性 LIS 升级会重排 30 年稳定、DEPRECATED 有序退役
语义 含院内流程(计费/组套绑定) 纯观察语义
一对多 一个 ITEMID → 可能多 LOINC(历史变迁) 一 LOINC → 院内多 ITEMID 并存

双键治理五原则

  1. 映射表是资产:ITEMID↔LOINC 映射独立成表带版本与评审留痕——不是 LIS 配置的附产品。
  2. 多对多是常态:禁止 1:1 断言;一个院内项目(如「生化全套」)可能对应多个 LOINC 成员码。
  3. 升级留痕:LIS 换系统时映射表迁移重评——历史 LOINC 不随 LIS 变化而变。
  4. LOINC 版本锁定:映射基于 2.83 生成,LOINC 升级时 diff MAP_TO 与 LCN 变更。
  5. 报表声明粒度:panel 级/成员级双口径报表并行,避免重复计数争议。

§7.8 LOINC Ontology 的使用与边界

LOINC Ontology(loincsnomed.org)把 LOINC 检验内容带进 SNOMED CT 本体框架——但它是「互操作方案」不是「LOINC 的替代品」,使用边界必须清楚。

什么时候用 Ontology

场景 用 Ontology? 理由
SNOMED 环境内表达检验 ✓ RF2 模块直接并入 SNOMED 服务
描述逻辑推理(检验概念分类) ✓ 本体框架的强项
检验订单/报告归一 ✗ 直接用 LOINC Num 更直接
FHIR Observation.code ✗ LOINC 原生码是惯例
跨 LOINC-SNOMED 一体化建模 ✓ 这就是它的使命

已知建模边界(官方 Notes 摘录)

  • panel 与其成员之间无连接——用 Ontology 时组套关系需另行获取(PanelsAndForms)。
  • 名义 LOINC 概念与答案列表之间无连接——问卷值域不随行。
  • supersystem(跨标本聚合类概念)未语义表达。
  • 部分 FSN 存在措辞不一致(官方列为 known issues)——文本处理不要假设 FSN 规范统一。

版本与覆盖现状(v2.82,2026-03)

  • 45,000+ SNOMED 概念(active + discouraged 实验室 LOINC 全集);对齐 SNOMED 国际版 2026-01-01 与 LOINC 2.82。
  • 覆盖:top 100 lab 概念 99 个 / top 2,000 中 1,637 个 / top 20,000 中 15,535 个(78%)——高频检验覆盖近满,长尾仍在补。
  • 版本号规则:自 v2.82 起对齐 LOINC 版本(替代早期独立 1.0/2.x 系列)。

§8 伦理、隐私与合规

  • 无患者数据:纯术语资产,隐私风险为零。
  • CC BY 4.0 全开放:商用/再分发/修改全部允许,署名是唯一义务——词表类资产中合规摩擦最低。
  • 署名规范:产品与模型卡中引用「LOINC(R)」注册商标 + 版本 + Regenstrief 署名;注意 LOINC 是注册商标,商用产品中的商标使用遵循官方指南。
  • 临床边界:映射结果用于临床报告路径前必须经检验科专家确认;自动映射不得绕过专家评审。
  • 禁背书:使用 LOINC 不意味着 Regenstrief 认可衍生产品。

§8.1 署名与商标实操清单

CC BY 4.0 的义务只有「署名」,加上 LOINC 注册商标的规范使用——按本清单落位即可达到可审计水平。

[ ] 词典/数据资产署名
    - 文件头或元数据包含:
      "This material contains content from LOINC(R)
       (http://loinc.org). LOINC is (c) 1995-2026,
       Regenstrief Institute, Inc. and the LOINC Committee,
       and available at no cost under the license at
       https://loinc.org/license/"
    - 版本号随发布记录(2.83)

[ ] 产品/文档署名
    - 模型卡/数据卡声明 LOINC 版本
    - 关于页/致谢区包含上述声明

[ ] 商标使用
    - 首次出现写 "LOINC(R)",此后可 LOINC
    - 不在产品名/公司名中嵌入 LOINC 造成背书暗示
    - 不使用 LOINC logo(除非获得书面授权)

[ ] 修改声明(若裁剪/翻译/派生)
    - 注明 "Based on LOINC(R) 2.83, modified"
    - 翻译词典注明翻译团队与覆盖范围

[ ] 复检节奏
    - 每版 LOINC 升级时更新署名版本号
    - 商标指南变化跟踪官方公告
  • 与 UMLS/SNOMED 对比:LOINC 的尽调成本近乎为零——没有 Level 分层、没有属地 Member License、没有商业源逐项谈判;这一许可优势在多标准集成产品(UMLS+SNOMED+LOINC 三词表齐上)中尤为明显。

§9 版本历史与演进

时间 演进 对 AI 用户的影响
1983 McDonald UPC 类比社论 标准化思想源头
1994 Regenstrief 发布首版(NLM 资助验证) 检验标识标准化开始
2000s HIPAA/HITECH 法遵驱动 从学术标准到合规要求
2020s USCDI/CDISC 收录 全球递交与互操作标配
2022/2025 SNOMED 协定签署/续签 Ontology 互操作路线
2024-08 2.78(30 周年) 216k 用户、近 200 国
2026-02 2.82 Ontology 转向版本对齐
2026-05 节奏演进公告 月度化转型开始
2026-08-19 2.83(本文口径) 112,405 概念

§9.1 未来演进方向

  • 发布节奏月度化:loinc.org/monthly 落地后版本管理从半年轴转为月轴——下游管线需升级版本锁定与回归测试频率。
  • Ontology 深化:top 20k 覆盖 78% 后,剩余长尾的 SNOMED 建模、panel 连接与答案列表连接是官方 Notes 列明的演进空间。
  • LLM 时代定位:检验归一恰好是 LLM 短板(长尾、精确、需版本对账)——LOINC 词典+约束校验的确定性层价值持续上升。

§9.2 使用本条目时的维护提示

  • 规模数字随版本浮动,引用必须带版本号(如 2.83)。
  • 发布节奏处于转型期,跟踪 loinc.org/monthly 公告调整管线。
  • Ontology 版本号自 v2.82 起对齐 LOINC 版本,引用时注明两侧版本。
  • 多语言翻译为社区维护,中文语境引用注明翻译版本与来源。
  • Loinc.csv 列集随版本小幅扩展(新增列多为治理与溯源类),解析器按官方 Readme 校准而非硬编码列位。
  • Ontology 的 known issues(panel 连接/答案列表连接缺失)每次升级复核官方 Notes——修复进度随版本变化。

§10 引用与资源

§10.1 官方资源

资源 链接 说明
LOINC 官网 https://loinc.org/ 总入口
下载页 https://loinc.org/downloads/ 2.83 文件族
发布说明 https://loinc.org/kb/ Release Notes
节奏公告 https://loinc.org/monthly 月度化计划
FHIR TS https://fhir.loinc.org/ 在线术语服务
LOINC Ontology https://loincsnomed.org/ SNOMED 桥(v2.82)
RELMA https://loinc.org/relma/ 映射工作台

§10.2 学术引用

  • McDonald CJ, et al. LOINC, a universal standard for identifying laboratory observations: a 5-year update. Clin Chem. 2003;49(4):624-633.
  • Vreeman DJ, et al. Universal adoption of LOINC: a standardized method for sharing clinical laboratory results. Clin Chem Lab Med. 2018(LOINC 实施方法论综述口径).
  • Regenstrief Institute. LOINC® Version 2.83 Release Notes. 2026-08-19.
  • Regenstrief Institute & SNOMED International. LOINC Ontology Technical Release Notes v2.82. 2026-03.
  • umls:SAB=LNC 的集成源词表——跨词表检验语义经 CUI
  • snomed-ct:LOINC Ontology 的本体侧载体
  • mimic-iii / mimic-iv / eicu-crd:检验表 ITEMID↔LOINC 归一主战场
  • clinicaltrials-gov:试验终点测量的 LOINC 标准化
  • gossis-1:ICU 化验密集型数据集的表型工程
  • open-targets:化验标志物与靶点证据链扩展
  • medmcqa / medqa:医学考试中检验项目的语义语境
  • carmen / radgraph:临床文本结构化范式的同族参照

§10.4 建议引用格式

@misc{loinc_283,
  title        = {LOINC (Logical Observation Identifiers Names and Codes), Version 2.83},
  author       = {{Regenstrief Institute}},
  howpublished = {https://loinc.org/},
  note         = {Released August 19, 2026; 112,405 concepts; CC BY 4.0},
  year         = {2026}
}

§10.5 常见问题 FAQ

Q1:LOINC 和 SNOMED 都能表达检验,用哪个?
A:检验订单/报告归一选 LOINC(六轴直接、词典小、CC BY 4.0);需要检验概念参与全临床本体推理选 SNOMED(或 Ontology 两者兼得)。实践中 FHIR Observation.code 用 LOINC 是默认惯例。

Q2:为什么同一个血检有多个 LOINC 码?
A:六轴任一不同即不同码——标本(血清/血浆/全血)、方法(手工/自动)、时间(时点/24 小时)、刻度(定量/定性)分叉都是临床语义的一部分。这不是冗余而是精确;按名称聚合会抹掉这些差异(坑点 4)。

Q3:我可以把 LOINC 词典打包进商业产品吗?
A:可以——CC BY 4.0 允许商用与再分发,条件是署名(引用 LOINC 版本与 Regenstrief Institute)并遵循注册商标使用指南。这是主流词表中许可摩擦最低的。

Q4:映射到 LOINC 后,旧私有码还要保留吗?
A:要——双键治理(§7.7):私有码是院内 LIS 现实,LOINC 是语义外联。历史数据回溯、院内流程绑定都依赖私有码;映射表带版本与评审留痕才是资产。

Q5:LLM 直接输出 LOINC 码靠谱吗?
A:单独不可靠——长尾码幻觉率高。可靠姿势是两段式:LLM 做语言理解(六轴抽取/规范化),词典+编码器做确定性码判定,最后词典校验幻觉。词典只有 11 万码,校验成本几乎为零,必做。

Q6:LOINC Num 会变吗?跨版本对账怎么做?
A:码本身 30 年稳定(一旦发布永不复用);但个别码会被 DEPRECATED(带 MAP_TO 升级目标),LCN 显示名会修订。跨版本对账以 LOINC Num 为键、diff STATUS/MAP_TO/LCN 三列——这就是全部;比 UMLS 的归组边界漂移简单得多。

Q7:检验结果的正常/异常范围在 LOINC 里吗?
A:不作为全量保证——参考区间随人群/方法/实验室而变,属 LIS/化验单语义而非 LOINC 核心职责。做异常判断请用各实验室自己的参考区间或专业规则库;LOINC 的单位体系(EXAMPLE_UCUM_UNITS)配合 UCUM 是单位层的权威。

Q8:想申请新的 LOINC 码(我们的新标志物没有码)怎么办?
A:官方开放新码申请(loinc.org 的 Requesting new LOINC codes 入口),商业实验室/公卫部门/研究机构均可提交,经 LOINC 委员会评审后随版本发布。AI 管线的「未匹配队列」积累的检验名(§5.6 配方 1)就是申请材料的天然素材。

(全文完;本文共 §0-§10 十一个章节,规模数字以 LOINC 2.83 官方口径为准,版本日期 2026-08-19。)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集