MedDRA 监管活动医学词典 — AI-Ready Wikipedia

27,361 首选术语 · 91,082 低层级术语 · 27 个系统器官分类:全球药物警戒的通用语言

来源 https://www.meddra.org发布时间: 2026-09-20最后更新: 2026-09-25 阅读 32
MedDRA 监管活动医学词典 — AI-Ready Wikipedia

信息速览

数据集名称MedDRA 监管活动医学词典 — AI-Ready Wikipedia
数据类型27,361 PT,91,082 LLT,27 个 SOC,230 个 SMQ,双年发布
规模不适用(术语标准资源;无患者数据)
接入方式https://www.meddra.org
AI 就绪度

MedDRA — 监管活动医学词典 AI-Ready Wikipedia

INFOBOX

项目 内容
全名 Medical Dictionary for Regulatory Activities(监管活动医学词典)
开发治理 ICH 主持开发;MSSO 负责维护/开发/分发;JMO 支持日本
首发 1999 年 3 月(MSSO 首个发布 V2.1)
当前版本 V29.1(2026-09-01 英文 / 09-15 全语言;2026-11-02 全球生效);V30.0 提案公示中
规模(V29.0) 27 SOC / 337 HLGT / 1,740 HLT / 27,361 PT / 91,082 LLT;230 个 SMQ
结构 五层严格层级(SOC > HLGT > HLT > PT > LLT)+ 多轴 SOC 链接 + 编码跨语言不变
发布节奏 每年 2 次:3 月(x.0,可含复杂变更)+ 9 月(x.1)
许可 订阅制:监管机构/学者/医疗机构免费;商业机构按年营业额 7 档滑动收费
应用 ICH E2B(R3) 不良事件传输;FAERS / EudraVigilance / PMDA 编码标准;临床试验安全性报告
语言 28 种语言版本(英语/日语本位 + 25 种翻译维护;丹麦语 2026-03 新增)
官方入口 https://www.meddra.org (ICH 页:https://ich.org/page/meddra)
本库条目 order 479 · record_id 579 · 类别:药物发现与化学 × 公共卫生与流行病学

§0 E-E-A-T 信任声明与免责声明

  • 经验:本条目写作基于 MedDRA 官方发布口径(meddra.org 新闻页 + 官方培训材料 V29.0 中文版)、ICH 官方页、Frontiers in Drug Safety and Regulation 2025 综述(Bousquet/Mozzicato 系作者)与中国食品药品网 2018 年 ICH 接轨报道;所有数量均标注版本与口径。
  • 专业性:药物警戒编码、ICSR 数据处理、SMQ 信号检测的方法学描述遵循 ICH E2A/E2B(R3)/E2D 与 M1 PtC 文档的官方建议。
  • 权威性:MedDRA 由 ICH MedDRA Steering Committee 治理、MSSO 维护;本条目不替代官方 Introductory Guide 与两份 PtC 文档。
  • 可信度:文内数字全部进入文末「口径存照」;订阅价格、语言数量等易变口径均标注时点与来源。
  • 免责:本页为第三方百科解读,与 MSSO/ICH 无隶属关系;MedDRA 名称与数据版权归 ICH 体系所有;使用 MedDRA 编码数据前须签署订阅协议并遵守使用条款。
  • 时效:口径锁定 2026-09-19/20(V29.1 发布周 + v2 修订包事件后);V30.0 变更以 2027-03 发布为准。

§1 数据集概览

§1.0 📌 30 秒速览

  1. 是什么:全球药物警戒的通用语言——报告不良事件时,把「病人说头疼」这种自由文本标准化为可比的编码术语。
  2. 谁在用:FDA(FAERS)、EMA(EudraVigilance)、PMDA、中国 NMPA(2018 ICH 接轨)——全球监管提交的强制编码标准。
  3. 多大:27,361 PT + 91,082 LLT + 27 SOC + 230 SMQ(V29.0 口径)。
  4. 怎么更新:每年 3 月/9 月双发布;x.0 版可动层级、x.1 版以术语增补为主。
  5. 一句话:如果你的研究涉及不良事件、药物警戒信号或监管安全性数据,MedDRA 就是那把必须对齐的尺子——而且它是订阅制,这与本库大多数免费条目不同。

§1.1 摘要

MedDRA(Medical Dictionary for Regulatory Activities,监管活动医学词典)是国际人用药品注册技术协调会(ICH)于 1990 年代末开发的标准化医学术语集,1999 年 3 月由 MSSO 发布首个版本(V2.1)。它诞生的直接动因是「一词多典」的监管乱象:欧洲用 WHO-ART、美国用 COSTART、日本用 J-ART、英国用 HARTS,跨国药企为满足不同监管提交要求要同时维护多套编码——M1 专家工作组把四套词库合并为一套五层术语体系,从此成为全球药物警戒的交换底座。

结构上,MedDRA 是一棵五层严格层级树:27 个系统器官分类(SOC)> 高位组术语(HLGT)> 高位术语(HLT)> 首选术语(PT)> 低位术语(LLT)。PT 是「独特的医学概念」——分析的单位;LLT 是 PT 的同义词、词形变体与口语表达——编码的单位。每个术语有永不复用的数字编码,28 种语言版本共享同一套编码,使「日本报告者用日语编码、德国审评员用德语阅读」成为可能。

规模上,V29.0(2026-03)含 27,361 PT 与 91,082 LLT(相对 V28.1 净增 198 PT/611 LLT),230 个标准化查询组(SMQ)为信号检测提供官方预定义的术语集合。治理上,术语变更由全球用户经 WebCR 提交申请、医学专家评审——V29.0 处理了 1,380 条变更申请(批准 1,042 条)。

应用上,MedDRA 是 ICH E2B(R3) 不良事件个案安全报告(ICSR)电子传输的指定编码标准,FDA FAERS、EMA EudraVigilance、日本 PMDA 数据库均以其为编码轴;临床试验的严重不良事件报告、疫苗不良事件监测(AEFI)、乃至 AI 自动编码(autocoding)管线都以 MedDRA 为目标词库。

许可上,MedDRA 采取「双轨开放」:全球监管机构、学者与医疗机构免费;商业机构按年营业额滑动收费(7 档制)。这与本库大多数条目的「完全免费」不同——订阅门槛本身是它生态语义的一部分(详见 §8)。

§1.2 战略价值

  1. 药物警戒的交换底座:没有 MedDRA,全球安全性数据不可比——E2B(R3) 的数据元素里,「不良事件术语」字段事实上由 MedDRA 独占;FAERS 与 EudraVigilance 的公开数据集都以 MedDRA 编码发布。
  2. 监管合规的硬通货:在中国(2018-05-01 起)、美国、欧盟、日本做注册提交,严重不良事件必须 MedDRA 编码——它不是「可选工具」而是制度性基础设施。
  3. 信号检测的语义层:离散比例报告比(PRR)、经验贝叶斯(EBGM/EBGM 基线的 MGPS)、贝叶斯置信传播网络(BCPNN)等成熟信号检测方法都以 PT 层为计算单位——SMQ 则提供「官方预聚合」的术语组。
  4. AI 编码任务的标准答案集:不良事件自动编码(autocoding)是医疗 NLP 最成熟的落地场景之一——训练标签就是「原始报告术语(verbatim term)→ MedDRA PT/LLT」的历史编码对。
  5. 术语治理的活标本:27 年、1,380 条/版的变更申请流、永不复用的编码、non-current 而非删除的退役机制——MedDRA 展示了「一个术语系统如何在监管刚性下持续演化」,这套治理模式是所有医学词库建设的参照系。

§1.3 同类数据集横向对比

| 维度 | MedDRA | WHO-ART | n}

| 维度 | MedDRA | WHO-ART |

— -(临床发现) COSTART(已退役)
定位 监管不良事件编码 药物警戒(前身)
结构 五层严格层级 + 多轴 SOC 四层
规模 27,361 PT / 91,082 LLT 约 6,000 PT
更新 每年 2 次 不定期(基本冻结)
治理 ICH/MSSO/JMO WHO UMC
语言 28 种 少数
现状 全球监管标准 历史数据可读
  1. 与前身词库的关系:MedDRA 吸收了 WHO-ART/COSTART/J-ART/HARTS 的术语内容——老数据集(如 1990 年代临床试验)需要 COSTART→MedDRA 映射表才能进现代管线。
  2. 与 SNOMED CT 的分工:SNOMED 管「临床文档里发生了什么」(发现/疾病/操作),MedDRA 管「监管报告里怎么写不良事件」——两者有部分映射但语义粒度和目的不同;一份数据集可以同时用两套(临床侧 SNOMED、安全性侧 MedDRA)。
  3. 与 WHO-ART 的现势关系:WHO-ART 仍由乌普萨拉监测中心维护(支持老系统),但新项目一律选 MedDRA——选型时把 WHO-ART 视为「历史兼容层」而非竞品。

§1.4 版本时间轴

年份 版本/事件 意义
1997-07 ICH 正式命名 MedDRA M1 专家工作组整合四套前身词库
1998-05 MedDRA 管理委员会成立 治理结构成型
1998-11 MSSO 成立 ICH 公开竞选的受托维护组织
1999-03 V2.1 发布 首个 MSSO 版本
2003 前后 EMA/MHLW/FDA 相继采用 从欧洲标准走向国际标准
2010s SMQ 体系成熟 信号检测的官方预聚合
2018-05 中国适用 ICH M1/E2B 中国监管数据接轨全球
2020-2022 COVID-19 加速通道 疫苗/诊断术语的快速增补(AEFI 语境)
2026-03 V29.0(复杂变更版) +198 PT/+611 LLT;新 HLT Poliovirus infections;1,380 条变更申请
2026-09 V29.1 + v2 修订包 Rh 抗体 LLT 大小写修正(ISBT 符号消歧);11-02 全球生效

§1.5 应用场景矩阵

场景 用哪一层 关键操作 适配度
个案安全报告(ICSR)编码 LLT(编码)→ PT(上报) verbatim → LLT 选择 ★★★★★
安全性汇总表(CIOSM II 表) PT × SOC 按主 SOC 分组列频次 ★★★★★
信号检测(PRR/MGPS/BCPNN) PT 层计数 SMQ 或 PT 级离散统计 ★★★★★
临床试验 SAE 报告 LLT → PT E2B(R3) 电子传输 ★★★★★
疫苗不良事件监测(AEFI) PT + SMQ 疫苗特异性术语 + CDC 疫苗码联动 ★★★★☆
AI 自动编码(autocoding) verbatim → PT/LLT 监督学习 编码对作训练标签 ★★★★☆
药物流行病学暴露-结局分析 PT/SOC 层结局定义 与 RxNorm/WHODrug 联动 ★★★☆☆
EHR 自由文本安全性挖掘 verbatim 归一 → PT NLP 管线 + 编码词典 ★★★☆☆

§1.6 组件全景

  1. 术语本体:五层层级 + 编码(.asc 文件分发——LLT.asc/PT.asc/HLT.asc/HLGT.asc/SOC.asc + 层级链接文件)。
  2. SMQ(Standardised MedDRA Queries):230 个官方预定义查询组——把「过敏性反应」「肝毒性」等安全性主题的 PT 集合打包,分 narrow(窄域,高查准)与 broad(宽域,高查全)两档;层级型 SMQ 还嵌套子查询。
  3. WBB(Web-Based Browser):订阅方的网页浏览器——五层导航 + 多语言切换 + 编码检索。
  4. MVAT(MedDRA Version Analysis Tool):版本升级影响评估——把「旧版编码数据集」放到新版词库里跑一遍,报告哪些编码 retired/renamed/移动了层级;版本迁移的官方工具。
  5. WebCR:变更申请提交门户——用户发现术语缺口/错误后走官方通道;批准结果进入下一个半年版。
  6. Download API:JSON/ASCII 双格式订阅下载;含 SNOMED/ICD 映射文件。
  7. PtC 文档族:Term Selection: PtC(编码端)+ Data Retrieval and Presentation: PtC(分析端),每年 3 月版更新;另有 Companion Document(2026-09 Release 4.0)覆盖数据质量/用药错误/产品质量等专题。
  8. 培训体系:MSSO 免费培训(英语/中文/法语/德语/韩语/葡萄牙语/俄语/西班牙语/阿拉伯语)+ JMO 日语培训。

§1.7 术语标准的经济学

MedDRA 的商业模式在本库条目里独树一帜,值得单独立传——它解释了为什么一个「公共标准」能维持每年千万级的专业维护:

  1. 谁付费谁受益的闭环:商业机构按年营业额 7 档滑动缴费(2018 年公开口径:年营业额低于 100 万美元的机构约 162 美元/年,大型药企则高数个量级);这笔钱经 ICH MedDRA 管理委员会流向 MSSO——覆盖术语维护、27 种语言翻译、WBB/MVAT 工具开发与全球培训。
  2. 监管机构的零门槛策略:全球监管机构免费——这保证了「编码标准的接受端」毫无阻力;标准的网络效应来自监管强制(E2B 提交必须用 MedDRA),商业机构实际上是「被制度邀请」订阅。
  3. 学者与医疗机构的免费通道:学术研究和医疗机构经 MSSO 免费获取——保证了学术药物警戒研究不会被订阅墙卡死;JMO 对日本医疗机构收名义费用。
  4. 对 AI 团队的含义:免费通道覆盖「学术 + 公共卫生」语境——大学团队的 FAERS 挖掘研究可以合法免费拿到 MedDRA;但商业 AI 产品若要把 MedDRA 嵌入发行物(如 SaaS 自动编码服务),需要商业订阅并核查再分发条款(详见 §8.4)。
  5. 成本结构的对比视角:与 SNOMED CT(成员国会员制)、UMLS(NLM 财政支持免费)相比,MedDRA 的「用户付费」模式让它的翻译速度(28 种语言)与变更响应(1,380 条/版)远超纯公共资金能支撑的规模——这是「术语标准经济学」的第三种解。

§1.8 MedDRA 在监管研究流程中的定位

药物安全性数据流(从报告到信号)
┌─────────────────────────────────────────────────────────────┐
│ 报告源:临床试验 CRF / 自发性报告 / 文献 / 注册登记 / EHR      │
│   → verbatim term(报告者原话,如「打了疫苗后胳膊肿了三天」)   │
│   → 编码(Medical Coder/autocoder):verbatim → MedDRA LLT    │
│   → ICSR(E2B(R3) 个案报告):LLT → PT 上报                   │
│   → 监管数据库(FAERS/EudraVigilance/PMDA/JADER)             │
│   → 信号检测:PT 层离散统计(PRR/MGPS/BCPNN)或 SMQ 聚合       │
│   → 评估决策:说明书修订/风险最小化措施/上市撤回               │
└─────────────────────────────────────────────────────────────┘
  1. 编码是数据进入监管世界的门:verbatim term 不进数据库——所有下游分析看到的都是 MedDRA 编码;编码质量决定整个数据价值链的上限。
  2. LLT 是入口、PT 是出口:编码员选 LLT(保真度),数据库里以 PT 聚合(可比性)——这个「窄进宽出」的语义设计是 MedDRA 数据工程的核心。
  3. SMQ 是官方快捷键:自己做 PT 级检索前,先看 SMQ 有没有现成的主题组——用官方组至少保证了跨研究可比。

§1.9 独特视角:报告语境的术语词典

MedDRA 与本库其他医疗词库有一个本质区别值得单独一章的注意力:它编码的是「报告」,不是「事实」。

  1. 报告语境的哲学:同一个临床事件「服药后转氨酶升高」,在 MedDRA 里可能编为 Hepatic enzyme increased(检查异常)或 Drug-induced liver injury(药物性肝损)——取决于报告者的判断而非客观检测;MedDRA 编码的是「报告者说了什么」的标准化翻译,不是「病人身上发生了什么」的金标准。
  2. 对 AI 的深刻含义:以 MedDRA 编码对训练的自动编码模型学到的是「报告语言 → 监管语言」的映射,不是「症状 → 疾病」的医学推理——把 autocoding 模型当临床诊断模型用是范畴错误(§6.5 坑点 7 的展开)。
  3. 信号的哲学:离散统计学派(Evans 的 PRR 传统)明确把 MedDRA 编码数据视为「报告比率」而非「发生率」——FAERS 里「药 A + PT B」的计数上升可能是真信号、媒体关注、或报告指南变化;MedDRA 的术语学只为这层不确定性提供可比性,不提供因果性。
  4. 为什么这个视角重要:国内团队引进 MedDRA 数据做真实世界研究时最容易踩的坑就是把「报告数」当「病例数」——理解报告语境是使用这套词典的第一课。

§2 医学与科学背景

§2.1 为什么不良事件需要专门词典

  1. 报告语言的天然混乱:同一事件可以是「恶心」「胃不舒服」「想吐」「反胃」「纳差伴恶心」——五份报告可能描述同一个临床现象;没有标准化,全球报告数据无法聚合。
  2. 监管可比性的刚需:审评员要在「这个药肝毒性报告比对照药多吗」这类问题上给出结论——前提是两边的「肝毒性」用同一套术语表达;跨国提交(ICH 三方)让这一需求从区域上升到全球。
  3. 安全性语义的特殊性:不良事件词汇有自己的结构——它们按「系统器官 + 症状/体征/诊断/检查异常」混合组织,而不是按疾病分类学(ICD 的组织逻辑);ICD 不适合编码「轻度头痛」这种没有诊断地位的事件——MedDRA 的 PT 层正是为此设计。
  4. 检查异常的词汇地位:Lab data(转氨酶升高、血小板减少)在不良事件报告里占比巨大——MedDRA 的 Investigations SOC(15,675 个 LLT,V29.0 口径)专门承载这类术语;ICD 对检查异常的表达远弱于此。

§2.2 五层层级的语义设计

层级 全称 语义 数量(V29.0) 示例
SOC System Organ Class 系统器官分类——平行轴 27 Infections and infestations
HLGT High Level Group Term 高位组——HLT 的聚类 337 Viral infectious disorders
HLT High Level Term 高位——PT 的临床聚类 1,740 Influenza viral infections
PT Preferred Term 首选——独特医学概念(分析单位) 27,361 Influenza
LLT Lowest Level Term 低位——同义词/变体(编码单位) 91,082 Flu / Influenza A / Grippe
  1. PT 的本体地位:PT 是 MedDRA 的「原子概念」——一个 PT 表达一个可区分的医学概念(症状、体征、诊断、检查异常、操作并发症等);分析永远在 PT 层做。
  2. LLT 的语言学功能:LLT 承载同义词(flu ↔ influenza)、词形变体(复数/拼写)、口语表达与方言——编码员的目标是找到语义最贴近的 LLT,然后系统自动归并到其父 PT。
  3. HLT/HLGT/SOC 的导航功能:三层上位结构为浏览与分组服务——但注意 HLT 的分组语义是「临床相似」而非「机制相同」(如 HLT 会把「细菌性脑膜炎」类聚在一起,但不提供病原学细分到 ATC 那种程度)。
  4. 示例:一条完整的编码链——报告者写「打过疫苗后手臂红肿痛」→ 编码员选 LLT Vaccination site erythema / Vaccination site swelling / Vaccination site pain(三个 LLT,各归其 PT)→ 分析时在 SOC General disorders and administration site conditions 下聚合成「注射部位反应」主题。

§2.3 SOC 的多轴设计

  1. 平行轴原则:27 个 SOC 是平行的分类视角而非互斥分区——同一个 PT 可以链接多个 SOC(多轴链接,multi-axial links),但只有一个主 SOC(Primary SOC)。
  2. 多轴的意义:PT Cardiac arrest 主轴是 Cardiac disorders,但也在 Nervous system disorders(晕厥类鉴别)和 General disorders 下有链接——按不同 SOC 做汇总表时同一事件会出现在不同主题下;这是特性不是缺陷。
  3. 主 SOC 的分析纪律:避免重复计数的标准做法是「按主 SOC 分组」——E2B 传输与监管汇总表都遵循此约定;自建分析若用全链接会重复计数(§6.5 坑点 4)。
  4. SOC 的分组逻辑混合:27 个 SOC 的划分依据并不统一——有按部位(心脏器官)、按病因(感染及侵染)、按目的(各类手术及医疗操作)、按性质(产品问题、社会环境)——这是历史遗产也是语义陷阱:跨 SOC 的计数比较没有「互斥分区」的含义。

§2.4 SMQ 的信号检测语义

  1. SMQ 是什么:230 个官方维护的 PT 集合,每个对应一个安全性主题(如 Anaphylactic reaction、Drug-induced liver injury、QT prolongation)——由 SMQ 专家工作组按医学证据定期修订(V29.0 无新增 SMQ 但调整了 255 个成员 PT)。
  2. narrow/broad 双域设计:narrow(窄域)收录「高特异性」成员(如「过敏性休克」本体),broad(宽域)额外收录「可能相关」成员(如「荨麻疹」「血管性水肿」)——查准 vs 查全的官方预配置;信号检测建议先 narrow 后 broad 双跑对比。
  3. 层级型 SMQ:部分 SMQ 嵌套子 SMQ(如「严重皮肤反应」下分 Stevens-Johnson syndrome、TEN 等子主题)——层级型查询可以下钻。
  4. 与自由检索的对比:SMQ 的价值是跨研究可比——两个团队都用官方 SMQ Definition and Guidelines 检索「肝毒性」,得到的集合一致;自由拼 PT 列表则各有各的口径(正是 PtC Data Retrieval 文档存在的意义)。

§2.5 与监管数据流的衔接(E2B/FAERS/EudraVigilance)

  1. E2B(R3):ICH 个案安全报告电子传输标准——不良事件/病史字段按 MedDRA 编码传输;E2B 的数据元素规范与 MedDRA 版本要求绑定(监管机构会公布「最低版本」)。
  2. FAERS(FDA):美国不良事件报告系统的公开季度数据集——MedDRA PT 是核心编码轴;公开数据文件里 PT 以编码+名称给出,研究者可做 PRR/MGPS 信号检测。
  3. EudraVigilance(EMA):欧洲的对应体系——EudraVigilance 公开访问报告分析(EVDAS)以 MedDRA 为编码层。
  4. PMDA/JADER(日本):日本 PMDA 数据库与 JADER 公开数据同样以 MedDRA(JMO 日语版)编码。
  5. 中国接轨路径:2018-05-01 起 NMPA 适用 ICH E2A/E2B/M1——中国上市后不良反应报告体系向 MedDRA 编码迁移;本土药物警戒团队从「自建词典」转向 MedDRA 是近年行业主线。

§2.6 与疫苗药物警戒的衔接

  1. AEFI 语境:疫苗接种后的不良事件(Adverse Events Following Immunization)是 MedDRA 的重点覆盖区——COVID-19 期间 MSSO 开设加速通道批量增补疫苗相关术语(Frontiers 2025 论文的官方叙事)。
  2. 疫苗特异性术语模式:Vaccination site X(注射部位反应)/ Vaccine X(疫苗相关事件)/ Programme X(项目性事件如接种差错)——疫苗警戒有一套稳定的术语命名模式。
  3. 与 CDC 疫苗码的关系:疫苗产品编码(CVX)由 RxNorm/CDC 侧承载,MedDRA 承载事件编码——「什么疫苗(RxNorm/CVX)+ 什么事件(MedDRA)」两轴联动的报告结构。
  4. VAERS 的语义结构:美国 VAERS 公开数据的症状字段即 MedDRA PT——做疫苗信号挖掘的数据团队实际操作的是「MedDRA PT × 疫苗产品」的列联表。

§2.7 用药错误与产品质量的语义边界

  1. 用药错误(Medication errors):V29.0 把 100+ 个 LLT 重排进 HLGT Medication errors——「过期药品被调配」「剂量计算错误」这类未造成伤害的错误也进 MedDRA(错误本身即报告对象);这是药物警戒「近失误(near miss)报告文化」的术语支撑。
  2. 产品质量问题(Product issues):SOC Product issues(V29.0 净变更 99 条)承载「药品质量问题」——药片变色、包装缺陷、污染物报告;注意这类术语报告的是产品问题,不必然伴随患者伤害。
  3. 语义边界的实操含义:编码「适应症外使用」「药物无效」与「药物过量」时要按 PtC Term Selection 的语境规则选 PT——同一句 verbatim「病人吃了双倍剂量」可能编为 Overdose(伤害语境)或 Medication error(错误语境)——编码员培训的核心难点之一。
  4. V29.0 的继发恶性肿瘤调整:24 个 LLT(如 Secondary carcinoma)置 non-current——官方立场是「转移灶」与「新原发癌」在术语层必须可区分;这是「术语粒度反映医学安全语义」的近期案例。

§2.8 与中药/传统药物的编码适配

  1. 成分复杂性的语义挑战:中药复方的多成分、药材基原差异、炮制工艺使其不良事件归因比化学药更难——MedDRA 编码「事件」侧没有障碍,但「暴露」侧需要与药物词典(WHODrug 的中成药条目/自建词表)配合。
  2. 国内实践现状:NMPA 不良反应报告体系里的中药注射剂安全性监测使用 MedDRA 事件编码——「双黄连注射剂过敏样反应」这类报告的事件侧以标准 PT 表达,产品侧以药物词典表达。
  3. 术语缺口的申请路径:传统药物特有的事件概念(如「上火」类民俗表达)不适合直接进 MedDRA——但相关的可观察事件(口干、便秘)有标准 PT;术语缺口走 WebCR 变更申请。
  4. 研究含义:中药真实世界安全性研究的数据模型建议「MedDRA(事件)+ WHODrug/RxNorm 扩展(暴露)+ 自建炮制/批次元数据」三段式——单靠任何一套词典都语义不完整。

§2.9 报告偏倚的语义层表达

  1. Weber 效应:上市后前两年报告率自然攀升——不是安全性恶化而是报告渠道激活;用 MedDRA 数据做时间趋势必须把这个效应放进解释框架。
  2. 媒体/监管行动的编码冲击:某药上新闻后其全部 PT 的报告量都会上升(notoriety bias)——信号检测文献的标准提醒;MedDRA 的可比性只解决「术语统一」,不解决「报告行为统一」。
  3. 编码培训的漂移:不同公司/年代的编码员对相似 verbatim 可能选不同 LLT(编码粒度漂移)——跨年份 PT 计数比较时要看 PtC 版本与编码指南变更史;V29.0 的用药错误重排就是一次「官方组织的粒度漂移校正」。
  4. 多语言报告的编码层:日语/中文报告先在本地语言下选 LLT(各语言版 LLT 对齐同一编码)——语言版本的完整性影响编码粒度;28 种语言里主要监管语言的术语覆盖最完整。

§3 数据集规格

§3.1 规格总表

属性 规格
名称 MedDRA(Medical Dictionary for Regulatory Activities)
治理 ICH MedDRA Steering Committee → MSSO(维护/开发/分发)+ JMO(日本)
当前版本 V29.1(2026-09-01 英文 / 09-15 全语言 / 11-02 全球生效)
发布节奏 每年 2 次:3 月 x.0(可含复杂变更)+ 9 月 x.1
层级结构 5 层:SOC(27) > HLGT(337) > HLT(1,740) > PT(27,361) > LLT(91,082)
编码 数字编码,跨语言/版本不变,永不复用
SMQ 230 个标准化查询组(narrow/broad 双域)
语言 28 种语言版本共享编码(丹麦语 2026-03 新增)
文件格式 ASCII(.asc 分层文件)+ JSON(Download API)+ WBB 浏览器
许可 订阅制:监管机构/学者/医疗机构免费;商业 7 档滑动收费
变更治理 WebCR 用户申请 → 专家评审 → 半年度发布(V29.0:1,380 申请/1,042 批准)
规模基线 V28.1:337 HLGT / 1,739 HLT / 27,163 PT / 90,471 LLT / SMQ 记录 97,480

§3.2 版本口径的地图

  1. x.0 vs x.1 的语义:3 月的 x.0 版是「复杂变更版」——层级结构可能动(新 HLT/合并/SOC 调整);9 月的 x.1 版以术语增补与修订为主——但两者对下游都是「新版本」,数据装载逻辑没有豁免。
  2. 全球生效日:9 月版发布后约 6 周才「全球生效」(V29.1:2026-09-01 发布 → 11-02 生效)——这个窗口是给全行业装载与测试的缓冲期;监管提交的版本切换以生效日为准。
  3. 修订包(updated version)机制:V29.1 英文版因 Rh 抗体 LLT 大小写重复问题在发布 16 天后出 v2 修订包——版本引用要精确到 v2;这是「官方补丁」的先例。
  4. 版本报告(Version Report):每个版本随附「相对上一版的完整 diff 文档」——迁移审计的官方依据;MVAT 则提供「我的数据在新版下会怎样」的计算。
  5. 引用纪律:论文/报告引用 MedDRA 必须写「版本号 + 发布月份」——「MedDRA 29.0」与「MedDRA 29.1」是不同的语义快照;仅写「MedDRA」视同引用失败。

§3.3 DAIMS 数据AI就绪度评估

# 维度 指标 评分(1-5) 依据
1 A 可获得 免费获取 3 监管/学术/医疗机构免费;商业订阅;无公开原始下载
2 A 可获得 获取流程 4 订阅审核明确;SSA 自助门户;Download API
3 A 可获得 分发格式 4 ASCII 分层文件 + JSON API;标准 ETL 友好
4 A 可获得 历史版本回溯 5 全历史版本可订阅下载;Version Report 全 diff
5 D 文档 官方文档 5 Introductory Guide + 两份 PtC + Companion Doc 4.0
6 D 文档 变更透明度 5 What’s New + Version Report + 变更申请全程可溯
7 D 文档 培训体系 5 免费多语言培训 + 认证课程
8 I 互操作 编码稳定性 5 编码永不复用;跨语言一致
9 I 互操作 外部映射 4 官方 SNOMED/ICD 映射;WHO-ART/COSTART 历史映射
10 I 互操作 语义层级 4 五层严格层级;多轴 SOC 需主轴纪律
11 M 元数据 术语元数据 4 层级/现势性/主 SOC/多轴链接;部分属性文件外(如变更历史)
12 M 元数据 版本元数据 5 每版 Version Report + MVAT 影响评估
13 S 可持续 治理机制 5 ICH 治理 + 27 年运营 + 用户变更流
14 S 可持续 生态工具 4 WBB/MVAT/WebCR/API 齐备;绑定订阅生态

综合 34/50(4.3/5)——文档与治理满分级、可得性受订阅制拖累;在「术语标准」类别里是治理成熟度的天花板。

§3.4 存储与计算需求

  1. 全量装载:五层 + 链接 + SMQ 的全量 ASCII 包在百 MB 级——关系型库 10 张表内装完;个人工作站完全可行。
  2. 增量订阅:每半年一个新版本包——增量 diff 可经 Version Report 导出;存储需求随历史版本数线性增长(建议保留全部历史版本:时间序列研究的刚需)。
  3. 编码词典内存态:autocoder 场景把 LLT → PT 的映射表加载进内存(91,082 条 LLT + 编码索引)——单机 GB 级即可;大规模报告流水的编码服务则按吞吐量水平扩展。
  4. FAERS 联动:MedDRA 本体 + FAERS 季度公开数据(数 GB/年)联合分析的典型配置是 16GB 内存 + PostgreSQL——学术研究的最小可行栈。

§3.5 获取通道

  1. 订阅入口:meddra.org 注册 → SSA(Self-Service Application)自助申请 → 订阅审核 → 下载权限与 WBB 账号。
  2. 免费通道:全球药监机构(官方函件通道)、学术机构与医疗机构(MSSO 免费订阅;JMO 名义收费)。
  3. 商业滑档:7 档年营业额制——报价需联系 MSSO;母公司年销售额为计费基准(跨国集团按集团口径)。
  4. 间接公开数据:FAERS 季度文件、EudraVigilance 公开报告分析、VAERS 公开数据——均含 MedDRA PT 编码与名称,可不经订阅做 PT 层分析(但拿不到 LLT 层与 SMQ 全集)。
  5. 镜像与再分发的红线:MedDRA 数据不可向未订阅第三方再分发——公开发布的数据集若含 MedDRA 编码需核查许可;学术论文里引用 PT 名称与编码数是允许的常规做法。

§3.6 口径对齐表

数字 口径 A 口径 B 使用建议
PT 数 27,163(V28.1) 27,361(V29.0) 写明版本号
LLT 数 90,471(V28.1) 91,082(V29.0) 写明版本号
HLT 数 1,739(V28.1) 1,740(V29.0 新增 Poliovirus infections) 写明版本号
SOC 数 27(长期稳定) — V29.0 SOC/HLGT 层无变化
SMQ 数 230(总数) 97,480(SMQ 内容记录数,V28.1) 区分「组数」与「成员记录数」
语言数 27(ICH 页:英语+日语+25 翻译) 28(含丹麦语 V29.0 口径) 以发布时点官方新闻为准
变更申请 1,380(处理数) 1,042(批准数) 区分处理/批准/未批/暂缓

§3.7 版本选择纪律

  1. 新项目:直接用当前全球生效版(2026-11-02 后为 V29.1 修订包 v2)——没有理由从旧版开始。
  2. 存量数据迁移:用 MVAT 评估「旧版编码数据 → 新版」的受影响记录数——监管提交场景下版本迁移是强制项(监管机构公布最低版本要求)。
  3. 长周期研究:锁定单一版本跑完全部分析再统一迁移——中途换版本等于在时间序列里埋了分层断点。
  4. FAERS 挖掘:注意 FAERS 季度文件用的 MedDRA 版本与你的订阅版可能不同——跨源对比前先对齐版本(或至少写明差异)。
  5. 版本引用三要素:版本号 + 发布月 + (如适用)修订包次——「MedDRA 29.1 (2026-09, English v2)」是合格写法。

§3.8 数据文件与字段详表

文件/组件 内容 关键字段
soc.asc / hlgt.asc / hlt.asc / pt.asc / llt.asc 五层术语主文件 meddra_code, name, (llt) pt_code, (pt) soc_code
hlgt_hlt.asc / hlt_pt.asc / pt_llt.asc 层级链接 上级码, 下级码
soc_hlgt.asc SOC-HLGT 链接 soc_code, hlgt_code
pt_soc.asc(多轴链接) PT×SOC 全链接(含主轴标志) pt_code, soc_code, primary_flag
intl_ord.asc 编码顺序/排序辅助 编码, 序号
smq_files SMQ 内容 smq_code, smq_name, scope, level, pt_code
Version Report 版本 diff 文档 变更类型, 旧码, 新码, 旧名, 新名
ASCII→JSON(Download API) 同内容的 JSON 形态 同上,程序化消费友好
SNOMED/ICD 映射 外部词库映射文件 meddra_code, 外部编码, 映射类型

§4 数据结构

§4.1 对象模型

MedDRA 数据模型(ASCII 分发文件视角)
├── Term(meddra_code 主键,永不复用)
│   ├── level(SOC/HLGT/HLT/PT/LLT 五选一)
│   ├── name(英文本位名;各语言版同名异文同码)
│   ├── current_status(current / non-current)
│   └── 层级父子链(pt_llt / hlt_pt / hlgt_hlt / soc_hlgt)
├── 多轴链接(pt_soc:一个 PT 多个 SOC + primary_flag)
├── SMQ 内容(smq_code → 成员 PT 集合 + narrow/broad 标志)
├── 语言版本(同一套编码 × 28 种语言字符串)
└── 版本维度(每半年一个语义快照 + Version Report diff)
  1. 模型的核心不变量:编码永不复用 + 层级严格五层 + 跨语言同码——三条不变量决定了 MedDRA 的数据工程全部姿势。
  2. non-current 的语义:术语退役后保留在词库里(历史数据可读)但标记 non-current——新编码不选它;数据装载时要保留 non-current 术语而非过滤删除。
  3. 多轴链接的载体:PT×SOC 的全链接集(含 primary 标志)是独立文件——只装载五层主文件会丢失多轴信息,跨 SOC 分析立即失真。

§4.2 五层文件装载与基本查询

#!/usr/bin/env bash
# MedDRA ASCII 包装载 PostgreSQL(教学骨架;正式装载以官方格式文档为准)
set -euo pipefail
DB="meddra_v291"
psql -d "$DB" <<'SQL'
CREATE TABLE llt (code bigint PRIMARY KEY, pt_code bigint, name text);
CREATE TABLE pt  (code bigint PRIMARY KEY, name text);
CREATE TABLE hlt (code bigint PRIMARY KEY, name text);
CREATE TABLE hlgt(code bigint PRIMARY KEY, name text);
CREATE TABLE soc (code bigint PRIMARY KEY, name text, soc_short_name text);
CREATE TABLE hlt_pt  (hlt_code bigint, pt_code bigint);
CREATE TABLE hlgt_hlt(hlgt_code bigint, hlt_code bigint);
CREATE TABLE soc_hlgt(soc_code bigint, hlgt_code bigint);
CREATE TABLE pt_soc  (pt_code bigint, soc_code bigint, primary_flag char);
\copy llt  FROM 'llt.asc'  WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
\copy pt   FROM 'pt.asc'   WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
\copy soc  FROM 'soc.asc'  WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
\copy pt_soc FROM 'pt_soc.asc' WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
SQL
echo "装载完成——注意官方文件以 \$ 分隔,QUOTE 用占位符绕过"
-- 典型查询 1:从 LLT 名找 PT(编码员词典查询)
SELECT l.name AS llt_name, p.code AS pt_code, p.name AS pt_name
FROM llt l JOIN pt p ON p.code = l.pt_code
WHERE lower(l.name) LIKE '%anaphyla%'
  AND l.code IN (SELECT code FROM llt);  -- 实际装载时加 current 过滤列

-- 典型查询 2:按主 SOC 分组的 PT 频次表(安全性汇总骨架)
SELECT s.name AS primary_soc, count(*) AS pt_count
FROM pt_soc ps JOIN soc s ON s.code = ps.soc_code
WHERE ps.primary_flag = 'Y'
GROUP BY s.name ORDER BY pt_count DESC;

装载要点:(1) 官方 ASCII 文件的分隔符与引号约定以当版 Distribution File Format Document 为准——版本间有过微调,别用两年前的脚本装载新版;(2) non-current 标志在 PT/LLT 文件的现势性字段——装载时保留该列,不要装载时过滤;(3) 全历史版本各自建 schema(v291/v290/v281)——跨版本分析的前提。

§4.3 Python 词典查询与层级遍历

#!/usr/bin/env python3
"""MedDRA 装载后的最小查询层:编码查询/层级上卷/主 SOC 归属。"""
import psycopg

class MedDRALookup:
    def __init__(self, dsn: str):
        self.conn = psycopg.connect(dsn)

    def llt_to_pt(self, llt_name: str) -> list[tuple[int, str]]:
        """编码员工作流:verbatim 近似匹配 LLT → 父 PT。"""
        with self.conn.cursor() as cur:
            cur.execute("""
                SELECT p.code, p.name FROM llt l
                JOIN pt p ON p.code = l.pt_code
                WHERE l.name ILIKE %s""", (f"%{llt_name}%",))
            return cur.fetchall()

    def rollup_to_soc(self, pt_code: int, primary_only: bool = True) -> list[str]:
        """PT → SOC(默认只取主轴——跨 SOC 分析的计数纪律)。"""
        cond = "AND primary_flag = 'Y'" if primary_only else ""
        with self.conn.cursor() as cur:
            cur.execute(f"""
                SELECT s.name FROM pt_soc ps
                JOIN soc s ON s.code = ps.soc_code
                WHERE ps.pt_code = %s {cond}""", (pt_code,))
            return [r[0] for r in cur.fetchall()]

    def smq_members(self, smq_name: str, scope: str = "narrow") -> set[int]:
        """SMQ 成员拉取:信号检测的官方术语集合。"""
        with self.conn.cursor() as cur:
            cur.execute("""
                SELECT member_pt FROM smq
                WHERE smq_name = %s AND scope = %s""", (smq_name, scope))
            return {r[0] for r in cur.fetchall()}

if __name__ == "__main__":
    lk = MedDRALookup("postgres://localhost/meddra_v291")
    print(lk.llt_to_pt("anaphylactic shock"))   # → PT Anaphylactic reaction
    print(lk.rollup_to_soc(10019161))            # 某编码的主 SOC
    print(len(lk.smq_members("Anaphylactic reaction")))

代码要点:(1) primary_only=True 是默认——全链接模式留给「多轴主题分析」这种明确知道自己要什么的场景;(2) SMQ 成员按 scope 拉——narrow 集合是 broad 的子集,信号检测双跑对比;(3) 生产化时加 current 过滤与版本参数——这个最小层没有处理版本维度,管好 schema 名即可。

§4.4 编码流水线:verbatim → LLT/PT

#!/usr/bin/env python3
"""不良事件 autocoder 的教学骨架:词典精确匹配层 + 模糊回退层。
   生产级系统通常还有:缩写展开、拼写纠错、LLM 候选生成 + 规则校验。"""
import re
from dataclasses import dataclass

@dataclass
class CodingResult:
    verbatim: str
    llt_code: int | None
    pt_code: int | None
    confidence: float
    method: str  # exact | normalized | fuzzy | llm

class Autocoder:
    def __init__(self, llt_index: dict[str, tuple[int, int]],
                 norm_rules: list):
        # llt_index: 归一化小写 LLT 名 → (llt_code, pt_code)
        self.llt_index = llt_index
        self.norm_rules = norm_rules  # 如 去除标点/展开缩写/单复数归一

    def _normalize(self, s: str) -> str:
        s = s.lower().strip()
        for pat, rep in self.norm_rules:
            s = re.sub(pat, rep, s)
        return s

    def code(self, verbatim: str) -> CodingResult:
        norm = self._normalize(verbatim)
        if norm in self.llt_index:
            llt, pt = self.llt_index[norm]
            return CodingResult(verbatim, llt, pt, 0.98, "exact")
        # 模糊回退:编辑距离 ≤2 的最佳 LLT(示意)
        best, best_dist = None, 3
        for cand, (llt, pt) in self.llt_index.items():
            d = _edit_distance(norm, cand)
            if d < best_dist:
                best, best_dist = (llt, pt), d
        if best:
            return CodingResult(verbatim, best[0], best[1],
                                0.6 - 0.1 * best_dist, "fuzzy")
        return CodingResult(verbatim, None, None, 0.0, "llm")  # 人工/AI 兜底

def _edit_distance(a: str, b: str) -> int:  # 标准DP,略
    return 0 if a == b else 1

管线要点:(1) 精确/归一化层命中即可信(置信度 >0.9)——覆盖 70-85% 流量;模糊层必须低置信标记并进人工复核队列——autocoder 的质量=「自动命中率 × 错误拦截率」;(2) 词典随版本更新重载——MVAT 评估版本升级对存量编码的影响后重建索引;(3) LLM 候选生成层(近两年主流)输出 top-k LLT 候选 + 依据 PtC 的语境规则校验——生成是容易的,语境正确性校验才是价值所在(见 §7.6)。

§4.5 元数据与可复现指纹

  1. 版本四元组:版本号(29.1)+ 发布月(2026-09)+ 修订包(v2 如适用)+ 语言(英语本位/中文版)——任何 MedDRA 编码数据集的最小元数据。
  2. 装载指纹:ASC 文件 SHA256 + 装载脚本 commit——版本相同但装载错误会让两个「同版」库语义漂移。
  3. SMQ 版本:SMQ 内容随主版本更新(V29.0 调整 255 个成员 PT)——引用 SMQ 分析必须写「SMQ 版本随 MedDRA 29.0」。
  4. 编码对快照:autocoder 训练集是「verbatim → 编码」的历史对——训练集的编码版本分布也要入档(老数据可能是旧版编码后未迁移)。

§4.6 完整性清单

装载/迁移 MedDRA 后的自查序列:

  1. 五层行数与官方 What’s New 的净变更数对账(V29.0 应见 PT 27,361/LLT 91,082)。
  2. 编码唯一性与「永不复用」抽查——同码不得跨层出现(SOC/PT/LLT 编码空间独立但部分历史码有跨层巧合,按官方 ord 文件核对)。
  3. 多轴链接文件装载验证——抽 5 个已知多轴 PT(如 Cardiac arrest)验证 pt_soc 全链接 + primary 标志。
  4. SMQ 成员计数与官方 Introductory Guide for SMQs 附录对账。
  5. non-current 术语在场性——过滤逻辑是否误删历史术语。
  6. 语言版本抽验——中文版抽样 20 个 PT 与 WBB 在线浏览对照。
  7. 层级遍历完整性——每个 LLT 应恰有一个父 PT;孤儿编码检测。

§4.7 数据血缘

MedDRA 血缘(术语从何而来)
临床安全实践/监管需求
  → 用户变更申请(WebCR:新增/修改/合并/退役)
  → MSSO 医学评审(+ 蓝丝带专家/SMQ 工作组)
  → 版本发布(3 月 x.0 / 9 月 x.1,含 What's New + Version Report)
  → 语言版本同步(MSSO 翻译管护 × 28 语言)
  → 订阅分发(ASCII/JSON + WBB/API)
  → 下游装载(监管数据库/EHR 系统/autocoder/研究管线)
  → 反馈(使用问题 → 新一轮变更申请)
  1. 用户驱动的演化:MedDRA 的内容演化由用户变更申请驱动(V29.0 处理 1,380 条)——词典的「生长方向」反映全球药物警戒实践的真实缺口;这是活词库与冻结词库的本质区别。
  2. 评审的医学权威性:变更经 MSSO 医学团队 + ICH M1 PtC 工作组评审——批准率约 75%(1,042/1,380)显示评审不是橡皮图章。
  3. 血缘的工程落点:自建管线的每个 MedDRA 编码字段都应可追溯到「版本 + 装载日期 + 编码方法(人工/自动/混合)」三元组——信号复现争议时这是唯一仲裁依据。

§4.8 与 FAERS 公开数据的联合装载

#!/usr/bin/env python3
"""FAERS 季度公开数据 + MedDRA 本体的联合查询骨架。
   FAERS 的 reac/demo/drug/outc 表经 primaryid 关联,
   pt 字段即 MedDRA PT 名称(公开层无编码,需名称对齐)。"""
import pandas as pd

def load_faers_quarter(dirpath: str) -> pd.DataFrame:
    """装载一个季度 FAERS 并展开 drug/reac 关联。"""
    demo = pd.read_csv(f"{dirpath}/DEMO.TXT", sep="$", engine="python")
    drug = pd.read_csv(f"{dirpath}/DRUG.TXT", sep="$", engine="python")
    reac = pd.read_csv(f"{dirpath}/REAC.TXT", sep="$", engine="python")
    m = (demo.merge(drug[["primaryid", "caseid", "drugname",
                          "role_cod"]], on="primaryid")
              .merge(reac[["primaryid", "pt"]], on="primaryid"))
    return m

def signal_prr(df: pd.DataFrame, drug_pat: str, pt_name: str,
               min_events: int = 3) -> dict:
    """PRR 信号:目标(药,PT) 计数 vs 其余——FAERS 挖掘的经典起点。"""
    d = df[df.drugname.str.contains(drug_pat, case=False, na=False)]
    a = (d.pt.str.upper() == pt_name.upper()).sum()
    b = len(d) - a
    rest = df[~df.drugname.str.contains(drug_pat, case=False, na=False)]
    c = (rest.pt.str.upper() == pt_name.upper()).sum()
    dd = len(rest) - c
    prr = (a / (a + b)) / (c / (c + dd)) if a and c else float("nan")
    return {"a": int(a), "b": int(b), "c": int(c), "d": int(dd),
            "prr": round(prr, 3), "signal": bool(prr >= 2 and a >= min_events)}

if __name__ == "__main__":
    # 注意:FAERS 的 pt 是字符串名——用 MedDRA 当前版名称对齐;
    # 历史季度的 non-current PT 名会成孤儿 → 迁移表兜底。
    print("FAERS PT 名称对齐纪律:季度文件版本 + 当前版名称映射双写")

联合要点:(1) FAERS 公开层只有 PT 名称无编码——名称对齐要处理 non-current 与改名(Version Report 是映射源);(2) PRR 只是信号初筛——narrow SMQ、分层(按报告年份/地区)与临床评估是后续必做步骤,别把初筛当结论;(3) 重复报告(duplicate case)处理是 FAERS 挖掘的前置工序——FDA 的 case 级去重逻辑要复现。

§4.9 中文语言版本的对齐检查

#!/usr/bin/env python3
"""中文版 MedDRA 与英语本位对齐抽验:同码异名同义性检查骨架。
   中文版由 MSSO 管护翻译——同一 meddra_code 在中英文文件中应严格同码。"""
import csv

def load_lang_table(path: str) -> dict[int, str]:
    """装载某语言层的 (code, name) 表(按官方格式文档适配分隔符)。"""
    out = {}
    with open(path, encoding="utf-8") as f:
        for row in csv.reader(f, delimiter="$"):
            out[int(row[0])] = row[1]
    return out

def audit_alignment(en: dict[int, str], zh: dict[int, str]) -> dict:
    missing_en = set(en) - set(zh)     # 英语有而中文缺 → 翻译滞后
    extra_zh = set(zh) - set(en)       # 中文有而英语无 → 装载错位
    return {"en_only": len(missing_en), "zh_only": len(extra_zh),
            "aligned": len(set(en) & set(zh))}

if __name__ == "__main__":
    # 版本对齐前提:两份文件必须同版本同修订包;
    # 历史上中文版翻译滞后英文版数周——对齐审计前先核对语言包发布日。
    print("口径:翻译允许重复(英文不可唯一翻译的术语允许多中文对应)")

中文版要点:(1) 翻译滞后窗口——英文版发布与全语言包发布间隔约两周(V29.1:09-01 英文 / 09-15 全语言)——跨国双语管线要预留窗口;(2) 允许重复翻译——英文 LLT 仅大小写不同时中文译文可重复(Rh 抗体事件正是英文侧自我修正、翻译侧不动的实例);(3) 术语委员会本土化——中文版经过中国药物警戒界的使用反馈修订,纯字面对照英中发现「不一致」时先查官方翻译说明再下结论。

§5 下游分析协议

§5.1 任务×资源速查表

任务 MedDRA 资产 配套资源 输出物
ICSR 个案编码 LLT 词典 + PtC Term Selection WHODrug(药名侧) E2B(R3) 合规报告
安全性汇总表 PT×主 SOC 分组 CIOMS 表模板 表 14/16/18 类汇总
信号检测 PT 计数 + SMQ FAERS/EudraVigilance 数据 PRR/MGPS/BCPNN 信号清单
疫苗安全性监测 疫苗 PT 模式 + SMQ VAERS/JADER 数据 AEFI 信号报告
自体编码(autocoding) LLT/PT 词典 + 编码对 NLP 栈 编码服务/人工复核队列
版本迁移审计 MVAT + Version Report 存量编码数据 迁移影响报告
医学概念映射 SNOMED/ICD 官方映射 OMOP/术语服务器 跨词库互操作层
监管提交 当前生效版 E2B 网关 合规提交包

§5.2 临床试验安全性数据编码协议

  1. 编码时点:SAE 即时编码(24h 内报告链启动)+ 数据库锁定前全量复码——两轮编码的词典版本可以不同,锁定版为准。
  2. 编码员治理:医学编码员(非数据管理员兼职)+ PtC Term Selection 培训 + 双人复核抽样——编码一致性(inter-rater)是质量核心指标。
  3. verbatim 保真:CRF 原话一字不改进 verbatim 字段——编码是「翻译层」,翻译绝不改写原文;否则审计追踪断裂。
  4. 词典版本声明:临床研究报告(CSR)的安全性章节必须写 MedDRA 版本——「coded with MedDRA 29.1」是审评合规项。
  5. synonym 表管理:自建 synonym 表(本地高频表达 → LLT)要版本化并与官方词典变更对账—— synonym 是 autocoding 的第一生产力也是漂移源。

§5.3 信号检测协议(FAERS/EVDAS 语境)

  1. 计算层选择:PT 层离散统计(PRR/ROR/MGPS/BCPNN)为主流——SOC/HLT 层用于综述展示不用来检测(聚合抹平信号)。
  2. SMQ 双跑:目标主题先查官方 SMQ 是否存在——有则 narrow/broad 双跑 + PT 级补充;无则自建 PT 集合并公开成员清单(可复现性)。
  3. 分层与去重:按年份/地区/报告者分层检查信号稳定性;case 级去重(同一病例多份报告)后重算——两个步骤做不做结论可以完全不同。
  4. 报告率 ≠ 发生率:所有结果措辞用「报告比」不用「发生率」——处方量分母缺失(FAERS 无暴露分母)是方法学天花板。
  5. 信号三角验证:统计信号 + 临床个案审读 + 生物学合理性——三缺一不上决策会;MedDRA 在这里只提供第一角的计算基础。

§5.4 成本模型

成本项 学术团队 中型药企 大型 MNC
订阅费 免费(MSSO 学者通道) 中档(营业额滑档) 高档(集团口径)
人力(编码员) 不适用/研究编码 2-5 名专职 编码团队 + 质量体系
autocoder 建设 开源栈 + FAERS 数据 商业/自研 + 订阅 全栈 + 多语言
培训认证 MSSO 免费 年度复训 内部培训体系
版本迁移 MVAT + 脚本 专职工程师周期项目 跨系统治理项目
  1. 隐性成本在迁移不在词典:词典本身成本可控;版本迁移(每年 2 次)触发的下游系统回归测试是大头——迁移自动化是药企药物警戒 IT 的常设能力。
  2. 学术的免费通道是战略资源:大学团队合法免费拿到与 MNC 同一套词典——这在数据要素里少见,做 FAERS/EVDAS 研究的成本门槛极低。
  3. autocoder 的 ROI 算法:人工编码 1 条约 1-3 分钟——日均千条报告的 CRO 每年人力百万级;自动编码命中率 80% 即节省同比例——这是医疗 NLP 在药企最明确的 ROI 场景。

§5.5 失败模式清单

  1. 版本声明缺失:分析没写 MedDRA 版本——审稿人/审计直接退回;修复:版本四元组强制入模板。
  2. LLT 层做分析:把 LLT 计数当 PT 结果——同一概念被同义词重复计数数倍;修复:分析永远上卷到 PT。
  3. 多轴重复计数:按全链接 SOC 分组不按主轴——同一 PT 出现在多个 SOC 汇总里;修复:主 SOC 纪律或明确声明全链接口径。
  4. non-current 误删:装载时过滤退役术语——历史数据读不出来;修复:保留 + 状态列过滤。
  5. SMQ 口径漂移:跨期分析用不同版本的 SMQ——成员变更没进对账;修复:SMQ 版本随主版本锁定。
  6. verbatim 丢失:编码后不存原话——autocoder 训练数据与审计依据双双蒸发;修复:verbatim 字段强制保留。
  7. 报告率当发生率:FAERS 报告数当发病率用——方法学硬伤;修复:措辞与设计双改(处方分母数据另找)。
  8. 语言混码:中文报告直接套英文词典近似匹配——编码粒度与合规性双输;修复:用对应语言版本词典。

§5.6 校准与验证协议

自建编码/分析管线的分级校准协议(L1-L6):

级别 校准内容 方法 通过标准
L1 词典装载 官方 What’s New 对账 + 完整性清单(§4.6) 全项通过
L2 编码一致性 双编码员盲评 200 条 verbatim Cohen κ ≥0.85
L3 autocoder 精度 金标集(人工复核)分域评估 精确层 ≥99%,整体按业务阈值
L4 信号复现 文献已知信号(如某经典 PRR 案例)复现 方向与量级一致
L5 版本迁移 MVAT 结果 vs 手工抽验 100 条 零不一致
L6 跨源对齐 FAERS PT 名 vs 自持编码版 孤儿率 <0.5%
  1. L2 的 κ 值是编码质量的总开关:低于 0.85 先修 PtC 培训与 synonym 表,再谈自动化。
  2. L4 的「已知信号复现」:选 3-5 个监管已确认的历史信号做盲复现——管线是否能从公开数据把它们找出来;这是端到端有效性的直接证据。

§6 实证结果与方法学分析

§6.1 27 年演进的实证观察

  1. 规模曲线:V2.1(1999)约 1.2 万 LLT → V29.0(2026)91,082 LLT——增长主要来自检查异常、操作并发症与用药错误类术语(V29.0 的 SOC 净变更分布:检查 118/损伤中毒 114/操作 97/产品问题 99)。
  2. 变更吞吐:每版处理约 1,000-1,500 条申请、批准约 75%——以 V29.0(1,380/1,042)为代表;这个吞吐量说明「活词库」的更新强度。
  3. COVID-19 压力测试:2020-2022 的疫苗/诊断术语加速增补(Frontiers 2025 官方回顾)证明其治理结构能以远超常规的速度响应公共卫生事件——词汇治理的「应急档位」存在且被验证过。
  4. 粒度持续细化:从早期的粗症状概念向「机制/时序/严重度」细分演进(如药物性肝损的 RUCAM 语境、免疫相关不良事件 irAE 的专门术语群)——词典跟随医学认知细分。

§6.2 编码质量的实证教训

  1. 一致性水平的行业基线:双人编码 κ 值文献区间约 0.7-0.9——差距主要来自「检查异常类」与「用药错误类」的语境判断;这两类是培训的优先靶点。
  2. autocoder 的实证演进:从词典/规则(精确匹配 + synonym)→ 机器学习(SVM/fastText 时代)→ LLM 候选 + 规则校验——命中率逐步提升但「模糊语境的语境正确性」仍是天花板;监督标签(历史编码对)的质量约束了所有模型。
  3. synonym 表是隐形资产:药企内部 synonym 表的质量与 autocoder 命中率强相关——它编码了「本机构医生怎么说」的地方性知识;人员流动时这块资产要交接。
  4. 跨语言编码的一致性:中文/日语版的编码一致性文献相对少——本土团队的编码规范建设不能照搬英语语境 PtC 的例子,需要本地化案例库。

§6.3 方法学三层框架(gsm)

  1. G(Governance 治理层):ICH 治理 → MSSO 执行 → 用户申请流——术语内容的合法性来源;引用 MedDRA 数据时治理层决定「这是谁的官方口径」。
  2. S(Semantics 语义层):五层层级 + 多轴 SOC + SMQ 集合——语义表达力的结构性来源;分析设计时选层(LLT/PT/SMQ)是第一决策。
  3. M(Methodology 方法学层):编码协议 + 信号检测协议 + 版本迁移协议——把词典用到正确的方法框架里;方法学错误(LLT 分析、报告率当发生率)与词典本身无关。
  4. 框架用法:评估任何 MedDRA 相关交付物时依次过三层——「口径是否官方(G)→ 层级是否选对(S)→ 方法是否合规(M)」;三层各有独立的失败面。

§6.4 接力实验设计

药物警戒团队可执行的接力式验证设计(每步产出喂给下一步):

  1. R1 词典完整性:装载当前版 + §4.6 清单全过——产出「可信词典实例」。
  2. R2 编码复现:选公开案例(FAERS 知名信号或已发表论文的编码样本)复现编码——产出「编码方法有效性证据」。
  3. R3 信号复现:盲复现 3 个监管已确认信号——产出「端到端检测能力证据」。
  4. R4 版本迁移演练:MVAT 跑一遍 + 抽验——产出「迁移能力证据」。
  5. R5 交付:方法学段落模板(§7.7)+ 全部 R1-R4 证据入附录——审稿可回放。

§6.5 八个真实坑点

  1. 坑点 1:版本口径缺失——「MedDRA」不写版本 = 引用失败;版本四元组强制。
  2. 坑点 2:LLT 层分析——同义词重复计数;分析永远上卷 PT。
  3. 坑点 3:non-current 误删——退役术语是历史数据的钥匙;保留不过滤。
  4. 坑点 4:多轴重复计数——SOC 汇总必须按主轴或显式声明全链接口径。
  5. 坑点 5:SMQ 版本漂移——成员集合随版本变;SMQ 版本随主版本锁定引用。
  6. 坑点 6:报告率当发生率——FAERS 无分母;措辞与设计双改。
  7. 坑点 7:autocoder 当诊断模型——编码模型学的是「报告语言→监管语言」,不是医学因果;临床诊断是另一个任务。
  8. 坑点 8:语言混码——中文 verbatim 套英文词典近匹配;用中文版词典编码中文报告。

§6.6 审稿人自查清单

  1. MedDRA 版本(+发布月+修订包)是否声明?——未声明退回。
  2. 分析层是否 PT/SMQ?LLT 计数直接退回。
  3. SOC 分组是否主轴口径?全链接口径是否显式声明?
  4. SMQ 引用是否带版本?自建 PT 集合是否公开成员清单?
  5. FAERS 研究是否做了 case 去重与分层敏感性分析?
  6. 报告率措辞是否全文一致(「报告」「报告比」而非「发生率」)?
  7. autocoder 是否报告金标集精度与人工复核比例?
  8. 时间跨度分析是否做版本迁移审计(MVAT 证据)?

§6.7 版本治理的方法学含义

  1. 半年度断层的处理:跨越版本切换的纵向研究在切换点做敏感性分析——「切换前后各跑一遍」是最简单的稳健性检验。
  2. x.0 复杂变更版的特殊警惕:层级变更(如 V29.0 新 HLT)会让按 HLT 分组的历史对比失真——纵向 HLT 分析只在 x.1 版序列内做,或全序列迁移到最新版后重算。
  3. Version Report 的二次利用:diff 文档不仅是迁移工具,也是「术语演化研究」的一手数据——术语增补的速率与方向本身就是药物警戒学的研究对象。
  4. 修订包事件的方法学记忆:V29.1 v2(Rh 抗体 LLT 大小写)说明「发布即冻结」不成立——版本引用精确到修订包,装载脚本要对 zip 文件名校验。

§6.8 与国际药械监管数据源的对齐张力

  1. FAERS vs EudraVigilance 的报告文化差:同一药物在美欧的报告谱不同(报告制度/激励差异)——跨源信号对比是「报告行为比较」不是「安全性比较」。
  2. 日本 JMO 的本地化深度:日语版不只翻译还承载本地报告惯例(J-ART 遗产)——日本数据出站到全球分析时的编码习惯差异要知晓。
  3. 中国的接轨进程:2018 起适用 M1/E2B——本土报告数据向 MedDRA 迁移的深度逐年推进;用中国公开数据做全球对比时注意接轨时点对数据形态的影响。
  4. 工程含义:跨国安全性数据湖的 MedDRA 维度要存「版本 + 语言 + 报告源」三元组——单维度对齐必然在某个跨源 join 时露馅。

§6.9 术语统计的解读纪律

  1. 规模数字三问:见到「MedDRA 有 X 个术语」先问——哪个层(PT/LLT)?哪个版本(28.1/29.0/29.1)?是否含 non-current?三问齐答才算有效口径(PT 27,361/LLT 91,082 都是 V29.0 current 口径)。
  2. SMQ 的两种计数:230 个(组数)vs 97,480 条(内容记录数,V28.1 口径)——写「SMQ 覆盖近十万术语」是两个口径的混淆;组数与成员记录数分开表述。
  3. 增长归因的克制:LLT 年增长数千条不等于「医学概念增长」——很大比例是同义词/词形变体与语言适配;用 PT 净增(+198)讲概念增长更诚实。
  4. 语言数的时点性:27 vs 28 的差异源于官方页更新滞后于发布新闻——引用时标注「截至 V29.0 发布(2026-03,含丹麦语)」。

§7 AI 就绪指南与应用场景

§7.1 MedDRA 在医疗 AI 中的四种喂法

  1. 喂法 1:监督标签——历史编码对(verbatim → PT/LLT)做 autocoder 训练集;质量由历史编码员一致性决定。
  2. 喂法 2:检索词典——报告语义检索的规范化目标(把报告聚到 PT/SMQ 主题);RAG 场景的 metadata 层。
  3. 喂法 3:特征工程层——FAERS/EHR 事件维度按 PT/SOC/SMQ 编码进模型特征;层级上卷做特征消融。
  4. 喂法 4:生成校验层——LLM 生成的安全性叙述用 MedDRA 编码一致性做自动校验(生成的事件是否可编码、编码是否与文本一致)。
  5. 四喂法与坑点对应:喂法 1 踩坑 8(语言混码);喂法 2 踩坑 5(SMQ 版本);喂法 3 踩坑 4(多轴重复);喂法 4 踩坑 7(语境正确性)——建模前对号。

§7.2 autocoder 管线实操配方

端到端配方(报告流水 → 编码流水)
┌────────────────────────────────────────────────────┐
│ 1. 预处理:verbatim 抽取(报告字段/叙述切分)          │
│ 2. 归一化:小写/去标点/缩写展开/synonym 表替换        │
│ 3. 词典精确层:归一化 LLT 索引直查(置信 0.95+)      │
│ 4. 模糊层:编辑距离/向量召回 top-k 候选(0.5-0.9)    │
│ 5. LLM 层:候选重排 + PtC 语境规则校验(0.3-0.8)     │
│ 6. 兜底:低置信进人工队列(阈值按业务定,常见 0.8)    │
│ 7. 回流:人工结果进 synonym 表/训练集(月度闭环)      │
└────────────────────────────────────────────────────┘
  1. 阈值的经济性:自动放行阈值每提高 0.05,人工队列多 5-10% 流量——阈值是业务决策不是技术参数;按「错误编码的成本」反推。
  2. synonym 表的月度闭环:人工兜底的产出回流成 synonym——管线每月都在变好;没有闭环的 autocoder 六个月后就开始落后。
  3. 版本重载:半年度新版本发布 → MVAT 评估存量 → 词典索引重载 → 金标回归测试——固定到发布日历上(3 月/9 月各一次)。

§7.3 模型选型与迁移决策

  1. 词典精确层是底线资产:任何 autocoder 的第一层永远是词典+归一化——命中率 70-85%、精度 99%+、零维护成本;深度模型是增量不是替代。
  2. 向量召回的选择:通用句子向量(多语)对医学报告够用但编码语境(轻度/中度、检查值)弱——领域微调(用历史编码对对比学习)可显著提升 top-k 召回。
  3. LLM 的正确位置:候选重排与语境校验(「这个 verbatim 该编症状还是用药错误」)——生成位置上是浪费(候选集合有限,检索即可);校验位置上是杠杆(PtC 规则的语义执行)。
  4. 多语言策略:本地语言版词典 + 本地语报告——跨语言迁移(英文模型+翻译)是降级方案;翻译丢失的口语细节正是 LLT 层的核心信息。

§7.4 公平性:术语覆盖的边缘地带

  1. 罕见病术语的密度差:常见病 PT 网络密(HLGT/HLT 分层丰富),罕见病术语多为「孤 PT」——信号检测在罕见病域的聚合支撑弱,分层分析要显式处理。
  2. 非英语报告的粒度损耗:28 种语言里小语种版本的 LLT 覆盖弱于英语本位——同一临床事件在小语种报告里可能被迫编到更粗的 LLT;跨语言比较时这是系统性偏倚源。
  3. 民俗/表达差异:「上火」「着凉」类民俗病因表达无对应 PT——编码员被迫映射到最近似标准术语,表达信息在编码层丢失;本土数据挖掘要回读 verbatim 层。
  4. 检查类术语的数值盲区:MedDRA PT 表达「转氨酶升高」但不表达「升高到多少」——严重度信息在编码层不保留(在 E2B 其他字段);只吃 PT 特征的模型会丢失剂量-反应关系。

§7.5 任务×资源速查表

AI 任务 输入 MedDRA 资产 评测指标
自动编码(分类) verbatim LLT/PT 词典 + 历史编码对 top-1 精度 / κ / 人工复核率
报告去重(聚类) 多源同例报告 PT/SOC 特征 配对 F1
信号初筛(排序) FAERS 计数表 SMQ 集合 + PT 层级 已知信号召回
叙述生成校验 LLM 安全叙述 编码一致性校验 编码-文本一致率
事件时序抽取 病程叙述 PT 词典(事件触发词) 事件级 F1
多语编码 中文/日文报告 本地语言版词典 各语言分域精度

§7.6 端到端案例:疫苗 AEFI 信号监测管线

  1. 目标:用 VAERS 公开数据 + MedDRA PT 对某类疫苗的不良事件谱做季度监测。
  2. 数据:VAERS 公开 CSV(症状字段即 MedDRA PT 名)+ 疫苗产品字段(CVX 码)。
  3. 步骤:(a) PT 名对齐当前版词典(non-current 迁移表兜底)→ (b) 按疫苗×PT 建列联表 → © narrow SMQ 主题聚合(如 Anaphylactic reaction)→ (d) 分层 PRR(按年份/性别/年龄组)→ (e) 信号清单进临床审读。
  4. 坑点前置:去重(duplicate case)在 (b) 前;报告率措辞全文「报告比」;版本声明 VAERS 数据月 + MedDRA 词典版。
  5. 产出:季度信号报告(方法学段落用 §7.7 模板)——全部中间表可回放。

§7.7 报告模板:方法学段落骨架

不良事件数据分析方法学段落(可复用骨架):
「不良事件以 MedDRA 版本 X.Y(年-月,修订包 vN 如适用)编码。
分析在首选术语(PT)层进行,SOC 分组采用主系统器官分类口径。
信号初筛采用 [PRR/ROR/MGPS],计数单位为报告例次;
FAERS 数据覆盖 [季度区间],已按 FDA case 级去重逻辑处理重复报告。
检索采用官方标准化 MedDRA 查询(SMQ)「[主题]」(narrow/broad,
随 MedDRA X.Y 版本);自建检索集合的成员术语清单见附录 A。
所有结果表述为报告比而非发生率,处方分母数据不可得。
版本迁移经 MVAT 工具评估,受影响记录及处理见附录 B。」
  1. 骨架的六要素:版本 / 层级 / 统计口径 / 数据源与去重 / SMQ 与成员清单 / 分母限制声明——少一个要素即审稿风险点。
  2. 本地化建议:中文研究在此基础上补「编码语言版本(中文版词典)」与「编码员一致性(κ)」两项——国内审稿环境对编码质量的关注在上升。

§7.8 成本与排期模板

阶段 内容 学术团队 企业团队
W1-2 订阅 + 词典装载 + §4.6 完整性 1 人 1-2 人
W3-4 金标集构建 + 编码一致性(L2) 2 人 编码组
W5-8 autocoder 建设与校准(L3) 1-2 人 NLP 组 + 编码组
W9-10 信号检测管线 + L4 复现 1 人 数据科学组
W11 版本迁移演练(L5) 0.5 人 IT 组
常设 半年度版本日历 + 月度 synonym 闭环 兼职 常设岗位

§7.9 消融案例:编码策略对信号检测的影响

  1. 设定:同一批 FAERS 数据,四种编码策略跑同一信号检测——A 直接用原始 PT 名;B 版本迁移后 current PT;C B + SMQ 聚合;D C + 主 SOC 分层。
  2. 典型结果模式:A 的孤儿 PT 造成漏计数(低估信号);B 修复对齐后信号量级恢复;C 的 SMQ 聚合把稀疏 PT 的信号聚合出来(窄域新信号出现);D 分层暴露「信号由某亚组驱动」——四步的信息增益逐级递减但定性结论逐级变准。
  3. 教训:编码策略不是「预处理细节」而是结果的决定性变量——发表时把策略(A-D 选型)写进方法学是可复现性的必要条件。
  4. 与坑点的映射:A 即坑点 3(non-current 误删的变体);C 即坑点 5 的正面用法;D 即坑点 4 的纪律执行——消融矩阵就是坑点清单的实验化。

§8 伦理、许可与合规

§8.1 许可与义务结构

  1. 订阅分层:监管机构免费(全球)/ 学者与医疗机构免费(MSSO)/ 商业 7 档滑动收费(年营业额基准)/ JMO 名义收费(日本医疗机构)。
  2. 费用流向:订阅费经 ICH MedDRA 管理委员会收取、用于 MSSO 的词典开发维护(中国药学会语境的官方解读)。
  3. 使用边界:订阅数据不得向未订阅第三方再分发;嵌入产品(SaaS/软件发行物)的用例需核查许可条款——「内部分析」与「对外交付」的边界在签约时明确。
  4. 公开数据的例外:FAERS/EudraVigilance/VAERS 公开文件中的 PT 名称与编码属于监管机构发布物——学术引用惯例允许,但整库再分发仍受各自监管机构的许可约束。

§8.2 引用与致谢模板

论文/报告引用模板:
「本研究使用 MedDRA® 版本 29.1(2026 年 9 月英文修订版 v2),
由 ICH 授权的 MedDRA MSSO 维护发布。
[如适用] FAERS 数据来自 FDA 公开发布(季度:YYYYQ1-YYYYQ4),
不良事件以 MedDRA 首选术语(PT)编码。
MedDRA® 为 ICH 注册商标;本研究的解读不代表 ICH/MSSO 立场。」
  1. 商标纪律:MedDRA® 是注册商标——产品名/公司名将其作为能力描述时遵循商标使用规范(不暗示官方背书)。
  2. 版本要素:引用含版本号+发布月+修订包——与 §3.7 纪律一致。
  3. 免责对称:声明「不代表官方立场」保护双方——学术惯例也是合规礼貌。

§8.3 国内合规路径

  1. 监管语境:中国自 2018-05-01 适用 ICH E2A/E2B/M1——本土药品上市许可持有人(MAH)的不良反应报告向 MedDRA 编码与 E2B 传输迁移。
  2. 订阅路径:国内企业经 meddra.org 直接订阅(按母公司年销售额滑档);国内监管机构(NMPA 体系)走监管免费通道。
  3. 数据出境敏感场景:跨国药企把中国临床安全性数据出境至全球安全数据库(MedDRA 编码后)——数据出境合规(个人信息保护/人类遗传资源管理)与药物警戒报告义务的双轨合规,安全数据编码本身不解决出境问题。
  4. 本土词典的过渡共存:部分本土体系仍有自建词典/WHO-ART 遗产——双词典并行期的映射表要版本化,最终向 MedDRA 收敛是行业方向。

§8.4 商业使用边界

  1. 内部研究/内部报告:商业订阅覆盖——药物警戒部门日常使用、监管提交、内部信号报告均属订阅内场景。
  2. 对外交付物:给客户/合作方的报告里含 MedDRA 编码数据——交付物标注词典版本即可(引用权);但把词典数据本体(编码表/层级文件)交付给未订阅方属于再分发——需要对方自行订阅。
  3. AI 产品嵌入:autocoder SaaS 把 MedDRA 词典嵌入服务——典型商业许可场景,签约时明确「服务输出(编码结果)」与「词典本体暴露」的边界;输出编码结果(RxCUI 式的 MedDRA 码)给客户通常允许,暴露原始词典文件通常不允许。
  4. 公开数据产品的红线:基于 FAERS 的公开数据产品再分发 FAERS 文件本身 + 附加 MedDRA 词典——词典部分仍是订阅内容;产品设计时把「监管公开数据」与「订阅词典」分层管理。

§8.5 合规台账最小模板

台账项 内容示例 更新频率
订阅信息 订阅主体/档位/有效期/SSA 账号 年度
词典版本 当前生产版本/历史版本清单/修订包 半年度
装载指纹 各环境 ASC SHA256/装载脚本 commit 每次装载
数据用例 内部分析/监管提交/对外交付清单 按项目
再分发核查 交付物词典暴露评估记录 按交付
版本迁移 MVAT 报告/迁移验证记录 半年度
编码质量 κ 复评/autocoder 金标精度 季度

§8.6 术语治理的架构语义

  1. 治理链的完整性:ICH Steering Committee(方向)→ MSSO(执行)→ JMO(日本)→ 用户组(反馈)→ WebCR(入口)——每一环有明确职责,术语变更全程可溯;这是公共医学词库治理的黄金模板。
  2. PtC 的「准司法解释」地位:两份 PtC 文档不是词典本体但决定词典的正确用法——理解 MedDRA 必须同时读 PtC(编码端 Term Selection + 分析端 Data Retrieval);只读词库不读 PtC 的团队必然踩坑点 2-4。
  3. 变更申请的民主性与权威性的平衡:任何用户可申请(WebCR),但批准权在医学专家——V29.0 的 75% 批准率显示这个阀门工作正常;对比纯自顶向下(无用户通道)或纯民主(无医学门槛)的词库治理,MedDRA 的混合模式是少数被验证可持续的。
  4. 对国内词库建设的启示:编码永不复用 + non-current 而非删除 + 版本 diff 文档 + 用户变更通道——四件套成本不高而价值极大;自建医学词典的团队可以直接抄这套治理骨架。

§9 谱系与生态

§9.1 医学监管术语时间线

年份 事件 意义
1960s-80s WHO-ART/COSTART/J-ART 各自发展 区域监管词库时代
1997-07 ICH 命名 MedDRA 统一化启动
1998-11 MSSO 成立 治理与维护实体就位
1999-03 V2.1 首发 五层结构确立
2003 前后 EMA/MHLW/FDA 采用 国际标准地位
2010s SMQ 体系成熟 信号检测官方化
2017 M1 PtC 范围扩展(Companion Doc) 指导文档体系加深
2018-05 中国适用 M1/E2B 全球最大医药市场接轨
2020-22 COVID 加速通道 公共卫生应急能力验证
2026-03 V29.0 复杂变更 +198 PT/+611 LLT;HLT 层调整
2026-09 V29.1 + v2 修订包 Rh 抗体消歧;28 语言同步

§9.2 术语表

  1. ICSR:Individual Case Safety Report——个案安全报告,E2B 传输的单位。
  2. PT(Preferred Term):首选术语——独特医学概念,分析单位。
  3. LLT(Lowest Level Term):低位术语——编码单位,PT 的同义词/变体。
  4. SOC(System Organ Class):系统器官分类——27 个平行轴。
  5. 主 SOC(Primary SOC):PT 的主归属轴——汇总表防重复计数的口径。
  6. SMQ(Standardised MedDRA Query):标准化查询组——官方预定义安全性主题 PT 集合,narrow/broad 双域。
  7. verbatim term:报告者原话——编码输入,必须保真存档。
  8. MSSO:MedDRA 维护与支持服务组织——ICH 授权的执行机构。
  9. JMO:日本维护组织——日语版与本地支持。
  10. WBB:Web-Based Browser——订阅方网页浏览器。
  11. MVAT:版本分析工具——版本升级影响评估。
  12. WebCR:变更申请门户——用户驱动的词库演化入口。
  13. non-current:现势性标志——退役术语保留不删、新编码不选。
  14. multi-axial link:多轴链接——PT 跨 SOC 的非主轴链接。
  15. AEFI:免疫接种后不良事件——疫苗警戒语境。
  16. E2B(R3):ICH 个案安全报告电子传输标准——MedDRA 的传输载体。

§9.3 资源选型决策树

需要编码不良事件吗?
├── 是 → 监管提交/临床试验? → MedDRA(唯一正解,订阅)
│        └── 预算受限学术研究? → MSSO 学者免费通道
├── 否,做信号挖掘 → 有订阅? → 直接 SMQ + PT 层
│        └── 无订阅? → FAERS/EudraVigilance/VAERS 公开 PT 层
├── 需要编码药物名 → WHODrug(MedDRA 不管药物)
├── 需要编码临床文档细节 → SNOMED CT(MedDRA 不管文档语义)
└── 需要编码疾病诊断分类 → ICD-10/11(统计分类语义)
  1. 决策树第一问是「要不要给监管看」:监管语境只有 MedDRA;纯研究语境才有词库选择自由。
  2. 词典分工的清晰边界:事件(MedDRA)/ 药物(WHODrug/RxNorm)/ 临床细节(SNOMED)/ 统计分类(ICD)——跨词典映射存在但互不替代。

§9.4 与本库其他条目的关系

关联条目 关系 典型联合场景
RxNorm 药物编码 × 事件编码双轴 FAERS 挖掘的药物-事件列联表
MIMIC-IV-ED EHR 叙述 × 安全性编码 急诊主诉的 autocoder 训练对
TCGA 结局定义 × 术语层 肿瘤免疫治疗 irAE 分析
DrugBank 药物知识 × 事件术语 作用机制-不良事件关联研究
SRA 组学数据 × 安全性表型 疫苗免疫反应研究的数据链

§9.5 组合使用建议

  1. 药物警戒最小组合:MedDRA(事件)+ WHODrug 或 RxNorm(暴露)+ FAERS/EudraVigilance(数据)——三件套覆盖 90% 上市后安全性研究。
  2. EHR 安全性挖掘组合:MIMIC-IV-ED 叙述 + autocoder(§7.2 配方)+ MedDRA 词典——把自由文本临床数据接入监管语义层。
  3. 疫苗研究组合:VAERS/JADER + 疫苗 SMQ + SRA 免疫测序(机制侧)——报告层与机制层的双通道。
  4. 跨国数据湖组合:MedDRA 多语言版 + 版本化 schema(§4.2)+ 语言对齐审计(§4.9)——多国报告统一入库的工程底座。

§9.6 术语基础设施的生态角色

  1. 监管层的语义宪法:MedDRA 是药物警戒领域的「强制性共同语言」——其地位由监管制度保障而非技术优越性;理解这一点决定了对它的工程态度(合规优先于优雅)。
  2. 词典生态的锚点:WHODrug/SNOMED/ICD 与 MedDRA 的官方映射使其成为映射枢纽——自建词库接入监管生态的第一步是「向 MedDRA 映射」。
  3. AI 数据要素的特殊性:历史编码对(verbatim→编码)是 MedDRA 生态沉淀的「影子数据集」——订阅方积累的编码对是训练资产,但词典本体不是;资产边界在 §8.4 的框架内。
  4. 公共卫生的应急基建:COVID-19 验证了它能以周级响应新现象(新综合征术语)——「应急档位」的存在让 MedDRA 成为全球公共卫生安全网的组成部分。

§9.7 术语标准家族的光谱定位

维度 MedDRA RxNorm HGNC SNOMED CT
对象 不良事件(报告语境) 临床药物 人类基因 全临床语义
体量 27,361 PT / 91,082 LLT 数万概念 4.4 万符号 数十万概念
许可 订阅(多轨免费) UMLS 免费+限制 完全无限制 成员国/许可制
节奏 半年度 月度 月度 双年发布
核心机制 五层层级+多轴+SMQ 成分×强度×剂型代数 稳定 ID+符号 多轴概念图
  1. 家族共性:稳定标识 + 生命周期管理 + 多源映射——与 RxNorm/HGNC 的三件套完全同构;词典工程在跨域上是同一门手艺。
  2. MedDRA 的独特处:它是唯一「报告语境」的词典——其余词典编码客观概念,MedDRA 编码主观报告;这个哲学差异决定其全部特殊性(§1.9)。

§9.8 MedDRA 生态的圈层地图

圈层 组件 角色 依赖关系
核心 五层术语 + 编码 + 版本流 语义本体 —(本体)
官方工具圈 WBB/MVAT/WebCR/Download API/PtC 文档 消费与治理 直接绑定核心发布
数据圈 FAERS/EudraVigilance/VAERS/JADER/临床试验 DB 语义承载 以 MedDRA 为编码轴
集成圈 E2B 网关/OMOP 映射/SNOMED/ICD 映射/WHODrug 联动 跨词库互操作 映射层
应用圈 autocoder/信号检测系统/安全数据库/BI 语义消费 经数据圈或集成圈
  1. 数据圈的公共入口:FAERS 是生态里最大的免费数据面——无订阅团队的 MedDRA 实战通常从 FAERS 开始(PT 层)。
  2. 圈层穿越的代价:应用圈直连核心(自建词典装载)灵活但承担全部版本治理;经集成圈(OMOP 词汇包等)省治理但多一层版本对齐——与 RxNorm 条目的圈层分析同构,结论也同构:没有免费选项,只有显式选择的代价。

§10 资源导航与 FAQ

§10.1 官方资源导航

资源 入口 用途
MedDRA 官网 https://www.meddra.org 订阅/新闻/文档/培训
ICH MedDRA 页 https://ich.org/page/meddra 治理结构与全景介绍
SSA 自助门户 ssa.meddra.org 订阅申请与凭证自助
WBB 浏览器 订阅内 术语在线浏览(28 语言)
MVAT 订阅内 版本影响评估
WebCR 订阅内 变更申请提交
Introductory Guide 官网文档区 入门必读
PtC Term Selection / Data Retrieval 官网文档区(3 月版更新) 编码端/分析端规范
SMQ Introductory Guide 官网文档区 信号检测查询规范
MSSO 培训 官网培训区(多语言免费) 团队能力建设

上手路径建议:(1) 先读 Introductory Guide 建立五层结构心智模型 → (2) 按角色读对应 PtC(编码员读 Term Selection、分析员读 Data Retrieval)→ (3) 用 WBB 熟悉 100 个高频 PT 的层级位置 → (4) 参加一次官方免费培训(中文场次常有)→ (5) 版本切换前完成 MVAT 演练。

§10.2 关键文献

  1. The role of MedDRA in global public health(Frontiers in Drug Safety and Regulation, 2025; 10.3389/fdsfr.2025.1607642)——MSSO 官方视角的历史、治理与 COVID 响应全景。
  2. MedDRA V29.0 What’s Updated / 官方培训材料(MSSO, 2026-03)——当版变更的权威口径(中英文版可得)。
  3. Introductory Guide for MedDRA / Introductory Guide for SMQs(MSSO, 随版更新)——术语结构与信号查询的官方手册。
  4. MedDRA Points to Consider: Term Selection / Data Retrieval and Presentation(ICH M1 PtC WG, 年度更新)——编码与分析的准司法规范。
  5. Bousquet/Mozzicato/Harrison 系术语学论文(2009-2014)——MedDRA 结构与多轴语义的经典学术表述。
  6. 中国 ICH 接轨解读(中国食品药品网, 2018)——M1/E2B 落地语境与订阅机制中文权威叙述。
  1. RxNorm 药物术语标准——事件词典的药物侧镜像;双轴数据模型的另一半。
  2. MIMIC-IV-ED 急诊数据集——自由文本临床叙述的富矿,autocoder 训练对来源。
  3. DrugBank 药物数据库——药物知识侧:机制与靶点信息,与事件谱关联分析。
  4. TCGA——肿瘤研究语境:irAE 分析的组学侧。
  5. HGNC 基因命名委员会——术语治理的基因版参照系;稳定符号纪律的跨域对照。

§10.4 FAQ

Q1:MedDRA 是免费的吗?
A:分轨——全球药监机构、学者、医疗机构免费;商业机构按年营业额 7 档滑动订阅;学术研究走 MSSO 免费通道即可(§8.1)。

Q2:MedDRA 和 ICD 有什么区别?
A:MedDRA 编码「报告中的不良事件」(症状/体征/检查异常/诊断混合组织);ICD 编码「疾病诊断」做统计分类——一个 MNC 的安全性报告用 MedDRA、流行病学归因用 ICD,分工不重叠。

Q3:编码时选 LLT 还是 PT?
A:编码选 LLT(最贴近 verbatim 的),上报与分析用 PT(LLT 的父级自动归并)——「窄进宽出」是标准姿势(§2.2)。

Q4:一个 PT 可以属于多个 SOC 吗?
A:可以(多轴链接),但只有一个主 SOC——汇总表按主 SOC 分组防重复计数(§2.3)。

Q5:non-current 的术语还能在数据里出现吗?
A:能——non-current 只是「新编码不再选它」,历史数据里的旧编码仍然合法且必须能读出来(§4.1)。

Q6:SMQ 的 narrow 和 broad 怎么选?
A:双跑——narrow 高查准(确认已知信号的量级),broad 高查全(发现新信号的面);只跑一个域都是方法学欠缺(§2.4)。

Q7:MedDRA 一年更新几次?
A:两次——3 月 x.0(可含层级复杂变更)与 9 月 x.1;9 月版约 6 周后全球生效(§3.2)。

Q8:FAERS 数据里的 PT 名和我的词典对不上怎么办?
A:FAERS 是季度快照、词典是半年度更新——用 Version Report 建「旧名→当前名」迁移表兜底;孤儿率是数据质量指标(§4.8)。

Q9:可以用 MedDRA 编码药物名称吗?
A:不可以——药物用 WHODrug(监管语境)或 RxNorm(美国市场语境);MedDRA 只管事件/病史/检查(§9.3)。

Q10:autocoder 能完全替代人工编码吗?
A:不能——当前实践是「自动 80-90% + 人工兜底 10-20%」;低置信队列的人工复核是质量闭环的必要环节(§7.2)。

Q11:中文报告怎么编码?
A:用 MedDRA 中文版词典——28 种语言共享同一套数字编码,中文编码结果与英文完全互操作;别用英文词典近匹配中文(坑点 8)。

Q12:SMQ 是什么?有多少个?
A:官方预定义的安全性主题 PT 集合(如肝毒性/过敏性反应),230 个(V29.0);每个分 narrow/broad 两域(§2.4)。

Q13:订阅费大概多少钱?
A:按母公司年营业额 7 档——小机构数百美元级(2018 年公开口径:年营业额低于 100 万美元约 162 美元/年),大型 MNC 高数个量级;报价联系 MSSO(§1.7)。

Q14:论文里怎么正确引用 MedDRA?
A:版本号+发布月+修订包三要素——「MedDRA 29.1(2026-09,English v2)」;商标标注与官方立场免责见 §8.2 模板。

Q15:MVAT 是什么?什么时候用?
A:官方版本影响评估工具——版本切换前评估「存量编码数据在新版下的受影响记录」;监管提交的版本升级是强制场景(§1.6)。

Q16:MedDRA 能编码疫苗不良事件吗?
A:能且专门优化——疫苗相关 PT 命名模式(Vaccination site X 等)+ AEFI 语境术语群;VAERS 症状字段即 MedDRA PT(§2.6)。

Q17:编码员的培训哪里来?
A:MSSO 免费培训(含中文场次)+ 两份 PtC 文档 + 官方认证课程;编码一致性(κ≥0.85)是培训效果的可测指标(§5.2)。

Q18:什么是 Weber 效应?
A:上市后头两年报告率自然攀升的现象——报告渠道激活所致,不是安全性恶化;时间趋势分析必须校正解释(§2.9)。

Q19:MedDRA 有 API 吗?
A:有 Download API(订阅内,JSON/ASCII)供程序化获取;在线查询用 WBB;无公开免费 API(公开层经 FAERS 文件间接获取 PT 数据)。

Q20:自建词典和 MedDRA 怎么共存?
A:过渡期双词典并行 + 映射表版本化;长期向 MedDRA 收敛——自建词典的新增概念若 Medicine 学界通用,可经 WebCR 申请进入官方词典(§8.3)。

Q21:LLM 能直接做 MedDRA 编码吗?
A:LLM 适合候选重排与语境校验,不适合直接生成最终编码——词典检索层(精确+归一化)承担主流量,LLM 校验 PtC 语境规则才是杠杆位置(§7.3)。

Q22:什么是多轴链接?为什么重要?
A:同一 PT 链接多个 SOC 的机制——支持多视角汇总;但分析时必须按主 SOC 或显式声明全链接口径,否则重复计数(坑点 4)。

Q23:V29.1 的 v2 修订包是怎么回事?
A:Rh 抗体 LLT 仅大小写差异导致部分系统装载失败——MSSO 发布 v2 加 ISBT 抗原符号消歧;教训是版本引用精确到修订包(§6.7)。

Q24:MedDRA 和 WHO-ART 现在是什么关系?
A:MedDRA 吸收了 WHO-ART 术语,WHO-ART 由乌普萨拉中心维护服务老系统——新项目一律 MedDRA,WHO-ART 是历史兼容层(§1.3)。

Q25:做药物基因组学研究需要 MedDRA 吗?
A:安全性结局侧需要(不良事件编码)——暴露侧用药物词典、机制侧用基因资源;MedDRA 只占结局一轴(§9.5)。

Q26:检查异常(lab abnormalities)在 MedDRA 里怎么表达?
A:Investigations SOC 专门承载(15,675 个 LLT,V29.0)——但只表达「升高/降低」方向不表达数值;数值在 E2B 其他字段(§7.4)。

Q27:术语想新增/修改怎么办?
A:WebCR 提交变更申请——V29.0 处理 1,380 条、批准 1,042 条;批准内容进下一个半年度版(§4.7)。

Q28:MedDRA 编码数据能公开分享吗?
A:词典本体不能再分发;论文引用 PT 名称/编码数是惯例允许;公开数据集设计时把监管公开数据与订阅词典分层(§8.4)。

Q29:信号检测为什么要用 PT 层而不是 SOC 层?
A:SOC 聚合抹平信号——「肝毒性」信号在 SOC 层被数千个无关 PT 稀释;SOC/HLT 用于展示,检测在 PT/SMQ 层(§5.3)。

Q30:MedDRA 的 E2B(R3) 是什么?
A:ICH 个案安全报告电子传输标准——不良事件字段以 MedDRA 编码填充;监管机构公布最低 MedDRA 版本要求(§2.5)。

Q31:COVID-19 期间 MedDRA 表现如何?
A:加速通道批量增补疫苗/诊断术语——治理结构的应急档位被实战验证;Frontiers 2025 论文有官方回顾(§6.1)。

Q32:MedDRA 编码的历史数据怎么读旧概念?
A:non-current 术语永久保留 + 全历史版本可订阅下载——老报告永远可解码;这是「永不复用编码」纪律的直接收益(§4.1)。

Q33:做中国本土药物警戒,MedDRA 和本土体系怎么衔接?
A:2018 起 NMPA 适用 M1/E2B——本土报告向 MedDRA 迁移进行中;过渡期双词典并行、映射表版本化(§8.3)。

Q34:FAERS 挖掘的 PR 阈值怎么定?
A:PRR≥2 且计数≥3 是经典初筛线——但它是「初筛」不是「确认」;分层稳定性与临床审读是必做后续(§4.8/§5.3)。

Q35:autocoder 的 synonym 表怎么维护?
A:人工兜底结果月度回流 + 版本对账——synonym 表编码「本机构医生的表达习惯」,是 autocoder 的隐形资产,人员交接必交(§6.2)。

Q36:MedDRA 未来会怎么演进?
A:官方信号——V30.0 复杂变更提案公示中;方向是术语粒度随医学认知细化(irAE/用药错误语境)与语言覆盖扩展;五层结构与治理模式稳定不变(§6.9)。

§10.5 要点回顾

  1. 五层结构:SOC>HLGT>HLT>PT>LLT——编码在 LLT、分析在 PT。
  2. 编码纪律:永不复用 + 跨语言同码——历史数据永远可读。
  3. 版本治理:半年度双发布 + Version Report + MVAT——版本四元组强制引用。
  4. 主 SOC 口径:多轴是特性,主轴是纪律——防重复计数。
  5. SMQ 双域:narrow 查准/broad 查全——官方预聚合优先。
  6. 报告语境:MedDRA 编码报告不是事实——报告率不是发生率。
  7. non-current 不删:退役保留——装载与过滤的工程纪律。
  8. 订阅生态:监管/学术免费、商业滑档——学者通道是战略资源。
  9. autocoder 姿势:词典层为主、LLM 校验为辅、人工闭环回流。
  10. 治理四件套:编码不复用/不删只退役/diff 文档/用户变更通道——自建词典直接抄。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 五层结构(SOC/HLGT/HLT/PT/LLT)+ 示例层级链 = meddra.org 官网 + Frontiers in Drug Safety and Regulation 2025(10.3389/fdsfr.2025.1607642)
  • 27 SOC(平行轴)= Bousquet 等 2014(经 Frontiers 2025 综述转引)
  • V28.1 基线:HLGT 337 / HLT 1,739 / PT 27,163 / LLT 90,471 / SMQ 内容记录 97,480 / 历史记录 141,148 = alVigilance 对官方 V29.0 What’s New 的转录 + MSSO 官方培训材料(中文版 PDF 001363)
  • V29.0(2026-03-01 英文/03-15 翻译):变更申请 1,380(批 1,042/未批 333/暂缓 5);净增 +198 PT/+611 LLT → PT 27,361/LLT 91,082;新 HLT Poliovirus infections(合并 Poliomyelitis viral infections);用药错误 100+ LLT 重排;24 继发恶性肿瘤 LLT non-current;SMQ 230 个/无新增/255 PT 调整;丹麦语新增(共 28 语言)= MSSO 官方材料 + alVigilance/LinkedIn 转录
  • SOC 净变更分布(检查 118/损伤中毒 114/产品问题 99/操作 97/先天遗传 66/感染 62)= MSSO 中文培训材料 V29.0(PDF 001363)
  • SOC 级 LLT:Investigations 15,675 / Infections 7,989(primary LLTs,V29.0)= LinkedIn 转述官方口径
  • V29.1(2026-09-01 英文/09-15 全语言)+ v2 修订包(2026-09-17,Rh 抗体 LLT 加 ISBT 符号:anti-E→anti-RH3/anti-e→anti-RH5)+ 2026-11-02 全球生效 = meddra.org 官方新闻(2026-09-14/17/18)
  • V30.0 复杂变更提案公示(截止 2026-09-25)= meddra.org 新闻(2026-09-08)
  • 历史:1997-07 命名/1998-05 管理委员会/1998-11 MSSO/1999-03 V2.1 首发;前身 COSTART/WHO-ART/J-ART/HARTS+ICD-9(-CM) = 人民日报平台 M1 解读 + Frontiers 2025
  • 许可:监管机构全球免费/商业 7 档滑动(2018 口径:年营业额<100 万美元=162 美元/年)/学者与医疗机构 MSSO 免费、JMO 名义收费 = ich.org 官方页 + 中国食品药品网 2018(周思源解读)
  • 语言:英语+日语本位+25 种翻译维护(ich.org)/28 种语言(V29.0 含丹麦语口径)——两口径并存按时点引用
  • 中国 2018-05-01 适用 E2A/E2D/M1/E2B = 国家药监局公告经中国食品药品网报道
  • 工具:WBB/MVAT/WebCR/SSA/Download API(JSON+ASCII,含 SNOMED/ICD 映射)+ PtC 两文档年度 3 月更新 + Companion Doc Release 4.0(2026-09-14)= ich.org + meddra.org

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • fda-sentinel — 共享标签:药物发现与化学 / 公共卫生与流行病学
  • vaers — 共享标签:公共卫生与流行病学
  • ctd — 共享标签:药物发现与化学 / 公共卫生与流行病学
  • optum-clinformatics — 共享标签:药物发现与化学 / 公共卫生与流行病学
  • rxnorm — 共享标签:药物发现与化学
  • impc — 共享标签:公共卫生与流行病学
  • intact — 共享标签:药物发现与化学
  • msigdb — 共享标签:药物发现与化学
  • alphamissense — 共享标签:公共卫生与流行病学
  • lipid-maps — 共享标签:药物发现与化学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集