信息速览
MedDRA — 监管活动医学词典 AI-Ready Wikipedia
INFOBOX
| 项目 | 内容 |
|---|---|
| 全名 | Medical Dictionary for Regulatory Activities(监管活动医学词典) |
| 开发治理 | ICH 主持开发;MSSO 负责维护/开发/分发;JMO 支持日本 |
| 首发 | 1999 年 3 月(MSSO 首个发布 V2.1) |
| 当前版本 | V29.1(2026-09-01 英文 / 09-15 全语言;2026-11-02 全球生效);V30.0 提案公示中 |
| 规模(V29.0) | 27 SOC / 337 HLGT / 1,740 HLT / 27,361 PT / 91,082 LLT;230 个 SMQ |
| 结构 | 五层严格层级(SOC > HLGT > HLT > PT > LLT)+ 多轴 SOC 链接 + 编码跨语言不变 |
| 发布节奏 | 每年 2 次:3 月(x.0,可含复杂变更)+ 9 月(x.1) |
| 许可 | 订阅制:监管机构/学者/医疗机构免费;商业机构按年营业额 7 档滑动收费 |
| 应用 | ICH E2B(R3) 不良事件传输;FAERS / EudraVigilance / PMDA 编码标准;临床试验安全性报告 |
| 语言 | 28 种语言版本(英语/日语本位 + 25 种翻译维护;丹麦语 2026-03 新增) |
| 官方入口 | https://www.meddra.org (ICH 页:https://ich.org/page/meddra) |
| 本库条目 | order 479 · record_id 579 · 类别:药物发现与化学 × 公共卫生与流行病学 |
§0 E-E-A-T 信任声明与免责声明
- 经验:本条目写作基于 MedDRA 官方发布口径(meddra.org 新闻页 + 官方培训材料 V29.0 中文版)、ICH 官方页、Frontiers in Drug Safety and Regulation 2025 综述(Bousquet/Mozzicato 系作者)与中国食品药品网 2018 年 ICH 接轨报道;所有数量均标注版本与口径。
- 专业性:药物警戒编码、ICSR 数据处理、SMQ 信号检测的方法学描述遵循 ICH E2A/E2B(R3)/E2D 与 M1 PtC 文档的官方建议。
- 权威性:MedDRA 由 ICH MedDRA Steering Committee 治理、MSSO 维护;本条目不替代官方 Introductory Guide 与两份 PtC 文档。
- 可信度:文内数字全部进入文末「口径存照」;订阅价格、语言数量等易变口径均标注时点与来源。
- 免责:本页为第三方百科解读,与 MSSO/ICH 无隶属关系;MedDRA 名称与数据版权归 ICH 体系所有;使用 MedDRA 编码数据前须签署订阅协议并遵守使用条款。
- 时效:口径锁定 2026-09-19/20(V29.1 发布周 + v2 修订包事件后);V30.0 变更以 2027-03 发布为准。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:全球药物警戒的通用语言——报告不良事件时,把「病人说头疼」这种自由文本标准化为可比的编码术语。
- 谁在用:FDA(FAERS)、EMA(EudraVigilance)、PMDA、中国 NMPA(2018 ICH 接轨)——全球监管提交的强制编码标准。
- 多大:27,361 PT + 91,082 LLT + 27 SOC + 230 SMQ(V29.0 口径)。
- 怎么更新:每年 3 月/9 月双发布;x.0 版可动层级、x.1 版以术语增补为主。
- 一句话:如果你的研究涉及不良事件、药物警戒信号或监管安全性数据,MedDRA 就是那把必须对齐的尺子——而且它是订阅制,这与本库大多数免费条目不同。
§1.1 摘要
MedDRA(Medical Dictionary for Regulatory Activities,监管活动医学词典)是国际人用药品注册技术协调会(ICH)于 1990 年代末开发的标准化医学术语集,1999 年 3 月由 MSSO 发布首个版本(V2.1)。它诞生的直接动因是「一词多典」的监管乱象:欧洲用 WHO-ART、美国用 COSTART、日本用 J-ART、英国用 HARTS,跨国药企为满足不同监管提交要求要同时维护多套编码——M1 专家工作组把四套词库合并为一套五层术语体系,从此成为全球药物警戒的交换底座。
结构上,MedDRA 是一棵五层严格层级树:27 个系统器官分类(SOC)> 高位组术语(HLGT)> 高位术语(HLT)> 首选术语(PT)> 低位术语(LLT)。PT 是「独特的医学概念」——分析的单位;LLT 是 PT 的同义词、词形变体与口语表达——编码的单位。每个术语有永不复用的数字编码,28 种语言版本共享同一套编码,使「日本报告者用日语编码、德国审评员用德语阅读」成为可能。
规模上,V29.0(2026-03)含 27,361 PT 与 91,082 LLT(相对 V28.1 净增 198 PT/611 LLT),230 个标准化查询组(SMQ)为信号检测提供官方预定义的术语集合。治理上,术语变更由全球用户经 WebCR 提交申请、医学专家评审——V29.0 处理了 1,380 条变更申请(批准 1,042 条)。
应用上,MedDRA 是 ICH E2B(R3) 不良事件个案安全报告(ICSR)电子传输的指定编码标准,FDA FAERS、EMA EudraVigilance、日本 PMDA 数据库均以其为编码轴;临床试验的严重不良事件报告、疫苗不良事件监测(AEFI)、乃至 AI 自动编码(autocoding)管线都以 MedDRA 为目标词库。
许可上,MedDRA 采取「双轨开放」:全球监管机构、学者与医疗机构免费;商业机构按年营业额滑动收费(7 档制)。这与本库大多数条目的「完全免费」不同——订阅门槛本身是它生态语义的一部分(详见 §8)。
§1.2 战略价值
- 药物警戒的交换底座:没有 MedDRA,全球安全性数据不可比——E2B(R3) 的数据元素里,「不良事件术语」字段事实上由 MedDRA 独占;FAERS 与 EudraVigilance 的公开数据集都以 MedDRA 编码发布。
- 监管合规的硬通货:在中国(2018-05-01 起)、美国、欧盟、日本做注册提交,严重不良事件必须 MedDRA 编码——它不是「可选工具」而是制度性基础设施。
- 信号检测的语义层:离散比例报告比(PRR)、经验贝叶斯(EBGM/EBGM 基线的 MGPS)、贝叶斯置信传播网络(BCPNN)等成熟信号检测方法都以 PT 层为计算单位——SMQ 则提供「官方预聚合」的术语组。
- AI 编码任务的标准答案集:不良事件自动编码(autocoding)是医疗 NLP 最成熟的落地场景之一——训练标签就是「原始报告术语(verbatim term)→ MedDRA PT/LLT」的历史编码对。
- 术语治理的活标本:27 年、1,380 条/版的变更申请流、永不复用的编码、non-current 而非删除的退役机制——MedDRA 展示了「一个术语系统如何在监管刚性下持续演化」,这套治理模式是所有医学词库建设的参照系。
§1.3 同类数据集横向对比
| 维度 | MedDRA | WHO-ART | n}
| 维度 | MedDRA | WHO-ART |
| — | -(临床发现) | COSTART(已退役) |
|---|---|---|
| 定位 | 监管不良事件编码 | 药物警戒(前身) |
| 结构 | 五层严格层级 + 多轴 SOC | 四层 |
| 规模 | 27,361 PT / 91,082 LLT | 约 6,000 PT |
| 更新 | 每年 2 次 | 不定期(基本冻结) |
| 治理 | ICH/MSSO/JMO | WHO UMC |
| 语言 | 28 种 | 少数 |
| 现状 | 全球监管标准 | 历史数据可读 |
- 与前身词库的关系:MedDRA 吸收了 WHO-ART/COSTART/J-ART/HARTS 的术语内容——老数据集(如 1990 年代临床试验)需要 COSTART→MedDRA 映射表才能进现代管线。
- 与 SNOMED CT 的分工:SNOMED 管「临床文档里发生了什么」(发现/疾病/操作),MedDRA 管「监管报告里怎么写不良事件」——两者有部分映射但语义粒度和目的不同;一份数据集可以同时用两套(临床侧 SNOMED、安全性侧 MedDRA)。
- 与 WHO-ART 的现势关系:WHO-ART 仍由乌普萨拉监测中心维护(支持老系统),但新项目一律选 MedDRA——选型时把 WHO-ART 视为「历史兼容层」而非竞品。
§1.4 版本时间轴
| 年份 | 版本/事件 | 意义 |
|---|---|---|
| 1997-07 | ICH 正式命名 MedDRA | M1 专家工作组整合四套前身词库 |
| 1998-05 | MedDRA 管理委员会成立 | 治理结构成型 |
| 1998-11 | MSSO 成立 | ICH 公开竞选的受托维护组织 |
| 1999-03 | V2.1 发布 | 首个 MSSO 版本 |
| 2003 前后 | EMA/MHLW/FDA 相继采用 | 从欧洲标准走向国际标准 |
| 2010s | SMQ 体系成熟 | 信号检测的官方预聚合 |
| 2018-05 | 中国适用 ICH M1/E2B | 中国监管数据接轨全球 |
| 2020-2022 | COVID-19 加速通道 | 疫苗/诊断术语的快速增补(AEFI 语境) |
| 2026-03 | V29.0(复杂变更版) | +198 PT/+611 LLT;新 HLT Poliovirus infections;1,380 条变更申请 |
| 2026-09 | V29.1 + v2 修订包 | Rh 抗体 LLT 大小写修正(ISBT 符号消歧);11-02 全球生效 |
§1.5 应用场景矩阵
| 场景 | 用哪一层 | 关键操作 | 适配度 |
|---|---|---|---|
| 个案安全报告(ICSR)编码 | LLT(编码)→ PT(上报) | verbatim → LLT 选择 | ★★★★★ |
| 安全性汇总表(CIOSM II 表) | PT × SOC | 按主 SOC 分组列频次 | ★★★★★ |
| 信号检测(PRR/MGPS/BCPNN) | PT 层计数 | SMQ 或 PT 级离散统计 | ★★★★★ |
| 临床试验 SAE 报告 | LLT → PT | E2B(R3) 电子传输 | ★★★★★ |
| 疫苗不良事件监测(AEFI) | PT + SMQ | 疫苗特异性术语 + CDC 疫苗码联动 | ★★★★☆ |
| AI 自动编码(autocoding) | verbatim → PT/LLT 监督学习 | 编码对作训练标签 | ★★★★☆ |
| 药物流行病学暴露-结局分析 | PT/SOC 层结局定义 | 与 RxNorm/WHODrug 联动 | ★★★☆☆ |
| EHR 自由文本安全性挖掘 | verbatim 归一 → PT | NLP 管线 + 编码词典 | ★★★☆☆ |
§1.6 组件全景
- 术语本体:五层层级 + 编码(.asc 文件分发——LLT.asc/PT.asc/HLT.asc/HLGT.asc/SOC.asc + 层级链接文件)。
- SMQ(Standardised MedDRA Queries):230 个官方预定义查询组——把「过敏性反应」「肝毒性」等安全性主题的 PT 集合打包,分 narrow(窄域,高查准)与 broad(宽域,高查全)两档;层级型 SMQ 还嵌套子查询。
- WBB(Web-Based Browser):订阅方的网页浏览器——五层导航 + 多语言切换 + 编码检索。
- MVAT(MedDRA Version Analysis Tool):版本升级影响评估——把「旧版编码数据集」放到新版词库里跑一遍,报告哪些编码 retired/renamed/移动了层级;版本迁移的官方工具。
- WebCR:变更申请提交门户——用户发现术语缺口/错误后走官方通道;批准结果进入下一个半年版。
- Download API:JSON/ASCII 双格式订阅下载;含 SNOMED/ICD 映射文件。
- PtC 文档族:Term Selection: PtC(编码端)+ Data Retrieval and Presentation: PtC(分析端),每年 3 月版更新;另有 Companion Document(2026-09 Release 4.0)覆盖数据质量/用药错误/产品质量等专题。
- 培训体系:MSSO 免费培训(英语/中文/法语/德语/韩语/葡萄牙语/俄语/西班牙语/阿拉伯语)+ JMO 日语培训。
§1.7 术语标准的经济学
MedDRA 的商业模式在本库条目里独树一帜,值得单独立传——它解释了为什么一个「公共标准」能维持每年千万级的专业维护:
- 谁付费谁受益的闭环:商业机构按年营业额 7 档滑动缴费(2018 年公开口径:年营业额低于 100 万美元的机构约 162 美元/年,大型药企则高数个量级);这笔钱经 ICH MedDRA 管理委员会流向 MSSO——覆盖术语维护、27 种语言翻译、WBB/MVAT 工具开发与全球培训。
- 监管机构的零门槛策略:全球监管机构免费——这保证了「编码标准的接受端」毫无阻力;标准的网络效应来自监管强制(E2B 提交必须用 MedDRA),商业机构实际上是「被制度邀请」订阅。
- 学者与医疗机构的免费通道:学术研究和医疗机构经 MSSO 免费获取——保证了学术药物警戒研究不会被订阅墙卡死;JMO 对日本医疗机构收名义费用。
- 对 AI 团队的含义:免费通道覆盖「学术 + 公共卫生」语境——大学团队的 FAERS 挖掘研究可以合法免费拿到 MedDRA;但商业 AI 产品若要把 MedDRA 嵌入发行物(如 SaaS 自动编码服务),需要商业订阅并核查再分发条款(详见 §8.4)。
- 成本结构的对比视角:与 SNOMED CT(成员国会员制)、UMLS(NLM 财政支持免费)相比,MedDRA 的「用户付费」模式让它的翻译速度(28 种语言)与变更响应(1,380 条/版)远超纯公共资金能支撑的规模——这是「术语标准经济学」的第三种解。
§1.8 MedDRA 在监管研究流程中的定位
药物安全性数据流(从报告到信号)
┌─────────────────────────────────────────────────────────────┐
│ 报告源:临床试验 CRF / 自发性报告 / 文献 / 注册登记 / EHR │
│ → verbatim term(报告者原话,如「打了疫苗后胳膊肿了三天」) │
│ → 编码(Medical Coder/autocoder):verbatim → MedDRA LLT │
│ → ICSR(E2B(R3) 个案报告):LLT → PT 上报 │
│ → 监管数据库(FAERS/EudraVigilance/PMDA/JADER) │
│ → 信号检测:PT 层离散统计(PRR/MGPS/BCPNN)或 SMQ 聚合 │
│ → 评估决策:说明书修订/风险最小化措施/上市撤回 │
└─────────────────────────────────────────────────────────────┘
- 编码是数据进入监管世界的门:verbatim term 不进数据库——所有下游分析看到的都是 MedDRA 编码;编码质量决定整个数据价值链的上限。
- LLT 是入口、PT 是出口:编码员选 LLT(保真度),数据库里以 PT 聚合(可比性)——这个「窄进宽出」的语义设计是 MedDRA 数据工程的核心。
- SMQ 是官方快捷键:自己做 PT 级检索前,先看 SMQ 有没有现成的主题组——用官方组至少保证了跨研究可比。
§1.9 独特视角:报告语境的术语词典
MedDRA 与本库其他医疗词库有一个本质区别值得单独一章的注意力:它编码的是「报告」,不是「事实」。
- 报告语境的哲学:同一个临床事件「服药后转氨酶升高」,在 MedDRA 里可能编为 Hepatic enzyme increased(检查异常)或 Drug-induced liver injury(药物性肝损)——取决于报告者的判断而非客观检测;MedDRA 编码的是「报告者说了什么」的标准化翻译,不是「病人身上发生了什么」的金标准。
- 对 AI 的深刻含义:以 MedDRA 编码对训练的自动编码模型学到的是「报告语言 → 监管语言」的映射,不是「症状 → 疾病」的医学推理——把 autocoding 模型当临床诊断模型用是范畴错误(§6.5 坑点 7 的展开)。
- 信号的哲学:离散统计学派(Evans 的 PRR 传统)明确把 MedDRA 编码数据视为「报告比率」而非「发生率」——FAERS 里「药 A + PT B」的计数上升可能是真信号、媒体关注、或报告指南变化;MedDRA 的术语学只为这层不确定性提供可比性,不提供因果性。
- 为什么这个视角重要:国内团队引进 MedDRA 数据做真实世界研究时最容易踩的坑就是把「报告数」当「病例数」——理解报告语境是使用这套词典的第一课。
§2 医学与科学背景
§2.1 为什么不良事件需要专门词典
- 报告语言的天然混乱:同一事件可以是「恶心」「胃不舒服」「想吐」「反胃」「纳差伴恶心」——五份报告可能描述同一个临床现象;没有标准化,全球报告数据无法聚合。
- 监管可比性的刚需:审评员要在「这个药肝毒性报告比对照药多吗」这类问题上给出结论——前提是两边的「肝毒性」用同一套术语表达;跨国提交(ICH 三方)让这一需求从区域上升到全球。
- 安全性语义的特殊性:不良事件词汇有自己的结构——它们按「系统器官 + 症状/体征/诊断/检查异常」混合组织,而不是按疾病分类学(ICD 的组织逻辑);ICD 不适合编码「轻度头痛」这种没有诊断地位的事件——MedDRA 的 PT 层正是为此设计。
- 检查异常的词汇地位:Lab data(转氨酶升高、血小板减少)在不良事件报告里占比巨大——MedDRA 的 Investigations SOC(15,675 个 LLT,V29.0 口径)专门承载这类术语;ICD 对检查异常的表达远弱于此。
§2.2 五层层级的语义设计
| 层级 | 全称 | 语义 | 数量(V29.0) | 示例 |
|---|---|---|---|---|
| SOC | System Organ Class | 系统器官分类——平行轴 | 27 | Infections and infestations |
| HLGT | High Level Group Term | 高位组——HLT 的聚类 | 337 | Viral infectious disorders |
| HLT | High Level Term | 高位——PT 的临床聚类 | 1,740 | Influenza viral infections |
| PT | Preferred Term | 首选——独特医学概念(分析单位) | 27,361 | Influenza |
| LLT | Lowest Level Term | 低位——同义词/变体(编码单位) | 91,082 | Flu / Influenza A / Grippe |
- PT 的本体地位:PT 是 MedDRA 的「原子概念」——一个 PT 表达一个可区分的医学概念(症状、体征、诊断、检查异常、操作并发症等);分析永远在 PT 层做。
- LLT 的语言学功能:LLT 承载同义词(flu ↔ influenza)、词形变体(复数/拼写)、口语表达与方言——编码员的目标是找到语义最贴近的 LLT,然后系统自动归并到其父 PT。
- HLT/HLGT/SOC 的导航功能:三层上位结构为浏览与分组服务——但注意 HLT 的分组语义是「临床相似」而非「机制相同」(如 HLT 会把「细菌性脑膜炎」类聚在一起,但不提供病原学细分到 ATC 那种程度)。
- 示例:一条完整的编码链——报告者写「打过疫苗后手臂红肿痛」→ 编码员选 LLT Vaccination site erythema / Vaccination site swelling / Vaccination site pain(三个 LLT,各归其 PT)→ 分析时在 SOC General disorders and administration site conditions 下聚合成「注射部位反应」主题。
§2.3 SOC 的多轴设计
- 平行轴原则:27 个 SOC 是平行的分类视角而非互斥分区——同一个 PT 可以链接多个 SOC(多轴链接,multi-axial links),但只有一个主 SOC(Primary SOC)。
- 多轴的意义:PT Cardiac arrest 主轴是 Cardiac disorders,但也在 Nervous system disorders(晕厥类鉴别)和 General disorders 下有链接——按不同 SOC 做汇总表时同一事件会出现在不同主题下;这是特性不是缺陷。
- 主 SOC 的分析纪律:避免重复计数的标准做法是「按主 SOC 分组」——E2B 传输与监管汇总表都遵循此约定;自建分析若用全链接会重复计数(§6.5 坑点 4)。
- SOC 的分组逻辑混合:27 个 SOC 的划分依据并不统一——有按部位(心脏器官)、按病因(感染及侵染)、按目的(各类手术及医疗操作)、按性质(产品问题、社会环境)——这是历史遗产也是语义陷阱:跨 SOC 的计数比较没有「互斥分区」的含义。
§2.4 SMQ 的信号检测语义
- SMQ 是什么:230 个官方维护的 PT 集合,每个对应一个安全性主题(如 Anaphylactic reaction、Drug-induced liver injury、QT prolongation)——由 SMQ 专家工作组按医学证据定期修订(V29.0 无新增 SMQ 但调整了 255 个成员 PT)。
- narrow/broad 双域设计:narrow(窄域)收录「高特异性」成员(如「过敏性休克」本体),broad(宽域)额外收录「可能相关」成员(如「荨麻疹」「血管性水肿」)——查准 vs 查全的官方预配置;信号检测建议先 narrow 后 broad 双跑对比。
- 层级型 SMQ:部分 SMQ 嵌套子 SMQ(如「严重皮肤反应」下分 Stevens-Johnson syndrome、TEN 等子主题)——层级型查询可以下钻。
- 与自由检索的对比:SMQ 的价值是跨研究可比——两个团队都用官方 SMQ Definition and Guidelines 检索「肝毒性」,得到的集合一致;自由拼 PT 列表则各有各的口径(正是 PtC Data Retrieval 文档存在的意义)。
§2.5 与监管数据流的衔接(E2B/FAERS/EudraVigilance)
- E2B(R3):ICH 个案安全报告电子传输标准——不良事件/病史字段按 MedDRA 编码传输;E2B 的数据元素规范与 MedDRA 版本要求绑定(监管机构会公布「最低版本」)。
- FAERS(FDA):美国不良事件报告系统的公开季度数据集——MedDRA PT 是核心编码轴;公开数据文件里 PT 以编码+名称给出,研究者可做 PRR/MGPS 信号检测。
- EudraVigilance(EMA):欧洲的对应体系——EudraVigilance 公开访问报告分析(EVDAS)以 MedDRA 为编码层。
- PMDA/JADER(日本):日本 PMDA 数据库与 JADER 公开数据同样以 MedDRA(JMO 日语版)编码。
- 中国接轨路径:2018-05-01 起 NMPA 适用 ICH E2A/E2B/M1——中国上市后不良反应报告体系向 MedDRA 编码迁移;本土药物警戒团队从「自建词典」转向 MedDRA 是近年行业主线。
§2.6 与疫苗药物警戒的衔接
- AEFI 语境:疫苗接种后的不良事件(Adverse Events Following Immunization)是 MedDRA 的重点覆盖区——COVID-19 期间 MSSO 开设加速通道批量增补疫苗相关术语(Frontiers 2025 论文的官方叙事)。
- 疫苗特异性术语模式:Vaccination site X(注射部位反应)/ Vaccine X(疫苗相关事件)/ Programme X(项目性事件如接种差错)——疫苗警戒有一套稳定的术语命名模式。
- 与 CDC 疫苗码的关系:疫苗产品编码(CVX)由 RxNorm/CDC 侧承载,MedDRA 承载事件编码——「什么疫苗(RxNorm/CVX)+ 什么事件(MedDRA)」两轴联动的报告结构。
- VAERS 的语义结构:美国 VAERS 公开数据的症状字段即 MedDRA PT——做疫苗信号挖掘的数据团队实际操作的是「MedDRA PT × 疫苗产品」的列联表。
§2.7 用药错误与产品质量的语义边界
- 用药错误(Medication errors):V29.0 把 100+ 个 LLT 重排进 HLGT Medication errors——「过期药品被调配」「剂量计算错误」这类未造成伤害的错误也进 MedDRA(错误本身即报告对象);这是药物警戒「近失误(near miss)报告文化」的术语支撑。
- 产品质量问题(Product issues):SOC Product issues(V29.0 净变更 99 条)承载「药品质量问题」——药片变色、包装缺陷、污染物报告;注意这类术语报告的是产品问题,不必然伴随患者伤害。
- 语义边界的实操含义:编码「适应症外使用」「药物无效」与「药物过量」时要按 PtC Term Selection 的语境规则选 PT——同一句 verbatim「病人吃了双倍剂量」可能编为 Overdose(伤害语境)或 Medication error(错误语境)——编码员培训的核心难点之一。
- V29.0 的继发恶性肿瘤调整:24 个 LLT(如 Secondary carcinoma)置 non-current——官方立场是「转移灶」与「新原发癌」在术语层必须可区分;这是「术语粒度反映医学安全语义」的近期案例。
§2.8 与中药/传统药物的编码适配
- 成分复杂性的语义挑战:中药复方的多成分、药材基原差异、炮制工艺使其不良事件归因比化学药更难——MedDRA 编码「事件」侧没有障碍,但「暴露」侧需要与药物词典(WHODrug 的中成药条目/自建词表)配合。
- 国内实践现状:NMPA 不良反应报告体系里的中药注射剂安全性监测使用 MedDRA 事件编码——「双黄连注射剂过敏样反应」这类报告的事件侧以标准 PT 表达,产品侧以药物词典表达。
- 术语缺口的申请路径:传统药物特有的事件概念(如「上火」类民俗表达)不适合直接进 MedDRA——但相关的可观察事件(口干、便秘)有标准 PT;术语缺口走 WebCR 变更申请。
- 研究含义:中药真实世界安全性研究的数据模型建议「MedDRA(事件)+ WHODrug/RxNorm 扩展(暴露)+ 自建炮制/批次元数据」三段式——单靠任何一套词典都语义不完整。
§2.9 报告偏倚的语义层表达
- Weber 效应:上市后前两年报告率自然攀升——不是安全性恶化而是报告渠道激活;用 MedDRA 数据做时间趋势必须把这个效应放进解释框架。
- 媒体/监管行动的编码冲击:某药上新闻后其全部 PT 的报告量都会上升(notoriety bias)——信号检测文献的标准提醒;MedDRA 的可比性只解决「术语统一」,不解决「报告行为统一」。
- 编码培训的漂移:不同公司/年代的编码员对相似 verbatim 可能选不同 LLT(编码粒度漂移)——跨年份 PT 计数比较时要看 PtC 版本与编码指南变更史;V29.0 的用药错误重排就是一次「官方组织的粒度漂移校正」。
- 多语言报告的编码层:日语/中文报告先在本地语言下选 LLT(各语言版 LLT 对齐同一编码)——语言版本的完整性影响编码粒度;28 种语言里主要监管语言的术语覆盖最完整。
§3 数据集规格
§3.1 规格总表
| 属性 | 规格 |
|---|---|
| 名称 | MedDRA(Medical Dictionary for Regulatory Activities) |
| 治理 | ICH MedDRA Steering Committee → MSSO(维护/开发/分发)+ JMO(日本) |
| 当前版本 | V29.1(2026-09-01 英文 / 09-15 全语言 / 11-02 全球生效) |
| 发布节奏 | 每年 2 次:3 月 x.0(可含复杂变更)+ 9 月 x.1 |
| 层级结构 | 5 层:SOC(27) > HLGT(337) > HLT(1,740) > PT(27,361) > LLT(91,082) |
| 编码 | 数字编码,跨语言/版本不变,永不复用 |
| SMQ | 230 个标准化查询组(narrow/broad 双域) |
| 语言 | 28 种语言版本共享编码(丹麦语 2026-03 新增) |
| 文件格式 | ASCII(.asc 分层文件)+ JSON(Download API)+ WBB 浏览器 |
| 许可 | 订阅制:监管机构/学者/医疗机构免费;商业 7 档滑动收费 |
| 变更治理 | WebCR 用户申请 → 专家评审 → 半年度发布(V29.0:1,380 申请/1,042 批准) |
| 规模基线 | V28.1:337 HLGT / 1,739 HLT / 27,163 PT / 90,471 LLT / SMQ 记录 97,480 |
§3.2 版本口径的地图
- x.0 vs x.1 的语义:3 月的 x.0 版是「复杂变更版」——层级结构可能动(新 HLT/合并/SOC 调整);9 月的 x.1 版以术语增补与修订为主——但两者对下游都是「新版本」,数据装载逻辑没有豁免。
- 全球生效日:9 月版发布后约 6 周才「全球生效」(V29.1:2026-09-01 发布 → 11-02 生效)——这个窗口是给全行业装载与测试的缓冲期;监管提交的版本切换以生效日为准。
- 修订包(updated version)机制:V29.1 英文版因 Rh 抗体 LLT 大小写重复问题在发布 16 天后出 v2 修订包——版本引用要精确到 v2;这是「官方补丁」的先例。
- 版本报告(Version Report):每个版本随附「相对上一版的完整 diff 文档」——迁移审计的官方依据;MVAT 则提供「我的数据在新版下会怎样」的计算。
- 引用纪律:论文/报告引用 MedDRA 必须写「版本号 + 发布月份」——「MedDRA 29.0」与「MedDRA 29.1」是不同的语义快照;仅写「MedDRA」视同引用失败。
§3.3 DAIMS 数据AI就绪度评估
| # | 维度 | 指标 | 评分(1-5) | 依据 |
|---|---|---|---|---|
| 1 | A 可获得 | 免费获取 | 3 | 监管/学术/医疗机构免费;商业订阅;无公开原始下载 |
| 2 | A 可获得 | 获取流程 | 4 | 订阅审核明确;SSA 自助门户;Download API |
| 3 | A 可获得 | 分发格式 | 4 | ASCII 分层文件 + JSON API;标准 ETL 友好 |
| 4 | A 可获得 | 历史版本回溯 | 5 | 全历史版本可订阅下载;Version Report 全 diff |
| 5 | D 文档 | 官方文档 | 5 | Introductory Guide + 两份 PtC + Companion Doc 4.0 |
| 6 | D 文档 | 变更透明度 | 5 | What’s New + Version Report + 变更申请全程可溯 |
| 7 | D 文档 | 培训体系 | 5 | 免费多语言培训 + 认证课程 |
| 8 | I 互操作 | 编码稳定性 | 5 | 编码永不复用;跨语言一致 |
| 9 | I 互操作 | 外部映射 | 4 | 官方 SNOMED/ICD 映射;WHO-ART/COSTART 历史映射 |
| 10 | I 互操作 | 语义层级 | 4 | 五层严格层级;多轴 SOC 需主轴纪律 |
| 11 | M 元数据 | 术语元数据 | 4 | 层级/现势性/主 SOC/多轴链接;部分属性文件外(如变更历史) |
| 12 | M 元数据 | 版本元数据 | 5 | 每版 Version Report + MVAT 影响评估 |
| 13 | S 可持续 | 治理机制 | 5 | ICH 治理 + 27 年运营 + 用户变更流 |
| 14 | S 可持续 | 生态工具 | 4 | WBB/MVAT/WebCR/API 齐备;绑定订阅生态 |
综合 34/50(4.3/5)——文档与治理满分级、可得性受订阅制拖累;在「术语标准」类别里是治理成熟度的天花板。
§3.4 存储与计算需求
- 全量装载:五层 + 链接 + SMQ 的全量 ASCII 包在百 MB 级——关系型库 10 张表内装完;个人工作站完全可行。
- 增量订阅:每半年一个新版本包——增量 diff 可经 Version Report 导出;存储需求随历史版本数线性增长(建议保留全部历史版本:时间序列研究的刚需)。
- 编码词典内存态:autocoder 场景把 LLT → PT 的映射表加载进内存(91,082 条 LLT + 编码索引)——单机 GB 级即可;大规模报告流水的编码服务则按吞吐量水平扩展。
- FAERS 联动:MedDRA 本体 + FAERS 季度公开数据(数 GB/年)联合分析的典型配置是 16GB 内存 + PostgreSQL——学术研究的最小可行栈。
§3.5 获取通道
- 订阅入口:meddra.org 注册 → SSA(Self-Service Application)自助申请 → 订阅审核 → 下载权限与 WBB 账号。
- 免费通道:全球药监机构(官方函件通道)、学术机构与医疗机构(MSSO 免费订阅;JMO 名义收费)。
- 商业滑档:7 档年营业额制——报价需联系 MSSO;母公司年销售额为计费基准(跨国集团按集团口径)。
- 间接公开数据:FAERS 季度文件、EudraVigilance 公开报告分析、VAERS 公开数据——均含 MedDRA PT 编码与名称,可不经订阅做 PT 层分析(但拿不到 LLT 层与 SMQ 全集)。
- 镜像与再分发的红线:MedDRA 数据不可向未订阅第三方再分发——公开发布的数据集若含 MedDRA 编码需核查许可;学术论文里引用 PT 名称与编码数是允许的常规做法。
§3.6 口径对齐表
| 数字 | 口径 A | 口径 B | 使用建议 |
|---|---|---|---|
| PT 数 | 27,163(V28.1) | 27,361(V29.0) | 写明版本号 |
| LLT 数 | 90,471(V28.1) | 91,082(V29.0) | 写明版本号 |
| HLT 数 | 1,739(V28.1) | 1,740(V29.0 新增 Poliovirus infections) | 写明版本号 |
| SOC 数 | 27(长期稳定) | — | V29.0 SOC/HLGT 层无变化 |
| SMQ 数 | 230(总数) | 97,480(SMQ 内容记录数,V28.1) | 区分「组数」与「成员记录数」 |
| 语言数 | 27(ICH 页:英语+日语+25 翻译) | 28(含丹麦语 V29.0 口径) | 以发布时点官方新闻为准 |
| 变更申请 | 1,380(处理数) | 1,042(批准数) | 区分处理/批准/未批/暂缓 |
§3.7 版本选择纪律
- 新项目:直接用当前全球生效版(2026-11-02 后为 V29.1 修订包 v2)——没有理由从旧版开始。
- 存量数据迁移:用 MVAT 评估「旧版编码数据 → 新版」的受影响记录数——监管提交场景下版本迁移是强制项(监管机构公布最低版本要求)。
- 长周期研究:锁定单一版本跑完全部分析再统一迁移——中途换版本等于在时间序列里埋了分层断点。
- FAERS 挖掘:注意 FAERS 季度文件用的 MedDRA 版本与你的订阅版可能不同——跨源对比前先对齐版本(或至少写明差异)。
- 版本引用三要素:版本号 + 发布月 + (如适用)修订包次——「MedDRA 29.1 (2026-09, English v2)」是合格写法。
§3.8 数据文件与字段详表
| 文件/组件 | 内容 | 关键字段 |
|---|---|---|
| soc.asc / hlgt.asc / hlt.asc / pt.asc / llt.asc | 五层术语主文件 | meddra_code, name, (llt) pt_code, (pt) soc_code |
| hlgt_hlt.asc / hlt_pt.asc / pt_llt.asc | 层级链接 | 上级码, 下级码 |
| soc_hlgt.asc | SOC-HLGT 链接 | soc_code, hlgt_code |
| pt_soc.asc(多轴链接) | PT×SOC 全链接(含主轴标志) | pt_code, soc_code, primary_flag |
| intl_ord.asc | 编码顺序/排序辅助 | 编码, 序号 |
| smq_files | SMQ 内容 | smq_code, smq_name, scope, level, pt_code |
| Version Report | 版本 diff 文档 | 变更类型, 旧码, 新码, 旧名, 新名 |
| ASCII→JSON(Download API) | 同内容的 JSON 形态 | 同上,程序化消费友好 |
| SNOMED/ICD 映射 | 外部词库映射文件 | meddra_code, 外部编码, 映射类型 |
§4 数据结构
§4.1 对象模型
MedDRA 数据模型(ASCII 分发文件视角)
├── Term(meddra_code 主键,永不复用)
│ ├── level(SOC/HLGT/HLT/PT/LLT 五选一)
│ ├── name(英文本位名;各语言版同名异文同码)
│ ├── current_status(current / non-current)
│ └── 层级父子链(pt_llt / hlt_pt / hlgt_hlt / soc_hlgt)
├── 多轴链接(pt_soc:一个 PT 多个 SOC + primary_flag)
├── SMQ 内容(smq_code → 成员 PT 集合 + narrow/broad 标志)
├── 语言版本(同一套编码 × 28 种语言字符串)
└── 版本维度(每半年一个语义快照 + Version Report diff)
- 模型的核心不变量:编码永不复用 + 层级严格五层 + 跨语言同码——三条不变量决定了 MedDRA 的数据工程全部姿势。
- non-current 的语义:术语退役后保留在词库里(历史数据可读)但标记 non-current——新编码不选它;数据装载时要保留 non-current 术语而非过滤删除。
- 多轴链接的载体:PT×SOC 的全链接集(含 primary 标志)是独立文件——只装载五层主文件会丢失多轴信息,跨 SOC 分析立即失真。
§4.2 五层文件装载与基本查询
#!/usr/bin/env bash
# MedDRA ASCII 包装载 PostgreSQL(教学骨架;正式装载以官方格式文档为准)
set -euo pipefail
DB="meddra_v291"
psql -d "$DB" <<'SQL'
CREATE TABLE llt (code bigint PRIMARY KEY, pt_code bigint, name text);
CREATE TABLE pt (code bigint PRIMARY KEY, name text);
CREATE TABLE hlt (code bigint PRIMARY KEY, name text);
CREATE TABLE hlgt(code bigint PRIMARY KEY, name text);
CREATE TABLE soc (code bigint PRIMARY KEY, name text, soc_short_name text);
CREATE TABLE hlt_pt (hlt_code bigint, pt_code bigint);
CREATE TABLE hlgt_hlt(hlgt_code bigint, hlt_code bigint);
CREATE TABLE soc_hlgt(soc_code bigint, hlgt_code bigint);
CREATE TABLE pt_soc (pt_code bigint, soc_code bigint, primary_flag char);
\copy llt FROM 'llt.asc' WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
\copy pt FROM 'pt.asc' WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
\copy soc FROM 'soc.asc' WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
\copy pt_soc FROM 'pt_soc.asc' WITH (FORMAT csv, DELIMITER '$', QUOTE E'\x01')
SQL
echo "装载完成——注意官方文件以 \$ 分隔,QUOTE 用占位符绕过"
-- 典型查询 1:从 LLT 名找 PT(编码员词典查询)
SELECT l.name AS llt_name, p.code AS pt_code, p.name AS pt_name
FROM llt l JOIN pt p ON p.code = l.pt_code
WHERE lower(l.name) LIKE '%anaphyla%'
AND l.code IN (SELECT code FROM llt); -- 实际装载时加 current 过滤列
-- 典型查询 2:按主 SOC 分组的 PT 频次表(安全性汇总骨架)
SELECT s.name AS primary_soc, count(*) AS pt_count
FROM pt_soc ps JOIN soc s ON s.code = ps.soc_code
WHERE ps.primary_flag = 'Y'
GROUP BY s.name ORDER BY pt_count DESC;
装载要点:(1) 官方 ASCII 文件的分隔符与引号约定以当版 Distribution File Format Document 为准——版本间有过微调,别用两年前的脚本装载新版;(2) non-current 标志在 PT/LLT 文件的现势性字段——装载时保留该列,不要装载时过滤;(3) 全历史版本各自建 schema(v291/v290/v281)——跨版本分析的前提。
§4.3 Python 词典查询与层级遍历
#!/usr/bin/env python3
"""MedDRA 装载后的最小查询层:编码查询/层级上卷/主 SOC 归属。"""
import psycopg
class MedDRALookup:
def __init__(self, dsn: str):
self.conn = psycopg.connect(dsn)
def llt_to_pt(self, llt_name: str) -> list[tuple[int, str]]:
"""编码员工作流:verbatim 近似匹配 LLT → 父 PT。"""
with self.conn.cursor() as cur:
cur.execute("""
SELECT p.code, p.name FROM llt l
JOIN pt p ON p.code = l.pt_code
WHERE l.name ILIKE %s""", (f"%{llt_name}%",))
return cur.fetchall()
def rollup_to_soc(self, pt_code: int, primary_only: bool = True) -> list[str]:
"""PT → SOC(默认只取主轴——跨 SOC 分析的计数纪律)。"""
cond = "AND primary_flag = 'Y'" if primary_only else ""
with self.conn.cursor() as cur:
cur.execute(f"""
SELECT s.name FROM pt_soc ps
JOIN soc s ON s.code = ps.soc_code
WHERE ps.pt_code = %s {cond}""", (pt_code,))
return [r[0] for r in cur.fetchall()]
def smq_members(self, smq_name: str, scope: str = "narrow") -> set[int]:
"""SMQ 成员拉取:信号检测的官方术语集合。"""
with self.conn.cursor() as cur:
cur.execute("""
SELECT member_pt FROM smq
WHERE smq_name = %s AND scope = %s""", (smq_name, scope))
return {r[0] for r in cur.fetchall()}
if __name__ == "__main__":
lk = MedDRALookup("postgres://localhost/meddra_v291")
print(lk.llt_to_pt("anaphylactic shock")) # → PT Anaphylactic reaction
print(lk.rollup_to_soc(10019161)) # 某编码的主 SOC
print(len(lk.smq_members("Anaphylactic reaction")))
代码要点:(1) primary_only=True 是默认——全链接模式留给「多轴主题分析」这种明确知道自己要什么的场景;(2) SMQ 成员按 scope 拉——narrow 集合是 broad 的子集,信号检测双跑对比;(3) 生产化时加 current 过滤与版本参数——这个最小层没有处理版本维度,管好 schema 名即可。
§4.4 编码流水线:verbatim → LLT/PT
#!/usr/bin/env python3
"""不良事件 autocoder 的教学骨架:词典精确匹配层 + 模糊回退层。
生产级系统通常还有:缩写展开、拼写纠错、LLM 候选生成 + 规则校验。"""
import re
from dataclasses import dataclass
@dataclass
class CodingResult:
verbatim: str
llt_code: int | None
pt_code: int | None
confidence: float
method: str # exact | normalized | fuzzy | llm
class Autocoder:
def __init__(self, llt_index: dict[str, tuple[int, int]],
norm_rules: list):
# llt_index: 归一化小写 LLT 名 → (llt_code, pt_code)
self.llt_index = llt_index
self.norm_rules = norm_rules # 如 去除标点/展开缩写/单复数归一
def _normalize(self, s: str) -> str:
s = s.lower().strip()
for pat, rep in self.norm_rules:
s = re.sub(pat, rep, s)
return s
def code(self, verbatim: str) -> CodingResult:
norm = self._normalize(verbatim)
if norm in self.llt_index:
llt, pt = self.llt_index[norm]
return CodingResult(verbatim, llt, pt, 0.98, "exact")
# 模糊回退:编辑距离 ≤2 的最佳 LLT(示意)
best, best_dist = None, 3
for cand, (llt, pt) in self.llt_index.items():
d = _edit_distance(norm, cand)
if d < best_dist:
best, best_dist = (llt, pt), d
if best:
return CodingResult(verbatim, best[0], best[1],
0.6 - 0.1 * best_dist, "fuzzy")
return CodingResult(verbatim, None, None, 0.0, "llm") # 人工/AI 兜底
def _edit_distance(a: str, b: str) -> int: # 标准DP,略
return 0 if a == b else 1
管线要点:(1) 精确/归一化层命中即可信(置信度 >0.9)——覆盖 70-85% 流量;模糊层必须低置信标记并进人工复核队列——autocoder 的质量=「自动命中率 × 错误拦截率」;(2) 词典随版本更新重载——MVAT 评估版本升级对存量编码的影响后重建索引;(3) LLM 候选生成层(近两年主流)输出 top-k LLT 候选 + 依据 PtC 的语境规则校验——生成是容易的,语境正确性校验才是价值所在(见 §7.6)。
§4.5 元数据与可复现指纹
- 版本四元组:版本号(29.1)+ 发布月(2026-09)+ 修订包(v2 如适用)+ 语言(英语本位/中文版)——任何 MedDRA 编码数据集的最小元数据。
- 装载指纹:ASC 文件 SHA256 + 装载脚本 commit——版本相同但装载错误会让两个「同版」库语义漂移。
- SMQ 版本:SMQ 内容随主版本更新(V29.0 调整 255 个成员 PT)——引用 SMQ 分析必须写「SMQ 版本随 MedDRA 29.0」。
- 编码对快照:autocoder 训练集是「verbatim → 编码」的历史对——训练集的编码版本分布也要入档(老数据可能是旧版编码后未迁移)。
§4.6 完整性清单
装载/迁移 MedDRA 后的自查序列:
- 五层行数与官方 What’s New 的净变更数对账(V29.0 应见 PT 27,361/LLT 91,082)。
- 编码唯一性与「永不复用」抽查——同码不得跨层出现(SOC/PT/LLT 编码空间独立但部分历史码有跨层巧合,按官方 ord 文件核对)。
- 多轴链接文件装载验证——抽 5 个已知多轴 PT(如 Cardiac arrest)验证 pt_soc 全链接 + primary 标志。
- SMQ 成员计数与官方 Introductory Guide for SMQs 附录对账。
- non-current 术语在场性——过滤逻辑是否误删历史术语。
- 语言版本抽验——中文版抽样 20 个 PT 与 WBB 在线浏览对照。
- 层级遍历完整性——每个 LLT 应恰有一个父 PT;孤儿编码检测。
§4.7 数据血缘
MedDRA 血缘(术语从何而来)
临床安全实践/监管需求
→ 用户变更申请(WebCR:新增/修改/合并/退役)
→ MSSO 医学评审(+ 蓝丝带专家/SMQ 工作组)
→ 版本发布(3 月 x.0 / 9 月 x.1,含 What's New + Version Report)
→ 语言版本同步(MSSO 翻译管护 × 28 语言)
→ 订阅分发(ASCII/JSON + WBB/API)
→ 下游装载(监管数据库/EHR 系统/autocoder/研究管线)
→ 反馈(使用问题 → 新一轮变更申请)
- 用户驱动的演化:MedDRA 的内容演化由用户变更申请驱动(V29.0 处理 1,380 条)——词典的「生长方向」反映全球药物警戒实践的真实缺口;这是活词库与冻结词库的本质区别。
- 评审的医学权威性:变更经 MSSO 医学团队 + ICH M1 PtC 工作组评审——批准率约 75%(1,042/1,380)显示评审不是橡皮图章。
- 血缘的工程落点:自建管线的每个 MedDRA 编码字段都应可追溯到「版本 + 装载日期 + 编码方法(人工/自动/混合)」三元组——信号复现争议时这是唯一仲裁依据。
§4.8 与 FAERS 公开数据的联合装载
#!/usr/bin/env python3
"""FAERS 季度公开数据 + MedDRA 本体的联合查询骨架。
FAERS 的 reac/demo/drug/outc 表经 primaryid 关联,
pt 字段即 MedDRA PT 名称(公开层无编码,需名称对齐)。"""
import pandas as pd
def load_faers_quarter(dirpath: str) -> pd.DataFrame:
"""装载一个季度 FAERS 并展开 drug/reac 关联。"""
demo = pd.read_csv(f"{dirpath}/DEMO.TXT", sep="$", engine="python")
drug = pd.read_csv(f"{dirpath}/DRUG.TXT", sep="$", engine="python")
reac = pd.read_csv(f"{dirpath}/REAC.TXT", sep="$", engine="python")
m = (demo.merge(drug[["primaryid", "caseid", "drugname",
"role_cod"]], on="primaryid")
.merge(reac[["primaryid", "pt"]], on="primaryid"))
return m
def signal_prr(df: pd.DataFrame, drug_pat: str, pt_name: str,
min_events: int = 3) -> dict:
"""PRR 信号:目标(药,PT) 计数 vs 其余——FAERS 挖掘的经典起点。"""
d = df[df.drugname.str.contains(drug_pat, case=False, na=False)]
a = (d.pt.str.upper() == pt_name.upper()).sum()
b = len(d) - a
rest = df[~df.drugname.str.contains(drug_pat, case=False, na=False)]
c = (rest.pt.str.upper() == pt_name.upper()).sum()
dd = len(rest) - c
prr = (a / (a + b)) / (c / (c + dd)) if a and c else float("nan")
return {"a": int(a), "b": int(b), "c": int(c), "d": int(dd),
"prr": round(prr, 3), "signal": bool(prr >= 2 and a >= min_events)}
if __name__ == "__main__":
# 注意:FAERS 的 pt 是字符串名——用 MedDRA 当前版名称对齐;
# 历史季度的 non-current PT 名会成孤儿 → 迁移表兜底。
print("FAERS PT 名称对齐纪律:季度文件版本 + 当前版名称映射双写")
联合要点:(1) FAERS 公开层只有 PT 名称无编码——名称对齐要处理 non-current 与改名(Version Report 是映射源);(2) PRR 只是信号初筛——narrow SMQ、分层(按报告年份/地区)与临床评估是后续必做步骤,别把初筛当结论;(3) 重复报告(duplicate case)处理是 FAERS 挖掘的前置工序——FDA 的 case 级去重逻辑要复现。
§4.9 中文语言版本的对齐检查
#!/usr/bin/env python3
"""中文版 MedDRA 与英语本位对齐抽验:同码异名同义性检查骨架。
中文版由 MSSO 管护翻译——同一 meddra_code 在中英文文件中应严格同码。"""
import csv
def load_lang_table(path: str) -> dict[int, str]:
"""装载某语言层的 (code, name) 表(按官方格式文档适配分隔符)。"""
out = {}
with open(path, encoding="utf-8") as f:
for row in csv.reader(f, delimiter="$"):
out[int(row[0])] = row[1]
return out
def audit_alignment(en: dict[int, str], zh: dict[int, str]) -> dict:
missing_en = set(en) - set(zh) # 英语有而中文缺 → 翻译滞后
extra_zh = set(zh) - set(en) # 中文有而英语无 → 装载错位
return {"en_only": len(missing_en), "zh_only": len(extra_zh),
"aligned": len(set(en) & set(zh))}
if __name__ == "__main__":
# 版本对齐前提:两份文件必须同版本同修订包;
# 历史上中文版翻译滞后英文版数周——对齐审计前先核对语言包发布日。
print("口径:翻译允许重复(英文不可唯一翻译的术语允许多中文对应)")
中文版要点:(1) 翻译滞后窗口——英文版发布与全语言包发布间隔约两周(V29.1:09-01 英文 / 09-15 全语言)——跨国双语管线要预留窗口;(2) 允许重复翻译——英文 LLT 仅大小写不同时中文译文可重复(Rh 抗体事件正是英文侧自我修正、翻译侧不动的实例);(3) 术语委员会本土化——中文版经过中国药物警戒界的使用反馈修订,纯字面对照英中发现「不一致」时先查官方翻译说明再下结论。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | MedDRA 资产 | 配套资源 | 输出物 |
|---|---|---|---|
| ICSR 个案编码 | LLT 词典 + PtC Term Selection | WHODrug(药名侧) | E2B(R3) 合规报告 |
| 安全性汇总表 | PT×主 SOC 分组 | CIOMS 表模板 | 表 14/16/18 类汇总 |
| 信号检测 | PT 计数 + SMQ | FAERS/EudraVigilance 数据 | PRR/MGPS/BCPNN 信号清单 |
| 疫苗安全性监测 | 疫苗 PT 模式 + SMQ | VAERS/JADER 数据 | AEFI 信号报告 |
| 自体编码(autocoding) | LLT/PT 词典 + 编码对 | NLP 栈 | 编码服务/人工复核队列 |
| 版本迁移审计 | MVAT + Version Report | 存量编码数据 | 迁移影响报告 |
| 医学概念映射 | SNOMED/ICD 官方映射 | OMOP/术语服务器 | 跨词库互操作层 |
| 监管提交 | 当前生效版 | E2B 网关 | 合规提交包 |
§5.2 临床试验安全性数据编码协议
- 编码时点:SAE 即时编码(24h 内报告链启动)+ 数据库锁定前全量复码——两轮编码的词典版本可以不同,锁定版为准。
- 编码员治理:医学编码员(非数据管理员兼职)+ PtC Term Selection 培训 + 双人复核抽样——编码一致性(inter-rater)是质量核心指标。
- verbatim 保真:CRF 原话一字不改进 verbatim 字段——编码是「翻译层」,翻译绝不改写原文;否则审计追踪断裂。
- 词典版本声明:临床研究报告(CSR)的安全性章节必须写 MedDRA 版本——「coded with MedDRA 29.1」是审评合规项。
- synonym 表管理:自建 synonym 表(本地高频表达 → LLT)要版本化并与官方词典变更对账—— synonym 是 autocoding 的第一生产力也是漂移源。
§5.3 信号检测协议(FAERS/EVDAS 语境)
- 计算层选择:PT 层离散统计(PRR/ROR/MGPS/BCPNN)为主流——SOC/HLT 层用于综述展示不用来检测(聚合抹平信号)。
- SMQ 双跑:目标主题先查官方 SMQ 是否存在——有则 narrow/broad 双跑 + PT 级补充;无则自建 PT 集合并公开成员清单(可复现性)。
- 分层与去重:按年份/地区/报告者分层检查信号稳定性;case 级去重(同一病例多份报告)后重算——两个步骤做不做结论可以完全不同。
- 报告率 ≠ 发生率:所有结果措辞用「报告比」不用「发生率」——处方量分母缺失(FAERS 无暴露分母)是方法学天花板。
- 信号三角验证:统计信号 + 临床个案审读 + 生物学合理性——三缺一不上决策会;MedDRA 在这里只提供第一角的计算基础。
§5.4 成本模型
| 成本项 | 学术团队 | 中型药企 | 大型 MNC |
|---|---|---|---|
| 订阅费 | 免费(MSSO 学者通道) | 中档(营业额滑档) | 高档(集团口径) |
| 人力(编码员) | 不适用/研究编码 | 2-5 名专职 | 编码团队 + 质量体系 |
| autocoder 建设 | 开源栈 + FAERS 数据 | 商业/自研 + 订阅 | 全栈 + 多语言 |
| 培训认证 | MSSO 免费 | 年度复训 | 内部培训体系 |
| 版本迁移 | MVAT + 脚本 | 专职工程师周期项目 | 跨系统治理项目 |
- 隐性成本在迁移不在词典:词典本身成本可控;版本迁移(每年 2 次)触发的下游系统回归测试是大头——迁移自动化是药企药物警戒 IT 的常设能力。
- 学术的免费通道是战略资源:大学团队合法免费拿到与 MNC 同一套词典——这在数据要素里少见,做 FAERS/EVDAS 研究的成本门槛极低。
- autocoder 的 ROI 算法:人工编码 1 条约 1-3 分钟——日均千条报告的 CRO 每年人力百万级;自动编码命中率 80% 即节省同比例——这是医疗 NLP 在药企最明确的 ROI 场景。
§5.5 失败模式清单
- 版本声明缺失:分析没写 MedDRA 版本——审稿人/审计直接退回;修复:版本四元组强制入模板。
- LLT 层做分析:把 LLT 计数当 PT 结果——同一概念被同义词重复计数数倍;修复:分析永远上卷到 PT。
- 多轴重复计数:按全链接 SOC 分组不按主轴——同一 PT 出现在多个 SOC 汇总里;修复:主 SOC 纪律或明确声明全链接口径。
- non-current 误删:装载时过滤退役术语——历史数据读不出来;修复:保留 + 状态列过滤。
- SMQ 口径漂移:跨期分析用不同版本的 SMQ——成员变更没进对账;修复:SMQ 版本随主版本锁定。
- verbatim 丢失:编码后不存原话——autocoder 训练数据与审计依据双双蒸发;修复:verbatim 字段强制保留。
- 报告率当发生率:FAERS 报告数当发病率用——方法学硬伤;修复:措辞与设计双改(处方分母数据另找)。
- 语言混码:中文报告直接套英文词典近似匹配——编码粒度与合规性双输;修复:用对应语言版本词典。
§5.6 校准与验证协议
自建编码/分析管线的分级校准协议(L1-L6):
| 级别 | 校准内容 | 方法 | 通过标准 |
|---|---|---|---|
| L1 | 词典装载 | 官方 What’s New 对账 + 完整性清单(§4.6) | 全项通过 |
| L2 | 编码一致性 | 双编码员盲评 200 条 verbatim | Cohen κ ≥0.85 |
| L3 | autocoder 精度 | 金标集(人工复核)分域评估 | 精确层 ≥99%,整体按业务阈值 |
| L4 | 信号复现 | 文献已知信号(如某经典 PRR 案例)复现 | 方向与量级一致 |
| L5 | 版本迁移 | MVAT 结果 vs 手工抽验 100 条 | 零不一致 |
| L6 | 跨源对齐 | FAERS PT 名 vs 自持编码版 | 孤儿率 <0.5% |
- L2 的 κ 值是编码质量的总开关:低于 0.85 先修 PtC 培训与 synonym 表,再谈自动化。
- L4 的「已知信号复现」:选 3-5 个监管已确认的历史信号做盲复现——管线是否能从公开数据把它们找出来;这是端到端有效性的直接证据。
§6 实证结果与方法学分析
§6.1 27 年演进的实证观察
- 规模曲线:V2.1(1999)约 1.2 万 LLT → V29.0(2026)91,082 LLT——增长主要来自检查异常、操作并发症与用药错误类术语(V29.0 的 SOC 净变更分布:检查 118/损伤中毒 114/操作 97/产品问题 99)。
- 变更吞吐:每版处理约 1,000-1,500 条申请、批准约 75%——以 V29.0(1,380/1,042)为代表;这个吞吐量说明「活词库」的更新强度。
- COVID-19 压力测试:2020-2022 的疫苗/诊断术语加速增补(Frontiers 2025 官方回顾)证明其治理结构能以远超常规的速度响应公共卫生事件——词汇治理的「应急档位」存在且被验证过。
- 粒度持续细化:从早期的粗症状概念向「机制/时序/严重度」细分演进(如药物性肝损的 RUCAM 语境、免疫相关不良事件 irAE 的专门术语群)——词典跟随医学认知细分。
§6.2 编码质量的实证教训
- 一致性水平的行业基线:双人编码 κ 值文献区间约 0.7-0.9——差距主要来自「检查异常类」与「用药错误类」的语境判断;这两类是培训的优先靶点。
- autocoder 的实证演进:从词典/规则(精确匹配 + synonym)→ 机器学习(SVM/fastText 时代)→ LLM 候选 + 规则校验——命中率逐步提升但「模糊语境的语境正确性」仍是天花板;监督标签(历史编码对)的质量约束了所有模型。
- synonym 表是隐形资产:药企内部 synonym 表的质量与 autocoder 命中率强相关——它编码了「本机构医生怎么说」的地方性知识;人员流动时这块资产要交接。
- 跨语言编码的一致性:中文/日语版的编码一致性文献相对少——本土团队的编码规范建设不能照搬英语语境 PtC 的例子,需要本地化案例库。
§6.3 方法学三层框架(gsm)
- G(Governance 治理层):ICH 治理 → MSSO 执行 → 用户申请流——术语内容的合法性来源;引用 MedDRA 数据时治理层决定「这是谁的官方口径」。
- S(Semantics 语义层):五层层级 + 多轴 SOC + SMQ 集合——语义表达力的结构性来源;分析设计时选层(LLT/PT/SMQ)是第一决策。
- M(Methodology 方法学层):编码协议 + 信号检测协议 + 版本迁移协议——把词典用到正确的方法框架里;方法学错误(LLT 分析、报告率当发生率)与词典本身无关。
- 框架用法:评估任何 MedDRA 相关交付物时依次过三层——「口径是否官方(G)→ 层级是否选对(S)→ 方法是否合规(M)」;三层各有独立的失败面。
§6.4 接力实验设计
药物警戒团队可执行的接力式验证设计(每步产出喂给下一步):
- R1 词典完整性:装载当前版 + §4.6 清单全过——产出「可信词典实例」。
- R2 编码复现:选公开案例(FAERS 知名信号或已发表论文的编码样本)复现编码——产出「编码方法有效性证据」。
- R3 信号复现:盲复现 3 个监管已确认信号——产出「端到端检测能力证据」。
- R4 版本迁移演练:MVAT 跑一遍 + 抽验——产出「迁移能力证据」。
- R5 交付:方法学段落模板(§7.7)+ 全部 R1-R4 证据入附录——审稿可回放。
§6.5 八个真实坑点
- 坑点 1:版本口径缺失——「MedDRA」不写版本 = 引用失败;版本四元组强制。
- 坑点 2:LLT 层分析——同义词重复计数;分析永远上卷 PT。
- 坑点 3:non-current 误删——退役术语是历史数据的钥匙;保留不过滤。
- 坑点 4:多轴重复计数——SOC 汇总必须按主轴或显式声明全链接口径。
- 坑点 5:SMQ 版本漂移——成员集合随版本变;SMQ 版本随主版本锁定引用。
- 坑点 6:报告率当发生率——FAERS 无分母;措辞与设计双改。
- 坑点 7:autocoder 当诊断模型——编码模型学的是「报告语言→监管语言」,不是医学因果;临床诊断是另一个任务。
- 坑点 8:语言混码——中文 verbatim 套英文词典近匹配;用中文版词典编码中文报告。
§6.6 审稿人自查清单
- MedDRA 版本(+发布月+修订包)是否声明?——未声明退回。
- 分析层是否 PT/SMQ?LLT 计数直接退回。
- SOC 分组是否主轴口径?全链接口径是否显式声明?
- SMQ 引用是否带版本?自建 PT 集合是否公开成员清单?
- FAERS 研究是否做了 case 去重与分层敏感性分析?
- 报告率措辞是否全文一致(「报告」「报告比」而非「发生率」)?
- autocoder 是否报告金标集精度与人工复核比例?
- 时间跨度分析是否做版本迁移审计(MVAT 证据)?
§6.7 版本治理的方法学含义
- 半年度断层的处理:跨越版本切换的纵向研究在切换点做敏感性分析——「切换前后各跑一遍」是最简单的稳健性检验。
- x.0 复杂变更版的特殊警惕:层级变更(如 V29.0 新 HLT)会让按 HLT 分组的历史对比失真——纵向 HLT 分析只在 x.1 版序列内做,或全序列迁移到最新版后重算。
- Version Report 的二次利用:diff 文档不仅是迁移工具,也是「术语演化研究」的一手数据——术语增补的速率与方向本身就是药物警戒学的研究对象。
- 修订包事件的方法学记忆:V29.1 v2(Rh 抗体 LLT 大小写)说明「发布即冻结」不成立——版本引用精确到修订包,装载脚本要对 zip 文件名校验。
§6.8 与国际药械监管数据源的对齐张力
- FAERS vs EudraVigilance 的报告文化差:同一药物在美欧的报告谱不同(报告制度/激励差异)——跨源信号对比是「报告行为比较」不是「安全性比较」。
- 日本 JMO 的本地化深度:日语版不只翻译还承载本地报告惯例(J-ART 遗产)——日本数据出站到全球分析时的编码习惯差异要知晓。
- 中国的接轨进程:2018 起适用 M1/E2B——本土报告数据向 MedDRA 迁移的深度逐年推进;用中国公开数据做全球对比时注意接轨时点对数据形态的影响。
- 工程含义:跨国安全性数据湖的 MedDRA 维度要存「版本 + 语言 + 报告源」三元组——单维度对齐必然在某个跨源 join 时露馅。
§6.9 术语统计的解读纪律
- 规模数字三问:见到「MedDRA 有 X 个术语」先问——哪个层(PT/LLT)?哪个版本(28.1/29.0/29.1)?是否含 non-current?三问齐答才算有效口径(PT 27,361/LLT 91,082 都是 V29.0 current 口径)。
- SMQ 的两种计数:230 个(组数)vs 97,480 条(内容记录数,V28.1 口径)——写「SMQ 覆盖近十万术语」是两个口径的混淆;组数与成员记录数分开表述。
- 增长归因的克制:LLT 年增长数千条不等于「医学概念增长」——很大比例是同义词/词形变体与语言适配;用 PT 净增(+198)讲概念增长更诚实。
- 语言数的时点性:27 vs 28 的差异源于官方页更新滞后于发布新闻——引用时标注「截至 V29.0 发布(2026-03,含丹麦语)」。
§7 AI 就绪指南与应用场景
§7.1 MedDRA 在医疗 AI 中的四种喂法
- 喂法 1:监督标签——历史编码对(verbatim → PT/LLT)做 autocoder 训练集;质量由历史编码员一致性决定。
- 喂法 2:检索词典——报告语义检索的规范化目标(把报告聚到 PT/SMQ 主题);RAG 场景的 metadata 层。
- 喂法 3:特征工程层——FAERS/EHR 事件维度按 PT/SOC/SMQ 编码进模型特征;层级上卷做特征消融。
- 喂法 4:生成校验层——LLM 生成的安全性叙述用 MedDRA 编码一致性做自动校验(生成的事件是否可编码、编码是否与文本一致)。
- 四喂法与坑点对应:喂法 1 踩坑 8(语言混码);喂法 2 踩坑 5(SMQ 版本);喂法 3 踩坑 4(多轴重复);喂法 4 踩坑 7(语境正确性)——建模前对号。
§7.2 autocoder 管线实操配方
端到端配方(报告流水 → 编码流水)
┌────────────────────────────────────────────────────┐
│ 1. 预处理:verbatim 抽取(报告字段/叙述切分) │
│ 2. 归一化:小写/去标点/缩写展开/synonym 表替换 │
│ 3. 词典精确层:归一化 LLT 索引直查(置信 0.95+) │
│ 4. 模糊层:编辑距离/向量召回 top-k 候选(0.5-0.9) │
│ 5. LLM 层:候选重排 + PtC 语境规则校验(0.3-0.8) │
│ 6. 兜底:低置信进人工队列(阈值按业务定,常见 0.8) │
│ 7. 回流:人工结果进 synonym 表/训练集(月度闭环) │
└────────────────────────────────────────────────────┘
- 阈值的经济性:自动放行阈值每提高 0.05,人工队列多 5-10% 流量——阈值是业务决策不是技术参数;按「错误编码的成本」反推。
- synonym 表的月度闭环:人工兜底的产出回流成 synonym——管线每月都在变好;没有闭环的 autocoder 六个月后就开始落后。
- 版本重载:半年度新版本发布 → MVAT 评估存量 → 词典索引重载 → 金标回归测试——固定到发布日历上(3 月/9 月各一次)。
§7.3 模型选型与迁移决策
- 词典精确层是底线资产:任何 autocoder 的第一层永远是词典+归一化——命中率 70-85%、精度 99%+、零维护成本;深度模型是增量不是替代。
- 向量召回的选择:通用句子向量(多语)对医学报告够用但编码语境(轻度/中度、检查值)弱——领域微调(用历史编码对对比学习)可显著提升 top-k 召回。
- LLM 的正确位置:候选重排与语境校验(「这个 verbatim 该编症状还是用药错误」)——生成位置上是浪费(候选集合有限,检索即可);校验位置上是杠杆(PtC 规则的语义执行)。
- 多语言策略:本地语言版词典 + 本地语报告——跨语言迁移(英文模型+翻译)是降级方案;翻译丢失的口语细节正是 LLT 层的核心信息。
§7.4 公平性:术语覆盖的边缘地带
- 罕见病术语的密度差:常见病 PT 网络密(HLGT/HLT 分层丰富),罕见病术语多为「孤 PT」——信号检测在罕见病域的聚合支撑弱,分层分析要显式处理。
- 非英语报告的粒度损耗:28 种语言里小语种版本的 LLT 覆盖弱于英语本位——同一临床事件在小语种报告里可能被迫编到更粗的 LLT;跨语言比较时这是系统性偏倚源。
- 民俗/表达差异:「上火」「着凉」类民俗病因表达无对应 PT——编码员被迫映射到最近似标准术语,表达信息在编码层丢失;本土数据挖掘要回读 verbatim 层。
- 检查类术语的数值盲区:MedDRA PT 表达「转氨酶升高」但不表达「升高到多少」——严重度信息在编码层不保留(在 E2B 其他字段);只吃 PT 特征的模型会丢失剂量-反应关系。
§7.5 任务×资源速查表
| AI 任务 | 输入 | MedDRA 资产 | 评测指标 |
|---|---|---|---|
| 自动编码(分类) | verbatim | LLT/PT 词典 + 历史编码对 | top-1 精度 / κ / 人工复核率 |
| 报告去重(聚类) | 多源同例报告 | PT/SOC 特征 | 配对 F1 |
| 信号初筛(排序) | FAERS 计数表 | SMQ 集合 + PT 层级 | 已知信号召回 |
| 叙述生成校验 | LLM 安全叙述 | 编码一致性校验 | 编码-文本一致率 |
| 事件时序抽取 | 病程叙述 | PT 词典(事件触发词) | 事件级 F1 |
| 多语编码 | 中文/日文报告 | 本地语言版词典 | 各语言分域精度 |
§7.6 端到端案例:疫苗 AEFI 信号监测管线
- 目标:用 VAERS 公开数据 + MedDRA PT 对某类疫苗的不良事件谱做季度监测。
- 数据:VAERS 公开 CSV(症状字段即 MedDRA PT 名)+ 疫苗产品字段(CVX 码)。
- 步骤:(a) PT 名对齐当前版词典(non-current 迁移表兜底)→ (b) 按疫苗×PT 建列联表 → © narrow SMQ 主题聚合(如 Anaphylactic reaction)→ (d) 分层 PRR(按年份/性别/年龄组)→ (e) 信号清单进临床审读。
- 坑点前置:去重(duplicate case)在 (b) 前;报告率措辞全文「报告比」;版本声明 VAERS 数据月 + MedDRA 词典版。
- 产出:季度信号报告(方法学段落用 §7.7 模板)——全部中间表可回放。
§7.7 报告模板:方法学段落骨架
不良事件数据分析方法学段落(可复用骨架):
「不良事件以 MedDRA 版本 X.Y(年-月,修订包 vN 如适用)编码。
分析在首选术语(PT)层进行,SOC 分组采用主系统器官分类口径。
信号初筛采用 [PRR/ROR/MGPS],计数单位为报告例次;
FAERS 数据覆盖 [季度区间],已按 FDA case 级去重逻辑处理重复报告。
检索采用官方标准化 MedDRA 查询(SMQ)「[主题]」(narrow/broad,
随 MedDRA X.Y 版本);自建检索集合的成员术语清单见附录 A。
所有结果表述为报告比而非发生率,处方分母数据不可得。
版本迁移经 MVAT 工具评估,受影响记录及处理见附录 B。」
- 骨架的六要素:版本 / 层级 / 统计口径 / 数据源与去重 / SMQ 与成员清单 / 分母限制声明——少一个要素即审稿风险点。
- 本地化建议:中文研究在此基础上补「编码语言版本(中文版词典)」与「编码员一致性(κ)」两项——国内审稿环境对编码质量的关注在上升。
§7.8 成本与排期模板
| 阶段 | 内容 | 学术团队 | 企业团队 |
|---|---|---|---|
| W1-2 | 订阅 + 词典装载 + §4.6 完整性 | 1 人 | 1-2 人 |
| W3-4 | 金标集构建 + 编码一致性(L2) | 2 人 | 编码组 |
| W5-8 | autocoder 建设与校准(L3) | 1-2 人 | NLP 组 + 编码组 |
| W9-10 | 信号检测管线 + L4 复现 | 1 人 | 数据科学组 |
| W11 | 版本迁移演练(L5) | 0.5 人 | IT 组 |
| 常设 | 半年度版本日历 + 月度 synonym 闭环 | 兼职 | 常设岗位 |
§7.9 消融案例:编码策略对信号检测的影响
- 设定:同一批 FAERS 数据,四种编码策略跑同一信号检测——A 直接用原始 PT 名;B 版本迁移后 current PT;C B + SMQ 聚合;D C + 主 SOC 分层。
- 典型结果模式:A 的孤儿 PT 造成漏计数(低估信号);B 修复对齐后信号量级恢复;C 的 SMQ 聚合把稀疏 PT 的信号聚合出来(窄域新信号出现);D 分层暴露「信号由某亚组驱动」——四步的信息增益逐级递减但定性结论逐级变准。
- 教训:编码策略不是「预处理细节」而是结果的决定性变量——发表时把策略(A-D 选型)写进方法学是可复现性的必要条件。
- 与坑点的映射:A 即坑点 3(non-current 误删的变体);C 即坑点 5 的正面用法;D 即坑点 4 的纪律执行——消融矩阵就是坑点清单的实验化。
§8 伦理、许可与合规
§8.1 许可与义务结构
- 订阅分层:监管机构免费(全球)/ 学者与医疗机构免费(MSSO)/ 商业 7 档滑动收费(年营业额基准)/ JMO 名义收费(日本医疗机构)。
- 费用流向:订阅费经 ICH MedDRA 管理委员会收取、用于 MSSO 的词典开发维护(中国药学会语境的官方解读)。
- 使用边界:订阅数据不得向未订阅第三方再分发;嵌入产品(SaaS/软件发行物)的用例需核查许可条款——「内部分析」与「对外交付」的边界在签约时明确。
- 公开数据的例外:FAERS/EudraVigilance/VAERS 公开文件中的 PT 名称与编码属于监管机构发布物——学术引用惯例允许,但整库再分发仍受各自监管机构的许可约束。
§8.2 引用与致谢模板
论文/报告引用模板:
「本研究使用 MedDRA® 版本 29.1(2026 年 9 月英文修订版 v2),
由 ICH 授权的 MedDRA MSSO 维护发布。
[如适用] FAERS 数据来自 FDA 公开发布(季度:YYYYQ1-YYYYQ4),
不良事件以 MedDRA 首选术语(PT)编码。
MedDRA® 为 ICH 注册商标;本研究的解读不代表 ICH/MSSO 立场。」
- 商标纪律:MedDRA® 是注册商标——产品名/公司名将其作为能力描述时遵循商标使用规范(不暗示官方背书)。
- 版本要素:引用含版本号+发布月+修订包——与 §3.7 纪律一致。
- 免责对称:声明「不代表官方立场」保护双方——学术惯例也是合规礼貌。
§8.3 国内合规路径
- 监管语境:中国自 2018-05-01 适用 ICH E2A/E2B/M1——本土药品上市许可持有人(MAH)的不良反应报告向 MedDRA 编码与 E2B 传输迁移。
- 订阅路径:国内企业经 meddra.org 直接订阅(按母公司年销售额滑档);国内监管机构(NMPA 体系)走监管免费通道。
- 数据出境敏感场景:跨国药企把中国临床安全性数据出境至全球安全数据库(MedDRA 编码后)——数据出境合规(个人信息保护/人类遗传资源管理)与药物警戒报告义务的双轨合规,安全数据编码本身不解决出境问题。
- 本土词典的过渡共存:部分本土体系仍有自建词典/WHO-ART 遗产——双词典并行期的映射表要版本化,最终向 MedDRA 收敛是行业方向。
§8.4 商业使用边界
- 内部研究/内部报告:商业订阅覆盖——药物警戒部门日常使用、监管提交、内部信号报告均属订阅内场景。
- 对外交付物:给客户/合作方的报告里含 MedDRA 编码数据——交付物标注词典版本即可(引用权);但把词典数据本体(编码表/层级文件)交付给未订阅方属于再分发——需要对方自行订阅。
- AI 产品嵌入:autocoder SaaS 把 MedDRA 词典嵌入服务——典型商业许可场景,签约时明确「服务输出(编码结果)」与「词典本体暴露」的边界;输出编码结果(RxCUI 式的 MedDRA 码)给客户通常允许,暴露原始词典文件通常不允许。
- 公开数据产品的红线:基于 FAERS 的公开数据产品再分发 FAERS 文件本身 + 附加 MedDRA 词典——词典部分仍是订阅内容;产品设计时把「监管公开数据」与「订阅词典」分层管理。
§8.5 合规台账最小模板
| 台账项 | 内容示例 | 更新频率 |
|---|---|---|
| 订阅信息 | 订阅主体/档位/有效期/SSA 账号 | 年度 |
| 词典版本 | 当前生产版本/历史版本清单/修订包 | 半年度 |
| 装载指纹 | 各环境 ASC SHA256/装载脚本 commit | 每次装载 |
| 数据用例 | 内部分析/监管提交/对外交付清单 | 按项目 |
| 再分发核查 | 交付物词典暴露评估记录 | 按交付 |
| 版本迁移 | MVAT 报告/迁移验证记录 | 半年度 |
| 编码质量 | κ 复评/autocoder 金标精度 | 季度 |
§8.6 术语治理的架构语义
- 治理链的完整性:ICH Steering Committee(方向)→ MSSO(执行)→ JMO(日本)→ 用户组(反馈)→ WebCR(入口)——每一环有明确职责,术语变更全程可溯;这是公共医学词库治理的黄金模板。
- PtC 的「准司法解释」地位:两份 PtC 文档不是词典本体但决定词典的正确用法——理解 MedDRA 必须同时读 PtC(编码端 Term Selection + 分析端 Data Retrieval);只读词库不读 PtC 的团队必然踩坑点 2-4。
- 变更申请的民主性与权威性的平衡:任何用户可申请(WebCR),但批准权在医学专家——V29.0 的 75% 批准率显示这个阀门工作正常;对比纯自顶向下(无用户通道)或纯民主(无医学门槛)的词库治理,MedDRA 的混合模式是少数被验证可持续的。
- 对国内词库建设的启示:编码永不复用 + non-current 而非删除 + 版本 diff 文档 + 用户变更通道——四件套成本不高而价值极大;自建医学词典的团队可以直接抄这套治理骨架。
§9 谱系与生态
§9.1 医学监管术语时间线
| 年份 | 事件 | 意义 |
|---|---|---|
| 1960s-80s | WHO-ART/COSTART/J-ART 各自发展 | 区域监管词库时代 |
| 1997-07 | ICH 命名 MedDRA | 统一化启动 |
| 1998-11 | MSSO 成立 | 治理与维护实体就位 |
| 1999-03 | V2.1 首发 | 五层结构确立 |
| 2003 前后 | EMA/MHLW/FDA 采用 | 国际标准地位 |
| 2010s | SMQ 体系成熟 | 信号检测官方化 |
| 2017 | M1 PtC 范围扩展(Companion Doc) | 指导文档体系加深 |
| 2018-05 | 中国适用 M1/E2B | 全球最大医药市场接轨 |
| 2020-22 | COVID 加速通道 | 公共卫生应急能力验证 |
| 2026-03 | V29.0 复杂变更 | +198 PT/+611 LLT;HLT 层调整 |
| 2026-09 | V29.1 + v2 修订包 | Rh 抗体消歧;28 语言同步 |
§9.2 术语表
- ICSR:Individual Case Safety Report——个案安全报告,E2B 传输的单位。
- PT(Preferred Term):首选术语——独特医学概念,分析单位。
- LLT(Lowest Level Term):低位术语——编码单位,PT 的同义词/变体。
- SOC(System Organ Class):系统器官分类——27 个平行轴。
- 主 SOC(Primary SOC):PT 的主归属轴——汇总表防重复计数的口径。
- SMQ(Standardised MedDRA Query):标准化查询组——官方预定义安全性主题 PT 集合,narrow/broad 双域。
- verbatim term:报告者原话——编码输入,必须保真存档。
- MSSO:MedDRA 维护与支持服务组织——ICH 授权的执行机构。
- JMO:日本维护组织——日语版与本地支持。
- WBB:Web-Based Browser——订阅方网页浏览器。
- MVAT:版本分析工具——版本升级影响评估。
- WebCR:变更申请门户——用户驱动的词库演化入口。
- non-current:现势性标志——退役术语保留不删、新编码不选。
- multi-axial link:多轴链接——PT 跨 SOC 的非主轴链接。
- AEFI:免疫接种后不良事件——疫苗警戒语境。
- E2B(R3):ICH 个案安全报告电子传输标准——MedDRA 的传输载体。
§9.3 资源选型决策树
需要编码不良事件吗?
├── 是 → 监管提交/临床试验? → MedDRA(唯一正解,订阅)
│ └── 预算受限学术研究? → MSSO 学者免费通道
├── 否,做信号挖掘 → 有订阅? → 直接 SMQ + PT 层
│ └── 无订阅? → FAERS/EudraVigilance/VAERS 公开 PT 层
├── 需要编码药物名 → WHODrug(MedDRA 不管药物)
├── 需要编码临床文档细节 → SNOMED CT(MedDRA 不管文档语义)
└── 需要编码疾病诊断分类 → ICD-10/11(统计分类语义)
- 决策树第一问是「要不要给监管看」:监管语境只有 MedDRA;纯研究语境才有词库选择自由。
- 词典分工的清晰边界:事件(MedDRA)/ 药物(WHODrug/RxNorm)/ 临床细节(SNOMED)/ 统计分类(ICD)——跨词典映射存在但互不替代。
§9.4 与本库其他条目的关系
| 关联条目 | 关系 | 典型联合场景 |
|---|---|---|
| RxNorm | 药物编码 × 事件编码双轴 | FAERS 挖掘的药物-事件列联表 |
| MIMIC-IV-ED | EHR 叙述 × 安全性编码 | 急诊主诉的 autocoder 训练对 |
| TCGA | 结局定义 × 术语层 | 肿瘤免疫治疗 irAE 分析 |
| DrugBank | 药物知识 × 事件术语 | 作用机制-不良事件关联研究 |
| SRA | 组学数据 × 安全性表型 | 疫苗免疫反应研究的数据链 |
§9.5 组合使用建议
- 药物警戒最小组合:MedDRA(事件)+ WHODrug 或 RxNorm(暴露)+ FAERS/EudraVigilance(数据)——三件套覆盖 90% 上市后安全性研究。
- EHR 安全性挖掘组合:MIMIC-IV-ED 叙述 + autocoder(§7.2 配方)+ MedDRA 词典——把自由文本临床数据接入监管语义层。
- 疫苗研究组合:VAERS/JADER + 疫苗 SMQ + SRA 免疫测序(机制侧)——报告层与机制层的双通道。
- 跨国数据湖组合:MedDRA 多语言版 + 版本化 schema(§4.2)+ 语言对齐审计(§4.9)——多国报告统一入库的工程底座。
§9.6 术语基础设施的生态角色
- 监管层的语义宪法:MedDRA 是药物警戒领域的「强制性共同语言」——其地位由监管制度保障而非技术优越性;理解这一点决定了对它的工程态度(合规优先于优雅)。
- 词典生态的锚点:WHODrug/SNOMED/ICD 与 MedDRA 的官方映射使其成为映射枢纽——自建词库接入监管生态的第一步是「向 MedDRA 映射」。
- AI 数据要素的特殊性:历史编码对(verbatim→编码)是 MedDRA 生态沉淀的「影子数据集」——订阅方积累的编码对是训练资产,但词典本体不是;资产边界在 §8.4 的框架内。
- 公共卫生的应急基建:COVID-19 验证了它能以周级响应新现象(新综合征术语)——「应急档位」的存在让 MedDRA 成为全球公共卫生安全网的组成部分。
§9.7 术语标准家族的光谱定位
| 维度 | MedDRA | RxNorm | HGNC | SNOMED CT |
|---|---|---|---|---|
| 对象 | 不良事件(报告语境) | 临床药物 | 人类基因 | 全临床语义 |
| 体量 | 27,361 PT / 91,082 LLT | 数万概念 | 4.4 万符号 | 数十万概念 |
| 许可 | 订阅(多轨免费) | UMLS 免费+限制 | 完全无限制 | 成员国/许可制 |
| 节奏 | 半年度 | 月度 | 月度 | 双年发布 |
| 核心机制 | 五层层级+多轴+SMQ | 成分×强度×剂型代数 | 稳定 ID+符号 | 多轴概念图 |
- 家族共性:稳定标识 + 生命周期管理 + 多源映射——与 RxNorm/HGNC 的三件套完全同构;词典工程在跨域上是同一门手艺。
- MedDRA 的独特处:它是唯一「报告语境」的词典——其余词典编码客观概念,MedDRA 编码主观报告;这个哲学差异决定其全部特殊性(§1.9)。
§9.8 MedDRA 生态的圈层地图
| 圈层 | 组件 | 角色 | 依赖关系 |
|---|---|---|---|
| 核心 | 五层术语 + 编码 + 版本流 | 语义本体 | —(本体) |
| 官方工具圈 | WBB/MVAT/WebCR/Download API/PtC 文档 | 消费与治理 | 直接绑定核心发布 |
| 数据圈 | FAERS/EudraVigilance/VAERS/JADER/临床试验 DB | 语义承载 | 以 MedDRA 为编码轴 |
| 集成圈 | E2B 网关/OMOP 映射/SNOMED/ICD 映射/WHODrug 联动 | 跨词库互操作 | 映射层 |
| 应用圈 | autocoder/信号检测系统/安全数据库/BI | 语义消费 | 经数据圈或集成圈 |
- 数据圈的公共入口:FAERS 是生态里最大的免费数据面——无订阅团队的 MedDRA 实战通常从 FAERS 开始(PT 层)。
- 圈层穿越的代价:应用圈直连核心(自建词典装载)灵活但承担全部版本治理;经集成圈(OMOP 词汇包等)省治理但多一层版本对齐——与 RxNorm 条目的圈层分析同构,结论也同构:没有免费选项,只有显式选择的代价。
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | 入口 | 用途 |
|---|---|---|
| MedDRA 官网 | https://www.meddra.org | 订阅/新闻/文档/培训 |
| ICH MedDRA 页 | https://ich.org/page/meddra | 治理结构与全景介绍 |
| SSA 自助门户 | ssa.meddra.org | 订阅申请与凭证自助 |
| WBB 浏览器 | 订阅内 | 术语在线浏览(28 语言) |
| MVAT | 订阅内 | 版本影响评估 |
| WebCR | 订阅内 | 变更申请提交 |
| Introductory Guide | 官网文档区 | 入门必读 |
| PtC Term Selection / Data Retrieval | 官网文档区(3 月版更新) | 编码端/分析端规范 |
| SMQ Introductory Guide | 官网文档区 | 信号检测查询规范 |
| MSSO 培训 | 官网培训区(多语言免费) | 团队能力建设 |
上手路径建议:(1) 先读 Introductory Guide 建立五层结构心智模型 → (2) 按角色读对应 PtC(编码员读 Term Selection、分析员读 Data Retrieval)→ (3) 用 WBB 熟悉 100 个高频 PT 的层级位置 → (4) 参加一次官方免费培训(中文场次常有)→ (5) 版本切换前完成 MVAT 演练。
§10.2 关键文献
- The role of MedDRA in global public health(Frontiers in Drug Safety and Regulation, 2025; 10.3389/fdsfr.2025.1607642)——MSSO 官方视角的历史、治理与 COVID 响应全景。
- MedDRA V29.0 What’s Updated / 官方培训材料(MSSO, 2026-03)——当版变更的权威口径(中英文版可得)。
- Introductory Guide for MedDRA / Introductory Guide for SMQs(MSSO, 随版更新)——术语结构与信号查询的官方手册。
- MedDRA Points to Consider: Term Selection / Data Retrieval and Presentation(ICH M1 PtC WG, 年度更新)——编码与分析的准司法规范。
- Bousquet/Mozzicato/Harrison 系术语学论文(2009-2014)——MedDRA 结构与多轴语义的经典学术表述。
- 中国 ICH 接轨解读(中国食品药品网, 2018)——M1/E2B 落地语境与订阅机制中文权威叙述。
§10.3 站内延伸阅读
- RxNorm 药物术语标准——事件词典的药物侧镜像;双轴数据模型的另一半。
- MIMIC-IV-ED 急诊数据集——自由文本临床叙述的富矿,autocoder 训练对来源。
- DrugBank 药物数据库——药物知识侧:机制与靶点信息,与事件谱关联分析。
- TCGA——肿瘤研究语境:irAE 分析的组学侧。
- HGNC 基因命名委员会——术语治理的基因版参照系;稳定符号纪律的跨域对照。
§10.4 FAQ
Q1:MedDRA 是免费的吗?
A:分轨——全球药监机构、学者、医疗机构免费;商业机构按年营业额 7 档滑动订阅;学术研究走 MSSO 免费通道即可(§8.1)。
Q2:MedDRA 和 ICD 有什么区别?
A:MedDRA 编码「报告中的不良事件」(症状/体征/检查异常/诊断混合组织);ICD 编码「疾病诊断」做统计分类——一个 MNC 的安全性报告用 MedDRA、流行病学归因用 ICD,分工不重叠。
Q3:编码时选 LLT 还是 PT?
A:编码选 LLT(最贴近 verbatim 的),上报与分析用 PT(LLT 的父级自动归并)——「窄进宽出」是标准姿势(§2.2)。
Q4:一个 PT 可以属于多个 SOC 吗?
A:可以(多轴链接),但只有一个主 SOC——汇总表按主 SOC 分组防重复计数(§2.3)。
Q5:non-current 的术语还能在数据里出现吗?
A:能——non-current 只是「新编码不再选它」,历史数据里的旧编码仍然合法且必须能读出来(§4.1)。
Q6:SMQ 的 narrow 和 broad 怎么选?
A:双跑——narrow 高查准(确认已知信号的量级),broad 高查全(发现新信号的面);只跑一个域都是方法学欠缺(§2.4)。
Q7:MedDRA 一年更新几次?
A:两次——3 月 x.0(可含层级复杂变更)与 9 月 x.1;9 月版约 6 周后全球生效(§3.2)。
Q8:FAERS 数据里的 PT 名和我的词典对不上怎么办?
A:FAERS 是季度快照、词典是半年度更新——用 Version Report 建「旧名→当前名」迁移表兜底;孤儿率是数据质量指标(§4.8)。
Q9:可以用 MedDRA 编码药物名称吗?
A:不可以——药物用 WHODrug(监管语境)或 RxNorm(美国市场语境);MedDRA 只管事件/病史/检查(§9.3)。
Q10:autocoder 能完全替代人工编码吗?
A:不能——当前实践是「自动 80-90% + 人工兜底 10-20%」;低置信队列的人工复核是质量闭环的必要环节(§7.2)。
Q11:中文报告怎么编码?
A:用 MedDRA 中文版词典——28 种语言共享同一套数字编码,中文编码结果与英文完全互操作;别用英文词典近匹配中文(坑点 8)。
Q12:SMQ 是什么?有多少个?
A:官方预定义的安全性主题 PT 集合(如肝毒性/过敏性反应),230 个(V29.0);每个分 narrow/broad 两域(§2.4)。
Q13:订阅费大概多少钱?
A:按母公司年营业额 7 档——小机构数百美元级(2018 年公开口径:年营业额低于 100 万美元约 162 美元/年),大型 MNC 高数个量级;报价联系 MSSO(§1.7)。
Q14:论文里怎么正确引用 MedDRA?
A:版本号+发布月+修订包三要素——「MedDRA 29.1(2026-09,English v2)」;商标标注与官方立场免责见 §8.2 模板。
Q15:MVAT 是什么?什么时候用?
A:官方版本影响评估工具——版本切换前评估「存量编码数据在新版下的受影响记录」;监管提交的版本升级是强制场景(§1.6)。
Q16:MedDRA 能编码疫苗不良事件吗?
A:能且专门优化——疫苗相关 PT 命名模式(Vaccination site X 等)+ AEFI 语境术语群;VAERS 症状字段即 MedDRA PT(§2.6)。
Q17:编码员的培训哪里来?
A:MSSO 免费培训(含中文场次)+ 两份 PtC 文档 + 官方认证课程;编码一致性(κ≥0.85)是培训效果的可测指标(§5.2)。
Q18:什么是 Weber 效应?
A:上市后头两年报告率自然攀升的现象——报告渠道激活所致,不是安全性恶化;时间趋势分析必须校正解释(§2.9)。
Q19:MedDRA 有 API 吗?
A:有 Download API(订阅内,JSON/ASCII)供程序化获取;在线查询用 WBB;无公开免费 API(公开层经 FAERS 文件间接获取 PT 数据)。
Q20:自建词典和 MedDRA 怎么共存?
A:过渡期双词典并行 + 映射表版本化;长期向 MedDRA 收敛——自建词典的新增概念若 Medicine 学界通用,可经 WebCR 申请进入官方词典(§8.3)。
Q21:LLM 能直接做 MedDRA 编码吗?
A:LLM 适合候选重排与语境校验,不适合直接生成最终编码——词典检索层(精确+归一化)承担主流量,LLM 校验 PtC 语境规则才是杠杆位置(§7.3)。
Q22:什么是多轴链接?为什么重要?
A:同一 PT 链接多个 SOC 的机制——支持多视角汇总;但分析时必须按主 SOC 或显式声明全链接口径,否则重复计数(坑点 4)。
Q23:V29.1 的 v2 修订包是怎么回事?
A:Rh 抗体 LLT 仅大小写差异导致部分系统装载失败——MSSO 发布 v2 加 ISBT 抗原符号消歧;教训是版本引用精确到修订包(§6.7)。
Q24:MedDRA 和 WHO-ART 现在是什么关系?
A:MedDRA 吸收了 WHO-ART 术语,WHO-ART 由乌普萨拉中心维护服务老系统——新项目一律 MedDRA,WHO-ART 是历史兼容层(§1.3)。
Q25:做药物基因组学研究需要 MedDRA 吗?
A:安全性结局侧需要(不良事件编码)——暴露侧用药物词典、机制侧用基因资源;MedDRA 只占结局一轴(§9.5)。
Q26:检查异常(lab abnormalities)在 MedDRA 里怎么表达?
A:Investigations SOC 专门承载(15,675 个 LLT,V29.0)——但只表达「升高/降低」方向不表达数值;数值在 E2B 其他字段(§7.4)。
Q27:术语想新增/修改怎么办?
A:WebCR 提交变更申请——V29.0 处理 1,380 条、批准 1,042 条;批准内容进下一个半年度版(§4.7)。
Q28:MedDRA 编码数据能公开分享吗?
A:词典本体不能再分发;论文引用 PT 名称/编码数是惯例允许;公开数据集设计时把监管公开数据与订阅词典分层(§8.4)。
Q29:信号检测为什么要用 PT 层而不是 SOC 层?
A:SOC 聚合抹平信号——「肝毒性」信号在 SOC 层被数千个无关 PT 稀释;SOC/HLT 用于展示,检测在 PT/SMQ 层(§5.3)。
Q30:MedDRA 的 E2B(R3) 是什么?
A:ICH 个案安全报告电子传输标准——不良事件字段以 MedDRA 编码填充;监管机构公布最低 MedDRA 版本要求(§2.5)。
Q31:COVID-19 期间 MedDRA 表现如何?
A:加速通道批量增补疫苗/诊断术语——治理结构的应急档位被实战验证;Frontiers 2025 论文有官方回顾(§6.1)。
Q32:MedDRA 编码的历史数据怎么读旧概念?
A:non-current 术语永久保留 + 全历史版本可订阅下载——老报告永远可解码;这是「永不复用编码」纪律的直接收益(§4.1)。
Q33:做中国本土药物警戒,MedDRA 和本土体系怎么衔接?
A:2018 起 NMPA 适用 M1/E2B——本土报告向 MedDRA 迁移进行中;过渡期双词典并行、映射表版本化(§8.3)。
Q34:FAERS 挖掘的 PR 阈值怎么定?
A:PRR≥2 且计数≥3 是经典初筛线——但它是「初筛」不是「确认」;分层稳定性与临床审读是必做后续(§4.8/§5.3)。
Q35:autocoder 的 synonym 表怎么维护?
A:人工兜底结果月度回流 + 版本对账——synonym 表编码「本机构医生的表达习惯」,是 autocoder 的隐形资产,人员交接必交(§6.2)。
Q36:MedDRA 未来会怎么演进?
A:官方信号——V30.0 复杂变更提案公示中;方向是术语粒度随医学认知细化(irAE/用药错误语境)与语言覆盖扩展;五层结构与治理模式稳定不变(§6.9)。
§10.5 要点回顾
- 五层结构:SOC>HLGT>HLT>PT>LLT——编码在 LLT、分析在 PT。
- 编码纪律:永不复用 + 跨语言同码——历史数据永远可读。
- 版本治理:半年度双发布 + Version Report + MVAT——版本四元组强制引用。
- 主 SOC 口径:多轴是特性,主轴是纪律——防重复计数。
- SMQ 双域:narrow 查准/broad 查全——官方预聚合优先。
- 报告语境:MedDRA 编码报告不是事实——报告率不是发生率。
- non-current 不删:退役保留——装载与过滤的工程纪律。
- 订阅生态:监管/学术免费、商业滑档——学者通道是战略资源。
- autocoder 姿势:词典层为主、LLM 校验为辅、人工闭环回流。
- 治理四件套:编码不复用/不删只退役/diff 文档/用户变更通道——自建词典直接抄。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 五层结构(SOC/HLGT/HLT/PT/LLT)+ 示例层级链 = meddra.org 官网 + Frontiers in Drug Safety and Regulation 2025(10.3389/fdsfr.2025.1607642)
- 27 SOC(平行轴)= Bousquet 等 2014(经 Frontiers 2025 综述转引)
- V28.1 基线:HLGT 337 / HLT 1,739 / PT 27,163 / LLT 90,471 / SMQ 内容记录 97,480 / 历史记录 141,148 = alVigilance 对官方 V29.0 What’s New 的转录 + MSSO 官方培训材料(中文版 PDF 001363)
- V29.0(2026-03-01 英文/03-15 翻译):变更申请 1,380(批 1,042/未批 333/暂缓 5);净增 +198 PT/+611 LLT → PT 27,361/LLT 91,082;新 HLT Poliovirus infections(合并 Poliomyelitis viral infections);用药错误 100+ LLT 重排;24 继发恶性肿瘤 LLT non-current;SMQ 230 个/无新增/255 PT 调整;丹麦语新增(共 28 语言)= MSSO 官方材料 + alVigilance/LinkedIn 转录
- SOC 净变更分布(检查 118/损伤中毒 114/产品问题 99/操作 97/先天遗传 66/感染 62)= MSSO 中文培训材料 V29.0(PDF 001363)
- SOC 级 LLT:Investigations 15,675 / Infections 7,989(primary LLTs,V29.0)= LinkedIn 转述官方口径
- V29.1(2026-09-01 英文/09-15 全语言)+ v2 修订包(2026-09-17,Rh 抗体 LLT 加 ISBT 符号:anti-E→anti-RH3/anti-e→anti-RH5)+ 2026-11-02 全球生效 = meddra.org 官方新闻(2026-09-14/17/18)
- V30.0 复杂变更提案公示(截止 2026-09-25)= meddra.org 新闻(2026-09-08)
- 历史:1997-07 命名/1998-05 管理委员会/1998-11 MSSO/1999-03 V2.1 首发;前身 COSTART/WHO-ART/J-ART/HARTS+ICD-9(-CM) = 人民日报平台 M1 解读 + Frontiers 2025
- 许可:监管机构全球免费/商业 7 档滑动(2018 口径:年营业额<100 万美元=162 美元/年)/学者与医疗机构 MSSO 免费、JMO 名义收费 = ich.org 官方页 + 中国食品药品网 2018(周思源解读)
- 语言:英语+日语本位+25 种翻译维护(ich.org)/28 种语言(V29.0 含丹麦语口径)——两口径并存按时点引用
- 中国 2018-05-01 适用 E2A/E2D/M1/E2B = 国家药监局公告经中国食品药品网报道
- 工具:WBB/MVAT/WebCR/SSA/Download API(JSON+ASCII,含 SNOMED/ICD 映射)+ PtC 两文档年度 3 月更新 + Companion Doc Release 4.0(2026-09-14)= ich.org + meddra.org
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- fda-sentinel — 共享标签:药物发现与化学 / 公共卫生与流行病学
- vaers — 共享标签:公共卫生与流行病学
- ctd — 共享标签:药物发现与化学 / 公共卫生与流行病学
- optum-clinformatics — 共享标签:药物发现与化学 / 公共卫生与流行病学
- rxnorm — 共享标签:药物发现与化学
- impc — 共享标签:公共卫生与流行病学
- intact — 共享标签:药物发现与化学
- msigdb — 共享标签:药物发现与化学
- alphamissense — 共享标签:公共卫生与流行病学
- lipid-maps — 共享标签:药物发现与化学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

