信息速览
VAERS — 疫苗不良事件报告系统 AI-Ready Wikipedia
INFOBOX
| 项目 | 内容 |
|---|---|
| 全名 | Vaccine Adverse Event Reporting System(疫苗不良事件报告系统) |
| 管护方 | CDC + FDA 共管;中央接收承包商运营;配套 VSD/CISA 体系 |
| 设立 | 1990 年 11 月(法源:1986 NCVIA 国家儿童疫苗伤害法案) |
| 系统性质 | 被动监测/自发报告——国家早期预警 + 假设生成 |
| 报告规模 | 1990: 2,214 → 2021 峰值 768,706 → 2025: 40,283(第三方加工口径) |
| 数据结构 | VAERSDATA + VAERSVAX + VAERSSYMPTOMS 三 CSV(VAERS ID 联接) |
| 症状编码 | MedDRA 首选术语(PT)——认证编码员 + 软件辅助 |
| 更新节奏 | 月度(处理至上月最后周五;2026-09-04 包处理至 08-28) |
| 许可 | 美国公共领域——免费公开;官方 Data Use Guide 为解释规范 |
| 口径变化 | 2025-05-08 起公开数据纳入 secondary reports |
| 官方入口 | https://vaers.hhs.gov/data/datasets.html (WONDER: wonder.cdc.gov) |
| 本库条目 | order 480 · record_id 580 · 类别:公共卫生与流行病学 × 医疗NLP |
§0 E-E-A-T 信任声明与免责声明
- 经验:本条目写作基于 VAERS 官方数据集页与 Data Use Guide、CDC stacks 官方安全监测手册(36403)、CDC WONDER 帮助文档、Wikipedia/PolitiFact 事实核查报道与 VaccineWatch 第三方加工口径;所有数字标注来源与口径。
- 专业性:被动监测的方法学解释(无分母、报告偏倚、不证因果)严格遵循 CDC/FDA 官方立场——本条目全文贯彻「报告数 ≠ 发生率」纪律。
- 权威性:VAERS 由美国卫生与公众服务部(HHS)体系运营;本条目为第三方百科解读,不构成疫苗安全性结论,亦不代表 CDC/FDA 立场。
- 可信度:文内数字进入文末「口径存照」;第三方加工数字(VaccineWatch 年度表)与官方原始文件区分标注。
- 免责:VAERS 报告不证明疫苗与事件的因果关系;引用本条目内容做公共传播时必须携带官方解释限制;反疫苗误用 VAERS 原始数据的行为是官方明确警告的对象。
- 时效:口径锁定 2026-09-19/20(2026-09-04 数据包发布后);月度更新以官网为准。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:美国疫苗不良事件的国家被动监测系统——任何人都可以报告「接种后发生了什么」,CDC/FDA 用它做早期预警。
- 多大:1990 至今百万级报告;2021 年(COVID 疫苗年)单年 768,706 份;常规年份 3-5 万。
- 什么结构:三张公开 CSV——报告表/疫苗表/症状表,VAERS ID 联接;症状是 MedDRA PT。
- 最大误区:报告数不是发生率——系统不记录接种总量(无分母),报告不证明因果。
- 一句话:这是全球被引用最多、也被误用最多的疫苗安全数据集——用它的第一课不是技术,是解释纪律。
§1.1 摘要
VAERS(Vaccine Adverse Event Reporting System)是美国的国家疫苗不良事件被动监测系统,1990 年 11 月依据 1986 年《国家儿童疫苗伤害法案》(NCVIA)设立,由 CDC 与 FDA 共同管理。它的制度设计极简:任何人在接种任何美国许可疫苗后发生了值得关注的事件——无论是医生、厂商还是患者本人——都可以提交报告;系统不做临床重要性判断、不做因果判断,全部接收。
报告进入中央接收设施后,由认证 MedDRA 编码员将报告中的症状语言编码为 MedDRA 首选术语(PT);严重报告(死亡/危及生命/住院/残疾,FDA 监管定义)会触发病历随访——出院小结、实验室结果、死亡证明甚至尸检报告,1 年后还有恢复状态随访信。
公开数据以三张联接的 CSV 表发布:VAERSDATA(每报告一行——人口学、日期、六个结局标志、六大自由文本字段)、VAERSVAX(每疫苗一行——类型/厂商/剂量/途径/批号)、VAERSSYMPTOMS(症状编码——每行五个 MedDRA PT 槽位)。月度更新、免费下载(需验证码),CDC WONDER 提供在线交叉分析;2025-05-08 起公开数据扩展纳入 secondary reports。
规模上,VAERS 经历了清晰的三阶段:1990 年代起步(数千份/年)、常规期基线(3-5 万份/年,2000s-2020)、大流行峰值(2021 年 768,706 份)。历史上最著名的信号是 1999 年的 RotaShield——15 例肠套叠报告触发确认研究、ACIP 撤回建议、厂商撤市,全程数月——这是被动监测「以小博大」的教科书案例。
解释纪律是 VAERS 的第一性知识:无分母(不能算发生率)、不证因果(只记录时间先后)、偏倚多重(低报+刺激性报告+诉讼驱动)、内容未核实、结局标志不互斥。CDC 官方反复警告:原始 VAERS 数据不能单独用于因果推断——但正因为它对所有报告敞开大门,它才能捕捉到「没人预料到」的罕见信号。
§1.2 战略价值
- 疫苗安全的国家级哨点:VAERS 与 VSD(主动监测)、CISA(临床评估)构成美国疫苗安全三层体系——VAERS 是唯一全人口覆盖、全开放访问的一层。
- 罕见信号的唯一捕捉网:上市前试验(数千-数万人)无法发现发生率低于万分之几的事件——只有像 VAERS 这样覆盖数亿剂次接种的被动系统才能捕捉;RotaShield 肠套叠、mRNA 过敏反应、强生 CVST 都是这条捕捉链的成果。
- 最长的疫苗安全时间序列:1990 至今 37 年、百万级报告、统一 MedDRA 编码——疫苗报告行为、政策效应(如 2021 峰值)与真实安全事件的纵向对比基线全球独此一份。
- 公共卫生传播的透明实验:任何人可提交、数据全公开——这种透明既是信任资产(官方反复强调可查证)也是误用风险(反疫苗社群滥用原始报告数);VAERS 是「数据透明与社会认知」关系的活教材。
- AI 任务的天然语料:六大自由文本字段 + MedDRA 编码结果——「报告叙述 → 结构化编码」的监督对是疫苗安全 NLP(autocoding/事件抽取/去重)的独家训练资源。
§1.3 同类数据集横向对比
| 维度 | VAERS | VSD | v-safe | FAERS |
|---|---|---|---|---|
| 性质 | 被动自发报告 | 主动监测(8 HMO 队列) | 主动短信/APP 随访 | 药物不良事件自发报告 |
| 管护 | CDC+FDA | CDC+HMO 联盟 | CDC | FDA |
| 人口覆盖 | 全美国(含部分境外) | 约 550 万成员(2000s 口径) | COVID 疫苗接种者自愿注册 | 全美国 |
| 分母可得 | 无 | 有(队列内) | 有(注册者) | 无(处方量另找) |
| 公开度 | 全公开(月度 CSV) | 受控(合作研究) | 公开(data.cdc.gov) | 公开(季度文件) |
| 数据形态 | 报告事件+MedDRA | 医疗记录+免疫登记 | 健康签到调查 | 报告事件+MedDRA |
- VAERS 与 VSD 的互补:VAERS 广而浅(全人口、无分母、假设生成);VSD 窄而深(队列内有分母、可做 incidence 与自我对照分析)——VAERS 出假设、VSD 做验证是标准接力。
- v-safe 的历史地位:COVID-19 期间的智能手机主动监测(健康签到调查)——被动系统的「主动补充」实验;其 5 表公开数据是 COVID 疫苗安全研究的独特资源。
- 与 FAERS 的同构性:同为自发报告体系、同样无分母、同样 MedDRA 编码——VAERS 的全部解释纪律原样适用于 FAERS;两个系统的数据挖掘方法学可以互换。
§1.4 版本时间轴
| 年份 | 事件 | 意义 |
|---|---|---|
| 1986 | NCVIA 通过 | 法源确立:报告义务 + VICP 补偿计划授权 |
| 1990-11 | VAERS 生效运作 | 首年 2,214 份报告 |
| 1991 | VSD 启动(CDC+4 HMO) | 主动监测体系补位 |
| 1999-07 | MMWR 报告 RotaShield 肠套叠 15 例 | 被动监测经典信号 |
| 1999-10 | ACIP 撤回建议;厂商撤市 | 从报告到行动全程约 4 个月 |
| 2001 | CISA Network 成立 | 临床评估层就位 |
| 2006 | Pediatrics 诉讼报告研究 | 报告偏倚的标志性实证 |
| 2021 | COVID 疫苗年——768,706 报告 | 历史峰值;公开关注度最高 |
| 2025-05-08 | 公开数据纳入 secondary reports | CDC/FDA 透明度扩围 |
| 2026-09-04 | 最新月度包(处理至 08-28) | 月度滚动持续 |
§1.5 应用场景矩阵
| 场景 | 用哪张表 | 关键操作 | 适配度 |
|---|---|---|---|
| 信号初筛(PRR/ROR) | 三表联接 | 疫苗×PT 列联表 + 离散统计 | ★★★★☆ |
| 结局标志监测 | VAERSDATA | DIED/HOSPITAL 标志频次趋势 | ★★★★☆ |
| 报告叙述挖掘 | VAERSDATA 文本字段 | NLP 抽取/主题聚类/autocoding 训练 | ★★★★★ |
| 批号聚集检测 | VAERSVAX | LOT 号×事件频次 | ★★★☆☆ |
| 政策效应评估 | 全库 | 时间序列断点(如 2021 峰值分解) | ★★★☆☆ |
| 去重与合并 | 全库 | case 级重复识别 | ★★★★☆ |
| 风险-获益决策 | 不适用 | 需 VSD/确认研究接力 | ★☆☆☆☆ |
| 发生率计算 | 不适用 | 无分母——制度性不可行 | ✗ 禁止 |
§1.6 组件全景
- VAERSDATA:报告主表——VAERS ID/年龄/性别/州/接种与发病日期/六个结局标志(DIED、HOSPITAL、ER_VISIT、DISABLE、L_THREAT、RECOVERED)/六大自由文本(不良事件描述、实验室数据、现病史、既往接种后事件、接种时用药、病史与过敏)。
- VAERSVAX:疫苗表——每报告每疫苗一行:类型(VAX_TYPE)/名称/厂商/剂量序号/途径/批号(LOT);一报告多疫苗多行。
- VAERSSYMPTOMS:症状编码表——每报告多行、每行 5 个 MedDRA PT 槽位(SYMPTOM1-5);编码随随访追加。
- CDC WONDER:在线分析门户——交叉表/地图/数据提取 + 文本字段全文检索;不下载文件快速探索的首选。
- VAERS 2.0 提交系统:在线报告门户(医疗专业人员与公众共用);提交即进中央接收流水。
- Data Use Guide:官方解释规范(310KB PDF)——字段定义、缩写表、解释警告;使用数据的合规底本。
- v-safe 公开数据:COVID-19 主动监测的 5 表数据(data.cdc.gov)——注册者/接种/健康签到(≥3 岁与 <3 岁)/种族民族。
- VICP 数据页(HRSA):疫苗伤害补偿的月度申领/裁定数据——VAERS 事件的经济与法律后果侧;约 60% 补偿来自和解(不判定因果)。
§1.7 被动监测的制度经济学
VAERS 的制度设计在数据要素里独树一帜,值得单独一节:
- 零门槛入口的社会选择:任何人可报、不判因果、全部接收——牺牲数据纯度换取捕捉网的最大覆盖;「宁可千次误报不可漏一次真信号」是早期预警系统的理性设计,但也意味着数据使用者必须自带过滤器。
- 法定义务与自愿报告的双轨:厂商的法定报告义务(全部知悉事件)+ 专业人员的表列事件义务 + 公众的完全自愿——三层入口里公众报告占 COVID 期增量的大头;报告者身份(REPORTER 字段)是分域分析的关键变量。
- 透明的政治经济学:全公开既是 1990s 疫苗信任危机的制度回应(NCVIA 同时解决「补偿」与「监测」两个信任问题),也是持续的内容治理挑战——反疫苗社群滥用报告数的官方警告与学术纠偏从未停止;用 VAERS 数据发公共传播内容,附带官方限制声明是伦理底线。
- 诉讼驱动报告的实例:2006 Pediatrics 研究——thimerosal/自闭症相关报告多为诉讼律师提交;「报告=健康事件」的假设在诉讼语境下失效——这提示报告者身份与诉讼周期应作为共变量进入任何严肃分析。
- 与 VICP 的语义联动:Reportable Events Table 镜像 VICP Vaccine Injury Table——报告体系与补偿体系的法律语义对齐;做 VAERS 研究时报告事件的法律地位(可补偿表列)是背景约束。
§1.8 VAERS 在疫苗安全研究流程中的定位
美国疫苗安全三层体系的数据流
┌──────────────────────────────────────────────────────────────┐
│ 接种(全美国,数亿剂次/年) │
│ ├─→ VAERS(被动):任何人 → 报告 → MedDRA 编码 → 公开 CSV │
│ │ 角色:假设生成——发现「未知未知」 │
│ ├─→ VSD(主动):8 HMO 医疗记录 → 队列/自我对照分析 │
│ │ 角色:假设检验——有分母的发生率与关联强度 │
│ └─→ CISA(临床):疑难个案 → 专科评估 → 机制研究 │
│ 角色:临床深描——机制与个体化建议 │
│ 信号接力:VAERS 出信号 → VSD/确认研究验证 → 监管行动 │
└──────────────────────────────────────────────────────────────┘
- VAERS 的输出是假设不是结论——一切严肃使用都以「接力设计」为前提:VAERS 初筛 → 确认研究 → 监管决策。
- 三层体系的分工:广度(VAERS)×深度(VSD)×临床精度(CISA)——研究设计时先问自己的问题属于哪一层的能力范围。
§1.9 独特视角:报告行为的社会学层
VAERS 编码的是「疫苗不良事件」,但它同时无意中记录了「美国公众与医疗系统如何谈论疫苗安全」——这个社会学层在 COVID 年份达到数据密度峰值:
- 2021 峰值的双重构成:768,706 份报告 = 真实不良事件(数亿剂次基数)+ 报告行为激活(媒体关注/动员报告/诉讼准备);把峰值全部读成「疫苗变危险了」或全部读成「报告文化现象」都是半截解释。
- 报告者身份的分层价值:医疗专业人员报告的临床信息质量显著高于公众报告(随访响应率与病历完整度)——分报告者身份建模是 VAERS 数据质量工程的第一刀。
- 诉讼与数据的互动:thimerosal 案例显示「诉讼→批量报告→数据面变化→更多诉讼引用」的反馈环——任何跨期分析都要把法律事件日历放进解释框架。
- 为什么这个视角重要:做 VAERS 的 NLP/统计模型时,把「报告行为」当作待建模的潜变量(而非噪声)的团队,得到的结果稳健性系统性更高——这是 COVID 年代 VAERS 研究文献最重要的方法学共识之一。
§2 医学与科学背景
§2.1 疫苗药物警戒的特殊性
- 健康人群的零容忍语境:疫苗接种于健康人(多数是儿童)——安全性阈值远低于治疗性药物;「罕见但严重」的事件(如肠套叠、心肌炎)在疫苗语境下的决策权重极高。
- 接种的时间锚定性:疫苗事件有精确的接种时间锚——「接种后 X 天内发生」是 VAERS 分析的核心时间结构(Onset Interval 字段);这是它与一般药物警戒(长期用药)的显著差异。
- 群体效应与个体归因的张力:疫苗的公共价值在群体层面(疾病消除),不良事件在个体层面——这个张力使疫苗安全的沟通比药物难一个量级;数据呈现方式(率 vs 计数 vs 时间线)直接影响公共认知。
- 多联苗与同时接种的归因难题:一针多抗原/一天多针是儿科常规——报告中的事件归因到哪个组分是内在难题;VAERSVAX 的多行结构(每疫苗一行)正是这个现实的反映。
§2.2 被动监测的流行病学语义
- spontaneous report 的本体:一份 VAERS 报告 = 「某人认为某事件发生在接种后值得报告」——它同时编码了临床事件与报告行为;后者是被动监测文献(spontaneous reporting system,SRS)的核心研究对象。
- 无分母的三层含义:不能算发生率(incidence)、不能跨疫苗比较(暴露基数不同)、不能跨期比较(接种量随年份剧变)——官方警告的完整展开;分母代理(接种剂量分布数据)需从外部源(CDC 接种覆盖率调查等)引入并声明不确定性。
- 报告概率的乘积结构:P(报告) = P(事件发生) × P(被察觉) × P(被归因于疫苗) × P(完成提交)——四因子中每个都受媒体/诉讼/指南影响;信号检测模型隐含地在校正这些因子,校正假设必须显式。
- Stimulated reporting 的定量证据:媒体事件后目标事件报告数骤增(notoriety effect)——VAERS 文献的标准识别策略是「事件前后其他事件报告数不变性」做差分对照。
§2.3 MedDRA 编码在 VAERS 的落地
- 认证编码员制度:中央接收设施的专职编码团队经 MedDRA 认证 + 编码软件辅助——不是自动化词典匹配而是「人工编码 + 工具辅助」;与制药企业 autocoder 的差异是流程而非技术。
- 编码随随访演化:初报编码基于报告内容;严重报告获得病历后追加 MedDRA 术语(如从「肝酶升高」细化为「药物性肝损伤」)——同一 VAERS ID 的症状集随时间增长是常态;跨期快照分析必须意识到这个动态。
- PT 层的使用:VAERSSYMPTOMS 的 5 槽位行结构给出 PT 名称(非编码)——与当前版 MedDRA 词典名称对齐是 ETL 第一关(non-current 旧名需迁移表)。
- 编码 ≠ 诊断:官方手册明确「MedDRA 术语不是确认的医学诊断,而是报告信息的系统编码」——把 PT 当疾病诊断是 VAERS 数据最常见的语义降级错误。
§2.4 结局标志的语义
- 六个标志的定义:DIED(接种后死亡)/ HOSPITAL(住院或延长住院)/ ER_VISIT(急诊或就诊)/ DISABLE(持续残疾)/ L_THREAT(危及生命)/ RECOVERED(已恢复)。
- Serious 的推导:FDA 监管定义的严重报告 = 死亡 ∨ 危及生命 ∨ 住院 ∨ 残疾——SERIOUS 字段与四标志的逻辑关系是数据质量核查点。
- 不互斥的工程含义:DIED 报告通常同时 HOSPITAL=Y——结局标志做频次分析时分别计数、绝不求和;「严重结局率」类自定义指标要写清代数式。
- RECOVERED 的信息量:恢复状态经 1 年随访信更新——非恢复结局的纵向负担研究(长期后遗症)可用,但注意随访响应的选择偏倚。
§2.5 报告义务的法律语义
- 厂商义务:报告全部其知悉的接种后不良事件——无论是否因果、无论是否表列;厂商是最大报告来源之一(经其药物警戒体系转发)。
- 专业人员义务:报告说明书禁忌事件 + Reportable Events Table 内事件(如过敏性休克、臂丛神经炎、脑病等,按疫苗类型列表)——表列事件与 VICP 补偿表对齐。
- 公众的无义务自由:不设门槛、不要求医学确认——公众报告是 COVID 年份增量的主要来源;三类报告者的数据质量分层是分析前提。
- 义务与自愿的边界效应:法定义务保证「表列严重事件」的下限覆盖;自愿通道保证「未预期事件」的开放捕捉——两轨缺一不可。
§2.6 信号检测方法在 VAERS 的应用
- 离散比(PRR/ROR):疫苗×PT 列联表的经典统计——注意 VAERS 的「其他疫苗」参照组混杂报告行为差异;分疫苗类内做 PRR 更稳健。
- 经验贝叶斯(MGPS/EBGM):Wikipedia 官方条目明示 VAERS 使用 empirical Bayes 数据挖掘——多维维度(疫苗×年份×年龄)收缩估计;FDA 的 FAERS 同款方法。
- 自我对照设计的边界:VAERS 无分母无法做 SCCS——接力到 VSD 的队列/病例交叉才是确认设计;「VAERS 出假设、VSD 出检验」的方法学分工。
- 聚类检测的本土工具:批号(LOT)聚集、地理聚集、时间聚集的检测目标写在官方七目标里(目标 5)——批号分析是 VAERS 独有的细粒度能力(药物警戒少见批号粒度公开数据)。
§2.7 v-safe 与主动监测的对照
- v-safe 的设计:COVID-19 疫苗接种者自愿注册、定期短信健康签到——主动抓取(含轻微事件);其 5 表公开数据(注册者/接种/签到)给出「有分母的轻事件谱」。
- 互补关系:VAERS 抓严重与意外(被动、无分母);v-safe 抓常见与轻微(主动、有注册分母)——COVID 疫苗安全的完整图景需要两者拼图。
- v-safe 的历史独特性:首个大规模 APP 式疫苗监测——其数据模型(签到调查结构)是后继主动监测系统的方法学原型。
- 研究的工程含义:COVID 疫苗安全研究的数据组合标准姿势 = VAERS(严重事件报告)+ v-safe(轻事件频率)+ VSD(发生率确认)——三源三角互证。
§2.8 疫苗犹豫语境下的数据沟通
- 误用模式图谱:绝对计数恐吓(「死亡报告 X 例」不除基数)、结局标志求和、把报告当确认、忽略背景发生率——官方与学术界的四大纠偏对象。
- 背景发生率的必要性:解读任何「接种后 X 病报告」都需要「不接种人群 X 病背景率」对照——缺血性卒中、贝尔氏麻痹等事件在未接种人群也持续发生;背景率表是 VAERS 研究的必备外源数据。
- 沟通的窗口效应:官方暂停(如强生 CVST 暂停)本身刺激报告——「监管行动 → 报告激增 → 复盘确认」的循环是 2021 年的常态;时间序列分析要含监管事件日历。
- 透明与误用的平衡:VAERS 维持全公开 + 官方持续纠偏——「透明但有解释护栏」的模式是公共健康数据治理的范本。
§2.9 报告质量的分层实证
- 严重报告的信息完备度更高:随访制度(病历索取/1 年随访信)使 DIED/HOSPITAL 报告的临床细节显著完善——严重域的分析置信度高于非严重域。
- 公众报告的验证率:非专业人员报告的信息缺失率与不可验证比例更高——REPORTER 字段分域是质量控制的第一个变量。
- 编码质量的稳定性:认证编码员 + 统一软件使 MedDRA 编码一致性好于报告输入质量——「输入噪声大、编码噪声可控」是 VAERS 数据质量的结构特征。
- 重复报告的识别:同一事件多人/多渠道报告(患者+医生+厂商)——case 级去重靠自由文本相似度 + 人口学 + 时间匹配;FDA/CDC 内部有去重流程但公开文件保留全部行——去重是用户侧功课。
§3 数据集规格
§3.1 规格总表
| 属性 | 规格 |
|---|---|
| 名称 | VAERS(Vaccine Adverse Event Reporting System) |
| 管护 | CDC + FDA 共管;中央接收承包商运营 |
| 设立 | 1990-11(1986 NCVIA 授权) |
| 性质 | 被动监测/自发报告——国家早期预警 + 假设生成 |
| 公开数据 | 三 CSV:VAERSDATA / VAERSVAX / VAERSSYMPTOMS(VAERS ID 联接) |
| 症状编码 | MedDRA PT(认证编码员 + 软件;编码随随访追加) |
| 更新节奏 | 月度(处理至上月最后周五);当年文件约周更新 |
| 口径变化 | 2025-05-08 起含 secondary reports |
| 规模 | 1990: 2,214 → 2021: 768,706 → 2025: 40,283 报告/年 |
| 许可 | 美国公共领域;Data Use Guide 为解释规范 |
| 在线分析 | CDC WONDER(wonder.cdc.gov)——交叉表/地图/文本检索 |
| 配套体系 | VSD(主动队列)/ CISA(临床)/ v-safe(APP 签到)/ VICP(补偿) |
§3.2 三表结构的口径地图
- 年度包 vs 单年 CSV:官网提供「1990-至今全历史 ZIP」与「单年度 ZIP/CSV」两种粒度——全历史包适冷启动分析、单年包适增量维护。
- 处理时点口径:每个发布包标注「处理至某周五」——同一年份的文件会随月度发布增长(随访追加编码/新报告入池);引用数据必须写「下载日期 + 处理时点」双戳。
- secondary reports 扩围(2025-05-08):此前公开数据只含每「患者×疫苗×剂量」组合的首份报告;扩围后含其他来源的首份报告——2025-05 前后的报告计数不可直接拼接对比(口径台阶)。
- 验证码机制:下载需输入网页验证码——程序化批量下载要预留交互步骤;官方 API 缺位是工程生态的长期痛点(社区工具普遍做网页解析)。
- WONDER vs 下载文件的差异:WONDER 是处理后的查询视图(含去重与标准化);下载 CSV 是原始行——两者计数可不同;论文数据源要二选一并声明。
§3.3 DAIMS 数据AI就绪度评估
| # | 维度 | 指标 | 评分(1-5) | 依据 |
|---|---|---|---|---|
| 1 | A 可获得 | 免费获取 | 5 | 公共领域、全历史免费 |
| 2 | A 可获得 | 获取流程 | 3 | 验证码交互;无正式 API |
| 3 | A 可获得 | 分发格式 | 4 | CSV/ZIP 标准;编码混杂需清洗 |
| 4 | A 可获得 | 历史版本回溯 | 4 | 全历史可得;历史文件不存档(月度覆盖) |
| 5 | D 文档 | 官方文档 | 4 | Data Use Guide + WONDER 帮助 + CDC 手册 |
| 6 | D 文档 | 口径变更透明度 | 4 | 扩围公告明确;历史口径需自行考古 |
| 7 | D 文档 | 解释限制声明 | 5 | 官方警告体系完备(同类最佳) |
| 8 | I 互操作 | 编码标准化 | 4 | MedDRA PT 全覆盖;名称对齐需迁移 |
| 9 | I 互操作 | 外部联接 | 3 | 无疫苗产品标准码(VAX_NAME 自由文本);CVX 需自映射 |
| 10 | I 互操作 | 时序一致性 | 3 | 随访追加使跨期快照漂移 |
| 11 | M 元数据 | 字段元数据 | 4 | Data Use Guide 字段表完整 |
| 12 | M 元数据 | 数据质量元数据 | 3 | 无逐行质量标志;质量靠字段推断 |
| 13 | S 可持续 | 运营持续性 | 5 | 37 年国家运营 + 法定地位 |
| 14 | S 可持续 | 生态工具 | 4 | WONDER + 社区工具丰富;官方 API 缺位 |
综合 50/70(3.6/5)——可得性与可持续满分级、互操作与工程细节受「无 API + 自由文本字段」拖累;「解释限制文档」是其文档体系的单项冠军。
§3.4 存储与计算需求
- 全历史装载:1990-2026 三表全量在 GB 级——PostgreSQL/duckdb 单机全装;VAERSSYMPTOMS 经「ID+槽位」展开后行数最大(每报告多行)。
- 增量维护:单年包数十 MB/月度更新——增量流水以「下载日期 + 处理时点」版本化;历史月份文件被新版覆盖(官方不存档历史快照)——自建快照归档是长期研究的前提。
- 文本字段的工程量:六大自由文本(最长数千字符)占存储大头——NLP 用途建议文本列与结构化列分表存储。
- 分析型内存:PRR/MGPS 全表扫描在内存 8-16GB 足够;文本 NLP 训练(autocoder)视语料规模 16-64GB。
§3.5 获取通道
- 官方下载:vaers.hhs.gov/data/datasets.html——选时段 → 输入验证码 → ZIP(三 CSV)或单 CSV。
- CDC WONDER:wonder.cdc.gov VAERS 查询——在线交叉表/地图/提取,无需下载;文本字段检索(叙述全文)仅在 WONDER 可用。
- v-safe 数据:data.cdc.gov v-safe COVID-19 数据集——5 表 CSV 直下。
- VICP 数据:HRSA 疫苗补偿页——月度申领/裁定统计。
- 社区镜像与工具:GitHub 多个 VAERS ETL 仓库(如 SQL 装载脚本集)——镜像时效性各异,正式研究仍以官方文件为准。
§3.6 口径对齐表
| 数字 | 口径 A | 口径 B | 使用建议 |
|---|---|---|---|
| 年度报告数 | VaccineWatch 加工表(2021: 768,706) | 官方文件重算(口径随处理时点漂移) | 写明加工源与下载日期 |
| 累计报告 | >120,000(2004 学术口径) | 百万级(2026 累计) | 标注时点 |
| 结局计数 | 六标志分别计数 | 不可求和(不互斥) | 求和=方法学错误 |
| 2025 前后 | pre-2025-05-08 首报口径 | 含 secondary reports | 跨界对比要声明台阶 |
| 严重定义 | FDA 四标志推导 | SERIOUS 官方字段 | 两者核对不一致行 |
| 报告者 | 法定义务(厂商/专业人员) | 自愿(公众) | REPORTER 分域分析 |
§3.7 版本选择纪律
- 「处理时点」即版本:VAERS 的版本不是年份而是「下载包的处理周五」——同一「2021 数据」在不同月份下载结果不同(随访追加);长研究锁定一次下载、全流程用同一快照。
- 快照自归档:官方覆盖历史包——自建流水必须归档每个下载快照(时间戳+ZIP 哈希);复现性靠自归档不靠官方。
- 2025-05-08 台阶:跨此日期的时间序列分析要声明 secondary reports 纳入的口径台阶——或以 2025-05 为断点做分段。
- WONDER 与文件的二选一:同一研究混用两个源会出现「计数对不上」的审计问题;选一个源贯穿全文。
- MedDRA 版本联动:编码随随访与 MedDRA 版本演化——PT 名称对齐的词典版本也要入档(与 meddra 条目的版本纪律联动)。
§3.8 数据文件与字段详表
| 文件 | 粒度 | 关键字段 |
|---|---|---|
| VAERSDATA | 每报告一行 | VAERS_ID, AGE_YRS, SEX, STATE, VAX_DATE, ONSET_DATE, NUMDAYS, DIED, HOSPITAL, ER_VISIT, DISABLE, L_THREAT, RECOVERED, SERIOUS, SYMPTOM_TEXT(叙述), LAB_DATA, CUR_ILL, HISTORY, ALLERGIES, OTHER_MEDS, PRIOR_VAX |
| VAERSVAX | 每报告×疫苗一行 | VAERS_ID, VAX_TYPE, VAX_MANU, VAX_LOT, VAX_DOSE_SERIES, VAX_ROUTE, VAX_SITE, VAX_NAME |
| VAERSSYMPTOMS | 每报告多行×5 槽 | VAERS_ID, SYMPTOM1…SYMPTOM5(MedDRA PT 名) |
| WONDER 提取 | 查询定义行列表 | 同上字段的标准化视图 + 全文检索命中 |
| v-safe 5 表 | 注册者/接种/签到 | REGISTRANT_ID, VACCINATION, HEALTH_CHECKIN_SURVEYS(含 UNDER3), RACE_ETHNICITY |
| Data Use Guide | — | 字段定义/缩写表/解释警告(310KB PDF) |
§4 数据结构
§4.1 对象模型
VAERS 公开数据模型(三表星型)
├── Report(VAERSDATA;主键 VAERS_ID)
│ ├── demographics(AGE_YRS/SEX/STATE——自由文本混合)
│ ├── timeline(VAX_DATE → ONSET_DATE → NUMDAYS 派生)
│ ├── outcomes(DIED/HOSPITAL/ER_VISIT/DISABLE/L_THREAT/RECOVERED——不互斥标志)
│ └── narratives(SYMPTOM_TEXT/LAB_DATA/CUR_ILL/HISTORY/ALLERGIES/OTHER_MEDS/PRIOR_VAX)
├── Vaccines(VAERSVAX;VAERS_ID × VAX 序号)
│ └── type/manu/lot/dose_series/route/site/name
├── Symptoms(VAERSSYMPTOMS;VAERS_ID × 行 × 5 槽)
│ └── MedDRA PT 名称(随随访追加演化)
└── 处理维度(下载日期 + 处理周五 + secondary 扩围口径)
- 星型结构的联接纪律:三表经 VAERS_ID 一对多联接——报告→症状与报告→疫苗都是一对多;联接后行数膨胀是分析最常见的意外。
- 自由文本是半张数据库:六大叙述字段承载结构化字段没有的临床细节(剂量拆分/合并用药/时间线细节)——严肃研究必须开箱文本层。
- 处理维度的元数据地位:下载日期/处理周五/扩围台阶是「看不见的第 4 张表」——不进 schema 但决定全部口径。
§4.2 三表装载与联接
#!/usr/bin/env python3
"""VAERS 年度包三表装载与星型联接(教学骨架)。
官方 CSV 为 ASCII/UTF 混合编码 + 引号内换行——pandas 读取需谨慎。"""
import pandas as pd
from pathlib import Path
def load_year(dirpath: str) -> tuple[pd.DataFrame, pd.DataFrame, pd.DataFrame]:
"""装载某年度三 CSV。字段名以官方 Data Use Guide 为准。"""
p = Path(dirpath)
data = pd.read_csv(p / "VAERSDATA.csv", low_memory=False,
encoding="cp1252", engine="python")
vax = pd.read_csv(p / "VAERSVAX.csv", low_memory=False,
encoding="cp1252", engine="python")
sym = pd.read_csv(p / "VAERSSYMPTOMS.csv", low_memory=False,
encoding="cp1252", engine="python")
for df in (data, vax, sym):
df.columns = [c.strip().upper() for c in df.columns]
return data, vax, sym
def wide_report(data: pd.DataFrame, vax: pd.DataFrame,
sym: pd.DataFrame) -> pd.DataFrame:
"""联接为「报告 × 疫苗(聚合串)× 症状(聚合串)」分析宽表。"""
vax_agg = (vax.groupby("VAERS_ID")
.agg(vax_types=("VAX_TYPE", lambda s: "|".join(sorted(set(s)))),
n_vax=("VAX_TYPE", "size"),
manus=("VAX_MANU", lambda s: "|".join(sorted(set(s.astype(str))))),
lots=("VAX_LOT", lambda s: "|".join(sorted(set(s.astype(str)))))))
sym_agg = (sym.groupby("VAERS_ID")
.agg(symptoms=("SYMPTOM1", lambda s: "|".join(s.dropna()))))
wide = data.merge(vax_agg, on="VAERS_ID", how="left") \
.merge(sym_agg, on="VAERS_ID", how="left")
return wide
if __name__ == "__main__":
d, v, s = load_year("/data/vaers/2021")
w = wide_report(d, v, s)
print(len(w), "份报告;", "含疫苗", w.n_vax.value_counts().head(3).to_dict())
装载要点:(1) 官方 CSV 存在编码混型与引号内换行——engine="python" + 显式 encoding 是起点,问题行用日志捕获;(2) 字段名先统一大写去空格再联接——年份间字段微调(新增列)要 diff 校验;(3) 联接策略「先聚合后联接」避免一对多笛卡尔膨胀。
§4.3 信号初筛:PRR 计算全流程
#!/usr/bin/env python3
"""疫苗×PT 列联表 → PRR 信号初筛(含最小计数阈值与报告者分层)。
教学骨架:生产环境加 case 去重、报告行为共变量与敏感性分析。"""
import numpy as np
import pandas as pd
def build_contingency(wide: pd.DataFrame, vax_pat: str, pt_pat: str,
serious_only: bool = True) -> dict:
d = wide[wide.vax_types.str.contains(vax_pat, case=False, na=False)]
if serious_only: # 严重域分析降低噪声报告权重
d = d[d.SERIOUS == "Y"]
a = int(d.symptoms.str.contains(pt_pat, case=False, na=False).sum())
b = int(len(d) - a)
rest = wide[~wide.vax_types.str.contains(vax_pat, case=False, na=False)]
if serious_only:
rest = rest[rest.SERIOUS == "Y"]
c = int(rest.symptoms.str.contains(pt_pat, case=False, na=False).sum())
dd = int(len(rest) - c)
prr = (a / (a + b)) / (c / (c + dd)) if a and c else float("nan")
chi2 = a * a * (a + b + c + dd) / max((a + b) * (c + dd) * 1.0, 1)
return {"a": a, "b": b, "c": c, "d": dd, "prr": round(prr, 2),
"signal_raw": bool(prr >= 2 and a >= 3 and chi2 >= 4)}
def stratified_stability(wide: pd.DataFrame, vax_pat: str, pt_pat: str,
by: str = "reporter_class") -> pd.DataFrame:
"""分层稳定性检查:报告者身份/年份分层的 PRR 方向一致性。"""
rows = []
for k, sub in wide.groupby(by):
r = build_contingency(sub, vax_pat, pt_pat)
rows.append({by: k, "prr": r["prr"], "a": r["a"]})
return pd.DataFrame(rows)
协议要点:(1) PRR≥2 + a≥3 + χ²≥4 是 Evans 传统初筛线——只做「值得看」的过滤器;(2) 严重域开关(SERIOUS=Y)是 VAERS 特有的噪声控制阀——非严重域的报告行为噪声过大;(3) 分层稳定性(报告者身份/年份)不翻转方向才算稳健信号——单层翻转即回炉;(4) 全流程措辞用「报告比」。
§4.4 文本字段清洗与 autocoding 语料构建
#!/usr/bin/env python3
"""SYMPTOM_TEXT 叙述 → autocoder 训练对的构建骨架。
训练对 =(叙述片段, VAERSSYMPTOMS 的 MedDRA PT)——注意:
编码是报告级不是句子级,需要启发式对齐或人工校准子集。"""
import re
import pandas as pd
def clean_narrative(t: str | float) -> str:
if not isinstance(t, str):
return ""
t = re.sub(r"\s+", " ", t).strip()
t = re.sub(r"unknown|n/a", "", t, flags=re.I)
return t
def build_corpus(wide: pd.DataFrame, min_len: int = 30) -> pd.DataFrame:
d = wide[["VAERS_ID", "SYMPTOM_TEXT", "symptoms"]].copy()
d["text"] = d.SYMPTOM_TEXT.map(clean_narrative)
d = d[(d.text.str.len() >= min_len) & d.symptoms.notna()]
# 报告级训练对(多标签):text → 多个 PT
d["pt_list"] = d.symptoms.str.split("|")
return d[["VAERS_ID", "text", "pt_list"]]
def dedup_pairs(df: pd.DataFrame, hash_col: str = "text") -> pd.DataFrame:
"""case 去重第一步:完全同文报告合并(重复提交识别)。"""
return df.drop_duplicates(subset=[hash_col], keep="first")
if __name__ == "__main__":
print("语料纪律:训练/验证划分按 VAERS_ID(防同事件跨集泄漏);"
"评测分报告者身份域报告")
语料要点:(1) 报告级多标签 vs 句子级对齐——直接用报告级多标签训练是安全起点;句子级对齐需要启发式(PT 名/同义词在句中定位)+ 人工校准子集;(2) 去重先行——完全同文与近似同文(编辑距离/向量)两层去重;(3) 划分按 VAERS_ID——同一事件的重复报告跨集泄漏是 VAERS NLP 最常见的评测虚高。
§4.5 元数据与可复现指纹
- 快照四元组:下载日期 + 处理周五(官方标注)+ 包文件 SHA256 + Data Use Guide 版本——VAERS 数据集的最小复现元数据。
- 年度包 diff:跨下载的同年度文件 diff(新增行/修改行)——随访追加的可观察证据;工程上用 VAERS_ID 主键对账。
- MedDRA 词典版本:PT 名称对齐所用词典版本入档——与 meddra 条目的版本四元组联动。
- 去重参数:去重算法与阈值是「研究级的隐性元数据」——不同去重强度的结果差异要进敏感性分析附录。
§4.6 完整性清单
装载年度包后的自查序列:
- 三表 VAERS_ID 交集/差集对账——SYMPTOMS/VAX 孤儿 ID 检测(已知存在少量,记录率)。
- 行数与官方页面说明核对(年度包规模随月度增长,写处理时点)。
- 结局标志值域核查——Y/N/空三分;大写/空格变体清洗。
- NUMDAYS 与 VAX_DATE→ONSET_DATE 的一致性抽验(日期解析错误高发区)。
- SYMPTOM1-5 槽位空置率——全空症状行的占比(编码缺失行)。
- 自由文本字段的编码混型扫描(U+FFFD/乱码行清单)。
- 年份字段重算与官方年表对照(VaccineWatch 级别的年度计数 sanity check)。
§4.7 数据血缘
VAERS 血缘(报告从哪来)
接种事件(全美国,数亿剂次/年)
→ 感知与归因(患者/照护者/专业人员/厂商——四类报告者)
→ 提交(在线 VAERS 2.0 / 邮寄 / 传真;厂商经药物警戒通道转发)
→ 中央接收(CDC/FDA 指导的承包商)
→ MedDRA 编码(认证编码员 + 软件;严重报告病历随访后追加编码)
→ 严重性判定(FDA 四标志定义)
→ 月度公开发布(三 CSV + WONDER 视图)
→ 下游(信号检测 / NLP 语料 / 监管评估 / 公共传播与误用)
- 血缘的核心特征是「四类报告者 × 两条提交轨」:报告者身份与提交渠道决定数据质量层——血缘建模从这两列开始。
- 编码是血缘里唯一的「专业化节点」:报告输入异质、编码输出同质——认证编码员制度是 VAERS 数据可用性的单点依赖与制度保障。
- 血缘的工程落点:下游产物(信号清单/模型)应可回溯到「报告 ID → 提交渠道 → 编码批次 → 下载快照」全链——信号复现争议的仲裁依据。
§4.8 与 CDC WONDER 的双通道使用
研究任务 → 通道选择
├── 快速探索(频次/交叉表/地图/趋势) → CDC WONDER 在线
│ 优点:标准化视图 + 全文检索;缺点:定制逻辑受限、计数口径已处理
├── 全量建模(PRR/MGPS/NLP/去重) → 官网 CSV 下载
│ 优点:原始行 + 自由文本;缺点:清洗工程 + 口径自管
└── 混合策略:WONDER 定方向 → CSV 做建模 → 计数对账时选一个源为准
- WONDER 的全文检索独占:叙述字段的关键词检索(症状描述/病历细节)只在 WONDER 有界面——定性研究的第一站。
- 计数的「双源对不上」是常态:WONDER(处理后)vs CSV(原始行)——论文数据源声明要精确到「通道 + 下载/查询日期」。
§4.9 v-safe 数据的结构化装载
#!/usr/bin/env python3
"""v-safe 公开数据(data.cdc.gov 5 表)的装载骨架。
与 VAERS 的互补分析:v-safe 有注册分母 → 轻事件频率;
VAERS 有严重事件 → 谱系互补。"""
import pandas as pd
def load_vsafe(dirpath: str) -> dict[str, pd.DataFrame]:
tables = ["REGISTRANTS", "VACCINATION",
"HEALTH_CHECKIN_SURVEYS", "HEALTH_CHECKIN_SURVEYS_UNDER3",
"RACE_ETHNICITY"]
return {t: pd.read_csv(f"{dirpath}/VSAFE_{t}.csv", low_memory=False)
for t in tables}
def symptom_frequency(checkins: pd.DataFrame) -> pd.Series:
"""签到调查的轻事件频次(有注册基数——可与 VAERS 报告数对照)。"""
sym_cols = [c for c in checkins.columns if "symptom" in c.lower()]
counts = pd.Series(dtype=int)
for c in sym_cols:
counts = counts.add(checkins[c].value_counts(), fill_value=0)
return counts.sort_values(ascending=False)
if __name__ == "__main__":
print("互补纪律:VAERS 计数(无分母)与 v-safe 频率(有分母)"
"并列呈现时必须分列、禁止混算")
互补要点:(1) 表结构为调查型(注册者→接种→签到)——联接键与 VAERS 的报告型结构完全不同;(2) 频次 vs 计数——v-safe 输出频率(分母=注册者),VAERS 输出计数(无分母);两源并表时列名与量纲要显式分离;(3) v-safe 覆盖 COVID 疫苗期——历史疫苗研究只能用 VAERS+VSD 组合。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | VAERS 资产 | 配套资源 | 输出物 |
|---|---|---|---|
| 信号初筛 | 疫苗×PT 列联表 | MedDRA 词典对齐 | PRR/ROR 信号清单 |
| 严重结局监测 | 结局标志 | 年度背景率外源 | 趋势报告 |
| 批号聚集检测 | VAERSVAX LOT | 生产批次元数据 | 聚集调查线索 |
| 叙述文本挖掘 | SYMPTOM_TEXT 等 | NLP 栈 | 事件抽取/主题/训练对 |
| 报告去重 | 全库 | 相似度工具 | case 级数据集 |
| 政策效应分析 | 时间序列 | 监管事件日历 | 断点/差分结果 |
| 疫苗安全沟通 | 官方解释限制 | 背景发生率表 | 合规分析报告 |
| 发生率计算 | 不适用 | → VSD 接力 | VAERS 内禁止 |
§5.2 信号初筛协议(VAERS 特化版)
- 域限定:先锁严重域(SERIOUS=Y)或按结局标志分域——全库混合统计的报告行为噪声最大;非严重域只做描述。
- 去重先行:case 级重复(患者+厂商+医生三重报告同事件)在列联表前完成——不去重的 PRR 在诉讼活跃域会系统性虚高。
- 报告者分层敏感性:主分析(全报告者)+ 敏感性分析(仅医疗专业人员报告)——两层方向一致才算稳健;公众报告激增期的信号要额外谨慎。
- 时间分层:按年份分层检查信号随时间的出现模式——「某年骤现」的信号优先排查刺激性报告(媒体/监管行动日历对照)。
- 背景率对照:目标 PT 的背景发生率(人群基线)对照——接种后事件数与预期背景数比较(observed vs expected)是比 PRR 更接近流行病学的一步;背景率数据外源引入。
- 接力声明:初筛输出的措辞是「值得确认研究的信号假设」——不含 VSD/确认研究接力的信号报告不进决策链。
§5.3 报告去重协议
- 三级匹配:完全同文(哈希)→ 强规则(同一患者出生日期+接种日期+事件类型)→ 模糊(文本相似度+人口学+时间窗)——逐级放宽、逐级加人工抽验。
- 多报告的语义保留:去重合并时保留「报告来源数」——同一事件被患者与医生分别报告本身是信息(严重度代理)。
- 厂商转发的识别:厂商报告里嵌原始报告者信息——转发链解开避免「厂商+原始」双计。
- 去重率的披露:论文报告「去重前/后计数」两行——去重强度是 VAERS 研究最大的自由度之一,必须披露。
§5.4 成本模型
| 成本项 | 学术团队 | 公共卫生机构 | 企业(疫苗厂商) |
|---|---|---|---|
| 数据获取 | 免费 | 免费 | 免费(另有法定报告义务成本) |
| ETL/清洗 | 1-2 人周 | 常设岗位 | 药物警戒数据团队 |
| 词典对齐 | MedDRA 订阅(学者免费) | 免费(监管) | 商业订阅 |
| 信号检测 | 开源统计栈 | 专职流行病学家 | 全套 PV 系统 |
| NLP 语料构建 | GPU + 人工校准 | 按项目 | autocoder 管线 |
| 接力验证 | 合作 VSD/研究者发起 | CDC/FDA 协作 | 确认试验 |
- 数据免费但人力密集:VAERS 的成本结构是「获取零成本、治理高成本」——清洗/去重/对齐占项目工时的大头。
- 厂商视角的义务成本:法定报告义务使厂商对 VAERS 的关系是「生产者+消费者」双角色——其 PV 系统的 VAERS 提交通道是合规基建。
§5.5 失败模式清单
- 计数当发生率——无分母铁律;修复:措辞+外源分母声明。
- 结局标志求和——不互斥;修复:分别计数。
- 跨 2025-05 台阶拼接——secondary 扩围口径断层;修复:分段或声明。
- 快照漂移——随访追加使旧结果不可复现;修复:快照自归档 + SHA256。
- 去重缺失——诉讼活跃域 PRR 虚高;修复:三级去重 + 披露。
- 联接膨胀——一对多笛卡尔;修复:先聚合后联接。
- PT 名孤儿——词典版本漂移;修复:迁移表对齐。
- 文本当结构化——叙述字段未清洗直接统计;修复:清洗管线 + 编码混型处理。
§5.6 校准与验证协议
自建 VAERS 分析管线的分级校准(L1-L6):
| 级别 | 校准内容 | 方法 | 通过标准 |
|---|---|---|---|
| L1 | 装载完整性 | §4.6 清单七项 | 全项通过 |
| L2 | 年度计数对账 | 官方/第三方年表比对 | 量级一致(±处理时点差异可解释) |
| L3 | 去重质量 | 人工盲评 200 组疑似重复 | 配对判定 κ ≥0.8 |
| L4 | 信号复现 | 已知历史信号(如 mRNA 过敏反应)盲复现 | 方向与量级一致 |
| L5 | autocoder 精度 | 人工校准子集 | 精度按业务阈值 + 分报告者域 |
| L6 | 跨源一致性 | WONDER vs CSV 计数 | 差异可归因于处理口径 |
- L4 的盲复现:选 2-3 个文献确认的信号(过敏反应/CVST)从零复现——管线有效性的端到端证据。
- L3 的 κ 值:去重是 VAERS 分析最大的主观自由度——κ 不达标先修规则再谈下游。
§6 实证结果与方法学分析
§6.1 37 年报告行为的实证观察
- 三阶段规模曲线:起步期(1990s,数千/年)→ 常规期(2000s-2020,3-5 万/年)→ 大流行期(2021 峰值 768,706 → 回落 2025 年 40,283)——报告行为与疫苗政策/媒体周期的强耦合清晰可见。
- 2021 峰值分解:接种基数(数十亿剂次中的一部分)+ 报告文化激活(公众报告通道高曝光)+ 监管事件日历(暂停/复通)——三因子叠加,任何单因子解释都失真。
- 结局标志的结构稳定:常规年份死亡报告约 150-250/年(占报告 0.4-0.6%)——严重域比例的长期稳定与报告总量的大幅波动并存,提示「报告行为变化主要发生在轻事件域」。
- 报告者构成的迁移:COVID 期公众报告占比显著上升(历史以专业人员/厂商为主)——数据质量分层的时间变化要进入任何跨期模型。
§6.2 信号检测的实证教训
- RotaShield 的教训是「小信号大行动」:15 例肠套叠(年龄模式异常)→ 确认研究 → 撤市——被动监测的价值在「模式异常」而非「计数大小」;年龄分布异常(2 月龄 vs 常见 5-9 月龄)是关键线索。
- mRNA 过敏反应的快速定量:早期报告 → CDC 快速量化(约每百万剂次若干例)→ 指南更新(观察期)——被动报告 + 外源分母的快速组合是 2021 年的方法学亮点。
- CVST 的暂停-复通循环:6 例/685 万 → 暂停 → 确认与获益-风险重估 → 复通——监管行动对报告流的反馈效应同期可见(暂停后报告激增)。
- HHE 研究的否定性价值:215 例 HHE 分析确认其自限性——被动数据也能做「排除性」结论(配合临床随访);信号检测不是只找阳性。
§6.3 方法学三层框架(gsm)
- G(Governance):NCVIA 法源 + CDC/FDA 共管 + Data Use Guide 解释规范——数据的法律地位与解释边界;任何使用先过 G 层。
- S(Semantics):三表星型 + MedDRA 编码 + 结局标志体系——数据结构的语义能力边界(报告级粒度、无分母、文本富矿)。
- M(Methodology):去重 → 分域 → 分层 → 初筛 → 接力——方法学链条的顺序纪律;顺序错误(先统计后去重)是常见硬伤。
- 框架用法:评估任何 VAERS 研究依次过三层——「口径合法(G)→ 语义选对(S)→ 方法有序(M)」。
§6.4 接力实验设计
VAERS 研究团队的接力验证设计:
- R1 快照定格:下载 + 归档 + SHA256 + §4.6 清单——产出「可信快照」。
- R2 去重定基:三级去重 + κ 校准——产出「case 级基线数据集」。
- R3 信号初筛:分域 PRR + 分层敏感性——产出「信号假设清单」。
- R4 历史信号盲复现:过敏反应/CVST 复现——产出「管线有效性证据」。
- R5 交付:方法学段落(§7.7 模板)+ 全部 R1-R4 证据 + 官方限制声明——审稿可回放。
§6.5 八个真实坑点
- 坑点 1:报告数当发生率——无分母铁律;observed vs expected 需外源背景率。
- 坑点 2:结局标志求和——不互斥标志;分别计数。
- 坑点 3:快照漂移——随访追加使同 ID 数据随月度变化;快照自归档。
- 坑点 4:去重缺失——多渠道同事件重复;三级去重 + 披露。
- 坑点 5:跨 2025-05 台阶——secondary reports 扩围断层;分段对比。
- 坑点 6:联接膨胀——一对多笛卡尔;先聚合后联接。
- 坑点 7:PT 名孤儿——MedDRA 版本漂移;迁移表对齐。
- 坑点 8:叙述字段直用——编码混型/换行/噪声;清洗管线先行。
§6.6 审稿人自查清单
- 数据源是否声明到「下载日期 + 处理时点 + SHA256」?
- 全文措辞是否「报告/报告比」而非「发生率」?
- 去重方法与去重前后计数是否披露?
- 结局标志是否分别计数(无求和)?
- 跨 2025-05-08 的分析是否处理口径台阶?
- 信号是否做了报告者分层与时间分层敏感性?
- PT 对齐所用 MedDRA 词典版本是否入档?
- 是否附官方解释限制声明(不证因果)?
- 信号结论是否明确「假设待确认」而非「因果成立」?
§6.7 版本治理的方法学含义
- 「活数据」的研究协议:VAERS 数据随随访更新——长研究的每次中期分析都要记录快照版本;「2021 数据」必须细化为「2021 年报告按 2026-09-04 包」。
- 随访追加的双刃:编码追加改善严重报告的完整度,但破坏跨期可比——「编码成熟度」(报告后月数)可作协变量;文献常用「锁定 24 月龄以上报告」做成熟度控制。
- WONDER 视图版本的隐匿更新:WONDER 后端随月度更新且无版本公告——严谨对比研究以 CSV 快照为准。
- 对国内同类系统的启示:月度覆盖式发布 + 无历史归档——是「节省存储、损失复现」的设计选择;自建监测系统的数据血缘设计可以直接以 VAERS 为反面教材归档快照。
§6.8 与国际疫苗监测体系的对齐张力
- 与 WHO VigiBase 的粒度差:VigiBase(UMC 管护)全球报告池但公开粒度受限;VAERS 全公开但美国境内为主——「公开性 × 覆盖面」的互补权衡。
- 与欧盟 EudraVigilance 的口径差:同为自发报告但报告文化/法律义务不同——跨系统报告计数比较是「报告行为比较」不是「安全性比较」。
- 中文语境的衔接:中国疫苗不良反应监测(NMPA 体系/中国药物警戒期刊口径)与 VAERS 的编码词库联动经 MedDRA——事件编码可通、报告义务与补偿体系完全不同;跨境研究要声明制度语境差异。
- 工程含义:跨国疫苗安全数据湖的「报告来源国 + 监测系统」双维度元数据不可省——单维度合并必然在解释时露馅。
§6.9 报告统计的解读纪律
- 年度计数三问:见到「某年 X 份报告」先问——数据源(官方/WONDER/第三方加工)?处理时点?含不含 secondary(2025 前后)?三问齐答才算有效口径。
- 峰值的双解释纪律:2021 的 768,706 必须同时携带「接种基数历史峰值」与「报告行为激活」两个解释——只写一个都是半截事实。
- 结局比例的分母选择:「死亡报告占全部报告 X%」的分母是报告不是接种——换成「占严重报告 Y%」或外源接种基数是不同口径;三种写法不可互换。
- 累计数的时点性:「累计百万级」随月度增长——引用累计数标注处理时点,且累计数含历史报告行为差异、不适合直接年化。
§7 AI 就绪指南与应用场景
§7.1 VAERS 在医疗 AI 中的四种喂法
- 喂法 1:autocoder 训练对——叙述文本 → MedDRA PT 的监督语料(37 年积累的「报告语言 → 编码语言」对)。
- 喂法 2:信号检测特征层——报告文本 embedding + 结构化标志进分类/聚类模型;PT 层信号与文本层信号融合。
- 喂法 3:报告质量预测——按报告者身份/文本特征预测「可验证性」——人工复核队列的优先级排序。
- 喂法 4:事件时序抽取——叙述中的时间线(接种→症状→处理→结局)抽取——NUMDAYS 之外的时间结构化。
- 四喂法与坑点对应:喂法 1 踩坑 7(PT 孤儿);喂法 2 踩坑 4(去重缺失);喂法 3 踩坑 8(文本未清洗);喂法 4 踩坑 6(膨胀)——建模前对号。
§7.2 报告叙述 NLP 管线实操配方
端到端配方(报告流水 → 模型流水)
┌────────────────────────────────────────────────────────┐
│ 1. 快照定格:下载+归档+SHA256(§4.5) │
│ 2. 清洗:编码统一/乱码行剔除/字段级去重(§4.4) │
│ 3. 语料构建:报告级多标签对 + 句子级对齐子集 │
│ 4. 划分:按 VAERS_ID 分层划分(防同事件泄漏) │
│ 5. 建模:词典层 + 向量召回 + LLM 校验(同 meddra §7.3) │
│ 6. 评测:分报告者身份域 + 分年代域报告 │
│ 7. 回流:人工校准结果 → 训练集版本化(月度闭环) │
└────────────────────────────────────────────────────────┘
- 与制药 autocoder 的差异:VAERS 叙述更口语、更不完整(公众报告)——词典层命中率低于制药流水,模糊层与人工队列占比更高;管线设计按「口语域」调参。
- 年代域漂移:1990s 报告语言 vs 2020s 报告语言(新疫苗词汇/网络语言)——分年代评测与增量学习是长期管线的必备设计。
- 评测的金标来源:VAERSSYMPTOMS 的官方编码本身就是金标(编码员产出)——但要注意「官方编码含随访追加」——训练对按编码成熟度过滤(如锁定 12 月龄以上报告)。
§7.3 模型选型与迁移决策
- 词典精确层仍是底线:MedDRA PT 名/同义词直配 + 拼写纠错——零训练成本的 50-70% 命中;先建词典层再谈深度模型。
- 向量召回的领域适配:通用句子向量对口语叙述召回不足——用 VAERS 语料对比学习微调;多年代语料防过拟合当代语言。
- LLM 的位置:候选重排 + 时间线抽取 + 质量预测——生成 PT 是浪费(候选有限);抽取结构化时间信息是杠杆。
- 小模型部署的现实:公共卫生机构的算力预算有限——词典+轻量向量(蒸馏)栈是可持续配置;LLM 仅离线批处理。
§7.4 公平性:报告覆盖的边缘地带
- 报告可达性的分层:英语能力/医疗资源/诉讼文化影响报告概率——不同社群的「真实事件 → 报告」转化率不同;基于 VAERS 的跨群体比较隐含报告可达性偏倚。
- 儿童报告的过表达:儿童疫苗接种率与家长报告意愿双高——儿童事件在库内过表达(2004 口径:49% 报告 <6 岁);成人疫苗研究要意识到基线的年龄结构。
- 语言与叙述质量:非英语母语者的叙述质量与编码粒度差异——autocoder 的分语言评测(英语内分群)是公平性审计点。
- 疫苗覆盖的时空差:疫苗引入时间表决定各疫苗的报告基数——「新疫苗报告多」主要是覆盖问题不是安全问题;模型特征里加疫苗上市年数。
§7.5 任务×资源速查表
| AI 任务 | 输入 | VAERS 资产 | 评测指标 |
|---|---|---|---|
| 自动编码(多标签) | SYMPTOM_TEXT | VAERSSYMPTOMS 金标 | macro-F1 / 分域 F1 |
| 重复报告识别 | 全库文本+人口学 | 时间/人口学约束 | 配对精确率/召回 |
| 严重度预测 | 叙述+结构化 | 结局标志 | AUROC(分结局) |
| 时间线抽取 | 叙述 | NUMDAYS 抽验 | 事件级 F1 |
| 信号排序 | 列联表+文本特征 | 历史确认信号 | 已知信号召回 |
| 报告质量分类 | 文本+元数据 | 随访响应(代理金标) | 校准曲线 |
§7.6 端到端案例:新疫苗上市后的信号监测
- 目标:某新疫苗上市后 12 个月内,用 VAERS 数据建立信号监测流水。
- 数据:上市后各月度包快照(自归档)+ MedDRA 词典 + 背景发生率表(外源)。
- 步骤:(a) 月度快照装载与对账 → (b) case 去重 → © 分域(严重/非严重)PT 频次监控 → (d) PRR 初筛 + 分层敏感性(报告者/月份)→ (e) 观察比预期(O/E,外源背景率)→ (f) 信号假设清单 → 确认研究接力。
- 坑点前置:快照归档(坑点 3);去重先行(坑点 4);措辞纪律(坑点 1)。
- 产出:月度信号简报(方法学段落用 §7.7 模板)——全部中间表可回放。
§7.7 报告模板:方法学段落骨架
VAERS 数据分析方法学段落(可复用骨架):
「本研究使用 VAERS 公开数据(vaers.hhs.gov,下载日期 YYYY-MM-DD,
处理时点 YYYY-MM-DD[官方标注],文件 SHA256 见附录)。
分析覆盖 [年份区间] 年报告;2025-05-08 口径台阶的处理方式为 [分段/声明]。
重复报告经 [三级去重方法] 处理,去重前/后计数分别为 X/Y。
症状以 MedDRA 首选术语编码(对齐词典版本 Z)。
信号初筛采用 [PRR/ROR],限定 [严重域/全域],
分层敏感性分析包括 [报告者身份/年份]。
本文所有结果为报告计数与报告比,不代表发生率或因果关系;
接种分母数据不可得,observed/expected 分析所用背景率来自 [外源]。
本研究的解释遵循 VAERS Data Use Guide 的官方限制。」
- 骨架的九要素:快照/区间/台阶/去重/词典/统计/分层/分母声明/官方限制——少一项即审稿风险点。
- 本地化建议:中文研究补「疫苗名称对齐(VAX_NAME 自由文本 → 标准名/CVX)」的方法说明——这是 VAERS 特有的对齐坑。
§7.8 成本与排期模板
| 阶段 | 内容 | 学术团队 | 机构团队 |
|---|---|---|---|
| W1 | 快照下载+归档+装载 | 1 人 | 1-2 人 |
| W2-3 | 清洗+对齐+完整性(L1-L2) | 1 人 | 数据组 |
| W4-5 | 去重+κ 校准(L3) | 1-2 人 | 流行病学组 |
| W6-8 | 信号初筛+历史复现(L4) | 1 人 | 数据科学组 |
| W9-10 | NLP 语料+autocoder(L5,可选) | 1-2 人 | NLP 组 |
| 常设 | 月度快照日历+年度词典对齐 | 兼职 | 常设岗位 |
§7.9 消融案例:去重与分层对信号结论的影响
- 设定:同一疫苗-PT 对的信号检测,四种流水跑——A 原始计数;B 去重后;C B+严重域限定;D C+报告者分层敏感性。
- 典型结果模式:A 的信号强度最高(重复+噪声报告推高);B 去重后回落(诉讼活跃域回落最猛);C 严重域内信号可能反向变化(噪声主要在轻事件域);D 分层暴露「公众报告驱动」或「专业人员报告驱动」——四步的结论从「强信号」收敛到「条件化信号假设」。
- 教训:VAERS 的「流水自由度」(去重/分域/分层)比统计方法选择更影响结论——发表时把流水选型写进方法学是可复现性的必要条件。
- 与坑点的映射:A 即坑点 4;C 即坑点 1 的域限定缓解;D 是坑点 1 的结构化应对——消融矩阵就是坑点清单的实验化。
§8 伦理、许可与合规
§8.1 许可与义务结构
- 公共领域地位:美国政府工作报告数据——无版权限制、免费使用;但官方 Data Use Guide 的解释限制是使用规范(合规且专业的引用底线)。
- 隐私的先天设计:VAERS 公开数据经 HHS 隐私评审(2025-05-08 扩围公告明示「保护患者隐私前提下扩大访问」)——仍含人口学与文本细节,二次发布分析结果时避免「小格子再识别」(稀疏层级的州×年龄×结局组合)。
- 报告者的贡献伦理:报告人是数据的生产者——对报告内容的研究使用不以「批评报告者」为叙事(报告质量研究的专业措辞)。
- 疫苗伤害语境的敏感叙事:VICP 补偿数据与 VAERS 联动分析涉及其家庭成员的重大利益——发表与传播遵循最大克制与官方口径。
§8.2 引用与致谢模板
论文/报告引用模板:
「本研究使用 VAERS 公开数据(CDC/FDA 管护,vaers.hhs.gov,
下载日期 YYYY-MM-DD,处理时点 YYYY-MM-DD)。
VAERS 是被动监测系统:报告不证明因果,数据不含接种分母,
不能用于计算发生率或比较疫苗风险。
本研究全部结论为报告层面的统计学描述,遵循 VAERS Data Use Guide
的官方解释限制;不代表 CDC/FDA 立场。」
- 限制声明的不可裁剪性:官方限制段是引用模板的必要组成——裁剪限制声明的 VAERS 引用即合规风险。
- 商标与机构名:VAERS/CDC/FDA 名称使用遵循美国政府机构命名规范(不暗示官方背书)。
§8.3 国内合规路径
- 数据获取:VAERS 全公开——国内团队直接下载合法;分析在境内环境进行即可。
- 疫苗安全研究的制度语境:中国的不良反应监测(NMPA 体系)与 VAERS 制度不同(报告义务/补偿体系/公开粒度)——比较研究必须声明制度差异,避免「制度 A 的指标套制度 B 的数据」。
- 公共传播的红线:将 VAERS 原始报告数直接翻译成中文公共传播内容(「美国疫苗 X 死亡报告」类标题)——既违反官方解释限制也触及国内疫苗安全传播规范;学术引用必须携带限制声明。
- 与本土数据组合:VAERS(美国报告)× 中国监测数据(受限公开)的组合研究——公开度不对等的比较设计要显式建模「报告制度」变量。
§8.4 商业使用边界
- 公共领域的产品化:VAERS 数据可进入商业分析产品(BI/咨询报告)——但产品输出必须携带官方限制(不能卖「疫苗风险排名」类无分母结论)。
- AI 产品嵌入:基于 VAERS 训练的 autocoder/监测模型可商业化——训练语料的公共领域属性清晰;模型输出继续遵循「报告层语义」。
- 咨询与诉讼支持:VAERS 数据在疫苗诉讼中的使用是敏感区——专家证人场景的引用要区分「报告事实」与「因果主张」,后者在 VAERS 数据内无证据地位。
- 媒体产品的纪律:数据新闻产品使用 VAERS 需内嵌限制声明与官方链接——透明化处理是行业自律基准。
§8.5 合规台账最小模板
| 台账项 | 内容示例 | 更新频率 |
|---|---|---|
| 快照档案 | 下载日期/处理时点/SHA256/包清单 | 每次下载 |
| 词典对齐 | MedDRA 版本/迁移表版本 | 半年度 |
| 去重参数 | 算法/阈值/κ 评审计录 | 每次流水变更 |
| 数据用例 | 内部分析/发表/产品输出清单 | 按项目 |
| 限制声明核查 | 产物限制段完整性抽查 | 每次发布 |
| 口径台阶 | 2025-05-08 前后分段记录 | 一次性+持续引用 |
§8.6 监测系统的治理语义
- 法源驱动的稳定运营:NCVIA 法案授权 + 37 年连续运营——法定地位使系统穿越政治周期与技术更替;这是「制度型数据基础设施」的范本。
- 双机构共管的制衡:CDC(公共卫生视角)+ FDA(监管视角)共管——机构制衡减少单一视角偏差;数据发布口径的一致性经共管维持。
- 透明与纠偏的并行机制:全公开 + 官方持续纠偏(Data Use Guide/WONDER 提示/学术合作纠偏)——「透明但有护栏」是争议性公共数据的治理范式。
- 对国内监测系统建设的启示:任何人可报的零门槛入口 + 认证编码的中央处理 + 月度公开的滚动发布 + 官方解释限制的随行文档——四件套成本可控而公信力收益极高;自建不良事件监测系统可直接参照。
§9 谱系与生态
§9.1 疫苗安全监测时间线
| 年份 | 事件 | 意义 |
|---|---|---|
| 1950s-70s | 疫苗诉讼潮与厂商退出 | 制度设计的动因 |
| 1986 | NCVIA 通过 | 报告义务+VICP 补偿双轨确立 |
| 1990-11 | VAERS 生效 | 被动监测启动(首年 2,214 报告) |
| 1991 | VSD 启动 | 主动监测补位 |
| 1999 | RotaShield 事件 | 被动监测经典信号→撤市 |
| 2001 | CISA Network | 临床评估层 |
| 2006 | 诉讼报告研究 | 报告偏倚实证 |
| 2020-21 | COVID 疫苗+v-safe | 峰值 768,706;主动监测实验 |
| 2025-05-08 | secondary reports 扩围 | 公开口径扩围 |
| 2026-09 | 月度滚动(处理至 08-28) | 37 年连续运营 |
§9.2 术语表
- 被动监测(passive surveillance):等待报告上门的监测模式——广覆盖、无分母、有偏倚。
- AEFI:免疫接种后不良事件——疫苗警戒的核心对象。
- NCVIA:1986 国家儿童疫苗伤害法案——VAERS 与 VICP 的共同法源。
- VICP:疫苗伤害补偿计划——无过错补偿制度;HRSA 管护。
- Reportable Events Table:法定报告事件表——镜像 VICP 疫苗伤害表。
- Serious(FDA 定义):死亡/危及生命/住院/残疾四选一即为严重报告。
- MedDRA PT:首选术语——VAERS 症状编码的词典层。
- Onset Interval(NUMDAYS):接种到发病的天数——时间结构核心字段。
- VSD:疫苗安全数据链——8 HMO 主动监测队列(有分母)。
- CISA:临床免疫安全评估网络——疑难个案临床评估。
- v-safe:COVID 期 APP 主动监测——有分母的轻事件谱。
- secondary report:同患者×疫苗×剂量组合的其他来源首份报告(2025-05 纳入公开)。
- 刺激性报告(stimulated reporting):媒体/监管/诉讼驱动的报告激增。
- 观察比预期(O/E):观察报告数与背景预期数之比——外源分母的近似。
- WONDER:CDC 在线查询系统——VAERS 的标准化视图通道。
- 批号聚集(lot clustering):同批号报告异常聚集——VAERS 独有细粒度检测。
§9.3 资源选型决策树
疫苗安全研究需要什么?
├── 全人口假设生成/叙述语料 → VAERS(被动、公开、无分母)
├── 有分母的发生率/确认研究 → VSD(合作)或 O/E(外源背景率)
├── 轻事件频率(COVID 疫苗期) → v-safe(公开 5 表)
├── 疑难个案临床机制 → CISA 文献(案例库)
├── 补偿/法律后果 → VICP(HRSA 月度数据)
└── 药物(非疫苗)不良事件 → FAERS(同构方法学)
- 第一问是「要不要分母」:要分母 → VAERS 单独不可行(接力 VSD/O/E);不要分母(计数/叙述/去重/NLP)→ VAERS 直接可用。
§9.4 与本库其他条目的关系
| 关联条目 | 关系 | 典型联合场景 |
|---|---|---|
| MedDRA 监管活动医学词典 | 编码词典 × 报告数据 | PT 对齐迁移表;SMQ 主题分析 |
| RxNorm 药物术语标准 | 疫苗产品码联动 | CVX/RxNorm 疫苗概念映射 |
| MIMIC-IV-ED 急诊数据集 | 临床叙述 × 事件报告 | 接种后急诊的对照分析 |
| All of Us 研究计划 | 队列接种记录 × 报告数据 | 有分母的接力验证 |
| SRA 序列档案 | 病原基因组 × 疫苗监测 | 疫苗株/野株演化背景 |
§9.5 组合使用建议
- 疫苗安全最小组合:VAERS(报告)+ MedDRA(词典)+ 外源背景率——信号初筛的标准三件套。
- 确认研究组合:VAERS 假设 + All of Us 或 VSD 式队列 + 电子接种记录——有分母的接力验证。
- NLP 语料组合:VAERS 叙述 + MedDRA 词典 + MIMIC-IV-ED 叙述——口语临床文本的广谱训练池。
- COVID 疫苗专项组合:VAERS + v-safe + VSD 文献——严重/轻微/发生率三源拼图。
§9.6 监测基础设施的生态角色
- 疫苗信任的制度装置:VAERS 的存在本身是 1986 妥协的产物(给厂商责任保护、给公众监测透明)——它同时服务监管、研究与公共信任三种功能。
- 自发报告体系的方法学母版:FAERS/VigiBase 等同构系统的方法学(去重/初筛/接力)在 VAERS 文献里最充分展开——方法学可整体迁移。
- AI 语料的独特性:37 年口语化临床叙述 + 官方编码——「公众怎么描述症状」的语料库在医学 NLP 里稀缺,VAERS 是最大开源池之一。
- 公共卫生应急的预设通道:大流行疫苗的快速监测能力(COVID 实战验证)——新疫苗上市的第一道监测网全球范例。
§9.7 监测数据家族的光谱定位
| 维度 | VAERS | FAERS | VigiBase | v-safe |
|---|---|---|---|---|
| 对象 | 疫苗 AEFI | 药物 AE | 全球药物+疫苗 AE | COVID 疫苗轻事件 |
| 模式 | 被动 | 被动 | 被动(聚合) | 主动签到 |
| 分母 | 无 | 无 | 无(聚合层) | 有(注册者) |
| 公开 | 全公开 CSV | 公开季度文件 | 受控访问 | 公开 5 表 |
| 编码 | MedDRA | MedDRA | MedDRA(ICH 语境) | 调查选项 |
- 家族共性:被动报告 × MedDRA × 无分母——VAERS 的全部解释纪律跨系统成立;做惯 FAERS 的团队迁移 VAERS 零方法学成本。
- VAERS 的独特处:全公开粒度(行级)+ 37 年时间深度 + 疫苗批号字段——药物监测系统无对应物。
§9.8 VAERS 生态的圈层地图
| 圈层 | 组件 | 角色 | 依赖关系 |
|---|---|---|---|
| 核心 | 三 CSV 公开数据 + WONDER | 数据本体 | —(本体) |
| 官方配套圈 | Data Use Guide/v-safe/VICP 页 | 解释与配套 | 官方发布体系 |
| 监测体系圈 | VSD/CISA | 验证与临床 | 接力验证通道 |
| 词典圈 | MedDRA/CVX | 语义对齐 | 编码与产品码 |
| 应用圈 | 信号检测/学术研究/BI 产品/公共传播 | 语义消费 | 经核心+词典圈 |
- 官方配套圈的独有厚度:Data Use Guide 的解释限制体系在同生态里最厚——「数据 + 反误用文档」的双件套是 VAERS 治理特色。
- 圈层穿越的代价:应用圈直连核心(跳过词典圈)必然踩 PT 孤儿与产品名自由文本——词典圈不是可选项是必经层;与 meddra/rxnorm 条目的圈层结论同构。
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | 入口 | 用途 |
|---|---|---|
| 数据集页 | https://vaers.hhs.gov/data/datasets.html | 三 CSV 年度包下载 |
| VAERS 主站 | https://vaers.hhs.gov | 报告入口/公告/指南 |
| Data Use Guide | 数据集页附 PDF(310KB) | 字段定义+解释限制 |
| CDC WONDER | https://wonder.cdc.gov/wonder/help/vaers.html | 在线交叉分析+全文检索 |
| CDC 手册 | stacks.cdc.gov/view/cdc/36403 | 系统运作官方长文 |
| v-safe 数据 | data.cdc.gov(v-safe COVID-19) | 主动监测 5 表 |
| VICP 数据 | HRSA vaccinecompensation 页 | 补偿申领月度数据 |
| ICH/MedDRA | meddra.org(经订阅) | 症状编码词典 |
上手路径建议:(1) 读 Data Use Guide(30 分钟)建立解释纪律 → (2) WONDER 交互探索年度趋势 → (3) 下载最近三年 CSV 做装载演练(§4.2)→ (4) 用历史确认信号做复现校准(§5.6 L4)→ (5) 上线月度快照日历。
§10.2 关键文献
- Safety monitoring in the Vaccine Adverse Event Reporting System(CDC stacks 36403)——系统运作、编码流程与七目标的官方长文。
- VAERS Data Use Guide(CDC/FDA,随数据发布更新)——字段定义与解释限制的规范文件。
- MMWR 1999-07-16(RotaShield 肠套叠)——被动监测经典信号的首发报告。
- Du Vernoy 2000(HHE 分析)——VAERS 队列式专题研究的范式示例。
- Pediatrics 2006(thimerosal 诉讼报告研究)——报告偏倚的标志性实证。
- PolitiFact 2021(VAERS 事实核查专题)——系统价值与误用的平衡叙述(含 Offit/Shimabukuro 引述)。
- VaccineWatch Methodology(第三方,2026)——现代 VAERS 数据工程流程的公开参考实现。
§10.3 站内延伸阅读
- MedDRA 监管活动医学词典——VAERS 症状编码的词典底座;版本对齐联动。
- RxNorm 药物术语标准——疫苗产品概念的标准码侧。
- MIMIC-IV-ED 急诊数据集——接种后急诊事件的临床对照侧。
- All of Us 研究计划——有分母队列的接力验证侧。
- SRA 序列档案——病原株监测的基因组背景侧。
§10.4 FAQ
Q1:VAERS 数据免费吗?
A:免费且公共领域——官网下载(需验证码)、WONDER 在线查询、v-safe/VICP 数据全公开。
Q2:VAERS 报告能证明疫苗导致不良事件吗?
A:不能——系统只记录时间先后;因果判定需要确认研究。这是官方 Data Use Guide 的第一条限制。
Q3:为什么不能用 VAERS 算发生率?
A:没有分母——系统不记录接种总剂量;报告数 ÷ 未知基数 = 无意义。分母要从外部接种数据引入并声明不确定性。
Q4:谁可以向 VAERS 报告?
A:任何人——医疗专业人员、厂商(后两者含法定义务场景)、患者、父母/照护者;不要求医学确认。
Q5:报告是怎么编码的?
A:中央接收设施的认证 MedDRA 编码员 + 软件辅助——症状编码为 MedDRA PT;严重报告获病历后编码可追加。
Q6:Serious 是怎么定义的?
A:FDA 监管定义——死亡/危及生命/住院或延长住院/持续残疾四选一;公开数据有 SERIOUS 字段可直用。
Q7:三个 CSV 怎么联接?
A:VAERS_ID——DATA(每报告一行)×VAX(每疫苗一行)×SYMPTOMS(每行 5 个 PT);一对多联接先聚合再连接防膨胀。
Q8:2025 年 5 月的数据口径变化是什么?
A:2025-05-08 起公开数据纳入 secondary reports(同患者×疫苗×剂量组合的其他来源首份报告)——跨界时间序列要声明台阶。
Q9:同一事件会重复报告吗?
A:会——患者、医生、厂商可分别报告同一事件;去重是用户侧功课(三级匹配协议,§5.3)。
Q10:结局标志可以加总吗?
A:不可以——标志不互斥(死亡报告通常同时住院=Y);分标志计数、不求和。
Q11:VAERS 里为什么有「死亡报告」这么多?
A:死亡报告经病历/尸检随访核实流程——「报告死亡」不等于「疫苗致死」;背景死亡率与接种基数解释大部分报告。
Q12:怎么下载历史年份?
A:官网提供 1990 至今每年 ZIP 与全历史包;注意官方覆盖历史月度包——自建快照归档保复现。
Q13:WONDER 和 CSV 文件计数对不上?
A:正常——WONDER 是处理后的标准化视图;论文数据源二选一并声明。
Q14:批号(LOT)分析可信吗?
A:批号字段是自由文本(转录噪声存在)——聚集检测用规范化匹配 + 最小报告数阈值;「批号异常」是调查线索不是结论。
Q15:MedDRA 版本怎么对齐?
A:VAERSSYMPTOMS 给 PT 名称——按当前版 MedDRA 建名称迁移表;non-current 旧名入迁移表(与 meddra 条目联动)。
Q16:v-safe 和 VAERS 什么关系?
A:互补——v-safe 是 COVID 期 APP 主动签到(有分母、抓轻事件);VAERS 是被动报告(无分母、抓严重意外);两源并表禁混算。
Q17:RotaShield 案例说明了什么?
A:1999 年 15 例肠套叠报告(年龄模式异常)→ 确认研究 → 撤市——被动监测「小信号大价值」的教科书案例。
Q18:报告者身份字段重要吗?
A:重要——专业人员报告的临床信息质量显著更高;分报告者域分析是 VAERS 数据质量工程的第一刀。
Q19:诉讼会影响数据吗?
A:会——2006 Pediatrics 记录 thimerosal/自闭症报告多为诉讼律师提交;跨期分析要把诉讼日历放进解释框架。
Q20:NLP 训练集怎么防泄漏?
A:按 VAERS_ID 划分——同一事件的重复报告跨集泄漏是评测虚高的头号来源;再加分年代域评测。
Q21:autocoder 对 VAERS 叙述的命中率如何?
A:低于制药流水(口语化/不完整)——词典层 50-70% 起步,模糊层与人工队列占比更高;按口语域调参。
Q22:怎么处理文本字段的编码乱码?
A:cp1252/UTF 混型 + U+FFFD 扫描——清洗管线(§4.4)+ 乱码行清单;丢弃前评估信息量。
Q23:NUMDAYS 字段可信吗?
A:日期解析错误高发——用 VAX_DATE/ONSET_DATE 重算核对;不一致行进清洗队列。
Q24:PRR 初筛线怎么定?
A:PRR≥2 + 计数≥3 + χ²≥4 是 Evans 传统线——只是「值得看」的过滤器;分层稳定性与接力确认是必做后续。
Q25:可以拿 VAERS 做跨疫苗风险排名吗?
A:不可以——不同疫苗的接种基数/报告人群/报告文化不同;官方明令禁止以此比较风险。
Q26:境外报告在 VAERS 里吗?
A:含少量境外与未知地区报告(STATE 字段非全美)——美国境内分析先过滤域。
Q27:月度包会改历史数据吗?
A:会——随访追加编码、新报告入池;「2021 年数据」随下载时点变化;快照归档+SHA256 是复现底线。
Q28:论文里怎么写数据源?
A:下载日期+处理时点+SHA256+口径台阶处理+MedDRA 词典版本——五要素缺一即复现风险(§7.7 模板)。
Q29:VICP 数据和 VAERS 什么关系?
A:VICP 是补偿侧(HRSA 管护)——Reportable Events Table 镜像其伤害表;补偿判定不等于因果科学结论(约 60% 为和解)。
Q30:VAERS 有官方 API 吗?
A:没有——下载走验证码网页;社区工具多为网页解析;WONDER 的数据提取是替代通道。
Q31:孩子接种后低张力低反应(HHE)是严重问题吗?
A:VAERS 专题研究(215 例)显示 HHE 多为自限性、中位 3.5 小时缓解——但个案处置遵医嘱;VAERS 数据不构成临床建议。
Q32:系统怎么应对大流行?
A:官方七目标的第 7 条——全人口应急监测;COVID 实战(峰值报告+v-safe 补位)验证了通道,也暴露了报告行为噪声的新量级。
Q33:中国团队能用 VAERS 发论文吗?
A:能——公共领域数据全球可用;注意携带官方限制声明、制度语境差异说明与快照复现元数据。
Q34:VAERS 数据能做时间序列预测吗?
A:可做「报告行为」的预测(含媒体/政策变量)——不可做「不良事件发生率」预测(无分母);两种预测的混淆是常见的传播错误。
Q35:新疫苗上市监测的标准姿势是什么?
A:月度快照+分域频次监控+PRR 初筛+分层敏感性+O/E 对照+接力确认——§7.6 的六步流水。
Q36:VAERS 未来会怎么演进?
A:官方方向——公开数据扩围(2025-05 secondary)与透明度持续增强;报告渠道在线化;方法学上 AI 辅助编码与去重是可见趋势;「无分母」的被动监测本质不变。
§10.5 要点回顾
- 被动监测本质:报告≠发生率——无分母是制度性事实。
- 三表星型:DATA×VAX×SYMPTOMS 经 VAERS_ID——先聚合后联接。
- MedDRA 编码:认证编码员+随访追加——名称对齐需迁移表。
- 快照纪律:处理时点即版本——自归档+SHA256 保复现。
- 去重先行:三级匹配+披露——诉讼活跃域尤其关键。
- 口径台阶:2025-05-08 secondary 扩围——跨界分段。
- 分层敏感性:报告者身份×年份——信号稳健性的两把尺。
- 接力声明:VAERS 出假设、确认研究出结论——决策链分工。
- 限制声明:官方解释限制随行——引用模板不可裁剪。
- 历史信号校准:RotaShield/过敏反应/CVST 复现——管线有效性的端到端证据。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 系统身份:CDC/FDA 共管被动监测/1990-11 生效/1986 NCVIA 法源/VICP 同法授权 = CDC stacks 36403 官方手册 + Wikipedia + PolitiFact 2021
- 七大目标(含批号聚集检测)= CDC stacks 36403 官方手册
- 法定义务(厂商全部知悉事件/专业人员禁忌与表列事件)+ Reportable Events Table 镜像 VICP Vaccine Injury Table = CDC stacks 36403 + Pediatric Pharmacotherapy 2004
- MedDRA 认证编码员/严重四标志 FDA 定义/严重报告病历与 1 年随访 = CDC stacks 36403
- 三 CSV 结构(VAERSDATA/VAERSVAX/VAERSSYMPTOMS)+ VAERS ID 联接 + 每 5 槽位 + 结局标志清单 = vaers.hhs.gov 数据集页 + VaccineWatch Methodology
- 2025-05-08 secondary reports 扩围 = vaers.hhs.gov 官方公告(数据集页)
- 最新包:2026-09-04 更新/处理至 2026-08-28 = vaers.hhs.gov 数据集页
- WONDER 变量体系(MedDRA 症状/文本字段检索/Onset Interval 等)= wonder.cdc.gov VAERS 帮助页
- 年度报告数(1990: 2,214/2021: 768,706/2022: 251,988/2023: 108,363/2024: 52,928/2025: 40,283/2026 部分: 977;2021 死亡 11,352/住院 50,676)= VaccineWatch 加工表(2026-02-25 处理;官方文件为源——第三方口径已标注)
- Pre-2021 基线 30,000-50,000/年 = VaccineWatch(与官方趋势叙述一致)
- 2004 时点:累计 >120,000 报告/59% <18 岁/49% <6 岁 = Pediatric Pharmacotherapy 2004
- RotaShield:MMWR 1999-07-16(15 例肠套叠)/ACIP 撤回/1999-10 自愿撤市 = HRSA ACCV 记录 + PolitiFact(Offit 引述)
- 强生 CVST 6 例/685 万接种 → 暂停-复通 = PolitiFact 2021(Shimabukuro 引述)
- HHE 研究:1996-1998 报告中 215 例/中位 4 月龄/中位 3.5h/多与百日咳疫苗相关 = Du Vernoy 2000 经 Pediatric Pharmacotherapy 2004 转述
- 诉讼报告偏倚:2006 Pediatrics(thimerosal 报告多为律师提交)= Wikipedia/PolitiFact 转述
- VSD:1991 起/2000 扩至 8 HMO/550 万人 = HRSA ACCV 记录;CISA:2001 起 6 学术中心 = 同源
- v-safe 5 表(data.cdc.gov)/VICP 月度数据(HRSA)/60% 和解 = GitHub BitKind 仓库 + HRSA 数据页(经 BitKind 转述)
- 解译限制(不证因果/无分母/低报+刺激/未核实/重复)= vaers.hhs.gov Data Use Guide 语境 + VaccineWatch Methodology 转述
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- litcovid — 共享标签:公共卫生与流行病学 / 医疗NLP
- cord-19 — 共享标签:公共卫生与流行病学 / 医疗NLP
- clinicaltrials-gov — 共享标签:公共卫生与流行病学 / 医疗NLP
- meddra — 共享标签:公共卫生与流行病学
- hgnc — 共享标签:医疗NLP
- rxnorm — 共享标签:医疗NLP
- impc — 共享标签:公共卫生与流行病学
- alphamissense — 共享标签:公共卫生与流行病学
- mimicel — 共享标签:公共卫生与流行病学
- mimiciii — 共享标签:医疗NLP
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

