INFOBOX
| 数据集名称 | i2b2/n2c2 NLP Shared Task Corpus |
| 英文全称 | i2b2/National NLP Clinical Challenges (n2c2) Shared Task Corpus Collection |
| 别名 / 简称 | i2b2 NLP、n2c2、i2b2 Challenges、N2C2 |
| 疾病分类 | 多疾病覆盖。去标识化(全疾病);肥胖与合并症(E66);药物信息(全药物);概念-断言-关系(多疾病);时间关系(多疾病);冠心病风险因素(BA40-BA5Z 心血管疾病系列 / E11 糖尿病);精神病学 RDoC(6A00-6A8Z 精神行为神经发育障碍);不良药物事件(XJ80 药物不良反应);社会决定因素(社会风险因素) |
| SNOMED CT | 404684003 Clinical finding / 432071007 Medication / 271814001 Adverse reaction / 392021009 Social determinant |
| 数据模态 | 文本(临床叙事:出院总结、入院评估、进展笔记、精神科初诊记录) |
| AI 任务类型 | 命名实体识别(NER)、关系抽取(RE)、文本分类、断言分类、共指消解、时间关系抽取、语义文本相似度、端到端信息抽取、临床概念规范化 |
| 样本总数 | 7,000+ 份人工标注临床笔记(12 届挑战合计);2006 年 889 份 + 2008 年 1,237 份 + 2009 年 1,243 份 + 2010 年 826 份 + 2011 年 978 份 + 2012 年 310 份 + 2014 年 1,304 份 + 2018 年 793 份 + 2022 年 500+ 份 等 |
| 数据大小 | ~80 MB(全语料合计,不含未标注笔记) |
| 数据格式 | XML(标注 + 文本)/ TXT(原始文本)/ CSV(部分元数据) |
| 许可证 | Data Use Agreement (DUA) — 非商业研究用途,禁止再分发 |
| 访问级别 | 申请审核(DBMI Data Portal 注册 + 签署 DUA) |
| DUO 标签 | HMB, NPUNCU |
| 语言 | 英文(美国临床文本) |
| 首发日期 | 2006(首届 i2b2 共享任务:去标识化 & 吸烟状态) |
| 最后更新 | 2022-11(2022 n2c2 共享任务 Workshop) |
| 发布机构 | Harvard Medical School DBMI & George Mason University(前身为 i2b2 Center / Partners HealthCare,PI: Isaac Kohane; NLP 负责人: Ozlem Uzuner) |
| 官方主页 | https://n2c2.dbmi.hms.harvard.edu |
| 下载地址 | https://portal.dbmi.hms.harvard.edu(DBMI Data Portal,需注册 + DUA) |
| DOI | 10.1136/amiajnl-2011-000203(2010 挑战代表性 DOI);各届挑战有独立 DOI |
| 引用次数 | 2,000+(i2b2/n2c2 核心论文合计,Google Scholar,截至 2026-07);催生数百篇后续期刊和会议论文 |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 人工金标准标注 + 多任务覆盖 + 规范 train/test 划分 + 活跃社区;扣分项:各挑战格式不统一、语料规模偏小、DUA 限制 GitHub 分发、2016 年数据不可获取 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部]交叉审核:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-07-29
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。i2b2/n2c2 数据要求通过 DBMI Data Portal 注册并签署 Data Use Agreement (DUA)。严禁将数据文件上传至 GitHub 或分享给他人——每位用户必须独立获取数据访问权限。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
i2b2/n2c2 是临床自然语言处理领域历史最长、影响最深的共享任务语料库族。它由 NIH 资助的 i2b2 中心于 2006 年发起,现由 Harvard Medical School DBMI 和 George Mason University 联合组织,涵盖 2006-2022 年 12 届挑战,累计产生 7,000+ 份人工标注临床笔记——从出院总结到精神科初诊记录,从去标识化到社会决定因素提取。
它的独特价值在于三个定义性特征:它是临床 NLP 社区的事实标准基准——几乎所有临床 NLP 系统都在 i2b2/n2c2 数据上评估过;它覆盖了最全面的临床文本处理任务谱——NER、关系抽取、断言分类、时间推理、语义相似度等 15+ 种任务类型;它采用了共享任务范式——每年发布训练集、保留测试集、统一评估,确保不同系统间的公平比较,这种模式已被 SemEval、BioNLP、MEDIQA 等后续挑战效仿。
你可以用它来:训练和评估临床文本去标识化系统、开发药物信息提取管线、在标准基准上比较你的 NER/RE 模型与社区 SOTA、或研究临床叙事中的时间推理和共指消解。
§1.1 摘要
i2b2(Informatics for Integrating Biology & the Bedside)是 NIH 于 2004-2014 年资助的国家生物医学计算中心,由 Isaac Kohane 博士领导,设在 Partners HealthCare System。其 NLP 共享任务系列由 Ozlem Uzuner 博士设计并主导,自 2006 年起每年举办一届,提供脱敏临床笔记和人工标注金标准,邀请全球研究团队在统一数据上公平比较系统性能。
2014 年 i2b2 中心项目结束后,挑战和数据集迁至 Harvard Medical School 生物医学信息系(DBMI),更名为 n2c2(National NLP Clinical Challenges)——名称既致敬 i2b2 传统,又标志进入新时代。Uzuner 博士现继续在 George Mason University 指导 n2c2 活动。
12 届挑战覆盖了临床 NLP 的核心任务谱:去标识化(2006、2014、2016)、疾病分类(2008 吸烟/肥胖)、药物提取(2009、2018、2022)、概念-断言-关系(2010)、共指消解(2011)、时间关系(2012)、心脏病风险因素(2014)、精神病学症状评估(2016)、不良药物事件(2018)、队列选择(2018)、语义文本相似度(2019)、家族史提取(2019)、概念规范化(2019)、社会决定因素(2022)和进展笔记推理(2022)。数据来源包括 Partners HealthCare、BIDMC、UPMC、Mayo Clinic 和 MIMIC-III 等多机构。
§1.2 为什么重要
社区基础设施维度:i2b2/n2c2 是临床 NLP 领域的"ImageNet 时刻"之前的"ImageNet"——在深度学习爆发之前,它就已经提供了标准化的标注数据和公平比较平台。共享任务范式确保了"同一数据、同一评估、可复现比较",这一模式已被证明是推动领域进步的最有效机制之一。据官方统计,i2b2/n2c2 数据集"已催生了数百篇期刊和会议论文"。
任务覆盖维度:12 届挑战从基础构建块(NER、断言分类)到高级推理(时间关系、共指、语义相似度),从临床应用(药物提取、不良事件检测)到研究应用(队列选择、风险因素追踪),构成了临床 NLP 任务的全谱系。几乎没有其他单一语料库族能覆盖如此多样的临床文本处理需求。
方法演进见证维度:i2b2/n2c2 的 16 年历史恰好横跨了临床 NLP 从规则系统到统计机器学习再到深度学习的完整技术演进。2006 年首届挑战中,CRF 和规则系统占据主流;2018 年 ADE 挑战中,BiLSTM 成为最受欢迎的方法;到 2019 年,BERT 已在语义相似度任务上取得最佳性能。这一时间轴为研究者提供了观察方法演进的独特窗口。
§1.3 横向对比
| 数据集 | 笔记数 | 任务类型 | 标注方式 | 机构来源 | 核心差异化 |
|---|---|---|---|---|---|
| i2b2/n2c2 | 7,000+ | 15+ 种(NER/RE/断言/时间/共指/STS 等) | 人工标注金标准 | 多机构(Partners/BIDMC/UPMC/Mayo/MIMIC) | 历史最长、任务最全的共享任务语料库族 |
| MIMIC-III/IV | ~200 万 | 无预定义 NLP 任务 | 无 NLP 标注 | BIDMC 单中心 | 规模最大但无 NLP 标注,需自行标注 |
| ShARe/CLEF eHealth | ~80,000 | 疾病 NER + 规范化 + 缩写展开 | 人工标注 | 多机构 | 专注疾病实体和规范化 |
| MADE 1.0 | 1,089 | 药物 + ADE 提取 | 人工标注 | 单中心 | 药物-ADE 专项 |
| SemEval-2014 Task 7 | 199 | 关系抽取(疾病-治疗) | 人工标注 | 单中心 | 疾病-治疗关系专项 |
| BioNLP Shared Tasks | 变化 | 生物医学事件抽取 | 人工标注 | 文献来源 | 生物医学文献(非临床笔记) |
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 2004 | NIH 资助 i2b2 国家生物医学计算中心(PI: Isaac Kohane,Partners HealthCare) |
| 2006 | 首届 i2b2 NLP 共享任务:去标识化 & 吸烟状态分类(889 份出院总结) |
| 2008 | 肥胖与合并症识别挑战(1,237 份出院总结) |
| 2009 | 药物信息提取挑战(1,243 份出院总结;引入社区标注实验) |
| 2010 | 概念-断言-关系挑战(与 VA 合办;826 份标注报告;22 个系统参与概念提取) |
| 2011 | 共指消解挑战(978 份文件;融合 i2b2/VA 语料和 ODIE 语料) |
| 2012 | 时间关系挑战(310 份出院总结;178,000 词) |
| 2014 | 最后一届 i2b2 共享任务:去标识化 & 心脏病风险因素(与 UTHealth 合办;1,304 份纵向记录,296 名患者) |
| 2014 | i2b2 中心 NIH 资助结束;NLP 数据集迁至 Harvard DBMI |
| 2016 | 首届 n2c2(CEGS N-GRID):精神病学 RDoC(~1,000 份精神科初诊记录) |
| 2018 | n2c2 双轨挑战:队列选择(288 名患者)+ ADE & 药物提取(505 份 MIMIC-III 出院总结;28 个团队参与) |
| 2019 | n2c2/OHNLP 四轨挑战:语义文本相似度 + 家族史提取 + 概念规范化 + 酒精严重度评估(33 个团队参与 STS 赛道) |
| 2022 | n2c2 三轨挑战:药物变更事件提取 + 社会决定因素 + 进展笔记推理 |
| 2026-07 | 数据持续通过 DBMI Data Portal 分发(截至 2026-07 仍可申请) |
§1.5 典型应用场景
- 临床文本去标识化系统开发:在 2006/2014/2016 去标识化挑战数据上训练和评估 PHI 检测与脱敏系统
- 药物信息提取管线构建:利用 2009/2018/2022 药物相关挑战数据开发端到端药物-ADE 提取系统
- 临床 NER 和关系抽取基准:在 2010 概念-断言-关系挑战数据上评估你的 NER/RE 模型与社区 SOTA 的差距
- 临床文本理解深度评估:利用时间关系(2012)、共指消解(2011)、语义相似度(2019)等高级任务数据测试模型的语言理解深度
- 临床决策支持研究:在 2018 队列选择数据上开发临床试验患者自动筛选系统
§2 医学背景
§2.1 ICD-11 编码
| 维度 | 详情 |
|---|---|
| ICD-11 编码 | 多编码覆盖。去标识化:全疾病(PHI 移除无关疾病编码);肥胖与合并症:E66 肥胖 / E11 2 型糖尿病;药物提取:全药物类别;概念-断言-关系:多疾病覆盖(问题/检查/治疗三类概念);时间关系:多疾病事件时间线;冠心病风险因素:BA40-BA5Z 心血管疾病系列 / E11 糖尿病 / DB80-DB98 代谢性疾病;精神病学 RDoC:6A00-6A8Z 精神行为神经发育障碍;不良药物事件:XJ80 药物不良反应;社会决定因素:社会风险因素(住房/就业/物质使用) |
§2.2 SNOMED CT 映射
| 挑战任务 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 去标识化 PHI | N/A | 226034005 | Personal health information finding |
| 肥胖 | E66 | 414915002 | Obese (finding) |
| 药物提取 | N/A | 432071007 | Medication (substance) |
| 概念-问题 | 多编码 | 404684003 | Clinical finding |
| 概念-检查 | 多编码 | 272379006 | Event (event) |
| 概念-治疗 | 多编码 | 90608004 | Therapeutic procedure |
| 不良药物事件 | XJ80 | 271814001 | Adverse reaction |
| 冠心病风险 | BA41 | 53741008 | Coronary arteriosclerosis |
| 吸烟状态 | QE90 | 77176002 | Smoker |
| 社会决定因素 | N/A | 392021009 | Social determinant |
§2.3 临床任务定义
i2b2/n2c2 的 12 届挑战覆盖了临床 NLP 的五大任务类别:
信息保护类(De-identification):2006、2014、2016 Track 1。从临床叙事中识别并移除受保护健康信息(PHI),包括患者姓名、医生姓名、医院名称、ID 编号、日期、地点、电话号码和年龄。这是使临床数据可用于研究的前提步骤。2014 年引入了纵向记录的去标识化(同一患者多次就诊记录的 PHI 一致性替换),2016 年扩展到精神科记录。
信息提取类(Information Extraction):2009 药物、2010 概念-断言-关系、2018 Track 2 ADE、2022 Track 1 药物变更。从非结构化文本中提取结构化信息——药物名称及其剂量/频率/给药途径/原因,临床概念(问题/检查/治疗)及其断言状态(存在/缺席/可能/假设)和相互关系(治疗改善问题、检查揭示问题等),以及不良药物事件和药物变更事件。
文本理解类(Text Understanding):2011 共指消解、2012 时间关系、2019 Track 1 语义文本相似度、2022 Track 3 进展笔记推理。这些任务要求系统理解文本的深层语义——识别不同表述是否指向同一实体、构建事件时间线、判断两句话的语义等价度、理解评估与计划之间的推理关系。
分类与预测类(Classification & Prediction):2006 吸烟状态、2008 肥胖与合并症、2014 Track 2 心脏病风险因素、2016 Track 2 RDoC 症状严重度、2018 Track 1 队列选择。从临床文本中推断患者状态或满足特定研究标准的资格。
新兴应用类(Emerging Applications):2019 Track 2 家族史提取、2019 Track 3 概念规范化、2022 Track 2 社会决定因素。这些挑战反映了临床 NLP 领域的研究前沿——从家族史中推断遗传风险、将临床概念映射到标准术语、从叙事中提取社会健康决定因素。
§2.4 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | Partners HealthCare Research Patient Data Repository(主要);BIDMC;UPMC;Mayo Clinic;MIMIC-III(2018 ADE 挑战) |
| 采集时间 | 各挑战数据采集时间不同,总体覆盖 2004-2018 年的临床记录 |
| 年龄分布 | 成人为主(具体年龄分布因挑战而异,未全部公开报告) |
| 性别比例 | 各挑战数据集不同,总体接近美国就医人群分布 |
| 种族分布 | 未系统释放种族信息(部分数据集因 IRB 限制不含人口学元数据) |
| 就医类型 | 以住院出院总结(discharge summaries)为主;2010 年含 UPMC 进展笔记;2016 年含精神科初诊评估;2022 年含 ICU 进展笔记 |
| 文本类型 | 出院总结、入院评估、进展笔记、精神科初诊记录、放射报告(ODIE 语料) |
§2.5 金标准 / 参考标准
| 挑战年份 | 标注方式 | 标注者 | 金标准性质 | 一致性检验 |
|---|---|---|---|---|
| 2006 De-id | 自动系统 + 人工三轮校验 | 3 名标注者(学生 + 教授)串行标注 | PHI 位置和类型 | 讨论后一致 |
| 2009 Medication | i2b2 团队 + 社区标注 | 17 份由 i2b2 团队标注;251 份由参与者众包标注 | 药物及 8 个字段 | 众包一致性分析 |
| 2010 Relations | 人工标注 | Partners/BIDMC/UPMC 临床和 NLP 专家 | 概念/断言/关系三级标注 | 论文报告 |
| 2012 Temporal | 人工标注 | 训练有素的标注者 | 事件/时间表达/时间关系 | Kappa 报告 |
| 2018 ADE | 人工标注 | 临床领域专家 | 概念/关系/端到端 | 论文报告 |
| 2019 STS | 人工标注 | 2 名临床专家独立标注 | 0-5 语义相似度评分 | 加权 Cohen kappa = 0.6(中等一致性) |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐挑战数据 | 大小 | 理由 |
|---|---|---|---|
| 去标识化系统开发 | 2006 + 2014 | ~16 MB | 2006 是经典基准(889 份);2014 引入纵向记录和更复杂 PHI 类型,两者互补 |
| 药物信息提取 | 2009 + 2018 Track 2 | ~35 MB | 2009 是基础药物提取(含社区标注);2018 扩展到 ADE 检测,含 MIMIC-III 数据和端到端评估 |
| NER + 断言 + 关系 | 2010 | ~2.7 MB | 临床 NLP 最经典的"概念-断言-关系"三位一体基准,22 个系统参与,社区基准最丰富 |
| 时间推理 | 2012 | ~5 MB | 唯一的临床时间关系标注语料,含事件/时间表达/关系三层标注 |
| 临床文本相似度 | 2019 Track 1 | ~2 MB | 1,642 训练 + 412 测试句对,含 GE 和 Epic 两种 EHR 来源 |
| 社会决定因素 | 2022 Track 2 | ~3 MB | 首个 SDOH 临床标注语料(SHAC),覆盖物质使用/就业/住房 |
| 综合评估你的 NLP 系统 | 2010 + 2012 + 2018 | ~43 MB | 覆盖 NER/RE/断言/时间/ADE 五大核心任务,社区基准最全 |
§3.1 模态详细说明
i2b2/n2c2 数据全部为英文临床叙事文本——不含结构化 EHR 数据、不含医学影像、不含基因组数据。文本类型包括:
- 出院总结(Discharge Summaries):2006/2008/2009/2010/2012/2018 Track 2 使用,是占比最大的文本类型,包含入院原因、住院经过、诊断、治疗计划和用药信息
- 进展笔记(Progress Notes):2010 年 UPMC 贡献的进展报告;2022 Track 3 使用 MIMIC-III ICU 进展笔记(评估与计划部分)
- 精神科初诊评估(Initial Psychiatric Evaluations):2016 年 RDoC 挑战使用,是首批公开的精神科临床记录
- 入院评估(Intake Records):2016 年精神科入院记录
- 纵向记录(Longitudinal Records):2014 年引入,同一患者多次就诊的连续记录,支持疾病进展研究
§3.2 按子集拆分样本数
| 挑战年份 | 挑战主题 | 训练集 | 测试集 | 未标注 | 合计 |
|---|---|---|---|---|---|
| 2006 | 去标识化 & 吸烟 | ~669 | ~220 | 889(含未标注) | 889 |
| 2008 | 肥胖 | ~742 | ~495 | — | 1,237 |
| 2009 | 药物 | 696 | 547 | — | 1,243 |
| 2010 | 概念-断言-关系 | 349 | 477 | 877 | 1,703 |
| 2011 | 共指消解 | ~500 | ~478 | — | 978 |
| 2012 | 时间关系 | ~190 | ~120 | — | 310 |
| 2014 | 去标识化 & 心脏病 | ~800 | ~504 | — | 1,304 |
| 2016 | RDoC 精神病学 | ~700 | ~300 | — | ~1,000* |
| 2018 | 队列选择 + ADE | 288 + 353 | 288 + 152 | — | 1,081 |
| 2019 | STS + 家族史等 | 1,642 句对 + N | 412 句对 + N | — | 变化 |
| 2022 | 药物变更 + SDOH + 进展 | ~350 | ~150 | — | 500+ |
*2016 年数据因 IRB 限制不对挑战外研究开放。
§3.3 数据格式详细说明
| 文件类型 | 格式 | 内容 |
|---|---|---|
| 标注文件 | XML | 临床文本 + 内联标注标签(实体跨度、类型、属性、关系) |
| 原始文本 | TXT | 脱敏后的纯文本临床叙事(无标注) |
| 金标准 | XML | 测试集标注(挑战结束后发布) |
| 元数据 | CSV | 部分挑战的患者 ID/文档 ID 映射 |
| 评估脚本 | Python/Shell | 官方评估代码(各挑战独立提供) |
§3.4 存储大小
| 挑战 | 大小 |
|---|---|
| 2006 去标识化 & 吸烟 | 14 MB |
| 2008 肥胖 | 13.6 MB |
| 2009 药物 | 34.7 MB |
| 2010 概念-断言-关系 | 2.7 MB |
| 2011 共指消解 | 3.8 MB |
| 2012 时间关系 | ~5 MB |
| 2014 去标识化 & 心脏病 | ~8 MB |
| 2018 队列选择 + ADE | ~6 MB |
| 2019 STS + 家族史等 | ~2 MB |
| 2022 三轨挑战 | ~5 MB |
| 全部合计 | ~80 MB |
§3.5 标注方式
i2b2/n2c2 的标注方式因挑战年份和任务而异,但核心原则一致——人工标注 + 多轮校验 + 专家审核:
- 标注者招募:各挑战招募具有临床背景的标注者(医学生、临床研究员、NLP 研究者),部分挑战使用专业标注平台
- 标注指南:每届挑战发布详细的标注指南(Annotation Guidelines),定义实体类型、关系类型、边界规则和消歧规则
- 多轮标注:通常采用 2-3 名标注者独立标注 → 分歧讨论 → 达成共识的流程
- 社区标注实验:2009 年药物挑战创新性地引入了"社区标注"——挑战参与者在提交系统输出后,集体标注测试集,生成众包金标准
- 一致性检验:部分挑战报告了标注者间一致性(Inter-Annotator Agreement, IAA),如 2019 STS 报告加权 Cohen kappa = 0.6
§3.6 标注者信息
| 维度 | 详情 |
|---|---|
| 标注者 | 各挑战不同——包括临床专家、NLP 研究者、训练有素的标注员 |
| 标注人数 | 各挑战 2-10+ 名标注者 |
| 资质 | 2010/2012 使用 Partners/BIDMC/UPMC 临床和 NLP 专家;2019 STS 使用 2 名多年临床领域经验的专家 |
| 一致性检验 | 部分挑战报告(如 2019 STS: kappa=0.6);部分未正式报告 |
| 已知局限 | 标注者主观性影响(尤其断言分类和关系抽取);2016 年数据因 IRB 限制不可获取 |
§3.7 数据采集时间
各挑战数据采集时间不同:
- 2006-2012 挑战:主要使用 Partners HealthCare RPDR 中 2004-2008 年间的出院总结
- 2014 挑战:使用 Partners HealthCare 纵向记录,覆盖冠心病和糖尿病患者多年就诊历史
- 2016 挑战:使用 Partners HealthCare 精神科初诊评估记录
- 2018 ADE 挑战:使用 MIMIC-III 数据库中的出院总结
- 2019 STS 挑战:使用 Mayo Clinic 113,000 名患者的 GE 和 Epic EHR 句子
- 2022 Track 3:使用 MIMIC-III ICU 进展笔记
§3.8 地域覆盖
美国多机构来源——Partners HealthCare(波士顿)、BIDMC(波士顿)、UPMC(匹兹堡)、Mayo Clinic(罗切斯特)、MIMIC-III(BIDMC 数据)。全部为美国医疗系统,反映美国临床文档实践和编码标准。
§3.10 深度溯源链
NIH i2b2 Center (2004-2014, PI: Kohane, Partners HealthCare)
|
+ Partners HealthCare RPDR (Research Patient Data Repository)
| + 出院总结 -> 2006/2008/2009/2010/2012/2014 挑战数据
| + 纵向记录 -> 2014 心脏病风险 / 2018 队列选择
| + 精神科初诊 -> 2016 RDoC 挑战
|
+ BIDMC (Beth Israel Deaconess Medical Center)
| + 出院总结 -> 2010 概念-断言-关系
|
+ UPMC (University of Pittsburgh Medical Center)
| + 出院总结 -> 2010 挑战
| + 进展笔记 -> 2010/2011 挑战
|
+ Mayo Clinic (via ODIE corpus)
| + 临床报告 -> 2011 共指消解
|
+ MIMIC-III (BIDMC ICU 数据库)
| + 出院总结 -> 2018 ADE 挑战 (505 份)
| + ICU 进展笔记 -> 2022 Track 3 进展笔记推理
|
+ Mayo Clinic EHR (GE + Epic)
| + 临床句子 -> 2019 STS 挑战 (2,054 句对)
|
+ 人工标注流程
+ 标注指南制定 -> 标注者培训
+ 独立标注 -> 分歧讨论 -> 共识达成
+ 专家审核 -> 金标准生成
+ 训练集发布 -> 测试集保留 -> 挑战评估 -> Workshop
§4 数据结构详解
§4.0 目录树预览
n2c2_data/
| 2006_deid_smoking/
| | training/
| | | deid_surrogate_train_all_version2.zip
| | + smoking_status_training.zip
| | test/
| | | deid_surrogate_test_all_groundtruth_version2.zip
| | + smoking_status_test_groundtruth.zip
| + guidelines/
|
| 2010_relations/
| | training/
| | | concept_assertion_relation_training/
| | | | *.xml
| | | + *.txt
| | + reference_standard_for_train/
| | test/
| | | concept_assertion_relation_test/
| | + reference_standard_for_test/
| + guidelines/
|
| 2018/
| | track1_cohort_selection/
| | track2_ade_medication/
| | | training/
| | | | *.xml
| | | + *.txt
| | + test/
| + guidelines/
|
| 2019/
| | track1_sts/
| | | Clinical-STS.train.csv
| | + Clinical-STS.test.csv
| | track2_family_history/
| + track3_concept_normalization/
|
| 2022/
| | track1_medication_event/
| | track2_sdoh/
| + track3_progress_note/
|
+ DUA.pdf
§4.1 DAIMS 标准化字段描述表
以 2010 概念-断言-关系挑战 XML 格式为代表:
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
note_id |
String | 文档唯一标识 | "file123.xml" |
文档索引 | 无 | N/A | 文件名 |
text |
Text | 脱敏临床叙事全文 | "Admission Date: ..." |
NLP 输入 | PHI 残留(~0.01%) | N/A | 英文临床文本 |
concept |
XML Tag | 临床概念标注 | <CONCEPT TYPE="problem"> |
NER 标签 | 标注者主观性 | 无标注 = 未标注 | problem / test / treatment |
assertion |
XML Attr | 断言类型 | ASSERTION="present" |
断言分类 | 边界模糊 | 默认 present | present / absent / possible / hypothetical / associated_with_someone_else |
relation |
XML Tag | 概念间关系 | <RELATION TYPE="TrIP"> |
RE 标签 | 关系边界争议 | 无 | TrIP/TrAP/TrNAP/TrCP/TrWP/TeCP/TeRP/PiP |
split |
Enum | 数据划分 | train / test |
实验控制 | N/A | N/A | |
challenge_year |
Integer | 挑战年份 | 2010 |
跨挑战分析 | N/A | N/A |
§4.2 标签分布统计
以 2018 ADE & 药物提取挑战为例(最具代表性的端到端信息提取任务):
| 概念类型 | Train 正例数 | Test 正例数 | F1(最佳系统) | 说明 |
|---|---|---|---|---|
| Medication(药物) | ~3,800 | ~1,600 | 0.9593 | 提取性能最高 |
| Dosage(剂量) | ~2,700 | ~1,100 | 0.9445 | — |
| Route(给药途径) | ~2,500 | ~1,000 | 0.9650 | — |
| Form(剂型) | ~1,800 | ~750 | 0.9434 | — |
| Frequency(频率) | ~2,600 | ~1,050 | 0.9553 | — |
| Duration(持续时间) | ~300 | ~120 | 0.7910 | 样本稀少,性能低 |
| Reason(原因) | ~1,400 | ~550 | 0.7900 | 局部上下文不足 |
| ADE(不良药物事件) | ~600 | ~250 | 0.6715 | 最难提取的概念 |
| 端到端 F1 | — | — | 0.8905 | 概念 + 关系联合评估 |
§4.5 缺失值情况
i2b2/n2c2 数据的"缺失"主要体现为:
-
标注覆盖不完全:并非所有临床概念都被标注——标注指南定义了特定实体类型,不在范围内的概念无标注。这不是"缺失",而是设计选择
-
2016 年数据不可获取:RDoC 精神病学挑战数据因 IRB 限制,不对挑战外研究开放
-
部分挑战的未标注集:2010 年释放了 877 份未标注报告,可用于半监督学习
-
元数据有限:大多数挑战不释放患者人口学信息(年龄/性别/种族),仅释放脱敏文本和标注
-
文档级元数据缺失:除挑战年份和文本类型外,无统一的文档元数据标准
§5 数据划分与使用建议
§5.1 官方划分
每届 i2b2/n2c2 挑战均提供官方 train/test 划分:
- 训练集:在挑战开发期(通常 2-3 个月)释放给注册参与者,含金标准标注
- 测试集:在挑战结束后释放,保留用于系统评估。部分挑战在测试期仅提供原始文本,要求参与者在 2-3 天内提交系统输出
- 验证集:大多数挑战不提供独立验证集——参与者需从训练集中自行划分
§5.2 划分策略说明
各挑战的划分策略不完全一致,但核心原则是文档级随机划分——确保同一文档不出现在 train 和 test 中。2014 年纵向记录挑战采用了患者级划分(同一患者的多次就诊记录在同一划分中)。
§5.3 数据泄漏风险
| 风险类型 | 描述 | 缓解措施 |
|---|---|---|
| 文档级泄漏 | 同一文档出现在 train 和 test | 官方划分已杜绝 |
| 患者级泄漏 | 同一患者多份记录跨划分 | 2014 年采用患者级划分;其他挑战未明确报告 |
| 跨挑战泄漏 | 2010 和 2011 使用了部分相同文档 | 注意不要将 2011 共指数据用于 2010 关系任务评估 |
| 机构泄漏 | 同一机构文档在 train 和 test | 正常情况——挑战设计为同机构评估 |
§5.4 交叉验证建议
i2b2/n2c2 各挑战语料规模较小(310-1,300 份),建议使用 5 折或 10 折交叉验证以获得更稳健的性能估计。但最终评估应在官方测试集上报告,以确保与社区基准的可比性。
§6 AI 就绪指南
§6.1 快速上手
# ========================================
# i2b2/n2c2 2010 概念-断言-关系挑战 — 快速上手
# 环境要求: Python 3.8+, nltk, spacy, scikit-learn, transformers
#
# 前置条件:
# 1. 在 DBMI Data Portal (https://portal.dbmi.hms.harvard.edu) 注册
# 2. 签署 Data Use Agreement (DUA)
# 3. 下载 2010 挑战数据并解压至 ./data/2010_relations/
#
# 目录结构预期:
# data/2010_relations/
# | training/
# | | concept_assertion_relation_training/
# | | | file001.xml
# | | + file001.txt
# | + reference_standard_for_train/
# + test/
# | concept_assertion_relation_test/
# + reference_standard_for_test/
# ========================================
import xml.etree.ElementTree as ET
import os
# Step 1: 解析 i2b2 XML 标注文件
def parse_i2b2_xml(xml_path, txt_path):
"""解析 i2b2 XML 标注,返回文本和实体列表"""
with open(txt_path, ''''''''''''''''r'''''''''''''''', encoding=''''''''''''''''utf-8'''''''''''''''') as f:
text = f.read()
tree = ET.parse(xml_path)
root = tree.getroot()
entities = []
for tag in root.findall(''''''''''''''''.//CONCEPT''''''''''''''''):
entities.append({
''''''''''''''''type'''''''''''''''': tag.get(''''''''''''''''TYPE''''''''''''''''),
''''''''''''''''assertion'''''''''''''''': tag.get(''''''''''''''''ASSERTION'''''''''''''''', ''''''''''''''''present''''''''''''''''),
''''''''''''''''span_text'''''''''''''''': tag.text or ''''''''''''''''''''''''''''''''
})
return text, entities
# Step 2: 加载数据
data_dir = "data/2010_relations/training/concept_assertion_relation_training"
texts, labels = [], []
for xml_file in os.listdir(data_dir):
if xml_file.endswith(''''''''''''''''.xml''''''''''''''''):
txt_file = xml_file.replace(''''''''''''''''.xml'''''''''''''''', ''''''''''''''''.txt'''''''''''''''')
text, entities = parse_i2b2_xml(
os.path.join(data_dir, xml_file),
os.path.join(data_dir, txt_file)
)
texts.append(text)
labels.append(entities)
print(f"Loaded {len(texts)} documents")
print(f"Total concepts: {sum(len(l) for l in labels)}")
# Step 3: 使用 HuggingFace Transformers 进行 NER
from transformers import AutoTokenizer, AutoModelForTokenClassification
from transformers import pipeline
model_name = "emilyalsentzer/Bio_ClinicalBERT"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForTokenClassification.from_pretrained(
model_name, num_labels=3 # problem / test / treatment
)
nlp_pipeline = pipeline("ner", model=model, tokenizer=tokenizer,
aggregationevent-blocked="simple")
results = nlp_pipeline(texts[0][:512])
for ent in results:
print(f"{ent[''''''''''''''''entity_group'''''''''''''''']}: {ent[''''''''''''''''word'''''''''''''''']} (score: {ent[''''''''''''''''score'''''''''''''''']:.3f})")
§6.2 数据获取
| 获取方式 | 链接 | 大小 | 说明 |
|---|---|---|---|
| DBMI Data Portal(官方唯一渠道) | https://portal.dbmi.hms.harvard.edu | ~80 MB | 注册 + DUA 后下载各挑战数据 |
| HuggingFace BigBio(加载脚本) | https://huggingface.co/datasets?search=n2c2 | 脚本 <1 MB | 仅提供数据加载脚本,数据仍需从 DBMI 获取 |
| n2c2 官方数据集页面 | https://n2c2.dbmi.hms.harvard.edu/data-sets | — | 查看各挑战元数据和引用信息 |
申请流程:
- 访问 DBMI Data Portal (https://portal.dbmi.hms.harvard.edu)
- 注册账号(支持 Facebook/Google/邮箱登录)
- 验证邮箱并完善个人资料(姓名、机构、职务、地址、电话)
- 签署 Data Use and Confidentiality Agreement (DUA)
- 等待审批(通常 1-3 个工作日)
- 获批后下载所需挑战数据
关键限制:
- 每位用户必须独立获取数据访问权限——不可通过他人代为下载
- 严禁将数据文件上传至 GitHub 或其他公开网站
- 数据仅限签署 DUA 的用户本人用于非商业研究
§6.3 预处理 Pipeline
Step 1: XML 解析
i2b2 XML 文件 -> 提取原始文本 + 标注标签
-> 文本与标注对齐(字符偏移量匹配)
Step 2: 文本清洗
-> 移除 PHI 残留(尽管已脱敏,仍建议二次检查)
-> 统一换行符和编码(UTF-8)
-> 保留临床缩写和术语(不做展开)
Step 3: 标注转换
-> XML 内联标注 -> BIO/BIOES 序列标注格式(NER 任务)
-> 关系标注 -> 句子级实体对 + 关系标签(RE 任务)
-> 断言标注 -> 实体级多分类标签
Step 4: 数据增强(可选)
-> 同义词替换(使用 UMLS 同义词词典)
-> 句子重排(保持标注一致性)
-> 跨挑战数据合并(注意格式统一)
Step 5: 模型输入构建
-> Tokenizer 分词(推荐 ClinicalBERT/BioBERT tokenizer)
-> 子词对齐(标注边界与 subword token 对齐)
-> Attention mask 构建
§6.4 框架加载
# 使用 HuggingFace BigBio 加载 n2c2 数据
# 安装: pip install datasets bigbio
from datasets import load_dataset
# 加载 2010 概念-断言-关系挑战(需先手动下载数据到本地)
# ds = load_dataset("bigbio/n2c2_2010", data_dir="/path/to/n2c2_2010_data")
# 加载 2006 去标识化挑战
# ds = load_dataset("bigbio/n2c2_2006_deid", data_dir="/path/to/n2c2_2006_data")
# 使用 PyTorch + Transformers 训练 NER 模型
import torch
from torch.utils.data import Dataset
from transformers import AutoTokenizer
class I2B2Dataset(Dataset):
def __init__(self, texts, annotations, tokenizer, max_length=512):
self.texts = texts
self.annotationevent-blocked= annotations
self.tokenizer = tokenizer
self.max_length = max_length
def __len__(self):
return len(self.texts)
def __getitem__(self, idx):
encoding = self.tokenizer(
self.texts[idx], truncation=True, max_length=self.max_length,
padding=''''''''''''''''max_length'''''''''''''''', return_offsets_mapping=True
)
labels = self._align_labels(encoding[''''''''''''''''offset_mapping''''''''''''''''],
self.annotations[idx])
encoding.pop(''''''''''''''''offset_mapping'''''''''''''''')
encoding[''''''''''''''''labels''''''''''''''''] = labels
return {k: torch.tensor(v) for k, v in encoding.items()}
def _align_labels(self, offsets, annotations):
labels = [0] * len(offsets) # 0 = O
return labels
§6.5 常见坑点
⚠️ 坑点 1:数据不可上传 GitHub(分类:工程陷阱)
问题:i2b2/n2c2 的 DUA 明确禁止将数据文件上传至任何公开网站(包括 GitHub)。许多研究者在发布代码时无意中包含了数据样本。
症状:收到 DBMI 的侵权通知;学术诚信问题;DUA 被吊销。
解决:(1) 在
.gitignore中添加数据目录;(2) 仅发布数据加载脚本,不发布数据本身;(3) 在 README 中说明数据需从 DBMI Data Portal 独立获取;(4) 使用 HuggingFace BigBio 的本地数据加载模式。参考:n2c2 DUA 全文预览 https://n2c2.dbmi.hms.harvard.edu
⚠️ 坑点 2:各挑战格式不统一(分类:预处理陷阱)
问题:12 届挑战跨越 16 年,XML 标注格式、实体类型定义、关系类型命名在不同挑战间存在差异。2006 年的去标识化标注格式与 2018 年的 ADE 标注格式完全不同。
症状:用 2010 挑战的解析代码处理 2018 挑战数据时报错或静默丢失标注。
解决:(1) 每届挑战独立编写解析逻辑;(2) 参考 HuggingFace BigBio 项目的统一加载脚本;(3) 不要假设跨挑战的实体类型定义一致——例如"problem"在 2010 年指医学问题,在 2018 年可能对应"reason"。
⚠️ 坑点 3:2016 年数据不可获取(分类:数据获取陷阱)
问题:2016 RDoC 精神病学挑战数据因 IRB 限制,仅在原始挑战期间可用,挑战结束后不再开放。
症状:在 DBMI Data Portal 找不到 2016 年数据下载选项;文献引用了该数据但无法复现。
解决:(1) 接受该数据不可获取的事实;(2) 使用 2014 年去标识化挑战的纵向记录作为替代(也含 Partners HealthCare 数据);(3) 关注后续精神科 NLP 数据集(如 PsyTAR、PsyClipse)。
⚠️ 坑点 4:ADE 和 Reason 是最难提取的概念(分类:评估误用)
问题:2018 年挑战结果显示,药物名称的 F1 高达 0.96,但 ADE 的 F1 仅 0.67。ADE 和 Reason 的识别需要超出局部上下文的理解——它们通常出现在文档的其他部分而非药物提及附近。
症状:系统整体 F1 看起来不错(~0.89),但仔细检查发现 ADE 和 Reason 的召回率极低。
解决:(1) 对 ADE/Reason 使用更大的上下文窗口或文档级注意力机制;(2) 考虑使用 LLM(如 GPT-4/ClinicalBERT)的零样本能力辅助 ADE 检测;(3) 在评估时分概念类型报告 F1,不要只看宏平均。
参考:Henry et al., JAMIA 2020, 27(1):3-12
⚠️ 坑点 5:标注者间一致性中等偏低(分类:标签理解)
问题:临床文本的标注高度主观——2019 年 STS 挑战的标注者间加权 Cohen kappa 仅 0.6(中等一致性),断言分类和关系抽取的标注也存在类似问题。这意味着金标准本身含噪声。
症状:模型性能在金标准上"触顶"后难以提升,可能因为标注噪声构成了性能上限。
解决:(1) 使用标签平滑(Label Smoothing)缓解标注噪声;(2) 考虑多标注者集成——如果可以获取多个标注版本,取共识标注;(3) 对低置信度标注进行人工复审。
§6.9 评估指标
i2b2/n2c2 各挑战使用的评估指标因任务而异:
from sklearn.metrics import f1_score, accuracy_score
from scipy.stats import pearsonr
# 1. NER 任务:严格匹配微平均 F1(实体类型 + 边界均正确)
def ner_f1(y_true, y_pred):
return f1_score(y_true, y_pred, average=''''''''''''''''micro'''''''''''''''')
# 2. 关系抽取:微平均 F1
def relation_f1(y_true, y_pred):
return f1_score(y_true, y_pred, average=''''''''''''''''micro'''''''''''''''')
# 3. 断言分类:准确率(Accuracy)
def assertion_accuracy(y_true, y_pred):
return accuracy_score(y_true, y_pred)
# 4. 语义文本相似度:Pearson 相关系数
def sts_pearson(y_true, y_pred):
r, p = pearsonr(y_true, y_pred)
return r
# 5. 端到端任务:概念 F1 + 关系 F1 的平均
def end_to_end_f1(c_f1, r_f1):
return (c_f1 + r_f1) / 2
各挑战最佳性能参考:
-
2006 去标识化:F1 ~0.98(PHI 检测)
-
2010 概念提取:F1 ~0.85 / 断言分类:Acc ~0.94 / 关系分类:F1 ~0.73
-
2018 ADE 端到端:F1 0.8905
-
2019 STS:Pearson r = 0.9010(IBM Research)
-
2022 药物变更事件:F1 ~0.80+
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 机构偏倚 | 虽为多机构,但全部为美国学术医学中心,社区医院和非美国数据缺失 | 高 | 在论文中明确标注机构来源 |
| 文档类型偏倚 | 出院总结占主导,护理记录、门诊笔记、放射报告代表性不足 | 中 | 2010 年引入 UPMC 进展笔记;2022 年引入 ICU 进展笔记 |
| 语言偏倚 | 仅英文临床文本,不适用于中文或其他语言临床 NLP | 高 | 中文临床 NLP 可参考 CCKS 挑战语料 |
| 标注者偏倚 | 标注者主观性影响,尤其断言分类和关系抽取 | 中 | 多标注者共识 + 专家审核 |
| 时间漂移 | 2006-2022 年跨度,临床文档实践和 EHR 系统显著演变 | 中 | 各挑战数据反映其采集年代的实践 |
| 规模限制 | 单挑战 310-1,304 份笔记,深度学习模型可能过拟合 | 中 | 跨挑战数据合并 + 迁移学习 |
§7.2 标签质量
| 任务类型 | 标注方式 | 准确率估计 | 一致性检验 | 局限性 |
|---|---|---|---|---|
| 去标识化(2006/2014) | 人工三轮校验 | ~98%(严格匹配) | 讨论后一致 | 罕见 PHI 类型可能遗漏 |
| 概念提取(2010) | 人工标注 + 专家审核 | ~90-95% | 论文报告 | 边界标注存在模糊性 |
| 断言分类(2010) | 人工标注 | ~85-90% | 中等一致性 | “possible” vs “hypothetical” 边界模糊 |
| 关系抽取(2010) | 人工标注 | ~80-85% | 中等一致性 | 关系类型定义复杂,标注者培训要求高 |
| ADE 提取(2018) | 人工标注 | ~85-90% | 论文报告 | ADE 概念召回率受限 |
| STS(2019) | 2 名专家独立标注 | N/A | kappa=0.6 | 中等一致性,金标准含噪声 |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 非美国医疗系统 | 高 — 临床文档风格、医学术语、EHR 系统差异大 | 跨语言/跨系统迁移研究有限 |
| 社区医院 | 中高 — 出院总结风格与学术中心不同 | 2022 Track 2 SDOH 数据引入了更广泛的社会背景 |
| 非英语临床文本 | 不适用 — 仅英文 | 中文需参考 CCKS 等挑战 |
| 护理记录/门诊笔记 | 高 — 训练数据以出院总结为主 | 仅 2010/2022 年含少量进展笔记 |
| LLM 时代评估 | 中 — 小语料可能无法充分评估 LLM 能力 | 2019 STS 已有 BERT 系统 |
§7.4 伦理考量
- 数据隐私:i2b2/n2c2 数据已经过 HIPAA Safe Harbor 去标识化处理(2006/2014 挑战专门针对 PHI 移除),所有患者标识符已替换。但临床文本中仍可能残留间接可识别信息(如罕见疾病、特定医疗事件),使用时需保持伦理警觉。
- 知情同意:原始临床笔记采集自 Partners HealthCare(现 Mass General Brigham)、BIDMC、UPMC 和 Mayo Clinic 等机构的常规诊疗记录,基于各机构 IRB 批准的广泛同意框架。DUA 中明确限制了数据仅用于非商业临床 NLP 研究。
- 公平性风险:i2b2/n2c2 语料全部来自美国学术医学中心,且以 Boston 地区为主,所训练的模型在社区医院或非美国医疗系统中可能存在性能退化。2022 年 Track 2 的 SDOH(社会决定因素)任务首次系统性地引入社会背景标注,标志着社区对该问题的认知。
- 误用风险:i2b2/n2c2 是 NLP 系统评估基准(共享任务),而非临床部署验证数据集。各挑战产生的标注数据和评测结果反映了特定年份 NLP 技术水平,不应直接外推至临床决策环境。
- 数据二次使用:DUA 禁止将数据上传至 GitHub 或开放共享平台。研究者在发布代码时需严格遵守 DUA,仅发布数据加载脚本,并将数据获取路径指向 DBMI Data Portal。
§7.5 公平性评估
i2b2/n2c2 原始论文未提供按患者种族/性别/保险类型分层的系统性能差异分析。但社区后继研究已开始关注此问题:
- 机构偏差:多挑战的测试集均来自与训练集相同或类似的学术医疗中心。Zhang et al. (2020) 发现去标识化模型在社区医院笔记上的 PHI 召回率下降 8-12%。
- 方言与语言偏差:所有笔记均为美式英语临床文本,不使用英式拼写或非英语术语。对于移民/非英语母语者撰写的笔记,NLP 模型性能未经检验。
- 疾病谱偏倚:出院总结中慢性病(糖尿病、高血压)的术语密度远高于急性病或罕见病,模型可能对罕见病的实体召回不足。
- SDOH 标注:2022 年 Track 2 的 SDOH 任务首次提供社会决定因素(住房、就业、物质使用等)的标注,为后续公平性审计奠定了基础。社区可基于此标注开展子群体性能差异研究。
# 公平性审计示例(基于 2022 SDOH 标签)
from sklearn.metrics import f1_score
import pandas as pd
# 伪代码:按 SDOH 标注状态分组评估模型性能
results = []
for sdoh_group in [''''''''''''''''housing_insecurity'''''''''''''''', ''''''''''''''''employment'''''''''''''''', ''''''''''''''''substance_use'''''''''''''''']:
subgroup = labels[labels[''''''''''''''''sdoh_category''''''''''''''''] == sdoh_group]
f1 = f1_score(subgroup[''''''''''''''''ground_truth''''''''''''''''], subgroup[''''''''''''''''model_prediction''''''''''''''''])
results.append({''''''''''''''''sdoh_category'''''''''''''''': sdoh_group, ''''''''''''''''f1'''''''''''''''': f1})
df_results = pd.DataFrame(results)
print(df_results)
§7.6 数据漂移提示
| 漂移维度 | 漂移程度 | 说明 | 影响 |
|---|---|---|---|
| 临床术语演变 | 中高 | 2006-2022 年跨度 16 年,ICD-9 → ICD-10 迁移、药物名称变更、诊断标准更新 | 2022 年数据中的术语可能与 2006 年训练模型时的术语不匹配 |
| EHR 系统演变 | 中 | 笔记结构从自由文本逐步过渡到半结构化/模板化录入(如 Epic SmartPhrases) | 后期笔记中模板化文本增多,可能使 NLP 模型产生虚假的模式依赖 |
| 临床实践演变 | 中 | COVID-19 后远程医疗记录显著增加(2020-),文档风格与 2006 年住院笔记差异明显 | 2020 年前的模型可能无法处理远程医疗笔记中的新型文本结构 |
| 标注标准演变 | 低中 | 各挑战独立定义标注指南;不同挑战间同一概念可能有不同标注方式 | 跨挑战数据合并使用时需注意标注标准的兼容性 |
| 语言使用演变 | 低 | 美式英语临床文本的语言特征相对稳定,但缩写和惯用语有少量新增 | 影响相对较小,但需关注 EHR 中患者生成内容(如 MyChart 消息)的加入 |
对策:(1) 优先使用最近年份的挑战数据训练部署模型(如 2018/2019/2022);(2) 跨年份数据合并训练时,在训练样本中加入年份标签作为辅助特征;(3) 使用 ClinicalBERT/GatorTron 等在近期临床文本上预训练的语言模型。
§7.7 DAIMS 24 项数据就绪度评估表
| # | 评估项 | 得分 | 说明 |
|---|---|---|---|
| 1 | 数据集标识 | ✅ 1 | 名称、组织方、各挑战年份、引用信息完整 |
| 2 | 数据采集过程 | ✅ 1 | 详尽描述了挑战机制、数据来源机构、标注流程和准入机制 |
| 3 | 数据预处理 | ⚠️ 0.5 | 各挑战独立定义预标注流程;无统一规范,但有 BigBio 统一加载脚本 |
| 4 | 数据标注方法 | ✅ 1 | 各挑战均有详细标注指南和标注者培训说明 |
| 5 | 数据划分 | ✅ 1 | 规范的 train/test 划分,由挑战组织方统一提供 |
| 6 | 数据分布 | ✅ 1 | 各挑战发布元数据中报告了完整的统计描述 |
| 7 | 数据格式 | ✅ 1 | XML 内联标注格式明确,BigBio 支持多种加载方式 |
| 8 | 数据可及性 | ⚠️ 0.5 | DUA 审批获取,非即时可用;2016 年数据不可获取 |
| 9 | 数据许可 | ✅ 1 | DUA 明确,无歧义 |
| 10 | 伦理审查 | ✅ 1 | 各来源机构 IRB 批准;DUA 限制使用范围 |
| 11 | 隐私保护 | ✅ 1 | HIPAA Safe Harbor 脱敏,2006/2014 挑战本身就是去标识化任务 |
| 12 | 人口学信息 | ⚠️ 0.5 | 人口学标签随笔记附带,但未系统报告整体分布 |
| 13 | 缺失数据处理 | ⚠️ 0.5 | 无缺失数据(标注完整),但罕见标签类型可能过少 |
| 14 | 数据质量 | ⚠️ 0.5 | 标注者间一致性中等(kappa 0.6-0.8),金标准含噪声 |
| 15 | 已知局限性 | ✅ 1 | 各挑战论文详尽列出局限性 |
| 16 | 偏倚评估 | ⚠️ 0.5 | 偏倚被定性讨论但未定量分析 |
| 17 | 泛化性分析 | ⚠️ 0.5 | 跨机构泛化性研究有限,未做系统评估 |
| 18 | 可复现性 | ⚠️ 0.5 | BigBio 提供加载脚本;但需要 DU 获取数据后才可复现 |
| 19 | 预训练模型发布 | ❌ 0 | 不发布预训练模型;仅发布经 DUA 审批的训练数据 |
| 20 | 评估指标标准化 | ✅ 1 | 各挑战严格定义评估指标并统一使用 |
| 21 | 基准任务多样性 | ✅ 1 | 12 届挑战覆盖 NLP 核心任务的几乎所有维度 |
| 22 | 外部验证 | ⚠️ 0.5 | 社区有跨系统验证但非官方组织 |
| 23 | 数据集维护 | ✅ 1 | 活跃维护,2022 年仍新增挑战 |
| 24 | 文档完整性 | ✅ 1 | 各挑战独立文档 + 官方网站 + BigBio 元数据 |
| 合计 | 17.0 / 24 |
DAIMS 评分:17.0 / 24
评分解读:良好 — i2b2/n2c2 在任务多样性、标注规范和评估标准化方面几乎无可挑剔,14 个满分项目彰显了其作为共享任务黄金标准的地位。主要扣分来自:(1) DUA 壁垒——数据获取需经过审批,非即时可用;(2) 2016 年数据不可获取——因 IRB 限制永久缺失;(3) 无预训练模型发布——共享任务范式决定了组织方不发布模型权重;(4) 标注一致性中等——金标准含噪声,尤其是断言分类和关系抽取任务。对你意味着什么:(1) 数据获取——提前规划 DUA 审批(通常 1-3 个工作日),不要等到 deadline 前才申请;(2) 标注噪声——i2b2/n2c2 的金标准不是绝对真理,考虑使用标签平滑或多标注者集成策略缓解标注噪声;(3) 跨挑战数据合并——如果你需要大规模临床 NLP 训练数据,合并多挑战数据时注意 XML 格式差异和实体类型定义的一致性;(4) LLM 评估——i2b2/n2c2 的单挑战语料规模(310-1,304 份笔记)对 LLM 微调可能不够,但对少样本评估和 zero-shot 测试非常有价值。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源 | 样本量 | 评估任务 | 性能指标 | 相对 i2b2 变化 | 关键发现 |
|---|---|---|---|---|---|---|
| VA 电子健康记录 | U.S. Department of Veterans Affairs(美国) | ~2,000 笔记 | 去标识化(De-id) | F1 0.91(i2b2 2006 训练 → VA 测试) | 下降 ~7% | 社区医院笔记的去标识化难度显著高于学术中心笔记(Zhang et al., 2020) |
| MIMIC-III 临床笔记 | MIT/BIDMC(美国) | ~2,000 份放射报告 | 去标识化 | F1 ~0.93 | 与 i2b2 测试集基本持平 | MIMIC-III 笔记来自同一 BIDMC 机构,风格相近(Neamatullah et al., 2008) |
| 2018 n2c2 ADE 挑战团队 | 多机构(美国) | 505 份出院总结 | ADE 端到端 | 最佳 F1 0.8905 | 挑战内测试 | 药物名称 F1 0.96 但 ADE F1 仅 0.67——ADE 和 Reason 是主要瓶颈 |
| 中文 CCKS 临床 NLP 挑战 | 中国中文信息学会(中国) | ~1,000 份中文电子病历 | 命名实体识别 | F1 0.85-0.92 | 不同任务体系,不可直接对标 | 中文电子病历命名实体(身体部位/检查/疾病/症状)与 i2b2 实体类型体系不同,但共享任务组织模式高度相似 |
| BioCreative / BioNLP | 国际生物 NLP 社区 | 变体 | 基因/蛋白质 NER | F1 0.80-0.90 | 不同领域 | 生物医学文献的 NER 与临床文本 NER 面临不同的分布外挑战(缩写消歧 vs PHI 识别) |
§8 基准性能与生态
§8.1 排行榜
注意:i2b2/n2c2 的共享任务范式决定了它更像"年度竞赛排行榜"而非"固定评估基准"。各挑战独立排名,不同年份因任务定义、评测指标和数据规模不同,结果不可直接横向比较。下表为各主要挑战的官方最佳结果汇编。
| 挑战年份 | 任务 | 最佳团队/系统 | 最佳性能 | 指标 | 论文 |
|---|---|---|---|---|---|
| 2006 | 去标识化 | Wellner et al. (MIT) | F1 0.9764 | 严格匹配 F1 | Uzuner et al., JAMIA 2007 |
| 2008 | 吸烟状态 | Wicentowski & Sydes | F1 0.9148 | 微平均 F1 | Uzuner et al., JAMIA 2008 |
| 2010 | 概念提取 | de Bruijn et al. | F1 0.8523 | 严格 F1 | Uzuner et al., JAMIA 2011 |
| 2010 | 断言分类 | de Bruijn et al. | Acc 0.9362 | 准确率 | Uzuner et al., JAMIA 2011 |
| 2010 | 关系分类 | Roberts et al. | F1 0.7332 | 微平均 F1 | Uzuner et al., JAMIA 2011 |
| 2011 | 共指消解 | Xu et al. | F1 0.915 | CoNLL F1 | Uzuner et al., JAMIA 2012 |
| 2012 | 时间关系 | Tang et al. (UTHealth) | F1 0.694 | 时间线 F1 | Sun et al., JAMIA 2013 |
| 2014 | 心脏病风险 | Roberts et al. | F1 0.891 | 微平均 F1 | Stubbs & Uzuner, JBI 2015 |
| 2014 | 纵向去标识化 | Aberdeen et al. (MITRE) | F1 0.9276 | 严格 F1 | Stubbs et al., JBI 2015 |
| 2018 | ADE 端到端 | Dandala et al. | F1 0.8905 | 端到端 F1 | Henry et al., JAMIA 2020 |
| 2019 | 语义文本相似度(STS) | IBM Research | Pearson r 0.9010 | Pearson r | Wang et al., JMIR 2020 |
| 2022 | 药物变更事件 | (最佳待公布) | F1 ~0.80+ | — | n2c2 2022 Workshop |
§8.2 SOTA 总结与选型建议
| 场景 | 推荐方法 | 理由 |
|---|---|---|
| 去标识化(规则为主) | CRF + 字典匹配 | 高精确率场景下,规则方法仍然最可靠;深度学习模型的边界不稳定性可能导致 PHI 泄露 |
| 概念提取(NER) | ClinicalBERT / BioBERT + BiLSTM-CRF | 在 2010 概念提取上已被验证为最强编码器方案 |
| 关系抽取 | BIOBERT + 注意力机制 / LLM few-shot | 关系类型复杂,需要大规模预训练语义知识 |
| 断言分类 | BERT + 句子级分类头 | 5 类断言(present/absent/possible/conditional/hypothetical)本质是句子分类任务 |
| 时间关系 | GatorTron / LLM | 2012 年挑战的最佳系统仍基于规则,但近期 LLM 方法在时间推理上潜力巨大 |
| LLM 评估 | GPT-4/Claude 等 zero-shot | i2b2/n2c2 小语料特别适合作为 LLM 临床能力的 zero-shot/few-shot 探针 |
§8.3 官方评测协议
i2b2/n2c2 各挑战的评估协议由组织方严格定义,核心流程如下:
- 组织方提供训练集(含标注)和测试集(不含标注)
- 参赛团队在训练集上开发系统,提交测试集预测结果
- 组织方使用预定义的指标(F1/准确率/Pearson r)统一评估
- 各团队在年度 Workshop 上提交系统描述论文并通过同行评审
- Workshop 上公布最终排名和所有团队结果
- 所有系统描述论文和概览论文在同行评审期刊上发表
与 EHRSHOT 等固定基准不同:i2b2/n2c2 的"排行榜"本质是年度竞赛的快照,每个挑战仅有一次正式排名。没有"后续提交"机制——挑战结束后数据保留但不再进行新提交的正式评估。
§8.4 相关数据集
| 数据集 | 关系 | 关键差异 |
|---|---|---|
| MIMIC-III 临床笔记 | 互补 — 同机构(BIDMC)大规模 ICU 笔记 | MIMIC-III 关注 ICU 自由文本;i2b2 关注多类型笔记的标注评估 |
| MIMIC-IV Note | 互补 — MIMIC-IV 的放射/出院总结 | 与 MIMIC-III 有部分重叠;MIMIC-IV Note 数量更大但无 NLP 标注 |
| 2018 n2c2 ADE | 自身子集 — ADE 提取 | 唯一含药物-ADE 关系标注的挑战 |
| 2019 n2c2 STS | 自身子集 — 语义文本相似度 | 唯一将临床 NLP 作为回归任务(Pearson r)而非分类/F1 的挑战 |
| CCKS 临床 NLP | 类似 — 中文临床 NLP 共享任务 | 任务类型相似(NER、关系抽取)但语言不同;中文 NLP 社区对标 |
| BioCreative / BioNLP | 互补 — 生物医学文献 NLP | 关注 PubMed 文献而非临床文本;基因/蛋白质/化学物实体与临床实体互补 |
| MedAlign | 互补 — 临床文本指令遵循 | Stanford Shah Lab 发布;关注 LLM 在临床文本上的指令遵循能力 |
| Corpus AnT (NUBes) | 替代 — 西班牙语匿名化 | 西班牙语临床文本去标识化共享任务;i2b2 的跨语言对应物 |
§8.5 关键论文
- Uzuner, O., Luo, Y., & Szolovits, P. (2007). Evaluating the State-of-the-Art in Automatic De-identification. Journal of the American Medical Informatics Association, 14(5), 550-563. — 2006 年去标识化挑战概览,定义 PHI 类别和严格匹配评估指标。被引 600+。
- Uzuner, O., South, B. R., Shen, S., & DuVall, S. L. (2011). 2010 i2b2/VA Challenge on Concepts, Assertions, and Relations in Clinical Text. Journal of the American Medical Informatics Association, 18(5), 552-556. — 2010 年三联挑战概览论文,定义了概念-断言-关系三级标注体系。被引 1,200+。
- Sun, W., Rumshisky, A., & Uzuner, O. (2013). Evaluating Temporal Relations in Clinical Text: 2012 i2b2 Challenge. Journal of the American Medical Informatics Association, 20(5), 806-813. — 2012 年时间关系挑战概览,TIME+EVENT+TLINK 三级标注。被引 500+。
- Stubbs, A. & Uzuner, O. (2015). Annotating Risk Factors for Heart Disease in Clinical Narratives for Diabetic Patients. Journal of Biomedical Informatics, 58, S78-S91. — 2014 年心脏病风险因子挑战,首次标注纵向时序关系。被引 200+。
- Henry, S., Buchan, K., Filannino, M., Stubbs, A., & Uzuner, O. (2020). 2018 n2c2 Shared Task on Adverse Drug Events and Medication Extraction in Electronic Health Records. Journal of the American Medical Informatics Association, 27(1), 3-12. — 2018 ADE 挑战概览,药物名称/ADE/原因/强度/剂量/给药方式/频次/给药途径/持续时间九实体体系。
- Wang, Y., Afzal, N., Fu, S., et al. (2020). MedSTS: A Resource for Clinical Semantic Textual Similarity. Language Resources and Evaluation, 54, 57-72. — 2019 MedSTS 资源论文,1,068 对临床句子对的 STS 标注。
- Stubbs, A., Kotfila, C., Xu, H., & Uzuner, O. (2015). Identifying Risk Factors for Heart Disease over Time: Overview of 2014 i2b2/UTHealth Shared Task Track 2. Journal of Biomedical Informatics, 58, S67-S77. — 2014 年 Track 2 纵向去标识化概览。
- Filannino, M., Stubbs, A., & Uzuner, O. (2017). Symptom Severity Prediction from Neuropsychiatric Clinical Records: Overview of 2016 CEGS N-GRID Shared Tasks Track 2. Journal of Biomedical Informatics, 75S, S62-S70. — 2016 RDoC 精神病学挑战概览,唯一因 IRB 限制不可获取的热门挑战。
§8.6 社区活跃度
| 指标 | 数据 | 来源 |
|---|---|---|
| 挑战参与团队累计 | 200+(所有挑战合计) | 各挑战 Workshop 概览论文 |
| 系统描述论文累计 | 500+ | Google Scholar / PubMed |
| i2b2/n2c2 相关 PubMed 论文 | 3,000+ | PubMed 搜索 “i2b2 n2c2” + “clinical NLP” |
| HuggingFace BigBio 收录挑战 | 9/12 | BigBio 项目(bigscience-workshop/biomedical) |
| 去标识化挑战被引次数 | 600+(JAMIA 2007)+ 300+(JBI 2015) | Google Scholar |
| 2010 概念-断言-关系挑战被引 | 1,200+ | Google Scholar |
| GitHub 社区代码仓库 | 200+ | GitHub 搜索 “n2c2” |
§8.7 生态快照
| 资源 | 类型 | 链接 | 为什么值得关注 |
|---|---|---|---|
| n2c2 官方网站 | 官方主页 | n2c2.dbmi.hms.harvard.edu | 数据集下载入口 + DUA 申请 + 历史挑战信息 |
| DBMI Data Portal | 数据获取 | portal.dbmi.hms.harvard.edu | 注册 + 签署 DUA + 下载数据 |
| BigBio (HuggingFace) | 工具/统一加载 | huggingface.co/bigscience-workshop | 统一加载器,覆盖 9 届挑战 |
| n2c2 clinicalml | 社区 GitHub | github.com/n2c2 | 组织方维护(部分仓库可能为归档状态) |
| Spark NLP Healthcare | 商用加载 | nlp.johnsnowlabs.com | 商业许可下的 i2b2 数据预加载支持 |
| Uzuner Lab (GMU) | 研究组 | volgenau.gmu.edu | i2b2/n2c2 联合组织方 Ozlem Uzuner 教授团队 |
§9 相关资源与引用
§9.1 BibTeX 引用
引用 i2b2/n2c2 数据时,建议同时引用对应挑战的概览论文。最广为使用的入口引用为 2010 年概念-断言-关系挑战概览:
@article{uzuner2011i2b2,
title={2010 i2b2/VA Challenge on Concepts, Assertions, and Relations in Clinical Text},
author={Uzuner, Ozlem and South, Brett R and Shen, Shuying and DuVall, Scott L},
journal={Journal of the American Medical Informatics Association},
volume={18},
number={5},
pages={552556},
year={2011},
publisher={BMJ Group},
doi={10.1136/amiajnl-2011-000203}
}
其他挑战的 BibTeX 引用请参见 §8.5 关键论文列表,从各挑战概览论文获取完整引用。
§9.2 官方资源
| 资源 | 链接 |
|---|---|
| n2c2 官方网站 | https://n2c2.dbmi.hms.harvard.edu |
| DBMI Data Portal(数据获取) | https://portal.dbmi.hms.harvard.edu |
| 数据集列表 | https://n2c2.dbmi.hms.harvard.edu/data-sets |
| BigBio n2c2 加载器 | https://huggingface.co/datasets?search=n2c2 |
| 2006 去标识化概览(JAMIA) | https://doi.org/10.1197/jamia.M2444 |
| 2010 概念-断言-关系概览(JAMIA) | https://doi.org/10.1136/amiajnl-2011-000203 |
| 2018 ADE 概览(JAMIA) | https://doi.org/10.1093/jamia/ocz180 |
§9.3 教程与社区链接
| 资源 | 类型 | 链接 |
|---|---|---|
| BigBio 入门教程 | 文档 | https://github.com/bigscience-workshop/biomedical |
| Spark NLP Healthcare i2b2 教程 | 教程 | https://nlp.johnsnowlabs.com/docs/en/examples |
| n2c2 Workshop 论文集 | 论文集 | https://n2c2.dbmi.hms.harvard.edu/previous-workshops |
| MIT PhysioNet 去标识化资源 | 工具 | https://physionet.org/content/deid/ |
§10 AI 使用声明卡
§10.1 使用的 AI 模型
| 模型 | 版本 | 用途 |
|---|---|---|
| Claude(WorkBuddy) | 2026-07 | Wiki 初稿生成、信息检索与整合 |
| WebSearch / WebFetch | WorkBuddy 内置 | 数据集背景资料收集与交叉验证 |
§10.2 AI 参与范围
ai-assisted — AI 完成初稿生成和信息整合,人工(千方病案医学编辑部)完成医学准确性审核和规范性校验。
§10.3 AI 参考的输入来源
- n2c2 官方网站 https://n2c2.dbmi.hms.harvard.edu
- Uzuner et al., “2010 i2b2/VA Challenge on Concepts, Assertions, and Relations in Clinical Text,” JAMIA, 2011
- Uzuner et al., “Evaluating the State-of-the-Art in Automatic De-identification,” JAMIA, 2007
- Sun et al., “Evaluating Temporal Relations in Clinical Text: 2012 i2b2 Challenge,” JAMIA, 2013
- Stubbs & Uzuner, “Annotating Risk Factors for Heart Disease in Clinical Narratives for Diabetic Patients,” JBI, 2015
- Henry et al., “2018 n2c2 Shared Task on Adverse Drug Events and Medication Extraction,” JAMIA, 2020
- Wang et al., “MedSTS: A Resource for Clinical Semantic Textual Similarity,” LRE, 2020
- HuggingFace BigBio 项目文档
- Spark NLP Healthcare 文档
- PubMed / Google Scholar 论文检索
§10.4 人工校验机制
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览(编年史、挑战全览) | 千方病案医学编辑部 | 与 n2c2 官方网站和 JAMIA 概览论文交叉比对 | ✅ 已通过 |
| §2 医学背景(术语、ICD-11 映射) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据规格(各挑战数据统计、版本矩阵) | 千方病案医学编辑部 | 与各挑战概览论文和 BigBio 元数据交叉比对 | ✅ 已验证 |
| §4 数据结构(XML 格式、字段表) | 千方病案医学编辑部 | 与技术文档交叉比对 | ✅ 已验证 |
| §5 数据划分 | 千方病案医学编辑部 | 与挑战官方划分说明交叉比对 | ✅ 已验证 |
| §6 AI 就绪指南(代码示例、坑点) | 千方病案医学编辑部 | 逻辑审查 + 交叉审核 | ✅ 已通过 |
| §7 质量评估(DAIMS、偏倚表、外部验证) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 基准性能(排行榜、SOTA、生态快照) | 千方病案医学编辑部 | 与各引用论文核实 | ✅ 已验证 |
§10.5 AI 生成的章节
全部章节均由 AI 完成初稿,经千方病案医学编辑部人工交叉审核后修改定稿。
§10.6 最后一次人工审核日期
2026-07-29
页面状态:published — 全部内容已完成审核并发布。
