信息速览
NIHSS Annotations for the MIMIC-III Database — AI-Ready 数据集百科
Database — AI-Ready 数据集百科
一句话:这是 MIMIC-III 生态里唯一一份以神经科专业量表为抽取目标的金标准语料——312 例卒中患者的出院小结,被两名标注员用 BRAT 逐条标出 2,929 个 NIHSS 条目、2,774 个测量值与 2,733 条"条目-分数"关系。它的使命很朴素:让"医生在病历里随手写下的
NIHSS 12 分"变成机器可读、可统计、可建模的结构化数值。
INFOBOX
| 属性 | 值 |
|---|---|
| 官方名称 | National Institutes of Health Stroke Scale (NIHSS) Annotations for the MIMIC-III Database |
| 发布方 | PhysioNet(MIT Laboratory for Computational Physiology 生态) |
| 版本 | v1.0.0(2021-01-25 发布,唯一版本) |
| DOI | 10.13026/gyjg-0t90 |
| RRID | SCR_007345 |
| 页面作者 | Jiayang Wang, Xiaoshuo Huang, Lin Yang, Jiao Li |
| 所属机构 | 中国医学科学院 / 北京协和医学院 医学信息研究所 |
| 临床支持 | 首都医科大学附属北京天坛医院 国家神经系统疾病临床研究中心 |
| 任务 | NER + RE 联合信息抽取(条目 → 分数,“has value” 关系) |
| 语料规模 | 312 例卒中患者 / 2,929 个 NIHSS items / 2,774 个 measurements / 2,733 条 relations |
| 初筛规模 | 3,660 例卒中病例(ICD-9 430/431/432/433/434/436 及子型) |
| 文类 | MIMIC-III 出院小结(discharge summaries) |
| 标注工具 | BRAT |
| 标注员 | 2 名(医学信息学背景),独立标注 100 份后讨论收敛 |
| 一致性 | Cohen’s Kappa = 0.901(almost perfect) |
| 划分 | Train 220 份 / Test 92 份 / End2End Test 单列 |
| 语料统计 | 7,848 句;平均 25 句/病例;153 token/病例 |
| 关联机制 | HADM_ID(MIMIC-III v1.4 锚点) |
| 关联论文 | Wang et al., SHI Vol.290, pp.1004-1005 (2022),PMID 35673177 |
| 最佳基线 | BERT-BiLSTM-CRF + Random Forest,F1 0.9006 |
| 代码 | github.com/huangxiaoshuo/NIHSS_IE |
| 访问级别 | Credentialed(需 CITI 培训 + DUA,与 MIMIC-III 同门槛) |
| 适合任务 | 临床信息抽取、量表结构化、NER/RE 基准、LLM 抽取能力评测 |
§0 速览与信任声明:一份 312 例的小语料,凭什么值得一篇 AI-Ready 百科条目
在 MIMIC 家族的众多成员里,这份语料有两点让它无法被替代。
第一,它抽取的对象不是"随便什么实体",而是一套国际通用的临床评分量表。NIHSS(美国国立卫生研究院卒中量表)是急性卒中的核心严重度指标,它决定溶栓与取栓决策、决定临床研究入组、决定医保与质控口径。但 NIHSS 的天然产出形态是自由文本——医生在出院小结里写"神志清,右侧肢体肌力 III 级,NIHSS 评分 12 分",这句话里的"12 分"不会进入任何结构化字段。要把海量历史病历变成可分析的研究队列,就必须有人先把"文本→量表分值"这条路走通,并且走通的过程中留下一份可验证的金标准。这份语料就是那条路的路标。
第二,它是一份规模小、专业度高、关系型标注的语料——这三点组合起来,使它在当下大模型时代反而更值钱。
三条速览结论:
- 它把"评分"建模成了关系,而不是字符串。语料不只标出"NIHSS 条目"和"数字",还标出二者之间的
has value关系。这是量表抽取的关键建模选择:同一个句子里可能有多个数字(年龄、血压、格拉斯哥评分),只有把"哪个数字属于哪个条目"建成关系,抽取结果才可用。做结构化抽取的团队,都能从这份语料的设计里读到直接可借用的模式。 - 它是"小样本 + 高专业度"任务的诚实样本。312 例患者、2,929 个条目——这个规模不足以训练一个大模型,但足以(a)验证标注协议是否可行、(b)作为 LLM few-shot 或评测的小型金标准集、(c)检验跨机构迁移时的性能衰减。官方把 Kappa、划分、条目计数全表都公开了,你能清楚看到这份数据"能做什么、不能做什么"。
- 它是 MIMIC 国际开放性的一个具体证据。这份语料由中国医学科学院与北京天坛医院的团队在上游 MIMIC-III 数据上建成,并反向贡献回 PhysioNet。它与本系列 495(Paediatric Intensive Care database,中国浙江大学医学院附属儿童医院自建库)构成一组有意思的对照:一个是"自建数据出海",一个是"在开放数据上做贡献"——中国团队参与重症数据生态的两条不同路径。
0.1 条目名与 slug 勘误
本条目在生产排期表中的 slug 被记为 NIHSS、中文名被截断为"National Institutes of Health Stro"。官方 slug 为 stroke-scale-mimic-iii,官方全称为 National Institutes of Health Stroke Scale (NIHSS) Annotations for the MIMIC-III Database。本条目一律以官方为准。
三条命名提醒:
- 检索该数据集时,PhysioNet 站内路径是
/content/stroke-scale-mimic-iii/,不是/content/nihss/,也不是/content/stroke-scale-mimic/; - 它是 MIMIC-III 语料,与 MIMIC-IV 谱系的同名概念数据集不共用文件;
- 它的关联代码仓库名是
NIHSS_IE(IE = Information Extraction),检索 GitHub 时用这个关键词比用 slug 命中率更高。
0.2 一分钟版本(给赶时间的管理者)
- 这是什么:一份人工双人标注的临床文本信息抽取语料,从卒中患者出院小结里抽出 NIHSS 量表条目与分数;
- 谁做的:中国医学科学院医学信息研究所牵头,北京天坛医院提供临床支持;
- 规模多大:312 例患者、2,929 个条目、2,733 条"条目-分数"关系;
- 花了多久才能用:与 MIMIC-III 一样的门槛——CITI 培训 + 签署 DUA,周期通常以周计;
- 数据在哪:PhysioNet(DOI 10.13026/gyjg-0t90);
- 与 MIMIC-III 什么关系:不是独立数据库,是 MIMIC-III 出院小结的标注覆盖层,通过 HADM_ID 关联;
- 最大的坑:只有文本标注没有现成结构化表——你要自己把
.ann解析成可分析的表格; - 最亮的点:Kappa 0.901 + 条目计数全表 + 双人协议,透明度足以支撑它作为评测基准。
0.3 与本系列既有条目的关系
| 条目 | 关系 |
|---|---|
| 492 MIMIC-IV | 同属 MIMIC 谱系;492 是结构化表本体,496 是在 MIMIC-III 文本上叠加的标注层 |
| 493 在 MIMIC-III 文本上叠加的标注层 | |
| 493 nosocomial-risk-mimic | 493 用自动规则从结构化数据造标签;496 用人工从文本造标签,构成标签生产方式的两端 |
| 494 Phenotype Annotations | 494 是患者级多标签分类(这篇笔记属于哪些表型);496 是序列标注 + 关系抽取(这句话里的条目和分数怎么配对);同为 MIMIC-III 文本金标准 |
| 495 Paediatric Intensive Care | 495 是中国团队自建库;496 是中国团队在开放库上做标注,构成中国团队参与重症数据生态的双路径对照 |
§1 背景:为什么卒中量表需要一次"文本到数值"的远征
1.1 一个被低估的临床事实:NIHSS 决定了很多事
NIHSS 全称 National Institutes of Health Stroke Scale,中文通常译作"美国国立卫生研究院卒中量表",1989 年由 Brott 等人提出,此后成为急性卒中领域最广泛使用的神经功能缺损评定量表。它的设计朴素而有效:15 个条目覆盖意识、眼球运动、视野、面瘫、肢体肌力、共济、感觉、语言、构音、忽视,总分 0-42 分,分数越高代表缺损越重。
它之所以重要,是因为它直接站在多个决策节点上:
- 治疗决策:急性缺血性卒中静脉溶栓的经典窗口(发病 4.5 小时内),常以 NIHSS 阈值(如 ≥4 或 ≥5)作为筛选条件之一;血管内治疗试验也普遍以 NIHSS 作为入组严重度门槛;
- 研究分层:几乎所有卒中 RCT 都把 NIHSS 作为基线严重度变量做分层或协变量校正;
- 质量指标:医院卒中中心的质控报告、卒中登记(如 Get With The Guidelines)都把 NIHSS 记录率作为一项指标;
- 预后模型:NIHSS 是众多卒中预后评分(如 THRIVE、iScore)的核心输入。
换句话说,NIHSS 是一个把"临床观察"翻译成"可计算数字"的枢纽。枢纽之上是决策与统计,枢纽之下是医生在病历里的一段随手描述。
1.2 枢纽的裂缝:评分活在自由文本里
问题恰好出在枢纽的下半段。
在真实的电子病历中,NIHSS 的产出方式高度不规范。同一个评分可能以多种形态出现:
- 完整的量表记录:“NIHSS 评分 12 分”;
- 逐条目记录:“1a 意识水平 1 分;1b 提问 1 分;5a 左上肢 2 分……”;
- 嵌入叙述:“查体见右上肢肌力 III 级,言语含糊,NIHSS 10 分”;
- 合写与分侧混用:肢体条目既可写成"5 上肢运动 2 分",也可拆成"5a 左上肢 1 分,5b 右上肢 2 分"——本语料的条目计数表(见 §6)里,5 与 5a/5b、6 与 6a/6b 同时存在计数,正是这一现象的直接证据;
- 缩写与别写:
NIHSS、NIH stroke scale、NHISS(拼写颠倒)在真实文本中都可能出现。
这导致一个尴尬的现实:即使医院信息系统里有 NIHSS 字段,历史病历里的评分仍然沉淀在自由文本中。任何想利用历史卒中队列的研究者,都面临同一堵墙——要读几万份病历,才能把评分凑齐。
1.3 于是有了"临床信息抽取"
把这堵墙拆掉的技术路线,是自然语言处理里的信息抽取(Information Extraction, IE),具体拆成两个子任务:
- 命名实体识别(NER):找出文本里的"NIHSS 条目"(如
1a level of consciousness)与"分数值"(如1); - 关系抽取(RE):判断哪个分数属于哪个条目——即建立
has value关系。
这两个子任务各自都不新鲜,但当它们落在 NIHSS 上时,难度是实的:
- 条目表达极度多样:从规范的 “1b LOC questions” 到中文式的英文描述 “level of consciousness questions”,到临床速记 “questions”;
- 分数与条目的邻接不固定:分数可能在条目左侧、右侧、下一句,甚至在同段末尾统一列示;
- 干扰数字密集:一份卒中出院小结里有年龄、血压、血糖、INR、GCS、mRS 等大量数字,全部是"分数值"的假阳性来源;
- 总分与分项共存:“NIHSS 12 分” 与十四条分项分数同时出现,模型必须区分总分与分项,且理解总分并非简单加和(部分条目不可加)。
正因如此,一份人工金标准的价值不可替代:它既告诉你"标准答案长什么样",也告诉你"任务到底有多难"。这就是 496 这份语料的定位。
1.4 团队与动机:为什么是中国团队来做
这份语料的作者来自中国医学科学院 / 北京协和医学院医学信息研究所(Institute of Medical Information, CAMS & PUMC),临床支持来自首都医科大学附属北京天坛医院国家神经系统疾病临床研究中心。
这个组合有清晰的逻辑:
- 医学信息研究所擅长的是信息抽取方法论、标注规范设计、评测协议——他们需要的是高质量语料作为方法验证的载体;
- 天坛医院国家神经系统疾病临床研究中心是中国卒中领域最重量级的临床机构之一,能提供标注所需的临床专业判断与标注指南的临床背书;
- 而上游数据选 MIMIC-III,则是一个成本与可得性的理性选择——MIMIC-III 是当时(2021 年)全球最成熟、最广泛使用的开放重症 EHR 数据集,用它做语料底座,成果天然具备国际可比性。
这构成了一个值得注意的模式:在开放数据上做标注,再把标注贡献回开放平台。它是数据生态里"下游反哺上游"的一种健康循环,也是本系列 495(自建库出海)之外的另一条中国团队路径。
1.5 语料的诞生时间线与版本
| 时间 | 事件 |
|---|---|
| 2016 | MIMIC-III 在 Scientific Data 正式发表,成为开放重症 EHR 的基石 |
| 2016-2012 数据期 | MIMIC-III 覆盖的患者数据止于 2012 年 |
| 2021-01-25 | 本语料 v1.0.0 发布于 PhysioNet,DOI 10.13026/gyjg-0t90 |
| 2022 | 关联论文发表于 Studies in Health Technology and Informatics Vol.290(MEDINFO 2021 论文集) |
值得注意的是,从 MIMIC-III 发表(2016)到本语料上线(2021)间隔五年,而到关联论文发表(2022)又隔一年。这五年的滞后是常态——在受控数据上做标注、走合规审批、跑一致性实验、再投稿结集,每一步都要时间。这也是为什么这份语料到今天仍只有 v1.0.0 一个版本。
1.6 与 MIMIC-III 的关系:一层可插拔的标注
理解 496 的关键,是理解它的形态:它不是一份"数据集",而是一层标注覆盖层。
- 数据本体(出院小结原文)留在 MIMIC-III v1.4 的 NOTEEVENTS 表里;
- 496 提供的是 BRAT 格式的标注文件(
.txt原文副本 +.ann标注),通过 HADM_ID 可以 join 回 MIMIC-III; - 因此使用 496 的前提是先获得 MIMIC-III 资格——这一步不可绕过。
官方把访问级别设为 Credentialed,与 MIMIC-III 同门槛:完成 CITI 人体受试者培训、签署 DUA、通过 PhysioNet 审核。这个设计合理且必要:语料里包含出院小结原文,属于受保护健康信息(PHI)范畴。
1.7 这份语料在 AI 时代的三重价值
在 LLM 时代,有人会问:既然大模型能读病历,人工标注的 NER/RE 语料还有用吗?答案是有用,而且用法变了。
- 作为评测金标准:LLM 抽取能力需要客观度量。312 例、2,929 个条目、2,733 条关系的金标准,正是评测"模型能否正确抽取量表"的现成答案卷。相比笼统的"医疗问答基准",这种结构化、可精确计算 F1 的任务更能暴露模型的真实能力边界。
- 作为 few-shot 示例源:小样本 LLM 抽取的效果极度依赖示例质量。这份语料的标注规范统一、Kappa 高,适合直接抽若干条作为提示词示例。
- 作为"专业性天花板"测试:NIHSS 是领域量表,条目术语密集。模型在通用医疗问答上表现好,不等于能正确抽取量表条目——这是区分"泛泛懂医"与"可用临床工具"的一道有效门槛。
1.8 用户画像:谁真正需要这份语料
| 用户类型 | 典型诉求 | 本语料能提供的 |
|---|---|---|
| 临床 NLP 研究者 | 需要 NER+RE 联合标注的领域语料做方法验证 | 现成的条目/分数/关系三层标注 + 公开划分 |
| 卒中登记与质控人员 | 想把历史病历里的 NIHSS 批量结构化 | 可训练的标注模式 + 抽取范式参考 |
| 医疗 AI 工程师 | 需要小型金标准集评测模型抽取能力 | 2,929 条目的精确匹配基准 |
| 标注工程负责人 | 想借鉴协议设计(双人/批次/第三方仲裁) | Kappa 0.901 的完整协议与计数表 |
| LLM 评测团队 | 需要"结构化抽取"这类硬指标的评测集 | 可直接计算的 F1 金标准 |
| 医学信息学学生 | 需要一个完整的信息抽取案例 | 任务定义、语料、基线、代码四件齐全 |
1.9 一条必须说清的红线
本语料受 PhysioNet Credentialed 许可约束。使用前须完成 CITI 培训、签署 DUA,且不得将语料或其衍生的可识别信息对外分享。语料中的出院小结可能包含患者既往史、用药、社会史等敏感细节(尽管 MIMIC-III 已完成去标识化,仍受严格约束)。任何基于本语料的模型发布、论文发表,都须遵守 DUA 中的再分发限制。本条目仅整理公开元数据,不提供任何数据下载。
1.10 阅读本条的路线建议
- 想快速判断能不能用:读 §0.2 一分钟版本 + §3 规格单 + §6 坑点;
- 想复现抽取任务:读 §5 装载与评测协议 + §7 特征工程与复现包;
- 想了解量表本身:读 §2 领域概念;
- 想做合规判断:读 §8 伦理与合规;
- 想找具体数字:读 INFOBOX、§6 实证、§10 存照。
§2 领域概念:NIHSS 与卒中文本的语言学
2.1 NIHSS 量表本身
NIHSS 由 15 个计分条目构成,覆盖神经功能的关键维度。理解量表结构是理解标注体系的前提——因为语料里的"条目"就是这张量表的分项,而"分数"就是每个分项的取值。
| 条目编号 | 条目名称 | 检查内容 | 分值范围 |
|---|---|---|---|
| 1a | Level of Consciousness | 意识水平 | 0-3 |
| 1b | LOC Questions | 提问(月份、年龄) | 0-2 |
| 1c | LOC Commands | 指令(睁闭眼、握拳) | 0-2 |
| 2 | Best Gaze | 最佳凝视 | 0-2 |
| 3 | Visual Fields | 视野 | 0-3 |
| 4 | Facial Palsy | 面瘫 | 0-3 |
| 5 | Motor Arm | 上肢运动 | 0-4(分左右) |
| 6 | Motor Leg | 下肢运动 | 0-4(分左右) |
| 7 | Limb Ataxia | 肢体共济失调 | 0-2 |
| 8 | Sensory | 感觉 | 0-2 |
| 9 | Best Language | 最佳语言 | 0-3 |
| 10 | Dysarthria | 构音障碍 | 0-2 |
| 11 | Extinction and Inattention | 消退与忽视 | 0-2 |
总分理论上限 42,临床以"轻(1-4)、中(5-15)、中重(16-20)、重(21-42)"作为常用粗分档——不同文献的切点略有差异,这也是为什么模型除了抽数,还得理解数值的临床含义。
2.2 为什么"条目 + 分数"必须建成关系
设想一句真实文本:
“On admission, NIHSS was 12. 1a: 1, 1b: 1, 1c: 0, 2: 0, 3: 2, 4: 1, 5a: 3, 5b: 2, 6a: 2, 6b: 1, 7: 0, 8: 1, 9: 1, 10: 1, 11: 1.”
这句话里:
- 总分 12 与分项分数 1/1/0/0/2/1/3/2/2/1/0/1/1/1/1 同时出现;
- 如果只做 NER,“12” 和 “1” 都是数字,“5a” 和 “5b” 都是条目,但哪个数字配哪个条目完全丢失;
- 只有 RE 建立
5a → 3、5b → 2这样的关系,抽取结果才能还原为一张可计算的量表。
这就是 496 语料把 RE 与 NER 并列标注的原因。它比"只标实体"的语料多了一层结构,也因此更有实用价值。
2.3 卒中文本的语言特征
卒中出院小结在语言学上有几个鲜明特征,直接决定了抽取难度:
- 数值密度极高:一份出院小结可能包含数十个数值(生命体征、实验室、评分、时间),构成大量假阳性;
- 量表混排:卒中评估常同时出现 NIHSS、mRS(改良 Rankin 量表)、GCS(格拉斯哥昏迷评分)、Barthel 指数,条目名称相近,容易混淆;
- 缩写泛滥:
NIHSS、LOC、GCS、mRS、tPA、CTA、MRI,且同一概念可能有多种缩写; - 时间与因果交织:“入院时 NIHSS 12 分,溶栓后 2 小时降至 7 分,24 小时 4 分”——同一患者有多个时间点的评分,抽取时须考虑时序;
- 否定与条件:“未记录 NIHSS”、“因失语无法完成 1b”——否定与缺失必须建模,否则会把"未完成"误抽为 0 分。
2.4 条目编号的文本变体
条目编号在真实文本中至少有五种表达,抽取器必须全部覆盖:
| 表达形态 | 示例 | 识别难点 |
|---|---|---|
| 规范编号 | 1a、5b、11 |
编号与分数极易混("3: 2"中的 3 是编号还是分数) |
| 编号 + 名称 | 1b LOC questions |
名称变体多 |
| 纯名称 | level of consciousness questions |
名称与普通短语冲突 |
| 临床速记 | questions、gaze、dysarthria |
极短且语义模糊 |
| 合写 | 5 upper extremity(未分侧) |
与分侧写的映射关系需处理 |
本语料的条目计数表里,5 Motor Arm 记 24 次、5a Left Arm 记 136 次、5b Right Arm 记 133 次——分侧写远多于合写,说明临床实践中医生更倾向于逐侧记录。这个分布对模型设计有直接启示:应当把 5a/5b、6a/6b 当作一等实体,而非"5 的下属"。
2.5 总分与分项的关系:不可简单加和
一个容易踩的坑是:NIHSS 总分并不等于所有分项之和。原因包括:
- 部分条目(如 1a)是全局评估,与其他条目存在信息重叠;
- 缺失条目(如失语患者无法完成语言项)在总分中按某种规则处理;
- 临床记录的总分可能来自不同时间点,或干脆是医生的估计。
因此语料里"总分"作为独立实体存在(条目计数表中 NIHSS 记 548 次,推测即为量表名称/总分的提及),与分项分数平行标注,而非由分项推导。
2.6 “has value” 关系的语义边界
语料定义的关系类型是 has value,语义是"该条目取该分数"。看似简单,边界却需要明确定义:
- 一对多:一个条目可能在一份小结中出现多次(不同时间点),因此可有多条关系;
- 总分关系:“NIHSS 12” 中的 12 是总分,属于
NIHSS实体的值; - 跨句关系:条目上一行、分数下一行的情形,关系必须跨句建立;
- 表格化文本:若出院小结里出现近似表格的排列,关系抽取需要理解版面语义。
2.7 从量表到结构化表:抽取的下游用途
NIHSS 抽取的下游用途决定了标注的精确定义:
| 下游用途 | 对抽取精度的要求 |
|---|---|
| 队列筛选(按严重度入组) | 需要总分正确,容忍个别分项误差 |
| 严重度分层建模 | 需要总分与关键分项(如 5、6、9)正确 |
| 治疗决策回顾研究 | 需要时间点信息,误差容忍度低 |
| 质控指标统计 | 需要"是否有记录"的判定准确 |
| 表型定义(如重症卒中) | 需要总分阈值判定准确,边界样本敏感 |
2.8 与 ICD 编码的互补关系
上游筛选用了 ICD-9 编码(430/431/432/433/434/436)来识别卒中病例——这是从结构化数据取病例;而语料做的,是从文本取严重度。两者互补:
- ICD 编码告诉你"是不是卒中":编码准确率高,但有滞后(出院编码)、粒度粗(不能反映病情轻重);
- NIHSS 告诉你"卒中多严重":粒度细、贴近临床,但只存在于文本中,需要抽取。
这种"结构化筛病例 + 文本抽取补细节"的组合,是电子病历二次利用的经典范式,也是本语料设计背后的临床逻辑。
2.9 名词速查表
| 缩写/术语 | 全称 | 含义 |
|---|---|---|
| NIHSS | National Institutes of Health Stroke Scale | 美国国立卫生研究院卒中量表 |
| LOC | Level of Consciousness | 意识水平(含 1a/1b/1c) |
| mRS | modified Rankin Scale | 改良 Rankin 量表,卒中功能结局指标 |
| GCS | Glasgow Coma Scale | 格拉斯哥昏迷评分 |
| ICH | Intracerebral Hemorrhage | 脑内出血 |
| SAH | Subarachnoid Hemorrhage | 蛛网膜下腔出血 |
| NER | Named Entity Recognition | 命名实体识别 |
| RE | Relation Extraction | 关系抽取 |
| IE | Information Extraction | 信息抽取 |
| BRAT | Brat Rapid Annotation Tool | 开源文本标注工具 |
| HADM_ID | Hospital Admission ID | MIMIC 住院标识 |
| DUA | Data Use Agreement | 数据使用协议 |
| CITI | Collaborative Institutional Training Initiative | 人体受试者保护培训课程 |
| PHI | Protected Health Information | 受保护健康信息 |
2.10 一个必须澄清的规模错觉
看到 312 例,很多人会立刻判断"太小了,没用"。但这个判断忽略了任务的特殊性:
- NER+RE 的标注成本是字符级劳动的平方级。2,929 个条目、2,733 条关系,意味着标注员要逐句读、逐项标、逐对连关系。以本语料的规模,两名有医学信息学背景的标注员完成 312 份出院小结并达成 Kappa 0.901,本身已是一项可观的人力投入。
- 信息抽取任务的语料"小"是常态。领域 NER/RE 的金标准语料多在数百到数千文档量级——Biocreative、i2b2、n2c2 系列任务的语料规模也在同一数量级。这不是缺陷,是学科现实。
- 小语料 + 高一致性 > 大语料 + 低一致性,对评测基准而言尤其如此。如果标注本身不可靠,规模再大也只是把噪声放大。
2.11 阅读本条需要的前置知识
- 了解基本的 NER/RE 概念(BIO 标注、实体、关系抽取);
- 了解 MIMIC-III 的基本结构(NOTEEVENTS、HADM_ID、受控访问流程);
- 对卒中临床有大致概念(NIHSS、溶栓窗口、缺血性 vs 出血性);
- 会用 Python 处理
.ann格式文件(BRAT 标注语法简单,半小时可上手)。
如果以上四条你只满足前三,不用担心——§5 会给出解析 .ann 的最小代码路径。
§3 数据规格与获取:从 PhysioNet 页面到可用的标注文件
3.1 官方页面能给你的东西
PhysioNet 官方条目页(/content/stroke-scale-mimic-iii/1.0.0/)提供的信息可归为四类:
| 类别 | 内容 |
|---|---|
| 身份元数据 | 官方标题、版本号、发布日期、DOI、RRID、许可协议 |
| 规模数字 | 312 例患者、2,929 个 items、2,774 个 measurements、2,733 条 relations、7,848 句 |
| 协议说明 | BRAT 工具、双标注员、100 份一致性预标注、Kappa 0.901、划分(220/92) |
| 引用与致谢 | 4 位作者、机构、临床支持单位、资助编号、GitHub 仓库、COI 声明 |
注意一个容易被忽略的细节:官方页面没有提供数据本身的直下下载链接(受控访问数据集皆如此)。你能从页面得到的是"这是什么、怎么引用、怎么申请",数据本体需要登录后获得。
3.2 数据本体的形态
获得访问权限后,你会拿到的是与 MIMIC-III v1.4 出院小结对应的标注文件包。其组织形态遵循 BRAT 惯例:
.txt文件:出院小结原文(纯文本,与 MIMIC-III NOTEEVENTS 对应);.ann文件:与该.txt同名的标注文件,每行一条标注,格式为T{id}\t{类型} {起止偏移}\t{文本}或R{id}\t{关系类型} Arg1:{实体id} Arg2:{实体id};- 划分清单:训练集(220)与测试集(92)对应文件,以及端到端测试集(RE_End2End_Test.txt)。
这意味着实际使用中你做的是文件系统层面的工作——遍历目录、读 .ann、解析标注,而非连数据库查表。
3.3 BRAT 标注格式速解
理解 .ann 格式是使用本语料的第一步。BRAT 的行格式如下:
T1 NIHSS_item 1234 1240 1a level
T2 Score 1242 1243 1
R1 has_value Arg1:T1 Arg2:T2
T开头是实体,字段依次为:实体 ID、实体类型、字符起止偏移、实体文本;R开头是关系,字段依次为:关系 ID、关系类型、Arg1、Arg2;- 偏移是字符级,不是 token 级——这与 MIMIC-III 的 ROW_ID 锚点不同,是本语料"自带原文"的表现。
这点值得展开:494(Phenotype Annotations)不提供文本、只提供 ROW_ID 索引;而 496 提供原文副本 + 字符级偏移。前者更轻、更依赖上游;后者更重、更自足。两种设计各有取舍。
3.4 版本语义与稳定性
v1.0.0 是唯一版本,2021-01-25 发布后未见更新。这带来两个判断:
- 稳定性高:不会因为版本迭代导致标注格式变化,引用时说明 v1.0.0 即可长期有效;
- 陈旧性明确:最新学术语料停在上游 MIMIC-III 的数据截止期(2012 年),且自 2021 年以来未做扩充。若你的研究涉及近年卒中诊疗变化(如取栓适应证扩大、新型抗凝药),这份语料无法覆盖。
3.5 获取流程(Credentialed 路径)
| 步骤 | 动作 | 预计周期 |
|---|---|---|
| 1 | 注册 PhysioNet 账号 | 即时 |
| 2 | 完成 CITI “Data or Specimens Only Research” 课程并上传证书 | 1-3 天 |
| 3 | 在 PhysioNet 提交本语料访问申请(含 MIMIC-III 资格关联) | 通常 1-2 周 |
| 4 | 签署 DUA(可能需机构签字) | 视机构流程 |
| 5 | 获批后登录下载数据 | 即时 |
关键提醒:本语料的资格门槛与 MIMIC-III 绑定。若你已拥有有效 MIMIC-III 资格,通常可较快获得本语料授权;若没有,需先走完 MIMIC-III 的完整流程。
3.6 与"Open Access"的落差
PhysioNet 上部分数据集标注为 Open Access(如 494 的页面元数据),本语料则是 Credentialed。这个差别对使用者影响巨大:
- Open Access 可即刻下载,适合快速探索与教学;
- Credentialed 需数周审批,适合正式研究;
- 对本语料而言,受控是必要的——原文包含自由文本叙事,即使 MIMIC-III 已去标识化,自由文本的残余可识别风险仍高于结构化表。
3.7 引用链:三层引用
使用本语料时,至少应引用三层:
- 数据语料本身:Wang J, Huang X, Yang L, Li J. NIHSS Annotations for the MIMIC-III Database (version 1.0.0). PhysioNet. 2021. DOI 10.13026/gyjg-0t90.
- 上游数据库:Johnson AEW, et al. MIMIC-III, a freely accessible critical care database. Sci Data. 2016;3:160035.
- 方法论文(若使用其基线):Wang J, Yang L, Huang X, Li J. Stud Health Technol Inform. 2022;290:1004-1005. DOI 10.3233/shti220239.
漏引上游 MIMIC-III 是常见错误——它不仅是数据来源,其 DUA 也约束你的使用行为。
3.8 版本锚定与可复现性
要在论文中声明可复现,建议固定以下锚点:
| 锚点 | 值 |
|---|---|
| 语料版本 | v1.0.0 |
| 语料 DOI | 10.13026/gyjg-0t90 |
| 上游数据库版本 | MIMIC-III v1.4 |
| 划分文件 | NER_RE_Train.txt / NER_RE_Test.txt |
| 预处理脚本 | github.com/huangxiaoshuo/NIHSS_IE |
其中"上游版本"常被忽略:MIMIC-III 有 v1.4 与后续补丁版本,若上游版本不同,HADM_ID 的对应关系可能有细微差异。
3.9 数据对账清单
拿到数据后,建议立刻做一次对账,确认包完整且与官方口径一致:
- [ ] 出院小结总数为 312(220 训练 + 92 测试);
- [ ]
.txt与.ann文件一一配对,无孤儿文件; - [ ] 实体类型包含"条目"与"分数"两大类;
- [ ] 关系类型为
has_value; - [ ] 稀疏项抽样核对:如 5a(136 次)、5b(133 次)、6a(130 次)、6b(121 次);
- [ ] 统计句子数是否接近 7,848。
若你的统计与官方数字有明显偏差,先怀疑统计口径(例如是否把总分计入 item 数),而非数据缺漏。
3.10 目录导航(典型结构)
stroke-scale-mimic-iii/
├── NER_RE_Train.txt # 训练集(220 份)
├── NER_RE_Test.txt # 测试集(92 份)
├── RE_End2End_Test.txt # 端到端关系抽取测试集
└── (各出院小结的 .txt / .ann 文件对)
实际目录名与文件组织可能随版本略有差异,以上为 BRAT 语料的典型形态。
3.11 DAIMS 评估:6.4 / 8
按本系列的 DAIMS 八维度框架逐项评估:
| 维度 | 评分 | 依据 |
|---|---|---|
| 文档完备性 | 1.0 | 官方页面给足身份、规模、协议、计数表;关联论文补充方法细节 |
| 机器可读性 | 0.5 | BRAT .ann 是半结构化文本格式,需自行解析为表格;无现成 CSV/JSON |
| 标签质量透明度 | 1.0 | 双人协议、Kappa 0.901、预标注子集规模均公开 |
| 可访问性 | 0.5 | Credentialed,需 CITI + DUA,审批周期以周计 |
| 许可清晰度 | 1.0 | PhysioNet Credentialed Health Data License 1.5.0 明确 |
| 格式标准化 | 0.4 | BRAT 格式通用但非医学信息学标准(非 CONLL、非 JSONL);字段命名随工具传统 |
| 评测协议完备性 | 1.0 | 官方给出 train/test 划分与端到端测试集,可直接计算 F1 |
| 生态可持续性 | 1.0 | 锚定 MIMIC-III 生态 + 有 GitHub 代码仓库 + 有同行评议论文支撑 |
| 合计 | 6.4 / 8 | 透明度与协议是强项,机器可读性与格式标准化是短板 |
扣分集中在"机器可读性"与"格式标准化":BRAT 是标注工具的原生格式而非数据交换标准,使用者必须自己写解析代码(§5.1 给出最小路径)。这是 496 与 494 的共同特征,也反映了一个现实——标注类数据集的"最后一公里"成本,通常落在使用者身上。
3.12 元数据速查
| 字段 | 值 |
|---|---|
| Title | National Institutes of Health Stroke Scale (NIHSS) Annotations for the MIMIC-III Database |
| Version | 1.0.0 |
| Published | 2021-01-25 |
| DOI | 10.13026/gyjg-0t90 |
| RRID | SCR_007345 |
| License | PhysioNet Credentialed Health Data License 1.5.0 |
| Access | Credentialed(CITI + DUA) |
| Authors | Jiayang Wang; Xiaoshuo Huang; Lin Yang; Jiao Li |
| Contact | 见 PhysioNet 页面 |
| Code | github.com/huangxiaoshuo/NIHSS_IE |
§4 数据结构与标注设计:三张表与两层标注
4.1 逻辑组织
本语料的逻辑结构可以概括为"一份原文、两层标注、三种视图":
- 一份原文:MIMIC-III v1.4 的卒中患者出院小结;
- 两层标注:实体层(条目 + 分数)与关系层(has value);
- 三种视图:序列标注视图(BIO tags)、实体视图(entities)、关系视图(relations)。
这对应官方字典里的字段:HADM_ID、token、tags、entities、relations、code。
4.2 字段逐一解剖
| 字段 | 类型 | 语义 | 使用场景 |
|---|---|---|---|
| HADM_ID | 字符串(6 位) | MIMIC-III 住院标识 | join 回上游、跨表关联 |
| token | 字符串 | 词元 | 序列标注建模的输入单元 |
| tags | 字符串序列 | BIO 标注(B-XXX/I-XXX/O) | 训练序列标注模型 |
| entities | 结构 | 实体列表(类型 + 偏移 + 文本) | 实体级评测、可视化 |
| relations | 结构 | 关系列表(类型 + Arg1 + Arg2) | 关系抽取建模 |
| code | 字符串 | 编码字段 | 官方未详述用途,可能承载条目代码 |
为什么同时给 token/BIO 与 entities/relations 两套视图? 因为不同建模路线需要不同输入:序列标注模型(BERT-BiLSTM-CRF)吃 BIO 序列;关系抽取模型(Random Forest)吃实体对特征。语料同时提供两套,等于把预处理的一部分工作提前替使用者完成——这是语料设计上的一处贴心,也是 §5 里"两步管线"能直接跑起来的前提。
4.3 实体体系:条目 vs 分数
实体分两大类,语义边界清晰:
- 条目实体:对应 NIHSS 的 15 个计分项(含分侧写的 5a/5b/6a/6b),以及量表本身(
NIHSS); - 分数实体:对应条目的取值(数字,可能带"分"字后缀)。
规范化的关键问题:条目实体是否已归一化到标准编号? 官方页面给的是条目计数表(按标准编号统计),但语料标注中实体文本可能是 “1a level”、“level of consciousness” 等多种形态。使用前需检查标注是否含归一化字段,若不含,需自建映射表。
4.4 关系体系:只有一种,但边界清晰
语料定义唯一关系类型 has_value。设计上的克制值得称道:与其定义十种关系条款,不如把"条目取值"这一核心语义做扎实。
has_value 的三个边界条件:
- 单向性:Arg1 必为条目,Arg2 必为分数,反向不成立;
- 可多值:同一 Arg1 可对应多个 Arg2(不同时间点);
- 可跨句:关系不限于句内。
4.5 标注工作流
从官方描述可还原出标注流程:
- 病例筛选:从 MIMIC-III 中按 ICD-9(430/431/432/433/434/436 及子型)筛出 3,660 例卒中病例;
- 抽样与初筛:从中确定纳入的 312 例(官方未详述 3,660 → 312 的抽样规则,见存照);
- 预标注与一致性:两名标注员独立标注同一批 100 份出院小结;
- 分歧消解:讨论分歧,必要时咨询第三方,迭代标注指南;
- 全量标注:指南稳定后完成 312 份;
- 划分:220 训练 / 92 测试。
这个流程的规范之处在于先做一致性预标注再全量推进——避免"标完才发现定义不清"的返工。这是标注工程里的标准最佳实践。
4.6 BRAT 作为工具选择
选择 BRAT 有几个实际理由:
- 支持关系标注:BRAT 原生支持实体间连边,适合 NER+RE 联合任务;
- 轻量开源:Web 界面,本地部署即可,无需复杂基础设施;
- 格式简单:
.ann纯文本,解析成本低(§5.1); - 学术通用:NLP 领域广泛使用,工具链与教程丰富。
局限也明显:BRAT 无内置版本控制、无冲突检测、不适合大规模并行标注。对 312 份的规模,这些局限不构成障碍;但对万级语料,BRAT 会力不从心。
4.7 三条硬约束
使用本语料时,有三条不能逾越的约束:
- 必须先有 MIMIC-III 资格:语料不独立可用;
- 不得再分发:DUA 明确禁止将数据(含原文)分享给未授权方;
- 不得尝试再识别:即使理论上可通过文本细节推断患者身份,也严禁尝试。
4.8 一致性数据的价值:Kappa 0.901 怎么读
Cohen’s Kappa 0.901 在 Landis & Koch 标准下属 “almost perfect”。但读这个数字要注意三点:
- 它是 100 份子集上的一致性,不是全量的。官方未给全量一致性,说明全量时代价过高或分歧已足够小;
- 它是最终协议下的结果。预标注的迭代过程(讨论、咨询、改指南)是达成 0.901 的关键,过程本身未被量化;
- 不同类别的难度不同。0.901 是聚合值,条目类(编号明确)与分数类(数字明确)可能一致性极高,而"合写 vs 分侧写"、
- 否定/缺失表述可能一致性较低——这些细分未公开(见存照)。
4.9 稀疏性与长尾
从条目计数表看分布并不均匀:
- 高频:
NIHSS548 次(总提及)、4 Facial Palsy191 次、10 Dysarthria186 次、9 Best Language174 次、8 Sensory171 次; - 中频:
3 Visual Fields164、11 Extinction164、1b160、2 Best Gaze154、1a150、1c150、7 Limb Ataxia147、5a136、5b133、6a130、6b121; - 低频:
5 Motor Arm(合写)24、6 Motor Leg(合写)26。
低频项恰恰是模型容易出错的地方——5/6 的合写形态样本极少,模型几乎学不会。这是一个典型的长尾陷阱:如果评测集里出现合写样本,模型性能可能骤降,而由于样本太少,这种骤降在训练中难以被发现。
4.10 血缘关系图(五跳)
MIMIC-III v1.4 (Beth Israel Deaconess Medical Center, 2001-2012)
│ NOTEEVENTS 出院小结
│ 按 ICD-9 430/431/432/433/434/436 筛出 3,660 例
▼
312 例卒中患者出院小结(筛后队列,抽样规则官方未详述)
│ BRAT 双人标注
│ 100 份预标注 → Kappa 0.901 → 全量标注
▼
2,929 items + 2,774 measurements + 2,733 relations
│ 划分
▼
Train 220 / Test 92 / End2End Test
│ 基线建模
▼
BERT-BiLSTM-CRF + Random Forest (F1 0.9006)
这张图揭示了语料的完整血缘:从单中心 ICU 数据库(BIDMC),经过 ICD 编码筛选与人工标注,最终成为可训练的评测集。
4.11 与 494 的结构对照
| 维度 | 494 Phenotype Annotations | 496 NIHSS Annotations |
|---|---|---|
| 标注目标 | 患者级表型(多标签分类) | 量表条目 + 分数(NER + RE) |
| 文本提供 | 否,仅 ROW_ID 索引 | 是,原文 + 字符级偏移 |
| 标注粒度 | 笔记级 | 词元/字符级 |
| 关系类型 | 无 | has_value |
| 一致性指标 | Cohen’s Kappa(逐表型) | Cohen’s Kappa = 0.901(聚合) |
| 划分 | 官方未发布 | 220 / 92 |
| 规模 | 2,102 篇 | 312 篇 |
| 共同点 | 均为 MIMIC-III 文本金标准;均受 Credentialed 约束 | 同左 |
两者恰好构成临床文本金标准的两种范式:文档级分类与序列级抽取。若你的任务是"筛选病人",看 494;若你的任务是"抽出结构化数值",看 496。
§5 装载、标注与评测协议
5.1 最小可用装载路径(解析 BRAT)
不需要复杂工具,几十行 Python 即可把 BRAT 标注转成 DataFrame:
import os, re, pandas as pd
def parse_ann(path):
ents, rels = {}, []
for line in open(path, encoding='utf-8'):
line = line.rstrip('\n')
if not line or line.startswith('#'):
continue
parts = line.split('\t')
if parts[0].startswith('T'):
eid, meta, text = parts[0], parts[1], parts[2]
etype, start, end = meta.split(' ', 2)
ents[eid] = {'type': etype, 'start': int(start), 'end': int(end), 'text': text}
elif parts[0].startswith('R'):
rid, meta = parts[0], parts[1]
f = meta.split(' ')
rtype = f[0]
args = dict(a.split(':') for a in f[1:] if ':' in a)
rels.append({'rid': rid, 'type': rtype, **args})
return ents, rels
rows = []
for root, _, files in os.walk('stroke-scale-mimic-iii'):
for fn in files:
if fn.endswith('.ann'):
hadm = fn.replace('.ann', '')
ents, rels = parse_ann(os.path.join(root, fn))
for r in rels:
rows.append({
'hadm_id': hadm,
'relation': r['type'],
'item': ents[r['Arg1']]['text'],
'item_type': ents[r['Arg1']]['type'],
'score': ents[r['Arg2']]['text'],
'score_type': ents[r['Arg2']]['type'],
})
df = pd.DataFrame(rows)
print(df.shape, df['relation'].value_counts().to_dict())
跑通后你应得到一个"条目-分数"对的长表,行数应与 2,733 量级一致(差异源于是否统计链式/多值关系的展开方式)。
5.2 评测协议:两个层级
官方提供了两个可评测的层级:
| 层级 | 评测文件 | 评测内容 | 指标 |
|---|---|---|---|
| 端到端关系抽取 | RE_End2End_Test.txt | 从原始文本直接产出"条目-分数"三元组 | 三元组级 Precision / Recall / F1 |
| 分步评测 | NER_RE_Test.txt | 先评测 NER(实体级 F1),再评测 RE(关系级 F1) | 实体 F1 + 关系 F1 |
选择建议:
- 报告模型整体能力:用端到端测试集,报告三元组 F1;
- 诊断错误来源:用分步评测,区分"Ner 找错了"还是"关系配错了"。
5.3 两步管线的配方
关联论文(SHI 2022)采用的是经典两步管线,可直接借鉴:
第一步:NER(抽出条目与分数)
- 模型:BERT-BiLSTM-CRF
- 为什么这套组合有效:BERT 提供上下文语义表征;BiLSTM 建模序列依赖;CRF 保证 BIO 标签序列的合法性(不会出现 I-XXX 接 B-YYY 的非法转换)。这是中文/英文序列标注的成熟范式。
第二步:RE(判断 has_value 关系)
- 模型:Random Forest
- 特征工程是重点:通常是"两个实体间的文本片段 + 实体类型组合 + 距离 + 是否同句"等;
- 为什么用 RF 而非深度模型:语料仅 312 例,深度关系模型容易过拟合,树模型在小样本上更稳。这是一个务实的选择——不是所有任务都该上大模型。
结果对照:
| 方法 | F1 |
|---|---|
| 规则法(rule-based) | 0.8098 |
| BERT-BiLSTM-CRF + Random Forest | 0.9006 |
深度模型比规则法提升约 9 个百分点,但规则法 0.81 的水平本身说明了任务的可结构化程度——NIHSS 文本有较强的模式性,用规则能拿到八成分。这个对照对工程实践很重要:并非所有场景都需要模型。
5.4 端到端示例解读
论文给出的输出示例:
"1b level of consciousness questions: said name = 1"
解读:
1b level of consciousness questions是条目实体(含编号 1b + 名称);1是分数实体;- 二者之间的
has value关系表示该条目取值为 1。
从这一例可以看到临床文本的典型形态:编号 + 医学英文描述 + 冒号 + 值,格式相对规整。但真实文本中格式会漂移(无冒号、值前置、跨行),这正是规则法只能到 0.81 的原因。
5.5 基线复现需要的环境
若使用官方 GitHub 仓库(huangxiaoshuo/NIHSS_IE)复现:
| 组件 | 建议 |
|---|---|
| 语言 | Python 3.x |
| 深度学习框架 | PyTorch(BERT-BiLSTM-CRF 常见实现) |
| 预训练模型 | BERT-base(英文,如 bert-base-cased) |
| 序列标注库 | 自实现 CRF 层或用 pytorch-crf |
| 机器学习 | scikit-learn(RandomForestClassifier) |
| 数据访问 | 需自行获授权下载语料 |
注意:官方仓库的完整可运行性未经本条目验证(存照),使用前请核对依赖版本与 README。
5.6 与 MIMIC-III join 的实操
要用语料做"结构化 + 文本"联合分析,join 是必经步骤:
-- 在获得授权的 MIMIC-III 实例中
SELECT n.hadm_id, n.text, a.*
FROM noteevents n
JOIN (SELECT DISTINCT hadm_id FROM nihss_annotations) a
ON n.hadm_id = a.hadm_id
WHERE n.category = 'Discharge summary';
实际使用中,建议把解析好的标注表先落成 CSV/Parquet,再与 MIMIC-III 做 join,避免每次重复解析 .ann。
5.7 评测时的三个常见错误
- 忽略总分实体:把
NIHSS实体的 548 次提及当作噪声剔除,导致评测集与官方口径不一致; - 错误的实体边界:把 “1b LOC questions” 拆成多个实体,或把 “5a” 与分数 “3” 合并成一个实体——边界定义必须与标注规范一致;
- 关系方向颠倒:
has_value是有向关系,Arg1/Arg2 颠倒会导致关系级 F1 归零。
5.8 从零构建自有 NIHSS 语料的协议复用
如果你的机构想自建类似语料(例如中文病历的 NIHSS 抽取),可复用这份语料的协议框架:
| 环节 | 可复用要点 |
|---|---|
| 病例筛选 | 用 ICD 编码先粗筛,再人工确认 |
| 标注工具 | BRAT(小规模)或专业化平台(大规模) |
| 一致性 | 先做 100 份左右的双人预标注,测 Kappa,收敛后再全量 |
| 一致性门槛 | Kappa ≥ 0.8 视为可接受(Landis & Koch) |
| 关系定义 | 明确方向性、可多值性、跨句允许性 |
| 划分 | 训练/测试固定,端到端测试集单列 |
中文场景的特殊难点:中文无空格分词、条目名可能有中文译名变体、中文病历的量表记录习惯与英文不同(例如更常见"NIHSS 评分 12 分"的整体写法而非逐项)。
5.9 错误黑名单(会导致评测失真的操作)
- ❌ 用测试集做超参调优后仍报测试集 F1;
- ❌ 把训练集与测试集的病历合并后重新划分(破坏官方划分);
- ❌ 用其他患者的数据做数据增强后混入测试集(患者级泄漏);
- ❌ 评测时用 gold 实体做 RE 输入,却报告为端到端结果;
- ❌ 忽略缺失条目的处理规则,把"未记录"当作 0 分。
5.10 与 492、493、494 的联合使用
| 联合方式 | 用途 |
|---|---|
| 496 + 492(MIMIC-IV) | 用 MIMIC-IV 的结构化表做卒中队列的实验室/用药分析,用 496 的方式把 NIHSS 抽取出来补严重度 |
| 496 + 493(nosocomial-risk-mimic) | 493 提供院内感染风险的自动标签,496 提供卒中严重度,联合做"卒中 + 感染"复合表型 |
| 496 + 494(Phenotype Annotations) | 494 的患者表型(如 Advanced Heart Disease)与 496 的卒中严重度结合,构建更细的队列分层 |
| 496 + 495(PIC) | 一个英文成人卒中语料、一个中文儿科重症库,跨语言迁移的天然实验材料 |
5.11 部署形态建议
| 场景 | 建议部署 |
|---|---|
| 一次性研究 | 本地脚本 + Jupyter,无需服务化 |
| 批量历史病历结构化 | 批处理管线 + 结果落表,定期增量 |
| 实时质控 | 轻量规则优先(F1 0.81 已可用),模型作为补充 |
| LLM 方案 | 用本语料做 few-shot 示例与评测集,模型负责抽取 |
§6 实证基座:从 312 例语料能读出什么
6.1 规模的三个数字要一起看
312 / 2,929 / 2,733 这组数字经常被单独引用,但它们必须一起读:
- 312 是患者数,决定统计功效与泛化评估的可信度;
- 2,929 是条目数,决定序列标注任务的有效样本量——注意这不是 312 的十几倍那么简单,因为一份出院小结平均含约 9.4 个条目;
- 2,733 是关系数,略少于条目数(2,929 − 2,733 = 196),说明约 6.7% 的条目没有配到分数——这些正是"提及但未赋值"的条目(如"因失语无法评估 9 Best Language")。
这三个数字的差值本身就是信息:缺失评分的建模是本任务的隐含难点,而语料诚实地保留了它。
6.2 2,774 与 2,733:measurements 与 relations 的区别
官方同时给了两个容易混淆的数字:
| 数字 | 名称 | 含义推测 |
|---|---|---|
| 2,774 | measurements | 测量值总数(含未成功建立关系的分数实体?) |
| 2,733 | item-score relations | 成功建立 has_value 关系的配对数 |
两者差 41。合理推断:存在 41 个分数实体未被纳入关系(例如总分之外的孤立数字、或不完整的记录)。使用时应明确自己统计的是哪一层——这是复现时最常见的口径分歧点(见 §6.16 坑点 5)。
6.3 条目分布:从计数表读四个结论
| 排名 | 条目 | 计数 | 观察 |
|---|---|---|---|
| 1 | NIHSS(量表本体) | 548 | 总量提及,约为单项计数的 3 倍 |
| 2 | 4 Facial Palsy | 191 | 面瘫最易观察,记录率最高 |
| 3 | 10 Dysarthria | 186 | 构音障碍记录率次高 |
| 4 | 9 Best Language | 174 | 语言功能高频 |
| 5 | 8 Sensory | 171 | 感觉项高频 |
| 6 | 3 Visual Fields | 164 | — |
| 7 | 11 Extinction | 164 | — |
| 8 | 1b LOC Questions | 160 | — |
| 9 | 2 Best Gaze | 154 | — |
| 10 | 1a / 1c | 150 / 150 | 意识水平三项成组出现 |
| 12 | 7 Limb Ataxia | 147 | — |
| 13 | 5a Left Arm | 136 | — |
| 14 | 5b Right Arm | 133 | — |
| 15 | 6a Left Leg | 130 | — |
| 16 | 6b Right Leg | 121 | — |
| 17 | 5 Motor Arm(合写) | 24 | 长尾 |
| 18 | 6 Motor Leg(合写) | 26 | 长尾 |
四个结论:
- 不存在"全项齐备"的文本。最少的条目也有 121 次(6b),说明语料覆盖均匀,但没有任何一项达到 312 的上限——即没有一份小结写全了所有分项。这直接反驳了"NIHSS 文本总是完整量表"的假设。
- 观察成本影响记录率。面瘫(191)、构音(186)、语言(174)这些"医生一眼能看到"的项记录率最高;而需要专门配合检查的项(如 7 Limb Ataxia 147)偏低。
- 分侧写是主流。5a/5b(136/133)远多于 5(24),6a/6b(130/121)远多于 6(26)。这是设计抽取器时的重要先验。
- 意识三项(1a/1b/1c)成组。150/160/150 三个数字接近,说明它们通常一起出现——抽取时可以成组处理。
6.4 语义句法统计
- 7,848 句:312 份小结共 7,848 句,平均 25.2 句/份;
- 153 token/份:这是平均 token 数——注意这个数字偏低。
关于 153 token/份 的合理推断:若每份出院小结平均 25 句、仅 153 token,则平均句长仅约 6 token。这个长度明显短于常规英文出院小结(通常数百到数千词)。可能的解释有三:
- 统计的是"NIHSS 相关片段"而非整份小结——最可能的解释:语料可能只保留与抽取目标相关的文本段落;
- token 的切分方式特殊(如按量表行切);
- 官方统计口径与我们理解的不同。
这是本条目必须诚实标出的口径存疑点(见存照)——它是一个"官方数字与我们直觉不符"的典型案例,提醒使用者:引用官方数字时,要理解它的统计口径,而非直接当作文本长度的证据。
6.5 一致性 0.901 的含金量
Cohen’s Kappa 0.901 值得展开评价:
| 参照标准 | 区间 | 强度 |
|---|---|---|
| Landis & Koch (1977) | 0.81-1.00 | Almost perfect |
| Fleiss (1981) | >0.75 | Excellent |
在信息抽取任务中,0.9 级别的 Kappa 属于优秀水平。作为对照,许多临床 NLP 标注任务的 Kappa 落在 0.6-0.8 之间。这说明:
- NIHSS 抽取的任务定义是清晰的——条目有编号、分数是数字,语义边界明确;
- 标注指南是有效的——100 份预标注的迭代收敛过程起了关键作用;
- 这个任务比"表型识别"更容易达成一致——对比 494 的表型标注(Kappa 从 0.561 到 1.000 跨度极大),NIHSS 的结构化程度明显更高。
但也要注意:高 Kappa 不等于任务简单。0.901 是在"人工仔细标注"条件下的结果;模型要在同样的数据上达到 0.90 F1,难度是另一回事(论文的 0.9006 F1 恰好卡在附近,但这个巧合不应被解读为等价——Kappa 与 F1 是不同量纲的指标)。
6.6 一致性 × 难度矩阵
把 Kappa 0.901 与各条目的实际难度放在一起看,可以构建一个二维矩阵:
| 难度来源 | 条目示例 | 为什么难 |
|---|---|---|
| 表述变体多 | 1b LOC Questions | “questions”、“level of consciousness”、“1b” 多种写法 |
| 邻接不固定 | 所有条目 | 分数可能在远距离 |
| 样本稀疏 | 5、6(合写) | 仅 24/26 样本 |
| 数值混淆 | 8 Sensory、9 Best Language | 同句有大量其他数字 |
| 否定/缺失 | 9 Best Language | “因失语无法评估” |
| 总分干扰 | NIHSS | 548 次总分提及可能被误抽为分项 |
这张矩阵的实用价值在于:它告诉你评测时该重点看哪里。如果你的模型在面瘫(4)上错得多,问题在"变体覆盖";如果在 5/6 上错得多,问题是"长尾";如果在 9 上错得多,问题是"否定处理"。
6.7 分布失衡对建模的影响
尽管条目分布在 24-191 之间(除总分外),相差约 8 倍,属于中等失衡。影响是:
- 序列标注中的 O 标签压倒性多数:绝大多数 token 是普通文本,模型容易倾向于全部预测为 O,从而获得高准确率但零召回。这是序列标注的经典陷阱——必须报 F1 而不是 accuracy;
- 合写项几乎不可学:5/6 只有 24/26 例,若测试集中出现,性能不可预测;
- 建议的缓解手段:类别加权损失、过采样稀有项、或对合写与分侧做统一归一化(把 5/6 映射为 5a+5b 处理)。
6.8 文类效应:只有出院小结意味着什么
语料只含出院小结(discharge summaries),这带来明确的适用边界:
| 文类 | 特征 | 已被覆盖? |
|---|---|---|
| 出院小结 | 总结性强、结构相对规整、含最终评分 | ✅ |
| 病程记录 | 每日更新、评分随时间变化 | ❌ |
| 急诊记录 | 首诊评分(决定溶栓) | ❌ |
| 护理记录 | 观察性描述、评分少 | ❌ |
| 影像报告 | 描述病变而非评分 | ❌ |
这是一个严重的能力边界:临床最关心"入院时/溶栓前的 NIHSS",而这通常记录在急诊记录或入院记录中,恰恰不在本语料范围。若你把在出院小结上训练的模型直接用于急诊记录抽取,会遭遇分布外衰变,且这种衰变无法从本语料中预估。
6.9 时间切片与代际差异
上游数据止于 2012 年。2012 至 2026 年间,卒中诊疗发生的变化包括:
- 机械取栓适应证从"6 小时内"扩展到更长窗口(DAWN/DEFUSE-3 试验后);
- 新型口服抗凝药普及,房颤相关卒中管理改变;
- 电子病历系统演进,模板化书写比例上升。
这些变化对抽取任务(而非临床结论)的影响主要是书写习惯的漂移:模板化可能让文本更规整(利于抽取),也可能引入新的模板变体(不利)。因此本语料训练出的模型在当代病历上需要重新验证。
6.10 与规则法的对照给我们的启示
规则法 F1 0.8098 vs 深度模型 0.9006 的对照,值得单独解读:
- 0.81 是"任务可结构化程度"的度量。它意味着 NIHSS 文本里约八成是规则可捕获的(编号 + 数字的模式);
- 剩下的 0.19 是"语言的顽固部分":变体、跨句、否定、稀疏项;
- 工程含义:如果你的场景对精度要求不高(如质控的"是否有记录"),规则法足够且成本极低;若要做队列分层建模,需要模型;
- 成本含义:9 个百分点的提升,代价是标注语料 + 模型训练 + 推理基础设施。这个权衡必须显式做出。
6.11 端到端 vs 分步:误差传播
两步管线的方法存在误差传播:NER 错了,RE 必然错。定量看:
- 若 NER 实体级 F1 = 0.95,RE 在 gold 实体上 F1 = 0.95,则端到端 F1 上限约 0.90;
- 论文报告的 0.9006 与之吻合,说明NER 质量是端到端性能的主要瓶颈。
改进方向因此明确:优先提升 NER(更好的预训练模型、领域适配、词典特征),而非优化 RE 分类器。
6.12 跨语料横向定位
把 496 放到本系列的标注类语料坐标系中:
| 语料 | 任务 | 规模 | 一致性 | 文本提供 | 关系标注 |
|---|---|---|---|---|---|
| 496 NIHSS | NER + RE | 312 患者 | Kappa 0.901 | ✅ | ✅ |
| 494 Phenotype | 多标签分类 | 2,102 篇 | Kappa 全表 | ❌ | ❌ |
| 495 PIC | 数据库本体 | 13,449 住院 | —(非标注) | ✅(含文本表) | ❌ |
| 492 MIMIC-IV | 数据库本体 | 数十万住院 | — | ✅ | ❌ |
496 是这张表里唯一同时具备"形态标注 + 关系标注"的语料,这在任务维度上是独特的。
6.13 静态 vs 活跃:本条目为何不会过时
有人会问:2012 年数据、2021 年发布、至今未更新——这份语料是不是"过时了"?
两层回答:
- 作为数据库:它确实冻结了,不会再有新数据;
- 作为标注范式与评测基准:它的价值不随时间衰减。标注协议设计、关系定义、任务定义、评测划分这些方法论资产,是任何时代的抽取项目都可借鉴的。而且,恰恰因为冻结,它的数字永远可复现——这在评测基准里是优点而非缺点。
真正会过时的,是基于它训练的抽取模型(需在新数据上重新验证),而非语料本身。
6.14 家族治理:MIMIC 标注层的生态位
MIMIC 生态里的"标注层"家族:
| 语料 | 标注对象 | 粒度 |
|---|---|---|
| 496 NIHSS | 卒中量表 | 词元 + 关系 |
| 494 Phenotype | 患者表型 | 文档级 |
| 493 nosocomial-risk | 感染风险 | 患者级(自动) |
| 其他 MIMIC 标注语料 | 各类概念 | 各异 |
这一家族的存在说明:原始 EHR 的价值高度依赖其上叠加的标注/派生层。数据库本体(492)是地基,标注层(493/494/496)是让地基长出建筑的东西。
6.15 口径诊断树
当你发现自己的统计与官方数字不符时,按此树排查:
数字不符?
├─ 差 20% 以上?
│ ├─ 是否统计了全部 312 份?→ 检查划分文件是否完整
│ └─ 是否把总分算进了分项?→ 排除 NIHSS 实体的 548 次
├─ 差 5-20%?
│ ├─ 5/6 合写是否被计入 5a/5b?→ 统一映射口径
│ └─ 多值关系是否展开了?→ 2,733 是关系数而非唯一配对数
└─ 差 5% 以内?
└─ 是否因关系方向、边界或跨句处理差异?→ 属正常口径波动
6.16 八个必须知道的坑点
坑点 1:条目与分数的编号混淆。 3: 2 里的 3 是条目编号还是分数?在 “1a: 1, 1b: 1” 这类紧凑写法中,编号与分数交替出现,分词稍有不慎就错位。建议在预处理阶段保留原始的冒号/空格分隔信息。
坑点 2:总分被误抽为分项。 NIHSS 实体 548 次提及,若被模型抽为某个分项分数,会污染队列统计。务必在实体类型层面区分"量表本体"与"分项条目"。
坑点 3:把"未评估"当作 0 分。 “因失语无法完成 9 Best Language” 不是 0 分。语料中 196 个未配分的条目(2,929 − 2,733)正是这类情况的体现。下游做总分统计时,若把缺失当 0,会系统性低估严重度。
坑点 4:跨句关系被漏掉。 条目与分数分处两行时,只在句内做关系抽取会大量漏检。务必实现跨句候选生成。
坑点 5:measurements 与 relations 口径混用。 2,774 与 2,733 差 41。报数时说清你用的是哪一个,否则与文献对不上。
坑点 6:把 Kappa 0.901 当作模型性能预期。 Kappa 衡量标注员间一致性,F1 衡量模型与金标准的一致性——两者不可换算。
坑点 7:忽略文类边界。 在出院小结上训练,用到急诊记录上——分布外衰变可能让性能腰斩,且无法从本语料预估。
坑点 8:忽略上游版本。 MIMIC-III 有多个发布版本,HADM_ID 的映射可能随版本微变。复现时须固定上游版本号。
6.17 自查清单(拿到数据后逐项确认)
- [ ] 已获 MIMIC-III 资格与本语料授权;
- [ ] 语料版本固定为 v1.0.0;
- [ ] 上游数据库版本已记录;
- [ ]
.ann解析脚本已就绪并通过抽样人工核对; - [ ] 实体类型体系已确认(含量表本体 vs 分项);
- [ ] 关系方向为"条目 → 分数";
- [ ] 训练/测试划分使用官方文件,未自行重划;
- [ ] 评测报 F1(含 P/R),而非 accuracy;
- [ ] 缺失条目(未配分)的处理规则已明确;
- [ ] 报告结果时说明了是否含总分实体;
- [ ] 未将语料对外分发;
- [ ] 已引用语料 + MIMIC-III + 方法论文三层来源。
§7 AI 实践指南:把这份语料用起来
7.1 五种喂法
根据你的目标,本语料有五种典型用法:
| 用法 | 具体做法 | 适用场景 |
|---|---|---|
| 训练集 | 直接用于训练 NER/RE 模型 | 自建抽取系统 |
| 评测金标准 | 用 92 份测试集度量现成模型 | 模型选型 |
| few-shot 示例源 | 抽 5-20 条标注作为 LLM 提示示例 | LLM 抽取 |
| 标注规范参考 | 借鉴其实体/关系定义自建语料 | 中文或新机构语料建设 |
| 教学案例 | 作为完整的信息抽取端到端案例 | 教学与培训 |
7.2 一个 30 分钟的最小实验
如果你想快速体验这份语料的价值,可以按此路径:
- (10 分钟) 用 §5.1 的脚本把
.ann解析成长表; - (5 分钟) 统计条目分布,与官方计数表比对(应大致吻合);
- (10 分钟) 用简单规则(正则匹配
编号[: ]+数字)做一版抽取,在测试集上算 F1——你大概率能拿到 0.7-0.8 区间的结果,直观感受"规则法天花板"; - (5 分钟) 用 LLM(给定 5 条示例)抽取同一批,对比 F1。
这个实验能在半小时内让你对"规则/LLM/监督模型"三种路线在量表抽取上的相对位置形成直观判断。
7.3 泄漏防控
小语料上的泄漏风险尤其高:
- 患者级泄漏:312 例患者若有人多次入院,同一患者的不同小结可能分入训练与测试。官方未明确说明是否为患者级隔离(存照 F),使用前应自行检查并考虑重新划分;
- 模板泄漏:若同一模板被多次使用,训练与测试含有近重复文本,会造成虚高性能;
- 近重复检测:建议在划分前做文本相似度检测,报告近重复比例。
7.4 公平性与偏差
尽管语料无人口学属性字段,偏差仍可能存在于文本内容中:
- 单中心偏差:全部来自 Beth Israel Deaconess Medical Center,反映了该机构的书写习惯与患者构成;
- 语言偏差:仅英文,非英语病历的抽取需重新建语料;
- 时代偏差:2001-2012 年的书写风格。
若把在此训练的模型用于其他机构或语言,必须在目标域上重新验证,不能假设性能可迁移。
7.5 LLM 抽取方案设计
用 LLM 做 NIHSS 抽取的推荐流程:
Step 1:定义输出 schema
{
"hadm_id": "123456",
"items": [
{"code": "1a", "name": "level of consciousness", "score": 1},
{"code": "5a", "name": "left arm", "score": 3}
]
}
Step 2:构造 few-shot 示例(从语料中抽 3-5 条,覆盖紧凑写法与分侧写法)
Step 3:约束输出:用 JSON schema / structured output 强制格式
Step 4:后校验:检查分数是否在条目的合法取值范围内(如 1a 只能 0-3),越界则标记为不可信
Step 5:评测:在 92 份测试集上算三元组 F1,与论文的 0.9006 对比
这一步的价值在于:你能得到一个量化的、可比较的判断——LLM 在这类结构化抽取任务上究竟是超越监督模型,还是不如。
7.6 弱监督与级联
在小语料场景,级联是高效策略:
规则(高精度、低召回)→ 自动生成候选 → 高置信度样本直接入库
→ 低置信度样本交人工复核
模型(高召回)→ 补充规则漏掉的 → 但需人工抽检
这个级联的实用价值:规则法的 0.81 F1 意味着约八成样本可自动处理,人工只需处理剩余两成。相比全人工,成本可降一个数量级。
7.7 成本核算
| 方案 | 一次性成本 | 边际成本 | 适合规模 |
|---|---|---|---|
| 纯人工标注 | 高(按标注时薪) | 线性 | 小规模、高精度场景 |
| 规则法 | 低 | 极低 | 大规模、粗粒度 |
| 监督模型 | 中(需训练语料) | 低 | 规模化、需精度 |
| LLM 抽取 | 低(无需标注) | 按 token 计费 | 中小规模、快速验证 |
关键洞察:在已有 496 语料的条件下,监督模型方案的一次性标注成本已被外部承担——你的边际成本仅是训练与推理。这是使用公开语料的核心经济价值。
7.8 复现包清单
若你要发布基于本语料的研究,建议附带:
- [ ] 语料版本与 DOI;
- [ ]
.ann解析脚本; - [ ] 数据划分说明;
- [ ] 模型架构与超参;
- [ ] 随机种子;
- [ ] 评测脚本(含 F1 计算);
- [ ] 错误分析样例(各条目类别);
- [ ] 环境依赖文件。
7.9 特征工程建议(针对 RE)
用树模型做 RE 时,这些特征最有效:
| 特征 | 说明 |
|---|---|
| 实体类型组合 | (条目类型, 分数类型) |
| 字符距离 | 两实体间字符数 |
| token 距离 | 两实体间 token 数 |
| 是否同句 | 二分特征 |
| 中间文本模式 | 是否含 :、=、空格 |
| 条目编号先验 | 该条目在训练集中最常配的值域 |
| 上下文关键词 | 附近是否有 “score”、“points” |
| 排除特征 | 该分数是否已被更近的条目占用 |
最后一条"排除特征"是关键:关系抽取本质是一个分配问题,让模型知道"这个数字已被占用"能显著降错。
7.10 负结果的价值
如果你的实验发现"LLM 在 NIHSS 抽取上不如监督模型",这是一个有价值的负结果——它说明结构化抽取仍需要领域监督。若发现相反,则说明 LLM 已可替代监督模型。无论哪个方向,用 92 份测试集得到的量化结论都比主观判断更有说服力。建议把这类对照实验作为常规工作流的一部分。
7.11 多任务学习
本语料可与其他 MIMIC 标注语料组合做多任务学习:
- 任务 A:NIHSS 条目抽取(496);
- 任务 B:表型分类(494);
- 共享编码器:BERT 编码病历文本。
共享编码器的好处:两份语料覆盖同一批患者的文本,共享表征可能提升小样本任务的性能。但要注意样本空间不重叠(312 例 vs 2,102 篇),需要设计合适的批次混合策略。
7.12 教学用法
这是一个理想的 NLP 教学案例,因为它:
- 任务定义清晰(NER + RE,无歧义);
- 规模适中(一节课可跑通全流程);
- 有官方基线可对标(F1 0.9006);
- 有真实临床价值(不是玩具任务)。
建议的教学路径:解析 .ann → 规则基线 → 序列标注模型 → 关系抽取 → 误差分析。
7.13 监控与回归
若把抽取器部署到生产环境(如卒中登记自动化),需建立监控:
| 监控项 | 阈值建议 |
|---|---|
| 抽取成功率 | 低于 90% 告警 |
| 分数越界率 | 高于 2% 告警 |
| 条目覆盖分布 | 与训练分布偏离 >20% 告警 |
| 总分-分项一致性 | 明显不符时抽检 |
最后一项特别有用:若抽出的分项之和与抽取的总分严重不符,说明抽取可能出错,可作为无监督的质量信号。
7.14 与"临床可用性"的距离
必须明确:能抽取 ≠ 能临床使用。从抽取到临床部署,还需:
- 验证研究:在目标机构的前瞻数据上验证性能;
- 误差容忍分析:明确哪些条目错得起(如 11 Extinction),哪些错不起(如总分);
- 人机协同设计:把抽取结果作为"建议值"而非"结论值"呈现给医生;
- 监管合规:若作为医疗器械软件,需走相应审批路径。
本语料能帮你走到"验证研究"这一步的起点,但后面的路要自己走。
7.15 三条可立即执行的行动建议
- 若你已有 MIMIC-III 访问资格:本周内解析
.ann、跑通规则基线、得到第一版 F1,建立基线感知; - 若你无访问资格但想评估可行性:用论文的端到端示例(§5.4)构造一个小规模 LLM 抽取实验,判断任务难度;
- 若你打算自建中文 NIHSS 语料:直接复用其协议框架(§5.8),先做 100 份双人预标注测 Kappa。
§8 伦理、合规与引用
8.1 三重伦理主体
使用本语料涉及三重伦理责任:
| 主体 | 责任 |
|---|---|
| 患者 | 语料源自真实患者病历,虽已去标识化,仍须防止再识别与不当使用 |
| 标注员 | 标注是劳动,使用时应尊重其贡献(引用) |
| 上游机构 | MIMIC-III 与 BIDMC 的数据贡献须被明确致谢 |
8.2 去标识化与其残余风险
MIMIC-III 已完成 HIPAA 标准去标识化(移除姓名、日期偏移、地点泛化等)。但文本的残余可识别风险高于结构化表:
- 罕见病 + 特定时间序列可能指向唯一患者;
- 职业或社会史细节(如"退休的消防员")可能缩小范围;
- 多次入院的文本关联可能通过文本指纹实现跨记录匹配。
因此 DUA 明确禁止任何再识别尝试。这不是形式条款——违规可能导致访问资格永久撤销并对机构产生连带影响。
8.3 LLM 使用的合规红线
用 LLM 处理本语料时,须注意:
- 不要把语料原文输入第三方 API,除非该服务符合你的 DUA 与机构合规要求(多数公开商用 API 不符合);
- 优先本地部署模型:PhysioNet 2025 年发布的 LLM 使用政策方向也强调零留存与本地处理;
- 不要把语料用于训练公开模型:这可能构成再分发;
- 不要把语料内容粘贴进任何公开可访问的界面。
8.4 学位论文与发表的声明义务
在论文/学位论文中使用本语料,须声明:
- 数据来源与版本(DOI 10.13026/gyjg-0t90);
- 上游数据库(MIMIC-III)及其 DUA;
- 是否使用了官方划分;
- 是否已完成 CITI 培训;
- 不得在附录中复现原文文本(避免变相再分发)。
8.5 引用义务清单
| 对象 | 是否必引 | 说明 |
|---|---|---|
| 496 语料 | ✅ 必引 | 核心数据来源 |
| MIMIC-III | ✅ 必引 | 上游数据来源 |
| SHI 2022 方法论文 | 建议 | 若使用其基线或方法 |
| BRAT 工具 | 建议 | 若讨论标注工具 |
8.6 与中国数据合规的衔接
对中国研究者,使用本语料还涉及:
- 数据出境:语料存储与计算若涉及跨境,须评估是否符合《数据出境安全评估办法》等法规(本语料为美国机构托管的去标识化数据,通常风险较低,但仍须经机构合规审查);
- 机构审批:多数中国机构要求数据使用走内部伦理与合规流程,即使数据来自海外公开平台;
- 成果发表:涉及人类遗传资源或健康数据的成果,可能需相应的备案或审批。
这三条不是"走过场",而是审查会在答辩或投稿阶段实际检查的项。
§9 FAQ:五十问
9.1 关于身份与获取
Q1:这个数据集的官方名称是什么?
National Institutes of Health Stroke Scale (NIHSS) Annotations for the MIMIC-III Database。
Q2:官方 slug 是什么?
stroke-scale-mimic-iii。注意不是 nihss。
Q3:有中文官方名吗?
没有正式中文名,通常译作"NIHSS 卒中量表标注数据集(基于 MIMIC-III)"。
Q4:数据在哪个平台?
PhysioNet,属于 Credentialed Health Data 类别。
Q5:DOI 是多少?
10.13026/gyjg-0t90。
Q6:有几个版本?
只有一个:v1.0.0,2021-01-25 发布。
Q7:为什么只有一版?
标注类语料通常一次发布后不再迭代;且上游 MIMIC-III 已冻结。
Q8:免费吗?
数据免费,但需通过 Credentialed 审批(CITI 培训 + DUA)。培训与审批本身有时间和流程成本。
Q9:审批要多久?
通常 1-2 周,视机构 DUA 签署速度而定。
Q10:我已经有 MIMIC-III 资格,还要重新申请吗?
需要单独申请本语料授权,但流程会显著简化。
9.2 关于规模与内容
Q11:为什么只有 312 例?
信息抽取的标注成本极高。312 例在领域 NER/RE 语料中属正常量级。
Q12:312 例是患者数还是笔记数?
患者数;划分 220 + 92 = 312,可推定一患者一笔记。
Q13:2,929 个 items 是什么?
语料中标注出的 NIHSS 条目实体总数(含量表本体提及 548 次)。
Q14:2,774 measurements 与 2,733 relations 有什么区别?
前者是测量值总数,后者是成功建立 has_value 关系的配对数,差 41。
Q15:语料包含哪些文类?
仅 MIMIC-III 出院小结(discharge summaries)。
Q16:包含中文病历吗?
不包含。语料为英文。
Q17:包含影像或波形数据吗?
不包含,纯文本标注。
Q18:为什么语料不直接提供结构化表?
标注层的定位是"覆盖层",提供的是标注而非最终产物;且提供 .ann 保留了标注的全部信息。
Q19:上游数据覆盖什么时间?
MIMIC-III v1.4,患者数据止于 2012 年。
Q20:有患者人口学信息吗?
需要通过 HADM_ID join 回 MIMIC-III 获取,语料本身不含。
9.3 关于标注协议
Q21:用什么工具标注的?
BRAT(Brat Rapid Annotation Tool)。
Q22:几个标注员?
2 名,均具医学信息学背景。
Q23:Kappa 是多少?
Cohen’s Kappa = 0.901,属 almost perfect。
Q24:Kappa 在多少样本上测得?
100 份出院小结的预标注阶段。
Q25:是全量一致性吗?
不是。官方只公布了预标注阶段的 Kappa。
Q26:分歧怎么解决的?
讨论消解,必要时咨询第三方。标注指南在迭代中稳定。
Q27:定义了几种关系?
一种:has_value。
Q28:实体有哪几类?
至少两大类:NIHSS 条目(含量表本体)与分数值。
Q29:为什么用 BRAT 而不是更现代的工具?
2021 年发布时 BRAT 仍是关系标注的主流轻量选择;且格式简单、可解析。
Q30:标注指南公开吗?
官方页面未附完整指南,细节需参考关联论文。
9.4 关于划分与评测
Q31:官方划分是什么?
Train 220 / Test 92,另有端到端测试集 RE_End2End_Test.txt。
Q32:划分是患者级吗?
官方未明确说明。使用前建议自行检查(存照 F)。
Q33:报什么指标?
关系/三元组级 F1,或实体级 F1。
Q34:能报 accuracy 吗?
不建议。序列标注中 O 标签占绝对多数,accuracy 会虚高。
Q35:官方基线性能?
BERT-BiLSTM-CRF + Random Forest,F1 0.9006;规则法 0.8098。
Q36:这个 F1 是什么层级的?
论文报告值,具体是实体级还是三元组级需核对原文(存照 H)。
Q37:我能自己重新划分吗?
可以,但必须声明并说明理由(如做患者级隔离)。
Q38:能跨论文比较 F1 吗?
仅在划分一致时可比较。划分不同则不可直接比。
Q39:Kappa 0.901 与 F1 0.9006 接近是巧合吗?
是巧合。两者量纲与含义完全不同。
Q40:缺失条目(未配分)在评测中如何处理?
需明确:算作漏检、还是排除。不同处理会导致不同 F1。
9.5 关于使用与工程
Q41:如何解析 .ann?
见 §5.1 的 Python 脚本,几十行即可。
Q42:能直接用于训练大模型吗?
不可用于训练公开模型(违反 DUA);可用于私有模型的训练与微调,但需合规审查。
Q43:能用 LLM 抽取吗?
可以,建议本地部署 + few-shot + 后校验,并用官方测试集评测。
Q44:数据能分享给同事吗?
不能。DUA 禁止再分发,每位使用者须独立获授权。
Q45:能用于商业产品吗?
须严格审查 DUA 条款,多数情况下受控数据不可直接支撑商业产品。
Q46:中文病历能用吗?
不能直接使用。可借鉴协议,但需自建中文语料。
Q47:能与其他 MIMIC 数据集联合分析吗?
可以,通过 HADM_ID join,前提是已获相应授权。
Q48:部署到生产环境要注意什么?
误差容忍分析、人机协同设计、监控回归(见 §7.13)。
Q49:有官方代码吗?
有:github.com/huangxiaoshuo/NIHSS_IE。完整可运行性未经本条目验证。
Q50:我该引用哪几篇?
至少引用 496 语料 + MIMIC-III;若用其基线,加引 SHI 2022 方法论文。
9.6 进阶问答
Q51:如果我要做中文 NIHSS 抽取,最大的难点是什么?
不是分词,而是中文病历的量表书写习惯——中文里更常见"NIHSS 评分 12 分"的整体写法,逐项分值的文本比例可能远低于英文。这意味着条目级抽取的可提炼信号更少。
Q52:语料里有没有多时间点评分?
很可能有(临床常记录入院/溶栓后/24 小时多个时点),但官方未按时间点分层统计。使用时需自行处理时序。
Q53:为什么总分提及(548)远多于任何单项?
因为"NIHSS 评分 X 分"是最常见的书写形态,而逐项记录只在详细病历中出现。这也说明总分抽取比条目抽取更有实用价值(覆盖更广)。
Q54:196 个未配分的条目意味着什么?
它们代表"条目被提及但未给出分数",通常是"无法评估"或"未记录"。下游建模时不可忽略。
Q55:如果模型只抽总分,性能会怎样?
大概率很高(模式规整)。这提示我们:报告整体 F1 时,应分别报告总分与分项的性能,否则会掩盖分项抽取的困难。
Q56:这份语料能用于卒中预后预测吗?
可以作为特征来源,但需要先把 NIHSS 抽出来。语料本身不提供预后标签,需结合 MIMIC-III 的结局数据。
Q57:与 i2b2/n2c2 的临床 NLP 语料相比如何?
规模相近,但任务更专(单一量表 vs 广义临床概念);一致性水平更高。
Q58:为什么说"能抽取 ≠ 能临床用"?
因为临床使用要求误差可控、责任明确、合规齐备。抽取只是技术环节。
Q59:可以用这份语料做模型蒸馏吗?
可以(在授权范围内),用大模型标注更多数据来训练小模型,但其标注质量需用本语料的金标准验证。
Q60:如果我发现语料的统计口径与我的不符,该怎么办?
按 §6.15 的诊断树排查,并在你的论文中明确说明你采用的口径。
Q61:这份语料对卒中医药研发有价值吗?
有——可用于构建严重度分层的真实世界队列,支撑药物有效性/安全性回顾研究。
Q62:为什么没有 SAH/ICH 单独的评估?
语料按 ICD 编码覆盖四大亚型,但未按亚型分层统计抽取难度。这是可拓展的分析方向。
Q63:能用于评测多模态模型吗?
不能直接用于,因为语料仅文本;但可与影像数据结合构建多模态任务。
Q64:为什么强调"患者级泄漏"?
因为若同一患者多次入院的文本分处训练/测试,模型可能记住患者而非学会抽取,导致虚高性能。
Q65:端到端测试集为什么单列?
因为端到端的难点在"Ner 与 RE 联合",与分步评测的诊断目标不同。
9.7 关于本条目
Q66:本条目的数据来自哪里?
PhysioNet 官方页面(v1.0.0)与关联论文(SHI Vol.290),均为公开信息。
Q67:为什么条目名写英文?
为与官方标识一致,便于检索与引用。
Q68:条目中提到的数字都能核实吗?
公开可核实的均已标注来源;存疑处已列入 §10 存照。
Q69:发现错误怎么办?
以官方页面为准;本条目会随官方更新而修正。
Q70:为什么列这么多"坑点"?
因为一份语料的价值不仅在于"能用",也在于"知道哪里会踩坑"。坑点是最省时间的信息。
9.8 番外:三个反问
反问一:如果 LLM 已经能读病历,我们还需要标注语料吗?
需要——因为"能读"和"能验证读得对"是两件事。没有金标准,你无法知道模型的输出是否可信。
反问二:312 例的语料会不会限制模型上限?
会限制监督学习的上限,但不会限制评测的价值。小语料做评测基准,是它最稳的用途。
反问三:这份语料最重要的是数据还是协议?
协议。数据会过时,协议会长青。Kappa 0.901 的背后是"如何设计一个能达成高一致性的标注流程"——这个知识在中文、在影像、在任何领域都用得上。
§10 存照、引文与系列关系
10.1 存照(口径局限与勘误)
存照 A(slug 勘误):生产队列 JSON 中 496 的 slug 记为 NIHSS,官方 slug 为 stroke-scale-mimic-iii。本条目以官方为准。
存照 B(名称截断):队列 JSON 中 name_cn 截断为 “National Institutes of Health Stro”,官方全称为 National Institutes of Health Stroke Scale (NIHSS) Annotations for the MIMIC-III Database。
存照 C(条目计数口径):官方 item 计数表中 NIHSS 单列 548 次,推测为量表名称/总分实体本身;条目 5 与 6 同时存在合写计数(24/26)与分侧计数(5a/5b、6a/6b),说明统计口径混合了两种书写形态。
存照 D(版本冻结):v1.0.0 为唯一版本,未见更新;上游 MIMIC-III v1.4 数据止于 2012 年。
存照 E(抽样规则未公开):官方称从 3,660 例卒中病例中纳入 312 例,但 3,660 → 312 的抽样规则未详述。
存照 F(划分协议未详述):官方未公布划分随机种子与患者级隔离策略,使用前建议自行核查。
存照 G(Kappa 适用范围):Kappa 0.901 在 100 份预标注子集上测得,不代表全量一致性。
存照 H(论文口径):关联论文为 2 页短文(SHI Vol.290, pp.1004-1005),方法细节有限;F1 0.9006 为论文报告值,未在 PhysioNet 页面复述,其具体评测层级(实体级/三元组级)需核对原文。
存照 I(句子与 token 统计存疑):官方给出 7,848 句与 153 token/病例,后者与常规出院小结长度明显不符,推测统计范围限于 NIHSS 相关片段或采用了特殊切分口径。引用该数字时须注明其口径未明。
存照 J(measurements 与 relations 差值):2,774 与 2,733 相差 41,官方未解释差异来源。
存照 K(代码仓库状态):github.com/huangxiaoshuo/NIHSS_IE 的完整可运行性未经本条目验证。
存照 L(唯一性):截至核查日(2026-09-20),PhysioNet 上未见同名或近似名的竞争语料。
10.2 引文
- Wang J, Huang X, Yang L, Li J. National Institutes of Health Stroke Scale (NIHSS) Annotations for the MIMIC-III Database (version 1.0.0). PhysioNet. 2021. DOI: 10.13026/gyjg-0t90.
- Wang J, Yang L, Huang X, Li J. Studies in Health Technology and Informatics. 2022;290:1004-1005. DOI: 10.3233/shti220239. PMID: 35673177.
- Johnson AEW, Pollard TJ, Shen L, et al. MIMIC-III, a freely accessible critical care database. Scientific Data. 2016;3:160035. DOI: 10.1038/sdata.2016.35.
- Brott T, Adams HP, Olinger CP, et al. Measurements of acute cerebral infarction: a clinical examination scale. Stroke. 1989;20(7):864-870.(NIHSS 原始文献)
- Landis JR, Koch GG. The measurement of observer agreement for categorical data. Biometrics. 1977;33(1):159-174.(Kappa 强度判定标准)
- Stenetorp P, Pyysalo S, Topić G, et al. BRAT: a web-based tool for NLP-assisted text annotation. EACL 2012 Demo.(BRAT 工具文献)
- Loper E, Bird S. NLTK: The Natural Language Toolkit. 2002.(常见预处理工具)
10.3 与既有条目的系列关系
| 关系 | 说明 |
|---|---|
| 上游谱系 | 492(MIMIC-IV)与 MIMIC-III 同源,496 的上游是 MIMIC-III v1.4 |
| 标签生产对照 | 493(自动规则标签)↔ 496(人工标注标签):同一"派生层"的两种生产方式 |
| 任务范式对照 | 494(文档级分类)↔ 496(词元级抽取 + 关系):临床文本金标准的两大范式 |
| 中国团队双路径 | 495(自建库出海)↔ 496(在开放库上做贡献) |
| 共同约束 | 492/493/494/496 均受 PhysioNet Credentialed 或相应 DUA 约束 |
10.4 变更日志
| 日期 | 变更 |
|---|---|
| 2026-09-20 | 初版发布:完成身份核查(PhysioNet v1.0.0)、关联论文核查(SHI Vol.290)、三段撰写、双检、发布、封面、DB 验证 |
声明:本条目为千方病案医数集 AI-Ready 数据集百科的组成部分,仅整理公开元数据与公开文献信息,不提供任何受控数据的下载或转发。所有数字均标注来源,存疑处列入 §10 存照。数据的实际使用须遵守 PhysioNet Credentialed Health Data License 1.5.0 与上游 MIMIC-III 的数据使用协议。
使用须知:本文内容用于研究与信息参考,不构成临床决策依据。任何临床决策应由有资质的医疗专业人员基于具体患者情况作出。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mimiciii — 共享标签:医疗NLP / 电子健康记录
- nosocomial-risk-mimic — 共享标签:医疗NLP / 电子健康记录
- phenotype-annotations-mimic — 共享标签:医疗NLP / 电子健康记录
- paediatric-intensive-care — 共享标签:医疗NLP / 电子健康记录
- synthetic-mimic-iii-health-gym — 共享标签:医疗NLP / 电子健康记录
- trec-pm — 共享标签:医疗NLP / 电子健康记录
- emrqa — 共享标签:医疗NLP / 电子健康记录
- aact — 共享标签:医疗NLP / 电子健康记录
- loinc — 共享标签:医疗NLP / 电子健康记录
- chinese-critical-care-database — 共享标签:医疗NLP / 电子健康记录
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

