信息速览

BLUE 基准 — 生物医学 NLP 十语料评测基准 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | BLUE 基准(BLUE Benchmark) |
| 英文全称 | Biomedical Language Understanding Evaluation |
| 别名/简称 | BLUE;BLUE benchmark |
| 疾病分类(ICD-11) | 2A00-2F9Z 恶性肿瘤(HoC 子任务);其余主题按 MeSH/UMLS 规范化 |
| SNOMED CT | 涉及临床发现(404684003)、疾病(64572001)、物质(105590001)等根概念层级 |
| 数据模态 | 生物医学与临床文本(PubMed 文献 + 电子病历笔记) |
| AI 任务类型 | 句子相似度、命名实体识别、关系抽取、文档多标签分类、自然语言推理 |
| 样本总数 | 10 语料合计约 80,842 个实例(句对/实体提及/关系/文档混合单位) |
| 数据大小 | 纯文本数据(10 语料合计,体积为 MB 级) |
| 数据格式 | TSV(BERT 格式)、BioC、IOB/CoNLL |
| 许可证 | 美国公有领域(Public Domain Notice,仓库本体) |
| 访问级别 | 开放(MedSTS、ShARe/CLEF、MedNLI、i2b2-2010 需向原始机构申请) |
| DUO 标签 | NRES(无限制) |
| 语言 | 英语 |
| 首发日期 | 2019-06(arXiv:1906.05474;数据 release 0.1 同月上线) |
| 最后更新 | 2022-01-12(README 最后修订) |
| 发布机构 | 美国国家生物技术信息中心(NCBI / NLM / NIH) |
| 官方主页 | https://github.com/ncbi-nlp/BLUE_Benchmark |
| 下载地址 | https://github.com/ncbi-nlp/BLUE_Benchmark/releases/tag/0.1 |
| DOI | 10.18653/v1/W19-5006 |
| 引用次数 | 1,010+(Semantic Scholar,截至 2026-09) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 官方统一划分、提供 BERT 格式数据与评测脚本;扣分项:4 个临床语料需外部申请,DDI 指标曾有 micro/macro-F1 变更 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责
- 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、疾病主题)、§7 质量评估与偏倚分析。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。BLUE 仓库本体为美国公有领域(要求引用其论文),但 MedSTS、ShARe/CLEF eHealth、MedNLI、i2b2-2010 等临床语料须分别通过 Mayo Clinic、PhysioNet 与 i2b2 官方渠道申请,禁止再分发。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
这是什么? BLUE 基准是美国国家卫生研究院(NIH)下属国家生物技术信息中心(NCBI)在 2019 年发布的生物医学自然语言处理评测基准。它受通用领域 GLUE 基准启发,把 BioNLP 社区历史上最重要的 10 个共享任务语料整合到同一套协议下,用统一的划分、分词与指标,评测预训练语言模型在生物医学文献与临床病历文本两类文体上的理解能力。
为什么重要? 在 BLUE 出现之前,生物医学 NLP 论文各自挑选数据集报告结果,数字之间无法比较。BLUE 是该领域第一个系统化基准,直接催生了 BlueBERT 这样的领域预训练模型,其"PubMed+临床笔记混合预训练"策略显著优于通用 BERT,为 BioBERT、PubMedBERT、BLURB 等后续工作铺平了道路。今天所有医疗大语言模型论文的评测体系,都能追溯到 BLUE 建立的框架。
我能用它做什么? 你可以用它评测自研医疗文本模型在药物实体识别、药物-药物相互作用抽取、化学物-疾病关系、癌症文献分类、临床语句推理等任务上的真实水平;可以直接下载其中 6 个公开语料(含 BERT 格式)跑通复现实验;也可以把 BLUE 协议作为内部模型选型与回归测试的标准管线。
§1.1 摘要
BLUE(Biomedical Language Understanding Evaluation)由 Peng、Yan、Lu 三位研究者完成,作者隶属 NIH 国家医学图书馆(NLM)国家生物技术信息中心(NCBI)计算生物学分支。基准选取 10 个已被 BioNLP 社区广泛使用、经共享任务检验的语料,覆盖 5 类任务:句子相似度(MedSTS、BIOSSES)、命名实体识别(BC5CDR-disease、BC5CDR-chemical、ShARe/CLEF eHealth)、关系抽取(DDI、ChemProt、i2b2-2010)、文档多标签分类(HoC)与自然语言推理(MedNLI)Peng et al., 2019, BioNLP@ACL. DOI 10.18653/v1/W19-5006。10 语料实例合计约 80,842 个(句对/实体提及/关系/文档混合单位),文本来自 PubMed 生物医学文献与 MIMIC-II/III 临床笔记两大文体。作者用统一协议评测了 ELMo、BERT、BioBERT 与其在 PubMed 及 PubMed+MIMIC-III 上继续预训练的 NCBI_BERT(即后来的 BlueBERT),发现领域预训练模型总体占优,临床任务上混合语料预训练的优势尤为显著。数据、BERT 格式版本与评测代码全部开源,仓库本体为美国公有领域。
§1.2 战略价值
维度一:评测方法论的开创性。 BLUE 首次把"通用领域基准 + 公开排行榜"的评测范式引入生物医学 NLP:统一 10 语料的训练/开发/测试划分,统一分词(原语料缺分词时用 spaCy 补齐),统一指标口径(strict span F1、Pearson、micro/macro-F1、accuracy),并公开全部重建代码——论文明确承诺"从零重建数据集且不删任何实例"。这使得不同实验室的数字第一次可以公平比较。这一范式被微软 2020 年的 BLURB 直接继承并扩展,后者已成为今日医疗 LLM 评测的行业标准之一。
维度二:领域预训练的证据链。 BLUE 的基线实验给出了"领域预训练是否值得"这一问题的早期系统性答案:PubMed+MIMIC-III 继续预训练的 BERT 在 10 任务中总体最佳,临床任务上的领先幅度尤其大(例如 MedNLI 准确率 84.0 对 ELMo 的 71.4)。这一结论推动了 BlueBERT、BioBERT、PubMedBERT 等一代生物医学预训练模型的发展,也奠定了"预训练语料与下游文体匹配"这一至今仍然成立的设计原则。对医疗 AI 工程团队而言,BLUE 是检验自研模型是否真正理解医学语言的最小可信集合。
维度三:语料治理的示范价值。 BLUE 选择"复用经过共享任务检验的既有语料"而非自建新标注,把 10 个分散在 BioCreative、CLEF、i2b2、TAC、EMNLP 不同体系的资产收拢到同一协议下,并公开全部重建代码。这种"聚合而非重建"的路线成本效益极高——10 语料的标注成本没有重复发生,却产生了 1+1 远大于 10 的评测势能。对数据平台建设者的启示是:数据集生态的下一步价值往往不在造新数据,而在把已验证的资产标准化、可比较化。
§1.3 同类数据集横向对比
| 数据集 | 任务数/数据集数 | 文本域 | 指标体系 | 与 BLUE 的差异化定位 |
|---|---|---|---|---|
| BLUE(本条目) | 5 任务 / 10 语料 | 文献 + 临床双域 | strict F1、Pearson、macro/micro-F1、accuracy | 首个生物医学 NLP 综合基准,含临床 NLI |
| GLUE | 9 任务 / 9 数据集 | 通用英文 | F1、accuracy、Matthews | BLUE 直接参照的通用领域原型 |
| BLURB | 6 任务 / 13 数据集 | 仅 PubMed 文献域 | 任务组内平均 + macro 平均 | 微软承继之作,新增 QA 任务与在线排行榜,剥离临床域 |
| BioBERT 基准集 | 3 类任务 | 文献为主 | F1、accuracy | 复用共享任务语料但无统一总分协议 |
| n2c2/i2b2 历年共享任务 | 单任务单届 | 临床笔记 | 任务自定义 | BLUE 的 i2b2-2010 语料即取自该系列 |
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2019-06 | arXiv:1906.05474 提交 | 论文上线,10 语料 5 任务定型 |
| 2019-06-17 | GitHub release 0.1 | BERT 格式数据发布,配合 NCBI BlueBERT 代码 |
| 2019-06 | BioNLP 2019 接收 | 论文被 BioNLP 2019 workshop 接收 |
| 2019-07-11 | 预处理 PubMed 文本公开 | 用于 NCBI_BERT 预训练的语料开放下载 |
| 2019-08-13 | DDI 指标变更 | 由 micro-F1 改为 macro-F1(旧结果不可比) |
| 2019-09 | BioNLP@ACL 2019 正式发表 | 论文页码 58–65;blue_plus 代码最后更新 |
| 2020-04-14 | LICENSE.txt 添加 | 明确美国公有领域地位 |
| 2020-07 | BLURB 发布 | 微软在 BLUE 基础上推出 13 数据集/6 任务后继基准 |
| 2022-01-12 | README 最后修订 | 仓库进入维护期,评测生态交棒 BLURB |
§1.5 典型应用场景
- 预训练模型选型:在决定为医疗文本系统选 BioBERT、PubMedBERT 还是通用 BERT 时,用 BLUE 10 任务快速量化差距,重点看与业务文体匹配的任务(文献业务看 BC5CDR/HoC,病历业务看 ShARe/CLEF、MedNLI)。
- 药物安全信息抽取的可行性评估:DDI(药物相互作用)与 ChemProt(化学物-蛋白关系)两个语料直接对应药物警戒业务,可先用 BLUE 协议验证模型基线再决定投入。
- 医疗大模型回归测试:将 BLUE 子集纳入 LLM 每次迭代的回归集合,防止领域理解能力随版本退化;BLURB 排行榜时代这仍是论文标准动作。
- 教学与复现训练:10 语料规模适中、官方提供 BERT 格式与评测脚本,是练习 NER/RE/STS/NLI 四类管线完整落地的最佳教材之一。
- 文献挖掘系统前置模块:BC5CDR 与 HoC 可直接作为医药文献知识库构建(实体识别 + 癌症机制分类)的标注资源复用。
- 指标口径审计的对照物:当团队内部对"该报 micro 还是 macro-F1"产生分歧时,BLUE 的指标变更历史(DDI 2019-08 事件)与 §8.4 评测协议是现成的教学案例与制度模板。
§2 医学背景
§2.1 ICD-11 编码映射表
BLUE 是文本基准,其"医学标签体系"来自各语料的标注类目而非疾病分类学。下表将 10 语料涉及的医学主题映射到 ICD-11 主题章节;对以 MeSH/UMLS/DrugBank 为受控词表的语料,标注概念本身不对应单一 ICD-11 编码,如实注明。
| 语料标签体系 | ICD-11 编码 + 中文名 | 映射说明 |
|---|---|---|
| HoC:十大癌症 hallmark 标签 | 2A00-2F9Z 恶性肿瘤 | HoC 全部 1,580 篇摘要均为癌症机制文献,归入 ICD-11 恶性肿瘤章节 |
| BC5CDR-disease:疾病提及 | 不适用(按 MeSH 词表规范化) | 疾病概念以 MeSH 树编码为受控词表,覆盖全身各系统 |
| BC5CDR-chemical:化学物质提及 | 不适用(按 MeSH 词表规范化) | 化学物概念以 MeSH 补充概念区(CNS)规范化 |
| DDI:4 类药物相互作用 | NF08 药物与生物制品不良效应(主题关联) | 相互作用抽取服务于药物警戒,与药物不良效应章节主题关联 |
| ChemProt:化学物-蛋白 9 类关系 | 不适用(关系类目而非疾病) | CPR:3/4/5/6/9 等为分子相互作用类型,无疾病分类含义 |
| ShARe/CLEF: disorder 提及 | 不适用(按 SNOMED CT 规范化) | 该任务要求 disorder 归一化到 SNOMED CT 编码 |
| i2b2-2010:问题-治疗 8 类关系 | 不适用(关系类目而非疾病) | 临床文本来自三家医院真实病历,主题跨全科室 |
| MedNLI:三分类蕴含标签 | 不适用(任务标签而非医学概念) | premise/hypothesis/neutral 描述临床陈述间逻辑关系 |
§2.1b SNOMED CT 映射表
| 标签/概念 | SNOMED CT 码 | 术语 | 说明 |
|---|---|---|---|
| 临床发现(i2b2 问题类实体) | 404684003 | Clinical finding (finding) | i2b2-2010 中 problem 实体的语义根 |
| 疾病/功能异常(ShARe disorder) | 64572001 | Disease (disorder) | ShARe/CLEF Task 1 要求归一化到该层级下的具体编码 |
| 物质/药物(BC5CDR-chemical、DDI) | 105590001 | Substance (substance) | 化学物质与药物的语义根层级 |
| 恶性肿瘤疾病(HoC 文献主题) | 363346000 | Malignant neoplastic disease (disorder) | HoC 十大 hallmark 描述的疾病机制所属层级 |
§2.2 数据集覆盖的医学主题与流行病学背景
BLUE 的医学内容横跨三大主题。其一是药物安全:DDI 语料标注药物-药物相互作用(SSRI 类与单胺氧化酶抑制剂联用引发 5-羟色胺综合征之类的经典场景),ChemProt 语料标注化学物与蛋白间结合、抑制、激活等分子关系——两者共同服务药物警戒与药理机制挖掘,是文献机器审阅(text mining for pharmacovigilance)的核心命题。其二是癌症机制:HoC(Hallmarks of Cancer)按十大标志性能力(逃逸凋亡、诱导血管生成、基因组不稳定等)对癌症文献摘要做多标签分类,直接对应肿瘤学文献综述与知识图谱构建。其三是临床叙事理解:ShARe/CLEF 与 i2b2-2010 的文本来自 ICU/住院病历,充斥缩写、拼写变体与非规范表达,MedSTS 与 MedNLI 则考察临床语句的语义等价与逻辑蕴含——这些是病历结构化、临床决策支持的底层能力。
流行病学上,10 语料无单一疾病谱系:BC5CDR 覆盖 CTD-Pfizer 语料抽样的 1,500 篇文献中出现的近 6,000 个疾病概念(化学物 4,409 个提及、疾病 5,818 个提及、化学物-疾病关系 3,116 条,据 Li et al. 2016);i2b2-2010 病历来自三家医院的真实住院人群;HoC 覆盖癌症研究文献全谱。因此 BLUE 的"流行病学"应理解为文献与病历文本的分布特征,而非特定疾病的患者分布。
从文本类型学看,三类主题呈现不同的语言挑战。药物安全主题(DDI、ChemProt)的难点在于关系的事实性——两个药物出现在同一句里并不代表存在相互作用,模型必须区分"共同提及"与"药理关联",这也是 DDI 语料专门设置 Int 类(虚假相互作用)的原因。癌症机制主题(HoC)的难点在于多标签语义的抽象性——十大 hallmark 是机制层面的归类(如"逃逸免疫清除"),同一摘要常同时命中 2–3 个机制,类目边界需要肿瘤学知识。临床叙事主题(ShARe/CLEF、i2b2-2010、MedNLI、MedSTS)的难点在于病历语言的非规范性——“r/o pneumonia”(待排除)、“pt c/o SOB”(患者主诉气促)之类缩写与口语化表达在标准 NLP 工具链中大量失配,这正是临床域任务上领域预训练收益最大的原因。
§2.3 临床任务定义
| 任务 | 临床/科研场景 | 输入 | 输出 | 在 BLUE 中的语料 |
|---|---|---|---|---|
| 筛查——药物相互作用检出 | 药物审方、药物警戒 | 含两个药物实体的句子 | 4 类相互作用(Advice/Effect/Mechanism/Int-DDI) | DDI |
| 诊断辅助——临床实体识别 | 病历结构化、编码辅助 | MIMIC 去标识笔记 | disorder 提及 span + SNOMED 归一化 | ShARe/CLEF eHealth |
| 机制综述——癌症文献分类 | 文献知识库、综述自动化 | PubMed 摘要 | 10 个 hallmark 多标签 | HoC |
| 分级——化学物-蛋白关系 | 靶点发现、毒理评估 | PubMed 摘要句子 | CPR:3/4/5/6/9 五类关系 | ChemProt |
| 预后/推理——临床语句蕴含 | 决策支持规则验证 | 临床陈述句对 | entailment/contradiction/neutral | MedNLI |
§2.4 文本来源人群与机构构成表
| 语料 | 文本来源 | 时间 | 机构 | 文体类型 |
|---|---|---|---|---|
| MedSTS | Mayo Clinic 临床数据仓库句子 | 未公开细节 | 梅奥诊所(美国) | 临床语句对 |
| BIOSSES | TAC 生物医学摘要跟踪训练集 | 2011 前后文献 | 学术界公开语料 | 文献句对 |
| BC5CDR | CTD-Pfizer 语料抽样 1,500 篇 | 2015 年定稿 | 生物医学文献 | PubMed 题录+摘要 |
| ShARe/CLEF | 299 篇 MIMIC-II 去标识笔记 | ICU 住院记录 | 美国贝斯以色列女执事医疗中心等 | 临床自由文本 |
| DDI | DrugBank 792 篇 + MedLine 233 篇 | 2013 年定稿 | 药物数据库与文献 | 结构化药品描述+摘要 |
| ChemProt | 1,820 篇 PubMed 摘要 | 2017 年定稿 | BioCreative VI 社区 | 文献摘要 |
| i2b2-2010 | 170 训练 + 256 测试文档 | 2010 年共享任务 | 美国三家合作医院 | 去标识出院小结等 |
| HoC | 1,580 篇癌症文献摘要 | 2016 年定稿 | PubMed 文献 | 文献摘要 |
| MedNLI | MIMIC-III 笔记中的句对 | ICU 住院记录 | 美国贝斯以色列女执事医疗中心 | 临床句对 |
注:BLUE 为文本基准,不含患者队列人口学字段(年龄/性别/种族分布不适用);临床语料的患者级信息以原始数据集(MIMIC-II/III、i2b2)的描述为准。
§2.5 临床价值
BLUE 各子任务对应的能力直接支撑四类临床场景。药物安全审阅:DDI 与 ChemProt 抽取器可预筛药物说明书更新、不良事件报告与文献警戒信号,把药师从海量文献人工审阅中解放出来。病历结构化与编码:ShARe/CLEF 的 disorder 识别 + SNOMED 归一化是病历到 ICD/SNOMED 编码自动化的第一步。证据快速合成:HoC 分类器可按癌症机制自动归档文献,加速系统综述与靶点调研。临床推理校验:MedNLI 评测的蕴含能力是"从病历文本推断临床断言"类决策支持规则的可信度基础。BLUE 把这些场景统一到可量化的协议下,使"该模型是否够格进入医疗文本流水线"有据可依。
值得强调的是 BLUE 价值的"间接性":它不提供可直接部署的模型,而提供"部署前必答的量化问题"——你的抽取器在 DDI 上 macro-F1 只有 70 时,意味着每 10 个它标记的相互作用中约 3 个是错的,这个数字直接决定人工复核环节的工作量与系统上线边界。把基准分数翻译成业务侧的操作成本,是 BLUE 对医疗 AI 工程最实用的贡献方式。
§2.6 金标准参考标注与一致性
| 语料 | 划分 | 标注方式 | 标注者 | 一致性/性质 |
|---|---|---|---|---|
| BC5CDR | 共享任务标准 train/test(BLUE 沿用) | 双人独立标注 + 共识仲裁 | 2 名受过医学训练与文献审阅训练的标注者(MeSH 索引员/CTD 策展人) | test 集 Jaccard 一致性:disease 87.49%,chemical 96.05% |
| ShARe/CLEF | 共享任务标准划分 | 双人标注 + 仲裁 | 2 名专业受训标注者 | 官方称较高 IAA;用于共享任务评奖 |
| DDI | BLUE 自定 624 训练/191 测试文件 | 双人标注 + 第三方仲裁 | 药物信息学专家 | 原共享任务报告良好 IAA |
| ChemProt | 共享任务标准划分 | 专家标注 | BioCreative VI 参与团队 | BLUE 仅评 5 类,类目过滤后口径一致 |
| i2b2-2010 | 共享任务标准划分 | 医师标注 | 执业医师 | 原任务报告良好 IAA;BLUE 取其子集 |
| HoC | BLUE 自定约 20% 测试 | 双人标注 + 共识 | 癌症信息学研究者 | 多标签 example-based F1 评测 |
| BIOSSES | 随机 80/20(无官方划分) | 5 人独立评分取均值 | 5 位领域专家 | 0–4 分制 |
| MedSTS | 共享任务标准划分 | 2 名医学专家评分 | 2 名医学专家 | 0–5 分制 |
| MedNLI | 沿用 Romanov & Shivade 划分 | 众包 + 专家校验 | 临床情境受训众包标注者 | EMNLP 2018 报告协议 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐获取版本 | 格式 | 理由 |
|---|---|---|---|
| 快速复现 BlueBERT 论文基线 | GitHub release 0.1(BERT 格式) | TSV | 与官方微调代码零适配成本,6 个公开语料开箱即用 |
| 自研管线 + 自定义预处理 | GitHub 仓库 blue/ 目录 + 各语料原始发布页 | BioC/原始 | 保留原文与完整标注,便于自定分词与多任务联合 |
| 只关心文献域评测且要排行榜 | 改用 BLURB(aka.ms/BLURB) | 统一打包 | 有在线排行榜与 13 数据集;BLUE 无在线排行榜 |
| 临床域(MIMIC 体系)评测 | BLUE 的 ShARe/CLEF + MedNLI + i2b2-2010 + MedSTS(需申请) | 多渠道 | BLUE 是少数把临床笔记纳入统一协议的基准 |
§3.1 模态详情
BLUE 是纯文本(NLP)基准,包含两种文体。生物医学文献文体(6 语料):PubMed 题录与摘要,术语规范、句式完整,平均句长 22.3–34.3 词(BC5CDR 22.3、BIOSSES 22.9、HoC 25.3、ChemProt 34.3、DDI 41.7)。临床笔记文体(4 语料):MIMIC-II/III 去标识住院记录与梅奥病历句子,缩写密集、句长波动大(ShARe/CLEF 平均 10.6 词、MedSTS 25.8 词、i2b2-2010 24.8 词、MedNLI 11.9 词)。两类文体的词汇与句法分布差异显著,这是 BLUE 设计上刻意保留的考察维度——也是后续 BLURB 论文批评其"混域"的原因:在临床笔记上预训练的模型在文献任务上表现会退化到接近通用 BERT。
| 文体特征 | 生物医学文献(6 语料) | 临床笔记(4 语料) |
|---|---|---|
| 词汇分布 | 标准术语为主(MeSH 级规范表达) | 缩写、口语化、非规范表达密集 |
| 句法 | 完整长句,逻辑连接词丰富 | 电报式短句(ShARe 平均 10.6 词)与长句并存 |
| 标注对象 | 化学物/疾病/蛋白/hallmark | disorder/问题-治疗关系/蕴含/相似度 |
| 受控词表 | MeSH、DrugBank、BioCreative 类目 | SNOMED CT、i2b2 类目、三分类标签 |
| 对分词器的挑战 | 复合化学名(如药物盐型) | 缩写歧义(“MS”= 多发性硬化/形态学/心音) |
| 领域预训练收益 | PubMed 语料收益中等 | MIMIC 语料收益最大(BLURB 论文实证) |
§3.2 按子集样本数明细表
| 语料 | Train | Dev | Test | 实例单位 | 任务 | 指标 | 域 | 平均句长(词) |
|---|---|---|---|---|---|---|---|---|
| MedSTS | 675 | 75 | 318 | 句对 | 句子相似度 | Pearson | 临床 | 25.8 |
| BIOSSES | 64 | 16 | 20 | 句对 | 句子相似度 | Pearson | 生物医学 | 22.9 |
| BC5CDR-disease | 4,182 | 4,244 | 4,424 | 实体提及 | NER | F1 | 生物医学 | 22.3 |
| BC5CDR-chemical | 5,203 | 5,347 | 5,385 | 实体提及 | NER | F1 | 生物医学 | 22.3 |
| ShARe/CLEF eHealth | 4,628 | 1,075 | 5,195 | 实体提及 | NER | F1 | 临床 | 10.6 |
| DDI | 2,937 | 1,004 | 979 | 关系 | 关系抽取 | macro-F1 | 生物医学 | 41.7 |
| ChemProt | 4,154 | 2,416 | 3,458 | 关系 | 关系抽取 | micro-F1 | 生物医学 | 34.3 |
| i2b2-2010 | 3,110 | 11 | 6,293 | 关系 | 关系抽取 | F1 | 临床 | 24.8 |
| HoC | 1,108 | 157 | 315 | 文档 | 文档多标签分类 | F1 | 生物医学 | 25.3 |
| MedNLI | 11,232 | 1,395 | 1,422 | 句对 | 自然语言推理 | accuracy | 临床 | 11.9 |
注:数字为论文 Table 1 与 GitHub README 一致口径;DDI 在论文 Table 1 中印为 micro-F1,GitHub 2019-08-13 起改用 macro-F1,本表按仓库现行口径标注。10 语料实例合计约 80,842。
§3.3 数据格式明细表
| 语料 | 原始格式 | BERT 格式(release 0.1) | 标注文件形态 |
|---|---|---|---|
| MedSTS / BIOSSES | 句对 + 分值(TSV/CSV) | TSV | sentence1、sentence2、score 三列 |
| BC5CDR(两份) | BioC XML | TSV(token \t label) | IOB 序列标注,空行分句 |
| ShARe/CLEF | 原始 .txt + .a1/.a2 标注(Brat 风格) | TSV(token \t label) | IOB 序列标注 |
| DDI | XML(实体 + 对 + 关系) | TSV | 句内实体对 + 类型标签 |
| ChemProt | BioC/XML | TSV | 实体对 + CPR 类标签 |
| i2b2-2010 | 原始 .txt + .ast/.rel 概念与关系文件 | TSV | 概念对 + 8 类关系标签 |
| HoC | 标题+摘要 + 多标签列表 | TSV | 文档 \t 多个 hallmark 标签 |
| MedNLI | JSONL(premise/hypothesis/label) | TSV | 三分类标签 |
§3.4 存储大小
BLUE 全部语料为纯文本,总量为 MB 级(10 语料合计约 8 万余实例),远小于影像与基因组数据集。官方未披露 release 0.1 压缩包的精确字节数;预训练所用 PubMed 文本(>4,000M 词)与 MIMIC-III 文本(>500M 词)体量大,仅用于预训练阶段,不属于 BLUE 语料本体。下载与训练所需的磁盘预算以"语料本体 < 1 GB + 模型检查点若干 GB"估算即可。
§3.5 标注方式
| 标注类型 | 语料 | 方式 |
|---|---|---|
| 人工实体标注 | BC5CDR(disease/chemical)、ShARe/CLEF | 双人独立标注 + 共识仲裁,MeSH/SNOMED 概念归一化 |
| 人工关系标注 | DDI、ChemProt、i2b2-2010 | 专家在实体对上标注关系类型,多数经第三方仲裁 |
| 人工多标签标注 | HoC | 按十大 hallmark 指南对摘要打多标签 |
| 人工相似度评分 | MedSTS、BIOSSES | 2 位(MedSTS)/5 位(BIOSSES)专家独立打分取均值 |
| 人工推理标注 | MedNLI | 受训标注者对临床句对标三分类标签 |
§3.6 标注者资质与一致性
各语料标注者均为相应共享任务组织方招募的领域专家:BC5CDR 使用受过医学训练的 MeSH 索引员与 CTD 策展人(test 集 Jaccard 一致性 disease 87.49%、chemical 96.05%);ShARe/CLEF 为专业受训标注者加仲裁;i2b2-2010 由执业医师标注;MedSTS/BIOSSES 分别由 2 位与 5 位专家评分;MedNLI 沿用 MIMIC-III 场景下受训标注者的协议。BLUE 本身未重新标注,一致性指标以各原始语料论文报告为准——这也意味着跨语料的标注质量存在不可消除的异质性。
§3.7 采集周期
BLUE 语料的时间跨度由原始共享任务决定:ShARe/CLEF eHealth 2013、DDIExtraction 2013 为 2013 年届任务;i2b2-2010 为 2010 年届;BC5CDR 于 2015 年 BioCreative V 定稿(Li et al. 2016 正式发布);HoC 于 2016 年发布;ChemProt 于 2017 年 BioCreative VI 定稿;MedNLI 于 2018 年随 EMNLP 论文发布;BLUE 基准本身于 2019-06 定型。故 temporalCoverage 记为 2013/2019。
§3.8 地域覆盖
文献类语料(BC5CDR、ChemProt、DDI 的 MedLine 部分、HoC、BIOSSES 源文献)覆盖全球 PubMed/DrugBank 来源,以英语文献为主;临床类语料(ShARe/CLEF、MedNLI 来自 MIMIC-II/III,i2b2-2010 来自三家美国医院,MedSTS 来自梅奥诊所)均产自美国医疗系统。BLUE 不含非英语与美域外临床文本,跨语言与跨医疗体系泛化需另行验证。
§3.9 文本规格
作为 NLP 基准,BLUE 无影像设备规格;其"技术规格"等价于文本处理参数:原语料缺分词时统一用 spaCy 分词;NER 评测要求 span 严格匹配(strict 版 precision/recall/F1,不重叠提及需完整命中);文档分类在摘要级进行(HoC example-based F1);句子相似度直接对人工分值回归出 Pearson 相关。基线微调超参(ELMo 路线)为最大序列长 128、Adam 学习率 0.001、batch 64、20 epochs、早停。
§3.10 深度溯源链
| 语料 | 原始共享任务 | 原始发布渠道 | BLUE 中的处理 |
|---|---|---|---|
| BC5CDR | BioCreative V CDR(2015) | biocreative 官网 | 沿用标准 train/test,拆分为 disease/chemical 两份 NER 子集 |
| ShARe/CLEF | ShARe/CLEF eHealth 2013 Task 1 | PhysioNet works 页 | 沿用标准划分 |
| DDI | DDIExtraction 2013 | 西班牙马德里卡洛斯三世大学语料页 | 重划 624/191 文件 |
| ChemProt | BioCreative VI CPI(2017) | biocreative 语料页 | 沿用标准划分,仅评 5 类 |
| i2b2-2010 | i2b2/VA 2010 关系任务 | i2b2 NLP DataSets | 取子集(170 训练/256 测试文档) |
| HoC | Hallmarks of Cancer 语料 | 剑桥大学 HoC 页 | 自划约 20% 测试 |
| BIOSSES | TAC 生物医学摘要跟踪 | 布尔萨 Uludag 大学 BIOSSES 页 | 随机 80/20 |
| MedSTS | 梅奥诊所发布 | Mayo 官方申请页 | 沿用标准划分 |
| MedNLI | Romanov & Shivade(EMNLP 2018) | PhysioNet(MIMIC-III 凭证访问) | 完全沿用其划分 |
§4 数据结构
§4.0 目录树
以下为获取并解压后的典型工作目录结构(GitHub 仓库顶层结构 + release 0.1 数据目录;语料子目录内的具体文件名以仓库实际为准,下图为示意):
workspace/
├── BLUE_Benchmark/ # 官方仓库(git clone)
│ ├── README.md # 任务表、基线表、引用格式
│ ├── LICENSE.txt # Public Domain Notice(2020-04-14 添加)
│ ├── requirements.txt # 依赖清单
│ ├── blue/ # BLUE 主基准:10 语料评测代码与数据构造脚本
│ │ ├── BIOSSES/
│ │ ├── MedSTS/
│ │ ├── BC5CDR-disease/
│ │ ├── BC5CDR-chemical/
│ │ ├── ShAReCLEF/
│ │ ├── DDI/
│ │ ├── ChemProt/
│ │ ├── i2b2-2010/
│ │ ├── HoC/
│ │ └── MedNLI/ # 每个语料子目录含 train/dev/test 数据文件
│ └── blue_plus/ # 扩展代码(2019-09 最后更新)
├── data/ # 解压 release 0.1 后的 BERT 格式数据
│ ├── BIOSSES/{train,dev,test}.tsv
│ ├── BC5CDR-chemical/{train,dev,test}.tsv # token 与 IOB 标签制表符分隔
│ └── ...
└── ncbi_bluebert/ # 配套 BlueBERT 预训练与微调代码仓库
└── run_classifier.py 等脚本
说明:data/ 内 6 个公开语料可直接从 release 0.1 下载;MedSTS、ShARe/CLEF、MedNLI、i2b2-2010 需按 §6.2 申请后放入对应子目录再运行评测代码。
§4.1 DAIMS 字段字典
BLUE 为多语料基准,字段按任务形态归纳为三类记录结构。核心字段如下(8 列:字段名/类型/说明/示例值/AI 用途/观测误差/信息性缺失编码/取值范围):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| sentence_1 | Text | 句对任务第一句 | “Sotalol prolongs the QT interval…” | STS/NLI 输入 | 拼写与缩写变体 | 无缺失 | 自由文本 |
| sentence_2 | Text | 句对任务第二句 | “…amiodarone also blocks potassium channels.” | STS/NLI 输入 | 同上 | 无缺失 | 自由文本 |
| score | Float | 人工相似度分(MedSTS 0–5 / BIOSSES 0–4) | 4.2(MedSTS) | 回归目标/排序 | 标注者间主观差异 | 无缺失 | 0–5(按语料) |
| token | Text | NER 语料经分词的词元 | “cisplatin” | 序列标注输入 | spaCy 分词边界差异 | 无缺失 | 词表 |
| label | Text/Label | NER 的 IOB 标签 | B-Chemical、I-Chemical、O | span 抽取 | 跨语料标签集不同 | O 为无实体 | IOB 集合 |
| entity_pair | Text | 关系语料的实体对(DDD 中两个药物) | (warfarin, aspirin) | 关系分类 | 实体歧义 | 无缺失 | 语料内实体 |
| relation | Label | 关系/推理标签 | Mechanism(DDI);entailment(MedNLI) | 分类目标 | 类目口径按语料 | 无缺失 | 见 §4.2 |
| document_label | Label | HoC 十大 hallmark 多标签 | “inducing angiogenesis” | 多标签分类 | 标注粒度按摘要级 | 无缺失 | 10 个 hallmark |
§4.2 标签分布
- NER(3 语料):IOB 二元组标签——BC5CDR-disease(B-/I-Disease)、BC5CDR-chemical(B-/I-Chemical)、ShARe/CLEF(B-/I-Disorder),其余为 O;提及/非提及比约 1:3(以总 token 计,语料均值)。
- DDI:4 类——Mechanism(最多)、Effect、Advice、Int(“Int.” false interaction 类),BLUE 报 macro-F1 时 4 类等权。
- ChemProt:9 类 CPR 中只评 5 类(CPR:3 激活、CPR:4 抑制、CPR:5 上游/下游、CPR:6 部分激动剂/拮抗剂等定义随语料文档,CPR:9 非直接关联),其余 4 类在构造时剔除。
- i2b2-2010:问题-治疗间 8 类关系(如 TrWP/TrCP/TrIP/TrNAP/TrAP/TrAG 等原任务类目),BLUE 沿用其子集口径。
- HoC:10 个 hallmark 多标签,平均每篇摘要 2–3 个标签(1,580 篇 × 多标签)。
- MedNLI:entailment/contradiction/neutral 三类,训练集 11,232 对大致均衡。
§4.3 关键统计
| 统计项 | 数值 | 来源 |
|---|---|---|
| 语料数 | 10 | 论文 Table 1 |
| 任务数 | 5 | 论文 Table 1 |
| 实例总数(混合单位) | 约 80,842 | 论文 Table 1 求和 |
| 文献域语料数 | 6(BIOSSES、BC5CDR×2、DDI、ChemProt、HoC) | 论文 Table 1 |
| 临床域语料数 | 4(MedSTS、ShARe/CLEF、i2b2-2010、MedNLI) | 论文 Table 1 |
| 预训练语料(PubMed) | >4,000M 词 | 论文 Table 2 |
| 预训练语料(MIMIC-III) | >500M 词 | 论文 Table 2 |
| 平均句长区间 | 10.6–41.7 词 | 论文 Table 1 |
| 文献域实例数 | 约 45,313(BIOSSES/BC5CDR×2/DDI/ChemProt/HoC 求和) | 论文 Table 1 求和 |
| 临床域实例数 | 约 35,529(MedSTS/ShARe/CLEF/i2b2-2010/MedNLI 求和) | 论文 Table 1 求和 |
| Semantic Scholar 引用 | 1,010+(截至 2026-09) | Semantic Scholar API |
注:文献域/临床域拆分合计 80,842,按 §3.2 各行 train+dev+test 分别求和得到;混合单位(句对/提及/关系/文档)不可跨语料相加解读,仅作规模量级参考。
§4.4 数据层级
BLUE 的数据层级因语料而异,统一归纳为三级:语料(corpus)→ 文档/句对(document/pair)→ 实例(mention/relation/label)。文献语料的层级为 语料 → PubMed 摘要 → 句子 → 实体 span;临床语料为 语料 → 去标识笔记 → 句子 → 实体 span 或关系对;句对语料为 语料 → 句对 → 分值/标签。与影像数据集"患者→检查→序列→切片"不同,BLUE 无患者主索引——临床语料中文档与患者的对应关系保存在 MIMIC-II/III 原库中,BLUE 本体不携带患者 ID。
这一层级设计对工程实践有两个直接推论:其一,任何跨语料聚合(如"文献域总均值")都必须以任务组为单位再平均,直接对所有实例求平均会被大语料(MedNLI 11,232 对)主导;其二,若需把 BLUE 子任务结果与患者级数据联动(如把 i2b2-2010 的关系抽取结果回贴到 MIMIC 原病历),必须走原始数据集的申请与合规通道,BLUE 发布物本身不支持患者级回溯。
§4.5 缺失值与信息性缺失
BLUE 为全标注基准,10 语料均无"缺失值编码"设计:句对任务的 score 无缺失(人工逐对评分),NER 语料的 O 标签即显式"无实体",关系语料中不属于受评类目的 ChemProt 关系对在构造时被剔除而非标记为缺失。需注意的"类缺失"现象有二:其一,i2b2-2010 的 dev 划分仅 11 条关系,接近"事实上的空开发集",调参与早停时必须换用交叉验证或直接以训练集内部划分替代;其二,BIOSSES 无官方划分、随机 80/20,导致不同论文的训练/测试重叠可能不同——两者都不是缺失值,而是划分机制上的信息性空缺,复现时须核对。
§5 划分与使用建议
官方划分:BLUE 对 10 语料给出统一 Train/Dev/Test 划分(见 §3.2)。其中 8 个语料沿用原共享任务划分;BIOSSES 为 BLUE 随机 80/20(原语料无官方划分);HoC 为 BLUE 自划约 20% 测试;DDI 为 BLUE 重划的 624/191 文件;i2b2-2010 取原任务子集(170 训练/256 测试文档)。
社区惯例:后续论文(BioBERT、BlueBERT、BLURB 及各领域模型)基本沿用 BLUE 划分报告数字;BLURB 对重合语料使用了自己的更大规模版本(如 ChemProt 18,035 训练关系、DDI 25,296 训练关系),与 BLUE 数字不可混排——引用时务必注明"BLUE 口径"或"BLURB 口径"。
划分策略建议:
- 除 BIOSSES 外不要自行重划——BLUE 的可比性建立在官方划分上;BIOSSES 若重划须固定随机种子并披露。
- i2b2-2010 的 11 条 dev 关系不可用于早停,建议 k 折交叉验证或按文档从训练集内部再切 10% 作为本地 dev。
- NER 任务以句子为单位划分已内置于语料;跨文档上下文(如病历章节标题)如需利用,只能在训练侧扩展,不得把测试文档信息带入训练。
泄漏风险(§5.3 重点):
- BC5CDR 两份 NER 子集(disease/chemical)来自同一批 1,500 篇文档——若把"BC5CDR-chemical 训练文档"与"BC5CDR-disease 测试文档"做跨语料检索去重,会发现大量同文档文本。多任务联合训练合法,但跨语料把对方的测试文本混入训练是典型泄漏,论文级对比会被质疑。
- MedNLI 句对取自 MIMIC-III,与 ShARe/CLEF(MIMIC-II)无直接文档重叠,但同源体系——若你的模型预训练语料包含 MIMIC 全文,须确认与官方预训练语料口径一致,否则对比失真。
- HoC 摘要与 BC5CDR/ChemProt 文献在 PubMed 生态中存在引用链重叠,属正常的文献级关联,不构成实例泄漏;但自行扩充训练集时避免从测试摘要的引文集合直接采样。
交叉验证建议:小语料(BIOSSES 100 句对、HoC 315 测试文档)上单点结果方差大,建议 5 折交叉验证报告均值±标准差;MedSTS 测试集仅 318 句对,Pearson 的 95% 置信区间宽(Bootstrap 估计),论文中应报告区间而非单点。
分阶段实施节奏建议:第一周只跑 6 个公开语料(无需申请),建立评测脚手架与完整性断言;第二至四周并行申请 4 个临床语料,期间用文献域任务调通训练与评估循环;语料到齐后再补临床域四任务并出全量报告。这个节奏把"外部依赖"(申请审批)与"内部工作"(代码搭建)解耦,避免团队因等待语料而空转。
外部验证建议:BLUE 内部表现不能外推到真实医院文本——建议用本机构去标识病历构建内部测试集,按 §7.8 的外部验证矩阵思路报告相对 BLUE 的性能衰减(临床文本的缩写率、句长分布差异是主要衰减源)。
跨口径引用纪律:BLUE 与 BLURB 的重合语料(BC5CDR、ChemProt、DDI、BIOSSES、HoC)划分与规模不同——例如 BLURB 的 ChemProt 训练集 18,035 条关系对 BLUE 的 4,154 条、DDI 25,296 对 2,937。任何"总分"比较必须先声明口径;论文审稿中最常见的质疑就是混用两套划分的数字。建议在实验管理系统中把"blue"与"blurb"建立为两个独立的评测配置,禁止隐式合并。
§6 AI 就绪指南
§6.0 云端快速启动
语料与模型均为纯文本/小检查点,无需 GPU 集群即可复现 NER 与 STS 基线。Colab(T4)单卡约 2–4 小时跑完 BC5CDR-chemical 的 BlueBERT 微调;本地 16 GB 显存足够 base 模型。预训练 BlueBERT 权重可从 ncbi_bluebert 仓库或 Hugging Face Hub 检索 bluebert 获取。
§6.1 快速上手
以下示例以最小可用子集 BC5CDR-chemical(NER) 演示完整评测闭环。目录结构预期:data/BLUE/ 下每个语料一个子目录(见 §4.0 目录树),data_root 与语料名直接拼接得到文件路径,例如 data_root="data/BLUE" 时训练文件为 data/BLUE/BC5CDR-chemical/train.tsv。TSV 行格式为 token<TAB>label,空行分隔句子,与 BERT 序列标注惯例一致。
# 最小读取示例:BLUE NER 语料(BC5CDR-chemical)
# 预期目录:data/BLUE/BC5CDR-chemical/{train,dev,test}.tsv
# data_root 拼接关系:f"{data_root}/{corpus}/{split}.tsv"
from pathlib import Path
def load_blue_ner(path):
"""读取 BLUE NER TSV -> list[list[(token, label)]],空行分句"""
sentences, cur = [], []
for line in Path(path).read_text(encoding="utf-8").splitlines():
line = line.strip()
if not line: # 空行 = 句子边界
if cur:
sentences.append(cur)
cur = []
continue
parts = line.split("\t")
if len(parts) >= 2: # token \t label
cur.append((parts[0], parts[-1]))
if cur:
sentences.append(cur)
return sentences
train_sents = load_blue_ner("data/BLUE/BC5CDR-chemical/train.tsv")
print(f"训练句子数:{len(train_sents)}")
print("示例:", train_sents[0][:5])
句子相似度任务(MedSTS)的最小读取示例——TSV 每行含句对与金标准分,是 5 任务中最简单的数据形态:
# 最小读取示例:BLUE 句子相似度语料(MedSTS)
# 预期目录:data/BLUE/MedSTS/{train,dev,test}.tsv
# 行格式:sentence_1 \t sentence_2 \t score(0-5 分制)
def load_blue_sts(path):
pairs = []
for line in Path(path).read_text(encoding="utf-8").splitlines():
parts = line.split("\t")
if len(parts) >= 3:
pairs.append({"s1": parts[0], "s2": parts[1], "score": float(parts[-1])})
return pairs
medsts_dev = load_blue_sts("data/BLUE/MedSTS/dev.tsv")
print(f"dev 句对数:{len(medsts_dev)}") # 预期 75
print("示例分值:", medsts_dev[0]["score"])
§6.2 数据获取
| 语料 | 渠道 | 是否需申请 | 说明 |
|---|---|---|---|
| BIOSSES、BC5CDR×2、DDI、ChemProt、HoC | GitHub release 0.1(BERT 格式) | 否 | 直接下载 |
| MedSTS | Mayo Clinic 官方发布页 | 是 | 填表申请,官方页为准 |
| ShARe/CLEF eHealth | PhysioNet works 页 | 是 | 注册后获取 |
| MedNLI | PhysioNet(MIMIC-III credentialed access) | 是 | 需完成凭证化流程 |
| i2b2-2010 | i2b2 NLP DataSets 申请页 | 是 | 签署 DUA |
申请流程的时间与材料要点:PhysioNet 渠道(ShARe/CLEF、MedNLI)需完成 CITI 人类受试者保护培训并上传证书,审核通常按工作日推进;i2b2-2010 需在申请表说明研究用途并签署 DUA,机构盖章可能额外消耗时间;MedSTS 申请页要求说明学术用途。建议为每个语料建立"申请状态看板"(申请日/预计到达日/DUA 存档路径),四个渠道并行推进,总周期控制在 2–4 周。所有申请获得的语料一律不得转载到公开仓库或对象存储。
# 1) 克隆官方仓库(评测代码 + 数据构造脚本)
git clone https://github.com/ncbi-nlp/BLUE_Benchmark.git
cd BLUE_Benchmark
# 2) 下载 release 0.1 的 BERT 格式数据(6 个公开语料)
# 打开 https://github.com/ncbi-nlp/BLUE_Benchmark/releases/tag/0.1
# 下载压缩包并解压到 data/ 目录,得到各语料 TSV
# 3) 安装依赖
pip install -r requirements.txt
§6.3 预处理全流程
BLUE 的设计哲学是"语料重建可从零复现"。若使用原始 BioC/XML 数据(而非 release 0.1 的 BERT 格式),需自行完成转换。以下演示 NER 语料从文本到 IOB 的关键步骤:
# 预处理:BC5CDR BioC XML -> IOB TSV(BLUE 协议口径)
# 关键点 1:原语料未提供分词时,BLUE 用 spaCy 分词(论文 §3.2)
# 关键点 2:NER 评测为 strict span 匹配,分词边界必须与评测侧一致
import spacy
nlp = spacy.blank("en")
def bio_tag(text, spans):
"""spans: [(start, end, type)] 字符级偏移 -> IOB 词级标签"""
doc = nlp(text)
tags = ["O"] * len(doc)
for start, end, typ in spans:
hit = [i for i, tok in enumerate(doc)
if tok.idx >= start and tok.idx + len(tok) <= end]
if not hit: # 分词边界与标注边界冲突:跳过并记录
continue
tags[hit[0]] = f"B-{typ}"
for j in hit[1:]:
tags[j] = f"I-{typ}"
return [(tok.text, tag) for tok, tag in zip(doc, tags)]
清洗与标准化要点:临床语料(ShARe/CLEF)保留原拼写,不做大小写归一(模型侧用 uncased tokenizer 时由 tokenizer 处理);DDI/ChemProt 需过滤到受评类目(ChemProt 只保留 CPR:3/4/5/6/9);HoC 每篇摘要拼接 title + abstract 后截断到模型最大长度。
关系抽取语料(DDI)的构造要点——实体对与关系标签是核心,实体在句中的位置编码(entity marker)是通用做法:
# 预处理:DDI 语料的实体对构造(实体标记法,entity markers)
# 输入:句子文本 + 两个药物实体 span + 关系标签
# 输出:插入 <e1>...</e1> <e2>...</e2> 标记后的分类输入
def mark_entity_pair(text, span1, span2):
"""span1/span2 为 (start, end) 字符偏移,span1 在前"""
e1_end, e2_start = span1[1], span2[0]
marked = (
text[:span1[0]] + "<e1>" + text[span1[0]:e1_end] + "</e1>"
+ text[e1_end:e2_start] + "<e2>" + text[span2[0]:span2[1]] + "</e2>"
+ text[span2[1]:]
)
return marked
# 示例:mark_entity_pair("Warfarin increases the effect of aspirin.",
# (0, 8), (31, 38)) -> DDI 关系分类输入
# 注意:只对受评类目(4 类 DDI)构造样本;未标注关系的句对默认为负类或剔除,
# 具体口径以官方数据构造脚本为准。
§6.4 PyTorch DataLoader 完整代码
以下为 NER 任务的完整可运行 Dataset + DataLoader(transformers 库,BlueBERT 权重名按 Hugging Face Hub 实际检索结果替换):
import torch
from torch.utils.data import Dataset, DataLoader
from transformers import AutoTokenizer, AutoModelForTokenClassification
from torch.optim import AdamW
MODEL_NAME = "bionlp/bluebert_pubmed_mimic3_uncased_L-12_H-768_A-12"
MAX_LEN = 128
tokenizer = AutoTokenizer.from_pretrained(MODEL_NAME)
label2id = {"O": 0, "B-Chemical": 1, "I-Chemical": 2}
class BlueNerDataset(Dataset):
"""BLUE NER 语料的 token classification 数据集。
对齐策略:token 序列用 offset_mapping 映射回词级标签,
子词只保留首子词的标签(与 strict span 评测的对齐口径一致)。
"""
def __init__(self, sentences, tokenizer, max_len=MAX_LEN):
self.sentences = sentences
self.tokenizer = tokenizer
self.max_len = max_len
def __len__(self):
return len(self.sentences)
def __getitem__(self, idx):
words, tags = zip(*self.sentences[idx])
enc = self.tokenizer(
list(words),
is_split_into_words=True,
truncation=True,
max_length=self.max_len,
return_offsets_mapping=True,
padding="max_length",
)
word_ids = enc.word_ids()
labels = []
prev = None
for wid in word_ids:
if wid is None:
labels.append(-100) # 特殊 token 不计损失
elif wid != prev:
labels.append(label2id.get(tags[wid], 0))
else:
labels.append(-100) # 子词延续位不计损失
prev = wid
return {
"input_ids": torch.tensor(enc["input_ids"]),
"attention_mask": torch.tensor(enc["attention_mask"]),
"labels": torch.tensor(labels),
}
train_sents = load_blue_ner("data/BLUE/BC5CDR-chemical/train.tsv")
dev_sents = load_blue_ner("data/BLUE/BC5CDR-chemical/dev.tsv")
train_ds = BlueNerDataset(train_sents, tokenizer)
dev_ds = BlueNerDataset(dev_sents, tokenizer)
train_dl = DataLoader(train_ds, batch_size=16, shuffle=True)
dev_dl = DataLoader(dev_ds, batch_size=32)
model = AutoModelForTokenClassification.from_pretrained(
MODEL_NAME, num_labels=len(label2id)
)
optimizer = AdamW(model.parameters(), lr=5e-5)
device = "cuda" if torch.cuda.is_available() else "cpu"
model.to(device)
for epoch in range(3):
model.train()
for batch in train_dl:
batch = {k: v.to(device) for k, v in batch.items()}
loss = model(**batch).loss
loss.backward()
optimizer.step()
optimizer.zero_grad()
print(f"epoch {epoch} done, last loss {loss.item():.4f}")
句子相似度任务(MedSTS)的回归 Dataset——目标为金标准分,评测时对预测分与金标准分计算 Pearson 相关:
class BlueStsDataset(Dataset):
"""BLUE 句子相似度语料的回归数据集(MedSTS/BIOSSES 通用)。
标签为人工金标准分(MedSTS 0-5,BIOSSES 0-4),
训练用 MSE/SmoothL1 回归,评测报 Pearson 相关。
"""
def __init__(self, pairs, tokenizer, max_len=128):
self.pairs = pairs
self.tokenizer = tokenizer
self.max_len = max_len
def __len__(self):
return len(self.pairs)
def __getitem__(self, idx):
item = self.pairs[idx]
enc = self.tokenizer(
item["s1"], item["s2"],
truncation=True, max_length=self.max_len,
padding="max_length", return_tensors="pt",
)
return {
"input_ids": enc["input_ids"].squeeze(0),
"attention_mask": enc["attention_mask"].squeeze(0),
"labels": torch.tensor(item["score"], dtype=torch.float),
}
sts_train = BlueStsDataset(load_blue_sts("data/BLUE/MedSTS/train.tsv"), tokenizer)
sts_dl = DataLoader(sts_train, batch_size=16, shuffle=True)
# 模型侧:AutoModelForSequenceClassification,num_labels=1,问题类型 regression
§6.5 坑点 8 个
⚠️ 坑点 1:DDI 指标曾由 micro-F1 改为 macro-F1,跨时期数字不可比(分类:评估误用)
问题:官方在 2019-08-13 将 DDI 任务指标从 micro-F1 改为 macro-F1(README 公告),但 2019-06 的论文 Table 1 仍印 micro-F1。直接把论文数字与后续仓库数字排进同一张表会得出错误结论。
症状:复现 DDI 时你的 macro-F1 "远低于"论文数字,或你的 micro-F1 “远高于” SOTA;文献综述中出现 4 类不平衡类目下的虚高成绩。
解决:
- 简单方法:引用前核对数字出处日期——2019-08-13 之前的 DDI 数字一律按 micro-F1 理解。
- 进阶方法:同时报告 micro 与 macro-F1,并注明类目频次(Mechanism 占比高导致 micro 偏高)。
- SOTA 方法:重新提交评测时在结果表脚注标明"BLUE 宏观 F1(2019-08 口径)",并给出 per-class F1。
参考:https://github.com/ncbi-nlp/BLUE_Benchmark(README News 区 2019-08-13 条目)
⚠️ 坑点 2:BIOSSES 无官方划分,随机 80/20 造成不可复现(分类:预处理陷阱)
问题:原语料只有 100 个句对且无官方划分,BLUE 采用随机 80/20。不同论文(或不同随机种子)的训练/测试集不同,Pearson 相关差异可达数个百分点。
症状:你的 BIOSSES 结果与已发表论文对不上,且差距远超正常波动;审稿人质疑划分泄漏。
解决:
- 简单方法:固定随机种子(如 42)并披露划分细节。
- 进阶方法:用 release 0.1 提供的官方 64/16/20 文件,不要自行重切。
- SOTA 方法:5×2 交叉验证或 Bootstrap 重采样,报告均值±标准差与置信区间。
参考:BLUE 论文 §3.1(“we randomly select 80% for training and 20% for testing”)
⚠️ 坑点 3:i2b2-2010 开发集只有 11 条关系(分类:工程陷阱)
问题:BLUE 的 i2b2-2010 划分为 3,110/11/6,293——dev 仅 11 条关系,任何基于 dev 的调参、早停、模型选择都建立在噪声上。
症状:以 dev 为准选 checkpoint 时,测试集成绩抖动极大;两次同配置训练的结果差异超过模型间真实差异。
解决:
- 简单方法:禁用 dev 早停,固定训练轮数。
- 进阶方法:从 3,110 条训练关系按文档分层抽样 10% 做本地 dev,训练结束后用全量训练集重训一轮。
- SOTA 方法:按文档 5 折交叉验证报告均值;注意按"文档"而非"关系"切分以防同文档关系泄漏。
参考:论文 Table 1(i2b2 2010 行);i2b2 2010 共享任务原始划分说明
⚠️ 坑点 4:NER strict 评测对分词边界极端敏感(分类:预处理陷阱)
问题:BLUE 的 NER 用 strict span 匹配:预测 span 必须与标注 span 完全一致。BLUE 用 spaCy 为原语料补分词,若你的 tokenizer 切分边界与 spaCy 不一致(如 “c-fos”、“IL-2” 被切开方式不同),标注边界无法还原,F1 被系统性压低。
症状:模型明明"找对了位置",entity-level F1 却比论文基线低 2–5 个百分点;错误集中在含连字符与缩写的实体上。
解决:
- 简单方法:直接使用 release 0.1 的 BERT 格式数据(已完成官方分词与对齐)。
- 进阶方法:用 tokenizer 的 offset_mapping 把字符级标注映射到词级,冲突 span 显式丢弃并记录日志(见 §6.3 代码)。
- SOTA 方法:评测时在字符级重建预测 span(把子词 span 合并回原文偏移),与官方评测脚本字符级对齐。
参考:BLUE 论文 §3.2(strict precision/recall/F1 与 spaCy 分词说明)
⚠️ 坑点 5:ChemProt 只评 5 类,全类目训练会污染对比(分类:标签理解)
问题:BLUE 对 ChemProt 仅评测 CPR:3/4/5/6/9 五类,其余类目在数据构造时剔除。直接在全部 9 类上微调再报告"F1",与 BLUE 口径不可比;且不同分发版本的 ChemProt 类目编号有出入。
症状:你的 ChemProt 成绩比 BLUE 基线高/低一大截;类目混淆矩阵里出现 BLUE 从未评测的类。
解决:
- 简单方法:构造数据时硬过滤到 5 个受评类目。
- 进阶方法:保留全类目做辅助训练,但评测头只输出 5 类,并在论文中说明。
- SOTA 方法:对齐 BLURB 口径时注意 BLURB 的 ChemProt 规模(18,035/11,268/15,745)与 BLUE(4,154/2,416/3,458)不同,分开报告。
参考:GitHub README(“evaluate the same five classes: CPR:3, CPR:4, CPR:5, CPR:6, and CPR:9”)
⚠️ 坑点 6:文献域与临床域混合,预训练语料匹配错了任务会系统性掉分(分类:偏倚陷阱)
问题:BLUE 刻意混排两类文体。BLURB 作者明确观察到:在临床笔记(MIMIC)上继续预训练的 BERT 在文献任务上会退化到接近通用 BERT 水平;反之亦然。用单一域预训练的模型跑全部 10 任务,会把"域错配"误读为"模型不行"。
症状:PubMed-only 模型在 ShARe/CLEF、MedNLI 上大幅落后;MIMIC-only 模型在 BC5CDR、HoC 上"意外"平庸。
解决:
- 简单方法:按域分组解读结果——文献任务看 PubMed 预训练模型,临床任务看 P+M(PubMed+MIMIC-III)预训练模型。
- 进阶方法:直接选用 BlueBERT(P+M 双语料)或为两域分别准备权重。
- SOTA 方法:报告分域平均分(文献域均值 / 临床域均值),并做域内显著性检验。
参考:BLURB 论文(arXiv:2007.15779)§2 对 BLUE 混域的批评与实验证据
⚠️ 坑点 7:小测试集上的 Pearson 相关系数方差大(分类:评估误用)
问题:MedSTS 测试集仅 318 句对、BIOSSES 仅 20 句对。Pearson 在小样本上抽样误差大,单点数字的置信区间宽;BIOSSES 的 20 对测试尤其脆弱,一两个句对的极端误差即可翻转排名。
症状:两次只差随机种子的实验在 BIOSSES 上波动 ±0.05;两篇论文的 BIOSSES 排名与 MedSTS 排名互相矛盾。
解决:
- 简单方法:同一模型多个随机种子取均值再报告。
- 进阶方法:Fisher z 变换计算 Pearson 置信区间,或 Bootstrap 重采样 1,000 次估计区间。
- SOTA 方法:比较模型时报告区间重叠情况;区间重叠则声明"不可区分"而非宣称新 SOTA。
参考:BLUE 论文 Table 1(BIOSSES test=20);BIOSSES 原始论文的评分协议
⚠️ 坑点 8:4 个临床语料需逐渠道申请,禁止再分发——凑不齐数据就无法复现完整 BLUE 分数(分类:工程陷阱)
问题:MedSTS(Mayo)、ShARe/CLEF(PhysioNet)、MedNLI(PhysioNet credentialed)、i2b2-2010(i2b2 DUA)不随 GitHub release 分发,且各自的数据使用协议禁止向第三方再分发。很多团队最终只跑通了 6 个公开语料。
症状:内部报告号称"BLUE 总分"却只有 6/10 任务;把申请语料转存到公司内网共享盘触发合规审计问题。
解决:
- 简单方法:提前 2–4 周并行提交四个渠道的申请,PhysioNet 走凭证化流程(CITI 证书)。
- 进阶方法:结果表明确标注"BLUE-6(公开子集)"口径,不做跨口径总分。
- SOTA 方法:在合规允许范围内用 MIMIC-III credentialed 访问重建语料(与官方划分核对文档数),自建机构级 BLUE 复评流水线。
参考:GitHub README Datasets 区;PhysioNet 与 i2b2 各自的申请页面
§6.6 数据增强建议
- ✅ 安全:NER 任务中的 token 级 dropout(随机 mask 词元);用同义句对替换的 STS 数据回流;实体替换增强(把 BC5CDR 训练集化学物名替换为同药理类的其他名称,并同步更新标签 span);MedNLI 中的 premise 保持不变的标签翻转对称检查。
- ❌ 危险:对临床语料做字符级噪声注入(缩写纠错会破坏医学缩写的真实分布,医学文本拼写错误罕见且信息量大);对 DDI/ChemProt 随机交换实体对方向(多数关系类目有方向性,交换后语义错误);用测试文档的引文/相似文档扩充训练集(文献生态重叠导致软泄漏);跨语料复制测试文本(BC5CDR 两份子集同源,见 §5.3)。
§6.7 模型推荐表
| 模型 | 适用任务 | 蓝本成绩(BLUE 口径) | 说明 |
|---|---|---|---|
| BlueBERT(base/large,P+M) | 全部 10 任务 | MedNLI 84.0 acc、ShARe/CLEF 77.1 F1 | PubMed+MIMIC-III 双语料预训练,临床任务首选 |
| BioBERT(v1.1) | NER/RE/分类 | BC5CDR-chem 93.0 F1、DDI 78.8 F1 | PubMed 预训练,文献任务强 |
| PubMedBERT(Microsoft) | 文献域任务 | BLURB 体系表现优 | 从头领域预训练,词表适配好 |
| ELMo(BioSentVec/PubMed) | STS 基线 | MedSTS 68.6 Pearson | 只作历史基线对比 |
| BioGPT / 生成式 LLM | HoC、端到端 RE | HoC 85.12 F1(BioGPT) | 生成式协议与抽取式不同,见 §8.2 |
| PubMedBERT | 文献域 NER/RE | BLURB 体系最优之一 | 从头预训练,领域词表完整,适合文献管线 |
| 通用 BERT-base | 全任务对照基线 | 低于领域模型 2–5 个点 | 用于量化"领域预训练收益"的对照组 |
§6.8 硬件需求表
| 配置 | GPU 显存 | 适用场景 | 预计耗时 |
|---|---|---|---|
| 最低配置 | 8 GB(T4 级) | base 模型单语料微调(batch 8 + 梯度累积) | BC5CDR 单任务 2–4 小时 |
| 推荐配置 | 16 GB(V100/A10) | base 模型全语料批量微调 | 10 语料一轮 1–2 天 |
| 大型配置 | 40 GB(A100) | large 模型 + 序列长 512 + 多种子 | 单任务 1–3 小时 |
| CPU-only | 无 GPU | STS 小语料(BIOSSES 100 句对)调试与评测脚本验证 | 仅限调试,训练不实用 |
| 说明 | — | 语料本体仅 MB 级,瓶颈全在模型与序列长度 | — |
§6.9 评估指标实现
# BLUE 指标速算:strict span F1 / macro-F1 / Pearson / accuracy
import numpy as np
from collections import defaultdict
def span_f1(pred_spans, gold_spans):
"""strict 实体级 F1:span 完全一致才算命中"""
tp = len(pred_spans & gold_spans)
p = tp / len(pred_spans) if pred_spans else 0.0
r = tp / len(gold_spans) if gold_spans else 0.0
return 2 * p * r / (p + r) if p + r else 0.0
def macro_f1(preds, golds, labels):
"""BLUE DDI 口径:4 类等权 macro-F1"""
scores = {}
for lb in labels:
tp = sum(1 for p, g in zip(preds, golds) if p == lb and g == lb)
fp = sum(1 for p, g in zip(preds, golds) if p == lb and g != lb)
fn = sum(1 for p, g in zip(preds, golds) if p != lb and g == lb)
prec = tp / (tp + fp) if tp + fp else 0.0
rec = tp / (tp + fn) if tp + fn else 0.0
scores[lb] = 2 * prec * rec / (prec + rec) if prec + rec else 0.0
return float(np.mean([scores[lb] for lb in labels]))
def pearson(x, y):
x, y = np.asarray(x, float), np.asarray(y, float)
return float(np.corrcoef(x, y)[0, 1])
accuracy = lambda preds, golds: float(np.mean(np.array(preds) == np.array(golds)))
端到端评测循环——把以上指标组装成 BLUE 风格的报告输出(含分类别明细,便于论文与内部报告直接引用):
# BLUE 风格评测报告:单语料 → 指标 → 分域汇总
def evaluate_ner(all_pred_spans, all_gold_spans):
"""所有测试句子的 span 级 strict F1(宏平均 over 文档)"""
scores = [span_f1(p, g) for p, g in zip(all_pred_spans, all_gold_spans)]
return {"metric": "strict span F1", "score": float(np.mean(scores))}
def evaluate_ddi(preds, golds):
labels = ["Mechanism", "Effect", "Advice", "Int"]
return {"metric": "macro-F1 (2019-08 口径)",
"score": macro_f1(preds, golds, labels)}
def report_blue(results):
"""results: {corpus: {"metric": ..., "score": ...}} 按分域平均汇总"""
lit = [v["score"] for k, v in results.items()
if k in {"BIOSSES", "BC5CDR-chemical", "BC5CDR-disease",
"DDI", "ChemProt", "HoC"}]
clin = [v["score"] for k, v in results.items()
if k in {"MedSTS", "ShAReCLEF", "i2b2-2010", "MedNLI"}]
print(f"文献域平均:{np.mean(lit):.4f}({len(lit)} 语料)")
print(f"临床域平均:{np.mean(clin):.4f}({len(clin)} 语料)")
for k, v in results.items():
print(f" {k:<16} {v['metric']}: {v['score']:.4f}")
§6.10 MLOps 笔记
- 口径版本化:把"BLUE 口径"(划分哈希 + 指标定义 + 类目过滤清单)写进实验配置,DDI 记录 micro 与 macro 两个数,防止半年后自己对不上。
- 数据不可再分发:4 个申请语料的本地副本要按 DUA 管理(访问日志、员工离岗回收),不进对象存储公共桶,不进 CI 缓存。
- 回归测试:把 BIOSSES(100 句对)作为快速冒烟集,全量 10 语料作为周级回归集;模型每次升级跑分域平均分(文献/临床两组)。
- 排行榜意识:BLUE 无官方在线排行榜,SOTA 数字以论文与 GitHub README 为准(2019-04 口径);新数字一律与 BLURB 排行榜交叉核对。
- 可复现性:固定 transformers/版本、随机种子与 GPU 型号;BIOSSES 与 HoC 小集上种子敏感性最高,建议 5 种子起报。
- 评测资产化:把 10 语料的加载、过滤、评测封装成内部标准库(含单元测试锁定语料行数),避免每个项目重写导致口径漂移;语料行数断言(如 BIOSSES=100、HoC test=315)是最廉价有效的完整性守卫。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 域混合偏倚 | 文献与临床文本混排,预训练语料不匹配时系统性掉分(BLURB 论文实证) | 高 | 分域报告成绩;按任务选预训练权重(P vs P+M) |
| 时间偏倚 | 语料定格于 2010–2019 年文献与病历,新药、新术语(如免疫检查点抑制剂)覆盖不足 | 中 | 上线前用近期文献自建补充测试集 |
| 机构偏倚 | 临床语料全部来自美国医院(MIMIC 体系、梅奥、i2b2 三院),美域外医疗文本缺位 | 中 | 跨机构内部数据外部验证 |
| 语种偏倚 | 全部为英语,中文等语言无覆盖 | 高(对非英语用户) | 翻译/跨语言模型另行评测,不直接迁移 |
| 类目不平衡 | DDI 的 Mechanism 类占比高,ChemProt 部分类目样本少 | 中 | macro-F1 报告 + per-class F1 |
| 标注者偏倚 | STS 主观评分(BIOSSES 5 人、MedSTS 2 人),个体差异进入金标准 | 低-中 | 使用均值分;报告标注者区间 |
| 划分脆弱性 | BIOSSES 随机划分、i2b2-2010 dev 仅 11 条、HoC/BC5CDR 测试集偏小 | 高 | 见 §6.5 坑点 2/3/7 的缓解方案 |
| 口径演化偏倚 | DDI 指标中途变更、BLUE/BLURB 双口径并存,历史数字易被误引 | 中 | 引用时强制标注口径与日期(§8.4 协议) |
| 许可碎片化 | 仓库本体公有领域但 4 个临床语料有独立 DUA,“一个 BLUE"并非"一个许可” | 中 | 采购/合规提前介入,按语料分别登记许可 |
§7.2 标注质量
BLUE 本体不重新标注,质量继承自各共享任务。最强的两份:BC5CDR(双人 + 共识,test 集 Jaccard 一致性 disease 87.49%、chemical 96.05%)、ShARe/CLEF(双人 + 仲裁)。STS 语料的"金标准"是人工均值分,天然含主观成分。MedNLI 沿用 EMNLP 2018 协议(受训众包 + 校验)。整体判断:BLUE 的标注质量在 BioNLP 语料中属第一梯队,但"十语料异质性"意味着跨任务的标注粒度与类目定义不可直接横向比较——这是使用时最重要的心智前提。
对标注质量的实操检验建议:抽取 50 个随机样本做内部双人盲标,与官方标注比对实体级 F1——若你的团队复标结果与官方差距超过 5 个点,通常不是官方标注的问题,而是类目理解偏差(如 ChemProt 的 CPR:5 上游/下游定义),此时应回读原始任务的标注指南而非质疑语料。这一步应写入任何严肃使用 BLUE 的项目计划。
§7.3 泛化性表
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 真实医院文本(非 MIMIC 体系) | 缩写/模板差异导致 NER 与关系抽取性能下降 | 临床语料全部来自美国医院体系,跨机构差异未被基准覆盖 |
| 2020 年后新文献 | 新药与新机制术语覆盖不足,HoC/ChemProt 分类性能衰减 | 语料定格于 2019 年前;LLM 时代评测多转用 PubMedQA 等新基准 |
| 非英语医疗文本 | 直接迁移基本失效 | BLUE 全部为英语语料 |
| 端到端生成式抽取 | 生成式协议(BioGPT 式)与 BLUE 抽取式协议数字不可比 | BioGPT 在 BC5CDR/DDI 的 F1(44.98/40.76)与抽取式 SOTA(90+)体系不同 |
| 对抗/拼写噪声 | BERT 系模型在同义词替换攻击下 NER F1 大幅下降 | 独立对抗评测显示同义词攻击可令 BC5CDR NER F1 下降逾 10 个百分点 |
综合解读:BLUE 各任务上的高分不等于生产环境的可靠性——基准考察的是"标准条件下的能力上限",而生产环境引入了基准未覆盖的文体混杂、术语演化与对抗输入。成熟团队的通行做法是把 BLUE 分数作为模型的"准入门槛"而非"验收标准":门槛线以下不进入试点,门槛线以上再叠加真实数据评估与人工复核抽检,形成两级质量闸门。
§7.4 伦理
BLUE 仓库本体为美国公有领域;临床语料(ShARe/CLEF、MedNLI、i2b2-2010)全部来自去标识病历并经原始机构伦理审查,MedSTS 经梅奥诊所内部流程。使用者的义务:不尝试对去标识文本做再识别;遵守 PhysioNet/i2b2/Mayo 的访问协议与再分发禁令;成果引用官方要求的论文。NCBI 官方免责声明明确:该工具产出的信息不用于直接诊断或医疗决策,须经临床专业人员审核。
再识别风险的特别说明:尽管临床语料已完成去标识,随着辅助信息增加(如机构、日期组合),再识别风险理论上不为零——这也是 PhysioNet 对 MIMIC 体系实行凭证化访问的原因。团队合规政策中应明确:BLUE 临床子任务的成绩不得与"可识别机构/时间"的元数据并列发布。
§7.5 公平性
BLUE 不含患者人口学字段,无法按种族/性别/年龄分组建模评测——这是文本基准的固有局限。间接的公平性风险在于:训练语料(PubMed 文献 + 美国病历)对非英语人群、基层医疗文本的欠表达,会沿"预训练→微调→部署"链条传导到下游系统的性能差异。建议团队在部署前用本地人群数据做分层评估。
§7.6 数据漂移
文献域漂移:PubMed 年新增百万级文献,药物与疾病术语持续演化,2019 年定稿的语料对"近期文献"分布已明显滞后;临床域漂移:病历模板、编码习惯(ICD-10 → ICD-11 过渡)在十余年间变化显著。实践建议:把 BLUE 定位为"能力基准"而非"分布基准",季度级回归用 BLUE,年度级分布校准用自采近期数据。
漂移的可观测信号:模型在 BLUE 分数稳定但线上指标下滑时,优先排查三件事——新术语覆盖率(对近期文献抽样新实体,检查模型识别率)、文体占比变化(临床输入中文本类型混合比例)、指标口径(是否有人悄悄改了过滤规则)。BLUE 分数只是"能力体检",线上表现的归因必须回到分布层面。
§7.7 DAIMS 数据可用性自评(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | 10 语料均为扁平 TSV/JSONL,可直接进入训练循环 |
| 2 | 唯一标识 | ✅ | 每语料按文档/句对唯一;跨语料无全局 ID(使用时需加语料前缀) |
| 3 | 特殊字符 | ⚠️ | 临床笔记含缩写、单位与罕见字符,需 UTF-8 统一读取 |
| 4 | 重复行 | ✅ | 共享任务语料经清洗;BC5CDR 两子集同源属设计而非重复 |
| 5 | 缺失编码 | ✅ | 全标注,无缺失值;O 标签即显式无实体 |
| 6 | 标签标识 | ✅ | 标签列明确(IOB/类目/分值),类目字典见 §4.2 |
| 7 | 罕见类分组 | ⚠️ | DDI/ChemProt 尾部类目样本少,需分层抽样与 per-class 报告 |
| 8 | 偏倚评估 | ✅ | 官方论文 + BLURB 均有系统分析(见 §7.1) |
| 9 | 数据字典 | ✅ | 论文 Table 1 + README 任务表完整 |
| 10 | 信息性缺失解释 | ✅ | dev 极小(i2b2-2010)、随机划分(BIOSSES)均有官方说明 |
| 11 | 设备记录 | ❌ | 纯文本基准,不适用 |
| 12 | 共线性 | ✅ | 各语料字段独立,无跨字段冗余编码 |
| 13 | 编码映射 | ✅ | MeSH(BC5CDR)、SNOMED CT(ShARe/CLEF)、DrugBank(DDI)官方受控词表 |
| 14 | 时间戳处理 | ❌ | 语料不含时间戳字段(文献年份在元数据侧) |
| 15 | 划分建议 | ✅ | 官方统一划分 + 本文 §5 策略 |
| 16 | 泄漏讨论 | ✅ | §5.3 明确跨子集同源等风险 |
| 17 | 标签分布 | ✅ | §4.2 汇总;原始分布随语料发布 |
| 18 | 测量偏倚 | ⚠️ | STS 主观评分含标注者偏倚,均值化缓解 |
| 19 | 外部验证建议 | ✅ | §7.8 矩阵 + §5 外部验证流程 |
| 20 | 版本记录 | ✅ | release 0.1 + 2019-08 指标变更公告 + 提交历史完整 |
| 21 | 预处理脚本 | ✅ | 官方仓库提供数据构造与评测代码 |
| 22 | 合规要求 | ⚠️ | 仓库本体公有领域,4 个临床语料需申请且禁再分发 |
| 23 | 多模态对齐 | ❌ | 单模态(文本)基准,不适用 |
| 24 | 去标识化 | ✅ | 临床文本由 MIMIC/i2b2 原始提供方完成去标识 |
DAIMS 评分:18.5 / 24
评分解读:扣分集中在三类——“不适用项”(设备记录、时间戳、多模态,合计 1.5 分权重损失)属于基准类型固有属性;“需注意项”(特殊字符、罕见类、测量偏倚、合规要求)与 BLUE 的多语料异质性和临床语料申请制直接相关。作为对比,单机构临床数据库通常在"设备/时间戳"上得分更高,但在"合规/去标识"上更复杂——BLUE 反而因语料成熟而合规清晰。
对你意味着什么:如果你要快速搭建医疗文本评测能力,BLUE 是同类中摩擦最小的选择之一——直接用官方划分与脚本即可拿到可信基线;但要把三条纪律固化进流程:(1) DDI 用 macro-F1 并记录口径日期;(2) BIOSSES/i2b2-2010 不信任小 dev,改多种子 + 交叉验证;(3) 四个临床语料的申请与 DUA 合规提前排期,不要在实验中期才启动。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| BLURB 体系(13 数据集) | 微软研究院 | NER/RE/STS/分类/QA | macro 平均分 | 重合语料规模扩大(ChemProt/DGI 等换为更大版本) | 临床预训练模型在文献任务退化,支持"分域评测"主张 |
| BioGPT 评测 | 微软研究院 | HoC 文档分类 | F1 85.12% | 高于 BLUE 时代 SOTA(NCBI_BERT large 87.3 属 base-large 混合口径,生成式协议不可直比) | 生成式 LLM 可直接完成 BLUE 部分任务,协议差异须声明 |
| 对抗扰动评测 | 学术界(arXiv:2004.11157) | BC5CDR NER | F1(攻击后) | 同义词攻击 F1 下降约 10+ 个百分点 | 蓝本模型对医学同义替换敏感,部署需鲁棒性测试 |
| BioBERT 复评 | DMIS(KAIST) | NER/RE/STS | F1/Pearson | 与 BLUE 基线同序,BioBERT 在文献任务领先 | BLUE 协议被后续旗舰模型采纳为标准评测 |
| LLM 时代多任务评测 | 多家机构 | BIOSSES/HoC/MedNLI 子集 | Pearson/F1/acc | 零样本 LLM 在抽取式任务上仍逊于微调编码器 | BLUE 子集成为医疗 LLM 的低成本领域探针 |
§8 基准性能与生态
§8.1 排行榜(官方基线全表)
BLUE 无长期维护的官方在线排行榜;下表为官方 README 发布的基线与当时 SOTA(2019-04 口径,SOTA 列引自官方标注)。注意:不同行来自不同论文与实现,测试口径细节(分词、类目过滤)不完全一致,数值不可直接横向排名,仅供量级参考。
| 模型 | 代表成绩(BLUE 测试集) | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|
| 当时 SOTA(逐任务) | BC5CDR-chem 93.3 F1、MedNLI 73.5 acc、ShARe/CLEF 70.0 F1 | ≤2019 | 逐任务最优系统拼盘 | 各任务原始论文(见 README 引用) | 逐任务分布 |
| ELMo(PubMed) | MedSTS 68.6、BIOSSES 60.2 Pearson;DDI 62.0 F1 | 2019 | 上下文词向量 + 任务头 | Peters et al., 2018, NAACL | ELMo |
| BioBERT | BC5CDR-chem 93.0 F1、DDI 78.8 F1、MedSTS 84.5 Pearson | 2019 | PubMed 继续预训练 BERT | Lee et al., 2020, Bioinformatics 36(4):1234–1240. DOI 10.1093/bioinformatics/btz682 | dmis-lab/biobert |
| NCBI_BERT base (P) | BC5CDR-disease 86.6 F1、BIOSSES 89.3 Pearson | 2019 | PubMed 继续预训练 BERT-base | Peng et al., 2019, BioNLP@ACL: 58–65. DOI 10.18653/v1/W19-5006 | ncbi-nlp/ncbi_bluebert |
| NCBI_BERT base (P+M) | MedSTS 84.8、MedNLI 84.0 acc、ShARe/CLEF 77.1 F1 | 2019 | PubMed+MIMIC-III 继续预训练 | 同上 | 同上 |
| NCBI_BERT large (P) | HoC 87.3 F1、DDI 79.9 F1 | 2019 | PubMed 继续预训练 BERT-large | 同上 | 同上 |
| BioGPT | HoC 85.12 F1;BC5CDR/DDI 端到端 RE 44.98/40.76 F1(生成式协议) | 2022 | 生成式 Transformer(15M PubMed 摘要从头预训练) | Luo et al., 2022, Briefings in Bioinformatics 23(6):bbac409. DOI 10.1093/bib/bbac409 | microsoft/BioGPT |
§8.2 分任务基线明细表(官方 README 全表)
下表为官方 README 发布的完整基线数字(SOTA 为 2019-04 作者所知口径)。P = PubMed 继续预训练,P+M = PubMed + MIMIC-III 继续预训练。DDI 行以 GitHub 现行 macro-F1 口径为准。
| 语料(指标) | SOTA@2019-04 | ELMo | BioBERT | NCBI_BERT base (P) | NCBI_BERT base (P+M) | NCBI_BERT large (P) | NCBI_BERT large (P+M) |
|---|---|---|---|---|---|---|---|
| MedSTS(Pearson) | 83.6 | 68.6 | 84.5 | 84.5 | 84.8 | 84.6 | 83.2 |
| BIOSSES(Pearson) | 84.8 | 60.2 | 82.7 | 89.3 | 91.6 | 86.3 | 75.1 |
| BC5CDR-disease(F1) | 84.1 | 83.9 | 85.9 | 86.6 | 85.4 | 82.9 | 83.8 |
| BC5CDR-chemical(F1) | 93.3 | 91.5 | 93.0 | 93.5 | 92.4 | 91.7 | 91.1 |
| ShARe/CLEF eHealth(F1) | 70.0 | 75.6 | 72.8 | 75.4 | 77.1 | 72.7 | 74.4 |
| DDI(macro-F1) | 72.9 | 62.0 | 78.8 | 78.1 | 79.4 | 79.9 | 76.3 |
| ChemProt(micro-F1) | 64.1 | 66.6 | 71.3 | 72.5 | 69.2 | 74.4 | 65.1 |
| i2b2-2010(F1) | 73.7 | 71.2 | 72.2 | 74.4 | 76.4 | 73.3 | 73.9 |
| HoC(F1) | 81.5 | 80.0 | 82.9 | 85.3 | 83.1 | 87.3 | 85.3 |
| MedNLI(accuracy) | 73.5 | 71.4 | 80.5 | 82.2 | 84.0 | 81.5 | 83.8 |
读表要点:(1) 临床任务(MedNLI、ShARe/CLEF、i2b2-2010)上 P+M 模型稳定领先,验证临床语料预训练的价值;(2) BIOSSES 上 base(P) 与 base(P+M) 高出 large 模型 10+ 个点,是测试集仅 20 句对导致的高方差信号(见 §6.5 坑点 7);(3) 文献任务(BC5CDR 系列)各模型挤在 1–2 个点内,区分度有限;(4) SOTA 列取自各任务原始最优系统,与 BERT 系列是不同方法体系。
§8.3 SOTA 总结与选型建议
BLUE 时代的结论至今有效:文献域任务选 PubMed 预训练编码器(BioBERT/PubMedBERT),临床域任务选 P+M 双语料模型(BlueBERT)。10 任务中的"简单项"(BC5CDR-chem 90+ F1)已近饱和,真实区分度集中在 DDI(macro 口径)、ChemProt 尾部类目、ShARe/CLEF 与 MedNLI。生成式 LLM(BioGPT 之后)在 HoC 分类上可超越编码器,但在端到端关系抽取上与传统"NER+RE 管线"数字体系不同——引用时务必标注协议。BLURB 排行榜发布后,社区 SOTA 追踪主战场转移至 BLURB,BLUE 作为历史基线的地位不变。
§8.4 评测协议
- 使用官方 Train/Dev/Test 划分,禁止重划(BIOSSES 除外,须披露种子)。
- NER:strict span 级 precision/recall/F1;span 重建到字符级后比对。
- 关系抽取:DDI 报 4 类 macro-F1(2019-08 起);ChemProt 报 5 类 micro-F1;i2b2-2010 报 F1。
- 句子相似度:预测分与人工金标准分的 Pearson 相关(BIOSSES/MedSTS)。
- 文档分类:HoC 摘要级 example-based F1;推理:MedNLI accuracy。
- 报告口径必须注明:BLUE(非 BLURB)、语料版本、指标变更日期(DDI)。
- 结果报告模板(建议逐字段照填):
模型:<名称/版本>;预训练语料:<通用/PubMed/P+M>;微调超参:<lr/epochs/batch>
划分:BLUE 官方(release 0.1);随机种子:<n>;<多种子时报告均值±标准差>
指标口径:NER=strict span F1;DDI=macro-F1(2019-08);ChemProt=micro-F1(5 类);
STS=Pearson;HoC=example-based F1;MedNLI=accuracy
结果:
MedSTS <Pearson> | BIOSSES <Pearson> | BC5CDR-disease <F1> | BC5CDR-chemical <F1>
ShARe/CLEF <F1> | DDI <macro-F1> | ChemProt <micro-F1> | i2b2-2010 <F1>
HoC <F1> | MedNLI <acc>
分域平均:文献域 <x.xx> | 临床域 <x.xx>
对照:BLUE README 基线(2019-04 口径);BLURB 排行榜(重合语料分开报告)
§8.5 相关数据集表
| 数据集 | 关系 | 千方站内词条 |
|---|---|---|
| MIMIC-III | MedNLI 文本来源、BlueBERT 预训练语料 | https://www.qianfanghub.com/ai-ready-dataset/mimic-iii/106 |
| BC5CDR | BLUE 的 NER 语料(独立使用价值高) | https://www.qianfanghub.com/ai-ready-dataset/bc5cdr/415 |
| BLURB | BLUE 的直系承继基准(微软) | https://www.qianfanghub.com/ai-ready-dataset/blurb/471 |
| BioBERT 评测集 | 复用同源语料的平行评测体系 | biobert-evaluation(词条生产中) |
| PubMedQA | 后继时代的 QA 评测(BLURB 成员) | https://www.qianfanghub.com/ai-ready-dataset/pubmedqa/49 |
§8.6 关键论文 Top 10
- Peng Y, Yan S, Lu Z. Transfer Learning in Biomedical Natural Language Processing: An Evaluation of BERT and ELMo on Ten Benchmarking Datasets. BioNLP@ACL 2019: 58–65. DOI 10.18653/v1/W19-5006 —— BLUE 本体论文,提出基准与 BERT/ELMo 基线。
- Devlin J, Chang M-W, Lee K, Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT 2019: 4171–4186 —— BLUE 评测的通用底座模型。
- Peters ME, Neumann M, Iyyer M, et al. Deep Contextualized Word Representations. NAACL 2018 —— ELMo,BLUE 的另一条基线。
- Lee J, Yoon W, Kim S, et al. BioBERT: a pre-trained biomedical language representation model for biomedical text mining. Bioinformatics 2020;36(4):1234–1240. DOI 10.1093/bioinformatics/btz682 —— 文献域预训练标杆,BLUE 主要对比模型。
- Peng Y, Yan S, Lu Z.(BlueBERT)同 BLUE 论文 —— P+M 双语料预训练策略与权重发布(ncbi_bluebert)。
- Gu Y, Tinn R, Cheng H, et al. Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing. arXiv:2007.15779(正式版刊于 ACM Computing Surveys)—— BLURB 论文,承继并批判性改进 BLUE。
- Luo R, Xia Y, Qin T, et al. BioGPT: generative pre-trained transformer for biomedical text generation and mining. Briefings in Bioinformatics 2022;23(6):bbac409. DOI 10.1093/bib/bbac409 —— 生成式范式在 BLUE 语料(HoC、DDI、BC5CDR)上的代表成果。
- Li J, Sun Y, Johnson RJ, et al. BioCreative V CDR task corpus: a resource for chemical disease relation extraction. Database 2016:baw068. DOI 10.1093/database/baw068 —— BLUE 最核心语料 BC5CDR 的原始论文。
- Romanov A, Shivade C. Lessons from Natural Language Inference in the Clinical Domain. EMNLP 2018: 1586–1596 —— MedNLI 原始论文,BLUE 唯一 NLI 语料来源。
- Soğancıoğlu G, Öztürk H, Özgür A. BIOSSES: a semantic similarity measure for biomedical sentences. Bioinformatics 2017;33(14) —— BIOSSES 语料原始论文。
§8.7 社区活跃度
BLUE 仓库自 2019 年起进入低维护状态(README 最后修订 2022-01-12,代码最后更新 2019-09),Issues 以数据申请与复现问题为主,官方响应有限——这是"基准完成使命、生态交棒"的常态。活跃讨论已迁移至 BLURB 排行榜、Hugging Face Hub(bluebert/biobert 模型页)与后续 LLM 评测论文。引用热度持续:Semantic Scholar 引用 1,010+(截至 2026-09),医疗 LLM 论文的评测相关工作中仍高频回溯 BLUE。
社区使用形态上有三个明显的代际层次:BERT 时代(2019–2021)把 BLUE 当作预训练模型的标准考场,几乎所有领域模型论文都报告 BLUE 分数;排行榜时代(2020–2023)评测主战场转移至 BLURB 在线排行榜,BLUE 转为历史对照与临床域补充(BLURB 不含临床语料);LLM 时代(2023 至今)BLUE 的子集(BIOSSES、HoC、MedNLI、MedSTS)被频繁纳入医疗大模型的多任务评测套件,作为小样本、低成本的领域理解探针。三个代际的数字体系互不通用,引用时注意区分。
§8.8 生态快照表
| 资源 | 类型 | 链接 | Star/热度(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| ncbi-nlp/BLUE_Benchmark | 官方仓库 | https://github.com/ncbi-nlp/BLUE_Benchmark | 数百级 Star | 唯一官方数据与评测代码源 |
| ncbi-nlp/ncbi_bluebert | 预训练模型 | https://github.com/ncbi-nlp/ncbi_bluebert | 数百级 Star | BlueBERT 权重与微调脚本 |
| dmis-lab/biobert | 第三方模型 | https://github.com/dmis-lab/biobert | 2,000+ Star | 文献域对照模型 |
| microsoft/BioGPT | 生成式模型 | https://github.com/microsoft/BioGPT | 5,000+ Star | LLM 时代对照 |
| aka.ms/BLURB | 后继基准排行榜 | https://aka.ms/BLURB | 官方榜单 | 追踪当前 SOTA |
注:GitHub Star 数为动态数据,随时间变化,此处仅给量级;以仓库实时页面为准。
§9 相关资源与引用
§9.1 官方与权威链接
| 资源 | 说明 | 链接 |
|---|---|---|
| 官方仓库 | 数据、评测代码、任务表与基线 | https://github.com/ncbi-nlp/BLUE_Benchmark |
| 数据 release 0.1 | BERT 格式的公开语料 | https://github.com/ncbi-nlp/BLUE_Benchmark/releases/tag/0.1 |
| BlueBERT 仓库 | 预训练权重与微调脚本 | https://github.com/ncbi-nlp/ncbi_bluebert |
| BLUE 论文(ACL Anthology) | BioNLP 2019 正式版 | https://aclanthology.org/W19-5006/ |
| BLUE 论文(arXiv) | 预印本 | https://arxiv.org/abs/1906.05474 |
| BLURB 排行榜 | 后继基准 SOTA 追踪 | https://aka.ms/BLURB |
| ShARe/CLEF 语料页 | PhysioNet(需申请) | https://physionet.org/works/ShAReCLEFeHealth2013/ |
| MedNLI 语料页 | PhysioNet(MIMIC-III 凭证访问) | https://physionet.org/works/MedNLI/ |
| i2b2 NLP DataSets | i2b2-2010 申请入口 | https://www.i2b2.org/NLP/DataSets/ |
| BC5CDR 语料页 | BioCreative V 官方 | https://biocreative.bioinformatics.udel.edu/tasks/biocreative-v/track-3-cdr/ |
| HoC 语料页 | 剑桥大学维护 | https://www.cl.cam.ac.uk/~sb895/HoC.html |
| BIOSSES 语料页 | 官方数据页 | https://tabilab.cmpe.boun.edu.tr/BIOSSES/ |
上表链接中,GitHub 官方仓库与 release 0.1 是使用 BLUE 的起点;四个需申请语料的官方页面是合规获取的唯一通道;BLURB 排行榜用于追踪 BLUE 之后的 SOTA 演进。
§9.2 BibTeX 引用
引用 BLUE 时使用官方指定的主引用(第一条);单独使用某语料时同时引用对应原始论文。
@inproceedings{peng2019transfer,
author = {Yifan Peng and Shankai Yan and Zhiyong Lu},
title = {Transfer Learning in Biomedical Natural Language Processing:
An Evaluation of BERT and ELMo on Ten Benchmarking Datasets},
booktitle = {Proceedings of the 2019 Workshop on Biomedical Natural Language Processing (BioNLP 2019)},
year = {2019},
pages = {58--65},
doi = {10.18653/v1/W19-5006}
}
@inproceedings{devlin2019bert,
author = {Devlin, Jacob and Chang, Ming-Wei and Lee, Kenton and Toutanova, Kristina},
title = {{BERT}: Pre-training of Deep Bidirectional Transformers for Language Understanding},
booktitle = {Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL-HLT)},
year = {2019},
pages = {4171--4186}
}
@inproceedings{peters2018elmo,
author = {Peters, Matthew E. and Neumann, Mark and Iyyer, Mohit and Gardner, Matt and Clark, Christopher and Lee, Kenton and Zettlemoyer, Luke},
title = {Deep Contextualized Word Representations},
booktitle = {Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL-HLT)},
year = {2018},
pages = {2227--2237}
}
@article{li2016bcd5cdr,
author = {Li, Jiao and Sun, Yanxia and Johnson, Robin J. and Sciaky, Daniela and Wei, Chih-Hsuan and Leaman, Robert and Davis, Allan Peter and Mattingly, Carolyn J. and Wiegers, Thomas C. and Lu, Zhiyong},
title = {BioCreative V CDR task corpus: a resource for chemical disease relation extraction},
journal = {Database},
volume = {2016},
year = {2016},
doi = {10.1093/database/baw068}
}
@inproceedings{romanov2018mednli,
author = {Romanov, Alexey and Shivade, Charles},
title = {Lessons from Natural Language Inference in the Clinical Domain},
booktitle = {Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing (EMNLP)},
year = {2018},
pages = {1586--1596}
}
@article{lee2020biobert,
author = {Lee, Jinhyuk and Yoon, Wonseok and Kim, Sungdong and Kim, Donghyun and Kim, Sunkyu and So, Chan Ho and Kang, Jaewoo},
title = {BioBERT: a pre-trained biomedical language representation model for biomedical text mining},
journal = {Bioinformatics},
volume = {36},
number = {4},
pages = {1234--1240},
year = {2020},
doi = {10.1093/bioinformatics/btz682}
}
@article{gu2021blurb,
author = {Gu, Yu and Tinn, Robert and Cheng, Hao and Lucas, Michael and Usuyama, Naoto and Liu, Xiaodong and Naumann, Tristan and Gao, Jianfeng and Poon, Hoifung},
title = {Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing},
journal = {ACM Computing Surveys},
year = {2022},
note = {arXiv:2007.15779}
}
@article{luo2022biogpt,
author = {Luo, Renqian and Xia, Yingce and Qin, Tao and Liu, Tie-Yan},
title = {BioGPT: generative pre-trained transformer for biomedical text generation and mining},
journal = {Briefings in Bioinformatics},
volume = {23},
number = {6},
year = {2022},
doi = {10.1093/bib/bbac409}
}
引用指南:比较基准时引 peng2019transfer;使用 BC5CDR 语料时加引 li2016bcd5cdr;使用 MedNLI 时加引 romanov2018mednli;BLURB 体系对比时另引 Gu et al.(arXiv:2007.15779)。所有数字注明口径(BLUE/BLURB、micro/macro、指标变更日期)。引用次数随时间增长,正式文稿建议引用时重新查询 Semantic Scholar 实时数字并标注"截至"日期。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 用途 | 使用环节 |
|---|---|---|
| 大语言模型(CodeBuddy 快速模型) | 资料检索整理、结构化撰写、代码示例生成 | 本词条全文初稿生产 |
§10.2 AI 参与范围
AI 参与了本词条的事实检索汇总、章节撰写、表格整理与代码示例生成;事实核查(来源比对、数字核验、纠错判定)由编辑流程执行,人工完成最终校验(见 §10.4)。AI 未直接访问任何语料原始数据文件,全部数字来自公开论文、官方仓库与检索到的二手来源,并在 FACTS.md 中逐条登记来源 URL;无法核实的字段一律省略而非推测补全。
§10.3 输入来源列表
- Peng Y, Yan S, Lu Z. Transfer Learning in Biomedical Natural Language Processing: An Evaluation of BERT and ELMo on Ten Benchmarking Datasets. BioNLP@ACL 2019: 58–65. DOI 10.18653/v1/W19-5006.
- Peng Y, Yan S, Lu Z. 同上(arXiv 预印本). arXiv:1906.05474.
- GitHub: ncbi-nlp/BLUE_Benchmark 官方仓库 README 与提交历史(2019–2022).
- GitHub: ncbi-nlp/BLUE_Benchmark LICENSE.txt(Public Domain Notice).
- GitHub: ncbi-nlp/BLUE_Benchmark release 0.1(2019-06-17).
- GitHub: ncbi-nlp/ncbi_bluebert(BlueBERT 权重与代码).
- Li J, et al. BioCreative V CDR task corpus. Database 2016:baw068. DOI 10.1093/database/baw068.
- Soğancıoğlu G, Öztürk H, Özgür A. BIOSSES. Bioinformatics 2017;33(14).
- Wang Y, et al. MedSTS: A Resource for Clinical Semantic Textual Similarity. LREC 2020.
- Suominen H, et al. Overview of the ShARe/CLEF eHealth Evaluation Lab 2013. CLEF 2013.
- Herrero-Zazo M, Segura-Bedmar I, Martínez P, Declerck T. The DDI corpus. Journal of Biomedical Informatics 2013;46(5):914–920.
- Krallinger M, et al. Overview of the BioCreative VI chemical-protein interaction Track. Database 2017.
- Uzuner Ö, South BR, Shen S, DuVall SL. 2010 i2b2/VA challenge on concepts, assertions, and relations in clinical text. JAMIA 2011;18(5):552–556.
- Baker S, et al. Automatic semantic classification of scientific literature according to the hallmarks of cancer. Scientific Reports 2016;6:35790.
- Romanov A, Shivade C. Lessons from Natural Language Inference in the Clinical Domain. EMNLP 2018: 1586–1596.
- Devlin J, et al. BERT. NAACL-HLT 2019: 4171–4186.
- Peters ME, et al. Deep Contextualized Word Representations. NAACL 2018.
- Lee J, et al. BioBERT. Bioinformatics 2020;36(4):1234–1240. DOI 10.1093/bioinformatics/btz682.
- Gu Y, et al. Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing. arXiv:2007.15779.
- Luo R, et al. BioGPT. Briefings in Bioinformatics 2022;23(6):bbac409. DOI 10.1093/bib/bbac409.
- Chen Q, et al. BioSentVec. ICHI 2019(STS 基线引用).
- Hugging Face: EMBO/BLURB Dataset Card(BIOSSES 语料说明).
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 全字段 | 千方病案医学编辑部 | 对照 FACTS.md 与官方来源逐字段核验 | ✅ 已通过/已验证 |
| §1 概览与战略价值 | 千方病案医学编辑部 | 对照论文摘要与 README 核验 | ✅ 已通过/已验证 |
| §2 医学背景(ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 术语学双库核对(ICD-11/SNOMED CT 根概念) | ✅ 已通过/已验证 |
| §3–§5 规格与划分 | 千方病案医学编辑部 | 对照论文 Table 1/Table 2 与 README 核验 | ✅ 已通过/已验证 |
| §6 代码与坑点 | 千方病案医学编辑部 | 代码静态审查 + 坑点逐条对照官方公告 | ✅ 已通过/已验证 |
| §7 质量评估与 DAIMS | 千方病案医学编辑部 | 24 项逐项赋分复核 | ✅ 已通过/已验证 |
| §8–§9 基准、引用与 BibTeX | 千方病案医学编辑部 | DOI 逐条解析核验 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本词条全部章节由 AI 辅助生成初稿,经 §10.4 所列人工校验后发布;其中 §2.1/§2.1b 的医学编码映射与 §6 的代码示例为重点人工复核对象。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mednli — 共享标签:医疗NLP / 医学问答与基准 / 临床文本 / 评测基准
- medcalc-bench — 共享标签:医疗NLP / 医学问答与基准 / 临床文本 / 评测基准
- i2b2-n2c2-nlp — 共享标签:医疗NLP / 医学问答与基准 / 评测基准
- cblue — 共享标签:医疗NLP / 医学问答与基准 / 评测基准
- blurb — 共享标签:医疗NLP / 医学问答与基准 / 评测基准
- lunguage — 共享标签:医疗NLP / 医学问答与基准 / 临床文本
- clicr — 共享标签:医疗NLP / 医学问答与基准 / 临床文本
- bc2gm — 共享标签:医疗NLP / 医学问答与基准 / 评测基准
- rxqa — 共享标签:医疗NLP / 医学问答与基准 / 评测基准
- rexerr — 共享标签:医疗NLP / 临床文本 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
