CORAL (coral) — AI-Ready Wikipedia

UCSF 40 份乳腺癌与胰腺癌进展笔记的专家级深标注肿瘤信息抽取基准——59 实体/23 属性/26 关系 schema、9028 实体/9986 修饰符/5312 关系人工注释,外加 200 份 GPT-4 自动标注扩展与 GPT-4/GPT-3.5-turbo/FLAN-UL2 八任务零样本评测

来源 UCSF Information Commons 去标识肿瘤内科进展笔记(2012–2022,Philter 去标识+日期按患者级随机偏移)+ BRAT standoff 人工深标注(.txt/.ann 成对)+ GPT-4 自动标注 CSV + subject-info.csv 人口学表 + BRAT 配置四件套发布时间: 2026-09-29最后更新: 2026-09-29 阅读 21
CORAL (coral) — AI-Ready Wikipedia

信息速览

数据集名称CORAL (coral) — AI-Ready Wikipedia
数据类型人工标注,文本数据,基准数据
规模40 份专家标注进展笔记(20 乳腺癌 + 20 胰腺癌,UCSF 2012–2022)+ 200 份 GPT-4 自动标注(每病种 100 份);患者级唯一数量未单独披露
接入方式UCSF Information Commons 去标识肿瘤内科进展笔记(2012–2022,Philter 去标识+日期按患者级随机偏移)+ BRAT standoff 人工深标注(.txt/.ann 成对)+ GPT-4 自动标注 CSV + subject-info.csv 人口学表 + BRAT 配置四件套
AI 就绪度

INFOBOX — CORAL 一屏速览

维度 内容
本质 40 份乳腺癌/胰腺癌进展笔记的专家级深标注肿瘤信息抽取基准(+200 份 GPT-4 自动标注扩展)
团队 UCSF(Butte 实验室),通讯 Madhumita Sushil;6 作者
论文 NEJM AI 2024;1(4):AIdbp2300110(2024-03-13 发表);预印本 arXiv:2308.03853
数据 PhysioNet v1.0(2024-02-07 发布),DOI 10.13026/v69y-xa45;UCSF 2012–2022
规模 40 份专家笔记(20 乳腺癌 + 20 胰腺癌)出 9028 实体 + 9986 修饰符 + 5312 关系
Schema 59 实体类型 + 23 属性 + 26 关系;十大概念大类;BRAT standoff 格式
标注者 2 位肿瘤学 fellow 和/或医学生;独立肿瘤学家评审 20 份子集
基准 8 个零样本抽取任务 × 3 模型(GPT-4/GPT-3.5-turbo/FLAN-UL2);BLEU-4/ROUGE-1/EM F1
最佳成绩 GPT-4 平均 BLEU 0.73 / ROUGE 0.72 / EM F1 0.51 / 人工评估准确率 68%
扩展集 200 份 GPT-4 自动标注(每病种 100 份,温度 0、0314 版)——非 gold standard
获取 PhysioNet Credentialed Access:账号 + DUA 1.5.0 + CITI 证书;代码/schema CC BY-NC-SA(GitHub)
库内互链 mimic-iv-note(47)、radgraph(561)、radgraph2(622)、i2b2-n2c2-nlp(14)、phenotype-annotations-mimic(594)

CORAL(Curated Oncology Reports to Advance Language model inference)是一个"用 40 份笔记撬动整个肿瘤信息抽取领域"的数据集工程:UCSF 团队没有去堆十万份弱标注文本,而是让肿瘤学 fellow 在一套 59 实体/23 属性/26 关系的细粒度 schema 上,把 20 份乳腺癌与 20 份胰腺癌进展笔记逐句解剖,产出 9028 个实体、9986 个修饰符、5312 条关系——平均每份笔记约 600 条注释。这份"少而深"的语料随后成为第一块真正意义上的肿瘤学大模型试金石:GPT-4、GPT-3.5-turbo 与 FLAN-UL2 在八个零样本抽取任务上同台,暴露出大模型在"从叙事文本推断首次诊断日期""区分计划用药与假设用药"这类推理任务上的真实水位。

导语读法三则:

  1. 只想下数据:直奔 §6 获取与许可——PhysioNet 受控访问三步走(账号、DUA、CITI 证书),别把"PhysioNet 有页面"误当"可直接下载"。
  2. 关心标注方法:直奔 §2 schema 解剖与 §3 标注方法论——十大概念大类、三种关系、BRAT standoff 格式与跳过规则都在那里。
  3. 做模型评测:直奔 §4 八任务基准——每个任务的抽取对象、三个模型的相对表现与常见错误模式可直接对标。

§0 导读:这个数据集解决什么问题

肿瘤科的临床决策与研究,几乎全部押注在肿瘤医生的进展笔记(progress note)上:跨机构、跨疗程的治疗史,生物标志物与分期,用药及其不良事件,全部以叙事文本形式沉淀。大语言模型(LLM, Large Language Model)在 USMLE 考题、医学问答、放射报告等任务上捷报频传之后,一个空档暴露出来——没有任何公开的、全面标注的肿瘤学笔记数据集可以让研究者严格评测"模型能否读懂进展笔记"。此前的肿瘤信息抽取工作要么局限在 ICD-O3 编码与癌症登记字段,要么只覆盖某个癌种的单一切面(如病理报告分级),没有一个信息表示 schema 能以"疾病无关、笔记类型无关"的方式囊括肿瘤叙事文本的全部临床信息。

CORAL 的回答分三层。第一层是 schema:一套十大概念大类(患者特征、时间信息、位置、检查、检查结果、肿瘤、治疗、操作、临床试验、疾病状态)下再分细粒度子类的表示体系,每个概念还可携带否定、经历者、意图等修饰属性,概念之间用描述性、时序性、高级推理三类关系连接——59 种实体类型、23 种属性、26 种关系,设计目标是对癌种与笔记类型均保持中立。第二层是数据:从 UCSF Information Commons 抽取 2012–2022 年间 40 份去标识进展笔记(乳腺癌、胰腺癌各 20 份,刻意选择临床图景迥异的两个癌种),由肿瘤学 fellow 按上述 schema 深标注,另附 200 份 GPT-4 自动标注笔记作为潜在扩展资源。第三层是基准:把"读笔记"拆成八个明确定义的抽取任务——从列举症状到推断首次诊断日期、从提取肿瘤特征到辨析未来用药——让三个模型在零样本设定下同台,用 BLEU-4、ROUGE-1、EM F1 与专家人工评估四种口径量化。

§0 读法三则:

  1. 这个条目是"schema + 语料 + 基准"三合一:本体是 40 份 BRAT standoff 深标注笔记,衍生品是 200 份 GPT-4 自动标注扩展,副产品是一套可复用的肿瘤信息表示 schema——三者的许可与获取方式各不相同(§6)。
  2. 全文统计数字均出自 PhysioNet 数据页与 NEJM AI 论文;两处名称口径差异(数据集名带 “medical”、论文标题不带)与双 DOI 已在坑 1、坑 2 存照。
  3. 检索时注意:PhysioNet 官方 slug 是 curated-oncology-reports,而学术圈惯称 CORAL——两个名字都指向同一个 DOI(坑 1)。

§1 数据集速览:十问十答

Q1:CORAL 的"40 份"从哪来?
UCSF Information Commons(覆盖 2012–2022 年患者数据的院内研究平台)。抽样条件有三:患者有对应表格化分期数据、病历中有文档化的疾病进展、存在肿瘤内科(medical oncology)笔记。乳腺癌与胰腺癌各 20 份,去标识后发放。

Q2:为什么偏偏选乳腺癌和胰腺癌各 20 份?
刻意选择临床图景最不相似的两个癌种:乳腺癌常可治愈、诊疗高度依赖生物标志物与基因检测、治疗方案横跨放疗-手术-内科三线;胰腺癌死亡率高、以高毒传统化疗为主。一个信息抽取 schema 若能同时吃下这两种叙事,对其他癌种的适配性就有初步证据。

Q3:一份笔记里标了什么?
HPI(History of Present Illness,现病史)与 A&P(Assessment and Plan,评估与计划)两个叙事节的全部内容,按 schema 标注为实体(如"ER 阳性"是 Biomarker 实体)、修饰符(如否定、经历者)与关系(如"阿霉素→导致→不良事件")。放射科与病理科报告的直接 copy-forward 段不标,跳过处会显式标记并注明原因。

Q4:谁标的,质量如何保证?
2 位肿瘤学 fellow 和/或 1 位医学生按统一 schema 标注;最终 40 份共出 9028 实体 + 9986 修饰符 + 5312 关系。基准结果另由 1 位与标注无关的独立肿瘤学家在 20 份笔记子集上人工复核。去标识流程经认证工具 Philter 处理并发布前由外部专家验证。

Q5:那 200 份是什么?
从同一去标识库按 race/ethnicity 分层再抽 200 份(每病种 100 份),用 GPT-4(0314 版、温度 0)以与基准评测完全相同的 prompts 自动标注。注意:这是"潜在扩展资源",不是 gold standard——没有人工修正,且该子集的去标识错误未回填(坑 6)。

Q6:八个评测任务是什么?
症状表现、放射学检查、基因/基因组检测、首次癌症诊断日期(推理)、肿瘤特征、已施行的操作、处方用药、未来用药(推理)。前六项偏"照文提取",后两项明确要求模型推理——这正是 GPT-4 与其他模型拉开差距的地方(§4.4)。

Q7:三个模型成绩如何?
GPT-4 全面领先:平均 BLEU 0.73、ROUGE 0.72、EM F1 0.51,人工评估子集平均准确率 68%。GPT-3.5-turbo 与开源 FLAN-UL2 明显落后。常见错误是响应不全(漏信息)与编造笔记里没有的细节(幻觉)。

Q8:怎么获取?
PhysioNet 受控访问(Credentialed Access):注册账号 → 上传 CITI “Data or Specimens Only Research” 培训证书 → 签署 PhysioNet Credentialed Health Data Use Agreement 1.5.0,之后可下载。代码与标注 schema 在 GitHub 以 CC BY-NC-SA 公开。想用 OpenAI/Google 等专有模型跑 CORAL?必须放在 HIPAA 合规框架里(坑 7)。

Q9:license 是什么?
数据文件:PhysioNet Credentialed Health Data License 1.5.0(非商业、相同方式共享口径);代码与 schema:CC BY-NC-SA。两者设计上互相兼容,但都不是可以随便商用的宽松许可。

Q10:40 份是不是太少了?
这是 CORAL 最常被误读的地方。它的定位是专家级评测基准(benchmark)而非训练语料:40 份笔记承载了 24326 条人工注释、覆盖 59 种实体类型的全谱系,这种标注密度(平均约 600 条/份)在大规模数据集上经济上不可行。把 CORAL 当训练集用是错位,当评测金标准用恰得其所(坑 4)。

§2 数据 Schema 解剖:59 个实体、23 个属性、26 种关系从哪里来

2.1 设计哲学:三个「不可知」

CORAL 的标注 schema(annotation schema)在论文中被反复强调为三个维度上的「不可知」(agnostic)设计:

  • 问题不可知(problem-agnostic):不预设某一种具体研究问题(如「只抽化疗方案」),而是把肿瘤临床笔记里可能出现的全部信息类型都纳入表示范围;
  • 笔记类型不可知(note type-agnostic):不绑定某一种笔记体裁(如「只处理病理报告」),面向内科肿瘤进展笔记这一整体;
  • 病种不可知(disease-agnostic):schema 本身不区分乳腺癌与胰腺癌,同一套概念体系适用于两类患者(数据层则刻意选了两个差异极大的病种做对照,见 §3.1)。

这一设计路线的直接动机是:此前的肿瘤信息抽取研究要么局限于 ICD-O-3 编码或癌症登记(cancer registry)字段,要么只针对某个单一问题(如病理报告解析、RECIST 疗效评语料)。论文作者指出,没有任何一种既有信息表示 schema 能以「问题-笔记类型-病种」三重不可知的方式覆盖临床笔记中的肿瘤学信息全貌——CORAL 的 schema 就是为了填补这个空档而设计的。

值得注意的是,schema 的语义学基础带有框架语义学(frame semantics)色彩:PhysioNet 页面致谢部分明确感谢了 Prof. Kirk Roberts 关于「基于框架语义学的癌症笔记标注」(frame semantics-based annotations of cancer notes)的讨论,以及 Prof. Artuur Leeuwenberg 关于时间关系标注(temporal relation annotation)的讨论。换言之,CORAL 的概念-属性-关系三层结构并非临时拼凑,而是有意借鉴了 FrameNet 式的「框架槽位」思想——每个实体类型像一个框架,属性是框架的槽位,关系则是框架之间的连接。同样在 LREC 2018 上,Roberts 等人曾发布过面向癌症临床叙事的 FrameNet schema(论文参考文献 [19]),CORAL 可视为该思路在 LLM 时代向「全谱系肿瘤进展笔记」的扩展。

2.2 十大宽类别(broad categories)

schema 的顶层由十个宽类别构成,PhysioNet 页面 Methods 段原文列举如下(英文原样,括号内为中文释义与典型内容举例):

# 宽类别(原文) 中文释义 典型信息举例
1 patient characteristics 患者特征 年龄、性别、家族史、合并症背景
2 temporal information 时间信息 事件日期、诊断时点、治疗起止时间
3 location-related information 部位相关信息 原发灶部位、转移部位、淋巴结分区
4 test-related information 检查相关信息 检查名称、检查目的、送检机构
5 test results-related information 检查结果相关信息 影像所见、实验室数值、组学结果
6 tumor-related information 肿瘤相关信息 组织学、分级、TNM 分期、生物标志物
7 treatment-related information 治疗相关信息 化疗/内分泌/靶向药物、放疗方案
8 procedure-related information 操作相关信息 手术、穿刺活检、植入港等操作
9 clinical trial 临床试验 试验名称、入组状态、试验相关治疗
10 disease state 疾病状态 缓解、进展、复发、稳定等状态判定

每个宽类别向下继续细分出多个细粒度子类(fine-grained subcategories),子类下还可以带子类专属细节。论文给出的一个具体例子是:「肿瘤检查」(tumor test)这一概念下包含放射学检查(radiology test)、基因组学检查(genomic test)和诊断性实验室检查(diagnostic lab test)三个子类。

2.3 三种注释模态:实体、属性、关系

schema 通过三种注释模态(annotation modalities)落地:

  1. 实体(entities):具有特定类型的短语(phrase of a specific type),例如把「eribulin」标为药物实体、「2021-03-04」标为日期实体;
  2. 属性/修饰符(attributes or modifiers):附着在实体上的修饰信息,例如某个症状实体上的「否认」(negation)标记、某药物实体上的「停药」状态;
  3. 关系(relations):实体对之间的连接(between entity pairs),用来表达实体本身承载不了的结构化语义。

三者层层递进:实体回答「有什么」,属性回答「这个实体处于什么状态」,关系回答「实体之间怎么关联」。这个三层结构同时也是 BRAT standoff 标注格式天然支持的三种对象(见 §3.6)。

2.4 三类关系:描述、时间、高级

26 种关系按语义分成三组:

  • 描述性关系(descriptive):把一个实体与其描述内容连起来。论文原例:把生物标志物名称与其检测结果关联(如 ER 阳性中的「ER」与「阳性」);
  • 时间性关系(temporal):标注事件发生时间。论文原例:指示某项检查是何时进行的;
  • 高级关系(advanced):需要推理或因果判断的关系。论文原例:把某个治疗与其引起的不良事件(adverse event)关联,或把处方与其用药理由关联。

「高级关系」是 CORAL 区别于一般 NER 数据集的关键:它要求标注者(以及被评测的 LLM)做出跨句因果推断——比如从「患者服用卡培他滨后出现手足综合征」中抽出「卡培他滨—引起—手足综合征」这条边。这也解释了为什么 GPT-4 在后续评测中「推断癌症所致症状」「推断未来用药考虑」两类任务上表现突出、而逐字精确匹配分数偏低(见 §4)。

2.5 硬数字:59 实体、23 属性、26 关系与注释密度

整个 schema 的规模由三个数字刻画(PhysioNet 页面 Abstract 与 Data Description 两处一致):

  • 59 个唯一实体类型(59 unique entities)
  • 23 个属性(23 attributes)
  • 26 种关系(26 relations)

40 份专家标注笔记上的注释总量为三项之和:9028(实体)+ 9986(修饰符/属性)+ 5312(关系)= 24326 条人工注释。按 40 份计,平均每份笔记约 608 条注释。作为对照,通用临床 NER 语料(如 i2b2/SAIC 系列)的单篇标注密度通常在几十到百余条量级——CORAL 的密度高出一个数量级,这正是「专家级深标注」路线的直接体现,也再次说明 40 份的体量选择是密度换规模的刻意权衡(坑 4)。

注意术语口径:数据页正文用「modifiers」(修饰符)计数 9986,而 Methods 段的模态表述用「attributes」(属性);两者指的是同一层对象(附着于实体的修饰信息),23 是 schema 中属性类型的种数,9986 是 40 份笔记中属性实例的条数——类型数与实例数、两套用词,读数据时不要混淆(双口径已在 FACTS.md 第 9 节存照)。

2.6 语义修饰:否认、经历者、意图

论文特别指出 schema 为概念纳入了三类「细微差别」(nuances):

  • 否认(negation):文本提到某症状但明确否认其存在(「无恶心呕吐」),标注为否认而非阳性;
  • 经历者(experiencer):区分症状的经历者是患者本人还是家属(「其母患乳腺癌」中的乳腺癌病史经历者不是患者);
  • 意图(intent):某项检查的目的或某条计划的性质(是已执行、拟执行还是假设性讨论)。

这三类修饰在 LLM 信息抽取里恰是易错点:零样本模型很容易把「否认的症状」当真、把「家属病史」算到患者头上。「意图」维度则直接对应任务 8(区分「计划用药」与「假设性用药考虑」),见 §4。

§3 标注方法论与数据构建:40 份笔记是怎样炼成的

3.1 病种对照设计:为什么是乳腺癌 + 胰腺癌

CORAL 没有选一个病种做深,而是刻意选了两个互补性极强的病种。论文 Methods 段给出的理由原文要点:

  • 乳腺癌(breast cancer):常可治愈(frequently curable);高度依赖生物标志物与基因检测;治疗计划整合放疗、外科与内科肿瘤学——代表「多学科、标志物驱动、长程管理」的信息复杂性;
  • 胰腺癌(pancreatic cancer):死亡率高;依赖高毒性的传统化疗方案(highly toxic traditional chemotherapy regimens)——代表「药物密集、预后差、毒性管理」的信息复杂性。

这一设计的评测学含义是:在 CORAL 上表现好的抽取系统,必须同时驾驭「检查-标志物-多学科治疗史」与「密集化疗-毒性-不良事件」两种截然不同的信息形态,无法靠病种特化的捷径得高分。

3.2 抽样来源与去标识

专家标注集的 40 份笔记来自 UCSF Information Commons(加州大学旧金山分校信息共享库),覆盖 2012–2022 年间的患者数据。抽样与去标识流程:

  • 去标识工具:Philter(UCSF 使用的临床文本去标识软件);
  • 日期处理:笔记内所有日期按患者级随机偏移量(random, patient-level offset)整体平移,保持相对时间关系不变而绝对日期不可回溯;
  • 纳入标准(三条件同时满足):有对应的表格化分期数据(tabular staging data);有记录在案的疾病进展(documented disease progression);有内科肿瘤学笔记(associated medical oncology note)。

疾病进展优先的抽样策略决定了语料的文体:这些笔记天然包含「既往治疗—当前状态—下一步计划」的完整叙事弧,正是任务 4(推断初次诊断时间)、任务 8(推断未来用药)这类需要跨时区推理的任务所依赖的土壤。

3.3 去标识误差回填:IRB 双号下的「逆脱敏」

自动化去标识并不完美。CORAL 的一个独特工序是把误伤的临床信息手工补回:部分基因符号(gene symbols)、临床试验名称(clinical trial names)与癌症分期(cancer stages)被自动处理错误地删减(inappropriately redacted),团队在 UCSF IRB #18-25163 与 #21-35084 两个批准号下将它们手工回填(manually added back)至临床笔记。

Ethics 段补充了更多细节:被回填的对象包括基因名称、临床试验名称与淋巴结分数(lymph node fractions)的删减错误;回填工作由 Jennifer Creasman、Alysa Gonzales、Dalia Martinez、Lakshmi Radhakrishnan 四人协助完成(致谢段点名);初始数据集凭认证去标识即构成非人体受试者研究(non-human subjects research)数据;最终数据集在发布前由一名外部专家评审员验证其去标识状态(validated as de-identified by an external expert reviewer)。

这道工序在临床 NLP 数据集中相当罕见——多数数据集选择容忍去标识误差,而 CORAL 选择修复它,因为被误删的基因符号与试验名恰恰是任务 3(基因/基因组检测)和任务 5(肿瘤特征)的评测要点。(注意:这一回填只发生在 40 份专家标注子集;200 份 GPT-4 扩展集未做回填,见坑 6。)

3.4 人工标注流程:谁标、标什么、跳过什么

标注者构成:40 份笔记由「两名肿瘤学专科医师(oncology fellows)中的一人和/或一名医学生(medicine student)」完成标注——即每份笔记至少一位肿瘤专科医师把关,医学生参与协作。

标注范围与跳过规则:笔记中除放射与病理报告的直接复制粘贴段(direct copy-forwards of radiology and pathology reports)之外的所有叙事段落均按 schema 标注。被跳过的段落在文本中原位标记,并注明跳过原因(marked as such within text, additionally indicating the reason for skipping)。

这一跳过规则本身就是一条重要的使用须知(坑 3):CORAL 的 .txt 文本里存在「未标注但不等于不重要」的段落——它们是被刻意排除的植入式报告体,旁边带有跳过标记与理由。直接拿整份文本去和 24326 条注释对齐做自动评测、而不处理跳过标记,会把「未标注段」误当「漏标段」,稀释 EM-F1 的分母口径。正确做法是仿照论文的评测设置(只对任务相关的叙事段落发问,见 §4.1)。

标注工具为 BRAT(brat rapid annotation tool),采用 standoff 格式:每份文档一对文件,.txt 存笔记原文,.ann 存标注——每行一条注释,含注释 ID、概念类型、文本偏移量(text offsets)与注释字符串本身。40 份笔记最终形成 40 对 .txt/.ann 文件,加上目录级元数据,构成 coral/annotated/ 主体(目录树详见 §3.6)。

3.5 GPT-4 自动标注扩展集:200 份「银标准」

除了 40 份金标准,CORAL 还附带了 200 份由 GPT-4 自动标注的临床笔记,设计要点:

  • 来源与规模:同样取自 UCSF Information Commons 去标识库,乳腺癌与胰腺癌各 100 份,与 40 份专家集完全不相交(These 200 notes are separate from the 40 notes that were annotated manually);
  • 分层抽样:按 race/ethnicity 分层,各人种/族裔样本数取「均匀分布病例数」与「UCSF 库内该族裔最大可得数」两者中的较小者——刻意制造比专家集更多样的人群构成;
  • 标注引擎:GPT-4,版本 0314,温度(temperature)0,使用与基准评测完全相同的 prompts(the same prompts as described in the manuscript and those used to benchmark the models);
  • 标注范围:六类信息——患者症状(patient symptoms)、肿瘤特征(tumor characteristics)、放射学检查相关信息(radiology test-related information)、操作相关信息(procedure-related information)、基因检测相关信息(genetic test-related information)、药物相关信息(medication-related information);
  • 关键限制:该子集的去标识误差未做手工回填(Redaction errors were not manually corrected in this subset),且没有任何人工质量核对。

对这 200 份的定位,论文的措辞是「potentially be used to expand upon the provided manual annotations」——潜在的扩展资源,而非第二个金标准(坑 6)。合理的用法是:把它当 GPT-4 自动结构化的产出物用于弱监督、预标注或管线调试;把它当与 40 份等价的 gold standard 用则是错误。

3.6 目录结构与文件格式全景

PhysioNet 发布包的 coral/ 目录结构如下(依据 Data Description 段原文整理):

coral/
├── annotated/                     # 40 份专家深标注(gold standard)
│   ├── breastca/                  # 20 份乳腺癌笔记
│   │   ├── *.txt                  #   笔记原文
│   │   └── *.ann                  #   BRAT standoff 标注(每行一条)
│   ├── pdac/                      # 20 份胰腺癌笔记
│   │   ├── *.txt / *.ann          #   同上
│   └── subject-info.csv           # 40 份的人口学信息,coral_idx 关联键
└── unannotated/                   # 200 份 GPT-4 自动标注(非金标准)
    ├── data/
    │   ├── breastca_unannotated.csv   # 100 份乳腺癌:人口学 + 笔记文本
    │   └── pdac_unannotated.csv       # 100 份胰腺癌:同上
    └── gpt4_out/
        ├── breastca_gpt4              # GPT-4 输出,coral_idx 对应
        └── pdac_gpt4                  # GPT-4 输出,coral_idx 对应

几个格式要点:

  • 关联键:coral_idx 即文件名去扩展名(file name without the extension),贯穿 .txt、.ann、subject-info.csv 与 gpt4_out 的全部对应关系;
  • .ann 行结构:注释 ID、概念类型、文本偏移量、注释字符串,四段式,一行一条,格式规范以 BRAT 官方文档为准;
  • 配置文件四件套:annotation.conf(新开发的标注 schema 以 BRAT 格式呈现——想最快读懂 59/23/26 的完整清单,这个文件就是权威源头)、tools.conf(辅助人工标注的工具描述,例如查询 Google 的能力)、kb_shortcuts.conf(标注键盘快捷键)、visual.conf(不同实体类型的颜色编码)。四者均为自由文本文件,需配合 BRAT 软件解析;
  • 命名细节(坑 5):unannotated 下的四个数据文件命名口径不完全一致——data/ 下两个文件带 .csv 扩展名,而 gpt4_out/ 下两个文件(breastca_gpt4、pdac_gpt4)在数据页描述中未带扩展名后缀;写读取脚本时不要用统一 glob 模式假设扩展名,应以实际下载包内文件名为准。

可视化使用路径(Usage Notes 段):安装 BRAT 的 Python 包 → 把下载内容复制进 BRAT 的 data 目录(默认位于 BRAT 主目录下的 data/)→ 运行 python standalone.py → 加载数据集即可获得可视化标注界面。读取 BRAT 文件与数据处理的源代码在配套 GitHub 仓库(见 §3.7)。

3.7 配套代码仓库与双仓分工

CORAL 在 GitHub 上的配套仓库为 MadhumitaSushil/OncLLMExtraction(arXiv 论文页与 PhysioNet Usage Notes 互指)。分工口径:

  • PhysioNet(curated-oncology-reports):数据本体——40 份 BRAT 标注 + 200 份自动标注 + schema 配置文件,受控访问(见 §6);
  • GitHub(OncLLMExtraction):源代码——读取 BRAT 文件的代码、数据处理管线、以及全部任务 prompts(The details of prompts and the source code are available in the accompanying Github repository)。

想复现论文的零样本评测,两个资源缺一不可:拿数据要在 PhysioNet 签协议,拿 prompts 与评测脚本要去 GitHub。这个双仓结构在引用时也要注意——PhysioNet 页面要求同时引用数据 DOI 与原始论文(arXiv:2308.03853 / NEJM AI DOI: 10.1056/AIdbp2300110),见坑 2 与 §6 的引用规范。

3.8 质量保证链小结

CORAL 的质量保证由五道工序串联:

  1. 认证去标识:Philter 软件处理 + 患者级日期平移,构成非人体受试者研究数据;
  2. 误差回填:IRB 双号下手工回填基因符号、试验名、分期等误删信息;
  3. 专家标注:肿瘤专科医师为主体的双人池标注,跳过段落显式标记;
  4. 外部验证:发布前由外部专家评审员验证去标识状态;
  5. 受控发布:PhysioNet Credentialed Access 门槛(CITI 证书 + 使用协议),见 §6。

这条链上的每一环在 PhysioNet 页面都有明确文字对应,属于「可追溯的质量声明」。相比之下,200 份 GPT-4 扩展集只经历了工序 1(且未做工序 2),两个子集的质量等级必须在任何下游使用中区别对待。

2.7 schema 粒度的设计权衡:为什么是 59 而不是 20 或 200

59 个实体类型是一个值得玩味的中位数选择。理解它为什么「恰好是 59」,要看清 schema 粒度的三个失败方向:

  • 过粗(如 20 个类型以内):无法区分「基因检测」与「影像检查」的槽位差异,任务 3 与任务 2 的评测会塌缩成同一道题;i2b2 时代的单任务 schema(如仅药物+剂量+不良事件三件套)在 CORAL 的八任务面前远远不够用;
  • 过细(如 UMLS 超级词表的十几万概念):标注一致性崩溃——两位肿瘤专科医师无法在数百个类型间稳定达成共识,人工评测的「对/错」判定也随之失去意义;
  • 恰当中间层:59 个实体类型恰好覆盖十大宽类别的全部任务需求(八任务的每个槽位都能落到至少一个类型),同时保持人工可管理的一致性;23 个属性集中处理状态维度(否认/经历者/意图/连续性等),26 种关系用三类语义组织跨实体的结构。

这个粒度还决定了标注成本结构的可行性:24326 条注释 ÷ 40 份 = 每份约 608 条,由「一名 fellow + 一名医学生」的小团队在合理周期内完成。若类型数翻倍,注释密度与歧义裁决成本大约同步翻倍——40 份的规模与 59 类的粒度是同一枚硬币的两面(坑 4 的另一层含义:不是「少标了几份」而是「粒度换来了密度」)。

获取完整清单的唯一权威途径是随数据发布的 annotation.conf(BRAT 格式):论文与数据页只给出类别框架与计数,不逐条罗列 59 个实体名。对 schema 研究者,这个文件比论文正文更值得精读——它包含类型间允许的属性附着与关系连接定义(即哪些类型可以带哪些修饰、连哪些边),是任何复刻或扩展 schema 的起点。

3.9 两病种的临床信息形态对照

论文用一段话给出了病种选择的理由(§3.1),下面把这段理由展开成可操作的抽取难度对照(标注维度为编译性整理,结论锚定论文原文;具体临床细节为领域背景补充,不承载论文声明):

维度 乳腺癌 胰腺癌 对信息抽取的含义
预后轨迹 常可治愈,长程管理 高死亡率,快速进展 乳腺癌笔记的治疗史跨度更长、线数更多;胰腺癌笔记的状态变化更密集
治疗支柱 手术+放疗+内分泌+靶向+化疗多学科并用 以高毒性传统化疗方案为主 乳腺癌考验多模态实体覆盖(放疗/手术实体);胰腺癌考验化疗药-毒性因果链抽取
标志物生态 ER/PR/HER2、BRCA、基因评分等检测驱动 标志物检测相对少,形态学与分期驱动 任务 3(基因检测)在乳腺癌子集信息密度显著更高
毒性叙事 内分泌/靶向毒性相对温和、慢速 化疗毒性剧烈、高频(血液学/消化道/神经毒性) 任务 7 的不良事件归因在胰腺癌子集更密集
意向性语言 维持治疗、长期随访计划多 线索更替、二线准备讨论多 任务 8 的 planned/hypothetical 判别在两个病种的措辞习惯不同

对评测设计的整体含义:一个模型若只在乳腺癌子集上好(或只在胰腺癌子集上好),说明它学到的不是「肿瘤信息抽取」而是「某类文档的表面模式」——这正是双病种对照设计的存在意义,也是任何只报全量平均分而不分病种报告的评测应被追问的原因(论文摘要报的是全量平均,分病种分数在正式版表格中,属待核项)。

3.10 「非人体受试者研究」认定与合规栈

CORAL 的伦理合规是一个三层栈,值得医疗 AI 数据集建设者完整抄写:

  1. 底层:Philter 认证去标识 + 患者级日期平移 → 初始数据集被认定为非人体受试者研究(non-human subjects research)数据——这是美国 Common Rule 框架下的关键身份认定,决定了后续操作的合规性质;
  2. 中层:对去标识误差的逆操作(回填基因符号/试验名/淋巴结分数)涉及重新接触可识别信息,因此需要 IRB 授权——#18-25163 与 #21-35084 两个批准号覆盖了这道工序;
  3. 顶层:发布前外部专家验证 + PhysioNet 受控访问(CITI 证书 + DUA 1.5.0)——把「已去标识」的声明转化为「可问责的分发约束」。

三层栈的每一层都在 PhysioNet 页面有对应段落(Ethics 与 Access 区),可追溯性本身就是这套合规栈的一部分。

3.11 从 CORAL 学标注项目管理:一份可迁移清单

把 CORAL 的标注流程拆开,能提炼出一套与具体领域无关的「专家深标注项目管理」清单。任何想复刻这类数据集的团队(不限肿瘤、不限英文)可以逐项对照:

阶段 0:schema 设计期

  1. 从「既有 schema 为什么不够」写起(CORAL:ICD-O3/登记字段/单任务 schema 三条路线的不足,§5.2)——schema 的合法性论证先于 schema 本身;
  2. 借力成熟语义框架而不是从零发明(CORAL:FrameNet 式框架-槽位-关系结构,§2.1);
  3. 用「最复杂文档」校准粒度:59 类是在「覆盖最杂的进展笔记」与「标注者可保持一致」之间压出来的(§2.7);
  4. schema 以机器可读配置随数据发布(annotation.conf),不要只活在论文 PDF 里。

阶段 1:抽样期

  1. 抽样标准写成可判定的条件清单(CORAL 三条件:有表格化分期 / 有进展记录 / 有内科肿瘤笔记,§3.2);
  2. 主动引入对照维度(CORAL:两个信息形态相反的病种,§3.1);
  3. 扩展子集单独分层抽样(200 份按 race/ethnicity 分层,§3.5)——但与金标准的关系必须显式声明。

阶段 2:标注执行期

  1. 明确「谁有资格标」(CORAL:fellow 为主、医学生协作,§3.4);
  2. 「不标什么」与「标什么」同样显式(CORAL:复制粘贴段跳过 + 原位标记跳过原因,坑 3);
  3. 标注工具选 standoff 格式生态(BRAT),配置文件四件套入包(§3.6)。

阶段 3:质量与合规期

  1. 去标识误差不只容忍,可以修复——修复动作走 IRB(CORAL:回填 + 双批准号,§3.3);
  2. 发布前引入团队外验证(外部专家验证去标识,§3.3);
  3. 人工评测与标注团队隔离(独立肿瘤学家评 68% 那一组,§4.4);
  4. 银标准(自动标注扩展集)与金标准物理分离目录(annotated/ vs unannotated/,§3.6)——目录结构即质量声明。

阶段 4:发布期

  1. 版本化 DOI + RRID + 引用规范三条齐备(§6.3/§6.4);
  2. Usage Notes 写到「能照着跑」的粒度(CORAL 甚至写了 BRAT 可视化的启动命令,§3.6);
  3. 配套代码仓与数据仓双轨、互相指路(§3.7)。

这 17 条全部能在 PhysioNet 页面找到对应文字——CORAL 的流程透明度本身就是它对社区的方法论贡献之一。

§4 八任务基准:三模型零样本评测的设计与结果

4.1 评测动机与总体设计

CORAL 的第三个建设目标(前两个是 schema 与数据集)是为近年 LLM 的肿瘤信息抽取能力建立零样本基线(benchmarking the baseline performance of the recent LLMs for zero-shot extraction of oncology information)。评测设计的关键决策:

  • 三个被测模型:GPT-4、GPT-3.5-turbo、FLAN-UL2。前两者代表闭源商用前沿,后者代表开源可自部署的基础模型(openly-available foundation model),在内部计算环境(internal computing environment)实现——三种获取通道覆盖了医疗机构的现实选项;
  • 零样本(zero-shot):不进行任何任务特定训练(without any task-specific training),直接用任务指令 + 笔记段落发问。这意味着评测测的是模型的原生指令遵循与临床推理能力,而非微调后性能;
  • 两段叙事输入:抽取对象是进展笔记的两个叙事章节(two narrative sections of clinical progress notes),与 §3.4 的跳过规则一致——不用整份笔记,不用被跳过的复制粘贴段;
  • 输入格式:{system role description} {note section text, prompt}——系统角色描述 + 笔记章节文本 + 任务 prompt 的三段拼接;
  • 解码设置:所有模型温度(temperature)设为 0,保证输出确定性可复现;GPT-4 用 0314 版本,GPT-3.5-turbo 用 0613 版本,API 版本 2023-05-15,均经 HIPAA 合规的 Microsoft Azure OpenAI studio 与 API 调用——论文强调这一通道不会向 Microsoft 或 OpenAI 永久传输或存储任何数据(no data was permanently transferred to or stored by Microsoft or OpenAI)。

4.2 八个任务逐项解析

八个信息抽取任务(论文 Methods 段编号原文,中文为编译)构成了从「逐字抽取」到「跨段推理」的能力阶梯:

任务 1 — 症状全谱抽取:识别患者经历的全部症状、癌症确诊时点已存在的症状、以及由所诊断癌症引起的症状,且每个症状关联其发生时间(datetime)。
这是三合一任务:普通症状列表(逐字可抽)、诊断时症状(时间锚定)、癌症所致症状(因果归因)。第三子类要求模型判断「症状是癌症造成的还是合并症造成的」,是典型的 advanced relation 推理。

任务 2 — 放射学检查四元组:列出患者接受的所有放射学检查,每项配对检查时间、检查部位(site)、检查的医学指征(medical indication)与检查结果(result)。
一条完整的「检查事件」记录需要同时抽出四个槽位并正确配对——输出结构越复杂,自由文本生成的配对错误风险越高。

任务 3 — 基因/基因组检测:列出患者接受的所有基因与基因组学检测,配对相应时间与结果。
乳腺癌场景下这是高频信息(ER/PR/HER2、BRCA1/2、21 基因评分等),但检测结果常以缩写与数值混合形式散落——也是去标识误删的的重灾区(见 §3.3,这正是回填工序存在的理由)。

任务 4 — 初次诊断时间推断:为患者推断(infer)癌症初次诊断的日期。
「推断」而非「抽取」:诊断日期往往不逐字出现,需要从影像日期、病理日期、治疗起点等间接线索推算。这是八个任务中最接近「单步推理」的一个。

任务 5 — 肿瘤特征分组抽取:抽取肿瘤特征,分组为:生物标志物(biomarkers)、组织学(histology)、分期(stage,含 TNM 与数字分期)、分级(grade)、转移(metastasis,附转移部位与确诊转移的操作),全部配对时间。
八个任务中槽位最多、嵌套最深的一个——「转移」还要连带「在哪儿转移的」与「怎么确认的(哪个操作诊断的)」两个从属槽位。

任务 6 — 介入性操作:识别患者接受的所有介入性操作(interventional procedures),配对时间、部位、医学指征与结局(outcome)。
与任务 2 同构,但对象从检查换成手术/穿刺/植入等操作,「结局」槽位比「结果」更依赖叙述性推断。

任务 7 — 用药全史:列出患者的所有处方药物,关联开始时间、结束时间、处方理由、连续性状态(continuity status:继续中/已完成/提前停药)以及归因于该药物的任何假设性或已确认的不良事件。
这是对 40 份笔记中 5312 条关系里 advanced relation(治疗—不良事件因果边、治疗—理由边)的最集中考验;「连续性状态」要求模型从「plan to continue」「discontinued due to neuropathy」这类措辞中判读状态机。

任务 8 — 未来用药推断:推断计划给药(planned for administration)或作为潜在选项讨论的药物(discussed as a potential option),配对其性质(计划 planned 或假设 hypothetical)与笔记中讨论的潜在不良事件。
纯推理任务:答案不在任何单句里,而散布在 assessment/plan 段的意向性语言(「will start」「consider adding」「if progression, switch to」)中。区别「计划」与「假设」直接对应 §2.6 的「意图」(intent)修饰维度。

八任务与 schema 三类关系的映射一目了然:任务 1/7/8 重度依赖 advanced relation(因果与意向),任务 2/3/5/6 重度依赖 descriptive relation(实体-结果-指征配对)+ temporal relation(时间锚定),任务 4 几乎全是 temporal 推理。

4.3 评测指标:为什么用 BLEU/ROUGE/EM-F1 三件套

LLM 的输出是自由文本而非标准化的结构化标注(free-text outputs to represent entity mentions and their relations),因此论文没有采用传统 IE 的 span-level precision/recall 主口径,而是用了文本对比较(comparing pairs of text)的指标组合:

  • BLEU-4(带平滑,with smoothing):机器翻译经典指标,4-gram 精确率几何平均,衡量输出与参考的 n-gram 重叠紧密度;
  • ROUGE-1:单词级(unigram)召回导向重叠,衡量关键信息点是否被覆盖;
  • 精确匹配 F1(exact match F1-score,EM-F1):模型输出与标注短语之间的逐字一致F1,专门衡量「能否生成词法上完全相同的输出」(lexically-identical outputs)。

三者的信息互补:BLEU-4 严于词序与搭配、ROUGE-1 宽于信息点覆盖、EM-F1 最严格(一字不差)。读结果时要三线同看——EM-F1 低不代表语义错(可能只是措辞不同),BLEU/ROUGE 高也不保证结构化槽位正确(可能流畅但空洞)。

4.4 人工评测协议:独立肿瘤学家与 68% 准确率

自动指标之外,对表现最好的模型(GPT-4)追加了一层人工评测:

  • 评测人:一名独立肿瘤学家(independent oncologist),非标注团队;
  • 评测范围:随机抽取一半笔记——乳腺癌 10 份 + 胰腺癌 10 份;
  • 评测对象:11 个实体抽取任务(11 entity extraction tasks,全部任务中排除 grade、TNM stage、summary stage 三项的抽取——即 14 个候选实体任务中取 11 个可评的)与 20 个关系抽取任务(20 relation extraction tasks);
  • 结果:GPT-4 平均准确率(average accuracy)68%。

排除三个分期/分级类任务的原因论文未展开(遗留疑点之一,见 FACTS.md 第 9 节),可推测的理由包括:分期表述的异质性(「T3N1M0」「stage III」「stage 3B」混用)使「对/错」二值判定歧义率高,人工裁决成本不成比例。

4.5 头对头结果:GPT-4 全面领先

三模型在 40 份专家标注笔记上的总体成绩(PhysioNet 页面 Abstract 与论文一致,四个平均数为全文仅有的总体分数口径):

指标 GPT-4 说明
平均 BLEU-4 0.73 GPT-4 exhibited overall best performance
平均 ROUGE-1 0.72 同上
平均 EM-F1 0.51 同上
平均准确率(人工评测) 68% 独立肿瘤学家评 20 份,11 实体任务 + 20 关系任务

GPT-3.5-turbo 与 FLAN-UL2 的分项分数表在论文正文表格中(PhysioNet 数据页未收录),属遗留待核项(需访问 NEJM AI 全文);数据页与摘要明确的是 GPT-4「总体最佳」(overall best performance)的结论性排序。

分数的定性解读(Abstract 原文要点):

  • 强项:GPT-4 在肿瘤特征(tumor characteristics)与药物(medication)抽取上 proficient;并在推断癌症所致症状(inferring symptoms due to cancer)与未来用药考虑(considerations of future medications)上表现 superior——恰好是两个纯推理任务,说明大模型的相对优势不在逐字匹配而在临床推断;
  • BLEU 0.73 / ROUGE 0.72 vs EM-F1 0.51 的落差:约 0.2 的差距是自由文本生成的典型指纹——模型能覆盖大部分信息点(ROUGE 高),但措辞、格式、缩写展开方式与人工标注不一致(EM-F1 腰斩)。对想用 CORAL 做自动评测的使用者,这组数字本身就是「必须配套语义级比对器或 LLM-as-judge」的论据;
  • EM-F1 0.51 的绝对水平:零样本、无微调、跨两个差异极大的病种、59 类实体全谱系——在这个难度设定下过半逐字命中并不低,但距离临床可直接采信仍有明确差距。

4.6 错误模式:两类系统性失败

论文对 GPT-4 归纳了两大类常见错误(Common errors):

  1. 部分响应与信息缺失(partial responses with missing information):输出只覆盖了参考答案的一部分——漏槽位、漏配对、漏时间锚。对任务 5 这种多槽位任务尤其致命,漏一个「转移部位」即整条记录降级;
  2. 幻觉(hallucinations with note-specific information):生成笔记中不存在的信息——把相似患者常见的处理方式、常见药物配伍「脑补」进输出,或在缺失信息处编造合理化内容。论文特别强调幻觉发生在 note-specific information 上,即模型用「先验的肿瘤学常识」覆盖了「这份笔记的个体事实」。

这两类错误的评估学含义:前者使召回受限(自动指标低估覆盖),后者使精确率受损且在临床场景下危害更大——漏抽可以人工补,错抽可能直接误导。CORAL 把这两类错误写进摘要结论「there is a need for further improvements」,等于给所有后续 LLM 医疗信息抽取工作立了靶子。

4.7 论文结论的应用定位

Abstract 结尾对 LLM 能力的判定原文要点:LLM「有望用于临床研究、复杂人群管理与优质诊疗记录的可靠信息抽取」(promising for performing reliable information extraction for clinical research, complex population management, and documenting quality patient care),但「仍需进一步改进」(there is a need for further improvements)。三个应用方向对应三类使用姿势:

  • 临床研究:以 CORAL 类基准先验证抽取管线,再放行到队列构建;
  • 复杂人群管理:依赖任务 7/8 式的用药史与未来计划结构化,服务于治疗路径管理;
  • 诊疗记录质量:以抽取结果反向核对笔记的完整性与一致性。

而所有这些应用的前提,都是先在 CORAL 的 40 份金标准上量出可信的错误率——这正是该数据集「小而深」的存在意义。

§5 生态位:CORAL 在临床 NLP 数据谱系中的位置

5.1 与通用临床 NLP 语料的关系

把 CORAL 放回临床 NLP 的经典语料谱系,它的差异化定位一目了然:

  • i2b2/n2c2 系列任务语料(去标识、肥胖、药物/ADE、关系等共享任务):单任务、单笔记类型、标注密度中等,是 2010 年代临床 NLP 的主力训练/评测资源。CORAL 与之共享 standoff 标注传统,但把「单任务」换成「八任务全谱系」,把「任务级 schema」换成「疾病-笔记类型-问题三重不可知 schema」;
  • MTSamples 转录报告集:规模大、覆盖科室广,但无专家深标注、无 LLM 评测基线,适合预训练/领域适应;CORAL 规模小、标注深、自带基准结果,适合评测;
  • MedNLI:从 MIMIC-III 衍生的临床自然语言推理集,句子级蕴含判断;CORAL 是笔记级结构抽取,两者在「临床推理」上互补但粒度不同;
  • MIMIC-IV-Note:大规模重症笔记库,提供体量与预训练燃料;CORAL 提供肿瘤学深标注评测靶。前者是「海量无深标」,后者是「少量极致深标」,构成经典的规模-质量互补对;
  • RadGraph:放射学报告的实体-关系标注,单模态(影像叙述)、单报告体裁;CORAL 的笔记体裁更杂(含评估计划、病程叙事),且明确把「放射/病理报告的直接复制段」排除在标注外——两者几乎不重叠,正好互补。

5.2 与肿瘤学专项数据集的关系

更贴近肿瘤学的既有资源(论文 Introduction 引文脉络):

  • ICD-O-3 / 癌症登记路线:抽取对象限定在登记字段可承载的元素(形态学、部位、分期);CORAL 的 schema 覆盖了登记字段之外的大量叙事信息(症状、意图、不良事件、试验);
  • 病理报告 NLP(如 CancerBERT 一类工作,论文引文 [16]):单报告体裁、单病种表型;CORAL 是进展笔记、双病种对照;
  • RECIST 语料(Li et al. 2020,论文引文 [15]):聚焦疗效评价语料;CORAL 不做疗效终点,做全谱系病史与计划;
  • FrameNet for Cancer(Roberts et al. LREC 2018,论文引文 [19]):schema 方法论上的直系先辈,见 §2.1。

一句话定位:在 CORAL 之前,公开世界没有「全面标注的肿瘤笔记」(no comprehensively annotated oncology notes exist publicly,Abstract 原文)——CORAL 填的是这个生态空位,而不是给任何既有数据集做增量版本。

5.3 与 LLM 医疗评测的时点关系

CORAL 的评测快照定格在 2023 年中:GPT-4(0314)、GPT-3.5-turbo(0613)、FLAN-UL2,API 版本 2023-05-15。论文发表(arXiv 2023-08,NEJM AI 2024-03)恰在「LLM 医疗能力」大爆发与「医疗专用评测集」稀缺的交汇点上。此后涌现的任何新模型,都可以在 CORAL 上与 0.73/0.72/0.51/68% 这组基线直接对话——前提是复现 §4.1 的协议:同样的两段叙事输入、同样的温度 0、同样的指标套件,以及(对人工准确率)同样的独立肿瘤学家裁决流程。

4.8 方法论启示:自由文本评测的局限与出路

CORAL 的评测设计暴露了 LLM 时代信息抽取评测的一个结构性难题,值得单独讨论(本节前半为论文立场的整理,后半为本文的分析性延伸,已明确标注):

难题:输出形态错配。 传统 IE 评测假设模型输出 standoff 标注(实体 span + 类型 + 关系三元组),于是有 span-level precision/recall/F1 与严格的事件槽位填充评分。LLM 的输出是自然语言——同一个事实可以写成「Eribulin(2021-03 至 2021-08,因周围神经病变停药)」或「Eribulin: 3/2021-8/2021, d/c due to neuropathy」。CORAL 的解法是用 BLEU-4/ROUGE-1/EM-F1 三个文本对文本指标绕开结构解析,代价是指标语义变模糊(坑 8):分数反映「文本相似度」而非「事实抽取正确率」。

延伸讨论(论文未做,本文分析):可能的出路。

  1. 语义相似度层:在 BLEU/ROUGE 之外叠加句向量或事实三元组级匹配,把「措辞不同但事实相同」的输出与真正的事实错误区分开——这正能修复 EM-F1 0.51 与 ROUGE 0.72 之间约 0.2 的落差中「好错误」的部分;
  2. LLM-as-judge:用强模型对照金标准逐槽位判定输出正确性——本质上是把 CORAL 人工评测协议(独立肿瘤学家逐任务判定)自动化,代价是引入评测器偏差;
  3. 结构化输出协议:要求模型按固定 JSON schema 输出再解析——但这就改变了「零样本自由文本」的实验设定,测的不再是论文测的能力;
  4. 版本锁定纪律:GPT-4 的 0314 快照与今天的 GPT-4 服务端版本在持续演化——CORAL 的分数是模型版本 + API 版本(2023-05-15)+ 温度 0 三重锁定的时点快照,任何复现都必须锁同样的版本号,否则分数差异无法归因(模型变了还是数据变了?)。

给后来者的基准声明:在 CORAL 上报告新模型成绩时,正确姿势是「同协议 + 同版本锁 + 三指标全套 + 分病种拆分」,只报一个笼统 F1 的对比不构成有效对话。

5.4 论文引文网络:编号 [1]-[29] 的参考文献谱系

CORAL 论文正文引用了编号 [1]-[29] 的文献列表(PhysioNet 页面 References 区收录;存照:本环境抓取的列表中编号 [18] 一行缺失——正文在「textual data sources have been limited to pilot studies[18]」处引用它,其具体条目未能从数据页确证,属遗留待核项)。逐组谱系分析如下(编号为论文原编号):

组 1:领域定位引文([1],1 条)

编号 文献 谱系角色
[1] Savova et al. 2019, Cancer Research——NLP 抽取临床癌症表型的综述 开篇定调:肿瘤 NLP 是有传统的领域,CORAL 的创新点不在「做 IE」而在「做全谱系专家标注 + LLM 评测」

组 2:LLM 医疗能力先证([2]-[9],8 条)

编号 文献 谱系角色
[2] OpenAI GPT-4 Technical Report (arXiv:2303.08774) 被测模型的技术出处
[3] Nori et al.——GPT-4 on USMLE LLM 医学考试能力先证
[4] Kung et al. 2023, PLOS Digital Health——ChatGPT on USMLE 同上(ChatGPT 侧)
[5] Singhal et al. 2023, Nature——LLM encode clinical knowledge(Med-PaLM) 临床知识基准侧先证
[6] Lee & Bubeck & Petro 2023, NEJM——GPT-4 as AI Chatbot for Medicine 医学场景应用愿景(与最终发表期刊 NEJM AI 同门)
[7] RSNA Radiology 2023——GPT-4 放射报告转结构化 「叙事→结构」的放射学先例(与 RadGraph 一脉互补)
[8] Agrawal et al. EMNLP 2022——LLM as few-shot clinical information extractors 方法学最近的先例:LLM 临床信息抽取的直接前身
[9] Haver et al. Radiology 2023——ChatGPT 乳腺癌筛查建议 肿瘤专科 LLM 评测先例

组 3:肿瘤 IE 的既有路线([10]-[18],9 条)——CORAL 要超越的对象

编号 文献 路线归属
[10] Alawad et al. 2018 IEEE BHI——病理报告多任务 CNN 抽取 癌症登记/ICD-O3 路线
[11] Breitenstein et al. 2018, Clin Transl Sci——乳腺癌 EHR 表型 癌症登记路线
[12] Yala et al. 2017——乳腺癌病理报告解析 病理报告专项
[13] Odisho et al. 2019, J Urol——病理报告 NLP 病理报告专项
[14] Li et al. 2020, JCO CCI——RECIST 疗效语料(Part I) 疗效评价专项
[15] Altieri et al. 2021, JBI——肿瘤属性分类 病理专项
[16] Zhou et al. 2022, JAMIA——CancerBERT 乳腺癌表型 领域模型专项
[17] Belenkaya et al. 2021, JCO CCI——OMOP 肿瘤扩展 表格数据路线的对位
[18] (抓取列表缺行;正文引其为例:「试点研究」) 文本路线的早期尝试

组 4:schema 方法论直系([19]-[21],3 条)

编号 文献 谱系角色
[19] Roberts et al. LREC 2018——FrameNet for Cancer schema 的直系先辈(§2.1 的框架语义学源头)
[20] Datta et al. 2019, JBI——frame semantic 肿瘤 IE 综述 框架语义路线的综述锚
[21] Datta et al. LREC 2020——Rad-SpatialNet 框架语义在放射报告的实例(空间关系)

组 5:基础设施([22]-[24],3 条)

编号 文献 谱系角色
[22] Radhakrishnan et al. 2023, JAMIA Open——Philter 认证去标识系统 去标识工序的技术出处
[23] ChatGPT 官网(原文标注 Accessed 2/05/2024,日期格式原文如此) GPT-3.5-turbo 的界面出处说明
[24] Yi Tay 发布页——FLAN-UL2 20B 开源被测模型出处

组 6:评测与工具([25]-[29],5 条)

编号 文献 谱系角色
[25] Papineni et al. ACL 2002——BLEU BLEU-4 指标出处
[26] Lin 2004——ROUGE ROUGE-1 指标出处
[27] Stenetorp et al. EACL 2012——BRAT 标注工具
[28] BRAT manual 格式规范
[29] OncLLMExtraction 仓库 自家代码(Project Website 同指)

谱系小结:编号 [1]-[29] 的引文中([18] 待补确证),组 2(LLM 能力先证)+ 组 3(既有肿瘤 IE 路线)共 17 条构成「问题空间」——LLM 很强但肿瘤 IE 缺全谱系资源;组 4 的 3 条构成「方法内核」——框架语义 schema;组 5/6 的 8 条是基础设施。这个分布印证了 CORAL 的自我定位:不是提出新算法,而是用成熟标注方法(框架语义 + BRAT)填补 LLM 时代最缺的资源层。

4.9 三模型对比的读法:闭源、次旗舰与开源的三角

虽然 GPT-3.5-turbo 与 FLAN-UL2 的分项分数在订阅墙内(附录 I 待核项 1),三模型的选型组合本身就构成一份有信息量的对比设计,可以独立于具体分数去读:

GPT-4(0314)——「能力上限」参照。 评测时点(2023 年中)的最强闭源模型。它的角色是回答「在最有利条件下,LLM 能在肿瘤笔记抽取上走多远」——答案:BLEU 0.73 / ROUGE 0.72 / EM-F1 0.51 / 人工准确率 68%,强于逐字抽取、弱于可直接采信。

GPT-3.5-turbo(0613)——「普及型」参照。 ChatGPT 界面背后的基础模型,是当时机构与个人实际最常接触到的 LLM。它的角色是回答「普通用户随手可用的大模型,与旗舰差多少」——这直接对应医疗机构的采购直觉:为「次旗舰」的性能差距付「旗舰」的价格是否值得。论文未公开分项分数前,这一档的读数只能存疑,但「GPT-4 overall best」的结论意味着 GPT-3.5 不高于上表。

FLAN-UL2(20B)——「可自部署」参照。 唯一的开放权重模型,跑在 UCSF 内部的 Wynton HPC 上(§7.3)。它的角色是回答「不走商业 API、数据不出院墙的部署路线,性能代价多大」——这是受 HIPAA 约束的医疗机构最现实的选项之一(坑 7),其分数的实践意义甚至高于旗舰对照。

三角的评测学含义:CORAL 同时锚定了「最强闭源 / 最普及闭源 / 可自部署开源」三点,让后来的研究者无论走哪条部署路线都有可对话的基线。这在 2023 年的评测设计里是相当周到的考虑——很多同期工作只测一两个模型,把「模型比较」与「部署路线比较」混为一谈。

跨模型的定性排序与任务维度的交互(论文摘要只给了 GPT-4 的定性):GPT-4 的相对优势集中在推理型任务(癌症所致症状、未来用药考虑,§4.5)——这暗示参数规模与推理能力的相关性在临床 IE 上依然成立,也暗示若 FLAN-UL2 也有分任务数据,其短板预计同样集中在 advanced relation 密集的任务。此推断已标注为本文分析,分项证实待订阅全文(附录 I)。

4.10 评测的统计学边界:小样本上的单点分数怎么读

论文报告的是四个总体平均数,未附置信区间(confidence interval)或方差信息——这不是疏忽,而是 40 份样本的现实约束。但这决定了读分数的方式(本节为本文的分析性整理,边界判定锚定论文披露口径):

  1. 笔记级方差不可忽略:进展笔记的信息密度差异极大——一份「初诊 + 完整分期 + 多线治疗史」的笔记可能有数百条注释,一份「随访 + 单线维持」的笔记可能只有几十条。同样一份笔记进入/移出评测集,总体平均分可能波动数个百分点;
  2. EM-F1 对措辞敏感:0.51 的 EM-F1 意味着约一半的匹配失败可能只是「同义改写」(缩写展开、语序、格式),其中有多少是「真错」需要人工评测口径(68%)补充——两个数字之间 17 个百分点的差距,大部分是口径差而非能力差;
  3. 人工评测的子集更小:68% 准确率来自 20 份(10+10)上的 11+20 个任务判定——该数字的方差天然更大,应视为「量级指示」而非「精确性能」;
  4. 对外部使用者的正确姿势:在 CORAL 上报告自己的结果时,附上 bootstrap 置信区间或至少分笔记分布,而不只是又一个单点平均——这是 CORAL 尺寸决定的、对后来者的最低统计礼仪。

把这条边界与 §4.9 的版本锁定、§4.8 的指标口径合起来,构成「在 CORAL 上做比较」的三条方法论戒律:同协议、同版本锁、报分布。

§6 获取、许可与引用:三步拿到 CORAL

6.1 受控访问三步走

CORAL 是 PhysioNet 上的受控访问(controlled access)数据集,Access Policy 原文一句话:「只有签署 DUA 的认证用户才能访问文件」(Only credentialed users who sign the DUA can access the files)。实际操作分三步:

  1. 注册 PhysioNet 账号并完成身份认证(PhysioNet credentialed user,即_credentialed access_ 体系下的实名用户);
  2. 上传培训证书:完成 CITI 课程 「Data or Specimens Only Research」 并提交证书(Required training 栏原文)——这是 PhysioNet 全部受控数据集的通用门槛,证明使用者受过人体受试者保护与负责任数据使用训练;
  3. 签署使用协议:在线签署 PhysioNet Credentialed Health Data Use Agreement 1.5.0(DUA),之后即可下载。

整个流程对学术界免费,但从申请到批通常以天计,且不可匿名、不可转授权——任何合作方需要独立走完三步。

6.2 License 条款要点

数据文件的许可是 PhysioNet Credentialed Health Data License 1.5.0,其核心约束(以 PhysioNet 官方许可文本为准):

  • 非商业(non-commercial):不得用于以营利为目的的用途;
  • 相同方式共享口径(share-alike 式):衍生数据集须沿用同等保护强度的许可再发布;
  • 禁止再分发原始数据:只能提供自己签署 DUA 后获得的下载通道,不得把数据包转传第三方;
  • 引用义务:使用数据必须按 §6.4 的规范引用(数据 DOI + 论文 + PhysioNet 平台标准引用)。

配套的代码与 schema(GitHub 仓库 OncLLMExtraction)以 CC BY-NC-SA 许可公开——同为非商业-相同方式共享口径,与数据许可在设计上互相兼容。两份许可都不是宽松许可(permissive license),想商用必须另行联系版权方。

两个许可的适用边界要分清:数据本体归 PhysioNet License 管,prompts/代码/schema 文件归 CC BY-NC-SA 管。只在论文里引用 prompt 写法不需要下数据;但要跑评测就必须走受控通道(坑 7 的 HIPAA 约束也只在「用真实数据跑模型」时才生效)。

6.3 版本链与双 DOI

CORAL 自 2024 年 2 月发布以来只有一个版本,但 PhysioNet 的 DOI 体系天然产生两个 DOI(坑 2):

对象 DOI 用法
Version 1.0(2024-02-07 发布) 10.13026/v69y-xa45 引用当时看到的版本时使用,结果可精确复现
Latest version(最新版指针) 10.13026/vwq3-fj85 引用「该数据集最新状态」时使用

学术惯例:论文方法节通常引 version DOI 保证可复现性;综述或数据库收录通常引 latest DOI。两者都指向同一数据集,不存在「哪个是真的」的问题。

6.4 引用规范:三重引用

PhysioNet 页面明确要求同时引用三类对象:

  1. 数据集本体:Sushil, M., Kennedy, V., Mandair, D., Miao, B., Zack, T., & Butte, A. (2024). CORAL: expert-Curated medical Oncology Reports to Advance Language model inference (version 1.0). PhysioNet. RRID:SCR_007345. https://doi.org/10.13026/v69y-xa45 ——注意附带 RRID:SCR_007345(研究资源标识符),这是 PhysioNet 数据集的标准身份编号;
  2. 原始论文:Sushil, Madhumita, et al. “Extracting detailed oncologic history and treatment plan from medical oncology notes with large language models.” arXiv:2308.03853 (2023);正式发表于 NEJM AI(DOI: 10.1056/AIdbp2300110,2024 年 3 月 13 日上线)——两条论文口径并存,见 §7.2 与坑 1;
  3. PhysioNet 平台:Pollard, T., et al. (2026). PhysioNet as a global platform for biomedical research. Nature Health, 1(8), 792–795. https://doi.org/10.1038/s44360-026-00096-z。

6.5 访问热度与地区可用性

PhysioNet 页面给出的量化热度指标:Project Views 390(当前版本与全版本一致,均为 390 次)——对于发布一年余的受控数据集,这一浏览量反映的是经过认证门槛过滤后的精准受众规模,与公开数据集动辄数万的浏览量不可直接比较。

一个工程层面的注意事项(自抓取实测存照):从部分网络环境访问该数据集页面时,文件区显示**「Data is not available in your region due to legal or policy restrictions.」**(数据因法律或政策限制在您所在地区不可用)——这是 PhysioNet 平台层面的地区可用性伪影,不影响已认证用户的正常下载路径,但在自动化抓取或镜像场景下会碰到。页面同时注明平台由 MIT Laboratory for Computational Physiology 维护,受 NIBIB、NHLBI 与 NIH Office of the Director 资助(grant numbers U24EB037545 与 R01EB030362)。

6.6 Topics 与检索路径

PhysioNet 为 CORAL 打的六个官方 Topics:information extraction、oncology、natural language processing、electronic health records、artificial intelligence、large language models。六个标签横跨「任务(IE/NLP)—领域(oncology/EHR)—技术(AI/LLM)」三个轴,任一轴检索都能命中。官方 slug 为 curated-oncology-reports(URL 路径 physionet.org/content/curated-oncology-reports/1.0/),Project Website 字段指向 GitHub 仓库 OncLLMExtraction。

§7 人物、机构与时间线

7.1 作者团队:六人与三种角色

CORAL 由六位作者完成,署名顺序与角色(依 PhysioNet 页面署名与致谢、COI 段落交叉梳理):

作者 角色 背景要点
Madhumita Sushil 第一作者、标注 schema 与评测主导 Butte 实验室成员;配套 GitHub 仓库(OncLLMExtraction)的所有者;COI 段报告无利益冲突
Vanessa Kennedy 肿瘤学专科医师(标注者之一) 两名 oncology fellows 之一
Divneet Mandair 肿瘤学专科医师(标注者之一) 两名 oncology fellows 之一
Brenda Miao 医学生(标注参与者) medicine student,COI 段报告无利益冲突
Travis Zack 肿瘤学顾问 COI 段注明为 SandboxAQ 药物开发有偿顾问(与本研究生明无关)
Atul Butte 通讯作者、实验室主导 UCSF 计算健康科学研究所(Institute for Computational Health Sciences)领军人物;Priscilla Chan and Mark Zuckerberg 卓越教授;创业与咨询经历广泛(Personalis、NuMedii 联合创始人等,详见 COI 段,均声明未参与本研究的具体利益)

团队构成体现了 CORAL 的方法论本质:计算科学家设计 schema 与评测(Sushil、Butte),临床医生提供领域判断与标注(Kennedy、Mandair、Zack),医学生参与执行(Miao)——「expert-curated」不是营销词,而是署名结构的事实。

7.2 双论文口径:arXiv 预印本与 NEJM AI 正式版

CORAL 的学术成果有两个版本,构成名称与时间线的双口径(坑 1 的组成部分):

  • arXiv 预印本:arXiv:2308.03853,2023 年 8 月 7 日提交 v1,cs.CL 分类;标题《Extracting detailed oncologic history and treatment plan from medical oncology notes with large language models》——注意标题含「medical」;
  • NEJM AI 正式版:DOI 10.1056/AIdbp2300110,2024 年 3 月 13 日发表;标题《Extracting detailed oncologic history and treatment plan from oncology notes with large language models》——正式版标题不含「medical」。

数据集发布(2024-02-07)恰好卡在预印本与正式发表之间:PhysioNet 页面「please cite the original publication」栏至今给出的是 arXiv 口径。检索、引用与查重时两条论文口径都要留痕,避免因标题差一个单词而漏检。

7.3 机构与基础设施

  • 加州大学旧金山分校(UCSF):数据来源(Information Commons)、标注执行(肿瘤专科医师)、IRB 审批(#18-25163 与 #21-35084)的所在地;
  • Butte 实验室:计算与 LLM 评测的执行主体;
  • UCSF AI Tiger Team、Academic Research Services、Research Information Technology、Chancellor’s Task Force for Generative AI(致谢段):提供了 Versa API gateway(UCSF 的大模型与生成式 AI 安全 API 网关实现)与 Versa chat(聊天界面)及相关数据资产服务——即 GPT 系模型实际经由 UCSF 自己的安全网关接入 Azure;
  • Wynton 高性能计算平台(致谢 Boris Oskotsky 与 Wynton 团队):FLAN-UL2 的内部部署算力载体;
  • 标注协作:Binh Cao(数据标注支持);Jennifer Creasman、Alysa Gonzales、Dalia Martinez、Lakshmi Radhakrishnan(临床试验名与基因名去标识修正)。

7.4 资助来源

论文与数据页列出的四个资助来源:

  1. FDA grant U01FD005978:UCSF–Stanford 监管科学与创新卓越中心(CERSI);
  2. NIH UL1 TR001872:UCSF 临床与转化科学研究所(CTSI);
  3. 美国国家癌症研究所(NCI/NIH)Award Number P30CA082103(UCSF 癌症中心核心支持);
  4. Priscilla Chan and Mark Zuckerberg 的慈善捐赠(philanthropic gift)。

论文按惯例声明:内容由作者负责,不代表 NIH 官方观点。

7.5 时间线一览

时间 事件
2012–2022 UCSF Information Commons 患者数据时间跨度(40+200 份笔记的来源区间)
2018 / 2021 UCSF IRB #18-25163 与 #21-35084 先后批准(去标识误差回填的合规依据)
2023-05-15 评测所用 Azure OpenAI API 版本号(评测快照的技术时点)
2023-08-07 arXiv:2308.03853 v1 提交(论文首公开)
2024-02-07 PhysioNet 数据集 v1.0 发布(DOI 10.13026/v69y-xa45)
2024-03-13 NEJM AI 正式版发表(DOI 10.1056/AIdbp2300110)
2024-05(抓取时点) ChatGPT 与 BRAT 手册等网络资源的访问日期标注(Accessed 2/05/2024)

7.6 利益冲突披露

COI 段原文要点:Sushil、Kennedy、Mandair、Miao 四人报告无财务关联或利益冲突;Zack 为 SandboxAQ 药物开发有偿顾问(声明与本研究生明无关);Butte 的披露清单极长(多家公司创始人/顾问/股东身份,含 Personalis、NuMedii、Tempus 类咨询与持股记录,以及通过 Stanford 的专利特许权使用费),并声明所有相关实体均未参与本研究的设计、执行、评测或写作。这一段如实转述即可——它是 Butte 实验室论文的标准披露格式,不构成对本研究结论的特定质疑,但引用者应知悉。

§8 生态与互链:库内可互链条目与外部依赖

8.1 库内互链图谱(千方病案医数集)

在千方病案医数集内,CORAL(coral)与下列已收录条目存在直接的类型学或方法学关联,建议互链(rid 为库内记录 ID):

库内条目 rid 互链逻辑 强度
mimic-iv-note 47 「海量弱标注 vs 小而深强标注」的经典互补对:MIMIC-IV-Note 提供体量与预训练燃料,CORAL 提供肿瘤学深标注评测靶;两者都是叙事型临床文本 ★★★
radgraph 561 实体-关系 standoff 标注的同构兄弟:RadGraph 做放射学报告(单体裁、单模态),CORAL 做进展笔记(多段落叙事、含因果与意向);CORAL 还刻意排除了放射报告复制段,两者文本几乎不重叠 ★★★
i2b2-n2c2-nlp 14 临床 NLP 共享任务传统(i2b2/n2c2 系列)的直系后辈:同为 standoff 深标注临床文本,CORAL 把单任务 schema 升维为三重不可知全谱系 schema ★★★
thyme 524 时间信息抽取(temporal reasoning)专题语料:CORAL 的 temporal relation 子类与任务 1/4 的时间锚定要求,与其构成方法学互证 ★★
mtsamples 350 大规模转录报告集:无深标注的预训练/领域适应燃料,与 CORAL 的评测定位互补;文体上同为临床叙事 ★★
mednli 648 临床自然语言推理:句子级蕴含判断 vs 笔记级结构抽取,同为「临床推理评测」但粒度正交 ★★
meddialog 210 医患对话文体:与 CORAL 的医医笔记文体构成叙事来源对照(对话 vs 书面病程记录) ★
imcs-21 200 中文门诊病历:语言与医疗体系的对照组,临床文本深标注的方法学同侪 ★
cancerlinq 388 肿瘤学结构化数据路线(cancerLinQ 式真实世界证据平台):与 CORAL 的「叙事→结构」抽取方向互为镜像——一个把结构化数据汇成证据网络,一个把叙事文本抽成结构 ★★

互链优先级建议:第一梯队 mimic-iv-note(47)、radgraph(561)、i2b2-n2c2-nlp(14)(类型学最近);第二梯队 thyme(524)、mtsamples(350)、mednli(648)、cancerlinq(388);第三梯队 meddialog(210)、imcs-21(200)(文体对照)。

8.2 外部依赖与工具链

CORAL 的使用路径上站着几个外部依赖,都在正文中有对应章节:

  • BRAT(Stenetorp et al., EACL 2012 demonstrations):标注格式与可视化工具,§3.6 的四配置文件与 python standalone.py 用法都出自其手册;
  • Philter(Radhakrishnan et al., JAMIA Open 2023):认证去标识系统(论文引文 [22]),§3.2 的去标识工序即由它执行;
  • FLAN-UL2(20B 开源模型,Yi Tay 发布页):三被测模型中唯一的自部署选项;
  • FrameNet for Cancer / Rad-SpatialNet(Roberts et al.):schema 方法论的先辈工作(论文引文 [19][21]);
  • OncLLMExtraction(GitHub):双仓中的代码仓,prompts 与评测脚本的唯一官方来源(§3.7)。

8.3 谁应该用 CORAL,谁不该

基于全部前文,给出明确的使用适配判定:

应该用:

  • 做肿瘤/临床信息抽取的模型评测——需要专家级金标准与可对比的 LLM 基线;
  • 研究标注 schema 设计——需要三重不可知全谱系 schema 的完整实例(59/23/26)与 BRAT 配置文件;
  • 开发弱监督或预标注管线——用 200 份 GPT-4 自动标注做冷启动,再用 40 份金标准校准;
  • 教学临床 NLP 标注方法——40 对 .txt/.ann + 四配置文件 + 可视化路径是完整的教学闭环。

不该用:

  • 当预训练语料——40 份的体量毫无意义(坑 4);
  • 当多病种训练集——只有乳腺癌与胰腺癌两种疾病状态,泛化声明不成立;
  • 当已验证的 GPT-4 产出直接进临床流程——200 份自动标注无人工核对(坑 6);
  • 在无 HIPAA 合规框架的环境跑专有模型 API——违反其数据许可精神与可能的 DUA 条款(坑 7)。

8.4 PhysioNet 平台生态位

CORAL 托管于 PhysioNet,这一平台选择本身就是元信息。PhysioNet 由 MIT 计算生理学实验室(Laboratory for Computational Physiology)维护,获 NIBIB、NHLBI 与 NIH Office of the Director 资助(grant numbers U24EB037545 与 R01EB030362——数据页页脚原文)。平台 2026 年在 Nature Health 上发表的自述论文(§6.4 引用规范第 3 条)给出量级:首个公开仓储建立 25 年后,PhysioNet 已支撑数以万计的研究论文(tens of thousands of research papers)。

对 CORAL 而言,PhysioNet 提供的三样东西是自建站点无法比拟的:

  1. 受控访问基础设施:credentialed user 体系、CITI 证书核验、DUA 电子签署、下载审计——PHI 类临床文本的标准分发管道,CORAL 无需自建即继承;
  2. 永久性与版本治理:DataCite 双 DOI(坑 2)+ 平台级长期 preservation 承诺(NIH 资助的平台使命),数据集链接腐烂风险趋近于零;
  3. 受众精确性:PhysioNet 的浏览/下载者默认懂「受控数据」的游戏规则,Project Views 390 是过滤后的有效曝光。

同时也要看到平台语境的反差:PhysioNet 以生理信号与重症数据(MIMIC 系是平台招牌)闻名,CORAL 这种「肿瘤叙事文本 + LLM 基准」类型的数据集在平台目录中属于少数派——它标志着 PhysioNet 的覆盖面正在从信号/影像向临床叙事 + 医疗 AI 评测资源扩展。对检索者的提示:在 PhysioNet 站内找 CORAL,走 Topics 标签(information extraction / large language models)比走传统信号分类更快。

8.5 互链实施建议

对库内编辑者,把 §8.1 的互链落地时建议遵循三条规则:

  1. 双向对称:CORAL 的条目页挂出 mimic-iv-note(47)、radgraph(561) 等链接的同时,对方条目的「相关数据集」区宜回挂 coral——互链的价值在于双向可达;
  2. 互链文案差异化:九个条目与 CORAL 的关系各不相同(互补对/同构兄弟/方法论同侪/文体对照),互链时应使用各自的关系描述(§8.1 表已给出),避免清一色「相关推荐」式弱文案;
  3. rid 以 DB 实查为准:本条目写作时的 rid 实查结果(mimic-iv-note=47、radgraph=561、i2b2-n2c2-nlp=14、thyme=524、mtsamples=350、meddialog=210、mednli=648、imcs-21=200、cancerlinq=388)随时间可能因库内重组而变化,发布时以当次 url_name 反查为准——这是本库「禁止位置对齐、必须键匹配」铁律在互链场景的应用。

6.7 获取合规自我检查清单

申请与使用过程中的十问自检(任何一问答「否」,先补齐再动数据):

  1. 我的 PhysioNet 账号是否已完成 credentialed 认证?
  2. 我的 CITI「Data or Specimens Only Research」证书是否在有效期内、且已上传?
  3. 我是否以本人身份签署了 DUA 1.5.0(而非代签/共用)?
  4. 我的下游合作者是否各自独立走完 1-3(无转授权)?
  5. 我的使用目的是否落在非商业范围(License 1.5.0 与代码 CC BY-NC-SA 的共同边界)?
  6. 我是否会在成果中完成三重引用(数据 DOI + 论文 + PhysioNet 平台,§6.4)?
  7. 若用专有模型 API 跑数据:通道是否有 HIPAA 合规安排(BAA、无数据保留承诺)?
  8. 若用开源模型:部署环境是否同样受控(数据不出内部环境)?
  9. 我是否在输出物中把 40 份金标准与 200 份银标准区分表述(坑 6)?
  10. 我是否保留了版本口径(引 version DOI 还是 latest DOI,坑 2)并在论文中一致?

这份清单同样适用于 PhysioNet 上其他受控数据集——CORAL 的获取路径就是平台标准路径,无特殊环节。

§9 坑点汇总:使用 CORAL 前必须知道的八件事

以下八则坑点按「识别→后果→正确姿势」整理,编号与正文各节引用一致(坑 1-7 散见 §0-§8,此处为全集)。

坑号 一句话 高发人群 后果等级
坑 1 名称口径:数据集名带 “medical”,论文正式版标题不带;官方 slug 又是第三种拼法 检索者、引用者 低(漏检/引错)
坑 2 双 DOI:v69y-xa45(v1.0)与 vwq3-fj85(latest)并存 引用者、元数据维护者 低
坑 3 跳过段:放射/病理报告复制段未标注且文中带跳过标记 自动评测实现者 高(指标口径污染)
坑 4 规模误读:把 40+200 当训练集 盲目跟风者 高(路线错误)
坑 5 unannotated 命名不齐:data/ 下带 .csv,gpt4_out/ 下不带 脚本作者 中(加载失败)
坑 6 200 份子集未回填去标识误差、无人工核对 拿自动标注当金标准者 高(质量错配)
坑 7 HIPAA 合规边界:跑专有模型必须走合规通道 工程落地者 高(合规风险)
坑 8 指标口径:BLEU/ROUGE/EM-F1 是自由文本比对指标,不是结构化 IE 的 span-F1;68% 又是第三种口径 结果比较者 高(误读基线)

坑 1:名称口径三件套。 数据集全名「CORAL: expert-Curated medical Oncology Reports to Advance Language model inference」(缩写展开刻意含 “medical”);NEJM AI 正式版论文标题《Extracting detailed oncologic history and treatment plan from oncology notes with large language models》(不含 “medical”,arXiv 预印本则含);PhysioNet 官方 slug curated-oncology-reports 又不含 CORAL 字样。三个名字、三个渠道、指向同一资源——检索时至少用「CORAL oncology PhysioNet」「curated-oncology-reports」「2308.03853」三条线索交叉。

坑 2:双 DOI。 version DOI(10.13026/v69y-xa45)锁版本、latest DOI(10.13026/vwq3-fj85)指最新。复现实验引前者,资源收录引后者,两者不是错误而是 DataCite 版本体系的常态。

坑 3:跳过段与标注范围。 「除放射/病理报告的直接复制粘贴段外全部标注」——意味着 .txt 里的报告体段落本来就不在标注承诺内。自动评测若把整份文本当标注覆盖域,会把设计性跳过误算为漏标,压低一切召回类指标。正确姿势:读跳过标记、按任务取叙事段(论文评测只喂两个叙事章节)。

坑 4:规模误读。 40 份专家笔记 = 24326 条注释 ≈ 每份 608 条。这是「密度换规模」的基准设计,不是「数据太少做不成事」;反过来拿它当训练集则是把评测靶当燃料,两端都是错位。

坑 5:目录命名不齐。 unannotated/data/ 下是 breastca_unannotated.csv 与 pdac_unannotated.csv(带扩展名),unannotated/gpt4_out/ 下是 breastca_gpt4 与 pdac_gpt4(数据页描述未带扩展名后缀)。关联键统一是 coral_idx(文件名去扩展名),写加载脚本时按实际文件名枚举,不要假设统一后缀。

坑 6:200 份自动标注的质量等级。 GPT-4(0314、温度 0)用与基准评测相同的 prompts 自动标注;未做去标识误差回填、没有任何人工质量核对。官方定位是「潜在扩展资源」(potentially be used to expand upon the provided manual annotations)。它是银标准(silver standard),与 40 份金标准在任何下游声明里都必须分开表述。

坑 7:HIPAA 合规边界。 论文用 HIPAA 合规的 Microsoft Azure OpenAI 通道(且声明不向 Microsoft/OpenAI 永久传输或存储数据),开源模型则在内部计算环境部署。想用 CORAL 数据跑专有模型,要么走等效合规通道,要么选可自部署的开源模型——把笔记文本直接贴到无 BAA(Business Associate Agreement)的公共 API 是合规红线。

坑 8:三种指标口径不可互换。 BLEU-4(0.73)与 ROUGE-1(0.72)衡量自由文本 n-gram 重叠;EM-F1(0.51)衡量逐字一致;68% 准确率是独立肿瘤学家在**半数笔记(10 乳腺癌 + 10 胰腺癌)**上对 11 个实体任务 + 20 个关系任务的人工判定口径。三者对象、子集、算法都不同——把 0.51 当「51% 的槽位抽对了」或拿它与 span-level F1 的文献直接比较,都是口径污染。

§10 DAIMS 评估:CORAL 的数据治理画像

10.1 DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 7 PhysioNet 官方页 + 六个 Topics 标签 + RRID:SCR_007345 + 双论文(arXiv/NEJM AI)索引;但 slug(curated-oncology-reports)与俗名(CORAL)分离,跨名检索有摩擦(坑 1)
A 可获取性 5 受控访问三步走(注册+CITI 证书+DUA 1.5.0),流程标准但以天计;代码与 prompts 在 GitHub 公开补偿部分需求;存在地区可用性伪影
I 可互操作 8 BRAT standoff 是临床 NLP 事实标准之一,.txt/.ann 成对 + 四配置文件 + coral_idx 统一关联键;CSV 扩展名不齐(坑 5)扣一分;无官方转换到 OMOP/FHIR 的脚本
M 元数据质量 9 数据页文档完备度罕见地高:Abstract/Methods/Data Description/Usage Notes/Ethics/Acknowledgements/COI 全链;schema 以 annotation.conf 机器可读形式随数据发布;85% 以上的数字可三源互证
S 可持续性 7 PhysioNet 平台长期维护承诺(MIT LCS 维护、NIH 资助 U24EB037545/R01EB030362);双 DOI 版本体系;单一版本发布至今未变;依赖 UCSF 凭据体系但平台中立
综合评级 7.2/10(中上偏优) 元数据与互操作是长板;可获取性受受控访问本质约束(这不是缺陷而是 PHI 数据的正当成本),但流程摩擦真实存在

§11 最佳实践:从决策树到复现清单

11.1 数据获取决策树

你的需求是什么?
├── 评测我自己的肿瘤 IE 模型/LLM
│   ├── 1) PhysioNet 注册 + CITI 证书 + 签 DUA 1.5.0(§6.1)
│   ├── 2) 下载 coral/annotated/(40 份金标准)
│   ├── 3) 按 §4.3 三指标套件评测,注意坑 3(跳过段)与坑 8(口径)
│   └── 4) 与 GPT-4 基线(0.73/0.72/0.51/68%)同口径对比
├── 只要 prompts 与评测脚本(无需数据)
│   └── 直接用 GitHub OncLLMExtraction(CC BY-NC-SA)
├── 做弱监督/预标注管线
│   ├── 用 unannotated/ 的 200 份 GPT-4 产出(坑 6:银标准)
│   └── 拿到 40 份金标准后做人工校准子集
├── 研究标注 schema 设计
│   ├── 读 annotation.conf(59/23/26 的机器可读权威清单)
│   ├── 对照 §2 的十大类与三类关系框架
│   └── 参考 FrameNet for Cancer(LREC 2018)的谱系
└── 教学/演示标注方法
    └── 装 BRAT → 拷入 data 目录 → python standalone.py 可视化(§3.6)

11.2 零样本评测复现清单

复现论文基线所需的最小配置核对表:

  1. 模型三选或全测:GPT-4(版本 0314)/ GPT-3.5-turbo(版本 0613)/ FLAN-UL2(自部署);
  2. 通道:GPT 系走 HIPAA 合规 Azure OpenAI(API 版本 2023-05-15);FLAN-UL2 走内部算力;
  3. 输入格式:{system role description} {note section text, prompt},两个叙事章节,不用跳过段;
  4. 温度 0;
  5. prompts:以论文任务节与 GitHub 仓库为准(任务原文对照见附录 A);
  6. 指标:BLEU-4(带平滑)+ ROUGE-1 + EM-F1;
  7. 人工评测(可选):独立肿瘤学家 + 半数笔记 + 11 实体任务 + 20 关系任务的口径;
  8. 引用:数据 DOI + 论文 + PhysioNet 平台三重引用(§6.4)。

附录 A:八任务原文中英对照

英文为论文 Methods 段任务清单原文(编号一致),中文为本文编译;「schema 对应」列标注该任务主要消耗的 schema 资源;「能力台阶」列标注其相对于逐字抽取的推理增量。

任务 1

Identify all symptoms experienced by the patient, symptoms present at the time of cancer diagnosis, and symptoms experienced due to the diagnosed cancer, all further related to the datetime of their occurrence.

译:识别患者经历的全部症状、癌症确诊时已存在的症状、以及由所诊断癌症引起的症状,全部关联发生时间。

  • schema 对应:症状实体 + negation/experiencer 修饰 + temporal relation + advanced relation(癌症→症状因果)
  • 能力台阶:★★(三重症状筛选 + 因果归因 + 时间锚定)

任务 2

List radiology tests conducted for the patient paired with their datetime, site of the test, medical indication for the test, and the test result.

译:列出患者接受的所有放射学检查,配对检查时间、部位、医学指征与结果。

  • schema 对应:radiology test 子类(tumor test 之下)+ descriptive relation(检查-结果)+ temporal relation
  • 能力台阶:★★(四槽位配对完整性)

任务 3

List genetic and genomic tests conducted for the patient paired with the corresponding datetime and the test result.

译:列出患者接受的所有基因与基因组学检测,配对相应时间与结果。

  • schema 对应:genomic test 子类 + descriptive/temporal relation
  • 能力台阶:★(槽位少但缩写/数值表达异质;去标识误删重灾区)

任务 4

Infer the datetime for the first diagnosis of cancer for the patient.

译:推断患者癌症初次诊断的日期。

  • schema 对应:disease state + temporal information
  • 能力台阶:★★★(「推断」——日期常不逐字出现,需从影像/病理/治疗线索推算)

任务 5

Extract tumor characteristics in the following groups: biomarkers, histology, stage (TNM and numeric), grade, and metastasis (along with the site of metastasis and the procedure that diagnosed metastasis), all paired with their datetime.

译:抽取肿瘤特征,分组为:生物标志物、组织学、分期(TNM 与数字)、分级、转移(附转移部位与确诊转移的操作),全部配对时间。

  • schema 对应:tumor-related information 全谱系 + location-related(转移部位)+ procedure-related(确诊操作)+ temporal relation
  • 能力台阶:★★★(槽位最多、嵌套最深)

任务 6

Identify all interventional procedures conducted for the patient paired with their datetime, site, medical indication, and outcome.

译:识别患者接受的所有介入性操作,配对时间、部位、医学指征与结局。

  • schema 对应:procedure-related information + descriptive/temporal relation
  • 能力台阶:★★(与任务 2 同构,「结局」槽位更依赖推断)

任务 7

List medications prescribed to the patient, linked to the beginning datetime, end datetime, reason for prescription, continuity status (continuing, finished, or discontinued early), and any hypothetical or confirmed adverse events attributed to the medication.

译:列出患者所有处方药物,关联开始时间、结束时间、处方理由、连续性状态(继续中/已完成/提前停药)、以及归因于该药物的任何假设性或已确认不良事件。

  • schema 对应:treatment-related information + advanced relation(药→不良事件因果、药→理由)+ temporal relation
  • 能力台阶:★★★(状态机判读 + 因果归因,advanced relation 最密集的任务)

任务 8

Infer medications that are either planned for administration or discussed as a potential option, paired with their consideration (planned or hypothetical) and potential adverse events discussed in the note.

译:推断计划给药或作为潜在选项讨论的药物,配对其性质(计划/假设)与笔记中讨论的潜在不良事件。

  • schema 对应:treatment-related(意向层)+ intent 修饰 + advanced relation(讨论中的不良事件)
  • 能力台阶:★★★(纯推理——答案散布于意向性语言,需区分 planned 与 hypothetical)

附录 B:schema 消费指南

B.1 十大宽类别 → 已知子类映射

十大宽类别与已从原文确证的子类举例(完整 59 实体清单以随数据发布的 annotation.conf 为权威,论文未逐条罗列——这本身是一个「文档边界」事实,见 FACTS.md 第 9 节遗留疑点):

宽类别 原文确证的子类/细节举例
test-related / test results-related 「tumor test」之下含 radiology test、genomic test、diagnostic lab test 三子类
temporal information 事件 datetime 全局锚定(八任务中 6 个要求配时间)
tumor-related biomarkers、histology、stage(TNM/数字)、grade、metastasis(附部位与确诊操作)
treatment-related 药物 + 起止时间 + 理由 + 连续性状态 + 不良事件;未来用药意向(planned/hypothetical)
procedure-related 介入性操作 + 部位 + 指征 + 结局
patient characteristics 人口学与背景(subject-info.csv 提供对应表格化字段)
clinical trial 试验名(去标识误删-回填的特殊照顾对象)
disease state 缓解/进展等状态判定(任务 4 的推断基础)
location-related 原发/转移/淋巴结部位
test results-related 数值与叙述性结果文本

B.2 四个配置文件怎么读

文件 内容 建议用法
annotation.conf 新标注 schema 的 BRAT 格式全量定义 59/23/26 的唯一权威清单——读它,不要靠论文数
visual.conf 实体类型颜色编码 快速建立「类型→颜色」直觉,辅助校对
tools.conf 标注辅助工具描述(如查询 Google) 了解当时的标注工作流
kb_shortcuts.conf 标注快捷键 复刻标注环境时用

B.3 与 OMOP/FHIR 的关系

论文引文脉络里提到 OMOP Common Data Model 的肿瘤扩展(Belenkaya et al., JCO CCI 2021,引文 [17])作为表格数据方向的对位工作:OMOP 路线把肿瘤信息装进标准化表结构,CORAL 路线把叙事文本标成可抽取结构——两者是「同一个终点的两条路」。CORAL 发布包不含到 OMOP/FHIR 的官方映射脚本,需要互操作转换的团队自行设计(这也是 DAIMS 的 I 维度扣分点)。

附录 C:逐项证据链自证

关键数字/事实 来源 位置
40 份(20 乳腺癌 + 20 胰腺癌)、UCSF 2012–2022 PhysioNet 数据页 Abstract /content/curated-oncology-reports/1.0/
9028 实体 / 9986 修饰符 / 5312 关系 PhysioNet 数据页 Abstract + Data Description 同上(两处一致)
59 entities / 23 attributes / 26 relations PhysioNet 数据页 Methods 末句 同上
200 份自动标注(各病种 100)+ 分层规则 PhysioNet 数据页 Methods 第 3 段 同上
GPT-4 0314 / GPT-3.5-turbo 0613 / API 2023-05-15 / 温度 0 PhysioNet 数据页 Methods 评测段 同上
BLEU 0.73 / ROUGE 0.72 / EM-F1 0.51 / accuracy 68% PhysioNet 数据页 Abstract 同上
人工评测协议(独立肿瘤学家、20 份、11 实体 + 20 关系任务) PhysioNet 数据页 Methods 评测段末 同上
十大宽类别原文列举 PhysioNet 数据页 Methods 第 1 段 同上
三类关系(descriptive/temporal/advanced) PhysioNet 数据页 Methods 第 1 段 同上
Philter 去标识 + 患者级日期偏移 PhysioNet 数据页 Methods 第 2 段 + Ethics 同上
IRB #18-25163 与 #21-35084 PhysioNet 数据页 Methods + Ethics 同上
外部专家验证去标识 PhysioNet 数据页 Ethics 段 同上
BRAT 目录结构 + subject-info.csv + 四 conf PhysioNet 数据页 Data Description + Usage Notes 同上
资助四源(U01FD005978 / UL1 TR001872 / P30CA082103 / CZ 慈善) PhysioNet 数据页 Acknowledgements 同上
六作者署名与顺序 PhysioNet 数据页头 同上
发布日期 2024-02-07、版本 1.0、RRID:SCR_007345 PhysioNet 数据页头 + Versions 区 同上
双 DOI(v69y-xa45 / vwq3-fj85) PhysioNet 数据页 Discovery 区 同上
Topics 六项、Project Views 390 PhysioNet 数据页 Discovery 区 同上
License 1.5.0 / DUA 1.5.0 / CITI 课程要求 PhysioNet 数据页 Access 区 同上
arXiv:2308.03853(2023-08-07,cs.CL) arXiv 摘要页 arxiv.org/abs/2308.03853
NEJM AI DOI 10.1056/AIdbp2300110 出版社页(订阅墙外的元数据) doi.org 解析
GitHub 仓库 MadhumitaSushil/OncLLMExtraction PhysioNet Project Website 字段 + arXiv 页 + 论文引文 [29] 三源一致 github.com/MadhumitaSushil/OncLLMExtraction
地区限制伪影原文 本环境实抓页面 Files 区 「Data is not available in your region due to legal or policy restrictions.」

附录 D:补充问答(FAQ)

Q:CORAL 的「C-O-R-A-L」缩写怎么展开?
A:官方展开为 Curated(首字母小写 c 在词中)、expert-Curated Oncology Reports to Advance Language model inference——注意中间的 “medical” 一词不参与缩写(这也是名称口径争议的一个来源,坑 1)。直译即「专家精选肿瘤报告集,助力语言模型推理」。

Q:为什么没有测试集/训练集划分?
A:因为它的本体是评测基准资源而非比赛数据集:40 份金标准由使用者自行决定用法(全量评测、留出校准均可);论文自己的评测也是全量 40 份跑自动指标、半数 20 份跑人工评测。强行发布 train/test 划分反而会误导「当训练集用」的错误姿势(坑 4)。

Q:能只用 breastca 子集或只用 pdac 子集吗?
A:可以,但要在结论里声明子集口径——两病种的信息形态差异极大(§3.1),单病种分数与全量分数不可比。论文的 GPT-4 优势任务(癌症所致症状、未来用药)恰是跨病种平均后的结论。

Q:subject-info.csv 里有哪些字段?
A:数据页只说明它含「对应的人口学信息」(corresponding demographic information)并以 coral_idx 关联;逐字段清单未在数据页罗列(遗留待核项,需下载后查看,见 FACTS.md 第 9 节)。unannotated 侧的 CSV 同样含人口学信息与笔记文本。

Q:GPT-4 的 68% 准确率是怎么算的?
A:独立肿瘤学家(非标注团队)随机抽取半数笔记(乳腺癌 10 + 胰腺癌 10),对 GPT-4 的输出逐任务判定:11 个实体抽取任务(排除 grade、TNM stage、summary stage 三类)+ 20 个关系抽取任务,得到平均 68%。它与 EM-F1 0.51 不可换算(坑 8)。

Q:为什么排除 grade/TNM stage/summary stage 的人工评测?
A:论文未给出理由(遗留疑点)。合理推测是这三类表述异质性高(「stage III」「T3N1M0」「stage 3B」混用),二值对错裁决歧义大、成本高。该排除意味着 68% 这一数字不含分期/分级抽取质量——引用时注意口径。

Q:FLAN-UL2 是什么、为什么选它?
A:FLAN-UL2 是 20B 参数的开放权重指令模型(UL2 架构 + FLAN 指令调优,论文引文 [24] 指向作者 Yi Tay 的发布说明)。选它为三被测模型中的开源代表:医疗结构不能都走商业 API,需要一个「可以拉回自家内网跑」的基线参照。

Q:数据集发布后有没有更新计划?
A:截至本文撰写,PhysioNet 版本区仅 v1.0(2024-02-07),无更新声明;latest DOI 与 version DOI 当前指向同一内容。若未来发布 v2(例如扩充第三病种或回填 200 份子集),latest DOI(坑 2)会自动指向新版本——跟踪该 DOI 即可。

Q:想引用 CORAL 的 schema 但不用它的数据,可以吗?
A:可以。schema 的机器可读形态(annotation.conf)在受控包内,但 schema 结构本身已在论文与 PhysioNet 页面公开描述(十大类、59/23/26、三类关系);GitHub 仓库(CC BY-NC-SA)亦含相关定义。引用论文 + 数据 DOI 即可,遵循 CC BY-NC-SA 的非商业-相同方式共享条款。

附录 E:术语对照表

英文术语 本文译法 首现
annotation schema 标注 schema / 信息表示体系 §2.1
broad categories 宽类别 §2.2
fine-grained subcategories 细粒度子类 §2.2
entities / attributes (modifiers) / relations 实体 / 属性(修饰符)/ 关系 §2.3
descriptive / temporal / advanced relations 描述性 / 时间性 / 高级关系 §2.4
negation / experiencer / intent 否认 / 经历者 / 意图 §2.6
progress note 进展笔记 §0
oncology fellow 肿瘤学专科医师(fellow) §3.4
standoff format standoff 格式(标注与原文分离存储) §3.4
copy-forward 直接复制粘贴段(病程中的植入式报告) §3.4
de-identification 去标识 §3.2
patient-level offset 患者级(日期)偏移量 §3.2
credentialed access 受控访问(认证用户制) §6.1
Data Use Agreement (DUA) 数据使用协议 §6.1
zero-shot 零样本 §4.1
exact match F1 (EM-F1) 精确匹配 F1 §4.3
hallucination 幻觉(生成不存在的信息) §4.6
partial response 部分响应(输出缺失信息) §4.6
silver standard 银标准(自动标注、无人工核对) 坑 6
benchmark 评测基准 坑 4

附录 F:参考文献分轨清单

数据资源轨

  1. Sushil M, Kennedy V, Mandair D, Miao B, Zack T, Butte A. CORAL: expert-Curated medical Oncology Reports to Advance Language model inference (version 1.0). PhysioNet, 2024-02-07. DOI: 10.13026/v69y-xa45. RRID:SCR_007345.
  2. PhysioNet latest version DOI: 10.13026/vwq3-fj85.
  3. Pollard T, Moody BE, Lehman L-wei H, et al. PhysioNet as a global platform for biomedical research. Nature Health. 2026;1(8):792–795. DOI: 10.1038/s44360-026-00096-z.

论文轨
4. Sushil M, et al. Extracting detailed oncologic history and treatment plan from medical oncology notes with large language models. arXiv:2308.03853 [cs.CL], 2023-08-07.
5. 同题正式版(标题不含 “medical”)。NEJM AI, 2024-03-13. DOI: 10.1056/AIdbp2300110.

代码与工具轨
6. OncLLMExtraction(源代码、prompts、评测脚本). https://github.com/MadhumitaSushil/OncLLMExtraction (PhysioNet Project Website 同指此处).
7. Stenetorp P, Pyysalo S, Topić G, Ohta T, Ananiadou S, Tsujii J. brat: a Web-based Tool for NLP-Assisted Text Annotation. EACL 2012 Demonstrations, 102–107.
8. BRAT rapid annotation tool manual. https://brat.nlplab.org/manual.html
9. Radhakrishnan L, Schenk G, Muenzen K, et al. A certified de-identification system for all clinical text documents for information extraction at scale. JAMIA Open. 2023;6(3):ooad045.(Philter,论文引文 [22])
10. Tay Y. A New Open Source Flan 20B with UL2.(FLAN-UL2 发布说明,论文引文 [24])

方法论先辈轨(论文引文节选)
11. Roberts K, Si Y, Gandhi A, Bernstam E. A FrameNet for Cancer Information in Clinical Narratives. LREC 2018.(引文 [19])
12. Datta S, Bernstam EV, Roberts K. A frame semantic overview of NLP-based information extraction for cancer-related EHR notes. J Biomed Inform. 2019;100:103301.
13. Belenkaya R, Gurley MJ, Golozar A, et al. Extending the OMOP Common Data Model and Standardized Vocabularies to Support Observational Cancer Research. JCO Clin Cancer Inform. 2021;(5):12–20.(引文 [17])
14. Papineni K, et al. BLEU: a Method for Automatic Evaluation of Machine Translation. ACL 2002.(引文 [25])
15. Lin C-Y. ROUGE: A Package for Automatic Evaluation of Summaries. 2004.(引文 [26])


存照与边界声明:本文所有硬数字与事实以 PhysioNet 数据页(/content/curated-oncology-reports/1.0/,抓取于 2026-09-28)为一手来源,arXiv 摘要页与 GitHub 仓库元数据为旁证;NEJM AI 正式版全文在订阅墙内,其分项分数表与若干细节(三项待核,见 writing/coral/FACTS.md 第 9 节)未纳入正文。双口径冲突(名称/标题、双 DOI、modifiers/attributes 用词、unannotated 命名、40 份规模定位)均已在正文坑点与 FACTS.md 存照。地区限制伪影为本环境实抓记录,不代表所有网络环境。

附录 G:读者画像与上手路径

三类典型读者的差异化上手路径(30 分钟级 / 半天级 / 周级):

画像一:临床 NLP 研究者(要发论文/跑对比实验)

  • 30 分钟:读本文 §2(schema)+ §4(评测协议),建立「59/23/26 + 八任务 + 三指标」的心智模型;
  • 半天:PhysioNet 三步走申请(§6.1)同时克隆 OncLLMExtraction 仓库读 prompts;下载后先跑 annotation.conf 与 subject-info.csv 的数据审计;
  • 周级:按 §十一复现清单搭评测管线,先复现 GPT-4 基线(0.73/0.72/0.51),再跑自己的模型;分病种拆分报告(§3.9 的教训)。

画像二:医院信息科/真实世界数据团队(要做管线选型)

  • 30 分钟:读 §1 十问十答 + §6(获取与许可),确认自身 CITI 培训状态与合规边界(坑 7);
  • 半天:读 §3(标注方法论)评估「用 GPT-4 预标注 + 人工复核」管线的可行性;对照坑 6 划清银/金标准边界;
  • 周级:在受控环境内用 200 份自动标注做管线压测,40 份金标准做验收集;任何产出进入临床流程前补人工审核层。

画像三:LLM 应用工程师(做医疗产品)

  • 30 分钟:读 §4.5-4.6(结果与错误模式)——重点关注幻觉与部分响应两类失败;读坑 7/坑 8;
  • 半天:克隆代码仓,把八任务 prompts 当作「信息抽取需求说明书」读;理解温度 0 与版本锁定的复现意义(§4.8);
  • 周级:若产品场景是肿瘤病程管理,用 CORAL 的错误模式清单设计自家评估集(覆盖因果归因、意向判别、连续性状态三类难点)。

附录 H:库内条目使用场景对照矩阵

九个可互链条目与 CORAL 在典型工作流中的角色对照(rid 见 §8.1):

工作流 首选资源 CORAL 的角色 协同方式
领域预训练/继续预训练 mimic-iv-note(47)、mtsamples(350) 不适用(体量不足,坑 4) 预训练用大体量语料,评测用 CORAL
放射报告结构化 radgraph(561) 互补评测靶 RadGraph 测报告理解,CORAL 测病史整合
临床 IE 模型对比评测 coral 主战场 同协议复现 §4 基线
时间信息抽取 thyme(524) 时间锚定评测补充 两套时间标注口径互证
医患对话理解 meddialog(210)、imcs-21(200) 文体对照 笔记体(CORAL)vs 对话体分工
临床推理/NLI mednli(648) 粒度互补 句级蕴含(MedNLI)+ 笔记级结构(CORAL)
共享任务式训练 i2b2-n2c2-nlp(14) 高密度评测补充 i2b2 练、CORAL 考
肿瘤 RWD 结构化 cancerlinq(388) 叙事侧方法源 结构化汇聚(cancerlinq)与叙事抽取(CORAL)互镜像

附录 I:遗留疑点与待核清单(正文引用汇总)

以下三项在正文多处被标记为待核,汇总于此(详见 writing/coral/FACTS.md 第 9 节存照):

  1. NEJM AI 正式版的分项分数表:GPT-3.5-turbo 与 FLAN-UL2 的逐任务分数、GPT-4 的分任务拆分、分病种拆分——正式版全文在订阅墙内,本文只使用了 PhysioNet 数据页公开的四个总体平均数(BLEU 0.73 / ROUGE 0.72 / EM-F1 0.51 / accuracy 68%)与定性结论(GPT-4 overall best、强项与错误模式);
  2. 200 份自动标注子集的质量指标:论文与数据页均未给出该子集相对人工标准的抽检一致率——「银标准无质量声明」是设计事实而非遗漏,但使用者应有知情预期;
  3. subject-info.csv 的字段明细:数据页只述及「人口学信息 + coral_idx 关联」,逐字段清单需受控下载后确认;
  4. 引文 [18] 的具体条目:PhysioNet 页面 References 区抓取列表缺该行(§5.4 存照),需对照论文 PDF 补全。

附录 J:CORAL 在医疗 AI 评测资源中的正交定位

把 CORAL 与三类近缘评测资源放在同一张正交表里,能看清它到底「测什么、不测什么」:

资源类型 代表 测的能力 不测的能力 与 CORAL 的关系
医学知识问答基准 USMLE 系列题、MedQA 类 医学知识的再现与选择题推理 真实病历文本的理解与结构化 CORAL 的被测能力是前者之外的一整层——「读懂这份笔记」
临床 IE 经典数据集 i2b2/n2c2 各年任务(14) 单任务 span/关系抽取 跨段因果、意向、时间推理 同一能力层的不同深度与广度(§5.1)
放射报告结构化 RadGraph(561) 报告内实体-关系 全病史整合与治疗叙事 体裁正交(§8.1)
肿瘤笔记深标注基准 CORAL 59 类实体 + 23 属性 + 26 关系的全谱系抽取与推断 知识问答、影像判读、对话生成 ——

这张表的读法:CORAL 不与任何一类竞争「更好的那个」,而是填补「真实肿瘤病程叙事的全面结构化理解」这一空白格子(§5.2 的「生态空位」结论的另一面表述)。组合使用的启示:一个「医疗 LLM 全面体检」可以由知识问答(考知识)+ 经典 IE(考基础抽取)+ CORAL(考病史整合与临床推断)三层构成,三层分数不可互相替代。

附录 K:数据集速查卡(一页版)

┌─────────────────────────────────────────────────────────────┐
│ CORAL 速查卡                                                │
├─────────────────────────────────────────────────────────────┤
│ 全名     CORAL: expert-Curated medical Oncology Reports    │
│          to Advance Language model inference                │
│ slug     physionet.org/content/curated-oncology-reports/1.0 │
│ DOI      v1.0: 10.13026/v69y-xa45                           │
│          latest: 10.13026/vwq3-fj85(坑 2)                 │
│ RRID     SCR_007345                                         │
│ 发布     2024-02-07,版本 1.0(唯一版本)                    │
│ 论文     arXiv:2308.03853(2023-08-07,标题含 medical)     │
│          NEJM AI 10.1056/AIdbp2300110(2024-03-13,不含)   │
│ 机构     UCSF(Butte 实验室)                               │
│ 规模     40 份专家标注(20 乳腺癌 + 20 胰腺癌,2012-2022)  │
│          + 200 份 GPT-4 自动标注(各 100,分层抽样)        │
│ 注释     9028 实体 + 9986 修饰符 + 5312 关系 = 24326 条     │
│ schema   59 实体 / 23 属性 / 26 关系;十大宽类别;          │
│          descriptive/temporal/advanced 三类关系             │
│ 格式     BRAT standoff(.txt+.ann 成对)+ 4 conf + CSV      │
│ 关联键   coral_idx(文件名去扩展名)                        │
│ 获取     PhysioNet credentialed:注册 + CITI 证书 +         │
│          DUA 1.5.0(§6.1);代码在 GitHub 公开              │
│ License  数据: PhysioNet Credentialed Health Data 1.5.0     │
│          代码: CC BY-NC-SA                                  │
│ 基线     GPT-4(0314): BLEU4 0.73 / ROUGE1 0.72 / EM-F1 0.51 │
│          / 人工准确率 68%(20 份,11 实体+20 关系任务)     │
│          对手: GPT-3.5-turbo(0613)、FLAN-UL2(零样本)      │
│ 强项     肿瘤特征、药物抽取;癌症所致症状、未来用药推断     │
│ 弱项     部分响应缺信息;笔记特定幻觉                       │
│ 红线     坑 3 跳过段 / 坑 4 非训练集 / 坑 6 银标准 /        │
│          坑 7 HIPAA / 坑 8 指标口径                         │
│ 引用     数据 DOI + 论文 + PhysioNet 平台,三重缺一不可     │
└─────────────────────────────────────────────────────────────┘

附录 L:五种反模式(错误用法的速判)

  1. 「40 份太少了,先用 200 份自动标注训练吧」——双重错误:把基准当训练集(坑 4)+ 把银标准当可靠语料(坑 6)。正确动作:40 份做评测,200 份做弱监督冷启动并声明质量等级。
  2. 「CORAL F1 是 0.51,比我模型 span-F1 0.6 低,所以我更强」——口径污染(坑 8):0.51 是自由文本 EM-F1,与 span-F1 不可比。正确动作:同协议重跑你的模型报 EM-F1。
  3. 「把整份 .txt 扔给模型再对 24326 条注释算召回」——忽略跳过段(坑 3):复制粘贴段本来就不在标注承诺内。正确动作:按任务取叙事章节。
  4. 「数据是去标识的,直接贴给任意 LLM API 没问题」——合规幻觉(坑 7):去标识不解除使用协议义务;论文自己都走了 HIPAA 合规通道。正确动作:等效合规通道或自部署开源模型。
  5. 「引用 NEJM AI 论文就行,数据 DOI 无所谓」——引用不全:PhysioNet 明确要求三重引用(§6.4),且数据 DOI 是可复现性的锚。正确动作:数据 DOI(version)+ 论文 + 平台引用三条齐上。

附录 M:缩写与术语速查总表

按字母序列出全文出现的缩写(含义与首现章节):

缩写 全称/含义 首现
AJB / MS / VEK / DM / BYM / TZ 作者姓氏缩写(COI 段用法):Atul Butte / Madhumita Sushil / Vanessa Kennedy / Divneet Mandair / Brenda Miao / Travis Zack §7.6
API Application Programming Interface,应用程序接口 §4.1
BAA Business Associate Agreement,商业伙伴协议(HIPAA 术语) 坑 7
BLEU-4 Bilingual Evaluation Understudy(4-gram),机器翻译评价指标 §4.3
BRAT brat rapid annotation tool,Web 标注工具 §3.4
CITI Collaborative Institutional Training Initiative,机构培训倡议(证书体系) §6.1
CERSI Center of Excellence in Regulatory Sciences and Innovation,监管科学与创新卓越中心 §7.4
CORAL expert-Curated medical Oncology Reports to Advance Language model inference 全文
CTSI Clinical and Translational Science Institute,临床与转化科学研究所 §7.4
DUA Data Use Agreement,数据使用协议 §6.1
EM-F1 Exact Match F1-score,精确匹配 F1 §4.3
EHR Electronic Health Record,电子健康记录 Topics
FDA U.S. Food and Drug Administration,美国食品药品监督管理局 §7.4
FLAN-UL2 20B 开放权重指令模型(UL2 架构 + FLAN 调优) §4.1
HIPAA Health Insurance Portability and Accountability Act,健康保险流通与责任法案 坑 7
HPC High-Performance Computing,高性能计算 §7.3
IE Information Extraction,信息抽取 §4.3
IRB Institutional Review Board,机构审查委员会(伦理委员会) §3.3
LLM Large Language Model,大语言模型 全文
NCI National Cancer Institute,美国国家癌症研究所 §7.4
NER Named Entity Recognition,命名实体识别 §5.1
NIBIB / NHLBI NIH 下属生物医学成像与生物工程研究所 / 心肺血液研究所 §8.4
NLP Natural Language Processing,自然语言处理 Topics
OMOP Observational Medical Outcomes Partnership,观察性医疗数据通用数据模型 §8.1
PDAC Pancreatic Ductal Adenocarcinoma 相关目录名(数据目录用 pdac 指代胰腺癌笔记) §3.6
Philter UCSF 认证临床文本去标识软件 §3.2
RWD Real-World Data,真实世界数据 附录 H
RRID Research Resource Identifier,研究资源标识符 §6.4
standoff 标注与原文分离存储的格式传统 §3.4
TNM Tumor-Node-Metastasis 分期系统 §4.2
UCSF University of California, San Francisco,加州大学旧金山分校 全文
USMLE United States Medical Licensing Examination,美国医师执照考试 §5.3

附录 N:中文临床 NLP 社区的适配性讨论

CORAL 是英文、美式医疗体系、肿瘤专科的资源。中文社区使用它时,有三个层面的适配问题值得预先想清楚(本节为面向本库读者的编译性分析):

语言层:能不能翻译着用? 机器翻译后的「标注对齐」会引入双重误差(翻译噪声 × 标注噪声),直接把翻译版当金标准不可取。可行的用法是把 CORAL 当方法蓝本而非数据本体:schema 结构(十大类/三类关系/修饰维度)、任务设计(八任务)、评测协议(三指标 + 人工子集)都可以跨语言移植,移植后再用中文肿瘤病历重建小规模金标准。

体系层:病历文体差异。 美式进展笔记(progress note)的 SOAP 结构、assessment/plan 段的意向性语言(任务 8 的土壤),与中文病历的病程记录/上级查房/阶段性小结文体不同——任务 8 这类「未来用药推断」在中文文体中的对应物需要重新设计,不能照搬 prompt。

流程层:合规与获取。 CITI 证书与 PhysioNet DUA 对中国使用者同样开放(平台无国籍限制条款),但机构内走 HIPAA 等效审护的路径要预先与法务确认;地区可用性伪影(§6.5)在申请前可先小规模验证网络可达性。

值得移植的三件东西(性价比排序):① 「跳过段显式标记」规则——中文病历同样存在插入的检查报告体,这条规则直接可用;② 「去标识误差回填 + IRB 双号」流程——为中文数据集建设提供合规栈模板(§3.10);③ 「银/金标准物理分离」的目录结构——零成本习惯,收益巨大。

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-29。事实陈述以 PhysioNet 数据页(curated-oncology-reports,2026-09-28 抓取存档)、NEJM AI 正式版论文(DOI: 10.1056/AIdbp2300110)、arXiv:2308.03853 预印本与 GitHub OncLLMExtraction 代码仓为源;两处名称口径差异(数据页带 “medical”、论文标题不带)、双 DOI 并行(version 10.13026/v69y-xa45 / latest 10.13026/vwq3-fj85)、modifiers(9986) 与 attributes(23) 的计数口径分岔、参考文献 [18] 缺行、“Accessed 2/05/2024” 日期格式歧义等原始文档缺陷已在 §9 坑点、附录 C 与附录 I 存照。条目与库内 mimic-iv-note、radgraph、i2b2-n2c2-nlp、thyme、mtsamples、meddialog、mednli、imcs-21、cancerlinq 等条目互链,构成临床文本深标注与肿瘤 NLP 评测的检索面。待核事项与维护触发点见附录 I。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • thyme — 共享标签:医疗NLP / 临床文本 / 关系抽取 / 肿瘤学
  • trec-pm — 共享标签:医疗NLP / 电子健康记录 / 肿瘤学
  • cantemist — 共享标签:医疗NLP / 临床文本 / 肿瘤学
  • loinc — 共享标签:医疗NLP / 临床文本 / 电子健康记录
  • radgraph — 共享标签:医疗NLP / 临床文本 / 关系抽取
  • metabric — 共享标签:电子健康记录 / 肿瘤学 / 乳腺癌
  • carmen — 共享标签:医疗NLP / 临床文本 / 肿瘤学
  • mednli — 共享标签:医疗NLP / 临床文本 / 电子健康记录
  • mediqa — 共享标签:医疗NLP / 临床文本 / 电子健康记录
  • i-spy — 共享标签:电子健康记录 / 肿瘤学 / 乳腺癌

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集