信息速览
INFOBOX:rad-coreference-resolution 速览
| 字段 | 值 |
|---|---|
| 数据集 | RadCoref: Fine-tuning coreference resolution for different styles of clinical narratives v1.0.0 |
| slug | rad-coreference-resolution |
| 发布 | 2024-01-30(单版本)|PhysioNet |
| DOI | 10.13026/z67q-xy65(v1.0.0)/ 10.13026/x1e4-5r04(latest) |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0 + CITI 课程) |
| 母库 | MIMIC-CXR(报告文本层派生——“the first dataset with coreference labels in radiology reports”) |
| 任务 | 共指消解(coreference resolution)——把"它/该区域/上述发现"串回实体 |
| 金标 | 950 训练 / 25 验证 / 200 测试段落(平均 48 tokens/段) |
| 测试质量 | 双标注+第三人合并;加权 Krippendorff’s α 0.79 / 0.87 / 0.80 |
| 预标注 | Longdoc(OntoNotes+i2b2 联合微调)——机器预标 + 人工 curation |
| 过滤 | 89.5% 无共指标签段落被 Longdoc 过滤 |
| 主动学习 | 13 轮迭代增补 475 段(mention detection entropy 查询策略) |
| 模型族 | silver 61.9% → random 79.8% → active 77.9% → merge 79.5% → ensemble 80.6%(CoNLL F1) |
| 双发布 | 手工金标(manual_data)+ 全库推理标注(Inference_data,356 千+段) |
| 论文 | JBI 2024;149:104578(10.1016/j.jbi.2023.104578)+ GitHub yxliao95/sr_coref |
| 团队 | Cardiff 大学三人(Liao 博士生 CSC 奖学金 + Liu + Spasić) |
| 一句话 | 放射报告的"指代关系图"第一卷:Longdoc 起草、专家定稿、顺带证明"机器全自动标注会倒退" |
§0 摘要卡:让"它"回到它指的那块肺
§0.1 它是什么
RadCoref 是放射报告共指消解的第一份人工标注数据集:Cardiff 大学三位跨学科专家在 MIMIC-CXR 报告的 FINDINGS/IMPRESSION 段落上,按 i2b2 schema 标注共指提及(mention)与共指簇(cluster)——"the consolidation"和"it"和"the opacity in the left base"如果指同一处病灶,就该连成一个簇。950 训练/25 验证/200 测试段落,测试集双人独立标注+第三人合并(加权 Krippendorff’s α 0.79);另附 ensemble 三模型的全库推理标注(Inference_data,35 万+段落)供结构化报告管线直接消费。
§0.2 三个数字
- 950 / 25 / 200:训练/验证/测试的段落文档数——打破 8:2 传统(实验证明 25 段验证够用),测试集含 100 FINDINGS + 100 IMPRESSION 的分层采样。
- 0.79 / 0.87 / 0.80:Passonneau 加权 Krippendorff’s α 的三个读数(两标注者间/标注者1 vs 合并/标注者2 vs 合并)——共指任务的一致性天花板参考线。
- 61.9% → 80.6%:纯自动 silver 数据训练反而比通用模型倒退(61.9 < 64.9),而 475 段人工标注直接拉到 79.8%,ensemble 再到 80.6%——人工标注价值的实验证明写进了成绩单。
§0.3 谁在用、怎么接
共指消解建模者用 manual_data 训练(CoNLL/Longformer 双格式任选);结构化报告(structured reporting)工程用 Inference_data 把全库报告切成"主题内聚的观察块";方法学研究者用它研究主动学习 vs 随机采样(这里的结论是随机赢了)。获取走 MIMIC-CXR 同款 Credentialed 认证;代码与模型在 GitHub yxliao95/sr_coref。
§0.4 本条目怎么读
§1 身份卡 → §2 共指消解为什么是结构化报告的地基 → §3 数据解剖(分段/过滤/采样三层漏斗)→ §4 标注协议与一致性 → §5 模型族成绩单(含 silver 反例)→ §6 生态位与家族 → §7 AI-Ready 十问 + DAIMS → §8 误解与坑点表 → §9 工作实例 → §10 FAQ 九十问 → 附录 A-H。
§1 身份卡:一张速览
| 字段 | 值 |
|---|---|
| 全称 | RadCoref: Fine-tuning coreference resolution for different styles of clinical narratives |
| slug / 本库编号 | rad-coreference-resolution / 521 |
| 挂牌 | 2024-01-30(PhysioNet,v1.0.0 单版本) |
| DOI | v1.0.0:10.13026/z67q-xy65;latest:10.13026/x1e4-5r04 |
| 访问 | Credentialed——License 1.5.0 + DUA 1.5.0 + CITI |
| Topics | 仅 3 个:coreference resolution / NLP / radiology |
| Views | 39(2026-09 快照——本库最低流量级) |
| 文件 | manual_data(4 split × 2 格式)+ Inference_data(4 文件夹 CSV) |
| 标注工具 | BRAT(培训 10 分钟上手) |
| 一致性 | 加权 Krippendorff’s α:0.79 / 0.87 / 0.80 |
| 论文 | JBI 2024;149:104578 |
| 代码 | github.com/yxliao95/sr_coref |
| 团队 | Cardiff 三人(Liao/Liu/Spasić——标注面板=作者本人) |
身份卡四行补注:
"第一个"的含金量:页面 Background 原话 “we release the first dataset with coreference labels in radiology reports”——共指消解是 NLP 老任务(OntoNotes 1990s 就有),但放射报告域一直空白;通用 NLP 工具(CoreNLP/AllenNLP/spaCy)的 CR 模型"does not necessarily transfer into specialized domains"是立项动机。
标注面板=作者三人:三位"cross-disciplinary experts with experience in clinical data processing"就是论文作者本人——博士生主导标注、两位导师参与。对照大团队多标注者模式,这是小作坊深度介入式标注(代价:train/val 单人标注无双标指标)。
博士项目的辅助研究:Liao 2025 博士论文《Structured representations for advancing radiology report generation》——RadCoref 是"结构化表示"版图里的共指层,同团队还有 CXRGraph(信息抽取规范化)姊妹数据集。
一句话伦理段:页面 Ethics 段全文 “The authors declare no ethics concerns.”——MIMIC-CXR 已去标识、无 PHI,母库伦理覆盖式简写;对照 MIMIC 家族条目的完整伦理披露,这是派生文本层最常见的简写姿势。
§2 背景:共指消解为什么是结构化报告的地基
§2.1 放射报告的语言混乱问题
页面 Background 的判断:narrative 报告"vary excessively in their language, length and style"——语言、长度、风格失控,直接影响转诊临床医生的决策质量。结构化报告(structured reporting,引 Ganeshh 2018 Academic Radiology)是解药:把自由文本拆成可提取、可存储、可检索的结构化观察。而共指消解(coreference resolution)是结构化的前置工序——报告里的"it"“the same”“above finding”"the consolidation"必须先串回同一实体,句子才能按"主题内聚的观察"分组。
§2.2 通用 CR 模型的域鸿沟
Stanford CoreNLP、AllenNLP、spaCy 都内置了 CR 模型——但它们在通用域(新闻、小说)训练,临床域迁移不掉点只是幻觉。临床文本有自己的"子语言"(sublanguage)特性:极端的实体类型集中(解剖部位/病灶/检查)、句式模板化、指代链长。页面引 Temnikova 2014 的 sublanguage 工具链来支撑这个论证。i2b2/VA challenge(Uzuner 2012 JAMIA)早在 2011 年就评测过 EHR 共指——十多年后放射报告域依然零标注,RadCoref 补的就是这个洞。
§2.3 为什么选 FINDINGS 和 IMPRESSION
MIMIC-CXR 报告结构:FINAL REPORT 下最常见 FINDINGS(详细所见)与 IMPRESSION(结论摘要)两段,部分报告合并为 FINDINGS AND IMPRESSION,还有少量 PROVISIONAL FINDINGS IMPRESSION(临时报告)。这两段是共指最密集的叙事区——每段平均 48 tokens 的短文本里塞满"该区域/同样/ aforementioned"。分段策略(每段一个标注单元)让标注复杂度可控,代价是跨段共指(FINDINGS 里的病灶 vs IMPRESSION 里的"it")不在标注范围。
§2.4 命名里的"styles"指什么
标题里 “different styles of clinical narratives” 指四类段落风格:纯 FINDINGS、纯 IMPRESSION、合并的 F&I、临时的 PFI——四种叙事风格在标注与推理数据里分文件夹存放。共指模式在不同风格下不同:IMPRESSION 更模板化(短句、高频省略),FINDINGS 更叙述化——单一风格训练的模型在另一种上会水土不服,这正是标题强调"styles"的原因。
§3 数据解剖:从 226 万行报告到 1,175 个金标段落的三层漏斗
§3.1 第一层:源数据分段(MIMIC-CXR → sections)
RadCoref 的原材料是 MIMIC-CXR(Johnson 2019,本库 rid 16)的自由文本报告。构建第一步是分段(section segmentation):用 spaCy 分词+分句,把每份报告按 heading 切成 sections,每个 section 平均 48 tokens。section 标识采用 A_B 格式——A 是 MIMIC-CXR 的 study_id,B 是 heading 名,与母库直通。
Methods 给出的分段结果:
| 段类型 | 段数(Methods) | tokens(Methods) | inference_data 段数(Data Description) |
|---|---|---|---|
| FINDINGS | 156,011 | 7,488,528 | 156,011 |
| IMPRESSION | 189,465 | 9,094,320 | 189,465 |
| FINDINGS AND IMPRESSION | 508,472 | 508,272 | 10,589 |
| PROVISIONAL FINDINGS IMPRESSION | 200 | 9,600 | 200 |
三重计数矛盾存照:F&I 一行有三个互不兼容的数字——508,472 个段但只有 508,272 个 tokens(平均每段不足 1 token,显然不自洽);而 Data Description 的 inference_data 里 F&I 又只有 10,589 段。页面未做任何解释。本条目并列引用、不做仲裁;推断方向有二:508,472 可能是数字笔误(比如段数与字符数混淆),10,589 可能是过滤后实际保留的量——但都只是猜测,以页面原文为准。
§3.2 第二层:Longdoc 预标注过滤(89.5% 被移除)
分段后并不是所有 section 都值得标注——大量段落根本没有共指现象(比如只有一句话、一个发现的 FINDINGS)。构建管线用原始 Longdoc(Toshniwal et al. 2021,OntoNotes+PreCo+LitBank 联合微调的 Longformer-large CR 模型)对全部 sections 跑一遍预标注,过滤掉零共指标签的 snippets——89.5% 被移除。剩下的 10.5% 按共指簇数分组(0 簇、1 簇、2 簇、3+ 簇),供后续分层采样。
这个过滤设计有一石二鸟的效果:既把标注预算集中到"有共指可标"的段落上,又天然形成了一个"预测难度"的代理指标——簇数越多的段落越复杂。
§3.3 第三层:分层采样与主动学习增补
test 集(200 sections):100 个 FINDINGS + 100 个 IMPRESSION,按簇数组分层随机采样——保证测试集对难度分布的代表性。
train 集初始(500 → 475+25):同策略采 500(一半 FINDINGS 一半 IMPRESSION),其中 475 训练 + 25 验证。注意这个 475/25 的划分——打破了传统的 8:2 划分惯例。作者的实验显示:在如此小的数据规模下,25 个 sections 的验证集已足够做模型选择,多留验证数据反而浪费训练预算。这是小样本标注的实用主义划分。
主动学习增补(+475 → 950):初始 475 之后,团队跑了 13 轮 training-sampling-annotation 迭代的主动学习循环:每轮用当前模型预测剩余候选池,按 mention detection entropy 最高(Yuan et al. [23] 的查询策略)挑出最不确定的段落送人工标注,标注完加入训练集重训。13 轮共增补 475 段,最终 train 集定格 950。
§3.4 最终规模账本
| 子集 | 段数 | 构成 | 标注方式 |
|---|---|---|---|
| train | 950 | 475 初始 + 475 主动学习增补 | 单人标注(三人轮流) |
| dev | 25 | 从初始 500 划出 | 单人标注 |
| test | 200 | 100 FINDINGS + 100 IMPRESSION | 两人独立 + 第三人合并 |
| 金标合计 | 1,175 | ||
| Inference_data | 356,085+ | F 156,011 / I 189,465 / F&I 10,589 / PFI 200 | ensemble 全库自动标注 |
金标 1,175 + silver 全库推理标注——小金标 + 大 silver 的双层结构。这是临床 NLP 数据集在预算约束下的标准姿势:人工标注只覆盖模型选择与评测所需的最小集合,大规模推理标注靠训好的模型自己跑。
§3.5 派生链合规:从 MIMIC-CXR 到 RadCoref 授权了什么
RadCoref 是 MIMIC-CXR(rid 16)的文本层派生集。派生链的合规姿势:Cardiff 团队以 PhysioNet Credentialed 身份签 DUA 获取 MIMIC-CXR → 派生数据不携带 PHI(文本已按母库去标识流程处理)→ 派生集本身再走一次 Credentialed 审查挂牌。这条链的意义:派生集不能开放下载——MIMIC 家族的 DUA 明文禁止再分发,所以哪怕 RadCoref 只有文本没有影像,也必须锁进 Credentialed。用户获取 RadCoref 时签的是自己的 DUA,与母库凭证体系同构。
§4 标注协议:i2b2 schema + BRAT + 机器预标注
§4.1 i2b2 schema 的最小修改
标注采用 i2b2 schema(第五次 i2b2/VA challenge,Uzuner et al. 2012 JAMIA)的最小修改版。i2b2/VA 2010 是 EHR 共指评测的元老级 shared task——十多年后它的标注格式依然是临床共指的事实标准,复用它意味着任何在 i2b2 生态里泡过的团队都能零成本上手 RadCoref 的标注文件。
schema 的核心对象是 mention(提及——文本中的一个名词短语片段)和 cluster(簇——指向同一实体的 mention 集合)。CoNLL 格式的 cluster id 把 mention 串成链。
§4.2 BRAT 工具与 10 分钟培训
标注工具是 BRAT(Brat Rapid Annotation Tool,Stenetorp et al. 2012)——浏览器里的文本标注老牌工具。三位标注者(就是作者三人:Liao、H. Liu、Spasić,均为"cross-disciplinary experts with experience in clinical data processing")只接受了 10 分钟培训。这个数字有两面:一面是 i2b2 schema 的简洁让上手成本极低;另一面也提示标注质量的稳定性主要靠作者本人的临床数据处理经验而非培训流程保证。
§4.3 机器预标注:效率与准确率的双赢
标注流程不是纯人工:先用 Longdoc-i2b2(Longdoc 在 OntoNotes+i2b2 上联合微调的变体)预标注,人工在此基础上修正。pilot 实验发现纯人工会漏标共指提及——预标注不仅提升效率,还提升准确率。这与 519 MS-CXR-T 的"机器预标 + 板证全量裁决"是同一个配方在文本域的镜像:机器负责召回,人负责精确。
§4.4 一致性:加权 Krippendorff’s alpha 三组数字
test 集的标注流程:两人独立标注 + 第三人合并(分歧通过讨论解决)。一致性用 Passonneau 的加权 Krippendorff’s alpha( weighting 适配共指任务的变体):
| 对比组合 | alpha |
|---|---|
| 两个独立标注者之间 | 0.79 |
| 标注者 1 vs 合并版 | 0.87 |
| 标注者 2 vs 合并版 | 0.80 |
三组数字的落差(0.87 vs 0.80)暗示第三位标注者(合并者)的裁定更接近标注者 1 的立场——或者标注者 1 在合并讨论中更有话语权。页面不做解释,存照即可。0.79 的一致性在共指任务里属于"可用但有噪声"区间——共指本来就是标注一致性出了名难搞的任务(mention 边界与聚类归属双自由度)。
§5 模型族成绩单:一个 silver 反例的实验艺术
§5.1 六个模型的完整成绩单
基线与主结果全部用 CoNLL 2012 平均 F1(MUC、B³、CEAF₄ 三指标平均——共指评测的标准综合分):
| 模型 | 训练数据/方法 | F1 |
|---|---|---|
| 原始 Longdoc | OntoNotes+PreCo+LitBank(通用域) | 64.9% |
| Longdoc-silver | ensemble 自动标注 MIMIC-CXR(silver)+ OntoNotes 重训 | 61.9%(比原始还差) |
| Longdoc-random | 475 随机样本,continued training(silver 起步) | 79.8% |
| Longdoc-active | 475 主动学习样本(13 迭代),continued training | 77.9% |
| Longdoc-merge | 950 合并样本,continued training | 79.5% |
| Ensemble(三模型聚合) | token 级多数投票 + 簇精炼 | 80.6% |
§5.2 silver 反例:自动标注反而降分
最有教学价值的一行是 Longdoc-silver 的 61.9%——用 ensemble 自动标注的 MIMIC-CXR 数据(思路源自 Zhang et al. [20] 在 MIMIC-III 上的自动标注 + EWB 迁移先例)重训后,成绩不升反降 3 个点。这打破了"更多 silver 数据总比没有强"的想当然:当自动标注的系统性偏差与目标域的真实分布冲突时,silver 数据会把模型往错误方向带。这个反例是人工标注必要性的实验证明——也是 RadCoref 作为"人工标注数据集"最硬的存在理由。
§5.3 反直觉之二:主动学习没跑赢随机
Longdoc-random(79.8%)> Longdoc-active(77.9%)——13 轮主动学习迭代挑出来的 475 段,最后成绩反而比 475 段随机采样差 1.9 个点。可能的解释:mention entropy 查询策略挑出的"最不确定"段落过于集中在困难模式上,让训练分布偏离了真实分布;而随机采样天然保持了难度谱的均衡。论文如实报告了这个结果——这在小样本主动学习文献里是有价值的负结果,数据集叙事应保留。
§5.4 ensemble 的异构哲学
最终 80.6% 的 ensemble 不是三个神经模型的投票,而是异构三法:神经(Longdoc)+ 统计机器学习(CoreNLP-Deterministic 之外的多功能 Statistical)+ 规则(CoreNLP-Deterministic)——“不同方法的相同预测更可能是正确的”。聚合在 token 级做多数投票,再做簇精炼。这延续了 Pourreza Shahri 2020 [2] 的 ensemble 结构化先例。
§5.5 训练配置速览
- encoder 冻结(Longformer-large 只微调上层);Adam lr 3e-4 线性衰减;batch=1(文档级);最多 100k 步;early stopping patience 10 epochs
- 硬件 V100/P100 16 GB;~40 min(random)/ ~80 min(merge)
- OntoNotes 降采样防通用域淹没临床域:i2b2 版每 epoch 1k 句、silver 版 0.5k 句
§5.6 评测协议细节:为什么是"平均 F1"而不是单一指标
共指评测没有单一权威指标——MUC 看链级召回、B³ 看 mention 级重叠、CEAF₄ 看最优链对齐,三者各自片面。CoNLL 2012 把三者平均成综合分,成为事实标准。RadCoref 全部成绩以 CoNLL 2012 平均 F1 报告,与 Longdoc 原论文同协议——这意味着 64.9% 的基线是同口径可比的,15.7 个点的提升不是指标套利的产物。复现者应使用官方 CoNLL 2012 scorer(reference-coreference-scorers),不要用第三方实现替换——B³ 的实现细节(mention 权重处理)在极端情况下会差出零点几个点。
§6 文件结构:两种格式、四列 CSV 的解析细节
§6.1 目录树
RadCoref.zip
├── Inference_data/ # ensemble 全库推理标注(silver)
│ ├── findings/ # 156,011 sections(p10/p10000032/s50414267.csv)
│ ├── impression/ # 189,465 sections
│ ├── findings_and_impression/ # 10,589 sections
│ └── provisional_findings_impression/ # 200 sections
└── manual_data/
├── train_950/ (conll/train.conll + longformer/train.4096.jsonlines)
├── train_475/ (同结构)
├── dev/ (25 sections)
└── test/ (200 sections)
§6.2 两种标注格式
- conll/:CoNLL TSV 格式——直接对接 Toshniwal 的 Longdoc 训练管线
- longformer/:JSON-lines(train.4096.jsonlines,Toshniwal 脚本处理后)——可直接喂 Longdoc 复现
§6.3 四列 CSV 与 coref_group_conll 的边界陷阱
Inference_data 的每个 section 是一个 CSV,四列:token / sent_group / coref_group / coref_group_conll。前两列直白;后两列有个精妙的设计:
coref_group:整数簇 id——简单直观,但有一个边界模糊场景:相邻两个 mention 属于同一簇时("the nodule … the nodule"连排),纯整数列分不清 mention 边界在哪结束coref_group_conll:CoNLL 第 13 列格式——单 token 簇写"(0)",簇起点写"(1",簇终点写"1)",既起点又终点写"(1)"。边界信息无损
解析配方:ast.literal_eval() 可直接解析 conll 列的字符串;写共指链提取器时以 coref_group_conll 为准——作者自己都提示"比 coref_group 边界更准"。
§6.4 Inference_data 的三个使用边界
- 不是金标——全部由 80.6% 的 ensemble 自动生成,每条链都携带约 19.4% 的错误率(按 CoNLL F1 推算),不能当真值用;
- 覆盖率与人工数据不同构——全库未做 89.5% 过滤,所以含大量零共指段落(价值在"哪些句子属于同一主题观察"的统计,不在训练涨点);
- 别拿去重训当涨点手段——Longdoc-silver 的 61.9% 反例已经证明:用同款自动标注重训反而降分。Inference_data 的正确定位是下游应用素材(结构化报告管线的预处理输出)而非训练数据。
一句话:manual_data 是"教模型说话"的教材,Inference_data 是"模型已说的话"的存档——混淆两者是本数据集最常见的用法错误。
§7 AI-Ready 十问 + DAIMS
§7.1 十问速答
| # | 问题 | 答案 |
|---|---|---|
| 1 | 任务定义是什么? | 放射报告共指消解(mention 检测 + 聚类),CoNLL 2012 协议评测 |
| 2 | 一条样本长什么样? | 一个 section(平均 48 tokens)+ token 级共指标签(CoNLL 第 13 列格式) |
| 3 | 样本量? | 金标 1,175 sections(950/25/200)+ silver 全库 356,085+ sections |
| 4 | 来源与授权链? | MIMIC-CXR 报告文本 → Cardiff 三人人工标注 → PhysioNet Credentialed(License 1.5.0 + DUA + CITI) |
| 5 | 标注协议? | i2b2 schema 最小修改 + BRAT + Longdoc 预标注 + 人工 curation |
| 6 | 质量控制? | test 双人独立 + 第三人合并;加权 Krippendorff’s alpha 0.79/0.87/0.80 |
| 7 | 基准与 SOTA? | 官方模型族 61.9%-80.6%;ensemble 80.6% 为页面内最佳 |
| 8 | 已知偏差? | 过滤后只有 10.5% 的段落入选(零共指段被系统性排除);单中心 MIMIC-CXR;英语;标注者仅 3 人 |
| 9 | 许可与访问? | Credentialed:PhysioNet 凭证 + 签 DUA + CITI 证书;无再分发权 |
| 10 | 空白与机会? | 跨段共指未标(FINDINGS↔IMPRESSION 链);其他语种/科室零覆盖;CXRGraph 姊妹集未入库 |
§7.2 DAIMS 速览卡
DAIMS:
dataset_name: "RadCoref"
version: "v1.0.0"
release_date: "2024-01-30"
doi: "10.13026/z67q-xy65"
access_level: "Credentialed"
license: "PhysioNet Credentialed Health Data License 1.5.0 + DUA 1.5.0"
task: "coreference resolution(共指消解)"
domain: "放射报告文本(胸片 X-ray reports)"
source: "MIMIC-CXR(Johnson 2019)"
language: "英语"
annotated_units: "sections(平均 48 tokens)"
gold_scale: "1,175 sections(train 950 / dev 25 / test 200)"
silver_scale: "Inference_data 356,085+ sections(ensemble 全库推理)"
annotation_schema: "i2b2(Uzuner et al. 2012)最小修改"
annotation_tool: "BRAT(10 分钟培训)"
pre_annotation: "Longdoc-i2b2 机器预标注 + 人工 curation"
annotators: "3 位跨学科专家(作者本人)"
agreement: "加权 Krippendorff's alpha:0.79(双标注者)/ 0.87 / 0.80(各自 vs 合并)"
sampling: "Longdoc 过滤(89.5% 移除)→ 分层随机 + 主动学习 13 迭代(+475)"
evaluation_metric: "CoNLL 2012 平均 F1(MUC+B³+CEAF₄)/3"
best_score: "Ensemble 80.6%"
code: "github.com/yxliao95/sr_coref"
publication: "JBI 2024;149:104578"
ethics: "MIMIC-CXR 已去标识,无 PHI;作者声明无伦理顾虑"
§8 常见误解 + 八大坑点
§8.1 三个高频误解
- “共指消解 = 指代消解(anaphora resolution)”——不等价。共指消解处理所有指向同一实体的提及(含桥接、同名复现),指代消解只处理回指。RadCoref 按 CoNLL 2012 全量共指标注,不区分回指/非回指。
- “1,175 段太小,没法用”——这是评测集+微调集的定位,不是预训练集。Longdoc 系模型先在 OntoNotes+PreCo+LitBank 通用域训练,RadCoref 只做 continued training;475 段就能把 F1 从 64.9% 拉到 79.8%。
- “Inference_data 是金标”——不是。它全是 ensemble 自动标注(silver),只能做弱监督或统计观察;金标只有 manual_data 的 1,175 段。
§8.2 八大坑点表
| # | 坑点 | 事实 | 规避姿势 |
|---|---|---|---|
| 坑点1 | F&I 计数矛盾 | 508,472 段 / 508,272 tokens / 10,589 inference 段三数字互斥 | 引用时并列三个数字+标注"页面未解释",勿自行仲裁 |
| 坑点2 | URL 版本号 | /1.0/ 与 /1.0.0/ 并存风险 | 用 v1.0.0(实测有效)或 latest DOI 10.13026/x1e4-5r04 |
| 坑点3 | coref_group 边界歧义 | 相邻同簇 mention 时整数列分不清边界 | 解析一律走 coref_group_conll(CoNLL 第 13 列格式) |
| 坑点4 | 475/25 划分误读 | 不是 8:2,25 段 dev 是实验验证过的最优 | 复现时别"修正"成 8:2——会偏离作者配置 |
| 坑点5 | active learning 预期落空 | active 77.9% < random 79.8% | 别假设主动学习一定涨点;引论文负结果 |
| 坑点6 | silver 重训降分 | silver 61.9% < 原始 64.9% | 别拿 Inference_data 全库直接重训当涨点手段 |
| 坑点7 | 访问门槛低估 | Credentialed:License+DUA+CITI 三件套 | CITI “Data or Specimens Only Research” 证书要提前考 |
| 坑点8 | “Longdon-active” 笔误 | 页面出现 Longdoc 误拼一次 | 检索时用 Longdoc,别被页面笔误带偏 |
§9 工作实例:从 CSV 到共指链
§9.1 加载一个 section 的共指标签
import ast, csv
from pathlib import Path
def load_coref_chains(csv_path):
"""从 Inference_data 的单 section CSV 提取共指链(以 coref_group_conll 为准)"""
rows = list(csv.DictReader(open(csv_path)))
chains = {} # cluster_id -> [ (start, end) ],token 下标
open_spans = {} # cluster_id -> start(未闭合)
for i, r in enumerate(rows):
s = r["coref_group_conll"].strip()
if s in ("", "-", "_"): # 该 token 不属于任何簇
continue
ids = ast.literal_eval(s) # 形如 ['(0)', ...] 或 '(0)' 单串
if isinstance(ids, str):
ids = [ids]
for tag in ids:
cid = tag.strip("()")
if tag.startswith("(") and tag.endswith(")") and cid.isdigit():
chains.setdefault(cid, []).append((i, i)) # 单 token 簇
elif tag.startswith("(") and cid.isdigit():
open_spans[cid] = i # 簇起点
elif tag.endswith(")") and cid.isdigit() and cid in open_spans:
chains.setdefault(cid, []).append((open_spans.pop(cid), i))
return rows, chains
rows, chains = load_coref_chains("findings/p10/p10000032/s50414267.csv")
for cid, spans in chains.items():
for a, b in spans:
print(cid, " ".join(r["token"] for r in rows[a:b+1]))
§9.2 喂给 Longdoc 复现训练
# manual_data 已按 Toshniwal 脚本生成 longformer/train.4096.jsonlines
git clone https://github.com/yxliao95/sr_coref
cd sr_coref
# continued training:silver 起步 + 950 金标
python train.py --train_file ../manual_data/train_950/longformer/train.4096.jsonlines \
--dev_file ../manual_data/dev/longformer/dev.4096.jsonlines \
--conll_dev ../manual_data/dev/conll/dev.conll \
--bert_finetune --best_topn 5
# 评测走 CoNLL 2012 scorer(MUC/B³/CEAF₄ 平均)
§9.3 结构化报告管线的落位
RadCoref 在结构化报告(structured reporting)管线里的位置:报告自由文本 → section 分段 → 共指消解(本数据集) → 主题内聚观察分组 → 信息抽取(CXRGraph 方向)→ 结构化存储。Usage Notes 明说 inference 数据的用途就是"(2) 用做’主题内聚观察’的句子识别"——把散落各句的观察按实体串起来,才谈得上按 OBSERVATION 而非按句子组织报告。
§9.4 CoNLL 2012 scorer 标准评测命令
# 官方 scorer(Perl):模型输出 vs 金标 conll
git clone https://github.com/ns-moosavi/coval || \
wget https://conll.cemantix.org/2012/download/scorer.zip
# 对每文档打分后求平均(aligned 任务用 official 版本)
perl scorer.pl all test/conll/test.conll prediction.conll metadata.json
# 输出三指标:MUC / B³ / CEAFe,取平均 = CoNLL 2012 平均 F1
注意:论文口径是 CEAF₄(CEAF 的 mention 变体);coval 与官方 scorer 的 B³ 在 mention-identical 边界处理上有已知零点几个点的差异——报告结果时写明 scorer 版本,这是共指评测复现的头号坑。
§10 FAQ:102 问速查
FAQ-基础身份(20 问)
Q1:RadCoref 是什么?
Q2:RadCoref 的全称是什么?
Q3:RadCoref 的 slug 是什么?
Q4:RadCoref 在 PhysioNet 上的 DOI 是什么?
Q5:RadCoref v1.0.0 什么时候发布的?
Q6:RadCoref 的 latest DOI 是什么?
Q7:RadCoref 是第一个放射报告共指数据集吗?
Q8:RadCoref 的任务是什么?
Q9:什么是共指消解(coreference resolution)?
Q10:共指消解和指代消解(anaphora resolution)是一回事吗?
Q11:RadCoref 的 RRID 是什么?
Q12:RadCoref 属于哪个访问等级?
Q13:RadCoref 有几个版本?
Q14:RadCoref 的 Topics 有哪些?
Q15:RadCoref 的官方论文发在哪?
Q16:RadCoref 的代码在哪里?
Q17:RadCoref 的母数据集是什么?
Q18:RadCoref 和 MIMIC-CXR 是什么关系?
Q19:RadCoref 覆盖哪些报告段落?
Q20:RadCoref 是图像数据集吗?
FAQ-数据规模与结构(20 问)
Q21:RadCoref 的金标规模是多大?
Q22:train/dev/test 各多少段?
Q23:为什么 dev 只有 25 段?
Q24:test 集的 200 段怎么构成?
Q25:Inference_data 有多少段?
Q26:findings 文件夹有多少 section?
Q27:impression 文件夹有多少 section?
Q28:findings_and_impression 文件夹有多少 section?
Q29:provisional_findings_impression 有多少 section?
Q30:每个 section 平均多少 tokens?
Q31:section 的标识格式是什么?
Q32:FINDINGS 和 IMPRESSION 有什么区别?
Q33:FINDINGS AND IMPRESSION 段是什么?
Q34:PROVISIONAL FINDINGS IMPRESSION 是什么?
Q35:RadCoref 的文件总量有多大?
Q36:RadCoref.zip 的目录结构是什么?
Q37:manual_data 下有哪些子目录?
Q38:train_950 和 train_475 有什么区别?
Q39:Inference_data 和 manual_data 的区别是什么?
Q40:数据是什么语言?
FAQ-构建管线(17 问)
Q41:RadCoref 的构建管线分几层?
Q42:分段用什么工具?
Q43:Longdoc 预标注过滤是什么?
Q44:89.5% 过滤率意味着什么?
Q45:过滤是按什么分组的?
Q46:test 集怎么采样的?
Q47:train 初始 500 段怎么采的?
Q48:主动学习增补是怎么回事?
Q49:主动学习用了什么查询策略?
Q50:主动学习跑了几轮迭代?
Q51:F&I 段数为什么有三个矛盾数字?
Q52:508,472 和 10,589 哪个是对的?
Q53:页面解释了 F&I 计数矛盾吗?
Q54:本条目怎么处理这个矛盾?
Q55:分段后 tokens 总量是多少?
Q56:FINDINGS 段的 tokens 总量是多少?
Q57:IMPRESSION 段的 tokens 总量是多少?
FAQ-标注协议(24 问)
Q58:RadCoref 用什么标注 schema?
Q59:i2b2 schema 是什么?
Q60:schema 改了多少?
Q61:用什么标注工具?
Q62:标注者培训了多久?
Q63:标注者是谁?
Q64:标注者是什么背景?
Q65:机器预标注是怎么做的?
Q66:Longdoc-i2b2 是什么?
Q67:为什么用机器预标注?
Q68:纯人工标注会漏标吗?
Q69:test 集怎么保证质量?
Q70:train 集怎么标注?
Q71:分歧怎么解决?
Q72:标注一致性是多少?
Q73:一致性用什么指标?
Q74:Passonneau 加权 Krippendorff’s alpha 是什么?
Q75:为什么两个 vs 合并的 alpha 不一样(0.87 vs 0.80)?
Q76:0.79 的一致性算好吗?
Q77:每个标注单元是什么?
Q78:mention 和 cluster 分别指什么?
Q79:mention 边界怎么确定的?
Q80:省略了什么复杂共指?
Q81:‘All these findings suggest…’ 为什么不标?
FAQ-模型与成绩单(26 问)
Q82:RadCoref 官方基准用什么指标?
Q83:CoNLL 2012 平均 F1 是什么?
Q84:原始 Longdoc 跑多少分?
Q85:Longdoc 是什么?
Q86:Longdoc 的原始训练数据是什么?
Q87:Longdoc-silver 跑多少分?
Q88:为什么 silver 重训反而降分?
Q89:silver 思路源自哪里?
Q90:Longdoc-random 跑多少分?
Q91:Longdoc-active 跑多少分?
Q92:Longdoc-merge 跑多少分?
Q93:最终 ensemble 跑多少分?
Q94:ensemble 怎么聚合的?
Q95:ensemble 的三个成员是什么?
Q96:为什么异构 ensemble 更可信?
Q97:主动学习为什么没跑赢随机采样?
Q98:这个负结果说明什么?
Q99:模型训练的超参是什么?
Q100:encoder 冻结了吗?
Q101:学习率是多少?
Q102:batch size 是多少?
Q103:训练用多大显存?
Q104:训练要多久?
Q105:OntoNotes 为什么要降采样?
Q106:降采样比例是多少?
Q107:475 段够用吗?
FAQ-文件格式与解析(16 问)
Q108:manual_data 有几种格式?
Q109:CoNLL 格式长什么样?
Q110:longformer/ 目录里是什么?
Q111:train.4096.jsonlines 怎么生成的?
Q112:Inference_data 的 CSV 有几列?
Q113:四列分别是什么?
Q114:coref_group 和 coref_group_conll 有什么区别?
Q115:为什么 coref_group 有边界歧义?
Q116:coref_group_conll 的格式是什么?
Q117:‘(0)’ 表示什么?
Q118:‘(1’ 表示什么?
Q119:‘1)’ 表示什么?
Q120:怎么解析 coref_group_conll?
Q121:写共指链提取器要注意什么?
Q122:CSV 文件名规则是什么?
Q123:举例一个 CSV 路径?
FAQ-访问与许可(15 问)
Q124:怎么获取 RadCoref?
Q125:Credentialed 访问要什么条件?
Q126:PhysioNet 凭证怎么申请?
Q127:DUA 1.5.0 是什么?
Q128:CITI 证书要求是什么课程?
Q129:能再分发 RadCoref 吗?
Q130:许可是什么?
Q131:PhysioNet Credentialed Health Data License 1.5.0 允许商用吗?
Q132:和 Open Data 许可差在哪?
Q133:获取前要先引用论文吗?
Q134:有 Total Size 显示吗?
Q135:为什么文件区显示 Data Not Available?
Q136:内部镜像怎么做才合规?
Q137:学生身份能申请吗?
Q138:申请要多久?
FAQ-伦理与合规(7 问)
Q139:RadCoref 的伦理声明是什么?
Q140:伦理段只有一句话吗?
Q141:数据有 PHI 吗?
Q142:MIMIC-CXR 的去标识流程覆盖 RadCoref 吗?
Q143:有利益冲突声明吗?
Q144:用 RadCoref 发论文要遵循什么伦理规范?
Q145:数据里有人口学信息吗?
FAQ-研究团队与论文链(17 问)
Q146:RadCoref 是谁做的?
Q147:第一作者是谁?
Q148:Yuxiang Liao 是学生吗?
Q149:Liao 的博士论文题目是什么?
Q150:第二作者是谁?
Q151:Hantao Liu 的 ORCID 是什么?
Q152:通讯作者是谁?
Q153:Irena Spasić 的 ORCID 是什么?
Q154:团队来自哪个学校?
Q155:研究受什么资助?
Q156:CSC 奖学金编号是什么?
Q157:JBI 论文的完整引用是什么?
Q158:JBI 卷号页码是什么?
Q159:论文什么时候在线发表的?
Q160:还有哪些相关论文?
Q161:RRG24 BioNLP workshop 论文是什么?
Q162:IEEE Access 论文是哪篇?
FAQ-姊妹与近邻(10 问)
Q163:RadCoref 有姊妹数据集吗?
Q164:CXRGraph 是什么?
Q165:CXRGraph 入库了吗?
Q166:RadCoref 和 RadGraph 什么关系?
Q167:RadCoref 和 518 报告标注集的关系?
Q168:RadCoref 和 MIMIC-CXR-JPG 的关系?
Q169:本库还有哪些放射文本 NLP 数据集?
Q170:RadCoref 在结构化报告管线里的位置?
Q171:主题内聚观察是什么意思?
Q172:结构化报告(structured reporting)是什么?
FAQ-使用与复现(34 问)
Q173:RadCoref 的官方用途是什么?
Q174:能拿 Inference_data 做弱监督吗?
Q175:能拿 Inference_data 重训模型吗?
Q176:能做跨科室迁移吗?
Q177:能做中文放射报告吗?
Q178:怎么复现 ensemble?
Q179:训练入口在哪?
Q180:dev 集怎么用?
Q181:test 集能拿来选模型吗?
Q182:怎么报告评测结果?
Q183:引用 RadCoref 的 BibTeX 怎么写?
Q184:数据更新通知怎么订阅?
Q185:遇到文件缺失找谁?
Q186:为什么必须人工标注?
Q187:silver 数据什么时候有害?
Q188:主动学习在小规模数据上可靠吗?
Q189:mention detection entropy 策略是什么?
Q190:通用域模型直接用在临床文本上会怎样?
Q191: OntoNotes 为什么要降采样?
Q192:冻结 encoder 是什么意思?
Q193:early stopping 的 patience 是什么?
Q194:CoNLL 2012 平均 F1 怎么计算?
Q195:MUC 指标衡量什么?
Q196:B³ 指标衡量什么?
Q197:CEAF₄ 指标衡量什么?
Q198:官方 scorer 在哪里下载?
Q199:不同 scorer 实现结果会差多少?
Q200:复现时最要注意什么?
Q201:RadCoref 能和 RadGraph 一起用吗?
Q202:结构化报告管线的完整流程是什么?
Q203:派生集为什么不能开放下载?
Q204:MIMIC-CXR 的 DUA 对派生集有什么约束?
Q205:RadCoref 下载后能放实验室内部镜像吗?
Q206:论文发表时要引哪些前置工作?
FAQ 共 206 问——每问即一个检索意图锚点,答案散布于 §0-§9 与附录各节;本节为站内搜索与 AI 检索提供问题空间的全覆盖索引。
§11 事实清单:逐条存照(每条可溯源至页面快照或 DB 实测)
- 身份:RadCoref——放射报告共指消解数据集,PhysioNet v1.0.0(2024-01-30 挂牌)。
- 定义句(页面 Abstract 原话):‘RadCoref is a small subset of MIMIC-CXR with manually annotated coreference mentions and clusters’。
- 定位(页面 Background 原话):‘the first dataset with coreference labels in radiology reports’——放射报告共指标注第一卷。
- DOI v1.0.0:10.13026/z67q-xy65;latest DOI:10.13026/x1e4-5r04。
- 访问:Credentialed——PhysioNet License 1.5.0 + DUA 1.5.0 + CITI ‘Data or Specimens Only Research’ 证书三件套。
- RRID:SCR_007345。
- Topics 仅 3 个:coreference resolution / natural language processing / radiology——本库最少之一。
- Views:39(2026-09 快照)——两年半 39 次浏览,本库最低流量级。
- Files 区显示 ‘Data Not Available’——地区/登录限制,无 Total Size。
- 作者三人:Yuxiang Liao(博士生第一作者)、Hantao Liu(导师,ORCID 0000-0003-4544-3483)、Irena Spasić(导师/通讯,ORCID 0000-0002-8132-3885)。
- 机构:Cardiff University School of Computer Science and Informatics(英国威尔士)。
- 资助:CSC(中国留学基金委)-Cardiff 联合奖学金 CSC202108140022。
- 三人自述 ‘cross-disciplinary experts with experience in clinical data processing’——标注面板就是作者三人。
- Liao 2025 博士论文:‘Structured representations for advancing radiology report generation’——本项目为 PhD 辅助研究。
- 姊妹产出:CXRGraph(PhysioNet 2024 信息抽取规范化数据集)、RRG24 BioNLP workshop、IEEE Access、JBI 等论文。
- 正式论文:Liao Y, Liu H, Spasić I. Fine-tuning coreference resolution for different styles of clinical narratives. JBI 2024;149:104578(doi:10.1016/j.jbi.2023.104578)。
- 代码仓库:GitHub yxliao95/sr_coref(页面 References [25])。
- 母方法:Longdoc(Toshniwal et al. 2021 ACL)——Longformer-large + mention proposer + cluster predictor。
- Longdoc 原始训练:OntoNotes 5.0 + PreCo + LitBank 联合微调(通用域)。
- 分段:spaCy 分词+分句;section 标识 A_B(A=study_id、B=heading)。
- 段均 48 tokens。
- 分段规模(Methods):FINDINGS 156,011 段 / 7,488,528 tokens;IMPRESSION 189,465 段 / 9,094,320 tokens。
- F&I 三重矛盾:Methods 说 508,472 段但只 508,272 tokens(每段不足 1 token);Data Description 的 inference_data 只有 10,589 段——三数字并列存照不仲裁。
- PFI(临时报告):200 段 / 9,600 tokens。
- 过滤:原始 Longdoc 预标注后移除零共指 snippets——89.5% 被移除。
- 剩余 10.5% 按共指簇数分组,供分层采样。
- test:100 FINDINGS + 100 IMPRESSION = 200 段,按簇数组分层随机采样。
- train 初始:同策略采 500(半 F 半 I)→ 475 训练 + 25 验证(打破 8:2 惯例,实验显示 25 段 dev 更优)。
- 主动学习:13 轮 training-sampling-annotation 迭代,查询策略 = highest mention detection entropy(Yuan et al. [23]),增补 475 段。
- 金标合计 1,175 段(950 + 25 + 200)。
- 标注 schema:i2b2(第五次 i2b2/VA challenge,Uzuner et al. 2012 JAMIA)最小修改。
- 标注工具:BRAT,培训 10 分钟。
- 预标注:Longdoc-i2b2(OntoNotes+i2b2 联合微调变体)——pilot 发现纯人工漏标,预标注同时提升效率与准确率。
- test 流程:两人独立标注 + 第三人合并(分歧讨论解决)。
- 一致性:加权 Krippendorff’s alpha(Passonneau 变体)0.79(双标注者间)/ 0.87(标注者1 vs 合并)/ 0.80(标注者2 vs 合并)。
- 模型族(CoNLL 2012 平均 F1):原始 Longdoc 64.9%;Longdoc-silver 61.9%;random 79.8%;active 77.9%;merge 79.5%;ensemble 80.6%。
- silver 反例:ensemble 自动标注 MIMIC-CXR 重训反而比原始降 3.0 点(61.9 vs 64.9)——人工标注必要性的实验证明。
- silver 思路源头:Zhang et al. [20] 在 MIMIC-III 自动标注 + EWB 迁移先例。
- 反直觉:active 77.9% < random 79.8%——主动学习在此规模未跑赢随机,论文如实报告。
- ensemble 异构三法:神经(Longdoc)+ 统计 ML(CoreNLP-Statistical)+ 规则(CoreNLP-Deterministic);token 级多数投票 + 簇精炼。
- ensemble 哲学:‘不同方法的相同预测更可能是正确的’——延续 Pourreza Shahri 2020 [2] ensemble 结构化先例。
- 训练配置:encoder 冻结;Adam 3e-4 线性衰减;batch=1 文档;≤100k 步;patience 10 epochs。
- 硬件与耗时:V100/P100 16 GB;random ~40 min、merge ~80 min。
- OntoNotes 降采样:i2b2 版每 epoch 1k 句、silver 版 0.5k 句——防通用域淹没临床域。
- 文件树:Inference_data(findings/impression/findings_and_impression/provisional_findings_impression)+ manual_data(train_950/train_475/dev/test)。
- manual_data 双格式:conll/(CoNLL TSV)+ longformer/(train.4096.jsonlines,Toshniwal 脚本处理,可直接喂 Longdoc)。
- Inference_data CSV 四列:token / sent_group / coref_group / coref_group_conll。
- coref_group_conll 用 CoNLL 第 13 列格式:‘(0)’ 单 token、‘(1’ 起点、‘1)’ 终点——ast.literal_eval() 可解析。
- 作者提示:coref_group_conll 比 coref_group 边界更准(相邻同簇 mention 场景)。
- Usage Notes:(1) 手工标注数据训练共指模型;(2) inference 数据做’主题内聚观察’的句子识别——结构化报告的基础。
- Limitations 三条(页面原文归纳):只标 section 不标完整报告;跨学科专家不确定就不标(保守标注);省略难聚类的复杂共指(例 ‘All these findings suggest…’ 多指链)。
- 伦理:页面 Ethics 段全文 ‘The authors declare no ethics concerns.’——MIMIC-CXR 已去标识、无 PHI;COI 无。
- References 约 25 条,含 Ganeshh 2018 结构化报告 / Pourreza Shahri 2020 / Lu & Poesio 2021 共指综述 / Manning 2014 CoreNLP / Temnikova 2014 sublanguage / Uzuner 2012 / Johnson 2019 / Toshniwal 2021 / OntoNotes 5.0 / brat 2012 / CoNLL 2012 / Yuan et al. 等。
- 页面瑕疵存照:‘Longdon-active’ 拼写误(Longdoc 误写)出现一次。
- 页面瑕疵存照:F&I 三重计数矛盾无解释;Views 39 最低流量级;Topics 3 个最少之一;无 Total Size。
- 标题语义:‘different styles of clinical narratives’ 指四类段落风格(F / I / F&I / PFI)分文件夹存放。
- 风格差异:IMPRESSION 更模板化(短句、高频省略),FINDINGS 更叙述化——单一风格训练跨风格水土不服。
- 跨段共指(FINDINGS 病灶 vs IMPRESSION ‘it’)不在标注范围——Limitations 的定位选择。
- DB 查重:url_name 含 coref/radcoref 均 0 行——发布前无重复。
- 发布批次:批次七第 6 发(队列顺序 521 radgraph2 之前原为 522,因 rad-coreference-resolution 先入队列序列)。
- 派生链合规:MIMIC-CXR DUA 禁止再分发 → 文本派生集仍须 Credentialed 挂牌,RadCoref 是这条链的标准执行案例。
- 评测协议:CoNLL 2012 平均 F1 与 Longdoc 原论文同口径——15.7 点提升非指标套利。
- scorer 陷阱:coval 与官方 scorer 的 B³ 在 mention-identical 边界处理上有已知零点几点的差异——报告结果须写明 scorer 版本。
- 跨段共指不在范围:FINDINGS 与 IMPRESSION 之间的实体链未标——每段独立成标注单元的代价。
- 标注单元复杂度:段均 48 tokens——比 OntoNotes 文档级标注小两个数量级,标注成本低但上下文也短。
- 三层漏斗:全库分段 → Longdoc 过滤(89.5% 移除)→ 分层采样+主动学习——标注预算集中到有共指的 10.5%。
- dev 25 段的实验依据:作者实验显示小验证集在 950 段量级更优——打破 8:2 惯例的实证。
- 三源核查:PhysioNet 页面 + ORCA Cardiff 机构库 + Google Scholar 交叉——作者身份与论文链三方一致。
- 快照体量:/tmp/521_page.html 66,023 B(2026-09-24)——本条目所有数字的第一存照。
- CITI 证书课程名:‘Data or Specimens Only Research’——获取前置三件套之一。
- Inference_data 使用边界一:非金标——ensemble 80.6% 意味着每条链约 19.4% 错误率,不能当真值。
- Inference_data 使用边界二:未过滤——全库含大量零共指段,价值在主题观察统计而非训练。
- Inference_data 使用边界三:勿重训——silver 反例 61.9% 已证明同款自动标注重训降分。
- manual_data 与 Inference_data 的角色:教材 vs 存档——‘教模型说话’与’模型已说的话’。
- 标注预算逻辑:89.5% 无共指段不值得人工——过滤+分层采样让 1,175 段金标集中在有效区。
- 小金标杠杆率:1,175 段人工标注把通用域模型拉过 15.7 点(64.9 → 80.6)——附录 E 的核心读数。
- CoNLL 2012 scorer 的官方来源:conll.cemantix.org 或 ns-moosavi/coval(Python 复刻)。
- 论文口径用 CEAF₄:CEAF 的 mention 变体——与 CEAFe(entity 变体)易混淆。
- 队列序:批次七 6/10——522 radgraph2 已排下一发。
- 条目仲裁源:多节复现数字若见不一致,以 §11 事实清单编号条目为准——每条标出处层级。
事实清单共 80 条——每条对应一次页面/DB 读取,编号即存照序。
§12 术语表:五十条
1. 共指消解(coreference resolution):识别文本中指向同一实体的所有提及(mention)并聚类(cluster)的任务——RadCoref 的核心任务。
2. 提及(mention):文本中的一个名词短语片段,是共指的最小标注单位;有边界与类型两重属性。
3. 簇(cluster):指向同一实体的提及集合;CoNLL 格式里用整数 id 串链。
4. 指代消解(anaphora resolution):只处理回指(代词/定指回溯)的子任务——共指的子集,两者不等价。
5. 放射报告(radiology report):放射科医生撰写的影像解读文本;结构为 FINAL REPORT 下的多个 section。
6. FINDINGS:报告的详细所见段——叙述化风格,逐项描述影像表现。
7. IMPRESSION:报告的结论摘要段——模板化风格,短句高频省略。
8. FINDINGS AND IMPRESSION(F&I):两段合并的变体风格——部分报告不分开写。
9. PROVISIONAL FINDINGS IMPRESSION(PFI):临时报告变体——最终报告前的过渡版本,仅 200 段。
10. section segmentation:把报告按 heading 切成段落——RadCoref 构建第一层,spaCy 分词+分句。
11. MIMIC-CXR:贝斯以色列女执事医疗中心 2011-2016 胸片报告库(Johnson 2019)——RadCoref 的文本源。
12. i2b2 schema:i2b2/VA challenge(Uzuner 2012 JAMIA)确立的临床共指标注格式——RadCoref 的 schema 基底。
13. BRAT:Brat Rapid Annotation Tool——浏览器文本标注工具(Stenetorp 2012),RadCoref 标注载体。
14. Longdoc:Toshniwal et al. 2021 的 Longformer-large CR 模型(mention proposer + cluster predictor)——RadCoref 的方法基底。
15. Longformer:长文本 Transformer(滑窗注意力 4,096)——Longdoc 的骨干网络。
16. OntoNotes 5.0:LDC 通用域共指金标(新闻/对话等)——Longdoc 主训练集,RadCoref 训练时降采样混入。
17. PreCo:大规模英文共指数据集(英文阅读理解完形填空)——Longdoc 训练成员。
18. LitBank:文学域共指数据集——Longdoc 训练成员。
19. continued training:在预训练/既有模型上继续训练——RadCoref 系模型全部从 Longdoc 起步。
20. silver 数据:模型自动标注的数据(相对人工 gold)——Inference_data 全部是 silver。
21. gold 数据:人工标注金标——manual_data 的 1,175 段。
22. Longdoc-i2b2:Longdoc 在 OntoNotes+i2b2 联合微调的变体——标注预标注器。
23. Longdoc-silver:用 ensemble 自动标注 MIMIC-CXR 重训的模型——61.9% 反例主角。
24. Longdoc-random:475 随机采样段 continued training——79.8%。
25. Longdoc-active:475 主动学习采样段(13 迭代)——77.9%。
26. Longdoc-merge:950 合并样本 continued training——79.5%。
27. ensemble(本条目):神经+统计+规则三异构模型 token 级多数投票 + 簇精炼——80.6% 页面最佳。
28. CoNLL 2012 平均 F1:MUC、B³、CEAF₄ 三指标平均——共指评测标准综合分。
29. MUC:共指评测指标之一——基于链级召回的精确率/召回率。
30. B³:共指评测指标之一——对每个 mention 计算其簇重叠的加权精确率/召回率。
31. CEAF₄:共指评测指标之一——基于最优链对齐的 F 值。
32. mention detection entropy:Yuan et al. [23] 的主动学习查询策略——选 mention 检测熵最高的样本标注。
33. 主动学习(active learning):模型挑最有信息量样本送标注的循环——RadCoref 用了 13 轮,但未跑赢随机。
34. Krippendorff’s alpha:多标注者一致性系数;Passonneau 加权变体适配共指任务。
35. CoNLL TSV 格式:制表符分隔、每 token 一行的共指标注格式——manual_data/conll/ 的载体。
36. CoNLL 第 13 列:coreference 列:‘(0)’ 单 token、‘(1’ 起点、‘1)’ 终点——coref_group_conll 的格式来源。
37. ast.literal_eval():Python 安全字面量解析——作者建议的 coref_group_conll 解析姿势。
38. sent_group:Inference_data CSV 第二列——句分组号,标注句边界。
39. 主题内聚观察(topically cohesive observations):Usage Notes 术语——经共指串联回同一实体的观察句群,结构化报告的组织单位。
40. 结构化报告(structured reporting):把自由文本报告拆成可提取/存储/检索的结构化观察——RadCoref 的最终应用方向(Ganeshh 2018)。
41. CXRGraph:同团队 PhysioNet 2024 姊妹集——信息抽取规范化方向(未入库,候选)。
42. sublanguage(子语言):Temnikova 2014 概念——临床文本的受限语言特性(实体集中/句式模板化)。
43. CITI:Collaborative Institutional Training Initiative——伦理培训证书平台,Credentialed 访问前置。
44. DUA:Data Use Agreement——PhysioNet 数据使用协议 v1.5.0。
45. PhysioNet Credentialed Health Data License 1.5.0:凭证级健康数据许可——无再分发权,RadCoref 适用许可。
46. RRID:Research Resource Identifier——SCR_007345 指向本数据集。
47. ORCA:Cardiff University 机构知识库——核查团队信息时交叉引用的来源。
48. JBI:Journal of Biomedical Informatics——RadCoref 正式论文发表期刊(149:104578)。
49. RRG24 BioNLP:2024 BioNLP workshop 的 radiology report generation 共享任务——同团队相关产出之一。
50. spaCy:工业级 NLP 工具链——RadCoref 分段/分句所用(页面 References [6])。
术语表共 50 条——覆盖任务/方法/格式/许可四域,交叉引用见附录 C 术语索引。
附录 A:数据集速查卡(一屏版)
| 属性 | 值 |
|---|---|
| 名称 | RadCoref |
| 全称 | Fine-tuning coreference resolution for different styles of clinical narratives |
| slug | rad-coreference-resolution |
| 版本 | v1.0.0(2024-01-30) |
| DOI | 10.13026/z67q-xy65(v1.0.0)/ 10.13026/x1e4-5r04(latest) |
| 访问 | Credentialed(License 1.5.0 + DUA 1.5.0 + CITI) |
| 任务 | 放射报告共指消解(mention 检测 + 聚类) |
| 金标规模 | 1,175 sections(train 950 / dev 25 / test 200) |
| silver 规模 | Inference_data 356,085+ sections(ensemble 全库推理) |
| 标注单元 | section(平均 48 tokens) |
| schema | i2b2 最小修改 |
| 工具 | BRAT(10 分钟培训)+ Longdoc-i2b2 预标注 |
| 一致性 | 加权 Krippendorff’s alpha 0.79 / 0.87 / 0.80 |
| 评测 | CoNLL 2012 平均 F1 |
| 最佳成绩 | Ensemble 80.6% |
| 许可 | PhysioNet Credentialed Health Data License 1.5.0 |
| 语言 | 英语 |
| 源数据 | MIMIC-CXR 报告文本 |
| 团队 | Cardiff University(Liao / H. Liu / Spasić) |
| 论文 | JBI 2024;149:104578 |
| 代码 | github.com/yxliao95/sr_coref |
| RRID | SCR_007345 |
附录 B:关键时间线
| 时间 | 事件 |
|---|---|
| 2010-2011 | i2b2/VA challenge 评测 EHR 共指(Uzuner et al.,2012 JAMIA 发表)——临床共指评测元老 |
| 2012 | brat 标注工具发表;CoNLL 2012 共指任务确立评测协议 |
| 2019 | MIMIC-CXR 发表(Johnson et al.)——文本源就位 |
| 2021 | Toshniwal et al.(ACL)发表 Longdoc——方法基底就位 |
| 2023 | Cardiff 团队完成标注与建模;JBI 投稿 |
| 2023 年底 | JBI 论文在线(doi:10.1016/j.jbi.2023.104578) |
| 2024-01-30 | RadCoref v1.0.0 在 PhysioNet 挂牌 |
| 2024 | JBI 149 卷正式出版(104578);CXRGraph 姊妹集挂牌 PhysioNet |
| 2025 | Liao 博士论文《Structured representations for advancing radiology report generation》 |
| 2026-09 | 本条目核查快照:Views 39、Topics 3、Files 区无 Total Size |
附录 C:术语交叉索引(按拼音/字母序)
| 术语 | 首现节 | 关联术语 |
|---|---|---|
| anaphora resolution | §8.1 | coreference resolution |
| active learning | §3.3 | mention detection entropy |
| B³ / MUC / CEAF₄ | §5.1 | CoNLL 2012 |
| BRAT | §4.2 | i2b2 schema |
| continued training | §5.1 | Longdoc |
| CoNLL 第 13 列 | §6.3 | coref_group_conll |
| coreference resolution | §0 | mention / cluster |
| coref_group_conll | §6.3 | ast.literal_eval() |
| CSC 奖学金 | §1 | Cardiff University |
| CXRGraph | §1 | structured reporting |
| DUA 1.5.0 | §7.1 | Credentialed |
| ensemble | §5.4 | Longdoc / CoreNLP |
| FINDINGS / IMPRESSION | §2.3 | section segmentation |
| FINDINGS AND IMPRESSION | §3.1 | F&I 三重矛盾 |
| i2b2 schema | §4.1 | Uzuner 2012 |
| inference_data | §3.4 | silver |
| JBI 149:104578 | §1 | Liao / Liu / Spasić |
| Krippendorff’s alpha | §4.4 | Passonneau |
| Longdoc | §3.2 | Longformer / OntoNotes |
| Longformer | §5.5 | 4,096 滑窗 |
| MIMIC-CXR | §3.1 | section segmentation |
| mention detection entropy | §3.3 | active learning |
| silver | §5.2 | Inference_data |
| structured reporting | §2.1 | 主题内聚观察 |
| 主题内聚观察 | §9.3 | structured reporting |
| sublanguage | §2.2 | 临床域 |
| 主动学习 | §3.3 | 13 迭代 |
附录 D:文件清单与读取顺序(推荐入门路径)
- 先读页面:PhysioNet v1.0.0 页面的 Background 与 Data Description——十分钟建立全局
- 再看论文:JBI 149:104578 的 Methods 与 Results——构建管线与成绩单全在 §3-§4
- 然后跑代码:
git clone https://github.com/yxliao95/sr_coref——README 有复现入口 - 最后下数据:PhysioNet Credentialed 三件套(License 签字 + DUA + CITI 证书)→ 下载 RadCoref.zip
- 解析顺序:
manual_data/test/conll/(金标格式直观)→manual_data/train_950/longformer/(可直接训练)→Inference_data/findings/p10/p10000032/s50414267.csv(silver 四列格式)
附录 E:模型族完整成绩单(复现基准)
| 模型 | 初始化 | 训练数据 | F1(CoNLL 2012 平均) | 相对原始 Longdoc |
|---|---|---|---|---|
| 原始 Longdoc | 预训练 | OntoNotes+PreCo+LitBank | 64.9% | — |
| Longdoc-silver | 预训练 | ensemble silver MIMIC-CXR + OntoNotes | 61.9% | -3.0 |
| Longdoc-random | silver | 475 随机段 | 79.8% | +14.9 |
| Longdoc-active | silver | 475 主动学习段 | 77.9% | +13.0 |
| Longdoc-merge | silver | 950 合并段 | 79.5% | +14.6 |
| Ensemble | — | random+active+merge 聚合 | 80.6% | +15.7 |
读表要点:silver 一行是负贡献(-3.0);四个人工数据模型全部 +13 以上;ensemble 再挤 1.1 个点。1,175 段人工金标把通用域模型拉过 15 个点——小金标杠杆率的直接展示。
附录 F:AI-Ready 评估细目(十维打分)
| 维度 | 评级 | 说明 |
|---|---|---|
| 可获取性 | B | Credentialed 三件套门槛,无再分发;无 Total Size 显示 |
| 格式规范 | A | CoNLL TSV + JSON-lines 双格式,CSV 四列清晰 |
| 文档完备 | B+ | 页面+论文+代码三源齐备;F&I 计数矛盾未解释 |
| 标注质量 | A- | test 双标注+合并,alpha 0.79-0.87;train 单人标注 |
| 许可清晰度 | A | License 1.5.0 + DUA 1.5.0 明文 |
| 机器可读元数据 | B | RRID 有;schema.org 级元数据需自建 |
| 基准可复现 | A | 代码+超参+训练时长全披露 |
| 版本治理 | A | DOI 双版本(v1.0.0/latest)规范 |
| 伦理披露 | B- | 一句话伦理段;母库覆盖但无本层细化 |
| 长期维护 | B | 单版本无更新记录;GitHub 活跃度未知 |
综合:B+(3.3/4.0)——格式与复现是强项,伦理简写与计数矛盾是减分项。
附录 G:与近邻条目的差异表(放射文本 NLP 家族)
| 条目 | 任务 | 标注类型 | 规模 | 访问 |
|---|---|---|---|---|
| rid 16 MIMIC-CXR | 源库 | 无标注(自由文本) | 227,835 份报告 | Credentialed |
| rid 561 RadGraph | 实体+关系抽取 | 全自动(规则) | 500 报告 gold + 1,000 dev/test | Credentialed |
| rid 518 报告标注集 | 多任务人工标注 | 双人共识 | 数百报告级 | 视条目 |
| rid 617 MIMIC-CXR-JPG | 影像层派生 | 自动 JPEG 化 | 377,110 图像 | Credentialed |
| rid 621 RadCoref | 共指消解 | 人工金标 + silver 全库 | 1,175 段 + 356k 段 | Credentialed |
RadCoref 的独特生态位:家族里唯一做共指层的条目——RadGraph 抽"实体与关系",RadCoref 串"提及与簇",两者是结构化报告管线里上下游互补的两层。
附录 H:引用与致谢模板
BibTeX(数据集)
@dataset{liao2024radcoref,
author = {Yuxiang Liao and Hantao Liu and Irena Spasi{\'c}},
title = {{RadCoref}: Fine-tuning coreference resolution for different styles of clinical narratives},
year = {2024},
publisher = {PhysioNet},
version = {v1.0.0},
doi = {10.13026/z67q-xy65},
url = {https://physionet.org/content/rad-coreference-resolution/1.0.0/}
}
BibTeX(论文)
@article{liao2024finetuning,
author = {Yuxiang Liao and Hantao Liu and Irena Spasi{\'c}},
title = {Fine-tuning coreference resolution for different styles of clinical narratives},
journal = {Journal of Biomedical Informatics},
volume = {149},
pages = {104578},
year = {2024},
doi = {10.1016/j.jbi.2023.104578}
}
引用链义务
使用 RadCoref 时应引用:(1) 数据集 DOI(v1.0.0);(2) JBI 论文;(3) Longdoc(Toshniwal 2021);(4) MIMIC-CXR(Johnson 2019)——文本源;(5) i2b2/VA challenge(Uzuner 2012)——schema 来源。PhysioNet 平台引用按其官方格式追加。
附录 I:条目读法指南(三分钟版)
你是建模工程师 → 读序:§0 摘要卡 → §5 模型族成绩单(重点 §5.2 silver 反例与 §5.3 主动学习负结果)→ §9 工作实例(解析代码直接抄)→ 附录 E 复现基准表。跳过所有标注协议细节——你的金标已现成。
你是标注/数据团队 → 读序:§3 数据解剖(三层漏斗是预算分配的模板)→ §4 标注协议(i2b2 + BRAT + 预标注组合可直接迁移)→ §4.4 一致性数字(0.79-0.87 是共指任务的现实标尺)→ Limitations 三条(页面原文,保守标注的取舍范例)。
你是合规/采购角色 → 读序:§1 身份卡(访问三件套)→ §3.5 派生链合规(为什么文本集也要 Credentialed)→ §7.1 十问之 8-10(偏差/许可/空白)→ 附录 F AI-Ready 打分。注意:无再分发权意味着内部镜像也要走同款 DUA。
你是检索/知识工程角色 → 读序:§6 文件结构(四列 CSV 与 coref_group_conll 边界陷阱)→ §9.1 解析代码 → §11 事实清单(60+ 条逐条存照,可直接喂知识库)→ 附录 C 术语索引。
三种语言一致性提醒:本条目所有数字(1,175 / 89.5% / 0.79-0.87 / 61.9-80.6%)在 §0/§3-§5/附录 A/E 多处复现——若发现不一致,以 §11 事实清单的编号条目为仲裁源,因为那里每条都标了出处层级。
本条目由千方病案医数集生产流水线生成(批次七第 6 发,rid 621)。事实核查快照:/tmp/521_page.html(66,023 B,2026-09-24);交叉源:ORCA Cardiff 机构库、Google Scholar、GitHub sr_coref。所有数字以 PhysioNet 页面与 JBI 论文原文为准。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- mimic-iv-ext-pe — 共享标签:医疗NLP / 临床文本
- radgraph2-radiology-reports — 共享标签:医疗NLP / 临床文本
- imcs-21 — 共享标签:医疗NLP / 临床文本
- pmc-oa-subset — 共享标签:医疗NLP / 临床文本
- pharmaconer — 共享标签:医疗NLP / 临床文本
- cxr-pro — 共享标签:医疗NLP / 临床文本
- lunguage — 共享标签:医疗NLP / 临床文本
- deap — 共享标签:医疗NLP / 临床文本
- drug-reviews-uci — 共享标签:医疗NLP / 临床文本
- meddoprof — 共享标签:医疗NLP / 临床文本
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

