信息速览

MEDIQA 医疗摘要评测数据集 — 医患对话转结构化病历 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | MEDIQA 医疗摘要评测数据集(MEDIQA-Chat / MEDIQA-Sum 官方数据,核心资产 MTS-Dialog) |
| 英文全称 | MEDIQA — Medical Summarization Shared Tasks;MTS-Dialog(Medical Training Summarization Dialog) |
| 别名/简称 | MTS-Dialog、MEDIQA-Chat 2023、MEDIQA-Sum 2023、ACI-BENCH(姊妹集)、MEDIQA 2021 |
| 疾病分类(ICD-11) | 无疾病诊断标签;对话内容多为症状体征类临床信息(框架上落于 ICD-11 第 21 章「症状、体征或临床所见」,MA00 起始区段) |
| SNOMED CT | 404684003(临床所见)、64572001(疾病)作层级锚点;病历章节结构对应 LOINC Document Ontology(10164-2 现病史、8661-1/10154-3 主诉等) |
| 数据模态 | 医患对话文本 + 结构化病历摘要文本(章节头 + 章节内容) |
| AI 任务类型 | Dialogue2Note 病历摘要生成、Dialogue2Topic 章节头分类、Note2Dialogue 反向对话生成、放射报告摘要 |
| 样本总数 | MTS-Dialog 约 1.7k 段对话(训练 1,201 + 验证 100 + 两个官方测试集各 200 段章节实例);ACI-BENCH 207 段完整就诊 |
| 数据大小 | MB 级 CSV 文本(对话共 241,685 词,摘要共 81,299 词) |
| 数据格式 | CSV(ID、section_header、dialogue、section_text 四列) |
| 许可证 | Creative Commons Attribution 4.0 International(CC BY 4.0) |
| 访问级别 | 开放(GitHub 直接下载;MEDIQA 2021 官方测试集需注册并签署数据使用协议) |
| DUO 标签 | NRES(无限制使用) |
| 语言 | 英语 |
| 首发日期 | 2021-06(MEDIQA 2021 系列);MTS-Dialog 论文发表于 2023-05(EACL 2023) |
| 最后更新 | 2025-05(MTS-Dialog GitHub 仓库,截至 2026-09 核对) |
| 发布机构 | 美国国家医学图书馆(NLM/NIH)、Microsoft、斯坦福大学、华盛顿大学等(MEDIQA 系列组织方) |
| 官方主页 | MEDIQA Shared Tasks |
| 下载地址 | github.com/abachaa/MTS-Dialog |
| DOI | 10.18653/v1/2023.eacl-main.168(MTS-Dialog 论文) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 有官方划分、20 类显式标签与官方源码,但 CSV 以「章节实例」为行、需自行做对话级分组防泄漏,且部分标签分布未公布 |
| 页面状态 | published |
§0 E-E-A-T 审核与免责声明
- 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(病历文书结构、ICD-11/LOINC 映射)、§7 偏倚分析。
- 数据工程审核:千方病案医学编辑部交叉审核 — 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MEDIQA 系列数据以 CC BY 4.0 发布,引用时请注明对应论文;MEDIQA 2021 官方测试集需注册并签署数据使用协议;其放射报告摘要任务(RRS)训练数据源自 MIMIC-CXR,获取需另行完成 PhysioNet 凭证化申请。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? MEDIQA 是 NLM/NIH 牵头组织的一系列医疗文本摘要共享任务的官方数据集合。它最核心的资产是 MTS-Dialog:约 1.7k 段模拟医患对话,每段对话配有由具备医学抄写员背景的标注者撰写的结构化病历摘要——包括 20 类规范化章节头(如主诉 CC、现病史 GENHX、用药 MEDICATIONS、评估 ASSESSMENT、计划 PLAN)和对应的章节正文。它回答的问题是:机器能否像病历抄写员一样,把一段门诊对话整理成一份结构清晰的病历?本文所有规模数字均以官方仓库与总览论文为准,动态信息标注核对时间。
为什么重要? 医生每天要花大量时间把问诊内容转写为病历,临床文档负担是医疗 AI 最明确的落地场景之一。在 MTS-Dialog 出现之前,公开可用的「对话—病历」平行语料几乎为零,因为真实对话涉及隐私无法发布。MEDIQA 系列用模拟对话绕开了这一死结,让「对话转病历」(Dialogue2Note)第一次拥有了可复现的公开基准,也推动了章节头分类、事实一致性评估等方法的发展。
我能用它做什么? 你可以训练和评测:医患对话→病历摘要生成模型、对话→章节头分类模型、病历→合成对话的反向生成模型(用于数据增强),以及摘要质量评估指标本身。数据为 CSV 纯文本、CC BY 4.0、无需申请即可下载,非常适合快速搭建对话式病历生成原型或做 LLM 摘要能力评测。
§1.1 技术摘要
MEDIQA 系列由 NLM/NIH 的 Asma Ben Abacha 等人组织,跨越三个阶段:2021 年在 NAACL-BioNLP 举办的三任务版(消费者健康问题摘要 QS、多答案摘要 MAS、放射报告摘要 RRS),35 支队伍参赛;2023 年拆分为两版——MEDIQA-Chat 2023(5th Clinical NLP Workshop,17 队)与 MEDIQA-Sum 2023(ImageCLEF@CLEF 2023,12 队 48 轮提交),两者共同使用 Microsoft 团队在 EACL 2023 发布的 MTS-Dialog(训练 1,201 段、验证 100 段、两个官方测试集各 200 段章节实例)以及完整就诊对话集 ACI-BENCH(Nature Scientific Data 2023,五组划分合计 207 段)。所有摘要由具备医学抄写员背景的标注者撰写,经培训反馈与独立复核三步质控;官方同时发布 400 份自动摘要的人工事实性评分,用于研究 ROUGE、BERTScore、BLEURT 与人工评估的相关性。评测指标以 ROUGE 为主排名,辅以 BERTScore/BLEURT 聚合分、章节头分类准确率,以及面向事实性的 HOLMS 与 CheXbert。
本条目以 MTS-Dialog 与 ACI-BENCH(对话→病历方向)为主线,MEDIQA 2021 三任务数据作为系列背景一并覆盖;各任务的规模、划分、标签体系与可复现评测协议详见 §3–§5。
§1.2 战略价值
维度一:填补「对话—病历」平行语料的结构性空白。 真实医患对话几乎不可能公开,这是临床 NLP 多年来的数据瓶颈。MEDIQA 系列选择「模拟对话 + 专家摘要」的路线,以可控成本换来了可发布、可复现、带 20 类章节标签的平行语料,并配套发布增强集(3.6k 对,法/西语回译)与人工事实性评分。对研究者而言,这是目前「对话转病历」任务事实上的入门与回归测试基准;对工程团队而言,它是评估 LLM 病历生成能力最便捷的公开标尺之一。其衍生价值同样可观:章节头分类子任务把「对话该写进病历哪一栏」变成可量化的 20 分类问题,为对话理解研究提供了中间粒度的测试点。
维度二:共享任务生态带来的方法与评测沉淀。 MEDIQA 不是一份孤立的数据,而是有持续评测传统的任务家族:2021 年验证了预训练摘要模型(BART、PEGASUS、T5)在医疗文本上的组合策略与泛化差距(Stanford 对 Indiana 测试分布),并引入 HOLMS、CheXbert 等事实性度量;2023 年两版任务产出了 FLAN-T5、LED 等获奖系统和「聚合分 = ROUGE-1 + BERTScore + BLEURT」的评估协议;后续研究(如跨域 SOAP 分析)反复以 MTS-Dialog/ACI-BENCH 为测试床。选择该数据集即接入了这条有论文背书的方法链。
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 标注 | 与 MEDIQA 的差异化 |
|---|---|---|---|---|
| MTS-Dialog(本条目核心) | 约 1.7k 段短对话 | 模拟医患对话 → 结构化病历摘要 | 20 类章节头 + 章节正文(前抄写员撰写) | 唯一带 20 类章节标签的对话级语料,官方双测试集 |
| ACI-BENCH | 207 段完整就诊 | 完整对话 → 全病历(SOAP 分部) | 完整病历文本 | 对话更长更完整,MEDIQA-Chat/Sum Task C 官方测试集 |
| MeQSum(MEDIQA 2021 T1) | 消费者健康问题 + 专家摘要 | 患者提问 → 问题摘要 | 专家改写摘要 | 面向 QA 前置的问题规整,非病历生成 |
| MEDIQA-AnS(MEDIQA 2021 T2) | 多答案聚合对 | 多条可靠答案 → 单一答案摘要 | 专家聚合摘要 | 答案聚合与去冗余,对话场景之外 |
| MIMIC-CXR 报告(MEDIQA 2021 T3 训练源) | 放射报告子集 | 影像所见文本 → 印象(Impression) | 报告自带章节 | 临床真实文本,但需 PhysioNet 凭证化获取 |
选择建议:若你的研究问题是「把医生说的话变成病历」,选 MTS-Dialog + ACI-BENCH 组合(前者练短对话、后者测长就诊);若研究问题是「帮患者把问题问清楚」或「把多个答案合成一个」,则属于 MEDIQA 2021 的 QS/MAS 赛道,与对话转病历不可混为一谈;若涉及影像报告,RRS 赛道的合规门槛(PhysioNet + 训练禁区)需提前纳入项目计划。横向对比的另一实用视角是「标签可得性」:只有 MTS-Dialog 同时给出章节头标签与章节正文,因此任何涉及「章节结构」的实验(分类、条件生成、分部评分)都无法用其他数据集平替。
§1.4 版本时间轴
| 时间 | 版本/事件 | 说明 |
|---|---|---|
| 2019-07 | MEDIQA 2019 @ ACL-BioNLP | 文本推理、问题蕴含与问答(非摘要方向) |
| 2021-06 | MEDIQA 2021 @ NAACL-BioNLP | QS/MAS/RRS 三摘要任务;35 队参赛;数据 CC BY 4.0 |
| 2023-05 | MTS-Dialog 发布(EACL 2023) | 1.7k 对话 + 增强集 + 400 份人工事实性评分 |
| 2023 | MEDIQA-Chat 2023 @ 5th Clinical NLP Workshop | 17 队;MTS-Dialog Task A 官方测试集、ACI-BENCH Task B/C |
| 2023-09 | MEDIQA-Sum 2023 @ ImageCLEF(Thessaloniki) | 12 队 48 轮;三子任务;MTS-Dialog TestSet-2 |
| 2024 | MEDIQA-CORR / MEDIQA-M3G @ 6th Clinical NLP Workshop | 系列转向医疗错误纠正与多语多模态答案生成 |
| 2025-05 | MTS-Dialog 仓库最近更新 | 截至 2026-09 核对 |
时间轴阅读要点:MTS-Dialog 虽于 2023-05 才随 EACL 论文发布,但其两个测试集分别被同年两版共享任务(MEDIQA-Chat 的 ClinicalNLP 会场与 MEDIQA-Sum 的 CLEF 会场)锁定为官方测试集,因此「论文版本」与「任务版本」需分开引用;2024 年起系列任务转向错误纠正(MEDIQA-CORR)与多语多模态生成(MEDIQA-M3G),对话摘要方向的主版本即 2023 年两版。
§1.5 典型应用场景
- 门诊语音助手后端评测:用 MTS-Dialog 评测「录音转写对话 → 结构化病历」链路,重点看章节头分类准确率与客观信息遗漏。
- LLM 病历生成能力基准:把 TestSet-1/TestSet-2 作为固定回归测试集,跟踪 GPT 类模型与微调小模型(FLAN-T5/LED)的差距。
- 反向数据增强:用 Note2Dialogue(MEDIQA-Chat Task C 思路)从院内病历模板合成对话,扩充隐私受限场景的训练数据。
- 摘要评估指标研究:基于官方 400 份人工事实性评分,验证自研评估指标与幻觉率/遗漏率的相关性。
- 病历书写规范教学工具:20 类章节头 + 规范正文可直接用于病历文书结构化的教学演示与自动化批改原型。
场景落地提醒:上述 1、2 属于「评测型」使用——数据不动、只评模型,成本最低;3、4 属于「构造型」使用——会派生新数据,务必遵守 §5.3 的泄漏与许可约束;5 属于「教学型」使用,注意 CC BY 4.0 的署名义务同样适用于课件与演示系统。
§2 医学背景
§2.1 病历章节与 ICD-11 框架锚定
MTS-Dialog 不含疾病诊断标签,因此不存在逐例 ICD-11 编码。本条目按「病历章节承载的临床信息类别」给出框架级 ICD-11 锚定:对话内容以症状、体征与病史叙述为主,框架上对应 ICD-11 第 21 章「症状、体征或临床所见,不可归类在他处者」(MA00 起始区段);涉及具体系统(如呼吸、消化)的对话内容则分别落入相应系统章节。此锚定用于理解数据覆盖面,不可当作疾病标注使用。
需要强调的是,「章节级锚定」与「诊断级编码」是两种不同抽象层:前者描述信息写在病历哪一栏(文书结构),后者描述患者得了什么病(临床语义)。MTS-Dialog 只提供前者——这也正是它的定位:病历书写结构化基准,而非疾病识别基准。若研究需要诊断标签,应另行引入 ICD 编码的病历数据集并与本数据集对齐实体。
| 病历章节(MTS-Dialog 代号) | 承载的临床信息 | ICD-11 框架锚点 |
|---|---|---|
| cc(主诉)/ genhx(现病史) | 本次就诊的症状与病程叙述 | 第 21 章「症状、体征或临床所见」为主,可触及各系统章节 |
| pastmedicalhx / pastsurgical / other_history | 既往疾病与手术史 | 既往诊断按其原疾病分章(数据中仅为文字叙述) |
| ros / exam | 系统回顾与体格检查发现 | 第 21 章症状体征(阳性发现) |
| medications / allergy / immunizations | 用药、过敏与接种史 | 疾病分类不适用;属文书结构信息 |
| assessment / diagnosis / plan / disposition | 评估、诊断印象与处置计划 | 诊断若编码将按 ICD-11 对应系统章节(数据未提供) |
§2.1b 病历章节的 LOINC/SNOMED 结构化映射
病历章节是国际通行的文书结构概念,行业标准编码由 LOINC Document Ontology 承载(SNOMED CT 仅提供「临床所见/疾病」等上位层级锚点:404684003 临床所见、64572001 疾病)。下表给出 MTS-Dialog 高频章节与 LOINC 文档章节码的对应关系,可直接用于把模型输出映射进 FHIR 文档结构。
| MTS-Dialog 标签 | LOINC 码 | LOINC 术语 |
|---|---|---|
| cc(主诉) | 10154-3 | Chief complaint Narrative - Reported |
| genhx(现病史) | 10164-2 | History of Present illness Narrative |
| pastmedicalhx(既往史) | 11348-0 | History of Past illness Narrative |
| pastsurgical(手术史) | 47519-4 | History of Procedures Document |
| medications(用药) | 10160-0 | History of Medication use Narrative |
| ros(系统回顾) | 10187-3 | Review of systems Narrative - Reported |
| exam(检查) | 29545-1 | Physical findings note |
| labs / imaging(检验/影像) | 30954-2 | Relevant diagnostic tests/laboratory data note |
| allergy(过敏) | 48765-2 | Allergies and adverse reactions Document |
| immunizations(接种史) | 11369-6 | History of Immunization note |
| fam/sochx(家族/社会史) | 10157-6 / 29762-2 | History of family member diseases / Social history Narrative |
| assessment / diagnosis(评估) | 51848-0 | Evaluation note |
| plan / disposition(计划与处置) | 18776-5 | Plan of care note |
该映射的价值在于打通「评测 → 落地」的最后一公里:模型输出的章节头代号(如 genhx)可先翻译为 LOINC 码(10164-2),再映射进 FHIR Composition 的 section 结构,使实验系统与医院 EHR 的文档格式对齐。映射表中未覆盖的章节(如 edcourse、gynhx)属急病程或专科史类,可在 LOINC 文档大纲的上级分组(History general / Relevant dx/tests)下挂载,具体编码选择应由院内信息科确认。
§2.2 临床文书负担与病历生成
临床文档(clinical documentation)是医生工作流中最耗时的环节之一:医生需要把问诊内容即时整理为带标准章节的病历(SOAP 结构:主观资料 S、客观资料 O、评估 A、计划 P)。MEDIQA-Chat 2023 总览论文将「自动生成病历以减轻医生日常负担、改善医患互动」列为任务的直接动机;参赛系统论文亦普遍把「将就诊对话转写为 SOAP 病历」描述为医务人员的重要行政负担。病历结构化程度直接影响照护连续性、计费合规与医疗质量审查,这正是「对话 → 病历摘要」任务的临床价值来源。
理解 MTS-Dialog 的标签体系需要先理解其模拟的文书对象——门诊/急诊病历的章节大纲。下表给出 20 类章节与 SOAP 四分部的对应关系:
| SOAP 分部 | 承载的 MTS-Dialog 章节 | 信息性质 |
|---|---|---|
| Subjective(主观) | cc、genhx、pastmedicalhx、pastsurgical、fam/sochx、gynhx、ros | 患者/病史叙述 |
| Objective(客观) | exam、labs、imaging、vital 相关内容 | 检查与检验发现 |
| Assessment(评估) | assessment、diagnosis、allergy(临床判断相关) | 诊断印象与风险 |
| Plan(计划) | plan、medications、procedures、immunizations、disposition、edcourse | 处置与医嘱 |
跨域研究(arXiv 2406.02826)表明:这一结构划分对失败模式有直接预测力——Objective 部分的数值信息(剂量、检验值)最容易被摘要模型遗漏,而 Plan 部分最容易被幻觉补全。使用者在设计评估时,建议按 SOAP 分部分别统计错误率,而非只看全文 ROUGE。
§2.3 临床任务定义
| 任务 | 输入 → 输出 | 临床类比 | 对应官方任务 |
|---|---|---|---|
| Dialogue2Note 摘要 | 短对话 → 单章节摘要 | 抄写员把问诊片段归入病历章节 | MEDIQA-Chat Task A;MEDIQA-Sum Subtask A/B |
| 章节头分类(Dialogue2Topic) | 短对话 → 20 类章节头之一 | 判断「这段话该写进病历哪一栏」 | MEDIQA-Chat Task A 头部预测;MEDIQA-Sum Subtask A |
| 完整就诊病历生成 | 全程对话 → 全病历(SOAP 分部) | 生成一次完整门诊/急诊病历 | MEDIQA-Chat Task B;MEDIQA-Sum Subtask C |
| Note2Dialogue 反向生成 | 病历 → 合成对话 | 由病历模拟问诊过程(数据增强用) | MEDIQA-Chat Task C |
| 消费者问题/多答案摘要 | 长问题或多条答案 → 规整摘要 | 患者教育与 QA 前置处理 | MEDIQA 2021 QS / MAS |
| 放射报告摘要 | 所见(Findings)→ 印象(Impression) | 放射科报告结尾结论生成 | MEDIQA 2021 RRS |
六类任务共享同一套 20 类章节标签体系或其上游概念,但输入输出形态差别很大:Dialogue2Note 与 RRS 是「压缩」(长输入短输出),QS 是「规整」(去噪与聚焦),MAS 是「聚合」(多源去冗余),Note2Dialogue 则是唯一的「展开」方向。工程实现时不要试图用一个模型覆盖全部方向——官方参赛队的经验表明,按任务定制架构与条件前缀的收益远大于多任务统一建模。
§2.4 数据人群画像
MTS-Dialog 与 ACI-BENCH 均为模拟数据,不存在真实患者队列。下表汇总其构建特征:
| 维度 | MTS-Dialog | ACI-BENCH |
|---|---|---|
| 来源 | 标注者撰写的模拟短对话 | 模拟完整就诊对话 |
| 构建者 | 具医学背景的前 medical scribes | 研究团队(U. Washington/Microsoft 等) |
| 就医类型 | 门诊/急诊风格的短片段(单一主题) | 完整就诊(覆盖 SOAP 全部信息) |
| 语言/地域 | 美式英语 | 美式英语 |
| 真实患者 | 无(无 PHI) | 无(无 PHI) |
| 人口学字段 | 无 | 无 |
「模拟人群」是一把双刃剑:一方面它使数据可以无限制分发、结果完全可复现;另一方面对话中不会出现真实人群的社会语言多样性(口音转写噪声、方言、非母语表达、情绪化表达等),模型在真实问诊录音转写上的表现必须另行验证。将本数据集用于任何面向真实患者的系统前,请把「模拟 → 真实」的域差距列为首要风险项。
§2.5 临床价值
对医疗 AI 而言,该数据集的价值在于「把病历生成从自由文本问题变成结构化、可评测的问题」:20 类章节标签对应真实病历大纲(与 LOINC 文档章节体系可映射),使得生成结果可以逐章节对齐、逐章节核查;官方人工事实性评分(幻觉率、遗漏率)为「敢不敢让模型写病历」提供了可量化的安全边界参考。MEDIQA 2021 还证明:对消费者健康问题做专家摘要可使其问答系统性能提升 58%,同理,结构良好的病历摘要也能改善下游检索、质控与转诊决策。
从临床信息学视角看,这套数据的另一个价值是「把病历书写规范显式化为可计算的标签空间」:住院医师规范化培训中「病历按大纲书写、信息按章节归位」的要求,恰好对应 Dialogue2Topic 与 Dialogue2Note 两级任务,因此它同时可服务于病历书写教学质量评估等非算法场景。
§2.6 金标准性质与标注方式
| 属性 | 说明 |
|---|---|
| 划分 | 官方固定划分:训练 1,201 / 验证 100 / 测试 200 + 200(两个官方测试集);ACI-BENCH 为 67/20/40/40/40 |
| 标注对象 | 每个章节实例 =(对话, 章节头, 章节正文)三元组 |
| 标注方式 | 人工撰写(模拟对话 + 摘要同源生成),另有法/西语回译增强集 |
| 标注者资质 | 具医学背景的前 medical scribes;一对一培训反馈;独立复核(rubric 评分 + 小幅修正) |
| 金标准性质 | 约定性金标准(专家撰写正文即答案),非多标注者一致性设计;官方另发布 400 份自动摘要的人工事实性计数 |
理解「约定性金标准」很关键:摘要任务本无唯一正确答案,MTS-Dialog 的答案即标注者撰写的正文本身——因此 ROUGE 类指标度量的是「与这一版参考摘要的重合度」,而非「临床正确性」。官方正是基于这一痛点发布了事实性人工评分并推动 HOLMS/CheXbert 等替代度量(见 §6.5 坑点 5)。
§3 数据集规格
§3.0 版本抉择矩阵
MEDIQA 名下有多份资产,选错集会直接导致实验不可比:
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 复现 MEDIQA-Chat 2023 Task A / MEDIQA-Sum Subtask A/B | MTS-Dialog 主集 + TestSet-1/2 | MB 级 CSV | 官方测试集锁定,结果可与排行榜对齐 |
| 训练病历生成模型并追求数据量 | MTS-Dialog 训练集 + 官方 3.6k 回译增强集 | MB 级 CSV | 增强集为官方论文实验所用,非自行魔改 |
| 评测长对话/完整病历生成 | ACI-BENCH(67/20/40/40/40) | MB 级 CSV | MEDIQA-Chat Task B、Task C 与 MEDIQA-Sum Task C 官方测试集 |
| 研究消费者问题规整、答案聚合、放射报告摘要 | MEDIQA 2021 三任务数据(MeQSum/MEDIQA-AnS/MIMIC-CXR 子集) | MB 级 + 需 PhysioNet | 2021 年任务专用,与 2023 对话任务不可混用 |
| 只想快速验证 LLM 提示词效果 | TestSet-1(200 章节实例) | 极小 | 无需训练即可手跑,含金标准可算 ROUGE |
§3.1 模态详情
数据为纯文本模态,包含两类文本对象:一是对话文本(多轮 Doctor/Patient 交替,平均 9 轮、142 词,最长 1,951 词);二是病历摘要文本(章节头 + 章节正文,平均 3 句、48 词)。MEDIQA 2021 的 RRS 任务另涉及放射报告文本(所见 → 印象),QS/MAS 涉及消费者健康问题与多条答案文本。全部为英语,UTF-8 编码,无影像、波形或结构化检验数值字段。
文本模态的三点工程含义:其一,无需 OCR、信号处理等重型前端,预处理成本几乎为零,适合作为多模态医疗流水线中的文本支路;其二,对话文本中的说话人标记(Doctor/Patient)是弱结构信息,建议在分词前显式解析而非依赖模型自行学习;其三,章节正文是高度模板化的病历语体,与对话语体差异显著——这正是「对话 → 病历」任务的语域转换(register transfer)本质,也是评测该任务难度的核心来源。
§3.2 按子集样本数
| 子集 | 样本数(章节实例) | 用途 |
|---|---|---|
| MTS-Dialog-TrainingSet | 1,201 | 训练 |
| MTS-Dialog-ValidationSet | 100 | 验证 |
| MTS-Dialog-TestSet-1(MEDIQA-Chat 2023 Task A) | 200 | 官方测试 |
| MTS-Dialog-TestSet-2(MEDIQA-Sum 2023 Task A&B) | 200 | 官方测试 |
| 官方回译增强集 | 3.6k 对 | 可选训练扩充 |
| ACI-BENCH train / valid / test1 / test2 / test3 | 67 / 20 / 40 / 40 / 40(合计 207) | 完整就诊任务官方划分 |
样本数阅读提示:MTS-Dialog 的 1,201/100/200/200 计的是「对话—摘要对」(行数),不是对话轮数——每行是(对话, 章节头, 章节正文)三元组。官方「1.7k 对话」的口径与四个子集行数合计 1,701 恰好一致,说明绝大多数对话对应单个章节实例;但自建任何切分前,仍应以 ID 前缀分组统计对话数,确认所用版本中是否存在一对话多行的情况(见 §6.5 坑点 1)。
§3.3 数据格式
| 格式 | 内容 | 提供方 |
|---|---|---|
| CSV(UTF-8) | ID、section_header、dialogue、section_text 四列 | MTS-Dialog 官方仓库 |
| CSV | 完整对话与对应病历(encounter 级) | ACI-BENCH 仓库 |
| CSV/TSV + 脚本 | MEDIQA 2021 三任务训练/验证数据与下载脚本 | MEDIQA2021 仓库(测试集经 AIcrowd 发放) |
| CSV | 400 份自动摘要的人工事实性评分(事实 P/R/F1、幻觉率、遗漏率、Levenshtein 编辑距离) | MTS-Dialog Correlation-Study 目录 |
格式层面全系列一致为「纯 CSV 文本 + Python 脚本」,无 JSON/Parquet 等二进制变体,直接 pd.read_csv 即可读取;这也意味着跨框架迁移(PyTorch/TensorFlow/JAX)不存在序列化成本,但使用时需自行处理对话字段内的换行符(CSV 引号包裹的嵌入换行)。
§3.4 存储大小
官方文本总量约 32.3 万词(对话 241,685 词 + 摘要 81,299 词),为 MB 级 CSV 文本,普通笔记本本地处理无压力。下载体积以 GitHub 仓库实际归档为准(截至 2026-09 核对,仓库未公布精确字节数)。注意增强集(3.6k 对)会使训练集体积约扩大至三倍。
体积虽小,工程价值不低:该量级意味着全量数据可以常驻内存、训练一个 epoch 以分钟计,非常适合做超参扫描、提示词迭代与消融实验;反过来,也意味着不要期望「数据量大到足以从零预训练」——所有模型路线都应基于预训练权重做微调(见 §6.7)。
§3.5 标注方式
标注为人工撰写型而非人工判别型:标注者根据病历正文或对话情境成对生成「对话—摘要」,因此对话与摘要语义对齐度高。增强集为自动回译(弱监督性质),使用时应与人工主集区分。MEDIQA 2021 的 QS/MAS 摘要由医学专家基于 NLM 收到的真实消费者问题与 CHiQA 检索的可靠来源答案撰写。
| 数据部分 | 标注范式 | 自动化程度 | 使用建议 |
|---|---|---|---|
| MTS-Dialog 主集(1,201/100/200/200) | 人工撰写(对话与摘要成对生成) | 无 | 可作金标准训练与测试 |
| MTS-Dialog 增强集(3.6k 对) | 法/西语回译自动生成 | 全自动 | 仅并入训练侧,标注弱化 |
| Correlation-Study(400 份摘要) | 人工事实性计数(P/R/F1、幻觉率、遗漏率、编辑距离) | 人工 | 仅作评估校准,不作训练 |
| MEDIQA 2021 QS/MAS | 专家撰写摘要(真实问题/CHiQA 答案) | 无 | 2021 任务专用 |
| MEDIQA 2021 RRS | 报告自带 Findings→Impression 结构 | 无(源自真实报告) | 需遵守官方训练禁区 |
§3.6 标注者资质与质控
官方描述了三步质控:仅录用有医学背景者(前 medical scribes);早期对每位标注者做一对一反馈培训;成稿后由独立复核按评分细则(rubric)评估对话对指南的遵循度及与临床笔记的相关性,并做小幅修正(改错字、补缺失信息)。数据集未公布标注者间一致性系数(如 Kappa),这一点在复现研究时需纳入局限性说明。
值得注意的对比:这种「写作型标注 + 流程质控」与判别型标注(如影像良恶性判读)的质控重心不同——前者靠指南与培训保证风格统一,后者靠多标者一致性保证判读可靠。因此从该数据集迁移到判别类任务时,不能直接套用其质控叙事;反之,用它来训练病历「书写风格」恰恰是质控流程所强项保证的。
§3.7 采集周期
MEDIQA 2021 的消费者问题来自 2020 年 12 月 NLM 收到的真实咨询;MTS-Dialog 与 ACI-BENCH 于 2022 至 2023 年构建,随 EACL 2023 论文(2023-05)发布;两个官方测试集分别随 MEDIQA-Chat 2023 与 MEDIQA-Sum 2023 定稿。MTS-Dialog 仓库最近一次更新为 2025-05(截至 2026-09 核对)。
从时间线可读出两个对研究设计重要的事实:其一,MEDIQA 2021 测试问题(2020-12)与 2023 对话数据之间存在约两年的文本风格与任务跨度,两代任务的成绩不可混用;其二,官方测试集自 2023 年起冻结至今,意味着排行榜数字积累的「测试集复用年限」已较长,做 LLM 评测时应关注结果饱和风险。
§3.8 地域覆盖
英语(美式)书写,模拟美国门诊/急诊文书习惯;无真实地理绑定。将结果迁移到中文病历或其他文书规范(如中国电子病历书写基本规范)时需重新评估章节体系差异:中文病历的「主诉/现病史/既往史/查体/辅助检查/诊断/处理」大纲与 MTS-Dialog 的 20 类章节大体同构,可直接做标签映射;但叙述风格(缩写习惯、时态、模板化程度)差异显著,建议迁移前先做小规模对照翻译评估,而非直接套用英文版提示词。
§3.9 设备规格
不适用:本数据集为纯文本,无采集设备、采样率或影像参数字段。对应地,DAIMS 检查项中的「设备记录」记为 ❌,使用者若需设备维度信息(如诊室录音设备型号对转写质量的影响),需在自采数据中另行补充。
§3.10 深度溯源链
数据构建链条清晰可溯源,每一环均有公开记录:
| 环节 | 执行方 | 可溯源性 |
|---|---|---|
| 任务设计与监督 | NLM/NIH(Ben Abacha、Mrabet、Demner-Fushman) | MEDIQA 2021 总览论文与官方站点 |
| 对话/摘要撰写 | 具医学背景的前 medical scribes | EACL 2023 论文 §4 标注协议 |
| 培训与反馈 | 一对一 trainer 反馈机制 | JMIR mHealth 2026 转引 |
| 独立复核 | rubric 评分 + 小幅修正 | EACL 2023 论文 |
| 发布与许可 | GitHub 公开仓库,CC BY 4.0 | 官方仓库 LICENSE |
| 官方测试集锁定 | MEDIQA-Chat 2023 / MEDIQA-Sum 2023 组委会 | 两版总览论文 |
| 放射报告上游 | MIMIC-CXR(PhysioNet 凭证化)、Indiana 公开报告集 | MEDIQA 2021 Task 3 说明 |
§4 数据结构
§4.0 目录树
mediqa_data/
├── MTS-Dialog/ # github.com/abachaa/MTS-Dialog
│ ├── Main-Dataset/
│ │ ├── MTS-Dialog-TrainingSet.csv # 1,201 章节实例
│ │ ├── MTS-Dialog-ValidationSet.csv # 100 章节实例
│ │ ├── MTS-Dialog-TestSet-1-MEDIQA-Chat-2023.csv # 200 章节实例(Task A)
│ │ └── MTS-Dialog-TestSet-2-MEDIQA-Sum-2023.csv # 200 章节实例(Sum A&B)
│ ├── Augmented-Data/ # 3.6k 对回译增强集(FR/ES)
│ └── Correlation-Study/ # 400 份自动摘要人工事实性评分
├── aci-bench/ # github.com/wyim/aci-bench
│ └── data/ # train 67 / valid 20 / test 40×3
└── MEDIQA2021/ # github.com/abachaa/MEDIQA2021
├── Task1/ # 消费者健康问题摘要(MeQSum 训练)
├── Task2/ # 多答案摘要(MEDIQA-AnS 训练)
└── Task3/ # 放射报告摘要(MIMIC-CXR 子集下载脚本)
目录树要点:Main-Dataset/ 是唯一必须完整保留的目录;Augmented-Data/ 含完整增强集以及按法语、西语拆分的独立版本;Correlation-Study/ 内的人工评分与论文 §5.2/§5.3 的相关性实验对应。aci-bench 与 MEDIQA2021 为可选目录——只做短对话任务时可完全不下载。
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| ID | 字符串 | 章节实例唯一标识;同一段对话可产出多行(每行一个章节) | MTS_ 前缀编号样式 | 分组键,防对话级泄漏 | 无 | 无 | 全库唯一 |
| section_header | 枚举字符串 | 20 类规范化章节头代号(小写无空格) | genhx | 分类标签 / 生成条件 | README 中个别代号与显示名对应易误读(如 genhx) | 无 | 20 个固定值 |
| dialogue | 长文本 | 多轮医患对话,含说话人标记与换行 | Doctor:… Patient:… | 编码器输入 | 含缩写、非规范拼写 | 无 | 平均 142 词,最大 1,951 词 |
| section_text | 长文本 | 该章节的病历正文(摘要目标) | 病历式短段落 | 解码器目标 | 专家撰写,风格统一 | 无 | 平均 48 词,最大约 1,800 词量级 |
| (ACI-BENCH)encounter 级列 | 长文本 | 完整对话与全病历,另分 SOAP 分部 | 全程问诊 | 长文本生成评测 | 对话缺 SOAP 某部时易诱发幻觉 | 无 | 207 段 |
§4.2 标签分布
官方 20 类规范化章节头如下(代号 [官方显示名])。官方未公布逐类计数分布,社区普遍反映 genhx、medications、pastmedicalhx 等病史类高频,gynhx、immunizations 等低频,直接使用前应自行统计:
| # | 代号 | 官方显示名 |
|---|---|---|
| 1 | fam/sochx | FAMILY HISTORY/SOCIAL HISTORY |
| 2 | genhx | HISTORY of PRESENT ILLNESS(README 原文如此) |
| 3 | pastmedicalhx | PAST MEDICAL HISTORY |
| 4 | cc | CHIEF COMPLAINT |
| 5 | pastsurgical | PAST SURGICAL HISTORY |
| 6 | allergy | ALLERGY |
| 7 | ros | REVIEW OF SYSTEMS |
| 8 | medications | MEDICATIONS |
| 9 | assessment | ASSESSMENT |
| 10 | exam | EXAM |
| 11 | diagnosis | DIAGNOSIS |
| 12 | disposition | DISPOSITION |
| 13 | plan | PLAN |
| 14 | edcourse | EMERGENCY DEPARTMENT COURSE |
| 15 | immunizations | IMMUNIZATIONS |
| 16 | imaging | IMAGING |
| 17 | gynhx | GYNECOLOGIC HISTORY |
| 18 | procedures | PROCEDURES |
| 19 | other_history | OTHER_HISTORY |
| 20 | labs | LABS |
标签使用建议:(1) 分类任务的输出层固定为这 20 个小写代号,勿混用显示名;(2) 生成任务的条件前缀建议用代号而非显示名(与社区复现口径一致);(3) 输出后处理时把代号映射到 §2.1b 的 LOINC 码即可接入 FHIR 管线;(4) 逐类计数需自行统计并随实验配置一并发布,弥补官方未公布分布的缺口。
§4.3 关键统计
| 指标 | 对话 | 摘要 |
|---|---|---|
| 总轮次/总句数 | 15,969 轮 / 18,406 句 | 5,870 句 |
| 每实例均值(SD) | 9 轮(8.72)/ 11 句 / 142 词(144.03) | 3 句(4.35)/ 48 词(72.02) |
| 最大值 | 103 轮 / 1,951 词 | 明显长尾(长摘要可达数百词) |
| 四分位(词数,P25/P50/P75) | 48 / 88 / 176 | 6 / 18 / 55 |
以上统计出自 MTS-Dialog 论文描述性统计表(经 JMIR mHealth 2026 转引核对,截至 2026-09)。
统计解读:对话均值 142 词但最大 1,951 词、P75 仅 176 词——典型的重尾分布,说明绝大多数样本是「一两分钟问诊片段」,长尾样本集中在少数复杂对话;摘要 P50 仅 18 词,与对话的中位长度差约 5 倍,压缩率高,这解释了为何纯抽取式方法在此数据上吃亏、摘要式架构成为主流。设计 DataLoader 的 max_length 时应按 P75 + 余量(如 512)起步,再针对长尾样本做溢出策略,而非按最大值浪费算力。
§4.4 数据层级
层级为:语料库合集(microsoft/clinical_visit_note_summarization_corpus)→ 数据集(MTS-Dialog / ACI-BENCH)→ 对话(约 1.7k 段;平均 9 轮)→ 章节实例(CSV 中的一行 = 对话 + 章节头 + 章节正文;绝大多数对话对应单行,个别对话可对应多行,以 ID 分组核查为准)→ 句子/词(平均 11 句、142 词)。ACI-BENCH 侧层级更粗:encounter(完整就诊) → SOAP 分部 → 句/词,一个 encounter 对应多行分部文本,天然一对多。
§4.5 缺失值与信息性缺失
官方数据未设计信息性缺失编码:若对话不含某章节信息,则该章节行根本不出现(而非以占位值标记)。这意味着「章节缺失」本身携带临床信息(医生未提及即不写),但也导致模型在输入不含某 SOAP 成分时容易凭空生成(已被跨域研究证实为典型失败模式,见 §6.5 坑点 6)。CSV 中未报告空值字段;增强集与人工集无缺失标记差异。
对使用者而言,有三层「缺失」需要区分对待:
| 缺失类型 | 表现形式 | 正确处理 |
|---|---|---|
| 章节级缺失 | 某对话没有 pastsurgical 行 | 视为临床语义(未提及),训练分类器时作「无该章节」负样本而非缺失值 |
| 句子级省略 | 摘要只有 1 句(P25 = 6 词) | 属正常短摘要,评估时避免按长度截断惩罚 |
| 增强集伪缺失 | 回译造成个别专名变形 | 与人工主集分开统计,勿混入质量报告 |
§5 划分与使用建议
§5.1 官方划分
MTS-Dialog:训练 1,201 / 验证 100 / TestSet-1 200(MEDIQA-Chat 2023 Task A 官方测试集)/ TestSet-2 200(MEDIQA-Sum 2023 Subtask A&B 官方测试集);Subtask A 结束后官方公布金标准章节头供 Subtask B 使用。ACI-BENCH:train 67 / valid 20 / test1 40(Chat Task B)/ test2 40(Chat Task C)/ test3 40(Sum Task C)。
| 划分 | MTS-Dialog | ACI-BENCH | 用途 |
|---|---|---|---|
| 训练 | 1,201(可并入 3.6k 增强) | 67 | 模型拟合 |
| 验证 | 100(任务方口径 180,见坑点 4) | 20 | 调参与早停 |
| 测试 | 200 + 200(两个官方测试集) | 40 × 3 | 论文报告与排行榜 |
| 划分粒度 | 章节实例(行) | 完整就诊(encounter) | 注意粒度不同 |
划分阅读要点:两个官方测试集互斥且用途锁定——TestSet-1 只对应 MEDIQA-Chat 2023 Task A 的成绩,TestSet-2 只对应 MEDIQA-Sum 2023 Subtask A/B 的成绩,不要交叉汇报;ACI-BENCH 的三组测试同样绑定各自任务(Chat B、Chat C、Sum C)。这种「一个测试集一个任务」的强绑定是复现官方成绩的第一前提。
§5.2 社区惯例与口径差异
社区复现时惯用「官方训练集 + 自留验证」,但注意:MEDIQA-Sum 2023 参赛论文报告其官方验证集为 180 条,而 MTS-Dialog 仓库主集验证为 100 条——两套口径并存。自建实验时务必在论文中写明所用划分来源,否则数字不可比。另一种社区做法是在训练集内部再切 10% 做双验证(仓库 100 条保留给最终调参),适合调参次数多的提示词工程场景,代价是有效训练数据略减。
§5.3 泄漏风险(重点)
- 对话级泄漏:CSV 以章节实例为行,同一段对话的多行若被随机打散,同一对话会同时落入训练与验证/测试,导致章节头分类与摘要指标虚高。任何自建划分必须按对话 ID 分组(GroupShuffle)。
- 官方禁区:MEDIQA 2021 RRS 任务明确禁止使用「其余 MIMIC-CXR 报告」与 Indiana 数据集训练(它们与测试分布重叠),违反将构成直接泄漏。
- 增强集泄漏:回译增强集由训练对派生,只能并入训练侧,绝不可参与验证/测试。
上实验前的泄漏自查清单(建议写入项目 README):
- 自建切分是否按对话/encounter ID 分组(而非按行)?
- 验证/测试中是否存在与训练集共享 ID 前缀的行?
- 增强集是否被严格限制在训练侧?
- 若涉放射报告:是否只使用了官方 RRS 允许的 MIMIC-CXR 子集?Indiana 是否完全隔离?
- 汇报的指标是否产自官方测试集(而非自留验证集)?
§5.4 划分策略建议
| 场景 | 推荐策略 |
|---|---|
| 论文投稿(可比性优先) | 锁死官方四个 CSV,验证集仅用于早停与超参 |
| 低频章节研究 | 分组分层 5 折(按对话 ID 分组 + 章节头分层) |
| 少样本实验 | 从训练集按对话组抽样 100/300/1,201 三档做学习曲线 |
| 工程迭代 | 官方划分 + 自建「真实对话」影子集做漂移监测 |
§5.5 交叉验证建议
小样本场景建议按对话分组做 5 折交叉验证(保持 20 类章节头分层);每折内同时报告宏平均与逐类 F1,避免高频章节(genhx、medications)掩盖低频章节的失效。正式报告仍以官方测试集为准,交叉验证数字仅作稳定性证据。
§5.6 外部验证建议
外部验证推荐三档:ACI-BENCH(长对话域,检验 SOAP 全段生成)、MIMIC-CXR 报告(放射域,需凭证,检验 Findings→Impression 迁移)、自院内脱敏对话(真实域,最关键也最稀缺)。跨域实验设计可直接参考 arXiv 2406.02826 的双向协议(MTS-Dialog→ACI-BENCH 与 ACI-BENCH→MTS-Dialog)。执行时建议固定「同一模型、同一解码配置、仅换数据域」的受控设定,并在结果表中逐 SOAP 分部拆解错误来源,这样外部验证才具有可归因性,而非仅报告一个总分下滑。
§6 AI 就绪指南
§6.0 云端快速启动
数据为 MB 级文本,任何免费 Colab/Kaggle 环境均可承载;模型训练建议至少一张 16 GB 显存 GPU(FLAN-T5-large 微调)。GitHub 仓库直接 clone 即含全部主集与评估脚本,无需注册;仅 MEDIQA 2021 官方测试集与 MIMIC-CXR 训练子集需要申请流程。三种典型启动路径:
| 路径 | 环境 | 预计耗时 | 适合人群 |
|---|---|---|---|
| 只跑评测(LLM 提示基线) | Colab CPU 即可 | 30 分钟内 | 想快速看 ROUGE 的新手 |
| 微调 FLAN-T5-base/large | Colab T4 / 单卡 16 GB | 数小时 | 复现官方级成绩 |
| LED 长输入完整病历 | 单卡 24 GB+ | 半天以上 | 复现 Task B / Subtask C 方向 |
§6.1 快速上手
# 目录结构预期(见 §4.0):
# data_root/MTS-Dialog/Main-Dataset/MTS-Dialog-TrainingSet.csv
# data_root/MTS-Dialog/Main-Dataset/MTS-Dialog-ValidationSet.csv
# data_root 与文件名的拼接关系:data_root + 各仓库目录名 + CSV 文件名
# 最小可用子集:仅 TrainingSet.csv(1,201 行)即可完成 Dialogue2Note 原型训练
import pandas as pd
data_root = "./mediqa_data" # 与 §4.0 目录树一致
train_csv = f"{data_root}/MTS-Dialog/Main-Dataset/MTS-Dialog-TrainingSet.csv"
df = pd.read_csv(train_csv) # 列:ID, section_header, dialogue, section_text
print(df.shape) # (1201, 4)
print(df["section_header"].nunique()) # 20 类章节头
# 同一对话可对应多行:按 ID 分组统计对话数(防泄漏第一步)
n_dialogues = df["ID"].str.rsplit("_", n=1).str[0].nunique()
print("unique conversations:", n_dialogues)
运行后即可确认数据完整性:训练集 1,201 行、20 类章节头。若你的实验只关心某一类章节(如 medications),可用 df[df.section_header == "medications"] 切出最小子集。此外建议立刻执行一次「行数 vs 独立对话数」审计(见坑点 1),确认所用版本中 ID 与对话的对应关系,这决定了后续所有切分策略的安全性。
§6.2 数据获取
| 资产 | 获取方式 | 大小 | 要求 |
|---|---|---|---|
| MTS-Dialog 主集 + 增强集 + 相关性研究数据 | GitHub 直接下载 | MB 级 | 无(CC BY 4.0) |
| ACI-BENCH | GitHub 或 合集仓库 | MB 级 | 无(CC BY 4.0) |
| MEDIQA 2021 训练/验证数据 | GitHub | MB 级 | 无(CC BY 4.0) |
| MEDIQA 2021 官方测试集 | 注册 AIcrowd、签署数据使用协议并上传表单,批准后下载 | 小 | 注册 + 签署协议 |
| MIMIC-CXR(RRS 训练源) | PhysioNet 凭证化申请 | 大 | CITI 培训 + DUA |
MEDIQA 2021 官方测试集的申请流程为四步:在任一 AIcrowd 任务页(QS/MAS/RRS)Resources 区下载数据使用协议表单 → 填写并签名(表单覆盖三任务)→ 上传等待批准 → 批准后在 AIcrowd 提交系统下载官方测试集并提交运行。整个流程面向研究用途设计,通常按注册顺序处理。
# 一键获取 MTS-Dialog 与 ACI-BENCH(约数十 MB,含 .git 历史)
git clone https://github.com/abachaa/MTS-Dialog.git mediqa_data/MTS-Dialog
git clone https://github.com/wyim/aci-bench.git mediqa_data/aci-bench
下载完成后建议核对四个官方 CSV 的行数(1,201/100/200/200),行数不符说明拿错版本或混入第三方镜像(见坑点 8)。
§6.3 预处理全流程
import re
import pandas as pd
def normalize_speaker_lines(dialogue: str) -> list[tuple[str, str]]:
"""把对话文本解析为 (说话人, 内容) 列表;官方格式为 'Doctor: ...' / 'Patient: ...' 行。"""
turns = []
for raw in re.split(r"\n+", dialogue.strip()):
raw = raw.strip()
if not raw:
continue
who, _, text = raw.partition(":")
turns.append((who.strip().lower(), text.strip()))
return turns
def clean_dialogue(dialogue: str) -> str:
# 1) 统一换行与空白;2) 保留原始拼写(消费者问题类数据可加医学拼写纠正,见坑点 7)
dialogue = re.sub(r"\s+", " ", dialogue.replace("\r", "\n")).strip()
return dialogue
def make_seq2seq_pairs(df: pd.DataFrame) -> pd.DataFrame:
"""Dialogue2Note(条件生成):输入 = 章节头 + 对话;输出 = 章节正文。"""
pairs = df.copy()
pairs["dialogue"] = pairs["dialogue"].map(clean_dialogue)
pairs["source"] = "section header: " + pairs["section_header"] + " | dialogue: " + pairs["dialogue"]
pairs["target"] = pairs["section_text"]
return pairs[["ID", "section_header", "source", "target"]]
train = make_seq2seq_pairs(pd.read_csv(
"./mediqa_data/MTS-Dialog/Main-Dataset/MTS-Dialog-TrainingSet.csv"))
valid = make_seq2seq_pairs(pd.read_csv(
"./mediqa_data/MTS-Dialog/Main-Dataset/MTS-Dialog-ValidationSet.csv"))
# 注意:不要在此处做全局重采样/打乱切分——官方划分已定,自建划分必须按对话 ID 分组(坑点 1)
预处理要点:对话与摘要均无需词干化或去停用词(生成任务保留原文);仅做空白规范化即可;若做 Dialogue2Topic 分类,则目标列换成 section_header。
Dialogue2Topic(章节头分类)方向的预处理更简单——不需要目标文本,只需把对话编码后接分类头,标签直接取 section_header 的 20 类枚举:
from sklearn.preprocessing import LabelEncoder
# Dialogue2Topic 预处理:标签编码 + 文本输入
le = LabelEncoder()
train_topic = pd.read_csv(
"./mediqa_data/MTS-Dialog/Main-Dataset/MTS-Dialog-TrainingSet.csv")
train_topic["label"] = le.fit_transform(train_topic["section_header"])
# 20 类标签顺序需与验证/测试集一致:用同一个已拟合的 le.transform()
# 注意:MEDIQA-Sum Subtask A 评测准确率(官方最佳 0.820),
# 分类输入通常只保留对话原文,章节头条件不可用(那是要预测的目标)
print(dict(zip(le.classes_, le.transform(le.classes_))))
§6.4 PyTorch DataLoader 完整代码
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
class Dialogue2NoteDataset(Dataset):
"""MEDIQA 章节实例数据集:输入 = 章节头条件 + 对话;目标 = 章节正文。
预期目录结构:data_root/MTS-Dialog/Main-Dataset/{Training,Validation}Set.csv
data_root 拼接关系与 §6.1 一致;最小可用子集为 TrainingSet.csv。"""
def __init__(self, csv_path: str, tokenizer, max_source_len=1024, max_target_len=256):
self.df = pd.read_csv(csv_path)
self.tok = tokenizer
self.max_source_len = max_source_len
self.max_target_len = max_target_len
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
source = f"generate {row['section_header']}: {row['dialogue']}"
target = str(row["section_text"])
src = self.tok(source, truncation=True, max_length=self.max_source_len,
padding="max_length", return_tensors="pt")
tgt = self.tok(text_target=target, truncation=True, max_length=self.max_target_len,
padding="max_length", return_tensors="pt")
return {
"input_ids": src["input_ids"].squeeze(0),
"attention_mask": src["attention_mask"].squeeze(0),
"labels": tgt["input_ids"].squeeze(0),
}
def build_loader(csv_path: str, model_name="google/flan-t5-large", batch_size=8):
tok = AutoTokenizer.from_pretrained(model_name)
ds = Dialogue2NoteDataset(csv_path, tok)
return DataLoader(ds, batch_size=batch_size, shuffle=False), tok, model_name
# 训练循环骨架(官方测试集不参与训练;shuffle 仅作用于训练 loader)
loader, tok, model_name = build_loader(
"./mediqa_data/MTS-Dialog/Main-Dataset/MTS-Dialog-TrainingSet.csv")
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
opt = torch.optim.AdamW(model.parameters(), lr=3e-5)
for epoch in range(3):
model.train()
for batch in loader:
out = model(**batch)
out.loss.backward()
opt.step()
opt.zero_grad()
若目标是 Subtask A(章节头分类),把 Seq2Seq 模型换成编码器 + 分类头即可,DataLoader 结构保持一致:
import torch.nn as nn
from transformers import AutoModel
class Dialogue2TopicModel(nn.Module):
"""20 类章节头分类头:编码器取 [CLS] 表征后线性映射。"""
def __init__(self, encoder_name="microsoft/deberta-v3-base", n_labels=20):
super().__init__()
self.encoder = AutoModel.from_pretrained(encoder_name)
self.dropout = nn.Dropout(0.1)
self.classifier = nn.Linear(self.encoder.config.hidden_size, n_labels)
def forward(self, input_ids, attention_mask):
out = self.encoder(input_ids=input_ids, attention_mask=attention_mask)
pooled = out.last_hidden_state[:, 0] # [CLS]
return self.classifier(self.dropout(pooled))
两个方向的工程要点:(1) 生成方向务必带章节头条件前缀(条件格式影响成绩且属可复现性的一部分);(2) 分类方向训练/测试必须使用同一标签编码器,且低频章节建议加权损失或过采样。
以下是被折叠的端到端评测脚本(生成模型 → 指标输出全流程,超过 30 行故折叠):
<details>
<summary>端到端评测脚本(生成 + ROUGE/BERTScore 聚合)</summary>
import pandas as pd
import torch
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
from rouge_score import rouge_scorer
CSV = "./mediqa_data/MTS-Dialog/Main-Dataset/MTS-Dialog-ValidationSet.csv"
MODEL = "google/flan-t5-large" # 与训练一致的条件前缀格式
tok = AutoTokenizer.from_pretrained(MODEL)
model = AutoModelForSeq2SeqLM.from_pretrained(MODEL)
df = pd.read_csv(CSV)
preds, refs = [], []
for _, row in df.iterrows():
source = f"generate {row['section_header']}: {row['dialogue']}"
inputs = tok(source, return_tensors="pt", truncation=True, max_length=1024)
with torch.no_grad():
output = model.generate(**inputs, max_length=256, num_beams=4)
preds.append(tok.decode(output[0], skip_special_tokens=True))
refs.append(str(row["section_text"]))
rs = rouge_scorer.RougeScorer(["rouge1", "rouge2", "rougeL"], use_stemmer=True)
r1 = sum(rs.score(r, p)["rouge1"].fmeasure for p, r in zip(preds, refs)) / len(preds)
r2 = sum(rs.score(r, p)["rouge2"].fmeasure for p, r in zip(preds, refs)) / len(preds)
print({"rouge1": round(r1, 4), "rouge2": round(r2, 4)})
# 建议:在该脚本外层加 tqdm 进度条与批处理,并把 preds 落盘以便复算事实性指标
</details>
§6.5 坑点 8 个
⚠️ 坑点 1:行级打乱破坏对话分组,造成跨集泄漏(分类:数据泄漏)
问题:MTS-Dialog 每行是(对话, 章节头, 正文)三元组,官方称约 1.7k 段对话对应合计 1,701 行——即可能存在一对话多行;ACI-BENCH 的一个 encounter 更是天然对应多条 SOAP 分部行。对行做随机切分会把同源文本放进训练与测试,指标虚高。
症状:自建划分的成绩显著高于官方测试集成绩;同一对话的内容在训练集与验证集都出现,章节头分类准确率异常漂亮但真实数据上一塌糊涂。
解决:
- 简单方法:先做分组审计——解析 ID 的对话前缀(如
df["ID"].str.rsplit("_", n=1).str[0]),统计「行数 vs 对话数」;若两者不等,必须以对话前缀为分组键做 GroupShuffleSplit。- 进阶方法:分组切分同时按 20 类章节头做分层,保证低频章节(gynhx、immunizations 等)在每折都有代表;ACI-BENCH 按 encounter ID 分组。
- SOTA 方法:直接锁死官方四个 CSV 的划分做可比性实验,自建划分仅用于消融研究。
参考:MTS-Dialog 官方仓库(官方划分定义)
⚠️ 坑点 2:官方训练数据禁区(MIMIC-CXR 余量与 Indiana)(分类:数据泄漏)
问题:MEDIQA 2021 RRS 任务只允许用指定的 MIMIC-CXR 子集训练;其余 MIMIC-CXR 报告与 Indiana 数据与测试分布重叠,明令禁止入训。
症状:加了「全量 MIMIC-CXR」后 ROUGE 大涨,但在跨机构(Stanford/Indiana)测试上泛化反而恶化,且属违规。
解决:
- 简单方法:只用官方仓库 Task3 脚本拉取的子集。
- 进阶方法:把「禁止集」写入数据版本控制的排除清单(DVC/.gitignore 级别),CI 中检测重叠 ID。
- SOTA 方法:用外部非重叠语料(如院内脱敏报告)做域适应,而非偷用测试域数据。
参考:MEDIQA 2021 官方站点任务说明
⚠️ 坑点 3:章节头代号与显示名不一致(genhx 陷阱)(分类:标签理解)
问题:官方 README 的 20 类列表中,
genhx的显示名是 HISTORY of PRESENT ILLNESS(现病史),而非直觉的「general history」;其余代号与显示名也非逐词直译。
症状:把genhx当成「一般病史」写提示词或做 LOINC 映射,把现病史内容归错章节;下游分类报告的混淆矩阵呈现 cc/genhx/pastmedicalhx 三类互相污染。
解决:
- 简单方法:以 README 原文列表为准建立「代号 → 显示名」映射表并写入代码常量。
- 进阶方法:映射到 LOINC(现病史 = 10164-2)后再进 FHIR 管线,避免自由文本歧义(见 §2.1b)。
- SOTA 方法:用少量人工核对样本校准每类章节的语义边界,尤其是 cc/genhx/pastmedicalhx 三角。
参考:MTS-Dialog README
⚠️ 坑点 4:验证集口径混乱(100 条 vs 180 条)(分类:评估误用)
问题:官方 MTS-Dialog 仓库主集验证集为 100 条;而 MEDIQA-Sum 2023 的参赛论文报告其官方验证集为 180 条。两套口径在社区并存。
症状:复现参赛论文时发现验证指标对不上;不同论文间「验证集 ROUGE」无法互比。
解决:
- 简单方法:论文写作时显式声明验证集来源(仓库主集 100 或任务方 180)。
- 进阶方法:同时报告两种口径的验证结果,用官方测试集做唯一外部锚点。
- SOTA 方法:只在官方测试集上与排行榜比较,验证集数字仅作训练参考不进论文表格。
参考:SuryaKiran at MEDIQA-Sum 2023 与 MTS-Dialog 仓库
⚠️ 坑点 5:ROUGE 高不等于临床正确(幻觉与遗漏)(分类:评估误用)
问题:病历生成中幻觉(写对话里没有的临床事实)与遗漏(漏掉客观信息如剂量、数值)都是高危错误,而 ROUGE 对二者均不敏感。
症状:模型 ROUGE-1 很高,人工检查却发现编造了用药剂量或漏掉了关键既往史;错误率随模型变大并未下降。
解决:
- 简单方法:用官方 Correlation-Study 的 400 份人工事实性计数校准自己的自动指标。
- 进阶方法:计算事实性 P/R/F1(抽取对话与生成摘要中的事实项做集合比对),同时报告幻觉率与遗漏率。
- SOTA 方法:放射域用 CheXbert 标签一致性做事实核查(MEDIQA 2021 引入),对话域可借鉴官方「事实抽取 + 编辑距离」框架。
参考:MTS-Dialog Correlation-Study;MEDIQA 2021 总览
⚠️ 坑点 6:短模拟对话 → 长真实就诊的外推失败(分类:预处理陷阱)
问题:MTS-Dialog 对话平均 142 词且单一主题,ACI-BENCH/真实就诊长达数千词且覆盖 SOAP 全部成分;直接把短对话模型用到长对话会截断与漏项。
症状:输入超长被截断后,生成病历缺 Objective 部分;或在对话未提及某 SOAP 成分时模型仍生成整段内容(幻觉)。
解决:
- 简单方法:把生成模型的最大输入长度调大(社区复现将 FLAN-T5 的 1,024 上限扩到 4,096)。
- 进阶方法:换长文档架构(如 LED-large-16384-pubmed,MEDIQA-Chat Task B 头名方案)。
- SOTA 方法:SOAP 分部生成 + 提示词显式声明「对话中没有的信息跳过该节」,并对缺失成分做存在性分类。
参考:跨域 SOAP 鲁棒性分析
⚠️ 坑点 7:消费者问题的拼写噪音(QS 任务)(分类:预处理陷阱)
问题:MEDIQA 2021 QS 任务的输入是真实消费者健康问题,含大量拼写错误与口语缩写,直接编码会稀释语义。
症状:问题摘要出现实体错拼延续;ROUGE 低于同配置的干净文本实验。
解决:
- 简单方法:接入医学拼写纠正器(如 NLM CSpell),2021 年参赛队实测有可测提升。
- 进阶方法:先做医学实体规范化(问题焦点/类型识别)再生成。
- SOTA 方法:知识驱动预处理 + 覆盖度重排(damo_nlp 冠军方案的思路)。
参考:MEDIQA 2021 总览
⚠️ 坑点 8:第三方镜像的许可证漂移(分类:工程陷阱)
问题:官方数据为 CC BY 4.0,但社区把 MTS-Dialog 重新打包上传的镜像(如 HF 上的 EN-MEDIQA 变体)标注了 CC BY-NC-SA 4.0 等不同许可。
症状:合规审查时发现项目许可链断裂;商用产品误用镜像版本导致授权风险。
解决:
- 简单方法:只从官方仓库(abachaa/MTS-Dialog、microsoft/clinical_visit_note_summarization_corpus)取数。
- 进阶方法:在数据清单中记录每个文件的来源 URL 与许可,入库管线自动校验。
- SOTA 方法:把许可校验纳入 CI,镜像与官方的哈希/行数不一致即告警。
参考:MTS-Dialog 官方许可声明
8 个坑点速查(按出现阶段排序):
| # | 坑点 | 分类 | 触发阶段 |
|---|---|---|---|
| 1 | 行级打乱破坏对话分组 | 数据泄漏 | 数据切分 |
| 2 | MIMIC-CXR 训练禁区 | 数据泄漏 | 数据获取 |
| 3 | genhx 代号语义错位 | 标签理解 | 标签映射 |
| 4 | 验证集 100/180 双口径 | 评估误用 | 实验复现 |
| 5 | ROUGE 掩盖幻觉与遗漏 | 评估误用 | 结果评估 |
| 6 | 短对话 → 长就诊外推失败 | 预处理陷阱 | 模型部署 |
| 7 | 消费者问题拼写噪音 | 预处理陷阱 | 文本清洗 |
| 8 | 第三方镜像许可漂移 | 工程陷阱 | 合规审查 |
§6.6 数据增强
安全 ✅:官方 3.6k 对法/西语回译增强集(官方论文实验同款);官方 Note2Dialogue 合成对话思路(Task C)以「病历 → 对话」反向扩充;同义章节头归一化(大小写/空格规范化)。
危险 ❌:把验证/测试集对话喂给 LLM 改写后加入训练(直接泄漏);用无医学审校的 LLM 自由生成「新病历」混入金标准(污染标签分布);跨数据集混入 MIMIC-CXR 非授权子集(坑点 2 违规)。
| 增强手段 | 官方背书 | 风险 | 建议 |
|---|---|---|---|
| 法/西语回译(3.6k 对) | ✅ 官方发布并用于论文实验 | 翻译腔、专名变形 | 与人工主集加权混合(官方做法) |
| 病历 → 合成对话 | ✅ MEDIQA-Chat Task C 官方任务 | 生成对话可能引入幻觉事实 | 仅入训练侧,抽样人工审校 |
| LLM 改写现有对话 | 无 | 若改写验证/测试样本即泄漏 | 严格限定改写训练集,记录版本 |
| 随机拼接多对话 | 无 | 产生不自然上下文 | 不推荐 |
| 同义词替换病历正文 | 无 | 破坏医学术语精确性 | 不推荐 |
§6.7 模型推荐
| 模型 | 适用任务 | 依据 |
|---|---|---|
| FLAN-T5(large) | Dialogue2Note 摘要、章节头分类 | MEDIQA-Chat 2023 Task A 头名系统 |
| LED-large-16384-pubmed | 长对话/完整病历生成 | MEDIQA-Chat 2023 Task B 头名系统,长输入友好 |
| BART / PEGASUS(医疗域适应) | 短文本摘要 | MEDIQA 2021 参赛主流架构 |
| LoRA 微调 FLAN-T5 | 资源受限微调 | MEDIQA-Sum 2023 Subtask B 头名(SuryaKiran) |
| GPT-3.5/GPT-4(提示基线) | 零样本对照 | 跨域研究常用基线;注意事实性核查 |
选型补充说明:表中前两行是「官方头名同款」,适合追求可比成绩;BART/PEGASUS 一行来自 MEDIQA 2021 时代的经验(BART 微调即有竞争力,参赛队 Optum 即以简单 BART 微调参赛),如今更多作为消融基线而非首选;GPT 系列作为零样本基线时,务必同步报告事实性指标——LLM 在短对话上易补全不存在的 SOAP 成分(坑点 6),仅看 ROUGE 会高估其实用性。
§6.8 硬件需求
| 阶段 | 最低配置 | 推荐配置 |
|---|---|---|
| 数据处理与基线评测 | CPU / 8 GB 内存 | 任意 GPU 环境 |
| FLAN-T5-large 全参微调 | 16 GB 显存 | 24 GB 显存 + 混合精度 |
| LED-large 长输入微调 | 24 GB 显存(梯度检查点) | 40 GB 显存 |
| LoRA 微调 | 8 GB 显存 | 16 GB 显存 |
硬件估算的依据:数据为短文本(P75 仅 176 词),FLAN-T5-base 全参微调在 8 GB 显存即可完成;large 级别按 seq2seq 常规经验估算需 16 GB 起;LED-large 因 16K 输入窗口的自注意力开销,即便实际输入 2–4K token 也建议按 24 GB 配置预留梯度检查点空间。评测阶段(含 LLM 提示基线)无训练显存压力,CPU 环境即可完成官方测试集推理。
§6.9 评估指标代码
自动指标遵循 MEDIQA-Sum 2023 官方口径(三指标均值),章节头分类附官方准确率指标:
from rouge_score import rouge_scorer
from bert_score import score as bert_score
def aggregate_scores(preds, refs, header_preds=None, header_golds=None):
"""MEDIQA-Sum 官方聚合分 = mean(ROUGE-1, BERTScore-F1, BLEURT)。
此处给出 ROUGE-1 + BERTScore 两项;BLEURT 需另装 bleurt 包。"""
rs = rouge_scorer.RougeScorer(["rouge1", "rouge2", "rougeL"], use_stemmer=True)
r1 = sum(rs.score(r, p)["rouge1"].fmeasure for p, r in zip(preds, refs)) / len(preds)
_, _, f1 = bert_score(preds, refs, lang="en", verbose=False)
result = {"rouge1": r1, "bertscore_f1": f1.mean().item()}
result["aggregate"] = sum(result.values()) / len(result)
if header_preds is not None:
acc = sum(p == g for p, g in zip(header_preds, header_golds)) / len(header_preds)
result["header_accuracy"] = acc # Subtask A 指标(MEDIQA-Sum 2023 最佳 0.820)
return result
事实性评估建议在自动指标之外,按官方 Correlation-Study 口径补充:事实精确率/召回率/F1、幻觉率、遗漏率与 Levenshtein 编辑距离(对生成病历与对话做事实项人工计数或抽取比对)。下面给出一个可运行的简化版事实一致性核查框架(以「数值事实」为代表,正是跨域研究中最易被遗漏的 Objective 信息):
import re
NUM_PAT = re.compile(r"\b\d+(?:\.\d+)?\s*(?:mg|ml|mmhg|bpm|%|years?|days?|weeks?)\b", re.I)
def fact_check_numbers(dialogue: str, generated_note: str):
"""数值事实核查:对话中出现的药物剂量/生命体征数值是否被病历保留。
官方口径的核心思想:幻觉 = 摘要含对话外事实;遗漏 = 对话事实未入摘要。"""
src_facts = set(m.group(0).lower() for m in NUM_PAT.finditer(dialogue))
gen_facts = set(m.group(0).lower() for m in NUM_PAT.finditer(generated_note))
tp = len(src_facts & gen_facts)
precision = tp / len(gen_facts) if gen_facts else 1.0
recall = tp / len(src_facts) if src_facts else 1.0
f1 = 2 * precision * recall / (precision + recall) if precision + recall else 0.0
return {
"factual_precision": precision, # 低 → 幻觉(编造数值)
"factual_recall": recall, # 低 → 遗漏(Objective 信息丢失)
"factual_f1": f1,
"missing": sorted(src_facts - gen_facts),
}
该框架与官方 Correlation-Study 的差别在于:官方对 400 份摘要做了逐事实人工计数(含症状、用药、病程等非数值事实),此处仅以正则抽取数值事实作自动化近似;论文报告中若引用「事实性 P/R/F1」字样,应明确说明所用的抽取粒度。
§6.10 MLOps 笔记
数据以 Git 仓库为版本源(最近更新 2025-05,截至 2026-09),建议用 DVC 固定四个官方 CSV 的哈希;训练/评测流水线中把「官方划分锁定」「对话级分组校验」「许可校验」设为三道闸门;模型注册表记录条件前缀模板(generate {section_header}: …),因为条件格式是可复现性的一部分;线上病历生成系统需对每类章节维护幻觉率/遗漏率看板,指标回到官方 Correlation-Study 口径以便横向追踪。
针对本数据集的三条额外运维建议:
- 标签映射常量化:20 类章节头代号 → 显示名 → LOINC 码的三级映射作为配置文件进入代码库(genhx 陷阱的工程化解法),任何改动走 Code Review。
- 双口径验证集标记:流水线配置中显式声明
validation: repo_100或validation: task_180,避免不同实验间的静默混用。
| 评测锁定 | 对外报告的成绩只在 TestSet-1/TestSet-2 上产出,且评测脚本与随机种子随模型版本一起归档(CLEF 2023 的强制代码提交是值得借鉴的内部规范)。 |
若把本数据集用于生产级病历生成系统的验收测试,建议再加两条门禁:一是「事实性门禁」——幻觉率超过预设阈值即阻断发布,阈值参考官方 Correlation-Study 中各模型的人工计数分布来设定;二是「覆盖门禁」——20 类章节头的逐类错误率分别达标,防止高频类的整体均值掩盖低频类(如 gynhx)的系统性失效。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 模拟数据偏倚 | 对话由前抄写员按指南撰写,语言规整度高于真实口语 | 高 | 上线前用院内真实对话做外部验证 |
| 短对话/单主题偏倚 | 平均 142 词、单一章节主题,不含完整 SOAP 流程 | 高 | 长文本任务换 ACI-BENCH 或扩输入长度(坑点 6) |
| 标签不平衡 | 20 类章节头未公布分布,社区普遍反映病史类高频、专科类低频 | 中 | 分层采样 + 每类指标单独报告 |
| 语言/地域偏倚 | 仅美式英语,美国门诊文书习惯 | 中 | 迁移到其他语言/规范需重建标签映射 |
| 标注者风格单一 | 标注者群体小、培训流程统一,风格收敛 | 中 | 多源数据混合训练前做风格探针分析 |
| 章节体系绑定 | 20 类章节绑定美式门诊/急诊模板,缺住院病程等文书类型 | 中 | 跨文书类型迁移前重建标签体系 |
| 测试集老化 | 官方测试集自 2023 年冻结,LLM 时代成绩趋近饱和 | 中 | 关注分数饱和信号,辅以自建新测试集 |
缓解措施按投入产出排序:先做「划分与泄漏治理」(零成本、收益最大),再做「指标升级」(事实性三件套替代单一 ROUGE),最后才是「数据侧补救」(混入真实对话、风格多样化增强)——因为模拟数据的核心偏倚无法通过算法修补,只能靠外部真实数据对冲。
§7.2 标注质量
三步质控(资质筛选 → 一对一培训反馈 → 独立 rubric 复核 + 小幅修正)保证了对话与摘要的高对齐度;官方未公布标注者间一致性系数,属于透明度短板。官方额外发布 400 份自动摘要的人工事实性计数(事实 P/R/F1、幻觉率、遗漏率、编辑距离),这是该生态少有的「人工评估锚点」,应优先利用。
| 质控环节 | 内容 | 对使用者的意义 |
|---|---|---|
| 标注者筛选 | 仅录用有医学背景者(前 medical scribes) | 章节正文符合病历书写惯例,标签语义可靠 |
| 一对一培训反馈 | 早期逐条反馈修正标注习惯 | 风格收敛,跨实例一致性较好 |
| 独立复核 | rubric 评估指南遵循度与内容相关性,小幅修正 | 成稿质量高于一次成稿流程 |
| 透明度缺口 | 无 Kappa 等一致性系数、无逐类计数 | 论文中需自行声明该局限 |
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 短对话模型 → 完整就诊(ACI-BENCH) | 客观信息(O 部)大量遗漏 | 跨域研究:FLAN-T5(MTS-Dialog 训练)在 ACI-BENCH 上数值信息缺失 |
| 完整就诊模型 → 短对话(MTS-Dialog) | SOAP 缺失成分被凭空补全(幻觉) | 同上:LED 在短对话上生成对话中不存在的 SOAP 段 |
| 单机构 → 跨机构报告(RRS) | 写作风格差异导致性能下降 | MEDIQA 2021 总览的 Stanford vs Indiana 泛化差距 |
| 模拟英语 → 真实多语环境 | 语言与文书规范双重失配 | 数据仅美式英语;镜像生态亦以英语为主 |
| 领域预训练增益 | PubMed/住院文本预训练对门诊任务收益有限甚至为负 | MEDIQA 2021 与 PULSAR 的负向/有限证据 |
泛化性表的用法:把它当作「实验设计前的风险清单」——若你的目标场景命中其中一行,就应在实验矩阵中提前安排对应的跨域测试组,而不是等投稿评审指出。四行风险的共同根因是训练分布过窄(单机构、单主题、单语域),任何拓宽训练分布的措施(多源混合、合成对话、域适应)都应针对具体行验证有效性。
§7.4 伦理
数据全部为模拟对话,不含真实患者信息(无 PHI),发布无需 IRB;这一设计以牺牲真实性换取可发布性。使用者应避免把「模拟病历生成器」直接用于临床文书,且生成结果需医生复核。CC BY 4.0 允许商用,但需署名(引用官方论文)。
两点延伸提醒:其一,模拟数据虽无 PHI,但「病历 → 合成对话」方向生成的对话若与真实患者情境高度相似,可能被误当作真实记录流转,产品设计中应给合成内容加显式水印或元数据标记;其二,CC BY 4.0 的署名义务同样适用于模型蒸馏场景——用该数据训练的教师模型产出的蒸馏数据集,应在数据卡中回溯声明上游来源。
§7.5 公平性
数据不含人口学字段(年龄、性别、种族均无),无法直接度量人群公平性;对话内容隐含的美国门诊场景与英语能力要求,可能使模型在其他语言与医疗体系下表现退化。构建多语或多地区版本时,MEDIQA-M3G 2024(皮肤科多语视觉问答)是系列内可参考的延伸。
公平性评估的可执行路径:既然数据本身不含人口学信号,公平性分析只能放在「任务层」——即检查生成系统在按科室、按章节类型、按对话复杂度切分的子群体上的性能差异(例如:老年多病共存对话 vs 单症状对话的遗漏率差异)。这类「章节级/复杂度级」公平性切片是 MTS-Dialog 可支撑的、且对临床部署有实际意义的最低限度公平性审计。
§7.6 数据漂移
病历书写实践、模板与合规要求持续演变(如 insurer 要求与 EHR 模板更新),模拟语料固定于 2022–2023 年构建期;LLM 时代摘要模型的能力增长也会使固定测试集逐步「饱和」。建议以官方测试集为锚、滚动引入自采新对话做漂移监测,并跟踪仓库更新(最近 2025-05,截至 2026-09)。
可操作的漂移监测方案:
- 数据侧:为自采对话维护「入池时间」字段,按季度对比新池与 MTS-Dialog 的章节分布、对话长度分布与词汇表差异(KL 散度或简单的覆盖率即可)。
- 模型侧:对每类章节头维护准确率/幻觉率的滚动窗口看板;genhx、medications 等高频类的突然掉点通常是分布迁移的最早信号。
- 协议侧:LLM 提示基线的成绩会随模型供应商更新而漂移,固定测试集上的提示基线也应像模型一样做版本归档。
§7.7 DAIMS 数据集自评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | CSV 宽表,四列结构清晰 |
| 2 | 唯一标识 | ✅ | 每行有 ID;对话前缀可作分组键 |
| 3 | 特殊字符 | ⚠️ | 对话含换行、缩写与非规范拼写,需清洗但不至破坏解析 |
| 4 | 重复行 | ✅ | 官方主集无重复行问题(增强集与主集需分开管理) |
| 5 | 缺失编码 | ⚠️ | 无显式缺失编码,空值语义未定义 |
| 6 | 标签标识 | ✅ | 20 类章节头显式枚举 |
| 7 | 罕见类分组 | ⚠️ | 低频章节(gynhx、immunizations 等)样本稀少,官方未公布逐类计数 |
| 8 | 偏倚评估 | ⚠️ | 官方未附偏倚分析,模拟数据偏倚需使用者自评 |
| 9 | 数据字典 | ✅ | README 提供完整字段与标签说明 |
| 10 | 信息性缺失解释 | ❌ | 「对话不含某章节」以行缺省表达,无正式语义定义 |
| 11 | 设备记录 | ❌ | 纯文本,无设备维度 |
| 12 | 共线性 | ✅ | 文本数据,不适用数值共线性问题 |
| 13 | 编码映射 | ⚠️ | 章节头代号 ↔ 显示名 ↔ LOINC 需自行映射(genhx 陷阱) |
| 14 | 时间戳处理 | ❌ | 对话与摘要均无时间戳 |
| 15 | 划分建议 | ✅ | 官方划分明确(含两套验证口径需注意) |
| 16 | 泄漏讨论 | ✅ | 官方明确 RRS 训练禁区;对话级分组需自行落实 |
| 17 | 标签分布 | ⚠️ | 未公布 20 类逐类计数 |
| 18 | 测量偏倚 | ⚠️ | 标注者群体小且风格统一,无一致性系数 |
| 19 | 外部验证建议 | ✅ | ACI-BENCH/跨机构验证路径清晰(§7.8) |
| 20 | 版本记录 | ✅ | GitHub 版本管理,更新可追溯(最近 2025-05) |
| 21 | 预处理脚本 | ✅ | 官方提供摘要系统源码与评估脚本 |
| 22 | 合规要求 | ✅ | CC BY 4.0,主集无申请门槛 |
| 23 | 多模态对齐 | ❌ | 纯文本,无影像/信号对齐需求 |
| 24 | 去标识化 | ✅ | 模拟对话,天然无 PHI |
DAIMS 评分:16.5 / 24
评分解读:该分数反映「文本金标准的典型画像」——结构与合规项近乎满分(标识、字典、划分、许可、版本、去标识化全绿),失分集中在临床数据固有的透明度短板:无时间戳、无疾病标签、无逐类分布与一致性系数,以及模拟数据带来的偏倚自评责任。对纯文本对话摘要研究而言,这些 ❌/⚠️ 大多「无从修复」而非「数据缺陷」。
分项透视:24 项中 ✅ 13 项多为「数据发布方已做到位」的工程项(标识、字典、许可、版本、脚本),⚠️ 7 项多为「需要使用者自行补齐」的分析项(分布统计、偏倚自评、编码映射),❌ 4 项全部是模态使然(无设备、无时间戳、无多模态、无信息性缺失编码)。换言之,扣分主要不是「做错了」而是「文本对话数据的天然边界」,这与 MIMIC 类 ICU 数值库的扣分结构截然不同——后者失分集中在隐私与合规,前者失分集中在语义透明度。
对你意味着什么:(1) 直接用官方划分 + 对话级分组即可安全训练,不必等待数据方修复;(2) 论文中必须自行补齐偏倚与一致性说明,审稿人会盯住模拟数据外推性;(3) 若你的任务依赖时间序列、疾病标签或人口学分层,此数据集不满足需求,应另配资源;(4) 章节头到 LOINC 的映射(§2.1b)建议直接进工程代码,避免 genhx 类语义错位。
若把本数据集引入院内数据治理体系,建议给 DAIMS 评分建立年度复评机制:随着官方仓库更新或你补充自采对话,✅/⚠️/❌ 的分布会变化,复评记录本身即是数据资产健康度的审计轨迹。### §7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| ACI-BENCH(完整就诊) | U. Washington/Microsoft 等 | MTS-Dialog 模型跨域评测 | ROUGE/BERTScore 等 | 显著下降 | FLAN-T5 在 SOAP 全段任务上遗漏客观信息(arXiv 2406.02826) |
| Stanford vs Indiana 测试分布 | 斯坦福大学 / 印第安纳大学 | 放射报告摘要(RRS) | ROUGE 系列 | 跨机构显著下降 | 单机构训练存在泛化差距(MEDIQA 2021 总览 Table 6) |
| MEDIQA-Sum 2023 Task C | CLEF 官方(Tredence 等) | 完整就诊 Dialogue2Note | ROUGE-1 0.500(冠军) | 远低于短对话任务(0.44 聚合分) | 长对话仍是瓶颈(ImageCLEF 2023 总览) |
| JMIR mHealth PEFT 研究 | 期刊同行评审 | LoRA/PEFT 病历生成 | 多指标对比 | 与全参微调可比 | 模拟对话定位明确:无 PHI 即不构成人体研究(JMIR mHealth 2026) |
外部验证矩阵的三点结论:第一,跨域掉分是系统性现象(短↔长、机构↔机构两个方向都成立),任何仅报告 MTS-Dialog 内部指标的系统都应视为「未验证」;第二,跨域研究同时给出了可操作的诊断方法(按 SOAP 分部统计信息缺失与幻觉),复现门槛低;第三,PULSAR 的「规模化 > 领域预训练」结论与 MEDIQA 2021 时代「领域适应有效」的经验形成对照,提示医疗 NLP 的方法结论随模型规模演化而失效,选型依据应跟随最新外部验证而非历史排行榜。
§8 基准性能与生态
§8.1 排行榜(官方成绩)
阅读须知:以下数字均来自官方总览论文的成绩表,仅在同任务同年官方测试集内可比;「排名」指该届任务官方排名而非跨届排名。
MEDIQA-Sum 2023(ImageCLEF,12 队 48 轮):
| 子任务 | 排名 | 队伍/机构 | 成绩 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| Subtask A(分类) | 1 | Cadence(美国) | 准确率 0.820 | 文本分类 | Ionescu et al., 2023, CLEF Working Notes. CEUR Vol-3497 | 未公开 |
| Subtask B(摘要) | 1 | SuryaKiran(Optum,印度) | 聚合分 0.5732 | LoRA 微调 | SuryaKiran at MEDIQA-Sum 2023, 2023, CLEF Working Notes. CEUR paper-143 | 论文方法可复现 |
| Subtask C(完整就诊) | 1 | Tredence(印度/美国) | ROUGE-1 0.500 / 聚合 0.455 | 长文档生成 | Ionescu et al., 2023, CLEF Working Notes. CEUR Vol-3497 | 未公开 |
MEDIQA-Chat 2023(ClinicalNLP,17 队):Task A 章节头分类最佳准确率 0.78(参赛者平均 0.56);wanglab 的 FLAN-T5-large 与 LED-large-16384-pubmed 分别列 Task A、Task B 头名(完整引用:Ben Abacha et al., 2023, ClinicalNLP@NAACL. DOI 10.18653/v1/2023.clinicalnlp-1.52;系统细节见 wanglab HF 仓库)。
MEDIQA 2021(NAACL-BioNLP,35 队):
| 任务 | 排名 | 队伍 | ROUGE-2 | 关键技术 | 完整引用 |
|---|---|---|---|---|---|
| QS | 1 | damo_nlp | 0.1608 | 知识驱动预处理 + 覆盖度重排 | He, Chen & Huang, 2021, BioNLP@NAACL. ACL |
| MAS | 1 | paht_nlp | 0.5076 | 多粒度查询聚焦摘要 | Zhu et al., 2021, BioNLP@NAACL. ACL |
| RRS | 1 | BDKG | 0.4362 | 领域自适应模块 + 事实感知重排 | Dai, Wang, Lyu & Zhu, 2021, BioNLP@NAACL. ACL |
⚠️ 各任务、各年份的数字不可直接比较:测试集不同(200 章节实例 vs 400 报告量级)、指标口径不同(ROUGE-2 排名 vs 三指标聚合分)、且 ROUGE 对摘要长度敏感;跨队比较仅在同任务同年官方测试集内有效。
§8.2 SOTA 总结与选型建议
截至 2026-09,对话→病历摘要的实用选型:追求官方可比成绩选 FLAN-T5/LED 微调(Task A/B 头名架构);资源受限选 LoRA(Subtask B 头名);LLM 零样本可作快速基线但必须补事实性核查。指标上建议放弃单一 ROUGE,采用「聚合分 + 事实性 P/R/F1 + 章节头准确率」三件套。
| 需求画像 | 推荐路线 | 理由 |
|---|---|---|
| 论文复现/排行榜对齐 | FLAN-T5-large 全参微调(短对话);LED-large(长对话) | MEDIQA-Chat 2023 双任务头名架构,成绩可锚定 |
| 数据稀缺/单卡环境 | LoRA/PEFT 微调 | Subtask B 头名验证有效;8 GB 显存可跑 |
| 快速 LLM 基线 | GPT-3.5/4 提示 + 事实性核查 | 零训练成本;跨域研究常用对照 |
| 章节头分类产线 | DeBERTa/BERT 类编码器微调 | 分类任务轻量;官方最佳准确率 0.78(Chat)/0.820(Sum) |
| 数据增强研究 | Note2Dialogue 反向生成(Task C 思路) | 官方验证过「病历 → 合成对话」的可行性 |
§8.3 评测协议
MEDIQA-Sum 2023 官方协议:Subtask A 用准确率;Subtask B/C 用 ROUGE-1、BERTScore、BLEURT 的算术平均(Subtask C 另按 SOAP 四分部等权聚合);每队每子任务至多 3 轮提交;强制提交代码,官方核查可复现性并记录状态。MEDIQA 2021:ROUGE 主排名 + HOLMS/CheXbert 辅助。该「代码强制 + 可复现性审计」是本系列评测协议的突出优点。
| 协议要素 | MEDIQA 2021 | MEDIQA-Chat 2023 | MEDIQA-Sum 2023 |
|---|---|---|---|
| 主指标 | ROUGE(排名用) | 各任务按类型定 | 准确率(A)+ 三指标均值(B/C) |
| 辅助指标 | HOLMS、CheXbert | 事实性与 ROUGE 族 | SOAP 分部聚合分(C) |
| 提交限制 | 经 AIcrowd 提交 | 多轮提交 | 每子任务至多 3 轮 |
| 代码要求 | 无强制 | 无强制 | 强制提交 + 可复现性核查 |
| 测试集发放 | 注册签署协议后 | 官方仓库/任务页 | 官方发放(A 结束后公布头标注供 B 用) |
三届协议的演进方向清晰:从 2021 的「指标探索」(HOLMS、CheXbert 首次进入医疗摘要评测)到 2023 的「指标整合 + 可复现性强制」,评测重心从「用什么分」转向「分能不能被信任」。自带评测协议立项的团队可直接借用 MEDIQA-Sum 2023 的完整协议文本(三指标均值 + 代码强制 + 复现审计),这是该共享任务留给社区的治理遗产。
§8.4 相关数据集
| 数据集 | 关系 | 获取 |
|---|---|---|
| MeQSum | MEDIQA 2021 QS 训练数据(消费者问题摘要) | 公开仓库 |
| MEDIQA-AnS | MEDIQA 2021 MAS 训练数据(多答案聚合) | 公开仓库 |
| MIMIC-CXR | MEDIQA 2021 RRS 训练源(放射报告) | PhysioNet 凭证化 |
| Indiana 胸片报告 | MEDIQA 2021 RRS 验证分布之一(禁止入训) | 公开数据集 |
| ACI-BENCH | MEDIQA-Chat/Sum 完整就诊官方测试集 | GitHub 公开 |
| clinical_visit_note_summarization_corpus | MTS-Dialog + ACI-BENCH 官方合集 | GitHub 公开 |
相关数据集的使用关系可概括为「一个训练生态、两代评测锚点」:MeQSum/MEDIQA-AnS/MIMIC-CXR 支撑 2021 年三任务训练,MTS-Dialog 支撑 2023 年短对话任务训练,而所有测试锚点(TestSet-1/2 与 ACI-BENCH 三组)自定稿起冻结——因此任何新方法只需对齐这些锚点即可进入可比序列,无需重新组织评测。
§8.5 关键论文 Top 10
- Ben Abacha, Mrabet, Zhang, Shivade, Langlotz & Demner-Fushman, 2021, BioNLP@NAACL, pp. 74–85. DOI 链接 — MEDIQA 2021 三任务总览,确立 ROUGE+HOLMS+CheXbert 评估框架与泛化差距发现。
- Ben Abacha, Yim, Fan & Lin, 2023, EACL, pp. 2291–2302. DOI 链接 — MTS-Dialog 数据集原始论文,含回译增强与指标相关性研究。
- Ben Abacha, Yim, Adams, Snider & Yetisgen, 2023, ClinicalNLP@NAACL. DOI 10.18653/v1/2023.clinicalnlp-1.52 — MEDIQA-Chat 2023 三任务总览(17 队)。
- Yim, Ben Abacha, Snider, Adams & Yetisgen, 2023, CLEF Working Notes. CEUR Vol-3497 paper-109 — MEDIQA-Sum 2023 三子任务总览与官方成绩表。
- Yim, Fu, Ben Abacha, Snider, Lin & Yetisgen, 2023, Nature Scientific Data, 10. DOI 链接 — ACI-BENCH 完整就诊对话数据集。
- He, Chen & Huang, 2021, BioNLP@NAACL — damo_nlp 问题摘要冠军系统(知识驱动预处理 + 覆盖度重排)。
- Dai, Wang, Lyu & Zhu, 2021, BioNLP@NAACL — BDKG 放射报告摘要冠军系统(事实感知重排)。
- SuryaKiran team, 2023, CLEF Working Notes. CEUR paper-143 — LoRA 轻量微调夺得 Subtask B 第一,验证 PEFT 在小数据病历生成上的有效性。
- Zhu, He, Chai, Fan, Ni, Xie & Wang, 2021, BioNLP@NAACL — paht_nlp 多答案摘要冠军系统,多粒度查询聚焦的聚合范式(MAS 赛道 ROUGE-2 0.5076)。
- Sänger, Weber & Leser, 2021, BioNLP@NAACL — WBI 生成式 Transformer 问题摘要系统(QS 赛道代表工作),系统比较了生成式架构在消费者问题上的表现。
§8.6 社区活跃度
MEDIQA 系列由 NLM/NIH 研究者持续维护:官方 Google Site 汇总 2019–2024 各版任务与总览论文;GitHub 组织(abachaa)下 MTS-Dialog、MEDIQA2021、MEDIQA-Chat-2023 等仓库公开,MTS-Dialog 最近更新 2025-05(截至 2026-09 核对);Mailing list(bionlp-mediqa / mediqa-nlp)延续答疑传统。社区衍生研究活跃:跨域鲁棒性分析、PEFT 对比研究(JMIR mHealth 2026)、合成数据研究(PULSAR)等持续引用官方口径。
活跃度的三个观察信号:其一,MTS-Dialog 论文发布后持续出现在病历生成与对话摘要新工作的实验表中,已成为该方向的默认回归基准;其二,两版 2023 共享任务合计 29 支队伍、参赛机构覆盖高校、医院与产业界(Optum、Cadence、Tredence 等),说明任务同时吸引研究与应用两侧;其三,系列在 2024 年继续扩版(MEDIQA-CORR、MEDIQA-M3G),组织方投入未中断,生态可持续性有保障。
对贡献者的提示:官方仓库接受 Issue 反馈数据问题;若发现标注错误或标签歧义(如 genhx 显示名),优先在仓库 Issue 区核对是否已有讨论,再决定是否自行在管线中做修正映射——直接修改数据文件会破坏与官方测试集的可比性。
§8.7 生态快照
| 资源 | 类型 | 链接 | 仓库状态(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| MTS-Dialog 官方仓库 | 数据 + 源码 | GitHub | 32 commits,2025-05 更新 | 主集、增强集、人工事实性评分一站式 |
| MEDIQA 系列官网 | 官方索引 | Google Site | 持续维护 | 各版任务与总览论文入口 |
| MEDIQA2021 仓库 | 数据 + 脚本 | GitHub | 赛后冻结 | 三任务训练数据与 RRS 下载脚本 |
| MEDIQA-Chat 2023 仓库 | 评测材料 | GitHub | 赛后冻结 | Task A/B/C 官方材料 |
| 官方语料合集 | 数据合集 | GitHub | 稳定 | MTS-Dialog + ACI-BENCH 统一入口 |
| ACL Anthology | 论文库 | 2021 总览 / EACL 2023 | 稳定 | 权威引用与 BibTeX |
| CEUR Vol-3497 | 论文库 | MEDIQA-Sum 总览 | 稳定 | CLEF 2023 成绩表与方法 |
生态使用路径建议:新手从「系列总览 → MTS-Dialog 仓库 → EACL 2023 论文」三步入门即可获得全部必需品;进阶研究者再读两版 2023 总览论文的参赛方法汇总(各自十余篇 working note 的一句话摘要),可快速定位与自己设定最接近的对手系统。
§9 相关资源与引用
§9.1 官方资源清单
- 系列总览与各版入口:MEDIQA Shared Tasks
- MEDIQA 2021 官方站点:sites.google.com/view/mediqa2021;赛后开放轮:AIcrowd
- MEDIQA-Chat 2023 评测材料:github.com/abachaa/MEDIQA-Chat-2023
- MTS-Dialog 数据与源码:github.com/abachaa/MTS-Dialog
- ACI-BENCH:github.com/wyim/aci-bench;官方合集:microsoft/clinical_visit_note_summarization_corpus
- MEDIQA-Sum 2023(ImageCLEF):官方任务页
- 术语标准:LOINC(病历章节编码)、SNOMED CT(临床所见层级)
- 社区邮件列表:bionlp-mediqa / mediqa-nlp(Google Groups,历届任务答疑存档)
§9.2 BibTeX 完整引用
以下 BibTeX 依 ACL Anthology 与 CEUR 官方条目整理,可直接粘贴使用(引用 MIMIC-CXR 相关内容时另按 PhysioNet 要求补引):
@inproceedings{benabacha-2021-mediqa,
title = {Overview of the {MEDIQA} 2021 Shared Task on Summarization in the Medical Domain},
author = {Ben Abacha, Asma and Mrabet, Yassine and Zhang, Yuhao and Shivade, Chaitanya and Langlotz, Curtis and Demner-Fushman, Dina},
booktitle = {Proceedings of the 20th Workshop on Biomedical Language Processing},
month = jun,
year = {2021},
publisher = {Association for Computational Linguistics},
url = {https://aclanthology.org/2021.bionlp-1.8/},
pages = {74--85}
}
@inproceedings{mts-dialog,
title = {An Empirical Study of Clinical Note Generation from Doctor-Patient Encounters},
author = {Ben Abacha, Asma and Yim, Wen-wai and Fan, Yadan and Lin, Thomas},
booktitle = {Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics},
month = may,
year = {2023},
address = {Dubrovnik, Croatia},
publisher = {Association for Computational Linguistics},
url = {https://aclanthology.org/2023.eacl-main.168},
pages = {2291--2302}
}
@inproceedings{benabacha-2023-mediqa-chat,
title = {Overview of the {MEDIQA-Chat} 2023 Shared Tasks on the Summarization \& Generation of Doctor-Patient Conversations},
author = {Ben Abacha, Asma and Yim, Wen-wai and Adams, Griffin and Snider, Neal and Yetisgen, Meliha},
booktitle = {Proceedings of the 5th Clinical Natural Language Processing Workshop},
year = {2023},
publisher = {Association for Computational Linguistics},
doi = {10.18653/v1/2023.clinicalnlp-1.52}
}
@inproceedings{yim-2023-mediqa-sum,
title = {Overview of the {MEDIQA-Sum} Task at {ImageCLEF} 2023: Summarization and Classification of Doctor-Patient Conversations},
author = {Yim, Wen-wai and Ben Abacha, Asma and Snider, Neal and Adams, Griffin and Yetisgen, Meliha},
booktitle = {CLEF 2023 Working Notes, CEUR Workshop Proceedings},
year = {2023},
address = {Thessaloniki, Greece},
url = {https://ceur-ws.org/Vol-3497/paper-109.pdf}
}
@article{aci-bench,
author = {Yim, Wen-wai and Fu, Yujuan and Ben Abacha, Asma and Snider, Neal and Lin, Thomas and Yetisgen, Meliha},
title = {{ACI-BENCH}: a Novel Ambient Clinical Intelligence Dataset for Benchmarking Automatic Visit Note Generation},
journal = {Nature Scientific Data},
year = {2023},
volume = {10},
url = {https://www.nature.com/articles/s41597-023-02487-3}
}
@inproceedings{suryakiran-2023-mediqa-sum,
title = {{SuryaKiran} at {MEDIQA-Sum} 2023: Leveraging {LoRA} for Clinical Dialogue Summarization},
author = {{SuryaKiran Team}},
booktitle = {CLEF 2023 Working Notes, CEUR Workshop Proceedings},
year = {2023},
url = {https://ceur-ws.org/Vol-3497/paper-143.pdf}
}
§9.3 引用指南
使用 MTS-Dialog 主集/增强集请引 mts-dialog;使用官方测试集成绩请同时引对应任务总览(benabacha-2023-mediqa-chat 或 yim-2023-mediqa-sum);使用 ACI-BENCH 请引 aci-bench;使用 MEDIQA 2021 三任务数据请引 benabacha-2021-mediqa。放射报告部分因数据源自 MIMIC-CXR,还应遵循 PhysioNet 对 MIMIC-CXR 的引用要求。
两条引用实务建议:第一,引用总览论文时同时给出所用子集的精确文件名(如 MTS-Dialog-TestSet-2-MEDIQA-Sum-2023.csv),因为同系列存在多个易混淆的划分口径;第二,若你的指标是 ROUGE-1/BERTScore/BLEURT 三指标均值,引用时注明「MEDIQA-Sum 2023 聚合分口径」,避免与单一 ROUGE 数字混淆。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型
- 文本生成模型:fast-model(CodeBuddy Code 内置)
- 检索辅助:WebSearch(联网检索核实事实)
§10.2 AI 参与范围
AI 负责文献检索、事实整理、初稿撰写与格式排版;事实性内容由检索来源约束(见 §10.3),全部章节经编辑部人工复核流程后发布。以下内容明确不由 AI 决定:疾病分类与 LOINC 编码的最终取舍(§2.1、§2.1b)、DAIMS 评分定级(§7.7)、坑点优先级排序(§6.5)。
§10.3 输入来源列表
- Ben Abacha et al., 2021, BioNLP@NAACL. https://aclanthology.org/2021.bionlp-1.8/
- Ben Abacha, Yim, Fan & Lin, 2023, EACL. https://aclanthology.org/2023.eacl-main.168/
- Ben Abacha, Yim, Adams, Snider & Yetisgen, 2023, ClinicalNLP@NAACL. DOI 10.18653/v1/2023.clinicalnlp-1.52
- Yim et al., 2023, CLEF Working Notes. https://ceur-ws.org/Vol-3497/paper-109.pdf
- Yim et al., 2023, Nature Scientific Data. https://www.nature.com/articles/s41597-023-02487-3
- MTS-Dialog 官方仓库. https://github.com/abachaa/MTS-Dialog
- MEDIQA2021 官方仓库. https://github.com/abachaa/MEDIQA2021
- MEDIQA 系列总览. https://sites.google.com/view/mediqa-shared-tasks
- MEDIQA 2021 官方站点. https://sites.google.com/view/mediqa2021/home
- 官方语料合集. https://github.com/microsoft/clinical_visit_note_summarization_corpus
- ImageCLEF 2023 总览. https://cea.hal.science/cea-04574635/file/ImageCLEF_2023_overview_springer_note.pdf
- SuryaKiran at MEDIQA-Sum 2023. https://ceur-ws.org/Vol-3497/paper-143.pdf
- 跨域 SOAP 鲁棒性分析. https://ar5iv.arxiv.org/html/2406.02826
- DS4DH at MEDIQA-Chat 2023. https://www.medrxiv.org/content/10.1101/2023.06.08.23291121v1.full
- JMIR mHealth PEFT 对比研究. https://mhealth.jmir.org/2026/1/e82545
- LOINC 文档章节编码. https://details.loinc.org/LOINC/85245-9.html
- FHIR LOINC Document Section 值集. https://build.fhir.org/ig/cctwFHIRterm/MOHW_TWCoreIG_Build/ValueSet-loinc-doc-section-code.xml.html
- MEDIQA-Chat 2023 官方仓库. https://github.com/abachaa/MEDIQA-Chat-2023
- ImageCLEF MEDIQA 任务页. https://www.imageclef.org/2023/medical/mediqa
- 第三方镜像 EN-MEDIQA(许可漂移证据). https://www.aifasthub.com/datasets/jonathankang/EN-MEDIQA
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景与 ICD-11/LOINC 映射 | 千方病案医学编辑部 | 对照 LOINC 官方码表逐条核对 | ✅ 已通过/已验证 |
| §4 数据结构与规模数字 | 千方病案医学编辑部 | 对照官方仓库与 EACL 2023 论文核对 | ✅ 已通过/已验证 |
| §6 预处理代码与坑点 | 数据工程师 | 代码走查 + 官方划分口径核对 | ✅ 已通过/已验证 |
| §7 质量评估与 DAIMS | 千方病案医学编辑部 | 24 项逐项核查 | ✅ 已通过/已验证 |
| §8 基准数字 | 千方病案医学编辑部 | 对照官方总览论文成绩表 | ✅ 已通过/已验证 |
| §9 BibTeX | 千方病案医学编辑部 | 对照 ACL Anthology/CEUR 官方条目 | ✅ 已通过/已验证 |
| §10 声明卡与来源列表 | 千方病案医学编辑部 | 逐条 URL 可达性核查 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
本页面全部章节由 AI 辅助生成初稿,其中 §1.0、§1.2、§2.2、§2.5 为 AI 基于来源综述撰写,其余章节为 AI 整理结构 + 人工核定内容;无纯 AI 无审核章节。代码示例(§6.1–§6.4、§6.9)由 AI 撰写并经数据工程师走查,接口以 transformers/pandas/scikit-learn 公开 API 为准。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
