信息速览

LitCovid — NCBI 官方新冠文献策展库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | LitCovid |
| 英文全称 | LitCovid: a curated literature hub for tracking up-to-date scientific information about the 2019 novel Coronavirus |
| 别名/简称 | LitCovid(官方唯一名称;NCBI 站内路径 /research/coronavirus/) |
| 疾病分类 | COVID-19 全谱系文献(ICD-11:1D92 COVID-19 / RA01.0 应急确认诊断;Long Covid 集合对应 Post COVID-19 condition) |
| SNOMED CT | 840539006 Disease caused by SARS-CoV-2 / 840533007 SARS-CoV-2(病原体);Long Covid 集合对应 Post COVID-19 condition 概念(详见 §2.2) |
| 数据模态 | 生物医学文献元数据(标题/摘要/MeSH)、多标签主题标注、实体标注(化学品与地理位置) |
| AI 任务类型 | 多标签主题分类、文献分诊与检索、证据合成、命名实体识别、文本与数据挖掘(TDM) |
| 样本总数 | 437,000+ 篇文献、来自 8,000+ 种期刊(截至 2024-11);其中 Long Covid 集合约 9,000 篇(2022-12) |
| 数据格式 | BioC XML/JSON(FTP 全库)、TSV(API 导出)、TSV(BioCreative VII train/dev/test) |
| 许可证 | 美国公共领域(U.S. Government Work,无版权限制) |
| 访问级别 | 开放(无需注册、无需申请) |
| DUO 标签 | NRES(无限制;文献元数据库,不含人类受试者数据) |
| 语言 | 英文(PubMed 收录文献的标题与摘要) |
| 首发日期 | 2020-02(官方论文表述为 first launched in February 2020) |
| 最后更新 | 每日更新(连续运行;437,000+ 篇快照截至 2024-11) |
| 发布机构 | NCBI / NLM / NIH(Bethesda, MD, USA) |
| 官方主页 | https://www.ncbi.nlm.nih.gov/research/coronavirus/ |
| 下载地址 | https://ftp.ncbi.nlm.nih.gov/pub/lu/LitCovid/ |
| DOI | 10.1093/nar/gkaa952(数据库描述论文;数据库本体无 DOI) |
| 引用次数 | 257+(Semantic Scholar,截至 2026-09,指 NAR 2021 数据库论文) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 开放直载、BC7 官方划分与评测脚本齐全;扣分项:主库为连续更新流无固定划分、BioC 格式需解析、全文需自行经 PMID→PMCID 映射获取 |
| 页面状态 | published |
§0 医学审核与免责声明
- 医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(COVID-19 疾病编码、Long Covid 定义与主题体系)、§7 质量评估与偏倚分析。
- 数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。LitCovid 由美国联邦政府雇员在职务范围内创作,在美国处于公共领域,无需注册或签署使用协议;NCBI 官方声明其产出信息不用于直接诊断或医疗决策,且须经临床专业人士审阅。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? LitCovid 是美国国家卫生研究院(NIH)下属国家医学图书馆(NLM)的国家生物技术信息中心(NCBI)在 2020 年 2 月上线的 COVID-19 文献专题库。它每天从 PubMed 海量新收录文章中把新冠相关论文"挑出来",并给每篇打上研究主题标签,让你不用在数千万条 PubMed 记录里大海捞针。截至 2024 年 11 月,它已收录超过 437,000 篇文献,来自 8,000 余种期刊,且仍在每日更新。
为什么重要? 疫情高峰期新冠论文以每月约 10,000 篇的速度增长,人工检索与阅读完全跟不上。LitCovid 用"机器学习分诊 + 人工审核"的混合流程自动化了这件事:其分诊模型识别相关文献的 F1 约 0.99,比纯关键词检索多识别约 35% 的相关文献。它是同类中第一个新冠专题文献资源,全部数据免费开放,成为全球科学家、公卫工作者与 AI 研究者的公共基础设施。
我能用它做什么? 三类典型用途:一是做多标签主题分类的模型训练与评测(BioCreative VII 官方基准:30,000+ 篇人工审核标注);二是做证据合成——按 Treatment、Diagnosis、Prevention 等 8 类主题快速定位文献,支撑系统综述与临床指南制定;三是做文本挖掘——基于标题、摘要做实体识别、疫情趋势分析与 RAG 知识库构建。
§1.1 技术摘要
LitCovid 的核心是一条每日运行的混合策展流水线。第一级是文献分诊(document triage):先用覆盖 coronavirus、ncov、2019-nCoV、COVID-19、SARS-CoV-2 等词的 PubMed 检索式粗筛,再用机器学习模型精判相关性(F1 约 0.99);第二级是主题分类(topic classification):为每篇文献分配最多 8 个主题标签(多标签任务),由自动算法给出建议、人工审核确认,算法层面 F1 约 0.80,因此团队在 2021-2022 年组织了 BioCreative VII 挑战赛,将最佳系统的 macro-F1 推到 0.8875;第三级是实体识别(entity recognition):抽取文中提到的化学品与地理位置(F1 约 0.94)。除 8 个主题外,2021 年 7 月底上线了 Long Covid 专题集合(以 human-in-the-loop 机器学习识别,2022 年底约 9,000 篇),并为文献标注了涉及的毒株与疫苗。全库数据以 BioC XML/JSON 格式在 FTP 开放,API 支持 TSV 导出,许可为美国公共领域。
§1.2 战略价值
维度一:生物医学 NLP 的公共基准。 在 BioCreative VII 之前,生物医学文献领域缺乏大规模多标签分类数据集——彼时常用的 Hallmarks of Cancer 语料仅约 1,600 篇。BC7-LitCovid 语料以约 34,000 篇人工审核文献将其放大了近 10 倍,并附带固定 train/dev/test 切分与官方评测脚本,19 个团队 80 次提交形成了可复现的排行榜。此后大量方法论文(长文本建模、标签相关性建模、数据增强)直接在该基准上比较,使其成为文献主题分类方向事实上的"GLUE"。
维度二:公卫信息基础设施。 LitCovid 每月接受数百万次访问,被用于证据合成、药物发现与文本数据挖掘。它的价值不只是"检索快":分诊模型比关键词检索多识别约 35% 的相关文献,这对系统综述的查全率直接有意义;主题导航与 Long Covid 专题集合则把"一周的新文献"压缩成"可扫读的分层视图",是疫情期公共卫生快速反应的典型数据基础设施案例。
维度三:人机协同策展的方法论样本。 LitCovid 完整记录了一条"纯人工 → AI 辅助 → 社区挑战赛"的策展进化路径:2020 年初两名兼职策展员纯手工维护,随后引入分诊/分类/实体三段自动化,2021-2022 年再把最难的主题分类环节开放给 BioCreative 社区并把 macro-F1 抬升约 12%。Long Covid 集合更给出了 human-in-the-loop 的可复用范式(集成多个互补分类器指导人工标注优先级)。对任何想建"文献自动策展系统"的团队,它既是数据源,也是一份公开的方法学蓝图。
§1.3 同类数据集横向对比
| 数据集 | 规模(时点) | 覆盖范围 | 标注 | 与 LitCovid 的差异 |
|---|---|---|---|---|
| LitCovid | 437,000+ 篇(2024-11) | 仅 COVID-19/SARS-CoV-2,2019 年至今 | 8 主题多标签 + Long Covid 集合,AI+人工混合 | 本体;每日更新、持续扩充 |
| CORD-19 | ~57,000 篇(2020-04,同期 LitCovid 约 8,000) | 全部冠状病毒(含 SARS、MERS)与更早时段 | 无主题标注(元数据+全文链接) | 覆盖更广但更粗;2020-04 时与 LitCovid 仅约 1,200 篇重叠 |
| BC7-LitCovid 语料 | ~34,000 篇(2022,固定切分) | LitCovid 的子集 | 人工审核 8 主题多标签 | LitCovid 的"冻结基准版",专供排行榜复现 |
| PubMed 全库 | 数千万条 | 全部生物医学 | 无新冠专题标注 | LitCovid 的上游源库;无策展层 |
§1.4 版本与规模时间轴
| 时间 | 事件 | 规模快照 |
|---|---|---|
| 2020-02 | LitCovid 上线(官方论文表述 February 2020) | — |
| 2020-04 底 | 与 CORD-19 首次对比 | ~8,000 篇 |
| 2020-08 下旬 | 日新增达 2,500+ 高峰;此后优先标注有摘要文献 | — |
| 2020-09 | NAR 数据库论文撰写时 | PubMed 新冠文献 55,000 篇 |
| 2021-07 底 | Long Covid 专题集合上线(2021-08 起每周更新) | — |
| 2022 | BioCreative VII LitCovid Track 举办(19 队 80 提交) | 200,000+ 篇 |
| 2022-12 | LitCovid in 2022 更新论文投稿 | 55,000 → ~300,000 篇(2.5 年) |
| 2023-09 | Database Commons 目录快照 | 375,727 篇 |
| 2024-10 | Database 期刊方法论文接收 | 370,000+ 篇 |
| 2024-11 | 第三方协议论文引用官方数字 | 437,000+ 篇(8,000+ 期刊) |
§1.5 典型应用场景
- 多标签主题分类基准实验:直接使用 BC7 固定切分与官方评测脚本,训练 BioBERT/PubMedBERT 类模型并与公开排行榜对比(见 §8.1)。
- 系统综述与证据合成:按 Treatment/Diagnosis/Prevention 等主题过滤候选文献集,再人工精读,显著缩小筛查范围;分诊模型相对关键词检索约 +35% 查全率。
- 疫情研究与监测:按时间与主题统计发文趋势,或结合地理位置实体追踪研究热点分布。
- 生物医学信息抽取:以摘要为输入做化学品/疾病/物种实体识别(可配合 PubTator/PubTator Central),LitCovid 自带化学品与地理位置标注。
- 领域 RAG 知识库:将 43 万+ 篇标题摘要构建检索语料,为医学问答与文献助手提供新冠领域的权威检索层(注意许可是美国公共领域,可自由再分发)。
- 标注辅助与人机协同研究:以 LitCovid 的"模型建议 + 人工确认"流程为参照(官方配套 LitSuggest 文献策展工具),研究标注优先级排序、主动学习与策展质量控制。
§2 医学背景
§2.1 ICD-11 编码映射
LitCovid 覆盖 COVID-19 全谱系研究文献。其主题体系与 ICD-11 相对应的核心编码如下(Codeminer 映射经 DermNet 与 WHO 紧急编码页交叉核对):
| ICD-11 编码 | 中文名称 | 英文名称 | 对应 LitCovid 内容 |
|---|---|---|---|
| 1D92 | COVID-19,病毒已证实 | COVID-19, virus identified | 全库主体文献 |
| RA01.0 | COVID-19(应急确认诊断,2020-02 启用) | COVID-19 (emergency use, confirmed diagnosis) | 2020 年应急编码期文献 |
| 1E90(Post COVID-19 condition 独立编码族) | 新冠感染后状况 | Post COVID-19 condition | Long Covid 专题集合(约 9,000 篇,2022-12) |
注:WHO 于 2020 年 2 月为 COVID-19 启用 ICD 紧急编码,2020 年 9 月追加"post-covid"相关编码以区分急性期与长期病程;Long Covid 集合的收录定义(症状出现至少 4 周后的持续/长期/延迟症状)与该分类思路一致。
§2.1b SNOMED CT 映射表
| 标签/概念 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| COVID-19(疾病) | 1D92 | 840539006 | Disease caused by SARS-CoV-2 |
| SARS-CoV-2(病原体) | — | 840533007 | SARS-CoV-2 (severe acute respiratory syndrome coronavirus 2) |
| Post COVID-19 condition(Long Covid 集合) | 1E90 | 概念存在于 SNOMED CT US 扩展 | Post COVID-19 condition |
§2.2 疾病简介与流行病学
COVID-19(冠状病毒病 2019)由严重急性呼吸综合征冠状病毒 2(SARS-CoV-2)引起,2019 年 12 月首次报告,2020 年 3 月 11 日 WHO 宣布全球大流行。病毒经呼吸道飞沫传播,多数感染者为轻中度症状,约三分之一为无症状感染;重症可出现呼吸衰竭、多器官衰竭甚至死亡。截至 2022 年 8 月 31 日,全球报告超过 580,000,000 例确诊病例与超过 6,400,000 例死亡。Delta、Omicron 等关切变异株(VOC)相继出现——Omicron 一度占美国新感染的 98% 以上——这也是 LitCovid 在 2022 年更新中为文献增加毒株标注的直接背景。
Long Covid(新冠感染后状况) 是 LitCovid 专题集合覆盖的另一重点:患者在急性期后持续出现多系统症状(呼吸系统问题、心血管疾病、认知障碍、严重疲劳等),缺乏特异性治疗。由于多数相关文献并不直接使用"Long Covid"一词,关键词检索会大量漏检——这正是 LitCovid 用 human-in-the-loop 机器学习构建该集合的原因(构建团队报告大多数相关文章会被关键词搜索漏掉)。
§2.3 研究任务定义(文献视角的"临床任务")
LitCovid 是文献元数据库而非患者队列,其"临床任务"以研究主题(topic)形式组织,与临床证据链一一对应:
| 研究主题 | 对应临床/科研任务 | 官方定义要点 |
|---|---|---|
| Diagnosis | 诊断 | 通过症状、检测结果与影像学特征评估 COVID-19 |
| Treatment | 治疗与疫苗 | 治疗策略、治疗性操作与疫苗研发 |
| Prevention | 预防与管控 | 预防、控制、缓解与管理策略 |
| Transmission | 传播 | 传播特征与传播模式 |
| Mechanism | 发病机制 | 感染与传播的底层机制、药物作用机制 |
| Epidemic Forecasting | 疫情预测 | 疫情传播趋势估计与建模 |
| Case Report | 病例报告 | 与 COVID-19 相关的具体患者病例描述(singleton) |
| General Information | 综合信息 | 简报与新闻类内容(singleton) |
§2.4 文献来源分布(替代患者人群表)
本数据集不含患者级记录,故以文献来源维度替代患者人群维度:
| 维度 | 覆盖情况 |
|---|---|
| 来源 | PubMed(美国 NLM 官方文献库),经检索式初筛 + ML 分诊 |
| 时间 | 2019 年至今,每日更新 |
| 期刊 | 8,000+ 种(截至 2024-11) |
| 语言 | 英文(PubMed 标题与摘要) |
| 文献类型 | 研究论文、评论、观点、预印本记录等;无摘要记录多为评论/观点类 |
| 地理 | 全球投稿(库内附地理位置实体标注) |
§2.5 临床价值
对临床与公卫用户,LitCovid 的价值在于把"每月 10,000 篇"的信息洪流组织成可导航的证据流:指南制定者可按 Treatment/Prevention 主题快速汇总干预证据;临床医生可跟踪 Diagnosis 主题的检测策略演进;Long Covid 集合为慢病管理与康复研究提供专门入口。NCBI 同时明确声明:该工具产出的信息不用于直接诊断或医疗决策,须经临床专业人士审阅后使用。
对研究者,主题标注还承担"证据预处理"角色:Cochrane 式系统综述最耗时的题目筛查环节,可以直接用主题过滤把候选集缩小一个数量级;Long Covid 集合的存在则使"症状出现 4 周后"这一操作性定义有了可下载的文献操作化版本,避免各研究自定义检索式导致的口径漂移。
§2.6 金标准(标注质量参照)
| 维度 | 说明 |
|---|---|
| 官方划分 | BC7-LitCovid 语料:train 24,960 / dev 6,239 / test 2,500(约 34,000 篇) |
| 标注方式 | 机器学习建议 + 人工审核(hybrid);BC7 语料全部经人工审核 |
| 标注者 | NCBI/NLM 策展团队(2 名兼职策展员,生物医学数据科学背景)+ BioCreative 19 支社区队伍 |
| 性质 | 多标签(每篇最多 8 主题);Case Report 与 General Information 设计上不与其他主题共现(singleton) |
| 标注输入 | 以标题+摘要为主,必要时参考全文与 MeSH |
§2.7 毒株时代与文献标注的对应
LitCovid 在 2022 年更新中加入毒株与疫苗标注,使主题维度之外新增"病原体演化"维度。关切变异株(VOC)的时间线与文献研究热点的对应关系如下(首报时间据 DermNet 汇总):
| 变异株 | 首报时间/地点 | 文献研究热点 |
|---|---|---|
| Alpha | 2020-09,英国 | 传播力上升、检测策略(Transmission/Diagnosis) |
| Beta | 2020-05,南非 | 免疫逃逸(Mechanism) |
| Gamma | 2020-11,巴西 | 再感染与重症(Mechanism/Case Report) |
| Delta | 2020-12,印度 | 疫苗有效性、突破感染(Prevention/Treatment) |
| Omicron | 2021-11,博茨瓦纳与南非 | 免疫逃逸与致病性(至 2022 年占美国新感染 98% 以上) |
建模提示:毒株时代切换点附近,同一主题下的文献表述分布会发生明显迁移(疫苗效力研究的对象、结局定义都在变),这既是 §7.6 数据漂移的微观机理,也是时间外推验证必须存在的理由。
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本 | 大小 | 理由 |
|---|---|---|---|
| 复现/对比 BC7 排行榜 | BioCreative VII 子集(FTP biocreative/ 目录,TSV) |
文本级,小 | 官方固定切分 train 24,960 / dev 6,239 / test 2,500,含评测脚本 |
| 构建全库检索/RAG/趋势分析 | API TSV 导出或 FTP 全库(BioC) | 官方未公布总体积,需下载实测 | 一次性拿到全库元数据,API 单请求即可导出 TSV |
| Long Covid 专题研究 | FTP LongCovid/ 目录 + Zenodo(10.5281/zenodo.7308463) |
文本级,小 | 含分类得分与人工标注,可复现 human-in-the-loop 管线 |
| 需要全文建模 | LitCovid 元数据 + BioC-PMC API 全文回填 | 取决于子集 | 版权限制下全文须经 PMID→PMCID 映射获取,覆盖率非 100%(见坑点 4) |
§3.1 模态详情
| 模态 | 内容 | 说明 |
|---|---|---|
| 文献元数据 | PMID、标题、摘要、期刊、发表日期 | 来自 PubMed,英文为主 |
| 主题标注 | 8 主题多标签 + Long Covid 集合归属 | AI 建议 + 人工审核,每日滚动 |
| 实体标注 | 化学品与地理位置提及 | 流水线第三模块,F1 约 0.94 |
| 毒株/疫苗标注 | 文献涉及的最新毒株与疫苗 | 2022 年更新新增(LitCovid in 2022) |
| 全文 | 不随库分发 | 版权限制,经 BioC-PMC API 按 PMCID 获取 |
§3.2 子集与样本数
| 子集 | 样本数 | 切分/时点 | 获取 |
|---|---|---|---|
| 全库 | 437,000+ 篇 | 截至 2024-11,每日更新 | API TSV / FTP BioC |
| BC7-LitCovid 训练集 | 24,960 篇 | 固定 | FTP biocreative/ |
| BC7-LitCovid 开发集 | 6,239 篇 | 固定 | FTP biocreative/ |
| BC7-LitCovid 测试集 | 2,500 篇 | 固定 | FTP biocreative/ |
| Long Covid 集合 | ~9,000 篇 | 2022-12 快照 | FTP LongCovid/ / Zenodo |
BC7 语料的入选条件决定了它的"金字标准"地位,复现时须逐条核对:全部文献同时具备 PubMed 标题与摘要;主题标签全部经人工审核;规模约为彼时生物医学文献领域最大多标签数据集(Hallmarks of Cancer 约 1,600 篇)的 10 倍;按官方切分发布,任何人不得重切后仍宣称"BC7 分数"。
§3.3 数据格式
| 格式 | 载体 | 用途 | 备注 |
|---|---|---|---|
| BioC XML/JSON | FTP 全库导出 | 批量文本挖掘 | 生物医学 NLP 标准交换格式 |
| TSV | API 导出(export/all/tsv) |
快速全库加载 | 单请求导出,pandas 可直读 |
| TSV(BC7) | FTP biocreative/ |
基准训练/评测 | 列含 PMID 与主题标签 |
| RIS | 站内导出 | 文献管理软件导入 | EndNote 等引用管理 |
| BioC XML(全文) | BioC-PMC API | 全文建模 | 需 PMID→PMCID 映射,非全覆盖 |
格式选择的三条经验法则:原型验证用 API TSV(一条 URL 换来全库 DataFrame);批量挖掘用 BioC(passage 级结构化文本,实体与段落对齐友好);排行榜复现只认 BC7 TSV(标签口径与评测脚本绑定)。RIS 导出仅服务于文献管理场景,不进入建模管线。BioC 是 NLM 的生物医学文本挖掘交换标准,其 document/passage/infon 层级让"标题/摘要段落"与"实体提及位置"可以在同一棵解析树中对齐,这是它相对裸 TSV 的结构优势。
§3.4 存储大小
官方未公布全库总体积;库内容为纯文本元数据(标题/摘要/标注),单条记录为 KB 级。全库经 FTP/API 下载后解压即为文本文件,本地规划预留数 GB 量级磁盘并按实际下载结果核算即可。
§3.5 标注方式
标注为**人工与机器学习混合(hybrid)**三段式:检索式粗筛 → ML 分诊模型精判(F1 约 0.99)→ 主题分类模型给出候选标签(F1 约 0.80)→ 人工审核确认;同时第三模块抽取化学品与地理位置实体(F1 约 0.94)。所有自动化方法在首次使用前均经评估并持续改进。早期(2020 年初)曾以纯人工策展为主,随文献量激增才引入自动化。Long Covid 集合采用 human-in-the-loop 框架:集成多个互补视角的分类器(语法规则、LitSuggest、PubTator 实体、MeSH 标题、CoronaCentral 标注等),由模型预测文章相关性并指导人工标注优先级。
§3.6 标注者资质与一致性
核心标注由 NCBI/NLM 计算生物学分支的策展团队完成,早期为 2 名具有生物医学数据科学背景的兼职策展员;BC7 语料中的全部文献均经人工审核。系统级一致性以 F1 表述:分诊 0.99、实体识别 0.94、主题分类 0.80(后者复杂度最高,也是组织 BioCreative VII 挑战赛的动因)。Long Covid 论文另报告了句级标注的标注者间一致性(Cohen κ=0.71,用于其配套研究),可作为该团队标注流程质量的旁证。
§3.7 采集与更新周期
| 更新项 | 周期 | 说明 |
|---|---|---|
| 全库文献 | 每日 | 新识别相关文献当日入库 |
| 主题标注 | 随入库滚动 | 2020-08 下旬起优先标注有摘要文献 |
| Long Covid 集合 | 每周(2021-08 时点) | 标注持续精化 |
获取时延与缓存建议:API TSV 全库导出为单请求大文件,首次下载后按"周"为周期做增量校验即可(库按日更新但研究用途对时效敏感度通常以周计);FTP 大文件下载建议断点续传并记录 ETag/文件大小;生产管道中把"下载日期"写进数据文件名(如 litcovid_all_2026-09-13.tsv),让快照可追溯(呼应 §6.10)。
§3.8 地域覆盖
文献来自全球投稿(PubMed 国际收录),库内提供按地理位置的浏览维度(Database Commons 目录明确记载"categorized by … geographic locations"),流水线第三模块自动抽取文献中的地理位置实体。
§3.9 设备规格
不适用——本数据集为文献元数据库,不含任何测量设备、影像设备或可穿戴设备信息;如需设备相关字段应回溯原始文献全文。
§3.10 深度溯源链
PubMed(NLM 上游源库)
└─ 收录检索式:coronavirus OR ncov OR cov OR 2019-nCoV OR COVID-19 OR SARS-CoV-2(All Fields)
└─ ML 文献分诊(document triage,F1 ≈ 0.99)
└─ 主题分类模型候选标签(F1 ≈ 0.80)+ 人工审核(NCBI 策展员)
├─ 8 主题多标签 → FTP/API 每日发布(BioC XML/JSON、TSV)
├─ Long Covid 集合(human-in-the-loop,~9,000 篇)→ FTP + Zenodo 10.5281/zenodo.7308463
└─ 实体识别(化学品/地理位置,F1 ≈ 0.94)+ 毒株/疫苗标注(2022 新增)
关键溯源文件:BC7 语料与评测脚本(FTP biocreative/ + GitHub ncbi/biocreative_litcovid)、Long Covid 分类与标注数据(Zenodo DOI 10.5281/zenodo.7308463)、各阶段方法学论文(见 §8.5)。
§4 数据结构
§4.0 目录树(下载后的本地组织)
LitCovid 官方以 FTP 目录 + API 形式分发,以下为按 §6.2 脚本下载后推荐的本地组织(目录名由脚本生成;FTP 内实际文件清单以其页面实时列出为准,脚本会动态枚举):
data_root/ ← 自定义根目录,脚本中由 LITCOVID_ROOT 指向
├── api/
│ └── litcovid_all.tsv ← 脚本 1:官方 API 全库 TSV 导出(元数据+主题)
├── biocreative/
│ ├── (train/…tsv) ← 脚本 2:FTP biocreative/ 目录动态下载
│ ├── (dev/…tsv) ← 官方固定切分:24,960 / 6,239 / 2,500 篇
│ └── (test/…tsv) ← 列含 PMID 与多标签主题
├── bioc/
│ └── (*.xml | *.json) ← 脚本 3:FTP 全库 BioC XML/JSON 导出
└── longcovid/
└── (…) ← Long Covid 分类与标注(FTP LongCovid/ + Zenodo)
BioC 是 NLM 制定的生物医学文本挖掘交换格式,其核心层级如下(通用标准结构示意,帮助理解 §6.3 解析代码的操作对象):
<collection> ← 一个导出文件 = 一个 collection
<document> ← 一篇文献(对应一个 PMID)
<id>32325980</id>
<passage> ← 文本以 passage 切分(标题/摘要各为一段)
<infon key="section_type">TITLE</infon>
<text>…</text>
</passage>
<passage>
<infon key="section_type">ABSTRACT</infon>
<text>…</text>
</passage>
</document>
</collection>
§4.1 DAIMS 字段字典
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| pmid | Integer | PubMed 唯一标识 | 32325980 | 主键/去重/回链 PubMed | 无(官方分配) | 不允许缺失 | PubMed PMID 域 |
| title | Text | 文献标题 | — | 分类主输入 | 无 | 空串(极罕见) | 自由文本 |
| abstract | Text | 摘要 | — | 分类主输入;缺失即不标注主题 | 截断/无摘要 | 空字段=无摘要(信息性:多为评论类) | 自由文本,可空 |
| topics | Text(多值) | 8 主题多标签,`\ | ` 分隔 | Treatment\ | Diagnosis | 多标签分类目标 | 模型建议+人工审核(主题级 F1 ≈ 0.80 起步) |
| date | Date | PubMed 发表日期 | 2020-04-15 | 时间切分/趋势分析 | 索引延迟 | 不允许缺失 | 2019 至今 |
| journal | Text | 期刊名 | — | 期刊偏倚分析/分层 | 期刊改名 | 空串 | 8,000+ 种 |
| location | Text(多值) | 地理位置实体 | USA; China | 趋势制图、地域分析 | 自动抽取(F1 ≈ 0.94) | 无提及=空 | 自由实体集 |
| chemical | Text(多值) | 化学品实体 | — | 药物/机制挖掘 | 自动抽取(F1 ≈ 0.94) | 无提及=空 | 自由实体集 |
| long_covid | Boolean | 是否属 Long Covid 集合 | true | 专题检索/子集实验 | human-in-the-loop 标注 | false=未入集合 | |
| strain/vaccine | Text(多值) | 涉及的毒株与疫苗标注 | Omicron | 时代分层、漂移分析 | 2022 年起新增,早期文献为空 | 空=未标注或无涉及 | 自由实体集 |
§4.2 标签体系与分布特征
8 主题为多标签体系,官方核实来源未给出逐类计数(完整分布见 BC7 论文 Table 2),但以下结构性特征已被多篇论文证实,直接影响建模:
- 标签不平衡:主题分布显著不均衡,是 BC7 参赛队伍公认的两大难点之一(与标签相关性并列)。
- singleton 约束:Case Report 与 General Information 设计上不与其他主题共现——合法标签组合空间因此缩小,可作为解码约束。
- 标签相关性:主题间强相关(如 Transmission 与 Prevention),朴素二分类独立解码会丢失联合信息。
- 标注密度随时间变化:2020-08 下旬起无摘要文献原则上不获主题标注,标签覆盖率在该时点前后发生结构性变化。
标签组合的合法性空间可归纳为三类,任何解码器/校验器都应按此约束输出:
| 组合类型 | 规则 | 示例 |
|---|---|---|
| 普通多标签 | 6 个非 singleton 主题可任意共现(1-6 个) | Treatment \ |
| singleton 独占 | Case Report 或 General Information 出现时排除其余全部主题 | 仅 Case Report |
| 空标签 | 2020-08 下旬后无摘要文献无标签(非分类错误) | topics 为空 |
官方评测脚本 README 的演示输出亦印证大类主导现象:演示样本中 Treatment 支持 1,087 例、Prevention 1,280 例,而 Epidemic Forecasting 仅 178 例、Case Report 仅 50 例。
§4.3 关键统计
| 统计项 | 数值 | 来源与口径 |
|---|---|---|
| 全库规模 | 437,000+ 篇 / 8,000+ 期刊 | 截至 2024-11 |
| BC7 语料 | ~34,000 篇(24,960/6,239/2,500) | 全部含标题+摘要且经人工审核 |
| BC7 全文覆盖率(第三方增强版) | 30,563 篇有全文(90.69%) | 经 BioC-PMC + 人工补全 |
| 全文长度 | 1.35% <512 token;56.76% <4096;43.24% >4096 | enriched BC7,token 计 |
| 实体提及总量 | 4,945,619 个提及 / 186,890 个唯一实体 | enriched BC7;平均 158.13 个/篇 |
| Long Covid 集合 | ~9,000 篇 | 2022-12 |
§4.4 数据层级
文献库(437,000+ 篇)
└─ 单篇文章(pmid 主键)
├─ 题录层:title / abstract / journal / date
├─ 标注层:topics(≤8 主题)· long_covid 归属 · 毒株/疫苗标注
└─ 实体层:chemical / location 提及(自动抽取)
└─ (可选回填)全文:PMID → PMCID → BioC-PMC API
§4.5 缺失值与信息性缺失编码
| 缺失情形 | 表现 | 是否信息性 | 处理建议 |
|---|---|---|---|
| 无摘要 | abstract 为空 | 是——无摘要记录多为评论/观点类,且 2020-08 下旬后不获主题标注 | 分类实验默认过滤;做"有无摘要"分层分析 |
| 无主题标签 | topics 为空 | 是——同上,标注策略变化的产物 | 按日期分段解释标签覆盖率 |
| 无全文 | 无对应 PMCID/全文体量过小 | 是——版权限制所致(非 PMC 收录或订阅墙) | BioC-PMC API 回填;<10KB XML 需人工核验剔除 |
| 无实体 | location/chemical 为空 | 否——文中确无提及 | 直接作为"无提及"类别 |
拿到任何一条记录时,按下面的决策树判断其可用性(与 §6.3 清洗三原则一致):
读取一条记录(pmid, title, abstract, topics, date)
├─ pmid 缺失/重复?
│ └─ 是 → 丢弃或合并(上游异常,记录日志)
├─ abstract 为空?
│ ├─ 是 → 不进入主题分类训练/评测(官方未标注)
│ │ 可用于"文章类型识别"等独立任务
│ └─ 否 ↓
├─ topics 为空且 date < 2020-08 下旬?
│ └─ 是 → 标注缺口,按需人工补标或剔除
├─ topics 含 singleton 组合冲突?
│ └─ 是 → 非法标签组合,触发 schema 断言报警
└─ 通过 → 入库(写明快照日期)
§5 数据划分与使用建议
§5.1 官方划分
唯一官方固定划分是 BC7-LitCovid 语料:train 24,960 / dev 6,239 / test 2,500(合计约 34,000 篇,全部含标题与摘要并经人工审核),与官方评测脚本一同发布于 FTP biocreative/ 目录与 GitHub ncbi/biocreative_litcovid。排行榜分数(§8.1)全部基于该切分。
§5.2 社区惯例划分
在 BC7 之外,社区对"全库流式数据"没有统一划分惯例。常见做法有两类:一是直接用 BC7 切分做方法学比较;二是从 API 导出全库后按时间切分(如训练用早期、测试用近期)研究分布漂移。后者没有官方基准分数可比,需自行在 dev 集上报数。
§5.3 划分策略建议与泄漏风险 ⚠️
- 同文多版本:预印本与正式发表版本可能同时入库(PubMed 收录预印本记录),若随机切分,同一研究的两个版本可能分属训练与测试集,造成近似重复泄漏。建议按标题相似度/DOI 聚类后再切分。
- 时间漂移:主题分布、毒株时代(2020 原始株 → 2021 Alpha/Delta → 2022 Omicron)随时间剧变。随机切分会高估性能;按
date切分更接近真实部署。 - singleton 约束:任何重切分都必须保持 Case Report/General Information 不与其他主题共现的约束,否则解码约束失效。
- 标注策略断点:2020-08 下旬前后的标注密度不同,跨该断点的混合划分会让标签覆盖率成为混杂变量。
§5.4 交叉验证建议
方法学消融可在 train+dev 上做 5 折分层交叉验证(按多标签组合分层,scikit-learn IterativeStratification),test 集只在最终汇报时使用一次;结合 §5.3 建议以"标题聚类分层"替代纯随机分层,防近似重复泄漏。
§5.5 外部验证建议
若目标是上线"持续策展助手",推荐时间外推验证:用 2020-2021 数据训练、2022+ 数据测试,并按主题分别汇报 macro-F1;同时用 Long Covid 集合(2021-07 后出现的新类别任务)检验模型对全新主题的冷启动能力——这正是官方论文指出的关键词检索漏检场景。
不同研究目标下的划分选择汇总:
| 目标 | 推荐划分 | 理由 |
|---|---|---|
| 与文献分数对标(发论文) | BC7 官方切分 + 官方评测脚本 | 唯一有公开排行榜的口径 |
| 方法消融/调参 | BC7 train+dev 上分层 CV,test 只用一次 | 防 test 过拟合 |
| 上线前的真实性能估计 | 时间外推(训练早期 → 测试近期) | 模拟部署后分布 |
| 检索/RAG 系统评测 | 按主题分层抽样 + 人工相关性判读 | 无现成 qrels,需自建小规模评测集 |
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
LitCovid 全部端点均为公网直连,Colab/Kaggle 无需任何凭证即可运行本章代码:colab.recommended——新建 Notebook 后直接执行 §6.1 与 §6.2 的代码块(无 GPU 也能完成数据获取与预处理;训练建议 T4 及以上)。数据落盘到 /content/data_root 即与本页目录树一致。
§6.1 快速上手:5 分钟载入数据
# ============================================================================
# 快速上手:从官方 API 一行式导出全库 TSV 并用 pandas 载入
#
# 目录结构预期(与本页 §4.0 目录树一致):
# data_root/
# └── api/litcovid_all.tsv ← 本脚本产出(全库元数据+主题标注)
#
# data_root 拼接关系:DATA_ROOT 环境变量或下方常量 → os.path.join 拼接子目录
# 最小可用子集:只要拿到 litcovid_all.tsv,即可完成"标题+摘要 → 8 主题"
# 的多标签分类全流程(无需任何其他文件)
# ============================================================================
import os, urllib.request
import pandas as pd
DATA_ROOT = os.environ.get("LITCOVID_ROOT", "data_root") # data_root 由你定义
API_TSV = "https://www.ncbi.nlm.nih.gov/research/coronavirus-api/export/all/tsv"
os.makedirs(os.path.join(DATA_ROOT, "api"), exist_ok=True)
tsv_path = os.path.join(DATA_ROOT, "api", "litcovid_all.tsv")
if not os.path.exists(tsv_path): # 幂等下载
urllib.request.urlretrieve(API_TSV, tsv_path)
df = pd.read_csv(tsv_path, sep="\t") # TSV 直读
print(df.shape) # 437,000+ 行(截至 2024-11 快照)
print(df.columns.tolist()) # 先看列名再写下游逻辑
§6.2 数据获取:三条官方通道
| 通道 | 地址 | 格式 | 适用 |
|---|---|---|---|
| API 导出 | coronavirus-api/export/all/tsv |
TSV | 全库元数据,最省事 |
| FTP 全库 | ftp.ncbi.nlm.nih.gov/pub/lu/LitCovid/ |
BioC XML/JSON | 批量文本挖掘 |
| BC7 基准 | 同上 FTP 的 biocreative/ 目录 |
TSV | 排行榜复现(train/dev/test) |
# 脚本 2:用 ftplib 动态枚举 FTP 目录并下载 BC7 基准文件
# FTP 目录内的具体文件名随官方更新而变化,因此先用 nlst() 枚举再过滤下载,
# 避免硬编码文件名失效。
from ftplib import FTP
bc7_dir = os.path.join(DATA_ROOT, "biocreative")
os.makedirs(bc7_dir, exist_ok=True)
with FTP("ftp.ncbi.nlm.nih.gov") as ftp: # 匿名 FTP,无需凭证
ftp.login()
ftp.cwd("pub/lu/LitCovid/biocreative")
names = ftp.nlst() # 动态获取官方文件清单
for name in names:
if name.lower().endswith((".tsv", ".txt")): # 基准切分文件
local = os.path.join(bc7_dir, name)
with open(local, "wb") as f:
ftp.retrbinary(f"RETR {name}", f.write)
print("saved:", local)
# 脚本 3:枚举全库 BioC 导出(只列前若干个,避免全量打印)
with FTP("ftp.ncbi.nlm.nih.gov") as ftp:
ftp.login()
ftp.cwd("pub/lu/LitCovid")
print(ftp.nlst()[:10]) # BioC XML/JSON 导出文件列表
# 如需全库:对目标文件逐个 retrbinary 下载,BioC 解析见 §6.3
§6.3 预处理全流程
<details>
<summary><b>展开:BioC 解析 → 清洗 → 多热标签编码(约 55 行)</b></summary>
# ============================================================================
# 预处理:BioC XML → DataFrame → 多热标签矩阵
# 输入:data_root/bioc/ 下的 BioC XML;输出:data_root/proc/merged.parquet
# ============================================================================
import glob, xml.etree.ElementTree as ET
import numpy as np, pandas as pd
TOPICS = ["General Information", "Mechanism", "Transmission", "Diagnosis",
"Treatment", "Prevention", "Case Report", "Epidemic Forecasting"]
SINGLETON = {"Case Report", "General Information"} # 官方设计:不与其他主题共现
def parse_bioc(path):
"""解析单个 BioC XML 文件:每篇 Document 产出一条记录。"""
rows = []
for doc in ET.parse(path).getroot().iter("document"):
rec = {"pmid": doc.findtext(".//id"), "title": "", "abstract": ""}
for passage in doc.iter("passage"): # BioC 以 passage 组织文本
label = passage.findtext("infon[@key='section_type']") or ""
text = (passage.findtext("text") or "").strip()
if label in ("TITLE", "ABSTRACT") or "title" in label.lower():
rec["title"] = rec["title"] or text
else:
rec["abstract"] += (" " + text).strip()
rows.append(rec)
return rows
def to_multihot(topics_series):
"""把 'Treatment|Diagnosis' 形式的标签列编码为 8 维多热矩阵。"""
Y = np.zeros((len(topics_series), len(TOPICS)), dtype="float32")
for i, s in enumerate(topics_series.fillna("")):
for t in str(s).split("|"):
t = t.strip()
if t in TOPICS:
Y[i, TOPICS.index(t)] = 1.0
return Y
if __name__ == "__main__":
frames = [pd.DataFrame(parse_bioc(p))
for p in sorted(glob.glob(os.path.join(DATA_ROOT, "bioc", "*.xml")))]
df = pd.concat(frames, ignore_index=True).drop_duplicates("pmid") # 去重
df = df[df["abstract"].str.len() > 0] # 无摘要记录不获主题标注
Y = to_multihot(df["topics"]) # 标签矩阵
os.makedirs(os.path.join(DATA_ROOT, "proc"), exist_ok=True)
df.reset_index(drop=True).to_parquet(os.path.join(DATA_ROOT, "proc", "merged.parquet"))
np.save(os.path.join(DATA_ROOT, "proc", "labels.npy"), Y)
print(df.shape, Y.sum(axis=1).mean()) # 平均每篇标签数(>1 即多标签生效)
</details>
清洗三原则:按 pmid 全局去重(预印本/正式版可能双份入库);过滤空摘要行(2020-08 下旬后官方即不再为其标注主题);标签解码时强制 singleton 约束(Case Report/General Information 独占)。标准化层面英文文本一般保留大小写交给 tokenizer 处理,无需额外正则清洗。
§6.4 PyTorch DataLoader 完整代码
<details>
<summary><b>展开:Dataset + tokenizer + DataLoader(约 60 行)</b></summary>
# ============================================================================
# 多标签主题分类 DataLoader:输入=标题+摘要,输出=8 维多热向量
# 依赖:pip install torch transformers pandas pyarrow
# ============================================================================
import numpy as np, pandas as pd, torch
from torch.utils.data import Dataset, DataLoader
from transformers import AutoTokenizer
CKPT = "microsoft/BiomedNLP-PubMedBERT-base-uncased-abstract-fulltext"
MAX_LEN = 512 # 见 §6.5 坑点 5:长文本权衡
class LitCovidDataset(Dataset):
"""One record per article:title+abstract 联合编码为单段输入。"""
def __init__(self, df: pd.DataFrame, Y: np.ndarray):
assert len(df) == len(Y)
self.texts = (df["title"].fillna("") + " [SEP] " +
df["abstract"].fillna("")).tolist()
self.Y = torch.from_numpy(Y).float() # 多热标签
self.tok = AutoTokenizer.from_pretrained(CKPT)
def __len__(self):
return len(self.texts)
def __getitem__(self, idx):
enc = self.tok(self.texts[idx], truncation=True, max_length=MAX_LEN,
padding="max_length", return_tensors="pt")
item = {k: v.squeeze(0) for k, v in enc.items()}
item["labels"] = self.Y[idx]
return item
def build_loaders(df, Y, train_idx, val_idx, batch_size=16, num_workers=2):
ds = LitCovidDataset(df.reset_index(drop=True), Y)
common = dict(batch_size=batch_size, num_workers=num_workers,
pin_memory=torch.cuda.is_available())
return (DataLoader(torch.utils.data.Subset(ds, train_idx), shuffle=True, **common),
DataLoader(torch.utils.data.Subset(ds, val_idx), shuffle=False, **common))
if __name__ == "__main__":
df = pd.read_parquet(os.path.join(DATA_ROOT, "proc", "merged.parquet"))
Y = np.load(os.path.join(DATA_ROOT, "proc", "labels.npy"))
rng = np.random.default_rng(42)
idx = rng.permutation(len(df)) # 演示用随机切分;
tr, va = idx[:-1000], idx[-1000:] # 正式实验请改用 BC7 官方切分
train_loader, val_loader = build_loaders(df, Y, tr, va)
batch = next(iter(train_loader))
print({k: tuple(v.shape) for k, v in batch.items()})
</details>
§6.5 八大坑点(LitCovid 实战精炼)
⚠️ 坑点 1:主题体系是"活的"——7 主题 → 8 主题 + Long Covid 集合(分类:标签理解)
问题:LitCovid 初期只有 7 个主题,Prevention 是后来加入的,Long Covid 集合 2021 年 7 月底才上线。用旧论文/旧导出对齐 8 主题体系,或把"8 主题 + Long Covid 集合"误当成"9 类互斥标签",都会造成标签空间错位。
症状:复现旧论文时某类标签永远为空;把 Long Covid 当第 9 个主题与 8 主题并列训练后,指标与任何已发表结果都对不上。
解决:
- 简单方法:以官方 FAQ 为准固定 8 主题枚举,Long Covid 作为独立布尔归属字段(
long_covid)而非第 9 类。- 进阶方法:按
date字段切分数据集历史版本,旧口径数据映射到新口径后再合并训练。- SOTA 方法:复现 BC7 排行榜时只使用 FTP
biocreative/的冻结语料,与新库数据物理隔离。
⚠️ 坑点 2:Case Report 与 General Information 是 singleton,不与其他主题共现(分类:标签理解)
问题:官方设计上这两个主题独占一篇文章,永不与其它主题同时出现。把它们当普通多标签训练/解码,会在评估时产生非法组合,也会低估合规解码器的作用。
症状:模型对同一篇文章同时预测出 “Case Report|Treatment”;在逐样本 F1 上出现系统性不可达的高分类错误。
解决:
- 简单方法:后处理硬规则——若 Case Report 或 General Information 概率最大,则清空其余标签。
- 进阶方法:改为"9 选 1(singleton 组)或 6 类多标签"的两段式建模,把约束编码进结构。
- SOTA 方法:解码时加入约束集合(constrained decoding),在 beam 内屏蔽非法组合;BC7 冠军 Bioformer 类模型 + 该约束可直接对齐官方标注空间。
⚠️ 坑点 3:无摘要文献没有主题标签,且多为评论/观点类(分类:偏倚陷阱)
问题:2020 年 8 月下旬起(日新增 2,500+ 篇的高峰后)官方优先标注有摘要文献;无摘要记录多为评论/观点而非正式研究。把"无标签"当"负类"训练会让模型学到"文章类型→标签"的伪相关。
症状:标签覆盖率在 2020-08 前后出现台阶式突变;测试集中评论类文章被系统性打上错误主题。
解决:
- 简单方法:建模前过滤空摘要行(§6.3 已含)。
- 进阶方法:保留"有无摘要"作为分层变量,分别报告指标;将"是否评论类"作为显式特征。
- SOTA 方法:对无摘要文献用标题-only 模型单独估计,或用官方论文的做法——将有摘要文章上约 +10% 的 F1 优势作为标注协议依据,明确声明适用域。
⚠️ 坑点 4:全文不在库里——版权墙与 PMID→PMCID 映射失败(分类:工程陷阱)
问题:LitCovid 只分发题录与标注;全文因版权限制需自行回填,且并非每篇文章都能映射到 PMCID(非 PMC 收录、订阅墙)。第三方研究实测需人工剔除 <10KB 的"空壳"XML 才能拿到可靠全文。
症状:用 PMID 直接批量拉全文时报 404/空文档;语料规模"虚胖",训练时大量样本实际无全文。
解决:
- 简单方法:只用标题+摘要建模(BC7 本身即此口径,排名可比)。
- 进阶方法:经 BioC-PMC API 按 PMCID 回填全文,过滤 <10KB XML。
- SOTA 方法:对拿不到全文的样本采用长摘要+关键词扩展,或像第三方增强版语料那样融合 MeSH 与实体注释补偿信息损失。
⚠️ 坑点 5:43% 的全文超过 4,096 token,512 截断丢掉大量证据(分类:预处理陷阱)
问题:enriched BC7 语料中 43.24% 全文超过 4,096 token,而主流预训练模型上限 512 token。截断策略不当会系统性丢弃结论段(通常在文末)。
症状:加长输入后指标不升反降;同一模型对"结论在摘要里"与"结论在正文末"的文章表现差异巨大。
解决:
- 简单方法:标题+摘要 512 token 输入(BC7 官方口径),先对齐基线。
- 进阶方法:头尾拼接(head+tail truncation)或分段编码后 mean-pooling。
- SOTA 方法:长文本模型(Longformer/BigBird 类,4,096 window)或层级 Transformer;Longformer 在该语料上可完整覆盖 56.76% 的 ≤4,096 文档,再对超长文档分层聚合。
⚠️ 坑点 6:标签不平衡 + 标签相关性,单一指标会骗你(分类:评估误用)
问题:主题分布显著不均衡且主题间强相关。micro-F1 会被大类(如 Treatment/Diagnosis)主导,一个只预测大类的模型也能拿到好看的 micro-F1;而稀有主题的召回可能趋近于零。
症状:micro-F1 ≈ 0.90 但某些主题的 macro 贡献 <0.5;上线后小类主题几乎不命中。
解决:
- 简单方法:同时报告 macro-F1、micro-F1 与 instance-F1(BC7 三指标),任一单指标都不作数。
- 进阶方法:损失函数加类权重或 focal loss;阈值按类别在 dev 集上分别调优。
- SOTA 方法:显式建模标签相关性(label correlation)与不平衡——这正是 BC7 后续方法论文的主攻方向;报告逐主题 F1 表。
⚠️ 坑点 7:每日更新 = 没有固定"最新版",自切分数与排行榜不可比(分类:评估误用)
问题:LitCovid 连续每日更新,任何"全库下载"都是一个独一无二的快照。用自己下载的快照自切分跑出的分数,与 BC7 固定切分上的排行榜分数不可直接比较。
症状:复现论文时数值偏差好几个点却查不出 bug;两篇论文的"SOTA"互相矛盾。
解决:
- 简单方法:比较方法优劣一律用 BC7 冻结语料;快照数据只用于应用型任务。
- 进阶方法:使用快照时在论文/报告里写明下载日期与规模(如"截至 YYYY-MM 共 X 篇"),保证可追溯。
- SOTA 方法:时间外推协议(训练早、测试晚)+ 公布随机种子与切分脚本,让快照实验可复现。
⚠️ 坑点 8:检索与导出的接口语义陷阱——布尔默认 OR、文件名动态变化、多标签分隔符(分类:工程陷阱)
问题:LitCovid 站内检索默认布尔 OR(多数数据库默认 AND),扩词即爆量;FTP 目录内文件清单随官方更新变化,硬编码文件名会失效;API/TSV 中多标签以分隔符拼接,按单值解析会截断标签。
症状:站内复检结果远超预期;数月后下载脚本报 550 无此文件;下游标签列出现非法枚举值。
解决:
- 简单方法:精确检索用引号与显式 AND/OR;TSV 解析先按分隔符 split 再映射到 8 主题枚举,白名单外标签报警。
- 进阶方法:FTP 下载统一走
nlst()动态枚举(§6.2 脚本 2),对文件名做正则白名单。- SOTA 方法:把下载-校验-入库做成幂等管道:每日增量拉取、schema 断言(pmid 唯一、标签合法、singleton 约束校验),异常时阻断发布。
§6.6 数据增强:安全与危险清单
- ✅ 安全:回译/同义替换仅用于训练集标题+摘要文本;按主题分层的过采样(对稀有主题);span dropout;用 LitCovid 同源 PubMed 语料做 MLM 继续预训练。
- ❌ 危险:跨 train/test 共享任何 PMID(近似重复预印本即泄漏,见 §5.3);把 singleton 主题与其他主题"组合增强"产生非法标签组合;用未来年份文献增强早期样本(时间穿越);对毒株/疫苗时代敏感的文本做无差别替换(语义漂移)。
§6.7 模型推荐
| 模型 | 输入 | BC7 表现参考 | 适用场景 |
|---|---|---|---|
| Bioformer(轻量 transformer) | 标题+摘要 | micro-F1 0.9181 / macro-F1 0.8875(BC7 最佳双项) | 精度与成本兼顾的首选 |
| DUT914(BioBERT+标签特征增强) | 标题+摘要 | instance-F1 0.9394(BC7 最佳) | 逐样本精确率敏感场景 |
| DonutNLP / polyu_cbsnlp(BioBERT+集成) | 标题+摘要 | micro 0.9174 / 0.9139 | 集成基线 |
| Longformer 类长文本模型 | +全文 | 无官方榜(BC7 摘要口径),需自测 | 全文建模、超长文档 |
| BioClinicalBERT / PubMedBERT | 标题+摘要 | BC7 多队 backbone | 通用稳健起点 |
§6.8 硬件需求
| 任务 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 数据下载+预处理 | 4 核 CPU / 8 GB RAM | 8 核 / 16 GB | 纯文本,无 GPU 需求 |
| BC7 复现(512 token) | 单卡 8 GB(T4) | 单卡 16-24 GB | batch 16 起,FP16 |
| 全文长文本(4,096) | 单卡 16 GB | A100 40 GB | Longformer 显存开销大 |
| 全库 RAG 索引 | 16 GB RAM | 32 GB+ / 向量库 | 43 万+ 篇摘要嵌入 |
§6.9 评估指标代码(对齐 BC7 三指标)
# 与 BioCreative VII 完全对齐的三个指标:macro-F1 / micro-F1 / instance-F1
from sklearn.metrics import f1_score
def bc7_scores(y_true, y_pred): # y_*: (n_samples, 8) 多热矩阵
return {
"macro_F1": f1_score(y_true, y_pred, average="macro"), # 逐标签平均
"micro_F1": f1_score(y_true, y_pred, average="micro"), # 全局池化
"instance_F1": f1_score(y_true, y_pred, average="samples"), # 逐样本平均
}
# 排行榜基准(BC7 最佳):0.8875 / 0.9181 / 0.9394(出处见 §8.1)
§6.10 MLOps 笔记
- 数据版本化:快照即版本。入库时记录下载日期、行数、API/FTP 端点,用 DVC 或数据清单表登记,杜绝"哪个快照训的"悬案(坑点 7)。
- Schema 契约:pmid 唯一、8 主题白名单、singleton 约束、空摘要过滤四条断言写进 CI,违反即阻断(坑点 8)。
- 漂移监控:主题分布按月监控;毒株时代切换期(如 Omicron 普及后)重新校准阈值。
- 持续学习:官方每日更新,上线模型建议季度重训 + 时间外推验证集常态保留。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解建议 |
|---|---|---|---|
| 语言偏倚 | 收录以英文文献为主(PubMed 题录) | 中 | 跨语言研究需另行扩展语料 |
| 发表速度偏倚 | 新冠论文中位接收时间约 6 天(对比:Ebola 相关 15 天、心血管相关 102 天),质量闸门相对宽松 | 中 | 证据合成时甄别预印本与同行评审状态 |
| 标注协议断点 | 2020-08 下旬起无摘要文献原则上不标注主题,标签覆盖率出现结构性台阶 | 高 | 建模按时间分层;过滤空摘要(坑点 3) |
| 标签不平衡 | 大类主题主导分布,稀有主题样本少 | 高 | macro-F1 为主指标 + 类加权(坑点 6) |
| 文献类型混杂 | 无摘要记录多为评论/观点,非正式研究 | 中 | "文章类型"分层分析 |
| 覆盖偏倚 | 仅限 COVID-19/SARS-CoV-2 文献;对比 CORD-19 覆盖全部冠状病毒 | 低(设计使然) | 冠状病毒全景研究改用 CORD-19 类资源 |
§7.2 标注质量
标注由"ML 建议 + 人工审核"混合流程产出:分诊 F1 ≈ 0.99、实体识别 F1 ≈ 0.94、主题分类 F1 ≈ 0.80(后者是 BC7 挑战赛的靶点,社区最佳已推进到 macro-F1 0.8875)。BC7 语料全部经人工审核(NCBI 2 名具生物医学数据科学背景的兼职策展员主导),是文献主题标注质量的天花板;但"全库"层面滚动标注无法逐篇复核,精度介于模型与人工之间。Long Covid 论文报告的句级标注者间一致性(Cohen κ=0.71,Moderate)提示人工标注本身也有歧义带。
§7.3 泛化性
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 新毒株时代文献(2022 后 Omicron) | 旧模型对毒株相关主题表述漂移的适应滞后 | LitCovid in 2022 专门增加毒株/疫苗标注以回应演化 |
| 无摘要文献 | 主题标注缺失,模型输入信息不足 | 官方以标题+摘要为标注输入;自动标注对有摘要文章 F1 高约 10% |
| 非 COVID-19 疾病文献 | 完全超出收录域 | 设计上即 COVID-19 专题库 |
| 长文档建模 | 512 截断丢信息(43.24% 全文 >4,096 token) | enriched BC7 长度统计 |
| 主题冷启动(如 Long Covid 新类) | 关键词检索大量漏检(多数相关文献不点名该词) | Long Covid 论文:大多数相关文章会被关键词搜索漏掉 |
§7.4 伦理
LitCovid 仅含已发表文献的题录与机器/人工标注,不含患者级记录或个人可识别信息;作品为美国联邦雇员职务作品,在美国处于公共领域,再分发与商业使用均无版权障碍。NCBI 官方免责声明明确:其产出信息不用于直接诊断或医疗决策。使用其主题标注训练的临床文本工具仍须按 §0 免责声明完成独立临床验证。
§7.5 公平性
文献库层面的公平性问题主要是代表性:英文文献与高资源国家期刊占比高(8,000+ 种期刊的构成未公开细分),低资源地区研究成果可能被系统性低代表;标签体系基于英文术语,非英语术语的"Long Covid"变体(如"新冠后综合征")依赖人工与 ML 兜底。这些偏倚会沿"文献→标注→模型"链路传导到下游工具,跨人群部署前应做地域分层审计。
§7.6 数据漂移
三重漂移源:分布漂移(毒株时代更替、疫情阶段变化导致主题分布随时间移动);协议漂移(2020-08 标注策略变化、2021-07 新增 Long Covid 集合、2022 新增毒株/疫苗标注);规模漂移(55,000 → 300,000 → 437,000+ 篇)。缓解:时间外推验证、按月监控主题分布、快照版本化(§6.10)。
§7.7 DAIMS 数据质量评估(24 项)
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ✅ | TSV/BioC 单表结构,pandas 直读 |
| 2 | 唯一标识 | ✅ | PMID 全局唯一,可回链 PubMed |
| 3 | 特殊字符 | ✅ | 纯文本题录,tokenizer 前无需复杂清洗 |
| 4 | 重复行 | ⚠️ | 预印本与正式发表版本可能近似重复,需标题聚类去重(§5.3) |
| 5 | 缺失编码 | ✅ | 空摘要=空字段,语义明确 |
| 6 | 标签标识 | ✅ | topics 多值列 + long_covid 布尔,8 主题白名单清晰 |
| 7 | 罕见类分组 | ⚠️ | 标签不平衡显著,稀有主题需分层评估与类加权 |
| 8 | 偏倚评估 | ✅ | 官方论文与 FAQ 充分披露策展流程与协议演变 |
| 9 | 数据字典 | ✅ | FAQ + 论文定义 8 主题与字段含义 |
| 10 | 信息性缺失解释 | ✅ | 无标签=无摘要(多为评论类)是信息性缺失(§4.5) |
| 11 | 设备记录 | ❌ | 不适用:文献元数据库无设备字段 |
| 12 | 共线性 | ⚠️ | 标签共现强相关(label correlation),独立解码次优 |
| 13 | 编码映射 | ✅ | ICD-11(1D92)与 SNOMED CT(840539006)映射明确(§2.1) |
| 14 | 时间戳处理 | ✅ | 每篇含发表日期,支持时间切分与趋势分析 |
| 15 | 划分建议 | ✅ | BC7 官方 train/dev/test 固定切分 |
| 16 | 泄漏讨论 | ✅ | 近似重复与时间漂移风险已讨论(§5.3) |
| 17 | 标签分布 | ✅ | BC7 论文 Table 2 给出完整逐主题分布;singleton 约束明确 |
| 18 | 测量偏倚 | ⚠️ | 标注协议随时间演变,跨时段比较需校正 |
| 19 | 外部验证建议 | ✅ | §5.5 与 §7.8 给出外推与社区评测路径 |
| 20 | 版本记录 | ⚠️ | 连续更新无官方版本号,使用者须自行快照登记 |
| 21 | 预处理脚本 | ✅ | 官方评测脚本 + 本页 §6.3/§6.4 可运行管线 |
| 22 | 合规要求 | ✅ | 美国公共领域,无使用协议门槛 |
| 23 | 多模态对齐 | ✅ | 题录-标注-实体三层按 PMID 对齐;单模态文本库无跨模态问题 |
| 24 | 去标识化 | ✅ | 不含个人数据,无需去标识化 |
DAIMS 评分:20.5 / 24
评分解读:18 项 ✅、5 项 ⚠️、1 项 ❌。扣分集中在四类"活库"固有特征——近似重复(4)、标签不平衡(7)、标签相关性(12)、协议演变(18),外加无版本号(20)与不适用的设备字段(11)。作为对比参照:静态、一次性冻结的 临床数据库通常在"版本记录/重复行"上得分更高,但在"持续更新/覆盖广度"上不及 LitCovid。
对你意味着什么:可以把 LitCovid 当作"开箱即基准"的文本库直接进入实验(官方切分 + 评测脚本齐全),但必须自带四道防线:按 PMID 做标题聚类去重、以 macro-F1 为主指标并做类加权、所有快照登记下载日期、跨时段实验显式处理 2020-08 标注协议断点。做到这四条,DAIMS 扣分项对你的项目影响趋近于零。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| BC7-LitCovid held-out test(2,500 篇) | BioCreative 社区(19 队 80 提交) | 多标签主题分类 | macro-F1 最高 0.8875 / micro-F1 0.9181 / instance-F1 0.9394 | 比当时通用 SOTA 多标签方法高约 12%(macro-F1) | 领域预训练 transformer + 集成是主导技术;singleton 约束下小类仍是短板 |
| enriched BC7 语料(30,563 篇回填全文+实体) | 北京工业大学等(Database 2024) | 多标签主题分类 | 全文/MeSH 相对元数据的边际增益有限(数值见原文) | 相比仅 metadata:提升有限 | 元数据(标题+摘要)已承载大部分判别信息;长文本增益需权衡成本 |
§8 基准性能与生态
§8.1 排行榜:BioCreative VII LitCovid Track(Track 5)
BC7 官方固定切分(train 24,960 / dev 6,239 / test 2,500,标题+摘要输入)上的多标签主题分类成绩,19 队 80 次提交,约 75% 提交优于基线。可比性声明:下表成绩同榜同口径可比;任何在其他快照/自切分上的分数均不可与本表直接比较。
| 排名 | 团队/系统 | micro / macro / instance F1 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | Bioformer | 0.9181 / 0.8875 / 0.9334 | 2022 | 轻量 transformer,参数量压缩至约 1/3;多语料预训练融合 | Chen Q, et al., 2022, Database. DOI: 10.1093/database/baac069(成绩官方记录) | 见 BC7 综述 Table 5 |
| 2 | DUT914 | 0.9175 / 0.8760 / 0.9394 | 2022 | BioBERT + 标签特征增强模块;instance-F1 全场最佳 | 同上(官方成绩记录) | 见 BC7 综述 Table 5 |
| 3 | DonutNLP | 0.9174 / 0.8754 / 0.9346 | 2022 | BioBERT + 集成学习 | 同上(官方成绩记录) | 见 BC7 综述 Table 5 |
| 4 | polyu_cbsnlp | 0.9139 / 0.8749 / 0.9319 | 2022 | 多种 BERT 族 backbone + MeSH 辅助 + 集成 | 同上(官方成绩记录) | 见 BC7 综述 Table 5 |
| 5 | Opscidia | 0.9135 / 0.8824 / 0.9296 | 2022 | BERT + 数据增强 + 集成 | 同上(官方成绩记录) | 见 BC7 综述 Table 5 |
§8.2 SOTA 总结与选型建议
BC7 之后该基准的技术共识:领域预训练 transformer 是起点(14/17 描述队伍使用),集成与标签相关性建模是主要涨分点,轻量化(Bioformer)证明了不必为大模型牺牲精度。选型建议:资源受限选 Bioformer 量级模型 + singleton 解码约束;追求极致 instance-F1 参照 DUT914 的标签特征增强;做全文/长文本研究则用 Longformer 族自建协议并在 dev 集报告,勿与 BC7 榜混比。标签不平衡处理(类权重/逐类阈值)稳定带来 macro-F1 收益。
§8.3 评测协议
官方评测脚本 biocreative_litcovid_eval.py(GitHub,2021-07 最后更新)以多热标签矩阵为输入,输出逐主题 precision/recall/F1 与 micro/macro/instance(samples)三口径平均;参赛队伍最多提交 5 次 test 预测。脚本 README 附带的示例输出展示了逐主题明细格式(如 Treatment F1 0.8780 / Diagnosis F1 0.7500 等,7 主题演示样本),建议所有自定义实验复用该脚本保持口径一致。
§8.4 相关数据集
| 数据集 | 关系 | 规模 | 差异化 |
|---|---|---|---|
| BC7-LitCovid 语料 | LitCovid 的冻结基准子集 | ~34,000 篇(24,960/6,239/2,500) | 人工审核 + 固定切分,排行榜专用 |
| CORD-19 | 早期平行资源 | ~57,000 篇(2020-04) | 覆盖全部冠状病毒与更早时段,无主题标注 |
| Long Covid 数据(Zenodo 10.5281/zenodo.7308463) | LitCovid 专题集合的配套研究数据 | ~9,000 篇分类+标注 | human-in-the-loop 管线完整开源 |
| PubMed | 上游源库 | 数千万条 | 无新冠策展层 |
§8.5 关键论文 Top 6
- Chen Q, Allot A, Lu Z. Keep up with the latest coronavirus research. Nature 2020;579(7798):193. DOI: 10.1038/d41586-020-00694-1 —— LitCovid 的"出生证明"通讯,首次公开宣布资源上线。
- Chen Q, Allot A, Lu Z. LitCovid: an open database of COVID-19 literature. Nucleic Acids Research 2021;49(D1):D1534-D1540. DOI: 10.1093/nar/gkaa952 —— 数据库主论文:三模块混合策展流水线与首批 F1 评估(被引 257+,Semantic Scholar 截至 2026-09)。
- Chen Q, Allot A, Leaman R, et al. LitCovid in 2022: an information resource for the COVID-19 literature. Nucleic Acids Research 2023;51(D1). DOI: 10.1093/nar/gkac1005 —— 两年更新综述:Long Covid 集合、毒株/疫苗标注与规模轨迹(55,000 → ~300,000)。
- Chen Q, Allot A, Leaman R, et al. Multi-label classification for biomedical literature: an overview of the BioCreative VII LitCovid Track. Database 2022;baac069. DOI: 10.1093/database/baac069 —— 基准论文:30,000+ 篇人工审核语料、19 队 80 提交与官方排行榜。
- Leaman R, et al. Comprehensively identifying Long Covid articles with human-in-the-loop machine learning. Patterns 2022. DOI: 10.1016/j.patter.2022.100659 —— Long Covid 集合的方法学论文:多数相关文献不点名该病,关键词检索失效的量化证据。
- Xu S. Is metadata of articles about COVID-19 enough for multilabel topic classification task? Database 2024;baae106. DOI: 10.1093/database/baae106 —— 后续方法研究: enriched 语料证明元数据已承载大部分判别信息,全文/MeSH 边际增益有限。
§8.6 社区活跃度
LitCovid 每月接受全球用户数百万次访问(官方论文口径,2022);BC7 挑战赛吸引 19 支队伍 80 次提交,覆盖四大洲机构;官方评测脚本仓库自 2021-07 起保持公开(评测口径稳定,最后提交 2021-07-15);NAR 主论文被引 257+(Semantic Scholar,截至 2026-09),是新冠文献挖掘方向的必引基础设施之一。
| 时间 | 社区节点 |
|---|---|
| 2020-02 | 资源上线,Nature 通讯发布 |
| 2020-11 | NAR 数据库主论文发表(2021-01 正式刊出) |
| 2021-07 | BC7 Track 5 评测脚本公开,挑战赛收官 |
| 2022 | BC7 综述发表(Database baac069),19 队成绩定格 |
| 2022-12 | Long Covid 方法论文与 Zenodo 数据存档发布 |
| 2024 | 第三方增强语料(baae106)等后续研究持续产出 |
§8.7 生态快照
| 资源 | 类型 | 链接 | Star/Fork(截至 2026-09,约) | 为什么值得关注 |
|---|---|---|---|---|
| ncbi/biocreative_litcovid | 官方评测代码 | https://github.com/ncbi/biocreative_litcovid | — | BC7 Track 5 官方评测脚本+样例,保榜口径的唯一标准 |
| BioCreative VII Track 5 页面 | 任务主页 | https://biocreative.bioinformatics.udel.edu/tasks/biocreative-vii/track-5/ | — | 报名、时间线与 FAQ;联系 qingyu.chen AT nih.gov |
| LitCovid FTP | 数据分发 | https://ftp.ncbi.nlm.nih.gov/pub/lu/LitCovid/ | — | BioC 全库 + BC7 语料 + 评测数据一站式获取 |
| LitCovid API | 数据接口 | https://www.ncbi.nlm.nih.gov/research/coronavirus-api/export/all/tsv | — | 单请求全库 TSV 导出,原型验证最快路径 |
| PubTator / PubTator Central | 配套工具 | https://www.ncbi.nlm.nih.gov/research/pubtator/api.html | — | 同团队实体标注系统,与 LitCovid 实体层互补 |
| Long Covid 数据(Zenodo) | 研究数据 | https://doi.org/10.5281/zenodo.7308463 | — | human-in-the-loop 完整标注数据,冷启动研究素材 |
§9 相关资源与引用
§9.1 官方资源导航
| 资源 | 链接 | 说明 |
|---|---|---|
| LitCovid 主页 | https://www.ncbi.nlm.nih.gov/research/coronavirus/ | 站内检索、主题浏览、Trending publications |
| 官方 FAQ | https://www.ncbi.nlm.nih.gov/research/coronavirus/faq | 主题沿革、Long Covid 定义、引用格式 |
| FTP 批量下载 | https://ftp.ncbi.nlm.nih.gov/pub/lu/LitCovid/ | BioC 全库 + BC7 语料 |
| API TSV 导出 | https://www.ncbi.nlm.nih.gov/research/coronavirus-api/export/all/tsv | 全库单请求导出 |
| BioC-PMC API | https://www.ncbi.nlm.nih.gov/research/bionlp/APIs/BioC-PMC/ | PMID→PMCID 全文回填 |
| 评测脚本 | https://github.com/ncbi/biocreative_litcovid | BC7 官方三指标评测 |
| BioCreative VII Track 5 | https://biocreative.bioinformatics.udel.edu/tasks/biocreative-vii/track-5/ | 挑战赛主页与 FAQ |
| Long Covid 数据 | https://ftp.ncbi.nlm.nih.gov/pub/lu/LongCovid/ | 分类得分与人工标注 |
| 引用指南 | 见 §9.2 BibTeX | 官方 FAQ 提供两篇核心引用的 RIS/BibTeX |
新用户学习路径建议(一周内可完成):第一步,读官方 FAQ 与 Nature 通讯建立概念(半天);第二步,用 §6.1 脚本拉全库 TSV、用 BC7 语料跑通 §6.4 DataLoader 与 §6.9 三指标(两天);第三步,在 BC7 上复现一个 PubMedBERT 基线并对照 §8.1 排行榜定位差距(两天);第四步,按 §5.5 设计时间外推实验,接入 §6.10 MLOps 流程(持续)。
§9.2 BibTeX 完整引用
@article{chen2020keep,
author = {Chen, Qingyu and Allot, Alexis and Lu, Zhiyong},
title = {Keep up with the latest coronavirus research},
journal = {Nature},
volume = {579},
number = {7798},
pages = {193},
year = {2020},
doi = {10.1038/d41586-020-00694-1}
}
@article{chen2021litcovid,
author = {Chen, Qingyu and Allot, Alexis and Lu, Zhiyong},
title = {LitCovid: an open database of {COVID-19} literature},
journal = {Nucleic Acids Research},
volume = {49},
number = {D1},
pages = {D1534--D1540},
year = {2021},
doi = {10.1093/nar/gkaa952}
}
@article{chen2022biocreative,
author = {Chen, Qingyu and Allot, Alexis and Leaman, Robert and Islamaj, Rezarta and Du, Jingcheng and Fang, Li and Wang, Kai and Xu, Shuo and Zhang, Yuefu and others},
title = {Multi-label classification for biomedical literature: an overview of the {BioCreative VII LitCovid Track} for {COVID-19} literature topic annotations},
journal = {Database},
volume = {2022},
pages = {baac069},
year = {2022},
doi = {10.1093/database/baac069}
}
@article{chen2023litcovid,
author = {Chen, Qingyu and Allot, Alexis and Leaman, Robert and Wei, Chih-Hsuan and Aghaarabi, Elaheh and Guerrerio, John J and Xu, Lilly and Lu, Zhiyong},
title = {LitCovid in 2022: an information resource for the {COVID-19} literature},
journal = {Nucleic Acids Research},
volume = {51},
number = {D1},
year = {2023},
doi = {10.1093/nar/gkac1005}
}
@article{leaman2022longcovid,
author = {Leaman, Robert and Wei, Chih-Hsuan and Allot, Alexis and Do{\u{g}}an, Rezarta Islamaj and Wu, Qingqing and Lu, Zhiyong},
title = {Comprehensively identifying {Long Covid} articles with human-in-the-loop machine learning},
journal = {Patterns},
year = {2022},
doi = {10.1016/j.patter.2022.100659}
}
@article{xu2024metadata,
author = {Xu, Shuo},
title = {Is metadata of articles about {COVID-19} enough for multilabel topic classification task?},
journal = {Database},
volume = {2024},
pages = {baae106},
year = {2024},
doi = {10.1093/database/baae106}
}
§9.3 引用指南
学术产出引用 LitCovid 时优先引用数据库主论文(Chen 2021, NAR);使用 BC7 语料或排行榜则必须加引 BC7 综述(Chen 2022, Database);使用 Long Covid 集合加引 Patterns 论文。官方 FAQ 亦提供 RIS/BibTeX 下载。再次提醒:引用任何快照数字时注明下载日期(连续更新库无固定版本号)。
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| fast-model(CodeBuddy Code) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch / WebFetch(多源检索) | 2026-09-13 | 6 组检索 + 2 次定点抓取:官方 FAQ、引用量 API、ICD-11/SNOMED 编码核对、GitHub 仓库详情 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 NCBI 官方 FAQ、六篇核心论文、Database Commons 目录与图书馆指南中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- Chen et al. (2020), Nature 579(7798):193 — LitCovid 上线通讯(DOI: 10.1038/d41586-020-00694-1)
- Chen et al. (2021), Nucleic Acids Research 49(D1):D1534-D1540 — 数据库主论文(DOI: 10.1093/nar/gkaa952)
- Chen et al. (2022), Database baac069 — BioCreative VII LitCovid Track 综述(DOI: 10.1093/database/baac069)
- Chen et al. (2023), Nucleic Acids Research 51(D1) — LitCovid in 2022(DOI: 10.1093/nar/gkac1005, PMID 36350613)
- Leaman et al. (2022), Patterns — Long Covid human-in-the-loop(DOI: 10.1016/j.patter.2022.100659)
- Xu (2024), Database baae106 — 元数据 vs 全文多标签分类研究(DOI: 10.1093/database/baae106)
- NCBI LitCovid 官方 FAQ(主题沿革、Long Covid、CORD-19 对比、免责声明)
- Database Commons 目录条目 7509(375,727 篇快照、机构与联系人信息)
- JMIR Research Protocols 2025;13:e58567(437,000+ 篇、8,000+ 期刊、截至 2024-11)
- UCL Discovery:BC7 综述手稿 PDF(Table 5 各队成绩明细)
- GitHub ncbi/biocreative_litcovid(评测脚本、示例输出、最后提交 2021-07-15)
- Indiana State University Library LibGuide(PubMed 检索式、布尔 OR、RIS 导出)
- NNLM News:LitCovid 报道(约 +35% 关键词检索增益)
- Semantic Scholar API 引用快照(gkaa952: 257;d41586-020-00694-1: 146,截至 2026-09)
- DermNet COVID-19 词条与 WHO ICD Emergency Codes 页(ICD-11 1D92/RA01.0、SNOMED CT 840539006/840533007)
- Zenodo 10.5281/zenodo.7308463(Long Covid 数据集存档)
§10.4 人工校验
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| INFOBOX 与规模数字 | 千方病案医学编辑部 | 逐项对照 FACTS.md 来源清单复核 | ✅ 已通过/已验证 |
| §2 医学背景与编码映射 | 千方病案医学编辑部 | ICD-11/SNOMED 双源交叉核对(DermNet + WHO) | ✅ 已通过/已验证 |
| §3-§5 规格与划分 | 千方病案医学编辑部数据工程组 | 对照 BC7 论文与 FTP 官方页面 | ✅ 已通过/已验证 |
| §6 代码与坑点 | 千方病案医学编辑部数据工程组 | 代码逻辑走查 + 端点可用性核验 | ✅ 已通过/已验证 |
| §7 DAIMS 与外部验证 | 千方病案医学编辑部 | 24 项逐条复核 + 来源回溯 | ✅ 已通过/已验证 |
| §8 排行榜与引用 | 千方病案医学编辑部 | 对照 BC7 综述 Table 5 与 Semantic Scholar | ✅ 已通过/已验证 |
| §C JSON-LD | 千方病案医学编辑部数据工程组 | 与 frontmatter schema_org 逐字段比对 | ✅ 已通过/已验证 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- cord-19 — 共享标签:医疗NLP / 公共卫生与流行病学 / 生物医学文献 / COVID-19
- vaers — 共享标签:医疗NLP / 公共卫生与流行病学
- scifact — 共享标签:医疗NLP / 生物医学文献 / COVID-19
- open-pmc — 共享标签:医疗NLP / 生物医学文献
- coswara — 共享标签:公共卫生与流行病学 / COVID-19
- jhu-csse-covid-19 — 共享标签:公共卫生与流行病学 / COVID-19
- pmc-oa-subset — 共享标签:医疗NLP / 生物医学文献
- s2orc — 共享标签:医疗NLP / 生物医学文献
- ncbi-disease — 共享标签:医疗NLP / 生物医学文献
- jnlpba — 共享标签:医疗NLP / 生物医学文献
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

