PubTator Central (pubtator-central) — NCBI 生物医学文献自动实体与关系标注语料 — AI-Ready Wikipedia

NCBI 对 2900 万条 PubMed 摘要与 300 万篇 PMC 全文做全自动生物概念(基因/变异/疾病/化学物质/物种/细胞系)实体与关系标注——2013 PubTator 原版的全文升级版,2019 NAR 发布,FTP/API/Web 三层发布,公共领域无限制许可;2024 演进为 PubTator 3.0

来源 NCBI PubTator 系列对 PubMed 摘要与 PMC 开放获取全文的全自动实体与关系标注:六类实体(基因/蛋白、变异、疾病、化学、物种、细胞系)+ 12 类关系;注释含连续 span、概念类型与数据库登录号;多格式发布(BioC-XML / JSON / tab);明细见正文附录发布时间: 2026-09-30最后更新: 2026-09-30 阅读 10
PubTator Central (pubtator-central) — NCBI 生物医学文献自动实体与关系标注语料 — AI-Ready Wikipedia

信息速览

数据集名称PubTator Central (pubtator-central) — NCBI 生物医学文献自动实体与关系标注语料 — AI-Ready Wikipedia
数据类型自动标注,文本数据,原始数据
规模不适用(文献级语料,非患者数据);文档规模:PTC 2019 约 2900 万 PubMed 摘要 + 300 万 PMC 全文;PubTator 3.0 约 3600 万摘要 + 600 万全文
接入方式NCBI PubTator 系列对 PubMed 摘要与 PMC 开放获取全文的全自动实体与关系标注:六类实体(基因/蛋白、变异、疾病、化学、物种、细胞系)+ 12 类关系;注释含连续 span、概念类型与数据库登录号;多格式发布(BioC-XML / JSON / tab);明细见正文附录
AI 就绪度

INFOBOX — PubTator Central 一屏速览

维度 内容
本质 NCBI 对 PubMed 摘要 + PMC 全文的全自动生物概念实体与关系标注语料/服务(非人工金标准、非挑战赛)
机构 NCBI / NLM / NIH(Bethesda, MD, USA),通讯 PI Zhiyong Lu(陆志勇)
本条目论文 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389;PMID 31114887)
版本链 PubTator(2013) → PubTator Central / PTC(2019, 亦称 PubTator2) → PubTator 3.0(2024)
规模(PTC 2019) 约 2900 万 PubMed 摘要 + 约 300 万 PMC 全文(PMC-TM 子集)
规模(3.0 2024) 约 3600 万摘要 + 600 万全文;超 10 亿实体+关系注释;12 类关系
六类实体 基因/蛋白、遗传变异、疾病、化学物质、物种、细胞系(归一化到 NCBI Gene / dbSNP / MeSH / NCBI Taxonomy / Cellosaurus)
获取 Web 界面 + RESTful API + FTP 批量三层;FTP ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/(全量 ~200G+)
格式 BioC-XML / JSON / tab 分隔(.gz)
许可 NCBI Public Domain Notice——美国政府作品,无使用与再复制限制(库内最宽松等级)
更新 PTC 官方页 daily / 3.0 论文 weekly / FTP README monthly(三口径并存)
任务 NER + NED(实体识别与归一化)+ RE(关系抽取,3.0 起)
库内互链 BioRED(457)、BC5CDR(415)、CHEMDNER(450)、NCBI-Disease(425)、BC2GM(434)、MedMentions(390)、CRAFT(529)、PubMedQA(49)、S2ORC(370)

PubTator Central(缩写 PTC)是生物医学文本挖掘领域最被广泛依赖的"基础设施级"资源之一:它不生产新知识,而是把 PubMed 里近三千万条摘要与 PMC 里三百万篇全文,用最先进的机器标注系统逐篇"贴上"基因、变异、疾病、化学物质、物种、细胞系六类生物概念标签,并把这些标签连同数据库登录号一起,以 Web / API / FTP 三种方式完全免费、无限制地开放给全世界。对任何做医学 NLP、临床知识图谱、或医疗大模型 grounding 的团队来说,它几乎是一个"默认起点"——你不需要自己从零构建实体识别管线,直接下载或调用即可。2019 年它把 PubTator 从"只有摘要"升级到"含全文",2024 年又演进为 PubTator 3.0,加入了关系抽取与语义检索。理解这个条目,本质上是在理解当代生物医学 AI 的语料底座是怎么被生产、组织和分发的。

导语读法三则:

  1. 只想拿数据:直奔 §6 获取与许可——记住"三层发布 + 公共领域无限制"这两个关键词,别在申请流程上浪费时间(它没有申请流程)。
  2. 关心版本关系:直奔 §2 与 §7——PubTator / PubTator Central / PubTator 3.0 是同一系统的三代,数字口径极易混用,读前先定版本。
  3. 做医疗 AI grounding:直奔 §5 与 §8——六类实体 + 12 类关系 + 与 ChatGPT 集成的验证,是它作为"事实锚点库"的直接证据。

§0 导读:这个数据集解决什么问题

生物医学文献的规模早已超出任何人力的处理范围。仅 PubMed 就收录了三千多万条摘要,PMC 的开放获取全文也在以每年数十万篇的速度增长;一篇临床研究里散落着基因名、变异位号、疾病术语、药物化学名、模式生物物种、实验细胞系——这些信息对药物重定位、基因优先排序、罕见病变异解读、知识图谱构建都至关重要,但它们以自由文本形式存在,机器无法直接消费。人工策展(biocuration)可以产出高质量标注,但速度远远追不上文献增长;这就是**自动文本挖掘(text mining)**登场的场景。

PubTator Central 的回答是把自动标注做成一项持续运行、全库覆盖、免费开放的公共服务,分三层。第一层是覆盖:它不止标注摘要,还把标注扩展到 PMC 的全文——全文信息量约为摘要的 40 倍,标注总量因此扩大近四倍,这是 PTC 相对 2013 原版最核心的升级。第二层是质量:它不再只用单一规则模型,而是并行部署多个专用 tagger(基因用 GNormPlus、变异用 tmVar、疾病与化学用 TaggerOne、物种用 SR4GN),再用基于深度学习的消歧模块裁决重叠与冲突标注。第三层是可达性:Web 界面给人看,RESTful API 给程序用,FTP 批量给大规模管线用,三种入口全免费、无门槛、无注册墙。

与此同时,必须诚实地给它标注定位:它是自动标注,不是人工金标准。NCBI 的免责声明白纸黑字写着不担保准确性。这决定了它的正确用法——它是"预标注 / 弱标注 / 检索索引 / grounding 素材"的最佳选择,而当你需要严格评测 NER/RE 模型的精度时,你应该用它去对照人工金标准语料(如 BioRED、BC5CDR、NCBI-Disease)。理解 PubTator Central 的价值,一半在于它提供了什么,另一半在于它明确不承诺什么。

§0 读法三则:

  1. 这个条目是"语料 + 服务 + 工具链 + 版本谱系"四合一:数据是注释结果,服务是 Web/API/FTP,工具链是 GNormPlus/tmVar/TaggerOne/AIONER/BioREx 等,(三代)版本谱系是理解一切数字口径的前提。
  2. 全文所有数字都标注了版本口径(PTC 2019 / 官方页 / 3.0 2024 / FTP 实测),因为同一个量在不同来源差异巨大——文档规模 29M/30M/36M、更新频率 daily/weekly/monthly 都是实例(§9 与坑点存照)。
  3. 检索时若把 “PubTator Central” 和 “PubTator 3.0” 当成两个独立数据集分别搜索,会得到大量交叉引用——它们是同一系统的前后版本,官方页至今仍在 /research/pubtator/(PTC)与 /research/pubtator3/(现行)两处并存。

§1 数据集速览:十问十答

Q1:PubTator Central 到底是什么?是数据集还是网站?
两者都是。它是 NCBI 提供的一项持续运行的自动标注服务,同时产出可批量下载的标注语料。你可以把它理解为一个"文献标注工厂":工厂本身(Web + API)实时可查,工厂的产出(FTP 全量注释)可整体打包下载。它不对应某一次性的数据发布,而是每日/每周滚动的活体资源。

Q2:它标注什么内容?
六类生物概念实体:基因/蛋白(genes/proteins)、遗传变异(genetic variants)、疾病(diseases)、化学物质(chemicals)、物种(species)、细胞系(cell lines)。每条注释 = 一段连续文本 + 一个概念类型 + 一个数据库登录号(例如基因映射到 NCBI Gene ID、疾病与化学映射到 MeSH、变异映射到 dbSNP、物种映射到 NCBI Taxonomy、细胞系映射到 Cellosaurus)。2024 年的 PubTator 3.0 又增加了 12 类实体间关系。

Q3:数据规模有多大?
按本条目主口径(PTC 2019):约 2900 万条 PubMed 摘要 + 约 300 万篇 PMC 全文。官方当前页面写"~3000 万摘要 + ~300 万全文"。2024 年的 PubTator 3.0 已扩展到约 3600 万摘要 + 600 万全文,注释总量超过 10 亿(实体+关系)。

Q4:它是人工标注的吗?
不是。它是全自动机器标注。多个专用识别模型并行跑,再用深度学习消歧模块统一裁决。这正是它敢宣称"全库覆盖"的原因,也是它必须声明"不担保准确性"的原因。

Q5:怎么获取?
三条路,全部免费无门槛:① Web 界面(/research/pubtator/ 与 /research/pubtator3/)交互式浏览检索;② RESTful API(/research/pubtator/api)程序化访问;③ FTP 批量下载(ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/)。格式为 BioC-XML、JSON、tab 分隔。

Q6:许可是什么?能商用吗?
NCBI Public Domain Notice——它是美国政府作品(United States Government Work),不受版权保护,NLM 与美国政府未对其使用或再复制设置任何限制。这意味着在许可层面可自由使用、修改、再分发,包括商业用途(具体合规仍需使用者自判,但数据本身无许可限制)。这是库内许可最宽松的等级之一。

Q7:它和 2013 年的 PubTator 什么关系?
它是 PubTator 的升级版(第二代)。2013 年的 PubTator 只能标注 PubMed 摘要(五类概念);2019 年的 PubTator Central 把标注扩展到 PMC 全文、增加细胞系为第六类概念、引入深度学习消歧、重写服务端架构。文献里有时称 PTC 为 PubTator2。

Q8:那 PubTator 3.0 又是什么?
是 2024 年的第三代。它用统一的 AIONER 模型做实体识别、用 BioREx 做关系抽取、支持语义与关系检索,并演示了与 ChatGPT(GPT-4)集成以提升回答的真实性与可验证性。数据规模进一步扩到 36M 摘要 / 6M 全文。

Q9:它适合做什么、不适合做什么?
适合:医学 NLP 的预标注、实体链接/归一化的候选生成、知识图谱的关系素材、文献检索的语义索引、医疗大模型的事实 grounding、生物策展的辅助线索。不适合:需要严格金标准评测标签的场景(应改用 BioRED/BC5CDR 等人工语料)、需要非 OA 全文覆盖的场景(PMC 版权限制)、需要解剖实体等未纳入概念的场景。

Q10:为什么对 AI-Ready 重要?
因为它把"高质量规模的标注语料"这一 AI 训练/评测关键要素,做成了公共领域、三层可达、持续更新的公共服务。它是库内极少数"许可零阻力 + 获取零门槛 + 规模千万级"三者兼备的资源,同时它的版本谱系与多口径数字,又是"AI-Ready 元数据治理"的典型教学样本(见 §9 双口径存照)。

§2 版本谱系:三代 PubTator 的关系必须一次讲清

PubTator Central 最容易被误读的地方,是它与"PubTator"这个名字的纠缠。市面上至少有三种说法在流通:“PubTator”“PubTator Central”“PubTator 3.0”——有人以为是三个数据集,有人以为是同一系统的别名,有人把 3.0 的数字套到 PTC 头上。正确理解是:它们是同一系统 NCBI PubTator 的三代版本,共享同一套设计哲学(把自动生物概念标注做成公共服务),但每一代在覆盖范围、概念类型、算法与服务能力上都有实质跃迁。

2.1 三代对照总表

维度 PubTator(2013,初版) PubTator Central / PTC(2019,第二代) PubTator 3.0(2024,第三代)
论文 NAR 41(Web Server issue):W518–W523 NAR 47(W1):W587–W593 NAR 52(W1):W540–W546
DOI 10.1093/nar/gkt441 10.1093/nar/gkz389 10.1093/nar/gkae235
PMID 23703206 31114887 38572754
文献别名 PubTator(初版) PTC / PubTator2 PubTator3
标注范围 仅 PubMed 摘要 摘要 + PMC 全文 摘要 + PMC 全文(规模更大)
文档规模 摘要级 约 29M 摘要 + 3M 全文 约 36M 摘要 + 6M 全文
概念类型 5 类(无 cell line) 6 类(+cell line) 6 类
关系抽取 无 无 12 类关系
核心算法 规则/统计 tagger 专用 tagger + 深度学习消歧 AIONER(统一 NER)+ BioREx(RE)
服务能力 浏览 + API 全文界面 + 语义检索 + API 语义/关系/布尔检索 + ChatGPT 集成
更新频率来源 — 官方页 daily 论文 weekly / FTP README monthly
许可 公共领域 公共领域 公共领域
Europe PMC 引用数(2026-09-30) 368 279 139

一句话总结谱系:2013 解决"有没有",2019 解决"全不全"(全文化 + 六类 + 消歧),2024 解决"关系与检索"(RE + 语义化)。 本条目以 PubTator Central(2019) 为立条主体(slug pubtator-central),PubTator 3.0 作为其直接后继在 §7 详述。

2.2 为什么以 PTC 立条,而不是 PubTator 3.0

三个理由:

  1. 官方在线实体名。截至抓取时点,NCBI 官方页 https://www.ncbi.nlm.nih.gov/research/pubtator/ 的主标题与自我描述仍为 “PubTator Central (PTC)”,且明确表述其覆盖"~30 million abstracts + ~3 million full-text"——即仍以 PTC 名义提供那一代口径的服务说明。以官方在线的实体名立条,符合"以可核网址为准"的纪律。
  2. 引用惯例。在生物医学 NLP 文献中,"PubTator Central"作为资源名被引用的频次最高(279 次引用,且大量下游论文以 gkz389 为方法学出处);2013 原版(368 次)多为"该系统起源"引用,3.0(139 次)相对新。
  3. 谱系叙述的自然支点。以 PTC 为支点,向前可接 2013 原版(讲清"从摘要到全文"的升级动机),向后可接 3.0(讲清"从实体到关系"的下一步),三代一条线,检索者任入一端都能顺藤摸到全貌。

2.3 名字陷阱:PubTator2 是什么

在一些论文与工具文档里,PTC 会被写成 “PubTator2” 或 “PubTator2.0”。这不是另一个系统,而是社区对"第二代 PubTator"的俗称——尤其在与 3.0 对照时(如 3.0 论文 Fig 2B 写 “compared with PubTator2 (also known as PubTatorCentral)”)。因此如果你在 3.0 论文里看到 “PubTator2”,它指的就是本条目。反之,若在 2019 论文里看到 “original PubTator”,指的是 2013 初版。这条别名链是检索与引用时最容易出错的地方(坑点 1)。

2.4 版本迁移对获取路径的实际影响

版本迭代不只是"名字变了",它直接改变数据的存放位置。抓取时点实测:

  • 旧目录 https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTatorCentral/ 仍可访问(HTTP 200),但只剩一个 2020-11-06 的 PubTatorCentral_BioCXML/ 子目录,README.txt 已 404——旧版的批量出口实质已冻结为历史快照。
  • 现行目录 https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/ 是活跃发布点,文件最后更新于 2026-08-17,总计约 200GB+。

这意味着:如果你按老教程的路径去下 PTC 的批量注释,会拿到一份 2020 年的旧快照,或直接扑空。正确的现行做法是走 PubTator3 目录(覆盖更全、更新更勤)。这一"版本迁移导致旧路径失效"的现象,是本条目给所有数据管线维护者的直接警示(坑点 5)。

§3 数据构成与规格

3.1 文档覆盖:为什么是"摘要 + 全文"两层

PTC 的文档来源有两块,理解它们的边界是正确使用的前提:

来源 规模(PTC 2019 口径) 说明
PubMed 摘要 约 2900 万条 全部 PubMed 记录的摘要部分;覆盖最广、最稳定
PMC 全文 约 300 万篇 仅限 PMC Text Mining(PMC-TM)子集:含 Open Access Subset 与 Author Manuscript Collection

关键在于"全文"的限定词:不是所有 PMC 文章都可用。只有进入 PMC-TM(可供文本挖掘)子集——即开放获取子集与作者手稿集——的文章才被标注。受出版商版权限制、未开放文本挖掘权限的全文不在覆盖范围内。论文提到当时 PMC 中"可供文本挖掘的文章比例接近 80%“,这个 80% 是按可从文本挖掘的字数/篇数统计的口径,不等于"PMC 里 80% 的文章”;使用时应理解为"绝大多数 OA 内容已覆盖,但非 OA 全文存在系统性缺口"。

为什么值得费这个力?因为摘要与全文的信息量差距巨大:论文明确指出全文长度约为摘要的 40 倍,且在摘要中常常缺失的关键知识(方法细节、实验结果、变异位点的具体语境、药物剂量关系等)大量存在于全文。把标注从摘要扩展到全文,使总标注量扩大近四倍——这是 PTC 相对 2013 原版最根本的价值增量,也是它对下游知识发现类应用(需要深挖正文关系)的直接赋能。

3.2 六类概念与归一化目标

PTC 标注六类生物概念,每类都归一化到一个权威数据库标识。这个"识别 + 归一化"的双步骤是它区别于普通 NER 的关键——它不只圈出实体词,还告诉你这个实体在数据库里是谁:

概念类型 英文 归一化目标数据库 PTC 识别/归一化工具 3.0 工具升级
基因/蛋白 gene/protein NCBI Gene GNormPlus AIONER + GNorm2
遗传变异 genetic variant(mutation) dbSNP RS ID tmVar 2.0 tmVar 3.0
疾病 disease MeSH TaggerOne AIONER + TaggerOne
化学物质 chemical MeSH TaggerOne(重训) AIONER + NLM-Chem
物种 species NCBI Taxonomy SR4GN AIONER + GNorm2
细胞系 cell line Cellosaurus TaggerOne AIONER + TaggerOne

几个值得注意的点:

  1. 疾病与化学物质共用 TaggerOne 但用不同模型,且化学 tagger 针对 PTC 用 BioCreative V CDR 语料 + CHEMDNER 语料联合重训——这说明"给全文做化学识别"比给摘要做更难,需要专门增强。
  2. 细胞系是 PTC 相对原版新增的第六类,归一化到 Cellosaurus(细胞系权威库)——满足了实验生物学对"这篇论文用了哪个细胞系"的检索需求。
  3. 同一 mention 可能映射到多个概念 ID(歧义),例如 “mTOR” 在不同物种语境下映射到人的 Gene ID 2475 或小鼠的 56717——这是归一化必须处理的核心难题,也是消歧模块存在的理由。
  4. 概念类型有限:解剖实体(细胞组分、细胞类型、组织)等尚未纳入,论文把其列为未来工作。使用者不要假设它能提供解剖学标注。

3.3 注释的数据结构

一个 annotation 被定义为三元组:连续文本片段(span)+ 概念类型(type)+ 登录号(identifier)。落到 FTP 的 tab 分隔文件里,实体文件是五列结构:

列 含义
PMID PubMed 摘要标识
Type 概念类型(gene / disease / chemical / species / mutation / cellline)
Concept ID 对应数据库标识(如 NCBI Gene ID、MeSH ID)
Mentions 对应该 PMID 中出现的生物概念提及文本
Resource 来源资源标记(含人工标注资源如 MeSH、gene2pubmed)

关系文件(3.0)是四列结构:

列 含义
PMID 文献标识
Type 关系类型(Association / Positive_Correlation / Negative_Correlation / Co-treatment / Drug_interaction / Comparison / Conversion / Binding 等)
概念 1 第一个实体(类型 + 标识)
概念 2 第二个实体(类型 + 标识)

"Resource"列的设计值得单独说明:它标记该注释的来源。当 Resource 是 MeSH 或 gene2pubmed 时,表示这条注释并非纯自动挖掘,而是融入了人工策展资源——这使 PTC 的注释带有"自动为主 + 少量人工锚点"的混合属性,对精度敏感的下游任务是有用的信号。

3.4 发布格式与体量

PTC / PubTator3 提供三种格式,各服务不同场景:

格式 用途 结构
PubTator tab 分隔(.gz) 大规模管线、按列解析 每行一条注释,列式;实体 5 列 / 关系 4 列
BioC-XML(tar.gz) 保留文档结构的互通 BioC 社区标准,文档 → passage → annotation 层级
JSON Web/API 交互 结构化对象,便于程序消费

BioC 的作用常被低估:BioC 是一个社区驱动的生物医学文本处理数据格式,PTC 用它作为流水线各步骤间输入/输出的统一载体,保证各组件与外部工具之间的互操作性。使用者若想把 PTC 注释接入自己的 NLP 管线,走 BioC 是最顺滑的路径。

现网实测的 PubTator3 FTP 体量(2026-08-17 文件):

文件 大小 内容
bioconcepts2pubtator3.gz 5.7G 全部实体注释合并
relation2pubtator3.gz 284M BioREx 全部关系
chemical2pubtator3.gz 1.7G 化学
disease2pubtator3.gz 2.0G 疾病
gene2pubtator3.gz 721M 基因
species2pubtator3.gz 466M 物种
mutation2pubtator3.gz 111M 变异
cellline2pubtator3.gz 68M 细胞系
BioCXML.0–9.tar.gz 10 × 20G ≈ 200G 全量 BioC-XML 归档(分 10 卷)

从单体文件大小可反推各概念类型的数据密度:疾病(2.0G)与化学(1.7G)是最大的两类实体——这与生物医学文献中疾病与药物/化合物提及的高频性一致;细胞系(68M)与变异(111M)相对稀疏,反映其提及频率较低。BioC-XML 归档总量约 200GB,是"全量全格式"的完整镜像。

3.5 处理流水线架构

PTC 的服务端流水线(论文 Fig 1)三步走:

新文献(PubMed 摘要 / PMC-TM 全文)
   │
   ▼
[步骤 A] 多概念 tagger 并行识别
   ├── GNormPlus  → 基因/蛋白
   ├── tmVar 2.0  → 遗传变异
   ├── TaggerOne  → 疾病、化学、细胞系
   └── SR4GN      → 物种
   │
   ▼
[步骤 B] 消歧模块(深度学习)
   └── 裁决重叠/冲突注释,保证一致性
   │
   ▼
[步骤 C] 存入 MongoDB 数据库
   │
   ├──→ Web 界面(浏览、检索、可视化)
   └──→ RESTful API(程序化检索)

3.0 把步骤 A 统一为 AIONER(一个模型识别六类实体),步骤 B 之外新增 BioREx 做关系抽取,存储改为 MongoDB + Solr(支持语义检索)。这一架构演进的核心收益是:统一模型简化了维护、关系抽取扩展了信息维度、Solr 支撑了高级检索。

3.6 与服务/语料的边界:PubTator 不是"数据集"而是"活体系统"

最后厘清一个概念边界:PubTator 系列严格说来不是一个静态数据集,而是一个持续运行的标注系统,其"数据集"属性来自 FTP 上的定期快照。这带来三个实际差异:

  1. 没有"版本号"意义上的数据发布:你下载到的是"截至某天的全量注释",而非"v1.2 数据集"。快照日期(如 PubTator3 的 2026-08-17)就是数据的时间戳。
  2. 可复现性依赖快照:若你的研究要可复现,必须锁定并归档你下载的那份 FTP 快照,否则数字会随官方更新而漂移。
  3. API 与 FTP 可能不同步:Web/API 检索的是实时数据库,FTP 是定期快照,两者在更新间隔内可能存在差异——对一致性敏感的任务应以 FTP 快照为准并记录日期。

这一"活体 vs 快照"的张力,正是 PubTator 这类持续服务型资源在 AI-Ready 语境下的特殊性:它的 AI-Ready 得分在"可得性"上近乎满分,但在"版本稳定可复现"上是使用者需自行补足的一环(§6.4 详述)。

3.7 使用前的质量自检清单

由于 PubTator 是自动标注,把它接入任何严肃管线之前,建议按下表逐项自检。这张表也是本条目"理智使用"主张的浓缩:

自检项 要问的问题 处理建议
概念类型覆盖 我要的实体类型在六类里吗? 不在(如解剖实体)→ 另寻资源
文档范围 我要的文献在 PubMed 摘要 / PMC-TM 全文里吗? 非 OA 全文 → 覆盖缺口,勿声称全库
标注质量 我把它当金标准还是弱监督? 当金标准 → 改用人工语料;当弱监督 → 可用并记录噪声
归一化精度 我依赖的数据库 ID 归一是否正确? 抽取样本人工核对;关注同形异义(如 mTOR 跨物种)
关系可用性 我要关系数据吗? 要 → 用 3.0 且限于摘要;要全文关系 → 不可得
版本与时点 我引的数字是哪个版本、哪一天? 记录版本与快照日期,全篇一致
可复现性 我能复现自己的实验吗? 归档下载的 FTP 快照 + 记录 Last modified
许可合规 我的用途有许可风险吗? 公共领域无限制,商业/再分发均可(自判合规)

一句话原则:用 PubTator 的规模与覆盖,用人工语料的精度做严格评测;把它的每条输出都当作"待验证线索"而非"既定事实"。

3.8 与人工金标准语料的关系:互补而非替代

初学者常问:"既然有 PubTator 自动标注,还需要人工语料吗?"答案是两者服务不同阶段,构成互补的两层:

维度 PubTator(自动层) 人工金标准(如 BioRED/BC5CDR)
规模 千万篇级 数百至数万(篇/句)
覆盖 全库(PubMed + PMC-TM) 精选子集
精度 有噪声,非金标准 高(人工双标 + 仲裁)
用途 预标注、弱监督、检索、grounding 严格评测、精度上限测量
更新 持续滚动 一次性或低频

正确的工作流是**“自动层预标注 + 人工层校准”**:用 PubTator 覆盖全库并产出候选,用人工金标准测量真实精度并做误差分析,再用人工标注微调模型。把两层混用(拿自动标注当金标准、或拿小规模金标准去覆盖全库)都会失败。这一"两层互补"的认知,是使用 PubTator 系列资源的前提。

§4 任务定义:NER / NED / RE 三件事说清楚

PubTator Central 支撑的是生物医学 NLP 的三个基础任务。理解这三个任务,才能理解它到底为下游提供了什么,以及为什么它被 BigBIO 等框架登记为标准的 NER + NED 数据集。

4.1 命名实体识别(NER)

定义:从自由文本中找出属于特定概念类型的实体文本片段(span)。例如从"BRCA1 mutations increase breast cancer risk"中识别出 “BRCA1”(基因)与 “breast cancer”(疾病)。

PubTator 的处理方式:六类实体各由专门模型识别。PTC 用 GNormPlus(基因)、tmVar 2.0(变异)、TaggerOne(疾病/化学/细胞系)、SR4GN(物种);3.0 统一为 AIONER 单模型多类型识别。识别结果就是注释里的 span 部分。

质量背景:论文 Table 1 展示了各概念从 2013 原版到 PTC 的性能改进;全文本比摘要更难标注(“content of full text is more complex than abstracts”),因此多个 tagger 为适配全文做了修改或重训。具体的 precision/recall/F1 逐类数值在论文 Supplementary Table S1(本条目存照待核,见 §9)。

4.2 命名实体归一化 / 消歧(NED / NEN)

定义:把识别出的实体文本链接到权威数据库中的唯一标识。例如 "BRCA1""BRCA-1"“breast cancer type 1 susceptibility protein” 都应归一化到同一个 NCBI Gene ID。

PubTator 的处理方式:这是它区别于普通 NER 工具的核心能力——它输出的是登录号,不是词表。六类实体分别归一化到 NCBI Gene / dbSNP / MeSH(疾病与化学)/ NCBI Taxonomy / Cellosaurus。

难点与消歧模块:

  1. 同形异义(一词多实体):如 “mTOR” 在不同物种语境下对应人(Gene ID 2475)或小鼠(56717),必须结合上下文裁决。
  2. 同实体多形(一词多写法):同一基因有官方名、别名、缩写、蛋白名等多种形式,需归一。
  3. 重叠注释冲突:多个 tagger 可能对同一 span 判出不同类型或重叠边界,需要 disambiguation 模块统一。

PTC 的消歧模块基于深度学习,是其相对原版在"准确性"上改进的关键组件。对下游知识图谱构建者而言,归一化的质量直接决定图谱节点的合并正确性——这是 PubTator 最有价值的贡献之一。

4.3 关系抽取(RE,3.0 起)

定义:识别两个实体之间存在何种语义关系。例如 “chemical X reduces expression of gene Y” 中的 chemical-gene 负相关关系。

PubTator 3.0 的处理方式:BioREx 模型抽取 12 类关系,覆盖 8 种实体对:

实体对 说明
chemical–chemical 化合物-化合物(如药物相互作用)
chemical–disease 化学-疾病(如药物诱导的疾病)
chemical–gene 化学-基因(如药物靶点、表达调控)
chemical–variant 化学-变异(如药物反应相关变异)
disease–gene 疾病-基因(如致病基因)
disease–variant 疾病-变异(如致病变异)
gene–gene 基因-基因(如相互作用、共表达)
variant–variant 变异-变异(如连锁、联合效应)

关系类型命名层包括 Association / Positive_Correlation / Negative_Correlation / Co-treatment / Drug_interaction / Comparison / Conversion / Binding 等。这个关系层是 PubTator 3.0 相对 PTC 的最大增量——它把"实体清单"升级为"实体关系图",直接服务于药物重定位(找靶向某基因的化合物)、变异解读(变异-疾病关联)、通路组装(基因-基因网络)等知识发现任务。

已知局限(3.0 自述):关系抽取目前仅覆盖摘要(受算力约束),全文关系抽取是未来工作;只有 12 类关系;实体与关系均为自动抽取,准确率非完美。使用者应把关系层当作"高召回线索"而非"金标准事实"。

4.4 三任务能力对照表

任务 PTC(2019) PubTator 3.0(2024) 下游用途
NER(实体识别) ✅ 六类(多 tagger) ✅ 六类(AIONER 统一) 预标注、检索索引
NED(实体归一化) ✅ 映射数据库 ID ✅ 同(工具换新) 知识图谱节点合并、实体链接
RE(关系抽取) ❌ 无 ✅ 12 类 / 8 实体对(仅摘要) 药物重定位、通路/关联发现

这张表也回答了一个常见疑问:如果你需要关系数据,必须用 3.0;如果你只需要实体标注,PTC 与 3.0 都能满足(3.0 是超集)。

§5 为什么它对医疗 AI 与生物医学 NLP 重要

PubTator 系列在生物医学 AI 生态中的位置,可以用一句话概括:它是"文献知识"通往"机器可用知识"的标准转换器。下面从五个维度说明它的价值。

5.1 作为训练/预标注语料:弱监督的规模优势

现代生物医学 NLP 模型(尤其是 BERT 类与更晚的 LLM)在预训练与微调时都需要大量标注数据。人工标注成本高昂,PubTator 提供的千万篇级、六类实体、带数据库 ID的自动标注,是弱监督/远程监督(distant supervision)的理想素材:

  • 预标注加速人工:用 PubTator 输出作为初筛,人工只在机器标注上做修正,可把标注成本大幅压缩(类似主动学习范式)。
  • 自动标注作训练信号:许多 NER/NED 模型直接以 PubTator 输出作为训练语料(在承认噪声的前提下),因为它规模远超任何人工语料。
  • 覆盖与多样性:2900 万摘要 + 300 万全文的覆盖,使模型见到的实体上下文分布远比小规模金标准丰富。

5.2 作为知识图谱与知识发现的底座

生物医学知识图谱(如疾病-基因-化学网络)的构建,通常需要从文献中抽取实体与关系。PubTator 提供的正是这个流程的原料:

  • 实体节点:六类概念 + 数据库 ID,可直接作为图谱节点骨架。
  • 关系边:3.0 的 12 类关系提供带类型的边,支撑因果/关联推理。
  • 典型应用(论文列举):药物重定位(chemical-gene 检索)、基因优先排序(候选基因文献排序)、基因-表型关联、疾病共病分析、生物策展辅助。

论文明确引用了大量下游用例,从"优先排序候选基因"到"创建基因与变异资源"再到"富化疾病知识图谱"——这些都建立在 PubTator 的实体+关系抽取之上。

5.3 作为 LLM 的 grounding / 检索增强资源

这是 PubTator 3.0 最前沿、也最值得医疗 AI 团队关注的用法。大模型的"幻觉"在生物医学场景尤其危险——一个编造的基因-疾病关联或药物-靶点关系,可能直接误导研究或临床判断。PubTator 3.0 论文给出了一条明确的解决路径:

  • 与 ChatGPT(GPT-4)集成:把 PubTator API 接入 ChatGPT 的回答流程,让模型基于真实文献注释作答,论文报告这显著提升了回答的真实性(factuality)与可验证性(verifiability)。
  • 可验证的溯源:由于每条注释都带 PMID 与数据库 ID,模型的每个断言都能追溯到原文与权威库——这是"可验证 AI"在生物医学领域的具体落地。
  • 检索质量:3.0 的检索在实体对查询下,召回文章数多于 PubMed 与 Google Scholar,且前 20 结果精度更高——这意味着它可作为 RAG(检索增强生成)系统中优于通用检索引擎的知识检索层。

对做医疗大模型 RAG / grounding 的团队,PubTator 提供的不只是数据,而是一套"实体对齐 + 关系预计算 + 可溯源注释"的现成事实层。开源代码 ncbi-nlp/pubtator-gpt 直接把这条集成路径产品化。

5.4 作为生物策展(biocuration)的辅助工具

生物数据库(如基因、变异、疾病资源)的维护依赖人工策展,而策展员面对的是海量文献。PubTator 从设计之初就服务于策展工作流:

  • 文献分诊(triage):自动标注帮策展员快速定位"哪些文章含相关基因/变异"。
  • 预填充:把机器标注作为策展表单的初值,人工只需审核。
  • 历史用例:2013 初版的论文即题为"a web-based text mining tool for assisting biocuration",且有专门的案例研究(用 PubTator 策展 PubMed 摘要中的基因);2019 PTC 论文回顾原系统已服务约 3 亿次 API 请求,用于策展支持等用例。

5.5 作为"基础设施"的稳定性价值

最后一层价值最朴素也最重要:它长期、稳定、免费、无门槛地运行。在生物医学 NLP 领域,工具与语料的生命周期往往很短——论文发表后数据库停更、链接失效是常态。PubTator 从 2013 到 2024 迭代三代,始终由美国政府机构(NCBI/NLM/NIH)维护,且:

  • 许可为公共领域(无使用限制);
  • 提供 Web + API + FTP 三层入口(不依赖单一渠道);
  • 持续更新(每日/每周/每月,视版本与渠道而定)。

这种"制度性稳定 + 零许可阻力 + 多渠道可达"的组合,使它成为众多管线与工具的默认依赖——它是那种"一旦你在生产系统里用了,就几乎不用担心它明天消失或突然要收费"的资源。对于要构建长期运行的医疗 AI 基础设施的团队,这种稳定性本身就是核心竞争力。

5.6 定位的诚实边界

必须同时说清它不是什么,避免误用:

  • 它不是人工金标准:自动标注带噪声,严格评测请用人工语料(BioRED/BC5CDR/NCBI-Disease 等)。
  • 它不覆盖非 OA 全文:PMC 版权限制导致系统性缺口,不适合声称"覆盖全部生物医学文献"的研究。
  • 它的关系层仅限摘要(3.0):需要全文关系的任务不能依赖它。
  • 它不含解剖实体等:概念类型有限,超出六类的需求需另寻资源。

把 PubTator 放在正确的位置——高覆盖、可追溯、零门槛的自动标注底座——才能最大化它的价值。

§6 获取与许可:三层入口 + 公共领域

6.1 三层获取入口总表

入口 地址 适用场景 门槛
Web 界面 https://www.ncbi.nlm.nih.gov/research/pubtator/(PTC)/ .../pubtator3/(3.0) 交互式浏览、检索、构建文档集、可视化注释 无
RESTful API /research/pubtator/api(PTC)/ /research/pubtator3/api(3.0) 程序化访问、集成到管线、3.0 支持语义/关系查询 无
FTP 批量 https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/(现行) 大规模下载全量注释 无

三层入口全部免费、无注册墙、无申请流程——这是它相对库内"请求制/注册墙"型数据集最大的获取优势。

6.2 许可:NCBI Public Domain Notice(逐字存照)

PubTator 数据的许可条款写在 FTP README.txt 开头,原文关键段落如下(英文原文存照):

“This software/database is a ‘United States Government Work’ under the terms of the United States Copyright Act. It was written as part of the author’s official duties as a United States Government employee and thus cannot be copyrighted. This software/database is freely available to the public for use. The National Library of Medicine and the U.S. Government have not placed any restriction on its use or reproduction.”

要点解读:

  1. 性质:美国政府作品(United States Government Work),依美国版权法不受版权保护。
  2. 权利:NLM 与美国政府未对其使用或再复制设置任何限制——可自由使用、修改、再分发。
  3. 第三方归类佐证:bio.tools 将其标为 Unlicense(无许可/公共领域)、Free of charge、Open access;BigBIO/HF 打包版将其标为 license: other(对应 NCBI_LICENSE)——注意 HF 的 “other” 是平台无法归入标准 CC 协议时的兜底标记,不代表"另有更严的许可",实际就是公共领域(坑点 3)。
  4. 免责:README 同时声明 NLM/美国政府不担保数据的准确性与结果(“do not and cannot warrant the performance or results”)——这条免责与"自动标注"属性呼应,是使用者的知情前提。

在库内许可光谱上的位置:这是最宽松等级。对比 Panda-Plus(掩码请求制、论文 CC BY-NC-ND)、各类注册墙数据集,PubTator 的"公共领域 + 无限制"使其在"可再分发、可商用、可修改"上几乎无摩擦。对要构建产品级医疗 AI 管线的团队,这一点极具吸引力。

6.3 实操:怎么下、怎么调

FTP 批量下载(推荐给大规模管线):

# 现行发布点(PubTator3)
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/bioconcepts2pubtator3.gz   # 全部实体注释 5.7G
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/relation2pubtator3.gz     # 全部关系 284M
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/gene2pubtator3.gz         # 按类型分文件

# 解压(tab 分隔)
gunzip bioconcepts2pubtator3.gz
# BioC-XML 归档需 tar 解包(10 卷,各 20G)
tar -zxvf BioCXML.0.tar.gz

要点提醒:

  1. 认准 PubTator3 目录:旧 PubTatorCentral/ 目录已冻结(仅剩 2020-11 的 BioCXML 快照),老教程路径会失效(坑点 5)。
  2. 单文件即可上手:只需全部实体注释时,下 bioconcepts2pubtator3.gz(5.7G)一份即可;需要按类型切分再用 {type}2pubtator3.gz。
  3. BioC-XML 体量极大:全量约 200GB(10×20G),非必要不下——它适合需要文档结构完整性的场景。
  4. 记录快照日期:为可复现性,务必记录你下载时 FTP 上文件的 Last modified 日期(如本轮实测为 2026-08-17),并归档你下载的那份副本。

API 调用(推荐给实时/按需场景):PTC 与 3.0 均提供 RESTful API。3.0 的 API 支持更灵活的查询,论文举例:“what chemicals are known to reduce expression of JAK1?” 这类信息需求可在单次 API 调用中回答——这是语义检索 + 关系预计算带来的能力。

BigBIO 框架加载(推荐给 datasets 生态用户):HF 上的 bigbio/pubtator_central 把 PTC 打包为标准的 NER + NED 数据集:

# 需先 pip install bioc(BigBIO 依赖)
from datasets import load_dataset
ds = load_dataset("bigbio/pubtator_central", name="pubtator_central_bigbio_kb")
# 提供 sample 与 full 两档配置;BigBIO 版本 1.0.0,源版本 2022.01.08

注意:BigBIO 打包版基于 2022 源版本、且引用的旧 FTP 路径(PubTatorCentral/bioconcepts2pubtatorcentral.offset.gz)已冻结——用它做研究时应核对数据新鲜度,需要最新数据请直接走 PubTator3 FTP。

6.4 AI-Ready 评估:可得性满分,稳定性自负

以库内 AI-Ready 检查单过一遍:

  • 机器可读元数据:✅ 论文开放获取 + FTP README(格式/引用/声明齐全)+ API 文档页。
  • 公开直链:✅ FTP HTTP 直链 + RESTful API + Web——三层无障碍,AI-Ready 最大加分项。
  • 许可明确性:✅ 公共领域,无限制——许可层面零歧义、零摩擦。
  • 可复现性:⚠️ 作为活体系统,无静态版本号,数据随官方更新漂移;可复现依赖使用者自行归档快照(§3.6)。这是唯一需要使用者补足的环节。
  • 文档自洽:⚠️ 多口径数字并存(规模、更新频率、注释总量),需按版本与时点对齐(§9 与坑点)。

综合:AI-Ready 等级"高"——三层无门槛获取 + 公共领域许可 + 持续更新,使它在"可得性"维度近乎满分;扣分点不在"能不能拿到",而在"拿到的到底是不是同一份"(版本/快照治理),这属于使用者侧的可复现性责任,而非资源本身的缺陷。

6.5 与库内可获取性光谱的对照

库内数据集已形成可获取性光谱(注册墙 → 请求制 → Zenodo → AWS Registry → 公开直链)。本条目在光谱上的位置:

档位 库内参照 本条目对应
注册墙(最严) 少量需审批的临床数据集 —
请求制 Panda-Plus 掩码(邮件申请) —
平台托管 Zenodo 型 —
Registry 收录 AWS Registry 型 —
公开直链 HF/Zenodo 直链型 ✅ 本条目(Web + API + FTP 三层)

PubTator 的特殊性在于:它不只是"公开直链",而是**“公开直链 + 公共领域许可 + 程序化 API”**三位一体。库内许多"公开直链"数据集仍带 CC BY-NC 等限制或需注册,而 PubTator 在许可与获取上同时到达最宽松端点——这使它在"能否无摩擦进入生产管线"这一实用维度上,是库内最具代表性的样本之一。

§7 PubTator 3.0:从实体到关系,从标注到检索

PubTator 3.0(2024)是 PubTator Central 的直接后继,也是理解 PubTator 系列"去向何方"的关键。本节点作为延伸专节,讲清它的增量。

7.1 三大增量

增量 内容 意义
AIONER 统一 NER 一个模型识别六类实体,取代 PTC 的多 tagger 并置 简化维护、统一框架、性能提升
BioREx 关系抽取 抽取 12 类关系(8 种实体对) 从"实体清单"升级为"实体关系图"
语义/关系检索 界面与 API 支持语义、关系、关键词、布尔查询 从"浏览标注"升级为"按需发现知识"

架构上,3.0 的流水线(论文 Fig 2A):AIONER 识别六类实体 → 专用 mapper 归一化(GNorm2/tmVar3/NLM-Chem/TaggerOne)→ BioREx 抽关系 → 存 MongoDB + Solr 检索。

7.2 规模扩展

维度 PTC(2019) PubTator 3.0(2024)
PubMed 摘要 约 29M 约 36M
PMC 全文 约 3M 约 6M
注释总量 (未单列) 超 10 亿(实体+关系)
关系类型 0 12 类
更新频率(论文口径) daily weekly

规模翻倍(尤其全文从 3M 到 6M)反映了 PMC 开放获取内容的持续增长与系统吞吐的提升。注释总量"超 10 亿"是一个量级标志——它意味着 PubTator 已成为生物医学文献知识规模最大的机器可读表示之一。

7.3 性能评估

3.0 论文用两组基准验证提升:

  • NER(vs PubTator2/PTC,在 BioRED 语料上):论文 Fig 2B 展示六类实体的识别性能对照,3.0 相对 PTC 有改进。
  • RE(vs SemRep 及此前最优系统,在 BioCreative V CDR 语料上):论文 Fig 2C 展示关系抽取显著优于 SemRep 与既往系统。

BioRED 是什么:600 篇 PubMed 摘要的文档级多实体、多关系语料(Luo L 等, 2022, Brief Bioinform 23(5):bbac282),是生物医学 RE 的权威基准;其自身报告 NER F-score 89.3%、新型关系 RE F-score 仅 47.7%——反映关系抽取仍是难题,也解释了为何 3.0 要专门用 BioREx 攻这一环。

7.4 检索质量与 LLM 集成

  • 检索质量:在实体对查询下,PubTator 3.0 检索到的文章数多于 PubMed 与 Google Scholar,且前 20 结果精度更高——这得益于语义检索(用预计算的概念匹配替代关键词匹配,规避术语差异)。
  • LLM grounding:把 ChatGPT(GPT-4)与 PubTator API 集成,显著提升回答的真实性与可验证性;开源代码 ncbi-nlp/pubtator-gpt。这是 PubTator 从"文献工具"跨入"AI 事实层"的标志性一步。

7.5 3.0 的自我设限(诚实边界)

论文明确列出三条局限,条目照录以正视听:

  1. 关系抽取仅限摘要:虽能处理全文实体,但关系目前只在摘要上抽取(算力约束),全文 RE 为未来工作。
  2. 关系类型有限:仅 12 类,虽为常用关系但非全部。
  3. 自动抽取非完美:实体与关系均由机器产出,准确率虽高但非 100%。

这三条与 PTC 的"自动标注非金标准"一脉相承,构成 PubTator 系列一贯的诚实定位。

7.6 源码开放与可复现资产

3.0 的全部组件开源(GitHub ncbi 组织):AIONER、GNorm2、tmVar3、NLM-Chem Tagger、TaggerOne、BioREx、pubtator-gpt;源码与训练模型归档于 Zenodo 10.5281/zenodo.10839631(CC0)。这意味着研究团队不仅能用 PubTator,还能复现其标注管线、按其架构自建领域专用标注系统——这是它作为"方法论公共资产"的价值延伸。

§8 生态:工具链、语料族与下游应用

8.1 NCBI Lu lab 的工具链生态

PubTator 不是孤立工具,它站在一条完整的 NCBI 生物医学 NLP 工具链之上(这条链本身也是理解 PubTator 能力来源的钥匙):

PubTator 系列
   ├── 实体识别层
   │    ├── GNormPlus / GNorm2   (基因/蛋白 + 物种归一化)
   │    ├── tmVar 2.0 / 3.0      (遗传变异 → dbSNP)
   │    ├── TaggerOne            (疾病/细胞系)
   │    ├── SR4GN                (物种,PTC 阶段)
   │    ├── NLM-Chem             (化学 → MeSH,3.0 阶段)
   │    └── AIONER               (3.0 统一 NER)
   ├── 关系抽取层
   │    └── BioREx               (3.0,12 类关系)
   ├── 语料层
   │    ├── BioRED               (关系抽取基准,600 摘要)
   │    ├── BioCreative V CDR    (化学-疾病关系)
   │    ├── CHEMDNER             (化学实体)
   │    └── NCBI-Disease         (疾病实体)
   └── LLM 集成层
        └── pubtator-gpt         (ChatGPT + PubTator API)

这条工具链的共同特征是:论文发表 + 源码开源 + 数据开放 + 持续维护,构成生物医学 NLP 领域罕见的"全栈开放"生态。

8.2 与前身及旁系的关系

  • 上行:2013 PubTator(起源)、2015 加入的 RESTful API(服务化起点)。
  • 下行:PubTator 3.0(关系与检索)。
  • 旁系:SemRep(另一生物医学关系抽取系统,3.0 的对比基线);PubTerm、Thalia 等(同期生物医学文献工具,论文引用的同类)。

8.3 下游应用全景

应用领域 具体用法 依赖的能力
生物策展 文献分诊、预填充策展表单 NER + NED
基因优先排序 定位候选基因的文献证据 NER + NED
基因-表型关联 从文献抽取基因-疾病联系 NER + RE
疾病共病分析 疾病-疾病共现与关联 NER + RE
药物重定位 chemical-gene 关系检索 RE
知识图谱富化 实体节点 + 关系边 NER + NED + RE
变异解读 变异-疾病关联 RE
LLM grounding 检索增强 + 可溯源作答 API + 全链

8.4 生态互链点(库内条目,已核 rid)

PubTator 与库内多条生物医学 NLP 语料形成天然的对照与互补关系:

库内条目 rid 与 PubTator 的关系
BioRED 457 PubTator 3.0 的 NER 评测语料;同为 NCBI Lu lab 出品——最直接互链
BC5CDR 415 PubTator 3.0 关系抽取评测基准(BioCreative V CDR)
CHEMDNER 450 PTC 化学 tagger 重训语料之一
NCBI-Disease 425 疾病 NER 人工金标准,与 PubTator 自动疾病标注互为对照
BC2GM 434 基因 NER 人工金标准对照
MedMentions 390 UMLS 实体链接语料,对应 PubTator 的归一化(NED)任务
CRAFT 529 生物医学概念标注金标准对照
PubMedQA 49 PubMed 问答基准,PubTator 注释可支撑其检索/grounding
S2ORC 370 大规模学术全文语料,与 PMC 全文标注形成"原文 vs 标注层"互补
LitCovid 380 COVID-19 文献库,PubTator 覆盖 PubMed 时的疫情主题子集
CORD-19 104 COVID-19 开放研究语料,同上的疫情切片

互链逻辑一句话:PubTator 是"自动标注层",库内 BioRED/BC5CDR/CHEMDNER/NCBI-Disease/BC2GM/MedMentions/CRAFT 是"人工金标准层",S2ORC/LitCovid/CORD-19 是"原始语料层",PubMedQA 是"下游任务层"——四层合起来构成一个完整的生物医学 NLP 数据生态面。

§9 版本口径与双口径存照

PubTator 的"活体系统"属性决定了它的数字在不同来源、不同版本、不同时点会不一致。这些不一致不是错误,而是版本演进的真实痕迹——但对自动化抽取与严格引用而言,必须逐条对齐。本节把所有冲突集中存照,并给出处理口径。

9.1 口径冲突总表

# 项 口径 A 口径 B 口径 C 处理建议
1 PubMed 摘要数 29M(PTC 2019 论文) ~30M(官方页 docsum) 36M(3.0 2024 论文) 按版本引用:PTC 条目用 29M,3.0 用 36M;官方页 30M 视为四舍五入
2 PMC 全文数 3M(PTC 2019) ~3M(官方页) 6M(3.0 2024) 同上,按版本
3 更新频率 daily(PTC 官方页) weekly(3.0 论文) monthly(PubTator3 FTP README) 三口径按渠道注明;页面=实时视角,论文=描述视角,FTP=批量视角
4 注释总量 over 1 billion(3.0 论文) 1.6B 实体 + 33M 关系(NIH poster 2024) — 论文概数 vs poster 细分;条目以论文"超 10 亿"为主,poster 存照
5 概念类型数 6 类(PTC/3.0 官方) 9 个 type(2020 GitHub 快照) — 6 类是现行口径;9 type 为旧分类残留(含 Genus/Strain/DomainMotif)
6 旧 FTP 状态 老教程引 bioconcepts2pubtatorcentral.gz 实抓仅剩 2020-11 BioCXML 目录 — 旧路径已冻结,现行走 PubTator3 目录(坑点 5)
7 BigBIO 许可标注 HF card: license: other 实际: NCBI 公共领域 — “other” 是平台兜底标记,非更严许可(坑点 3)

9.2 为什么会有这些冲突:三个机制

  1. 版本演进:三代系统覆盖的文献量本就不同(29M → 36M),把不同版本的数字混用必然冲突。对策:所有引用必须带版本标签。
  2. 视角差异:同一时点的同一系统,Web 页面(实时数据库视角)、论文(发表时快照视角)、FTP(批量快照视角)三者的统计口径与更新节奏不同,数字可以同时"都对"。对策:引用时注明来源渠道。
  3. 社区残留:三方工具(GitHub 脚本、BigBIO 打包)冻结在某一历史版本,其数字与路径随时间失效。对策:不盲信二手打包,回到官方 FTP/论文核对。

9.3 引用规范建议

  • 引 PubTator Central 本体:用 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389),规模引 29M + 3M。
  • 引摘要+全文+关系综合能力:用 NAR 2024;52(W1):W540–W546(doi:10.1093/nar/gkae235),规模引 36M + 6M + 超 10 亿注释。
  • 引系统起源:用 NAR 2013;41(Web Server Issue):W518–W523(doi:10.1093/nar/gkt441)。
  • 引数据快照:注明下载日期与 FTP 文件 Last modified(本轮为 2026-08-17)。
  • 勿混引:不要把 3.0 的 36M/6M/10 亿套到 PTC 名下,也不要把 PTC 的 29M/3M 当作当前规模。

9.4 待核遗留疑点

以下数字/信息本轮未逐点抓取,存照待后续核验:

  1. PTC 2019 Table 1 与 Supplementary Table S1 的逐类 precision/recall/F1(PMC 反爬 + OUP Cloudflare 阻挡)。
  2. 3.0 Fig 2B(vs PubTator2 on BioRED)与 Fig 2C(vs SemRep on CDR)的具体数值。
  3. PubTator 3.0 主站实时注释计数器的当前值(NCBI 主站反爬)。
  4. 旧 PubTatorCentral FTP 冻结的确切时间与官方替代公告(未见明确说明)。
  5. PTC 与 3.0 的 URL 并存过渡策略(据两页并存推断,官方未明文)。

§10 避坑清单:八个已识别的坑

坑 1:PubTator / PubTator Central / PubTator 3.0 是三代,不是三个数据集。
它们在文献里会被简称成 “PubTator”“PTC”"PubTator2"“PubTator3”,极易被当作独立资源。正确认知:同一系统的 v1/v2/v3;PTC = 第二代 = PubTator2;3.0 = 第三代。把三者的数字混用是最常见的引用错误。

坑 2:文档规模有三套数字,必须带版本。
29M/3M(PTC 2019)、~30M/~3M(官方页)、36M/6M(3.0 2024)。任何"PubTator 覆盖 X 篇文献"的表述都必须先声明是哪个版本、哪个时点。自动化抽取若不加版本约束,会得到自相矛盾的结果。

坑 3:BigBIO/HF 的 license: other 不是"更严的许可"。
它是 HuggingFace 无法归入标准 CC 协议时的兜底标记,实际对应 NCBI 公共领域(bigbio_license_shortname: NCBI_LICENSE)。看到 “other” 就直接判为"许可不明/受限"会误判——本条目数据实为无限制使用。

坑 4:它是自动标注,不是金标准。
把 PubTator 标注当作人工金标准来评测模型、或直接作为问答的唯一事实源,都会引入系统性误差。NCBI 免责声明明确"不担保准确性"。正确用法:弱监督/预标注/检索线索/grounding 素材;严格评测请用人工语料。

坑 5:旧 FTP 路径已冻结,老教程会失效。
ftp.ncbi.nlm.nih.gov/pub/lu/PubTatorCentral/ 现仅剩 2020-11-06 的 BioCXML 快照,README 404;BigBIO 打包引用的 bioconcepts2pubtatorcentral.offset.gz 亦来自旧路径。现行批量下载统一走 PubTator3/ 目录。按老路径操作会拿到过时数据或扑空。

坑 6:更新频率三口径(daily/weekly/monthly),别当矛盾。
官方页说 daily(实时同步视角)、3.0 论文说 weekly(描述视角)、FTP README 说 monthly(批量快照视角)。三者服务不同场景,都对。规划数据刷新周期时应按你实际使用的渠道(FTP 快照 = monthly)设定预期。

坑 7:全文覆盖有系统性缺口。
“PMC 全文"仅指 PMC Text Mining 子集(OA Subset + Author Manuscript Collection),非 OA 的受版权全文不在内。任何声称"覆盖全部生物医学全文"的用法都会高估覆盖度。论文提到的”~80% 可文本挖掘"是按开放内容的统计口径,不等于"80% 的 PMC 文章"。

坑 8:3.0 的关系抽取仅限摘要。
PubTator 3.0 能对全文做实体标注,但关系抽取目前只在摘要上(算力约束)。需要全文级关系的研究不能依赖它;论文已把全文 RE 列为未来工作。此外 3.0 仅 12 类关系、不含解剖实体,超出范围的需求需另寻资源。

§11 总结

11.1 三句话总结

  1. PubTator Central 是 NCBI 对约 2900 万 PubMed 摘要 + 300 万 PMC 全文做的全自动六类生物概念实体标注(含数据库归一化),2019 年发布,是 2013 原版 PubTator 的全文升级版,2024 年演进为含关系抽取的 PubTator 3.0。
  2. 它的核心价值在三层无门槛获取(Web/API/FTP)+ 公共领域无限制许可 + 持续更新——是库内"可得性"维度近乎满分的代表,也是医学 NLP 与知识图谱的默认语料底座。
  3. 它的正确定位是自动标注/弱监督/grounding 资源,不是人工金标准;用它的规模与覆盖,用人工语料(BioRED/BC5CDR 等)的精度做严格评测。

11.2 适合谁

  • 生物医学 NLP 团队:需要大规模预标注/弱监督语料做 NER/NED/RE。
  • 医疗知识图谱构建者:需要六类实体 + 12 类关系作为图节点与边的原料。
  • 医疗大模型 / RAG 团队:需要可溯源、可验证的事实层做 grounding(3.0 + pubtator-gpt)。
  • 生物策展工作者:需要文献分诊与预填充工具。
  • 数据工程师:需要"公共领域 + API + FTP"零摩擦接入的语料源。

11.3 不适合谁

  • 需要严格金标准评测标签的团队(应改用人工语料)。
  • 需要覆盖非 OA 全文的研究(PMC 版权缺口)。
  • 需要解剖实体等未纳入概念的场景。
  • 需要全文级关系抽取的任务(3.0 RE 仅限摘要)。

11.4 30 秒决策卡

你的情况 行动
要立刻拿一批实体标注 FTP 下 PubTator3/bioconcepts2pubtator3.gz(5.7G,公共领域)
要程序化按需查询 调 pubtator3/api(支持语义/关系查询)
要关系数据 用 3.0 的 relation2pubtator3.gz(284M,仅摘要关系)
要严格评测 NER/RE 模型 用库内 BioRED(457)/BC5CDR(415)/NCBI-Disease(425) 等人工语料,不要用 PubTator 当金标准
要 LLM grounding 参考 ncbi-nlp/pubtator-gpt + 3.0 API
要引用本资源 本体引 gkz389(PTC),关系/检索引 gkae235(3.0),起源引 gkt441

FAQ(高频问答 32 问)

A. 基础认知

Q1:PubTator Central 是数据集还是工具?
两者兼有。它是一个持续运行的自动标注系统(工具/服务),其产出(批量注释)可下载,因而也具备数据集属性。它不对应一次性发布,而是活体资源。

Q2:它和 PubTator 什么关系?
PTC 是 PubTator 的第二代(升级版)。2013 原版只标摘要(5 类概念),2019 的 PTC 扩到全文、加细胞系、加深度学习消歧。文献中 PTC 亦称 PubTator2。

Q3:它和 PubTator 3.0 什么关系?
3.0 是第三代(2024),在 PTC 基础上加关系抽取(12 类)、语义/关系检索、AIONER/BioREx 新算法,规模扩到 36M 摘要 / 6M 全文。

Q4:谁做的、谁在维护?
NCBI / NLM / NIH 的文本挖掘研究组(Lu lab),通讯 PI Zhiyong Lu(陆志勇)。美国政府机构维护,自 2013 年持续至今。

Q5:发表在哪、怎么引?
PTC 引 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389,PMID 31114887);3.0 引 NAR 2024;52(W1):W540–W546(doi:10.1093/nar/gkae235);起源引 NAR 2013;41:W518–W523(doi:10.1093/nar/gkt441)。

Q6:最大的卖点一句话?
把近三千万摘要 + 三百万全文的生物概念,做成了免费、无门槛、可程序化、公共领域的标注服务——医学 NLP 的默认语料底座。

Q7:它自己有什么局限?
自动标注非金标准;全文覆盖仅限 PMC 可文本挖掘子集;3.0 关系仅限摘要;概念类型有限(6 类实体/12 类关系);多口径数字需按版本对齐。

Q8:开源吗?
数据公共领域(无限制);3.0 全部组件源码开源(AIONER/GNorm2/tmVar3/BioREx/pubtator-gpt),归档 Zenodo CC0。

Q9:现在还能用 2019 的 PTC 吗?
能。Web 页 /research/pubtator/ 仍在线;但批量下载应走 PubTator3 目录(旧 PubTatorCentral FTP 已冻结)。

Q10:它是"活的"还是"静态的"?
活的。每日/每周/每月更新(视渠道)。正因如此,引用时须记录时点,复现时须归档快照。

B. 数据与获取

Q11:规模到底多大?
分版本:PTC 29M 摘要 + 3M 全文;官方页 ~30M + ~3M;3.0 36M + 6M;3.0 注释超 10 亿。按你要引的版本选择。

Q12:数据有哪几种格式?
BioC-XML(tar 归档)、JSON、PubTator tab 分隔(.gz)。大规模管线用 tab;要文档结构用 BioC-XML。

Q13:怎么下载全量?
ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/:全部实体 bioconcepts2pubtator3.gz(5.7G),关系 relation2pubtator3.gz(284M),BioC-XML BioCXML.0-9.tar.gz(10×20G)。

Q14:有 API 吗?
有。/research/pubtator/api(PTC)与 /research/pubtator3/api(3.0)。3.0 支持语义/关系/布尔查询。

Q15:HF 上能加载吗?
能,bigbio/pubtator_central(BigBIO 框架,需 pip install bioc)。但注意其基于 2022 源版本、引用旧 FTP 路径,数据新鲜度需自查。

Q16:能商用吗?
许可层面:可以。公共领域,NLM/美国政府未设使用与再复制限制。具体产品合规仍需使用者自判,但数据本身无许可阻力。

Q17:旧 PTC 的批量文件去哪了?
旧 PubTatorCentral/ 目录现仅剩 2020-11 的 BioCXML 快照,README 404。历史文件已由 PubTator3 目录取代。

Q18:怎么保证可复现?
下载时记录 FTP 文件 Last modified 日期(本轮 2026-08-17),归档你下载的那份副本,并在论文中声明快照时点。

C. 任务与质量

Q19:它做哪些任务?
NER(实体识别)+ NED(归一化到数据库 ID)+(3.0)RE(关系抽取)。BigBIO 登记为 NER + NED。

Q20:六类实体是什么、归一化到哪?
基因→NCBI Gene;变异→dbSNP;疾病→MeSH;化学→MeSH;物种→NCBI Taxonomy;细胞系→Cellosaurus。

Q21:它是人工标注的吗?
不是,全自动。多模型并行 + 深度学习消歧。故 NCBI 声明不担保准确性。

Q22:能当金标准用吗?
不能。它是弱监督/自动标注资源。严格评测请用 BioRED/BC5CDR/NCBI-Disease 等人工语料。

Q23:同一实体有多种写法怎么办?
这正是归一化(NED)解决的问题——不同写法映射到同一数据库 ID。反之同形异义(如 mTOR 人/鼠)由消歧模块按上下文裁决。

Q24:3.0 的关系有哪些?
12 类,覆盖 8 种实体对(chem-chem/chem-disease/chem-gene/chem-variant/disease-gene/disease-variant/gene-gene/variant-variant)。

Q25:关系能覆盖全文吗?
不能。3.0 关系抽取仅限摘要(算力约束),全文 RE 是未来工作。

D. 生态与应用

Q26:谁在用、用来干什么?
生物策展、基因优先排序、基因-表型关联、疾病共病、药物重定位、知识图谱富化、变异解读、LLM grounding。

Q27:和 ChatGPT 怎么结合?
把 PubTator API 接入 ChatGPT(GPT-4),让回答基于真实文献注释,显著提升真实性与可验证性;开源代码 ncbi-nlp/pubtator-gpt。

Q28:检索比 PubMed/Google Scholar 好吗?
3.0 论文报告:实体对查询下,PubTator 3.0 检索文章数更多、前 20 结果精度更高(语义检索优势)。

Q29:和 BioRED 什么关系?
BioRED 是 3.0 评测 NER 的人工语料(同为 NCBI Lu lab);也独立是生物医学 RE 基准(NER F1 89.3%,新型关系 RE F1 仅 47.7%)。

Q30:库内还有哪些相关条目?
BioRED(457)、BC5CDR(415)、CHEMDNER(450)、NCBI-Disease(425)、BC2GM(434)、MedMentions(390)、CRAFT(529)、PubMedQA(49)、S2ORC(370)、LitCovid(380)、CORD-19(104)。

Q31:本条目为什么叫 pubtator-central 而不是 pubtator3?
以官方在线实体名立条(NCBI 官方页至今主名仍为 PubTator Central),并以 PTC 为谱系支点;3.0 作为直接后继以专节(§7)收录。

Q32:只记住一件事的话?
PubTator Central = NCBI 的全自动生物医学文献实体标注公共服务,公共领域、三层可达、持续更新——是医学 AI 最省事的语料与 grounding 起点,但它是自动标注,不是金标准。


事实清单(硬事实 40 条)

  1. PubTator Central(PTC)是 NCBI 对 PubMed 摘要 + PMC 全文做全自动生物概念标注的服务/语料。
  2. 组织:NCBI / NLM / NIH(Bethesda, MD, USA);通讯作者 Zhiyong Lu(zhiyong.lu@nih.gov)。
  3. 三代谱系:PubTator(2013) → PubTator Central/PTC(2019, 亦称 PubTator2) → PubTator 3.0(2024)。
  4. 2013 论文:NAR 41(Web Server Issue):W518–W523,doi:10.1093/nar/gkt441,PMID 23703206,Europe PMC 引用 368。
  5. 2019 PTC 论文:NAR 47(W1):W587–W593,doi:10.1093/nar/gkz389,PMID 31114887,Europe PMC 引用 279。
  6. PTC 论文作者:Chih-Hsuan Wei*, Alexis Allot*, Robert Leaman, Zhiyong Lu(*共同一作)。
  7. PTC 论文时间:Received 2019-02-17 / Accepted 2019-04-30 / Published 2019-05-22 / Issue 2019-07-02。
  8. 2024 论文:NAR 52(W1):W540–W546,doi:10.1093/nar/gkae235,PMID 38572754,Europe PMC 引用 139。
  9. 3.0 论文作者:Wei CH, Allot A, Lai PT, Leaman R, Tian S, Luo L, Jin Q, Wang Z, Chen Q, Lu Z。
  10. PTC 规模:约 2900 万 PubMed 摘要 + 约 300 万 PMC 全文(PMC-TM 子集)。
  11. 官方页当前口径:~30M 摘要 + ~3M 全文。
  12. 3.0 规模:约 3600 万摘要 + 600 万全文;注释总量超 10 亿;12 类关系。
  13. 全文长度约为摘要的 40 倍;全文标注使总量扩大近四倍。
  14. 六类实体:基因/蛋白、遗传变异、疾病、化学物质、物种、细胞系。
  15. 归一化目标:NCBI Gene / dbSNP / MeSH / NCBI Taxonomy / Cellosaurus。
  16. PTC 工具:GNormPlus(基因)、tmVar 2.0(变异)、TaggerOne(疾病/化学/细胞系)、SR4GN(物种)。
  17. 3.0 工具:AIONER(统一 NER)、GNorm2、tmVar3、NLM-Chem、TaggerOne、BioREx(RE)。
  18. PTC 处理流水线:多 tagger 并行 → 深度学习消歧 → 存 MongoDB(Fig 1)。
  19. 3.0 处理流水线:AIONER → 专用 mapper → BioREx → MongoDB + Solr(Fig 2A)。
  20. 注释结构:span + 概念类型 + 登录号;实体文件 5 列(PMID/Type/Concept ID/Mentions/Resource)。
  21. 关系文件 4 列(PMID/Type/概念1/概念2)。
  22. 发布格式:BioC-XML / JSON / PubTator tab 分隔(.gz)。
  23. 许可:NCBI Public Domain Notice——United States Government Work,无使用与再复制限制。
  24. bio.tools 标为 Unlicense / Free of charge / Open access。
  25. PTC 更新:官方页 daily;3.0 论文 weekly;PubTator3 FTP README monthly。
  26. 原 PubTator 累计服务约 3 亿次 API 请求(2019 口径)。
  27. 3.0 关系 8 种实体对:chem-chem / chem-disease / chem-gene / chem-variant / disease-gene / disease-variant / gene-gene / variant-variant。
  28. 3.0 关系类型命名层含 Association / Positive_Correlation / Negative_Correlation / Co-treatment / Drug_interaction / Comparison / Conversion / Binding。
  29. 3.0 自述局限:关系仅限摘要、仅 12 类、自动抽取非完美。
  30. 3.0 检索:实体对查询下召回多于 PubMed/Google Scholar,前 20 精度更高。
  31. 3.0 集成 ChatGPT(GPT-4) 显著提升回答真实性与可验证性;代码 ncbi-nlp/pubtator-gpt。
  32. 3.0 源码归档 Zenodo 10.5281/zenodo.10839631(CC0)。
  33. PubTator3 FTP 实测(2026-08-17):bioconcepts2pubtator3.gz 5.7G;relation2pubtator3.gz 284M;BioCXML.0-9.tar.gz 10×20G(~200G);README.txt 6.9K(2023-09-09)。
  34. 各类型文件大小:chemical 1.7G / disease 2.0G / gene 721M / species 466M / mutation 111M / cellline 68M。
  35. 旧 PubTatorCentral FTP 现仅剩 PubTatorCentral_BioCXML/ 子目录(2020-11-06),README 404。
  36. NIH Research Festival 2024 poster 口径:1.6 billion entity + 33 million relation annotations。
  37. 第三方 2020 GitHub 快照:pmid 23,148,838;Disease 96.98M > Chemical 89.11M > Gene 50.09M > Species 36.15M > Mutation 2.75M > CellLine 1.94M 注释。
  38. BioRED(3.0 的 NER 评测语料):600 摘要,Brief Bioinform 2022;23(5):bbac282;NER F1 89.3%,新型关系 RE F1 47.7%。
  39. BigBIO/HF 打包 bigbio/pubtator_central:源版本 2022.01.08,BigBIO 版本 1.0.0,license: other(=NCBI_LICENSE),任务 NER+NED。
  40. 库内互链 rid:BioRED(457)、BC5CDR(415)、CHEMDNER(450)、NCBI-Disease(425)、BC2GM(434)、MedMentions(390)、CRAFT(529)、PubMedQA(49)、S2ORC(370)、LitCovid(380)、CORD-19(104)。

术语表(30 条)

术语 释义
PubTator NCBI 生物医学文献自动标注系统系列的统称
PubTator Central(PTC) 第二代,2019 发布,扩到全文,亦称 PubTator2
PubTator 3.0 第三代,2024 发布,加关系抽取与语义检索
NER Named Entity Recognition,命名实体识别——从文本找出实体 span
NED / NEN Named Entity Disambiguation/Normalization,实体消歧/归一化——链接到数据库标识
RE Relation Extraction,关系抽取——识别实体间的语义关系
Bioconcept 生物概念(基因/疾病/化学等)
Mention 文本中对某实体的提及片段
Span 连续文本片段,注释的定位范围
Concept ID 概念在权威库中的登录号(如 NCBI Gene ID、MeSH ID)
PMID PubMed 文献唯一标识
PMC PubMed Central,生物医学全文数据库
PMC-TM PMC Text Mining 子集(可文本挖掘的 OA 与作者手稿)
OA Subset PMC Open Access Subset,开放获取子集
GNormPlus / GNorm2 基因/物种识别与归一化工具(NCBI)
tmVar / tmVar 2.0 / 3.0 遗传变异识别与归一化工具(映射 dbSNP)
TaggerOne 疾病/细胞系识别与归一化工具(NCBI)
SR4GN 物种识别工具(PTC 阶段使用)
NLM-Chem 化学实体识别工具(3.0 阶段使用)
AIONER 3.0 的统一多类型 NER 深度学习模型
BioREx 3.0 的关系抽取系统
BioC 生物医学文本处理社区数据格式(互操作载体)
BioC-XML BioC 格式的 XML 表示
MeSH Medical Subject Headings,医学主题词表(疾病/化学归一化目标)
Cellosaurus 细胞系权威数据库(细胞系归一化目标)
NCBI Taxonomy NCBI 物种分类数据库
dbSNP NCBI 单核苷酸多态性数据库(变异归一化目标)
Disambiguation 消歧——裁决重叠/冲突标注
Weak supervision 弱监督——用自动/远程标注替代人工标注
Grounding 接地/事实锚定——让 LLM 输出基于可验证的真实来源
RAG Retrieval-Augmented Generation,检索增强生成
BioRED 生物医学关系抽取人工基准语料(600 摘要,NCBI)
BC5CDR BioCreative V 化学-疾病关系语料
CHEMDNER 化学实体识别语料(BioCreative)
Public Domain 公共领域——不受版权保护,可自由使用

附录

附录 A:条目信息速查卡

项 值
条目名 PubTator Central
url_name pubtator-central
类型 生物医学文献自动实体/关系标注语料与在线服务(活体系统)
本条目论文 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389)
团队 NCBI / NLM / NIH(Lu lab,通讯 Zhiyong Lu)
规模(PTC) 约 29M 摘要 + 3M 全文
许可 NCBI 公共领域(无使用与再复制限制)
获取 Web + RESTful API + FTP(ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/)
抓取时点 2026-09-30
库内互链 biored(457)/bc5cdr(415)/chemdner(450)/ncbi-disease(425)/bc2gm(434)/medmentions(390)/craft(529)/pubmedqa(49)/s2orc(370)/litcovid(380)/cord-19(104)

附录 B:DAIMS 评估全表

维度 评分(1-10) 依据
D 可发现性 9 三代论文 OA + 官方页 + bio.tools + FTP 目录可索引;但版本多、名称近易混淆
A 可获取性 10 Web + API + FTP 三层无门槛、无注册、公共领域——本条目最强项
I 可互操作 9 BioC-XML/JSON/tab 多格式 + 标准数据库 ID(Gene/MeSH/dbSNP/Taxonomy/Cellosaurus);有 BigBIO 包装
M 元数据质量 7 README/论文表格完备;但多口径数字(规模/频率/总量)需按版本对齐,无统一版本号
S 可持续性 9 NCBI/NIH 政府机构长期维护,2013 至今持续更新;风险主要是自动标注随算法版本漂移
综合评级 8.8/10(高) 可得性与许可近乎满分;扣分在版本治理(活体系统的可复现性依赖使用者归档)

附录 C:逐项证据链自证

关键数字 来源 位置
29M 摘要 / 3M 全文 NAR 2019 摘要 + 正文 Europe PMC / PMC6602571
六类实体 + 工具名 NAR 2019 正文 PMC6602571
40 倍长度 / 4 倍标注 NAR 2019 正文 PMC6602571
~30M / ~3M 官方页口径 NCBI 官方 docsum 页 ncbi.nlm.nih.gov/research/pubtator/
36M / 6M / 超 10 亿 / 12 关系 NAR 2024 摘要 Europe PMC(DOI:10.1093/nar/gkae235)
8 种实体对 / AIONER / BioREx Zenodo 10839631 描述 beta.explore.openaire.eu
1.6B + 33M 注释 NIH Research Festival 2024 poster researchfestival.nih.gov
FTP 文件清单与大小 实抓 ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/(2026-09-30)
公共领域声明 FTP README.txt 原文 ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/README.txt
Unlicense bio.tools 条目 bio.tools/PubTator_Central
BioRED 数字 Brief Bioinform 2022;23(5):bbac282 PubMed 35849818 / OUP
BigBIO 打包 HF card + pubtator_central.py huggingface.co/datasets/bigbio/pubtator_central
旧 FTP 冻结 实抓目录 ftp.ncbi.nlm.nih.gov/pub/lu/PubTatorCentral/(仅 2020-11 BioCXML)

附录 D:数据获取决策树

需求是什么?
├── 要立刻拿一批实体标注
│   └── FTP PubTator3/bioconcepts2pubtator3.gz(5.7G,公共领域,直接下)
├── 要程序化按需查询
│   └── 调 pubtator3/api(支持语义/关系/布尔查询)
├── 要关系数据
│   └── FTP PubTator3/relation2pubtator3.gz(284M,仅摘要关系)
├── 要文档结构完整的标注
│   └── FTP PubTator3/BioCXML.0-9.tar.gz(10×20G,~200G)
├── 要严格评测 NER/RE 模型
│   └── 用库内人工语料 BioRED(457)/BC5CDR(415)/NCBI-Disease(425),勿用 PubTator 当金标准
├── 要 LLM grounding
│   └── pubtator3/api + 参考 ncbi-nlp/pubtator-gpt
└── 要引用本资源
    └── 本体 gkz389 / 关系检索 gkae235 / 起源 gkt441

附录 E:六类实体与下游用法

实体类型 归一化目标 典型下游用法
基因/蛋白 NCBI Gene 基因优先排序、靶点识别
遗传变异 dbSNP 变异解读、精准医学
疾病 MeSH 疾病共病、基因-表型关联
化学物质 MeSH 药物重定位、药物相互作用
物种 NCBI Taxonomy 模式生物筛选、物种特异性分析
细胞系 Cellosaurus 实验可复现性、细胞模型检索

附录 F:PubTator 数据处理骨架(代码)

# 示例:解析 PubTator tab 分隔实体文件
# 实体文件 5 列:PMID  Type  Concept_ID  Mentions  Resource
def parse_pubtator_entities(path):
    """逐行解析 PubTator tab 实体文件(gz 可先 gunzip)。"""
    records = {}
    with open(path, encoding="utf-8") as f:
        for line in f:
            cols = line.rstrip("\n").split("\t")
            if len(cols) < 5:
                continue
            pmid, ctype, cid, mentions, resource = cols[:5]
            records.setdefault(pmid, []).append({
                "type": ctype,            # gene/disease/chemical/species/mutation/cellline
                "concept_id": cid,        # NCBI Gene / MeSH / dbSNP / Taxonomy / Cellosaurus
                "mentions": mentions.split("|"),
                "resource": resource,     # 来源资源(如 MeSH、gene2pubmed)
            })
    return records

# 注意:BioC-XML 格式需用 bioc 库解析;API 交互建议走 pubtator3/api

附录 G:关系类型与实体对对照

实体对 关系语义示例
chemical–chemical 药物-药物相互作用
chemical–disease 化学诱导疾病 / 治疗
chemical–gene 药物靶点 / 表达调控
chemical–variant 药物反应相关变异
disease–gene 致病基因 / 关联
disease–variant 致病变异
gene–gene 相互作用 / 共表达
variant–variant 连锁 / 联合效应

附录 H:三代版本引用规范

引用目的 推荐文献 DOI
引 PTC 本体与全文升级 NAR 2019;47(W1):W587–W593 10.1093/nar/gkz389
引关系抽取与语义检索 NAR 2024;52(W1):W540–W546 10.1093/nar/gkae235
引系统起源 NAR 2013;41(Web Server Issue):W518–W523 10.1093/nar/gkt441
引数据快照 注明 FTP Last modified 日期 —

附录 I:口径冲突登记表(与 §9 对照)

# 项 口径 A 口径 B 口径 C 处理
1 摘要数 29M(PTC) ~30M(页) 36M(3.0) 按版本
2 全文数 3M(PTC) ~3M(页) 6M(3.0) 按版本
3 更新频率 daily(页) weekly(论文) monthly(FTP) 按渠道
4 注释总量 >1B(论文) 1.6B+33M(poster) — 论文为主
5 概念类型 6 类(现行) 9 type(2020 快照) — 6 类为准
6 旧 FTP 老教程路径 实抓已冻结 — 走 PubTator3
7 HF 许可 other 实为公共领域 — other=兜底

附录 J:与其他 NLP 语料的定位对照

语料 性质 规模 用途定位
PubTator Central 自动标注 千万篇级 弱监督/预标注/grounding
BioRED 人工金标准 600 摘要 RE/NER 严格评测
BC5CDR 人工金标准 1,500 篇 化学-疾病关系评测
NCBI-Disease 人工金标准 793 摘要 疾病 NER 评测
BC2GM 人工金标准 20,000 句 基因 NER 评测
MedMentions 人工金标准 4,392 摘要 实体链接(NED)评测
S2ORC 原始语料 千万篇级 全文检索/预训练

附录 K:检索路径示范

目标 推荐查询式 预期命中
PTC 论文 “PubTator central” AND “full text” NAR 47(W1):W587
3.0 论文 “PubTator 3.0” AND “relation” NAR 52(W1):W540
官方数据 NCBI PubTator official site ncbi.nlm.nih.gov/research/pubtator/
批量数据 PubTator3 FTP ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/
许可条款 PubTator3 README public domain ftp README.txt
下游用例 PubTator biocuration / gene prioritization 引用 PTC 的论文

附录 L:缩写速查

缩写 全称
PTC PubTator Central
NCBI National Center for Biotechnology Information
NLM National Library of Medicine
NIH National Institutes of Health
NER Named Entity Recognition
NED/NEN Named Entity Disambiguation/Normalization
RE Relation Extraction
PMC PubMed Central
PMC-TM PMC Text Mining subset
OA Open Access
MeSH Medical Subject Headings
BioC Biomedical text processing community format
DAIMS Discoverability/Accessibility/Interoperability/Metadata/Sustainability
RAG Retrieval-Augmented Generation
GPT Generative Pre-trained Transformer

附录 M:FAIR/AI-Ready 检查单

检查项 状态 说明
F1 全局唯一标识 ✅ DOI(三代论文)+ PMID + FTP URL
F2 富元数据 ✅ 论文表格 + FTP README + API 文档
A1 可访问协议 ✅ Web + API + FTP,全部无门槛
A2 元数据可访问 ✅ 论文 OA + README 公开
I1 互操作格式 ✅ BioC-XML / JSON / tab + 标准库 ID
I2 词汇表引用 ✅ MeSH / NCBI Gene / dbSNP / Cellosaurus 等标准词表
R1 来源溯源 ✅ 注释带 PMID + Resource 来源标记
R3 可复现流程 ⚠️ 活体系统无版本号,需使用者归档快照
AI-Ready 综合 高 可得性与许可满分;可复现性依赖快照管理

附录 N:本地快照与归档建议(代码骨架)

# 1) 记录下载时点与文件清单(可复现性关键)
curl -sL https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/ > snapshot_listing_$(date +%Y%m%d).html

# 2) 下载所需文件
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/bioconcepts2pubtator3.gz
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/relation2pubtator3.gz

# 3) 校验并归档(保留原始压缩包 + 时点记录)
md5sum bioconcepts2pubtator3.gz relation2pubtator3.gz > checksums_$(date +%Y%m%d).txt

附录 O:本条目生产档案

  • 生产通道:教训 12 存在性核验(三轮精确搜索 + NCBI/Europe PMC/bio.tools/FTP 实抓,均证实)
  • 事实研究:WebSearch×6 + WebFetch + Europe PMC API×4 + FTP 实抓×3(PubTator3/PubTatorCentral/README)
  • FACTS.md:writing/pubtator-central/FACTS.md 九节
  • 成稿方式:五块直写拼接(part1-5),每 part 尾留空行,cat 连接
  • 坑点:§10 八则(坑 1-8"坑 N:"编号制)
  • description:成稿时即 ≤170 字符(140 字符)
  • title:带站点后缀 | 千方病案医数集(91 字符)
  • 互链计划:新篇正文内链 11 处(BioRED/BC5CDR/CHEMDNER/NCBI-Disease/BC2GM/MedMentions/CRAFT/PubMedQA/S2ORC/LitCovid/CORD-19)

附录 P:维护计划与触发点

触发点 条件 动作 优先级
新版本发布 PubTator 4.0 / 重大算法更新 更新版本谱系与规模 1
主站数字更新 官方页/API 计数显著变化 更新规模口径与时点 2
旧 FTP 恢复/迁移 PubTatorCentral 目录状态变化 更新获取路径 3
关系统计更新 3.0 关系抽取扩展到全文 更新 §7.5 局限 4
库内新互链 新增相关 NLP 语料条目 补互链 5

附录 Q:引文规范

@article{wei2019pubtatorcentral,
  title   = {PubTator central: automated concept annotation for biomedical
             full text articles},
  author  = {Wei, Chih-Hsuan and Allot, Alexis and Leaman, Robert and Lu, Zhiyong},
  journal = {Nucleic Acids Research},
  volume  = {47},
  number  = {W1},
  pages   = {W587--W593},
  year    = {2019},
  doi     = {10.1093/nar/gkz389}
}

@article{wei2024pubtator3,
  title   = {PubTator 3.0: an AI-powered literature resource for unlocking
             biomedical knowledge},
  author  = {Wei, Chih-Hsuan and Allot, Alexis and Lai, Po-Ting and Leaman, Robert
             and Tian, Shubo and Luo, Ling and Jin, Qiao and Wang, Zhizheng
             and Chen, Qingyu and Lu, Zhiyong},
  journal = {Nucleic Acids Research},
  volume  = {52},
  number  = {W1},
  pages   = {W540--W546},
  year    = {2024},
  doi     = {10.1093/nar/gkae235}
}

@article{wei2013pubtator,
  title   = {PubTator: a web-based text mining tool for assisting biocuration},
  author  = {Wei, Chih-Hsuan and Kao, Hung-Yu and Lu, Zhiyong},
  journal = {Nucleic Acids Research},
  volume  = {41},
  number  = {Web Server issue},
  pages   = {W518--W523},
  year    = {2013},
  doi     = {10.1093/nar/gkt441}
}

尾注

本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 NAR 2019(PTC 本体)、NAR 2024(PubTator 3.0)、NAR 2013(起源)、NCBI 官方页、PubTator3 FTP README 与实抓、bio.tools 条目为源;多口径数字(文档规模 29M/30M/36M、更新频率 daily/weekly/monthly、注释总量 1B/1.6B)已在 §9 与附录 I 逐条存照,引用前须按版本与时点对齐。条目与库内 BioRED(rid 457)、BC5CDR(rid 415)、CHEMDNER(rid 450)、NCBI-Disease(rid 425)、BC2GM(rid 434)、MedMentions(rid 390)、CRAFT(rid 529)、PubMedQA(rid 49)、S2ORC(rid 370)、LitCovid(rid 380)、CORD-19(rid 104)等条目互链,构成生物医学 NLP 语料与知识图谱家族的完整检索面。后续维护触发点见附录 P。


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • biored — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 关系抽取 / 知识图谱
  • craft — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 知识图谱 / 评测基准
  • genia — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 关系抽取 / 评测基准
  • medmentions — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 知识图谱
  • bc5cdr — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 关系抽取
  • chemprot — 共享标签:医疗NLP / 生物医学文献 / 关系抽取
  • s2orc — 共享标签:医疗NLP / 生物医学文献 / 知识图谱
  • cometa — 共享标签:医疗NLP / 命名实体识别 / 知识图谱
  • ncbi-disease — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别
  • jnlpba — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集