信息速览
INFOBOX — PubTator Central 一屏速览
维度 内容 本质 NCBI 对 PubMed 摘要 + PMC 全文的全自动生物概念实体与关系标注语料/服务(非人工金标准、非挑战赛) 机构 NCBI / NLM / NIH(Bethesda, MD, USA),通讯 PI Zhiyong Lu(陆志勇) 本条目论文 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389;PMID 31114887) 版本链 PubTator(2013) → PubTator Central / PTC(2019, 亦称 PubTator2) → PubTator 3.0(2024) 规模(PTC 2019) 约 2900 万 PubMed 摘要 + 约 300 万 PMC 全文(PMC-TM 子集) 规模(3.0 2024) 约 3600 万摘要 + 600 万全文;超 10 亿实体+关系注释;12 类关系 六类实体 基因/蛋白、遗传变异、疾病、化学物质、物种、细胞系(归一化到 NCBI Gene / dbSNP / MeSH / NCBI Taxonomy / Cellosaurus) 获取 Web 界面 + RESTful API + FTP 批量三层;FTP ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/(全量 ~200G+)格式 BioC-XML / JSON / tab 分隔(.gz) 许可 NCBI Public Domain Notice——美国政府作品,无使用与再复制限制(库内最宽松等级) 更新 PTC 官方页 daily / 3.0 论文 weekly / FTP README monthly(三口径并存) 任务 NER + NED(实体识别与归一化)+ RE(关系抽取,3.0 起) 库内互链 BioRED(457)、BC5CDR(415)、CHEMDNER(450)、NCBI-Disease(425)、BC2GM(434)、MedMentions(390)、CRAFT(529)、PubMedQA(49)、S2ORC(370)
PubTator Central(缩写 PTC)是生物医学文本挖掘领域最被广泛依赖的"基础设施级"资源之一:它不生产新知识,而是把 PubMed 里近三千万条摘要与 PMC 里三百万篇全文,用最先进的机器标注系统逐篇"贴上"基因、变异、疾病、化学物质、物种、细胞系六类生物概念标签,并把这些标签连同数据库登录号一起,以 Web / API / FTP 三种方式完全免费、无限制地开放给全世界。对任何做医学 NLP、临床知识图谱、或医疗大模型 grounding 的团队来说,它几乎是一个"默认起点"——你不需要自己从零构建实体识别管线,直接下载或调用即可。2019 年它把 PubTator 从"只有摘要"升级到"含全文",2024 年又演进为 PubTator 3.0,加入了关系抽取与语义检索。理解这个条目,本质上是在理解当代生物医学 AI 的语料底座是怎么被生产、组织和分发的。
导语读法三则:
- 只想拿数据:直奔 §6 获取与许可——记住"三层发布 + 公共领域无限制"这两个关键词,别在申请流程上浪费时间(它没有申请流程)。
- 关心版本关系:直奔 §2 与 §7——PubTator / PubTator Central / PubTator 3.0 是同一系统的三代,数字口径极易混用,读前先定版本。
- 做医疗 AI grounding:直奔 §5 与 §8——六类实体 + 12 类关系 + 与 ChatGPT 集成的验证,是它作为"事实锚点库"的直接证据。
§0 导读:这个数据集解决什么问题
生物医学文献的规模早已超出任何人力的处理范围。仅 PubMed 就收录了三千多万条摘要,PMC 的开放获取全文也在以每年数十万篇的速度增长;一篇临床研究里散落着基因名、变异位号、疾病术语、药物化学名、模式生物物种、实验细胞系——这些信息对药物重定位、基因优先排序、罕见病变异解读、知识图谱构建都至关重要,但它们以自由文本形式存在,机器无法直接消费。人工策展(biocuration)可以产出高质量标注,但速度远远追不上文献增长;这就是**自动文本挖掘(text mining)**登场的场景。
PubTator Central 的回答是把自动标注做成一项持续运行、全库覆盖、免费开放的公共服务,分三层。第一层是覆盖:它不止标注摘要,还把标注扩展到 PMC 的全文——全文信息量约为摘要的 40 倍,标注总量因此扩大近四倍,这是 PTC 相对 2013 原版最核心的升级。第二层是质量:它不再只用单一规则模型,而是并行部署多个专用 tagger(基因用 GNormPlus、变异用 tmVar、疾病与化学用 TaggerOne、物种用 SR4GN),再用基于深度学习的消歧模块裁决重叠与冲突标注。第三层是可达性:Web 界面给人看,RESTful API 给程序用,FTP 批量给大规模管线用,三种入口全免费、无门槛、无注册墙。
与此同时,必须诚实地给它标注定位:它是自动标注,不是人工金标准。NCBI 的免责声明白纸黑字写着不担保准确性。这决定了它的正确用法——它是"预标注 / 弱标注 / 检索索引 / grounding 素材"的最佳选择,而当你需要严格评测 NER/RE 模型的精度时,你应该用它去对照人工金标准语料(如 BioRED、BC5CDR、NCBI-Disease)。理解 PubTator Central 的价值,一半在于它提供了什么,另一半在于它明确不承诺什么。
§0 读法三则:
- 这个条目是"语料 + 服务 + 工具链 + 版本谱系"四合一:数据是注释结果,服务是 Web/API/FTP,工具链是 GNormPlus/tmVar/TaggerOne/AIONER/BioREx 等,(三代)版本谱系是理解一切数字口径的前提。
- 全文所有数字都标注了版本口径(PTC 2019 / 官方页 / 3.0 2024 / FTP 实测),因为同一个量在不同来源差异巨大——文档规模 29M/30M/36M、更新频率 daily/weekly/monthly 都是实例(§9 与坑点存照)。
- 检索时若把 “PubTator Central” 和 “PubTator 3.0” 当成两个独立数据集分别搜索,会得到大量交叉引用——它们是同一系统的前后版本,官方页至今仍在
/research/pubtator/(PTC)与/research/pubtator3/(现行)两处并存。
§1 数据集速览:十问十答
Q1:PubTator Central 到底是什么?是数据集还是网站?
两者都是。它是 NCBI 提供的一项持续运行的自动标注服务,同时产出可批量下载的标注语料。你可以把它理解为一个"文献标注工厂":工厂本身(Web + API)实时可查,工厂的产出(FTP 全量注释)可整体打包下载。它不对应某一次性的数据发布,而是每日/每周滚动的活体资源。
Q2:它标注什么内容?
六类生物概念实体:基因/蛋白(genes/proteins)、遗传变异(genetic variants)、疾病(diseases)、化学物质(chemicals)、物种(species)、细胞系(cell lines)。每条注释 = 一段连续文本 + 一个概念类型 + 一个数据库登录号(例如基因映射到 NCBI Gene ID、疾病与化学映射到 MeSH、变异映射到 dbSNP、物种映射到 NCBI Taxonomy、细胞系映射到 Cellosaurus)。2024 年的 PubTator 3.0 又增加了 12 类实体间关系。
Q3:数据规模有多大?
按本条目主口径(PTC 2019):约 2900 万条 PubMed 摘要 + 约 300 万篇 PMC 全文。官方当前页面写"~3000 万摘要 + ~300 万全文"。2024 年的 PubTator 3.0 已扩展到约 3600 万摘要 + 600 万全文,注释总量超过 10 亿(实体+关系)。
Q4:它是人工标注的吗?
不是。它是全自动机器标注。多个专用识别模型并行跑,再用深度学习消歧模块统一裁决。这正是它敢宣称"全库覆盖"的原因,也是它必须声明"不担保准确性"的原因。
Q5:怎么获取?
三条路,全部免费无门槛:① Web 界面(/research/pubtator/ 与 /research/pubtator3/)交互式浏览检索;② RESTful API(/research/pubtator/api)程序化访问;③ FTP 批量下载(ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/)。格式为 BioC-XML、JSON、tab 分隔。
Q6:许可是什么?能商用吗?
NCBI Public Domain Notice——它是美国政府作品(United States Government Work),不受版权保护,NLM 与美国政府未对其使用或再复制设置任何限制。这意味着在许可层面可自由使用、修改、再分发,包括商业用途(具体合规仍需使用者自判,但数据本身无许可限制)。这是库内许可最宽松的等级之一。
Q7:它和 2013 年的 PubTator 什么关系?
它是 PubTator 的升级版(第二代)。2013 年的 PubTator 只能标注 PubMed 摘要(五类概念);2019 年的 PubTator Central 把标注扩展到 PMC 全文、增加细胞系为第六类概念、引入深度学习消歧、重写服务端架构。文献里有时称 PTC 为 PubTator2。
Q8:那 PubTator 3.0 又是什么?
是 2024 年的第三代。它用统一的 AIONER 模型做实体识别、用 BioREx 做关系抽取、支持语义与关系检索,并演示了与 ChatGPT(GPT-4)集成以提升回答的真实性与可验证性。数据规模进一步扩到 36M 摘要 / 6M 全文。
Q9:它适合做什么、不适合做什么?
适合:医学 NLP 的预标注、实体链接/归一化的候选生成、知识图谱的关系素材、文献检索的语义索引、医疗大模型的事实 grounding、生物策展的辅助线索。不适合:需要严格金标准评测标签的场景(应改用 BioRED/BC5CDR 等人工语料)、需要非 OA 全文覆盖的场景(PMC 版权限制)、需要解剖实体等未纳入概念的场景。
Q10:为什么对 AI-Ready 重要?
因为它把"高质量规模的标注语料"这一 AI 训练/评测关键要素,做成了公共领域、三层可达、持续更新的公共服务。它是库内极少数"许可零阻力 + 获取零门槛 + 规模千万级"三者兼备的资源,同时它的版本谱系与多口径数字,又是"AI-Ready 元数据治理"的典型教学样本(见 §9 双口径存照)。
§2 版本谱系:三代 PubTator 的关系必须一次讲清
PubTator Central 最容易被误读的地方,是它与"PubTator"这个名字的纠缠。市面上至少有三种说法在流通:“PubTator”“PubTator Central”“PubTator 3.0”——有人以为是三个数据集,有人以为是同一系统的别名,有人把 3.0 的数字套到 PTC 头上。正确理解是:它们是同一系统 NCBI PubTator 的三代版本,共享同一套设计哲学(把自动生物概念标注做成公共服务),但每一代在覆盖范围、概念类型、算法与服务能力上都有实质跃迁。
2.1 三代对照总表
| 维度 | PubTator(2013,初版) | PubTator Central / PTC(2019,第二代) | PubTator 3.0(2024,第三代) |
|---|---|---|---|
| 论文 | NAR 41(Web Server issue):W518–W523 | NAR 47(W1):W587–W593 | NAR 52(W1):W540–W546 |
| DOI | 10.1093/nar/gkt441 | 10.1093/nar/gkz389 | 10.1093/nar/gkae235 |
| PMID | 23703206 | 31114887 | 38572754 |
| 文献别名 | PubTator(初版) | PTC / PubTator2 | PubTator3 |
| 标注范围 | 仅 PubMed 摘要 | 摘要 + PMC 全文 | 摘要 + PMC 全文(规模更大) |
| 文档规模 | 摘要级 | 约 29M 摘要 + 3M 全文 | 约 36M 摘要 + 6M 全文 |
| 概念类型 | 5 类(无 cell line) | 6 类(+cell line) | 6 类 |
| 关系抽取 | 无 | 无 | 12 类关系 |
| 核心算法 | 规则/统计 tagger | 专用 tagger + 深度学习消歧 | AIONER(统一 NER)+ BioREx(RE) |
| 服务能力 | 浏览 + API | 全文界面 + 语义检索 + API | 语义/关系/布尔检索 + ChatGPT 集成 |
| 更新频率来源 | — | 官方页 daily | 论文 weekly / FTP README monthly |
| 许可 | 公共领域 | 公共领域 | 公共领域 |
| Europe PMC 引用数(2026-09-30) | 368 | 279 | 139 |
一句话总结谱系:2013 解决"有没有",2019 解决"全不全"(全文化 + 六类 + 消歧),2024 解决"关系与检索"(RE + 语义化)。 本条目以 PubTator Central(2019) 为立条主体(slug pubtator-central),PubTator 3.0 作为其直接后继在 §7 详述。
2.2 为什么以 PTC 立条,而不是 PubTator 3.0
三个理由:
- 官方在线实体名。截至抓取时点,NCBI 官方页
https://www.ncbi.nlm.nih.gov/research/pubtator/的主标题与自我描述仍为 “PubTator Central (PTC)”,且明确表述其覆盖"~30 million abstracts + ~3 million full-text"——即仍以 PTC 名义提供那一代口径的服务说明。以官方在线的实体名立条,符合"以可核网址为准"的纪律。 - 引用惯例。在生物医学 NLP 文献中,"PubTator Central"作为资源名被引用的频次最高(279 次引用,且大量下游论文以 gkz389 为方法学出处);2013 原版(368 次)多为"该系统起源"引用,3.0(139 次)相对新。
- 谱系叙述的自然支点。以 PTC 为支点,向前可接 2013 原版(讲清"从摘要到全文"的升级动机),向后可接 3.0(讲清"从实体到关系"的下一步),三代一条线,检索者任入一端都能顺藤摸到全貌。
2.3 名字陷阱:PubTator2 是什么
在一些论文与工具文档里,PTC 会被写成 “PubTator2” 或 “PubTator2.0”。这不是另一个系统,而是社区对"第二代 PubTator"的俗称——尤其在与 3.0 对照时(如 3.0 论文 Fig 2B 写 “compared with PubTator2 (also known as PubTatorCentral)”)。因此如果你在 3.0 论文里看到 “PubTator2”,它指的就是本条目。反之,若在 2019 论文里看到 “original PubTator”,指的是 2013 初版。这条别名链是检索与引用时最容易出错的地方(坑点 1)。
2.4 版本迁移对获取路径的实际影响
版本迭代不只是"名字变了",它直接改变数据的存放位置。抓取时点实测:
- 旧目录
https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTatorCentral/仍可访问(HTTP 200),但只剩一个 2020-11-06 的PubTatorCentral_BioCXML/子目录,README.txt 已 404——旧版的批量出口实质已冻结为历史快照。 - 现行目录
https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/是活跃发布点,文件最后更新于 2026-08-17,总计约 200GB+。
这意味着:如果你按老教程的路径去下 PTC 的批量注释,会拿到一份 2020 年的旧快照,或直接扑空。正确的现行做法是走 PubTator3 目录(覆盖更全、更新更勤)。这一"版本迁移导致旧路径失效"的现象,是本条目给所有数据管线维护者的直接警示(坑点 5)。
§3 数据构成与规格
3.1 文档覆盖:为什么是"摘要 + 全文"两层
PTC 的文档来源有两块,理解它们的边界是正确使用的前提:
| 来源 | 规模(PTC 2019 口径) | 说明 |
|---|---|---|
| PubMed 摘要 | 约 2900 万条 | 全部 PubMed 记录的摘要部分;覆盖最广、最稳定 |
| PMC 全文 | 约 300 万篇 | 仅限 PMC Text Mining(PMC-TM)子集:含 Open Access Subset 与 Author Manuscript Collection |
关键在于"全文"的限定词:不是所有 PMC 文章都可用。只有进入 PMC-TM(可供文本挖掘)子集——即开放获取子集与作者手稿集——的文章才被标注。受出版商版权限制、未开放文本挖掘权限的全文不在覆盖范围内。论文提到当时 PMC 中"可供文本挖掘的文章比例接近 80%“,这个 80% 是按可从文本挖掘的字数/篇数统计的口径,不等于"PMC 里 80% 的文章”;使用时应理解为"绝大多数 OA 内容已覆盖,但非 OA 全文存在系统性缺口"。
为什么值得费这个力?因为摘要与全文的信息量差距巨大:论文明确指出全文长度约为摘要的 40 倍,且在摘要中常常缺失的关键知识(方法细节、实验结果、变异位点的具体语境、药物剂量关系等)大量存在于全文。把标注从摘要扩展到全文,使总标注量扩大近四倍——这是 PTC 相对 2013 原版最根本的价值增量,也是它对下游知识发现类应用(需要深挖正文关系)的直接赋能。
3.2 六类概念与归一化目标
PTC 标注六类生物概念,每类都归一化到一个权威数据库标识。这个"识别 + 归一化"的双步骤是它区别于普通 NER 的关键——它不只圈出实体词,还告诉你这个实体在数据库里是谁:
| 概念类型 | 英文 | 归一化目标数据库 | PTC 识别/归一化工具 | 3.0 工具升级 |
|---|---|---|---|---|
| 基因/蛋白 | gene/protein | NCBI Gene | GNormPlus | AIONER + GNorm2 |
| 遗传变异 | genetic variant(mutation) | dbSNP RS ID | tmVar 2.0 | tmVar 3.0 |
| 疾病 | disease | MeSH | TaggerOne | AIONER + TaggerOne |
| 化学物质 | chemical | MeSH | TaggerOne(重训) | AIONER + NLM-Chem |
| 物种 | species | NCBI Taxonomy | SR4GN | AIONER + GNorm2 |
| 细胞系 | cell line | Cellosaurus | TaggerOne | AIONER + TaggerOne |
几个值得注意的点:
- 疾病与化学物质共用 TaggerOne 但用不同模型,且化学 tagger 针对 PTC 用 BioCreative V CDR 语料 + CHEMDNER 语料联合重训——这说明"给全文做化学识别"比给摘要做更难,需要专门增强。
- 细胞系是 PTC 相对原版新增的第六类,归一化到 Cellosaurus(细胞系权威库)——满足了实验生物学对"这篇论文用了哪个细胞系"的检索需求。
- 同一 mention 可能映射到多个概念 ID(歧义),例如 “mTOR” 在不同物种语境下映射到人的 Gene ID 2475 或小鼠的 56717——这是归一化必须处理的核心难题,也是消歧模块存在的理由。
- 概念类型有限:解剖实体(细胞组分、细胞类型、组织)等尚未纳入,论文把其列为未来工作。使用者不要假设它能提供解剖学标注。
3.3 注释的数据结构
一个 annotation 被定义为三元组:连续文本片段(span)+ 概念类型(type)+ 登录号(identifier)。落到 FTP 的 tab 分隔文件里,实体文件是五列结构:
| 列 | 含义 |
|---|---|
| PMID | PubMed 摘要标识 |
| Type | 概念类型(gene / disease / chemical / species / mutation / cellline) |
| Concept ID | 对应数据库标识(如 NCBI Gene ID、MeSH ID) |
| Mentions | 对应该 PMID 中出现的生物概念提及文本 |
| Resource | 来源资源标记(含人工标注资源如 MeSH、gene2pubmed) |
关系文件(3.0)是四列结构:
| 列 | 含义 |
|---|---|
| PMID | 文献标识 |
| Type | 关系类型(Association / Positive_Correlation / Negative_Correlation / Co-treatment / Drug_interaction / Comparison / Conversion / Binding 等) |
| 概念 1 | 第一个实体(类型 + 标识) |
| 概念 2 | 第二个实体(类型 + 标识) |
"Resource"列的设计值得单独说明:它标记该注释的来源。当 Resource 是 MeSH 或 gene2pubmed 时,表示这条注释并非纯自动挖掘,而是融入了人工策展资源——这使 PTC 的注释带有"自动为主 + 少量人工锚点"的混合属性,对精度敏感的下游任务是有用的信号。
3.4 发布格式与体量
PTC / PubTator3 提供三种格式,各服务不同场景:
| 格式 | 用途 | 结构 |
|---|---|---|
| PubTator tab 分隔(.gz) | 大规模管线、按列解析 | 每行一条注释,列式;实体 5 列 / 关系 4 列 |
| BioC-XML(tar.gz) | 保留文档结构的互通 | BioC 社区标准,文档 → passage → annotation 层级 |
| JSON | Web/API 交互 | 结构化对象,便于程序消费 |
BioC 的作用常被低估:BioC 是一个社区驱动的生物医学文本处理数据格式,PTC 用它作为流水线各步骤间输入/输出的统一载体,保证各组件与外部工具之间的互操作性。使用者若想把 PTC 注释接入自己的 NLP 管线,走 BioC 是最顺滑的路径。
现网实测的 PubTator3 FTP 体量(2026-08-17 文件):
| 文件 | 大小 | 内容 |
|---|---|---|
bioconcepts2pubtator3.gz |
5.7G | 全部实体注释合并 |
relation2pubtator3.gz |
284M | BioREx 全部关系 |
chemical2pubtator3.gz |
1.7G | 化学 |
disease2pubtator3.gz |
2.0G | 疾病 |
gene2pubtator3.gz |
721M | 基因 |
species2pubtator3.gz |
466M | 物种 |
mutation2pubtator3.gz |
111M | 变异 |
cellline2pubtator3.gz |
68M | 细胞系 |
BioCXML.0–9.tar.gz |
10 × 20G ≈ 200G | 全量 BioC-XML 归档(分 10 卷) |
从单体文件大小可反推各概念类型的数据密度:疾病(2.0G)与化学(1.7G)是最大的两类实体——这与生物医学文献中疾病与药物/化合物提及的高频性一致;细胞系(68M)与变异(111M)相对稀疏,反映其提及频率较低。BioC-XML 归档总量约 200GB,是"全量全格式"的完整镜像。
3.5 处理流水线架构
PTC 的服务端流水线(论文 Fig 1)三步走:
新文献(PubMed 摘要 / PMC-TM 全文)
│
▼
[步骤 A] 多概念 tagger 并行识别
├── GNormPlus → 基因/蛋白
├── tmVar 2.0 → 遗传变异
├── TaggerOne → 疾病、化学、细胞系
└── SR4GN → 物种
│
▼
[步骤 B] 消歧模块(深度学习)
└── 裁决重叠/冲突注释,保证一致性
│
▼
[步骤 C] 存入 MongoDB 数据库
│
├──→ Web 界面(浏览、检索、可视化)
└──→ RESTful API(程序化检索)
3.0 把步骤 A 统一为 AIONER(一个模型识别六类实体),步骤 B 之外新增 BioREx 做关系抽取,存储改为 MongoDB + Solr(支持语义检索)。这一架构演进的核心收益是:统一模型简化了维护、关系抽取扩展了信息维度、Solr 支撑了高级检索。
3.6 与服务/语料的边界:PubTator 不是"数据集"而是"活体系统"
最后厘清一个概念边界:PubTator 系列严格说来不是一个静态数据集,而是一个持续运行的标注系统,其"数据集"属性来自 FTP 上的定期快照。这带来三个实际差异:
- 没有"版本号"意义上的数据发布:你下载到的是"截至某天的全量注释",而非"v1.2 数据集"。快照日期(如 PubTator3 的 2026-08-17)就是数据的时间戳。
- 可复现性依赖快照:若你的研究要可复现,必须锁定并归档你下载的那份 FTP 快照,否则数字会随官方更新而漂移。
- API 与 FTP 可能不同步:Web/API 检索的是实时数据库,FTP 是定期快照,两者在更新间隔内可能存在差异——对一致性敏感的任务应以 FTP 快照为准并记录日期。
这一"活体 vs 快照"的张力,正是 PubTator 这类持续服务型资源在 AI-Ready 语境下的特殊性:它的 AI-Ready 得分在"可得性"上近乎满分,但在"版本稳定可复现"上是使用者需自行补足的一环(§6.4 详述)。
3.7 使用前的质量自检清单
由于 PubTator 是自动标注,把它接入任何严肃管线之前,建议按下表逐项自检。这张表也是本条目"理智使用"主张的浓缩:
| 自检项 | 要问的问题 | 处理建议 |
|---|---|---|
| 概念类型覆盖 | 我要的实体类型在六类里吗? | 不在(如解剖实体)→ 另寻资源 |
| 文档范围 | 我要的文献在 PubMed 摘要 / PMC-TM 全文里吗? | 非 OA 全文 → 覆盖缺口,勿声称全库 |
| 标注质量 | 我把它当金标准还是弱监督? | 当金标准 → 改用人工语料;当弱监督 → 可用并记录噪声 |
| 归一化精度 | 我依赖的数据库 ID 归一是否正确? | 抽取样本人工核对;关注同形异义(如 mTOR 跨物种) |
| 关系可用性 | 我要关系数据吗? | 要 → 用 3.0 且限于摘要;要全文关系 → 不可得 |
| 版本与时点 | 我引的数字是哪个版本、哪一天? | 记录版本与快照日期,全篇一致 |
| 可复现性 | 我能复现自己的实验吗? | 归档下载的 FTP 快照 + 记录 Last modified |
| 许可合规 | 我的用途有许可风险吗? | 公共领域无限制,商业/再分发均可(自判合规) |
一句话原则:用 PubTator 的规模与覆盖,用人工语料的精度做严格评测;把它的每条输出都当作"待验证线索"而非"既定事实"。
3.8 与人工金标准语料的关系:互补而非替代
初学者常问:"既然有 PubTator 自动标注,还需要人工语料吗?"答案是两者服务不同阶段,构成互补的两层:
| 维度 | PubTator(自动层) | 人工金标准(如 BioRED/BC5CDR) |
|---|---|---|
| 规模 | 千万篇级 | 数百至数万(篇/句) |
| 覆盖 | 全库(PubMed + PMC-TM) | 精选子集 |
| 精度 | 有噪声,非金标准 | 高(人工双标 + 仲裁) |
| 用途 | 预标注、弱监督、检索、grounding | 严格评测、精度上限测量 |
| 更新 | 持续滚动 | 一次性或低频 |
正确的工作流是**“自动层预标注 + 人工层校准”**:用 PubTator 覆盖全库并产出候选,用人工金标准测量真实精度并做误差分析,再用人工标注微调模型。把两层混用(拿自动标注当金标准、或拿小规模金标准去覆盖全库)都会失败。这一"两层互补"的认知,是使用 PubTator 系列资源的前提。
§4 任务定义:NER / NED / RE 三件事说清楚
PubTator Central 支撑的是生物医学 NLP 的三个基础任务。理解这三个任务,才能理解它到底为下游提供了什么,以及为什么它被 BigBIO 等框架登记为标准的 NER + NED 数据集。
4.1 命名实体识别(NER)
定义:从自由文本中找出属于特定概念类型的实体文本片段(span)。例如从"BRCA1 mutations increase breast cancer risk"中识别出 “BRCA1”(基因)与 “breast cancer”(疾病)。
PubTator 的处理方式:六类实体各由专门模型识别。PTC 用 GNormPlus(基因)、tmVar 2.0(变异)、TaggerOne(疾病/化学/细胞系)、SR4GN(物种);3.0 统一为 AIONER 单模型多类型识别。识别结果就是注释里的 span 部分。
质量背景:论文 Table 1 展示了各概念从 2013 原版到 PTC 的性能改进;全文本比摘要更难标注(“content of full text is more complex than abstracts”),因此多个 tagger 为适配全文做了修改或重训。具体的 precision/recall/F1 逐类数值在论文 Supplementary Table S1(本条目存照待核,见 §9)。
4.2 命名实体归一化 / 消歧(NED / NEN)
定义:把识别出的实体文本链接到权威数据库中的唯一标识。例如 "BRCA1""BRCA-1"“breast cancer type 1 susceptibility protein” 都应归一化到同一个 NCBI Gene ID。
PubTator 的处理方式:这是它区别于普通 NER 工具的核心能力——它输出的是登录号,不是词表。六类实体分别归一化到 NCBI Gene / dbSNP / MeSH(疾病与化学)/ NCBI Taxonomy / Cellosaurus。
难点与消歧模块:
- 同形异义(一词多实体):如 “mTOR” 在不同物种语境下对应人(Gene ID 2475)或小鼠(56717),必须结合上下文裁决。
- 同实体多形(一词多写法):同一基因有官方名、别名、缩写、蛋白名等多种形式,需归一。
- 重叠注释冲突:多个 tagger 可能对同一 span 判出不同类型或重叠边界,需要 disambiguation 模块统一。
PTC 的消歧模块基于深度学习,是其相对原版在"准确性"上改进的关键组件。对下游知识图谱构建者而言,归一化的质量直接决定图谱节点的合并正确性——这是 PubTator 最有价值的贡献之一。
4.3 关系抽取(RE,3.0 起)
定义:识别两个实体之间存在何种语义关系。例如 “chemical X reduces expression of gene Y” 中的 chemical-gene 负相关关系。
PubTator 3.0 的处理方式:BioREx 模型抽取 12 类关系,覆盖 8 种实体对:
| 实体对 | 说明 |
|---|---|
| chemical–chemical | 化合物-化合物(如药物相互作用) |
| chemical–disease | 化学-疾病(如药物诱导的疾病) |
| chemical–gene | 化学-基因(如药物靶点、表达调控) |
| chemical–variant | 化学-变异(如药物反应相关变异) |
| disease–gene | 疾病-基因(如致病基因) |
| disease–variant | 疾病-变异(如致病变异) |
| gene–gene | 基因-基因(如相互作用、共表达) |
| variant–variant | 变异-变异(如连锁、联合效应) |
关系类型命名层包括 Association / Positive_Correlation / Negative_Correlation / Co-treatment / Drug_interaction / Comparison / Conversion / Binding 等。这个关系层是 PubTator 3.0 相对 PTC 的最大增量——它把"实体清单"升级为"实体关系图",直接服务于药物重定位(找靶向某基因的化合物)、变异解读(变异-疾病关联)、通路组装(基因-基因网络)等知识发现任务。
已知局限(3.0 自述):关系抽取目前仅覆盖摘要(受算力约束),全文关系抽取是未来工作;只有 12 类关系;实体与关系均为自动抽取,准确率非完美。使用者应把关系层当作"高召回线索"而非"金标准事实"。
4.4 三任务能力对照表
| 任务 | PTC(2019) | PubTator 3.0(2024) | 下游用途 |
|---|---|---|---|
| NER(实体识别) | ✅ 六类(多 tagger) | ✅ 六类(AIONER 统一) | 预标注、检索索引 |
| NED(实体归一化) | ✅ 映射数据库 ID | ✅ 同(工具换新) | 知识图谱节点合并、实体链接 |
| RE(关系抽取) | ❌ 无 | ✅ 12 类 / 8 实体对(仅摘要) | 药物重定位、通路/关联发现 |
这张表也回答了一个常见疑问:如果你需要关系数据,必须用 3.0;如果你只需要实体标注,PTC 与 3.0 都能满足(3.0 是超集)。
§5 为什么它对医疗 AI 与生物医学 NLP 重要
PubTator 系列在生物医学 AI 生态中的位置,可以用一句话概括:它是"文献知识"通往"机器可用知识"的标准转换器。下面从五个维度说明它的价值。
5.1 作为训练/预标注语料:弱监督的规模优势
现代生物医学 NLP 模型(尤其是 BERT 类与更晚的 LLM)在预训练与微调时都需要大量标注数据。人工标注成本高昂,PubTator 提供的千万篇级、六类实体、带数据库 ID的自动标注,是弱监督/远程监督(distant supervision)的理想素材:
- 预标注加速人工:用 PubTator 输出作为初筛,人工只在机器标注上做修正,可把标注成本大幅压缩(类似主动学习范式)。
- 自动标注作训练信号:许多 NER/NED 模型直接以 PubTator 输出作为训练语料(在承认噪声的前提下),因为它规模远超任何人工语料。
- 覆盖与多样性:2900 万摘要 + 300 万全文的覆盖,使模型见到的实体上下文分布远比小规模金标准丰富。
5.2 作为知识图谱与知识发现的底座
生物医学知识图谱(如疾病-基因-化学网络)的构建,通常需要从文献中抽取实体与关系。PubTator 提供的正是这个流程的原料:
- 实体节点:六类概念 + 数据库 ID,可直接作为图谱节点骨架。
- 关系边:3.0 的 12 类关系提供带类型的边,支撑因果/关联推理。
- 典型应用(论文列举):药物重定位(chemical-gene 检索)、基因优先排序(候选基因文献排序)、基因-表型关联、疾病共病分析、生物策展辅助。
论文明确引用了大量下游用例,从"优先排序候选基因"到"创建基因与变异资源"再到"富化疾病知识图谱"——这些都建立在 PubTator 的实体+关系抽取之上。
5.3 作为 LLM 的 grounding / 检索增强资源
这是 PubTator 3.0 最前沿、也最值得医疗 AI 团队关注的用法。大模型的"幻觉"在生物医学场景尤其危险——一个编造的基因-疾病关联或药物-靶点关系,可能直接误导研究或临床判断。PubTator 3.0 论文给出了一条明确的解决路径:
- 与 ChatGPT(GPT-4)集成:把 PubTator API 接入 ChatGPT 的回答流程,让模型基于真实文献注释作答,论文报告这显著提升了回答的真实性(factuality)与可验证性(verifiability)。
- 可验证的溯源:由于每条注释都带 PMID 与数据库 ID,模型的每个断言都能追溯到原文与权威库——这是"可验证 AI"在生物医学领域的具体落地。
- 检索质量:3.0 的检索在实体对查询下,召回文章数多于 PubMed 与 Google Scholar,且前 20 结果精度更高——这意味着它可作为 RAG(检索增强生成)系统中优于通用检索引擎的知识检索层。
对做医疗大模型 RAG / grounding 的团队,PubTator 提供的不只是数据,而是一套"实体对齐 + 关系预计算 + 可溯源注释"的现成事实层。开源代码 ncbi-nlp/pubtator-gpt 直接把这条集成路径产品化。
5.4 作为生物策展(biocuration)的辅助工具
生物数据库(如基因、变异、疾病资源)的维护依赖人工策展,而策展员面对的是海量文献。PubTator 从设计之初就服务于策展工作流:
- 文献分诊(triage):自动标注帮策展员快速定位"哪些文章含相关基因/变异"。
- 预填充:把机器标注作为策展表单的初值,人工只需审核。
- 历史用例:2013 初版的论文即题为"a web-based text mining tool for assisting biocuration",且有专门的案例研究(用 PubTator 策展 PubMed 摘要中的基因);2019 PTC 论文回顾原系统已服务约 3 亿次 API 请求,用于策展支持等用例。
5.5 作为"基础设施"的稳定性价值
最后一层价值最朴素也最重要:它长期、稳定、免费、无门槛地运行。在生物医学 NLP 领域,工具与语料的生命周期往往很短——论文发表后数据库停更、链接失效是常态。PubTator 从 2013 到 2024 迭代三代,始终由美国政府机构(NCBI/NLM/NIH)维护,且:
- 许可为公共领域(无使用限制);
- 提供 Web + API + FTP 三层入口(不依赖单一渠道);
- 持续更新(每日/每周/每月,视版本与渠道而定)。
这种"制度性稳定 + 零许可阻力 + 多渠道可达"的组合,使它成为众多管线与工具的默认依赖——它是那种"一旦你在生产系统里用了,就几乎不用担心它明天消失或突然要收费"的资源。对于要构建长期运行的医疗 AI 基础设施的团队,这种稳定性本身就是核心竞争力。
5.6 定位的诚实边界
必须同时说清它不是什么,避免误用:
- 它不是人工金标准:自动标注带噪声,严格评测请用人工语料(BioRED/BC5CDR/NCBI-Disease 等)。
- 它不覆盖非 OA 全文:PMC 版权限制导致系统性缺口,不适合声称"覆盖全部生物医学文献"的研究。
- 它的关系层仅限摘要(3.0):需要全文关系的任务不能依赖它。
- 它不含解剖实体等:概念类型有限,超出六类的需求需另寻资源。
把 PubTator 放在正确的位置——高覆盖、可追溯、零门槛的自动标注底座——才能最大化它的价值。
§6 获取与许可:三层入口 + 公共领域
6.1 三层获取入口总表
| 入口 | 地址 | 适用场景 | 门槛 |
|---|---|---|---|
| Web 界面 | https://www.ncbi.nlm.nih.gov/research/pubtator/(PTC)/ .../pubtator3/(3.0) |
交互式浏览、检索、构建文档集、可视化注释 | 无 |
| RESTful API | /research/pubtator/api(PTC)/ /research/pubtator3/api(3.0) |
程序化访问、集成到管线、3.0 支持语义/关系查询 | 无 |
| FTP 批量 | https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/(现行) |
大规模下载全量注释 | 无 |
三层入口全部免费、无注册墙、无申请流程——这是它相对库内"请求制/注册墙"型数据集最大的获取优势。
6.2 许可:NCBI Public Domain Notice(逐字存照)
PubTator 数据的许可条款写在 FTP README.txt 开头,原文关键段落如下(英文原文存照):
“This software/database is a ‘United States Government Work’ under the terms of the United States Copyright Act. It was written as part of the author’s official duties as a United States Government employee and thus cannot be copyrighted. This software/database is freely available to the public for use. The National Library of Medicine and the U.S. Government have not placed any restriction on its use or reproduction.”
要点解读:
- 性质:美国政府作品(United States Government Work),依美国版权法不受版权保护。
- 权利:NLM 与美国政府未对其使用或再复制设置任何限制——可自由使用、修改、再分发。
- 第三方归类佐证:bio.tools 将其标为 Unlicense(无许可/公共领域)、Free of charge、Open access;BigBIO/HF 打包版将其标为
license: other(对应NCBI_LICENSE)——注意 HF 的 “other” 是平台无法归入标准 CC 协议时的兜底标记,不代表"另有更严的许可",实际就是公共领域(坑点 3)。 - 免责:README 同时声明 NLM/美国政府不担保数据的准确性与结果(“do not and cannot warrant the performance or results”)——这条免责与"自动标注"属性呼应,是使用者的知情前提。
在库内许可光谱上的位置:这是最宽松等级。对比 Panda-Plus(掩码请求制、论文 CC BY-NC-ND)、各类注册墙数据集,PubTator 的"公共领域 + 无限制"使其在"可再分发、可商用、可修改"上几乎无摩擦。对要构建产品级医疗 AI 管线的团队,这一点极具吸引力。
6.3 实操:怎么下、怎么调
FTP 批量下载(推荐给大规模管线):
# 现行发布点(PubTator3)
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/bioconcepts2pubtator3.gz # 全部实体注释 5.7G
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/relation2pubtator3.gz # 全部关系 284M
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/gene2pubtator3.gz # 按类型分文件
# 解压(tab 分隔)
gunzip bioconcepts2pubtator3.gz
# BioC-XML 归档需 tar 解包(10 卷,各 20G)
tar -zxvf BioCXML.0.tar.gz
要点提醒:
- 认准 PubTator3 目录:旧
PubTatorCentral/目录已冻结(仅剩 2020-11 的 BioCXML 快照),老教程路径会失效(坑点 5)。 - 单文件即可上手:只需全部实体注释时,下
bioconcepts2pubtator3.gz(5.7G)一份即可;需要按类型切分再用{type}2pubtator3.gz。 - BioC-XML 体量极大:全量约 200GB(10×20G),非必要不下——它适合需要文档结构完整性的场景。
- 记录快照日期:为可复现性,务必记录你下载时 FTP 上文件的 Last modified 日期(如本轮实测为 2026-08-17),并归档你下载的那份副本。
API 调用(推荐给实时/按需场景):PTC 与 3.0 均提供 RESTful API。3.0 的 API 支持更灵活的查询,论文举例:“what chemicals are known to reduce expression of JAK1?” 这类信息需求可在单次 API 调用中回答——这是语义检索 + 关系预计算带来的能力。
BigBIO 框架加载(推荐给 datasets 生态用户):HF 上的 bigbio/pubtator_central 把 PTC 打包为标准的 NER + NED 数据集:
# 需先 pip install bioc(BigBIO 依赖)
from datasets import load_dataset
ds = load_dataset("bigbio/pubtator_central", name="pubtator_central_bigbio_kb")
# 提供 sample 与 full 两档配置;BigBIO 版本 1.0.0,源版本 2022.01.08
注意:BigBIO 打包版基于 2022 源版本、且引用的旧 FTP 路径(PubTatorCentral/bioconcepts2pubtatorcentral.offset.gz)已冻结——用它做研究时应核对数据新鲜度,需要最新数据请直接走 PubTator3 FTP。
6.4 AI-Ready 评估:可得性满分,稳定性自负
以库内 AI-Ready 检查单过一遍:
- 机器可读元数据:✅ 论文开放获取 + FTP README(格式/引用/声明齐全)+ API 文档页。
- 公开直链:✅ FTP HTTP 直链 + RESTful API + Web——三层无障碍,AI-Ready 最大加分项。
- 许可明确性:✅ 公共领域,无限制——许可层面零歧义、零摩擦。
- 可复现性:⚠️ 作为活体系统,无静态版本号,数据随官方更新漂移;可复现依赖使用者自行归档快照(§3.6)。这是唯一需要使用者补足的环节。
- 文档自洽:⚠️ 多口径数字并存(规模、更新频率、注释总量),需按版本与时点对齐(§9 与坑点)。
综合:AI-Ready 等级"高"——三层无门槛获取 + 公共领域许可 + 持续更新,使它在"可得性"维度近乎满分;扣分点不在"能不能拿到",而在"拿到的到底是不是同一份"(版本/快照治理),这属于使用者侧的可复现性责任,而非资源本身的缺陷。
6.5 与库内可获取性光谱的对照
库内数据集已形成可获取性光谱(注册墙 → 请求制 → Zenodo → AWS Registry → 公开直链)。本条目在光谱上的位置:
| 档位 | 库内参照 | 本条目对应 |
|---|---|---|
| 注册墙(最严) | 少量需审批的临床数据集 | — |
| 请求制 | Panda-Plus 掩码(邮件申请) | — |
| 平台托管 | Zenodo 型 | — |
| Registry 收录 | AWS Registry 型 | — |
| 公开直链 | HF/Zenodo 直链型 | ✅ 本条目(Web + API + FTP 三层) |
PubTator 的特殊性在于:它不只是"公开直链",而是**“公开直链 + 公共领域许可 + 程序化 API”**三位一体。库内许多"公开直链"数据集仍带 CC BY-NC 等限制或需注册,而 PubTator 在许可与获取上同时到达最宽松端点——这使它在"能否无摩擦进入生产管线"这一实用维度上,是库内最具代表性的样本之一。
§7 PubTator 3.0:从实体到关系,从标注到检索
PubTator 3.0(2024)是 PubTator Central 的直接后继,也是理解 PubTator 系列"去向何方"的关键。本节点作为延伸专节,讲清它的增量。
7.1 三大增量
| 增量 | 内容 | 意义 |
|---|---|---|
| AIONER 统一 NER | 一个模型识别六类实体,取代 PTC 的多 tagger 并置 | 简化维护、统一框架、性能提升 |
| BioREx 关系抽取 | 抽取 12 类关系(8 种实体对) | 从"实体清单"升级为"实体关系图" |
| 语义/关系检索 | 界面与 API 支持语义、关系、关键词、布尔查询 | 从"浏览标注"升级为"按需发现知识" |
架构上,3.0 的流水线(论文 Fig 2A):AIONER 识别六类实体 → 专用 mapper 归一化(GNorm2/tmVar3/NLM-Chem/TaggerOne)→ BioREx 抽关系 → 存 MongoDB + Solr 检索。
7.2 规模扩展
| 维度 | PTC(2019) | PubTator 3.0(2024) |
|---|---|---|
| PubMed 摘要 | 约 29M | 约 36M |
| PMC 全文 | 约 3M | 约 6M |
| 注释总量 | (未单列) | 超 10 亿(实体+关系) |
| 关系类型 | 0 | 12 类 |
| 更新频率(论文口径) | daily | weekly |
规模翻倍(尤其全文从 3M 到 6M)反映了 PMC 开放获取内容的持续增长与系统吞吐的提升。注释总量"超 10 亿"是一个量级标志——它意味着 PubTator 已成为生物医学文献知识规模最大的机器可读表示之一。
7.3 性能评估
3.0 论文用两组基准验证提升:
- NER(vs PubTator2/PTC,在 BioRED 语料上):论文 Fig 2B 展示六类实体的识别性能对照,3.0 相对 PTC 有改进。
- RE(vs SemRep 及此前最优系统,在 BioCreative V CDR 语料上):论文 Fig 2C 展示关系抽取显著优于 SemRep 与既往系统。
BioRED 是什么:600 篇 PubMed 摘要的文档级多实体、多关系语料(Luo L 等, 2022, Brief Bioinform 23(5):bbac282),是生物医学 RE 的权威基准;其自身报告 NER F-score 89.3%、新型关系 RE F-score 仅 47.7%——反映关系抽取仍是难题,也解释了为何 3.0 要专门用 BioREx 攻这一环。
7.4 检索质量与 LLM 集成
- 检索质量:在实体对查询下,PubTator 3.0 检索到的文章数多于 PubMed 与 Google Scholar,且前 20 结果精度更高——这得益于语义检索(用预计算的概念匹配替代关键词匹配,规避术语差异)。
- LLM grounding:把 ChatGPT(GPT-4)与 PubTator API 集成,显著提升回答的真实性与可验证性;开源代码
ncbi-nlp/pubtator-gpt。这是 PubTator 从"文献工具"跨入"AI 事实层"的标志性一步。
7.5 3.0 的自我设限(诚实边界)
论文明确列出三条局限,条目照录以正视听:
- 关系抽取仅限摘要:虽能处理全文实体,但关系目前只在摘要上抽取(算力约束),全文 RE 为未来工作。
- 关系类型有限:仅 12 类,虽为常用关系但非全部。
- 自动抽取非完美:实体与关系均由机器产出,准确率虽高但非 100%。
这三条与 PTC 的"自动标注非金标准"一脉相承,构成 PubTator 系列一贯的诚实定位。
7.6 源码开放与可复现资产
3.0 的全部组件开源(GitHub ncbi 组织):AIONER、GNorm2、tmVar3、NLM-Chem Tagger、TaggerOne、BioREx、pubtator-gpt;源码与训练模型归档于 Zenodo 10.5281/zenodo.10839631(CC0)。这意味着研究团队不仅能用 PubTator,还能复现其标注管线、按其架构自建领域专用标注系统——这是它作为"方法论公共资产"的价值延伸。
§8 生态:工具链、语料族与下游应用
8.1 NCBI Lu lab 的工具链生态
PubTator 不是孤立工具,它站在一条完整的 NCBI 生物医学 NLP 工具链之上(这条链本身也是理解 PubTator 能力来源的钥匙):
PubTator 系列
├── 实体识别层
│ ├── GNormPlus / GNorm2 (基因/蛋白 + 物种归一化)
│ ├── tmVar 2.0 / 3.0 (遗传变异 → dbSNP)
│ ├── TaggerOne (疾病/细胞系)
│ ├── SR4GN (物种,PTC 阶段)
│ ├── NLM-Chem (化学 → MeSH,3.0 阶段)
│ └── AIONER (3.0 统一 NER)
├── 关系抽取层
│ └── BioREx (3.0,12 类关系)
├── 语料层
│ ├── BioRED (关系抽取基准,600 摘要)
│ ├── BioCreative V CDR (化学-疾病关系)
│ ├── CHEMDNER (化学实体)
│ └── NCBI-Disease (疾病实体)
└── LLM 集成层
└── pubtator-gpt (ChatGPT + PubTator API)
这条工具链的共同特征是:论文发表 + 源码开源 + 数据开放 + 持续维护,构成生物医学 NLP 领域罕见的"全栈开放"生态。
8.2 与前身及旁系的关系
- 上行:2013 PubTator(起源)、2015 加入的 RESTful API(服务化起点)。
- 下行:PubTator 3.0(关系与检索)。
- 旁系:SemRep(另一生物医学关系抽取系统,3.0 的对比基线);PubTerm、Thalia 等(同期生物医学文献工具,论文引用的同类)。
8.3 下游应用全景
| 应用领域 | 具体用法 | 依赖的能力 |
|---|---|---|
| 生物策展 | 文献分诊、预填充策展表单 | NER + NED |
| 基因优先排序 | 定位候选基因的文献证据 | NER + NED |
| 基因-表型关联 | 从文献抽取基因-疾病联系 | NER + RE |
| 疾病共病分析 | 疾病-疾病共现与关联 | NER + RE |
| 药物重定位 | chemical-gene 关系检索 | RE |
| 知识图谱富化 | 实体节点 + 关系边 | NER + NED + RE |
| 变异解读 | 变异-疾病关联 | RE |
| LLM grounding | 检索增强 + 可溯源作答 | API + 全链 |
8.4 生态互链点(库内条目,已核 rid)
PubTator 与库内多条生物医学 NLP 语料形成天然的对照与互补关系:
| 库内条目 | rid | 与 PubTator 的关系 |
|---|---|---|
| BioRED | 457 | PubTator 3.0 的 NER 评测语料;同为 NCBI Lu lab 出品——最直接互链 |
| BC5CDR | 415 | PubTator 3.0 关系抽取评测基准(BioCreative V CDR) |
| CHEMDNER | 450 | PTC 化学 tagger 重训语料之一 |
| NCBI-Disease | 425 | 疾病 NER 人工金标准,与 PubTator 自动疾病标注互为对照 |
| BC2GM | 434 | 基因 NER 人工金标准对照 |
| MedMentions | 390 | UMLS 实体链接语料,对应 PubTator 的归一化(NED)任务 |
| CRAFT | 529 | 生物医学概念标注金标准对照 |
| PubMedQA | 49 | PubMed 问答基准,PubTator 注释可支撑其检索/grounding |
| S2ORC | 370 | 大规模学术全文语料,与 PMC 全文标注形成"原文 vs 标注层"互补 |
| LitCovid | 380 | COVID-19 文献库,PubTator 覆盖 PubMed 时的疫情主题子集 |
| CORD-19 | 104 | COVID-19 开放研究语料,同上的疫情切片 |
互链逻辑一句话:PubTator 是"自动标注层",库内 BioRED/BC5CDR/CHEMDNER/NCBI-Disease/BC2GM/MedMentions/CRAFT 是"人工金标准层",S2ORC/LitCovid/CORD-19 是"原始语料层",PubMedQA 是"下游任务层"——四层合起来构成一个完整的生物医学 NLP 数据生态面。
§9 版本口径与双口径存照
PubTator 的"活体系统"属性决定了它的数字在不同来源、不同版本、不同时点会不一致。这些不一致不是错误,而是版本演进的真实痕迹——但对自动化抽取与严格引用而言,必须逐条对齐。本节把所有冲突集中存照,并给出处理口径。
9.1 口径冲突总表
| # | 项 | 口径 A | 口径 B | 口径 C | 处理建议 |
|---|---|---|---|---|---|
| 1 | PubMed 摘要数 | 29M(PTC 2019 论文) | ~30M(官方页 docsum) | 36M(3.0 2024 论文) | 按版本引用:PTC 条目用 29M,3.0 用 36M;官方页 30M 视为四舍五入 |
| 2 | PMC 全文数 | 3M(PTC 2019) | ~3M(官方页) | 6M(3.0 2024) | 同上,按版本 |
| 3 | 更新频率 | daily(PTC 官方页) | weekly(3.0 论文) | monthly(PubTator3 FTP README) | 三口径按渠道注明;页面=实时视角,论文=描述视角,FTP=批量视角 |
| 4 | 注释总量 | over 1 billion(3.0 论文) | 1.6B 实体 + 33M 关系(NIH poster 2024) | — | 论文概数 vs poster 细分;条目以论文"超 10 亿"为主,poster 存照 |
| 5 | 概念类型数 | 6 类(PTC/3.0 官方) | 9 个 type(2020 GitHub 快照) | — | 6 类是现行口径;9 type 为旧分类残留(含 Genus/Strain/DomainMotif) |
| 6 | 旧 FTP 状态 | 老教程引 bioconcepts2pubtatorcentral.gz |
实抓仅剩 2020-11 BioCXML 目录 | — | 旧路径已冻结,现行走 PubTator3 目录(坑点 5) |
| 7 | BigBIO 许可标注 | HF card: license: other |
实际: NCBI 公共领域 | — | “other” 是平台兜底标记,非更严许可(坑点 3) |
9.2 为什么会有这些冲突:三个机制
- 版本演进:三代系统覆盖的文献量本就不同(29M → 36M),把不同版本的数字混用必然冲突。对策:所有引用必须带版本标签。
- 视角差异:同一时点的同一系统,Web 页面(实时数据库视角)、论文(发表时快照视角)、FTP(批量快照视角)三者的统计口径与更新节奏不同,数字可以同时"都对"。对策:引用时注明来源渠道。
- 社区残留:三方工具(GitHub 脚本、BigBIO 打包)冻结在某一历史版本,其数字与路径随时间失效。对策:不盲信二手打包,回到官方 FTP/论文核对。
9.3 引用规范建议
- 引 PubTator Central 本体:用 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389),规模引 29M + 3M。
- 引摘要+全文+关系综合能力:用 NAR 2024;52(W1):W540–W546(doi:10.1093/nar/gkae235),规模引 36M + 6M + 超 10 亿注释。
- 引系统起源:用 NAR 2013;41(Web Server Issue):W518–W523(doi:10.1093/nar/gkt441)。
- 引数据快照:注明下载日期与 FTP 文件 Last modified(本轮为 2026-08-17)。
- 勿混引:不要把 3.0 的 36M/6M/10 亿套到 PTC 名下,也不要把 PTC 的 29M/3M 当作当前规模。
9.4 待核遗留疑点
以下数字/信息本轮未逐点抓取,存照待后续核验:
- PTC 2019 Table 1 与 Supplementary Table S1 的逐类 precision/recall/F1(PMC 反爬 + OUP Cloudflare 阻挡)。
- 3.0 Fig 2B(vs PubTator2 on BioRED)与 Fig 2C(vs SemRep on CDR)的具体数值。
- PubTator 3.0 主站实时注释计数器的当前值(NCBI 主站反爬)。
- 旧 PubTatorCentral FTP 冻结的确切时间与官方替代公告(未见明确说明)。
- PTC 与 3.0 的 URL 并存过渡策略(据两页并存推断,官方未明文)。
§10 避坑清单:八个已识别的坑
坑 1:PubTator / PubTator Central / PubTator 3.0 是三代,不是三个数据集。
它们在文献里会被简称成 “PubTator”“PTC”"PubTator2"“PubTator3”,极易被当作独立资源。正确认知:同一系统的 v1/v2/v3;PTC = 第二代 = PubTator2;3.0 = 第三代。把三者的数字混用是最常见的引用错误。
坑 2:文档规模有三套数字,必须带版本。
29M/3M(PTC 2019)、~30M/~3M(官方页)、36M/6M(3.0 2024)。任何"PubTator 覆盖 X 篇文献"的表述都必须先声明是哪个版本、哪个时点。自动化抽取若不加版本约束,会得到自相矛盾的结果。
坑 3:BigBIO/HF 的 license: other 不是"更严的许可"。
它是 HuggingFace 无法归入标准 CC 协议时的兜底标记,实际对应 NCBI 公共领域(bigbio_license_shortname: NCBI_LICENSE)。看到 “other” 就直接判为"许可不明/受限"会误判——本条目数据实为无限制使用。
坑 4:它是自动标注,不是金标准。
把 PubTator 标注当作人工金标准来评测模型、或直接作为问答的唯一事实源,都会引入系统性误差。NCBI 免责声明明确"不担保准确性"。正确用法:弱监督/预标注/检索线索/grounding 素材;严格评测请用人工语料。
坑 5:旧 FTP 路径已冻结,老教程会失效。
ftp.ncbi.nlm.nih.gov/pub/lu/PubTatorCentral/ 现仅剩 2020-11-06 的 BioCXML 快照,README 404;BigBIO 打包引用的 bioconcepts2pubtatorcentral.offset.gz 亦来自旧路径。现行批量下载统一走 PubTator3/ 目录。按老路径操作会拿到过时数据或扑空。
坑 6:更新频率三口径(daily/weekly/monthly),别当矛盾。
官方页说 daily(实时同步视角)、3.0 论文说 weekly(描述视角)、FTP README 说 monthly(批量快照视角)。三者服务不同场景,都对。规划数据刷新周期时应按你实际使用的渠道(FTP 快照 = monthly)设定预期。
坑 7:全文覆盖有系统性缺口。
“PMC 全文"仅指 PMC Text Mining 子集(OA Subset + Author Manuscript Collection),非 OA 的受版权全文不在内。任何声称"覆盖全部生物医学全文"的用法都会高估覆盖度。论文提到的”~80% 可文本挖掘"是按开放内容的统计口径,不等于"80% 的 PMC 文章"。
坑 8:3.0 的关系抽取仅限摘要。
PubTator 3.0 能对全文做实体标注,但关系抽取目前只在摘要上(算力约束)。需要全文级关系的研究不能依赖它;论文已把全文 RE 列为未来工作。此外 3.0 仅 12 类关系、不含解剖实体,超出范围的需求需另寻资源。
§11 总结
11.1 三句话总结
- PubTator Central 是 NCBI 对约 2900 万 PubMed 摘要 + 300 万 PMC 全文做的全自动六类生物概念实体标注(含数据库归一化),2019 年发布,是 2013 原版 PubTator 的全文升级版,2024 年演进为含关系抽取的 PubTator 3.0。
- 它的核心价值在三层无门槛获取(Web/API/FTP)+ 公共领域无限制许可 + 持续更新——是库内"可得性"维度近乎满分的代表,也是医学 NLP 与知识图谱的默认语料底座。
- 它的正确定位是自动标注/弱监督/grounding 资源,不是人工金标准;用它的规模与覆盖,用人工语料(BioRED/BC5CDR 等)的精度做严格评测。
11.2 适合谁
- 生物医学 NLP 团队:需要大规模预标注/弱监督语料做 NER/NED/RE。
- 医疗知识图谱构建者:需要六类实体 + 12 类关系作为图节点与边的原料。
- 医疗大模型 / RAG 团队:需要可溯源、可验证的事实层做 grounding(3.0 + pubtator-gpt)。
- 生物策展工作者:需要文献分诊与预填充工具。
- 数据工程师:需要"公共领域 + API + FTP"零摩擦接入的语料源。
11.3 不适合谁
- 需要严格金标准评测标签的团队(应改用人工语料)。
- 需要覆盖非 OA 全文的研究(PMC 版权缺口)。
- 需要解剖实体等未纳入概念的场景。
- 需要全文级关系抽取的任务(3.0 RE 仅限摘要)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要立刻拿一批实体标注 | FTP 下 PubTator3/bioconcepts2pubtator3.gz(5.7G,公共领域) |
| 要程序化按需查询 | 调 pubtator3/api(支持语义/关系查询) |
| 要关系数据 | 用 3.0 的 relation2pubtator3.gz(284M,仅摘要关系) |
| 要严格评测 NER/RE 模型 | 用库内 BioRED(457)/BC5CDR(415)/NCBI-Disease(425) 等人工语料,不要用 PubTator 当金标准 |
| 要 LLM grounding | 参考 ncbi-nlp/pubtator-gpt + 3.0 API |
| 要引用本资源 | 本体引 gkz389(PTC),关系/检索引 gkae235(3.0),起源引 gkt441 |
FAQ(高频问答 32 问)
A. 基础认知
Q1:PubTator Central 是数据集还是工具?
两者兼有。它是一个持续运行的自动标注系统(工具/服务),其产出(批量注释)可下载,因而也具备数据集属性。它不对应一次性发布,而是活体资源。
Q2:它和 PubTator 什么关系?
PTC 是 PubTator 的第二代(升级版)。2013 原版只标摘要(5 类概念),2019 的 PTC 扩到全文、加细胞系、加深度学习消歧。文献中 PTC 亦称 PubTator2。
Q3:它和 PubTator 3.0 什么关系?
3.0 是第三代(2024),在 PTC 基础上加关系抽取(12 类)、语义/关系检索、AIONER/BioREx 新算法,规模扩到 36M 摘要 / 6M 全文。
Q4:谁做的、谁在维护?
NCBI / NLM / NIH 的文本挖掘研究组(Lu lab),通讯 PI Zhiyong Lu(陆志勇)。美国政府机构维护,自 2013 年持续至今。
Q5:发表在哪、怎么引?
PTC 引 NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389,PMID 31114887);3.0 引 NAR 2024;52(W1):W540–W546(doi:10.1093/nar/gkae235);起源引 NAR 2013;41:W518–W523(doi:10.1093/nar/gkt441)。
Q6:最大的卖点一句话?
把近三千万摘要 + 三百万全文的生物概念,做成了免费、无门槛、可程序化、公共领域的标注服务——医学 NLP 的默认语料底座。
Q7:它自己有什么局限?
自动标注非金标准;全文覆盖仅限 PMC 可文本挖掘子集;3.0 关系仅限摘要;概念类型有限(6 类实体/12 类关系);多口径数字需按版本对齐。
Q8:开源吗?
数据公共领域(无限制);3.0 全部组件源码开源(AIONER/GNorm2/tmVar3/BioREx/pubtator-gpt),归档 Zenodo CC0。
Q9:现在还能用 2019 的 PTC 吗?
能。Web 页 /research/pubtator/ 仍在线;但批量下载应走 PubTator3 目录(旧 PubTatorCentral FTP 已冻结)。
Q10:它是"活的"还是"静态的"?
活的。每日/每周/每月更新(视渠道)。正因如此,引用时须记录时点,复现时须归档快照。
B. 数据与获取
Q11:规模到底多大?
分版本:PTC 29M 摘要 + 3M 全文;官方页 ~30M + ~3M;3.0 36M + 6M;3.0 注释超 10 亿。按你要引的版本选择。
Q12:数据有哪几种格式?
BioC-XML(tar 归档)、JSON、PubTator tab 分隔(.gz)。大规模管线用 tab;要文档结构用 BioC-XML。
Q13:怎么下载全量?
ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/:全部实体 bioconcepts2pubtator3.gz(5.7G),关系 relation2pubtator3.gz(284M),BioC-XML BioCXML.0-9.tar.gz(10×20G)。
Q14:有 API 吗?
有。/research/pubtator/api(PTC)与 /research/pubtator3/api(3.0)。3.0 支持语义/关系/布尔查询。
Q15:HF 上能加载吗?
能,bigbio/pubtator_central(BigBIO 框架,需 pip install bioc)。但注意其基于 2022 源版本、引用旧 FTP 路径,数据新鲜度需自查。
Q16:能商用吗?
许可层面:可以。公共领域,NLM/美国政府未设使用与再复制限制。具体产品合规仍需使用者自判,但数据本身无许可阻力。
Q17:旧 PTC 的批量文件去哪了?
旧 PubTatorCentral/ 目录现仅剩 2020-11 的 BioCXML 快照,README 404。历史文件已由 PubTator3 目录取代。
Q18:怎么保证可复现?
下载时记录 FTP 文件 Last modified 日期(本轮 2026-08-17),归档你下载的那份副本,并在论文中声明快照时点。
C. 任务与质量
Q19:它做哪些任务?
NER(实体识别)+ NED(归一化到数据库 ID)+(3.0)RE(关系抽取)。BigBIO 登记为 NER + NED。
Q20:六类实体是什么、归一化到哪?
基因→NCBI Gene;变异→dbSNP;疾病→MeSH;化学→MeSH;物种→NCBI Taxonomy;细胞系→Cellosaurus。
Q21:它是人工标注的吗?
不是,全自动。多模型并行 + 深度学习消歧。故 NCBI 声明不担保准确性。
Q22:能当金标准用吗?
不能。它是弱监督/自动标注资源。严格评测请用 BioRED/BC5CDR/NCBI-Disease 等人工语料。
Q23:同一实体有多种写法怎么办?
这正是归一化(NED)解决的问题——不同写法映射到同一数据库 ID。反之同形异义(如 mTOR 人/鼠)由消歧模块按上下文裁决。
Q24:3.0 的关系有哪些?
12 类,覆盖 8 种实体对(chem-chem/chem-disease/chem-gene/chem-variant/disease-gene/disease-variant/gene-gene/variant-variant)。
Q25:关系能覆盖全文吗?
不能。3.0 关系抽取仅限摘要(算力约束),全文 RE 是未来工作。
D. 生态与应用
Q26:谁在用、用来干什么?
生物策展、基因优先排序、基因-表型关联、疾病共病、药物重定位、知识图谱富化、变异解读、LLM grounding。
Q27:和 ChatGPT 怎么结合?
把 PubTator API 接入 ChatGPT(GPT-4),让回答基于真实文献注释,显著提升真实性与可验证性;开源代码 ncbi-nlp/pubtator-gpt。
Q28:检索比 PubMed/Google Scholar 好吗?
3.0 论文报告:实体对查询下,PubTator 3.0 检索文章数更多、前 20 结果精度更高(语义检索优势)。
Q29:和 BioRED 什么关系?
BioRED 是 3.0 评测 NER 的人工语料(同为 NCBI Lu lab);也独立是生物医学 RE 基准(NER F1 89.3%,新型关系 RE F1 仅 47.7%)。
Q30:库内还有哪些相关条目?
BioRED(457)、BC5CDR(415)、CHEMDNER(450)、NCBI-Disease(425)、BC2GM(434)、MedMentions(390)、CRAFT(529)、PubMedQA(49)、S2ORC(370)、LitCovid(380)、CORD-19(104)。
Q31:本条目为什么叫 pubtator-central 而不是 pubtator3?
以官方在线实体名立条(NCBI 官方页至今主名仍为 PubTator Central),并以 PTC 为谱系支点;3.0 作为直接后继以专节(§7)收录。
Q32:只记住一件事的话?
PubTator Central = NCBI 的全自动生物医学文献实体标注公共服务,公共领域、三层可达、持续更新——是医学 AI 最省事的语料与 grounding 起点,但它是自动标注,不是金标准。
事实清单(硬事实 40 条)
- PubTator Central(PTC)是 NCBI 对 PubMed 摘要 + PMC 全文做全自动生物概念标注的服务/语料。
- 组织:NCBI / NLM / NIH(Bethesda, MD, USA);通讯作者 Zhiyong Lu(zhiyong.lu@nih.gov)。
- 三代谱系:PubTator(2013) → PubTator Central/PTC(2019, 亦称 PubTator2) → PubTator 3.0(2024)。
- 2013 论文:NAR 41(Web Server Issue):W518–W523,doi:10.1093/nar/gkt441,PMID 23703206,Europe PMC 引用 368。
- 2019 PTC 论文:NAR 47(W1):W587–W593,doi:10.1093/nar/gkz389,PMID 31114887,Europe PMC 引用 279。
- PTC 论文作者:Chih-Hsuan Wei*, Alexis Allot*, Robert Leaman, Zhiyong Lu(*共同一作)。
- PTC 论文时间:Received 2019-02-17 / Accepted 2019-04-30 / Published 2019-05-22 / Issue 2019-07-02。
- 2024 论文:NAR 52(W1):W540–W546,doi:10.1093/nar/gkae235,PMID 38572754,Europe PMC 引用 139。
- 3.0 论文作者:Wei CH, Allot A, Lai PT, Leaman R, Tian S, Luo L, Jin Q, Wang Z, Chen Q, Lu Z。
- PTC 规模:约 2900 万 PubMed 摘要 + 约 300 万 PMC 全文(PMC-TM 子集)。
- 官方页当前口径:~30M 摘要 + ~3M 全文。
- 3.0 规模:约 3600 万摘要 + 600 万全文;注释总量超 10 亿;12 类关系。
- 全文长度约为摘要的 40 倍;全文标注使总量扩大近四倍。
- 六类实体:基因/蛋白、遗传变异、疾病、化学物质、物种、细胞系。
- 归一化目标:NCBI Gene / dbSNP / MeSH / NCBI Taxonomy / Cellosaurus。
- PTC 工具:GNormPlus(基因)、tmVar 2.0(变异)、TaggerOne(疾病/化学/细胞系)、SR4GN(物种)。
- 3.0 工具:AIONER(统一 NER)、GNorm2、tmVar3、NLM-Chem、TaggerOne、BioREx(RE)。
- PTC 处理流水线:多 tagger 并行 → 深度学习消歧 → 存 MongoDB(Fig 1)。
- 3.0 处理流水线:AIONER → 专用 mapper → BioREx → MongoDB + Solr(Fig 2A)。
- 注释结构:span + 概念类型 + 登录号;实体文件 5 列(PMID/Type/Concept ID/Mentions/Resource)。
- 关系文件 4 列(PMID/Type/概念1/概念2)。
- 发布格式:BioC-XML / JSON / PubTator tab 分隔(.gz)。
- 许可:NCBI Public Domain Notice——United States Government Work,无使用与再复制限制。
- bio.tools 标为 Unlicense / Free of charge / Open access。
- PTC 更新:官方页 daily;3.0 论文 weekly;PubTator3 FTP README monthly。
- 原 PubTator 累计服务约 3 亿次 API 请求(2019 口径)。
- 3.0 关系 8 种实体对:chem-chem / chem-disease / chem-gene / chem-variant / disease-gene / disease-variant / gene-gene / variant-variant。
- 3.0 关系类型命名层含 Association / Positive_Correlation / Negative_Correlation / Co-treatment / Drug_interaction / Comparison / Conversion / Binding。
- 3.0 自述局限:关系仅限摘要、仅 12 类、自动抽取非完美。
- 3.0 检索:实体对查询下召回多于 PubMed/Google Scholar,前 20 精度更高。
- 3.0 集成 ChatGPT(GPT-4) 显著提升回答真实性与可验证性;代码
ncbi-nlp/pubtator-gpt。 - 3.0 源码归档 Zenodo 10.5281/zenodo.10839631(CC0)。
- PubTator3 FTP 实测(2026-08-17):bioconcepts2pubtator3.gz 5.7G;relation2pubtator3.gz 284M;BioCXML.0-9.tar.gz 10×20G(~200G);README.txt 6.9K(2023-09-09)。
- 各类型文件大小:chemical 1.7G / disease 2.0G / gene 721M / species 466M / mutation 111M / cellline 68M。
- 旧 PubTatorCentral FTP 现仅剩 PubTatorCentral_BioCXML/ 子目录(2020-11-06),README 404。
- NIH Research Festival 2024 poster 口径:1.6 billion entity + 33 million relation annotations。
- 第三方 2020 GitHub 快照:pmid 23,148,838;Disease 96.98M > Chemical 89.11M > Gene 50.09M > Species 36.15M > Mutation 2.75M > CellLine 1.94M 注释。
- BioRED(3.0 的 NER 评测语料):600 摘要,Brief Bioinform 2022;23(5):bbac282;NER F1 89.3%,新型关系 RE F1 47.7%。
- BigBIO/HF 打包
bigbio/pubtator_central:源版本 2022.01.08,BigBIO 版本 1.0.0,license: other(=NCBI_LICENSE),任务 NER+NED。 - 库内互链 rid:BioRED(457)、BC5CDR(415)、CHEMDNER(450)、NCBI-Disease(425)、BC2GM(434)、MedMentions(390)、CRAFT(529)、PubMedQA(49)、S2ORC(370)、LitCovid(380)、CORD-19(104)。
术语表(30 条)
| 术语 | 释义 |
|---|---|
| PubTator | NCBI 生物医学文献自动标注系统系列的统称 |
| PubTator Central(PTC) | 第二代,2019 发布,扩到全文,亦称 PubTator2 |
| PubTator 3.0 | 第三代,2024 发布,加关系抽取与语义检索 |
| NER | Named Entity Recognition,命名实体识别——从文本找出实体 span |
| NED / NEN | Named Entity Disambiguation/Normalization,实体消歧/归一化——链接到数据库标识 |
| RE | Relation Extraction,关系抽取——识别实体间的语义关系 |
| Bioconcept | 生物概念(基因/疾病/化学等) |
| Mention | 文本中对某实体的提及片段 |
| Span | 连续文本片段,注释的定位范围 |
| Concept ID | 概念在权威库中的登录号(如 NCBI Gene ID、MeSH ID) |
| PMID | PubMed 文献唯一标识 |
| PMC | PubMed Central,生物医学全文数据库 |
| PMC-TM | PMC Text Mining 子集(可文本挖掘的 OA 与作者手稿) |
| OA Subset | PMC Open Access Subset,开放获取子集 |
| GNormPlus / GNorm2 | 基因/物种识别与归一化工具(NCBI) |
| tmVar / tmVar 2.0 / 3.0 | 遗传变异识别与归一化工具(映射 dbSNP) |
| TaggerOne | 疾病/细胞系识别与归一化工具(NCBI) |
| SR4GN | 物种识别工具(PTC 阶段使用) |
| NLM-Chem | 化学实体识别工具(3.0 阶段使用) |
| AIONER | 3.0 的统一多类型 NER 深度学习模型 |
| BioREx | 3.0 的关系抽取系统 |
| BioC | 生物医学文本处理社区数据格式(互操作载体) |
| BioC-XML | BioC 格式的 XML 表示 |
| MeSH | Medical Subject Headings,医学主题词表(疾病/化学归一化目标) |
| Cellosaurus | 细胞系权威数据库(细胞系归一化目标) |
| NCBI Taxonomy | NCBI 物种分类数据库 |
| dbSNP | NCBI 单核苷酸多态性数据库(变异归一化目标) |
| Disambiguation | 消歧——裁决重叠/冲突标注 |
| Weak supervision | 弱监督——用自动/远程标注替代人工标注 |
| Grounding | 接地/事实锚定——让 LLM 输出基于可验证的真实来源 |
| RAG | Retrieval-Augmented Generation,检索增强生成 |
| BioRED | 生物医学关系抽取人工基准语料(600 摘要,NCBI) |
| BC5CDR | BioCreative V 化学-疾病关系语料 |
| CHEMDNER | 化学实体识别语料(BioCreative) |
| Public Domain | 公共领域——不受版权保护,可自由使用 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | PubTator Central |
| url_name | pubtator-central |
| 类型 | 生物医学文献自动实体/关系标注语料与在线服务(活体系统) |
| 本条目论文 | NAR 2019;47(W1):W587–W593(doi:10.1093/nar/gkz389) |
| 团队 | NCBI / NLM / NIH(Lu lab,通讯 Zhiyong Lu) |
| 规模(PTC) | 约 29M 摘要 + 3M 全文 |
| 许可 | NCBI 公共领域(无使用与再复制限制) |
| 获取 | Web + RESTful API + FTP(ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/) |
| 抓取时点 | 2026-09-30 |
| 库内互链 | biored(457)/bc5cdr(415)/chemdner(450)/ncbi-disease(425)/bc2gm(434)/medmentions(390)/craft(529)/pubmedqa(49)/s2orc(370)/litcovid(380)/cord-19(104) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 9 | 三代论文 OA + 官方页 + bio.tools + FTP 目录可索引;但版本多、名称近易混淆 |
| A 可获取性 | 10 | Web + API + FTP 三层无门槛、无注册、公共领域——本条目最强项 |
| I 可互操作 | 9 | BioC-XML/JSON/tab 多格式 + 标准数据库 ID(Gene/MeSH/dbSNP/Taxonomy/Cellosaurus);有 BigBIO 包装 |
| M 元数据质量 | 7 | README/论文表格完备;但多口径数字(规模/频率/总量)需按版本对齐,无统一版本号 |
| S 可持续性 | 9 | NCBI/NIH 政府机构长期维护,2013 至今持续更新;风险主要是自动标注随算法版本漂移 |
| 综合评级 | 8.8/10(高) | 可得性与许可近乎满分;扣分在版本治理(活体系统的可复现性依赖使用者归档) |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 29M 摘要 / 3M 全文 | NAR 2019 摘要 + 正文 | Europe PMC / PMC6602571 |
| 六类实体 + 工具名 | NAR 2019 正文 | PMC6602571 |
| 40 倍长度 / 4 倍标注 | NAR 2019 正文 | PMC6602571 |
| ~30M / ~3M 官方页口径 | NCBI 官方 docsum 页 | ncbi.nlm.nih.gov/research/pubtator/ |
| 36M / 6M / 超 10 亿 / 12 关系 | NAR 2024 摘要 | Europe PMC(DOI:10.1093/nar/gkae235) |
| 8 种实体对 / AIONER / BioREx | Zenodo 10839631 描述 | beta.explore.openaire.eu |
| 1.6B + 33M 注释 | NIH Research Festival 2024 poster | researchfestival.nih.gov |
| FTP 文件清单与大小 | 实抓 | ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/(2026-09-30) |
| 公共领域声明 | FTP README.txt 原文 | ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/README.txt |
| Unlicense | bio.tools 条目 | bio.tools/PubTator_Central |
| BioRED 数字 | Brief Bioinform 2022;23(5):bbac282 | PubMed 35849818 / OUP |
| BigBIO 打包 | HF card + pubtator_central.py | huggingface.co/datasets/bigbio/pubtator_central |
| 旧 FTP 冻结 | 实抓目录 | ftp.ncbi.nlm.nih.gov/pub/lu/PubTatorCentral/(仅 2020-11 BioCXML) |
附录 D:数据获取决策树
需求是什么?
├── 要立刻拿一批实体标注
│ └── FTP PubTator3/bioconcepts2pubtator3.gz(5.7G,公共领域,直接下)
├── 要程序化按需查询
│ └── 调 pubtator3/api(支持语义/关系/布尔查询)
├── 要关系数据
│ └── FTP PubTator3/relation2pubtator3.gz(284M,仅摘要关系)
├── 要文档结构完整的标注
│ └── FTP PubTator3/BioCXML.0-9.tar.gz(10×20G,~200G)
├── 要严格评测 NER/RE 模型
│ └── 用库内人工语料 BioRED(457)/BC5CDR(415)/NCBI-Disease(425),勿用 PubTator 当金标准
├── 要 LLM grounding
│ └── pubtator3/api + 参考 ncbi-nlp/pubtator-gpt
└── 要引用本资源
└── 本体 gkz389 / 关系检索 gkae235 / 起源 gkt441
附录 E:六类实体与下游用法
| 实体类型 | 归一化目标 | 典型下游用法 |
|---|---|---|
| 基因/蛋白 | NCBI Gene | 基因优先排序、靶点识别 |
| 遗传变异 | dbSNP | 变异解读、精准医学 |
| 疾病 | MeSH | 疾病共病、基因-表型关联 |
| 化学物质 | MeSH | 药物重定位、药物相互作用 |
| 物种 | NCBI Taxonomy | 模式生物筛选、物种特异性分析 |
| 细胞系 | Cellosaurus | 实验可复现性、细胞模型检索 |
附录 F:PubTator 数据处理骨架(代码)
# 示例:解析 PubTator tab 分隔实体文件
# 实体文件 5 列:PMID Type Concept_ID Mentions Resource
def parse_pubtator_entities(path):
"""逐行解析 PubTator tab 实体文件(gz 可先 gunzip)。"""
records = {}
with open(path, encoding="utf-8") as f:
for line in f:
cols = line.rstrip("\n").split("\t")
if len(cols) < 5:
continue
pmid, ctype, cid, mentions, resource = cols[:5]
records.setdefault(pmid, []).append({
"type": ctype, # gene/disease/chemical/species/mutation/cellline
"concept_id": cid, # NCBI Gene / MeSH / dbSNP / Taxonomy / Cellosaurus
"mentions": mentions.split("|"),
"resource": resource, # 来源资源(如 MeSH、gene2pubmed)
})
return records
# 注意:BioC-XML 格式需用 bioc 库解析;API 交互建议走 pubtator3/api
附录 G:关系类型与实体对对照
| 实体对 | 关系语义示例 |
|---|---|
| chemical–chemical | 药物-药物相互作用 |
| chemical–disease | 化学诱导疾病 / 治疗 |
| chemical–gene | 药物靶点 / 表达调控 |
| chemical–variant | 药物反应相关变异 |
| disease–gene | 致病基因 / 关联 |
| disease–variant | 致病变异 |
| gene–gene | 相互作用 / 共表达 |
| variant–variant | 连锁 / 联合效应 |
附录 H:三代版本引用规范
| 引用目的 | 推荐文献 | DOI |
|---|---|---|
| 引 PTC 本体与全文升级 | NAR 2019;47(W1):W587–W593 | 10.1093/nar/gkz389 |
| 引关系抽取与语义检索 | NAR 2024;52(W1):W540–W546 | 10.1093/nar/gkae235 |
| 引系统起源 | NAR 2013;41(Web Server Issue):W518–W523 | 10.1093/nar/gkt441 |
| 引数据快照 | 注明 FTP Last modified 日期 | — |
附录 I:口径冲突登记表(与 §9 对照)
| # | 项 | 口径 A | 口径 B | 口径 C | 处理 |
|---|---|---|---|---|---|
| 1 | 摘要数 | 29M(PTC) | ~30M(页) | 36M(3.0) | 按版本 |
| 2 | 全文数 | 3M(PTC) | ~3M(页) | 6M(3.0) | 按版本 |
| 3 | 更新频率 | daily(页) | weekly(论文) | monthly(FTP) | 按渠道 |
| 4 | 注释总量 | >1B(论文) | 1.6B+33M(poster) | — | 论文为主 |
| 5 | 概念类型 | 6 类(现行) | 9 type(2020 快照) | — | 6 类为准 |
| 6 | 旧 FTP | 老教程路径 | 实抓已冻结 | — | 走 PubTator3 |
| 7 | HF 许可 | other | 实为公共领域 | — | other=兜底 |
附录 J:与其他 NLP 语料的定位对照
| 语料 | 性质 | 规模 | 用途定位 |
|---|---|---|---|
| PubTator Central | 自动标注 | 千万篇级 | 弱监督/预标注/grounding |
| BioRED | 人工金标准 | 600 摘要 | RE/NER 严格评测 |
| BC5CDR | 人工金标准 | 1,500 篇 | 化学-疾病关系评测 |
| NCBI-Disease | 人工金标准 | 793 摘要 | 疾病 NER 评测 |
| BC2GM | 人工金标准 | 20,000 句 | 基因 NER 评测 |
| MedMentions | 人工金标准 | 4,392 摘要 | 实体链接(NED)评测 |
| S2ORC | 原始语料 | 千万篇级 | 全文检索/预训练 |
附录 K:检索路径示范
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| PTC 论文 | “PubTator central” AND “full text” | NAR 47(W1):W587 |
| 3.0 论文 | “PubTator 3.0” AND “relation” | NAR 52(W1):W540 |
| 官方数据 | NCBI PubTator official site | ncbi.nlm.nih.gov/research/pubtator/ |
| 批量数据 | PubTator3 FTP | ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/ |
| 许可条款 | PubTator3 README public domain | ftp README.txt |
| 下游用例 | PubTator biocuration / gene prioritization | 引用 PTC 的论文 |
附录 L:缩写速查
| 缩写 | 全称 |
|---|---|
| PTC | PubTator Central |
| NCBI | National Center for Biotechnology Information |
| NLM | National Library of Medicine |
| NIH | National Institutes of Health |
| NER | Named Entity Recognition |
| NED/NEN | Named Entity Disambiguation/Normalization |
| RE | Relation Extraction |
| PMC | PubMed Central |
| PMC-TM | PMC Text Mining subset |
| OA | Open Access |
| MeSH | Medical Subject Headings |
| BioC | Biomedical text processing community format |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| RAG | Retrieval-Augmented Generation |
| GPT | Generative Pre-trained Transformer |
附录 M:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI(三代论文)+ PMID + FTP URL |
| F2 富元数据 | ✅ | 论文表格 + FTP README + API 文档 |
| A1 可访问协议 | ✅ | Web + API + FTP,全部无门槛 |
| A2 元数据可访问 | ✅ | 论文 OA + README 公开 |
| I1 互操作格式 | ✅ | BioC-XML / JSON / tab + 标准库 ID |
| I2 词汇表引用 | ✅ | MeSH / NCBI Gene / dbSNP / Cellosaurus 等标准词表 |
| R1 来源溯源 | ✅ | 注释带 PMID + Resource 来源标记 |
| R3 可复现流程 | ⚠️ | 活体系统无版本号,需使用者归档快照 |
| AI-Ready 综合 | 高 | 可得性与许可满分;可复现性依赖快照管理 |
附录 N:本地快照与归档建议(代码骨架)
# 1) 记录下载时点与文件清单(可复现性关键)
curl -sL https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/ > snapshot_listing_$(date +%Y%m%d).html
# 2) 下载所需文件
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/bioconcepts2pubtator3.gz
wget https://ftp.ncbi.nlm.nih.gov/pub/lu/PubTator3/relation2pubtator3.gz
# 3) 校验并归档(保留原始压缩包 + 时点记录)
md5sum bioconcepts2pubtator3.gz relation2pubtator3.gz > checksums_$(date +%Y%m%d).txt
附录 O:本条目生产档案
- 生产通道:教训 12 存在性核验(三轮精确搜索 + NCBI/Europe PMC/bio.tools/FTP 实抓,均证实)
- 事实研究:WebSearch×6 + WebFetch + Europe PMC API×4 + FTP 实抓×3(PubTator3/PubTatorCentral/README)
- FACTS.md:writing/pubtator-central/FACTS.md 九节
- 成稿方式:五块直写拼接(part1-5),每 part 尾留空行,cat 连接
- 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- description:成稿时即 ≤170 字符(140 字符)
- title:带站点后缀
| 千方病案医数集(91 字符) - 互链计划:新篇正文内链 11 处(BioRED/BC5CDR/CHEMDNER/NCBI-Disease/BC2GM/MedMentions/CRAFT/PubMedQA/S2ORC/LitCovid/CORD-19)
附录 P:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 新版本发布 | PubTator 4.0 / 重大算法更新 | 更新版本谱系与规模 | 1 |
| 主站数字更新 | 官方页/API 计数显著变化 | 更新规模口径与时点 | 2 |
| 旧 FTP 恢复/迁移 | PubTatorCentral 目录状态变化 | 更新获取路径 | 3 |
| 关系统计更新 | 3.0 关系抽取扩展到全文 | 更新 §7.5 局限 | 4 |
| 库内新互链 | 新增相关 NLP 语料条目 | 补互链 | 5 |
附录 Q:引文规范
@article{wei2019pubtatorcentral,
title = {PubTator central: automated concept annotation for biomedical
full text articles},
author = {Wei, Chih-Hsuan and Allot, Alexis and Leaman, Robert and Lu, Zhiyong},
journal = {Nucleic Acids Research},
volume = {47},
number = {W1},
pages = {W587--W593},
year = {2019},
doi = {10.1093/nar/gkz389}
}
@article{wei2024pubtator3,
title = {PubTator 3.0: an AI-powered literature resource for unlocking
biomedical knowledge},
author = {Wei, Chih-Hsuan and Allot, Alexis and Lai, Po-Ting and Leaman, Robert
and Tian, Shubo and Luo, Ling and Jin, Qiao and Wang, Zhizheng
and Chen, Qingyu and Lu, Zhiyong},
journal = {Nucleic Acids Research},
volume = {52},
number = {W1},
pages = {W540--W546},
year = {2024},
doi = {10.1093/nar/gkae235}
}
@article{wei2013pubtator,
title = {PubTator: a web-based text mining tool for assisting biocuration},
author = {Wei, Chih-Hsuan and Kao, Hung-Yu and Lu, Zhiyong},
journal = {Nucleic Acids Research},
volume = {41},
number = {Web Server issue},
pages = {W518--W523},
year = {2013},
doi = {10.1093/nar/gkt441}
}
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以 NAR 2019(PTC 本体)、NAR 2024(PubTator 3.0)、NAR 2013(起源)、NCBI 官方页、PubTator3 FTP README 与实抓、bio.tools 条目为源;多口径数字(文档规模 29M/30M/36M、更新频率 daily/weekly/monthly、注释总量 1B/1.6B)已在 §9 与附录 I 逐条存照,引用前须按版本与时点对齐。条目与库内 BioRED(rid 457)、BC5CDR(rid 415)、CHEMDNER(rid 450)、NCBI-Disease(rid 425)、BC2GM(rid 434)、MedMentions(rid 390)、CRAFT(rid 529)、PubMedQA(rid 49)、S2ORC(rid 370)、LitCovid(rid 380)、CORD-19(rid 104)等条目互链,构成生物医学 NLP 语料与知识图谱家族的完整检索面。后续维护触发点见附录 P。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- biored — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 关系抽取 / 知识图谱
- craft — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 知识图谱 / 评测基准
- genia — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 关系抽取 / 评测基准
- medmentions — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 知识图谱
- bc5cdr — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别 / 关系抽取
- chemprot — 共享标签:医疗NLP / 生物医学文献 / 关系抽取
- s2orc — 共享标签:医疗NLP / 生物医学文献 / 知识图谱
- cometa — 共享标签:医疗NLP / 命名实体识别 / 知识图谱
- ncbi-disease — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别
- jnlpba — 共享标签:医疗NLP / 生物医学文献 / 命名实体识别
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

