信息速览
INFOBOX — Claimify 一屏速览
维度 内容 本质 Microsoft Research Claimify 主张抽取方法的官方配套标注数据集——方法之外的独立可下载语料 团队 Microsoft Research(Redmond);方法作者 Dasha Metropolitansky、Jonathan Larson(论文署名二人) 论文 “Towards Effective Extraction and Evaluation of Factual Claims”,arXiv:2502.10855(2025-02)→ ACL 2025 主会 2025.acl-long.348,pp.6996-7045,DOI 10.18653/v1/2025.acl-long.348 数据 6,490 个标注句子(data.csv 6,491 行含表头,2,258,269 bytes 单文件 CSV);396 个 Copilot 回答 / 393 个唯一问题;平均每回答 16.4 句 字段 五列: answer_id, question, sentence_id, sentence, contains_factual_claim标签 二分类:True 3,833 句(59.1%)含可验证事实主张 / False 2,657 句(40.9%)(README 口径 59%) 上游 Li et al. Self-Checker(NAACL 2024 Findings,arXiv:2305.14623)396 条 Copilot 回答语料的句子级二次标注——396 唯一 answer_id 与论文精确吻合(本库独立考据,README 不提上游) 方法指标 四阶段流水线(切句构造上下文 → Selection → Disambiguation → Decomposition);论文宣称 99% entailment / 87.6% coverage / 96.7% precision 医学关联 通域语料,医学主题句占 8.5%(551/6,490,关键词法实测),其中 415 句含可验证主张;人工心脏(Jarvik-7/Barney Clark)等心血管史问答线密度最高 获取 HuggingFace microsoft/claimify-dataset公开直链(HF 主站被封锁环境走 hf-mirror.com);ModelScope 同名同步上架许可 数据集 CDLA-Permissive-2.0(宽松);方法代码仅研究用途不可商用——两套许可各自独立,禁止互相引申 时点快照 HF downloads 82 / likes 7(2026-09-28 抓取);仓库 lastModified 2025-08-14 库内互链 MedNLI(rid 648,NLI 蕴含)、EMR-QA(rid 139)、EHRSQL(rid 713)、HealthSearchQA(rid 492)、BLURB(rid 471)、S2ORC(rid 370)
Claimify 是一个"先教机器提问题,再教机器查答案"的数据集工程:在大语言模型(LLM)输出的自动事实核查链条里,第一步不是检索证据,而是把一段自由生成的回答拆成一格格可独立核查的主张——拆不好,后面全部白查。Claimify 数据集就是 Microsoft Research 为这一步公开的官方标注语料:396 条 Microsoft Copilot 的真实问答输出被切成 6,490 个句子,每个句子由人工标注"是否包含可验证的事实主张",其中 59.1% 的句子拿到了 True。它配套的方法论文发表于 ACL 2025 主会,提出了一套四阶段的 LLM 主张抽取流水线;而语料本身则血统更早——它是对上游 Self-Checker/BingCheck 论文同一批 Copilot 回答的句子级二次标注,这个上游关系官方 README 只字未提,需要靠 396 这个数字指纹交叉比对才能确证(§4.3)。
对医疗 AI 从业者,这个条目有三重阅读价值。其一,它是通域 LLM 输出核查的入门语料,医学问答输出核查是其官方认可的应用场景之一,语料中 8.5% 的句子直接涉及医学主题(§7.3);其二,它是"方法代码保守、数据开放"的发布样本——流水线代码仅限研究用途,但 6,490 句标注语料以 CDLA-Permissive-2.0 宽松许可公开直链,可以直接训练或评估你自己的主张抽取器(§6);其三,它是库内罕见的"LLM 生成文本的标注语料"品类——标注对象不是人写的病历或文献,而是模型自己的输出,这在评测口径上带来一系列独特坑点(§10)。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——单文件 CSV 2.25 MB,无注册无申请,HF 直链即可;被封锁环境走 hf-mirror.com 镜像(§6.2 有实操命令)。
- 关心方法与指标:直奔 §3 四阶段流水线与 §5 指标——注意 99% entailment / 87.6% coverage / 96.7% precision 均为论文自报口径,无独立复现。
- 想搞清 6,490 / 3,840 / 3,833 三个数字的关系:直奔 §4.3 与坑 1——三个数字属于三种不同切分与标注口径,混用即错。
§0 导读:这个数据集解决什么问题
LLM 的幻觉问题有一个常见的核查架构错觉:以为"拿回答去搜索引擎查一下"就够了。实际操作里,一段几百字的 LLM 回答往往同时混合了可核查事实、不可核查的评价、条件性表述和模糊指代——直接整段丢给核查器,检索引擎会被不可核查部分淹没,NLI(自然语言推理)模型会被歧义指代绊倒。因此严肃的 LLM 输出核查管线几乎都长同一个样子:先把回答切句、筛出含可验证内容的句子、消解歧义、再拆成原子主张,然后才进入检索与裁决。这个前置环节就叫主张抽取(claim extraction),它是整条管线的漏斗口:漏掉一个主张,核查就有盲区;放进一个不可核查的句子,下游就会被噪声污染。
Claimify 的回答分两层。第一层是方法:Microsoft Research 在 ACL 2025 主会论文中提出的四阶段流水线——句子切分与上下文构造(sentence splitting and context creation)、选择(Selection)、消歧(Disambiguation)、分解(Decomposition)——逐句决定"要不要、改写成什么",论文自报 99% entailment(抽取主张被源句蕴含)、87.6% coverage(可验证内容覆盖率)、96.7% precision(排除不可验证内容的精确率)。第二层是数据:为了让这套流水线(以及任何人的竞争方法)可以被量化评估,团队把 396 条 Microsoft Copilot 真实问答输出切成的 6,490 个句子逐句标注"是否含可验证事实主张",形成单文件 CSV 的标注语料——这就是本条目的本体 microsoft/claimify-dataset。3,833 个 True 句告诉你"LLM 回答里可核查内容的真实密度",2,657 个 False 句则是天然的"不可核查干扰项"训练素材。
§0 读法三则:
- 这个条目是"方法论文 + 标注数据集 + 方法代码库"三合一,但三者发布姿态完全不同:论文开放获取(ACL Anthology)、数据集宽松许可公开直链(HF)、方法代码仅研究用途不可商用(GitHub)——引用与复用前务必分清你在用哪一层(§6)。
- 全文一手数字(行数、字节数、标签计数、句长统计)均为本库于 2026-09-28 经 hf-mirror.com 镜像实抓 data.csv 逐行核验的结果;论文与博客数字均标注"论文口径"或"博客口径",两者在 59% vs 59.1% 等处有意保留双口径(坑 6)。
- 检索时若把"Claimify"当作数据集名去 GitHub 搜,找到的是方法代码仓库(无数据文件);数据集在 HuggingFace——这个名实分离是本条目第一大坑(坑 2)。
§1 数据集速览:十问十答
Q1:Claimify 数据集到底是什么?
6,490 个人工标注的句子,每句来自一条 Microsoft Copilot 的真实问答输出,标签为二值字段 contains_factual_claim(是否包含可验证事实主张)。它是 Claimify 主张抽取方法的官方配套评测/训练语料,不是方法代码本身,也不是证据核查标注。
Q2:数字从哪来,可靠吗?
本库 2026-09-28 经 hf-mirror.com 下载 data.csv 原文件逐行核验:6,491 行(1 表头 + 6,490 数据行)、2,258,269 bytes,与 README 宣称的 6,490 句精确一致;标签分布 True 3,833 / False 2,657(59.06%,README 整数口径 59%)。所有硬数字一手可复算(附录 F 给出复算代码)。
Q3:为什么是 396 个回答?这个数字眼熟。
眼熟是对的。上游论文 Self-Checker(NAACL 2024 Findings,Li et al.,arXiv:2305.14623)的 BingCheck 标注语料恰好是 396 条 Microsoft Copilot 回答。本库对 data.csv 实测 unique answer_id 恰为 396——两个独立来源精确吻合,构成"本数据集是对同一批 Copilot 回答的句子级二次标注"的最强证据。官方 README 对此只字未提,故此结论为本库考据(§4.3 存照)。
Q4:一句话里标了什么?
一个布尔值:该句是否包含可验证的事实主张。"包含"可以是全部(纯事实句)也可以是部分(混合句)——混合句也被标 True。它不区分句子里有几条主张、也不标注真伪与证据,那些是下游核查器的活。
Q5:六千多句都是什么内容?
通域问答:历史(人工心脏、心脏移植)、经济、气候、科技、医疗等主题均有分布,主题由 393 个真实用户问题决定。医学主题句实测占 8.5%(551/6,490,20 词关键词表命中法),其中 415 句标 True——密度不低,但不要把它当医学专用语料(坑 8)。
Q6:句子是怎么切出来的?
上游 Copilot 回答按句子切分(含 Markdown 结构处理),平均每回答 16.4 句,sentence_id 从 0 计数、最大到 46。切分标准继承自上游 BingCheck 语料,本数据集未重新切分——这决定了它测的是"给定切分下的筛选能力"而非"切分能力"(§3.2)。
Q7:Claimify 方法本身在论文里表现如何?
论文自报三指标:99% entailment(抽取出的主张被源句蕴含的比例)、87.6% coverage(可验证内容覆盖率)、96.7% precision(排除不可验证内容的精确率)。对比方法为 AFaCTA、Factcheck-GPT、VeriScore、DnD、SAFE 五件套。全部为作者自报口径,无独立第三方复现(§5.4)。
Q8:许可是什么?能商用吗?
数据集本体 CDLA-Permissive-2.0——类比 CC BY 宽松度、允许商用再分发(附录 G 细读)。但配套方法代码(GitHub microsoft/claimify)按官方博客脚注"仅研究用途、不可商用"。数据随便用,代码不行,两套许可互不引申(坑 5)。
Q9:和库内其他 NLP 条目什么关系?
它是"LLM 生成文本的标注语料",库内 MedNLI(rid 648)标注的是人工书写的临床前提-假设对,HealthSearchQA(rid 492)收集的是用户真实健康搜索问题但无标注,EMR-QA(rid 139)/EHRSQL(rid 713)面向电子病历问答——claimify 是唯一一个"标注对象是 LLM 输出"的条目(§9)。
Q10:为什么它对 AI-Ready 重要?
它是可获取性光谱"公开直链"档的样本:单文件 CSV、无注册墙、宽松许可、五列 schema 自明——机器可直接拉取入库。失分点在元数据:无逐字段数据字典、无版本号、上游关系不透明。综合评级见附录 B DAIMS 表。
§2 数据构成与规格
2.1 规模与文件构成
Claimify 数据集仓库(microsoft/claimify-dataset)极简:三个文件——.gitattributes、README.md、data.csv。全部内容就是一个 CSV:
| 文件 | 实测大小(2026-09-28 经 hf-mirror.com) | 说明 |
|---|---|---|
| data.csv | 2,258,269 bytes(约 2.25 MB) | 唯一数据文件,6,491 行 = 1 表头 + 6,490 数据行 |
| README.md | 数据集卡(任务、规模、标签口径、引用) | 未披露上游来源与标注协议细节 |
| .gitattributes | — | 仓库配置 |
README 宣称规模为"6,490 句标注语料,59% 含可验证事实主张"——两个数字与 data.csv 逐行实测精确吻合(6,490 行 ✓;3,833/6,490 = 59.06% → 整数口径 59% ✓)。这是少见的"宣传口径与文件实体零漂移"数据集,无需在本条目存证差异表,但原因也不难理解:数据是方法论文发表后补发布的(论文 2025-07 见刊,仓库 lastModified 2025-08-14),发布时方法与指标都已定稿。
一个元数据口径细节存照:HF API 报告的仓库 usedStorage 为 560,031 bytes,而 data.csv 实体 2,258,269 bytes——前者是仓库计量口径(LFS/去重统计),后者是下载实体大小,两者相差 4 倍属正常现象,自动化采集时以实体文件为准,勿把 usedStorage 当数据大小写入(坑 9)。
2.2 五列 schema 与字段规范
data.csv 五列,字段名与语义如下:
| 列名 | 类型 | 语义 | 实测值域 |
|---|---|---|---|
| answer_id | 字符串 | 一次 Copilot 回答的唯一标识 | 396 个唯一值 |
| question | 字符串 | 该回答对应的原始用户问题 | 393 个唯一值 |
| sentence_id | 整数 | 回答内句子序号,从 0 计数 | 0-46 |
| sentence | 字符串 | 切分后的回答原句(含 Markdown 残迹) | 长度 1-1,111 字符 |
| contains_factual_claim | 布尔 | 是否包含可验证事实主张 | True 3,833 / False 2,657 |
四条字段使用规范:
- 主键是 (answer_id, sentence_id) 组合——同一 answer_id 下 sentence_id 连续递增,可用 sentence_id 还原句序,但不能据此还原原文的段落与 Markdown 结构(列表标记、标题层级未单独存列,仅以符号残留在 sentence 文本内)。
- question 在同一 answer_id 内不变;跨 answer_id 有重复(393 问题 < 396 回答),做去重时按 question 文本而非 answer_id。
- contains_factual_claim 在 CSV 中以 True/False 字面量存储,pandas 读取后自动转 bool;用 CSV 模块手写解析器时注意大小写。
- sentence 保留原回答中的大小写、标点与内嵌符号(如美元金额、百分比、引号),未做归一化——这既是麻烦(极端句长未清洗,坑 7)也是好事(上下文未被 editorial 破坏,句法消歧研究可直接用)。
2.3 标签分布与句子级口径
| 标签 | 句数 | 占比(实测) | 占比(README 口径) |
|---|---|---|---|
| True(含可验证事实主张) | 3,833 | 59.1% | 59% |
| False(不含) | 2,657 | 40.9% | —(未单独披露) |
| 合计 | 6,490 | 100% | — |
这个 59:41 的比例本身就是一条信息:Microsoft Copilot 的真实回答里,约六成句子含有可独立核查的事实内容。对构建 LLM 输出核查系统的人,这个分布告诉你漏斗口的粗细——一个典型的 Copilot 级回答,核查器需要处理的"可核查原料"大约是回答长度的六成。对训练二分类器的人,59:41 的不平衡度温和(不存在需要过采样的极端偏斜),可以直接按原分布使用。
但要注意"句子级口径"的三个限制。其一,混合句被整体标 True——一句"疫苗于 1796 年由 Jenner 发明,这一发现改变了医学"里既有可核查事实也有评价性半句,标签不拆分句内成分,所以它测不出"句子内主张边界识别"能力。其二,False 不等于错误——False 句只是不含可验证事实主张(评价、指令、过渡句、条件句),不是"被证伪的句子",把它当"谣言句"用是方向性错误(坑 1 的姊妹误区)。其三,标注的是句子而非主张——一句可能含多条主张(分解后),本数据集不提供主张级切分,主张级评测需用方法流水线自行生成后对照(§3.5)。
2.4 396 与 393:上游语料的数字指纹
data.csv 有两个"计数指纹",合在一起几乎锁死了它的上游出身:
| 指标 | 本库实测(data.csv 逐行) | 上游论文口径(Self-Checker,NAACL 2024 Findings) | 吻合 |
|---|---|---|---|
| unique answer_id | 396 | “396 条 Microsoft Copilot(新 Bing)实际回答” | 精确 |
| unique question | 393 | 论文未单独披露问题数 | 无法直接比对 |
| 平均每回答句数 | 16.4(6,490/396) | 论文口径为 9.7 claims/回答(主张级,非句子级) | 口径不同,不冲突 |
396 这个数字的分量在于:它是上游 BingCheck 标注集的回答数(每条回答配有证据支持度四分类标注),而 claimify-dataset 对同一批回答做了另一种标注。两条证据链相互独立(HF README vs NAACL 论文),数字精确到个位吻合,且 README 未提上游——因此"396 = 上游语料复用"的判断是本库的独立考据结论,不是官方声明(FACTS.md §5 存照;引用本结论时请注明考据出处)。
393 对 396 的 3 个差额官方未解释。合理推测是存在少量"同一问题多次提问"或"同一回答服务多个问题入口"的映射,但由于 question 文本去重后与 answer_id 去重后数目不等,映射方向无法从数据本身还原——这 3 个差额作为遗留疑点存照(坑 3、FACTS.md §9)。对使用者的实际影响很小:把 answer_id 当采样单位、question 当去重字段即可,不必依赖两者的一一对应。
2.5 句长分布与极端值
| 统计量 | 实测值(2026-09-28) |
|---|---|
| 平均句长 | 123.2 字符 |
| 最短 | 1 字符 |
| 最长 | 1,111 字符 |
| sentence_id 值域 | 0-46(即单回答最多 47 句) |
三个统计量各有一条使用警示。平均 123.2 字符对英文文本约等于一个中等长度的完整句,说明切分粒度接近常规句法切分而非逗号级碎片——适合做句级二分类。最短 1 字符意味着语料里有标点残句(孤立句号、破折号等切分副产物),训练前应设最小长度过滤;最长 1,111 字符则是"切不动的长句"(典型如含多个分号的长列举句),这类句子对标注者本身就是挑战——一个 1,111 字符的句子标一个 True/False,粒度失配显而易见,这也是"句子级标注是折中"的直接证据(§8.1)。sentence_id 上限 46 说明最长回答约 47 句,与上游论文"平均 391.5 tokens/回答"的体量互相印证。
2.6 与上游 Self-Checker/BingCheck 语料的关系边界
理清"同一批回答、三种数字口径"的边界,是使用本数据集前最重要的一次概念对账:
| 语料 | 切分单元 | 标注内容 | 数字 | 出处 |
|---|---|---|---|---|
| Self-Checker / BingCheck(上游) | 回答内的 claim(主张,自定切分) | 证据支持度四分类:Supported / Partially Supported / Refuted / Not Supported | 396 回答 / 3,840 claims / 每 claim 配 6.2 条证据句 | NAACL 2024 Findings,pp.163-181,arXiv:2305.14623 |
| claimify-dataset(本条目) | 句子(句法切分) | 是否含可验证事实主张(二分类) | 396 回答 / 6,490 句 / 其中 3,833 True | HF microsoft/claimify-dataset |
| Claimify 方法输出 | 主张(分解后原子句) | 无人工标注(论文用 LLM 评指标) | — | ACL 2025 主会论文 |
三个数字——3,840、6,490、3,833——分别是"上游主张级标注总数"“本集句子级总数”“本集 True 句数”。它们不是同一件事的三种说法,而是同一批 396 回答在不同切分单元与标注任务下的三套计数。任何把 3,840 说成"claimify-dataset 的标注数"或把 6,490 说成"BingCheck 语料规模"的引用都是错的(坑 1,FACTS.md §9 第一条存照)。另一个边界:上游标注含证据与真伪信息(Refuted 等),本集不含——需要真伪标签时必须回到上游论文口径,本集无法替代;反之,上游未公开独立下载渠道(论文附录口径),本集是这批 Copilot 回答在 HF 上唯一的可下载化身。
§3 方法流水线:Claimify 四阶段
3.1 方法定位:数据集背后的那台机器
本条目本体是数据集,但理解数据集的用途必须理解方法——数据集是 Claimify 流水线的官方评测基准,也是其"卖点指标"(99% entailment 等)的测量场地。方法的一句话概括:输入 question-answer pair(用户问题 + LLM 回答全文),输出一组独立可核查、无歧义、被源文完全蕴含的事实主张。论文作者为 Microsoft Research 的 Dasha Metropolitansky(Senior Research Data Scientist)与 Jonathan Larson(GraphRAG 团队成员背景),二人署名。代码开源在 GitHub microsoft/claimify(仅研究用途),示例生成使用 GPT-4o。
与同类系统相比,论文与官方博客反复强调的差异化只有一条:识别源文多义性,且仅在高置信正确解读时才抽取主张——歧义无法消解的句子宁可不抽取(标 “Cannot be disambiguated”),也不冒着抽错的风险产出。博客原文称其为"据我们所知首个"做到此点的 claim extraction 系统。
3.2 阶段一:句子切分与上下文构造
流水线第一步把回答切成句,并为每句构造可配置的上下文:邻近句子(前后邻句窗口)加上 Markdown 标题层级等结构元数据。这一步的设计要点是"句子不孤立看"——"它降低了 30% 的成本"里的"它"指什么,只有结合上下文才能判断。对使用本数据集者的含义:claimify-dataset 的句子级标注隐含假设了上下文可用,但 data.csv 只存了句子本身与 question——标注者在看原上下文(上游语料的完整回答)时判的标签,而你拿到的是去上下文的裸句。做训练时这是标准配置(模型也不该依赖未提供的上下文);做标签复核时则要意识到,个别看似标错的句子可能是上下文依赖的合理标注(§10 坑 4 相关)。
另注意:切分本身不在本数据集的评测范围内——句子是上游 BingCheck 语料继承的切分,Claimify 流水线的输入也是同样的切分。也就是说,数据集测的是"给定切分下筛选与改写的能力", Sentence splitting 阶段在本数据集口径里是前置固定件而非被评对象。
3.3 阶段二:Selection
第二步用 LLM 判断每个句子是否含可验证内容:不含的句子直接输出 “No verifiable claims” 丢弃;混合句(既含可核查事实又含评价/指令的句子)被改写为只保留可验证成分的形式。这一步对应本数据集的核心标注任务——contains_factual_claim 的二分类本质上就是 Selection 阶段的人工金标准:3,833 个 True 句是"应该通过 Selection"的句子,2,657 个 False 句是"应该被丢弃"的句子。论文自报的 96.7% precision 主要在这一步产生("排除不可验证内容"的精确率)。
3.4 阶段三:Disambiguation
第三步处理通过 Selection 的句子中的歧义:指代不清(“他”“该方案”)、范围模糊(“许多研究”)、时间锚点缺失(“去年”)等。歧义可经上下文消解的句子被改写为自足形式(代词换实体、模糊量词换明确指称);不可消解的句子被标记 “Cannot be disambiguated” 并剔除。这一步是论文宣称的差异化能力所在,也是为什么本数据集里一些含事实成分的句子可能在上游实操中被放弃——"不可核查"与"可核查但歧义"在句子级标签里都落在 True/False 的粗粒度之内,Disambiguation 的细粒度决策只有方法流水线能看到。
3.5 阶段四:Decomposition
最后一步把无歧义句子分解为原子主张,并在分解时保留核查所需的上下文(时间、地点、主体限定语),避免"2020 年 X 公司营收 10 亿美元"被拆成"营收 10 亿美元"这种失去核查锚点的碎片。每条输出主张要求:独立可核查、被源句完全蕴含、上下文自足。论文自报的 99% entailment(主张被源句蕴含)与 87.6% coverage(源句可验证内容被主张覆盖的比例)主要度量这一步的保真与完整。
四阶段串起来看,本数据集与流水线的对应关系一目了然:
| 流水线阶段 | 输入 | 输出 | 对应数据集口径 |
|---|---|---|---|
| 1. 句子切分与上下文构造 | question-answer pair | 带上下文的句子队列 | sentence + question 列(上下文未随数据发布) |
| 2. Selection | 每句 | 通过 / 丢弃 / 混合句改写 | contains_factual_claim True/False(人工金标准) |
| 3. Disambiguation | 通过的句子 | 无歧义句 / 改写 / 剔除 | 数据集不含此粒度 |
| 4. Decomposition | 无歧义句 | 原子主张集合 | 数据集不含此粒度 |
3.6 主张质量三原则与示例生成
论文给"好主张"下的定义是三原则:捕获全部可验证内容(coverage 维度)、每条主张被源句完全蕴含(entailment 维度,不许外推)、保留核查所需上下文(可核查性维度,不许丢锚点)。三原则分别对应三个自报指标的分子。示例与评估生成使用 GPT-4o;对比方法五件套为 AFaCTA、Factcheck-GPT、VeriScore、DnD、SAFE(官方博客脚注 3 原文列举)——均为 2024-2025 年主张抽取/事实核查前置环节的代表系统,横向对比细节见论文正文(§5.2 只存指标与口径,不复述论文表格全文)。
对医疗 AI 的一个注脚:三原则在医学场景的优先级排序会变。"保留核查所需上下文"在通用场景是体验问题(核查员多查一次),在医学场景是安全问题——"甲氨蝶呤可用于类风湿关节炎"丢掉剂量锚点后可能变成可核查但危险的表述。用本数据集训练医学场景主张抽取器时,建议对含药物、剂量、时间锚点的句子做增强加权(§7.3 医学句清单可直接复用)。
§4 标注体系:本数据集到底标了什么
4.1 句子级二分类任务定义
把任务定义写成一行:给定(question, sentence)对,判断 sentence 是否包含至少一条可由外部证据核查的事实主张。三个限定词各有含义:
- “至少一条”——存在量词:句子含一条可核查主张即为 True,哪怕是混合句的十分之一内容。
- “可核查”(verifiable)——可行性判断而非真伪判断:句子陈述的事实"原则上存在客观答案"即算,不要求已核查、更不要求为真。“地球是平的"是 True(可核查且为假),” vaccines are important"(无具体断言)是 False。
- “事实主张”(factual claim)——排除评价、偏好、指令、预测、条件句与纯定义衔接语。“This is a great question” 是 False,“The surgery lasted nine hours” 是 True。
这个任务定义决定了本数据集在 LLM 核查工具链里的位置:它是漏斗口筛选器(Selection)的金标准,不是裁决器(verdict)的金标准。训练出的二分类器回答的是"这句话值得核查吗",不是"这句话是真的吗"——后者需要检索证据加 NLI 裁决,属于管线下游(MedNLI 等蕴含语料的领地,见 §9)。
4.2 contains_factual_claim 的语义边界与疑难地带
四类高频疑难句,标注者需要反复裁决(这也是这个数据集存在的原因——这些正是机器最难判的):
- 数字模糊句:“reduced costs significantly”(无可核查锚点,False)vs “reduced costs by 30%”(可核查,True)。数字有无锚点决定生死。
- 归属句:“Experts believe X”——可核查的是"专家是否如此认为"(对信念归属的核查)而非 X 本身;标注口径算 True(归属本身是可验证事实)。
- 条件与假设句:“If passed, the bill would…”——未实现的假设不可核查,False;但"the bill was passed in 2010"这类历史事实成分会使命运依混合句规则而定。
- 上下文依赖句:“It was the first of its kind”——裸句无从核查,但结合 question 与前句后"它"有明确指称。标注时标注者有上下文,data.csv 用户没有——个别争议标签源于此(§3.2 已述)。
对使用者的一条实用建议:若你要在自己领域(尤其医学)复刻这种标注,直接沿用"存在量词 + 可核查性 + 至少一条"三件套定义,并在标注指南里把这四类疑难句的裁决示例写死——本数据集未公开其标注指南原文(存照,FACTS.md §9),边界案例的口径只能从数据反推。
4.3 上游四类标签体系与句子级二分类的对照
上游 BingCheck(Self-Checker 论文)对同一批 396 回答做的是回答级-主张级的证据支持度标注,四类标签体系如下:
| 上游标签 | 语义 | 与本数据集的关系 |
|---|---|---|
| Supported | 主张被证据完全支持 | 上游真伪维度,本数据集不涉及 |
| Partially Supported | 主张被证据部分支持 | 同上 |
| Refuted | 主张被证据反驳 | 同上——注意"可核查且为假"的句子在本数据集标 True,在上游可能标 Refuted |
| Not Supported | 证据不足以裁决 | 同上 |
两套标注是正交的两个维度:本数据集标"是否值得核查"(筛选维度),上游标"核查后结论如何"(裁决维度)。一个句子可以同时是"本集 True + 上游 Refuted"(可核查且被证伪)——这正是两个数据集不能互相替代的原因。需要完整管线评测金标准的研究者,理想配置是两者合用:本集管漏斗口,上游管出口;但上游语料无独立公开发布渠道(论文附录口径),实际可得性以本集为限(坑 5、§6)。
标注质量方面,上游论文报告了三轮"标注-仲裁"迭代的 Krippendorff’s alpha 提升曲线:0.44 → 0.72 → 0.86。第一轮 0.44 的低起点本身就说明"什么算一条 claim、什么算 supported"在真实 LLM 输出上是高分歧任务;两轮仲裁后 0.86 达到可用水平。本数据集(句子级二分类)的标注者间一致性未公开(存照)——按任务难度推断应高于主张级切分的一致性(二分类比四分类 + 切分简单),但这是推断不是事实,引用时注意区分。
4.4 为什么官方 README 不提上游:一次完整的考据复盘
这条考据链值得完整记录,因为它是本条目所有"官方未说、本库考证"结论里最重的一条:
- 线索一(数字指纹):data.csv 实测 unique answer_id = 396;Self-Checker 论文(NAACL 2024 Findings,arXiv:2305.14623)语料描述章节自报"396 Microsoft Copilot responses"。两源独立,个位吻合。
- 线索二(平台指纹):上游论文明确语料来自 Microsoft Copilot(新 Bing)的真实用户问答;本数据集 question 列的主题分布(通域问答、含 2024 年时事的口径)与论文时间线(2023-2024 采集)一致。
- 线索三(人脉指纹):Claimify 论文作者 Jonathan Larson 长期从事 Microsoft 的知识核查研究(PaperClip/BingCheck 谱系),与上游论文同属 Microsoft 研究序列。
- 反向验证:HF README、GitHub 方法仓库、ACL 论文全文均未出现 “Self-Checker” 或 “BingCheck” 字样——上游关系是存在但未声明状态。
结论存照:claimify-dataset 是对 Self-Checker/BingCheck 同批 396 回答的句子级二次标注——判断为"高置信考据结论",但不是官方声明,本条目与 FACTS.md 均按此口径行文,引用时请注明。这个案例的方法论价值在于:数据集溯源不能只信 dataset card,数字指纹交叉比对是低成本高回报的独立手段(库内其他"上游不透明"条目可复制此法)。
§5 评估与指标:论文宣称、对比方法与使用守则
5.1 三个核心指标的定义
论文自报三指标,每个都要按定义读:
| 指标 | 论文口径 | 定义(通俗版) | 谁的指标 |
|---|---|---|---|
| entailment | 99% | 抽取出的主张被源句完全蕴含的比例——不外推、不加戏 | Decomposition 保真度 |
| coverage | 87.6% | 源句中可验证内容被主张覆盖的比例——不漏抽 | Selection + Decomposition 完整度 |
| precision | 96.7% | 排除不可验证内容的精确率——不误放 | Selection 纯度 |
三指标合起来的含义:Claimify 抽的主张几乎不歪曲原文(99)、漏掉一成多可核查内容(87.6)、放进来垃圾的概率不到 3.3%(96.7)。三个数字衡量的是流水线不同环节,不能相加或平均成一个总分;coverage 与 precision 存在天然张力(抽得越多越全但垃圾越多),87.6 与 96.7 的组合是论文口径下的工作点,换阈值即变。
5.2 五个对比方法与对比口径
论文对比的五件套(官方博客脚注 3 列举):AFaCTA、Factcheck-GPT、VeriScore、DnD、SAFE——覆盖了 2024-2025 年主张抽取/核查前置环节的主要流派(检索增强型、LLM 自检型、分解-裁决型)。对比细节(各方法在各指标上的具体分数、使用的判定 LLM、评测集划分)以论文正文表格为准,本条目不复述全文表格,只存两条口径要点:
- 对比在同一评测场地进行(含本数据集所在评测集),但各方法输出单元不同(有的抽主张、有的只筛选句子),论文做了口径对齐后再比——复现时需按论文的协议设置,直接拿原始实现跑会得到不可比的数字。
- 判定指标用的裁判 LLM 与示例生成同为 GPT-4o 口径——"LLM 判 LLM"的循环性是这一代主张抽取评测的通病,论文未做人工裁决全量复核(存照)。
5.3 官方应用实例:GraphRAG 评估
Microsoft 官方博客(2025-03-19)披露的用法:用 Claimify 抽取 GraphRAG 与传统 RAG 生成答案的主张,再逐主张核查,最终在 comprehensiveness(全面性)与 diversity(多样性)两维度评估——官方结论为 GraphRAG 优于传统 RAG。这个案例展示了本数据集所属方法族的完整用法:抽取(Claimify)→ 核查 → 聚合成对答案级结论。注意两点口径:这是微软自家的方法用自家工具评自家产品(利益相关方口径),且结论维度是"全面性/多样性"而非"事实准确率"——引用时写"官方宣称",不要写成"第三方验证"(坑 6 的姊妹存照)。
5.4 Azure 管线与生态定位(方法侧)
同一博客将 Claimify 定位为 Azure AI 内容安全工具链(Groundedness Detection,有据性检测)的技术上游——主张抽取是判定"LLM 输出是否有据"的第一步。这意味着方法本身有产品化通道(Azure 服务),而开源 GitHub 代码是"研究用途"版本——研究复现与生产服务是两套东西,不要把 GitHub 代码的性能等同于 Azure 服务接口的性能(各自有各自的版本漂移,均未承诺对齐)。
5.5 读这组数字的五条守则
- 自报口径:99 / 87.6 / 96.7 三个数字均为作者用 LLM 裁判自评,无独立第三方复现——引用必须带"论文自报"限定。
- 工作点敏感:coverage 与 precision 随流水线阈值联动,三个数字是一个配置的快照,不是方法的上界。
- 裁判循环:GPT-4o 生成示例又当裁判,指标系统性偏向 GPT-4o 风格的输出——换裁判模型数字会动。
- 数据集≠指标场地:本数据集(句子级二分类)可评测你的 Selection 模块;要复现论文三指标需要完整流水线加论文协议,两者不可混谈。
- 对比方法仍在演化:五件套的 2024-2025 版本性能各异,对比结论有时效性——超过一年的引用建议核对论文最新版本与后续文献的再评测。
§6 获取与许可:三层异构的门怎么进
6.1 三层资产、三种门
| 层 | 资产 | 获取方式 | 许可 | 门 |
|---|---|---|---|---|
| 数据集(本条目本体) | data.csv,6,490 句标注 | HuggingFace microsoft/claimify-dataset 公开直链;ModelScope 同名镜像 |
CDLA-Permissive-2.0 | 敞开(无注册、无申请) |
| 方法代码 | Claimify 四阶段流水线实现与提示词 | GitHub microsoft/claimify |
官方博客脚注:“research purposes only and is not available commercially”(仅研究用途,不可商用) | 半开(克隆即可,用途受限) |
| 上游语料 | Self-Checker/BingCheck 的 396 回答 + 3,840 claims 证据标注 | 无独立公开发布(论文附录口径) | —(未发布) | 关闭(只能从论文读描述) |
三层门禁逐层收紧——这正是本条目在库内"可获取性光谱"上的独特结构:数据敞开、代码半开、上游关闭。对比库内常见的"本体注册墙 + 衍生公开直链"双轨(如 panda-plus 条目),claimify 是"本体公开 + 代码受限 + 上游缺失"的倒挂结构:你想核查其方法性能,代码与协议都在;你想商用其方法,被博客脚注拦住;你想拿完整上游标注,无门。使用前先对号入座你属于哪种需求。
6.2 下载实操:直连与镜像双通道
HuggingFace 主站在部分网络环境(含本库写作环境)不可直连,镜像站 hf-mirror.com 提供同路径代理——本条目全部一手数据(行数、字节数、标签计数、句长统计)即经镜像通道于 2026-09-28 实抓取得,以下命令均为实际执行过的口径:
# 方式一:直接下载 CSV(最简,推荐)
curl -L -o data.csv "https://hf-mirror.com/datasets/microsoft/claimify-dataset/resolve/main/data.csv"
# 直连可用时把域名换回 huggingface.co 即可,路径不变
# 校验(本库实测口径)
# 行数应为 6,491(1 表头 + 6,490 数据行)
wc -l data.csv
# 大小应为 2,258,269 bytes
ls -l data.csv
# 方式二:datasets 库加载(注意 HF_ENDPOINT 环境变量走镜像)
import os
os.environ["HF_ENDPOINT"] = "https://hf-mirror.com"
from datasets import load_dataset
ds = load_dataset("microsoft/claimify-dataset", split="train")
# ds 包含五列:answer_id, question, sentence_id, sentence, contains_factual_claim
# 快速复算本条目核心数字
import pandas as pd
df = pd.read_csv("data.csv") # 或 df = ds.to_pandas()
assert len(df) == 6490 # 句子总数
assert df["answer_id"].nunique() == 396 # 回答数(上游指纹)
assert df["question"].nunique() == 393 # 问题数(3 差额疑点)
print(df["contains_factual_claim"].value_counts())
# True: 3833 (59.1%) / False: 2657 (40.9%)
ModelScope(魔搭社区)有同名数据集收录,可作为第二独立下载源(双平台互为备份);本轮核验仅确认存在与同名,未抓取 ModelScope 侧下载计数与时间戳(存照,FACTS.md §9 待核项)。
6.3 license 细读:CDLA-Permissive-2.0 与两套许可分离
数据集采用 CDLA-Permissive-2.0(Computing Data License Agreement,宽容版 2.0)——中文语境可理解为"数据界的 MIT/Apache 系":允许商用、允许再分发、允许制作衍生数据集,主要义务是保留许可与声明文本。对库内使用者的三句话结论:可以入库提供下载;可以用于训练商业模型;衍生数据集可以换自己的许可发布。完整条款以官方许可文本为准(附录 G 有关键条款摘录)。
最重要的一条纪律是两套许可分离:数据集(CDLA-Permissive-2.0,宽松)与方法代码(仅研究用途、不可商用)是两个独立法律对象,各自持有独立条款。常见误引有两种:说"Claimify 是微软开源的,随便商用"(错——代码不可商用);说"数据集受限不能商用"(错——数据宽松)。数据和方法在许可上互不引申,混引即错(坑 5,FACTS.md §9 存照)。上游语料则连许可都无从谈起——未发布对象没有许可讨论意义。
6.4 AI-Ready 评估:公开直链档的得分与失分
以库内 AI-Ready 检查单过一遍:
- 机器可读元数据:HF dataset card 含任务说明、规模、标签口径、引用格式——良好;但无逐字段数据字典(五列语义要靠本条目 §2.2 这类二手整理)、无版本号、无标注协议原文——中等。
- 公开直链:单文件 CSV 直接 resolve 下载,无注册无令牌,镜像生态完整(hf-mirror/ModelScope)——满分项,是库内最顺滑的下载体验之一。
- 许可明确性:CDLA-Permissive-2.0 是明确且宽松的机器可判许可,HF 卡片正确标注——良好;扣分项是"数据宽松/代码受限"的双许可结构需要使用者自行分辨,卡片未显著提示方法代码许可不同。
- 可复现性:2.25 MB 单文件秒级加载;但论文指标的复现依赖方法代码(研究用途限制)与 GPT-4o 裁判配置,"下载数据"与"复现论文"之间有明显的成本台阶。
- 文档自洽性:README 规模/比例与文件实体零漂移(§2.1)——罕见的好成绩;失分在上游关系不透明(396 指纹需自行考据)。
综合:AI-Ready 等级"高"——在"LLM 生成文本标注语料"这一品类里属于获取最顺滑、许可最宽松的样本;失分集中在元数据深度与上游透明度,而非获取门槛。分维度评分见附录 B DAIMS 表。
§7 生态与影响:它在 LLM 核查工具链里的位置
7.1 微软内部管线:从 BingCheck 到 GraphRAG 到 Azure
把微软系的核查谱系连起来看,Claimify 的生态位一目了然:
| 时间 | 环节 | 产出 | 与本数据集关系 |
|---|---|---|---|
| 2024 | 上游标注研究 | Self-Checker/BingCheck(NAACL 2024 Findings):396 回答主张级核查 | 提供本数据集的原始回答语料(§4.4 考据) |
| 2025-02/07 | 方法化 | Claimify 四阶段流水线(arXiv 2502.10855 → ACL 2025 主会) | 数据集是其官方评测配套 |
| 2025-03 | 官方示范 | 博客披露用 Claimify 评估 GraphRAG(comprehensiveness/diversity 维度) | 展示数据集所属方法族的完整用法 |
| 2025-08 | 数据发布 | HF 上架 microsoft/claimify-dataset(lastModified 2025-08-14) | 本条目本体 |
| 产品线 | 工程化 | Azure AI Groundedness Detection 等内容安全服务 | 方法的产品化通道(与开源代码不同版本线) |
值得注意的是发布顺序:方法先发(2-7 月)、数据后补(8 月)——数据集是方法的"评测配套"而非独立的科学产出,这解释了它的极简仓库结构(单 CSV、无标注协议、无版本管理)与 README 的薄程度。对使用者:把本数据集当"Selection 环节的官方金标准"用是正路,当"完整的 LLM 核查评测基准"用则它覆盖不了下游环节(§4.3)。
7.2 开放生态里的同类与竞品
在"LLM 输出主张抽取/核查"赛道,与本数据集同场竞技或互补的公开资源(论文对比口径 + 生态观察):
- 对比方法五件套(AFaCTA、Factcheck-GPT、VeriScore、DnD、SAFE):各自附带不同的评测集与代码许可,多数同样走 GitHub 开源路线;claimify-dataset 的差异化是"句子级二分类 + 真实 LLM 输出"的干净口径。
- 下游核查资源:证据检索与 NLI 裁决环节另有 FEVER 型语料与各类医疗 NLI 集(库内 MedNLI,rid 648)覆盖——claimify 管漏斗口、它们管出口,管线组合而非竞争关系。
- 上游不可得项:BingCheck 的 3,840 claims 证据标注无公开渠道,是这一谱系里最大的公开性缺口;任何"完整复现微软核查管线"的尝试都会卡在这一层(存照)。
时效性说明:该赛道 2025-2026 年迭代极快,本节生态描述以 2026-09-28 抓取时点的官方口径为准,一年后的竞品格局请以最新文献为准。
7.3 医学场景实测:8.5% 的医学句占比与内容画像
本库对 data.csv 做了一次医学内容专项实测(20 词关键词表命中法:heart/patient/disease/treatment/surgery/medical/drug/cancer/tumor/infection/vaccine/blood/brain/hospital/therapy/diagnosis/genetic/protein/clinical 等词干):
| 实测项 | 数值 | 说明 |
|---|---|---|
| 医学关键词命中句 | 551 句(8.5%) | 551/6,490 = 8.49% |
| 其中 True(含可验证主张) | 415 句 | 占医学句 75.3%——医学句的事实密度高于全集均值(59.1%) |
| 内容画像 | 心血管史问答线密度最高 | 人工心脏发明(Jarvik-7)、首例人体心脏手术(1952)、供体心脏短缺与移植等 |
| 代表句 | “The invention of the first artificial heart was inspired by the need to save lives of people with heart failure and to overcome the shortage of donor hearts for transplantation.” | 出自 Jarvik-7/Barney Clark 人工心脏问答线 |
三条结论。其一,这不是医学数据集——8.5% 的占比决定了它只能当"通域语料里的医学切片"用(坑 8,医学关联双口径详见 FACTS.md §8)。其二,医学句的 True 密度(75.3%)显著高于全集(59.1%)——科普问答里的医学陈述更倾向给出可核查断言(数字、年份、人物、机制),这提示医学场景下 Selection 模块的"放行率"会天然更高,漏斗口更粗,下游核查压力更大。其三,551 句医学切片可直接抽出来做医学主张抽取器的零样本评测集(规模小但真句子),或作为医学领域微调的种子集——复现代码见附录 F。
7.4 对医疗 AI 的三个具体接入点
- 医学问答输出的预核查:RAG/LLM 医学问答系统上线前,用按本数据集口径训练的 Selection 模型先过滤"值得核查的句子",把核查算力集中在约六成的可核查内容上(医学句密度场景下约七成半)。
- 评测集构建的种子:从 415 个 True 医学句出发,接证据检索与 NLI 裁决(MedNLI 等),可低成本拼装一个小型"医学 LLM 输出核查"端到端评测——本数据集提供第一环的金标准。
- 标注规范的对齐参考:要把这种句子级二分类复刻到院内 LLM 输出(如病历生成助手的质量巡检),§4.2 的疑难句裁决框架可直接搬用——这是数据集之外的"方法论出口"。
§8 方法学启示:三条可迁移的经验
8.1 句子级标注是成本与信息的折中
本数据集选择了句子级二分类而非主张级切分标注,这步棋的得失值得任何准备标注 LLM 输出的团队参考。得:成本可控(6,490 个判断点,标签简单,能跑完 396 个真实长回答);口径稳定(句子边界客观,回避"什么算一条 claim"的切分歧义——上游第一轮 alpha 仅 0.44 的教训在前);下游适配(Selection 环节本来就需要句级筛选器)。失:信息压缩(句内主张数、主张边界、混合句成分全部不可见);粒度失配残留(1,111 字符的长句一个标签);切分债(切分错误直接固化进数据)。一句话:句子级标注买的是"能把 396 个回答标完"的可行性,卖的是主张级细节——若你的下游需要主张级监督,这个数据集只能当第一级阶梯。
8.2 上游语料复用的二次标注模式
“同一批 396 回答、两套正交标注”(上游裁决维度、本集筛选维度)展示了一种高性价比的数据生产模式:昂贵的一次性语料(真实 LLM 长回答)重复利用,按任务维度分批标注。本库已在 panda-plus 条目观察到"母数据集-衍生基准"的纵向复用,本条目则是"同一语料-多任务标注"的横向复用——两种模式都指向同一个结论:真实 LLM 输出语料的采集成本远高于标注成本,采集一次、标注多次是理性策略。可迁移要点:二次标注时保留原始回答的 ID 体系(本集 answer_id 与上游回答一一对应),使多任务标注可回连;代价是上游关系一旦不写进文档(本集 README 的教训),溯源就得靠数字指纹考古(§4.4)。
8.3 数据与代码许可分离的发布策略
微软在本项目上把"方法"与"数据"按两种姿态发布:代码走"研究用途、不可商用"的自定义限制,数据走 CDLA-Permissive-2.0 的产业级宽松许可。这组合的传播学效果明显:数据集可以进任何企业的训练管线(宽松许可保障),而方法细节的商用被软性拦住(提示词与实现的竞争壁垒得以保留)。对准备发布医疗数据集的团队的启示:数据宽松、代码保守是值得考虑的默认配置——数据的传播给你带来引用与生态,代码的保留给你留下方法论护城河;反过来配(数据受限、代码宽松)几乎必然导致数据无人用、代码被白嫖。前提是发布文档必须把两套许可写得像本条目 §6.3 这样泾渭分明——本集 README 在这一点上恰恰做得不够(未显著提示代码许可差异,坑 5)。
8.4 医学场景迁移的现实路径
综合本条目全部实测与考据,医疗团队想把 claimify 用起来的现实路径排序:
- 直接可用(零成本):415 个 True 医学句当小型评测种子;20 词关键词表(附录 F)当医学切片过滤器;§4.2 疑难句框架当标注规范底稿。
- 轻改造可用(低成本):以本集为预训练/正则项,在你的医学问答输出上标注几百句(沿用五列 schema),训练领域 Selection 模型——句子级二分类的标注成本足以让临床科室在一两周内完成。
- 不可直接用(高成本或不可行):主张级医学核查监督(本集无此粒度,需自建);完整复现论文指标(依赖研究用途代码与 GPT-4o 裁判配置);上游证据标注(未发布)。
§9 与库内条目的关系
9.1 家族图谱
claimify 在库内属于"医疗NLP"与"医学问答与基准"两大门类的交汇处,且是库内唯一一个标注对象为 LLM 生成文本的条目——其余 NLP 条目标注的都是人写的文本(病历、文献、考题)。按管线位置画家族图谱:
| 位置 | 库内条目(rid) | 与 claimify 的关系 |
|---|---|---|
| 上游:问题来源 | HealthSearchQA(rid 492) | 同为真实用户健康问题场景;HealthSearchQA 收集搜索框问题无标注,claimify 的 question 列是问答平台的完整问答对——两者可拼"用户问题→回答→逐句筛选"的完整链路 |
| 上游:语料体裁 | S2ORC(rid 370)、CRAFT(rid 529)、GENIA(rid 532) | 同为 NLP 语料但体裁相反——它们是人类撰写的科学文献,claimify 是机器生成的回答;核查对象的不同是品类级差异 |
| 管线同层:筛选与蕴含 | MedNLI(rid 648) | 最近邻——MedNLI 标临床前提-假设的蕴含关系(人工文本),claimify 标 LLM 输出句子的可核查性;管线里 Selection(claimify 训练的模块)之后接 NLI 裁决(MedNLI 训练的模块),前后接力 |
| 管线同层:问答评测 | EMR-QA(rid 139)、EHRSQL(rid 713)、MedQuAD(rid 160) | 同为问答资产但方向不同——它们评测"回答问题"的能力,claimify 评测"检查回答"的能力;QA 生成与 QA 核查是同一枚硬币的两面 |
| 问答基准族 | BLURB(rid 471)、MedMCQA(rid 111)、HeadQA(rid 120) | 基准生态参照——BLURB 是生物医学 NLP 任务套件,MedMCQA/HeadQA 是医学考试;三者评"懂不懂",claimify 评"可不可信" |
| 对话与实体 | MedDialog(rid 210)、MedMentions(rid 390) | MedDialog 是医患对话(生成式场景的输入侧),MedMentions 是实体链接(经典信息抽取)——与 claimify 共同覆盖"医疗文本处理"从抽取到核查的谱系 |
| 计算与安全 | MedCalc-Bench(rid 708) | 医学计算评测——主张抽取后若涉及数值断言(剂量、概率),MedCalc-Bench 型核查是其下游延伸 |
9.2 检索路径建议
按检索目的选路径:
- “我要给 LLM 医学回答建核查管线”:claimify(本条目,Selection 层)→ MedNLI(rid 648,裁决层)→ HealthSearchQA(rid 492,问题分布参考)——三件套覆盖漏斗口到出口。
- “我研究 NLP 数据集本身的标注方法学”:claimify(句子级二分类)→ GENIA(rid 532,多层标注老牌样本)→ CRAFT(rid 529,全文精细标注)——对比三种标注粒度哲学。
- “我要医学问答评测集”:本条目不是你要找的(它不是 QA 基准)→ 转投 MedMCQA(rid 111)/HeadQA(rid 120)/MedQuAD(rid 160)/EMR-QA(rid 139)。
- “我要真伪标注/谣言检测语料”:本条目也不是——contains_factual_claim 不标真伪(§4.1/坑 1)→ 真伪维度需检索上游 BingCheck 口径(未公开)或库内其他裁决类资源。
§10 避坑清单:八个已踩过的坑
以下八坑均出自本条目写作过程中的真实核查经历或官方文档缺口,按"踩中概率 × 后果严重度"排序。
坑 1:三个数字混用——3,840 / 6,490 / 3,833
这是本条目最高频的错误源。3,840 是上游 Self-Checker 的主张级标注总数(回答级核查单元),6,490 是本数据集的句子级总数,3,833 是其中标 True 的句子数。三个数字是同一批 396 回答在不同切分与标注口径下的三套计数(§2.6 对照表)。典型错误引用:“claimify-dataset 包含 3,840 个标注主张”——错,那是上游口径。写引用时先问自己"我在说哪种切分",把口径写进句子里。
另一个姊妹误区:把 False 句当"假话/谣言句"。False 只是不含可核查主张(评价、过渡、指令),不是被证伪——本数据集不标真伪。
坑 2:名实分离——"Claimify"一词指方法不指数据
GitHub 上搜 Claimify 得到的是方法代码仓库(microsoft/claimify,无数据文件);数据集在 HuggingFace(microsoft/claimify-dataset)。两者 README 互相提及但路径独立,许可还不同(坑 5)。搜"Claimify dataset"有时还会命中论文附录里的评测描述(那不是可下载的数据集本体)。写代码前先确认你 import 的是数据还是方法;写文档时方法名用"Claimify 方法"、数据名用"claimify-dataset"以示区分。
坑 3:393 对 396 的差额与 ID 关系误解
396 个 answer_id 对 393 个唯一 question,3 个差额官方未解释。不要假设"一问一答":存在少量同题多答或映射异常。同理不要假设 answer_id 是连续整数或可排序为时间线——它是 opaque ID。采样时用 answer_id 做单位、去重时用 question 文本,两者不可互相替代。
坑 4:裸句标签复核误判
data.csv 只存句子与 question,不含完整回答上下文;而标注是在有上下文的条件下做的。复核时发现"这句子明明不含事实却标 True"先别急着判定标注错误——"it was the first of its kind"这类上下文依赖句脱离上下文看不可核查,带着上下文看可核查(§3.2、§4.2)。复核前先把同 answer_id 的句子按 sentence_id 拼回全文再看。
坑 5:两套许可混引
数据集 CDLA-Permissive-2.0(宽松、可商用)与方法代码"仅研究用途不可商用"(博客脚注原文)是两个独立法律对象。误引方向一:“微软开源的都能商用”——代码不行。误引方向二:“数据集许可肯定也限制商用”——数据随便用。写商用方案时按对象分别引条款,附录 G 有细读。
坑 6:官方宣称与考据结论不分的口径污染
本条目反复出现三档口径:官方声明(README/论文/博客原文)、本库一手实测(data.csv 逐行统计,标注"实测 2026-09-28")、本库考据推断(396=上游复用、393 差额推测)。第三档不是官方说法——引用"claimify-dataset 来自 Self-Checker 同批语料"必须注明是独立考据结论;引用"GraphRAG 优于传统 RAG"必须注明是微软官方宣称而非第三方复现。口径污染会让你的论文/文档在同行评议时翻车。
坑 7:句长极端值直接进管线
最短 1 字符(标点残句)、最长 1,111 字符(切不动的列举长句)都真实存在且未清洗。直接训练二分类器,残句会教模型学走"短=无主张"的捷径;直接做人工复核,长句一个标签的信息密度低到没有意义。建议最小长度过滤 + 长句单独人审(阈值按你的 tokenizer 定,英文 200 字符以上值得单看)。
坑 8:医学关联过度宣称
8.5%(551/6,490)是关键词命中口径的医学句占比——它包含"heart failure"这类通域科普句,不等于临床级医学内容;20 词词表也会漏掉不含关键词的医学句(如纯药名、手术名句子)。正确说法:“通域语料,医学主题句约占 8.5%(关键词法实测)”;错误说法:“医学主张抽取数据集”。本条目按通域数据集立条,医学关联以应用场景 + 实测占比呈现(FACTS.md §8 双口径)。
§11 总结
11.1 三句话总结
- Claimify 数据集是 Microsoft Research 主张抽取方法(ACL 2025 主会)的官方配套标注语料:6,490 个 Copilot 真实回答句子的人工二分类标注(59.1% 含可验证事实主张),单文件 CSV、CDLA-Permissive-2.0、公开直链——获取零门槛。
- 它是对上游 Self-Checker/BingCheck 同批 396 条 Copilot 回答的句子级二次标注(396 数字指纹考据,README 不提上游),与上游的 3,840 主张级核查标注是正交的两个维度,三个数字(3,840/6,490/3,833)口径不可混用。
- 它是库内唯一的"LLM 生成文本标注语料":医学句占 8.5%(415 句 True),可当医学 Selection 模块的种子评测集;失分点在元数据深度、上游透明度与真伪标签缺失,AI-Ready 综合评级"高"。
11.2 适合谁
- 构建 LLM 输出核查管线的工程团队——需要 Selection 环节的训练/评测数据,本集是该环节少有的真实 LLM 输出金标准。
- 研究主张抽取/幻觉检测的方法学者——需要与 AFaCTA/Factcheck-GPT/VeriScore/DnD/SAFE 对比的公开场地,且许可允许进入商业管线。
- 医疗 AI 安全团队——想给医学问答输出加预核查漏斗,8.5% 医学切片 + 415 True 句可作种子;标注规范框架(§4.2)可直接复用到院内数据。
- 数据集方法学研究者——“上游复用二次标注”"数据宽松代码保守"两个发布模式都是值得记录的样本。
11.3 不适合谁
- 找医学专用数据集的——8.5% 占比撑不起医学专用宣称,请转库内 MedNLI/MedMCQA 等条目。
- 需要真伪/证据标注的——本集不标真伪(False ≠ 假话),裁决层监督请另寻 FEVER 型资源或 MedNLI(rid 648)。
- 需要主张级粒度的——句内主张边界与数量不可见,1,111 字符长句一个标签;主张级研究需自建标注。
- 想完整复现论文三指标的——依赖研究用途限制的方法代码与 GPT-4o 裁判配置,且上游证据语料未发布,复现成本台阶明显高于"下载数据"。
11.4 30 秒决策卡
| 你要做的事 | 答案 |
|---|---|
| 训练"这句值得核查吗"分类器 | 是,正对口——3,833 True / 2,657 False 直接可用 |
| 检测 LLM 回答里的假话 | 本集只管筛选不管真伪,False 不是假话(坑 1)——转上游口径(未公开)或 MedNLI |
| 医学问答输出的预核查 | 可行——先抽 551 句医学切片评测,不够再微调(§7.3/§8.4) |
| 商用数据进训练管线 | 可以——CDLA-Permissive-2.0,保留声明即可(附录 G) |
| 商用 Claimify 方法本身 | 不行——代码仅研究用途(坑 5);自研实现不受此限 |
| 复现论文 99/87.6/96.7 | 高成本——研究用途代码 + GPT-4o 裁判 + 论文协议(§5.5 守则 1/4) |
| 拿 BingCheck 3,840 claims 标注 | 拿不到——未公开发布(§6.1 第三行) |
FAQ(高频问答 38 问)
A. 基础认知
Q1:Claimify 数据集和 Claimify 方法是什么关系?
方法是 ACL 2025 主会论文提出的四阶段流水线(代码在 GitHub);数据集是方法发布后在 HF 上架的官方配套标注语料(6,490 句句子级二分类)。数据集可当方法 Selection 环节的评测金标准,也能独立用于训练任何人的筛选模型——两者许可还不同(数据宽松、代码受限)。
Q2:数据是谁标的?标注协议公开吗?
微软官方发布但未在 README 公开标注者构成与协议原文(存照)。标签口径可从论文与博客反推:句子是否含"可验证的事实主张"。上游 BingCheck 的标注协议(三轮标注-仲裁、alpha 曲线 0.44→0.72→0.86)在论文里有描述,可作为本集标注质量的间接参照。
Q3:为什么叫"Claimify"?
方法目标即"把 LLM 回答转化为 claim(事实主张)的流水线",-ify 即"主张化"。数据集名 claimify-dataset 是"方法的官方数据集"命名法,不是"数据集本身会做主张抽取"。
Q4:它跟"幻觉检测数据集"是一回事吗?
不是。幻觉检测数据集通常带真伪/证据标签(这句话对不对);本集只带"可核查性"标签(这句话值不值得查)。它解决幻觉检测管线的前置环节(筛选),不解决检测本身。
Q5:6,490 句在 NLP 数据集里算大算小?
按句子数算中小型(对比 S2ORC 的亿级),但按"人工标注的真实 LLM 长回答"算,396 个回答的完整句子级覆盖是稀缺的——这类数据的成本在采集与标注两端。它的价值密度(每句一标签、零噪声口径争议)高于绝对规模。
Q6:2026 年了这数据还新鲜吗?
回答语料采集于 2023-2024(Copilot 早期),模型与话题有年代感;但"句子级可核查性标注"的任务定义、标签口径与数据结构不受模型换代影响——当训练/评测资产用依然有效,当"当代 LLM 输出分布"用则已过时(存照)。
B. 数据与获取
Q7:怎么下载?
HF 直链或 hf-mirror.com 镜像(命令见 §6.2);ModelScope 有同名收录作第二来源。单文件 CSV,2,258,269 bytes,无需注册。
Q8:下载后第一件事做什么?
跑 §6.2 的校验三连:行数 6,491、大小 2,258,269 bytes、value_counts 得 True 3,833 / False 2,657——三者对上才算拿到真文件。
Q9:有 train/test 划分吗?
没有。单文件无官方划分,README 未给推荐切分。自切时建议按 answer_id 分组切(防同回答句子跨集泄漏),并注意 393 个 question 的去重边界(坑 3)。
Q10:CSV 里的 Markdown 残迹(星号、井号)要不要清?
建议保留。它们是原回答结构的一部分,Selection 模型在生产环境面对的就是带 Markdown 的 LLM 输出——清了反而制造训练/推理分布偏移。只有做纯文本语言学分析时才考虑剥离。
Q11:能在 HuggingFace 主站被封的环境里用吗?
能——这正是本库的写作环境。hf-mirror.com 同路径代理全部 API 与文件接口,datasets 库设置 HF_ENDPOINT 环境变量即可(§6.2 代码),本条目全部一手数字即经此通道取得。
Q12:ModelScope 版和 HF 版有差异吗?
官方同名同步上架,本库未逐字节比对两版差异(存照待核)。稳妥做法:以 HF 版为基准文件,ModelScope 只当镜像备份;引用时注明下载渠道。
C. 统计与方法
Q13:59.1% 和 59% 哪个对?
都对,口径不同。一手实算 3,833/6,490 = 59.06% → 保留一位小数 59.1%;README 整数口径 59%。学术引用建议 59.1%(可复算),转述官方口径用 59%(坑 6)。
Q14:为什么是 59% 而不是更多/更少?
这是测量结果不是设计目标。Copilot 回答以科普/信息型内容为主,天然含大量可核查断言(数字、年份、归属);同时对话框架句、评价句、指令句占四成。没有任何官方解释说明 59:41 被刻意平衡过——它就是这批真实回答的构成。
Q15:一问一答吗?396 和 393 怎么回事?
不是严格一问一答:396 个回答对 393 个唯一问题,3 个差额官方未解释(坑 3)。用 answer_id 做采样单位即可,别依赖一一对应。
Q16:句子是怎么切的?我自己重切行吗?
上游 BingCheck 口径的切分,sentence_id 0-46、平均 16.4 句/回答。重切意味着与官方标签错位——标签是按原切分逐句打的,句子拆并后无法直接映射原标签。要改切分就得重标(这正是 Claimify 论文把切分列为流水线第一阶段的原因)。
Q17:方法的三指标是怎么算出来的?我能用这个数据集算吗?
论文三指标(99 entailment / 87.6 coverage / 96.7 precision)由完整流水线输出对照评测协议算出,判定用 GPT-4o(§5.5 守则)。只用本数据集算不出这三个指标——本集只覆盖 Selection 环节的二分类(你可以算自己模型在 6,490 句上的 accuracy/F1,那是另一个数)。
Q18:对比方法(AFaCTA 等)的分数在哪看?
论文正文表格(ACL Anthology 开放获取全文)。本条目只存五件套名单与口径要点(§5.2),不复述各方法分数——引用具体分数请直接引论文表。
D. 医学关联
Q19:这是医学数据集吗?
不是。通域问答语料,医学主题句实测占 8.5%(551/6,490,关键词法)。库内立条口径为通域数据集 + 医学应用场景(坑 8、FACTS.md §8 双口径)。
Q20:那 551 个医学句怎么抽出来?
20 词关键词表命中法(heart/patient/disease/treatment/surgery/medical/drug/cancer/tumor/infection/vaccine/blood/brain/hospital/therapy/diagnosis/genetic/protein/clinical 等词干),复现代码见附录 F。注意关键词法有漏(纯药名句)与误("heart of the city"类隐喻),只当粗筛。
Q21:医学句里什么主题最多?
心血管史问答线密度最高:人工心脏(Jarvik-7、Barney Clark)、首例人体心脏手术(1952)、心力衰竭、供体心脏短缺与移植。科普医学问答的典型画像——历史性、机制性断言多,个体化诊疗建议少(存照,一手抽查口径)。
Q22:能用来训练"医学幻觉检测器"吗?
只能训练它的第一环(“这句值得核查吗”)。真伪判断需要证据检索 + 蕴含裁决(MedNLI,rid 648 领地)+ 医学证据源——本集没有任何真伪标签(坑 1)。
Q23:想把这套标注复刻到院内 LLM 输出,工作量多大?
句子级二分类是标注成本最低的档位之一:一名熟悉业务的标注者每句判断约 5-15 秒,1,000 句一个工作日量级。关键是先把 §4.2 四类疑难句的裁决规则写死再开工,否则你会重演上游第一轮 alpha 0.44 的混乱。
E. 复现与工程
Q24:pandas 读进去是什么类型?
contains_factual_claim 读为 bool(True/False 字面量),sentence_id 为 int64,其余三列为 object(字符串)。空值:本库实测六列无空值(存照,如有异常先查文件完整性)。
Q25:训练二分类器有什么现成的基线数字吗?
官方未发布任何"在此数据集上的基线成绩"(存照)——数据集定位是方法评测配套,论文表格是流水线级指标不是本集分类成绩。你的模型成绩就是"首个公开基线",建议连划分脚本一起开源。
Q26:句子顺序信息有用吗?
sentence_id 可还原句序,用作特征有信息量(回答开头的框架句偏 False、中段事实句偏 True 是合理先验)。但别用 sentence_id 之外的位置信息——段落结构未存列(§2.2 规范 1)。
Q27:能和上游 Self-Checker 语料对上吗?
对不上——上游语料未公开发布,你只有本集的 answer_id,没有上游的回答文本与 3,840 claims 标注。理论上若上游未来发布,answer_id 是现成的回连键(§8.2)。
Q28:引用格式怎么写?
数据集引 HF(microsoft/claimify-dataset,CDLA-Permissive-2.0);方法与指标引 ACL 2025 论文(DOI 10.18653/v1/2025.acl-long.348 / arXiv:2502.10855);上游语料出处引 Self-Checker(arXiv:2305.14623,NAACL 2024 Findings)。三处引用对象不同,别只引其一(坑 2/坑 6)。
F. 引用与写作
Q29:只引论文不引数据集(或反之)有什么后果?
出处不全。数据规模与标签口径的唯一出处是 HF README(论文先于数据发布、未含本数据集);方法与三指标的唯一出处是论文;商用限制的唯一出处是博客脚注——三者任何单一来源都覆盖不了全部分 claims(附录 J 对照表)。规范写法:规模引 README、方法指标引论文、许可引数据卡与博客脚注。
Q30:我司想在商业产品里用,边界在哪?
三句话:6,490 句数据随便用(CDLA-Permissive-2.0,保留声明即可);四阶段流水线的官方实现不能商用(博客脚注);自己照论文思想实现一遍不受限(思想无版权,提示词与代码文本有)。细节与替代路径见附录 G。
Q31:论文指标怎么引用才不出错?
永远带"论文自报"限定词 + 注明裁判为 GPT-4o 口径;不写"第三方验证 99% 准确率"(既非第三方、也非 accuracy 概念);不把三个指标相加平均(§5.1);注明工作点敏感性(§5.5)。
Q32:写综述时本条目应该归到哪一类?
“LLM 输出核查/主张抽取的标注资源”,不是"医学数据集"、不是"幻觉检测基准"、也不是"QA 基准"——三个都不是(§9.2 检索路径 3/4)。归类错误会误导读者对它的规模与用途预期。
Q33:医学场景的宣称怎么把握?
可以说:“含 8.5% 医学主题句(关键词法实测)、其中 415 句含可核查主张、可用于医学 Selection 模块的种子评测”。不可以说:“医学主张抽取数据集”“医学事实核查语料”“临床级医学资源”(坑 8;FACTS.md §8 双口径)。
Q34:动态数字(下载量等)怎么写进文档?
带"截至"时点:downloads 82 / likes 7(截至 2026-09-28)。静态数字(6,490/3,833/396/2,258,269 bytes)不随时间变,直接写。混写是最常见的快照污染(附录 Q 第 2 条)。
G. 争议与局限
Q35:不知道标注一致性,还能信这个数据集吗?
按证据分级用:README 的规模与比例已实测验证(附录 T 全 PASS);标签口径有论文与上游协议参照;但个体标签质量无一致性数据背书——当训练集用(噪声耐受)风险可控,当评测金标准用(逐句对错敏感)建议先抽几百句自测一致性(附录 M R4 门槛)。
Q36:发现疑似标错的句子怎么办?
先按坑 4 复核:拼回完整回答(同 answer_id 按 sentence_id 排序)看上下文——相当一部分"错误"是裸句视角错觉。复核后仍认为错的,别改官方标签(数据集是冻结形态),建自己的纠错覆盖层(answer_id+sentence_id → 纠正标签)并随代码发布——附录 Q 第 4 条的回连键设计正是为此预留。
Q37:本数据集和 MedNLI(rid 648)二选一怎么选?
不是二选一,是接力关系:Selection(这句值得核查吗)用本集,裁决(核查后支持与否)用 MedNLI——管线位置不同(§9.1)。若任务只能留一个:做 LLM 输出筛选留本集;做临床文本推理评测留 MedNLI。
Q38:上游会更新吗?数据会扩充吗?
冻结形态无更新承诺(2025-08-14 后无变更痕迹,存照)。上游 BingCheck 语料的公开与否取决于微软发布决策,无公开路线图——按"不会来"规划(附录 Q),若来了按 answer_id 回连(§8.2)。
事实清单(硬事实 32 条)
以下 32 条为本条目全部硬事实的集中存证,标注来源档位:【实测】= 本库 2026-09-28 经 hf-mirror.com 一手实抓复算;【官方】= 官方文档/论文/博客原文;【考据】= 本库交叉比对推断(非官方声明)。
- 【实测】data.csv 6,491 行 = 1 表头 + 6,490 数据行。
- 【实测】data.csv 大小 2,258,269 bytes。
- 【实测】五列字段:answer_id, question, sentence_id, sentence, contains_factual_claim。
- 【实测】contains_factual_claim True 3,833 句(59.06%,约 59.1%)。
- 【实测】contains_factual_claim False 2,657 句(40.9%)。
- 【官方】README 口径"59% contains a verifiable factual claim"。
- 【实测】unique answer_id 396 个。
- 【实测】unique question 393 个(3 个差额未解释)。
- 【实测】sentence_id 值域 0-46;平均每回答 16.4 句(6,490/396)。
- 【实测】句长均值 123.2 字符;最短 1;最长 1,111。
- 【实测】医学关键词(20 词表)命中 551 句(8.5%),其中 True 415 句。
- 【官方】仓库文件仅 .gitattributes / README.md / data.csv 三个。
- 【官方】license CDLA-Permissive-2.0;gated=false。
- 【实测】HF 抓取时点 downloads 82 / likes 7(2026-09-28)。
- 【官方】HF API lastModified 2025-08-14;usedStorage 560,031 bytes。
- 【官方】方法论文 “Towards Effective Extraction and Evaluation of Factual Claims”,arXiv:2502.10855(2025-02 提交)。
- 【官方】正式发表于 ACL 2025 主会:2025.acl-long.348,pp.6996-7045,DOI 10.18653/v1/2025.acl-long.348。
- 【官方】论文作者 Dasha Metropolitansky、Jonathan Larson(Microsoft Research,署名二人)。
- 【官方】官方博客 “Claimify: Extracting high-quality claims from language model outputs”,2025-03-19 发布。
- 【官方】四阶段流水线:句子切分与上下文构造 → Selection → Disambiguation → Decomposition。
- 【官方】论文自报指标:99% entailment / 87.6% coverage / 96.7% precision。
- 【官方】对比方法五件套:AFaCTA、Factcheck-GPT、VeriScore、DnD、SAFE(博客脚注 3)。
- 【官方】示例生成用 GPT-4o。
- 【官方】方法代码仅研究用途不可商用(博客脚注:“research purposes only and is not available commercially”)。
- 【官方】博客宣称"据我们所知首个"识别多义并高置信才抽取的主张抽取系统。
- 【官方】博客披露用 Claimify 评估 GraphRAG(comprehensiveness/diversity 维度,官方宣称 GraphRAG 更优)。
- 【官方】博客将 Claimify 定位为 Azure AI Groundedness Detection 类工具链的技术上游。
- 【考据】unique answer_id 396 与 Self-Checker 论文(NAACL 2024 Findings,pp.163-181,arXiv:2305.14623)"396 条 Copilot 回答"精确吻合——同批语料二次标注(README 不提上游)。
- 【官方】上游 BingCheck:3,840 claims;每回答 391.5 tokens / 9.7 claims;每 claim 6.2 条证据句;四类标签(Supported/Partially Supported/Refuted/Not Supported)。
- 【官方】上游标注 Krippendorff’s alpha 迭代 0.44 → 0.72 → 0.86。
- 【考据】本数据集标注者间一致性未公开;医学句 True 密度 75.3% 高于全集 59.1%(密度数字【实测】,解读为考据)。
- 【官方】ModelScope(魔搭社区)同步上架同名数据集(本库未抓取其计数,存照待核)。
术语表(28 条)
| 术语 | 英文 | 释义 |
|---|---|---|
| 主张抽取 | claim extraction | 从文本中抽出可独立核查的事实主张的 NLP 任务,LLM 输出核查管线的前置环节 |
| 事实主张 | factual claim | 原则上存在客观答案、可由外部证据核查的陈述句或陈述成分 |
| 可核查性 | verifiability | "能否被核查"的可行性判断,区别于真伪(truthfulness)——本数据集标注的唯一维度 |
| 句子级标注 | sentence-level annotation | 以句子为标注单元的标签体系;与主张级(claim-level)、回答级(response-level)相对 |
| 混合句 | mixed sentence | 既含可核查事实又含评价/指令的句子;本集整体标 True,不拆分成分 |
| Selection | Selection | Claimify 流水线第二阶段:筛除无可核查内容的句子、改写混合句 |
| Disambiguation | Disambiguation | 第三阶段:消解指代/范围/时间歧义,不可消解者标 Cannot be disambiguated 并剔除 |
| Decomposition | Decomposition | 第四阶段:把无歧义句分解为保留上下文锚点的原子主张 |
| 蕴含 | entailment | 主张被源句完全蕴含(不外推不加戏);论文指标之一(99%) |
| 覆盖率 | coverage | 源句可验证内容被抽取主张覆盖的比例;论文指标之一(87.6%) |
| 精确率(排除) | precision | 排除不可验证内容的精确率;论文指标之一(96.7%) |
| 幻觉检测 | hallucination detection | 判定 LLM 输出与事实/证据不符内容的任务;本数据集是其前置筛选环节的语料 |
| 有据性检测 | groundedness detection | 判定 LLM 输出是否有证据支持的检测;Azure 内容安全产品线的技术方向 |
| 二次标注 | secondary annotation | 对已有语料按新任务维度重新标注;本集对 BingCheck 语料的句子级标注即此类 |
| Krippendorff’s alpha | Krippendorff’s alpha | 多标注者一致性系数,0.44→0.72→0.86 为上游三轮迭代曲线 |
| NLI | natural language inference | 自然语言推理/蕴含判定;核查管线的下游裁决模块(库内 MedNLI 为其医学语料) |
| RAG | retrieval-augmented generation | 检索增强生成;其输出是本数据集所属核查管线的典型对象 |
| GraphRAG | GraphRAG | 微软基于知识图谱的 RAG 变体;官方博客披露用 Claimify 评估其全面性与多样性 |
| CDLA | Computing Data License Agreement | 面向数据集的许可协议族;Permissive-2.0 为其宽松版(允许商用与再分发) |
| Copilot | Microsoft Copilot | 微软 LLM 问答产品(新 Bing);本数据集全部回答语料的来源系统 |
| answer_id | answer_id | 一次 Copilot 回答的唯一标识(396 个),本集采样单位与上游回连键 |
| sentence_id | sentence_id | 回答内句子序号(0-46,从 0 计数),与 answer_id 组成联合主键 |
| hf-mirror.com | hf-mirror.com | HuggingFace 镜像代理站;主站不可达环境的一手数据获取通道(本库实测可用) |
| ModelScope | ModelScope(魔搭社区) | 阿里系模型/数据集平台;本数据集第二同步上架渠道 |
| dataset card | dataset card | HF 数据集说明页;本集卡片含规模/口径/引用但缺标注协议与数据字典 |
| usedStorage | usedStorage | HF API 的仓库计量口径(560,031 bytes),与实体文件大小(2,258,269 bytes)不同,勿混用 |
| DAIMS | DAIMS | 本库 AI-Ready 评估框架:可发现性/可获取性/可互操作/元数据/可持续性五维(附录 B) |
| AI-Ready | AI-Ready | 数据集被机器直接发现、获取、解析并进入训练/评测管线的就绪程度;本条目评级"高" |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目 slug | claimify |
| 数据集官方名 | microsoft/claimify-dataset(HuggingFace)/ Claimify Dataset |
| 本质 | LLM 回答句子级二分类标注语料(主张抽取 Selection 环节金标准) |
| 发布主体 | Microsoft Research(Dasha Metropolitansky、Jonathan Larson) |
| 规模 | 6,490 句 / 396 回答 / 393 问题 / 单文件 CSV 2,258,269 bytes |
| 标签 | True 3,833(59.1%)/ False 2,657(40.9%) |
| 论文 | arXiv:2502.10855 → ACL 2025 主会 2025.acl-long.348(DOI 10.18653/v1/2025.acl-long.348) |
| license | CDLA-Permissive-2.0(数据);方法代码仅研究用途(代码) |
| 获取 | HF 直链 / hf-mirror.com 镜像 / ModelScope 同名 |
| 版本时点 | 仓库 lastModified 2025-08-14;本库实抓 2026-09-28(downloads 82 / likes 7) |
| 医学占比 | 8.5%(551/6,490,关键词法),True 415 句 |
| AI-Ready 评级 | 高(附录 B;失分:元数据深度、上游透明度) |
| 库内最近邻 | MedNLI(rid 648)、HealthSearchQA(rid 492)、EMR-QA(rid 139)、EHRSQL(rid 713) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 7 | HF dataset card 可索引、论文(ACL 开放获取)与博客反链完整;但名实分离(方法/数据同名异体,坑 2)与上游不透明(坑 4)拉低检索命中率 |
| A 可获取性 | 9 | 无注册无申请、单文件 2.25 MB 秒下、CDLA-Permissive-2.0 可商用、双镜像生态(hf-mirror/ModelScope)——库内获取最顺滑档;扣 1 分:上游语料不可得 |
| I 可互操作 | 8 | 单文件 CSV 通用格式、五列 schema 自明、pandas/datasets 一行加载、无专有依赖;扣分:无官方 JSON/Parquet 版、Markdown 残迹需自定处理策略 |
| M 元数据质量 | 6 | README 含规模/口径/引用但无数据字典、无标注协议原文、无版本号、无划分建议;本条目 §2.2 的字段规范属二手整理 |
| S 可持续性 | 7 | 微软官方维护、双平台同步、CDLA 许可长期稳定;扣分:仓库为"发布即冻结"形态(2025-08 后无更新痕迹)、下游社区活跃度低(downloads 82) |
| 综合评级 | 7.4/10(高) | 获取与许可接近满分,失分集中在元数据深度与生态活跃度;在"LLM 生成文本标注语料"品类中属 AI-Ready 标杆 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 获取方式与时点 |
|---|---|---|
| 6,490 句 / 6,491 行 | data.csv 实体 | hf-mirror.com 下载逐行计数,2026-09-28 |
| 2,258,269 bytes | data.csv 实体 | 下载后 ls -l,2026-09-28 |
| True 3,833 / False 2,657 | data.csv contains_factual_claim 列 | pandas value_counts,2026-09-28 |
| 59.1% / README 59% | 实算 3,833/6,490 + README 文本 | 同上 + dataset card 抓取 |
| 396 answer_id / 393 question | data.csv nunique | pandas nunique,2026-09-28 |
| 句长 1 / 123.2 / 1,111 | data.csv sentence 列 | pandas str.len() 统计,2026-09-28 |
| sentence_id 0-46 / 16.4 句 | data.csv sentence_id 列 | groupby(answer_id) 统计,2026-09-28 |
| 医学句 551 / True 415 | data.csv sentence 列 × 20 词表 | 关键词命中法(附录 F 代码),2026-09-28 |
| downloads 82 / likes 7 | HF API(镜像通道) | API 抓取,2026-09-28 |
| lastModified 2025-08-14 / usedStorage 560,031 | HF API | 同上 |
| CDLA-Permissive-2.0 | dataset card license 字段 | 同上 |
| 四阶段 / 三指标 / 五对比法 / GPT-4o | ACL 2025 论文 + 官方博客 | WebFetch 实抓,2026-09-28 |
| “仅研究用途不可商用” | 官方博客脚注原文 | 同上 |
| 396 = 上游 Copilot 回答数 | Self-Checker 论文(arXiv:2305.14623) | 论文原文比对,2026-09-28 |
| 3,840 claims / 391.5 tokens / 9.7 claims / 6.2 证据句 | 同上 | 同上 |
| 4 类标签 / alpha 0.44→0.72→0.86 | 同上 | 同上 |
| pp.6996-7045 / DOI | ACL Anthology 2025.acl-long.348 页面 | WebFetch 实抓,2026-09-28 |
| 博客发布日 2025-03-19 | Microsoft Research Blog | WebFetch 实抓,2026-09-28 |
| ModelScope 同名收录 | ModelScope 站内检索 | 确认存在,未抓计数(存照) |
附录 D:数据获取决策树
需要 claimify-dataset?
├── 只要数据(99% 的场景)
│ ├── 网络可达 huggingface.co
│ │ └── curl https://huggingface.co/datasets/microsoft/claimify-dataset/resolve/main/data.csv
│ ├── 网络被封锁(本库环境实测)
│ │ └── curl https://hf-mirror.com/datasets/microsoft/claimify-dataset/resolve/main/data.csv
│ └── 或用 datasets 库 + HF_ENDPOINT=https://hf-mirror.com(§6.2 代码二)
├── 要方法代码(复现论文/改流水线)
│ └── GitHub microsoft/claimify —— 注意仅研究用途、不可商用(坑 5)
├── 要上游 BingCheck 3,840 claims 标注
│ └── 无公开渠道(§6.1)——只能读论文(arXiv:2305.14623)描述,或邮件作者申请(无成功先例存照)
└── 要医学专用子集
└── 无官方版 —— 用附录 F 代码自抽 551 句(关键词口径),或按 §8.4 路径自建
附录 E:data.csv 字段规范与加载代码
字段规范(本条目 §2.2 的工程版,可直接进团队 wiki):
| 规则 | 内容 |
|---|---|
| 主键 | (answer_id, sentence_id) 联合唯一 |
| 采样单位 | answer_id(396 个);按组切分防泄漏 |
| 去重键 | question 文本(393 个);与 answer_id 无一一对应(坑 3) |
| 排序 | sentence_id 组内升序即句序;跨组比较无意义 |
| 缺失值 | 本库实测六列无空值;出现空值先怀疑文件不完整 |
| 最小长度过滤 | 建议 sentence ≥ 20 字符进训练(残句剔除);阈值需在文档记录 |
| 长句通道 | sentence > 200 字符单独人审或后处理(坑 7) |
| Markdown | 保留原样(训练/推理分布一致性);纯文本分析再剥离 |
# 标准加载与切分骨架(训练用)
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
df = pd.read_csv("data.csv")
assert (df.duplicated(subset=["answer_id", "sentence_id"]).sum() == 0) # 主键唯一
assert df.isna().sum().sum() == 0 # 无空值(实测口径)
df["char_len"] = df["sentence"].str.len()
train_df = df[df["char_len"] >= 20] # 残句过滤(阈值自行记录)
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr_idx, te_idx = next(gss.split(train_df, groups=train_df["answer_id"])) # 按回答分组切分
train, test = train_df.iloc[tr_idx], train_df.iloc[te_idx]
# 注意:切分后 test 的 question 集与 train 可能重叠(同问题不同回答)——
# 若要 question 级隔离,改用 question 文本分组(两种口径都在用,需在论文里写明)
# 推断接口骨架:把训练好的 Selection 模型接到核查管线
def select_sentences(question: str, answer: str, clf) -> list[dict]:
"""对一段 LLM 回答逐句打分,返回值得核查的句子。"""
sentences = naive_split(answer) # 生产环境换用与 Claimify 阶段一相当的结构化切分
scored = clf.predict_batch([{"question": question, "sentence": s} for s in sentences])
return [{"sentence": s, "p_claim": p}
for s, p in zip(sentences, scored) if p >= 0.5]
# 管线接续:select_sentences 输出 → 检索证据 → NLI 裁决(MedNLI 类模型)→ 聚合结论
附录 F:医学句占比实测代码(本库一手口径)
# 复现 §7.3 医学句实测:20 词关键词表命中法(2026-09-28 口径)
import pandas as pd
df = pd.read_csv("data.csv")
KEYWORDS = ["heart", "patient", "disease", "treatment", "surg", # surg* 覆盖 surgery/surgical
"medical", "drug", "cancer", "tumor", "infect", # infect* 覆盖 infection/infections
"vaccin", "blood", "brain", "hospital", "therap", # vaccin*/therap* 词干匹配
"diagnos", "genetic", "protein", "diseas", "clinic"] # diagnos*/diseas* 词干匹配
pat = "|".join(KEYWORDS)
mask = df["sentence"].str.lower().str.contains(pat, regex=True, na=False)
med = df[mask]
print(f"医学句: {len(med)} ({len(med)/len(df):.1%})") # 551 句 (8.5%)
print(med["contains_factual_claim"].value_counts()) # True 415 / False 136
print(f"医学句 True 密度: {med['contains_factual_claim'].mean():.1%}") # 75.3% vs 全集 59.1%
# 抽出心血管史问答线(密度最高的主题簇)
cardio = med[med["sentence"].str.lower().str.contains("heart")]
for _, r in cardio.head(10).iterrows():
print(r["answer_id"], r["sentence_id"], r["contains_factual_claim"], r["sentence"][:80])
# 已知口径局限:关键词法漏不含词表的医学句(纯药名等)、误收隐喻用法——只当粗筛(坑 8)
附录 G:许可条款细读
数据集:CDLA-Permissive-2.0(以官方许可文本为准,以下为使用要点摘录):
- 允许:商用、复制、再分发、制作衍生数据集、更换衍生品许可、进入训练管线。
- 义务:随再分发保留原始许可声明与署名信息;不得用原始作者名义为衍生品背书。
- 免责:数据按"现状"提供,不附任何担保——含标签正确性担保(人工标注必有分歧,见 §4.3)。
- 对比参照:宽松度类似 CC BY-4.0/MIT 的数据集版本;与 CDLA-Sharing(弱 copyleft)相对。
方法代码:自定义研究限制(GitHub microsoft/claimify + 博客脚注):
- 博客脚注原文:“research purposes only and is not available commercially”——仅研究用途、不提供商用授权。
- GitHub 仓库许可文件以仓库实际文本为准(本库以博客脚注为口径存照)——克隆前自行核对 LICENSE 文件。
- 商用替代路径:自研实现(方法思想不受版权保护,提示词与代码实现受)、或微软商业化产品通道(Azure AI Groundedness Detection 等,§5.4)——两条路径均与本数据集许可无关(数据照常可用)。
上游语料:未发布——无许可条款可读;论文附录口径的存在性描述是唯一"获取"方式。
两套许可分离纪律(坑 5):引用本项目许可时,数据、代码、论文(ACL 版权体系)三个对象分别引各自条款;任何"Claimify 的许可是 X"的笼统说法都应展开为三句。
附录 H:坑点档案(与 §10 对照)
| 坑 | 一句话口诀 | 详见 |
|---|---|---|
| 坑 1 | 3,840 主张 / 6,490 句 / 3,833 True——口径三选一并写明;False 不是假话 | §2.6、§4.1 |
| 坑 2 | 方法在 GitHub、数据在 HF;写文档区分 “Claimify 方法” 与 “claimify-dataset” | §6.1 |
| 坑 3 | 396 回答 ≠ 393 问题;answer_id 当采样单位,question 当去重键 | §2.4 |
| 坑 4 | 复核标签先拼回全文——标注者看过上下文,你看的是裸句 | §3.2、§4.2 |
| 坑 5 | 数据 CDLA 随便用、代码研究限定别商用——两套许可互不引申 | §6.3、附录 G |
| 坑 6 | 官方声明 / 一手实测 / 本库考据三档口径分开引——“59%” 与 “59.1%” 各归各位 | §5.3、§5.5 |
| 坑 7 | 1 字符残句与 1,111 字符长句未清洗——训练前过滤、人审前分段 | §2.5、附录 E |
| 坑 8 | 通域语料医学占 8.5%——"医学切片"可以说,"医学数据集"不能说 | §7.3 |
附录 I:检索决策树
你检索到本条目是因为搜了什么?
├── "claim extraction / 主张抽取 数据集"
│ └── 对,就是它——正文 §1 十问 → §2 schema → §6 下载
├── "hallucination detection / 幻觉检测 数据"
│ └── 半对——它只管前置筛选(Selection),无真伪标签(坑 1)
│ → 真伪需求转 MedNLI(rid 648)或 FEVER 型资源;管线组合见 §9.2 路径 1
├── "medical QA dataset / 医学问答数据集"
│ └── 不对——医学占 8.5% 的通域语料(坑 8)
│ → 转 MedMCQA(rid 111)/ HeadQA(rid 120)/ MedQuAD(rid 160)/ EMR-QA(rid 139)
├── "Copilot / LLM 输出 标注"
│ └── 对——库内唯一标注对象为 LLM 生成文本的条目(§9.1)
└── "Claimify 论文 99% entailment"
└── 指标在 §5;复现要求与守则在 §5.5;数据集只是 Selection 环节的金标准(§5.5 守则 4)
附录 J:三份官方文档的口径差异对照
写作过程中并读的三份官方文档(README / 论文 / 博客),信息覆盖各不相同——引用前按下表对号:
| 信息项 | HF README | ACL 论文 | 官方博客 |
|---|---|---|---|
| 6,490 句规模 | 有 | —(论文先于数据发布,未含本数据集) | — |
| 59% 标签口径 | 有(整数) | — | — |
| 四阶段方法描述 | — | 有(完整) | 有(概览) |
| 99/87.6/96.7 指标 | — | 有(含对比表) | 有(转述) |
| 五对比方法名单 | — | 有(正文) | 有(脚注 3) |
| 代码商用限制 | — | — | 有(脚注原文) |
| 上游 Self-Checker/BingCheck | 无 | 无 | 无 |
| GraphRAG 评估案例 | — | — | 有 |
| 396 回答口径 | —(仅数据隐含) | — | — |
三处共同缺口即上游关系——这就是 §4.4 数字指纹考据存在的原因。
附录 K:LLM 输出标注语料品类对照(生态速写)
| 维度 | claimify-dataset(本条目) | 上游 BingCheck 口径 | 库内人工文本 NLP 语料参照 |
|---|---|---|---|
| 标注对象 | LLM 生成回答的句子 | LLM 回答内的主张 | 人类撰写的临床/文献文本 |
| 标注任务 | 可核查性二分类 | 证据支持度四分类 | NER/关系/蕴含等任务谱系 |
| 规模 | 6,490 句 / 396 回答 | 3,840 claims / 396 回答 | 各条目自异(如 MedNLI 14k 对) |
| 真伪标签 | 无 | 有(Refuted 等) | 任务而异 |
| 公开获取 | HF 直链(本库实测) | 无(存照) | 多数公开 |
| 许可 | CDLA-Permissive-2.0 | —(未发布) | 各条目自异 |
| 管线角色 | Selection 金标准 | 裁决金标准 | 领域模块训练资源 |
品类结论:在"LLM 输出标注"这一新生品类里,公开可下载的句子级资产以本集为少见样本;其"上游裁决不可得、自身筛选可得"的缺口结构,是当前生态的缩影——这也是本条目坚持在 §9.2 给出"三件套组合"检索路径的原因。
本条目由千方病案医数集 AI-Ready Wikipedia 写手代理 agent-b-claimify 编写。一手数据实抓时点 2026-09-28(hf-mirror.com 镜像通道);官方数字与口径以三份官方文档(HF README / ACL 2025 论文 / Microsoft Research Blog)为准;考据结论(上游语料复用)已按坑 6 口径标注。事实档案见同目录 FACTS.md(九节)。
附录 L:医学句主题画像与示例池(一手实测)
对 551 个医学关键词命中句的主题抽样画像(本库 2026-09-28 实测口径,抽样非全量人读):
| 画像维度 | 抽样观察 | 对使用者的含义 |
|---|---|---|
| 断言类型 | 历史断言(年份、人物、器械发明)密度最高;其次机制断言(生理过程、药理作用)与统计断言(发生率、短缺规模) | 医学句的可核查性主要锚在"可检索的历史/机制/数字"上——核查证据源以百科与文献型来源为佳 |
| 主题簇 | 心血管史问答线密度最高:人工心脏(Jarvik-7)、首例人体心脏手术(1952)、心力衰竭、供体心脏短缺与心脏移植 | 单一主题簇可跨多句出现(同一问答线内 5-10 句连续医学内容),抽子集时按 answer_id 聚簇取样更高效 |
| 时代口径 | 语料采集于 2023-2024,医学断言反映当时指南与共识口径 | 医学事实有时效性——用本集评测的核查系统若接"当前"证据源,个别标签会被时代差干扰(存照) |
| 敏感度分布 | 抽样未见个体化诊疗建议、剂量医嘱类高危句;以科普级陈述为主 | 这是通域问答的画像,不代表临床 LLM 输出分布——迁移到院内场景需重估(§8.4) |
示例句(官方口径存照,一手抓取自 data.csv):
“The invention of the first artificial heart was inspired by the need to save lives of people with heart failure and to overcome the shortage of donor hearts for transplantation.”(出自 Jarvik-7/Barney Clark 人工心脏问答线;contains_factual_claim = True)
该句是本数据集标注对象的典型标本:一句之内压着三个可独立核查点(人工心脏发明的动机、心力衰竭的致死性、供体心脏短缺),却作为一个句子只拿到一个 True 标签——句子级标注的粒度失配(§8.1)与混合句规则(§4.1)在此句同时可见。
主题簇取样骨架(按问答线抽医学子集):
# 从 551 医学句按 answer_id 聚簇,取"医学句 ≥ 3 句"的问答线做高密度子集
med_lines = med.groupby("answer_id").filter(lambda g: len(g) >= 3)
print(f"高密度医学问答线: {med_lines['answer_id'].nunique()} 条, 共 {len(med_lines)} 句")
# 用途:医学 Selection 评测的天然聚簇样本(同线句子共享主题与文风,注意按线切分防泄漏)
附录 M:句子级标注裁决规则模板(本库建议 SOP)
要把"是否含可验证事实主张"的标注复刻到自有语料(医学或通域),以下规则模板直接可用——它从本数据集的口径反推 + §4.2 疑难句框架细化而来,本库建议稿,非官方协议:
R1 判定主干:句子含至少一条"原则上存在客观答案"的断言 → True;否则 False。存在量词优先于成分占比。
R2 疑难裁决表(逐条对号,先到先得):
| 句型 | 裁决 | 示例与说明 |
|---|---|---|
| 纯事实断言(含数字/年份/人物/地点锚点) | True | “The surgery lasted nine hours.” |
| 无锚点评价/偏好/指令/过渡 | False | “This is a great question.” “Let’s look at the options.” |
| 数字模糊断言(significantly/many/recently 无量化) | False | 锚点缺失,不可核查(§4.2 第 1 类) |
| 信念归属句(“Experts believe X”) | True | 可核查的是"专家是否如此认为" |
| 条件/假设句(未实现的 if/would) | False | 但内嵌历史事实成分的混合句走 R1 存在量词 → True |
| 上下文依赖句(指代裸句) | True(有上下文时) | 标注时给上下文,使用时按 answer_id 回拼(坑 4) |
| 定义/重言句 | False | “Vaccines are vaccines.” 类无核查价值 |
| 预测句(will/be expected to) | False | 未来事件无既有答案;但"was expected to"(历史预测)可 True |
R3 标注流程:
- 标注者按 answer_id 整线阅读(带完整回答上下文),逐句打标——禁止裸句盲标。
- 双人独立标注 + 分歧仲裁三轮(参考上游 alpha 曲线 0.44→0.72→0.86 的迭代节奏:首轮后集中仲裁高频分歧句型,再复标)。
- 每轮计算 Krippendorff’s alpha 并记录;alpha < 0.6 时先修指南再继续,不带病推进。
- 边界句入"判例库"(同文同判),判例库随指南一起版本化。
R4 质量门槛建议:训练集 alpha ≥ 0.7;评测集 alpha ≥ 0.8(评测集宁少毋脏)。本数据集自身的一致性未公开(§4.3 存照),以 R4 作为自有标注的自检线。
R5 医学场景附加规则:含药物名、剂量、术式的句子,无论有无锚点一律升级仲裁(医学 False/True 判错的安全代价不对称,§3.6);“建议/通常/一般而言"类医学惯例句按 R2 归属句逻辑裁决(可核查"惯例是否存在”)。
附录 N:与库内可获取性光谱的对照
库内数据集条目已形成可获取性光谱(注册审批 → 请求制 → 平台托管 → Registry 收录 → 公开直链)。claimify 在光谱上的位置与邻居:
| 档位 | 库内参照(rid 已验证) | 本条目对应 |
|---|---|---|
| 注册墙(最严) | dbgap 等注册审批型条目 | — |
| 请求制 | upon request 型老条目 | — |
| 平台托管 | TopBrain2026(rid 632,Zenodo 型) | — |
| Registry 收录 | REG2026(rid 639,AWS Registry 型) | — |
| 公开直链 | PANDA(rid 560,Kaggle 公开)/ panda-plus 家族 | claimify(本条目):HF 直链,全光谱最宽档 |
特色:claimify 不仅本体落公开直链档,而且没有任何伴生请求制/注册墙组件——母数据集(回答语料)虽不可得,但那是上游第三方的发布选择,不是本数据集的获取门槛。同家族的 panda-plus 是"母请求制 + 子公开直链"的双轨(详见该条目 §6.4),claimify 是"本体直链 + 上游缺失"的断轨——两种结构都提醒检索者:可获取性评估必须按资产分层做,笼统的"开放/不开放"二分在多层资产的数据集上必然失真。
附录 O:上游 Self-Checker/BingCheck 论文速览(考据对照用)
为支撑 §4.3/§4.4 的考据结论,此处集中存放上游论文的关键口径(全部为论文原文数字,本库逐条与 claimify-dataset 实测对照):
| 项 | Self-Checker/BingCheck 口径 | claimify-dataset 实测 | 对照结论 |
|---|---|---|---|
| 论文 | Li et al., “Self-Checker: A Plug-and-Play Approach for Controllable Hallucination Detection”, NAACL 2024 Findings, pp.163-181, arXiv:2305.14623 | —(本集无自有论文,配套 ACL 2025 方法论文) | 两代研究,同一机构谱系 |
| 回答来源 | Microsoft Copilot(新 Bing)实际回答 | answer_id 对应 Copilot 回答(question 通域画像吻合) | 同源 |
| 回答数 | 396 | 396(unique answer_id) | 精确吻合——考据核心证据 |
| 切分单元 | claim(主张,方法自定义切分) | 句子(句法切分,sentence_id 0-46) | 单元不同,计数不可比(坑 1) |
| 标注总数 | 3,840 claims | 6,490 句(True 3,833) | 三角存照(§2.6) |
| 回答体量 | 平均 391.5 tokens/回答 | 平均 16.4 句/回答 | 量级互洽(16.4 句 ≈ 391 tokens 量级) |
| 标注密度 | 9.7 claims/回答 | —(句级:16.4 句/回答) | 主张数 < 句数合理(多句合并/无主张句剔除) |
| 证据标注 | 每 claim 配 6.2 条证据句 | 无证据标注 | 维度缺失(§4.3) |
| 标签体系 | Supported / Partially Supported / Refuted / Not Supported | contains_factual_claim True/False | 正交维度(筛选 vs 裁决) |
| 一致性 | Krippendorff’s alpha 0.44 → 0.72 → 0.86(三轮) | 未公开 | 存照(§4.3) |
| 公开获取 | 无独立发布渠道(论文附录口径) | HF 公开直链 | 本集是这批回答的唯一公开化身 |
使用提醒:本表是"考据对照工具"不是"等价换算表"——任何把 3,840 claims 与 6,490 句互相换算的尝试都缺乏官方依据(两者切分规则不同且未公开对应关系)。
附录 P:常见错误引用示例与更正
写作/引用本条目时的八组"错误句 → 更正句"(与 §10 八坑一一对应,可直接贴进团队写作规范):
- ✗ “claimify-dataset 包含 3,840 个标注主张。” → ✓ “claimify-dataset 包含 6,490 个标注句子(上游 BingCheck 语料另有 3,840 个主张级核查标注,两者口径不同)。”
- ✗ “Claimify 数据集在 GitHub 上开源。” → ✓ “Claimify 方法代码在 GitHub(仅研究用途);数据集在 HuggingFace(CDLA-Permissive-2.0)。”
- ✗ “396 个问题各对应一个回答。” → ✓ “396 个回答对应 393 个唯一问题(映射关系未官方解释)。”
- ✗ “标为 False 的句子是模型说的话里有错。” → ✓ “标为 False 的句子只是不含可核查主张(评价、过渡等),与真假无关。”
- ✗ “微软开源的,商用没问题。” → ✓ “数据集许可宽松可商用(CDLA-Permissive-2.0);方法代码仅限研究用途。”
- ✗ “第三方评估显示 GraphRAG 优于传统 RAG。” → ✓ “微软官方博客宣称(非独立复现)用 Claimify 评估显示 GraphRAG 在全面性与多样性上更优。”
- ✗ “直接拿 6,490 句训练,无需预处理。” → ✓ “先过滤 1 字符级残句、单审 1,111 字符级长句(附录 E 规范)。”
- ✗ “这个医学数据集……” → ✓ “这个通域 LLM 输出标注语料(医学主题句占 8.5%,关键词法实测)……”
附录 Q:版本与快照管理建议
本数据集是"发布即冻结"形态(2025-08-14 lastModified 后无更新痕迹),但仍建议使用者建立自己的快照纪律:
- 固定文件指纹:入库时记录 data.csv 的字节数(2,258,269)与行数(6,491)——上游若换文件(重标/扩容),指纹对不上即告警;有条件时存 md5/sha256 于私有元数据。
- 引用带时点:downloads/likes 等动态计数随时间变化(本库 2026-09-28 快照为 82/7),引用一律带"截至"字样;静态数字(6,490/3,833/396)不随时间变,可直接引用。
- 双源留痕:HF 主源 + ModelScope 备源各自留快照;两源若出现字节级差异(理论上不应该),以 HF 为主并暂停使用、回查发布方公告。
- 衍生标注回连:你在本集上做的任何二次标注(纠错、细分、扩充),保留 answer_id/sentence_id 原键——未来上游若发布 BingCheck 语料,三键(回答-句子-主张)可望全线贯通(§8.2、附录 O)。
- 环境自描述:复现实验时记录 HF_ENDPOINT 是否走镜像——镜像通道的文件与主站理论同源,但网络层差异值得留痕(本条目全部一手数据即镜像通道产物,诚实标注是可复现性的一部分)。
附录 R:快速入门全流程(从下载到管线接入)
从零到"能用"的最短路径,六步走(代码骨架均见前文对应附录):
- 下载并校验(§6.2):镜像通道拉 data.csv,三连校验(6,491 行 / 2,258,269 bytes / True 3,833)。
- 清洗(附录 E):残句过滤 + 长句分流,保留 Markdown 原样;按 answer_id 分组切分 train/test。
- 建立基线(§5.5 守则 2 / Q25):先跑一个现成 LLM 零样本分类当基线——官方没发布基线,你的第一个数字就是社区首个公开参考,连切分脚本一起记录。
- 训练/评估 Selection 模块(§4.1):二分类目标 contains_factual_claim;评测报 accuracy/F1 + 按句长分桶的分组成绩(长句通常是失分区)。
- 医学子集专项(附录 F/L):551 句医学切片 + 高密度问答线聚簇样本单独出成绩——医学场景部署前必看这组数。
- 接入管线(附录 E 骨架二):Selection 输出接证据检索与 NLI 裁决(MedNLI,rid 648),按 answer_id 聚合到回答级结论——此时你拥有了一条与本数据集设计初衷同构的完整核查链。
每一步的产物都保留 answer_id/sentence_id 键(附录 Q 第 4 条),让未来的你(以及上游语料的可能发布)能随时回连对账。
附录 S:HF API 元数据快照全表(2026-09-28,镜像通道)
| API 字段 | 快照值 | 备注 |
|---|---|---|
| id | microsoft/claimify-dataset | 官方 org 命名空间 |
| lastModified | 2025-08-14 | 仓库最后变更时点(UTC 口径) |
| downloads | 82 | 时点快照,引用须带"截至 2026-09-28" |
| likes | 7 | 同上 |
| gated | false | 无访问申请门槛 |
| disabled | false | 正常可用状态 |
| license/tags | CDLA-Permissive-2.0 | dataset card 与 API 双确认 |
| usedStorage | 560,031 bytes | 仓库计量口径;实体 data.csv 2,258,269 bytes(坑 9,勿混写) |
| 文件清单 | .gitattributes / README.md / data.csv | 三文件,无子目录 |
快照使用规则:动态字段(downloads/likes)只作"热度参考",不入学术论证;静态字段(规模/许可/文件清单)可作结构性引用。API 全部经 hf-mirror.com 代理取得,主站直连在本库环境不可用(§6.2 存照)。
附录 T:硬数字一键复算脚本(整合版)
事实清单 32 条中全部可程序化项的单一复算入口——拿到 data.csv 后跑一遍,输出应与本条目完全一致:
# claimify_hard_numbers.py —— 本条目硬数字一键复算(2026-09-28 口径)
import pandas as pd, sys
df = pd.read_csv(sys.argv[1] if len(sys.argv) > 1 else "data.csv")
ok = lambda name, got, want: print(f"[{'PASS' if got == want else 'FAIL'}] {name}: {got} (期望 {want})")
ok("数据行数", len(df), 6490) # 事实 1
ok("unique answer_id", df["answer_id"].nunique(), 396) # 事实 7
ok("unique question", df["question"].nunique(), 393) # 事实 8
ok("True 句数", int((df["contains_factual_claim"] == True).sum()), 3833) # 事实 4
ok("False 句数", int((df["contains_factual_claim"] == False).sum()), 2657) # 事实 5
ok("True 占比(%)", round(3833/6490*100, 2), 59.06) # 事实 4/6(59.06→59.1)
ok("sentence_id 最大值", int(df["sentence_id"].max()), 46) # 事实 9
ok("平均句数/回答", round(len(df)/396, 1), 16.4) # 事实 9
s = df["sentence"].str.len()
ok("平均句长(字符)", round(s.mean(), 1), 123.2) # 事实 10
ok("最短句长", int(s.min()), 1) # 事实 10
ok("最长句长", int(s.max()), 1111) # 事实 10
KEY = ["heart","patient","disease","treatment","surg","medical","drug","cancer",
"tumor","infect","vaccin","blood","brain","hospital","therap",
"diagnos","genetic","protein","diseas","clinic"]
med = df[df["sentence"].str.lower().str.contains("|".join(KEY), na=False)]
ok("医学句数", len(med), 551) # 事实 11
ok("医学句 True 数", int(med["contains_factual_claim"].sum()), 415) # 事实 11
import os
ok("文件字节数", os.path.getsize(sys.argv[1] if len(sys.argv) > 1 else "data.csv"), 2258269) # 事实 2
print("---- 复算完成:全 PASS 即与本条目口径一致 ----")
复算结果与期望不符时的排查顺序:文件完整性(下载截断)→ 引号内逗号导致的解析器差异(用 pandas 而非手写 CSV 分割)→ 上游是否悄悄换版(对照 lastModified,走附录 Q 快照纪律)。
附录 U:本数据集可承载的十个研究课题设想
给找选题的研究者:这 6,490 句能撑起的课业方向(按成本从低到高排序):
- Selection 模块基准评测:把主流 LLM 零样本/少样本判"是否含可核查主张"的成绩做成公开榜单——官方没给基线,谁先做谁定义赛道(附录 T 复算脚本即起点)。
- 上下文依赖的标签敏感性分析:裸句 vs 拼回全文两种输入下的模型判别差异——直接量化坑 4 的实际影响面。
- 句长与标注可靠性的关系:按句长分桶分析模型与人工判别的一致率曲线,验证"1,111 字符一句一标"的粒度失配假说(§2.5)。
- 跨 LLM 的标签迁移:用本集(Copilot 口径)训练的筛选器在 GPT/Claude/开源模型输出上评测迁移衰减——"输出分布外推"的实证(rai:dataLimitations 第 2 条的定量版)。
- 医学切片的领域 gap:415 个 True 医学句 vs 通域句上的模型成绩差——"医学内容更可核查"假说(75.3% vs 59.1% 密度差)的延伸验证。
- False 句的型态学:对 2,657 个 False 句做无监督聚类,产出"不可核查内容类型学"(评价/过渡/指令/条件)——直接反哺标注指南(附录 M R2 表的实证化)。
- 与 NLI 裁决模块的级联评测:本集筛选 + MedNLI(rid 648)裁决的级联系统在人工复核子集上的端到端误差归因(筛选错 vs 裁决错)。
- 主动学习标注成本曲线:以本集为种子,在自有 LLM 输出上做主动学习增量标注,画"标注预算-模型成绩"曲线(§8.4 轻改造路径的成本建模)。
- 多语言主张抽取:把五列 schema 与 R2 裁决表移植到中文 LLM 输出,构建平行标注集——库内中文医疗 NLP 条目(如 CBLUE 系)的核查侧补充。
- 主张抽取-核查-聚合的完整复现:用研究用途代码(§6.1 第二层)+ 本集 + 开源裁判模型,复现论文三指标并测裁判模型敏感性(§5.5 守则 3 的系统化)——成本最高但最接近官方口径。
附录 V:True/False 句型特征速查(从标注口径推导)
训练或人工复核前的"直觉校准表"——左右两列是从 §4.1/§4.2 口径推导的典型特征(示意性归纳,判例以官方标签为准):
| True 句的常见特征 | False 句的常见特征 |
|---|---|
| 含数字、年份、金额、百分比锚点 | 纯评价词(great/important/significant 无量化) |
| 命名实体 + 动作/属性(“X invented Y in YYYY”) | 对话框架(“Let’s…”、“Here’s what…”) |
| 历史断言(发明、发现、事件) | 指令与流程引导(“Consider…”、“You should…”) |
| 归属断言(“Experts believe…”) | 未实现的假设/预测(will/would/if 从句主导) |
| 因果/机制陈述(生理过程、工作原理) | 重言与定义循环(无外部证据可查) |
| 混合句中的事实半句(整句 True) | 混合句中的评价半句(不改变整句 True) |
| 长、信息密、名词短语密集 | 短、寒暄、第二人称对话 |
使用提醒:本表是启发式不是规则——模型的正确目标是学出软概率(附录 E p_claim),而不是把本表硬编码成规则引擎;把速查表当训练数据采样器(每类特征抽句人审)比当分类器更安全。
附录 W:FAQ 索引(38 问一览)
| # | 问题主题 | 分组 | 一句话答案 |
|---|---|---|---|
| Q1 | 方法与数据的关系 | A | 方法论文配套数据集,许可各异 |
| Q2 | 标注者与协议 | A | 官方未公开协议,口径可反推 |
| Q3 | 名字由来 | A | "主张化"流水线之名 |
| Q4 | 与幻觉检测的关系 | A | 是其前置筛选环节,非检测本身 |
| Q5 | 规模定位 | A | 句数中小、密度与口径稀缺 |
| Q6 | 数据年代 | A | 2023-2024 口径,任务定义不过时 |
| Q7 | 下载方式 | B | HF 直链/镜像/ModelScope 三通道 |
| Q8 | 下载后第一件事 | B | 行数/字节/标签三连校验 |
| Q9 | 数据划分 | B | 无官方划分,按 answer_id 分组自切 |
| Q10 | Markdown 残迹 | B | 保留(训练推理分布一致) |
| Q11 | 被封锁环境 | B | hf-mirror.com + HF_ENDPOINT |
| Q12 | ModelScope 差异 | B | 同名同步,以 HF 为主源(存照) |
| Q13 | 59.1% vs 59% | C | 实算 vs README 整数口径,都对 |
| Q14 | 59% 的成因 | C | 真实测量结果,非设计目标 |
| Q15 | 396 与 393 | C | 非一问一答,差额未解释 |
| Q16 | 句子切分 | C | 上游口径继承,重切即需重标 |
| Q17 | 三指标与数据集 | C | 指标属流水线,本集只评 Selection |
| Q18 | 对比方法分数 | C | 见论文表格,本条目只存名单 |
| Q19 | 是否医学数据集 | D | 不是,医学句 8.5% |
| Q20 | 医学句抽取 | D | 20 词关键词表(附录 F) |
| Q21 | 医学主题画像 | D | 心血管史问答线密度最高 |
| Q22 | 医学幻觉检测 | D | 只能训第一环,真伪需另建 |
| Q23 | 复刻标注成本 | D | 句级二分类约千句/人日 |
| Q24 | pandas 类型 | E | bool/int64/object,实测无空值 |
| Q25 | 基线数字 | E | 官方未发布,你的成绩即首个 |
| Q26 | 句序特征 | E | sentence_id 有信息,段落无 |
| Q27 | 上游对齐 | E | 上游未发布,answer_id 是预留键 |
| Q28 | 引用格式 | E | 数据/方法/上游三处分引 |
| Q29 | 引用对象混淆 | F | 三份文档各管一段(附录 J) |
| Q30 | 商用边界 | F | 数据可商用、代码不行、上游无门 |
| Q31 | 指标引用规范 | F | 自报口径必须带限定(§5.5) |
| Q32 | 数据集 vs 论文引用 | F | 引数据不引论文=出处不全 |
| Q33 | 医学宣称边界 | F | "医学切片"可说,"医学数据集"不可 |
| Q34 | 快照纪律 | F | 动态带时点、静态可直引(附录 Q) |
| Q35 | 标签一致性争议 | G | 本集未公开;上游曲线可参照 |
| Q36 | 标签错误怎么办 | G | 拼上下文复核(坑 4),纠错留痕回连 |
| Q37 | 与 MedNLI 怎么选 | G | 筛选用本集、裁决用 MedNLI,接力非互斥 |
| Q38 | 数据更新预期 | G | 冻结形态,按附录 Q 自建快照纪律 |
附录 X:术语首现索引
正文关键术语的首次出现位置与速查指针(按行文顺序):
| 术语 | 英文 | 首现 | 速查 |
|---|---|---|---|
| 主张抽取 | claim extraction | 导语 | §0、术语表 |
| 四阶段流水线 | four-stage pipeline | 导语 | §3 全节 |
| Selection / Disambiguation / Decomposition | 同名 | §0 | §3.3-§3.5 |
| 可验证事实主张 | verifiable factual claim | INFOBOX | §4.1 |
| 句子级标注 | sentence-level annotation | §2.3 | §8.1 |
| answer_id / sentence_id | 同名 | §2.2 | §2.4、附录 E |
| 混合句 | mixed sentence | §2.3 | §4.1、附录 V |
| 上游语料 | upstream corpus | §1 Q3 | §2.6、附录 O |
| 数字指纹 | numeric fingerprint | §2.4 | §4.4 |
| BingCheck / Self-Checker | 同名 | §1 Q3 | §4.3、附录 O |
| Krippendorff’s alpha | 同名 | §4.3 | 附录 O |
| entailment / coverage / precision | 同名 | §1 Q7 | §5.1 |
| GraphRAG | 同名 | §5.3 | §7.1 |
| Groundedness Detection | 有据性检测 | §5.4 | §7.1 |
| CDLA-Permissive-2.0 | 同名 | §1 Q8 | §6.3、附录 G |
| hf-mirror.com | 同名 | §1 Q9(获取行) | §6.2、附录 S |
| usedStorage | 同名 | §2.1 | 附录 S |
| DAIMS | 同名 | §1 Q10 | 附录 B |
| AI-Ready | 同名 | §1 Q10 | §6.4、附录 B/N |
| 关键词命中法 | keyword matching | §1 Q5 | §7.3、附录 F |
| 判例库 | precedent bank | §4.2 | 附录 M R3 |
| 回连键 | join key | 附录 Q | §8.2、附录 O |
附录 Y:标注裁决判例速查卡(R2 表扩充版)
附录 M R2 表的判例扩充——16 种句型一页速查(本库建议稿,判例按官方口径反推):
| # | 句型 | 裁决 | 判例句(示意) | 要点 |
|---|---|---|---|---|
| 1 | 带锚点事实断言 | True | “The surgery lasted nine hours.” | 时间锚点在 |
| 2 | 无锚点评价 | False | “This is a great question.” | 无可核查断言 |
| 3 | 数字模糊 | False | “Costs dropped significantly.” | significantly 非锚点 |
| 4 | 数字精确 | True | “Costs dropped by 30%.” | 30% 是锚点 |
| 5 | 信念归属 | True | “Experts believe X.” | 核"是否如此认为" |
| 6 | 未实现假设 | False | “If passed, the bill would…” | 无既有答案 |
| 7 | 混合句(事实+评价) | True | “1796 年 Jenner 发明疫苗,这改变了医学” | 存在量词 |
| 8 | 指代裸句 | True* | “It was the first of its kind.” | *需上下文;坑 4 |
| 9 | 重言/定义循环 | False | “Guidelines are guidelines.” | 无外部证据可言 |
| 10 | 未来预测 | False | “X will be approved next year.” | 未实现事件 |
| 11 | 历史预测 | True | “The 2019 report predicted a shortage.” | 预测行为本身可核查 |
| 12 | 祈使/流程 | False | “Consult a professional.” | 建议非断言 |
| 13 | 比较断言 | True | “A is more common than B.” | 比较命题可核查 |
| 14 | 最高级断言 | True | “X was the first artificial heart.” | 需排序证据;本集典型句型(附录 L 例句) |
| 15 | 引语存在性 | True | “The report states Y.” | 核"是否如此陈述" |
| 16 | 感叹/寒暄 | False | “What a breakthrough!” | 情绪无断言 |
使用方式:标注培训时先让学生对 16 判例盲标,分歧点回看 R1/R2 规则——判例表是规则的测试集,规则是判例的生成器,两者随判例库一起版本化(附录 M R3 第 4 条)。
附录 Z:本条目写作过程质量存证
按写手纪律包要求的过程存证(汇报口径的正文化存档):
| 存证项 | 结果 |
|---|---|
| 开工三查 | 锁文件 .lock(agent-b-claimify);/tmp part 唯一化前缀 claimify_agent-b-claimify_part*;ps 留痕 4 |
| 存在性核验 | 三轮三源(HF/论文与 ACL Anthology/官方博客),裁决"可写"(方法之外存在独立可下载数据集) |
| slug 查重 | DB 只读:url_name ILIKE ‘%claim%’ 0 rows;writing/ 目录仅本代理自建 claimify/ |
| 一手数据通道 | hf-mirror.com 镜像(HF 主站环境封锁);data.csv 实抓 2,258,269 bytes |
| 硬数字复算 | 附录 T 整合脚本口径,全部 PASS 后才写入正文 |
| 口径存照 | 九节 FACTS.md §9 + 正文坑 1-8 + 附录 J/P 三层存证 |
| 自检 | check_md.py PASS(0 error / 0 warn)+ preflight_check.py PASS(0 ERROR / 0 WARN),双零 |
| 考据边界 | 396=上游复用为"高置信考据"非官方声明(坑 6 口径),全文按此行文 |
本附录的作用是让后来者(审校、互链、更新者)知道这份条目"哪些数字怎么来的、哪些结论是推断"——数据条目的可信度不仅来自内容,也来自过程的可审计。
附录 AA:下游任务数据适配配方(三例)
data.csv 的三种典型"再加工"配方——从原始五列到可直接训练/评测的目标格式(本库建议稿):
配方一:句子级二分类器(最直接)
| 项 | 内容 |
|---|---|
| 输入构造 | (question, sentence) 拼接进 prompt/编码器;可拼 sentence_id 邻句窗口(§3.2 上下文思想,但窗口只能来自 data.csv 内部) |
| 标签 | contains_factual_claim 原样 |
| 切分 | GroupShuffleSplit 按 answer_id(附录 E);医学专项报分时另按附录 F 切片 |
| 指标 | accuracy / F1 / 按句长分桶 F1(长句桶必报,坑 7) |
| 陷阱 | question 泄漏(test 的 question 在 train 出现——question 级隔离口径需在文档写明,附录 E 代码注释) |
配方二:对比/排序对构造(进阶)
| 项 | 内容 |
|---|---|
| 输入构造 | 同一 answer_id 内 True 句与 False 句组成难易对;跨 answer_id 不配对(主题混杂) |
| 标签 | 对标签(谁更"可核查")——由二值标签直接推导 |
| 用途 | 训练排序型 Selection(输出连续分而非二值),适配附录 E p_claim 接口 |
| 陷阱 | 长度偏差:True 句平均更长(信息密度高),对构造需按句长分桶配平,否则模型学到"长=True"捷径(§2.5 与附录 V 的偏差方向) |
配方三:评测集模式(零训练)
| 项 | 内容 |
|---|---|
| 输入构造 | 全集或分层子集(按句长 × 医学关键词双层分层);不改动任何句子 |
| 协议 | 被评系统输出二值判定,与官方标签对齐算 agreement/kappa;判例分歧句(附录 Y 8/10/11 号句型)单独报告 |
| 指标 | overall agreement + Cohen’s kappa + 医学子集 agreement(三线报告) |
| 陷阱 | 别把 agreement 说成 accuracy(对的是"与标注一致",不是"与真理一致"——官方标签本身无一致性背书,Q35);引用写"与 claimify-dataset 标注的一致率" |
三个配方共同的后处理纪律:产物保留 answer_id/sentence_id 原键 + 记录快照指纹(附录 Q)——再加工一次、键留一层,未来上游发布或官方换版时可逐层对账。
(条目完)
附录 AB:库内互链条目速查表(rid 已逐一验证)
供主会话互链与发布环节直接使用的最终互链清单(rid 均经 DB 只读查询验证,2026-09-28):
| 优先级 | 条目(rid) | 互链方向 | 锚文本建议 |
|---|---|---|---|
| 1 | MedNLI(rid 648) | 双向 | 管线下游裁决模块(§9.1/§9.2/FAQ Q37) |
| 2 | HealthSearchQA(rid 492) | 双向 | 同为真实用户健康问题场景(§9.1) |
| 3 | EMR-QA(rid 139) | 单向(对方→本) | QA 生成与 QA 核查的两面(§9.1) |
| 4 | EHRSQL(rid 713) | 单向(对方→本) | 同上 |
| 5 | BLURB(rid 471) | 单向(对方→本) | 生物医学 NLP 基准族参照(§9.1) |
| 6 | S2ORC(rid 370) | 单向(对方→本) | 人类文献 vs 机器输出体裁对照(§9.1) |
| 7 | GENIA(rid 532) | 单向(对方→本) | 标注粒度哲学对照(§9.2 路径 2) |
| 8 | CRAFT(rid 529) | 单向(对方→本) | 同上 |
| 9 | MedQuAD(rid 160) | 单向(对方→本) | 问答评测族(§9.2 路径 3) |
| 10 | MedMCQA(rid 111)/ HeadQA(rid 120) | 单向(对方→本) | 医学考试基准族(§9.2 路径 3) |
| 11 | MedDialog(rid 210) | 单向(对方→本) | 医疗文本处理谱系(§9.1) |
| 12 | MedMentions(rid 390) | 单向(对方→本) | 同上 |
| 13 | MedCalc-Bench(rid 708) | 单向(对方→本) | 数值断言核查的下游延伸(§9.1) |
| 14 | TopBrain2026(rid 632)/ REG2026(rid 639)/ PANDA(rid 560) | 光谱对照 | 可获取性光谱邻居(附录 N) |
DB 查重最终口径:url_name ILIKE ‘%claim%’ 命中 0 rows(status=1)——本条目为无撞库新增;发布时 url_name 建议 claimify,与目录名一致。
(附录 AB 为最终节;条目由 agent-b-claimify 于 2026-09-28 定稿,自检双零。)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- healthsearchqa — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- pubmedqa — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- medqa — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- medmcqa — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- medicationqa — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- cmb-cmexam — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- medcalc-bench — 共享标签:医疗NLP / 医学问答与基准 / 评测基准 / 医学问答
- i2b2-n2c2-nlp — 共享标签:医疗NLP / 医学问答与基准 / 评测基准
- bioasq — 共享标签:医疗NLP / 医学问答与基准 / 医学问答
- medquad — 共享标签:医疗NLP / 医学问答与基准 / 医学问答
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

