信息速览
INFOBOX — BIOSSES 一屏速览
维度 内容 本质 生物医学句子相似度(STS)人工标注基准(数据集)+ 同批发布的方法论文,非挑战赛、非新采集 团队 Boğaziçi University(伊斯坦布尔海峡大学)计算机工程系 TABILAB;一作 Gizem Soğancıoğlu,通讯 Arzucan Özgür 论文 Bioinformatics 2017;33(14):i49-i58(doi:10.1093/bioinformatics/btx238;PMID 28881973 / PMC5870675) 规模 100 句对,单 train split;5 位专家,0–4 分级取均值为金标准 来源 TAC 2014 Biomedical Summarization Track 训练集的引用句(20 篇 reference × 12–20 篇 citing) 任务 句子级语义相似度回归(Pearson 相关评估),Evans 1996 相关强度准则 方法 字符串(Qgram/Block/Jaccard/Overlap/Levenshtein)+ 本体(WordNet/UMLS)+ 段落向量 + 监督回归 结果 域外 SOTA ADW 0.586 / SEMILAR 0.419;监督回归 0.836(提升最高 42.6%);人类上界 0.902 获取 官网 DataSet.html 原始页 + GitHub 代码 + HuggingFace tabilab/biosses(parquet,456 downloads)许可 数据集 GPL-3.0|论文 CC BY-NC 4.0(两件资产两套许可) 库内互链 BLUE 基准(rid 478)、MedNLI(rid 648)、i2b2/n2c2(rid 14)、BC2GM(rid 434)、BC5CDR(rid 415)
BIOSSES 是生物医学自然语言处理史上一件"小而关键"的工艺品:它只有 100 个句对,整个数据文件压缩后不足 23 KB,却填补了一个当时无人填补的空缺——在它之前,语义文本相似度(STS)评测的公认真值集几乎全是通用英语(SemEval STS 系列),生物医学领域的句级相似度既没有手工标注的基准,也没有系统的领域适配研究。BIOSSES 用 5 位人类专家对 100 对生物医学句子逐一打 0–4 分,把"两句话有多像"这个模糊问题固化成一个可复现的 Pearson 相关系数,并顺手一批提出了四类方法——其中监督回归模型拿到 0.836 的相关性,逼近当时标注者之间 0.902 的一致性上界。
它的历史地位不在于规模,而在于范式:BIOSSES 让"在生物医学文本上做句子嵌入/相似度"第一次有了可以横向比较的标尺。此后十余年,从 BioBERT、SciBERT、PubMedBERT 到各类 sentence-transformer 与 LLM 嵌入模型,BIOSSES 几乎成了领域内"必跑的小基准"之一——尽管它的 100 条样本意味着任何两个模型之间零点几个百分点的差异都不该被过度解读。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——原始页在官网 DataSet.html,最省事的入口是 HuggingFace
tabilab/biosses一行load_dataset;许可记住是 GPL-3.0(不是论文的 CC BY-NC)。 - 关心方法史:直奔 §5 与 §4 的实验结果表——字符串/本体/向量/监督四类方法的相关系数一表看全,还有"通用域系统在生物医学文本上失效"这件事的原始测量。
- 要评估自己的模型:直奔 §7 与附录的评测检查清单——注意 100 条样本的统计强度边界,以及"单 split 无固定 test"带来的口径不一。
§0 导读:这个数据集解决什么问题
在 BIOSSES 出现之前(2017 年之前),"计算两个句子有多相似"这件事已经有了相当成熟的通用英语解法:字符串编辑距离、WordNet 本体相似度、LSA/段落向量,以及 SemEval STS 系列每年发布的标准化评测集。问题在于,这些方法搬到生物医学文本上会显著退化。论文用一对句子把这个退化讲得很清楚:S1 说"receptor-interacting protein kinase 1 and its related kinase 3"驱动 necroptosis,S2 说"RIP1 和 RIP3"介导 necroptosis——人类一眼看出指的是同一对蛋白,但通用域方法既无法识别蛋白质的缩写别名,也不会给这些术语加权。
更深一层的问题在评测上。一个领域没有基准数据集,就没有公共的真值,所有方法的优劣只能各说各话。生物医学领域当时有词级/概念级相似度的评测(基于 MeSH、SNOMED-CT、Gene Ontology 的概念相似度研究颇多),但句子级的手工标注基准是空白。论文在引言里明确断言:“there is neither a manually annotated benchmark data set, nor a comprehensive study on sentence-level semantic similarity computation in the biomedical domain.”
BIOSSES 的回答是一套"数据集 + 方法"的双产出:
- 数据层:从 TAC 2014 Biomedical Summarization Track 的引用句里挑出 100 个句对,请 5 位人类专家各自按 0–4 打分,取均值为金标准。选引用句而非随机句对是个关键设计——引用同一篇文献、且理由相似的句子天然具有语义相似度,引用不同主题文献的句子天然不相似,这样一来,从同一个语料里就能自然得到覆盖 0 到 4 各个等级、且两端样本均衡的句对。
- 方法层:在同一个数据上系统比较四类方法——字符串相似度、本体法(WordNet 通用域 + UMLS 生物医学域)、段落向量(在 4 GB PubMed Central 语料上训练)、以及把前几类分数作为特征输入的监督回归。监督模型把 0.836 的相关系数立成了当时的领域标杆。
对今天的使用者,BIOSSES 的价值有两个维度。其一是即插即用的评测尺:100 条英语生物医学句对,任务干净、许可明确、一行代码可加载,适合快速验证一个句嵌入模型是否"懂得"生物医学语义。其二是一节方法论公开课:它示范了"如何用极小的标注预算建立领域基准",也用自己的局限(规模、单 split、单来源)提醒后人——小基准可以开路,但不能替代统计严谨性。
§0 读法三则:
- 本条目是"数据集(100 句对)+ 方法论文"二合一;数据本体和被提出的方法虽同源,但可用性不同——数据可自由下载(GPL-3.0),方法代码在 GitHub(Java 实现,依赖旧版库)。
- 全文所有相关系数均出自论文 Table 3;人类上界 0.902 出自 Table 2。两者的关系(系统 0.836 < 人类 0.902)是理解这个基准"天花板"的关键。
- 检索时注意 BIOSSES 与 STSR(库内 stsr,rid 677)是两回事——后者是 2025 年牙齿分割挑战赛,仅是字母临时同形(坑 4)。
§1 数据集速览:十五问十五答
Q1:BIOSSES 的"100 句对"是什么?
是 100 条记录,每条含两个生物医学英文句子(sentence1、sentence2)和一个 0–4 的相似度金标准分(score)。这个分数是 5 位人类专家各自打分的均值,0 表示两句话无关,4 表示完全等价。
Q2:句子是从哪来的?
全部选自 TAC(Text Analysis Conference)2014 Biomedical Summarization Track 的训练集。该语料含 20 篇 reference articles,每篇配 12–20 篇引用它的 citing articles;BIOSSES 的句子取自这些 citing articles 里的引用句,即含有一条文献引用的句子。
Q3:为什么专挑引用句,不随机选?
因为随机选句对绝大多数会毫不相关,无法覆盖中间相似度等级。引用句里既有"引用同一文献且理由相似"(→ 高相似)的情况,也有"引用同一文献但主题不同"(→ 低相似)的情况,能自然得到从 0 到 4 的均衡分布。
Q4:谁来标注的,怎么保证质量?
5 位不同的人类专家独立评分。评分标准参照 SemEval 2012 Task 6 的 STS 指南,并为每个等级(0–4)提供了生物医学文献的示例句对。论文 Table 2 报告了标注者间相关性:各标注者与其余四人均值的相关在 0.902 到 0.958 之间,最低的 0.902 被视为算法能达到的性能上界(因为算法不可能比人类之间更一致)。
Q5:评分的五个等级分别什么意思?
0 = 两句话主题不同;1 = 主题相同但不等价;2 = 共享部分细节但不等价;3 = 大致等价但缺失/存在重要信息差异;4 = 完全或基本等价。这五级整数评分取均值后金标准可以是小数(如 2.2)。
Q6:用哪个指标衡量算法表现?
Pearson 相关系数——算法预测分与金标准分之间的线性相关。论文引 Evans(1996)的强度准则:0.80–1.00 非常强、0.60–0.79 强、0.40–0.59 中等、0.20–0.39 弱、0.00–0.19 极弱。
Q7:论文提出的方法里哪个最好?
监督回归(Linear Regression)最好,Pearson 相关 0.836。它把三个无监督方法(Qgram 字符串相似度、Paragraph Vector、COM 组合本体)的分数作为特征输入。单项方法里最强的是 Paragraph Vector(0.787)和 Qgram(0.754)。
Q8:通用域方法在生物医学文本上真的不行吗?
论文实测:域外最强系统 ADW 只拿到 0.586,SEMILAR 只有 0.419——按 Evans 准则都只是"中等"。这证明了领域适配的必要性,也解释了为什么需要专门为生物医学文本建基准。
Q9:我现在怎么拿到数据?
三个入口:①官网 tabilab.cmpe.boun.edu.tr/BIOSSES/DataSet.html(原始发布页);②GitHub gizemsogancioglu/biosses(代码+样例);③HuggingFace tabilab/biosses(parquet,最省事的 load_dataset 入口,抓取时 456 downloads)。
Q10:为什么一个只有 100 条的小数据集值得立一条目?
因为它填补了库内的任务类型空白——库内已有 NER(BC2GM)、关系抽取(BC5CDR/ChemProt)、推理(MedNLI)、问答(MedQA/PubMedQA)等基准,唯独缺"句子级语义相似度回归"这一类;同时它在领域内的引用历史与"首个人工标注生物医学 STS 基准"的地位,使其成为生物医学 NLP 评测谱系上不可绕过的一环。规模局限已在 §6、§7 与附录充分披露。
Q11:它和通用英语的 STS 基准(如 STS Benchmark)是什么关系?
领域变体关系:通用英语 STS 基准提供"通用语义相似度"标尺,BIOSSES 提供"生物医学语义相似度"标尺。两者任务形式相同(句对+分数+相关评估),但词汇、概念与难点不同——BIOSSES 的难点在专业术语与缩写别名。
Q12:数据里有临床文本吗?
没有。全部来自生物医学文献(TAC 语料的引用句),不含病历、临床笔记、处方等临床文本。若做临床场景,需另找资源。
Q13:论文标题里的"system"指什么?
指论文同批发布的整套相似度计算系统(含字符串/本体/向量/监督四类方法),BIOSSES 既是这套系统的名字,也是它配套数据集的名字——论文与数据集同名。
Q14:为什么用"均值"而不是"多数投票"?
相似度是连续量而非类别,均值能保留"程度"信息;多数投票只适用于离散类别。取均值也使金标准可为小数(更细粒度)。
Q15:拿到数据集后第一件事该做什么?
统计 score 的分布(确认 0–4 全谱覆盖)、检查有无重复句对、确定评估协议(建议分层 10 折 CV),然后再跑模型——跳过这三步容易得到不可比、不可复现的分数。
§2 数据构成与规格
2.1 规模、来源与字段结构
BIOSSES 数据本体是一张 100 行的表,字段极简:
| 字段 | 类型 | 取值域 | 语义 |
|---|---|---|---|
| sentence1 | string | 生物医学英文句子 | 句对中的第一句 |
| sentence2 | string | 生物医学英文句子 | 句对中的第二句 |
| score | float32 | 0–4(可为小数) | 5 位标注者 0–4 整数评分的均值(金标准) |
HuggingFace dataset card 的实测元数据(hf-mirror API,2026-09-30 抓取):num_examples=100、num_bytes=32775、download_size=23090、dataset_size=32775;features 即上述三字段;splits 只有一个 train(无 val/test 划分)。数据文件为单个 parquet:data/train-00000-of-00001.parquet,实测大小 23,090 字节——一个 23 KB 的文件装载整个基准,这个数字本身就是理解 BIOSSES 性质的最好注脚。
来源语料 TAC 的规格:TAC 2014 Biomedical Summarization Track 训练集含 20 篇 reference articles(被引的"参考"文章),每篇配 12 至 20 篇 citing articles(引用它的文章)。BIOSSES 的句子从 citing articles 的引用句中产生。论文没有声明随机抽样,而是"从引用句中选取以保证相似度分布覆盖"的定向选取策略(见 §3.1)。
2.2 为什么用"引用句"构造句对
这是 BIOSSES 最巧妙的设计,值得单列。若随机从两篇文章各取一句,绝大多数组合会毫不相关,句对的引入内容会极度偏向低相似度端,中间档(1–3)样本稀少,无法评估算法在"部分相似"区间的判别能力。引用句策略则把"相似度"这一维度和"引用行为"绑在一起:
- 两句话引用同一篇 reference article,且理由相似(如都指向某蛋白质相互作用研究的结论)→ 天然高度相似;
- 两句话引用同一篇 reference article,但讨论的是该文献的不同侧面,或引用的文献主题本就不同(一个讲微生物学、一个讲胚胎学)→ 天然低相似或无相似。
这样一来,从同一批引用句里就能抽取出覆盖 0 到 4 全部等级的句对。论文还专门强调,TAC 语料的标注文件里"语义相关与语义无关的句对同时出现",正是这一性质使其成为理想来源。
2.3 分数的分布与标注者一致性
论文 Fig. 1 展示五级评分的分布,结论是"每个相似度等级都有足够的实例"——即 100 条样本在五个等级上并非全部挤在某一端。金标准采用均值,因此 score 字段可含小数(如 HF card 给出的实例为 2.2 分)。
标注者间相关性(Table 2:各标注者 vs 其余四人均值):
| 标注者 | Pearson r |
|---|---|
| A | 0.952 |
| B | 0.958 |
| C | 0.917 |
| D | 0.902 |
| E | 0.941 |
最低值 0.902 是这张表的重点台词:论文明确把它当作"算法度量的上界"(an upper bound for an algorithmic measure evaluated on this dataset)。逻辑是——如果两位人类专家对同一句对的一致性都只有 0.902,那么任何算法与"金标准"的相关性若超过 0.902,反而说明金标准本身可能有噪声或过拟合,而非算法真的超过了人类。这个上界此后成为讨论 BIOSSES 分数"天花板"的固定参照。
2.4 数据版本与分发形态
同一份 100 句对数据以三种形态存在,内容一致、载体不同:
| 形态 | 位置 | 特点 |
|---|---|---|
| 原始发布页 | 官网 tabilab.cmpe.boun.edu.tr/BIOSSES/DataSet.html |
论文指定的官方数据入口(Availability 段点名) |
| 代码仓库 | GitHub gizemsogancioglu/biosses |
含 Java 实现与 input.txt 样例(非完整数据),资源经 get_resources.sh 下载 resources.zip |
| 结构化转存 | HuggingFace tabilab/biosses |
单 parquet,load_dataset 一行加载;抓取时 downloads=456、likes=7、lastModified=2024-01-10 |
TFDS(TensorFlow Datasets)以 community catalog 形式收录了该 HF 版本。三形态中,HF 版本对现代管线最友好,但抓取时点(2026-09-30)官网在沙箱内 HTTP 返回 000 不可达,实际数据一致性以 HF parquet 元数据(23,090 B)为准。
2.5 字段级使用说明
虽然只有三列,但每列在使用时都有易忽略的细节:
- sentence1 / sentence2:均为英文,未经分词/归一化处理,保留了原始标点与大小写;论文的预处理(去标点、去停用词)是方法侧步骤,不是数据侧步骤。因此若你的模型需要小写化或标点归一,应自行处理,以便与论文口径对比。
- score:float32,取值 0–4,可为小数。它不是 5 个整数评分的原始集合,而是均值;因此数据里看不到标注者间的分歧信息。若研究关注标注不确定性,需回论文/官网索取原始逐人评分(本条目未能确认逐人评分是否随数据公开)。
- 无 ID 列:parquet 无显式记录 ID,行序即标识。跨版本比较时不要假设行序稳定。
- 无划分列:没有 split 字段,全部 100 行同属 train。评估时必须自行划分(建议对齐论文的 10 折 CV)。
这些细节合起来意味着一件事:BIOSSES 是"极简记录 + 极简字段"的基准,它的可用性来自简单,它的局限也来自简单。
2.6 数据量级的直观换算
- 100 句对 = 200 个句子,约 4,000–6,000 个英文词(按生物医学句子平均长度粗估);
- 单 parquet 23,090 字节 ≈ 22.5 KB,可整文件装进一行 base64 消息、一封邮件、一个 Gist;
- 相比 SemEval STS 系列(每年数千句对)小两个数量级,相比库内 bc2gm(约 2 万句)小两个数量级以上。
这一量级决定了它只适合"探针"用途,不适合"训练"或"排行榜"用途。
2.7 数据溯源链
一条 BIOSSES 记录从原始文献到 HF parquet,经过四层转换,使用者应清楚自己在哪一层工作:
第 0 层:原始生物医学文献(PMC 等)
↓ 被引
第 1 层:TAC 2014 BiomedSumm 训练集
(20 篇 reference × 12–20 篇 citing;含引用句与引文标注)
↓ 抽取引用句对 + 5 位专家 0–4 标注取均值
第 2 层:BIOSSES 数据集本体(100 句对 + 金标准分)
↓ 三种发布形态
第 3 层:官网 DataSet.html | GitHub 代码库 | HF parquet 转存
溯源要点三条:
- 第 0→1 层不可逆:TAC 语料的具体文献归属(哪句来自哪篇)在 BIOSSES 中未逐条标注;若需回到原始文献,需经 TAC 语料的映射。
- 第 1→2 层的选择偏差:100 句对是"定向选取 + 引用句策略"的产物,不是 TAC 的随机样本,因此它代表"生物医学引用句的相似度空间",不代表"生物医学文本的相似度空间"。
- 第 2→3 层内容一致:三形态应包含同样的 100 条,但官网版本的状态在抓取时点不可验证(FACTS §9 待核);实践以 HF 为准。
§3 标注流程与数据构造方法
3.1 句对选取规程
构造流程可还原为四步:
- 语料筛选:锁定 TAC 2014 BiomedSumm track 训练集,其中约 20 篇 reference 及其 12–20 篇 citing articles 构成句源池。
- 引用句提取:只保留含文献引用的句子,排除无引用的普通叙述句。
- 相似度覆盖抽样:在引用句中,挑选出"引用同一文献且理由相近"与"引用同一文献但主题迥异"两类,保证相似度谱系的两端与中间档都有样本。
- 去冗余:论文未详述句对去重的精确规则,但强调选样目标是"获得不同相似度等级的句对",而非追求句面差异最大化。
3.2 五级评分量表
评分量表的构成本身是对 SemEval 2012 Task 6 STS 指南的生物医学移植,论文 Table 1 给出每一级的示例句对(其中 score 3 一例的第二句在 PMC XML 与 HF README 转述间措辞略有出入,语义一致):
| 等级 | 判定语(论文原文意译) | 论文示例(句1 vs 句2) |
|---|---|---|
| 0 | 两句话主题不同 | C/EBPα 与 NFI-A 结合 miR-223 上调区 vs 异亮氨酸不能与含氨基的配体片段 44 相互作用 |
| 1 | 主题相同但不等价 | 膜蛋白的定义 vs 膜蛋白因位于信号通路顶端而与多种疾病相关 |
| 2 | 共享部分细节但不等价 | anti-HER2 疗法治疗 CNS 转移的现状 vs HER2 扩增乳腺癌 CNS 转移风险更高 |
| 3 | 大致等价但有重要信息差异/缺失 | 癌组织 miR-126/424 表达降低且多个 miRNA 升高 vs 某研究显示 miR-126/424 表达降低 |
| 4 | 完全或基本等价 | β-内酰胺酶水解抗生素是革兰阴性菌耐药主因 vs 革兰阴性菌耐药主机制是 β-内酰胺酶水解 |
3.3 一致性与质量控制
- 5 位标注者独立打分,未采用先协商后评分的委员会模式;
- 提供评分指南 + 每级生物医学示例句对作为锚点(anchoring);
- 不报告标注者的专业背景细节,但从致谢可见标注者包括 Ecem Soğancıoğlu、Jesus Lago Garcia、Kübra Eren、Onur Yanar,且论文感谢 Bridget T. McInnes 在 UMLS 接口上的协助,提示标注与本体方法的使用有生物医学 NLP 专家把关;
- 一致性以"各人 vs 其余四人均值"的 Pearson r 量化,最低 0.902,作为算法上界公开。
标注者构成与潜在偏差:论文未逐一披露 5 位标注者的资历,但致谢显示标注者包含一作亲属(Ecem Soğancıoğlu)与同组研究人员,且感谢生物医学 NLP 学者 Bridget T. McInnes 的协助。据此可推断两点:一、标注者以该研究团队成员及关联人员为主,非同机构随机召集的独立专家池;二、标注质量依赖团队对任务的理解而非大规模众包。这种"小团队精标"模式与库内 i2b2/n2c2 系列的"临床专家大规模标注"形成对照——前者胜在一致性(0.902 上界不低),后者胜在规模与代表性。使用时应意识到:0.902 的一致性反映的是"同一小团队内部的共识",不完全等同于"全体领域专家的共识"。
为什么没有报 Fleiss κ / Krippendorff α? 相似度是连续量,标准做法是用**相关系数(Pearson/Spearman)**而非类别一致性系数(κ/α 面向离散类别)。BIOSSES 选择 Pearson 与它的评估指标(也是 Pearson)保持一致的哲学——标注一致性与算法评估用同一把尺子。
3.3.1 标注流程的可质疑点(尽调清单)
作为尽职调查,以下问题在论文中未完全澄清,使用者应心中有数:
- 标注指南的完整文本未附——只知道依据 SemEval 2012 Task 6,具体到生物医学场景的边界案例如何处理(如"部分重叠但主结论相反"该给几分)未公开细则;
- 标注者是否被告知句对的来源文献——若知道,可能引入"文献主题一致则给高分"的系统性倾向;论文未明确说明盲设计程度;
- 5 位标注者的评分是同时进行还是先后——先后评分可能产生锚定效应,论文未说明;
- 是否存在被剔除的句对(如分歧过大者)——论文未报告最终入选率,无法排除"只保留高一致样本"的选择偏差;
- 金标准用均值而非中位数——均值对极端评分敏感,若某位标注者系统性偏高/偏低,均值会被拉动。
以上五点不构成对 BIOSSES 的否定(它在当时的条件下已是严谨之作),但提醒使用者:它是一个"团队内部共识"型真值集,不是"领域全体共识"型真值集。
3.4 论文提出的相似度计算方法(数据集的方法学配套)
BIOSSES 论文不只是一个数据集声明,它同时以该数据为试验台,系统比较了四类句子相似度计算方法。理解这些方法是读懂 §4 结果表的前提。
(1)字符串相似度(string similarity)
在去标点、去停用词后,用 SimMetrics 库计算:
- Qgram:滑动长度 q 的窗口生成 q-gram 集合,按匹配比例计分(仅字符级、无语义);
- Block distance(曼哈顿距离):按词频向量各维差之和计距,转相似度;
- Jaccard:两句子唯一词集合的交并比;
- Overlap coefficient:交并比的分母改为较小集合大小;
- Levenshtein:编辑距离(插入/删除/替换/复制的最小操作数),1 减距离得相似度。
(2)本体法(ontology-based)
先用词级相似度算词与词的相似,再聚合成句子级。词级算法有六种:Path(分类树最短路径)、Resnik(信息量 IC)、Lin(IC 的比值形式)、WP(Wu-Palmer,路径深度加权)、JCN(Jiang-Conrath)、LCH(Leacock-Chodorow)。
句子级聚合算法(论文自创的"语义向量法"):对两个句子取所有唯一词的并集作为字典 D 的维度,为每句构建同维语义向量——每个维度取"该句的每个词与字典该维词的最高相似度",最后取两向量的余弦相似度。论文用走查例(S1 “Necroptosis requires the activity of RIP1 and RIP3” vs S2 “Necroptosis could be induced via modulating RIP1 and RIP3”)演示了这一过程。
两个本体变体:
- WBSM(WordNet-Based Similarity Method):以 WordNet 为知识源,用 WS4J 库,基于 Is-A 关系;
- UBSM(UMLS-Based Similarity Method):先用 MetaMap 把文本映射为 UMLS 概念(能识别多词概念,比按单词处理更可靠),再用
Umls::Similarity网页接口计算概念相似度——该接口限定在 OMIM 与 MeSH 两个子本体,关系参数用 PAR/CHD(父子); - COM(Combined Ontology Method):把 WBSM 与 UBSM 的句子级分数按权重 λ 线性组合:
combined = Score_WordNet·λ + Score_UMLS·(1−λ)。λ=0.5 时两本体等权。若某词不在任一本体中,其对应相似度记 0。
(3)分布式向量(Paragraph Vector)
在约 4 GB 文本、约 37K 篇文章的 PMC(PubMed Central)开放获取子集上训练段落向量模型(word2vec 家族,Le & Mikolov 式文档/句向量),输出向量维度 100,采用 Skip-Gram。两句话的向量相似度即其语义相似度。这是当年把"无监督大规模语料预训练"引入生物医学句相似度的较早尝试。
(4)监督回归组合(supervised)
把三个表现最好的无监督方法的输出——Qgram、Paragraph Vector、COM——作为输入特征,用 Weka 的 Linear Regression 训练一个回归模型预测相似度分数。这是论文性能最高的方案,也是"用监督学习把多路无监督信号融合"这一思路的早期范例。
3.5 构造成本与"小样本高价值"的经济学
BIOSSES 的构造逻辑里有一条隐含的成本-价值判断值得点破:在领域基准从无到有的阶段,100 条高信噪比的标注远比 10,000 条低质量标注更能推动研究。理由有三:
- 真值可靠性优先:领域基准一旦发布,其分数会被大量论文引用。100 条经 5 位专家一致标注的句对,其真值可信度远高于上万条众包/弱标注数据;后者引入的噪声会污染整个领域的评测基线。
- 迭代速度优先:早期研究需要的是快速试错,而非精细排名。100 条让任何新方法的评测在几分钟内完成,降低了试错成本,加快了方法迭代。
- 分布覆盖优先:通过引用句策略保证 0–4 全谱覆盖,使这 100 条在"相似度维度"上的信息密度高于同等数量的随机样本。
这三点共同解释了为什么一个 23 KB 的数据集能在领域内被引用十余年——它卖的从来不是数据量,而是真值质量与覆盖面。
3.6 从 BIOSSES 看"领域基准冷启动"的可复制模板
把 BIOSSES 的构造流程抽象成模板,可迁移到其他尚无句级相似度基准的领域:
| 步骤 | BIOSSES 的做法 | 迁移要点 |
|---|---|---|
| 1 选源语料 | 选学术文献(TAC),因其含引文结构 | 任何有引文/互引结构的领域文本 |
| 2 定代理信号 | 用"引用行为"代理"主题相关" | 找领域内天然的相似性先验 |
| 3 保分布覆盖 | 定向选高/低相似句对 | 避免随机抽样的分布偏斜 |
| 4 小规模专家标注 | 5 人独立 0–4 打分取均值 | 优先真值质量而非样本量 |
| 5 公开一致性上界 | 报标注者间相关 | 让使用者知道性能天花板 |
| 6 同批发布方法基线 | 四类方法横向对比 | 给后续研究者一个起跑线 |
这套模板的每一环都在 BIOSSES 里得到验证,是它作为"方法论案例"的额外价值。
§4 实验结果:一张表看全四类方法
4.1 主结果表(论文 Table 3,预处理后)
| 方法类别 | 具体方法 | Pearson 相关 |
|---|---|---|
| 域外 SOTA 基线 | ADW | 0.586 |
| SEMILAR | 0.419 | |
| 字符串相似度 | Qgram | 0.754 |
| Block | 0.752 | |
| Jaccard | 0.710 | |
| Overlap coefficient | 0.695 | |
| Levenshtein | 0.592 | |
| 词嵌入 | Paragraph Vector | 0.787 |
| 本体法(WordNet, WBSM) | Path | 0.644 |
| JCN | 0.623 | |
| Lin | 0.495 | |
| WP | 0.354 | |
| LCH | 0.287 | |
| Resnik | 0.234 | |
| 本体法(UMLS, UBSM) | Path | 0.651 |
| Lin | 0.645 | |
| JCN | 0.624 | |
| WP | 0.576 | |
| Resnik | 0.473 | |
| LCH | 0.333 | |
| 组合本体(COM, λ=0.5) | 0.710 | |
| 监督组合 | Linear Regression | 0.836 |
4.2 结果解读四条
其一,通用域系统确实"水土不服"。 ADW(0.586)与 SEMILAR(0.419)都是当年通用英语 STS 的一线系统,但在生物医学句对上只落入 Evans 准则的"中等"区间。这是论文最核心的动机证据:若不做领域适配,最强的通用方法也追不上一个简单的字符级 Qgram(0.754)。对使用者的启示是——把通用句嵌入模型直接套到生物医学文本上,评测分数可能并无竞争力。
其二,简单方法出人意料地强。 Qgram 用纯字符级滑动窗口匹配就拿到 0.754,高于所有本体法(含组合本体 COM 0.710)。原因有二:生物医学术语词汇形近(同一蛋白的不同写法、缩写)使字符级匹配占便宜;而本体法受限于概念映射的覆盖率与质量(MetaMap 映射失败、WordNet 不含生物医学概念),在未登录词上退化。这是"术语密集文本里字符 n-gram 常是强基线"这一经验的重要早期佐证。
其三,段落向量验证了"无监督语料预训练"的价值。 用 4 GB PMC 语料训出的 Paragraph Vector 单独就拿到 0.787,是所有无监督方法中最高。论文评价其为"有前景的方法",理由正是它能在无标注的大规模领域语料上捕捉语义——这条路线后来被 BioBERT/SciBERT 乃至今天的生物医学句嵌入模型发扬光大,回看 BIOSSES 的 0.787 可视为这条路径的早期坐标。
其四,监督融合是明确的赢家。 把 Qgram、Paragraph Vector、COM 三路分数交给线性回归,相关性跃升到 0.836,比最强单项(0.787)高约 5 个百分点,比域外 SOTA(ADW 0.586)高出最高 42.6%。论文的解读是:不同无监督方法的分数"互相补充"(complement each other),尽管每个单方法都只与金标准"强相关"(0.60–0.79),组合后达到了"非常强"(0.80–1.00)。
4.3 评估协议与人类上界
- 协议:由于数据集规模小,监督模型采用分层 10 折交叉验证(stratified 10-fold CV),最终结果取各折相关性的平均。这一点必须在引用时注意——后续论文若用单次固定划分报告 BIOSSES 分数,与本论文的 10 折 CV 口径不完全可比。
- 预处理的重要性:论文对比了预处理前后,发现预处理提升所有方法(提升 10–31% 不等,字符串方法受益最大)。Table 3 报告的是预处理后的结果。
- 人类上界:0.902(标注者间最低相关)。最佳系统 0.836 距此仍有约 0.066 的差距。论文结论段据此写道"there is still room for improvement"——即 2017 年的最强系统尚未穷尽这个基准的空间,这为后来者留了追赶的余地。
4.4 逐方法点评表
把 Table 3 的每个方法放进"它靠什么取胜、又栽在哪里"的框架里:
| 方法 | 分数 | 取胜机制 | 失效场景 |
|---|---|---|---|
| ADW | 0.586 | WordNet 图上的 PageRank 词义消歧 | 无法识别生物医学缩写与领域术语 |
| SEMILAR | 0.419 | WordNet/LSA 词级相似 + 最优匹配 | 同 ADW,且最优匹配对术语密集句不稳 |
| Qgram | 0.754 | 字符 n-gram 捕捉形态相似 | 语义不同但拼写相近时误判 |
| Block | 0.752 | 词频向量 L1 距离 | 词序/语义无关,靠词表重合 |
| Jaccard | 0.710 | 词集合交并比 | 同 Block,且对长句惩罚重 |
| Overlap | 0.695 | 交并比按较小集合归一 | 短句对偏乐观 |
| Levenshtein | 0.592 | 编辑操作数 | 长句编辑距离累积、语义无关 |
| Paragraph Vector | 0.787 | 4 GB 领域语料学到的分布语义 | 语料外术语、罕见实体表示弱 |
| WBSM-Path | 0.644 | WordNet 分类树最短路径 | WordNet 缺生物医学概念,覆盖不足 |
| WBSM-Resnik | 0.234 | 信息量(需语料统计) | 通用语料的 IC 不适配生物医学 |
| UBSM-Path | 0.651 | UMLS 概念树最短路径 | MetaMap 未映射的概念退化 |
| UBSM-Lin | 0.645 | UMLS 概念的信息量比值 | 依赖 UMLS 子本体(OMIM/MeSH)覆盖 |
| COM(λ=0.5) | 0.710 | 通用域 + 领域本体互补加权 | 两本体都缺的概念仍为 0 |
| Linear Regression | 0.836 | 三路无监督分数监督融合 | 依赖训练划分;小样本易过拟合(故用 10 折 CV) |
这张表揭示的规律是:分数高低与"对术语形态/领域语料的依赖强度"正相关——越贴近生物医学术语表面形式(Qgram)或领域语料分布(PV)的方法,越强;越依赖通用本体结构(WBSM)的,越弱。UBSM 普遍略高于对应的 WBSM,直接说明"用对的领域本体"有增益。
4.5 与"人类上界"的正确对话方式
论文给出的 0.902 不是"模型的及格线",而是"天花板"。理解这一点的正确姿势是:
- 一个系统拿到 0.85,不是"接近满分",而是"已达到人类一致性的约 94%";
- 一个系统拿到 0.95,不是"超越人类",而更可能意味着测试方式(如把 10 折 CV 的金标准也用作训练目标,或数据泄漏)出了问题;
- 报告的分数应连同评估协议一起给出,否则 0.80 与 0.85 的差距可能只是协议差异。
这套"上界思维"是 BIOSSES 留给评测方法论的一个附带礼物,对今天评测 LLM 的相似度能力同样适用。
4.6 分数提升的归因分解
从 ADW(0.586)到监督回归(0.836),0.25 的相关提升来自哪些环节?论文的对比表可以拆成三段:
| 环节 | 相关提升 | 归因 |
|---|---|---|
| ADW 0.586 → Qgram 0.754 | +0.168 | 从通用本体转向字符级匹配(术语形近的红利) |
| Qgram 0.754 → ParagraphVector 0.787 | +0.033 | 从表面匹配转向领域语料学到的分布语义 |
| PV 0.787 → 监督回归 0.836 | +0.049 | 多路信号监督融合 |
这个分解的启示是:领域适配的第一步红利最大(+0.168),主要来自"换用适合术语文本的方法";后续每一步增益递减但都为正。对工程实践的指导是——先把方法换成领域友好的(如字符 n-gram 或领域预训练嵌入),再考虑复杂的融合与调优,性价比最高。
4.7 论文的可复现性评估
| 复现要素 | 可复现性 | 说明 |
|---|---|---|
| 数据集 | 高 | HF 一行加载,100 条固定 |
| 评估协议 | 中 | 10 折 CV 有描述,但未给随机种子/折划分 |
| 字符串方法 | 高 | SimMetrics 是公开库,预处理规则明确 |
| 本体方法 | 中 | 依赖 WordNet/UMLS 版本与 MetaMap,映射结果可能随版本漂移 |
| 段落向量 | 中 | 语料未固化快照,训练细节部分披露 |
| 监督模型 | 高 | 线性回归 + 三特征,Weka 实现明确 |
综合:方法描述足以理解,但逐位复现 0.836 存在若干不确定源(语料快照、本体版本、折划分)。这也解释了为什么后续论文很少声称"精确复现了 BIOSSES 的 0.836",而多是"在 BIOSSES 上报告我们自己的分数"。
§5 历史地位与影响
5.1 “首个人工标注生物医学句级 STS 基准”
BIOSSES 最常被引用的一句话,是它在论文引言里自我定位的那句断言:在它之前,生物医学领域既没有手工标注的句子级相似度基准,也没有系统的句级相似度研究。这不是营销辞令,而是可由当时的文献状态印证的判断——词级/概念级相似度研究(基于 MeSH、GO、SNOMED 等的概念相似度)在生物医学领域早已成熟,但把评测粒度上升到"句子"、并配以人工真值的,BIOSSES 是第一个。
这一定位使其成为生物医学 NLP 评测谱系中"从句级语义切入"的原点条目。任何追溯"生物医学句子嵌入/文本相似度评测从何而来"的综述,几乎都会从 BIOSSES 起笔。
5.2 作为领域"必跑小基准"的长期使用
2017 年之后,随着预训练语言模型(BERT 家族)进入生物医学领域,BIOSSES 的用途发生了一次转向:它从"方法评测集"变成了"句嵌入质量的小型试金石"。BioBERT、SciBERT、PubMedBERT 及其后的各类生物医学/通用句嵌入模型(以及 2020 年后的 sentence-transformers 系列),相当一部分在报告生物医学语义相似度能力时会列出 BIOSSES 上的 Spearman/Pearson 相关。它之所以能承担这个角色,恰恰因为规模小、加载快、任务干净——几分钟就能在一个新模型上跑完,适合作为"冒烟测试"级别的领域适配信号。
但小规模是一把双刃剑。100 条样本下,两个模型相关性的差异极易被少数几条样本的偶然性主导,1–2 个百分点的差距在统计上往往不显著;又因缺乏官方固定测试划分,不同论文选择 10 折 CV 还是自定义划分会造成分数口径漂移。因此,把 BIOSSES 当作方向性指标(模型是否具备基本生物医学语义能力)是合适的,把它当作模型优劣的精确排序依据则不合适——这一点在库内条目中必须明示(见 §7 与坑 1)。
5.3 方法学遗产:四类方法谱系的早期坐标系
BIOSSES 论文把字符串、本体、分布式向量、监督融合四类方法放在同一基准、同一指标下横向对比,这在那时的生物医学句级研究里是罕见的系统工作。它留下的几条经验后来反复得到验证:
- 字符 n-gram 是术语密集文本的强基线(Qgram 0.754);
- 领域本体法单独用效果有限,受概念映射覆盖率制约(本体法普遍低于字符串法);
- 大规模领域语料的无监督预训练有价值(Paragraph Vector 0.787),预示了预训练路线的兴起;
- 多路信号监督融合优于任一单项(0.836)。
放在 2026 年的视角回看,这四条几乎就是从"规则/本体时代"过渡到"预训练时代"的路线图上的一组坐标点。
5.4 与相关工作的关系
- SemEval STS 系列(2012–2016):通用英语句相似度的年度评测,BIOSSES 的量表(0–4 分级、Pearson 评估)直接借鉴 SemEval 2012 Task 6,但把赛题移植到生物医学领域作为固定基准(SemEval 是逐年轮换的竞赛,BIOSSES 是长期可复用的静态集)。
- 生物医学词/概念相似度研究:BIOSSES 是句级层的补充——它证明了词级本体的组合(WordNet+UMLS)在句子粒度上不自动转化为优势,需要句子级聚合算法与监督融合。
- 后续生物医学 STS 资源:BIOSSES 之后,领域内陆续出现更大规模的相似度/蕴含资源(如 MedNLI 的句对推理、以及各类句子嵌入评测集),但 BIOSSES 作为"最小、最早、最常被引"的一件,始终保留在评测清单里。
5.5 常见引用语境一览
BIOSSES 在后续文献里通常出现在哪类论证中,决定了读者应如何理解它的"引用价值":
| 引用语境 | 典型表述 | 说明 |
|---|---|---|
| 段落/句嵌入预训练论文 | “在 BIOSSES 上达到 X 相关” | 作为领域适配的快速验证指标 |
| 相似度方法综述 | “首个生物医学句级 STS 基准” | 作为历史起点引用 |
| 领域本体应用研究 | “本体法在句级表现有限(BIOSSES 实证)” | 引其对比结论 |
| 医疗信息检索/摘要 | “句级相似度可提升摘要质量” | 引其任务动机 |
| 数据集质量讨论 | “小基准的信噪比优势与统计局限” | 引其规模争议 |
5.6 一句话定位(供综述引用)
BIOSSES(Soğancıoğlu et al., Bioinformatics 2017)是生物医学领域第一个人工标注的句子级语义相似度基准,含 100 个由 5 位专家标注(0–4 分取均值)的 TAC 语料引用句对,论文同批提出字符串/本体/段落向量/监督回归四类方法,最佳监督模型 Pearson 相关 0.836,人类一致性上界 0.902。
5.7 与生物医学预训练模型时代的关系
BIOSSES 在 2017 年诞生时是"方法评测集";2018 年 BERT 之后,它的角色悄然转变为"领域嵌入探针"。理解这一转变对正确使用它很关键:
- 2017 语境:无预训练模型,BIOSSES 用来比较手工特征方法(字符串/本体)与早期神经方法(段落向量)的优劣;
- 2019+ 语境:BERT 系(BioBERT/SciBERT/PubMedBERT)与句嵌入模型出现后,BIOSSES 成了**快速验证"模型有没有领域语义感"**的第一站——它足够小,几分钟出结果;
- 今天的语境:LLM 嵌入模型普遍在 BIOSSES 上接近或达到 0.9(逼近人类上界),此时它的用途进一步收缩为冒烟测试与历史对照,而非区分强模型。
这条演变也解释了一个常见困惑:“BIOSSES 分数这么容易刷高,还有用吗?”——有用,但用途变了:它不再是"高手对决的赛场",而是"新模型入场的体温计"。
§6 获取与许可
6.1 三个获取入口
| 入口 | 地址 | 内容 | 适合谁 |
|---|---|---|---|
| 原始发布页 | tabilab.cmpe.boun.edu.tr/BIOSSES/DataSet.html |
论文指定的官方数据入口(句对+标注分) | 想引用官方来源者 |
| 代码仓库 | github.com/gizemsogancioglu/biosses |
Java/Maven 实现 + input.txt 样例 + get_resources.sh |
想复现论文方法者 |
| 结构化转存 | huggingface.co/datasets/tabilab/biosses |
单 parquet(23,090 B),一行 load_dataset |
现代管线使用者 |
HuggingFace 版本最简单:
from datasets import load_dataset
ds = load_dataset("tabilab/biosses", split="train")
print(len(ds)) # 100
print(ds[0]) # {'sentence1': ..., 'sentence2': ..., 'score': 2.2}
抓取时点(2026-09-30):HF 版本 downloads=456、likes=7、lastModified=2024-01-10。GitHub 仓库最后活动为 2019-05-21(README 更新)。官网在当前沙箱网络环境下不可达(HTTP 000),实践上以 HF 与 GitHub 两处为准;官网的长期可用性依赖作者服务器,存在单点风险(见坑 3)。
6.2 许可:两件资产,两套规则(关键)
BIOSSES 的许可是最容易踩坑的地方,因为"数据集"和"论文"的许可不是同一个:
| 资产 | 许可 | 依据 | 约束要点 |
|---|---|---|---|
| 数据集本体(100 句对) | GPL-3.0 | HF tabilab/biosses cardData.license = gpl-3.0;GitHub 仓库含 LICENSE |
copyleft(传染性):衍生作品若分发需同样以 GPL-3.0 开源;允许商用,但对再分发的开源义务有要求 |
| 论文文本 | CC BY-NC 4.0 | PMC5870675 明确 “Creative Commons Attribution Non-Commercial License” | 署名 + 非商业;不可用于商业用途 |
需要特别澄清两个常见误读:
- TFDS 的转述有误:TensorFlow Datasets 页面把许可写成 “GNU Common Public License v.3.0”。这里"Common"是笔误,实际 GNU General Public License v.3.0(GPL-3.0,即 HF cardData 记录的 gpl-3.0)。版本号 3.0 是一致的,但名称不能照抄。
- 不要把论文许可当数据许可:论文是 CC BY-NC(禁商用),数据集是 GPL-3.0(可商用但 copyleft)。如果你把 BIOSSES 数据用进产品,数据侧受 GPL-3.0 约束(通常意味着若你分发含该数据的作品,需以 GPL-3.0 兼容方式开源);而引用论文的文字/图表则受 CC BY-NC 约束。两者要分开看(坑 2)。
6.3 引用规范
@article{sogancioglu2017biosses,
title = {BIOSSES: a semantic sentence similarity estimation system
for the biomedical domain},
author = {So{\u{g}}anc{\i}o{\u{g}}lu, Gizem and {\"O}zt{\"u}rk, Hakime
and {\"O}zg{\"u}r, Arzucan},
journal = {Bioinformatics},
volume = {33},
number = {14},
pages = {i49--i58},
year = {2017},
doi = {10.1093/bioinformatics/btx238}
}
§7 AI-Ready 评估与局限披露
7.1 DAIMS 评估
以库内 DAIMS 框架(可发现性/可获取性/可互操作/元数据质量/可持续性)逐维评估:
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 论文开放获取 + HF dataset card + TFDS 收录 + PapersWithCode id(biosses);DOI 唯一 |
| A 可获取性 | 8 | HF 一行直链加载,无需注册/审批;仅官网单点不可达扣分 |
| I 可互操作 | 7 | 标准 parquet + HuggingFace datasets 生态;字段极简(三列),无官方转化脚本但本身即通用文本格式 |
| M 元数据质量 | 7 | HF card 元数据完备(许可证/规模/来源/引用/标注说明);但无官方 train/val/test 划分说明,规模极小 |
| S 可持续性 | 6 | 托管于 HF + GitHub(稳定);官网依赖作者单点服务器不可达,长期维护有风险 |
| 综合评级 | 7.2/10(中上) | 开放直链与元数据质量优秀;受"官网单点风险 + 无固定划分"拖低 |
7.2 AI-Ready 检查单(FAIR 视角)
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI + HF repo + PMID |
| F2 富元数据 | ✅ | HF dataset card 含 features/splits/来源/引用/标注说明 |
| A1 可访问协议 | ✅ | HTTP 直链(HF),无门禁 |
| A2 元数据可访问 | ✅ | 元数据始终开放 |
| I1 互操作格式 | ✅ | Parquet / HF datasets |
| I2 词汇表引用 | ✅ | 术语为生物医学标准词汇(UMLS/MeSH/WordNet 语境) |
| R1 来源溯源 | ✅ | 明确标注源自 TAC 2014 BiomedSumm track |
| R3 可复现流程 | ⚠️ | 方法是论文描述,代码仓库为旧版 Java 实现,现代复现需自行重写 |
| AI-Ready 综合 | 高 | 直链覆盖评测任务,是库内可获取性最"顺滑"的条类之一 |
7.3 局限逐条披露(必读)
BIOSSES 的局限不是边角料,而是理解其正确用法的一部分:
- 规模极小(100 句对):这是库内规模最小的 NLP 基准之一。方法间 Pearson 差异的统计显著性难以保证;单条样本的标注波动对总分影响可观。结论:只作方向性指标,不作精细排序。
- 无官方测试划分:单一 train split。不同论文的"BIOSSES 分数"因评估协议不同(10 折 CV / 单次划分 / 全部当测试)而口径不一,横向比较需先对齐协议。
- 单语言、单来源、单文体:全英语、全来自 TAC 2014 一个 track 的 20 篇文献、全为学术论文的引用句。面向临床文本、专利、社交媒体等文体时外推性未知。
- 标注为整数分级均值:5 人 0–4 整数分取均值,非连续真值;0.902 的标注者间相关构成实际性能上界,超过此值的报告值得警惕(可能是过拟合或数据泄漏)。
- 许可的 copyleft 性质:GPL-3.0 对再分发有传染性要求,商用与开源场景需分别评估(§6.2)。
- 官网单点风险:原始发布页依赖作者服务器,抓取时点不可达。
7.3.1 局限的应对处置(把每条局限转成行动)
| 局限 | 使用时的处置 |
|---|---|
| 规模小 | 只报方向性结论;如需显著性,做多次随机划分并报置信区间 |
| 无固定划分 | 自行固定随机种子并公布;对齐论文的 10 折 CV 口径以便对标 |
| 单语言单来源 | 明确声明适用域;跨域结论须另找资源验证 |
| 整数均值真值 | 明示真值性质;超过 0.902 先排查泄漏 |
| GPL-3.0 copyleft | 分发前核对开源义务;商用场景先做许可评估 |
| 官网单点 | 使用 HF/GitHub 镜像入口,并在文档中记录双备份 |
这六条合并成一句话:把 BIOSSES 当作"有明确适用边界的探针",而非"无条件的权威标尺"。
7.4 与库内其他条目的可获取性对照
库内 NLP 基准的可获取性光谱大致为:注册墙 → 请求制 → 平台托管 → 公开直链。BIOSSES 落在公开直链档的顺畅一端(HF 一行加载),与库内 bc2gm(rid 434)、bc5cdr(rid 415)等同属"开箱即用"梯队;但其规模同时是库内最小的一档,这一"易获取 + 小规模"的组合是其区别于库内多数基准条目(规模大但常需申请/注册)的显著特征。
7.5 与库内其他基准的规模—获取性对照
| 条目 | 规模量级 | 获取方式 | 与 BIOSSES 的对比点 |
|---|---|---|---|
| BIOSSES | 极小(100 句对) | 公开直链(HF) | 本条目:最小规模 + 最顺直链 |
| MedNLI(rid 648) | 中等 | 公开/平台 | 句对任务族,规模更大 |
| BC2GM(rid 434) | 中等 | 公开 | NER 任务,规模更大 |
| BC5CDR(rid 415) | 中等 | 公开 | 关系抽取,规模更大 |
| BioRED(rid 457) | 中等 | 公开 | 文档级关系抽取 |
| i2b2/n2c2-nlp(rid 14) | 大 | 多需注册 | 临床共享任务语料 |
| MIMIC-III(rid 106) | 大 | 注册+培训 | 临床数据,最严获取 |
对照结论:BIOSSES 代表了"小规模 + 零门槛"的极端,与 MIMIC-III(大规模 + 高门槛)恰成光谱两端。使用者应根据"要速度还是要规模"来选择。
7.6 数据质量维度简评
| 质量维度 | 评价 | 依据 |
|---|---|---|
| 真值可靠性 | 高 | 5 位专家独立标注,一致性 0.902–0.958,公开上界 |
| 标注粒度 | 中 | 0–4 整数分取均值,非连续真值,无逐人分歧记录 |
| 分布覆盖 | 中上 | 引用句策略保证 0–4 全谱有样本,但绝对数少(每级约 20 条) |
| 领域覆盖 | 偏窄 | 仅生物医学文献引用句,不含临床笔记/专利等 |
| 格式规范性 | 高 | 三字段极简,parquet 标准,HF 生态兼容 |
| 文档完备性 | 中上 | HF card 完备;但无官方划分说明、无逐人评分披露 |
7.7 三条"使用前必读"
- 把 100 条当"信号",不当"排名"——任何 <2 个百分点的模型差异不要下结论。
- 把 GPL-3.0 当数据许可,CC BY-NC 当论文许可——两者不可互换(坑 2)。
- 把 0.902 当天花板——超过它先怀疑泄漏,而非庆祝(坑 6)。
§8 方法学启示:三条可迁移的经验
8.1 "引用句策略"是构造相似度句对的可复制技巧
BIOSSES 证明:在学术文本语料里,用"引用行为"作为相似度的代理信号,可以低成本地构造出覆盖全相似度谱系的句对。理由在于引用行为本身就隐含"主题相关"的先验——引同一文献且理由相近者高相似、引同一文献但视角不同者低相似。这一技巧可迁移到任何带引文结构的语料(其他学科文献、专利引证、判例互引等),是数据集构造方法论上的一个通用杠杆。
8.2 小规模高信噪比基准的定位
100 句对无法支撑精细排名,但足以支撑"冒烟测试"与"方向判断"。BIOSSES 的长期生命力恰恰来自这种定位——它被当作快速领域适配探针而非权威排行榜。对基准设计者的启示是:小基准的价值不在统计功效,而在低使用门槛 + 高信噪比(任务干净、真值可靠、加载即用),使其成为大基准之外的"快速信号源"。这与库内其他"小规模高信噪比"条目(如 mednli 系列)的定位逻辑相通。
8.3 多路无监督信号的监督融合
论文最实的方法学结论是:把多个弱相关的无监督分数监督融合,能得到远超任一单项的表现(0.836 > 0.787 > 0.754)。这一"特征级融合"思路在今天已是常识(集成学习/特征拼接),但 BIOSSES 在 2017 年的生物医学句相似度语境下给出了清晰的定量演示:三个各自"强相关"(0.60–0.79)的信号,组合后达到"非常强"(0.836)。对工程实践的直接含义是——别指望单一方法通吃,把互补信号交给一个简单回归器往往就够。
8.4 本体法的"覆盖率陷阱"
BIOSSES 的对比暴露了一个至今仍适用的教训:本体法(Ontology-based)的性能上限由概念覆盖率决定,而非由相似度算法决定。WBSM 与 UBSM 各自试了六种词级算法(Path/Resnik/Lin/WP/JCN/LCH),但无论用哪种,分数都被"有多少词能映射到本体"卡住——WordNet 不含生物医学专有概念,UMLS 虽含但依赖 MetaMap 映射成功率。这解释了为什么同为 Path 算法,UBSM(0.651)高于 WBSM(0.644);也解释了为什么所有本体法都低于字符级 Qgram(0.754)。对今日知识增强/图谱增强的相似度方法,这个教训依旧成立:知识源的覆盖广度往往比相似度公式的精致程度更决定成败。
8.5 "小样本 + 交叉验证"作为方法论文的诚信示范
BIOSSES 数据集小,论文没有回避,而是用分层 10 折 CV并把"人类上界 0.902"公之于众——这两件事合起来构成了一个诚实的方法学示范:承认数据局限 → 采用适配的评估协议 → 公开性能天花板。今天许多小数据集论文仍缺少这两步(既不做 CV 也不报上界),导致分数虚高且不可比。BIOSSES 的做法值得作为"小基准论文"的合规范本。
§9 与库内条目的关系
9.1 家族图谱
BIOSSES 在库内属"生物医学 NLP 基准"家族,与以下条目构成互补关系:
- BLUE 基准(rid 478):生物医学 NLP 十语料评测基准——最直接互链点。BLUE 是"多任务评测集大成者",BIOSSES 是"单任务小基准"的典型;两者对照可看到评测设计从"单点深挖"到"广谱覆盖"的两种取向。
- MedNLI(rid 648):临床自然语言推理——句对级任务的天然对照(NLI 三分类 vs STS 回归),同属"两段文本关系判定"任务族。
- BC2GM(rid 434):基因/蛋白提及识别——同属生物医学 NLP 语料,任务类型对照(NER vs STS)。
- BC5CDR(rid 415):化学-疾病关系抽取——关系抽取任务对照。
- BioRED(rid 457):生物医学文档级关系抽取——文本标注语料家族。
- i2b2/n2c2-nlp(rid 14):临床 NLP 共享任务语料——标注语料方法论对照。
- PubMedQA(rid 49):生物医学文献问答——同以生物医学文献为源的语料。
- BioASQ(rid 53):生物医学语义索引与问答评测基准——语义评测家族。
- MedQA(rid 50)/ MedMCQA(rid 111):医学考试问答——问答基准家族。
- MIMIC-III(rid 106):ICU 数据库——临床数据家族背景。
9.2 任务类型填补声明
库内已有条目覆盖:命名实体识别(BC2GM)、关系抽取(BC5CDR/ChemProt/BioRED)、推理(MedNLI)、问答(MedQA/MedMCQA/PubMedQA/BioASQ)、多跳推理(MedHop)。BIOSSES 是库内首个"句子级语义相似度回归"任务基准,任务类型上填补空白。这一点既是它入选的理由,也是它在家族图谱中不可被其他条目替代的原因——同一批文献可以做 NER、可以做 QA,但"两句话有多像"这一任务维度此前无人覆盖。
9.3 检索路径建议
- 检索词组合:“BIOSSES”(精确)+ “sentence similarity” 或 “semantic textual similarity”;确认为 Bioinformatics 2017 那篇。
- 若要数据:直接 HF
tabilab/biosses,别绕官网(当前不可达)。 - 若要方法复现:GitHub
gizemsogancioglu/biosses(注意是旧版 Java/SimMetrics/WS4J 依赖)。 - 若误搜到 STSR(牙齿分割):那是库内 stsr(rid 677),与 BIOSSES 无关(坑 4)。
9.4 互链矩阵(供发布后家族导航)
| 互链条目 | rid | 互链理由 | 内链位置建议 |
|---|---|---|---|
| blue-benchmark | 478 | 多任务评测基准 vs 单任务小基准 | §9.1、附录 K |
| mednli | 648 | 句对级关系判定任务族 | §9.1、§0 |
| bc2gm | 434 | 生物医学 NER 语料 | §9.1、附录 K |
| bc5cdr | 415 | 生物医学关系抽取 | §9.1、附录 K |
| biored | 457 | 文档级关系抽取 | §9.1、附录 K |
| i2b2-n2c2-nlp | 14 | 临床 NLP 共享任务方法论 | §9.1、附录 K |
| pubmedqa | 49 | 文献派生语料 | §9.1 |
| bioasq | 53 | 生物医学语义评测 | §9.1 |
| medqa | 50 | 医学问答家族 | §9.1 |
| medmcqa | 111 | 医学问答家族 | §9.1 |
| mimic-iii | 106 | 临床数据背景 | §9.1 |
凡从本条目跳转到上述任一条目,或在上述条目检索到本条目,均应能拼出"生物医学 NLP 评测家族"的完整检索面。
9.5 推荐的家族读法顺序
若读者想系统了解"生物医学 NLP 评测数据全景",建议按以下顺序读库内条目:
- 先读 BLUE 基准(rid 478):建立"生物医学 NLP 有哪些主流任务/语料"的全景;
- 再读 BIOSSES(本条目):补齐"句子相似度回归"这一环;
- 接着读 MedNLI(rid 648):理解"句对关系判定"的另一分支(推理);
- 然后读 BC2GM(434)/BC5CDR(415)/BioRED(457):看注释型任务(NER/RE)的语料设计;
- 最后读 MedQA(50)/PubMedQA(49)/BioASQ(53):看问答型任务的语料与评测。
这条路径的逻辑是"从全景 → 单任务 → 任务变体 → 注释语料 → 问答语料",BIOSSES 在其中扮演"把句级语义评测这一环补齐"的角色。
§10 避坑清单:八个已踩过的坑
坑 1:100 句对不是"转述误差",是真的这么小。 五源(论文/官网/HF/GitHub/TFDS)一致确认 BIOSSES 只有 100 句对,全数据文件仅 23 KB。任何把 BIOSSES 当"大数据集"使用的尝试都会落空。正确用法是把它当小规模高信噪比探针,只做方向性判断;报告其分数时务必同时报告评估协议(10 折 CV / 单次划分),并说明 100 条下的小差异不具统计显著性。
坑 2:数据集许可是 GPL-3.0,不是论文的 CC BY-NC。 两者常被混为一谈:HF cardData 与 GitHub LICENSE 都标 gpl-3.0(可商用、copyleft),而论文(PMC5870675)是 CC BY-NC 4.0(禁商用)。引用数据引 GPL-3.0,引用论文文字引 CC BY-NC。此外 TFDS 把 GPL 误写成 “GNU Common Public License”——名称错误,版本 3.0 正确(§6.2)。
坑 3:官网 tabilab.cmpe.boun.edu.tr 在部分网络环境不可达。 抓取时点(2026-09-30)curl 与 WebFetch 均返回失败(HTTP 000)。它仍是论文 Availability 段点名的官方入口,但实践上请走 HF 或 GitHub;官网不可达是网络/服务器单点问题,不代表数据集不存在(数据存在性由 HF/GitHub/论文三方确证)。
坑 4:“BIOSSES” 与 “STSR” 只是字母临时同形,别混。 库内 stsr(rid 677)是 2025 年 MICCAI ODIN 的牙齿分割与配准挑战赛,与 BIOSSES(STS 相似度)毫无关系;检索时若只看缩写"STS"或模糊匹配,可能把两者搞混。
坑 5:无官方 test 划分,分数口径不可直接横比。 HuggingFace 只有一个 train split(100 条全在里面)。论文自身用 10 折 CV;后继论文有的用自定义划分、有的把全 100 条当测试。因此"某模型 BIOSSES 得 0.9"这类说法,必须先问"在什么协议下"——未经对齐的跨论文比较可能失真。
坑 6:别把 0.902 当成"算法可达到的分数"。 0.902 是标注者之间的最低相关(人类一致性),论文视其为上界。论文自己最好的监督模型是 0.836。若某模型报告在 BIOSSES 上显著超过 0.90,应先怀疑数据泄漏或过拟合,而非欢呼超越人类。
坑 7:机构归属存在交叉口径。 Gizem Soğancıoğlu 双挂 Boğaziçi University 与 Yapı Kredi Technology;Hakime Öztürk 的机构标签在 PubMed(列 Boğaziçi)与 BVS(列 Yapı Kredi Technology)两处不一致。转引机构信息时以论文首页口径为准并注明交叉。
坑 8:论文方法是 2017 年的旧技术栈,复现需心理准备。 GitHub 代码是 Java/Maven,依赖 SimMetrics、WS4J、deeplearning4j,且资源需经 get_resources.sh 从外部下载(链接曾于 2017-12-17 更新,长期可用性无保证)。想用现代框架复现论文的 0.836,实际要重新实现,不能指望仓库开箱即跑。
§11 总结
11.1 三句话总结
- BIOSSES 是生物医学领域第一个人工标注的句子级语义相似度基准:100 句对、5 位专家 0–4 分级取均值、Pearson 相关评估,填补了 2017 年之前的领域空白。
- 它同批发布的四类方法以 0.836(监督回归)的成绩立下当时标杆,并留下四条可迁移经验:字符 n-gram 是术语文本强基线、领域本体法单独用效果有限、大规模语料无监督预训练有价值、多路信号融合优于单项。
- 它规模极小(100 条 / 23 KB)却长期是领域"必跑小基准"——正确用法是做快速方向性探针,而非权威排行榜;报告分数时必须披露评估协议并警惕 0.902 的人类上界。
11.2 适合谁
- 生物医学句嵌入/文本相似度研究者:需要一个即插即用的领域评测探针。
- 预训练模型开发者:用 BIOSSES 做领域适配的快速冒烟测试。
- 数据集构造方法研究者:引用句策略是可复制的低成本构造技巧。
- 生物医学 NLP 综述作者:追溯句级相似度评测源头时的原点条目。
11.3 不适合谁
- 需要大规模训练集训练句相似度模型的团队(100 条远不够)。
- 需要统计严格的模型排名场景(小规模 + 无固定划分)。
- 需要中文/临床文本/多语言相似度评测的项目(BIOSSES 仅英语学术引用句)。
- 希望开箱复现论文方法者(旧版 Java 栈 + 外部资源依赖)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 想立刻加载数据 | HF load_dataset("tabilab/biosses", split="train")(100 条,秒级) |
| 要报告模型 BIOSSES 分数 | 先明确协议(建议 10 折 CV 对齐论文),并写明"100 条小样本,差异不显著" |
| 要引用许可 | 数据引 GPL-3.0,论文引 CC BY-NC 4.0(坑 2) |
| 要复现论文方法 | 参考 GitHub(旧版 Java)或按 §3.4 自行重实现 |
| 要做综述定位 | §5.1"首个手工标注生物医学句级 STS 基准"可直接引用 |
| 要引用具体数字 | 附录 C 证据链表 + 论文 Table 3 |
11.5 五句话深读总结
- 它是第一个:在 BIOSSES 之前,生物医学领域没有手工标注的句子级相似度基准(论文引言原文认定)。
- 它用引用句构造:从 TAC 2014 语料的引用句中定向选取 100 对,自然覆盖 0–4 全相似度谱。
- 它是 5 人标注:5 位专家独立 0–4 打分取均值为真值,标注者间最低相关 0.902 公开为算法上界。
- 它同批立了方法标杆:字符串/本体/向量/监督四类方法横向对比,监督融合达 0.836,超域外 SOTA 最多 42.6%。
- 它小而长寿:100 条 / 23 KB,却因真值质量高、加载零门槛、历史定位独特而长期作为领域"体温计"。
11.6 给三类读者的最短路径
| 你是谁 | 只读这三节 | 关键提醒 |
|---|---|---|
| 要评测模型的工程师 | §6 + §7 + 附录 W | 协议对齐、报小样本局限、警惕 0.902 上界 |
| 要做数据集的研究者 | §3 + §5 + 附录 S/T | 引用句策略可迁移,双口径许可勿混 |
| 要写综述的学者 | §5 + §9 + 附录 Y | 时间线、家族图谱、一句话定位可直接引用 |
FAQ(高频问答 45 问)
A. 基础认知
Q1:BIOSSES 是什么的缩写?
它并非严格的首字母缩写,而是作为数据集/系统的定名使用(BIOSSES = BIOmedical Sentence Similarity Estimation System 之意)。库内 slug 取 biosses。
Q2:它是挑战赛吗?
不是。它没有比赛、没有 leaderboard、没有提交系统,是一个静态的人工标注基准数据集 + 一篇方法论文。
Q3:谁做的?
土耳其 Boğaziçi University(伊斯坦布尔海峡大学)计算机工程系,一作 Gizem Soğancıoğlu,通讯 Arzucan Özgür,三人作者(Soğancıoğlu、Öztürk、Özgür)。
Q4:发表在哪?多少钱能看?
Bioinformatics(Oxford University Press),2017;33(14):i49-i58,开放获取(论文 CC BY-NC 4.0),PMC5870675 可免费读全文。
Q5:数据集多大?
100 个句对,单 parquet 文件 23,090 字节。是的,就是这么小。
Q6:最大的卖点一句话?
生物医学领域第一个人工标注的句子级语义相似度基准,让"两句话有多像"第一次有了可复现的领域标尺。
Q7:它和 SemEval STS 什么关系?
同源不同命:量表(0–4 分级、Pearson 评估)借鉴 SemEval 2012 Task 6,但 SemEval 是逐年轮换的通用英语竞赛,BIOSSES 是生物医学领域的长期静态基准。
Q8:它自己有什么局限?
100 条规模太小、单 split 无固定测试集、单语言单来源、标注为整数均值、许可 GPL-3.0 有 copyleft 义务、官网单点不可达——见 §7.3。
Q9:为什么它能被长期使用?
因为它小、快、干净:几分钟跑完,适合做领域适配探针;且"最早 + 唯一"的历史定位使其成为综述必引条目。
Q10:库内之前有类似的吗?
没有。库内 743 条中此前无任何句级语义相似度基准;BIOSSES 填补了"句子相似度回归"任务类型空白(§9.2)。
B. 数据与获取
Q11:100 句对是怎么选出来的?
从 TAC 2014 BiomedSumm track 训练集的引用句里定向选取,兼顾"引同一文献理由相近"(高相似)与"引同一文献主题迥异"(低相似),使相似度覆盖 0–4 全谱。
Q12:得分 0–4 是怎么来的?
5 位人类专家各自独立打整数分(0=无关,4=等价),取均值为金标准,所以 score 可以是小数(如 2.2)。
Q13:数据字段有哪些?
就三个:sentence1、sentence2、score(float32)。简洁到不能再简洁。
Q14:怎么下载最省事?
HuggingFace:load_dataset("tabilab/biosses", split="train")。只有 100 行,无需注册,无门禁。
Q15:官网能下吗?
论文指定的官方入口是 tabilab.cmpe.boun.edu.tr/BIOSSES/DataSet.html,但抓取时点在沙箱内不可达(坑 3);实践走 HF 或 GitHub。
Q16:有官方 train/val/test 划分吗?
没有,只有一个 train split(100 条全在内)。这是横向比较分数时的口径风险来源(坑 5)。
Q17:能用它训练模型吗?
不能当训练集(100 条太少)。它是评测集/探针。若要训练相似度模型,需另找或自建大规模语料。
Q18:GPL-3.0 意味着什么?
可自由使用和商用,但若你分发含该数据(或其衍生)的作品,需遵守 GPL-3.0 的开源义务(copyleft)。若只是内部评测/研究,通常无影响;商用分发前建议咨询法务(§6.2)。
C. 方法与应用
Q19:论文提出的最好方法是什么?
把 Qgram、Paragraph Vector、COM 三个无监督分数作为特征,送入线性回归——Pearson 相关 0.836。
Q20:为什么一个简单的 Qgram 能打败本体法?
生物医学术语词汇形近(同名蛋白的不同写法/缩写)让字符级匹配占便宜;而本体法受制于概念映射覆盖率(MetaMap 未登录词、WordNet 缺生物医学概念)——见 §4.2。
Q21:段落向量为什么值得关注?
它在 4 GB PMC 语料上无监督训练,单独就拿到 0.787,是所有无监督方法中最高的,预示了"领域预训练"路线的价值(后来的 BioBERT 等)。
Q22:0.902 是什么?
标注者之间的最低 Pearson 相关,代表"人类一致性"。论文把它当作算法的性能上界——算法不可能比人类彼此更一致(坑 6)。
Q23:0.836 vs 0.902 说明什么?
2017 年最强系统距人类上界仍有约 0.066 的差距,论文结论明确"仍有提升空间",为后来者(预训练模型)留了追赶余地。
Q24:评估协议是什么?
监督模型用分层 10 折交叉验证(因数据小),取各折平均;预处理提升所有方法 10–31%。
Q25:我可以用它评测大语言模型吗?
可以,但要小心:100 条样本下 LLM 输出的相似度分数波动大,且需把 LLM 的连续输出与 0–4 金标准对齐口径;只宜作粗粒度方向判断。
D. 与库内/生态
Q26:它和 MedNLI(rid 648)什么关系?
同属"两段文本关系判定"任务族,但 MedNLI 是推理三分类(蕴涵/中立/矛盾),BIOSSES 是相似度回归(0–4 连续)。互链互补。
Q27:它和 BLUE 基准(rid 478)什么关系?
BLUE 是十语料多任务评测集大成者,BIOSSES 是单任务小基准;两者代表评测设计的"广谱覆盖"与"单点深挖"两种取向。
Q28:TFDS 上的许可写的是"GNU Common Public License",对吗?
名称有误,应为 GNU General Public License v3.0(GPL-3.0)。版本号 3.0 一致(坑 2)。
Q29:GitHub 仓库开箱能跑吗?
不能直接开箱。它是 2017 年的 Java/Maven 工程,依赖 SimMetrics/WS4J/deeplearning4j,资源还需 get_resources.sh 外链下载;现代复现基本要重写(坑 8)。
Q30:如果我只记住一件事?
BIOSSES 是"小而关键"的领域起源条目:100 句对、23 KB,却让生物医学句子相似度第一次有了人工标注的公共标尺,并用 0.836/0.902 这组数字标出了 2017 年人类与机器的差距。
E. 复现与工程细节
Q31:想复现论文的 0.836,需要什么资源?
需要:SimMetrics(字符串相似度)、WS4J + WordNet(通用本体)、MetaMap + Umls::Similarity(UMLS,且需 OMIM/MeSH 子本体访问权限)、一个 4 GB 的 PMC 开放语料(训练段落向量)、Weka(线性回归)。资源获取是最大障碍,尤其 UMLS 接口需注册。
Q32:段落向量那 4 GB 语料还能拿到吗?
PMC Open Access Subset 本身长期公开可获取,但论文未固化具体快照版本,因此严格复现"同一 4 GB 语料"需自行定格一个时间点。这属于复现的固有不确定性。
Q33:为什么监督模型用线性回归而不是更复杂的模型?
论文的意图是演示"多路信号融合"的增益,而非追求最强监督器;线性回归可解释性高、参数少,适合 100 条小样本(复杂模型在此规模下极易过拟合)。
Q34:10 折 CV 的随机性会影响分数吗?
会。100 条数据下不同折划分会带来零点几个百分点的波动;论文报告的是各折平均。若你复现,建议多次不同种子取平均,并报告方差。
Q35:能直接用 sentence-transformers 跑 BIOSSES 吗?
可以,且很快(100 条秒级)。但要注意:需把 STS 输出(通常 0–1 余弦相似度)与 BIOSSES 的 0–4 金标准对齐口径(线性缩放或直接算相关);直接算 Pearson/Spearman 相关是常见做法。
Q36:HF 版本和官网版本内容一致吗?
从元数据看 HF 版就是官网/论文数据的转存(100 条、三字段、23 KB 量级一致)。本次核验未能实抓官网页面比对逐条内容,属遗留待核(FACTS §9)。
Q37:parquet 里有没有标注者 ID 或逐人分数?
没有。HF 版仅 sentence1/sentence2/score 三列,score 是均值;逐人原始评分未包含(是否另行公开未确认)。
Q38:数据里有重复句对吗?
本次核验未逐条查重(100 条)。论文未声明去重口径;使用者可根据 sentence1+sentence2 拼接自行去重。
F. 语义与判读
Q39:BIOSSES 的"相似度"和"蕴含(entailment)"是一回事吗?
不是。相似度是连续回归(0–4,衡量"多像"),蕴含是分类(是否可推出)。两者相关但不同:两句可能高度相似却不构成蕴含。不要用 BIOSSES 训练 NLI 模型。
Q40:0 分和 4 分的样本各有多少?
论文 Fig. 1 称各级都有足够实例,但未在正文给出逐级精确计数;HF 版可自行统计 score 分布。本条目未逐级计数(属可补充细节)。
Q41:score 是整数还是小数?
原始逐人评分是整数(0–4),金标准是均值,所以是小数(HF 示例 2.2)。做回归任务时应按连续目标处理。
Q42:为什么 BIO 领域要用专门的相似度基准?
因为通用域方法在术语密集文本上失效(ADW 0.586/SEMILAR 0.419),且缩写、别名、领域概念普遍存在(如 RIP1 = receptor-interacting protein kinase 1),需要领域感知的表示与评测。
Q43:如果我要做中文生物医学句相似度,能用 BIOSSES 吗?
不能直接用(仅英语)。但它可作为方法模板:引用句策略、0–4 量表、报标注者一致性上界——这些可直接迁移到中文语料。
Q44:这个基准过时了吗?
作为"方法对比集"它已被更强的预训练模型超越(0.836 已非难事);但作为"最快的领域适配探针"和"历史起点条目",它仍有效且仍被引用。
Q45:为什么库内要为这么小的数据集单独立条目?
因为它填补了任务类型空白(库内首个句级相似度回归基准),且是领域起源条目——数据库的完整性不仅看规模,也看谱系覆盖。规模局限已在 §7.3、坑 1 充分披露。
事实清单(硬事实 51 条)
- BIOSSES 是生物医学句子相似度人工标注基准,含 100 个句对(五源一致)。
- 发布方:Boğaziçi University 计算机工程系 TABILAB。
- 作者三人:Gizem Soğancıoğlu(一作)、Hakime Öztürk、Arzucan Özgür(通讯)。
- 论文:Bioinformatics 2017;33(14):i49-i58,doi:10.1093/bioinformatics/btx238。
- PMID 28881973;PMCID PMC5870675。
- 数据来源:TAC 2014 Biomedical Summarization Track 训练集的引用句。
- TAC 语料规模:20 篇 reference articles,每篇 12–20 篇 citing articles。
- 标注者:5 位不同人类专家,独立评分。
- 评分范围:0(无关系)–4(等价),依据 SemEval 2012 Task 6 STS 指南。
- 金标准:5 位标注者分数的均值。
- 评估指标:Pearson 相关系数;强度准则引 Evans(1996)。
- 数据结构三字段:sentence1(string) / sentence2(string) / score(float32)。
- HF 实测:num_examples=100、num_bytes=32775、download_size=23090、dataset_size=32775。
- HF 文件:data/train-00000-of-00001.parquet,实测 23,090 字节。
- HF 仅一个 split:train(无 val/test)。
- HF 抓取时点:downloads=456、likes=7、lastModified=2024-01-10。
- 标注者间相关(vs 其余四人均值):A 0.952 / B 0.958 / C 0.917 / D 0.902 / E 0.941。
- 最低相关 0.902 被视为算法性能上界。
- 域外基线:ADW 0.586;SEMILAR 0.419。
- 字符串方法:Qgram 0.754;Block 0.752;Jaccard 0.710;Overlap 0.695;Levenshtein 0.592。
- 词嵌入:Paragraph Vector 0.787。
- WBSM(WordNet)六算法:Path 0.644 / JCN 0.623 / Lin 0.495 / WP 0.354 / LCH 0.287 / Resnik 0.234。
- UBSM(UMLS)六算法:Path 0.651 / Lin 0.645 / JCN 0.624 / WP 0.576 / Resnik 0.473 / LCH 0.333。
- COM(λ=0.5):0.710。
- 监督回归(Linear Regression):0.836(全论文最佳)。
- 相对域外 SOTA 提升:最高 42.6%(Pearson 口径)。
- 监督模型评估:分层 10 折交叉验证,取各折平均。
- 预处理提升所有方法 10–31%(字符串方法受益最大)。
- Paragraph Vector 训练语料:PMC 开放获取子集约 4 GB / 约 37K 篇,向量维度 100,Skip-Gram。
- 句子级本体聚合算法:语义向量(字典维度 × 词间最高相似度)+ 余弦相似度。
- UMLS 相似度接口限定 OMIM + MeSH 子本体,关系参数 PAR/CHD。
- 工具链:SimMetrics(字符串)、WS4J(WordNet)、MetaMap(UMLS 映射)、Umls::Similarity、Weka LinearRegression。
- 论文许可:CC BY-NC 4.0(Oxford University Press 开放获取)。
- 数据集许可:GPL-3.0(HF cardData + GitHub LICENSE)。
- TFDS 把许可误写为 “GNU Common Public License v.3.0”(应为 General)。
- 三获取入口:官网 DataSet.html / GitHub 代码库 / HuggingFace parquet。
- GitHub 仓库活动:2017-11-07 首传 → 2018-04-22 修 bug → 2019-05-21 README 更新(末次)。
- 致谢标注者:Ecem Soğancıoğlu、Jesus Lago Garcia、Kübra Eren、Onur Yanar;Bridget T. McInnes(UMLS 协助)。
- 资助:TÜBİTAK BİDEB 2210-A/2211-E 奖学金 + Science Academy BAGEP Award。
- 官网抓取时点不可达(HTTP 000,网络/服务器单点问题)。
- 论文认定"生物医学领域此前无句级相似度基准"——BIOSSES 为第一个(引言原文)。
- 句对选自 citing sentences(含文献引用的句子),非随机句对。
- 选引用句的动机:引用同文献者天然高相似、引不同主题文献者天然低相似,自然覆盖 0–4 全谱。
- 句子级语义向量构建:字典 = 两句唯一词并集;每维取词间最高相似度;最终余弦相似度。
- 论文自创三个本体法变体:WBSM(WordNet)、UBSM(UMLS)、COM(加权组合,λ=0.5 等权)。
- 论文字符串方法用 SimMetrics 库实现(去标点 + 去停用词预处理后)。
- 论文提到域外系统 ADW 用 WordNet + PageRank,SEMILAR 用 WordNet/LSA + 最优匹配。
- 论文致谢说明标注者含 Ecem Soğancıoğlu(一作的亲属)、Jesus Lago Garcia、Kübra Eren、Onur Yanar。
- BIOSSES 官方代码仓库为 Java/Maven 工程(非 Python),需 get_resources.sh 下载外部资源。
- HuggingFace 版本经 TFDS(TensorFlow Datasets)作为 community catalog 收录。
- PapersWithCode 收录 id 为
biosses。
术语表(41 条)
| 术语 | 释义 |
|---|---|
| STS | Semantic Textual Similarity,语义文本相似度(句级相似度评测的通用称法) |
| BIOSSES | 生物医学句子相似度估计系统/基准的定名 |
| 句对(sentence pair) | 待比较的两句话,本数据集的记录单元 |
| 引用句(citing sentence) | 含有一条文献引用的句子;BIOSSES 的句源 |
| TAC | Text Analysis Conference,美国 NIST 系列评测会议 |
| BiomedSumm | TAC 的生物医学摘要 track,BIOSSES 语料来源 |
| reference article | 被引用的"参考"文章 |
| 金标准(gold standard) | 5 位专家评分的均值,作为评测真值 |
| Pearson 相关系数 | 线性相关系数,本数据集的评估指标 |
| Evans 准则 | 相关强度分档(0.80+ 非常强 / 0.60–0.79 强 / 0.40–0.59 中等 / 0.20–0.39 弱 / 0–0.19 极弱) |
| 上界(upper bound) | 标注者间最低一致相关 0.902,算法性能的实际天花板 |
| Qgram | q-gram 字符 n-gram 滑动窗口匹配相似度 |
| Block distance | 曼哈顿距离(词频向量各维差之和) |
| Jaccard | 两集合交并比 |
| Overlap coefficient | 交并比分母取较小集合的相似度 |
| Levenshtein | 编辑距离(插入/删除/替换的最小操作数) |
| WordNet | 通用英语词汇本体,本数据集通用域知识源 |
| UMLS | 统一医学语言系统,含 >170 万生物医学概念的生物医学本体 |
| MetaMap | 把文本映射为 UMLS 概念的工具 |
| WBSM | WordNet-Based Similarity Method,基于 WordNet 的句子相似度法 |
| UBSM | UMLS-Based Similarity Method,基于 UMLS 的句子相似度法 |
| COM | Combined Ontology Method,WordNet+UMLS 加权组合本体法 |
| λ(lambda) | COM 中权重参数,0.5 为两本体等权 |
| Path 算法 | 基于分类树最短路径的词级相似度 |
| Resnik / Lin / JCN / LCH / WP | 信息量(IC)或路径深度类词级相似度算法 |
| Paragraph Vector | 段落/句向量模型(word2vec 家族),无监督训得句表征 |
| SimMetrics / WS4J / Weka | 论文使用的字符串相似度 / WordNet / 机器学习库 |
| 分层 10 折交叉验证 | 保持类别比例的小样本交叉验证协议,论文监督模型采用 |
| GPL-3.0 | GNU 通用公共许可证 v3.0(copyleft),数据集许可 |
| CC BY-NC 4.0 | 署名-非商业许可,论文许可 |
| PapersWithCode | 论文-代码-数据集索引平台,BIOSSES id = biosses |
| 语义相似度(semantic similarity) | 按含义而非字面衡量两段文本的接近程度 |
| 相似度回归 | 把相似度作为连续值预测(区别于分类) |
| 蕴含(entailment) | 一段文本能否推出另一段(与相似度相关但不同) |
| 词级相似度 | 单个词/概念之间的相似度,句子级相似度的基础 |
| 句子级相似度 | 两整句之间的相似度,需聚合词级相似度 |
| 余弦相似度 | 两向量夹角的余弦,本数据集句向量聚合的收口步骤 |
| 语义向量 | 以字典维度、词间最高相似度填充的句子表征 |
| 标注者间一致性 | 多位标注者评分的一致程度,本数据集以相关衡量 |
| 盲评(blinding) | 标注者不知既有标签/他人结果的设计 |
| 分布语义(distributional semantics) | 从语料统计中学习词/句含义的范式 |
| copyleft | 传染性开源许可条款(GPL 属此类) |
| 冒烟测试(smoke test) | 小规模快速验证,本数据集典型用法 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| 条目名 | BIOSSES |
| url_name | biosses |
| 类型 | 人工标注基准数据集 + 方法论文 |
| 论文 | Bioinformatics 2017;33(14):i49-i58 |
| 团队 | Boğaziçi University 计算机工程系(TABILAB) |
| 规模 | 100 句对(单 train split,23 KB) |
| 许可 | 数据集 GPL-3.0 / 论文 CC BY-NC 4.0 |
| 抓取时点 | 2026-09-30 |
| 库内互链 | blue-benchmark(478)/mednli(648)/bc2gm(434)/bc5cdr(415)/biored(457)/i2b2-n2c2-nlp(14)/pubmedqa(49)/bioasq(53)/medqa(50)/medmcqa(111)/mimic-iii(106) |
附录 B:DAIMS 评估全表
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | 论文开放获取 + HF card + TFDS + PapersWithCode id |
| A 可获取性 | 8 | HF 一行直链,无门禁;官网单点不可达扣分 |
| I 可互操作 | 7 | 标准 parquet + HF 生态;字段极简 |
| M 元数据质量 | 7 | HF card 完备;无官方划分说明,规模极小 |
| S 可持续性 | 6 | HF/GitHub 稳定;官网依赖作者服务器单点 |
| 综合评级 | 7.2/10(中上) | 直链与元数据优秀,受小规模与官网单点拖低 |
附录 C:逐项证据链自证
| 关键数字 | 来源 | 位置 |
|---|---|---|
| 100 句对 | 论文 §2.1 + HF card + GitHub README | PMC5870675 / HF dataset card |
| 5 位标注者 / 0–4 分 / 取均值 | 论文 §2.1 + HF card | PMC5870675 |
| 标注者相关 0.902–0.958 | 论文 Table 2 | PMC5870675 |
| ADW 0.586 / SEMILAR 0.419 | 论文 Table 3 | PMC5870675 |
| Qgram 0.754 / ParagraphVector 0.787 | 论文 Table 3 | PMC5870675 |
| WBSM/UBSM 六算法分数 | 论文 Table 3 | PMC5870675 |
| COM 0.710 / 监督 0.836 | 论文 Table 3 + 摘要 | PMC5870675 |
| 提升 42.6% | 论文摘要 | PMC5870675 |
| 4 GB / 37K 篇 / 维度 100 | 论文 §2.3.1 | PMC5870675 |
| 20 篇 reference × 12–20 citing | 论文 §2.1 | PMC5870675 |
| GPL-3.0(数据) | HF cardData.license + GitHub LICENSE | hf-mirror API 2026-09-30 |
| CC BY-NC 4.0(论文) | PMC 版权声明 | PMC5870675 |
| num_examples=100 / download_size=23090 | HF dataset_info 实测 | hf-mirror API 2026-09-30 |
| downloads 456 / likes 7 | HF API 实测 | hf-mirror API 2026-09-30 |
| 致谢标注者名单 / 资助 | 论文 Acknowledgements | PMC5870675 |
附录 D:数据获取决策树
你的需求是什么?
├── 只想立刻跑评测探针
│ └── HF load_dataset("tabilab/biosses", split="train")(100 条,秒级)
├── 想复现论文方法
│ └── GitHub gizemsogancioglu/biosses(Java/Maven;资源经 get_resources.sh)
├── 想引用官方原始来源
│ └── 官网 DataSet.html(当前不可达→备选 HF/GitHub)
├── 想商用/再分发
│ └── 先核对 GPL-3.0 copyleft 义务(数据)与 CC BY-NC(论文),勿混
└── 想要更大规模的句相似度数据
└── BIOSSES 不适用(仅 100 条)——另寻大规模语料或自建
附录 E:Score 分级语义与判读
| score | 语义(论文 Table 1) | 判读要点 |
|---|---|---|
| 0 | 两句话主题不同 | 完全不同话题 |
| 1 | 主题相同但不等价 | 同一大主题、信息不重叠 |
| 2 | 共享部分细节但不等价 | 有交集但各自补充不同信息 |
| 3 | 大致等价但有重要信息差异/缺失 | 大部分重合、细节缺损 |
| 4 | 完全或基本等价 | 同义重述 |
注:原始为 5 位专家的整数评分,取均值后可为小数(如 2.2);粒度介于整数级之间。
附录 F:论文四类方法速查
| 类别 | 代表方法 | 最佳分数 | 关键依赖 |
|---|---|---|---|
| 字符串 | Qgram | 0.754 | SimMetrics |
| 本体 | UBSM-Path | 0.651 | MetaMap + Umls::Similarity |
| 组合本体 | COM(λ=0.5) | 0.710 | WordNet + UMLS |
| 分布式向量 | Paragraph Vector | 0.787 | PMC 4 GB 语料 |
| 监督融合 | Linear Regression | 0.836 | Weka(输入 Qgram+PV+COM) |
附录 G:AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI + HF repo + PMID |
| F2 富元数据 | ✅ | HF dataset card 完备 |
| A1 可访问协议 | ✅ | HTTP 直链(HF),无门禁 |
| A2 元数据可访问 | ✅ | 始终开放 |
| I1 互操作格式 | ✅ | Parquet / HF datasets |
| I2 词汇表引用 | ✅ | UMLS/MeSH/WordNet 语境 |
| R1 来源溯源 | ✅ | 明确标注 TAC 2014 |
| R3 可复现流程 | ⚠️ | 旧版 Java 实现,现代复现需重写 |
| AI-Ready 综合 | 高 | 库内可获取性最顺畅的条目之一 |
附录 H:评测 BIOSSES 的检查清单(10 项)
- 协议对齐:确认你的评估划分(10 折 CV / 固定划分),并声明,避免与论文口径混比(坑 5)。
- 样本量认知:100 条,任何 <2 个百分点差异不具统计显著性;报告时注明置信区间或至少声明小样本。
- 上界意识:参考人类上界 0.902;显著超过者先查数据泄漏/过拟合(坑 6)。
- 分数口径:确认用的是 Pearson 还是 Spearman(论文用 Pearson),不要混淆。
- 许可核对:数据 GPL-3.0(copyleft),论文 CC BY-NC——按用途分别核对(坑 2)。
- 来源引用:数据引 HF/论文,方法引论文,勿把 TFDS 的许可笔误照抄(坑 2)。
- 字段确认:score 为 float,可直接做回归目标;无需归一化到 0–1(依论文口径)。
- 重复性:随机划分时固定随机种子;若做多次划分,报告均值与方差。
- 不可当训练集:100 条不足以训练有意义的相似度模型,只作评测。
- 时点存照:HF downloads 等会变,引用这些数字时注明抓取日期(本条目为 2026-09-30)。
附录 I:与论文结果的对照自检表
| 你的模型分数 | 相对定位 | 参考 |
|---|---|---|
| < 0.586 | 弱于 2017 通用域 SOTA | 需排查领域适配 |
| 0.586–0.710 | 与通用域/组合本体相当 | 领域适配有限 |
| 0.754–0.787 | 与 2017 最强单项相当 | 达到字符串/向量法水平 |
| 0.787–0.836 | 接近 2017 监督融合水平 | 良好 |
| 0.836–0.902 | 超越 2017 监督系统 | 优秀(预训练模型常见区间) |
| > 0.902 | 超过人类上界 | 高度可疑,先查泄漏(坑 6) |
附录 J:三获取入口对照
| 入口 | 内容 | 直链性 | 抓取时点状态 |
|---|---|---|---|
| 官网 DataSet.html | 原始句对+标注分 | 直链 | 不可达(HTTP 000) |
| GitHub 仓库 | Java 代码 + input.txt 样例 | 直链 | 可访问(末次活动 2019-05-21) |
| HuggingFace | parquet(100 行) | 直链 | 可访问(456 downloads / 7 likes) |
附录 K:与库内 NLP 基准家族对照
| 库内条目 | rid | 任务类型 | 规模量级 | 与 BIOSSES 关系 |
|---|---|---|---|---|
| BLUE 基准 | 478 | 十语料多任务评测 | 综合 | 评测设计取向对照 |
| MedNLI | 648 | 自然语言推理(三分类) | 中等 | 句对任务族对照 |
| BC2GM | 434 | 命名实体识别 | 中等 | 任务类型对照 |
| BC5CDR | 415 | 关系抽取 | 中等 | 任务类型对照 |
| BioRED | 457 | 文档级关系抽取 | 中等 | 生物医学文本家族 |
| i2b2/n2c2-nlp | 14 | 临床 NLP 共享任务 | 大 | 标注方法论对照 |
| PubMedQA | 49 | 文献问答 | 中等 | 文献源语料对照 |
| BioASQ | 53 | 语义索引与问答 | 大 | 语义评测家族 |
| MedQA / MedMCQA | 50 / 111 | 医学考试问答 | 大 | 问答家族 |
| MIMIC-III | 106 | 临床数据库 | 大 | 临床数据背景 |
| BIOSSES | 本条目 | 句子语义相似度回归 | 极小(100) | 任务类型填补空白 |
附录 L:双口径登记表
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 数据许可 | GPL-3.0(HF/GitHub) | “GNU Common Public License v3.0”(TFDS 名称笔误) | 按 GPL-3.0,注明 TFDS 笔误 |
| 2 | 论文许可 vs 数据许可 | 论文 CC BY-NC 4.0 | 数据 GPL-3.0 | 分资产引用,勿混(坑 2) |
| 3 | Öztürk 机构 | Boğaziçi University(PubMed) | Yapı Kredi Technology(BVS) | 按论文首页口径并注交叉 |
| 4 | 规模"过小"疑云 | 100 句对(真实规模,五源一致) | 任务头疑"过小需改道" | 核验判为正式基准,继续成稿并披露局限 |
附录 M:维护计划与触发点
| 触发点 | 条件 | 动作 | 优先级 |
|---|---|---|---|
| 官网恢复 | tabilab 服务器可达 | 补抓官网原文,更新 §6.1 | 1 |
| 划分更新 | 团队发布官方 test 划分 | 改写 §7.3、附录 H | 2 |
| HF 版本更新 | parquet 重新生成/规模变化 | 更新 §2.1 与指纹数字 | 3 |
| 后继基准 | 出现更大规模生物医学 STS 基准 | §5.4 扩写 | 4 |
| 许可变更 | 数据或论文许可调整 | §6.2 重写 | 5 |
附录 N:缩写速查
| 缩写 | 全称 |
|---|---|
| BIOSSES | BIOmedical Sentence Similarity Estimation System |
| STS | Semantic Textual Similarity |
| TAC | Text Analysis Conference |
| UMLS | Unified Medical Language System |
| MeSH | Medical Subject Headings |
| OMIM | Online Mendelian Inheritance in Man |
| WBSM / UBSM / COM | WordNet-Based / UMLS-Based / Combined Ontology Similarity Method |
| IC | Information Content(Resnik/Lin/JCN 类算法的基础) |
| PV | Paragraph Vector |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
| GPL-3.0 | GNU General Public License v3.0 |
| CC BY-NC | Creative Commons Attribution-NonCommercial |
附录 O:引文规范
@article{sogancioglu2017biosses,
title = {BIOSSES: a semantic sentence similarity estimation system
for the biomedical domain},
author = {So{\u{g}}anc{\i}o{\u{g}}lu, Gizem and {\"O}zt{\"u}rk, Hakime
and {\"O}zg{\"u}r, Arzucan},
journal = {Bioinformatics},
volume = {33},
number = {14},
pages = {i49--i58},
year = {2017},
doi = {10.1093/bioinformatics/btx238}
}
@misc{biosses-hf,
title = {BIOSSES dataset card},
howpublished = {HuggingFace Datasets, \texttt{tabilab/biosses}},
note = {License: GPL-3.0; 100 sentence pairs}
}
附录 P:本条目生产档案
- 生产通道:agent-b-biosses,正选 slug biosses;开工三查 ps 计数=4,锁
agent-b-biosses 2026-09-30T12:22 - 存在性核验:三轮精确搜索(WebSearch×3)+ 论文全文 XML 实抓(Europe PMC REST,114,795 B)+ HF 镜像 API 实测 + GitHub 仓库结构实抓
- 核验结论:数据集真实存在、规模/license/来源可查证;判定继续(非撞库、非证伪)——BIOSSES 真实规模即 100 句对,虽小但为领域起源基准且填补库内任务类型空白
- FACTS.md:writing/biosses/FACTS.md 九节
- 成稿方式:五块直写拼接(part1-5),全部写入私有区
.parts_agent-b-biosses_1790770949/ - 坑点:§10 八则(坑 1-8"坑 N:"编号制)
- 互链计划:新篇正文内链 6 处(BLUE/MedNLI/BC2GM/BC5CDR/BioRED/i2b2-n2c2)
附录 Q:坑点档案(与 §10 对照)
| 坑 | 一句话档案 | 触发场景 |
|---|---|---|
| 坑 1 | 100 句对是真实规模,非转述误差 | 使用/评估 |
| 坑 2 | 数据 GPL-3.0 vs 论文 CC BY-NC 4.0 | 许可引用 |
| 坑 3 | 官网 tabilab 在部分网络不可达(HTTP 000) | 数据获取 |
| 坑 4 | BIOSSES ≠ STSR(缩写临时同形) | 检索/选条 |
| 坑 5 | 无官方 test 划分,协议不一 | 分数横比 |
| 坑 6 | 0.902 是人类上界,非算法目标 | 分数解读 |
| 坑 7 | 机构归属双口径(Soğancıoğlu/Öztürk) | 著录 |
| 坑 8 | 旧版 Java 技术栈,复现不易 | 复现 |
附录 R:检索决策树
你想找什么?
├── BIOSSES 数据集本体
│ └── HF tabilab/biosses(或官网 DataSet.html;后者当前不可达)
├── BIOSSES 论文
│ └── doi:10.1093/bioinformatics/btx238(PMC5870675 开放全文)
├── BIOSSES 方法代码
│ └── GitHub gizemsogancioglu/biosses(Java/Maven)
├── 同类句对基准
│ └── SemEval STS 系列(通用英语)/ MedNLI(推理)
└── STSR(牙齿分割)?
└── 那是库内 stsr(rid 677),与 BIOSSES 无关(坑 4)
附录 S:双口径登记表(详版)
| # | 项 | 口径 A | 口径 B | 处理 |
|---|---|---|---|---|
| 1 | 数据集许可 | GPL-3.0(HF/GitHub) | “GNU Common Public License v3.0”(TFDS) | 按 GPL-3.0,注 TFDS 名称笔误 |
| 2 | 许可资产 | 数据 GPL-3.0 | 论文 CC BY-NC 4.0 | 分资产引用 |
| 3 | Öztürk 机构 | Boğaziçi(PubMed) | Yapı Kredi Technology(BVS) | 按论文首页并注 |
| 4 | 规模 | 100 句对(真实) | 主会话 brief 疑"过小" | 核验判为正式基准,继续并披露 |
附录 T:方法学检查清单(复现者 8 项)
- 数据加载:HF
load_dataset("tabilab/biosses", split="train")。 - 预处理对齐:去标点 + 去停用词(论文口径),否则与论文分数不可比。
- 本体版本:WordNet 用 WS4J 内置版本;UMLS 用 OMIM+MeSH 子集、PAR/CHD 关系。
- 段落向量:自训或复用 4 GB PMC 模型,维度 100、Skip-Gram。
- 监督输入:Qgram + Paragraph Vector + COM 三路分数。
- 评估协议:分层 10 折 CV,取各折平均。
- 上界参照:以 0.902 为天花板,不追超过。
- 报告要素:协议 + 划分 + 随机种子 + 样本量声明。
附录 U:BIOSSES 分数登记表(论文口径)
| 方法 | Pearson | 类别 |
|---|---|---|
| ADW | 0.586 | 域外基线 |
| SEMILAR | 0.419 | 域外基线 |
| Levenshtein | 0.592 | 字符串 |
| Overlap | 0.695 | 字符串 |
| Jaccard | 0.710 | 字符串 |
| Block | 0.752 | 字符串 |
| Qgram | 0.754 | 字符串 |
| Paragraph Vector | 0.787 | 向量 |
| COM(λ=0.5) | 0.710 | 本体组合 |
| Linear Regression | 0.836 | 监督 |
| 人类上界 | 0.902 | 一致性 |
附录 V:任务类型在库内的分布
| 任务类型 | 库内代表条目(rid) |
|---|---|
| 命名实体识别 | bc2gm(434) |
| 关系抽取 | bc5cdr(415)、biored(457) |
| 句子相似度回归 | biosses(本条目) |
| 自然语言推理 | mednli(648) |
| 文献问答 | pubmedqa(49)、bioasq(53) |
| 医学考试问答 | medqa(50)、medmcqa(111) |
| 多任务评测 | blue-benchmark(478) |
附录 W:数据加载与评测骨架(代码)
from datasets import load_dataset
from scipy.stats import pearsonr
from sklearn.model_selection import KFold
import numpy as np
# 1) 加载(100 条,单 split)
ds = load_dataset("tabilab/biosses", split="train")
s1 = [r["sentence1"] for r in ds]
s2 = [r["sentence2"] for r in ds]
gold = np.array([r["score"] for r in ds]) # 0..4 连续
# 2) 你的句编码器 -> 余弦相似度(示例,需替换为真实编码)
def encode(sentences):
... # 返回 shape=(n, d) 的句向量
def pred_similarity(s1, s2):
a, b = encode(s1), encode(s2)
a = a / np.linalg.norm(a, axis=1, keepdims=True)
b = b / np.linalg.norm(b, axis=1, keepdims=True)
return (a * b).sum(axis=1) # 0..1 余弦
# 3) 分层 10 折 CV 对齐论文口径
kf = KFold(n_splits=10, shuffle=True, random_state=42)
scores = []
for tr, te in kf.split(gold):
# 如需缩放预测分到 0..4,用训练折拟合线性映射
pred = pred_similarity([s1[i] for i in te], [s2[i] for i in te])
scores.append(pearsonr(pred, gold[te])[0])
print("mean Pearson", np.mean(scores), "±", np.std(scores))
# 参照:人类上界 0.902;论文监督基线 0.836
附录 X:为何本条目"小规模却值得立条"的评审备忘
| 质疑 | 回应 |
|---|---|
| 规模太小(100 条) | 真实规模,领域起源基准;库内需谱系覆盖而非仅规模 |
| 已被新模型刷满 | 角色已转向"冒烟测试/历史对照",仍被广泛引用 |
| 任务单一 | 正是库内缺失的"句级相似度回归"类型 |
| 数据价值低 | 真值质量高(5 专家 + 公开上界),构造方法论可迁移 |
| 与 STSR 重名 | 仅缩写临时同形,实为无关条目(坑 4) |
附录 Y:关键时间线
| 时间 | 事件 |
|---|---|
| 2014 | TAC BiomedSumm track 语料形成 |
| 2017-07-15 | 论文发表于 Bioinformatics 33(14) |
| 2017-11-07 | GitHub 仓库首传代码 |
| 2018-04-22 | 修复 Combined method/linear regression bug |
| 2019-05-21 | README 更新(仓库末次活动) |
| 2024-01-10 | HF tabilab/biosses lastModified |
| 2026-09-30 | 本条目核验与成稿时点 |
附录 Z:缩写与链接速查
| 缩写 | 全称 | 外部链接 |
|---|---|---|
| BIOSSES | BIOmedical Sentence Similarity Estimation System | HF tabilab/biosses |
| TAC | Text Analysis Conference | tac.nist.gov(BiomedSumm track) |
| UMLS | Unified Medical Language System | nlm.nih.gov/research/umls |
| MeSH | Medical Subject Headings | nlm.nih.gov/mesh |
| OMIM | Online Mendelian Inheritance in Man | omim.org |
| WordNet | 英语词汇本体 | wordnet.princeton.edu |
| MetaMap | UMLS 概念映射工具 | metamap.nlm.nih.gov |
| Weka | 机器学习工具包 | cs.waikato.ac.nz/ml/weka |
| DAIMS | 五维数据质量框架 | 库内评估口径 |
尾注
本条目为 AI-Ready Wikipedia 数据集条目,生产于 2026-09-30,抓取与核验时点见附录 A。事实陈述以论文开放获取全文(Bioinformatics 2017;33(14):i49-i58,PMC5870675)、HuggingFace 镜像 API 实测与 GitHub 仓库实抓为源;数据集许可(GPL-3.0)与论文许可(CC BY-NC 4.0)的双口径、TFDS 许可名称笔误、机构归属交叉、官网不可达等原始状态已在坑点与附录 L 存照。条目与库内 BLUE 基准(rid 478)、MedNLI(rid 648)、i2b2/n2c2-nlp(rid 14)、BC2GM(rid 434)、BC5CDR(rid 415)、BioRED(rid 457)等条目互链,构成生物医学 NLP 评测家族的完整检索面。后续维护触发点见附录 M。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- craft — 共享标签:医疗NLP / 生物医学文献 / 评测基准
- genia — 共享标签:医疗NLP / 生物医学文献 / 评测基准
- scifact — 共享标签:医疗NLP / 生物医学文献 / 评测基准
- open-pmc — 共享标签:医疗NLP / 生物医学文献
- mediqa — 共享标签:医疗NLP / 生物医学文献 / 评测基准
- s2orc — 共享标签:医疗NLP / 生物医学文献
- apollocorpus — 共享标签:医疗NLP / 生物医学文献 / 评测基准
- pubtator-central — 共享标签:医疗NLP / 生物医学文献 / 评测基准
- litcovid — 共享标签:医疗NLP / 生物医学文献
- pubmedqa — 共享标签:医疗NLP / 生物医学文献 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

