信息速览
INFOBOX — BBBC051 一屏速览
维度 内容 本质 3 例人体肾皮质组织的 DAPI 单通道共聚焦荧光显微图像集(3D 体积 / 2D 投影 / 2D 切片),附 8 类细胞类型 ground truth 归属 Broad Bioimage Benchmark Collection(BBBC)第 051 号,Version 1,Phenotype classification 分节 团队 Ashkar Lab(El-Achkar Lab),Indiana University School of Medicine;联系人/一作 Andre Woloshuk,通讯/末作 Seth Winfree 论文 Woloshuk et al., In Situ Classification of Cell Types in Human Kidney Tissue Using 3D Nuclear Staining, Cytometry Part A 2021;99(7):707-721(官方页 early view 口径 “Cytometry. 2020; 1–15”) 数据 Images.zip 2.9 GB 直链 + groundtruthlabels.txt;3 个 tissue samples;50 μm 切片 类别 8 类肾皮质细胞:集合管/连接小管、远曲小管、肾小球内皮、间质内皮、白细胞、足细胞、近端小管节段、髓袢升支粗段 标注 VTEA tissue cytometry 半自动流水线:LS Connect3D 核分割 + 多标记强度 X-means 无监督聚类 + 专家验证,~230,000 细胞 核心发现 仅凭 DAPI 核染色即可原位区分 8 类细胞:NephNet3D balanced accuracy 80.26%,超经典机器学习(RF 42.20%)约 38 个百分点 结论方向 3D > 2D、with context > without context;免多重标记的分类范式可避免抗体标记对组织的耗竭 衍生 TissueMNIST(MedMNIST v2 第 6 号):236,386 样本、28×28×1、7:1:2 切分、MD5 ebe78ee8b05294063de985d821c1c34b 获取 官方直链无注册;图像 + ground truth 均为 CC BY 3.0 Unported(允许商用) 库内互链 bbbc(BBBC 总集概览)、medmnist(MedMNIST 系列总集)
BBBC051 是一个"用一种染料干八种细胞的活"的数据集:3 例人体肾皮质组织、一张 DAPI 核染色的共聚焦图像,配合一条半自动 tissue cytometry 流水线,硬是标注出了八类肾皮质细胞的 ground truth;再用自设计的 NephNet3D 网络证明——只看细胞核的形态与 DAPI 强度,深度学习就能在原位把八类细胞分到 balanced accuracy 80.26%。对肾脏数字病理与 3D 显微图像分析而言,它是"免标记分类"范式的公开基准起点之一;对 MedMNIST 生态而言,它是 TissueMNIST 的上游母体——一个 3D 组织分类数据集如何在轻量化改道后进入标准 benchmark 循环的完整案例。
这个案例的每一步都经得起拆开看:图像有明确的一手出处(BBBC 官方页)、标签有可追溯的生产线(VTEA,开源)、数字有可区分的口径(三套规模数字各归其位)、许可有清晰的边界(CC BY 3.0)、衍生有完整的链路记录(TissueMNIST 四步加工)。本条目剩余部分的全部任务,就是把这五个"经得起"逐一展开成可核查的细节。
导语读法三则:
- 只想下数据:直奔 §6 获取与许可——Images.zip 2.9 GB 官方直链无注册,CC BY 3.0 允许商用,ground truth 在 groundtruthlabels.txt,下载后按 §6.6 自查。
- 关心标注怎么来的:直奔 §3 注释流水线——八类标签不是人工逐个点的,是 VTEA 半自动流水线聚类出来的,理解这一点才能正确使用标签(§3.5 还列了失败模式)。
- 做模型评测:直奔 §5 Bench——注意论文的最强数字 80.26% 是 NephNet3D(3D 核体积输入),拿 2D 模型对标时别错配口径,评测协议建议见 §5.5。
§0 导读:这个数据集解决什么问题
0.1 问题:原位认细胞,为什么要付出"组织耗竭"的代价
肾脏组织由二十余种细胞类型构成,散布在肾小球、小管、间质三大结构中。要在原位(in situ)认出它们,传统做法是多重免疫荧光标记——每种细胞类型配一条抗体:白细胞要 CD45,内皮要 CD31,近端小管要 AQP1 或 LRP2,髓袢升支要 THP/uromodulin,远曲小管要 NCC(SLC12A3),足细胞与基膜要 Nestin……多重标记的限制是结构性的:
- 通道数上限:一台共聚焦显微镜能同时区分的荧光通道有限,"全谱标记"在一张切片上几乎不可能,只能分组、连续切片、分别染——切片之间的空间对应又引入新的对齐问题。
- 组织耗竭:抗体标记一轮下来,切片被消耗殆尽,同一组织无法再用于下游实验(原位杂交、激光显微切割、质谱成像等)。
- 抗体可得性与批次差异:稀有标志物的抗体未必可得,批次间滴度差异直接转化为假阴性。
- 专家瓶颈:即便标记完成,逐细胞的判读仍依赖组织学家,通量与一致性都受人力约束。
Indiana University School of Medicine 的 Ashkar Lab(肾内科,同时深度绑定 IUPUI 计算机科学系与 Richard L. Roudebush VA Medical Center)提出了一个反直觉的思路:细胞核的 3D 形态与 DAPI 染色强度本身,可能就携带足够的类型信息。直觉依据是肾组织学教科书级别的观察——近端小管上皮的核大而圆、密集排布成管状;足细胞的核贴在肾小球毛细血管丛外侧,形态特殊;两种内皮细胞的核都小而扁,但一个在肾小球内、一个在间质;白细胞的核小、致密、染色深。核的大小、形状、染色质纹理、染色强度、空间排布,合起来像一套"形态学指纹"。
0.2 回答:三步走的公开验证
BBBC051 就是这个思路的公开验证集,论文的论证结构分三步:
第一步,用传统方法"教会"流水线认细胞。 对 3 例肾皮质组织做三组多重标记实验(每例三套抗体组,覆盖 CD45/CD31/Nestin、AQP1/LRP2/THP、NCC/KRT8),让每个细胞核在"免疫表型空间"里有了精确坐标。
第二步,把多标记信息蒸馏成标签。 用团队的 VTEA(Volumetric Tissue Exploration and Analysis)tissue cytometry 平台:LS Connect3D 分割细胞核 → 按多标记强度做 X-means 无监督聚类 → 空间位置与形态交叉验证 → 专家把关,得到约 23 万个细胞的 8 类标签。
第三步,把标签"反绑"到单通道图像上做闭环验证。 训练 NephNet2D/NephNet3D 网络,输入只有 DAPI 通道,输出 8 类预测。结果 NephNet3D 达到 balanced accuracy 80.26%,比经典机器学习特征(Random Forest + Haralick 纹理 + PFTAS,42.20%)高出约 38 个百分点——DAPI 单染色确实携带可被深度网络利用的细胞类型指纹。这个数字同时给出了范式的边界:约五分之一的细胞仍会被误分类,它是"强证据"而非"临床级替代"。
这个"假设 → 代理标注 → 闭环检验"的论证结构,在科学方法论上属于典型的"利用更强信息源验证更弱信息源的充分性":多标记是强信息(直接编码类型),DAPI 是弱信息(间接形态指纹),论文用强信息制造标签、用弱信息复现标签,复现成功即证明弱信息在此任务上"充分"。这种结构对一切"能否用便宜特征替代昂贵特征"的研究都有模板价值——它给出了证明充分性所需的全部组件与它们的最小配置。
0.3 这个数据集的三重价值
- 数据本身:带 8 类标注的人肾皮质 3D 荧光显微图像在公开数据集中极为稀缺——多数公开肾图像是 2D H&E 病理切片(如库内相关病理条目所覆盖),保留完整三维核结构的荧光体积数据几乎只此一家。BBBC051 提供体积、投影、切片三形态,可直接支撑 3D 显微图像分析研究。
- 方法论:论文完整披露了"多标记蒸馏 → 无监督聚类 → 单通道学习"的半自动标注范式,VTEA 平台开源(GitHub icbm-iupui/volumetric-tissue-exploration-analysis),整套流水线可迁移到任何"标签难得、图像易得"的组织成像场景(§8 展开五条可迁移经验)。
- 生态位:它是 MedMNIST v2 中 TissueMNIST 的上游母体——236,386 个 28×28 轻量样本让 3D 组织分类进入了标准 benchmark 循环,反过来又持续为 BBBC051 带来曝光与二手引用(§7)。
- 教学价值:一条流水线、四个消融口径、三个规模口径、两个年份口径——BBBC051 恰好把"数据集使用前该问的所有问题"都集中在一个案例里。它被用作数据集工程教学的案例素材时,本条目的坑点清单(§10)与证据分级表(附录 G)可以直接作为课程练习的对照答案。
三重价值还有时间维度上的互补:数据价值随使用即时兑现;方法论价值随团队复制逐步兑现;生态价值随 MedMNIST 循环长期兑现。评估 BBBC051 的投入产出时,三者应分别记账——只按"下载量/引用量"这类单一指标评估,会系统性低估后两者的慢变量。
0.4 §0 读法三则
- 这个条目是"图像集 + 标注流水线 + 分类基准"三合一:图像与标签可下载(§6),流水线方法论可复用(§3),基准数字可对标(§5)——三者参考价值各不相同。
- 全文统计数字均以 FACTS 存档与多源复核为准;规模存在 690,000 / ~230,000 / 236,386 三个口径(坑点 3),引用前务必分清。
- 检索时若把 BBBC051 当作"合成肾类器官数据"或"MCF7 乳腺癌数据",都是踩了第三方聚合页的讹误(坑点 1、坑点 2)——它是真实 deceased donor 人体肾皮质组织。
0.5 本条目与一手资料的关系声明
本条目是二手整理与多源复核的产物,不是一手资料。效力顺位如下:
- 一手资料:BBBC 官方页(数据契约:文件、许可、推荐引用)与论文(方法契约:流水线、实验、基准数字)——冲突时以一手为准。
- 本条目:在一手资料之上做结构化、口径裁定(附录 C)与使用指导(§3.5、§5.5 等 D 级建议);所有硬数字均标注来源(事实清单、附录 G 证据分级)。
- 第三方聚合页:不具效力;本条目记录的两处讹误(坑点 1、坑点 2)即来自该层级。
检索者引用本条目时,建议同时核对对应一手出处——本条目的复核日志(附录 E)记录了 2026-09-29 时点的一手状态,此后官方页或论文若有更新,以更新后为准。
0.6 如何报告本条目错误
发现本条目与一手资料不符时,按以下顺序处置:先确认自己看的是本条目最新版本;再核对坑点清单(§10)——八个已知口径问题都已存照,若你发现的是新问题,它就是有价值的反馈;最后通过库内条目维护流程提交(附一手出处链接)。特别欢迎对 D 级内容(工程建议类)的实践反馈——它们最依赖社区经验校准。
§1 数据集速览:十问十答
Q1:BBBC051 到底是什么?
Broad Bioimage Benchmark Collection(BBBC,Ljosa & Carpenter et al., Nature Methods 2012)的第 051 号图像集,官方页标题 Human kidney cortex cells:3 例人体肾皮质组织的 DAPI 单通道共聚焦荧光显微图像(z-stack 体积、最大强度投影、单层切片三形态),附 8 类细胞类型的 ground truth,定位任务为表型分类(phenotype classification)。BBBC 系列以"冻结即发布"著称:每个编号对应一个稳定的图像集合与明确的推荐任务,BBBC051 在总表中归入 Phenotype classification 分节。它不是合成数据、不是类器官(坑点 1),也不是乳腺癌数据(坑点 2)。
Q2:图像从哪来?
3 例 deceased donor nephrectomy(遗体捐献供体肾切除术)标本的肾皮质组织,切成 50 μm 厚切片——远厚于常规 3-5 μm 病理切片,为的是保留完整的三维核结构。Leica SP8 共聚焦显微镜整片 tile-scan 采集(硬件参数由兄弟论文 Ferkowicz et al., Lab Invest 2021 披露,见坑点 6),405 nm 激发 DAPI。供体的临床与人口学背景未随数据集公开——这是使用时需自知的数据边界(rai:dataLimitations 已存照)。
Q3:三种图像形态是什么关系?
同一批 z-stack 的三种导出:volumes(完整 3D 体积)、projections(沿 z 轴最大强度投影后的 2D 图)、slices(单层 2D 切片)。三形态服务于不同实验设计——3D 网络吃 volumes,2D 网络吃 projections 或 slices;论文证明 3D 输入的分类效果更好(§4.1),所以三形态的并存本身就是一组"内置消融实验"。选哪种形态取决于你的研究问题:做 3D 形态学选 volumes,做轻量 2D 基线选 projections,做极端信息下限测试选 slices。
Q4:8 类细胞是哪些?
集合管/连接小管(Collecting Duct/Connecting Tubule)、远曲小管(Distal Convoluted Tubule)、肾小球内皮细胞(Glomerular endothelial cells)、间质内皮细胞(Interstitial endothelial cells)、白细胞(Leukocytes)、足细胞(Podocytes)、近端小管节段(Proximal Tubule Segments)、髓袢升支粗段(Thick Ascending Limb)。BBBC 官方网页未逐条列出类名,类名经论文 SI Table S1 定义、并由 MedMNIST info.py 完整存档互证(坑点 5);每类的解剖学位置与形态学预期见 §2.5 的逐类小传。
Q5:标签是怎么打的?
半自动:VTEA tissue cytometry 流水线先用 LS Connect3D 分割细胞核,再依据三组多重标记实验(DAPI+CD45+CD31+Nestin / DAPI+AQP1+LRP2+THP / DAPI+SLC12A3+KRT8)的荧光强度做 X-means 无监督聚类打簇标签,经空间位置与形态验证、专家把关后定稿。约 230,000 个细胞获得 8 类标签,导出为 NephNuc 系列训练集(5 种形态,§2.6)。理解"簇级半自动金标准"这个性质,是用好标签的前提(§3.3)。
Q6:规模到底多大?
三个口径并存、各有出处(坑点 3):BBBC 总表在 Phenotype classification 分节计 690,000 images(细胞数口径);论文摘要称 ~230,000 cells 完成八类分类(NephNuc 训练库口径);衍生 TissueMNIST 为 236,386 样本(MedMNIST 切分后口径,165,466/23,640/47,280 对应 7:1:2)。三个数字都是"对的",只是统计边界不同——引用时按用途选口径并注明来源,千万不要混用(例如把 236,386 说成"原始图像数"就是口径错配)。
Q7:官方推荐的任务和指标是什么?
用 DAPI 单通道图像预测 8 类细胞类型,评价指标为 balanced accuracy(平衡准确率,对类别不平衡稳健——肾皮质中近端小管上皮占大头,足细胞、白细胞稀少,普通 accuracy 会被多数类淹没)。ground truth 按 3 个 tissue samples 组织,天然支持留一法式的跨样本泛化实验(§5.5 的评测协议建议)。
Q8:目前最好的成绩是多少?
论文自报:NephNet3D(3D 核体积输入)balanced accuracy 80.26%;经典机器学习最优为 Random Forest(Haralick+PFTAS 特征)42.20%,SVM 41.54%;方向性结论为 3D 优于 2D、with context 优于 without context。第三方在 TissueMNIST 上的成绩属于 28×28 轻量口径,与 3D 原始口径不可直接比较(§4.5、§7.1)。
Q9:怎么获取、什么许可?
官方直链 Images.zip(2.9 GB)+ groundtruthlabels.txt,无需注册、无请求制;图像与 ground truth 均为 CC BY 3.0 Unported(允许商用),持有人 Andre Woloshuk。官方推荐引用语:‘We used image set BBBC051, available from the Broad Bioimage Benchmark Collection [Ljosa et al., Nature Methods, 2012].’(§6 全展开)
Q10:它和 TissueMNIST 什么关系?
TissueMNIST 是 MedMNIST v2 从 BBBC051 加工出的轻量衍生:取体积做 z 轴 7 层 32×32 裁剪,最大强度投影到 28×28×1,沿用 8 类标签,切成 165,466/23,640/47,280(7:1:2),MD5 ebe78ee8b05294063de985d821c1c34b,Zenodo record 5208230 分发。加工链路的逐步拆解见 §7.1——注意 MIP 压缩恰好丢掉了论文证明最有判别力的 z 轴 3D 信息。研究 3D 原始口径回本条目,研究轻量 benchmark 口径去 medmnist 条目(§7、§9)。
1.1 目标读者与使用地图
| 你是 | 最短路径 | 你会拿到什么 |
|---|---|---|
| 想立即下载使用的工程师 | §6.1 → §6.6 → §2.7 | 直链、下载后自查清单、完整性核对步骤 |
| 关心标注质量的方法学审稿人 | §3 全章 → §3.5 → 存照③ | 半自动标签的生产方式、失败模式审计清单、口径边界 |
| 复现论文基准的算法研究员 | §5 全章 → §5.5 | 基准数字总表、指标口径、五变量评测协议 |
| 设计新标注流水线的团队负责人 | §3.2 → §3.3 → §3.6 → §8 | 四步流水线、成本经济学、复现指引、五条可迁移经验 |
| 做 TissueMNIST 相关 benchmark 的用户 | §7.1 → §7.2 → §4.5 | 加工链路四步拆解、口径差异警示 |
| 做许可合规/数据治理的专员 | §6.2 → §6.3 → §6.8 | 许可条款、官方引用模板、四场景合规操作 |
| 图书馆员/数据管理员(元数据入库) | INFOBOX → 事实清单 → 附录 C | 结构化速览、硬数字-来源对照、口径裁定汇总 |
| 检索中踩到讹误描述的普通读者 | §0.4 → §10 | 三个最常见的讹误口径与实核(坑点 1-3) |
| 教学设计者(数据集工程课程) | §0 → §8 → §10 → 附录 G | 案例叙事、五条经验、坑点练习、证据分级方法 |
| 综述作者 | 事实清单 → §7.4 → 附录 B | 数字口径、谱系引用、完整文献列表 |
1.2 十问速查表
| 问 | 答案浓缩 |
|---|---|
| Q1 是什么 | BBBC 第 051 号:3 例人肾皮质 DAPI 单通道图像 + 8 类标签,任务为表型分类 |
| Q2 图像来源 | deceased donor nephrectomy 标本,50 μm 切片,Leica SP8 共聚焦(参数归属兄弟论文) |
| Q3 三形态 | volumes(3D)/ projections(MIP)/ slices(单层),同一 z-stack 的三种导出 |
| Q4 八类 | 集合管/连接小管、远曲小管、肾小球内皮、间质内皮、白细胞、足细胞、近端小管节段、髓袢升支 |
| Q5 标注方式 | VTEA 半自动:Connect3D 分割 + X-means 聚类 + 专家验证 |
| Q6 规模 | 690,000(BBBC 总表)/ ~230,000(论文)/ 236,386(TissueMNIST),三口径并存 |
| Q7 任务与指标 | DAPI → 8 类,balanced accuracy |
| Q8 最优成绩 | NephNet3D 80.26%(3D);RF 42.20% 为经典特征锚点 |
| Q9 获取与许可 | 官方直链无注册;CC BY 3.0 允许商用 |
| Q10 TissueMNIST 关系 | 轻量衍生母体;MIP 压缩丢 3D 信息,两口径不可互推 |
1.3 按主题的 FAQ 索引
文末 FAQ 共 28 问,按主题分组:
| 主题 | 覆盖问题 |
|---|---|
| 数据性质 | 是不是合成数据、是不是 H&E、8 类是什么、为什么单通道 |
| 规模口径 | 细胞总数、三口径分辨、样本量核对 |
| 获取与许可 | 注册、商用、引用模板、衍生发布、原始文件 |
| 基准与指标 | 80.26% 口径、为什么用 balanced accuracy、类别不平衡 |
| 标注方法 | 流水线复现、标签可靠性质疑、半自动 vs 全人工 |
| 口径互通 | 与 TissueMNIST 的换算边界、跨口径训练-测试、后续版本 |
§2 数据构成:三形态图像与八类标签的完整盘点
2.1 官方分发包结构
BBBC051 的全部分发物只有两个文件,均从官方页直链获取、无需注册:
| 文件 | 大小/格式 | 内容 |
|---|---|---|
| Images.zip | 2.9 GB,TIFF 图像包 | 全部 DAPI 荧光图像,按 3 个 tissue samples 分目录组织 |
| groundtruthlabels.txt | 纯文本标签 | 细胞核与 8 类标签的对应关系 |
官方页明确数据按 3 个 tissue samples 分目录,这一组织方式天然支持"跨样本泛化"实验设计——以两个样本训练、在第三个样本上测试,检验模型对供体间差异的鲁棒性。ground truth 标签同样按样本组织,与图像目录一一对应。与许多"一锅烩"式的图像集相比,这种按组织来源分目录的结构是 BBBC051 对严谨评测的隐性支持:样本内随机划分会因相邻核高度相似而高估性能,跨目录划分才是论文结论的可信复现方式(§5.5)。
两个文件、三个目录、八类标签——BBBC051 的全部复杂性都藏在"结构简单"的表象之下:图像是什么(三形态,§2.3)、标签哪来的(三组标记实验,§2.4)、类型有哪些(八类定义,§2.5)、训练库长什么样(NephNuc 五形态,§2.6)。以下四节逐一拆开。
2.2 标本来源与采集
- 组织来源:3 例 deceased donor nephrectomy(遗体捐献供体肾切除术)标本的肾皮质组织。注意这是真实人体组织,而非类器官或合成数据(坑点 1);供体的人口学与临床背景未随数据集公开。
- 切片厚度:50 μm——远厚于常规 3-5 μm 病理切片,保留完整的三维核结构,这是 3D 分类可行性的物理前提。厚切片也意味着共聚焦的光学切层能力(排除焦外信号)成为成像质量的必要条件。
- 采集硬件:Leica SP8 共聚焦显微镜,HC PL APO 20×/0.75 IMM 油镜(折射率 1.51),405 nm 激发 DAPI,整片 tile-scan 过夜采集 10-14 小时/片,单卷 .lif 文件 40-50 GB。注意:这些硬件参数并非 BBBC051 论文正文披露,而是同团队的兄弟论文 Ferkowicz et al., Lab Invest 2021(doi:10.1038/s41374-020-00518-w)描述的完整 3D tissue cytometry 管线细节——引用时须注明归属(坑点 6)。
- 采集节奏的含义:过夜 10-14 小时/片的采集速度说明这是"以时间为代价换完整三维信息"的成像——每片组织一次只能做一种标记组合的扫描,这也是三组标记实验需要分组连续切片的技术根源。
- 官方披露程度:官方页对数据生成细节仅有一句 “Additional details on generation is the subject of an upcoming publication”——截至本条目复核日(2026-09-29),该"即将出版的出版物"对应关系未在官方页落实,采集与质控细节依赖论文与兄弟论文拼合(§10 坑点 8)。
2.3 三种图像形态
同一批共聚焦 z-stack 以三种形态导出,服务于不同网络架构与实验设计:
| 形态 | 内容 | 适用场景 |
|---|---|---|
| volumes | 完整 3D 体积(z-stack) | NephNet3D 等 3D 网络输入;保留核的三维形态指纹 |
| projections | 沿 z 轴最大强度投影(MIP)后的 2D 图 | 2D 网络输入;压缩深度信息换取处理速度 |
| slices | 单层 2D 切片 | 2D 网络输入;丢弃焦外信息,信息量最少的口径 |
三形态的并存本身就是论文核心论点的实验设计:同样一批细胞核,3D 输入比 2D 输入分类效果更好(§5),说明 z 轴形态信息(核的立体形状、沿深度的强度分布)携带类型判别力,投影或切片会损失这部分信息。MIP 的取舍值得展开:最大强度投影保留的是 z 轴上"最亮"的像素,对 DAPI 这类核染色而言大体等价于"取核最致密的焦平面",因此投影图保留了核的平面轮廓与染色强度,但完全丢失核的立体形状与沿深度的纹理变化——后者恰是 spherical harmonics 特征(§5.2)在 3D 口径下能捕捉、投影后无法捕捉的部分。
从存储与算力视角看三形态:volumes 的体积约为 projections 的 z 倍量级,projections 又与 slices 同级;一次下载获得三种形态,意味着用户可以按"先 2D 立项、后 3D 深化"的节奏渐进投入,而不必为试点阶段预付全量 3D 处理成本——这也是 BBBC 分发设计里对下游友好的细节。
2.4 三组多重标记实验(标签的物理来源)
ground truth 的标签并非凭空而来,而是来自对 3 例标本(每例三套抗体组)的三组多重标记实验。每组均以 DAPI 为核染色,叠加不同细胞类型的标记抗体:
| 组别 | 标记组合 | 圈定的细胞类型 |
|---|---|---|
| ① | DAPI + CD45 + CD31 + Nestin | 白细胞(CD45)、内皮细胞(CD31)、足细胞/基膜(Nestin) |
| ② | DAPI + AQP1 + LRP2 + THP/uromodulin | 近端小管(AQP1、LRP2)、髓袢升支(THP/uromodulin) |
| ③ | DAPI + SLC12A3/NCC + KRT8 | 远曲小管(NCC)、集合管/上皮(KRT8) |
理解这张表就理解了 BBBC051 的方法学本质:多标记实验只用于"生产标签",最终分发的图像只有 DAPI 通道。这是"蒸馏式标注"——把昂贵的多重标记信息蒸馏为标签,再让模型学习仅凭核染色复现该标签。8 类中的"肾小球内皮 vs 间质内皮"依赖空间位置(肾小球内 vs 间质)区分,"近端小管节段"则依赖核在管状结构中的排布——这也是 with context 版本输入存在的原因(§3.4)。
分组设计的逻辑也清晰可读:组①圈定"游离细胞"(白细胞、内皮、足细胞),组②圈定"近端小管系"(AQP1/LRP2 双阳性的近端小管与 THP 阳性的升支粗段),组③圈定"远端小管系与集合管"(NCC 阳性的远曲小管与 KRT8 阳性的集合管上皮)。三组合起来正好覆盖 8 类的判定所需的标志物证据。
2.5 八类细胞类型定义表与逐类小传
8 类类名在 BBBC 官方网页未逐条列出;论文 SI Table S1 给出定义,MedMNIST 官方代码库 info.py 将其完整存档(本条目 2026-09-29 复核直接证实),两源一致。中文名按标准肾解剖学译法:
| 标签 | 英文类名 | 中文 | 解剖学位置 |
|---|---|---|---|
| 0 | Collecting Duct / Connecting Tubule | 集合管 / 连接小管 | 皮质集合管系统 |
| 1 | Distal Convoluted Tubule | 远曲小管 | 肾单位远端 |
| 2 | Glomerular endothelial cells | 肾小球内皮细胞 | 肾小球毛细血管内 |
| 3 | Interstitial endothelial cells | 间质内皮细胞 | 肾间质毛细血管 |
| 4 | Leukocytes | 白细胞 | 间质浸润/巡游 |
| 5 | Podocytes | 足细胞 | 肾小球包曼囊 |
| 6 | Proximal Tubule Segments | 近端小管节段 | 肾单位近端 |
| 7 | Thick Ascending Limb | 髓袢升支粗段 | 髓放线/髓质外带 |
逐类小传(形态学预期基于标准肾组织学通识,供误差分析时对照):
- 集合管/连接小管:集合管由主细胞与闰细胞构成,连接小管是远曲小管向集合管的过渡段;在皮质中走行较直、管腔较大,核圆形、大小均匀、排列相对疏松。KRT8 阳性是其在组③实验中的判定证据。
- 远曲小管:NCC(噻嗪类利尿剂敏感的钠氯共转运体)特异性标记;管壁相对薄、管腔清晰,核排列较近端小管疏松,细胞界限更分明。
- 肾小球内皮细胞:肾小球毛细血管丛内的 fenestrated 内皮;核小而扁,被限制在肾小球结构内部——"位于肾小球内"这一空间属性是其与间质内皮的核心区分,也是 with context 输入的价值所在。
- 间质内皮细胞:管周毛细血管与直小血管的内皮,CD31 阳性;核同样小而扁,但散布于肾间质、伴随小管走行,与肾小球无空间关联。
- 白细胞:CD45 阳性的免疫细胞,核小、圆形、染色质致密(DAPI 染色深)、胞质极少;在正常皮质中散在分布、丰度低——天然的少数类,balanced accuracy 指标选择的直接原因之一。
- 足细胞:位于包曼囊内侧、覆盖肾小球毛细血管丛外侧面的脏层上皮细胞;Nestin 阳性;核相对较大、染色质疏松,位置特殊(贴着肾小球但不在血管腔内),是 8 类中形态学与空间属性都最特殊的一类。
- 近端小管节段:AQP1/LRP2 双阳性;皮质中丰度最高的细胞类型,核大而圆、染色质常驻、密集排列成管状结构——天然的多数类。
- 髓袢升支粗段:THP/uromodulin 特异性标记;上皮核介于近端与远端小管之间,沿髓放线分布。
类别构成覆盖了肾皮质的四大功能系统:小管上皮(0、1、6、7)、肾小球(2、5)、间质血管(3)、免疫细胞(4)。文献另有"11 类压缩为 8 类"的第三方转述(Sci Rep 2026, s41598-026-55088-6),此说法与 BBBC/MedMNIST 两边的官方口径均无法核对,本条目仅存照不采信(§10 坑点 8)。
八类的区分难度分层(按 §2.5 小传推导,供误差分析预期):
| 难度层 | 类对 | 区分依据 |
|---|---|---|
| 易 | 小管上皮 vs 内皮/白细胞 | 核大小、染色质密度差异显著 |
| 易 | 足细胞 vs 多数类 | 位置特殊(肾小球外缘)+ 核大疏松 |
| 中 | 集合管 vs 远曲小管 | 同为远端小管系上皮,靠 KRT8/NCC 标记与管腔形态 |
| 中 | 近端小管 vs 髓袢升支 | 核形态与排布有差异但同属管状上皮 |
| 难 | 肾小球内皮 vs 间质内皮 | 核形态几乎相同,区分几乎全靠空间语境(with context 增益的主要去向) |
这个分层直接预测了混淆矩阵的形态:最重的混淆块应落在"难"层,"中"层次之——若实验中观察到相反模式,优先怀疑数据加载或标签对齐有 bug,而不是模型能力。
2.6 NephNuc 训练集:五种导出形态
论文将标注好的细胞核(含周边上下文与否、3D 或 2D)导出为五种训练库形态,统称 NephNuc:
| 导出形态 | 输入维度 | 是否含上下文 |
|---|---|---|
| NephNuc3D | 3D 核体积 | 否 |
| NephNuc3D with context | 3D 核体积 + 周边环境 | 是 |
| NephNuc2D_Projection | 2D(MIP 投影) | 否 |
| NephNuc2D_Projection with context | 2D(MIP 投影)+ 上下文 | 是 |
| NephNuc2D | 2D(单层切片) | 否 |
with context 指在细胞核本体之外附带周边像素/体素——邻居核的排布、管腔的位置等空间语境。"with context 优于 without"的消融结论(§5)说明:一部分细胞类型的判别力不在核本身,而在核所处的组织学语境。五种形态与三组标记实验、8 类标签共同构成完整的监督信号链:图像(DAPI)+ 标签(8 类)+ 判定证据(三组标记)全部可追溯。
2.7 下载后的完整性核对清单
从官方直链获取数据后,建议按以下顺序核对(各条均基于官方页描述的既定结构):
- 压缩包完整性:Images.zip 约 2.9 GB——若下载体积显著偏离,优先怀疑传输中断而非版本变化(BBBC051 未见 v2,§6.5)。
- 目录结构:解压后应看到按 3 个 tissue samples 组织的目录;若只有单一平铺目录,说明拿到的不是 BBBC051 官方分发(警惕聚合站二次打包)。
- 标签文件:groundtruthlabels.txt 为纯文本;核对应关系按样本组织。加载后统计标签分布:8 类均应非空,且近端小管类应占大头(肾皮质细胞丰度的自然分布)。
- 图像模态:抽查若干文件确认单通道(DAPI);若发现多通道图像或 RGB 合成图,同样说明来源有问题。
- 形态齐备:volumes / projections / slices 三形态文件均应在包内;缺形态时先检查子目录再怀疑下载完整性。
2.8 使用场景适配表
不同研究问题应取不同的数据子集与口径:
| 研究场景 | 建议取用 | 理由 |
|---|---|---|
| 3D 细胞核分类(复现论文主线) | volumes + NephNuc3D 口径标签 | 与 NephNet3D 80.26% 同口径,可直接对标 |
| 2D 轻量基线 | projections(或 TissueMNIST) | 与 RF 2D 口径对标;轻量场景直接用 TissueMNIST |
| 空间/邻域建模(cell graph、neighborhood analysis) | volumes + with context 输入设计 | 语境特征是论文证明的增益来源(§4.1) |
| 跨供体泛化研究 | 按 tissue sample 目录做 leave-one-out 划分 | 3 例供体是唯一的天然划分单位 |
| 免标记分类范式验证 | 全部图像 + 自选分类器 | 数据集的方法学卖点本身就是任务 |
| 弱监督/半监督方法研究 | 全量图像 + 部分标签 | 标签覆盖 ~23 万细胞,图像中未标注核可用作无监督素材 |
| 多通道/共定位研究 | 不适用 | 仅 DAPI 单通道,无第二通道可做共定位 |
2.9 数据边界与不适用场景
除上表的"多通道不适用"外,使用前还应知晓以下边界(均为事实性边界,非数据缺陷):
- 无临床配对信息:供体的人口学、临床诊断、肾功能指标均未随数据集公开——不能做"基因型/临床表现 vs 细胞组成"类关联研究。
- 正常组织口径:标本为供体肾的肾皮质,非病变组织;做疾病模型(如糖尿病肾病、纤维化)外推时须自行验证适用性。
- 无时序/活细胞维度:静态固定组织的终末图像,不适合活细胞动力学研究。
- 供体数 = 3:供体层面的统计功效有限——任何"供体间差异"的结论都只有 3 个观测单位,做人群层面推断是不当使用。
- 单采样区域口径:每例组织的取材区域与面积以官方/论文描述为准,官方页未详述取材异质性控制(坑点 8 的生成细节真空在此处也有影响)。
这些边界不削弱 BBBC051 在"方法学验证"场景的价值,但把"肾皮质细胞分型基准"误用为"肾疾病队列"或"人群代表性样本"是检索中最常见的过度外推——引用时把"3 例供体的方法学基准"说全,可以避免九成误用。
边界的正确引用模板(两句版,可直接套用):“BBBC051 是基于 3 例遗体捐献供体肾切除术标本、约 23 万个经半自动流水线标注为 8 类的肾皮质细胞核的 DAPI 单通道荧光显微图像集(Woloshuk et al., Cytometry Part A 2021),定位为原位细胞分型的方法学基准。”;“其规模与许可口径为:BBBC 总表计 690,000 幅细胞图像,图像与标注以 CC BY 3.0(允许商用)经官方直链分发。”——两句合用,数据性质、规模口径、许可状态全部落位。
2.10 图像加载与处理的工程注意
以下为处理 3D 荧光显微 TIFF 数据的通识性工程建议(具体规格以包内文件实际为准):
-
读取库:Python 生态用 tifffile(支持 ImageJ/Zeiss 系 TIFF 与内存映射);3D 数据建议先以"懒加载"方式检查维度顺序,确认 z 轴位置后再进入训练管线。
-
维度顺序:不同导出形态的维度语义不同——volumes 是 zyx(或 tzyx),projections/slices 是 yx(或 cyx);混用而不检查维度是 3D 管线最常见的低级错误来源。
-
动态范围:荧光图像的位深与强度分布因采集增益而异;跨样本比较强度前先检查各样本的直方图,必要时做每样本归一化(注意:归一化策略会改变强度特征的物理含义,与论文的经典特征口径对照时须保持一致)。
-
内存预算:2.9 GB 压缩包解压后的 TIFF 总量会显著放大(TIFF 无损压缩比通常有限),加上训练时的 batch 复制与增强副本,建议按"解压体积 × 3-5"预估内存/磁盘需求;逐样本流式读取优于全量驻留。
-
标签对齐:ground truth 以核对象为单位,训练前需完成"核对象 → 图像裁块"的坐标关联;建议一次性把 NephNuc 五种形态的裁块预生成落盘,避免训练循环内重复做 3D 邻域取窗。
-
随机性与可复现:裁块、增强、划分的随机种子与日志建议随实验存档——本数据集的跨样本口径(§5.5)对划分方式敏感,可复现性要求比一般 2D 分类更高。
-
格式转换:若训练管线偏好 HDF5/zarr(支持分块读取与并行),建议一次性转换后以 MD5/SHA 存档转换产物——二次分发转换格式时须保留原始 TIFF 可回溯性(§6.8 再分发义务同样适用于转换产物),并在文档中写明转换时的维度重排与压缩选项,避免下游"转换即失真"的隐形成本。
-
最小加载示意(伪代码,占位符需按包内实际结构替换):
# 依赖: tifffile, numpy
import tifffile, numpy as np
# volumes: 确认维度顺序后再进入管线
vol = tifffile.imread("<tissue_sample_dir>/<volume>.tif") # 预期 (Z, Y, X) 或含通道维
assert vol.ndim >= 3, "unexpected dims -- check axis order first"
# projections / slices: 2D 路径
img2d = tifffile.imread("<tissue_sample_dir>/<projection>.tif")
# 标签: 按官方 groundtruthlabels.txt 的实际格式解析(先看文件头与分隔符)
# labels = parse_groundtruth("<path>/groundtruthlabels.txt")
示意代码只固定"先查维度、再写管线"的顺序,不预设任何未存档的文件名与格式细节(§附录 J 同口径)。
常见格式陷阱三则:其一,TIFF 页序即 z 序的假设并不总成立——部分导出器把 z 轴写成多页 TIFF,部分写成单页多通道,读取后先验证体积的各向异性比例再继续;其二,16 位强度直接除 255 转 8 位会截断高值——动态范围压缩应先查实际最大值再定映射;其三,标签文件与图像的核编号对齐依赖官方说明——任何"看起来对齐了"的假设都要用 §2.7 的分布核对来验证。
3.9 标签质量抽验的最小方案
对"簇级半自动金标准"建立信心,不需要全量人工重标,一个最小抽验方案即可:
- 抽样:按 8 类分层,每类抽 30-50 个核(稀少类如白细胞可全查),共 200-500 个。
- 双盲精标:两名熟悉肾组织学的人员仅看 DAPI 图像独立分类(不告知聚类标签)——这一步顺便检验"单染色人眼可分性",与论文的机器可分性形成人机对照。
- 一致性计算:算两位标注者的一致率与 kappa;再分别与聚类标签比对。
- 结论解读:人工-聚类一致率 ≈ 人工-人工一致率 → 簇标签质量达到人工水平;显著低于 → 按簇定位系统性分歧,反馈到 §3.5 的审计。
- 存档:抽验结果随实验记录保存——任何下游用户问起"这标签多可靠",你有一手答案而不是转述。
这个方案的全部成本是数百个核的双盲判读(数十小时级),换来的是对 23 万标签的量化信心——性价比远高于"全信"或"全疑"两个极端。
§3 注释流水线:VTEA tissue cytometry 如何炼成 23 万个标签
3.1 VTEA 是什么
VTEA(Volumetric Tissue Exploration and Analysis)是同团队(Winfree、El-Achkar 等)于 2017 年发表的 3D 组织定量分析平台(Winfree S, et al. J Am Soc Nephrol. 2017;28(7):2108-2118, doi:10.1681/ASN.2016091027, PMID 28154201;开源代码 GitHub icbm-iupui/volumetric-tissue-exploration-analysis)。它的定位是 3D 版的 tissue cytometry——像流式细胞仪对细胞悬液做逐细胞定量那样,对厚组织切片的 3D 共聚焦图像做逐细胞核的分割、特征提取与分群。2021 年团队又在 Lab Invest 发表了集成机器学习的完整 3D 管线(Ferkowicz et al.),并有 VTEA 扩展版预印本(bioRxiv 2021.12.27.474025,集成 ML + neighborhood analysis)。BBBC051 的标注流水线是这一方法谱系在"标签生产"场景下的应用。
tissue cytometry 这个词值得多说一句:它是流式细胞术(flow cytometry)思想在组织原位语境的移植——流式对悬液中的细胞按荧光强度分门别类,tissue cytometry 对组织图像中的细胞做同样的事,但额外保留了每个细胞的空间坐标。空间信息的加入使"细胞是什么"与"细胞在哪里"可以同时回答,这正是组①-③实验中"肾小球内皮 vs 间质内皮"这类依赖位置的类别能够成立的前提。
两种"细胞计量"的对照:
| 维度 | flow cytometry(流式) | tissue cytometry(组织计量,VTEA) |
|---|---|---|
| 输入 | 细胞悬液(解离后的单个细胞) | 原位组织 3D 图像(细胞仍在组织中) |
| 信号 | 逐细胞荧光强度 | 逐核荧光强度 + 3D 形态 + 空间坐标 |
| 空间信息 | 无(悬液已破坏组织结构) | 完整保留 |
| 通量 | 极高(每秒数千事件) | 受成像与分割约束(过夜采集/片) |
| 形态学 | 前向/侧向散射(间接) | 直接成像(核形、染色质可见) |
| 组织语境 | 不可得 | 可得(context 类特征的来源) |
VTEA 的三个能力支柱对应流水线的三个环节:分割(把连续组织切成离散核对象——LS Connect3D)、量化(把图像信号变成数值表——强度与形态特征矩阵)、分群(把数值表变成类别——X-means 聚类)。三支柱各自有替代品(任何 3D 分割器、任何特征提取器、任何聚类器),但三者的接口约定(“核对象 → 特征行 → 簇标签”)是流水线可替换性的来源——VTEA 是这个接口的一个开源实现,而非唯一实现。
3.2 流水线四步
BBBC051 的 8 类标签按以下步骤生产:
- 核分割:LS Connect3D 对 DAPI 通道做 3D 细胞核分割,得到约 23 万个核对象及其 3D 形态参数(体积、表面积、长短轴、球形度等)。分割质量是整条流水线的地基——厚切片中的核密度高、接触多,3D 分割比 2D 更依赖软件的分离能力。
- 多标记强度量化:对每个核提取三组多重标记实验中各抗体通道的荧光强度特征——每个核在"CD45 阳性?CD31 阳性?NCC 阳性?……"的免疫表型空间里有了坐标。强度量化以核对象为聚合单位(核内平均/总强度),将连续荧光值转化为可比的表型读数。
- X-means 无监督聚类:在多标记强度特征空间上运行 X-means(自动确定簇数的 K-means 扩展),把免疫表型相近的核聚成簇;簇标签即"候选细胞类型"。X-means 的选择意图明确:不预设类数,让数据的表型结构自己说话——若组织里存在第 9 种可分辨的表型,聚类会提示出来。
- 验证与定稿:以空间位置(核是否位于肾小球内、是否贴管腔)与核形态做交叉验证,专家把关簇的生物学解释,最终归并为 8 类,写入 groundtruthlabels.txt。
每步的输入-产出对应关系:
| 步骤 | 输入 | 产出物 |
|---|---|---|
| ① 核分割 | DAPI 3D 体积 | ~23 万个核对象(3D 形态参数齐全) |
| ② 强度量化 | 核对象 × 三组标记通道 | 核 × 标志物的强度特征矩阵 |
| ③ X-means 聚类 | 强度特征矩阵 | 簇标签(自动定簇数) |
| ④ 验证定稿 | 簇标签 + 空间位置 + 形态 | 8 类最终标签 → groundtruthlabels.txt |
3.3 为什么是"半自动"而不是全人工
23 万个细胞若逐个人工分类,按每秒 1 个的不间断节奏也要 64 小时以上,且人会疲劳漂移。X-means 聚类把"分类 23 万个点"压缩为"解释十几个簇"——专家只需要看每个簇的标记谱与空间分布,判断它是哪类细胞。这是 tissue cytometry 的核心经济学:机器出候选,人出裁决。代价是标签质量受聚类质量约束:同一簇内的异质性无法完全排除(rai:dataLimitations 已存照),使用标签时应意识到这是"簇级半自动金标准"而非"逐细胞全盲人工金标准"。
与另一类常见方案——专家逐细胞划类——相比,半自动方案的误差结构也不同:人工标注的误差是随机的、逐点独立的;聚类标注的误差是结构化的、成簇出现的(一个簇错,簇内全部细胞跟着错)。这直接影响下游模型的验证设计:交叉验证时应按簇或按样本划分,而不能按细胞随机划分,否则验证集与训练集会共享同源误差,性能被虚高。
顺带一提,"聚类 + 专家裁决"在医学图像数据集谱系中并非孤例思路——凡是"特征空间中天然成团、团与生物学类目有对应"的场景(细胞分型、组织区域划分、病例分层),这个结构都成立。BBBC051 的贡献是把这条路的完整参数(多少标记组、什么聚类算法、多少人工裁决量)以可核查的方式留在了论文里,让后来者不必从零摸索。
把这个思路放回更大的一幅图:医学数据集的标注经济学正在从"全人工"向"模型辅助"演进,本数据集代表的"聚类辅助"是其中无监督的一支;今天的"模型预标 + 人工修正"是监督的一支。两支共享同一个风险——辅助系统的系统误差会被不察觉地写进金标准——也因此共享同一份解药:抽验审计(§3.9 的最小方案)。读懂 BBBC051 的标注经济学,等于读懂了此后十年医学标注流水线的基本矛盾。
3.4 标签到学习任务的"蒸馏"闭环
标注完成后,团队做了一个方向翻转:多标记信息退休,只保留 DAPI 通道图像 + 8 类标签,训练 NephNet2D/NephNet3D 从核染色预测类型。这个闭环的方法学含义是:
- 训练时的监督来自多标记,推理时只依赖 DAPI——新组织切片无需任何抗体标记即可被分类;
- 免除标记耗竭:同一组织在 DAPI 染色后仍可用于下游实验,抗体预算也大幅缩减;
- 可增量复制:遇到第 9 类细胞(如闰细胞、远端直小管)时,只需做一轮针对性多标记实验 + 聚类,扩展标签集,再重训网络。
蒸馏闭环还有一个容易被忽略的推论:标签的上界由标记实验的判别力决定。CD45/CD31/NCC 等标志物自身有表达的边界模糊带(表达强弱连续分布),聚类切在这些模糊带上的簇标签,会把这些不确定性原样传递给下游分类任务。换句话说,80.26% 的 NephNet3D 不只是"模型能力的度量",部分反映的也是"8 类划分本身的固有边界"。
三个常见误设:其一,“蒸馏后多标记数据可以扔了”——不能,它是标签的判定证据,复核标签争议、扩展新类别时都要回到它(虽然它不随本数据集分发,理解其存在是理解标签性质的前提);其二,“DAPI 图像里能直接看到 8 类”——不能,DAPI 视野里只有核,"类型"是监督信号赋予的抽象,可视化工具里看到的颜色是标签不是染色;其三,“80.26% 接近 100% 了,剩余误差是工程问题”——不是,§2.5 的形态近邻类对与 §3.4 的标签固有边界决定了剩余误差有信息论成分,不是堆算力就能消除的。
3.5 流水线的失败模式与审计建议
任何半自动流水线都有典型失败模式,BBBC051 的标签链路也不例外。使用者在做误差分析时,建议优先排查以下四类:
- 边界细胞:表达强度处于两簇模糊带的细胞(如 NCC 弱阳性的过渡段上皮),聚类归属可能摇摆。审计方式:按"到簇中心的距离"排序,抽查距离最近的样本对。
- 分割合并/过分裂:LS Connect3D 在高密度区可能把两个核并成一个(under-segmentation),或在弱染色区把一个核拆成两半(over-segmentation)。前者的标签会"张冠李戴",后者会产生幽灵对象。审计方式:对体积/球形度离群的核对象做人工复看。
- 稀少类型欠聚类:白细胞等低丰度类型可能在聚类中被并入大簇(X-means 对簇大小不均敏感)。审计方式:核对 8 类各自的样本量分布,稀少类的数量级是否与组织学常识一致(正常皮质中白细胞远少于小管上皮)。
- 跨样本批次效应:三例标本的染色强度、成像批次若有系统差异,聚类可能在"样本维度"而非"类型维度"上切分。审计方式:分样本查看各类别的标记谱是否一致。
VTEA 开源意味着这些审计都是可执行的——这不是假设性的风险清单,而是复现者应当完成的尽调步骤。
3.6 复现指引
把这条流水线复用到自己的组织成像数据上,需要的组件与顺序:
- 成像:50 μm 级厚切片 + 共聚焦 z-stack(参考 Leica SP8 配置,坑点 6 归属口径);若做多标记定标,按目标类型设计抗体组(每例多组、分组连续切片)。
- 分割:LS Connect3D(或任何 3D 核分割方案,如 Cellpose 的 3D 模式——注意这已偏离原流水线,需自行验证一致性)。
- 聚类定标:X-means(或 HDBSCAN 等可变簇数方案)在标记强度空间上聚类;专家逐簇解释并定类。
- 学习闭环:保留目标输入通道(原论文为 DAPI)+ 簇标签,训练分类网络;按 §5.5 的协议评测。
- 代码底座:VTEA 开源库(icbm-iupui/volumetric-tissue-exploration-analysis)提供 3D 分析的参考实现;扩展版思路见 bioRxiv 2021.12.27.474025。
复现的最小里程碑:把流水线在自己数据上跑通,建议按四个里程碑验收——M1 分割:随机抽 20 个视野,核分割的查全/查准双人目检通过;M2 量化:特征矩阵生成,每核一行、无空值、数值范围合理;M3 聚类:簇数在生物学预期量级(不要求等于目标类数),每簇能被专家用一句话解释;M4 闭环:单通道分类器的 balanced accuracy 显著高于随机基线且接近标注簇的纯度上限。四个里程碑都过,才谈得上"复现成功";跳过任何一步的"跑通"都只是管道联通而非质量确认。
3.7 半自动 vs 全人工标注的权衡对照
| 维度 | VTEA 半自动(BBBC051 采用) | 逐细胞全人工 |
|---|---|---|
| 通量 | 23 万级可行 | 每秒 1 个也要 64 小时起 |
| 专家时间 | 解释十几个簇 | 逐细胞判读 |
| 误差结构 | 结构化、成簇出现 | 随机、逐点独立 |
| 一致性 | 簇内标准统一 | 人内/人间漂移 |
| 可扩展性 | 加类型 = 加一轮标记+聚类 | 加类型 = 全量重标 |
| 验证设计要求 | 按簇/按样本划分 | 常规随机划分即可 |
| 簇内异质性 | 无法完全排除 | 不适用 |
| 适用规模 | 大规模、类型数中等 | 小规模精标、金标准子集 |
这张表解释了 BBBC051 的一个根本性质:它不可能通过扩人力变成全人工金标——23 万细胞的全人工分类即使可行,也会失去"与聚类口径一致"的性质。正确的用法是把全人工精标当作"审计子集":抽几百个细胞做双盲精标,量化半自动标签的簇级准确率,再决定下游任务对标签误差的容忍度。这是任何使用半自动标注数据集(在医学图像领域相当常见)的团队都值得建立的惯例。
3.8 VTEA 流水线在团队方法谱系中的位置
把 BBBC051 放回团队 2017-2021 的方法演化时间线,能看清它的"承上启下"角色:
- 2017(JASN):VTEA 平台奠基。 Winfree 等发布 3D tissue cytometry 平台,解决"厚切片共聚焦图像的逐细胞定量"的工程问题——分割、特征、分群的工具箱成型。
- 2020-2021(Cytometry Part A,本条目主文献):用平台生产公开基准。 平台第一次以"标签生产线"的身份运转,产出 BBBC051——从方法验证到公开基准的跃迁,同时回答了"DAPI 单染色可分性"的科学问题。
- 2021(Lab Invest):管线完整化。 Ferkowicz 等把完整 3D 管线(含成像硬件细节,坑点 6 的归属源)正式发表,补齐了从采集到分析的端到端描述。
- 2021(bioRxiv):扩展版。 VTEA 集成机器学习与 neighborhood analysis,把"邻居是谁"从消融变量升级为一等公民——与 BBBC051 的 with context 结论(§4.1)互相呼应。
这条时间线的启示是:BBBC051 不是孤立的"发布一个数据集",而是方法谱系中"平台成型 → 基准公开 → 管线完整化 → 方法扩展"的中间枢纽。理解这一点,就能理解为什么它的官方页在生成细节上如此简略——细节分散在谱系的其他论文里,官方页的 “upcoming publication” 也应在这个语境下理解(坑点 8)。
§4 比较发现:同一批核,四种口径,差距 38 个百分点
4.1 消融矩阵:2D/3D × context
论文用同一套 8 类标签、同一批细胞核,对输入形态做了系统消融(经典机器学习口径,Random Forest + Haralick 纹理与 PFTAS 特征,balanced accuracy):
| 输入 | without context | with context |
|---|---|---|
| 2D | 36.05% | 38.05% |
| 3D | 38.15% | 42.20% |
两条正交的规律同时成立:3D 输入优于对应 2D 输入(+2.10 / +4.15 个百分点),with context 优于 without context(+2.00 / +4.05 个百分点)。最优组合(3D + context,42.20%)比最差组合(2D no context,36.05%)高出 6.15 个百分点——这还只是经典特征的天花板。SVM 在同一特征族上为 41.54%,与 RF 最优口径相当,说明瓶颈在特征表示而非分类器本身。
这两个维度的增益各有明确的生物学解释。3D 增益来自核的立体指纹:核的三维形状(spherical harmonics 可展开的部分)与沿深度的染色分布,在投影中必然被压缩。context 增益来自组织学语境:肾小球内皮与间质内皮的核本身几乎无法区分,区分它们的是"邻居是谁"——前者被肾小球结构包裹,后者散布于小管之间;管腔的方向性信息同样只能从 context 中获得。换句话说,这两条增益是"数据里确实有这些信息、且这些信息可被利用"的实证,而非工程技巧。
4.2 经典机器学习 vs 深度学习
| 方法 | 输入口径 | balanced accuracy |
|---|---|---|
| Random Forest(Haralick + PFTAS) | 3D + context | 42.20% |
| SVM(同特征族) | 3D + context | 41.54% |
| NephNet3D(自设计网络) | 3D 核体积 | 80.26% |
深度学习与经典特征之间的差距约 38 个百分点——不是渐进改进,而是量级差异。解释在于特征表示:Haralick/PFTAS 是人工设计的纹理与强度统计,只能捕捉显式模式;NephNet3D 直接以 3D 体素为输入,自行学出核形变、染色质分布、核周组织学语境等高维特征。8 类中大量类别差异是"细微形态差异 + 空间排布差异"(如肾小球内皮 vs 间质内皮),恰恰是手工特征最难表达的部分。
基准数字的记忆锚:36 → 38 → 42 → 80。前三个是 RF 消融阶梯(2D 无语境 36.05%、两个"中点"口径 38.05%/38.15%、3D + context 42.20%),最后是 NephNet3D 的 80.26%——记住"三个 4 字头 + 一个 8 字头"的结构,就不会把 80.26% 记成 2D 口径,也不会把 42.20% 当成深度学习成绩。
还有一个容易被读漏的对照价值:SVM 与 RF 在同特征族上只差 0.66 个百分点(41.54% vs 42.20%),而 NephNet3D 与 RF 差 38 个百分点——这意味着特征表示的改进空间(42% → 80%)远大于分类器的改进空间(41.54% → 42.20%)。对任何在"换分类器还是换特征表示"之间犹豫的团队,这个消融结构本身就是答案。
4.3 论文自设网络的两个梯队
深度学习侧,论文报告了自设计的 NephNet2D 与 NephNet3D 两个网络,外加 ResNet-31 finetune 作为迁移学习对照。方向性结论明确:NephNet3D(3D 核体积输入)为全场最优 80.26%,2D 版本低于 3D 版本——与 §4.1 经典特征的消融方向一致,说明"3D 信息有判别价值"这一结论在手工特征与学习特征两种表示下均成立。NephNet2D 与 ResNet-31 的具体数值以论文表格为准,本条目 FACTS 存档未收录、不予转写,对标者请查原文表格引用。
值得注意的方法学细节是"自设计 + finetune 对照"的双轨设计:NephNet 系列针对"单通道小体积"的输入特点设计(DAPI 单通道、核级小尺寸 3D 数据),而 ResNet-31 finetune 检验了 ImageNet 时代的迁移学习范式在这种非自然图像上的表现。这种"定制架构 + 通用架构"的并列报告,让结论不至于被"是不是恰好调好了自己的网络"的质疑稀释。
4.4 在 BBBC 生态内的定位
BBBC 总表把 BBBC051 归入 Phenotype classification(表型分类)分节,同节还有 BBBC018(人 IPF 与正常肺成纤维细胞,Ilastik 训练集)与 BBBC037(人类 iPSC 心肌细胞,多表型)等细胞分类集——这些同类集的横向对比由库内 bbbc 总集条目承担(§9 分工),本条目不重复展开。BBBC051 在该分节中的独特性有三:
- 3D 原生:多数 BBBC 分类集是 2D 图像,BBBC051 的 50 μm 厚切 z-stack 是 3D 分类研究的稀缺供给;
- 单通道极简:只有 DAPI 一个通道,把"信息下限"问题推到极致——这是它的方法学卖点,也意味着它不适合研究多通道共定位;
- 人体组织:BBBC 中人体原位组织的标注集占比很低,多数是细胞培养物;BBBC051 的 8 类直接对应肾组织学教科书分类,可解释性强。
从 BBBC 系列的任务谱系看,Phenotype classification 分节的数据集回答的都是"这批细胞是什么",但 BBBC051 把问题又推进了一层:它问的是"只看染色质与核形,能不能知道这批细胞是什么"——这个问题在其他成员那里要么不成立(多通道数据集直接有标记信息),要么没有 8 类这种组织学深度的标签体系。
进入实验前的三个预期管理:其一,这是"方法学基准"不是"应用系统",80.26% 的主要意义是证明信号存在,不是给出部署就绪的判读器;其二,这是"人体原位组织"不是"细胞培养物",核形态的天然散布远大于对齐培养条件下的细胞系,实验里出现较大的类内方差是数据本性而非管线 bug;其三,这是"3 例供体"不是"大数据",供体间的系统差异会被模型学成捷径,跨样本评测(§5.5)是唯一能暴露它的设计。
4.5 与 TissueMNIST 口径的对照警示
同一母数据在两个口径下的"难度"完全不同:BBBC051 原始口径(3D 核体积、真实分辨率)最优 80.26%;TissueMNIST 口径(28×28×1 的 MIP 压缩图)则是轻量 benchmark——在 TissueMNIST 上刷出的高分不能倒推为"BBBC051 任务已被解决",因为 MIP 投影恰好丢弃了论文证明最有判别力的 z 轴 3D 信息(§7.3、§9)。两个口径各自有用途,但引用时必须注明。
更具体地说,两个口径回答的是两个不同的问题:TissueMNIST 回答"在算力受限、模型轻量的设定下,28×28 的组织小图能分到什么程度"——这服务的是 benchmark 循环与教学场景;BBBC051 原始口径回答"DAPI 单染色在信息上到底够不够"——这服务的是方法学验证。把 TissueMNIST 的高分当作后一问题的答案,是把"压缩后的残余信息"误当成"原始信息量",这是本数据集最常见的一种二手引用错误。
4.6 从 42% 到 80% 的跃迁说明了什么
把 42.20%(经典特征最优)与 80.26%(NephNet3D)并置,这一跃迁在本数据集内可以归因到三个来源,且每个来源都有可检验的对应物:
- 表示学习替代手工特征:手工特征只能表达设计者想到的模式;端到端学习从数据中自行发现判别性模式。对应的检验:给深度模型喂 2D 输入,若仍显著超 RF 2D 口径,则表示学习本身贡献了增益。
- 3D 原生处理:网络直接消费体素,无需先压缩成手工特征。对应的检验:3D 口径的增益在 RF(+4.05,38.15→42.20)与深度模型中方向一致。
- 语境建模的容量:with context 输入给了模型核周空间,卷积网络天然擅长从空间排布中提取结构信息。对应的检验:with context 增益同样跨表示方式成立。
三条证据链都指向同一个方法论结论:当类别差异是"形态+语境"的复合函数时,端到端 3D 学习是当前最匹配的归纳偏置。这个结论对一切"组织原位细胞分型"任务(肺、肝、肿瘤微环境)都有参考价值——BBBC051 的价值不只在肾。
4.7 "单染色可分性"的外推边界
把"DAPI 单染色可分 8 类"外推到其他组织与其他通道设定时,有几条边界值得预先声明:
- 外推较稳的方向:核形态差异大、空间结构强的场景——管状/腺状上皮 vs 间质细胞 vs 免疫细胞这类"大类区分",在其他实体组织(肝小叶、肺泡壁、肠隐窝)中同样有形态学依据,单染色可分性预期成立。
- 外推需谨慎的方向:同谱系、同形态带的细胞亚型(如小管的相邻节段、不同状态的免疫细胞亚群)——它们的差异更多写在分子标志物而非核形态里,单染色的信息上限会先在这些类别上触顶。
- 通道设定的边界:本数据集证明的是"DAPI(DNA 染色)单通道"的可分性,不能直接外推到其他单通道染色(如膜标记、细胞质标记)——染色对象不同,携带的形态信息维度完全不同。
- 病理状态的边界:BBBC051 标签来自正常供体皮质;病变组织(炎症浸润、异型核、坏死)中核形态偏离正常谱系,8 类划分的适用性需要重新验证。
这四条边界的共同逻辑是:可分性 = 信号存在性 × 学习器容量,BBBC051 只证明了前半段在特定设定下的存在性。任何外推都应从"目标场景的信号是否存在"这一步重新开始,而不是从 80.26% 直接推算。
把 §4.1-§4.7 连起来看,本章其实完成了一次"从数字到边界"的完整推导:4.1/4.2 给出数字,4.3 给出数字背后的结构,4.4/4.5 给出数字的坐标系,4.6 提炼数字的方法论含义,4.7 划出数字的适用边界。跳读的读者只需带走一句话:42% 与 80% 都是真的,但它们各自只属于自己那个口径。
§5 Bench:任务定义、指标与基准数字
5.1 任务形式化
输入:单个细胞核的 DAPI 图像(四种口径:3D 核体积 ± context、2D 投影/切片 ± context)。输出:8 类之一(§2.5 类别表)。官方 ground truth 按 3 个 tissue samples 组织,支持跨样本划分实验。核心评价指标为 balanced accuracy(各类别召回率的算术平均)——选择它是因为 8 类在肾皮质中的自然丰度高度不均(近端小管上皮占皮质细胞的大头,足细胞、白细胞稀少),普通 accuracy 会被多数类淹没。
balanced accuracy 的取值也值得校准直觉:8 类随机猜测的期望 balanced accuracy 是 100%/8 ≈ 12.5%(若按各等权类猜测);而"全猜多数类"的策略在普通 accuracy 下可能很好看,在 balanced accuracy 下则会被稀少类的零召回拖到很低。RF 的 42.20% 意味着每类的平均召回在四成上下——对经典特征来说是有判别力但远未解决的水平;NephNet3D 的 80.26% 意味着平均每类能正确抓住八成——对"免标记分型"而言是强证据。
训练骨架示意(通用 PyTorch 风格伪代码,不预设任何 BBBC051 专属超参——超参以论文为准或自行调优):
# 伪代码: 8 类核分类的训练骨架
model = build_backbone(input_dim="3D" or "2D", with_context=False) # 口径自明(§5.5)
loss_fn = torch.nn.CrossEntropyLoss(weight=class_weights) # 类不平衡(§5.1)
opt = torch.optim.AdamW(model.parameters())
for epoch in range(EPOCHS):
for batch in loader: # loader 按 §5.5 协议划分
x, y = batch # y ∈ {0..7}, 类别表见 §2.5
logits = model(x)
loss = loss_fn(logits, y)
loss.backward(); opt.step(); opt.zero_grad()
bal_acc = evaluate(model, val_split) # 各类召回的算术平均
骨架只表达"类加权交叉熵 + balanced accuracy 监控"两个与数据集性质绑定的要点;网络结构、增强策略、学习率均属论文细节或工程自由度,不在本条目转写范围(附录 J)。
5.2 特征族(经典 ML 基线)
论文为经典机器学习基线提取的特征族覆盖五类人工特征:
| 特征族 | 捕捉内容 | 对应的生物学信号 |
|---|---|---|
| pixel intensity statistics | 核内 DAPI 强度分布(均值、方差、分位数等) | 染色质致密度、核大小(总强度) |
| Haralick texture | 灰度共生矩阵纹理(对比度、同质性等) | 染色质纹理粗细(异染色质/常染色质分布) |
| PFTAS | 参数化阈值面积统计(局部强度结构) | 核内亮暗区域的比例与结构 |
| spherical harmonics | 3D 核形状的球谐展开系数 | 核的立体形态指纹(球形度、凹凸、椭偏度) |
| Zernike moments | 2D 形状正交矩 | 投影后核轮廓的形状特征 |
这套特征族在 CellProfiler 生态中是标准配置,可复现性好——任何团队都能用同特征族在自己的数据上重建 36-42% 的基线,作为深度模型的对照锚点。五类特征与 §2.5 的类别小传对照还能看出基线的能力边界:核大小与染色质密度(intensity/texture)能区分"大类核 vs 小扁核"(如近端小管 vs 内皮),但难以区分"两个都小的扁核"(肾小球内皮 vs 间质内皮)——后者需要 context,正是 with context 增益集中在这些类别上的原因。
从历史语境看,这套特征族的选择本身就是一种"社区语言":Haralick、Zernike、PFTAS 在生物图像分析社区有十几年的使用史,报告它们的成绩等于用社区共知的方言说话——审稿人可以立刻校准"42.20% 意味着什么"。深度学习成绩若不配这类公共锚点,就会变成无法对话的孤立数字;BBBC051 论文两套并报的做法,值得一切"新方法 + 旧基准"类论文借鉴。
5.3 基准数字总表(论文自报口径)
| 模型/特征组合 | 输入 | balanced accuracy |
|---|---|---|
| Random Forest | 2D, no context | 36.05% |
| Random Forest | 2D, with context | 38.05% |
| Random Forest | 3D, no context | 38.15% |
| Random Forest | 3D, with context | 42.20% |
| SVM | 3D + context(同特征族) | 41.54% |
| NephNet2D | 2D | 论文表格给出(本条目存档未收录具体值) |
| NephNet3D | 3D 核体积 | 80.26% |
| ResNet-31 finetune | — | 对照口径,见论文表格 |
使用须知:80.26% 意味着约五分之一的细胞仍被误分类,且混淆大概率集中在形态学近邻类别(如两类内皮、小管各节段之间)。把它当作"DAPI 单染色分型的强证据"使用是恰当的;把它当作"可替代病理专家的自动判读"是不恰当的(rai:dataLimitations 已存照)。
读表的三个要点:其一,看行分组——前五行是同一特征族在不同输入口径下的家族内消融,后三行是深度学习梯队,两组之间才有"表示方式"的跨越;其二,看列的对称性——2D/3D 两行成对出现,每对内比较 context 增益、每对间比较维度增益;其三,看缺省值——NephNet2D 与 ResNet-31 的数值本条目未转写(§4.3),表中留白是刻意的信息边界声明,不是遗漏。
此外须记住这个数字的另一半语境:它是论文自报的最优口径,基于半自动生成的标签(§3.3)——标签误差与模型误差在这 80.26% 里是纠缠的。第三方在原始口径上的独立复现(若有)才是对 80.26% 的真正外部校验;目前最广为人知的第三方接触路径反而是 TissueMNIST 轻量口径(§7.1)。
5.4 复现与扩展建议
- 数据划分:官方按 3 个 tissue samples 组织,建议做 leave-one-sample-out 三折泛化,报告跨供体方差——仅做样本内随机划分会高估性能(同一肾小管的相邻核高度相似)。
- 类别不平衡:报告 per-class recall 与混淆矩阵,警惕"近端小管 + 集合管"多数类吸收小类(足细胞、白细胞)的假象。
- 3D 价值验证:任何新模型建议同时报 3D 与 2D-MIP 两个口径——若 3D 增益消失,大概率是模型容量或数据增强的问题而非信息不存在。
- 别与 TissueMNIST 榜单混比:28×28 轻量口径与 3D 原始口径的数字不可互换(§4.5)。
- 标签溯源:做误差分析时按 §3.5 的失败模式清单审计被误分类的样本——先分清"模型错"还是"标签结构性模糊",再下改进结论。
5.5 评测协议建议(面向新基准提交者)
若把 BBBC051 当作新模型的评测场,一套自洽的协议应至少固定以下五个变量:
- 划分方式:跨 tissue sample(推荐,检验供体泛化)或样本内分层随机(仅作参考口径);两者都报告时须分开列表,不得合并平均。
- 输入口径:从 3D±context / 2D±context 中选定并在标题中标明;NephNet3D 80.26% 只与 3D 口径可比。
- 指标:balanced accuracy 为主指标;辅以 per-class recall、混淆矩阵;若报告 macro-F1,须注明与 balanced accuracy 的差异来源(精确率项)。
- 参考锚点:至少纳入 RF 3D+context(42.20%)作为经典特征锚点,报告相对增益。
- 标签边界声明:说明已知标签为簇级半自动口径(§3.3),并对混淆矩阵中"标签模糊带"类别(两类内皮、小管近邻节段)的误差做定性讨论。
固定这五个变量后,不同团队的结果才在同一坐标系里。这五条不是官方法则,而是本条目依据论文实验结构与数据性质给出的工程建议——采用与否由评测者自定,但不声明口径的分数没有可比性这一点没有例外。
协议即元数据:把 §5.5 的五变量声明看作实验元数据的一部分——它们应与随机种子、软件版本一起进入实验记录与论文复现包。若干年后重看一个 BBBC051 实验,"3D with context + leave-one-sample-out + balanced accuracy + RF 锚点 + 标签性质已声明"这行元数据比分数本身更能告诉你这个实验可信到什么程度。数据集会留存几十年,口径声明是让分数在时间中保持可解读的唯一手段。
5.6 常见误读对照表
| 误读 | 实况 | 出处 |
|---|---|---|
| “80.26% 是 accuracy” | 是 balanced accuracy(各类召回等权平均),与 accuracy 不同口径 | §5.1 |
| “690,000 是带标签细胞数” | 带标签细胞 ~230,000(论文口径);690,000 是 BBBC 总表 images 口径 | 坑点 3 |
| “TissueMNIST 上的高分说明 BBBC051 任务已解决” | TissueMNIST 丢了 3D 判别信息,两口径难度不同不可互推 | §4.5、§7.1 |
| “8 类类名来自 BBBC 官方页” | 官方页未列名;类名经论文 SI Table S1 + MedMNIST info.py 存档 | 坑点 5 |
| “BBBC051 是合成/类器官数据” | 真实 deceased donor 人体组织 | 坑点 1 |
| “成像参数是 BBBC051 论文披露的” | 来自 Ferkowicz Lab Invest 2021 | 坑点 6 |
| “标签是专家逐个点的” | 簇级半自动(聚类 + 专家验证),误差成簇结构化 | §3.3 |
| “with context 是数据增强” | 是输入信息量的扩展(核周体素),不是变换增强 | §2.6、§4.1 |
| “80.26% 可以直接临床落地” | 约 1/5 细胞误分类,且标签含半自动误差;是方法学证据非临床工具 | §5.3、rai:dataLimitations |
这张表可作为组会/评审时的"快速纠偏卡"——九条覆盖了本数据集在二手传播中最常见的偏差形态。
4.8 如果只有 2D 管线怎么办
多数团队的现有基建是 2D 分类管线(ResNet/ViT 家族 + 常规增强),改造成 3D 的成本不低。务实的路径有三条,按信息保有量排序:
- 轻量 3D 改造:把 2D 骨干沿 z 轴堆叠成伪 3D(2.5D),或在 patch 级引入 z 向滑动窗口——改动小,能吃到部分 3D 增益;对照锚点是 RF 3D 口径(38.15-42.20%)。
- MIP 2D + 诚实口径:直接用 projections 口径(对照 RF 2D:36.05-38.05%),论文标题写明 2D-MIP 口径;不要把 2D 成绩与 NephNet3D 80.26% 并排比较。
- 走 TissueMNIST 轻量生态:若目标就是轻量 benchmark,直接用 28×28 npz(去 medmnist 条目),与社区榜单可比。
三条路径的共同前提是口径自明:报告成绩时把"输入形态、context 与否、划分方式"三个变量写全——本数据集四种输入口径的数字差从 36% 到 80%,不写口径的分数没有意义(§5.5)。
路径选择速判:有 3D 管线且关心方法学 → 路径一;只有 2D 管线且要发方法论文 → 路径二(诚实口径 + RF 2D 锚点);只是要跑通/教学/刷轻量榜 → 路径三。三者的共同禁忌只有一个:跨口径比较却不声明。
5.7 迁移到自有肾组织数据的注意事项
若目标是以 BBBC051 为起点、在自己的肾组织成像数据上落地分类,按风险从高到低有四条:
- 染色协议差异:DAPI 浓度、孵育时间、切片厚度都会改变强度分布与核形貌表现;先做小规模对照(同切片双协议染色),量化分布偏移。
- 显微镜/物镜差异:分辨率、点扩散函数、通道串扰不同——用本数据集预训练的网络在自采数据上做 fine-tune 比直接推理可靠;差异大时考虑风格迁移或域适应。
- 标签体系差异:若你的分类学更细(如把近端小管分 S1/S2/S3 段)或更粗(合并内皮两类),直接沿用 8 类标签做预训练、按自有分类学做输出头替换是成本最低的迁移结构。
- 标注缺口:自有数据没有多标记实验时,无法复制"蒸馏式标注";可行替代是拿 BBBC051 模型的预测做伪标签 + 人工抽验(注意伪标签的误差继承问题,§3.5 的审计清单同样适用)。
这四条的公共底座是:把 BBBC051 当作"预训练域 + 方法论模板",而不是"可以直接套用的封闭系统"——它的许可(CC BY 3.0)与开源管线(VTEA)也为这种迁移方式提供了完整自由度。
5.8 对审稿人的核查清单
评审使用 BBBC051 的投稿时,建议核查以下五点(对应本条目已梳理的口径):
- 输入口径声明:论文是否写明用的是 3D±context / 2D±context 哪种输入?与 NephNet3D 80.26% 的比较是否同口径(§5.5)?
- 划分方式:是跨 tissue sample 还是样本内随机?跨供体泛化声称是否有 leave-one-sample-out 支撑(§5.4)?
- 指标口径:balanced accuracy 还是 accuracy?是否报告 per-class recall 与混淆矩阵(§5.1)?
- 锚点对照:是否与经典特征基线(RF 3D+context 42.20%)对比,增益幅度是否合理?
- 标签性质声明:作者是否意识到 ground truth 是簇级半自动口径,误差分析是否区分"模型误差"与"标签结构误差"(§3.3、§3.5)?
五点全过的投稿,其结论的可信度有扎实基础;缺任何一点,问题通常出在该点对应的环节——这张清单本质上是把本条目 §3-§5 的口径整理成了审稿操作项。
一条给作者的预防性建议:与其等审稿人问,不如在 Methods 末尾主动放一个"口径声明框",把 §5.5 五变量各写一行——这在 BBBC051 类多口径数据集上正在成为好的发表惯例;声明框的成本是五行文字,收益是砍掉一半以上的方法学审稿往返。
§6 获取与许可:直链、引用与版本
6.1 获取方式
| 项目 | 内容 |
|---|---|
| 官方页 | https://bbbc.broadinstitute.org/BBBC051(BBBC 第 051 号,Version 1) |
| 图像直链 | Images.zip,2.9 GB,data.broadinstitute.org/bbbc/BBBC051/ 下官方直链 |
| 标签文件 | groundtruthlabels.txt,官方页直链 |
| 注册要求 | 无注册、无请求制、无申请流程 |
| 衍生轻量版 | TissueMNIST 经 MedMNIST 官网与 Zenodo(record 5208230)分发,含 npz 与 MedMNIST+ 64/128/224 升级版 |
BBBC 的分发哲学是"页面即全部":官方页上列出的一切(图像直链、标签、描述、许可、推荐引用)就是数据的完整契约,没有隐藏的补充条款。BBBC051 在这一点上是全系列中最简单的档位——两个文件、直链、即下即用。
6.2 许可条款
- 图像 + ground truth:CC BY 3.0 Unported(允许商用),权利持有人 Andre Woloshuk。允许任何用途(含商用)+ 署名。
- 衍生 TissueMNIST:MedMNIST 侧声明沿用 CC BY 3.0(与其母体许可一致,Zenodo record 5208230 页面载明)。
- 论文本体:© 2020 International Society for Advancement of Cytometry(ISAC);作者声明无利益冲突。论文全文经 PubMed Central(PMC8382162)开放获取。
CC BY 3.0 在学术数据集许可中属于"最宽松档":与 CC BY-NC(禁商用)相比,BBBC051 的许可覆盖商业研究与产品研发场景;与 CC0(公共领域)相比,它保留署名要求——使用时的最低义务是在成果中给出归属(§6.3 的官方推荐引用语即是官方给出的署名模板)。对人肾原位组织数据而言,"宽松许可 + 公开直链"的组合也值得注意:这类数据的分发通常受伦理审查约束更重,BBBC051 能以 CC BY 3.0 发布,说明其采集与分发流程已按供体组织数据的合规要求处理(细节以官方页与论文为准,官方页未展开伦理声明细节——使用者在涉及人体组织数据二次分发的场景下,应自行与维护方确认边界)。
6.3 官方推荐引用
BBBC 官方页要求使用者引用总集论文,推荐引用语原文:
We used image set BBBC051, available from the Broad Bioimage Benchmark Collection [Ljosa V, Carpenter AE, et al., Nature Methods, 2012].
BBBC 总集论文:Ljosa V, Carpenter AE et al., Nature Methods 2012, doi:10.1038/nmeth.2083, PMC3627348。使用 BBBC051 做方法研究时应同时引用方法论文(§6.4)。
一个实用的引用清单:数据集引 BBBC 总集 + 官方页编号,方法引 Woloshuk 2021(分类方法与流水线),标注平台引 Winfree 2017(VTEA),成像细节引 Ferkowicz 2021(Lab Invest)。四篇各管一段,混引或漏引都会造成溯源断链。
引用自检三问:我引的年份与卷期出自哪个口径(坑点 4)?我引的参数是不是把兄弟论文的内容算到了主文献头上(坑点 6)?我引的 DOI 是从期刊官网核过还是从聚合页抄的(坑点 7)?三问都过,引用链基本可靠。
6.4 论文引用(双口径并存)
同一篇论文在两个出处有不同的卷期表述,引用时按所投刊物要求选择其一并保持一致(坑点 4):
| 口径 | 表述 | 出处 |
|---|---|---|
| early view 口径 | Cytometry. 2020; 1–15 | BBBC 官方页(页面沿用早期在线版引用) |
| 正式卷期口径 | Cytometry Part A. 2021 Jul;99(7):707-721(online 2020-12-13;ISSN 1552-4930) | PubMed/PMC |
完整引文:Woloshuk A, Khochare S, Almulhim AF, McNutt AT, Dean D, Barwinska D, Ferkowicz MJ, Eadon MT, Kelly KJ, Dunn KW, Hasan MA, El-Achkar TM, Winfree S. In Situ Classification of Cell Types in Human Kidney Tissue Using 3D Nuclear Staining. doi:10.1002/cyto.a.24274 · PMID 33252180 · PMCID PMC8382162。
双口径的成因是常见的时间线现象:论文 2020 年 12 月 13 日在线发表(early view 无卷期),2021 年 7 月正式归入第 99 卷第 7 期;BBBC 官方页长期沿用在线版引用格式。判别哪个口径"对"没有意义——判别"哪个出处写的是哪个口径"才有意义。
6.5 版本链与维护方
- 版本:BBBC051 Version 1,未见 v2。BBBC 以"冻结即发布"著称——同一版本的内容不变,修订通常以新编号或新版本页形式出现。
- 维护方:BBBC 隶属 Broad Institute 成像平台;BBBC051 条目内容由 Ashkar Lab(Indiana University School of Medicine)提供,联系人/一作 Andre Woloshuk(awoloshu@iu.edu,官方页载明)。
- 团队结构:13 位作者横跨四个机构——IUSM 肾内科(Ashkar/El-Achkar Lab 主体)、IUPUI 计算机科学系(Almulhim、Hasan,深度学习侧)、Richard L. Roudebush VA Medical Center(Kelly、El-Achkar、Winfree)、解剖与细胞生物学系。这个"肾内科 + 计算机系 + VA"的组合也解释了论文的双重身份:一半是肾脏病学的组织定量方法,一半是计算机视觉的基准构建。
6.6 下载后的自查步骤
按顺序执行(与 §2.7 完整性核对清单配合使用):
- 校验文件体积(约 2.9 GB)与解压完整性(zip 无 CRC 错误)。
- 确认 3 个 tissue samples 目录结构与 groundtruthlabels.txt 同包存在。
- 抽查图像为单通道 DAPI、TIFF 格式可读。
- 加载标签,统计 8 类分布并留档(后续评测需要 per-class 口径)。
- 记录下载日期与来源 URL——BBBC 页面偶有链接迁移(data.broadinstitute.org 与 bbbc.broadinstitute.org 两个域名并存),留档避免溯源断链。
6.7 常见获取问题
- 镜像站可信吗? BBBC 不经营官方镜像;任何第三方再打包(聚合站、网盘转存)都引入过"元数据错配"的实际案例(本数据集自身的坑点 1、坑点 2 即为第三方描述讹误)。一律以官方页直链为准。
- TissueMNIST 能替代 BBBC051 吗? 不能,两者口径不同(§4.5、§7.1);需要 28×28 轻量数据时用 TissueMNIST,需要 3D 原始口径时必须回 BBBC051 本体。
- 想要未裁剪的原始 .lif 文件? 官方分发的只有 Images.zip 处理后图像;40-50 GB/卷的原始采集文件不在分发范围内(且该细节来自兄弟论文口径,坑点 6)。需要原始数据时联系维护方(awoloshu@iu.edu)。
6.8 许可合规操作清单(四场景)
CC BY 3.0 的义务只有"署名",但落到不同使用场景,操作细节不同:
| 场景 | 义务 | 建议操作 |
|---|---|---|
| 论文使用 | 署名 | 按 §6.3 官方推荐语引用 + 方法研究加引主文献 |
| 产品/商业使用 | 署名 | 许可为 CC BY 3.0(允许商用),在产品文档/关于页保留归属声明 |
| 再分发原数据 | 署名 + 保留许可声明 | 随数据包附 CC BY 3.0 声明与持有人信息(Andre Woloshuk);建议同时附官方页链接以便溯源 |
| 发布衍生数据集(如 TissueMNIST 式加工) | 署名 + 许可兼容 | 衍生品以同等或更宽松许可(CC BY 3.0 或 CC0)发布,注明母体与加工方式(MedMNIST 侧即为先例:CC BY 3.0 + 官网列明来源) |
两个特别提示:其一,CC BY 3.0 已是 3.0 版本,若你的发布平台要求 4.0,须注意许可版本兼容规则(BY 3.0 授权的作品通常可按 4.0 兼容条款使用,具体以 CC 官方兼容性说明为准);其二,再分发时不要剥掉 groundtruthlabels.txt 只发图像——标签与图像是一个整体口径,拆开发布会造成下游口径混乱(坑点 3 的传播土壤)。
最后提醒许可之外的另一层"合规":涉及人体组织数据的成果,发表时通常还需满足所在机构的伦理审查与数据管理计划要求——BBBC051 的开放许可解决的是"数据权利人允许你用",机构合规解决的是"你的组织允许你用",两层都过才算合规闭环(§2.9 的伦理边界在此处再次相关)。
6.9 获取渠道对照表
| 渠道 | 拿到什么 | 适合谁 | 注意 |
|---|---|---|---|
| BBBC 官方页直链 | Images.zip 2.9 GB + groundtruthlabels.txt(全量、三形态、原始口径) | 3D 研究者、方法复现者 | 唯一权威渠道;下载后按 §6.6 自查 |
| MedMNIST 官网 / Zenodo 5208230 | TissueMNIST npz(28×28,236,386 样本)+ MedMNIST+ 升级版 | 轻量 benchmark 用户、教学 | 衍生口径,MIP 已压缩 3D 信息 |
| 第三方聚合站 | 不建议 | — | 元数据讹误实例集中地(坑点 1、坑点 2) |
| 联系维护方(awoloshu@iu.edu) | 官方分发之外的疑问(原始采集文件等) | 特殊需求者 | 请求制,说明用途与机构隶属 |
6.10 许可场景三问三答
- 改图后发表可以吗? 可以。CC BY 3.0 允许演绎(裁剪、调色、拼接 figure),署名义务不变;建议在图注注明"图像来自 BBBC051, Broad Bioimage Benchmark Collection"。
- 教学课件/学位论文里用可以吗? 可以。同属 CC BY 3.0 覆盖范围,按 §6.3 模板署名即可。
- 闭源产品内置模型(在 BBBC051 上训练)可以吗? 可以。训练用途不构成"分发",模型权重不属于数据集的演绎副本的通常口径;产品文档中保留数据来源致谢是稳妥做法。若直接打包分发数据集本体或其裁块,则回到 §6.8 再分发行的义务。
7.7 使用 TissueMNIST 的三条提醒
- 它测不了 3D 能力:28×28×1 没有 z 轴信息,任何"3D 组织分析"的结论都不能从它得出;需要 3D 请回 BBBC051 原始口径。
- 切分是固定的:train/val/test 7:1:2 由 MedMNIST 统一切分定版(MD5 定版即含此切分),自定义重切分会失去与社区榜单的可比性。
- 榜单成绩不可回推母体:轻量口径的高分与 BBBC051 原始任务的 80.26% 之间没有换算关系(§4.5)——两个榜单、两个问题。
8.5 想找同类数据集?
- 同系列(BBBC 其他成员):库内 bbbc 总集条目按任务/模态索引 BBBC001-054;Phenotype classification 分节是 BBBC051 的直接邻居(BBBC018、BBBC037 等)。
- 同生态(MedMNIST 系):库内 medmnist 总集条目覆盖 12 子集统一框架;若你的任务形态与 TissueMNIST 类似(显微镜、小图、多类),先在那里横向选型。
- 检索关键词建议:‘tissue cytometry’、‘nuclear morphology classification’、‘DAPI single-channel’、‘in situ cell type classification’、‘kidney cortex’——避开讹误关键词(‘organoid’、‘MCF7’、‘synthetic kidney’,坑点 1、坑点 2)。
找数据的通用三问(从本条目经验提炼):一手出处在哪里(官方页/期刊,不是聚合站)?口径数字是谁说的(总表/论文/衍生方,边界不同)?许可允许我的用法吗(署名义务与商用条款)?三问在 BBBC051 上各有对应案例(§6.9、坑点 3、§6.8),可作为评估任何医学数据集的第一分钟尽调。
§7 生态:从 BBBC051 到 TissueMNIST 的衍生链
7.1 TissueMNIST:轻量化衍生基准
TissueMNIST 是 MedMNIST v2(Yang et al., Scientific Data 2023, 10(1):41)收录的第 6 号子集,官方描述为 “TissueMNIST: Kidney Cortex Microscope Multi-Class (8)”——直接从 BBBC051 加工而来,8 类标签沿用:
| 属性 | 值 |
|---|---|
| 样本总数 | 236,386 |
| 切分(7:1:2) | train 165,466 / val 23,640 / test 47,280 |
| 原始裁剪 | 32×32×7(z-stack 7 层) |
| 降维方式 | z 轴最大强度投影(MIP)→ 28×28×1 |
| 文件 MD5 | ebe78ee8b05294063de985d821c1c34b |
| Zenodo | record 5208230 |
| 许可 | CC BY 3.0 |
| MedMNIST+ | 提供 64×64 / 128×128 / 224×224 升级分辨率版 |
TissueMNIST 与 BBBC051 原始口径的参数对照:
| 参数 | BBBC051 原始口径 | TissueMNIST 口径 |
|---|---|---|
| 数据形态 | 3D 体积 / 2D 投影 / 2D 切片 | 28×28×1(MIP 压缩) |
| 原始裁剪 | 全视野 z-stack(50 μm 厚切) | 以核为中心 32×32×7 |
| 样本总量 | 690,000(总表)/ ~230,000(标签口径) | 236,386 |
| 切分 | 官方按 3 tissue samples 组织 | train/val/test = 7:1:2 固定切分 |
| 类别 | 8 类(同源) | 8 类(沿用) |
| 分发 | Images.zip 2.9 GB + txt 标签 | npz(MD5 定版)+ Zenodo |
| 论文最优成绩 | NephNet3D 80.26%(balanced accuracy) | MedMNIST 榜单各模型成绩(轻量口径) |
| 适用 | 方法学验证、3D 研究 | 轻量 benchmark、教学、快速迭代 |
MedMNIST v2 全库约 708K 张 2D 图、12 个子集,是医学图像分类的标准轻量 benchmark 生态;TissueMNIST 在其中承担"显微镜 + 3D 组织来源"的生态位。
7.2 加工链路逐步拆解
从 BBBC051 原始体积到 TissueMNIST 的 npz 文件,加工链路可拆为四步(每一步都有信息取舍):
- 取自 3D 核对象:以 VTEA 分割出的细胞核为中心,从原始 z-stack 中裁出 32×32×7 的小块——x/y 方向 32 像素、z 方向 7 层。这是"以核为样本"的取样:TissueMNIST 的 236,386 个样本对应的是细胞核个体,不是整幅视野。
- z 向 MIP 降维:对 7 层做最大强度投影,得到 28×28×1(x/y 方向同时从 32 降到 28)。z 向信息在此被压缩——§4 已证明这部分信息有判别力。
- 标签映射:沿用 BBBC051 的 8 类标签(0-7 与 §2.5 类别表对应)。
- 切分与分发:按 7:1:2 切为 train/val/test,npz 打包,MD5 ebe78ee8b05294063de985d821c1c34b 定版,Zenodo record 5208230 分发。
衍生关系中的责任分配:母体(BBBC051)对标签的生物学正确性负责——标签错了,一切衍生都错;衍生(TissueMNIST)对加工失真的声明负责——压了什么、丢了什么、切分怎么定,必须写清。这个责任划分提示母体文档的读者:母体条目(本条目)与衍生文档(MedMNIST 官网)各自只对半条链路负责,跨链路的问题(本条目 §4.5 反复警示的口径混淆)需要像本条目这样的"链路地图"来覆盖。
切分数值自洽核对:165,466 + 23,640 + 47,280 = 236,386,与样本总数严格吻合;比例上 165,466/236,386 ≈ 0.6999、23,640/236,386 ≈ 0.1000、47,280/236,386 ≈ 0.2001,与 7:1:2 名义比例一致(尾差来自整数取整)。这一核对可作为"TissueMNIST 文件是否为定版"的快速指纹检查之一(配合 MD5)。
npz 定版核验示意(伪代码):
# 依赖: numpy, hashlib
import numpy as np, hashlib
raw = open("tissuemnist.npz", "rb").read()
assert hashlib.md5(raw).hexdigest() == "ebe78ee8b05294063de985d821c1c34b"
npz = np.load("tissuemnist.npz")
# MedMNIST npz 约定: train_images/val_images/test_images + 同名 _labels
# 各 split 样本数应为 165,466 / 23,640 / 47,280 (§7.1), 图像尺寸 28x28
核验顺序与 §6.6 一脉相承:先验哈希(文件级),再验形状与样本数(数组级)——两级都过才进入训练。
理解第 1 步尤其重要:TissueMNIST 的样本不是"随机裁块"而是"以已标注的核为中心取样",因此它的 236,386 样本与 BBBC051 论文口径的 ~230,000 细胞在同一数量级上互相印证——两个数字的微小差异(236,386 vs ~230,000)来自取样边界与统计口径的细节,这正是坑点 3 中"三口径并存"的又一处注脚。
7.3 MedMNIST v2 论文口径(含 DOI 纠错存照)
MedMNIST v2 论文:Yang L, et al. MedMNIST v2: A large-scale lightweight benchmark for 2D and 3D biomedical image classification. Scientific Data, 2023, 10(1):41, ISSN 2052-4463;预印本 arXiv:2110.14795。
新增存照(坑点 7):本条目前任研究存档曾记录 MedMNIST v2 DOI 为 10.1038/s41597-023-02683-x;本条目成稿前经 Dimensions、RWTH Publications、BibSonomy、University of Bamberg 四个独立来源交叉验证,正确 DOI 为 10.1038/s41597-022-01721-8(022 系列),023-02683-x 为讹传口径。本条目全文采用四源一致口径。这是继存照②(selectdataset.com 张冠李戴)之后第二个"第三方元数据传播讹误"案例——引用前用期刊官网或 PubMed 核验 DOI 应成为习惯。
7.4 姊妹论文与方法谱系
BBBC051 所属的方法谱系在团队内部持续演化,四篇关键文献:
| 文献 | 定位 |
|---|---|
| Winfree et al., JASN 2017;28(7):2108-2118(doi:10.1681/ASN.2016091027, PMID 28154201) | VTEA 平台原始论文,3D tissue cytometry 方法奠基 |
| Woloshuk et al., Cytometry Part A 2021(本条目主文献) | BBBC051 数据集 + DAPI 单染色 8 类分类论文 |
| Ferkowicz et al., Lab Invest 2021(doi:10.1038/s41374-020-00518-w) | 完整 3D tissue cytometry 管线论文(含 BBBC051 成像硬件参数披露,坑点 6) |
| VTEA 扩展版预印本 bioRxiv 2021.12.27.474025 | 集成 ML + neighborhood analysis 的扩展 |
开源代码:GitHub icbm-iupui/volumetric-tissue-exploration-analysis(VTEA)。论文 2021 年发表后被引约 35 次(Google Scholar 2026-09-29 口径),其中相当比例来自 TissueMNIST/MedMNIST 生态的间接引用——轻量衍生基准反哺了母体数据集的可见度。这个"母体发布 → 轻量化衍生 → 衍生引回母体"的循环,是当代医学图像数据集工程中最值得研究的传播模式之一:BBBC051 的直接使用者(3D 显微分析团队)规模有限,而经由 TissueMNIST 认识它的教学与 benchmark 用户规模大得多。
四篇文献的阅读顺序建议:要快适数据上手,读 BBBC051 官方页即可(§6);要理解标签怎么来,按 Winfree 2017(平台)→ Woloshuk 2021(应用与基准)的顺序读;要完整复现端到端管线,再补 Ferkowicz 2021(采集与管线细节)与 bioRxiv 扩展版(最新方法)。直接从 Woloshuk 2021 单篇切入也可行——它的 SI 覆盖了理解本数据集所需的最小集合。
7.5 第三方口径存照
Sci Rep 2026(s41598-026-55088-6)转述 TissueMNIST "11 类压缩为 8 类"的说法,与 BBBC 官方页、MedMNIST 官方代码库两边的口径均无法核对(两边均为 8 类,未见 11 类原始标注的任何官方痕迹)。本条目仅存照不采信(§10 坑点 8)。
§8 方法学启示:BBBC051 对数据集工程的五条可迁移经验
-
蒸馏式标注破解"标签贵"困局。 多重免疫标记很贵、组织会被耗竭,但它只需做一次(每例三组);蒸馏出的标签可以无限次喂给单通道模型。任何"标注手段昂贵、目标输入廉价"的场景(如:多序列 MRI 定标签、单序列 T1 做预测;多参数病理染色定标签、H&E 做预测)都可复制此结构。BBBC051 证明了这条链路在"23 万样本、8 类、人体原位组织"的规模上是跑得通的。
-
无监督聚类 + 专家裁决是 23 万级标注的性价比解。 X-means 自动定簇数,专家只解释簇而非逐点分类。代价是簇级异质性残留——这提示使用者在误差分析时按簇回溯,而非按个体细胞回溯。性价比的另一面是误差的结构化(§3.3):半自动标签的验证设计必须考虑误差成簇出现的特性,否则任何"随机划分 + 高分"都有虚高嫌疑。
-
输入维度是被低估的自由变量。 同一批核,2D 与 3D 的差距在经典特征下 2-4 个百分点、在深度模型下被进一步放大(3D + context 42.20% → NephNet3D 80.26%)。做显微图像分类前先问:我的信号是 3D 的吗?MIP 是不是正在丢掉判别力?对数据集构建者的推论是:发布 3D 数据时同时提供三形态导出(体积/投影/切片),等于免费送给用户一组内置消融——BBBC051 的三形态设计值得作为发布模板。
-
context 是组织学的隐形特征。 with context 一致优于 without——内皮 vs 白细胞这类差异部分写在"邻居是谁"里。这对细胞图网络(cell graph)、邻域分析类方法是一个来自实证的背书。数据集构建者的对应动作:标注时顺手保存空间坐标(BBBC051 的标签按样本组织且与空间结构对应,这正是 context 实验可做的前提)。
-
衍生轻量基准是数据集的第二生命。 BBBC051 原始口径下载门槛高(2.9 GB、3D 处理链),TissueMNIST 让它进入标准 benchmark 循环、被大量轻量论文间接引用。母体数据集设计时预留"可压缩性"(干净标签、规则切分、许可兼容)会在衍生时获得复利。反过来,母体条目(如本条目)有义务把"衍生口径 ≠ 母体口径"讲清楚——否则轻量榜单的高分会持续制造对母体任务的错误预期(§4.5 的警示)。
8.1 BBBC051 在数据集工程谱系中的坐标
最后把本数据集放进"数据集工程"的坐标系收束本章:按"标注自动化程度"分,它处于"半自动(聚类+专家验证)“档——比纯人工贵、比全自动可靠;按"任务深度"分,它是"多类细粒度(8 类组织学类型)”——比二元分类深、比像素级分割浅;按"数据真实性"分,它是"人体原位组织"——比细胞系/合成数据更接近临床,比队列研究更受控于方法学。这个"中间档集合体"的定位,使它对大多数团队都有参考价值,也使它的每一个口径(规模、许可、标注性质)都必须精确到出处才能被正确使用——这正是本条目用三章篇幅(§5-§7)处理口径问题的原因。
自检定位是否用对了,只需三个问题:我是否把它当"3 例供体的方法学基准"而非"疾病队列"引用?我是否写明了所用口径(3D/2D、context、划分)?我的许可用法是否落在 CC BY 3.0 的署名义务内?三问皆"是",坐标就是对的。
8.2 三个反常识结论的速记卡
本章五条经验中,有三条与常见直觉相反,单独速记:
- “多标记是标签的脚手架,不是数据的一部分”——直觉上多通道数据更值钱,BBBC051 证明"多通道定标签 + 单通道发数据"的组合反而创造了新的研究价值(免标记分类)。
- “3D 不是负担,是被浪费的存量”——直觉上 3D 数据处理贵,先压 2D;本数据集证明被压掉的 z 轴恰恰承载了最大判别增益。
- “轻量衍生不是降级,是放大器”——直觉上 28×28 压缩版是"失真版";TissueMNIST 用压缩换来了数量级的用户面,反哺母体引用。
8.3 关键时间线
| 时间 | 事件 |
|---|---|
| 2020-12-13 | 论文在线发表(early view,官方页沿用 “Cytometry. 2020; 1–15” 口径) |
| 2021 | 论文正式归卷 Cytometry A. 2021 Jul;99(7):707-721;BBBC051 Version 1 挂线发布 |
| 2021 | 姊妹管线论文 Ferkowicz et al., Lab Invest 2021 发表(成像硬件细节归属源) |
| 2021-12 | VTEA 扩展版预印本(bioRxiv 2021.12.27.474025) |
| 2023 | MedMNIST v2 发表(Sci Data 10(1):41),TissueMNIST 进入轻量 benchmark 生态 |
| 2026-09-29 | 本条目复核日:五方向多源复核、新增存照⑦(DOI 纠错) |
时间线上三个值得注意的节奏:其一,从在线发表(2020-12)到正式归卷(2021-07)相隔约七个月,这是坑点 4 双口径的时间根源;其二,VTEA 平台(2017)到 BBBC051(2020/2021)相隔三四年——公开基准的发布滞后于方法成熟,是"先磨刀后发布"的健康节奏;其三,TissueMNIST(2023)再滞后约两年——轻量衍生通常由第三方生态在母体沉淀后启动,这个节奏也是"衍生以母体稳定为前提"的例证。
8.4 五条经验的落地检查清单
把 §8 的五条经验转成可勾选的工程检查项:
- [ ] 设计标注手段时:先问"昂贵的信息能否只用于生产标签,让目标输入保持廉价"(蒸馏式结构)
- [ ] 标注预算固定时:优先评估"聚类 + 专家裁决"方案的簇级质量,而非直接压低人工单价
- [ ] 采集 3D 数据时:同时导出体积/投影/切片三形态并打包发布(免费送用户一组内置消融)
- [ ] 保存标注时:连同空间坐标与上下文信息一起存档(context 是隐形特征,§4.1)
- [ ] 发布数据集时:检查标签干净度、切分规则性、许可兼容性三要素(为衍生预留可压缩性)
- [ ] 引用规模数字时:写明口径与出处(三口径教训,坑点 3)
- [ ] 被衍生时:在母体文档中明确"衍生口径 ≠ 母体口径"(§4.5)
- [ ] 元数据管理时:DOI、年份、作者列表以期刊官网/PubMed 为准并留复核记录(坑点 4、坑点 7)
§9 库内关系:与 bbbc、medmnist 条目的分工
9.1 与 bbbc(BBBC 总集)条目的分工
库内 bbbc 条目(rid 34,约 48,593 字符)是 BBBC 全系图像集的总集概览,以表格清单方式覆盖 BBBC001 至 BBBC054 各集的一行式索引(含 BBBC051 行:Human kidney cortex cells、Fluorescent、690,000)。经成稿前复查,该条目对 BBBC051 仅停留于表格提及——mentions_woloshuk=false、mentions_tissuemnist=false、无 kidney 主题展开。
分工由此确立:总集条目管"全景与选型"(BBBC 系列怎么来的、Ljosa/Carpenter 总集论文、按任务/模态选集),本条管"单集深潜"(VTEA 标注流水线、8 类定义、NephNet 基准、许可细节、衍生链)。两条目互链不重复:检索者从总集条目按行索引跳入本条做深读,从本条沿 §4.4 回总集条目做横向比较。
这一分工也符合两个条目的自然访问模式:需要"在 54 个集合里挑一个"的用户进入总集条目,只需要"深挖某一个集合"的用户直达本条。总集条目的一行式索引保证广度(任何集合 10 秒内可定位),本条目的章节化深潜保证深度(任何工程问题 10 分钟内可查到口径)。广度与深度在各自条目内自洽,互链后形成完整的检索闭环。
9.2 与 medmnist(MedMNIST 系列总集)条目的分工
库内 medmnist 条目(rid 716)覆盖 MedMNIST v2 全库 12 个子集的统一框架(708K 图、npz 格式、MedMNIST+ 升级分辨率、v2 论文口径)。TissueMNIST 在该条目中是 12 行之一;在本条目中是 §7 的完整展开。
分工:medmnist 条目管"系列横向"(12 子集对比、统一 API、轻量 benchmark 生态),本条管"上游源头"——TissueMNIST 的 236,386 个样本从哪来(BBBC051 的 3 例肾皮质)、8 类标签的物理来源(三组多重标记实验)、MIP 压缩丢掉了什么(z 轴 3D 判别信息)。两条目互链后,"母体-衍生"的完整链路才闭合。
9.3 三条目互链速查
| 条目 | rid | 角色 | 与本条的关系 |
|---|---|---|---|
| bbbc | 34 | BBBC 全系总集概览 | 母集合;本条为其 051 号成员的单集深潜页 |
| medmnist | 716 | MedMNIST v2 系列总集 | 衍生宿主;本条为其 TissueMNIST 子集的上游源头页 |
| 本条 | bbbc051 | 单集深潜 | 承上(bbbc 选型入口)启下(medmnist 衍生出口) |
9.4 互链锚文本建议
为保证库内跳转的语义清晰,建议各条目互链时使用以下锚文本(而非裸 URL 或"参见"):
| 从 | 到 | 建议锚文本 |
|---|---|---|
| bbbc(BBBC051 行) | 本条 | BBBC051 单集深潜:DAPI 单染色 8 类细胞分类 |
| 本条 §4.4 | bbbc | BBBC 总集条目(Phenotype classification 分节横向比较) |
| 本条 §7.1 | medmnist | MedMNIST v2 总集条目(12 子集统一框架) |
| medmnist(TissueMNIST 行) | 本条 | 上游母体 BBBC051(3D 原始口径与标注流水线) |
§10 避坑清单:八个必知坑点
以下坑点全部由本条目成稿过程中的多源复核确认,每条附证据、影响面与处置。阅读约定:坑点编号(坑点 1-坑点 8)是全文通用索引,正文任何位置引用坑点即指本清单对应条目;每个坑点的"影响面"描述它若被踩中会怎样误导工作,"处置"给出可执行的纠正动作。八个坑点中有七个对应附录 C 的编号存照①-⑦,一个(坑点 8)为双议题并置存照——存照机制与坑点机制的关系见附录 C 的使用规则。
坑点 1:聚合页称"肾皮质类器官合成数据"——错
部分数据聚合页/任务简报把 BBBC051 描述为合成 human renal organoids(肾皮质类器官合成数据)。实核口径:真实 deceased donor nephrectomy 人体肾皮质组织(FACTS 存照①,官方页与论文双证)。合成、类器官两词均不成立。影响面:数据性质认知全错——类器官数据与人体原位组织在供体异质性、组织结构完整性、伦理属性上完全不同,基于错误认知的研究设计(如"把它当合成数据用")从一开始就偏航。处置:任何引用本数据集"数据性质"的文字,一律以官方页 “Human kidney cortex cells” 为准;发现下游文献沿用"类器官"口径时,按本条目存照①指正。
坑点 2:selectdataset.com 称"MCF7 乳腺癌药物筛选"——张冠李戴
第三方站点 selectdataset.com 把 BBBC051 页面与 MCF7 乳腺癌药物筛选数据混同,属张冠李戴(FACTS 存照②)。BBBC051 与 MCF7、药物筛选均无关系;BBBC 系列中确有乳腺癌细胞系数据集(归总集条目覆盖),可能是混淆来源。影响面:检索入口错误——按"MCF7"检索 BBBC051 的用户会落入完全无关的数据集合。处置:从官方页获取元数据,勿采信聚合页描述;库内检索关键词建议用 “BBBC051”、“human kidney cortex”、“kidney cortex cells”。
坑点 3:规模三口径 690,000 / ~230,000 / 236,386——各有出处
| 口径 | 数值 | 出处 | 指代 |
|---|---|---|---|
| ① | 690,000 | BBBC 总表 Phenotype classification 分节 | images(细胞)总数 |
| ② | ~230,000 | 论文摘要 “~230,000 cells were classified into eight different classes” | 完成八类分类的细胞(NephNuc 训练库) |
| ③ | 236,386 | MedMNIST/TissueMNIST | 衍生轻量样本总数 |
三口径并存非矛盾而是统计边界不同(FACTS 存照③;口径①经 2026-09-29 官方总表页复核直接证实)。影响面:引用错配——“236,386 张原始图像”、"690,000 个带标签细胞"这类表述都是口径错配的实例。处置:引用时注明口径与出处;需要"带 8 类标签的细胞数"时用论文口径 ~230,000,需要"衍生基准样本数"时用 236,386 并注明 TissueMNIST。
坑点 4:年份双口径 2020 vs 2021
BBBC 官方页引用为 “Cytometry. 2020; 1–15”(early view 在线版),PubMed/PMC 正式卷期为 Cytometry A. 2021 Jul;99(7):707-721(online 2020-12-13)(FACTS 存照④)。两口径都对,只是出处不同。影响面:引用不一致——同一团队成果在不同论文里被引成 2020 与 2021 两个年份,文献计量时会被拆成两条记录。处置:正文按正式卷期引 2021;转述官方页表述时保留其原样;同一文内勿混用。
坑点 5:8 类类名 BBBC 官方页未列名
BBBC 官方网页对 8 类只写"eight cell types",未逐条列出类名(FACTS 存照⑤)。类名经论文 SI Table S1 定义、MedMNIST info.py 完整存档(2026-09-29 复核直接证实,两源一致)——本条目 §2.5 的类别表即据此构建。影响面:来源归属错误——把类名说成"BBBC 官方页列出"会让读者在官方页找不到出处,产生对条目可靠性的怀疑。处置:引用类名时注明来源为论文 SI/MedMNIST 存档口径,勿写成"BBBC 官方页列出"。
坑点 6:Leica SP8 成像参数的归属陷阱
共聚焦硬件参数(Leica SP8、20×/0.75 IMM 油镜、过夜 tile-scan、40-50 GB/卷)并非 BBBC051 论文正文披露,而来自同团队兄弟论文 Ferkowicz et al., Lab Invest 2021(FACTS 存照⑥)。影响面:溯源断链——引用者标注"BBBC051 论文披露"后,核查者在原文找不到对应内容,误判为编造。处置:引用这些参数时必须标注 Lab Invest 2021 出处,不能写成"BBBC051 论文披露";本条目 §2.2 已按此口径标注。
坑点 7:MedMNIST v2 DOI 传播讹误
本条目前任研究存档曾记录 MedMNIST v2 论文 DOI 为 10.1038/s41597-023-02683-x;成稿前经 Dimensions、RWTH Publications、BibSonomy、University of Bamberg 四源交叉验证,正确 DOI 为 10.1038/s41597-022-01721-8(新增存照⑦,本条目全文采用)。023-02683-x 在多个第三方页面流传,属元数据传播讹误。影响面:链接失效与引文错误——DOI 错则解析 404 或解析到无关对象,文献管理软件批量导入时错误会扩散。处置:引用 MedMNIST v2 前经期刊官网/PubMed 核验 DOI;其他条目若引用该论文,建议同样自查。
坑点 8:生成细节未详述 + "11 类压缩为 8 类"无从核对
两个未决口径并置存照:其一,官方页对数据生成细节仅有 “Additional details on generation is the subject of an upcoming publication” 一句,该"即将出版的出版物"截至复核日(2026-09-29)未在官方页落实对应关系;其二,Sci Rep 2026(s41598-026-55088-6)转述 TissueMNIST “11 类压缩为 8 类”,与 BBBC/MedMNIST 两边官方口径均无法核对。影响面:细节真空易被二手填充——"upcoming publication"的真空期里,第三方对生成细节的转述(如 11→8 类说)会填补搜索结果,越晚核查纠错成本越高。处置:两说均只存照、不采信、不在正文展开推导;引用 BBBC051 生成细节时以论文 + Lab Invest 2021 拼合口径为准。
常见问题 FAQ
Q:BBBC051 是合成数据吗?
不是。它是 3 例遗体捐献供体肾切除术(deceased donor nephrectomy)标本的肾皮质真实人体组织,共聚焦显微镜采集(坑点 1)。"类器官合成数据"是第三方聚合页讹误。
Q:为什么只有 DAPI 一个通道?标签哪来的?
设计如此:三组多重免疫标记实验只用于生产标签(§2.4),经 VTEA 流水线蒸馏为 8 类标签后"反绑"到仅 DAPI 的图像上(§3.4)。分发图像只有 DAPI 通道。
Q:8 类细胞类型分别是哪些?
集合管/连接小管、远曲小管、肾小球内皮、间质内皮、白细胞、足细胞、近端小管节段、髓袢升支粗段(§2.5)。类名见论文 SI Table S1 与 MedMNIST info.py 存档,BBBC 官方页本身未列名(坑点 5)。
Q:数据集到底有多少个细胞?
按口径分:BBBC 总表 690,000(images)、论文 ~230,000(完成八类分类)、TissueMNIST 236,386(衍生样本)(坑点 3)。
Q:下载要注册吗?
不要。Images.zip(2.9 GB)与 groundtruthlabels.txt 均为官方直链,无注册、无请求制(§6.1)。
Q:可以商用吗?
可以。图像与 ground truth 为 CC BY 3.0 Unported(允许商用),持有人 Andre Woloshuk;署名即可(§6.2)。
Q:应该怎么引用?
按官方推荐语引用 BBBC 总集(Ljosa et al., Nature Methods 2012),方法研究加引主文献(Woloshuk et al., Cytometry Part A 2021;99(7):707-721, doi:10.1002/cyto.a.24274);引用硬件参数时另加 Ferkowicz 2021(§6.3、§6.4、坑点 6)。
Q:NephNet3D 的 80.26% 是什么口径?
balanced accuracy,3D 核体积输入,论文自报。约五分之一细胞仍被误分类,不能当临床级自动判读用(§5.3)。
Q:为什么不用普通 accuracy?
8 类自然丰度极不均:近端小管上皮占皮质细胞大头,足细胞、白细胞稀少。普通 accuracy 下"全猜多数类"就能得高分,balanced accuracy 对各类等权计算召回,才能暴露小类性能(§5.1)。
Q:TissueMNIST 上的成绩能代表 BBBC051 原始任务的难度吗?
不能直接互推。TissueMNIST 是 28×28 的 MIP 压缩口径,丢掉了论文证明最有判别力的 z 轴 3D 信息(§4.5、§7.1)。
Q:想复现标注流水线,代码在哪?
VTEA 开源:GitHub icbm-iupui/volumetric-tissue-exploration-analysis;方法论文 Winfree et al., JASN 2017;扩展版思路见 bioRxiv 2021.12.27.474025(§3.1、§3.6)。
Q:BBBC051 有 Version 2 吗?
截至复核日未见。当前为 Version 1(§6.5)。
Q:为什么 3D 输入比 2D 好?
50 μm 厚切片保留了核的三维形态与沿深度染色分布的指纹,投影/切片会损失这部分信息;经典特征与深度模型两个口径下方向一致(§4.1、§4.3)。
Q:with context 是什么意思,为什么有用?
输入除核本体外附带周边像素/体素。部分类别(两类内皮、小管各节段)的判别信息写在空间语境里——核的邻居、管腔的位置——而不在核自身形态里(§2.5 逐类小传、§4.1)。
Q:标签可以直接当逐细胞人工金标准用吗?
要打折。标签是簇级半自动口径(聚类 + 专家验证),存在簇内异质性与结构化误差的可能;用它训练没问题(原论文即如此),用它当"绝对真值"做细粒度误差分析时要按 §3.5 审计。
Q:想要原始未裁剪的采集文件(.lif)怎么办?
官方只分发 Images.zip 处理后图像;原始采集文件不在分发范围。需要时联系维护方 Andre Woloshuk(awoloshu@iu.edu,官方页载明)(§6.7)。
Q:能把 BBBC051 用于疾病研究吗?
谨慎。标本是正常供体肾皮质,不是病变组织;疾病场景外推需自行验证适用性,且无临床配对信息(§2.9)。
Q:三例供体能支撑人群层面的结论吗?
不能。供体层面只有 3 个观测单位,BBBC051 是方法学基准而非人群代表性样本;"供体间差异"类结论的统计功效有限(§2.9)。
Q:论文发表后有没有官方的后续版本或扩展?
BBBC051 本体停留于 Version 1;团队方法谱系的后续演化见 §3.8(Lab Invest 2021 管线、bioRxiv 扩展版),但官方页标注的 “upcoming publication” 对应出版物截至复核日未落实(坑点 8)。
Q:类别不平衡严重吗?该怎么处理?
肾皮质的自然丰度决定了不平衡存在(近端小管多数类 vs 足细胞/白细胞少数类)。训练侧用类加权或重采样,评测侧坚持 balanced accuracy + per-class recall(§5.1);不要用普通 accuracy 做模型选择。
Q:可以基于 BBBC051 发布自己的衍生数据集吗?
可以。CC BY 3.0 允许衍生,条件是署名 + 许可兼容(衍生品用同等或更宽松许可)。TissueMNIST 就是先例:注明母体、沿用 CC BY 3.0(§6.8)。
Q:它是 H&E 病理切片数据吗?
不是。BBBC051 是 DAPI 荧光显微图像(核染色通道),不是 H&E 透光病理切片;两者在染色原理、信息维度、分析管线上都不同。H&E 病理类数据由库内相关条目覆盖(§9)。
Q:可以直接用 BBBC051 训练、在 TissueMNIST 测试集上报成绩吗?
不建议。两者虽同源但预处理链不同(裁块方式、归一化、分辨率),跨口径训练-测试会引入未声明的分布差异;正确做法是各自口径内训练-测试,跨口径实验作为域适应研究单独声明。
Q:哪里能看到本条目所有数字的出处?
事实清单(每行标注来源)+ 附录 G 证据分级表(每章标注证据等级)+ 附录 E 复核日志(复核方向与结论)。三者合起来构成本条目的"可审计层"。
Q:本条目的工程建议(D 级内容)和官方结论怎么区分?
凡属本条目给出的建议(评测协议、抽验方案、迁移路线),正文均以"建议/示意/推论"措辞出现,并在附录 G 标为 D 级;官方结论(基准数字、许可、口径)标为 A/B 级且有出处可查。
Q:BBBC051 的图像能用于发表图版吗?
可以。CC BY 3.0 允许演绎与发表,署名即可;建议图注注明来源(§6.10)。
Q:三组标记实验的原始多通道图像在本数据集里有吗?
没有。分发物只有 DAPI 单通道;多通道信息已被蒸馏为标签。理解这一点的价值在于:任何"用 BBBC051 验证多通道方法"的实验设计都需重找数据源(§2.4、§2.9)。
Q:如果我要在论文里同时引用 BBBC051 和 TissueMNIST,注意什么?
分开口径引用:数据规模、任务难度、最优成绩各自标注(§7.1 对照表);不要写"BBBC051(即 TissueMNIST)"——两者是母体与衍生的关系,不是同一对象的两个名字。
Q:本数据集支持基准榜单提交吗?
BBBC 本身不运营榜单(冻结发布、无官方 leaderboard);TissueMNIST 侧的榜单运营归属 MedMNIST 生态(medmnist.com)。想在 BBBC051 原始口径上发布成绩,走论文/预印本自报 + 本条目 §5.5 协议声明即可获得可比性。
Q:五个 part 的成稿方式对读者有影响吗?
没有。五 part 拼接后即为单一连续文档,章节编号连续、锚点唯一;拼接口仅存在于生成过程,不出现在最终文件结构中(附录 D)。
事实清单:硬数字与来源对照
| 硬数字 | 内容 | 来源 |
|---|---|---|
| 2.9 GB | Images.zip 大小 | BBBC 官方页(2026-09-29 复核) |
| 3 | tissue samples(nephrectomy 标本)数 | 官方页 + 论文 |
| 50 μm | 切片厚度 | 论文(FACTS 存档) |
| 8 | 细胞类型类数 | 论文 + MedMNIST info.py |
| 690,000 | BBBC 总表 images 口径 | BBBC 总表页(2026-09-29 复核直接证实) |
| ~230,000 | 论文口径完成八类分类的细胞数 | 论文摘要 |
| 236,386 | TissueMNIST 样本总数 | MedMNIST 官网/info.py |
| 165,466 / 23,640 / 47,280 | TissueMNIST train/val/test(7:1:2) | MedMNIST 官网 |
| 32×32×7 → 28×28×1 | TissueMNIST 裁剪与 MIP 降维 | MedMNIST info.py |
| ebe78ee8b05294063de985d821c1c34b | TissueMNIST npz MD5 | MedMNIST info.py |
| 36.05% / 38.05% / 38.15% / 42.20% | RF 消融(2D/3D × ±context)balanced accuracy | 论文(FACTS 存档) |
| 41.54% | SVM balanced accuracy | 论文(FACTS 存档) |
| 80.26% | NephNet3D balanced accuracy | 论文摘要(复核证实) |
| 707-721 / 99(7) / 2021 Jul | 论文正式卷期页码 | PubMed/PMC |
| 2020-12-13 | 论文 online 日期 | PubMed |
| 33252180 / PMC8382162 / 10.1002/cyto.a.24274 | 论文标识符 | PubMed/PMC |
| 1552-4930 | Cytometry Part A ISSN | PubMed |
| 13 | 论文作者数 | PubMed |
| 35 | 论文被引(Google Scholar 口径) | Google Scholar(2026-09-29) |
| 10.1038/s41597-022-01721-8 | MedMNIST v2 正确 DOI(四源一致) | Dimensions/RWTH/BibSonomy/Bamberg |
| 10.1681/ASN.2016091027 / 28154201 | VTEA 原始论文 DOI/PMID | FACTS 存档 |
| 10.1038/nmeth.2083 / PMC3627348 | BBBC 总集论文 DOI/PMCID | FACTS 存档 |
| 10.1038/s41374-020-00518-w | Ferkowicz Lab Invest 2021 DOI | FACTS 存档 |
| 5208230 | TissueMNIST Zenodo record | MedMNIST 官网 |
| CC BY 3.0 Unported | 图像 + GT 许可(允许商用) | 官方页(持有人 Andre Woloshuk) |
| awoloshu@iu.edu | 官方联系人 | 官方页 |
术语表
| 术语 | 释义 |
|---|---|
| BBBC | Broad Bioimage Benchmark Collection,Broad Institute 维护的公开生物图像基准集,总集论文 Nature Methods 2012 |
| DAPI | 4′,6-二脒基-2-苯基吲哚,DNA 嵌入型荧光染料,405 nm 激发,标记细胞核 |
| tissue cytometry | 组织细胞计量学:对组织切片(而非细胞悬液)做逐细胞定量分析与分群的方法学 |
| VTEA | Volumetric Tissue Exploration and Analysis,3D tissue cytometry 开源平台(Winfree et al., JASN 2017) |
| X-means | 自动确定簇数的 K-means 扩展聚类算法 |
| LS Connect3D | 商用 3D 图像分析与核分割软件,VTEA 流水线的分割组件 |
| NephNuc | 本数据集导出的细胞核训练库统称(5 种形态,§2.6) |
| NephNet2D/NephNet3D | 论文自设计的 2D/3D 细胞核分类网络 |
| balanced accuracy | 各类别召回率的算术平均,对类别不平衡稳健的评价指标 |
| nephrectomy | 肾切除术;本数据集组织来自遗体捐献供体肾切除术标本 |
| deceased donor | 遗体捐献供体;区别于活体供体 |
| z-stack | 共聚焦显微镜沿 z 轴逐层采集得到的三维图像堆栈 |
| MIP | Maximum Intensity Projection,最大强度投影:沿 z 轴取最大值压缩为 2D 的降维方式 |
| tile-scan | 显微镜分块扫描拼接大视野的采集方式 |
| Haralick texture | 基于灰度共生矩阵的纹理特征族 |
| PFTAS | 参数化阈值面积统计,CellProfiler 生态常用的局部强度结构特征 |
| spherical harmonics | 球谐函数展开,用于描述 3D 形状特征 |
| Zernike moments | Zernike 正交矩,2D 形状描述子 |
| in situ classification | 原位分类:在组织内直接对细胞分类,而非分离后分类 |
| with context | 输入中包含目标核周边像素/体素的组织学语境(对照 without context) |
| MedMNIST v2 | 轻量医学图像分类基准集系列(Sci Data 2023, 10(1):41),含 TissueMNIST 等 12 子集 |
| TissueMNIST | MedMNIST v2 第 6 号子集,BBBC051 的轻量衍生(28×28×1,236,386 样本) |
| early view | 期刊正式组卷期前的在线先行发表版本 |
| glomerulus(肾小球) | 肾单位的血液滤过结构,毛细血管丛 + 包曼囊;肾小球内皮与足细胞所在 |
| podocyte(足细胞) | 包曼囊脏层上皮细胞,构成滤过屏障的关键组分 |
| uromodulin(THP) | Tamm-Horsfall 蛋白,髓袢升支粗段特异性标志物 |
| NCC(SLC12A3) | 噻嗪类敏感钠氯共转运体,远曲小管特异性标志物 |
| 闰细胞 | 集合管的酸碱调节上皮细胞,本数据集未单列,归入集合管/连接小管类 |
| under/over-segmentation | 分割不足(两核并一)与过分割(一核拆二),§3.5 审计对象 |
| cell graph | 以细胞为节点、空间邻接为边的图表示,用于建模组织微环境 |
| npz | NumPy 压缩数组格式,MedMNIST 系列的标准分发格式 |
| per-class recall | 每个类别各自的召回率,balanced accuracy 的组成单位 |
| confusion matrix | 混淆矩阵:行真实类、列预测类的错误分布表,误差分析的标准工具 |
| immune phenotype space | 免疫表型空间:以各标志物阳性强度为坐标的多维特征空间,X-means 在此聚类 |
| 包曼囊(Bowman’s capsule) | 肾小球外侧的上皮性囊袋,足细胞贴附于其脏层 |
| 髓放线(medullary ray) | 皮质中向髓质延伸的小管束,髓袢升支粗段的分布区域之一 |
| 异染色质/常染色质 | 染色质的致密/疏松形态,DAPI 强度纹理差异的分子基础 |
| leave-one-out(留一法) | 每折留出一个单位(此处为 tissue sample)做验证的交叉验证方式 |
| MD5 | 消息摘要哈希,用于数据文件版本定版与完整性校验 |
| RAI | Responsible AI 的缩写;rai: 前缀的 schema_org 属性用于声明数据责任信息(如 dataLimitations) |
| cr:RecordSet | Croissant 元数据规范中的记录集节点,描述数据集的记录结构与键 |
| schema_org | 结构化元数据规范(schema.org),本库 frontmatter 以 @graph 节点式内嵌 |
附录
附录 A:官方资源链接速查
| 资源 | 地址 |
|---|---|
| BBBC051 官方页 | https://bbbc.broadinstitute.org/BBBC051 |
| BBBC 总表(image_sets) | https://bbbc.broadinstitute.org/image_sets |
| 本条目页 | https://www.qianfanghub.com/ai-ready-dataset/bbbc051/725 |
| MedMNIST 官网 | https://medmnist.com/ |
| MedMNIST 代码库(info.py 类名存档) | https://github.com/MedMNIST/MedMNIST |
| Zenodo(MedMNIST 分发) | https://zenodo.org/record/5208230 |
| VTEA 代码库 | https://github.com/icbm-iupui/volumetric-tissue-exploration-analysis |
| PubMed 主文献 | https://pubmed.ncbi.nlm.nih.gov/33252180/ |
| PubMed Central 全文 | https://www.ncbi.nlm.nih.gov/pmc/articles/PMC8382162/ |
链接访问备注:BBBC 官方页存在 bbbc.broadinstitute.org 与 data.broadinstitute.org 两个域名口径(内容同源);Zenodo record 编号访问地址为 zenodo.org/records/5208230;若任一链接失效,优先以 BBBC 官方页与 MedMNIST 官网的当前入口为准——两大官方页的互链是比本条目更新鲜的活性校验点。
附录 B:参考文献列表
- Woloshuk A, Khochare S, Almulhim AF, McNutt AT, Dean D, Barwinska D, Ferkowicz MJ, Eadon MT, Kelly KJ, Dunn KW, Hasan MA, El-Achkar TM, Winfree S. In Situ Classification of Cell Types in Human Kidney Tissue Using 3D Nuclear Staining. Cytometry Part A. 2021 Jul;99(7):707-721. doi:10.1002/cyto.a.24274. PMID 33252180. PMCID PMC8382162.(© 2020 ISAC;官方页 early view 口径 “Cytometry. 2020; 1–15”)
- Ljosa V, Carpenter AE, et al. Broad Bioimage Benchmark Collection(BBBC 总集论文). Nature Methods. 2012. doi:10.1038/nmeth.2083. PMCID PMC3627348.
- Winfree S, et al. Volumetric Tissue Exploration and Analysis(VTEA). J Am Soc Nephrol. 2017;28(7):2108-2118. doi:10.1681/ASN.2016091027. PMID 28154201.
- Ferkowicz MJ, et al. 完整 3D tissue cytometry 管线. Lab Invest. 2021. doi:10.1038/s41374-020-00518-w.(BBBC051 成像硬件参数的实际披露源)
- Yang L, et al. MedMNIST v2: A large-scale lightweight benchmark for 2D and 3D biomedical image classification. Scientific Data. 2023;10(1):41. doi:10.1038/s41597-022-01721-8. ISSN 2052-4463. arXiv:2110.14795.(DOI 经四源验证,坑点 7)
- VTEA 扩展版(集成 ML + neighborhood analysis). bioRxiv 2021.12.27.474025.
- Sci Rep. 2026. s41598-026-55088-6.("11 类压缩为 8 类"转述来源,仅存照,坑点 8)
附录 C:存照与口径裁定汇总
| 存照 | 议题 | 裁定 |
|---|---|---|
| ① | 任务书"合成肾皮质类器官" vs 实核 | 以磁盘 FACTS 为准:真实 deceased donor 人体肾皮质组织;冲突本身存照(坑点 1) |
| ② | selectdataset.com"MCF7 乳腺癌药物筛选" | 第三方张冠李戴,不采信(坑点 2) |
| ③ | 规模 690,000 / ~230,000 / 236,386 | 三口径并存、各有出处,引用注明口径(坑点 3) |
| ④ | 年份 2020(early view)vs 2021;99(7)(正式卷期) | 双口径并存,正文正式卷期优先(坑点 4) |
| ⑤ | 8 类类名公开程度 | BBBC 官方页未列名;论文 SI Table S1 定义 + MedMNIST info.py 完整存档互证(坑点 5) |
| ⑥ | Leica SP8 成像参数归属 | 归属 Ferkowicz Lab Invest 2021,非 BBBC051 论文直接披露(坑点 6) |
| ⑦ | MedMNIST v2 DOI | 023-02683-x 为讹传;四源一致裁定 10.1038/s41597-022-01721-8(坑点 7,新增存照) |
| — | 生成细节"upcoming publication" / “11 类压缩为 8 类” | 待核/无从核对,仅存照不采信(坑点 8) |
| — | 前任研究存档 §8 记录的 MedMNIST v2 DOI | 成稿采用四源裁定口径,错误口径降级为存照⑦的证据链 |
存照的使用规则:存照不是"正文免责声明",而是口径裁定的公开证据链。三条使用规则:其一,正文凡涉及存照议题,须链接坑点编号(读者可一跳到底);其二,存照内的"不采信"结论是终局性的——除非新证据(附录 I 触发点)出现,不得在正文复活讹误口径;其三,新增存照(如⑦)必须写明裁定方法(四源一致)与裁定日期,使后来者可以独立重跑验证。
附录 D:本条目编制信息
- 条目编码:bbbc051(库内 URL 占位 https://www.qianfanghub.com/ai-ready-dataset/bbbc051/725)
- 事实底座:writing/bbbc051/FACTS.md(前任代理 2026-09-29 存档,55 行 9 节),成稿前经五方向多源抽查复核(官方页/论文/TissueMNIST/DOI/BBBC 总表)
- 复核日期:2026-09-29;复核方向与新增存照⑦(DOI 纠错)详见附录 C 与附录 E
- 分类标签:category_tags 取自受控词表 92 词条(医学影像 / 病理图像 / 图像分类 / 评测基准)
- 编制流程:续写代理 agent-e-bbbc051ct 在租约锁(.lock)保护下完成;成稿方式为五 part 直写后拼接;校验以 scripts/check_md.py 与 scripts/preflight_check.py 双零为准
- 与 FACTS 的关系:成稿未删改 FACTS.md 任何行;FACTS §8 的 DOI 讹误经成稿期复核裁定后,修正口径入正文、原记录保留并入存照⑦
附录 E:成稿前复核日志(2026-09-29)
本条目成稿前对 FACTS 存档做了五个方向的抽查复核,均采用多源互证(≥2 独立来源),结论如下:
| 复核方向 | 核对点 | 结论 |
|---|---|---|
| BBBC 官方页 | 标题 Human kidney cortex cells、Version 1、Images.zip 2.9 GB 直链、ground truth 按 3 tissue samples 组织、groundtruthlabels.txt、CC BY 3.0(Andre Woloshuk)、联系人 awoloshu@iu.edu、“Cytometry. 2020; 1–15” 引用口径、“upcoming publication” 句 | 全部与 FACTS 一致,无出入 |
| BBBC 总表页 | BBBC051 行位于 Phenotype classification 分节;“BBBC051 Human kidney cortex cells Fluorescent 690,000” | 690,000 口径①从转述升级为官方页原文直接证实 |
| 论文(PubMed/PMC/Scholar) | Cytometry A. 2021 Jul;99(7):707-721、online 2020-12-13、ISSN 1552-4930、13 作者全名、PMID 33252180、PMCID PMC8382162、DOI 10.1002/cyto.a.24274、NephNet3D 80.26%、四机构、关键词、被引 35 | 全部与 FACTS 一致 |
| TissueMNIST(MedMNIST 官网/info.py/GitHub) | 236,386 = 165,466/23,640/47,280、32×32×7 → MIP → 28×28、MD5 ebe78ee8b05294063de985d821c1c34b、Zenodo 5208230、CC BY 3.0、MedMNIST+ 64/128/224、8 类类名全列 | 与 FACTS 一致;意外收获:info.py 完整列出 8 类类名,使存照⑤升级为"官方页未列名但两源存档互证",本条目得以列出 §2.5 类别表 |
| MedMNIST v2 DOI | FACTS §8 记 10.1038/s41597-023-02683-x;经 Dimensions/RWTH/BibSonomy/Bamberg 四源验证 | FACTS 有误:正确 DOI 为 10.1038/s41597-022-01721-8;成稿采用四源口径,原记录入新增存照⑦ |
复核遗留(维持存照,未闭环):官方页 “upcoming publication” 对应出版物未落实(坑点 8 前半);Sci Rep 2026 “11 类压缩为 8 类” 转述无从核对(坑点 8 后半)。
附录 F:口径速查卡(最常被引用的 12 个数字)
供快速引用与校对的"一张卡"——每个数字附正确口径与常见错误用法:
| 数字 | 正确口径 | 常见错误用法 |
|---|---|---|
| 690,000 | BBBC 总表 images(细胞)口径 | 误作"带标签细胞数" |
| ~230,000 | 论文口径完成八类分类的细胞 | 误作"图像张数" |
| 236,386 | TissueMNIST 衍生样本总数 | 误作"原始图像数" |
| 2.9 GB | Images.zip 体积 | 误作"全部数据量"(含标签文件) |
| 3 | tissue samples(供体标本)数 | 误作"3 种标记通道" |
| 8 | 细胞类型类数 | 误信"11 类压缩为 8 类"转述 |
| 50 μm | 切片厚度 | 误作"z-stack 步长" |
| 80.26% | NephNet3D balanced accuracy(3D 输入) | 误作 accuracy 或 2D 口径 |
| 42.20% | RF(3D + context)balanced accuracy | 误作 2D 口径或 SVM 成绩 |
| 32×32×7 → 28×28×1 | TissueMNIST 裁剪与 MIP 降维 | 误作 BBBC051 原始分辨率 |
| 2021;99(7):707-721 | 论文正式卷期 | 与官方页 2020 early view 口径混用 |
| CC BY 3.0 Unported | 图像 + GT 许可(允许商用) | 误记为 CC0 或 BY-NC |
附录 G:章节-证据映射表
本条目各章主要论断的证据来源分级:A = 论文/官方页原文直接证实(2026-09-29 复核);B = FACTS 存档(前任代理多源核过,本轮抽查未见出入);C = 标准学科通识(肾组织学/工程惯例,无 BBBC051 专属数字);D = 本条目基于 A/B 事实的工程推论或建议(不新增事实)。
| 章节 | 主要内容 | 证据级 |
|---|---|---|
| §0.1 问题背景 | 多重标记的四项限制 | C + B |
| §0.2 三步论证 | 三组标记 → 蒸馏 → 单通道闭环 | A/B |
| §1 十问十答 | 全部硬数字 | A/B |
| §2.1-2.3 分发包、标本、三形态 | 文件结构、3 例、50 μm、三形态 | A/B |
| §2.2 成像硬件 | Leica SP8 参数 | B(归属 Lab Invest 2021,坑点 6) |
| §2.4 三组标记实验 | 抗体组合表 | B |
| §2.5 八类定义与逐类小传 | 类名(A:MedMNIST info.py 存档);小传(C) | A/C |
| §2.6 NephNuc 五形态 | 导出口径 | B |
| §2.7-2.10 自查/场景/边界/工程 | 核对清单、边界声明 | D(边界基于 A/B 事实) |
| §3.1-3.4 VTEA 流水线 | 四步、成本经济学、蒸馏闭环 | A/B/D |
| §3.5-3.8 失败模式/复现/权衡/谱系 | 审计清单、时间线 | D(谱系时间点为 B) |
| §4 比较发现 | 消融矩阵、42.20% vs 80.26% | A/B;解读为 D |
| §5 Bench | 特征族、基准数字、协议建议 | A/B;协议为 D |
| §6 获取与许可 | 直链、CC BY 3.0、引用语、双口径 | A/B |
| §7 生态 | TissueMNIST 参数、加工链、DOI 纠错 | A/B |
| §8 方法学启示 | 五条经验、时间线、检查清单 | D(经验基于 A/B 事实) |
| §9 库内关系 | rid34/rid716 分工 | A(DB 复查) |
| §10 八个坑点 | 全部存照 | A/B |
| FAQ/术语/附录 | 数字对照、裁定汇总、复核日志 | A/B/D |
任何第三方复核本条目时,可按此表定位每个论断的证据等级——C/D 级内容均不携带 BBBC051 专属新数字,争议空间被压缩到 A/B 级(皆可溯源)。
附录 H:与任务书的差异声明
本条目接受任务时,任务描述中曾将 BBBC051 概括为"合成 human renal organoids"(合成人肾类器官)。经对磁盘 FACTS 存档与一手来源(BBBC 官方页、论文)的多源复核,该概括与实核冲突:BBBC051 的图像来自 deceased donor nephrectomy 人体肾皮质组织,非合成、非类器官(FACTS 存照①)。按"磁盘为准、一手来源裁定"的铁律,本条目全文采用修正口径撰写,冲突本身不入正文推演、仅在本附录与坑点 1 存照。这一处理与本库其他条目处理任务书讹误的惯例一致:修正内容、保留冲突痕迹、不沉默改写。
附录 I:后续维护触发点
维护原则:本条目的可审计性依赖"事实有源、裁定留痕"——后续更新时应保持两条纪律:更新硬数字必须同步更新事实清单与坑点口径(三处一致);触发存照议题的更新必须走附录 E 复核日志留痕(日期、来源、结论),不得静默修改正文口径。维护的判据永远是"与一手来源的一致性",而非"与上一版的一致性"——版本延续性让位于事实正确性。
以下事件发生时,本条目应触发复核更新(按优先级):
- 官方页发布 v2 或新增文件——更新 §6.1 获取表、§6.5 版本链、INFOBOX 数据行。
- 官方 “upcoming publication” 落地——即坑点 8 前半闭环:核实其与 BBBC051 生成细节的对应关系,更新 §2.2 官方披露程度与附录 E 复核日志。
- BBBC 总表口径变动(如 690,000 修订)——更新坑点 3 三口径表与事实清单。
- MedMNIST 侧更新(TissueMNIST 版本/MD5/MedMNIST+ 变化)——更新 §7.1 参数表,并核对许可声明是否仍与母体一致。
- 第三方出现新的可核对口径(如"11 类压缩为 8 类"找到原始出处)——按坑点 8 的存照流程更新裁定。
- 论文被引显著增长或出现重要独立复现——更新 §7.4 被引口径与 §5.3 的"外部校验"备注。
附录 K:检索关键词正误对照
| 目的 | 推荐关键词 | 避免关键词(及原因) |
|---|---|---|
| 找本数据集 | BBBC051;human kidney cortex cells;kidney cortex DAPI | organoid kidney(坑点 1);MCF7 kidney(坑点 2) |
| 找同类任务数据 | tissue cytometry;in situ cell type classification;nuclear morphology classification | — |
| 找轻量衍生 | TissueMNIST;MedMNIST kidney | 误把 TissueMNIST 样本数当 BBBC051 规模(坑点 3) |
| 找方法论文 | Woloshuk 2021;10.1002/cyto.a.24274;PMID 33252180 | — |
| 找标注平台 | VTEA;volumetric tissue exploration analysis;Winfree 2017 | — |
| 找衍生论文口径 | MedMNIST v2;10.1038/s41597-022-01721-8 | 10.1038/s41597-023-02683-x(坑点 7 讹传 DOI) |
附录使用总图:A 找链接 → B 找文献 → C 找口径裁定 → D 看编制背景 → E 看复核日志 → F 查数字 → G 查证据等级 → H 看任务书冲突处理 → I 看维护触发 → K 查检索词 → L 看 DAIMS 评分。十一个附录按"引用一篇 BBBC051 相关成果"的典型顺序排列:先 A 定资源,再 B 定引文,再 C/F/E 校数字,L 给整体质量评级,其余按需。本条目正文(§0-§10)与附录的分工是:正文给叙事与判断,附录给可核查的骨架——两层互为索引,任一层发现的问题都能定位到另一层的对应条目。
附录 L:DAIMS 评估全表
DAIMS 五维(Discoverability 可发现性 / Accessibility 可获取性 / Interoperability 可互操作 / Metadata 元数据质量 / Sustainability 可持续性),按本库统一口径 1-10 分:
| 维度 | 评分(1-10) | 依据 |
|---|---|---|
| D 可发现性 | 8 | BBBC 总表 + 官方页双入口、论文开放获取(PMC8382162)、衍生 TissueMNIST 在 MedMNIST 官网高频曝光;扣分项:官方页不列 8 类类名(坑点 5)、第三方聚合页讹误密集(坑点 1、坑点 2)干扰检索 |
| A 可获取性 | 9 | 双文件(Images.zip 2.9 GB + groundtruthlabels.txt)官方直链、无注册无请求制、CC BY 3.0 允许商用——本维度近乎满分;微扣:仅整包下载无按需子集、无官方镜像 |
| I 可互操作 | 6 | TIFF + 纯文本标签为通用格式、三形态导出降低使用门槛;扣分项:无官方机器可读元数据(无 Dataset card/Croissant 实例)、标签与图像的关联格式需自行解析、无官方转换脚本 |
| M 元数据质量 | 7 | 类名有论文 SI 定义 + MedMNIST info.py 存档双源互证、规模/许可/联系人在官方页齐备;扣分项:生成细节披露不全(“upcoming publication” 未落地,坑点 8)、规模三口径并存需读者自辨(坑点 3) |
| S 可持续性 | 7 | Broad Institute 平台级托管、Version 1 冻结稳定、衍生生态(MedMNIST v2)持续活跃反哺;扣分项:内容维护联系人依赖个人邮箱(awoloshu@iu.edu,单点风险)、v2 无时间表 |
| 综合评级 | 7.4/10(中上) | 获取性与可发现性是强项(直链 + 宽许可 + 双生态曝光);互操作与元数据被"手工时代"发布方式拖低——2019-2020 年发布的 3D 数据集的典型画像,且其短板多数可由本条目这类二级文档部分补偿 |
DAIMS 评分为本库编辑部的标准化评估口径,依据为官方页、论文与本条目复核日志(附录 E)的可见事实;评分反映"当前时点"状态,附录 I 的触发点事件(如官方补齐生成细节或上线机器可读元数据)将直接抬升对应维度评分。
附录 J:本条目未覆盖、需读者自查的事项清单
以下信息 FACTS 存档未收录、本条目不予转写(避免转写失真),需用时请直接查对应一手来源:
| 事项 | 去哪查 | 说明 |
|---|---|---|
| groundtruthlabels.txt 的内部字段格式 | 数据包内文件本身 + 官方页说明 | 加载前以实际文件为准 |
| 图像位深、逐文件像素尺寸、z 轴步长 | 数据包内 TIFF 元数据 | 建议脚本化批量提取并随实验存档 |
| 8 类各自的精确样本量分布 | groundtruthlabels.txt 统计 | 论文可能另有表格,以 SI 为准 |
| NephNet2D / ResNet-31 的具体成绩 | 论文结果表(§4.3、§5.3 已留口径说明) | 本条目存档未收录 |
| 伦理审批与供体知情同意的具体机制 | 论文 ethics 声明 / 联系维护方 | 官方页未展开(§6.2 已提示) |
| 每例标本的取材区域与面积 | 论文 Methods / Lab Invest 2021 | 生成细节真空的一部分(坑点 8) |
| TissueMNIST 裁块时的边界处理细节 | MedMNIST 代码库(数据生成脚本) | 本条目 §7.2 只描述链路主干 |
| VTEA 扩展版的 neighborhood analysis 细节 | bioRxiv 2021.12.27.474025 | 本条目 §3.8 仅定位其在谱系中的位置 |
| 官方页是否新增伦理声明或 FAQ | BBBC 官方页当前版本 | 本条目按 2026-09-29 时点记录 |
| NephNet 网络的具体层数/通道配置 | 论文 Methods/SI 或代码 | 本条目只记录"自设计 2D/3D"的存在性与相对结论 |
这份清单与附录 G 的证据分级配合使用:表中各项在正文均无替代性转写——凡本条目未给出的数字,正文中也不会以模糊措辞冒充给出。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- acevedo-blood — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- camelyon17 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- nct-crc-he-100k — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- medmnist — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- bbbc — 共享标签:医学影像 / 病理图像 / 评测基准
- pcam — 共享标签:病理图像 / 图像分类 / 评测基准
- neptune — 共享标签:医学影像 / 病理图像 / 图像分类
- panda-plus — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- biomedica — 共享标签:医学影像 / 图像分类 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

