癌症单细胞转录图谱数据集
该数据集包含 7,930 个单细胞的转录组表达数据,涵盖三种不同生物学状态:健康免疫基线、液体肿瘤(髓样白血病)以及实体肿瘤微环境(黑色素瘤),旨在构建一个跨队列整合的单细胞分析基准,为算法性能评估与方法学对比、多队列批次效应校正(Batch Correction)、免疫耗竭状态分析、跨肿瘤类型生物标志物挖掘提供基准。
基本信息
资源简介
该数据集包含 7,930 个单细胞的转录组表达数据,涵盖三种不同生物学状态:健康免疫基线、液体肿瘤(髓样白血病)以及实体肿瘤微环境(黑色素瘤),旨在构建一个跨队列整合的单细胞分析基准,为算法性能评估与方法学对比、多队列批次效应校正(Batch Correction)、免疫耗竭状态分析、跨肿瘤类型生物标志物挖掘提供基准。
数据集构成
:
Cohort A:健康免疫基线(约 2,700 个细胞)
来源:10x Genomics PBMC3k
生物学背景:健康供体外周血单个核细胞(PBMCs),作为免疫稳态对照基线
作用:用于对比肿瘤相关免疫状态变化
Cohort B:液体肿瘤 / 髓样白血病(约 2,730 个细胞)
来源:Paul et al., 2015
生物学背景:髓样祖细胞及白血病相关细胞状态的单细胞转录组数据
作用:代表血液系统恶性肿瘤模型
Cohort C:实体肿瘤微环境(约 2,500 个细胞)
来源:Tumor Immune Cell Atlas (TICAtlas)
生物学背景:来源于黑色素瘤等实体瘤微环境中的免疫细胞与恶性细胞,包括耗竭 T 细胞、巨噬细胞及肿瘤细胞
作用:用于研究实体瘤免疫抑制与细胞异质性
下载信息
注册下载
Tips: 该数据集需要在对应的数据源网站注册通过后,才能进行数据下载,注册有对应要求,或者需要收费。
需登录公开下载
Tips: 该数据集属于公开下载,应该可以免费公开下载。
暂未开放有偿下载
Tips: 该数据集 Qianfanghub 可以协助提供有偿下载服务,注意,服务不针对数据相关产权,只是技术服务费。
提供高速下载与技术交付服务(收技术服务费,非数据销售)
暂未开放千方医数集,医疗数据集部分,是为社区服务的公开医疗数据集搜索引擎,并不存储或者下载原始的任何数据。 如果您有其他医疗数据需求,可以和客服联系,或者下工单。我们有强大的三甲医疗机构帮助您提供个性化的医疗数据定制、采集、标注服务。
使用方式
数据集获取
方式一:KaggleHub(Python,推荐 AI Agent 使用)
# 前置依赖: pip install kagglehub
import kagglehub
path = kagglehub.dataset_download("qasimhu/pan-cancer-scrna-seq-atlas")
print("数据已下载至:", path)
方式二:Kaggle CLI(命令行)
# 前置条件: 注册 Kaggle 账号, Settings > API > Create New Token
# 将 kaggle.json 放到 ~/.kaggle/ 并 chmod 600
pip install kaggle
kaggle datasets download -d qasimhu/pan-cancer-scrna-seq-atlas
unzip pan-cancer-scrna-seq-atlas.zip -d pan-cancer-scrna-seq-atlas/
数据集大小约 0.07 GB。
数据说明
该数据集包含 7,930 个单细胞的转录组表达数据,涵盖三种不同生物学状态:健康免疫基线、液体肿瘤(髓样白血病)以及实体肿瘤微环境(黑色素瘤),旨在构建一个跨队列整合的单细胞分析基准,为算法性能评估与方法学对比、多队列批次效应校正(Batch Correction)、免疫耗竭状态分析、跨肿瘤类型生物标志物挖掘提供基准。 数据集构成 : Cohort A:健康免疫基线(约 2,700 个细胞) 来源:10x Genomics PBMC3k 生物学背景:健康供体外周血单个核细胞(PBMCs),作为免疫稳态对照基线 作用:用于对比肿瘤相关免疫状态变化 Cohort B:液体肿瘤 / 髓样白血病(约 2,730 个细胞) 来源:Paul et al., 2015 生物学背景:髓样祖细胞及白血病相关细胞状态的单细胞转录组数据 作用:代表血液系统恶性肿瘤模型 Cohort C:实体肿瘤微环境(约 2,500 个细胞) 来源:Tumor Immune Cell Atlas (TICAtlas) 生物学背景:来源于黑色素瘤等实体瘤微环境中的免疫细胞与恶性细胞,包括耗竭 T 细胞、巨噬细胞及肿瘤细胞 作用:用于研究实体瘤免疫抑制与细胞异质性
数据加载示例(图像类)
from PIL import Image
import glob, os
files = (glob.glob(os.path.join(path, "**", "*.png"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.jpg"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.tif"), recursive=True))
print("图像文件数:", len(files))
img = Image.open(files[0]); print("尺寸/模式:", img.size, img.mode)
# torchvision Dataset 方式:
# from torchvision import datasets
# ds = datasets.ImageFolder(path) # 要求 子目录=类别
目录组织与标注格式以源站说明和下载后实际文件为准。
许可
CC BY 4.0
精度瓶颈?数据缺失?
当前公开数据无法满足您的算法精度?千方提供针对 癌症(总论) 的高质量、多模态真实临床数据定制解决方案。




