TCGA-RNA-Seq

TCGA项目的RNA测序数据,用于基因表达调控分析和疾病相关基因变异研究。

maasmaas
魔搭社区
2026-07-13 更新
浏览 7
基因组疾病相关基因变异基因表达调控分析

基本信息

模态
基因组
创建/更新时间
2026-07-13

资源简介

该数据集包含癌症基因组图谱(TCGA)项目的RNA测序数据,用于基因表达调控分析、疾病相关基因变异与精准医疗研究。

原始链接

https://modelscope.cn/datasets/ai4s/TCGA-RNA-Seq

访问原始数据

官方服务

如需原始数据获取支持或标注服务,请联系我们。

帮我联系

下载信息

注册下载

Tips: 该数据集需要在对应的数据源网站注册通过后,才能进行数据下载,注册有对应要求,或者需要收费。

暂未开放

公开下载

Tips: 该数据集属于公开下载,应该可以免费公开下载。

免登录

有偿下载

Tips: 该数据集 Qianfanghub 可以协助提供有偿下载服务,注意,服务不针对数据相关产权,只是技术服务费。

提供高速下载与技术交付服务(收技术服务费,非数据销售)

暂未开放

千方医数集,医疗数据集部分,是为社区服务的公开医疗数据集搜索引擎,并不存储或者下载原始的任何数据。 如果您有其他医疗数据需求,可以和客服联系,或者下工单。我们有强大的三甲医疗机构帮助您提供个性化的医疗数据定制、采集、标注服务。

使用方式

数据集获取(ModelScope)

方式一:MsDataset(Python)

# 前置依赖: pip install modelscope
from modelscope.msdatasets import MsDataset

ds = MsDataset.load("ai4s/TCGA-RNA-Seq", subset_name="default", split="train")
print(ds)

方式二:CLI(命令行)

pip install modelscope
modelscope download dataset ai4s/TCGA-RNA-Seq

数据集卡片摘录(源站)

数据集说明

综合​**:RNA测序数据(RNA-Seq)是 TCGA 的核心数据类型之一,为癌症机制探索、亚型划分和预后标志物筛选提供了基础。**

1. 背景介绍

TCGA(The Cancer Genome Atlas)项目是由美国国立癌症研究所(NCI)和国家人类基因组研究所(NHGRI)联合发起的癌症组学研究项目,旨在通过大规模测序和多组学技术揭示不同类型肿瘤的分子特征。其中,RNA测序数据(RNA-Seq)是 TCGA 的核心数据类型之一,为后续癌症机制探索、亚型划分和预后标志物筛选提供了基础。

UCSC Xena 是一个由加州大学圣克鲁兹分校开发的癌症数据可视化和下载平台,它对 TCGA 的原始 RNA-Seq 数据进行了统一整合和标准化处理,使研究者能够以可比性强的方式访问跨癌种的转录组数据。

2. 数据类型与处理流程

原始数据来源

  • RNA-Seq 原始数据由 Illumina 平台测序,测序对象为 polyA+ mRNA。
  • 测序样本主要包括肿瘤组织样本和部分对应的正常组织样本。

表达矩阵类型

| 表达单位 | 说明
| : | :- |
| HTSeq raw counts |基于 GENCODE 注释的原始基因计数值,适用于差异表达分析(如DESeq2)。|
| FPKM | 考虑基因长度和测序深度的标准化表达单位,适用于横向比较。|
| FPKM-UQ|在FPKM基础上进行上四分位数归一化,适用于横向比较与可视化。|
|log2(x + 1) |对FPKM-UQ数据进行log转换,常用于聚类、热图和生存分析。
| TPM(部分来源于GDC或Xena派生) |更适合在样本间进行表达强度比较。
UCSC Xena 平台通常提供 log2(FPKM-UQ + 1) 处理版本的数据作为默认下载格式。

注释版本与基因集

  • GENCODE v22 是主要使用的基因注释版本。
  • 包含全部编码基因(protein-coding)与部分长链非编码RNA(lncRNA)。
  • 通常以 ENSEMBL ID 形式记录,同时提供基因名称映射。
  • 所有表达矩阵与 phenotype 文件对齐,便于分析。

3. 样本覆盖范围

  • 覆盖33种癌症,包括​:
    | 缩写 | 中文名称 | 英文全称 | 系统分类 |
    | — | — | — | — |
    | ACC | 肾上腺皮质癌 | Adrenocortical carcinoma | 内分泌系统 |
    | BLCA | 膀胱尿路上皮癌 | Bladder Urothelial Carcinoma | 泌尿系统 |
    | BRCA | 乳腺浸润性癌 | Breast Invasive Carcinoma | 生殖系统 |
    | CESC | 宫颈鳞癌与腺癌 | Cervical Squamous Cell Carcinoma and Endocervical Adenocarcinoma | 生殖系统 |
    | CHOL | 肝外胆管癌 | Cholangiocarcinoma | 消化系统 |
    | COAD | 结肠腺癌 | Colon Adenocarcinoma | 消化系统 |
    | DLBC | 弥漫大 B 淋巴瘤 | Diffuse Large B-cell Lymphoma | 淋巴系统 |
    | ESCA | 食管癌 | Esophageal Carcinoma | 消化系统 |
    | GBM | 胶质母细胞瘤 | Glioblastoma Multiforme | 神经系统 |
    | HNSC | 头颈鳞癌 | Head and Neck Squamous Cell Carcinoma | 呼吸/消化交界区 |
    | KICH | 肾集合管癌

许可

Apache License 2.0

数据加载示例(表格/文本类)

import pandas as pd, glob, os

files = (glob.glob(os.path.join(path, "**", "*.csv"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.tsv"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.xlsx"), recursive=True))
print("数据文件:", files)
df = pd.read_csv(files[0])
print(df.shape); print(df.columns.tolist()); print(df.head(3))

源站:modelscope.cn/datasets/ai4s/TCGA-RNA-Seq

精度瓶颈?数据缺失?

当前公开数据无法满足您的算法精度?千方提供针对 癌症(总论) 的高质量、多模态真实临床数据定制解决方案。

获取专属数据定制方案