7个卵巢癌数据集
该数据集整合了7个卵巢癌相关数据集,包含529例病例和65例对照样本,数据模态涉及基因表达、临床表格等多种类型,主要用于卵巢癌的医学研究,支持生物信息学分析、诊断模型构建和预后评估等方向。
基本信息
资源简介
7个卵巢癌数据集
【数据集背景】
本数据集源站标题为《7 ovarian cancer datasets》,为 7 ovarian cancer datasets 的组成部分。源站首次发布:2024-04-21。
【数据内容】
源站原始描述:Ovarian tumors are tumors that develop in the ovaries. Because the ovary contains a variety of cells that are actively dividing, a wide variety of tumors exist. The exact cause is not known. Because of the lack of subjective symptoms, it is extremely common for the disease to be detected as an advanced cancer. We have prepared 6 microarray datasets for ovarian cancer. Now, let''s use machine learning to find important transcripts! Source ① GSE6008 ② GSE9891 ③ GSE18520 ④ GSE38666 ⑤ GSE66957 ⑥ GSE6…
【数据结构与技术规格】
文件数 16 个,合计 1.98 GB。
【主题与分类】
主题标签:cancer、classification、tabular、data analytics、clustering。
【获取与许可】
源站页面:https://www.kaggle.com/datasets/yoshifumimiya/6-ovarian-cancer-datasets
使用许可:Unknown。
下载信息
注册下载
需要注册 Kaggle 账号并登录后下载,适合需要跟踪下载记录和使用 API 的用户。
需登录公开下载
无需注册即可直接获取公开样本或文档,适合快速预览和评估数据集质量。
暂未开放有偿下载
公开数据集受托下载与技术交付服务。
提供高速下载与技术交付服务(收技术服务费,非数据销售)
暂未开放当前数据集主要来源为 Kaggle 公开托管,完整影像包建议通过原始链接或 Kaggle API 获取。
使用方式
数据集获取
方式一:KaggleHub(Python,推荐 AI Agent 使用)
# 前置依赖: pip install kagglehub
import kagglehub
path = kagglehub.dataset_download("yoshifumimiya/6-ovarian-cancer-datasets")
print("数据已下载至:", path)
方式二:Kaggle CLI(命令行)
# 前置条件: 注册 Kaggle 账号, Settings > API > Create New Token
# 将 kaggle.json 放到 ~/.kaggle/ 并 chmod 600
pip install kaggle
kaggle datasets download -d yoshifumimiya/6-ovarian-cancer-datasets
unzip 6-ovarian-cancer-datasets.zip -d 6-ovarian-cancer-datasets/
数据说明
该数据集是一个整合了7个卵巢癌相关数据集的集合,包含529例卵巢癌病例和65例对照样本(可能还有额外数据)。数据集来源于Kaggle平台,以公开可下载的形式提供,主要用于卵巢癌的医学研究,支持基因表达、临床特征分析等方向,适用于生物信息学、癌症诊断和预后模型开发等应用场景。
数据加载示例(表格/文本类)
import pandas as pd, glob, os
files = (glob.glob(os.path.join(path, "**", "*.csv"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.tsv"), recursive=True)
+ glob.glob(os.path.join(path, "**", "*.xlsx"), recursive=True))
print("数据文件:", files)
df = pd.read_csv(files[0])
print(df.shape); print(df.columns.tolist()); print(df.head(3))
数据缺失?
依托陕西、四川两大基地,我们与超过十家三甲医院建立直接合作关系,覆盖合规授权、采集治理、专业标注、数据交付的全流程,为AI医疗团队提供即拿即用的高质量临床数据。
⚡️ 需要数据支持或标注服务?立即联系我们获取专业方案。




