7个卵巢癌数据集

该数据集整合了7个卵巢癌相关数据集,包含529例病例和65例对照样本,数据模态涉及基因表达、临床表格等多种类型,主要用于卵巢癌的医学研究,支持生物信息学分析、诊断模型构建和预后评估等方向。

Octopus210Octopus210
kaggle
2024-04-21 更新
浏览 49
cancerclassificationtabulardata analyticsclustering

基本信息

大小
1.98 GB
许可
Unknown
创建/更新时间
2024-04-21
版本
v14

资源简介

7个卵巢癌数据集

【数据集背景】

本数据集源站标题为《7 ovarian cancer datasets》,为 7 ovarian cancer datasets 的组成部分。源站首次发布:2024-04-21。

【数据内容】

源站原始描述:Ovarian tumors are tumors that develop in the ovaries. Because the ovary contains a variety of cells that are actively dividing, a wide variety of tumors exist. The exact cause is not known. Because of the lack of subjective symptoms, it is extremely common for the disease to be detected as an advanced cancer. We have prepared 6 microarray datasets for ovarian cancer. Now, let''s use machine learning to find important transcripts! Source ① GSE6008 ② GSE9891 ③ GSE18520 ④ GSE38666 ⑤ GSE66957 ⑥ GSE6…

【数据结构与技术规格】

文件数 16 个,合计 1.98 GB。

【主题与分类】

主题标签:cancer、classification、tabular、data analytics、clustering。

【获取与许可】

源站页面:https://www.kaggle.com/datasets/yoshifumimiya/6-ovarian-cancer-datasets

使用许可:Unknown。

官方服务

专家保障全链路合规授权与标注交付

陕川双基地 × 超十家三甲医院直连

从合规授权、采集治理、专业标注到数据集交付,我们提供全链路闭环服务,让高质量临床数据即拿即用。

⚡️ 需要原始数据或标注支持?联系我们获取定制方案。

帮我联系

下载信息

注册下载

需要注册 Kaggle 账号并登录后下载,适合需要跟踪下载记录和使用 API 的用户。

需登录

公开下载

无需注册即可直接获取公开样本或文档,适合快速预览和评估数据集质量。

暂未开放

有偿下载

公开数据集受托下载与技术交付服务。

提供高速下载与技术交付服务(收技术服务费,非数据销售)

暂未开放

当前数据集主要来源为 Kaggle 公开托管,完整影像包建议通过原始链接或 Kaggle API 获取。

使用方式

数据集获取

方式一:KaggleHub(Python,推荐 AI Agent 使用)

# 前置依赖: pip install kagglehub
import kagglehub

path = kagglehub.dataset_download("yoshifumimiya/6-ovarian-cancer-datasets")
print("数据已下载至:", path)

方式二:Kaggle CLI(命令行)

# 前置条件: 注册 Kaggle 账号, Settings > API > Create New Token
# 将 kaggle.json 放到 ~/.kaggle/ 并 chmod 600
pip install kaggle
kaggle datasets download -d yoshifumimiya/6-ovarian-cancer-datasets
unzip 6-ovarian-cancer-datasets.zip -d 6-ovarian-cancer-datasets/

数据说明

该数据集是一个整合了7个卵巢癌相关数据集的集合,包含529例卵巢癌病例和65例对照样本(可能还有额外数据)。数据集来源于Kaggle平台,以公开可下载的形式提供,主要用于卵巢癌的医学研究,支持基因表达、临床特征分析等方向,适用于生物信息学、癌症诊断和预后模型开发等应用场景。

数据加载示例(表格/文本类)

import pandas as pd, glob, os

files = (glob.glob(os.path.join(path, "**", "*.csv"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.tsv"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.xlsx"), recursive=True))
print("数据文件:", files)
df = pd.read_csv(files[0])
print(df.shape); print(df.columns.tolist()); print(df.head(3))

数据缺失?

依托陕西、四川两大基地,我们与超过十家三甲医院建立直接合作关系,覆盖合规授权、采集治理、专业标注、数据交付的全流程,为AI医疗团队提供即拿即用的高质量临床数据。

⚡️ 需要数据支持或标注服务?立即联系我们获取专业方案。

获取专属数据定制方案