肺癌风险数据集

Lung Cancer Risk 是于 2025 年发布的一个面向肺癌风险预测与健康因素分析的表格型数据集,旨在通过多维特征探索吸烟习惯、生活方式与肺癌风险之间的关联。

kaggle
2025-08-23 更新
浏览 13
影像、表格分类、检测、预测

基本信息

模态
影像、表格
大小
0.01 GB
数据量
50000
任务类型
分类、检测、预测
许可
CC0 1.0
创建/更新时间
2025-08-23

资源简介

Lung Cancer Risk 是于 2025 年发布的一个面向肺癌风险预测与健康因素分析的表格型数据集,旨在通过多维特征探索吸烟习惯、生活方式与肺癌风险之间的关联。

该数据集包含 50,000 条基于已知肺癌风险因素(例如生活习惯、环境暴露和家族史等)的患者资料,阳性病例约占 25%,反映了现实中肺癌的患病率。每条样本均由多个健康与行为特征构成,适用于肺癌风险建模、医学机器学习研究、健康预测系统开发与教学实验,尤其在分类建模和风险评估场景中具有良好的参考价值。

数据构成:

每条样本包含多个维度的健康与行为特征,主要包括:

基本信息:年龄、性别

生活习惯:吸烟情况、饮酒频率

健康因素:慢性疾病(如高血压、糖尿病)、肺部相关诊断

环境暴露:氡气水平、石棉暴露、二手烟暴露

家族史:家族中是否有癌症或肺部疾病史

目标变量:肺癌诊断结果(是否患癌)

原始链接

https://www.kaggle.com/datasets/mikeytracegod/lung-cancer-risk-dataset

访问原始数据

官方服务

如需原始数据获取支持或标注服务,请联系我们。

帮我联系

下载信息

注册下载

Tips: 该数据集需要在对应的数据源网站注册通过后,才能进行数据下载,注册有对应要求,或者需要收费。

需登录

公开下载

Tips: 该数据集属于公开下载,应该可以免费公开下载。

暂未开放

有偿下载

Tips: 该数据集 Qianfanghub 可以协助提供有偿下载服务,注意,服务不针对数据相关产权,只是技术服务费。

提供高速下载与技术交付服务(收技术服务费,非数据销售)

暂未开放

千方医数集,医疗数据集部分,是为社区服务的公开医疗数据集搜索引擎,并不存储或者下载原始的任何数据。 如果您有其他医疗数据需求,可以和客服联系,或者下工单。我们有强大的三甲医疗机构帮助您提供个性化的医疗数据定制、采集、标注服务。

使用方式

数据集获取

方式一:KaggleHub(Python,推荐 AI Agent 使用)

# 前置依赖: pip install kagglehub
import kagglehub

path = kagglehub.dataset_download("mikeytracegod/lung-cancer-risk-dataset")
print("数据已下载至:", path)

方式二:Kaggle CLI(命令行)

# 前置条件: 注册 Kaggle 账号, Settings > API > Create New Token
# 将 kaggle.json 放到 ~/.kaggle/ 并 chmod 600
pip install kaggle
kaggle datasets download -d mikeytracegod/lung-cancer-risk-dataset
unzip lung-cancer-risk-dataset.zip -d lung-cancer-risk-dataset/

数据说明

Lung Cancer Risk 是于 2025 年发布的一个面向肺癌风险预测与健康因素分析的表格型数据集,旨在通过多维特征探索吸烟习惯、生活方式与肺癌风险之间的关联。 该数据集包含 50,000 条基于已知肺癌风险因素(例如生活习惯、环境暴露和家族史等)的患者资料,阳性病例约占 25%,反映了现实中肺癌的患病率。每条样本均由多个健康与行为特征构成,适用于肺癌风险建模、医学机器学习研究、健康预测系统开发与教学实验,尤其在分类建模和风险评估场景中具有良好的参考价值。 数据构成: 每条样本包含多个维度的健康与行为特征,主要包括: 基本信息:年龄、性别 生活习惯:吸烟情况、饮酒频率 健康因素:慢性疾病(如高血压、糖尿病)、肺部相关诊断 环境暴露:氡气水平、石棉暴露、二手烟暴露 家族史:家族中是否有癌症或肺部疾病史 目标变量:肺癌诊断结果(是否患癌)

数据加载示例(图像类)

from PIL import Image
import glob, os

files = (glob.glob(os.path.join(path, "**", "*.png"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.jpg"), recursive=True)
       + glob.glob(os.path.join(path, "**", "*.tif"), recursive=True))
print("图像文件数:", len(files))
img = Image.open(files[0]); print("尺寸/模式:", img.size, img.mode)

# torchvision Dataset 方式:
# from torchvision import datasets
# ds = datasets.ImageFolder(path)  # 要求 子目录=类别

目录组织与标注格式以源站说明和下载后实际文件为准。

许可

CC0 1.0

精度瓶颈?数据缺失?

当前公开数据无法满足您的算法精度?千方提供针对 癌症(总论) 的高质量、多模态真实临床数据定制解决方案。

获取专属数据定制方案