Global Burden of Disease (GBD) — 全球疾病负担综合评估面板数据集 AI-Ready Wikipedia | 千方医数集

375种疾病·88种风险因素·204国·660子国家级·1990-2023·310K+数据源

来源 IHME (Institute for Health Metrics and Evaluation), University of Washington url: https://www.healthdata.org/发布时间: 2026-08-14最后更新: 2026-08-14 阅读 48

信息速览

数据集名称Global Burden of Disease (GBD) — 全球疾病负担综合评估面板数据集 AI-Ready Wikipedia | 千方医数集
数据类型375种疾病与伤害,88种风险因素,204国家+660子国家级
规模覆盖全球204国约80亿人口
接入方式 IHME (Institute for Health Metrics and Evaluation), University of Washington url: https://www.healthdata.org/
AI 就绪度

数据集封面

INFOBOX

属性
全称 Global Burden of Diseases, Injuries, and Risk Factors Study
简称 GBD
当前版本 GBD 2023(2025-10-12 发表于 The Lancet)
运营机构 Institute for Health Metrics and Evaluation (IHME),华盛顿大学
首席研究员 Christopher J.L. Murray, MD, DPhil
共同创始人 Alan D. Lopez(已故)
覆盖范围 204 个国家与地区 + 660 个子国家级区域(GBD 2023)
疾病/伤害数 375 种(GBD 2023)/ 371 种(GBD 2021)/ 369 种(GBD 2019)
风险因素数 88 种可改变风险因素,631 个风险-结局对
时间跨度 1990-2023(GBD 2023)
数据源数量 310,000+(GBD 2023),其中 30% 为本轮新增
核心指标 Deaths / YLLs / YLDs / DALYs / HALE / Incidence / Prevalence / MMR / Life Expectancy
核心模型 CODEm / DisMod-MR 2.1 / CRA / MR-BRT / OneMod
复合指数 SDI(社会人口指数)/ HAQ(医疗可及性与质量指数)
不确定性 250 次抽样,95% UI = 第 2.5-97.5 百分位数
合作者 2,780 名(GBD 2023),来自 160+ 个国家
数据格式 CSV(主下载格式)/ JSON(API)/ HTML(可视化)
访问方式 GBD Results Tool / GHDx / GBD Compare / API(免费注册)
许可证 IHME 非商业免费使用协议(CC BY-NC-ND 4.0 用于可视化)
费用 非商业用途免费;商业用途需许可
主要基金 Bill & Melinda Gates Foundation
核心期刊 The Lancet(旗舰出版物)
引用规模 GBD 2010 系列论文累计引用 40,000+ 次(单篇最高 10,900+)
ICD-11 映射 GBD 疾病分类体系与 ICD-11 兼容,覆盖全疾病谱
SNOMED CT GBD 疾病层级映射至 SNOMED CT 临床概念
DUO 标签 无个体数据(汇总统计),无 DUO 限制
DAIMS 评分 20/24(83.3%)⭐⭐⭐⭐☆
AI 就绪度 面板数据格式,适用于时间序列预测、风险归因建模、跨国家比较 ML

§0 E-E-A-T 信任声明与免责声明

信任维度

维度 说明
经验性 (Experience) GBD 自 1990 年发起,已有 30+ 年方法学积累,历经 9 轮迭代(GBD 1990/2010/2013/2015/2016/2017/2019/2021/2023),每轮扩展覆盖范围并改进方法
专业性 (Expertise) IHME 是华盛顿大学医学院下属独立研究机构,PI Christopher J.L. Murray 为 GBD 方法创始人、美国国家医学院院士、2018 年 Canada Gairdner 全球健康奖得主
权威性 (Authoritativeness) GBD 估计被 WHO、世界银行、联合国、各国卫生部广泛引用和使用,是全球健康指标的事实标准
可信赖性 (Trustworthiness) 遵循 GATHER 指南(Guidelines for Accurate and Transparent Health Estimates Reporting),所有数据源、代码、方法公开可查,250 次抽样不确定性区间透明报告
透明性 (Transparency) 所有输入数据源可在 GBD Sources Tool 查询,建模代码在 GHDx 公开,方法学附录在 The Lancet 发表
独立性 (Independence) IHME 独立于 WHO 和各国政府,方法论评估与倡导分离,避免利益冲突

审核机制

  • [千方病案医学编辑部]交叉审核:本条目的疾病分类、ICD-11 映射、临床意义评估由千方病案医学编辑部交叉审核
  • GBD 同行评审:每轮 GBD 结果均在 The Lancet 发表前经过严格同行评审
  • 合作者网络审查:2,780 名来自 160+ 国家的合作者审查各自国家/地区的估计值

透明度声明

本页面基于 GBD 2023(2025-10-12 发布)公开数据编写。所有数据源、方法学和代码均可通过 IHME 官方网站(healthdata.org)和 GHDx(ghdx.healthdata.org)访问。GBD 估计会随新数据和方法改进而更新,不同轮次之间存在差异。

免责声明

本页面为数据集百科条目,不构成医疗建议或健康政策建议。GBD 估计为人群层面的统计推断,不适用于个体健康决策。数据使用者应阅读 IHME 使用条款并引用相应 GBD 轮次。千方病案不对 GBD 估计的准确性承担责任,一切以 IHME 官方发布为准。

§1 数据集概览

§1.0 📌 30秒速览

问题 回答
这是什么? 全球最大的疾病负担综合评估研究,量化 204 个国家 375 种疾病/伤害和 88 种风险因素导致的死亡、残疾和健康损失
谁做的? 华盛顿大学 IHME,2,780 名来自 160+ 国家的合作者,PI 为 Christopher J.L. Murray
有多大规模? 310,000+ 数据源,覆盖 1990-2023 年,204 国 + 660 子国家级区域,估计数十亿数据点
核心创新? 发明 DALY(伤残调整寿命年)指标,首次将死亡和残疾统一量化,可跨疾病、跨国家、跨时间比较
怎么访问? 免费注册 → GBD Results Tool 下载 CSV(10 万行/次)或 GBD Compare 在线可视化
AI 能做什么? 疾病负担时空预测、风险归因建模、流行病学转变趋势分析、卫生政策模拟、SDG 进展监测
最大坑点? 低收入国家数据稀疏(依赖口头尸检推断)、估计值每轮变化(时间不一致性)、非商业限制

§1.1 摘要

Global Burden of Disease(GBD)研究是一项系统性的全球健康评估计划,旨在量化全球、区域和国家层面因疾病、伤害和风险因素导致的健康损失。GBD 由世界银行于 1990 年委托发起(Murray & Lopez, 1996),最初评估 8 个地区 107 种疾病的疾病负担,并首次提出伤残调整寿命年(DALY)作为统一比较死亡和残疾的核心指标。2007 年,在盖茨基金会支持下,华盛顿大学成立健康指标与评估研究所(IHME)作为 GBD 的永久学术基地,由 Christopher J.L. Murray 担任所长。

GBD 最新版本(GBD 2023)于 2025 年 10 月 12 日在 The Lancet 发表,覆盖 204 个国家和地区及 660 个子国家级区域的 375 种疾病与伤害、88 种可改变风险因素,时间跨度从 1990 年到 2023 年。该轮研究使用超过 310,000 个数据源(其中 30% 为本轮新增),包括生命登记系统、口头尸检、人口普查、家庭调查、疾病登记、科学文献等。核心估计指标包括死亡数(Deaths)、过早死亡损失年(YLLs)、残疾损失年(YLDs)、伤残调整寿命年(DALYs = YLLs + YLDs)、健康期望寿命(HALE)、发病率和患病率。所有估计基于 250 次抽样生成 95% 不确定性区间。

GBD 采用四级疾病/伤害层级和三级风险因素层级分类体系,使用 Cause of Death Ensemble 模型(CODEm)、疾病建模元回归(DisMod-MR 2.1)和比较风险评估(CRA)等统计建模方法。GBD 还开发了社会人口指数(SDI)和医疗可及性与质量指数(HAQ Index)两个复合指标,用于跨国家比较和分层分析。

GBD 2023 的核心发现显示:2023 年全球 DALYs 总数为 28.0 亿(95% UI 25.7-30.8 亿),较 2010 年增长 6.1%,但年龄标化 DALY 率下降了 12.6%,反映了人口增长和老龄化与卫生改善的交织效应。非传染性疾病(NCDs)贡献 18.0 亿 DALYs(2023),其中缺血性心脏病(1.93 亿)、卒中(1.57 亿)和糖尿病(9,020 万)居前三位。焦虑症(+62.8%)和抑郁症(+26.3%)的年龄标化率增幅最大。代谢风险因素的归因 DALYs 增长了 30.7%,而环境卫生和行为风险因素显著下降。

GBD 估计通过 GBD Results Tool(CSV 下载)、GBD Compare(交互可视化)、GHDx(数据目录)和 API 向全球免费开放(非商业用途)。GBD 研究网络拥有 2,780 名来自 160+ 国家的合作者,已支撑数万篇同行评审论文,是全球公共卫生政策制定的核心数据基础。

§1.2 为什么重要

维度 说明
1. 唯一性 全球唯一覆盖全疾病谱(375 种疾病/伤害)+ 全风险因素谱(88 种)+ 全地理范围(204 国 + 660 子国家级)+ 长时间序列(1990-2023)的综合健康评估
2. 指标创新 发明 DALY 指标,将死亡(YLL)和残疾(YLD)统一为一个可比较的综合指标,彻底改变了健康评估范式
3. 可比性 使用统一方法学框架、标准人口结构和一致的疾病分类,使跨疾病、跨国家、跨时间比较成为可能
4. 政策影响力 被 WHO、世界银行、联合国、各国卫生部广泛引用,直接影响全球卫生资源配置和政策优先级设定
5. SDG 监测 GBD 指标被用于监测联合国可持续发展目标(SDG)健康相关目标的进展
6. 风险归因 通过 CRA 框架量化 88 种风险因素对 631 个健康结局的归因负担,为预防干预提供证据
7. 透明性 所有数据源、代码、方法公开,遵循 GATHER 指南,2,780 名合作者交叉验证
8. 迭代改进 30 年 9 轮迭代,每轮新增数据源、扩展覆盖范围、改进方法学,不断提高估计精度
9. 子国家级精度 660 个子国家级区域的估计,揭示国家内部健康差异,支持精准公共卫生干预
10. AI 价值 结构化面板数据格式,适用于时空预测模型、风险归因 ML、流行病学转变建模等 AI/ML 应用

§1.3 对比表

数据集 类型 覆盖范围 疾病数 时间跨度 数据源 开放性
GBD 2023 疾病负担面板 204 国 + 660 子国家级 375 + 88 风险 1990-2023 310K+ 免费注册
GBD 2021 疾病负担面板 204 国 + 811 子国家级 371 + 88 风险 1990-2021 101K 免费注册
WHO Global Health Estimates 疾病负担估计 183 国 ~150 2000-2019 汇总 免费下载
Eurostat 健康统计 EU 27 国 + 候选国 ICD-10 全谱 1994-当前 生命登记 免费下载
CDC Wonder 美国健康统计 美国(国家级 + 州级) ICD-10 全谱 1999-当前 生命登记 免费在线
Global Health Observatory (WHO) 全球健康指标 194 国 按主题 2000-当前 多源 免费在线
UN World Population Prospects 人口估计 237 国 N/A(人口学) 1950-2100 人口普查 免费下载
IHME Local Burden of Disease 子国家级疾病负担 99 国子国家级 按疾病 1990-当前 多源 免费注册

§1.4 时间轴

年份 事件
1991 世界银行委托开展首个 GBD 研究(Murray & Lopez),用于《1993 年世界发展报告》
1996 GBD 1990 结果出版(Murray & Lopez, Harvard University Press),首次提出 DALY 指标,评估 8 个地区 107 种疾病
1997 GBD 1990 系列论文发表于 The Lancet(4 篇),首次量化全球疾病负担
2000-2002 WHO 更新 GBD 1990 估计,引入比较风险因素评估框架
2007 盖茨基金会支持在华盛顿大学成立 IHME,作为 GBD 永久学术基地
2008 WHO 发布《2004 年全球疾病负担更新》
2010 GBD 2010 研究启动,扩展至 291 种疾病、67 种风险因素、187 个国家、21 个地区
2012-12 GBD 2010 系列论文发表于 The Lancet(7 篇),引入 CODEm 和 DisMod-MR 模型
2014 GBD 2013 发表,1,000+ 研究者参与
2015 GBD 2015 发表,2,000 研究者、120 个国家,引入 GATHER 指南
2016 GBD 2016 发表,2,518 合作者,引入 HAQ 指数
2018-10 GBD 2017 发表(The Lancet),3,676 合作者、146 个国家,首次全面子国家级分析
2020-10 GBD 2019 发表(The Lancet),5,500+ 合作者、152 个国家,369 种疾病、87 种风险因素、204 国
2022-05 IHME 发布 GBD Compare 可视化工具和 GBD Results Tool 升级版
2024-02 GBD 2021 系列论文发表于 The Lancet,11,000+ 合作者,371 种疾病、88 种风险因素、811 子国家级
2024-05 GBD 2021 风险因素和人口预测论文发表
2025-10-12 GBD 2023 发表于 The Lancet(Lancet 406:1873-1922),375 种疾病、88 种风险因素、660 子国家级、310K+ 数据源、2,780 合作者

§1.5 用例

用例 描述 典型用户
全球疾病负担排名 识别全球和各国首要死亡和残疾原因,为卫生政策优先级提供依据 WHO、各国卫生部
风险因素归因 量化 88 种风险因素对特定疾病的归因负担(PAF),指导预防干预 公共卫生机构
流行病学转变分析 分析 CMNN→NCD 的转变趋势,预测未来疾病谱变化 流行病学研究者
健康不平等评估 比较 SDI 五分位组之间的疾病负担差异,识别健康差距 政策研究者
SDG 进展监测 跟踪可持续发展目标健康指标的进展和差距 联合国、WHO
AI 疾病预测 用 GBD 面板数据训练时空预测模型,预测未来疾病负担趋势 AI/ML 研究者
HAQ 指数比较 跨国家比较医疗系统绩效,识别改善空间 卫生系统研究者

§2 医学背景

§2.1 疾病负担概念与 ICD-11 映射

GBD 疾病与伤害分类体系采用四级层级结构,与 ICD-11 兼容:

层级 数量 示例
Level 1 3 大类 传染性/母婴/营养性疾病(CMNN) / 非传染性疾病(NCD) / 伤害
Level 2 22 簇 心血管疾病 / 肿瘤 / 慢性呼吸疾病 / 神经系统疾病 / 精神障碍 / 伤害等
Level 3 ~200+ 缺血性心脏病 / 卒中 / 糖尿病 / 阿尔茨海默病 / 抑郁症 / 道路伤害等
Level 4 ~150+ 心肌梗死 / 缺血性卒中 / 出血性卒中 / 1型/2型糖尿病等细分

ICD-11 核心映射(GBD Level 3 对应 ICD-11 编码):

GBD 疾病 ICD-11 编码 2023 全球 DALYs 趋势 (2010-2023)
缺血性心脏病 BA41-BA6Z 1.93 亿 ↑ 增长
卒中 8B00-8B6Z 1.57 亿 ↑ 增长
糖尿病 5A10-5A11 9,020 万 ↑↑ 14.9% 增长
慢性肾病 GB00-GB4Z ~4,500 万 ↑ 增长
阿尔茨海默病 8A20 ~3,200 万 ↑ 增长
焦虑症 6B00 ~3,000 万 ↑↑↑ 62.8% 增长
抑郁症 6A70-6A7Z ~4,500 万 ↑↑ 26.3% 增长
道路伤害 XB30 ~2,800 万 ↓ 下降
下呼吸道感染 CA40-CA4Z ~2,500 万 ↓ 下降
新生儿疾病 KA00-KA2Z ~4,000 万 ↓ 下降

SNOMED CT 补充映射:GBD Level 2 簇映射至 SNOMED CT 临床概念组(如"心血管疾病"→ 49429004 |Cardiovascular disease|),Level 3/4 映射至具体临床概念。

§2.2 核心指标体系

GBD 定义并计算以下核心健康指标:

指标 定义 计算方法 意义
Deaths 因特定原因死亡的人数 生命登记 + 建模估计 死亡规模
YLLs 过早死亡损失年 死亡数 × (标准预期寿命 - 死亡年龄) 过早死亡负担
YLDs 残疾损失年 后遗症患病率 × 残疾权重 残疾负担
DALYs 伤残调整寿命年 YLLs + YLDs 综合健康损失
HALE 健康期望寿命 基于年龄别死亡率和人均 YLDs 健康调整后预期寿命
Incidence 新发病例数 DisMod-MR 2.1 建模 疾病发生率
Prevalence 现患病例数 DisMod-MR 2.1 建模 疾病流行率
MMR 孕产妇死亡率 每 10 万活产孕产妇死亡数 产科安全
Life Expectancy 预期寿命 生命表计算 总体健康水平

§2.3 SDI 与 HAQ 指数

社会人口指数(SDI)

SDI 是 GBD 开发的综合发展指标,用于跨国家比较和分层分析:

SDI 组 SDI 值范围 代表国家 特征
High SDI >0.81 美国、英国、日本、澳大利亚 低生育率、高教育、高收入
High-middle SDI 0.70-0.81 中国、巴西、俄罗斯、墨西哥 转型期
Middle SDI 0.61-0.69 印度、印尼、菲律宾 快速发展
Low-middle SDI 0.46-0.60 孟加拉、巴基斯坦、尼日利亚 发展中
Low SDI <0.46 阿富汗、中非共和国、索马里 最不发达

SDI = f(人均滞后分配收入, 15+ 岁平均受教育年限, 25 岁以下女性总生育率)

医疗可及性与质量指数(HAQ Index)

HAQ 指数基于 32 种在有效医疗下不应死亡的原因,使用风险标化死亡率(RSDR)和癌症死亡率/发病率比(MIR),通过主成分分析构建 0-100 分量表:

2016 年 HAQ 排名 国家 HAQ 分数
最高 冰岛 97.1
第二 挪威 96.6
第三 荷兰 96.1
最低 中非共和国 18.6
倒数第二 索马里 19.0
倒数第三 几内亚比绍 23.4

§2.4 CRA 风险评估框架

比较风险评估(CRA)是 GBD 量化风险因素归因负担的核心方法:

风险因素暴露 → 相对风险 (RR) → 暴露流行率 (SEV) → TMREL → PAF → 归因 DALYs

输入:88 种风险因素 × 631 个风险-结局对
输出:每种风险因素的可归因疾病负担
CRA 核心概念 说明
SEV (Summary Exposure Value) 风险加权暴露流行率,0-1 标度
TMREL (Theoretical Minimum Risk Exposure Level) 理论最低风险暴露水平
PAF (Population Attributable Fraction) 人群归因分数:若暴露降至 TMREL,健康风险将变化的比例
RR (Relative Risk) 相对风险,暴露函数
BPRF (Burden of Proof Risk Function) 基于证据一致性的保守风险-结局关联评估

§2.5 临床转化意义

维度 说明
政策优先级 GBD 排名直接驱动全球和国家级卫生预算分配
预防干预 CRA 归因分析指出最大可改变风险因素,指导预防策略
卫生系统评估 HAQ 指数跨国家比较医疗系统绩效
进展监测 时间序列估计跟踪干预效果和 SDG 进展
预测建模 面板数据支持疾病负担趋势预测和未来情景模拟

§3 数据集规格

§3.0 版本抉择矩阵

版本 发表年份 疾病/伤害 风险因素 国家 子国家级 数据源 合作者 论文出处
GBD 1990 1996-1997 107 8 区域 ~1,000 ~50 Harvard University Press / Lancet
GBD 2010 2012 291 67 187 ~1,000 ~500 Lancet (7 篇)
GBD 2013 2014-2015 306 79 188 ~10,000 ~1,000 Lancet (多期刊)
GBD 2015 2016 310 79 195 部分 ~20,000 ~2,000 Lancet (8 篇)
GBD 2016 2017 328 84 195 部分 ~22,000 ~2,500 Lancet (多篇)
GBD 2017 2018 359 84 195 部分 ~30,000 ~3,700 Lancet (多期刊)
GBD 2019 2020 369 87 204 部分 ~50,000 ~5,500 Lancet (8 篇)
GBD 2021 2024 371 88 204 811 ~101,000 ~11,000 Lancet (多期刊)
GBD 2023 2025 375 88 204 660 310,000+ 2,780 Lancet 406:1873-1922

版本选择建议

  • 最新分析 → 使用 GBD 2023(2025-10 发布)
  • 时间一致性 → 固定使用单一 GBD 轮次,不混用不同轮次估计值
  • COVID-19 影响 → 使用 GBD 2021/2023(首次包含 COVID-19 估计)
  • 子国家级分析 → 使用 GBD 2021(811 子国家级)或 GBD 2023(660 子国家级)
  • 历史对比 → GBD 2019 为最广泛引用的稳定版本

§3.1 数据来源

GBD 数据来源类型(310,000+ 数据源,GBD 2023):

数据类型 数量(约) 覆盖 典型来源
生命登记 (Vital Registration) ~50,000 高收入国为主 各国民事登记系统
口头尸检 (Verbal Autopsy) ~5,000 LMIC 为主 INDEPTH 网络、HDSS 站点
人口普查 (Census) ~3,000 全球 各国统计局
家庭调查 (Household Survey) ~20,000 全球 DHS、MICS、WHO STEPS
疾病登记 (Disease Registry) ~8,000 高/中收入国 癌症登记、HIV/TB 登记
卫生服务联系数据 ~5,000 部分国家 医院出院、门诊记录
警察记录 (Police Records) ~2,000 全球 道路伤害、凶杀
开源数据库 ~3,000 全球 WHO、UN、World Bank
微创组织取样 (MITS) ~500 部分LMIC 儿童死因调查
科学文献 (Scientific Literature) ~100,000 全球 PubMed、Embase 系统综述
其他 (报告/估计/建模/环境监测/立法/地理空间) ~113,000 全球 多源

§3.2 样本统计

维度
全球覆盖人口 ~80 亿(2023)
国家与地区 204
子国家级区域 660(GBD 2023)/ 811(GBD 2021)
GBD 超级区域 7
GBD 区域 21
年龄组 23 组(<1 月、1-5 月、6-11 月、12-23 月、2-4 岁…95+ 岁)
性别 男 / 女 / 综合
时间点 1990-2023(34 年,年度估计)
疾病/伤害 375 种
死因 288+ 种致命原因
后遗症 1,600+
风险因素 88 种
风险-结局对 631
估计数据点 数十亿(每个维度组合 × 指标 × 年份 × 抽样)
抽样次数 250(GBD 2023)/ 500(GBD 2021)/ 1,000(GBD 2017 及之前)
数据源 310,000+

§3.3 数据格式与大小

数据格式 用途 特点
CSV GBD Results Tool 下载 主要格式,结构化表格
JSON API 返回 编程接口
HTML GBD Compare 在线可视化 交互式图表
XLSX 附录表格 层级分类表
Shapefile 地理空间估计 子国家级地图
PDF Country Profiles 国家概况快照

GBD Results Tool 下载结构(CSV 字段)

字段 说明 示例
measure_id 指标 ID 1=Death, 2=DALY, 3=YLD, 4=YLL
location_id 地点 ID 1=Global, 102=China, 235=USA
year 年份 1990-2023
age_group_id 年龄组 ID 7=15-49, 22=All ages
sex_id 性别 ID 1=Male, 2=Female, 3=Both
cause_id 疾病/原因 ID 493=IHD, 290=Stroke
metric_id 度量类型 ID 1=Number, 2=Percent, 3=Rate
val 点估计值 193,000,000
upper 95% UI 上限 209,000,000
lower 95% UI 下限 176,000,000

§3.4 预处理流水线

数据采集                   数据处理                   建模估计
┌─────────────┐          ┌─────────────┐          ┌─────────────┐
│ 生命登记     │          │ 年龄-性别   │          │ CODEm       │
│ 口头尸检     │    →     │ 分割       │    →     │ DisMod-MR   │
│ 人口普查     │          │ 垃圾代码   │          │ CRA         │
│ 家庭调查     │          │ 重分配     │          │ MR-BRT      │
│ 疾病登记     │          │ 完整性     │          │ OneMod      │
│ 科学文献     │          │ 校正       │          │ 250次抽样   │
│ 警察记录     │          │ 标准化     │          │ 95% UI      │
└─────────────┘          └─────────────┘          └──────┬──────┘
                                                        │
                                                 ┌──────▼──────┐
                                                 │  GBD Results │
                                                 │  Tool (CSV)  │
                                                 │  GBD Compare  │
                                                 │  GHDx         │
                                                 └─────────────┘

§3.5 许可证

条款 说明
使用许可 IHME 非商业免费使用协议(Free-of-Charge Non-Commercial User Agreement)
可视化许可 CC BY-NC-ND 4.0(署名-非商业-禁止演绎)
注册要求 免费注册账户后可下载数据
下载限制 单次请求 100,000 行(可申请增加,每次增 100,000 行)
商业使用 需联系 services@healthdata.org 获取商业许可
再分发 不可原样再分发数据
引用要求 发表时须引用相应 GBD 轮次和 IHME
制裁合规 遵守美国法律,不向受制裁实体提供数据
全球论文限制 不允许非合作者使用 GBD 数据发表全球层面论文

§3.6 基金

资助方 资金用途
Bill & Melinda Gates Foundation GBD 核心运营和主要资金来源
University of Washington 机构支持
各国合作者机构 合作者贡献
慈善基金会 特定主题分析(如 Bloomberg Philanthropies 道路安全)

§3.7 溯源链

原始数据源(310K+)
  ↓ (GHDx 编目)
GBD Sources Tool(可查询每个数据源)
  ↓ (数据处理:年龄分割、性别分割、垃圾代码重分配、完整性校正)
处理后的标准化数据
  ↓ (统计建模:CODEm / DisMod-MR 2.1 / CRA / MR-BRT / OneMod)
建模估计(250 次抽样 → 点估计 + 95% UI)
  ↓ (GATHER 合规报告)
GBD Results Tool (CSV) + GBD Compare (可视化)
  ↓ (同行评审)
The Lancet 发表
  ↓ (合作者网络审查)
2,780 名合作者交叉验证

§4 数据结构详解

§4.0 目录树(概念性)

GBD_2023/
├── cause/                     # 疾病/伤害估计
│   ├── deaths/               # 死亡数
│   │   ├── level_1/          # CMNN / NCD / Injuries
│   │   ├── level_2/          # 22 簇
│   │   ├── level_3/          # ~200+ 具体
│   │   └── level_4/          # ~150+ 细分
│   ├── YLLs/                 # 过早死亡损失年
│   ├── YLDs/                 # 残疾损失年
│   ├── DALYs/                # 伤残调整寿命年
│   ├── incidence/            # 发病率
│   ├── prevalence/           # 患病率
│   └── sequelae/            # 1,600+ 后遗症
├── risk/                      # 风险因素估计
│   ├── behavioral/           # 行为风险(吸烟、饮酒、饮食等)
│   ├── metabolic/            # 代谢风险(高血压、高血糖、高BMI等)
│   ├── environmental/        # 环境风险(空气污染、水污染等)
│   ├── SEVs/                 # 暴露流行率
│   ├── TMRELs/               # 理论最低风险水平
│   ├── PAFs/                 # 人群归因分数
│   └── attributable_burden/  # 归因 DALYs
├── population/                # 人口估计
│   ├── fertility/            # 生育率
│   ├── mortality/            # 全因死亡率
│   ├── migration/            # 迁移
│   └── life_tables/          # 生命表
├── SDI/                       # 社会人口指数
├── HAQ/                       # 医疗可及性与质量指数
├── HALE/                      # 健康期望寿命
├── covariates/                # 协变量
│   ├── income/               # 人均收入
│   ├── education/            # 教育水平
│   └── health_spending/      # 卫生支出
├── hierarchies/               # 分类层级
│   ├── cause_hierarchy.xlsx  # 疾病层级
│   ├── risk_hierarchy.xlsx   # 风险因素层级
│   └── location_hierarchy.xlsx # 地点层级
└── code/                      # 建模代码
    ├── CODEm/
    ├── DisMod-MR/
    └── CRA/

§4.1 DAIMS 数据字典

表 1:核心估计指标

字段 类型 说明 值域
measure_id int 指标类型 1=Death, 2=DALY, 3=YLD, 4=YLL, 5=Prevalence, 6=Incidence, 7=Remission, 9=MMR
location_id int 地点 ID 1=Global, 4454=World Bank High Income, 44637=England, 4863=China
year int 年份 1990-2023
age_group_id int 年龄组 ID 2=Early NN, 3=Late NN, 4=1-5 months, 5=6-11 months, … 22=All ages, 27=Age-std
sex_id int 性别 1=Male, 2=Female, 3=Both
cause_id int 疾病/原因 ID 294=All causes, 493=IHD, 290=Stroke, 2907=Diabetes mellitus
metric_id int 度量类型 1=Number, 2=Percent, 3=Rate (per 100k)
val float 点估计值 非负实数
upper float 95% UI 上限 ≥ val
lower float 95% UI 下限 ≤ val

表 2:风险因素估计

字段 类型 说明 值域
rei_id int 风险因素 ID 88 种风险因素(Level 1-3)
rei_type str 类型 risk / etiology / impairment / injury n-code
exposure_category str 暴露类别 连续/分类
SEV float 暴露流行率 0-1
TMREL float 理论最低风险 连续值
PAF float 人群归因分数 0-1
attributable_DALYs float 归因 DALYs 非负实数

表 3:地点层级

层级 说明 数量 示例
Level 1 全球 1 Global
Level 2 超级区域 7 High-income, Central Europe, Southeast/East Asia…
Level 3 国家/地区 204 China, USA, India, Brazil…
Level 4 子国家级 ~600+ China provinces, USA states, UK regions…
Level 5 更细子国家级 ~60+ England regions, Mexico states…

§4.2 风险因素分类

GBD 2023 风险因素层级(88 种,3 大类)

Level 1 Level 2(示例) Level 3(示例) 风险-结局对数
行为风险 烟草 吸烟、嚼烟 ~50
酒精 饮酒量 ~30
饮食 14 种饮食风险因素 ~70
药物使用 注射/非注射药物 ~15
不安全性行为 ~10
职业风险 14 种职业暴露 ~60
代谢风险 高BMI ~40
高收缩压 ~30
高空腹血糖 ~30
高LDL胆固醇 ~20
肾功能障碍 ~10
低骨密度 ~5
环境/职业风险 空气污染 颗粒物、室内固体燃料 ~20
水和卫生 不安全水、不安全卫生、无洗手 ~15
非最佳温度 高温、低温 ~10
职业暴露 石棉、矽尘、致癌物等 ~60

§4.3 数据获取方式

方式 URL 说明 格式
GBD Results Tool https://vizhub.healthdata.org/gbd-results/ 核心数据下载平台,注册后按维度筛选下载 CSV
GHDx https://ghdx.healthdata.org/ 全球健康数据交换目录,查询所有输入数据源 HTML/CSV
GBD Compare https://vizhub.healthdata.org/gbd-compare/ 交互可视化:树图、地图、趋势图 HTML
GBD Sources Tool (通过 GHDx) 查询 GBD 输入数据源引用 HTML
Country Profiles https://www.healthdata.org/data-visualization/country-profiles 国家概况 PDF(可打印) PDF
GBD Cancer Compare https://vizhub.healthdata.org/gbd-cancer-compare/ 52 种癌症分析 HTML
GBD Sex Differences https://vizhub.healthdata.org/gbd-sex-differences/ 性别差异分析 HTML
Burden of Proof https://vizhub.healthdata.org/burden-of-proof/ 风险-结局证据强度 HTML
API https://api.healthdata.org/gbd 编程接口(需 API key) JSON
代码 https://ghdx.healthdata.org/gbd-2023/code GBD 建模代码 Python/R

§4.4 缺失值与不确定性

处理方式 说明
不确定性区间 250 次抽样(GBD 2023),95% UI = 第 2.5-97.5 百分位数
数据稀疏区域 低收入国家依赖口头尸检和模型推断,UI 较宽
垃圾代码重分配 非特定/不合理 ICD 编码重分配至最可能死因
完整性校正 生命登记不完整国家使用完整性校正因子
年龄-性别分割 粗年龄/性别数据分配至 GBD 标准年龄组
协变量外推 数据缺失年份使用社会经济协变量外推
时间不一致性 不同 GBD 轮次估计值不同(每轮更新数据和方法)

§4.5 生态工具

工具 类型 说明
GBD Results Tool Web 平台 核心数据查询和 CSV 下载
GHDx 数据目录 搜索所有输入数据源元数据
GBD Compare 可视化 树图/地图/趋势图交互
GBD Sources Tool 查询工具 按地区/原因/风险因素查询输入数据
Country Profiles 报告 204 国一键 PDF 概况
API 编程接口 JSON 格式数据获取
GBD Code 开源代码 Python/R 建模代码
SDI 计算器 在线工具 计算/查看各国 SDI
HAQ Dashboard 可视化 HAQ 指数跨国家比较
R/Python 包 社区开发 gbdR、pyGBD 等第三方包
Stata 集成 插件 GBD 数据导入 Stata
Tableau 连接器 BI 工具 Tableau 直连 GBD 数据

§5 数据划分与使用建议

§5.1 划分策略

GBD 是面板数据(非传统 ML 数据集),划分方式取决于研究目标:

策略 方法 适用场景
按时间划分 训练:1990-2015,验证:2016-2019,测试:2020-2023 时间序列预测
按地区划分 训练:80% 国家,验证:10%,测试:10% 跨国家泛化
按 SDI 划分 分层抽样:5 个 SDI 组各取比例 健康不平等
按疾病划分 训练:已知疾病负担,预测:新兴疾病 疾病转移
按年龄-性别划分 按人口结构分层 人口学分析
按风险因素划分 训练:主要风险因素,外推:新风险 风险归因

§5.2 基准配置代码

import pandas as pd
import numpy as np

# 加载 GBD Results Tool 导出的 CSV
gbd_data = pd.read_csv(''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''gbd_results_2023.csv'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')

# 标准列名映射
measure_map = {1: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Death'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 2: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 3: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''YLD'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 4: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''YLL'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
               5: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Prevalence'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 6: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Incidence''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
sex_map = {1: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Male'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 2: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Female'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 3: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Both''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
metric_map = {1: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Number'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 2: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Percent'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 3: ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Rate_per_100k''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}

gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_name''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].map(measure_map)
gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_name''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].map(sex_map)
gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_name''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].map(metric_map)

# 筛选缺血性心脏病的 DALYs(中国,2010-2023,全年龄,两性合计)
ihd_china = gbd_data[
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''cause_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 493) &       # IHD
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''location_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 44533) &   # China (national)
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 2) &        # DALYs
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 3) &         # Rate per 100k
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''age_group_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 27) &     # Age-standardized
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 3) &            # Both sexes
    (gbd_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] >= 2010)
]

print(f"China IHD age-std DALY rate 2010-2023:")
print(ihd_china[[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''lower'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''upper'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''']].to_string(index=False))

# 时间序列预测训练集
train = ihd_china[ihd_china[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] <= 2019]
test = ihd_china[ihd_china[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] >= 2020]

print(f"\nTrain: {len(train)} years, Test: {len(test)} years")

§5.3 使用建议

场景 建议 注意事项
时间序列预测 使用 1990-2019 训练,2020-2023 测试(含 COVID 冲击) COVID-19 扰乱了长期趋势
跨国家比较 使用年龄标化率(age_group_id=27)消除人口结构差异 不使用原始计数比较
风险归因 使用 PAF × DALYs 计算归因负担 注意中介效应调整
SDI 分层 按 SDI 五分位分组分析 SDI 每轮更新
子国家级分析 使用 location_id 层级 4-5 子国家级覆盖因国家而异
不确定性传播 使用 250 次抽样值,而非仅用点估计 忽略 UI 会低估不确定性
纵向对比 固定单一 GBD 轮次,不混用不同轮次 不同轮次方法不同,估计值不兼容
政策报告 使用最新 GBD 轮次数据 注明 GBD 版本和 IHME 来源

§6 AI 就绪指南

§6.0 快速启动

# GBD 数据获取(通过 API 或 CSV 下载)
import requests
import pandas as pd

# 方法 1: 直接使用 GBD Results Tool 导出的 CSV
# 步骤:1) 注册 https://vizhub.healthdata.org/gbd-results/
#       2) 选择维度 → 3) 下载 CSV → 4) 加载
df = pd.read_csv(''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''IHME-GBD_2023_DATA-xxx.csv'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')

# 方法 2: 通过 API(需要 API key)
# headers = {''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Authorization'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Bearer YOUR_API_KEY''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
# url = ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''https://api.healthdata.org/gbd/2023/results''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''
# params = {''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''location_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''1'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''2023'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''cause_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''294'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
#           ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''1'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''3'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''age_group_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''22'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_id'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''3''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
# responevent-blocked= requests.get(url, headers=headers, params=params)
# data = response.json()

§6.1 数据加载与预处理

import pandas as pd
import numpy as np

class GBDDataset:
    """GBD 面板数据加载器"""

    # ID 映射表
    MEASURES = {1:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Death'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 2:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 3:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''YLD'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 4:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''YLL'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
                5:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Prevalence'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 6:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Incidence''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
    SEXES = {1:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Male'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 2:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Female'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 3:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Both''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
    METRICS = {1:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Number'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 2:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Percent'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', 3:''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Rate_per_100k''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''}
    AGE_STANDARIZED = 27
    ALL_AGES = 22

    def __init__(self, csv_path):
        self.data = pd.read_csv(csv_path)
        self._add_names()

    def _add_names(self):
        self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_name''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].map(self.MEASURES)
        self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_name''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].map(self.SEXES)
        self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_name''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].map(self.METRICS)

    def query(self, measure=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', cause=None, location=None,
              year_range=(1990, 2023), sex=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Both'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', metric=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Rate_per_100k'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
              age=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Age-standardized''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''):
        """查询 GBD 数据"""
        m_id = {v:k for k,v in self.MEASURES.items()}[measure]
        s_id = {v:k for k,v in self.SEXES.items()}[sex]
        met_id = {v:k for k,v in self.METRICS.items()}[metric]
        age_id = self.AGE_STANDARIZED if age == ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Age-standardized'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''' else self.ALL_AGES

        mask = (
            (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''measure_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == m_id) &
            (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''sex_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == s_id) &
            (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''metric_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == met_id) &
            (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''age_group_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == age_id) &
            (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] >= year_range[0]) &
            (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] <= year_range[1])
        )
        if cause:
            mask &= (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''cause_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == cause)
        if location:
            mask &= (self.data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''location_id''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == location)

        return self.data[mask].sort_values(''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')

    def to_panel(self, cause_id, location_ids, years=range(1990, 2024)):
        """转换为面板数据格式 (country × year)"""
        panels = {}
        for loc_id in location_ids:
            data = self.query(measure=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', cause=cause_id,
                            location=loc_id, sex=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Both'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
                            metric=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Rate_per_100k'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', age=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Age-standardized'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')
            panels[loc_id] = data.set_index(''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''']
        return pd.DataFrame(panels)

    def get_uncertainty(self, cause_id, location_id, year=2023):
        """获取不确定性区间"""
        data = self.query(measure=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', cause=cause_id,
                         location=location_id, year_range=(year, year))
        if len(data) > 0:
            row = data.iloc[0]
            return {
                ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': row[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''],
                ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''lower'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': row[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''lower''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''],
                ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''upper'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': row[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''upper''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''],
                ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''ui_width'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': row[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''upper''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] - row[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''lower'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''']
            }
        return None

§6.2 疾病负担趋势预测

from sklearn.linear_model import Ridge
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_absolute_error
import numpy as np

# 示例:预测中国缺血性心脏病 DALY 率趋势
gbd = GBDDataset(''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''IHME-GBD_2023_DATA-xxx.csv'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')

# 获取面板数据:中国 IHD DALY 年龄标化率
china_ihd = gbd.query(measure=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', cause=493,  # IHD
                      location=44533,  # China national
                      sex=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Both'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', metric=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Rate_per_100k'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
                      age=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Age-standardized'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')

# 特征工程:年份 + 滞后项 + SDI
years = china_ihd[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''year''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].values
values = china_ihd[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].values

# 创建滞后特征
def create_features(series, lag=3):
    X, y = [], []
    for i in range(lag, len(series)):
        X.append(series[i-lag:i])
        y.append(series[i])
    return np.array(X), np.array(y)

X, y = create_features(values, lag=3)

# 划分训练/测试
split = int(len(X) * 0.8)
X_train, X_test = X[:split], X[split:]
y_train, y_test = y[:split], y[split:]

# Ridge 回归
ridge = Ridge(alpha=1.0)
ridge.fit(X_train, y_train)
ridge_pred = ridge.predict(X_test)
ridge_mae = mean_absolute_error(y_test, ridge_pred)
print(f"Ridge MAE: {ridge_mae:.2f} DALYs per 100k")

# Random Forest
rf = RandomForestRegressor(n_estimators=100, random_state=42)
rf.fit(X_train, y_train)
rf_pred = rf.predict(X_test)
rf_mae = mean_absolute_error(y_test, rf_pred)
print(f"Random Forest MAE: {rf_mae:.2f} DALYs per 100k")

# 带不确定性的预测
# 使用 250 次抽样值进行 Bootstrap
draws = china_ihd[[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''lower'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''upper'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''']].values
bootstrap_predictionevent-blocked= []
for _ in range(250):
    sampled = np.random.uniform(draws[:, 0], draws[:, 2])
    # 在抽样值上训练模型
    X_b, y_b = create_features(sampled, lag=3)
    rf_b = RandomForestRegressor(n_estimators=50, random_state=None)
    rf_b.fit(X_b, y_b)
    pred = rf_b.predict(X_test)
    bootstrap_predictions.append(pred)

pred_mean = np.mean(bootstrap_predictions, axis=0)
pred_lower = np.percentile(bootstrap_predictions, 2.5, axis=0)
pred_upper = np.percentile(bootstrap_predictions, 97.5, axis=0)
print(f"Bootstrap prediction 95% UI width: {np.mean(pred_upper - pred_lower):.2f}")

§6.3 风险因素归因分析

# 分析代谢风险因素对心血管疾病的归因负担
# 获取风险因素归因数据
metabolic_risks = [
    370,   # High BMI
    107,   # High SBP (systolic blood pressure)
    367,   # High FPG (fasting plasma glucose)
    369,   # High LDL
    371,   # Low GFR (kidney dysfunction)
]

# 对每种代谢风险,查询归因 DALYs
for risk_id in metabolic_risks:
    risk_data = gbd.query(measure=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''DALY'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', cause=493,  # IHD
                          location=1,  # Global
                          sex=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Both'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', metric=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Rate_per_100k'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
                          age=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''Age-standardized'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''')
    # 注意:风险因素归因数据需通过 GBD Results Tool 单独下载
    # 筛选 measure=DALY, cause=IHD, risk=<risk_id>
    print(f"Risk ID {risk_id}: PAF = {risk_data[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''val''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].iloc[-1]:.4f}")

# 计算联合 PAF(考虑中介效应)
# GBD 使用 CRA 框架处理中介效应
# 联合 PAF ≠ 1 - ∏(1 - PAF_i)  # 需要使用 GBD 方法

§6.4 PyTorch DataLoader(面板数据预测)

import torch
from torch.utils.data import Dataset, DataLoader

class GBDPanelDataset(Dataset):
    """GBD 面板数据集,适用于疾病负担时空预测"""

    def __init__(self, csv_path, cause_id, location_ids,
                 year_range=(1990, 2023), seq_len=10, pred_len=1):
        gbd = GBDDataset(csv_path)

        # 构建面板数据矩阵 (n_locations × n_years)
        panel = gbd.to_panel(cause_id, location_ids, range(*year_range))

        # 对数变换稳定方差
        panel_log = np.log1p(panel.values)

        # 创建滑动窗口
        self.samples = []
        for loc_idx in range(panel_log.shape[1]):
            series = panel_log[:, loc_idx]
            for i in range(len(series) - seq_len - pred_len + 1):
                x = series[i:i+seq_len]
                y = series[i+seq_len:i+seq_len+pred_len]
                self.samples.append((x, y, loc_idx))

    def __len__(self):
        return len(self.samples)

    def __getitem__(self, idx):
        x, y, loc_id = self.samples[idx]
        return (
            torch.FloatTensor(x).unsqueeze(-1),  # (seq_len, 1)
            torch.FloatTensor(y),                  # (pred_len,)
            torch.LongTensor([loc_id])             # location index
        )

# 使用示例
dataset = GBDPanelDataset(
    csv_path=''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''IHME-GBD_2023_DATA-xxx.csv'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''',
    cause_id=493,  # IHD
    locationevent-blocked=[44533, 102, 235, 71, 161],  # China, USA, India, Brazil, etc.
    seq_len=10,
    pred_len=1
)

dataloader = DataLoader(dataset, batch_size=32, shuffle=True)

# LSTM 模型
class BurdenPredictor(torch.nn.Module):
    def __init__(self, input_dim=1, hidden_dim=64, num_layers=2, pred_len=1):
        super().__init__()
        self.lstm = torch.nn.LSTM(input_dim, hidden_dim, num_layers, batch_first=True)
        self.fc = torch.nn.Linear(hidden_dim, pred_len)

    def forward(self, x):
        out, _ = self.lstm(x)
        return self.fc(out[:, -1, :])  # 取最后一个时间步

model = BurdenPredictor()
criterion = torch.nn.MSELoss()
optimizer = torch.optim.Adam(model.parameters(), lr=0.001)

# 训练循环
for epoch in range(50):
    for x, y, loc in dataloader:
        pred = model(x)
        loss = criterion(pred.squeeze(), y.squeeze())
        optimizer.zero_grad()
        loss.backward()
        optimizer.step()
    if (epoch + 1) % 10 == 0:
        print(f"Epoch {epoch+1}, Loss: {loss.item():.4f}")

§6.5 坑点

# 坑点 严重度 解决方案
1 轮次不一致:不同 GBD 轮次估计值不兼容,混用导致错误结论 ⚠️⚠️⚠️ 固定使用单一 GBD 轮次;若需多轮对比,明确标注版本差异
2 低收入国家数据稀疏:依赖口头尸检和模型外推,UI 极宽 ⚠️⚠️ 检查目标国家的数据源覆盖(GHDx);优先使用有生命登记的国家
3 下载限制:单次请求 100,000 行上限 ⚠️ 分多次下载(按年份/地区/疾病分批);或申请增加配额
4 垃圾代码重分配:原始 ICD 编码被重新分配,可能与本地数据不符 ⚠️⚠️ 理解 GBD 重分配逻辑;使用 GBD Sources Tool 查看原始数据
5 非商业限制:商业使用需单独许可 ⚠️ 联系 services@healthdata.org 获取商业许可
6 HAQ 指数范围有限:仅基于 32 种可干预死因,不涵盖全部疾病 ⚠️ 结合其他指标(如 SDI、卫生支出)综合评估
7 SDI 不完整:不包含气候、冲突、卫生系统功能等情境因素 ⚠️⚠️ 补充使用其他指标(如气候变化指数、脆弱国家指数)
8 残疾权重偏差:主要来自高收入国家人群的偏好 ⚠️⚠️ 注意跨文化残疾权重差异;不直接比较 HIC 和 LMIC 的 YLDs
9 COVID-19 扰动:2020-2021 估计值受 COVID 冲击,非长期趋势 ⚠️⚠️ 时间序列分析时单独处理 COVID 期间数据
10 非随机子国家级覆盖:并非所有国家都有子国家级估计 ⚠️ 检查 GBD location hierarchy 中 Level 4/5 覆盖情况

§6.6 模型推荐

任务类型 推荐模型 输入 输出
时间序列预测 LSTM / GRU / Transformer 历史疾病负担序列 未来 N 年估计
跨国家泛化 Graph Neural Network 国家-邻接图 + 疾病负担 未观测国家估计
风险归因 Bayesian Network 88 风险因素 + 暴露水平 归因 DALYs
流行病学转变 Hidden Markov Model 时间序列 + SDI 转变阶段分类
疾病聚类 K-Means / DBSCAN 疾病负担向量 疾病模式聚类
空间插值 Gaussian Process 子国家级估计 连续空间地图
不确定性量化 Bayesian Neural Network 面板数据 预测 + 不确定性
多任务学习 Multi-Task Learning 多疾病 + 多风险 联合预测
异常检测 Isolation Forest 时间序列 异常爆发检测
因果推断 DoWhy / EconML 风险因素 → 疾病 因果效应
NLP 文献挖掘 BioBERT PubMed 摘要 疾病-风险关联
卫星+健康融合 Multi-Modal DL 卫星图像 + GBD 环境健康影响

§6.7 硬件配置

配置级别 CPU RAM GPU 存储 适用场景
入门 8 核 32 GB 500 GB SSD 单疾病分析、GBD Results Tool 下载
标准 16 核 64 GB RTX 4090 2 TB NVMe 多疾病面板建模、LSTM 训练
研究 32 核 128 GB A100 40GB 4 TB NVMe 大规模时空建模、Transformer
高性能 64 核 256 GB 4× A100 8 TB NVMe 全疾病谱建模、GNN
云端 按需 按需 AWS EC2 P4 S3 弹性计算、协作
轻量 笔记本 16 GB 100 GB 数据下载和探索

§6.8 评估指标

指标 公式 适用场景
MAE 平均绝对误差 预测精度
RMSE 均方根误差 预测精度(对大误差敏感)
MAPE 平均绝对百分比误差 跨尺度比较
Coverage Probability 真值落入 95% UI 的比例 不确定性校准
CWC 覆盖宽度准则 UI 宽度 + 覆盖率平衡
决定系数 模型解释力

§7 质量评估与局限性

§7.1 偏倚分析

# 偏倚类型 说明 影响 缓解措施
1 数据可用性偏倚 高收入国家数据丰富,LMIC 数据稀疏 估计精度在 LMIC 较低 使用模型外推 + 宽 UI 透明报告
2 口头尸检偏倚 LMIC 依赖口头尸检,诊断特异性有限 死因分类错误 垃圾代码重分配 + 灵敏度分析
3 残疾权重偏倚 残疾权重主要来自 HIC 人群偏好 YLD 估计可能不代表 LMIC 感知 跨文化验证研究
4 模型设定偏倚 协变量选择影响估计值 不同模型设定产生不同结果 使用 CODEm 集成模型减少偏倚
5 时间不一致偏倚 不同 GBD 轮次使用不同方法 纵向对比困难 固定单一轮次
6 地理外推偏倚 数据稀疏国家从邻国外推 估计值可能不代表本地实际 合作者审查 + 本地数据验证
7 出版偏倚 文献来源偏向已发表研究 低估罕见/未研究疾病 补充灰色文献和监测数据

§7.2 标注质量

GBD 无传统意义的"标注"(非监督学习数据集),但估计质量受以下因素影响:

质量因素 评估方式 当前水平
数据源数量 每国数据源数量(GHDx 可查) 高收入国 >500,LMIC <20
数据源质量 生命登记完整性 + 死因编码质量 ICD-10/11 编码合规率
模型验证 交叉验证 + 预留验证 CODEm 使用 out-of-sample RMSE
合作者审查 2,780 名合作者审查各自国家估计 多轮审查
同行评审 The Lancet 评审 每轮通过
GATHER 合规 18 项标准检查 完全合规

§7.3 泛化性

场景 泛化能力 说明
跨国家泛化 ✅ 高 204 国统一方法学,可比性强
跨时间泛化 ⚠️ 中 1990-2023 时间序列,但 COVID 扰动
跨疾病泛化 ✅ 高 375 种疾病统一分类框架
子国家级泛化 ⚠️ 中 660 子国家级,但非所有国家覆盖
LMIC 泛化 ⚠️ 低 数据稀疏,UI 宽
罕见疾病泛化 ⚠️ 低 数据不足,估计依赖外推
新兴疾病泛化 ⚠️ 低 新疾病(如 COVID-19)需新模型
职业暴露泛化 ⚠️ 中 14 种职业风险,覆盖有限
心理健康泛化 ⚠️ 中 残疾权重主要来自 HIC

§7.4 伦理考量

维度 说明
数据隐私 仅汇总统计,无个体数据,无 PII 风险
国家主权 估计值可能与官方数据不同,引发政治争议
资源分配影响 GBD 排名直接影响全球卫生资金分配
LMIC 代表性 数据稀疏导致 LMIC 估计不确定性高
商业使用 非商业限制可能限制 LMIC 企业使用
AI 伦理 AI 增强估计可能引入算法偏倚

§7.5 DAIMS 24 项数据就绪度评估

# 评估项 评分 说明
1 数据来源文档化 GHDx 完整记录所有 310K+ 数据源
2 数据收集协议 GATHER 指南合规
3 数据处理透明 代码和方法学附录公开
4 数据格式规范 CSV 标准化输出
5 元数据完整性 维度 ID、层级、度量全面
6 数据质量指标 250 次 UI 透明报告
7 缺失值处理 模型外推 + UI 反映不确定性
8 样本代表性 ⚠️ LMIC 代表性有限
9 时间覆盖 1990-2023,34 年
10 地理覆盖 204 国 + 660 子国家级
11 人口覆盖 全球 ~80 亿人口
12 疾病覆盖 375 种疾病/伤害
13 风险因素覆盖 88 种可改变风险因素
14 年龄-性别覆盖 23 年龄组 × 3 性别
15 数据量 数十亿估计点
16 可重复性 代码公开 + 数据可下载
17 许可证明确 IHME 非商业协议
18 访问便捷性 免费注册 + CSV 下载 + API
19 版本管理 9 轮版本,每轮独立
20 引用规范 GBD 轮次引用格式
21 AI/ML 就绪 ⚠️ 面板数据格式,需自定义 DataLoader
22 多模态整合 ⚠️ 纯统计估计,无原始信号
23 不确定性量化 250 次 UI
24 伦理合规 汇总数据无 PII 风险

DAIMS 总评分:20/24(83.3%)⭐⭐⭐⭐☆

§7.6 外部验证

验证数据集 对比维度 发现
WHO Global Health Estimates 死因死亡率 大体一致,部分疾病存在差异
India Million Death Study 印度死因 GBD 估计的 IHD 死亡率高于 MDS 直接测量
HDSS 站点 (INDEPTH) LMIC 死亡率 合理一致性,但 IHD 存在系统差异
UN Population Division 总死亡数 GBD 估计 LMIC 死亡数比 UN 低约 300 万
GLOBOCAN (IARC) 癌症发病率/死亡率 趋势一致,但 GBD 提供更长时序
Eurostat 欧洲死因统计 高度一致(欧洲生命登记质量高)
CDC Wonder 美国死因统计 高度一致

§8 基准性能与生态

§8.1 排行榜

任务 方法 指标 性能 来源
疾病负担趋势预测 Ridge 回归 + IDP 滞后 MAE <5% of mean rate GBD 2023
风险归因 CRA + BPRF 95% UI 覆盖率 ~95% GBD 2023
死因建模 CODEm 集成 Out-of-sample RMSE 最低的模型加权组合 GBD 2023
疾病建模 DisMod-MR 2.1 预留验证 R² >0.8 (多数疾病) GBD 2023
IBD 负担预测到 2050 8 种 ML 算法集成 预测精度 MAPE <10% Zhao et al. 2025
NLP 疾病-国家关联 BioBERT + GloVe F1 0.78-0.85 Zhang et al. 2024
时空热斑检测 Geospatial AI 检测率 78-92% Forkuo et al. 2024

§8.2 关键论文

# 论文 期刊 年份 引用数 核心贡献
1 Murray CJL & Lopez AD. The Global Burden of Disease Harvard University Press 1996 11,000+ GBD 1990 奠基,提出 DALY 指标
2 Lozano R et al. Global and regional mortality from 235 causes of death Lancet 2012 10,900+ GBD 2010 死因分析,CODEm 模型
3 Lim SS et al. A comparative risk assessment of 67 risk factors Lancet 2012 9,400+ GBD 2010 风险因素 CRA
4 Murray CJL et al. Disability-adjusted life years for 291 diseases Lancet 2012 6,900+ GBD 2010 DALYs 估计
5 Vos T et al. Years lived with disability for 1160 sequelae Lancet 2012 6,300+ GBD 2010 YLDs 估计
6 Murray CJL & Lopez AD. Alternative projections of mortality 1990-2020 Lancet 1997 5,800+ GBD 首次未来预测
7 Murray CJL & Lopez AD. Evidence-based health policy Science 1996 1,750+ GBD 方法学概念论文
8 Abbafati C et al. Global burden of 369 diseases 204 countries 1990-2019 Lancet 2020 1,500+ GBD 2019 旗舰论文
9 GBD 2021 Disease and Injury Collaborators. 371 diseases 204 countries 1990-2021 Lancet 2024 ~500+ GBD 2021 含 COVID-19
10 GBD 2023 Disease and Injury and Risk Factor Collaborators. 375 diseases 88 risk factors 1990-2023 Lancet 2025 新发表 GBD 2023 最新旗舰论文
11 Fullman N et al. Measuring performance on HAQ Index for 195 countries Lancet 2018 730+ HAQ 指数方法
12 Murray CJL. The Global Burden of Disease Study at 30 years Nat Med 2022 ~200+ GBD 30 年回顾

§8.3 使用统计

指标 数值
累计引用 100,000+(GBD 系列论文合计)
单篇最高引用 10,900+(Lozano et al. 2012)
年度论文引用 GBD 10,000+
合作者 2,780(GBD 2023)/ 11,000+(GBD 2021 累计)
合作国家 160+
IHME 员工 ~500
IHME 年度预算 ~$100M+
使用 GBD 的国际组织 WHO, World Bank, UN, UNICEF, UNDP, UNAIDS, Gates Foundation

§8.4 相关数据集

数据集 关系 说明
WHO Global Health Estimates 互补 WHO 使用部分 GBD 方法,但覆盖范围更窄
IHME Local Burden of Disease 子集 IHME 子国家级精细化估计
UN World Population Prospects 输入 人口估计用于 GBD 率计算
GLOBOCAN (IARC) 互补 癌症专项估计,GBD 部分使用其数据
SEER 输入 美国癌症登记数据用于 GBD 估计
NHANES 输入 美国健康调查数据用于风险因素估计
DHS (Demographic Health Survey) 输入 LMIC 家庭调查数据
INDEPTH Network 输入 LMIC 人口监测站点数据

§8.5 生态快照

                    ┌──────────────┐
                    │  Bill & Melinda │
                    │ Gates Foundation│
                    │   (核心基金)    │
                    └───────┬──────┘
                            │
                    ┌───────▼──────┐
                    │     IHME      │
     ┌──────────────┤  (UW Seattle) ├──────────────┐
     │              │  PI: Murray   │              │
     │              └───────┬──────┘              │
     │                      │                      │
┌────▼─────┐          ┌─────▼──────┐        ┌──────▼─────┐
│ GBD      │          │  GBD Core  │        │  GBD Tools │
│Collaborators│       │  Methods   │        │  & Data    │
│2,780     │          │ CODEm      │        │ Results    │
│160+ 国   │          │ DisMod-MR  │        │ GHDx       │
└────┬─────┘          │ CRA        │        │ Compare    │
     │                │ SDI/HAQ    │        │ API        │
     │                └─────┬──────┘        └──────┬─────┘
     │                      │                      │
     │          ┌───────────┼───────────┐          │
     │          │           │           │          │
┌────▼────┐ ┌───▼───┐ ┌────▼────┐ ┌────▼───┐ ┌────▼────┐
│  WHO    │ │ World │ │   UN    │ │ 各国   │ │ 研究者  │
│ (政策)  │ │ Bank  │ │ (SDG)  │ │卫生部  │ │ (论文)  │
└─────────┘ └───────┘ └────────┘ └────────┘ └────────┘

§9 相关资源与引用

§9.1 官方资源

# 资源 URL 说明
1 IHME 官网 https://www.healthdata.org/ IHME 主站
2 GBD 项目主页 https://www.healthdata.org/research-analysis/gbd GBD 概况
3 GBD Results Tool https://vizhub.healthdata.org/gbd-results/ 数据下载
4 GHDx https://ghdx.healthdata.org/ 数据源目录
5 GBD Compare https://vizhub.healthdata.org/gbd-compare/ 交互可视化
6 GBD 2023 代码 https://ghdx.healthdata.org/gbd-2023/code 建模代码
7 GBD Sources Tool (通过 GHDx) 输入数据源查询
8 Country Profiles https://www.healthdata.org/data-visualization/country-profiles 国家概况
9 GBD Cancer Compare https://vizhub.healthdata.org/gbd-cancer-compare/ 52 种癌症
10 GBD Sex Differences https://vizhub.healthdata.org/gbd-sex-differences/ 性别差异
11 Burden of Proof https://vizhub.healthdata.org/burden-of-proof/ 风险证据强度
12 IHME 数据访问条款 https://www.healthdata.org/data-tools-practices/data-access 使用条款
13 IHME 条款与条件 https://www.healthdata.org/data-tools-practices/data-practices/terms-and-conditions 法律条款
14 GBD 数据和工具指南 https://www.healthdata.org/research-analysis/about-gbd/gbd-data-and-tools-guide 工具使用指南

§9.2 BibTeX

@article{gbd2023,
  title={Burden of 375 diseases and injuries, risk-attributable burden of 88 risk factors, and healthy life expectancy in 204 countries and territories, including 660 subnational locations, 19902023: a systematic analysis for the Global Burden of Disease Study 2023},
  author={GBD 2023 Disease and Injury and Risk Factor Collaborators and Hay, Simon I and Ong, Kanyin Liane and Santomauro, Damian F and others},
  journal={The Lancet},
  volume={406},
  number={10513},
  pages={18731922},
  year={2025},
  publisher={Elsevier},
  doi={10.1016/S0140-6736(25)01637-X}
}

@article{gbd2021,
  title={Global incidence, prevalence, years lived with disability (YLDs), disability-adjusted life-years (DALYs), and healthy life expectancy (HALE) for 371 diseases and injuries in 204 countries and territories and 811 subnational locations, 19902021},
  author={GBD 2021 Diseases and Injuries Collaborators},
  journal={The Lancet},
  year={2024},
  doi={10.1016/S0140-6736(24)00757-8}
}

@article{murray2012,
  title={Disability-adjusted life years (DALYs) for 291 diseases and injuries in 21 regions, 19902010: a systematic analysis for the Global Burden of Disease Study 2010},
  author={Murray, Christopher JL and Vos, Theo and Lozano, Rafael and others},
  journal={The Lancet},
  volume={380},
  number={9859},
  pages={21972223},
  year={2012},
  doi={10.1016/S0140-6736(12)61689-4}
}

@book{murray1996,
  title={The Global Burden of Disease: A Comprehensive Assessment of Mortality and Disability from Diseases, Injuries, and Risk Factors in 1990 and Projected to 2020},
  author={Murray, Christopher JL and Lopez, Alan D},
  year={1996},
  publisher={Harvard University Press},
  address={Cambridge, MA}
}

§9.3 核心团队

姓名 角色 机构
Christopher J.L. Murray, MD, DPhil 创始人 & 所长 IHME, 华盛顿大学
Alan D. Lopez (已故) 共同创始人 昆士兰大学
Theo Vos, MD, PhD 首席方法学家 IHME
Stephen Lim, PhD 教授 IHME
Rafael Lozano, MD, PhD 教授 IHME
Mohsen Naghavi, MD, PhD 教授 IHME
Simon I Hay, DSc 教授 IHME / 牛津大学
Ali Mokdad, PhD 首席战略官 IHME
Abraham Flaxman, PhD 副教授 IHME
Kathryn Wolsiefer 执行总监 IHME
Tom Fleming 传播总监 IHME
2,780 合作者 GBD 2023 合作者网络 160+ 国

§10 AI 使用声明卡

§10.1 数据集标识

属性
数据集名称 Global Burden of Disease (GBD) Study
当前版本 GBD 2023
数据集 ID global-burden-of-disease/97
最后更新 2025-10-12
AI 使用分类 面板数据 / 时间序列 / 空间建模
推荐 AI 任务 疾病负担预测 / 风险归因 / 流行病学转变建模

§10.2 许可证摘要

条款 说明
非商业使用 ✅ 免费
商业使用 ❌ 需许可
再分发 ❌ 禁止原样再分发
衍生作品 ✅ 非商业衍生允许
引用要求 ✅ 必须引用 GBD 轮次和 IHME

§10.3 推荐工作流

步骤 操作 工具
1 注册 IHME 账户 healthdata.org
2 在 GBD Results Tool 选择维度 在线平台
3 下载 CSV 数据 CSV 文件
4 加载和预处理数据 Python + pandas
5 构建面板数据矩阵 GBDDataset 类
6 时间序列划分 1990-2019 训练 / 2020-2023 测试
7 训练预测模型 LSTM / Ridge / RF
8 不确定性传播 250 次 Bootstrap
9 评估和可视化 matplotlib / GBD Compare

§10.4 人工校验表

# 检查项 状态
1 frontmatter 9 字段完整
2 INFOBOX 核心字段齐全
3 §0 E-E-A-T 信任声明包含 6 维度
4 §1.0 30 秒速览包含 7 个核心问题
5 §1.4 时间轴覆盖 GBD 全部 9 轮版本
6 §2 ICD-11 + SNOMED CT 双重映射
7 §3.0 版本抉择矩阵覆盖 9 个版本
8 §3.5 许可证条款完整(非商业/商业/引用)
9 §4.1 DAIMS 数据字典 3 表完整
10 §4.2 风险因素 88 种分类完整
11 §5 数据划分策略 6 种
12 §6 代码可运行(Python)
13 §6.5 坑点 10 个 + 解决方案
14 §7.5 DAIMS 24 项评估完整
15 §8.2 关键论文 12 篇含 DOI
16 §C JSON-LD @graph 单块完整
返回 AI-Ready 数据集