信息速览

NCD-RisC — 全球慢病风险因素趋势 pooling 数据 AI-Ready Wikipedia
| 字段 | 内容 |
|---|---|
| 数据集名称 | 慢病风险因素协作(NCD-RisC) |
| 英文全称 | NCD Risk Factor Collaboration (NCD-RisC) |
| 别名/简称 | NCD-RisC |
| 疾病分类(ICD-11) | 5B81 肥胖;BA00 原发性高血压;5A11 2 型糖尿病 |
| SNOMED CT | 414916001(Obesity);59621000(Essential hypertension);44054006(Diabetes mellitus type 2);60621009(Body mass index,observable entity) |
| 数据模态 | 人体测量(身高、体重、BMI)、血压、血糖(汇总统计层) |
| AI 任务类型 | 时序趋势预测、流行病学建模、全球健康不平等分析、政策评估 |
| 样本总数 | BMI 2024 论文:3,663 项人群代表性研究、2.22 亿名参与者(成人 + 5-19 岁儿童青少年) |
| 数据大小 | 轻量级汇总 CSV(world/region/country 三级,非个体级微数据) |
| 数据格式 | CSV(估计值)、XLSX 与 R 代码(Zenodo 输入数据与模型代码) |
| 许可证 | 论文开放获取 CC BY 4.0;估计值 CSV 按官方引用要求使用 |
| 访问级别 | 开放(age-specific 结果需经官网请求) |
| DUO 标签 | NRES(汇总级公开数据,无个体级使用限制) |
| 语言 | 英文 |
| 首发日期 | 2016-04(首批 Lancet pooling 分析:BMI 与糖尿病) |
| 最后更新 | 2026(官网持续发布新分析) |
| 发布机构 | NCD-RisC(帝国理工伦敦 WHO 慢病监测与流行病学协作中心协调) |
| 官方主页 | https://ncdrisc.org |
| 下载地址 | https://www.ncdrisc.org/data-downloads.html |
| DOI | 10.1016/S0140-6736(16)30054-X(BMI 2016);10.7554/eLife.13410(身高);10.1016/S0140-6736(16)31919-5(血压);10.1016/S0140-6736(23)02750-2(BMI 2024) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 汇总 CSV 开放下载、模型 R 代码公开、文件结构规整;扣分项:无官方机器学习划分、估计值列名跨版本不统一、age-specific 数据需邮件请求 |
| 页面状态 | published |
§0 E-E-A-T 审核声明
- 医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 双映射、流行病学数字)、§7 质量评估与偏倚分析。
- 数据工程审核:千方病案医学编辑部交叉审核,医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
- 审核日期:2026-09-05
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NCD-RisC 估计值可从官网免费下载,使用时应按官方建议引用对应论文;age-specific 结果与输入级微数据需经官网请求并遵守原研究的数据治理与共享安排。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? NCD-RisC(Non-Communicable Disease Risk Factor Collaboration,慢病风险因素协作)是一个由全球上千名健康科学家组成的合作网络,协调中心位于帝国理工伦敦的 WHO 慢病监测与流行病学协作中心。它把世界各国调查里"实际量出来的"身高、体重、血压和血糖数据汇总到一起,用统计模型算出每个国家每年的风险因素水平,再免费公布在官网上。
为什么重要? 在它出现之前,各国调查口径不一、发布零散,全球慢病趋势只能"拼凑估计"。NCD-RisC 用统一协议筛选研究、统一模型估计,让 200 个国家与地区之间的比较成为可能;其论文发表于 Lancet、eLife、Nature,是 WHO 全球慢病目标评估的核心数据来源。
我能用它做什么? 拿到 1975 年以来分国家、分性别的 BMI、血压、糖尿病、身高趋势 CSV,用于:训练时序预测模型、评估本国调查数据在全球的位置、做健康不平等与政策效果分析、或作为全球健康课程的教学数据集。注意它给的是"国家层面的模型估计",不是个体级微数据。
§1.1 摘要
NCD-RisC 的数据生产是一条"文献检索 → 研究筛选 → 数据统一 → pooling 建模 → 公开发布"的流水线。协作按统一协议检索各国全国或次国家级人群测量研究(要求身高、体重、血压或血糖为仪器实测而非自报),由数据提供方按统一格式提交个体或汇总级数据;帝国理工团队对每个研究重新计算风险因素水平,再用贝叶斯层级模型(Bayesian hierarchical model)按国家、区域、超级区域分层,估计逐年趋势,并输出 95% 可信区间。每个主题(BMI、血压、糖尿病、身高)独立成篇,发表于 Lancet 或 eLife,估计值 CSV 与(在数据治理许可下的)输入数据、R 代码随论文公开。本词条依据官网与论文核实:BMI 2016 论文纳入 1,698 项研究、1,920 万成人(1975-2014,200 个国家与地区,实测数据来自 186 国);血压 2017 论文纳入 1,479 项研究、1,910 万成人(1975-2015);糖尿病 2016 论文纳入 751 项研究、440 万参与者(1980-2014);身高 eLife 2016 论文纳入 1,472 项研究、1,860 万参与者(1896-1996 出生队列);BMI 2024 论文更新至 3,663 项研究、2.22 亿参与者(1990-2022);糖尿病 2024 论文纳入 1,108 项研究、1.41 亿参与者(1990-2022)。
§1.2 战略价值
维度一:全球比较的"唯一锚点"。 各国卫生调查的抽样框架、测量设备与报告口径差异极大,任何试图横跨国家比较肥胖或高血压趋势的研究都必须处理这些异质性。NCD-RisC 是目前唯一对身高、体重、血压、血糖四大人体测量指标做过全球标准化 pooling 的公开产出,其估计值附带 95% 可信区间,让"国家 A 比国家 B 胖多少"这类问题有了可引用的答案。对 AI 团队而言,它同时是建模对象(时序预测)与评估参照(用本国数据对标全球估计)。
维度二:小而规整、天然适合教学的时序数据集。 与动辄数百 GB 的影像数据不同,NCD-RisC 公开的估计值 CSV 只有 KB 至 MB 级,却具备完整的面板结构(国家 × 性别 × 年份 × 指标)与不确定性信息(可信区间),非常适合演示时序建模、层级模型、不确定性传播与数据可视化,也是全球健康、公共卫生政策课程的经典教学素材。
维度三:政策与科学的引用基础设施。 WHO 的全球慢病目标(如 2025 年遏制肥胖上升趋势)进展评估直接采用 NCD-RisC 估计;其 2016 年首批两篇论文即推动"肥胖人数超过体重不足人数"成为全球头条。引用血压 2017 论文已达 1,876 次(ScienceDirect 计数,截至 2026-09),下游复用覆盖Nature、Lancet 系列与各国政策报告,是名副其实的"引用基础设施"。
§1.2b 术语速查
首次接触 pooling 分析的读者,先对齐以下六个术语,可避免 90% 的误读:
| 术语 | 含义 | 使用提醒 |
|---|---|---|
| Pooling / pooled analysis | 把多国多源人群测量研究按统一协议合并后统一建模 | 不等于简单平均;模型按层级借用信息 |
| 贝叶斯层级模型 | 按国家-区域-超级区域分层共享统计强度的估计框架 | 输出是后验分布,不是点真值 |
| 后验均值 | 可信分布的中心,即官网 CSV 中的主数值列 | 必须与可信区间一起引用 |
| 95% 可信区间(CI) | 后验分布的 2.5%-97.5% 分位区间 | CI 宽度即数据证据强度 |
| 年龄标准化(age-standardised) | 用统一标准人口结构加权后的指标 | 用于跨国/跨期比较 |
| 粗率(crude) | 未做年龄调整的实际人口比率 | 用于负担人数测算 |
§1.3 同类数据集横向对比
| 数据集 | 规模 | 模态 | 指标层级 | 差异化 |
|---|---|---|---|---|
| NCD-RisC | 3,663 项研究、2.22 亿参与者(BMI 2024) | 人体测量、血压、血糖汇总统计 | 国家-年份-性别估计值 + 可信区间 | 统一贝叶斯层级模型,四大指标全球可比 |
| WHO Global Health Observatory | 多源汇总 | 全指标 | 国家级指标 + 元数据 | 广度最大但方法学口径随来源变化 |
| Global Burden of Disease (GBD) | 数千项数据源 | 疾病负担全谱 | 国家-年份-年龄-性别估计 | 覆盖疾病归因与负担,非实测 pooling |
| World Bank HNP Indicators | 各国官方统计 | 卫生/营养/人口 | 国家级指标 | 直接转载各国报告,未统一重测 |
| Our World in Data(NCD-RisC 转载) | 转载身高/BMI 等 | 可视化数据 | 图表层 CSV | 便于可视化,源头仍为 NCD-RisC |
§1.4 版本时间轴
| 时间 | 里程碑 | 规模数字 |
|---|---|---|
| 2016-04 | Lancet 同期发表首批两项 pooling 分析:成人 BMI(1975-2014)与糖尿病(1980-2014) | BMI:1,698 项研究、1,920 万成人;糖尿病:751 项研究、440 万参与者 |
| 2016 | eLife 发表百年成人身高趋势(1896-1996 出生队列) | 1,472 项研究、1,860 万参与者、200 国 |
| 2017-01 | Lancet 发表全球血压趋势(1975-2015) | 1,479 项研究、1,910 万成人、200 国 |
| 2017 | Lancet 发表全人群 BMI 趋势(1975-2016,含儿童青少年) | 2,416 项研究、1.289 亿参与者 |
| 2019 | Nature 发建成人 BMI 城乡差异分析 | 官网提供对应输入数据 codebook 下载 |
| 2020 | Lancet 发表学龄儿童青少年身高 BMI 轨迹(1985-2019) | 2,181 项研究、6,500 万参与者、200 国 |
| 2023 | Nature Medicine 发表基于空腹血糖与 HbA1c 的糖尿病诊断全球差异 | Nat Med 2023, 29:2885-2901 |
| 2024-03 | Lancet 发表体重不足与肥胖趋势更新(1990-2022) | 3,663 项研究、2.22 亿参与者、200 国 |
| 2024-11 | Lancet 发表糖尿病流行率与治疗趋势(1990-2022),Zenodo 同步公开 R 代码与输入数据 | 1,108 项研究、1.41 亿参与者、200 国 |
| 2026 | 官网发布工业化国家肥胖代谢表型多国分析等新论文 | Lancet 2026(持续更新) |
§1.5 典型应用场景
- 全球趋势时序建模:以国家-年份面板训练预测模型,外推各国肥胖或高血压流行率,评估 2030 年慢病目标可达性。
- 本国数据对标:将一次全国调查的实测结果与 NCD-RisC 同年估计比较,判断本国数据在全球分布中的位置与一致性。
- 健康不平等研究:利用区域/国家两套文件计算国家间与国家内(配合城乡分析)差距的时间演变。
- 政策效果回溯:结合各国控盐、初级保健等政策时间线,用中断时序设计考察血压或 BMI 趋势拐点。
- 教学与可视化:KB 级 CSV + 可信区间结构,适合作为贝叶斯估计、不确定性可视化与地理空间_join_的教学数据。
- 版本敏感性研究:利用官方 Archives 与最新版并存的结构,量化"同一国家同一指标在方法学修订后的估计漂移",是研究估计稳定性的天然实验场。
§2 医学背景
§2.1 ICD-11 编码映射
NCD-RisC 覆盖的风险因素本身不是疾病,但直接映射到 ICD-11 中慢病及相关测量条目:
| 风险因素主题 | ICD-11 编码 | ICD-11 中文名 | 说明 |
|---|---|---|---|
| BMI(超重/肥胖) | 5B81 | 肥胖 | 成人 BMI ≥30 kg/m²;NCD-RisC 同时报告低体重(BMI <18.5 kg/m²) |
| 血压升高 | BA00 | 原发性高血压 | 论文定义 SBP ≥140 mmHg 或 DBP ≥90 mmHg |
| 糖尿病 | 5A11 | 2 型糖尿病 | 论文不区分 1 型与 2 型,按糖尿病总体报告 |
| 低体重/营养不良 | 5B20 | 成人低体重 | BMI <18.5 kg/m²,与肥胖构成"双重负担"分析两端 |
§2.1b SNOMED CT 映射
| 标签 | ICD-11 | SNOMED CT 码 | 术语 |
|---|---|---|---|
| 肥胖 | 5B81 | 414916001 | Obesity(disorder) |
| 原发性高血压 | BA00 | 59621000 | Essential hypertension(disorder) |
| 2 型糖尿病 | 5A11 | 44054006 | Diabetes mellitus type 2(disorder) |
| BMI 测量值 | — | 60621009 | Body mass index(observable entity) |
§2.2 疾病与风险因素简介
高血压、肥胖与糖尿病是全球疾病负担前三位的可干预风险因素组合。NCD-RisC 血压 2017 论文估计,全球升高血压(SBP ≥140 或 DBP ≥90 mmHg)患病人数从 1975 年的 5.94 亿增至 2015 年的 11.3 亿,且增量主要来自中低收入国家;同一时期高收入西方与亚太国家的人均血压显著下降,使全球血压最高的地区从高收入国家转移到南亚、撒哈拉以南非洲与中东欧。糖尿病 2016 论文估计 1980-2014 年全球成人糖尿病患病率男性从 4.3% 升至 9.0%、女性从 5.0% 升至 7.9%。BMI 2024 论文估计 2022 年全球逾 10 亿人患肥胖,且大多数国家肥胖流行率已超过体重不足。身高则被视作童年营养与感染环境的"累积记录",eLife 2016 论文显示百年间各国成人身高差异巨大(荷兰 20 世纪末出生男性均值超 182.5 cm,危地马拉 1896 年出生女性均值 140.3 cm)。这些数字使风险因素监测成为慢病防控的第一道仪表盘。
从流行病学转型看,NCD-RisC 系列论文刻画了三条主线:其一,风险负担的地理转移——血压 2017 论文显示 1975 年血压最高的高收入西方与亚太国家到 2015 年已降至全球最低,而中南欧、南亚与撒哈拉以南非洲接棒成为高值区;其二,"双重负担"的重构——BMI 2016 论文记录全球男性体重不足流行率从 13.8%(1975)降至 8.8%(2014),女性从 14.6% 降至 9.7%,同期男性肥胖流行率从 3.2% 升至 10.8%、女性从 6.4% 升至 14.9%,低与中低收入国家在摆脱体重不足的同时迅速肥胖化;其三,疾病谱的量级变化——糖尿病 2016 论文估计成人患者总数在 1980-2014 年间增长约四倍,增量集中于东亚、南亚等中低收入地区。这三条主线共同说明:慢病防控的主战场已不在高收入国家,而人群风险监测基础设施的缺口也恰在这些地区。
§2.3 临床与公共卫生任务定义
NCD-RisC 支撑的不是个体层面的"筛查-诊断-治疗"任务,而是人群层面的三类任务:
- 监测(surveillance):逐年估计各国风险因素水平,对照 WHO 全球慢病目标(如 2025 年将升高血压流行率较 2010 年降低 25%)。
- 比较评估(benchmarking):将国家估计在区域内、超级区域内排序,识别防控薄弱地区。
- 归因与预测研究:作为暴露输入进入疾病负担模型或预测模型(下游研究者任务)。
对应到机器学习任务:时序回归/预测(趋势外推)、层级建模(国家-区域结构)、空间分析(地理聚类)、不确定性量化(可信区间传播)。
三类任务共用一条方法论底线:NCD-RisC 的每一个输出都自带"方法签名"(版本、协议、模型假设),任何机器学习结果都必须携带同样的签名发布。这意味着实验管理里除了随机种子与超参,还要记录数据版本字段——把"方法签名"当作超参的一部分管理,是与该数据集长期协作的最重要习惯。
§2.4 患者人群构成
| 维度 | 构成 |
|---|---|
| 来源 | 全国或次国家级人群代表性测量调查(非临床就诊人群) |
| 时间跨度 | 1975-2022(BMI/血压/糖尿病 pooling);1896-1996 出生队列(身高 eLife 2016) |
| 年龄 | 成人:BMI 2016 ≥18 岁、BMI 2024 ≥20 岁;儿童青少年:5-19 岁 |
| 性别 | 男女分开估计 |
| 种族/地域 | 覆盖全球 200 个国家与地区(含中国台湾),按 21 个分析区域组织 |
| 就医类型 | 一般人群入户或集中体测,与医疗系统接触状态无关 |
与临床数据集最大的差别在"无幸存者偏倚入口":源调查面向一般人群设计(抽样框为住户而非医院),不经过医疗系统筛选,因此对"未被诊断的高血压/糖尿病人群"有真实覆盖——这正是 NCD-RisC 糖尿病估计显著高于各国诊断登记数字的原因,也使该数据集成为估计"未诊断缺口"(配合 Nat Med 2023 诊断口径研究)的首选参照。使用时注意:相应地,它无法回答就诊人群内部的临床异质性问题。
§2.5 临床与公共卫生价值
对临床医学而言,NCD-RisC 的价值是间接但根本的:它提供了风险因素的人群基线,使临床指南的"高危人群"定义(如 SBP ≥140 mmHg)有了人群分布参照;对公共卫生而言,它是 WHO 与各国政府衡量慢病防控成效的事实标准。AI 研究者可将其视为"全球尺度上的队列汇总层":个体级队列(如 UK Biobank)回答机制问题,NCD-RisC 回答"全人类正在变胖还是变瘦、变快还是变慢"的宏观问题。
另一个常被低估的价值是"协议仲裁"。当两个国家调查对同一指标给出不同数字时(不同设备、不同抽样框、不同年份),NCD-RisC 的统一重算提供了第三方仲裁:它在论文附录中为每个国家列出了纳入的全部源研究及其原始值,研究者可以逐层下钻,定位差异来源(抽样?设备?还是覆盖年份)。这种"估计值 + 源研究清单"的双层公开结构,在国家级汇总数据中相当少见,也是其能成为 WHO 引用标准的技术底气。
§2.6 参考标准
| 项目 | 内容 |
|---|---|
| 参考标准 | 各源研究中的仪器实测值(身高、体重、血压、空腹血糖或糖尿病诊断史),经统一协议重算 |
| 标注方式 | 仪器实测(非人工判读);糖尿病含自报诊断史 + 实测空腹血糖的组合定义 |
| 标注者 | 各源研究现场测量人员 + 帝国理工协调团队的统一重算与质控 |
| 性质 | 汇总统计层"金标准":不是个体级真值,而是当前最完整的全球可比估计 |
§3 数据集规格
§3.0 版本抉择矩阵
NCD-RisC 按主题滚动更新,不同论文版本覆盖年份、年龄定义与研究数不同,动手前先选对版本:
| 你的需求 | 推荐版本 | 规模 | 理由 |
|---|---|---|---|
| 最新全球 BMI/肥胖趋势(1990-2022) | Lancet 2024 BMI | 3,663 项研究、2.22 亿参与者 | 最新、含成人(≥20 岁)与儿童青少年(5-19 岁)两套 |
| 1975 年起的长期 BMI 基线 | Lancet 2017 BMI | 2,416 项研究、1.289 亿参与者 | 唯一覆盖 1975-2016 的全人群版本(成人 ≥18 岁) |
| 血压全球趋势 | Lancet 2017 血压 | 1,479 项研究、1.91 亿成人样本 | 唯一官方血压 pooling 版本(1975-2015) |
| 糖尿病患病率与治疗覆盖 | Lancet 2024 糖尿病 | 1,108 项研究、1.41 亿参与者 | 最新(1990-2022)且含治疗覆盖估计 |
| 糖尿病历史基线(1980-2014) | Lancet 2016 糖尿病 | 751 项研究、440 万参与者 | 唯一覆盖 1980 年起的版本 |
| 百年身高趋势 | eLife 2016 | 1,472 项研究、1,860 万参与者 | 唯一成人身高版本(出生队列 1896-1996) |
| 学龄儿童青少年身高 | Lancet 2020 | 2,181 项研究、6,500 万参与者 | 5-19 岁身高 BMI 轨迹(1985-2019) |
| 城乡 BMI 差异 | Nature 2019 | 官网 bmi-2019 目录提供 codebook | 唯一城乡分层专题分析 |
§3.1 模态详情
- 人体测量(BMI/身高):源研究以校准设备实测身高与体重;BMI = 体重(kg)/身高(m)²。估计输出为分性别、分年份的均值与 BMI 类别流行率(成人按 WHO 分类:<18.5、18.5-<25、25-<30、30-<35、35-<40、≥40 kg/m²;儿童青少年按相对中位数的 SD 等效值)。
- 血压:源研究实测收缩压(SBP)与舒张压(DBP),多为多次读数取均值;估计输出为均值血压与升高血压(SBP ≥140 或 DBP ≥90 mmHg)流行率。
- 血糖/糖尿病:源研究实测空腹血浆血糖并/或采集糖尿病诊断史与用药史;估计输出为糖尿病流行率(2024 版另含治疗覆盖)。
- 层级:所有主题均为"汇总统计"模态——公开文件是个体级数据的模型汇总,非个体记录。
§3.2 按主题样本数
| 主题论文 | 研究数 | 参与者 | 覆盖年份 | 国家/地区 |
|---|---|---|---|---|
| BMI 2016(成人) | 1,698 | 1,920 万成人 | 1975-2014 | 200(实测来自 186) |
| BMI 2017(全人群) | 2,416 | 1.289 亿 | 1975-2016 | 200 |
| BMI 2024(全人群) | 3,663 | 2.22 亿 | 1990-2022 | 200 |
| 血压 2017 | 1,479 | 1,910 万成人 | 1975-2015 | 200 |
| 糖尿病 2016 | 751 | 440 万 | 1980-2014 | 200 |
| 糖尿病 2024 | 1,108 | 1.41 亿 | 1990-2022 | 200 |
| 身高 eLife 2016 | 1,472 | 1,860 万 | 出生 1896-1996 | 200 |
| 儿童青少年身高 2020 | 2,181 | 6,500 万 | 1985-2019 | 200 |
| 腹型肥胖与高血压 2024 | 837 | 750 万 | 见论文 | 8 大区域 |
§3.3 数据格式
| 内容 | 格式 | 获取方式 |
|---|---|---|
| 估计值(world/region/country 三级) | CSV | 官网 Data downloads 直接下载 |
| age-specific 估计 | CSV/ZIP | 官网请求获取 |
| 模型 R 代码 + 输入数据(糖尿病 2024 示范) | ZIP(含 .R、.xlsx、.csv) | Zenodo 公开记录 |
| 输入数据 codebook(城乡 BMI 2019 示范) | XLSX | 官网直接下载 |
§3.4 存储大小
公开估计值 CSV 为轻量汇总数据:单个国家级文件通常在 KB 至 MB 量级;Zenodo 上糖尿病 2024 代码与输入数据包为 602.7 kB。整站全部主题下载后体积仍远小于 100 MB,适合在笔记本上完成全部分析,无 GPU 需求。存储建议按"主题/版本"两级目录组织(§4.0 目录树),目录名内嵌论文年份(如 bmi-2024/),使版本快照在文件系统层面即自解释。
§3.5 标注方式
NCD-RisC 无人工判读标注。所有"标签"(BMI 类别、升高血压、糖尿病)由实测值按统一阈值规则生成:成人 BMI 类别按 WHO 固定切点;儿童青少年超重/肥胖按相对年龄-性别中位数 2 SD 的等效 BMI;升高血压按 SBP ≥140 或 DBP ≥90 mmHg;糖尿病按诊断史或空腹血糖 ≥7 mmol/L 的组合定义。估计流程本身由贝叶斯层级模型完成,属"模型生成"层。
§3.6 测量者资质与一致性
源研究测量由各国经培训的调查员按各自方案完成;NCD-RisC 协调团队按统一协议重新筛选、重算与校准(例如血压读数的设备与袖带差异处理),并在论文附录报告敏感性分析。跨研究协议残余异质性是不可消除的系统性不确定来源(见坑点 7)。
§3.7 采集周期
源研究为一次性横断面调查(部分国家有连续多轮,如中国与墨西哥的多轮全国调查);NCD-RisC 以年为粒度输出估计,每年每个国家/性别/年龄组生成一个后验估计,历史年份由模型回溯补齐。
§3.8 地域覆盖
覆盖全球 200 个国家与地区(含中国台湾),2016 年 BMI 论文按 21 个区域组织,并聚合为若干超级区域(如高收入亚太、东亚与东南亚、波利尼西亚与密克罗尼西亚等)。实测研究密度在高收入国家与人口大国最高;小岛屿国家与撒哈拉以南部分国家实测数据稀疏,估计值主要来自层级模型外推(见坑点 4)。
论文摘要中明确出现的超级区域及高值/低值记录如下(完整 21 区域清单见论文附录):
| 超级区域/区域 | 论文记录的代表性结论 | 出处 |
|---|---|---|
| 高收入西方与亚太 | 血压均值 1975 年全球最高 → 2015 年全球最低 | 血压 2017 论文 |
| 东亚与东南亚、南亚、大洋洲、撒哈拉以南非洲 | 血压"可能上升"的区域组 | 血压 2017 论文 |
| 中欧与东欧 | 女性血压 40 年持续下降但水平仍全球最高档 | 血压 2017 论文 |
| 中亚、中东与北非 | 血压下降趋势较晚启动、不确定性较大 | 血压 2017 论文 |
| 波利尼西亚与密克罗尼西亚 | 2014 年均值 BMI 全球最高(男 29.2、女 32.2 kg/m²) | BMI 2016 论文 |
| 南亚 | 2014 年均值 BMI 全球最低(男 21.4、女 21.8 kg/m²);体重不足流行率最高(男 23.4%、女 24.0%) | BMI 2016 论文 |
| 中部非洲 | 男性均值 BMI 全球最低档(21.4 kg/m²) | BMI 2016 论文 |
| 安第斯拉美、中亚 | 1896 年出生队列身高最矮地区组 | 身高 eLife 2016 论文 |
| 加勒比与波利尼西亚/密克罗尼西亚岛国 | 2022 年成人"体重不足 + 肥胖"双重负担最高 | BMI 2024 论文 |
§3.9 设备与测量规格
源研究使用各国调查标准设备:身高体重用校准的身高计与体重秤;血压用水银柱或经验证的示波法设备(读数方案跨研究存在 2-7 次不等的差异);血糖用空腹静脉或毛细血管血样检测。NCD-RisC 不公开设备型号明细,协议差异的量化处理见各论文 Methods 与附录。
§3.10 深度溯源链
每一层数据变换都有书面记录,形成完整的"测量 → 估计 → 发布"证据链:
| 层级 | 执行者 | 产出 | 可核验方式 |
|---|---|---|---|
| 个体测量 | 各国调查现场人员 | 身高/体重/血压/血糖原始记录 | 源研究自身发布物 |
| 研究筛选 | 帝国理工协调团队 | 纳入研究清单(含排除原因) | 论文附录逐国清单 |
| 统一重算 | 帝国理工团队 | 各研究风险因素水平重算值 | 论文 Methods 协议 |
| 模型估计 | 帝国理工团队 | 各国-年-性别后验分布 | Zenodo 公开 R 代码可复跑 |
| 同行评审 | Lancet/eLife/Nature | 论文 + 附录 | 期刊存档 |
| 发布 | NCD-RisC 官网/Zenodo | CSV、代码、Docker 镜像 | 下载即得 |
| 政策采用 | WHO 等 | 全球慢病目标进展评估 | WHO 报告 |
§4 数据结构
§4.0 目录树
以下为从官网与 Zenodo 下载后的典型目录结构(文件名均为官方公布名):
ncd-risc/
├── bmi/
│ ├── NCD_RisC_Lancet_2024_BMI_age_standardised_world.csv
│ ├── NCD_RisC_Lancet_2024_BMI_age_standardised_region.csv
│ ├── NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv
│ ├── NCD_RisC_Lancet_2024_BMI_female_age_specific_country.zip # 需请求获取
│ ├── NCD_RisC_Lancet_2024_BMI_male_age_specific_country.zip # 需请求获取
│ ├── NCD_RisC_Lancet_2017_BMI_age_standardised_country.csv # 旧版(archives)
│ └── NCD_RisC_Lancet_2017_BMI_child_adolescent_country.csv # 旧版(archives)
├── blood_pressure/
│ └── (官网 Data downloads 血压主题同名结构)
├── diabetes/
│ ├── NCD_RisC_Lancet_2016_DM_age_standardised_countries.csv # 旧版(archives)
│ └── (官网 Data downloads 糖尿病主题同名结构)
├── height/
│ ├── NCD_RisC_eLife_2016_height_age18_countries.csv # 旧版(archives)
│ └── (官网 Height 下载页最新结构)
└── zenodo_code_input/ # Zenodo 13987398
├── NCD_RisC_diabetes_prevalence_code.R
├── NCD_RisC_diabetes_treatment_code.R
├── NCD_RisC_diabetes_functions.R
├── NCD_RisC_Lancet_2024_input_data_diabetes.xlsx
├── country-list-2023-new.csv
└── covariates-urbanisation-2021.csv
§4.1 DAIMS 字段字典(输入数据 codebook 字段,全部经官方 codebook 核实)
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| iso | Text | 国家 3 字母 ISO 码 | CHN | 地理聚合主键 | 无 | 无 | ISO 3166-1 alpha-3 |
| id_study | Text | 研究唯一标识 | 1042 | 溯源、去重 | 无 | 无 | 官方编号体系 |
| stratum | Text | 城乡分层 | rural / urban / mixed | 城乡差分分析 | 无 | 无 | |
| sex | Integer | 性别编码 | 1 | 分性别建模 | 无 | 无 | |
| age | Float | 年龄组中点 | 47.5 | 年龄调整、分层 | 组距内均匀假设 | 无 | 依调查设计 |
| N_bmi | Integer | 实测身高体重的样本量 | 1,412 | 元回归权重 | 抽样误差随 N 递减 | 无 | ≥0 |
估计值 CSV 在上述维度上输出"后验均值 + 95% 可信区间下限/上限"三列组(列名以官方文件首行为准,跨主题/跨版本存在差异,见坑点 8)。year 为整数年份;age 在 age-specific 文件中为年龄组标识。
§4.2 标签分布
以 BMI 2024 论文口径为例(成人 ≥20 岁,1990-2022):全球成人肥胖流行率持续上升,1990-2022 年间体重不足与肥胖合计流行率上升的国家占比:女性 81%(162/200 国)、男性 70%(140/200 国),其后验概率 ≥0.80;到 2022 年,89% 的国家(177/200)女性肥胖流行率超过体重不足。儿童青少年端:女孩肥胖超过消瘦的国家达 133 个(67%)。完整分布以官网 CSV 为准,本节数字直接引自论文摘要。
BMI 2024 论文同时给出"双重负担"(体重不足与肥胖合并)的方向性结论:1990-2022 年间,成人双重负担上升的国家为女性 162 国(81%)、男性 140 国(70%),而后验概率 ≥0.80 的下降仅见于女性 11 国(6%)、男性 17 国(9%);儿童青少年端下降更少(女孩 5 国、男孩 15 国)。这组分布数字意味着:以"下降国家"为正样本的分类/预测任务将面临极端类别不平衡——这也是把该数据集用于 ML 任务时必须在实验设计阶段处理好的现实。
§4.3 关键统计- 血压 2017 论文:全球升高血压人数 594M(1975)→ 1.13B(2015);2015 年男性升高血压流行率 24.1%、女性 20.1%。
- BMI 2016 论文:全球年龄标准化均值 BMI 男性 21.7(1975)→ 24.2 kg/m²(2014),女性 22.1 → 24.4 kg/m²。
- 糖尿病 2016 论文:1980-2014 年成人糖尿病患病率男性 4.3% → 9.0%,女性 5.0% → 7.9%。
- 身高 eLife 2016 论文:百年最大增幅为韩国女性 +20.2 cm、伊朗男性 +16.5 cm。
- 身高 eLife 2016 论文:百年间最高/最低人群差距始终约 19-20 cm(女)并有所扩大(男),但国家排名大幅洗牌。
- 以上全部为模型后验估计,引用时必须连同 95% 可信区间(见论文原文)。
§4.4 数据层级
全球层(world 文件)
└── 超级区域(如高收入国家、东亚与东南亚)
└── 区域(21 个分析区域)
└── 国家/地区(200 个,含中国台湾)
└── 性别(男/女)
└── 年份(逐年)
└── 年龄组(age-standardised 或 age-specific 文件)
注意:世界/区域/国家三级在官网是分开的三个文件,下载哪个层级取决于分析目的;区域文件用于区域比较,不要用它自行加总"重构"世界值(人口加权口径与官方不同)。
§4.5 缺失值与信息性缺失
- 公开估计值 CSV 原则上"每格都有值":没有实测研究的国家-年份由层级模型与协变量(UN 人口、城市化率等)生成估计,因此"看起来无缺失"。
- 信息性缺失体现在可信区间宽度:实测研究少的国家 CI 显著更宽。CI 宽度就是缺失信息的编码,任何下游分析都应把 CI 作为一等公民(见坑点 1、坑点 4)。
- age-specific 文件不直接公开(需请求),若分析需要年龄结构而未获得授权,切勿用 age-standardised 值冒充分年龄值。
识别"哪些估计缺少实测支撑"的实用做法:对比同一国家在 CI 宽度分布中的分位——CI 宽度处于全体国家最宽十分位的,基本就是实测研究稀疏或为零的群体;再与论文附录的逐国源研究清单交叉核对,即可为每个国家打上"证据等级"标签。建议把该标签作为生产管道里的一等字段随数据入库,所有下游模型按证据等级分层评估,而不是只看汇总 RMSE。
§5 数据划分与使用建议
§5.1 官方划分
无机器学习意义上的官方划分。官方提供的三级文件(world/region/country)与两套口径(age-standardised/crude)是"分析层级划分",不是 train/val/test。
由此推论:该数据集上任何"测试成绩"都是研究者自定义协议下的结果,跨论文不可比;复现他人数字必须先对齐其切分方式。
§5.2 社区惯例划分
- 时序留出:按年份切分(如 1990-2012 训练、2013-2017 验证、2018-2022 测试),模拟真实外推。
- 国家留出:随机或按区域留出部分国家,评估模型对"未见国家"的泛化;建议按区域整块留出以避免信息泄漏。
- 指标留出:以 BMI/血压趋势为输入预测另一指标或下游疾病负担,评估跨指标迁移。
§5.3 划分策略与泄漏风险
- 同国相邻年份高度自相关:随机按(国家,年份)网格切分会造成严重泄漏,测试集指标虚高。务必整块切分(整国或整时段)。
- 层级嵌套泄漏:同一超级区域内国家共享模型部分效应,按国家随机切分时区域信息已"看过"测试国家;跨区域评估更严格。
- 协变量时滞:UN 人口/城市化协变量若使用了未来修订版数据(如 2024 修订版 WPP),会向历史任务泄漏未来信息。
- 版本泄漏:训练与测试使用不同论文版本的估计值,会因版本间方法修订产生伪漂移(见坑点 2)。
§5.4 交叉验证建议
采用"留一区域"或"留一国群"的分组 K 折(GroupKFold,group=region 或 subregion),并报告各折 CI 覆盖率;纯随机 K 折在这里没有意义。
import pandas as pd
import numpy as np
from sklearn.model_selection import GroupKFold
df = pd.read_csv(
"./data/bmi/NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv")
df.columns = [c.strip().lower() for c in df.columns]
geo = next(c for c in df.columns
if c in ("iso", "iso3", "country", "country_code"))
# group=国家:保证同一国家的全部年份进入同一折,杜绝时序泄漏
gkf = GroupKFold(n_splits=5)
X = df.drop(columns=[c for c in df.columns if "mean" in c])
y = df[[c for c in df.columns if "mean" in c][0]]
for fold, (tr, te) in enumerate(gkf.split(X, y, groups=df[geo]), 1):
tr_countries, te_countries = set(df.iloc[tr][geo]), set(df.iloc[te][geo])
assert not (tr_countries & te_countries), "国家跨折 → 泄漏"
print(f"fold {fold}: train {len(tr_countries)} 国 / test {len(te_countries)} 国")
§5.5 外部验证建议
- 与 GBD(Global Burden of Disease)同指标估计做平行比较,量化方法学差异。
- 与 WHO Global Health Observatory 各国自报/实测指标对齐检验。
- 用未进入 pooling 的全国新调查(如最新一轮国家慢病调查)作为"真值"检验 NCD-RisC 同年估计的校准度。
§6 AI 就绪指南 ⭐
§6.0 云端快速启动
数据体量小,无需云端 GPU。任何可运行 Python 3.10+ 或 R 4.3+ 的环境即可;官方模型代码提供 Docker 镜像 ncdrisc/ncdrisc_hpc_docker(R 4.3.1 环境已核实于 Zenodo 记录),如需复跑官方估计用 Docker 最稳:
docker pull ncdrisc/ncdrisc_hpc_docker:0.2
docker run -it -v "$PWD":/work ncdrisc/ncdrisc_hpc_docker:0.2 Rscript /work/run_estimates.R
§6.1 快速上手
目录结构预期:把官网下载的 CSV 放进 data_root 指向的目录(如 ./data/bmi/)。data_root 与官网文件名直接拼接即可定位文件。最小可用子集:一份 NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv(KB-MB 级)即可完成全部演示。注意:下例不硬编码估计值列名(跨版本存在差异),用模式匹配动态发现数值列——这本身就是该数据集的第一工程实践。
# 预期目录结构:./data/bmi/NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv
# data_root 拼接关系:data_root / topic_dir / official_filename
# 最小可用子集:仅 country 级一个 CSV 即可运行
import pandas as pd
from pathlib import Path
data_root = Path("./data")
f = data_root / "bmi" / "NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv"
df = pd.read_csv(f)
print(df.shape) # 面板规模
print(df.columns.tolist()) # 先看真实列名,再写后续逻辑
# 动态发现均值列与可信区间列(避免跨版本列名差异导致脚本失效)
mean_cols = [c for c in df.columns if "mean" in c.lower()]
ci_cols = [c for c in df.columns if any(k in c.lower() for k in ("lower", "upper", "ci"))]
print("均值候选列:", mean_cols)
print("可信区间候选列:", ci_cols)
§6.2 数据获取
| 步骤 | 内容 |
|---|---|
| 1 | 访问官网 Data downloads:https://www.ncdrisc.org/data-downloads.html |
| 2 | 按主题(BMI/血压/糖尿病/身高)选择最新版本,下载 world/region/country 三级 age-standardised 与 crude CSV |
| 3 | age-specific 结果按官网指引以邮件请求(说明用途) |
| 4 | 需要复跑模型:Zenodo 记录 10.5281/zenodo.13987398 下载 R 代码与输入数据(602.7 kB) |
| 5 | 引用:使用哪个论文版本的数据就引用哪篇论文(BibTeX 见 §9) |
请求 age-specific 结果时,官方要求说明用途。邮件要点:研究者身份与机构、计划分析的主题与时间范围、所需主题/国家/年龄层、数据仅用于该研究并按论文引用。模板:
To: ncdrisc@imperial.ac.uk
Subject: Request for age-specific results (BMI, Lancet 2024)
Dear NCD-RisC team,
I am a researcher at [机构名] working on [研究主题]. I would like to
request the age-specific country-level results for [主题] as published in
[论文版本], for use in [用途描述]. I will cite the corresponding paper and
will not redistribute the files beyond the project team.
Thank you for your consideration.
import requests
url = ("https://www.ncdrisc.org/downloads/bmi-2019/"
"NCD_RisC_Nature_2019_input_data.xlsx") # 官网公开的输入数据 codebook 示例
r = requests.get(url, timeout=60)
r.raise_for_status()
Path("./data/bmi/NCD_RisC_Nature_2019_input_data.xlsx").write_bytes(r.content)
§6.3 预处理全流程
目标:把一份国家级 age-standardised CSV 整理成"国家-年份-性别"长表,并为时序建模加入不确定性列。流程:读取 → 动态识别列 → 类型规范化 → 不确定性宽度计算 → 基本校验。
import pandas as pd
import numpy as np
def load_ncdrisc_country(csv_path: Path) -> pd.DataFrame:
df = pd.read_csv(csv_path)
df.columns = [c.strip().lower() for c in df.columns]
# 1) 统一地理实体列:ISO3 码列通常名为 iso/iso3/country code 之一
geo_col = next(c for c in df.columns
if c in ("iso", "iso3", "country", "country_code", "location"))
# 2) 动态识别数值列(均值/下限/上限),不硬编码列名
def pick(patterns):
return next((c for c in df.columns
if any(p in c for p in patterns)), None)
mean_col = pick(["mean"])
lo_col = pick(["lower"])
hi_col = pick(["upper"])
# 3) 类型规范化
for c in (mean_col, lo_col, hi_col):
df[c] = pd.to_numeric(df[c], errors="raise")
# 4) 不确定性宽度 = 上限 - 下限(可信区间宽度的信息性编码)
df["ci_width"] = df[hi_col] - df[lo_col]
# 5) 基本校验:上下限不得交叉
bad = df[df[lo_col] > df[hi_col]]
assert bad.empty, f"可信区间上下限交叉 {len(bad)} 行"
return df[[geo_col, mean_col, lo_col, hi_col, "ci_width"]]
panel = load_ncdrisc_country(
Path("./data/bmi/NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv"))
panel.describe()
流程五步的设计理由:
- 先读列名再写逻辑:估计值列命名随主题与论文版本变化,动态发现优于硬编码。
- 地理列归一:同一语义列在不同文件可能叫 iso/iso3/country code,统一入口避免下游 join 失败。
- 类型规范化:CSV 全部为文本读入,数值列必须显式转换,转换失败即暴露格式异常。
- CI 宽度入列:把不确定性变成一等特征,供 §6.4 建模与 §6.9 校准检验共用。
- 上下限交叉断言:最廉价的完整性检查,任何版本更新先跑这一步。
§6.4 PyTorch DataLoader
任务示范:用每个国家的历史序列预测下一年肥胖相关水平(回归),并把可信区间宽度作为输入特征(让模型"知道"数据可靠程度)。数据层级:country → year 序列。整块切分策略见 §5.3。
<details>
<summary>展开完整 Dataset 类与 DataLoader 代码(约 60 行)</summary>
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
class CountryYearSeries(Dataset):
"""NCD-RisC 国家级面板 → 滑窗时序回归数据集。
目录结构预期:data_root 下为官网下载的 country 级 CSV;
data_root 拼接关系:data_root / csv 文件;最小子集为单个 CSV。
切分约定:整国切分(train_countries / test_countries),
绝不按行随机切分(同国相邻年份自相关 → 泄漏)。
"""
def __init__(self, csv_path, train_countries, seq_len=10,
mean_col=None, lo_col=None, hi_col=None):
df = pd.read_csv(csv_path)
df.columns = [c.strip().lower() for c in df.columns]
geo = next(c for c in df.columns
if c in ("iso", "iso3", "country", "country_code"))
self.mean_col = mean_col or next(c for c in df.columns if "mean" in c)
self.lo_col = lo_col or next(c for c in df.columns if "lower" in c)
self.hi_col = hi_col or next(c for c in df.columns if "upper" in c)
df["ci_width"] = df[self.hi_col] - df[self.lo_col]
self.df = df[df[geo].isin(train_countries)].copy()
self.seq_len = seq_len
self.samples = []
for _, g in self.df.groupby(geo):
g = g.sort_values("year")
feats = g[[self.mean_col, "ci_width"]].to_numpy(np.float32)
if len(feats) > seq_len:
for i in range(len(feats) - seq_len):
self.samples.append((feats[i:i+seq_len],
feats[i+seq_len, 0]))
def __len__(self):
return len(self.samples)
def __getitem__(self, idx):
x, y = self.samples[idx]
return torch.from_numpy(x), torch.tensor(y, dtype=torch.float32)
# --- 整国切分示例:按 ISO3 码切 80/20(生产中建议按区域整块切) ---
full = pd.read_csv(
"./data/bmi/NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv")
geo = next(c for c in full.columns
if c.strip().lower() in ("iso", "iso3", "country", "country_code"))
countries = sorted(full[geo].unique())
rng = np.random.default_rng(42)
test_countries = set(rng.choice(countries, size=max(1, len(countries)//5),
replace=False))
train_countries = [c for c in countries if c not in test_countries]
train_ds = CountryYearSeries(
"./data/bmi/NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv",
train_countries=train_countries, seq_len=10)
test_ds = CountryYearSeries(
"./data/bmi/NCD_RisC_Lancet_2024_BMI_age_standardised_country.csv",
train_countries=sorted(test_countries), seq_len=10)
train_loader = DataLoader(train_ds, batch_size=64, shuffle=True,
num_workers=2)
test_loader = DataLoader(test_ds, batch_size=128, shuffle=False)
</details>
§6.5 坑点 8 个(该数据集真实特有失败模式)
⚠️ 坑点 1:把后验估计当原始观测(分类:评估误用)
问题:官网 CSV 的每个数值都是贝叶斯层级模型的后验均值,已被模型平滑并借用了区域信息;研究者常把它当成"该国实测值"直接与本地调查数据做差值或当真值训练。
症状:模型在 NCD-RisC 曲线上"过拟合"得完美,但用真实新调查验证时系统性偏差;小国数据尤其失真(实测研究近乎为零,估计值主要由协变量驱动)。
解决:
- 简单方法:所有结论措辞区分"估计值"与"实测值";引用数字必须连同可信区间。
- 进阶方法:把 CI 宽度作为特征/权重传入模型(§6.4 示范),CI 越宽权重越低;对 CI 覆盖率做校准检验。
- SOTA 方法:把 NCD-RisC 估计当作"带测量误差的观测"进入状态空间模型,用其可信区间构造观测噪声,而非直接拟合点值。
参考:BMI 2016 论文 Methods(https://doi.org/10.1016/S0140-6736(16)30054-X);血压 2017 论文(https://doi.org/10.1016/S0140-6736(16)31919-5)
⚠️ 坑点 2:跨版本拼接趋势(分类:工程陷阱)
问题:NCD-RisC 各主题滚动更新,旧版整体移入官网 Archives 页;不同版本覆盖年份、成人年龄定义(BMI 2016 ≥18 岁 vs BMI 2024 ≥20 岁)与研究集不同,把它们当同一条曲线拼接会出现伪趋势。
症状:拼接曲线在版本交界年份出现无解释的台阶式跳变;同一国家 2014 与 2016 版数字对不上而误判"数据错误"。
解决:
- 简单方法:单一分析固定单一版本,在论文/报告中注明版本与引用论文。
- 进阶方法:必须跨版本时,仅取重叠年份做再校准(比例或回归校准),并报告校准不确定性。
- SOTA 方法:直接复跑官方最新版模型(Zenodo R 代码 + Docker 镜像),从源头获得一致的完整序列。
参考:官网 Archives(https://ncdrisc.org/archives.html);Zenodo(https://doi.org/10.5281/zenodo.13987398)
⚠️ 坑点 3:age-standardised 与 crude 混用(分类:预处理陷阱)
问题:官网同时提供年龄标准化值(用于跨国比较,剔除人口年龄结构影响)与粗率 crude 值(反映真实人口负担);两者趋势方向甚至可能相反(年轻化人口的国家 crude 肥胖率可被稀释)。
症状:用 crude 值做国家排名,人口年轻的国家被低估;用 age-standardised 值计算"全国患者总数",数字与卫生部门公布对不上。
解决:
- 简单方法:排名/比较用 age-standardised;估算负担人数(患病人数)用 crude × 各国人口。
- 进阶方法:建模时把口径声明为协变量元数据,训练/评估全程只用一种口径。
- SOTA 方法:需要两种口径时,用 age-standardised 序列 + UN WPP 人口结构自行重加权,复现 crude 并核对官网 crude 文件。
参考:官网 Data downloads 双口径文件组(https://www.ncdrisc.org/data-downloads.html)
⚠️ 坑点 4:忽略可信区间,只取点估计(分类:偏倚陷阱)
问题:数据稀疏国家(小岛屿国家、部分撒哈拉以南国家)的估计 CI 很宽——有时上下限相差数倍;只取后验均值会把模型外推的"猜测"当作高置信事实,在排名和回归中产生虚假确定性。
症状:小国在"最胖国家排行"中反复登顶(点值高但 CI 跨度巨大);以点值为目标的回归残差在小国上呈异方差。
解决:
- 简单方法:排名按 CI 下限或中位排序;报告时展示区间而非单点。
- 进阶方法:对每行估计从其 CI 重构近似后验分布,做蒙特卡洛传播,输出结论的分布而非点值。
- SOTA 方法:按 CI 宽度做证据分级(如 WHO 类比 GRADE),在 meta 回归中用逆方差加权。
参考:BMI 2016 论文可信区间报告(https://doi.org/10.1016/S0140-6736(16)30054-X);血压 2017 论文区域不确定性讨论(https://doi.org/10.1016/S0140-6736(16)31919-5)
⚠️ 坑点 5:用成人 BMI 切点分类儿童青少年(分类:标签理解)
问题:NCD-RisC 儿童青少年(5-19 岁)超重/肥胖标签按"相对同年龄同性别人群中位数 2 SD 的等效 BMI"定义,随年龄变化;直接套用成人固定切点(25/30 kg/m²)会把大量正常儿童误标为超重。
症状:5-19 岁文件按成人切点重算后肥胖率异常飙升或骤降;与官方文件对不齐。
解决:
- 简单方法:儿童青少年一律使用官方文件自带的类别流行率列,不自行重算。
- 进阶方法:需要自定义切点时,采用 WHO 儿童生长参考或 IOTF 标准,并在报告中说明与 NCD-RisC 定义不可直接比较。
- SOTA 方法:同时报告 WHO 与 IOTF 两套定义做敏感性分析——这正是 NCD-RisC 论文附录的做法。
参考:BMI 2024 论文摘要(https://doi.org/10.1016/S0140-6736(23)02750-2);BMI 2017 论文(https://ncdrisc.org/archives.html)
⚠️ 坑点 6:与 GBD/WHO GHO 数字直接混比(分类:评估误用)
问题:GBD、WHO GHO 与 NCD-RisC 都产出国家级风险因素估计,但模型假设、纳入研究集与标准人口不同;把三者数字放进同一张表"互相验证",差异往往被误读为某一方"数据错误"。
症状:同一国家同一年肥胖率在三个来源相差 3-8 个百分点;审稿人质询口径不一致。
解决:
- 简单方法:单一来源单一口径贯穿全文;跨来源差异作为"方法学不确定性"单独讨论。
- 进阶方法:做来源间一致性分析(Bland-Altman 或相关分析),量化系统偏差而非逐点对错。
- SOTA 方法:把多来源估计放入三角互证(triangulation)框架,差异本身作为结论的一部分呈现。
参考:NCD-RisC 官网关于方法的说明(https://ncdrisc.org);WHO GHO(https://www.who.int/data/gho)
⚠️ 坑点 7:源研究测量协议异质性的残余偏倚(分类:偏倚陷阱)
问题:pooling 的各研究血压测量次数(1-7 次)、设备类型、血糖采血与空腹状态要求不同;NCD-RisC 已做标准化校正,但下游用户若重新 pooling 或把估计值与单次本地调查硬比,残余协议差异会显形。
症状:本地调查值与 NCD-RisC 同年估计差值方向与本地已知的测量方案偏差一致(如本地只测一次血压 → 系统性偏高);糖尿病估计对"诊断史 + 空腹血糖"组合定义敏感。
解决:
- 简单方法:对比前核对本地调查协议与 NCD-RisC 协议差异清单(论文 Methods/附录)。
- 进阶方法:按协议特征(测量次数、设备类型)做分层或校正后再比较。
- SOTA 方法:引用糖尿病定义差异的专门研究(Nat Med 2023,基于空腹血糖与 HbA1c 的全球差异分析),用其对齐诊断口径。
参考:Nat Med 2023(https://www.ncdrisc.org/publications.html);血压 2017 论文 Methods(https://doi.org/10.1016/S0140-6736(16)31919-5)
⚠️ 坑点 8:age-specific 与输入数据的获取边界(分类:工程陷阱)
问题:官网只直接提供 age-standardised 与 crude 汇总 CSV;分年龄结果需邮件请求,个体级输入数据仅在"数据治理与共享安排许可"下提供(部分来源只给联系信息)。自动化脚本若假设所有层都可下载,会在 age-specific 环节断链;而拿到的历史输入数据快照又可能与新版本估计不对应。
症状:爬取官网链接出现 404 或仅获部分文件;用旧版输入数据复跑得到与论文不一致的估计。
解决:
- 简单方法:按"官网公开层 → 邮件请求层 → Zenodo 代码层"三级明确数据需求,脚本按存在性检测降级处理。
- 进阶方法:固定 Zenodo 版本号(如 10.5281/zenodo.13987398 v1.0)与官方 Docker 镜像,保证代码-数据-环境三位一体可复现。
- SOTA 方法:为项目建立"数据快照 + 版本清单 + 引用论文"的注册表,任何估计值入库都记录其论文版本与下载日期。
参考:Zenodo 记录(https://doi.org/10.5281/zenodo.13987398);论文 Data sharing 声明(BMI 2024,https://doi.org/10.1016/S0140-6736(23)02750-2)
§6.6 数据增强
- ✅ 安全:时间平滑(移动平均)、按区域聚合重采样、对数/标准化变换、加入与 CI 宽度成比例的高斯观测噪声(等价于不确定性传播)、国家嵌入随机掩码。
- ❌ 危险:对"国家-年份"网格做线性插值补齐后当作真值训练(会把模型外推洗白成数据);跨版本混拼后做增强(固化版本伪影);用镜像/翻转类图像增强思维处理面板数据(地理实体不可"翻转");对 CI 宽度做独立增强而破坏与均值的联合分布。
一条判断准则:任何增强都不得改变"该估计的不确定性"与"该估计的值"之间的联合关系。凡是让 CI 宽的国家变得和 CI 窄的国家"看起来一样可靠"的增强,都是在向模型注入系统性的过度自信。
§6.7 模型推荐
| 模型 | 适用场景 | 理由 |
|---|---|---|
| 层级贝叶斯时序模型 | 复现/扩展官方方法 | 与数据生成机制同构,天然输出区间 |
| Prophet / 结构化时序 | 单国趋势外推基线 | 小样本、含趋势与季节外推项,训练秒级 |
| N-BEATS / N-HiTS | 多国批量预测 | 纯时序架构,可混合 CI 宽度协变量 |
| Temporal Fusion Transformer | 多指标多协变量 | 处理 BMI+血压+城市化协变量的注意力融合 |
| 空间层级模型(CAR/GP) | 空间插值与不平等 | 利用地理邻接结构,适合稀疏数据国家 |
| LightGBM 面板基线 | 快速强基线 | 表格面板友好,需配整块切分防泄漏 |
§6.8 硬件需求
| 任务 | 配置 |
|---|---|
| 全部官方 CSV 分析与可视化 | 任意笔记本(4 GB 内存) |
| 多国批量时序训练(N-BEATS 等) | 单卡消费级 GPU 或 CPU 数小时 |
| 复跑官方贝叶斯估计 | 多核 CPU + 官方 Docker(R 4.3.1) |
§6.9 评估指标代码
时序回归三件套 + 该数据集特有的"区间校准"指标:
import numpy as np
def rmse(y_true, y_pred):
return float(np.sqrt(np.mean((np.asarray(y_true) - np.asarray(y_pred)) ** 2)))
def mae(y_true, y_pred):
return float(np.mean(np.abs(np.asarray(y_true) - np.asarray(y_pred))))
def interval_coverage(y_true, lo, hi):
"""模型预测区间(或数据自带可信区间)对真值的覆盖率。"""
y = np.asarray(y_true)
return float(np.mean((np.asarray(lo) <= y) & (y <= np.asarray(hi))))
def sharpness(lo, hi):
"""区间锐度:平均宽度,越窄越好(在覆盖率达标前提下)。"""
return float(np.mean(np.asarray(hi) - np.asarray(lo)))
# 使用示例:以数据自带可信区间为参照,检验你的模型预测区间是否
# 与官方不确定性同量级(覆盖率接近 95% 且锐度不显著更宽)
# cov = interval_coverage(y_test, pred_lo, pred_hi) # 期望 ≈ 0.95
# sh = sharpness(pred_lo, pred_hi) # 越接近官方 CI 宽度越好
§6.10 MLOps 笔记
- 数据版本化:估计值随论文版本修订,务必用 DVC/git-lfs 固化"哪个论文版本 + 下载日期"的快照;官网 Archives 是官方旧版存档,不要自己找补。
- 环境复现:复跑官方模型统一使用 Zenodo 附带的 Docker 镜像(
ncdrisc/ncdrisc_hpc_docker),锁定 R 4.3.1。 - 监测漂移:若在生产中用 NCD-RisC 估计做基准,订阅官网 Latest publications,新版发布即触发重评估流水线。
- 测试策略:在 CI 中内置 §6.3 的基本校验(上下限交叉、年份连续性、ISO 码合法性),任何版本更新先跑校验再入库。
- 合规:公开估计值无 DUA 门槛,但对外发布衍生产品时应标注"基于 NCD-RisC 估计值(引用对应论文)";age-specific 与输入微数据的使用遵守原研究治理安排。
- 沟通机制:模型方法问题优先查论文附录与 Zenodo 代码注释;仍无法解决时经 ncdrisc@imperial.ac.uk 与协调团队联系,往来记录归档进项目知识库。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 数据稀疏外推 | 小岛屿国家等实测研究极少,估计主要来自模型 | 高 | 报告并使用 CI;敏感性分析剔除低证据国家 |
| 测量协议异质 | 血压测量次数/设备、血糖检测方案跨研究不一 | 中 | 官方统一重算校正;下游对比前核对协议(坑点 7) |
| 定义漂移 | 成人年龄定义(≥18 vs ≥20)与诊断标准跨版本变化 | 中 | 单版本分析;跨版本再校准(坑点 2) |
| 城市化与人口协变量依赖 | 估计借用 UN WPP/城市化协变量,协变量误差传导 | 低-中 | 关注论文协变量敏感性分析 |
| 发布选择 | 各主题更新节奏不同,主题间"最新年份"不一致 | 低 | 用版本抉择矩阵(§3.0)对齐需求 |
| 排名伪影 | 点值排名让 CI 极宽的小国反复登顶 | 中 | 按 CI 下限/中位排名;蒙特卡洛传播(坑点 4) |
§7.2 标注质量
无人工判读标注环节;标签由实测值 + 统一阈值规则生成,可复现性强(阈值全部公开于论文 Methods)。模型层"标注"(后验估计)经同行评审与官方代码复跑验证,重现性在同领域属最高档。
质量控制的三道闸门值得下游信任但也要理解其边界:第一道是研究纳入筛选(排除自报数据、非概率抽样与临床就诊样本),协议公开且逐研究记录;第二道是数值重算与离群检查(对源数据重新计算指标水平,异常回查);第三道是模型层敏感性分析(替代先验、协变量集、区域结构均做过扰动检验并见于附录)。边界在于:个体级录入错误无法在汇总层完全暴露,且前两道闸门依赖源研究团队提交的数据质量——因此对关键国家的关键数字,最稳妥的核验方式仍是回溯该国原始调查报告做三角比对。
§7.3 泛化性
| 使用场景 | 失效风险 | 证据 |
|---|---|---|
| 跨国排名与比较 | 低-中(需用 age-standardised + CI) | 官方双口径文件与可信区间体系 |
| 单国外推未来趋势 | 中(政策突变/冲突国家结构断裂) | 血压 2017 论文记录的区域趋势逆转 |
| 数据稀疏国家点值应用 | 高 | CI 宽度即证据(坑点 1、4) |
| 与本地调查直接对比 | 中(协议异质性) | 坑点 7;Nat Med 2023 定义差异研究 |
| 儿童青少年阈值迁移 | 高(定义体系不同) | 坑点 5 |
| 糖尿病定义迁移应用 | 中-高(诊断口径差异) | 坑点 7;Nat Med 2023 定义差异研究 |
| 城乡对比重算 | 中(stratum 结构见官方 codebook) | Nature 2019 城乡分析与 codebook |
§7.4 伦理
数据为人群汇总统计,不含个体信息;源研究各自在其国内伦理框架下完成。使用时避免对特定国家人群的污名化解读(肥胖/疾病排名的传播语境),遵循 WHA 相关伦理与公平叙事惯例。
§7.5 公平性
NCD-RisC 的核心贡献之一即揭示全球健康不平等(风险负担从高收入国家向中低收入国家转移)。但需注意:数据稀疏国家的估计不确定性最大,而它们恰恰多为低与中低收入国家——若忽略 CI,不平等分析会系统性高估这些国家的"异常值"风险。
§7.6 数据漂移
两类漂移需监控:一是真实现象漂移(如高收入国家肥胖平台期,官网 2026 年新闻即为此主题);二是版本漂移(新版论文修订历史估计值)。建议对生产系统中引用的每个数字标注版本,新版发布时跑差异报告。
实务上可设三个监测点:年度检查(官网 Latest publications 是否有本主题新论文)、版本比对(新旧版同国同年估计差异超过 CI 宽度 10% 即触发人工复核)、校准复核(生产模型对最新一轮国家调查的预测偏差季度回看)。三个监测点共同保证"估计在变、你的产品不会悄悄失准"。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ❌ | 面板长格式(country-year-sex 行),时序分析更友好,但需透视才能做宽表对比 |
| 2 | 唯一标识 | ✅ | iso + sex + year(+age 组)组合键唯一;输入数据有 id_study |
| 3 | 特殊字符 | ✅ | ASCII CSV,无特殊分隔符陷阱 |
| 4 | 重复行 | ✅ | 同键无重复(以 2024 BMI country 文件结构为准) |
| 5 | 缺失编码 | ⚠️ | 汇总层"无显式缺失",无实测国家由模型填补——缺失被吸收进 CI 宽度 |
| 6 | 标签标识 | ⚠️ | 性别用数字编码(输入层 1/2);类别流行率列命名跨版本不一 |
| 7 | 罕见类分组 | ✅ | 小样本国家由层级模型自然处理,无需人工合并 |
| 8 | 偏倚评估 | ✅ | 论文系统报告敏感性分析与方法学比较 |
| 9 | 数据字典 | ⚠️ | 输入数据有官方 codebook;估计值 CSV 列说明散见于论文附录 |
| 10 | 信息性缺失解释 | ✅ | CI 宽度即缺失信息编码,论文明确说明 |
| 11 | 设备记录 | ⚠️ | 协议差异在论文 Methods 描述,逐研究设备明细不公开 |
| 12 | 共线性 | ✅ | 汇总层无共线性问题 |
| 13 | 编码映射 | ✅ | ISO 3166-1 alpha-3 标准码 |
| 14 | 时间戳处理 | ✅ | 整数年份,无时区/格式歧义 |
| 15 | 划分建议 | ⚠️ | 无官方 ML 划分;需按 §5.3 自建整块切分 |
| 16 | 泄漏讨论 | ✅ | 时序自相关与层级嵌套泄漏路径清晰可辨(§5.3) |
| 17 | 标签分布 | ✅ | 各类别流行率与人数论文全量报告 |
| 18 | 测量偏倚 | ⚠️ | 协议异质性有校正但残余不可排除 |
| 19 | 外部验证建议 | ✅ | GBD/WHO GHO/本国调查三条外部对照路径明确 |
| 20 | 版本记录 | ✅ | 官网 Archives 完整保留旧版估计 |
| 21 | 预处理脚本 | ✅ | Zenodo 公开官方 R 代码与 Docker 环境 |
| 22 | 合规要求 | ✅ | 估计值开放下载,无 DUA;age-specific 需请求 |
| 23 | 多模态对齐 | ⚠️ | 各主题独立分析,跨主题对齐需自行处理年龄定义差异 |
| 24 | 去标识化 | ✅ | 纯汇总统计,无个体级记录(de-identified summary layer) |
DAIMS 评分:19.5 / 24(✅ 计 16 项、⚠️ 计 7 项 × 0.5、❌ 计 1 项 × 0)
评分解读:该数据集在"可追溯性、可复现性、版本管理与合规"四方面达到流行病学公开数据的最高水准——官方代码、Docker 环境、旧版存档一应俱全;失分集中在"面向机器学习的工程化":无官方划分、估计值列名与编码跨版本不统一、输入微数据不可直接获取。它是"研究级即用、ML 级需加工"的典型。
对你意味着什么:
- 若你的任务是趋势预测/政策建模:直接用,优先固定单一论文版本,把 CI 宽度放进特征(半天内可出第一条基线)。
- 若你的任务是构建 ML 训练集:预留一天做 §6.3 预处理 + §5.3 整块切分设计,并建立版本快照注册表。
- 若你需要分年龄或个体级数据:走邮件请求/Zenodo 路径,把等待周期排进项目计划,不要在脚本里假设这些层可直接下载。
- 若你做跨来源研究:把来源差异当作研究对象而非误差,参考坑点 6 的三角互证框架。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| 城乡 BMI 分解 | NCD-RisC/Nature 2019 | 城乡贡献分解 | 趋势差值 | 官方专题输出 | 农村 BMI 上升是全球肥胖增长主驱动 |
| 空腹血糖 vs HbA1c 诊断 | NCD-RisC/Nat Med 2023 | 糖尿病定义敏感性 | 患病率差值 | 定义间系统性差异 | 诊断口径显著改变各国患病估计 |
| 美国心血管代谢表型 | Nat Cardiovasc Res 2024 | 美国表型转变 | 表型流行率 | 与国内调查一致 | 肥胖相关多病共存上升 |
| WHO 慢病目标评估 | WHO/WHA 进程 | 2025 目标可达性 | 后验概率 | 政策采用 | BMI 2016 评估 2025 肥胖目标达成概率几乎为零 |
§8 基准性能与生态
§8.1 下游复用与"基准"
NCD-RisC 不是机器学习竞赛数据集,不存在 Kaggle/paperswithcode 排行榜;其"基准"角色体现为被下游研究与政策评估复用。以下为经同行评审的代表性下游工作(完整引用):
| 研究 | 任务 | 核心发现 | 完整引用 |
|---|---|---|---|
| 城乡 BMI 分解 | 归因分解 | 农村 BMI 上升是全球成人肥胖主驱动 | NCD Risk Factor Collaboration (NCD-RisC), 2019, Nature. DOI 见官网 publications 页 |
| 糖尿病诊断差异 | 定义敏感性 | 空腹血糖与 HbA1c 口径显著改变估计 | Zhang M et al.(NCD-RisC 相关分析), 2023, Nature Medicine 29:2885-2901 |
| 美国表型转变 | 队列表型 | 肥胖相关多病共存演变 | Lhoste VPF, Zhou B, et al., 2024, Nature Cardiovascular Research 3:46-59 |
| 2025 肥胖目标评估 | 政策评估 | 按当时趋势目标达成概率几乎为零 | NCD-RisC, 2016, The Lancet 387(10026):1377-1396. DOI 10.1016/S0140-6736(16)30054-X |
注:各行数字产自不同模型假设与年份口径,不可直接横向比较数值大小;比较请回到各自论文的协议描述。
§8.2 SOTA 总结与选型建议
该数据集无 SOTA 排行概念。选型建议:做"复现官方数字"选层级贝叶斯 + 官方 Docker;做"快速趋势洞察"选 Prophet;做"多国批量深度预测"选 N-BEATS/TFT 并以官方估计为观测、CI 为观测噪声。
§8.3 评测协议
建议协议:整国留出(或留一区域)+ 时序滚动起点;报告 RMSE/MAE 之外必须报告区间覆盖率与锐度(§6.9);所有结果绑定论文版本号。
一个可复用的最小协议模板:固定随机种子与版本快照 → GroupKFold(5) 整国切分 → 每折报告 RMSE/MAE/覆盖率/锐度四指标 → 汇总均值 ± 标准差 → 另行报告"全量训练 + 最近三年留出"的外推成绩单。两组数字分开呈现,前者衡量跨国家泛化,后者衡量时间外推——把它们混成一个数字是该数据集上最常见的评测误用。
§8.4 相关数据集
| 数据集 | 机构 | 关系 |
|---|---|---|
| Global Health Observatory | WHO | 指标最全的官方汇总,与 NCD-RisC 互为补充 |
| Global Burden of Disease | IHME | 疾病负担全谱估计,方法学平行体系 |
| World Bank HNP | 世界银行 | 各国官方卫生营养人口指标转载 |
| Demographic and Health Surveys (DHS) | USAID/ICF | 许多源研究的上游,提供微数据 |
| Our World in Data | OWID | NCD-RisC 数据的可视化转载层 |
§8.5 关键论文 Top 9
- NCD Risk Factor Collaboration (NCD-RisC). Trends in adult body-mass index in 200 countries from 1975 to 2014: a pooled analysis of 1698 population-based measurement studies with 19.2 million participants. The Lancet, 2016, 387(10026):1377-1396. DOI 10.1016/S0140-6736(16)30054-X —— 首发标志性论文,全球 BMI 趋势基准。
- NCD-RisC. Worldwide trends in diabetes since 1980: a pooled analysis of 751 population-based studies with 4.4 million participants. The Lancet, 2016, 387(10026):1513-1530 —— 与上篇同期发表,确立糖尿病全球趋势。
- NCD-RisC. A century of trends in adult human height. eLife, 2016, 5:e13410. DOI 10.7554/eLife.13410 —— 百年身高趋势,营养环境的长时段记录。
- NCD-RisC. Worldwide trends in blood pressure from 1975 to 2015: a pooled analysis of 1479 population-based measurement studies with 19.1 million participants. The Lancet, 2017, 389(10064):37-55. DOI 10.1016/S0140-6736(16)31919-5 —— 血压主题基准,被引 1,876 次(ScienceDirect,截至 2026-09)。
- NCD-RisC. Worldwide trends in body-mass index, underweight, overweight, and obesity from 1975 to 2016: a pooled analysis of 2416 population-based measurement studies in 128.9 million children, adolescents, and adults. The Lancet, 2017, 390:2627-2642 —— 全人群(含儿童青少年)BMI 长基线。
- NCD-RisC. Rising rural body-mass index is the main driver of the global obesity epidemic in adults. Nature, 2019 —— 城乡归因专题,官网提供输入数据 codebook。
- NCD-RisC. Height and body-mass index trajectories of school-aged children and adolescents from 1985 to 2019 in 200 countries and territories: a pooled analysis of 2181 population-based studies with 65 million participants. The Lancet, 2020, 396:1511-1524 —— 儿童青少年生长轨迹。
- NCD-RisC. Worldwide trends in underweight and obesity from 1990 to 2022: a pooled analysis of 3663 population-representative studies with 222 million children, adolescents, and adults. The Lancet, 2024, 403(10431):1027-1050. DOI 10.1016/S0140-6736(23)02750-2 —— 当前 BMI 最新版本(成人 ≥20 岁)。
- NCD-RisC. Worldwide trends in diabetes prevalence and treatment from 1990 to 2022: a pooled analysis of 1108 population-representative studies with 141 million participants. The Lancet, 2024 —— 糖尿病最新版本,代码与输入数据经 Zenodo 公开。
§8.6 社区活跃度
NCD-RisC 以"论文 + 官网"为主要发布渠道:官网持续发布新论文与新闻(2026 年仍有 Lancet/Nature 新作与多家国际媒体报道);无官方 GitHub 仓库,代码发布以 Zenodo 记录与官网"code and input data download"入口为准;联系通道为 ncdrisc@imperial.ac.uk。学术社区覆盖 200 国数千名协作者,引用血压 2017 论文 1,876 次(ScienceDirect 计数,截至 2026-09)。
社区使用的三个典型入口:一是数据消费者(研究者/WHO/媒体)直接下载官网 CSV 做引用级分析;二是方法研究者通过 Zenodo 代码复跑或扩展官方模型(R 生态为主);三是数据新闻与教学场景经 Our World in Data 等可视化转载层间接使用。三个入口对应三种"版本纪律":第一类须标注论文版本,第二类须锁定 Zenodo 版本号与 Docker 标签,第三类以源头论文为准回溯引用。官方不设论坛,方法学讨论以论文通信(Lancet 相关评论与 Department of Error 条目)和邮件为主。
§8.7 生态快照
| 资源 | 类型 | 链接 | Star(截至 2026-09) | 推荐理由 |
|---|---|---|---|---|
| NCD-RisC 官网 | 官方主页/数据 | https://ncdrisc.org | —(非 GitHub 资源) | 一手数据与公告 |
| Data downloads | 官方下载 | https://www.ncdrisc.org/data-downloads.html | —(非 GitHub 资源) | 全主题估计值 CSV |
| Archives | 官方旧版存档 | https://ncdrisc.org/archives.html | —(非 GitHub 资源) | 版本对照与历史复现 |
| Zenodo 糖尿病 2024 代码库 | 代码+输入数据 | https://doi.org/10.5281/zenodo.13987398 | —(非 GitHub 资源) | 复跑官方贝叶斯模型 |
| Docker Hub 官方镜像 | 环境 | https://hub.docker.com/r/ncdrisc/ncdrisc_hpc_docker | —(非 GitHub 资源) | R 4.3.1 环境一键复现 |
| Our World in Data 身高页 | 可视化转载 | https://ourworldindata.org/grapher/average-height-of-women | —(非 GitHub 资源) | 教学与快速可视化 |
§9 相关资源与引用
§9.1 官方资源
- 官方主页:https://ncdrisc.org
- 数据下载:https://www.ncdrisc.org/data-downloads.html
- 身高数据下载:https://www.ncdrisc.org/data-downloads-height.html
- 旧版存档:https://ncdrisc.org/archives.html
- 论文列表(含 code and input data download 入口):https://www.ncdrisc.org/publications.html
- 输入数据 codebook(城乡 BMI 2019):https://www.ncdrisc.org/downloads/bmi-2019/NCD_RisC_Nature_2019_input_data.xlsx
- Zenodo 代码与输入数据(糖尿病 2024):https://doi.org/10.5281/zenodo.13987398
- 联系邮箱:ncdrisc@imperial.ac.uk
- 城乡 BMI 2019 输入数据 codebook 直链:https://www.ncdrisc.org/downloads/bmi-2019/NCD_RisC_Nature_2019_input_data.xlsx
- 官方 Docker 镜像(R 4.3.1 模型环境):https://hub.docker.com/r/ncdrisc/ncdrisc_hpc_docker
- 本词条页面:https://www.qianfanghub.com/ai-ready-dataset/ncd-risc/400
§9.2 BibTeX 引用
@article{NCDRisC2016BMI,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {Trends in adult body-mass index in 200 countries from 1975 to 2014:
a pooled analysis of 1698 population-based measurement studies
with 19.2 million participants},
journal = {The Lancet},
volume = {387},
number = {10026},
pages = {1377--1396},
year = {2016},
doi = {10.1016/S0140-6736(16)30054-X}
}
@article{NCDRisC2016Diabetes,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {Worldwide trends in diabetes since 1980: a pooled analysis of
751 population-based studies with 4.4 million participants},
journal = {The Lancet},
volume = {387},
number = {10026},
pages = {1513--1530},
year = {2016}
}
@article{NCDRisC2016Height,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {A century of trends in adult human height},
journal = {eLife},
volume = {5},
pages = {e13410},
year = {2016},
doi = {10.7554/eLife.13410}
}
@article{NCDRisC2017BP,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {Worldwide trends in blood pressure from 1975 to 2015:
a pooled analysis of 1479 population-based measurement studies
with 19.1 million participants},
journal = {The Lancet},
volume = {389},
number = {10064},
pages = {37--55},
year = {2017},
doi = {10.1016/S0140-6736(16)31919-5}
}
@article{NCDRisC2017BMI,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {Worldwide trends in body-mass index, underweight, overweight,
and obesity from 1975 to 2016: a pooled analysis of 2416
population-based measurement studies in 128.9 million children,
adolescents, and adults},
journal = {The Lancet},
volume = {390},
pages = {2627--2642},
year = {2017}
}
@article{NCDRisC2024BMI,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {Worldwide trends in underweight and obesity from 1990 to 2022:
a pooled analysis of 3663 population-representative studies
with 222 million children, adolescents, and adults},
journal = {The Lancet},
volume = {403},
number = {10431},
pages = {1027--1050},
year = {2024},
doi = {10.1016/S0140-6736(23)02750-2}
}
@misc{NCDRisC2024Code,
author = {{NCD Risk Factor Collaboration (NCD-RisC)}},
title = {Code and data for estimates of diabetes prevalence and treatment
coverage, 1990-2022 (Lancet 2024)},
year = {2024},
doi = {10.5281/zenodo.13987398},
url = {https://zenodo.org/records/13987398}
}
§9.3 引用指南
- 用了哪个论文版本的数据,就引用哪篇论文(§9.2 提供全部条目);官网下载页也随每份文件给出建议引用语。
- 引用估计数字时必须连同可信区间与"基于贝叶斯层级模型估计"的限定语。
- 复现模型或衍生产品发布时,同时引用 Zenodo 代码记录并注明运行环境(官方 Docker 镜像标签)。
§10 AI 使用声明卡
§10.1 AI 模型列表
- 本词条正文由大语言模型辅助撰写(初稿生成与结构组织)。
- 事实核验与数字校对:WebSearch 检索 + 编辑部人工核对(见 §10.3 来源列表)。
§10.2 AI 参与范围
- 参与:章节框架生成、初稿撰写、代码示例编写、表格整理、语言润色。
- 不参与:事实裁断(数字必须可溯源,不可溯源即删除)、医学审核(由编辑部承担)、最终发布决定。
- 约束机制:全部规模数字、引用计数、版本日期在写作阶段即绑定 §10.3 来源列表;任何在检索中无法核实的字段一律省略而非推测,省略决策由人工复核确认。
§10.3 输入来源列表
- NCD-RisC 官方主页。 https://ncdrisc.org
- NCD-RisC 数据下载页(Data downloads)。 https://www.ncdrisc.org/data-downloads.html
- NCD-RisC 身高数据下载页。 https://www.ncdrisc.org/data-downloads-height.html
- NCD-RisC 旧版估计存档(Archives)。 https://ncdrisc.org/archives.html
- NCD-RisC 论文列表页。 https://www.ncdrisc.org/publications.html
- NCD-RisC. Trends in adult body-mass index in 200 countries from 1975 to 2014. The Lancet 2016;387(10026):1377-1396. https://doi.org/10.1016/S0140-6736(16)30054-X
- NCD-RisC. Worldwide trends in blood pressure from 1975 to 2015. The Lancet 2017;389(10064):37-55. https://doi.org/10.1016/S0140-6736(16)31919-5
- NCD-RisC. A century of trends in adult human height. eLife 2016;5:e13410. https://doi.org/10.7554/eLife.13410
- NCD-RisC. Worldwide trends in underweight and obesity from 1990 to 2022. The Lancet 2024;403(10431):1027-1050. https://doi.org/10.1016/S0140-6736(23)02750-2
- NCD-RisC 糖尿病 1990-2022 代码与输入数据(Zenodo 记录,含 R 代码、Docker 镜像与协变量说明)。 https://zenodo.org/records/13987398
- 城乡 BMI 2019 输入数据 codebook(官方 XLSX)。 https://www.ncdrisc.org/downloads/bmi-2019/NCD_RisC_Nature_2019_input_data.xlsx
- Luxembourg Institute of Health 关于 2016 年两项 Lancet pooling 分析与帝国理工 WHO 协作中心的说明。 https://events.lih.lu/blog/our-news-1/post/lih-contributed-to-large-scale-studies-on-worldwide-obesity-and-diabetes-estimations-47
- ScienceDirect 血压 2017 论文页(被引计数 1,876,截至 2026-09)。 https://www.sciencedirect.com/science/article/pii/S0140673616319195
- Our World in Data 身高数据页(NCD-RisC 转载与 CC BY 复用说明)。 https://ourworldindata.org/grapher/average-height-of-women
- Middlesex University 机构库血压 2017 论文记录(CC BY 许可信息)。 https://eprints.mdx.ac.uk/20828/
§10.4 人工校验
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §1 概览与规模数字 | 千方病案医学编辑部 | 对照官网/论文逐条核对检索快照 | ✅ 已通过 |
| §2 医学背景(ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 术语映射交叉审核 | ✅ 已通过 |
| §3-§4 数据规格与字段字典 | 医疗 AI 数据工程师 | 对照官方 codebook 与下载页结构 | ✅ 已通过 |
| §6 AI 就绪指南与 8 坑点 | 医疗 AI 数据工程师 | 代码本地试跑 + 坑点溯源核对 | ✅ 已通过 |
| §7 质量评估与 DAIMS | 医疗 AI 数据工程师 | 24 项逐项核对 | ✅ 已通过 |
| §8-§9 生态与引用 | 千方病案医学编辑部 | 引用逐条回访 | ✅ 已通过 |
| §10 声明卡与来源列表 | 千方病案医学编辑部 | 15 条来源逐条可达性验证 | ✅ 已通过 |
§10.5 AI 生成章节标注
全部章节为 AI 辅助生成初稿,经 §10.4 所列人工审核通过后发布;引用数字均可回溯至 §10.3 来源列表。
§10.6 最后人工审核日期
2026-09-05(与 §0.3 审核日期一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- framingham — 共享标签:公共卫生与流行病学 / 流行病学 / 队列研究
- charls — 共享标签:公共卫生与流行病学 / 流行病学 / 队列研究
- qresearch — 共享标签:公共卫生与流行病学 / 流行病学 / 队列研究
- jhu-csse-covid-19 — 共享标签:公共卫生与流行病学 / 流行病学 / 疾病监测
- global-burden-of-disease — 共享标签:公共卫生与流行病学 / 流行病学
- nhanes — 共享标签:公共卫生与流行病学 / 流行病学
- healthdata-gov — 共享标签:公共卫生与流行病学 / 流行病学
- nhis — 共享标签:公共卫生与流行病学 / 流行病学
- mics — 共享标签:公共卫生与流行病学 / 疾病监测
- ckb — 共享标签:公共卫生与流行病学 / 队列研究
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
