信息速览

INFOBOX
| 数据集名称 | DHS Program(The Demographic and Health Surveys Program) |
| 英文全称 | The Demographic and Health Surveys Program |
| 别名 / 简称 | DHS、MEASURE DHS、人口与健康调查项目 |
| 疾病分类 | 多领域覆盖。核心映射:ICD-11 第18–22章(妊娠/分娩/产褥期相关、新生儿/儿童疾病、损伤/中毒/外因),另覆盖第1章(传染病—HIV/疟疾/结核)、第5章(内分泌—营养/贫血/发育迟缓)、第15章(发育异常—儿童营养)、第20章(产科—产前/分娩/产后保健)、第21章(新生儿/儿童病因) |
| SNOMED CT | 4438400000751004(Demographic and Health Survey)| 3847420000751006(Household health survey) |
| 数据模态 | 结构化表格(Stata/SPSS/SAS/ASCII)、地理空间(GPS 坐标/Shapefile)、生物标志物(血红蛋白/HIV RDT/疟疾 RDT/人体测量) |
| AI 任务类型 | 分类(儿童营养不良 stunting/wasting/underweight 三分类)、回归(生育率/死亡率预测)、时间序列(跨国趋势分析)、聚类(地理健康模式发现)、生存分析(儿童死亡率风险建模)、地理空间分析(健康公平性映射) |
| 样本总数 | 350+ 次全国代表性调查(截至 2026-08),覆盖 90+ 国家,累计数千万受访者;单次调查典型规模 5,000–40,000 住户(如尼日利亚 2024:40,047 住户 / 39,050 女性 / 12,204 男性) |
| 数据大小 | 单次调查约 10–60 MB(Flat ASCII 重复文件)/ 4–35 MB(层次文件);全套 350+ 调查约 5–10 GB |
| 数据格式 | Stata (.dta) / SPSS (.sav) / SAS (.sas7bdat) / Flat ASCII (.dat) / 层次 CSPro / GPS (.DBF/.MDB/.shp) / REST API (JSON) |
| 许可证 | 免费注册制(legitimate academic research,需在线注册并说明用途;批准后免费下载) |
| 访问级别 | 注册审核(在线注册 → 24 小时内邮件批准 → 下载;API 指标查询无需注册) |
| DUO 标签 | NRES |
| 语言 | 英文(部分国家报告有法语/西班牙语/葡萄牙语/阿拉伯语版本) |
| 首发日期 | 1984(DHS-I 启动,第一波调查在哥伦比亚、印尼等地实施) |
| 最后更新 | 2026-08(DHS-8 阶段持续产出新调查,数据持续发布) |
| 发布机构 | ICF International(USAID 资助,合作伙伴:Path / Avenir Health / Johns Hopkins CCP / Vysnova / Blue Raster / Encompass) |
| 官方主页 | https://dhsprogram.com |
| 下载地址 | https://dhsprogram.com/data/new-user-registration.cfm(注册下载)/ https://api.dhsprogram.com/rest/(API) |
| DOI | N/A(调查项目,非单一出版物;各调查报告有独立 DOI) |
| 引用次数 | 10,000+(Web of Science,以 DHS 为数据源的同行评议文献;Google Scholar 更广口径 50,000+) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 标准化问卷 + CAPI + 多格式 + GPS + API + 海量跨国可比数据;扣分项:无官方 ML 划分、问卷跨阶段版本差异需大量对齐、文件命名复杂(CCDDVVFF 编码)、自报数据偏倚、无图像模态 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:[千方病案医学编辑部]交叉审核:§2 医学背景(ICD-11 映射、调查指标定义、全球卫生意义)、§7 偏倚分析。
数据工程审核者:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 Recode 文件结构与 DAIMS 字段映射、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-08-12
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。DHS Program 要求数据使用者在线注册并说明研究用途,仅限合法学术研究。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览(Overview)
§1.0 📌 30 秒速览(Executive Summary)
DHS Program(The Demographic and Health Surveys Program)是由美国国际发展署(USAID)于 1984 年发起的全球最大住户健康调查项目,累计在 90+ 个低收入和中等收入国家完成 350+ 次全国代表性横断面调查,覆盖撒哈拉以南非洲、南亚、东南亚、拉丁美洲、中东和北非。每轮调查采用标准化模型问卷(DHS-8 为当前版本),以面对面访谈方式采集生育率、避孕使用、产妇与儿童健康、营养状况、儿童死亡率、HIV 感染与认知、疟疾指标、家庭暴力等人口健康核心数据,部分调查附加血红蛋白(贫血)、HIV 快速检测、疟疾 RDT、人体测量(身高/体重)等生物标志物采集。
它的独特价值在于提供了一套全球跨国家、跨时间的可比较人口健康指标体系——标准化问卷 + 两阶段分层抽样 + CAPI 数据采集 + 质控流程确保了不同国家、不同年份调查之间的可比性。自 1996 年起收集 GPS 簇坐标(经随机位移以保护隐私),使地理空间健康分析成为可能。DHS Program 由 ICF International 实施,数据通过注册制免费向全球研究者开放,配套 DHS REST API(12 个数据端点)和 STATcompiler 在线分析工具。截至 2026 年,DHS 数据已支撑 10,000+ 篇同行评议出版物,是全球卫生政策制定和 SDG 监测的基石数据源。
你可以用它来:训练一个基于住户特征预测 5 岁以下儿童死亡率(U5M)的深度学习模型(已有研究在 34 个 LMIC 上用 DNN/CNN 达到 0.71 敏感度 / 0.83 特异度)、对儿童营养不良进行 ML 分类(stunting 预测汇总准确率 68.92%)、或者利用 GPS 坐标进行跨国地理空间健康公平性映射。
§1.1 摘要
DHS Program 由 USAID 资助,以五年期递进实施(DHS-I 1984–1990 → DHS-II 1989–1993 → DHS-III 1992–1998 → DHS-IV 1997–2003 → DHS-V 2003–2008 → DHS-VI 2008–2013 → DHS-7 2013–2018 → DHS-8 2018–2025)。项目自 1984 年起一直由同一团队实施,虽经历多次机构收购更名(Westinghouse Health Systems → Macro Systems → ORC Macro → Macro International → ICF Macro → ICF International → ICF),但团队核心人员和操作方法保持连续性。
DHS 调查类型包括:(1) Standard DHS(核心标准调查,覆盖最全面);(2) AIDS Indicator Survey (AIS)(2003 年创建,HIV 专项调查,共 11 次);(3) Malaria Indicator Survey (MIS)(2006 年创建,疟疾专项调查,30+ 次);(4) Service Provision Assessment (SPA)(卫生设施评估调查,提供卫生服务供方侧信息)。此外还有 Special DHS 和 Interim DHS 等变体。所有调查采用标准模型问卷——每个阶段(DHS-I 到 DHS-8)修订并更新,国家可在核心问卷基础上增删问题以适应本地需求。
数据以 Recode 文件体系分发:HR(住户 Recode)、IR(女性个人 Recode)、MR(男性 Recode)、KR(儿童 Recode)、BR(生育 Recode)、PR(住户成员 Recode)、CR(夫妇 Recode)、AR(HIV 检测结果 Recode)、GE(GPS 地理数据)、GC(地理空间协变量)。每个 Recode 文件以 CCDDVVFF[DS].ZIP 命名(CC = 国家代码、DD = 数据文件类型、VV = 版本号、FF = 格式、DS = 数据结构),提供 Stata / SPSS / SAS / Flat ASCII 四种统计软件格式。
§1.2 战略价值分析
全球卫生监测维度:DHS Program 是联合国可持续发展目标(SDG)健康相关指标(特别是 SDG 3.7 产前保健覆盖、3.1 产妇死亡率、3.2 新生儿与 5 岁以下儿童死亡率、3.3 疟疾/HIV、3.8 全民健康覆盖)的核心数据源之一。在缺乏完善生命登记系统的低收入国家,DHS 调查往往是唯一能够提供全国代表性健康指标的来源。世界银行、WHO、UNICEF、UNFPA 等国际组织在编制全球卫生统计报告时大量依赖 DHS 数据。DHS 的 Wealth Index(财富指数)方法——基于住户资产和耐用品拥有量通过主成分分析构建——已成为 LMIC 社会经济地位分层的事实标准,被全球卫生研究者广泛采用。
AI/ML 研究维度:DHS 数据在全球卫生 AI 研究中扮演"基准训练集"角色。其跨国可比设计使研究者能够开发泛化于不同文化、经济和地理背景的预测模型,而非仅限于单一国家。已有多项研究证明 DHS 数据支持深度学习建模:Adegbosin et al. (2020, BMJ Open) 在 34 个 LMIC 的 152 万名儿童数据上训练 DNN/CNN 预测 5 岁以下死亡率,CNN-DNN 混合模型敏感度 0.71、特异度 0.83,显著优于逻辑回归。儿童营养不良 ML 预测的系统综述(2024,11 项研究 Meta 分析)报告 stunting 预测汇总准确率 68.92%、wasting 84.39%、underweight 73.60%。DHS 的 GPS 簇坐标数据结合地理空间协变量(GC 文件)支持精细地理分辨率下的健康公平性制图和资源分配优化。
方法学创新维度:DHS Program 在全球调查方法学领域确立了多项标杆实践:(1) 两阶段分层整群抽样确保全国和次国家级代表性;(2) 标准化模型问卷 + 国家定制机制实现跨国可比;(3) CAPI(DHS-7 起全面部署平板电脑访谈)减少数据录入错误;(4) 生物标志物采集(自 1986 年起引入人体测量,后扩展至贫血/HIV/疟疾/血压/糖尿病等 20+ 种)将自报数据与客观测量相结合;(5) GPS 簇坐标位移协议(城市 2km / 农村 5km / 1% 农村 10km)平衡空间分析与隐私保护;(6) IPUMS DHS 平台(明尼苏达大学)提供跨调查变量调和,极大降低了多国数据分析的技术门槛。
§1.3 与同类调查项目的对比
| 维度 | DHS Program | MICS (UNICEF) | BRFSS (CDC) | NHANES (NCHS) |
|---|---|---|---|---|
| 发起方 | USAID / ICF | UNICEF | CDC | NCHS |
| 覆盖范围 | 90+ LMIC | 100+ LMIC | 美国 50 州 | 美国本土 |
| 调查类型 | 住户面访 + 生物标志物 | 住户面访(MICS6 增加部分生物标志物) | 电话调查 | 面访 + 体检 + 实验室 |
| 抽样设计 | 两阶段分层整群 | 两阶段分层整群 | 不等概率电话 | 四阶段分层 |
| 核心指标 | 生育/避孕/儿童健康/营养/HIV/疟疾 | 儿童/妇女权益/教育/健康 | 行为风险因素 | 营养/慢病/毒物 |
| CAPI | DHS-7 起全面部署 | MICS6 起部署 | CATI(电话) | 面访+移动体检 |
| GPS 坐标 | 有(位移保护) | 部分 | 无 | 有(普查区块级) |
| 数据格式 | Stata/SPSS/SAS/ASCII | SPSS/Stata | SAS/CSV | SAS |
| 访问方式 | 注册免费 | 注册免费 | 公开下载 | 公开下载(限制性数据需申请) |
| AI 就绪度 | ⭐⭐⭐(3/5) | ⭐⭐(2/5) | ⭐⭐⭐⭐(4/5) | ⭐⭐⭐⭐(4/5) |
§1.4 关键时间轴
| 年份 | 里程碑 |
|---|---|
| 1984 | DHS-I 启动,首批调查在哥伦比亚、印尼等地实施 |
| 1986 | 引入人体测量模块(儿童和母亲身高/体重) |
| 1989 | DHS-II 启动,Macro Systems 接管实施 |
| 1996 | 开始收集 GPS 簇坐标(经度/纬度) |
| 2003 | 创建 AIS(AIDS Indicator Survey) |
| 2006 | 创建 MIS(Malaria Indicator Survey) |
| 2009 | ICF 收购 Macro,更名为 ICF Macro |
| 2011 | 组织更名为 ICF International |
| 2013 | DHS-7 启动,全面部署 CAPI(平板电脑访谈) |
| 2018 | DHS-8 启动,修订标准问卷(新增慢性病、移民、结核病、宫颈癌筛查等模块) |
| 2020 | Adegbosin et al. 在 BMJ Open 发表 DNN/CNN 预测 U5M 研究(34 LMIC,152 万儿童) |
| 2024 | 儿童营养不良 ML 预测 Meta 分析发表(11 项研究) |
| 2024 | 尼日利亚 DHS 2024 完成(40,047 住户),赞比亚 DHS 2024 完成(12,808 住户) |
| 2026 | DHS-8 阶段持续产出,350+ 次调查,覆盖 90+ 国家 |
§1.5 典型用例
| 用例 | 描述 | 难度 |
|---|---|---|
| 5 岁以下儿童死亡率预测 | 使用 DHS 跨国数据训练 ML 模型预测 U5M,识别关键风险因子(母乳喂养时长、产前检查次数、母亲教育、财富指数) | ★★★☆☆ |
| 儿童营养不良分类 | 基于 DHS 人体测量数据训练 ML 模型分类 stunting/wasting/underweight,准确率 68–84% | ★★☆☆☆ |
| 跨国生育率趋势建模 | 汇总多国 DHS 调查数据,分析 TFR 变化趋势及社会决定因素 | ★★★☆☆ |
| 地理空间健康公平性制图 | 结合 GPS 坐标和地理空间协变量,绘制精细地理分辨率下的健康指标地图 | ★★★★☆ |
| HIV 知识与行为评估 | 分析 HIV 相关知识、态度和行为指标在人群中的分布和变化 | ★★☆☆☆ |
| 疟疾干预措施效果评估 | 比较 ITN 拥有/使用率与疟疾患病率之间的关联 | ★★★☆☆ |
§2 医学背景(Medical Context)
§2.1 ICD-11 映射
DHS Program 作为全球卫生调查项目,其指标体系覆盖 ICD-11 的多个章节:
| ICD-11 章节 | DHS 对应指标 | 调查模块 |
|---|---|---|
| 第1章 感染性疾病 | HIV 感染率、HIV 知识/态度/行为、疟疾患病率、结核病知识 | HIV Testing / HIV Behavior & Knowledge / Malaria / TB Questions |
| 第5章 内分泌/代谢/营养 | 贫血(血红蛋白 < 11 g/dL 儿童/< 12 g/dL 女性)、发育迟缓(HAZ < −2 SD)、消瘦(WHZ < −2 SD)、低体重(WAZ < −2 SD)、超重(WHZ > +2 SD)、碘盐检测 | Anemia Testing / Anthropometry / Iodine Salt Test / Micronutrients |
| 第15章 发育异常 | 儿童生长发育指标(HAZ / WHZ / WAZ 基于 WHO 2006 生长标准) | Anthropometry (Child) |
| 第18章 妊娠/分娩/产褥期 | 产前保健覆盖率(≥4 次访视)、分娩方式、分娩地点、产后保健、破伤风接种 | Maternal Care (in IR/KR Recode) |
| 第19章 产科影响 | 孕产妇死亡率(MMR 通过姐妹存活法间接估计) | Maternal Mortality (in IR Recode) |
| 第20章 新生儿/围产期 | 新生儿死亡率(出生后 28 天内死亡)、低出生体重(< 2500 g) | Birth History (in BR Recode) |
| 第21章 儿童疾病 | 腹泻发病率、口服补液盐使用、急性呼吸道感染(ARI)寻求治疗率、疫苗接种覆盖率(BCG/DTP/脊灰/麻疹/轮状/肺炎) | Child Health (in KR Recode) |
| 第22章 损伤/中毒/外因 | 家庭暴力(身体/性/情感/经济暴力)、女性生殖器切割(FGC) | Domestic Violence Module / FGC Module |
§2.2 SNOMED CT 映射
| SNOMED CT 概念 | 代码 | DHS 对应变量 |
|---|---|---|
| Demographic and Health Survey | 4438400000751004 | 项目整体 |
| Household health survey | 3847420000751006 | Household Recode (HR) |
| Antenatal care visit | 424513001 | m4_m4a_m4b(产前保健访视次数) |
| Contraceptive method | 266425005 | v312(当前避孕方法) |
| Child anthropometry | 248278009 | hw1_hw2_hw3(儿童身高/体重/年龄) |
| HIV test result | 302615000 | hiv03(HIV 检测结果) |
| Malaria rapid diagnostic test | 1191000121100 | hml35(疟疾 RDT 结果) |
§2.3 临床任务定义
DHS 数据支持的 AI/ML 任务主要属于群体健康预测和流行病学推断范畴,而非个体临床诊断:
- 风险分层预测:基于住户特征(财富指数、母亲教育、居住地、产前检查、饮用水/卫生设施)预测儿童死亡/营养不良风险
- 趋势预测:利用多次调查的重复横断面数据建模国家层面健康指标的时间趋势
- 地理空间建模:将 GPS 簇坐标与地理空间协变量结合,在精细地理分辨率下估计健康指标
- 公平性分析:按财富分位、性别、教育、城乡/地区分层评估健康指标的分布公平性
- 因子发现:通过 ML 模型特征重要性排序识别健康结果的关键社会决定因素
§3 数据集规格(Specifications)
§3.0 调查类型抉择矩阵
| 调查类型 | 起始年 | 调查数 | 核心指标 | 样本规模 | 生物标志物 | 适用场景 |
|---|---|---|---|---|---|---|
| Standard DHS | 1984 | 300+ | 生育/避孕/儿童健康/营养/死亡率/HIV/疟疾 | 5,000–40,000 住户 | 贫血/HIV/疟疾/人体测量 | 全面人口健康评估 |
| AIS | 2003 | 11 | HIV 感染率/知识/行为/态度 | 5,000–15,000 住户 | HIV 检测 | HIV 专项监测 |
| MIS | 2006 | 30+ | ITN 拥有/使用/疟疾患病率/RDT | 3,000–10,000 住户 | 疟疾 RDT/涂片/贫血 | 疟疾专项监测 |
| SPA | 不固定 | 20+ | 卫生设施能力/服务质量/药品可及性 | 100–500 设施 | N/A | 卫生系统评估 |
| Special DHS | 不固定 | 视需求 | 国家特定主题(如 gender、NCD) | 视需求 | 视设计 | 定制调查 |
§3.1 Standard DHS — 核心调查
问卷结构(DHS-8 版本):
| 问卷 | 受访者 | 核心内容 |
|---|---|---|
| Household Questionnaire | 户主/知情成人 | 住户名册、居住条件、饮水/卫生/烹饪燃料、耐用品拥有量、 iod盐检测、疟疾蚊帐 |
| Woman’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Questionnaire | 15–49 岁女性 | 生育史、避孕使用、产前/分娩/产后保健、儿童健康、免疫接种、婚姻、就业、HIV/疟疾知识、家暴(选配模块) |
| Man’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Questionnaire | 15–59 岁男性(选配) | 生育意愿、避孕认知、HIV/疟疾知识/行为、就业、健康 |
| Biomarker Questionnaire | 女性和儿童 | 血红蛋白、HIV 快速检测、疟疾 RDT、身高/体重、血压(选配) |
抽样设计:两阶段分层整群抽样。第一阶段在各省/地区分层内按城市/农村和人口规模概率比例抽取普查区(Enumeration Area, EA);第二阶段在选中的 EA 内等概率抽取住户(通常 20–30 户/EA)。女性/男性问卷在选中住户中面向全体适龄人员实施。样本权重计算考虑分层、整群和不应答调整,分析时必须使用 v005(女性)/mv005(男性)权重变量。
§3.2 Recode 文件体系
DHS 数据以 Recode 文件分发。每个文件类型对应特定的分析单位:
| 文件类型 | 代码 | 分析单位 | 核心变量类别 | 典型文件名 |
|---|---|---|---|---|
| Household Recode | HR | 住户 | 住户特征/饮水/卫生/蚊帐 | KEHR71FL |
| Individual Recode | IR | 女性 15–49 | 生育/避孕/产妇健康/儿童生存 | KEIR71FL |
| Men’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Recode | MR | 男性 15–59 | 生育意愿/HIV/疟疾/健康 | KEMR71FL |
| Children’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Recode | KR | 5 岁以下儿童 | 儿童健康/营养/免疫/喂养 | KEKR71FL |
| Births Recode | BR | 每次出生 | 生育史详细记录 | KEBR71FL |
| Household Member Recode | PR | 住户成员 | 人口特征/教育/就业/健康保险 | KEPR71FL |
| Couples’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’’ Recode | CR | 夫妇 | 配偶匹配数据 | KECR71FL |
| HIV Test Results | AR | HIV 检测结果 | HIV 状态/同意检测/结果反馈 | KEAR71FL |
| Geographic Data | GE | 调查簇 | GPS 坐标/位移信息 | KEGE71FL |
| Geospatial Covariates | GC | 调查簇 | 气候/植被/人口密度/距离设施 | KEGC71FL |
文件命名规则:CCDDVVFF[DS].ZIP
- CC = 2 字母国家代码(ISO 3166-1 alpha-2,如 KE = 肯尼亚)
- DD = 2 字母数据文件类型(如 IR = Individual Recode)
- VV = 2 字符版本号(阶段+序号,如 71 = DHS-7 第 1 版)
- FF = 2 字母格式代码(FL = Flat ASCII / DT = Stata / SV = SPSS / SD = SAS)
- DS = 数据结构代码(仅 SPA 调查使用)
§3.3 GPS 与地理空间数据
| 项目 | 规格 |
|---|---|
| 起始年份 | 1996(部分早期调查有 GPS) |
| 覆盖调查数 | 80+ Standard DHS(不含 AIS/MIS) |
| 坐标精度 | EA/簇级(非住户级) |
| 位移协议 | 城市:0–2 km 随机位移;农村:0–5 km 随机位移;1% 农村:0–10 km |
| 位移方向 | 随机角度(0–360°) |
| 位移方法 | 随机距离 + 随机方向 |
| 文件格式 | .DBF / .MDB / .shp(Shapefile) |
| 配套数据 | Geospatial Covariates(GC 文件)含气候/植被/人口密度/到设施距离等 |
§3.4 生物标志物模块
| 标志物 | 测量方法 | 受试者 | 起始年 | 调查数 |
|---|---|---|---|---|
| 血红蛋白(贫血) | HemoCue 光度计 | 女性 15–49 / 儿童 6–59 月 | 1986 | 190+ |
| HIV | 快速检测(OraQuick/Stat-Pak) | 女性/男性 15–49 | 2001 | 60+ |
| 疟疾 | RDT / 显微镜涂片 | 儿童 6–59 月 | 2006 | 30+ |
| 人体测量 | 身高板 + 电子秤 | 儿童 < 5 / 女性 15–49 | 1986 | 190+ |
| 血压 | 电子血压计 | 女性/男性 15+ | 2013 (DHS-7) | 部分 |
| 碘盐 | 快速测试 kit | 住户 | 2000s | 多次 |
| 维生素 A | DBS spot test | 儿童 6–59 月 | 2000s | 部分 |
§3.5 问卷模块系统
DHS-8 核心问卷之外的选配模块(国家按需选择):
| 模块 | 内容 | 适用国家 |
|---|---|---|
| Domestic Violence | 身体/性/情感/经济暴力(WHO 伦理协议,每户仅 1 名女性) | 多数 DHS-7/8 |
| Female Genital Cutting | FGC 实践和态度 | 非洲 |
| Chronic Diseases | 高血压/糖尿病/宫颈筛查 | DHS-8 核心 |
| Food Insecurity (FIES) | 8 项食物不安全量表 | DHS-8 选配 |
| Migration | 迁移史 | DHS-8 选配 |
| Tobacco Use | 烟草使用 | 89+ 次调查 |
| Alcohol Consumption | 饮酒 | 42+ 次调查 |
| Social & Behaviour Change | SBCC 疟疾知识/态度/媒体暴露 | MIS 选配 |
| Fieldworker Characteristics | 访员特征(可用于访员效应分析) | DHS-7+ |
§3.6 CAPI 系统
自 DHS-7(2013–2018)起,DHS Program 全面部署 CAPI(Computer Assisted Personal Interviewing)系统,使用平板电脑进行面对面访谈。CAPI 的优势包括:
- 逻辑跳转自动执行,减少访员错误
- 实时范围检查和一致性校验
- GPS 坐标自动采集
- 数据每日同步至中央服务器
- 支持多语言问卷切换
§3.7 DHS-8 问卷更新
DHS-8 阶段(2018–2025)引入以下新增内容:
-
慢性病模块:高血压、糖尿病、宫颈癌筛查纳入核心问卷
-
完整妊娠史:替代原有的出生史,包含所有妊娠结局(含流产)
-
最低膳食多样性(MDD-W):女性 24 小时食物摄入多样性纳入核心
-
结核病知识:新增加密核心模块
-
迁移模块:人口流动与住址变更
-
出生登记:5 岁以下儿童出生证书持有
§4 数据结构详解(Data Schema)
§4.1 Recode 文件内部结构
以 Individual Recode (IR) 为例——这是最常用的 DHS 数据文件:
# IR 文件结构(DHS-8 Recode)
# 每行 = 一名 15-49 岁受访女性
# === 标识变量 ===
caseid # 个案 ID(EA号 + 住户号 + 个人序号)
v000 # 调查类型/阶段标识
v001 # 簇号
v002 # 住户号
v003 # 个人序号
# === 基本人口特征 ===
v012 # 当前年龄
v013 # 5 岁年龄组
v106 # 最高教育水平
v107 # 最高教育年限(注意:标签为"最高教育年限"但实际编码复杂)
v149 # 教育程度(详细)
v190 # 财富指数分位(poorest/poorer/middle/richer/richest)
v191 # 财富指数连续值
# === 地理变量 ===
v024 # 地区(省/州)
v025 # 城乡类型
v026 # 住户位移标志
v134 # 居住地类型(城市/农村/首都)
# === 权重 ===
v005 # 女性样本权重(除以 1,000,000 后使用)
# === 生育与避孕 ===
v201 # 总生育数
v208 # 过去 5 年内出生数
v301 # 避孕知识
v312 # 当前避孕方法
v313 # 当前避孕状态
v364 # 未满足的避孕需求
# === 产妇健康 ===
m14_1 # 产前检查次数(最近出生)
m15_1 # 产前检查提供者
m17_1 # 分娩地点
m19_1 # 分娩方式
m66_1 # 产后检查时间
# === HIV/疟疾 ===
v781 # 是否接受过 HIV 检测
v783 # HIV 检测结果
hml32 # 蚊帐拥有情况
§4.2 DAIMS 字段映射
| DAIMS 维度 | DHS 对应字段/文件 | 说明 |
|---|---|---|
| 样本量 | v005 (权重) × 样本设计 | 加权后推算全国代表性 |
| 人口统计 | v012, v106, v190 | 年龄/教育/财富分位 |
| 地理覆盖 | v024, v025 + GE/GC 文件 | 省/城乡 + GPS 坐标 + 协变量 |
| 时间覆盖 | v000 (调查阶段标识) | 跨阶段可比性需检查 Recode 版本 |
| 测量方法 | CAPI 面访 + 生物标志物 | 自报 + 客观测量混合 |
| 缺失数据 | 缺失值编码为 9/99/999 等 | 需根据 Recode Manual 识别 |
| 伦理审查 | ICF IRB + 东道国 IRB | 45 CFR 46 合规 |
| 隐私保护 | GPS 位移 + 去标识化 | 簇级而非住户级坐标 |
| 样本权重 | v005 (女性) / mv005 (男性) / hv005 (住户) | 必须用于所有分析 |
| 分层变量 | v021 (分层变量) / v022 (分层重数) | 用于方差估计 |
§4.3 缺失数据编码(DQ/DS)
DHS 使用特殊的缺失值编码体系,直接使用会导致分析错误:
| 编码 | 含义 | 处理建议 |
|---|---|---|
| 9 / 99 / 999 | “Don’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'t know”(不知道) | 设为缺失 (NA) |
| 8 / 98 / 998 | “No response”(无应答) | 设为缺失 (NA) |
| 0 / 00 / 000 | “No”(否定回答) | 保留为 0,不要删除 |
| 7 / 97 / 997 | “Not applicable”(不适用) | 根据分析场景决定是否设为缺失 |
| 空白 | 未问该问题(跳转) | 设为缺失 (NA) |
⚠️ 关键:不同变量的缺失值编码位数不同(个位 / 十位 / 百位 / 千位),必须查阅 DHS Recode Manual 确认每个变量的具体编码。例如 v107 的标签是"最高教育年限",但其实际编码与标签含义不一致——直接使用会导致错误分析。
§5 数据划分与使用建议(Splits & Usage)
§5.1 官方 ML 划分
DHS Program 不提供官方的 train/validation/test 划分。数据按调查(国家×年份)组织,研究者需自行设计划分策略。
§5.2 推荐划分策略
| 策略 | 描述 | 优势 | 风险 |
|---|---|---|---|
| 跨国留出法 | 以 N−k 个国家训练,k 个国家测试 | 评估跨国泛化能力 | 测试国可能在文化/经济上与训练国差异大 |
| 时间留出法 | 早期调查训练,晚期调查测试 | 评估时间外推性 | 时间跨度可能不足 |
| 省份留出法 | 省份级留出(同一国家内) | 控制国家固定效应 | 省份间人口/文化差异 |
| K 折交叉验证 | 调查级 K 折 | 充分利用数据 | 不同折可能来自不同阶段 |
§5.3 数据泄漏风险
| 风险 | 描述 | 防范措施 |
|---|---|---|
| 簇内泄漏 | 同一 EA/簇内的住户高度相关 | 以簇(v001)为分层单位划分 |
| 国家泄漏 | 同一国家不同调查重复 | 确保同一国家的调查不同时出现在训练集和测试集 |
| 时间泄漏 | 时间相邻的调查高度自相关 | 时间留出时确保最小间隔 |
| 权重泄漏 | 样本权重信息泄露 | 划分时不使用权重信息 |
§5.4 外部验证建议
| 验证源 | 描述 | 用途 |
|---|---|---|
| MICS (UNICEF) | 独立的住户调查项目 | 跨调查项目验证 |
| BRFSS (CDC) | 美国行为风险因素监测 | 高收入国家对比 |
| WHO/UNICEF 估计 | 全球官方统计估计 | 校准模型预测 |
| 国家生命登记系统 | 部分国家有完善登记 | 验证死亡率预测 |
§6 AI 就绪指南(AI-Ready Guide)
§6.0 云端快速启动
DHS 数据可通过以下方式在云端使用:
| 平台 | 可用性 | 说明 |
|---|---|---|
| DHS API | ✅ 无需注册 | https://api.dhsprogram.com/rest/ 提供指标查询(12 个端点) |
| STATcompiler | ✅ 免费在线 | https://www.statcompiler.com 指标查询与可视化 |
| IPUMS DHS | ✅ 免费注册 | https://dhs.ipums.org 跨调查变量调和 |
| Google Earth Engine | ✅ GC 协变量可集成 | 地理空间协变量与 DHS GPS 数据融合 |
| rdhs R package | ✅ 开源 | API 客户端 + 数据集管理(ropensci/rdhs) |
§6.1 快速上手代码
# ========================================
# DHS Program 快速上手 — Python + DHS REST API
# 环境要求: requests, pandas (pip install requests pandas)
# ⚠️ 目录结构预期:
# 无需下载文件——所有指标通过 DHS REST API 实时查询
# API 端点: https://api.dhsprogram.com/rest/dhs/{endpoint}
# 指标查询无需认证;原始数据集下载需注册
# 注册地址: https://dhsprogram.com/data/new-user-registration.cfm
# ========================================
import requests
import pandas as pd
# - 1. 查询所有国家调查列表 -
countries_url = "https://api.dhsprogram.com/rest/dhs/countries"
responevent-blocked= requests.get(countries_url)
countries = pd.DataFrame(response.json()["Data"])
print(f"覆盖国家数: {len(countries)}")
print(countries[["CountryName", "DHS_CountryCode", "Region"]].head(10))
# - 2. 查询特定国家调查列表(如肯尼亚 KE) -
surveys_url = "https://api.dhsprogram.com/rest/dhs/surveys"
params = {"countryIds": "KE"}
responevent-blocked= requests.get(surveys_url, params=params)
surveys = pd.DataFrame(response.json()["Data"])
print(f"肯尼亚调查数: {len(surveys)}")
print(surveys[["SurveyId", "SurveyYear", "SurveyType"]].head(10))
# - 3. 查询健康指标(如避孕使用率) -
# 指标 ID: CN_NPR_C_W Prev—Current modern contraception use
data_url = "https://api.dhsprogram.com/rest/dhs/data"
params = {
"indicatorIds": "CN_NPR_C_W_PR_C", # 现代避孕方法使用率
"returnGeometry": "true"
}
responevent-blocked= requests.get(data_url, params=params)
data = pd.DataFrame(response.json()["Data"])
print(f"指标记录数: {len(data)}")
print(data[["CountryName", "SurveyYear", "Value"]].head(10))
# - 4. 查询带 GPS 坐标的指标数据 -
params_gps = {
"indicatorIds": "CN_NPR_C_W_PR_C",
"returnGeometry": "true",
"surveyIds": "KE2014DHS"
}
responevent-blocked= requests.get(data_url, params=params_gps)
gps_data = response.json()["Data"]
print(f"带 GPS 的记录数: {len(gps_data)}")
# ========================================
# DHS Program 快速上手 — R + rdhs 包
# 安装: devtools::install_github("ropensci/rdhs")
# ========================================
library(rdhs)
# - 1. 配置凭证(需已注册 DHS 账号) -
# set_rdhs_config(email = "your@email.com",
# project = "Your Project Name",
# password = "your_password",
# cache_path = "~/.dhs_cache")
# - 2. 查询调查列表 -
surveys <- dhs_surveys(countryIds = "KE")
print(nrow(surveys))
# - 3. 查询指标数据 -
data <- dhs_data(
indicatorIds = "CN_NPR_C_W_PR_C",
countryIds = "KE",
returnGeometry = TRUE
)
print(head(data))
# - 4. 下载原始数据集(需注册批准) -
# datasets <- dhs_datasets(countryIds = "KE", fileFormat = "DT")
# downloads <- download_datasets(datasets)
§6.2 数据获取流程
| 步骤 | 操作 | 耗时 |
|---|---|---|
| 1 | 在 dhsprogram.com 注册账号(姓名、邮箱、研究项目描述) | 10 分钟 |
| 2 | 选择需要下载的国家和调查 | 5 分钟 |
| 3 | 提交注册请求 | < 1 分钟 |
| 4 | 等待 ICF 批准(通常 24 小时内邮件回复) | < 24 小时 |
| 5 | 登录下载 ZIP 数据包 | 视文件大小 |
| 6 | 解压并使用统计软件打开 | 即时 |
§6.3 预处理标准流程
# ========================================
# DHS 数据预处理标准流程(以 IR Recode 为例)
# ========================================
import pandas as pd
import numpy as np
# - 1. 加载 Stata 文件 -
# 推荐使用 .dta 格式(含变量标签和值标签)
df = pd.read_stata("KEIR8FL.DTA", conevent-blocked=False)
# - 2. 处理缺失值编码 -
# DHS 用 9/99/999 等编码缺失
# 必须查阅 Recode Manual 确认每个变量的缺失值编码
missing_codes = {
''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v012'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': [99, 98], # 年龄
''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v106'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': [9], # 教育水平
''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v190'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': [9], # 财富分位
''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v312'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': [99], # 避孕方法
''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''m14_1'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''': [99, 98], # 产前检查次数
}
for var, codes in missing_codes.items():
if var in df.columns:
df.loc[df[var].isin(codes), var] = np.nan
# - 3. 应用样本权重 -
# v005 是权重变量,需除以 1,000,000
df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''weight''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v005''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] / 1_000_000
# - 4. 构建分析变量 -
# 示例:创建二分类结局变量(是否使用现代避孕方法)
modern_methods = [1, 2, 3, 7, 8, 9, 10, 11, 13] # 根据编码手册
df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''modern_fp''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] = df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v312''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].isin(modern_methods).astype(int)
# - 5. 处理聚类抽样设计 -
# 必须以簇(v001)为聚类单位进行统计推断
from statsmodels.stats.weight import DescrStatsW
weighted_stats = DescrStatsW(df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''modern_fp''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''], weights=df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''weight''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''])
print(f"现代避孕使用率: {weighted_stats.mean:.3f}")
§6.4 PyTorch / TensorFlow 加载
# ========================================
# PyTorch Dataset(以 U5M 预测为示例任务)
# ========================================
import torch
from torch.utils.data import Dataset, DataLoader
import pandas as pd
import numpy as np
class DHSKRDataset(Dataset):
"""DHS Children''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''s Recode (KR) Dataset for U5M prediction"""
def __init__(self, stata_path, country_list=None):
df = pd.read_stata(stata_path, conevent-blocked=False)
if country_list:
df = df[df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v000''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].str[:2].isin(country_list)]
# 特征:母亲教育、财富分位、城乡、产前检查、母乳喂养
self.features = self._extract_features(df)
# 标签:儿童是否在 5 岁前死亡
self.labels = self._extract_labels(df)
# 权重
self.weights = df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v005''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''].values / 1_000_000
def _extract_features(self, df):
feat_cols = [''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v106'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v190'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''v025'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''b8_01'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''', ''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''m14_1'''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''']
features = df[feat_cols].copy()
# 处理缺失值
for col in features.columns:
features[col] = features[col].replace([9, 99, 999], np.nan)
features[col] = features[col].fillna(features[col].median())
return features.values.astype(np.float32)
def _extract_labels(self, df):
# b5_01: 儿童是否存活(0=死亡, 1=存活)
return (df[''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''b5_01''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''''] == 0).astype(int).values
def __len__(self):
return len(self.labels)
def __getitem__(self, idx):
return (
torch.tensor(self.features[idx]),
torch.tensor(self.labels[idx], dtype=torch.float32),
torch.tensor(self.weights[idx], dtype=torch.float32)
)
# 使用示例
dataset = DHSKRDataset("KEKR8FL.DTA", country_list=["KE", "UG", "TZ"])
loader = DataLoader(dataset, batch_size=256, shuffle=True)
§6.5 工程坑点 ⚠️
⚠️ 坑点 1:样本权重必须使用
分类:统计分析陷阱
问题:DHS 采用不等概率两阶段整群抽样设计,直接使用未加权数据会产出有偏估计。
症状:未加权分析结果与 DHS 官方报告数值不符;点估计偏差可达 5–20%。
解决:所有描述性统计和回归分析必须使用 v005(女性)/ mv005(男性)/ hv005(住户)权重变量。权重值已乘以 1,000,000(整数化存储),使用前需除以 1,000,000。方差估计还需考虑分层(v021/v022)和聚类(v001)设计效应。
参考:DHS Using Datasets for Analysis — Step 7: Use sample weights
⚠️ 坑点 2:缺失值编码不是 NaN 而是 9/99/999
分类:数据预处理陷阱
问题:DHS 将"不知道"编码为 9/99/999、"无应答"编码为 8/98/998、"不适用"编码为 7/97/997,而非 NaN。直接加载 .dta 文件后这些值会作为有效数值参与计算。
症状:连续变量均值偏高;分类变量出现不存在的类别;模型训练时异常值。
解决:逐变量根据 DHS Recode Manual 确认缺失值编码,在加载后立即替换为 np.nan。特别注意:0 通常表示"否定回答"(有效值),不可删除。
参考:DHS Recode Manual — Variable-specific missing value codes
⚠️ 坑点 3:v107 变量标签与实际编码不一致
分类:数据理解陷阱
问题:v107 的变量标签是"Highest year of education",暗示应为连续数值。但实际编码为分类代码(0=无教育, 1=初等, 2=中等, 3=高等),不是年份值。
症状:研究者将 v107 当作连续变量纳入回归,得到无意义的系数和预测值。
解决:必须查阅 DHS Recode Manual 确认每个变量的实际含义和编码方式。v106(教育水平)是分类变量,v107 也是分类变量而非连续变量。R package rdhs 提供 read_dhs_dta() 函数自动解析变量标签。
参考:DHS Recode Manual — “Why is the recode manual so important?”
⚠️ 坑点 4:GPS 坐标位移导致空间精度损失
分类:地理空间分析陷阱
问题:DHS GPS 簇坐标经随机位移(城市 2km / 农村 5km / 1% 农村 10km)以保护受访者隐私。直接将坐标与高分辨率地理特征(如道路网络、具体设施位置)匹配会引入系统性偏差。
症状:空间模型预测精度低;到最近设施距离计算偏大;空间自相关分析受影响。
解决:使用 DHS 提供的 Geospatial Covariates (GC) 文件而非自行计算地理特征。GC 文件由 DHS 团队使用位移后坐标在 2km/5km/10km 缓冲区内计算聚合值,已考虑位移影响。如需自行计算,确保使用足够大的缓冲区半径(≥5km)。
参考:DHS Spatial Data Analysis — Guidelines for Using GPS Coordinates
⚠️ 坑点 5:跨阶段问卷版本差异破坏可比性
分类:时间序列分析陷阱
问题:DHS 问卷在每个阶段(DHS-I 到 DHS-8)修订,变量定义和编码可能变更。同一变量在不同阶段的 Recode 版本中可能有不同的编码体系或含义。
症状:跨国/跨时间分析中变量值域不一致;合并不同阶段数据后出现异常分布。
解决:(1) 使用 IPUMS DHS 平台(dhs.ipums.org)提供的跨调查变量调和版数据;(2) 阅读 Recode Structure 变更文档(每阶段发布);(3) 使用 DHS API 的 tags 端点查找跨阶段可比较指标。
参考:IPUMS DHS — Variable comparability documentation
⚠️ 坑点 6:财富指数是资产代理而非收入
分类:模型解释陷阱
问题:v190(财富指数分位)基于住户耐用品拥有量、住房材料、饮水/卫生设施等通过主成分分析构建,是社会经济地位的代理变量而非直接收入/支出测量。
症状:研究者将财富指数等同于收入纳入模型并做收入弹性解释;跨国比较时未考虑各国资产构成差异。
解决:(1) 在论文中明确说明财富指数是资产基代理;(2) 跨国比较时使用国家内部相对分位(poorest→richest)而非绝对分值;(3) 如有消费支出数据(部分 DHS 有消费模块),可做稳健性检验。
参考:Rutstein & Johnson (2004) — The DHS Wealth Index
§6.6 数据增强建议
| 增强来源 | 数据类型 | 用途 |
|---|---|---|
| Geospatial Covariates (GC) | 气候/植被/人口密度 | 健康社会决定因素建模 |
| WorldPop | 1km 网格人口估计 | 人口加权健康指标 |
| OpenStreetMap | 设施/道路网络 | 服务可及性分析 |
| Google Earth Engine | 卫星影像 | 环境暴露量估计 |
| UN World Population Prospects | 国家人口估计 | 趋势外推 |
| IHME GBD | 全球疾病负担 | 疾病负担对比 |
§6.7 推荐模型架构
| 任务类型 | 推荐架构 | 参考文献性能 |
|---|---|---|
| U5M 预测 | DNN / CNN / CNN-DNN 混合 | 敏感度 0.71 / 特异度 0.83 (Adegbosin 2020) |
| Stunting 分类 | RF / XGBoost / ANN | 准确率 68.92% (Meta-analysis 2024) |
| Wasting 分类 | RF / SVM | 准确率 84.39% (Meta-analysis 2024) |
| 生育率回归 | 面板回归 / LSTM | 视数据量 |
| 地理空间建模 | Bayesian hierarchical / Geostatistical | 精细分辨率制图 |
§6.8 硬件需求
| 阶段 | CPU | RAM | GPU | 磁盘 |
|---|---|---|---|---|
| 单国分析(1 次调查) | 4 核 | 8 GB | 不需要 | 100 MB |
| 跨国分析(10+ 调查) | 8 核 | 32 GB | 可选 | 1 GB |
| 全量 + GC + 地理空间 | 16 核 | 64 GB | 推荐 | 10 GB |
| 深度学习(U5M 预测) | 8 核 | 32 GB | 1×GPU (8GB VRAM) | 5 GB |
§6.9 评估指标
| 任务 | 推荐指标 | 注意事项 |
|---|---|---|
| U5M 预测 | Sensitivity / Specificity / AUC / F1 | 类别极度不平衡(死亡率 < 10%),AUC 可能虚高 |
| 营养不良分类 | Accuracy / F1 / Cohen’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’‘’'s Kappa | 同样面临类别不平衡 |
| 生育率回归 | RMSE / MAE / R² | 考虑分层抽样效应 |
| 地理空间 | MSE / Spatial Correlation | 评估空间自相关 |
§6.10 MLOps 建议
| 实践 | 建议 |
|---|---|
| 版本控制 | 数据按调查 ID(如 KE2014DHS)版本化 |
| 数据溯源 | 记录每个变量的 Recode 版本和编码手册引用 |
| 可复现性 | 固定 rdhs / pandas / Stata 版本,记录权重变量使用 |
| 模型卡片 | 声明训练国家列表、调查阶段、缺失值处理策略 |
| 公平性 | 按财富分位/城乡/地区分层评估模型性能差异 |
§7 质量评估与局限性(Quality & Limitations)
§7.1 偏倚来源分析
| 偏倚类型 | 描述 | 影响程度 | 缓解措施 |
|---|---|---|---|
| 回忆偏倚 | 出生史和健康行为依赖受访者回忆,5 年回忆期可能导致远期事件遗漏 | 中 | 使用最近 5 年出生事件分析;与生命登记系统交叉验证 |
| 自报偏倚 | 避孕使用、HIV 知识、就医行为等依赖自报,可能受社会期望效应影响 | 高 | 生物标志物客观测量(HIV 检测、贫血)部分缓解;SBCC 模块评估暴露效应 |
| 选择偏倚 | 仅覆盖住户人口(排除无家可归者、机构内人员);男性调查选配可能导致男性数据缺失 | 中 | 评估无应答率;比较住户覆盖率与人口普查 |
| 抽样偏倚 | LMIC 偏向(USAID 援助国为主),高收入国家不纳入 | 高 | 理论外推时声明限制;与 BRFSS/NHANES 对比 |
| 阶段偏倚 | 跨阶段问卷变更导致时间趋势分析中指标定义漂移 | 中 | 使用 IPUMS DHS 调和版数据;明确分析的时间窗口 |
| 地理偏倚 | GPS 位移导致空间精度损失;GC 协变量仅 2–10km 缓冲区聚合 | 中 | 使用 DHS 官方 GC 文件;避免高分辨率空间匹配 |
| 生物标志物选择偏倚 | 生物标志物检测自愿参加,同意者可能与未同意者系统性不同 | 低 | 比较同意/不同意者的人口特征;使用 Heckman 选择模型 |
§7.2 数据质量保障体系
| 环节 | 措施 |
|---|---|
| 访员培训 | 2–3 周集中培训,含模拟访谈和现场实习,通过认证后方可上岗 |
| 现场督导 | 每组配备督导员,监督 10–20% 访谈;每日问卷审核和反馈 |
| CAPI 逻辑检查 | 跳转逻辑自动执行;实时范围和一致性校验 |
| 数据同步 | CAPI 每日同步至中央服务器;实时进度监控 |
| 后期清洗 | ICF 数据处理团队进行结构清洗、编码校验、权重计算 |
| GPS 位移 | 严格遵循位移协议(城市 2km / 农村 5km / 1% 农村 10km) |
| IRB 审查 | ICF IRB + 东道国 IRB 双重审查;45 CFR 46 合规 |
| 公开报告 | 调查完成报告含抽样误差表、应答率、数据质量评估 |
§7.7 DAIMS 评估
| DAIMS 维度 | 满足情况 | 评分 |
|---|---|---|
| 1. 数据集目的 | ✅ 明确(全球人口健康监测) | 1/1 |
| 2. 组成 | ✅ 完整(多种 Recode 文件 + GPS + 生物标志物) | 1/1 |
| 3. 采集方法 | ✅ 详尽(标准化问卷 + CAPI + 生物标志物协议) | 1/1 |
| 4. 标注方法 | ✅ 调查员培训 + 督导 + CAPI 逻辑检查 | 1/1 |
| 5. 标注者特征 | ✅ 访员特征数据可获取(DHS-7+) | 1/1 |
| 6. 样本权重 | ✅ 必须使用,文档详尽 | 1/1 |
| 7. 隐私保护 | ✅ 去标识 + GPS 位移 + DV 伦理协议 | 1/1 |
| 8. 伦理审查 | ✅ ICF IRB + 东道国 IRB | 1/1 |
| 9. 更新频率 | ✅ 持续(新调查持续发布) | 1/1 |
| 10. 版本管理 | ⚠️ Recode 版本跨阶段差异需手动处理 | 0.5/1 |
| 11. 元数据完整度 | ⚠️ Recode Manual 详尽但变量标签有时不精确 | 0.5/1 |
| 12. 可比性 | ⚠️ 跨阶段问卷变更影响可比性,IPUMS 部分缓解 | 0.5/1 |
| 13. 地理覆盖 | ✅ 90+ 国家,GPS 坐标可用 | 1/1 |
| 14. 时间覆盖 | ✅ 1984 至今,部分国家有 3+ 次 | 1/1 |
| 15. 格式多样性 | ✅ Stata/SPSS/SAS/ASCII/API | 1/1 |
| 16. API 可用性 | ✅ 12 个 REST 端点 | 1/1 |
| 17. AI 就绪文档 | ❌ 无官方 ML 划分和基准 | 0/1 |
| 18. 偏倚文档 | ✅ 详尽的抽样设计和偏倚讨论 | 1/1 |
| 19. 外部验证 | ⚠️ 与 MICS 可比但无统一基准 | 0.5/1 |
| 20. 可复现性 | ✅ Recode 版本可追溯 | 1/1 |
| 21. 数据字典 | ✅ Recode Manual + 在线变量文档 | 1/1 |
| 22. 许可证 | ✅ 免费注册制 | 1/1 |
| 23. 引用规范 | ✅ 明确的引用指南 | 1/1 |
| 24. 变更日志 | ✅ 阶段变更文档 | 1/1 |
DAIMS 总分:18.5 / 24(77%)
评估总结:DHS Program 在数据采集标准化、伦理审查、隐私保护、文档完整度和可访问性方面表现优异(18.5/24)。主要短板在于 AI/ML 就绪度——无官方 ML 划分、无基准性能参考、跨阶段变量可比性需手动处理。这些短板可通过使用 IPUMS DHS 调和数据、参考已发表的 ML 研究方法学和 DHS API 自动化数据获取来部分缓解。
§7.8 外部验证矩阵
| 验证来源 | 重叠指标 | 验证用途 | 可比性 |
|---|---|---|---|
| MICS (UNICEF) | 儿童健康/营养/免疫/水卫 | 跨项目交叉验证 | 高(同方法学) |
| BRFSS (CDC) | 行为风险因素(HIV/烟草/饮酒) | 高收入国家对比 | 中(电话 vs 面访) |
| NHANES (NCHS) | 贫血/营养/慢病 | 客观测量对比 | 中(体检 vs 面访) |
| WHO/UNICEF 估计 | U5M/免疫/TFR | 全球官方统计校准 | 高(部分基于 DHS) |
| 国家 DHS 类似调查 | 全面指标 | 独立调查验证 | 高 |
| IHME GBD | 疾病负担 | 与健康结果对比 | 中(不同方法学) |
§8 基准性能与生态(Benchmarks & Ecosystem)
§8.1 关键 AI/ML 应用
| 研究 | 任务 | 数据 | 模型 | 性能 | 引用 |
|---|---|---|---|---|---|
| Adegbosin et al. 2020 | U5M 预测 | 34 LMIC, 1,520,018 儿童 | DNN/CNN/CNN-DNN | 敏感度 0.71 / 特异度 0.83 | BMJ Open, 10:e034524 |
| Ogallo et al. 2020 | 新生儿死亡率 | 10 个 SSA 国家 | ML 模型 | 识别家庭规模等新因子 | medRxiv 2020.10.14 |
| Meta-analysis 2024 | 儿童营养不良 | 11 项研究 (2019–2023) | ML (RF/SVM/XGBoost) | Stunting 68.92% / Wasting 84.39% | Manipal Univ. |
| Mensah et al. 2024 | U5M 预测 | 加纳 DHS 2022 | ANN/XGBoost/RF/LR | ANN 最佳 | RS-8051248 |
| 多项研究 | HIV 知识评估 | 多国 DHS | 回归/分类 | 变量研究 | 多期刊 |
§8.7 生态快照
| 组件 | 状态 | 说明 |
|---|---|---|
| DHS Program 官网 | ✅ 活跃 | dhsprogram.com — 调查注册/下载/报告 |
| DHS REST API | ✅ 活跃 | api.dhsprogram.com — 12 个数据端点 |
| STATcompiler | ✅ 活跃 | statcompiler.com — 在线指标查询和可视化 |
| IPUMS DHS | ✅ 活跃 | dhs.ipums.org — 跨调查变量调和(明尼苏达大学) |
| rdhs R package | ✅ 活跃 | github.com/ropensci/rdhs — API 客户端和数据管理 |
| DHS GitHub | ✅ 活跃 | github.com/dhsprogram — 代码示例和分析工具 |
| DHS Learning Resources | ✅ 活跃 | 在线培训模块、视频教程 |
| DHS Forum | ✅ 活跃 | 用户论坛和 Q&A |
| DHS Spatial Data | ✅ 活跃 | 地理空间分析和制图资源 |
§9 相关资源与引用(Resources & Citation)
§9.1 引用格式
BibTeX:
@misc{dhsprogram2024,
author = {{ICF International}},
title = {The Demographic and Health Surveys Program (DHS)},
year = {19842024},
publisher = {USAID and ICF},
url = {https://dhsprogram.com/},
note = {350+ surveys in 90+ countries since 1984}
}
@article{corsi2012,
author = {Corsi, Daniel J. and Neuman, Melissa and Finlay, Jocelyn E. and Subramanian, S. V.},
title = {Demographic and health surveys: a profile},
journal = {International Journal of Epidemiology},
volume = {41},
number = {6},
pages = {16021613},
year = {2012},
doi = {10.1093/ije/dys184}
}
§9.2 官方资源链接
| 资源 | URL |
|---|---|
| 官方主页 | https://dhsprogram.com |
| 数据注册 | https://dhsprogram.com/data/new-user-registration.cfm |
| REST API | https://api.dhsprogram.com/rest/ |
| STATcompiler | https://www.statcompiler.com |
| IPUMS DHS | https://dhs.ipums.org |
| Recode Manual | https://dhsprogram.com/publications/publication-dhsm4-dhs-questionnaires-and-manuals.cfm |
| Using Datasets Guide | https://dhsprogram.com/data/Using-Datasets-for-Analysis.cfm |
| File Format Guide | https://dhsprogram.com/data/File-Formats.cfm |
| File Naming Convention | https://dhsprogram.com/data/File-Types-and-Names.cfm |
| rdhs R Package | https://github.com/ropensci/rdhs |
| 模型数据集 | https://dhsprogram.com/data/Download-Model-Datasets.cfm |
| GPS/Geospatial | https://dhsprogram.com/data/GPS-Coordinates.cfm |
§9.3 引用指南
使用 DHS 数据的论文应引用:
- 具体调查报告(如:
[Country] National Institute of Statistics, ICF. [Country] Demographic and Health Survey [Year]. [City]: [Publisher]; [Year].) - DHS Program 项目描述(Corsi et al. 2012, IJE)
- 数据下载日期和版本号
§9.4 变更日志
| 版本 | 日期 | 变更 |
|---|---|---|
| DHS-I | 1984 | 初始调查启动 |
| DHS-II | 1989 | Macro Systems 接管 |
| DHS-III | 1992 | 引入 GPS 坐标采集(1996 起) |
| DHS-IV | 1997 | MEASURE DHS 品牌启用 |
| DHS-V | 2003 | AIS 调查创建 |
| DHS-VI | 2008 | MIS 调查创建 |
| DHS-7 | 2013 | 全面 CAPI 部署 |
| DHS-8 | 2018 | 新增慢性病/迁移/结核/宫颈癌筛查/MDD-W |
§10 AI 使用声明卡(AI Usage Card)
| 字段 | 内容 |
|---|---|
| AI 模型 | Claude 3.5 Sonnet(结构化内容生成) + GPT-4(代码验证) |
| AI 参与范围 | 资料整理 + 初稿撰写 + 代码生成 |
| 输入来源 | (1) DHS Program 官网及 API 文档; (2) ICF/DHS Methodology 文档; (3) DHS File Formats 文档; (4) DHS Using Datasets Guide; (5) DHS Privacy and Ethics 文档; (6) Corsi et al. 2012 (IJE); (7) Adegbosin et al. 2020 (BMJ Open); (8) DHS Model Datasets; (9) rdhs R package 文档; (10) IPUMS DHS 文档; (11) WebSearch 检索结果; (12) v3.9 Schema 模板; (13) ADNI_Wikipedia.md 格式参考 |
| 最后人工审核 | 2026-08-12 |
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例 | 千方病案医学编辑部 | 逻辑审查 | ✅ 已通过 |
| §3 数据规格 | 千方病案医学编辑部 | 与官方文档交叉比对 | ✅ 已验证 |
| §7 质量评估 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §1 概览 | 千方病案医学编辑部 | 内容审查 | ✅ 已通过 |
| §8 基准性能 | 千方病案医学编辑部 | 引用验证 | ✅ 已验证 |
