信息速览

UNICEF MICS — 全球儿童妇女住户调查数据库 AI-Ready Wikipedia
INFOBOX
| 字段 | 内容 |
|---|---|
| 数据集名称 | UNICEF MICS:多指标类集调查 |
| 英文全称 | Multiple Indicator Cluster Surveys (MICS) |
| 别名/简称 | MICS;MICS1-MICS7(各轮);MICS-type(非全球项目同类调查) |
| 疾病分类 | ICD-11:1E90 麻疹、CA40 肺炎、1B10 结核病、1C60 HIV 病、8A61 癫痫、6A70 抑郁发作、5D42 营养不良 等(详见 §2.1) |
| SNOMED CT | 14189004(麻疹)、233604007(肺炎)、56717001(结核病)、86406008(HIV 感染)、271737000(贫血)、62315008(腹泻)等(详见 §2.1b) |
| 数据模态 | 结构化住户调查微数据(面访)+ 5 岁以下儿童人体测量 + 水质检测 + 地理空间数据(MICS GIS,部分国家)+ 电话随访(MICS Plus) |
| AI 任务类型 | SDG 指标估计、小区域估计(SAE)、贫困与福祉预测、不平等分解、跨调查迁移学习、报告文本挖掘 |
| 样本总数 | 418 次调查 / 123 国(截至 2025-10);IPUMS MICS 收录 237 个样本、1,800 万个人记录 |
| 数据大小 | 按国家/调查打包发布,单包数十 MB 量级(视模块与样本量而定;官方未发布全库总量统计) |
| 数据格式 | SPSS .sav(10 类数据文件)+ SPSS 语法 + PDF 调查报告 + Excel 制表计划 |
| 许可证 | UNICEF Terms of Use(免费用于合法研究;禁止再分发或出售) |
| 访问级别 | 注册后开放(注册 MICS 数据用户后 1-2 天内开通全部调查下载权限) |
| DUO 标签 | NRES(无限制研究用途;附出版物回传义务) |
| 语言 | 英语(变量标签、数据字典与官方文档);各国问卷另有本地语言译文 |
| 首发日期 | 1995(MICS1 首轮,60+ 国实施) |
| 最后更新 | MICS7 进行中(2023 年启动;截至 2026-09 最新动态为 Ukraine MICS 2025/26 初步统计快照,2026-06-11) |
| 发布机构 | UNICEF(全球 MICS 团队)× 各国国家统计局(NSO) |
| 官方主页 | UNICEF MICS 官网 |
| 下载地址 | Surveys/Datasets 页 |
| DOI | 无统一 DOI;各调查以 study ID 编目(如 LAO_2006_MICS_v01_M,详见 §9.3 引用指南) |
| 引用次数 | 无单一原始论文口径;MICS 与 DHS 并列为全球住户调查文献两大支柱数据源(各国调查分开编目与引用) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 数据字典、标准制表计划与 SPSS 语法齐备、跨轮模块标准化;扣分:仅 SPSS 格式需转换、无官方机器可读 schema、权重与非自加权设计需自行正确处理 |
| 页面状态 | published |
§0 E-E-A-T 与审核声明
医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11/SNOMED 编码映射、妇幼健康主题流行病学)、§7 偏倚分析与公平性评估。审核日期:2026-09-05。
数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。审核日期:2026-09-05。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。MICS 微数据以 UNICEF Terms of Use 免费向注册研究者开放,但禁止再分发或出售,并要求向 UNICEF 与实施调查的政府伙伴回传基于数据的报告与出版物副本。敏感调查(如女性问卷、儿童管教模块)另受各国实施机构的发布政策约束;部分调查数据集状态为 Restricted,表示实施机构不允许共享。具体使用限制以 UNICEF MICS 官方 FAQ 为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? MICS(Multiple Indicator Cluster Surveys,多指标类集调查)是 UNICEF 开发并支持、由各国国家统计局执行的住户抽样调查项目。它用一套全球统一的模块化问卷,走进 123 个国家的数十万个家庭,逐户登记儿童与妇女的健康、营养、教育、保护和家庭状况,自 1995 年以来已完成 418 次调查(截至 2025-10)。
为什么重要? 在很多低收入国家,出生登记、免疫接种、儿童营养不良这些信息在行政系统里是缺失的,MICS 往往是唯一的全国代表性数据来源。它监测 33 项 SDG 指标(涉及 11 个 SDG 目标),是衡量联合国 2030 议程"不让任何一个人掉队"原则落实的有力工具;在 DHS 项目于 2025 年 2 月终止后,MICS 更成为低中收入国家住户调查数据的主要支柱。
我能用它做什么? 如果你是公共卫生研究者,可以直接下载各国匿名化微数据复算官方指标或做新分析;如果你是机器学习工程师,可以用它训练福祉/贫困预测、多指标联合建模与小区域估计模型;如果你是政策分析者,用 IPUMS MICS 或 MICS Tabulator 一键跨国比较。所有数据免费,注册即可下载。
§1.1 摘要
MICS 采用多阶段分层整群抽样设计(推荐每簇 15-30 户,典型全国样本约 10,000 户),以约三年为一轮推进:MICS1(1995-1996,60+ 国)至 MICS7(2023 年启动)共 7 轮,截至 2025-10 已在 123 个国家完成 418 次调查(官方口径)。MICS6 使用 6 种模型问卷(家庭、15-49 岁女性、15-49 岁男性、5 岁以下儿童、5-17 岁儿童、水质检测),完整调查产出 10 类微数据文件(household、household listing、ITN、women、birth history、FGM、maternal mortality、men、children 5-17、children under 5),变量分原始与派生两类,派生变量由官方 SPSS 语法按公开指标算法计算,微数据本身不做任何插补。数据以 SPSS .sav 格式经匿名化后免费发布于 mics.unicef.org,仅限合法研究用途。生态工具包括 IPUMS MICS(94 国、237 个样本、2,000+ 协调变量、1,800 万个人记录)、MICS Tabulator(在线制表)与 MICS7 新增的 MICS Plus(电话随访)与 MICS GIS(地理空间)能力,构成从原始微数据到协调化分析矩阵的完整链路。
§1.2 战略价值
维度一:全球南方数据的"最后一公里"。 231 项 SDG 指标中约 80 项可通过住户调查监测,MICS 目前覆盖其中 33 项(11 个目标下),且新增模块(心理健康、霸凌、时间使用、融合教育)正将其覆盖推向住户调查可测指标的一半左右。对出生登记率、儿童失学、儿童管教方式这类行政系统几乎不记录的指标,MICS 是许多国家唯一的全国代表性来源;UNICEF 与各国合作将结果发布周期目标定在外业结束后 6 个月内(实际平均约 12 个月),是同类项目中速度较快的。对 AI 团队而言,这意味着你可以拿到"世界上别处拿不到"的真实人群福祉标签。
维度二:标准化与可比性资产。 MICS 的核心设计是"无问题不指标"——问卷中不存在不服务于指标算法或背景变量的问题,且国家定制必须保留标准题目编号,从源头保证跨国可比性;官方为每轮提供标准制表计划与 SPSS 语法,使任何研究者都能逐字节复现官方报告表格。IPUMS MICS 进一步把 2005 年以来的数据协调成 2,000+ 变量、编码跨时空一致的矩阵,并同步喂养 MICS Tabulator。这为迁移学习、跨国家 pooled 模型与合成控制类研究提供了同类数据集中最完整的标准化基础设施。
维度三:获取门槛与合规确定性。 相比需要逐项审批、签署协议的研究数据通道,MICS 的"注册即用"模式(1-2 天开通、全库访问、免费)把获取摩擦降到最低;其许可边界(研究用途、禁再分发、回传义务)清晰可执行,团队可以把它写进合规 SOP 而无需个案法律评估。对需要快速验证想法、构建教学案例或做多国基线对比的团队,这是同类数据源中工程上最省心的入口。
§1.3 同类数据集横向对比
| 数据集 | 规模与范围 | 模态与标注 | 与 MICS 的差异化 |
|---|---|---|---|
| MICS | 418 次调查 / 123 国(截至 2025-10),1995 年起 7 轮 | 10 类结构化微数据 + 人体测量 + 水质检测;指标=派生变量 | 儿童为核心设计对象(对有儿童家庭过抽样);免费注册即得;监测 33 项 SDG 指标 |
| DHS(DHS Program) | 90+ 国家、300+ 次调查,1984 年起 | 结构化微数据 + 生物标志物(血液/血压等) | 卫生与健康专题更深(生物标志物);项目于 2025-02 因 USAID 资金终止,历史数据仍可用;与 MICS 工具高度可比、团队密切协作 |
| LSMS / LSMS-ISA(世界银行) | 数十个国家、多轮面板 | 结构化微数据 + 农业生产模块 | 面板设计、农业与消费支出更深;儿童专题远弱于 MICS |
| IPUMS MICS | 94 国、237 个 MICS 样本、2,000+ 变量、1,800 万记录 | MICS 微数据的协调化重编码版本 | 不是独立调查,而是 MICS 的"跨时空统一码"发行渠道,免费提取,附可比性文档 |
| MICS Tabulator | 覆盖 MICS2 至今的协调化数据 | 在线制表平台(无微数据下载) | 官方在线分析入口:自定义指标定义与缺失处理,导出 Excel/PDF/RTF,适合快速验证 |
§1.4 版本时间轴
| 轮次 | 时间窗口 | 国家规模 | 主线与新增能力 |
|---|---|---|---|
| MICS1 | 1995-1996 | 60+ 国 | 应对 1990 世界儿童峰会中期评估;1994-11 UNICEF 执行主任发出执行指令后铺开 |
| MICS2 | 约 2000 | 数十国 | 加深覆盖面,监测更多全球共识指标 |
| MICS3 | 2006 起 | 数十国 | 对标 MDG 与《适合儿童成长的世界》承诺 |
| MICS4 | 2009 起(实施至 2013) | 数十国 | 确立三年一轮节奏;男性问卷进入通用工具包(2011 起) |
| MICS5 | 2012 起 | 40+ 国 / 50+ 次调查(至 2015) | MDG 收官测量;指标清单达 166 项 |
| MICS6 | 2016-2022 | 最大一轮之一 | SDG 基线;指标清单 200 项(计性别分层 237 项);新增 5-17 岁儿童问卷、残疾模块(child functioning)、水质检测 |
| MICS7 | 2023-2026(进行中) | 持续增长 | 新模块:心理健康、霸凌、儿童时间使用、融合教育;新能力:MICS Plus(电话随访)、MICS GIS、MICS Tabulator、MICS Link、MICS PRTI |
§1.5 典型应用场景
- SDG/国家指标官方监测:用官方 SPSS 语法逐国复算 200+ 指标并生成统计快照,服务国家规划与全球报告。
- 儿童营养不良与免疫研究:基于 5 岁以下儿童文件(生长迟缓、消瘦、超重、全程免疫覆盖等)做流行病学与干预效果分析。
- 机器学习福祉预测:以家庭资产、住房、教育等背景变量训练财富指数/多维贫困预测模型,或做多指标联合风险建模。
- 小区域估计(SAE):将 MICS 簇级数据与人口普查/地理空间层结合,把全国代表性估计下探到次级区域(需注意 §6.5 坑点 8 的代表性边界)。
- 跨国家比较研究:用 IPUMS MICS 协调变量做 90+ 国横向比较(教育、童婚、暴力、早期发展等),或用 MICS Tabulator 快速出图。
选型决策指南:要官方口径 → 用官方语法复算(不要自算);要跨国 pooled → 先 IPUMS 后建模,绝不 pool 原始 .sav;要区县级数字 → 先确认该国样本是否支持(多数不支持,需 SAE + 空间协变量);要最新趋势 → 跟踪 MICS7 各国发布(官网新闻 + 数据集状态);只想验证一个数字 → MICS Tabulator 免下载直接查。
§2 医学背景
§2.1 ICD-11 编码映射表
MICS 是调查数据集,不含临床诊断编码;其健康模块测量的疾病与状况对应如下 ICD-11 编码,便于将调查指标与临床术语体系对接(映射为研究参考用途):
| MICS 监测主题/状况 | MICS 指标域 | ICD-11 编码 | ICD-11 术语(中文) |
|---|---|---|---|
| 麻疹免疫/麻疹患病史 | 免疫接种模块 | 1E90 | 麻疹 |
| 急性呼吸道感染(咳嗽伴呼吸急促) | 疾病症状模块 | CA40 | 肺炎 |
| 结核病 | 疾病症状模块(部分国家模块) | 1B10 | 结核病 |
| HIV/AIDS | HIV/AIDS 模块(知识、检测与态度) | 1C60 | HIV 病 |
| 贫血(部分调查血红蛋白检测) | 人体测量与营养模块 | 3A00 | 缺铁性贫血 |
| 儿童消瘦/发育迟缓/超重 | 人体测量模块 | 5D42 | 营养不良 |
| 腹泻(含 ORS 使用) | 疾病症状模块 | 1A03 | 病毒性胃肠炎 |
| 癫痫(MICS7 心理健康/功能模块相关条目) | 儿童功能/心理健康模块 | 8A61 | 癫痫 |
| 儿童与青少年抑郁症状 | MICS7 心理健康模块 | 6A70 | 抑郁发作 |
| 儿童与青少年焦虑症状 | MICS7 心理健康模块 | 6B00 | 广泛性焦虑障碍 |
§2.1b SNOMED CT 映射表
| MICS 监测主题/状况 | 指标域 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| 麻疹 | 免疫接种模块 | 14189004 | Measles(麻疹) |
| 肺炎 | 疾病症状模块 | 233604007 | Pneumonia(肺炎) |
| 结核病 | 疾病症状模块 | 56717001 | Tuberculosis(结核病) |
| HIV 感染 | HIV/AIDS 模块 | 86406008 | Human immunodeficiency virus infection(HIV 感染) |
| 贫血 | 营养模块 | 271737000 | Anemia(贫血) |
| 腹泻 | 疾病症状模块 | 62315008 | Diarrhea(腹泻) |
| 癫痫 | 功能模块 | 91175000 | Epilepsy(癫痫) |
§2.2 健康主题简介与流行病学定位
MICS 的健康测量横跨四大主题域。生存与死因域:以生育史/死亡率模块测量 5 岁以下死亡率与孕产妇死亡率相关条目,是 SDG 3.2(消除可避免的儿童死亡)的核心数据来源之一。营养域:对 5 岁以下儿童做身高/体重/年龄人体测量,派生生长迟缓(stunting)、消瘦(wasting)、超重三组 z 值分类指标,辅以母乳喂养与膳食摄入、盐碘化(部分轮次)条目。疾病控制域:免疫接种(卡介苗、DPT、脊灰、麻疹等,按 24-35 月龄口径计算全程覆盖)、急性呼吸道感染与腹泻两周患病率及处置(口服补液盐)、发热与疟疾(疟疾流行国)、杀虫剂处理蚊帐(ITN)。保护与发展域:出生登记、儿童管教方式、童工、童婚、女性生殖器切割(FGM)、儿童早期发展(ECD)指数、残疾筛查(child functioning/adult functioning 模块)与 MICS7 新增的心理健康条目。
从流行病学定位看,MICS 的重要性在于"补行政系统之缺":上述主题在低收入国家的民事登记、卫生信息系统覆盖严重不足,MICS 提供的全国与区域分层估计往往是这些国家唯一的周期性人群测量。UNECE 区域的经验亦显示,该区域 54 国中近 16 国关于对儿童暴力(SDG 16.2.1)的数据完全来自 MICS。需要强调:MICS 报告的是"人群测量值"而非临床诊断——症状类指标基于母亲/照护者回忆的两周患病窗口,与临床金标准存在已知差距(详见 §7.1 偏倚表)。
高频指标的官方分母速查(决定每个指标"谁进入分母",是复算与建模的第一约束):
| 指标族 | 官方分母 universe | 分母含义 |
|---|---|---|
| 营养(生长迟缓/消瘦/超重) | 全部 0-59 月龄儿童(有有效测量) | 月龄决定参照分布与 z 值 |
| 免疫覆盖 | 特定月龄档(如 12-23 / 24-35 月龄,视指标) | 免疫时点已过的最小 cohort |
| ARI/腹泻/发热两周患病率 | 全部 0-59 月龄儿童 | 照护者回忆窗口 |
| 早期儿童发展(ECD) | 36-59 月龄儿童 | 四发展域可测的最小年龄 |
| 出生登记 | 全部 0-59 月龄(部分分析扩展至 17 岁) | 登记时点的存活儿童 |
| 童婚/FGM(女性) | 15-49 岁女性(FGM 另限特定年龄组报告) | 自报经历或态度 |
| 儿童管教 | 1-14 岁儿童 | 照护者管教方式回忆 |
§2.2b 模型问卷模块清单
MICS 通用工具包"全模块打包、按需裁剪":实施者只删除不适用模块(如非疟疾国删 ITN),但不得改动保留模块的标准题号。以下为标准模块结构(以 MICS5-MICS6 工具包为骨架):
| 问卷 | 模块组 | 模块(主题域) |
|---|---|---|
| 家庭问卷(HH/HL) | 户与成员 | 信息面板、家庭成员名单(教育/童工/儿童管教在此层) |
| 家庭问卷(HH/HL) | 住房与环境 | 家庭特征、水与卫生设施、洗手、盐碘化(部分轮次) |
| 家庭问卷(HH/HL) | 疟疾(流行国) | 杀虫剂处理蚊帐(ITN)、室内滞留喷洒 |
| 女性问卷(WM,15-49 岁) | 人口与背景 | 信息面板、背景特征、大众媒体与 ICT 使用 |
| 女性问卷(WM,15-49 岁) | 生育与孕产 | 生育史(含死亡率信息)、末次生育意愿、孕产妇与新生儿健康、产后健康检查、孕产妇死亡率模块(可选) |
| 女性问卷(WM,15-49 岁) | 生殖健康 | 避孕、未满足需求、婚姻/同居、性行为 |
| 女性问卷(WM,15-49 岁) | 健康与保护 | 疾病症状、HIV/AIDS 知识态度、女性生殖器切割(FGM/C,可选)、家庭暴力态度、烟酒使用、生活满意度 |
| 男性问卷(MN,15-49 岁) | 平行模块 | 信息面板、背景、媒体与 ICT、生育、家庭暴力态度、婚姻/同居、性行为、HIV/AIDS、割礼、烟酒使用、生活满意度 |
| 5 岁以下儿童问卷(CH,0-59 月龄) | 儿童生存 | 信息面板、年龄、出生登记 |
| 5 岁以下儿童问卷(CH,0-59 月龄) | 健康与发展 | 早期儿童发展(ECD)、母乳喂养与膳食摄入、免疫接种、疾病照护(腹泻/发热/ARI 处置) |
| 5 岁以下儿童问卷(CH,0-59 月龄) | 测量 | 人体测量(身高/体重/年龄) |
| 5-17 岁儿童问卷(FS,MICS6 起) | 学龄儿童 | 教育、童工、儿童功能(残疾筛查,每户随机抽 1 名儿童) |
| 水质检测问卷(WQ,MICS6 起) | 实验室检测 | 抽样住户饮用水大肠菌群检测 |
设计要点:MICS5 时指标清单为 166 项、MICS6 扩至 200 项(计性别分层 237 项);模块裁剪自由度带来"同一指标覆盖国数不同"的现实——pooled 分析前必须逐国核对模块启用情况。
§2.3 AI 任务定义
| 任务类型 | 定义 | 输入 → 输出 | 代表性用途 |
|---|---|---|---|
| 指标估计(官方口径) | 按官方定义在加权样本上计算率值 | 模块变量 + 权重 → 率值与置信区间 | 国家报告、SDG 提交 |
| 小区域估计 | 借助普查/空间协变量把估计下探到次级区域 | 簇级数据 + 协变量 → 区县级率值 | 地方规划、资源分配 |
| 多指标预测/分类 | 用背景变量预测健康/福祉结局 | 家庭特征 → 结局概率 | 风险分层、干预瞄准 |
| 跨国 pooled 建模 | 合并多国样本训练统一模型 | IPUMS MICS 协调矩阵 → 模型参数 | 比较研究、迁移学习 |
| 文本挖掘 | 对调查发现报告/统计快照做 NLP | PDF 报告 → 结构化指标表 | 指标抽取、趋势汇总 |
§2.4 调查人群画像
| 人群子集 | 来源与工具 | 年龄/范围 | 应答者 | 备注 |
|---|---|---|---|---|
| 全体家庭成员 | 家庭问卷 + 成员名单(HL) | 全年龄 | 任一知情成年成员(MICS1-3 为户主) | 住房、教育、童工、管教、水与卫生等 |
| 育龄女性 | 女性问卷(WM) | 15-49 岁 | 本人 | 生育史、孕产、避孕、HIV 知识、婚姻等 |
| 育龄男性 | 男性问卷(MN,2011 起通用) | 15-49 岁 | 本人 | 部分国家采用 |
| 5 岁以下儿童 | 儿童问卷(CH) | 0-59 月龄 | 母亲;不在户时由主要照护者应答 | 免疫、人体测量、ECD、哺乳 |
| 5-17 岁儿童 | 儿童问卷(FS,MICS6 起) | 5-17 岁 | 母亲/照护者(每户随机抽 1 名儿童) | 教育、童工、功能模块 |
| 水质子样本 | 水质检测问卷(MICS6 起) | 抽样住户饮用水 | 现场检测 | 大肠菌群等实验室指标 |
| 亚人群调查 | 罗姆人聚居区、难民聚居地等 | 视设计 | 同上 | 约 20% IPUMS MICS 样本为亚国家/特定人群 |
§2.5 公共卫生与政策价值
对政策链路而言,MICS 数据的价值在三个环节兑现。规划环节:基线调查让国家首次获得儿童暴力、早期发展、残疾、社会保护覆盖等主题的量化底数(UNECE 多国均为"首次测量")。监测环节:三年一轮的固定口径让塞尔维亚、土库曼斯坦、吉尔吉斯斯坦、北马其顿等长期参与国形成了跨 20 余年的趋势序列;塞尔维亚罗姆人聚居区调查更提供了主流人群之外的弱势群体分层证据。评估环节:统计快照与主题深入分析(教育、多维贫困等专题工作坊产出)直接服务项目终期评估。对 AI 团队,MICS 的价值是把"哪个孩子掉队"从经验判断变成可建模、可定位、可复算的量化问题。
从能力建设视角看,MICS 的外部性同样可观:它并非单纯"采集数据",而是通过工作坊体系把问卷设计、抽样、数据处理、报告编写的全套技能转移给各国统计系统——UNECE 指出 NSO 会把 MICS 中学到的可迁移知识用于其他调查,提升整个国家统计体系的指标理解力。这意味着 MICS 微数据的"生产质量"随时间自我强化:参与轮次越多的国家,其后期轮次的数据质量基础设施越成熟。
§2.6 金标准对照表
| 对照维度 | MICS 官方口径 | 研究者自定义口径 | 性质 |
|---|---|---|---|
| 指标计算 | 官方 SPSS 语法 + 标准制表计划(唯一权威) | 自行定义分母/缺失处理(须显式声明) | 官方=复现基准 |
| 抽样权重 | 官方权重(校正无响应/过抽样并归一化) | 重新加权(仅限特殊设计场景) | 官方=默认使用 |
| 健康结局 | 症状/行为自我报告(两周窗口) | 临床检测/行政记录 | 不同构念,不可互替 |
| 跨国比较 | 标准题目编号保留 + IPUMS 协调码 | 直接 pool 原始 .sav(高风险) | IPUMS=推荐路径 |
| 儿童营养分类 | 官方 z 值派生变量 | 按 WHO 参照自行重算 | 需完全对齐参照标准 |
| 报告文本 | 官方报告与统计快照(PDF) | 自行解析的报告语料 | 构念不同:官方为权威口径 |
§3 数据集规格
§3.0 版本抉择矩阵
| 你的需求 | 推荐版本/轮次 | 数据形态 | 理由 |
|---|---|---|---|
| 最新指标、SDG 监测 | MICS7(2023 起,进行中) | 各国陆续发布 | 新模块(心理健康、霸凌、时间使用、融合教育)+ MICS Plus/GIS;注意部分调查仍在采集,数据集状态可能是 Not yet available |
| 跨国 pooled 研究 | MICS6(2016-2022)+ IPUMS MICS | IPUMS 协调矩阵 | MICS6 样本量最大、模块最全;IPUMS 已覆盖 MICS2 起的多轮样本,编码统一 |
| 历史趋势分析(MDG 时代) | MICS3-MICS5(2006-2015) | 原始 .sav | 与 MDG 指标口径对齐;塞尔维亚等国已形成长序列 |
| 快速验证指标、不想下载 | MICS Tabulator(MICS2 起) | 在线制表 | 无需注册下载微数据;适合核查官方数字与出图 |
| 教学与小样本练习 | 任一 MICS6 已发布国(数据集状态 Available) | 单包数十 MB | 官方语法与报告配套完整,适合全流程教学 |
§3.1 模态详情
- 结构化微数据(主模态):每份调查由 6 种模型问卷生成至多 10 类 .sav 数据文件,一条记录对应一户或一名个体;变量分原始(直接对应问卷题项)与派生(官方语法计算)两类。
- 人体测量:5 岁以下儿童身高/身长、体重与年龄测量,存于儿童文件(CH),派生变量为 z 值与分类(生长迟缓/消瘦/超重)。
- 水质检测:MICS6 起的独立问卷与现场检测流程,对抽样住户饮用水做大肠菌群检测,产出独立数据文件。
- 地理空间(MICS GIS):MICS7 新增能力,部分国家(如老挝已连续发布)公开 GIS 数据层;公开微数据文件本身不含 GPS 坐标,需向国家实施机构申请。
- 电话随访(MICS Plus):MICS7 起的纵向补充,用电话随访在两轮调查间获得更及时洞察(如利比亚的推进)。
- 文档模态:调查发现报告(PDF,可达数百页)、统计快照、数据质量表——是文本挖掘与指标抽取的对象。
§3.2 按子集样本数表
| 子集/文件 | 单次调查规模 | 全库规模 | 来源口径 |
|---|---|---|---|
| 户(household, HH) | 均值约 10,000 户(IPUMS 收录样本范围 700-103,000) | 418 次调查累计 | IPUMS MICS 统计 + 官方调查数 |
| 个人(全员) | 均值约 58,000 人(范围 3,000-600,000) | IPUMS MICS 1,800 万个人记录 | Cairn/Population 2025 |
| 15-49 岁女性(WM) | 约每户 1-2 名合格者 | 各调查独立 | 问卷设计口径 |
| 5 岁以下儿童(CH) | 视生育率与样本量(每簇 15-30 户) | 各调查独立 | 抽样设计口径 |
| 全国代表性样本占比 | 约 80% 的 IPUMS MICS 样本为全国代表 | 其余为亚国家/特定人群 | Cairn/Population 2025 |
| 调查覆盖 | — | 123 国、418 次调查(截至 2025-10) | UNICEF 官方口径 |
§3.3 格式表
| 制品 | 格式 | 说明 |
|---|---|---|
| 微数据 | SPSS .sav(唯一官方格式) | 官方明确不提供 SAS/Stata/Excel 版本,需自行转换(可轻松导入其他统计软件) |
| 语法 | SPSS 语法文件(.sps) | 复现全部官方标准表格;各国定制语法可向实施机构申请 |
| 制表计划 | Excel | 标准表格定义(每轮工具包组成部分) |
| 数据录入 | CSPro 应用(纸质或平板) | 问卷电子化采集/录入工具 |
| 报告 | 调查发现报告 + 统计快照 + 数据质量表 | |
| 协调数据 | IPUMS 自有提取格式(Stata 等) | 经 IPUMS 平台按需生成提取包 |
| 统计快照 | 各国主题快照(Ukraine MICS 2025/26 首批快照 2026-06 发布) |
§3.4 存储大小
MICS 按"国家 × 调查"为单位打包发布,每个数据包通常包含微数据(10 类文件中该调查启用的部分)、配套文档(问卷、数据字典、报告 PDF)与语法文件;单包大小视模块取舍与样本量而定,典型为数十 MB 量级,官方未发布全库总容量统计。若只做协调化分析,IPUMS MICS 提取包按所选变量与样本生成,体量可控;若只验证指标,MICS Tabulator 完全免下载。
§3.5 标注方式
MICS 无人工"标注"环节,其"标签"体系是程序化派生:每个指标有公开的算法定义,官方 SPSS 语法从原始题项计算派生变量(含分母 universe 与缺失规则),指标清单是问卷设计的唯一驱动(“无问题不指标”)。派生过程中的关键决策——哪些样本进入分母、don’t know 与 missing 如何处理——均写入语法与制表计划,可审计、可复现。这意味着对 AI 而言,MICS 的"标签质量"等同于"官方算法实现质量",且基准实现始终可获取。
§3.6 标注者资质与一致性
| 角色 | 资质/机制 | 一致性保障 |
|---|---|---|
| 问卷设计 | UNICEF 全球 MICS 团队 + 专家与伙伴机构 | 标准问卷 + 模块化裁剪规范 |
| 实地采集 | 各国 NSO 访问员团队 | 调查设计/数据处理区域工作坊统一培训 |
| 数据处理 | 各国处理团队 | CSPro 结构与一致性检查;外业期间 field check tables 实时纠偏(巴基斯坦已自动化为仪表盘) |
| 报告与解译 | 国家级数据解译与报告编写工作坊 | 首轮制表共识化;主题深入分析工作坊 |
| 质量审计 | 每份报告附标准数据质量表 | 年龄分布、堆积、完整性、性别比等清单化核查 |
§3.7 采集周期
MICS 以约三年为一轮滚动推进(MICS4 起确立):每轮先发布全球统一工具包,各国在轮次窗口内错峰实施;单国外业完成后进入处理与报告阶段,UNICEF 目标 6 个月内发布结果,近期调查实际平均约 12 个月;数据集在国家级结果发布后至少 2-3 个月公开。MICS7 于 2023 年启动,窗口至 2026 年(Springer 轮次表口径),截至 2026-09 仍有调查处于采集或待发布状态(如 Ukraine MICS 2025/26 已发初步统计快照)。
单次调查生命周期示意(时长为官方口径的典型区间):
| 阶段 | 典型窗口 | 关键产物/门槛 |
|---|---|---|
| 工具包本地化 + 抽样设计 | 数月 | 国家定制问卷(保留标准题号)、抽样方案 |
| 培训 + 外业采集 | 数周至数月 | CSPro 录入/CAPI;外业期间 field check tables |
| 数据处理与二访编辑 | 数月 | 结构/一致性检查;无插补 |
| 报告编写与解译工作坊 | 数月 | 调查发现报告初稿(含数据质量表附录) |
| 国家级发布 → 数据公开 | 报告发布后 2-3 个月起 | 数据集状态 Not yet available → Available |
| 结果发布时限 | 目标 6 个月,实际均值约 12 个月 | UNICEF 与各国合作的发布承诺 |
§3.8 地域覆盖
覆盖 123 个国家和地区(截至 2025-10),重心在撒哈拉以南非洲(西非与中非为 MICS7 主力区域)、南亚、中东欧与中亚(UNECE 区域累计 59 次调查)、中东与北非、东亚太平洋与拉美加勒比。典型长期参与国:塞尔维亚(含罗姆人聚居区亚调查)、土库曼斯坦、吉尔吉斯斯坦、北马其顿。空间分辨率:公开微数据仅含区域级标识;更细地理信息(GPS)不在公开文件中。城市/农村口径为各国自定义(人口规模或基础设施标准),跨国不可直接比较。
§3.9 采集设备与平台
| 环节 | 设备/软件 | 说明 |
|---|---|---|
| 数据采集 | 纸质问卷 或 平板/PDA(CSPro CAPI) | 两条路线均受支持;外业期间均可产出 field check tables |
| 数据录入/检查 | CSPro | 结构检查 + 一致性检查 |
| 数据处理 | SPSS + Power BI | 官方三件套(CSPro/Power BI/SPSS);二访编辑含结构与一致性检查,不做插补 |
| 制表与发布 | Excel 制表计划 + SPSS 语法 | 官方表格唯一权威实现 |
| 在线分析 | MICS Tabulator(R/Python 模块化架构) | 协调化数据实时制表,支持自写代码的进阶用户 |
采集设备的演进值得注意:早期轮次以纸质问卷 + CSPro 事后录入为主,录入与外业并行(同期双录入校验)是官方质量控制的关键一环;平板/PDA 直接采集(CAPI)逐步普及后,跳转逻辑前置到设备端,配合外业期间实时 field check tables(巴基斯坦已把该流程自动化为可视化仪表盘,并将成为 MICS 调查的常态),系统性采集误差在外业现场即可发现并纠正。对数据使用者,这意味着近期轮次的结构性错误(跳转越界、编码越界)显著少于早期轮次——但早期轮次数据因此更需要先查官方数据质量表再用。
§3.10 深度溯源链
UNICEF 全球 MICS 团队(工具包、工作坊、技术协作框架)
└─→ 各国国家统计局 NSO(抽样设计、培训、外业采集)
└─→ CSPro 录入/CAPI + field check tables(外业质量控制)
└─→ 二访编辑:结构 + 一致性检查(无插补)
└─→ 匿名化:删除姓名/地址/细粒度地理标识
└─→ 国家级发布(报告 + 统计快照 + 数据质量表)
└─→ UNICEF 审核 + 2-3 个月后公开微数据(mics.unicef.org)
└─→ IPUMS MICS 协调化 / MICS Tabulator 在线化
§4 数据结构
§4.0 目录树
典型 MICS 调查数据包解压后布局(示意,按国家/调查略有差异):
{国家}_{年份}_MICS/ ← data_root 指向这里
├── Datasets/ ← 微数据(SPSS .sav,仅含该国启用的文件类型)
│ ├── {cc}_{yyyy}_MICS_household.sav ← HH:每户一行(含权重 hhweight)
│ ├── {cc}_{yyyy}_MICS_hl.sav ← HL:家庭成员名单(合并的枢纽)
│ ├── {cc}_{yyyy}_MICS_wm.sav ← WM:15-49 岁女性
│ ├── {cc}_{yyyy}_MICS_mn.sav ← MN:15-49 岁男性(视国家)
│ ├── {cc}_{yyyy}_MICS_bh.sav ← BH:生育史(视国家)
│ ├── {cc}_{yyyy}_MICS_ch.sav ← CH:5 岁以下儿童
│ ├── {cc}_{yyyy}_MICS_fs.sav ← FS:5-17 岁儿童
│ ├── {cc}_{yyyy}_MICS_itn.sav ← ITN:处理蚊帐(疟疾流行国)
│ ├── {cc}_{yyyy}_MICS_wq.sav ← WQ:水质检测(MICS6 起)
│ └── {cc}_{yyyy}_MICS_mortality.sav ← 孕产妇死亡率/FGM 等模块文件(视国家)
├── SPSS syntax/ ← 官方标准表格语法(复现报告用)
├── Questionnaires/ ← 问卷(英语 + 本地语言)
├── Data dictionary/ ← 变量级数据字典
└── {国家} MICS {年份} Survey Findings Report.pdf ← 最终报告(含数据质量表附录)
§4.1 DAIMS 字段字典
核心标识与权重字段(各数据文件通用骨架;指标变量请以各国数据字典与官方语法为准):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| HH1 | Integer | 簇编号(匿名) | 34 | 抽样层级/分组 CV/聚类稳健 SE | 无(匿名化序号) | 无 | 1-999 |
| HH2 | Integer | 户编号(匿名) | 12 | 户级合并键(与 HH1 联用) | 无 | 无 | 1-99 |
| LN | Integer | 家庭成员行号 | 3 | 个体合并键(HL↔WM↔CH) | 无 | 无 | 1-30+ |
| hhweight | Float | 户权重(归一化:加权户数=未加权户数) | 312.45 | 一切估计必须加权 | 无响应/过抽样校正引入 | 无 | >0 |
| WM/CH 权重 | Float | 女性/儿童文件各自权重(如 wmweight/chweight 家族) | 288.7 | 分文件加权估计 | 同上 | 无 | >0 |
| HL 背景(教育/年龄/性别等家族) | Mixed | 成员名单背景变量(逐题编码) | edulv=2 | 人口学协变量、公平性分层 | 访问员/应答者错报(年龄堆积) | 9/99/999 系列=Missing;8/98/888=Don’t know | 视变量定义 |
| CH 人体测量家族 | Float | 身高/体重/年龄 z 值派生变量 | haz=-2.1 | 营养不良分类标签 | 测量误差(儿童身高测量) | 特定缺失码 | z 值 ±6(官方清理界值) |
| 派生指标家族(免疫/ECD/管教等) | Integer/Categorical | 官方语法按指标算法生成 | impw=1(麻疹免疫=是) | 监督学习标签 | 母亲回忆偏倚(卡类回忆等) | 沿用 8/9 惯例 | 0/1 或多分类 |
§4.2 标签分布
MICS 的"标签"即派生指标,其分布有三个结构性特征:分母由年龄组决定——如免疫覆盖按 24-35 月龄口径计算、营养指标按 0-59 月龄,导致同一文件内不同标签的有效样本量差异极大;类别不平衡普遍——覆盖率类指标(如全程免疫、清洁燃料使用)在多数国家呈偏态分布,罕见结局(如严重消瘦)标签占比常低于 5%,建模时需按国/簇分层采样或用加权损失;跨轮分布漂移真实存在——指标定义与问卷措辞随轮次更新(如 MICS6 新增 5-17 岁问卷),同一指标在 MICS5 与 MICS6 间的分母口径可能不同。使用官方语法的派生变量可保证标签与国家报告数字一致;自建标签务必在论文中给出与官方口径的对照表。
§4.2b 标签分布体检代码
# =============================================================
# 标签分布体检:分母规模 / 类别不平衡 / DK 占比 三项快查
# 输入: analysis_ready.parquet(§6.3 产物)
# =============================================================
import pandas as pd, numpy as np
df = pd.read_parquet("analysis_ready.parquet")
label = "stunted" # 目标派生指标(示例)
# 1) 分母规模: 按 MICS 官方 universe(营养指标 0-59 月龄)过滤
elig = df[(df["age_mos"] >= 0) & (df["age_mos"] < 60) & (df["done"] == 1)]
print("合格分母 n =", len(elig)) # 与官方报告合格样本数核对
# 2) 类别不平衡: 加权患病率 + 未加权标签计数
print("加权患病率 =", np.average(elig[label], weights=elig["w"]))
print(elig[label].value_counts(normalize=True)) # <5% 罕见类需加权损失/分层采样
# 3) DK 占比: 8 系列编码单独统计(信息性缺失信号)
dk = (df[label.replace("stunted", "raw_item")] == 8).mean()
print("Don't know 占比 =", round(dk, 3))
§4.3 关键统计
- 418 次调查 / 123 个国家(截至 2025-10,UNICEF 官方口径);UNECE 区域累计 59 次。
- 7 轮(MICS1 1995 → MICS7 2023 起);MICS4 起三年一轮。
- 200 项 MICS6 标准指标(计性别分层 237 项);MICS5 为 166 项。
- 33 项 SDG 指标由 MICS 监测(11 个 SDG 目标下);231 项 SDG 指标中 80 项可用住户调查测量。
- 10 类微数据文件(全模块调查);6 种模型问卷(MICS6)。
- IPUMS MICS:94 国、237 个样本、2,000+ 协调变量、1,800 万 个人记录;样本均值 12,000 户 / 58,000 人。
- 约 80% IPUMS 样本为全国代表性;结果发布平均 12 个月(目标 6 个月)。
- 典型全国样本约 10,000 户(IPUMS 收录样本范围 700-103,000 户);每簇推荐 15-30 户。
§4.4 数据层级
调查(国家 × 轮次,study ID 如 LAO_2006_MICS_v01_M)
└── 簇(cluster,HH1)
└── 户(household,HH2,权重 hhweight)
├── 全体成员(HL,行号 LN)
│ ├── 女性 15-49(WM,LN 关联)
│ │ └── 生育史(BH,每活产一行)
│ └── 男性 15-49(MN,LN 关联)
├── 5 岁以下儿童(CH,UF1=儿童行号,经母亲 LN 关联)
└── 5-17 岁儿童(FS,每户随机 1 名)
层级合并规则:所有文件可经 HH1 + HH2(+ 行号)相互关联(官方有专门的文件合并指南文档);CH 文件的儿童记录通过母亲 LN 挂接到 WM 记录,母亲不在户时挂接到照护者应答记录——该规则确保不在籍儿童也有完整数据。
跨文件合并关系表(实现 §6.3 流水线前必读):
| 关系 | 连接键 | 方向与基数 | 常见错误 |
|---|---|---|---|
| HL ↔ HH | HH1 + HH2 | 多对一(成员→户) | 忘带 hhweight 导致后续估计丢失权重 |
| WM ↔ HL | HH1 + HH2 + LN(女性本人行号) | 多对一 | 只用 HH1+HH2 造成笛卡尔积式膨胀 |
| CH ↔ WM | HH1 + HH2 + 母亲行号 | 多对一(儿童→母亲) | 母亲不在户时需走照护者路径,硬 join 丢样本 |
| CH ↔ HH | HH1 + HH2 | 多对一(儿童→户特征) | 户级特征在 CH 内复制多行,回归需聚类 SE |
| BH ↔ WM | HH1 + HH2 + 母亲行号 | 一对多(每位女性多活产行) | 把 BH 行当独立个体计数 |
§4.5 缺失值与信息性缺失编码
| 情形 | 编码/处理 | 含义与风险 |
|---|---|---|
| 应答者"不知道" | 8(或 98/888 等 8 系列码) | Don’t know 是真实响应,不应并入"否"(官方指标算法对 DK 的处理因指标而异) |
| 缺失/不适用 | 9(或 99/999 等 9 系列码) | Missing/NA;多由 universe 跳转产生(如男性不应答女性题) |
| 个体未完成访谈 | 不进入对应文件或无完成标记 | 复现官方表格必须只用完成访谈案例——直接用全体记录会稀释分母 |
| 权重缺失/为零 | 极少数记录权重异常 | 先核对抽样文件版本再建模;不要自行补权重 |
| 微数据无插补 | 官方不插补任何值 | 缺失模式原样保留;多重插补等处理由研究者自担且须声明 |
| 敏感题拒答 | 局部缺失码 | 可能与暴露本身相关(信息性缺失),如 FGM/暴力模块 |
信息性缺失警示:敏感模块(童婚、管教、FGM)的缺失并非随机——拒绝回答本身可能与经历相关;DK 高比例也常出现在 immunization 卡类回忆上(母亲不在场时)。对 AI 建模,建议将"缺失指示变量"与原变量并行保留,并在 §7.1 偏倚框架下报告缺失敏感性分析。
§5 划分与使用建议
§5.1 官方划分
MICS 不存在"训练/验证/测试划分"——它是统计调查而非 ML 基准集。官方口径的"划分"只有两个:按国家 × 轮次的独立调查(study ID),以及调查内部按抽样设计的分层/簇结构(用于方差估计与加权)。任何估计都应在调查内部、按官方权重进行;把多调查拼成单一"训练集"不属于官方支持的使用方式。
§5.2 社区惯例划分
- 跨国 pooled 研究:以 IPUMS MICS 协调矩阵为基础,按国家(或国家 × 轮次)做分组切分——绝不允许同一样本中的同簇/同户记录跨训练/测试两侧。
- 单国建模:按簇(HH1)分组切分(GroupKFold by cluster),保留城乡/区域分层比例。
- 时间外推评估:用早轮(如 MICS5)训练、晚轮(MICS6)同国测试,检验模型跨轮稳健性——这是最接近"泛化"的社区做法。
- 留一国评估:pooled 研究中把一国整体留出做测试,模拟"模型部署到新国家"的真实场景。
- 敏感模块单列:FGM/暴力/管教等敏感模块样本与缺答模式特殊,社区惯例是单建模型或单独报告,不与健康指标混训。
- 小区域估计:训练/评估以全国估计为锚,区县级估计靠模型收缩,不设独立测试集(评估用设计效应与后验校准)。
§5.3 泄漏风险(重点)
⚠️ MICS 的最大泄漏源是抽样结构:同一簇/户的成员共享环境、水卫生与经济社会特征,随机行级切分会把"同一个家"拆进训练与测试两侧,使指标虚高。其次是跨轮次同国数据:相邻轮次抽样框重叠,MICS5 训练 + MICS6 测试仍可能高估泛化。第三是标签构造泄漏:派生指标的分母 universe 变量(年龄组、完成访谈标记)若作为特征进入模型,等于把答案泄露给模型。防御措施见 §6.5 坑点 1 与坑点 5。
§5.4 交叉验证建议
推荐按簇分组的分层 5 折 CV:分组键 = 国家 × 轮次 × HH1;分层键 = 城乡 × 目标标签分位。报告每折的加权指标(用各折真实权重重算)而非合并混淆矩阵。跨国 pooled 模型可加"留一国"(leave-one-country-out)折,专门度量国家间迁移能力——这是 MICS 类数据最诚实的泛化指标。
§5.5 外部验证建议
- 对官方数字校准:模型加权估计必须与该国官方报告表格对齐(容差通常应在小数点级),对不齐先查权重/分母/缺失处理三件事(§6.5 坑点 8)。
- 跨数据源三角验证:与 DHS(工具协调、口径可比)及人口普查/行政数据做指标级一致性检查;DHS 项目 2025-02 终止后,其 40 余年历史档案仍是重要对照源。
- 跨 IPUMS/原始文件一致性:IPUMS MICS 与原始 MICS 编码不同(IPUMS 重编码),切勿把 IPUMS 训练的模型直接套在原始 .sav 特征上,必须做特征映射后再验证。
- 跨模态对齐验证:问卷派生指标与水质检测、人体测量等物理测量结果的交叉核对(如自报水处理行为 vs 实验室检测),暴露自报偏倚并为多模态建模提供校准点。
§6 AI 就绪指南
§6.0 云端快速启动
MICS 无专属云端镜像,但包体小、纯结构化数据,任何免费云端环境都能跑通:
| 环境 | 适配度 | 要点 |
|---|---|---|
| Google Colab | ★★★★★ | pip install pyreadstat 即可读 .sav;单调查包数十 MB,直接上传或挂载网盘 |
| Kaggle Notebooks | ★★★★☆ | 可搜索社区上传的单国 MICS 数据集(注意核对来源与轮次,避免用非官方再分发版) |
| 本地 Jupyter | ★★★★★ | 推荐:注册下载后离线分析,网络依赖最少 |
| Databricks/EMR 等大数仓 | ★★★☆☆ | 仅 pooled 全库(数百国次 .sav 合并)时值得,单国分析用牛刀 |
最小云端验证路径:注册 MICS 账号 → 下载任一 MICS6 “Available” 状态国数据包 → Colab 读 HH + CH 两个 .sav → 用官方权重算一个儿童指标 → 与官方报告表格核对(见 §6.1)。
注册与下载避坑:注册时研究目的描述要具体(“复算该国免疫覆盖指标"优于"数据分析”),可缩短开通等待;下载前先看数据集状态语义——Available 才能下,Not yet available 意味着报告刚出、数据未到,Restricted 则实施机构不允许共享,不要浪费时间尝试;账号一次注册全库通用,建议顺手把目标国的多轮数据包一起下载,避免后续重复等待。
§6.1 快速上手
代码块前的关键约定:
- 目录结构预期:
data_root指向解压后的调查包根目录(见 §4.0 目录树);文件名模式为{cc}_{yyyy}_MICS_{filetype}.sav,实际后缀以各国包内为准。 - data_root 拼接关系:所有路径用
os.path.join(data_root, "Datasets", ...)拼接,不要硬编码绝对路径。 - 最小可用子集:
household.sav(HH)+ch.sav(5 岁以下儿童)即可完成"读数据 → 合并 → 加权估计"全流程。
# =============================================================
# MICS 最小分析路径:读取 → 合并 → 加权估计
# 依赖: pip install pyreadstat pandas numpy
# data_root 指向解压后的调查包根目录(§4.0 目录树)
# 最小可用子集: household.sav + ch.sav(5 岁以下儿童文件)
# =============================================================
import pyreadstat
import pandas as pd
DATA_ROOT = "data/mics/NOT_2017_MICS" # 示例:替换为你的国家包
DS = f"{DATA_ROOT}/Datasets"
# 1) 读取户文件与儿童文件(SPSS .sav)
hh, hh_meta = pyreadstat.read_sav(f"{DS}/NOT_2017_MICS_household.sav")
ch, ch_meta = pyreadstat.read_sav(f"{DS}/NOT_2017_MICS_ch.sav")
# 2) 户级权重是全部估计的前提(MICS 非自加权设计)
print(hh["hhweight"].describe()) # 权重分布体检
print("加权户数 =", hh["hhweight"].sum(), # 归一化检查:加权总数≈未加权总数
"未加权户数 =", len(hh))
# 3) 经 HL 名单把儿童挂到户(合并键 HH1+HH2;儿童行号见 ch 文件说明)
hl, _ = pyreadstat.read_sav(f"{DS}/NOT_2017_MICS_hl.sav")
keys = ["HH1", "HH2"] # 簇号 + 户号 = 匿名合并键
ch_hh = ch.merge(hh[keys + ["hhweight"]], on=keys, how="left")
# 4) 加权示例:城乡分布(先验检查,不是指标)
urb = ch_hh.groupby("HH7")["hhweight"].sum() / ch_hh["hhweight"].sum()
print(urb) # HH7=城乡标识(变量名以各国字典为准)
# 5) 复现官方指标的正确姿势:直接运行官方 SPSS 语法/制表计划,
# 或核对 pyreadstat 读出的派生变量是否与官方报告表格一致。
# 自算指标时:只用完成访谈案例 + 正确 universe(年龄组)+ 官方缺失码处理。
§6.2 数据获取
| 步骤 | 操作 | 说明 |
|---|---|---|
| 1 | 访问 Surveys/Datasets 页 | 按国家/轮次/状态筛选;状态 Available 才能下载 |
| 2 | 点击数据集 → 注册 MICS 数据用户 | 需姓名、机构、研究目的简述;仅限合法研究用途 |
| 3 | 登录后 1-2 天内开通全部调查下载 | 一次注册,全库访问 |
| 4 | 下载 .zip 数据包(SPSS .sav) | 仅 SPSS 格式;附问卷、字典、语法、报告 |
| 5 | (替代)IPUMS MICS 提取 | 94 国协调变量、免费,注册流程类似 |
| 6 | (替代)MICS Tabulator 在线分析 | 免下载,导出 Excel/PDF/RTF |
IPUMS MICS 提取路径(跨国研究推荐):
# =============================================================
# IPUMS MICS 使用路径(无需本地 .sav,直接拿协调化提取包)
# 网页操作: mics.ipums.org → Create Account → Select Data Samples
# → 勾选变量 → Create Extract → 邮件通知后下载
# 提取包形态: .dat 固定宽文本 + .xml DDI 字典 + .do/.sps/.R 读取脚本
# =============================================================
import pandas as pd
# 读取 Stata 格式提取包(官网推荐 Stata Only 一键选项可直接出 .dta)
df = pd.read_stata("ipums_mics_extract_0001.dta")
print(df[["COUNTRY", "YEAR", "PERNUM", "AGE", "SEX"]].head())
# 要点:
# 1) 提取包变量名为 IPUMS 统一码(如 HHID/PERNUM/EDUCCAT*),跨时空一致
# 2) 不要把 IPUMS 编码与原始 MICS .sav 编码混用(§6.5 坑点 3)
# 3) 比较研究引用 Bolgrien et al. 2025 + IPUMS MICS(§9.3 引用指南)
约束提醒:禁止再分发或出售;须向 UNICEF 与实施调查的政府伙伴回传基于数据的报告/出版物副本;数据集状态为 Restricted 的调查不可获取,Not available 表示 MICS 团队无可公开副本。
§6.3 预处理全流程
从 .sav 到模型就绪矩阵的四步流水线(格式转换 → 合并/清洗 → 权重与标准化 → 标签构造):
# =============================================================
# MICS 预处理流水线:.sav → 建模就绪 Parquet
# 输入: 调查包 Datasets/ 下的 .sav 文件(§4.0 目录树)
# 输出: analysis_ready.parquet(户/个体级 + 权重 + 标签)
# 关键原则: 只用完成访谈记录;DK/missing 重码;权重随行保留
# =============================================================
import pyreadstat, pandas as pd, numpy as np
DS, CC, YY = "data/mics/NOT_2017_MICS/Datasets", "NOT", 2017
def load(name):
df, meta = pyreadstat.read_sav(f"{DS}/{CC}_{YY}_MICS_{name}.sav")
return df
# --- 第 1 步:格式转换(.sav → pandas/Parquet)---------------
hh, hl, ch = load("household"), load("hl"), load("ch")
# --- 第 2 步:合并 + 清洗 --------------------------------------
# 匿名合并键:簇 HH1 + 户 HH2(+ 行号 LN/UF1)
hh_keys = ["HH1", "HH2"]
ch_full = (ch.merge(hl[hh_keys + ["HL4", "HL5"]], # HL4/HL5=名单年龄/性别(示例列名)
on=hh_keys + ["UF1"], how="left") # UF1=儿童行号(变量名以字典为准)
.merge(hh[hh_keys + ["hhweight", "HH6", "HH7"]],
on=hh_keys, how="left"))
# --- 第 3 步:缺失与缺失码标准化 ------------------------------
# MICS 惯例:8 系列=Don't know,9 系列=Missing/NA(含 98/888、99/999 等)
def recode_specials(s: pd.Series) -> pd.Series:
return s.mask(s.isin([8, 98, 888]) , np.nan) \
.mask(s.isin([9, 99, 999]), np.nan) # DK 与 missing 分列保留更佳
# --- 第 4 步:标签构造(示例:官方派生变量优先)--------------
# 优先使用官方语法生成的派生变量列(数值含义=指标算法);
# 自算标签必须: ① 限定官方 universe(如 24-35 月龄免疫口径)
# ② 仅用完成访谈记录 ③ 与官方报告表格核对
ch_full["w"] = ch_full["hhweight"] # 权重列随行携带
ch_full.to_parquet("analysis_ready.parquet") # Parquet: 类型稳定、跨语言
指标复算示例(全程免疫覆盖,官方口径演示):
# =============================================================
# 官方口径复算示例:12-23 月龄儿童麻疹疫苗(MCV)覆盖率
# 口径三件套(§6.5 坑点 8): ① 官方 universe(年龄分组)
# ② 完成访谈记录 ③ DK/缺失按官方码表处理
# 注意: 官方派生变量优先——如 ch 文件已有官方 MCV 派生列则直接使用
# =============================================================
import pandas as pd, numpy as np
ch = pd.read_parquet("analysis_ready.parquet") # §6.3 流水线产物
# ① 官方 universe: 免疫接种指标按 12-23 月龄(国家报告口径分档之一)
age_mos = ch["cage"] # 月龄变量(名称以字典为准)
mask_age = (age_mos >= 12) & (age_mos <= 23)
# ② 仅完成访谈: CH 文件中完成访谈标记(变量名以字典为准)
mask_done = ch["UF20"] == 1 # UF20=完成访谈标记(示例列名)
# ③ 麻疹疫苗指标: 官方派生列(卡/回忆合并口径),DK(8)/Missing(9) 不计入分母
mcv = ch.loc[mask_age & mask_done, "imsmc"] # 官方 MCV 派生变量(示例列名)
mcv = mcv[mcv.isin([1, 2])] # 1=是, 2=否; 8/9 剔除
y = (mcv == 1).astype(float)
w = ch.loc[mcv.index, "w"] # 儿童权重列
coverage = np.average(y, weights=w)
se = np.sqrt(np.average((y - coverage)**2, weights=w) / len(mcv))
print(f"加权 MCV 覆盖率 = {coverage:.1%} (SE≈{se:.1%})")
# 收尾核对: 与该国官方报告对应表格对照,容差应为小数点级
缺失处理决策表(每个变量过一遍再进模型):
| 变量情形 | 推荐处理 | 理由 |
|---|---|---|
| 官方派生指标列 | 原样使用 + universe 过滤 | 与官方口径一致,可对账 |
| 原始题项 + DK 占比 < 5% | 8 系列并入"否"或按官方语法 | 影响可忽略时追求简单 |
| 原始题项 + DK 占比高(如免疫卡回忆) | DK 单列保留(x + x_dk) | DK 本身有信息(母亲未见过卡) |
| 敏感模块拒答 | 保留缺失指示位 + 敏感性分析 | 缺失可能与暴露相关(信息性) |
| universe 外缺失(跳转产生) | 不算缺失,剔除出分母 | 结构性缺失非数据问题 |
| 复现官方表格场景 | 严格按官方语法逐行对齐 | 任何自由处理都会破坏对账 |
工程建议:全部特征与标签落 Parquet/Feather(避免反复解析 .sav);把 DK 与 Missing 拆成两列(x + x_dk 指示位),保留信息性缺失信号;每个国家 × 轮次单独跑流水线,输出带 study ID 的中间表,供 pooled 时追溯。
§6.4 PyTorch DataLoader 完整代码
# =============================================================
# MICS 表格数据 PyTorch DataLoader(Tabular Dataset 模板)
# 输入: §6.3 产出的 analysis_ready.parquet(含特征列/标签列/权重列)
# 设计: 按簇分组切分防泄漏(§5.3);样本权重用于加权损失
# =============================================================
import torch
from torch.utils.data import Dataset, DataLoader
import pandas as pd, numpy as np
FEATURES = ["w_age", "w_edu", "h_food", "h_water", "asset_idx"] # 示例特征列
LABEL = "stunted" # 0/1 标签(官方派生或自算并与官方口径核对)
WEIGHT = "w" # 调查权重列(hhweight)
GROUP = "cluster" # 簇 ID(HH1),分组切分键
class MicsDataset(Dataset):
"""MICS 表格数据集:特征 + 标签 + 调查权重三元组。"""
def __init__(self, df: pd.DataFrame,
feats=FEATURES, label=LABEL, weight=WEIGHT):
self.X = torch.tensor(df[feats].to_numpy(np.float32))
self.y = torch.tensor(df[label].to_numpy(np.float32))
self.w = torch.tensor(df[weight].to_numpy(np.float32))
def __len__(self):
return len(self.y)
def __getitem__(self, i):
return self.X[i], self.y[i], self.w[i]
def weighted_bce(logits, y, w):
"""调查加权二元交叉熵:让加权估计与官方口径一致。"""
loss = torch.nn.functional.binary_cross_entropy_with_logits(
logits, y, reduction="none")
return (loss * w).sum() / w.sum()
# --- 按簇分组切分(防同簇泄漏)--------------------------------
df = pd.read_parquet("analysis_ready.parquet")
clusters = df[GROUP].unique()
rng = np.random.default_rng(42)
test_clusters = set(rng.choice(clusters, size=max(1, len(clusters)//5),
replace=False))
is_test = df[GROUP].isin(test_clusters)
tr, te = MicsDataset(df[~is_test]), MicsDataset(df[is_test])
train_loader = DataLoader(tr, batch_size=1024, shuffle=True, num_workers=2)
test_loader = DataLoader(te, batch_size=4096, shuffle=False, num_workers=2)
# --- 最小训练循环 ---------------------------------------------
model = torch.nn.Linear(len(FEATURES), 1)
opt = torch.optim.Adam(model.parameters(), lr=1e-3)
for epoch in range(5):
for X, y, w in train_loader:
opt.zero_grad()
loss = weighted_bce(model(X).squeeze(-1), y, w)
loss.backward()
opt.step()
print("test weighted loss:",
sum(weighted_bce(model(X).squeeze(-1), y, w).item()
for X, y, w in test_loader))
§6.5 坑点 8 个
⚠️ 坑点 1:忘加权或误加权——非自加权设计下估计全面偏移(分类:评估误用)
问题:MICS 样本非自加权:城市/有儿童家庭常被过抽样,无响应由权重校正;不加权直接统计会把城市样本放大数倍,所有率值系统性偏移。
症状:自己算的免疫覆盖、贫困率与官方报告差出几个百分点;城乡分布与普查明显不符;论文审稿人指出"未使用设计权重"。
解决:
- 简单方法:任何分组统计都乘
hhweight(或对应文件的 wmweight/chweight 家族)再加权平均,groupby后先sum(weight)再相除。- 进阶方法:用调查加权回归(如 R
survey包 / Pythonstatsmodels的加权 GLM),方差按簇聚类校正(设计效应 deff),报告置信区间而非裸点估计。- SOTA 方法:复现官方数字时使用官方 SPSS 语法 + 制表计划原样运行;机器学习场景在损失函数中引入样本权重(§6.4
weighted_bce),并做 deff 诊断。
参考:PLOS Medicine(DHS/MICS 测量系列);Sociological Science/medRxiv 镜像:MICS 交付稳健数据
⚠️ 坑点 2:儿童年龄错报——分母 universe 静态错位(分类:标签理解)
问题:年龄是大多数 MICS 指标的分母(免疫 24-35 月龄、营养 0-59 月龄),但年龄错报普遍:死亡年龄报告向 12 月龄堆积,访问员还可能把儿童"转移"到 5 岁以上年龄组以缩短访谈。
症状:年龄单变量直方图在 12、24、60 月龄出现尖峰(heaping);5 岁以下合格儿童数低于预期;免疫覆盖与营养指标随年龄口径剧烈波动。
解决:
- 简单方法:画年龄/死亡年龄分布图查堆积;用官方报告的合格样本数核对自己的分母计数。
- 进阶方法:用出生日期(如可用)与访问日期重算精确月龄替代访问员记录年龄;对堆积窗口做敏感性分析(±1 月龄扰动下指标稳定性)。
- SOTA 方法:参考官方数据质量表(报告附录 D 类表格)中的年龄堆积与完整性指标,量化后再决定是否纳入该调查;跨国 pooled 时按质量表筛样本。
参考:PLOS Medicine 测量系列;世界银行 Microdata:MICS 报告数据质量表
⚠️ 坑点 3:跨国 pooling 城乡口径与题目国别化差异(分类:偏倚陷阱)
问题:城市/农村定义因国而异(人口规模或基础设施口径),题目本地化(如腹泻处置的"政府推荐家庭液"类别未按国更新)使同一变量在不同国家含义不同;直接 pool 原始 .sav 会把这些差异当作"信号"学进模型。
症状: pooled 模型中国家哑变量系数巨大;同一特征(如"农村")在不同国家子样本上效应方向相反;跨国外部验证性能骤降。
解决:
- 简单方法:pool 前逐变量做国家分布对比表,把国别化类别映射到统一码本,映射不了就丢特征。
- 进阶方法:改用 IPUMS MICS 协调变量(编码跨时空统一、附每个变量的可比性说明),并在国家内做标准化(组内 z 值)。
- SOTA 方法:分层建模(国家随机效应)+ 留一国验证(§5.4);把不可比维度显式建模为组效应而非全局特征。
参考:2024 PLoS ONE:42 国 MICS 分析(城乡口径警示);IPUMS MICS FAQ:编码差异
⚠️ 坑点 4:跨轮次指标定义漂移——两轮数字不可直接连线(分类:预处理陷阱)
问题:指标定义、问卷措辞与分母口径随轮次演化(MICS5→6 新增 5-17 岁问卷、水质问卷;免疫与死因口径多次修订);把不同轮次同指标数字直接拼成趋势线,可能把"定义变化"画成"健康变化"。
症状:趋势图中某指标在某轮出现无法解释的跳变;两轮 pooled 模型中"轮次哑变量"比任何真实协变量都强;与官方趋势报告对不上。
解决:
- 简单方法:先读每轮工具包的指标定义变更说明,只对定义未变的指标画趋势。
- 进阶方法:用官方重新发布的可比序列(官方常在报告中做跨轮可比性说明),或在轮次交界处做断点敏感性分析。
- SOTA 方法:对必须跨轮的指标,用 IPUMS MICS(其协调文档逐变量标注了跨轮可比性与 universe 变化)。
参考:PLOS Medicine:覆盖率趋势比较陷阱;IPUMS MICS
⚠️ 坑点 5:文件合并键与样本框错误——分母悄悄膨胀或坍缩(分类:工程陷阱)
问题:10 类文件靠簇号+户号+行号关联(如 CH↔WM 经母亲行号、母亲不在户时经照护者);合并键用错(只用户号、忽略行号)或忘记限定"完成访谈",会让分母虚增或丢失无母亲儿童。
症状:合并后行数 ≠ 官方合格样本数;5 岁以下样本量比官方报告少一大截;指标重复计算(户级变量 join 后复制多行)。
解决:
- 简单方法:每步合并后做行数断言(合并前行数、键唯一性检查);CH 合并先 WM 后 HL。
- 进阶方法:按官方《Guidelines for Merging Data Files of a MICS Survey》文档逐步操作;只用完成访谈记录(官方表格口径)。
- SOTA 方法:把合并流水线固化为带断言的脚本(§6.3),每个国家包跑完输出合并审计表(各文件行数、匹配率)。
参考:官方 Surveys/Datasets FAQ(合并指南与完成访谈口径);medRxiv 镜像:文件关联与匿名标识符
⚠️ 坑点 6:Don’t know 与 missing 混为一谈——指标口径隐性漂移(分类:预处理陷阱)
问题:MICS 用 8 系列编码 Don’t know、9 系列编码 Missing/NA;两者语义不同且官方各指标处理不一(有的把 DK 归"否"、有的剔除)。研究者一律
dropna或一律填 0,都会让指标与官方口径系统性偏离。
症状:复算指标与官方报告差值在不同指标间方向不一致;DK 高发变量(如免疫卡类回忆)上模型特征分布异常;敏感性分析结果不稳。
解决:
- 简单方法:重码前查该国数据字典中该变量的码表;把 8 系与 9 系分列保留(
x+x_dk)。- 进阶方法:按官方语法逐指标对齐 DK 处理;对高 DK 变量做"DK 作为独立类别"建模。
- SOTA 方法:多重插补(敏感性分析框架下)+ 缺失机制审计(对敏感模块检查缺失是否与暴露相关,即信息性缺失)。
参考:2024 PLoS ONE(DK/缺失剔除口径示例);medRxiv 镜像:无插补原则
⚠️ 坑点 7:拿"MICS-type"或"DHS-MICS"当 MICS——来源身份误认(分类:工程陷阱)
问题:MICS 工具可被任何调查自由使用;用 MICS 问卷但无 MICS 团队技术支持的"MICS-type"调查不在官方调查列表;个别 DHS 调查嵌入 MICS 模块被标为"DHS-MICS"。把这些当 MICS 官方数据引用/下载会张冠李戴。
症状:在官方 Surveys 页搜不到你手里的"某国 MICS";文档自称 MICS 但无官方数据字典与语法;引用格式对不上 study ID 体系。
解决:
- 简单方法:以官方 Surveys 页列表为唯一身份判定:列表内=全球 MICS 项目调查。
- 进阶方法:核对 study ID(如
LAO_2006_MICS_v01_M)、官方数据字典与语法是否配套;DHS-MICS 联合调查按主调查程序归属引用。- SOTA 方法:数据溯源写入分析代码注释(study ID + 下载日期 + 状态),pooled 研究对每个样本附身份审计。
参考:官方 FAQ:MICS-type 与 DHS-MICS 说明
⚠️ 坑点 8:复现官方表格对不上——三处口径差叠加(分类:评估误用)
问题:官方数字 = 官方权重 × 官方 universe(分母)× 官方缺失处理;研究者常在任一处偏离(全体记录 vs 完成访谈、自算年龄分母、dropna 策略),复算结果对不上官方报告后误以为"数据有错"。
症状:与官方表格差 1-5 个百分点且方向不定;区域层面差异大于全国层面;同一指标在不同国家的偏差方向不一致。
解决:
- 简单方法:先跑官方 SPSS 语法直接对照官方表,排除环境问题;再逐项检查权重列、分母 age group、DK/missing 三件套。
- 进阶方法:写"口径审计清单"(权重来源列名、universe 条件、缺失码表),每指标一行,逐一打勾对齐。
- SOTA 方法:用 MICS Tabulator 在线复算同指标做第三方核对(其参数化口径设置可显式复现你的选择),定位偏差来自哪一环。
参考:官方语法与工具页;MICS Tabulator(UNESCAP 介绍材料)
§6.6 数据增强
调查数据不是图像/文本,"增强"要极其克制:
- ✅ 安全:调查加权重采样(按分层×簇,保持设计结构);多重插补生成 m 个分析数据集(合并结果按 Rubin 规则);聚类稳健的 bootstrap(按簇重抽,估计方差)。
- ❌ 危险:对个体行做随机过采样 SMOTE 式合成(破坏抽样权重与簇结构,制造虚假人群);在户/个体间随机交换背景属性(违反联合分布);对敏感属性(婚姻、暴力)做合成(伦理与法律风险)。
- 提示:MICS 文件不插补是官方原则(§4.5);任何合成数据产物必须与真实数据物理隔离并在论文中声明。
- ✅ 可以做的"弱增强":对文本字段(报告 PDF)做同义改写扩充 NLP 训练对(不改数字);对特征做加噪的对抗训练(仅特征侧,标签与权重不动)——两者都不触碰抽样结构。
§6.7 模型推荐表
| 任务 | 推荐模型/方法 | 理由 |
|---|---|---|
| 官方指标复算 | 官方 SPSS 语法(唯一基准) | 与国家报告逐字一致 |
| 率值/回归估计 | 调查加权 GLM(R survey、statsmodels 加权) |
方差按设计校正,CI 可发表 |
| 多指标预测 | 梯度提升树(XGBoost/LightGBM)+ 样本权重 | 表格数据基线强;支持加权损失 |
| 跨国 pooled | 分层模型(国家随机效应)/ 混合效应 | 吸收国别截距差异 |
| 纵向/随访数据 | 固定效应面板模型(MICS Plus 电话随访) | MICS7 新增纵向维度,控制个体异质性 |
| 小区域估计 | 单元/区域级 SAE(Fay-Herriot 类)+ 空间协变量 | SAE 方法学与普查/空间层对接 |
| 大样本 pooled 深度模型 | MLP/TabNet(IPUMS MICS 协调矩阵上) | 1,800 万记录量级才值得上深度模型 |
§6.8 硬件需求表
| 场景 | CPU | 内存 | 存储 | GPU |
|---|---|---|---|---|
| 单国分析(HH+WM+CH) | 4 核 | 8 GB | 1 GB 级 | 不需要 |
| 多国 pooled(IPUMS 提取) | 8 核 | 16-32 GB | 10-50 GB | 可选 |
| 全 IPUMS 矩阵深度学习 | 16 核+ | 64 GB+ | 100 GB 级 | 单卡 24 GB 足够(表格数据) |
§6.9 评估指标代码
# =============================================================
# 调查加权评估指标:加权率、加权 AUROC、设计效应
# 输入: 含 y_true / y_pred / w / cluster 列的 DataFrame
# =============================================================
import numpy as np, pandas as pd
def weighted_rate(df, y="y_true", w="w"):
"""加权率 = Σ(w·y)/Σw —— 与官方指标算法同构。"""
return np.average(df[y], weights=df[w])
def weighted_auc(df, s="y_pred", y="y_true", w="w"):
"""加权 ROC AUC(体素对抽样/加权敏感,勿用无权版本)。"""
from sklearn.metrics import roc_auc_score
return roc_auc_score(df[y], df[s], sample_weight=df[w])
def design_effect(df, y="y_true", w="w", c="cluster"):
"""设计效应 deff = 簇聚类方差 / 简单随机方差;>1 提示按簇建模/报告。"""
p = weighted_rate(df, y, w)
tot = df[w].sum()
gp = df.groupby(c).apply(lambda g: g[w].sum() * (weighted_rate(g, y, w) - p)**2)
var_cluster = gp.sum() / tot**2
var_srs = p * (1 - p) / len(df)
return var_cluster / var_srs
print(weighted_rate(df), weighted_auc(df), design_effect(df))
加权率的标准误与置信区间(设计效应修正版):
# =============================================================
# 加权比例的置信区间:deff 校正的正态近似
# 报告规范: 点估计 ± 1.96 × SE(deff 修正),与官方报告口径对齐
# =============================================================
p = weighted_rate(df, "y_true", "w")
deff = design_effect(df, "y_true", "w", "cluster")
n_eff = df["w"].sum()**2 / ((df["w"]**2).sum()) # 有效样本量
se = np.sqrt(p * (1 - p) / n_eff * deff)
print(f"{p:.3f} [{p - 1.96*se:.3f}, {p + 1.96*se:.3f}] (deff={deff:.2f}, n_eff={n_eff:.0f})")
§6.10 MLOps 笔记
- 数据版本化:以
study ID + 数据包状态 + 下载日期为版本键(如NOT_2017_MICS_v01_M@2026-09-01);MICS 数据会因重新发布而更新,训练结果必须可追溯到具体数据包。 - 重训触发:新轮次发布(如 MICS7 各国陆续出数据)或同 study ID 重新发布时触发重训与再校准;跨国 pooled 模型在新增国家样本后需重估国家间泛化。
- 口径回归测试:把官方指标复算纳入 CI——每次数据或代码变更后自动与官方表格对照(容差阈值),口径漂移当天发现。
- 特征store 对齐:IPUMS MICS 与原始 MICS 编码不同,线上特征管道必须声明数据源版本,禁止混用两套码本(§6.5 坑点 3/坑点 4)。
- 审计留痕:MICS 许可要求回传出版物副本——在 MLOps 元数据里记录"基于该数据版本的产出物清单",便于合规履行义务。
- 特征字典管理:以各国数据字典为准维护特征元数据表(变量名 → 含义 → 轮次可用性),新国家包接入时先跑字典 diff 再进管道。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 非自加权设计偏倚 | 城市/有儿童家庭过抽样,无响应分层差异 | 高(不处理则系统偏移) | 始终使用官方权重;方差按簇校正(坑点 1) |
| 年龄误报/堆积 | 死亡年龄堆积于 12 月龄;访问员将儿童移入 5+ 组减少工作量 | 高(侵蚀分母) | 出生日期重算月龄;官方数据质量表筛查(坑点 2) |
| 回忆偏倚 | 两周患病率、免疫卡缺失时靠母亲回忆 | 中-高(视指标) | 用卡类记录交叉验证;敏感指标加 DK 分析 |
| 社会期望偏倚 | 管教方式、家庭暴力态度、FGM 等敏感题 | 中 | 官方敏感模块测量设计;解释时给区间而非点值 |
| 覆盖缺口 | 游牧、无户籍、机构人群难以进入抽样框 | 中(人群中占比小但最脆弱) | 结果解释限定"居住人口";与普查核对覆盖率 |
| 访问员效应 | 培训与监督强度随国别/轮次差异 | 中 | 官方 field check tables 与质量表;pooled 时按轮次质量控制筛选 |
| 指标口径漂移 | 跨轮次定义/措辞变化 | 高(时间序列) | 只对定义未变指标画趋势;IPUMS 协调(坑点 4) |
| 季节性与访谈时点 | 患病率等指标随访谈季节波动 | 中 | 单国调查外业窗口固定,跨季比较需谨慎;趋势分析锚定同季轮次 |
§7.2 标注质量
MICS 的"标注"= 程序化派生指标(§3.5),其质量由三层机制保障:算法公开——每个指标定义与 SPSS 语法随工具包发布,任何第三方可逐行审计;过程控制——外业 field check tables 实时发现系统性采集误差(巴基斯坦已自动化为仪表盘),二访编辑含结构与一致性检查;结果审计——每份报告附录数据质量表(年龄分布、堆积、完整性、性别比等十余项)。局限在于:派生变量质量依赖原始采集质量(回忆与测量误差不因语法而消失),且官方语法覆盖"标准表格",超出标准表格的自定义指标需自担口径责任。
对 AI 工程师的实操含义:把官方语法视为"黄金标注函数"——训练集标签可以由它确定性生成,也可以在自己实现后与其 diff 调试;两套实现(你的 Python 版与官方 SPSS 版)输出不一致时,优先怀疑 universe 与缺失处理,其次才是算法理解偏差。这种"可对账的标签"在医疗健康数据集中是稀缺属性。
§7.3 泛化性评估表
| 泛化场景 | 失效风险 | 证据与机制 |
|---|---|---|
| 跨国 pooled 模型 | 高 | 城乡口径、题目国别化、文化与报告行为差异(§6.5 坑点 3);需 IPUMS 协调 + 国家组效应 |
| 跨轮次时间外推 | 中-高 | 指标口径漂移 + 真实趋势混杂(坑点 4);建议锚定官方可比序列 |
| 向行政/临床数据迁移 | 高 | 调查自报 ≠ 临床诊断 ≠ 行政记录,构念不同(§2.2/§2.6) |
| 向低行政层级(区县)迁移 | 高 | 样本量对区县级不具代表性,除非该国专门过抽样(PLOS 测量系列) |
| 向未被调查人群外推 | 高 | 游牧/无户籍/机构人群不在抽样框;结果仅代表居住人口 |
| 同国相邻轮次迁移 | 中 | 抽样框部分重叠,性能估计偏乐观(§5.3) |
| 向 MICS Plus 纵向数据迁移 | 待验证 | 电话随访为 MICS7 新能力,与面访口径的衔接尚在累积证据 |
§7.4 伦理与合规
- 知情同意与伦理审批:各国实施机构在采集时遵循知情同意、保密与自愿参与程序,经各国伦理审批流程(IPUMS MICS 文档口径)。
- 匿名化承诺:公开微数据完全匿名——姓名、地址与细粒度地理标识已删除,公开文件不可识别个人或住户;禁止任何再识别尝试,若偶然发现身份应立即报告 UNICEF。
- 许可义务:免费但非无义务——仅限合法研究目的;禁止再分发或出售;须向 UNICEF 与实施政府伙伴回传全部基于数据的报告/出版物;引用须含 study ID 与下载信息(§9.3)。
- 敏感数据:部分调查数据集状态为 Restricted(实施机构不允许共享);GPS 与更细地理数据须直接向国家申请,不得从公开文件复原。
- 二次使用伦理:微数据虽已匿名化,组合多个变量仍可能产生统计再识别风险——对儿童与弱势群体的敏感指标(FGM、暴力、HIV)做子群分析时应报告合并小格,避免可识别的交叉分层。
- 成果回传:向 UNICEF 与实施政府伙伴提交出版物副本既是许可义务,也是让被调查国家受益于二次分析的机制,建议纳入项目合规清单。
§7.5 公平性
MICS 的设计使命即"让最掉队的孩子被看见":分层数据天然支持按财富、城乡、区域、性别、残疾与移民身份的拆分(UNECE 称其拆分能力是衡量"不让任何一个人掉队"原则落实的有力工具;MICS 的残疾与移民模块让相关国家在拆分维度上处于领先)。对 AI 公平性评估,MICS 提供罕见的群体标注(财富五分位、城乡、残疾筛查),可直接用于子群性能审计。公平性局限:亚人群样本量可能不足(少数族裔、游牧人群),且罗姆人聚居区、难民聚居地等专项调查与全国调查的样本框不同,pooling 时需显式区分。
§7.6 数据漂移
三类漂移需要监控:口径漂移——每轮工具包更新模块与指标定义(MICS7 新增心理健康、霸凌、时间使用、融合教育),同一指标跨轮含义可能变化;人群漂移——调查国家集合随轮次扩张/变动(MICS7 主力区域为西非中非与欧亚),pooled 分布随之移动;事件漂移——疫情等冲击造成数据采集中断与行为突变(如轮次间隔拉长)。工程对策:以 study ID 为粒度冻结数据版本,指标层面维护"口径变更日志",模型上线前跑官方口径回归测试(§6.10)。额外的漂移信号源:官方数据质量表中的无响应率与年龄堆积指标随轮次变化,可作为"采集过程漂移"的代理指标纳入监控面板。
§7.7 DAIMS 24 项评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式可用 | ✅ | 每户/每人一行的 .sav 文件,天然宽格式 |
| 2 | 唯一标识 | ✅ | 簇+户+行号构成匿名唯一键(官方合并指南) |
| 3 | 特殊字符处理 | ⚠️ | 变量名为大写缩写(HH1/UF1),含义需查字典;跨轮变量名有变更 |
| 4 | 重复行 | ✅ | 结构化采集与 CSPro 一致性检查保证无重复行 |
| 5 | 缺失编码 | ✅ | 8 系列=DK、9 系列=Missing 的全局惯例 + 字典明示 |
| 6 | 标签标识 | ✅ | 派生指标有官方算法定义与语法实现 |
| 7 | 罕见类分组 | ⚠️ | 罕见结局(严重消瘦等)样本极少;分母年龄组进一步切割 |
| 8 | 偏倚评估 | ✅ | 每份报告附标准数据质量表(堆积/完整性/性别比) |
| 9 | 数据字典 | ✅ | 每调查附变量级数据字典与问卷 |
| 10 | 信息性缺失解释 | ⚠️ | 敏感模块缺失可能与暴露相关;官方不插补,留研究者处理 |
| 11 | 设备记录 | ✅ | 采集方式(纸笔/CAPI)与软件(CSPro/SPSS/Power BI)官方文档明示 |
| 12 | 共线性 | ⚠️ | 财富指数与资产、教育等变量高相关;建模需正则化或选组 |
| 13 | 编码映射 | ✅ | IPUMS MICS 提供跨轮跨国统一码本 + 逐变量可比性说明 |
| 14 | 时间戳处理 | ⚠️ | 调查期(年/月)明确;个体事件时间需由日期变量重算,注意堆积 |
| 15 | 划分建议 | ✅ | 官方无 ML 划分但提供抽样结构;本百科给出按簇分组方案(§5) |
| 16 | 泄漏讨论 | ✅ | 同簇/同户/同轮泄漏机制明确(§5.3) |
| 17 | 标签分布 | ✅ | 官方报告表格即标签分布权威来源 |
| 18 | 测量偏倚 | ⚠️ | 自报测量 + 人体测量误差 + 访问员效应(§7.1) |
| 19 | 外部验证建议 | ✅ | DHS/普查/行政数据三角验证路径明确(§5.5/§7.8) |
| 20 | 版本记录 | ✅ | study ID 含版本号(v01_M);重发布与状态变更官方留痕 |
| 21 | 预处理脚本 | ✅ | 官方 SPSS 语法公开;社区 Python 生态(pyreadstat)成熟 |
| 22 | 合规要求 | ✅ | 注册制 + ToU + 禁再分发 + 出版物回传义务 |
| 23 | 多模态对齐 | ⚠️ | 问卷/测量/水质/GIS 多模态存在,但公开文件无 GPS,模态对齐受限于匿名化 |
| 24 | 去标识化 | ✅ | 完全匿名化(删姓名/地址/细地理),公开文件不可识别个人 |
DAIMS 评分:19.5 / 24
评分解读:MICS 在标识体系、缺失编码惯例、字典与语法公开、去标识化与合规五大基础项上接近满分,是公共调查数据中工程化程度最高的家族之一;失分集中在"机器学习友好度"而非"数据质量"——变量命名需人工对照字典、无官方机器可读 schema、跨轮口径漂移与敏感模块信息性缺失需要研究者主动管理。整体属于"高可信、需转译"的表格数据集。
对你意味着什么:
- 可以放心做的事:用官方键体系(HH1+HH2+LN)搭建合并流水线并全程加权;以官方语法与质量表作为口径与质量的锚;把 8/9 缺失码、字典与 IPUMS 码本纳入自动化管道。
- 必须投入的事:写一份口径审计清单(权重列、分母 universe、DK/missing 三件套);pooled 前完成 IPUMS 协调或自建映射;把官方复算纳入 CI 回归。
- 不该做的事:不加权出报告;把 DK 当缺失一键删除;把"MICS-type"调查混入官方样本;用公开文件尝试地理复原或再识别(合规红线)。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| DHS 微数据 | 各国 NSO + DHS Program(ICF) | 指标级一致性(免疫、营养、生育率等) | 指标一致性/可比性评估 | 官方称两项目工具经机构间程序高度协调 | MICS 与 DHS 高度可比,技术团队长期协作;联合调查极少且 discouraged 标注 |
| 人口普查/行政系统 | 各国统计系统 | 覆盖率与总量核对 | 分布一致性(定性) | 调查估计与行政覆盖互补 | 行政系统缺失的指标(出生登记、儿童保护)MICS 常为唯一来源 |
| IPUMS MICS 重算 | 明尼苏达大学 IPUMS + UNICEF | 协调变量与原始文件一致性 | 变量级验证(官方协作流程) | IPUMS 重编码不改原始响应,仅改码值 | 官方五年伙伴关系产出;建议比较用 IPUMS 对 IPUMS,不与原始文件混比 |
(说明:MICS 为调查型数据集,外部验证以"指标一致性与可比性"为主而非模型排行榜;本表仅收录有同行评审或官方协作文档支撑的结果。)
§8 基准性能与生态
§8.1 排行榜与代表性研究(分析基准)
MICS 无 ML 排行榜;"基准"体现为官方制表基准与代表性同行评审研究:
| 排名 | 研究/工具 | 任务与规模 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | 官方标准制表(指标复算基准) | 200 项指标 × 每次调查 | 每轮 | SPSS 语法 + 制表计划 | UNICEF Global MICS Team, MICS6 Tool Package. https://mics.unicef.org/tools | 官方语法 |
| 2 | MICS 交付稳健数据综述 | 全项目方法论 | 2019 | 调查设计/数据质量体系 | Khan, S. and Hancioglu, A., 2019. Multiple Indicator Cluster Surveys: Delivering Robust Data on Children and Women across the Globe. DOI: 10.1111/sifp.12103 | 未公开 |
| 3 | 可复用经期材料跨国研究 | 42 次调查 / 38 国 / 471,364 响应 | 2024 | 加权横断面 pooling | PLoS ONE, 2024(42 surveys analysis). https://scixplorer.org/link_gateway/2024PLoSO..1910451R/PUB_HTML | 未公开 |
| 4 | IPUMS MICS 协调化论文 | 89 国 / 218 样本 / 约 1,200 变量 | 2025 | 跨时空变量协调 | Bolgrien, A., Hancioglu, A., King, M. and Boyle, E.H., 2025. Harmonized Data from Household Surveys on the Status and Well-being of Children, Adolescents, and Their Families: MICS and IPUMS MICS. Population, 80(1), 67-78. DOI: 10.3917/e.popu.2501.0067 | https://mics.ipums.org |
| 5 | 儿童青少年焦虑抑郁复合指标 | LMIC 多国 MICS | 2025 | 主客观多维复合指标 | Child Indicators Research, 2025. A Composite Indicator of Anxiety and Depression Signs in Children and Adolescents of Low- and Middle-Income Countries. DOI: 10.1007/s12187-025-10328-5 | 未公开 |
数值不可直接比较的原因:各研究的目标指标、国家集合、轮次与加权口径不同,且部分为方法论综述而非基准任务;MICS 的"金标准"始终是官方语法在官方口径下的复算结果。
§8.2 SOTA 总结与选型建议
MICS 生态的"最优实践"分三层:指标层面,官方 SPSS 语法是不可超越的基准——任何自算指标必须与之对齐;协调化层面,IPUMS MICS 是跨国研究的 SOTA 基础设施(编码统一 + 逐变量可比性文档 + 空间协调地理),新研究应优先在其上构建而非重造码本;建模层面,表格任务的强基线是"加权 GLM + 梯度提升树(加权损失)+ 按簇分组的 CV",深度模型仅在全库级(IPUMS 1,800 万记录)才具备性价比。新兴方向是小区域估计与地理空间融合(MICS GIS 落地后),以及 MICS Plus 电话随访数据带来的纵向建模机会。
一句话选型:先问"口径是否要对齐官方"——要,就用官方语法与 Tabulator;不要(自定任务),再问"是否跨时空比较"——是,就走 IPUMS MICS;都不是,才考虑在单国原始文件上自由建模,并把 §6.5 全部坑点过一遍。
§8.3 评测协议
- 口径锁定:声明 study ID、轮次、模块集合与数据包下载日期;指标定义引用官方工具包版本。
- 加权与方差:全部估计带权重;方差按簇聚类(或 Taylor 线性化),报告 CI 与 deff。
- 官方对照:自算指标先与官方报告表格对齐(口径审计三件套:权重列/universe/缺失处理)。
- 划分纪律:按簇分组 CV;pooled 用留一国折;杜绝行级随机切分(§5.3)。
- 公平性审计:按财富五分位/城乡/性别/残疾拆分报告性能差异(§7.5)。
- 合规交付:结果出版物回传 UNICEF 与实施伙伴;禁止再分发数据或衍生微数据。
- 可追溯性:论文/模型卡中声明数据版本(study ID + 下载日期)、指标定义版本(工具包轮次)与代码仓库,使第三方可完整复现。
§8.4 相关数据集表
| 数据集 | 机构 | 关系 | 互补性 |
|---|---|---|---|
| DHS(Demographic and Health Surveys) | ICF/USAID(项目 2025-02 终止,档案开放) | 最强同类 + 工具协调伙伴 | 生物标志物更深;40+ 年历史档案用于长期趋势 |
| LSMS / LSMS-ISA | 世界银行 | 同为住户调查 | 面板设计、农业与消费支出更深 |
| IPUMS International | 明尼苏达大学 | 人口普查微数据协调化 | 普查级人口结构与 MICS 调查指标互补 |
| MICS Tabulator | UNICEF | MICS 官方在线分析层 | 免下载复算/出图,参数化口径 |
| UNICEF Data(data.unicef.org) | UNICEF | 指标发布层 | 国家级时序指标结果查询 |
§8.5 关键论文 Top 6
- Khan, S. and Hancioglu, A., 2019. Multiple Indicator Cluster Surveys: Delivering Robust Data on Children and Women across the Globe. DOI: 10.1111/sifp.12103 — MICS 项目方法论与数据质量体系的权威综述。
- Bolgrien, A., Hancioglu, A., King, M. and Boyle, E.H., 2025. Harmonized Data from Household Surveys on the Status and Well-being of Children, Adolescents, and Their Families: MICS and IPUMS MICS. Population, 80(1), 67-78. DOI: 10.3917/e.popu.2501.0067 — IPUMS MICS 协调化体系与样本结构的第一手描述。
- PLOS Medicine 测量系列, 2013. DHS/MICS coverage measurement and data quality. DOI: 10.1371/journal.pmed.1001391 — 系统讨论权重误用、年龄堆积、跨国可比性等经典陷阱。
- Child Indicators Research, 2025. A Composite Indicator of Anxiety and Depression Signs in Children and Adolescents of Low- and Middle-Income Countries. DOI: 10.1007/s12187-025-10328-5 — 展示 MICS 轮次对照与心理健康新模块的研究范式。
- PLoS ONE, 2024. Cross-national variation in the prevalence and correlates of current use of reusable menstrual materials(42 国 MICS 分析). https://scixplorer.org/link_gateway/2024PLoSO..1910451R/PUB_HTML — 大规模加权 pooling 的操作范例(含 DK/缺失剔除口径)。
- UNICEF Global MICS Programme, 2021. Announcing the launch of IPUMS MICS. https://mics.unicef.org/news/announcing-launch-ipums-mics — 官方对协调化基础设施范围的公告(首发 88 国/202 调查/800+ 变量)。
§8.6 社区活跃度
MICS 由 UNICEF 全球团队中心化运营,社区形态与开源项目不同:官方渠道包括 mics.unicef.org 新闻与通知订阅、MICS Methodological Paper Series、YouTube 频道、区域/全球工作坊体系(设计、数据处理、解译与专题深析)与 mics@unicef.org 支持邮箱;研究社区以公共卫生/人口学/经济学为主,Google Scholar 上 MICS 相关文献体量大且持续增长(无统一口径统计);使用者支持为"注册用户 + 邮件工单"模式(数据访问 1-2 天开通),问题响应经由官方 FAQ 与邮箱分流。协作网络方面,UNICEF 与 IPUMS(明尼苏达大学)的五年伙伴关系产出了协调化基础设施,UNECE、UNESCAP 等区域委员会持续推广 Tabulator 与统计协调;DHS 项目 2025-02 终止后,MICS 社区事实上成为全球住户调查方法学讨论的枢纽之一。
§8.7 生态快照表
| 资源 | 类型 | 链接 | Star 截至 2026-09 | 推荐理由 |
|---|---|---|---|---|
| MICS 官网(新闻/工具/调查列表) | 官方门户 | https://mics.unicef.org | -(官方项目) | 一切起点:调查列表=数据身份唯一判定 |
| Surveys/Datasets 页 | 数据入口 | https://mics.unicef.org/surveys | -(官方项目) | 注册下载 + FAQ(许可/合并/状态语义) |
| MICS Tools | 官方工具包 | https://mics.unicef.org/tools | -(官方项目) | 问卷、语法、制表计划、合并指南 |
| IPUMS MICS | 协调化数据平台 | https://mics.ipums.org | -(学术项目) | 94 国/237 样本/2,000+ 变量,跨国研究首选 |
| MICS Tabulator | 在线分析平台 | https://mics.unicef.org(Tools 入口) | -(官方项目) | 免下载复算与可视化 |
| MICS GIS / MICS Plus | 官方新能力 | https://mics.unicef.org | -(官方项目) | 地理空间与电话随访纵向数据 |
| 世界银行 Microdata Library | 第三方编目 | https://microdata.worldbank.org | -(学术项目) | DDI 元数据、访问条件与引用格式范例 |
| UNICEF Data | 指标结果门户 | https://data.unicef.org | -(官方项目) | 国家级指标时序查询,适合校验自己复算的结果 |
§9 相关资源与引用
§9.1 官方资源
- 官方主页:UNICEF MICS — 项目总览、新闻、工具、工作坊
- 调查与数据:Surveys/Datasets — 调查列表(身份判定)、注册下载、FAQ
- 工具包:MICS Tools — 各轮问卷、SPSS 语法、制表计划、合并指南
- IPUMS MICS:mics.ipums.org — 协调化提取平台(94 国、2,000+ 变量)
- IPUMS MICS FAQ:mics.ipums.org/mics-action/faq — 编码差异、地理协调、提取机制
- UNICEF 法律条款:unicef.org/legal — 数据使用许可的上级框架
- 官方联系:mics@unicef.org(Global MICS Coordinator, UNICEF, New York)
- 方法论出版物:MICS Methodological Paper Series 与 Webinars — 指标方法与深入分析范例
- 指标结果库:UNICEF Data — 各国指标时序结果的官方发布与可视化查询
§9.2 BibTeX 完整引用
@misc{unicef_mics_programme,
author = {{UNICEF Global MICS Programme}},
title = {Multiple Indicator Cluster Surveys (MICS)},
year = {2026},
url = {https://mics.unicef.org},
note = {123 countries, 418 surveys (as of Oct 2025). Accessed 2026-09}
}
@article{khan_hancioglu_2019,
author = {Khan, S. and Hancioglu, A.},
title = {Multiple Indicator Cluster Surveys: Delivering Robust Data
on Children and Women across the Globe},
year = {2019},
doi = {10.1111/sifp.12103}
}
@article{pone_2024_menstrual,
author = {{PLoS ONE}},
title = {Cross-national variation in the prevalence and correlates of
current use of reusable menstrual materials: Analysis of 42
cross-sectional surveys in low-income, lower-middle-income,
and upper-middle-income countries},
journal = {PLoS ONE},
year = {2024},
url = {https://scixplorer.org/link_gateway/2024PLoSO..1910451R/PUB_HTML}
}
@article{bolgrien_etal_2025,
author = {Bolgrien, Anna and Hancioglu, Attila and King, Miriam and
Boyle, Elizabeth Heger},
title = {Harmonized Data from Household Surveys on the Status and
Well-being of Children, Adolescents, and Their Families:
MICS and IPUMS MICS},
journal = {Population},
volume = {80},
number = {1},
pages = {67--78},
year = {2025},
doi = {10.3917/e.popu.2501.0067}
}
@article{plosmed_2013_measurement,
author = {{PLOS Medicine Collection}},
title = {Coverage Measurement and Data Quality in Household Surveys
(DHS/MICS Series)},
journal = {PLOS Medicine},
year = {2013},
doi = {10.1371/journal.pmed.1001391}
}
@article{cir_2025_composite,
author = {{Child Indicators Research}},
title = {A Composite Indicator of Anxiety and Depression Signs in
Children and Adolescents of Low- and Middle-Income Countries:
a Subjective-Objective Multidimensional Approach},
journal = {Child Indicators Research},
year = {2025},
doi = {10.1007/s12187-025-10328-5}
}
@misc{unicef_ipums_launch,
author = {{UNICEF Global MICS Programme}},
title = {Announcing the Launch of IPUMS MICS},
url = {https://mics.unicef.org/news/announcing-launch-ipums-mics},
note = {Initial release: 800+ variables, 202 surveys (2005-2020),
88 countries. Accessed 2026-09}
}
@misc{unicef_mics_survey_example,
author = {{UNICEF and Ministry of Planning and Investment, Lao PDR}},
title = {Lao PDR Multiple Indicator Cluster Survey (MICS) 2006,
Ref. LAO_2006_MICS_v01_M},
year = {2011},
note = {Study ID citation format example. Accessed 2026-09}
}
§9.3 引用指南
- 引用单次调查(推荐格式,来自官方/编目范例):
UNICEF + 实施机构. {国家} Multiple Indicator Cluster Survey (MICS) {年份}, Ref. {study ID}. Dataset downloaded from {URL} on {日期}.其中 study ID 形如LAO_2006_MICS_v01_M(国家_年份_MICS_版本)。 - 引用整个项目:使用 §9.2 第一条
unicef_mics_programme,并注明访问日期。 - 使用 IPUMS MICS:引用 Bolgrien et al. 2025 + IPUMS MICS 平台,声明提取的变量与样本集合。
- 义务提醒:引用之外,请向 UNICEF 与实施政府伙伴回传出版物副本(许可条款要求,§7.4)。
§9.4 学习路径建议
- 第 1 步(1 天):读官网首页与 Surveys/Datasets FAQ,理解调查状态语义(Available/Restricted 等)与许可义务;注册账号。
- 第 2 步(2-3 天):下载一个 MICS6 已发布国数据包,对照数据字典与 §4.0 目录树,跑通 §6.1 最小路径(读文件→合并→加权城乡分布),并用官方报告核对一个指标。
- 第 3 步(1 周):跑官方 SPSS 语法(或用 MICS Tabulator 复算)完成口径审计三件套(权重/universe/缺失),把 §6.5 八个坑点逐条对照自查。
- 第 4 步(进阶):需要跨国比较时切换到 IPUMS MICS 提取协调矩阵,读其逐变量可比性文档;建模需求按 §6.7 选型、§5.4 协议评估。
- 第 5 步(前沿):跟踪 MICS7 新能力——MICS GIS 地理空间层(老挝已连续发布)与 MICS Plus 电话随访纵向数据,把横断面分析升级为时空建模;方法论细节参考官方 Methodological Paper Series。
§10 AI 使用声明卡
§10.1 AI 模型列表
| 模型 | 角色 | 用途 |
|---|---|---|
| fast-model(CodeBuddy Code) | 写作代理 | 本条目的检索、整理、撰写与自检执行 |
§10.2 AI 参与范围
AI 负责信息检索(WebSearch 5 次)、事实清单整理(FACTS.md)、全文起草与格式自检;所有结构性决策、章节框架与质量评分标准遵循《千方病案医数集写作宪法》(WRITER_CONSTITUTION.md)。事实性内容仅收录有公开来源支撑的陈述,查证不到的字段按规范省略。
§10.3 输入来源列表
- UNICEF MICS 官网首页(项目定位、120+ 国、软件栈、新闻动态)— https://mics.unicef.org
- UNICEF MICS Surveys/Datasets FAQ(许可、注册、状态、匿名化、SPSS 格式、合并指南)— https://mics.unicef.org/surveysdatasets
- UNECE SDG 故事(33 项 SDG 指标、351 次/118 国口径、MICS7 新模块、资助方)— https://w3.unece.org/sdg2023/story-12.html
- medRxiv 镜像:Khan & Hancioglu, MICS: Delivering Robust Data…(10 文件、6 问卷、无插补、权重、发布周期、Tabulator)— https://www.medrxiv.org/lookup/external-ref?access_num=10.1111/sifp.12103&link_type=DOI
- PLOS Medicine 测量系列(抽样规模、权重误用、年龄堆积与转移、可比性陷阱)— https://journals.plos.org/plosmedicine/article/file?id=10.1371/journal.pmed.1001391&type=manuscript
- IPUMS MICS 官网(94 国/237 样本/2,000+ 变量/1,800 万记录)— https://mics.ipums.org
- IPUMS MICS FAQ(文件类型、编码差异、地理协调)— http://mics.ipums.org/mics-action/faq
- UNICEF MICS 新闻:IPUMS MICS 发布(2018 伙伴关系、首发 88 国/202 调查/800+ 变量)— https://mics.unicef.org/news/announcing-launch-ipums-mics
- Cairn/Population 2025:Bolgrien et al.(IPUMS MICS 样本结构、均值 12,000 户、80% 全国代表)— https://shs.cairn.info/journal-population-2025-1-page-67?lang=en
- UNESCAP 会议材料:MICS Tabulator 项目概述(架构、IPUMS 协作、R/Python)— https://www.unescap.org/sites/default/files/4.2 UNICEF_MICS Tabulator.pdf
- 世界银行 Microdata Library(访问条件、引用格式、study ID 范例、数据质量表)— https://microdata.worldbank.org/catalog/2528 及 https://microdata.worldbank.org/catalog/4146
- 世界银行复现包目录(UNICEF ToU、SPSS→Stata 转换实践、再分发限制)— https://reproducibility.worldbank.org/catalog/609/study-description
- 维基百科镜像:MICS 条目(轮次时间轴、MICS1 起点、指标清单 200/237、DHS 终止影响)— https://wikiclassic.com/wiki/Multiple_Indicator_Cluster_Surveys
- Springer Child Indicators Research 2025(轮次对照表:Round 6 2016-2022、Round 7 2023-2026、新计划清单)— https://link.springer.com/article/10.1007/s12187-025-10328-5/tables/2
- PLoS ONE 2024(42 国 MICS 分析:城乡口径差异、DK/缺失处理实践)— https://scixplorer.org/link_gateway/2024PLoSO..1910451R/PUB_HTML
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §0 审核声明与免责条款 | 千方病案医学编辑部 | 逐字对照宪法 §5 模板 | ✅ 已通过 |
| §1 概览与 §2 医学背景(含 ICD-11/SNOMED 映射) | 千方病案医学编辑部 | 编码表逐项复核、主题流行病学审读 | ✅ 已通过 |
| §3-§4 规格与数据字典 | 千方病案医学编辑部(数据工程) | 与 FACTS.md 来源逐条对齐、字典骨架复核 | ✅ 已通过 |
| §5-§6 划分策略与 AI 就绪指南(含 8 坑点) | 千方病案医学编辑部(数据工程) | 代码可运行性走查、坑点四段式完整性检查 | ✅ 已通过 |
| §7-§8 质量评估、DAIMS 与生态 | 千方病案医学编辑部 | DAIMS 24 项逐项核对、引用完整性检查 | ✅ 已通过 |
| §9-§10 引用与声明卡 | 千方病案医学编辑部 | BibTeX 逐条对照来源列表 | ✅ 已通过 |
§10.5 AI 生成章节标注
本条目全部章节(frontmatter、INFOBOX、§0-§10、§C)由 fast-model 写作代理起草,人工审核范围与结果见 §10.4 校验记录表。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核声明一致)。
页面状态:published(全部内容已完成审核并发布)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- nhanes — 共享标签:公共卫生与流行病学 / 调查数据
- brfss — 共享标签:公共卫生与流行病学 / 调查数据
- nhis — 共享标签:公共卫生与流行病学 / 调查数据
- dhs-program — 共享标签:公共卫生与流行病学 / 调查数据
- jhu-csse-covid-19 — 共享标签:公共卫生与流行病学 / 疾病监测
- ncd-risc — 共享标签:公共卫生与流行病学 / 疾病监测
- charls — 共享标签:公共卫生与流行病学 / 调查数据
- meps — 共享标签:公共卫生与流行病学 / 调查数据
- ctd — 共享标签:公共卫生与流行病学 / 疾病监测
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。
