信息速览

Framingham Heart Study — 心血管流行病学奠基队列 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | Framingham Heart Study(FHS) |
| 英文全称 | Framingham Heart Study |
| 别名/简称 | FHS、弗雷明汉心脏研究、Framingham Cohort、framcohort |
| 疾病分类 | 心血管疾病谱系(ICD-11:BA41 急性心肌梗死 / BA52 稳定性缺血性心脏病 / CB4Z 心力衰竭 / 8B20 脑梗死 / BC81 心房颤动;延伸至 6D70-6D8Z 神经认知障碍) |
| SNOMED CT | 22298006 Myocardial infarction / 84114007 Heart failure / 230690007 Stroke / 49436004 Atrial fibrillation / 53741008 Coronary arteriosclerosis(详见 §2.2) |
| 数据模态 | 纵向结构化临床检查、心血管事件随访、影像(超声心动图/CT/MRI)、组学(GWAS/蛋白组/代谢组/转录组) |
| AI 任务类型 | 生存分析(Cox)、10 年心血管风险预测、时间事件分类、纵向轨迹建模、家系关联分析、多组学整合 |
| 样本总数 | 约 15,000 名参与者(Original 5,209 + Offspring 5,124 + Gen 3 4,095 + NOS 103 + Omni 1/2 916);教学数据集 4,434 人 / 11,627 person-exam |
| 数据大小 | 教学数据集 ~1.4 MB(CSV);BioLINCC/dbGaP 全量按申请变量包分发(数十 GB 量级,含组学与影像) |
| 数据格式 | CSV / SAS / dbGaP 授权下载包(含 IDAT/VCF 等组学格式)/ DICOM(影像子研究) |
| 许可证 | dbGaP Data Use Certification(HMB consent,需 IRB)/ BioLINCC DUA / NHLBI 教学数据集(公开,禁止用于发表) |
| 访问级别 | 教学数据集:开放下载;临床表型:BioLINCC 申请审核;基因+表型:dbGaP DAC 授权访问 |
| DUO 标签 | HMB, IRB, NPUNCU(dbGaP consent group 1) |
| 语言 | 英文 |
| 首发日期 | 1948-10-11(首位参与者入组)/ 1951(首篇论文)/ 2008-07-08(dbGaP SHARe 发布) |
| 最后更新 | 2022(事件随访与 Offspring Exam 10 完成;持续随访中) |
| 发布机构 | 美国国家心肺血液研究所(NHLBI) & 波士顿大学(Boston University)联合管理 |
| 官方主页 | https://www.framinghamheartstudy.org/ |
| 下载地址 | https://biolincc.nhlbi.nih.gov/teaching/(教学集)/ https://biolincc.nhlbi.nih.gov/studies/framcohort/(临床)/ dbGaP phs000007(组学+表型) |
| DOI | 10.1093/ije/dyv337(队列 profile 论文,Tsao & Vasan 2015) |
| 引用次数 | Wilson 1998 风险评分论文 13,300+(Google Scholar,截至 2026-09);FHS 衍生论文 3,698 篇(官方统计,截至 2018-08) |
| AI 就绪度评分 | ⭐⭐⭐⭐(4/5)— 教学数据集开箱即用、文档跨越 75 年、终点经委员会判定;扣分项:全量数据需申请、教学集禁发表、人群祖源单一、无官方 ML 划分 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11/SNOMED CT 映射、Framingham 终点定义与风险评分临床口径)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(教学数据集 39 个变量、长格式结构)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 NHLBI、波士顿大学、BioLINCC、dbGaP 无任何商业利益关联。本页面不销售 FHS 数据本身,仅提供 AI 就绪指南与学术信息服务。编辑者未接受 NHLBI 或波士顿大学的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。Framingham 风险评分及其衍生工具的使用应遵循当前临床指南(如 ACC/AHA)。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。NHLBI 教学数据集经匿名化处理,官方明确声明不适用于发表(inappropriate for publication purposes);dbGaP 数据仅限基因-表型关联研究并需 IRB 文件;BioLINCC 数据需签署 DUA。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 30 秒速览
Framingham Heart Study 是 1948 年由美国国家心脏研究所(今 NHLBI)在马萨诸塞州弗雷明汉镇启动的前瞻性社区队列,历经 Original(5,209 人)、Offspring(5,124 人)、第三代(4,095 人)三个世代及两个少数族裔 Omni 队列,总计约 15,000 名参与者,随访已超过 75 年——是现代医学史上运行时间最长的心血管流行病学队列。
它的历史地位怎么强调都不为过:"危险因素(risk factor)"这个词本身就是 1961 年从 Framingham 论文里诞生的;高血压、高胆固醇、吸烟、糖尿病与心脏病的因果关系,以及沿用至今的 Framingham 风险评分(Wilson 1998,被引 13,000+),都建立在它的数据之上。衍生论文超过 3,600 篇,覆盖从心衰分型到社会网络肥胖传播、再到痴呆发病率三十年下降的整个医学版图。
你可以用它来:在公开的 NHLBI 教学数据集(4,434 人、24 年随访,免申请下载)上 10 分钟跑通第一个 10 年 CVD 风险预测模型;申请 BioLINCC 临床数据做生存分析与纵向轨迹研究;或通过 dbGaP 获取三代家系的 GWAS 与多组学数据做基因-表型关联。注意:教学数据集经匿名化处理,禁止用于发表。
§1.1 摘要
FHS 以"每 2-4 年一次现场检查 + 持续事件监测"的架构运行:每次检查包含病史、用药审查、医生查体、人体测量、12 导联心电图、血尿生化(约 4 小时完成),Offspring 时代起陆续加入超声心动图、运动试验、动态心电、颈动脉超声、心脏 CT、心脏与脑 MRI、血管张力计与加速度计;两次检查之间通过邮寄问卷、电话、医院与诊所病历、死亡证明保持连续监测,全部疑似心血管终点由医师终点评审委员会(Endpoint Review Committee)逐例判定。2007 年 SHARe 项目为 9,300+ 名三代参与者完成 55 万 SNP 基因分型,此后外显子组/全基因组测序、蛋白组、代谢组、转录组、DNA 甲基化与微生物组层层叠加,形成"深表型 × 三代家系 × 75 年纵向"的独特数据结构。数据经三条路径开放:NHLBI 教学数据集(公开)、BioLINCC(临床表型,申请)、dbGaP phs000007(组学+表型,DAC 授权)。
§1.2 战略价值分析
科学范式维度:FHS 不只产出了数据,而是发明了"研究慢性病的方法论"——它第一次把传染病流行病学的队列前瞻设计引入非传染病研究,第一次证明慢性病同样存在"流行",第一次提出并命名"危险因素"概念(Kannel 1961),并由此推导出"多因素联合 → 个体绝对风险量化"的临床预防范式(Truett 1967 首个多变量 logistic 风险函数 → Wilson 1998 风险评分 → ATP III 指南采纳)。今天每一个慢病风险预测模型,方法论血统都可追溯到 Framingham。
数据资产维度:三代家系 + 75 年纵向 + 委员会判定终点 + 深组学,四个特性叠加在全球队列中几乎无替代品。UK Biobank 规模更大但随访仅十余年且无三代家系;ARIC、CHS 同类美国队列规模为其三分之一且世代单一。"同一祖父 1950 年的血压、父亲 1985 年的超声、孙辈 2010 年的蛋白组"这种时间深度的家族数据,是研究遗传-环境-衰老交互的唯一级别资源。
AI 生态维度:FHS 教学数据集是全球生物统计与医学 ML 课堂的"hello world"——11,627 行、39 个变量、免申请下载,Kaggle 上相关 notebook 数以千计;而 dbGaP 端的 SHARe/SABRe 组学数据长期作为 GWAS 方法与多组学整合方法的开发基准。从 Cox 比例风险模型(生存分析的标准工具)到现代梯度提升风险预测,FHS 始终处于"方法验证场"的位置。
§1.3 横向对比
| 数据集 | 规模 | 随访 | 模态 | 获取 | 核心差异化 |
|---|---|---|---|---|---|
| Framingham(FHS) | ~15,000(三代+Omni) | 75 年+(1948- ) | 临床+影像+组学+家系 | 教学集公开;全量申请 | 最长寿三代家系队列,风险评分发源地 |
| UK Biobank | 502,000 | ~15 年(2006- ) | 临床+影像+WGS | 申请+费用 | 规模最大、影像/WGS 全覆盖,无三代家系 |
| ARIC | 15,792 | 35 年+(1987- ) | 临床+影像+组学 | BioLINCC/dbGaP | 四社区、含非裔 27%,同走 NHLBI 通道 |
| CHS(Cardiovascular Health Study) | 5,888 | 30 年+(1989- ) | 临床+影像 | BioLINCC/dbGaP | 专注 ≥65 岁老年心血管 |
| NHANES | 每期 ~10,000 | 横断面+死亡率链接 | 临床+检验+营养 | 完全公开 | 全国代表性横断面,无纵向家系 |
FHS 的不可替代性在于时间深度与家系结构的乘积:它是唯一可以让研究者对齐"祖孙三代在相同年龄"的表型数据,且终点经医师委员会逐例判定 75 年。
§1.4 版本演进时间轴
| 时间 | 事件 |
|---|---|
| 1948-10-11 | 首位参与者入组;National Heart Act 资助,选址马萨诸塞州弗雷明汉镇 |
| 1948-1953 | Original 队列 Exam 1(5,209 人,28-62 岁,基线无 CVD) |
| 1951 | 首篇论文发表(Dawber et al., Am J Public Health 41:279-281) |
| 1957 | Dawber 4 年随访:高血压、高胆固醇、超重与 CHD 关联确立 |
| 1961 | Kannel et al. 提出"危险因素(factors of risk)"概念(Ann Intern Med 55:33-50) |
| 1966-1971 | 20 年资助到期险遭终止;1971 年波士顿大学接手运营(NHLBI 合同 N01-HC-25195) |
| 1967 | Truett-Cornfield-Kannel 首个多变量 logistic 风险函数 |
| 1971-1975 | Offspring 队列 Exam 1(5,124 人,子代及其配偶) |
| 1975 | 痴呆监测启动 |
| 1976 | 首个 CVD 总体风险 profile(CHD+卒中+跛行+心衰) |
| 1994/1995 | Omni 1 队列入组(506 人,少数族裔) |
| 1998 | Wilson et al. 发表 Framingham Risk Score(Circulation 97:1837-1847),后成 ATP III 计算器基础 |
| 2002-2005 | 第三代队列 Exam 1(4,095 人);2003 年 NOS(103 人)与 Omni 2(410 人)入组 |
| 2007 | SHARe 项目完成 9,300+ 人 55 万 SNP 分型;Christakis & Fowler 社会网络肥胖研究(NEJM) |
| 2008-07-08 | dbGaP phs000007(Framingham SHARe)正式发布 |
| 2008 | D’Agostino et al. 发表 General CVD Risk Profile(Circulation 117:743-753) |
| 2013 | ACC/AHA Pooled Cohort Equations 取代 FRS 成为美国指南首选 |
| 2014 | Original 队列 Exam 32 完成(最后一次双年检查) |
| 2016 | Satizabal et al. 证实三十年痴呆发病率下降 44%(NEJM 374:523-532) |
| 2018-08 | FHS 官方统计衍生论文达 3,698 篇(70 周年) |
| 2022 | Offspring 队列 Exam 10 完成;事件随访更新至 2022 |
§1.5 典型 AI 应用场景
- 10 年心血管风险预测与校准研究:以教学数据集或 BioLINCC 临床数据训练 Cox/梯度提升模型,与 Framingham Risk Score、Pooled Cohort Equations 对比判别度(C-index)与校准度——风险预测方法学的标准练兵场。
- 生存分析与竞争风险方法验证:24-75 年随访 + 委员会判定终点 + 死亡竞争风险,是 Fine-Gray、多状态模型、landmark 分析等方法的天然验证数据。
- 纵向轨迹与联合建模:每 2-4 年重复测量的血压/血脂/BMI 轨迹,适合混合效应模型、潜在类别轨迹(LCGA)、纵向-生存联合模型。
- 家系遗传关联与多组学整合:dbGaP SHARe(55 万 SNP、900+ 家系)与 SABRe 蛋白组/代谢组,支撑 GWAS、多基因风险评分(PRS)与多组学因子分析。
- 生物统计与医学 ML 教学:教学数据集免申请、变量含义清晰、结局经典,是全球课堂标准的入门数据集。
§2 医学背景
§2.1 ICD-11 疾病分类锚定
FHS 的核心终点为心血管疾病谱系,并延伸至痴呆等非心血管结局。主要终点到 ICD-11 的映射:
| FHS 终点(委员会判定) | 中文名称 | ICD-11 对应 |
|---|---|---|
| Myocardial infarction(HOSPMI / MI_FCHD) | 心肌梗死 | BA41 急性心肌梗死 |
| Angina pectoris(ANGINA) | 心绞痛 | BA40 心绞痛 |
| Coronary heart disease 复合(ANYCHD) | 冠心病(心绞痛+心梗+冠脉死亡) | BA52.Z 缺血性心脏病 |
| Stroke(STROKE) | 卒中(含脑梗死与脑出血) | 8B20 脑梗死 / 8B00 脑出血 |
| Heart failure | 心力衰竭 | CB4Z 心力衰竭 |
| Atrial fibrillation | 心房颤动 | BC81.3 心房颤动 |
| Intermittent claudication | 间歇性跛行 | BD40 外周动脉闭塞性疾病 |
| CVD 复合终点(CVD) | 心血管疾病总事件 | BA00-BE2Z 循环系统疾病章 |
| Dementia(1975 年起监测) | 痴呆 | 6D70-6D8Z 神经认知障碍 |
§2.2 SNOMED CT 映射
| 临床概念 | ICD-11 | SNOMED CT | SNOMED CT 术语 |
|---|---|---|---|
| 心肌梗死 | BA41 | 22298006 | Myocardial infarction (disorder) |
| 心绞痛 | BA40 | 194823009 | Angina pectoris (disorder) |
| 冠状动脉粥样硬化 | BA52 | 53741008 | Coronary arteriosclerosis (disorder) |
| 心力衰竭 | CB4Z | 84114007 | Heart failure (disorder) |
| 脑梗死 | 8B20 | 230690007 | Stroke (disorder) |
| 心房颤动 | BC81.3 | 49436004 | Atrial fibrillation (disorder) |
| 原发性高血压 | BA00.Z | 38341003 | Essential hypertension (disorder) |
| 2 型糖尿病 | 5B55.Z | 44054006 | Diabetes mellitus type 2 (disorder) |
| 高脂血症 | 5C80 | 55822004 | Hyperlipidemia (disorder) |
| 痴呆 | 6D70-6D8Z | 52448006 | Dementia (disorder) |
§2.3 疾病简介
心血管疾病(CVD)是全球首要死因,每年导致约 1,800 万人死亡(约占全球死亡 32%)。1948 年 FHS 启动时,美国每两例死亡就有一例归因于心血管病,而"高血压是衰老的自然现象"仍是主流医学认知——罗斯福总统 1945 年死于血压 300/190 mmHg 引发的出血性卒中,正是这一认知空白的时代注脚。FHS 用 75 年的连续观测完成了人类医学史上最重要的一次因果链论证:血压、胆固醇、吸烟、糖尿病、肥胖 → 动脉粥样硬化 → 心梗/卒中/心衰。今天全球一级预防指南(ACC/AHA、ESC、中国 CVD 预防指南)的证据地基中,FHS 衍生证据占据核心位置;美国心血管死亡率自 1970 年代起的持续下降(“拐点”),公认与 FHS 驱动的风险因素干预策略直接相关。
§2.4 临床任务定义
| AI 任务 | 临床定义 | 标准参考 | 在 FHS 中的操作化 |
|---|---|---|---|
| 10 年 CHD 风险预测 | 基线无 CVD 者 10 年内首次冠心病事件 | Wilson 1998 / ATP III | 风险因素 → 委员会判定 CHD 终点,Cox/Weibull 模型 |
| 总体 CVD 风险预测 | 10 年内任一 CVD 事件(CHD+卒中+跛行+心衰) | D’Agostino 2008 | CVD 复合终点(教学集 CVD 变量) |
| 卒中风险预测 | 卒中或 TIA 首发 | Wolf 1991 风险 profile | STROKE 终点 |
| 心衰风险预测 | 心衰首发(Framingham 标准) | Kannel 1999;McKee 1971 标准 | 2 主要 或 1 主要+2 次要标准判定 |
| 房颤风险预测 | 10 年房颤首发 | Schnabel 2009 / CHARGE-AF | ECG + 病历判定 |
| 生存分析(全因死亡) | 死亡时间 | Kaplan-Meier / Cox | DEATH + TIMEDTH(天数) |
| 痴呆发病监测 | 神经认知障碍首发 | Satizabal 2016 | 1975 年起神经学评审 |
§2.5 患者人群特征
| 维度 | 特征 |
|---|---|
| 数据来源 | 单镇社区:美国马萨诸塞州弗雷明汉镇(1948 年约 28,000 居民,被视为 1940 年代美国中产阶级的代表样本) |
| 采集时间 | 1948-10 至今(随访 75 年+;事件随访公开数据更新至 2022) |
| 队列构成 | Original 5,209(1948,28-62 岁)/ Offspring 5,124(1971)/ Gen 3 4,095(2002)/ NOS 103(2003)/ Omni 1 506(1994)/ Omni 2 410(2002) |
| 年龄(基线) | Original 28-62 岁;Offspring 入组时多为青年-中年;Gen 3 入组时平均约 40 岁 |
| 性别比例 | 女性略多于男性(Original 队列女性约 55%;FHS 是首批将女性纳入并按性别分层报告的队列) |
| 种族分布 | 三大主队列约 100% 欧洲裔白人;Omni 1/2(916 人)覆盖非裔、拉丁裔、亚裔、印度裔、原住民、太平洋岛民 |
| 随访依从性 | 定期检查返回率约 99%,Original 队列失访率不足 4%——流行病学史上的奇迹 |
| 检查内容 | 病史+用药审查+医生查体+人体测量+12 导联 ECG+血尿采集(约 4 小时);部分周期含超声心动图、运动试验、CT、MRI、神经认知电池(MMSE) |
| 家系结构 | 900+ 个家系贯穿三代,约 15,000 人中相当比例存在血缘关系——既是资产也是统计陷阱(见 §6.5 坑点 7) |
各队列检查次数与最新周期(截至 2022,EGA phs003593 口径):
| 队列 | 入组 | 已完成检查 | 备注 |
|---|---|---|---|
| Original | 1948 | 32 次双年检查(至 2014) | 事件随访至 2022 |
| Offspring | 1971 | 10 次(Exam 10 完成于 2022) | Exam 1-2 间隔 8 年、Exam 7-8 间隔 7 年 |
| Gen 3 | 2002 | 3 次(至 2019) | — |
| Omni 1 | 1994 | 5 次(至 2022) | — |
| Omni 2 | 2002 | 3 次(至 2019) | — |
§2.6 金标准/参考标准
| 数据类型 | 记录方式 | 产生者 | 金标准性质 |
|---|---|---|---|
| 血压 | 医生/技师按标准化方案坐位测量 3 次,取后两次均值 | FHS 诊所(标准水银/校准设备,跨时代有设备变迁) | 标准化临床测量,教学集 SYSBP/DIABP 即此口径 |
| 血脂/血糖 | 空腹静脉血,标准实验室方法 | FHS 实验室(方法学随时代升级) | 定量标准;教学集仅 TOTCHOL/GLUCOSE(HDLC/LDLC 高缺失) |
| 心血管终点(心梗/卒中/心衰/心绞痛/死亡) | 医师终点评审委员会(Endpoint Review Committee)逐例评审病历、影像、死亡证明 | FHS 医师委员会 | 流行病学领域最高级别终点判定,75 年口径一致(Sequence of Events 表单) |
| 心电图 | 12 导联标准采集 | FHS 诊所 | 机器测量 + 医师阅读 |
| 超声心动图/CT/MRI | 标准化协议,特定检查周期 | FHS 影像核心实验室 | 定量影像表型(左室质量、冠脉钙化等) |
| 基因型 | Affymetrix 500K+50K(SHARe);外显子组/WGS(ESP/TOPMed) | dbGaP 授权分发 | 标准 GWAS 质控流程 |
§3 数据集规格
§3.0 版本抉择矩阵
FHS 没有"版本号",但有四条截然不同的获取路径——选错路径是最常见的入门错误:
| 你的需求 | 推荐路径 | 大小 | 理由 |
|---|---|---|---|
| 学 ML/生物统计、课堂作业、快速原型 | NHLBI 教学数据集 | ~1.4 MB CSV | 免申请即刻下载;4,434 人 × 3 次检查 × 24 年随访;⚠️ 官方禁止用于发表 |
| 发表级临床表型研究(生存分析/纵向建模) | BioLINCC framcohort | 按变量包分发 | 含 Original/Offspring/Gen3 大部分 exam 数据;申请免费;需 DUA |
| 基因-表型关联、GWAS、多组学 | dbGaP phs000007 | 数十 GB | SHARe 55 万 SNP + SABRe 组学 + 表型;DAC 授权 + IRB 文件;⚠️ 纯表型分析被禁止(须回 BioLINCC) |
| BioLINCC/dbGaP 未覆盖的数据或生物标本 | FHS Repository | 视提案 | 提交 FHS Research Application;可能收服务费 |
一句话结论:原型用教学集,临床表型发表走 BioLINCC,组学研究走 dbGaP,其余找 FHS 官方。
§3.1 模态详细说明
FHS 包含四大数据模态层,跨越三个技术时代:
- 纵向临床检查(核心层):每 2-4 年一次现场检查——血压(3 次测量取后两次均值)、人体测量(身高/体重/腰围)、病史与用药审查、医生查体、12 导联心电图、空腹血尿生化(总胆固醇、HDL/LDL、血糖、肌酐等)。教学数据集即此层的 1956-1968 年切片。
- 心血管事件随访(终点层):两次检查之间以邮寄问卷+电话+医院/诊所病历+死亡证明保持连续监测;全部疑似事件由医师终点评审委员会按 Sequence of Events 表单逐例判定,覆盖心绞痛、心梗、卒中、心衰、间歇性跛行、房颤与全因死亡。
- 无创影像与生理功能:Offspring 时代起逐步加入超声心动图(Original exams 18-32、Offspring exams 3-10、Gen3/Omni2 exams 1-3、Omni1 exams 1-5)、运动负荷试验、动态心电、颈动脉超声、心脏 CT(4,427 人,1-2 个时间点)、心脏与脑 MRI、血管张力计与加速度计。
- 多组学:SHARe(9,300+ 人,Affymetrix 500K+50K,约 55 万 SNP)、CARe(约 2,100 候选基因 5 万 SNP)、ESP Heart-GO 外显子组测序、TOPMed 全基因组测序、SABRe(蛋白组、代谢组/脂质组、免疫检测、基因表达、miRNA)、DNA 甲基化与微生物组。
§3.2 样本量拆分
A. 全队列(FHS 官方与 dbGaP 口径)
| 层级 | 数量 | 说明 |
|---|---|---|
| 总参与者 | 约 15,000 | FHS 官网"nearly 15,000";含三代 + NOS + Omni 1/2 |
| dbGaP phs000007 同意受试者 | 17,141 | SHARe 顶层研究 consented subjects 口径 |
| SHARe 基因分型 | >9,300 | 三代、900+ 家系,55 万 SNP |
| DNA 样本 | 约 9,978 | Original 971 / Offspring 3,930 / Gen3 4,077 / Omni1 493 / Omni2 407(Benjamin 2015) |
| 心脏 CT | 4,427 人 | Offspring/Gen3/Omni,1-2 个时间点 |
B. 教学数据集(NHLBI Teaching Dataset,公开)
| 层级 | 数量 | 说明 |
|---|---|---|
| 参与者 | 4,434 | Original 队列子集,1956-1968 年间 3 次检查 |
| person-exam 观测 | 11,627 | 长格式,每人 1-3 行(取决于出席次数) |
| 随访 | 24 年 | 事件:心绞痛、心梗、卒中/脑出血、全因死亡 |
| 变量 | 39 | 风险因素 15 个 + 基线患病 5 个 + 事件与时间变量 19 个 |
C. 组学子研究(dbGaP phs000007 体系内)
| 子研究 | 内容 | 规模 | 说明 |
|---|---|---|---|
| SHARe | GWAS 基因分型 | >9,300 人,~550,000 SNP | Affymetrix 500K + 50K supplemental;2007 年启动 |
| CARe | 候选基因分型 | ~50,000 SNP,约 2,100 候选基因 | 心血管候选基因 panel |
| ESP Heart-GO | 外显子组测序 | NHLBI Exome Sequencing Project 子集 | 罕见变异研究 |
| TOPMed | 全基因组测序 | FHS 为 TOPMed 参与队列之一 | 深度 WGS |
| SABRe | 系统组学 | 蛋白组、代谢组/脂质组、免疫检测、基因表达、miRNA | 多组学整合主力资源 |
D. 影像子研究(单独申请)
| 模态 | 覆盖 | 规模 |
|---|---|---|
| 超声心动图 | Original ex18-32 / Offspring ex3-10 / Gen3、NOS、Omni2 ex1-3 / Omni1 ex1-5 | 数千人次(EGA phs003593) |
| 心脏 CT(冠脉钙化等) | Offspring / Gen3 / Omni,1-2 个时间点 | 4,427 人 |
| 心脏与脑 MRI | 特定检查周期 | 子集 |
§3.3 数据格式详情
| 形态 | 格式 | 说明 |
|---|---|---|
| 教学数据集 | CSV / SAS(.sas7bdat)+ PDF 文档 | BioLINCC Teaching Studies 页直接下载;Kaggle 有 CC0 镜像(4240 行 period=1 变体流传亦广,注意甄别) |
| BioLINCC 临床数据 | SAS 数据集 + PDF 编码手册 | 按研究(framcohort 等)与变量包分发 |
| dbGaP | 授权下载包(phenotype 文本 + IDAT/VCF/PLINK 等组学格式) | phs000007 顶层 + 子研究(phs000008 Main Exams、phs000009、phs000014 Sequence of Events 等) |
| 影像 | DICOM | 经 FHS 影像子研究单独申请(如 EGA phs003593 超声心动图影像) |
§3.4 存储大小
| 形态 | 大小 | 备注 |
|---|---|---|
| 教学数据集 | ~1.4 MB(CSV) | 任何笔记本内存即可处理 |
| BioLINCC 临床变量包 | 数十至数百 MB | 取决于申请变量与队列范围 |
| dbGaP 组学 | 数十 GB(原始 IDAT/VCF) | 建议在 NIH BioData Catalyst 云端分析 |
| 影像子研究 | TB 级 | 单独申请 |
§3.5 标注方式
FHS 的"标签"产生机制分三层,与 ML 数据集的手工标注有本质区别:
- 委员会判定终点(金标准级):心梗、卒中、心衰、心绞痛、间歇性跛行、死亡——由医师终点评审委员会基于全部可得病历逐例评审,75 年保持统一标准。这是 FHS 标签质量远超一般 EHR 数据集的根本原因。
- 标准化定量测量:血压、血脂、血糖等由诊所按标准方案测量,跨时代的设备/方法变迁(水银血压计→自动设备;血脂测定方法学升级)构成隐性的"测量漂移"。
- 自报变量:吸烟(CURSMOKE/CIGPDAY)、教育程度(educ)、用药(BPMEDS)等问卷变量,存在自报偏倚。
§3.6 标注者资质
终点判定的标注者即 FHS 医师终点评审委员会——由心血管、神经科医师组成,基于标准化 Sequence of Events 表单评审。心衰判定使用 McKee-Kannel 1971 标准(2 项主要 或 1 主要+2 次要标准),该标准后被全球多个队列沿用。血压等检查由经统一培训的 FHS 诊所技师按 protocol 执行,各检查周期均有公开的 Exam Cycle Protocol Manual。
§3.7 数据采集时间范围
1948-10-11 至今。教学数据集切片为约 1956-1968 年三次检查(period 1/2/3,间隔约 6 年)+ 24 年事件随访。事件随访公开数据更新至 2022 年。
§3.8 地理覆盖
单镇——美国马萨诸塞州弗雷明汉镇(波士顿以西约 32 公里)。参与者现已迁居全球,但基线全部来自该镇。单镇、单时代、单一种族构成是 FHS 最核心的外推性限制(详见 §7.3)。
§3.9 采集设备规格
| 项目 | 规格/方法 | 覆盖时段 | 说明 |
|---|---|---|---|
| 血压测量 | 标准水银柱/校准自动设备,坐位 3 次取后两次均值 | 全周期 | 教学集 SYSBP/DIABP 口径 |
| 心电图 | 12 导联标准 ECG | 全周期 | — |
| 超声心动图 | 标准化协议(M 型→二维→多普勒) | Original ex18-32 / Offspring ex3-10 等 | 设备代际更替构成影像漂移 |
| 心脏 CT | MDCT 冠脉钙化扫描 | 4,427 人 | — |
| 基因分型 | Affymetrix 500K+50K(SHARe)/ 外显子组 / TOPMed WGS | 2007 起 | dbGaP 分发 |
§3.10 深度溯源链
| 环节 | 系统/方法 | 关键转换 |
|---|---|---|
| 1. 数据源 | 弗雷明汉镇社区人群(1948 年无 CVD 居民) | 入组时基线无临床 CVD → 自然实验起点 |
| 2. 周期检查 | FHS 诊所标准化 exam(2-4 年周期) | 临床测量+血尿样本+影像,75 年代际设备变迁 |
| 3. 事件监测 | 邮寄问卷+电话+医院/诊所病历+死亡证明 | 连续监测,99% 随访率 |
| 4. 终点判定 | 医师终点评审委员会(Sequence of Events) | 病历 → 标准化判定终点数据集(dbGaP phs000014) |
| 5. 组学检测 | SHARe/CARe/ESP/SABRe/TOPMed | 生物样本 → GWAS/测序/蛋白组/代谢组 |
| 6. 去标识化与分发 | NHLBI(教学集匿名化扰动)→ BioLINCC(编码临床数据)→ dbGaP(编码组学+表型,DAC 授权) | 三路径分级开放;教学集经扰动且禁止发表 |
§4 数据结构详解
§4.0 目录结构预览
教学数据集(BioLINCC Teaching Studies 下载后):
fhs-teaching/
├── frmgham.csv # 长格式主文件:11,627 行 × 39 列(每人 1-3 行)
├── frmgham.sas7bdat # SAS 版本(同一内容)
├── FHS_Teaching_Longitudinal_Data_Documentation_2021a.pdf # 官方数据字典(必读)
└── README / License # 使用条款:禁止用于发表
dbGaP phs000007 授权下载后的典型结构:
phs000007.Framingham/
├── phs000007.vXX.pht00XXXX.vX.Framingham_Subject.data_dict.xml # 受试者表数据字典
├── phs000007.vXX.pht00XXXX.vX.Framingham_Subject.txt # 受试者表型数据
├── phs000007.vXX.pht00XXXX.vX.Framingham_Pedigree.txt # 家系结构表
├── substudies/
│ ├── phs000008/ # Main Exams(14,173 consented)
│ ├── phs000009/ # Basic Participant Exam Information
│ ├── phs000014/ # Sequence of Events(终点判定)
│ └── ... # SABRe 组学、影像索引等子研究
└── molecular/ # IDAT / VCF / PLINK(SHARe 55 万 SNP)
§4.1 DAIMS 标准化字段描述表(教学数据集核心变量)
受试者与检查结构
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| RANDID | INTEGER | 匿名化参与者 ID | 95148 | 分组键(划分/聚类) | 无 | 不允许缺失 | 2448-999312 |
| PERIOD | INTEGER | 检查周期 | 2 | 纵向结构轴 | 无 | 不允许缺失 | 1 / 2 / 3 |
| TIME | INTEGER | 距 period 1 天数 | 2128 | 纵向时间对齐 | 无 | 不允许缺失 | ≥0 天 |
| SEX | INTEGER | 性别 | 2 | 协变量/分层(评分按性别分层) | 无 | 不允许缺失 | 1=男 / 2=女 |
| AGE | INTEGER | 检查时年龄 | 58 | 核心风险因素 | 无 | 不允许缺失 | 32-81 |
风险因素变量(每次检查时测量)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| SYSBP | FLOAT | 收缩压(三次测量后两次均值) | 130.0 | 核心预测变量 | 时代设备变迁 | SAS “.” 缺失 | 83.5-295 mmHg |
| DIABP | FLOAT | 舒张压(同口径) | 84.0 | 核心预测变量 | 同上 | SAS “.” 缺失 | 30-150 mmHg |
| TOTCHOL | INTEGER | 血清总胆固醇 | 245 | 预测变量(⚠️ 非 LDL) | 方法学时代变迁 | SAS “.” 缺失 | 107-696 mg/dL |
| HDLC / LDLC | FLOAT | HDL/LDL 胆固醇 | 48.0 | 预测变量 | 高缺失率(尤其 period 1) | 大量 “.”(MNAR:早期未常规检测) | — |
| GLUCOSE | INTEGER | 随机血糖 | 78 | 预测变量 | 非空腹口径 | 缺失率高 | 39-478 mg/dL |
| CURSMOKE | INTEGER | 当前吸烟 | 1 | 预测变量 | 自报偏倚 | “.” | 0 / 1 |
| CIGPDAY | FLOAT | 每日吸烟支数 | 20 | 剂量变量 | 自报;不吸烟者=0 | 与 CURSMOKE 耦合缺失 | 0-90 |
| BMI | FLOAT | 体质指数 | 25.4 | 预测变量 | 无 | “.” | 14.43-56.8 |
| HEARTRTE | FLOAT | 心率 | 75 | 辅助变量 | 无 | “.” | 44-143 |
| DIABETES | INTEGER | 糖尿病(用药或随机血糖 ≥200) | 0 | 预测变量 | 定义口径宽松 | “.” | 0 / 1 |
| BPMEDS | INTEGER | 服用降压药 | 0 | 预测变量(评分含此项) | 自报 | “.” | 0 / 1 |
| educ | INTEGER | 教育程度 | 2 | 社会经济协变量 | 自报 | 部分版本无此列 | 1-4 |
基线患病与事件变量(⚠️ 事件变量覆盖整个 24 年随访、不随 PERIOD 变化)
| 字段名 | 数据类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| PREVCHD | INTEGER | 基线患冠心病 | 0 | 队列过滤 | 委员会判定 | “.” | 0 / 1 |
| PREVAP / PREVMI / PREVSTRK / PREVHYP | INTEGER | 基线心绞痛/心梗/卒中/高血压 | 0 | 队列过滤 | 委员会判定 | “.” | 0 / 1 |
| ANGINA / HOSPMI / MI_FCHD / ANYCHD | INTEGER | 随访期心绞痛/住院心梗/心梗或致死性 CHD/任一 CHD | 0 | 标签 | 委员会判定 | 无(0/1 恒定) | 0 / 1 |
| STROKE / CVD / DEATH | INTEGER | 随访期卒中/任一 CVD/全因死亡 | 0 | 标签 | 委员会判定 | 无 | 0 / 1 |
| HYPERTEN | INTEGER | 随访期新发高血压 | 0 | 标签/协变量 | 按血压与用药判定 | 无 | 0 / 1 |
| TIMEAP / TIMEMI / TIMEMIFC / TIMECHD / TIMESTRK / TIMECVD / TIMEDTH / TIMEHYP | INTEGER | 对应事件距基线天数(未发生=删失天数) | 3607 | 生存分析时间轴 | 右删失 | 无 | ≥0 天 |
教学数据集 39 个变量完整速查(按官方文档分组):
| 分组 | 变量 |
|---|---|
| 标识与时间(3) | RANDID, PERIOD, TIME |
| 人口学(3) | SEX, AGE, educ |
| 血压(3) | SYSBP, DIABP, BPMEDS |
| 血脂血糖(4) | TOTCHOL, HDLC, LDLC, GLUCOSE |
| 生活方式(3) | CURSMOKE, CIGPDAY, BMI |
| 其他检查(1) | HEARTRTE |
| 基线患病(5) | PREVCHD, PREVAP, PREVMI, PREVSTRK, PREVHYP |
| 基线糖尿病(1) | DIABETES |
| 事件指示(8) | ANGINA, HOSPMI, MI_FCHD, ANYCHD, STROKE, CVD, DEATH, HYPERTEN |
| 事件时间(8) | TIMEAP, TIMEMI, TIMEMIFC, TIMECHD, TIMESTRK, TIMECVD, TIMEDTH, TIMEHYP |
§4.2 标签分布统计
以教学数据集 period 1(4,434 人,基线)24 年随访口径:
| 终点 | 阳性数(约) | 阳性率 | 说明 |
|---|---|---|---|
| ANYCHD(任一 CHD) | ~1,300 | ~29% | 24 年长随访下事件率高,类别不平衡温和 |
| MI_FCHD(心梗或致死性 CHD) | ~640 | ~14% | — |
| STROKE | ~490 | ~11% | — |
| CVD(复合) | ~1,480 | ~33% | 最常用教学标签 |
| DEATH(全因死亡) | ~1,700 | ~38% | 竞争风险显著 |
| HYPERTEN(新发高血压) | ~1,600 | ~36% | — |
注:以上为约数,具体随版本与基线过滤口径略有出入;Kaggle 流传的 4,240 行版本中 TenYearCHD(自定义 10 年标签)阳性率约 15.2%。
§4.3 关键字段描述性统计
- period 1 基线:年龄 32-81 岁(均值约 50);男性约 44%(SEX=1);当前吸烟者约 49%(1956-1968 时代特征,远高于当代)。
- SYSBP 均值约 133 mmHg(83.5-295);TOTCHOL 均值约 237 mg/dL(107-696);BMI 均值约 25.6。
- 基线患病:PREVHYP 约 31%;PREVCHD / PREVMI / PREVSTRK 各 <5%(入组时已排除临床 CVD,残余为期间发病)。
- 缺失集中区:GLUCOSE(约 20-25%)、HDLC/LDLC(period 1 高缺失)、educ;缺失机制见 §4.5。
§4.4 数据层级关系
教学数据集(长格式):
参与者(RANDID,4,434 人;SEX 为时不变变量)
└─ 检查(PERIOD 1/2/3;每人 1-3 行;AGE/TIME/全部风险因素随时点变化)
├─ 时变风险因素:SYSBP, DIABP, TOTCHOL, BMI, CURSMOKE, ...
├─ 基线患病:PREV*(随 PERIOD 演进:period 2 时 prevchd 可能转为 1)
└─ 事件与随访时间:ANGINA/CVD/DEATH + TIME*(⚠️ 不随 PERIOD 变化,恒为全随访期口径)
全队列(dbGaP 端):
家系(PEDIGREE,900+ 家系)
└─ 参与者(subject ID,三代+Omni)
├─ 检查表(exam 周期 × cohort;phs000008/009 等)
├─ 终点表(Sequence of Events,phs000014)
├─ 组学(SHARe SNP / 测序 / SABRe 多组学)
└─ 影像索引(超声/CT/MRI,单独申请)
高频踩坑:教学集中 SEX 恒定而 AGE 随时点增长;事件变量对 period 2/3 的行同样取"全随访期"值——用 period 2 特征 + CVD 标签时,该事件可能发生在 period 2 之前,构成反向时间泄漏(见 §6.5 坑点 2)。
§4.5 缺失值情况与信息性缺失编码
| 缺失类型 | 变量示例 | 缺失原因 | 信息性缺失编码 | 对 AI 的影响 |
|---|---|---|---|---|
| SAS 系统缺失 | 全部变量 | 以 “.” 编码 | 读入 pandas 自动转 NaN | 直接 na_values="." 读取 |
| MNAR_protocol | HDLC / LDLC(period 1) | 早期检查未常规测定 | 缺失 ≈ 早期年代 | 简单插补会抹掉时代信号;建议按 PERIOD 分层处理 |
| MAR_clinical | GLUCOSE(约 20-25%) | 非空腹随机血糖,部分检查未测 | 缺失与就诊流程相关 | 多重插补或以 DIABETES 替代 |
| MCAR 近似 | BMI / HEARTRTE(<5%) | 现场漏测 | 低信息 | 中位数插补可接受 |
| 结构性缺失 | CIGPDAY(不吸烟者=0) | 与 CURSMOKE 耦合 | 0 非缺失 | 勿将 0 当缺失插补 |
| 删失 | TIME* 未达事件者 | 右删失 | 生存=删失而非阴性 | 必须 Kaplan-Meier/Cox 框架,勿当 0/1 标签直接分类 |
§5 数据划分与使用建议
§5.1 官方数据划分
FHS 不提供任何官方 train/validation/test 划分。 教学数据集与 BioLINCC/dbGaP 数据均为原始纵向结构,划分完全由使用者负责。风险评分文献的惯例是:在同一数据内以 2/3 训练 + 1/3 验证,或报告全样本拟合 + 外部队列验证(D’Agostino 2001 的多队列验证即此范式)。
§5.2 推荐划分策略
- 按 RANDID 分组划分(强制):教学数据集每人 1-3 行,任何划分必须以 RANDID 为组——这是本数据集第一铁律。
- 横断面快照法(教学友好):取 period 1 行(4,434 人)作为"基线特征 → 随访事件"的标准监督学习框架,与文献风险评分口径一致。
- 时代外验证(准外部验证):以 PERIOD 或年代分层(period 1+2 训练 → period 3 验证),检验跨检查周期的稳健性。
- 全队列家系感知划分(dbGaP 端):按家系 ID 分组划分,避免亲属跨训练/测试集。
import pandas as pd
from sklearn.model_selection import GroupShuffleSplit
df = pd.read_csv("frmgham.csv", na_values=".")
base = df[df["PERIOD"] == 1].copy() # 横断面快照
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr, te = next(gss.split(base, groups=base["RANDID"]))
assert not set(base.iloc[tr].RANDID) & set(base.iloc[te].RANDID)
§5.3 数据泄漏风险防御
| # | 泄漏模式 | 严重程度 | 防御措施 |
|---|---|---|---|
| 1 | 长格式按行随机划分(同一 RANDID 跨训练/测试) | 高 | GroupShuffleSplit(groups=RANDID) |
| 2 | period 2/3 特征 + 恒定事件标签(事件可能先于特征发生) | 高 | 仅用 period 1 基线特征;或按 TIME 重建时点正确的事件口径 |
| 3 | 将 PREV*(患病史)用作预测"新发同病种"的特征 | 中 | 定义终点时先排除对应 PREV*=1 者 |
| 4 | 用 TIMECVD 等随访时间变量作特征 | 高 | TIME* 只能作生存时间轴,严禁入模 |
| 5 | 删失当阴性:24 年未随访完者计 CVD=0 | 中 | 用生存分析框架而非硬标签分类 |
§5.4 交叉验证建议
- 标准:5-10 折 GroupKFold(groups=RANDID)。
- 校准研究:划分独立的校准集(calibration set),分别报告判别度(C-index/AUROC)与校准度(calibration slope、Hosmer-Lemeshow、校准曲线)——风险评分研究只报 AUROC 是方法学缺陷。
- 家系数据(dbGaP):以家系为折叠轴。
§5.5 外部验证
FHS 训练的风险模型经典外部验证路径:ARIC / CHS / MESA(美国同类 NHLBI 队列,BioLINCC/dbGaP 同通道)、UK Biobank、REGICOR(西班牙,Marrugat 2003 适配)、中国多省市队列(Liu 2004 JAMA 适配)。历史结论一致:FRS 在非欧洲裔人群系统性高估风险,需重新校准(recalibration)后可用(D’Agostino 2001)。
§6 AI 就绪指南
§6.0 云端快速启动
零门槛体验:教学数据集无需注册即可从 BioLINCC Teaching Studies 页下载(CSV ~1.4 MB)。下载后在任何能跑 pandas 的环境(含 Colab 免费 CPU)中,5 分钟内可完成"加载 → period 1 快照 → Logistic 回归 10 年 CVD 风险模型 → AUROC 输出"全流程。Kaggle 搜索 “Framingham” 有数千个公开 notebook 可参考(注意甄别 4,240 行变体与官方 11,627 行长格式的差异)。
§6.1 快速上手
# ========================================
# Framingham 教学数据集快速上手 — scikit-learn 版
# 环境要求: pandas, scikit-learn
#
# ⚠️ 目录结构预期:
# ./data/frmgham.csv # BioLINCC Teaching Studies 下载的 CSV
# 长格式:每人 1-3 行(PERIOD=1/2/3),RANDID 为参与者键
# 缺失值以 "." 编码,需 na_values="."
# ⚠️ 事件变量(CVD/ANYCHD/DEATH 等)覆盖整个 24 年随访,
# 不随 PERIOD 变化——仅使用 PERIOD==1 的基线特征做预测!
# ========================================
import pandas as pd
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import GroupShuffleSplit
from sklearn.metrics import roc_auc_score, brier_score_loss
df = pd.read_csv("./data/frmgham.csv", na_values=".")
# 步骤 1:横断面快照——period 1 基线特征预测随访 CVD
base = df[df["PERIOD"] == 1].copy()
features = ["AGE", "SEX", "SYSBP", "DIABP", "TOTCHOL",
"CURSMOKE", "CIGPDAY", "BMI", "DIABETES", "BPMEDS", "HEARTRTE"]
base = base.dropna(subset=features + ["CVD"])
X, y = base[features], base["CVD"]
# 步骤 2:按 RANDID 分组划分(period 1 每人仅 1 行,此处为防御性写法)
gss = GroupShuffleSplit(n_splits=1, test_size=0.2, random_state=42)
tr, te = next(gss.split(X, groups=base["RANDID"]))
# 步骤 3:基线模型
model = LogisticRegression(max_iter=2000).fit(X.iloc[tr], y.iloc[tr])
prob = model.predict_proba(X.iloc[te])[:, 1]
print(f"AUROC: {roc_auc_score(y.iloc[te], prob):.3f}") # 预期约 0.73-0.76
print(f"Brier: {brier_score_loss(y.iloc[te], prob):.3f}")
§6.2 数据获取流程
| 获取方式 | 链接/位置 | 大小 | 流程 |
|---|---|---|---|
| NHLBI 教学数据集 | https://biolincc.nhlbi.nih.gov/teaching/ | ~1.4 MB | 直接下载,无需注册;禁止用于发表 |
| BioLINCC 临床数据 | https://biolincc.nhlbi.nih.gov/studies/framcohort/ | 按变量包 | ① 注册 BioLINCC 账号;② 在线提交数据申请(研究计划摘要);③ NHLBI 审核(数周);④ 签署 DUA 后下载;免费 |
| dbGaP 组学+表型 | phs000007(Framingham Cohort) | 数十 GB | ① eRA Commons 账号;② 提交 Data Access Request(含研究用途声明);③ 机构 Signing Official 签批 + 本地 IRB 文件;④ NHLBI DAC 审批;⑤ 下载或在 BioData Catalyst 云端分析 |
| FHS Repository | https://www.framinghamheartstudy.org/fhs-for-researchers | 视提案 | 提交 FHS Research Application;评审委员会审查;可能收取服务费 |
| 影像子研究 | 如 EGA phs003593(超声心动图影像) | TB 级 | 经 dbGaP/EGA 授权访问 |
DUA/DUC 核心义务:不得尝试重识别参与者;不得用于家系结构重建以识别个人或家族;dbGaP 数据仅限基因-表型关联研究(纯表型分析须走 BioLINCC);HMB consent 禁止祖源/人群起源研究;发表时按规范引用 FHS 与 NHLBI。
申请时间预期(社区经验):BioLINCC 审核通常数周;dbGaP 从 eRA Commons 注册到 DAC 批准需数周至数月(IRB 文件与机构签批是主要耗时环节),立项时应把申请周期写入计划。教学数据集是唯一"今天下载今天用"的路径。
§6.3 预处理 Pipeline
<details>
<summary><b>点击展开完整的 5 步预处理代码(教学数据集 → 建模宽表)</b></summary>
import pandas as pd
import numpy as np
# 步骤 1:读取与缺失编码
df = pd.read_csv("frmgham.csv", na_values=".")
print(df.shape) # 期望 (11627, 39)
# 步骤 2:横断面快照 + 队列过滤(基线无 CVD,与风险评分口径一致)
base = df[df["PERIOD"] == 1].copy()
base = base[base["PREVCHD"] == 0] # 预测 CHD 时排除基线患者
# 步骤 3:缺失处理(按机制分层)
# - 低缺失变量:中位数插补
# - GLUCOSE:缺失率高,生成缺失指示变量后插补
# - HDLC/LDLC:period 1 大面积缺失 → 本快照直接弃用这两列
for col in ["SYSBP", "DIABP", "TOTCHOL", "BMI", "HEARTRTE", "CIGPDAY"]:
base[col] = base[col].fillna(base[col].median())
base["GLUCOSE_missing"] = base["GLUCOSE"].isna().astype(int)
base["GLUCOSE"] = base["GLUCOSE"].fillna(base["GLUCOSE"].median())
# 步骤 4:特征工程(对齐 Framingham 风险评分经典变量)
base["AGE_SEX"] = base["AGE"] * (base["SEX"] == 1) # 性别交互示例
base["SMOKE_DOSE"] = base["CURSMOKE"] * base["CIGPDAY"] # 吸烟剂量
base["PP"] = base["SYSBP"] - base["DIABP"] # 脉压
# 步骤 5:标签与时间轴
# 分类任务:y = base["ANYCHD"](24 年随访标签)
# 生存任务:surv_y = (event=base["ANYCHD"], time=base["TIMECHD"]/365.25)
feature_cols = ["AGE", "SEX", "SYSBP", "DIABP", "TOTCHOL", "CURSMOKE",
"SMOKE_DOSE", "BMI", "DIABETES", "BPMEDS", "GLUCOSE",
"GLUCOSE_missing", "HEARTRTE", "PP"]
X = base[feature_cols]
y = base["ANYCHD"]
print(f"快照样本: {X.shape}, 阳性率: {y.mean():.3f}")
</details>
**纵向分析(混合效应模型/轨迹)*则保留长格式全量 11,627 行,以 RANDID 为随机截距;生存分析直接用(TIME, 事件指示)二元组接入 lifelines 或 R survival。
§6.4 框架加载
# scikit-learn / XGBoost:快照宽表直接入模(见 §6.1/§6.3)
import xgboost as xgb
dtrain = xgb.DMatrix(X_train, label=y_train)
params = {"objective": "binary:logistic", "eval_metric": "auc",
"scale_pos_weight": (len(y_train) - y_train.sum()) / y_train.sum(),
"max_depth": 4, "learning_rate": 0.05}
model = xgb.train(params, dtrain, num_boost_round=400)
# 生存分析:lifelines Cox 比例风险模型
from lifelines import CoxPHFitter
surv_df = base[["AGE", "SEX", "SYSBP", "TOTCHOL", "CURSMOKE",
"DIABETES", "BPMEDS"]].copy()
surv_df["T"] = base["TIMECHD"] / 365.25 # 天 → 年
surv_df["E"] = base["ANYCHD"]
cph = CoxPHFitter().fit(surv_df, duration_col="T", event_col="E")
cph.print_summary() # 对照 Kannel/Wilson 的 HR
# R 生态:survival 包复现性别分层 Cox(与 Wilson 1998 同框架)
library(survival)
base <- subset(read.csv("frmgham.csv", na.strings = "."), PERIOD == 1 & PREVCHD == 0)
base$T <- base$TIMECHD / 365.25
fit <- coxph(Surv(T, ANYCHD) ~ AGE + TOTCHOL + SYSBP + BPMEDS +
CURSMOKE + DIABETES + strata(SEX), data = base)
summary(fit) # 对照原文 HR;concordance 输出 C-index
§6.5 常见坑点
⚠️ 坑点 1:教学数据集不能用于发表(分类:评估误用)
问题:NHLBI 官方明确声明教学数据集经匿名化扰动处理,“inappropriate for publication purposes”。Kaggle 上大量 notebook 与个别课程论文忽略了这一点。
症状:投稿时数据可用性声明写 “Framingham public dataset” 被审稿人质疑;结果与正式 FHS 文献对不上。
解决:课堂/原型用教学集并在作业中声明其性质;任何拟发表工作改用 BioLINCC 申请正式临床数据(免费)。
参考:BioLINCC FHS Teaching Dataset Documentation 2021a(原文 NOTE 段)。
⚠️ 坑点 2:事件变量不随 PERIOD 变化——结构性时间泄漏(分类:数据泄漏)
问题:教学集中 CVD/ANYCHD/DEATH 等事件变量对同一人所有行取同一恒定值(整个 24 年随访口径)。用 period 2/3 的特征预测"恒定事件",事件可能发生在该次检查之前——特征在时间上晚于结局。
症状:period 3 行训练的模型 AUROC 异常高(0.85+),且 PREV* 变量成为最强"特征"。
解决:仅用 PERIOD==1 的基线特征做预测(§6.3 步骤 2);若必须用多 period,需按 TIME* 重建每个时点的正确结局口径。
参考:BioLINCC 官方文档中对 participant 95148 的示例说明。
⚠️ 坑点 3:长格式按行划分导致同一参与者泄漏(分类:数据泄漏)
问题:11,627 行中每人占 1-3 行,随机按行划分会把同一 RANDID 的不同检查行同时分进训练与测试。
症状:测试集 AUROC 虚高 3-6%。
解决:
GroupShuffleSplit(groups=RANDID);划分后断言 RANDID 零交集。参考:sklearn GroupShuffleSplit 文档;§5.2 代码。
⚠️ 坑点 4:SAS 缺失值 “.” 被读成数值或字符串(分类:预处理陷阱)
问题:SAS 导出的缺失以小数点 “.” 表示,pandas 默认不识别,整列被读成 object,或 “.” 被静默丢弃导致列错位。
症状:数值列 dtype=object;
describe()不输出统计量;个别行字段错位。解决:
pd.read_csv(..., na_values=".");读入后df.dtypes逐列核对;官方文档明确缺失以 “.” 编码。参考:FHS Teaching Dataset Documentation 2021a。
⚠️ 坑点 5:把删失当阴性——24 年随访的生存数据结构(分类:标签理解)
问题:CVD=0 不等于"终生不发生",而是"随访期内未观察到"(右删失);DEATH 与 CVD 存在竞争风险。直接当 0/1 硬标签训练分类器,会系统性低估高龄、随访短者的风险。
症状:模型在高龄亚群校准差;与文献报告的 10 年风险不可比。
解决:方法学严谨时使用 Cox/Fine-Gray 框架(lifelines/survival);若做教学分类,声明"24 年观察窗标签"口径,并用 TIME* 做亚组敏感性分析。
参考:D’Agostino 2008(Circulation 117:743-753)的生存分析口径。
⚠️ 坑点 6:1956-1968 的时代分布与当代不可比(分类:偏倚陷阱)
问题:教学集切片来自他汀问世前、降压治疗有限、吸烟率约 49% 的时代;TOTCHOL 而非 LDL 是主血脂变量;无当代药物与介入治疗背景。
症状:模型学到"吸烟权重极高";拿到当代人群(如 UK Biobank)上校准严重高估风险。
解决:时代局限写进方法学;跨时代迁移必须重新校准基线风险(recalibration);勿用教学集模型指导任何当代临床判断。
参考:D’Agostino 2001(JAMA 286:180-187)多种族/多时代校准结论。
⚠️ 坑点 7:家系相关性违反独立同分布假设(分类:偏倚陷阱)
问题:FHS 是 900+ 家系的三代队列,亲属间表型相关。dbGaP/BioLINCC 全量数据若当 i.i.d. 样本处理,标准误被低估、显著性被夸大。
症状:GWAS 或风险因素关联的 p 值系统性偏小;置信区间过窄。
解决:家系聚类稳健标准误、GEE 或混合效应模型;GWAS 用家系感知方法(如 SOLAR/merlin 系);划分时按家系分组。教学集已去除家系信息,无此问题但也无法作家系研究。
参考:SHARe 方法论文(BMC Medical Genetics 2007 增刊);dbGaP phs000007 pedigree 表。
⚠️ 坑点 8:dbGaP 与 BioLINCC 权限错配(分类:工程陷阱)
问题:FHS 数据分散在三个平台且用途互斥——dbGaP 明文规定 Framingham 数据仅限基因-表型关联研究,纯表型分析在 dbGaP 被禁止;教学集禁止发表;BioLINCC 不含组学。
症状:在 dbGaP 申请纯临床表型分析被 DAC 拒;或在教学集上写完论文才发现不能发表。
解决:立项先按 §3.0 矩阵定路径;跨平台合并同一参与者数据需确认各平台 DUA 兼容性;引用时区分数据来源平台。
参考:dbGaP phs000007 Data Use Limitations 原文;FHS 官网 “Available FHS Data” 页。
§6.6 数据增强
| ✅ 安全增强 | ❌ 危险增强(禁止) |
|---|---|
| 对连续风险因素加小幅生理合理噪声(如 SYSBP ±2 mmHg) | SMOTE 等合成少数类(破坏流行病学校准,HR 失真) |
| 缺失模式扰动模拟 MAR | 对 RANDID/家系结构做任何变换 |
| 分性别/年龄段 bootstrap 重采样 | 跨 PERIOD 随机拼接特征(制造不存在的人-时点组合) |
| 风险因素对数/样条变换(非线性建模) | 对事件标签做任何"平衡"后再做生存分析 |
§6.7 模型推荐
| 任务 | 推荐方法 | 特征方案 | 预期性能(教学集快照口径) |
|---|---|---|---|
| 经典风险评分复现 | Cox 比例风险(性别分层) | Wilson 1998 变量集 | C-index 约 0.72-0.75(CHD) |
| 快速基线 | Logistic Regression | §6.3 特征 | AUROC 约 0.73-0.76(CVD) |
| 非线性提升 | XGBoost / LightGBM | 同左 + 交互项 | AUROC 约 0.76-0.79 |
| 生存分析教学 | Kaplan-Meier + Cox + Fine-Gray | TIME* + 事件指示 | 对照文献 HR |
| 纵向轨迹 | 混合效应模型 / LCGA | 长格式全量 | — |
| GWAS(dbGaP) | PLINK + 家系感知方法 | SHARe 55 万 SNP | — |
§6.8 计算资源需求
| 硬件 | 教学数据集 | BioLINCC 临床全量 | dbGaP 组学 |
|---|---|---|---|
| 磁盘 | <10 MB | 数百 MB | 50-200 GB(建议云端) |
| 内存 | 任意(<1 GB) | 8 GB | 32 GB+ |
| GPU | 不需要 | 不需要 | 不需要(统计遗传为 CPU 任务) |
| 训练时间 | 秒级 | 分钟级 | 小时-天级 |
| 云端替代 | Colab 免费层 | Colab 免费层 | NIH BioData Catalyst |
§6.9 评估指标
from sklearn.metrics import roc_auc_score, brier_score_loss
from lifelines.utils import concordance_index
# 判别度
print(f"AUROC: {roc_auc_score(y_test, prob):.3f}")
# 校准度(风险评分研究必须报告)
print(f"Brier: {brier_score_loss(y_test, prob):.3f}")
# 生存模型
print(f"C-index: {concordance_index(T_test, -risk_score, E_test):.3f}")
社区共识(风险预测方法学):判别度(C-index/AUROC)与校准度(calibration slope、校准曲线、Brier)必须同时报告;与 Framingham Risk Score / Pooled Cohort Equations 的对比需在同一人群同一终点口径下进行;外部队列报告重新校准前后两套结果。
§6.10 MLOps 笔记
- 来源声明:任何产物必须注明数据路径(教学集 / BioLINCC / dbGaP)与版本/访问日期;教学集产物标注"不可发表"。
- 口径锁定:SYSBP 是"三次测量后两次均值"、TOTCHOL 非 LDL、事件为 24 年随访口径——写进数据卡。
- 引用义务:使用 FHS 数据发表须引用队列文献(见 §9),dbGaP 数据还须注明 accession(phs000007)。
- 可复现性:随机种子 + RANDID 分组划分文件入库保存,教学集虽公开但 Kaggle 变体众多,务必记录原始下载 URL 与文件哈希。
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 | 描述 | 严重程度 | 缓解措施 |
|---|---|---|---|
| 祖源单一偏倚 | 三大主队列约 100% 欧洲裔白人;Omni 队列仅 916 人 | 高 | 非欧洲裔外推必须重新校准;Omni 队列仅支持探索性分析 |
| 单镇时代偏倚 | 1948 年弗雷明汉中产社区;教学集切片 1956-1968,无他汀与现代治疗背景 | 高 | 时代局限声明;跨时代模型重新校准基线风险 |
| 健康志愿者偏倚 | 志愿参与者较一般人群更健康、依从性更高;99% 随访率本身即证据 | 中 | 绝对风险估计向下偏,相对危险度受影响较小 |
| 存活者偏倚 | 参加 period 2/3 检查者必须活到且能到场——晚期检查人群系统性更健康 | 中高 | 纵向分析用联合建模/逆概率加权校正 |
| 自报偏倚 | 吸烟、用药、教育为自报 | 中 | 敏感性分析;与客观测量交叉验证 |
| 家系相关偏倚 | 900+ 家系,i.i.d. 假设不成立 | 中 | 聚类稳健方差/GEE/混合模型 |
| 测量时代漂移 | 血压计、血脂方法学、超声设备 75 年代际更替 | 中 | 按检查周期分层;方法学变迁记入局限 |
| 教学集扰动偏倚 | 教学集经匿名化扰动,分布与原始数据存在刻意偏差 | 高(对发表) | 仅用于教学,禁止发表 |
§7.2 标注质量评估
| 标注类型 | 可靠性 | 一致性 | 局限性 |
|---|---|---|---|
| 委员会判定终点(心梗/卒中/心衰/死亡) | 极高——医师委员会逐例评审,75 年统一标准 | 跨时代口径一致(Sequence of Events 表单) | 镇外发生事件依赖病历获取,存在残余漏检 |
| 血压/生化测量 | 高——标准化 protocol | 设备/方法学时代漂移 | 教学集无空腹血糖、无常规 LDL(period 1) |
| 自报行为变量 | 中 | — | 吸烟/用药社会期许偏倚 |
| 教学集标签 | 与原始判定一致但经扰动 | — | 不可发表 |
| 基因分型(SHARe) | 高——标准 GWAS 质控 | Affymetrix 平台标准 | 55 万 SNP 密度低于当代 WGS |
§7.3 泛化性讨论
| 场景 | 失效风险 | 证据 |
|---|---|---|
| 跨种族(欧洲裔 → 非裔/亚裔/拉丁裔) | 高 | D’Agostino 2001(JAMA 286:180-187)多队列验证:FRS 在其他族裔系统性高估,需重新校准 |
| 跨国家(美国 → 欧洲/中国) | 中高 | Liu 2004(JAMA)中国队列、Marrugat 2003 西班牙 REGICOR 均需适配后才可用 |
| 跨时代(1956-1968 → 当代) | 高 | 治疗背景(他汀、降压、介入)根本改变风险-结局关系;教学集模型不可用于当代 |
| 跨队列(FHS → ARIC/CHS) | 低-中 | 同类 NHLBI 社区队列间校准后判别度保持良好(D’Agostino 2001) |
| 跨亚群体(女性/高龄) | 低-中 | FHS 自始按性别分层建模;≥80 岁样本稀疏 |
§7.4 伦理考量
- FHS 数据来自三代真实家庭,许多参与者已去世;其 75 年、99% 随访率的奉献是科学公共品,研究者应怀有相应敬意。
- 全部数据经编码去标识;dbGaP DUC 明确禁止重识别尝试、禁止利用家系结构识别个人或家族、禁止祖源/人群起源研究(HMB consent)。
- 教学集扰动处理是参与者保护的一部分——利用扰动特征尝试"还原"原始值违反使用精神。
- 三大主队列的种族单一性既是历史事实也是伦理提醒:基于 FHS 的风险工具直接用于非欧洲裔人群曾造成系统性风险高估,公平性校正是使用者的责任而非可选项。
- 影像与组学数据涉及更深层个人信息(WGS 可识别性强),须严格在授权平台内分析。
§7.5 公平性评估
from fairlearn.metrics import MetricFrame
from sklearn.metrics import roc_auc_score
# 教学集可用的公平性轴:性别(风险评分文献的核心分层轴)
frame = MetricFrame(
metrics={"AUROC": roc_auc_score},
y_true=y_test, y_pred=prob,
sensitive_features=X_test["SEX"] # 1=男 2=女
)
print(frame.by_group)
已知公平性事实:FHS 三大主队列无种族多样性可言,任何 FHS 训练模型的"跨族裔公平性"无法内部评估——这是数据结构性限制,必须依靠 ARIC/Jackson Heart Study/MESA 等多族裔队列外部评估;性别维度上,Wilson 1998 即按性别分别建模,单性别合并模型会在女性亚群校准偏差。
§7.6 数据漂移提示
- FHS 本身就是一部"漂移测量仪":1956-1968 教学集与当代人群在吸烟率(约 49% vs 当代美国约 12%)、降压/他汀使用、血脂分布上存在根本性分布漂移。
- 监控信号:风险因素分布 PSI(年龄、SYSBP、TOTCHOL、吸烟率);基线风险(baseline hazard)漂移——FRS 在当代人群的主要失效模式是基线风险高估而非权重失效,重新校准基线即可大部分修复。
- 跨 PERIOD 的内源漂移:测量设备与方法的代际更替(水银血压计→自动设备)构成隐性漂移点,纵向模型应将检查周期作为协变量。
§7.7 DAIMS 24 项数据就绪度评估
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 数据为宽格式(每行一个样本/事件) | ⚠️ | 教学集为长格式(每人 1-3 行),需自行转快照;dbGaP 按 exam 分表 |
| 2 | 有唯一标识符列 | ✅ | RANDID(教学集)/ subject ID + pedigree(dbGaP) |
| 3 | 无 Unicode 或特殊字符 | ✅ | 全 ASCII;SAS “.” 缺失编码已文档化 |
| 4 | 无重复行 | ✅ | 每人每 PERIOD 唯一行 |
| 5 | 缺失值已识别并编码 | ✅ | “.” 编码 + 官方文档说明;§4.5 机制分类 |
| 6 | 标签列被明确标识 | ✅ | ANGINA/MI_FCHD/ANYCHD/STROKE/CVD/DEATH + TIME* 成对定义 |
| 7 | 已对罕见类别(<3%)进行分组 | ⚠️ | PREVSTRK/PREVMI 等低频变量未分组;教育程度 4 类无需处理 |
| 8 | 偏倚评估已完成 | ✅ | §7.1 八类偏倚 + 75 年文献累积的偏倚讨论 |
| 9 | 有完整的数据字典 | ✅ | 官方 PDF 文档(变量级定义);dbGaP 每表 XML 字典 |
| 10 | 对"信息性缺失"有明确编码解释 | ⚠️ | 缺失机制(protocol 未测 vs 漏测)需使用者按年代推断 |
| 11 | 数据采集设备和设置已记录 | ✅ | Exam Cycle Protocol Manuals 全周期公开 |
| 12 | 已移除完全共线性变量 | ⚠️ | SYSBP/DIABP、CURSMOKE/CIGPDAY 耦合保留,需自行处理 |
| 13 | 对编码的映射标准已说明 | ✅ | SEX/PERIOD/事件 0-1 编码文档完整 |
| 14 | 对时间戳的处理已明确说明 | ✅ | TIME(距 period 1 天数)+ TIME*(事件天数)口径清晰;匿名化去日期 |
| 15 | 训练/验证/测试划分建议已给出 | ❌ | 无任何官方划分;§5.2 本 Wiki 补位 |
| 16 | 数据泄漏风险已被讨论 | ⚠️ | 官方文档隐含提示(95148 示例)但未系统讨论;§5.3/§6.5 补位 |
| 17 | 标签分布已被分析 | ✅ | §4.2 + 75 年文献的发病率报告 |
| 18 | 选择性测量偏倚已被讨论 | ✅ | 存活者/健康志愿者偏倚在队列文献中充分讨论 |
| 19 | 外部验证建议已给出 | ✅ | D’Agostino 2001 多种族验证范式 + §5.5 |
| 20 | 数据更新和版本信息已记录 | ✅ | dbGaP 版本链(v1.p1 → v12.p5)完整;教学集 2021a 文档 |
| 21 | 最小必要预处理脚本已提供 | ❌ | 无官方脚本;依赖社区与本 Wiki §6.3 |
| 22 | 合规使用要求已明确 | ✅ | 三平台条款清晰(教学集禁发表/dbGaP HMB+IRB/BioLINCC DUA) |
| 23 | 多模态对齐方法已说明 | ⚠️ | 影像/组学需单独申请,跨模态 ID 对齐文档分散 |
| 24 | 去标识化方法已被记录 | ✅ | 教学集扰动声明 + dbGaP/BioLINCC 编码与 DUC/DUA 体系 |
DAIMS 评分:17 / 24
评分解读:良好——文档与终点质量是世界顶级,但作为"ML 就绪数据集"缺官方划分、预处理脚本与系统性的泄漏警示。
对你意味着什么:FHS 的 15 个 ✅ 来自流行病学史上最厚重的文档资产——委员会判定终点、全周期 protocol、完整的版本链与合规体系。扣分集中在"它本不是为 ML 设计的":长格式需自行转快照(§6.3)、无官方划分(用 §5.2 的 RANDID 分组方案)、无官方预处理脚本(用 §6.3 五步管道)、事件变量结构天然埋着时间泄漏(先读 §6.5 坑点 2/3 再写第一行代码)。建议上手顺序:教学集跑通 §6.1 → 精读坑点 1-4 → 需要发表再启动 BioLINCC 申请(预留数周审核时间)。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部测试集变化 | 关键发现 |
|---|---|---|---|---|---|
| ARIC / CHS 等美国多队列 | NHLBI 社区队列 | FRS CHD 风险验证(多种族) | C-index 约 0.65-0.75(白人);非裔/日裔/印第安人群校准差 | 校准显著高估风险 | D’Agostino 2001(JAMA):FRS 可迁移但非欧洲裔必须重新校准 |
| 中国多省市队列(CMCS) | 中国 | FRS 适配 | 校准后可用 | 原尺度大幅高估 | Liu 2004(JAMA 291:2591-2599):直接套用高估,需本地化 |
| REGICOR(西班牙) | 地中海人群 | FRS 适配 | 校准后判别度良好 | 高估 | Marrugat 2003:低发病率人群需重校准 |
| Pooled Cohort Equations 对比 | ACC/AHA 工作组 | 当代美国人群 ASCVD 风险 | PCE 优于 FRS(当代口径) | — | Goff 2013:FRS 在当代指南被 PCE 取代的直接原因 |
| UK Biobank | 英国 | 经典风险评分跨时代验证 | 判别度保留,校准漂移 | 系统性高估 | 风险因素权重稳健、基线风险时代漂移——重新校准修复 |
结论性洞察:70 年的外部验证史给出了一个反直觉但稳定的结论——FHS 数据学到的风险因素相对权重高度可迁移(血压、胆固醇、吸烟、糖尿病的方向与量级全球一致),失效的几乎总是基线绝对风险。重新校准基线(recalibration)是 FHS 模型走向任何新人群的标准动作。
§8 基准性能与生态
§8.1 排行榜
FHS 没有 Kaggle 式排行榜——它的"排行榜"是 75 年的临床风险评分谱系。以下风险函数全部在 FHS 数据上构建,构成心血管风险预测的基准族:
| 排名 | 风险函数 | 终点 | 年份 | 关键技术 | 完整引用 | 代码/工具 |
|---|---|---|---|---|---|---|
| 1 | Framingham Risk Score(CHD,分类变量版) | 10 年 CHD | 1998 | 性别分层 Cox + 风险因素类别积分表 | Wilson PWF, D’Agostino RB, Levy D, Belanger AM, Silbershatz H, Kannel WB. “Prediction of coronary heart disease using risk factor categories.” Circulation 97:1837-1847. DOI: 10.1161/01.CIR.97.18.1837 | FHS 官网 Risk Score Calculator |
| 2 | General CVD Risk Profile | 10 年总体 CVD | 2008 | 多终点 Cox + 性别分层 | D’Agostino RB, Vasan RS, Pencina MJ, Wolf PA, Cobain M, Massaro JM, Kannel WB. Circulation 117:743-753. DOI: 10.1161/CIRCULATIONAHA.107.699579 | 同上 |
| 3 | ATP III 硬 CHD 评分 | 10 年硬 CHD(心梗+冠脉死亡) | 2001-2002 | FRS 的指南适配版 | D’Agostino RB, Grundy S, Sullivan LM, Wilson P. JAMA 286:180-187 (2001) + NCEP ATP III | NCEP 计算器 |
| 4 | Framingham Stroke Risk Profile | 10 年卒中/TIA | 1991 | 性别分层 Cox | Wolf PA, D’Agostino RB, Belanger AJ, Kannel WB. Stroke 22:312-318 (1991) | — |
| 5 | Framingham HF Risk Profile | 4 年心衰 | 1999 | Cox | Kannel WB, D’Agostino RB, Silbershatz H, et al. Arch Intern Med 159:1197-1204 (1999) | — |
| 6 | CHARGE-AF(房颤) | 5 年房颤 | 2009 | 多队列 Cox(FHS 为推导队列之一) | Schnabel RB et al. / Alonso A et al. CHARGE-AF Consortium | — |
| 7 | 30 年 CVD 风险函数 | 30 年 CVD | 2009 | 长程 Cox | Pencina MJ, D’Agostino RB, Larson MG, Massaro JM, Vasan RS. Circulation 119:3078-3084 (2009) | — |
注:各风险函数终点口径、变量集与年代不同,绝对数值不可直接比较;2013 年起美国指南首选为 Pooled Cohort Equations(Goff et al., Circulation 2014),FRS 转为方法学基准与全球适配起点。
机器学习时代的代表工作(口径各异,数值不可与经典评分直接比较):
| 工作 | 数据口径 | 结果 | 说明 |
|---|---|---|---|
| 教学集 LR/RF/XGBoost 基线族(Kaggle 社区) | period 1 快照,24 年标签 | AUROC 约 0.73-0.79 | 数千公开 notebook 的收敛区间,可作自检参照 |
| Pooled Cohort Equations(Goff 2013) | 多 NHLBI 队列汇总(含 FHS) | C-index 约 0.72-0.77(ASCVD) | 取代 FRS 的当代美国指南工具 |
| QRISK3(Hippisley-Cox 2017, BMJ) | 英国 QResearch 队列 | 优于 FRS(英国人群) | 与 FRS 对比研究的常客 |
| CHARGE-AF(Alonso 2013) | 多队列含 FHS | C-index 约 0.77(5 年房颤) | FHS 数据参与推导的多队列风险模型 |
§8.2 SOTA 总结与选型建议
| 如果你… | 推荐方案 | 为什么 |
|---|---|---|
| 复现经典风险评分 | lifelines Cox + Wilson 1998 变量集(性别分层) | C-index 0.72-0.75,与原文可比 |
| 教学演示 ML 全流程 | 教学集 + Logistic/XGBoost(§6.1) | 10 分钟出结果,免申请 |
| 验证新风险预测方法 | 教学集快照 + C-index/校准双报告 + ARIC 外验 | 方法学论文标准配置 |
| 做发表级研究 | BioLINCC framcohort + 生存分析框架 | 免费用、可发表、口径权威 |
| 组学/家系研究 | dbGaP phs000007 + 家系感知统计 | 三代家系全球唯一级别 |
§8.3 官方评测协议
无官方 ML 评测协议。风险预测文献事实标准:性别分层 Cox 模型;报告 C-index(判别度)+ 校准(calibration-in-the-large、slope、校准曲线);新方法与 FRS/PCE 对比需同人群同终点;外部队列报告重新校准前后结果。教学集社区惯例:period 1 快照 + 24 年随访标签 + AUROC(注意该口径与 10 年风险评分文献不同,不可直接对比)。
写论文时的最小报告清单:数据路径与版本(教学集/BioLINCC/dbGaP accession)、基线过滤规则(PREV* 排除)、划分方式(RANDID 分组 + 随机种子)、缺失处理策略、判别度与校准双指标、性别分层结果、外部验证(如有)。
§8.4 相关数据集
| 数据集 | 关系 | 说明 |
|---|---|---|
| ARIC | 同类/外验集 | 15,792 人四社区队列,BioLINCC/dbGaP 同通道,FRS 经典外验集 |
| CHS | 同类 | ≥65 岁老年心血管队列 |
| MESA | 互补 | 6,814 人多族裔队列,PCE 推导队列之一 |
| Jackson Heart Study | 互补 | 非裔美国人心血管队列 |
| UK Biobank | 互补 | 50 万人当代队列,FHS 模型的当代外验场 |
| NHANES | 互补 | 全国代表性横断面 + 死亡链接 |
| NHLBI 教学集姊妹集 | 同类 | BioLINCC Teaching Studies 页另有其他 NHLBI 队列教学集 |
§8.5 关键论文 Top 10
- Kannel WB, Dawber TR, Kagan A, Revotskie N, Stokes J (1961), Ann Intern Med 55:33-50. “Factors of Risk in the Development of Coronary Heart Disease—Six Year Follow-Up Experience.” — "危险因素"概念诞生之作,现代预防医学的起点。
- Wilson PWF et al. (1998), Circulation 97:1837-1847. “Prediction of Coronary Heart Disease Using Risk Factor Categories.” — Framingham Risk Score 经典版,被引 13,300+(截至 2026-09),ATP III 计算器基础。DOI: 10.1161/01.CIR.97.18.1837
- Dawber TR, Moore FE, Mann GV (1957), Am J Public Health 47:4-24. “Coronary Heart Disease in the Framingham Study.” — 首批确立高血压/高胆固醇与 CHD 关联的 4 年随访报告。
- Tsao CW, Vasan RS (2015), Int J Epidemiol 44:1800-1813. “Cohort Profile: The Framingham Heart Study.” — 队列权威 profile,引用 FHS 数据的标准入口。DOI: 10.1093/ije/dyv337
- Andersson C, Johnson AD, Benjamin EJ, Levy D, Vasan RS (2019), Nat Rev Cardiol 16:687-698. “70-year legacy of the Framingham Heart Study.” — 70 年全景综述与组学时代总结。
- D’Agostino RB, Vasan RS, Pencina MJ, et al. (2008), Circulation 117:743-753. “General Cardiovascular Risk Profile for Use in Primary Care.” — 总体 CVD 风险函数。
- Mahmood SS, Levy D, Vasan RS, Wang TJ (2014), Lancet 383:999-1008. “The Framingham Heart Study and the epidemiology of cardiovascular disease: a historical perspective.” — 最佳历史方法学综述。
- Satizabal CL et al. (2016), NEJM 374:523-532. “Incidence of Dementia over Three Decades in the Framingham Heart Study.” — 痴呆发病率三十年下降 44%,FHS 超越心血管边界的标志。DOI: 10.1056/NEJMoa1504327
- Christakis NA, Fowler JH (2007), NEJM 357:370-379. “The Spread of Obesity in a Large Social Network over 32 Years.” — 基于 FHS 家系+社会网络数据(12,067 人)的网络科学经典。
- Levy D et al. (1990), NEJM 322:1561-1566. “Prognostic Implications of Echocardiographically Determined Left Ventricular Mass.” — 影像表型(左室质量)独立预后价值的奠基研究。
§8.6 社区活跃度
| 维度 | 数据 |
|---|---|
| FHS 衍生论文总量 | 3,698 篇(官方统计,截至 2018-08;首篇 1951) |
| Wilson 1998 引用 | 13,300+(Google Scholar,截至 2026-09) |
| Kaggle 生态 | “Framingham” 相关公开 notebook 数以千计(教学集为主要教学数据集之一,截至 2026-09) |
| dbGaP 授权请求 | phs000007 为 dbGaP 历史最悠久、申请量最大的研究之一(2008 年首发) |
| 教学采用 | 全球生物统计与医学 ML 课程标准数据集(Harvard、JHU 等公开课长期使用) |
| 指南采纳 | ATP III(2001-2002)、ESC 历届预防指南引用;2013 后美国为 PCE |
§8.7 生态快照
| 资源 | 类型 | 链接 | 规模(截至 2026-09,约) | 为什么值得关注 |
|---|---|---|---|---|
| FHS 官网 For Researchers | 官方入口 | https://www.framinghamheartstudy.org/fhs-for-researchers | — | 数据目录、exam 表、编码手册、申请入口的唯一权威汇总 |
| BioLINCC framcohort | 官方数据 | https://biolincc.nhlbi.nih.gov/studies/framcohort/ | — | 临床表型发表级获取通道 |
| dbGaP phs000007 | 官方数据 | https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs000007 | 17,141 consented | 组学+表型授权访问顶层研究 |
| BioLINCC Teaching Studies | 教学数据 | https://biolincc.nhlbi.nih.gov/teaching/ | 11,627 person-exam | 免申请教学集唯一下载点 |
| FHS Risk Score Calculators | 官方工具 | https://www.framinghamheartstudy.org/fhs-risk-functions/ | — | 各风险函数官方计算器与公式 |
| riskCommunicator(R 包) | 工具库 | CRAN | — | 内置 FHS 教学集与文档,教学友好 |
| Kaggle Framingham mirrors | 社区镜像 | https://www.kaggle.com/datasets/shreyjain601/framingham-heart-study | CC0 | 快速原型;注意 4,240 行变体与官方长格式差异 |
| NIH BioData Catalyst | 云平台 | https://biodatacatalyst.nhlbi.nih.gov/ | — | dbGaP 数据免下载云端分析 |
§9 相关资源与引用
官方资源
- 数据集主页:https://www.framinghamheartstudy.org/
- 研究者数据总览:https://www.framinghamheartstudy.org/fhs-for-researchers/data-available-overvie
- 教学数据集下载:https://biolincc.nhlbi.nih.gov/teaching/
- BioLINCC 临床数据:https://biolincc.nhlbi.nih.gov/studies/framcohort/
- dbGaP 顶层研究:https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/study.cgi?study_id=phs000007
- FHS 文献库:https://www.framinghamheartstudy.org/fhs-bibliography/
- 风险函数计算器:https://www.framinghamheartstudy.org/fhs-risk-functions/
BibTeX 引用
% 1) 队列 Profile(引用 FHS 数据的标准入口)
@article{tsao2015framingham,
title={Cohort Profile: The Framingham Heart Study (FHS): overview of milestones in cardiovascular epidemiology},
author={Tsao, Connie W and Vasan, Ramachandran S},
journal={International Journal of Epidemiology},
volume={44}, number={6}, pages={1800--1813}, year={2015},
doi={10.1093/ije/dyv337}
}
% 2) 70 年综述(组学与现代时代)
@article{andersson2019framingham,
title={70-year legacy of the Framingham Heart Study},
author={Andersson, Charlotte and Johnson, Andrew D and Benjamin, Emelia J and Levy, Daniel and Vasan, Ramachandran S},
journal={Nature Reviews Cardiology},
volume={16}, pages={687--698}, year={2019},
doi={10.1038/s41569-019-0202-5}
}
% 3) Framingham Risk Score(如使用风险评分)
@article{wilson1998prediction,
title={Prediction of coronary heart disease using risk factor categories},
author={Wilson, Peter WF and D'Agostino, Ralph B and Levy, Daniel and Belanger, Albert M and Silbershatz, Halit and Kannel, William B},
journal={Circulation},
volume={97}, number={18}, pages={1837--1847}, year={1998},
doi={10.1161/01.CIR.97.18.1837}
}
% 4) dbGaP 数据还须注明:dbGaP Study Accession phs000007(Framingham Cohort),
% 并在致谢中说明数据由 NHLBI 与 Boston University 提供。
教程与学习资源
- BioLINCC 官方教学集 PDF 文档(FHS_Teaching_Longitudinal_Data_Documentation_2021a)——变量级权威字典,第一课必读
- riskCommunicator R 包 vignette(内置 FHS 教学集):https://cran.r-project.org/package=riskCommunicator
- Kaggle “Framingham Heart Study” notebooks(入门参考,注意甄别数据变体)
- FHS 官网 Exam Cycle Protocol Manuals(各检查周期协议全文)
原始论文
- Dawber TR, Meadors GF, Moore FE (1951). “Epidemiological approaches to heart disease: the Framingham Study.” Am J Public Health 41:279-281.(首篇)
- Kannel WB et al. (1961). “Factors of risk in the development of coronary heart disease—six year follow-up experience.” Ann Intern Med 55:33-50.
- Feinleib M et al. (1975). “The Framingham Offspring Study. Design and preliminary data.” Prev Med 4:518-525.
- Splansky GL et al. (2007). “The Third Generation Cohort of the NHLBI’s Framingham Heart Study.” Am J Epidemiol 165:1328-1335.
- Tsao CW, Vasan RS (2015). Int J Epidemiol 44:1800-1813. DOI: 10.1093/ije/dyv337.
社区链接
- dbGaP Authorized Access 申请指南:https://dbgap.ncbi.nlm.nih.gov/aa/wga.cgi?page=login
- NIH BioData Catalyst(dbGaP 云端分析平台):https://biodatacatalyst.nhlbi.nih.gov/
- AHA 精准医学平台 FHS 数据合作说明:https://www.framinghamheartstudy.org/fhs-for-researchers/helpful-links-for-accessing-fhs-data/
- EGA 影像子研究(phs003593,超声心动图 DICOM):https://ega-archive.org/studies/phs003593
§10 AI 使用声明卡
§10.1 AI 模型使用
| AI 模型 | 版本 | 用途 |
|---|---|---|
| deep-model(WorkBuddy) | 2026-09 | 初稿生成:INFOBOX 数据汇编、§1-§9 结构化写作、§6 代码示例生成、JSON-LD 构建 |
| WebSearch(多源检索) | 2026-09-05 | 6 组检索:队列规模三源核实、BioLINCC/dbGaP 流程、风险评分文献与引用快照、教学集文档原文 |
§10.2 AI 参与范围
AI 参与范围:初稿生成 + 资料整理 + 代码生成 + 格式化排版。
AI 在本页面的工作中负责:(1) 从 FHS 官网、dbGaP(phs000007/008/009/014)、BioLINCC 官方文档、EGA phs003593 与同行评审文献中整理结构化信息;(2) 生成 §6 的 Python 代码示例;(3) 系统化组织 §6.5 的 8 个坑点与 §7.1 偏倚表;(4) 执行 G1/G2/G3 排版规范检查与中英文格式标准化;(5) 构建 §C 统一 JSON-LD @graph。
§10.3 输入来源
- FHS 官网 “Available FHS Data” 与 For Researchers 页面(获取路径三源:dbGaP/BioLINCC/FHS Repository)
- dbGaP phs000007(Framingham SHARe,DUC/HMB 条款原文、17,141 consented subjects)
- dbGaP phs000008(Main Exams)、phs000009(Basic Participant Exam Information,各队列 exam 时间线)
- dbGaP phs000014(Sequence of Events 终点判定机制)
- BioLINCC FHS Teaching Dataset Documentation 2021a(4,434 人、11,627 行、24 年随访、“inappropriate for publication” 声明)
- Tsao & Vasan (2015), Int J Epidemiol 44:1800-1813(队列 profile,99% 随访率、Omni 队列口径)
- Andersson et al. (2019), Nat Rev Cardiol 16:687-698(n≈15,000、组学谱系、影像清单)
- EGA phs003593(各队列检查次数与最新周期、CT 4,427 人)
- Wilson et al. (1998), Circulation 97:1837-1847 + Google Scholar 引用快照(13,301,截至 2026-09)
- D’Agostino et al. (2008), Circulation 117:743-753(General CVD risk profile)
- D’Agostino et al. (2001), JAMA 286:180-187(多种族外部验证);Liu et al. (2004), JAMA(中国适配);Marrugat et al. (2003)(REGICOR)
- Mahmood et al. (2014), Lancet 383:999-1008(风险函数谱系、Truett 1967、Kannel 1976)
- Satizabal et al. (2016), NEJM 374:523-532(痴呆三十年下降)
- Christakis & Fowler (2007), NEJM 357:370-379(社会网络肥胖,12,067 人)
- Kaggle 教学集镜像页与 riskCommunicator 文档(变量取值范围、CC0 镜像)
- FHS 70 周年官方统计(3,698 篇论文,截至 2018-08)
§10.4 人工校验表
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| §2 医学背景(ICD-11/SNOMED 映射、终点与风险评分口径) | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §3 数据集规格(队列规模、获取路径矩阵) | 千方病案医学编辑部 | 与 dbGaP/EGA/BioLINCC 官方页面交叉比对 | ✅ 已验证 |
| §4 数据结构(教学集变量字典、缺失机制) | 千方病案医学编辑部 | 与 BioLINCC 2021a 官方文档交叉比对 | ✅ 已验证 |
| §5 数据划分策略 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §6 代码示例与坑点 | 千方病案医学编辑部 | 逻辑审查 + 与官方文档比对 | ✅ 已通过 |
| §7 质量评估与 DAIMS 评分 | 千方病案医学编辑部 | 交叉审核 | ✅ 已通过 |
| §8 排行榜与引用数表述 | 千方病案医学编辑部 | 与原文及 Scholar 快照交叉比对 | ✅ 已验证 |
| §C JSON-LD @graph | 千方病案医学编辑部 | Schema v3.9 字段逐项校验 | ✅ 已通过 |
§10.5 AI 生成章节标注
以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.5 公平性评估代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。
§10.6 最后审核
最后一次人工审核日期:2026-09-05
页面状态:published(全部内容已完成审核并发布)
