FinnGen — 芬兰全国基因组与健康队列 AI-Ready Wikipedia | 千方病案医数集

52 万芬兰生物银行个体的基因组-全国登记联动队列 · 2,755 个疾病终点 GWAS

来源 FinnGen(芬兰生物银行公私合作伙伴项目,THL / 赫尔辛基大学 FIMM / Broad Institute) url: https://www.finngen.fi/en发布时间: 2026-09-08最后更新: 2026-09-08 阅读 4

信息速览

数据集名称FinnGen — 芬兰全国基因组与健康队列 AI-Ready Wikipedia | 千方病案医数集
数据类型519,972 名参与者,21,311,644 个插补变异,2,755 个公开疾病终点,汇总统计免费下载
规模519,972 名参与者(R13 总基因型个体,截至 2026-09)
接入方式FinnGen(芬兰生物银行公私合作伙伴项目,THL / 赫尔辛基大学 FIMM / Broad Institute) url: https://www.finngen.fi/en
AI 就绪度

数据集封面

FinnGen — 芬兰全国基因组与健康队列 AI-Ready Wikipedia


INFOBOX

字段 内容
数据集名称 FinnGen(芬兰基因组与健康队列)
英文全称 FinnGen(Finnish Genomics and Health Data Project)
别名/简称 FinnGen study、FinnGen R13/DF13
疾病分类(ICD-11 编码+中文名) 全谱系覆盖:ICD-10 全部 21 章均有 endpoint 定义(如心血管系统 I40-I5A、内分泌 5A00 糖尿病等),R13 共 4,662 个 endpoint 定义
SNOMED CT 无官方全量映射;endpoint 库官方匹配 EFO、DOID 与 MeSH 编码(自动算法+人工审核)
数据模态 芯片基因分型(Illumina/Affymetrix)+ 全基因组插补(SISu v4.2)+ 全国医疗登记链接 + 生物银行最小表型;扩展:蛋白组 QTL、单细胞 multiome
AI 任务类型 GWAS/PheWAS、疾病终点分类、精细定位与共定位、孟德尔随机化、多基因风险评分(PRS)、疾病轨迹建模
样本总数 519,972 名基因型个体(R13);核心 GWAS/PheWAS 500,186 名
数据大小 汇总统计约 0.5 GB/endpoint(bgzip TSV,2,755 个公开);个体级数据仅 Sandbox 内可及
数据格式 bgzipped TSV + tabix 索引(汇总统计);gzip TSV(endpoint/covariates)、PLINK bed/bgen(基因型)、BigQuery(沙箱)
许可证 汇总统计免费获取(在线登记后下载);个体级数据受 FinnGen Scientific Plan 与 Findata 审批约束
访问级别 汇总统计:注册后开放;个体级数据:申请审核(Sandbox 内分析,不可导出)
语言 数据与文档以英语为主;登记原始编码为芬兰语/瑞典语;Risteys 门户英语界面
首发日期 2017(项目启动);DF2 于 2018 Q4 发布给合作伙伴
最后更新 2026-06-02(DF13 公开);2026-08-13(单细胞 multiome 公开)
发布机构 FinnGen 公私合作伙伴关系(THL、赫尔辛基大学 FIMM、Broad Institute、9 家芬兰生物银行、国际制药企业伙伴)
官方主页 finngen.fi/en
下载地址 finngen.fi/en/access_results(表单登记后邮件发送下载说明)
DOI 10.1038/s41586-022-05473-8
引用次数 3,157+(Scopus,截至 2026-09,Tampere 大学研究门户快照)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 汇总统计格式统一、文档完备、endpoint 定义库开放;扣分项:无官方 ML 训练/测试划分,个体级数据须在 Sandbox 内编码,且 endpoint 语义需专门理解(见 §6.5)
页面状态 published

§0 E-E-A-T 审核声明

医学审核:千方病案医学编辑部交叉审核:§2 医学背景(ICD-10/ICD-11 映射、芬兰登记体系、流行病学)、§7 偏倚分析。

数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-05

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集官方协议。FinnGen 汇总统计需在线登记后下载并遵守引用与致谢要求;个体级数据仅限 FinnGen 合作机构研究者经芬兰登记数据主管机构 Findata 审批后在沙箱内使用。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。

页面数字口径说明:本页所有规模数字均标注版本与日期(截至 2026-09 为 DF13 公开口径);FinnGen 处于持续更新状态,引用时请以官方 Handbook 最新 release notes 为准。


§1 数据集概览

§1.0 30 秒速览

这是什么? FinnGen 把约 52 万芬兰人的基因数据与芬兰全国几十年的就医记录连在了一起。参与者的血样来自全国九家生物银行,基因分型后与住院、门诊、死因、用药报销、癌症登记等国家级数据库逐一匹配,形成一部「基因 + 全病程」的国家规模生命档案。截至 2026-09,最新公开版本 DF13 覆盖 500,186 名 GWAS 分析个体与 2,755 个疾病终点。

为什么重要? 芬兰人口经历过历史性「奠基者瓶颈」,一些有害的低频变异在芬兰人群中频率远高于其他欧洲人群,这让隐藏在常见病背后的遗传机制更容易被看见。Kurki 等 2023 年发表于 Nature 的分析中,91 个信号在非芬兰欧洲人群中频率不足 5%,其中 62 个在芬兰富集超过两倍——这些正是其他大型队列难以发现的生物学入口。

我能用它做什么? 免费下载 2,755 个疾病终点的 GWAS 汇总统计做靶点优先级排序、孟德尔随机化、共定位与多基因风险评分研究;若所在机构是 FinnGen 合作伙伴,还可经 Findata 审批进入沙箱,在个体级数据上做 PRS 评估、疾病轨迹与自定义表型分析。

§1.1 摘要

FinnGen 是一项 2017 年启动、2023 年 9 月完成采样的全国性公私合作项目,目标是对约 10% 的芬兰人口进行基因组分型并与全国健康登记联动(官方结果页)。样本由 Auria、Borealis、THL、芬兰红十字会血液服务等九家生物银行汇入,其中既包括转入生物银行的历史疾病队列(legacy cohorts),也包括医院前瞻性招募样本,因此队列对重病、老年与住院人群有天然富集。基因分型采用 Illumina 与 Affymetrix 双平台芯片,以芬兰特异的 SISu v4.2 参考面板(8,554 个全基因组)插补,R13 合并集包含 21,311,644 个变异(GRCh38)(FinnGen 手册)。表型方面,项目从 HILMO 住院与专科门诊、AvoHILMO 初级保健、死因登记、Kela 药物报销与购药、芬兰癌症登记五大登记源出发,经临床专家组审批构建了层级化的临床 endpoint 体系(R13 达 4,662 个定义),DF13 公开 2,755 个 endpoint 的 SAIGE/REGENIE 汇总统计及 SuSiE/FINEMAP 精细定位结果。旗舰论文 Kurki et al.(Nature 2023)基于 DF5 的 224,737 人分析了 1,932 个疾病,识别 2,733 个全基因组显著关联,验证了瓶颈化人群通过低频、高影响变异切入常见病生物学的独特价值(PMID 36653562)。

§1.2 战略价值

维度一:低频变异发现能力。 在英国生物银行等泛欧队列中,绝对多数有害变异散布在超低频区间(MAF<0.1%),单队列统计功效难以触达;而在奠基者效应作用下,芬兰人群把同类有害变异集中到少量 0.1%≤MAF<5% 的低频变异上。FinnGen 的隔离人群设计使这些变异以数倍频率出现,将「需要百万样本才能捕捉」的信号压缩到 50 万级样本即可检测的区间。这一结构性优势在 Kurki 2023 的 30 个全新低频关联与 148 个精细定位编码变异中得到实证,并持续产出资助级药物靶点证据(如静脉曲张 GJD3 保护性错义变异)。

维度二:登记联动的纵向表型深度。 芬兰实行全民医疗与全国唯一身份编码,HILMO 登记最早可回溯至 1969 年,死因登记与癌症登记同样覆盖数十年。这意味着每位参与者拥有自出生(或登记起始)到最近的完整就医轨迹,支持其他生物银行难以实现的疾病时间轴建模、预后队列构建与家族性(父母代 endpoint)分析。DF13 同步发布了亲代死因与亲代 endpoint 文件,为跨代遗传与家庭设计提供可能。

维度三:开放科学与合规的平衡范本。 汇总统计层面,FinnGen 采取「登记即可免费下载」的极简开放策略,配合 PheWeb 在线浏览器与 Risteys endpoint 门户,几乎零门槛接入;个体级层面则通过沙箱(数据不出域)、Findata 审批与科学计划约束实现 GDPR 兼容。这套「绿-红」双层架构已被多个国家级项目借鉴,是研究合规体系设计的重要参考。

维度四:组学纵深持续扩张。 在核心「基因型 × 登记」骨架上,FinnGen 持续叠加高价值组学层:DF10 的 Olink/SomaScan 蛋白组 QTL、覆盖 383 项实验室测量的 Kanta 实验室值 GWAS(2025-10 公开)、以及 2026-08 公开的 1,108 人单细胞 multiome(1,060 万 snRNA 核 + 710 万 snATAC 核,33 种细胞类型 cis-QTL)。这让「疾病 GWAS → 调控机制 → 因果基因」的全链路分析在单一项目生态内闭环,减少了跨项目对齐成本。

§1.3 同类数据集横向对比

FinnGen 的直接对标物是各国国家级生物银行;下表聚焦「与 FinnGen 搭配使用」视角(规模数字为各项目公开口径,截至 2026-09)。

数据集 规模 模态 标注/表型 与 FinnGen 的差异化
FinnGen 519,972 基因型个体 芯片+SISu v4.2 插补 + 全国登记 4,662 endpoint 定义、2,755 公开 GWAS 隔离人群低频变异富集;登记回溯数十年;汇总统计零门槛
UK Biobank 约 50 万参与者 芯片+外显子/全基因组测序子集 医疗链接 + 影像 + 可穿戴 表型维度更宽(影像、环境),但低频变异功效弱于隔离人群
All of Us 超 30 万 WGS 全基因组测序 + EHR 多元美国人群 祖先多样性极强,但 EHR 深度与登记完整性不及芬兰
Estonian Biobank 约 21 万参与者 芯片 + 国家登记 与 FinnGen 同类隔离人群 与 FinnGen 常作 meta 合作(ESTBB),规模较小
genomics-england-100k 约 10 万全基因组 WGS + NHS 登记 罕见病/肿瘤聚焦 WGS 深度覆盖罕见病家庭,但常见病 PheWAS 功效不如 FinnGen

§1.4 版本时间轴

版本(Data Freeze/Release) 发布给合作伙伴 公开发布 总样本量 核心 GWAS 样本 公开 endpoint 数
DF10/R10 2022 Q3 2023-12-18 430,897 412,181 2,408
DF11/R11 2023 Q1 2024-06-24 473,681 453,733 2,447
DF12/R12 2024 Q1 2024-11-04 520,210 500,348 2,502
DF13/R13 2025 Q2 2026-06-02 519,972 500,186 2,755
DF14/R14 2026 Q1 预计约 2027 519,870 官方尚未公布 4,867(endpoint 定义数)

(数据来源:FinnGen Data Freezes and Releases官方结果页;截至 2026-09,DF13 为最新公开版本。)

读表要点:① 「总样本量」与「核心 GWAS 样本」的差异来自表型过滤(R5 起仅保留基因型个体且有表型者);② 公开发布滞后合作伙伴约 1 年(独占期),因此 2026-09 时点的「最新公开」是 DF13 而沙箱内已是 DF14;③ DF12→DF13 总样本微降(520,210 → 519,972)属正常 QC/撤回调整,不代表负增长;④ DF13 同期以独立轨道发布了实验室值 GWAS(2025-10)与单细胞 multiome(2026-08),不占用上述 endpoint 计数。

§1.5 典型应用场景

  1. 药物靶点验证与孟德尔随机化:以 FinnGen 大规模病例组(如冠状动脉粥样硬化 47,550 例)作为结局端,与暴露组 GWAS 联合做两样本 MR,是近年药物靶点 MR 论文的高频数据源。
  2. 精细定位与共定位:SISu LD 面板 + SuSiE/FINEMAP 输出可直接用于可信集构建,与 eQTL(如单细胞 multiome 的 cis-QTL)共定位确定因果基因。
  3. 多基因风险评分跨人群评估:在 UKBB 训练的 PRS 于 FinnGen 个体级数据上检验迁移性能,隔离人群的 LD 结构差异是天然的迁移压力测试。
  4. PheWAS 药物安全性信号复核:对编码靶点变异做全表型组扫描(PheWAS),快速筛查靶点抑制的潜在副作用谱。
  5. 疾病轨迹与预后建模(个体级,合作机构):利用数十年登记轨迹在沙箱内构建早期预警或疾病亚型模型,再用亲代 endpoint 做家庭聚集性分析。
  6. LoF burden 速筛:用 PheWeb 内置的基因功能缺失(LoF)视图快速评估「敲低该基因」的表型谱,为在研化合物寻找人遗传学安全性佐证。

§2 医学背景

§2.1 ICD-11 映射表

FinnGen endpoint 命名与层级跟随 ICD-10 章节(首字母+章号),下表给出高频研究 endpoint 与 ICD-11 的对应关系(ICD-11 使用 WHO 浏览器编码)。

FinnGen endpoint endpoint 中文名 ICD-10 参考 ICD-11 编码 ICD-11 中文名
I9_CHD 冠心病 I25 BA41-BA4Z 冠状动脉疾病
I9_MI 心肌梗死 I21 BA41.0 急性心肌梗死
E2_DIABETES_NOV2_T1D 1 型糖尿病(排除 T2D) E10 5A14 1 型糖尿病
E2_DIABETES_NOV2_T2D 2 型糖尿病(排除 T1D) E11 5A11 2 型糖尿病
G6_PARKINSON 帕金森病 G20 8A00 帕金森病
F5_ANXIETY_REACT 焦虑与反应性障碍 F40-F48 6B0-6B0Z 焦虑与恐惧相关障碍
C3_COLORECTAL 结直肠癌 C18-C20 2B91 结直肠癌
AB1_APOE_RELATED_D 阿尔茨海默病相关痴呆 F00/G30 8A80 阿尔茨海默病
J10_ASTHMA 哮喘 J45 CA23 哮喘
K11_APPEND_ACUTE 急性阑尾炎 K35 DB10 急性阑尾炎

§2.1b SNOMED CT 与本体映射表

标签/概念 ICD-11 参考 SNOMED CT 参考码 术语说明
心肌梗死 BA41.0 22298006 FinnGen endpoint 官方映射至 EFO/DOID/MeSH,SNOMED 为社区常用对照码
2 型糖尿病 5A11 44054006 endpoint 排除 T1D,SNOMED 映射时须保留排除语义
帕金森病 8A00 49049000 层级 INCLUDE:上级 endpoint 自动包含子类病例
结直肠癌 2B91 363406005 癌症 endpoint 以 ICD-O-3 形态学编码为准
哮喘 CA23 195967001 含 _INCLAVO 后缀的 endpoint 并入初级保健登记编码

说明:FinnGen 官方本体映射目标为 EFO、DOID 与 MeSH(经自动算法加人工审核完成),SNOMED CT 无官方全量映射,上表供跨库对齐时参考,使用前应按最新 SNOMED 版本复核。

§2.2 疾病与登记体系简介

FinnGen 的表型基础不是单一疾病,而是覆盖 ICD-10 全部 21 章的层级化临床 endpoint 库。每个 endpoint 定义「某医学状况确已发生」,例如一次带 G43.1(先兆偏头痛)出院编码即触发偏头痛 endpoint。定义通常综合多个登记源:HILMO(住院与专科门诊,ICD-8/9/10 + NOMESCO/芬兰医院联盟手术编码)、AvoHILMO(初级保健,ICD-10 与 ICPC2)、死因登记(Statistics Finland,WHO ICD 编码)、Kela 药物报销与购药登记(ATC 码)以及芬兰癌症登记(ICD-O-3 形态学)。流行病学上,芬兰约 550 万人口中已有约 10% 加入 FinnGen,队列中位年龄约 63 岁(Kurki 2023 分析时),医院招募与 legacy 疾病队列使重症与住院治疗疾病占比显著高于普通人群——这是功效优势,也是患病率估计的偏倚来源。

芬兰人口结构为何放大遗传信号:芬兰人口源于约 1,500 年前的少量奠基者,且历史上经历过两次区域性的大规模人口瓶颈(西部晚期定居区与东北部早期定居区),其后代近缘繁殖率长期高于欧洲均值。其结果是:在欧洲总人群中散布于大量超稀有变异的有害等位基因,在芬兰集中到少数低频变异(0.1%≤MAF<5%)上——经典的「芬兰遗产病」(Finnish Disease Heritage,如先天性肾病综合征、 Finnish latum 等 40 余种孟德尔病)由此得名。FinnGen 把这一孟德尔遗传层面的洞察系统推广到常见病:同一瓶颈机制使常见病的低频高风险变异同样可被 50 万级样本捕获(Kurki 2023 中 62 个信号在芬兰富集超两倍即为直接证据)。

登记体系的纵向完整性:芬兰自 1971 年起实行全民医保,每位居民持有终身唯一的个人身份编码,HILMO 住院登记回溯至 1969 年、死因登记自 1936 年系统性保存、Kela 药物报销登记覆盖 1995 年至今的处方报销。FinnGen 经该身份编码(分析前已伪匿名化为 FID)把生物银行样本与上述登记无缝链接,避免了回顾性队列中最常见的「个体无法追踪」问题,也使 DF13 的亲代 endpoint/死因文件(家庭层面链接)成为可能。

§2.3 临床任务定义

  • 疾病易感基因发现(GWAS/PheWAS):以 endpoint 为 case-control 标签,对 21,311,644 个变异做全基因组扫描;官方分析链为 SAIGE(早期 release)与 REGENIE(R10 起,含 GRM 亲缘校正)。
  • 筛查与风险分层(PRS):个体级数据支持在沙箱内计算多基因评分并按 endpoint 评估判别力(AUROC/AUC),常与家族史、登记轨迹特征组合。
  • 诊断亚型细化(层级 endpoint):endpoint 库按 ICD-10 树状层级组织,INCLUDE 列实现子类病例自动并入上层,支持从「任何糖尿病」逐层下钻到 T1D/T2D 互斥亚型。
  • 预后与生存分析:ENDPOINT_X_FU_AGE 列为 case 提供首次事件年龄、为 control 提供随访结束年龄,可直接驱动 Cox 生存模型(Risteys 即按此方式计算死亡率与绝对风险)。
  • 药物靶点因果推断(MR/coloc):以编码变异(pQTL/eQTL)为工具变量,与 endpoint 汇总统计做共定位与孟德尔随机化。
  • LoF 负向验证:PheWeb 内置基因-表型 LoF burden 视图,可直接检查「功能缺失该基因是否保护/致病」,是靶点安全性的第一道速筛。
  • 实验室性状遗传学:Kanta 实验室值 GWAS(383 项测量)支持把连续生物标志物纳入靶点证据链(如 eGFR、脂质谱)。

§2.4 患者人群表

维度 描述
来源 9 家芬兰生物银行(Auria、Borealis、Eastern Finland、Central Finland、Red Cross Blood Service、Tampere 临床生物银行、Helsinki Terveystalo、THL Biobank、Arctic)
招募时间 2017-2023(2023-09 达成 >50 万基因型+表型个体后停止扩增)
年龄 中位约 63 岁(Kurki 2023 分析队列),老年人群富集
性别 DF13:281,909 女性 / 218,277 男性
种族/祖先 芬兰欧洲祖先为主(隔离人群);与泛欧人群存在可量化的 LD 与等位基因频谱差异
就医类型 住院/专科就诊人群显著富集;血液服务生物银行贡献相对健康个体;legacy 队列携带特定疾病过代表
地理分布 覆盖芬兰全国,南部与中部(大学医院所在地区)占比更高

样本构成的双源结构:Kurki 2023 明确 FinnGen 样本由两类构成——转入生物银行的历史研究队列(legacy,预期约 20 万,多为疾病特异性队列)与生物银行前瞻招募样本(预期约 30 万)。六家区域医院生物银行贡献专科医疗患者,私立医疗生物银行(Terveystalo)补充专科体系外患者,血液服务生物银行则带来更健康的人群。使用任何 endpoint 前应意识到:该 endpoint 的病例可能主要来自某个过采样的 legacy 队列,患病率数字不可外推。

§2.5 临床价值

对临床研究者,FinnGen 的价值在于把「罕见暴露」放大到可研究规模:低频编码变异在芬兰的高频化使药物靶点的人遗传学证据(human genetics evidence)获取成本大幅下降,GJD3、LPA 等靶点叙事均始于此。对公共卫生建模者,数十年登记回溯让感染-慢病因果链、共病网络与家庭聚集性(亲代 endpoint)分析成为可能。对 AI 工程团队,2,755 个统一格式、统一 QC 流程的 endpoint 汇总统计构成了一个「即插即用」的表型组先验库——无论训练 PRS 模型还是构建知识图谱,都可以从全表型组层面起步,而非从单一疾病起步。

在药物研发流程中,FinnGen 的典型位置是「靶点确认 → 适应症拓展 → 安全性反证」:靶点编码变异与疾病的关联提供因果方向与剂量效应;层级 endpoint 库支持在同一数据源内检索适应症扩展证据(同一靶点变异是否关联多个终点);PheWAS 则在进入临床试验前扫描潜在副作用信号。Aavikko 等 2025 年在 Nat Rev Cancer 的综述系统梳理了这一「FinnGen 优先」的癌症研究路径。

§2.6 金标准表(标注体系)

维度 内容
划分方式 无官方 ML 训练/测试划分;每个 endpoint 的 case/control 由登记编码规则自动生成
标注方式 算法化规则标注(登记编码 → endpoint),非人工逐例标注
标注者 FinnGen 临床专家组(芬兰执业医师,部分含制药企业专家)审批定义;数据团队执行代码化
标注性质 回顾性、行政登记驱动;特异性优先于敏感性;每轮 Data Freeze 修订并累积版本
质量锚点 各 endpoint 附官方对照排除标准(control exclusion);Risteys 门户公布个案数、未校正患病率与首事件年龄分布

与人工标注临床数据集(如 MIMIC 中经临床共识的 sepsis 标签)不同,FinnGen 的「金标准」是定义层面的权威而非逐例层面的权威:官方保证 endpoint 规则的专家审批与跨库一致性,但不保证每个编码都 clinically true。这是登记型数据集的固有属性,也是它与前瞻队列(如 UKBB 首诊确认子研究)在标签可信度上的本质差别。


§3 数据集规格

§3.0 版本抉择矩阵

你的需求 推荐版本 大小 理由
快速 PheWAS / MR 端点 DF13(r13.finngen.fi 约 0.5 GB/endpoint 最新公开、样本最大、2,755 个 endpoint;文档与浏览器维护中
与 pan-UKBB 对照 DF12 meta(FG+UKBB 867 表型) 在线浏览器+下载 三方 meta(FG-MVP-UKBB 330 表型)仅存在于 DF12 周期
训练个体级 PRS 模型 DF13 个体级(Sandbox) 沙箱内 TB 级 需合作机构资格;chip plink + endpoint 宽表
复现 Kurki 2023 DF5/R5 r5.finngen.fi 论文基于 224,737 人(DF5),浏览器保留
蛋白/单细胞组学联动 DF13 + multiome(2026-08 公开) 独立发布 1,108 人单细胞 multiome cis-QTL 与 R12/Kanta 实验室值共定位

§3.1 模态详情

  • 基因分型(chip genotypes):Illumina 与 Affymetrix 阵列;Illumina 侧 GenCall + zCall 呼叫,Affymetrix 侧 AxiomGT1;历史平台数据经 liftOver 统一到 GRCh38/hg38。
  • 插补基因型(imputed genotypes):以芬兰特异 SISu v4.2 参考面板(8,554 个芬兰全基因组)插补,合并集 21,311,644 个变异;沙箱提供 PLINK bed/bgen 及 LD 剪枝的高质量 GRM。
  • 临床 endpoint(宽表):FID × endpoint 布尔矩阵 + 每 endpoint 年龄列;R13 沙箱含 4,662 个 endpoint 定义,公开 GWAS 2,755 个。
  • 登记纵向明细(detailed longitudinal data):HILMO/AvoHILMO 事件级记录、死因、Kela 报销/购药、癌症登记 ICD-O-3,DF13 追加扩展版 HILMO+AvoHILMO 与癌症筛查(乳腺/宫颈)文件。
  • 扩展组学:DF10 蛋白组 Olink(619 人 2,925 蛋白)/SomaScan(828 人 7,596 蛋白)QTL;DF12 起发布 OmicsPred PGS 模型;2026-08 公开 1,108 人单细胞 multiome(snRNA 10,612,211 核 + snATAC 7,100,899 核,27,294 基因 + 297,024 染色质可及峰)。
  • 亲代数据(DF13 新增):亲代死因与亲代 endpoint,支持家庭聚集性与跨代分析。

沙箱红库数据类型清单(按 release notes 汇总,R13):chipd(芯片基因型)、plink/bgen(插补基因型)、grm(亲缘矩阵)、analysis_covariates(协变量)、endpoint 与 endpoint_longitudinal(宽表与明细)、parental_endpoint / parental_causes_of_death(亲代)、hilmo_avohilmo_extended(扩展登记)、cancer_detailed(癌症明细)、cancer_screening(癌症筛查)、hla(HLA 插补与关联)、truncated_endpoint_file(截断 endpoint)。多数数据类型在 BigQuery 中同步建表,可用 SQL 直接查询。

§3.2 子集样本数表

子集 样本数 说明
R13 总基因型个体 519,972 合并 141 个数据集
R13 核心 GWAS/PheWAS 500,186 表型经基因型个体过滤
DF13 女性 / 男性 281,909 / 218,277 官方结果页口径
有 endpoint 的个体(DF14) 519,329 DF14 发布说明
Kurki 2023 分析队列 224,737 DF5 时点,1,932 endpoints
单细胞 multiome 子集 1,108 33 种细胞类型
蛋白组子集 Olink 619 / SomaScan 828 DF10 v1

§3.3 格式表

数据对象 格式 坐标系/参考 索引/配套
GWAS 汇总统计 tab 分隔、bgzip GRCh38 tabix(.gz.tbi)+ manifest.tsv
精细定位结果 bgzip TSV(SuSiE/FINEMAP) GRCh38 .SUSIE.cred.bgz / .FINEMAP.snp.bgz 等
endpoint 宽表 gzip TSV 不适用 分析 covariates gzip TSV
基因型(沙箱) PLINK bed / bgen GRCh38 GRM(PLINK bed,LD 剪枝)
沙箱查询 BigQuery 表 不适用 SQL;部分红数据已入库
LD 参考 bcor(LDstore) SISu 每染色体一份

§3.4 存储大小

  • 单 endpoint 汇总统计约 0.5 GB(bgzip;如 R10 女性 BMI 521.9 MB),2,755 个 endpoint 全量约 TB 级,建议按 manifest 选择性下载。
  • 精细定位(SuSiE/FINEMAP)、变异注释与共定位结果按目录独立存放,单 endpoint 的 fine-map 文件显著小于汇总统计本体。
  • 个体级基因型(bgen/bed)与登记明细仅存在于沙箱,官方未公开总字节数;沙箱存储计费约 0.03 欧元/GB/月,GWAS 流水线单次运行约 3-10 欧元。
  • 本地解析性能参考:pandas 直读单 endpoint gz(约 2,000 万行)需数分钟与约 4-6 GB 内存;批量全表扫描建议用 DuckDB/Polars 或按 tabix 区间读取。

§3.5 标注方式

endpoint 生成属规则化自动标注:登记编码按专家审批的定义表(ICD/ATC/手术码 + 年龄/性别前提 + 互斥 condition 参数)映射为 0/1 标签;癌症专用 ICD-O-3 形态学;药物/手术码仅在特异性足够时使用。无人工逐例复核,但每轮 Data Freeze 临床专家组会修订定义库并新增/删除 endpoint。

endpoint 构建规则要点(来自官方 endpoint 文档):

  • 层级 INCLUDE:上层 endpoint 的定义列显式列出全部下级子类(INCLUDE 列),子类病例自动计入上层,形成 ICD-10 风格树;GWAS 时上层与下层的 case 集合是嵌套关系而非独立标签。
  • 特异性优先:在 case/control 极不平衡的 GWAS 中,官方宁要「高特异性、低敏感性」——不把低置信来源(如仅护士编码的 ICPC2 记录)并入主 endpoint,以免稀释对照。
  • 互斥 condition 参数:如 T2D 排除 T1D 病例、Crohn 病排除溃疡性结肠炎病例;未满足排除规则的「疑似病例」进入对照排除清单而非 case 清单。
  • 年龄/性别前提:部分 endpoint 设有发病年龄窗或性别限定(如妊娠相关 endpoint 仅对女性触发)。
  • _INCLAVO 后缀:带此后缀的 endpoint 在住院/专科来源之外并入初级保健登记(PRIM_OUT)编码,敏感性更高;两者并存时必须显式选择,不可混用。
  • 跨登记差异保留:住院登记与死因登记的编码清单在「有充分理由」时可以不同,定义文件逐登记列明。

§3.6 标注者资质与一致性

endpoint 定义由芬兰各医学专科领先专家组成的多组专家群审批(部分含国际制药伙伴的临床专家);本体匹配(EFO/DOID/MeSH)由自动算法完成并经人工策展;Risteys 门户的 endpoint 描述文案为程序化聚合,官方承认偶有错误,应以 endpoint 定义文件为准。

§3.7 采集周期

样本采集 2017-2023(两年一次 Data Freeze,2017-2023 阶段每年 2 月与 8 月;FinnGen 3 阶段起样本固定,改为每年一次登记数据更新,R13 2025-02、R14 2026-02、R15 计划 2027-02)。每次发布到全部数据/工具齐备约需 2-3 个月:首月生成 GWAS 协变量文件,1-3 个月内登记与表型团队更新全部登记数据并转换为 OMOP 格式,第 3 个月核心分析结果(GWAS/精细定位/共定位/autoreporting)才最终上绿库——赶新版的用户应按此节奏安排分析窗口。

§3.8 地域覆盖

芬兰全国(北至 Lapland 的 Arctic Biobank,南至赫尔辛基),约占芬兰总人口 10%;医院生物银行网络与大学医院分布决定样本在南部/中部偏多。

§3.9 设备规格

  • 基因分型:Illumina(GenCall/zCall)与 Affymetrix/Thermo Fisher Axiom 阵列(AxiomGT1);芯片平台与批次信息记录于批次注释文件(HWE、INFO 等 per batch)。
  • 蛋白组:Olink Explore 平台(2,925 蛋白,619 人)与 SomaScan(7,596 蛋白,828 人)。
  • 单细胞:10x Genomics 类单核 multiome 测序(snRNA-seq + snATAC-seq,1,108 人)。
  • 实验室测量:来自 Kanta 国家健康数据服务的常规检验(383 项进入 GWAS 的测量各 ≥1,000 人覆盖)。
  • 无床旁监护/影像设备类元数据。

§3.10 深度溯源链

环节 记录位置
样本-生物银行归属 141 个数据集批次清单(合并集)与批次注释文件
芯片-平台-批次 variant annotation(HWE/INFO per batch)
插补参考版本 SISu v4.2(8,554 WGS),GRCh38
登记-编码版本 HILMO/AvoHILMO/死因/Kela/癌症登记逐年编码(ICD8 1967-1986、ICD9 1987-1995、ICD10 1996-)
endpoint 定义版本 官方 endpoint 定义库(每 DF 存档,含控制排除标准)
分析流水线 沙箱 FinnGen Pipelines(REGENIE/SAIGE/SuSiE/FINEMAP 版本随 release 文档)
访问与审批 Findata 审批记录、沙箱用户协议、安全考试、analysis proposal 编号

溯源链使用建议:写论文时最少应引用「DF 版本 + endpoint 定义库版本 + 分析工具版本」三元组;复现争议发生时,批次注释与 Findata 审批链路决定了问题出在数据侧还是流程侧。


§4 数据结构

§4.0 目录树

公开(绿库)与沙箱(红库)数据在 Google Cloud 存储中的组织如下(以 R13 为例):

gs://finngen-production-library-green/finngen_R13/     # 公开分析结果(绿)
├── finngen_R13_analysis_data/
│   ├── summary_stats/            # {ENDPOINT}.gz + .gz.tbi(2,755 个)
│   ├── finemap/                  # {ENDPOINT}.SUSIE.*.bgz / .FINEMAP.*.bgz
│   ├── colocalization/           # 共定位结果
│   ├── autoreporting/            # 自动报告(GWCatalog 风格)
│   ├── annotations/              # 变异注释(HWE/INFO per batch)
│   └── hla/                      # HLA 关联分析
└── finngen_R13_analysis_documentation/
    ├── finngen_R13_analysis_document_GWAS.pdf
    └── finngen_R13_colocalization.md

/finngen/library-red/finngen_R13/                      # 个体级数据(红,仅沙箱)
├── chipd_1.0/                    # 芯片基因型数据
├── plink_1.0/                    # 插补基因型 PLINK bed(+bgen)
├── grm_1.0/                      # LD 剪枝 GRM
├── analysis_covariates/          # 分析协变量(gzip TSV)
├── phenotype_1.0/
│   └── data/
│       ├── finngen_R13_endpoint_1.0.txt.gz             # endpoint 宽表
│       └── finngen_R13_endpoint_longitudinal_1.0.txt.gz
├── parental_endpoint_1.0/        # 亲代 endpoint(DF13 新增)
├── parental_causes_of_death_1.0/ # 亲代死因(DF13 新增)
├── hilmo_avohilmo_extended_1.0/  # 扩展登记明细
├── cancer_detailed_1.0/          # 癌症详细数据
└── truncated_endpoint_file_1.0/  # 截断 endpoint 文件

绿/红两库的关系:绿库(公开)只含聚合级分析结果,任何人登记后可读;红库(沙箱)才含个体级基因型与登记明细。两库目录命名一一对应(finngen_R13_*),官方文档引用路径时以 /finngen/library-red/...gs://finngen-production-library-green/... 开头,按前缀即可判断数据敏感级。

§4.1 DAIMS 字段字典(8 列)

表 1:endpoint 宽表(finngen_R13_endpoint_1.0.txt.gz)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
FID str 个体唯一假名 ID FG0001 主键/分组划分键 无(生物银行侧生成) 无缺失 全表唯一
FINNGENID str 官方个体 ID(同 FID 体系) FG0001 跨表 JOIN 键 无缺失 全表唯一
ENDPOINT_FU_AGE float case=首次事件年龄;control=随访结束年龄(DF12 起命名) 58.3 生存分析时间变量 依赖登记覆盖起点 缺失=个体无随访信息 约 0-108
I9_CHD int 冠心病 case/control 标签 1 分类标签 登记漏报(院外事件) 无显式缺失列 0/1
G6_PARKINSON int 帕金森病标签 0 分类标签 初级保健-only 诊断漏报 无显式缺失列 0/1
INCLUDE 列(上级 endpoint) int 上层 endpoint 自动包含子类病例 1 层级建模/避免标签泄漏 子类定义变更会传导 0/1

表 2:分析协变量(analysis_covariates,gzip TSV)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
FID str 个体 ID FG0001 主键 唯一
sex int 遗传学推断性别(与登记性别校验) 1 分层/校正 性发育异常个体被 QC 剔除 1/2
age float 分析时点年龄 63.2 协变量 与采样年份耦合 缺失少见 约 18-108
batch str 芯片批次 FIB_12 批次效应校正 批次清单
pc1-pc10 float 基因型主成分 -0.012 祖先/群体结构校正 连续
genotype_missingness float 个体缺失率 0.012 QC 过滤(>5% 剔除) 0-1
excess_heterozygosity float 杂合度过量(±4 SD 外剔除) 0.31 QC 连续

表 3:GWAS 汇总统计({ENDPOINT}.gz,bgzip+tabix)

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失编码 取值范围
#chrom str 染色体(GRCh38) 9 坐标定位 NA 1-22, X
pos int 位置(bp) 22125500 坐标定位 liftOver 后差异 NA 1-2.5e8
ref / alt str 参考/替代等位(alt=效应等位) C / T 效应对齐 NA NA ACGT
rsids str rsID(可多个) rs1333049 跨库 JOIN 新变异可缺失 NA(缺 rsID 行仍保留) 字符串
beta float alt 等位效应量(log OR 或加性) 0.043 MR/PRS 权重 SAIGE/REGENIE 数值非整数 NA 连续
sebeta float 效应标准误 0.008 显著性/MR 权重方差 NA NA >0
pval float 关联 p 值 3.2e-9 筛选 NA NA [0,1]
mlogp float -log10(p)(大值更稳) 8.49 排序(避免下溢) NA NA ≥0
af_alt float alt 等位频率(非 MAF) 0.47 频率谱/对齐检查 与国际库差异大(隔离人群) NA [0,1]
af_alt_cases / af_alt_controls float case/control 侧 alt 频率 0.482 / 0.469 效应方向核查 NA NA [0,1]
info float 插补质量 INFO(REGENIE 结果) 0.98 质量过滤(<0.6) NA NA [0,1]

三表关系:endpoint 宽表与 analysis_covariates 以 FID/FINNGENID 一对一连接,构成「个体级特征-标签」层;GWAS 汇总统计是个体级基因型 × endpoint 分析的边缘化产物,只含变异级信息,个体身份已完全不可见。公开用户只能拿到第三类表;前两类表的任何行列在沙箱外出现即属数据泄露事件。

§4.2 标签分布

  • R13 endpoint 定义 4,662 个,其中核心(GWAS/PheWAS 用)2,466 个;DF13 公开汇总统计的 endpoint 2,755 个(官方结果页)。
  • 病例量级从数十到数十万不等:常见 endpoint 如冠心病(R9:47,550 case / 313,400 control)、心梗 strict(24,185 case);罕见 endpoint(如心梗后并发症 226 例)仍在库中,但功效有限(MR 应用示例)。
  • 类别极不平衡是常态(case 占比常 <10%),且不同 endpoint 的对照排除标准不同,case/control 比例跨 endpoint 不可直接比较。
  • 官方对病例重叠超过 50% 的 endpoint 做过聚类(Kurki 2023 时从全库收敛到 1,932 个主分析 endpoint),层级重叠意味着「标签数量」永远大于「独立信号数量」。
  • 每轮 DF 的 endpoint 集合只增不减地累积修订:DF14 已达 4,867 个定义,跨 DF 对比须以 endpoint 名称精确匹配而非行号。

§4.3 关键统计

  • 合并插补集:21,311,644 变异(DF13);DF14 基因型个体 519,870、插补变异 21,299,087(截至 2026-02 发合作伙伴)。
  • 中位参与年龄约 63 岁(Kurki 2023);女性约 54%。
  • GWAS 变异覆盖:MAC<10 的变异不进入关联分析;精细定位流程过滤 INFO<0.6。
  • Risteys 门户对每个 endpoint 公布:个案数、未校正患病率、首事件平均年龄、按年龄/年份分布(<5 人聚合不显示)。
  • QC 口径(Kurki 2023):个体侧剔除遗传性别不匹配、缺失率 >5%、杂合度 ±4 SD 外样本;变异侧剔除缺失率 >2%、HWE 显著偏离、INFO 过低的位点。
  • 遗传数据组织:合并集由 141 个数据集构成(跨生物银行批次);LD 剪枝 GRM 与插补基因型在沙箱并列提供,分别服务混合模型与常规分析。

§4.4 数据层级

个体(FID/FINNGENID)
├── endpoint 宽表(每个体 × 4,662 endpoint,0/1 + 年龄列)
├── 登记 longitudinal 明细(HILMO/AvoHILMO 事件行:日期 + 编码 + 类型)
│   ├── 住院/专科门诊诊断(ICD-8/9/10,NOMESCO/手术编码)
│   ├── 初级保健就诊(ICD-10/ICPC2 + SPAT 操作码)
│   ├── Kela 报销/购药(ATC、VNR 药品号)
│   ├── 死因登记(直接/根本/贡献死因,WHO ICD)
│   └── 癌症登记(ICD-O-3:TOPO/MORPHO/BEH)
├── 亲代层(父母亲代 endpoint + 亲代死因,DF13 新增)
├── 基因型层(chip → 插补 → GRM;含 HLA 插补)
└── 组学层(蛋白组/单细胞,子集个体)

§4.5 缺失值与信息性缺失

缺失情形 表现 处理建议
登记 era 空白 早期年份某登记未覆盖(如初级保健登记晚于 HILMO) 按 endpoint 定义只回溯其来源登记;生存分析左截断
endpoint 列无缺失但语义受限于覆盖 0 ≠「确定未患病」 在模型中把「登记覆盖期之前出生/事件」作为协变量或敏感性分析
rsids 缺失 新插补变异无 rsID 用 chrom:pos:ref:alt 作为键
pval 下溢 p 极小时双精度归零 用 mlogp 列排序
Risteys 描述错误 门户文案偶有错配 以 endpoint 定义文件为真值
生物银行最小表型稀疏 身高/体重/吸烟为生物银行侧最小集,缺失率不一 这些字段非 FinnGen 核心,需用时检查覆盖率并做多重插补
罕见 endpoint 病例过少 case 数几十甚至个位数 并入上层 endpoint 或改用 burden/层级建模

§5 划分与使用建议

§5.1 官方划分

FinnGen 无官方 ML 训练/验证/测试划分。数据组织为「全员 cohort + endpoint 标签」,官方分析(GWAS/PheWAS)按 endpoint 动态定义 case 与对照排除集,不做留出集。官方提供的「官方划分替代物」有三:① 每 endpoint 的核心/非核心状态(2,466 核心优先);② endpoint 层级(树结构约束);③ 官方跨库 meta(作为一致性基准)。把这些用起来,比自造随机划分更贴近官方口径。

§5.2 社区惯例

  • 跨数据集验证:FinnGen ↔ UKBB 互为验证集(两侧 meta 已官方提供 867 表型);PRS 论文常用「UKBB 训练 → FinnGen 验证」或反之。
  • 时间划分:利用登记年份把事件发生晚于某年(如 2018-01-01)的个体划为「未来」测试集,模拟前瞻部署。
  • 亲缘感知划分:沙箱内有亲缘结构,家族成员必须同侧划分(可基于 GRM 聚类)。
  • endpoint 域外推:训练集取 ICD 前若干章(如心血管+代谢),测试集取未见过的章节(如神经/精神),考察疾病域泛化——这是 PheWAS 模型论文的常见协议。
  • 版本外推:DF12 训练、DF13 测试(登记数据更新带来标签增补),检验模型对标签漂移的稳健性;注意两 DF 样本几乎重叠,须按 FID 去重对齐后再切分。

§5.3 泄漏风险(重点)

  • endpoint INCLUDE 层级泄漏:若目标标签为子类 endpoint,则上级 endpoint 的年龄列/标签蕴含子类信息;把任何 endpoint 派生特征直接喂给预测子类标签的模型等于标签泄漏。
  • 亲缘泄漏:隔离人群中二/三级亲属常见,随机划分会让「遗传近亲」横跨训练/测试,PRS 类模型 AUROC 虚高。
  • 登记重叠泄漏:定义「糖尿病并发症」类特征时若使用与标签同一登记同一年份的编码,会造成时间性重述泄漏;特征窗口必须早于标签事件时间。
  • DF 间重复:DF12 与 DF13 样本几乎完全重叠(500,348 → 500,186),把两个 DF 当独立样本合并会重复计数。
  • 生物银行侧最小表型泄漏:身高/体重/吸烟与特定 endpoint(如代谢、呼吸系统)强相关且来自招募期——若这些字段在招募时已含疾病状态信息,用它做特征需与标签事件时间对齐。
  • meta 数据泄漏:使用官方 FG+UKBB meta 结果做特征选择时,若测试集个体在 meta 中已出现,等于把测试标签泄入训练过程;跨库特征选择须在 meta 之外完成。

§5.4 交叉验证建议

个体级任务推荐 GroupKFold(按 FID 或 GRM 家族簇);跨 DF 版本做「旧 DF 训练、新 DF 测试」的时间外推验证;endpoint 层面用层级交叉验证(训练只看部分 ICD 章节)评估跨疾病域泛化。稀有 endpoint(case 数 <100)建议不单独建模,并入层级上层 endpoint 或走 burden 分析。

§5.5 外部验证建议

优先使用官方提供的 FinnGen+pan-UKBB meta 浏览器(867 表型)与 FinnGen-MVP-UKBB 三方 meta(330 表型)检查效应方向一致性;单 endpoint 深度研究建议对照 Estonian Biobank(同为隔离人群)与 MVP(美国退伍军人,非隔离人群)三方三角验证。汇总级研究的最低验证标准是「lead SNP 方向一致 + 数量级相同」;个体级研究应报告跨库 AUROC 衰减幅度并分解祖先/亲缘/定义差异的贡献。


§6 AI 就绪指南

§6.0 云端快速启动

公开汇总统计托管在 Google Cloud Storage(绿库),任何装有 gsutil/gcloud 或能联网的机器均可直接使用,无需申请沙箱。零安装方案是在浏览器打开 r13.finngen.fi(PheWeb)与 risteys.finngen.fi(endpoint 门户)做信号检索;批量分析建议一台 ≥8 GB 内存的 Linux/WSL 机器 + Python 3.10+。个体级分析则只能在 FinnGen 沙箱的浏览器虚拟机内完成(见 §6.5 坑点 8)。

§6.1 快速上手

30 秒跑通路径:注册表单拿下载授权 → 下 manifest → 挑 1 个感兴趣的 endpoint 下载 → pandas 读入 → 按 mlogp 排序看 lead SNP → 到 r13.finngen.fi/Risteys 交叉核对。全程无需申请沙箱,是验证「数据是否适合你的问题」的最小成本路径。

目录结构预期与下载说明:注册表单获批后,官方邮件给出 manifest 与下载指令。推荐把全部 endpoint 统统放进 data_root/sumstats/,manifest 平级存放;下面代码以「只下载冠心病 I9_CHD 并读入」为最小可用子集。

# 前置准备:
#   data_root/
#   ├── R13_manifest.tsv          # 从官方邮件给出的 manifest URL 下载
#   └── sumstats/
#       └── I9_CHD.gz(.tbi)       # 单 endpoint 约 0.5 GB,bgzip+tabix
# data_root 与文件名由 manifest 的 path 列决定;本例手工拼接。
import gzip
import pandas as pd
from pathlib import Path

data_root = Path("data_root")

# 最小可用子集:单 endpoint 汇总统计(tabix 压缩,pandas 直读 gzip 即可)
sumstats = pd.read_csv(
    data_root / "sumstats" / "I9_CHD.gz", sep="\t",
    compression="gzip", low_memory=False,
)
# 关键列:#chrom pos ref alt rsids nearest_genes pval mlogp beta sebeta
#         af_alt af_alt_cases af_alt_controls (+info,REGENIE 结果)
lead = sumstats[sumstats["mlogp"] > 7.3].sort_values("mlogp", ascending=False)
print(lead[["#chrom", "pos", "rsids", "beta", "sebeta", "af_alt"]].head(10))
# 注意:beta/af_alt 均以 alt(效应)等位为参照——与外部库合并前必须对齐(见坑点 2)

§6.2 数据获取

数据层 获取方式 审批 周期
汇总统计(绿) 在线表单登记 → 邮件收到 gsutil 指令与 manifest 无(承诺遵守引用要求) ≤7 个工作日开账户
PheWeb/Risteys 浏览 直接访问 r13.finngen.firisteys.finngen.fi 即时
个体级(红) 仅 FinnGen 合作机构;账户表单 + 用户身份协议 + Findata 审批 + 数据安全考试(每年) 合作机构代表签署 1-2 个月
非 FinnGen 机构要生物银行样本/再联系 Fingenious 门户(FINBB) FINBB 流程 视项目

授权边界速记:绿数据下载后仍是「FinnGen 数据」——引用与致谢义务不因免费而消失;红数据的一切产出(含图表)在导出前都属敏感数据;两者都不可转授给未获授权的第三方。拿不准时先发邮件问服务台,比事后补救便宜得多。

# 汇总统计批量下载(获批邮件中会给出精确 URL 与授权说明)
# 1) 下载 manifest(含全部 endpoint 的 path)
gsutil cp https://storage.googleapis.com/finngen-public-data-r13/summary_stats/R13_manifest.tsv .
# 2) 按需挑选 endpoint 下载(示例:下载全部 I9_ 心血管 endpoint)
awk -F'\t' '$1 ~ /^I9_/ {print $NF}' R13_manifest.tsv | \
  while read p; do gsutil -m cp "gs://$p" sumstats/; done
# 3) 精细定位结果同样在绿库 finemap/ 目录,命名 {ENDPOINT}.SUSIE.cred.bgz 等

申请流程逐步说明(汇总统计 → 个体级):

  1. 在官方「Access results」页填在线表单(邮箱 + 用途),数日内收到含绿库 gsutil 指令与 manifest 地址的邮件——只需汇总统计者到此为止。
  2. 需要个体级数据者:确认所在机构已是 FinnGen 合作伙伴(非合作机构改走 Fingenious/FINBB 门户),提交 FinnGen 账户申请表。
  3. 收到账户激活邮件(注意垃圾箱),设置强密码并立即启用 2FA。
  4. 签署沙箱用户身份协议(须机构授权代表签字)。
  5. 由 FinnGen 提交给 Findata 审批名单(红数据审批约 2-3 周至 1-2 个月)。
  6. 首次登录完成数据安全考试(此后每年一次),通过后创建 IVM 虚拟机开始分析。
  7. 结果下载前提交 analysis proposal(对照 Scientific Plan 与在研清单查重)。

endpoint 定义库解析(复刻对照排除的第一步):

# 前置:从官方 endpoint 定义库页面下载对应 DF 的定义文件(tsv)到 data_root/endpoints/
# 每行 = 一个 endpoint 的定义:名称、层级、各登记来源的编码清单、年龄/性别前提、
#        互斥 condition 参数与对照排除清单
import pandas as pd

ep_def = pd.read_csv("data_root/endpoints/finngen_R13_endpoint_definitions.tsv", sep="\t")
# 1) 查看某 endpoint 的定义与控制排除
row = ep_def[ep_def["NAME"] == "E2_DIABETES_NOV2_T2D"].iloc[0]
print(row["NAME"], "| INCLUDE:", row.get("INCLUDE", ""))
# 2) 枚举全部含初级保健来源的 endpoint(_INCLAVO 后缀)
inclavo = ep_def[ep_def["NAME"].str.endswith("_INCLAVO")]["NAME"].tolist()
# 3) 在沙箱内按定义文件生成 case/control 后,务必与官方 analysis covariates 的
#    个体集合做交叉验证(case 数应与 Risteys 公布数一致)

提示:DF 之间 endpoint 定义与个体集合都会变化——定义文件、宽表与汇总统计三者必须取自同一 DF 版本,并在论文方法中记录。

§6.3 预处理全流程

流程:格式校验 → 等位对齐 → 质量过滤 → 标准化 → MR/共定位就绪。下面代码完成从原始 gz 到「可与外部 GWAS 做 meta/MR」的清洗:

# 前置:sumstats/I9_CHD.gz 已下载;外部 gwas_df 已读入并含 CHR BP EA NEA BETA P
import numpy as np

def clean_finngen(df: pd.DataFrame) -> pd.DataFrame:
    # 1) 统一 ID:优先 rsids,缺失时用 chrom:pos:ref:alt
    df = df.copy()
    df["variant_id"] = df["rsids"].fillna(
        df["#chrom"].astype(str) + ":" + df["pos"].astype(str)
        + ":" + df["ref"] + ":" + df["alt"]
    )
    # 2) 质量过滤:MAC<10 的变异官方未做关联;INFO<0.6 为精细定位惯例阈值
    if "info" in df.columns:
        df = df[df["info"] >= 0.6]
    # 3) 去重(tabix 索引边界偶发重复行)
    df = df.drop_duplicates(subset=["#chrom", "pos", "ref", "alt"])
    # 4) 效应对齐:FinnGen 效应等位=alt;外部数据通常 EA 已标明
    #    对齐后统一输出:SNP A1(效应等位) BETA P
    df["A1"] = df["alt"]
    df["A2"] = df["ref"]
    # 5) p 下溢保护:优先 mlogp
    df["P"] = np.where(df["pval"] == 0, 10 ** (-df["mlogp"]), df["pval"])
    return df[["variant_id", "#chrom", "pos", "A1", "A2",
               "beta", "sebeta", "P", "af_alt"]]

fg_clean = clean_finngen(sumstats)
# 与外部 GWAS 合并时:A1 不一致则翻转 beta 并换 A1/A2 与频率(1-af)
# 共定位/MR 推荐直接用官方 SuSiE 可信集与 SISu LD bcor,避免通用 EUR LD 面板(见坑点 6)

# --- MR 场景示例:把 FinnGen 作为结局端与暴露端 GWAS 合并 ---
# 外部暴露 GWAS(如 UKBB/如 exposure_df:SNP A1 BETA SE P EAF)
def merge_harmonise(fg: pd.DataFrame, exp: pd.DataFrame) -> pd.DataFrame:
    m = fg.merge(exp, on="variant_id", suffixes=("_out", "_exp"))
    # 等位对齐:FinnGen A1=alt(效应等位),外部以 A1 为效应等位
    same = m["A1"] == m["A1_exp"]
    flip = m["A1"] == m["A2_exp"]
    m = m[same | flip].copy()
    m.loc[flip, "BETA_exp"] = -m.loc[flip, "BETA_exp"]          # 翻转暴露端效应
    m.loc[flip, "EAF_exp"] = 1 - m.loc[flip, "EAF_exp"]
    # 回文(A1/A2 与 A1_exp/A2_exp 互逆)低 MAF 建议剔除(TwoSampleMR 惯例)
    palindromic = (
        (m["A1"].isin(["A", "T"]) & m["A2"].isin(["A", "T"])) |
        (m["A1"].isin(["C", "G"]) & m["A2"].isin(["C", "G"]))
    )
    m = m[~(palindromic & (abs(m["af_alt"] - 0.5) < 0.08))]
    m["F"] = (m["BETA_exp"] / m["SE_exp"]) ** 2                 # 工具变量强度
    return m[m["F"] >= 10]                                      # 剔除弱工具变量

# harmonised = merge_harmonise(fg_clean, exposure_df)
# 之后可用 TwoSampleMR / MendelianRandomization 包做 IVW/weighted median 等估计

§6.4 PyTorch DataLoader(个体级,沙箱内)

在沙箱内(合作机构)可用 endpoint 宽表 + 插补基因型构建 PRS/深度模型任务。以下为完整可运行的 Dataset 模板(Python 3.10,PyTorch 2.x;data_root 按 §4.0 目录树拼接):

# 目录预期(沙箱内):
#   data_root/
#   ├── phenotype_1.0/data/finngen_R13_endpoint_1.0.txt.gz   # endpoint 宽表
#   ├── analysis_covariates/finngen_R13_analysis_covariates.txt.gz
#   └── grm_1.0/                        # LD 剪枝基因型(PLINK bed),用 plink2 提取
# 任务:用 LD 剪枝 SNP + 协变量预测 endpoint(示例 I9_CHD)
import numpy as np
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader

data_root = "/finngen/library-red/finngen_R13"
ENDPOINT = "I9_CHD"

# 1) 读 endpoint 宽表(仅 3 列,避免整表载入内存)
ep = pd.read_csv(f"{data_root}/phenotype_1.0/data/finngen_R13_endpoint_1.0.txt.gz",
                 sep="\t", compression="gzip",
                 usecols=["FINNGENID", ENDPOINT, f"{ENDPOINT}_FU_AGE"])
# 2) 读协变量(sex/age/batch PC)
cov = pd.read_csv(f"{data_root}/analysis_covariates/finngen_R13_analysis_covariates.txt.gz",
                  sep="\t", compression="gzip")
df = ep.merge(cov, on="FINNGENID", how="inner")
# 3) 官方对照排除:完整复刻 control exclusion(此处示意化,实际按 endpoint 定义库执行)
df = df[~((df[ENDPOINT] == 0) & (df["E2_DIABETES_NOV2_T1D"] == 1))]  # 示例:排除 T1D 对照

# 4) plink2 预先导出 LD 剪枝 SNP 的 dosage 矩阵(命令行,见注释):
#    plink2 --bfile grm_1.0/finngen_R13 --export A --out snp_matrix --threads 8
#    得到 snp_matrix.A.txt(个体 × SNP dosage,float)
X_snp = np.load("snp_matrix.npy")          # (N, S) float32,行序与 df 对齐需自行校验
X_cov = df[["sex", "age"]].to_numpy(np.float32)
X = np.hstack([X_snp, X_cov]).astype(np.float32)
y = df[ENDPOINT].to_numpy(np.float32)

class FinnGenEndpointDataset(Dataset):
    """个体 × (SNP dosage + 协变量) → endpoint 二分类。"""
    def __init__(self, X: np.ndarray, y: np.ndarray):
        self.X = torch.from_numpy(X)
        self.y = torch.from_numpy(y)
    def __len__(self) -> int:
        return len(self.y)
    def __getitem__(self, idx: int):
        return self.X[idx], self.y[idx]

# 划分:按 FID/家族分组(隔离人群必须避免亲缘泄漏,见坑点 6/§5.3)
from sklearn.model_selection import GroupShuffleSplit
groups = df["FINNGENID"].str[:6]           # 示意分组前缀;实际用 GRM 家族簇
tr_idx, te_idx = next(GroupShuffleSplit(n_splits=1, test_size=0.2,
                                        random_state=42).split(X, y, groups))
loader = DataLoader(FinnGenEndpointDataset(X[tr_idx], y[tr_idx]),
                    batch_size=4096, shuffle=True, num_workers=4)

§6.5 坑点(8 个)

坑点速查表(详细解法见下方逐条展开):

# 坑点 分类 一句话后果
1 三代 ICD 混编与芬兰本地化 标签理解 国际映射表失配,早期病例系统性丢失
2 af_alt/beta 以 alt 等位为参照 预处理陷阱 跨库合并方向翻转,MR 结论反向
3 ENDPOINT_X_FU_AGE 语义双关 标签理解 把事件/删失年龄当基线年龄,模型偏倚
4 对照排除标准未复刻 偏倚陷阱 效应稀释,复现值全面低于官方
5 登记覆盖起点不一致+死因延迟 偏倚陷阱 时代假象与左截断,生存分析失真
6 隔离人群高 LD 与亲缘 评估误用 外部 LD 面板错估,随机划分指标虚高
7 汇总统计工程细节 工程陷阱 tabix 失效、p 下溢、PheWeb 拒收
8 沙箱出域限制与提案制度 工程陷阱 导出被拒、研究与科学计划冲突

⚠️ 坑点 1:三代 ICD 混编(ICD-8/9/10)与芬兰本地化编码(分类:标签理解)

问题:芬兰登记横跨 1967 年至今,ICD8(1967-1986)、ICD9(1987-1995)、ICD10(1996-)三代编码并存;且芬兰版 ICD 在第 4/5 位字符上有本地扩展,与国际 ICD-10、美国 ICD-10-CM 均不完全一致。直接套用国际编码映射会系统性丢失早期病例或错配亚型。
症状:endpoint 病例数远低于文献报道值;把芬兰编码喂给 ICD-10-CM 映射表时报大量 unmapped;跨时代分析出现「1995 年前后发病率跳变」。
解决

  1. 简单方法:始终使用 FinnGen 官方 endpoint(已跨三代 harmonized),不要自建 ICD 映射。
  2. 进阶方法:确需自定义 endpoint 时,在 longitudinal 明细里按 ICD 版本列分别处理三代码,并用官方 endpoint 定义库中的对应 ICD-8/9/10 码清单做并集。
  3. SOTA 方法:以官方 endpoint 为标签、自定义规则只做「endpoint 之上」的细分(如年龄分窗),并把「时代效应」作为敏感性分析维度。
    参考FinnGen 手册-健康编码集、Kurki et al. 2023(Methods-Phenotyping)。

⚠️ 坑点 2:af_alt 是效应(alt)等位频率,不是 MAF;beta 也以 alt 为参照(分类:预处理陷阱)

问题:FinnGen 汇总统计的 af_alt/af_alt_cases/af_alt_controlsbeta 全部以 GRCh38 alt 等位(效应等位)为参照,而多数外部工具与论文默认 minor allele 或自定义 EA。官方在结果页反复强调这一点。
症状:与外部 GWAS 合并时出现系统性方向翻转;MR 中 SNP 效应方向与文献相反;等位频率对不上 gnomAD(低频变异差一倍)。
解决

  1. 简单方法:合并前以 A1=alt, A2=ref 对齐,不一致就翻转 beta、并把 af 换成 1-af。
  2. 进阶方法:用 af_alt 与 af_alt_cases/controls 三列交叉验证对齐是否正确(case/control 侧频率差应与 beta 同号)。
  3. SOTA 方法:在共定位/coloc 输入中显式携带 allele 信息并用 coloc/SuSiE 的对齐检查;MR 用 TwoSampleMR 的 harmonise_data() 自动处理回文与对齐。
    参考FinnGen 官方结果页注意事项GWAS results format

⚠️ 坑点 3:ENDPOINT_X_FU_AGE 列语义双关(case 与 control 含义不同)(分类:标签理解)

问题:endpoint 宽表中每个 endpoint 都有一列年龄(DF12 起统一命名 ENDPOINT_X_FU_AGE),但同一列对 case 是「首次事件年龄」、对 control 是「随访结束年龄」——不是单纯的人口学年龄。同时上级 endpoint 通过 INCLUDE 列自动包含子类病例,标签之间不是独立的。
症状:把该列当「基线年龄」做协变量,模型在 case 侧系统性偏老;把多个层级 endpoint 当独立多标签做多任务学习,子类与父类标签完全共线。
解决

  1. 简单方法:分析时给 case 和 control 分别解释该列;基线年龄改用分析时点年龄(covariates 表)。
  2. 进阶方法:生存建模直接利用其「事件时间 vs 删失时间」语义(Risteys 的 Cox 回归即按此实现);层级预测用「只预测子类、父类由 INCLUDE 推导」的结构化输出。
  3. SOTA 方法:多任务场景按 ICD 章节分组并屏蔽父-子对的损失项,防止层级共线破坏训练。
    参考Endpoint and endpoint longitudinal data

⚠️ 坑点 4:官方 GWAS 的对照排除标准(control exclusion)未复刻导致效应稀释(分类:偏倚陷阱)

问题:FinnGen 官方 GWAS 对每个 endpoint 使用专门的对照排除标准(例如 T2D 的对照须排除 T1D 者、癌症对照须排除同器官其他癌),且每轮 Data Freeze 修订。自己从宽表生成 case/control 时不复刻这些规则,会把「高危但未确诊者」留在对照组。
症状:复现的 OR/β 系统性小于官方 pheweb 数值;显著性位点数量骤减;不同 DF 间结果对不上。
解决

  1. 简单方法:下载对应 DF 的官方 endpoint 定义库,逐条执行 control exclusion 规则。
  2. 进阶方法:在沙箱内用 endpoint 定义文件(含各登记码清单与 condition 参数)脚本化生成 case/control,并单元测试抽样个体。
  3. SOTA 方法:直接使用官方 summary statistics 做下游(MR/PRS/共定位),避免重造 GWAS;确需自定义表型时在论文中报告与官方定义的差异敏感性分析。
    参考FinnGen clinical endpoints

⚠️ 坑点 5:登记覆盖起点不一致与死因登记延迟(分类:偏倚陷阱)

问题:各登记源覆盖起点不同(HILMO 最早可回溯至 1969 年;AvoHILMO、Kanta 实验室数据等更晚启动),死因登记有按年度的上报与处理延迟。同一出生队列在不同 endpoint 上的「可观测窗口」不同,产生左截断与时代效应。
症状:老年个体「突然出现」大量 1990 年代事件(登记首次覆盖);近年 endpoint 病例数逐年上升被误读为发病率上升;生存分析中出生越早的人风险被高估。
解决

  1. 简单方法:遵循 Risteys 的做法,把随访起点统一设为 1998-01-01(该日期起各登记覆盖完整),事件早于此按此日处理。
  2. 进阶方法:按出生年份分层检查首事件年龄分布;对晚期启动的登记来源的 endpoint 做敏感性分析(含/不含该来源)。
  3. SOTA 方法:用时钟年龄 × 登记覆盖窗口构造双重时间轴,或以启动后生存模型(delayed entry)处理左截断。
    参考Risteys 文档(随访起点与覆盖图)

⚠️ 坑点 6:隔离人群的高 LD 与亲缘——外部 LD 面板与随机划分全失效(分类:评估误用)

问题:芬兰隔离人群 LD 延伸更长、低频变异富集且存在亲缘结构。用 1000G EUR 等 LD 面板做 FinnGen 信号的 clumping/精细定位,或用随机划分训练 PRS/ML 模型,都会得到扭曲结果。
症状:精细定位可信集异常庞大或错位;PRS 在「无亲缘测试集」上的 AUROC 明显低于随机划分;GWAS QQ 图 λ 膨胀但 LDSC 截距正常(亲缘混杂)。
解决

  1. 简单方法:官方 GWAS 已用 REGENIE+GRM 处理亲缘——直接用官方汇总统计,勿在个体级重跑线性回归。
  2. 进阶方法:精细定位/LD 估计用官方 SISu bcor(LDstore 读取);沙箱内建模按 GRM 家族簇分组划分。
  3. SOTA 方法:SuSiE+FINEMAP 双方法交叉验证可信集(官方已并行输出),跨人群 meta 用 FinnGen+UKBB 官方 meta 检查隔离人群特异信号。
    参考:Kurki et al. 2023(Methods-Genotyping and QC);R4 手册 LD estimation 章节。

⚠️ 坑点 7:汇总统计文件的工程细节——命名、压缩、数值语义(分类:工程陷阱)

问题:官方文件命名严格为 {ENDPOINT}.gz + .gz.tbi(无 .txt.gz 后缀);bgzip 压缩的 tabix 格式用普通 gzip 工具能解但会失去随机访问;数值来自插补 dosage 与 SAIGE/REGENIE 输出,beta/计数列含小数而非整数;MAC<10 变异不出现在文件中;pval 可能下溢为 0。自建 PheWeb 上传还有 11 列硬格式与 UNIX 换行符要求。
症状:tabix 索引报错「gzip 不兼容」;按整数逻辑解析 n_hom 列失败;极显著位点排序时 NaN;自建浏览器文件被管线静默拒收。
解决

  1. 简单方法:用 pandas.read_csv(compression="gzip") 或 pysam/tabix 库读取;排序与显著性筛选一律用 mlogp
  2. 进阶方法:批量处理前用 manifest 校验文件集合;下载后校验 .tbi 存在性,需要随机访问时用 bcftools view -Rtabix 原生查询。
  3. SOTA 方法:沙箱内自建结果浏览按官方 PheWeb 指南 的 11 列规范 + metadata.json 提交,由数据管理员经安全检查后上绿库。
    参考GWAS results format、R6 手册 Data description。

⚠️ 坑点 8:沙箱「数据出不去」——导出限制、绿桶只读与分析提案(分类:工程陷阱)

问题:个体级数据(红数据)受严格出域控制:沙箱内文本可复制进、不可复制出,禁止截屏;绿库桶不能从沙箱内写入;任何结果下载需先提交 analysis proposal(防止重复研究并符合 FinnGen Scientific Plan),导出还要经数据管理员安全检查。此外结果有 1 年独占期政策。
症状:脚本在本地能跑、进沙箱后 gsutil cp 到外部被拒;把中间表写本地磁盘失败;论文投稿被要求补充 analysis proposal 编号。
解决

  1. 简单方法:在沙箱内完成全部分析,只把聚合级结果(如 AUROC、汇总表)走官方导出流程。
  2. 进阶方法:立项时同步提交 analysis proposal 并登记到 appsheet,避免与其他在研项目撞车被合并审批。
  3. SOTA 方法:把「可在沙箱内复跑」的代码仓库(版本固定)作为研究可复现性方案,本地只保留聚合结果与官方公开数据。
    参考Partner researchersRed data users

§6.6 数据增强(安全 / 危险)

  • 安全:等位频率随机打乱(permutation)做 null 基准;对 dosage 矩阵做特征标准化;SNP 掩码(random masking)用于对比式预训练;按登记年份的时间窗滚动划分。
  • 安全:以 endpoint 层级做标签平滑(父类概率约束子类);按生物银行批次重加权缓解招募偏倚;对年龄列做分箱(十年窗)降低登记 era 噪声。
  • 危险:对 endpoint 标签做重采样不区分对照排除规则(制造伪病例);把层级父子 endpoint 当独立类别做 SMOTE 过采样(层级共线);对个体级 SNP 行做行间插值(基因型非连续量,插值无意义且泄漏家族结构)。
  • 危险:用非芬兰 LD 面板「增强」FinnGen 信号做 PRS 训练;把 DF12/DF13 混合样本当独立增强数据(同一批人重复计数,等效标签泄漏)。

§6.7 模型推荐表

任务 推荐方法/工具 说明
GWAS(个体级) REGENIE(官方,R10 起) GRM 亲缘校正,分两步适配不平衡 case-control
GWAS(汇总级复用) 官方 SAIGE/REGENIE 结果 无需重跑
精细定位 SuSiE + FINEMAP(官方并行输出) 配 SISu bcor LD
共定位 coloc / eCAVIAR 输入官方 SuSiE 可信集
MR TwoSampleMR / MR-Base 对齐效应等位后使用
PRS LDpred2 / PRSice-2 / lassosum2 LD 参考用 SISu 或官方 GRM
LoF burden PheWeb 内置视图 / SAIGE-GENE 基因级功能缺失聚合检验
HLA 关联 官方 HLA 分析结果(绿库) 已预计算 HLA 等位关联
深度表型建模 MLP/ResNet on dosage(沙箱内) 对比线性 PRS 基线
疾病轨迹 Cox / 时序 Transformer(沙箱内) 特征窗口必须早于事件

§6.8 硬件需求表

场景 最低配置 推荐
单/多 endpoint 汇总统计下载与解析 8 GB 内存、~2 GB/endpoint 磁盘 16 GB 内存、SSD
沙箱 GWAS(官方 Pipelines) 平台托管,GWAS 单次约 3-10 欧元 官方流水线模板
沙箱个体级建模 IVM 默认配置(可调) +0.03 欧/GB/月存储预算
全组学(蛋白/单细胞)下游 32 GB 内存 HPC 或沙箱批量作业
tabix 区间随机查询 任意(原生 tabix/bcftools 即可) 避免整文件解压

§6.9 评估指标代码

汇总级研究的主要「指标」是复现质量而非预测精度:lead SNP 方向一致率、数量级一致性与跨 DF 稳定性;个体级预测任务则使用下述分类指标(注意类别极不平衡下 AUROC 稳定而 AUPRC 敏感)。

# 个体级 endpoint 二分类评估:类极不平衡场景 AUROC + AUPRC + 校准
import numpy as np
from sklearn.metrics import roc_auc_score, average_precision_score, brier_score_loss

def evaluate_endpoint(y_true: np.ndarray, y_score: np.ndarray) -> dict:
    return {
        "AUROC": roc_auc_score(y_true, y_score),          # 主指标(官方口径)
        "AUPRC": average_precision_score(y_true, y_score),  # 稀有 endpoint 更敏感
        "prevalence": float(y_true.mean()),
        "brier": brier_score_loss(y_true, y_score),        # PRS 部署需校准
    }
# 汇总级复现检查:与官方 pheweb 对比 lead SNP 的 beta 符号一致率与 p 值秩相关

§6.10 MLOps 笔记

  • 版本对齐:任何模型/表格必须记录 DF 版本号(如 DF13);DF 间样本高度重叠,禁止跨 DF 混合训练。
  • 可复现性:沙箱内固定 pipeline 代码版本并随论文发布聚合结果;个体级代码仓库在合作机构内归档。
  • 审计:记录所用 endpoint 定义库版本(每 DF 更新)、对照排除规则与 SISu LD 版本。
  • 成本控制:沙箱存储按 GB/月计费,中间文件及时清理;GWAS 批量作业优先用官方 Pipelines 模板。
  • 隐私:个体级数据永不落地本地;导出物走官方安全审查,保留 proposal 编号链路。
  • 监控:部署 PRS/风险模型时按出生队列与性别分桶监控 AUROC 漂移;登记端新增年度数据(如 R14)后重跑校准集。
  • 实验管理:沙箱 IVM 默认 24 小时回收会话——长作业交给官方 Pipelines,交互式探索的中间产物写入个人红桶而非临时目录。
  • 依赖管理:SISu LD、REGENIE 参数与 endpoint 定义库三者任一变更都会改变结果等价性,实验元数据中至少记录这三项的版本哈希。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
招募偏倚 医院生物银行与 legacy 疾病队列主导,重症/住院人群过代表;血液服务银行贡献健康个体 不用于患病率估计;GWAS 效应通常稳健;对照排除规则纠偏
祖先偏倚 几乎全部为芬兰欧洲祖先,跨人群外推受限 与 UKBB/MVP 三方 meta 交叉验证
时代/登记偏倚 三代 ICD 并存、各登记覆盖起点不同、死因延迟 统一随访起点 1998-01-01;敏感性分析(见坑点 5)
对照定义偏倚 对照排除标准按 endpoint 定制,随 DF 修订 使用官方定义库版本并记录 DF
性别偏倚 女性 54%,某些 endpoint 男性/女性诊断行为差异 分层分析与性别特异性 endpoint
生存偏倚 老年富集 + 竞争风险(死亡删失) Cox 竞争风险模型;Risteys 分窗 lagged HR
批次效应 Illumina/Affymetrix 双平台、141 个数据集批次 协变量含批次与基因型 PC;变异注释含 per-batch HWE/INFO
参与者撤回 生物银行同意可随时撤回,DF 间样本数微调 每轮 DF 以官方最新 FID 清单重建分析集

§7.2 标注质量

endpoint 定义经专科临床专家组审批,跨三代 ICD harmonized,本体匹配(EFO/DOID/MeSH)有人工策展,是大型生物银行中规范化程度最高的一档。局限:行政登记驱动的标注无逐例临床复核,特异性优先策略意味着敏感性让步(部分轻症漏检);Risteys 门户描述文案偶有程序化聚合错误;每 DF 定义修订使历史结果的 endpoint 边界不完全可比。

质量锚点:官方对每个 endpoint 同步公布「建议对照排除标准」,这是验证你复刻的 case/control 集是否正确的黄金参照——沙箱内复刻后先对齐「case 数 = Risteys 显示数」,再开始任何建模。癌症 endpoint 因采用 ICD-O-3 形态学编码,其特异性显著高于纯 ICD 编码 endpoint,跨 endpoint 比较时注意这一结构性差异。

§7.3 泛化性表

场景 失效风险 证据/说明
效应迁移到非芬兰欧洲人群 低频富集信号在非芬兰人群 MAF 更低、功效下降;常见变异效应大体一致(官方 UKBB meta 支撑)
PRS 跨人群(非欧) LD 与频率谱差异,隔离人群训练的 PRS 外推显著衰减
患病率/流行病学估计 招募结构不代表芬兰全人口(官方明示不适用)
轻症/门诊为主疾病 中高 特异性优先 + 住院富集,仅用初级保健登记的 endpoint 依赖 _INCLAVO 定义
儿科/罕见单基因病 队列中位年龄约 63 岁,儿科 endpoint 病例稀少
老年用药多态场景 Kela 报销以报销药物为限,OTC 与部分新药不完整覆盖
精神疾病等 stigma 敏感诊断 登记依赖就诊编码,未就诊者缺失;住院端比门诊端完整

§7.4 伦理

数据使用受芬兰生物银行法与 GDPR 约束:生物银行书面同意覆盖登记链接与再联系;个体级数据伪匿名化,沙箱出域受控;Findata(国家登记数据审批机构)对红数据研究者逐人审批;DPO 机制与数据泄露报告流程完备;结果发布设 1 年独占期后全量公开。

对 AI 研究者的三点合规提示:① 基因组数据在 GDPR 下属特殊类别数据,即使伪匿名也不可视为匿名,任何二次使用都须在生物银行同意与 Scientific Plan 范围内;② 参与者可通过生物银行随时撤回同意——这正是 DF12→DF13 样本数微调的原因之一,分析中应按最新 DF 重建样本集而非沿用旧 FID 清单;③ 涉及再联系参与者(如招募临床亚组)必须走 Fingenious/FINBB 渠道,不得凭登记信息自行接触。

§7.5 公平性

  • 祖先维度:数据本质上服务欧洲(尤其芬兰)人群遗传发现,非欧人群的效用与风险预测能力不可直接迁移;官方以 FinnGen+MVP+UKBB 多人群 meta 缓解。
  • 性别维度:女性样本略多但心血管等 endpoint 的典型表现(症状编码差异)可能引入诊断行为偏倚;建议分性别校准。
  • 社会经济维度:登记无直接收入变量,医院招募模式可能低估低就医率群体。
  • 年龄维度:中位约 63 岁使儿科与早发型疾病证据薄弱;针对年轻人群的模型需在别处训练。
  • 地理维度:南部/中部大学医院辐射区样本更密,北部与乡村居民代表性较低,跨区域部署前应做分层评估。

§7.6 数据漂移

  • 编码漂移:1996 年 ICD10 切换、2011 年代初级保健登记扩展、Kanta 实验室数据接入——endpoint 历史深度随 DF 变化。
  • 定义漂移:endpoint 库每 DF 修订(R13 4,662 个定义,DF14 已增至 4,867 个),旧 release 的部分 endpoint 被重命名或合并。
  • 样本漂移:DF12→DF13 总基因型个体 520,210 → 519,972(QC/撤回微调),核心 GWAS 集随之变化;跨 DF 对比必须以官方口径为准。
  • 分布漂移监控:建议按出生队列 × 登记来源绘制 endpoint 首事件年龄分布(Risteys 已内置),任何模型部署前重跑。
  • 成本漂移:组学扩展(蛋白/单细胞/实验室值)使「同一 FID」在不同数据层的覆盖面每轮 DF 都在扩大——特征工程应显式记录数据层可用时点,避免用未来才有的测量预测过去的事件。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 宽格式 endpoint 宽表(个体 × endpoint 0/1 + 年龄列)
2 唯一标识 FID/FINNGENID 全表唯一,跨表 JOIN 稳定
3 特殊字符 endpoint 命名 ASCII 大写+下划线(G6_PARKINSON)
4 重复行 官方 QC + tabix 索引约束;个体行唯一
5 缺失编码 ⚠️ 登记 era 空白语义复杂,0 ≠ 确认未患病
6 标签标识 endpoint 定义文件 + DOID/EFO/MeSH 映射公开
7 罕见类分组 核心 2,466 endpoints 筛选 + 官方层级聚类(重叠 >50% 合并)
8 偏倚评估 ⚠️ 招募偏倚官方承认,无内置偏倚校正权重
9 数据字典 手册 + 每字段说明 + Risteys 门户
10 信息性缺失解释 ⚠️ 部分 endpoint 的登记来源差异需读定义文件推断
11 设备记录 无床旁/影像设备元数据(登记型数据天然缺失)
12 共线性 GRM(LD 剪枝)+ SISu LD bcor 官方提供
13 编码映射 ICD-8/9/10 + ATC + ICD-O-3 全映射文档化
14 时间戳处理 ⚠️ 事件日期覆盖不均匀,年代效应需自行处理
15 划分建议 ⚠️ 无官方 ML 划分;需用户自建(§5.2-§5.3)
16 泄漏讨论 亲缘/层级/时间泄漏路径明确可查(§5.3)
17 标签分布 Risteys 公布每 endpoint 个案数/患病率/年龄分布
18 测量偏倚 ⚠️ 登记行为(就诊/编码习惯)偏倚存在,量化需研究
19 外部验证建议 官方提供与 pan-UKBB/MVP 的 meta 浏览器
20 版本记录 DF/R 双轨版本 + release notes 完整存档
21 预处理脚本 沙箱 FinnGen Pipelines(REGENIE/SuSiE/FINEMAP 模板)
22 合规要求 Findata 审批 + Scientific Plan + 数据安全考试
23 多模态对齐 ⚠️ 蛋白/单细胞子集样本量小(619/828/1,108),对齐需自行处理
24 去标识化 伪匿名 + 沙箱出域控制 + 无自由文本

DAIMS 评分:19.5 / 24

评分解读:FinnGen 在数据字典、版本管理、编码映射、合规与去标识化等「治理类」维度达到国家队列的标杆水平,LD/GRM 配套使遗传学分析开箱即用;失分集中在「ML 工程类」维度——无官方训练/测试划分、登记缺失语义复杂、设备级元数据缺失、多模态子集对齐成本高。这与其设计目标(大规模 GWAS/PheWAS 而非通用 ML 基准)一致。

对你意味着什么

  1. 做 GWAS/MR/共定位/PRS 研究可直接起步——官方汇总统计 + SuSiE 可信集 + SISu LD 已消除最大摩擦。
  2. 做个体级 ML 前必须先解决三件事:按官方定义库复刻对照排除、按 GRM 家族簇分组划分、把登记覆盖窗口写进特征工程;否则 §5.3 的三条泄漏路径会让指标虚高。
  3. 若你的任务依赖设备级生理信号或非欧人群泛化,FinnGen 不是正确数据源——改用 MIMIC/UKBB/All of Us 组合。
  4. 跨 DF 更新研究结论时,把「endpoint 定义库 diff」当作首要检查项:endpoint 合并/改名会无声地改变你的病例集合。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
UK Biobank(Estonian/UK meta) UK Biobank/ESTBB 15 种既往研究疾病的新关联验证 30 个新关联(低频、芬兰富集) 效应方向一致 低频编码变异在隔离人群可测、在泛欧人群需 meta(Kurki 2023)
ESTBB + UKBB meta Estonian Biobank、UKBB 15 疾病 GWAS meta 识别 30 个新关联 meta 后部分信号仍芬兰特异 隔离人群 meta 增效策略可行(Kurki 2023)
pan-UKBB(867 表型) Broad Pan-UKBB 双侧 meta 效应一致性 867 表型浏览器公开 常见变异方向一致率极高 官方维护的跨库一致性资源(metaresults 门户)
MVP(美国退伍军人) US VA MVP 三方 meta(330 表型) FG-MVP-UKBB 浏览器 非隔离人群功效下降 跨祖先三角验证官方化(public-mvp-ukbb 门户)
X 染色体剂量补偿研究 FIMM(Fu/Kenttämies 等) 女性特异 GWAS(R10) 39.6 GB 汇总统计公开于 Zenodo 与常染色体流程一致 X 染色体与剂量补偿机制可研究(Zenodo 15125257)

§8 基准性能与生态

§8.1 排行榜(里程碑研究)

FinnGen 无外部统一排行榜;下表列出以 FinnGen 为核心数据源的同批 Nature 系列里程碑结果(数值不可直接互相比较——endpoint 定义、DF 版本与分析方法各异)。| 排名/主题 | 研究 | 关键结果 | 年份/期刊 | 关键技术 | 完整引用 | 代码/资源 |
|-----------|------|----------|-----------|----------|----------|-----------|
| 1 | 旗舰 PheWAS | 224,737 人、1,932 endpoint:2,733 全显著(893 PWS)、2,496 位点、148 coding 变异 | 2023 Nature | SAIGE + PheWAS + fine-mapping | Kurki MI et al., 2023, Nature. DOI 10.1038/s41586-022-05473-8 | r5.finngen.fi |
| 2 | 单/双等位剂量效应 | 单等位与双等位效应并存,复杂遗传模式下常见病信号增强 | 2023 Nature | burden/剂量模型 | Heyne HO, Karjalainen J, et al., 2023, Nature(FinnGen Collection) | Nature Collection |
| 3 | 药物使用模式 PGS | 心理代谢疾病终身用药轨迹的遗传预测 | 2023 Nature | PGS + 纵向登记 | Kiiskinen T, Helkkula P, Ripatti S, et al., 2023, Nature | Nature Collection |
| 4 | 上呼吸道炎症遗传 | 41 个基因组位点、2 型炎症通路共享 | 2023 Nat Commun | GWAS meta | Saarentaus EC, Karjalainen J, Palotie A, et al., 2023, Nature Communications | Nature Collection |
| 5 | 耳硬化 GWAS | 27 个位点,与骨骼结构共享信号 | 2023 Nat Commun | 跨库 meta | Rämö J, Kiiskinen T, Palotie A, et al., 2023, Nature Communications | Nature Collection |
| 6 | 静脉曲张 | GJD3 保护性错义变异(芬兰富集) | 2023 Commun Biol | coding 变异 GWAS | Helkkula P, Hassan S, Tukiainen T, et al., 2023, Communications Biology | Nature Collection |
| 7 | 睾酮-健康因果 | 睾酮与多数非性别特异疾病无因果 | 2023 Commun Med | MR | Leinonen J, Mars N, Tukiainen T, et al., 2023, Communications Medicine | Nature Collection |
| 8 | 自免疫-痴呆 MR | 免疫系统级 MR+三角验证支持自免疫参与痴呆 | 2022 Nature Aging | 免疫 MR triangulation | Lindbohm J, Mars N, Kivimäki M, et al., 2022, Nature Aging | Nature Collection |

读表提示:以上研究同日发表于 Nature FinnGen Collection(2023-01-18),共享同一批 DF5/DF7 数据但 endpoint 与方法各异,结果互为佐证而非排名;其中 Kurki 2023 的 PheWAS 数字(2,733 全显著/2,496 位点)是最常被引用的全表型组基准。

§8.2 SOTA 总结与选型建议

  • 目标是发现新靶点:直接用 DF13 汇总统计 + 官方 SuSiE 可信集 + coloc,把「PWS 信号 → coding 变异 → 共定位」作为漏斗。
  • 目标是方法学论文:隔离人群是 PRS/LD/遗传混合模型的天然压力测试场,需以 GRM 家族分组为底线设计。
  • 目标是临床预测:FinnGen 适合作为「外部队列」验证,不适合作为部署数据的单一来源(无设备信号、年龄偏老)。
  • 目标是单细胞机制解释:把疾病 GWAS 与 multiome cis-QTL 共定位(CASCADE 浏览器已预计算),再回 FinnGen 汇总统计验证表型关联方向。
  • 目标是药物安全性:对靶点编码变异做 PheWAS 全表型扫描,并与 pan-UKBB meta 双库复核以排除芬兰特异假象。

§8.3 评测协议

  1. 冻结 DF 版本与 endpoint 定义库版本;2. 复刻官方对照排除;3. 主要指标 AUROC(个体级)或 lead SNP 复现率(汇总级);4. 一律与官方 pheweb 数值交叉核对 beta 方向与数量级;5. 跨库比较时引用官方 meta 浏览器结果而非自行合并;6. 报告时写明所用 SISu/LD 版本与 REGENIE/SAIGE 轮次;7. 罕见 endpoint 声明病例数与功效局限。
数据集 关系 互补点
UK Biobank 竞争+互补 影像/环境表型;泛欧人群对照
Estonian Biobank 同类隔离队列 meta 增效
Million Veteran Program 多人群对照 非欧祖先三角验证
genomics-england-100k 罕见病 WGS 测序深度互补
deCODE(冰岛) 同类隔离队列 家系深度(long pedigree)互补,文献常并引
FinnGen multiome(自扩展) 子集组学 cis-QTL 与疾病共定位闭环

§8.5 关键论文 Top 7

  1. Kurki MI, Karjalainen J, Palta P, Sipilä TP, Kristiansson K, Donner KM, et al. FinnGen provides genetic insights from a well-phenotyped isolated population. Nature 613(7944):508-518, 2023. DOI 10.1038/s41586-022-05473-8 —— 旗舰论文:隔离人群低频变异-疾病图谱。
  2. Heyne HO, Karjalainen J, et al. Mono- and biallelic variant effects on disease at biobank scale. Nature, 2023(DOI 见 Nature Collection)—— 复杂遗传模式下剂量效应。
  3. Kiiskinen T, Helkkula P, Ripatti S, et al. Genetic predictors of lifelong medication-use patterns in cardiometabolic diseases. Nature, 2023 —— 用药轨迹 PGS。
  4. Kanai M, et al. Population-scale immune multiome atlas reveals regulatory disease mechanisms. medRxiv 2025.11.25.25340489 —— 1,108 人单细胞 multiome 图谱。
  5. Aavikko M, Liu A, Daly M. Unlocking the potential of FinnGen to advance cancer research. Nat Rev Cancer, 2025. DOI 10.1038/s41568-025-00885-w —— 癌症研究应用全景综述。
  6. Saarentaus EC, Karjalainen J, Palotie A, et al. Inflammatory and infectious upper respiratory diseases associate with 41 genomic loci and type 2 inflammation. Nature Communications, 2023 —— 章节级疾病域示范。
  7. Helkkula P, Hassan S, Tukiainen T, et al. GWAS of varicose veins identifies a protective missense variant in GJD3 enriched in the Finnish population. Communications Biology, 2023 —— 靶点发现范式样板。

§8.6 社区活跃度

  • 月度 FinnGen Users’ meeting(Zoom,欧美双场)与 office hour;全员自动加入 Slack 工作区。
  • 完整 Handbook(docs.finngen.fi)免登录开放;Task Forces/Interest Groups 按疾病域组织,合作研究者可申请加入。
  • 各芬兰大学设本地支持人(Local SupPers);服务台 finngen-servicedesk@helsinki.fi
  • 第三方生态:PheWeb 浏览器(r13.finngen.fi)、CTGCatalog 收录、大量 MR/PRS 论文以 FinnGen 为标准数据源。
  • 学术影响:旗舰论文 Scopus 引用 3,157(截至 2026-09),MR/PRS/共定位方法论文将其作为「隔离人群标准数据源」已成惯例。
  • 发布节奏:DF14 起固定为每年一次登记数据更新(2026-02、2027-02),可据此规划长周期研究的数据刷新点。

§8.7 生态快照表

资源 类型 链接 状态(截至 2026-09) 推荐理由
FinnGen Handbook 官方文档 docs.finngen.fi 持续更新 一切字段/流程的唯一权威
R13 PheWeb 结果浏览器 r13.finngen.fi 在线 检索变异/表型/基因
Risteys endpoint 门户 risteys.finngen.fi 在线 endpoint 定义与分布
Lab values GWAS 结果浏览器 labvalues.finngen.fi 383 项实验室测量 定量性状补充
FG+pan-UKBB meta meta 浏览器 public-metaresults-fg-ukbb.finngen.fi 867 表型 跨库一致性
FG-MVP-UKBB meta meta 浏览器 public-mvp-ukbb.finngen.fi 330 表型 三方验证
Fingenious 样本再联系 site.fingenious.fi FINBB 运营 非 FinnGen 机构接入芬兰生物银行
FinnGen multiome 子集组学 cascade.finngen.fi 2026-08 公开 单细胞调控图谱
Variant annotation(绿库) 变异注释 finngen_R13_analysis_data/annotations/ 随 DF 更新 HWE/INFO per batch 溯源

§9 相关资源与引用

§9.1 官方文档与入口

§9.2 教程与自助材料

  • Handbook「New to FinnGen」快速指南:账户、绿/红数据分级、考试与 2FA 流程。
  • Handbook「Data Protection & Security」系列(含安全视频课程):个体级数据操作规范,安全考试题源。
  • 沙箱内 Pipelines 模板:REGENIE GWAS、SuSiE/FINEMAP 精细定位、colocalization 全链路官方参数。
  • PheWeb 自定义上传指南(11 列规范 + metadata.json)—— 沙箱内发布自定义 GWAS 结果。
  • Release notes(按年归档,2024/2025/2026):每份新文件的时间线与路径清单,是新 DF 迁移的首查材料。
  • Monthly Users’ meeting 录像与 office hour(合作研究者可见成员区)。

§9.3 浏览器与在线工具

工具 用途 地址
R13 PheWeb 变异/表型/基因检索、LoF burden r13.finngen.fi
Risteys endpoint 定义、患病率、生存分析 risteys.finngen.fi
Lab values browser 383 项实验室测量 GWAS labvalues.finngen.fi
FG+pan-UKBB meta 867 表型双库 meta public-metaresults-fg-ukbb.finngen.fi
FG-MVP-UKBB meta 330 表型三方 meta public-mvp-ukbb.finngen.fi
CASCADE multiome browser 单细胞 cis-QTL 与共定位 cascade.finngen.fi

§9.4 社区与支持

  • 服务台:finngen-servicedesk@helsinki.fi(账户、访问、一般问题)。
  • 数据保护官员:dpo-finngen@helsinki.fi(隐私与数据泄露)。
  • Slack 工作区(自动加入)与 Task Forces / Interest Groups(按疾病域)。
  • 本地支持人网络:奥卢大学、于韦斯屈莱大学、东芬兰大学、坦佩雷大学、图尔库大学各设联系人。
  • 发布通讯:FinnGen Newsletter 邮件列表,每轮 DF 发布与沙箱工具更新第一时间公告。
  • 用户会议:每月最后一个周二(欧美双场 Zoom),office hour 于次日按赫尔辛基/波士顿双时区进行。

§9.5 BibTeX 完整引用

@article{kurki2023finngen,
  title   = {FinnGen provides genetic insights from a well-phenotyped isolated population},
  author  = {Kurki, Mitja I and Karjalainen, Juha and Palta, Priit and Sipilä, Timo P and
             Kristiansson, Kati and Donner, Kati M and Reeve, Mary P and Laivuori, Hannele and
             Aavikko, Mervi and Kaunisto, Mari A and Loukola, Anu and Lahtela, Elisa and
             Mattsson, Hannele and Laiho, Päivi and Della Briotta Parolo, Pietro and
             Lehisto, Arto A and Kanai, Masahiro and Mars, Nina and Rämö, Joel and
             Kiiskinen, Tuomo and Heyne, Henrike O and Veerapen, Kumar and Rüeger, Sina and
             Lemmelä, Susanna and Zhou, Wei and Ruotsalainen, Sanni and Pärn, Kalle and
             Hiekkalinna, Tero and Koskelainen, Sami and Paajanen, Teemu and Llorens, Vincent and
             Gracia-Tabuenca, Javier and Siirtola, Harri and Reis, Kadri and Elnahas, Abdelrahman G and
             Hiltunen, Mikko and Palotie, Aarno and FinnGen},
  journal = {Nature},
  volume  = {613},
  number  = {7944},
  pages   = {508--518},
  year    = {2023},
  doi     = {10.1038/s41586-022-05473-8},
  pmid    = {36653562}
}

@misc{finngenhandbook,
  author = {{FinnGen}},
  title  = {{FinnGen} Documentation of the R13 release},
  year   = {2025},
  url    = {https://docs.finngen.fi},
  note   = {Accessed 2026-09-05}
}

@article{aavikko2025finngen,
  title   = {Unlocking the potential of {FinnGen} to advance cancer research},
  author  = {Aavikko, Mervi and Liu, Aoxing and Daly, Mark},
  journal = {Nature Reviews Cancer},
  year    = {2025},
  doi     = {10.1038/s41568-025-00885-w}
}

@article{kanai2025multiome,
  title   = {Population-scale immune multiome atlas reveals regulatory disease mechanisms},
  author  = {Kanai, Masahiro and others},
  journal = {medRxiv},
  year    = {2025},
  doi     = {10.1101/2025.11.25.25340489}
}

§9.6 引用指南

官方引用要求:① 使用官方描述句「The FinnGen study is a large-scale genomics initiative that has analyzed over 500,000 Finnish biobank samples…」;② 致谢文本「We want to acknowledge the participants and investigators of the FinnGen study」;③ 引用 Kurki et al. 2023(最新旗舰);④ 建议把「FinnGen」作为论文关键词;⑤ 涉及具体 DF 的结果时在方法中写明版本(如 DF13/R13,2026-06 公开)。

补充惯例:① 汇总统计页与 Handbook 各自给出 BibTeX 模板,引用网页类文档时用 @misc 条目并注明访问日期;② 使用官方 SuSiE/精细定位输出时同时引用 Kurki 2023 的 Methods 章节;③ 衍生数据库(如 CTGCatalog 收录)仍应回溯引用 FinnGen 原始发布。


§10 AI 使用声明卡

§10.1 AI 模型列表

  • 大语言模型(AI 初稿生成):千方病案写作 agent(fast-model)
  • WebSearch 检索(事实核查):CodeBuddy WebSearch(2026-09 检索批次)

§10.2 AI 参与范围

AI 生成初稿范围:全文章节框架与正文文字、代码示例、表格填充、JSON-LD 序列化。人工职责:事实核对(对照官方 Handbook、Nature 论文与官方结果页)、数字来源核验、医学与工程审核、最终发布决定。

AI 未参与:官方数据的生产与维护;本页面对官方文档的解读以 2026-09 检索到的公开版本为准,官方文档更新后本页相应内容应随之复核。所有 FinnGen 商标与数据权利归 FinnGen 项目及其合作方所有,本页面为独立第三方百科条目。

§10.3 输入来源列表

  1. Kurki MI, et al. FinnGen provides genetic insights from a well-phenotyped isolated population. Nature 613:508-518, 2023. DOI 10.1038/s41586-022-05473-8
  2. FinnGen Handbook — Data Freezes and Releases. https://docs.finngen.fi/finngen-data-specifics/finngen-data-freezes-and-releases
  3. FinnGen 官方结果访问页. https://www.finngen.fi/en/access_results
  4. FinnGen Data Releases 2025 release notes. https://docs.finngen.fi/release-notes/data-releases-2025
  5. FinnGen 官方瑞典语结果页(DF13 数字). https://www.finngen.fi/sv/utnyttja-resultaten
  6. FinnGen Handbook — Endpoint and endpoint longitudinal data. https://docs.finngen.fi/finngen-data-specifics/red-library-data-individual-level-data/what-phenotype-files-are-available-in-sandbox-1/endpoint-and-endpoint-longitudinal-data
  7. FinnGen Handbook — More information on health code sets. https://docs.finngen.fi/finngen-data-specifics/finnish-health-registers-and-medical-coding/more-information-on-health-code-sets
  8. FinnGen Handbook — FinnGen clinical endpoints. https://finngen.gitbook.io/finngen-handbook/finngen-data-specifics/endpoints/finngen-clinical-endpoints
  9. FinnGen Handbook — GWAS results format. https://docs.finngen.fi/finngen-data-specifics/green-library-data-aggregate-data/core-analysis-results-files/gwas-results-format
  10. FinnGen Handbook — Red data users(沙箱架构与成本). https://finngen.gitbook.io/finngen-handbook/where-to-begin.../quick-guides/red-data-users
  11. FinnGen Partner researchers 页. https://www.finngen.fi/en/partner-researchers
  12. FinnGen Handbook FAQ — Where do I apply for data access. https://finngen.gitbook.io/finngen-handbook/faq/about-finngen-access-and-accounts/where-do-i-apply-for-data-access
  13. Risteys 文档(随访起点与方法). https://r10.risteys.finngen.fi/documentation
  14. FinnGen R4/R6 手册 PDF(汇总统计与精细定位格式). https://finngen.gitbook.io/documentation
  15. PheWeb 自定义上传指南. https://docs.finngen.fi/working-in-the-sandbox/which-tools-are-available/untitled/how-to-set-up-a-pheweb-browser-for-summary-statistics
  16. Zenodo — X chromosome female summary statistics(R10). https://zenodo.org/records/15125257
  17. Nature FinnGen Collection. https://www.nature.com/collections/ahigjjgihc
  18. Aavikko M, Liu A, Daly M. Nat Rev Cancer, 2025. DOI 10.1038/s41568-025-00885-w
  19. MR 应用示例(finngen_R9 endpoints). Nutrition Metabolism and Cardiovascular Diseases, 2024
  20. Tampere 大学研究门户(Scopus 引用快照). https://researchportal.tuni.fi/en/persons/marianna-niemi/
  21. FinnGen Newsletter vol 1/2026(DF14 统计). Oulu 大学邮件列表转载

§10.4 人工校验表

内容模块 审核者 审核方式 审核状态
§1 概览与版本时间轴 千方病案医学编辑部 与官方 Data Freezes 页逐行比对 ✅ 已验证
§2 医学背景(ICD 映射、登记体系) 千方病案医学编辑部 交叉审核 ✅ 已通过
§3 数据集规格 千方病案医学编辑部 与 Handbook 模态/格式章节交叉比对 ✅ 已验证
§4 数据结构(字段字典、目录树) 千方病案医学编辑部 与 Handbook endpoint/gwas-results 格式比对 ✅ 已验证
§5 划分与泄漏讨论 千方病案医学编辑部 交叉审核 ✅ 已通过
§6 代码示例与 8 个坑点 千方病案医学编辑部 逻辑审查 + 官方文档逐条溯源 ✅ 已通过
§7 DAIMS 与偏倚评估 千方病案医学编辑部 交叉审核 ✅ 已通过
§8 排行榜与引用数 千方病案医学编辑部 与 Nature Collection/Scopus 快照比对 ✅ 已验证
§9 资源链接与 BibTeX 千方病案医学编辑部 链接可达性检查 + 引文格式核对 ✅ 已验证
§C JSON-LD @graph 千方病案医学编辑部 Schema v3.9 字段逐项校验 ✅ 已通过

§10.5 AI 生成章节标注

以下章节由 AI 生成初稿并经人工审核:§1.0 30 秒速览、§3.0 版本抉择矩阵、§6.0-§6.4 代码示例、§6.5 八个坑点、§6.9 评估指标代码、§7.7 DAIMS 评估表与评分、§8.7 生态快照、§C JSON-LD。

§10.6 最后人工审核日期

2026-09-05(与 §0.3 审核日期一致)

页面状态:published(全部内容已完成审核并发布)

返回 AI-Ready 数据集