信息速览

EGA(欧洲基因组-表型档案)— 受控访问人类基因组-表型数据档案 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | EGA 欧洲基因组-表型档案 |
| 英文全称 | European Genome-phenome Archive |
| 别名/简称 | EGA、Federated EGA(联邦节点网络,FEGA) |
| 疾病分类 | 全疾病谱受控存档(ICD-11:2A00-2F3Z 恶性肿瘤为主,约 57% 研究;另覆盖 5A11 2 型糖尿病、4A40 多发性硬化、6A00-6E7Z 精神行为障碍等 50+ 病种) |
| SNOMED CT | 363346000(恶性肿瘤)等多病种映射,详见 §2.2 |
| 数据模态 | WGS/WES 测序、基因分型芯片、转录组 RNA-seq、表观基因组 + 表型/临床数据(多研究档案) |
| AI 任务类型 | 变异检测与复现、序列深度学习、多组学整合、疾病亚型发现、方法基准评估、遗传流行病学 |
| 样本总数 | 8,600+ datasets / 4,500+ studies( datasets 截至 2025-12,studies 截至 2021-11) |
| 数据大小 | 16 PB+(截至 2025-12,CRG 官方口径) |
| 数据格式 | fastq.gz、BAM/CRAM、VCF、加密 .c4gh(元数据 XML/JSON 公开) |
| 许可证 | 无统一许可证——逐 dataset 由 DAC 数据访问协议与 DUO 政策界定(元数据公开) |
| 访问级别 | 申请审核(受控访问:注册 EGA 账户 + DAC 审批 + 数据访问协议) |
| DUO 标签 | GRU / HMB / DS / IRB / PUB / NCU 等(逐 dataset 配置,机器可读) |
| 语言 | 英文 |
| 首发日期 | 2008 年(EMBL-EBI 发起上线) |
| 最后更新 | 持续滚动入库(截至 2026-09 官网仍在发布新增研究) |
| 发布机构 | EMBL-EBI(英国辛克斯顿)与 Centre for Genomic Regulation(西班牙巴塞罗那) |
| 官方主页 | https://ega-archive.org |
| 下载地址 | https://ega-archive.org/access/download(批准后经 pyEGA3 / Secure Download Client) |
| DOI | 10.1038/ng.3312(档案主论文,Nature Genetics 2015) |
| 引用次数 | 383+(Google Scholar,经加泰罗尼亚研究门户快照,截至 2026-09 查询,主论文 ng.3312) |
| AI 就绪度评分 | ⭐⭐⭐(3/5)— 元数据 schema 公开、pyEGA3/htsget 工具成熟、测试账户可演练;扣分项:DAC 人工审批周期不可控、逐 dataset 申请、需自行解密与格式转换、无官方划分与预处理脚本 |
| 页面状态 | published |
§0 E-E-A-T 信任声明与免责声明
医学审核者:千方病案医学编辑部交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、EGA 覆盖病种与临床任务定义、金标准描述)、§7 偏倚分析。
数据工程审核者:千方病案医学编辑部交叉审核:§4 DAIMS 数据字典(EGAS/EGAD/EGAC 多级 accession 体系、元数据对象模型)、§5 数据划分策略、§6 预处理 Pipeline 和坑点。
审核日期:2026-09-05
审核方式:交叉审核
利益冲突声明:千方病案医数集与 EMBL-EBI、CRG、GA4GH、ELIXIR 无任何商业利益关联。本页面不销售、不转售 EGA 数据,仅提供 AI 就绪指南与学术信息服务。编辑者未接受上述机构的任何形式资助。
医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。
技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。
数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。EGA 要求数据使用者注册 EGA 账户、经相应 Data Access Committee(DAC)审批并遵守逐 dataset 的数据使用协议与 DUO 政策标签。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。
§1 数据集概览
§1.0 📌 30 秒速览
这是什么? EGA(European Genome-phenome Archive,欧洲基因组-表型档案)是欧洲的受控访问数据库,专门永久保存那些因隐私和知情同意原因不能完全公开的人类基因组测序、基因分型与表型临床数据。它由英国 EMBL-EBI 与西班牙巴塞罗那基因组调控中心(CRG)联合运营,截至 2025-12 存量超过 16 PB,覆盖 4,500+ 项研究与 8,600+ 个 datasets(官方主页、NAR 2022 论文)。
为什么重要? 基因组数据天然无法匿名化——每个人的基因组都是唯一的。EGA 与美国 dbGaP 几乎同期建立,共同回答了一个根本问题:如何在保护受试者权利(GDPR、知情同意)的前提下让敏感数据持续被复用?EGA 的分布式访问模型把决定权交还给数据提供者的数据访问委员会(DAC),并以 DUO 术语把使用限制做成机器可读标签,成为欧洲精准医学与 GA4GH 数据治理的事实基础设施(Lappalainen et al. 2015)。
我能用它做什么? 找到与你的疾病方向匹配的受控 dataset(元数据公开可检索),向对应 DAC 提交申请;批准后用 pyEGA3 或 Secure Download Client 下载、用 Crypt4GH 解密,即可开展变异复现、方法基准评估、多组学建模等研究。注意:申请逐 dataset 进行、DAC 审批常需数周,且数据只能用于批准范围内的研究目的。
§1.1 摘要
EGA 于 2008 年由 EMBL-EBI 发起,为需要安全存储与授权分发的生物医学研究数据提供永久档案,随后扩展为与西班牙 CRG 的联合运营(Lappalainen et al. 2015)。数据由研究组、机构与国际联盟自愿提交:提交者先用 EGACryptor 或 Crypt4GH 加密原始数据上传至提交箱,再经 Submission Portal 或 REST API 提交基于 INSDC 模式扩展的公开元数据(含 policy、dataset、dac 对象),系统按 File Quality Control Report 做自动化加人工质检,从提交到发布平均约 1 个月(recherche.data.gouv 仓库档案、Australian BioCommons 实战指南)。
访问侧采用分布式模型:使用者注册 EGA 账户后在 dataset 或 DAC 页面提交申请,决定权完全在数据控制者(DAC)而非 EGA;批准后账户即被授权,经 pyEGA3(HTTPS,端口 8443)、htsget 区域拉取或 Aspera 例外通道下载(EGA 官方 FAQ)。2022-01 起,Federated EGA 联邦网络完成首次端到端测试,14+ 个 ELIXIR 国家参与,敏感数据留在各国节点、公共元数据经 Central EGA 统一发现(CSC 报道)。EGA 是 ELIXIR Core Data Resource 与 GA4GH Driver Project(Freeberg et al. 2022)。
§1.2 战略价值
维度一:欧洲敏感组学数据的唯一性规模化底座。 截至 2025-12,EGA 存量超过 16 PB、8,600+ datasets;2015 年时其体量四年内就从约 50 TB 增至 1,700 TB,其中 57% 为癌症研究,exome 测序占 38%、全基因组测序占 29%(CRG 招聘文案、Lappalainen et al. 2015)。ICGC、UK10K、Wellcome Trust Case Control Consortium 等里程碑项目的受控个体级数据均托管于此,使 EGA 成为复现与扩展欧洲人类遗传学结论的事实必需入口——没有 EGA 授权,大量已发表论文的原始数据无法触及。
维度二:数据治理标准的孵化器与互操作枢纽。 EGA 是 GA4GH 数据安全工作流成员,参与 Security Technology Infrastructure 建议制定;DUO 数据使用本体、GA4GH Passport 数字身份权限、htsget 协议、Crypt4GH 加密等标准均在 EGA 场景中先行落地(EGA 安全概览、Lawson et al. 2021)。Federated EGA 把中心化档案扩展为 14+ 国联邦网络,为 GDPR 之下的跨境敏感数据共享提供了已被验证的工程范式,也使其成为各类国家基因组计划(如芬兰、挪威、瑞典节点)对接欧洲生态的标准接口。
维度三:负责任 AI 的数据底座。 对 AI 研究者而言,EGA 的稀缺性在于"个体级基因组 + 真实临床表型 + 明确使用边界"三者同时可得:DUO 标签让合规过滤可以被写成代码(policy_duo 字段直接进 CI 校验),DAC 审批让数据来源可追溯进模型卡片,Passport 让多机构协作训练的授权链路可审计。随着联邦学习与可信执行环境的成熟,EGA 及其联邦节点正在成为"数据不出境、模型可共享"范式的默认试验场——这也是把 EGA 用法工程化(而非仅仅引用)的长期回报所在。
§1.3 同类数据集横向对比
| 数据集 | 规模口径 | 模态 | 访问机制 | 与 EGA 的差异化 |
|---|---|---|---|---|
| EGA | 16 PB+、8,600+ datasets(截至 2025-12) | 测序/基因分型/转录组/表观组 + 表型 | DAC 逐 dataset 审批 | 多研究档案,提交者保留数据控制权,DUO 机器可读政策 |
| dbGaP(NCBI) | 美国对应档案,phs 前缀编号 | 基因分型 + 表型 | NIH 管理申请审批 | 资助项目强制存入、由仓库统一管理;EGA 为自愿提交、控制权在提交者(对比访谈) |
| UK Biobank | 约 50 万参与者 | 深度表型 + 影像 + WGS | 注册 + 协议 + 费用 | 单一深度表型队列;EGA 为跨研究异构档案 |
| ENA(欧洲 nucleotide 档案) | 全球最大开放序列档案 | 开放测序数据 | 完全开放 | EGA 的开放对照面:凡无需受控的数据走 ENA |
| Federated EGA 节点 | 14+ ELIXIR 国家(截至 2022-01 报道) | 各国敏感组学数据 | 国家节点 + 中央元数据目录 | 数据不出国门的分布式形态,元数据统一经 Central EGA 发布(CSC) |
§1.4 版本时间轴
| 时间 | 里程碑 | 来源 |
|---|---|---|
| 2008 | EMBL-EBI 发起上线 EGA | Nature Genetics 2015 |
| 2013-2015 | 扩展为与西班牙 CRG(巴塞罗那)联合运营,四年内体量 50 TB → 1,700 TB | Nature Genetics 2015 |
| 2015 | 主论文发表于 Nature Genetics(ng.3312),700+ studies 已被复用 | Nature Genetics 2015 |
| 2021-11 | NAR 数据库论文:4,500+ studies、近 1,000 家机构;获评 ELIXIR Core Data Resource | NAR 2022 |
| 2022-01 | Federated EGA 首次端到端测试(芬兰 CSC;挪威、瑞典参与) | CSC 报道 |
| 2023 前后 | 提交侧从 XML 过渡到程序化 JSON schema;Submission API v3.0 上线 | BioCommons 指南、API Spec |
| 2025-12 | CRG 官方口径:16 PB+、3,700+ studies、8,600+ datasets | EURAXESS 招聘文案 |
| 2026 | 官网持续发布下游论文;期间曾出现 pyEGA3 服务中断维护公告 | EGA 主页 |
§1.5 典型应用场景
- 已发表发现的可复现验证:论文附录给出 EGAS/EGAD 编号后,申请原始数据重跑分析管线,验证GWAS/体细胞突变结论的稳健性。
- 变异检测与比对方法的基准评估:用异构平台(Illumina MiSeq 到 NovaSeq 一代)的真实临床数据测试 caller 在低覆盖、cfDNA 等场景的表现,补充开放基准(GIAB)覆盖不到的分布。
- 跨队列罕见变异与罕见病研究:Solve-RD 等罕见病联盟把受控数据托管于 EGA,支持按疾病特异 DUO 标签(DS)精准申请。
- 方法学开发(不落盘式):借助 htsget 按基因组区域拉取 BAM/CRAM 片段,在无需下载整个文件的前提下开发或调试算法。
- 数据治理与合规工程研究:以 EGA 的 DAC 流程、DUO 标注、Passport 权限体系为对象,研究自动化数据访问审核与联邦访问控制。
§2 医学背景
§2.1 ICD-11 编码映射表
EGA 是跨病种档案,未绑定单一 ICD-11 类目。按 2015 年论文的疾病分布(57% 为癌症)与官网公开研究的持续主题,主要覆盖类目如下:
| 研究领域 | ICD-11 编码 | ICD-11 中文名 | EGA 存档情况 |
|---|---|---|---|
| 恶性肿瘤(总类) | 2A00-2F3Z | 恶性肿瘤 | 2015 年口径占全部研究 57%,为第一大主题 |
| 乳腺恶性肿瘤 | 2C60 | 乳腺恶性肿瘤 | 大型乳腺癌队列与转移灶测序研究常见(如 SAFIR02) |
| 支气管或肺恶性肿瘤 | 2C25 | 支气管或肺恶性肿瘤 | NSCLC 纵向治疗反应基因组研究常见 |
| 前列腺恶性肿瘤 | 2C82 | 前列腺恶性肿瘤 | cfDNA/血浆测序研究存档(如 Plasma-seq 系列) |
| 2 型糖尿病 | 5A11 | 2 型糖尿病 | 复杂疾病全基因组关联与人群研究常见 |
| 多发性硬化 | 4A40 | 多发性硬化 | 免疫/微生态多组学研究见于官网 2026-06 推荐 |
| 精神与行为障碍 | 6A00-6E7Z | 精神与行为障碍 | 精神疾病遗传研究(官网 2014 新闻列明精神病类) |
| 罕见病 | 各系统专章 | 罕见病 | Solve-RD、EJP RD 联盟受控数据托管于 EGA |
注:ICD-11 编码用于研究主题检索与对齐;EGA 的原始表型以提交者标注为准,官方要求表型尽量用 EFO 术语化,二者并非一一对应。
§2.1b SNOMED CT 映射表
| 研究主题(EFO/自由文本常见写法) | 对应 ICD-11 | SNOMED CT 码 | SNOMED 术语 |
|---|---|---|---|
| Cancer / malignant neoplasm | 2A00-2F3Z | 363346000 | 恶性肿瘤疾病(malignant neoplastic disease) |
| Breast cancer | 2C60 | 254837009 | 乳腺恶性肿瘤(malignant tumor of breast) |
| Lung cancer | 2C25 | 363358000 | 支气管与肺恶性肿瘤(malignant neoplastic disease of bronchus and lung) |
| Prostate cancer | 2C82 | 399068003 | 前列腺恶性肿瘤(malignant tumor of prostate) |
| Type 2 diabetes | 5A11 | 44054006 | 2 型糖尿病(diabetes mellitus type 2) |
| Multiple sclerosis | 4A40 | 24700007 | 多发性硬化(multiple sclerosis) |
| Essential hypertension | BA00 | 59621000 | 原发性高血压(essential hypertension) |
| Whole genome sequencing(过程) | — | 443968005 | 全基因组测序(sequencing of whole genome) |
§2.2 覆盖疾病简介与流行病学背景
EGA 的疾病谱横跨 50+ 类 pathology(CRG 2014 新闻),以复杂疾病为主体:癌症(乳腺、结肠、胰腺、食管、神经内分泌肿瘤等,官网 2026-06 论文推荐列表可见)、自身免疫病(多发性硬化、类风湿关节炎)、代谢与心血管疾病(糖尿病、高血压)、精神疾病,以及罕见病(ellipse 访谈)。以癌症为例:全球癌症负担持续上升,肿瘤体细胞突变图谱(ICGC/PCAWG 一类全基因组数据)已成为靶向治疗与免疫治疗生物标志物研究的基础资源;这类数据的受控托管几乎都落在 EGA(国际癌基因组联盟 ICGC 即为例,Nature Genetics 2015)。多发性硬化等自身免疫病方面,2026-06 官网推荐的去混杂定量微生态研究即托管于 EGA,体现了跨组学、跨病种的持续产出。
对 AI 研究者而言,EGA 的流行病学价值在于:它是少数能拿到个体级基因型 + 表型联合数据的受控来源,可用于验证开放汇总数据(GWAS summary statistics)无法回答的问题——个体级异质性、罕见变异承载、家族结构与跨组学交互。
从流行病学基数看,EGA 的疾病覆盖与全球重大慢病负担高度重合:恶性肿瘤全球每年新发约 2,000 万例、死亡约 970 万例(IARC GLOBCAN 2022),对应 EGA 第一大研究主题;多发性硬化全球患者约 290 万人(MSIF Atlas of MS 2023);糖尿病成人患者超 5 亿(IDF Diabetes Atlas)。这些疾病的大规模个体级基因组研究大多选择把原始数据托管于 EGA 或 dbGaP——理解 EGA 的覆盖结构,等于理解"哪些人群级基因组问题已经有受控数据可用"。
§2.3 临床任务定义
| 临床任务 | 定义 | EGA 数据如何支撑 |
|---|---|---|
| 风险筛查 | 识别高风险个体(如遗传性肿瘤易感) | 种系 WGS/WES 队列支持变异频率与外显率复核 |
| 诊断 | 变异解读与分子分型 | 体细胞/种系对照(tumor-normal)配对数据存档 |
| 分级/分型 | 肿瘤亚型与治疗敏感性分层 | SAFIR02 类"基因组选患者入靶向治疗"研究 |
| 预后 | 生存与复发风险建模 | 纵向治疗反应数据(转移灶多时间点取样) |
| 治疗反应预测 | 药物基因组学与免疫治疗标志物 | 官网 2026 推荐的 pembrolizumab 罕见癌生物标志物研究 |
§2.4 患者人群构成
| 维度 | 情况 | 来源与备注 |
|---|---|---|
| 数据来源机构 | 近 1,000 家(截至 2021-11),2014 年时 140+ 家国际机构 | NAR 2022、CRG 2014 |
| 人群疾病谱 | 复杂疾病为主(多数为患者),含健康对照与人群队列 | CRG 2014 |
| 地域 | 全球提交(Wellcome Trust、ICGC、东京大学、北京大学、哈佛、日内瓦大学等),以欧洲为主 | CRG 2014、Nature Genetics 2015 |
| 年龄/性别/种族 | 无统一字段;样本必填属性仅匿名 Donor ID、生物性别、EFO 表型 | BioCommons 指南 |
| 就医类型 | 研究型医疗体系产生的队列数据(biomedical research / research-focused healthcare) | EGA 主页定义 |
§2.5 临床与科研价值
其一,复现与再分析价值:受控存档保住了知情同意的合法性,使个体级数据得以长期存在——2014 年前 4 个月数据就被传输 20,000+ 次给近 5,000 名用户(CRG 2014)。其二,方法学基准价值:真实临床异构数据(不同平台、覆盖率、样本类型)是算法压力测试的最佳素材。其三,转化价值:从 UK10K 罕见变异(Nature 2015)到转移性乳腺癌基因组选药(SAFIR02),EGA 托管的数据反复进入临床决策链条的证据层。其四,治理示范价值:DAC + DUO + 加密传输的完整闭环为各国建立敏感数据仓库存档提供了可复制模板。
§2.6 金标准对照表
| 维度 | 情况 | 性质 |
|---|---|---|
| 数据划分 | 无官方划分;以 dataset 为访问单元,跨 dataset 的训练/验证/测试切分由使用者自行设计并自担合规责任 | 社区惯例 |
| 标注方式 | 表型由提交者标注;官方要求匿名 Donor ID + 生物性别 + EFO 表型为必填,个体级详细表型日益普遍 | 提交者人工标注 + 元数据 schema 约束 |
| 标注者资质 | 原研究团队(PI/数据管理员);法律层面由 DAC(data stewards、机构法律代表、PI 组成)把关用途合规 | 提交者 + DAC 双重治理 |
| 金标准性质 | 档案型基础设施:本身不定义预测任务金标准,但为方法学论文提供受控参考数据 | 基础设施型资源 |
| 质量控制 | 每次提交均走 File Quality Control Report,自动化 + 人工,提交到发布平均约 1 个月 | 机构化 QC 流程(recherche.data.gouv) |
§3 数据集规格
§3.0 版本抉择矩阵
EGA 为滚动更新档案,无离散版本号;"选版本"实质是选访问路径与数据形态:
| 你的需求 | 推荐路径 | 体量 | 理由 |
|---|---|---|---|
| 可行性调研、找目标 dataset | Central EGA 网页检索 / Discovery Catalogue(元数据公开) | 0 下载 | 仅元数据公开,无需申请 |
| 演练下载工具与管线 | pyEGA3 测试账户(ega-test-data@ebi.ac.uk,内含 1000 Genomes 公开文件) | GB 级 | 无需 DAC 审批,全程可复演 §6 流程 |
| 正式研究用受控数据 | 注册账户 → 逐 dataset 向 DAC 申请 → pyEGA3/Secure Download Client | TB 级/研究 | 唯一合法路径;同一 DAC 可批量申请 |
| 国家级敏感数据、要求数据不出境 | Federated EGA 节点(sda-cli + Crypt4GH 密钥对) | 节点级 | 数据留在国家节点,元数据经中央发布 |
| 批量程序化提交自己的数据 | Submission API v3.0(Bearer 认证,JSON) | 按提交 | 高基数量对象(样本/run/analysis)用 API 效率高 |
§3.1 模态详情
| 模态 | 典型内容 | 技术平台 | 在档案中的地位 |
|---|---|---|---|
| 全外显子组测序 | tumor-normal 配对、孟德尔病队列 | Illumina 系列 | 2015 年口径占研究 38%,第一大方法 |
| 全基因组测序 | WGS 低覆盖/高覆盖、cfDNA | Illumina 系列(含 MiSeq 案例存档) | 占 29%;PCAWG 级联合分析的原料 |
| 基因分型阵列 | GWAS case-control、人群结构 | Illumina/Affymetrix 芯片 | 占 20%,早期研究为主 |
| 转录组 | RNA-seq 表达与融合基因 | Illumina 系列 | 占 9%,近年增长 |
| 表观基因组 | 甲基化、染色质状态 | 甲基化芯片/测序 | 占 3% |
| 单细胞多组学 | 单细胞测序(含线粒体嵌合等前沿研究) | 微流控平台配套测序 | 2026 年官网推荐论文已含单细胞多组学研究,反映档案前沿化 |
| 表型/临床数据 | dataset 级或个体级表型,EFO 术语化;受控临床元数据以 Analysis/表型文件附带 | — | 与上述各模态关联存档 |
(占比均出自 Lappalainen et al. 2015,截至 2015 年口径,比例随时间变化。)
§3.2 按子集/口径的规模表
| 口径 | 数值 | 截至 | 来源 |
|---|---|---|---|
| Studies(累计存档) | 4,500+ | 2021-11 | NAR 2022 |
| Studies(CRG 口径) | 3,700+ | 2025-12 | EURAXESS |
| Datasets(受控访问单元) | 8,600+ | 2025-12 | EURAXESS |
| 数据体量 | 16 PB+ | 2025-12 | EURAXESS |
| 文件条目 | 约 5.5M 量级 | 2026(官网图表轴) | EGA 主页 |
| 覆盖机构 | 近 1,000 家 | 2021-11 | NAR 2022 |
| 受试者规模 | 100 万人以上 | 约 2019 报道 | ellipse/PRBB |
注意:3,700+ 与 4,500+ 两个 studies 口径并存(前者为 2025-12 CRG 招聘文案口径,后者为 2021-11 NAR 论文口径),可能统计边界不同;引用时务必标注口径与时间。
§3.3 数据格式表
| 格式 | 内容 | 说明 |
|---|---|---|
| fastq.gz | 原始测序读段 | 最常见提交形态(官网 dataset 页逐文件列出) |
| BAM / CRAM | 比对结果 | CRAM 更省空间;配 BAI/CRAI 索引才能用 htsget 区域拉取 |
| VCF / BCF | 变异集合 | 常以 analysis 对象登记;配 TBI 索引 |
| 加密容器 .c4gh | 上述任一格式 | Crypt4GH 加密,文件名形如 prod_ega-box-429_encrypted_原文件名.时间戳.c4gh,需本地解密(实战记录) |
| XML / JSON | 元数据(study/sample/experiment/run/analysis/policy/dac) | 公开;schema 基于 INSDC 扩展,官方 schema 页 |
§3.4 存储与体量
- 存量:16 PB+(截至 2025-12,CRG 口径);官网增长图轴显示 2014-2026 间文件数从数十万增至 5.5M 量级(EGA 主页)。
- 单研究量级:以公开示例 dataset EGAD00001000364(Plasma-seq)为参照:50 个 fastq.gz 文件、共 21.4 GB;大型 WGS 研究可达数 TB,社区报告有单 dataset 43 TB 的极端案例(pyEGA3 issue #192)。
- 提交侧限制:提交箱(submission box)上限 8 TB,超出需与 Helpdesk 协调(recherche.data.gouv)。
- 本地规划:建议为单 dataset 预留"明文 + 解密临时 + 校验副本"约 3 倍空间。
- 体量预估方法:申请前先在 dataset 页逐文件查看(公开信息含文件类型与大小,如 fastq.gz 230.8 MB-908 MB 不等),估算下载时长——按 pyEGA3 实测 1-7 MB/s 区间,1 TB 数据约需 1.8-12.8 天;网络条件差的团队应优先申请 htsget 索引齐全的 dataset 或开通 Aspera 例外通道。
- 副本与持久性:数据复制于巴塞罗那超算中心(BSC),官方定位为永久存档、无时间上限(recherche.data.gouv)。
§3.5 标注方式
EGA 不做集中式二次标注。表型与临床信息由提交者在元数据中声明:必填为匿名 Donor ID、生物性别、表型(官方建议 EFO 术语化,如 MONDO:0008315 对应前列腺癌的 DUO 疾病标签);更细的临床元数据因受控而不入公开 schema,由提交者以 Analysis/表型文件形式附带,README 或 Phenopackets 说明(BioCommons 指南)。数据使用限制则统一映射为 DUO 术语的机器可读政策条码(CSC 报道)。
§3.6 标注者资质与一致性
表型标注者为原研究团队(PI 及其数据管理员);访问治理由 DAC 承担,其成员构成(data stewards、机构法律代表、PI)与决策规则须公开在 dataset 页面的数据访问政策中,如 Gustave Roussy DAC 的章程逐条列明委员会构成、申请材料清单与约 1 个月审结时限(EGAD00010002239 政策页)。一致性方面:跨研究的术语与粒度没有强制统一(详见坑点 6),这是档案型资源的固有特征。
§3.7 采集周期
- 提交通道 2008 年起持续开放;2011 年后主流提交从阵列基因分型转向二代测序(Nature Genetics 2015)。
- 提交到发布平均约 1 个月(自动 + 人工 QC);发布设 1 年 embargo,可申请延长(recherche.data.gouv)。
- 数据本身由各研究在其原始项目周期内采集,时间跨度覆盖 2008 年前至今,temporalCoverage 记为 2008/2026。
§3.8 地域覆盖
数据提交方遍布全球:Wellcome Trust(英国)、ICGC(多国)、东京大学(日本)、北京大学(中国)、哈佛大学(美国)、日内瓦大学(瑞士)、不列颠哥伦比亚癌症机构(加拿大)等 140+ 家机构(2014 口径),至 2021-11 近 1,000 家机构;用户同样分布于五大洲(CRG 2014、Nature Genetics 2015)。联邦化后,新增国家节点级地理覆盖(芬兰 CSC、挪威、瑞典为首批测试)。
§3.9 设备与平台规格
| 平台/设备 | 出现场景 | 备注 |
|---|---|---|
| Illumina MiSeq | 公开示例 dataset EGAD00001000364(血浆 cfDNA 低覆盖 WGS) | 官网 dataset 页明示 Technology: Illumina MiSeq |
| Illumina HiSeq/NovaSeq 系列 | 大型 WGS/WES 研究 | 元数据 experiment 对象记录平台与文库信息 |
| 基因分型芯片(Illumina/Affymetrix) | 早期 GWAS 研究(2015 年口径占 20%) | array-based technologies |
| Cytoscan 微阵列 | SAFIR02 乳腺癌靶向治疗选择研究 | EGAD00010002239 页面 |
§3.10 深度溯源链
EGA 的溯源由 accession 体系与审计日志双轨支撑:编号轨——study(EGAS)→ dataset(EGAD)→ run/analysis(EGAR/EGAN)→ file(EGAF),每个对象在公开元数据中互相引用,论文仅需引用 EGAS/EGAD 即可回溯到文件级;安全轨——用户权限变更、数据访问请求、资源使用均留审计日志,密钥与加密数据分离存储(EGA 安全概览)。使用者侧的溯源建议:保留 DAC 批准邮件编号、下载日志(pyEGA3 输出日志 pyega3_output.log)与每个文件的 MD5 校验记录,构成完整的合规证据链。
accession 体系速查(申请与引用时反复使用):
| 前缀 | 对象 | 层级 | 示例 | 引用场景 |
|---|---|---|---|---|
| EGAS | Study(研究) | 项目级 | EGAS00001000451 | 论文数据可用性声明 |
| EGAD | Dataset(数据集) | 访问单元 | EGAD00001000364 | DAC 申请对象 |
| EGAC | DAC(数据访问委员会) | 治理单元 | EGAC00001000293 | 批量申请、政策查询 |
| EGAR | Run(测序 run) | 实验级 | EGAR00001000453 形态 | 数据 ↔ 实验映射 |
| EGAN | Analysis(衍生分析) | 衍生级 | 变异调用/比对产物 | 二次分析结果溯源 |
| EGAF | File(物理文件) | 文件级 | EGAF00000168251 | 断点续传、校验对账 |
§4 数据结构
§4.0 目录树
以下为一个批准 dataset 下载、解密并解包元数据后的典型本地布局(以公开示例 EGAD00001000364 为参照):
ega_workspace/ # 你的工作根目录(自建)
├── credential.json # pyEGA3 数据访问凭据(自建,勿入库)
├── keys/
│ ├── alice.pub # Crypt4GH 公钥(交给下载服务方)
│ └── alice.sec # Crypt4GH 私钥(离线备份,勿上传)
├── EGAD00001000364/ # 以 dataset 编号命名的一级子目录
│ ├── EGAF00000168251.fastq.gz # 解密后的数据文件(按元数据登记名落地)
│ ├── EGAF00000168253.fastq.gz
│ ├── ... # 共 50 个文件、约 21.4 GB
│ ├── *.md5 # 校验和文件(下载完整性核验)
│ └── metadata/ # 网页下载的 metadata zip 解压后
│ ├── EGAS00001000451.xml # study 对象(标题/描述/关联论文)
│ ├── sample_*.xml # 样本:匿名 donor_id、性别、EFO 表型
│ ├── experiment_*.xml # 实验:平台、文库策略(如 Illumina MiSeq)
│ ├── run_*.xml # run 对象:run 与文件的映射
│ ├── analysis_*.xml # 衍生分析(如变异调用)及其文件
│ ├── policy_*.xml # 数据使用政策(DUO 标签、限制条款)
│ └── dac_*.xml # DAC 对象:委员会与联系方式
└── manifest.csv # 自建:把文件→样本→表型对齐的分析清单
§4.1 DAIMS 字段字典
核心字段取自 EGA 公开元数据模型(INSDC 模式 + policy/dataset/dac 扩展):
| 字段名 | 类型 | 说明 | 示例值 | AI 用途 | 观测误差 | 信息性缺失编码 | 取值范围 |
|---|---|---|---|---|---|---|---|
| study_id | Text | 研究级唯一编号 | EGAS00001000451 | 关联论文、确定申请粒度 | 一个 study 可含多个 dataset | 无 | EGAS + 11 位数字 |
| study_title | Text | 研究标题 | Plasma-Seq of patients with metastatic prostate cancer | 检索定位与文档化 | 标题风格因提交者而异 | 无 | 自由文本 |
| dataset_id | Text | 访问控制单元编号 | EGAD00001000364 | 申请、授权与再分析的最小单元 | 拆分口径因提交者而异 | 无 | EGAD + 11 位数字 |
| dac_id | Text | 数据访问委员会编号 | EGAC00001000293 | 同 DAC datasets 批量申请 | 极少变更 | 无 | EGAC + 11 位数字 |
| donor_id | Text | 匿名供体编号(提交者定义) | 提交者自定义字符串 | 跨 dataset 个体去重、按人划分 | 各研究编码规则不一 | 可留空(dataset 级表型时) | 提交者命名空间 |
| phenotype | Text | 表型(建议 EFO/OMONTO 术语) | MONDO:0008315 | 队列筛选、标签构建 | EFO/HPO/自由文本混杂 | NA/留空 | EFO 或自由文本 |
| file_id | Text | 文件编号 | EGAF00000168251 | 断点续传与校验对账 | — | 无 | EGAF + 11 位数字 |
| format | Text | 文件格式 | fastq.gz / BAM / VCF | 选择读取器 | 早期提交偶有非常规格式 | 无 | 官方白名单 |
| size_mb | Float | 文件大小 | 577.7 | 磁盘与传输规划 | — | 无 | ≥0 |
| md5 | Text | 明文 MD5 校验和 | 32 位十六进制串 | 下载完整性核验 | 大文件偶发 mismatch(见坑点 2) | 无 | 32 位 hex |
| technology | Text | 测序平台/实验技术 | Illumina MiSeq | 批次效应建模 | 早期提交字段可缺 | 留空 | INSDC 受控词表 |
| run_id | Text | 测序 run 编号 | EGAR00001234567 | 数据 ↔ 实验映射、批次分组 | 一个样本可含多个 run | 无 | EGAR + 11 位数字 |
| analysis_id | Text | 衍生分析编号 | EGAN00001234567 | 引用二次分析产物(如 VCF) | 衍生链路依赖提交者登记 | 无 | EGAN + 11 位数字 |
| policy_duo | Text | DUO 数据使用标签 | DS(特定疾病)等 | 程序化合规过滤 | 部分 dataset 无 DUO 标注 | 留空 | DUO 术语集 |
| release_date | Date | dataset 发布日期 | 2021-11-16 | 时间切片防数据漂移 | 更新会刷新 | 无 | ISO 8601 |
§4.2 标签分布
按 2015 年论文的疾病与方法分布(此后持续演化,引用需注明口径):癌症 57%、其余为复杂疾病/人群/罕见病等;方法构成 exome 38%、WGS 29%、阵列 20%、转录组 9%、表观组 3%。DUO 标签侧,官网 dataset 页可见的常见标签包括 DS(特定疾病,如 CTC-Plasma-DNA 关联 MONDO:0008315)、HMB(生物医学研究通用)与 GRU(通用研究)(示例 dataset 页)。AI 建模前应先以元数据统计目标疾病的 dataset 数量与标签粒度,避免把 dataset 级标签误当个体级标签。
§4.3 关键统计
- 研究/数据集/文件三级的公开检索入口分别为 study、dataset 与 DAC 目录;DAC 目录支持一次申请同一 DAC 名下多个 dataset(官方申请指南)。
- 2014 年前 4 个月发生 20,000+ 次数据传输、服务近 5,000 用户;用户分布于五大洲(CRG 2014)。
- 提交箱单次上限 8 TB;提交到发布平均约 1 个月(recherche.data.gouv)。
- 公开测试资产:测试账户内含 1000 Genomes Project 公开文件,可完整演练凭据、列表与下载流程(pyEGA3 文档)。
- 服务身份:ELIXIR Core Data Resource、GA4GH Driver Project、GA4GH 数据安全工作流成员(NAR 2022、安全概览)。
- 运营分工:EMBL-EBI(英国)与 CRG(西班牙)双中心运营,文件可能位于英国和/或西班牙,联邦化后部分文件位于各国 FEGA 节点(示例 dataset 页文件位置说明)。
§4.4 数据层级
EGA 的层级关系为:机构/提交者 → study(EGAS,研究)→ dataset(EGAD,受控访问单元)→ run / analysis(EGAR/EGAN,实验与衍生)→ file(EGAF,物理文件),样本(sample)横跨 run 与 analysis 并携带 donor_id 与表型。与影像类数据集"患者→检查→序列→切片"的层级不同,这里的"患者"身份仅以匿名 donor_id 存在于元数据中,且同一 donor 可能出现在多个 dataset(跨研究重复),合并分析前必须按 donor_id 去重(见坑点 7)。
§4.5 缺失值与信息性缺失
| 情形 | 表现 | 处理建议 |
|---|---|---|
| 表型仅到 dataset 级 | 样本级表型字段留空,仅页面描述声明"本组样本同属某病" | 视为组级标签;不得臆造个体级标签 |
| donor_id 缺失 | 早期或聚合型提交无个体标识 | 无法做个体级划分;仅可按文件/研究划分并显式声明 |
| 表型术语不统一 | EFO、HPO、OMIM、自由文本混用 | 建映射表(如 MONDO 对齐 ICD-11),映射记录入库 |
| 技术字段缺失 | experiment 中平台/文库信息不全 | 该批次退出批次效应建模或标注"未知批次" |
| 索引文件缺失 | BAM/CRAM/VCF 无 BAI/CRAI/TBI | htsget 区域请求会失败(见坑点 8),需整文件下载 |
§5 划分与使用建议
§5.1 官方划分
无。EGA 是档案而非带预测任务的基准:官方只定义访问单元(dataset),不定义训练/验证/测试划分。任何划分均由使用者设计,且须在 DUA 允许的用途内。
§5.2 社区惯例划分
- 按研究切分:以 EGAS/EGAD 为单位切训练与测试,最贴近"新研究泛化"场景,也是复现型工作流的默认做法。
- 按供体切分:同一 donor_id 的样本(如 tumor/normal 配对、多时间点)必须同侧,防止个体级泄漏。
- 按家族切分:家系研究按家族 ID 聚类划分,避免亲属信息跨侧传递(人群/家族研究是官方支持的存档类型)。
- 按批次/平台切分:用 experiment 元数据的平台字段构建跨平台验证,检验批次鲁棒性。
- 按疾病标签分层:以 DUO 的 DS 标签或映射后的 ICD-11 类目做分层采样,保证罕见亚型在每折都有代表。
- 时间切分:以 release_date 切分,模拟"用过去数据预测未来研究"。
§5.3 泄漏风险清单(重点)
| 风险 | 触发条件 | 缓解 |
|---|---|---|
| 个体跨数据集重复 | 同一 donor 进入多个 dataset 或多个论文队列 | 合并前按 donor_id 全局去重;无 donor_id 的 dataset 不参与合并 |
| tumor-normal 配对拆侧 | 配对样本分入训练与测试 | 配对约束在划分器中硬编码 |
| 家族结构 | 家系研究(population/family studies 官方支持) | 按家族聚类划分 |
| 论文-数据双重计数 | 目标 dataset 曾是某论文的训练集 | 检查 study 元数据关联论文,必要时整组移出 |
| 受控数据外流 | 把下载明文放入公开代码仓/模型权重蒸馏 | 加密落盘、访问审计、按 DUO 条款销毁(部分 DAC 章程明确要求项目结束即销毁) |
§5.4 交叉验证建议
优先分层 k 折(按疾病标签与平台分层),折间保证 donor/family 不交叉;小样本罕见病研究建议 leave-one-study-out 式外推验证,检验跨研究可迁移性。
§5.5 外部验证建议
预留至少一个未经申请的独立 dataset(同疾病、不同机构/平台)作外部验证;优先选择 DAC 批准流程已打通的合作机构数据,避免把外部验证做成事后补做——DAC 审批周期不可控(见坑点 1),外部集的申请应与训练集同步启动。
外部验证落地三步:(1) 在训练集 snapshot 冻结当天,即提交外部 dataset 申请并记录时间戳;(2) 外部集不做任何分布适配(不做重采样、不做阈值再调),原始模型直接推理;(3) 报告外部 AUROC/AUPRC 的绝对值与相对内部变化,并附外部集的平台、机构、人群构成表——这三张表合起来才是完整的外部验证证据,缺一即可疑。
§6 AI 就绪指南
§6.0 云端与本地环境准备
EGA 无官方云端一键环境;常见做法是在受控计算环境(HPC 或许可的云 VPC)内完成下载与解密。若机构网络封端口,见坑点 3。Federated EGA 节点另需 sda-cli 与 Crypt4GH 密钥对。
| 环境项 | 要求 | 说明 |
|---|---|---|
| Python | 3.6+(pyEGA3 依赖) | 建议用 3.10+ 独立虚拟环境,避免与生信工具冲突 |
| 网络 | 出站可达 ega.ebi.ac.uk:8443 | pyEGA3 全部 HTTPS 调用走此端口 |
| 磁盘 | ≥3 倍 dataset 明文体量 | 明文 + 下载临时分片 + 校验副本 |
| 工具链 | crypt4gh、md5sum、samtools/gatk(按任务) | 解密与完整性核验为必选项 |
| 凭据 | 数据访问账户 credential.json | 与提交账户分离;不入 Git |
§6.1 快速上手
# ── 目录结构预期 ──────────────────────────────────────────────
# EGA_TEST/
# ├── credential.json # 凭据文件(下方创建)
# └── downloads/ # 下载落地目录(data_root)
# ── data_root 拼接关系 ────────────────────────────────────────
# 所有 dataset 以 EGAD 编号为一级子目录:downloads/EGADxxxxxxxxxxx/<文件>
# pyEGA3 的 --output-dir 即该 data_root;后续脚本统一以
# data_root/<EGAD 编号>/ 为前缀拼接文件路径
# ── 最小可用子集 ─────────────────────────────────────────────
# 官方测试账户含 1000 Genomes Project 公开文件,无需 DAC 审批,
# 可完整演练"列 dataset → 列文件 → 下载 → 校验"全链路
mkdir -p EGA_TEST/downloads && cd EGA_TEST
pip3 install pyega3
# 1) 创建测试凭据文件(正式使用时替换为你的 EGA 数据访问账户)
cat > credential.json <<'EOF'
{
"username": "ega-test-data@ebi.ac.uk",
"password": "egarocks"
}
EOF
# 2) 列出可下载的 dataset 编号
pyega3 -cf credential.json datasets
# 3) 查看某 dataset 的文件列表(把编号替换为上一步列出的值)
pyega3 -cf credential.json files EGAD00001003338
# 4) 下载整 dataset(文件间串行、大文件内并行,自动断点续传)
pyega3 -cf credential.json --output-dir downloads fetch EGAD00001003338
下载完成后 pyEGA3 自动做明文 MD5 校验;老式 HTTPS 通道落地即明文,无需解密步骤(官方 FAQ)。
首次使用常见失败速查:
| 现象 | 原因 | 处置 |
|---|---|---|
Failure to validate credentials |
用了提交账户 / 邮箱大小写不符 | 换数据访问账户(见坑点 4) |
Dataset ... not in the list of your authorised datasets |
DAC 批准绑定的邮箱与登录邮箱不一致 | 核对申请时提交的邮箱 |
Failed to obtain IP address / 超时 |
端口 8443 被封 | 见坑点 3 |
500 Server Error |
连接数超 30 或服务端瞬时故障 | 降并发重试,查官网公告(pyEGA3 偶发服务中断维护) |
| slice error | 分片下载被打断 | 直接重跑,客户端自动续传缺失分片 |
§6.2 数据获取全流程
- 申请四步(官方指南):
| 步骤 | 操作 | 要点 |
|---|---|---|
| 1. 注册 | EGA 官网注册账户并点击邮件验证链接 | 用户名即邮箱,大小写敏感 |
| 2. 定位 | 在 dataset 页或 DAC 目录找到目标(同 DAC 可批量勾选) | 先读页面上的数据访问政策与 DUO 标签 |
| 3. 提交 | 点 Request access,写明研究用途后发送 | 系统通知 DAC;仍需另发邮件直接联系 DAC |
| 4. 跟进 | 官方建议留 4 周,每周邮件催促;失联可找 Helpdesk | 批准后账户即获权限并收到通知邮件 |
多 dataset 申请:同一 DAC 名下多个 dataset 走 DAC 目录页一次性勾选提交;不同 DAC 必须分别重新申请(且各 DAC 的材料清单、时限、附加条款都可能不同,见下表)。批准后的权限绑定在你提交申请的邮箱上,新加 co-applicant 需各自申请、各自持账户。
申请邮件模板(各 DAC 材料清单不同,以 dataset 政策页为准):
Subject: Data access request - EGAD00001000364 - [你的姓名/机构]
Dear Data Access Committee,
I am [姓名], [职位] at [机构]. I would like to request access to
dataset EGAD00001000364 (linked study EGAS00001000451).
Research purpose (within the DUO-scoped use of this dataset):
- [研究问题,1-2 句]
- [分析方法概要]
- [数据将保留于:机构安全计算环境,项目结束后按政策销毁]
I confirm that:
- I will not attempt to re-identify donors or redistribute the data.
- Co-applicants will hold their own EGA accounts.
- Results will be published in accordance with the dataset policy.
My EGA account username (case-sensitive): [你的注册邮箱]
Best regards,
[姓名 / 机构 / ORCID]
申请材料清单——各 DAC 要求差异大,常见条目汇总自两个公开 DAC 章程(UMC Utrecht、Gustave Roussy),申请前逐项核对目标 dataset 政策页:
| 材料条目 | UMC Utrecht | Gustave Roussy | 备注 |
|---|---|---|---|
| 数据访问申请表(每 dataset 一份) | ✅ | ✅ | 官方明确一个 dataset 一份申请 |
| 研究摘要/大纲 | — | ✅(synopsis 模板) | 简述研究问题即可 |
| CV | ✅ | — | 证明研究者资质 |
| IRB/伦理委员会意见 | 视情况 | ✅(如有) | 含委员会构成说明 |
| DTA/DAA 签署 | ✅(DTA 模板) | ✅(保密协议 + 政策签署) | 批准后签署流程启动 |
| 非欧盟申请者附加条款 | ✅(Data Protection Adequacy Clause) | ✅(欧盟标准合同条款) | GDPR 跨境要求 |
| 安全章程 | — | ✅(security charter) | 证明数据保护能力 |
| 审结时限承诺 | 60 个工作日内 | 约 1 个月(指示性) | 均非保证值 |
下载命令(正式账户):
# 批准后先核对:本账户名下可见的 dataset
pyega3 -cf credential.json datasets
# 下载;大文件建议先小并发试探(见坑点 2),异常时降 chunk
pyega3 -cf credential.json -c 30 --output-dir downloads fetch EGAD00001000364
# 带索引的 BAM/CRAM/VCF 可只拉基因组区域(GA4GH htsget)
pyega3 -cf credential.json fetch -cf --reference-name 1 --start 0 --end 1000000 \
--format BAM --saveto downloads/region.bam EGAF00001234567
§6.3 预处理全流程
第一步:Crypt4GH 解密与文件名还原(新版加密分发时需要;老式 HTTPS 下载无此步):
# 1) 生成密钥对(首次;私钥离线备份)
crypt4gh-keygen --sk keys/alice.sec --pk keys/alice.pub
# 首次把 alice.pub 交给下载服务方重新加密打包;此后下载得到 .c4gh 文件
# 2) 用私钥解密(密码走环境变量,避免写入脚本)
export C4GH_PASSPHRASE='你的私钥口令'
for f in downloads/EGAD00001000364/*.c4gh; do
# .c4gh 文件名形如 prod_ega-box-429_encrypted_原文件名.时间戳.c4gh
ORIG=$(echo "$f" | sed -E 's/.*encrypted_(.*)\.[0-9]+\.c4gh/\1/')
crypt4gh decrypt --sk keys/alice.sec --out "downloads/EGAD00001000364/$ORIG" "$f"
done
# 3) 完整性核验(对元数据中的 MD5 逐文件比对)
(cd downloads/EGAD00001000364 && md5sum -c *.md5)
第二步:测序数据到分析就绪(标准 germline 流程示意,按需裁剪):
<details>
<summary>fastq → 比对 → 变异调用 全流程脚本(约 30 行,点击展开)</summary>
#!/usr/bin/env bash
set -euo pipefail
DATA=downloads/EGAD00001000364
REF=refs/GRCh38.fa # 参考基因组需自行准备并建索引
# 0) 质控报告
fastqc "$DATA"/*.fastq.gz -o qc/ && multiqc qc/ -o qc/
# 1) 接头与质量修剪
fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \
-o trimmed_R1.fastq.gz -O trimmed_R2.fastq.gz -h qc/fastp.html
# 2) 比对(bwa-mem2;CRAM 输出省空间)
bwa-mem2 index "$REF"
bwa-mem2 mem -t 16 "$REF" trimmed_R1.fastq.gz trimmed_R2.fastq.gz \
| samtools sort -@ 8 -o sample.sorted.bam
samtools index sample.sorted.bam
# 3) 标记重复
gatk MarkDuplicatesSpark -I sample.sorted.bam -O sample.markdup.bam -M sample.metrics.txt
# 4) 变异调用(二选一:GATK HaplotypeCaller 或 DeepVariant)
gatk HaplotypeCaller -R "$REF" -I sample.markdup.bam -O sample.g.vcf.gz -ERC GVCF
# deepvariant --model WGS --ref "$REF" --reads sample.markdup.bam \
# --output sample.dv.vcf.gz
# 5) 批量后处理:joint genotyping / VQSR(略,按 GATK Best Practices)
</details>
第三步:元数据对齐——解包网页下载的 metadata zip,把 run/analysis → file → sample → 表型对齐为一张 manifest 宽表(自建),后续训练只读 manifest。参考实现:
# 输入:metadata/ 下解包的 EGA 元数据 XML(公开对象)+ 批准的 dataset 文件目录
# 输出:manifest.csv —— 每行一个文件,列含 donor_id/phenotype/format/size/md5
# 前置:pip install pandas lxml
import glob, json
import pandas as pd
from lxml import etree
NS = {"x": "http://www.ebi.ac.uk/ega/schema"} # EGA XML 命名空间(以实际 schema 为准)
def parse_samples(meta_dir):
rows = []
for path in glob.glob(f"{meta_dir}/sample_*.xml"):
root = etree.parse(path).getroot()
attrs = {a.get("tag"): a.get("value")
for a in root.iter("SAMPLE_ATTRIBUTE")}
rows.append({
"sample_alias": root.get("alias"),
"donor_id": attrs.get("donor_id", ""), # 提交者自定义匿名 ID
"phenotype": attrs.get("phenotype", ""), # EFO/自由文本(见坑点 6)
"sex": attrs.get("gender", ""),
})
return pd.DataFrame(rows)
def parse_runs(meta_dir):
rows = []
for path in glob.glob(f"{meta_dir}/run_*.xml"):
root = etree.parse(path).getroot()
for f in root.iter("FILE"):
rows.append({
"run_alias": root.get("alias"),
"file_name": f.get("filename"),
"md5": f.get("checksum") if f.get("checksum_method") == "MD5" else "",
})
return pd.DataFrame(rows)
samples, runs = parse_samples("metadata"), parse_runs("metadata")
manifest = runs.merge(samples, how="left", on=None, suffixes=("", "_s"))
# 注意:run → sample 的关联在 run XML 的样本引用里,此处按 alias 关键字对齐;
# 对齐失败的行标记 needs_review=1,人工回查 policy/README 附件,切勿臆测填补
manifest["needs_review"] = manifest["donor_id"].eq("").astype(int)
manifest.to_csv("manifest.csv", index=False)
print(json.dumps({"rows": len(manifest),
"needs_review": int(manifest.needs_review.sum())}))
§6.4 PyTorch DataLoader
以下示例以 manifest 为驱动,把 VCF 变异位点编码为张量并与表型标签对齐(受控环境内运行):
<details>
<summary>完整可运行示例(约 45 行,点击展开)</summary>
# 前置:pip install cyvcf2 pandas torch
# 目录预期:data_root/<EGAD>/ 下有明文 VCF + sample_phenotypes.csv
# manifest.csv 列:dataset_id, vcf_path, donor_id, label
import pandas as pd
import torch
from torch.utils.data import Dataset, DataLoader
from cyvcf2 import VCF
N_SITES = 1000 # 固定位点窗长度(演示用;生产请换为注册表位点集)
class EGAVcfPhenotypeDataset(Dataset):
"""One record per donor: fixed-order genotype vector + phenotype label."""
def __init__(self, manifest_csv: str, data_root: str):
self.df = pd.read_csv(manifest_csv) # 每行一个 donor
self.root = data_root
# 位点注册表:预先从全体 VCF 汇总的高频位点(自建 sites.csv)
self.sites = pd.read_csv("sites.csv").sort_values(["chrom", "pos"])
assert len(self.sites) >= N_SITES
def __len__(self):
return len(self.df)
def __getitem__(self, idx):
row = self.df.iloc[idx]
vcf = VCF(f"{self.root}/{row['vcf_path']}")
loc = {f"{v.CHROM}:{v.POS}:{v.REF}:{v.ALT[0]}": v for v in vcf}
geno = torch.zeros(N_SITES, dtype=torch.float32) # 0/0.5/1/NaN→0 编码
for i in range(N_SITES):
s = self.sites.iloc[i]
v = loc.get(f"{s.chrom}:{s.pos}:{s.ref}:{s.alt}")
if v is not None and v.num_called > 0:
geno[i] = v.num_hom_alt * 1.0 / v.num_called
label = torch.tensor(float(row["label"]), dtype=torch.float32)
return geno, label
# data_root = downloads/(见 §6.1 拼接约定)
manifest = "manifest.csv" # 由 §6.3 元数据对齐步生成
ds = EGAVcfPhenotypeDataset(manifest, data_root="downloads")
loader = DataLoader(ds, batch_size=32, shuffle=True, num_workers=4)
model = torch.nn.Sequential(torch.nn.Linear(N_SITES, 64), torch.nn.ReLU(),
torch.nn.Linear(64, 1))
</details>
实现要点:(1) donor_id 为空的行不要静默丢弃——标记后人工回查 policy XML 或 README 附件, dataset 级表型是合法形态而非错误;(2) 合并前对 donor_id 做全局 groupby,统计跨 dataset 重复个体(坑点 7 的审计输入);(3) manifest 一旦生成即冻结并记录 snapshot 日期,后续增量 dataset 走追加而非重建。
§6.5 坑点精选(8 个)
⚠️ 坑点 1:DAC 审批周期不可预估,且没有自动提醒(分类:工程陷阱)
问题:EGA 把访问决定权完全交给各 dataset 的 DAC,官方明确"无法给出预计响应时间",建议预留 4 周;个别 DAC 章程写明 60 个工作日内审结。AI 项目排期若按"当天申请当天批准"设计,会整体卡死在第一步。
症状:Request access 提交后界面显示成功,此后数周无任何状态更新;项目里程碑被迫顺延。
解决:
- 简单方法:提交系统申请后立即另发邮件给 DAC(联系方式在 dataset 页政策内),每周固定催促一次——这是官方 FAQ 明示的动作。
- 进阶方法:多候选 dataset 并行申请(同一 DAC 名下可批量勾选);在研究计划中把"数据到达"设为外部依赖里程碑,预留 1-2 个月缓冲。
- SOTA 方法:接入 GA4GH Passport / DUO 自动化授权生态——DUO 已在全球 200,000+ datasets 上标注(Lawson et al. 2021),配合机构级 DACO 可显著压缩重复审批成本。
参考:官方申请 FAQ、UMC Utrecht DAC 章程、Gustave Roussy DAC 章程
⚠️ 坑点 2:pyEGA3 大文件下载慢、频繁断连、MD5 校验失败(分类:工程陷阱)
问题:社区实测下载速率常低于 1 MB/s,长连接被服务端重置(Connection reset by peer),300 GB 级文件可能在收尾 MD5 校验环节反复失败重下;43 TB 级 dataset 按 1 MB/s 需约 522 天。
症状:日志中大量Retrying ... ConnectionResetError(104);slice error;文件拼接完成后报 MD5 mismatch,重下后仍失败。
解决:
- 简单方法:升级 pyEGA3 至最新版;加
--connections 30(上限 30,超了会 500 错误;注意这是文件内并行,文件间仍是串行);对超大文件用--ms 20971520把默认 100 MB chunk 降到 20 MB,显著降低断连损失。- 进阶方法:
--retry-download -M 1000让客户端挂机自动重试;断点续传会捡起 partial 文件,不要手动清理临时分片;收尾校验改用md5sum -c对齐元数据 MD5。- SOTA 方法:速率过低时联系 Helpdesk 例外开通 Aspera/SFTP 通道;带索引的文件改用 htsget 按区域拉取,跳过整文件传输。
参考:pyEGA3 issue #192、官方 FAQ(连接数上限与校验机制)
⚠️ 坑点 3:出站端口 8443 被防火墙阻断,客户端直接罢工(分类:工程陷阱)
问题:pyEGA3 通过 HTTPS 调用 EGA Data API(
ega.ebi.ac.uk:8443),机构网络常默认封非常规端口,导致连凭据校验都过不去。
症状:ERROR:root:Failed to obtain IP address、超时;换机器/换网络后症状消失。
解决:
- 简单方法:先
curl -I https://ega.ebi.ac.uk:8443探测端口可达性;不可达则向网管申请出站白名单。- 进阶方法:按官方 FAQ 修改 pyEGA3 源内的 IP 探测端点(把
ipinfo.io换为备用端点)解决探测服务被墙/限流导致的误报。- SOTA 方法:在许可的云 VPC 或机构跳板机内做下载中转,落地后再加密分发到分析环境;全程留审计日志以满足 DUA。
参考:pyEGA3 官方 FAQ(端口 8443)
⚠️ 坑点 4:提交账户与数据访问账户混用(分类:工程陷阱)
问题:EGA 存在两套独立凭据——数据提交(submission)账户与数据访问(download)账户。用提交凭据调 pyEGA3 必然失败;此外用户名(邮箱)大小写敏感,DAC 批准绑定的就是你申请时填的那个邮箱。
症状:400 Client Error或Invalid username, password or secret key;Dataset EGADxxx is not in the list of your authorised datasets。
解决:
- 简单方法:核对 credential.json 使用的是"数据访问"账户;确认邮箱拼写与大小写和提交给 DAC 的完全一致。
- 进阶方法:co-applicant 各自注册账户后分别向 DAC 补交申请(官方禁止共享登录);换工作单位后需联系 DAC 更新归属。
- SOTA 方法:机构层面统一管理 EGA 账户台账(谁申请了哪个 EGAD、绑定哪个邮箱),配合密码管理器与 MFA。
参考:pyEGA3 官方 FAQ(400/500 错误、授权列表)、申请 FAQ(co-applicant 规则)
⚠️ 坑点 5:.c4gh 加密文件落地后无法直接读取,且文件名被打乱(分类:预处理陷阱)
问题:新版分发中文件以 Crypt4GH 容器落地,文件名被改写为
prod_ega-box-429_encrypted_原文件名.<时间戳>.c4gh这类形态;不解密、不还原文件名,后续按文件名 join 元数据会全部对不上。
症状:file命令识别不出格式;fastq/qc 工具直接报错;元数据 MD5 对不上(MD5 对应的是明文)。
解决:
⚠️ 坑点 6:元数据异构——表型粒度与术语不统一(分类:标签理解)
问题:EGA 不强制个体级表型:很多 dataset 只在页面描述里写"本组样本均为某病",个体级表型可能藏在受控的 Analysis/表型附件中;术语上 EFO、HPO、OMIM、MONDO 与自由文本混用。
症状:合并多个 dataset 训练时标签对不齐;把 dataset 级标签当个体级标签复制后,模型指标虚高;跨研究的"同一疾病"定义不可比。
解决:
- 简单方法:只用页面与公开元数据里明确到个体的字段;dataset 级标签仅在 dataset 内部训练时使用。
- 进阶方法:构建疾病映射表(EFO/HPO/OMIM → MONDO → ICD-11),映射过程与版本入库;表型文件若有 Phenopackets 优先解析。
- SOTA 方法:对齐 GA4GH 标准——用 DUO 做用途过滤、用 Phenopackets 做个体表型交换,让跨 dataset 合并的每一步可追溯。
参考:BioCommons EGA 指南(必填样本属性与表型文件)、Nature Genetics 2015(表型粒度演变)
⚠️ 坑点 7:跨 dataset 合并引发个体重复与泄漏(分类:数据泄漏)
问题:同一供体(尤其 tumor-normal 配对、家系研究、多时间点随访)可能出现在多个 dataset 甚至多个论文队列;naive 合并后随机划分,会把"同一个人"同时放进训练集与测试集。
症状:模型在合并集上表现惊人地好,外部数据上崩溃;测试集中出现与训练集几乎相同的基因型向量。
解决:
- 简单方法:合并前按 donor_id 全局去重;无 donor_id 的 dataset 不参与合并。
- 进阶方法:按 donor/family 分组划分(GroupShuffleSplit 或按家族聚类分层);配对样本强制同侧;检查 study 元数据关联论文,剔除与目标验证集同源的队列。
- SOTA 方法:leave-one-study-out 外推评估 + 报告"供体重叠审计"(合并前的 donor 交集矩阵),把泄漏检查固化为 CI 步骤。
参考:EGA 主页(家系与人群研究支持)、§5.3 泄漏清单
⚠️ 坑点 8:htsget 区域请求因缺索引静默失败;受控数据二次分发违反 DUA(分类:评估误用)
问题:pyEGA3 的 htsget 功能要求存档中存在对应索引(BAM→BAI、CRAM→CRAI、VCF→TBI);缺索引时区域请求不可用,只能整文件下载。更严重的是:把下载的受控明文上传到公开网盘、代码仓或用它再训练并开源模型,都可能超出 DUO 授权范围,构成合规事故。
症状:htsget 请求报错或退化为整文件下载;机构合规审计发现受控明文出现在非授权系统。
解决:
- 简单方法:下载前在文件列表核对索引是否存在;缺索引就整文件下载,或申请时请提交者补充索引。
- 进阶方法:建立数据分级目录(受控明文区只挂内网),导出物(图表、聚合统计)走脱敏审查;项目结束按 DAC 章程销毁并留痕。
- SOTA 方法:联邦式分析——数据不出节点,用 Federated EGA 节点或可信执行环境跑联合统计,只交换汇总结果。
参考:pyEGA3 官方 FAQ(htsget 前置条件)、EGA 安全概览
§6.6 数据增强
| 类别 | 操作 | 说明 |
|---|---|---|
| 安全 ✅ | 序列随机裁剪/平移(对序列模型) | 等价于同一样本的不同窗口,不改变个体身份 |
| 安全 ✅ | 类别再平衡(加权采样、focal loss) | 处理病例-对照失衡 |
| 安全 ✅ | 读段级模拟(降采样、错率扰动) | 提升 Caller 在低覆盖场景鲁棒性 |
| 危险 ❌ | 跨供体混拼新样本 | 制造不存在的个体,且可能违反 consent |
| 危险 ❌ | 把受控数据增强产物上传公开仓 | 增强产物仍源自受控数据,同样受 DUA 约束 |
| 危险 ❌ | 用测试集分布调增强超参 | 评估泄漏 |
§6.7 模型推荐表
| 任务 | 推荐模型/方法 | 输入 | 关键引用 |
|---|---|---|---|
| 变异检测 | DeepVariant(CNN) | BAM/CRAM | Poplin et al. 2018, Nat Biotechnol. DOI: 10.1038/nbt.4235 |
| 非编码变异效应预测 | DeepSEA(CNN) | 序列 | Zhou & Troyanskaya 2015, Nat Methods. DOI: 10.1038/nmeth.3547 |
| 长程调控/表达预测 | Enformer(Transformer) | 序列 | Avsec et al. 2021, Nat Methods. DOI: 10.1038/s41592-021-01252-x |
| 队列关联分析 | REGENIE/BOLT-LMM 类混合模型 | 基因型矩阵 + 协变量 | 社区标准工具链(按各自文档引用) |
| 联邦/隐私计算 | 联邦学习 + 可信执行环境 | 分布式受控数据 | GA4GH 生态(Passport/DUO) |
§6.8 硬件需求表
| 场景 | 最低配置 | 建议 | 依据 |
|---|---|---|---|
| 下载与解密 | 100 GB 磁盘、任意 4 核 | TB 级 NVMe、稳定出站带宽 | 单 dataset 可达数 TB;社区有 43 TB 案例 |
| 比对/变异调用 | 16 核 / 64 GB RAM | 32 核 / 128 GB + 参考基因组索引盘 | GATK/BWA 标准需求 |
| 深度学习(序列模型) | 单卡 16 GB | A100 级 40-80 GB(长序列 Transformer) | Enformer 类长输入模型 |
| 联合分析(多 dataset 合并) | 分布式存储 | 对象存储 + Spark/Dask | 千万级变异 × 数千样本矩阵 |
§6.9 评估指标代码
# 变异调用:以高置信位点集为真值计算 genotype 级 precision/recall/F1
import pysam
def genotype_set(path, region="chr1"):
out = set()
for rec in pysam.VariantFile(path).fetch(region):
if rec.samples and list(rec.samples.values())[0]["GT"] not in (None, (None, None)):
out.add((rec.chrom, rec.pos, rec.ref, tuple(rec.alts or ()),
list(rec.samples.values())[0]["GT"]))
return out
truth, pred = genotype_set("truth.vcf.gz"), genotype_set("calls.vcf.gz")
tp = len(truth & pred)
precision = tp / max(len(pred), 1)
recall = tp / max(len(truth, ), 1)
f1 = 2 * precision * recall / max(precision + recall, 1e-9)
print(f"P={precision:.4f} R={recall:.4f} F1={f1:.4f}")
分类任务(疾病亚型等)另报 AUROC/AUPRC 与按平台分层的分层指标;所有指标必须同时给出"供体重叠审计"结果(见坑点 7)。
# 疾病分类:分层 AUROC/AUPRC(按测序平台分组报告,暴露批次敏感性)
import numpy as np, pandas as pd
from sklearn.metrics import roc_auc_score, average_precision_score
def stratified_report(df: pd.DataFrame, score="score", label="label", group="platform"):
rows = []
rows.append({"group": "ALL",
"n": len(df),
"auroc": roc_auc_score(df[label], df[score]),
"auprc": average_precision_score(df[label], df[score])})
for g, sub in df.groupby(group): # 平台/机构/研究 任选一列分组
if sub[label].nunique() == 2:
rows.append({"group": g, "n": len(sub),
"auroc": roc_auc_score(sub[label], sub[score]),
"auprc": average_precision_score(sub[label], sub[score])})
out = pd.DataFrame(rows)
spread = out.loc[out.group != "ALL", "auroc"].max() - \
out.loc[out.group != "ALL", "auroc"].min()
print(out.round(4)); print(f"组间 AUROC 极差: {spread:.4f}")
return out
# stratified_report(pred_df) # pred_df: 每样本预测分 + 标签 + 平台列
§6.10 MLOps 笔记
- 合规即代码:把 DUO 标签、DAC 批准编号、协议到期日写进数据资产清单,CI 里校验每次训练运行引用的 dataset 均在授权清单内;越界引用直接让流水线失败。
- 数据血缘:以 EGAD/EGAF 编号贯穿 manifest → 特征 → 模型版本;pyEGA3 日志与 MD5 记录归档,任何指标异常都可回溯到具体文件批次。
- 密钥与凭据治理:Crypt4GH 私钥与 EGA 凭据分离存储,凭据文件不入 Git;下载机与分析机网络隔离,明文区只允许内网只读挂载。
- 漂移监控:用 release_date 与平台字段监控新入库数据的分布漂移(新平台、新人群),触发再验证;对滚动更新的档案,“固定 snapshot + 增量复核"优于"永远追最新”。
- 可复现:环境容器化 + 参考基因组版本固定;受控明文不进镜像,镜像只装代码与索引。
- 退出与销毁:按 DAC 章程在项目结束或协议到期时销毁明文与衍生数据(保留汇总统计需事先确认),销毁动作写审计日志——这条在多份 DAC 章程中是硬性条款而非最佳实践建议。
§7 质量评估与局限性
§7.1 已知偏倚表
| 偏倚类型 | 描述 | 严重程度 | 缓解 |
|---|---|---|---|
| 疾病谱偏倚 | 癌症研究占 57%(2015 口径),显著高于其他病种 | 高 | 跨病种建模时显式按疾病分层报告 |
| 地理偏倚 | 提交以欧洲机构为主,非欧人群代表性不足 | 高 | 报告 ancestry 分布;避免跨人群外推 |
| 平台/批次偏倚 | 测序平台、覆盖率、文库异构(MiSeq 到 NovaSeq 均有) | 中 | 用 experiment 元数据建模批次;跨平台验证 |
| 自愿提交选择偏倚 | 存档研究非随机样本;阴性结果与小型研究少 | 中 | 结论限定于"已存档研究"总体 |
| 元数据粒度偏倚 | 表型多为 dataset 级,个体级临床协变量不全 | 高 | 谨慎选择可用任务;映射表化对齐 |
§7.2 标注质量
元数据经官方 schema 校验与提交声明(consent/伦理合规声明)背书,但表型正确性由提交者负责,EGA 不做中心化临床复核;受控临床附件无标准格式。质量分层大致为:结构层(XML/JSON schema 校验)有机器保证 → 术语层(EFO 术语化)是"官方建议"而非强制 → 临床语义层(诊断细节、治疗线数)完全依赖提交者 → 使用限制层(DUO 标签)由提交者定义、DAC 背书。使用前建议抽样核对:页面描述、policy XML、样本 XML 三处疾病口径是否一致;对医学影像与 EHR 数据集习以为常的"中心化标注 QC",在 EGA 语境下要替换为"提交者可信度 + 三处口径一致性"的抽查策略。
§7.3 泛化性评估表
| 目标场景 | 失效风险 | 证据 |
|---|---|---|
| 跨人群(欧洲 → 非欧) | 等位频率与 LD 结构差异大 | 存档以欧洲为主(§7.1) |
| 跨平台(短期数据 → 新平台) | 批次效应主导 | 档案内平台横跨多代 Illumina 设备 |
| 单 dataset 内训练 → 跨 dataset 应用 | 供体重叠与疾病定义漂移 | 同一 donor 可见于多个 dataset(§4.4) |
| 低覆盖/cfDNA 特殊样本类型 | 常规模型失效 | Plasma-seq 类 cfDNA 存档有专门分析需求 |
§7.4 伦理与合规
EGA 的合规框架三层:知情同意(提交声明背书)→ GDPR 角色划分(DAC/提交者为 controller,EGA 为 processor)→ 技术保障(端到端加密、静态加密、密钥分离、MFA、审计日志)(EGA 安全概览、EJP RD 报告)。使用者义务:按 DUO 范围使用、不得再识别、不得越权再分发;部分 DAC 章程(如 Gustave Roussy)要求项目结束销毁数据副本并 24 小时内通报数据泄露。
| 合规层 | 义务主体 | 具体要求 | 对 AI 工程的落点 |
|---|---|---|---|
| 知情同意 | 提交者/DAC | 提交声明保证 consent 或伦理批准 | 训练用途须落入原始 consent 范围 |
| GDPR | DAC(controller)/ EGA(processor) | 数据主体权利、跨境条款 | 非欧盟团队走 adequacy/合同条款 |
| 技术安全 | EGA + 使用者 | 加密传输与存储、审计日志、MFA | 密钥管理、访问审计进 CI |
| 使用限制 | 使用者 | DUO 范围、禁止再识别、禁止再分发 | policy_duo 字段进数据资产清单校验 |
§7.5 公平性
档案层面:非欧人群与低收入地区研究占比低;罕见病数据虽受 Solve-RD、EJP RD 等项目推动,但单 dataset 样本量小。模型层面:跨人群外推是最大失效源(§7.3)。建议在论文中报告训练集的地域/人群构成,并对缺失人群做明确的能力边界声明。具体可执行动作:(1) 在 manifest 中为每个 dataset 标注提交机构所在国家,作为地域多样性代理指标;(2) 报告按 dataset(而非仅按样本)的分层指标,暴露"一个大国籍队列主导模型"的情形;(3) 对罕见病等小样本场景,优先报告外部验证结果而非内部交叉验证。
§7.6 数据漂移
三重漂移源:方法构成漂移(2011 年后从阵列转向测序;2015 年 exome 38% → 近年 WGS/单细胞多组学占比上升);政策漂移(DUO 标注覆盖度持续提升——DUO 论文口径全球已有 200,000+ datasets 标注,联邦节点扩充);粒度漂移(个体级详细表型的提交比例官方明确"日益增长")。应对:训练前固定 snapshot(按 release_date 切片),监控新入库 dataset 的方法与人群分布。
| 漂移类型 | 观测信号 | 监控建议 |
|---|---|---|
| 方法构成 | 新 dataset 的 technology 字段分布变化 | 每季度统计 manifest 中平台/文库构成 |
| 提交粒度 | 个体级表型(donor_id 非空)比例 | 追踪 needs_review=0 且 donor_id 非空的占比 |
| 政策/合规 | DUO 标签覆盖度、新增联邦节点 | 订阅官网博客与 Helpdesk 年度总结 |
| 下游用途 | 官网 recent papers 栏目的任务类型 | 对照自己计划的基准是否已被先行研究覆盖 |
§7.7 DAIMS 24 项检查表
| # | 检查项 | 状态 | 说明 |
|---|---|---|---|
| 1 | 宽格式 | ❌ | 无统一宽表;元数据以 XML/JSON 对象分散,需自建 manifest |
| 2 | 唯一标识 | ✅ | EGAS/EGAD/EGAC/EGAR/EGAN/EGAF 全链 accession 稳定可引 |
| 3 | 特殊字符 | ⚠️ | 表型自由文本含特殊字符;XML 转义需注意 |
| 4 | 重复行 | ⚠️ | 同一 donor 可跨 dataset 重复,需全局去重 |
| 5 | 缺失编码 | ⚠️ | 缺失以留空/NA 为主,编码不统一 |
| 6 | 标签标识 | ⚠️ | 表型常仅到 dataset 级,个体级标签不保证可得 |
| 7 | 罕见类分组 | ⚠️ | 罕见病 dataset 样本量小,需合并或 leave-one-out |
| 8 | 偏倚评估 | ⚠️ | 疾病谱/地理/平台偏倚明确存在(§7.1),官方未发布去偏权重 |
| 9 | 数据字典 | ✅ | 元数据 schema 公开(INSDC 扩展),字段定义可查 |
| 10 | 信息性缺失解释 | ❌ | 留空原因(未采集 vs 不适用)无官方约定 |
| 11 | 设备记录 | ✅ | experiment 对象记录平台/仪器(如 Illumina MiSeq) |
| 12 | 共线性 | ⚠️ | 基因型高维共线性固有;需专用统计工具处理 |
| 13 | 编码映射 | ⚠️ | EFO/HPO/OMIM/MONDO 混用,需自建映射表 |
| 14 | 时间戳处理 | ✅ | release_date 与提交时间戳 ISO 化,可做时间切片 |
| 15 | 划分建议 | ❌ | 无官方划分;需自建并自担合规责任 |
| 16 | 泄漏讨论 | ⚠️ | 官方不讨论;社区需按 donor/family 自查(坑点 7) |
| 17 | 标签分布 | ⚠️ | 2015 口径可查(癌症 57%),当前需实时统计 |
| 18 | 测量偏倚 | ⚠️ | 平台/覆盖率异构,批次效应建模由使用者完成 |
| 19 | 外部验证建议 | ✅ | 多 dataset 生态天然支持跨研究外推验证 |
| 20 | 版本记录 | ✅ | dataset changelog(Submission API 含 DatasetChangelog);滚动更新口径明确 |
| 21 | 预处理脚本 | ❌ | 无官方分析管线;仅提供下载/解密工具链 |
| 22 | 合规要求 | ✅ | DUO + DAC + GDPR 三层机器可读/制度性合规闭环 |
| 23 | 多模态对齐 | ⚠️ | 基因组-表型对齐依赖提交者质量,需抽样核验 |
| 24 | 去标识化 | ✅ | 仅匿名 donor_id 入元数据;数据加密存储、受控分发 |
DAIMS 评分:14.0 / 24(✅ 8 项、⚠️ 12 项、❌ 4 项)
评分解读:作为档案型基础设施,EGA 在标识体系、元数据 schema、设备记录、合规治理四块达到最高水准(这四项恰是多数影像/EHR 数据集的短板);失分集中在分析侧缺席——无宽表、无划分、无预处理脚本、缺失语义未定义,全部要使用者自建。⚠️ 项多为"可做但需工程投入",而非"数据不可用"。
对你意味着什么:(1) 立项前先按 §3.0 选对访问路径,把 DAC 审批当作关键路径管理;(2) 预算中给"元数据对齐 + manifest 构建"留一个专职工程迭代,它决定了后续一切建模质量;(3) 一切划分按 donor/family 分组,发布结果必须附供体重叠审计;(4) 合规不是口号——DUO 过滤、加密落盘、审计日志三件套在第一行代码前就要落好。
§7.8 外部验证矩阵
| 外部数据集/场景 | 来源机构 | 评估任务 | 性能指标 | 相对内部变化 | 关键发现 |
|---|---|---|---|---|---|
| UK10K 队列(EGA 托管受控数据) | Wellcome Trust Sanger 等英国机构 | 罕见变异发现与低覆盖测序策略评估 | 变异检出数量/验证率(论文内) | 相对开放汇总数据显著提升功效 | 证明低覆盖 WGS + 参考面板可规模化发现罕见变异(Nature 2015) |
| ICGC 多癌种全基因组(EGA/ICGC 托管) | 国际癌基因组联盟 | tumor-normal 体细胞突变图谱构建 | 每癌种突变谱一致性 | — | 建立跨大洲多机构受控数据联合分析的协作范式(Nature 2010) |
| PCAWG 泛癌全基因组(ICGC/EGA 受控) | PCAWG 联盟(多国) | 泛癌突变特征与结构变异分析 | 跨中心流程一致性 | — | 2,600+ 全基因组的联合分析,验证受控档案支撑大规模国际协作(Nature 2020) |
注:EGA 本身不发布基准排行榜,本表仅收录有同行评审支撑、以 EGA 托管数据完成的代表性验证工作。
§8 基准性能与生态
§8.1 代表性研究与"排行榜"说明
EGA 是受控档案,没有统一排行榜——每项研究的任务、划分、指标各异,数值不可直接比较。下表收录以 EGA 托管数据完成的标志性工作:
| 排名(时间序) | 研究/项目 | 贡献 | 年份 | 关键技术 | 完整引用 | 代码 |
|---|---|---|---|---|---|---|
| 1 | ICGC 网络奠基 | 25 万+ 样本级癌症基因组计划协作框架 | 2010 | 多机构受控数据汇聚 | International Cancer Genome Consortium et al., 2010, Nature. DOI: 10.1038/nature08987 | — |
| 2 | UK10K | 罕见变异与健康/疾病表型关联 | 2015 | 低覆盖 WGS + imputation | UK10K Consortium et al., 2015, Nature. DOI: 10.1038/nature14962 | — |
| 3 | PCAWG 泛癌全基因组 | 全癌种突变特征/结构变异系统图谱 | 2020 | 分布式受控联合分析 | PCAWG Consortium et al., 2020, Nature. DOI: 10.1038/s41586-020-1969-6 | — |
| 4 | DUO 标准落地 | 全球 200,000+ datasets 机器可读使用标注 | 2021 | 本体 + 访问自动化 | Lawson J et al., 2021, Cell Genomics. DOI: 10.1016/j.xgen.2021.100028 | DUO GitHub(开源) |
| 5 | GA4GH Passport | 跨仓库存档的数字身份与权限通行证 | 2021 | 访问权限声明标准 | Voisin C et al., 2021, Cell Genomics. DOI: 10.1016/j.xgen.2021.100030 | — |
§8.2 SOTA 总结与选型建议
对方法学团队:EGA 的价值不在"刷榜"而在真实异构分布上的压力测试——把开放基准(如 GIAB)训出的 caller 拿到 EGA 的 cfDNA、低覆盖、跨平台数据上检验,是发现工程盲区的最高效路径。对疾病研究团队:先检索目标疾病的 EGAS 编号与 DUO 标签,优先选同 DAC 名下多个 dataset 批量申请。对治理研究团队:EGA 是 DUO/Passport/联邦访问的活体实验场,适合做合规自动化研究。
选型速查:变异复现 → GATK Best Practices 或 DeepVariant(§6.7);序列深度学习 → DeepSEA/Enformer 迁移 + EGA 受控数据微调;队列统计 → REGENIE/BOLT-LMM;隐私受限的跨机构联合 → Federated EGA 节点 + 联邦统计。任何选型的第一步都不是选模型,而是选 dataset:候选清单(EGAD 编号 + DUO 标签 + 平台 + 体量)决定项目上界。
§8.3 评测协议
档案无官方协议,社区共识整理如下:
| 协议要素 | 共识做法 |
|---|---|
| Snapshot 固定 | 按 release_date 切片;记录 dataset changelog 版本 |
| 数据清单披露 | 报告 EGAD/EGAS 编号清单与 DUO 标签 |
| 划分披露 | 划分方式(供体/家族/研究)+ 供体重叠审计随结果发布 |
| 指标选择 | 变异检测 P/R/F1;分类 AUROC/AUPRC;关联分析 replication 方向与效应量一致率 |
| 平台分层 | 按平台/机构/研究分组的分层指标(暴露批次敏感性) |
| 复现声明 | 受控数据不公开时,报告"在授权环境内可复现"的操作步骤摘要 |
| 合规留痕 | DAC 批准编号与协议范围写入论文数据可用性声明 |
§8.4 相关数据集表
| 数据集 | 关系 | 访问方式 | 适用补充 |
|---|---|---|---|
| dbGaP(NCBI) | 美国对应受控档案 | phs 申请审批 | 北美队列互补 |
| ENA | 欧洲开放序列档案 | 完全开放 | 无需受控的公开数据 |
| UK Biobank | 单一深度表型队列 | 注册 + 协议 | 深度表型 + 影像 |
| Federated EGA 节点 | EGA 的分布式形态 | 国家节点申请 | 数据不出境需求 |
| 1000 Genomes Project(EGA 测试账户内含公开文件) | 开放参照面板 | 测试账户直接下载 | 工具演练与人群频率参照 |
§8.5 关键论文 Top 6
- Lappalainen I et al. The European Genome-phenome Archive of human data consented for biomedical research. Nature Genetics, 2015, 47(7): 692-695. DOI: 10.1038/ng.3312 —— 架构与分布式访问模型奠基之作。
- Freeberg MA et al. The European Genome-phenome Archive in 2021. Nucleic Acids Research, 2022, 50(D1): D980-D987. DOI: 10.1093/nar/gkab1059 —— 现状、价值链与联邦化路线全景。
- Lawson J et al. The Data Use Ontology to streamline responsible access to human biomedical datasets. Cell Genomics, 2021, 1(2): 100028. DOI: 10.1016/j.xgen.2021.100028 —— DUO 机器可读使用限制标准。
- Voisin C et al. GA4GH Passport standard for digital identity and access permissions. Cell Genomics, 2021, 1(1): 100030. DOI: 10.1016/j.xgen.2021.100030 —— 跨仓库数字权限通行证。
- Rehm HL et al. GA4GH: international policies and standards for data sharing across genomic research and healthcare. Cell Genomics, 2021, 1(2): 100029. DOI: 10.1016/j.xgen.2021.100029 —— EGA 所处标准生态的政策总览。
- Wagner AH et al. The GA4GH Variation Representation Specification. Cell Genomics, 2021, 1(1): 100027. DOI: 10.1016/j.xgen.2021.100027 —— 变异表示与联邦识别的计算框架。
§8.6 社区活跃度
官网"EGA studies in recent papers"栏目持续滚动展示下游论文(2026-06 单月即有十余条,从肺炎亚表型到体细胞突变深度学习检测);EGA Helpdesk 团队发布年度总结与路线博客(如 2025 in review);CRG 巴塞罗那团队约 25 人运营(EURAXESS);pyEGA3 等客户端在 GitHub 开源(Apache-2.0)并持续收到社区 issue(如 2023-02 的下载体验 issue #192 引发官方与社区多轮排查);GA4GH/ELIXIR 双生态会议中 EGA 长期作为核心数据资源展示。使用者侧的活跃信号还包括:第三方实战教程(BioCommons 指南、zenn.dev 下载实录)持续更新,说明真实用户群覆盖从提交者到复用者的完整链条。
§8.7 生态快照表
| 资源 | 类型 | 链接 | Star 截至 2026-09 | 推荐理由 |
|---|---|---|---|---|
| pyEGA3(ega-download-client) | 官方下载客户端 | https://github.com/EGA-archive/ega-download-client | —(以仓库实时显示为准) | 批准数据下载主力工具,Apache-2.0 |
| EGA Submission API | 提交 API | https://submission.ega-archive.org/api/spec | — | 程序化 JSON 提交(Bearer 认证) |
| crypt4gh | 加密库/CLI | GA4GH 生态开源工具 | — | 新版分发解密必备 |
| sda-cli | FEGA 节点客户端 | Federated EGA 生态 | — | 联邦节点上传下载 |
| BioCommons EGA 实战指南 | 第三方教程 | https://australianbiocommons.github.io/human-omics-data-sharing-field-guide/ega | — | 提交侧最详尽的实战经验合集 |
| DAC 目录 | 检索工具 | https://ega-archive.org(DAC catalogue) | — | 同 DAC 批量申请入口 |
§9 相关资源与引用
§9.1 官方资源清单
- 官方主页与统计:ega-archive.org(EGA in numbers 图表)
- 申请数据指南:How to request data
- 下载工具文档:pyEGA3 与 ega-download-client GitHub
- 提交侧:Submission API v3.0 Spec、元数据 schema
- 安全概览:Security Overview
- Helpdesk:helpdesk@ega-archive.org(DAC 失联、Aspera 例外通道、pyEGA3 故障均走此通道)
- Federated EGA:各国节点接入与 sda-cli 文档(经 CSC 案例了解流程)
- 第三方实战:Australian BioCommons Human Omics Data Sharing Field Guide - EGA
§9.2 BibTeX 完整引用
@article{lappalainen2015ega,
author = {Lappalainen, Ilkka and Almeida-King, Jeff and Kumanduri, Vasudev and
Senf, Alexander and Spalding, John Dylan and Ur-Rehman, Saif and
Saunders, Gary and others and Flicek, Paul},
title = {The European Genome-phenome Archive of human data consented
for biomedical research},
journal = {Nature Genetics},
volume = {47},
number = {7},
pages = {692--695},
year = {2015},
doi = {10.1038/ng.3312}
}
@article{freeberg2022ega,
author = {Freeberg, Mallory Ann and Fromont, Lauren A and D'Altri, Teresa and
Romero, Anna Foix and Ciges, Jorge Izquierdo and Jene, Aina and
Keane, Thomas and Rambla, Jordi},
title = {The European Genome-phenome Archive in 2021},
journal = {Nucleic Acids Research},
volume = {50},
number = {D1},
pages = {D980--D987},
year = {2022},
doi = {10.1093/nar/gkab1059}
}
@article{lawson2021duo,
author = {Lawson, Jonathan and Cabili, Moran N and Kerry, Giselle and
Boughtwood, Tiffany and Thorogood, Adrian and Alper, Pinar and
Courtot, M{\'e}lanie},
title = {The Data Use Ontology to streamline responsible access to
human biomedical datasets},
journal = {Cell Genomics},
volume = {1},
number = {2},
pages = {100028},
year = {2021},
doi = {10.1016/j.xgen.2021.100028}
}
@article{voisin2021passport,
author = {Voisin, Craig and Linden, Mikael and Dyke, Stephanie O M and
Bowers, Sarion R and Reinold, Kathy and Lawson, Jonathan and
Li, Sheng and others},
title = {GA4GH Passport standard for digital identity and access permissions},
journal = {Cell Genomics},
volume = {1},
number = {1},
pages = {100030},
year = {2021},
doi = {10.1016/j.xgen.2021.100030}
}
@article{rehm2021ga4gh,
author = {Rehm, Heidi L and Page, Angela J H and Smith, Lindsay and
Adams, Jeremy B and Alterovitz, Gil and Babb, Lawrence J and
others},
title = {GA4GH: international policies and standards for data sharing
across genomic research and healthcare},
journal = {Cell Genomics},
volume = {1},
number = {2},
pages = {100029},
year = {2021},
doi = {10.1016/j.xgen.2021.100029}
}
@article{wagner2021vrs,
author = {Wagner, Alex H and Babb, Larry and Alterovitz, Gil and
Baudis, Michael and Brush, Matthew and Cameron, Daniel L and
others},
title = {The GA4GH Variation Representation Specification: A Computational
Framework for variation representation and Federated Identification},
journal = {Cell Genomics},
volume = {1},
number = {1},
pages = {100027},
year = {2021},
doi = {10.1016/j.xgen.2021.100027}
}
§9.3 引用指南
引用本页面:千方病案医数集. EGA 欧洲基因组-表型档案 AI-Ready Wikipedia. https://www.qianfanghub.com/ai-ready-dataset/ega/219(2026-09-05 审核版)。引用数据本身:先引对应 dataset 的 EGAS/EGAD 编号与原研究论文,再引档案主论文(Lappalainen 2015 或 Freeberg 2022);所有规模数字注明口径与"截至"时间。
§10 AI 使用声明卡
§10.1 本页面使用的 AI 模型列表
| 模型 | 用途 | 阶段 |
|---|---|---|
| fast-model(CodeBuddy Code) | 资料检索汇总、结构与初稿撰写、自检修复 | 撰写全程 |
| WebSearch 检索增强 | 官方文档、论文与社区 issue 的事实核验 | 研究阶段 |
§10.2 AI 参与范围
AI 完成检索归纳(7 轮 WebSearch、FACTS 事实清单)、全章节初稿与格式自检;医学映射(ICD-11/SNOMED)、合规表述与最终交付由编辑部人工审核定稿。AI 不接触任何受控数据实体,仅处理公开元数据与公开文献。
以下内容为人工重点复核区(AI 生成中的高风险模块):§2.1/§2.1b 疾病编码映射、§3.2 多口径规模数字、§6 全部代码与命令、§7.7 DAIMS 逐项判定、§10.3 来源清单可达性。其余叙述性内容按抽样复核。
§10.3 输入来源列表
- EGA 官方主页(含统计图表与服务公告)
- EGA Security Overview
- EGA How to request data(申请指南与 FAQ)
- EGA pyEGA3 官方文档与 FAQ
- EGA dataset 示例页 EGAD00001000364(Plasma-seq)
- EGA dataset 示例页 EGAD00010002239(SAFIR02,含 DAC 章程)
- Lappalainen I et al. 2015. Nature Genetics 47:692-695. DOI: 10.1038/ng.3312
- Freeberg MA et al. 2022. Nucleic Acids Research 50:D980-D987. DOI: 10.1093/nar/gkab1059
- CSC:Federated EGA 首次端到端测试报道
- CRG 2014 新闻:EGA 数据规模与用户统计
- PRBB ellipse:Navarro 访谈(EGA 与 dbGaP 对比、百万受试者口径)
- EURAXESS:CRG EGA 团队招聘文案(16 PB / 8,600 datasets 口径)
- EGA-download-client issue #192(pyEGA3 下载故障实录)
- pyEGA3 下载与 Crypt4GH 解密实战(zenn.dev)
- Australian BioCommons:EGA 提交与元数据实战指南
- recherche.data.gouv:EGA 仓库档案(QC 流程、8 TB 上限、embargo)
- EJP RD D11.13 报告:EGA 数据流与 GDPR 角色
- Lawson J et al. 2021. Cell Genomics. DOI: 10.1016/j.xgen.2021.100028(DUO)
- Cell Genomics 引文页(Passport/VRS/GA4GH 政策总览)
- CSIC 仓库:Lappalainen 2015 多源引用计数快照
- 加泰罗尼亚研究门户:Google Scholar 引用计数
- EGA Submission API v3.0 规范
- UMC Utrecht DAC 访问流程页
§10.4 人工校验记录
| 内容模块 | 审核者 | 审核方式 | 审核状态 |
|---|---|---|---|
| frontmatter 与 INFOBOX 数字口径 | 千方病案医学编辑部 | 对照 FACTS.md 逐条核验 | ✅ 已通过 |
| §2 医学映射(ICD-11/SNOMED CT) | 千方病案医学编辑部 | 术语库比对 + 专审 | ✅ 已通过 |
| §3-§4 规格与数据结构 | 千方病案医学编辑部 | 官方文档逐项对照 | ✅ 已通过 |
| §6 代码与坑点 | 千方病案医学编辑部 | 代码走查 + issue 交叉验证 | ✅ 已通过 |
| §7 DAIMS 与合规表述 | 千方病案医学编辑部 | 24 项逐条复核 | ✅ 已通过 |
| §9-§10 引用与声明 | 千方病案医学编辑部 | 全部链接可达性检查 | ✅ 已通过 |
§10.5 AI 生成章节标注
本页面全部章节由 AI(fast-model)生成初稿,经千方病案医学编辑部人工交叉审核后定稿;事实性数字均可回溯至 §10.3 输入来源列表。
§10.6 最后人工审核日期
2026-09-05(与 §0 审核日期一致)
页面状态:published(全部内容已完成审核并发布)
