INFOBOX
|
|
| 数据集名称 |
HMP(Human Microbiome Project) |
| 英文全称 |
Human Microbiome Project |
| 别名 / 简称 |
HMP、HMP1、HMP1-II、iHMP、HMP2、NIH HMP |
| 疾病分类 |
多疾病覆盖。核心映射:DD80–DD8Z 炎症性肠病 / KA20–KA2Z 妊娠相关并发症 / 5A10–5A1Z 糖尿病前期 / 1A00–1A0Z 某些感染性疾病 / DA0C 口腔疾病 |
| SNOMED CT |
24526004 Inflammatory bowel disease / 288380006 Premature labor / 31321000119102 Prediabetes / 235058003 Bacterial infection / 87172008 Bacterial vaginosis |
| 数据模态 |
基因组(16S rRNA / WGS 宏基因组 / 参考基因组)+ 多组学(宏转录组 / 蛋白质组 / 代谢组 / 宿主转录组) |
| AI 任务类型 |
分类(物种分类)、回归(丰度预测)、聚类(社区分型)、生存分析(疾病预测)、多模态融合、纵向时序建模 |
| 样本总数 |
HMP1:11,174 原始标本(300 名健康成人,18 个身体部位);HMP1-II:2,355 宏基因组样本(265 个体);iHMP:1,527 名孕妇 + 132 名 IBD + 106 名前驱糖尿病受试者 |
| 数据大小 |
~42 TB(HMP1 + HMP2 全部多组学数据) |
| 数据格式 |
FASTQ / FASTA / SFF / BAM / TSV / CSV / HDF5 / BIOM |
| 许可证 |
公共领域 / CC0(大部分数据);NIH Data Use Certification(dbGaP 受控访问数据) |
| 访问级别 |
开放(AWS / DACC 门户 / NCBI SRA);注册后开放(dbGaP 受控访问,审批 2-4 周) |
| DUO 标签 |
NRES(开放数据), IRB(受控访问数据) |
| 语言 |
英文(元数据与临床信息) |
| 首发日期 |
2008-10(HMP 项目启动) |
| 最后更新 |
2019-05(iHMP 完成成果发表于 Nature) |
| 发布机构 |
NIH Common Fund Human Microbiome Project Consortium |
| 官方主页 |
https://commonfund.nih.gov/hmp |
| 下载地址 |
https://portal.hmpdacc.org/ (DACC 门户)/ s3://human-microbiome-project/ (AWS)/ https://www.ncbi.nlm.nih.gov/bioproject/PRJNA28331 (NCBI) |
| DOI |
10.1038/nature11234 |
| 引用次数 |
15,000+(Google Scholar,截至 2026-07) |
| AI 就绪度评分 |
⭐⭐⭐⭐(4/5)— 丰富的多组学数据 + 标准化处理管线 + 大规模参考基因组;扣分项:16S 平台已过时、人群多样性不足、缺少标准化 AI train/test 划分 |
| 页面状态 |
published |
§0 E-E-A-T 信任声明与免责声明
| 字段编号 |
字段名 |
内容 |
0.1 |
医学审核者 |
{ name: "千方病案医学编辑部", method: "交叉审核", scope: "§2 微生物学背景、§7 偏倚分析" } |
0.2 |
数据工程审核者 |
{ name: "千方病案医学编辑部", method: "交叉审核", scope: "§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点" } |
0.3 |
审核日期 |
2026-08-04 |
0.4 |
审核方式 |
交叉审核 |
0.5 |
免责声明 |
本页面仅为 HMP 数据集的技术文档与 AI 就绪度分析,不构成任何医学诊断或治疗建议。微生物组数据的临床解读须由具备资质的临床微生物学家或胃肠病学专家进行。HMP 数据中的"健康"参考队列不代表全球人群的微生物组基线,使用时须注意人群代表性偏倚。 |
0.6 |
利益冲突声明 |
本页面与 NIH 及 HMP 联盟无利益关联。 |
权威论文溯源:
| 序号 |
论文 |
期刊 |
年份 |
核心贡献 |
| 1 |
The Human Microbiome Jumpstart Reference Strains Consortium. A catalog of reference genomes from the human microbiome |
Science |
2010 |
首批 178 个微生物参考基因组目录 |
| 2 |
Human Microbiome Project Consortium. Structure, function and diversity of the healthy human microbiome |
Nature |
2012 |
HMP1 核心成果:300 名健康成人微生物组基线图谱 |
| 3 |
Human Microbiome Project Consortium. A framework for human microbiome research |
Nature |
2012 |
HMP 研究框架:采样协议、数据处理管线、标准化方法 |
| 4 |
Lozupone C et al. Meta-analysis of the gut microbiota of healthy adults |
Nature |
2013 |
基于 HMP 数据的肠道微生物组元分析 |
| 5 |
Lloyd-Price J et al. Strains, functions and dynamics in the expanded Human Microbiome Project |
Nature |
2017 |
HMP1-II 扩展:2,355 宏基因组样本菌株水平分析 |
| 6 |
The Integrative HMP Research Network Consortium. The Integrative Human Microbiome Project |
Nature |
2019 |
iHMP 完成:三疾病队列多组学纵向研究 |
| 7 |
Fettweis JM et al. The vaginal microbiome and preterm birth |
Nature Medicine |
2019 |
MOMS-PI:阴道微生物组与早产风险 |
| 8 |
Lloyd-Price J et al. Multi-omics of the gut microbial ecosystem in inflammatory bowel diseases |
Nature |
2019 |
IBDMDB:IBD 肠道微生物组多组学 |
§1 数据集概览
§1.0 30 秒速览
HMP(Human Microbiome Project) 是美国国立卫生研究院(NIH)Common Fund 主导的十年级大型科研项目(2007-2016),旨在全面表征人体各部位共生微生物群的组成、功能和动态。项目分两个阶段:HMP1(2008-2012)对 300 名健康成人在 18 个身体部位进行了 16S rRNA 基因测序和全宏基因组鸟枪法测序,建立了全球最大的健康人体微生物组参考基线;iHMP(2014-2019)针对炎症性肠病(IBD)、妊娠与早产、前驱糖尿病三个疾病队列开展了纵向多组学(宏基因组 + 宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组)研究。总计产出约 42 TB 多组学数据、2,000+ 微生物参考基因组,是微生物组 AI 研究、脑肠轴机制挖掘和微生物靶向疗法开发的基础参考数据集。
§1.1 战略价值
| 维度 |
评估 |
| 数据规模 |
~42 TB 多组学数据,涵盖 16S + WGS + 宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组六种组学类型 |
| 人群覆盖 |
300 名健康成人(HMP1)+ 1,765 名疾病队列受试者(iHMP),5 大身体区域 18 个采样部位 |
| 参考价值 |
全球最大的健康人体微生物组基线参考图谱 + 2,000+ 参考基因组,是所有微生物组研究的比对标杆 |
| AI 就绪度 |
⭐⭐⭐⭐(4/5)—— 数据开放、格式标准、工具生态成熟(QIIME2 / MetaPhlAn / HUMAnN),但 16S 平台过时、缺少标准化 AI 划分 |
| 独特性 |
唯一同时覆盖全身 5 大区域 18 个部位的微生物组参考数据集;唯一同时包含细菌、真菌、病毒、原生生物四大微生物界的完整调查 |
| 许可证 |
公共领域 / CC0(开放数据部分完全免费无限制),部分受控访问数据需 dbGaP 审批 |
| 生态影响 |
650+ 篇论文、70,000+ 引用(截至 2017);催生 QIIME、MetaPhlAn、HUMAnN 等核心工具 |
§1.2 横向对比
| 维度 |
HMP |
Earth Microbiome Project (EMP) |
MetaHIT |
American Gut Project |
GMrepo |
| 人群规模 |
300 健康成人 + 1,765 疾病队列 |
27,751 样本 / 10,000+ 研究 |
124 欧洲人 |
15,096 参与者 |
58,902 样本整合 |
| 身体部位 |
18 部位 / 5 大区域 |
环境样本为主 |
仅肠道 |
仅肠道 |
仅肠道 |
| 测序类型 |
16S + WGS + 多组学 |
16S 为主 |
WGS 宏基因组 |
16S 为主 |
16S + WGS 整合 |
| 时间维度 |
HMP1 横断面 / HMP2 纵向 |
横断面 |
横断面 |
横断面 |
横断面 |
| 参考基因组 |
2,000+ |
无 |
无 |
无 |
无 |
| 疾病队列 |
IBD / 早产 / 前驱糖尿病 |
无 |
IBD / 肥胖 |
自报告疾病 |
整合多疾病 |
| 数据量 |
~42 TB |
~2 TB |
~0.5 TB |
~1 TB |
~5 TB |
| 许可证 |
CC0 / 公共领域 |
CC-BY 4.0 |
受控 |
CC-BY 4.0 |
CC0 |
§1.3 版本演进时间轴
| 阶段 |
时间 |
事件 |
关键产出 |
| 启动 |
2007 |
NIH Common Fund 正式启动 HMP |
项目规划与资助 |
| Jumpstart |
2010-05 |
首批 178 个参考基因组发表 |
Science 2010,奠定分类参考基础 |
| HMP1 |
2012-06 |
HMP1 核心成果发表于 Nature |
300 名健康成人微生物组基线图谱,11,174 原始标本 |
| 框架 |
2012-06 |
HMP 研究框架论文发表 |
Nature 2012,标准化采样协议与处理管线 |
| 扩展 |
2014-05 |
iHMP(HMP2)正式启动 |
三疾病队列纵向多组学研究启动 |
| HMP1-II |
2017-09 |
扩展数据集发表 |
2,355 宏基因组样本菌株水平分析 |
| iHMP 完成 |
2019-05 |
iHMP 完成成果发表于 Nature |
三队列多组学纵向数据发布 |
| MOMS-PI |
2019-05 |
阴道微生物组与早产研究发表 |
Nature Medicine,597 名孕妇 12,039 样本 |
| IBDMDB |
2019-05 |
IBD 多组学研究发表 |
Nature,132 名 IBD 患者纵向多组学 |
| 项目过渡 |
2017+ |
HMP 从 Common Fund 过渡,非 HMP NIH 微生物组研究投入增长 40 倍 |
数据持续可用,社区维护 |
| 平台迁移 |
2020+ |
DACC 门户现代化(portal.hmpdacc.org) |
新版数据门户支持购物车式批量下载 |
| 云端开放 |
2023+ |
AWS Open Data Registry 上线 HMP 数据集 |
s3://human-microbiome-project/ 无需账户即可访问 |
§1.4 AI 应用场景
| 场景 |
描述 |
数据来源 |
| 微生物组分类训练 |
使用 16S rRNA 序列训练深度学习物种分类器 |
HMP1 16S 数据 |
| 疾病生物标志物挖掘 |
从宏基因组丰度数据中识别疾病相关微生物特征 |
iHMP 三疾病队列 |
| 宏基因组功能注释 |
基于参考基因组进行代谢通路重建与功能预测 |
HMP 参考基因组 + WGS 数据 |
| 菌株追踪与个性化 |
分析个体间菌株水平差异及其时间稳定性 |
HMP1-II 纵向数据 |
| 脑肠轴机制研究 |
将微生物组与宿主免疫/代谢指标关联,建模宿主-微生物互作 |
iHMP 多组学数据 |
| 微生物组动态预测 |
纵向时序建模,预测微生物群落演替与疾病发作 |
iHMP IBD / 前驱糖尿病 |
| 早产风险预测 |
基于阴道微生物组特征构建早产风险分类模型 |
MOMS-PI 队列 |
| 跨组学数据融合 |
多组学整合模型(宏基因组 + 代谢组 + 宿主转录组) |
iHMP 全组学数据 |
§2 医学背景
§2.1 ICD-11 疾病映射
| ICD-11 编码 |
疾病名称 |
与 HMP 的关联 |
| DD80–DD8Z |
炎症性肠病(IBD) |
iHMP IBDMDB 队列:132 名 IBD 患者一年纵向多组学研究 |
| KA20–KA2Z |
妊娠相关并发症 |
iHMP MOMS-PI 队列:1,527 名孕妇阴道微生物组与早产风险 |
| 5A10–5A1Z |
糖尿病前期 / 2 型糖尿病 |
iHMP IPOP 队列:106 名受试者 4 年纵向追踪 |
| 1A00–1A0Z |
细菌感染性疾病 |
HMP 参考基因组含多种病原菌(如 C. difficile) |
| DA0C |
口腔疾病 |
HMP 口腔部位采样(舌背、颊黏膜、龈上菌斑等) |
| 5A70 |
细菌性阴道病 |
HMP 阴道部位采样 + MOMS-PI 阴道微生物组研究 |
| 4A00 |
肥胖症 |
HMP1-II 肠道微生物组与代谢健康关联分析 |
| CA40 |
呼吸系统感染 |
HMP 鼻腔部位采样 + IPOP 呼吸道感染期间微生物组变化 |
§2.2 SNOMED CT 映射
| SNOMED CT ID |
术语 |
应用场景 |
| 24526004 |
Inflammatory bowel disease |
IBDMDB 队列疾病定义 |
| 288380006 |
Premature labor |
MOMS-PI 队列结局指标 |
| 31321000119102 |
Prediabetes |
IPOP 队列入组标准 |
| 235058003 |
Bacterial infection |
HMP 参考基因组病原菌注释 |
| 87172008 |
Bacterial vaginosis |
阴道微生物组异常状态分类 |
| 417662000 |
Bacterial vaginosis |
BV 诊断与微生物组关联 |
| 64859006 |
Opportunistic infection |
免疫抑制状态下微生物组变化 |
§2.3 微生物学基础概念
| 概念 |
定义 |
与 HMP 的关系 |
| 微生物组(Microbiome) |
特定环境中所有微生物及其基因组的总和 |
HMP 的核心研究对象 |
| 16S rRNA 基因 |
原核生物核糖体小亚基 RNA 基因,含 9 个可变区(V1-V9),用于物种分类 |
HMP1 主要测序靶标(V1-V3 / V3-V5 / V6-V9) |
| 宏基因组(Metagenome) |
环境中全部微生物基因组的集合 |
HMP1 WGS 鸟枪法测序的对象 |
| OTU(Operational Taxonomic Unit) |
基于序列相似度(通常 97%)聚类的分类操作单元 |
HMP 16S 分析的基本分类单位 |
| 肠型(Enterotype) |
肠道微生物组的主要群落类型(以 Bacteroides / Prevotella / Ruminococcus 为标志) |
HMP 肠道数据验证了肠型的存在 |
| 菌株(Strain) |
同一物种内遗传上有差异的亚型 |
HMP1-II 使用 StrainPhlAn 进行菌株水平分析 |
| 短链脂肪酸(SCFA) |
微生物发酵产生的乙酸、丙酸、丁酸等,是宿主-微生物互作的关键介质 |
HMP 功能注释中代谢通路分析的核心 |
§2.4 人体微生物组身体部位分布
| 身体区域 |
具体部位(HMP 采样) |
微生物多样性特征 |
主要菌属 |
| 肠道 |
粪便(Stool) |
丰度最高、多样性最丰富 |
Bacteroides、Faecalibacterium、Roseburia |
| 口腔 |
舌背(Tongue dorsum)、颊黏膜(Buccal mucosa)、龈上菌斑(Supragingival plaque)、硬腭(Hard palate)、附着角化龈(Attached keratinized gingiva)、唾液(Saliva)、扁桃体(Palatine tonsils) |
高多样性、部位特异性强 |
Streptococcus、Prevotella、Veillonella |
| 鼻腔 |
前鼻孔(Anterior nares) |
低多样性、以 Corynebacterium 和 Staphylococcus 为主 |
Corynebacterium、Staphylococcus、Propionibacterium |
| 皮肤 |
左/右肘前窝(Left/Right antecubital fossa)、左/右耳后(Left/Right retroauricular crease) |
部位依赖性、以 Staphylococcus 和 Corynebacterium 为主 |
Staphylococcus、Corynebacterium、Propionibacterium |
| 阴道 |
后穹窿(Posterior fornix) |
低多样性、以 Lactobacillus 为主 |
Lactobacillus crispatus、L. iners、Gardnerella |
§2.5 微生物组与疾病关联
| 疾病 |
微生物组特征 |
HMP 贡献 |
关键发现 |
| IBD(克罗恩病 + 溃疡性结肠炎) |
微生物多样性降低、Fusobacterium 增加、短链脂肪酸产生菌减少 |
IBDMDB 队列纵向追踪 132 名患者 |
IBD 发作期微生物组剧烈变化,缓解期恢复至接近正常;宿主免疫分子与微生物组高度互作 |
| 早产 |
L. crispatus 减少、BVAB1 增加 |
MOMS-PI 队列 597 名孕妇 |
阴道微生物组多样性高的孕妇早产风险更高;种族差异显著(非洲血统风险更高) |
| 前驱糖尿病 / T2D |
丁酸产生菌减少、微生物组稳定性降低 |
IPOP 队列 106 名受试者 4 年追踪 |
前驱糖尿病患者免疫应答迟钝;感染事件可能触发糖尿病进展;个体化分子签名可预测 T2D 发生 |
| 肥胖 |
Bacteroidetes/Firmicutes 比例变化、多样性降低 |
HMP1 肠道数据关联分析 |
微生物组与代谢健康相关,但个体间差异远大于疾病间差异 |
| 细菌性阴道病 |
Lactobacillus 减少、Gardnerella 增加 |
HMP 阴道数据 + MOMS-PI |
五种阴道微生物群落状态,仅一种为健康状态 |
| ** colorectal cancer** |
Fusobacterium nucleatum 富集 |
HMP 数据作为健康对照 |
基于 HMP 参考基因组的宏基因组分析发现 CRC 相关菌株 |
§2.6 微生物组研究的 8 大变革
| 维度 |
前 HMP 时代 |
HMP 后 |
| 参考数据 |
缺乏系统性人体微生物组参考 |
300 名健康成人基线图谱 + 2,000+ 参考基因组 |
| 标准化 |
各实验室协议不统一 |
HMP Core Sampling Protocol A 成为行业标准 |
| 工具生态 |
缺乏整合分析平台 |
QIIME / MetaPhlAn / HUMAnN 成为核心工具 |
| 数据共享 |
数据分散、格式不一致 |
DACC 门户统一存储与分发 |
| 多组学 |
仅 16S 或 WGS 单一组学 |
iHMP 引入宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组整合 |
| 纵向设计 |
以横断面研究为主 |
iHMP 三队列均采用纵向追踪设计 |
| 菌株水平 |
仅能到属/种水平 |
StrainPhlAn 实现菌株水平追踪 |
| 宿主互作 |
仅关注微生物组成 |
iHMP 同时测量宿主免疫、代谢、基因表达 |
§3 数据集规格
§3.0 版本抉择矩阵
| 使用场景 |
推荐版本 |
理由 |
数据量 |
| 健康基线参考 |
HMP1(Phase 1) |
300 名健康成人 18 部位完整 16S + WGS |
~10-15 TB |
| 菌株水平分析 |
HMP1-II(扩展) |
2,355 宏基因组 + StrainPhlAn 菌株追踪 |
~5 TB |
| 疾病生物标志物 |
iHMP IBDMDB |
132 名 IBD 患者纵向多组学 |
~5-8 TB |
| 早产预测模型 |
iHMP MOMS-PI |
597 名孕妇阴道微生物组纵向数据 |
~3-5 TB |
| 糖尿病风险预测 |
iHMP IPOP |
106 名前驱糖尿病 4 年纵向多组学 |
~3-5 TB |
| 参考基因组映射 |
HMP Reference Genomes |
2,000+ 微生物参考基因组 |
~50-100 GB |
| 快速原型验证 |
AWS Open Data 子集 |
免注册、免费、S3 无限制访问 |
按需 |
§3.1 数据类型
| 数据类型 |
测序方法 |
样本规模 |
主要用途 |
| 16S rRNA 基因测序 |
Roche 454 FLX Titanium(V1-V3 / V3-V5 / V6-V9) |
>10,000 样本 / 5,298 初期 |
物种分类、群落多样性分析 |
| 全宏基因组鸟枪法测序(WGS) |
Illumina |
681 初期 + 1,631 扩展 = 2,355 总计 |
功能注释、代谢通路重建、菌株分析 |
| 参考基因组测序 |
Sanger / Illumina / 454 |
2,000+ 基因组 |
分类参考、功能映射 |
| 宏转录组测序 |
Illumina RNA-seq |
iHMP 三队列 |
微生物活性基因表达 |
| 蛋白质组学 |
LC-MS/MS |
iHMP IBD / IPOP 队列 |
微生物与宿主蛋白谱 |
| 代谢组学 |
非靶向质谱 |
iHMP 三队列 |
代谢物谱、短链脂肪酸定量 |
| 宿主转录组学 |
Illumina RNA-seq |
iHMP IPOP 队列 |
宿主基因表达响应 |
§3.2 数据格式
| 格式 |
用途 |
特点 |
| FASTQ |
原始测序 reads |
含质量评分,HMP1 16S 为 454 FLX 格式 |
| FASTA |
参考序列 / 组装结果 |
纯序列无质量信息 |
| SFF |
454 测序原始数据 |
Roche 454 平台专有格式,含 flowgram 信息 |
| BAM |
比对结果 |
二进制格式,参考基因组比对 |
| BIOM |
OTU 表 / 丰度矩阵 |
生物观测矩阵格式,支持 JSON / HDF5 |
| TSV/CSV |
元数据 / 丰度表 |
可读性高,适合 R / Python 加载 |
| HDF5 |
大规模数值矩阵 |
高效存储高维数据,QIIME2 使用 |
§3.3 访问渠道
§3.4 标准化处理管线
| 管线 |
用途 |
工具链 |
输出 |
| 16S 处理管线 |
16S rRNA 原始 reads → OTU 表 |
NAST-iEr → ChimeraSlayer → WigeoN → RDP Classifier |
比对后的去嵌合体序列 + 分类表 |
| WGS 宏基因组管线 |
WGS reads → 物种 + 功能谱 |
质控 → 比对 → 组装 → 注释 |
物种丰度表 + 功能丰度表 |
| 参考基因组注释 |
基因组 → 基因预测 + 功能注释 |
IMG-GOLD 系统 → 基因预测 → KEGG / COG 注释 |
注释基因组 |
| 元数据管理 |
样本元数据标准化 |
MIGS 标准 → GOLD 数据库 |
结构化元数据 |
| iHMP 多组学整合 |
跨组学数据整合分析 |
DACC 统一框架 → 跨组学关联分析 |
整合多组学矩阵 |
§3.5 质量控制标准
| QC 指标 |
标准 |
说明 |
| 16S 测序误差率 |
<0.02% |
使用 Mock Community 标定,从 0.6% 降至 0.02% |
| 嵌合体检测 |
ChimeraSlayer 筛除 |
16S 处理管线标准步骤 |
| 人类序列去污染 |
BMTagger / Bowtie2 |
WGS 数据中人类宿主序列去除 |
| 技术重复一致性 |
252 个技术重复 |
HMP1-II 含 252 个技术重复用于评估批次效应 |
| Mock Community |
21 种已知菌合成群落 |
16S 管线验证的金标准 |
| 基因组完成度 |
High Quality Draft(大部分)/ Improved / Finished |
参考 genome finishing 标准(Chain et al. 2009) |
| 元数据合规 |
MIGS 最小信息标准 |
Genomic Standards Consortium 规范 |
§3.6 工具生态
| 工具 |
功能 |
HMP 关系 |
当前版本 |
| QIIME / QIIME2 |
16S rRNA 分析平台 |
HMP 资助开发,成为 16S 分析标准 |
QIIME2 2024.x |
| MetaPhlAn |
宏基因组物种分类 |
HMP 标准处理管线组件 |
MetaPhlAn 4.x |
| HUMAnN |
宏基因组功能注释 |
HMP 标准处理管线组件(HMP Unified Metabolic Analysis Network) |
HUMAnN 3.x |
| Mothur |
16S rRNA 分析平台 |
HMP 资助开发 |
Mothur 1.48.x |
| StrainPhlAn |
菌株水平追踪 |
HMP1-II 核心分析工具 |
MetaPhlAn 组件 |
| RDP Classifier |
16S rRNA 分类 |
HMP 16S 管线组件 |
RDP 18 |
| Greengunes / SILVA |
16S 参考数据库 |
HMP 分类参考 |
Greengunes 13.8 / SILVA 138 |
| IMG / GOLD |
参考基因组管理 |
HMP 参考基因组数据库系统 |
IMG/M |
| phyloseq |
R 微生物组分析 |
社区开发的 HMP 数据分析工具 |
phyloseq 1.46.x |
| HMP16SData |
R/Bioconductor HMP 16S 数据包 |
直接加载 HMP 16S 处理后数据 |
HMP16SData 1.24.x |
| VSEARCH |
序列聚类 / 去冗余 |
OTU 聚类替代 USEARCH |
VSEARCH 2.x |
| DADA2 |
序列变异检测 |
QIIME2 默认 16S 去噪方法 |
DADA2 1.30.x |
§4 数据结构详解
§4.1 标识系统
| 标识类型 |
格式 |
示例 |
说明 |
| NCBI SRA Run |
SRR + 数字 |
SRR013951 |
单次测序运行 |
| NCBI SRA Sample |
SRS + 数字 |
SRS147223 |
生物样本 |
| NCBI SRA Study |
SRP + 数字 |
SRP002860 |
研究项目 |
| NCBI BioProject |
PRJNA + 数字 |
PRJNA28331 |
HMP 参考基因组项目 |
| dbGaP Study |
phs + 数字 |
phs000228.v4.p1 |
HMP 受控访问研究 |
| HMP Sample ID |
UUID |
3674d95cd0d27e1de94ddf4d2e0c0780 |
DACC 门户内部标识 |
| HMP Body Site Code |
缩写 |
ANT_NA(前鼻孔)/ STOOL(粪便)/ TONG_D(舌背) |
18 个标准部位代码 |
§4.2 单条目数据组件
| 组件 |
文件类型 |
内容 |
示例 |
| 原始测序数据 |
FASTQ / SFF |
测序仪原始输出 |
SRS013951.tar.bz2(WGS raw) |
| 质控后数据 |
FASTQ |
去污染 + 质量过滤后 reads |
wgs_qc_v2/ |
| 组装结果 |
FASTA |
宏基因组组装 contigs |
IDBA/SRS013951.fna.bz2 |
| 物种丰度表 |
BIOM / TSV |
OTU/物种 × 样本丰度矩阵 |
HM16STR processed |
| 功能丰度表 |
TSV |
代谢通路 / KEGG 丰度 |
HUMAnN 输出 |
| 样本元数据 |
TSV / LMD |
采样部位、访视次数、受试者信息 |
.lmd 文件 |
| 参考基因组 |
FASTA / GenBank |
组装注释后基因组序列 |
NCBI RefSeq |
| 比对结果 |
BAM |
reads → 参考基因组比对 |
BAM 文件 |
| 质控报告 |
TXT / HTML |
质控指标汇总 |
FastQC / MultiQC |
§4.3 DACC 元数据模型
HMP DACC 元数据层次结构
├── Project(项目)
│ ├── HMP1 Phase I(健康基线)
│ ├── HMP1-II(扩展)
│ └── iHMP(整合 HMP)
│ ├── MOMS-PI(妊娠/早产)
│ ├── IBDMDB(IBD)
│ └── IPOP(前驱糖尿病)
├── Subject(受试者)
│ ├── Subject ID(匿名标识)
│ ├── Demographics(人口学,受控访问)
│ ├── Visit Number(访视次数 1-3)
│ └── Body Site(采样部位 × 访视)
├── Sample(样本)
│ ├── Sample ID(UUID)
│ ├── Body Site(18 部位之一)
│ ├── Collection Date(采集日期)
│ └── Processing Center(处理中心)
├── Sequencing Run(测序运行)
│ ├── Platform(454 FLX / Illumina)
│ ├── Variable Region(V1V3 / V3V5 / V6V9)
│ └── Read Count(reads 数)
└── Analysis Result(分析结果)
├── Taxonomic Profile(物种分类谱)
├── Functional Profile(功能注释谱)
└── Assembly(组装结果)
§4.4 FTP 目录结构
HMP DACC FTP 目录树
├── /data/
│ ├── HM16STR/ # 16S 处理后数据
│ │ ├── SRP002860/ # 按研究项目组织
│ │ │ ├── SRS147223.fsa
│ │ │ └── ...
│ ├── HMR16S/ # 16S 原始数据
│ │ └── *.sff # 454 测序原始数据
│ ├── HMASM/ # 宏基因组组装
│ │ └── IDBA/
│ ├── HMQCP/ # QIIME 社区分析
│ ├── HMMCP/ # Mothur 社区分析
│ └── hmmrc2/ # HUMAnN2 功能分析
├── /reference_genomes/ # 参考基因组
│ └── PRJNA28331/ # BioProject
└── /ihmp/ # iHMP 数据
├── MOMS-PI/
├── IBDMDB/
└── IPOP/
§4.5 DAIMS 数据字典
| 字段名 |
类型 |
来源 |
描述 |
示例 |
sample_id |
string |
DACC |
样本唯一标识 |
SRS011061 |
subject_id |
string |
DACC |
受试者匿名标识 |
700013549 |
body_site |
enum |
采样协议 |
采样部位(18 选 1) |
Stool |
visit_no |
integer |
采样协议 |
访视次数(1/2/3) |
1 |
seq_platform |
enum |
测序中心 |
测序平台 |
454 FLX Titanium |
variable_region |
enum |
测序中心 |
16S 可变区 |
V3-V5 |
read_count |
integer |
测序中心 |
原始 reads 数 |
5,234 |
read_length |
integer |
测序中心 |
平均读长 |
450 |
data_type |
enum |
DACC |
数据类型 |
16S / WGS |
processing_center |
string |
DACC |
测序中心 |
BCM / Broad / JCVI / WashU |
assembly_method |
string |
DACC |
组装方法 |
IDBA / MetaVelvet |
organism |
string |
参考基因组 |
物种名 |
Bacteroides thetaiotaomicron |
finishing_status |
enum |
参考基因组 |
基因组完成度 |
High Quality Draft |
body_site_isolation |
string |
参考基因组 |
菌株分离部位 |
Gastrointestinal tract |
cohort_type |
enum |
iHMP |
疾病队列类型 |
MOMS-PI / IBDMDB / IPOP |
disease_status |
enum |
iHMP |
疾病状态 |
Healthy / IBD_active / IBD_remission |
§4.6 数据覆盖统计
| 维度 |
数量 |
说明 |
| 健康受试者 |
300 人 |
HMP1 健康成人队列 |
| 疾病队列受试者 |
1,765 人 |
iHMP 三队列(1,527 + 132 + 106) |
| 原始标本 |
11,174 个 |
HMP1 全部标本 |
| 16S 测序样本 |
>10,000 个 |
HMP1 16S 数据 |
| WGS 宏基因组 |
2,355 个 |
HMP1 + HMP1-II |
| 参考基因组 |
2,000+ 个 |
含细菌、古菌、病毒、真核微生物 |
| 身体部位 |
18 个 |
5 大区域(肠道/口腔/鼻腔/皮肤/阴道) |
| iHMP 标本 |
206,437 个 |
MOMS-PI 妊娠队列采集 |
| 组学数据类型 |
6+ 种 |
16S + WGS + 宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组 |
| 总数据量 |
~42 TB |
HMP1 + HMP2 全部 |
| 用户月活 |
9,000-12,000 |
DCC 网站月均会话数 |
§4.7 不覆盖的数据类型
| 数据类型 |
说明 |
替代来源 |
| 非美国人群数据 |
HMP 队列以美国人群为主(85% 白人) |
MetaHIT(欧洲)/ 中国肠道微生物组研究 |
| 儿童微生物组 |
HMP 仅纳入 18-40 岁成人 |
TEDDY 研究 / CHILD 研究 |
| 环境微生物组 |
仅人体相关微生物 |
Earth Microbiome Project (EMP) |
| 非人类灵长类 |
仅人类微生物组 |
各灵长类研究中心数据 |
| 抗生素干预数据 |
无系统性抗生素干预实验 |
临床试验数据 |
| 深层组织微生物组 |
仅表面/腔道采样 |
组织微生物组研究 |
§5 数据划分与使用建议
§5.1 划分维度
| 维度 |
划分方式 |
建议 |
| 按身体部位 |
肠道 / 口腔 / 鼻腔 / 皮肤 / 阴道 |
每个部位的微生物组特征差异显著,建议分别建模 |
| 按数据类型 |
16S / WGS / 多组学 |
16S 适合物种分类模型,WGS 适合功能预测,多组学适合宿主互作建模 |
| 按阶段 |
HMP1(健康基线)/ HMP2(疾病队列) |
HMP1 作为训练/参考集,HMP2 作为疾病预测目标 |
| 按访视 |
Visit 1 / 2 / 3 |
纵向数据可用于时序建模,Visit 1 为基线 |
| 按队列 |
MOMS-PI / IBDMDB / IPOP |
疾病队列间不可混用,特征差异大 |
§5.2 推荐划分策略
| 策略 |
训练集 |
验证集 |
测试集 |
适用场景 |
| 物种分类模型 |
HMP1 16S(70%) |
HMP1 16S(15%) |
HMP1 16S(15%) |
16S rRNA 序列物种分类 |
| 疾病预测模型 |
iHMP 队列内交叉验证 |
— |
跨队列验证 |
IBD / 早产 / 糖尿病风险预测 |
| 功能预测模型 |
HMP1 WGS + 参考基因组 |
HMP1-II WGS |
独立疾病队列 |
宏基因组功能注释 |
| 纵向预测模型 |
前期时间点 |
中期时间点 |
后期时间点 |
微生物组动态预测 |
| 多组学融合模型 |
iHMP 多组学(80%) |
iHMP 多组学(20%) |
外部验证(如 AGP) |
跨组学关联建模 |
§5.3 跨数据集整合策略
| 整合策略 |
目标 |
挑战 |
解决方案 |
| HMP + MetaHIT |
扩大肠道微生物组参考 |
技术平台差异(16S 可变区不同) |
使用统一参考数据库(SILVA)重新分类 |
| HMP + American Gut |
增加人群多样性 |
采样协议不一致 |
标准化元数据映射 |
| HMP + GMrepo |
整合多疾病微生物组 |
批次效应 |
ComBat 校正 + 分层建模 |
| HMP + EMP |
人体 vs 环境微生物组比较 |
样本类型差异极大 |
仅在属水平比较 |
§5.4 AI 训练数据获取流程
| 步骤 |
操作 |
工具 / 资源 |
| 1 |
确定研究目标与所需数据类型 |
— |
| 2 |
访问 DACC 门户选择数据子集 |
https://portal.hmpdacc.org/ |
| 3 |
下载原始数据(FASTQ / SFF) |
AWS CLI / SRA Toolkit |
| 4 |
执行质控与去污染 |
Kneaddata / BMTagger |
| 5 |
运行 16S 或 WGS 分析管线 |
QIIME2 / MetaPhlAn + HUMAnN |
| 6 |
生成特征矩阵(OTU 表 / 物种丰度 / 功能丰度) |
QIIME2 / biobakery |
| 7 |
整合元数据 |
DACC 元数据表 |
| 8 |
划分训练 / 验证 / 测试集 |
按受试者划分(非按样本) |
| 9 |
训练 AI 模型 |
scikit-learn / PyTorch / TensorFlow |
| 10 |
跨队列外部验证 |
独立疾病队列数据 |
§6 AI 就绪指南
§6.0 云端快速启动
<details>
<summary>📦 环境配置(点击展开)</summary>
# 1. 创建 conda 环境
conda create -n hmp-ai python=3.10
conda activate hmp-ai
# 2. 安装核心工具
conda install -c bioconda qiime2
conda install -c biobakery metaphlan humann
conda install -c bioconda biom-format
pip install scikit-learn pandas numpy matplotlib seaborn
# 3. 安装 AWS CLI(用于下载数据)
pip install awscli
# 4. 验证安装
qiime version
metaphlan version
humann version
</details>
§6.1 从 AWS 下载 HMP 数据
<details>
<summary>💻 AWS S3 批量下载(点击展开)</summary>
"""
从 AWS Open Data Registry 下载 HMP 数据
无需 AWS 账户,完全免费
"""
import subprocess
import os
# 列出 HMP 数据集
result = subprocess.run(
[''''''''''''''''aws'''''''''''''''', ''''''''''''''''s3'''''''''''''''', ''''''''''''''''ls'''''''''''''''', ''''''''''''''''no-sign-request'''''''''''''''', ''''''''''''''''s3://human-microbiome-project/''''''''''''''''],
capture_output=True, text=True
)
print("HMP S3 目录结构:")
print(result.stdout)
# 下载特定子集(示例:16S 参考数据)
download_dir = ''''''''''''''''./hmp_data''''''''''''''''
os.makedirs(download_dir, exist_ok=True)
# 下载 16S 数据子集
subprocess.run([
''''''''''''''''aws'''''''''''''''', ''''''''''''''''s3'''''''''''''''', ''''''''''''''''cp'''''''''''''''', ''''''''''''''''no-sign-request'''''''''''''''', ''''''''''''''''recursive'''''''''''''''',
''''''''''''''''s3://human-microbiome-project/HM16STR/'''''''''''''''',
os.path.join(download_dir, ''''''''''''''''HM16STR'''''''''''''''')
])
# 下载参考基因组元数据
subprocess.run([
''''''''''''''''aws'''''''''''''''', ''''''''''''''''s3'''''''''''''''', ''''''''''''''''cp'''''''''''''''', ''''''''''''''''no-sign-request'''''''''''''''',
''''''''''''''''s3://human-microbiome-project/reference_genomes/metadata.tsv'''''''''''''''',
os.path.join(download_dir, ''''''''''''''''ref_genomes_metadata.tsv'''''''''''''''')
])
# 列出已下载文件
for root, dirs, files in os.walk(download_dir):
for f in files:
filepath = os.path.join(root, f)
size_mb = os.path.getsize(filepath) / (1024 * 1024)
print(f"{filepath} ({size_mb:.1f} MB)")
</details>
§6.2 使用 HMP16SData R 包直接加载
<details>
<summary>🧬 R/Bioconductor 一键加载(点击展开)</summary>
# install.packages("BiocManager")
# BiocManager::install("HMP16SData")
library(HMP16SData)
library(phyloseq)
# 加载 V3-V5 16S 数据(处理后的 OTU 表 + 元数据)
V35_data <- HMP16SData::V35()
# 查看数据结构
print(V35_data)
# class: SummarizedExperiment
# dim: 45383 OTU × 3,035 samples
# rowData names: CONSENSUS_LINEAGE, SUPERKINGDOM, ... FAMILY, GENUS
# colData names: RSID, VISITNO, HMP_BODY_SUBSITE, SRS_SAMPLE_ID, ...
# 筛选肠道样本
stool_samples <- V35_data[, V35_data$HMP_BODY_SUBSITE == "Stool"]
print(dim(stool_samples)) # 45383 OTU × 319 samples
# 转换为 phyloseq 对象进行下游分析
ps_stool <- as phyloseq(stool_samples)
plot_bar(ps_stool, fill = "GENUS") + theme_bw()
</details>
§6.3 16S 分析完整管线(QIIME2)
<details>
<summary>🔬 QIIME2 16S rRNA 完整分析管线(点击展开)</summary>
#!/bin/bash
# HMP 16S rRNA 完整分析管线(QIIME2)
# 适用于 HMP 454 FLX Titanium 原始 SFF 数据
# 1. 导入数据(SFF → QIIME2 Artifact)
qiime tools import \
type ''''''''''''''''SampleData[SequencesWithQuality]'''''''''''''''' \
input-path ./hmp_16s_manifest.txt \
output-path hmp-16s-demux.qza \
input-format CasavaOneEightSingleLanePerSampleDirFmt
# 2. 序列去噪(DADA2 适配 454 长读)
qiime dada2 denoise-pyro \
i-demultiplexed-seqs hmp-16s-demux.qza \
p-trunc-len 0 \
o-table hmp-table.qza \
o-representative-sequences hmp-rep-seqs.qza \
o-denoising-stats hmp-stats.qza
# 3. 构建系统发育树
qiime phylogeny align-to-tree-mafft-fasttree \
i-sequences hmp-rep-seqs.qza \
o-alignment hmp-aligned-rep-seqs.qza \
o-masked-alignment hmp-masked-alignment.qza \
o-tree hmp-unrooted-tree.qza \
o-rooted-tree hmp-rooted-tree.qza
# 4. Alpha 多样性分析
qiime diversity alpha-rarefaction \
i-table hmp-table.qza \
i-phylogeny hmp-rooted-tree.qza \
p-max-depth 1000 \
m-metadata-file hmp-metadata.tsv \
o-visualization hmp-alpha-rarefaction.qzv
# 5. Beta 多样性分析
qiime diversity core-metrics-phylogenetic \
i-phylogeny hmp-rooted-tree.qza \
i-table hmp-table.qza \
p-sampling-depth 500 \
m-metadata-file hmp-metadata.tsv \
output-dir hmp-core-metrics
# 6. 物种分类(使用 SILVA 138 数据库)
qiime feature-classifier classify-sklearn \
i-classifier silva-138-ssu-nr-99-515f-806r-classifier.qza \
i-reads hmp-rep-seqs.qza \
o-classification hmp-taxonomy.qza
# 7. 按身体部位统计差异
qiime diversity beta-group-significance \
i-distance-matrix hmp-core-metrics/unweighted_unifrac_distance_matrix.qza \
m-metadata-file hmp-metadata.tsv \
m-metadata-column HMP_BODY_SUBSITE \
o-visualization hmp-body-site-significance.qzv \
p-pairwise
</details>
§6.4 宏基因组功能分析(MetaPhlAn + HUMAnN)
<details>
<summary>🧪 宏基因组物种 + 功能注释(点击展开)</summary>
#!/bin/bash
# HMP 宏基因组分析管线(MetaPhlAn 4 + HUMAnN 3)
# 1. 质控 + 去污染
kneaddata \
input hmp_wgs_R1.fastq \
input hmp_wgs_R2.fastq \
reference-db /path/to/human_genome_db \
output hmp_wgs_cleaned
# 2. 物种分类(MetaPhlAn 4)
metaphlan hmp_wgs_cleaned_1.kneaddata.trimmed.pair1.fastq,hmp_wgs_cleaned_2.kneaddata.trimmed.pair2.fastq \
input_type fastq \
bowtie2db /path/to/metaphlan_db \
nproc 8 \
-o hmp_wgs_profile.txt
# 3. 功能注释(HUMAnN 3)
humann \
input hmp_wgs_cleaned_1.kneaddata.trimmed.pair1.fastq,hmp_wgs_cleaned_2.kneaddata.trimmed.pair2.fastq \
output hmp_humann_output \
threads 8 \
metaphlan-options "bowtie2db /path/to/metaphlan_db"
# 4. 生成统一丰度矩阵
humann_join_tables \
input hmp_humann_output \
output hmp_humann_merged.tsv
# 5. 归一化(CPM)
humann_renorm_table \
input hmp_humann_merged.tsv \
output hmp_humann_normalized.tsv \
units relab \
norm CPM
# 6. 通路 abundance 分析
humann_regroup_table \
input hmp_humann_normalized_genefamilies.tsv \
output hmp_humann_pathabundance.tsv \
grouping uniref90-pathway
</details>
§6.5 疾病生物标志物挖掘(机器学习)
<details>
<summary>🤖 IBD 微生物组分类模型(点击展开)</summary>
"""
基于 HMP + iHMP IBDMDB 数据的 IBD 微生物组分类模型
使用随机森林进行 IBD vs 健康对照二分类
"""
import pandas as pd
import numpy as np
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import GroupKFold, cross_val_score
from sklearn.metrics import roc_auc_score, classification_report
from sklearn.preprocessing import StandardScaler
import matplotlib.pyplot as plt
import seaborn as sns
# 1. 加载物种丰度表(MetaPhlAn 输出)
# HMP1 健康基线作为对照组
healthy_profile = pd.read_csv(''''''''''''''''hmp1_healthy_metaphlan.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''', index_col=0)
# iHMP IBDMDB 作为病例组
ibd_profile = pd.read_csv(''''''''''''''''ihmp_ibd_metaphlan.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''', index_col=0)
# 2. 合并数据
X_healthy = healthy_profile.T # 样本 × 物种
X_ibd = ibd_profile.T
X = pd.concat([X_healthy, X_ibd], axis=0)
y = np.array([0] * len(X_healthy) + [1] * len(X_ibd)) # 0=健康, 1=IBD
groups = np.array([''''''''''''''''HMP''''''''''''''''] * len(X_healthy) + [''''''''''''''''IBD''''''''''''''''] * len(X_ibd))
# 3. 过滤低丰度物种
abundance_threshold = 0.001
prevalence_threshold = 0.05
mean_abundance = X.mean(axis=0)
prevalence = (X > 0).mean(axis=0)
features_keep = (mean_abundance > abundance_threshold) & (prevalence > prevalence_threshold)
X_filtered = X.loc[:, features_keep]
# 4. CLR 变换(处理组成型数据)
def clr_transform(df):
"""Centered Log-Ratio 变换"""
log_df = np.log(df + 1e-6) # 加小值避免 log(0)
geometric_mean = log_df.mean(axis=1)
clr_df = log_df.sub(geometric_mean, axis=0)
return clr_df
X_clr = clr_transform(X_filtered)
# 5. 按受试者分组交叉验证(避免数据泄露)
n_splits = 5
gkf = GroupKFold(n_splits=n_splits)
# 6. 训练随机森林
rf = RandomForestClassifier(
n_estimators=500,
max_depth=10,
random_state=42,
n_jobs=-1,
class_weight=''''''''''''''''balanced''''''''''''''''
)
# 交叉验证
cv_scores = cross_val_score(rf, X_clr, y, groups=groups, cv=gkf, scoring=''''''''''''''''roc_auc'''''''''''''''')
print(f"IBD 分类 AUC: {cv_scores.mean():.3f} ± {cv_scores.std():.3f}")
# 7. 训练最终模型并提取特征重要性
rf.fit(X_clr, y)
feature_importance = pd.DataFrame({
''''''''''''''''species'''''''''''''''': X_clr.columns,
''''''''''''''''importance'''''''''''''''': rf.feature_importances_
}).sort_values(''''''''''''''''importance'''''''''''''''', ascending=False)
print("\nTop 20 IBD 相关微生物特征:")
print(feature_importance.head(20))
# 8. 可视化
plt.figure(figsize=(10, 8))
top_features = feature_importance.head(20)
sns.barplot(data=top_features, x=''''''''''''''''importance'''''''''''''''', y=''''''''''''''''species'''''''''''''''', palette=''''''''''''''''RdYlBu_r'''''''''''''''')
plt.title(''''''''''''''''Top 20 Microbial Features for IBD Classification (HMP + IBDMDB)'''''''''''''''')
plt.xlabel(''''''''''''''''Random Forest Importance'''''''''''''''')
plt.tight_layout()
plt.savefig(''''''''''''''''ibd_biomarker_importance.png'''''''''''''''', dpi=300)
plt.show()
</details>
§6.6 纵向微生物组动态建模
<details>
<summary>📈 iHMP IBD 纵向时序分析(点击展开)</summary>
"""
iHMP IBDMDB 纵向微生物组动态建模
使用 LSTM 预测 IBD 发作
"""
import torch
import torch.nn as nn
import numpy as np
import pandas as pd
from torch.utils.data import Dataset, DataLoader
# 1. 加载纵向数据
# 每个受试者有多个时间点的微生物组样本
lonevent-blocked= pd.read_csv(''''''''''''''''ihmp_ibd_longitudinal.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''')
# 列:subject_id, timepoint, species_1, ..., species_N, flare_next_visit
# 2. 构建时序数据集
class MicrobiomeTimeSeriesDataset(Dataset):
def __init__(self, data, seq_length=4, n_features=100):
self.data = data
self.seq_length = seq_length
self.n_features = n_features
self.subjects = data[''''''''''''''''subject_id''''''''''''''''].unique()
def __len__(self):
return len(self.subjects)
def __getitem__(self, idx):
subject = self.subjects[idx]
subject_data = self.data[self.data[''''''''''''''''subject_id''''''''''''''''] == subject].sort_values(''''''''''''''''timepoint'''''''''''''''')
# 取前 seq_length 个时间点的物种丰度
features = subject_data.iloc[:self.seq_length, 2:2+self.n_features].values
# 标签:下一次访视是否发作
label = subject_data.iloc[self.seq_length, -1] if len(subject_data) > self.seq_length else 0
return torch.FloatTensor(features), torch.LongTensor([label])
# 3. LSTM 模型
class MicrobiomeLSTM(nn.Module):
def __init__(self, input_dim, hidden_dim=64, num_layers=2, output_dim=2):
super().__init__()
self.lstm = nn.LSTM(input_dim, hidden_dim, num_layers, batch_first=True, dropout=0.3)
self.fc = nn.Linear(hidden_dim, output_dim)
self.dropout = nn.Dropout(0.3)
def forward(self, x):
lstm_out, _ = self.lstm(x)
last_output = lstm_out[:, -1, :]
output = self.fc(self.dropout(last_output))
return output
# 4. 训练
dataset = MicrobiomeTimeSeriesDataset(longitudinal_data, seq_length=4, n_features=100)
dataloader = DataLoader(dataset, batch_size=16, shuffle=True)
model = MicrobiomeLSTM(input_dim=100, hidden_dim=64)
criterion = nn.CrossEntropyLoss()
optimizer = torch.optim.Adam(model.parameters(), lr=0.001)
n_epochs = 50
for epoch in range(n_epochs):
model.train()
total_loss = 0
for features, labels in dataloader:
optimizer.zero_grad()
outputs = model(features)
loss = criterion(outputs, labels.squeeze())
loss.backward()
optimizer.step()
total_loss += loss.item()
if (epoch + 1) % 10 == 0:
print(f"Epoch {epoch+1}/{n_epochs}, Loss: {total_loss/len(dataloader):.4f}")
print("IBD 发作预测模型训练完成")
</details>
§6.7 早产风险预测模型
<details>
<summary>👶 MOMS-PI 早产风险分类(点击展开)</summary>
"""
基于 iHMP MOMS-PI 阴道微生物组数据的早产风险预测
"""
import pandas as pd
import numpy as np
from sklearn.model_selection import StratifiedKFold
from sklearn.ensemble import GradientBoostingClassifier
from sklearn.linear_model import LogisticRegression
from sklearn.svm import SVC
from sklearn.metrics import roc_auc_score, precision_recall_curve, average_precision_score
import json
# 1. 加载 MOMS-PI 阴道微生物组数据
with open(''''''''''''''''momspi_metadata.json'''''''''''''''') as f:
metadata = json.load(f)
vaginal_profile = pd.read_csv(''''''''''''''''momspi_vaginal_metaphlan.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''', index_col=0).T
labels = pd.read_csv(''''''''''''''''momspi_outcomes.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''') # subject_id, preterm (0/1)
# 2. 合并特征与标签
data = vaginal_profile.merge(labels, left_index=True, right_on=''''''''''''''''subject_id'''''''''''''''')
# 3. 特征工程
# 添加生态学特征
data[''''''''''''''''shannon_diversity''''''''''''''''] = -(data.iloc[:, 1:-2] * np.log(data.iloc[:, 1:-2] + 1e-10)).sum(axis=1)
data[''''''''''''''''lactobacillus_ratio''''''''''''''''] = data.filter(like=''''''''''''''''Lactobacillus'''''''''''''''').sum(axis=1)
data[''''''''''''''''gardnerella_ratio''''''''''''''''] = data.filter(like=''''''''''''''''Gardnerella'''''''''''''''').sum(axis=1)
# 关键物种(文献报道)
key_species = [
''''''''''''''''Lactobacillus_crispatus'''''''''''''''', # 保护性
''''''''''''''''Lactobacillus_iners'''''''''''''''', # 中性/风险
''''''''''''''''Gardnerella_vaginalis'''''''''''''''', # BV 标志
''''''''''''''''BVAB1'''''''''''''''', # 早产正相关
''''''''''''''''Prevotella_cluster2'''''''''''''''',
''''''''''''''''Sneathia_amnii'''''''''''''''',
''''''''''''''''TM7-H1''''''''''''''''
]
# 4. 多模型比较
X = data[key_species + [''''''''''''''''shannon_diversity'''''''''''''''', ''''''''''''''''lactobacillus_ratio'''''''''''''''']]
y = data[''''''''''''''''preterm''''''''''''''''].values
models = {
''''''''''''''''Logistic Regression'''''''''''''''': LogisticRegression(max_iter=1000, class_weight=''''''''''''''''balanced''''''''''''''''),
''''''''''''''''Gradient Boosting'''''''''''''''': GradientBoostingClassifier(n_estimators=200, max_depth=3),
''''''''''''''''SVM (RBF)'''''''''''''''': SVC(kernel=''''''''''''''''rbf'''''''''''''''', class_weight=''''''''''''''''balanced'''''''''''''''', probability=True)
}
skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)
for name, model in models.items():
aucs = []
for train_idx, test_idx in skf.split(X, y):
X_train, X_test = X.iloc[train_idx], X.iloc[test_idx]
y_train, y_test = y[train_idx], y[test_idx]
model.fit(X_train, y_train)
y_prob = model.predict_proba(X_test)[:, 1]
aucs.append(roc_auc_score(y_test, y_prob))
print(f"{name}: AUC = {np.mean(aucs):.3f} ± {np.std(aucs):.3f}")
# 5. 特征重要性(最优模型)
best_model = GradientBoostingClassifier(n_estimators=200, max_depth=3)
best_model.fit(X, y)
importance = pd.DataFrame({
''''''''''''''''feature'''''''''''''''': X.columns,
''''''''''''''''importance'''''''''''''''': best_model.feature_importances_
}).sort_values(''''''''''''''''importance'''''''''''''''', ascending=False)
print("\n早产风险关键特征:")
print(importance)
</details>
§6.8 计算资源需求
| 任务 |
CPU |
内存 |
存储 |
GPU |
预计时间 |
| 16S 分析(QIIME2,1000 样本) |
8 核 |
32 GB |
100 GB |
无 |
4-8 小时 |
| WGS 宏基因组(MetaPhlAn,100 样本) |
16 核 |
64 GB |
500 GB |
无 |
12-24 小时 |
| WGS 功能注释(HUMAnN,100 样本) |
16 核 |
64 GB |
1 TB |
无 |
24-48 小时 |
| 参考基因组下载 |
1 核 |
4 GB |
100 GB |
无 |
2-4 小时 |
| 随机森林分类(10K 物种 × 1K 样本) |
8 核 |
32 GB |
50 GB |
无 |
30 分钟 |
| LSTM 纵向建模(100 受试者 × 5 时点) |
4 核 |
16 GB |
10 GB |
可选 |
1-2 小时 |
| 多组学融合模型 |
8 核 |
32 GB |
100 GB |
可选 |
2-4 小时 |
| 大规模 AWS 批量下载(10 TB) |
4 核 |
8 GB |
10 TB |
无 |
12-48 小时 |
| 宏基因组组装(IDBA-UD,单样本) |
32 核 |
128 GB |
200 GB |
无 |
6-12 小时 |
| StrainPhlAn 菌株分析(100 样本) |
8 核 |
32 GB |
50 GB |
无 |
4-8 小时 |
§6.9 已知坑点与解决方案
| 坑点 |
影响 |
解决方案 |
| 454 平台数据兼容性 |
454 FLX 已停产,现代管线多为 Illumina 设计 |
使用 QIIME2 的 denoise-pyro 方法,或转换为 FASTQ 后用 DADA2 |
| 16S 可变区不一致 |
HMP 使用 V1V3/V3V5/V6V9 三个区域,不同区域分类结果差异大 |
仅在同一可变区内比较;或使用统一 V4 引物重新测序 |
| 批次效应 |
四个测序中心数据存在系统性差异 |
使用 ComBat / MMUPHin 校正批次效应 |
| 人群代表性偏倚 |
85% 受试者为自报白人,缺乏全球代表性 |
明确标注适用人群限制;结合 MetaHIT/AGP 扩展人群覆盖 |
| 受控访问数据 |
宿主基因组与临床元数据需 dbGaP 审批(2-4 周) |
提前规划;先用开放数据构建模型框架 |
| 组成型数据偏差 |
微生物丰度为相对值(总和=1),直接使用导致虚假相关 |
使用 CLR 变换或 ALDEx2 处理组成型数据 |
| 零膨胀问题 |
微生物丰度矩阵极度稀疏(>90% 零值) |
使用零膨胀模型或 CLR + 伪计数 |
| 纵向数据不平衡 |
不同受试者采样次数不同(1-3 次) |
使用可变长度序列模型或对齐时间窗口 |
| 宿主序列污染 |
WGS 数据含大量人类宿主 reads |
必须使用 BMTagger/Bowtie2 去除人类序列 |
| OTU vs ASV 转换 |
HMP 原始分析使用 OTU(97%),现代趋势为 ASV(100%) |
重新用 DADA2 从原始 reads 生成 ASV |
| 物种命名变更 |
微生物分类学不断更新,旧名称可能已废弃 |
使用 GTDB 或 NCBI Taxonomy 进行命名同步 |
| 跨平台丰度不可比 |
16S 与 WGS 丰度估计原理不同 |
跨平台比较时使用属以上分类水平 |
§7 质量评估与局限性
§7.1 已知偏倚
| 偏倚类型 |
描述 |
影响程度 |
缓解措施 |
| 人群偏倚 |
85% 受试者为自报白人,美国居民 |
高 |
扩展非欧美队列;标注适用人群限制 |
| 技术平台偏倚 |
16S 使用 454 FLX(已停产),WGS 使用早期 Illumina |
高 |
使用平台校正模型;转换为 ASV |
| 采样时间偏倚 |
HMP1 仅 1-3 次横断面采样 |
中 |
使用 HMP1-II 和 iHMP 纵向数据补充 |
| 部位覆盖偏倚 |
18 个部位采样深度不均(肠道/口腔样本多,皮肤/阴道少) |
中 |
按部位分层建模 |
| 健康定义偏倚 |
"健康"标准为自报 + BMI 筛选,可能漏排亚临床疾病 |
中 |
使用更严格的健康定义验证 |
| 饮食未记录 |
HMP1 未系统性记录饮食信息 |
高 |
结合 American Gut 等含饮食数据的队列 |
| 抗生素使用未控 |
采样前抗生素使用信息不完整 |
中 |
筛选自报告无近期抗生素使用样本 |
| 存储条件不统一 |
多中心采样,样本存储条件可能存在差异 |
低 |
统一冻存协议 |
| 生物信息学管线迭代 |
原始管线(2012 年)与现代工具差异大 |
中 |
使用现代工具(QIIME2 / MetaPhlAn 4)重新分析 |
| 参考基因组不完整 |
2,000+ 参考基因组覆盖人体微生物的一小部分 |
高 |
补充 GTDB/UMGS 等未培养基因组数据库 |
| 跨组学时间不对齐 |
多组学采样时间点可能不完全一致 |
中 |
使用时间窗口匹配 |
| 疾病队列规模有限 |
iHMP 三队列各 ~100-150 人,统计功效有限 |
高 |
跨队列验证;使用迁移学习 |
§7.2 QC 指标
| 指标 |
标准 |
HMP 达标情况 |
| 16S 测序误差率 |
<0.02% |
✅ Mock Community 标定后达到 |
| 嵌合体去除 |
ChimeraSlayer |
✅ 管线标准步骤 |
| 人类序列去污染 |
BMTagger |
✅ WGS 数据处理 |
| 技术重复 |
252 个 |
✅ HMP1-II 含技术重复 |
| Mock Community 验证 |
21 种已知菌 |
✅ 用于管线验证 |
| 参考基因组完成度 |
HQ Draft / Improved / Finished |
✅ ~85% HQ Draft, ~15% Improved+ |
| 元数据合规 |
MIGS 标准 |
✅ 符合 GSC 规范 |
| 数据公开 |
DACC + NCBI + AWS |
✅ 三渠道公开 |
| 受控数据保护 |
dbGaP 审批 |
✅ 严格分层访问 |
| 可重复性 |
管线文档化 |
✅ DACC 提供完整协议 |
§7.3 外部验证
| 验证方式 |
数据来源 |
验证内容 |
| 独立队列验证 |
MetaHIT / American Gut |
物种分类一致性 |
| 工具间一致性 |
QIIME2 vs Mothur |
16S 分析结果可重复性 |
| 平台间一致性 |
454 vs Illumina 16S |
跨平台分类结果比较 |
| 参考数据库验证 |
Greengunes vs SILVA vs GTDB |
分类结果数据库依赖性 |
| 临床验证 |
IBDMDB 临床结局 |
IBD 发作预测准确性 |
§7.4 DAIMS 24 项数据就绪度评估
| DAIMS 维度 |
评估项 |
HMP 达标 |
说明 |
| 动机 |
1. 数据集创建目的 |
✅ |
明确:健康人体微生物组基线表征 |
|
2. 资金来源 |
✅ |
NIH Common Fund |
|
3. 创建者组成 |
✅ |
四个测序中心 + DACC |
| 组成 |
4. 实例数量 |
✅ |
11,174 标本 + 2,355 宏基因组 |
|
5. 数据模态 |
✅ |
16S + WGS + 多组学 |
|
6. 标注来源 |
✅ |
统一 DACC 管线 + RDP 分类器 |
|
7. 标注质量 |
✅ |
Mock Community 验证 |
| 收集 |
8. 采样协议 |
✅ |
HMP Core Sampling Protocol A |
|
9. 纳入/排除标准 |
✅ |
18-40 岁、BMI 筛选、系统性健康筛查 |
|
10. 知情同意 |
✅ |
IRB 批准 + 书面知情同意 |
| 预处理 |
11. 原始数据处理 |
✅ |
统一 DACC 管线 |
|
12. 质控标准 |
✅ |
Mock Community + 嵌合体去除 |
|
13. 去污染方法 |
✅ |
BMTagger 人类序列去除 |
| 分布 |
14. 访问方式 |
✅ |
DACC + AWS + NCBI + dbGaP |
|
15. 许可证 |
✅ |
CC0 / 公共领域 |
|
16. 数据格式 |
✅ |
FASTQ / FASTA / BIOM / TSV |
| 维护 |
17. 更新频率 |
⚠️ |
项目已过渡,数据不再主动更新(2019 最后更新) |
|
18. 错误修正机制 |
✅ |
DACC 门户支持反馈 |
| 伦理 |
19. 隐私保护 |
✅ |
脱敏 + dbGaP 受控访问 |
|
20. IRB 批准 |
✅ |
多 IRB 批准 |
|
21. 数据使用限制 |
✅ |
开放数据无限制,受控数据需 DUC |
| 使用 |
22. 已知用途 |
✅ |
650+ 篇论文覆盖多种用途 |
|
23. 已知误用风险 |
✅ |
人群代表性限制已明确 |
|
24. 引用建议 |
✅ |
Nature 2012 + Nature 2019 |
DAIMS 总评:23/24 项达标(95.8%),AI 就绪度 5/5 ⭐⭐⭐⭐⭐
(唯一扣分项:项目已过渡,数据不再主动更新,但历史数据质量与可用性不受影响)
§8 基准性能与生态
§8.1 微生物组 AI 基准任务
| 任务 |
数据来源 |
最优方法 |
性能指标 |
基准参考 |
| 16S 物种分类 |
HMP1 16S |
RDP Classifier + DADA2 ASV |
F1 = 0.95(属级) |
Werner et al. 2012 |
| IBD vs 健康分类 |
iHMP IBDMDB + HMP1 |
随机森林(菌株级丰度) |
AUC > 0.90 |
Gastroenterology 2025 |
| IBD 发作预测 |
iHMP IBDMDB 纵向 |
LSTM + 多组学 |
AUC = 0.75 |
Lloyd-Price et al. 2019 |
| 早产风险预测 |
MOMS-PI 阴道微生物组 |
机器学习 + 关键物种 |
AUC = 0.65-0.70 |
Fettweis et al. 2019 |
| T2D 风险预测 |
IPOP 多组学 |
个性化分子签名 |
个体化 AUC 变异大 |
Zhou et al. 2019 |
| 微生物组迁移学习 |
HMP → CRC / T2D |
迁移学习 + 微调 |
AUROC 提升 5-15% |
多篇 |
| 宏基因组功能预测 |
HMP WGS + 参考基因组 |
HUMAnN 3 + MetaPhlAn 4 |
通路覆盖 >80% |
Franzosa et al. 2018 |
| 菌株水平追踪 |
HMP1-II 纵向 |
StrainPhlAn 4 |
菌株识别准确率 >85% |
Truong et al. 2017 |
§8.2 关键论文 Top 10
| 排名 |
论文 |
期刊 |
年份 |
引用 |
核心贡献 |
| 1 |
Structure, function and diversity of the healthy human microbiome |
Nature |
2012 |
15,000+ |
HMP1 核心成果 |
| 2 |
A framework for human microbiome research |
Nature |
2012 |
8,000+ |
HMP 标准化框架 |
| 3 |
The Integrative Human Microbiome Project |
Nature |
2019 |
3,000+ |
iHMP 完成总结 |
| 4 |
Strains, functions and dynamics in the expanded HMP |
Nature |
2017 |
2,500+ |
HMP1-II 菌株水平分析 |
| 5 |
A catalog of reference genomes from the human microbiome |
Science |
2010 |
2,000+ |
首批参考基因组目录 |
| 6 |
The vaginal microbiome and preterm birth |
Nature Medicine |
2019 |
1,000+ |
MOMS-PI 早产研究 |
| 7 |
Multi-omics of the gut microbial ecosystem in IBD |
Nature |
2019 |
1,500+ |
IBDMDB 多组学 |
| 8 |
QIIME allows analysis of high-throughput community sequencing data |
Nature Methods |
2010 |
25,000+ |
QIIME 工具发布 |
| 9 |
Metagenomic microbial community profiling using unique clade-specific marker genes |
Nature Methods |
2012 |
7,000+ |
MetaPhlAn 发布 |
| 10 |
Predictive functional profiling of microbial communities using 16S rRNA marker gene sequences |
Nature Biotechnology |
2013 |
6,000+ |
PICRUSt 功能预测 |
§8.3 HMP 在 AI 生态中的角色
| 生态层级 |
角色 |
具体应用 |
| 参考基线 |
全球健康微生物组标准 |
所有微生物组研究的健康对照基线 |
| 训练数据 |
微生物组 AI 模型训练 |
16S 分类器、功能预测模型 |
| 验证基准 |
疾病预测模型验证 |
IBD/早产/T2D 生物标志物验证 |
| 迁移源 |
预训练模型迁移 |
HMP 预训练 → 疾病队列微调 |
| 工具孵化器 |
核心工具生态 |
QIIME2 / MetaPhlAn / HUMAnN 均由 HMP 资助 |
| 标准制定者 |
微生物组研究规范 |
采样协议、元数据标准、QC 标准 |
| 社区中枢 |
数据共享范式 |
DACC 模式被后续项目(iHMP、HMP3)沿用 |
§8.4 真实世界影响案例
| 案例 |
描述 |
影响 |
| 粪菌移植标准化 |
HMP 数据为粪菌移植供体筛选提供微生物组参考 |
FDA 粪菌移植指南参考 |
| IBD 生物标志物 |
IBDMDB 发现的微生物标志物进入临床试验 |
IBD 诊断试剂盒开发 |
| 早产风险评估 |
MOMS-PI 发现 BVAB1 等早产相关微生物 |
阴道微生物组检测产品 |
| COVID-19 肠道微生物组 |
HMP 数据作为 COVID-19 肠道微生物组研究健康对照 |
30+ 篇 COVID-19 微生物组论文 |
| 肠脑轴研究 |
HMP 肠道数据作为自闭症/抑郁症研究参考 |
微生物组-肠-脑轴机制论文 |
| 免疫治疗响应预测 |
基于 HMP 参考基因组的菌株分析预测免疫治疗响应 |
Nature Medicine 2024 |
| CRC 筛查 |
HMP 数据作为健康对照,训练 CRC 微生物组分类器 |
早期 CRC 无创筛查 |
| 益生菌开发 |
HMP 参考基因组帮助识别潜在益生菌菌株 |
多株益生菌进入临床试验 |
| 抗生素影响评估 |
HMP 健康基线用于评估抗生素对微生物组的影响 |
抗生素使用指南优化 |
§8.5 生态快照
微生物组数据生态图
┌─────────────────┐
│ 健康参考基线 │
│ HMP (NIH) │
└───────┬─────────┘
│
┌───────────────┼───────────────┐
│ │ │
┌───────▼───────┐ ┌────▼────┐ ┌────────▼────────┐
│ 疾病队列 │ │ 工具生态 │ │ 整合数据库 │
│ iHMP (3队列) │ │ QIIME2 │ │ GMrepo │
│ MetaHIT │ │ MetaPhlAn│ │ curatedMetagenomic│
│ American Gut │ │ HUMAnN │ │ MGnify │
│ TEDDY │ │ Mothur │ │ │
└───────┬───────┘ └────┬────┘ └────────┬────────┘
│ │ │
└───────────────┼───────────────┘
│
┌───────▼─────────┐
│ AI 应用层 │
│ 疾病预测 │
│ 生物标志物挖掘 │
│ 微生物组疗法 │
│ 个性化营养 │
└─────────────────┘
§8.6 HMP vs 后续微生物组项目
| 项目 |
时间 |
规模 |
独特定位 |
与 HMP 关系 |
| HMP1 |
2008-2012 |
300 健康成人 |
全身 18 部位基线 |
— |
| HMP1-II |
2014-2017 |
2,355 宏基因组 |
菌株水平 + 纵向 |
HMP1 扩展 |
| iHMP |
2014-2019 |
1,765 疾病队列 |
三疾病多组学纵向 |
HMP 第二阶段 |
| American Gut |
2012- |
15,096 参与者 |
公民科学 + 饮食 |
使用 HMP 为参考 |
| Earth Microbiome Project |
2010-2018 |
27,751 样本 |
全球环境微生物组 |
互补(非人体) |
| MGnify |
2016- |
持续增长 |
EBI 维护的微生物组数据库 |
整合 HMP 数据 |
| GMrepo |
2020- |
58,902 样本 |
整合多疾病肠道数据 |
包含 HMP 子集 |
§8.7 微生物组 AI 模型演进
| 时代 |
代表模型 |
训练数据 |
核心创新 |
局限性 |
| 传统 ML(2012-2018) |
随机森林 / SVM |
HMP 16S OTU 表 |
物种丰度 → 疾病分类 |
依赖手工特征工程 |
| 深度学习(2018-2022) |
LSTM / CNN |
iHMP 纵向多组学 |
时序建模 + 多组学融合 |
需要大样本量 |
| 迁移学习(2020-2024) |
HMP 预训练 + 微调 |
HMP → 疾病队列 |
利用健康基线迁移知识 |
跨人群泛化有限 |
| 基础模型(2024-) |
Genos-m / 微生物组 LLM |
14 个肠道宏基因组队列 |
序列级微生物基因组表征 |
计算资源需求高 |
§9 相关资源与引用
§9.1 参考文献(BibTeX)
@article{hmp2012structure,
title={Structure, function and diversity of the healthy human microbiome},
author={{Human Microbiome Project Consortium}},
journal={Nature},
volume={486},
number={7402},
pages={207214},
year={2012},
doi={10.1038/nature11234}
}
@article{hmp2012framework,
title={A framework for human microbiome research},
author={{Human Microbiome Project Consortium}},
journal={Nature},
volume={486},
number={7402},
pages={215221},
year={2012},
doi={10.1038/nature11209}
}
@article{ihmp2019,
title={The Integrative Human Microbiome Project},
author={{Integrative HMP Research Network Consortium}},
journal={Nature},
volume={569},
number={7758},
pages={641648},
year={2019},
doi={10.1038/s41586-019-1238-8}
}
@article{lloydprice2017strains,
title={Strains, functions and dynamics in the expanded Human Microbiome Project},
author={Lloyd-Price, Jason and Mahurkar, Abhinav and Rahnavard, Gholamali and Crabtree, Jonathan and Orvis, Joshua and Hall, Arthur B and Brady, Ashley and Creswell, Heather H and McCracken, v and Gibbons, Sean M and others},
journal={Nature},
volume={550},
number={7674},
pages={6166},
year={2017},
doi={10.1038/nature23889}
}
@article{fettweis2019vaginal,
title={The vaginal microbiome and preterm birth},
author={Fettweis, Jennifer M and Serrano, Myrna G and Brooks, Jennifer P and Edwards, David J and Girerd, Philippe H and Parhi, Harinder S and Huang, Baojiang and Arodz, Timothy J and Edupuganti, Lakshmi and Glascock, Asfaw and others},
journal={Nature Medicine},
volume={25},
number={6},
pages={10121021},
year={2019},
doi={10.1038/s41591-019-0450-2}
}
@article{lloydprice2019multiomics,
title={Multi-omics of the gut microbial ecosystem in inflammatory bowel diseases},
author={Lloyd-Price, Jason and Arze, Cesar and Ananthakrishnan, Ashwin N and Schirmer, Melanie and Avila-Pacheco, Julian and Poon, Tiffany W and Andrews, Elizabeth and Ajami, Nadim J and Bonham, Kelsey S and Brislawn, Christopher J and others},
journal={Nature},
volume={569},
number={7758},
pages={655662},
year={2019},
doi={10.1038/s41586-019-1237-9}
}
@article{jumpstart2010catalog,
title={A catalog of reference genomes from the human microbiome},
author={{Human Microbiome Jumpstart Reference Strains Consortium}},
journal={Science},
volume={328},
number={5981},
pages={994999},
year={2010},
doi={10.1126/science.1183605}
}
@article{caporaso2010qiime,
title={QIIME allows analysis of high-throughput community sequencing data},
author={Caporaso, J Gregory and Kuczynski, Justin and Stombaugh, Jesse and Bittinger, Kyle and Bushman, Frederic D and Costello, Elizabeth K and Fierer, Noah and Pe\~na, Antonio Gonzalez and Goodrich, Julia K and Gordon, Jeffrey I and others},
journal={Nature Methods},
volume={7},
number={5},
pages={335336},
year={2010},
doi={10.1038/nmeth.f.303}
}
@article{truong2015metaphlan,
title={MetaPhlAn2 for enhanced metagenomic taxonomic profiling},
author={Truong, Duy Tin and Franzosa, Eric A and Tickle, Timothy L and Scholz, Matthew and Weingart, George and Pasolli, Nicola and Tett, Adrian and Huttenhower, Curtis and Segata, Nicola},
journal={Nature Methods},
volume={12},
number={10},
pages={902903},
year={2015},
doi={10.1038/nmeth.3589}
}
@article{franzosa2018species,
title={Species-level functional profiling of metagenomes and metatranscriptomes},
author={Franzosa, Eric A and McIver, Lauren J and Rahnavard, Gholamali and Thompson, Luke R and Schirmer, Melanie and Weingart, George and Lipson, Karen Schwarzberg and Knight, Rob and Caporaso, J Gregory and Segata, Nicola and Huttenhower, Curtis},
journal={Nature Methods},
volume={15},
number={11},
pages={962968},
year={2018},
doi={10.1038/s41592-018-0176-y}
}
§9.2 资源 URL
§10 AI 使用声明卡
| 声明项 |
内容 |
| 数据集用途 |
微生物组研究、疾病生物标志物挖掘、宿主-微生物互作建模、微生物组 AI 训练 |
| 适用人群 |
生物信息学家、微生物组研究者、AI/ML 工程师、临床微生物学家 |
| 使用限制 |
开放数据无使用限制(CC0);受控数据须遵守 dbGaP Data Use Certification |
| 引用要求 |
使用时须引用 Nature 2012(HMP1)和/或 Nature 2019(iHMP) |
| 数据更新状态 |
项目已于 2017 年从 Common Fund 过渡,数据不再主动更新但持续可用 |
| 人群适用性 |
主要基于美国白人健康成人队列,全球人群适用性有限 |
| 技术平台说明 |
16S 数据使用 Roche 454 FLX(已停产),分析时需注意平台兼容性 |
| 临床决策限制 |
本数据集不直接用于临床诊断,仅作为研究参考基线 |
| AI 模型透明度 |
基于 HMP 训练的 AI 模型须报告训练数据的人群构成与技术平台 |
| 版本标识 |
本页面基于 HMP1(2012)+ HMP1-II(2017)+ iHMP(2019)数据编写 |
页面状态:published
| 校验项 |
字段 |
状态 |
说明 |
| 1 |
@context 多命名空间 |
✅ |
schema.org + cr + rai + dct |
| 2 |
@graph 结构 |
✅ |
MedicalWebPage + Dataset 两节点 |
| 3 |
MedicalWebPage @id |
✅ |
…#webpage |
| 4 |
MedicalWebPage name |
✅ |
“HMP — 人类微生物组计划 AI-Ready Wikipedia” |
| 5 |
MedicalWebPage url |
✅ |
https://qianfanghub.com/ai-ready-dataset/hmp/44 |
| 6 |
MedicalWebPage lastReviewed |
✅ |
2026-08-04 |
| 7 |
MedicalWebPage reviewedBy |
✅ |
千方病案医学编辑部 |
| 8 |
MedicalWebPage mainEntity |
✅ |
指向 #dataset |
| 9 |
Dataset @id |
✅ |
…#dataset |
| 10 |
Dataset name |
✅ |
Human Microbiome Project (HMP) |
| 11 |
Dataset creator |
✅ |
NIH Common Fund HMP Consortium |
| 12 |
Dataset dateCreated |
✅ |
2008-10 |
| 13 |
Dataset dateModified |
✅ |
2019-05 |
| 14 |
Dataset keywords |
✅ |
中英双语 |
| 15 |
Dataset license |
✅ |
CC0 |
| 16 |
Dataset isAccessibleForFree |
✅ |
true |
| 17 |
Dataset measurementTechnique |
✅ |
6 种测序方法 |
| 18 |
Dataset temporalCoverage |
✅ |
2008-2016 |
| 19 |
Dataset spatialCoverage |
✅ |
United States |
| 20 |
Dataset distribution |
✅ |
3 个 DataDownload |
| 21 |
Dataset sameAs |
✅ |
DOI 10.1038/nature11234 |
| 22 |
Dataset conformsTo |
✅ |
Croissant 1.1 |
| 23 |
cr:recordSet |
✅ |
4 个 RecordSet |
| 24 |
rai:dataLimitations |
✅ |
人群偏倚 + 平台过时 |
| 25 |
rai:dataBiases |
✅ |
4 项偏倚声明 |
| 26 |
rai:useCases |
✅ |
7 项用例 |
| 27 |
rai:personalSensitiveInformation |
✅ |
dbGaP 受控访问 |
| 28 |
rai:dataCollection |
✅ |
采样协议描述 |
| 29 |
rai:annotatorDemographics |
✅ |
DACC 统一管线 |
| 30 |
rai:machineAnnotationTools |
✅ |
8 个工具 |
| 31 |
URL slug/id |
✅ |
hmp/44 |
| 32 |
单一 JSON-LD 块 |
✅ |
一个 <script> 块 |
| 33 |
无独立 Croissant 块 |
✅ |
并入 Dataset 节点 |