HMP

HMP 人类微生物组计划 | 千方病案医数集

来源 NIH Common Fund | https://commonfund.nih.gov/hmp发布时间: 2026-08-04最后更新: 2026-08-04 阅读 2

信息速览

数据集名称HMP
数据类型约 42 TB 大小, 11174+ 样本, 2000+ 参考基因组
规模300+ 健康成人 + 1,500+ 疾病队列
接入方式NIH Common Fund | https://commonfund.nih.gov/hmp
AI 就绪度

INFOBOX

数据集名称 HMP(Human Microbiome Project)
英文全称 Human Microbiome Project
别名 / 简称 HMP、HMP1、HMP1-II、iHMP、HMP2、NIH HMP
疾病分类 多疾病覆盖。核心映射:DD80–DD8Z 炎症性肠病 / KA20–KA2Z 妊娠相关并发症 / 5A10–5A1Z 糖尿病前期 / 1A00–1A0Z 某些感染性疾病 / DA0C 口腔疾病
SNOMED CT 24526004 Inflammatory bowel disease / 288380006 Premature labor / 31321000119102 Prediabetes / 235058003 Bacterial infection / 87172008 Bacterial vaginosis
数据模态 基因组(16S rRNA / WGS 宏基因组 / 参考基因组)+ 多组学(宏转录组 / 蛋白质组 / 代谢组 / 宿主转录组)
AI 任务类型 分类(物种分类)、回归(丰度预测)、聚类(社区分型)、生存分析(疾病预测)、多模态融合、纵向时序建模
样本总数 HMP1:11,174 原始标本(300 名健康成人,18 个身体部位);HMP1-II:2,355 宏基因组样本(265 个体);iHMP:1,527 名孕妇 + 132 名 IBD + 106 名前驱糖尿病受试者
数据大小 ~42 TB(HMP1 + HMP2 全部多组学数据)
数据格式 FASTQ / FASTA / SFF / BAM / TSV / CSV / HDF5 / BIOM
许可证 公共领域 / CC0(大部分数据);NIH Data Use Certification(dbGaP 受控访问数据)
访问级别 开放(AWS / DACC 门户 / NCBI SRA);注册后开放(dbGaP 受控访问,审批 2-4 周)
DUO 标签 NRES(开放数据), IRB(受控访问数据)
语言 英文(元数据与临床信息)
首发日期 2008-10(HMP 项目启动)
最后更新 2019-05(iHMP 完成成果发表于 Nature)
发布机构 NIH Common Fund Human Microbiome Project Consortium
官方主页 https://commonfund.nih.gov/hmp
下载地址 https://portal.hmpdacc.org/ (DACC 门户)/ s3://human-microbiome-project/ (AWS)/ https://www.ncbi.nlm.nih.gov/bioproject/PRJNA28331 (NCBI)
DOI 10.1038/nature11234
引用次数 15,000+(Google Scholar,截至 2026-07)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 丰富的多组学数据 + 标准化处理管线 + 大规模参考基因组;扣分项:16S 平台已过时、人群多样性不足、缺少标准化 AI train/test 划分
页面状态 published

§0 E-E-A-T 信任声明与免责声明

字段编号 字段名 内容
0.1 医学审核者 { name: "千方病案医学编辑部", method: "交叉审核", scope: "§2 微生物学背景、§7 偏倚分析" }
0.2 数据工程审核者 { name: "千方病案医学编辑部", method: "交叉审核", scope: "§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点" }
0.3 审核日期 2026-08-04
0.4 审核方式 交叉审核
0.5 免责声明 本页面仅为 HMP 数据集的技术文档与 AI 就绪度分析,不构成任何医学诊断或治疗建议。微生物组数据的临床解读须由具备资质的临床微生物学家或胃肠病学专家进行。HMP 数据中的"健康"参考队列不代表全球人群的微生物组基线,使用时须注意人群代表性偏倚。
0.6 利益冲突声明 本页面与 NIH 及 HMP 联盟无利益关联。

权威论文溯源:

序号 论文 期刊 年份 核心贡献
1 The Human Microbiome Jumpstart Reference Strains Consortium. A catalog of reference genomes from the human microbiome Science 2010 首批 178 个微生物参考基因组目录
2 Human Microbiome Project Consortium. Structure, function and diversity of the healthy human microbiome Nature 2012 HMP1 核心成果:300 名健康成人微生物组基线图谱
3 Human Microbiome Project Consortium. A framework for human microbiome research Nature 2012 HMP 研究框架:采样协议、数据处理管线、标准化方法
4 Lozupone C et al. Meta-analysis of the gut microbiota of healthy adults Nature 2013 基于 HMP 数据的肠道微生物组元分析
5 Lloyd-Price J et al. Strains, functions and dynamics in the expanded Human Microbiome Project Nature 2017 HMP1-II 扩展:2,355 宏基因组样本菌株水平分析
6 The Integrative HMP Research Network Consortium. The Integrative Human Microbiome Project Nature 2019 iHMP 完成:三疾病队列多组学纵向研究
7 Fettweis JM et al. The vaginal microbiome and preterm birth Nature Medicine 2019 MOMS-PI:阴道微生物组与早产风险
8 Lloyd-Price J et al. Multi-omics of the gut microbial ecosystem in inflammatory bowel diseases Nature 2019 IBDMDB:IBD 肠道微生物组多组学

§1 数据集概览

§1.0 30 秒速览

HMP(Human Microbiome Project) 是美国国立卫生研究院(NIH)Common Fund 主导的十年级大型科研项目(2007-2016),旨在全面表征人体各部位共生微生物群的组成、功能和动态。项目分两个阶段:HMP1(2008-2012)对 300 名健康成人在 18 个身体部位进行了 16S rRNA 基因测序和全宏基因组鸟枪法测序,建立了全球最大的健康人体微生物组参考基线;iHMP(2014-2019)针对炎症性肠病(IBD)、妊娠与早产、前驱糖尿病三个疾病队列开展了纵向多组学(宏基因组 + 宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组)研究。总计产出约 42 TB 多组学数据、2,000+ 微生物参考基因组,是微生物组 AI 研究、脑肠轴机制挖掘和微生物靶向疗法开发的基础参考数据集

§1.1 战略价值

维度 评估
数据规模 ~42 TB 多组学数据,涵盖 16S + WGS + 宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组六种组学类型
人群覆盖 300 名健康成人(HMP1)+ 1,765 名疾病队列受试者(iHMP),5 大身体区域 18 个采样部位
参考价值 全球最大的健康人体微生物组基线参考图谱 + 2,000+ 参考基因组,是所有微生物组研究的比对标杆
AI 就绪度 ⭐⭐⭐⭐(4/5)—— 数据开放、格式标准、工具生态成熟(QIIME2 / MetaPhlAn / HUMAnN),但 16S 平台过时、缺少标准化 AI 划分
独特性 唯一同时覆盖全身 5 大区域 18 个部位的微生物组参考数据集;唯一同时包含细菌、真菌、病毒、原生生物四大微生物界的完整调查
许可证 公共领域 / CC0(开放数据部分完全免费无限制),部分受控访问数据需 dbGaP 审批
生态影响 650+ 篇论文、70,000+ 引用(截至 2017);催生 QIIME、MetaPhlAn、HUMAnN 等核心工具

§1.2 横向对比

维度 HMP Earth Microbiome Project (EMP) MetaHIT American Gut Project GMrepo
人群规模 300 健康成人 + 1,765 疾病队列 27,751 样本 / 10,000+ 研究 124 欧洲人 15,096 参与者 58,902 样本整合
身体部位 18 部位 / 5 大区域 环境样本为主 仅肠道 仅肠道 仅肠道
测序类型 16S + WGS + 多组学 16S 为主 WGS 宏基因组 16S 为主 16S + WGS 整合
时间维度 HMP1 横断面 / HMP2 纵向 横断面 横断面 横断面 横断面
参考基因组 2,000+
疾病队列 IBD / 早产 / 前驱糖尿病 IBD / 肥胖 自报告疾病 整合多疾病
数据量 ~42 TB ~2 TB ~0.5 TB ~1 TB ~5 TB
许可证 CC0 / 公共领域 CC-BY 4.0 受控 CC-BY 4.0 CC0

§1.3 版本演进时间轴

阶段 时间 事件 关键产出
启动 2007 NIH Common Fund 正式启动 HMP 项目规划与资助
Jumpstart 2010-05 首批 178 个参考基因组发表 Science 2010,奠定分类参考基础
HMP1 2012-06 HMP1 核心成果发表于 Nature 300 名健康成人微生物组基线图谱,11,174 原始标本
框架 2012-06 HMP 研究框架论文发表 Nature 2012,标准化采样协议与处理管线
扩展 2014-05 iHMP(HMP2)正式启动 三疾病队列纵向多组学研究启动
HMP1-II 2017-09 扩展数据集发表 2,355 宏基因组样本菌株水平分析
iHMP 完成 2019-05 iHMP 完成成果发表于 Nature 三队列多组学纵向数据发布
MOMS-PI 2019-05 阴道微生物组与早产研究发表 Nature Medicine,597 名孕妇 12,039 样本
IBDMDB 2019-05 IBD 多组学研究发表 Nature,132 名 IBD 患者纵向多组学
项目过渡 2017+ HMP 从 Common Fund 过渡,非 HMP NIH 微生物组研究投入增长 40 倍 数据持续可用,社区维护
平台迁移 2020+ DACC 门户现代化(portal.hmpdacc.org 新版数据门户支持购物车式批量下载
云端开放 2023+ AWS Open Data Registry 上线 HMP 数据集 s3://human-microbiome-project/ 无需账户即可访问

§1.4 AI 应用场景

场景 描述 数据来源
微生物组分类训练 使用 16S rRNA 序列训练深度学习物种分类器 HMP1 16S 数据
疾病生物标志物挖掘 从宏基因组丰度数据中识别疾病相关微生物特征 iHMP 三疾病队列
宏基因组功能注释 基于参考基因组进行代谢通路重建与功能预测 HMP 参考基因组 + WGS 数据
菌株追踪与个性化 分析个体间菌株水平差异及其时间稳定性 HMP1-II 纵向数据
脑肠轴机制研究 将微生物组与宿主免疫/代谢指标关联,建模宿主-微生物互作 iHMP 多组学数据
微生物组动态预测 纵向时序建模,预测微生物群落演替与疾病发作 iHMP IBD / 前驱糖尿病
早产风险预测 基于阴道微生物组特征构建早产风险分类模型 MOMS-PI 队列
跨组学数据融合 多组学整合模型(宏基因组 + 代谢组 + 宿主转录组) iHMP 全组学数据

§2 医学背景

§2.1 ICD-11 疾病映射

ICD-11 编码 疾病名称 与 HMP 的关联
DD80–DD8Z 炎症性肠病(IBD) iHMP IBDMDB 队列:132 名 IBD 患者一年纵向多组学研究
KA20–KA2Z 妊娠相关并发症 iHMP MOMS-PI 队列:1,527 名孕妇阴道微生物组与早产风险
5A10–5A1Z 糖尿病前期 / 2 型糖尿病 iHMP IPOP 队列:106 名受试者 4 年纵向追踪
1A00–1A0Z 细菌感染性疾病 HMP 参考基因组含多种病原菌(如 C. difficile)
DA0C 口腔疾病 HMP 口腔部位采样(舌背、颊黏膜、龈上菌斑等)
5A70 细菌性阴道病 HMP 阴道部位采样 + MOMS-PI 阴道微生物组研究
4A00 肥胖症 HMP1-II 肠道微生物组与代谢健康关联分析
CA40 呼吸系统感染 HMP 鼻腔部位采样 + IPOP 呼吸道感染期间微生物组变化

§2.2 SNOMED CT 映射

SNOMED CT ID 术语 应用场景
24526004 Inflammatory bowel disease IBDMDB 队列疾病定义
288380006 Premature labor MOMS-PI 队列结局指标
31321000119102 Prediabetes IPOP 队列入组标准
235058003 Bacterial infection HMP 参考基因组病原菌注释
87172008 Bacterial vaginosis 阴道微生物组异常状态分类
417662000 Bacterial vaginosis BV 诊断与微生物组关联
64859006 Opportunistic infection 免疫抑制状态下微生物组变化

§2.3 微生物学基础概念

概念 定义 与 HMP 的关系
微生物组(Microbiome) 特定环境中所有微生物及其基因组的总和 HMP 的核心研究对象
16S rRNA 基因 原核生物核糖体小亚基 RNA 基因,含 9 个可变区(V1-V9),用于物种分类 HMP1 主要测序靶标(V1-V3 / V3-V5 / V6-V9)
宏基因组(Metagenome) 环境中全部微生物基因组的集合 HMP1 WGS 鸟枪法测序的对象
OTU(Operational Taxonomic Unit) 基于序列相似度(通常 97%)聚类的分类操作单元 HMP 16S 分析的基本分类单位
肠型(Enterotype) 肠道微生物组的主要群落类型(以 Bacteroides / Prevotella / Ruminococcus 为标志) HMP 肠道数据验证了肠型的存在
菌株(Strain) 同一物种内遗传上有差异的亚型 HMP1-II 使用 StrainPhlAn 进行菌株水平分析
短链脂肪酸(SCFA) 微生物发酵产生的乙酸、丙酸、丁酸等,是宿主-微生物互作的关键介质 HMP 功能注释中代谢通路分析的核心

§2.4 人体微生物组身体部位分布

身体区域 具体部位(HMP 采样) 微生物多样性特征 主要菌属
肠道 粪便(Stool) 丰度最高、多样性最丰富 Bacteroides、Faecalibacterium、Roseburia
口腔 舌背(Tongue dorsum)、颊黏膜(Buccal mucosa)、龈上菌斑(Supragingival plaque)、硬腭(Hard palate)、附着角化龈(Attached keratinized gingiva)、唾液(Saliva)、扁桃体(Palatine tonsils) 高多样性、部位特异性强 Streptococcus、Prevotella、Veillonella
鼻腔 前鼻孔(Anterior nares) 低多样性、以 Corynebacterium 和 Staphylococcus 为主 Corynebacterium、Staphylococcus、Propionibacterium
皮肤 左/右肘前窝(Left/Right antecubital fossa)、左/右耳后(Left/Right retroauricular crease) 部位依赖性、以 Staphylococcus 和 Corynebacterium 为主 Staphylococcus、Corynebacterium、Propionibacterium
阴道 后穹窿(Posterior fornix) 低多样性、以 Lactobacillus 为主 Lactobacillus crispatus、L. iners、Gardnerella

§2.5 微生物组与疾病关联

疾病 微生物组特征 HMP 贡献 关键发现
IBD(克罗恩病 + 溃疡性结肠炎) 微生物多样性降低、Fusobacterium 增加、短链脂肪酸产生菌减少 IBDMDB 队列纵向追踪 132 名患者 IBD 发作期微生物组剧烈变化,缓解期恢复至接近正常;宿主免疫分子与微生物组高度互作
早产 L. crispatus 减少、BVAB1 增加 MOMS-PI 队列 597 名孕妇 阴道微生物组多样性高的孕妇早产风险更高;种族差异显著(非洲血统风险更高)
前驱糖尿病 / T2D 丁酸产生菌减少、微生物组稳定性降低 IPOP 队列 106 名受试者 4 年追踪 前驱糖尿病患者免疫应答迟钝;感染事件可能触发糖尿病进展;个体化分子签名可预测 T2D 发生
肥胖 Bacteroidetes/Firmicutes 比例变化、多样性降低 HMP1 肠道数据关联分析 微生物组与代谢健康相关,但个体间差异远大于疾病间差异
细菌性阴道病 Lactobacillus 减少、Gardnerella 增加 HMP 阴道数据 + MOMS-PI 五种阴道微生物群落状态,仅一种为健康状态
** colorectal cancer** Fusobacterium nucleatum 富集 HMP 数据作为健康对照 基于 HMP 参考基因组的宏基因组分析发现 CRC 相关菌株

§2.6 微生物组研究的 8 大变革

维度 前 HMP 时代 HMP 后
参考数据 缺乏系统性人体微生物组参考 300 名健康成人基线图谱 + 2,000+ 参考基因组
标准化 各实验室协议不统一 HMP Core Sampling Protocol A 成为行业标准
工具生态 缺乏整合分析平台 QIIME / MetaPhlAn / HUMAnN 成为核心工具
数据共享 数据分散、格式不一致 DACC 门户统一存储与分发
多组学 仅 16S 或 WGS 单一组学 iHMP 引入宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组整合
纵向设计 以横断面研究为主 iHMP 三队列均采用纵向追踪设计
菌株水平 仅能到属/种水平 StrainPhlAn 实现菌株水平追踪
宿主互作 仅关注微生物组成 iHMP 同时测量宿主免疫、代谢、基因表达

§3 数据集规格

§3.0 版本抉择矩阵

使用场景 推荐版本 理由 数据量
健康基线参考 HMP1(Phase 1) 300 名健康成人 18 部位完整 16S + WGS ~10-15 TB
菌株水平分析 HMP1-II(扩展) 2,355 宏基因组 + StrainPhlAn 菌株追踪 ~5 TB
疾病生物标志物 iHMP IBDMDB 132 名 IBD 患者纵向多组学 ~5-8 TB
早产预测模型 iHMP MOMS-PI 597 名孕妇阴道微生物组纵向数据 ~3-5 TB
糖尿病风险预测 iHMP IPOP 106 名前驱糖尿病 4 年纵向多组学 ~3-5 TB
参考基因组映射 HMP Reference Genomes 2,000+ 微生物参考基因组 ~50-100 GB
快速原型验证 AWS Open Data 子集 免注册、免费、S3 无限制访问 按需

§3.1 数据类型

数据类型 测序方法 样本规模 主要用途
16S rRNA 基因测序 Roche 454 FLX Titanium(V1-V3 / V3-V5 / V6-V9) >10,000 样本 / 5,298 初期 物种分类、群落多样性分析
全宏基因组鸟枪法测序(WGS) Illumina 681 初期 + 1,631 扩展 = 2,355 总计 功能注释、代谢通路重建、菌株分析
参考基因组测序 Sanger / Illumina / 454 2,000+ 基因组 分类参考、功能映射
宏转录组测序 Illumina RNA-seq iHMP 三队列 微生物活性基因表达
蛋白质组学 LC-MS/MS iHMP IBD / IPOP 队列 微生物与宿主蛋白谱
代谢组学 非靶向质谱 iHMP 三队列 代谢物谱、短链脂肪酸定量
宿主转录组学 Illumina RNA-seq iHMP IPOP 队列 宿主基因表达响应

§3.2 数据格式

格式 用途 特点
FASTQ 原始测序 reads 含质量评分,HMP1 16S 为 454 FLX 格式
FASTA 参考序列 / 组装结果 纯序列无质量信息
SFF 454 测序原始数据 Roche 454 平台专有格式,含 flowgram 信息
BAM 比对结果 二进制格式,参考基因组比对
BIOM OTU 表 / 丰度矩阵 生物观测矩阵格式,支持 JSON / HDF5
TSV/CSV 元数据 / 丰度表 可读性高,适合 R / Python 加载
HDF5 大规模数值矩阵 高效存储高维数据,QIIME2 使用

§3.3 访问渠道

渠道 URL 访问方式 数据范围 特点
HMP DACC Portal https://portal.hmpdacc.org/ Web 门户 + 购物车 全部 HMP1 + iHMP 数据 最全面,支持元数据筛选与可视化
AWS Open Data s3://human-microbiome-project/ AWS CLI / SDK(无需账户) HMP1 16S + WGS + 参考基因组 免注册、免费、支持批量下载
NCBI SRA https://www.ncbi.nlm.nih.gov/sra SRA Toolkit 全部公开测序数据 与 NCBI 生态整合
NCBI BioProject PRJNA28331 Web 浏览 HMP1 全部参考基因组 参考基因组元数据
dbGaP phs000228.v4.p1 申请审批(2-4 周) 受控访问临床/宿主数据 含宿主基因组与受保护元数据
FTP ftp://ftp.ncbi.nlm.nih.gov/genomes/HUMAN_MICROBIOM/ wget / curl 参考基因组 适合批量下载
Metabolomics Workbench https://www.metabolomicsworkbench.org/ Web 浏览 iHMP 代谢组学数据 代谢物结构与定量数据

§3.4 标准化处理管线

管线 用途 工具链 输出
16S 处理管线 16S rRNA 原始 reads → OTU 表 NAST-iEr → ChimeraSlayer → WigeoN → RDP Classifier 比对后的去嵌合体序列 + 分类表
WGS 宏基因组管线 WGS reads → 物种 + 功能谱 质控 → 比对 → 组装 → 注释 物种丰度表 + 功能丰度表
参考基因组注释 基因组 → 基因预测 + 功能注释 IMG-GOLD 系统 → 基因预测 → KEGG / COG 注释 注释基因组
元数据管理 样本元数据标准化 MIGS 标准 → GOLD 数据库 结构化元数据
iHMP 多组学整合 跨组学数据整合分析 DACC 统一框架 → 跨组学关联分析 整合多组学矩阵

§3.5 质量控制标准

QC 指标 标准 说明
16S 测序误差率 <0.02% 使用 Mock Community 标定,从 0.6% 降至 0.02%
嵌合体检测 ChimeraSlayer 筛除 16S 处理管线标准步骤
人类序列去污染 BMTagger / Bowtie2 WGS 数据中人类宿主序列去除
技术重复一致性 252 个技术重复 HMP1-II 含 252 个技术重复用于评估批次效应
Mock Community 21 种已知菌合成群落 16S 管线验证的金标准
基因组完成度 High Quality Draft(大部分)/ Improved / Finished 参考 genome finishing 标准(Chain et al. 2009)
元数据合规 MIGS 最小信息标准 Genomic Standards Consortium 规范

§3.6 工具生态

工具 功能 HMP 关系 当前版本
QIIME / QIIME2 16S rRNA 分析平台 HMP 资助开发,成为 16S 分析标准 QIIME2 2024.x
MetaPhlAn 宏基因组物种分类 HMP 标准处理管线组件 MetaPhlAn 4.x
HUMAnN 宏基因组功能注释 HMP 标准处理管线组件(HMP Unified Metabolic Analysis Network) HUMAnN 3.x
Mothur 16S rRNA 分析平台 HMP 资助开发 Mothur 1.48.x
StrainPhlAn 菌株水平追踪 HMP1-II 核心分析工具 MetaPhlAn 组件
RDP Classifier 16S rRNA 分类 HMP 16S 管线组件 RDP 18
Greengunes / SILVA 16S 参考数据库 HMP 分类参考 Greengunes 13.8 / SILVA 138
IMG / GOLD 参考基因组管理 HMP 参考基因组数据库系统 IMG/M
phyloseq R 微生物组分析 社区开发的 HMP 数据分析工具 phyloseq 1.46.x
HMP16SData R/Bioconductor HMP 16S 数据包 直接加载 HMP 16S 处理后数据 HMP16SData 1.24.x
VSEARCH 序列聚类 / 去冗余 OTU 聚类替代 USEARCH VSEARCH 2.x
DADA2 序列变异检测 QIIME2 默认 16S 去噪方法 DADA2 1.30.x

§4 数据结构详解

§4.1 标识系统

标识类型 格式 示例 说明
NCBI SRA Run SRR + 数字 SRR013951 单次测序运行
NCBI SRA Sample SRS + 数字 SRS147223 生物样本
NCBI SRA Study SRP + 数字 SRP002860 研究项目
NCBI BioProject PRJNA + 数字 PRJNA28331 HMP 参考基因组项目
dbGaP Study phs + 数字 phs000228.v4.p1 HMP 受控访问研究
HMP Sample ID UUID 3674d95cd0d27e1de94ddf4d2e0c0780 DACC 门户内部标识
HMP Body Site Code 缩写 ANT_NA(前鼻孔)/ STOOL(粪便)/ TONG_D(舌背) 18 个标准部位代码

§4.2 单条目数据组件

组件 文件类型 内容 示例
原始测序数据 FASTQ / SFF 测序仪原始输出 SRS013951.tar.bz2(WGS raw)
质控后数据 FASTQ 去污染 + 质量过滤后 reads wgs_qc_v2/
组装结果 FASTA 宏基因组组装 contigs IDBA/SRS013951.fna.bz2
物种丰度表 BIOM / TSV OTU/物种 × 样本丰度矩阵 HM16STR processed
功能丰度表 TSV 代谢通路 / KEGG 丰度 HUMAnN 输出
样本元数据 TSV / LMD 采样部位、访视次数、受试者信息 .lmd 文件
参考基因组 FASTA / GenBank 组装注释后基因组序列 NCBI RefSeq
比对结果 BAM reads → 参考基因组比对 BAM 文件
质控报告 TXT / HTML 质控指标汇总 FastQC / MultiQC

§4.3 DACC 元数据模型

HMP DACC 元数据层次结构
├── Project(项目)
│   ├── HMP1 Phase I(健康基线)
│   ├── HMP1-II(扩展)
│   └── iHMP(整合 HMP)
│       ├── MOMS-PI(妊娠/早产)
│       ├── IBDMDB(IBD)
│       └── IPOP(前驱糖尿病)
├── Subject(受试者)
│   ├── Subject ID(匿名标识)
│   ├── Demographics(人口学,受控访问)
│   ├── Visit Number(访视次数 1-3)
│   └── Body Site(采样部位 × 访视)
├── Sample(样本)
│   ├── Sample ID(UUID)
│   ├── Body Site(18 部位之一)
│   ├── Collection Date(采集日期)
│   └── Processing Center(处理中心)
├── Sequencing Run(测序运行)
│   ├── Platform(454 FLX / Illumina)
│   ├── Variable Region(V1V3 / V3V5 / V6V9)
│   └── Read Count(reads 数)
└── Analysis Result(分析结果)
    ├── Taxonomic Profile(物种分类谱)
    ├── Functional Profile(功能注释谱)
    └── Assembly(组装结果)

§4.4 FTP 目录结构

HMP DACC FTP 目录树
├── /data/
│   ├── HM16STR/          # 16S 处理后数据
│   │   ├── SRP002860/    # 按研究项目组织
│   │   │   ├── SRS147223.fsa
│   │   │   └── ...
│   ├── HMR16S/           # 16S 原始数据
│   │   └── *.sff         # 454 测序原始数据
│   ├── HMASM/            # 宏基因组组装
│   │   └── IDBA/
│   ├── HMQCP/            # QIIME 社区分析
│   ├── HMMCP/            # Mothur 社区分析
│   └── hmmrc2/           # HUMAnN2 功能分析
├── /reference_genomes/   # 参考基因组
│   └── PRJNA28331/       # BioProject
└── /ihmp/                # iHMP 数据
    ├── MOMS-PI/
    ├── IBDMDB/
    └── IPOP/

§4.5 DAIMS 数据字典

字段名 类型 来源 描述 示例
sample_id string DACC 样本唯一标识 SRS011061
subject_id string DACC 受试者匿名标识 700013549
body_site enum 采样协议 采样部位(18 选 1) Stool
visit_no integer 采样协议 访视次数(1/2/3) 1
seq_platform enum 测序中心 测序平台 454 FLX Titanium
variable_region enum 测序中心 16S 可变区 V3-V5
read_count integer 测序中心 原始 reads 数 5,234
read_length integer 测序中心 平均读长 450
data_type enum DACC 数据类型 16S / WGS
processing_center string DACC 测序中心 BCM / Broad / JCVI / WashU
assembly_method string DACC 组装方法 IDBA / MetaVelvet
organism string 参考基因组 物种名 Bacteroides thetaiotaomicron
finishing_status enum 参考基因组 基因组完成度 High Quality Draft
body_site_isolation string 参考基因组 菌株分离部位 Gastrointestinal tract
cohort_type enum iHMP 疾病队列类型 MOMS-PI / IBDMDB / IPOP
disease_status enum iHMP 疾病状态 Healthy / IBD_active / IBD_remission

§4.6 数据覆盖统计

维度 数量 说明
健康受试者 300 人 HMP1 健康成人队列
疾病队列受试者 1,765 人 iHMP 三队列(1,527 + 132 + 106)
原始标本 11,174 个 HMP1 全部标本
16S 测序样本 >10,000 个 HMP1 16S 数据
WGS 宏基因组 2,355 个 HMP1 + HMP1-II
参考基因组 2,000+ 个 含细菌、古菌、病毒、真核微生物
身体部位 18 个 5 大区域(肠道/口腔/鼻腔/皮肤/阴道)
iHMP 标本 206,437 个 MOMS-PI 妊娠队列采集
组学数据类型 6+ 种 16S + WGS + 宏转录组 + 蛋白质组 + 代谢组 + 宿主转录组
总数据量 ~42 TB HMP1 + HMP2 全部
用户月活 9,000-12,000 DCC 网站月均会话数

§4.7 不覆盖的数据类型

数据类型 说明 替代来源
非美国人群数据 HMP 队列以美国人群为主(85% 白人) MetaHIT(欧洲)/ 中国肠道微生物组研究
儿童微生物组 HMP 仅纳入 18-40 岁成人 TEDDY 研究 / CHILD 研究
环境微生物组 仅人体相关微生物 Earth Microbiome Project (EMP)
非人类灵长类 仅人类微生物组 各灵长类研究中心数据
抗生素干预数据 无系统性抗生素干预实验 临床试验数据
深层组织微生物组 仅表面/腔道采样 组织微生物组研究

§5 数据划分与使用建议

§5.1 划分维度

维度 划分方式 建议
按身体部位 肠道 / 口腔 / 鼻腔 / 皮肤 / 阴道 每个部位的微生物组特征差异显著,建议分别建模
按数据类型 16S / WGS / 多组学 16S 适合物种分类模型,WGS 适合功能预测,多组学适合宿主互作建模
按阶段 HMP1(健康基线)/ HMP2(疾病队列) HMP1 作为训练/参考集,HMP2 作为疾病预测目标
按访视 Visit 1 / 2 / 3 纵向数据可用于时序建模,Visit 1 为基线
按队列 MOMS-PI / IBDMDB / IPOP 疾病队列间不可混用,特征差异大

§5.2 推荐划分策略

策略 训练集 验证集 测试集 适用场景
物种分类模型 HMP1 16S(70%) HMP1 16S(15%) HMP1 16S(15%) 16S rRNA 序列物种分类
疾病预测模型 iHMP 队列内交叉验证 跨队列验证 IBD / 早产 / 糖尿病风险预测
功能预测模型 HMP1 WGS + 参考基因组 HMP1-II WGS 独立疾病队列 宏基因组功能注释
纵向预测模型 前期时间点 中期时间点 后期时间点 微生物组动态预测
多组学融合模型 iHMP 多组学(80%) iHMP 多组学(20%) 外部验证(如 AGP) 跨组学关联建模

§5.3 跨数据集整合策略

整合策略 目标 挑战 解决方案
HMP + MetaHIT 扩大肠道微生物组参考 技术平台差异(16S 可变区不同) 使用统一参考数据库(SILVA)重新分类
HMP + American Gut 增加人群多样性 采样协议不一致 标准化元数据映射
HMP + GMrepo 整合多疾病微生物组 批次效应 ComBat 校正 + 分层建模
HMP + EMP 人体 vs 环境微生物组比较 样本类型差异极大 仅在属水平比较

§5.4 AI 训练数据获取流程

步骤 操作 工具 / 资源
1 确定研究目标与所需数据类型
2 访问 DACC 门户选择数据子集 https://portal.hmpdacc.org/
3 下载原始数据(FASTQ / SFF) AWS CLI / SRA Toolkit
4 执行质控与去污染 Kneaddata / BMTagger
5 运行 16S 或 WGS 分析管线 QIIME2 / MetaPhlAn + HUMAnN
6 生成特征矩阵(OTU 表 / 物种丰度 / 功能丰度) QIIME2 / biobakery
7 整合元数据 DACC 元数据表
8 划分训练 / 验证 / 测试集 按受试者划分(非按样本)
9 训练 AI 模型 scikit-learn / PyTorch / TensorFlow
10 跨队列外部验证 独立疾病队列数据

§6 AI 就绪指南

§6.0 云端快速启动

<details>
<summary>📦 环境配置(点击展开)</summary>

# 1. 创建 conda 环境
conda create -n hmp-ai python=3.10
conda activate hmp-ai

# 2. 安装核心工具
conda install -c bioconda qiime2
conda install -c biobakery metaphlan humann
conda install -c bioconda biom-format
pip install scikit-learn pandas numpy matplotlib seaborn

# 3. 安装 AWS CLI(用于下载数据)
pip install awscli

# 4. 验证安装
qiime version
metaphlan version
humann version

</details>

§6.1 从 AWS 下载 HMP 数据

<details>
<summary>💻 AWS S3 批量下载(点击展开)</summary>

"""
从 AWS Open Data Registry 下载 HMP 数据
无需 AWS 账户,完全免费
"""
import subprocess
import os

# 列出 HMP 数据集
result = subprocess.run(
    [''''''''''''''''aws'''''''''''''''', ''''''''''''''''s3'''''''''''''''', ''''''''''''''''ls'''''''''''''''', ''''''''''''''''no-sign-request'''''''''''''''', ''''''''''''''''s3://human-microbiome-project/''''''''''''''''],
    capture_output=True, text=True
)
print("HMP S3 目录结构:")
print(result.stdout)

# 下载特定子集(示例:16S 参考数据)
download_dir = ''''''''''''''''./hmp_data''''''''''''''''
os.makedirs(download_dir, exist_ok=True)

# 下载 16S 数据子集
subprocess.run([
    ''''''''''''''''aws'''''''''''''''', ''''''''''''''''s3'''''''''''''''', ''''''''''''''''cp'''''''''''''''', ''''''''''''''''no-sign-request'''''''''''''''', ''''''''''''''''recursive'''''''''''''''',
    ''''''''''''''''s3://human-microbiome-project/HM16STR/'''''''''''''''',
    os.path.join(download_dir, ''''''''''''''''HM16STR'''''''''''''''')
])

# 下载参考基因组元数据
subprocess.run([
    ''''''''''''''''aws'''''''''''''''', ''''''''''''''''s3'''''''''''''''', ''''''''''''''''cp'''''''''''''''', ''''''''''''''''no-sign-request'''''''''''''''',
    ''''''''''''''''s3://human-microbiome-project/reference_genomes/metadata.tsv'''''''''''''''',
    os.path.join(download_dir, ''''''''''''''''ref_genomes_metadata.tsv'''''''''''''''')
])

# 列出已下载文件
for root, dirs, files in os.walk(download_dir):
    for f in files:
        filepath = os.path.join(root, f)
        size_mb = os.path.getsize(filepath) / (1024 * 1024)
        print(f"{filepath} ({size_mb:.1f} MB)")

</details>

§6.2 使用 HMP16SData R 包直接加载

<details>
<summary>🧬 R/Bioconductor 一键加载(点击展开)</summary>

# install.packages("BiocManager")
# BiocManager::install("HMP16SData")

library(HMP16SData)
library(phyloseq)

# 加载 V3-V5 16S 数据(处理后的 OTU 表 + 元数据)
V35_data <- HMP16SData::V35()

# 查看数据结构
print(V35_data)
# class: SummarizedExperiment
# dim: 45383 OTU × 3,035 samples
# rowData names: CONSENSUS_LINEAGE, SUPERKINGDOM, ... FAMILY, GENUS
# colData names: RSID, VISITNO, HMP_BODY_SUBSITE, SRS_SAMPLE_ID, ...

# 筛选肠道样本
stool_samples <- V35_data[, V35_data$HMP_BODY_SUBSITE == "Stool"]
print(dim(stool_samples))  # 45383 OTU × 319 samples

# 转换为 phyloseq 对象进行下游分析
ps_stool <- as phyloseq(stool_samples)
plot_bar(ps_stool, fill = "GENUS") + theme_bw()

</details>

§6.3 16S 分析完整管线(QIIME2)

<details>
<summary>🔬 QIIME2 16S rRNA 完整分析管线(点击展开)</summary>

#!/bin/bash
# HMP 16S rRNA 完整分析管线(QIIME2)
# 适用于 HMP 454 FLX Titanium 原始 SFF 数据

# 1. 导入数据(SFF → QIIME2 Artifact)
qiime tools import \
  type ''''''''''''''''SampleData[SequencesWithQuality]'''''''''''''''' \
  input-path ./hmp_16s_manifest.txt \
  output-path hmp-16s-demux.qza \
  input-format CasavaOneEightSingleLanePerSampleDirFmt

# 2. 序列去噪(DADA2 适配 454 长读)
qiime dada2 denoise-pyro \
  i-demultiplexed-seqs hmp-16s-demux.qza \
  p-trunc-len 0 \
  o-table hmp-table.qza \
  o-representative-sequences hmp-rep-seqs.qza \
  o-denoising-stats hmp-stats.qza

# 3. 构建系统发育树
qiime phylogeny align-to-tree-mafft-fasttree \
  i-sequences hmp-rep-seqs.qza \
  o-alignment hmp-aligned-rep-seqs.qza \
  o-masked-alignment hmp-masked-alignment.qza \
  o-tree hmp-unrooted-tree.qza \
  o-rooted-tree hmp-rooted-tree.qza

# 4. Alpha 多样性分析
qiime diversity alpha-rarefaction \
  i-table hmp-table.qza \
  i-phylogeny hmp-rooted-tree.qza \
  p-max-depth 1000 \
  m-metadata-file hmp-metadata.tsv \
  o-visualization hmp-alpha-rarefaction.qzv

# 5. Beta 多样性分析
qiime diversity core-metrics-phylogenetic \
  i-phylogeny hmp-rooted-tree.qza \
  i-table hmp-table.qza \
  p-sampling-depth 500 \
  m-metadata-file hmp-metadata.tsv \
  output-dir hmp-core-metrics

# 6. 物种分类(使用 SILVA 138 数据库)
qiime feature-classifier classify-sklearn \
  i-classifier silva-138-ssu-nr-99-515f-806r-classifier.qza \
  i-reads hmp-rep-seqs.qza \
  o-classification hmp-taxonomy.qza

# 7. 按身体部位统计差异
qiime diversity beta-group-significance \
  i-distance-matrix hmp-core-metrics/unweighted_unifrac_distance_matrix.qza \
  m-metadata-file hmp-metadata.tsv \
  m-metadata-column HMP_BODY_SUBSITE \
  o-visualization hmp-body-site-significance.qzv \
  p-pairwise

</details>

§6.4 宏基因组功能分析(MetaPhlAn + HUMAnN)

<details>
<summary>🧪 宏基因组物种 + 功能注释(点击展开)</summary>

#!/bin/bash
# HMP 宏基因组分析管线(MetaPhlAn 4 + HUMAnN 3)

# 1. 质控 + 去污染
kneaddata \
  input hmp_wgs_R1.fastq \
  input hmp_wgs_R2.fastq \
  reference-db /path/to/human_genome_db \
  output hmp_wgs_cleaned

# 2. 物种分类(MetaPhlAn 4)
metaphlan hmp_wgs_cleaned_1.kneaddata.trimmed.pair1.fastq,hmp_wgs_cleaned_2.kneaddata.trimmed.pair2.fastq \
  input_type fastq \
  bowtie2db /path/to/metaphlan_db \
  nproc 8 \
  -o hmp_wgs_profile.txt

# 3. 功能注释(HUMAnN 3)
humann \
  input hmp_wgs_cleaned_1.kneaddata.trimmed.pair1.fastq,hmp_wgs_cleaned_2.kneaddata.trimmed.pair2.fastq \
  output hmp_humann_output \
  threads 8 \
  metaphlan-options "bowtie2db /path/to/metaphlan_db"

# 4. 生成统一丰度矩阵
humann_join_tables \
  input hmp_humann_output \
  output hmp_humann_merged.tsv

# 5. 归一化(CPM)
humann_renorm_table \
  input hmp_humann_merged.tsv \
  output hmp_humann_normalized.tsv \
  units relab \
  norm CPM

# 6. 通路 abundance 分析
humann_regroup_table \
  input hmp_humann_normalized_genefamilies.tsv \
  output hmp_humann_pathabundance.tsv \
  grouping uniref90-pathway

</details>

§6.5 疾病生物标志物挖掘(机器学习)

<details>
<summary>🤖 IBD 微生物组分类模型(点击展开)</summary>

"""
基于 HMP + iHMP IBDMDB 数据的 IBD 微生物组分类模型
使用随机森林进行 IBD vs 健康对照二分类
"""
import pandas as pd
import numpy as np
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import GroupKFold, cross_val_score
from sklearn.metrics import roc_auc_score, classification_report
from sklearn.preprocessing import StandardScaler
import matplotlib.pyplot as plt
import seaborn as sns

# 1. 加载物种丰度表(MetaPhlAn 输出)
# HMP1 健康基线作为对照组
healthy_profile = pd.read_csv(''''''''''''''''hmp1_healthy_metaphlan.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''', index_col=0)
# iHMP IBDMDB 作为病例组
ibd_profile = pd.read_csv(''''''''''''''''ihmp_ibd_metaphlan.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''', index_col=0)

# 2. 合并数据
X_healthy = healthy_profile.T  # 样本 × 物种
X_ibd = ibd_profile.T

X = pd.concat([X_healthy, X_ibd], axis=0)
y = np.array([0] * len(X_healthy) + [1] * len(X_ibd))  # 0=健康, 1=IBD
groups = np.array([''''''''''''''''HMP''''''''''''''''] * len(X_healthy) + [''''''''''''''''IBD''''''''''''''''] * len(X_ibd))

# 3. 过滤低丰度物种
abundance_threshold = 0.001
prevalence_threshold = 0.05
mean_abundance = X.mean(axis=0)
prevalence = (X > 0).mean(axis=0)
features_keep = (mean_abundance > abundance_threshold) &amp; (prevalence > prevalence_threshold)
X_filtered = X.loc[:, features_keep]

# 4. CLR 变换(处理组成型数据)
def clr_transform(df):
    """Centered Log-Ratio 变换"""
    log_df = np.log(df + 1e-6)  # 加小值避免 log(0)
    geometric_mean = log_df.mean(axis=1)
    clr_df = log_df.sub(geometric_mean, axis=0)
    return clr_df

X_clr = clr_transform(X_filtered)

# 5. 按受试者分组交叉验证(避免数据泄露)
n_splits = 5
gkf = GroupKFold(n_splits=n_splits)

# 6. 训练随机森林
rf = RandomForestClassifier(
    n_estimators=500,
    max_depth=10,
    random_state=42,
    n_jobs=-1,
    class_weight=''''''''''''''''balanced''''''''''''''''
)

# 交叉验证
cv_scores = cross_val_score(rf, X_clr, y, groups=groups, cv=gkf, scoring=''''''''''''''''roc_auc'''''''''''''''')
print(f"IBD 分类 AUC: {cv_scores.mean():.3f} ± {cv_scores.std():.3f}")

# 7. 训练最终模型并提取特征重要性
rf.fit(X_clr, y)
feature_importance = pd.DataFrame({
    ''''''''''''''''species'''''''''''''''': X_clr.columns,
    ''''''''''''''''importance'''''''''''''''': rf.feature_importances_
}).sort_values(''''''''''''''''importance'''''''''''''''', ascending=False)

print("\nTop 20 IBD 相关微生物特征:")
print(feature_importance.head(20))

# 8. 可视化
plt.figure(figsize=(10, 8))
top_features = feature_importance.head(20)
sns.barplot(data=top_features, x=''''''''''''''''importance'''''''''''''''', y=''''''''''''''''species'''''''''''''''', palette=''''''''''''''''RdYlBu_r'''''''''''''''')
plt.title(''''''''''''''''Top 20 Microbial Features for IBD Classification (HMP + IBDMDB)'''''''''''''''')
plt.xlabel(''''''''''''''''Random Forest Importance'''''''''''''''')
plt.tight_layout()
plt.savefig(''''''''''''''''ibd_biomarker_importance.png'''''''''''''''', dpi=300)
plt.show()

</details>

§6.6 纵向微生物组动态建模

<details>
<summary>📈 iHMP IBD 纵向时序分析(点击展开)</summary>

"""
iHMP IBDMDB 纵向微生物组动态建模
使用 LSTM 预测 IBD 发作
"""
import torch
import torch.nn as nn
import numpy as np
import pandas as pd
from torch.utils.data import Dataset, DataLoader

# 1. 加载纵向数据
# 每个受试者有多个时间点的微生物组样本
lonevent-blocked= pd.read_csv(''''''''''''''''ihmp_ibd_longitudinal.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''')
# 列:subject_id, timepoint, species_1, ..., species_N, flare_next_visit

# 2. 构建时序数据集
class MicrobiomeTimeSeriesDataset(Dataset):
    def __init__(self, data, seq_length=4, n_features=100):
        self.data = data
        self.seq_length = seq_length
        self.n_features = n_features
        self.subjects = data[''''''''''''''''subject_id''''''''''''''''].unique()
        
    def __len__(self):
        return len(self.subjects)
    
    def __getitem__(self, idx):
        subject = self.subjects[idx]
        subject_data = self.data[self.data[''''''''''''''''subject_id''''''''''''''''] == subject].sort_values(''''''''''''''''timepoint'''''''''''''''')
        
        # 取前 seq_length 个时间点的物种丰度
        features = subject_data.iloc[:self.seq_length, 2:2+self.n_features].values
        # 标签:下一次访视是否发作
        label = subject_data.iloc[self.seq_length, -1] if len(subject_data) > self.seq_length else 0
        
        return torch.FloatTensor(features), torch.LongTensor([label])

# 3. LSTM 模型
class MicrobiomeLSTM(nn.Module):
    def __init__(self, input_dim, hidden_dim=64, num_layers=2, output_dim=2):
        super().__init__()
        self.lstm = nn.LSTM(input_dim, hidden_dim, num_layers, batch_first=True, dropout=0.3)
        self.fc = nn.Linear(hidden_dim, output_dim)
        self.dropout = nn.Dropout(0.3)
        
    def forward(self, x):
        lstm_out, _ = self.lstm(x)
        last_output = lstm_out[:, -1, :]
        output = self.fc(self.dropout(last_output))
        return output

# 4. 训练
dataset = MicrobiomeTimeSeriesDataset(longitudinal_data, seq_length=4, n_features=100)
dataloader = DataLoader(dataset, batch_size=16, shuffle=True)

model = MicrobiomeLSTM(input_dim=100, hidden_dim=64)
criterion = nn.CrossEntropyLoss()
optimizer = torch.optim.Adam(model.parameters(), lr=0.001)

n_epochs = 50
for epoch in range(n_epochs):
    model.train()
    total_loss = 0
    for features, labels in dataloader:
        optimizer.zero_grad()
        outputs = model(features)
        loss = criterion(outputs, labels.squeeze())
        loss.backward()
        optimizer.step()
        total_loss += loss.item()
    
    if (epoch + 1) % 10 == 0:
        print(f"Epoch {epoch+1}/{n_epochs}, Loss: {total_loss/len(dataloader):.4f}")

print("IBD 发作预测模型训练完成")

</details>

§6.7 早产风险预测模型

<details>
<summary>👶 MOMS-PI 早产风险分类(点击展开)</summary>

"""
基于 iHMP MOMS-PI 阴道微生物组数据的早产风险预测
"""
import pandas as pd
import numpy as np
from sklearn.model_selection import StratifiedKFold
from sklearn.ensemble import GradientBoostingClassifier
from sklearn.linear_model import LogisticRegression
from sklearn.svm import SVC
from sklearn.metrics import roc_auc_score, precision_recall_curve, average_precision_score
import json

# 1. 加载 MOMS-PI 阴道微生物组数据
with open(''''''''''''''''momspi_metadata.json'''''''''''''''') as f:
    metadata = json.load(f)

vaginal_profile = pd.read_csv(''''''''''''''''momspi_vaginal_metaphlan.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''', index_col=0).T
labels = pd.read_csv(''''''''''''''''momspi_outcomes.tsv'''''''''''''''', sep=''''''''''''''''\t'''''''''''''''')  # subject_id, preterm (0/1)

# 2. 合并特征与标签
data = vaginal_profile.merge(labels, left_index=True, right_on=''''''''''''''''subject_id'''''''''''''''')

# 3. 特征工程
# 添加生态学特征
data[''''''''''''''''shannon_diversity''''''''''''''''] = -(data.iloc[:, 1:-2] * np.log(data.iloc[:, 1:-2] + 1e-10)).sum(axis=1)
data[''''''''''''''''lactobacillus_ratio''''''''''''''''] = data.filter(like=''''''''''''''''Lactobacillus'''''''''''''''').sum(axis=1)
data[''''''''''''''''gardnerella_ratio''''''''''''''''] = data.filter(like=''''''''''''''''Gardnerella'''''''''''''''').sum(axis=1)

# 关键物种(文献报道)
key_species = [
    ''''''''''''''''Lactobacillus_crispatus'''''''''''''''',      # 保护性
    ''''''''''''''''Lactobacillus_iners'''''''''''''''',          # 中性/风险
    ''''''''''''''''Gardnerella_vaginalis'''''''''''''''',        # BV 标志
    ''''''''''''''''BVAB1'''''''''''''''',                         # 早产正相关
    ''''''''''''''''Prevotella_cluster2'''''''''''''''',
    ''''''''''''''''Sneathia_amnii'''''''''''''''',
    ''''''''''''''''TM7-H1''''''''''''''''
]

# 4. 多模型比较
X = data[key_species + [''''''''''''''''shannon_diversity'''''''''''''''', ''''''''''''''''lactobacillus_ratio'''''''''''''''']]
y = data[''''''''''''''''preterm''''''''''''''''].values

models = {
    ''''''''''''''''Logistic Regression'''''''''''''''': LogisticRegression(max_iter=1000, class_weight=''''''''''''''''balanced''''''''''''''''),
    ''''''''''''''''Gradient Boosting'''''''''''''''': GradientBoostingClassifier(n_estimators=200, max_depth=3),
    ''''''''''''''''SVM (RBF)'''''''''''''''': SVC(kernel=''''''''''''''''rbf'''''''''''''''', class_weight=''''''''''''''''balanced'''''''''''''''', probability=True)
}

skf = StratifiedKFold(n_splits=5, shuffle=True, random_state=42)

for name, model in models.items():
    aucs = []
    for train_idx, test_idx in skf.split(X, y):
        X_train, X_test = X.iloc[train_idx], X.iloc[test_idx]
        y_train, y_test = y[train_idx], y[test_idx]
        
        model.fit(X_train, y_train)
        y_prob = model.predict_proba(X_test)[:, 1]
        aucs.append(roc_auc_score(y_test, y_prob))
    
    print(f"{name}: AUC = {np.mean(aucs):.3f} ± {np.std(aucs):.3f}")

# 5. 特征重要性(最优模型)
best_model = GradientBoostingClassifier(n_estimators=200, max_depth=3)
best_model.fit(X, y)
importance = pd.DataFrame({
    ''''''''''''''''feature'''''''''''''''': X.columns,
    ''''''''''''''''importance'''''''''''''''': best_model.feature_importances_
}).sort_values(''''''''''''''''importance'''''''''''''''', ascending=False)
print("\n早产风险关键特征:")
print(importance)

</details>

§6.8 计算资源需求

任务 CPU 内存 存储 GPU 预计时间
16S 分析(QIIME2,1000 样本) 8 核 32 GB 100 GB 4-8 小时
WGS 宏基因组(MetaPhlAn,100 样本) 16 核 64 GB 500 GB 12-24 小时
WGS 功能注释(HUMAnN,100 样本) 16 核 64 GB 1 TB 24-48 小时
参考基因组下载 1 核 4 GB 100 GB 2-4 小时
随机森林分类(10K 物种 × 1K 样本) 8 核 32 GB 50 GB 30 分钟
LSTM 纵向建模(100 受试者 × 5 时点) 4 核 16 GB 10 GB 可选 1-2 小时
多组学融合模型 8 核 32 GB 100 GB 可选 2-4 小时
大规模 AWS 批量下载(10 TB) 4 核 8 GB 10 TB 12-48 小时
宏基因组组装(IDBA-UD,单样本) 32 核 128 GB 200 GB 6-12 小时
StrainPhlAn 菌株分析(100 样本) 8 核 32 GB 50 GB 4-8 小时

§6.9 已知坑点与解决方案

坑点 影响 解决方案
454 平台数据兼容性 454 FLX 已停产,现代管线多为 Illumina 设计 使用 QIIME2 的 denoise-pyro 方法,或转换为 FASTQ 后用 DADA2
16S 可变区不一致 HMP 使用 V1V3/V3V5/V6V9 三个区域,不同区域分类结果差异大 仅在同一可变区内比较;或使用统一 V4 引物重新测序
批次效应 四个测序中心数据存在系统性差异 使用 ComBat / MMUPHin 校正批次效应
人群代表性偏倚 85% 受试者为自报白人,缺乏全球代表性 明确标注适用人群限制;结合 MetaHIT/AGP 扩展人群覆盖
受控访问数据 宿主基因组与临床元数据需 dbGaP 审批(2-4 周) 提前规划;先用开放数据构建模型框架
组成型数据偏差 微生物丰度为相对值(总和=1),直接使用导致虚假相关 使用 CLR 变换或 ALDEx2 处理组成型数据
零膨胀问题 微生物丰度矩阵极度稀疏(>90% 零值) 使用零膨胀模型或 CLR + 伪计数
纵向数据不平衡 不同受试者采样次数不同(1-3 次) 使用可变长度序列模型或对齐时间窗口
宿主序列污染 WGS 数据含大量人类宿主 reads 必须使用 BMTagger/Bowtie2 去除人类序列
OTU vs ASV 转换 HMP 原始分析使用 OTU(97%),现代趋势为 ASV(100%) 重新用 DADA2 从原始 reads 生成 ASV
物种命名变更 微生物分类学不断更新,旧名称可能已废弃 使用 GTDB 或 NCBI Taxonomy 进行命名同步
跨平台丰度不可比 16S 与 WGS 丰度估计原理不同 跨平台比较时使用属以上分类水平

§7 质量评估与局限性

§7.1 已知偏倚

偏倚类型 描述 影响程度 缓解措施
人群偏倚 85% 受试者为自报白人,美国居民 扩展非欧美队列;标注适用人群限制
技术平台偏倚 16S 使用 454 FLX(已停产),WGS 使用早期 Illumina 使用平台校正模型;转换为 ASV
采样时间偏倚 HMP1 仅 1-3 次横断面采样 使用 HMP1-II 和 iHMP 纵向数据补充
部位覆盖偏倚 18 个部位采样深度不均(肠道/口腔样本多,皮肤/阴道少) 按部位分层建模
健康定义偏倚 "健康"标准为自报 + BMI 筛选,可能漏排亚临床疾病 使用更严格的健康定义验证
饮食未记录 HMP1 未系统性记录饮食信息 结合 American Gut 等含饮食数据的队列
抗生素使用未控 采样前抗生素使用信息不完整 筛选自报告无近期抗生素使用样本
存储条件不统一 多中心采样,样本存储条件可能存在差异 统一冻存协议
生物信息学管线迭代 原始管线(2012 年)与现代工具差异大 使用现代工具(QIIME2 / MetaPhlAn 4)重新分析
参考基因组不完整 2,000+ 参考基因组覆盖人体微生物的一小部分 补充 GTDB/UMGS 等未培养基因组数据库
跨组学时间不对齐 多组学采样时间点可能不完全一致 使用时间窗口匹配
疾病队列规模有限 iHMP 三队列各 ~100-150 人,统计功效有限 跨队列验证;使用迁移学习

§7.2 QC 指标

指标 标准 HMP 达标情况
16S 测序误差率 <0.02% ✅ Mock Community 标定后达到
嵌合体去除 ChimeraSlayer ✅ 管线标准步骤
人类序列去污染 BMTagger ✅ WGS 数据处理
技术重复 252 个 ✅ HMP1-II 含技术重复
Mock Community 验证 21 种已知菌 ✅ 用于管线验证
参考基因组完成度 HQ Draft / Improved / Finished ✅ ~85% HQ Draft, ~15% Improved+
元数据合规 MIGS 标准 ✅ 符合 GSC 规范
数据公开 DACC + NCBI + AWS ✅ 三渠道公开
受控数据保护 dbGaP 审批 ✅ 严格分层访问
可重复性 管线文档化 ✅ DACC 提供完整协议

§7.3 外部验证

验证方式 数据来源 验证内容
独立队列验证 MetaHIT / American Gut 物种分类一致性
工具间一致性 QIIME2 vs Mothur 16S 分析结果可重复性
平台间一致性 454 vs Illumina 16S 跨平台分类结果比较
参考数据库验证 Greengunes vs SILVA vs GTDB 分类结果数据库依赖性
临床验证 IBDMDB 临床结局 IBD 发作预测准确性

§7.4 DAIMS 24 项数据就绪度评估

DAIMS 维度 评估项 HMP 达标 说明
动机 1. 数据集创建目的 明确:健康人体微生物组基线表征
2. 资金来源 NIH Common Fund
3. 创建者组成 四个测序中心 + DACC
组成 4. 实例数量 11,174 标本 + 2,355 宏基因组
5. 数据模态 16S + WGS + 多组学
6. 标注来源 统一 DACC 管线 + RDP 分类器
7. 标注质量 Mock Community 验证
收集 8. 采样协议 HMP Core Sampling Protocol A
9. 纳入/排除标准 18-40 岁、BMI 筛选、系统性健康筛查
10. 知情同意 IRB 批准 + 书面知情同意
预处理 11. 原始数据处理 统一 DACC 管线
12. 质控标准 Mock Community + 嵌合体去除
13. 去污染方法 BMTagger 人类序列去除
分布 14. 访问方式 DACC + AWS + NCBI + dbGaP
15. 许可证 CC0 / 公共领域
16. 数据格式 FASTQ / FASTA / BIOM / TSV
维护 17. 更新频率 ⚠️ 项目已过渡,数据不再主动更新(2019 最后更新)
18. 错误修正机制 DACC 门户支持反馈
伦理 19. 隐私保护 脱敏 + dbGaP 受控访问
20. IRB 批准 多 IRB 批准
21. 数据使用限制 开放数据无限制,受控数据需 DUC
使用 22. 已知用途 650+ 篇论文覆盖多种用途
23. 已知误用风险 人群代表性限制已明确
24. 引用建议 Nature 2012 + Nature 2019

DAIMS 总评:23/24 项达标(95.8%),AI 就绪度 5/5 ⭐⭐⭐⭐⭐
(唯一扣分项:项目已过渡,数据不再主动更新,但历史数据质量与可用性不受影响)

§8 基准性能与生态

§8.1 微生物组 AI 基准任务

任务 数据来源 最优方法 性能指标 基准参考
16S 物种分类 HMP1 16S RDP Classifier + DADA2 ASV F1 = 0.95(属级) Werner et al. 2012
IBD vs 健康分类 iHMP IBDMDB + HMP1 随机森林(菌株级丰度) AUC > 0.90 Gastroenterology 2025
IBD 发作预测 iHMP IBDMDB 纵向 LSTM + 多组学 AUC = 0.75 Lloyd-Price et al. 2019
早产风险预测 MOMS-PI 阴道微生物组 机器学习 + 关键物种 AUC = 0.65-0.70 Fettweis et al. 2019
T2D 风险预测 IPOP 多组学 个性化分子签名 个体化 AUC 变异大 Zhou et al. 2019
微生物组迁移学习 HMP → CRC / T2D 迁移学习 + 微调 AUROC 提升 5-15% 多篇
宏基因组功能预测 HMP WGS + 参考基因组 HUMAnN 3 + MetaPhlAn 4 通路覆盖 >80% Franzosa et al. 2018
菌株水平追踪 HMP1-II 纵向 StrainPhlAn 4 菌株识别准确率 >85% Truong et al. 2017

§8.2 关键论文 Top 10

排名 论文 期刊 年份 引用 核心贡献
1 Structure, function and diversity of the healthy human microbiome Nature 2012 15,000+ HMP1 核心成果
2 A framework for human microbiome research Nature 2012 8,000+ HMP 标准化框架
3 The Integrative Human Microbiome Project Nature 2019 3,000+ iHMP 完成总结
4 Strains, functions and dynamics in the expanded HMP Nature 2017 2,500+ HMP1-II 菌株水平分析
5 A catalog of reference genomes from the human microbiome Science 2010 2,000+ 首批参考基因组目录
6 The vaginal microbiome and preterm birth Nature Medicine 2019 1,000+ MOMS-PI 早产研究
7 Multi-omics of the gut microbial ecosystem in IBD Nature 2019 1,500+ IBDMDB 多组学
8 QIIME allows analysis of high-throughput community sequencing data Nature Methods 2010 25,000+ QIIME 工具发布
9 Metagenomic microbial community profiling using unique clade-specific marker genes Nature Methods 2012 7,000+ MetaPhlAn 发布
10 Predictive functional profiling of microbial communities using 16S rRNA marker gene sequences Nature Biotechnology 2013 6,000+ PICRUSt 功能预测

§8.3 HMP 在 AI 生态中的角色

生态层级 角色 具体应用
参考基线 全球健康微生物组标准 所有微生物组研究的健康对照基线
训练数据 微生物组 AI 模型训练 16S 分类器、功能预测模型
验证基准 疾病预测模型验证 IBD/早产/T2D 生物标志物验证
迁移源 预训练模型迁移 HMP 预训练 → 疾病队列微调
工具孵化器 核心工具生态 QIIME2 / MetaPhlAn / HUMAnN 均由 HMP 资助
标准制定者 微生物组研究规范 采样协议、元数据标准、QC 标准
社区中枢 数据共享范式 DACC 模式被后续项目(iHMP、HMP3)沿用

§8.4 真实世界影响案例

案例 描述 影响
粪菌移植标准化 HMP 数据为粪菌移植供体筛选提供微生物组参考 FDA 粪菌移植指南参考
IBD 生物标志物 IBDMDB 发现的微生物标志物进入临床试验 IBD 诊断试剂盒开发
早产风险评估 MOMS-PI 发现 BVAB1 等早产相关微生物 阴道微生物组检测产品
COVID-19 肠道微生物组 HMP 数据作为 COVID-19 肠道微生物组研究健康对照 30+ 篇 COVID-19 微生物组论文
肠脑轴研究 HMP 肠道数据作为自闭症/抑郁症研究参考 微生物组-肠-脑轴机制论文
免疫治疗响应预测 基于 HMP 参考基因组的菌株分析预测免疫治疗响应 Nature Medicine 2024
CRC 筛查 HMP 数据作为健康对照,训练 CRC 微生物组分类器 早期 CRC 无创筛查
益生菌开发 HMP 参考基因组帮助识别潜在益生菌菌株 多株益生菌进入临床试验
抗生素影响评估 HMP 健康基线用于评估抗生素对微生物组的影响 抗生素使用指南优化

§8.5 生态快照

微生物组数据生态图
                    ┌─────────────────┐
                    │   健康参考基线   │
                    │   HMP (NIH)     │
                    └───────┬─────────┘
                            │
            ┌───────────────┼───────────────┐
            │               │               │
    ┌───────▼───────┐ ┌────▼────┐ ┌────────▼────────┐
    │  疾病队列      │ │ 工具生态 │ │  整合数据库     │
    │  iHMP (3队列)  │ │ QIIME2  │ │  GMrepo         │
    │  MetaHIT       │ │ MetaPhlAn│ │  curatedMetagenomic│
    │  American Gut  │ │ HUMAnN  │ │  MGnify         │
    │  TEDDY         │ │ Mothur  │ │                 │
    └───────┬───────┘ └────┬────┘ └────────┬────────┘
            │               │               │
            └───────────────┼───────────────┘
                            │
                    ┌───────▼─────────┐
                    │   AI 应用层      │
                    │  疾病预测        │
                    │  生物标志物挖掘  │
                    │  微生物组疗法    │
                    │  个性化营养      │
                    └─────────────────┘

§8.6 HMP vs 后续微生物组项目

项目 时间 规模 独特定位 与 HMP 关系
HMP1 2008-2012 300 健康成人 全身 18 部位基线
HMP1-II 2014-2017 2,355 宏基因组 菌株水平 + 纵向 HMP1 扩展
iHMP 2014-2019 1,765 疾病队列 三疾病多组学纵向 HMP 第二阶段
American Gut 2012- 15,096 参与者 公民科学 + 饮食 使用 HMP 为参考
Earth Microbiome Project 2010-2018 27,751 样本 全球环境微生物组 互补(非人体)
MGnify 2016- 持续增长 EBI 维护的微生物组数据库 整合 HMP 数据
GMrepo 2020- 58,902 样本 整合多疾病肠道数据 包含 HMP 子集

§8.7 微生物组 AI 模型演进

时代 代表模型 训练数据 核心创新 局限性
传统 ML(2012-2018) 随机森林 / SVM HMP 16S OTU 表 物种丰度 → 疾病分类 依赖手工特征工程
深度学习(2018-2022) LSTM / CNN iHMP 纵向多组学 时序建模 + 多组学融合 需要大样本量
迁移学习(2020-2024) HMP 预训练 + 微调 HMP → 疾病队列 利用健康基线迁移知识 跨人群泛化有限
基础模型(2024-) Genos-m / 微生物组 LLM 14 个肠道宏基因组队列 序列级微生物基因组表征 计算资源需求高

§9 相关资源与引用

§9.1 参考文献(BibTeX)

@article{hmp2012structure,
  title={Structure, function and diversity of the healthy human microbiome},
  author={{Human Microbiome Project Consortium}},
  journal={Nature},
  volume={486},
  number={7402},
  pages={207214},
  year={2012},
  doi={10.1038/nature11234}
}

@article{hmp2012framework,
  title={A framework for human microbiome research},
  author={{Human Microbiome Project Consortium}},
  journal={Nature},
  volume={486},
  number={7402},
  pages={215221},
  year={2012},
  doi={10.1038/nature11209}
}

@article{ihmp2019,
  title={The Integrative Human Microbiome Project},
  author={{Integrative HMP Research Network Consortium}},
  journal={Nature},
  volume={569},
  number={7758},
  pages={641648},
  year={2019},
  doi={10.1038/s41586-019-1238-8}
}

@article{lloydprice2017strains,
  title={Strains, functions and dynamics in the expanded Human Microbiome Project},
  author={Lloyd-Price, Jason and Mahurkar, Abhinav and Rahnavard, Gholamali and Crabtree, Jonathan and Orvis, Joshua and Hall, Arthur B and Brady, Ashley and Creswell, Heather H and McCracken, v and Gibbons, Sean M and others},
  journal={Nature},
  volume={550},
  number={7674},
  pages={6166},
  year={2017},
  doi={10.1038/nature23889}
}

@article{fettweis2019vaginal,
  title={The vaginal microbiome and preterm birth},
  author={Fettweis, Jennifer M and Serrano, Myrna G and Brooks, Jennifer P and Edwards, David J and Girerd, Philippe H and Parhi, Harinder S and Huang, Baojiang and Arodz, Timothy J and Edupuganti, Lakshmi and Glascock, Asfaw and others},
  journal={Nature Medicine},
  volume={25},
  number={6},
  pages={10121021},
  year={2019},
  doi={10.1038/s41591-019-0450-2}
}

@article{lloydprice2019multiomics,
  title={Multi-omics of the gut microbial ecosystem in inflammatory bowel diseases},
  author={Lloyd-Price, Jason and Arze, Cesar and Ananthakrishnan, Ashwin N and Schirmer, Melanie and Avila-Pacheco, Julian and Poon, Tiffany W and Andrews, Elizabeth and Ajami, Nadim J and Bonham, Kelsey S and Brislawn, Christopher J and others},
  journal={Nature},
  volume={569},
  number={7758},
  pages={655662},
  year={2019},
  doi={10.1038/s41586-019-1237-9}
}

@article{jumpstart2010catalog,
  title={A catalog of reference genomes from the human microbiome},
  author={{Human Microbiome Jumpstart Reference Strains Consortium}},
  journal={Science},
  volume={328},
  number={5981},
  pages={994999},
  year={2010},
  doi={10.1126/science.1183605}
}

@article{caporaso2010qiime,
  title={QIIME allows analysis of high-throughput community sequencing data},
  author={Caporaso, J Gregory and Kuczynski, Justin and Stombaugh, Jesse and Bittinger, Kyle and Bushman, Frederic D and Costello, Elizabeth K and Fierer, Noah and Pe\~na, Antonio Gonzalez and Goodrich, Julia K and Gordon, Jeffrey I and others},
  journal={Nature Methods},
  volume={7},
  number={5},
  pages={335336},
  year={2010},
  doi={10.1038/nmeth.f.303}
}

@article{truong2015metaphlan,
  title={MetaPhlAn2 for enhanced metagenomic taxonomic profiling},
  author={Truong, Duy Tin and Franzosa, Eric A and Tickle, Timothy L and Scholz, Matthew and Weingart, George and Pasolli, Nicola and Tett, Adrian and Huttenhower, Curtis and Segata, Nicola},
  journal={Nature Methods},
  volume={12},
  number={10},
  pages={902903},
  year={2015},
  doi={10.1038/nmeth.3589}
}

@article{franzosa2018species,
  title={Species-level functional profiling of metagenomes and metatranscriptomes},
  author={Franzosa, Eric A and McIver, Lauren J and Rahnavard, Gholamali and Thompson, Luke R and Schirmer, Melanie and Weingart, George and Lipson, Karen Schwarzberg and Knight, Rob and Caporaso, J Gregory and Segata, Nicola and Huttenhower, Curtis},
  journal={Nature Methods},
  volume={15},
  number={11},
  pages={962968},
  year={2018},
  doi={10.1038/s41592-018-0176-y}
}

§9.2 资源 URL

资源 URL 类型
NIH HMP 官方页面 https://commonfund.nih.gov/hmp 官方
HMP DACC Portal https://portal.hmpdacc.org/ 数据门户
HMP DACC 旧版 https://www.hmpdacc.org/ 数据门户(旧)
AWS Open Data https://registry.opendata.aws/human-microbiome-project/ 云端数据
NCBI BioProject https://www.ncbi.nlm.nih.gov/bioproject/PRJNA28331 参考基因组
NCBI SRA https://www.ncbi.nlm.nih.gov/sra 测序数据
dbGaP https://www.ncbi.nlm.nih.gov/gap/ 受控访问
Metabolomics Workbench https://www.metabolomicsworkbench.org/ 代谢组学
iHMP DCC http://www.ihmpdcc.org iHMP 数据
QIIME2 https://qiime2.org/ 分析工具
MetaPhlAn https://github.com/biobakery/MetaPhlAn 分析工具
HUMAnN https://huttenhower.sph.harvard.edu/humann 分析工具
HMP16SData ® https://bioconductor.org/packages/HMP16SData/ R 数据包
Mothur https://mothur.org/ 分析工具
DACC GitHub Schemas https://github.com/ihmpdcc/osdf-schemas 数据模型
Nature iHMP Collection https://www.nature.com/collections/fiabfcjbfj 论文集

§10 AI 使用声明卡

声明项 内容
数据集用途 微生物组研究、疾病生物标志物挖掘、宿主-微生物互作建模、微生物组 AI 训练
适用人群 生物信息学家、微生物组研究者、AI/ML 工程师、临床微生物学家
使用限制 开放数据无使用限制(CC0);受控数据须遵守 dbGaP Data Use Certification
引用要求 使用时须引用 Nature 2012(HMP1)和/或 Nature 2019(iHMP)
数据更新状态 项目已于 2017 年从 Common Fund 过渡,数据不再主动更新但持续可用
人群适用性 主要基于美国白人健康成人队列,全球人群适用性有限
技术平台说明 16S 数据使用 Roche 454 FLX(已停产),分析时需注意平台兼容性
临床决策限制 本数据集不直接用于临床诊断,仅作为研究参考基线
AI 模型透明度 基于 HMP 训练的 AI 模型须报告训练数据的人群构成与技术平台
版本标识 本页面基于 HMP1(2012)+ HMP1-II(2017)+ iHMP(2019)数据编写

页面状态:published

§C 机器可读元数据校验表

校验项 字段 状态 说明
1 @context 多命名空间 schema.org + cr + rai + dct
2 @graph 结构 MedicalWebPage + Dataset 两节点
3 MedicalWebPage @id …#webpage
4 MedicalWebPage name “HMP — 人类微生物组计划 AI-Ready Wikipedia”
5 MedicalWebPage url https://qianfanghub.com/ai-ready-dataset/hmp/44
6 MedicalWebPage lastReviewed 2026-08-04
7 MedicalWebPage reviewedBy 千方病案医学编辑部
8 MedicalWebPage mainEntity 指向 #dataset
9 Dataset @id …#dataset
10 Dataset name Human Microbiome Project (HMP)
11 Dataset creator NIH Common Fund HMP Consortium
12 Dataset dateCreated 2008-10
13 Dataset dateModified 2019-05
14 Dataset keywords 中英双语
15 Dataset license CC0
16 Dataset isAccessibleForFree true
17 Dataset measurementTechnique 6 种测序方法
18 Dataset temporalCoverage 2008-2016
19 Dataset spatialCoverage United States
20 Dataset distribution 3 个 DataDownload
21 Dataset sameAs DOI 10.1038/nature11234
22 Dataset conformsTo Croissant 1.1
23 cr:recordSet 4 个 RecordSet
24 rai:dataLimitations 人群偏倚 + 平台过时
25 rai:dataBiases 4 项偏倚声明
26 rai:useCases 7 项用例
27 rai:personalSensitiveInformation dbGaP 受控访问
28 rai:dataCollection 采样协议描述
29 rai:annotatorDemographics DACC 统一管线
30 rai:machineAnnotationTools 8 个工具
31 URL slug/id hmp/44
32 单一 JSON-LD 块 一个 &lt;script&gt;
33 无独立 Croissant 块 并入 Dataset 节点
返回 AI Ready 数据集