American Gut Project — 全球最大公民科学微生物组参考库 AI-Ready Wikipedia

11,336 名公民科学家贡献 15,096 个 16S 样本的开放人类微生物组参考库

来源 UC San Diego Knight Lab / The Microsetta Initiative url: https://microsetta.ucsd.edu/发布时间: 2026-09-18最后更新: 2026-09-25 阅读 29
American Gut Project — 全球最大公民科学微生物组参考库 AI-Ready Wikipedia

信息速览

数据集名称American Gut Project — 全球最大公民科学微生物组参考库 AI-Ready Wikipedia
数据类型15,096 个微生物组样本,11,336 名参与者,16S V4 测序 + 问卷元数据,开放获取
规模11,336 名参与者(15,096 个样本,截至 2017-05)
接入方式UC San Diego Knight Lab / The Microsetta Initiative url: https://microsetta.ucsd.edu/
AI 就绪度

American Gut Project — 全球最大公民科学微生物组参考库 AI-Ready Wikipedia


INFOBOX

数据集名称 American Gut Project
英文全称 American Gut Project(现为 The Microsetta Initiative 旗下项目)
别名/简称 AGP、American Gut、英国分部 British Gut、澳洲分部 Australian Gut
疾病分类 健康与工业化人群疾病谱自报标签(ICD-11:DD70 克罗恩病 / DD71 溃疡性结肠炎 / 5A11 2 型糖尿病 / 6A70 抑郁障碍 / 5B80 肥胖症等)
SNOMED CT 34000004 Crohn’s disease / 64533001 Ulcerative colitis / 44054006 Diabetes mellitus type 2 / 35489006 Depressive disorder(均为自报标签,详见 §2.2)
数据模态 16S rRNA V4 扩增子测序、自报问卷元数据;子集含非靶向代谢组与鸟枪宏基因组
AI 任务类型 饮食/生活方式-菌群关联建模、α/β 多样性预测、疾病-菌群分类、参考图谱定位(microbiome GPS)、组成性数据分析方法评测、元数据填补
样本总数 15,096 个样本 / 11,336 名参与者(截至 2017-05 论文快照;Qiita 版本持续增长)
数据大小 4.67 亿条 16S 读段(FASTQ GB 级)+ sOTU 特征表与问卷元数据(MB 级)
数据格式 FASTQ / BIOM / TSV(sample metadata)/ QIIME 2 archive(Qiita artifact)/ mzTab(GNPS 代谢组)
许可证 去标识化数据进入 Public Domain(无访问限制);mSystems 论文 CC BY 4.0
访问级别 开放(EBI 直接下载;Qiita 需免费注册)
DUO 标签 NRES(公开数据,无使用限制)
语言 英文(问卷与元数据)
首发日期 2012-11(项目启动)/ 2018-05-15(mSystems 主论文发表)
最后更新 持续更新(2018 年起由 The Microsetta Initiative 接续运营)
发布机构 UC San Diego Knight Lab / Center for Microbiome Innovation(联合 EMP、Human Food Project)
官方主页 https://microsetta.ucsd.edu/
下载地址 https://qiita.ucsd.edu/study/description/10317
DOI 10.1128/mSystems.00031-18(论文)/ ERP012803(EBI 数据集 accession)
引用次数 986+(Crossref Cited by,截至 2026-09)
AI 就绪度评分 ⭐⭐⭐⭐(4/5)— 完全开放获取、EMP 标准协议、BIOM 即取即用;扣分项:无官方划分、49 个测序批次与两版引物混杂、自报元数据需清洗、组成性数据不可直接套常规模型
页面状态 published

§0 E-E-A-T 审核声明

医学审核:[千方病案医学编辑部] 交叉审核:§2 医学背景(ICD-11 与 SNOMED CT 映射、自报疾病谱流行病学)、§7 偏倚分析(自选偏倚、代表性、公平性)。

数据工程审核:[千方病案医学编辑部交叉审核] 医疗 AI 数据工程师,审核范围:§4 DAIMS 数据字典、§5 数据划分策略、§6 预处理 Pipeline 和坑点。

审核日期:2026-09-17

医疗免责声明:本页面提供的医学信息仅供研究和教育目的,不构成医疗建议、诊断或治疗方案。数据集的医学描述基于公开发表的文献,未经逐一临床验证。任何基于该数据集训练的 AI 模型在应用于临床决策前,必须经过独立的临床验证和监管审批。

技术免责声明:本页面的代码示例、预处理建议和基准性能数据基于公开资料整理,不保证在特定环境下的准确性和适用性。使用者应自行验证代码安全性和数据预处理流程的正确性。千方病案医数集不对因使用本页面信息而导致的任何直接或间接损失承担责任。

数据使用合规:使用本页面描述的数据集前,请务必阅读并遵守数据集原始许可协议。American Gut Project 的去标识化数据进入 public domain,经 EBI(ERP012803)与 Qiita(study 10317)开放获取;Qiita 下载需免费注册账号。DUO 标签仅供参考,具体使用限制以数据集官方协议为准。


§1 数据集概览

§1.0 📌 30 秒速览

这是什么? American Gut Project(美国肠道计划,AGP)是一个"全民参与"的人类微生物组研究:任何人在官网支付 99 美元(或由赞助方代付)即可获得采样盒,用干拭子蘸取少量粪便(或口腔、皮肤样本)常温邮寄到 UC San Diego 实验室,16S rRNA 测序后收到一份"你的肠道里住着谁"的教育报告。截至 2017 年 5 月,11,336 名普通民众贡献了 15,096 个样本,是全球已发表的最大的公民科学人类微生物组数据集。

为什么重要? 在 AGP 之前,肠道菌群研究多来自数百人规模的精心设计队列,人群多样性受限。AGP 用"众包众筹"换取空前的样本规模与人群多样性——覆盖 45+ 国家/地区、横跨从纯素到近纯肉的饮食谱系——首次以工业化人群为对象建立起最大的公开肠道菌群参考数据库。所有数据无条件开放(public domain),任何研究者可直接下载复用。

我能用它做什么? 训练菌群-饮食/生活方式关联模型、构建"把你放进人群分布"的参考图谱(microbiome GPS)、评测组成性数据分析与去批次算法、开发自报元数据填补方法,或直接将其作为教学素材。注意:它是观察性、自报、常温邮寄的数据,适合"发现关联与建参考系",不适合做临床诊断或因果推断。

阅读路径:想直接动手 → §6(含可运行代码与 8 个坑点);想评估适不适合你的任务 → §1.2 与 §7;写论文引用 → §9;快速核对硬事实 → INFOBOX 与 §3。

§1.1 摘要

AGP 于 2012 年 11 月由 Rob Knight、Jeff Leach 与 Jack Gilbert 共同创立,是地球微生物组计划(EMP)与 Human Food Project 的合作子项目。参与者通过 Indiegogo/FundRazr 众筹平台付费获得采样盒,使用 BBL Culture Swabs 干拭子采集粪便、口腔或皮肤样本常温寄回(英/澳经本地聚合站中转);所有样本统一在 UC San Diego 单一实验室按 EMP 标准协议提取 DNA,扩增 16S rRNA V4 区(515F/806R 引物,两代版本),在 Illumina MiSeq(批次 1-19、23-49)与 HiSeq(批次 20-22)上测序。序列经 Deblur(截断 125 nt)生成 sOTU,移除邮寄过生长(bloom)序列后插入 Greengenes 13_8 参考树。截至 2017 年 5 月,累计 15,096 个样本、11,336 人、4.67 亿条读段(48,599 条 unique sOTU),配套自报问卷(每题中位应答率 70.9%),14.8% 参与者完成 VioScreen 食物频率问卷,数千样本另有非靶向代谢组与鸟枪宏基因组数据。主成果发表于 mSystems(McDonald et al. 2018,DOI 10.1128/mSystems.00031-18),全部去标识化数据持续存入 public domain。2018 年项目升级为伞状的 The Microsetta Initiative(TMI),样本采集与数据扩张至今延续。

§1.2 战略价值

维度一:工业化人群肠道菌群的"地图底图"。 AGP 是截至论文发表时最大的公开人类肠道微生物组参考数据库(15,096 样本),其价值类似地理领域的"底图":任何小型研究的菌群谱都可以投到 AGP 分布上做定位(论文称之为从"绘图"到"microbiome GPS"的跨越)。分析显示约 3,000 个样本后新 sOTU 发现率即明显下降,说明该规模已能刻画工业化人群肠道菌群的主要组成边界;同时 AGP 人类肠道样本间的 β 多样性变异竟大于 EMP 环境样本间的变异,为"人类菌群个体差异空间有多大"提供了前所未有的量化基准。对 AI 团队而言,它是菌群预训练表征、参考坐标嵌入与异常检测的理想底图。

维度二:公民科学开放范式的"基础设施标本"。 AGP 证明了众筹 + 众包 + 即时开放(数据产生即入 public domain)的完整闭环:标准化 EMP 协议、IRB 明确授权公开、问卷控制词表、开源 Jupyter 分析、参与者回馈报告。这一范式本身成为后续项目(英国双胞胎队列扩展、Australian Gut、Microsetta 国际网络)的模板。对方法论研究者,它是天然的"真实世界脏数据"基准——49 个测序批次、两版引物、常温邮寄 bloom、自报噪声——为去批次、数据清洗、鲁棒建模算法提供了稀缺的开放测试场。

§1.3 同类数据集横向对比

数据集 规模 人群与设计 模态 标注 与 AGP 的差异
American Gut Project 15,096 样本 / 11,336 人 公民科学自选人群,美/英/澳 + 42 国 16S V4 + 问卷;子集代谢组、shotgun 自报问卷(弱监督) 规模最大、完全开放、人群噪声最高
Human Microbiome Project 2(HMP2/IBDMDB) ~百人级纵向 临床设计队列(IBD 等) 宏基因组 + 转录组 + 代谢组 + 16S 临床随访 设计严谨但规模小、人群窄
TwinsUK ~万级样本 英国双胞胎纵向队列 16S/宏基因组 + 深度表型 临床+家族结构 有遗传配对设计,可做宿主遗传控制
Flemish Gut Flora Project(FGFP) ~数千人 比利时一般人群横断面 16S/shotgun + 问卷 自报+临床检测 地理单一但人群无付费门槛
MetaHIT 百人级 欧洲 IBD/IBS 定向队列 shotgun + 元基因组 临床+自报 疾病定向、shotgun 为主,无公民科学维度
The Microsetta Initiative(AGP 后继) 持续增长 AGP 伞状国际扩展 16S V4/V1-V3 + 问卷 自报问卷 AGP 的"活体续集",含 COVID 子研究

§1.4 版本时间轴

时间 版本/事件 说明
2012-11 项目启动 众筹上线(Indiegogo),CU Boulder IRB #12-0582
2013-2014 扩至英国、澳大利亚 British Gut(King’s College London)、Australian Gut(UQ)分部成立
2014-08 引物版本切换 515f/806r → 515fB/806rB(barcode 从反向引物移至正向引物),旧数据兼容靠 125 nt 截断统一
2015-02 IRB 迁移 UCSD HRPP 协议 #141853 接管,明确授权公开去标识化数据
2017-05 数据快照 15,096 样本 / 11,336 人,构成主论文分析基底
2018-05-15 mSystems 主论文 DOI 10.1128/mSystems.00031-18;同日宣布 The Microsetta Initiative
2018 至今 TMI 时代 数据经 Qiita study 10317 持续增长;AGP 品牌并入 TMI

§1.5 典型应用场景

  1. 人群参考定位(microbiome GPS):将自有队列的 β 多样性谱投到 AGP 参考分布上,判断样本"落在工业化人群的哪个位置"。
  2. 饮食-菌群关联建模:以每周植物种类数(plants per week)等饮食字段为特征,复现"每周 >30 种植物者 α 多样性更高"级别的关联并扩展建模。
  3. 组成性数据分析方法评测:用 49 批次、跨引物版本的 sOTU 表测试 CLR/ALDEx2/ANCOM-BC、去 bloom、去批次算法的鲁棒性。
  4. 自报元数据质量工程:研究弱监督标签噪声、缺失机制(选答题 70.9% 应答率)与填补策略。
  5. 科普与教学:配套 Coursera 课程 Gut Check: Exploring Your Microbiome 与 Open Humans 个人数据回传,是数据素养教育的天然素材。
  6. 标签校准与测量误差研究:以 VioScreen 子集(n=1,762)为金标准锚点,研究主问卷饮食字段的测量误差结构、缺失机制与校准方法(坑点 4 的正面用法)。
  7. 跨项目 meta 分析底座:与 EMP、TwinsUK、FGFP 做联合差异丰度分析——协议同源(EMP 标准)但 sample_name 体系相互独立,对齐工作量可控。

§2 医学背景

§2.1 ICD-11 编码映射

AGP 并非以单一疾病为核心的临床数据集,而是以健康人群为底、叠加自报疾病谱标签的人群微生物组参考库。下表列出主要自报疾病标签及其 ICD-11 映射(注意:全部为参与者自报,未经临床验证):

自报状况 ICD-11 编码 ICD-11 中文名称 在 AGP 中的角色
克罗恩病 DD70 克罗恩病 自报疾病史字段;参与者较全美人群约 6 倍富集
溃疡性结肠炎 DD71 溃疡性结肠炎 自报疾病史字段;IBD 亚组分析常用
2 型糖尿病 5A11 2 型糖尿病 自报疾病史字段;菌群关联探索
抑郁障碍 6A70 抑郁障碍 心理健康问卷字段;125 人匹配对照亚组
双相障碍 6A60 双相障碍 心理健康问卷字段
创伤后应激障碍 6B40 创伤后应激障碍 心理健康问卷字段
肥胖症 5B80 肥胖症 BMI 计算字段(自报身高体重);健康子集排除项
抗生素使用 无直接编码(相关:QA02 用药史) — 近一月/一年抗生素使用字段;多样性关联核心变量
高血压 BA00 高血压病 自报疾病史字段;代谢综合征亚组分析常用

§2.1b SNOMED CT 映射

标签 ICD-11 SNOMED CT 码 SNOMED 术语
克罗恩病 DD70 34000004 Crohn’s disease
溃疡性结肠炎 DD71 64533001 Ulcerative colitis
2 型糖尿病 5A11 44054006 Diabetes mellitus type 2
抑郁障碍 6A70 35489006 Depressive disorder
粪便样本 — 119332005 Feces specimen
口腔/皮肤拭子 — 258498002 / 119324003? Swab specimen 类(按具体部位取子概念)

§2.2 疾病简介与流行病学

AGP 覆盖的"疾病"本质上是工业化人群中最常见的慢性状态标签。以论文健康子集(20-69 岁、BMI 18.5-30、无 IBD/糖尿病、近一年无抗生素,n=3,942)为对照,其他参与者即构成"偏离健康定义"的现实谱系。三个方向最受关注:

  • 炎症性肠病(IBD):参与式招募使 IBD 患者显著富集——研究者报告 AGP 中 IBD 参与者比例约为全美人群的 6 倍,使 AGP 成为无需临床动员即可获得的 IBD 菌群"准病例池"。
  • 心理健康:主论文将 125 名自报精神疾病(抑郁、双相、PTSD、精神分裂)参与者按国家/年龄/性别/BMI 与对照 1:1 匹配,发现精神疾病参与者肠道菌群彼此更相似的聚类模式,在美英两国、两性及各年龄段均成立。
  • 代谢与饮食:2 型糖尿病、肥胖与抗生素使用通过自报字段进入分析;"每周食用植物种类数"这一细粒度饮食变量被证明比"素食/杂食"类标签更具解释力——每周 >30 种植物者(n=41)α 多样性显著高于 ≤10 种者(n=44)。
  • 抗生素暴露:问卷按时间窗(近一周/近一月/近一年)分级采集抗生素使用,是队列中效应量最明确的暴露之一——论文以近一月使用者(n=139)与一年未用者(n=117)的对照展示微生物多样性下降与代谢组"悖论"。建议建模时保留时间窗粒度而非合并为二元变量。
  • 饮食表型的两套口径:主问卷的 plants_per_week(全队列覆盖)与 VioScreen 的营养素级定量(14.8% 子集)构成"广覆盖弱精度 + 小样本高精度"的双层结构,是研究弱监督标签校准与测量误差模型的理想教材。

需要强调的流行病学边界:AGP 人群偏向高学历、高收入、城市居住者,吸烟率与肥胖率低于全美平均水平,Hispanic 与非裔社区代表性不足——它刻画的是"工业化国家关注健康的中产人群"的菌群参考系,而非全人群普查。

§2.3 临床任务定义

AGP 不定义筛查/诊断/分级/预后任务——它是横断面观察性数据,所有报告明确声明非医学可操作。它的"任务"以研究形式存在:

  • 关联发现:给定自报协变量(饮食、抗生素、心理健康、睡眠等),预测/解释菌群 α 多样性或 β 多样性结构。
  • 参考定位:将新样本嵌入 AGP 参考分布(论文愿景:“microbiome GPS”——不仅告诉你现在在哪,还告诉你想去哪该怎么走)。
  • 标签噪声与缺失建模:把自报问卷当作真实世界弱监督标签的标准研究场景。
  • 行为变量建模:排便频率、睡眠时长、饮酒频率等"高频低精度"自报变量均以受控词表采集,适合做标签噪声与稳健性研究。
  • 方法学基准:为去 bloom、去批次、组成性统计、尺度化 UniFrac(Striped UniFrac 即为此规模而生)提供测试场。
  • 异常检测与 QC 参照:判断新样本是否落在工业化人群参考分布之外(极度低多样性、菌群单一化等),用于队列质控而非临床警报。
  • 多模态对齐研究:16S + 非靶向代谢组 + 鸟枪宏基因组的重叠子集为"同一人、多组学"联合建模(多视图学习、分子网络-菌群共变)提供小规模真实对齐场景。

§2.4 参与者人群表

维度 描述
来源 公民科学众筹(Indiegogo/FundRazr,典型 99 美元/样本,无支付能力者可由赞助方覆盖)
时间窗 2012-12 至 2017-05 构成论文快照;TMI 时代延续至今
地理 美国参与者 n=7,860、英国 n=2,518、澳大利亚 n=321,另 42 个国家/地区
居住类型(美国,ZIP 级) 城市 n=7,317 / 农村社区 n=29 / 混合 n=98
年龄 跨度极大(成人为主,问卷含儿童样本);健康子集限定 20-69 岁
性别 两性均有大规模覆盖,无强制配比
种族/族裔 以白人为主,跨度大于其他大型微生物组项目,但 Hispanic 与非裔代表性不足
就医类型 无需就医;社区人群,无临床入组流程(IRB 线上知情同意)
健康定义子集 n=3,942(20-69 岁、BMI 18.5-30、无 IBD/糖尿病、近一年无抗生素)
饮食精细表型子集 n=1,762(14.8%)完成 VioScreen 图像化食物频率问卷
抗生素暴露字段 近一周/近一月/近一年三档时间窗;论文对照近一月使用者 n=139 vs 一年未用者 n=117
心理健康专项 自报精神疾病 n=125(抑郁/双相/PTSD/精神分裂),触发式追问 + 按 4 协变量 1:1 匹配对照
多部位贡献者 少数参与者贡献粪/口/肤多部位或多时点样本——同人多样本是泄漏管理重点(§5.3)
教育与收入 自报字段、缺失偏重(§4.5)

§2.5 临床价值

AGP 的临床价值在于"参考"与"假说"而非"诊断":它为工业化人群肠道菌群提供了正常分布的量化底图,使"某个人的菌群位于人群什么分位"成为可回答的问题;它把饮食多样性、抗生素暴露、睡眠、心理健康等生活方式因素与菌群的关联在万级人群中做了首次规模化确认,为后续纵向与干预研究(FMT 队列、婴儿时序研究等)提供假说;它还以参与式设计回答了"民众能不能、愿不愿意、以什么质量参与医学研究"这一科学传播问题。所有结论的适用边界:关联性、横断面、自报、非临床。对 AI 从业者的直译:AGP 能回答"什么样的菌群谱在工业化人群中常见",不能回答"这个样本的主人得了什么病"——把它当先验库与 QC 参照,别当标注器。

§2.6 金标准参考表

维度 AGP 的"金标准"
划分 无官方 ML 划分;论文分析子集(健康子集 n=3,942、VioScreen 子集 n=1,762)即官方"高质量层"
标注方式 参与者自报问卷(控制词表 + 触发式追问);VioScreen FFQ 供 14.8% 子集交叉验证
标注者 参与者本人(非医学专业人员);极端值由算法门控剔除
标注性质 弱监督、自报、部分缺失(每题中位应答率 70.9%);无临床金标准标签
技术金标准 EMP 标准协议(16S V4、515F/806R、UCSD 单一实验室提取)+ Deblur sOTU + bloom 序列移除
人群金标准 无概率抽样对照——NHANES 类全国代表性调查不含菌群组学;AGP 的"人群参考"身份以规模与开放性换取代表性
纵向金标准 横断面无随访——纵向研究参照请用 HMP2/IBDMDB 或 TMI 的纵向子研究

§3 数据集规格

§3.0 版本抉择矩阵

AGP 是"活"的数据集,论文快照与持续增长版本并存,先选版本再动手:

你的需求 推荐版本 大小 理由
复现 mSystems 2018 论文结果 固定快照(BIOM + metadata,论文用集) MB-GB 级 与论文数字严格对应,不再变化,免注册
要最新、最大样本量的分析 Qiita study 10317 GB 级 持续增长,含处理后 artifact 与元数据;需免费注册
需要 raw reads 自建 pipeline EBI ERP012803(PRJEB11419) GB 级 INSDC 原始 FASTQ,可直接匿名下载
做代谢组-菌群联合分析 GNPS 代谢组数据集 GB 级 非靶向代谢组,与 16S 样本可对齐
只想快速教学演示 redbiom 查询(qiita_study_id==10317) MB 级 免注册拉取特征表与元数据
想做行为字段建模(睡眠/饮酒/运动) Qiita 活数据全字段问卷 GB 级 仅主问卷自报口径;健康子集不限制行为字段,按需自筛

§3.1 模态详情

  • 16S rRNA V4 扩增子(核心模态):遵循 EMP 标准协议。2014-08 前用 515f/806r 引物对(barcode 在反向引物),此后用更新的 515f/806rB(barcode 移至正向引物);sOTU 级处理(Deblur v1.0.2,截断 125 nt——因个别批次仅 125 cycles),移除已知 bloom 序列后经 SEPP 插入 Greengenes 13_8 99% 参考树,分类学用 RDP 分类器(QIIME 2 实现),多样性计算统一稀有化至每样本 1,250 条。
  • 自报问卷元数据:一般健康状态、疾病史、生活方式与饮食(含每周植物种类数、抗生素使用、睡眠、酒精、排便频率等),控制词表 + 触发式追问;VioScreen FFQ 提供精确定量饮食的子集。
  • 非靶向代谢组(子集):数千粪便样本的 LC-MS/MS 数据存于 GNPS,用于菌群-分子共变分析(论文发现"抗生素悖论":近期用药者微生物多样性低但代谢物多样性高)。
  • 鸟枪宏基因组(子集):部分样本另有全基因组测序与植物饮食者的抗生素抗性基因分析。
  • EMP 协议语境:AGP 的 16S 模块是 EMP 标准协议在人类粪便/口腔/皮肤上的直接应用(EMP 2017 Nature 论文与 AGP 2018 mSystems 论文共享提取/扩增/测序流程),因此与 EMP 环境、其他 EMP 人类样本的联合分析天然同源——这是选 AGP 做"参考底图"的技术前提。

§3.2 按子集样本数表

子集 规模 说明
总样本 15,096 截至 2017-05(4.67 亿条 16S 读段、48,599 条 unique sOTU)
总参与者 11,336 多数贡献 1 份粪便样本,少数多部位/多时点
美国样本 n=6,634 主队列
英国样本 n=2,071 British Gut
其他国家/地区样本 其余差额 42 个国家/地区贡献,单国规模小,分析中常并入"其他"
多部位/多时点样本 同一参与者贡献 泄漏管理重点(§5.3);论文主分析每人仅取 1 份合格粪便
代谢组/shotgun 子集 数千级 经 sample_name 与 16S 对齐(官方未发布对齐表,见 §7.7 DAIMS 项 23)
健康子集 n=3,942 单份粪便、20-69 岁、BMI 18.5-30、无 IBD/糖尿病、近一年无抗生素
VioScreen 子集 n=1,762 14.8% 参与者,精确定量饮食
心理健康亚组 n=125 自报精神疾病,1:1 匹配对照
Qiita 活数据 持续增长 study 10317,TMI 时代仍在新增

§3.3 数据格式表

格式 内容 来源
FASTQ(gzip) 原始 16S 读段(含 barcode/引物) EBI ERP012803
BIOM(HDF5/JSON) Deblur sOTU 特征表(样本 × sOTU 计数) Qiita artifact / 论文固定快照 FTP
TSV(sample metadata) 问卷元数据 + 样本技术信息 Qiita study 10317 / 快照 FTP
QIIME 2 archive(.qza) Qiita 导出的特征表/代表序列/树 artifact Qiita study 10317
mzTab / GNPS job 非靶向代谢组特征表与分子网络 GNPS
Jupyter Notebook 官方分析代码(conda 环境可复现) GitHub knightlab-analyses
Newick SEPP 插入 Greengenes 13_8 的 sOTU 系统发生树(Weighted UniFrac 需要) Qiita artifact / 快照 FTP
TSV(营养素级) VioScreen 输出的能量/宏量营养素/纤维等定量摄入 VioScreen 子集(n=1,762)
per-run TSV EBI filereport 的仪器型号/读长/读段数字段(批次建模用) ERP012803 API

§3.4 存储大小

16S 原始 FASTQ(EBI 全量下载)为 GB 级;论文快照 BIOM 特征表与元数据在 MB-GB 级;GNPS 代谢组原始文件另计 GB 级。建议为"FASTQ + QIIME 2 处理中间件"预留至少 50 GB 磁盘;若只做表格级分析,10 GB 以内足够。工程细节:同一 BIOM 表在 HDF5 与 JSON 两种序列化下体积差异可达数倍,管道传输建议 HDF5;10,000 级样本 × 48,599 维稀疏表转稠密后常驻内存约需 8-16 GB,建议以 scipy 稀疏矩阵或分块加载,进 GPU 前先 CLR 并过滤零列/极稀有列,可把活跃维度压至 1-2 万级。

§3.5 标注方式

标注 = 参与者自报。问卷基于前人研究改造,全部题目选答;核心质量机制有三:① 控制词表(多选题 + 有界数值输入)压制自由文本噪声;② 触发式追问与疾病专项问卷(自报 IBD 等会触发扩展问题);③ 数值极端值门控(身高 48-210 cm、体重 2.5-200 kg、BMI 异常剔除、明显矛盾答案如"幼儿饮酒"剔除)。属于弱监督标注,无任何临床复核。

§3.6 标注者资质与一致性

标注者即参与者本人,无医学资质要求,无标注者间一致性可计算。间接一致性证据来自 14.8% 完成 VioScreen FFQ 的子集:其精确定量饮食答案与主问卷饮食答案的相关性良好(论文 Table S2),说明主要饮食字段的自报信度可接受;但运动等行为变量存在"报告与说谎"的经典不可辨问题(研究者原话:要么关联运动,要么关联谎报运动)。

§3.7 采集周期

论文快照覆盖 2012-12(首批样本)至 2017-05;49 个测序批次横跨 2013-2017。TMI 时代(2018 至今)样本持续新增,Qiita 上的活数据不存在"完成时"。另需注意:英/澳样本经聚合站暂存引入额外时滞(采样日与收样日相差数天),做季节性分析时以 collection_date 为准并在局限中说明。

§3.8 地域覆盖

美国(参与者 n=7,860)为绝对主体,英国(n=2,518)与澳大利亚(n=321)经本地聚合站中转(英/澳样本先在聚合站 -80 °C 保存再批量干冰运美),另覆盖 42 个国家/地区。地理跨度大但人群结构单一(工业化、高教育、城市),非工业化人群仅存在于对照性 meta 分析而非 AGP 本体。城市/农村字段基于 US ZIP 前三位与城市化常数表,仅美国样本可用;英国样本只能到国家级。

§3.9 设备规格

  • 采样:BBL Culture Swabs(BD)干拭子,无保存液,常温邮寄(系统基准研究证实运输条件对后续 bloom 修正有效)。
  • 测序:批次 1-19 与 23-49 用 Illumina MiSeq;批次 20-21 用 HiSeq Rapid Run;批次 22 用 HiSeq High-Output(EBI 记录仪器字段为 Illumina HiSeq 2500);合计 49 个批次、三种平台配置、两版引物。
  • 文库:EMP 标准 V4 双端方案(2×150 或 2×125 cycles),掺 5-10% PhiX。
  • 质量谱提示:PhiX 掺入与低多样性文库的质控痕迹可直接从 FASTQ 碱基质量分布观察——MiSeq 批次(1-19、23-49)与 HiSeq 批次(20-22)质量谱不同,是批次效应最直观的来源之一。

§3.10 深度溯源链

每份样本可沿完整链条追溯:参与者账户(TMI/Open Humans)→ 采样盒编号 → 邮寄批次(英/澳聚合站 -80 °C 暂存 → 干冰运美)→ UCSD 实验室 DNA 提取 → 测序批次(EBI per-round accession,论文 Table S1 提供每批次 accession 对照)→ Deblur sOTU 表 → Qiita artifact 版本 / EBI ERP012803。技术元数据(引物版本、测序仪、lane、plate)与生物元数据(body site、饮食、疾病史)分列,可支撑批次效应建模。工程建议:把"快照版本 + 下载日期 + 表形状校验和"写入项目 README,让溯源链从论文级细化到工程级(与 §6.10 MLOps 笔记一致)。


§4 数据结构

§4.0 目录树

从论文固定快照 FTP 或 Qiita 导出后,典型解压结构如下(列名以 Qiita prep information 文件为准):

agp/
├── 16s/                                    # 16S 扩增子数据
│   ├── raw/                                # EBI ERP012803 原始 FASTQ(按 run 分目录)
│   │   ├── ERR*/                           # 每个测序 run 一个目录
│   │   │   ├── *_1.fastq.gz                # R1(正向读段,barcode 随版本在 R1 或 R2)
│   │   │   └── *_2.fastq.gz                # R2
│   │   └── ...
│   ├── agp_125nt_sotu.biom                 # Deblur sOTU 特征表(样本 × sOTU)
│   ├── agp_sotu_seqs.fasta                 # sOTU 代表序列
│   ├── agp_sotu_tree.nwk                   # SEPP 插入 Greengenes 13_8 后的系统树
│   ├── taxonomy_gg138.tsv                  # RDP 分类结果
│   └── per_run_report.tsv                  # EBI filereport 导出的 run 级技术字段(仪器/读长/读段数)
├── metadata/
│   ├── sample_metadata.tsv                 # 样本级元数据(主表)
│   ├── prep_information.tsv                # 技术元数据(批次/引物/仪器/plate)
│   └── vioscreen/                          # VioScreen FFQ 子集(n=1,762)
├── metabolomics/
│   ├── gnps_feature_table.tsv              # GNPS 分子特征表
│   └── gnps_molecular_network/             # 分子网络作业
├── notebooks/                              # 官方 Jupyter 分析(conda 环境)
└── docs/
    ├── mapping_files/                      # 问卷字段 → 控制词表映射
    └── table_s1_batch_accessions.xlsx      # 每测序批次 ↔ EBI accession 对照

§4.1 DAIMS 字段字典

核心字段(8 列:字段名/类型/说明/示例值/AI 用途/观测误差/信息性缺失编码/取值范围)。实际列名与顺序以 Qiita prep information file 为准:

字段名 类型 说明 示例值 AI 用途 观测误差 信息性缺失 取值范围
sample_name Text 样本唯一主键(如 10317.000066637) 10317.000066637 主键/对齐锚点 无 无 Qiita 编号体系
participant_id Text 参与者主键(同人多样本分组的 group 键) 000066637 GroupKFold/泄漏防控 无 无 与 sample_name 一一对应
body_site Text 采样部位 fecal / oral / skin 分层/子集选择 低 无 受控词表
country Text 参与者国家 United States 地域分层 低 无 受控词表
age_years Integer 自报年龄 34 协变量/分层 自报误差(出生日期矛盾即剔除) 选答缺失 门控后 0-100+
sex Text 自报性别 female 协变量 低 选答缺失 受控词表
bmi Float 自报身高体重计算 23.6 协变量/健康子集判定 自报误差(超 200 kg/2.5 kg 剔除) 依赖身高体重双缺 18.5-30 定义健康层
plants_per_week Integer 每周食用植物种类数 28 饮食多样性核心特征 回忆偏倚 选答缺失 0-40+
antibiotics_past_year Text 近一年抗生素使用 I have not taken antibiotics in the past year 暴露变量 回忆偏倚 选答缺失 受控词表
collection_date Date 采样日期 2016-11-30 时间趋势/批次协变量 低 无 2012-12 至今
total_seq_per_sample Integer 每样本读段数 9,850 深度过滤/稀有化 无 无 ≥1,250(分析门槛)
diet_type Text 自报饮食类型 Omnivore 饮食分组/混杂控制 自报误差(可能与 plants_per_week 矛盾,坑点 4) 选答缺失 受控词表
alcohol_consumption Text 自报饮酒频率 Never 生活方式暴露变量 回忆/社会期许偏倚 选答缺失 受控词表
sleep_duration Text 自报平均睡眠时长 7-8 hours 生活方式-菌群关联探索 回忆偏倚 选答缺失 受控词表
height_cm / weight_kg Float 自报身高/体重(bmi 计算源) 175.0 / 70.5 门控字段/健康子集判定 自报误差(官方门控 48-210 cm / 2.5-200 kg) 双缺则 bmi 缺失 门控区间内
sequencing_batch Text 测序批次(prep information 文件) Batch_15 批次效应建模/LOBO 划分 无 无 1-49
引物版本/仪器/plate/lane Text 技术元数据组(prep information) 515fB/806rB 批次协变量与 QC 无 无 以 prep information 为准

§4.2 标签分布

  • 部位:粪便样本绝对主导(每位参与者至少一份合格粪便样本入选主分析;口腔、皮肤等部位构成补充);分析规则为每人优先选 1 份粪便样本。
  • 健康层:健康子集 n=3,942(占参与者约 35%),其余为偏离健康定义的现实谱系(BMI 超界、慢性病、近期抗生素等)。
  • 饮食:plants_per_week 从 0 到 40+ 全谱分布;论文两组对照(>30 种 vs ≤10 种)分别为 41 与 44 人。
  • 地理:美国 n=6,634 / 英国 n=2,071 样本,美英 α 多样性差异显著(论文 Figure 1C)。
  • 抗生素:近一月使用者 n=139、一年未用者 n=117 的论文对照设计可直接复用为"高信噪比"子任务。
  • 心理健康:自报精神疾病 125 人 + 1:1 匹配对照 125 人;触发式专项问卷覆盖抑郁/双相/PTSD/精神分裂。
  • 部位长尾:除粪/口/肤外尚有耳、鼻、毛发、生殖道等数十种自选部位——类别极多、单类极小,建模前按层级归组或限定主部位。
  • "全库 vs 分析口径"的规模差:全库 15,096 样本;进入论文主分析(粪便、≥1,250 读段、每人 1 份)后样本量明显缩小——引用任何"样本数"先核对口径。

§4.3 关键统计

  • 4.67 亿条 16S 读段、48,599 条 unique V4 sOTU(Greengenes 13_8 参考树内)。
  • 每题中位应答率 70.9%(全部题目选答);14.8% 完成 VioScreen FFQ。
  • 新 sOTU 发现率约在 3,000 样本后显著下降(规模饱和证据)。
  • AGP 肠道样本间 β 多样性变异 > EMP 环境样本间变异。
  • 近一月抗生素使用者(n=139)微生物多样性低于一年未用者(n=117),但代谢物多样性更高(“抗生素悖论”)。
  • 手术前后 n=1 时序样例显示:单次手术造成的菌群位移可超过不同环境群系之间的差异——活数据 + 个体纵向整合的独特产出。
  • VioScreen 子集(n=1,762)的精确定量饮食答案与主问卷自报答案相关性良好(论文 Table S2),是字段级校准锚点。

§4.4 数据层级

participant(去标识化账户)
└── sample(sample_name 主键;一人可有多个部位/多个时点样本)
    └── sequencing run(49 个批次;plate/lane 级技术重复结构)
        └── sOTU feature(48,599 条;BIOM 稀疏计数)
            └── taxonomy / phylogeny(Greengenes 13_8 + SEPP 树)

同一层级的"宽表视图":样本级宽表(sOTU 丰度列 + 元数据列)是绝大多数任务的入口;参与者级聚合(每人 1 份合格粪便)是论文口径;批次级透视(batch × plate × lane)用于 QC 与泄漏设计。三种视图共享 sample_name 主键,建议在特征仓库里做成三张物化视图而非三份拷贝。

§4.5 缺失值与信息性缺失

AGP 元数据无统一的信息性缺失编码,缺失机制以 MNAR 为主(越敏感的问题越少人答):每题中位应答率 70.9%,疾病史、收入类字段缺失更重。工程处理三原则:① 用 Qiita 元数据中的缺失标记重建 mask 并把"缺失"建模为显式类别而非 NaN;② 数值字段(age/bmi)已在官方侧做极端值门控,但跨字段矛盾需自行检测(如年龄 <4 岁但身高 >105 cm 即剔除);③ 饮食字段缺失与饮食行为本身相关(不关心饮食者更不填饮食表),直接删行会引入选择偏倚,建议多重插补或缺失指示特征。

# 缺失处理三步(与上述原则一一对应)
num_cols = ["age_years", "bmi"]
cat_cols = ["diet_type", "alcohol_consumption", "sleep_duration"]
flags = meta_clean[num_cols + cat_cols].isna().add_suffix("_missing")   # ① 显式缺失指示特征
meta_clean = pd.concat([meta_clean, flags], axis=1)
meta_clean[cat_cols] = meta_clean[cat_cols].fillna("missing")           # ② 类别列:缺失即显式类别
# ③ 跨字段矛盾检测(官方门控思路的工程化)
bad = (meta_clean["age_years"] < 4) & (meta_clean["height_cm"] > 105)
meta_clean = meta_clean[~bad]

§5 划分与使用建议

§5.1 官方划分

无官方 train/val/test 划分——AGP 的定位是参考库与关联研究资源,论文按分析目的构造子集(健康子集 n=3,942、VioScreen 子集 n=1,762、单份粪便优先)。若做监督任务需自建划分。

§5.2 社区惯例

关联分析沿用论文子集口径(每参与者 1 份合格粪便样本、≥1,250 读段)再随机划分;方法学研究(去批次、bloom 修正)通常按测序批次划分训练/测试;参考定位研究以全部合格粪便样本构建参考分布。以 plants_per_week 二分类为例的社区基线常见设定:健康子集口径 + 每人 1 份粪便 + GroupKFold(5) + 弹性网或 GBDT,另报告跨批次 LOBO 复检(§6.9 给出可运行实现)。

§5.3 泄漏风险 ⭐

  • 同人多样本:11,336 人对 15,096 样本,同一参与者的口腔/皮肤/粪便或前后时点样本高度相关——必须按 participant 分组划分(GroupKFold),否则同人样本跨集将把性能推高至虚高。
  • 同批次同板:49 个测序批次内,同 plate 样本经完全相同的实验流程,批次内相关显著;跨批次外推应作为独立的鲁棒性评估而非随机划分的一部分。
  • 家庭/同住者:同住家庭成员菌群趋同(共同环境与饮食),问卷中的同住字段可用于识别;严格设计应把同住者放同侧。
  • 特征构造泄漏:健康子集定义本身用到 BMI/疾病字段——若把疾病字段当标签又用健康子集做训练集,等于把选择条件泄漏进标签;标签与筛选条件必须分离。
  • 时间近邻:同一参与者前后时点样本即便相隔数月,菌群仍高度自相关——多时点任务请用时间感知切分(按人留出 + 按时间窗隔离)。

§5.4 交叉验证建议

推荐"按参与者 GroupKFold + 按标签 Stratified"双重结构,5 折起步;报告跨批次(leave-one-batch-out)结果作为泛化性下界;α 多样性回归任务同时报告 R² 与 Spearman ρ。

from sklearn.model_selection import StratifiedGroupKFold

# 参与者分组键:从 Qiita 元数据的 participant 字段读取(与 sample_name 一一对应;
# 具体列名以官方 prep information / docs/mapping_files 为准)
groups = meta_clean.loc[otu_clr.index, "participant_id"]
y_bin = (meta_clean.loc[otu_clr.index, "plants_per_week"] > 30).astype(int).values
sgkf = StratifiedGroupKFold(n_splits=5, shuffle=True, random_state=42)
for tr_idx, te_idx in sgkf.split(otu_clr.values, y_bin, groups):
    # 双约束保证:同人样本不跨集(Group)+ 标签比例近平衡(Stratified)
    pass

划分后再做一次 sanity check:统计每折内"参与者在训练与测试集同时出现"的行数,必须为 0;同折内标签占比与全量占比的差应在 ±5 个百分点内(Stratified 生效的证据)。

§5.5 外部验证建议

外部数据集 用途 预期差异
HMP2 / IBDMDB IBD 菌群关联的纵向验证 临床采集 vs 邮寄干拭子,bloom 负担不同
TwinsUK 英国人群复现 + 遗传配对设计控制 16S 协议相近,可直接比对
FGFP 比利时一般人群泛化 地理单一、无付费门槛,检验自选偏倚影响
EMP 环境样本 人类-环境边界测试(论文 Figure 1D 类分析) 非工业化人群差异显著,慎下结论

§6 AI 就绪指南 ⭐

§6.0 云端快速启动

AGP 无官方云托管环境,但两条路径近乎零门槛:

  • 免注册演示:redbiom 直接查询 Qiita study 10317 的特征表与元数据,数分钟内拿到 DataFrame。
  • 完整复现:本地/服务器安装 QIIME 2(conda)后从 EBI ERP012803 或 Qiita 下载,按 §6.3 流程处理。
  • 规模提示:表格级分析(方案 A/B)16 GB 内存即可;从 EBI 拉 raw FASTQ 前确认磁盘 ≥200 GB(§6.8)。先跑方案 A 确认字段可用,再走方案 B 做完整复现,是成本最低的上手路径。
# 方案 A:免注册,先看数据长什么样(需 conda create -n redbiom -c conda-forge redbiom)
redbiom search "qiita_study_id==10317" > agp_samples.txt
redbiom summarize samples --from agp_samples.txt | head -40

§6.1 快速上手

以下代码假设目录结构:data_root/ 下有 agp_125nt_sotu.biom(Deblur sOTU 特征表)与 sample_metadata.tsv(元数据)。两者来自 Qiita study 10317 的下载或论文固定快照 FTP(§6.2);最小可用子集 = 健康子集(n=3,942)+ 粪便样本 + ≥1,250 读段。data_root 变量与 os.path.join 拼接关系保持一致即可换机运行。

import os, pandas as pd, biom

DATA_ROOT = os.environ.get("AGP_DATA_ROOT", "./data/agp")
# 1) 读入 BIOM 特征表 → 行=样本,列=sOTU(写明拼接关系,换数据只改 DATA_ROOT)
table = biom.load_table(os.path.join(DATA_ROOT, "agp_125nt_sotu.biom"))
otu = pd.DataFrame(table.matrix_data.T.toarray(),
                   index=table.ids("observation"), columns=table.ids("sample")).T
# 2) 读元数据(TSV,第一列为 sample_name)
meta = pd.read_csv(os.path.join(DATA_ROOT, "sample_metadata.tsv"), sep="\t")
meta = meta.set_index("sample_name")
# 3) 最小可用子集:粪便 + 深度达标
fecal = meta[meta["body_site"] == "fecal"].index.intersection(otu.index)
otu_f = otu.loc[fecal]
keep = otu_f.sum(axis=1) >= 1250            # 与论文一致的分析门槛
otu_m = otu_f[keep]
print(otu_m.shape)                           # 预期约 1 万级样本 × 48,599 条 sOTU

# 4) 最小分析示例:Shannon α 多样性 + 按国家分组比较(论文 Figure 1C 口径)
from skbio.diversity.alpha import shannon
alpha = otu_m.apply(lambda row: shannon(row.values), axis=1)
print(alpha.groupby(meta.loc[alpha.index, "country"]).describe())

# 5) 保存中间产物(分块加载/换模型场景下复用,避免每次重读 BIOM)
otu_m.to_parquet(os.path.join(DATA_ROOT, "fecal_1250.parquet"))
meta.to_parquet(os.path.join(DATA_ROOT, "meta_clean.parquet"))

§6.2 数据获取

途径 地址 方式 大小 是否注册
EBI 原始 FASTQ ERP012803(PRJEB11419) FTP/HTTP 匿名 GB 级 否
Qiita 处理后 artifact qiita.ucsd.edu study 10317 网页/CLI GB 级 是(免费)
论文固定快照 ftp.microbio.me(BIOM + metadata) 匿名 FTP MB-GB 级 否
redbiom 查询 redbiom search "qiita_study_id==10317" CLI MB 级 否
代谢组 GNPS(gnps.ucsd.edu) 网页 GB 级 否
本地物化视图 SQLite/DuckDB(样本宽表/参与者聚合/批次透视三视图,§4.4) 自建 MB 级 否
官方分析代码 github.com/knightlab-analyses/american-gut-analyses git clone MB 级 否
# EBI 匿名下载原始数据(示例:拉取整个 study 的 FASTQ 清单再下载)
curl -O "https://www.ebi.ac.uk/ena/portal/api/filereport?accession=ERP012803&result=read_run&fields=run_accession,scientific_name,instrument_model,read_count,fastq_ftp&format=tsv"
# → 得到 run 清单;逐行 wget https://ftp.sra.ebi.ac.uk/vol1/<路径>/<RUN>_1.fastq.gz

# 论文固定快照(复现 mSystems 2018 用这个)
wget -r "ftp://ftp.microbio.me/AmericanGut/"   # BIOM + 元数据,不再变化

# redbiom 辅助命令(各版本参数略有差异,以 --help 输出为准)
redbiom context list                           # 列出可用 context(对应不同处理版本)
redbiom summarize features --from agp_samples.txt | head -20

§6.3 预处理全流程

标准路径 = QIIME 2 复现 EMP 流程(导入 → Deblur → 过滤 → 多样性),再进入 Python 建模。

# 步骤 1:导入 EMP V4 双端数据(按引物版本区分 manifest;此处以单端示意)
qiime tools import \
  --type 'SampleData[SequencesWithQuality]' \
  --input-path manifest_fecal.tsv --input-format SingleEndFastqManifestPhred33V2 \
  --output-path demux.qza

# 步骤 2:Deblur 生成 sOTU(与论文一致:截断 125 nt)
qiime deblur denoise-16S --i-demultiplexed-seqs demux.qza \
  --p-trim-length 125 --p-sample-stats --o-table deblur_table.qza \
  --o-representative-sequences deblur_seqs.qza --o-stats deblur_stats.qza

# 步骤 3:过滤低深度样本(≥1,250)与 bloom(QIIME 2 已内置常见污染清单可选)
qiime feature-table filter-samples --i-table deblur_table.qza \
  --p-min-frequency 1250 --o-filtered-table table_1250.qza

# 步骤 4:稀有化 + α/β 多样性(统一深度 1,250,与论文一致)
qiime diversity core-metrics --i-table table_1250.qza --p-sampling-depth 1250 \
  --m-metadata-file sample_metadata.tsv --output-dir core_metrics
# 步骤 5:元数据清洗(官方门控规则复刻)+ CLR 变换,进入建模
meta_clean = meta.copy()
meta_clean = meta_clean[meta_clean["age_years"].between(0, 100)]
# BMI 门控:身高 48-210 cm、体重 2.5-200 kg 之外的 bmi 计算值剔除
valid = meta_clean["bmi"].between(10, 60)
meta_clean = meta_clean[valid]

import numpy as np
def clr(df, pseudocount=1.0):
    counts = df + pseudocount                      # 组成性数据必须过对数比变换
    log = np.log(counts.div(counts.sum(axis=1), axis=0))
    return log.sub(log.mean(axis=1), axis=0)

otu_clr = clr(otu_m[otu_m.sum(0) >= 10])           # 先过滤极稀有的 sOTU 再 CLR

§6.3b 与论文口径的对应表

复现 mSystems 2018 时,逐步骤核对参数与论文 Methods 的对应关系:

管线步骤 论文对应位置 关键参数
测序与导入 Methods: Sequencing EMP V4 双端;两版引物分 manifest
Deblur 去噪 Methods: Deblur v1.0.2 截断 125 nt
bloom 移除 Methods: shipping overgrowth 官方 bloom 序列清单
深度过滤 Sample Selection ≥1,250 读段/样本
稀有化 Diversity analyses 统一 1,250
分类注释 Methods RDP(QIIME 2 实现),Greengenes 13_8
系统发生 Methods SEPP 插入 Greengenes 13_8 参考树
# 步骤 6:分类学注释(朴素贝叶斯分类器,与论文 RDP 口径一致)
qiime feature-classifier classify-sklearn \
  --i-classifier gg-13-8-99-nb-classifier.qza \
  --i-reads deblur_seqs.qza --o-classification taxonomy_gg138.qza

# 步骤 7:导出 BIOM/TSV 与 SEPP 插树(Weighted UniFrac 需要)
qiime tools export deblur_table.qza --output-path exported
biom convert -i exported/feature-table.biom -o agp_125nt_sotu.tsv --to-tsv
qiime fragment-insertion sepp \
  --i-representative-sequences deblur_seqs.qza \
  --i-reference-tree gg_13_8_otus/tree.nwk --o-tree agp_sotu_tree.qza

§6.4 PyTorch DataLoader 完整示例

任务示例:用肠道 sOTU 谱预测"每周植物种类数 >30"(论文核心饮食变量)。

import os, numpy as np, pandas as pd, torch
from torch.utils.data import Dataset, DataLoader

class AGPDataset(Dataset):
    """sOTU 计数表 + 元数据 → 二分类(植物多样性高/低)。
    预期目录结构:DATA_ROOT 下 agp_125nt_sotu.biom + sample_metadata.tsv;
    DATA_ROOT 通过环境变量 AGP_DATA_ROOT 注入,避免路径硬编码。"""
    def __init__(self, otu_clr: pd.DataFrame, meta: pd.DataFrame):
        self.X = torch.tensor(otu_clr.values, dtype=torch.float32)
        mask = meta.loc[otu_clr.index, "plants_per_week"].notna()
        self.X, self.samples = self.X[mask.values], otu_clr.index[mask.values]
        y = (meta.loc[self.samples, "plants_per_week"] > 30).astype(int).values
        self.y = torch.tensor(y, dtype=torch.float32)

    def __len__(self): return len(self.y)
    def __getitem__(self, i): return self.X[i], self.y[i]

def make_loaders(otu_clr, meta, participant_ids, batch_size=256, seed=42):
    """按参与者 GroupKFold 划分——防止同人多样本跨集泄漏(见坑点 5)。"""
    g = torch.Generator().manual_seed(seed)
    parts = pd.Series(participant_ids, index=otu_clr.index)
    uniq = parts.unique(); rng = np.random.RandomState(seed)
    test_ids = rng.choice(uniq, size=max(1, len(uniq)//5), replace=False)
    is_test = parts.isin(test_ids).values
    ds_tr = AGPDataset(otu_clr[~is_test], meta)
    ds_te = AGPDataset(otu_clr[is_test], meta)
    return (DataLoader(ds_tr, batch_size=batch_size, shuffle=True, generator=g),
            DataLoader(ds_te, batch_size=batch_size), ds_tr, ds_te)

# 模型:稀疏高维 → 先线性 bottleneck(比深层网络更稳,48,599 维 sOTU 用 MLP 易过拟合)
class OTUMLP(torch.nn.Module):
    def __init__(self, d_in):
        super().__init__()
        self.net = torch.nn.Sequential(
            torch.nn.Linear(d_in, 256), torch.nn.BatchNorm1d(256),
            torch.nn.ReLU(), torch.nn.Dropout(0.4), torch.nn.Linear(256, 1))
    def forward(self, x): return self.net(x).squeeze(-1)
# —— 训练与评估全流程(接上:make_loaders / OTUMLP)——
from sklearn.metrics import roc_auc_score

def run_training(otu_clr, meta, participant_ids, epochs=30, lr=1e-3, seed=42):
    torch.manual_seed(seed); np.random.seed(seed)
    train_loader, test_loader, ds_tr, ds_te = make_loaders(
        otu_clr, meta, participant_ids, seed=seed)
    model = OTUMLP(otu_clr.shape[1])
    # 类别不平衡:BCE 的 pos_weight 取训练折正类频率倒数(plants>30 属少数类)
    pos_rate = float(ds_tr.y.mean())
    loss_fn = torch.nn.BCEWithLogitsLoss(
        pos_weight=torch.tensor((1.0 - pos_rate) / max(pos_rate, 1e-6)))
    opt = torch.optim.AdamW(model.parameters(), lr=lr, weight_decay=1e-4)
    sched = torch.optim.lr_scheduler.CosineAnnealingLR(opt, T_max=epochs)
    best_auc, patience, bad = 0.0, 5, 0
    for epoch in range(epochs):
        model.train()
        for xb, yb in train_loader:
            opt.zero_grad()
            loss = loss_fn(model(xb), yb)
            loss.backward()
            torch.nn.utils.clip_grad_norm_(model.parameters(), 5.0)  # CLR 特征有长尾
            opt.step()
        sched.step()
        # 每轮在留出折上监控(按人划分语义下,此"测试折"即验证折)
        model.eval(); probs, ys = [], []
        with torch.no_grad():
            for xb, yb in test_loader:
                probs.append(torch.sigmoid(model(xb))); ys.append(yb)
        auc = roc_auc_score(torch.cat(ys).numpy(), torch.cat(probs).numpy())
        if auc > best_auc:
            best_auc, bad = auc, 0
        else:
            bad += 1
            if bad >= patience:      # early stopping:防止记个体指纹(坑点 5)
                break
    return model, best_auc

model, auc = run_training(otu_clr, meta, participant_ids)
print(f"按参与者划分 AUC = {auc:.3f}")
# 警戒线:随机划分常见 0.9+,按人划分应显著回落;两者差值即泄漏幅度(坑点 5)
# —— 评估细节:阈值无关指标 + 校准(接上 run_training 返回的 model)——
from sklearn.metrics import average_precision_score

def evaluate(model, test_loader):
    model.eval(); probs, ys = [], []
    with torch.no_grad():
        for xb, yb in test_loader:
            probs.append(torch.sigmoid(model(xb))); ys.append(yb)
    prob = torch.cat(probs).numpy(); y = torch.cat(ys).numpy()
    return {
        "roc_auc": roc_auc_score(y, prob),
        "pr_auc": average_precision_score(y, prob),   # 类别不平衡时的诚实指标
        "brier": float(np.mean((prob - y) ** 2)),     # 校准代理:越低越好
    }
# 报告纪律:先跨参与者(按人划分),再跨批次(LOBO),最后才谈"全员随机划分"的虚高数字

§6.5 坑点清单(8 个)

⚠️ 坑点 1:把 AGP 当全人群普查——自选偏倚直接进模型(分类:偏倚陷阱)

以下坑点按"踩坑频率 × 修复成本"整理;每条给出三档解决方法(简单/进阶/SOTA),并标注与正文的交叉引用。
问题:AGP 是自选、付费(99 美元)、需互联网的公民科学队列:高学历高收入城市人群为主、吸烟与肥胖率低于全美、Hispanic 与非裔代表性不足、IBD 患者约 6 倍富集。用它推导"人群正常值"会系统偏差。
症状:菌群-疾病关联在 AGP 上成立、在 NHANES 类概率样本或临床队列上失效;α 多样性参考范围整体偏高;“健康基线"其实是"关注健康的中产基线”。
解决:

  1. 简单方法:所有结论限定措辞为"工业化国家自选志愿者人群";论文健康子集(n=3,942)作为"健康层"而非"人群正常值"。
  2. 进阶方法:按 country/urban/rural/收入代理字段分层评估效应稳定性;对 IBD 富集做加权(survey-weight)敏感性分析。
  3. SOTA 方法:与 FGFP(无付费门槛的一般人群)或 TwinsUK 做迁移验证,把 AGP 定位为"参考分布"而非"估计总体",用领域对抗(domain adaptation)量化协变量迁移。
    参考:mSystems 2018 主论文 Cohort characteristics 与 bioRxiv v1 “unrepresentative in several important respects”;Turnbaugh/PLOS “Lessons from AGP”(europepmc.org/articles/4798814)。

⚠️ 坑点 2:常温邮寄导致的细菌过生长(bloom)污染(分类:预处理陷阱)

问题:干拭子无保存液、常温运输数天,某些类群(变形菌等)在途中增殖,样本测到的不是体内真实比例。AGP 官方已用 QC 研究识别运输中生长的序列并在分析前移除,但你自己下载的 raw FASTQ / 未过滤表若跳过此步即引入系统误差。
症状:β 多样性按运输时长聚类而非按表型聚类;"土壤/水源类微生物"出现在粪便样本且比例异常;与冷冻临床队列比较时假关联涌现。
解决:

  1. 简单方法:直接使用官方已去 bloom 的 Deblur sOTU 表(论文快照 / Qiita artifact),勿从 raw FASTQ 重表。
  2. 进阶方法:自建 pipeline 时按 AGP 方法移除已识别 bloom 序列清单(Deblur 论文与 AGP 代码仓库提供),并对运输时长字段做协变量检查。
  3. SOTA 方法:用 SourceTracker/decontam 类方法按负对照估计污染比例;报告"去 bloom 前后"双版本结果以示透明。
    参考:mSystems 2018 “removing the effects of overgrowth during room-temperature shipping”;Science News 2014 报道(Knight 访谈确认报告端已修正);PMC5954205 评论。

⚠️ 坑点 3:49 个测序批次 × 3 种平台配置 × 2 版引物的批次效应(分类:评估误用)

问题:2013-2017 年 49 个批次、MiSeq/HiSeq Rapid Run/HiSeq High-Output 三种配置、515f/806r 与 515fB/806rB 两版引物(barcode 正反向不同);批次与时间强相关,时间趋势分析(如"季节效应")极易被批次效应冒充。
症状:PCA/PCoA 前两轴按批次/引物版本分离;任何"按年份变化的发现"在 leave-one-batch-out 下消失;自训模型在跨批次测试上 AUC 大幅跳水。
解决:

  1. 简单方法:把 prep_information 中的批次/引物版本/仪器字段纳入元数据,永远把它们作为协变量报告。
  2. 进阶方法:训练/测试划分强制分层或 leave-one-batch-out;对特征表做 per-batch 组成性归一化(CLR 后按批次中心化)。
  3. SOTA 方法:混合效应模型(样本批次为随机效应)或 ComBat/RUV 类去批次;评测时同时报告 within-batch 与 cross-batch 双指标。
    参考:bioRxiv 277970 Methods(批次-平台-引物对照表);QIIME 2 / Deblur 文档(125 nt 截断即为兼容批次设计)。

⚠️ 坑点 4:自报元数据是"脏标签"——脏值、矛盾值与 70.9% 应答率(分类:标签理解)

问题:全部健康/饮食字段为参与者自报:控制词表压制了自由文本但没消灭错误(官方示例:有人把"鸡肉"填成碳水化合物来源);全部题目选答,每题中位应答率仅 70.9%,缺失与不关心健康的行为相关(MNAR)。
症状:plants_per_week 出现 0 但 diet_type 自称 vegan;BMI 用身高体重矛盾组合算出;直接 dropna 后样本量骤减且偏向高健康素养人群。
解决:

  1. 简单方法:沿用官方门控(身高 48-210 cm、体重 2.5-200 kg、年龄矛盾剔除),缺失建显式类别。
  2. 进阶方法:跨字段一致性校验(年龄 vs 身高体重 vs 饮酒);缺失指示特征 + 多重插补。
  3. SOTA 方法:用 VioScreen 子集(n=1,762)做黄金校准,对主问卷自报值做测量误差模型(measurement error model);敏感性分析报告插补假设上下界。
    参考:mSystems 2018 Metadata Curation 段;“Lessons from the American Gut Project”(europepmc.org/articles/4798814)。

⚠️ 坑点 5:同一参与者多样本跨训练/测试集——静默泄漏(分类:数据泄漏)

问题:11,336 人贡献 15,096 样本:多部位(粪/口/肤)与多时点样本共存;随机按样本划分会让同一人的样本同时出现在训练与测试集,菌群个体化程度极高,模型只需"认人"即可得高分。
症状:随机划分 AUC 0.9+,按人划分后跌至接近随机;分类特征重要性里出现无生物学意义的样本级指纹。
解决:

  1. 简单方法:每参与者只保留 1 份合格粪便样本(与论文口径一致)再做划分。
  2. 进阶方法:GroupKFold(group=participant_id),必要时叠加 StratifiedKFold 保证标签平衡。
  3. SOTA 方法:跨人 + 跨批次双重外推评估(leave-one-participant-out 的批次分层版本),报告性能分布而非单点。
    参考:mSystems 2018 Sample Selection(“A single fecal sample was selected for each participant”);本页 §5.3。

⚠️ 坑点 6:Qiita 下载需注册 + "活数据"版本漂移(分类:工程陷阱)

问题:Qiita(study 10317)是持续增长的活数据:今天下载的 artifact 明天就多了新样本;且网页下载需注册登录。而论文固定快照不再变化。用"活数据"复现论文永远对不上数;用快照又拿不到最新样本。
症状:同一段代码两次运行样本数不同;合作者复现不了你的样本数;论文审稿被问"你用的哪个版本"。
解决:

  1. 简单方法:复现论文用固定快照(ftp.microbio.me);探索性分析用 Qiita 并在工程上记录下载日期。
  2. 进阶方法:把 Qiita artifact 的版本号/ID(redbiom 查询结果快照)写入数据卡(data card)与随机种子一起版本化。
  3. SOTA 方法:用 redbiom 按时间戳锁定 context 快照(redbiom context 机制),保证学术可重现性;EBI accession 逐 run 引用(论文 Table S1 提供批次级对照)。
    参考:github.com/knightlab-analyses/american-gut-analyses(官方明确区分 fixed / not fixed 数据集);microsetta.ucsd.edu(AGP→TMI 更名与账号迁移公告)。

⚠️ 坑点 7:把组成性计数当绝对丰度直接喂模型(分类:预处理陷阱)

问题:16S 测序得到的是相对组成(各样本测序深度不同、总计被强制归一),直接算"绝对丰度差"、用未变换计数跑线性回归或用欧氏距离聚类,结论都是错的——这正是 Aitchison 组成性数据分析(CoDA)要解决的问题。
症状:稀有 sOTU 的"倍数变化"随测序深度漂移;欧氏 PCA 中总读段数主导第一轴;模型学到的"物种重要性"在重测序后不可复现。
解决:

  1. 简单方法:统一稀有化到 1,250 条(论文口径)后做相对丰度分析——保守但可行。
  2. 进阶方法:CLR/Aitchison 距离(§6.3 已给出 CLR 实现)+ ALDEx2/ANCOM-BC 做差异检验;多样性用 Bray-Curtis(相对丰度)与加权 UniFrac。
  3. SOTA 方法:零膨胀负二项/Dirichlet-multinomial 组成性模型;跨样本比较用 log-ratio 嵌入(如 DEICODE 类 RPCA,专为组成性 β 多样性设计)。
    参考:mSystems 2018 Methods(rarefaction 1,250 与 Deblur 细节);QIIME 2 教程(compositional data 章节)。

⚠️ 坑点 8:把自报疾病标签当临床诊断用(分类:偏倚陷阱)

问题:AGP 的疾病字段是参与者自报(“你是否被诊断过 IBD”),无临床复核、无统一诊断标准、时间未知;参与者报告与就诊档案的一致性有限。将其直接当"金标准标签"训练诊断模型,是在用噪声标签模拟诊断。
症状:所谓"疾病菌群特征"与临床队列文献不一致;亚组内异质性巨大;报告端被问"我有 X 病,你推荐我做什么"——官方明确答复数据非医学可操作。
解决:

  1. 简单方法:所有疾病相关结论写明"自报、未经临床验证";把标签视为"自报状态"变量。
  2. 进阶方法:与 HMP2/IBDMDB 等临床确诊队列做标签一致性对照;对匹配对照设计(论文心理健康亚组的 1:1 匹配法)加以复用。
  3. SOTA 方法:标签噪声学习(label-noise robust loss)+ 临床队列迁移评估;把 AGP 定位在"假说生成"层,临床验证留给设计队列。
    参考:mSystems 2018(匹配对照方法与局限性讨论);Open Humans AGP 页面(“This report is not medically actionable”);PMC5954205 评论。

§6.6 数据增强

  • ✅ 安全:组成性数据上的对数比扰动(在 simplex 上加 Dirichlet 噪声重归一);sOTU 按分类学层级聚合(genus/family 级多尺度);per-batch CLR 后的特征抖动;交叉验证内的伪计数敏感性测试。
  • ❌ 危险:对计数矩阵直接加高斯噪声(破坏组成性约束);随机过采样少数类(同人多样本会被复制放大泄漏);在稀有化前做任何逐样本变换(深度信息是重要的 QC 协变量);跨批次混合后做"随机"增强(批次伪影被当作变化源学习)。
# 组成性增强:simplex 上的 Dirichlet 扰动(仅作用于训练折,验证/测试折不动)
def dirichlet_perturb(counts: np.ndarray, alpha=500.0, rng=None):
    rng = rng or np.random.default_rng()
    rel = counts / counts.sum()                 # 相对丰度(simplex 上的一点)
    pert = rng.dirichlet(alpha * rel)           # 以原组成为中心重采样
    return pert * counts.sum()                  # 回到原总深度
# 用法:对每个训练样本以小概率应用;alpha 越大扰动越弱(500 约为温和扰动)

§6.7 模型推荐

任务 推荐模型 理由
关联筛查(表型-菌群) 随机森林 / 弹性网(CLR 特征) 稀疏高维稳健,可解释重要性
α 多样性回归 梯度提升 + 分位数损失 偏态分布、需区间预测
β 多样性结构 PERMANOVA + RPCA(DEICODE 类) 组成性数据专用距离
参考定位 kNN in Aitchison space / 嵌入检索 "microbiome GPS"直译实现
跨批次稳健建模 混合效应模型 / ComBat 前置 批次随机效应显式建模
元数据填补 缺失指示 + 多重插补(MICE) MNAR 机制下的保守方案
大规模参考定位 FAISS / annoy(Aitchison 嵌入空间) 1 万级样本检索毫秒级,microbiome GPS 生产化
批次-表型混杂检验 PERMANOVA 分层 + 混合效应模型 先把批次效应与生物学信号分开,再谈关联
多时点个体内分析 混合效应(时点为重复测量) + 个体随机截距 同人多样本在此是信号而非噪声(与 §5.3 相反口径)

§6.8 硬件需求

场景 CPU 内存 磁盘 GPU
表格级分析(BIOM + 元数据) 4 核 16 GB 50 GB 不需要
QIIME 2 全量重处理(FASTQ) 16 核 64 GB 200 GB 不需要
深度模型(48,599 维 sOTU) 8 核 32 GB 100 GB 单卡 16 GB 足够
GNPS 代谢组联合分析 16 核 64 GB 200 GB 不需要

§6.9 评估指标

from sklearn.metrics import roc_auc_score, average_precision_score
from scipy.stats import spearmanr
from skbio.diversity.alpha import shannon

# 分类:报告 ROC-AUC + PR-AUC(标签不平衡时 PR-AUC 更诚实)
auc = roc_auc_score(y_test, prob); pr = average_precision_score(y_test, prob)
# α 多样性回归:R² + Spearman ρ 双报告(组成性数据对 R² 不敏感)
rho = spearmanr(pred_shannon, true_shannon).statistic
# 多样性距离矩阵检验:PERMANOVA(scikit-bio)
# from skbio.stats.distance import permanova → 永远配 per-batch 分层复检
# leave-one-batch-out:泛化性下界(坑点 3 的操作化)
from sklearn.model_selection import LeaveOneGroupOut
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler

groups = meta_clean.loc[otu_clr.index, "sequencing_batch"]   # 批次来自 prep information
y_bin = (meta_clean.loc[otu_clr.index, "plants_per_week"] > 30).astype(int).values
aucs = []
for tr_idx, te_idx in LeaveOneGroupOut().split(otu_clr.values, y_bin, groups):
    clf = make_pipeline(StandardScaler(),
                        LogisticRegression(max_iter=5000))
    clf.fit(otu_clr.values[tr_idx], y_bin[tr_idx])
    prob = clf.predict_proba(otu_clr.values[te_idx])[:, 1]
    aucs.append(roc_auc_score(y_bin[te_idx], prob))
print(f"LOBO AUC 中位 {np.median(aucs):.3f},范围 {np.min(aucs):.3f}-{np.max(aucs):.3f}")
# 与随机划分 AUC 的差值 = 批次过拟合量;差值大说明模型在记批次指纹而非生物学信号

阈值选择提示:plants > 30 的阈值沿用论文口径;实际建模可改用分位数(如上三分位)以获得更均衡的标签——改动阈值属于任务重定义,须同步更新数据卡并在结果中标注。

§6.10 MLOps 笔记

  • 数据版本化:记录 数据来源(快照 FTP / Qiita artifact ID / redbiom context)+ 下载日期 + 行数校验和;活数据场景这是复现生命线(坑点 6)。
  • 管线幂等:QIIME 2 artifact 有哈希自证;用 qiime info 与表形状断言做 CI 门禁。
  • 标签卡:为每个建模字段写 data card(控制词表、应答率、门控规则),训练前校验。
  • 监控漂移:TMI 持续新增样本,上线模型每季度用新增数据重估 AUC 与特征漂移(PSI)。
  • 审计:保留"去 bloom 前后"、"去批次前后"双版本特征表,方便审稿与回滚。
  • 容器复现:以 QIIME 2 官方镜像(固定版本号)封装 §6.3 流程,把"conda 环境 + artifact 哈希 + 随机种子"三件套写入方法学附录。
  • 协作口径:团队内统一"一人一粪一折"术语表(参与者分组、批次分层、稀有化深度 1,250),防止不同成员的"基线"数字不可比。

§7 质量评估与局限性

§7.1 已知偏倚表

偏倚类型 描述 严重程度 缓解措施
自选人群偏倚 高学历/高收入/城市、吸烟肥胖率低、Hispanic 与非裔不足 🔴 高 结论限定人群;加权/分层;外部队列迁移验证
疾病富集偏倚 IBD 参与者约 6 倍于全美人群比例 🟡 中 匹配对照设计(论文心理健康亚组方法可复用)
运输过生长偏倚 常温邮寄 bloom 污染 🔴 高 官方已移除 bloom 序列;自建 pipeline 必须复刻该步骤
批次效应 49 批次 × 3 平台 × 2 版引物,批次与时间强相关 🔴 高 协变量纳入 + leave-one-batch-out + 去批次算法
自报测量误差 疾病/饮食/行为全部自报,无临床复核 🟡 中 控制词表 + 门控;VioScreen 子集校准;标签噪声学习
缺失机制 MNAR 敏感字段缺失更重(每题中位应答 70.9%) 🟡 中 缺失显式建模 + 多重插补 + 敏感性分析
地理-文化偏倚 美英澳工业化人群为主体,非工业化人群缺失 🔴 高 meta 分析对照 EMP 非工业化样本;慎推全球结论
深度选择偏倚 分析门槛 ≥1,250 读段,低深度样本(常为运输受损)被剔除 🟢 低 报告纳入/排除流程;深度作为协变量
答题自选偏倚 全部题目选答——"答不答"本身与健康素养相关,缺失即信号 🟡 中 缺失显式建模(§4.5);字段级应答率随数据卡发布
语言/支付门槛 英文问卷 + 99 美元(可赞助代付)使低收入与非英语群体缺位 🟡 中 公平性声明(§7.5);目标人群外部验证
多时点自相关 少数参与者的多时点样本高度自相关,随机划分虚高 🟡 中 按人分组划分(§5.3);时间感知切分

§7.2 标注质量

自报标注的可信底线由三道防线决定:控制词表(压制自由文本噪声)、数值门控(剔除物理不可能值)、VioScreen 交叉验证子集(14.8%,饮食字段与主问卷相关性良好)。但没有临床金标准复核、无标注者间一致性;行为变量(运动)存在"报告 vs 说谎"不可辨问题。综合评级:弱监督中上水平——在公民科学数据中属标杆,但不可与临床标注混用。工程提示:把控制词表与门控规则抄进训练前的数据校验脚本(data validation),任何违反即 fail-fast——这是把"弱监督中上水平"守住的实际手段。

§7.3 泛化性评估

目标场景 泛化风险 证据
工业化国家成人肠道菌群参考定位 🟢 低 美英澳 1.5 万级样本,覆盖主群体
非工业化人群建模 🔴 高 论文 meta 分析显示 AGP 与非工业化人群显著差异丰度
儿童/老年特殊人群 🟡 中 有样本但以成人为主;健康子集限 20-69 岁
临床诊断模型 🔴 高 自报标签 + 横断面,非医学可操作
时间趋势/季节效应 🟡 中 批次与时间强相关(坑点 3),需极谨慎
其他部位(口腔/皮肤)建模 🟡 中 样本量远小于粪便,子集分析为主
跨年份协议迁移 🟡 中 EMP 文库方案 2018 年起微量化演进;两代引物版本并存(§7.6)

§7.4 伦理

参与者在 IRB 框架下线上知情同意(CU Boulder #12-0582,2012-12 至 2015-03;UCSD #141853,2015-02 起),协议明确授权两类事项:所有非个人标识数据的公开存档与向参与者返还结果。数据发布前去除直接标识符;问卷全部选答;参与者获得教育性报告作为回馈。这是"去标识化 + 主动公开"的教科书式设计,但也意味着数据无法撤回——隐私保护依赖去标识化质量而非访问控制。

§7.5 公平性

付费参与(99 美元)+ 互联网依赖 + 英文问卷三重门槛造成结构性排除:低收入、低数字化程度、非英语母语群体系统性缺位;Hispanic 与非裔社区代表性不足被论文点名。任何"跨人群公平"应用(如把模型推广至弱势群体)都应先在目标人群中做外部验证——在 AGP 上训练的模型对未覆盖人群属于分布外推理。

§7.6 数据漂移

AGP/TMI 是活数据:新样本持续进入、协议随 EMP 演进(2018 年起 EMP 转向 5 µl 微量化 384 样本文库方案)、引物版本更新。跨年份使用时需警惕三个漂移源:人群构成漂移(早期参与者饮食偏好更极端)、技术漂移(批次/引物)、环境漂移(抗生素政策、饮食潮流)。缓解:所有分析锁定数据快照并记录下载日期;趋势结论必须带批次协变量。实操建议:给每个样本打上"协议纪元"标签(引物版本 + 批次区间),任何跨纪元比较先做敏感性分析。

§7.7 DAIMS 24 项评估

# 检查项 状态 说明
1 数据为宽格式(每行一个样本/事件) ✅ BIOM 样本 × sOTU 矩阵 + 样本级元数据宽表
2 有唯一标识符列 ✅ sample_name(Qiita 编号体系,如 10317.000066637)全局唯一
3 无 Unicode 或特殊字符 ⚠️ 元数据为 ASCII 但控制词表值冗长含空格;FASTQ 无问题
4 无重复行 ✅ Qiita 主键约束,官方侧已保证样本级唯一
5 缺失值已识别并编码 ⚠️ 官方用标准值标记缺失,但使用者需自建显式 mask
6 标签列被明确标识 ⚠️ 无官方"标签列"——任务自定义(饮食/疾病/多样性皆可为目标)
7 已对罕见类别(<3%)进行分组 ⚠️ 自报疾病类别长尾,需自行归组(如按 ICD-11 章节聚合)
8 偏倚评估已完成 ✅ 论文专节自评估 + 本页 §7.1 八类偏倚
9 有完整的数据字典 ✅ Qiita prep information + EMP 协议文档 + 问卷映射文件
10 对"信息性缺失"有明确编码解释 ⚠️ MNAR 机制明确(选答 70.9%)但无官方解释文档,需自建
11 数据采集设备和设置已记录 ✅ 49 批次/仪器/引物版本/plate 级完整记录(Table S1 + prep info)
12 已移除完全共线性变量 ❌ 未执行:bmi 与身高体重共线、同住成员与环境变量共线
13 对编码的映射标准已说明 ✅ 控制词表 + 受控词表映射文件随 metadata 发布
14 对时间戳的处理已明确说明 ✅ collection_date 为真实采样日期(非就诊时点,无偏移需求)
15 训练/验证/测试划分建议已给出 ❌ 官方无 ML 划分,仅分析子集定义
16 数据泄漏风险已被讨论 ✅ 同人多样本/同批次/同住三类泄漏已识别(§5.3、§6.5)
17 标签分布已被分析 ✅ §4.2 部位/健康层/饮食/地理分布
18 选择性测量偏倚已被讨论 ✅ bloom、批次、自报误差三大测量偏倚各有坑点专述
19 外部验证建议已给出 ✅ §5.5 HMP2 / TwinsUK / FGFP / EMP
20 数据更新和版本信息已记录 ✅ 论文固定快照 + Qiita 活数据双轨版本体系清晰
21 最小必要预处理脚本已提供 ⚠️ 官方 Jupyter 笔记本 + QIIME 2 流程开源,但无一键式统一脚本
22 合规使用要求已明确 ✅ public domain,无访问限制(Qiita 下载需免费注册为平台流程)
23 多模态对齐方法已说明 ⚠️ 16S-代谢组/shotgun 子集需经 sample_name 自行对齐,官方未发布对齐表
24 去标识化方法已被记录 ✅ IRB 协议明确授权公开去标识数据,直接标识符不出库

DAIMS 评分:18.5 / 24

评分解读:良好——开放性、溯源与文档化是同类公民科学数据集的天花板(批次/引物/设备记录完整到可复现每个实验细节),短板集中在"为机器学习而设"的三件事:无官方划分、共线性未处理、多模态对齐需自助。

对你意味着什么:可以直接把 BIOM 表 + 元数据拖进任何探索性分析(省去申请审批);动手前必须自建三件基础设施——按参与者的划分器、显式缺失 mask、批次协变量表;若要跨 16S-代谢组做联合建模,先花半天核对子集样本的 sample_name 交集;引用时锁定具体快照版本,否则三个月后你的基线数字将无法复现。

§7.8 外部验证矩阵

外部数据集/场景 来源机构 评估任务 性能指标 相对内部变化 关键发现
EMP 环境样本对照 EMP(UCSD 等) 人类 vs 环境 β 多样性边界 β 多样性变异幅度 AGP 肠道内变异 > EMP 环境样本间变异 人类肠道菌群个体差异空间异常广阔(mSystems 2018)
非工业化人群 meta 分析 已发表队列(论文引用 2-6 号文献) 工业化 vs 非工业化差异丰度 差异丰度显著性 AGP 整体呈工业化特征谱 AGP 不能代理非工业化人群菌群
HMP2/IBDMDB 临床队列 Broad/HMS 等 IBD 菌群特征方向 差异丰度方向一致性 方向可复现,幅度受 bloom/批次影响 邮寄干拭子可复现临床队列已知关联(mSystems 2018 IMPORTANCE)
手术前后 n=1 时序 参与者自身纵向 个体内变化 vs 人群间差异 变化幅度比较 单次手术菌群位移可超不同环境群系间差异 活数据 + n=1 整合范式验证(mSystems 2018)

§8 基准性能与生态

§8.1 排行榜(标志性发现基准)

AGP 是关联研究资源而非竞赛数据集,无模型排行榜。下表收录论文级别的标志性定量发现(不同行来自不同任务/子集,数值不可横向比较):

# 发现 数值 条件/子集 完整引用 代码
1 每周植物种类数与 α 多样性正相关 >30 种 vs ≤10 种:多样性显著更高(n=41 vs 44) 粪便子集 McDonald et al., 2018, mSystems. DOI 10.1128/mSystems.00031-18 GitHub knightlab-analyses
2 近期抗生素使用的"微生物-分子悖论" 近一月用药者(n=139)微生物多样性↓但代谢物多样性↑(对照 n=117) 粪便子集 同上 同上
3 心理健康-菌群聚类 125 名自报精神疾病者菌群彼此更相似(1:1 匹配) 美英匹配对 同上 同上
4 新 sOTU 发现饱和 约 3,000 样本后新类群发现率明显下降 全集累计曲线 McDonald et al., 2018, mSystems. DOI 10.1128/mSystems.00031-18;同行评论 Crowdsourcing Our National Gut(PMC5954205) 同上
5 抗生素抗性基因与植物饮食 多植物饮食者肠道 ARG 更少 shotgun 子集 同上(主论文讨论) 同上
6 国家间 α 多样性差异 美国与英国粪便样本 α 多样性显著不同 美 n=6,634 vs 英 n=2,071 McDonald et al., 2018, mSystems. DOI 10.1128/mSystems.00031-18 GitHub knightlab-analyses
7 n=1 手术纵向位移 单次手术造成的菌群位移可超过不同环境群系之间的差异 参与者自身纵向(活数据整合) 同上 同上

§8.2 SOTA 总结与选型建议

AGP 上的"最好成绩"属于方法学而非模型:组成性分析(CLR/RPCA)已基本取代未变换计数方法;混合效应/ComBat 已成为跨批次分析标配;per-participant 划分已成共识。选型建议:关联筛查用弹性网/随机森林起步(基线稳、可解释);参考定位用 Aitchison 空间 kNN;除非有充分理由,不要在该数据上追求端到端深度架构——48,599 维稀疏组成性特征对大模型并不友好。

此外,引用 AGP 基线时应注明所用快照(论文快照 vs Qiita 某版本)与子集口径——两者样本量可相差数倍,不同口径的数字不可直接对比;论文快照 + 健康子集 + 按人划分的组合是事实上的"默认基线配置"。

§8.3 评测协议

建议的社区式评测协议:① 数据锁定论文快照或记录 Qiita artifact 版本;② 每参与者 1 份合格粪便样本(≥1,250 读段);③ 按参与者分组 5 折 CV + leave-one-batch-out 双报告;④ 指标 ROC-AUC/PR-AUC(分类)、R²/Spearman(回归)、PERMANOVA(组间结构);⑤ 报告"去 bloom 前后"敏感性;⑥ 所有比较行对齐"一人一粪 + ≥1,250 读段"口径;⑦ 随机种子与数据快照哈希随结果一同发布。

数据集 关系 差异化
Human Microbiome Project(HMP/HMP2) 同代互补 临床设计、纵向多组学,规模小
Earth Microbiome Project(EMP) 上级项目 AGP 是其人类子集;EMP 覆盖全球环境
TwinsUK 同域队列 双胞胎遗传控制设计
Flemish Gut Flora Project 同域队列 一般人群横断面,无付费门槛
The Microsetta Initiative 直接后继 AGP 的伞状扩展,含新研究(如 COVID 相关子研究)
MetaHIT 同域队列 欧洲队列,shotgun 为主,疾病定向
EMP 非工业化人类样本 对照参考 论文 meta 分析的对照组(协议同源,非 AGP 本体数据)
TMI COVID 时期子研究 后继扩展 经 Microsetta 门户获取,主题为疫情期生活方式与菌群
TMI 纵向子研究 后继扩展 同一参与者多时点复测——做多时点任务时注意时间近邻泄漏(§5.3)

§8.5 关键论文 Top 6

  1. McDonald D, Hyde E, Debelius JW, et al., Knight R. American Gut: an Open Platform for Citizen Science Microbiome Research. mSystems, 3(3):e00031-18, 2018. DOI 10.1128/mSystems.00031-18 —— 数据集主论文:15,096 样本规模、协议、核心发现与开放平台设计。
  2. Thompson LR, Sanders JG, McDonald D, et al. A communal catalogue reveals Earth’s multiscale microbial diversity. Nature, 551:457-463, 2017. DOI 10.1038/nature24621 —— 上级 EMP 的方法论与标准化底座。
  3. Amir A, McDonald D, Navas-Molina JA, et al. Deblur Rapidly Resolves Single-Nucleotide Community Sequence Patterns. mSystems, 2(2):e00191-16, 2017. DOI 10.1128/mSystems.00191-16 —— sOTU 生成方法,AGP 16S 表的技术核心。
  4. Bolyen E, Rideout JR, Dillon MR, et al. Reproducible, interactive, scalable and extensible microbiome data science using QIIME 2. Nature Biotechnology, 37:852-857, 2019. DOI 10.1038/s41587-019-0209-9 —— AGP 处理管线所在的执行框架。
  5. McDonald D, Vázquez-Baeza Y, Koslicki D, et al. Striped UniFrac: enabling microbiome analysis at unprecedented scale. Nature Methods, 15:847-848, 2018. DOI 10.1038/s41592-018-0187-8 —— 让 UniFrac 扩展到 AGP 规模的算法。
  6. Salter SJ, Cox MJ, Turek EM, et al. Reagent and laboratory contamination can critically impact sequence-based microbiome analyses. BMC Biology, 12:87, 2014. DOI 10.1186/s12915-014-0087-z —— bloom/污染识别的方法学源头之一。

§8.6 社区活跃度

  • 学术影响:986+ 引用(Crossref Cited by,截至 2026-09);官方称数据已支撑 85+ 期刊上的发表(AmericanGut.org 官网)。
  • 平台生态:Qiita(study 10317)持续托管;redbiom 免注册查询;GNPS 代谢组;Open Humans 个人数据回传。
  • 教育与开源:Coursera 课程 Gut Check: Exploring Your Microbiome;GitHub knightlab-analyses/american-gut-analyses 提供全部分析笔记本(conda 环境复现);代码主体遵循 BSD 类开源许可(biocore 组织)。
  • 运营:2018 年并入 The Microsetta Initiative 持续运营,样本采集、报告生成与数据扩张未停。
  • 规范传播:AGP 的问卷控制词表、门控规则与"数据产生即开放"模式被后续公民科学项目直接借用,是真实世界数据治理的参考实现。
  • 教学渗透:多门微生物组课程与教材以 AGP 为标准练习数据,QIIME 2 Forum 的公开问答覆盖从数据下载到 Deblur 参数选择的绝大多数工程问题。

§8.7 生态快照表

资源 类型 链接 活跃度(截至 2026-09) 推荐理由
Qiita 数据管理平台 https://qiita.ucsd.edu/ 持续运营,study 10317 持续增长 处理后 artifact 一站式获取
redbiom CLI 查询工具 conda-forge 安装 与 QIIME 2 生态集成 免注册秒级拉取
EBI ENA 原始数据存档 https://www.ebi.ac.uk/ena/browser/view/ERP012803 INSDC 永久存档 匿名下载 raw FASTQ
GNPS 代谢组平台 http://gnps.ucsd.edu/ 持续运营 分子网络与特征表
Open Humans 参与者数据回传 https://www.openhumans.org/activity/american-gut-project/ AGP 项目页存续 个人报告数据互操作
官方分析仓库 Jupyter 笔记本 https://github.com/knightlab-analyses/american-gut-analyses 论文冻结(2018 最终提交) 复现论文的权威代码
Microsetta 官网 项目门户 https://microsetta.ucsd.edu/ 活跃运营 最新样本采集与说明
EMP 协议站 方法文档 https://earthmicrobiome.org/protocols-and-standards/16s/ 持续维护 V4 引物与文库协议权威来源
Knight Lab 团队方法站 https://knightlab.ucsd.edu/ 持续更新 团队方法论文与工具入口
bioRxiv 预印本 论文预印本 https://www.biorxiv.org/content/10.1101/277970v1.full 论文冻结(2018) 追溯审稿史与 v1 差异

§9 相关资源与引用

§9.1 官方资源与文档

§9.2 BibTeX 完整引用

@article{McDonald2018AmericanGut,
  author  = {McDonald, Daniel and Hyde, Embriette and Debelius, Justine W. and Morton, James T. and Gonzalez, Antonio and Ackermann, Gail and Aksenov, Alexander A. and Behsaz, Bahar and Brennan, Caitriona and Chen, Yingfeng and others and Knight, Rob},
  title   = {American Gut: an Open Platform for Citizen Science Microbiome Research},
  journal = {mSystems},
  volume  = {3},
  number  = {3},
  pages   = {e00031-18},
  year    = {2018},
  doi     = {10.1128/mSystems.00031-18}
}

@article{Thompson2017EMP,
  author  = {Thompson, Luke R. and Sanders, Jon G. and McDonald, Daniel and Amir, Amnon and Ladau, Joshua and Locey, Kenneth J. and Prill, Robert J. and Tripathi, Anupriya and Gibbons, Sean M. and Ackermann, Gail and others and Knight, Rob},
  title   = {A communal catalogue reveals Earth's multiscale microbial diversity},
  journal = {Nature},
  volume  = {551},
  pages   = {457--463},
  year    = {2017},
  doi     = {10.1038/nature24621}
}

@article{Amir2017Deblur,
  author  = {Amir, Amnon and McDonald, Daniel and Navas-Molina, Jose A. and Kopylova, Evguenia and Morton, James T. and Xu, Zhenjiang Zech and Kightley, Eric P. and Thompson, Luke R. and Hyde, Embriette R. and Gonzalez, Antonio and Knight, Rob},
  title   = {Deblur Rapidly Resolves Single-Nucleotide Community Sequence Patterns},
  journal = {mSystems},
  volume  = {2},
  number  = {2},
  pages   = {e00191-16},
  year    = {2017},
  doi     = {10.1128/mSystems.00191-16}
}

@article{Bolyen2019QIIME2,
  author  = {Bolyen, Evan and Rideout, Jai Ram and Dillon, Matthew R. and Bokulich, Nicholas A. and Abnet, Christian C. and Al-Ghalith, Gabriel A. and Alexander, Harriet and Alm, Eric J. and Arumugam, Manimozhiyan and Asnicar, Francesco and others and Caporaso, J. Gregory},
  title   = {Reproducible, interactive, scalable and extensible microbiome data science using {QIIME 2}},
  journal = {Nature Biotechnology},
  volume  = {37},
  pages   = {852--857},
  year    = {2019},
  doi     = {10.1038/s41587-019-0209-9}
}

@article{McDonald2018StripedUniFrac,
  author  = {McDonald, Daniel and V{\'a}zquez-Baeza, Yoshiki and Koslicki, David and McClelland, Josiah and Reeve, Nicolai and Xu, Zhenjiang and Gonzalez, Antonio and Knight, Rob},
  title   = {Striped {UniFrac}: enabling microbiome analysis at unprecedented scale},
  journal = {Nature Methods},
  volume  = {15},
  pages   = {847--848},
  year    = {2018},
  doi     = {10.1038/s41592-018-0187-8}
}

@article{Salter2014Contamination,
  author  = {Salter, Susannah J. and Cox, Michael J. and Turek, Elena M. and Calus, Szymon T. and Cookson, William O. and Moffatt, Miriam F. and Turner, Paul and Parkhill, Julian and Loman, Nicholas J. and Walker, Alan W.},
  title   = {Reagent and laboratory contamination can critically impact sequence-based microbiome analyses},
  journal = {BMC Biology},
  volume  = {12},
  pages   = {87},
  year    = {2014},
  doi     = {10.1186/s12915-014-0087-z}
}

@article{McDonald2015Context,
  author  = {McDonald, Daniel and Birmingham, Amanda and Knight, Rob},
  title   = {Context and the human microbiome},
  journal = {Microbiome},
  volume  = {3},
  pages   = {14},
  year    = {2015},
  doi     = {10.1186/s40168-015-0117-2}
}

@misc{McDonald2018AGPpreprint,
  author = {McDonald, Daniel and others},
  title  = {American Gut: an Open Platform for Citizen-Science Microbiome Research},
  year   = {2018},
  doi    = {10.1101/277970},
  note   = {bioRxiv preprint,仅用于追溯审稿史}
}

§9.3 引用指南

使用数据本体(任何规模、任何子集)一律引用 McDonald et al. 2018(mSystems);处理管线在 QIIME 2 上运行则加引 Bolyen et al. 2019;自行从 FASTQ 重建 sOTU 表加引 Amir et al. 2017;使用 UniFrac 大规模计算加引 McDonald et al. 2018(Striped UniFrac);涉及污染/bloom 方法论溯源可引 Salter et al. 2014。若同时使用 EMP 环境对照数据,加引 Thompson et al. 2017。预印本(bioRxiv 277970)仅用于追溯审稿史,正式引用一律使用 mSystems 正式版;卷期页码以上方 BibTeX 与 mSystems 官方页为准。


§10 AI 使用声明卡

§10.1 AI 模型列表

本条目由 CodeBuddy Code(AI 编码与写作助手)基于公开检索资料辅助撰写;本页代码示例经 AI 生成后按宪法规范整理。

§10.2 AI 参与范围

AI 参与范围:资料检索与交叉核对、结构组织、正文撰写、代码示例生成、表格与 BibTeX 整理。AI 不参与:事实终审、医学审稿决策、发布决策。所有硬事实均溯源至 §10.3 列出的公开来源,并沉淀于同目录 FACTS.md 供复核。

数字转录规则:规模、日期、accession 等均直接取自来源原文或官方页面,未做外推;无法核实的口径(如 Google Scholar 计数)以带日期的 Crossref 计数替代并注明来源,其余推算数字(如内存估计)在正文以"约"字标注。

§10.3 输入来源列表

  1. McDonald D, et al. American Gut: an Open Platform for Citizen Science Microbiome Research. mSystems, 3(3):e00031-18, 2018. DOI 10.1128/mSystems.00031-18. https://journals.asm.org/doi/10.1128/mSystems.00031-18
  2. McDonald D, et al. American Gut: an Open Platform for Citizen-Science Microbiome Research (preprint). bioRxiv, 277970, 2018. DOI 10.1101/277970. https://www.biorxiv.org/content/10.1101/277970v1.full
  3. The Microsetta Initiative. The American Gut Project is now The Microsetta Initiative. https://microsetta.ucsd.edu/american-gut-project/
  4. The Microsetta Initiative. Project Overview. https://microsetta.ucsd.edu/project-overview/
  5. Knight Lab. american-gut-analyses(数据获取与分析代码总览). GitHub, 2018. https://github.com/knightlab-analyses/american-gut-analyses
  6. Earth Microbiome Project. 16S Illumina Amplicon Protocol. https://earthmicrobiome.org/protocols-and-standards/16s/
  7. UC San Diego Today. What’s in Your Gut? 2018. https://today.ucsd.edu/feature/whats-in-your-gut
  8. UC San Diego. Big data from world’s largest citizen science microbiome project serves food for thought(媒体稿). 2018. https://bioengineer.org/?p=76686
  9. UC San Diego Jacobs School. News Release 2543(TMI 宣布). 2018. https://jacobs.ucsd.edu/news/release/2543
  10. Infection Control Today. Data From World’s Largest Citizen Science Microbiome Project Serves Up Food for Thought. 2018. https://www.infectioncontroltoday.com/view/data-worlds-largest-citizen-science-microbiome-project-serves-food-thought
  11. McDonald D, et al. Context and the human microbiome. Microbiome. DOI 10.1186/s40168-015-0117-2. https://microbiomejournal.biomedcentral.com/article/10.1186/s40168-015-0117-2
  12. Crowdsourcing Our National Gut(同行评论). 2018. https://pmc.ncbi.nlm.nih.gov/articles/PMC5954205/
  13. Turning Participatory Microbiome Research into Usable Data: Lessons from the American Gut Project. https://europepmc.org/articles/4798814
  14. NCBI SRA. ERX2290794: Illumina HiSeq 2500 sequencing(AGP 运行记录). https://ncbi.nlm.nih.gov/sra/ERX2290794
  15. Open Humans. American Gut Project. https://www.openhumans.org/activity/american-gut-project/
  16. AmericanGut.org(现 Microsetta 门户;85+ 期刊发表声明). http://americangut.org
  17. ASM mSystems 官方页面(Crossref Cited by 引用计数). https://journals.asm.org/doi/10.1128/mSystems.00031-18
  18. Science News. Here’s the poop on getting your gut microbiome analyzed. 2014. https://www.sciencenews.org/blog/gory-details/here’s-poop-getting-your-gut-microbiome-analyzed

§10.4 人工校验记录

内容模块 审核者 审核方式 审核状态
frontmatter 与 INFOBOX 硬事实 千方病案医学编辑部 与 FACTS.md 逐条比对(规模/日期/DOI/accession) ✅ 已通过/已验证
§1-§3 概览与规格 千方病案医学编辑部 论文原文与官方页面交叉核对 ✅ 已通过/已验证
§2 医学背景(ICD-11/SNOMED 映射) 千方病案医学编辑部 公共术语库交叉核对;自报属性核对 ✅ 已通过/已验证
§4-§6 数据结构与代码 千方病案医学编辑部 数据工程师审查流程与代码逻辑 ✅ 已通过/已验证
§6.5 坑点 8 个 千方病案医学编辑部 与论文 Methods/limitations 及官方仓库比对 ✅ 已通过/已验证
引用与许可声明 千方病案医学编辑部 URL 可达性与许可条款核对 ✅ 已通过/已验证
§9.2 BibTeX 条目 千方病案医学编辑部 DOI 逐一与 mSystems/期刊官方页核对 ✅ 已通过/已验证

§10.5 AI 生成章节标注

全章节由 AI 辅助生成初稿:§0-§4、§6-§9 为 AI 检索整理;§5、§7 中的评估意见为 AI 依据论文与官方文档的推断性整理;§8.2、§8.3 为 AI 基于社区惯例的选型建议。关键数字与结论均锚定 §10.3 来源。

§10.6 最后人工审核日期

最后人工审核日期:2026-09-17

页面状态:published(全部内容已完成审核并发布)


相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • hmp — 共享标签:基因组学与多组学 / 测序数据 / 微生物组
  • ega — 共享标签:基因组学与多组学 / 测序数据 / 队列研究
  • mgnify — 共享标签:基因组学与多组学 / 测序数据 / 微生物组
  • curatedmetagenomicdata — 共享标签:基因组学与多组学 / 测序数据 / 微生物组
  • uk-biobank — 共享标签:基因组学与多组学 / 测序数据 / 队列研究
  • gnomad — 共享标签:基因组学与多组学 / 测序数据
  • uniprot — 共享标签:基因组学与多组学 / 测序数据
  • 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
  • encode — 共享标签:基因组学与多组学 / 测序数据
  • geo — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集