信息速览
SRA(Sequence Read Archive)— AI-Ready Wikipedia
INFOBOX
| 属性 | 内容 |
|---|---|
| 全称 | Sequence Read Archive(SRA;前身 Short Read Archive) |
| 运营 | NCBI(NLM/NIH)——INSDC 美国节点;与 EBI ENA、DDBJ DRA 三节点互为镜像 |
| 启动 | ~2009(应对下一代测序数据爆炸) |
| 规模 | >3,100 万公共文件 / >47 PB(单副本,2025 官方口径);INSDC 三节点合计 534,254 studies / 66,912 petabases(2025-01) |
| 内容 | 原始/最小处理测序 reads(FASTQ/BAM/CRAM)+ 比对信息;WGS/WES/RNA-seq/宏基因组/单细胞全谱 |
| 对象模型 | BioProject(SRP)→ BioSample(SRS)→ Experiment(SRX)→ Run(SRR)四级 |
| 云访问 | AWS + GCP 全量镜像(NIH STRIDES,2019 起);AWS Open Data 免 egress;GCP us-east-1 免检索费 |
| 格式 | Normalized(含 BQS)/ SRA Lite(去质量分数,2023 起默认化) |
| 派生数据 | STAT 分类含量(元数据内建)+ RNA-seq gene feature counts(日更 TSV) |
| 受控边界 | dbGaP 链接受控数据约占档案三分之一 |
| 下载量 | 2020 年 >48 PB(官方工作组报告) |
| 政策 | NCBI Policy + NIH Genomic Data Sharing(GDS);期刊/资助方强制 deposit 的全球事实标准 |
| 本库关联 | GEO(芯片/功能组学)、ENA(欧洲节点)、dbSNP/ GEO(芯片/功能组学)、ENA(欧洲节点)、dbSNP/ClinVar(变异语义)、TCGA/GTEx/All of Us(受控队(变异语义)、TCGA/GTEx/dbSNP/ClinVar(变异语义)、TCGA/GTEx/All of Us(受控队列原始数据源) |
§0 E-E-A-T 信(受控队列原始数据源) |
§0 E-E-A-T 信任声明与免责声明
本页所有规模数字、格式政策与访问口径均核实自一手来源:NCBI 官方 NAR 数据库综述(Database resources of the NCBI in 2025, NAR 53:D1——31M 文件/47 PB 口径;2022 版——11.5 PB + 4.9 PB dbGaP 历史口径)、NIH Council of Councils SRA Data Working Group 报告(2021——增长预测/冷热存储/受控比例)、SRA 标准引用论文(Leinonen et al., NAR 39:D19-D25, 2011)、MetaGraph 论文(Nature 2025——INSDC 三节点 534,254 studies / 66,912 Pbp)与 AWS Open Data 注册表(sra-rnaseq-analysis 派生数据条目)。检索核实时间为 2026-09-19。
SRA 的规模数字随时间持续滚动且存在三个不同口径(公共文件数 / 测序文库数 / 三节点合计碱基数),本页在各处显式标注口径与出处。「47 PB」是 NCBI 单副本官方口径——不是全库下载量,也不是三节点总和;引用时声明口径与检索日期。
本页为技术参考文档:SRA 是全球测序数据的档案库而非质控后的分析数据集——数据质量、样本标签正确性与污染状态由提交者与使用者共同负责;受控人类数据的使用受 NIH GDS Policy 与 dbGaP 数据访问委员会约束;任何临床结论需经独立验证。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:世界最大公共测序原始数据档案——全球高通量测序仪输出的「第一手 reads」之家(FASTQ/BAM/CRAM)。
- 体量:>3,100 万公共文件 / >47 PB(NCBI 2025 口径);INSDC 三节点合计 66,912 petabases(2025-01)。
- 访问:公共数据免费开放——网页检索 / SRA Toolkit / AWS Open Data(免 egress)/ GCP(us-east-1 免检索费);受控人类数据走 dbGaP。
- 杀手锏:生命之树全物种 + 宏基因组 + 环境样本的原始数据不可替代性——期刊/资助方强制 deposit 政策的全球事实标准。
- 适用:重分析(reanalysis)、方法开发、宏基因组挖矿、病原监测、跨研究 meta 分析、AI 预训练语料。
- 不适用:质控后分析数据集(需自建管线)、变异语义查询(用 dbSNP/ClinVar)、组装基因组(用 GenBank/RefSeq)、全库 bulk 下载(47 PB 不现实——云原位检索)。
§1.1 摘要
每个高通量测序实验的产出都是数百万到数十亿条短读段(reads)——它们从测序仪流出后去哪里?NCBI 的 Sequence Read Archive(SRA)就是这个问题的全球答案:自 2009 年起,SRA 作为 INSDC(国际核酸序列数据库合作组织)的美国节点,收集原始或最小处理的测序 reads。到 2025 年,NCBI 官方口径为「超过 3,100 万公共文件、超过 47 PB(单副本)」;把 EBI 的 ENA 与 DDBJ 的 DRA 两个镜像节点算进来,INSDC 全库在 2025 年初已达 534,254 项研究、66,912 万亿碱基对(petabase-pairs)——这是一部「地球基因组数字普查」。
对 AI 团队,SRA 的价值在四个维度:
- 重分析的原料不可替代:期刊与资助方普遍强制 deposit——发表流程本身保证了数据供给;重分析(换比对软件/换参考基因组/换质控标准)是 SRA 的头号用途。
- 宏基因组与病原监测的全球底池:Serratus 单次扫描 570 万数据集发现 13 万+ 新 RNA 病毒;乳头瘤病毒多样性单次搜索提升 34%——「档案不是死数据,是未开采的矿」。
- 云原生取数范式的样板:全量镜像 AWS + GCP(NIH STRIDES 2019 起)、AWS Open Data 免 egress、元数据进 BigQuery/Athena——47 PB 级数据的可及性设计全球领先。
- 派生数据层的工程智慧:STAT 分类含量内建于元数据、RNA-seq gene feature counts 日更——NCBI 自己就在做「档案 → AI-ready 派生层」的示范。
数据的第一性事实:SRA 是档案不是数据集——元数据由提交者自由填写(同义词/拼写错误/外链引用遍布),质量分数在 SRA Lite 格式中被去除,受控人类数据约占三分之一——「先做元数据再工程与 QC,再谈跨研究聚合」是 SRA 项目的第一课。
§1.2 战略价值
- 科学记录的保存层:实验数据的可重复性依赖原始数据存档——SRA 使「发表后十年重跑一个 RNA-seq 实验」成为可能;这是所有下游衍生库(GEO 表达集、变异 callers、组装结果)的地基。
- 方法学的公共竞技场:比对软件/组装器/变异 caller 的 benchmark 都在 SRA 数据上做——「用 SRA 真实数据验证方法」是生信方法论文的标准动作。
- 监测与发现的前线:COVID-19 期间 NCBI 提供 70 万+ SARS-CoV-2 样本增强访问;STAT 分类工具使全球病原监测无需重算分类——公共卫生语义直接内建。
- AI 语料的新大陆:petabase 级序列语料是基因组基础模型(DNA 语言模型)的天然训练池——Logan/MetaGraph 等第三方索引使「扫全库」从不可能变成单机可承受。
§1.3 同类数据集横向对比
| 资源 | 定位 | 规模量级 | 与 SRA 的关系 |
|---|---|---|---|
| SRA(NCBI) | 原始测序档案(INSDC 美国节点) | >31M 文件 / >47 PB | — |
| ENA(EBI) | 原始测序档案(INSDC 欧洲节点) | 同库镜像 | 同一提交的欧洲入口;检索界面不同 |
| DDBJ DRA | 原始测序档案(INSDC 日本节点) | 同库镜像 | 亚洲节点;日本本地统计 |
| GEO | 芯片与功能组学 processed 数据 | 数百万系列 | 处理后数据档案(与 SRA 原始层互补;本库 geo 条目) |
| EGA | 人类受控基因组档案(欧洲) | PB 级 | 欧洲版 dbGaP——受控人类数据的欧洲通道 |
| dbGaP | 基因型-表型受控档案(美国) | 受控研究数千 | SRA 受控数据的表型-授权语境 |
| GenBank/RefSeq | 组装序列与参考 | 亿级序列 | 下游语义层(SRA 不收组装序列) |
| 亿级序列 | 下游语义层(SRA 不收组装序列) | ||
| Human Cell Atlas | 单细胞图谱计划 | 千万+ 细胞 | 其原始数据多数落 |
| openAHB/Logan | 第三方组装索引 | 27M 库组装 | SRA 的下游增强层(contigs) |
§1.4 版本时间轴
2001-2008 测序读段爆炸前夜(454/Illumina 早期;Short Read Archive 筹备)
~2009 SRA 上线(NCBI;INSDC 三节点分工:SRA/ENA/DRA)
2011 Leinonen NAR 引用论文(SRA 内容与提交标准确立)
2019 STRIDES Initiative:全量迁移 AWS + GCP(「首个最大云端生医数据集」)
2020 年下载量 >48 PB;COVID-19 病原监测(70 万+ SARS-CoV-2 样本)
2021 Working Group 报告:16.5 PB normalized / 受控 31%;冷热分层架构
2022 NAR 口径:11.5 PB 公共 + 4.9 PB dbGaP
2023-2024 SRA Lite 默认化(去 BQS);STAT 人类 reads 掩码 opt-in 服务
2025 NAR 口径:>31M 文件 / >47 PB;新平台 Element/Ultima 支持;
Logan 完成 27M 库组装;MetaGraph Nature 论文(INSDC 66,912 Pbp)
2026 持续滚动;第三方 petabase 索引生态成熟(Pebblescout/MetaGraph)
§1.5 应用场景矩阵
- 重分析(reanalysis):发表数据的换管线重跑——质控/比对/定量标准更新时的标准动作。
- 宏基因组挖矿:全球环境/肠道样本的序列搜索——新病毒/新抗性基因/新物种发现(Serratus/PV 案例)。
- 方法 benchmark:比对/组装/定量工具的真实数据评测——生信方法论文标配。
- 病原监测:STAT 分类 + 全球样本流——新发传染病的序列侦察网络。
- AI 预训练:petabase 级 DNA/RNA 序列语料——基因组语言模型的原料池。
- 跨研究 meta 分析:同表型多研究合并——样本量倍增的廉价路径(元数据再工程是前置)。
- 教学与培训:真实数据的小成本练手——生信课程的标准素材库。
§1.6 组件全景
SRA 的六个数据层:
- 原始数据层:提交者上传的 FASTQ/BAM/CRAM 或仪器特有格式——Original(原样保存)。
- 标准化层:NCBI ETL 后的 Normalized SRA 格式(含 base quality scores)——检索与下载的主格式。
- 轻量层:SRA Lite(去除 BQS)——2023 起默认化;文件更小、下载更快;质量信息缺失是代价。
- 元数据层:BioProject/BioSample/Experiment/Run 四级对象 + 提交者自由文本属性;进 BigQuery/Athena 可 SQL 化。
- 派生分析层:STAT 分类含量(每个 Run 的物种组成)+ RNA-seq gene feature counts(人类/小鼠计数 TSV,日更)。
- 访问与工具层:网页检索(Run Selector)/ SRA Toolkit(prefetch/fasterq-dump)/ Cloud Data Delivery / AWS ODP / GCP 桶。
§1.7 云原生档案的经济学
- 全量双云镜像:STRIDES 使 SRA 成为「第一个也是最大的云端生物医学数据集」——47 PB 级档案的云迁移是全球最大的公共数据基础设施工程之一。
- 免费出口的设计:AWS Open Data Program 支持免费下载与免费 egress(无 AWS 账号也可 --no-sign-request);GCP us-east-1 免检索费——「数据出去不要钱」是与商业云格局的显著差异。
- 冷热分层:低访问量数据进冷存储(NEARLINE 等)——检索时间换存储成本;官方文档明确各层语义。
- 成本陷阱:免费的是「NCBI 桶内读取与官方出口」——把数据转到自建桶再跨区/跨云搬运会产生 egress 费;大规模项目先画数据流再估成本。
- 本地集群的位置:SRA Toolkit 支持从云桶直取到本地——小规模研究(几十-几百 Runs)本地处理仍然主流;万级 Runs 以上考虑云原位。
§1.8 SRA 在研究流程中的定位
实验设计 → 测序生产 → 原始数据 deposit → 发表 → 重分析/聚合/发现
│ │ │ │
│ ├─ SRA:原始 reads 档案( deposit 强制层)
│ ├─ SRA:重分析原料(换管线/换参考)
│ ├─ SRA:跨研究聚合(meta 分析底池)
│ └─ SRA:petabase 挖矿(病毒/抗性/新物种)
└─ GenBank/RefSeq(组装序列)← dbSNP/ClinVar(变异语义)
| 流程阶段 | SRA 角色 | 典型用法 | 验收标准 |
|---|---|---|---|
| 数据产出 | 档案入口 | deposit(期刊/资助方要求) | accession 可引用 |
| 方法开发 | benchmark 素材 | 公开数据集评测 | 锁定 accession 清单 |
| 重分析 | 原料供给 | 原始 reads 重跑管线 | 结果与原研究对照 |
| 聚合发现 | 底池 | 宏基因组/跨研究合并 | 元数据再工程完成 |
定位纪律:SRA 覆盖「原始层」最厚——需要 processed 数据去 GEO,需要语义去 dbSNP/ClinVar/KEGG;SRA 的核心承诺是「仪器输出的第一手事实」。
§1.9 INSDC 三节点镜像的独特设计
- 一份提交、三处可及:任一节点提交自动共享三节点(NCBI/EBI/DDBJ)——「地理冗余」使全球研究者从最近入口取数;检索界面与统计口径各异但底层数据一致。
- 历史与治理:INSDC 自 1980s GenBank 时代延续至今——三节点合作是国际科研基础设施治理的活化石;数据政策(如人类数据边界)在三节点间有差异,提交前读各自政策。
- 对 AI 的含义:镜像意味着「数据主权冗余」——单节点故障/政策变化不致数据丢失;但也意味着「同一数据多个入口」——引用时统一 accession(三节点共享 ID 体系)即可,无需重复下载。
§2 医学与科学背景
§2.1 原始 reads 的科学语义:为什么重分析不可替代
- 处理后数据是「观点」,原始数据是「事实」:论文里的表达矩阵/变异列表都经过管线选择(比对软件/过滤阈值/参考版本)——换一条管线结论可能变;SRA 保存的原始 reads 让后来的研究者重新做选择。
- 方法学演进的复利:比对算法(Bowtie2→STAR→HISAT2)、定量方法(TPM/RSEM/Salmon)、质控标准(MultiQC)持续演进——十年前的数据用今天的管线重跑,往往产出更好的结果;这是 SRA「越老越值钱」的原因。
- 参考基因组的世代更替:GRCh37→GRCh38→T2T-CHM13——历史数据在新参考上的重新比对能释放新信息(着丝粒/短臂区域);原始 reads 是唯一能跨参考世代重用的资产。
- 长读长时代的混合装配:历史短读数据 + 新增长读数据做混合组装——SRA 的历史存量使「 retro 补齐」成为可能。
§2.2 元数据的非标准化问题(SRA 的头号痛点)
- 提交者自由文本:SRA 不强制标准化术语——样本属性(组织/疾病/年龄)由提交者任意填写;「forskin fibroblast」(拼写错误)、「cell line BJ」(外链引用)、「no」(否定键)类混乱是常态(MetaSRA 论文的经典例证)。
- 同义词与拼写变体:同一疾病有数十种写法——跨研究聚合的前提是「元数据再工程」(映射到本体/受控词表)。
- 结构边界模糊:研究级/样本级/实验级信息的混写——提交者常把实验协议写进样本描述;自动抽取需要区分「描述对象」。
- 工程应对:MetaSRA(人类样本标准化 schema)与 OncoMX 类再工程库是起点;NCBI 自身的 Picard/元数据改进持续进行——「不要直接解析原始 metadata 做大规模统计」是铁律。
§2.3 SRA Lite 与质量分数的取舍
- BQS 的存储代价:base quality scores 是 SRA 云存储的最大成本驱动(Working Group 报告)——每个碱基的质量值使文件体积数倍膨胀。
- SRA Lite 的设计:去除 BQS 的轻量格式——2023 起逐步成为默认;文件更小、下载更快、成本更低。
- 下游影响:依赖质量值的 QC(FastQ 的 Q 分布)、比对器质量加权、变异 caller 的 BQSR 环节——Lite 格式下结果可能改变;官方立场是「多数应用不受影响」,但方法论文必须声明所用格式。
- 补偿路径:Original(原样提交)数据在云上可取——需要 BQS 的分析用 original 或 Normalized 格式;重分析报告写明「SRA Lite(无 BQS)」或「Original(含 BQS)」。
§2.4 宏基因组与病原监测的语义
- 环境与肠道样本的主体性:SRA 中宏基因组/环境样本是最大类别之一——「地球基因组普查」的主战场;STAT 分类工具使每个 Run 的物种组成可直接查询。
- Serratus 的示范:云上扫 5.7M 数据集(10.2 Pbp)找 RNA 依赖的 RNA 聚合酶标志基因——13 万+ 新 RNA 病毒,RNA 病毒已知多样性提升约一个数量级;COVID-19 期间正是这套范式支撑了全球监测。
- 乳头瘤病毒的增量:Logan-SRA(27M 库组装压缩)单次 ~10 小时对齐搜索——独立重识别 65% 已知 PV 类型 + 新增 383 新型(多样性 +34%),且发现新类型分布与采样强度不成正比( undersampled 生物群系更有产出)。
- 公共卫生语义:STAT 人类 reads 掩码服务(opt-in)是「监测与隐私」的平衡设计——宏基因组研究中的 incidental 人类序列可被主动掩码防误公开。
§2.5 变异发现生态中的位置
- SRA → 变异 caller → dbSNP/ClinVar:变异语义库的原始证据层在 SRA——ClinVar 条目回溯其支撑 reads 是可复现性的终极检查。
- Frequency 参考的原料:gnomAD/topMed 的变异频率全部源自 SRA/受控档案的原始数据——「SRA 存量决定频率目录的深度」。
- 罕见变异的全球对照:新发突变位点在全球 SRA 存量中的检索(k-mer 类工具 Pebblescout)——「这个变异在公开数据里出现过吗」从几个月变成秒级。
§2.6 与 GEO 的分工结构
GEO(本库 geo 条目)存「处理后数据」(表达矩阵/甲基化 beta 值)+ 仪器原始数据(常转发至 SRA);SRA 只存原始层。标准工作流:GEO 检索研究 → 原始数据落 SRA 的 accession → SRA 取数重跑。「GEO 找图、SRA 取数」是转录组重分析的双库节奏。
§2.7 AI 视角的科学定位
对医疗 AI,SRA 是「序列模态的最大语料库 + 方法学 benchmark 场」:DNA/RNA 语言模型的预训练池(petabase 级)、监督信号弱但规模极大的自监督场、工具链评测的真实分布源。它的短板(元数据噪声、无统一 QC、BQS 缺失)都是「全球自愿 deposit」的固有代价——用它的方法论核心是「锁定 accession 清单 + 元数据再工程 + 自建 QC 管线」三件套。
§2.8 隐私与受控边界的技术语义
- 人类数据的双轨:公共 SRA 的人类数据应为去标识化/已获同意数据——但「序列数据理论上可再识别」使受控框架存在;dbGaP 链接的数据(约三分之一)需 DAC 批准。
- STAT 掩码的治理创新:提交者可 opt-in 让 NCBI 用 STAT 检测并掩码 FASTQ/BAM 中的意外人类 reads——宏基因组/环境研究中的 incidental 发现防线。
- 再识别的全球红线:对公共数据尝试再识别在多数机构与期刊政策中违规——与 All of Us 行为准则同构的伦理约束。
- 跨库合流的边界:SRA 公共数据与自有数据合并在技术上容易——但人类数据合并后的 re-consent/隐私评估是研究者责任;「技术可行 ≠ 合规可做」。
§2.9 数据质量与污染的技术语义
SRA 的质量语义与 curated 数据集完全不同——「档案原样保存」意味着质量责任在提交者与使用者之间流转:
- 污染的三个来源:样本交换(index hopping/标签跳跃)、物种混杂(宿主 reads 混入微生物样本)、核酸降解(FFPE/环境降解)——STAT 分类字段使宏观污染可预查,样本级污染需 kraken2/FastQ Screen 精查。
- 「提交即归档」的纪律:SRA 不做数据重写——即使后来发现标签错误,历史快照仍可被引用;corrections 走提交者更新流程——「版本语义」因此是 Run 级而非全库级。
- QC 的双层结构:官方层(STAT/格式校验/文件完整性)+ 使用者层(FastQC/MultiQC/比对率)——「官方 QC 通过」不等于「分析级可用」;二者缺一不可。
- 工程含义:以 SRA 为源的管线必须内建 QC 闸门(fail-fast)——把「档案质量未知」作为设计前提,而不是异常;这与 curated 库(gnomAD/TCGA 先 QC 后发布)的用法是两种范式。
§3 数据集规格
§3.1 规格总表
| 维度 | 规格(2025-2026 官方口径) |
|---|---|
| 公共文件 | >31,000,000 |
| 数据量 | >47 PB(单副本) |
| 测序文库 | >38 million 公共文库(Logan/eLife 口径) |
| INSDC 三节点 | 534,254 studies / 66,912 petabases(2025-01 MetaGraph) |
| 受控比例 | 约三分之一(dbGaP 链接) |
| 年下载量 | >48 PB(2020 官方口径) |
| 对象模型 | BioProject(SRP)/ BioSample(SRS)/ Experiment(SRX)/ Run(SRR) |
| 格式 | FASTQ/BAM/CRAM;Normalized / SRA Lite |
| 平台 | Illumina/IonTorrent/PacBio/ONT/Element/Ultima 等 |
| 云 | AWS + GCP 全量镜像;AWS ODP 免 egress |
| 派生 | STAT 分类含量 + RNA-seq counts(日更) |
| 政策 | NCBI Policy + NIH GDS Policy |
§3.2 规模演进的时间切片
| 时点 | 口径 | 出处 |
|---|---|---|
| 2021-03 | 16.5 PB normalized / 30 PB original / 14.5M records | Working Group 报告 |
| 2022 | 11.5 PB 公共 + 4.9 PB dbGaP | NAR 2022 数据库综述 |
| 2025(官方) | >31M 文件 / >47 PB 单副本 | NAR 2025 数据库综述 |
| 2025-01(INSDC) | 534,254 studies / 66,912.1 Pbp | MetaGraph Nature 论文 |
| 2025(第三方) | >38M 公共文库;Logan 27M 库组装 | eLife reviewed preprint |
解读:官方「文件」口径与第三方「文库」口径相差约 20%——文件含比对/归档产物;引用时先问口径。增长趋势未减(官方 2021 预测 2025 达 32.5 PB ETL 与实际相符)。
§3.3 DAIMS 数据AI就绪度评估
| 维度 D | 数据完整性 | 评分 | 说明 |
|---|---|---|---|
| D1 | 人群/物种覆盖 | 10/10 | 生命之树全谱 + 宏基因组 + 环境——档案类满分 |
| D2 | 数据深度 | 9/10 | 原始 reads 最深层;质控状态参差 |
| D3 | 元数据质量 | 5/10 | 提交者自由文本——聚合前需再工程(最大短板) |
| D4 | 多组学 | 7/10 | 测序模态全谱;非测序模态(影像等)不覆盖 |
| A1 | 机器可读 | 9/10 | 云桶 + BigQuery/Athena + Toolkit 全链 API |
| A2 | 文档完备 | 8/10 | 官方文档详细;但元数据语义文档弱 |
| A3 | 接入成本 | 9/10 | 免费开放 + AWS ODP 免 egress;本地小规模零成本 |
| A4 | 更新机制 | 8/10 | 持续滚动 + 派生层日更;无版本号(锁 accession 替代) |
| I1 | 指标标准化 | 6/10 | BQS/Lite 格式分裂;元数据无标准 |
| I2 | 可复现性 | 9/10 | accession 级可复现的黄金标准 |
| M1 | 多模态对齐 | 6/10 | 元数据对齐靠再工程;序列-样本链接内建 |
| M2 | 时间序列 | 5/10 | 无内建时序语义(纵向研究靠自组织) |
| S1 | 数据安全 | 7/10 | 受控层完备(dbGaP);公共层污染/误公开风险靠掩码 opt-in |
| S2 | 合规负担 | 8/10 | 公共数据近零负担;受控数据走 DAC 流程 |
总分:B+ 级(可及性与覆盖满分档;扣分项是元数据质量与格式分裂——「最大档案」与「最乱元数据」是一枚硬币的两面)
§3.4 存储与计算需求
| 场景 | 体量 | 建议路径 |
|---|---|---|
| 单研究重分析(10-100 Runs) | GB-数百 GB | 本地 SRA Toolkit(prefetch → fasterq-dump) |
| 中型项目(100-1K Runs) | TB 级 | 本地集群或单云 VM(注意本地磁盘周转) |
| 大型聚合(1K-10K Runs) | 10-100 TB | 云原位(GCE/S3 桶内处理) |
| petabase 挖矿 | PB 级 | 云原生 + 专用索引(Logan/MetaGraph 类) |
| 元数据查询 | GB 级 | BigQuery/Athena 直查(无需下载数据) |
SRA 的工程重心是「按需取数」——47 PB 永远不该也不必全量落地;accession 清单 → 批量取数 → 流式处理是标准循环。
§3.5 获取通道
- 网页检索:NCBI SRA 网页 + Run Selector(过滤/批量导出 accession);浏览器级零门槛。
- SRA Toolkit:prefetch(断点续传下载 .sra)→ fasterq-dump(转 FASTQ,–split-3 分双端)——本地工作流的标准二件套。
- AWS Open Data:s3://sra-pub-src-1 / sra-pub-run-odp(–no-sign-request 免账号)——脚本化批量取数首选。
- GCP:us-east-1 桶(免检索费)+ Cloud Data Delivery 网页(选区送桶)。
- 元数据 SQL:BigQuery/Athena 的 SRA 元数据表(含 STAT 分类)——「先 SQL 选 Run 再取数」的工程姿势。
- ENA 门户:REST API(ebi.ac.uk/ena/portal/api)——欧洲节点 API 化取数更顺手(与 SRA 同库)。
§3.6 口径对齐表
| 数字 | 出处口径 | 澄清 |
|---|---|---|
| >31,000,000 公共文件 / >47 PB | NCBI NAR 2025 官方 | 「文件」口径(含比对/归档产物);单副本 |
| >38 million 公共测序文库 | eLife 2025(引 Logan) | 「文库」口径——比文件口径少约 20% |
| 534,254 studies / 66,912 Pbp | MetaGraph Nature 2025(2025-01-11) | INSDC 三节点合计碱基——非 NCBI 单节点 |
| 16.5 PB normalized / 14.5M records | Working Group 报告(2021) | 历史时点口径 |
| 11.5 PB + 4.9 PB dbGaP | NAR 2022 | 历史时点;受控比例参考 |
| 受控约 31% | Working Group 报告(2021) | 2021 时点——当前或有变化 |
| 2020 年下载 >48 PB | Working Group 报告 | 下载量 ≠ 库存量 |
| 70 万+ SARS-CoV-2 样本 | NCBI NAR 2022 | 病原监测专项口径 |
§3.7 版本与锁定纪律
- 档案无版本号:SRA 持续滚动(新提交/状态变更/格式升级)——「2026 年的 SRA」不是快照;重分析必须锁 accession 清单 + 检索日期。
- 数据状态生命周期:官方已正式定义记录状态与流转(Submitted → Processing → Public 等)——引用前核对状态。
- 格式选择声明:Normalized vs SRA Lite vs Original——方法论文写明下载格式(BQS 有无)。
- accession 语义:SRR(Run)是取数单元;SRP/SRS/SRX 是组织层级——引用数据量时说明计数层级(「30 个 SRP/800 个 SRR」)。
§3.8 数据层级与文件格式详表
| 层 | 格式 | 访问 | 分析入口 |
|---|---|---|---|
| Original(原样提交) | FASTQ/BAM/CRAM/仪器格式 | 公共/受控 | 需 BQS 的分析;文件最大 |
| Normalized | SRA 格式(含 BQS) | 公共/受控 | Toolkit 标准目标;平衡选择 |
| SRA Lite | SRA 格式(无 BQS) | 公共/受控 | 默认下载格式;小而快 |
| 比对产物 | BAM/CRAM(部分提交) | 公共/受控 | 直接可视化/重比对起点 |
| RNA-seq counts | TSV(gene id × count) | 公共 | 差异表达快速起点(日更派生) |
| STAT 分类 | 元数据字段 | 公共 | 宏基因组预筛(无需下数据) |
| 元数据 | BigQuery/Athena 表 | 公共 | SQL 选 Run/项目画像 |
| 受控(dbGaP) | 同上格式 | dbGaP DAC 批准 | 表型链接的人类数据分析 |
- 格式纪律:QC 类分析(Q 分布)必须 Original/Normalized——SRA Lite 的 BQS 缺失使 QC 语义改变;比对/定量类 Lite 可用但需声明。
- FASTQ 双端分离:fasterq-dump --split-3 输出 _1/_2 文件——单文件假定会踩坑(老式 fastq-dump 行为不同)。
§4 数据结构
§4.1 四级对象模型
SRA 对象模型(INSDC 标准)
├── BioProject(SRP) # 研究项目:总体目标/资助/数据政策
│ ├── BioSample(SRS) # 生物来源:物种/组织/供体(含属性键值对)
│ │ ├── Experiment(SRX)# 实验设计:平台/建库策略/仪器参数
│ │ │ ├── Run(SRR) # 运行:实际序列数据(取数单元)
│ │ │ └── ...更多 Run
│ │ └── ...更多 Experiment
│ └── ...更多 Sample
└── Submission # 提交包:元数据 + 指令
# 取数链:SRP 检索 → SRS 过滤 → SRX 确认设计 → SRR 批量下载
# 引用链:论文引用 SRP;方法引用 SRR 清单
§4.2 元数据检索与队列选取(BigQuery/ENA API)
-- BigQuery(NCBI SRA 元数据公共表):找人类 RNA-seq 公共 Runs(示意)
SELECT
acc, -- Run accession(SRR)
biosample, -- SRS
organism, -- 分类
platform, library_strategy -- Illumina / RNA-Seq
FROM `nih-sra-datastore.sra.metadata`
WHERE organism = 'Homo sapiens'
AND library_strategy = 'RNA-Seq'
AND acc LIKE 'SRR%'
LIMIT 1000;
-- 官方公共数据集:nih-sra-datastore.sra(含 STAT 分类字段 tax_analysis)
# ENA 门户 API(同库欧洲节点):下载人类 RNA-seq Runs 的 TSV 清单
curl "https://www.ebi.ac.uk/ena/portal/api/search?result=read_run&query=tax_eq(9606)%20AND%20library_strategy=RNA-Seq&fields=run_accession,sample_accession,study_accession,scientific_name,fastq_ftp&format=tsv&limit=50" -o srr_list.tsv
§4.3 取数与转换(SRA Toolkit)
#!/usr/bin/env bash
# SRA 取数三件套:prefetch(断点续传)→ fasterq-dump(转 FASTQ)→ 压缩
set -euo pipefail
# 1) 单 Run 取数
prefetch SRR12345678 # 下载 .sra(断点续传;默认到 ~/ncbi/public/sra)
# 2) 转 FASTQ:--split-3 分离双端(单端仍出单文件)
fasterq-dump SRR12345678 --split-3 --threads 8 --outdir ./fastq/
gzip ./fastq/SRR12345678_1.fastq ./fastq/SRR12345678_2.fastq
# 3) 批量:accession 清单逐行取数(限速防封禁)
while read -r acc; do
prefetch "$acc" && fasterq-dump "$acc" --split-3 --threads 8 -O ./fastq/
done < SRR_Acc_List.txt
# 4) AWS Open Data 直取(免账号;跳过 NCBI 带宽)
aws s3 cp --no-sign-request s3://sra-pub-run-odp/srp/123/SRR12345678 ./
§4.4 RNA-seq 派生计数的使用
#!/usr/bin/env python3
"""NCBI 官方 RNA-seq gene feature counts:跳过比对直接拿计数矩阵。
来源:s3://sra-rnaseq-analysis(人类/小鼠 bulk RNA-seq;日更新)"""
import boto3, pandas as pd
s3 = boto3.client("s3")
# 1) 取单个 Run 的计数(两列:gene_id, count)
s3.download_file("sra-rnaseq-analysis",
"by_run/SRR12345678/SRR12345678.tsv",
"SRR12345678.tsv")
cnt = pd.read_csv("SRR12345678.tsv", sep="\t")
print(cnt.head())
# 2) 多 Run 合并成矩阵(跨研究 DE 的快速起点)
import os
accs = ["SRR1", "SRR2", "SRR3"] # 示例;实际来自 metadata 检索
mat = {}
for a in accs:
key = f"by_run/{a}/{a}.tsv"
s3.download_file("sra-rnaseq-analysis", key, f"{a}.tsv")
df = pd.read_csv(f"{a}.tsv", sep="\t", index_col=0)
mat[a] = df.iloc[:, 0]
matrix = pd.DataFrame(mat)
print(matrix.shape) # genes × runs——直接喂 DESeq2/edgeR 前的原料
(派生计数是「官方管线口径」——与自己重比对的数值会有差异;跨研究 DE 的严谨做法仍以自建管线为准,派生层做快速预览与量级验证。)
§4.5 元数据与可复现指纹
- accession 清单:所有用到的 SRR/SRP 列表 + 检索日期——复现包第一件。
- 格式声明:SRA Lite / Normalized / Original + Toolkit 版本——BQS 有无影响 QC 类结果。
- STAT 快照:分类含量字段随时间可能更新——记录检索时点。
§4.6 完整性清单
- [ ] accession 清单 + 检索日期双戳
- [ ] 下载格式(Lite/Normalized/Original)声明
- [ ] 元数据再工程(同义词映射/本体对齐)记录
- [ ] QC 管线(FastQC/MultiQC)与阈值透明
- [ ] 受控/公共边界确认(人类数据)
- [ ] 平台/建库策略过滤(混平台 meta 分析的分层)
- [ ] 双端/单端统一处理(–split-3 语义)
- [ ] 偏倚面(deposit 自愿性/期刊偏好)limitation 段落
§4.7 数据血缘
全球测序实验室(期刊/资助方 deposit 要求)
→ 提交(BioProject + BioSample + 数据文件)
→ NCBI ETL(格式标准化/STAT 分类/RNA-seq counts)
→ 三节点镜像(INSDC:SRA/ENA/DRA)
→ 双云全量镜像(AWS ODP / GCP)
→ 研究者取数(Toolkit/云桶/API)
→ 重分析产物(比对着/计数矩阵/组装 contigs → GEO/GenBank 回流)
「提交 → 标准化 → 镜像 → 取数 → 重分析 → 回流」六段血缘——SRA 是全球测序数据循环的「心脏泵」:deposit 进、reanalysis 出、processed 产物再回 GEO/GenBank,构成科学数据的完整循环。
§4.8 云原位流式处理(大数据集)
#!/usr/bin/env python3
"""AWS ODP 云原位流式:千级 Runs 不落地 NCBI 带宽,桶对桶/流式处理。
场景:中型聚合(1K Runs)——先把数据流图画清楚(egress 陷阱,§6.5 坑点 5)。"""
import boto3, subprocess, json
s3 = boto3.resource("s3") # --no-sign-request 等价:botocore UNSIGNED 配置或公开桶
# 1) 清单驱动的批量取数(官方公共桶,免 egress)
bucket = s3.Bucket("sra-pub-run-odp")
with open("srr_list.txt") as f:
accs = [l.strip() for l in f if l.strip()]
def fetch(acc: str):
"""官方桶内对象命名按 SRP 前缀分桶;先探测再下载。"""
prefix = acc[3:6] # SRR123 → "123" 路由段
key = f"srp/{prefix}/{acc}"
local = f"./sra/{acc}.sra"
bucket.download_file(key, local) # 同区 EC2 上跑:免费且快
return local
# 2) 流式转换:转 FASTQ 后立刻 QC + 删除 .sra(存储周转纪律)
for acc in accs[:50]: # 先试跑 50 个
path = fetch(acc)
subprocess.run(["fasterq-dump", path, "--split-3", "-O", "./fastq/"], check=True)
subprocess.run(["gzip", "-f"] + [p for p in __import__("glob").glob(f"./fastq/{acc}*")])
subprocess.run(["rm", path]) # .sra 用完即删(周转)
# 3) 大规模:把本段逻辑搬进 GCE/SageMaker 同区实例——零 egress
(云原位的成本核心是「同区」——EC2 与 S3 同区流量免费;跨区/下载回本地才产生 egress;千级 Runs 的预算差异可达 10 倍。)
§4.9 k-mer 撞车检测与全球搜索
#!/usr/bin/env bash
# 序列撞车检测:新序列是否已存在于公开库(Pebblescout 类服务/本地 MetaGraph)
# 1) Pebblescout(NCBI 内建服务化 k-mer 搜索——网页/API)
# 输入:候选 contig/序列 FASTA → 秒级返回命中 Runs 列表
# 2) 本地 MetaGraph 索引(自建场景:研究者/机构级)
metagraph build -v -k 31 --mem-gb 200 \
-o my_index annotation_xf contigs.fa # 构建计数 de Bruijn 图索引
metagraph query -v -i my_index \
-o hits.tsv candidate_sequences.fa # 查询公开库索引
# 3) 命中解读:新序列(无命中)→ blast 确认新性 → 系统发育定位
makeblastdb -in nt_subset.fa -dbtype nucl
blastn -query candidate.fa -db nt_subset.fa -outfmt "6 qseqid sseqid pident length" -max_target_seqs 20
(「先索引后取数」的新默认——MetaGraph 估全库索引 ~172-223 TB(Nature 2025),单机可承受;Pebblescout 把 3.7 Pbp 做成秒级服务——撞车检测从「数月 blast 全库」变成「秒级 k-mer + 定向 blast 确认」。)
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用哪些层 | 关键动作 | 陷阱 |
|---|---|---|---|
| 重分析(转录组) | Original/Normalized + 元数据 | 自建管线 + 原研究对照 | Lite 无 BQS 的 QC 失效 |
| 宏基因组挖矿 | STAT 预筛 + 原始 reads | k-mer/组装双路 | 元数据地理信息缺失 |
| 病原监测 | STAT 分类字段 | 直接 SQL 监控 | 掩码 opt-in 的盲区 |
| 方法 benchmark | 锁定 accession 集 | 公平切分 | 数据泄漏(同 study 跨 train/test) |
| 跨研究 meta | 元数据再工程先行 | 同义词映射/批次校正 | 元数据直用假相关 |
| AI 预训练 | 云原位流式 | 序列 tokenize | 分布偏移(物种不平衡) |
§5.2 转录组重分析协议
- 清单锁定:GEO 找研究 → SRA 取 accession → 清单入库(SRP/SRR 双层)。
- QC 三查:FastQC(R1/R2)→ MultiQC 汇总 → 剔除异常 Run(质量/接头/复杂度)。
- 比对/定量:STAR/HISAT2 比对 GRCh38 + featureCounts/Salmon 定量——与原研究管线对照。
- 批次校正:study 作为批次协变量(ComBat/limma)——跨研究 DE 必做。
- 对照验证:重跑结果与原文表的关键基因量级一致(±2 倍内)——不一致先查元数据再查版本。
§5.3 宏基因组挖矿协议
- STAT 预筛:SQL 选目标物种/低丰度域——只取候选 Run(省 90% 下载)。
- 质控:fastp 剪接头 + BBTools 去人类污染——防 incidental 序列。
- 双路检测:k-mer 搜索(Pebblescout/MetaGraph 索引)+ 组装(MEGAHIT)→ ORF 预测 → HMM 搜索。
- 验证闭环:候选序列回 NCBI nt/blast 确认新性 → 系统发育定位。
- 报告:accession 溯源表(每个新发现 → 来源 Run 列表)——审稿必查。
§5.4 成本模型
| 场景 | 技术路线 | 成本量级 |
|---|---|---|
| 单研究重分析(50 Runs) | 本地 Toolkit + 桌面工作站 | $0 数据费;人力为主 |
| 中型聚合(1K Runs) | 云 VM + S3 桶 | 数百-数千美元(计算为主) |
| petabase 扫描 | 云原生 + 专用索引 | 数万美元级(Serratus 类项目) |
| 元数据普查 | BigQuery/Athena | 数美元(查询费) |
| 存储 | 自建桶 | egress 免费但存量收费 |
($0 的元数据普查 vs 数万美元的全库扫描——「先 SQL 后取数」的纪律直接决定预算数量级。)
§5.5 失败模式清单
- 元数据直用:自由文本当结构化数据——假关联丛生;再工程先行。
- Lite 格式做 QC:BQS 缺失使 Q 分布全平——用 Original 补。
- 同 study 跨切分:benchmark 训练测试泄漏——按 SRP 切。
- 单端/双端混拼:–split-3 语义误解——显式检查文件对。
- 下载风暴:千级 Runs 直连 NCBI——限速/分批/AWS ODP 分流。
- egress 陷阱:官方桶免费、自建桶出口收费——数据流图画清楚。
- 受控混入:dbGaP 数据当公共用——授权边界核查。
- 污染未查:样本交换/指数跳跃/物种混杂——kraken/STAT 双查。
§5.6 校准与验证协议
| 验证层 | 数据源 | 指标 | 通过线(参考) |
|---|---|---|---|
| L1 取数完整性 | accession 清单 vs 实得 | 拿全率 | 100%(缺数逐条说明) |
| L2 QC 通过率 | MultiQC | 异常 Run 比例 | <10% 并逐条记录 |
| L3 重分析一致性 | vs 原研究产物 | 关键基因量级 | ±2 倍内且方向一致 |
| L4 跨研究批次效应 | PCA/UMAP | study 聚类程度 | 校正后混合 |
| L5 污染检查 | STAT + kraken2 | 非 target reads 比例 | 报告并过滤 |
| L6 方法学复现 | 独立实现者 | 管线重跑一致 | 主结论复现 |
- L3 是重分析的灵魂:与原研究一致≠管线相同——量级与方向的一致性说明「结论对方法选择稳健」。
- L5 的卫生学意义:宏基因组研究的人类污染检查同时是隐私合规动作(防 incidental 公开)。
§6 实证结果与方法学分析
§6.1 petabase 扫描的三个里程碑
- Serratus(2021):云上 5.7M 数据集 / 10.2 Pbp 转译搜索——13 万+ 新 RNA 病毒;「云原生 + 锁定标志基因」范式的确立;COVID-19 监测的直接技术储备。
- Logan(2024-2025):27M 库的组装压缩——「archive → assembled contigs」的一次性全球重工程;下游搜索从 reads 层跃升到 contig 层。
- MetaGraph(Nature 2025):de Bruijn 图索引——估全库索引仅 ~172-223 TB(可装进数块消费级硬盘,$2,500);「petabase 数据的 petabyte 级索引」的压缩复利证明。
§6.2 乳头瘤病毒案例:单库重扫的边际产出
- 设计:Logan-SRA 组装库上 ~10 小时对齐搜索——比对传统五十年研究积累(992 个 PV 类型)。
- 结果:独立重识别 65% 已知类型 + 383 新型(+34%),跨 105 宿主物种——犀牛/田鼠/灰狐等新宿主。
- 方法学启示:新类型分布与采样强度不成正比——东非/南美的 undersampled 生物群系反而高产;「挖矿策略应按生态盲区而非数据量分配」。
- 对 AI 的含义:数字化石搜索(petabase)+ 生态先验(盲区优先)= 发现效率的新解;纯堆算力的边际产出递减。
§6.3 方法学三层框架(gsm)
- G(Ground layer):原始 reads——仪器输出的事实层(SRA 的本体)。
- S(Synthesis layer):比对/定量/组装/STAT 分类——标准化推断层(可重跑可替换)。
- M(Medical layer):疾病关联/临床结论——语义层(需验证闭环)。
越层引用:把 G 层的 STAT 粗分类当 M 层诊断(「检出 HIV 序列 = HIV 感染」)是宏基因组论文的常见审稿雷——分类含量是环境信号不是临床诊断;论文口径按层声明。
§6.4 接力实验设计
- SRA → GEO:原始 reads 重跑 → 与 processed 矩阵对照。
- SRA → gnomAD/dbSNP:重分析变异 → 频率目录对照。
- SRA → ClinVar:新变异 → 临床语义核对。
- SRA → GenBank/RefSeq:新组装 → 分类语义层登记。
- SRA → Logan/MetaGraph:档案 → 第三方索引(挖矿提速)。
§6.5 八个真实坑点
- 坑点 1:元数据直用——自由文本同义词/拼写错误;再工程先行。
- 坑点 2:Lite 格式做 QC——BQS 缺失;Original/Normalized 补齐并声明。
- 坑点 3:同 study 泄漏——benchmark 按 SRP 切分;Run 级随机切是泄漏。
- 坑点 4:下载风暴——千级 Runs 直连 NCBI 触发限流;AWS ODP 分流 + 限速。
- 坑点 5:egress 费用——官方桶免费、自建桶出口收费;数据流图先行。
- 坑点 6:受控数据混用——dbGaP 数据当公共引用;授权边界逐条核查。
- 坑点 7:双端语义——–split-3 的文件对语义;单端数据误拆。
- 坑点 8:STAT 粗分类当诊断——环境信号 ≠ 临床结论;分层口径声明。
§6.6 审稿人自查清单
- [ ] accession 清单 + 检索日期写入数据可用性声明?
- [ ] 下载格式(Lite/Normalized/Original)与 Toolkit 版本声明?
- [ ] 元数据再工程(同义词映射)描述?
- [ ] 按 SRP 切分防泄漏?
- [ ] QC 管线与阈值透明?
- [ ] 污染检查(STAT/kraken)记录?
- [ ] 受控/公共边界确认?
- [ ] 跨研究批次校正方法描述?
§6.7 档案演进的方法学含义
- SRA Lite 默认化(2023-):「质量分数默认消失」改变了 QC 语义——方法论文的格式声明从可选变必选。
- STAT 掩码 opt-in(2024-):宏基因组数据的 incidental 人类序列有了官方防线——但只覆盖 opt-in 提交,历史数据是盲区。
- 新平台支持(Element/Ultima):混合平台数据的比对器兼容性是新坑——平台作为批次协变量的必要性上升。
- 第三方索引成熟(Logan/MetaGraph):挖矿成本从「云集群」降到「单机 + 索引」——「先索引后取数」的新默认。
§6.8 第三方索引生态的工程图景
| 工具/项目 | 方法 | 规模 | 语义 |
|---|---|---|---|
| Logan | 云端组装 + 压缩 | 27M 库 contigs | 「archive → assembled」一次重工程 |
| MetaGraph | 计数 de Bruijn 图索引 | 全库估 ~172-223 TB | k-mer 对齐级搜索(Nature 2025) |
| Pebblescout | 核苷酸 k-mer | 3.7 Pbp | 秒级查询(SRA 内建服务化) |
| Serratus | 云转译搜索 | 5.7M 集 / 10.2 Pbp | 蛋白标志基因扫描 |
| STAT | NCBI 官方 k-mer 分类 | 内建元数据 | 物种组成直接查询 |
| MetaSRA | 元数据再工程 | 人类样本 | ENCODE 风格标准化 schema |
生态启示:NCBI 存「事实」、第三方建「视图」——「档案与索引分离」是 PB 级数据系统的正确架构;研究者组合官方口径 + 第三方索引,声明各自版本。
§6.9 档案治理的开放经济学
- 供给端的社会契约:SRA 的体量来自「期刊/资助方强制 deposit」的制度设计——数据共享从道德呼吁变成发表流程的技术环节;这是全球科研治理最成功的公共品之一。
- 成本端的真实压力:Working Group 报告披露的焦虑(exponential growth vs NIH 预算)催生了冷热分层/SRA Lite/AWS ODP 免费出口三项对策——「数据可持续性」是档案类基础设施的长期议题。
- 需求端的分工演化:官方管保存与基础派生(STAT/counts),第三方管高级索引(组装/图索引)——「不重复造轮子」的生态分工使 47 PB 的可分析性持续提升。
- 对数据集工程的启示:把「强制 deposit + 派生层 + 生态分工」三件套映射到医疗 AI 数据集工程——「采集即归档 + 官方轻派生 + 社区建视图」是可复制模式。
§7 AI 就绪指南与应用场景
§7.1 SRA 在医疗 AI 中的四种喂法
- 自监督预训练喂法:petabase 序列 → DNA/RNA 语言模型(分布式云原位流式)。
- 方法学 benchmark 喂法:锁定 accession 集 → 比对/定量/组装工具评测。
- 发现喂法:k-mer/组装双路 → 新病毒/新抗性基因/新标志物(Serratus/PV 模式)。
- 聚合喂法:元数据再工程 → 跨研究 meta 分析/多任务训练(批次校正核心)。
四种喂法与 §6.5 坑点对应:喂法 1 踩坑 4(下载风暴);喂法 2 踩坑 3(同 study 泄漏);喂法 3 踩坑 8(分类当诊断);喂法 4 踩坑 1(元数据直用)——建模前回读对号。
§7.2 宏基因组发现管线实操配方
#!/usr/bin/env bash
# 宏基因组新物种挖掘:STAT 预筛 → QC → 组装 → ORF → 搜索(示意)
set -euo pipefail
# 1) 预筛:BigQuery 选目标 Runs(无 BQS 依赖的宏基因组用 Lite 即可)
# SELECT acc FROM `nih-sra-datastore.sra.metadata`
# WHERE tax_analysis IS NOT NULL AND organism LIKE '%environmental%'
# 2) 批量取数(AWS ODP 分流)
while read -r acc; do prefetch "$acc"; done < srr_list.txt
# 3) QC + 去宿主
fastp -i R1.fq.gz -I R2.fq.gz -o clean_R1.fq.gz -O clean_R2.fq.gz
bbmap.sh filterhost in=clean_R1.fq.gz ref=hg38.fa out=nonhost_R1.fq.gz
# 4) 组装 + ORF + 搜索
megahit -1 nonhost_R1.fq.gz -2 nonhost_R2.fq.gz -o asm/
prodigal -i asm/final.contigs.fa -a orfs.faa
hmmsearch --tblout hits.tbl RdRp.hmm orfs.faa # 病毒 RdRp 标志
# 5) 候选 → blast 确认新性 → 系统发育
§7.3 模型选型与迁移决策
- 序列语言模型:DNABERT 类 transformer——云原位流式(DataLoader 直接读桶);分布式必须。
- 分类器(宏基因组):kraken2/Centrifuge 类 k-mer 精确匹配——SRA 大规模取数前的预筛主力。
- 表达模型:变分自编码器/深度网络——跨研究聚合需批次协变量(study one-hot + ComBat)。
- 组装质量评估:QUAST + BUSCO——自动化组装管线的验收层。
- 不确定性:稀有物种分类的置信区间——STAT 的分类置信度字段 + 自建 bootstrap。
§7.4 公平性:档案偏差的工程兑现
- 物种/领域不平衡:人类与模式生物过代表,非模式物种稀疏——「全球物种公平」不是 SRA 的设计目标;挖矿按生态盲区(PV 案例)而非数据量分配。
- 地域偏差:发达国家/期刊强势区的提交占主导——全球健康监测的外推要声明盲区。
- 期刊偏好层:强制 deposit 政策覆盖度学科差异大——临床测序的公共存量远小于科研测序。
- 格式世代:老数据(无 BQS Lite/旧平台)与新数据的格式断层——预训练语料的「数据清洗世代」声明。
§7.5 任务×资源速查表
| AI 任务 | SRA 数据 | 输出形态 | 验收 |
|---|---|---|---|
| DNA 语言模型预训练 | 云原位流式 reads | 预训练权重 | 下游 fine-tune 增益 |
| 宏基因组分类器 | STAT + reads | 分类模型 | L5 污染线 |
| 转录组表征 | RNA-seq counts/自跑 | 嵌入/聚类 | 批次校正后混合 |
| 新病原发现 | 组装 + HMM | 候选序列 | blast 新性 + 系统发育 |
| 工具 benchmark | 锁定集 | 方法排名 | SRP 切分无泄漏 |
| 元数据 NLP | 提交者文本 | 结构化标签 | 人工核验子集 PPV |
§7.6 端到端案例:全球肠道抗性基因监测
- 预筛:BigQuery 选人类肠道宏基因组 Runs(STAT 含 Bacteroidetes 等标志)——2 万+ Runs。
- 取数:AWS ODP 分流 + 限速批取——数周窗口。
- 挖掘:组装 → ORF → CARD/ResFinder HMM——抗性基因清单 + 丰度矩阵。
- 时空分析:元数据地理/年份字段(再工程后)→ 抗性基因流行度地图。
- 验证:与 CARD 参考对照 + blast 新性 → 新变体登记。
- 报告:accession 溯源 + 地域盲区声明 + 批次效应敏感性——三件套齐。
§7.7 报告模板:方法学段落骨架
原始测序数据自 NCBI Sequence Read Archive 取得(accession 清单见附录;检索日期 2026-09;下载格式 SRA Lite,无 base quality scores,SRA Toolkit v3.x fasterq-dump --split-3 转换)。样本元数据经再工程处理(同义词映射至 [本体];字段缺失率 [x]%)。质量控制采用 fastp(接头/质量修剪)与 BBTools 去宿主过滤;宏基因组分类核查使用 NCBI STAT 字段与 kraken2 双查。基准评测按 BioProject 层级切分训练/测试集以避免同研究数据泄漏。跨研究分析采用 study 批次协变量校正(ComBat);受控人类数据(dbGaP,项目号 [xxx])使用经数据访问委员会批准。本研究的 accession 清单、再工程映射表与 QC 报告全部开源。
§7.8 成本与排期模板
| 阶段 | 内容 | 成本构成 | 周期 |
|---|---|---|---|
| 检索设计 | 元数据 SQL + 清单锁定 | 数美元查询费 | 3-5 天 |
| 试跑 | 10-50 Runs 全管线 | 本地 $0 | 1 周 |
| 批量取数 | 百-千级 Runs | 云带宽/存储 | 1-4 周 |
| 主分析 | 挖掘/训练 | 计算(本地或云) | 2-6 周 |
| 验证 | L1-L6 协议 | 人力 | 1-2 周 |
| 复现包 | 清单+映射表+管线 | 人力 | 2 天 |
SRA 项目的排期风险在取数环节(带宽/限流/存储周转)——「试跑先行 + 分批取数」是排期第一项。
§7.9 消融案例:元数据再工程的必要性
跨研究聚合时元数据处理策略的典型消融(转录组 meta 分析场景):
| 配置 | 元数据策略 | 跨研究结果(示意) | 诊断 |
|---|---|---|---|
| R1 | 原始自由文本直用关键词 | 组间差异混杂,假阳性 +30% | 同义词分裂 |
| R2 | 大小写/简单清洗 | 略改善;拼写错误仍存 | 清洗不够 |
| R3 | 本体映射(HPO/UBERON)+ 人工核验子集 | 假阳性回落;批次主导 | 语义对齐生效 |
| R4 | R3 + 缺失模式建模(披露意愿协变量) | 最稳;残留差异可解释 | 完整流程 |
- 方法:同一表型多研究合并;评估统一(同一统计框架);R3 的映射表人工抽检 200 条。
- 读数:R1→R3 的假阳性降幅主要来自「同义词合并」——元数据的最大噪声源是词形不是数值;R4 处理「敏感字段拒答」的非随机缺失。
- 结论:「元数据再工程」不是可选美化——跨研究聚合的统计有效性依赖语义对齐;投入产出比最高的预处理环节。
§8 伦理、许可与合规
§8.1 政策与义务结构
- 公共数据:免费开放下载/使用——NCBI Policy + NIH GDS Policy 框架;提交者保留原始权利,商用衍生逐案评估。
- 受控数据(dbGaP):人类受控数据约三分之一——机构签署 DUA + 研究者 DAC 批准 + 年度合规报告;再识别禁令全球红线。
- deposit 义务:期刊/资助方普遍要求——提交者承担元数据正确性责任;研究者引用时承担口径声明责任。
- 掩码与污染:STAT 掩码 opt-in 防误公开——研究者发现历史数据疑似人类序列时按 NCBI 报告流程处理。
§8.2 引用与致谢模板
致谢模板(按需裁剪):
Raw sequencing data were obtained from the NCBI Sequence Read Archive
(accessions: SRPxxxxxx, SRRxxxxxx; retrieved 2026-09). The SRA is
maintained by the National Center for Biotechnology Information,
National Library of Medicine, NIH, and mirrored across INSDC partner
databases (ENA/DDBJ). SRA citation: Leinonen et al., Nucleic Acids
Research 39, D19-D25 (2011). Controlled-access human data were used
under dbGaP project phsxxxxxx (approved by the relevant DAC).
§8.3 国内合规路径
- 下载使用:SRA 公共数据的下载与本地分析属于使用公开资源——国内合规重点是「人类遗传资源」语义:国外来源的人类测序数据在境内使用需符合人类遗传资源管理规范(对外提供/出境另受约束)。
- 提交与回流:国内产生的数据向 SRA deposit 涉及数据出境申报——人类数据走审批、非人类数据按科研合作规范。
- 红线:把 SRA 人类公共数据与国内人群库做未批准的个体级合并;对公共数据尝试再识别——两侧都违规。
§8.4 商业使用边界
- 默认姿态:公共数据「可用」不等于「无限商用」——提交者协议与数据来源(含临床数据)决定边界;商用前逐 study 核查数据政策字段。
- API 与抓取:NCBI API 有使用政策(限速/标识)——商业级批量抓取需读官方条款;AWS ODP 是合规批量通道。
- 成本模型:数据免费但云不免费——商业实体的存储/计算全额自担;egress 费陷阱(§6.5 坑点 5)在商业规模下放大。
§8.5 合规台账最小模板
| 台账项 | 记录内容 | 示例 |
|---|---|---|
| 数据来源 | accession 清单 + 检索日期 | SRP/SRR 双层 |
| 下载格式 | Lite/Normalized/Original | BQS 有无声明 |
| 受控授权 | dbGaP 项目号 + DAC 批准 | 年度合规报告 |
| 元数据再工程 | 映射表 + 抽检记录 | 本体版本 |
| QC 记录 | MultiQC 报告 + 剔除清单 | 阈值透明 |
| 工具版本 | Toolkit/k‑mer 工具版本 | 复现包 |
| 出口合规 | 数据流图 + egress 路径 | 云成本对账 |
§8.6 提交者侧的合规义务
把视角反转——作为数据提交者(而非使用者)的义务清单:
- 元数据真实性:BioSample 属性的准确性是下游一切分析的地基——拼写错误/字段混写在提交时就该避免(MetaSRA 的痛源自提交侧)。
- 人类数据分类:公共 vs 受控(dbGaP)的判断在提交时做出——GDS Policy 与机构 IRB 是判定依据;「先公共后撤回」不是可靠策略。
- 掩码 opt-in 决策:宏基因组/环境数据建议启用 STAT 人类 reads 掩码——incidental 序列的误公开风险在提交时阻断。
- 撤回与更正流程:错误数据走官方更正流程(不改写历史)——引用者因此能追溯版本;撤回的语义(数据删除 vs 状态标记)按官方定义执行。
§9 谱系与生态
§9.1 测序档案时间线
1982 GenBank 上线(INSDC 起点——组装序列时代)
2005-2008 高通量测序爆发(454/SOLiD/Illumina)——reads 需要新家
~2009 SRA 上线(NCBI;三节点分工确立)
2011 Leinonen NAR 论文(标准引用确立)
2019 STRIDES:AWS+GCP 全量云镜像
2020 COVID-19 监测(70 万+ 样本);年下载 >48 PB
2023-2024 SRA Lite 默认化;STAT 掩码 opt-in
2024-2025 Logan 27M 库组装;MetaGraph Nature 论文
2026 第三方索引生态成熟;新平台持续接入
§9.2 术语表
| 术语 | 定义 |
|---|---|
| SRA | Sequence Read Archive——原始测序档案 |
| INSDC | 国际核酸序列数据库合作(NCBI/EBI/DDBJ 三节点) |
| BioProject(SRP) | 研究项目层对象 |
| BioSample(SRS) | 生物来源层对象 |
| Experiment(SRX) | 实验设计层对象 |
| Run(SRR) | 运行层对象——实际取数单元 |
| SRA Lite | 去除 base quality scores 的轻量格式 |
| Normalized | NCBI ETL 标准化格式(含 BQS) |
| BQS | Base Quality Scores——碱基质量分数 |
| STAT | Sequence Taxonomic Analysis Tool——官方 k-mer 分类 |
| STRIDES | NIH 云基础设施计划(SRA 上云的工程载体) |
| AWS ODP | AWS Open Data Program——免费出口通道 |
| dbGaP | 基因型-表型受控档案(SRA 受控数据的授权语境) |
| GDS | NIH Genomic Data Sharing Policy |
| prefetch / fasterq-dump | SRA Toolkit 取数/转 FASTQ 二件套 |
| MetaSRA | 人类样本元数据再工程库 |
§9.3 资源选型决策树
你的需求是什么?
├─ 「原始 reads 重跑管线」
│ → SRA(Toolkit 本地取数)
├─ 「处理后表达矩阵快速起点」
│ → GEO(processed)或 SRA RNA-seq counts(官方派生)
├─ 「变异数据语义」
│ → dbSNP/ClinVar(变异层)——SRA 是证据层不是语义层
├─ 「组装基因组/参考」
│ → GenBank/RefSeq(组装层)
├─ 「人类受控队列(表型链接)」
│ → dbGaP(授权路径)或 All of Us(云内受控)
├─ 「宏基因组全球扫描」
│ → SRA + Logan/MetaGraph 索引(挖矿提速)
├─ 「欧洲本地取数」
│ → ENA 门户(同库;REST API 更顺手)
└─ 「单细胞图谱」
→ HCA/CellxGene(图谱层)——原始数据多数在 SRA
§9.4 与本库其他条目的关系
| 条目 | 关系 |
|---|---|
| geo | 处理后数据档案——「GEO 找图、SRA 取数」双库节奏 |
| gnomad | 变异频率目录——其原始数据源自 SRA/受控档案 |
| clinvar | 临床变异语义——SRA 提供证据层 |
| tcga | 癌症多组学——其原始数据部分回流档案 |
| gtex / all-of-us | 大型队列——原始 reads 的规模化生产者 |
| 大型队列——原始 reads 的规模化生产者 | |
| ensembl / gencode | 注释语义层——重分析比对的参考注释 / gencode |
| dbgap | 受控人类数据授权路径——SRA 受控层的入口 |
§9.5 组合使用建议
| 研究设计 | 推荐组合 | 分工 |
|---|---|---|
| 转录组重分析 | SRA(raw)+ GEO(processed 对照)+ gencode(注释) | 事实 + 对照 + 语义 |
| 宏基因组挖矿 | SRA(库)+ Logan(contigs)+ CARD/HMDB(语义) | 事实 + 索引 + 注释 |
| 变异发现 | SRA(证据)+ gnomAD(频率)+ ClinVar(临床) | 证据 + 背景 + 语义 |
| 方法 benchmark | SRA(真实数据)+ 人工模拟集 | 真实性 + 可控性 |
| AI 预训练 | SRA(语料)+ MetaGraph(索引加速) | 事实 + 效率 |
组合纪律:accession 统一——多库组合以 SRA accession 为血缘主键;版本快照与检索日期统一记录。
§9.6 全球科研基础设施的生态角色
SRA 证明了「全球自愿 deposit + 公共档案 + 云镜像」可以在 petabyte 尺度运转:期刊与资助方的强制要求提供了供给端,INSDC 三节点提供了地理冗余,STRIDES 双云镜像提供了可及性,STAT/counts 派生层提供了「档案 → 分析」的自动扶梯。它把「数据共享」从道德呼吁重写为发表流程的技术环节——全球测序数据的可持续循环因此有了基础设施。对医疗 AI,SRA 是序列模态的「原始层宪法」:任何声称覆盖基因组数据的工作都应能回溯到 SRA accession 级的证据链。
§9.7 开放-受控光谱上的定位
公共测序资源分布在「全开放(SRA 公共层)— 受控(SRA dbGaP 层 / EGA)— 云内受控(All of Us)」光谱上——SRA 是开放端的规模极值:
| 维度 | SRA 公共层 | SRA dbGaP 层 | All of Us |
|---|---|---|---|
| 数据形态 | 原始 reads(全物种) | 人类受控 reads | 全体级多模态 |
| 访问 | 直接下载 | DAC 批准 | 注册+培训+云内 |
| 表型链接 | 弱(元数据) | 结构化(dbGaP) | 强(OMOP 同人) |
| 分析地 | 本地/云 | 本地/云(授权内) | 仅云内 |
| 典型用途 | 重分析/挖矿 | 人类疾病研究 | 精准医学队列 |
- 工程含义:SRA 公共层的「免注册直取」使其成为数据工程的默认起点——受控需求出现时再升级路径。
- 风险对冲:公共层元数据弱——表型驱动的研究在公共层受限;dbGaP/All of Us 补强。
§9.8 全球测序数据循环的未来图景
把 SRA 放进「测序数据全生命周期」的完整拼图:
| 环节 | 基础设施 | 与 SRA 的关系 |
|---|---|---|
| 产生 | 全球测序实验室/临床实验室 | 供给端(deposit 强制) |
| 归档 | SRA/ENA/DRA(INSDC) | 档案本体 |
| 语义 | GenBank/RefSeq/dbSNP/ClinVar | 下游语义层(组装/变异) |
| 索引 | Logan/MetaGraph/Pebblescout | 第三方视图层(挖矿加速) |
| 应用 | gnomAD/GEO/HCA | 频率/表达/图谱产品层 |
| 回流 | 重分析产物 → GEO/GenBank | 循环闭合 |
循环结论:SRA 是循环的「心脏泵」——「事实存档 + 语义分流 + 视图加速 + 产品孵化 + 产物回流」的完整闭环使全球测序数据成为「活的资源」而非「死的备份」;医疗 AI 团队在此闭环中的正确姿势是「用证据层(SRA)验证、用语义层(ClinVar/RefSeq)解读、用产品层(gnomAD/GEO)提速」。
§10 资源导航与 FAQ
§10.1 官方资源导航
- 主站 https://www.ncbi.nlm.nih.gov/sra/;云文档 https://www.ncbi.nlm.nih.gov/sra/docs/sra-cloud/
- SRA Toolkit https://github.com/ncbi/sra-tools;RNA-seq counts https://registry.opendata.aws/ncbi-sra-rnaseq/
- 数据处理状态 https://www.ncbi.nlm.nih.gov/sra/docs/sequence-data-processing/
- 提交文档(含人类数据掩码)https://www.ncbi.nlm.nih.gov/sra/docs/submit/
上手指引(第一次接入的推荐顺序):
- 网页检索目标研究 → Run Selector 导出 accession 清单(第一天)。
- 本地安装 Toolkit → 10 个 Run 试跑全管线(prefetch → fasterq-dump → QC)。
- 元数据 BigQuery 试查 → 锁定清单与格式声明(Lite vs Original)。
- 批量取数(AWS ODP 分流 + 限速)→ 存储周转规划。
- 复现包固化(清单+映射表+管线+QC 报告)。
§10.2 关键文献
- Leinonen, R., Sugawara, H. & Shumway, M. The Sequence Read Archive. Nucleic Acids Research 39, D19-D25 (2011). DOI 10.1093/nar/gkq1019
- Database resources of the National Center for Biotechnology Information in 2025. Nucleic Acids Research 53, D1 (2025).
- NIH Council of Councils. SRA Data Working Group Final Report. NIH(2021-09).
- Schmidt, E. et al. Efficient and accurate search in petabase-scale sequence repositories. Nature(2025). DOI 10.1038/s41586-025-09603-w
- Medical X / eLife reviewed preprint(2025). Petabase-scale Papillomavirus discovery(Logan-SRA 重扫;+34% 多样性).
§10.3 站内延伸阅读
- GEO — 基因表达综合库:处理后数据档案(「GEO 找图、SRA 取数」)
- gnomAD — 基因组频率数据库:SRA 原始数据孵化出的频率目录
- ClinVar — 临床变异知识库:变异语义层
- TCGA — 癌症基因组图谱:规模化原始数据的生产者
- All of Us — NIH 研究计划:云内受控的光谱另一端
- GTEx — 组织表达数据库:组织表达的重分析原料
§10.4 FAQ
Q1:SRA 数据免费吗?
A:公共数据完全免费——数据免费、AWS ODP 免 egress;成本在计算与自建存储。
Q2:能下载整个 SRA 吗?
A:不要——47 PB 级;按 accession 清单按需取数;全库级需求用 Logan/MetaGraph 索引。
Q3:SRA 和 ENA/DDBJ 什么关系?
A:INSDC 三节点——同一提交三处镜像;从任一入口取同一数据;引用统一 accession。
Q4:SRA Lite 的质量分数没了怎么办?
A:需要 BQS 的分析(QC/Q 分布)用 Original 或 Normalized 格式;方法论文声明所用格式。
Q5:怎么批量下载 1000 个 Run?
A:accession 清单 → prefetch 逐条(限速)或 AWS ODP 直取;先试跑再放量;留意存储周转。
Q6:元数据能信吗?
A:部分信——提交者自由文本(同义词/拼写错误普遍);跨研究聚合前做再工程(MetaSRA 类映射)。
Q7:怎么找「所有人类 RNA-seq」?
A:BigQuery/Athena 元数据表(library_strategy=RNA-Seq + organism 过滤)——SQL 秒级出清单,不用下数据。
Q8:受控数据怎么拿?
A:dbGaP 路径——机构 DUA + DAC 批准;人类受控数据约占档案三分之一。
Q9:RNA-seq counts 派生数据是什么?
A:NCBI 官方把公共人类/小鼠 bulk RNA-seq 跑出的基因计数 TSV(日更)——快速起点;严谨分析仍建议自建管线。
Q10:prefetch 和直接下 FASTQ 区别?
A:prefetch 拿 .sra(断点续传)再本地转 FASTQ;部分数据可直接从云桶拿 FASTQ(AWS ODP);大批量用前者更稳。
Q11:–split-3 是什么?
A:fasterq-dump 的双端分离参数——R1/R2 出 _1/_2 文件;单端数据仍出单文件;不分离会拿到交织格式。
Q12:能看到数据有没有污染吗?
A:STAT 分类字段(元数据内建)预查物种组成;下载后 kraken2 精查——双查是底线。
Q13:提交的数据多久公开?
A:提交后处理(状态页有生命周期定义)——受控数据按提交者设定释放;引用前核对状态。
Q14:能引用 SRA 里的单条 Run 吗?
A:能——SRR accession 独立可引用;方法部分常给 SRR 清单,数据可用性给 SRP。
Q15:和 GEO 怎么分工?
A:GEO 存 processed(矩阵/系列组织);SRA 存 raw(reads)——重分析走 SRA,快速可视化走 GEO。
Q16:微信/国内访问慢怎么办?
A:ENA 门户(欧洲节点 API)或 AWS ODP(不限速)——同一数据多入口;NCBI 直连高峰期不稳。
Q17:宏基因组挖矿从哪开始?
A:STAT 预筛(SQL 选 Runs)→ 组装/或直接用 Logan contigs → HMM/blast——「先索引后取数」省 90% 下载。
Q18:AI 预训练用 SRA 合规吗?
A:公共数据的分析使用在政策内——遵守 NCBI 使用条款与限速;人类受控数据除外;商用基础模型逐案评估。
Q19:怎么知道数据是单端还是双端?
A:元数据 library_layout 字段(paired/single);下载后文件对检查——混拼是常见坑。
Q20:老数据还能用新参考基因组吗?
A:能——原始 reads 可跨参考重比对(GRCh37→38→T2T);这是 SRA 原始层存档的核心价值。
Q21:下载 10TB 数据成本多少?
A:AWS ODP 免 egress(NCBI 桶内);存储自付;自建桶跨区出口才收费——数据流图决定成本。
Q22:STAT 是什么?
A:NCBI 官方 k-mer 分类工具——每个 Run 的物种组成已内建于元数据;BigQuery 直接查,宏基因组预筛神器。
Q23:样本交换/标签错误怎么防?
A:没有全局防线——性别标记检查/亲缘一致性/表达谱聚类是常用手段;跨研究引用时保持怀疑。
Q24:能把自己的数据也提交 SRA 吗?
A:能——BioProject + BioSample 注册后提交;人类数据按 GDS/受控规则;提交是期刊流程一部分。
Q25:数据会下线吗?
A:INSDC 档案承诺长期保存——但个别记录可能因合规/撤回状态变更;重要分析自留本地副本。
Q26:重分析结果和原论文对不上怎么办?
A:先查三件套——参考基因组版本/比对软件/元数据理解;±2 倍内的量级差异常见;方向不一致需怀疑元数据或批次。
Q27:SRA Lite 会成为唯一格式吗?
A:官方趋势是 Lite 默认——但 Original 数据保留在云上可取;「默认轻量、按需全量」是长期格局。
Q28:怎么测「我的分析数据是否已有人发过」?
A:Pebblescout/MetaGraph k-mer 搜索——秒级查询公开库;序列撞车检测的官方姿势。
Q29:如何引用 SRA 本身?
A:Leinonen et al. NAR 2011(DOI 10.1093/nar/gkq1019)+ 具体 accession;数据可用性声明写清单与日期。
Q30:和 EGA/dbGaP 的关系?
A:dbGaP 是美国受控档案(SRA 受控层的授权语境);EGA 是欧洲受控档案——人类敏感数据的受控双通道。
Q31:单细胞数据在 SRA 里怎么找?
A:library_strategy=RNA-Seq + 单细胞关键词/平台字段——但图谱级整理用 HCA/eq + 单细胞关键词/平台字段——但图谱级整理用 HCA/CellxGene 更高效(原始数据仍落 SRA)。
**Q32:SRA 的 更高效(原始数据仍落 SRA)。
Q32:SRA 的未来方向?
A:官方路线(文档化口径)——格式轻量化(Lite)、派生层扩展(counts/STAT)、新平台接入(Element/Ultima)、云体验优化;第三方索引生态(Logan/MetaGraph)分担挖矿负载。
Q33:受控数据占到三分之一,公共层够用吗?
A:按需——重分析/宏基因组/方法开发公共层绰绰有余;表型驱动的人类疾病研究才需要 dbGaP 受控层。
Q34:批量下载被限流了怎么办?
A:三路分流——AWS ODP(免账号直取桶)、ENA API(欧洲入口)、降低并发 + 重试间隔;官方 API 政策要求标识与限速。
Q35:怎么判断一个 study 的数据质量底线?
A:先看 STAT 分类是否符合预期物种、再抽 3-5 个 Run 跑 FastQC、再看提交者机构的元数据完整性——三步 30 分钟定性。
Q36:临床测序数据在 SRA 里多吗?
A:少于科研测序——deposit 政策的学科覆盖差异 + 临床隐私约束;临床队列优先看 dbGaP/EGA/All of Us/TCGA 类结构化资源。
§10.5 要点回顾
- 档案非数据集:accession 级按需取数——47 PB 永不全量落地。
- 三节点一库:INSDC 镜像——引用统一 accession。
- 格式三态:Original/Normalized/Lite——BQS 有无决定 QC 语义,方法论文必须声明。
- 元数据再工程先行:自由文本是最大噪声源——R1→R3 消融的教训。
- SQL 先于下载:BigQuery/Athena/STAT 预筛——「先查后取」省一个数量级预算。
- SRP 切分防泄漏:Run 级随机切是 benchmark 泄漏。
- egress 路径决定成本:官方桶免费、自建桶出口收费——数据流图先行。
- 受控边界核查:dbGaP 三分之一——公共/受控混引逐条授权。
- 分层口径纪律:STAT 分类是环境信号不是临床诊断——G/S/M 三层按层问责。
- accession 是血缘主键:清单 + 检索日期 + 格式声明——复现包三件套。
口径存照(数字均注明口径与来源,写入正文前已核对)
-
31,000,000 公共 SRA 文件 / >47 PB(单副本)/ SRA Lite 默认化 / STAT 掩码 opt-in / Element+Ultima 支持 / GCP NEARLINE us-east-1 = Database resources of the NCBI in 2025(NAR 53:D1,2025)与 NCBI SRA 云文档
- 11.5 PB 公共 + 4.9 PB dbGaP(2022 时点)/ 70 万+ SARS-CoV-2 样本 = Database resources of the NCBI in 2022(NAR 2022)
- 16.5 PB normalized / 14.5M records / 受控 31% / 2020 下载 >48 PB / 2025 预测 32.5+57.5 PB = NIH Council of Councils SRA Data Working Group 报告(2021)
- INSDC 三节点 534,254 studies / 66,912.1 petabase-pairs(2025-01-11)/ 全库索引估 ~172-223 TB = MetaGraph,Nature(2025),DOI 10.1038/s41586-025-09603-w
-
38 million 公共测序文库 / Logan 27M 库组装 / Serratus 5.7M 集 10.2 Pbp → 13 万+ 新 RNA 病毒 / PV +34%(383 新型跨 105 宿主)= eLife reviewed preprint(2025)及其引文
- SRA 层级(SRP/SRS/SRX/SRR)/ INSDC 三节点互镜像 / FASTQ-BAM-CRAM 边界(不收组装与变异)= Leinonen NAR 2011 与 CASRAI 术语条目(2026-09 更新)
- RNA-seq gene feature counts(人类/小鼠 bulk;日更 TSV)= AWS Open Data 注册表(ncbi-sra-rnaseq)与 NCBI 官方文档
- 对象模型细节(prefetch 断点续传/–split-3 语义/Run Selector)= SRA Toolkit GitHub wiki 与 NCBI 官方手册(2026-09 检索)
- 第三方工具语义(Pebblescout 3.7 Pbp / STAT 27.9 Pbp @2021 / MetaSRA schema)= 各工具论文与 NCBI Insights(2023-2024 增强公告)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- impc — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- alphamissense — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- ckb — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- uk-biobank — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- all-of-us — 共享标签:基因组学与多组学 / 公共卫生与流行病学
- gnomad — 共享标签:基因组学与多组学 / 测序数据
- uniprot — 共享标签:基因组学与多组学 / 测序数据
- 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
- encode — 共享标签:基因组学与多组学 / 测序数据
- geo — 共享标签:基因组学与多组学 / 测序数据
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

