NCBI SRA 测序档案 — AI-Ready Wikipedia

3,100 万+ 公共文件 · 47 PB+ 原始测序数据:世界最大公共测序档案的云原生取数与重分析指南

来源 https://www.ncbi.nlm.nih.gov/sra/发布时间: 2026-09-19最后更新: 2026-09-25 阅读 29
NCBI SRA 测序档案 — AI-Ready Wikipedia

信息速览

数据集名称NCBI SRA 测序档案 — AI-Ready Wikipedia
数据类型3,100 万+ 公共文件,47 PB+ 原始 reads,INSDC 三节点,云原生 AWS+GCP,RNA-seq counts 日更
规模公共数据开放(去标识化;受控人类数据约三分之一需 dbGaP 批准)
接入方式https://www.ncbi.nlm.nih.gov/sra/
AI 就绪度

SRA(Sequence Read Archive)— AI-Ready Wikipedia

INFOBOX

属性 内容
全称 Sequence Read Archive(SRA;前身 Short Read Archive)
运营 NCBI(NLM/NIH)——INSDC 美国节点;与 EBI ENA、DDBJ DRA 三节点互为镜像
启动 ~2009(应对下一代测序数据爆炸)
规模 >3,100 万公共文件 / >47 PB(单副本,2025 官方口径);INSDC 三节点合计 534,254 studies / 66,912 petabases(2025-01)
内容 原始/最小处理测序 reads(FASTQ/BAM/CRAM)+ 比对信息;WGS/WES/RNA-seq/宏基因组/单细胞全谱
对象模型 BioProject(SRP)→ BioSample(SRS)→ Experiment(SRX)→ Run(SRR)四级
云访问 AWS + GCP 全量镜像(NIH STRIDES,2019 起);AWS Open Data 免 egress;GCP us-east-1 免检索费
格式 Normalized(含 BQS)/ SRA Lite(去质量分数,2023 起默认化)
派生数据 STAT 分类含量(元数据内建)+ RNA-seq gene feature counts(日更 TSV)
受控边界 dbGaP 链接受控数据约占档案三分之一
下载量 2020 年 >48 PB(官方工作组报告)
政策 NCBI Policy + NIH Genomic Data Sharing(GDS);期刊/资助方强制 deposit 的全球事实标准
本库关联 GEO(芯片/功能组学)、ENA(欧洲节点)、dbSNP/ GEO(芯片/功能组学)、ENA(欧洲节点)、dbSNP/ClinVar(变异语义)、TCGA/GTEx/All of Us(受控队(变异语义)、TCGA/GTEx/dbSNP/ClinVar(变异语义)、TCGA/GTEx/All of Us(受控队列原始数据源)

§0 E-E-A-T 信(受控队列原始数据源) |

§0 E-E-A-T 信任声明与免责声明

本页所有规模数字、格式政策与访问口径均核实自一手来源:NCBI 官方 NAR 数据库综述(Database resources of the NCBI in 2025, NAR 53:D1——31M 文件/47 PB 口径;2022 版——11.5 PB + 4.9 PB dbGaP 历史口径)、NIH Council of Councils SRA Data Working Group 报告(2021——增长预测/冷热存储/受控比例)、SRA 标准引用论文(Leinonen et al., NAR 39:D19-D25, 2011)、MetaGraph 论文(Nature 2025——INSDC 三节点 534,254 studies / 66,912 Pbp)与 AWS Open Data 注册表(sra-rnaseq-analysis 派生数据条目)。检索核实时间为 2026-09-19。

SRA 的规模数字随时间持续滚动且存在三个不同口径(公共文件数 / 测序文库数 / 三节点合计碱基数),本页在各处显式标注口径与出处。「47 PB」是 NCBI 单副本官方口径——不是全库下载量,也不是三节点总和;引用时声明口径与检索日期。

本页为技术参考文档:SRA 是全球测序数据的档案库而非质控后的分析数据集——数据质量、样本标签正确性与污染状态由提交者与使用者共同负责;受控人类数据的使用受 NIH GDS Policy 与 dbGaP 数据访问委员会约束;任何临床结论需经独立验证。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:世界最大公共测序原始数据档案——全球高通量测序仪输出的「第一手 reads」之家(FASTQ/BAM/CRAM)。
  • 体量:>3,100 万公共文件 / >47 PB(NCBI 2025 口径);INSDC 三节点合计 66,912 petabases(2025-01)。
  • 访问:公共数据免费开放——网页检索 / SRA Toolkit / AWS Open Data(免 egress)/ GCP(us-east-1 免检索费);受控人类数据走 dbGaP。
  • 杀手锏:生命之树全物种 + 宏基因组 + 环境样本的原始数据不可替代性——期刊/资助方强制 deposit 政策的全球事实标准。
  • 适用:重分析(reanalysis)、方法开发、宏基因组挖矿、病原监测、跨研究 meta 分析、AI 预训练语料。
  • 不适用:质控后分析数据集(需自建管线)、变异语义查询(用 dbSNP/ClinVar)、组装基因组(用 GenBank/RefSeq)、全库 bulk 下载(47 PB 不现实——云原位检索)。

§1.1 摘要

每个高通量测序实验的产出都是数百万到数十亿条短读段(reads)——它们从测序仪流出后去哪里?NCBI 的 Sequence Read Archive(SRA)就是这个问题的全球答案:自 2009 年起,SRA 作为 INSDC(国际核酸序列数据库合作组织)的美国节点,收集原始或最小处理的测序 reads。到 2025 年,NCBI 官方口径为「超过 3,100 万公共文件、超过 47 PB(单副本)」;把 EBI 的 ENA 与 DDBJ 的 DRA 两个镜像节点算进来,INSDC 全库在 2025 年初已达 534,254 项研究、66,912 万亿碱基对(petabase-pairs)——这是一部「地球基因组数字普查」。

对 AI 团队,SRA 的价值在四个维度:

  1. 重分析的原料不可替代:期刊与资助方普遍强制 deposit——发表流程本身保证了数据供给;重分析(换比对软件/换参考基因组/换质控标准)是 SRA 的头号用途。
  2. 宏基因组与病原监测的全球底池:Serratus 单次扫描 570 万数据集发现 13 万+ 新 RNA 病毒;乳头瘤病毒多样性单次搜索提升 34%——「档案不是死数据,是未开采的矿」。
  3. 云原生取数范式的样板:全量镜像 AWS + GCP(NIH STRIDES 2019 起)、AWS Open Data 免 egress、元数据进 BigQuery/Athena——47 PB 级数据的可及性设计全球领先。
  4. 派生数据层的工程智慧:STAT 分类含量内建于元数据、RNA-seq gene feature counts 日更——NCBI 自己就在做「档案 → AI-ready 派生层」的示范。

数据的第一性事实:SRA 是档案不是数据集——元数据由提交者自由填写(同义词/拼写错误/外链引用遍布),质量分数在 SRA Lite 格式中被去除,受控人类数据约占三分之一——「先做元数据再工程与 QC,再谈跨研究聚合」是 SRA 项目的第一课。

§1.2 战略价值

  1. 科学记录的保存层:实验数据的可重复性依赖原始数据存档——SRA 使「发表后十年重跑一个 RNA-seq 实验」成为可能;这是所有下游衍生库(GEO 表达集、变异 callers、组装结果)的地基。
  2. 方法学的公共竞技场:比对软件/组装器/变异 caller 的 benchmark 都在 SRA 数据上做——「用 SRA 真实数据验证方法」是生信方法论文的标准动作。
  3. 监测与发现的前线:COVID-19 期间 NCBI 提供 70 万+ SARS-CoV-2 样本增强访问;STAT 分类工具使全球病原监测无需重算分类——公共卫生语义直接内建。
  4. AI 语料的新大陆:petabase 级序列语料是基因组基础模型(DNA 语言模型)的天然训练池——Logan/MetaGraph 等第三方索引使「扫全库」从不可能变成单机可承受。

§1.3 同类数据集横向对比

资源 定位 规模量级 与 SRA 的关系
SRA(NCBI) 原始测序档案(INSDC 美国节点) >31M 文件 / >47 PB —
ENA(EBI) 原始测序档案(INSDC 欧洲节点) 同库镜像 同一提交的欧洲入口;检索界面不同
DDBJ DRA 原始测序档案(INSDC 日本节点) 同库镜像 亚洲节点;日本本地统计
GEO 芯片与功能组学 processed 数据 数百万系列 处理后数据档案(与 SRA 原始层互补;本库 geo 条目)
EGA 人类受控基因组档案(欧洲) PB 级 欧洲版 dbGaP——受控人类数据的欧洲通道
dbGaP 基因型-表型受控档案(美国) 受控研究数千 SRA 受控数据的表型-授权语境
GenBank/RefSeq 组装序列与参考 亿级序列 下游语义层(SRA 不收组装序列)
亿级序列 下游语义层(SRA 不收组装序列)
Human Cell Atlas 单细胞图谱计划 千万+ 细胞 其原始数据多数落
openAHB/Logan 第三方组装索引 27M 库组装 SRA 的下游增强层(contigs)

§1.4 版本时间轴

2001-2008  测序读段爆炸前夜(454/Illumina 早期;Short Read Archive 筹备)
~2009      SRA 上线(NCBI;INSDC 三节点分工:SRA/ENA/DRA)
2011       Leinonen NAR 引用论文(SRA 内容与提交标准确立)
2019       STRIDES Initiative:全量迁移 AWS + GCP(「首个最大云端生医数据集」)
2020       年下载量 >48 PB;COVID-19 病原监测(70 万+ SARS-CoV-2 样本)
2021       Working Group 报告:16.5 PB normalized / 受控 31%;冷热分层架构
2022       NAR 口径:11.5 PB 公共 + 4.9 PB dbGaP
2023-2024  SRA Lite 默认化(去 BQS);STAT 人类 reads 掩码 opt-in 服务
2025       NAR 口径:>31M 文件 / >47 PB;新平台 Element/Ultima 支持;
           Logan 完成 27M 库组装;MetaGraph Nature 论文(INSDC 66,912 Pbp)
2026       持续滚动;第三方 petabase 索引生态成熟(Pebblescout/MetaGraph)

§1.5 应用场景矩阵

  1. 重分析(reanalysis):发表数据的换管线重跑——质控/比对/定量标准更新时的标准动作。
  2. 宏基因组挖矿:全球环境/肠道样本的序列搜索——新病毒/新抗性基因/新物种发现(Serratus/PV 案例)。
  3. 方法 benchmark:比对/组装/定量工具的真实数据评测——生信方法论文标配。
  4. 病原监测:STAT 分类 + 全球样本流——新发传染病的序列侦察网络。
  5. AI 预训练:petabase 级 DNA/RNA 序列语料——基因组语言模型的原料池。
  6. 跨研究 meta 分析:同表型多研究合并——样本量倍增的廉价路径(元数据再工程是前置)。
  7. 教学与培训:真实数据的小成本练手——生信课程的标准素材库。

§1.6 组件全景

SRA 的六个数据层:

  1. 原始数据层:提交者上传的 FASTQ/BAM/CRAM 或仪器特有格式——Original(原样保存)。
  2. 标准化层:NCBI ETL 后的 Normalized SRA 格式(含 base quality scores)——检索与下载的主格式。
  3. 轻量层:SRA Lite(去除 BQS)——2023 起默认化;文件更小、下载更快;质量信息缺失是代价。
  4. 元数据层:BioProject/BioSample/Experiment/Run 四级对象 + 提交者自由文本属性;进 BigQuery/Athena 可 SQL 化。
  5. 派生分析层:STAT 分类含量(每个 Run 的物种组成)+ RNA-seq gene feature counts(人类/小鼠计数 TSV,日更)。
  6. 访问与工具层:网页检索(Run Selector)/ SRA Toolkit(prefetch/fasterq-dump)/ Cloud Data Delivery / AWS ODP / GCP 桶。

§1.7 云原生档案的经济学

  1. 全量双云镜像:STRIDES 使 SRA 成为「第一个也是最大的云端生物医学数据集」——47 PB 级档案的云迁移是全球最大的公共数据基础设施工程之一。
  2. 免费出口的设计:AWS Open Data Program 支持免费下载与免费 egress(无 AWS 账号也可 --no-sign-request);GCP us-east-1 免检索费——「数据出去不要钱」是与商业云格局的显著差异。
  3. 冷热分层:低访问量数据进冷存储(NEARLINE 等)——检索时间换存储成本;官方文档明确各层语义。
  4. 成本陷阱:免费的是「NCBI 桶内读取与官方出口」——把数据转到自建桶再跨区/跨云搬运会产生 egress 费;大规模项目先画数据流再估成本。
  5. 本地集群的位置:SRA Toolkit 支持从云桶直取到本地——小规模研究(几十-几百 Runs)本地处理仍然主流;万级 Runs 以上考虑云原位。

§1.8 SRA 在研究流程中的定位

实验设计 → 测序生产 → 原始数据 deposit → 发表 → 重分析/聚合/发现
                │              │                │            │
                │              ├─ SRA:原始 reads 档案( deposit 强制层)
                │              ├─ SRA:重分析原料(换管线/换参考)
                │              ├─ SRA:跨研究聚合(meta 分析底池)
                │              └─ SRA:petabase 挖矿(病毒/抗性/新物种)
                └─ GenBank/RefSeq(组装序列)← dbSNP/ClinVar(变异语义)
流程阶段 SRA 角色 典型用法 验收标准
数据产出 档案入口 deposit(期刊/资助方要求) accession 可引用
方法开发 benchmark 素材 公开数据集评测 锁定 accession 清单
重分析 原料供给 原始 reads 重跑管线 结果与原研究对照
聚合发现 底池 宏基因组/跨研究合并 元数据再工程完成

定位纪律:SRA 覆盖「原始层」最厚——需要 processed 数据去 GEO,需要语义去 dbSNP/ClinVar/KEGG;SRA 的核心承诺是「仪器输出的第一手事实」。

§1.9 INSDC 三节点镜像的独特设计

  1. 一份提交、三处可及:任一节点提交自动共享三节点(NCBI/EBI/DDBJ)——「地理冗余」使全球研究者从最近入口取数;检索界面与统计口径各异但底层数据一致。
  2. 历史与治理:INSDC 自 1980s GenBank 时代延续至今——三节点合作是国际科研基础设施治理的活化石;数据政策(如人类数据边界)在三节点间有差异,提交前读各自政策。
  3. 对 AI 的含义:镜像意味着「数据主权冗余」——单节点故障/政策变化不致数据丢失;但也意味着「同一数据多个入口」——引用时统一 accession(三节点共享 ID 体系)即可,无需重复下载。

§2 医学与科学背景

§2.1 原始 reads 的科学语义:为什么重分析不可替代

  1. 处理后数据是「观点」,原始数据是「事实」:论文里的表达矩阵/变异列表都经过管线选择(比对软件/过滤阈值/参考版本)——换一条管线结论可能变;SRA 保存的原始 reads 让后来的研究者重新做选择。
  2. 方法学演进的复利:比对算法(Bowtie2→STAR→HISAT2)、定量方法(TPM/RSEM/Salmon)、质控标准(MultiQC)持续演进——十年前的数据用今天的管线重跑,往往产出更好的结果;这是 SRA「越老越值钱」的原因。
  3. 参考基因组的世代更替:GRCh37→GRCh38→T2T-CHM13——历史数据在新参考上的重新比对能释放新信息(着丝粒/短臂区域);原始 reads 是唯一能跨参考世代重用的资产。
  4. 长读长时代的混合装配:历史短读数据 + 新增长读数据做混合组装——SRA 的历史存量使「 retro 补齐」成为可能。

§2.2 元数据的非标准化问题(SRA 的头号痛点)

  1. 提交者自由文本:SRA 不强制标准化术语——样本属性(组织/疾病/年龄)由提交者任意填写;「forskin fibroblast」(拼写错误)、「cell line BJ」(外链引用)、「no」(否定键)类混乱是常态(MetaSRA 论文的经典例证)。
  2. 同义词与拼写变体:同一疾病有数十种写法——跨研究聚合的前提是「元数据再工程」(映射到本体/受控词表)。
  3. 结构边界模糊:研究级/样本级/实验级信息的混写——提交者常把实验协议写进样本描述;自动抽取需要区分「描述对象」。
  4. 工程应对:MetaSRA(人类样本标准化 schema)与 OncoMX 类再工程库是起点;NCBI 自身的 Picard/元数据改进持续进行——「不要直接解析原始 metadata 做大规模统计」是铁律。

§2.3 SRA Lite 与质量分数的取舍

  1. BQS 的存储代价:base quality scores 是 SRA 云存储的最大成本驱动(Working Group 报告)——每个碱基的质量值使文件体积数倍膨胀。
  2. SRA Lite 的设计:去除 BQS 的轻量格式——2023 起逐步成为默认;文件更小、下载更快、成本更低。
  3. 下游影响:依赖质量值的 QC(FastQ 的 Q 分布)、比对器质量加权、变异 caller 的 BQSR 环节——Lite 格式下结果可能改变;官方立场是「多数应用不受影响」,但方法论文必须声明所用格式。
  4. 补偿路径:Original(原样提交)数据在云上可取——需要 BQS 的分析用 original 或 Normalized 格式;重分析报告写明「SRA Lite(无 BQS)」或「Original(含 BQS)」。

§2.4 宏基因组与病原监测的语义

  1. 环境与肠道样本的主体性:SRA 中宏基因组/环境样本是最大类别之一——「地球基因组普查」的主战场;STAT 分类工具使每个 Run 的物种组成可直接查询。
  2. Serratus 的示范:云上扫 5.7M 数据集(10.2 Pbp)找 RNA 依赖的 RNA 聚合酶标志基因——13 万+ 新 RNA 病毒,RNA 病毒已知多样性提升约一个数量级;COVID-19 期间正是这套范式支撑了全球监测。
  3. 乳头瘤病毒的增量:Logan-SRA(27M 库组装压缩)单次 ~10 小时对齐搜索——独立重识别 65% 已知 PV 类型 + 新增 383 新型(多样性 +34%),且发现新类型分布与采样强度不成正比( undersampled 生物群系更有产出)。
  4. 公共卫生语义:STAT 人类 reads 掩码服务(opt-in)是「监测与隐私」的平衡设计——宏基因组研究中的 incidental 人类序列可被主动掩码防误公开。

§2.5 变异发现生态中的位置

  1. SRA → 变异 caller → dbSNP/ClinVar:变异语义库的原始证据层在 SRA——ClinVar 条目回溯其支撑 reads 是可复现性的终极检查。
  2. Frequency 参考的原料:gnomAD/topMed 的变异频率全部源自 SRA/受控档案的原始数据——「SRA 存量决定频率目录的深度」。
  3. 罕见变异的全球对照:新发突变位点在全球 SRA 存量中的检索(k-mer 类工具 Pebblescout)——「这个变异在公开数据里出现过吗」从几个月变成秒级。

§2.6 与 GEO 的分工结构

GEO(本库 geo 条目)存「处理后数据」(表达矩阵/甲基化 beta 值)+ 仪器原始数据(常转发至 SRA);SRA 只存原始层。标准工作流:GEO 检索研究 → 原始数据落 SRA 的 accession → SRA 取数重跑。「GEO 找图、SRA 取数」是转录组重分析的双库节奏。

§2.7 AI 视角的科学定位

对医疗 AI,SRA 是「序列模态的最大语料库 + 方法学 benchmark 场」:DNA/RNA 语言模型的预训练池(petabase 级)、监督信号弱但规模极大的自监督场、工具链评测的真实分布源。它的短板(元数据噪声、无统一 QC、BQS 缺失)都是「全球自愿 deposit」的固有代价——用它的方法论核心是「锁定 accession 清单 + 元数据再工程 + 自建 QC 管线」三件套。

§2.8 隐私与受控边界的技术语义

  1. 人类数据的双轨:公共 SRA 的人类数据应为去标识化/已获同意数据——但「序列数据理论上可再识别」使受控框架存在;dbGaP 链接的数据(约三分之一)需 DAC 批准。
  2. STAT 掩码的治理创新:提交者可 opt-in 让 NCBI 用 STAT 检测并掩码 FASTQ/BAM 中的意外人类 reads——宏基因组/环境研究中的 incidental 发现防线。
  3. 再识别的全球红线:对公共数据尝试再识别在多数机构与期刊政策中违规——与 All of Us 行为准则同构的伦理约束。
  4. 跨库合流的边界:SRA 公共数据与自有数据合并在技术上容易——但人类数据合并后的 re-consent/隐私评估是研究者责任;「技术可行 ≠ 合规可做」。

§2.9 数据质量与污染的技术语义

SRA 的质量语义与 curated 数据集完全不同——「档案原样保存」意味着质量责任在提交者与使用者之间流转:

  1. 污染的三个来源:样本交换(index hopping/标签跳跃)、物种混杂(宿主 reads 混入微生物样本)、核酸降解(FFPE/环境降解)——STAT 分类字段使宏观污染可预查,样本级污染需 kraken2/FastQ Screen 精查。
  2. 「提交即归档」的纪律:SRA 不做数据重写——即使后来发现标签错误,历史快照仍可被引用;corrections 走提交者更新流程——「版本语义」因此是 Run 级而非全库级。
  3. QC 的双层结构:官方层(STAT/格式校验/文件完整性)+ 使用者层(FastQC/MultiQC/比对率)——「官方 QC 通过」不等于「分析级可用」;二者缺一不可。
  4. 工程含义:以 SRA 为源的管线必须内建 QC 闸门(fail-fast)——把「档案质量未知」作为设计前提,而不是异常;这与 curated 库(gnomAD/TCGA 先 QC 后发布)的用法是两种范式。

§3 数据集规格

§3.1 规格总表

维度 规格(2025-2026 官方口径)
公共文件 >31,000,000
数据量 >47 PB(单副本)
测序文库 >38 million 公共文库(Logan/eLife 口径)
INSDC 三节点 534,254 studies / 66,912 petabases(2025-01 MetaGraph)
受控比例 约三分之一(dbGaP 链接)
年下载量 >48 PB(2020 官方口径)
对象模型 BioProject(SRP)/ BioSample(SRS)/ Experiment(SRX)/ Run(SRR)
格式 FASTQ/BAM/CRAM;Normalized / SRA Lite
平台 Illumina/IonTorrent/PacBio/ONT/Element/Ultima 等
云 AWS + GCP 全量镜像;AWS ODP 免 egress
派生 STAT 分类含量 + RNA-seq counts(日更)
政策 NCBI Policy + NIH GDS Policy

§3.2 规模演进的时间切片

时点 口径 出处
2021-03 16.5 PB normalized / 30 PB original / 14.5M records Working Group 报告
2022 11.5 PB 公共 + 4.9 PB dbGaP NAR 2022 数据库综述
2025(官方) >31M 文件 / >47 PB 单副本 NAR 2025 数据库综述
2025-01(INSDC) 534,254 studies / 66,912.1 Pbp MetaGraph Nature 论文
2025(第三方) >38M 公共文库;Logan 27M 库组装 eLife reviewed preprint

解读:官方「文件」口径与第三方「文库」口径相差约 20%——文件含比对/归档产物;引用时先问口径。增长趋势未减(官方 2021 预测 2025 达 32.5 PB ETL 与实际相符)。

§3.3 DAIMS 数据AI就绪度评估

维度 D 数据完整性 评分 说明
D1 人群/物种覆盖 10/10 生命之树全谱 + 宏基因组 + 环境——档案类满分
D2 数据深度 9/10 原始 reads 最深层;质控状态参差
D3 元数据质量 5/10 提交者自由文本——聚合前需再工程(最大短板)
D4 多组学 7/10 测序模态全谱;非测序模态(影像等)不覆盖
A1 机器可读 9/10 云桶 + BigQuery/Athena + Toolkit 全链 API
A2 文档完备 8/10 官方文档详细;但元数据语义文档弱
A3 接入成本 9/10 免费开放 + AWS ODP 免 egress;本地小规模零成本
A4 更新机制 8/10 持续滚动 + 派生层日更;无版本号(锁 accession 替代)
I1 指标标准化 6/10 BQS/Lite 格式分裂;元数据无标准
I2 可复现性 9/10 accession 级可复现的黄金标准
M1 多模态对齐 6/10 元数据对齐靠再工程;序列-样本链接内建
M2 时间序列 5/10 无内建时序语义(纵向研究靠自组织)
S1 数据安全 7/10 受控层完备(dbGaP);公共层污染/误公开风险靠掩码 opt-in
S2 合规负担 8/10 公共数据近零负担;受控数据走 DAC 流程

总分:B+ 级(可及性与覆盖满分档;扣分项是元数据质量与格式分裂——「最大档案」与「最乱元数据」是一枚硬币的两面)

§3.4 存储与计算需求

场景 体量 建议路径
单研究重分析(10-100 Runs) GB-数百 GB 本地 SRA Toolkit(prefetch → fasterq-dump)
中型项目(100-1K Runs) TB 级 本地集群或单云 VM(注意本地磁盘周转)
大型聚合(1K-10K Runs) 10-100 TB 云原位(GCE/S3 桶内处理)
petabase 挖矿 PB 级 云原生 + 专用索引(Logan/MetaGraph 类)
元数据查询 GB 级 BigQuery/Athena 直查(无需下载数据)

SRA 的工程重心是「按需取数」——47 PB 永远不该也不必全量落地;accession 清单 → 批量取数 → 流式处理是标准循环。

§3.5 获取通道

  1. 网页检索:NCBI SRA 网页 + Run Selector(过滤/批量导出 accession);浏览器级零门槛。
  2. SRA Toolkit:prefetch(断点续传下载 .sra)→ fasterq-dump(转 FASTQ,–split-3 分双端)——本地工作流的标准二件套。
  3. AWS Open Data:s3://sra-pub-src-1 / sra-pub-run-odp(–no-sign-request 免账号)——脚本化批量取数首选。
  4. GCP:us-east-1 桶(免检索费)+ Cloud Data Delivery 网页(选区送桶)。
  5. 元数据 SQL:BigQuery/Athena 的 SRA 元数据表(含 STAT 分类)——「先 SQL 选 Run 再取数」的工程姿势。
  6. ENA 门户:REST API(ebi.ac.uk/ena/portal/api)——欧洲节点 API 化取数更顺手(与 SRA 同库)。

§3.6 口径对齐表

数字 出处口径 澄清
>31,000,000 公共文件 / >47 PB NCBI NAR 2025 官方 「文件」口径(含比对/归档产物);单副本
>38 million 公共测序文库 eLife 2025(引 Logan) 「文库」口径——比文件口径少约 20%
534,254 studies / 66,912 Pbp MetaGraph Nature 2025(2025-01-11) INSDC 三节点合计碱基——非 NCBI 单节点
16.5 PB normalized / 14.5M records Working Group 报告(2021) 历史时点口径
11.5 PB + 4.9 PB dbGaP NAR 2022 历史时点;受控比例参考
受控约 31% Working Group 报告(2021) 2021 时点——当前或有变化
2020 年下载 >48 PB Working Group 报告 下载量 ≠ 库存量
70 万+ SARS-CoV-2 样本 NCBI NAR 2022 病原监测专项口径

§3.7 版本与锁定纪律

  1. 档案无版本号:SRA 持续滚动(新提交/状态变更/格式升级)——「2026 年的 SRA」不是快照;重分析必须锁 accession 清单 + 检索日期。
  2. 数据状态生命周期:官方已正式定义记录状态与流转(Submitted → Processing → Public 等)——引用前核对状态。
  3. 格式选择声明:Normalized vs SRA Lite vs Original——方法论文写明下载格式(BQS 有无)。
  4. accession 语义:SRR(Run)是取数单元;SRP/SRS/SRX 是组织层级——引用数据量时说明计数层级(「30 个 SRP/800 个 SRR」)。

§3.8 数据层级与文件格式详表

层 格式 访问 分析入口
Original(原样提交) FASTQ/BAM/CRAM/仪器格式 公共/受控 需 BQS 的分析;文件最大
Normalized SRA 格式(含 BQS) 公共/受控 Toolkit 标准目标;平衡选择
SRA Lite SRA 格式(无 BQS) 公共/受控 默认下载格式;小而快
比对产物 BAM/CRAM(部分提交) 公共/受控 直接可视化/重比对起点
RNA-seq counts TSV(gene id × count) 公共 差异表达快速起点(日更派生)
STAT 分类 元数据字段 公共 宏基因组预筛(无需下数据)
元数据 BigQuery/Athena 表 公共 SQL 选 Run/项目画像
受控(dbGaP) 同上格式 dbGaP DAC 批准 表型链接的人类数据分析
  1. 格式纪律:QC 类分析(Q 分布)必须 Original/Normalized——SRA Lite 的 BQS 缺失使 QC 语义改变;比对/定量类 Lite 可用但需声明。
  2. FASTQ 双端分离:fasterq-dump --split-3 输出 _1/_2 文件——单文件假定会踩坑(老式 fastq-dump 行为不同)。

§4 数据结构

§4.1 四级对象模型

SRA 对象模型(INSDC 标准)
├── BioProject(SRP)        # 研究项目:总体目标/资助/数据政策
│   ├── BioSample(SRS)     # 生物来源:物种/组织/供体(含属性键值对)
│   │   ├── Experiment(SRX)# 实验设计:平台/建库策略/仪器参数
│   │   │   ├── Run(SRR)   # 运行:实际序列数据(取数单元)
│   │   │   └── ...更多 Run
│   │   └── ...更多 Experiment
│   └── ...更多 Sample
└── Submission               # 提交包:元数据 + 指令

# 取数链:SRP 检索 → SRS 过滤 → SRX 确认设计 → SRR 批量下载
# 引用链:论文引用 SRP;方法引用 SRR 清单

§4.2 元数据检索与队列选取(BigQuery/ENA API)

-- BigQuery(NCBI SRA 元数据公共表):找人类 RNA-seq 公共 Runs(示意)
SELECT
  acc,                       -- Run accession(SRR)
  biosample,                 -- SRS
  organism,                  -- 分类
  platform, library_strategy -- Illumina / RNA-Seq
FROM `nih-sra-datastore.sra.metadata`
WHERE organism = 'Homo sapiens'
  AND library_strategy = 'RNA-Seq'
  AND acc LIKE 'SRR%'
LIMIT 1000;
-- 官方公共数据集:nih-sra-datastore.sra(含 STAT 分类字段 tax_analysis)
# ENA 门户 API(同库欧洲节点):下载人类 RNA-seq Runs 的 TSV 清单
curl "https://www.ebi.ac.uk/ena/portal/api/search?result=read_run&query=tax_eq(9606)%20AND%20library_strategy=RNA-Seq&fields=run_accession,sample_accession,study_accession,scientific_name,fastq_ftp&format=tsv&limit=50" -o srr_list.tsv

§4.3 取数与转换(SRA Toolkit)

#!/usr/bin/env bash
# SRA 取数三件套:prefetch(断点续传)→ fasterq-dump(转 FASTQ)→ 压缩
set -euo pipefail

# 1) 单 Run 取数
prefetch SRR12345678                    # 下载 .sra(断点续传;默认到 ~/ncbi/public/sra)

# 2) 转 FASTQ:--split-3 分离双端(单端仍出单文件)
fasterq-dump SRR12345678 --split-3 --threads 8 --outdir ./fastq/
gzip ./fastq/SRR12345678_1.fastq ./fastq/SRR12345678_2.fastq

# 3) 批量:accession 清单逐行取数(限速防封禁)
while read -r acc; do
  prefetch "$acc" && fasterq-dump "$acc" --split-3 --threads 8 -O ./fastq/
done < SRR_Acc_List.txt

# 4) AWS Open Data 直取(免账号;跳过 NCBI 带宽)
aws s3 cp --no-sign-request s3://sra-pub-run-odp/srp/123/SRR12345678 ./

§4.4 RNA-seq 派生计数的使用

#!/usr/bin/env python3
"""NCBI 官方 RNA-seq gene feature counts:跳过比对直接拿计数矩阵。
来源:s3://sra-rnaseq-analysis(人类/小鼠 bulk RNA-seq;日更新)"""
import boto3, pandas as pd

s3 = boto3.client("s3")
# 1) 取单个 Run 的计数(两列:gene_id, count)
s3.download_file("sra-rnaseq-analysis",
                 "by_run/SRR12345678/SRR12345678.tsv",
                 "SRR12345678.tsv")
cnt = pd.read_csv("SRR12345678.tsv", sep="\t")
print(cnt.head())

# 2) 多 Run 合并成矩阵(跨研究 DE 的快速起点)
import os
accs = ["SRR1", "SRR2", "SRR3"]          # 示例;实际来自 metadata 检索
mat = {}
for a in accs:
    key = f"by_run/{a}/{a}.tsv"
    s3.download_file("sra-rnaseq-analysis", key, f"{a}.tsv")
    df = pd.read_csv(f"{a}.tsv", sep="\t", index_col=0)
    mat[a] = df.iloc[:, 0]
matrix = pd.DataFrame(mat)
print(matrix.shape)   # genes × runs——直接喂 DESeq2/edgeR 前的原料

(派生计数是「官方管线口径」——与自己重比对的数值会有差异;跨研究 DE 的严谨做法仍以自建管线为准,派生层做快速预览与量级验证。)

§4.5 元数据与可复现指纹

  1. accession 清单:所有用到的 SRR/SRP 列表 + 检索日期——复现包第一件。
  2. 格式声明:SRA Lite / Normalized / Original + Toolkit 版本——BQS 有无影响 QC 类结果。
  3. STAT 快照:分类含量字段随时间可能更新——记录检索时点。

§4.6 完整性清单

  • [ ] accession 清单 + 检索日期双戳
  • [ ] 下载格式(Lite/Normalized/Original)声明
  • [ ] 元数据再工程(同义词映射/本体对齐)记录
  • [ ] QC 管线(FastQC/MultiQC)与阈值透明
  • [ ] 受控/公共边界确认(人类数据)
  • [ ] 平台/建库策略过滤(混平台 meta 分析的分层)
  • [ ] 双端/单端统一处理(–split-3 语义)
  • [ ] 偏倚面(deposit 自愿性/期刊偏好)limitation 段落

§4.7 数据血缘

全球测序实验室(期刊/资助方 deposit 要求)
  → 提交(BioProject + BioSample + 数据文件)
  → NCBI ETL(格式标准化/STAT 分类/RNA-seq counts)
  → 三节点镜像(INSDC:SRA/ENA/DRA)
  → 双云全量镜像(AWS ODP / GCP)
  → 研究者取数(Toolkit/云桶/API)
  → 重分析产物(比对着/计数矩阵/组装 contigs → GEO/GenBank 回流)

「提交 → 标准化 → 镜像 → 取数 → 重分析 → 回流」六段血缘——SRA 是全球测序数据循环的「心脏泵」:deposit 进、reanalysis 出、processed 产物再回 GEO/GenBank,构成科学数据的完整循环。

§4.8 云原位流式处理(大数据集)

#!/usr/bin/env python3
"""AWS ODP 云原位流式:千级 Runs 不落地 NCBI 带宽,桶对桶/流式处理。
场景:中型聚合(1K Runs)——先把数据流图画清楚(egress 陷阱,§6.5 坑点 5)。"""
import boto3, subprocess, json

s3 = boto3.resource("s3")   # --no-sign-request 等价:botocore UNSIGNED 配置或公开桶

# 1) 清单驱动的批量取数(官方公共桶,免 egress)
bucket = s3.Bucket("sra-pub-run-odp")
with open("srr_list.txt") as f:
    accs = [l.strip() for l in f if l.strip()]

def fetch(acc: str):
    """官方桶内对象命名按 SRP 前缀分桶;先探测再下载。"""
    prefix = acc[3:6]                      # SRR123 → "123" 路由段
    key = f"srp/{prefix}/{acc}"
    local = f"./sra/{acc}.sra"
    bucket.download_file(key, local)       # 同区 EC2 上跑:免费且快
    return local

# 2) 流式转换:转 FASTQ 后立刻 QC + 删除 .sra(存储周转纪律)
for acc in accs[:50]:                      # 先试跑 50 个
    path = fetch(acc)
    subprocess.run(["fasterq-dump", path, "--split-3", "-O", "./fastq/"], check=True)
    subprocess.run(["gzip", "-f"] + [p for p in __import__("glob").glob(f"./fastq/{acc}*")])
    subprocess.run(["rm", path])           # .sra 用完即删(周转)

# 3) 大规模:把本段逻辑搬进 GCE/SageMaker 同区实例——零 egress

(云原位的成本核心是「同区」——EC2 与 S3 同区流量免费;跨区/下载回本地才产生 egress;千级 Runs 的预算差异可达 10 倍。)

#!/usr/bin/env bash
# 序列撞车检测:新序列是否已存在于公开库(Pebblescout 类服务/本地 MetaGraph)
# 1) Pebblescout(NCBI 内建服务化 k-mer 搜索——网页/API)
#    输入:候选 contig/序列 FASTA → 秒级返回命中 Runs 列表

# 2) 本地 MetaGraph 索引(自建场景:研究者/机构级)
metagraph build -v -k 31 --mem-gb 200 \
    -o my_index annotation_xf contigs.fa    # 构建计数 de Bruijn 图索引
metagraph query -v -i my_index \
    -o hits.tsv candidate_sequences.fa      # 查询公开库索引

# 3) 命中解读:新序列(无命中)→ blast 确认新性 → 系统发育定位
makeblastdb -in nt_subset.fa -dbtype nucl
blastn -query candidate.fa -db nt_subset.fa -outfmt "6 qseqid sseqid pident length" -max_target_seqs 20

(「先索引后取数」的新默认——MetaGraph 估全库索引 ~172-223 TB(Nature 2025),单机可承受;Pebblescout 把 3.7 Pbp 做成秒级服务——撞车检测从「数月 blast 全库」变成「秒级 k-mer + 定向 blast 确认」。)

§5 下游分析协议

§5.1 任务×资源速查表

任务 用哪些层 关键动作 陷阱
重分析(转录组) Original/Normalized + 元数据 自建管线 + 原研究对照 Lite 无 BQS 的 QC 失效
宏基因组挖矿 STAT 预筛 + 原始 reads k-mer/组装双路 元数据地理信息缺失
病原监测 STAT 分类字段 直接 SQL 监控 掩码 opt-in 的盲区
方法 benchmark 锁定 accession 集 公平切分 数据泄漏(同 study 跨 train/test)
跨研究 meta 元数据再工程先行 同义词映射/批次校正 元数据直用假相关
AI 预训练 云原位流式 序列 tokenize 分布偏移(物种不平衡)

§5.2 转录组重分析协议

  1. 清单锁定:GEO 找研究 → SRA 取 accession → 清单入库(SRP/SRR 双层)。
  2. QC 三查:FastQC(R1/R2)→ MultiQC 汇总 → 剔除异常 Run(质量/接头/复杂度)。
  3. 比对/定量:STAR/HISAT2 比对 GRCh38 + featureCounts/Salmon 定量——与原研究管线对照。
  4. 批次校正:study 作为批次协变量(ComBat/limma)——跨研究 DE 必做。
  5. 对照验证:重跑结果与原文表的关键基因量级一致(±2 倍内)——不一致先查元数据再查版本。

§5.3 宏基因组挖矿协议

  1. STAT 预筛:SQL 选目标物种/低丰度域——只取候选 Run(省 90% 下载)。
  2. 质控:fastp 剪接头 + BBTools 去人类污染——防 incidental 序列。
  3. 双路检测:k-mer 搜索(Pebblescout/MetaGraph 索引)+ 组装(MEGAHIT)→ ORF 预测 → HMM 搜索。
  4. 验证闭环:候选序列回 NCBI nt/blast 确认新性 → 系统发育定位。
  5. 报告:accession 溯源表(每个新发现 → 来源 Run 列表)——审稿必查。

§5.4 成本模型

场景 技术路线 成本量级
单研究重分析(50 Runs) 本地 Toolkit + 桌面工作站 $0 数据费;人力为主
中型聚合(1K Runs) 云 VM + S3 桶 数百-数千美元(计算为主)
petabase 扫描 云原生 + 专用索引 数万美元级(Serratus 类项目)
元数据普查 BigQuery/Athena 数美元(查询费)
存储 自建桶 egress 免费但存量收费

($0 的元数据普查 vs 数万美元的全库扫描——「先 SQL 后取数」的纪律直接决定预算数量级。)

§5.5 失败模式清单

  1. 元数据直用:自由文本当结构化数据——假关联丛生;再工程先行。
  2. Lite 格式做 QC:BQS 缺失使 Q 分布全平——用 Original 补。
  3. 同 study 跨切分:benchmark 训练测试泄漏——按 SRP 切。
  4. 单端/双端混拼:–split-3 语义误解——显式检查文件对。
  5. 下载风暴:千级 Runs 直连 NCBI——限速/分批/AWS ODP 分流。
  6. egress 陷阱:官方桶免费、自建桶出口收费——数据流图画清楚。
  7. 受控混入:dbGaP 数据当公共用——授权边界核查。
  8. 污染未查:样本交换/指数跳跃/物种混杂——kraken/STAT 双查。

§5.6 校准与验证协议

验证层 数据源 指标 通过线(参考)
L1 取数完整性 accession 清单 vs 实得 拿全率 100%(缺数逐条说明)
L2 QC 通过率 MultiQC 异常 Run 比例 <10% 并逐条记录
L3 重分析一致性 vs 原研究产物 关键基因量级 ±2 倍内且方向一致
L4 跨研究批次效应 PCA/UMAP study 聚类程度 校正后混合
L5 污染检查 STAT + kraken2 非 target reads 比例 报告并过滤
L6 方法学复现 独立实现者 管线重跑一致 主结论复现
  1. L3 是重分析的灵魂:与原研究一致≠管线相同——量级与方向的一致性说明「结论对方法选择稳健」。
  2. L5 的卫生学意义:宏基因组研究的人类污染检查同时是隐私合规动作(防 incidental 公开)。

§6 实证结果与方法学分析

§6.1 petabase 扫描的三个里程碑

  1. Serratus(2021):云上 5.7M 数据集 / 10.2 Pbp 转译搜索——13 万+ 新 RNA 病毒;「云原生 + 锁定标志基因」范式的确立;COVID-19 监测的直接技术储备。
  2. Logan(2024-2025):27M 库的组装压缩——「archive → assembled contigs」的一次性全球重工程;下游搜索从 reads 层跃升到 contig 层。
  3. MetaGraph(Nature 2025):de Bruijn 图索引——估全库索引仅 ~172-223 TB(可装进数块消费级硬盘,$2,500);「petabase 数据的 petabyte 级索引」的压缩复利证明。

§6.2 乳头瘤病毒案例:单库重扫的边际产出

  1. 设计:Logan-SRA 组装库上 ~10 小时对齐搜索——比对传统五十年研究积累(992 个 PV 类型)。
  2. 结果:独立重识别 65% 已知类型 + 383 新型(+34%),跨 105 宿主物种——犀牛/田鼠/灰狐等新宿主。
  3. 方法学启示:新类型分布与采样强度不成正比——东非/南美的 undersampled 生物群系反而高产;「挖矿策略应按生态盲区而非数据量分配」。
  4. 对 AI 的含义:数字化石搜索(petabase)+ 生态先验(盲区优先)= 发现效率的新解;纯堆算力的边际产出递减。

§6.3 方法学三层框架(gsm)

  1. G(Ground layer):原始 reads——仪器输出的事实层(SRA 的本体)。
  2. S(Synthesis layer):比对/定量/组装/STAT 分类——标准化推断层(可重跑可替换)。
  3. M(Medical layer):疾病关联/临床结论——语义层(需验证闭环)。

越层引用:把 G 层的 STAT 粗分类当 M 层诊断(「检出 HIV 序列 = HIV 感染」)是宏基因组论文的常见审稿雷——分类含量是环境信号不是临床诊断;论文口径按层声明。

§6.4 接力实验设计

  1. SRA → GEO:原始 reads 重跑 → 与 processed 矩阵对照。
  2. SRA → gnomAD/dbSNP:重分析变异 → 频率目录对照。
  3. SRA → ClinVar:新变异 → 临床语义核对。
  4. SRA → GenBank/RefSeq:新组装 → 分类语义层登记。
  5. SRA → Logan/MetaGraph:档案 → 第三方索引(挖矿提速)。

§6.5 八个真实坑点

  1. 坑点 1:元数据直用——自由文本同义词/拼写错误;再工程先行。
  2. 坑点 2:Lite 格式做 QC——BQS 缺失;Original/Normalized 补齐并声明。
  3. 坑点 3:同 study 泄漏——benchmark 按 SRP 切分;Run 级随机切是泄漏。
  4. 坑点 4:下载风暴——千级 Runs 直连 NCBI 触发限流;AWS ODP 分流 + 限速。
  5. 坑点 5:egress 费用——官方桶免费、自建桶出口收费;数据流图先行。
  6. 坑点 6:受控数据混用——dbGaP 数据当公共引用;授权边界逐条核查。
  7. 坑点 7:双端语义——–split-3 的文件对语义;单端数据误拆。
  8. 坑点 8:STAT 粗分类当诊断——环境信号 ≠ 临床结论;分层口径声明。

§6.6 审稿人自查清单

  • [ ] accession 清单 + 检索日期写入数据可用性声明?
  • [ ] 下载格式(Lite/Normalized/Original)与 Toolkit 版本声明?
  • [ ] 元数据再工程(同义词映射)描述?
  • [ ] 按 SRP 切分防泄漏?
  • [ ] QC 管线与阈值透明?
  • [ ] 污染检查(STAT/kraken)记录?
  • [ ] 受控/公共边界确认?
  • [ ] 跨研究批次校正方法描述?

§6.7 档案演进的方法学含义

  1. SRA Lite 默认化(2023-):「质量分数默认消失」改变了 QC 语义——方法论文的格式声明从可选变必选。
  2. STAT 掩码 opt-in(2024-):宏基因组数据的 incidental 人类序列有了官方防线——但只覆盖 opt-in 提交,历史数据是盲区。
  3. 新平台支持(Element/Ultima):混合平台数据的比对器兼容性是新坑——平台作为批次协变量的必要性上升。
  4. 第三方索引成熟(Logan/MetaGraph):挖矿成本从「云集群」降到「单机 + 索引」——「先索引后取数」的新默认。

§6.8 第三方索引生态的工程图景

工具/项目 方法 规模 语义
Logan 云端组装 + 压缩 27M 库 contigs 「archive → assembled」一次重工程
MetaGraph 计数 de Bruijn 图索引 全库估 ~172-223 TB k-mer 对齐级搜索(Nature 2025)
Pebblescout 核苷酸 k-mer 3.7 Pbp 秒级查询(SRA 内建服务化)
Serratus 云转译搜索 5.7M 集 / 10.2 Pbp 蛋白标志基因扫描
STAT NCBI 官方 k-mer 分类 内建元数据 物种组成直接查询
MetaSRA 元数据再工程 人类样本 ENCODE 风格标准化 schema

生态启示:NCBI 存「事实」、第三方建「视图」——「档案与索引分离」是 PB 级数据系统的正确架构;研究者组合官方口径 + 第三方索引,声明各自版本。

§6.9 档案治理的开放经济学

  1. 供给端的社会契约:SRA 的体量来自「期刊/资助方强制 deposit」的制度设计——数据共享从道德呼吁变成发表流程的技术环节;这是全球科研治理最成功的公共品之一。
  2. 成本端的真实压力:Working Group 报告披露的焦虑(exponential growth vs NIH 预算)催生了冷热分层/SRA Lite/AWS ODP 免费出口三项对策——「数据可持续性」是档案类基础设施的长期议题。
  3. 需求端的分工演化:官方管保存与基础派生(STAT/counts),第三方管高级索引(组装/图索引)——「不重复造轮子」的生态分工使 47 PB 的可分析性持续提升。
  4. 对数据集工程的启示:把「强制 deposit + 派生层 + 生态分工」三件套映射到医疗 AI 数据集工程——「采集即归档 + 官方轻派生 + 社区建视图」是可复制模式。

§7 AI 就绪指南与应用场景

§7.1 SRA 在医疗 AI 中的四种喂法

  1. 自监督预训练喂法:petabase 序列 → DNA/RNA 语言模型(分布式云原位流式)。
  2. 方法学 benchmark 喂法:锁定 accession 集 → 比对/定量/组装工具评测。
  3. 发现喂法:k-mer/组装双路 → 新病毒/新抗性基因/新标志物(Serratus/PV 模式)。
  4. 聚合喂法:元数据再工程 → 跨研究 meta 分析/多任务训练(批次校正核心)。

四种喂法与 §6.5 坑点对应:喂法 1 踩坑 4(下载风暴);喂法 2 踩坑 3(同 study 泄漏);喂法 3 踩坑 8(分类当诊断);喂法 4 踩坑 1(元数据直用)——建模前回读对号。

§7.2 宏基因组发现管线实操配方

#!/usr/bin/env bash
# 宏基因组新物种挖掘:STAT 预筛 → QC → 组装 → ORF → 搜索(示意)
set -euo pipefail

# 1) 预筛:BigQuery 选目标 Runs(无 BQS 依赖的宏基因组用 Lite 即可)
#    SELECT acc FROM `nih-sra-datastore.sra.metadata`
#    WHERE tax_analysis IS NOT NULL AND organism LIKE '%environmental%'

# 2) 批量取数(AWS ODP 分流)
while read -r acc; do prefetch "$acc"; done < srr_list.txt

# 3) QC + 去宿主
fastp -i R1.fq.gz -I R2.fq.gz -o clean_R1.fq.gz -O clean_R2.fq.gz
bbmap.sh filterhost in=clean_R1.fq.gz ref=hg38.fa out=nonhost_R1.fq.gz

# 4) 组装 + ORF + 搜索
megahit -1 nonhost_R1.fq.gz -2 nonhost_R2.fq.gz -o asm/
prodigal -i asm/final.contigs.fa -a orfs.faa
hmmsearch --tblout hits.tbl RdRp.hmm orfs.faa   # 病毒 RdRp 标志
# 5) 候选 → blast 确认新性 → 系统发育

§7.3 模型选型与迁移决策

  1. 序列语言模型:DNABERT 类 transformer——云原位流式(DataLoader 直接读桶);分布式必须。
  2. 分类器(宏基因组):kraken2/Centrifuge 类 k-mer 精确匹配——SRA 大规模取数前的预筛主力。
  3. 表达模型:变分自编码器/深度网络——跨研究聚合需批次协变量(study one-hot + ComBat)。
  4. 组装质量评估:QUAST + BUSCO——自动化组装管线的验收层。
  5. 不确定性:稀有物种分类的置信区间——STAT 的分类置信度字段 + 自建 bootstrap。

§7.4 公平性:档案偏差的工程兑现

  1. 物种/领域不平衡:人类与模式生物过代表,非模式物种稀疏——「全球物种公平」不是 SRA 的设计目标;挖矿按生态盲区(PV 案例)而非数据量分配。
  2. 地域偏差:发达国家/期刊强势区的提交占主导——全球健康监测的外推要声明盲区。
  3. 期刊偏好层:强制 deposit 政策覆盖度学科差异大——临床测序的公共存量远小于科研测序。
  4. 格式世代:老数据(无 BQS Lite/旧平台)与新数据的格式断层——预训练语料的「数据清洗世代」声明。

§7.5 任务×资源速查表

AI 任务 SRA 数据 输出形态 验收
DNA 语言模型预训练 云原位流式 reads 预训练权重 下游 fine-tune 增益
宏基因组分类器 STAT + reads 分类模型 L5 污染线
转录组表征 RNA-seq counts/自跑 嵌入/聚类 批次校正后混合
新病原发现 组装 + HMM 候选序列 blast 新性 + 系统发育
工具 benchmark 锁定集 方法排名 SRP 切分无泄漏
元数据 NLP 提交者文本 结构化标签 人工核验子集 PPV

§7.6 端到端案例:全球肠道抗性基因监测

  1. 预筛:BigQuery 选人类肠道宏基因组 Runs(STAT 含 Bacteroidetes 等标志)——2 万+ Runs。
  2. 取数:AWS ODP 分流 + 限速批取——数周窗口。
  3. 挖掘:组装 → ORF → CARD/ResFinder HMM——抗性基因清单 + 丰度矩阵。
  4. 时空分析:元数据地理/年份字段(再工程后)→ 抗性基因流行度地图。
  5. 验证:与 CARD 参考对照 + blast 新性 → 新变体登记。
  6. 报告:accession 溯源 + 地域盲区声明 + 批次效应敏感性——三件套齐。

§7.7 报告模板:方法学段落骨架

原始测序数据自 NCBI Sequence Read Archive 取得(accession 清单见附录;检索日期 2026-09;下载格式 SRA Lite,无 base quality scores,SRA Toolkit v3.x fasterq-dump --split-3 转换)。样本元数据经再工程处理(同义词映射至 [本体];字段缺失率 [x]%)。质量控制采用 fastp(接头/质量修剪)与 BBTools 去宿主过滤;宏基因组分类核查使用 NCBI STAT 字段与 kraken2 双查。基准评测按 BioProject 层级切分训练/测试集以避免同研究数据泄漏。跨研究分析采用 study 批次协变量校正(ComBat);受控人类数据(dbGaP,项目号 [xxx])使用经数据访问委员会批准。本研究的 accession 清单、再工程映射表与 QC 报告全部开源。

§7.8 成本与排期模板

阶段 内容 成本构成 周期
检索设计 元数据 SQL + 清单锁定 数美元查询费 3-5 天
试跑 10-50 Runs 全管线 本地 $0 1 周
批量取数 百-千级 Runs 云带宽/存储 1-4 周
主分析 挖掘/训练 计算(本地或云) 2-6 周
验证 L1-L6 协议 人力 1-2 周
复现包 清单+映射表+管线 人力 2 天

SRA 项目的排期风险在取数环节(带宽/限流/存储周转)——「试跑先行 + 分批取数」是排期第一项。

§7.9 消融案例:元数据再工程的必要性

跨研究聚合时元数据处理策略的典型消融(转录组 meta 分析场景):

配置 元数据策略 跨研究结果(示意) 诊断
R1 原始自由文本直用关键词 组间差异混杂,假阳性 +30% 同义词分裂
R2 大小写/简单清洗 略改善;拼写错误仍存 清洗不够
R3 本体映射(HPO/UBERON)+ 人工核验子集 假阳性回落;批次主导 语义对齐生效
R4 R3 + 缺失模式建模(披露意愿协变量) 最稳;残留差异可解释 完整流程
  1. 方法:同一表型多研究合并;评估统一(同一统计框架);R3 的映射表人工抽检 200 条。
  2. 读数:R1→R3 的假阳性降幅主要来自「同义词合并」——元数据的最大噪声源是词形不是数值;R4 处理「敏感字段拒答」的非随机缺失。
  3. 结论:「元数据再工程」不是可选美化——跨研究聚合的统计有效性依赖语义对齐;投入产出比最高的预处理环节。

§8 伦理、许可与合规

§8.1 政策与义务结构

  1. 公共数据:免费开放下载/使用——NCBI Policy + NIH GDS Policy 框架;提交者保留原始权利,商用衍生逐案评估。
  2. 受控数据(dbGaP):人类受控数据约三分之一——机构签署 DUA + 研究者 DAC 批准 + 年度合规报告;再识别禁令全球红线。
  3. deposit 义务:期刊/资助方普遍要求——提交者承担元数据正确性责任;研究者引用时承担口径声明责任。
  4. 掩码与污染:STAT 掩码 opt-in 防误公开——研究者发现历史数据疑似人类序列时按 NCBI 报告流程处理。

§8.2 引用与致谢模板

致谢模板(按需裁剪):
Raw sequencing data were obtained from the NCBI Sequence Read Archive
(accessions: SRPxxxxxx, SRRxxxxxx; retrieved 2026-09). The SRA is
maintained by the National Center for Biotechnology Information,
National Library of Medicine, NIH, and mirrored across INSDC partner
databases (ENA/DDBJ). SRA citation: Leinonen et al., Nucleic Acids
Research 39, D19-D25 (2011). Controlled-access human data were used
under dbGaP project phsxxxxxx (approved by the relevant DAC).

§8.3 国内合规路径

  1. 下载使用:SRA 公共数据的下载与本地分析属于使用公开资源——国内合规重点是「人类遗传资源」语义:国外来源的人类测序数据在境内使用需符合人类遗传资源管理规范(对外提供/出境另受约束)。
  2. 提交与回流:国内产生的数据向 SRA deposit 涉及数据出境申报——人类数据走审批、非人类数据按科研合作规范。
  3. 红线:把 SRA 人类公共数据与国内人群库做未批准的个体级合并;对公共数据尝试再识别——两侧都违规。

§8.4 商业使用边界

  1. 默认姿态:公共数据「可用」不等于「无限商用」——提交者协议与数据来源(含临床数据)决定边界;商用前逐 study 核查数据政策字段。
  2. API 与抓取:NCBI API 有使用政策(限速/标识)——商业级批量抓取需读官方条款;AWS ODP 是合规批量通道。
  3. 成本模型:数据免费但云不免费——商业实体的存储/计算全额自担;egress 费陷阱(§6.5 坑点 5)在商业规模下放大。

§8.5 合规台账最小模板

台账项 记录内容 示例
数据来源 accession 清单 + 检索日期 SRP/SRR 双层
下载格式 Lite/Normalized/Original BQS 有无声明
受控授权 dbGaP 项目号 + DAC 批准 年度合规报告
元数据再工程 映射表 + 抽检记录 本体版本
QC 记录 MultiQC 报告 + 剔除清单 阈值透明
工具版本 Toolkit/k‑mer 工具版本 复现包
出口合规 数据流图 + egress 路径 云成本对账

§8.6 提交者侧的合规义务

把视角反转——作为数据提交者(而非使用者)的义务清单:

  1. 元数据真实性:BioSample 属性的准确性是下游一切分析的地基——拼写错误/字段混写在提交时就该避免(MetaSRA 的痛源自提交侧)。
  2. 人类数据分类:公共 vs 受控(dbGaP)的判断在提交时做出——GDS Policy 与机构 IRB 是判定依据;「先公共后撤回」不是可靠策略。
  3. 掩码 opt-in 决策:宏基因组/环境数据建议启用 STAT 人类 reads 掩码——incidental 序列的误公开风险在提交时阻断。
  4. 撤回与更正流程:错误数据走官方更正流程(不改写历史)——引用者因此能追溯版本;撤回的语义(数据删除 vs 状态标记)按官方定义执行。

§9 谱系与生态

§9.1 测序档案时间线

1982  GenBank 上线(INSDC 起点——组装序列时代)
2005-2008  高通量测序爆发(454/SOLiD/Illumina)——reads 需要新家
~2009  SRA 上线(NCBI;三节点分工确立)
2011  Leinonen NAR 论文(标准引用确立)
2019  STRIDES:AWS+GCP 全量云镜像
2020  COVID-19 监测(70 万+ 样本);年下载 >48 PB
2023-2024  SRA Lite 默认化;STAT 掩码 opt-in
2024-2025  Logan 27M 库组装;MetaGraph Nature 论文
2026  第三方索引生态成熟;新平台持续接入

§9.2 术语表

术语 定义
SRA Sequence Read Archive——原始测序档案
INSDC 国际核酸序列数据库合作(NCBI/EBI/DDBJ 三节点)
BioProject(SRP) 研究项目层对象
BioSample(SRS) 生物来源层对象
Experiment(SRX) 实验设计层对象
Run(SRR) 运行层对象——实际取数单元
SRA Lite 去除 base quality scores 的轻量格式
Normalized NCBI ETL 标准化格式(含 BQS)
BQS Base Quality Scores——碱基质量分数
STAT Sequence Taxonomic Analysis Tool——官方 k-mer 分类
STRIDES NIH 云基础设施计划(SRA 上云的工程载体)
AWS ODP AWS Open Data Program——免费出口通道
dbGaP 基因型-表型受控档案(SRA 受控数据的授权语境)
GDS NIH Genomic Data Sharing Policy
prefetch / fasterq-dump SRA Toolkit 取数/转 FASTQ 二件套
MetaSRA 人类样本元数据再工程库

§9.3 资源选型决策树

你的需求是什么?
├─ 「原始 reads 重跑管线」
│    → SRA(Toolkit 本地取数)
├─ 「处理后表达矩阵快速起点」
│    → GEO(processed)或 SRA RNA-seq counts(官方派生)
├─ 「变异数据语义」
│    → dbSNP/ClinVar(变异层)——SRA 是证据层不是语义层
├─ 「组装基因组/参考」
│    → GenBank/RefSeq(组装层)
├─ 「人类受控队列(表型链接)」
│    → dbGaP(授权路径)或 All of Us(云内受控)
├─ 「宏基因组全球扫描」
│    → SRA + Logan/MetaGraph 索引(挖矿提速)
├─ 「欧洲本地取数」
│    → ENA 门户(同库;REST API 更顺手)
└─ 「单细胞图谱」
     → HCA/CellxGene(图谱层)——原始数据多数在 SRA

§9.4 与本库其他条目的关系

条目 关系
geo 处理后数据档案——「GEO 找图、SRA 取数」双库节奏
gnomad 变异频率目录——其原始数据源自 SRA/受控档案
clinvar 临床变异语义——SRA 提供证据层
tcga 癌症多组学——其原始数据部分回流档案
gtex / all-of-us 大型队列——原始 reads 的规模化生产者
大型队列——原始 reads 的规模化生产者
ensembl / gencode 注释语义层——重分析比对的参考注释 / gencode
dbgap 受控人类数据授权路径——SRA 受控层的入口

§9.5 组合使用建议

研究设计 推荐组合 分工
转录组重分析 SRA(raw)+ GEO(processed 对照)+ gencode(注释) 事实 + 对照 + 语义
宏基因组挖矿 SRA(库)+ Logan(contigs)+ CARD/HMDB(语义) 事实 + 索引 + 注释
变异发现 SRA(证据)+ gnomAD(频率)+ ClinVar(临床) 证据 + 背景 + 语义
方法 benchmark SRA(真实数据)+ 人工模拟集 真实性 + 可控性
AI 预训练 SRA(语料)+ MetaGraph(索引加速) 事实 + 效率

组合纪律:accession 统一——多库组合以 SRA accession 为血缘主键;版本快照与检索日期统一记录。

§9.6 全球科研基础设施的生态角色

SRA 证明了「全球自愿 deposit + 公共档案 + 云镜像」可以在 petabyte 尺度运转:期刊与资助方的强制要求提供了供给端,INSDC 三节点提供了地理冗余,STRIDES 双云镜像提供了可及性,STAT/counts 派生层提供了「档案 → 分析」的自动扶梯。它把「数据共享」从道德呼吁重写为发表流程的技术环节——全球测序数据的可持续循环因此有了基础设施。对医疗 AI,SRA 是序列模态的「原始层宪法」:任何声称覆盖基因组数据的工作都应能回溯到 SRA accession 级的证据链。

§9.7 开放-受控光谱上的定位

公共测序资源分布在「全开放(SRA 公共层)— 受控(SRA dbGaP 层 / EGA)— 云内受控(All of Us)」光谱上——SRA 是开放端的规模极值:

维度 SRA 公共层 SRA dbGaP 层 All of Us
数据形态 原始 reads(全物种) 人类受控 reads 全体级多模态
访问 直接下载 DAC 批准 注册+培训+云内
表型链接 弱(元数据) 结构化(dbGaP) 强(OMOP 同人)
分析地 本地/云 本地/云(授权内) 仅云内
典型用途 重分析/挖矿 人类疾病研究 精准医学队列
  1. 工程含义:SRA 公共层的「免注册直取」使其成为数据工程的默认起点——受控需求出现时再升级路径。
  2. 风险对冲:公共层元数据弱——表型驱动的研究在公共层受限;dbGaP/All of Us 补强。

§9.8 全球测序数据循环的未来图景

把 SRA 放进「测序数据全生命周期」的完整拼图:

环节 基础设施 与 SRA 的关系
产生 全球测序实验室/临床实验室 供给端(deposit 强制)
归档 SRA/ENA/DRA(INSDC) 档案本体
语义 GenBank/RefSeq/dbSNP/ClinVar 下游语义层(组装/变异)
索引 Logan/MetaGraph/Pebblescout 第三方视图层(挖矿加速)
应用 gnomAD/GEO/HCA 频率/表达/图谱产品层
回流 重分析产物 → GEO/GenBank 循环闭合

循环结论:SRA 是循环的「心脏泵」——「事实存档 + 语义分流 + 视图加速 + 产品孵化 + 产物回流」的完整闭环使全球测序数据成为「活的资源」而非「死的备份」;医疗 AI 团队在此闭环中的正确姿势是「用证据层(SRA)验证、用语义层(ClinVar/RefSeq)解读、用产品层(gnomAD/GEO)提速」。

§10 资源导航与 FAQ

§10.1 官方资源导航

上手指引(第一次接入的推荐顺序):

  1. 网页检索目标研究 → Run Selector 导出 accession 清单(第一天)。
  2. 本地安装 Toolkit → 10 个 Run 试跑全管线(prefetch → fasterq-dump → QC)。
  3. 元数据 BigQuery 试查 → 锁定清单与格式声明(Lite vs Original)。
  4. 批量取数(AWS ODP 分流 + 限速)→ 存储周转规划。
  5. 复现包固化(清单+映射表+管线+QC 报告)。

§10.2 关键文献

  1. Leinonen, R., Sugawara, H. & Shumway, M. The Sequence Read Archive. Nucleic Acids Research 39, D19-D25 (2011). DOI 10.1093/nar/gkq1019
  2. Database resources of the National Center for Biotechnology Information in 2025. Nucleic Acids Research 53, D1 (2025).
  3. NIH Council of Councils. SRA Data Working Group Final Report. NIH(2021-09).
  4. Schmidt, E. et al. Efficient and accurate search in petabase-scale sequence repositories. Nature(2025). DOI 10.1038/s41586-025-09603-w
  5. Medical X / eLife reviewed preprint(2025). Petabase-scale Papillomavirus discovery(Logan-SRA 重扫;+34% 多样性).

§10.4 FAQ

Q1:SRA 数据免费吗?
A:公共数据完全免费——数据免费、AWS ODP 免 egress;成本在计算与自建存储。

Q2:能下载整个 SRA 吗?
A:不要——47 PB 级;按 accession 清单按需取数;全库级需求用 Logan/MetaGraph 索引。

Q3:SRA 和 ENA/DDBJ 什么关系?
A:INSDC 三节点——同一提交三处镜像;从任一入口取同一数据;引用统一 accession。

Q4:SRA Lite 的质量分数没了怎么办?
A:需要 BQS 的分析(QC/Q 分布)用 Original 或 Normalized 格式;方法论文声明所用格式。

Q5:怎么批量下载 1000 个 Run?
A:accession 清单 → prefetch 逐条(限速)或 AWS ODP 直取;先试跑再放量;留意存储周转。

Q6:元数据能信吗?
A:部分信——提交者自由文本(同义词/拼写错误普遍);跨研究聚合前做再工程(MetaSRA 类映射)。

Q7:怎么找「所有人类 RNA-seq」?
A:BigQuery/Athena 元数据表(library_strategy=RNA-Seq + organism 过滤)——SQL 秒级出清单,不用下数据。

Q8:受控数据怎么拿?
A:dbGaP 路径——机构 DUA + DAC 批准;人类受控数据约占档案三分之一。

Q9:RNA-seq counts 派生数据是什么?
A:NCBI 官方把公共人类/小鼠 bulk RNA-seq 跑出的基因计数 TSV(日更)——快速起点;严谨分析仍建议自建管线。

Q10:prefetch 和直接下 FASTQ 区别?
A:prefetch 拿 .sra(断点续传)再本地转 FASTQ;部分数据可直接从云桶拿 FASTQ(AWS ODP);大批量用前者更稳。

Q11:–split-3 是什么?
A:fasterq-dump 的双端分离参数——R1/R2 出 _1/_2 文件;单端数据仍出单文件;不分离会拿到交织格式。

Q12:能看到数据有没有污染吗?
A:STAT 分类字段(元数据内建)预查物种组成;下载后 kraken2 精查——双查是底线。

Q13:提交的数据多久公开?
A:提交后处理(状态页有生命周期定义)——受控数据按提交者设定释放;引用前核对状态。

Q14:能引用 SRA 里的单条 Run 吗?
A:能——SRR accession 独立可引用;方法部分常给 SRR 清单,数据可用性给 SRP。

Q15:和 GEO 怎么分工?
A:GEO 存 processed(矩阵/系列组织);SRA 存 raw(reads)——重分析走 SRA,快速可视化走 GEO。

Q16:微信/国内访问慢怎么办?
A:ENA 门户(欧洲节点 API)或 AWS ODP(不限速)——同一数据多入口;NCBI 直连高峰期不稳。

Q17:宏基因组挖矿从哪开始?
A:STAT 预筛(SQL 选 Runs)→ 组装/或直接用 Logan contigs → HMM/blast——「先索引后取数」省 90% 下载。

Q18:AI 预训练用 SRA 合规吗?
A:公共数据的分析使用在政策内——遵守 NCBI 使用条款与限速;人类受控数据除外;商用基础模型逐案评估。

Q19:怎么知道数据是单端还是双端?
A:元数据 library_layout 字段(paired/single);下载后文件对检查——混拼是常见坑。

Q20:老数据还能用新参考基因组吗?
A:能——原始 reads 可跨参考重比对(GRCh37→38→T2T);这是 SRA 原始层存档的核心价值。

Q21:下载 10TB 数据成本多少?
A:AWS ODP 免 egress(NCBI 桶内);存储自付;自建桶跨区出口才收费——数据流图决定成本。

Q22:STAT 是什么?
A:NCBI 官方 k-mer 分类工具——每个 Run 的物种组成已内建于元数据;BigQuery 直接查,宏基因组预筛神器。

Q23:样本交换/标签错误怎么防?
A:没有全局防线——性别标记检查/亲缘一致性/表达谱聚类是常用手段;跨研究引用时保持怀疑。

Q24:能把自己的数据也提交 SRA 吗?
A:能——BioProject + BioSample 注册后提交;人类数据按 GDS/受控规则;提交是期刊流程一部分。

Q25:数据会下线吗?
A:INSDC 档案承诺长期保存——但个别记录可能因合规/撤回状态变更;重要分析自留本地副本。

Q26:重分析结果和原论文对不上怎么办?
A:先查三件套——参考基因组版本/比对软件/元数据理解;±2 倍内的量级差异常见;方向不一致需怀疑元数据或批次。

Q27:SRA Lite 会成为唯一格式吗?
A:官方趋势是 Lite 默认——但 Original 数据保留在云上可取;「默认轻量、按需全量」是长期格局。

Q28:怎么测「我的分析数据是否已有人发过」?
A:Pebblescout/MetaGraph k-mer 搜索——秒级查询公开库;序列撞车检测的官方姿势。

Q29:如何引用 SRA 本身?
A:Leinonen et al. NAR 2011(DOI 10.1093/nar/gkq1019)+ 具体 accession;数据可用性声明写清单与日期。

Q30:和 EGA/dbGaP 的关系?
A:dbGaP 是美国受控档案(SRA 受控层的授权语境);EGA 是欧洲受控档案——人类敏感数据的受控双通道。

Q31:单细胞数据在 SRA 里怎么找?
A:library_strategy=RNA-Seq + 单细胞关键词/平台字段——但图谱级整理用 HCA/eq + 单细胞关键词/平台字段——但图谱级整理用 HCA/CellxGene 更高效(原始数据仍落 SRA)。

**Q32:SRA 的 更高效(原始数据仍落 SRA)。

Q32:SRA 的未来方向?
A:官方路线(文档化口径)——格式轻量化(Lite)、派生层扩展(counts/STAT)、新平台接入(Element/Ultima)、云体验优化;第三方索引生态(Logan/MetaGraph)分担挖矿负载。

Q33:受控数据占到三分之一,公共层够用吗?
A:按需——重分析/宏基因组/方法开发公共层绰绰有余;表型驱动的人类疾病研究才需要 dbGaP 受控层。

Q34:批量下载被限流了怎么办?
A:三路分流——AWS ODP(免账号直取桶)、ENA API(欧洲入口)、降低并发 + 重试间隔;官方 API 政策要求标识与限速。

Q35:怎么判断一个 study 的数据质量底线?
A:先看 STAT 分类是否符合预期物种、再抽 3-5 个 Run 跑 FastQC、再看提交者机构的元数据完整性——三步 30 分钟定性。

Q36:临床测序数据在 SRA 里多吗?
A:少于科研测序——deposit 政策的学科覆盖差异 + 临床隐私约束;临床队列优先看 dbGaP/EGA/All of Us/TCGA 类结构化资源。

§10.5 要点回顾

  1. 档案非数据集:accession 级按需取数——47 PB 永不全量落地。
  2. 三节点一库:INSDC 镜像——引用统一 accession。
  3. 格式三态:Original/Normalized/Lite——BQS 有无决定 QC 语义,方法论文必须声明。
  4. 元数据再工程先行:自由文本是最大噪声源——R1→R3 消融的教训。
  5. SQL 先于下载:BigQuery/Athena/STAT 预筛——「先查后取」省一个数量级预算。
  6. SRP 切分防泄漏:Run 级随机切是 benchmark 泄漏。
  7. egress 路径决定成本:官方桶免费、自建桶出口收费——数据流图先行。
  8. 受控边界核查:dbGaP 三分之一——公共/受控混引逐条授权。
  9. 分层口径纪律:STAT 分类是环境信号不是临床诊断——G/S/M 三层按层问责。
  10. accession 是血缘主键:清单 + 检索日期 + 格式声明——复现包三件套。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 31,000,000 公共 SRA 文件 / >47 PB(单副本)/ SRA Lite 默认化 / STAT 掩码 opt-in / Element+Ultima 支持 / GCP NEARLINE us-east-1 = Database resources of the NCBI in 2025(NAR 53:D1,2025)与 NCBI SRA 云文档

  • 11.5 PB 公共 + 4.9 PB dbGaP(2022 时点)/ 70 万+ SARS-CoV-2 样本 = Database resources of the NCBI in 2022(NAR 2022)
  • 16.5 PB normalized / 14.5M records / 受控 31% / 2020 下载 >48 PB / 2025 预测 32.5+57.5 PB = NIH Council of Councils SRA Data Working Group 报告(2021)
  • INSDC 三节点 534,254 studies / 66,912.1 petabase-pairs(2025-01-11)/ 全库索引估 ~172-223 TB = MetaGraph,Nature(2025),DOI 10.1038/s41586-025-09603-w
  • 38 million 公共测序文库 / Logan 27M 库组装 / Serratus 5.7M 集 10.2 Pbp → 13 万+ 新 RNA 病毒 / PV +34%(383 新型跨 105 宿主)= eLife reviewed preprint(2025)及其引文

  • SRA 层级(SRP/SRS/SRX/SRR)/ INSDC 三节点互镜像 / FASTQ-BAM-CRAM 边界(不收组装与变异)= Leinonen NAR 2011 与 CASRAI 术语条目(2026-09 更新)
  • RNA-seq gene feature counts(人类/小鼠 bulk;日更 TSV)= AWS Open Data 注册表(ncbi-sra-rnaseq)与 NCBI 官方文档
  • 对象模型细节(prefetch 断点续传/–split-3 语义/Run Selector)= SRA Toolkit GitHub wiki 与 NCBI 官方手册(2026-09 检索)
  • 第三方工具语义(Pebblescout 3.7 Pbp / STAT 27.9 Pbp @2021 / MetaSRA schema)= 各工具论文与 NCBI Insights(2023-2024 增强公告)

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • impc — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • alphamissense — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • ckb — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • uk-biobank — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • all-of-us — 共享标签:基因组学与多组学 / 公共卫生与流行病学
  • gnomad — 共享标签:基因组学与多组学 / 测序数据
  • uniprot — 共享标签:基因组学与多组学 / 测序数据
  • 1000-genomes — 共享标签:基因组学与多组学 / 测序数据
  • encode — 共享标签:基因组学与多组学 / 测序数据
  • geo — 共享标签:基因组学与多组学 / 测序数据

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集