信息速览
ClinicalTrials.gov — 临床试验注册与结果数据库 AI-Ready Wikipedia
INFOBOX
| 数据集名称 | ClinicalTrials.gov(临床试验注册与结果数据库) |
| 英文全称 | ClinicalTrials.gov Registry and Results Database of Human Clinical Studies |
| 别名/简称 | ClinicalTrials.gov、CT.gov、NCT Registry、AACT(Aggregate Analysis of ClinicalTrials.gov,CTTI 关系型镜像) |
| 领域定位 | 临床试验注册、结果公开与研究透明度基础设施;面向分析的全量结构化数据出口 |
| 数据模态 | 结构化注册条目(约 40 个数据模块)+ 方案/合格标准自由文本 + 结果摘要(结局度量、分组统计、不良事件)+ 协议版本历史 |
| AI 任务类型 | 试验文本挖掘与实体/关系抽取、结局切换与一致性检测、发表偏倚与合规审计、患者-试验匹配、试验设计与数字孪生建模、赞助商行为分析 |
| 样本总数 | 601,897 项注册研究(2026-09-08 快照):介入性 459,380(76%)/ 观察性 140,464(23%)/ 扩展获取 1,067 |
| 结果数据 | 80,028 项研究已发布结果;介入性研究中 75,321 项(94%)含结果 |
| 数据大小 | 官方全量导出(CSV/JSON)压缩后约 20 GB 量级;AACT PostgreSQL 全库约 100-200 GB(随快照浮动) |
| 数据格式 | API v2(JSON)/ CSV / XML 批量导出;AACT 提供 PostgreSQL 转储与云端只读实例 |
| 许可证 | 美国政府作品公共领域(17 U.S.C. §105);站点条款禁止暗示 NIH/NLM 背书 |
| 访问级别 | 开放(无需申请即可获取 API 与批量导出;AACT 需注册免费账号) |
| 语言 | 以英文为主(部分来自 226 个国家/地区的注册信息含本地语言地点与人名) |
| 首发日期 | 2000-02-29(网站上线;1997 年 FDAMA 113 立法授权) |
| 最后更新 | 每日滚动更新(AACT 同步每日刷新);本 Wiki 数字口径 2026-09-08 官方快照 |
| 发布机构 | 美国国家医学图书馆(NLM,NIH 下属)托管,与美国食品药品监督管理局(FDA)协作;AACT 由 CTTI(Duke + FDA 公私合作)维护 |
| 官方主页 | https://clinicaltrials.gov/ ;数据 API:https://clinicaltrials.gov/data-api/api ;AACT:https://aact.ctti-clinicaltrials.org/ |
§0 E-E-A-T 信任声明与免责声明
- 经验(Experience):本文基于 ClinicalTrials.gov 官方 Trends & Charts(2026-09-08 快照)、官方数据 API 文档、CTTI AACT 官方站与数据字典、以及 JAMA/NEJM 已发表注册库研究撰写,全部关键数字均标注口径与快照日期。
- 专业性(Expertise):内容覆盖注册制度(FDAAA 801、ICMJE 政策)、数据工程(API v2、AACT 表结构)与 AI 就绪实践(文本挖掘、合规审计、患者匹配)三个层面。
- 权威性(Authoritativeness):ClinicalTrials.gov 由美国国家医学图书馆(NLM)托管,是全球被期刊政策、监管法规与出版伦理引用最多的临床试验注册库。
- 可信度(Trustworthiness):本文不提供任何个体患者的诊疗建议;所有合规结论(如结果缺失比例)均注明数据来源为官方快照或第三方全量分析,并说明其统计口径差异。
- 免责声明:ClinicalTrials.gov 注册内容为赞助方与研究者自报,NLM 不对单条记录做临床有效性核验。本文对数据的 AI 用法描述不构成法律或监管意见。
- 数字口径说明:本文规模数字统一采用官方 Trends & Charts 2026-09-08 快照;个别赞助结构比例引自第三方(PharmaDossier)2026-06-10 全量分析,均已显式标注。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:全球最大的人类临床试验注册与结果数据库,601,897 项研究,226 个国家与地区,NLM 托管。
- 为什么重要:它是系统综述中对抗发表偏倚的「注册分母」,也是 ICMJE 期刊政策与 FDAAA 法规的事实基础设施。
- AI 价值:结构化 40 模块字段 + 大规模自由文本(方案、合格标准、结局度量)+ 版本化历史,可同时支撑 NLP、表格学习与合规审计。
- 获取方式:官方 API v2(JSON)/ CSV / XML 全量导出;CTTI 的 AACT PostgreSQL(40+ 表)每日刷新。
- 成本:公共领域,免费;AACT 需注册免费账号。
- 一句话:想研究「临床试验这项全球活动本身」,这是唯一绕不开的数据源。
§1.1 摘要
ClinicalTrials.gov 于 2000 年 2 月 29 日上线,由美国国家医学图书馆(NLM,National Library of Medicine)托管,与美国食品药品监督管理局(FDA)协作运营,是全球规模最大、引用最广的人类临床试验注册与结果数据库。截至 2026 年 9 月 8 日的官方快照,注册库收录 601,897 项研究:介入性研究(Interventional)459,380 项占 76%,观察性研究(Observational)140,464 项占 23%,扩展获取项目(Expanded Access)1,067 项。其中 80,028 项已发布结果,在要求提交结果的介入性研究中,94%(75,321 项)已按规则公开结果数据。
从 AI 数据集视角看,ClinicalTrials.gov 提供三类互相耦合的信息资产。其一是结构化字段层:每项研究以 NCT 编号(如 NCT04280705)为唯一键,含研究设计、分期、状态、合格标准、干预类型、主要/次要结局、赞助方与地点等约 40 个数据模块。其二是自由文本层:方案摘要、详细描述、合格标准的纳入/排除准则、结局度量的文本描述,构成大规模临床研究文本语料,直接支撑实体识别、结局一致性检测与患者-试验匹配等任务。其三是时间与版本层:注册库保留每条记录的协议修订历史(含时间戳),使结局切换(outcome switching)检测、方案复杂度演化等纵向研究成为可能。
数据获取有三条主路径。官方 API v2 提供 RESTful JSON 接口,支持按病种、干预、赞助方、状态、分期与日期范围查询,cursor 分页与字段裁剪降低传输成本;批量导出提供全量 CSV 与 JSON 文件,适合离线重建镜像;AACT 数据库由临床试验转型倡议(CTTI,Duke 与 FDA 共同创立的公私合作组织)维护,将注册库每日全量转换为 40+ 张关联表的 PostgreSQL 数据库,并提供云端只读实例与全量快照下载,是学术级 SQL 分析的事实标准。三类通道均为免费开放,数据本身为美国政府作品(公共领域)。
在制度层面,ClinicalTrials.gov 是三层合规体系的交汇点:FDAAA 801 条款与 2016 Final Rule(2017-01-18 生效)要求「适用临床试验」在 21 天内注册、在完成后 12 个月内提交结果;ICMJE 自 2005 年起要求会员期刊以注册为发表前提;AllTrials 等公民运动与学术界持续以注册库为分母审计发表偏倚与结果缺失。对 AI 研究者而言,这意味着该数据集不仅支持「研究什么」,也天然支持「谁在按规则研究」这一元科学问题。
§1.2 战略价值
- 对抗发表偏倚的分母:NEJM 2008 年抗抑郁药研究(Turner 等)显示 FDA 登记 74 项试验中 38 项阳性结果几乎全部发表,而阴性/存疑 36 项仅 14 项发表——注册库提供「已启动但未发表」的完整分母,是证据合成与元研究(meta-research)不可替代的基础。
- 监管与政策研究的基础设施:结果提交合规率、延迟公开器械试验(986 项 FDAAA 延迟提交)、赞助商行为画像等政策问题,均以该库全量数据为证据源。
- 患者招募与精准匹配:64,499 项正在招募的研究(2026-09-08)与全量合格标准文本,是检索型 LLM 与患者-试验匹配系统的核心语料;API v2 的结构化状态字段可直接过滤可行动子集。
- 试验设计与数字孪生:方案复杂度量化(终点数、设盲、分层、国家数)、入组周期与终止原因分布(第三方分析:终止试验 43% 源于入组失败)为试验模拟与成本建模提供先验。
- 知识图谱节点:与 UMLS/SNOMED CT/LOINC 的概念体系互链,可将「药物-病种-结局-赞助方-地点」构建为可推理的多关系图,是生物医药大模型检索增强(RAG)的骨干数据源之一。
§1.3 同类数据集横向对比
| 数据源 | 运营方 | 规模 | 结果数据 | 获取方式 | 相对优势 |
|---|---|---|---|---|---|
| ClinicalTrials.gov | 美国 NLM/NIH | 601,897 项 | 80,028 项已发布 | API v2 / CSV / XML / AACT SQL | 全球最大、结果数据最全、公共领域 |
| EU Clinical Trials Register / CTIS | 欧洲药品管理局 EMA | EU/EEA 注册试验为主 | 逐步并入 CTIS | 网页/下载 | 欧盟法规域完整覆盖 |
| ISRCTN | BMC/Springer Nature(英国) | 数万项 | 部分 | 网页/API | 国际注册(含非药物干预) |
| ChiCTR | 中国(成都) | 数万项 | 部分 | 网页 | 中文试验注册主力 |
| jRCT | 日本 | 数万项 | 部分 | 网页 | 日本法规域 |
| WHO ICTRP | 世界卫生组织 | 汇聚各注册库 | 索引级 | 搜索门户 | 全球统一检索入口(不含结果详情) |
| FDA FAERS | 美国 FDA | 不良事件报告 | N/A | ERS | 美国 FDA |
与本文互链 API | 药物警戒(与注册库互补) |
与本文互链的站内条目: 药物警戒(与注册库互补) |
与本文互链的站内条目:eicu-crd、mimic-iii、mimic-iv、umls、snome、库互补) |
与本文互链的站内条目:eicu-crd、mimic-iii、mimic-iv、umls、snomed-ct、loinc、mimic-iv、umls、snomed-ct、loinc、mimic-iv、umls、snomed-ct、loinc、gwas-catalog、open-targets、faers、drugbank、c、、snomed-ct、loinc、gwas-catalog、open-targets、faers、drugbank、chembl、pubmedq、faers、drugbank、chembl、pubmedqa、medqa、gmai-mmbench、radgraph。
§1.4 版本时间轴
| 时间 | 事件 |
|---|---|
| 1997 | 美国国会通过 FDAMA 113 条款,授权设立临床试验注册库 |
| 2000-02-29 | ClinicalTrials.gov 网站正式上线,首批约 5,000 项研究 |
| 2004-09 | ICMJE 宣布:2005-07-01 之后启动的试验须先注册方可投稿会员期刊 |
| 2007 | FDAAA 801 条款立法:适用临床试验强制注册与结果提交 |
| 2008 | 结果数据库(Clinical Results Database)上线 |
| 2010-2016 | CTTI 早期 AACT 数据库运行并提供历史抽取(2017 年前为旧版本) |
| 2012 | CTTI AACT 数据库启动(现版本前身) |
| 2016-09 | 2016 Final Rule 颁布(FDAAA 801 执行细则) |
| 2017-01-18 | Final Rule 生效:21 天注册时限 + 12 个月结果时限;AACT 同年升级为当前 40+ 表架构 |
| 2023 | API v2 与站点现代化改造(取代 v1),JSON-LD 与 OpenAPI 规范公开 |
| 2024-2025 | CTIS 并行整合欧盟域试验;注册量突破 55 万 |
| 2026-09-08 | 官方快照:601,897 项研究,本文规模数字口径 |
§1.5 典型应用场景
- 系统综述的注册分母:Cochrane 综述与荟萃分析流程中,检索注册库确认「已注册未发表」试验,量化发表偏倚。
- 结局切换审计:将注册的主要结局与发表论文的结局逐项比对(COMPare 项目方法论),自动检测增益性改写。
- 合规监测与记者调查:统计完成试验的结果缺失率(第三方分析:完成 Phase 3 约 58% 无结果),生成赞助商合规画像。
- 患者-试验匹配:以合格标准文本 + 结构化状态字段构建检索/排序系统,如美国 All of Us 研究项目的自动招募试点。
- 试验文本挖掘基准数据:实体(干预、病种、机构)与关系(干预-结局)抽取;合格标准的结构化解析(PICO 抽取)。
- 政策与经济分析:注册量、分期分布、赞助结构随时间演化;试验成本与复杂度建模。
- 大模型评测与 RAG:以 NCT 编号键控的方案-结果对,可作为医疗 LLM 长文档理解与证据引用的评测语料。
§1.6 数据出口全景
| 出口 | 运营方 | 形态 | 更新 | 适用人群 | 门槛 |
|---|---|---|---|---|---|
| 网页检索 | NLM | 交互式搜索/专家检索 | 每日 | 患者、研究者 | 无 |
| API v2(studies) | NLM | RESTful JSON | 每日 | 工程师 | 无(API key 提额) |
| API v2(stats/version) | NLM | 统计与版本端点 | 每日 | 数据监控 | 无 |
| CSV 批量导出 | NLM | 单表宽文件 | 每日 | pandas 用户 | 无 |
| JSON/XML 批量导出 | NLM | 嵌套文档集 | 每日 | 镜像/管道 | 无 |
| JSON-LD 站点输出 | NLM | 结构化元数据 | 每日 | SEO/知识图谱 | 无 |
| AACT 云只读 | CTTI | PostgreSQL | 每日 | SQL 分析师 | 免费账号 |
| AACT 快照下载 | CTTI | PG dump | 每日/历史 | 本地复现 | 免费账号 |
| AACT 历史存档 | CTTI | dump(2010-2016 起) | 静态 | 纵向研究 | 免费账号 |
| AACT GitHub ETL | CTTI | 开源转换代码 | 随仓库 | 数据工程 | 无 |
§1.7 与法规时间线的耦合
- 数据密度随法规跃迁:2005(ICMJE 政策)与 2017(Final Rule 生效)是注册量与结果数据的两次阶跃。
- 以 2005-07-01 为界的注册完整性显著不同——跨时代分析必须把该日期作为哑变量或分层因子。
- 2017 年后「适用临床试验」的结果缺失才具有合规含义;此前的结果空缺属制度空白而非违规。
- AI 侧启示:任何以「年份」为特征的时间序列模型,应在 2005 与 2017 两处检验结构断点(Chow test 或分段回归)。
§1.8 增长动力与全球格局
四类增长动力
| 动力 | 机制 | 数据可见效应 |
|---|---|---|
| 法规强制 | FDAAA 801 / ICMJE 政策 | 注册量在 2005 与 2017 两次阶跃 |
| 平台化 | API v2 + 站点现代化(2023) | 第三方应用与监测工具激增 |
| 全球化 | 非美地点占比 58% | 多中心跨国试验成为常态 |
| 结果透明运动 | AllTrials / COMPare / 媒体审计 | 结果发布从 4 万级增长至 8 万级 |
全球格局要点
- 美国本土:28% 研究仅在美国实施;FDA 法规域的结构化质量最高。
- 欧盟域:CTIS 并行运行后,欧盟试验呈双注册格局。
- 亚太:中国、日本、韩国注册量持续上升,ChiCTR/jRCT 与 NCT 互补。
- 拉美/非洲:以观察性与疫苗/传染病试验为主,结果发布率偏低(合规研究热点区)。
对 AI 采样的建议
- 横断面统计:直接用全量快照,权重按研究而非按国别。
- 文本建模:按赞助类别分层采样,行业(22.1%)文本模板化程度高,需要足量学术样本平衡。
- 招募类应用:以 RECRUITING(64,499)为动作集,其余状态只用于历史分析。
§2 临床研究背景
§2.1 研究类型与分期体系
ClinicalTrials.gov 的「研究类型-分期」分类是其结构化检索的第一维度,也是 AI 任务标签体系的基础:
| 研究类型 | 数量(2026-09-08) | 占比 | 说明 |
|---|---|---|---|
| 介入性(Interventional) | 459,380 | 76% | 按方案将参与者分配至干预/对照 |
| 观察性(Observational) | 140,464 | 23% | 无干预分配,随访健康结局 |
| 扩展获取(Expanded Access) | 1,067 | <0.2% | 严重疾病患者在试验外获取未批准疗法 |
介入性研究的分期体系(Phase):
| 分期 | 含义 | 典型入组规模 | 注册库常见标签 |
|---|---|---|---|
| 早期 Phase 1 | 首次人体探索(微剂量/机制验证) | 10-30 | EARLY_PHASE1 |
| Phase 1 | 安全性与耐受性、药代动力学 | 20-100 | PHASE1 |
| Phase 2 | 初步疗效与剂量探索 | 100-300 | PHASE2 / PHASE1, PHASE2 |
| Phase 3 | 确证性疗效与安全性 | 300-30,000 | PHASE3 / PHASE2, PHASE3 |
| Phase 4 | 上市后监测与真实世界验证 | 不限 | PHASE4 |
| N/A | 多数观察性研究不适用分期 | 不限 | N/A |
干预类型分布(一项研究可含多类,故求和大于介入总数):
| 干预类型 | 注册数量 | 已发布结果数量 |
|---|---|---|
| 药物/生物制剂 | 221,455 | 53,140 |
| 行为干预等 | 180,388 | 19,197 |
| 器械 | 63,813 | 11,485 |
| 手术操作 | 48,979 | 3,842 |
| 介入性合计 | 459,380 | 75,321 |
| 观察性 | 140,464 | 4,707 |
| 总计 | 601,897 | 80,028 |
注意:986 项含未获批器械的「适用临床试验」依据 FDAAA 以「延迟公开」(Delayed Posting)状态提交,不计入上表器械行。
§2.1b 术语体系映射
注册库本身不强制使用统一临床术语,但结构化字段与术语体系的映射是 NLP 任务的关键前置:
- 病种(Conditions):注册方自由填写;文献级映射通常通过 UMLS Metathesaurus 将病种字符串对齐到 CUI,再经 SNOMED CT/ICD-11 完成编码归一。站内条目 umls 与 snomed-ct 详细讨论了该映射链。
- 干预(Interventions):药物类条目常以通用名填写;与 RxNorm、DrugBank、ChEMBL 的对齐可构建「试验-分子」连接。
- 结局度量(Outcome Measures):时间框架、单位与参数(Measure/Time Frame/Description)三段式字段;与 LOINC 语义对齐在实验室结局上效果最好。
- 机构(Facilities/Sponsors):地点字符串含本地语言;ROR(Research Organization Registry)与 GRID 是机构消歧的常用外部键。
§2.2 注册制度与法规背景
- 为什么必须注册:1990 年代末的发表偏倚证据(如抗抑郁药选择性发表)表明,仅依赖文献会系统性高估疗效。注册库提供「已启动试验」的先验完整清单,使阴性结果不再可以无声消失。
- FDAAA 801 与 Final Rule:2007 年立法、2016-09 颁布细则、2017-01-18 生效。「适用临床试验」(Applicable Clinical Trials,含 FDA 监管的药物/生物/器械 II-IV 期与受 NIH 资助的对照研究)须在首例入组后 21 天内注册,主完成日后 12 个月内提交结果;违规可民事罚款(器械与药物最高每日数万美元)并扣减 NIH 资助。
- ICMJE 政策:2005-07-01 后启动的试验,投稿 ICMJE 会员期刊必须提供注册号——这是注册率在 2005 年后跃升的直接推手。
- 执行落差:NIH 以扣款机制执行 Final Rule 的案例很少;学术界与媒体(AllTrials、COMPare、STAT News)以公开合规统计形成声誉压力。第三方全量分析显示完成 Phase 3 试验约 58% 未发布结果——注册制度解决「注册」,结果报告仍是全球性缺口。
§2.3 AI 任务定义
| 任务 | 输入 | 输出 | 评测思路 |
|---|---|---|---|
| 患者-试验匹配 | 患者摘要 + 试验合格标准 | 匹配分数/资格判定 | 以人工标注资格判定集评测(如外部公开基准) |
| 结局切换检测 | 注册结局 vs 论文结局 | 一致/增益性改写/降级 | 人工复核抽样 + 规则基线 |
| 合格标准解析 | 纳入/排除文本 | 结构化 PICO/年龄/性别/疾病码 | 实体级 F1(疾病、药物、数值阈值) |
| 赞助商合规画像 | 历史注册与结果时间线 | 每赞助商结果缺失率/延迟天数 | 与官方延迟字段交叉验证 |
| 试验结果预测 | 方案文本 + 设计字段 | 成功/终止/入组失败概率 | 时间切分防泄漏(见 §5.3) |
| 方案复杂度量化 | 设计字段(终点数/设盲/国家数) | 复杂度指数 | 与入组周期相关性校验 |
§2.4 覆盖人群
- 地理覆盖:研究地点分布 226 个国家与地区、全美 50 州;2026-09 快照中仅美国 28%、仅非美 58%、跨美/非美 4%、未提供 10%——非美注册已占绝对多数,但结果数据以美资/欧盟法规域为主。
- 病种覆盖:条件字段为自由文本,病种长尾极长;高频病种(乳腺癌、前列腺癌、卒中、心衰、糖尿病视网膜病变等)均达数千至数万项。
- 人群局限:老年(>75 岁)、肾损伤、孕妇在合格标准中长期被排除的比例偏高,以注册库训练匹配模型时需注意样本偏移(详见 §6.5 坑点 6)。
§2.5 临床与研究价值
- 对患者:提供官方统一的「正在招募什么研究」入口;每月 320 万独立访客的检索流量意味着它是全球患者寻找临床试验的第一触点。
- 对研究者:系统综述的必备检索源;方案与结果的版本历史支持方法学研究(方案修订频率与结果选择的关系)。
- 对监管与支付方:结果提交合规统计是法规迭代(如欧盟 CTIS、中国注册制度)的证据基础。
- 对 AI 团队:文本+结构化+版本的复合形态使其成为医疗 NLP 少数可直接对齐真实工作流(合规审计、招募匹配)的数据集。
§2.6 金标准与参考实现
-
金标准定位:注册库本身即为「试验注册事实」的金标准(NCT 编号全球唯一);结果数据则以 FDA 监管提交为最强约束。
-
参考实现:CTTI AACT 的 ETL(GitHub 开源)是 XML→关系表的参考转换;NLM 官方 API 文档与 OpenAPI 规范是字段语义的权威定义。
-
学术基线:Califf 等(JAMA 2012)与 Zarin 等(NEJM 2017)提供了注册库全景特征的经典口径;结局切换检测的 COMPare 方法论是审计类任务的经典流程。
-
学术基线:Califf 等(JAMA 2012)与 Zarin 等(NEJM 2017)提供了注册库全景特征的经典口径;结局切换检测的 COMPare 方法论是审计类任务的经典流程。
§2.7 结局切换与发表偏倚:两个经典案例
案例 A:抗抑郁药选择性发表(NEJM 2008,Turner 等)
- 样本:向 FDA 提交的 74 项抗抑郁药随机对照试验。
- 发现:38 项阳性结果中 37 项发表(97%);36 项阴性/存疑结果中仅 14 项以「阴性」面目发表,22 项干脆未发表;3 项阴性结果被改写为阳性发表。
- 净效果:文献中该类药物「有效」比例 94%,FDA 完整数据口径仅 51%。
- AI 启示:以注册库为主要结局为基准,与 PubMed 发表比对,可自动化该审计——这正是「结局切换检测」任务的商业与科学价值。
案例 B:COMPare 项目(牛津 CEBM,2015-2016)
- 方法:连续追踪三大顶级医学期刊的 67 项试验,逐项比对注册结局与发表结局。
- 发现:68% 的试验存在结局切换;58% 的试验在论文中未如实报告预先注册的全部主要结局。
- AI 启示:COMPare 的编码本(结局一致/增益/降级/未报告)可直接作为标注规范,构建小型人工金标集。
发表偏倚的量化口径(供表格建模参考):
| 口径 | 定义 | 全库规模 | 数据来源 |
|---|---|---|---|
| 已发布结果 | results_posted = true | 80,028 | 官方快照 |
| 适用试验已发布率 | 适用临床试验中 results_posted | 94%(介入性) | 官方 |
| 完成 Phase 3 无结果 | COMPLETED × PHASE3 × 未发布 | 约 58% | 第三方 2026-06 全量 |
| 注册延迟 | start_date - 注册提交日 > 21 天 | 可计算 | AACT |
| 结果延迟 | 主完成日 + 12 个月后仍未发布 | 可计算 | AACT |
§2.8 注册字段与临床概念的对应练习
以一项假设的「多发性骨髓瘤 CAR-T 疗法 Phase 3 试验」为例演示字段到临床概念的映射:
| 注册字段 | 填报内容示例 | 临床概念 | 标准术语出口 |
|---|---|---|---|
| conditions | Multiple Myeloma | 多发性骨髓瘤 | ICD-11 2A30;SNOMED 109989006 |
| interventions | Ciltacabtagene Autoleucel | BCMA 靶向 CAR-T | RxNorm 数字码;ChEMBL 分子页 |
| phase | PHASE3 | 确证性研究 | 法规强制结果提交范围 |
| design_allocation | RANDOMIZED | 随机化 | Cochrane 偏倚风险工具输入 |
| design_masking | OPEN_LABEL | 开放标签 | 方案复杂度分析输入 |
| primary_outcome | 总生存期 OS 至 48 个月 | 生存终点 | LOINC 无直接码(需自定义映射) |
| enrollment | 419 | 意向治疗样本 | 统计功效回溯输入 |
| overall_status | COMPLETED | 主完成 | 12 个月结果合规观察开始 |
| results_posted | true | 结果已公开 | 合规闭环 |
- 该映射练习可直接改造为模型评测的「字段-概念」对齐测试集。
- 生存类终点在 LOINC 无直接编码的缺口(见上表)是结局标准化研究的已知难题,值得单独立项。
§3 数据集规格
§3.0 版本抉择矩阵
| 使用目标 | 推荐通道 | 理由 |
|---|---|---|
| 单项/少量研究查询 | API v2 | cursor 分页 + 字段裁剪,轻量 |
| 大规模 NLP 语料构建 | 官方 JSON 全量导出 | 保留完整嵌套结构,字段无裁剪 |
| SQL 级横断面分析 | AACT 云只读 PostgreSQL | 40+ 表可直接 JOIN,免解析 |
| 历史演化/纵向研究 | AACT 历史快照(2010-2016 + 近年存档) | 固定快照可复现 |
| 快速原型/教学 | CSV 批量导出 | 表格直接进 pandas |
| 患者招募系统 | API v2 + fields 裁剪 | 只拉状态与合格标准相关字段 |
§3.1 模态详情
| 数据层 | 内容 | 典型字段 | AI 可用形态 |
|---|---|---|---|
| 结构化注册层 | 研究设计、分期、状态、条件、干预、赞助方、地点 | nct_id / study_type / phase / overall_status / conditions / interventions | 表格学习标签与特征 |
| 自由文本层 | 简要标题、方案摘要、详细描述、合格标准(纳入/排除) | brief_title / brief_summary / description / eligibility_criteria | NLP 语料(PICO 抽取、NER、匹配) |
| 结局层 | 主要/次要结局度量、时间框架、统计 | outcome_measures / primary_outcome / secondary_outcome | 结局一致性、文本-数值混合抽取 |
| 结果层 | 分组统计、结局分析、不良事件 | results_section / reported_event_totals / result_groups | 表格学习、安全信号研究 |
| 版本层 | 协议修订历史(含时间戳) | protocol_section history / record verification month | 结局切换检测、纵向建模 |
§3.2 按子集样本数
| 子集 | 数量 | 占比 | AI 侧说明 |
|---|---|---|---|
| 全部注册研究 | 601,897 | 100% | 2026-09-08 快照 |
| 介入性 | 459,380 | 76% | 主力分析对象 |
| 观察性 | 140,464 | 23% | 队列/注册研究语料 |
| 扩展获取 | 1,067 | 0.2% | 特殊疗法可及性 |
| 已发布结果 | 80,028 | 13.3% | 结果层数据源 |
| 招募中 | 64,499 | 10.7% | 患者匹配可行动子集 |
| FDAAA 延迟提交器械 | 986 | 0.2% | 合规研究特例 |
§3.3 格式对照
| 通道 | 格式 | 结构 | 适用 | 注意 |
|---|---|---|---|---|
| API v2 | JSON | 嵌套模块(protocol/results) | 在线查询、增量同步 | cursor 分页;fields 裁剪;API key 提高限额 |
| 批量导出 | CSV | 每研究一行(多值列内分隔) | pandas 原型 | 多值字段解析需自定义分隔规则 |
| 批量导出 | JSON/XML | 全量嵌套 | 镜像重建 | 压缩后约 20 GB 量级 |
| AACT 云 | PostgreSQL | 40+ 关联表 | SQL 分析、荟萃统计 | 需注册账号;只读 |
| AACT 快照 | PostgreSQL dump | 全库 | 本地复现 | 与官方文件快照日期不同步 |
| AACT 历史 | dump 存档 | 2010-2016 + 近年 | 纵向研究 | schema 与现行版本有差异 |
§3.4 存储大小
| 项目 | 量级 | 说明 |
|---|---|---|
| 官方 CSV/JSON 全量导出 | 约 20 GB(压缩) | 随快照浮动;解压后 3-6 倍 |
| AACT PostgreSQL 全库 | 100-200 GB | 含索引与结果层大表 |
| AACT design_outcomes 表 | 3,716,648 行 | 2026-08-01 快照口径 |
| AACT design_groups 表 | 1,097,076 行 | 同上 |
| AACT countries 表 | 808,912 行(含 35,778 已移除) | 同上 |
| 官方研究文件(2026-07-25) | 595,630 条唯一 NCT | 与 8 月 AACT 存在滚动差 |
§3.5 标注方式
- 注册库无「人工标注」语义——所有字段由注册责任方(sponsor 或 investigator)按 ICH E6 与 Final Rule 要求填报;NLM 做格式校验与受控词表(状态、分期、干预类型)约束。
- 结果层数据(分组统计、不良事件)由赞助方按规则提交,格式受控但内容自报。
- 对 AI 而言,「标注质量」等价于「填报质量」:结构化字段一致性高,自由文本字段噪声大(详见 §6.5 坑点)。
- 若任务需要人工金标注(如资格判定),常用外部资源:人工构建的患者-试验匹配基准与 PICO 解析标注集(见 §7.3)。
§3.6 标注者资质与一致性
- 填报主体:制药/器械企业的临床运营团队(行业 22.1% 注册量)与学术/医院的试验协调员(71.4%)。
- 结果提交受 FDA 电子提交规范约束,行业试验的结果层完整度显著高于部分学术试验。
- 无跨注册方的一致性检验机制;NLM 仅校验格式合法性。研究显示结局度量文本表达高度异构(同一量表可有数十种写法)。
§3.7 采集周期
- 注册动作:研究启动前(法定 21 天内)创建;持续修订。
- 结果动作:主完成日后 12 个月内提交;结果发布后仍可勘误修订。
- 数据出口:官方每日滚动更新;AACT 每日全量刷新(自 2012 年持续至今)。
§3.8 地域覆盖
| 区域 | 注册研究地点占比(2026-09-08) | 说明 |
|---|---|---|
| 仅美国 | 28%(168,993) | FDA 法规域 |
| 仅非美 | 58%(346,258) | EU CTIS、中日韩、拉美等 |
| 美国与非美兼有 | 4%(26,119) | 多中心全球试验 |
| 未提供 | 10%(60,527) | 数据质量缺口 |
| 覆盖面 | 226 个国家与地区、全美 50 州 | 招募中研究 64,499 项 |
§3.9 设备规格
- 注册库不含原始临床影像/生理数据;「设备」维度指被试验的医疗器械(63,813 项含器械干预)。
- 器械类试验的延迟公开规则(986 项)构成合规研究的天然对照组。
- 若需与原始影像/生理数据联动,应经 NCT 编号与站内影像类条目(如 pi-cai、prostatex、ct-rate)的关联文献桥接。
§3.10 深度溯源链
| 层级 | 实体 | 溯源要点 |
|---|---|---|
| L0 | 法规授权 | FDAMA 113(1997)→ FDAAA 801(2007)→ 2016 Final Rule(2017 生效) |
| L1 | 运营机构 | NLM(NIH)托管;FDA 协作;ICMJE 期刊政策外压 |
| L2 | 填报方 | 注册责任方(sponsor/PI)自报;格式受控 |
| L3 | 数据出口 | API v2 / CSV / XML(官方);AACT(CTTI,Duke+FDA) |
| L4 | 本文口径 | 官方 Trends & Charts 2026-09-08;第三方 2026-06-10 全量分析(显式标注) |
§3.11 AACT 主要表对照总表
| 表名 | 一行 = | 主键/外键 | AI 典型用途 |
|---|---|---|---|
| studies | 一项研究 | nct_id | 全景统计、标签源 |
| conditions | 研究-病种对 | nct_id + 下拉 | 病种聚合、UMLS 链接 |
| interventions | 研究-干预对 | nct_id + 下拉 | 药物映射、干预谱分析 |
| eligibilities | 研究资格块 | nct_id | 年龄/性别结构化、文本源 |
| sponsors | 研究-赞助方对 | nct_id + role | 合规画像(lead/collaborator) |
| facilities | 研究-地点对 | nct_id + 下拉 | 地理聚合、中心级分析 |
| countries | 研究-国家对 | nct_id + country | 808,912 行;跨国试验网络 |
| designs | 设计要素 | nct_id | 分配/盲法/目的 |
| design_groups | 设计分组 | nct_id + group | 1,097,076 行;分组结构 |
| design_outcomes | 结局度量声明 | nct_id + outcome | 3,716,648 行;结局切换基准 |
| outcome_analyses | 结局分析统计 | outcome 外键 | 结果层数值 |
| reported_event_totals | 不良事件汇总 | nct_id + 事件 | 安全信号初筛 |
| calculated_values | NLM 计算字段 | nct_id | 596,685 行;现成派生特征 |
| result_groups | 结果分组 | nct_id + group | 分组间统计比较 |
| central_contacts / result_contacts | 联系人 | nct_id | 招募联络信息 |
§3.12 与官方文件的实体关系差异
- 官方 JSON 是嵌套文档(每研究一个树),AACT 是关系分解(每树一张表)——语义等价但粒度不同:AACT 行数远大于 NCT 数是正常的(一对多展开)。
calculated_values是 NLM 官方派生字段(如受试者总数、地点数),在官方 JSON 中没有一一对应的原生字段——从 JSON 侧复现需自行计算。countries表含「已移除」记录(35,778 行)——AACT 保留删除痕迹,官方文件只含现状;纵向研究可用此差异检测地点变更。- 结果层的
outcome_analyses官方侧字段以 p 值/CI/统计方法自由文本为主,AACT 已拆分列——统计文本挖掘优先走 AACT。
§4 数据结构
§4.0 目录树
官方批量导出与 AACT 的组织方式如下(示意,具体文件名随快照日期浮动):
clinicaltrials-gov/
├── api-v2/ # 官方 RESTful API(在线)
│ ├── /api/v2/studies # 研究查询(cursor 分页)
│ ├── /api/v2/studies/meta # 字段元信息
│ ├── /api/v2/stats/size # 注册库统计
│ └── /api/v2/version # API 版本
├── bulk-export/ # 官方批量导出(CSV/JSON/XML)
│ ├── ClinicalTrials.csv # 全库单表宽表(多值列内部分隔)
│ ├── study_records/ # JSON:每研究一个嵌套文档
│ │ ├── NCT00000001.json
│ │ └── ...
│ └── jsonld-context/ # JSON-LD context(结构化站点输出)
└── aact/ # CTTI AACT(PostgreSQL,40+ 表)
├── core tables/
│ ├── studies # 每研究一行(NCT 主键)
│ ├── conditions # 研究病种(一对多)
│ ├── interventions # 干预(一对多)
│ ├── eligibilities # 合格标准(性别/年龄/文本)
│ ├── sponsors # 赞助方(lead/collaborator)
│ └── facilities # 地点(一对多,含国家/城市)
├── design tables/
│ ├── designs # 设计(分配/盲法/主要目的)
│ ├── design_groups # 分组(实验/对照/安慰剂)
│ ├── design_outcomes # 结局度量(3,716,648 行)
│ └── calculated_values # NLM 计算字段(596,685 行)
├── results tables/
│ ├── outcome_analyses # 结局分析统计
│ ├── reported_event_totals # 不良事件汇总
│ ├── result_groups # 结果分组
│ └── result_contacts # 结果联系方式
└── auxiliary/
├── countries # 国家(808,912 行)
├── central_contacts # 中央联系人
└── ... # 合计 40+ 表
§4.1 DAIMS 字段字典
| 字段 | 类型 | 语义 | AI 提示 |
|---|---|---|---|
| nct_id | Text | 研究唯一键(NCT00000001 格式) | 全局 JOIN 主键;版本历史按此键时间戳累积 |
| brief_title / official_title | Text | 简题/正式题名 | 标题 NLP 与实体识别入口 |
| brief_summary | Text | 方案摘要(注册方撰写) | 长文本;含营销性语言噪声 |
| study_type | Enum | 介入性/观察性/扩展获取 | 任务过滤首选字段 |
| phase | Enum | EARLY_PHASE1 至 PHASE4 / N/A | 可多值(如 PHASE1, PHASE2) |
| overall_status | Enum | RECRUITING / COMPLETED / TERMINATED / WITHDRAWN 等 | 状态机含 20+ 取值;招募筛选键 |
| start_date / primary_completion_date | Date | 启动/主完成日期 | 完成日期有「估计/实际」类型区分 |
| enrollment | Integer | 目标/实际入组人数 | enrollment_type 区分目标与实际 |
| eligibility_criteria | Text | 纳入/排除全文本 | PICO 抽取与患者匹配核心语料 |
| healthy_volunteers | Boolean | 是否招募健康志愿者 | 人群偏移分析字段 |
| conditions | Text(多值) | 病种(自由文本) | 需 UMLS/SNOMED 归一(见 §2.1b) |
| interventions | Text(多值) | 干预名称与类型 | 药物→RxNorm/DrugBank 桥接 |
| design_allocation / design_masking | Enum | 随机化/盲法描述 | 方案复杂度特征 |
| primary_outcome / secondary_outcome | Text(多值) | 结局度量(Measure+Time Frame+Description) | 结局切换检测基准字段 |
| results_posted | Boolean | 是否已发布结果 | 合规审计标签 |
| last_update_posted | Date | 最近更新时间 | 数据新鲜度控制 |
| lead_sponsor / collaborators | Text | 主赞助方/合作方 | 赞助画像;ROR 消歧 |
| facility_* | Text | 地点国家/州/城市/机构 | 地理聚合 |
§4.2 标签分布
- 研究类型分布:介入性 76%、观察性 23%、扩展获取 <0.2%。
- 结果发布分布:全库 13.3% 已发布结果;介入性内部 94% 的适用试验已发布(法定强制域)。
- 地域分布:仅美 28% / 仅非美 58% / 跨域 4% / 未提供 10%。
- 赞助结构(第三方 2026-06-10 全量分析):学术/医院/非营利 71.4%、行业 22.1%、NIH 2.0%、其他政府 2.6%、网络 0.8%;Phase 3 中行业 49.8%。
- 合规缺口(第三方口径):完成 Phase 3 约 58% 无结果;终止试验 43% 因入组失败。
§4.3 关键统计
| 统计项 | 数值 | 口径 |
|---|---|---|
| 注册研究总数 | 601,897 | 官方 2026-09-08 |
| 介入性 / 观察性 / 扩展获取 | 459,380 / 140,464 / 1,067 | 同上 |
| 已发布结果 | 80,028 | 同上 |
| 招募中 | 64,499 | 同上 |
| 覆盖国家与地区 | 226 | 同上 |
| 月独立访客 | 约 320 万 | 官方 2025-12 披露 |
| AACT design_outcomes | 3,716,648 行 | 第三方 2026-08-01 AACT |
| AACT design_groups | 1,097,076 行 | 同上 |
| 官方研究文件唯一 NCT | 595,630 | 第三方 2026-07-25 提取 |
| FDAAA 延迟提交器械试验 | 986 | 官方 |
§4.4 数据层级
- 注册层(Registry Layer):所有 601,897 项研究;结构化字段 + 文本。
- 结果层(Results Layer):80,028 项;结局分析、分组统计、不良事件;法规强制域内覆盖率高。
- 版本层(History Layer):每研究可含多次修订(含协议变更时间戳);结局切换与方案漂移分析的基础。
- 元数据层(Meta Layer):注册库统计、字段元信息、JSON-LD 站点级输出。
§4.5 缺失值处理与信息性缺失编码
- 未提供地点:10% 研究无地点信息——地理聚合任务应显式建模「未知」类,勿丢弃。
- 结果缺失 ≠ 数据缺失:未发布结果研究的结果字段为空是结构性缺失(法规范围外或合规缺口),与「试验无数据」含义不同;合规研究需以「适用临床试验」判定先行。
- 观察性研究的分期字段:phase = N/A 属信息性缺失,表示不适用而非漏填。
- 日期类型:日期字段含估计/实际两种类型修饰;纵向分析须先按类型过滤,否则未来估计日期会污染时间线。
- 自由文本多值:conditions/interventions 为分隔多值文本,解析时分隔符并非全局唯一(分号/逗号混用),建议基于 UMLS 词库切分。
- 延迟提交:器械延迟公开记录在结果层不可见,全量统计需读取延迟提交标记(986 项)。
§4.6 官方 JSON 模块结构示例
{
"protocolSection": {
"identificationModule": {
"nctId": "NCT04280705",
"briefTitle": "…",
"officialTitle": "…"
},
"statusModule": {
"overallStatus": "RECRUITING",
"startDateStruct": {"date": "2020-02", "type": "ACTUAL"},
"primaryCompletionDateStruct": {"date": "2020-10", "type": "ESTIMATED"}
},
"designModule": {
"studyType": "INTERVENTIONAL",
"phases": ["PHASE3"],
"enrollmentInfo": {"count": 394, "type": "ACTUAL"},
"designInfo": {
"allocation": "RANDOMIZED",
"maskingInfo": {"masking": ["PARTICIPANT", "CARE_PROVIDER"]},
"primaryPurpose": "TREATMENT"
}
},
"conditionsModule": {"conditions": ["COVID-19"]},
"eligibilityModule": {
"sex": "ALL",
"minimumAge": "18 Years",
"maximumAge": "N/A",
"healthyVolunteers": false,
"eligibilityCriteria": "Inclusion Criteria:\n - …\nExclusion Criteria:\n - …"
}
},
"resultsSection": {
"participantFlowModule": {"recruitmentDetails": "…", "preAssignmentDetails": {"arms": []}},
"outcomeMeasuresModule": {"outcomeMeasures": [{"title": "…", "type": "PRIMARY", "units": "…"}]},
"adverseEventsModule": {"frequencyThreshold": "0%", "eventGroups": []}
},
"hasResults": true
}
- 日期对象的 type 字段(ACTUAL/ESTIMATED/ANTICIPATED)是官方 JSON 对估计日期坑点的显式标注(对应坑点 4)。
maskingInfo支持多维盲法(参与者/医护/评估者/统计师),比 AACT 单列字符串更细。hasResults布尔位是结果域过滤的第一道开关。- 建议镜像策略:官方 JSON 做主存储(保留嵌套语义),AACT 仅作查询加速层。
§4.7 状态机全景
| overall_status | 语义 | AI 注意 |
|---|---|---|
| RECRUITING | 招募中 | 患者匹配可行动集 |
| ENROLLING_BY_INVITATION | 仅受邀入组 | 勿当公开招募 |
| ACTIVE_NOT_RECRUITING | 进行中不再招募 | 结果未至 |
| COMPLETED | 主完成(数据可能未交) | 12 个月合规观察窗 |
| TERMINATED | 提前终止 | 终止原因字段价值高 |
| WITHDRAWN | 启动前撤回 | 勿计入「失败」口径 |
| SUSPENDED | 暂停 | 可恢复;时序分析注意 |
| NOT_YET_RECRUITING | 获批未启动 | 前瞻预测样本 |
| AVAILABLE / ENROLLING_BY_INVITATION(扩展获取) | 扩展获取专用 | 仅 1,067 项 |
§4.8 解析陷阱清单(工程落地版)
| 陷阱 | 触发场景 | 症状 | 处置 |
|---|---|---|---|
| CSV 多值列分裂 | brief_summary 内含逗号/换行 | 列错位、行数虚增 | 用官方 JSON 而非 CSV 做文本源 |
| 年龄字符串 | 「18 Months」「up to 100 Years」 | int() 直接崩 | 正则提取数值+单位换算月/岁 |
| 枚举超集 | 新状态/新分期值出现 | Enum 校验失败 | 保留 unknown 桶 + 版本监控 |
| 嵌套空对象 | resultsSection 为空 dict | KeyError | get() 链路 + 显式 None |
| 日期粒度混合 | 「2020-02」缺日 | 日期解析歧义 | 按 Month/Day 粒度分列存储 |
| HTML 实体 | 文本含 & 等 | 展示乱码 | 统一 html.unescape |
| 多语言地点 | 城市/机构非英文 | 聚合碎片 | 以国家码聚合,城市级慎用 |
| 撤回研究残留 | WITHDRAWN 但字段完整 | 计入统计虚高 | 按 status 过滤后再统计 |
§4.9 与 Croissant 元数据的映射
- 本文 frontmatter 的 schema_org 块按 Croissant 1.1 约定给出了 RecordSet 与 Field 级映射(studies 表 → 字段级 dataType 与 source.extract.column)。
- 若将注册库接入支持 Croissant 的训练平台(如 Hugging Face 风格数据卡),可直接复用该映射:
recordSet.key = nct_id(全局唯一键)field.dataType对齐 schema.org 类型(Text/Integer/Boolean)rai:dataLimitations列出六条核心局限(自报性、强制域、文本噪声、schema 演化、快照不同步、结果粒度)
- 建议每次镜像重建时同步刷新 Croissant 块中的快照日期与行数。
§5 划分与使用建议
§5.1 官方划分
注册库不提供机器学习意义上的官方划分。语义上可将快照一分为三:
- 结构域(约 60 万):全部注册记录,用于横断面分析与语料构建。
- 结果域(8 万):已发布结果子集,用于结果层数据挖掘与安全信号研究。
- 版本域(全量):含修订历史,用于纵向与审计类任务。
§5.2 社区惯例划分
- 按病种切分(Disease-Hold-out):留出完整病种(如全部肿瘤试验)评估模型泛化,避免相邻病种文本泄漏。
- 按时间切分(Time-based Split):以注册日期为界(如 2010 前训练 / 2010-2018 验证 / 2019 后测试),模拟真实前瞻场景;结局预测类任务必须如此切分。
- 按赞助商切分(Sponsor-Hold-out):留出整家赞助商检验跨机构泛化;行业与学术试验文本风格差异显著,混合切分会虚高性能。
- 按 NCT 数值段切分:注册号大致随时间递增,可作时间切分的近似代理。
§5.3 泄漏风险(重点)
- 时间泄漏:结局预测任务若随机切分,训练集会包含「未来」试验及其结果,性能严重虚高——必须时间切分并冻结特征快照。
- 同赞助商泄漏:同一赞助商的试验文本模板高度相似(摘要句式、结局措辞),按赞助商切分可检验模板外泛化。
- 同一研究的多次快照:AACT 历史快照重复建模时,同一 NCT 的早期与晚期版本不得分属训练与测试。
- 论文-注册泄漏:结局切换检测任务若同时使用论文语料,需防止测试对(注册记录-论文)的任一侧出现在训练侧。
- 患者匹配的间接泄漏:外部患者-试验匹配基准若源自某药品公司试验族,模型若在该族上预调参将产生家族性泄漏。
§5.4 交叉验证建议
# 时间切分 + 分组(赞助商)双约束的划分示例(pandas)
import pandas as pd
import numpy as np
from sklearn.model_selection import GroupKFold
# studies: AACT studies 表最小化
# cutoff 按注册年份切分,GroupKFold 保证同赞助商不跨折
df = studies.copy()
df["reg_year"] = pd.to_datetime(df["start_date"], errors="coerce").dt.year
train = df[df.reg_year <= 2015]
dev = df[(df.reg_year > 2015) & (df.reg_year <= 2018)]
test = df[df.reg_year > 2018]
gkf = GroupKFold(n_splits=5)
for tr_idx, va_idx in gkf.split(train, groups=train["lead_sponsor"]):
... # 交叉验证仅在训练段内部进行,验证段与测试段保持时间纯净
- 分层维度:按 study_type × phase × results_posted 三层联合分层,防止结果域被稀释。
- 大赞助商:头部企业(数千项研究)在 GroupKFold 下天然占满多折,可另设「头部赞助商整组留出」压力测试。
§5.5 外部验证建议
- 跨注册库验证:以 EU CTIS 或 ISRCTN 的同病种子集做域外测试,检验对欧盟/英国填报风格的泛化。
- 与法规数据对齐:FDA 批准记录( Drugs@FDA)作为外部真值验证「Phase 3 结果→批准」预测链路。
- 与文献对齐:PubMed 论文-注册链接(MEDLINE 的 NCT 编号字段)可验证结果一致性任务。
- 实践口径校准:第三方合规统计(AllTrials/PharmaDossier)可作合规审计模型的外部 sanity check——模型输出与全量统计的偏差超过 5 个百分点应视为校准失败。
§5.6 典型分析配方
配方 1:赞助商合规画像(表格学习)
- 样本:完成 Phase 3 的介入性试验 × lead_sponsor 聚合。
- 特征:注册年限、试验数、病种熵、地域广度、历史延迟天数。
- 标签:结果是否按时发布(12 个月窗)。
- 陷阱:大赞助商样本量极多,简单按试验分层会被头部企业支配;按赞助商聚合后建模(研究层级 → 机构层级)。
配方 2:终止原因分类(NLP)
- 样本:TERMINATED 状态研究的 why_stop 文本(第三方口径 43% 源于入组失败)。
- 标签体系:入组失败 / 安全性 / 商业决策 / 其他;人工标注 500-1000 条起步。
- 评测:分层抽样(按年份与赞助类别)后宏 F1。
配方 3:患者-试验匹配(检索式 LLM)
- 语料:RECRUITING 子集(64,499)+ 合格标准文本。
- 索引:标题/摘要 BM25 + 病种 UMLS 过滤 + 合格标准向量检索。
- 判定:LLM 逐条准则判定「符合/不符合/不确定」,unknown 保守返回。
- 上线门槛:§6.6 的状态过滤 + 分人群公平性报告。
配方 4:结局切换检测(版本对齐)
- 输入:design_outcomes(注册版)× 论文报告结局(PubMed NCT 链接)。
- 对齐:主要结局文本相似度(表格结构 + 语义双通道)。
- 标签:一致 / 增益性改写 / 降级 / 未报告(COMPare 编码本)。
- 难点:论文侧结局抽取本身是子任务,建议分两阶段各自评测。
配方 5:试验时间线预测(纵向)
- 目标:主完成日偏差(估计 vs 实际)或注册→启动间隔。
- 特征:期别、国家数、入组目标、赞助类别、病种稀有度。
- 切分:严格按注册年份时间切分(§5.3)。
§6 AI 就绪指南
§6.0 云端快速启动
# 路径 A:官方 API v2(无需账号)
curl -s "https://clinicaltrials.gov/api/v2/studies?query.cond=cancer&pageSize=5" | head -c 2000
# 路径 B:AACT 云端 PostgreSQL(注册免费账号后)
psql -h aact-db.ctti-clinicaltrials.org -p 5432 -d aact -U <你的账号>
# SELECT count(*) FROM studies; -- ~60 万行
# 路径 C:全量导出
# CSV: https://clinicaltrials.gov/data-api/about-api/csv-download
# JSON: 全量研究文档(嵌套),适合构建本地镜像
§6.1 快速上手(含目录注释)
# ============================================================
# ClinicalTrials.gov API v2 → 招募中肿瘤试验最小示例
# ============================================================
import requests, json
BASE = "https://clinicaltrials.gov/api/v2/studies"
params = {
"query.cond": "breast cancer", # 病种自由文本检索
"filter.overallStatus": "RECRUITING", # 状态受控词过滤
"fields": [ # 字段裁剪,降低传输
"NCTId", "BriefTitle", "OverallStatus",
"EligibilityCriteria", "Phase"
],
"pageSize": 20,
"pageToken": "", # cursor 分页
}
rows = []
while True:
r = requests.get(BASE, params=params, timeout=30)
r.raise_for_status()
data = r.json()
rows.extend(data.get("studies", []))
tok = data.get("nextPageToken")
if not tok:
break
params["pageToken"] = tok
print(len(rows))
# 每条 studies[i]["protocolSection"]["eligibilityModule"]["eligibilityCriteria"]
# 即纳入/排除全文本,可直接进入 PICO 抽取流水线
§6.2 AACT SQL 级分析
-- 各赞助商:完成 Phase 3 的结果缺失率(第三方合规口径复现)
SELECT s.lead_sponsor,
COUNT(*) AS n_completed_p3,
SUM(CASE WHEN s.results_posted THEN 1 ELSE 0 END) AS n_with_results,
ROUND(100.0 * AVG(CASE WHEN s.results_posted THEN 1 ELSE 0 END), 1) AS pct_results
FROM studies s
WHERE s.study_type = 'Interventional'
AND s.phase LIKE '%PHASE3%'
AND s.overall_status = 'COMPLETED'
GROUP BY s.lead_sponsor
HAVING COUNT(*) >= 20
ORDER BY pct_results ASC
LIMIT 25;
-- 结局度量文本异构性体检:同一量表的不同写法
SELECT regexp_replace(outcome_measure, '[^A-Za-z0-9]', '', 'g') AS norm,
COUNT(DISTINCT outcome_measure) AS variants
FROM design_outcomes
WHERE outcome_measure ILIKE '%overall survival%'
GROUP BY 1
ORDER BY variants DESC
LIMIT 10;
§6.3 文本层特征工程
- PICO 抽取:合格标准文本按「Inclusion Criteria / Exclusion Criteria」标题分段后,对每条准则抽取(病种、干预、数值阈值、时间窗);UMLS MetaMap 或 scispaCy 可做初版实体链。
- 复杂度特征:终点数(design_outcomes 计数)、设盲层数(design_masking)、国家数(countries)、入组目标(enrollment)——第三方方案复杂度研究(如 eClinCloud 2026 分析)表明 NONE 盲法占 24.99 万行设计记录,是常见基线。
- 版本特征:结局字段修订次数、修订时点相对入组进度的位置——结局切换检测的强预测特征。
- 检索与 RAG:以「NCT 编号 + 方案文本 + 结局」构建语料块;标题与摘要适合做 BM25/向量双路召回,合格标准适合做重排特征。
§6.4 表格层建模建议
- 目标示例:结果缺失率预测、终止原因分类(入组失败 43% 为最大类)、入组周期回归。
- 特征域:设计字段(分期/盲法/分配)、赞助类别(行业/学术/NIH)、病种(UMLS 聚类)、地域、年份。
- 基线:逻辑回归即可复现第三方全景统计的方向性结论;梯度提升树在细粒度赞助画像上稳定占优。
- 校准:结果缺失率输出务必做校准曲线——全库先验约 13.3%,模型偏差应报告相对先验的增益而非裸 AUC。
§6.5 坑点(Pitfalls)
坑点 1:AACT 与官方文件快照不同步
2026-08-01 的 AACT calculated_values 有 596,685 行,而 2026-07-25 的官方研究文件是 595,630 条 NCT——两条通道的快照日不同,直接联表会得到「幽灵差」。对策:所有跨通道分析先记录并统一快照时间戳。
坑点 2:phase 字段是多值
PHASE1, PHASE2 这样的组合标签真实存在(字符串而非枚举单值)。WHERE phase = 'PHASE3' 会漏掉 PHASE2, PHASE3——应用 LIKE 或拆分匹配,并清楚说明口径。
坑点 3:结果的「缺失」是结构性的
观察性研究一般不要求提交结果,Phase 1 通常不强制。把「无结果」当模型负样本时必须先以「适用临床试验」定义过滤,否则模型学到的是法规范围而非科学规律。
坑点 4:完成日期含估计值
primary_completion_date 可为「估计」类型。纵向分析若不排除估计日期,会把「未来」日期纳入统计,导致时间线扭曲。AACT 的日期类型字段与主表分列,容易漏 JOIN。
坑点 5:自由文本多值的分隔符不统一
conditions 与 interventions 字段内部分隔符混用(分号、逗号、竖线),单纯 split 会切碎「Alzheimer Disease, Late Onset」这类带逗号术语。对策:以 UMLS 词库做最长匹配切分,或直接使用官方 JSON 的数组结构。
坑点 6:合格标准的人群偏移
老年、肾损伤、孕产妇在纳入标准中长期被排除;直接拿全量训练患者匹配模型会在这些人群上系统性低估可入组率。对策:报告分人群的入组率并设定公平性监控。
坑点 7:赞助商字符串无机构 ID
lead_sponsor 是自由文本(拼写变体、合并重组后旧名),按字符串 GROUP BY 会把同一机构拆成多行。对策:ROR/GRID 消歧,或至少做大小写+停用词归一后再聚合。
坑点 8:注册文本的营销语言
brief_summary 常含赞助方的宣传性措辞(「first-in-class」「novel」)。文本分类任务中这类词汇与赞助类别强相关,模型会学到「文体」而非「医学」——跨赞助切分测试(§5.2)是唯一可靠检测手段。
§6.6 患者匹配参考流水线
# 招募中试验的合格标准结构化示例(规则基线)
import re
def parse_criteria(text: str) -> dict:
# eligibilityCriteria 原文样例:
# "Inclusion Criteria:\n - Age 18-75...\nExclusion Criteria:\n - Prior chemo..."
inc = re.split(r"Exclusion Criteria:", text.split("Inclusion Criteria:")[-1])[0]
exc = text.split("Exclusion Criteria:")[-1] if "Exclusion Criteria:" in text else ""
age = re.search(r"(?:Age[s]?\s*[::]?\s*)?(\d{1,3})\s*(?:to|-|–)\s*(\d{1,3})", inc)
return {
"inclusion_lines": [l.strip("- ").strip() for l in inc.splitlines() if l.strip().startswith("-")],
"exclusion_lines": [l.strip("- ").strip() for l in exc.splitlines() if l.strip().startswith("-")],
"age_min": int(age.group(1)) if age else None,
"age_max": int(age.group(2)) if age else None,
}
- 规则基线适用于年龄/性别/妊娠三类硬准则;病种与既往治疗史需模型链路(NER → UMLS 链接 → 布尔判定)。
- 评测:以人工资格判定(eligible/not-eligible/unknown)三分类报告宏 F1,unknown 单列以暴露过度自信。
- 上线前必须以「状态=RECRUITING 且 last_update 近 90 天」过滤,避免向患者推荐已停止招募的研究。
§6.7 大规模拉取性能实践
- API v2 分页节奏:pageSize 上限受官方约束(数百级),cursor 逐页推进;全库约 60 万条 NCT,串行全量拉取按秒级/页估算需数天——生产环境应并发分片(按 NCT 段或 condition 过滤切片)并记录 cursor 断点。
- fields 裁剪收益:只拉 EligibilityCriteria + 状态字段可减少 70%+ 传输量;JSON 嵌套文档全量约 5-10 KB/条,裁剪后 <1 KB/条。
- AACT 直查优先:结构化过滤(状态/分期/赞助)在 AACT SQL 内先做,命中集合再用 API v2 拉取全文,是成本最低的两段式。
- 限速与重试:API key 提高限额;429/5xx 用指数退避重试;批量任务务必断点续传(记录最后处理的 NCT)。
- 本地镜像策略:每月全量快照 + 每日增量(以 last_update_posted 过滤)可兼顾复现性与新鲜度;快照日期写入数据集元数据(对应坑点 1)。
§6.8 开源工具链与生态
| 工具/项目 | 形态 | 语言 | 定位 |
|---|---|---|---|
| AACT ETL | 开源仓库 | SQL/Python | XML→关系表官方参考实现 |
| clinical-trials-api 客户端 | 社区库 | Python/R | API v2 封装与分页 |
| ClinicalTrials.gov JSON Schema | 规范 | JSON | 字段语义权威定义(官方 OpenAPI) |
| MetaMap / scispaCy | 术语链 | Java/Python | 合格标准实体链接到 UMLS |
| EBM-NLP 类标注集 | 语料 | XML/JSON | PICO 抽取迁移标注 |
| LangChain/LlamaIndex 检索器 | 框架 | Python | NCT 语料 RAG 接入 |
| DuckDB CSV 扩展 | 引擎 | SQL | 对批量 CSV 做本地即席分析 |
- 工程建议:以官方 JSON Schema 为字段真值源,避免从 AACT 列名反推语义(两套命名不完全同构)。
- 注意:社区封装库更新滞后于 API v2 演进;关键生产路径建议直连官方端点。
§6.9 数据质量自检脚本骨架
# 拉取后必做的 6 项体检
def dq_report(df, snapshot_date: str) -> dict:
return {
"n_rows": len(df), # 与快照口径对照(§4.3)
"dup_nct": int(df.nct_id.duplicated().sum()), # 必须为 0
"status_values": sorted(df.overall_status.unique()), # 状态机完备(§4.7)
"est_dates": int((df.primary_completion_type == "ESTIMATED").sum()), # 坑点 4
"missing_location_pct": round(df.location_missing.mean() * 100, 1), # ~10%
"results_posted_pct": round(df.results_posted.mean() * 100, 1), # ~13.3%
"snapshot": snapshot_date, # 坑点 1:口径落档
}
- 六项体检任意一项异常都应暂停下游建模,先核对快照通道与过滤口径。
§6.10 向量检索建库配方
语料块切分(chunking)
| 块类型 | 粒度 | 建议大小 | 元数据 |
|---|---|---|---|
| 摘要块 | 每研究 1 块 | brief_summary 全文 | nct_id / status / phase / conditions |
| 标准块 | 纳入/排除各 1 块 | 每条准则 1 行 | nct_id / criterion_type / 序号 |
| 结局块 | 主要+次要各 1 块 | measure + time_frame + description | nct_id / outcome_type |
| 设计块 | 每研究 1 块 | 设计要素拼接 | nct_id / allocation / masking |
检索链路
# 双路召回 + 重排(伪代码)
hits_bm25 = bm25_index.search(query, k=200, filter={"status": "RECRUITING"})
hits_dense = vec_index.search(embed(query), k=200, filter={"status": "RECRUITING"})
merged = rrf_fuse(hits_bm25, hits_dense, k=100) # 倒数融合
reranked = cross_encoder.rerank(query, merged, top_k=20)
# 过滤层必须前置状态过滤,避免向患者返回不可加入的试验
评测集构建
- 从 RECRUITING 子集抽样 200-500 项研究,人工撰写「患者画像 → 期望命中 NCT」查询对。
- 指标:Recall@20(召回质量)+ 状态过滤准确率(上线安全)+ 分病种宏平均(公平性)。
- 回归监控:每次镜像刷新后重跑评测,防止快照漂移导致检索质量下滑。
§7 评估基准与 DAIMS 评估
§7.1 DAIMS 评估(24 项)
| # | 维度 | 评估项 | 得分 | 说明 |
|---|---|---|---|---|
| 1 | 可得性 | 开放获取(无需申请即可下载) | 5/5 | API v2 与批量导出即开即用 |
| 2 | 可得性 | 机器可读许可(公共领域) | 5/5 | 美国政府作品 17 U.S.C. §105 |
| 3 | 可得性 | 稳定持久标识(NCT 编号) | 5/5 | 全球唯一,20+ 年稳定 |
| 4 | 结构化 | 受控字段完备度 | 5/5 | 约 40 模块字段覆盖设计全要素 |
| 5 | 结构化 | 关系型镜像(AACT 40+ 表) | 5/5 | SQL 级分析就绪 |
| 6 | 结构化 | schema 稳定性 | 3/5 | API v1→v2 现代化改造迁移成本 |
| 7 | 文本 | 方案/标准全文本可得 | 5/5 | 合格标准文本是稀缺资产 |
| 8 | 文本 | 文本规范化程度 | 2/5 | 自由文本噪声大(见坑点 5/7) |
| 9 | 版本 | 协议修订历史保留 | 4/5 | 时间戳完整;早期记录粒度粗 |
| 10 | 版本 | 历史快照可复现 | 4/5 | AACT 历史存档 2010-2016 起 |
| 11 | 结果 | 结果数据发布量 | 4/5 | 80,028 项,全球最大 |
| 12 | 结果 | 结果层结构化程度 | 4/5 | 分组/统计/不良事件结构化 |
| 13 | 结果 | 强制域覆盖率 | 4/5 | 适用试验 94% 已发布 |
| 14 | 质量 | 填报准确性 | 3/5 | 自报制;NLM 仅格式校验 |
| 15 | 质量 | 地点/赞助商 ID 化 | 2/5 | 无机构持久 ID(坑点 7) |
| 16 | 质量 | 多值字段机器可读性 | 3/5 | CSV 宽表分隔符不统一 |
| 17 | 治理 | 更新频率 | 5/5 | 每日滚动 + AACT 每日刷新 |
| 18 | 治理 | 变更通告 | 4/5 | AACT 提供更新通知 |
| 19 | 治理 | 法规锚定 | 5/5 | FDAAA 801 + ICMJE 双支柱 |
| 20 | AI 任务 | 患者-试验匹配适用性 | 4/5 | 缺人工金标注(需外源基准) |
| 21 | AI 任务 | NLP 语料适用性 | 4/5 | 规模与多样性顶级;噪声需处理 |
| 22 | AI 任务 | 表格学习适用性 | 4/5 | 先验极不均衡,需分层评估 |
| 23 | 伦理 | 个体隐私风险 | 5/5 | 无患者级数据,仅研究级聚合 |
| 24 | 伦理 | 二次使用许可清晰度 | 5/5 | 公共领域 + 禁背书条款清晰 |
DAIMS 综合:98/120(4.08/5)——可得性、治理与伦理接近满分;主要失分在文本规范性与机构 ID 化。
§7.2 可复现分析路线
- 复现第三方合规统计:AACT studies 表 + §6.2 SQL(口径:Interventional × PHASE3 × COMPLETED × results_posted)。
- 复现结局切换检测:版本层修订记录 + 发表论文 NCT 链接(PubMed/Europe PMC 的 NCT 字段)比对主要结局文本。
- 复现地域格局:官方 Trends & Charts 数值与 AACT countries 表(808,912 行)交叉验证。
§7.3 外部评测资源
- 患者-试验匹配:若干学术团队发布的人工标注资格判定集(如 eligibility criteria NLP 相关共享任务与基准),规模数千至数万条准则级标注。
- PICO/实体抽取:EBM-NLP 类资源覆盖 PICO 元素标注,可迁移至合格标准文本。
- 文本风格迁移警示:任何在单病种或单赞助商子集上训练的匹配模型,上线前必须按 §5.2 切分重测。
§7.4 质量审计清单(发布前)
- [ ] 快照日期写入所有产物元数据(表格/图表/模型卡)。
- [ ] 状态过滤条件显式可复制(SQL 或 API 参数原文)。
- [ ] 分母口径声明:全库 / 介入性 / 适用临床试验,三者必选其一并说明。
- [ ] 日期字段已按 ACTUAL/ESTIMATED 分型处理。
- [ ] 多赞助商、多病种采样凭证(防坑点 8 文体泄漏)。
- [ ] 结果缺失分析已区分「制度外」与「违规」两类。
- [ ] 与官方 Trends & Charts 的总量偏差 <1%(快照差异容忍带)。
- [ ] 地理聚合已建模「未提供地点」10% 的未知类。
§7.5 与站内数据集的联合分析建议
| 联合对象 | 键 | 分析价值 |
|---|---|---|
| mimic-iv / eicu-crd | 院区-试验招募记录 | 注册设计与真实入组的差距 |
| umls / snomed-ct | 病种/干预 CUI | 大规模术语归一管道验证场 |
| loinc | 实验室结局 | 结局度量标准化率评估 |
| faers | 药物-事件对 | 注册安全数据与自发报告交叉 |
| gwas-catalog | 病种-靶点 | 治疗假设的遗传证据密度 |
| open-targets | 靶点-疾病关联 | 管线热点与证据链对齐 |
| pubmedqa / medqa | 评测语料 | NCT 语料作 RAG 扩展库 |
§7.6 模型卡要点(基于本数据集训练/评测时建议声明)
| 卡片项 | 建议声明内容 |
|---|---|
| 训练数据快照 | AACT YYYY-MM-DD 或官方导出 YYYY-MM-DD(必填,坑点 1) |
| 样本范围 | 研究数、状态过滤、期别过滤、病种域 |
| 切分方式 | 时间切分 / 赞助商切分 / 病种切分(§5.2)与理由 |
| 已知偏差 | 自报数据、行业文本模板、人群排除偏移(坑点 6/8) |
| 评测协议 | 时间外推测试集 + 分赞助类别宏指标 |
| 合规声明 | 公共领域许可、禁背书条款遵守情况 |
| 更新策略 | 镜像刷新频率与模型重训触发条件 |
- 建议:模型卡与数据卡(Croissant 块)一起发布,形成「快照-切分-评测」三要素可追溯链。
§8 伦理、隐私与合规
- 无患者级数据:注册库只含研究级聚合信息(入组目标、结局统计),个体患者不可识别;DAIMS 隐私维度满分。
- 禁背书条款:NLM 条款禁止以 NIH/NLM 名义背书衍生产品;发布衍生应用时须明示数据来源且不使用官方徽标。
- 自报偏差的告知义务:基于注册库的任何结论(如合规率)应注明「自报数据,NLM 不核验内容」。
- 结果使用的临床边界:结果层数据不得直接用于个体诊疗决策;不良事件汇总的粒度不足以支撑药物警戒因果判定(应与 FAERS 等专用数据源协同)。
- 合规研究的双刃剑:结果缺失统计具有舆论属性,发布前应给赞助方口径差异留出说明空间(法规范围差异、延迟提交状态)。
§9 版本历史与演进
| 时间 | 演进 | 对 AI 用户的影响 |
|---|---|---|
| 1997-2000 | FDAMA 113 立法 → 2000-02-29 上线 | 注册层建立 |
| 2004-2005 | ICMJE 注册政策 | 注册量跃升,2005 年后数据更具全景性 |
| 2007-2008 | FDAAA 801 立法;结果库上线 | 结果层诞生 |
| 2012 | AACT 启动(CTTI) | SQL 级分析通道建立 |
| 2016-2017 | Final Rule 生效;AACT 升级 40+ 表 | 结果强制域扩大;表结构定型 |
| 2023 | API v2 + 站点现代化(v1 弃用) | 迁移成本一次性发生;JSON-LD/OpenAPI 就绪 |
| 2024-2026 | 注册量 55 万→60 万;AACT 持续每日刷新 | 规模红利继续增长 |
- AI 侧迁移提示:v1→v2 字段名体系重构(如 Study → protocolSection 嵌套),历史脚本需重写映射;AACT 2017 升级前后表名不兼容。
- 口径提示:引用规模数字必须带快照日期——注册库每日增长 100+ 条,任何无日期引用都会在数月内失真。
§9.1 未来演进方向
- 与 CTIS 的全球互操作:EU-EEA 注册数据与 NCT 的字段映射标准仍在演进,跨库去重将长期是数据工程问题。
- 结果数据的机器可读性提升:CDISC 标准化提交的普及将改善结果层异构性(当前结果统计以自由文本参数为主)。
- 机构持久标识:赞助方与机构的 ROR 化若落地,机构级分析的可复现性将大幅提高(当前为自由文本)。
- API 生态扩展:JSON-LD 与 OpenAPI 的完善使注册库更适合作为 LLM 时代的结构化证据源;预期增量端点(如历史版本 API)将继续开放。
- AI 原生用法的制度化:患者匹配自动化、结果缺失自动监测等用法已进入监管讨论视野,注册库可能成为「AI 审计临床试验」的基准数据。
§9.2 使用本条目时的维护提示
- 规模数字每季度复核一次(官方 Trends & Charts);本文口径 2026-09-08。
- AACT 表结构若发生升级(如 2017 年型重构),需同步更新 §3.11 与 §4.0。
- API v2 若弃用某端点,以官方 OpenAPI 规范为准修正 §6.0 与 §6.1 示例。
- 第三方统计(赞助结构、合规缺口)每年复核一次,注意第三方快照与官方快照的日期差。
§10 引用与资源
§10.1 官方资源
| 资源 | 链接 | 说明 |
|---|---|---|
| 注册库主页 | https://clinicaltrials.gov/ | 患者与研究者入口 |
| Trends & Charts | https://clinicaltrials.gov/about-site/trends-charts | 本文规模数字口径(2026-09-08) |
| 数据 API | https://clinicaltrials.gov/data-api/api | API v2 文档与 OpenAPI 规范 |
| CSV/JSON 下载 | https://clinicaltrials.gov/data-api/about-api/csv-download | 全量批量导出 |
| AACT 数据库 | https://aact.ctti-clinicaltrials.org/ | CTTI 关系型镜像(每日刷新) |
| AACT 数据字典 | https://aact.ctti-clinicaltrials.org/data_dictionary | 40+ 表 schema 与字段语义 |
| 术语与条款 | https://clinicaltrials.gov/about-site/terms-conditions | 公共领域与禁背书条款 |
§10.2 学术引用
- Califf RM, Zarin DA, Kramer JM, Clancy RW. Characteristics of clinical trials registered in ClinicalTrials.gov, 2007-2010. JAMA. 2012;307(17):1838-1847.
- Zarin DA, Tse T, Williams RJ, Rajakannan T. Update on trial registration 11 years after the ICMJE policy was established. N Engl J Med. 2017;376(10):983-991.
- Turner EH, Matthews AM, Linardatos E, Tell RA, Rosenthal R. Selective publication of antidepressant trials and its influence on apparent efficacy. N Engl J Med. 2008;358(3):252-260.
- Tse T, Williams RJ, Zarin DA. Reporting «free text» for structured data elements in ClinicalTrials.gov. Trials. 2009;10:23.
- Clinical Trials Transformation Initiative. AACT Database Documentation. https://aact.ctti-clinicaltrials.org/ (访问日期 2026-09-19).
§10.3 站内互链
- eicu-crd:重症监护电子病历——与注册库结果层互补的真实世界数据
- mimic-iii / mimic-iv:单中心深度 EHR——注册库「广度」的深度对照组
- umls / snomed-ct / loinc:病种与结局术语归一的三大支柱(见 §2.1b)
- open-targets / gwas-catalog:靶点与遗传证据——试验干预选择的先验知识源
- faers:不良事件信号——结果层安全数据的专业扩展
- drugbank / chembl:药物-分子映射——干预字段的结构化出口
- pubmedqa / medqa / gmai-mmbench:医疗 LLM 评测——注册库可作 RAG 语料补充
- radgraph:放射报告结构化——同为「临床文本结构化」范式
§10.4 建议引用格式
@misc{clinicaltrials_gov_2026,
title = {ClinicalTrials.gov Registry and Results Database},
author = {{U.S. National Library of Medicine}},
howpublished = {https://clinicaltrials.gov/},
note = {Snapshot 2026-09-08: 601,897 registered studies},
year = {2026}
}
@misc{aact_2026,
title = {AACT: Aggregate Analysis of ClinicalTrials.gov},
author = {{Clinical Trials Transformation Initiative}},
howpublished = {https://aact.ctti-clinicaltrials.org/},
note = {Daily-refreshed PostgreSQL mirror of ClinicalTrials.gov},
year = {2026}
}
§10.5 常见问题 FAQ
Q1:注册库数据可以直接商用吗?
A:数据为美国政府作品(公共领域),无版权限制;但站点条款禁止暗示 NIH/NLM 背书,商用产品应明示数据来源与快照日期,且不得使用官方徽标。
Q2:AACT 和官方导出选哪个?
A:SQL 分析选 AACT(40+ 表直接 JOIN);构建本地镜像或保留完整嵌套语义选官方 JSON;快速原型选 CSV。三者可混用,但注意快照日期对齐(坑点 1)。
Q3:为什么我的结果缺失率和 AllTrials 报告不一致?
A:口径差异——「适用临床试验」(法规强制)与全部介入性研究、「COMPLETED」与「主完成日后 12 个月」时间窗都会显著改变分母;务必显式写清自己的 SQL 过滤条件(§6.2)。
Q4:注册文本可以直接做 LLM 训练吗?
A:许可上没有障碍(公共领域);但 brief_summary 的营销语言(坑点 8)与字段模板句式会让模型学到「文体」——建议混合多赞助商、多病种采样并做跨域评测。
Q5:如何拿到某试验的协议修订历史?
A:API v2 返回当前版本 + 历史时间戳;完整旧版本文本可经 Wayback 式存档或记录变更日志获取;纵向研究建议用 AACT 历史快照固定口径。
Q6:观察性研究值得挖吗?
A:140,464 项的观察性研究是真实世界证据(RWE)设计模式与队列结构的富矿;其结果缺失属制度性(不强制),不应作为负面标签。
Q7:与 EU CTIS 有重叠吗?
A:跨国试验常两地注册(NCT + CTIS 编号),但字段体系与结果政策不同;做欧盟域研究应以 CTIS 为主、CT.gov 为辅,去重键可用 sponsor + 方案文本相似度。
Q8:单次全量拉取的合理工程预算?
A:官方批量导出(CSV/JSON)一次下载即可获得全库,优于逐条 API 拉取;API 只应承担增量同步与在线查询。
本文由千方病案医数集编辑部基于官方快照与公开文献整理,数据口径 2026-09-08;引用本文请同时引用 NLM 注册库与 CTTI AACT。
编辑注:本条目是「临床试验透明化基础设施」系列的第一个条目;后续条目(UMLS、LOINC、SNOMED CT 等)将沿用本文 §2.1b 的术语映射框架与 §6.5 的坑点体例,形成站内互链网络的一致性锚点。任何读者若发现规模数字与本条目口径不符,请优先核对快照日期,再考虑字段口径差异——这是本数据集使用中最常见、也最容易被忽视的两个变量。
(全文完;本文共 §0-§10 十一个章节,规模数字以官方 2026-09-08 快照为准,工程示例以 API v2 与 AACT 当前版本为准。)
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- snomed-ct — 共享标签:医疗NLP / 临床文本 / 真实世界数据
- rexerr — 共享标签:医疗NLP / 临床文本 / 评测基准
- vaers — 共享标签:医疗NLP / 公共卫生与流行病学
- blue-benchmark — 共享标签:医疗NLP / 临床文本 / 评测基准
- mednli — 共享标签:医疗NLP / 临床文本 / 评测基准
- medcalc-bench — 共享标签:医疗NLP / 临床文本 / 评测基准
- mimic-iv-ext-pe — 共享标签:医疗NLP / 临床文本
- rad-coreference-resolution — 共享标签:医疗NLP / 临床文本
- radgraph2-radiology-reports — 共享标签:医疗NLP / 临床文本
- mediqa — 共享标签:医疗NLP / 临床文本 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

