信息速览
IntAct — 分子相互作用数据库 AI-Ready Wikipedia
INFOBOX
| 项目 | 内容 |
|---|---|
| 全名 | IntAct Molecular Interaction Database(IntAct 分子相互作用数据库) |
| 维护机构 | EMBL-EBI(欧洲分子生物学实验室欧洲生物信息学研究所;英国剑桥 Hinxton Wellcome Genome Campus) |
| 创立 | 2004 年(NAR 数据库专刊创刊论文;策划与 Swiss-Prot 团队合作) |
| 数据来源 | 文献策划(literature curation)+ 作者直接提交;不收预测互作 |
| 当前版本 | Release 252(2026-01;与 UniProt release 2025_04 同步) |
| 规模(R252) | 1,787,152 二元互作 / 917,295 互作记录 / 145,895 互作分子 / 23,889 篇策划文献 |
| 精细注释 | 90,968 突变特征 / 76,513 实验 / 250 检测方法 CV / 4,120 词表项 |
| 物种覆盖 | 3,725 物种;人类物理 PPI 428,940 条(2025-07 口径) |
| 联盟地位 | IMEx 国际分子交换联盟中央仓库(Active 成员 + 数据物理集中地) |
| 标准体系 | HUPO-PSI:PSI-MI XML 2.5/3.0、MITAB 2.7、MI-JSON、MIQL、PSICQUIC |
| 姊妹项目 | Complex Portal(大分子复合物百科;CPX 编号) |
| 许可 | 数据 CC BY 4.0;软件/转储 Apache 2.0 |
| 认证 | ELIXIR Core Data Resource + Global Core Biodata Resource |
| 官方入口 | https://www.ebi.ac.uk/intact |
| 本库条目 | order 482 · record_id 582 · 类别:基因组学与多组学 × 药物发现与化学 |
§0 E-E-A-T 信任声明与免责声明
- 经验:本条目基于 IntAct 官网(首页/About 页/下载页)、IMEx 联盟官网(成员名录与规则)、NAR 2004 创刊论文(PMID 14681455)、NAR 2013 MIntAct 论文(PMID 24234451)、NAR 2022 推荐引文(PMID 34761267)、Complex Portal NAR 2025 论文(PMID 39558156)与 Nature 系列综述(s41540-026-00698-z)核对;数字全部标注 release 版本。
- 专业性:数据模型(Experiment/Interaction/Interactor)与 n-ary 语义依据 2004 创刊论文原文;格式与查询规范依据 HUPO-PSI/PSICQUIC 官方文档;AI 用例(PLM-interact 突变效应微调)依据 Nature Communications 原文数据。
- 权威性:IntAct 为 EMBL-EBI 官方资源、ELIXIR 与全球核心生物数据资源双重认证;本条目为第三方百科解读,不替代官方文档与 PSI 标准原文。
- 可信度:文内数字进入文末「口径存照」;Release 252 与 2025-07 人类口径两套数字并行时已显式标注。
- 免责:互作数据为研究用途(官网免责声明:不担保正确性、可能受专利约束);本条目不构成医疗建议。
- 时效:口径锁定 2026-09-19/20(Release 252 发布后);IntAct 每月滚动发布,下一次发布以官网为准。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:EMBL-EBI 的专家团队逐篇阅读文献,把实验证明的蛋白/核酸/小分子互作翻译成机器可读记录——带方法、物种、结合区域、突变效应的"证据网络"。
- 多大:Release 252(2026-01)178 万条二元互作、23,889 篇手工策划文献、3,725 个物种、9 万条突变特征。
- 为什么重要:它是 IMEx 国际联盟的中央仓库(DIP/MINT/MatrixDB 等的策划数据都汇到这里);每条边都有具体文献背书——PPI 机器学习最常用的金标准底座之一。
- 怎么用:CC BY 4.0 全开放——FTP 拉全量 MITAB(807 MB)、REST/PSICQUIC 编程查询、Cytoscape 可视化。
- 一句话:STRING 告诉你"谁可能和谁有关系",IntAct 告诉你"谁和谁已被证明有关系、用什么方法、在什么条件下"。
§1.1 摘要
IntAct(Molecular Interaction Database)由欧洲生物信息学研究所(EMBL-EBI)维护,是免费开源的分子相互作用数据库与分析工具集。它只从两条通道取数:文献策划——专业生物文献策划员(biocurator)逐篇阅读同行评议论文,把文中实验证明的每个相互作用按标准提取;作者直接提交——作者在论文发表前把未发表数据入库。它不收录预测互作:库里每一条边都对应一篇具体文献、一个具体实验方法与一段具体实验条件。
Release 252(2026 年 1 月发布、与 UniProt release 2025_04 同步)包含:1,787,152 条二元互作(由 917,295 条互作记录——含 n-ary 复合物记录——投影而来)、145,895 个互作分子(126,704 蛋白 + 12,320 核酸 + 小分子与词表项)、76,513 个实验、23,889 篇手工策划文献、90,968 条突变特征、250 种互作检测方法受控词表、4,120 个本体术语,覆盖 3,725 个物种。人类口径:428,940 条直接/物理关联 PPI(2025-07 统计)。
IntAct 是 IMEx(International Molecular Exchange Consortium,国际分子交换联盟)的中央仓库:DIP、MINT、MatrixDB、IID、InnateDB、UniProt group(Swiss-Prot/SIB)等 Active 成员按同一套深度策划规则(deep curation model——对一篇文章中全部实验证明互作做完整提取)策划数据,物理写入 IntAct,成员库再回迁各自站点展示子集。BioGRID 仅为其 Observer(观察员)。
数据的标准化程度极高:HUPO-PSI 分子互作(MI)标准贯穿始终——PSI-MI XML 2.5/3.0、MITAB 2.7、MI-JSON 四种导出格式,MIQL 查询语言,PSICQUIC 标准查询协议(50+ 服务统一语法),250 种检测方法与 4,120 个受控词表项消除自由文本歧义。许可为双轨制:数据 CC BY 4.0,软件与数据转储 Apache 2.0。IntAct 同时是 ELIXIR Core Data Resource 与 Global Core Biodata Resource(全球核心生物数据资源)——"不可替代"级基础设施的官方认证。
其团队同时运营姊妹项目 Complex Portal(手工策划的大分子复合物百科,CPX 编号,数据入 IntAct 数据模型)——从两两互作到组装体全谱覆盖。
§1.2 战略价值
- PPI 证据的金标准层:预测网络(STRING 类)与实验证据库(IntAct 类)是互作数据的两个层级——IntAct 是"每条边可溯源到文献与方法"的那一层,所有预测模型的评测都绕不开它。
- IMEx 联盟的治理样板:多数据库共享策划规则、分工不重复、数据物理集中——"文献级数据主权协作"在世界范围内做到这个深度的只有 IMEx;任何联盟式数据工程都值得研究这套治理。
- 突变-互作扰动的稀缺标注:90,968 条突变特征(含增强/削弱/无影响方向标注)把静态互作网络升级为"互作动力学"数据——疾病突变机制解释与 ML 突变效应建模的直接原料。
- 标准生态的发起方:PSI-MI 格式、PSICQUIC 协议、MIQL 查询语言——IntAct 团队是这套"互作数据操作系统"的制定者与执行者;格式复利让 50+ 数据库可以联邦查询。
- 深度策划的方法论证据:23,889 篇文献 × 平均 75 条互作 × 每条含区域/PTM/条件——"把文献读透"这项人类智力工作被制度化为可复用数据资产。
§1.3 同类数据集横向对比
| 维度 | IntAct | BioGRID | STRING | MINT | mentha |
|---|---|---|---|---|---|
| 机构 | EMBL-EBI | 独立(美/加) | 丹麦/欧洲 | 意大利 | 欧洲 |
| 数据性质 | 实验(文献+提交) | 实验(文献) | 实验+预测+文本挖掘 | 实验(汇入 IntAct) | IMEx 自动整合 |
| 人类口径 | 428,940 物理 PPI | 230 万非冗余(2025-07) | 143,591 物理对(该口径) | 同源 | 动态 |
| 综合评分 | 无(证据自判) | 无 | 有(综合置信) | 无 | 有(排名) |
| n-ary 保留 | 是(XML/JSON) | 二元为主 | 二元 | 是 | 二元 |
| 突变注释 | 90,968 条 | 有(遗传互作强) | 无 | 同源 | 弱 |
| IMEx 身份 | Active + 中央库 | Observer | 非成员 | Active | 基于 IMEx |
- IntAct vs BioGRID:记录量 BioGRID 更大(289 万条/87,122 篇),但 IntAct 的联盟中枢身份、n-ary 语义与精细注释(区域/PTM/突变方向)独有;BioGRID 的化学互作与 CRISPR 模块是差异化强项。
- IntAct vs STRING:STRING 覆盖 12,000+ 物种、融合预测通道并给综合分——适合"补全网络";做评测必须剔除其非实验通道,而 IntAct 天然纯净。
- IntAct vs Complex Portal:互作边 vs 组装体——复合物(≥2 分子 + 体外可重建 + 已证明特定功能)在 CPX 编号体系,数据模型互通。
§1.4 版本时间轴
| 时间 | 里程碑 |
|---|---|
| 2003-08/09 | 创刊论文收稿(08-15)与修回(09-23) |
| 2004-01 | NAR 数据库专刊创刊论文刊出:~2,200 互作、三组件数据模型、GO 格式词表(PMID 14681455) |
| 2005-2010 | HUPO-PSI 标准成熟(PSI-MI 格式演进);IMEx 联盟规则确立 |
| 2013 | MIntAct 项目:11 个互作数据库以 IntAct 为共同策划平台(PMID 24234451) |
| 2015-06 | Complex Portal 上线(re3data 记录 2015-06-20) |
| 2018-2021 | PSICQUIC 生态成熟(50+ 服务);ELIXIR Core Data Resource 认证 |
| 2022 | Del Toro et al. NAR:"fine-grained"定位(PMID 34761267);Gogl 定量 fragmentomics 集成 |
| 2023-2024 | GPCR-RAMP 互作组(Sakmar lab,2024)集成;新 logo(Cristoffer Sevilla 设计);Global Core Biodata Resource 认证 |
| 2025 | Complex Portal 2025 论文(hu.MAP3.0/MuSIC 预测复合物;PMID 39558156);Sandra Orchard 退休(2025-11) |
| 2026-01 | Release 252:1,787,152 二元互作;UniProt 2025_04 同步;N 端蛋白形集成 |
§1.5 应用场景矩阵
| 场景 | 用什么 | 典型动作 |
|---|---|---|
| 网络构建 | FTP MITAB 全量 | 方法过滤 → networkx/igraph 建图 → 拓扑分析 |
| 靶点邻域分析 | Web/REST 单蛋白 | TP53 类靶点互作伙伴 → 通路归属 → 脱靶预警 |
| PPI 链接预测 | MITAB + 方法列 | 按方法分层训练集 + 按文献切分防泄漏 |
| 突变效应建模 | 特征列突变注释 | 6,979 条方向标注 → 微调 PLM |
| 复合物研究 | Complex Portal/CPX | 化学计量 + 拓扑 + 子复合物可视化 |
| 跨库联邦 | PSICQUIC | 一条 MIQL 同时查 IntAct/MINT/DIP |
| 文本挖掘 | FTP 句子级数据 | 关系抽取模型训练语料 |
| 功能推断 | 互作邻居 + GO | guilt by association 富集 |
§1.6 组件全景
- 互作主库:917,295 条互作记录(含 n-ary)→ 1,787,152 条二元投影;
- 互作分子注册:145,895 个分子实体(蛋白 126,704 / 核酸 12,320 / 小分子与词表项);
- 实验层:76,513 个实验(方法、物种、条件、载体)——互作的"上下文容器";
- 精细特征层:90,968 条突变特征 + 结合区域 + PTM 依赖;
- 词表层:250 检测方法 + 4,120 CV 项(GO 格式公开);
- 姊妹库:Complex Portal(CPX 编号复合物 + hu.MAP3.0/MuSIC 预测复合物);
- 服务层:REST API / PSICQUIC / MIQL / Cytoscape App / DocBot。
§1.7 为什么"deep curation"是它最贵的资产
绝大多数 PPI 数据库的最低目标是"知道 A 和 B 有互作";IntAct 的策划深度是把一篇论文里的"上下文"也变成结构化字段:
浅层策划(多数聚合库)
A ──互作──▶ B (一列布尔事实)
IntAct deep curation
A ──方法:anti-tag coip──▶ B
│ 实验: 76,513 之一个
│ 文献: PMID:12345678 (Smith 2021)
│ 物种: Homo sapiens (9606)
│ A 区域: 12-45 SH2 domain
│ B 区域: 233-236 pY 模体
│ 条件: 需要 B 的 Y233 磷酸化
│ 突变: B/Y233F ──削弱──▶ 互作
└ 证据: 论文正文原句可溯源
这层"区域 + PTM 依赖 + 突变方向"的注释是 90,968 条突变特征的来源,也是机器学习文献里反复被引用的突变扰动对(如 MCM7-Y600E 增强互作、ISCU-N151A 削弱互作)的出处。
§1.8 三组件数据模型速记
- Experiment(实验):一组互作 + 实验条件(通常对应一篇文献的一个实验体系);
- Interaction(互作):≥1 个 Interactor 的参与记录(不强制二元);
- Interactor(互作分子):蛋白/核酸/小分子/词表项 + 序列与特征。
一切导出格式(MITAB 的行、XML 的节点层级、JSON 的对象树)都是这三组件的投影——理解它们就理解了 IntAct 的全部结构。
§1.9 独特视角:一个"不造分"的数据库
IntAct 的第 15 列(置信分)常为空——它拒绝造综合置信分,把方法、文献、条件原样给你,由你按研究问题自行加权。这与 STRING(综合置信分)与 IID(I-score)的哲学相反。在"AI 要分数"的时代坚持"AI 要证据",这个立场本身就是方法学声明:分数会掩盖方法异质性(Y2H 的假阳性谱与共晶完全不同),而分层证据让使用者自己决定信什么。
§2 医学与科学背景
§2.1 蛋白互作与疾病机制的关系
细胞功能由蛋白复合体与信号网络执行:信号转导、代谢调控、基因表达、免疫识别——几乎全部通过蛋白间瞬时或稳定的物理结合实现。疾病本质上是网络扰动:突变破坏界面(如 ZAP70 视图中粉色线 = 受定点突变影响的互作)、病原蛋白劫持宿主网络、药物分子结合靶点蛋白。理解"谁和谁互作、在哪里互作、什么条件下互作"因此是分子医学的基础设施问题。
§2.2 互作检测方法的证据层级
250 种检测方法覆盖不同证据强度与假阳性谱:
| 方法 | CV 编号 | 证据性质 | 注意 |
|---|---|---|---|
| 酵母双杂交(Y2H) | MI:0018 | 体内、高通量、间接 | 假阳性较高、核系统偏好 |
| 免疫共沉淀(anti tag coip) | MI:0006 | 体外/体内、中等通量 | 需注意抗体特异 |
| 亲和纯化-质谱(AP-MS) | MI:0004 类 | 体内复合物、高通量 | n-ary 证据主力、间接成员 |
| X 射线共晶 | MI:0114 | 结构级、直接 | 分辨率与截断蛋白注意 |
| FRET/BRET | MI:0380 类 | 活细胞、瞬时 | 距离敏感 |
方法分层是 IntAct 分析纪律的第一课:同一蛋白对在"共晶 + coip"下的证据强度与"仅 Y2H"完全不同——不做方法过滤的网络分析等于把所有证据等权混合。
§2.3 n-ary 语义与二元投影
TAP/AP-MS 实验给出的是"一个钓饵拉出一群伙伴"的组装体证据。IntAct 从 2004 年起就明确:多蛋白互作可表示为单个 n-ary 互作,不人为拆分(创刊论文原文存照 5)。衍生后果:
- Interactions(917,295)是记录真值;Binary Interactions(1,787,152)是投影值;
- 一个 n 元复合物投影贡献 C(n,2) 条二元对——网络拓扑(密度、度分布)随投影模型(spoke vs matrix)显著变化;
- MITAB 只承载二元投影;完整 n-ary(含化学计量)在 XML/JSON。
§2.4 IMEx 深度策划模型
IMEx 的"deep" curation 与普通文献索引的区别在于"完整性承诺":一篇文章中全部实验证明的 PPI 都要被完整策划(不挑重点)——这消除了"策划员只录明星互作"的偏倚。规则包括:单一策划规则集(跨成员一致)、统一检索界面、标准下载格式、CC 署名许可。代价是单位文献的策划成本极高——这正是 23,889 篇文献(相对 BioGRID 的 87,122 篇)但深度注释领先的取舍。
§2.5 突变-互作扰动的医学语义
90,968 条突变特征把"位点级突变"与"互作级后果"连接:
- 增强(increased interaction,MI:1126 类):突变使结合更强——如 MCM7-Y600E 增强某互作;
- 削弱(decreased interaction,MI:1125 类):突变削弱结合——如 ISCU-N151A;
- 无影响(no effect):阴性信息同样有价值——排除界面候选位点;
- 破坏(disrupted):结合消失——疾病突变机制解释的直接证据。
疾病解读链条:患者错义突变 → 是否位于互作界面 → IntAct 突变特征佐证 → 通路扰动假设。这是从 VUS(意义未明变异)到机制假设的一环证据。
§2.6 复合物的功能单位语义
Complex Portal 对"复合物"的定义刻意严格:≥2 个蛋白和/或核酸的组装体、体外足够稳定可重建、已被证明具有特定分子功能——三个条件缺一不可。这把"凑在一起的蛋白群"与"功能机器"(剪接体、核孔复合物、蛋白酶体)区分开。复合物条目含化学计量(stoichiometry)、拓扑与结合区域,ECO 证据编码标注每条声明的证据类型。2025 年起,hu.MAP3.0 与 MuSIC 的高置信机器学习预测人类复合物入库但显式标注——预测与实验证据的边界仍然清晰。
§2.7 宿主-病原互作的特俗价值
3,725 个物种的覆盖使 IntAct 成为宿主-病原蛋白互作(HP-PPI)的天然载体:病毒蛋白与宿主因子的物理结合、细菌效应蛋白的靶点——这些跨物种边在感染生物学与抗病毒药物靶点筛选中直接可用。物种 CV(NCBI taxonomy)使"取全部人-病毒互作"成为一条 MIQL 查询。
§2.8 蛋白形(proteoform)层级的互作
2026-01 集成的 N 端蛋白形(Gevaert lab,VIB Ghent,与 UniProt 联合策划)把互作证据细化到蛋白形层级:同一基因的不同 N 端形态可以获得新互作或失去旧互作——互作网络在 isoform/proteoform 维度上是"多张网"而非"一张网"。加上既有的 isoform 投影(MITAB 列 1 的 P04637-1 形式),IntAct 是少数在亚基因层级表达互作的库。
§2.9 互作数据与多组学的接口
- 基因组:GWAS/罕见病变异 → 互作邻域定位候选基因;
- 转录组:共表达 + 物理互作双重过滤 → 更高置信的功能模块;
- 蛋白组:AP-MS 原始数据(Px 联盟标准)→ IntAct 策划层;
- 代谢组:蛋白-小分子互作(ChEBI)→ 代谢酶-底物/变构关系;
- 药物组:药物靶点互作邻域 → 脱靶与再利用。
§3 数据集规格
§3.1 规格总表
| 项目 | 规格 |
|---|---|
| 数据库名 | IntAct Molecular Interaction Database |
| 维护方 | EMBL-EBI(英国剑桥 Hinxton) |
| 创立 | 2004(NAR 创刊论文;2003 收稿) |
| 当前版本 | Release 252(2026-01;UniProt 2025_04 同步) |
| 发布节奏 | 每月一次 |
| 二元互作 | 1,787,152 |
| 互作记录(含 n-ary) | 917,295 |
| 互作分子 | 145,895(蛋白 126,704 / 核酸 12,320) |
| 突变特征 | 90,968 |
| 实验 | 76,513 |
| 策划文献 | 23,889 |
| 物种 | 3,725 |
| 检测方法 CV | 250 终端方法 |
| 词表总量 | 4,120 项(GO 格式公开) |
| 人类物理 PPI | 428,940(2025-07 口径) |
| 导出格式 | MITAB 2.7 / PSI-MI XML 2.5 / XML 3.0 / MI-JSON |
| 全量体积 | intact.zip 807.1 MB(MITAB) |
| 访问通道 | Web / FTP / REST API / PSICQUIC / Cytoscape App |
| 查询语言 | MIQL(PSICQUIC 规范) |
| 许可 | 数据 CC BY 4.0;软件/转储 Apache 2.0 |
| 认证 | ELIXIR Core Data Resource;Global Core Biodata Resource |
| 引文 | Del Toro 2022 NAR(PMID 34761267) |
§3.2 数据发布口径的地图
- 月度滚动:每月一个 release;统计数字随之漂移——引用必须带 release 号(如 R252)与日期。
- 双口径并行:Binary Interactions(178 万)与 Interactions(92 万)并存且含义不同——规模引用必须指明口径。
- UniProt 同步戳:每个 release 标注对齐的 UniProt 版本(R252 ↔ 2025_04)——蛋白 ID 语义随 UniProt 演进。
- 人类口径的历史性:428,940 是 2025-07 的综述引用口径,不是某个 release 的官方快照——精确到月的数字应查当月 release 统计页。
- IMEx 联合口径:IntAct 下载文件含 IMEx 成员(MINT/DIP/UniProtKB 策划团队)记录——“全库"与"仅 IntAct 团队策划”(source database 列 MI:0469)是两个口径。
§3.3 DAIMS 数据AI就绪度评估
| # | 维度 | 指标 | 评分(1-5) | 依据 |
|---|---|---|---|---|
| 1 | A 可获得 | 免费获取 | 5 | CC BY 4.0;无需注册 |
| 2 | A 可获得 | 获取流程 | 5 | FTP/API/PSICQUIC/Web 五通道 |
| 3 | A 可获得 | 分发格式 | 5 | MITAB/XML2.5/XML3.0/JSON 四格式 |
| 4 | A 可获得 | 历史版本回溯 | 4 | 月度 release 可溯;归档粒度一般 |
| 5 | D 文档 | 官方文档 | 5 | 用户指南/培训/DocBot |
| 6 | D 文档 | 方法透明度 | 5 | PSI 标准 + 策划规则全公开 |
| 7 | D 文档 | 引用规范 | 5 | 推荐引文(Del Toro 2022)+ 论文列表 |
| 8 | I 互操作 | 标识符 FAIR | 5 | EBI-xxx + UniProt AC 双 ID 体系 |
| 9 | I 互操作 | 本体对齐 | 5 | PSI-MI CV(GO 格式)+ NCBI taxon + ChEBI |
| 10 | I 互操作 | 跨资源整合 | 5 | PSICQUIC 50+ 服务;UniProt/Reactome 互链 |
| 11 | M 元数据 | 参数元数据 | 5 | 方法/物种/条件/角色/区域全 CV 化 |
| 12 | M 元数据 | 版本元数据 | 4 | release + UniProt 同步戳;人类快照粒度弱 |
| 13 | S 可持续 | 治理机制 | 5 | EMBL/ELIXIR 资助;IMEx 联盟治理;20+ 年连续 |
| 14 | S 可持续 | 资源持续供给 | 5 | Global Core Biodata Resource 认证 |
综合 63/70(4.5/5)——标准与互操作是教科书级:PSI-MI/PSICQUIC 就是"AI-Ready 数据格式"的行业原型;扣分仅在版本快照粒度与人类口径的历史性混用。
§3.4 存储与计算需求
- 全量 MITAB:807 MB zip(解压后数 GB)——pandas 单机可全装;42+ 列制表符。
- XML/JSON:完整 n-ary 结构更大(GB 级)——按需流式解析(SAX/ijson)而非全量 DOM。
- 网络内存:17.8 万互作分子、178 万边的无向图——networkx 单机轻松;全库含属性图建议 GraphML/Parquet。
- 增量策略:月度 release 差量小——固定版本号 + 逐月快照比"追 latest"更可复现。
- API 配额:批量大查询走 FTP;REST 适合单基因/小列表——避免逐行打公共 API。
§3.5 获取通道
- Web 门户:单蛋白/互作检索、MIQL 高级查询(Advanced Search)、Graph 网络视图、突变视图(ZAP70 例的"受突变影响的互作"高亮)。
- FTP:
ftp.ebi.ac.uk/pub/databases/intact/current/——intact.zip(全量 MITAB)、pmidMITAB27.zip(按文献打包)、psi25/psi30(XML)、句子级文本挖掘数据。 - REST API:
ebi.ac.uk/intact/ws/——JSON 响应,单基因/互作检索、interactor 详情、复杂查询。 - PSICQUIC:
ebi.ac.uk/Tools/webservices/psicquic/——注册表 50+ 服务;MIQL 语法统一;MITAB/XML 输出。 - Cytoscape App:IntAct App——分层视图(互作/区域/PTM/突变)、嵌套导航、多层过滤、子网络、命令行自动化。
- Complex Portal REST:
ebi.ac.uk/intact/complex-ws/——CPX 复合物查询与下载。
§3.6 口径对齐表
| 数字 | 口径 A | 口径 B | 使用建议 |
|---|---|---|---|
| 互作量 | 1,787,152(binary 投影) | 917,295(记录含 n-ary) | 规模引用分清两口径 |
| 人类互作 | 428,940(2025-07 综述口径) | 当月 release 统计页 | 历史口径 ≠ 当前快照 |
| 文献量 | 23,889(IntAct 全库) | 87,122(BioGRID 对照) | 深度 vs 广度两种策划 |
| 物种数 | 3,725(IntAct 收录) | 12,000+(STRING 含预测) | 实验证据 ≠ 预测覆盖 |
| 突变特征 | 90,968(全库) | 6,979(方向标注子集,PLM 用例) | 总量 ≠ 监督信号量 |
| 复合物 | CPX(手工策划) | hu.MAP3.0/MuSIC(预测,2025 起) | 实验与预测分开引用 |
§3.7 版本选择纪律
- 新分析:直接用当前 release(撰写时为 R252)——除非需衔接旧结果。
- 方法学写入:release 号 + 下载日期 + UniProt 同步版本三元组入论文方法节。
- 跨版本对比:月度滚动使"上月 vs 本月"差异含新增策划与 UniProt ID 演进——对比须先 diff ID 映射。
- 人类口径复现:428,940 这类历史数字要用当月统计重算——综述引用值不适合直接做当前基线。
- IMEx 口径声明:全库 or 仅 IntAct 团队策划(source 列过滤)——两者相差可观。
§3.8 数据文件与字段详表
| 数据面 | 粒度 | 关键字段 |
|---|---|---|
| MITAB 互作表 | 每二元对一行 | id_a/id_b(UniProt+isoform)、alt_id(EBI-xxx)、alias、method(MI:xxxx)、first_author、pmid、taxid_a/b、int_type(MI:0407 等)、source_db(MI:0469=intact)、int_id、特征列(mutation/binding site/stoichiometry) |
| Interactor 表 | 每分子一行 | EBI-xxx、UniProt AC、sequence、taxon、molecule type、别名、CV 项 |
| Experiment 层 | 每实验一组 | 方法、物种、载体/细胞系、宿主物种、检测条件 |
| 特征层 | 每特征一条 | feature type(binding site/mutation/modification)、原始/替换氨基酸、位点范围、效应(增强/削弱/无影响/破坏) |
| Complex Portal | 每 CPX 一条 | CPX 编号、名称、组分+化学计量、ECO 证据码、物种、定义、来源文献 |
| 句子数据 | 每证据句一条 | PMID + 句子 + 互作映射(文本挖掘语料) |
§4 数据结构
§4.1 对象模型
Experiment(实验:方法/物种/条件;通常对应一篇文献)
│ 1..n
▼
Interaction(互作记录;n-ary 允许)
│ 参与者 2..n
├──▶ Interactor A(蛋白/核酸/小分子;EBI-xxx)
├──▶ Interactor B(同上)
├──▶ 参数:stoichiometry / biological role(bait/prey)
└──▶ 特征:binding site / mutation(90,968)/ PTM 依赖
导出投影:
MITAB 行 = Interaction 的二元投影(n-ary 展开成对)
PSI-MI XML = 全结构(Experiment→InteractionSet→Interaction→Participant→Feature)
MI-JSON = 同 XML 语义的 JSON 树
关键语义:互作记录是"实验观察到的分子集合"——二元投影是分析便利,不是生物事实的全部。
§4.2 REST API 单蛋白查询
#!/usr/bin/env python3
"""IntAct REST API:取 TP53 (P04637) 的互作"""
import requests
BASE = "https://www.ebi.ac.uk/intact/ws"
# 1) 按 UniProt AC 找互作(JSON 分页)
r = requests.get(f"{BASE}/interaction/findInteractions",
params={"query": "uniprotkb:P04637",
"format": "json", "page": "0", "pageSize": "100"},
timeout=60)
r.raise_for_status()
data = r.json()
print("总命中:", data.get("totalCount"))
for rec in data.get("content", [])[:10]:
print(rec.get("ac"), "|", str(rec.get("summary"))[:80])
# 2) interactor 详情(EBI-xxxxxxx)
r2 = requests.get(f"{BASE}/interactor/EBI-366083", timeout=30)
print(r2.json().get("preferredName"), "|", r2.json().get("taxid"))
API 形态随版本演进:以
https://www.ebi.ac.uk/intact/ws/的 OpenAPI 描述为准;批量化请转 FTP。
§4.3 FTP 全量装载与网络构建
#!/usr/bin/env python3
"""下载全量 MITAB → pandas 解析 → 人类直接物理互作网络"""
import urllib.request, re
import pandas as pd
import networkx as nx
# 1) 下载(首次约 807 MB)
URL = "https://ftp.ebi.ac.uk/pub/databases/intact/current/psimitab/intact.zip"
urllib.request.urlretrieve(URL, "intact.zip")
# 2) 解压后读取(以实际解压出的 intact.txt 为准)
cols = ["id_a","id_b","alt_a","alt_b","alias_a","alias_b",
"method","first_author","pub_id","taxid_a","taxid_b",
"int_type","source_db","int_id","confidence"]
df = pd.read_csv("intact.txt", sep="\t", comment="#", header=None,
usecols=range(15), names=cols, dtype=str)
# 3) 拆解 PSI-MI 复合字段
df["method_mi"] = df["method"].str.extract(r'"(MI:\d+)"')
df["method_nm"] = df["method"].str.extract(r'\(([^)]+)\)')
df["pmid"] = df["pub_id"].str.extract(r'pmid:(\d+)')
df["int_type_mi"] = df["int_type"].str.extract(r'"(MI:\d+)"')
df["src_mi"] = df["source_db"].str.extract(r'"(MI:\d+)"')
df["uni_a"] = df["id_a"].str.extract(r'uniprotkb(?:/kb)?:([\w-]+)')
df["uni_b"] = df["id_b"].str.extract(r'uniprotkb(?:/kb)?:([\w-]+)')
# 4) 过滤口径示例:人类 + 物理互作(direct MI:0407 / association MI:0915)
m = (df["taxid_a"].str.contains(r'taxid:9606\b', na=False)
& df["taxid_b"].str.contains(r'taxid:9606\b', na=False)
& df["int_type_mi"].isin(["MI:0407", "MI:0915"])
& df["uni_a"].notna() & df["uni_b"].notna() & (df["uni_a"] != df["uni_b"]))
human = df[m].drop_duplicates(subset=["uni_a","uni_b","pmid","method_mi"])
print("人类物理互作(按文献-方法去重):", len(human))
# 5) 建图 + 枢纽分析
G = nx.Graph()
G.add_edges_from(zip(human["uni_a"], human["uni_b"]))
print("节点:", G.number_of_nodes(), "边:", G.number_of_edges())
print("top hubs:", sorted(G.degree, key=lambda x: -x[1])[:8])
§4.4 方法分层与证据分级扫描
#!/usr/bin/env python3
"""按方法分层评估一个靶点列表的证据强度"""
TIERS = {"结构级": ["MI:0114"], # x-ray crystallography
"生化级": ["MI:0006", "MI:0018"], # coip / Y2H
"复合物级": ["MI:0004"]} # affinity chromatography tech 类
def evidence_tier(sub: pd.DataFrame) -> dict:
out = {}
for tier, mis in TIERS.items():
n = sub[sub["method_mi"].isin(mis)]["pmid"].nunique()
out[tier] = {"methods": int(n), "pmids": int(n)}
out["总文献"] = int(sub["pmid"].nunique())
return out
targets = ["P04637", "Q09472", "P43403"] # TP53 / EP300 / ZAP70
for t in targets:
sub = human[human["uni_a"].eq(t) | human["uni_b"].eq(t)]
print(t, evidence_tier(sub))
§4.5 突变特征提取
#!/usr/bin/env python3
"""从 MITAB 特征列提取突变-互作方向标注(增强/削弱/无影响/破坏)"""
import re
def mut_effects(feat: str):
out = []
for seg in str(feat).split("|"):
if "mutation" not in seg:
continue
mi = re.search(r'"(MI:\d+)"', seg) # 效应 CV
orig = re.search(r"original:([A-Za-z\-0-9]+)", seg)
repl = re.search(r"replacement:([A-Za-z\-0-9]+)", seg)
rng = re.search(r"range:([\d\-,]+)", seg)
out.append({"effect": mi.group(1) if mi else None,
"orig": orig.group(1) if orig else None,
"repl": repl.group(1) if repl else None,
"site": rng.group(1) if rng else None})
return out
# 效应 CV 速记:
# MI:1125 decreased / MI:1126 increased
# MI:2228 no effect / MI:2229 disrupted
# 产出:数千条 (突变, 方向, 位点, PMID) —— 突变效应模型的监督信号
§4.6 PSICQUIC 联邦查询
#!/usr/bin/env python3
"""PSICQUIC:一个语法查询 50+ 互作服务"""
import requests
REG = "https://www.ebi.ac.uk/Tools/webservices/psicquic/registry/psicquic/active/"
services = requests.get(REG, headers={"Accept": "application/json"}, timeout=30).json()
print("服务数:", len(services), "示例:", [s["name"] for s in services[:8]])
# 查 IntAct:P53 的人类互作,MITAB 输出
r = requests.get(
"https://www.ebi.ac.uk/Tools/webservices/psicquic/intact/webservices/current/search/interactor/P04637",
params={"format": "tab25", "query": "species:9606"}, timeout=60)
rows = [ln.split("\t") for ln in r.text.strip().split("\n") if ln]
print("返回行数:", len(rows), "首行 A 侧:", rows[0][0][:40])
§4.7 完整性清单
发布即检(建议写进流水线):
- release 号与下载日期已固定(URL 带
current的快照要存档); - 二元/记录双口径的统计对齐(读后行数 vs 官网统计);
- method/int_type/taxid/source_db 四列 CV 拆解成功(
MI:\d+抽取命中率); - 自互作(uni_a==uni_b)与 isoform 后缀的处理策略已声明;
- 按文献去重(pmid+方法)后保留的口径与论文一致;
- XML/JSON 路径(若需要 n-ary)的化学计量字段解析测试。
§4.8 数据血缘
期刊文献 / 预印本 / 作者直接提交
│
▼
IMEx 成员策划(IntAct/MINT/DIP/MatrixDB/IID/InnateDB/UniProt-SIB…统一规则)
│ 记录物理写入
▼
IntAct 主库(EBI)──每月 release──▶ FTP/XML/JSON/MITAB
│ │
├──▶ Complex Portal(CPX 复合物)│
├──▶ UniProt 条目互作区 │
├──▶ PSICQUIC 50+ 服务 │
└──▶ mentha 自动整合门户 ▼
终端分析(网络/AI)
反向血缘:每条互作记录可回溯到实验(方法/条件)→ 文献(PMID)→ 策划团队(source CV)→ 发布版本——四层溯源链完整。
§4.9 与 UniProt/Reactome 的整合消费
#!/usr/bin/env python3
"""把 IntAct 邻域接到 UniProt 功能注释(伪代码骨架)
1) 取靶点 IntAct 邻居(MITAB 过滤)
2) UniProt ID → GO/Reactome(UniProt REST)
3) 富集分析(gProfiler/clusterProfiler)
"""
NEIGHBORS = {"P04637": {"Q09472", "P43403", "Q13547"}} # 来自 §4.3 输出
for target, neigh in NEIGHBORS.items():
# UniProt REST: /uniprotkb/{ac}.json → goComponent/GO/Reactome 字段
for ac in neigh:
# r = requests.get(f"https://rest.uniprot.org/uniprotkb/{ac}.json")
# go_terms = [x["properties"]["value"] for x in r.json()["uniProtKBCrossReferences"] if x["database"]=="GO"]
pass
# → GO 富集 → 功能解读
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 主资源 | 配套 | 输出 |
|---|---|---|---|
| 靶点互作档案 | IntAct Web/REST | UniProt | 方法分层互作清单 |
| 全基因组网络 | FTP MITAB | networkx/igraph | 加权图 + 拓扑指标 |
| PPI 链接预测 | MITAB + 方法列 | 负例策略(§6.4) | AUROC/AUPR |
| 突变效应预测 | 特征列方向标注 | PLM/序列模型 | 方向分类器 |
| 复合物证据 | Complex Portal | IntAct 互作边 | 组装体清单 |
| 跨库一致性 | PSICQUIC 多服务 | 去重键(pmid+对) | 一致性报告 |
| 文献关系抽取 | 句子级数据 | NLP 模型 | 抽取器 + F1 |
§5.2 单靶点深度解读协议
- 取边:
uniprotkb:<AC>全量互作(Web/REST); - 分层:方法 CV 三档(结构/生化/复合物)+ 互作类型过滤(剔除 co-localization);
- 上下文:物种、组织/细胞系、bait/prey 角色;
- 区域:结合区域注释 → 界面残基清单;
- 突变:特征列突变 → 哪些位点变动影响互作;
- 文献:PMID 清单 → 关键论文原文复核;
- 产出:靶点互作档案(一页纸:邻域 + 证据强度 + 区域 + 突变)。
§5.3 网络模块挖掘协议
- 建图(方法过滤后)→ 权重可选(按方法档位/文献数);
- 聚类:MCL 或 ClusterONE → 候选复合物/模块;
- 对照:与 Complex Portal 已知复合物对齐(Jaccard);
- 富集:模块 GO/Reactome → 功能命名;
- 稳健性:跨 release 重跑 → 模块稳定性报告。
§5.4 PPI 预测评测协议
- 真值:IntAct 人类物理互作(固定 release);
- 切分:按 PMID 切(同一文献不跨训练/测试);
- 负例:策略显式(随机/定位不交叠/表达不共现)+ 敏感性分析(≥2 种负例报告波动);
- 基线:随机、度保持随机、STRING 实验通道子集;
- 指标:AUROC + AUPR(正负比例失衡时 AUPR 优先);
- 去泄漏:序列相似度阈值(Bernett 类去冗余)双报告。
§5.5 成本模型
| 动作 | 成本 | 频率 |
|---|---|---|
| FTP 全量下载 | 807 MB / 半小时 | 每 release |
| 解析入库 | 单机分钟级 | 每 release |
| REST 单靶点 | 秒级 | 日常 |
| Cytoscape 会话 | 分钟级 | 交互 |
| 文献复核(PMID 原文) | 小时级 | 关键结论 |
§5.6 失败模式清单
- 把 co-localization 当结合:未过滤互作类型——图密度虚高;
- hub 爆炸:TP53 度数千拖垮可视化与采样——分层采样/剪枝;
- isoform 重复计数:
P04637-1与P04637同对重复——先定投影规则; - 负例泄漏:随机负样本撞上"真实未发表"互作——多策略敏感性;
- 文献泄漏:同 PMID 跨 train/test——按文献切;
- 版本漂移:上月数字本月对不上——release 固定;
- IMEx 口径混淆:MINT/DIP 记录被当成 IntAct 策划——source 列检查;
- API 滥用:逐行打 REST 拉全库——被限流/超时,改 FTP。
§6 实证结果与方法学分析
§6.1 二十二年增长的三段结构
- 2004-2012(奠基期):~2,200 → 数万;三组件模型与 CV 体系定型;Swiss-Prot 合作策划;
- 2013-2019(联盟期):MIntAct 平台化(11 库共用);IMEx 规则成熟;数据量进入十万级;
- 2020-2026(精细期):"fine-grained"定位(Del Toro 2022);突变特征 9 万级;定量互作(Kd/fragmentomics)与蛋白形层级出现;178 万 binary。
增长动力从"录更多文献"转向"录得更深"——单位文献的注释密度持续上升。
§6.2 深度策划的实证代价与收益
- 代价:23,889 篇 vs BioGRID 87,122 篇——单位文献策划成本高一个量级;
- 收益:每篇平均 75 条二元互作全提取(完整性承诺);区域/PTM/突变层只有这里成体系;
- 推论:做"广度索引"用 BioGRID,做"证据深读"用 IntAct——两库是互补不是替代。
§6.3 突变标注的实证规模
- 全库突变特征 90,968 条(R252);
- 其中有明确方向标注(增强/削弱)的约 6,979 条(PLM-interact 引用口径);
- PLM-interact 用这 6,979 条做监督:零样本下所有方法接近随机;全层微调后 AUPR +150%、AUROC +36%;
- 方法论启示:小样本方向标注 + 预训练序列模型 = 突变效应任务的可行配方;阴性标注(无影响)同样重要——排除候选界面。
§6.4 负例构造策略的实证比较
| 策略 | 做法 | 主要偏倚 | 适用 |
|---|---|---|---|
| 随机配对 | 无记录对随机采 | 采到真实未发现互作 | 快速基线 |
| 亚细胞不交叠 | 定位注释不重叠对 | 结构先验过强 | 保守负例 |
| 表达不共现 | 组织表达不重叠 | RNA 质量依赖 | 中庸 |
| 文献阴性 | "不互作"报告 | 样本极少 | 补充 |
纪律:评测报告 ≥2 种负例策略的结果区间——单策略负例的 SOTA 数字不可信。
§6.5 八个真实坑点
- 坑点 1:双口径混写——178 万 binary ≠ 92 万 records;引用必须选边并注明。
- 坑点 2:co-localization 污染——未剔 MI:0403 的网络分析把"同区室"当"结合";图密度虚高。
- 坑点 3:负例污染——随机负例混入真实未发表互作;负例策略 + 敏感性分析双报告。
- 坑点 4:文献泄漏——同 PMID 跨 train/test 虚高指标;按文献切分。
- 坑点 5:isoform 投影——
-1后缀与 canonical 聚合规则未声明;同对重复计数。 - 坑点 6:IMEx 来源混淆——MINT/DIP 遗留记录当 IntAct 策划;source 列(MI:0469)过滤。
- 坑点 7:版本漂移——月度滚动使数字对不上;release 号 + 日期 + UniProt 同步三元组入方法节。
- 坑点 8:API 拉全库——REST 逐行查询打爆公共接口;批量走 FTP。
§6.6 审稿人自查清单
- [ ] release 号 + 下载日期 + UniProt 同步版本三元组?
- [ ] binary vs records 口径声明?
- [ ] 方法过滤规则(保留了哪些 MI 编号)?
- [ ] 负例策略 + 敏感性分析?
- [ ] 按 PMID 切分的去泄漏声明?
- [ ] isoform 投影规则?
- [ ] IMEx 成员记录的来源处理?
- [ ] 与 STRING/BioGRID 对照时的口径差异说明?
§6.7 版本治理的方法学含义
月度滚动 + UniProt 同步是"活的数据库":ID 映射演进(merge/demerge)、方法 CV 增补、策划回溯修正都会改变数字。可复现的最小实践是版本三元组入方法学 + 全量快照存档(下载即存,不追 current);跨版本结果对比前先做 ID diff。
§6.8 与人类遗传学证据的整合张力
把 IntAct 突变特征用于疾病解读的边界:一条"Y233F 削弱互作"的证据支持"该位点在界面",但不等于患者的 VUS 致病——还需要:位点保守性、人群频率、家族共分离、功能实验。互作证据是链条一环,单独不构成因果结论。审稿常见退稿理由恰是"用互作邻域富集直接宣布致病机制"。
§6.9 互作类型语义的解读纪律
MI:0407 direct interaction:分子直接接触(共晶/生化证据);MI:0915 physical association:物理关联但接触面未定;MI:0403 co-localization:仅共定位——不是结合;MI:0914 association:功能关联,物理性未证。
分级使用:结构建模只取 0407;网络分析可放宽到 0915;0403 只做背景参考。一句纪律:互作类型列不读,等于没读 IntAct。
§7 AI 就绪指南与应用场景
§7.1 IntAct 在医疗 AI 中的四种喂法
- 图监督:PPI 链接预测/互作类型分类——节点特征(序列 embedding+GO)+ 边标签(方法分层);
- 序列监督:突变方向标注微调 PLM(PLM-interact 范式)——6,979 条方向对;
- 知识检索:RAG 语料——"蛋白 X 的互作伙伴与证据"结构化查询;
- 负样本工程:定位/表达先验负例 + 阴性突变标注——评测集构造。
§7.2 网络挖掘管线实操配方
FTP 全量 → 口径过滤(物种/类型/方法) → 去重(pmid+方法+对)
→ 建图(networkx) → 模块聚类(MCL/ClusterONE)
→ Complex Portal 对照 → GO/Reactome 富集 → 模块命名报告
关键旋钮:方法白名单、去重粒度、聚类分辨率——报告所有旋钮设置。
§7.3 突变效应模型选型
| 模型 | 输入 | 何时用 |
|---|---|---|
| PLM 微调(全层) | 序列对 + 突变 | 有 6k+ 方向标注、算力充足 |
| PLM + 分类头 | 同上(冻结) | 算力受限(效果弱于全层) |
| 结构先验规则 | 共晶/AlphaFold 界面 | 无标注冷启动 |
| 集成 | 结构 + PLM | 稳健生产 |
实证锚点:PLM-interact 全层微调 AUPR +150%/AUROC +36%(相对零样本)——冻结嵌入不足以学到方向语义。
§7.4 公平性:基因宇宙的覆盖偏倚
IntAct 继承了文献宇宙的马太效应:TP53/EGFR 类蛋白的互作记录是冷门蛋白的百倍;冷门蛋白的"邻居少"不是生物学事实而是策划史。AI 后果:链接预测模型在热门子图上指标虚高、对冷门蛋白失效。对策:按文献年代/方法覆盖分桶评测;报告 per-bin 指标;谨慎外推到 under-studied 基因(IMPC 的教训同样适用于互作宇宙)。
§7.5 任务×资源速查表
| AI 任务 | IntAct 用法 | 关键字段 | 评测要点 |
|---|---|---|---|
| 链接预测 | 正例边 + 方法分层 | int_type/method | 按文献切 + 负例敏感性 |
| 突变效应 | 方向标注 6,979 | feature/effect/site | 类别不平衡处理 |
| 互作类型分类 | 类型 CV | int_type | 层级标签处理 |
| 复合物预测 | 边 + CPX 对照 | source/CPX | 与已知复合物 Jaccard |
| 文本抽取 | 句子级语料 | 句子+映射 | 实体规范化错误率 |
| 靶点推荐 | 邻域 + 突变热点 | 邻域+效应 | 前瞻验证设计 |
§7.6 端到端案例:疾病基因的互作机制假设
场景:外显子组发现患者错义突变(基因 G,位点 p.R300C)。
1) UniProt 定位 p.R300C → 命中 IntAct binding site 注释区域
2) 该区域互作对(A×B)的方法分层:共晶 1 篇 + coip 3 篇
3) 特征列:同位点系列突变(R300A/K)标注"削弱"(MI:1125)
4) 邻域富集:伙伴集中于 DNA 修复通路(GO:0006281)
5) 结论表述:该突变位于有实验证据的结合界面,系列突变显示
削弱效应,通路归属提示 DNA 修复机制假设 → 待功能实验验证
注意结论的强度控制:这是"机制假设的一环证据",不是致病性判定。
§7.7 报告模板:方法学段落骨架
相互作用数据取自 IntAct Release 252(2026-01,与 UniProt 2025_04 同步)。
分析使用二元投影(1,787,152 条);保留互作类型 MI:0407 与 MI:0915,
剔除 MI:0403(共定位);物种限定 Homo sapiens(taxid 9606);
同一蛋白对-文献-方法重复记录按 (UniProt A, UniProt B, PMID, MI method)
去重。isoform 投影保留 canonical 形态。数据于 <日期> 下载并存档
(URL/MD5 见补充材料)。预测评测按来源文献(PMID)切分训练与测试,
负例采用 <策略 A> 与 <策略 B> 双策略敏感性分析。
§7.8 成本与排期模板
| 阶段 | 工作 | 预算 |
|---|---|---|
| 周 1 | FTP 下载 + 解析入库 + 口径过滤 | 0.5 人日 |
| 周 1-2 | 网络构建 + 拓扑 + 分层统计 | 1 人日 |
| 周 2 | 模块聚类 + CPX 对照 + 富集 | 1-2 人日 |
| 周 3 | (预测任务)切分 + 负例 + 训练评测 | 3-5 人日 |
| 周 4 | 文献复核 + 方法学写作 | 1-2 人日 |
§7.9 消融案例:方法过滤对网络指标的影响
同一人类子集,三档过滤的典型差异(示意量级,具体以自算为准):
- 全类型(含 co-localization):边数最大、度分布最平(人人相连);
- 剔除 0403:边数下降数成,模块化上升;
- 仅 0407+0915:边数最少、hub 度锐减、富集最锐利。
教训:网络指标(密度/聚类系数/中心性)是过滤口径的函数——不报口径的拓扑对比无效。
§8 伦理、许可与合规
§8.1 许可与义务结构
| 资产 | 许可 | 义务 |
|---|---|---|
| 互作数据(XML/JSON/MITAB/网页) | CC BY 4.0 | 署名(引用推荐文献) |
| 软件/网站/服务/Curator Tool | Apache 2.0 | 许可声明与 NOTICE |
| SQL 与图数据库转储 | Apache 2.0 | 同上 |
| 品牌与美术物料 | Apache 2.0 | 署名 |
| IMEx 联合数据(成员记录) | CC 署名许可 | 按成员引用规范 |
§8.2 引用与致谢模板
数据来源:IntAct Molecular Interaction Database, EMBL-EBI
(https://www.ebi.ac.uk/intact),Release 252(2026-01)。
引用:Del Toro N et al. The IntAct database: efficient access to
fine-grained molecular interaction data. Nucleic Acids Res.
2022;50(D1):D648-D653. PMID: 34761267.
(使用 Complex Portal 时另引:Balu S et al. NAR 2025, PMID 39558156)
§8.3 国内合规路径
- CC BY 4.0 属于"开放许可"范畴,商用/科研均可,署名义务需履行;
- 数据无人类受试者信息(分子层面数据)——不涉人类遗传资源管理材目录的出境审批;
- 数据下载后进入本地系统的边界:署名 + 版本声明 + 免责继承(官网 disclaimer:不担保正确性、可能受专利约束);
- 产品集成(如临床决策支持)时建议:独立数据审计 + 免责声明 + 引用页。
§8.4 商业使用边界
- 允许:商业软件集成、数据库产品内嵌、衍生分析服务(CC BY 4.0 + Apache 2.0 均允许商用);
- 注意:部分数据可能受第三方专利约束(官方免责声明明确提示);商标与 logo 使用按品牌规范;
- 竞品场景(互作数据库产品)使用其数据:许可允许但商业伦理上建议差异化增值。
§8.5 合规台账最小模板
| 字段 | 示例 |
|---|---|
| 数据集 | IntAct Release 252(2026-01) |
| 下载 URL/日期 | ftp.ebi.ac.uk/.../intact.zip / 2026-09-20 |
| 许可 | 数据 CC BY 4.0;软件 Apache 2.0 |
| 署名方式 | Del Toro 2022 NAR 引用 |
| 使用场景 | 靶点互作检索模块 |
| 改动 | 过滤(物种/类型)+ ID 映射 |
| 再分发 | 附许可文本 + 版本戳 |
§8.6 IMEx 治理语义
IMEx 的治理是"规则统一 + 数据集中 + 品牌分散":策划规则、质量门槛、许可条款统一;数据物理集中在 IntAct(单点权威);各成员库保留自己的门户与用户群(回迁子集展示)。SAB(18 个月评审)提供科学监督。这套结构避免了联盟常见的"数据漂移"问题——任何成员的策划都直接进入中央库,不存在"双库不一致"的中间态。
§9 谱系与生态
§9.1 分子互作数据库时间线
| 年份 | 事件 |
|---|---|
| 1999-2003 | DIP/BIND/MINT 等第一代互作库上线 |
| 2004 | IntAct 创刊(NAR;~2,200 互作) |
| 2004-2010 | HUPO-PSI 标准化(PSI-MI 1.0→2.5);IMEx 规则确立 |
| 2010-2015 | 第二代整合(iRefIndex 停更前整合期);IMEx 平台化(MIntAct 2013) |
| 2015 | Complex Portal 上线 |
| 2015-2022 | STRING/IntAct 双雄格局;PSICQUIC 生态成熟 |
| 2022-2026 | fine-grained 深度注释时代:突变特征、定量互作、蛋白形层级、预测复合物(CP 内标注) |
§9.2 术语表
| 术语 | 含义 |
|---|---|
| MITAB | PSI 分子互作制表符格式(binary 投影;≥42 列) |
| PSI-MI | HUPO-PSI 分子互作标准(XML/表格双形态) |
| MI-JSON | JSON 形态的 PSI-MI 数据(浏览器友好) |
| MIQL | 分子互作查询语言(PSICQUIC 规范) |
| PSICQUIC | 互作数据标准 Web 服务协议(SOAP+REST) |
| n-ary | 多分子(≥3)互作记录(不拆分为对) |
| spoke model | n-ary 按"饵-猎物"星形投影成对的扩展方式 |
| deep curation | IMEx 深度策划:一篇文章全部互作完整提取 |
| IMEx | 国际分子交换联盟(策划共享联盟) |
| biocurator | 专业文献策划员 |
| bait/prey | 亲和纯化实验中的诱饵/猎物分子角色 |
| ECO | 证据与结论本体(Complex Portal 证据标注) |
| VUS | 意义未明变异(ACMG 分级) |
| CPX | Complex Portal 复合物编号 |
§9.3 资源选型决策树
需要互作数据?
├─ 每条边要文献/方法证据 ──▶ IntAct(或 BioGRID 广度版)
│ ├─ 需要 n-ary/化学计量 ──▶ PSI-MI XML/JSON(非 MITAB)
│ ├─ 需要突变方向 ──▶ 特征列 + MI:1125/1126/2228/2229
│ └─ 需要复合物 ──▶ Complex Portal(CPX)
├─ 要预测补全/大网络 ──▶ STRING(评测剔预测通道)
├─ 要跨库一站 ──▶ PSICQUIC registry
├─ 要 IMEx 动态整合 ──▶ mentha
└─ 要突变/化学/CRISPR 模块 ──▶ BioGRID
§9.4 与本库其他条目的关系
- UniProt 条目:IntAct 的 ID 主轴与同步基准;UniProt 条目页的互作区直接展示 IntAct 记录;
- STRING 类条目(如若有):预测融合 vs 实验纯度的对照组;
- Open Targets:把 PPI 证据纳入靶点优先级时,IntAct 是"实验互作"通道的源头之一;
- 药物发现类条目(DrugBank 等):靶点-药物网络与靶点-靶点互作网络的两层图。
§9.5 组合使用建议
- IntAct + Complex Portal:互作边 + 组装体单位——网络到机器的完整语义;
- IntAct + UniProt 变异:ClinVar/突变库位点 ↔ 界面注释——VUS 机制假设;
- IntAct + STRING:实验子图 + 预测扩展——候选边排序(实验边为种子);
- IntAct + AlphaFold:界面区域注释 + 结构模型——界面可药性评估;
- IntAct + IMEx 兄弟库:子领域深读(MatrixDB 细胞外基质、InnateDB 免疫)。
§9.6 互作数据的生态角色
IntAct 是互作数据的"清算所"(clearinghouse):上游(文献/提交/成员库)→ 中央策划 → 下游(门户/工具/模型)全链路。它不直接做终端产品(如药物发现 SaaS),但一切终端产品都可以经 PSICQUIC/FTP 消费它——"基础设施不做应用"的定位与 ELIXIR 的使命一致。
§9.7 互作资源家族的光谱定位
纯实验 ◀────────────────────────▶ 重预测
IntAct BioGRID MINT/DIP mentha IID STRING
深注释 ◀────────────────────────▶ 浅注释
(区域/PTM/突变只有最左端成体系)
§9.8 IntAct 生态的圈层地图
| 圈层 | 成员 | 关系 |
|---|---|---|
| 核心 | IntAct 主库 + Complex Portal | 同团队 |
| 联盟 | DIP/MINT/MatrixDB/IID/InnateDB/UniProt-SIB | IMEx Active |
| 观察层 | BioGRID/PrimesDB | IMEx Observer |
| 消费层 | UniProt/Reactome/InterMine 系/mentha | 数据消费与展示 |
| 工具层 | Cytoscape(App)/ComplexViewer/PSICQUIC 客户端 | 可视化与访问 |
| 标准层 | HUPO-PSI(PSI-MI/PSICQUIC)/ECO/ChEBI/NCBI taxon | 规范基座 |
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | URL |
|---|---|
| IntAct 首页 | https://www.ebi.ac.uk/intact |
| About/统计 | https://www.ebi.ac.uk/intact/about |
| 下载页 | https://www.ebi.ac.uk/intact/downloads |
| REST API | https://www.ebi.ac.uk/intact/ws/ |
| Complex Portal | https://www.ebi.ac.uk/complexportal |
| IMEx 联盟 | https://www.imexconsortium.org |
| PSICQUIC 注册表 | https://www.ebi.ac.uk/Tools/webservices/psicquic/ |
| Cytoscape App 文档 | https://ebi-intact.github.io/IntActApp/ |
| FTP 根 | https://ftp.ebi.ac.uk/pub/databases/intact/current/ |
| 支持 | https://www.ebi.ac.uk/support/intact |
§10.2 关键文献
| 论文 | 价值 | 标识 |
|---|---|---|
| Hermjakob 2004(创刊) | 数据模型与 CV 体系起源 | NAR 32:D452-5; PMID 14681455; doi:10.1093/nar/gkh052 |
| Orchard 2013(MIntAct) | 11 库共同策划平台 | PMID 24234451; doi:10.1093/nar/gkt1115 |
| Del Toro 2022(推荐引文) | fine-grained 定位与现状 | NAR 50:D648-653; PMID 34761267 |
| Balu 2025(Complex Portal) | 预测复合物与可视化 | PMID 39558156; doi:10.1093/nar/gkae1085 |
| PLM-interact(Nat Commun) | 突变效应微调用例 | IntAct 6,979 方向标注 |
| Nature 系统综述 2026 | 人类 428,940 口径 | s41540-026-00698-z |
§10.3 站内延伸阅读
- UniProt 蛋白质数据库 — ID 主轴与同步基准
- STRING 蛋白互作网络 — 预测融合路线对照(若已发布)
- BioGRID 蛋白与遗传互作 — 广度策划对照(若已发布)
- ChEBI 化学实体本体 — 小分子互作对象的 ID 体系
- DrugBank 药物数据库 — 药物-靶点网络的另一半
- AlphaFold 蛋白结构数据库 — 界面结构先验
§10.4 FAQ
Q1:IntAct 的数据从哪来?
只来自两条通道:专家对同行评议文献的逐篇策划,以及作者直接提交(论文发表前)。不收录预测互作。
Q2:IntAct 与 STRING 最大的区别?
IntAct 只有实验证据、保留方法与文献细节、无综合评分;STRING 融合预测与文本挖掘、给综合置信分。做"证据"研究用 IntAct,做"补全网络"用 STRING(评测时剔除预测通道)。
Q3:1,787,152 和 917,295 两个数什么关系?
后者是数据库互作记录数(含 n-ary 复合物记录),前者是把 n-ary 投影成二元对后的条数。一个 5 蛋白复合物记录投影贡献 C(5,2)=10 条二元对。
Q4:哪些数据库的策划数据会进 IntAct?
IMEx Active 成员:DIP、MINT、MatrixDB、IID、InnateDB、UniProt group(Swiss-Prot/SIB)、EMBL-EBI 自身。BioGRID 只是 Observer。全部 IMEx 数据物理集中于 IntAct。
Q5:IntAct 收录多少物种?
Release 252 覆盖 3,725 个物种(含人类、模式生物与宿主-病原对中的微生物)。
Q6:人类互作有多少?
2025-07 统计口径:428,940 条直接/物理关联的人类 PPI。全库二元互作 178 万(R252)。两套口径并存,引用时注明。
Q7:怎么引用 IntAct?
推荐引文:Del Toro N et al., “The IntAct database: efficient access to fine-grained molecular interaction data,” Nucleic Acids Res 50(D1):D648-653, 2022(PMID 34761267)。创始论文:Hermjakob H et al., NAR 2004;32:D452-5(PMID 14681455)。
Q8:许可证是什么?要注册吗?
数据 CC BY 4.0(含 XML/JSON/MITAB 与网页服务访问);软件 Apache 2.0。FTP/API 免注册使用。
Q9:什么是 MITAB 2.7?
PSI 标准的制表符表格格式(binary 投影),≥42 列,含 ID/别名/方法/文献/物种/互作类型/来源库/特征等。全量 zip 约 807 MB,pandas/R 可直接装载。
Q10:MI-JSON 是什么?
为浏览器解析设计的 JSON 格式(PSI-MI XML 不适合浏览器直解),ComplexViewer 与多个前端基于它。
Q11:什么是 MIQL?
分子互作查询语言(Molecular Interactions Query Language),PSICQUIC 规范定义的标准查询语法,支持字段:值 + 布尔组合(如 species:9606 AND method:"MI:0018")。
Q12:PSICQUIC 是什么?
HUPO-PSI 的标准 Web 服务规范(SOAP+REST),定义每个互作数据提供方必须实现的最小方法集;注册表里现有 50+ 服务(IntAct/MINT/DIP/InnateDB 等),统一 MIQL 语法。
Q13:为什么 IntAct 没有综合置信分?
设计哲学不同:不造黑盒分数,把方法、文献、条件全给你,由你按研究问题自行加权。需要分数可看 STRING 或 IID。
Q14:n-ary 互作如何导出?
MITAB 只保留二元投影;完整 n-ary 结构(含化学计量)需 PSI-MI XML 2.5/3.0 或 MI-JSON。
Q15:突变特征是什么?有多少?
90,968 条(Release 252):突变对互作影响的机器可读记录,含方向(增强/削弱/无影响/破坏)与位点。其中有方向标注的约数千条(PLM-interact 工作用了 6,979 条增强/削弱注释)。
Q16:怎么找"某篇论文的所有互作"?
MIQL:pubid:<PMID>;或用按文献打包的 pmidMITAB27.zip。IMEx 规则要求一篇文章全部实验证明互作被完整策划,因此返回即"全量"。
Q17:怎么过滤"只看直接物理互作"?
用互作类型 CV:保留 MI:0407(direct interaction)/ MI:0915(physical association),剔除 MI:0403(co-localization)等弱证据。
Q18:IntAct 的 Complex Portal 是什么?
姊妹项目:手工策划的大分子复合物百科(CPX 编号),复合物定义 = ≥2 分子 + 体外可重建 + 已证明特定分子功能;含化学计量/拓扑/结合区域;2025 年起新增 hu.MAP3.0 与 MuSIC 的高置信预测人类复合物(显式标注预测)。
Q19:Complex Portal 的数据格式?
PSI-MI XML 2.5/3.0 + ComplexTAB(复合物专用 tab 格式);REST API 在 intact/complex-ws 路径;可视化用 ComplexViewer(SVG 2D,可缩放到序列与子复合物)。
Q20:Cytoscape 怎么用 IntAct?
装 IntAct App:分层视图(互作/区域/PTM/突变)、预定义样式、多层过滤、子网络、session 保存;核心功能支持命令行自动化;PSICQUIC 桥接可跨服务扩展网络。
Q21:数据多久更新一次?
每月一个 release;Release 252(2026-01)与 UniProt 2025_04 同步。跨版本计数会漂移,引用需带版本号。
Q22:什么是 ELIXIR Core Data Resource?
欧洲生命科学基础设施(ELIXIR)认定的核心数据资源,标志其长期资助与保存地位;IntAct 同时是全球核心生物数据资源(Global Core Biodata Resource)。
Q23:IntAct 有 AI 聊天助手吗?
有:DocBot 站内问答(EMBL-EBI Terms of Use 约束,不收集个人数据)。
Q24:可以做 PPI 链接预测吗?
可以,但 IntAct 是正例库:负例需自行构造(随机对/亚细胞不交叠/表达不共现等),方法节必须报告策略与敏感性分析;切分按 PMID 防文献级泄漏。
Q25:突变效应预测的监督信号从哪来?
特征列的突变注释(增强/削弱/无影响),有方向标注的约 6,979 条(PLM-interact 用例)——小样本全层微调优于仅调分类头。
Q26:GNN 训练有什么特殊注意?
hub 偏置(TP53 度数千):分层采样/去冗余;同一文献多方法重复记录需去重;isoform 投影先固定映射规则。
Q27:IntAct 与 UniProt 的关系?
双向联动:UniProt 条目展示 IntAct 互作;IntAct 用 UniProt 作蛋白 ID 主轴并与其 release 同步(2025_04);两家还做了 isoform 与 N 端蛋白形的联合策划。
Q28:有哪些近期特色数据集?
GPCR-RAMP 互作组(215 GPCR/122 强互作/23 内源复合物,含 Kd);定量 fragmentomics(Gogl 2022);N 端蛋白形(Gevaert lab,VIB Ghent)。
Q29:数据里有负向互作(“确认不互作”)吗?
极少。个别文献报告阴性结果会被记录,但体量远小于正例;做负样本不能指望它。
Q30:下载文件为什么有 DIP/MINT 记录?
IMEx 成员策划写 IntAct + 历史遗留数据。看 MITAB 第 13 列(source database)分辨;psi-mi:"MI:0469"(intact) 才是 IntAct 团队策划。
Q31:如何做"方法分层"评测?
按检测方法 CV 分层:如"仅 Y2H(MI:0018)子集"评 Y2H 可预测性,"仅共晶(MI:0114)子集"评物理结合判定。方法异质性是 PPI 评测的主要混杂。
Q32:IntAct 记录蛋白-小分子互作吗?
是(Interactor 含 small molecule,ID 走 ChEBI);同样蛋白-DNA/RNA(12,320 核酸)也收录。
Q33:句子级文本挖掘数据是什么?
FTP 上的辅助产物:把策划中的证据句子按文献整理,供 NLP 研究训练关系抽取模型——IntAct 对"从文本到结构"全链路开放的体现。
Q34:团队规模与历史人物?
创始论文 16 位作者横跨 9 个欧洲机构;Henning Hermjakob 与 Sandra Orchard 主持二十年;Orchard 2025-11 退休转 UniProt 代表;现任 IMEx 代表 Kalpana Panneerselvam。
Q35:Sandra Orchard 做了什么?
IntAct/Complex Portal 的奠基 Group Leader 之一,同时参与 UniProt/GO/InterPro 数十年;EMBL-EBI 2025-11 的致敬文称"从英格兰北部农场走向生物信息学前沿——AI 时代凸显数据策划的价值"。
Q36:一句话总结 IntAct 的 AI-Ready 价值?
把 20 年互作文献系统性翻译为带方法、文献、区域与突变方向的机器可读证据网络——是 PPI 建模里少见的"证据密度 × 标准化 × 许可自由"三高数据集。
Q37:spoke 和 matrix 扩展模型怎么选?
spoke 只保留"饵-猎物"边(保守、低噪声);matrix 把 n-ary 全成对展开(敏感、高噪声)。IntAct 的 binary 列默认接近 spoke 式投影;matrix 展开自行做,且要声明。
Q38:能不能直接把 MITAB 灌进图数据库?
可以——列结构规整;建议先做 CV 拆解(method/int_type/taxid 抽 MI:xxxx)与去重键设计(A/B/PMID/方法),再入 Neo4j/Nebula;n-ary 需求则从 XML/JSON 灌。
§10.5 要点回顾
- 定位:实验证据互作的证据库——每条边有文献与方法,不收预测、不造综合分。
- 双口径:178 万 binary vs 92 万 records——引用分清,n-ary 语义是关键。
- IMEx 中枢:成员统一规则策划、数据物理集中——治理样板。
- 深度注释:区域/PTM/突变方向 9 万条——fine-grained 层独有。
- 标准生态:PSI-MI/MITAB/MIQL/PSICQUIC——格式即基础设施。
- 双许可:数据 CC BY 4.0、软件 Apache 2.0——商用无摩擦。
- 负例与泄漏:正例库 + 按文献切分——PPI 建模两大纪律。
- 方法分层:互作类型列不读等于没读——0403 不是结合。
- 版本三元组:release 号 + 日期 + UniProt 同步——可复现最小集。
- Complex Portal:复合物在 CPX——互作边与组装体双层语义。
口径存照(数字均注明口径与来源,写入正文前已核对)
- Release 252 统计(Binary 1,787,152 / Interactions 917,295 / Interactors 145,895 / Proteins 126,704 / Mutation Features 90,968 / Experiments 76,513 / Publications 23,889 / Nucleic Acids 12,320 / CV Terms 4,120 / Organisms 3,725 / Genes 1,299 / Methods 250;与 UniProt 2025_04 同步)= ebi.ac.uk/intact/about + 官网首页(“Release 252 - January 2026”)
- 人类 428,940 direct/physically associated PPIs(2025-07 统计口径)= Nature 系综述 s41540-026-00698-z(“as of July 14, 2025 … IntAct records 428,940 direct or physically associated human PPIs”)
- 创始:~2,200 binary and complex interactions / Swiss-Prot 合作 / 三组件模型 / n-ary 不拆分 / GO 格式 CV = Hermjakob 2004 NAR 32:D452-5(PMID 14681455, doi:10.1093/nar/gkh052;收稿 2003-08-15/修回 2003-09-23)
- MIntAct:11 库共同策划平台 = Orchard 2013(PMID 24234451, doi:10.1093/nar/gkt1115)
- 推荐引文:Del Toro 2022 NAR 50(D1):D648-653(PMID 34761267)= 官网 About “Please use this publication to cite IntAct”
- 许可双轨(数据 CC BY 4.0 / 软件+Curator Tool+SQL 与 Graph Database dumps Apache 2.0)+ 免责声明 = 官网 About License 节
- IMEx:单一策划规则/deep curation model/一篇文章全部 PPI 完整策划/CC 署名/数据集中于 IntAct/成员名录(Active: DIP,IntAct,MINT,MatrixDB,IID,InnateDB,UniProt group,Swiss-Prot group SIB,EMBL-EBI;Observer: BioGRID,PrimesDB)/mentha 门户/SAB 名单 = imexconsortium.org/about
- 下载:intact.zip 807.1 MB(MITAB 全量)/pmidMITAB27.zip/句子级文本挖掘数据/miTab2.7+miXML2.5+miXML3.0 = 官网下载页 + kghub.org 注册记录
- Complex Portal:定义(≥2 分子+体外可重建+特定分子功能)/ECO 证据码/ComplexTAB/ComplexViewer/hu.MAP3.0+MuSIC 预测复合物(2025)/REST complex-ws/创建 2015-06-20 = ebi.ac.uk/complexportal + Balu 2025(PMID 39558156, doi:10.1093/nar/gkae1085)+ re3data r3d100013295
- 认证:ELIXIR Core Data Resource + Global Core Biodata Resource = 官网首页底部声明
- 近期语料:GPCR-RAMP(215 GPCR/122 强互作/23 内源复合物,Sakmar lab 2024)/定量 fragmentomics(Gogl, Nat Commun 2022)/N 端蛋白形(Gevaert lab, VIB Ghent;与 UniProt 联合策划)= 官网 Featured Dataset + @intact_project 社媒公告(2025-2026)
- 人物:Sandra Orchard 退休(2025-11,EMBL-EBI 致敬文;转 UniProt 代表)/Kalpana Panneerselvam(IntAct IMEx 代表)/logo 设计 Cristoffer Sevilla = EMBL-EBI News(2025-11-25)+ 官网 About
- PLM-interact:IntAct 增强/削弱互作注释 6,979 条;全层微调 AUPR+150%/AUROC+36%;MCM7-Y600E(增强)/ISCU-N151A(削弱)案例 = Nature Communications PLM-interact 论文(经中文述评交叉核对)
- BioGRID 对照:230 万非冗余人类互作(2025-07-14)/全库 2,890,191 记录/87,122 篇 = Nature 系综述 + 摩熵化学工具百科
- DocBot/AI 问答(EBI Terms of Use;不收集个人数据)/隐私(仅作者姓名+通讯邮箱溯源)= 官网 DocBot banner + Privacy Notices
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
- lipid-maps — 共享标签:基因组学与多组学 / 药物发现与化学
- alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
- disgenet — 共享标签:基因组学与多组学 / 药物发现与化学
- open-targets — 共享标签:基因组学与多组学 / 药物发现与化学
- alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
- pdb — 共享标签:基因组学与多组学 / 药物发现与化学
- hmdb — 共享标签:基因组学与多组学 / 药物发现与化学
- binding-moad — 共享标签:基因组学与多组学 / 药物发现与化学
- lincs-l1000 — 共享标签:基因组学与多组学 / 药物发现与化学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

