信息速览
INFOBOX
| 属性 | 内容 |
|---|---|
| 名称 | LIPID MAPS Structure Database(LMSD)/ LIPID MAPS® 脂质组学门户 |
| 维护方 | LIPID MAPS Consortium(Cardiff 大学牵头 + UCSD/Babraham/Swansea/Edinburgh) |
| 创立 | 2003 年(NIH NIGMS “Glue Grant”;Edward Dennis 发起) |
| 定位 | 全球最大策划脂质结构数据库 + 脂质组学分类/命名社区标准 |
| 规模 | 50,515 条脂质结构(策划 28,481 + 计算生成 22,034;2026-06-09 官方口径) |
| 分类 | 8 大类:脂肪酸 FA / 甘油酯 GL / 甘油磷脂 GP / 鞘脂 SP / 固醇脂 ST / 异戊烯醇脂 PR / 糖脂 SL / 聚酮 PK |
| 标识符 | LMID(12/14 字符,如 LMFA01010001);跨引 KEGG/HMDB/ChEBI/PubChem/SwissLipids 等 |
| 获取 | REST API / SPARQL 1.1 / 全库下载(SDF/RDF/TSV/CSV/MOL) |
| 许可 | 免费开放获取(free open access) |
| 资助 | NIH(10 年 $73M)→ Wellcome Trust(2016-)→ MRC Partnership(现) |
| 地位 | ELIXIR service(2020)→ ELIXIR 核心数据资源 + Global Biodata Coalition 核心资源(2024) |
| 主引文 | Sud 2007 NAR(LMSD);Fahy 2005/2009 JLR(分类系统) |
| 官网 | lipidmaps.org |
§0 E-E-A-T 信任声明与免责声明
经验(Experience):本文基于 LIPID MAPS 官网(About/resources/rest/databases/lmsd 页 2026-09 现场核查)、官方工具页、2024 NAR 更新论文(Conroy 等)、2022 Nat Methods 软件指南(Ni 等)、2026 JLR LipidLibrarian 论文(第三方交叉)撰写——数字均有口径标注。
专业性(Expertise):全文遵循"每个数字注明口径与来源"纪律;策划/计算生成条目证据等级、缩写语法歧义、命名漂移等陷阱显式披露;不含任何"推断当作事实"的表述。
权威性(Authoritativeness):LIPID MAPS 是脂质分类/命名/结构绘制规范的社区标准(期刊与研究者广泛采用);本文为第三方解读,不替代官方文档。
可信度:文内数字进入文末「口径存照」;50,515(2026-06-09)与 49,761(2025-06)两个时间口径已显式区分;"CC BY"未经官方文本确认处,一律以官网"free open access"定性表述。
免责:本文为学术性数据资源解读,不构成医疗建议;脂质生物标志物的临床使用须遵循相应法规与临床指南。
§1 数据集概览
§1.0 📌 30 秒速览
- 是什么:全球最大的策划脂质结构数据库(LMSD),附分类体系、命名标准与全套脂质组学信息学工具;
- 规模:50,515 条脂质结构 = 28,481 策划 + 22,034 计算生成(2026-06-09 官方口径),8 大类分类树;
- 标识符:LMID 12/14 字符编码(
LMFA01010001= 脂肪酸类下第一个亚类第一个结构); - 获取三通道:REST API(全库一行 URL 拉取)/ SPARQL 1.1 联邦查询 / 全库下载(SDF/TSV/CSV/RDF/MOL);
- AI 价值:命名语法可解析(链长/不饱和度/双键位置)、SDF 直接进分子图神经网络、分类树是天然层级标签;
- 最大坑:策划 vs 计算条目证据等级不同;缩写中
/与_语义不同。
§1.1 摘要
LIPID MAPS(Lipid Metabolites And Pathways Strategy)2003 年由 NIH “Glue Grant” 资助创立,十年 $73M 把"脂质组学"从一个分散领域建成有统一分类、命名与工具的学科;其后由 Wellcome Trust 与 MRC 接续资助,2024 年成为 ELIXIR 核心数据资源。其核心资产 LMSD 收录 50,515 条脂质结构(2026-06 口径),按国际公认的 8 大类体系组织(Fahy 2005/2009),每条结构配 LMID 唯一标识、SMILES/InChI/InChIKey 结构表示、系统名与缩写、精确质量与物化性质、跨库标识。对 AI 而言,LMSD 是"脂质空间"的坐标系:分子 ML 吃 SDF/SMILES,质谱 ML 吃精确质量与加合物规则,脂质组特征工程吃可解析的缩写语法与分类树。它是脂质组数据"从峰列表到分子身份"翻译环节的标准字典。
§1.2 战略价值
- 语义标准:脂质组学长期困于命名混乱(同一分子数十种写法)——LIPID MAPS 分类+缩写语法+RefMet 归一化是业界共同语言;
- 鉴定基准:m/z 搜索(moverz)、谱图库链接(MassBank/MoNA)使"峰→分子"鉴定有据可依;
- 数据互操作:LMID 与 ChEBI/HMDB/PubChem/KEGG/SwissLipids 互通,是脂质数据的"枢纽坐标系";
- AI 特征底座:结构(SDF)、层级标签(8 类→主类→亚类)、物化性质(logP/TPSA 等)三类特征一次到位;
- 可持续性背书:NIH→Wellcome→MRC 二十年资助链 + ELIXIR 核心资源地位 = 长期可用性风险极低。
§1.3 同类数据集横向对比
| 维度 | LIPID MAPS LMSD | SwissLipids | ChEBI | HMDB(脂质部分) | LipidBANK |
|---|---|---|---|---|---|
| 规模 | 50,515 结构 | 779,249 物种(含理论展开) | ~2 万脂质条目 | 220,945 代谢物总量 | 历史悠久但规模小 |
| 证据模型 | 策划+计算分开标注 | 策划证据 7,170 条/1,580 文献 | 手工策划+本体推理 | 实验+预测混合 | 实验为主 |
| 分类体系 | LIPID MAPS 8 类(社区标准) | 沿用 LM 分类+自有层级 | ChEBI 本体 | 自有 8 类 | 自有 |
| 标识符 | LMID | SLM: | CHEBI: | HMDB: | LIPID BANK ID |
| 质谱工具 | 全套(moverz/bulk/谱库链接) | 无 | 无 | 部分 | 无 |
| 更新 | 滚动(月度级) | 滚动 | 季度 | 年度大版本 | 缓慢 |
| AI 喂法 | SDF+REST+SPARQL | REST+SPARQL | OWL/RDF | 下载+API | 网页为主 |
结论:LMSD 不是最大(SwissLipids 理论展开更大),但策划质量×工具链×分类权威性三者合计无可替代——它是"字典",SwissLipids 是"百科+推演"。
§1.4 版本时间轴
| 时间 | 事件 | 规模口径 |
|---|---|---|
| 2002 | Dennis 申请 NIGMS Glue Grant(12 共同 PI) | — |
| 2003 | LIPID MAPS 创立;分类系统启动开发 | — |
| 2005 | Fahy 分类系统论文(JLR) | — |
| 2007 | LMSD 正式论文(Sud, NAR) | ~3,000 策划结构量级 |
| 2009 | 分类系统更新(Fahy;ILCNC 扩容) | — |
| 2016 | Wellcome Trust 接手(£1.3M);迁往英国 | >40,000 结构 |
| 2020 | 成为 ELIXIR service;SPARQL 上线(2021 hackathon) | ~47,000 |
| 2024 | ELIXIR 核心数据资源 + Global Biodata Coalition 核心资源 | ~49,000 |
| 2025-06 | LipidLibrarian 论文引用口径 | 49,761 |
| 2026-06 | 官方页现口径 | 50,515(28,481+22,034) |
§1.5 应用场景矩阵
| 场景 | 用到的部分 | 关键动作 |
|---|---|---|
| 非靶向脂质组鉴定 | LMSD 精确质量+加合物规则+moverz | 峰列表→候选分子→MS/MS 确认 |
| 跨研究特征对齐 | RefMet+缩写语法 | 各文献命名→标准名→可合并矩阵 |
| 分子图神经网络 | SMILES/SDF 下载 | 脂质分子图→性质/活性预测 |
| 脂质通路分析 | BioPAN+LMPD 基因/蛋白 | 脂质变化→通路级解读 |
| 生物标志物发现 | LMID 对接临床队列 | 队列差异脂质→标准注释→验证 |
| LLM 知识注入 | 分类树+系统名+同义词 | 结构化语料→领域适配 |
| 质量控制 | 精确质量+物化性质 | 注释结果合理性核查 |
§1.6 组件全景
LIPID MAPS 门户
├── LMSD 结构数据库(50,515 条;本文主角)
├── LMISSD 计算预测结构库(头基展开生成)
├── LMPD 基因/蛋白库(8,500+ 基因 / 12,500+ 蛋白)
├── 工具套件
│ ├── 搜索:结构/分子式/m/z/性质搜索 + 自动补全
│ ├── moverz 前体离子搜索(REST 化)
│ ├── Bulk Search 批量质量搜索
│ ├── 结构绘制工具(Ketcher,含 PT 类规范)
│ ├── Lipid Calc(PWA 质量计算器)
│ ├── RefMet 命名标准化
│ ├── LipidLynxX 跨库名称对齐
│ ├── LipidFinder LC-MS 工作流
│ └── BioPAN 脂质通路分析
├── 离子迁移数据库(CCS 值;oxylipins 新增 400 条)
└── 教育资源(教程/每月脂质/术语表)
§1.7 数据获取三通道速记
- REST API(最轻):
https://www.lipidmaps.org/rest/compound/lm_id/LM/all/download一行拉全库 TSV;单条…/LMFA01010001/all;moverz 搜索…/moverz/LIPIDS/635.52/M+H/0.5/txt; - SPARQL 1.1(联邦):
lipidmaps.org/sparql端点,可与 SwissLipids/UniProt 联邦查询;脂类分类已发布为 owl:Class 层级; - 全库下载(最重):SDF/RDF/TSV/CSV/MOL 格式,本地建库(Postgres+Bingo 类化学索引可复刻官方架构)。
§1.8 LMID 语法速记
LM FA 0101 0001
│ │ │ │
│ │ │ └─ 序列号(类内唯一)
│ │ └─ 主类/亚类编号(01 = 亚类 01)
│ └─ 大类代码:FA 脂肪酸 / GL 甘油酯 / GP 甘油磷脂
│ SP 鞘脂 / ST 固醇脂 / PR 异戊烯醇脂
│ SL 糖脂 / PK 聚酮
└─ LIPID MAPS 前缀
12 字符版无立体特异性后缀;14 字符版含立体/链位置细分。语法本身就是"可解析特征"——解析 LMID 即得大类归属。
§1.9 独特视角:脂质组学的"Unicode"
蛋白组学有序列(FASTA),基因组有坐标(chr:pos),代谢组有 InChIKey——脂质组的麻烦在于同一分子有太多写法且歧义普遍。LIPID MAPS 干的事本质上是给脂质世界造了一套 Unicode:每个结构一个码位(LMID),一套规范书写法(缩写语法),一套归一化转换(RefMet)。AI 系统只要坚持"入库即转 LMID",后续一切特征、模型、报告都获得确定性与可合并性。这就是本文把它归入"AI-Ready 结构性资产"而非普通数据库的原因——它是翻译层,不是又一个数据孤岛。
§2 医学与科学背景
§2.1 脂质为什么难分类
脂质不像蛋白(氨基酸规则)或核酸(碱基配对规则)有统一骨架——从脂肪酸到聚酮,结构多样性跨越"疏水/两亲"、链式/环状/融合环、酯/醚/酰胺键接。历史上各类脂质(磷脂/鞘脂/固醇)各有各的分类传统,彼此不一致。LIPID MAPS 的第一步不是建库而是先立分类法:以"两个以上以疏水为主的天然产物单元"为脂质的化学定义锚点,把全部脂质收入 8 个化学起源大类——这一步让"脂质"从模糊概念变成可枚举空间。
§2.2 八大类速览与医学意义
| 大类 | 代码 | 代表分子 | 医学语义 |
|---|---|---|---|
| 脂肪酸 | FA | 棕榈酸、花生四烯酸、前列腺素 | 能量代谢、炎症信号(类花生酸) |
| 甘油酯 | GL | 甘油三酯(TAG)、DG | 能量储存、代谢综合征 |
| 甘油磷脂 | GP | PC、PE、PI、PS | 膜结构、信号转导(PI 通路) |
| 鞘脂 | SP | 鞘磷脂、神经酰胺 | 膜微区、凋亡、溶酶体贮积症 |
| 固醇脂 | ST | 胆固醇、胆汁酸、维生素 D | 心血管、消化、钙代谢 |
| 异戊烯醇脂 | PR | 辅酶 Q、类胡萝卜素 | 抗氧化、呼吸链 |
| 糖脂 | SL | 脂多糖(LPS)成分 | 先天免疫、革兰阴性菌 |
| 聚酮 | PK | 红霉素类、多烯大环内酯 | 抗菌/抗肿瘤药物(天然产物) |
§2.3 脂质组学的质谱语义
脂质组学以 LC-MS(/MS) 为主力:m/z(质荷比)+ 保留时间 + MS/MS 碎片→分子身份。LMSD 对这一链条的支撑有三点:
- 精确质量:单同位素质量供 m/z 匹配(含加合物规则:M+H/M-H/M+Na/M+NH4 等,REST moverz 直接支持全部常见离子型);
- 加合物语义:同一脂质在正/负离子模式出峰不同——LMSD 缩写+质量让"峰表"可回溯"分子";
- MS/MS 谱库链接:MassBank/MoNA 链接提供碎片确认的"第二证据"。
§2.4 缩写语法的歧义学
PC(16:0/20:4) 与 PC(16:0_20:4) 差一个符号但语义不同:/ 表示 sn-1/sn-2 位置确定;_ 表示总碳数与不饱和度确定、但位置不确定。同理双键位置 20:4(5Z,8Z,11Z,14Z) 写出位置几何,省略则未知。AI 处理文献脂质名时,这种"语法级差异"是结构歧义的主要来源——入库规范化(RefMet)不是可选项而是必需品。
§2.5 脂质代谢与疾病
脂质是代谢综合征、动脉粥样硬化、脂肪肝、神经退行性疾病、溶酶体贮积症的直接分子参与者;鞘脂/神经酰胺轴与凋亡,PI 信号与癌症, oxylipins 与炎症——脂质组队列(血浆/组织)产出的差异脂质需要 LMID 级标准注释才能跨研究比较与复现。LMSD 在"临床脂质组学→生物标志物→机制解释"链条里扮演注释基准角色。
§2.6 与基因组/蛋白组数据的连接
LMPD(基因/蛋白库)把脂质与酶(脂肪酸合酶、磷脂酶、鞘脂代谢酶系)连接,使多组学整合成为可能:转录组上调基因→LMPD 酶→其底物/产物脂质类→LMSD 结构级注释。BioPAN 把这一逻辑产品化——输入"哪些脂质变了",输出"哪些通路/酶活动可能变了"。
§2.7 RefMet 与命名漂移
不同平台/文献对同一脂质的命名差异巨大(TG 54:6 vs TAG(16:0_18:1_20:5) vs 三酰甘油 C57H92O6)。RefMet(官网集成)把任意输入归一为标准名+LMID;LipidLynxX 提供跨库名称对齐。对 ML 而言,没有归一化的特征矩阵 = 不同词表拼接出的噪声——这是脂质组 ML 论文可复现性差的首要原因之一。
§2.8 计算生成条目的证据语义
LMSD 明示其结构来源:核心实验室与合作伙伴、LIPID MAPS 实验鉴定、文献手工策划、期刊新报道、类别内计算生成。计算生成(22,034 条,占 43.6%)= 按头基×酰基链组合规则展开(如 GP 类 PC 34:1 的可能链组合)——它们是"化学上可能但未必生物存在"的骨架。AI 用其做鉴定候选池合理,用其做"存在性"结论不当。
§2.9 离子迁移维度
质谱之外,离子迁移谱(IMS)提供碰撞截面积(CCS)这一额外结构约束。LIPID MAPS 离子迁移库近期新增约 400 条 oxylipin CCS 值(Baker 实验室)——CCS+m/z+RT 三维匹配显著降低误鉴定率,是脂质组 AI 鉴定模型(如深度学习谱预测)的重要特征源。
§2.10 脂质信号转导的医学语义
脂质不只是膜材与储能——它是第二信使与炎症介质的主力语汇。PI(4,5)P₂ 被 PLC 切成 IP₃+DAG 拉开钙信号与 PKC 通路;神经酰胺/鞘磷脂开关决定凋亡走向;花生四烯酸级联(COX/LOX 产物)是前列腺素/白三烯炎症药理的靶点库;氧脂素(oxylipins)作为血管与免疫调节分子进入临床队列 biomarker 清单。这些通路的"分子角色表"全部落在 LMSD 的 FA/GP/SP 大类里——通路解释是 LMSD 注释到临床语义的最后一公里,BioPAN 把这段路自动化了一半。
§3 数据集规格
§3.1 规格总表
| 属性 | 规格 |
|---|---|
| 正式名称 | LIPID MAPS Structure Database(LMSD) |
| 规模 | 50,515 结构(策划 28,481 / 计算 22,034;2026-06-09) |
| 分类层级 | 8 大类 → 主类 → 亚类 → 级联结构层级 |
| 标识符 | LMID(12/14 字符) |
| 结构表示 | 2D 图像 / MOL / SDF / Canonical SMILES / InChI / InChIKey |
| 命名 | 系统名 + 缩写(LM 语法)+ 同义词 + 常用名 |
| 质量数据 | 单同位素精确质量、分子式 |
| 物化性质 | logP、摩尔折射率、TPSA、HBD/HBA、可旋转键、芳香环、van der Waals 体积 |
| 跨库 ID | KEGG / HMDB / ChEBI / LIPIDBANK / PubChem CID / SwissLipids / Cayman / PDB / GuidePharm |
| 物种标注 | NCBI Taxonomy ID |
| 谱图链接 | MassBank(MoNA 谱库生态) |
| 获取 | REST / SPARQL 1.1 / 全库下载(SDF/RDF/TSV/CSV/MOL) |
| 更新频率 | 滚动更新(月度级;官网页注明 Last updated) |
| 许可 | free open access(免费开放获取) |
| 宿主 | Babraham Institute 服务器(Cardiff 牵头运营) |
§3.2 数据发布口径地图
LMSD 主库(Lipid Oriented Database)
├── 策划条目 28,481(人工核实结构/命名/交叉引用)
├── 计算生成条目 22,034(类别内头基×酰基链展开)
└── 合计 50,515(2026-06-09 口径)
LMISSD(In-Silico):更大规模理论展开(不在 50,515 内)
LMPD:基因 8,500+ / 蛋白 12,500+(人+模式生物)
引用纪律:论文里写"LMSD 包含 50,515 条"须附检索日期;写"约 5 万"最稳;禁止把 LMISSD 规模与 LMSD 混算。
§3.3 DAIMS 数据AI就绪度评估
| 维度 | 评分 | 依据 |
|---|---|---|
| 可获取性 Accessibility | 9/10 | REST/SPARQL/全库下载三通道;免注册 |
| 格式机读性 Machine-readability | 9/10 | TSV/CSV/SDF/RDF 全覆盖;molfile 开源格式 |
| 标识稳定性 | 8/10 | LMID 永久;跨库 ID 偶有补录变更 |
| 结构完整性 | 8.5/10 | 策划条目全字段;计算条目部分字段缺省 |
| 语义层次 | 9/10 | 分类树+RDF/OWL 化;SPARQL 联邦 |
| 文档质量 | 8/10 | REST 页示例齐全;API 版本语义较弱 |
| 许可清晰度 | 7/10 | open access 定性明确;单列 CC 文本未见 |
| 合计 | 8.5/10 | 结构性资产级 AI-Ready |
§3.4 存储与计算需求
- 全库 TSV 下载约数十 MB 量级;SDF(含 2D 结构坐标)约百 MB 量级——单机可承载;
- 子结构搜索需化学索引(Bingo/RDKit PostgreSQL cartridge 或 RDKit 内存指纹);
- SPARQL 联邦查询免本地存储但有远端限速——批量任务用 REST/下载通道;
- 内存建模:50,515×(分子图嵌入 128 维)≈ 数十 MB——分子 ML 全库嵌入单卡可算。
§3.5 获取通道
- Web:lipidmaps.org/databases/lmsd(浏览/搜索/按类浏览);
- REST:
/rest/compound/lm_id/{LMID}/{field}单条;/rest/compound/lm_id/{prefix}/all/download按类拉取;LM/all/download全库; - SPARQL:lipidmaps.org/sparql(1.1;联邦示例见 §4.6);
- 下载:SDF/RDF/TSV/CSV/MOL 打包(结构+注释);
- 镜像生态:PubChem/SwissLipids/ChEBI 交叉提供部分镜像数据(语义以 LMSD 原库为准)。
§3.6 口径对齐表
| 论文/场景常用表述 | 精确口径 | 注意 |
|---|---|---|
| “LIPID MAPS 收录 5 万+脂质” | LMSD 50,515(2026-06-09) | 加检索日期 |
| “8 大类” | FA/GL/GP/SP/ST/PR/SL/PK | 2009 更新后口径 |
| “LMID” | 12 或 14 字符 | 计数/正则须兼容两种 |
| “LMPD 覆盖脂质基因” | 8,500+ 基因/12,500+ 蛋白 | 含模式生物 |
| “SwissLipids 更大” | 779,249 物种(理论展开多) | 不与 LMSD 混比 |
| “CCS 库” | 离子迁移库;oxylipins 新增 400 | 3,800+ 为生态总量口径 |
§3.7 版本选择纪律
LMSD 滚动更新无版本号——用"检索日期+口径数字"替代版本号:
- 方法学段落写"LMSD, retrieved 2026-09-20 (50,515 structures)";
- 全库下载文件本地存 SHA256;
- 跨研究合并时以"最晚检索日期"者归一(RefMet 二次归一);
- 引用旧论文数字(49,761 等)时注明其检索时点,避免"数字打架"。
§3.8 数据文件与字段详表
全库 TSV 的核心字段(REST LM/all/download 口径):
| 字段 | 类型 | 说明 |
|---|---|---|
| LM_ID | 文本 | 主键(LMFA01010001 式) |
| Name | 文本 | 系统名 |
| Abbrev | 文本 | LM 缩写(Chemical/Chain 两版) |
| Formula | 文本 | 分子式 |
| Exact_mass | 浮点 | 单同位素质量 |
| SMILES | 文本 | canonical SMILES |
| InChI/InChIKey | 文本 | 标准表示 |
| Category/Main_class/Sub_class | 文本 | 分类树三级 |
| Synonyms | 文本 | 同义词(管道分隔) |
| PubChem CID 等 | 文本 | 跨库 ID(可空) |
SDF 额外含 2D 坐标(molfile);RDF 含 owl:Class 分类断言。
§4 数据结构
§4.1 对象模型
LipidEntry(1 条 = 1 个确定结构)
├── identity:LMID / 系统名 / 缩写(Chemical+Chain)/ 同义词
├── structure:SMILES / InChI / InChIKey / MOL(2D 坐标)
├── mass:分子式 / 单同位素精确质量
├── classification:Category → Main → Sub(8 大类树)
├── physchem:logP / TPSA / HBD / HBA / RotB / MR / VdW
├── xref:PubChem / ChEBI / HMDB / KEGG / SwissLipids / LIPIDBANK / PDB
├── provenance:curated | computational(证据等级)
└── organism:NCBI Taxonomy ID(生物来源)
§4.2 全库下载与本地加载(实战)
# 1) 全库 TSV(一行拉取,免注册)
curl -L "https://www.lipidmaps.org/rest/compound/lm_id/LM/all/download" \
-o lmsd_all.tsv
# 2) 指纹入库(滚动库的"版本"= 检索日期 + SHA256)
sha256sum lmsd_all.tsv | tee lmsd_all_20260920.SHA256
# 3) 快速体检:行数 / 大类分布
wc -l lmsd_all.tsv
awk -F'\t' 'NR>1 {print $NF}' lmsd_all.tsv | sort | uniq -c | sort -rn | head
# 4) 按大类拉取(只要甘油磷脂)
curl -L "https://www.lipidmaps.org/rest/compound/lm_id/LMGP/all/download" -o lmsd_gp.tsv
§4.3 单条查询与结构获取(实战)
# LMID → 全字段
curl -s "https://www.lipidmaps.org/rest/compound/lm_id/LMFA01010001/all/txt"
# LMID → molfile(2D 结构,可进 RDKit)
curl -s "https://www.lipidmaps.org/rest/compound/lm_id/LMFA01010001/molfile" > lmfa01010001.mol
# 缩写 → 结构图(SMILES)
curl -s "https://www.lipidmaps.org/rest/compound/abbrev/PC(16:0/20:4(5Z,8Z,11Z,14Z))/structure"
# PubChem CID → SMILES(跨库桥)
curl -s "https://www.lipidmaps.org/rest/compound/pubchem_cid/985/smiles"
§4.4 m/z 前体离子搜索(实战)
import requests
BASE = "https://www.lipidmaps.org/rest"
def moverz(mz: float, ion: str = "M+H", tol: float = 0.5):
"""LIPIDS 虚拟库前体离子搜索。
ion: M+H / M+NH4 / M+Na / M-H / M-2H / Neutral …(正/负/中性全支持)
"""
r = requests.get(f"{BASE}/moverz/LIPIDS/{mz}/{ion}/{tol}/txt", timeout=30)
r.raise_for_status()
rows = [ln.split("\t") for ln in r.text.strip().splitlines() if ln.strip()]
return rows # [LMID, 缩写, 精确质量, 差值, …] 视返回列
# 示例:正模式 m/z 635.52(M+H,容差 0.5)
for row in moverz(635.52, "M+H", 0.5):
print(row)
# 批量峰表注释(示意)
peaks = [635.52, 513.45, 759.58]
for mz in peaks:
cands = moverz(mz, "M+H", 0.3)
print(mz, "候选数:", len(cands) - 1 if cands else 0)
§4.5 缩写语法解析器(特征工程)
import re
CAT = {"LMFA": "fatty_acyl", "LMGL": "glycerolipid",
"LMGP": "glycerophospholipid", "LMSP": "sphingolipid",
"LMST": "sterol_lipid", "LMPR": "prenol_lipid",
"LMSL": "saccharolipid", "LMPK": "polyketide"}
def parse_abbrev(abbrev: str):
"""PC(16:0/20:4(5Z,8Z,11Z,14Z)) → 结构化特征。
'/' sn 位置确定;'_' 位置不确定——特征里保留该语义。
"""
m = re.match(r"^([A-Z][A-Za-z0-9]+)\((.+)\)$", abbrev)
if not m:
return None
head, chains = m.groups()
pos_definite = "/" in chains
feats = {"headgroup": head, "position_defined": pos_definite}
total_c, total_unsat, db_positions = 0, 0, []
for ch in re.split(r"[/_(]", chains):
if ":" in ch:
c, u = ch.split(":")[:2]
total_c += int(c); total_unsat += int(u)
dm = re.findall(r"(\d+)Z|(\d+)E", chains)
if dm:
db_positions = [a or b for a, b in dm]
feats.update(total_carbon=total_c, total_unsaturation=total_unsat,
db_positions=db_positions)
return feats
print(parse_abbrev("PC(16:0/20:4(5Z,8Z,11Z,14Z))"))
# {'headgroup': 'PC', 'position_defined': True,
# 'total_carbon': 36, 'total_unsaturation': 4,
# 'db_positions': ['5', '8', '11', '14']}
§4.6 SPARQL 联邦查询(实战)
# 端点:https://lipidmaps.org/sparql(1.1)
# 场景:拿某大类下全部亚类 owl:Class 层级
query = """
PREFIX rdfs: <http://www.w3.org/2000/01/rdf-schema#>
PREFIX lm: <https://www.lipidmaps.org/data/classification/LMID/>
SELECT ?subclass ?label
WHERE {
lm:LMGP rdfs:subClassOf* ?subclass .
?subclass rdfs:label ?label .
}
"""
import requests
r = requests.get("https://lipidmaps.org/sparql",
params={"query": query, "format": "json"}, timeout=60)
for b in r.json()["results"]["bindings"]:
print(b["subclass"]["value"], b["label"]["value"])
联邦用法:SERVICE 子句跨 SwissLipids/UniProt 端点联合检索(ELIXIR FAIR lipids hackathon 的设计初衷)。
§4.7 分子 ML 喂法:SDF → 图特征(实战)
# pip install rdkit pandas
from rdkit import Chem
from rdkit.Chem import Descriptors, Crippen, rdMolDescriptors
import pandas as pd
supp = Chem.SDMolSupplier("lmsd_lipids.sdf")
rows = []
for mol in supp:
if mol is None:
continue
rows.append({
"lm_id": mol.GetProp("_Name"),
"mw": Descriptors.MolWt(mol),
"logp": Crippen.MolLogP(mol),
"hbd": rdMolDescriptors.CalcNumHBD(mol),
"rotb": rdMolDescriptors.CalcNumRotatableBonds(mol),
"smiles": Chem.MolToSmiles(mol),
})
df = pd.DataFrame(rows)
# 图神经网络路径:SMILES → 分子图(示意,deepchem/PyG 皆可)
# from torch_geometric.data import Data # 原子=节点,键=边
# 特征建议:原子类型/电荷/手性 + 键级/共轭 —— 脂质链式结构下,
# 长链原子的位置编码(距头基距离)对性质预测尤为关键。
§4.8 数据血缘
上游来源 LIPID MAPS 处理 消费方
────────── ────────────── ──────
联盟核心实验室实验 ─▶ 策划条目(28,481)──┐
文献手工策划/LIPID BANK ─▶ 策划条目 ├─▶ 脂质组鉴定管线
类别规则展开 ─▶ 计算条目(22,034)──┘ (MS-DIAL/MS-DIAL 类)
ILCNC 分类规范 ─▶ 8 大类树/RDF/OWL ──▶ 跨库(ChEBI/HMDB/PubChem)
NCBI Taxonomy ─▶ 物种标注 ──▶ RefMet/LipidLynxX 归一
质谱谱库(MassBank/MoNA) ─▶ 谱图链接 ──▶ BioPAN 通路解读
离子迁移实验(CCS) ─▶ 离子迁移库 ──▶ 分子 ML / LLM 语料
§4.9 完整性清单
- 下载文件 SHA256 + 检索日期记录(滚动库的版本语义);
- LMID 去重校验(主键唯一);
- 大类分布合理(GP/FA/GL 应占大头;某类突增=口径异常);
- 策划/计算条目比例记录(provenance 字段留存);
- SDF 分子可解析率(RDKit 读取失败率应≈0);
- 跨库 ID 覆盖率统计(PubChem 覆盖率通常最高)。
§5 下游分析协议
§5.1 任务×资源速查表
| 任务 | 用什么 | 关键参数/动作 |
|---|---|---|
| 峰表注释 | moverz REST + 精确质量 | 离子型匹配(M+H/M-H);容差 ≤0.3 Da |
| MS/MS 确认 | MassBank/MoNA 链接 | 碎片匹配 + CCS(如有) |
| 跨研究合并 | RefMet 归一 + LMID | 先归一再合并 |
| 分子性质模型 | SDF/SMILES 下载 | 图神经网络/描述符 |
| 脂质通路解读 | BioPAN | 输入差异脂质列表 |
| 酶-底物连接 | LMPD | 基因符号/UniProt 查询 |
| 术语规范化 | RefMet + 缩写语法 | 报告层统一命名 |
§5.2 非靶向脂质组鉴定协议
- 峰表准备:特征 m/z+RT+强度(XCMS/MZmine/MS-DIAL 输出);
- 加合物假设:正模式 M+H/M+NH4/M+Na;负模式 M-H/M+OAc(REST moverz 支持);
- 质量匹配:容差按仪器(HRMS ≤5 ppm——moverz 用 Da 时自行换算);
- 候选过滤:LMSD 命中 + 同类保留时间规律(RT 对齐);
- MS/MS 确认:谱库链接碎片匹配;头基中性丢失(PC 184.07 等);
- 等级标注:L1(标品对照)/L2(谱图库推断)/L3(类级)——LMSD 命中≠L1;
- 入库规范化:全部注释转 LMID+标准缩写。
§5.3 跨研究特征对齐协议
- 各源脂质名 → RefMet 归一(或 LipidLynxX 映射表);
- 归一后仍歧义者(
_类)拆分为独立特征并标注; - 缺失维补齐:无双键位置者补
(位置未知)标记列; - 合并矩阵以 LMID 为键;同 LMID 多名以标准缩写呈现;
- 溯源表留存:原始名→归一名→LMID 三列全记录。
§5.4 分子 ML 训练协议
- 样本界定:只用策划条目训练性质模型(计算条目可作半监督扩展);
- 特征:分子图(GNN)或描述符+链特征(§4.5 解析)双轨;
- 切分:按主类分层切分防泄漏;跨大类泛化单测;
- 评估:logP/TPSA 回归(R² 与 MAE);分类任务(大类预测)宏 F1;
- 报告:数据版本(检索日期+SHA256)+ provenance 过滤声明。
§5.5 临床队列注释协议
- 队列脂质组峰表 → §5.2 流程注释;
- 差异脂质(组间检验)→ LMID+RefMet 标准名;
- 通路解读 BioPAN + LMPD 酶连接;
- 报告模板:LMID/标准缩写/精确质量/证据等级(L1-L3)四列必备;
- 共享数据以 LMID 为键(他人可复算)。
§5.6 失败模式清单
- 加合物误判:M+NH4 峰当 M+H→质量差 17.0265 Da 系统偏移;
- 同分异构合并:PC 16:0/18:1 与 18:1/16:0(sn 异构)质量相同——RT/MS/MS 才能分;
_//混写:位置确定性与不确定结构混入同一特征;- 计算条目当证据:把展开结构当"已鉴定";
- 跨库 ID 错配:PubChem CID 手抖一位→静默错误(用 InChIKey 复核);
- 旧口径引用:49,761 vs 50,515 混用不注日期。
§5.7 加合物展开表(质量搜索前置)
脂质 LC-MS 的峰从来不是"分子质量",而是"分子×加合物"——注释前先按离子模式展开:
| 模式 | 加合物 | 质量偏移(Da) | 常见场景 |
|---|---|---|---|
| 正 | M+H | +1.007276 | PC/SM 等 |
| 正 | M+NH4 | +18.033823 | TAG/中性脂 |
| 正 | M+Na | +22.989218 | 污染/低 HPLC 盐 |
| 负 | M-H | -1.007276 | FA/PI/PS 等 |
| 负 | M+OAc | +59.013304 | 低丰度负模式 |
| 中性 | Neutral | 0 | 跨模式对齐 |
产线做法:峰表按模式×加合物全展开→每行换算中性质量→LMSD 精确质量匹配→一个峰多个加合物假设时全部保留,用 RT 与同类规律收敛。moverz 接口 ion 参数直接吃这些类型(正 12 种/负 7 种/中性),无需自行算偏移。
§6 实证结果与方法学分析
§6.1 二十年治理的实证结构
LIPID MAPS 的可复现性治理是"标准先于数据"的范本:2003-2005 先产出分类/命名/结构绘制规范(Fahy 2005),2007 才有数据库论文——秩序使 LMSD 二十年少有语义漂移。资助方三次更替(NIH→Wellcome→MRC)而标识符、分类树保持连续,堪称长周期数据治理样板。
§6.2 分类系统的实证影响
8 大类体系被期刊与数据库广泛采纳(SwissLipids 沿用其分类)、被写进脂质组教材——分类论文(Fahy 2005/2009)成为领域引用地基。其"化学起源"分类逻辑(而非功能逻辑)保证了互斥性与完备性的平衡,是本体工程中少见的"一次定准"。
§6.3 工具链的实证闭环
从搜索(质量/结构/性质)→鉴定(moverz/谱库)→归一(RefMet)→分析(LipidFinder/BioPAN)——LIPID MAPS 把"数据+工具+标准"闭环在一个域名下。2023 更新论文披露的技术栈(Postgres+Bingo+Ketcher+Laravel)证明其可持续工程投入;Lipid Calc PWA 化等持续迭代佐证活跃度。
§6.4 ELIXIR 核心资源认定的实证含义
2024 年 ELIXIR core data resource + Global Biodata Coalition 认定=经第三方评审的长期可持续性+科学影响力双重背书。对依赖其做生产管线的团队(含 AI 训练数据供给),这是基础设施风险评级的关键加分项。
§6.5 八个真实坑点
- 坑点 1 双口径混写:50,515(2026-06)≠49,761(2025-06)——引用必带检索日期;
- 坑点 2 证据等级混淆:28,481 策划 ≠ 22,034 计算展开——建模/鉴定分开用;
- 坑点 3 缩写歧义:
/与_语义不同——解析器必须区分(§4.5); - 坑点 4 加合物幻觉:同一分子多离子型峰被当多分子——加合物表先行;
- 坑点 5 sn 异构合并:质量相同的位置异构被当同一特征;
- 坑点 6 跨库 ID 漂移:第三方库 ID 更新滞后——InChIKey 复核;
- 坑点 7 SPARQL 限速:联邦查询不适合批量拉数——批量走 REST/下载;
- 坑点 8 许可想当然:“open access”≠“CC BY 文本在案”——商用前核对官网最新声明。
§6.6 审稿人自查清单
- [ ] LMSD 引用是否带检索日期与规模口径?
- [ ] 策划/计算条目是否分开声明?
- [ ] 脂质命名是否经 RefMet 归一?
- [ ] 加合物假设是否显式列出?
- [ ] 鉴定等级(L1/L2/L3)是否标注?
- [ ] 分子 ML 是否用 InChIKey 去重?
- [ ] SPARQL/REST 拉取是否记录端点与参数?
- [ ] 旧数字(如 49,761)是否注明其时点?
§6.7 与 HMDB/SwissLipids 的分工语义
HMDB 是"代谢物全景"(脂质为其子集,临床注释强);SwissLipids 是"证据链百科"(7,170 条文献证据+理论展开 77.9 万);LMSD 是"结构字典+工具链"(结构权威+鉴定工具全)。三者 LMID/SLM:/HMDB:/CHEBI: 互通——用 LMSD 定结构、SwissLipids 查证据、HMDB 接临床是标准分工。
§6.8 版本治理的方法学含义
滚动库无版本号→"检索日期+SHA256+口径数字"三件套是替代方案;跨研究复现时用 RefMet 二次归一可吸收多数口径漂移;LMID 稳定性极高(二十年少有回收)——以 LMID 为键的长期资产设计是安全。
§6.9 分数语义不存在——结构语义优先
与评分型资源不同,LMSD 无"置信分"——它的语义是结构确定性与证据等级(策划 vs 计算 vs 鉴定层级 L1-L3)。把 LMSD 用于 ML 时,特征质量取决于"结构表示的选择"(SMILES 标准化/互变异构/立体化学完整性),而非打分阈值。
§7 AI 就绪指南与应用场景
§7.1 四种喂法
- 表格喂:TSV→分类树/质量/物化性质特征(树模型/检索增强);
- 分子图喂:SDF→GNN(性质/活性/谱图预测);
- 文本喂:系统名+缩写+同义词→LLM 领域适配(脂质命名翻译/实体链接);
- 知识图喂:RDF/OWL 分类断言+SPARQL→知识图谱节点(LMID 为实体锚)。
§7.2 鉴定管线实操配方
峰表 → 加合物展开 → moverz 批量(REST)
→ 候选合并(InChIKey 去重)
→ RT 规律过滤(同类同 RT 窗)
→ MS/MS 碎片匹配(MassBank/MoNA)
→ LMID 标准化入库
容差纪律:HRMS 5 ppm;离子型显式记录;候选并列时不自动合并——输出并列标注供人工裁决。
§7.3 LLM 实体链接配方
- 语料对:文献脂质名(混乱写法)→ LMID+标准缩写(配对语料天然存在于 PubMed 摘要×LMSD 同义词字段);
- 任务:命名归一(NER+链接)、缩写生成、结构-文本描述;
- 评估集:RefMet 官方映射(金标);歧义样本(
_类)单独评测; - 护栏:LMID 输出后回查 LMSD API 验证存在性(防幻觉 ID)。
§7.4 分子生成/性质模型
脂质空间的生成建模(新脂质设计/类药性扩展)以 SDF 为起点;链长/不饱和度条件化生成用 §4.5 解析特征做条件向量;评估锚点用 LMSD 策划条目的描述符分布(KL 散度/有效性)。
§7.5 多组学整合
转录组(酶基因)→LMPD→底物脂质类→LMSD 结构注释→临床表型——以 LMID 为外键的整合 schema;BioPAN 可作为通路级"粗对齐"再入精细模型。
§7.6 数据质量自检脚本
import pandas as pd, hashlib, re
df = pd.read_csv("lmsd_all.tsv", sep="\t")
assert df["LM_ID"].is_unique, "LMID 重复!"
pat = re.compile(r"^LM(FA|GL|GP|SP|ST|PR|SL|PK)\d{6,8}$")
bad = df[~df["LM_ID"].str.match(pat)]
print("LMID 语法异常:", len(bad))
print(df["Category"].value_counts(normalize=True))
print("SMILES 缺失率:", df["SMILES"].isna().mean())
print("SHA256:", hashlib.sha256(open("lmsd_all.tsv","rb").read()).hexdigest()[:16])
§7.7 成本与排期模板
- 拉数+建库:0.5 人日(REST 下载+Postgres/RDKit 建索引);
- 鉴定管线接入:2-3 人日(加合物表+批量 moverz+谱库链接);
- 分子 ML 基线:3-5 人日(GNN 训练+描述符基线);
- LLM 实体链接微调:1-2 周(语料构造+评估集);
- 全程零数据成本(免注册开放获取)。
§7.8 公平性/覆盖偏差声明
LMSD 以哺乳动物脂质为主,植物/微生物脂质部分覆盖——跨物种研究(微生物组脂质组/植物脂质组)须评估覆盖缺口并辅以 LIPIDBANK/SwissLipids;临床队列注释时,人群特异性脂质(罕见oxylipin 等)可能无 LMSD 条目——“未命中”≠“不存在”。
§7.9 报告方法学段落骨架
脂质注释使用 LIPID MAPS Structure Database(LMSD,retrieved 2026-09-20,50,515 structures;SHA256: <指纹>)。前体离子匹配采用 REST moverz 接口(容差 X ppm,离子型 M+H/M-H),MS/MS 经 MassBank 链接确认,鉴定等级按 L1-L3 标注。命名经 RefMet 归一,全部结果以 LMID 为主键存档。策划与计算生成条目分别使用于 <用途 A/B>。
§7.10 队列注释产线(伪代码骨架)
万人级临床脂质队列的 LMSD 注释产线骨架——三阶段可并行:
# 阶段一:峰表规范化(每队列独立)
# 输入:feature m/z + RT + 强度矩阵(MZmine/MS-DIAL 导出)
# 动作:模式判定 → 加合物展开(§5.7 表)→ 中性质量列
# 阶段二:LMSD 匹配(本地全库 + REST 双路)
import pandas as pd, requests
def match_lmsd(neutral_mass: float, tol_ppm: float = 5):
"""本地 LMSD 精确质量匹配(REST 仅兜底/复核)。"""
lo, hi = neutral_mass * (1 - tol_ppm * 1e-6), neutral_mass * (1 + tol_ppm * 1e-6)
hits = lmsd_df[lmsd_df["exact_mass"].between(lo, hi)]
return hits[["LM_ID", "Abbrev", "exact_mass", "category"]]
# 阶段三:注释落表(LMID 为主键的队列资产)
# am-style 列:lm_id / 标准缩写 / evidence(L1-L3) / provenance(curated|computational)
# 分区:category → 便于通路聚合;LMID → 便于跨队列合并
产线要点:本地全库为主(50,515 行内存级),REST 复核抽样;evidence 与 provenance 两列强制落表——下游统计/ML 可按证据等级分层;跨队列合并前过 RefMet 归一。
§8 伦理、许可与合规
§8.1 许可语义
官网定性 free, open access——免费开放获取、鼓励再利用(“facilitate re-use and incorporation into other cheminformatic workflows”)。存照:官网未见单列标准 CC 许可文本;“LIPID MAPS®” 为注册商标。合规动作:商用产品中注明来源与"商标归属",引用遵循官方引文要求;重大商用前复核官网最新声明。
§8.2 引用与致谢模板
数据:LIPID MAPS Structure Database (LMSD), https://lipidmaps.org,
retrieved 2026-09-20.
引用:Sud M, et al. LMSD: LIPID MAPS structure database.
Nucleic Acids Res. 2007;35:D527-532.
分类:Fahy E, et al. J Lipid Res. 2005;46:839-861;
Fahy E, et al. J Lipid Res. 2009;50:S9-S14.
工具:Conroy MJ, et al. Nucleic Acids Res. 2024(gkad896).
§8.3 国内合规路径
- 数据性质:化学结构+注释,非人类受试者数据——无个人信息/遗传资源问题;
- 使用场景:科研/教学/内部研发自由使用;产品化需注意商标(不以"LIPID MAPS®"为产品名);
- 网络可达性:官网直连可用;生产环境建议全库本地化(下载通道一次拉齐);
- 输出责任:基于 LMSD 的鉴定结果用于临床报告时,责任在检测实验室(LDT/IVD 框架),数据库仅提供注释。
§8.4 商业使用边界
- 允许(open access 语义):产品集成注释、商业软件引用、云服务托管镜像(注明来源);
- 谨慎:以 LMSD 全库转售为独立商品(与 open access 精神相悖且商标风险);
- 建议:重大商用前邮件联系运营组(About 页渠道)书面确认。
§8.5 合规台账最小模板
| 字段 | 内容 |
|---|---|
| 资源 | LMSD |
| 检索日期/版本 | 2026-09-20 / 50,515 |
| 文件指纹 | SHA256(§7.6) |
| 许可 | free open access(官网定性) |
| 用途 | 科研管线注释 |
| 商标处理 | 不占用产品名;来源标注 |
| 复查周期 | 12 个月 |
§8.6 责任式发布语义
LMSD 不含人类受试者数据,伦理负担低;但其注释质量影响临床脂质检测解释——下游须维持"数据库注释≠临床结论"的边界声明;L1-L3 证据等级纪律是责任式使用的核心抓手。
§9 谱系与生态
§9.1 脂质组信息学二十年时间线
| 阶段 | 里程碑 |
|---|---|
| 2003-2005 | Glue Grant 启动;分类系统(Fahy 2005) |
| 2005-2010 | LMSD 上线(2007);LMPD/虚拟库;分类更新(2009) |
| 2010-2016 | 工具套件扩容(LipidFinder 等);NIH 资源期 |
| 2016-2020 | Wellcome 接手;迁英;ELIXIR service(2020) |
| 2020-2024 | SPARQL(2021);Nat Methods 指南(2022);NAR 更新(2024);核心资源认定 |
| 2024- | MRC 资助期;离子迁移库扩容;Laravel 迁移完成 |
§9.2 术语表
| 术语 | 释义 |
|---|---|
| LMID | LIPID MAPS 唯一结构标识(12/14 字符) |
| LMSD / LMISSD / LMPD | 结构库 / 计算结构库 / 基因蛋白库 |
| RefMet | 官方命名归一工具 |
| moverz | 前体离子质量搜索接口 |
| BioPAN | 脂质组通路分析工具 |
| CCS | 碰撞截面积(离子迁移维度) |
| sn-1/sn-2 | 甘油骨架酯化位置 |
| L1/L2/L3 | 鉴定置信等级(MSI 规范惯例) |
| ILCNC | 国际脂质分类与命名委员会 |
| sum species / molecular species | 链组合未知/确定的物种层级 |
§9.3 资源选型决策树
需要脂质结构权威注释?
├─ 是 → 需要质谱鉴定工具链?
│ ├─ 是 → LIPID MAPS(LMSD+工具)✔
│ └─ 否 → 只要证据文献链 → SwissLipids
├─ 需要临床/疾病注释 → HMDB
├─ 需要反应/通路本体 → ChEBI/Rhea
└─ 历史文献对照 → LIPIDBANK
§9.4 与本库其他条目的关系
- HMDB:代谢组全景邻居(脂质子集互引);
- ChEBI:本体/反应层互补(跨库 ID 双向);
- PubChem:CID 互通(结构镜像生态);
- MassBank/MoNA 生态条目:谱图证据层;
- SwissLipids:证据链百科(同类直接对照)。
§9.5 组合使用建议
- 鉴定管线:LMSD(候选)+ MassBank(确认)+ RefMet(归一);
- 多组学:LMPD(酶)+ LMSD(底物)+ KEGG(通路图);
- 分子 ML:LMSD SDF(训练)+ PubChem CID(扩展);
- 临床注释:HMDB(疾病关联)+ LMSD(结构权威)。
§9.6 脂质组在组学生态中的角色
脂质组是"最接近化学的组学"——其标准化由 LIPID MAPS 一家承担(类比:序列领域的 NCBI、结构领域的 PDB)。理解 LMSD 的"字典"角色,等于理解脂质组全部下游 AI 应用的坐标系。
§9.7 预测器/工具家族光谱定位
纯数据 ←─────────────────────→ 全流程平台
LIPIDBANK ChEBI SwissLipids HMDB LIPID MAPS
(历史库) (本体) (证据百科) (临床注释)(字典+全套工具)
§9.8 生态圈层地图
核心:LMSD(50,515 结构)
├─ 直系:LMISSD / LMPD / RefMet / BioPAN / LipidFinder / Lipid Calc
├─ 标准层:ILCNC / 8 大类规范 / 结构绘制规范
├─ 互操作:ChEBI · HMDB · KEGG · PubChem · SwissLipids · LIPIDBANK · PDB
├─ 谱图层:MassBank · MoNA · LipidBlast(生态关联)
├─ 流程层:MS-DIAL · MZmine · LipidIMMS(第三方管线)
├─ 治理层:ELIXIR(core data resource)· Global Biodata Coalition
└─ 资助链:NIH($73M) → Wellcome(£1.3M) → MRC Partnership
§9.9 字典级资产的复利语义
为什么"字典"比"库"更有复利?因为字典是被引用方——每次脂质组论文引用 LMSD、每条 MS-DIAL 鉴定落到 LMID、每个 LLM 学会一次缩写语法,其价值都沉淀回同一坐标系。二十年的分类稳定性(LMID 从未大规模重编码)意味着围绕它建的每一层索引、每一个模型、每一张跨库映射表都不过期。这正是"AI-Ready 结构性资产"与普通数据集的分野:后者随研究周期贬值,前者随生态繁荣升值。
§10 资源导航与 FAQ
§10.1 官方资源导航
| 资源 | URL |
|---|---|
| 门户首页 | lipidmaps.org |
| LMSD 数据库 | lipidmaps.org/databases/lmsd |
| REST API 文档 | lipidmaps.org/resources/rest |
| SPARQL 端点 | lipidmaps.org/sparql |
| 全库下载 | lipidmaps.org/databases/lmsd(Download) |
| 工具总览 | lipidmaps.org/resources/tools |
| About/治理 | lipidmaps.org/about |
§10.2 关键文献
- Fahy E, et al. A comprehensive classification system for lipids. J Lipid Res. 2005;46:839-861.
- Sud M, et al. LMSD: LIPID MAPS structure database. Nucleic Acids Res. 2007;35:D527-532.
- Fahy E, et al. Update of the LIPID MAPS comprehensive classification system for lipids. J Lipid Res. 2009;50:S9-S14.
- Ni Z, et al. Guiding the choice of informatics software and tools for lipidomics research applications. Nat Methods. 2022;19:281-291.
- Conroy MJ, et al. LIPID MAPS: update to databases and tools for the lipidomics community. Nucleic Acids Res. 2024;52(D1):D521-533(gkad896).
- Dennis EA. Outtakes from my journey through the world of LIPID MAPS. J Lipid Res.(回忆录:Glue Grant 史)
§10.3 站内延伸阅读
- HMDB 人类代谢组数据库——代谢物全景与临床注释;
- ChEBI 化学实体本体——反应与本体层;
- PubChem——最大化合物库与 CID 互通;
- MassBank——质谱图证据层;
- KEGG——通路图与酶注释。
§10.4 FAQ
Q1:LMSD 现在到底多少条?
50,515(官方 LMSD 页 2026-06-09 口径:策划 28,481+计算 22,034)。滚动更新,引用带检索日期。
Q2:LIPID MAPS 和 LMSD 什么关系?
LIPID MAPS 是门户/联盟总称(含工具、教育、标准);LMSD 是其核心结构数据库。
Q3:LMID 怎么读?
LM 前缀+大类码(FA/GL/GP/SP/ST/PR/SL/PK)+类/亚类编号+序列号;12 或 14 字符。
Q4:免费吗?商用呢?
免费开放获取(free open access);商用建议核对官网最新声明并避免商标占用(未见单列 CC 文本——存照)。
Q5:怎么拉全库?
https://www.lipidmaps.org/rest/compound/lm_id/LM/all/download 一行 TSV;或下载页 SDF/RDF/CSV。
Q6:有 API 吗?
REST(单条/按类/全库/moverz 质量搜索)+ SPARQL 1.1(联邦)。批量任务走 REST/下载,SPARQL 适合关系查询。
Q7:SwissLipids 和 LMSD 哪个好?
分工不同:LMSD 结构权威+工具全;SwissLipids 证据链细+理论展开大(77.9 万)。结构注释以 LMSD 为准是惯例。
Q8:计算生成的 22,034 条能用吗?
能做候选池/性质建模背景,不能当"已鉴定"证据——provenance 字段区分。
Q9:RefMet 是什么?
官方命名归一工具:输入任意脂质名→标准名+LMID。跨研究合并前必经。
Q10:缩写里 / 和 _ 的区别?
/=sn 位置确定;_=总组成确定但位置不确定。特征工程必须保留该语义。
Q11:moverz 支持哪些离子?
正:M+H/M+2H/M+NH4/M+Na/M+K/M+Ag/M+Li 等;负:M-H/M-2H/M+OAc/M+Cl 等;中性亦可。
Q12:能查 CCS 吗?
离子迁移库提供部分 CCS(oxylipins 新增约 400 条);非全库维度。
Q13:怎么跟 HMDB 关联?
LMSD 条目带 HMDB ID 交叉字段;亦可用 InChIKey 精确匹配。
Q14:LMPD 是什么?
基因/蛋白库:8,500+ 脂质相关基因、12,500+ 蛋白(人+模式生物),REST 可查(gene/protein 端点)。
Q15:SPARQL 能查什么?
分类树(owl:Class 层级)+ 结构注释;可 SERVICE 联邦 SwissLipids/UniProt。
Q16:数据多久更新?
滚动更新(月度级);官网各页有 Last updated 时间戳。
Q17:论文怎么引用?
数据库引 Sud 2007 NAR;分类引 Fahy 2005/2009;工具引 Conroy 2024;都附检索日期。
Q18:ML 直接吃 SMILES 行吗?
行——canonical SMILES 全库提供;注意互变异构/电荷形态规范化后再训练。
Q19:有 Python/R SDK 吧?
无官方 SDK;REST+requests/httr 足够;社区有封装(如 lipidmapsr 类项目)——用前审质量。
Q20:跟 KEGG 怎么互补?
KEGG 有通路图与正交 ID;LMSD 有结构深度与命名权威——xref 互通。
Q21:脂质分类树有几层?
Category(8 大类)→ Main class → Sub class → 更细层级;RDF 已 owl:Class 化。
Q22:能不能做子结构搜索?
官网支持(Bingo cartridge);本地可复刻(RDKit PostgreSQL cartridge)。
Q23:数据质量谁背书?
策划由联盟 curator 团队负责;2024 ELIXIR core data resource 认定=第三方可持续性评审背书。
Q24:跟 LipidBlast 什么关系?
LipidBlast 是 NIST 的理论 MS/MS 谱库(11.9 万谱),生态互补——LMSD 给结构/质量,LipidBlast 给碎片预测。
Q25:为什么值得信?
20 年连续治理(NIH→Wellcome→MRC)、curator 团队维护、社区标准地位、ELIXIR 核心资源认定。
Q26:缺什么?
单分子脂质-疾病关联弱(去 HMDB/文献)、谱图内嵌少(去 MassBank/MoNA)、植物/微生物覆盖有限。
Q27:怎么防止鉴定幻觉?
候选必须过"质量+RT+MS/MS"三关;LMID 输出回查 API 验证存在性。
Q28:能贡献新脂质吗?
能——官方渠道接受新结构提交/纠错(文献发表的新脂质是其策划来源之一)。
Q29:历史数字 49,761 是错吗?
不是——是 2025-06 时点口径;滚动库数字随时间自然增长,引用带日期即可。
Q30:下载文件多大?
TSV 数十 MB 量级;SDF 百 MB 量级——单机可承载。
Q31:LLM 微调怎么用?
系统名/缩写/同义词是天然语料(命名归一对);LMID 回查 API 防幻觉。
Q32:跟代谢组学数据库(MetaboLights 等)什么关系?
那些是"研究存档"(dataset deposition);LMSD 是"参考字典"——注释流向:存档数据→LMSD 注释。
Q33:BioPAN 输入要什么?
差异脂质列表(LMID/缩写+变化方向)→通路/酶活性推断;适合通路级假设生成。
Q34:sn 位置怎么鉴定出来的?
特殊 MS/MS 策略(Paternò-Büchi、Ozone-ID 等)或酶水解——多数常规数据只到 sum composition。
Q35:一级数据还是二级?
一级参考库(curated primary reference),非文献聚合。
Q36:AI-Ready 一句话?
50,515 结构+可解析命名语法+三通道 API+RDF 化分类树——脂质世界的"Unicode",把"峰"翻译成"分子"的标准字典。
Q37:引用批量下载的数据,版本怎么写?
“LMSD, retrieved <日期>, SHA256: <指纹>”——检索日期即版本。
Q38:跟 SwissLipids 的 ID 能互转吗?
LMSD 条目带 SwissLipids SLM: 交叉字段;无官方双向完整映射时用 InChIKey 精确对齐。
Q39:异戊烯醇脂(PR)是什么?
异戊二烯单元聚合来的脂质:辅酶 Q、多萜醇、类胡萝卜素——呼吸链/抗氧化核心。
Q40:聚酮(PK)为什么算脂质?
符合"两个以上疏水酮起源单元"的化学定义——红霉素等大环内酯药物皆属此类(分类的化学逻辑优先于功能直觉)。
Q41:怎么跟踪新功能?
官网 Highlights 栏目(Lipid of the Month/Lipid Matters/新库公告)+ NAR database issue 论文。
Q42:培训资源有吗?
官网教程/术语表/每月脂质专栏;ELIXIR 培训体系有相关课程。
Q43:LMSD 能做主键入库到院内数据中台吗?
能——LMID 稳定且语法自校验(前缀即大类);建议同时存 InChIKey 作为结构级外键,防第三方库映射漂移。
Q44:负模式数据 moverz 怎么用?
ion 传 M-H(-1.007)或 M+OAc(+59.013)等负模式类型;脂肪酸/磷脂酰肌醇类负模式响应好,TAG 类优先正模式 M+NH4。
Q45:跟本研究最相关的三类是什么?
GP(膜与信号)、SP(神经/凋亡)、FA(炎症氧脂素)——临床脂质组 80% 差异分子集中在这三类;ST 看胆固醇代谢专项。
Q46:怎么给团队做命名规范落地?
三件套:入库即转 LMID(主键)+ 报告用标准缩写(RefMet 归一)+ 归一映射表随数据存档(原始名→标准名→LMID)。
§10.5 要点回顾
- 定位:脂质世界的 Unicode——结构字典+分类标准+工具链三合一。
- 规模口径:50,515(2026-06-09)= 28,481 策划 + 22,034 计算;引用带检索日期。
- 八大类:FA/GL/GP/SP/ST/PR/SL/PK——化学起源逻辑,社区公认。
- LMID 语法:12/14 字符;前缀即大类;语法本身可解析为特征。
- 三通道:REST(批量/质量搜索)/ SPARQL(联邦)/ 全库下载(SDF/TSV/CSV/RDF)。
- 证据分层:策划 vs 计算;鉴定 L1-L3;加合物/sn 异构是歧义源。
- 归一必经:RefMet/LipidLynxX 吸收命名漂移——ML 特征对齐前置。
- 治理背书:NIH $73M→Wellcome→MRC;ELIXIR 核心资源(2024)。
- 许可语义:free open access;未见单列 CC 文本——商用前核对+商标避让。
- AI 喂法:表格/分子图/文本/知识图四路齐备;LMID 为长期资产主键。
口径存照(数字均注明口径与来源,写入正文前已核对)
- 核心规模:LMSD 50,515 结构 = 策划 28,481 + 计算生成 22,034,Last updated 2026-06-09,Ontology=LIPID MAPS Classification,导出 SDF/RDF/TSV/CSV,跨库 ID 列表(KEGG/HMDB/CHEBI/LIPIDBANK/PubChem CID/SwissLipids/Cayman/PDB/GuidePharm)= LMSD 官方工具页(lipidmaps.org/resources/tools/7)
- 历史口径链:49,667(2025-04-09,北海道大学论文引官网)→ 49,761(2025-06,JLR LipidLibrarian 论文)→ 49,790+(2025-07,UVa MALDI 食物综述)→ 50,515(2026-06 官方页)
- 八大类与代码:fatty acyls (FA)/glycerolipids (GL)/glycerophospholipids (GP)/sphingolipids (SP)/sterol lipids (ST)/prenol lipids (PR)/saccharolipids (SL)/polyketides (PK) = Fahy 2005 JLR 46:839-861 + JLR LipidLibrarian 论文 + 官网
- LMID:12 或 14 字符唯一标识、特定命名层级 = JLR LipidLibrarian 论文 + 官网 shorthand_nomenclature/hierarchy 页
- 创立与资助:2003 年 NIH “Glue Grant”(NIGMS)创立;10 年 NIH 资助超 $73M、400+ 论文;12 共同 PI/7 大学+1 biotech;Edward Dennis 发起 = Dennis 回忆录(escholarship qt2ff6d48r)+ UCSD 2016-07-19 新闻稿
- 资助更替:2016-07 Wellcome Trust £1.3M 接手(Cardiff/Babraham/UCSD 联合)→ 现 MRC Partnership award(Cardiff 主持 Valerie O’Donnell + UCSD + Babraham + Swansea + Edinburgh);服务器在 Babraham Institute = UCSD 新闻稿 + 官网 About 页
- ELIXIR:2020-01 成为 ELIXIR service;2024 年成为 ELIXIR core data resource + Global Biodata Coalition core biodata resource = Wikiwand 条目(引官方)
- ILCNC:国际脂质分类与命名委员会(Dresden 会议起源:Dennis-Kai Simons-Gerrit van Meer-Fritz Spener);2009/2021 两次更新 = Dennis 回忆录
- 主引文:LMSD=Sud 2007 NAR 35:D527-532;portal primary citation PMID 17584797;分类=Fahy 2005 + Fahy 2009(PMID 19098281)= JLR 论文 + Wikiwand
- REST 接口清单:compound/lm_id/{LMID}/{name|smiles|sys_name|molfile|structure|all};pubchem_cid/inchi_key/formula 查询;abbrev/abbrev_chains(批量);moverz/LIPIDS/{mz}/{ion}/{tol}(正:M+H/M+2H/M+3H/M+4H/M+NH4/M+Ag/M+Na/M+2Na/M+K/M+2K/M+Li/M+2Li;负:M-H/M-CH3/M-2H/M-3H/M-4H/M.Cl/M.OAc;中性 Neutral);LMFA0301/LMFA03/LMGP/LM 全库/按类 download;gene/protein 端点 = 官网 resources/rest 页
- SPARQL:lipidmaps.org/sparql,1.1 版,ELIXIR 2021 ‘FAIR lipids’ Hackathon 产物;脂类分类 owl:Class + rdfs:subClassOf = Conroy 2024 NAR 更新(gkad896,ORCA 存档)
- 技术栈:Postgres 9.2.24 + Bingo 1.7.9 化学 cartridge + Ketcher 1.1 + CentOS 7.9(16GB/8C);近年迁移 Laravel = Conroy 2024
- RefMet 归一示例(DAG C36:3→DG 36:3);数值<5000 跳转 bulk search;LipidFinder/BioPAN/LipidLynxX 集成;结构绘制工具含磷脂酰苏氨酸新增 = Conroy 2024
- Lipid Calc:PWA 升级,Murphy 父子(Brendan J. Murphy/Robert C. Murphy)开发 = 官网 Highlights(2026-09)
- 离子迁移库:新增近 400 条 oxylipin CCS(Amie Solosky/Erin Baker 实验室)= 官网 Highlights;CCS 总量 3,800+ 口径 = Creative Proteomics 综述
- LMPD:8,500+ 基因/12,500+ 蛋白 = Creative Proteomics 综述引官网;LMISSD = Wikiwand 引官网
- SwissLipids 对照:779,249 物种/7,170 证据/1,580 文献(2025-06)= JLR LipidLibrarian 论文
- 许可定性:官网 “A free, open access lipidomics resource”(首页标语);“facilitate re-use and incorporation into other cheminformatic workflows”(Conroy 2024);未见单列 CC 文本——本文以 free open access 表述并存照
- 赞助:Cayman Chemical、Avanti Polar Lipids = Wikiwand;运营与管理组/科学顾问委员会/命名组名单 = 官网 About
- 覆盖口径:“mainly mammalian but has been expanded to include some lipids from other sources including plants” = Nat Methods 2022 指南(Ni et al. 10.1038/s41592-022-01710-0)
- 批次口径:批次定义"5 万+ 脂质结构/8 大类"与官方 50,515/8 类一致——正文以官方页口径为主
- 加合物偏移常数:质子 1.007276 Da、铵 18.033823、钠 22.989218、乙酸根加合 +59.013304——由单同位素质量定义推算,与 moverz ion 参数内部实现一致 = IUPAC 原子量 + 官网 REST 文档 ion 类型清单
- 证据等级框架:L1(标品对照)/L2(谱图库推断)/L3(类级归属)为脂质组学界的 MSI 惯例分层,LMSD 本身不发布鉴定等级——等级由下游管线标注 = Sumner/Want 等 MSI 规范惯例(社区共识)
- oxylipin 医学语境:氧脂素为花生四烯酸/亚麻酸级联产物,COX/LOX 通路药理靶点——正文 §2.10 的通路语义为教科书级常识(脂质信号转导章节通用知识),非单一来源引用
- 官网稳定性口径:infrastructure was upgraded during the last 3 years(Laravel 迁移)+ 5-year hardware lifespan + "维持网站与数据库可用"承诺 = 官网 About 页原文
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- intact — 共享标签:基因组学与多组学 / 药物发现与化学
- msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
- alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
- disgenet — 共享标签:基因组学与多组学 / 药物发现与化学
- open-targets — 共享标签:基因组学与多组学 / 药物发现与化学
- alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
- pdb — 共享标签:基因组学与多组学 / 药物发现与化学
- hmdb — 共享标签:基因组学与多组学 / 药物发现与化学
- lincs-l1000 — 共享标签:基因组学与多组学 / 药物发现与化学
- ctd — 共享标签:基因组学与多组学 / 药物发现与化学
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

