LIPID MAPS 脂质结构数据库 — AI-Ready Wikipedia

50,515 条脂质结构 · 8 大类分类树 · LMID 命名语法:脂质组学的语义标准与 AI-Ready 工程底座

来源 https://lipidmaps.org/发布时间: 2026-09-20最后更新: 2026-09-25 阅读 39
LIPID MAPS 脂质结构数据库 — AI-Ready Wikipedia

信息速览

数据集名称LIPID MAPS 脂质结构数据库 — AI-Ready Wikipedia
数据类型50,515 脂质结构,8 大类,LMID 命名语法,开放获取,REST/SPARQL
规模不适用(化学结构数据库;无人类患者数据)
接入方式https://lipidmaps.org/
AI 就绪度

INFOBOX

属性 内容
名称 LIPID MAPS Structure Database(LMSD)/ LIPID MAPS® 脂质组学门户
维护方 LIPID MAPS Consortium(Cardiff 大学牵头 + UCSD/Babraham/Swansea/Edinburgh)
创立 2003 年(NIH NIGMS “Glue Grant”;Edward Dennis 发起)
定位 全球最大策划脂质结构数据库 + 脂质组学分类/命名社区标准
规模 50,515 条脂质结构(策划 28,481 + 计算生成 22,034;2026-06-09 官方口径)
分类 8 大类:脂肪酸 FA / 甘油酯 GL / 甘油磷脂 GP / 鞘脂 SP / 固醇脂 ST / 异戊烯醇脂 PR / 糖脂 SL / 聚酮 PK
标识符 LMID(12/14 字符,如 LMFA01010001);跨引 KEGG/HMDB/ChEBI/PubChem/SwissLipids 等
获取 REST API / SPARQL 1.1 / 全库下载(SDF/RDF/TSV/CSV/MOL)
许可 免费开放获取(free open access)
资助 NIH(10 年 $73M)→ Wellcome Trust(2016-)→ MRC Partnership(现)
地位 ELIXIR service(2020)→ ELIXIR 核心数据资源 + Global Biodata Coalition 核心资源(2024)
主引文 Sud 2007 NAR(LMSD);Fahy 2005/2009 JLR(分类系统)
官网 lipidmaps.org

§0 E-E-A-T 信任声明与免责声明

经验(Experience):本文基于 LIPID MAPS 官网(About/resources/rest/databases/lmsd 页 2026-09 现场核查)、官方工具页、2024 NAR 更新论文(Conroy 等)、2022 Nat Methods 软件指南(Ni 等)、2026 JLR LipidLibrarian 论文(第三方交叉)撰写——数字均有口径标注。

专业性(Expertise):全文遵循"每个数字注明口径与来源"纪律;策划/计算生成条目证据等级、缩写语法歧义、命名漂移等陷阱显式披露;不含任何"推断当作事实"的表述。

权威性(Authoritativeness):LIPID MAPS 是脂质分类/命名/结构绘制规范的社区标准(期刊与研究者广泛采用);本文为第三方解读,不替代官方文档。

可信度:文内数字进入文末「口径存照」;50,515(2026-06-09)与 49,761(2025-06)两个时间口径已显式区分;"CC BY"未经官方文本确认处,一律以官网"free open access"定性表述。

免责:本文为学术性数据资源解读,不构成医疗建议;脂质生物标志物的临床使用须遵循相应法规与临床指南。

§1 数据集概览

§1.0 📌 30 秒速览

  • 是什么:全球最大的策划脂质结构数据库(LMSD),附分类体系、命名标准与全套脂质组学信息学工具;
  • 规模:50,515 条脂质结构 = 28,481 策划 + 22,034 计算生成(2026-06-09 官方口径),8 大类分类树;
  • 标识符:LMID 12/14 字符编码(LMFA01010001 = 脂肪酸类下第一个亚类第一个结构);
  • 获取三通道:REST API(全库一行 URL 拉取)/ SPARQL 1.1 联邦查询 / 全库下载(SDF/TSV/CSV/RDF/MOL);
  • AI 价值:命名语法可解析(链长/不饱和度/双键位置)、SDF 直接进分子图神经网络、分类树是天然层级标签;
  • 最大坑:策划 vs 计算条目证据等级不同;缩写中 / 与 _ 语义不同。

§1.1 摘要

LIPID MAPS(Lipid Metabolites And Pathways Strategy)2003 年由 NIH “Glue Grant” 资助创立,十年 $73M 把"脂质组学"从一个分散领域建成有统一分类、命名与工具的学科;其后由 Wellcome Trust 与 MRC 接续资助,2024 年成为 ELIXIR 核心数据资源。其核心资产 LMSD 收录 50,515 条脂质结构(2026-06 口径),按国际公认的 8 大类体系组织(Fahy 2005/2009),每条结构配 LMID 唯一标识、SMILES/InChI/InChIKey 结构表示、系统名与缩写、精确质量与物化性质、跨库标识。对 AI 而言,LMSD 是"脂质空间"的坐标系:分子 ML 吃 SDF/SMILES,质谱 ML 吃精确质量与加合物规则,脂质组特征工程吃可解析的缩写语法与分类树。它是脂质组数据"从峰列表到分子身份"翻译环节的标准字典。

§1.2 战略价值

  1. 语义标准:脂质组学长期困于命名混乱(同一分子数十种写法)——LIPID MAPS 分类+缩写语法+RefMet 归一化是业界共同语言;
  2. 鉴定基准:m/z 搜索(moverz)、谱图库链接(MassBank/MoNA)使"峰→分子"鉴定有据可依;
  3. 数据互操作:LMID 与 ChEBI/HMDB/PubChem/KEGG/SwissLipids 互通,是脂质数据的"枢纽坐标系";
  4. AI 特征底座:结构(SDF)、层级标签(8 类→主类→亚类)、物化性质(logP/TPSA 等)三类特征一次到位;
  5. 可持续性背书:NIH→Wellcome→MRC 二十年资助链 + ELIXIR 核心资源地位 = 长期可用性风险极低。

§1.3 同类数据集横向对比

维度 LIPID MAPS LMSD SwissLipids ChEBI HMDB(脂质部分) LipidBANK
规模 50,515 结构 779,249 物种(含理论展开) ~2 万脂质条目 220,945 代谢物总量 历史悠久但规模小
证据模型 策划+计算分开标注 策划证据 7,170 条/1,580 文献 手工策划+本体推理 实验+预测混合 实验为主
分类体系 LIPID MAPS 8 类(社区标准) 沿用 LM 分类+自有层级 ChEBI 本体 自有 8 类 自有
标识符 LMID SLM: CHEBI: HMDB: LIPID BANK ID
质谱工具 全套(moverz/bulk/谱库链接) 无 无 部分 无
更新 滚动(月度级) 滚动 季度 年度大版本 缓慢
AI 喂法 SDF+REST+SPARQL REST+SPARQL OWL/RDF 下载+API 网页为主

结论:LMSD 不是最大(SwissLipids 理论展开更大),但策划质量×工具链×分类权威性三者合计无可替代——它是"字典",SwissLipids 是"百科+推演"。

§1.4 版本时间轴

时间 事件 规模口径
2002 Dennis 申请 NIGMS Glue Grant(12 共同 PI) —
2003 LIPID MAPS 创立;分类系统启动开发 —
2005 Fahy 分类系统论文(JLR) —
2007 LMSD 正式论文(Sud, NAR) ~3,000 策划结构量级
2009 分类系统更新(Fahy;ILCNC 扩容) —
2016 Wellcome Trust 接手(£1.3M);迁往英国 >40,000 结构
2020 成为 ELIXIR service;SPARQL 上线(2021 hackathon) ~47,000
2024 ELIXIR 核心数据资源 + Global Biodata Coalition 核心资源 ~49,000
2025-06 LipidLibrarian 论文引用口径 49,761
2026-06 官方页现口径 50,515(28,481+22,034)

§1.5 应用场景矩阵

场景 用到的部分 关键动作
非靶向脂质组鉴定 LMSD 精确质量+加合物规则+moverz 峰列表→候选分子→MS/MS 确认
跨研究特征对齐 RefMet+缩写语法 各文献命名→标准名→可合并矩阵
分子图神经网络 SMILES/SDF 下载 脂质分子图→性质/活性预测
脂质通路分析 BioPAN+LMPD 基因/蛋白 脂质变化→通路级解读
生物标志物发现 LMID 对接临床队列 队列差异脂质→标准注释→验证
LLM 知识注入 分类树+系统名+同义词 结构化语料→领域适配
质量控制 精确质量+物化性质 注释结果合理性核查

§1.6 组件全景

LIPID MAPS 门户
├── LMSD 结构数据库(50,515 条;本文主角)
├── LMISSD 计算预测结构库(头基展开生成)
├── LMPD 基因/蛋白库(8,500+ 基因 / 12,500+ 蛋白)
├── 工具套件
│   ├── 搜索:结构/分子式/m/z/性质搜索 + 自动补全
│   ├── moverz 前体离子搜索(REST 化)
│   ├── Bulk Search 批量质量搜索
│   ├── 结构绘制工具(Ketcher,含 PT 类规范)
│   ├── Lipid Calc(PWA 质量计算器)
│   ├── RefMet 命名标准化
│   ├── LipidLynxX 跨库名称对齐
│   ├── LipidFinder LC-MS 工作流
│   └── BioPAN 脂质通路分析
├── 离子迁移数据库(CCS 值;oxylipins 新增 400 条)
└── 教育资源(教程/每月脂质/术语表)

§1.7 数据获取三通道速记

  1. REST API(最轻):https://www.lipidmaps.org/rest/compound/lm_id/LM/all/download 一行拉全库 TSV;单条 …/LMFA01010001/all;moverz 搜索 …/moverz/LIPIDS/635.52/M+H/0.5/txt;
  2. SPARQL 1.1(联邦):lipidmaps.org/sparql 端点,可与 SwissLipids/UniProt 联邦查询;脂类分类已发布为 owl:Class 层级;
  3. 全库下载(最重):SDF/RDF/TSV/CSV/MOL 格式,本地建库(Postgres+Bingo 类化学索引可复刻官方架构)。

§1.8 LMID 语法速记

LM FA 0101 0001
│  │  │    │
│  │  │    └─ 序列号(类内唯一)
│  │  └─ 主类/亚类编号(01 = 亚类 01)
│  └─ 大类代码:FA 脂肪酸 / GL 甘油酯 / GP 甘油磷脂
│              SP 鞘脂 / ST 固醇脂 / PR 异戊烯醇脂
│              SL 糖脂 / PK 聚酮
└─ LIPID MAPS 前缀

12 字符版无立体特异性后缀;14 字符版含立体/链位置细分。语法本身就是"可解析特征"——解析 LMID 即得大类归属。

§1.9 独特视角:脂质组学的"Unicode"

蛋白组学有序列(FASTA),基因组有坐标(chr:pos),代谢组有 InChIKey——脂质组的麻烦在于同一分子有太多写法且歧义普遍。LIPID MAPS 干的事本质上是给脂质世界造了一套 Unicode:每个结构一个码位(LMID),一套规范书写法(缩写语法),一套归一化转换(RefMet)。AI 系统只要坚持"入库即转 LMID",后续一切特征、模型、报告都获得确定性与可合并性。这就是本文把它归入"AI-Ready 结构性资产"而非普通数据库的原因——它是翻译层,不是又一个数据孤岛。

§2 医学与科学背景

§2.1 脂质为什么难分类

脂质不像蛋白(氨基酸规则)或核酸(碱基配对规则)有统一骨架——从脂肪酸到聚酮,结构多样性跨越"疏水/两亲"、链式/环状/融合环、酯/醚/酰胺键接。历史上各类脂质(磷脂/鞘脂/固醇)各有各的分类传统,彼此不一致。LIPID MAPS 的第一步不是建库而是先立分类法:以"两个以上以疏水为主的天然产物单元"为脂质的化学定义锚点,把全部脂质收入 8 个化学起源大类——这一步让"脂质"从模糊概念变成可枚举空间。

§2.2 八大类速览与医学意义

大类 代码 代表分子 医学语义
脂肪酸 FA 棕榈酸、花生四烯酸、前列腺素 能量代谢、炎症信号(类花生酸)
甘油酯 GL 甘油三酯(TAG)、DG 能量储存、代谢综合征
甘油磷脂 GP PC、PE、PI、PS 膜结构、信号转导(PI 通路)
鞘脂 SP 鞘磷脂、神经酰胺 膜微区、凋亡、溶酶体贮积症
固醇脂 ST 胆固醇、胆汁酸、维生素 D 心血管、消化、钙代谢
异戊烯醇脂 PR 辅酶 Q、类胡萝卜素 抗氧化、呼吸链
糖脂 SL 脂多糖(LPS)成分 先天免疫、革兰阴性菌
聚酮 PK 红霉素类、多烯大环内酯 抗菌/抗肿瘤药物(天然产物)

§2.3 脂质组学的质谱语义

脂质组学以 LC-MS(/MS) 为主力:m/z(质荷比)+ 保留时间 + MS/MS 碎片→分子身份。LMSD 对这一链条的支撑有三点:

  1. 精确质量:单同位素质量供 m/z 匹配(含加合物规则:M+H/M-H/M+Na/M+NH4 等,REST moverz 直接支持全部常见离子型);
  2. 加合物语义:同一脂质在正/负离子模式出峰不同——LMSD 缩写+质量让"峰表"可回溯"分子";
  3. MS/MS 谱库链接:MassBank/MoNA 链接提供碎片确认的"第二证据"。

§2.4 缩写语法的歧义学

PC(16:0/20:4) 与 PC(16:0_20:4) 差一个符号但语义不同:/ 表示 sn-1/sn-2 位置确定;_ 表示总碳数与不饱和度确定、但位置不确定。同理双键位置 20:4(5Z,8Z,11Z,14Z) 写出位置几何,省略则未知。AI 处理文献脂质名时,这种"语法级差异"是结构歧义的主要来源——入库规范化(RefMet)不是可选项而是必需品。

§2.5 脂质代谢与疾病

脂质是代谢综合征、动脉粥样硬化、脂肪肝、神经退行性疾病、溶酶体贮积症的直接分子参与者;鞘脂/神经酰胺轴与凋亡,PI 信号与癌症, oxylipins 与炎症——脂质组队列(血浆/组织)产出的差异脂质需要 LMID 级标准注释才能跨研究比较与复现。LMSD 在"临床脂质组学→生物标志物→机制解释"链条里扮演注释基准角色。

§2.6 与基因组/蛋白组数据的连接

LMPD(基因/蛋白库)把脂质与酶(脂肪酸合酶、磷脂酶、鞘脂代谢酶系)连接,使多组学整合成为可能:转录组上调基因→LMPD 酶→其底物/产物脂质类→LMSD 结构级注释。BioPAN 把这一逻辑产品化——输入"哪些脂质变了",输出"哪些通路/酶活动可能变了"。

§2.7 RefMet 与命名漂移

不同平台/文献对同一脂质的命名差异巨大(TG 54:6 vs TAG(16:0_18:1_20:5) vs 三酰甘油 C57H92O6)。RefMet(官网集成)把任意输入归一为标准名+LMID;LipidLynxX 提供跨库名称对齐。对 ML 而言,没有归一化的特征矩阵 = 不同词表拼接出的噪声——这是脂质组 ML 论文可复现性差的首要原因之一。

§2.8 计算生成条目的证据语义

LMSD 明示其结构来源:核心实验室与合作伙伴、LIPID MAPS 实验鉴定、文献手工策划、期刊新报道、类别内计算生成。计算生成(22,034 条,占 43.6%)= 按头基×酰基链组合规则展开(如 GP 类 PC 34:1 的可能链组合)——它们是"化学上可能但未必生物存在"的骨架。AI 用其做鉴定候选池合理,用其做"存在性"结论不当。

§2.9 离子迁移维度

质谱之外,离子迁移谱(IMS)提供碰撞截面积(CCS)这一额外结构约束。LIPID MAPS 离子迁移库近期新增约 400 条 oxylipin CCS 值(Baker 实验室)——CCS+m/z+RT 三维匹配显著降低误鉴定率,是脂质组 AI 鉴定模型(如深度学习谱预测)的重要特征源。

§2.10 脂质信号转导的医学语义

脂质不只是膜材与储能——它是第二信使与炎症介质的主力语汇。PI(4,5)P₂ 被 PLC 切成 IP₃+DAG 拉开钙信号与 PKC 通路;神经酰胺/鞘磷脂开关决定凋亡走向;花生四烯酸级联(COX/LOX 产物)是前列腺素/白三烯炎症药理的靶点库;氧脂素(oxylipins)作为血管与免疫调节分子进入临床队列 biomarker 清单。这些通路的"分子角色表"全部落在 LMSD 的 FA/GP/SP 大类里——通路解释是 LMSD 注释到临床语义的最后一公里,BioPAN 把这段路自动化了一半。

§3 数据集规格

§3.1 规格总表

属性 规格
正式名称 LIPID MAPS Structure Database(LMSD)
规模 50,515 结构(策划 28,481 / 计算 22,034;2026-06-09)
分类层级 8 大类 → 主类 → 亚类 → 级联结构层级
标识符 LMID(12/14 字符)
结构表示 2D 图像 / MOL / SDF / Canonical SMILES / InChI / InChIKey
命名 系统名 + 缩写(LM 语法)+ 同义词 + 常用名
质量数据 单同位素精确质量、分子式
物化性质 logP、摩尔折射率、TPSA、HBD/HBA、可旋转键、芳香环、van der Waals 体积
跨库 ID KEGG / HMDB / ChEBI / LIPIDBANK / PubChem CID / SwissLipids / Cayman / PDB / GuidePharm
物种标注 NCBI Taxonomy ID
谱图链接 MassBank(MoNA 谱库生态)
获取 REST / SPARQL 1.1 / 全库下载(SDF/RDF/TSV/CSV/MOL)
更新频率 滚动更新(月度级;官网页注明 Last updated)
许可 free open access(免费开放获取)
宿主 Babraham Institute 服务器(Cardiff 牵头运营)

§3.2 数据发布口径地图

LMSD 主库(Lipid Oriented Database)
├── 策划条目 28,481(人工核实结构/命名/交叉引用)
├── 计算生成条目 22,034(类别内头基×酰基链展开)
└── 合计 50,515(2026-06-09 口径)
LMISSD(In-Silico):更大规模理论展开(不在 50,515 内)
LMPD:基因 8,500+ / 蛋白 12,500+(人+模式生物)

引用纪律:论文里写"LMSD 包含 50,515 条"须附检索日期;写"约 5 万"最稳;禁止把 LMISSD 规模与 LMSD 混算。

§3.3 DAIMS 数据AI就绪度评估

维度 评分 依据
可获取性 Accessibility 9/10 REST/SPARQL/全库下载三通道;免注册
格式机读性 Machine-readability 9/10 TSV/CSV/SDF/RDF 全覆盖;molfile 开源格式
标识稳定性 8/10 LMID 永久;跨库 ID 偶有补录变更
结构完整性 8.5/10 策划条目全字段;计算条目部分字段缺省
语义层次 9/10 分类树+RDF/OWL 化;SPARQL 联邦
文档质量 8/10 REST 页示例齐全;API 版本语义较弱
许可清晰度 7/10 open access 定性明确;单列 CC 文本未见
合计 8.5/10 结构性资产级 AI-Ready

§3.4 存储与计算需求

  • 全库 TSV 下载约数十 MB 量级;SDF(含 2D 结构坐标)约百 MB 量级——单机可承载;
  • 子结构搜索需化学索引(Bingo/RDKit PostgreSQL cartridge 或 RDKit 内存指纹);
  • SPARQL 联邦查询免本地存储但有远端限速——批量任务用 REST/下载通道;
  • 内存建模:50,515×(分子图嵌入 128 维)≈ 数十 MB——分子 ML 全库嵌入单卡可算。

§3.5 获取通道

  1. Web:lipidmaps.org/databases/lmsd(浏览/搜索/按类浏览);
  2. REST:/rest/compound/lm_id/{LMID}/{field} 单条;/rest/compound/lm_id/{prefix}/all/download 按类拉取;LM/all/download 全库;
  3. SPARQL:lipidmaps.org/sparql(1.1;联邦示例见 §4.6);
  4. 下载:SDF/RDF/TSV/CSV/MOL 打包(结构+注释);
  5. 镜像生态:PubChem/SwissLipids/ChEBI 交叉提供部分镜像数据(语义以 LMSD 原库为准)。

§3.6 口径对齐表

论文/场景常用表述 精确口径 注意
“LIPID MAPS 收录 5 万+脂质” LMSD 50,515(2026-06-09) 加检索日期
“8 大类” FA/GL/GP/SP/ST/PR/SL/PK 2009 更新后口径
“LMID” 12 或 14 字符 计数/正则须兼容两种
“LMPD 覆盖脂质基因” 8,500+ 基因/12,500+ 蛋白 含模式生物
“SwissLipids 更大” 779,249 物种(理论展开多) 不与 LMSD 混比
“CCS 库” 离子迁移库;oxylipins 新增 400 3,800+ 为生态总量口径

§3.7 版本选择纪律

LMSD 滚动更新无版本号——用"检索日期+口径数字"替代版本号:

  1. 方法学段落写"LMSD, retrieved 2026-09-20 (50,515 structures)";
  2. 全库下载文件本地存 SHA256;
  3. 跨研究合并时以"最晚检索日期"者归一(RefMet 二次归一);
  4. 引用旧论文数字(49,761 等)时注明其检索时点,避免"数字打架"。

§3.8 数据文件与字段详表

全库 TSV 的核心字段(REST LM/all/download 口径):

字段 类型 说明
LM_ID 文本 主键(LMFA01010001 式)
Name 文本 系统名
Abbrev 文本 LM 缩写(Chemical/Chain 两版)
Formula 文本 分子式
Exact_mass 浮点 单同位素质量
SMILES 文本 canonical SMILES
InChI/InChIKey 文本 标准表示
Category/Main_class/Sub_class 文本 分类树三级
Synonyms 文本 同义词(管道分隔)
PubChem CID 等 文本 跨库 ID(可空)

SDF 额外含 2D 坐标(molfile);RDF 含 owl:Class 分类断言。

§4 数据结构

§4.1 对象模型

LipidEntry(1 条 = 1 个确定结构)
├── identity:LMID / 系统名 / 缩写(Chemical+Chain)/ 同义词
├── structure:SMILES / InChI / InChIKey / MOL(2D 坐标)
├── mass:分子式 / 单同位素精确质量
├── classification:Category → Main → Sub(8 大类树)
├── physchem:logP / TPSA / HBD / HBA / RotB / MR / VdW
├── xref:PubChem / ChEBI / HMDB / KEGG / SwissLipids / LIPIDBANK / PDB
├── provenance:curated | computational(证据等级)
└── organism:NCBI Taxonomy ID(生物来源)

§4.2 全库下载与本地加载(实战)

# 1) 全库 TSV(一行拉取,免注册)
curl -L "https://www.lipidmaps.org/rest/compound/lm_id/LM/all/download" \
     -o lmsd_all.tsv

# 2) 指纹入库(滚动库的"版本"= 检索日期 + SHA256)
sha256sum lmsd_all.tsv | tee lmsd_all_20260920.SHA256

# 3) 快速体检:行数 / 大类分布
wc -l lmsd_all.tsv
awk -F'\t' 'NR>1 {print $NF}' lmsd_all.tsv | sort | uniq -c | sort -rn | head

# 4) 按大类拉取(只要甘油磷脂)
curl -L "https://www.lipidmaps.org/rest/compound/lm_id/LMGP/all/download" -o lmsd_gp.tsv

§4.3 单条查询与结构获取(实战)

# LMID → 全字段
curl -s "https://www.lipidmaps.org/rest/compound/lm_id/LMFA01010001/all/txt"

# LMID → molfile(2D 结构,可进 RDKit)
curl -s "https://www.lipidmaps.org/rest/compound/lm_id/LMFA01010001/molfile" > lmfa01010001.mol

# 缩写 → 结构图(SMILES)
curl -s "https://www.lipidmaps.org/rest/compound/abbrev/PC(16:0/20:4(5Z,8Z,11Z,14Z))/structure"

# PubChem CID → SMILES(跨库桥)
curl -s "https://www.lipidmaps.org/rest/compound/pubchem_cid/985/smiles"

§4.4 m/z 前体离子搜索(实战)

import requests

BASE = "https://www.lipidmaps.org/rest"

def moverz(mz: float, ion: str = "M+H", tol: float = 0.5):
    """LIPIDS 虚拟库前体离子搜索。
    ion: M+H / M+NH4 / M+Na / M-H / M-2H / Neutral …(正/负/中性全支持)
    """
    r = requests.get(f"{BASE}/moverz/LIPIDS/{mz}/{ion}/{tol}/txt", timeout=30)
    r.raise_for_status()
    rows = [ln.split("\t") for ln in r.text.strip().splitlines() if ln.strip()]
    return rows  # [LMID, 缩写, 精确质量, 差值, …] 视返回列

# 示例:正模式 m/z 635.52(M+H,容差 0.5)
for row in moverz(635.52, "M+H", 0.5):
    print(row)

# 批量峰表注释(示意)
peaks = [635.52, 513.45, 759.58]
for mz in peaks:
    cands = moverz(mz, "M+H", 0.3)
    print(mz, "候选数:", len(cands) - 1 if cands else 0)

§4.5 缩写语法解析器(特征工程)

import re

CAT = {"LMFA": "fatty_acyl", "LMGL": "glycerolipid",
       "LMGP": "glycerophospholipid", "LMSP": "sphingolipid",
       "LMST": "sterol_lipid", "LMPR": "prenol_lipid",
       "LMSL": "saccharolipid", "LMPK": "polyketide"}

def parse_abbrev(abbrev: str):
    """PC(16:0/20:4(5Z,8Z,11Z,14Z)) → 结构化特征。
    '/' sn 位置确定;'_' 位置不确定——特征里保留该语义。
    """
    m = re.match(r"^([A-Z][A-Za-z0-9]+)\((.+)\)$", abbrev)
    if not m:
        return None
    head, chains = m.groups()
    pos_definite = "/" in chains
    feats = {"headgroup": head, "position_defined": pos_definite}
    total_c, total_unsat, db_positions = 0, 0, []
    for ch in re.split(r"[/_(]", chains):
        if ":" in ch:
            c, u = ch.split(":")[:2]
            total_c += int(c); total_unsat += int(u)
        dm = re.findall(r"(\d+)Z|(\d+)E", chains)
    if dm:
        db_positions = [a or b for a, b in dm]
    feats.update(total_carbon=total_c, total_unsaturation=total_unsat,
                 db_positions=db_positions)
    return feats

print(parse_abbrev("PC(16:0/20:4(5Z,8Z,11Z,14Z))"))
# {'headgroup': 'PC', 'position_defined': True,
#  'total_carbon': 36, 'total_unsaturation': 4,
#  'db_positions': ['5', '8', '11', '14']}

§4.6 SPARQL 联邦查询(实战)

# 端点:https://lipidmaps.org/sparql(1.1)
# 场景:拿某大类下全部亚类 owl:Class 层级
query = """
PREFIX rdfs: <http://www.w3.org/2000/01/rdf-schema#>
PREFIX lm:   <https://www.lipidmaps.org/data/classification/LMID/>
SELECT ?subclass ?label
WHERE {
  lm:LMGP rdfs:subClassOf* ?subclass .
  ?subclass rdfs:label ?label .
}
"""
import requests
r = requests.get("https://lipidmaps.org/sparql",
                 params={"query": query, "format": "json"}, timeout=60)
for b in r.json()["results"]["bindings"]:
    print(b["subclass"]["value"], b["label"]["value"])

联邦用法:SERVICE 子句跨 SwissLipids/UniProt 端点联合检索(ELIXIR FAIR lipids hackathon 的设计初衷)。

§4.7 分子 ML 喂法:SDF → 图特征(实战)

# pip install rdkit pandas
from rdkit import Chem
from rdkit.Chem import Descriptors, Crippen, rdMolDescriptors
import pandas as pd

supp = Chem.SDMolSupplier("lmsd_lipids.sdf")
rows = []
for mol in supp:
    if mol is None:
        continue
    rows.append({
        "lm_id": mol.GetProp("_Name"),
        "mw": Descriptors.MolWt(mol),
        "logp": Crippen.MolLogP(mol),
        "hbd": rdMolDescriptors.CalcNumHBD(mol),
        "rotb": rdMolDescriptors.CalcNumRotatableBonds(mol),
        "smiles": Chem.MolToSmiles(mol),
    })
df = pd.DataFrame(rows)

# 图神经网络路径:SMILES → 分子图(示意,deepchem/PyG 皆可)
# from torch_geometric.data import Data  # 原子=节点,键=边
# 特征建议:原子类型/电荷/手性 + 键级/共轭 —— 脂质链式结构下,
# 长链原子的位置编码(距头基距离)对性质预测尤为关键。

§4.8 数据血缘

上游来源                       LIPID MAPS 处理              消费方
──────────                    ──────────────              ──────
联盟核心实验室实验          ─▶ 策划条目(28,481)──┐
文献手工策划/LIPID BANK     ─▶ 策划条目             ├─▶ 脂质组鉴定管线
类别规则展开                ─▶ 计算条目(22,034)──┘    (MS-DIAL/MS-DIAL 类)
ILCNC 分类规范              ─▶ 8 大类树/RDF/OWL    ──▶ 跨库(ChEBI/HMDB/PubChem)
NCBI Taxonomy               ─▶ 物种标注            ──▶ RefMet/LipidLynxX 归一
质谱谱库(MassBank/MoNA)   ─▶ 谱图链接            ──▶ BioPAN 通路解读
离子迁移实验(CCS)         ─▶ 离子迁移库          ──▶ 分子 ML / LLM 语料

§4.9 完整性清单

  1. 下载文件 SHA256 + 检索日期记录(滚动库的版本语义);
  2. LMID 去重校验(主键唯一);
  3. 大类分布合理(GP/FA/GL 应占大头;某类突增=口径异常);
  4. 策划/计算条目比例记录(provenance 字段留存);
  5. SDF 分子可解析率(RDKit 读取失败率应≈0);
  6. 跨库 ID 覆盖率统计(PubChem 覆盖率通常最高)。

§5 下游分析协议

§5.1 任务×资源速查表

任务 用什么 关键参数/动作
峰表注释 moverz REST + 精确质量 离子型匹配(M+H/M-H);容差 ≤0.3 Da
MS/MS 确认 MassBank/MoNA 链接 碎片匹配 + CCS(如有)
跨研究合并 RefMet 归一 + LMID 先归一再合并
分子性质模型 SDF/SMILES 下载 图神经网络/描述符
脂质通路解读 BioPAN 输入差异脂质列表
酶-底物连接 LMPD 基因符号/UniProt 查询
术语规范化 RefMet + 缩写语法 报告层统一命名

§5.2 非靶向脂质组鉴定协议

  1. 峰表准备:特征 m/z+RT+强度(XCMS/MZmine/MS-DIAL 输出);
  2. 加合物假设:正模式 M+H/M+NH4/M+Na;负模式 M-H/M+OAc(REST moverz 支持);
  3. 质量匹配:容差按仪器(HRMS ≤5 ppm——moverz 用 Da 时自行换算);
  4. 候选过滤:LMSD 命中 + 同类保留时间规律(RT 对齐);
  5. MS/MS 确认:谱库链接碎片匹配;头基中性丢失(PC 184.07 等);
  6. 等级标注:L1(标品对照)/L2(谱图库推断)/L3(类级)——LMSD 命中≠L1;
  7. 入库规范化:全部注释转 LMID+标准缩写。

§5.3 跨研究特征对齐协议

  1. 各源脂质名 → RefMet 归一(或 LipidLynxX 映射表);
  2. 归一后仍歧义者(_ 类)拆分为独立特征并标注;
  3. 缺失维补齐:无双键位置者补 (位置未知) 标记列;
  4. 合并矩阵以 LMID 为键;同 LMID 多名以标准缩写呈现;
  5. 溯源表留存:原始名→归一名→LMID 三列全记录。

§5.4 分子 ML 训练协议

  1. 样本界定:只用策划条目训练性质模型(计算条目可作半监督扩展);
  2. 特征:分子图(GNN)或描述符+链特征(§4.5 解析)双轨;
  3. 切分:按主类分层切分防泄漏;跨大类泛化单测;
  4. 评估:logP/TPSA 回归(R² 与 MAE);分类任务(大类预测)宏 F1;
  5. 报告:数据版本(检索日期+SHA256)+ provenance 过滤声明。

§5.5 临床队列注释协议

  1. 队列脂质组峰表 → §5.2 流程注释;
  2. 差异脂质(组间检验)→ LMID+RefMet 标准名;
  3. 通路解读 BioPAN + LMPD 酶连接;
  4. 报告模板:LMID/标准缩写/精确质量/证据等级(L1-L3)四列必备;
  5. 共享数据以 LMID 为键(他人可复算)。

§5.6 失败模式清单

  1. 加合物误判:M+NH4 峰当 M+H→质量差 17.0265 Da 系统偏移;
  2. 同分异构合并:PC 16:0/18:1 与 18:1/16:0(sn 异构)质量相同——RT/MS/MS 才能分;
  3. _// 混写:位置确定性与不确定结构混入同一特征;
  4. 计算条目当证据:把展开结构当"已鉴定";
  5. 跨库 ID 错配:PubChem CID 手抖一位→静默错误(用 InChIKey 复核);
  6. 旧口径引用:49,761 vs 50,515 混用不注日期。

§5.7 加合物展开表(质量搜索前置)

脂质 LC-MS 的峰从来不是"分子质量",而是"分子×加合物"——注释前先按离子模式展开:

模式 加合物 质量偏移(Da) 常见场景
正 M+H +1.007276 PC/SM 等
正 M+NH4 +18.033823 TAG/中性脂
正 M+Na +22.989218 污染/低 HPLC 盐
负 M-H -1.007276 FA/PI/PS 等
负 M+OAc +59.013304 低丰度负模式
中性 Neutral 0 跨模式对齐

产线做法:峰表按模式×加合物全展开→每行换算中性质量→LMSD 精确质量匹配→一个峰多个加合物假设时全部保留,用 RT 与同类规律收敛。moverz 接口 ion 参数直接吃这些类型(正 12 种/负 7 种/中性),无需自行算偏移。

§6 实证结果与方法学分析

§6.1 二十年治理的实证结构

LIPID MAPS 的可复现性治理是"标准先于数据"的范本:2003-2005 先产出分类/命名/结构绘制规范(Fahy 2005),2007 才有数据库论文——秩序使 LMSD 二十年少有语义漂移。资助方三次更替(NIH→Wellcome→MRC)而标识符、分类树保持连续,堪称长周期数据治理样板。

§6.2 分类系统的实证影响

8 大类体系被期刊与数据库广泛采纳(SwissLipids 沿用其分类)、被写进脂质组教材——分类论文(Fahy 2005/2009)成为领域引用地基。其"化学起源"分类逻辑(而非功能逻辑)保证了互斥性与完备性的平衡,是本体工程中少见的"一次定准"。

§6.3 工具链的实证闭环

从搜索(质量/结构/性质)→鉴定(moverz/谱库)→归一(RefMet)→分析(LipidFinder/BioPAN)——LIPID MAPS 把"数据+工具+标准"闭环在一个域名下。2023 更新论文披露的技术栈(Postgres+Bingo+Ketcher+Laravel)证明其可持续工程投入;Lipid Calc PWA 化等持续迭代佐证活跃度。

§6.4 ELIXIR 核心资源认定的实证含义

2024 年 ELIXIR core data resource + Global Biodata Coalition 认定=经第三方评审的长期可持续性+科学影响力双重背书。对依赖其做生产管线的团队(含 AI 训练数据供给),这是基础设施风险评级的关键加分项。

§6.5 八个真实坑点

  1. 坑点 1 双口径混写:50,515(2026-06)≠49,761(2025-06)——引用必带检索日期;
  2. 坑点 2 证据等级混淆:28,481 策划 ≠ 22,034 计算展开——建模/鉴定分开用;
  3. 坑点 3 缩写歧义:/ 与 _ 语义不同——解析器必须区分(§4.5);
  4. 坑点 4 加合物幻觉:同一分子多离子型峰被当多分子——加合物表先行;
  5. 坑点 5 sn 异构合并:质量相同的位置异构被当同一特征;
  6. 坑点 6 跨库 ID 漂移:第三方库 ID 更新滞后——InChIKey 复核;
  7. 坑点 7 SPARQL 限速:联邦查询不适合批量拉数——批量走 REST/下载;
  8. 坑点 8 许可想当然:“open access”≠“CC BY 文本在案”——商用前核对官网最新声明。

§6.6 审稿人自查清单

  • [ ] LMSD 引用是否带检索日期与规模口径?
  • [ ] 策划/计算条目是否分开声明?
  • [ ] 脂质命名是否经 RefMet 归一?
  • [ ] 加合物假设是否显式列出?
  • [ ] 鉴定等级(L1/L2/L3)是否标注?
  • [ ] 分子 ML 是否用 InChIKey 去重?
  • [ ] SPARQL/REST 拉取是否记录端点与参数?
  • [ ] 旧数字(如 49,761)是否注明其时点?

§6.7 与 HMDB/SwissLipids 的分工语义

HMDB 是"代谢物全景"(脂质为其子集,临床注释强);SwissLipids 是"证据链百科"(7,170 条文献证据+理论展开 77.9 万);LMSD 是"结构字典+工具链"(结构权威+鉴定工具全)。三者 LMID/SLM:/HMDB:/CHEBI: 互通——用 LMSD 定结构、SwissLipids 查证据、HMDB 接临床是标准分工。

§6.8 版本治理的方法学含义

滚动库无版本号→"检索日期+SHA256+口径数字"三件套是替代方案;跨研究复现时用 RefMet 二次归一可吸收多数口径漂移;LMID 稳定性极高(二十年少有回收)——以 LMID 为键的长期资产设计是安全。

§6.9 分数语义不存在——结构语义优先

与评分型资源不同,LMSD 无"置信分"——它的语义是结构确定性与证据等级(策划 vs 计算 vs 鉴定层级 L1-L3)。把 LMSD 用于 ML 时,特征质量取决于"结构表示的选择"(SMILES 标准化/互变异构/立体化学完整性),而非打分阈值。

§7 AI 就绪指南与应用场景

§7.1 四种喂法

  1. 表格喂:TSV→分类树/质量/物化性质特征(树模型/检索增强);
  2. 分子图喂:SDF→GNN(性质/活性/谱图预测);
  3. 文本喂:系统名+缩写+同义词→LLM 领域适配(脂质命名翻译/实体链接);
  4. 知识图喂:RDF/OWL 分类断言+SPARQL→知识图谱节点(LMID 为实体锚)。

§7.2 鉴定管线实操配方

峰表 → 加合物展开 → moverz 批量(REST)
     → 候选合并(InChIKey 去重)
     → RT 规律过滤(同类同 RT 窗)
     → MS/MS 碎片匹配(MassBank/MoNA)
     → LMID 标准化入库

容差纪律:HRMS 5 ppm;离子型显式记录;候选并列时不自动合并——输出并列标注供人工裁决。

§7.3 LLM 实体链接配方

  • 语料对:文献脂质名(混乱写法)→ LMID+标准缩写(配对语料天然存在于 PubMed 摘要×LMSD 同义词字段);
  • 任务:命名归一(NER+链接)、缩写生成、结构-文本描述;
  • 评估集:RefMet 官方映射(金标);歧义样本(_ 类)单独评测;
  • 护栏:LMID 输出后回查 LMSD API 验证存在性(防幻觉 ID)。

§7.4 分子生成/性质模型

脂质空间的生成建模(新脂质设计/类药性扩展)以 SDF 为起点;链长/不饱和度条件化生成用 §4.5 解析特征做条件向量;评估锚点用 LMSD 策划条目的描述符分布(KL 散度/有效性)。

§7.5 多组学整合

转录组(酶基因)→LMPD→底物脂质类→LMSD 结构注释→临床表型——以 LMID 为外键的整合 schema;BioPAN 可作为通路级"粗对齐"再入精细模型。

§7.6 数据质量自检脚本

import pandas as pd, hashlib, re

df = pd.read_csv("lmsd_all.tsv", sep="\t")
assert df["LM_ID"].is_unique, "LMID 重复!"
pat = re.compile(r"^LM(FA|GL|GP|SP|ST|PR|SL|PK)\d{6,8}$")
bad = df[~df["LM_ID"].str.match(pat)]
print("LMID 语法异常:", len(bad))
print(df["Category"].value_counts(normalize=True))
print("SMILES 缺失率:", df["SMILES"].isna().mean())
print("SHA256:", hashlib.sha256(open("lmsd_all.tsv","rb").read()).hexdigest()[:16])

§7.7 成本与排期模板

  • 拉数+建库:0.5 人日(REST 下载+Postgres/RDKit 建索引);
  • 鉴定管线接入:2-3 人日(加合物表+批量 moverz+谱库链接);
  • 分子 ML 基线:3-5 人日(GNN 训练+描述符基线);
  • LLM 实体链接微调:1-2 周(语料构造+评估集);
  • 全程零数据成本(免注册开放获取)。

§7.8 公平性/覆盖偏差声明

LMSD 以哺乳动物脂质为主,植物/微生物脂质部分覆盖——跨物种研究(微生物组脂质组/植物脂质组)须评估覆盖缺口并辅以 LIPIDBANK/SwissLipids;临床队列注释时,人群特异性脂质(罕见oxylipin 等)可能无 LMSD 条目——“未命中”≠“不存在”。

§7.9 报告方法学段落骨架

脂质注释使用 LIPID MAPS Structure Database(LMSD,retrieved 2026-09-20,50,515 structures;SHA256: <指纹>)。前体离子匹配采用 REST moverz 接口(容差 X ppm,离子型 M+H/M-H),MS/MS 经 MassBank 链接确认,鉴定等级按 L1-L3 标注。命名经 RefMet 归一,全部结果以 LMID 为主键存档。策划与计算生成条目分别使用于 <用途 A/B>。

§7.10 队列注释产线(伪代码骨架)

万人级临床脂质队列的 LMSD 注释产线骨架——三阶段可并行:

# 阶段一:峰表规范化(每队列独立)
#   输入:feature m/z + RT + 强度矩阵(MZmine/MS-DIAL 导出)
#   动作:模式判定 → 加合物展开(§5.7 表)→ 中性质量列

# 阶段二:LMSD 匹配(本地全库 + REST 双路)
import pandas as pd, requests

def match_lmsd(neutral_mass: float, tol_ppm: float = 5):
    """本地 LMSD 精确质量匹配(REST 仅兜底/复核)。"""
    lo, hi = neutral_mass * (1 - tol_ppm * 1e-6), neutral_mass * (1 + tol_ppm * 1e-6)
    hits = lmsd_df[lmsd_df["exact_mass"].between(lo, hi)]
    return hits[["LM_ID", "Abbrev", "exact_mass", "category"]]

# 阶段三:注释落表(LMID 为主键的队列资产)
#   am-style 列:lm_id / 标准缩写 / evidence(L1-L3) / provenance(curated|computational)
#   分区:category → 便于通路聚合;LMID → 便于跨队列合并

产线要点:本地全库为主(50,515 行内存级),REST 复核抽样;evidence 与 provenance 两列强制落表——下游统计/ML 可按证据等级分层;跨队列合并前过 RefMet 归一。

§8 伦理、许可与合规

§8.1 许可语义

官网定性 free, open access——免费开放获取、鼓励再利用(“facilitate re-use and incorporation into other cheminformatic workflows”)。存照:官网未见单列标准 CC 许可文本;“LIPID MAPS®” 为注册商标。合规动作:商用产品中注明来源与"商标归属",引用遵循官方引文要求;重大商用前复核官网最新声明。

§8.2 引用与致谢模板

数据:LIPID MAPS Structure Database (LMSD), https://lipidmaps.org,
      retrieved 2026-09-20.
引用:Sud M, et al. LMSD: LIPID MAPS structure database.
      Nucleic Acids Res. 2007;35:D527-532.
分类:Fahy E, et al. J Lipid Res. 2005;46:839-861;
      Fahy E, et al. J Lipid Res. 2009;50:S9-S14.
工具:Conroy MJ, et al. Nucleic Acids Res. 2024(gkad896).

§8.3 国内合规路径

  1. 数据性质:化学结构+注释,非人类受试者数据——无个人信息/遗传资源问题;
  2. 使用场景:科研/教学/内部研发自由使用;产品化需注意商标(不以"LIPID MAPS®"为产品名);
  3. 网络可达性:官网直连可用;生产环境建议全库本地化(下载通道一次拉齐);
  4. 输出责任:基于 LMSD 的鉴定结果用于临床报告时,责任在检测实验室(LDT/IVD 框架),数据库仅提供注释。

§8.4 商业使用边界

  • 允许(open access 语义):产品集成注释、商业软件引用、云服务托管镜像(注明来源);
  • 谨慎:以 LMSD 全库转售为独立商品(与 open access 精神相悖且商标风险);
  • 建议:重大商用前邮件联系运营组(About 页渠道)书面确认。

§8.5 合规台账最小模板

字段 内容
资源 LMSD
检索日期/版本 2026-09-20 / 50,515
文件指纹 SHA256(§7.6)
许可 free open access(官网定性)
用途 科研管线注释
商标处理 不占用产品名;来源标注
复查周期 12 个月

§8.6 责任式发布语义

LMSD 不含人类受试者数据,伦理负担低;但其注释质量影响临床脂质检测解释——下游须维持"数据库注释≠临床结论"的边界声明;L1-L3 证据等级纪律是责任式使用的核心抓手。

§9 谱系与生态

§9.1 脂质组信息学二十年时间线

阶段 里程碑
2003-2005 Glue Grant 启动;分类系统(Fahy 2005)
2005-2010 LMSD 上线(2007);LMPD/虚拟库;分类更新(2009)
2010-2016 工具套件扩容(LipidFinder 等);NIH 资源期
2016-2020 Wellcome 接手;迁英;ELIXIR service(2020)
2020-2024 SPARQL(2021);Nat Methods 指南(2022);NAR 更新(2024);核心资源认定
2024- MRC 资助期;离子迁移库扩容;Laravel 迁移完成

§9.2 术语表

术语 释义
LMID LIPID MAPS 唯一结构标识(12/14 字符)
LMSD / LMISSD / LMPD 结构库 / 计算结构库 / 基因蛋白库
RefMet 官方命名归一工具
moverz 前体离子质量搜索接口
BioPAN 脂质组通路分析工具
CCS 碰撞截面积(离子迁移维度)
sn-1/sn-2 甘油骨架酯化位置
L1/L2/L3 鉴定置信等级(MSI 规范惯例)
ILCNC 国际脂质分类与命名委员会
sum species / molecular species 链组合未知/确定的物种层级

§9.3 资源选型决策树

需要脂质结构权威注释?
├─ 是 → 需要质谱鉴定工具链?
│        ├─ 是 → LIPID MAPS(LMSD+工具)✔
│        └─ 否 → 只要证据文献链 → SwissLipids
├─ 需要临床/疾病注释 → HMDB
├─ 需要反应/通路本体 → ChEBI/Rhea
└─ 历史文献对照 → LIPIDBANK

§9.4 与本库其他条目的关系

  • HMDB:代谢组全景邻居(脂质子集互引);
  • ChEBI:本体/反应层互补(跨库 ID 双向);
  • PubChem:CID 互通(结构镜像生态);
  • MassBank/MoNA 生态条目:谱图证据层;
  • SwissLipids:证据链百科(同类直接对照)。

§9.5 组合使用建议

  1. 鉴定管线:LMSD(候选)+ MassBank(确认)+ RefMet(归一);
  2. 多组学:LMPD(酶)+ LMSD(底物)+ KEGG(通路图);
  3. 分子 ML:LMSD SDF(训练)+ PubChem CID(扩展);
  4. 临床注释:HMDB(疾病关联)+ LMSD(结构权威)。

§9.6 脂质组在组学生态中的角色

脂质组是"最接近化学的组学"——其标准化由 LIPID MAPS 一家承担(类比:序列领域的 NCBI、结构领域的 PDB)。理解 LMSD 的"字典"角色,等于理解脂质组全部下游 AI 应用的坐标系。

§9.7 预测器/工具家族光谱定位

纯数据 ←─────────────────────→ 全流程平台
LIPIDBANK   ChEBI   SwissLipids   HMDB      LIPID MAPS
(历史库)  (本体) (证据百科)  (临床注释)(字典+全套工具)

§9.8 生态圈层地图

核心:LMSD(50,515 结构)
 ├─ 直系:LMISSD / LMPD / RefMet / BioPAN / LipidFinder / Lipid Calc
 ├─ 标准层:ILCNC / 8 大类规范 / 结构绘制规范
 ├─ 互操作:ChEBI · HMDB · KEGG · PubChem · SwissLipids · LIPIDBANK · PDB
 ├─ 谱图层:MassBank · MoNA · LipidBlast(生态关联)
 ├─ 流程层:MS-DIAL · MZmine · LipidIMMS(第三方管线)
 ├─ 治理层:ELIXIR(core data resource)· Global Biodata Coalition
 └─ 资助链:NIH($73M) → Wellcome(£1.3M) → MRC Partnership

§9.9 字典级资产的复利语义

为什么"字典"比"库"更有复利?因为字典是被引用方——每次脂质组论文引用 LMSD、每条 MS-DIAL 鉴定落到 LMID、每个 LLM 学会一次缩写语法,其价值都沉淀回同一坐标系。二十年的分类稳定性(LMID 从未大规模重编码)意味着围绕它建的每一层索引、每一个模型、每一张跨库映射表都不过期。这正是"AI-Ready 结构性资产"与普通数据集的分野:后者随研究周期贬值,前者随生态繁荣升值。

§10 资源导航与 FAQ

§10.1 官方资源导航

资源 URL
门户首页 lipidmaps.org
LMSD 数据库 lipidmaps.org/databases/lmsd
REST API 文档 lipidmaps.org/resources/rest
SPARQL 端点 lipidmaps.org/sparql
全库下载 lipidmaps.org/databases/lmsd(Download)
工具总览 lipidmaps.org/resources/tools
About/治理 lipidmaps.org/about

§10.2 关键文献

  1. Fahy E, et al. A comprehensive classification system for lipids. J Lipid Res. 2005;46:839-861.
  2. Sud M, et al. LMSD: LIPID MAPS structure database. Nucleic Acids Res. 2007;35:D527-532.
  3. Fahy E, et al. Update of the LIPID MAPS comprehensive classification system for lipids. J Lipid Res. 2009;50:S9-S14.
  4. Ni Z, et al. Guiding the choice of informatics software and tools for lipidomics research applications. Nat Methods. 2022;19:281-291.
  5. Conroy MJ, et al. LIPID MAPS: update to databases and tools for the lipidomics community. Nucleic Acids Res. 2024;52(D1):D521-533(gkad896).
  6. Dennis EA. Outtakes from my journey through the world of LIPID MAPS. J Lipid Res.(回忆录:Glue Grant 史)

§10.4 FAQ

Q1:LMSD 现在到底多少条?
50,515(官方 LMSD 页 2026-06-09 口径:策划 28,481+计算 22,034)。滚动更新,引用带检索日期。

Q2:LIPID MAPS 和 LMSD 什么关系?
LIPID MAPS 是门户/联盟总称(含工具、教育、标准);LMSD 是其核心结构数据库。

Q3:LMID 怎么读?
LM 前缀+大类码(FA/GL/GP/SP/ST/PR/SL/PK)+类/亚类编号+序列号;12 或 14 字符。

Q4:免费吗?商用呢?
免费开放获取(free open access);商用建议核对官网最新声明并避免商标占用(未见单列 CC 文本——存照)。

Q5:怎么拉全库?
https://www.lipidmaps.org/rest/compound/lm_id/LM/all/download 一行 TSV;或下载页 SDF/RDF/CSV。

Q6:有 API 吗?
REST(单条/按类/全库/moverz 质量搜索)+ SPARQL 1.1(联邦)。批量任务走 REST/下载,SPARQL 适合关系查询。

Q7:SwissLipids 和 LMSD 哪个好?
分工不同:LMSD 结构权威+工具全;SwissLipids 证据链细+理论展开大(77.9 万)。结构注释以 LMSD 为准是惯例。

Q8:计算生成的 22,034 条能用吗?
能做候选池/性质建模背景,不能当"已鉴定"证据——provenance 字段区分。

Q9:RefMet 是什么?
官方命名归一工具:输入任意脂质名→标准名+LMID。跨研究合并前必经。

Q10:缩写里 / 和 _ 的区别?
/=sn 位置确定;_=总组成确定但位置不确定。特征工程必须保留该语义。

Q11:moverz 支持哪些离子?
正:M+H/M+2H/M+NH4/M+Na/M+K/M+Ag/M+Li 等;负:M-H/M-2H/M+OAc/M+Cl 等;中性亦可。

Q12:能查 CCS 吗?
离子迁移库提供部分 CCS(oxylipins 新增约 400 条);非全库维度。

Q13:怎么跟 HMDB 关联?
LMSD 条目带 HMDB ID 交叉字段;亦可用 InChIKey 精确匹配。

Q14:LMPD 是什么?
基因/蛋白库:8,500+ 脂质相关基因、12,500+ 蛋白(人+模式生物),REST 可查(gene/protein 端点)。

Q15:SPARQL 能查什么?
分类树(owl:Class 层级)+ 结构注释;可 SERVICE 联邦 SwissLipids/UniProt。

Q16:数据多久更新?
滚动更新(月度级);官网各页有 Last updated 时间戳。

Q17:论文怎么引用?
数据库引 Sud 2007 NAR;分类引 Fahy 2005/2009;工具引 Conroy 2024;都附检索日期。

Q18:ML 直接吃 SMILES 行吗?
行——canonical SMILES 全库提供;注意互变异构/电荷形态规范化后再训练。

Q19:有 Python/R SDK 吧?
无官方 SDK;REST+requests/httr 足够;社区有封装(如 lipidmapsr 类项目)——用前审质量。

Q20:跟 KEGG 怎么互补?
KEGG 有通路图与正交 ID;LMSD 有结构深度与命名权威——xref 互通。

Q21:脂质分类树有几层?
Category(8 大类)→ Main class → Sub class → 更细层级;RDF 已 owl:Class 化。

Q22:能不能做子结构搜索?
官网支持(Bingo cartridge);本地可复刻(RDKit PostgreSQL cartridge)。

Q23:数据质量谁背书?
策划由联盟 curator 团队负责;2024 ELIXIR core data resource 认定=第三方可持续性评审背书。

Q24:跟 LipidBlast 什么关系?
LipidBlast 是 NIST 的理论 MS/MS 谱库(11.9 万谱),生态互补——LMSD 给结构/质量,LipidBlast 给碎片预测。

Q25:为什么值得信?
20 年连续治理(NIH→Wellcome→MRC)、curator 团队维护、社区标准地位、ELIXIR 核心资源认定。

Q26:缺什么?
单分子脂质-疾病关联弱(去 HMDB/文献)、谱图内嵌少(去 MassBank/MoNA)、植物/微生物覆盖有限。

Q27:怎么防止鉴定幻觉?
候选必须过"质量+RT+MS/MS"三关;LMID 输出回查 API 验证存在性。

Q28:能贡献新脂质吗?
能——官方渠道接受新结构提交/纠错(文献发表的新脂质是其策划来源之一)。

Q29:历史数字 49,761 是错吗?
不是——是 2025-06 时点口径;滚动库数字随时间自然增长,引用带日期即可。

Q30:下载文件多大?
TSV 数十 MB 量级;SDF 百 MB 量级——单机可承载。

Q31:LLM 微调怎么用?
系统名/缩写/同义词是天然语料(命名归一对);LMID 回查 API 防幻觉。

Q32:跟代谢组学数据库(MetaboLights 等)什么关系?
那些是"研究存档"(dataset deposition);LMSD 是"参考字典"——注释流向:存档数据→LMSD 注释。

Q33:BioPAN 输入要什么?
差异脂质列表(LMID/缩写+变化方向)→通路/酶活性推断;适合通路级假设生成。

Q34:sn 位置怎么鉴定出来的?
特殊 MS/MS 策略(Paternò-Büchi、Ozone-ID 等)或酶水解——多数常规数据只到 sum composition。

Q35:一级数据还是二级?
一级参考库(curated primary reference),非文献聚合。

Q36:AI-Ready 一句话?
50,515 结构+可解析命名语法+三通道 API+RDF 化分类树——脂质世界的"Unicode",把"峰"翻译成"分子"的标准字典。

Q37:引用批量下载的数据,版本怎么写?
“LMSD, retrieved <日期>, SHA256: <指纹>”——检索日期即版本。

Q38:跟 SwissLipids 的 ID 能互转吗?
LMSD 条目带 SwissLipids SLM: 交叉字段;无官方双向完整映射时用 InChIKey 精确对齐。

Q39:异戊烯醇脂(PR)是什么?
异戊二烯单元聚合来的脂质:辅酶 Q、多萜醇、类胡萝卜素——呼吸链/抗氧化核心。

Q40:聚酮(PK)为什么算脂质?
符合"两个以上疏水酮起源单元"的化学定义——红霉素等大环内酯药物皆属此类(分类的化学逻辑优先于功能直觉)。

Q41:怎么跟踪新功能?
官网 Highlights 栏目(Lipid of the Month/Lipid Matters/新库公告)+ NAR database issue 论文。

Q42:培训资源有吗?
官网教程/术语表/每月脂质专栏;ELIXIR 培训体系有相关课程。

Q43:LMSD 能做主键入库到院内数据中台吗?
能——LMID 稳定且语法自校验(前缀即大类);建议同时存 InChIKey 作为结构级外键,防第三方库映射漂移。

Q44:负模式数据 moverz 怎么用?
ion 传 M-H(-1.007)或 M+OAc(+59.013)等负模式类型;脂肪酸/磷脂酰肌醇类负模式响应好,TAG 类优先正模式 M+NH4。

Q45:跟本研究最相关的三类是什么?
GP(膜与信号)、SP(神经/凋亡)、FA(炎症氧脂素)——临床脂质组 80% 差异分子集中在这三类;ST 看胆固醇代谢专项。

Q46:怎么给团队做命名规范落地?
三件套:入库即转 LMID(主键)+ 报告用标准缩写(RefMet 归一)+ 归一映射表随数据存档(原始名→标准名→LMID)。

§10.5 要点回顾

  1. 定位:脂质世界的 Unicode——结构字典+分类标准+工具链三合一。
  2. 规模口径:50,515(2026-06-09)= 28,481 策划 + 22,034 计算;引用带检索日期。
  3. 八大类:FA/GL/GP/SP/ST/PR/SL/PK——化学起源逻辑,社区公认。
  4. LMID 语法:12/14 字符;前缀即大类;语法本身可解析为特征。
  5. 三通道:REST(批量/质量搜索)/ SPARQL(联邦)/ 全库下载(SDF/TSV/CSV/RDF)。
  6. 证据分层:策划 vs 计算;鉴定 L1-L3;加合物/sn 异构是歧义源。
  7. 归一必经:RefMet/LipidLynxX 吸收命名漂移——ML 特征对齐前置。
  8. 治理背书:NIH $73M→Wellcome→MRC;ELIXIR 核心资源(2024)。
  9. 许可语义:free open access;未见单列 CC 文本——商用前核对+商标避让。
  10. AI 喂法:表格/分子图/文本/知识图四路齐备;LMID 为长期资产主键。

口径存照(数字均注明口径与来源,写入正文前已核对)

  • 核心规模:LMSD 50,515 结构 = 策划 28,481 + 计算生成 22,034,Last updated 2026-06-09,Ontology=LIPID MAPS Classification,导出 SDF/RDF/TSV/CSV,跨库 ID 列表(KEGG/HMDB/CHEBI/LIPIDBANK/PubChem CID/SwissLipids/Cayman/PDB/GuidePharm)= LMSD 官方工具页(lipidmaps.org/resources/tools/7)
  • 历史口径链:49,667(2025-04-09,北海道大学论文引官网)→ 49,761(2025-06,JLR LipidLibrarian 论文)→ 49,790+(2025-07,UVa MALDI 食物综述)→ 50,515(2026-06 官方页)
  • 八大类与代码:fatty acyls (FA)/glycerolipids (GL)/glycerophospholipids (GP)/sphingolipids (SP)/sterol lipids (ST)/prenol lipids (PR)/saccharolipids (SL)/polyketides (PK) = Fahy 2005 JLR 46:839-861 + JLR LipidLibrarian 论文 + 官网
  • LMID:12 或 14 字符唯一标识、特定命名层级 = JLR LipidLibrarian 论文 + 官网 shorthand_nomenclature/hierarchy 页
  • 创立与资助:2003 年 NIH “Glue Grant”(NIGMS)创立;10 年 NIH 资助超 $73M、400+ 论文;12 共同 PI/7 大学+1 biotech;Edward Dennis 发起 = Dennis 回忆录(escholarship qt2ff6d48r)+ UCSD 2016-07-19 新闻稿
  • 资助更替:2016-07 Wellcome Trust £1.3M 接手(Cardiff/Babraham/UCSD 联合)→ 现 MRC Partnership award(Cardiff 主持 Valerie O’Donnell + UCSD + Babraham + Swansea + Edinburgh);服务器在 Babraham Institute = UCSD 新闻稿 + 官网 About 页
  • ELIXIR:2020-01 成为 ELIXIR service;2024 年成为 ELIXIR core data resource + Global Biodata Coalition core biodata resource = Wikiwand 条目(引官方)
  • ILCNC:国际脂质分类与命名委员会(Dresden 会议起源:Dennis-Kai Simons-Gerrit van Meer-Fritz Spener);2009/2021 两次更新 = Dennis 回忆录
  • 主引文:LMSD=Sud 2007 NAR 35:D527-532;portal primary citation PMID 17584797;分类=Fahy 2005 + Fahy 2009(PMID 19098281)= JLR 论文 + Wikiwand
  • REST 接口清单:compound/lm_id/{LMID}/{name|smiles|sys_name|molfile|structure|all};pubchem_cid/inchi_key/formula 查询;abbrev/abbrev_chains(批量);moverz/LIPIDS/{mz}/{ion}/{tol}(正:M+H/M+2H/M+3H/M+4H/M+NH4/M+Ag/M+Na/M+2Na/M+K/M+2K/M+Li/M+2Li;负:M-H/M-CH3/M-2H/M-3H/M-4H/M.Cl/M.OAc;中性 Neutral);LMFA0301/LMFA03/LMGP/LM 全库/按类 download;gene/protein 端点 = 官网 resources/rest 页
  • SPARQL:lipidmaps.org/sparql,1.1 版,ELIXIR 2021 ‘FAIR lipids’ Hackathon 产物;脂类分类 owl:Class + rdfs:subClassOf = Conroy 2024 NAR 更新(gkad896,ORCA 存档)
  • 技术栈:Postgres 9.2.24 + Bingo 1.7.9 化学 cartridge + Ketcher 1.1 + CentOS 7.9(16GB/8C);近年迁移 Laravel = Conroy 2024
  • RefMet 归一示例(DAG C36:3→DG 36:3);数值<5000 跳转 bulk search;LipidFinder/BioPAN/LipidLynxX 集成;结构绘制工具含磷脂酰苏氨酸新增 = Conroy 2024
  • Lipid Calc:PWA 升级,Murphy 父子(Brendan J. Murphy/Robert C. Murphy)开发 = 官网 Highlights(2026-09)
  • 离子迁移库:新增近 400 条 oxylipin CCS(Amie Solosky/Erin Baker 实验室)= 官网 Highlights;CCS 总量 3,800+ 口径 = Creative Proteomics 综述
  • LMPD:8,500+ 基因/12,500+ 蛋白 = Creative Proteomics 综述引官网;LMISSD = Wikiwand 引官网
  • SwissLipids 对照:779,249 物种/7,170 证据/1,580 文献(2025-06)= JLR LipidLibrarian 论文
  • 许可定性:官网 “A free, open access lipidomics resource”(首页标语);“facilitate re-use and incorporation into other cheminformatic workflows”(Conroy 2024);未见单列 CC 文本——本文以 free open access 表述并存照
  • 赞助:Cayman Chemical、Avanti Polar Lipids = Wikiwand;运营与管理组/科学顾问委员会/命名组名单 = 官网 About
  • 覆盖口径:“mainly mammalian but has been expanded to include some lipids from other sources including plants” = Nat Methods 2022 指南(Ni et al. 10.1038/s41592-022-01710-0)
  • 批次口径:批次定义"5 万+ 脂质结构/8 大类"与官方 50,515/8 类一致——正文以官方页口径为主
  • 加合物偏移常数:质子 1.007276 Da、铵 18.033823、钠 22.989218、乙酸根加合 +59.013304——由单同位素质量定义推算,与 moverz ion 参数内部实现一致 = IUPAC 原子量 + 官网 REST 文档 ion 类型清单
  • 证据等级框架:L1(标品对照)/L2(谱图库推断)/L3(类级归属)为脂质组学界的 MSI 惯例分层,LMSD 本身不发布鉴定等级——等级由下游管线标注 = Sumner/Want 等 MSI 规范惯例(社区共识)
  • oxylipin 医学语境:氧脂素为花生四烯酸/亚麻酸级联产物,COX/LOX 通路药理靶点——正文 §2.10 的通路语义为教科书级常识(脂质信号转导章节通用知识),非单一来源引用
  • 官网稳定性口径:infrastructure was upgraded during the last 3 years(Laravel 迁移)+ 5-year hardware lifespan + "维持网站与数据库可用"承诺 = 官网 About 页原文

相关数据集导航

以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:

  • intact — 共享标签:基因组学与多组学 / 药物发现与化学
  • msigdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • disgenet — 共享标签:基因组学与多组学 / 药物发现与化学
  • open-targets — 共享标签:基因组学与多组学 / 药物发现与化学
  • alphafold — 共享标签:基因组学与多组学 / 药物发现与化学
  • pdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • hmdb — 共享标签:基因组学与多组学 / 药物发现与化学
  • lincs-l1000 — 共享标签:基因组学与多组学 / 药物发现与化学
  • ctd — 共享标签:基因组学与多组学 / 药物发现与化学

导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

返回 AI-Ready 数据集