生信实战 · 算法

修饰位点 motif 富集:算法、陷阱与正确解读

Motif-x vs MoMo vs pLogo 算法对比、为什么"找到 RRXS/T 不等于找到 CK2 底物"、背景序列选择、定位概率阈值的多重检验校正方法。

本文目录

  1. 三种主流 motif 算法的本质差异
  2. 陷阱 1:找到 RRXS/T ≠ 找到 CK2 底物
  3. 陷阱 2:背景序列选择偏倚
  4. 陷阱 3:定位概率阈值没设就发布
  5. 实战 R 代码
  6. 参考文献

一、三种主流 motif 算法

算法核心思路优势劣势
Motif-x基于位置特异矩阵的迭代搜索直观,引用最多对大样本效率低,结果假阳多
MoMo基于混合 motif 模型(MEME 衍生)支持多种修饰类型混合参数难调
pLogo基于信息论的 logo 图,可视化视觉直观不做显式显著性检验

二、陷阱 1:找到 RRXS/T ≠ 找到 CK2 底物

motif 富集最常见的"假发现"问题是:

经典误读:"我们鉴定到的磷酸化位点显著富集到 RRXS/T 序列,因此这些底物的上游激酶是 CK2。"

问题在哪里?RRXS/T 实际上是 CK2 / PKA / AGC 家族 / SRPK等多个激酶的共识识别序列——光是 motif 富集到 RRXS/T,无法判断是谁在调控

正确做法:

  1. 结合激酶抑制剂激酶 KO实验验证。
  2. GPS / NetworKIN 等工具做激酶-底物预测作为辅助证据。
  3. 细胞背景:不表达 CK2 的细胞中找到 RRXS/T 富集可能指向其他激酶。

三、陷阱 2:背景序列选择偏倚

背景序列的选择比看起来重要得多:

四、陷阱 3:定位概率阈值

MaxQuant 输出 Localization prob,告诉你"该修饰发生在该特定位点的概率"。常见错误:

五、实战 R 代码

# R 代码:使用 depLogo + motifr 做 motif 富集 library(depLogo) library(motifr) # 提取磷酸化位点周边序列 sequences <- extract_flanking_sequences( phospho_sites, window = 7, # 上下游各 7 个残基 uniprot_mapping = "human_grch38" ) # 用同一蛋白未修饰位点作为背景 background <- extract_background_sequences( phospho_sites, background_strategy = "same_protein_unmodified" ) # MoMo 富集 enriched_motifs <- momo_enrich( foreground = sequences, background = background, modification = "Phospho", p_threshold = 1e-6 )

参考文献

  1. Schwartz & Gygi, Nat Biotechnol 2005: Motif-x。
  2. Cheng et al., Bioinformatics 2018: MoMo。
  3. O'Shea et al., Nat Methods 2013: pLogo。
  4. Aimsmass 内部 SOP v2.1。

需要 motif 富集与激酶预测的生信支持?

Aimsmass 提供基序富集 + 激酶预测 + 通路富集一键分析,加 motif 可视化图表。

info@aimsmass.cn