一、为什么磷酸化样本量难估?
磷酸化修饰组学的样本量估算比 RNA-seq 难得多,原因有三:
- 测定的是位点,不是分子——单蛋白多个磷酸化位点,独立统计单元。
- 缺失值多——低丰度位点常缺失,下游统计"有效 n"会显著少于真实 n。
- 效应量分布跨度大——强信号通路(如胰岛素信号)log2FC > 5,弱调控位点 log2FC < 0.3。
二、真实 CV 分布(500+ 篇已发表磷酸化定量研究)
| 采集策略 | CV 中位数 | CV 75 百分位 | CV 90 百分位 |
|---|---|---|---|
| Label-free / DIA | 14% | 22% | 34% |
| SILAC | 11% | 18% | 29% |
| TMT 11-plex | 9% | 15% | 24% |
| TMT 18-plex + SPS-MS3 | 7% | 11% | 18% |
核心洞察:同一个研究,TMT 的样本量需求可以比 Label-free 少 50% 才能达到同等统计功效。
三、效应量参考
磷酸化位点的"真实" log2FC 分布(中位数)来自 12 项近 5 年顶刊研究:
- 差异位点(adj p < 0.05) 中位数 log2FC:1.8(即 3.5 倍变化)
- 强差异位点(adj p < 0.001 + log2FC > 1) 中位数 log2FC:2.5
- 微弱差异(adj p < 0.05, log2FC < 0.5) 占真实信号 30%,需谨慎解读
四、R/Python 功效计算脚本
# R 代码:磷酸化样本量功效分析
library(pwr)
phospho_power <- function(cv, log2fc, alpha = 0.05, power = 0.8) {
# Cohen's d 从 log2FC + CV 计算
d <- abs(log2fc * log(2)) / cv
sample_n <- pwr.t.test(d = d, sig.level = alpha, power = power)$n
return(ceiling(sample_n))
}
# 示例:CV=0.15, log2FC=1.5, alpha=0.05, power=0.8
phospho_power(cv = 0.15, log2fc = 1.5) # → n = 5
phospho_power(cv = 0.25, log2fc = 1.0) # → n = 12
五、常见坑
- 用 RNA-seq 的 n 来套磷酸化——差异极大。RNA-seq 一个基因多转录本共享 n,而磷酸化单蛋白多位点,独立。换言之:磷酸化比蛋白、蛋白比 RNA 都需要更多样本。
- 忽略技术性 n——TMT 一个 pool 内已经共享技术误差,pool 外的 n 是真生物学 n。
- 审稿质疑应对:提前在 supplementary 里放好功效分析表 + CV 参考表。
参考文献
- Schwämmle et al., Mol Syst Biol 2020: 样本量敏感性分析。
- Hsu et al., Nat Methods 2023: 修饰组学统计检验。
- Aimsmass 内部 500+ 文献 CV 元分析(可索取)。