返回博客

虚拟细胞的评估,为什么要先校准指标?

从共享偏移与采样噪声推导均值基线为何难以击败,解释技术重复、指标分辨力与测试隔离,并给出兼顾误差、特异效应和检索的验证协议。

一个不看扰动身份、只输出训练均值的模型也能得到很高的相关系数;反过来,包含真实扰动信号的重复测量可能输给均值。两件事并不矛盾:前者可能奖励共享偏移,后者可能奖励低方差估计。2026 年 10 月 1 日发表的指标校准研究给出的有用问题是:在比较模型前,这把尺子能否区分有信息与无特异信息的预测?下面以原创简化推导说明机制,再给出可实施的评估协议。

1. 先定义预测对象,才知道基线在检验什么

本文讨论固定细胞背景中训练时未见的遗传扰动,评价对象是同一扰动下细胞表达的平均向量,即 pseudobulk。令 \(X\) 为经过预先规定的归一化和变换后的 \(G\) 维表达,\(I\) 为扰动身份,\(C=c\) 为固定背景;训练扰动集合 \(\mathcal T\) 含 \(M\) 种扰动:

\[\mu_i=\mathbb{E}[X\mid I=i,\,C=c],\qquad b=\frac{1}{M}\sum_{j\in\mathcal{T}}\bar{x}_j\]

\(\bar x_j\) 是扰动内细胞平均;\(b\) 让每种训练扰动等权,细胞多的扰动不会自动支配它。这个约定遵循新研究,与 Systema 的“所有训练扰动细胞平均”预测基线不同;后者用于评价的扰动质心参考又是扰动等权。复现时不能把这些都叫同一个“均值”。

对照细胞均值 \(\mu_{\mathrm{ctrl}}\) 检验“完全没有变化”;\(b\) 检验“只有平均变化”;线性基线检验非线性模型是否增加价值。若任务改成已见单扰动的未见组合,还要比较加和预测:

\[\hat{\mu}_{i+j}^{\mathrm{add}}=\bar{x}_i+\bar{x}_j-\mu_{\mathrm{ctrl}}\]

2025 年 8 月 4 日的线性基准研究说明这些基线很有竞争力,但均值准确不代表细胞状态分布、多峰性或少数细胞反应准确。本文也不把归一化后的表达差异直接解释为分子数量变化。

2. 共享偏移如何制造高相关

Systema(2025 年 8 月 25 日在线发表)强调,扰动面板选择和细胞状态等因素可产生共享变化。用一个简化分解:\(s\) 为共享偏移,\(u_i\) 为特异效应;假设训练平均特异效应为零,且此处 \(s,u_i\) 均已跨基因中心化、相互正交、非零。只预测 \(b\) 时:

\[\begin{aligned}\mu_i&=\mu_{\mathrm{ctrl}}+s+u_i,\qquad b=\mu_{\mathrm{ctrl}}+s,\\\hat{\mu}_i-\mu_{\mathrm{ctrl}}&=s,\qquad\mu_i-\mu_{\mathrm{ctrl}}=s+u_i,\\\operatorname{corr}(s,s+u_i)&=\frac{\lVert s\rVert_2}{\sqrt{\lVert s\rVert_2^2+\lVert u_i\rVert_2^2}}.\end{aligned}\]

当共享偏移远大于特异效应,相关可接近一,却没有识别扰动身份。此式是说明机制的特殊情形,不假设真实生物效应正交。改以训练参考 \(b\) 作差能去掉共享项,但均值预测变成零向量,其 Pearson 相关未定义,不能悄悄记作零。即使预测 \(2u_i\) 与真值 \(u_i\) 相关为一,幅度也已错了一倍;去均值后的相关仍需要误差指标约束。

3. 为什么技术重复也可能输给均值

固定已训练的 \(b\),令真实均值与它相差 \(\delta\)。真实均值不可直接观测,评价半组与重复半组的平均分别是:

\[\mu=b+\delta,\qquad y=\mu+\varepsilon_{\mathrm{g}},\qquad t=\mu+\varepsilon_{\mathrm{d}}\]

假设两组噪声独立、零均值,协方差分别为 \(\Sigma_{\mathrm g},\Sigma_{\mathrm d}\),并对训练数据条件化。展开平方、令交叉项期望为零,得到:

\[\begin{aligned}\operatorname{MSE}(a,y)&=\frac{1}{G}\lVert a-y\rVert_2^2,\\\mathbb{E}\operatorname{MSE}(b,y)&=\frac{\lVert\delta\rVert_2^2+\operatorname{tr}\Sigma_{\mathrm{g}}}{G},\\\mathbb{E}\operatorname{MSE}(t,y)&=\frac{\operatorname{tr}\Sigma_{\mathrm{d}}+\operatorname{tr}\Sigma_{\mathrm{g}}}{G}.\end{aligned}\]

当 \(\lVert\delta\rVert_2^2<\operatorname{tr}\Sigma_{\mathrm d}\),带偏差的均值反而有更低的期望误差。这是合理的偏差与方差权衡,不是 MSE 算错了。作为解析玩具例,\(G=100\)、\(\lVert\delta\rVert_2^2=1\)、两组每基因噪声方差均为 \(\frac{1}{50}\),均值与重复的期望 MSE 分别为 \(\frac{3}{100}\) 与 \(\frac{1}{25}\)。具体取 \(\delta=e_1\),各基因、各半组独立噪声取 \(-1,0,1\),概率依次为 \(\frac{1}{100},\frac{98}{100},\frac{1}{100}\),即可满足这些假设。这些不是生物实验数据。

少量变化基因被大量稳定基因稀释时,平均重建风险与发现特异变化并非同一目标。因此应改变评价关注的信号并检查其敏感性,而不是因为阳性对照输了就宣布平方误差无效。若共享批次噪声破坏独立性、训练参考本身随机或存在系统偏差,公式需要增加协方差或额外风险项;随机分半也不能替代独立生物重复。

让这个玩具例的变化只发生在第一个基因。若预先只给该基因权重,均值的期望误差变为 \(\frac{51}{50}\),重复仍为 \(\frac{1}{25}\),排序便翻转。这里的单基因权重是构造时已知的理想化选择,不是从带噪真值挑出的基因,也不是官方 WMSE 的实测结果。它展示评价目标改变的后果,不证明任意加权都更合理。

4. 用独立对照校准指标的分辨力

新研究把每种扰动的细胞分为评价真值半组 GT 和技术重复半组 TD。TD 的平均预测 GT;它知道测试扰动的真实反应,属于理想化阳性对照,不能作为可部署预测器。为降低弱信号基因的噪声,插值重复 ID 逐基因收缩到训练均值:

\[\hat{y}_{\mathrm{ID}}=\alpha\odot t+(1-\alpha)\odot b,\qquad\alpha_g=1-p_{g,\mathrm{adj}}^{\mathrm{TD}}\]

调整后的差异表达检验 \(p\) 值只来自 TD 半组,评价权重或基因掩码另由 GT 半组生成;两种分析均与同半组的其他扰动比较,排除未扰动对照。\(1-p\) 是这里的插值规则,不是“该基因发生变化”的后验概率。其分半、插值与噪声分析见论文补充说明。

动态范围比例 DRF 比较阳性与阴性对照的实得差距,相对阴性到完美预测的差距。例如 MSE 越小越好,记两个对照的损失为 \(L_{\mathrm{pos}},L_{\mathrm{neg}}\),完美损失为零:

\[\operatorname{DRF}_{\mathrm{MSE}}=\frac{L_{\mathrm{neg}}-L_{\mathrm{pos}}}{L_{\mathrm{neg}}+\epsilon},\qquad\epsilon>0\]

DRF 接近零表示在这些对照下可辨差距很小;高 DRF 也不是概率校准、置信区间或单次预测可信度。对照、样本数和稳定常数均影响它。相关未定义、理想差距近零时必须单独报告有效样本;不能靠稳定常数赋予分数生物意义。

这是截断前的 MSE 特例;官方代码还将 DRF 限制到 \([-1,1]\)。复现时应固定分数方向、稳定项与截断约定,而不是仅抄下一个比例式。

原创机制图:训练扰动生成预测模型和均值负对照;留出的测试细胞分为 TD 与 GT,分别构造阳性对照与真值评分权重,所有结果只在评价端汇合。
原创评估流程示意,非实验数据。训练、阳性对照构造与最终打分承担不同角色;测试反应不能回流到模型训练。

5. 三类指标分别回答三个问题

重建误差问数值是否接近;去参考后的指标问特异方向或效应是否恢复;检索问预测能否识别正确扰动。新文发现加权与检索指标的分辨力较好,但这不构成删除直接误差的理由。

特别要区分 ID 权重与 WMSE 权重。固定版本官方实现对 GT 差异表达的绝对 t 统计量做最小最大缩放后平方,再归一化:

\[\begin{aligned}a_g&=|t_g^{\mathrm{GT}}|,\qquad w_g=\left(\frac{a_g-\min_h a_h}{\max_h a_h-\min_h a_h}\right)^2,\\\operatorname{WMSE}(\hat y,y)&=\frac{\sum_g w_g(\hat y_g-y_g)^2}{\sum_g w_g}.\end{aligned}\]

上式要求缩放范围和权重总和非零;退化时应记录无定义或按预注册规则处理,不能悄悄改变评价目标。这里的 \(t_g^{\mathrm{GT}}\) 是统计量,与上一节重复均值向量 \(t\) 不同。按调整后 \(p\) 值选前若干基因,也不等于它们都达到显著性阈值。

对同一背景、预先固定的 \(P>1\) 个候选,一个与官方 NIR 实现一致的表达是:

\[R_i=\frac{1}{P-1}\sum_{j\ne i}\mathbf{1}\!\left[d(\hat y_i,y_i)<d(\hat y_i,y_j)\right]\]

\(d\) 为欧氏距离;严格不等号使并列不计胜出。它衡量相对排名,不约束绝对误差:将真实的两类 \(b\pm u\) 预测为 \(b\pm100u\),仍可各自排第一而幅度严重错误。候选池变简单也会涨分。因此误差、检索、去参考指标应一起报告,并固定候选池和并列规则,而不是挑最高的一项。

6. 把隔离与计算成本写进协议

建议先按扰动身份划分训练、验证、测试;跨背景主张还需按供体、批次或细胞类型外层留出。特征选择、训练参考和模型选择只使用允许的数据,测试预测封存后才打开评价端细胞。以下是协议伪代码,不是声称已完成的模型实验:

train, valid, test_ids = split_by_perturbation(manifest)
preprocess, reference = fit_on_training_only(train)
model = fit_and_select(train, valid, preprocess)
predictions = seal_predictions(model, test_ids)

# Evaluator only: test responses never return to the model.
gt_cells, td_cells = locked_cell_split(test_responses)
y, td = pseudobulk(gt_cells), pseudobulk(td_cells)
weights = frozen_weight_rule(deg(gt_cells))
alpha = 1 - adjusted_p(deg(td_cells))
positive = alpha * td + (1 - alpha) * reference
report_all(predictions, y, positive, reference,
           weights, fixed_candidates, fixed_tie_rule)

冻结规则后用 GT 生成评分掩码本身不等于训练泄漏;拿同一 GT 权重构造阳性对照、调模型或反复选指标,才破坏角色隔离。还应同时报告全基因误差、弱信号层结果、无定义数量,以及按扰动汇总的不确定性;有生物重复时按实验层级处理,不能把同一扰动的细胞当作独立模型测试。

差异表达也需要固定比较组。新研究将目标扰动与其他扰动细胞比较,并排除未扰动对照;换成与对照细胞比较会改变权重与“特异效应”的含义。协议应记录基因面板、变换次序、过滤阈值、先验与预训练数据来源,查明测试响应是否早已进入外部表示。基因家族或通路相近的随机划分只能支持相应难度的泛化,不能自动代表全新生物机制。

若预测与真值均为 \(P\times G\) 矩阵,逐项误差成本为 \(O(PG)\),全候选精确检索为 \(O(P^2G)\)。平方欧氏距离可以按预测行分块计算:

\[D_{ij}=\lVert\hat y_i\rVert_2^2+\lVert y_j\rVert_2^2-2\hat y_i^{\mathsf T}y_j\]

每次处理 \(B\le P\) 行,保留输入矩阵与 \(B\times P\) 距离块,可将存储限制在 \(O(PG+BP)\),避免分配完整距离矩阵。这没有降低计算阶数,也不包含模型推理、差异表达或重复抽样的成本。浮点消减、候选对齐、并列与无定义值应有小例子验收。随文检验脚本以标准库有理数运算检验上述合成噪声风险,并检查共享偏移与零向量情形;不是模型训练或真实数据基准复现。

7. 新论文的结论到哪里为止

新研究比较九种模型、两类任务:在未见单扰动任务的若干高分辨力指标上,模型能超过无特异信息基线。但不是任何模型都胜过任何基线;未见组合任务中,Norman19 的加和基线仍强。Wessels23 上部分模型胜出,与更高组合覆盖相伴,却不构成覆盖率的因果证明。研究未检验未见细胞类型、供体或条件。其模型与协议也不同于 2025 年线性基准,不能当作仅更换指标的对照实验。

8. 一个值得前瞻检验的成功标准

如果目标是筛选值得做实验的扰动,应预先固定候选集、预算、成功表型和排名规则,封存预测,再在独立生物重复中比较模型与均值、线性及适用的加和基线。成功应表现为特异效应恢复和实际命中改善,同时误差可接受;不能仅靠转录组代理分数替代功能验证。

一个可证伪的预期是:如果模型恢复的是可迁移的扰动机制,其相对优势在改变重复划分和适度改变候选组成后应保持,并在新的实验批次继续提供增量信息。可以预注册主要任务指标,把其他指标作为约束,同时公布逐扰动的模型减基线差值、效应强度和细胞数分层。资源有限时,应比较相同实验预算下得到的有效发现,避免用更大的候选筛选或更多事后调参制造表面优势。

如果优势在换批次、弱信号分层、候选池变难或控制平均变化后消失,就应收缩模型能力的主张。如果阳性与阴性对照本身难以区分,则需先检查样本量、噪声和评价目标。即使能预测一个群体的平均反应,也未识别同一个细胞在两种干预下的个体反事实。本文给出的是机制推导、公开证据分析与验证建议;未训练扰动模型,也未开展新湿实验。

参考资料

  1. Deep learning perturbation models can outperform baselines on calibrated metrics · 2026-10-01 · 查阅 2026-10-07
  2. Supplementary Notes 1–2: metric calibration, signal dilution and robustness · 2026-10-01 · 查阅 2026-10-07
  3. Systema: a framework for evaluating genetic perturbation response prediction beyond systematic variation · 2025-08-25 · 查阅 2026-10-07
  4. Deep-learning-based gene perturbation effect prediction does not yet outperform simple linear baselines · 2025-08-04 · 查阅 2026-10-07
  5. CellSimBench data manager: weighting and metric definitions (commit 15361aec8392fb45a75c8c9da88ca5e6510fca97) · 查阅 2026-10-07
  6. CellSimBench metrics engine: retrieval and reference metrics (commit 15361aec8392fb45a75c8c9da88ca5e6510fca97) · 查阅 2026-10-07
  7. CellSimBench calibration analysis: direction, stabilization and clipping (commit 15361aec8392fb45a75c8c9da88ca5e6510fca97) · 查阅 2026-10-07
利友诚

关于作者

利友诚 · Youcheng Li

北京大学智能学院人工智能专业博士研究生,导师为王立威教授;Isoplex Intelligence(壹索智能)联合创始人兼 CTO。

研究关注医疗人工智能、生成式基础模型、诊断推理与科学智能体。以第一作者或共同第一作者身份在 Nature Biomedical Engineering、Scientific Data、KDD 和 PLOS Computational Biology 发表研究。