返回博客

结构正确,为何亲和力仍可能不可靠?从 AlphaFold 3 到 Boltz-2

从结合态与游离态的统计权重出发,推导姿态不足以确定亲和力的原因,检查 Boltz-2 的标签与单位,并提出防泄漏、带基线的评估方案。本文未运行实验。

把配体准确放进口袋,能否顺便知道它结合得多牢?不能。一个正确姿态约束的是结合态的几何;亲和力比较的是结合与游离两种状态的统计权重。这个区别决定了如何使用 AlphaFold 3 和 Boltz-2,也决定了什么实验才足以验证它们。

本文以 2024 年 5 月 8 日发表的 AlphaFold 3 论文、2025 年 6 月 18 日发布的 Boltz-2 预印本 v1及截至 2026 年 10 月 6 日查阅的官方实现为依据,不声称覆盖此后所有进展。以下包含独立推导与评估方案;本文没有运行模型、分子模拟或湿实验,也没有产生性能结果。

1. 一张结构图缺少什么信息

AF3 用扩散模块从加噪坐标恢复原子位置。其论文明确指出,多次随机采样并不近似溶液中的构象系综。官方输出说明把 ipTM 定义为界面结构置信度;它不是以摩尔浓度定义的亲和力,也不是经过当前筛选库校准的结合概率。由“模型相信这个接触方式”跳到“这个分子一定强结合”,换掉了被预测的量。

考虑稀溶液中可逆、单一化学计量的结合 \(\mathrm R+\mathrm L\rightleftharpoons\mathrm{RL}\)。在固定温度、溶液条件及标准态 \(C^{\circ}=1\,\mathrm{mol}\,\mathrm L^{-1}\) 下:

\[\begin{aligned} K_{\mathrm d} &= \frac{[\mathrm R][\mathrm L]}{[\mathrm{RL}]} \\ \Delta G^{\circ}_{\mathrm{bind}} &= RT\ln\!\left(\frac{K_{\mathrm d}}{C^{\circ}}\right) \\ \mathrm pK_{\mathrm d} &= -\log_{10}\!\left(\frac{K_{\mathrm d}}{C^{\circ}}\right) \end{aligned}\]

这里 \(R\) 为气体常数,\(T\) 为绝对温度;下文 \(k_{\mathrm B}\) 为玻尔兹曼常数。因此十倍 \(K_{\mathrm d}\) 差异对应 \(RT\ln 10\) 的自由能差,而不是某个固定的坐标误差。统计热力学的计算框架需要比较结合态与游离态的配分函数,并处理标准态、平移和转动归一化;不能把一次接触打分直接代入上式。

2. 一个反例:最低点相同,亲和力仍可不同

为了看清信息缺口,构造一个玩具模型:两个候选体系 \(\mathrm A\)、\(\mathrm B\) 的结合能谷最低点位置与深度相同,游离态配分函数也相同;唯一差别是能谷的有效构象体积 \(\Omega\)。假设谷内能量近似常数 \(E\),采用一致的积分测度,则 \(Z_{\mathrm{bound}}\approx\Omega\exp\!\left(-\frac{E}{k_{\mathrm B}T}\right)\)。于是每摩尔结合自由能之差为:

\[\Delta G^{\circ}_{\mathrm B}-\Delta G^{\circ}_{\mathrm A} = -RT\ln\!\left(\frac{\Omega_{\mathrm B}}{\Omega_{\mathrm A}}\right)\]

即使两个代表性姿态都“正确”,更宽的结合态能谷也可改变自由能。若游离配体更加柔性,游离态的统计权重又会改变结论;水、质子化与受体重排也不能仅由一张接触图消去。这只是“姿态不充分”的反例,不是实际配体的熵计算方法:真实能谷不平坦,能量与构象宽度通常同时变化。

原创示意图:结构坐标需要经过结合与游离系综的自由能比较才能联系到亲和力;结构、预测及实验各需独立验证。
图 1 · 原创概念示意,非实验数据。箭头表示解释所需的信息,不表示必须依次运行三种软件。

还要区分平衡与动力学:在简单两态质量作用模型中,\(K_{\mathrm d}=\frac{k_{\mathrm{off}}}{k_{\mathrm{on}}}\)。相同的比值允许不同的解离速率和驻留时间。描述局部构象波动,不等于测得过渡速率;预测平衡亲和力,也不必先恢复完整的真实时间轨迹。

3. Boltz-2 补上的是监督任务

固定版本的亲和力模块将预测坐标转成距离分箱,与主干成对表征融合;Pairformer 关注蛋白—配体及配体内部相互作用,池化后输出连续值和二分类分数。这说明几何能够参与亲和力推断,但这里的回归头并没有显式计算上面的配分函数比。

论文第 3、4 节说明,连续监督混合了 \(K_{\mathrm i}\)、\(K_{\mathrm d}\)、\(\mathrm{IC}_{50}\) 等不同读数,并加强同一实验内的成对差值损失。可以用一个简化模型理解后者:\(y_{ia}=g_i+b_a+\varepsilon_{ia}\),其中 \(b_a\) 是实验 \(a\) 的共同偏移。同一实验中相减会消掉 \(b_a\);跨实验相减则不会。这是本文的解释模型,不能消掉化合物特异的干扰、不同作用机制或非线性偏差。

这也给使用者一个实际约束:先问模型能否在同靶点、同实验的系列中排序,再问能否跨靶点比较绝对数值。局部排序成功,并不自动回答第二个问题。

4. 先把单位和标签对齐

官方预测文档将 affinity_pred_value 描述为 \(\log_{10}\!\left(\frac{\mathrm{IC}_{50}}{1\,\mathrm{\mu M}}\right)\),数值越低越强;结合论文的混合标签训练,更稳妥的理解是 \(\mathrm{IC}_{50}\) 类尺度的预测。若将输出记作 \(y\),单位换算给出:

\[\mathrm{pIC}_{50} = -\log_{10}\!\left(\frac{\mathrm{IC}_{50}}{1\,\mathrm M}\right) = 6-y\]

这个量没有 \(\mathrm{kcal}\,\mathrm{mol}^{-1}\) 单位,也不能直接充当 \(\mathrm pK_{\mathrm d}\)。例如简单可逆竞争性酶抑制、符合 Michaelis–Menten 与相应稳态条件时,Cheng–Prusoff 关系为 \(\mathrm{IC}_{50}=K_{\mathrm i}\!\left(1+\frac{[\mathrm S]}{K_{\mathrm m}}\right)\)。底物浓度改变,读数就可能改变。本文核验版本的亲和力功能适用于蛋白—小分子体系,不应直接外推到蛋白—蛋白或核酸。连续头面向活性分子之间的强弱比较;另一输出 affinity_probability_binary 面向 binder/decoy 分类,部署到不同阳性率的筛选库仍需检验校准。

5. 怎样检验“结构确实帮助了亲和力”

下面是尚未执行的评估设计。先选择部署问题:已知靶点的新化学系列,用时间留出加骨架隔离;未知靶点,用蛋白同源簇留出,另报与训练配体的相似度。这是两套测试,不能把随机拆分的一组总分称作两者都已解决。

# Proposed protocol; not executed
records = curate(raw, keep_assay=True, keep_endpoint=True)
records = preserve_censoring(records)  # >10 is not =10
train, valid, test = deployment_split(records)
audit_overlap(train, test, by=["identity", "scaffold", "protein_cluster"])
freeze(versions, weights, templates, seeds, split_manifest)
baseline = fit_and_select_fingerprint_model(train, valid)  # no 3D
baseline_predictions = baseline.predict(test.inputs)
predictions = []
for sample in test:
    out = frozen_boltz2(sample.inputs)
    predictions.append(record(sample.id, out.affinity_pred_value,
        out.affinity_probability_binary, out.pose, out.confidence))
results = join_by_id(test, predictions, baseline_predictions)
report_within_target_and_assay(results)
report_by_pose_quality(results.with_reference_structures())
bootstrap_group_metrics(results, unit="scaffold_or_target")

清洗时保留实验类型、单位、重复测量和不等号;常规 MAE 只用未删失的可比标签,删失比例另报。基线至少包括训练集均值、仅用配体指纹的模型及固定协议的对接打分;有靶点历史数据时再加靶点均值。它们检查模型是否主要依赖分子大小、相似骨架或靶点偏好。常数均值基线只比较 MAE;对接打分须先在验证集校准到相应标签尺度,才能比较绝对误差。

预训练模型不能只审计这次划分:还需记录结构与亲和力训练集、模板库的时间边界和已知重叠;拿不到完整训练清单时,应把污染状态记为未知。所有标准化、校准、阈值和超参数只在训练/验证集确定。

报告同靶点、同实验内的 Spearman 与 MAE,同时给出各组分数;分类单独报告 PR-AUC 和概率校准,并注明阳性率及阴性样本来源。对有参考结构的子集,再按口袋对齐的配体 RMSD、立体化学与碰撞分层检查亲和力误差。这个子集偏向可获得结构的结合物,不能替代整个筛选库。区间估计按独立骨架或靶点重采样,避免把近邻分子当作大量独立证据。

6. 什么结果才会改变判断

如果在姿态准确的子集中,复杂模型仍未超过仅配体基线,就没有足够证据说三维表征带来了增益;但这也不是“模型完全不用几何”的因果证明。若要定位几何的贡献,还需在支持的接口下控制其他输入做干预,防止人为扰动制造分布外伪影。

更有价值的后续工作,是先冻结候选排序,再在一致实验条件下盲测,同时报告失败、重复性与不确定性。结构模型能提出具体机制假设,亲和力模型能帮助分配验证资源;这两种价值,都不需要把一个可信的坐标图误当成已经测得的结合自由能。

参考资料

  1. Abramson et al. — Accurate structure prediction of biomolecular interactions with AlphaFold 3 · 2024-05-08 · 查阅 2026-10-06
  2. Passaro et al. — Boltz-2: Towards Accurate and Efficient Binding Affinity Prediction (bioRxiv v1) · 2025-06-18 · 查阅 2026-10-06
  3. Boltz-2 full paper — author-hosted PDF · 查阅 2026-10-06
  4. AlphaFold 3 output documentation — commit f43dfb8 · 查阅 2026-10-06
  5. Boltz prediction documentation — commit b1ebfc4 · 查阅 2026-10-06
  6. Boltz affinity module source — commit b1ebfc4 · 查阅 2026-10-06
  7. Gallicchio & Levy — The Binding Energy Distribution Analysis Method (BEDAM) for the Estimation of Protein-Ligand Binding Affinities · 2010-09 · 查阅 2026-10-06
  8. Cheng & Prusoff — Relationship between the inhibition constant (Ki) and the concentration of inhibitor which causes 50 per cent inhibition (I50) of an enzymatic reaction · 1973-12-01 · 查阅 2026-10-06
利友诚

关于作者

利友诚 · Youcheng Li

北京大学智能学院人工智能专业博士研究生,导师为王立威教授;Isoplex Intelligence(壹索智能)联合创始人兼 CTO。

研究关注医疗人工智能、生成式基础模型、诊断推理与科学智能体。以第一作者或共同第一作者身份在 Nature Biomedical Engineering、Scientific Data、KDD 和 PLOS Computational Biology 发表研究。