返回博客

AVI 高分代表什么?

从 AlphaGenome Atlas 的成对轨道预测、18 维特征与频率代理标签,推导原始 logit 和 PHRED 排名的含义,检验概率、归因、坐标与计算预算的边界。

给一个非编码变异打出 AVI 20 分,应该把它理解成什么?最容易滑过去的一步,是把“全基因组中排名靠前”读成“有 99% 的概率导致疾病”。AlphaGenome Atlas 的价值在于把分子预测、候选排序和机制探索连接起来;这条连接需要逐层保留分数的含义。本文从最小的 REF/ALT 比较出发,追踪 18 维特征怎样变成原始 logit,再变成 PHRED 排名,并给出可以运行的数学反例。

Atlas 资源于 2026 年 9 月 8 日公开;相关 medRxiv v1 实际发表于 9 月 20 日,仍为预印本。本文核读的是官网链接的技术报告,重点为第 18–28 页的方法;基础 AlphaGenome 论文于 1 月 28 日正式发表于 Nature。这是对已公开报告的技术解读,不把旧材料包装为当天新闻。资源发布;官方报告;预印本;基础论文。

一、最小基线:比较同一上下文的两条预测

AlphaGenome 输入约 1 Mb 的 DNA 上下文,输出多种分子实验轨道,例如 RNA 表达、染色质可及性和剪接信息。它预测的是实验读数的模式,而不是直接输入一个人的全部遗传与临床资料后给出疾病后验。不同输出头分辨率不同,不能把所有模态都当成逐碱基的一维表达量。模型与输出头。

对一个变异 \(\nu\),最小基线是在同一上下文里准备参考序列和替代序列:除了目标改动,其余条件保持一致。对模态 \(m\),得到 \(Y_m^{\mathrm{ref}}\) 与 \(Y_m^{\mathrm{alt}}\),再由指定 scorer、空间掩码、聚合和变换产生轨道分数 \(z_{m,c,g}\)。其中组织或轨道 \(c\)、基因或位点 \(g\) 的索引取决于模态。不能只写一句 ALT 减 REF,就忽略是先聚合还是先变换、比较哪个基因以及哪个实验体系。官方 scoring 说明。

这一接口先验收坐标与元数据。Atlas 的预计算依据 GRCh38,REF 由这个参考组装决定;N/n 未评分,也未计算某个位点两个非参考等位基因之间的所有替换。交换 REF/ALT 可能查询不到,而不是得到一个可直接取负号的结果。通用在线预测接口可以接受用户指定的 REF/ALT,不能据此假定它会替你检查参考基因组是否匹配。分析者仍要记录组装、等位基因、位置、scorer、组织与注释版本,并主动验证 REF;SDK 中 Variant 的 position 是 1-based,Interval 的 start 是 0-based。报告第 18–20 页;固定版本 FAQ。

二、从轨道到 18 维:压缩了什么信息

AVI 并不把全部组织轨道直接送入一个无限维分类器。报告取十个 AlphaGenome 分子特征,加四个编码相关特征、两个保守性特征和两个 indel 类型指示量。编码项包括 AlphaMissense 和三项功能丧失后果注释(protein termination、stop lost、start lost);保守性来自多物种比对。九项分子 scorer 在相关轨道和基因等维度取最大绝对效应,剪接则另用合并项。用简化索引写成:

\[a_m=\max_{c,g}|z_{m,c,g}|,\qquad S_{\mathrm{splice}}=S_{\mathrm{sites}}+S_{\mathrm{usage}}+\frac{S_{\mathrm{junctions}}}{5}\]

这里只有剪接连接项除以 5,不能把整个剪接和都除以 5。所谓 active allele scores 用于表示等位基因的绝对活性,未作为上述 AVI 分子特征。特征定义并不统一为同一个物理单位,读取时应保留各自 scorer 含义。报告第 22–23 页。

最大值解决了“如何把大量预测压成少量特征”的工程问题,也引入解释边界:可及性最大变化可能出现在组织甲,RNA 最大变化出现在组织乙。十个最大值不是同一个细胞状态下同时发生的十项测量。绝对值还去掉了部分方向信息;如果要解释一个机制,应返回对应组织、轨道、基因的成对预测,核对效应方向与范围。

十项 AlphaGenome 分子特征以及 Cactus 保守性用 MaxAbsScaler 缩放,只使用训练集的最大绝对值:

\[\widetilde a_i(\nu)=\frac{a_i(\nu)}{\max_{u\in\mathcal T}|a_i(u)|}\]

其中 \(\mathcal T\) 是训练集合,分母假设为正。其他特征按报告保留原有尺度;不能把所有 18 项都随手重新标准化。固定训练统计量也意味着新样本可能超过训练集范围,缩放本身不构成分布外校准。若自己实现时遇到恒零特征,应明确处理规则,不能从这个公式猜测官方实现。

原创机制示意,非实验数据,没有模型运行、病例数据或实测曲线。第一层是 GRCh38 REF 与 ALT 的分子效应评分。输入包括十个 AlphaGenome 特征,即九个跨相关维度的最大绝对效应特征和一个合并剪接特征;再加入四个编码类特征、两个保守性特征和两个 indel 类型指示,共十八个。不同特征的最大值可能来自不同组织,不能据此拼成同一细胞的联合机制。active-allele 评分被排除;仅 AlphaGenome 特征与 Cactus 特征按训练集尺度归一化。第二层是 AVI:十六个主要特征与两个类型指示输入模型,六个模型原始 logit 取平均。gnomAD 罕见与常见频率代理标签经过分层平衡采样,仅作为训练监督旁路,并非直接的临床致病标签;模型选择使用功能实验和性状关联验证数据。第三层把输出映射到固定全 SNV 参照的 PHRED 排名;二十分表示全 SNV 参照前百分之一,不是百分之九十九的致病概率。indel 也映射到同一 SNV 参照。不能在筛选后的候选子集重新排名再冒充原始 AVI PHRED。后续需对照同一 biosample 的 REF 与 ALT 轨道,并结合原始实验、组织、表型、遗传方式与独立验证,形成解释假设和候选优先级,不能单独作出临床结论。
原创机制示意,非实验数据或模型运行结果。分子效应特征、频率代理监督下的 AVI 输出与固定全 SNV 参照的 PHRED 排名是不同层次;PHRED 20 表示参照分布前 1%,不表示 99% 致病。跨组织最大值不等于同一细胞的联合机制,indel 仍映射 SNV 参照。解释与优先级还需要成对轨道、原始实验和独立背景证据;图不提供临床结论。

三、训练目标:用群体频率构造代理标签

AVI 的训练对象为 gnomAD v4.1 genome 数据中已观察到的变异,代理标签来自其 FAF95_GRPMAX,即跨遗传祖源群体的最大过滤等位基因频率的 95% 下界。报告将低于 0.001 的变异标为 proxy impactful,将不低于 0.001 且低于 0.999 的变异标为 proxy neutral。这个区分利用负选择相关信息;它没有逐一证明罕见变异致病,也没有把罕见但中性的变异排除在正类之外。报告第 20–21 页。

为减轻局部突变背景混杂,SNV 按合并反向互补的 96 类三核苷酸替换上下文分别平衡正负样本;训练 indel 按不超过 10 bp 的长度分别平衡。报告使用十份重采样集合。这样可以减少某些序列上下文和基础突变率对训练的影响,却改变了模型所见的类比例与输入分布。这里的“平衡”是数据构造规则,不是对人群疾病先验的测量。

设代理标签为 \(y\),训练在 logit 上使用二元交叉熵:

\[\ell(y,f)=-y\log\sigma(f)-(1-y)\log\bigl(1-\sigma(f)\bigr)\]

即便 \(\sigma(f)\) 对采样后的代理标签完全校准,它也只回答该采样分布下的代理类问题。为了看清先验这一环,考虑一个严格限定的假设:标签定义相同,类条件分布不变,仅类先验由 \(\pi_{\mathrm{sample}}\) 换到 \(\pi_{\mathrm{target}}\)。贝叶斯定理给出:

\[\frac{q_{\mathrm{target}}(x)}{1-q_{\mathrm{target}}(x)}=\frac{q_{\mathrm{sample}}(x)}{1-q_{\mathrm{sample}}(x)}\,\frac{\pi_{\mathrm{target}}/(1-\pi_{\mathrm{target}})}{\pi_{\mathrm{sample}}/(1-\pi_{\mathrm{sample}})}\]

这是本文的通用概率推导,不是 Atlas 提供的校准方案。假设抽样先验为 0.5,抽样后验为 0.9,而目标先验为 0.01,同标签目标后验只有约 8.33%。但真实 Atlas 还做了上下文分层抽样,更重要的是疾病事件与频率代理标签并不是同一标签;只替换一个先验不能完成这两次转换。

也不能把整个研究流程说成“完全没有功能或临床数据参与”。其梯度训练使用频率代理标签,但模型选择使用独立验证中的功能与关联基准;正式测试还包括 ClinVar 等评估。训练监督、验证选模、测试证据要分别记录。

四、原始 logit:条件权重不是固定证据权重

报告把主特征记为 \(x\in\mathbb R^{16}\),把两个插入/删除指示量记为 \(v\in\{0,1\}^2\)。SNV 的类型向量为零。模型包含条件超网络、普通线性支路和 indel 偏移:

\[f(x,v)=w_\phi(h)^\top x+b_\phi(h)+w_\theta^\top x+b_\theta+o(v),\qquad h=h_\phi(x,v)\]

超网络用当前 \(x,v\) 生成非负权重 \(w_\phi(h)\) 和偏置,因而不同变异可有不同的特征组合方式;普通线性支路的权重没有同样的非负约束。最终六个成员平均的是原始 logits:

\[s(\nu)=\frac{1}{6}\sum_{k=1}^{6}f_k(x(\nu),v(\nu))\]

平均 logit 再作 sigmoid,与先对每个成员作 sigmoid 再平均,一般并不相同;这里必须按报告保留顺序。报告第 24–26 页给出了结构与训练,当前公开 SDK 的查询能力也不能据此视为已经公开了整套 AVI 训练权重。

另一个容易误读的结论是:既然超网络权重非负,任何特征增加都必然提高最终分数。固定 \(v\) 对主特征求导,本文展开为:

\[\frac{\partial f}{\partial x_i}=w_{\phi,i}(h)+\sum_jx_j\frac{\partial w_{\phi,j}(h)}{\partial x_i}+\frac{\partial b_\phi(h)}{\partial x_i}+w_{\theta,i}\]

只有第一项由非负权重直接限制;权重、偏置随输入变化的导数以及普通线性项都要计入。最小数学反例是:

\[g(x)=x e^{-x},\qquad g^{\prime}(x)=e^{-x}(1-x)\]

权重 \(e^{-x}\) 始终为正,而 \(x>1\) 时导数为负。这个反例没有复刻 AVI 学到的函数,它只说明“权重非负”这一条件不足以推出整个模型单调。可解释的条件组合,不等于一套固定、可逐项相加的生物学证据权重。

五、PHRED 20:尾部排名的对数尺度

报告将平均原始分数按全部 SNV 的分布转换为 PHRED:10 表示前 10%,20 表示前 1%。Indel 的原始分数也映射到同一 SNV 分位曲线,并非在 indel 自己的分布里另行排名。图 1 及第 3–4 页。

为解释尺度,本文定义一个明确的有限参考集合 \(\mathcal R\),大小为 \(N\),并把并列分数全部计入上尾:

\[T_{\mathcal R}(s)=\frac{1}{N}\sum_{u\in\mathcal R}\mathbf 1\{s(u)\ge s\},\qquad Q_{\mathcal R}(s)=-10\log_{10}T_{\mathcal R}(s)\]

这个含等号的尾部定义是教学约定;报告没有完整披露 AVI 后端的离散并列、插值与端点细节,本文代码不声称逐位复现其转换。对参考集合里的分数,尾部非零;对超过参考最大值的新分数,教学代码直接报错,而不私自外推有限分值。只要上尾比例为 0.01,\(Q=20\)。这里的 0.01 是背景中有多少分数不低于它,没有出现疾病标签。

看一个纯合成例子:参考分数是 0 到 999 的一千个整数,990 的上尾有十个,所以得到 20 分。现在只留下 990 到 999 作为候选集合;同一个 990、同一个模型,在新集合里的上尾比例变为 1,教学分数变为 0。重新对子集排名改变了参考问题,不能再称它是原来全基因组的 AVI PHRED。若对原分数和固定背景同时施加严格递增变换,尾部排名则不变:排名保留顺序,却丢掉原始尺度。

量或阶段使用什么分布解释时保留什么
单 scorer 的 quantile_score官方 FAQ:gnomAD v3 任一群体 MAF > 0.01 的常见变异背景特定 scorer/track 的相对异常程度;不能直接充当 AVI PHRED
AVI 训练代理标签gnomAD v4.1 FAF95_GRPMAX 阈值与分层平衡抽样代理目标与采样分布
AVI PHRED全部 SNV 原始分数的排名;indel 映射同一 SNV 曲线固定背景的上尾位置
疾病事件后验特定任务的真实标签、类比例与条件证据另需独立验证;不能从前面任一排名直接读出

单 scorer 的 quantile 与 AVI PHRED 是两层不同转换。接口里名字都像“校准分数”,不意味着参考分布相同。尤其在已经按频率、区域或家系信息过滤的候选列表中,背景组成改变,原来的全 SNV 前 1% 不能自动理解成当前列表里 1% 的假阳性率。固定版本 FAQ 的 raw/quantile 定义。

六、要问疾病后验,还缺哪些条件

令疾病相关真值为 \(D\),高分事件为 \(B\),目标任务中真值比例为 \(\pi=\Pr(D=1)\)。若确知该任务的灵敏度 \(\alpha\) 与假阳性率 \(\beta\),从条件概率定义就能推得:

\[\Pr(D=1\mid B)=\frac{\alpha\pi}{\alpha\pi+\beta(1-\pi)},\quad\alpha=\Pr(B\mid D=1),\quad\beta=\Pr(B\mid D=0)\]

式子来自正类命中与负类误报的计数分解。PHRED 的全 SNV 尾部比例不等于这里的 \(\beta\),报告的排名也没有直接提供某个个体或任务的 \(\pi\)。再做一组明确假设的数学反例:令灵敏度为 0.9、假阳性率为 0.01;当真值比例为 0.001,后验约 8.26%;比例换为 0.1,后验约 90.91%。这些数没有来自 AVI 的实验或临床表现,只用于说明相同条件率在不同背景下产生不同后验。

因此,高分可引导下一步检验,但机制解释还应核对组织、表达与剪接背景、变异作用范围,以及独立的遗传和实验依据。Atlas 报告也列出细胞类型缺失、部分 RNA 测量覆盖不足和不直接建模 trans 调控等限制。一个选中的病例或一个 AUPRC 数值,不能替代所有候选、所有祖源或所有用途的概率校准。报告第 18、27–30 页。

七、归因:解释原始分数,还要保留基线

Atlas 用 expected gradients 近似 SHAP,在原始 logit 尺度给出特征归因。方法页指定零向量背景,但“输入为零”不推出“输出为零”。为避免与前面 16 维主特征混淆,本文把完整输入写为 \(z=(x,v)\),模型输出写为 \(F(z)\)。在可微、可积且精确沿路径积分的条件下,零基线路径满足(偏导符号表示对模型输入第 i 个坐标求导,并在路径点取值):

\[\phi_i(z)=z_i\int_0^1\partial_i F(tz)\,\mathrm dt,\qquad\sum_i\phi_i(z)=F(z)-F(0)\]

右边的加总由链式法则与微积分基本定理得到。实际 expected-gradient 估计还会有数值近似误差,所以应检查 \(F(0)+\sum_i\phi_i\approx F(z)\),不能默默删掉基线。报告结果和图注有“贡献和为 raw score”的概括说法;本文沿方法定义保留基线,不假定其发布模型恰有零基线输出。报告第 26 页。

即便归因在原始尺度近似相加,经过全基因组排序及对数变换后,也不能直接把各项解释成 PHRED 的可加份额,更不能读成某项分子机制贡献了多少致病概率。保守性驱动的高分可能缺乏具体分子机制解释;归因提出的是模型使用了哪些输入信号,因果检验仍需不同证据。

八、计算预算:预计算把工作移到了哪里

Atlas 用预计算避免每次查询都重新跑长序列模型。报告将参考基因组按 128 bp 窗口铺开,每个非 N 位点枚举三个 ALT,在共同约 1 Mb 上下文中缓存一次 REF 预测。若一个窗口有 \(n\) 个可评分位点,理想前向次数为:

\[n_{\mathrm{ALT}}=3n,\qquad C_{\mathrm{naive}}=2(3n),\qquad C_{\mathrm{cached}}=1+3n\quad(n>0)\]

完整窗口最多 384 个 ALT;成对独立计算需要 768 次,缓存后为 385 次。这是调用次数账本,不是实测约两倍加速:预测头、内存流量、批处理、结果压缩和写盘仍有成本。部分基因注释掩码可复用,中心与 contact-map 掩码仍逐变异构造。Indel 在报告中另行处理,没有这个 REF 缓存;其激活 shift/stitch 策略需要三次前向,不能把 SNV 的预算或坐标规则原样套过去。报告第 19–20 页。

查询也有预算。固定 SDK 版本将区间拆成小块、分页并发请求并汇集结果;scorer、组织与基因过滤影响传输量和解析内存。查询预计算值、重新进行在线推理,以及在本地训练 AVI,是三个不同工作量。本文没有运行这些模型、计时服务或下载整个 Atlas,不能给出未经测量的端到端耗时。固定版本 Atlas client。

解释尾部的教学代码只需排序一次参考数组,成本 \(O(N\log N)\)、存储 \(O(N)\);每次用二分定位上尾为 \(O(\log N)\)。这说明参考背景与查询可以分离,不表示真实 Atlas 必须用这个小型数据结构实现。

九、如何用可检验对照验收

本文附 原创 Python 检验代码,仅使用标准库,运行 python3 alphagenome-avi-ranking.py。作者实际通过 80 项算术检查:固定背景的分数与并列、递增变换不变性、子集改变分数、logit 与 sigmoid 的平均顺序、同标签先验修正、指定条件率的贝叶斯反例、条件正权重的非单调反例、非零输出基线归因,以及 SNV 前向次数。极端先验以 log-odds 计算,避免直接 odds 溢出。这些是合成输入的数学检查,没有执行 AlphaGenome、AVI、真实基因变异或临床实验。

要进一步验证科研用途,可以预先固定三类对照。第一,对固定版本的同一批变异比较频率基线、保守性基线、分子 scorer 与 AVI,保持参考组装、可评分集合、过滤和方向约定一致;覆盖不到的变异单列,不能当作零效应。第二,在独立组织或功能实验中追踪哪些轨道差异得到支持,保留反例与未测量项,而不是只展示一个机制故事。第三,对明确定义的目标与人群另评排序和概率校准,记录标签构造、类比例及筛选路径;缺少相应真值时保留未知。

报告的 AVI 拆分与测试按位点去除训练/验证重叠,即使 ALT 不同也排除,indel 还扩展到覆盖区间;验证使用功能与关联数据来选模。这个防泄漏措施值得保留,但不能据此声称底层 AlphaGenome 从未见过该基因组区域:轨道预测的折间留出与用于变异评分的蒸馏模型是不同设置。建议新增基因座、时间和实验来源对照,辨认上下文记忆、任务迁移与真实增量。报告第 21–22、28 页;底层模型的训练与蒸馏。

最后的验收问题很具体:分数能否在正确坐标和固定背景下重复?高分由哪些组织、轨道与特征驱动?这些信号在独立证据中是否成立?排序是否在目标候选集内更有效,概率是否针对同一个真实目标另行校准?把每个接口回答清楚,Atlas 才能从大规模预计算资源变成可审查的科研优先级,而不是一个被过度解释的单数。

引用元数据核验使用 Scientific Agent Skills 的 citation-management 流程;其最新论文版本为 v2(2026-09-02)。这一工具出处已列入参考来源,用于研究流程说明,不作为基因组或疾病结论的证据。Kassis et al., Scientific Agent Skills。

参考资料

  1. AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome — Google DeepMind resource announcement · 2026-09-08 · 查阅 2026-10-09
  2. AlphaGenome Atlas: in silico mutagenesis of the entire human genome improves prioritization and interpretation of non-coding variants — official launch report, Methods pp.18–28 · 2026-09-08 · 查阅 2026-10-09
  3. Cheng et al. AlphaGenome Atlas: in silico mutagenesis of the entire human genome improves prioritization and interpretation of non-coding variants — medRxiv v1, preprint · 2026-09-20 · 查阅 2026-10-09
  4. Avsec et al. Advancing regulatory variant effect prediction with AlphaGenome. Nature 649, 1206–1218 (2026) · 2026-01-28 · 查阅 2026-10-09
  5. How variant scoring works — official AlphaGenome documentation · 查阅 2026-10-09
  6. AlphaGenome FAQ — pinned API source 9d9885cd966c9ed72bd477f63ef831f586ed0bfc · 查阅 2026-10-09
  7. AlphaGenome Atlas client — pinned API source 9d9885cd966c9ed72bd477f63ef831f586ed0bfc · 查阅 2026-10-09
  8. Kassis et al. Scientific Agent Skills: A Library of Procedural Knowledge for Research Agents. arXiv:2609.00065, current v2 revised 2026-09-02 (research-tool attribution) · 2026-08-30 · 查阅 2026-10-09
利友诚

关于作者

利友诚 · Youcheng Li

北京大学智能学院人工智能专业博士研究生,导师为王立威教授;Isoplex Intelligence(壹索智能)联合创始人兼 CTO。

研究关注医疗人工智能、生成式基础模型、诊断推理与科学智能体。以第一作者或共同第一作者身份在 Nature Biomedical Engineering、Scientific Data、KDD 和 PLOS Computational Biology 发表研究。