Yau Awards Archive 2020 — 2025

B10

纯 CPU 预算下的蛋白质变异效应零样本预测:语言模型规模、MSA 特征与结构特征的算力—性能帕累托前沿及其在 ProteinGym 分层上的稳定性

优先级:低(风险最高,需明确接受可能跑不出显著结论)分族:蛋白质序列与结构参赛子类:计算蛋白质科学 / 机器学习资源需求:纯 CPU 笔记本,模型权重 ≤ 3 GB,推理需数十小时后台运行技能取向:Python + PyTorch 推理 + 基准评估

1 · 研究问题

在"一台 16 GB 纯 CPU 笔记本"这一硬预算下,蛋白质语言模型(protein language model, PLM)的参数规模、基于多序列比对的位点无关基线、以及 AlphaFold 结构派生特征三者的组合,在 ProteinGym 深度突变扫描(deep mutational scanning, DMS)基准上构成怎样的算力—性能帕累托前沿?该前沿的形状在按 MSA 深度与实验类型分层后是否稳定,还是存在某一层上"小模型 + MSA 特征"反超大模型的区域?

2 · 研究背景与空白

背景。 零样本变异效应预测指:不使用任何该蛋白的实验数据,仅凭序列(或结构)模型给出的似然,预测每个氨基酸突变对蛋白功能的影响。它是变异致病性判读与蛋白工程的基础工具。ProteinGym 是该任务的标准基准,收录 200+ 个 DMS 实验、约百万级突变,并公开每个蛋白的预计算 MSA 与各方法的官方得分。

已有工作到哪一步。 ESM-2 系列(8M 至 15B 参数)的零样本性能已被系统报告,ESM2-3B 在 ProteinGym 上的平均 Spearman 约 0.443;基于结构的零样本方法(ESM-IF、ProteinMPNN 及其变体)与多模态方法(如 ProtSSN 等,Cell Research, 2024)也已有大量比较;2025 年有工作专门探讨"结构基零样本适应度预测",指出 ESM-IF 因训练于 AlphaFold2 预测结构,在预测结构上反而优于实验结构。ProteinGym 官网本身即提供按 MSA 深度(低/中/高)与功能类别的分层排行榜。

空白在于:所有这些比较都以"性能"为唯一坐标,没有任何一项把推理算力预算作为第二坐标,也没有人在"纯 CPU、无 GPU"这一真实约束下刻画可行前沿。 而这恰是绝大多数中学、地方院校与低资源实验室的实际处境:15B 模型不可能在笔记本上跑,3B 模型的权重在 fp32 下就要 12 GB。哪一档模型才是这个预算下的最优选择、能否用便宜的 MSA 特征把小模型补到大模型水平——这是一个有明确实用价值却无人回答的问题。这条路线风险最高,因为答案可能平淡("越大越好,无反超区域"),因此它排在第 10 位,且必须与更稳的路线并行才可启动。

3 · 可检验假设

  • H1:在 CPU 推理时间预算轴上,ESM-2 的性能—算力曲线在 150M 参数附近出现明显拐点——从 8M 到 150M 的平均 Spearman 增益 ≥ 0.08,而从 150M 到 650M 的增益 ≤ 0.04(推理时间却增加 ≥ 4 倍),两段增益之差的 95% 自助法置信区间(按 DMS 实验重抽样)不跨 0。
  • H2(反超假设):存在至少一个分层——预期为"MSA 深度高 + 蛋白长度短"的子集——在该层上"ESM-2 35M 的对数似然与 MSA 位点无关基线(PSSM)的秩和组合"的 Spearman 不低于 ESM-2 650M 单独使用,差值 95% 置信区间下界 ≥ −0.01;而在"MSA 深度低"的层上不存在此反超。若 H2 在所有分层上都被否证,则结论为"低资源场景下没有捷径,模型规模不可替代"——这同样是一条对使用者有用的负面结论。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用自建推理与评分脚本在 ProteinGym 上复现官方发布的 ESM-2 650M 零样本得分:(a) 在 ≥ 30 个 DMS 实验的子集上,本项目计算的突变得分与 ProteinGym 官方发布的对应模型得分的 Spearman 相关 ≥ 0.95;(b) 本项目算得的逐实验 Spearman 与官方排行榜数值的绝对偏差 ≤ 0.02,均值偏差 ≤ 0.01。任一项不达标,推理或评分实现有误(最常见原因是打分策略选择——masked-marginals / wt-marginals / mutant-marginals 三者结果不同),后续全部前沿结论无效。
  2. 统计口径预先写死:(a) 主指标为逐 DMS 实验的 Spearman 秩相关,跨实验取中位数与均值并都报,不做突变级汇总(因为不同实验的突变数极不均衡,汇总会被少数大实验主导);(b) 若做"有害/中性"二分类的补充分析,报 PR-AUC 与 MCC,不报 accuracy,原因是多数 DMS 中有害突变占比失衡,accuracy 会被多数类支配;(c) 所有模型间比较用按 DMS 实验整体重抽样的自助法(≥ 1,000 次)给 95% 置信区间,分层比较报 BH-FDR;(d) 算力必须以同一台机器、同一线程数、同一 batch 设置实测的墙钟时间与峰值内存报告,且必须给出"每单位 Spearman 增益的秒数"这一双成本口径;(e) 样本量为 DMS 实验数,须先做检验力估计:在 n 个实验下能以 80% 检验力检出的最小 Spearman 差值是多少,写入方案。
  3. 算力预算必须显式声明并遵守:全部结果必须在"16 GB 内存、纯 CPU"下产生;任何超出该预算的模型(见下表)一律标注为"未评估"而不得引用他人 GPU 结果冒充本项目结果。
  4. 规模下限:≥ 60 个 DMS 实验(须覆盖 ≥ 3 类实验终点:稳定性、结合、活性/适应度),每个实验 ≥ 500 个突变;≥ 4 档模型规模;≥ 3 类分层维度(MSA 深度、蛋白长度、实验终点)。
  5. 公开基准与他人模型的地位:ProteinGym 的 DMS 数据、预计算 MSA、官方得分文件,以及全部预训练模型权重,均为他人成果,仅作为输入、校验与对照,不计入本项目的数据贡献
  6. 可复现性:全部推理脚本、打分策略实现、计时脚本、硬件规格、模型权重的 checksum、随机种子开源;提供 10 个 DMS 实验 + 两档模型的降规模复现包(≤ 3 小时可跑完)。

5 · 数据与工具

用途 来源 / 工具
DMS 基准与预计算 MSA ProteinGym(https://proteingym.org/ ,数据托管于官方下载链接/Zenodo)。含 200+ DMS 实验、参考序列、突变表、预计算 MSA 与各方法官方得分。MSA 打包文件体积较大(数十 GB 量级),需核实并按需只下载目标实验的 MSA
蛋白质语言模型 Hugging Face facebook/esm2_t6_8M_UR50Desm2_t12_35Mesm2_t30_150Mesm2_t33_650M。fp32 权重分别约 0.03 / 0.14 / 0.6 / 2.6 GB,650M 及以下均可在 16 GB 内存下推理
明确超出范围的模型 ESM-2 3B(fp32 权重约 12 GB,加上激活值在 16 GB 机器上不可行)、ESM-2 15B、ESM-3、以及任何需训练的方法(EVE、DeepSequence 需 GPU 训练数小时至数天)。这些一律标注"未评估",不得引用他人结果充数
MSA 基线 自实现的位点无关模型(PSSM / 独立位点频率,含伪计数与序列加权),纯 numpy,秒级;以及 GEMME(Java,MSA 基,CPU 上单蛋白分钟级,在 ProteinGym 上性能接近顶尖方法)——这是本课题最重要的低算力对照
结构特征 AlphaFold DB 已发布模型的 pLDDT 与相对溶剂可及性(DSSP),以及残基接触数。不运行任何结构预测推理(理由与 B02 相同:AlphaFold2 完整流程需约 2.2 TB 数据库与 GPU;ColabFold 在 CPU 上单蛋白数小时,不可用于 60+ 蛋白的规模)
推理与评分 Python + PyTorch(CPU 后端,torch.set_num_threads 固定线程数)、transformersscipy.stats.spearmanr
算力口径(须实测校准,以下为规划估计) 打分策略决定成本:wt-marginals 每个蛋白只需 1 次前向传播masked-marginals 需要 L 次前向传播(L 为序列长度),是 ESM 论文的标准做法但成本高 L 倍。以 L=300、8 线程为例,单次前向传播粗估 8M ≈ 0.05 s、35M ≈ 0.15 s、150M ≈ 0.5 s、650M ≈ 2 s;masked-marginals 下 650M 单蛋白约 600 s,60 个蛋白约 10 小时(长蛋白会显著更久)。四档模型全跑约 13–20 小时,可后台分夜运行。这些数字必须在第 3 周用实测替换,规划估计不得写进论文
对照基准 ProteinGym 官方排行榜与官方得分文件。仅用于校验与对比,不计入本项目的数据贡献
伦理 全部为公开序列、结构与已发表实验数据,不涉及人体实验、动物实验与可识别个人信息,无需伦理审批

6 · 方法路径

  1. 装环境(PyTorch CPU + transformers),下载 ProteinGym 参考数据与官方得分,先完成验收标准第 1 条的 650M 复现;特别注意打分策略必须与官方一致,把三种策略的结果差异一并记录到 validation/(这本身是有用的方法学信息)。
  2. 第一件事是实测算力:在目标笔记本上测四档模型在不同序列长度下的单次前向时间与峰值内存,画出成本曲线,据此确定可评估的 DMS 实验子集(长度上限)。此步决定整个课题的规模,不得跳过或用规划估计代替
  3. 按预先写死的规则选定 ≥ 60 个 DMS 实验(覆盖三类终点、长度 ≤ 实测可行上限、突变数 ≥ 500),并从 ProteinGym 按需下载对应 MSA。
  4. 跑四档模型的零样本打分(固定 masked-marginals,若算力不足则固定 wt-marginals 并明确声明),逐实验算 Spearman,实测记录墙钟时间;画性能—算力帕累托前沿,检验 H1。
  5. 实现 PSSM 基线与 GEMME 基线,同样记录算力;构造"小模型 + MSA 基线"的秩组合(简单的秩平均与按 MSA 深度加权两种组合规则,规则预先写死,不得事后调参)。
  6. 按 MSA 深度、蛋白长度、实验终点三维分层,比较各组合的 Spearman,自助法给区间,BH 校正,检验 H2;明确报告是否存在反超区域及其边界。
  7. 独立交叉校验:其一,加入结构派生特征(pLDDT、相对溶剂可及性)作为第三类廉价特征,检验其增益是否独立于 MSA 特征;其二,用一个 ProteinGym 未参与前沿构造的留出实验子集(≥ 15 个)做外部验证,报前沿结论在留出集上的成立情况——防止分层选择造成的事后挑选偏倚。

7 · 新颖性边界

本课题训练任何模型、提出新的打分方法、声称任何模型性能超过已发表的最优方法,声称"更大的 PLM 通常更好"或"结构特征有帮助"为本项目发现——这些已由 ESM-2 论文、ProteinGym 排行榜、2025 年结构基零样本适应度工作与 Cell Research 2024 的多模态工作确立。

已有工作具体完成了什么:ProteinGym 发布了 200+ DMS 的统一基准、预计算 MSA、官方得分与按 MSA 深度与功能类别的分层排行榜;ESM-2 的规模—性能关系(ESM2-3B 平均 Spearman 约 0.443)已公布;结构基方法与多模态方法的比较也已系统开展。这些工作全部在 GPU 环境下进行,性能是唯一坐标轴;没有任何一项报告 CPU 推理成本,也没有任何一项刻画"给定算力预算下的最优选择"。

本项目的贡献(且是主结论):把评价维度从"性能"换成"性能—算力二维帕累托前沿",在一个明确声明的硬件预算下给出可执行的选型建议,并检验一个可否证的命题(H2 的反超区域)。这属于研究手册所列"评价维度的转换"与"方法层面的可复现性贡献",在计算领域是被承认的贡献类型;但定位必须讲清楚,否则会被误读为重复基准测试——答辩时这是最可能被追问的一点,须提前准备英文表述。

为什么有价值:变异效应预测的使用者中,有大量人手上只有 CPU。现有排行榜按性能排序,对他们没有直接指导意义;一条带算力坐标的前沿把"我应该用哪个模型"变成可读数的答案。

风险声明:本课题最可能的负面结果是"前沿平凡"——即性能随算力单调增加、无拐点、无反超区域。 这仍是有效结论(它明确否定了"小模型 + 廉价特征可替代大模型"这一在低资源社区中流行的期望),但价值低于发现反超区域。必须由第 2 条的检验力估计证明本设计有能力检出 0.04 的 Spearman 差值,否则连负面结论也不成立。这正是本课题排在第 10 位的原因。

8 · 决策门槛(go / no-go)

  • 第 3 周末(第一道硬门槛):完成算力实测。若 650M 模型在 masked-marginals 下的实测速度使 60 个实验需要 > 60 小时,立即降级:其一,打分策略改为 wt-marginals(成本降 L 倍,但性能会下降,须在论文中明确标注并用 10 个实验量化两种策略的性能差);其二,把最大模型档从 650M 降到 150M,前沿的横轴范围相应收窄。两条降级都保留"性能—算力前沿 + 分层稳定性 + 反超检验"的主结论框架。
  • 第 7 周末(第二道硬门槛):验收标准第 1 条必须通过。若与官方得分的 Spearman < 0.95,逐项排查打分策略、突变编号偏移(1-based vs 0-based)、以及 ESM 的特殊 token 处理;四周内仍不通过则本课题终止,学生转入 B02(同为结构/序列分析族、共用 AlphaFold DB 与 Python 技能栈,前期投入不浪费)。这是全部十条路线中唯一设有"终止并转线"门槛的课题,启动前必须让学生知情。
  • 第 12 周末:确认 ProteinGym MSA 的下载可行性。若 MSA 无法按需下载(只提供整包且体积超出磁盘),立即降级:改用自行从 UniRef50 构建的浅 MSA(MMseqs2,单蛋白分钟级,但需 UniRef50 数据库约 30–60 GB 磁盘),或彻底放弃 MSA 分支,把 H2 改述为"小模型 + 结构特征能否反超大模型"。框架保留。
  • 第 24 周末:若 H1 的拐点不存在且 H2 无反超区域,按风险声明写"前沿平凡"结论,并把实测算力表与留出集外部验证作为核心交付物。
  • 第 36 周结果冻结,第 44 周英文 PPT 初稿。
  • 需提前核实而非边做边发现:(a) ProteinGym 当前版本的 DMS 数量、MSA 打包方式与官方得分文件格式;(b) ESM-2 各档权重在 Hugging Face 上的可下载性与 fp32/fp16 CPU 推理的数值一致性(fp16 在 CPU 上可能不加速甚至更慢,须实测);(c) GEMME 的安装依赖(Java + MSA 格式要求)。三项在第 5 周前查清。
  • 选择前提仅在学生已具备 Python/PyTorch 基础、已完成至少一条更稳路线的前期训练、且明确接受"可能跑不出显著结论"这一风险时才启动。 本课题的交付物质量高度依赖实测算力表的严谨性与外部验证的诚实执行;若学生倾向于"调到好看为止",这条路线会变成事后挑选偏倚的重灾区,反而在答辩中失分。
  • 预算裁剪顺序:先砍结构特征分支(第 7 步前半),再砍 GEMME(保留 PSSM 基线),再砍分层维度(只保留 MSA 深度),最后把 DMS 实验数从 60 降到 35、模型档从 4 降到 3。砍到只剩"35 个 DMS × 三档模型 × PSSM 基线 × 实测算力前沿 + 留出集验证"时,主结论仍成立。