ISEF Topic Scoping 2027

C577–87

分子对接分数能预测什么:用诱饵分子做一次基准测试

推荐优先级:最高 · 参赛子类:Cellular & Molecular Biology — 计算靶点验证 · 资源需求:零实验室、零合规、零器材;一台笔记本,实测数天 CPU 时 · 技能取向:分子对接 / 基准测试设计 / 排序统计

1 · 研究问题

一个学生项目最常用的对接流程(AutoDock Vina / HADDOCK 打分 + MM/PBSA 后处理),在由已知结合物与理化性质匹配的诱饵分子构成的标准集上,富集能力是多少?它有多大概率把一个诱饵排在真实配体前面,而 MM/PBSA 给出的结合能与实测亲和力之间还剩多少相关性?

2 · 研究背景与空白

背景。 分子对接的核心事实是:它对任何输入都会给出一个分数。 你把一个真配体丢进去,得到 −9.2 kcal/mol;你把一个完全无关的分子丢进去,同样得到一个数,可能是 −8.7。分数本身不携带"这是不是真的结合"的信息,唯一有意义的问题是排序能力——真配体能不能被系统性地排在诱饵前面。评价这件事的标准做法在药物设计领域已有二十年历史:取一批已知活性分子,配上一批理化性质匹配但拓扑不同的诱饵(分子量、logP、可旋转键数相近,因此不能靠"分子大小"作弊),跑完整个流程后报告 ROC-AUC 与早期富集因子。MM/PBSA 是在对接位姿基础上做的一次结合自由能估计,它的绝对值系统性偏大是众所周知的;文献普遍认为它至多提供有限的排序改善,而不能当作实验结合自由能读。但在学生项目里,一个 kcal/mol 数值几乎总是被直接当作"结合强度的定量证据"呈现。

已有工作到哪一步。 CELL030(2025,Grand Award,"Midkine as a Target for Pancreatic Cancer Therapy") 摘要原文:"The MK vaccine was designed with reverse vaccinology epitope prediction, structural modeling, and in silico immune and molecular docking simulations"、"Computational vaccine design indicated a structurally stable, antigenic, non-allergenic, and non-toxic MK vaccine, which elicited strong Th1-dominant immune response with high binding affinity to immune cell receptors"。MCRO025(2025,Grand + Special Award,"Induced MRSA Autolysis Using Designed Activators") 摘要原文:"MM/PBSA calculations determined an average binding energy of -80 kcal/mol for the designed activators"。−80 kcal/mol 这个数量级对一个小分子-蛋白复合物而言异常之大(典型实验值在 −5 到 −15 kcal/mol 量级),这本身就说明 MM/PBSA 的绝对值不能按实验结合自由能读——而摘要把它当作有效性证据呈现。 另有 MCRO013(2026 Grand + Special) 用 HADDOCK 分数比较两个同源蛋白的底物依赖性。三个获奖项目、三种打分函数,共用同一个未被基准化的假设。

空白在于:对接打分函数的基准测试在药物设计文献里是成熟工作,但没有任何面向学生的公开材料回答"用一台笔记本、用学生实际会用的默认参数跑出来的这条流程,它的富集能力到底是多少、把诱饵排在真配体前面的概率有多大"——而这恰恰是每一个 in silico 学生项目的可信度基石。这个空白适合一年期学生课题,因为它零实验室、零合规、零器材,数据与工具全部免费公开,主要成本只是 CPU 时间;而且结论正负都成立:富集能力好是对整类做法的有力辩护,富集能力接近随机则是一个必须被知道的警告。

3 · 可检验假设

H1 在理化性质匹配的诱饵集上,学生默认参数下的 AutoDock Vina 流程,其早期富集因子 EF1% < 10(即在打分排名前 1% 的分子里,真配体的富集倍数不足 10 倍),且至少有 20% 的诱饵分子的打分优于该靶点真配体的中位数打分

H2(机制/备择假设)MM/PBSA 后处理并不改善排序:对同一批分子,MM/PBSA 重打分后的 ROC-AUC 与原始 Vina 打分的 ROC-AUC 之差,其自助抽样 95% 置信区间跨过零;同时 MM/PBSA 的绝对结合能与实测 ΔG 的 Spearman ρ < 0.4。若 H2 成立,学生得到一条明确建议:MM/PBSA 增加了十倍算力却没有增加信息量。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。已发表基准数值重跑对齐:选 2–3 个在公开对接基准中已有 ROC-AUC 报告的靶点,用本项目的流程重跑,要求复现出的 ROC-AUC 与已发表值的偏差 ≤ 0.10;同时做位姿重现校验——对至少 5 个有晶体结构的复合物做重对接(redocking),要求 RMSD ≤ 2.0 Å 的成功率 ≥ 60%这两项任一不过关不许往下做——连已知答案都对不上时,后续所有关于富集能力的数字都是在测自己的配置错误。
  2. 统计口径预先写死——这是极不平衡分类,一律报 PR-AUC 与富集因子,明确不报 accuracy。 真配体与诱饵的比例通常在 1:50 左右,在这种不平衡下 accuracy 会被多数类支配:一个把所有分子都判为诱饵的模型 accuracy 高达 98%,却毫无用处;ROC-AUC 也会被大量易分的负样本抬高。 因此主指标固定为 PR-AUC、EF1%、EF5%、以及 BEDROC,ROC-AUC 只作辅助报告。全部指标须给出自助抽样(≥ 2000 次)置信区间
  3. 统计口径预先写死——排序能力用 Spearman ρ 与 Kendall τ 并给置信区间。 MM/PBSA 结合能与实测亲和力的关系一律报 Spearman ρ 与 Kendall τ 两个量并附自助抽样置信区间,不得只报"存在相关性"或只报皮尔逊 r(后者对异常值极敏感,而 MM/PBSA 的异常值很常见)。
  4. 规模下限与诱饵匹配判据。 靶点 ≥ 3 个(覆盖不同蛋白家族);每靶点真配体 ≥ 30 个、性质匹配诱饵 ≥ 1500 个;诱饵的匹配判据必须预先定死并可复现(分子量、logP、可旋转键数、氢键供受体数各自的分布差异须报告)。若诱饵与真配体在分子量上就可分,整个基准无效——这一点必须先验证。
  5. 主结论的量化形式。 交付一张"学生对接流程性能卡":逐靶点给出 PR-AUC、EF1%、"诱饵优于真配体中位数"的比例,以及 MM/PBSA 相对原始打分的 ROC-AUC 增量及其置信区间。并给出一条可操作结论:在这个性能水平下,一个纯对接筛选出的候选分子,其"值得进一步验证"的先验概率大约是多少。
  6. 可复现性。 全部输入结构(含质子化与电荷分配的具体设置)、对接盒子坐标、软件版本号与随机种子、批处理脚本与全部原始打分输出开源存档,第三方可一键重跑。对接结果对随机种子敏感,不记录种子的结果不可复现——这一条必须写进方法。

5 · 数据与工具

用途 来源 / 工具
靶点结构 Protein Data Bank(PDB),免费公开。需核实所选靶点是否有分辨率足够(建议 ≤ 2.5 Å)且带共结晶配体的结构,用于 redocking 校验
真配体与诱饵集 公开的诱饵基准数据集(DUD-E 类)。需核实:该数据集的当前可访问地址、许可条款、以及诱饵生成方式是否与本项目所需的性质匹配判据一致——不同基准集的诱饵构造方法不同,会直接影响结论
实测亲和力(用于检验 H2) 公开的结合亲和力数据库(如 PDBbind 类)。需核实覆盖范围与当前访问方式若无法取得配对的实测 ΔG,H2 的后半部分不可检验,须在方案中提前写明
对接软件 AutoDock Vina(免费开源);如需比较,HADDOCK 有网页服务。需核实 HADDOCK 网页服务的提交额度限制——大规模筛选很可能超限,这决定了 HADDOCK 只能用于小规模对照
MM/PBSA GROMACS + 相应的 MM/PBSA 工具链(免费)。需核实具体工具与版本;MM/PBSA 算力需求远高于对接,只对排名前列子集做
分子准备 Open Babel / RDKit(免费)。质子化状态与互变异构体的处理方式必须显式记录——见第 6 步的静默失败点
计算环境 纯 CPU 笔记本即可。规模按"3 靶点 × 1500 诱饵 × Vina 默认穷尽度"估算,数天可完成;存储 GB 级
对照基准(仅用于校验与对比,不计入本项目的数据贡献 已发表的对接基准测试论文中的 ROC-AUC/EF 数值,仅用于 §4 第 1 条的对齐校验。本方向未做外部文献核查,须自行补检索
须核实项 ①诱饵基准集的当前可访问性与许可;②配对实测 ΔG 数据的可得性;③HADDOCK 网页服务的额度限制

6 · 方法路径

  1. 装环境 + 跑通已知算例 + 完成 §4 第 1 条的校验。 先做 5 个复合物的 redocking,达到 RMSD ≤ 2.0 Å 成功率 ≥ 60%,再在 2–3 个有已发表基准值的靶点上对齐 ROC-AUC。这一步不过不许继续——对接环境的配置错误(盒子位置、受体准备、电荷模型)全部不会报错,只会静默地给出一堆看似合理的分数。
  2. 核实工具的能力边界,逐一排查静默失败点。 本条的陷阱全是"不报错但给错结果"型:(a)打分函数对任何输入都给分——包括对无效构象、对盒子外的位姿,必须检查最优位姿是否真的落在结合口袋内;(b)质子化状态与互变异构体——同一个分子在 pH 7.4 下带不带电荷会改变对接分数好几个单位,而 Open Babel 的默认处理并不总是正确,必须显式设定并记录(c)受体的水分子与辅因子——留不留结晶水会显著改变结果,须预先定死并做敏感性对照;(d)对接盒子的大小与中心——盒子过大时穷尽度不足,Vina 会静默地欠采样,须用 redocking 成功率来标定盒子设置;(e)随机种子——Vina 是随机算法,同一输入多跑几次分数会变,必须记录种子并报告重复运行的分数离散度
  3. 构建并验证诱饵集。 检验诱饵与真配体在分子量、logP、可旋转键数上的分布是否确实匹配;须给出明确、可复现的匹配判据,并报告若仅用分子量就能把两者分开的判别能力(若能,基准无效,须换诱饵集)。
  4. 跑完整的对接筛选(3 靶点 × 全部分子 × 每分子 ≥ 3 个随机种子),落盘全部原始打分与位姿。
  5. 计算富集指标并给置信区间,逐靶点报告 PR-AUC、EF1%、EF5%、BEDROC 与"诱饵优于真配体中位数"的比例。
  6. 对排名前列子集做 MM/PBSA 重打分,比较重打分前后的排序指标,检验 H2;并与配对的实测 ΔG 做 Spearman/Kendall 相关。
  7. 独立交叉校验。第二种打分函数(例如把 Vina 换成另一个免费打分函数,或用 HADDOCK 对小规模子集重跑)独立计算同一批分子的排序,检查两套排序之间的相关性。若两个打分函数的排序彼此都不相关,那么任何单一函数的排序都不可信——这个结论不需要任何实验数据就能成立,是本条最稳的保底结果。

7 · 新颖性边界

本课题不声称: - 不声称发明了对接基准测试。诱饵集基准与富集因子在药物设计文献里有二十年历史,把它当成新方法会立即失去可信度。 - 不声称发现了"MM/PBSA 绝对值偏大"。这是已知的方法学事实,不是本项目的发现。 - 不声称 CELL030(2025,Grand Award)、MCRO025(2025,Grand + Special)或 MCRO013(2026,Grand + Special)的结论是错的。本课题不评价任何一个具体项目的科学价值,只量化它们共用的那个流程在标准基准上的性能——这个措辞决定了你是在建设还是在拆台。 - 不声称本基准的结论能外推到所有靶点。打分函数的性能强烈依赖靶点类型,3 个靶点的结论覆盖面必须诚实写明。

已有工作做到哪: CELL030 用反向疫苗学 + 结构建模 + in silico 对接得出"high binding affinity"结论;MCRO025 报告 MM/PBSA 平均结合能 −80 kcal/mol;MCRO013 用 HADDOCK 分数比较两个同源蛋白的底物依赖性。三者都未报告打分流程在标准基准上的富集能力。方法学层面,对接基准与 MM/PBSA 评估文献成熟。本方向未做外部文献核查,学生必须自行补一轮独立检索(重点查对接打分函数基准测试与 MM/PBSA 排序能力评估)。

本项目的贡献(属「方法可复现性贡献」型): 已有工作用打分结果支撑生物学结论;本项目量化的是在学生实际会用的软件、默认参数与笔记本算力下,这条流程的富集能力与诱饵混入率。这张"性能卡"是主结论,不是附加内容。贡献定位必须写成"在低成本、学生可及条件下的定量标定与可操作阈值",而不是"发现了一个新的方法学问题"。

为什么有价值: 本类目与相邻类目每年有大量项目以对接分数作为主要证据,而评委最常问的一句就是"你怎么知道这个分数有意义"。一张实测的性能卡把这个问题从辩论变成数据;而"20% 的诱饵打分优于真配体"这样的数字,比任何定性论述都更能说明纯对接结论的适用边界。

若结论不显著: 若实测富集能力良好(EF1% 明显高于随机、诱饵混入率低),则"学生默认参数下的对接流程具有可用的排序能力"同样是有效结论,而且是对整类计算项目的有力辩护。但必须给出误差棒证明有能力分辨这个差异,否则"没测出问题"和"没能力测"无法区分。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 4 周末,即 2026 年 9 月初):完成 §4 第 1 条的双重校验,并确认诱饵基准集与实测亲和力数据均可访问。 阈值:redocking RMSD ≤ 2.0 Å 成功率 ≥ 60%;至少 1 个靶点的 ROC-AUC 与已发表值偏差 ≤ 0.10;诱饵集与亲和力数据均已落盘。

若第 4 周末诱饵基准集不可访问,立即降级: 降级路径一——自建性质匹配诱饵集:从公开化合物库按分子量/logP/可旋转键数分层抽样,自行构造诱饵。主结论框架完全保留,但必须额外报告自建诱饵与标准诱饵集的构造差异,并承认结果不可与已发表基准直接比较。降级路径二——若配对实测 ΔG 不可得,砍掉 H2 的后半部分(MM/PBSA 与实测亲和力的相关),只保留"MM/PBSA 是否改善排序"这一支——后者只需要真配体/诱饵标签,不需要任何实测数值,主结论不受影响。

🟡 条件 2(第 10 周末,即 2026 年 10 月中):确认算力足够。 阈值:已完成至少 1 个完整靶点的全量筛选。若单靶点耗时超过两周,立即降级: 把靶点数从 3 减到 2、诱饵数从 1500 减到 800,并把 MM/PBSA 的子集从前 5% 缩到前 1%。主结论框架不变,只是覆盖面收窄,须在论文中显式声明。

⚠️ 与「附属赛后不得修改」的冲突点: 诱饵的性质匹配判据、对接盒子的定义方式、质子化状态的处理规则、以及主指标的选择(PR-AUC + EF1%)这四项,一旦在附属赛后想改就不被允许。 必须在 2026 年 11 月底前定死并写进研究计划,同时给出把主指标换成 ROC-AUC 时结论是否改变的敏感性检验。

须提前核实而非边做边发现的事项: - 诱饵基准集与亲和力数据库的当前可访问性与许可条款——这是本条唯一的单点外部依赖,必须在第 2 周内实测下载成功,而不是"看起来有"。 - HADDOCK 网页服务的提交额度,决定它只能用于小规模交叉校验还是可以承担主分析。 - 本方向未做外部文献核查,"未找到前作"不等于"不存在前作",须自行补一轮独立文献检索——这一条对本课题尤其重要,因为对接基准测试是一个成熟领域,学生的新颖性只能定位在"学生可及条件下的实测"这一层,必须提前知道,否则表述会出错。

已知困难及其定位: 最难的一环是把"学生默认参数"这句话定义清楚——什么算默认,是软件出厂设置还是常见教程里的设置?这个困难本身就是研究内容:本课题要交付的正是"参数选择这个自由度对结论的影响有多大",因此必须至少跑两套参数(出厂默认 + 一套常见教程设置)并报告差异。

选择前提: 适合有编程与命令行基础、能忍受长时间批处理、且明确接受"主结论可能是一个对现有做法的辩护(零结果)"的学生。注意学科归属风险:本条偏计算化学,必须在文书里把结论锚定到"细胞与分子生物学的靶点验证实践",否则容易被归到 CBIO(计算生物学与生物信息学)类目。这一点直接影响你在哪个类目参赛,须在报名前想清楚。 不适合需要实物展台的学生——本条展板全是图表。

预算裁剪顺序: 无金钱预算可裁(全部工具免费)。算力不足时的裁剪顺序为:先砍 MM/PBSA(H2 前半部分退化为不可检验,但 H1 与"两个打分函数排序互不相关"的保底结论仍成立);再砍第三个靶点;再砍随机种子重复数(从 3 减到 1,但须放弃对分数离散度的报告)。砍到只剩"2 靶点 × 800 诱饵 × Vina 单种子"时,H1 仍完全可检验,主结论成立。

合规与表格: - 本条是本文件合规负担最轻的一类:纯计算,零生物材料,零人类受试者,零器材。 - 家中禁止培养任何潜在危险生物制剂(规则明文点名连 BSL-1 与 C. elegans 都不行)——本条完全不涉及任何培养,因此不触发这一条,也不需要实验室与监督人。 相应地,PHBA 的 SRC 事前审批 2–6 周也完全不需要扣除,这是本条时间线优势的来源:从 2026-08 起算的 3–4 个月净窗口可以全部用于研究本身。 - 朊病毒样蛋白条款的关键区分: Aβ、tau、α-syn、TDP-43、Huntingtin 及编码这些蛋白的质粒在湿实验中全面禁止,但纯计算/结构生物信息学方向完全不受此条限制。因此本条即使选用这类蛋白作为靶点也不违规——不过为避免 SRC 环节的不必要争议,建议在选靶点时主动避开,并在研究计划中写明"本项目不涉及任何实体蛋白或质粒的获取与操作"。 - 不触碰的红线: 不涉及人类受试者(不向任何人采集样本、不向任何人反馈数据或提供建议/诊断——2027 版已删除"医生监督下可以"的豁免,一律禁止,因此不触发 Form 4 与 IRB);不涉及脊椎动物;不涉及 rDNA 与基因编辑;不得把靶点选为抗生素耐药相关机制并声称筛选耐药菌抑制剂——那会滑向抗生素耐药性条款(禁止插入抗性性状、禁止设计或筛选多重耐药菌);不涉及任何化学品实体,因此不触发 SDS 相关的致癌/致畸/生殖毒性条款。 - 表格清单(本条): Form 1、1A、1B、Form 2A(2027 新增学生支持披露表,纯计算课题也必须交)。若使用某机构的计算资源或有导师指导,加 Form 2B(Qualified Scientist,注意新增"支持时长"提问)或 Form 2C(受监管研究机构)不需要 Form 3、4、5A/5B、6A/6B、7。 - 展台禁活体、液体(含水)、土壤、玻璃——本条天然不受影响,因为没有任何实物。展台靠富集曲线(PR 曲线)、逐靶点性能卡、诱饵与真配体的打分分布重叠图、以及两种打分函数排序的散点图撑起来,是纯图表展位。 - AI 政策:不得用生成式 AI 撰写研究计划、摘要、展板或引文;批处理与统计脚本若由 AI 生成,须显式引用并保留提示词日志注意:研究 AI 或计算方法本身完全合法,本条属此类。

评分: O=8, W=9, F=9, S=7, Fit=7 → base=82.0,h=5 → [77, 87],置信度:高