Yau Awards Archive 2020 — 2025

C02

GFN2-xTB 构象能排序在分子内氢键体系上的可靠性审计:以成对反序率与 Boltzmann 权重传播误差为判据

推荐优先级 高分族 半经验量子化学资源需求 纯 CPU,单分子秒级技能取向 命令行 + 结构文件处理 + 统计失败风险 低

1 · 研究问题

在公开构象能基准集上,GFN2-xTB(Grimme 组的自洽电荷紧束缚半经验方法)相对于高精度参考值的误差,是否随体系中分子内氢键(intramolecular hydrogen bond, IMHB)数量的增加而系统性放大?若用成对反序率(pairwise inversion rate,即被错误排序的构象对占比)而非能量 MAE 作为判据,这种放大在多大的 IMHB 数量上开始使 Boltzmann 加权系综性质失真超过 10%?

2 · 研究背景与空白

分子在室温下是按玻尔兹曼分布加权的构象系综(conformer ensemble)。任何依赖构象的性质——溶解度、光谱、对接打分、NMR 位移——都要先枚举构象再按相对能量加权,精度瓶颈几乎总在构象相对能量而非几何。全 DFT 处理数十个构象在笔记本上不现实,故半经验方法 GFN2-xTB 成为默认工具:H 到 Rn 全参数化,含多极静电与密度依赖色散,单点亚秒级。

已有工作走到哪一步:Grimme 等在 GFN2-xTB 原始论文(JCTC 2019, 15, 1652)中已用构象集(含葡萄糖、麦芽糖等强氢键体系)对照 DLPNO-CCSD(T)/CBS 参考值,结论是 GFN2-xTB "在所有统计指标上优于同类方法",并指出糖类因氢键网络众多而最难。GMTKN55 的 ACONF / SCONF / PCONF21 / MCONF 子集提供带高精度参考能的构象几何。这些工作报告的核心指标是相对能量的 MAE / RMSE 与相关系数

空白在:能量 MAE 与"排序对不对"并不是一回事——0.3 kcal/mol 的 MAE 若集中落在能量间隔更小的一批构象对上,就足以把系综中最主要的几个构象顺序完全打乱;而下游应用真正消费的是Boltzmann 权重,不是能量本身。目前公开文献很少把误差按"IMHB 数量"分层,也很少把误差传播到系综平均性质上给出可操作阈值。这属于评价维度的转换 + 参数维度分层:几何与参考能全公开、xtb 免费且笔记本秒级、结论正负都成立。

3 · 可检验假设

H1 构象相对能量的 MAE 随体系 IMHB 数量单调增大:IMHB ≥ 2 的分组 MAE 至少是 IMHB = 0 分组的 1.8 倍,差异在自助 95% 置信区间上可分辨。

H2 成对反序率与能量 MAE 不成正比:存在一组分子,其能量 MAE 处于全集中位数以下,但在 1 kcal/mol 以内的近简并构象对上反序率 > 30%,导致 Boltzmann 加权的系综平均偶极矩相对参考值偏差 > 10%。若 H2 被否证(反序率可由 MAE 单调预测),则说明现行以 MAE 为中心的报告方式已足够,这同样是有价值的负结论。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用自建管线在 GMTKN55 的 ACONF(正构烷烃构象)与 SCONF(糖类构象)子集上重算 GFN2-xTB 相对能量,与 Grimme 组已发表的 GFN2-xTB 在这两个子集上的 MAD 数值对比,偏差 ≤ 0.15 kcal/mol(每个子集至少覆盖其全部标准构象)。此条不过关说明输入几何、单位换算或收敛设置有误,后续全部结论无效
  2. 统计口径预先写死:能量误差报 MAE 与 RMSE(kcal/mol),排序误差报成对反序率与 Kendall τ;所有点估计给 1,000 次分子级自助重抽样的 95% 置信区间(自助单位是分子而非构象对,避免同一分子内构象对的相关性夸大精度)。分层比较用配对自助检验,不用 t 检验。
  3. IMHB 判据必须明确且可复现:给出 SMARTS + 几何双重判据(如 D–H···A 距离 ≤ 2.5 Å 且角度 ≥ 130°,具体数值在第 6 周前写定并冻结),并公布判据的敏感性分析(阈值 ±0.2 Å 下结论是否稳定)。
  4. 样本量下限:纳入统计的分子 ≥ 40 个、构象 ≥ 400 个;每个 IMHB 分层组内分子数 ≥ 10,否则合并分层档位。
  5. 系综性质传播误差至少覆盖 2 个可观测量(如系综平均偶极矩、系综平均回转半径),报"参考权重 vs GFN2-xTB 权重"下的相对偏差分布。
  6. 全部输入结构、xtb 命令行、后处理脚本开源,一条命令可重跑。

5 · 数据与工具

用途 来源 / 工具
基准几何与参考能 GMTKN55 数据库(Goerigk 等)子集 ACONF / SCONF / PCONF21 / MCONF,含笛卡尔坐标与高精度参考相对能(CCSD(T) 级)。官方网站可下载压缩包。仅用于校验与对比,不计入本项目的数据贡献
半经验计算 xtb(Grimme 组,LGPL,conda-forge 一条命令安装)。内置 GFN0/GFN1/GFN2-xTB 与 GFN-FF;内置几何优化、频率、GBSA/ALPB 隐式溶剂。注意:xtb 不做 DFT,若需 DFT 参考须另用 PySCF/ORCA
构象生成(扩展部分) CREST(基于 xtb 的元动力学构象搜索)——安装与可用性需核实;降级方案为 RDKit ETKDG + xtb 优化去重
后处理 Python + ASE(读写结构、批量驱动 xtb)、NumPy/SciPy、RDKit(SMARTS 匹配 IMHB)
算力 纯 CPU。GFN2-xTB 单点:30–60 原子分子在单核上 亚秒级;几何优化 10–60 秒;数百原子体系仍在分钟级。400 个构象的全量优化 + 单点,单机数小时。CREST 元动力学搜索对 30 原子分子约 10–60 分钟/分子(需本机实测),是唯一可能超预算的步骤,故列为可选扩展

6 · 方法路径

  1. 装 xtb 与 ASE,跑通 xtb 自带算例,下载 GMTKN55 子集,完成 ACONF/SCONF 的方法学校验硬门槛(第 1–5 周)。
  2. 核实工具能力边界:确认 xtb 的相对能量是否需统一到同一收敛阈值(--opt tight vs 默认)、是否需要 --gfn 2 显式指定、单位是否为 Hartree;确认 CREST 在本机可安装并测得单分子墙钟时间。不确定项在第 8 周前查清。
  3. 写定 IMHB 判据(SMARTS + 几何双阈值)并冻结,对全部构象打标签,公布判据代码。
  4. 批量跑 GFN2-xTB 单点与优化,构建"参考相对能 vs GFN2 相对能"配对表;按 IMHB 数量分层统计 MAE、反序率、Kendall τ。
  5. 把两套相对能分别转为 298 K Boltzmann 权重,计算系综平均偶极矩与回转半径,报相对偏差分布与"权重失真开始超过 10%"的 IMHB 阈值。
  6. 做判据敏感性分析(IMHB 几何阈值 ±0.2 Å / ±10°)与方法敏感性分析(GFN1-xTB、GFN-FF 各重跑一遍作为对照)。
  7. 独立交叉校验:对随机抽取的 10 个分子,用 PySCF 在 B3LYP-D3/6-31G* 水平重算相对能(每分子小时级,仅作抽样校验),确认分层结论方向一致。

7 · 新颖性边界

  • 本课题声称改进 GFN2-xTB,声称发现该方法的新失效机制,把"GFN2-xTB 对氢键体系更困难"这一 Grimme 原文已明确指出的定性结论声称为本项目发现。
  • 已有工作具体完成了什么:Grimme 等(JCTC 2019)在多个构象集上以 DLPNO-CCSD(T)/CBS 为参考评测 GFN2-xTB,报告聚合的 MAD 并定性指出糖类氢键体系最难;GMTKN55(Goerigk 等 2017)提供标准化的构象子集与参考能,社区惯例是报子集级 MAD。
  • 本项目的贡献是评价维度的转换且构成主结论:把判据从"能量 MAE"换成"成对反序率 + Boltzmann 权重传播到系综可观测量的失真幅度",并按可复现的 IMHB 计数判据分层,给出一条可操作阈值——"IMHB 数量超过 N 时,GFN2-xTB 权重不再足以支撑系综平均性质的 10% 精度要求"。
  • 为什么有价值:下游使用者(对接、光谱、溶剂化计算)真正需要知道的是"什么时候不能只用 xTB",而现有文献给的是聚合 MAD,无法直接回答这个问题。
  • "差异不显著"同样是有效结论:若分层后 MAE 与反序率均无系统趋势,说明 GFN2-xTB 对氢键体系的额外风险被高估了——但必须给出误差棒证明本研究能分辨 1.8 倍的 MAE 比值。

8 · 决策门槛(go / no-go)

  • 第 5 周末:ACONF/SCONF 复现偏差必须 ≤ 0.15 kcal/mol。若失败,先核对参考能的定义(相对最低能构象 vs 相对首个构象)与几何是否被重新优化;仍失败则降级为"只做单一子集 SCONF 的深度分析",样本量下降但反序率 + 权重传播的主结论框架完全保留。
  • 第 10 周末:确认可用构象总数与 IMHB 分层后每组分子数。若 IMHB ≥ 2 组的分子数 < 10,立即降级:其一,纳入 PCONF21(多肽构象,氢键丰富)与 MCONF(黑色素前体)扩充样本;其二,把分层轴从"IMHB 计数"改为"氢键供体+受体总数"这一连续变量,改做回归而非分组对比。两条路径都保留主结论框架。
  • 第 16 周末:若 CREST 在本机的单分子墙钟时间 > 2 小时,放弃自建构象系综,全部转用 GMTKN55 提供的既有几何。这不影响主结论(主结论建立在既有基准几何上),只是失去"自建系综"的扩展章节。
  • 已知困难即研究内容:IMHB 的定义本身没有唯一标准,不同阈值会给出不同计数。这不是障碍——判据敏感性分析本身就是本项目的一部分交付物,且是评委容易认可的严谨性证据。
  • 预算裁剪顺序:先砍 CREST 构象搜索扩展,再砍 GFN1/GFN-FF 对照,再砍 PySCF 抽样交叉校验(改为引用文献值),最后砍第二个系综可观测量。砍到只剩"GMTKN55 两子集 + 反序率 + 单一系综性质"时主结论仍成立。