C05
笔记本墙钟预算下反应能垒计算的误差-成本前沿:泛函×基组网格在 BH76 上的系统偏置可校正性判定
1 · 研究问题
在标准反应能垒基准集 BH76 的固定几何上,密度泛函(DFT)方法的"泛函 × 基组"组合构成的误差-墙钟成本前沿在纯 CPU 笔记本上落在哪里?对每个组合,其误差是系统性的(可由一个加性常数或线性标度校正掉大部分)还是随机的(校正后 MAE 几乎不降)?
2 · 研究背景与空白
反应能垒(barrier height)决定反应速率,是计算化学中最难算准也最有用的量之一;化学精度(chemical accuracy)通常定义为 1 kcal/mol。BH76 是 GMTKN55 中的能垒子集,含 76 个正逆向能垒(氢转移、重原子转移、亲核取代等),提供固定参考几何与高精度参考能垒——这一点至关重要:无需过渡态搜索或频率计算,只做单点能量,因此完全落在笔记本算力范围内。
已有工作走到哪一步:Goerigk 与 Grimme 等(PCCP 2017)在 GMTKN55 上评测 200 余个泛函并公布 BH76 上的 MAD,结论是纯 GGA 严重低估能垒(常达 8–10 kcal/mol),杂化泛函随 HF 交换比例改善,双杂化最优。这些评测统一在 def2-QZVP 量级大基组上进行,运行于工作站/集群。
空白在:小型课题组用的是 6-31G 这一级,而在这一级上"哪个泛函最准"的排名与大基组结论未必一致,且没有人以固定墙钟预算为约束报告过误差-成本前沿。更关键的是,现有评测报告 MAD,却没有系统回答"误差有多少是可由一个常数吸收的系统偏置"——若 GGA 的 −9 kcal/mol 误差高度一致,廉价方法加一个经验常数即可达到杂化泛函的实用精度。这属于换问题方向 + 换评价维度*。
3 · 可检验假设
H1 在 BH76 上,纯 GGA 泛函(如 PBE、BLYP)在 6-31G* 下的平均带符号误差(mean signed error, MSE)为负且量级 ≥ 6 kcal/mol;扣除该常数偏置后,其 MAE 下降 ≥ 50%,即误差主要是系统性的。
H2 在等墙钟时间口径下(同一时间预算内可完成的组合),基组升级(6-31G* → def2-TZVP)对能垒 MAE 的改善幅度小于泛函升级(GGA → 杂化);即在笔记本预算下,把算力花在泛函上比花在基组上更划算。若 H2 被否证,同样给出明确的、可操作的资源分配建议。
4 · 量化验收标准
- 方法学校验(硬门槛):用自建 PySCF 管线在 BH76 的全部 76 个能垒上重算至少 2 个已被 GMTKN55 评测过的泛函(如 PBE 与 B3LYP)在同一基组下的结果,与 Goerigk 等公布的 MAD 值对比,偏差 ≤ 1.0 kcal/mol(若基组不同,须先在文献所用基组上做一次对照)。此条不过关意味着几何读取、参考能定义(正/逆向、单位 kcal/mol vs Hartree)或 SCF 设置有误,后续全部误差-成本结论无效。
- 统计口径预先写死:误差指标同时报 MAE、RMSE 与 MSE(全部 kcal/mol),并报"扣除 MSE 后的残差 MAE"作为系统偏置可校正性的量化指标。所有点估计给 1,000 次自助(自助单位为反应)95% 置信区间。成本口径采用双口径:等自由度(同基组下比泛函)与等墙钟时间(同时间预算下比一切组合),两种都要报,且墙钟时间必须在同一台机器、同一线程数、连续测量三次取中位数。
- 网格规模下限:≥ 6 个泛函(覆盖 GGA / meta-GGA / 杂化 / range-separated 四类)× ≥ 3 个基组(6-31G*、def2-SVP、def2-TZVP),共 ≥ 18 个组合 × 76 个能垒。
- 收敛性检查:报告每个组合的 SCF 收敛失败率与 DFT 积分格点敏感性(至少 2 个格点等级对照,能垒变化 ≤ 0.2 kcal/mol 方认为格点收敛)。任何未收敛的算例必须显式列出,不得静默丢弃。
- 交付一张"MAE vs 单点墙钟时间"的前沿图,并在图上标出 1 kcal/mol 化学精度线与本机 1 分钟/10 分钟预算线。
- 全部输入几何、批量脚本、原始能量输出、计时日志与统计脚本开源,一条命令可重跑。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 基准几何与参考能垒 | GMTKN55 的 BH76 子集(Goerigk/Grimme 组官网提供打包下载,含笛卡尔坐标与参考能)。仅用于校验与对比,不计入本项目的数据贡献 |
| 主计算引擎 | PySCF(Apache-2.0,pip 可装,纯 Python + NumPy/BLAS 后端)。内置:HF、DFT(大量 LibXC 泛函)、密度拟合、几何优化(需配合 geomeTRIC)、解析梯度。注意:不同泛函的可用性依赖 LibXC 版本,双杂化泛函与部分 range-separated 泛函是否内置须核实;MP2/CCSD 内置但对本课题非必需 |
| 可选对照引擎 | ORCA。官方声明对学术与个人用途免费,但需注册并接受 EULA,且条款面向"学术机构"的研究/教学用途——中学生个人是否符合资格须在第 3 周前核实;不符合则完全弃用,PySCF 已足够 |
| 结构与驱动 | ASE(读写坐标、批量驱动)、geomeTRIC(若做几何优化扩展)、Python 标准库计时 |
| 算力 | 纯 CPU。参考标尺:PySCF 官方基准中苯(6 重原子,6-31G 约 102 个基函数)的 B3LYP 单点约 4 秒。按混合 DFT 约 N³–N⁴ 的经验标度外推到本课题:BH76 体系多为 ≤ 6 重原子,6-31G* 单点 秒级,def2-TZVP 单点 数十秒;18 组合 × 76 能垒(每个能垒需 3 个单点:反应物、过渡态、产物)≈ 4,000 次单点,单机 数小时至一两天,可后台分批跑。超出范围的方案(明确列出)**:过渡态搜索 + 解析频率(10 重原子以上的 Hessian 在笔记本上是数小时到数天/分子)、双杂化泛函在 def2-QZVP 下的全网格、任何 CCSD(T)/CBS 自算参考值——这三项一律不做,参考值直接取 BH76 已发布数值 |
6 · 方法路径
- 装 PySCF + ASE,跑通官方算例,下载 BH76,先用 1 个泛函 1 个基组打通"读几何 → 单点 → 组装能垒 → 对比参考"的全链路(第 1–6 周)。
- 核实工具能力边界:确认 PySCF 中目标泛函的 LibXC 名称与可用性、密度拟合是否会改变能垒(做一次开关对照)、默认积分格点等级是否足够。第 6 周前查清 ORCA 的许可资格问题,结论写进方案(可用/不可用/需核实)。
- 通过方法学校验硬门槛:复现 PBE 与 B3LYP 在 BH76 上的已发表 MAD。
- 铺开泛函 × 基组网格,批量计算并逐个记录墙钟时间(同机、同线程、三次中位数);未收敛算例单独记录。
- 做统计分析:MAE / RMSE / MSE、扣除 MSE 后的残差 MAE、按反应类型(氢转移 / 重原子转移 / 亲核取代)分层,全部给自助 95% CI。
- 绘制误差-成本前沿图(等墙钟口径)与等自由度对比表,判定 H1 与 H2。
- 独立交叉校验:随机抽 10 个能垒,用 xtb 的 GFN2-xTB 与一个未纳入网格的泛函重算,确认前沿位置与偏置方向的结论不依赖网格的具体选点。
7 · 新颖性边界
- 本课题不声称提出新泛函或新校正方案,不声称发现"GGA 低估能垒"(这是数十年的共识),不自算高精度参考值,不把 GMTKN55/BH76 数据计入学生的数据贡献。
- 已有工作具体完成了什么:Goerigk 与 Grimme 等(PCCP 2017)在 GMTKN55/BH76 上评测 200 余个泛函,统一使用大基组(def2-QZVP 量级)并运行于集群,输出为每个泛函的 MAD 排名与加权总分(WTMAD)。
- 本项目的贡献有两条且都是主结论:其一,换问题方向——把"哪个泛函最准"换成"在纯 CPU 笔记本的固定墙钟预算下误差前沿在哪",输出一张对小资源使用者可直接照做的前沿图;其二,换评价维度——把 MAD 拆成"系统偏置 + 残差",定量回答"廉价泛函加一个经验常数能不能顶用"这一从未被系统报告的问题。
- 为什么有价值:绝大多数中学与本科阶段的计算化学工作被迫在 6-31G 这一级做能垒,却只能参考大基组的泛函排名。这份前沿图直接服务于这一使用场景,且方法学层面的可复现性贡献在计算领域是被承认的*——但定位必须讲清楚,否则会被误读为重复 Goerigk 的工作。
- "差异不显著"同样是有效结论:若扣除 MSE 后残差 MAE 几乎不降,说明廉价泛函的误差本质随机、不可用常数校正,这直接否定了一条被广泛使用的民间做法。
8 · 决策门槛(go / no-go)
- 第 6 周末:方法学校验硬门槛必须通过(PBE/B3LYP 的 BH76 MAD 复现偏差 ≤ 1.0 kcal/mol)。若失败,最可能的原因是参考能定义或几何版本不匹配——降级为改用 BH76 的一个子集(如只做 19 个氢转移反应,参考值在多篇文献中被独立引用,交叉验证更容易),网格规模不变,主结论框架完全保留。
- 第 10 周末:核实本机跑完全网格所需的总墙钟时间。若外推超过 200 小时,立即降级:其一,把基组从 3 个减到 2 个(6-31G* 与 def2-SVP),去掉 def2-TZVP;其二,把能垒数从 76 减到分层抽样的 40 个(每类反应等比例抽取,抽样规则事先写定)。两条路径都保留"误差-成本前沿 + 偏置可校正性"的主结论框架。
- 第 3 周前必须查清(不要边做边发现):ORCA 的免费学术许可是否覆盖中学生个人使用。若不覆盖,方案中一切 ORCA 相关内容删除,全部改用 PySCF——本课题的设计已保证不依赖 ORCA。
- 已知困难即研究内容:SCF 不收敛在过渡态构型上时有发生。把"哪些泛函/基组组合在哪类过渡态上更容易不收敛"写成一节,本身就是对小资源使用者有价值的交付物,而不是失败。
- 预算裁剪顺序:先砍 def2-TZVP,再砍格点敏感性分析(改为只在 2 个代表组合上做),再砍反应类型分层,最后砍 xtb 交叉校验。砍到只剩"6 泛函 × 1 基组 × 76 能垒 + 前沿图 + 偏置分解"时主结论仍成立。
- 选择前提:仅在学生已理解自洽场、基组、交换关联泛函等基本概念时启动,否则先做 C01/C02 打底。