ISEF Topic Scoping 2027

G774–92

优化器是不是在钻代理模型的空子:翼型遗传优化结果的高保真复核

推荐优先级:高 · 族 A(纯计算 / 公开数据)/参赛子类:Energy — Sustainable Materials and Design · 资源需求:一台笔记本,零器材成本,无采购周期 · 技能取向:机器学习 / 数值气动 / 实验设计

1 · 研究问题

用 XGBoost 之类的代理模型(surrogate model)当适应度函数去跑遗传优化,最终胜出的翼型是真的气动更好,还是恰好落在代理模型误差最大的那片区域?把优化轨迹上的每一代最优个体都送回高保真求解器复算,"升阻比提升近三倍"还剩多少?

2 · 研究背景与空白

背景。 翼型气动优化的标准流程是:用 CST(Class Shape Transformation)之类的参数化方法把翼型形状压缩成十几个数,再用遗传算法(Genetic Algorithm, GA)在这个参数空间里搜索。问题在于,每评估一个候选个体都要跑一次流场求解,代价高,所以人们用一个便宜的回归模型(代理模型)来预测适应度。这里潜伏着一个机器学习圈已经命名的失效模式:代理利用(surrogate exploitation)——优化器并不知道代理模型在哪里可信,它只会朝"代理预测值最高"的方向走,而代理预测值最高的地方恰恰经常是训练数据最稀疏、误差最大的地方。换句话说,优化器会系统性地把自己送进代理模型的外推盲区,然后报告一个漂亮但不存在的提升。

已有工作到哪一步。 EGSD011(2026, Grand Award, "Optimization of Wind Turbine Performance") 对 IEA 15 MW 海上风机叶片的 50 个二维翼型截面逐个优化,"Airfoils are optimized using a surrogate-assisted genetic algorithm (SGA) with Class Shape Transformation (CST) parameterization. Performance is evaluated using an XGBoost-based fitness function",结果 "One airfoil, the FFA-W3-211, achieved a lift-to-drag ratio nearly three times greater than the original",并外推到 "approximately 2,236 MWh in additional annual energy per turbine""$68.8 million in additional annual revenue"摘要里没有给出 XGBoost 的验证误差,也没有说明优化后的翼型是否用高保真方法复核过——而"L/D 提升近三倍"对一个已经被工业界优化过的 FFA 系列翼型来说是一个需要解释的数字。另可查 2022 EGSD043(波浪能的 ML+RL 优化,Fourth Award)。本赛道的整体证据背景同样成立:两届 35 篇获奖摘要中 sensitivity analys 出现 0 次、uncertaint 出现 0 次;error barsensitivity analys 在同两届四个工程赛道 173 个获奖项目中合计 0 次

空白在于:中学生能源优化项目里,从来没有人检验过"代理模型被优化器利用了多少"。这个空白特别适合一年期学生课题:它零采购、零合规风险、纯计算,全部跑在普通笔记本的 CPU 上;数据用完全公开的翼型库;而且结论正负都成立——测到偏差随代数放大是结果,测不到则给出一条"什么条件下代理辅助优化是可信的"的适用域边界,同样有价值。更关键的是,它把课题定位成方法学而非工程复现,从而完全绕开"我没有 15 MW 风机的真实数据"这个死结。

3 · 可检验假设

H1 遗传算法终代最优个体的"代理预测 L/D"与"高保真复核 L/D"之间的相对偏差 ≥ 代理模型留出集 RMSE 的 3 倍,且该偏差随代数单调增长。

数值依据的推算过程:留出集 RMSE 是代理模型在训练分布内的平均误差;而 GA 每代从 N 个候选中主动挑出代理预测值最大的那个,这是一个极值统计问题——在 N 个近似独立的高斯误差样本中取最大值,其期望偏移约为 RMSE × √(2 ln N)。取常见种群规模 N = 100,√(2 ln 100) ≈ 3.03。因此"3 倍 RMSE"不是随手取的阈值,而是"即使代理模型完全无偏、误差纯随机"时也必然出现的选择偏差下界;实测若显著超过它,说明还叠加了真实的外推失效。

H2(机制假设,H1 被否证时仍有内容)若偏差不随代数放大,则误差的主导来源不是代理外推,而是 CST 参数化在设计空间边界处产生的几何退化(自交、局部厚度为负、前缘曲率发散)——判据是:把几何合法性检查判定为不可行的个体全部剔除后,代理—高保真偏差应显著收缩。这条假设独立于 H1,且它指向一个完全不同的修补动作(约束参数空间而非主动学习),因此 H1 被否证时本课题仍有完整交付物。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 用高保真求解器复现一个已发表算例:对一个有公开气动数据的标准翼型,在指定雷诺数与马赫数下计算升力系数—攻角曲线与阻力极曲线,与已发表值的偏差 ≤ 5%(线性段升力线斜率)与 ≤ 15%(最小阻力系数)。所选算例的参考数据出处、雷诺数区间、以及原文是否报告不确定度,全部需核实——不得引用任何未经查证的数字。跑不出这个算例就不许往下做:如果"高保真"这一端本身不准,整个"复核"的概念就不成立。
  2. 必须报告优化前后的同口径对比,逐个最优解。 交付一张主表,每一行是一个精英个体(覆盖每一代,不是只有最终那一个),列为:代数、代理预测 L/D、高保真复核 L/D、相对偏差、几何是否合法。另外必须并列报告两个"提升":(a)代理声称的提升 = 代理预测 L/D ÷ 基线翼型代理预测 L/D;(b)真实提升 = 高保真复核 L/D ÷ 同一求解器算出的基线翼型 L/D。基线必须用同一求解器重算,不得用文献值当分母——那会把求解器偏差整个记进"提升"里,是本类比较最常见的隐蔽错误。
  3. 统计口径预先写死,且必须区分两个 n。 独立重复运行 GA ≥ 10 次(不同随机种子),每次运行 ≥ 50 代"同一次运行内的不同代"与"不同随机种子的独立运行"不是一回事:前者高度自相关,把 10 次 × 50 代当作 n = 500 是伪重复。所有偏差统计必须以"运行"为独立单位,报告种子间的均值与标准差;代际趋势只在运行内部拟合,再对 10 条斜率做检验。
  4. 代理模型的训练与评估口径冻结。 训练/留出划分方式、特征、超参数在开题时写死并写入研究计划;报告留出集 RMSE 与 R²;另做一次覆盖度分析:判断每个优化解落在训练集参数分布的凸包内还是外,报告"外推解占比"随代数的变化——这是 H1 的机制证据。
  5. 求解器收敛失败率必须报告。 逐代记录高保真求解不收敛的个体比例及其处理方式(丢弃 / 惩罚 / 重试)。不收敛个体被静默丢弃会系统性偏袒"好算"的几何,从而人为压低偏差,这是本课题最容易自我污染的一环。
  6. 主动学习修补的量化。 每 K 代注入 M 个高保真样本重训代理,报告"挽回的偏差比例",并给出 K、M 与计算预算的权衡曲线。这条是本课题的正向产出,不只是批评。
  7. 可复现性。 GA 代码、代理训练代码、几何合法性检查、求解器调用脚本、全部原始结果表与随机种子清单开源,第三方一键重跑。若任何代码由生成式 AI 辅助生成,必须显式引用并保留完整提示词日志——这是 ISEF 的明文要求。

5 · 数据与工具

用途 来源 / 工具
翼型几何与气动数据 公开翼型数据库(源文件指定为 UIUC 翼型数据库)。其分发条款与数据完整性需核实
高保真求解器 XFOIL(黏性—无黏耦合面元法,开源)。必须核实其适用边界:对厚翼型、大攻角、分离主导工况精度显著下降,且转捩判据参数(Ncrit)的取值直接改变 L/D,默认值与文献常用值是否一致需核实
可选的第二求解器(交叉校验用) 开源 RANS 求解器抽查若干个体。具体软件、版本与网格无关性验证方案需核实,本文件不指定
代理模型 XGBoost(与被对标项目同族),配 scikit-learn 做划分与评估。均为开源、零成本
遗传算法 开源 GA 库或自写。CST 参数化自实现,须附几何合法性检查(自交、负厚度、前缘曲率)
算力 普通笔记本 CPU。实际核心小时数须自己实测并报告,不得沿用他人数字
对照基准(仅用于校验与对比,不计入本项目的数据贡献 EGSD011 的 "nearly three times greater" L/D 提升、"approximately 2,236 MWh""$68.8 million";FFA-W3-211 原始几何(若取自 IEA 15 MW 参考风机公开文档,其文件位置与分发条款需核实

能力边界须核实项: ① XFOIL 在本课题所选雷诺数与翼型厚度下的可信区间——这是整个课题的地基,如果"高保真"这一端不可信,复核就没有意义;② Ncrit 等转捩参数的取值依据;③ 所选公开算例的实验数据出处与其自身不确定度;④ 本课题的检索基于本地五届语料、未做外部文献核查,"中学生项目里没人做过"不等于学术文献里没做过——surrogate exploitation 在优化与机器学习文献中是已知现象,开题前必须自己补检索,并在第 7 块明确"不声称首次发现该现象"。

6 · 方法路径

  1. 装环境 + 跑通已发表算例。 固定 Python 与求解器版本,复现标准翼型的公开极曲线至 §4 第 1 条的阈值。这一步不过不许继续。
  2. 核实工具能力边界。 逐条验证以下静默失败点(不报错但给错结果):(a)求解器不收敛却返回上一次的结果或一个默认值——必须逐次检查收敛标志,不能只看有没有抛异常;(b)CST 参数化生成自交或负厚度的几何,求解器照样给出一个数,而那个数毫无物理意义;(c)优化解落在训练集分布之外,代理照常输出预测值,没有任何外推警告;(d)转捩参数 Ncrit 的默认值与文献算例不一致,导致 L/D 系统性偏移几个百分点,而两边的曲线看起来都很正常;(e)适应度定义口径不同——用"极曲线上的 L/D 峰值"还是"指定设计攻角处的 L/D",两者可以差出几十个百分点,比较时必须口径一致。
  3. 训练代理模型并冻结,报告留出集 RMSE 与 R²,做训练集参数分布的覆盖度刻画。
  4. 跑满 ≥ 10 个随机种子 × ≥ 50 代的 GA,完整保存每代精英个体的几何与代理预测值。
  5. 对全部精英个体做高保真复核,画"代理预测 vs 高保真"的漂移曲线(横轴代数、纵轴相对偏差),并叠上"外推解占比"曲线——这是 H1 的主图。同时输出 §4 第 2 条的同口径对比主表。
  6. 做主动学习修补实验,扫 K 与 M 的组合,量化能挽回多少偏差,给出成本—收益曲线。
  7. 独立交叉校验。 用另一种原理的求解器(开源 RANS)复核每次运行的前若干名个体,验证观察到的偏差是"代理相对真实"的偏差,而不是 XFOIL 自身在这片几何区域的系统偏差。两条求解链若在同一批几何上系统性不一致,必须如实报告并把它写成本课题的一条限制,而不是选一条好看的。

7 · 新颖性边界

本课题不声称: - 不声称首次提出代理辅助优化。这是优化领域的成熟做法,EGSD011(2026, Grand Award)本身就在用。 - 不声称首次发现 surrogate exploitation。 该现象在机器学习与优化文献中已有名称与研究,本课题只是把它搬到一个从未被检验过的应用场景里。开题前须自己补检索并在正文中引用原始来源。 - 不声称复现或反驳 EGSD011 的工业算例。本课题明确不去做 IEA 15 MW 的工程复现——没有那份真实数据,任何"复现"都是假的。 - 不声称提出更好的翼型。本课题产出的所有优化解都只是研究对象,不作为设计推荐。 - 不声称 XFOIL 是"真值"。它只是一条独立于代理模型的、可被第三方重跑的参考链路,其自身偏差在第 6 步交叉校验中被检验并如实报告。

已有工作做到哪: EGSD011 用 XGBoost 适应度 + CST 参数化 + 遗传算法优化了 50 个截面,报出 L/D 近三倍的提升与年发电量、年收益的外推,但未报告代理模型验证误差,也未说明是否做过高保真复核。这就是缝隙所在。

本项目的贡献(属「评价维度转换」型): 已有工作评估的是优化能带来多少提升;本项目评估的是这个提升里有多少是优化器钻代理模型空子钻出来的,并给出一条"偏差随代数放大"的定量曲线与一个可直接复用的修补方案(主动学习注入频率与成本的权衡)。这是主结论,不是附加内容。

必须主动写进讨论的混淆源: 若代理—高保真偏差不随代数放大,也可能只是因为本课题的训练集覆盖足够密(设计空间维度低),而不是 surrogate exploitation 不存在。必须报告设计空间维度与训练样本数的比值,并在讨论中说明结论的适用范围。这是评委最容易追问的一点,主动处理远好过被问出来。

为什么有价值: 一个"L/D 提升近三倍"的数字被直接外推成 2,236 MWh 与 6,880 万美元的年收益——如果那个提升有相当部分是代理模型的外推幻觉,整条外推链就塌了。而检验这件事的成本是零:一台笔记本、公开数据、开源求解器。这个不对称性本身就是本课题的价值。

若结论不显著: 若偏差不超过 3 倍 RMSE、也不随代数放大,主结论改为"在本课题的设计空间与训练密度下,代理辅助优化的结果可信,其适用边界是 X"——这同样是有效结论,但必须给出误差棒证明有能力分辨预期量级的偏差,否则等于没做。

8 · 决策门槛(go / no-go)

🟢 2026-08-25(第 3 周末):高保真求解器复现已发表算例通过。 若在目标雷诺数下无法复现公开数据到 §4 第 1 条的阈值,不得继续跑优化降级路径:把工作雷诺数降到该求解器已被广泛验证的低速区间(模型飞机翼型量级),换一套相应的公开算例重新标定。主结论框架"优化器钻代理空子的程度有多大"完全保留,只是研究对象从大型风机翼型换成低雷诺数翼型——本课题本来就是方法学定位,这个替换不改变任何一个可交付物。

🟡 2026-09-28(第 8 周末):≥ 10 个随机种子的 GA 全部跑完,全部精英个体的高保真复核完成。 若单次高保真复核耗时超出预期导致跑不满,降级路径:把复核对象从"每代精英"收缩为"每 5 代的精英 + 终代全部前 10 名",代际漂移曲线的分辨率下降但趋势判据不变;同时在正文中明确 log 出被裁掉的部分,不得让缩减后的采样看起来像全覆盖。

🟢 2026-10-12(第 10 周末):主动学习修补实验完成,主图定稿。

2026-12-15:数据采集截止,留 3 周分析与展板。

⚠️ 与「附属赛后不得修改」的冲突点: ① 适应度函数的口径(L/D 峰值 vs 设计点 L/D);② 训练/留出划分方式与代理超参数;③ 随机种子清单;④ 几何合法性检查的判据。这四项一旦在附属赛后想改就不被允许。必须在 2026 年 11 月底前全部定死并写进研究计划。 特别是随机种子清单:事后增删种子等价于挑选有利结果,是选择性报告,评审对此极敏感。

须提前核实而非边做边发现的事项: - 求解器的适用边界(厚翼型、大攻角、Ncrit 取值)。这是地基,第 1 周就要查清楚,不能等到跑完 10 个种子才发现"高保真"这一端本身不可信。 - surrogate exploitation 的既有文献。本课题必须在第 7 块明确不声称首次发现该现象,因此开题前必须找到并引用原始来源;找不到就不能这么写。 - 公开翼型库与参考风机文档的分发条款,避免使用受限数据。 - 本文件的证据基础是本地五届语料、未做外部文献核查,"未找到前作"不等于不存在前作

已知困难及其定位: 本课题最难的一点是"如何证明高保真那一端可信"。这个困难本身就是研究内容——它逼出了第 1 步的已发表算例复现和第 7 步的双求解器交叉校验,而这两件事恰恰是本赛道 35 篇获奖摘要里一次都没出现过的动作(calibrat 出现 0 次)。

采购与合规: 零采购、零合规风险,无 SRC 事前审批需求,仅需常规 Form 3。 无任何超过 4 周的采购项,本条不受采购周期约束——这是本文件里可行性最高的一条。AI 政策:不得用生成式 AI 撰写研究计划、摘要、展板或引文;AI 生成的代码须显式引用并保留提示词日志。研究方法本身涉及机器学习完全合法。

选择前提: 适合已具备 Python 与机器学习基础、能读懂极值统计论证的学生。不适合把"跑通别人的优化代码"当作研究的学生——本课题的全部价值在于受控对比的设计(同口径基线、独立种子、代际漂移),代码本身是现成的。

预算裁剪顺序: 无预算可裁(零成本)。时间不足时的裁剪顺序:先砍步骤 7(RANS 交叉校验),再砍步骤 6(主动学习修补),最后把种子数从 10 降到 5 并如实报告功效损失。砍到最后主结论"代理预测与高保真复核的偏差有多大、是否随代数放大"仍然成立。

🔴 展台能否展示实物:本课题没有实物,展板全是图表。 可选做法是把若干优化翼型截面 3D 打印成塑料剖面模型带上展位(非液体、非粉末、非化学品,合规),但它只是装饰——本课题的说服力 100% 由代际漂移曲线与同口径对比表承担。不接受"展板全是图"的学生不适合这条课题。 反过来说,本赛道 35 项获奖里至少 22 项的核心实物依规不能上展台,纯计算类课题在这条规则下不吃亏

评分: O=9, W=8, F=8, S=8, Fit=8 → base=83.2,h=9 → [74, 92],置信度:中