ISEF Topic Scoping 2027

M659–77

换一个生长模型,"致病株更耐热"这个结论还在吗

推荐优先级:备选 · 参赛子类:Microbiology — Bacteriology(纯计算版可考虑 Microbial Genetics) · 资源需求:可做成零器材纯计算版;自测版需学校实验室 + 酶标仪 + 恒温梯度 · 技能取向:非线性拟合 / 模型选择 / 敏感性分析

1 · 研究问题

用逻辑斯蒂(logistic)模型从同一批生长曲线拟合出的承载力与生长速率,换成 Gompertz、Baranyi 或 Ratkowsky 平方根模型后会变多少?更进一步:16 小时这个单一终点落在指数期还是稳定期,对"某组长得更好"这一结论的方向与显著性有什么影响?

2 · 研究背景与空白

背景。 细菌在一份有限的培养基里生长,画出来是一条 S 形曲线:先是几乎不长的迟滞期(lag),然后进入指数期快速倍增,最后因为营养耗尽或代谢产物累积而进入平台(稳定期)。要把这条曲线变成几个可比较的数字,就得拟合一个模型。问题是可选的模型不止一个,而它们对同一批数据给出的参数并不相同。 逻辑斯蒂模型假定曲线关于拐点对称;Gompertz 模型允许不对称(上升快、封顶慢),这更贴近多数实测曲线;Baranyi 模型专门为食品微生物学设计,把迟滞期显式建模成"细胞需要先适应";而温度与生长速率的关系有它自己的经典模型——Ratkowsky 平方根模型,它说的是"生长速率的平方根对温度近似线性",即用普通线性回归直接拟合速率对温度,在生物学上是有偏的。还有一层更基本的问题:如果只在某个固定时刻(比如 16 小时)读一次 OD,那么"A 组读数比 B 组高"可能意味着 A 长得快,也可能意味着 A 的迟滞期短、或 B 已经进入稳定期而 A 还没到——单个终点无法区分这三种情况。

已有工作到哪一步。 MCRO045(2026,Grand Award) 摘要原文:"Thirteen representative strains were incubated in triplicate for 16 h across a 15–35 °C gradient to quantify thermal growth responses. Growth was analyzed using linear regression and linear mixed-effects models"——用线性模型描述温度-生长关系,而微生物生长速率对温度的经典关系是 Ratkowsky 平方根模型(非线性),且 16 小时的单一终点无法区分"生长更快"与"进入稳定期更晚"。 另一条同样依赖模型选择的:CELL043(2026,Special Award,"Prokaryotic IF1,2,3 Overexpression Under Stress") 摘要原文:"Logistic models were fit to growth curves to estimate carrying capacity, intrinsic growth rate, and inflection time, with residual sum of squares used to assess goodness of fit"——只用一个模型 + RSS 判定拟合优度,没有与其他模型比较。

空白在于:微生物生长模型的比较在食品微生物学文献里是成熟话题,但没有人以"学生项目实际会得到的那种数据"为条件——重复数少、时间分辨率粗、终点单一——系统检验过"换模型会不会翻转结论"。这个空白适合一年期学生课题的三个理由:(1)可做成完全零器材的纯计算版,用公开生长曲线数据集,从而绕开实验室门槛;(2)自测版用面包酵母(规则豁免类),世代快,一天能跑完一条完整曲线,3–4 个月能跑很多轮;(3)结论正负都成立——结论随模型翻转,说明这类项目必须报告模型选择;不翻转,则说明模型选择在这个精度下不重要,同样是可用的判据。但必须诚实说明:这是本文件里新颖性最弱的一条(O=6),它的价值在可辩护性而非原创性。

3 · 可检验假设

H1 在学生规模的数据条件下(每组 3 个重复、时间点间隔 ≥ 30 min),四种模型给出的最大生长速率 μ_max 估计值的跨模型极差 ≥ 30%(相对于其均值),且承载力 K 的跨模型极差 ≥ 15%

H2(机制假设,H1 被否证时仍有内容)参数估计虽随模型变化,但核心结论(组间差异的方向与显著性)是稳健的:在 ≥ 90% 的组间比较中,四种模型给出同向且同显著性判定的结果。若 H2 成立,本课题的结论是"放心用你顺手的模型";若 H2 被否证,结论是"必须报告模型敏感性"。两者都是有用的答案。

H3(附加,针对终点法)以单一时点 OD(如 16 h)比较组间差异,与用拟合的 μ_max 比较,在 ≥ 20% 的比较中给出不一致的排序——即终点法与曲线法不等价。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关不许往下做,后续全部结论无效)。 合成数据回收检验:用已知参数生成模拟生长曲线(指定 μ_max、K、lag),注入已知幅度的噪声,再用自己的拟合流程回收参数,要求回收值与真值的相对偏差 ≤ 5%(无噪声时)、≤ 15%(典型噪声时)拟合器连自己造的数据都回收不准,就不许拿去拟合真实数据——不过关不许往下做,后续全部结论无效。 同时须验证优化器的初值敏感性:同一条曲线用 ≥ 5 组不同初值拟合,收敛到同一组参数(相对差 ≤ 1%)才算通过——非线性拟合最常见的静默失败就是落进局部极小而不报错。
  2. 统计口径预先写死。(a)生物学重复 = 独立单菌落起始、不同日制备的独立培养物;技术重复 = 同一培养物分到多个孔。n 只数生物学重复,n ≥ 5(自测版)。若使用公开数据集,必须逐个数据集核实其"重复"属于哪一类,核实不了的一律按技术重复处理并在局限性中声明。(b)模型比较用 AIC/BIC,并且必须同时报告——两者常给出不同答案,只报一个是挑对自己有利的。 另须报告残差图(残差 vs 拟合值、残差自相关),因为生长曲线的残差通常自相关,此时 AIC 的可比性会打折,这一点必须在正文中说明而不是回避。(c)参数估计的不确定度用 bootstrap(≥ 2000 次残差重抽样)给 95% 置信区间,不报单点值。(d)H2 的"结论是否翻转"必须有预先定义的判据:方向一致 + 显著性判定一致(α = 0.05)才算不翻转;这个判据必须在看数据之前写死。(e)温度—速率关系必须同时用线性回归与 Ratkowsky 平方根模型拟合并对比,报告两者对"最适温度"与"组间差异"的不同答案。
  3. 模型数量 = 4(logistic、Gompertz、Baranyi、Ratkowsky 平方根,后者用于温度—速率关系而非曲线本身);曲线数 ≥ 40 条(自测版:≥ 4 组条件 × ≥ 5 生物学重复 × ≥ 2 轮;纯计算版:从公开数据集取 ≥ 100 条并说明抽取规则)。
  4. 时间分辨率的敏感性扫描:把高分辨率曲线人为降采样到每 30 min / 1 h / 2 h / 只留 16 h 单点,各自重拟合,给出"参数估计精度随采样间隔劣化"的曲线。这条曲线直接回答'16 小时单点够不够',是本课题最有操作价值的产出。
  5. 可复现性。 全部原始 OD 时序(含仪器型号、波长、孔板布局)、合成数据生成器、拟合与统计脚本、公开数据集的下载脚本与版本快照全部开源存档,第三方可一键重跑得到同样的参数与 AIC/BIC 表。

5 · 数据与工具

用途 来源 / 工具
纯计算版:公开生长曲线数据 微生物生长动力学的公开数据库与已发表论文的附件数据(含原始 OD 时间序列)。具体数据库名称、覆盖范围、许可条款与是否含逐孔原始读数——需核实。绝不许把"我知道有这样的数据库"当作确定事实写进方案。
自测版:产生曲线的生物 面包酵母 Saccharomyces cerevisiae(发酵用,非 rDNA),规则明文列入 PHBA 事前审查豁免清单;或 E. coli K-12(在学校进行)具体菌株与是否在 2027 豁免清单内——需核实
培养与读数 96 孔板 + 酶标仪动力学读数模式(每 15–30 min 读一次 OD₆₀₀,恒温)。若酶标仪无恒温或动力学功能,退到试管 + 恒温水浴 + 定时手动取样读 OD——分辨率降低但仍可做,见 §8 条件 2
温度梯度 多台恒温水浴/恒温箱,或酶标仪自带温控。各温度点的实际温度须用独立温度计实测记录,不许只信旋钮——温度是本课题的核心自变量
拟合与统计 Python(scipy.optimizelmfitstatsmodels)或 R(growthcurvernlsMicrobiobiogrowth 等生长曲线拟合包)。具体包名与其维护状态——需核实。纯 CPU,笔记本即可
对照基准(仅用于校验与对比,不计入本项目的数据贡献 MCRO045(2026,Grand Award)的 16 h 终点 + 线性/线性混合效应模型做法;CELL043(2026,Special Award)的 logistic + RSS 做法。两者仅作为"被检验的分析方案"引用,本项目不重新分析它们的数据(也拿不到)
须核实项 ① 公开生长曲线数据集的具体名称、内容与许可(这一条决定纯计算版是否可行,必须在 8 月内查清);② 学校酶标仪是否支持恒温动力学读数;③ 面包酵母/K-12 在 2027 豁免清单内的确切措辞;④ 所选拟合包的模型实现是否与经典文献一致(不同包对 Baranyi 的参数化不同,必须核实并写明采用哪一种

6 · 方法路径

  1. 装环境 + 跑通已知对照 + 完成 §4 第 1 条的校验。 实现四种模型的拟合器,用合成数据做参数回收检验与初值敏感性检验。这一步不过不许继续——拟合器不可靠,后面比较的就是自己代码的差异而不是模型的差异。这一步完全不需要生物材料,可在任何审批等待期内完成。
  2. 确定数据来源并落盘。 纯计算版:下载公开数据集、冻结快照、记录版本与日期;自测版:完成培养体系与酶标仪参数的固化。
  3. 核实工具与生物材料的能力边界。 本方向已知的静默失败点,逐一验证并写进记录本:(a)OD 读数受颗粒/沉淀/絮凝散射干扰而不再代表菌浓度——酵母尤其容易沉降与出芽成团,必须在方法中写死振荡方案,并做一次"振荡 vs 静置"的对照;(b)活菌与死菌在 OD 上不可分——稳定期后 OD 不降不代表菌还活着,承载力 K 的生物学解读必须谨慎,最好用一次平板计数在稳定期做锚定;(c)OD 的线性上限——高密度时多重散射使 OD 饱和,曲线的平台可能是仪器的平台而不是细菌的平台,这是本课题最危险的静默失败,必须先测出线性上限并在超出时稀释后读数;(d)培养基批次效应——换批次会改变承载力,须重跑内部对照;(e)孔板边缘效应——外圈孔蒸发快、温度不均,必须弃用外圈或做位置随机化并检验位置效应;(f)非线性拟合落入局部极小而不报错——见 §4 第 1 条的初值敏感性检验。
  4. 产出/收集 ≥ 40 条(自测)或 ≥ 100 条(计算)生长曲线,覆盖至少 4 组条件(温度梯度或菌株差异)。
  5. 四模型并行拟合并做敏感性分析。 逐曲线拟合四种模型,报告参数、AIC/BIC、残差诊断;逐组间比较检验结论是否翻转(判据见 §4 第 2 条 d)。
  6. 做降采样扫描与终点法对照。 回答"16 小时单点能不能替代整条曲线",输出参数精度随采样间隔劣化的曲线。
  7. 独立交叉校验(用另一种方法算同一个量)。不依赖任何模型的非参数估计——例如在 log(OD) 时序上做滑动窗口线性回归取最大斜率作为 μ_max,以及直接取平台段读数均值作为 K——与四种模型的估计对照。若非参数估计落在四个模型估计的范围内,说明模型差异是"参数化选择"造成的;若落在外面,说明所有模型都在系统性偏移,那是更重要的发现。

7 · 新颖性边界

本课题不声称: - 不声称提出新的生长模型。四种模型全部是既有的经典模型,本项目一个都不改。 - 不声称首次比较微生物生长模型。这在食品微生物学与预测微生物学文献里是成熟话题,前作必然大量存在——这是本条课题最大的弱点,必须在文书中主动、清楚地承认。 - 不声称 MCRO045(2026,Grand Award)CELL043(2026,Special Award) 的结论错误。本项目没有它们的原始数据,也不重新分析它们的数据;只指出它们的分析方案含有一个未被评估的自由度。 - 不做任何抗菌、耐药或治疗相关的声称。

已有工作做到哪: MCRO045 用 16 h 单一终点、跨 15–35 °C 梯度、三重复测 13 株代表菌的热生长响应,以线性回归与线性混合效应模型分析;CELL043 用 logistic 模型拟合生长曲线估计承载力、内禀生长速率与拐点时间,以残差平方和判定拟合优度,未与其他模型比较。预测微生物学领域已有大量模型比较文献。

本项目的贡献(属「方法可复现性贡献」型): 已有文献比较的是模型对高质量数据的拟合优度;本项目评估的是在学生项目实际的数据条件下(少重复、粗分辨率、单终点),模型选择这一自由度会不会改变结论的方向,并给出一份"什么时候必须报告模型敏感性、什么时候不必"的判据。这类贡献在计算与统计方法领域是被承认的,但定位必须讲清楚,否则会被误读为重复工作——这是本条课题最需要小心的地方。

为什么有价值: 生长曲线是中学生微生物项目最常见的产出,而模型选择几乎从不被报告。若结论确实随模型翻转,这一整类项目需要增加一行敏感性分析;若不翻转,学生可以停止焦虑。两个答案都能省下很多人的时间。

若结论不显著: 若参数估计跨模型差异很小、结论也不翻转(H1 与 H2 都指向"模型选择不重要"),这同样是有效结论——它给出"在这个精度下随便选"的许可;但必须给出误差棒(参数的 bootstrap 置信区间)证明有能力分辨"极差 10%"与"极差 30%"这个差异,否则等于没做。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 4 周末,2026 年 9 月初):确认公开生长曲线数据集是否存在且可用(含逐孔原始 OD 时序、许可允许再分析)。 若 9 月初确认不存在可用的公开数据集,立即降级为自测版:面包酵母自测生长曲线(豁免类、世代快、一天一条完整曲线)。主结论框架完全保留(仍是模型选择的敏感性分析),只是数据从公开来源变为自产,并且自产数据的额外好处是:你完全知道每一条曲线的重复归属,不必像用公开数据那样对"这是生物学重复还是技术重复"打问号。 代价是这条路重新受"你有没有实验室"约束——因此必须在 8 月内同时准备两条路,不要等到 9 月才开始找实验室。

🟡 条件 2(第 8 周末,2026 年 10 月上旬):完成 ≥ 40 条曲线的采集,且 OD 读数全部落在实测线性区内。 若酶标仪不支持恒温动力学读数、或读数大量超出线性上限,立即降级: 改用试管 + 恒温水浴 + 定时手动取样 + 稀释后读 OD。时间分辨率从 15 min 降到 1–2 h,这恰好落进 §4 第 4 条的降采样扫描范围内——主结论框架完全保留,只是"低分辨率"从人为模拟变成了真实条件,而这反而让结论更贴近学生项目的现实。 若连恒温水浴都不足,把温度梯度从 4 点降到 2 点(室温 + 37 °C),改以"菌株/条件差异"而非温度作为分组变量。

⚠️ 与「附属赛后不得修改」的冲突点: 四件事必须在 2026 年 11 月底前定死并写进研究计划,附属赛后一律不许改:① 四种模型的具体参数化形式与所用软件包版本(不同包对 Baranyi 的参数化不同,换包等于换模型);② "结论是否翻转"的判据(方向 + 显著性);③ 生物学重复的定义与 n;④ 降采样扫描的间隔点位。其中第 ① 条最容易被忽略——学生常在分析中途换一个更顺手的包,那在附属赛后就是违规修改。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,「未找到前作」不等于「不存在前作」。 本条课题的前作风险是全文件最高的——预测微生物学有整个子领域在做模型比较(Baranyi、Ratkowsky、Zwietering 等人的工作就是这个领域的基石文献)。学生必须在开题前做一轮扎实的文献检索,并把定位收缩到"学生级数据条件下的结论稳健性"这一具体角度,同时主动引用领域内的经典比较研究。绝不可声称首次比较模型。若检索后发现连"低质量数据下的模型敏感性"也已被系统研究过,应当直接放弃本条,改选 M2 或 M12。 - 公开生长曲线数据集的存在性与许可(见条件 1)——这是本课题最先要查清的一件事,8 月内必须有答案。 - 学校酶标仪的恒温与动力学读数能力、OD 线性上限(必须自测,不许引用)。 - 面包酵母/E. coli K-12 在 2027 豁免清单内的确切措辞——以官方规则手册为准,需核实

已知困难及其定位: 新颖性弱。这个困难不能被包装成研究内容——它是真实的缺陷,本课题因此评分 O=6、区间 [59, 77] 的下界最低之一,推荐优先级为"备选"。它的正确用法是:当学生已具备扎实的编程与统计能力、且其他课题因实验室或时间问题全部走不通时,作为一条低风险、必能产出、但天花板不高的保底路径。

选择前提: 适合编程与统计基础扎实、能接受"主结论是一份方法学判据表"、且明确接受本条新颖性偏弱这一事实的学生。不适合希望在原创性维度上拿分的学生——它的分数来自可辩护性(W=8)而不是原创性。

预算裁剪顺序: 纯计算版零成本;自测版耗材数百元。时间不足时依次砍:先砍第 7 步的非参数交叉校验;再把模型从 4 个减到 3 个(砍掉 Baranyi,因为它的参数化最容易在不同软件包间不一致,风险最高);再把温度点从 4 个减到 2 个;最后把降采样扫描点位从 4 档减到 2 档(保留"最高分辨率"与"16 h 单点"两个端点,这两个端点就足以支撑 H3)。砍到最后 H1 与 H3 仍成立。

合规与表格: - 纯计算版: 不接触任何生物材料,不触发 PHBA 条款,无需 SRC 事前批准,因此不需要扣除 2–6 周审批窗口。表格通常仅需 Form 1 + 1A + 1B + Form 2A(2027 新增,所有项目必填) + Abstract;Form 1A 第 10 题 Source of Data 勾 "publicly available" 并写明数据集与版本。 - 🔴 自测版:家中禁止培养任何潜在危险生物制剂,规则明文点名连 BSL-1 与 C. elegans 都不行。 必须在实体学校实验室(至少 BSL-1)进行,由受过训练的 Direct Supervisor 或 Qualified Scientist 监督。"实验室从哪来、监督人是谁"必须在 2026 年 8 月内落实到具体人与具体房间——而且因为本课题有纯计算版可选,这一条应当作为"走哪个版本"的决策依据,不要等到实验开始才发现没实验室。 - 🔴 自测版的 PHBA 审批: 面包酵母(发酵用、非 rDNA)与在学校进行的 E. coli K-12 均在事前审查豁免清单内,对应 Form 3但豁免清单的当年措辞需核实,若不适用则触发 Form 6A + SRC 事前批准,需额外 2–6 周,必须从 2026-08 起算的 3–4 个月净窗口里显式扣除。时间线建议:8 月完成 §6 第 1 步(拟合器 + 合成数据校验,零生物材料)并同步提交表格;按最坏 6 周计,9 月下旬开跑;11 月底采集截止。 - 🔴 如何绕开抗生素耐药性红线: 本课题完全不涉及任何抗菌剂、不做任何耐药性研究、不筛选任何耐药株。分组变量是温度或菌株,不是药物。注意:引用的前作 MCRO045 涉及致病弧菌,你只能把它作为"分析方案被检验的对象"提及,绝不可复制它的菌株或研究对象。 - 人类受试者 / 脊椎动物 / 基因编辑 / 朊病毒样蛋白: 全部不适用。 - 表格(2027 版编号)汇总: 无条件必备 Form 1 + 1A + 1B + Form 2A + Abstract;自测版加 Form 3(豁免路径)或 Form 6A + SRC 事前批准(非豁免路径);若在学校之外任何时点做实验或接受指导(含线上)触发 Form 2C 并须在展台竖立展示。 - 展台: 纯计算版无任何禁带物。自测版的孔板、培养基、菌液全部上不了台(活体、液体含水、玻璃一律禁止)。本课题展台靠:① 同一条曲线四种模型拟合的叠加图(视觉上直接展示"它们真的不一样");② 参数估计的跨模型对照图(含置信区间);③ 结论翻转率的汇总表(主结论);④ 参数精度随采样间隔劣化的曲线。全是图表,不吃展台禁令的亏。 - AI 政策: 不得用生成式 AI 撰写研究计划、摘要、展板或生成引文;拟合器与统计脚本若由 AI 生成,须显式引用、说明哪些部分由 AI 生成并保留提示词日志。数据解释必须由学生本人完成。

评分: O=6, W=8, F=7, S=5, Fit=8 → base=67.6,h=9 → [59, 77],置信度:中