ISEF Topic Scoping 2027

P264–82

"活力指数"这个复合指标有多稳:换一个萌发判据,排名会不会翻转

推荐优先级:备选 · 参赛子类:Plant Sciences — Growth and Development · 资源需求:培养皿 + 相机/扫描仪 + 电脑,百元级;几乎零合规 · 技能取向:图像判读 / 指标构造 / 稳健性分析

1 · 研究问题

活力指数(vigor index = 平均根长+芽长 × 萌发率)这个被广泛使用的复合指标,当"算不算萌发"的判据从"任何可见突出"改成"胚根 ≥ 2 mm"、当测量日从第 7 天改成第 5 或第 10 天时,处理组之间的优劣排序会不会翻转?若会翻转,翻转发生在多大的处理效应量以下?

2 · 研究背景与空白

背景。 种子活力(seed vigor)不是一个可以直接测量的物理量,它是一个构造出来的复合指标:把萌发率(一个比例)与平均苗长(一个长度)相乘。这类乘积型指标有一个人所共知但很少被追究的性质——它的数值完全取决于两个自由度:萌发的判定阈值,与测量的时点。 判据放宽(任何可见突出都算),萌发率上升而平均苗长下降(因为把刚萌动的短苗算进了分母);测量日推后,两个因子同时上升但速率不同。两个自由度都由研究者自行选择,且几乎没有项目报告过换一个选择结果会怎样。这不是精度问题,是自由度问题:一个能改变结论方向的自由度如果没被检验,那个结论就没有被检验。

已有工作到哪一步。 PLNT038T(2025,Grand Award,"Effect of Plant Extracts on Seed Germination") 摘要原文:"Germination was measured after 7 days, with any visible protrusion counted. The vigor index was calculated as the average total length (mm) of the respective seed's root and shoot multiplied by the germination rate per plate."——判据(任何可见突出)和时点(第 7 天)都被写死为单一选择,没有任何敏感性检验。 而这两项恰恰是研究者自由度最大的两处。该项目在此基础上得出了两个物种的优劣排序结论:"the highest concentration of Juglans nigra extract significantly promoted Zea mays germination while inhibiting Lolium perenne growth",并用 ANOVA + Tukey HSD 确认了组间差异。同一语料中,PLNT051(2026,Special Award,"Priming for Success") 同样在固定时点收口:"The seeds were then observed for germination and recorded daily for 7 days"、"each of the 900 seedlings were measured for hypocotyl length"——它逐日记录了,但只在第 7 天做了结论。

空白在于没有任何一个获奖项目报告过活力指数的排序在判据/时点网格上是否稳健,因此所有基于该指标的处理排序结论,其稳健性都是未知的。这个空白适合一年期学生课题的理由:它只需要一批培养皿和一台相机,实验成本几乎为零;逐日拍照本来就是标准操作,增量工作量只在事后重算;而且结论正负都成立——排序稳健则为这个指标提供一次难得的辩护,排序翻转则指出一个能改变结论的自由度。

3 · 可检验假设

H1 在 3 套萌发判据 × 5 个测量日(第 3/5/7/10/14 天)构成的 15 格网格上,处理组的活力指数排序至少在 3 格中发生相邻名次翻转(即 Kendall τ 相对第 7 天/任意可见突出这一"标准格"< 0.8)。判据来源:萌发率与平均苗长在乘积中方向相反,判据放宽时前者升后者降,因此存在一个使乘积不变的中性点;处理间效应量若小于该中性点附近的曲率尺度,排序必然对判据敏感。

H2(机制假设,H1 被否证时仍有内容)排序翻转的发生概率与处理间效应量成负相关:当两个处理的活力指数相对差 ≥ 30% 时,排序在整个 15 格网格上保持不变;差 < 15% 时翻转概率 > 50%。若 H2 成立,本课题的产出就从"这个指标不稳"升级为"这个指标在多大效应量以上可用",是一条可直接引用的操作判据。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。已知长度的标准标尺(打印的毫米刻度卡,或游标卡尺量过的金属标尺)放入每张照片,图像测长脚本对该标尺的读数偏差须 ≤ 3%;同时由两名独立判读者对同一批 100 粒种子按同一判据判定萌发/未萌发,判读者间一致性 Cohen's κ ≥ 0.85这一步不过关不许往下做,后续全部结论无效——本课题的全部主张建立在"判据可复现"上,判读不一致则整个网格是噪声。
  2. 统计口径预先写死——生物学重复与技术重复必须分开计数。 实验单元是培养皿。 皿内 20 粒种子是技术重复,n 只计皿数;每个处理至少 6 皿,来自至少 2 个独立播种批次。活力指数逐皿计算后再跨皿求均值,绝不允许把所有种子汇集成一个大池再算一个指数(那会把皿间方差抹掉,人为缩小误差棒)。
  3. 统计口径预先写死——排序稳健性的量化方式。 主结果不是"排序变了/没变"这个二值判断,而是每一格上处理排序与标准格的 Kendall τ,以及逐格自助抽样(1000 次重抽皿)得到的"排序翻转概率"。萌发数据是计数数据,逐格的组间检验用二项族 GLM 而非 t 检验;苗长数据用皿为随机效应的混合模型。明确写明不报单格 p 值作为主结论及其原因——15 格上做 15 次检验必然产生假阳性,本课题关心的是排序的稳定性而非任何单格的显著性。
  4. 网格规模与效应量覆盖。 判据 ≥ 3 套(任何可见突出 / 胚根 ≥ 2 mm / 胚根 ≥ 5 mm 且子叶展开),测量日 ≥ 5 个,处理 ≥ 4 组且处理间活力指数相对差须覆盖 5%–50% 区间(否则 H2 无法检验),物种 ≥ 2 个。
  5. 交付一个可复用的开源脚本。 输入:逐日照片的萌发/长度记录表;输出:排序稳健性热图 + Kendall τ 表 + 翻转概率。脚本须自带一组合成数据的单元测试,第三方 clone 后可直接跑出示例图。
  6. 可复现性。 全部原始照片(含标尺与皿号)、逐粒逐日判读表、双判读者的原始判定、脚本与合成测试数据开源存档,第三方可一键重跑得到相同热图。

5 · 数据与工具

用途 来源 / 工具
受试种子 生菜、黑麦草、萝卜等快萌发物种,单一批号一次购足。须核实:批号、标称发芽率、生产日期;不同批次不得混用
处理梯度(用于制造效应量) 无需化学品——用盐胁迫(NaCl 浓度梯度)温度梯度即可造出 5%–50% 的活力指数差,成本近零且合规负担最低
图像采集 平板扫描仪(培养皿倒扣直接扫描,光照完全一致,优于相机)或固定支架 + 手机。须核实:所用扫描仪的 DPI 与实际光学分辨率是否一致——标称插值 DPI 不等于光学 DPI
长度测量 ImageJ / Fiji 的 NeuronJSmartRoot 插件,或 RootNav须核实:所选插件对弯曲胚根的路径长度算法是否与手工描迹一致,须在至少 30 粒种子上比对
尺度校准 打印毫米刻度卡(每张照片必须入镜)+ 游标卡尺实测校验
对照基准(仅用于校验与对比,不计入本项目的数据贡献 PLNT038T 的活力指数定义与第 7 天/任意可见突出这一"标准格";PLNT051 的 7 天逐日记录设计
统计与作图 R + lme4(混合模型)、boot(自助抽样)、ggplot2(热图)。纯 CPU
须核实项 判读者的可得性——κ 校验需要第二名独立判读者(同学或老师均可),须在开题前确认此人能在整个数据采集期稳定参与,且其身份与投入须在 Form 2A(学生支持披露表) 中如实披露

6 · 方法路径

  1. 建体系 + 跑通已知对照 + 完成 §4 第 1 条的校验。 搭好扫描/拍照工位,跑通图像测长脚本对标准标尺的 ≤ 3% 校验;组织双判读者在 100 粒种子上做 κ 校验并达到 ≥ 0.85。这一步不过不许继续。
  2. 核实工具与生物材料的能力边界。 这个方向有四个不报错但给错结果的静默失败点,必须逐一实测排除:(a)种子批次异质性——不同批次基础萌发率可差 30 个百分点,会直接改变处理间效应量,进而改变翻转概率,因此全实验必须锁定单一批号;(b)培养皿位置效应与培养箱温度梯度——边缘与中心差 1–2 °C 会让"测量日"这个自变量混入位置效应,必须随机化皿位并实测温度分布;(c)图像绿度与长度受白平衡和曝光影响——同一根胚根在不同曝光下经阈值分割后长度可差 10% 以上,因此必须用扫描仪(固定光源)而非手机,或强制固定白平衡与曝光并记录参数;(d)真菌污染被当成萌发失败——污染皿必须单独记录而非静默丢弃,否则会在后期时点上系统性压低萌发率、伪造出"排序随时点变化"的假信号。
  3. 冻结网格并写入研究计划。 3 套判据的精确定义(配示意图)、5 个测量日、4 组处理、2 个物种,一次定死。判据定义必须精确到可复现的程度:"胚根 ≥ 2 mm"须写明从何处量到何处、弯曲胚根按路径长还是直线距离。
  4. 播种并逐日扫描。 每天同一时刻扫描全部培养皿,连续 14 天,不做任何实时判读——判读全部在数据采集结束后离线进行,避免采集期的期望偏倚。
  5. 双判读者盲判。 皿号打乱后交由两名判读者按三套判据各判一遍;不一致的种子由第三方裁决并记录裁决数。处理标签在判读阶段对判读者屏蔽。
  6. 重算 15 格并做稳健性分析。 逐格计算活力指数、排序、Kendall τ 与自助抽样翻转概率,产出热图;按处理间效应量分层,检验 H2。
  7. 独立交叉校验。 用另一种方法算同一个量:对同一批数据,改用不依赖乘积构造的单一指标(如 T50,即累计萌发达 50% 所需天数,由生存分析给出)重新排序,与活力指数的排序对照。若 T50 排序稳定而活力指数排序翻转,那就直接指出了问题出在指标的乘积构造上,而不是出在数据上——这是本课题最有力的一张图。

7 · 新颖性边界

本课题不声称: - 不声称首次提出活力指数。这是一个在种子科学里通用了数十年的标准指标。 - 不声称 PLNT038T(2025,Grand Award) 的结论是错的。它在自己选定的判据与时点下得到的结论是成立的;本课题问的是这个结论对判据与时点有多敏感,是两个不同的问题。 - 不声称提出一个更好的活力指标。本课题只做稳健性检验,不构造新指标——构造新指标需要与独立的"真实活力"参照对标,而那个参照在本设计中不存在。 - 不声称结果可外推到本课题未测试的物种或处理类型。

已有工作做到哪: PLNT038T 明确定义了活力指数 = 平均根芽长 × 萌发率,在第 7 天、以"任何可见突出"为判据,做了 ANOVA + Tukey HSD 并给出处理排序;PLNT051 逐日记录了 7 天并测了 900 株幼苗的下胚轴长度,但同样只在终点做结论。两者都没有做判据/时点的敏感性检验。

本项目的贡献(属「方法可复现性贡献」型): 已有工作评估的是某个处理是否提高了活力指数;本项目评估的是这个指标在研究者自由度网格上的排序稳健性,以及它在多大效应量以上才可信,并交付一个可复用的开源稳健性检验脚本。这是主结论,不是附加内容。这类贡献在方法学领域是被承认的,但定位必须讲清楚,否则会被误读为"只是把别人的数据重算了一遍"。

为什么有价值: 活力指数被中学生项目和农业实践大量使用,而它的两个关键自由度从未被系统检验。若结论是"效应量 ≥ 30% 时排序稳健",那这就是一条任何人都能直接引用的操作判据;若结论是"普遍翻转",那一大批基于该指标的排序结论都需要重新表述。

若结论不显著: 若 15 格上排序完全稳健、Kendall τ 恒为 1,H1 被否证——"排序稳健"同样是有效结论(这是对该指标的一次难得辩护),但必须给出误差棒证明有能力分辨翻转:具体地,必须证明在所设置的最小效应量(5%)处,本设计的自助抽样确实能检出翻转,否则"没测到翻转"只是因为没有能力测到。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 4 周末,即 2026 年 9 月初):判读者间一致性 κ 必须 ≥ 0.85,且图像测长偏差 ≤ 3%。 若 κ < 0.85,立即降级:把三套判据收缩为两套「客观可自动化」的判据——放弃"任何可见突出"这类依赖人眼的定性判据,改用"胚根投影长度 ≥ 2 mm"与"≥ 5 mm"两套完全由脚本从图像自动判定的阈值。主结论框架保留(仍是判据 × 时点网格上的排序稳健性),只是判据维度从 3 降到 2、且全部自动化,κ 问题随之消失。

🟡 条件 2(第 10 周末,即 2026 年 10 月中旬):处理间效应量必须覆盖 5%–50% 区间。 若所设的盐/温度梯度造出的活力指数差全部集中在某个窄区间,H2 无法检验。立即降级:放弃 H2 的分层结论,把主结论收缩为 H1(在实际达到的效应量上报告翻转),并在局限性中显式声明"效应量覆盖不足,翻转阈值未能标定"。主结论框架不变。

⚠️ 与「附属赛后不得修改」的冲突点: 三件事必须在 2026 年 11 月底前定死:(1)三套判据的精确定义(含"从哪量到哪"与弯曲胚根的处理);(2)5 个测量日;(3)"标准格"的选择(本课题定为第 7 天 / 任何可见突出,以便与 PLNT038T 对齐)。事后改判据定义等于事后改主结论,附属赛后一律不被允许。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,「未找到前作」不等于「不存在前作」。 种子科学界对萌发判据的标准化早有 ISTA 规程,学生必须在开题前自己查一轮(重点查 Seed Science and Technology 与 ISTA 规则),新颖性主张必须限定在"该敏感性分析未见于 ISEF 语料",不得声称学界首次。 - 扫描仪的光学 DPI 与插值 DPI 必须在第 1 周确认,不要等到测长时才发现分辨率不够。 - 第二名判读者的可得性与其投入须在开题前确认,并如实填入 Form 2A

已知困难及其定位: "这看起来只是把别人的数据重算了一遍"是本课题最大的答辩风险。应对方式不是辩解,而是把可复用脚本作为独立交付物——工具本身是可展示、可辩护的贡献,且 §6 第 7 步的 T50 交叉校验会直接把问题定位到指标的乘积构造上,那不是"重算",那是诊断。

选择前提: 适合能忍受连续 14 天每天扫描、并愿意事后做数千次盲判的学生。不适合希望"发现某个处理有效"的学生——本课题的处理只是用来造效应量的工具,处理本身完全不重要。

预算裁剪顺序: 总成本百元级。时间不足时的裁剪顺序:先砍第二个物种(只做一个),再砍测量日从 5 个减到 4 个,再砍处理从 4 组减到 3 组(3 组是排序问题的下限,2 组无排序可言)。砍到最后主结论框架仍完整保留。

合规与表格: 植物组织与种子豁免 SRC 事前审批,本课题合规负担是全文件最低的一条。需 Form 1、Form 1A、Form 1BForm 2A(2027 新增学生支持披露表)为强制项,须披露第二判读者的角色与投入。若用 NaCl 造梯度则无危险化学品问题,无需 Form 3;若改用其他试剂须逐一查 SDS。不涉及 PHBA、rDNA、脊椎动物或人类受试者。判读者是合作者不是受试者,不触发 Form 4。 AI 政策:研究计划、摘要、展板与引文不得由生成式 AI 撰写;脚本若由 AI 生成须显式引用并保留提示词日志。展台:培养皿含液体与活体种子,不得上台。展位靠 15 格排序热图、Kendall τ 曲线、翻转概率图与逐日扫描图像拼板撑住——本课题的产出天然全部是图,是全文件里展台风险最低的几条之一。

生长周期时间轴: 2026-08 中旬提交 Form 1/1A/1B/2A → 审批 2–4 周(无 PHBA,不需额外 2–6 周)→ 2026-09 初完成 κ 与测长校验 → 2026-09 中旬第一轮播种(第 0 天)→ 逐日扫描至第 14 天,主结局网格在播种后第 14 天即可全部生成 → 2026-10 与 2026-11 各跑一轮(换物种 / 换效应量梯度)→ 2026-12-15 数据采集截止,留三周做离线盲判、重算与展板。主结局落在播种后 14 天,距 60 天红线余量极大;离线判读可在数据采集结束后集中完成,时间弹性是本条课题的核心优势。

评分: O=6, W=8, F=9, S=5, Fit=10 → base=73.2,h=9 → [64, 82],置信度:中