ISEF Topic Scoping 2027

P977–87

叶脉分形维数对图像预处理有多敏感:43/45 的物种区分能撑住吗

推荐优先级:最高 · 参赛子类:Plant Sciences — Systematics and Evolution · 资源需求:扫描仪 + 笔记本 + 免费叶片,零器材成本,零合规,零生长周期 · 技能取向:图像处理 / 标度分析 / 结论稳健性检验

1 · 研究问题

盒计数分形维数 D 随扫描分辨率、二值化阈值与边缘检测参数如何变化?在把这三项参数各扫一遍之后,"10 个物种的 45 次两两比较中有 43 次显著"这个结果还剩下多少?

2 · 研究背景与空白

背景。 分形维数量化的是一个图形"填充空间的效率"随观察尺度变化的方式。盒计数法的操作定义是:用边长为 ε 的正方形网格去覆盖图形,数出被占据的格子数 N(ε),然后在 log N(ε) 对 log(1/ε) 的图上取斜率。这个定义里藏着两个几乎从不被言明的前提。第一,真正的分形维数要求 ε → 0 的极限存在,而任何实际图像的 ε 下限被像素尺寸卡死、上限被图像尺寸卡死——中间可用的标度区间往往只有一个多数量级,在这么窄的区间上拟合出来的斜率是一个"表观维数",不是数学意义上的分形维数。第二,N(ε) 完全取决于"哪些像素算是叶脉",而这由扫描分辨率、二值化阈值与边缘检测算子共同决定。 提高 DPI 会让细脉被分辨出来,D 上升;提高二值化阈值会让弱脉消失,D 下降;换一个边缘算子会改变脉宽,进而改变小 ε 端的 N(ε)。这三项都是研究者自由选择的,而它们各自能把 D 移动百分之几到十几——这个量级与物种间的真实差异是同一个数量级。 因此"D/H 能区分物种"这个结论的成立与否,可能取决于预处理参数的选择。

已有工作到哪一步。 PLNT009(2025,Grand Award,"Fractal-Dimension-Based Plant Characteristic") 摘要原文:"Computer programs were developed by the author to extract the venation structures of leaves via edge detection, and to determine the leaf height (H) and the fractal dimension of the venation structure (D)"、"Over 970 leaves"、"When comparing D/H values of samples taken from 10 different plant species, significant differences were observed in most (43 out of 45) comparisons"。它自己做了很好的稳定性检验(同株两侧无差异、同种不同个体无差异,p>0.05),这说明作者有方法学意识——但它检验的是生物学重复的稳定性,完全没有检验图像处理参数的稳定性。这两件事是不同的,而后者恰恰是分形维数这个量最脆弱的地方。 该项目还给出了应用定位("especially effective for classification applications where only the leaf of a plant is present, such as for plant fossil identification")与 D 和 H 正相关这一先导观察("Preliminary analysis of sample leaf collections from the same plant revealed a positive correlation between D and H, prompting the use of the D/H")。

空白在于该项目——以及整个 PLNT 语料——没有任何一处报告过分形维数的标度区间、拟合优度或预处理参数敏感性,因此 43/45 这个数字在参数网格上的稳定性是完全未知的。这个空白适合一年期学生课题的理由:叶片免费、扫描仪学校就有,零器材成本、零合规、零生长周期,全部计算可在两周内跑完;结论正负都成立——若 43/45 在网格上崩塌,那是一个能改变整类形态计量课题的方法学结论;若它稳如磐石,那就为一个 Grand Award 结论提供了它自己没给出的稳健性证据。

3 · 可检验假设

H1 在 DPI × 二值化阈值 × 边缘算子构成的参数网格上,同一批叶片算出的 D 的极差 ≥ 0.15(绝对值),且显著两两比较对数(满分 45)的极差 ≥ 8 对;即预处理选择能把结论从"43/45 显著"移动到"35/45 或更低"。判据来源:叶脉是多尺度结构,DPI 从 150 提到 1200 使可分辨的最细脉尺度改变约 3 倍,而 log N 对 log(1/ε) 的斜率对最细尺度端的贡献极其敏感。

H2(机制假设,H1 被否证时仍有内容)D 的参数敏感性由标度区间的宽度与拟合优度预测:标度区间跨度 < 1.5 个数量级或局部斜率的相对标准差 > 5% 的图像,其 D 在参数网格上的极差显著大于标度区间良好的图像。若 H2 成立,本课题就同时给出了判据——一条"什么样的图像上 D 才可信"的操作标准,这比单纯指出问题有用得多,也正是 PLNT009 完全没有的东西。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 盒计数实现必须在已知解析维数的标准分形上通过校验:Sierpiński 三角形(D = log3/log2 ≈ 1.5850)、Koch 曲线(D = log4/log3 ≈ 1.2619)、Cantor 尘(D = log2/log3 ≈ 0.6309)与一条直线(D = 1.0000)、一个实心正方形(D = 2.0000),自建代码算出的 D 与解析值偏差须 ≤ 2%,且五个算例全部通过。这一步不过关不许往下做,后续全部结论无效——本课题的全部主张是"D 变了多少",D 本身算错则一切归零。这一条同时是唯一能向评委证明学生真的自己实现了盒计数的证据。
  2. 统计口径预先写死——生物学重复与技术重复必须分开计数。 实验单元是单片叶;同一片叶在不同参数下重算 不是重复,是同一观测的不同处理(配对数据),必须用配对/重复测量结构分析,绝不可当作独立样本。生物学重复:每物种 ≥ 12 片叶,来自 ≥ 3 个独立个体(同株不同叶是技术重复,不同植株才是生物学重复)。物种 ≥ 5 个。论文正文必须显式写出"n(物种)= A,n(植株)= B,n(叶)= C,参数格 = G"。
  3. 统计口径预先写死——参数敏感性用重复测量模型,两两比较必须校正多重性。 模型为 D ~ DPI * 阈值 * 算子 + (1|叶片) + (1|植株) + (1|物种),叶片为随机效应以吸收配对结构。45 次两两比较必须做多重比较校正(Holm 或 Benjamini-Hochberg),并明确写明 PLNT009 报告的 43/45 是否做过校正无法从摘要判定,因此本课题同时报告"校正前"与"校正后"两套显著对数,以便对齐明确写明不以未校正的两两 t 检验作为主结论及其原因:45 次比较在 α = 0.05 下期望产生约 2.25 个假阳性,恰好与"45 减 43"同量级。
  4. 标度区间与拟合优度必须逐图报告。 每张图像的 log-log 曲线必须给出:所用标度区间的上下限(以像素为单位)、区间跨度(数量级)、线性拟合的 R²、以及局部斜率随 ε 的变化曲线任一图像若标度区间跨度 < 1 个数量级,其 D 值须被标记为不可靠并单独报告,不得混入主分析。这是本课题相对 PLNT009 最实质的增量。
  5. 参数网格规模。 DPI ≥ 4 档(150 / 300 / 600 / 1200)× 二值化阈值 ≥ 5 档(Otsu 及其上下各 2 档,步长须预先定死)× 边缘算子 ≥ 3 种(Canny 至少 2 个 σ、Sobel、形态学骨架化)= ≥ 60 个参数格,每格重算全部叶片。
  6. 必须报告 D 与 D/H 两条线。 PLNT009 的结论建立在 D/H 而非 D 上,因此参数敏感性必须对两者分别报告——H(叶高)几乎不受预处理影响,若 D/H 比 D 更稳,那本身就是对 PLNT009 那个"用 D/H 而非 D"选择的一次独立支持,是一个正面结论。
  7. 可复现性。 全部叶片扫描原图(含标尺与 DPI 元数据)、五个标准分形的校验脚本与输出、盒计数与标度区间拟合实现、参数网格重算脚本、统计脚本全部开源存档,第三方可一键重跑得到相同的 D 与显著对数曲面。

5 · 数据与工具

用途 来源 / 工具
叶片样本 校园、公园或市场可得的植物叶片,≥ 5 物种 × ≥ 3 植株 × ≥ 4 叶。免费。须核实:采集地点是否需要许可(公园与保护区可能限制采样);严禁采集列管保护物种
图像采集 平板扫描仪(光照完全一致,远优于相机)。须核实:所用扫描仪的光学 DPI 与插值 DPI——标称 1200 DPI 若为插值则 1200 档与 600 档实质相同,会让 DPI 这一维度失效。这是本课题最关键的须核实项
尺度参照 每张扫描必须包含毫米标尺,用于把像素换算为物理长度并计算标度区间的物理跨度
图像处理 Python + scikit-image(Otsu、Canny、Sobel、skeletonize)+ numpy须核实:skeletonize 的算法版本(Zhang-Suen vs Lee)在不同 scikit-image 版本间有差异,须锁定版本号并写入研究计划
盒计数实现 必须自行实现——现成库的边界处理、网格起点偏移与 ε 取值方式各不相同,且多数不报告标度区间。自行实现是 §4 第 1 条的前提,也是本课题的技术核心
标准分形(用于 §4 第 1 条校验) Sierpiński 三角、Koch 曲线、Cantor 尘、直线、实心正方形,全部由自建代码生成,解析维数已知。零成本、零依赖
对照基准(仅用于校验与对比,不计入本项目的数据贡献 PLNT009(2025)的 43/45 显著比较、970+ 叶片规模、以及其同株两侧/同种不同个体 p > 0.05 的稳定性结论
统计 R 或 Python + lme4/statsmodels(重复测量模型)、多重比较校正(Holm / BH)。纯 CPU 笔记本即可;60 参数格 × 数百张图的重算量在数小时内可完成,须核实实际耗时并据此决定是否需要并行
须核实项 扫描仪的真实光学分辨率——若光学上限只有 600 DPI,则 1200 档必须从网格中删去或标注为插值,否则 DPI 维度的结论是伪的

6 · 方法路径

  1. 建体系 + 跑通已知对照 + 完成 §4 第 1 条的校验。 自行实现盒计数与标度区间拟合,在五个解析维数已知的标准分形上验证(偏差 ≤ 2%,五个全过)。这一步不过不许继续——它同时是技术门槛与答辩证据。
  2. 核实工具的能力边界。 这个方向有五个不报错但给错结果的静默失败点,必须逐一实测排除:(a)扫描仪的插值 DPI 冒充光学 DPI——插值只是把像素复制放大,不带来任何新信息,但代码完全看不出区别,会让 DPI 维度的结论变成噪声;(b)图像绿度/灰度受白平衡与曝光影响——扫描仪虽固定光源,但自动色彩校正与自动曝光仍可能逐张变化,必须全程关闭并记录设置;(c)二值化阈值与叶片自身颜色混杂——深色叶与浅色叶在同一 Otsu 阈值下提取出的脉网密度不同,这会把"物种差异"与"颜色差异"混在一起,必须在结论中显式区分;(d)盒计数的网格起点偏移——同一图像换一个网格原点,N(ε) 可变化数个百分点,标准做法是多起点平均,若不做则引入一个随机但系统的偏差;(e)标度区间的自动选取——若代码自动取"全部可用 ε"做线性拟合,会把两端的饱和段(ε 接近像素尺寸时 N 趋于饱和、ε 接近图像尺寸时 N 趋于 1)算进去,系统性压低 D 且完全不报错。这五条必须在代码里写成断言或显式输出,而不是靠记性。
  3. 建立叶片图像库并冻结样本表。 ≥ 5 物种 × ≥ 3 植株 × ≥ 4 叶,扫描时记录物种、植株编号、叶位与采集日期。样本表一旦写入研究计划即冻结,11 月底之后不得增删物种。
  4. 实现标度区间的诊断输出。 对每张图产出局部斜率曲线与拟合优度,据此用一条预先写死的规则自动判定可用标度区间——"哪一段算标度区间"是本课题最大的主观判断点,须给出明确、可复现的判据(建议:局部斜率在连续 ≥ 1 个数量级内的相对标准差 ≤ 5%),并把该规则写入研究计划。
  5. 跑满参数网格。 ≥ 60 格 × 全部叶片,输出 D、D/H、标度区间跨度与拟合 R² 的完整张量。
  6. 做敏感性分析与结论稳健性检验。 主图为"显著两两比较对数 vs 参数格"的曲面(分校正前/校正后两版),辅以 D 的极差热图与 D vs D/H 的稳定性对照;按 H2 检验标度区间质量能否预测参数敏感性。
  7. 独立交叉校验。 用另一种方法算同一个量:对同一批图像,改用不依赖盒计数的其他复杂度度量——如脉网骨架的总长度密度、分枝点密度、或 Minkowski–Bouligand 的膨胀法(dilation method)维数——重新做 45 次两两比较。若骨架长度密度这样一个概念简单、参数敏感性低的量能给出与 D/H 相当的物种区分能力,那本身就是本课题最有力的结论:分形维数在这里可能是一个不必要的复杂化。 这张图完全不依赖 H1 是否成立。

7 · 新颖性边界

本课题不声称: - 不声称首次把分形维数用于叶脉或植物分类。这在形态计量学与植物学文献中已有大量工作,学生必须在开题前查清并主动引用。 - 不声称 PLNT009(2025,Grand Award) 的结论是错的。它的 43/45 在其选定的预处理参数下是真实的;本课题问的是这个数字在参数网格上有多稳,是稳健性问题而非真伪问题。这个区分必须在展板上明写。 - 绝不声称超越 PLNT009。 该项目采集了 970+ 片叶、做了同株两侧与同种不同个体的稳定性检验、并给出了化石鉴定的应用定位,其规模与完整度远超本课题。本课题只做一件事:检验它没检验的那个维度。 - 不声称首次指出盒计数对预处理敏感。这是图像分析里的常识性问题,本课题的贡献在于把它量化到这个具体场景与这个具体结论上。 - 不声称结果可外推到本课题未测试的物种或叶型。掌状脉与羽状脉的多尺度结构差异很大,须在局限性中声明。

已有工作做到哪: PLNT009 用自编程序做边缘检测提取脉网、计算 D 与 H,在 970+ 片叶上验证了 D/H 在同株两侧与同种不同个体间无显著差异(p > 0.05),并在 10 物种的 45 次两两比较中报告 43 次显著。它检验了生物学重复的稳定性,没有检验图像处理参数的稳定性;也没有报告任何标度区间、拟合优度或多重比较校正。

本项目的贡献(属「方法可复现性贡献」型): 已有工作评估的是D/H 能不能区分物种;本项目评估的是这个区分能力在预处理参数网格上是否稳定,以及 D 本身在有限标度区间上是否是一个良定义的量,并交付一条"什么样的图像上 D 才可信"的操作判据。这是主结论,不是附加内容。这类贡献在计算与图像分析领域是被承认的,但定位必须讲清楚,否则会被误读为重复工作。

为什么有价值: 分形维数是学生形态计量项目里最受欢迎的量之一,因为它听起来深刻、算起来简单。但它的两个前提——足够宽的标度区间、稳定的预处理——几乎从不被检查。若 43/45 在网格上崩塌,那么这一整类课题都需要先报告标度区间;若它稳如磐石,那就为一个 Grand Award 结论提供了它自己没给出的稳健性证据。两种结果都改变这类课题的报告要求。

若结论不显著: 若参数网格上 D 的极差不足 0.15、显著对数几乎不动、H1 被否证——"该结论对预处理稳健"同样是有效结论(这是对 PLNT009 的一次独立支持,其价值不低于推翻它),但必须给出误差棒证明有能力分辨这个差异:具体地,必须报告本参数网格覆盖的 D 变化范围,并证明该范围确实涵盖了合理的预处理选择空间,否则"没测到敏感性"只是因为网格扫得太窄。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 3 周末,即 2026 年 8 月底):五个标准分形的 D 必须全部复现至 ≤ 2%。 若做不到,说明盒计数实现有系统性问题,此时不得继续跑参数网格——先排查网格起点偏移、标度区间选取与边界处理。若到第 6 周末(2026 年 9 月中旬)仍无法通过,立即降级:放弃盒计数,改做「骨架形态计量」路径——用脉网骨架的总长度密度、分枝点密度、平均脉段长度等概念简单、无标度区间问题的量重做同一批 45 次两两比较,并把主问题改为"不用分形维数能不能达到同样的物种区分能力"。主结论框架保留(仍是"PLNT009 的区分能力有多稳、依赖什么"),且这条路径的技术风险几乎为零。

🟡 条件 2(第 6 周末,即 2026 年 9 月中旬):扫描仪的光学 DPI 必须 ≥ 600。 若光学上限低于 600,立即降级:把 DPI 维度替换为「下采样倍率」——以最高光学 DPI 扫描一次,然后用软件下采样到 1/2、1/4、1/8,构造等效的分辨率维度。主结论框架完全保留(仍是"分辨率如何改变 D"),且下采样路径反而更干净,因为它排除了不同扫描通道之间的硬件差异。

⚠️ 与「附属赛后不得修改」的冲突点: 五件事必须在 2026 年 11 月底前定死:(1)标度区间的自动选取规则(局部斜率相对标准差 ≤ 5% 且跨度 ≥ 1 个数量级);(2)参数网格的具体档位;(3)物种与叶片样本表;(4)多重比较校正方法(Holm 还是 BH);(5)"可靠/不可靠 D"的判定阈值。标度区间规则尤其危险——事后换一个规则等于事后换一套 D 值,附属赛后一律不被允许。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,「未找到前作」不等于「不存在前作」。 盒计数的预处理敏感性在图像分析与分形几何文献中很可能早有系统研究(重点查 Pattern RecognitionChaos, Solitons & FractalsPlant Methods)。学生必须在开题前查清并主动引用,新颖性主张须严格限定为"该敏感性未被 PLNT009 及 ISEF 语料中的同类项目检验"。 - 扫描仪的光学 DPI 必须在第 1 周核实,不要等到扫完几百张才发现 1200 档是插值的。 - scikit-image 的版本号必须在第 1 周锁定并写入研究计划——skeletonize 的算法在版本间有差异。 - 建议在 2026 年 8 月底前设法取得 PLNT009 摘要全文与其公开的方法细节,确认其预处理参数,以便在网格中包含"它用的那一格"作为参照点。若能包含该参照格,本课题的对齐就非常干净。

已知困难及其定位: 本课题唯一的技术难点是把盒计数与标度区间拟合写对这个困难本身就是研究内容——课题问的正是"D 在有限标度区间上是不是一个良定义的量",所以标度区间不是要绕开的障碍,而是要测量的对象。另一个风险是"这看起来只是把别人的结论重算了一遍",应对方式是 §6 第 7 步的骨架形态计量交叉校验:若一个概念简单得多的量能达到同样的区分能力,那结论就不是"重算",而是"分形维数在这里可能是不必要的复杂化"——这是一个独立的、有冲击力的正面发现。

选择前提: 适合已具备 Python 图像处理基础、能读懂 log-log 拟合与多重比较校正的学生。不适合把"跑通别人的库"当作研究的学生——本课题要求自行实现盒计数,现成库不满足 §4 第 1 条的要求。也不适合想做实验的学生:本课题从头到尾不种一株植物。

预算裁剪顺序: 无预算可裁(零成本)。时间不足时的裁剪顺序:先砍 §6 第 7 步的骨架交叉校验(但应尽量保留,它是本课题最有冲击力的一张图),再砍边缘算子从 3 种减到 2 种,再砍二值化阈值从 5 档减到 3 档,最后砍物种从 5 个减到 4 个(4 物种给 6 次两两比较,仍可做多重比较校正)。五个标准分形的校验永远不砍——它是硬门槛。 砍到最后主结论框架仍完整保留。

合规与表格: 本课题是全文件合规负担最低的两条之一(另一条是 P6):纯图像分析、零器材、离体叶片、无化学品、无装置、无活体培养。Form 1、Form 1A、Form 1BForm 2A(2027 新增学生支持披露表)为强制项无需 Form 3。植物组织豁免 SRC 事前审批。不涉及 PHBA、rDNA、脊椎动物、人类受试者。采集叶片须遵守当地法规:严禁采集列管保护物种,公园与保护区采样须取得许可;严禁向环境引入任何非本地物种。 注意:规则明文排除"文献综述、纯演示、说明模型、单纯复现"——本课题必须清楚地表明它有自己的研究问题(参数敏感性)与自己产生的数据(自采叶片、自实现算法),而不是复现 PLNT009。 AI 政策:研究计划、摘要、展板与引文不得由生成式 AI 撰写;本课题代码量大,AI 生成代码的显式引用与提示词日志保留在这里尤其重要展台:无活体、无液体、无土壤、无玻璃,展台合规风险接近零。干燥压制的叶片标本可以上台,这是本课题少见的实物优势。展位靠显著对数曲面图、D 极差热图、五个标准分形的校验图、log-log 标度区间诊断图与叶脉提取效果对比图撑住。

生长周期时间轴: 2026-08 中旬提交 Form 1/1A/1B/2A → 审批 2–4 周(无 PHBA、无危险化学品、无装置,本课题审批负担全文件最轻)→ 2026-08 底完成五个标准分形的校验 → 2026-09 完成叶片采集与扫描(叶片采集是本课题唯一有季节性的环节:秋季落叶前必须完成,错过即需等待下一年,这是本课题唯一的时间硬约束)→ 2026-09 至 2026-11 跑参数网格与统计分析(纯计算,可随时重跑)→ 2026-12-15 分析截止,留三周做展板。本课题不种植物,无播种日、无主结局测量日、无 60 天红线。叶片必须在 2026 年 9 月底前采集完毕——这条与生长周期同性质的季节约束是它唯一不可压缩的时间点,须在开题第一周就安排采集。

评分: O=8, W=9, F=9, S=6, Fit=8 → base=81.6,h=5 → [77, 87],置信度:高