ISEF Topic Scoping 2027

R1171–81

0.9784 对 0.7214,两个数是在同一张试卷上考出来的吗

推荐优先级:较高 · 族 A(公开数据集重评测)/ 参赛子类:ROBO — 机器学习方向(官方 2027 子类名称需核实) · 资源需求:一台笔记本,零器材成本;数据集下载与格式转换须预留 2 周 · 技能取向:音频信号处理 / 评测协议设计 / 统计推理

1 · 研究问题

把跨基准比较拉回同一评测协议——完全相同的测试划分、相同的正负样本比例、相同的评价脚本——之后,自研模型与被引基准之间那 0.257 的 AUROC 差距还剩多少?测试集的正负比、片段长度、重叠窗口分别贡献了多少虚假优势?

2 · 研究背景与空白

背景。 被动声学监测(passive acoustic monitoring)用水听器长期录音,再由分类器从连续音频里找出鲸类叫声。评价指标通常是 AUROC(Area Under the Receiver Operating Characteristic curve),它等于"随机取一个正样本、随机取一个负样本,模型给正样本更高分"的概率。这个指标常被当作"与类别比例无关"的稳健指标,但那句话只在正负样本各自的分布不变时成立:一旦负样本池的构成变了——比如把大量静音段、船机噪声或另一物种的叫声塞进负类——排序任务的难度就变了,AUROC 会整体移动。更根本的是,在连续音频上"一个样本"是什么,完全由切片协议定义:片段长度决定一次叫声被切成几个样本,重叠窗口决定这些样本彼此有多相关。换句话说,AUROC 是一个协议函数,不是一个物体的固有属性。

已有工作到哪一步。 2025 ROBO046T(Grand + Special)"MobyGlobal: A Real-Time Whale Detection Network"——ESP32 + 水听器浮标,CBAM 模型,训练数据来自 Cornell 与 Watkins Marine Mammal Database。其核心证据原文是 achieving a 0.9784 AUROC score that surpasses the 0.7214 benchmark set by Cornell while on lower parameters。这两个数据集都公开可得,无需复现浮标硬件。本文件结尾归纳的七种可攻击句式里,「与外部数字相减」一行举的正是它。而在更大的背景上:对 ISEF 2025+2026 两届 ROBO 全部 48 篇获奖摘要做子串计数,repeatab 0 次、tolerance 0 次、error bar 0 次、standard deviation 0 次、sensitivity analys 0 次;reproducib 唯一 1 次来自 ROBO043T 的 establishing a reproducible framework for low-resource African sign language recognition——那是对自己工作的形容词,不是可复现性研究。mine_isef 五届全量检索中 reproducibility 零命中。

空白在于:拿自己留出集上的 0.9784 去减一个别人在别的划分、别的评测脚本下得到的 0.7214,这个减法在方法学上不成立,而从来没有人把这两个数放回同一张试卷上重考一次。这个空白适合一年期学生课题:两个数据集公开、音频模型在 CPU 上训练可行(梅尔谱 + 小型 CNN)、零采购;而且结论正负都成立——差距收窄说明原结论主要由协议造成,差距不收窄说明原结论稳健,这条课题不会因为结果方向而报废

3 · 可检验假设

H1 在完全对齐的评测协议下(同一测试划分、同一正负比、同一切片参数、同一评价脚本),自研模型与基准模型的 AUROC 差将从表观的 0.257 收窄到 0.10 以内,即协议差异贡献了表观差距的 ≥ 60%

依据的推算过程:AUROC 的移动幅度由负样本池构成决定。当负类里"明显不像叫声"的静音/低噪段占比上升时,排序任务被系统性地变简单;这一项在纯静音负类与含船噪负类之间通常能拉开零点几的量级差异——具体幅度不能凭空断言,必须由 §6 第 4 步的敏感性扫描实测给出,这里的 0.10 是待否证的门槛而非已知量。之所以敢把门槛放在这里:两个数(0.9784 与 0.7214)来自两套完全独立的数据准备流程,协议一致的先验概率极低。

H2(备择假设,H1 被否证时仍有内容)若协议对齐后差距仍 ≥ 0.20,则差异不能由协议解释;此时残差应与模型容量/注意力结构相关,而随正负比变化。判据是:把两个模型都放到全部协议格上跑,若两条曲线在整个协议空间上平行位移,则差异是模型的;若两条曲线交叉或收敛,则差异是协议的。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 用自建管线在基准数据集的官方划分上复现 0.7214 这个数,偏差 ≤ 0.02 AUROC。这是一次"重测已知标准量":跑不出这个数,说明切片、特征或评价脚本与原基准不同,那么后续任何"对齐"都是自说自话。若官方划分与评测脚本无法取得,本条不能通过——这本身就是主结论的一部分(见 §8 条件 2),此时必须以"该基准协议不可复原"的形式如实报告,而不是用近似值凑一个数上去。
  2. 统计口径预先写死——重抽样单元必须是录音而非片段。 AUROC 的置信区间用自助抽样(bootstrap)给出,重抽样单元为录音/站点(cluster bootstrap),不得以片段为单元:同一录音的相邻片段不独立,按片段重抽样会把置信区间压窄到毫无意义。报告时必须分别给出「同一录音内不同切片的波动」与「不同录音之间的波动」——这两个 n 不是一回事,混用是本类目最常见的错误。
  3. 协议三因子做全因子扫描。 正负比(至少 3 档,例如 1:1 / 1:5 / 1:20)× 片段长度(至少 3 档)× 重叠率(0% / 50%),每格报告 AUROC 与置信区间,产出一张"协议 → AUROC"敏感度表。这张表本身就是主要交付物之一。
  4. 必须报告同口径的前后对比。 自研模型与基准模型都要在两种协议(原始协议、对齐协议)下各测一次,四个数同时报告,并给出"0.257 中协议贡献 Y、残差 Z"的分解,Y 与 Z 均带自助抽样置信区间。
  5. 阴性结果预案(开题时即写好)。 若 Z 的置信区间不跨零且仍大,结论是"原结论在协议对齐后依然成立"——这同样是有效结论,交付物变为一份"跨基准比较何时合法"的判据清单加上敏感度表。
  6. 可复现性。 切片脚本、协议配置文件、评价脚本、模型权重、原始数据校验和(checksum)与下载日期全部开源,第三方一键重跑。

5 · 数据与工具

用途 来源 / 工具
鲸类叫声标注数据(主) Cornell 的鲸鱼检测数据,源文件记载其公开可得。注册与格式转换会花时间,预留 2 周。具体数据集版本号、样本量、采样率与许可条款需核实
第二数据源(外部验证) Watkins Marine Mammal Database,源文件记载其公开可得。通道构成与许可需核实
被比较的外部数字 0.7214 ROBO046T 摘要中引用的 Cornell 基准(仅用于校验与对比,不计入本项目的数据贡献)。其原始划分、评价脚本与版本需核实——这是本课题的命门
特征与模型 梅尔谱 + 小型 CNN。源文件已确认此路线在 CPU 上训练可行
计算环境 笔记本 CPU,零采购,无到货周期
明确不做的部分 ESP32 + 水听器浮标硬件不复现。本课题不评价 MobyGlobal 的硬件,也不需要任何涉水器材

须核实而非引用的量:0.7214 的原始定义——它是哪一版数据、哪个划分、哪个评价脚本下的数,是否有官方 leaderboard 或可下载的划分文件。这一项拿不到,整个"减法"就永远无法验证,而这恰恰会变成结论。② 两个数据集的许可是否允许再分发切片索引(开源交付物依赖此项)。③ 音频读取库的默认重采样率与你所用版本的行为——默认值往往低于原始采样率,会静默截掉高频成分,具体默认值需核实你锁定的版本

6 · 方法路径

  1. 建管线 + 跑通基准复现。 实现切片、特征、训练、评价四段流水线,在官方划分上复现 0.7214(§4 第 1 条硬门槛)。这一步不过不许继续。
  2. 核实数据与工具的能力边界。 本方向已知的静默失败点(不报错但给错结果),逐一验证自己的实现没有踩中: - 重叠切片使同一次叫声的相邻片段同时落入训练集与测试集——片段级泄漏,管线完全不报错,AUROC 会被抬到接近 1; - 按文件名排序划分,导致同一站点、同一天的录音全部集中在一侧,测到的是站点差异而非模型能力; - 梅尔谱的归一化统计量用全数据集计算,测试集统计量泄漏进训练; - 读音频时被静默重采样,频率轴与标注的频段不对应,高频叫声被截掉; - 某个批次里只有一类标签时,AUROC 返回 NaN 或被静默填成 0.5,平均后把结果拉向中间值。
  3. 冻结协议矩阵并写入研究计划,附一次性说明每档取值的依据。此后不得增删协议格。
  4. 跑全因子扫描,产出"协议 → AUROC"敏感度表,同时记录每格的录音级 bootstrap 置信区间。
  5. 完成分解:报告 0.257 中协议贡献 Y 与残差 Z,并按 H2 的判据判断两条曲线是平行位移还是交叉收敛。
  6. 独立交叉校验。 用另一种原理测同一个量:改用平均精度(Average Precision / PR-AUC)重算同一批结果——该指标对正负比的敏感方式与 AUROC 不同,若两者给出的模型排序与协议敏感度方向一致,结论稳健;若不一致,说明结论被指标选择支配,必须在正文中如实报告。再用 Watkins 库做一次完全独立数据源的外部验证。

7 · 新颖性边界

本课题不声称: - 不声称首次指出跨协议比较有问题。评测协议对齐在机器学习方法学文献中是成熟话题,本课题不提出新的统计方法。 - 不声称 MobyGlobal 的模型无效或其结论为假。本课题重测的是"这个减法成不成立",不是"这个模型好不好",两者必须在展板与问答中严格区分。 - 不声称提出新的鲸类叫声检测算法,也不声称首次做鲸类被动声学检测。 - 不声称复现或评价其 ESP32 浮标硬件——本课题完全不涉及硬件。

已有工作做到哪: ROBO046T 报告 achieving a 0.9784 AUROC score that surpasses the 0.7214 benchmark set by Cornell while on lower parameters,两个数来自不同的数据准备流程;本类目 48 篇获奖摘要中 reproducib 仅 1 次命中且是形容词,mine_isef 五届 reproducibility 零命中。

本项目的贡献(属「方法可复现性贡献」型): 已有工作交付的是一个更高的分数;本项目交付的是这个分数在协议对齐后还剩多少,以及一份"跨基准比较什么时候合法"的判据清单。这个分解是主结论,不是附加内容。

为什么有价值: 本类目的量化主张几乎全部没有不确定度,而"与外部数字相减"是其中最常见、也最容易被评委当场追问的一种。给出一个实测的"协议贡献了多少"的数字,任何后来者都可以直接引用来判断自己的比较是否成立。

若结论不显著: 若协议对齐后差距不收窄(Z 的置信区间不跨零且仍大),说明原结论稳健——这同样是有效结论,但必须给出误差棒证明你有能力分辨预期量级的差异,否则等于没做。

8 · 决策门槛(go / no-go)

🔴 条件 1(第 3 周末,2026-08-25):两个数据集全部下载成功并完成格式转换。 源文件已点明这是本条最大的变量:注册与格式转换会花时间,预留 2 周,因此这是一个明确的 go/no-go 项。若 Cornell 数据取不到,降级路径:改用 Watkins 单库自建协议矩阵,主结论框架从"重测跨基准差距"变为"在同一模型上量化协议选择能让 AUROC 移动多少"——敏感度表、分解形式、判据清单全部保留,只是失去与 0.7214 的直接对照。

🟡 条件 2(第 6 周末,2026-09-14):取得 0.7214 的原始评测定义。 若到期仍无法取得该基准的划分与评价脚本,不得用近似值凑一个数。此时明确写入结论:该外部基准的协议不可复原,因此任何以它为减数的比较都无法验证——这本身就是一个完整、可答辩的方法学结论,且直接支撑判据清单的第一条。

2026-12-15:数据采集截止,留 3 周分析与展板。

⚠️ 与「附属赛后不得修改」的冲突点: 协议矩阵的档位(正负比、片段长度、重叠率各取哪几个值)与主指标(AUROC 还是 AP)一旦在附属赛后想改就不被允许。必须在 11 月底前定死。 事后从敏感度表里挑一格对自己有利的当主结果,是选择性报告,属评审最敏感的问题。

须提前核实而非边做边发现的事项: - 数据集许可是否允许再分发切片索引,直接决定可复现性交付物的形态。 - 本文件的证据级别是"基于本地五届语料,未做外部文献核查",且 2022–2024 三届只有标题。"零命中"不等于"不存在前作",学生必须在开题前自己补一轮独立文献检索。 - 数据集是活的,版本可能更新:首次下载即冻结快照并记录日期与校验和。

已知困难及其定位: 0.7214 的协议可能永远无法完全复原。这个困难本身就是研究内容——"一个外部数字的可复现性"正是本课题要测量的对象,所以它不是需要绕开的障碍。

选择前提: 适合能接受"主结论可能是一个否定性方法学结论"、且愿意在评测口径上抠细节的学生。不适合想造硬件或需要现场演示的学生——本课题的展板全是曲线与表格。

预算裁剪顺序: 零成本,无预算可裁。时间不足时的裁剪顺序:先砍 Watkins 外部验证,再砍 PR-AUC 交叉校验,再把全因子扫描降为单因子(只扫正负比)。砍到只剩单因子扫描时,主结论仍是"协议贡献了多少",框架完整。

🔴 展台能否展示实物: 无实物,纯图表——ROC 曲线、协议对照表、分解条形图。浮标硬件不需要,因此完全不受"液体不得上台"这一条影响;无锐器、无电池组、无通电无人机。展台限制对本课题为零。

评分: O=7, W=8, F=8, S=7, Fit=9 → base=76.4,h=5 → [71, 81],置信度:高