ISEF Topic Scoping 2027

B1580–90

n=17、九个预测变量、调整后 R²=0.985:这个模型能预测新病人吗

1 · 研究问题

一项研究用扩散张量成像的微结构指标预测人工耳蜗术后言语识别得分,报告调整后 R² = 0.968(AzBio)与 0.985(CNC)。样本是 17 名人工耳蜗候选者,三条听觉通路 × 三个 DTI 指标 = 9 个候选预测变量。在 n=17、p=9 的情形下:(a) 纯噪声数据能得到多大的调整后 R²?(b) 留一交叉验证下的 R² 是多少(样本外 R² 常常为负)?(c) 若预测变量是从 9 个中挑选出来的,选择过程本身如何抬高 R²? 在预先固定的样本、对照与统计口径下,主效应的方向、幅度和不确定度分别是多少,结论能否在独立留出数据或独立重复中成立?

2 · 研究背景与空白

背景。 这条课题研究的不是“能不能做出一个结果”,而是一个现有结论在测量误差、样本差异和外推条件改变后还能不能站住。核心逻辑是把观察量、真实目标量与混杂因素分开:先用已知答案校验工具,再固定对照和重复单位,最后用误差棒判断差异。只给一个最高分、一次演示或一条相关关系,不能说明方法在新样本上可靠。

已有工作到哪一步。 BEHA032(2026 BEHA Grand Award)"DTI for Predicting Cochlear Implant Outcomes"——摘要原文:"DTI data from 12 normal-hearing controls and 17 CI candidates";概率纤维追踪重建三条中枢听觉通路(斜方体、外侧丘系 LL、下丘臂 BI),沿通路提取三个 DTI 微结构指标,代入普通最小二乘多元线性回归预测术后 CNC 与 AzBio 言语得分;"The MLR models demonstrated high predictive accuracy, accounting for 96.8% of the variance in AzBio scores (adj. R-squared = 0.968) and 98.5% in CNC scores (adj. R-squared = 0.985)"摘要自己写明"the current predictive model is limited by a small longitudinal cohort (n = 5). A larger sample size is required to confirm MLR coefficients and ensure generalizability"——这个自省非常关键,必须原样引用并承认;你的课题不是指出它没意识到问题,而是把它意识到的问题量化。 相关:BEHA035(2025 Grand)脑龄分析(见 B4)、BEHA043(2026 Grand)精神分裂症 fMRI(见 B5)。

空白在于:三个自产结果:(a) 零数据校准——生成 n=17、p=9 的纯随机数据,跑同样的多元线性回归 + 变量选择流程,报告调整后 R² 的零分布;这条零分布是本课题的核心产出,它直接给出"0.985 有多罕见"的答案。(b) 样本外验证:在任何一份公开的 DTI + 行为结局数据上,对比样本内 R² 与留一交叉验证 R²,量化两者落差随 n/p 比的变化。(c) 所需样本量:给定希望的样本外 R²,n 应该是多少——这是给该领域的直接建议。 五字段原文的研究问句是:一项研究用扩散张量成像的微结构指标预测人工耳蜗术后言语识别得分,报告调整后 R² = 0.968(AzBio)与 0.985(CNC)。样本是 17 名人工耳蜗候选者,三条听觉通路 × 三个 DTI 指标 = 9 个候选预测变量。在 n=17、p=9 的情形下:(a) 纯噪声数据能得到多大的调整后 R²?(b) 留一交叉验证下的 R² 是多少(样本外 R² 常常为负)?(c) 若预测变量是从 9 个中挑选出来的,选择过程本身如何抬高 R²? 这适合一年期学生课题,因为可以把主任务裁成一个对象、一个主指标和一个独立复核;即使预期差异不出现,只要校验与统计功效过关,零结果仍能界定已有结论的适用边界。

3 · 可检验假设

H1 在加入本课题预先规定的控制、校正或独立验证后,主指标将沿五字段框架所述预期方向变化,且相对基线变化 ≥ 10% 或标准化效应绝对值 ≥ 0.5;若 95% 置信区间同时排除这两个门槛,则 H1 被否证。两种尺度只选与主指标有意义的一种,并在预实验前写死。

H2 若 H1 被否证,备择机制是假定原观察主要由测量误差、样本构成、基础率、时间漂移或未控制混杂驱动;比较“仅含原变量”与“加入机制变量”的模型,若主效应方向改变或绝对值下降 ≥ 20%,则支持机制解释,否则报告当前分辨率下未找到证据。

4 · 量化验收标准

  1. 方法学校验硬门槛。 用自建管线、装置或代码重跑一个答案已知的合成算例/标准样;主量反算偏差须 ≤ 5%。不过关则停止,且后续全部结论无效。
  2. 统计口径预先写死。 独立样本、技术重复和连续观测分开计数;测量类每个关键条件至少 3 次独立重复,技术重复只估计仪器噪声,并用误差传播或方差分量合成不确定度。极不平衡分类主报 PR-AUC、precision、recall,不以 accuracy 为主,因为全猜多数类也会虚高;时间序列按时间划分并把随机划分仅作泄漏对照。
  3. 正式采集前固定主指标、排除规则、对照、效应方向与 10%(或标准化效应 0.5)判据;报告全部独立重复、效应量和 95% 置信区间,不只报 p 值或最佳一次。
  4. 至少完成一项阴性对照和一项敏感性分析;改变关键阈值、预处理或模型选择时,主结论不得仅由单一任意选择决定。
  5. 用独立批次、独立留出段或第二种原理不同的方法复核主量;不一致时优先报告不一致与误差预算,不平均成一个“更好看”的数字。
  6. 可复现性。 保存原始数据、清洗记录、参数、环境版本、随机种子、脚本和排除日志;第三方应能重建主表与主图。

5 · 数据与工具

用途 来源 / 工具
研究对象与主问题 一项研究用扩散张量成像的微结构指标预测人工耳蜗术后言语识别得分,报告调整后 R² = 0.968(AzBio)与 0.985(CNC)。样本是 17 名人工耳蜗候选者,三条听觉通路 × 三个 DTI 指标 = 9 个候选预测变量。在 n=17、p=9 的情形下:(a) 纯噪声数据能得到多大的调整后 R²?(b) 留一交叉验证下的 R² 是多少(样本外 R² 常常为负)?(c) 若预测变量是从 9 个中挑选出来的,选择过程本身如何抬高 R²?
原创切口 三个自产结果:(a) 零数据校准——生成 n=17、p=9 的纯随机数据,跑同样的多元线性回归 + 变量选择流程,报告调整后 R² 的零分布;这条零分布是本课题的核心产出,它直接给出"0.985 有多罕见"的答案。(b) 样本外验证:在任何一份公开的 DTI + 行为结局数据上,对比样本内 R² 与留一交叉验证 R²,量化两者落差随 n/p 比的变化。(c) 所需样本量:给定希望的样本外 R²,n 应该是多少——这是给该领域的直接建议。
前作与对照基准 BEHA032(2026 BEHA Grand Award)"DTI for Predicting Cochlear Implant Outcomes"——摘要原文:"DTI data from 12 normal-hearing controls and 17 CI candidates";概率纤维追踪重建三条中枢听觉通路(斜方体、外侧丘系 LL、下丘臂 BI),沿通路提取三个 DTI 微结构指标,代入普通最小二乘多元线性回归预测术后 CNC 与 AzBio 言语得分;"The MLR models demonstrated high predictive accuracy, accounting for 96.8% of the variance in AzBio scores (adj. R-squared = 0.968) and 98.5% in CNC scores (adj. R-squared = 0.985)"摘要自己写明"the current predictive model is limited by a small longitudinal cohort (n = 5). A larger sample size is required to confirm MLR coefficients and ensure generalizability"——这个自省非常关键,必须原样引用并承认;你的课题不是指出它没意识到问题,而是把它意识到的问题量化。 相关:BEHA035(2025 Grand)脑龄分析(见 B4)、BEHA043(2026 Grand)精神分裂症 fMRI(见 B5)。;仅用于校验与对比,不计入本项目的数据贡献
数据/样本 需核实:可取得数量、独立单位、标签/测量定义、许可与缺失情况;未确认内容不得写成已具备
分析工具 纯 CPU、16 GB 笔记本可运行的开源工具优先;需核实版本、许可、输入格式、分组/时序划分和不确定度输出能力
校验材料 已知答案的合成数据、标准样或公开基准;仅用于校验与对比,不计入本项目的数据贡献
风险边界 最可能死在被读成"挑一个已经自我承认了局限的项目下手"。规避方式:这恰恰是优点——你可以在摘要里明确写"该研究已正确指出样本量限制;本研究把这一限制转化为可操作的量化指南"。这种定位既尊重前作、又有独立贡献,是本文件中措辞风险最低的高分条目之一。 人类受试者:不触发(零数据模拟 + 公开去标识化影像衍生数据)。

6 · 方法路径

  1. 装环境或搭装置,跑通已知答案算例并完成校验。 锁定版本、单位、坐标/标签定义和误差计算;反算偏差 >5% 时只修方法,不进入正式样本。
  2. 核实工具能力边界并逐条排查静默失败点。 五字段原约束为:最可能死在被读成"挑一个已经自我承认了局限的项目下手"。规避方式:这恰恰是优点——你可以在摘要里明确写"该研究已正确指出样本量限制;本研究把这一限制转化为可操作的量化指南"。这种定位既尊重前作、又有独立贡献,是本文件中措辞风险最低的高分条目之一。 人类受试者:不触发(零数据模拟 + 公开去标识化影像衍生数据)。 此外检查单位或标签错位、全数据预处理泄漏、相关观测冒充独立 n、缺失值静默填 0、默认参数改变口径、输出正常但物理量方向或尺度错误;每项用最小反例测试,不能以“软件未报错”作为通过。
  3. 预注册最小设计。 把主问题收敛为一个对象、一个主指标、一个主要对照;写死样本单位、重复数、阈值、排除规则和降级触发条件。
  4. 采集或整理正式数据。 保留原始输入与时间戳/批次,盲化能盲化的标签;协议偏离当天登记,不覆盖原记录。
  5. 估计主效应与不确定度。 同时报原口径与校正口径,给出误差棒、效应量、失败样本和敏感性曲线;分类、时序或测量问题按 §4 执行。
  6. 检验 H2 与边界条件。 H1 不成立时不临时换题,而是量化测量误差、样本构成、基础率、时间漂移或混杂能解释多少。
  7. 独立交叉校验。 使用独立批次、留出时间段或第二种原理不同的方法复算主量;失败时以“不一致”为主结果,不选择性保留支持预期的路径。

7 · 新颖性边界

本课题不声称什么: 不声称首次进入该主题,不声称重新发现或推翻前作,也不把前作的项目编号、年份、奖级、引文和数字据为本项目结果;具体已有工作是:BEHA032(2026 BEHA Grand Award)"DTI for Predicting Cochlear Implant Outcomes"——摘要原文:"DTI data from 12 normal-hearing controls and 17 CI candidates";概率纤维追踪重建三条中枢听觉通路(斜方体、外侧丘系 LL、下丘臂 BI),沿通路提取三个 DTI 微结构指标,代入普通最小二乘多元线性回归预测术后 CNC 与 AzBio 言语得分;"The MLR models demonstrated high predictive accuracy, accounting for 96.8% of the variance in AzBio scores (adj. R-squared = 0.968) and 98.5% in CNC scores (adj. R-squared = 0.985)"摘要自己写明"the current predictive model is limited by a small longitudinal cohort (n = 5). A larger sample size is required to confirm MLR coefficients and ensure generalizability"——这个自省非常关键,必须原样引用并承认;你的课题不是指出它没意识到问题,而是把它意识到的问题量化。 相关:BEHA035(2025 Grand)脑龄分析(见 B4)、BEHA043(2026 Grand)精神分裂症 fMRI(见 B5)。

已有工作做到哪一步: 五字段证据表明前作已完成其原始对象、方法或性能演示;本项目完整保留这条事实,不把摘要未写出的信息推断为“没有做”。数据集、器材规格、价格、货期或外部文献的任何补充均标为“需核实”。

本项目贡献(属「评价维度转换」;若使用全新独立对象则同时属「新样本独立检验」,若核心是校准与脚本则同时属「方法可复现性贡献」): 三个自产结果:(a) 零数据校准——生成 n=17、p=9 的纯随机数据,跑同样的多元线性回归 + 变量选择流程,报告调整后 R² 的零分布;这条零分布是本课题的核心产出,它直接给出"0.985 有多罕见"的答案。(b) 样本外验证:在任何一份公开的 DTI + 行为结局数据上,对比样本内 R² 与留一交叉验证 R²,量化两者落差随 n/p 比的变化。(c) 所需样本量:给定希望的样本外 R²,n 应该是多少——这是给该领域的直接建议。 主结论是原结论在预注册控制与独立复核下的效应幅度及适用边界,不是附带造一个更复杂模型或装置。

为何有价值: 它把“看起来有效”转换为“在多大误差、何种样本和什么阈值下仍有效”。差异不显著同样是有效结论,但必须给出误差棒证明有能力分辨预注册的 10% 相对变化或标准化效应 0.5;置信区间过宽只能写“测不出来”。

8 · 决策门槛(go / no-go)

第 5 周末必须同时满足:校验偏差 ≤ 5%、至少取得计划独立样本的 20%、主指标能从原始输入稳定重算。任一不满足,立即启动具名降级路径 “单对象能力边界标定”:砍掉多对象/多模型比较,只保留最可得的一种对象、一个主指标和一个独立复核,转而报告误差、敏感性与最小可分辨效应;主结论仍是“原结论在什么条件下站得住”。

与“附属赛后不得修改”的冲突点:主指标、阈值、样本排除、对照、预处理和降级触发条件必须赛前定死。须提前核实: 最可能死在被读成"挑一个已经自我承认了局限的项目下手"。规避方式:这恰恰是优点——你可以在摘要里明确写"该研究已正确指出样本量限制;本研究把这一限制转化为可操作的量化指南"。这种定位既尊重前作、又有独立贡献,是本文件中措辞风险最低的高分条目之一。 人类受试者:不触发(零数据模拟 + 公开去标识化影像衍生数据)。 同时核实许可、设备/软件真实能力、场地、表格和采购可得性。已知困难及其定位:这些限制就是能力边界,不用未经核实的规格填补。选择前提:学生愿意做重复、校验和零结果解释。预算裁剪顺序:先砍多模型/多材料,再砍次要指标,再砍展示性装置;不得砍校验、主要对照、独立重复和交叉验证。

净实验窗口按 2026-08 至 12 月约 3–4 个月规划。按实际对象核实合规:附属赛后项目不得更改;展台禁液体(含水)、土壤、玻璃、锐器、化学品、干燥粉末、>100 Wh 电池和通电无人机,禁网址与二维码;家中不得培养任何潜在危险生物制剂;涉及脊椎动物、人类受试者、激光、高真空或 SDS 标注的致癌致畸化学品时,须在相应动作前确认审批。AI 不得用于撰写研究计划、摘要、展板或引文。

评分: O=8, W=9, F=9, S=7, Fit=10 → base=85.0,h=5 → [80, 90],置信度:高


自己继续找题

bash python3 analysis/mine_isef.py --cat BEHA --awarded-only "你感兴趣的关键词" python3 analysis/score_topics.py your_scores.tsv

动作永远是同一个:拿一个近届获奖作品,问它没问的那个关于自身有效性的问题。

但在 BEHA,还有一道前置筛子:你的那个问题能不能在不接触活人的前提下回答? 如果不能,无论问题多好都要放弃——IRB 在招募之前批准,这一条没有任何余地。

本赛道最高产的六种问法:

  1. 零结果的功效是多少。 B1 是这么来的。"没发现关联"只有配上"我们能发现多大的关联"才是证据。
  2. 标签是怎么定义的。 B2、B3 都是这么来的。凡是准确率 ≥ 99%,先查标签的构造方式。
  3. 因果推断的标准稳健性套件跑了吗。 B6、B10 都是这么来的。平行趋势、安慰剂、设定曲线、置换推断——这四项在本类目获奖项目里的报告率接近零。
  4. 样本量与效应量的关系。 B12、B14、B15 都是这么来的。n<30 配 d>1.5 是一个可以量化的信号。
  5. 刺激材料有几个。 B13 是这么来的。每个条件只有一段音频、一张图片、一段文字,就无法把条件效应与材料效应分开。
  6. 参数/种子/阈值换一个还成立吗。 B7、B11 都是这么来的。

几条本文件核查过但没写成课题的线索,留给你: - BEHA043(2026 Grand) 的"预后头"把被试分成"稳定对照 / 治疗响应型 / 进展性精神病"三类,摘要自己写这是 "a stratification previously impossible without longitudinal clinical observation"——那么它的训练标签从哪来? 这是一个比站点混杂更尖锐的问题(但也更依赖于拿到原文细节)。 - BEHA009(2025 Special) 报告社交媒体使用与心理健康的相关只有 r = -0.23,但基于同一批数据的分类模型 F1 > 0.91。r=-0.23 与 F1=0.91 在同一份数据上很难同时成立——这个内部不一致值得追问(多半来自类别不平衡下的 F1 定义或阈值选择)。 - BEHA023(2026 Grand,Friend or Foe) 让 20 名学生先做 Test 1(无奖励)后做 Test 2(有手机奖励),顺序完全没有平衡,因此"奖励降低成绩"与"疲劳/顺序效应"无法区分。这是一个教科书级的混淆,但要重做需要人类受试者。离线可行的替代:用公开的重复测量数据集量化顺序效应的典型大小,说明它足以解释观察到的差值。 - BEHA066(2025 Grand) 把分区 GIS 数据与肠道菌群、心血管代谢健康联系起来(n=1,656),用 SHAP 找出"混合用途邻近度"为最重要特征。空间自相关会同时抬高特征重要性与显著性——空间零模型(Moran 谱随机化)是标准检验,摘要中没有。 - BEHA044(2025 Grand,Investigating Intersubjective Realities) 用递归量化分析(RQA)研究观点变化——RQA 结果对嵌入维数、时间延迟、递归半径三个参数极度敏感,这是与 B7 平行的一条线索。


一条规矩

凡是"某项目做了/没做 X"的判断,必须回摘要原文核对。

本文件里有三条的核心前提尚待核实,已在各自的"约束"栏写明退路:B13(原研究每个口音用了几位说话人)、B12(eiBraille 的年份标注与本地语料不一致)、B9(新颖性边界——媒体众包数据库与官方统计的对比在文献中可能已被反复做过)。

同时必须承认:BEHA032 与 BEHA056 的摘要都主动写明了自己的局限(前者写"n=5 的纵向队列限制了泛化性",后者写"sampling toward N=480 ongoing")。你的课题绝不能表现得像是发现了它们没意识到的问题——你要做的是把它们自己指出的问题量化成可操作的数字。这个措辞差别,在评委面前是"严谨"与"傲慢"的差别。

每一条"它没做 X",你都要能当场翻到摘要的那一段。