C1575–85
换一个内参基因,那个「显著上调」还在吗
1 · 研究问题
qPCR 相对定量结果对内参(housekeeping)基因选择的敏感性有多大?在应激、增殖抑制、生长因子刺激这三类常见处理下,常用内参(GAPDH、ACTB、18S、TUBB)自身的表达变化了多少?换一个内参,报告的目标基因倍数变化会移动多少? 在预先固定的样本、对照与统计口径下,主效应的方向、幅度和不确定度分别是多少,结论能否在独立留出数据或独立重复中成立?
2 · 研究背景与空白
背景。 这条课题研究的不是“能不能做出一个结果”,而是一个现有结论在测量误差、样本差异和外推条件改变后还能不能站住。核心逻辑是把观察量、真实目标量与混杂因素分开:先用已知答案校验工具,再固定对照和重复单位,最后用误差棒判断差异。只给一个最高分、一次演示或一条相关关系,不能说明方法在新样本上可靠。
已有工作到哪一步。 ISEF 2026 BCHM029(Special Award)「The Role of VEGF and FGF21 in Restoring Endostatin」,摘要原文:「After primary neonatal rat ventricular myocytes (NRVMs) were cultured and treated with Endostatin (0.2 µg/mL) by the Qualified Scientist, either alone or following pre-treatment with vascular endothelial growth factor (VEGF) or fibroblast growth factor 21 (FGF21), the Finalist evaluated cardiomyocyte growth by measuring cell size via microscopy. Hypertrophic gene expression (Nppa and Nppb) was then quantified using RT-qPCR and normalized against housekeeping genes.(…)Endostatin treatment significantly reduced both cell size and hypertrophic gene expression, indicating suppression of growth pathways. Pre-treatment with VEGF or FGF21 reversed these effects, restoring both molecular and structural markers of cardiomyocyte growth.」它用 RT-qPCR 相对内参基因定量肥大标志物 Nppa/Nppb,摘要中未说明使用了哪些内参,也未报告内参稳定性验证。 而心肌细胞肥大恰恰是内参最不稳定的场景之一——肥大意味着细胞体积、总 RNA 量、代谢速率同时变化,这三者都会影响常用内参。同时该项目还用「显微镜下的细胞面积」作为肥大读数——而细胞铺展面积受贴壁与细胞骨架影响,VEGF 本身就是已知的细胞骨架/铺展调节因子。这是第二条可以问的线,但需要细胞实验才能查。
(另注该摘要的一个细节:它明确区分了「由合格科学家完成」与「由参赛者完成」的步骤。这是 2027 强化的 Form 2A/2B/2C 披露方向所鼓励的做法,值得学习。)
文献前作:未核查(内参基因稳定性有 Vandesompele 等人 2002 年的 geNorm 奠基论文与 MIQE 指南(Bustin et al. 2009,明确要求报告内参验证),必查。MIQE 指南的存在意味着这是社区已有共识——你的贡献只能是「按条件分类的定量偏差表」,不能是「发现应该验证内参」)。
空白在于:一次内参稳定性的系统检验,全部用公开 RNA-seq 数据完成,零成本、零合规。 qPCR 的相对定量(ΔΔCt)的全部有效性建立在一个假设上:内参基因在所有实验条件下表达恒定。 而这个假设在应激条件下经常不成立——GAPDH 是糖酵解酶,在缺氧和代谢应激下显著上调;ACTB 在细胞骨架重塑(正是 EMT、肥大、迁移类研究的核心过程)中变化;18S 在核糖体生物合成变化时移动。换句话说:内参最不稳定的场合,恰恰是生化课题最常研究的场合。 你的设计:(1) 从 GEO/ArrayExpress 收集若干配对的处理–对照 RNA-seq 数据集,覆盖氧化应激、生长因子刺激、增殖抑制、肥大刺激等条件;(2) 提取常用内参基因的表达值,量化它们在各条件下的变化倍数;(3) 模拟 qPCR 分析:用 RNA-seq 的全局归一化结果作为「真值」,分别用每个内参做 ΔΔCt 归一化,计算目标基因倍数变化的偏差;(4) 用 geNorm / NormFinder 算法排出各条件下的最优内参;(5) 交付一张「按实验条件分类的内参推荐表 + 误用内参的典型偏差幅度」。 五字段原文的研究问句是:qPCR 相对定量结果对内参(housekeeping)基因选择的敏感性有多大?在应激、增殖抑制、生长因子刺激这三类常见处理下,常用内参(GAPDH、ACTB、18S、TUBB)自身的表达变化了多少?换一个内参,报告的目标基因倍数变化会移动多少? 这适合一年期学生课题,因为可以把主任务裁成一个对象、一个主指标和一个独立复核;即使预期差异不出现,只要校验与统计功效过关,零结果仍能界定已有结论的适用边界。
3 · 可检验假设
H1 在加入本课题预先规定的控制、校正或独立验证后,主指标将沿五字段框架所述预期方向变化,且相对基线变化 ≥ 10% 或标准化效应绝对值 ≥ 0.5;若 95% 置信区间同时排除这两个门槛,则 H1 被否证。两种尺度只选与主指标有意义的一种,并在预实验前写死。
H2 若 H1 被否证,备择机制是假定原观察主要由测量误差、样本构成、基础率、时间漂移或未控制混杂驱动;比较“仅含原变量”与“加入机制变量”的模型,若主效应方向改变或绝对值下降 ≥ 20%,则支持机制解释,否则报告当前分辨率下未找到证据。
4 · 量化验收标准
- 方法学校验硬门槛。 用自建管线、装置或代码重跑一个答案已知的合成算例/标准样;主量反算偏差须 ≤ 5%。不过关则停止,且后续全部结论无效。
- 统计口径预先写死。 独立样本、技术重复和连续观测分开计数;测量类每个关键条件至少 3 次独立重复,技术重复只估计仪器噪声,并用误差传播或方差分量合成不确定度。极不平衡分类主报 PR-AUC、precision、recall,不以 accuracy 为主,因为全猜多数类也会虚高;时间序列按时间划分并把随机划分仅作泄漏对照。
- 正式采集前固定主指标、排除规则、对照、效应方向与 10%(或标准化效应 0.5)判据;报告全部独立重复、效应量和 95% 置信区间,不只报 p 值或最佳一次。
- 至少完成一项阴性对照和一项敏感性分析;改变关键阈值、预处理或模型选择时,主结论不得仅由单一任意选择决定。
- 用独立批次、独立留出段或第二种原理不同的方法复核主量;不一致时优先报告不一致与误差预算,不平均成一个“更好看”的数字。
- 可复现性。 保存原始数据、清洗记录、参数、环境版本、随机种子、脚本和排除日志;第三方应能重建主表与主图。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 研究对象与主问题 | qPCR 相对定量结果对内参(housekeeping)基因选择的敏感性有多大?在应激、增殖抑制、生长因子刺激这三类常见处理下,常用内参(GAPDH、ACTB、18S、TUBB)自身的表达变化了多少?换一个内参,报告的目标基因倍数变化会移动多少? |
| 原创切口 | 一次内参稳定性的系统检验,全部用公开 RNA-seq 数据完成,零成本、零合规。 qPCR 的相对定量(ΔΔCt)的全部有效性建立在一个假设上:内参基因在所有实验条件下表达恒定。 而这个假设在应激条件下经常不成立——GAPDH 是糖酵解酶,在缺氧和代谢应激下显著上调;ACTB 在细胞骨架重塑(正是 EMT、肥大、迁移类研究的核心过程)中变化;18S 在核糖体生物合成变化时移动。换句话说:内参最不稳定的场合,恰恰是生化课题最常研究的场合。 你的设计:(1) 从 GEO/ArrayExpress 收集若干配对的处理–对照 RNA-seq 数据集,覆盖氧化应激、生长因子刺激、增殖抑制、肥大刺激等条件;(2) 提取常用内参基因的表达值,量化它们在各条件下的变化倍数;(3) 模拟 qPCR 分析:用 RNA-seq 的全局归一化结果作为「真值」,分别用每个内参做 ΔΔCt 归一化,计算目标基因倍数变化的偏差;(4) 用 geNorm / NormFinder 算法排出各条件下的最优内参;(5) 交付一张「按实验条件分类的内参推荐表 + 误用内参的典型偏差幅度」。 |
| 前作与对照基准 | ISEF 2026 BCHM029(Special Award)「The Role of VEGF and FGF21 in Restoring Endostatin」,摘要原文:「After primary neonatal rat ventricular myocytes (NRVMs) were cultured and treated with Endostatin (0.2 µg/mL) by the Qualified Scientist, either alone or following pre-treatment with vascular endothelial growth factor (VEGF) or fibroblast growth factor 21 (FGF21), the Finalist evaluated cardiomyocyte growth by measuring cell size via microscopy. Hypertrophic gene expression (Nppa and Nppb) was then quantified using RT-qPCR and normalized against housekeeping genes.(…)Endostatin treatment significantly reduced both cell size and hypertrophic gene expression, indicating suppression of growth pathways. Pre-treatment with VEGF or FGF21 reversed these effects, restoring both molecular and structural markers of cardiomyocyte growth.」它用 RT-qPCR 相对内参基因定量肥大标志物 Nppa/Nppb,摘要中未说明使用了哪些内参,也未报告内参稳定性验证。 而心肌细胞肥大恰恰是内参最不稳定的场景之一——肥大意味着细胞体积、总 RNA 量、代谢速率同时变化,这三者都会影响常用内参。同时该项目还用「显微镜下的细胞面积」作为肥大读数——而细胞铺展面积受贴壁与细胞骨架影响,VEGF 本身就是已知的细胞骨架/铺展调节因子。这是第二条可以问的线,但需要细胞实验才能查。 (另注该摘要的一个细节:它明确区分了「由合格科学家完成」与「由参赛者完成」的步骤。这是 2027 强化的 Form 2A/2B/2C 披露方向所鼓励的做法,值得学习。) 文献前作:未核查(内参基因稳定性有 Vandesompele 等人 2002 年的 geNorm 奠基论文与 MIQE 指南(Bustin et al. 2009,明确要求报告内参验证),必查。MIQE 指南的存在意味着这是社区已有共识——你的贡献只能是「按条件分类的定量偏差表」,不能是「发现应该验证内参」)。;仅用于校验与对比,不计入本项目的数据贡献 |
| 数据/样本 | 需核实:可取得数量、独立单位、标签/测量定义、许可与缺失情况;未确认内容不得写成已具备 |
| 分析工具 | 纯 CPU、16 GB 笔记本可运行的开源工具优先;需核实版本、许可、输入格式、分组/时序划分和不确定度输出能力 |
| 校验材料 | 已知答案的合成数据、标准样或公开基准;仅用于校验与对比,不计入本项目的数据贡献 |
| 风险边界 | 可行性极高(F=9):零成本、纯计算、零合规。最可能死在新颖性——MIQE 指南已经要求这件事十几年了。最便宜的规避方式: 让交付物变成一个面向学生的查询工具:输入你的实验条件类型(应激/增殖/分化/肥大),输出推荐内参与「若误用 GAPDH,预期偏差幅度」。并用本地 ISEF 语料统计一个附加发现:近两届 BCHM/BMED/TMED 获奖摘要中,有多少个报告了 qPCR 但未提及内参验证——这个统计本身就是一个独有的、别人做不出来的量化结果,而且直接把方法学问题与你的赛道连接起来。 |
6 · 方法路径
- 装环境或搭装置,跑通已知答案算例并完成校验。 锁定版本、单位、坐标/标签定义和误差计算;反算偏差 >5% 时只修方法,不进入正式样本。
- 核实工具能力边界并逐条排查静默失败点。 五字段原约束为:可行性极高(F=9):零成本、纯计算、零合规。最可能死在新颖性——MIQE 指南已经要求这件事十几年了。最便宜的规避方式: 让交付物变成一个面向学生的查询工具:输入你的实验条件类型(应激/增殖/分化/肥大),输出推荐内参与「若误用 GAPDH,预期偏差幅度」。并用本地 ISEF 语料统计一个附加发现:近两届 BCHM/BMED/TMED 获奖摘要中,有多少个报告了 qPCR 但未提及内参验证——这个统计本身就是一个独有的、别人做不出来的量化结果,而且直接把方法学问题与你的赛道连接起来。 此外检查单位或标签错位、全数据预处理泄漏、相关观测冒充独立 n、缺失值静默填 0、默认参数改变口径、输出正常但物理量方向或尺度错误;每项用最小反例测试,不能以“软件未报错”作为通过。
- 预注册最小设计。 把主问题收敛为一个对象、一个主指标、一个主要对照;写死样本单位、重复数、阈值、排除规则和降级触发条件。
- 采集或整理正式数据。 保留原始输入与时间戳/批次,盲化能盲化的标签;协议偏离当天登记,不覆盖原记录。
- 估计主效应与不确定度。 同时报原口径与校正口径,给出误差棒、效应量、失败样本和敏感性曲线;分类、时序或测量问题按 §4 执行。
- 检验 H2 与边界条件。 H1 不成立时不临时换题,而是量化测量误差、样本构成、基础率、时间漂移或混杂能解释多少。
- 独立交叉校验。 使用独立批次、留出时间段或第二种原理不同的方法复算主量;失败时以“不一致”为主结果,不选择性保留支持预期的路径。
7 · 新颖性边界
本课题不声称什么: 不声称首次进入该主题,不声称重新发现或推翻前作,也不把前作的项目编号、年份、奖级、引文和数字据为本项目结果;具体已有工作是:ISEF 2026 BCHM029(Special Award)「The Role of VEGF and FGF21 in Restoring Endostatin」,摘要原文:「After primary neonatal rat ventricular myocytes (NRVMs) were cultured and treated with Endostatin (0.2 µg/mL) by the Qualified Scientist, either alone or following pre-treatment with vascular endothelial growth factor (VEGF) or fibroblast growth factor 21 (FGF21), the Finalist evaluated cardiomyocyte growth by measuring cell size via microscopy. Hypertrophic gene expression (Nppa and Nppb) was then quantified using RT-qPCR and normalized against housekeeping genes.(…)Endostatin treatment significantly reduced both cell size and hypertrophic gene expression, indicating suppression of growth pathways. Pre-treatment with VEGF or FGF21 reversed these effects, restoring both molecular and structural markers of cardiomyocyte growth.」它用 RT-qPCR 相对内参基因定量肥大标志物 Nppa/Nppb,摘要中未说明使用了哪些内参,也未报告内参稳定性验证。 而心肌细胞肥大恰恰是内参最不稳定的场景之一——肥大意味着细胞体积、总 RNA 量、代谢速率同时变化,这三者都会影响常用内参。同时该项目还用「显微镜下的细胞面积」作为肥大读数——而细胞铺展面积受贴壁与细胞骨架影响,VEGF 本身就是已知的细胞骨架/铺展调节因子。这是第二条可以问的线,但需要细胞实验才能查。
(另注该摘要的一个细节:它明确区分了「由合格科学家完成」与「由参赛者完成」的步骤。这是 2027 强化的 Form 2A/2B/2C 披露方向所鼓励的做法,值得学习。)
文献前作:未核查(内参基因稳定性有 Vandesompele 等人 2002 年的 geNorm 奠基论文与 MIQE 指南(Bustin et al. 2009,明确要求报告内参验证),必查。MIQE 指南的存在意味着这是社区已有共识——你的贡献只能是「按条件分类的定量偏差表」,不能是「发现应该验证内参」)。
已有工作做到哪一步: 五字段证据表明前作已完成其原始对象、方法或性能演示;本项目完整保留这条事实,不把摘要未写出的信息推断为“没有做”。数据集、器材规格、价格、货期或外部文献的任何补充均标为“需核实”。
本项目贡献(属「评价维度转换」;若使用全新独立对象则同时属「新样本独立检验」,若核心是校准与脚本则同时属「方法可复现性贡献」): 一次内参稳定性的系统检验,全部用公开 RNA-seq 数据完成,零成本、零合规。 qPCR 的相对定量(ΔΔCt)的全部有效性建立在一个假设上:内参基因在所有实验条件下表达恒定。 而这个假设在应激条件下经常不成立——GAPDH 是糖酵解酶,在缺氧和代谢应激下显著上调;ACTB 在细胞骨架重塑(正是 EMT、肥大、迁移类研究的核心过程)中变化;18S 在核糖体生物合成变化时移动。换句话说:内参最不稳定的场合,恰恰是生化课题最常研究的场合。 你的设计:(1) 从 GEO/ArrayExpress 收集若干配对的处理–对照 RNA-seq 数据集,覆盖氧化应激、生长因子刺激、增殖抑制、肥大刺激等条件;(2) 提取常用内参基因的表达值,量化它们在各条件下的变化倍数;(3) 模拟 qPCR 分析:用 RNA-seq 的全局归一化结果作为「真值」,分别用每个内参做 ΔΔCt 归一化,计算目标基因倍数变化的偏差;(4) 用 geNorm / NormFinder 算法排出各条件下的最优内参;(5) 交付一张「按实验条件分类的内参推荐表 + 误用内参的典型偏差幅度」。 主结论是原结论在预注册控制与独立复核下的效应幅度及适用边界,不是附带造一个更复杂模型或装置。
为何有价值: 它把“看起来有效”转换为“在多大误差、何种样本和什么阈值下仍有效”。差异不显著同样是有效结论,但必须给出误差棒证明有能力分辨预注册的 10% 相对变化或标准化效应 0.5;置信区间过宽只能写“测不出来”。
8 · 决策门槛(go / no-go)
第 5 周末必须同时满足:校验偏差 ≤ 5%、至少取得计划独立样本的 20%、主指标能从原始输入稳定重算。任一不满足,立即启动具名降级路径 “单对象能力边界标定”:砍掉多对象/多模型比较,只保留最可得的一种对象、一个主指标和一个独立复核,转而报告误差、敏感性与最小可分辨效应;主结论仍是“原结论在什么条件下站得住”。
与“附属赛后不得修改”的冲突点:主指标、阈值、样本排除、对照、预处理和降级触发条件必须赛前定死。须提前核实: 可行性极高(F=9):零成本、纯计算、零合规。最可能死在新颖性——MIQE 指南已经要求这件事十几年了。最便宜的规避方式: 让交付物变成一个面向学生的查询工具:输入你的实验条件类型(应激/增殖/分化/肥大),输出推荐内参与「若误用 GAPDH,预期偏差幅度」。并用本地 ISEF 语料统计一个附加发现:近两届 BCHM/BMED/TMED 获奖摘要中,有多少个报告了 qPCR 但未提及内参验证——这个统计本身就是一个独有的、别人做不出来的量化结果,而且直接把方法学问题与你的赛道连接起来。 同时核实许可、设备/软件真实能力、场地、表格和采购可得性。已知困难及其定位:这些限制就是能力边界,不用未经核实的规格填补。选择前提:学生愿意做重复、校验和零结果解释。预算裁剪顺序:先砍多模型/多材料,再砍次要指标,再砍展示性装置;不得砍校验、主要对照、独立重复和交叉验证。
净实验窗口按 2026-08 至 12 月约 3–4 个月规划。按实际对象核实合规:附属赛后项目不得更改;展台禁液体(含水)、土壤、玻璃、锐器、化学品、干燥粉末、>100 Wh 电池和通电无人机,禁网址与二维码;家中不得培养任何潜在危险生物制剂;涉及脊椎动物、人类受试者、激光、高真空或 SDS 标注的致癌致畸化学品时,须在相应动作前确认审批。AI 不得用于撰写研究计划、摘要、展板或引文。
评分: O=7, W=9, F=9, S=7, Fit=8 → base=79.8,h=5 → [75, 85],置信度:高
自己继续找题
上面 15 条全部是同一个动作:拿一个近届获奖作品,问它没问的那个关于自身有效性的问题。
操作流程:
bash
python3 analysis/mine_isef.py --cat BCHM --awarded-only "你感兴趣的关键词"
检索 ISEF 2022–2026 五届。然后去读它的完整摘要原文(/Volumes/Mac-Mini/workspaces/tian2-edu/ISEF-Scrape/output/projects-2025-full/ 与 projects-2026-awards/ 下的 manifest.json)。只读标题就断言「它没做 X」是这个流程唯一的致命伤。
BCHM 专属的六个高产提问角度(本文件 15 条全部落在这六类里):
- 阴性对照在哪? MIP 缺 NIP(C5)、多酚缺去污剂/过氧化氢酶(C6)、肽缺反离子与乱序对照(C7)、划痕缺增殖阻断(C9)、荧光缺内滤光校正(C10)。这是本赛道最大的结构性缺口,而且这些对照全都很便宜。
- 这个「特异性」工具真的特异吗? apocynin / PBA(C8)、p300 抑制剂(C13)、单条错配序列(C11)。问:它还会影响什么?
- 这个读数测的是它说的那个东西吗? 浊度 vs β-折叠(C4)、TLC 灰度 vs 真实浓度(C12)、内参归一化后的倍数变化(C15)。
- 计算结果的可信区间是什么? AlphaFold 置信度(C2)、跨界使用的打分函数(C3)、外推出训练域的 ML 预测(C1)。
- 报告的精度涵盖哪几层变异?(C14)「CV<12%」——同一天还是不同天?同一批蛋白还是不同批?
- 它自己摘要里有没有两个互相拉扯的数字?(C1 的 243,088 vs 456,561、7,108,495 vs 251,422;C12 的 44.5 µM vs 1.34 g/L)这是最富矿的一类:诚实的作者会把自己的问题写在摘要里,你只要读得够仔细。
否决顺序(前两步零成本):
① 是否触发人类受试者 / 朊样蛋白 / 生物合规红线 ② 时间窗口(净 3–4 个月)+ 表征可得性 + SDS 检查——「我要声称的那件事,需要哪台仪器才能证明?我要用的每一种化学品,SDS 上写了什么?」这两问零成本,但决定生死。 ③ ISEF 近五届有无同题(用上面的脚本) ④ 文献前作(本文件全部空缺,必须自己补)
最后三句实话:
第一, 本赛道的方法学文献极其成熟。你几乎不可能「发现」一个新的方法学问题——PAINS、内参验证、印迹因子、适用域,全都有二十年以上的文献。 但这不毁掉你的课题:你的贡献不是概念,是在低成本、学生可及条件下的定量标定与可操作阈值。 这个定位必须从第一句话就写清楚,否则评委的第一个问题就会把你问倒。
第二, 本文件评分最高的几条(C2、C1、C15)全部是零成本纯计算。这不是巧合——在一个表征门槛极高的赛道里,没有实验室的学生唯一的结构性优势,就是那些不需要仪器、只需要严谨思考的问题。
第三, 评分区间反映的是我的证据量,不是你的项目质量。评委看的是你答不答得出他的追问——在这个赛道,那个追问几乎总是:「你的对照组是什么?」