B08
已发表两样本孟德尔随机化因果宣称的系统性复核:用更新后的 GWAS 摘要统计重跑,检验重现率与工具变量强度、多效性检验完备性的关系
1 · 研究问题
从近五年文献中系统抽取 ≥ 60 条两样本孟德尔随机化(two-sample Mendelian randomization, MR)发表的"显著因果效应"宣称,用发表之后才出现的更大样本 GWAS 摘要统计在统一管线下重跑,有多大比例的效应方向一致且仍达显著?重现率能否由原研究的工具变量强度(F 统计量)、工具 SNP 数、以及原文是否完整报告了多效性(pleiotropy)敏感性分析来预测?
2 · 研究背景与空白
背景。 MR 用与暴露相关的遗传变异作为工具变量(instrumental variable)估计暴露对结局的因果效应,理论上可规避混杂与反向因果。因为全基因组关联研究(GWAS)摘要统计大量公开,两样本 MR 的执行成本极低——一台笔记本、一个 R 包、几分钟即可产出一篇论文。结果是过去五年 MR 论文数量爆炸式增长,其中大量是"暴露 X 对疾病 Y 有因果效应"的单一宣称,方法学质量参差。
已有工作到哪一步。 方法学社区已充分意识到问题:多项基准工作系统比较了 IVW、MR-Egger、加权中位数、MR-PRESSO、MR-APSS 等估计量在不同工具阈值(5×10⁻⁸ 至 5×10⁻⁵)下的表现,并指出部分方法对阈值高度敏感、部分方法(如 MR-APSS)复现性更好;2026 年一项工作重新评估了两样本 MR 中的工具强度问题。STROBE-MR 报告规范也已发布。
空白在于:这些工作都在方法层面做模拟与基准比较,没有人对已发表的具体因果宣称做一次系统的、以更新数据为自变量的复核审计。 也就是说,我们知道 MR 方法可能不稳,但不知道文献中已经写进摘要的那些结论有多少经得起数据更新。这个空白适合学生课题:GWAS 摘要统计是聚合级公开数据、算力近乎为零、方法学完全公开、结论正负都成立(重现率高则为 MR 文献正名;重现率低则给出一个可引用的折扣系数与风险因子清单)。
3 · 可检验假设
- H1:在更新后的 GWAS 上重跑,已发表 MR 宣称中效应方向一致且 BH-FDR < 0.05 的比例 ≤ 60%;且该重现率随原研究工具变量的平均 F 统计量分档单调上升,最高档与最低档之差 ≥ 25 个百分点(自助法 95% 置信区间不跨 0)。
- H2(机制假设):原文未完整报告多效性敏感性分析(未同时报 MR-Egger 截距、加权中位数与留一分析)的宣称,其重现率显著低于完整报告组,差值 ≥ 20 个百分点;且不重现的宣称在重跑中更常出现 MR-Egger 截距显著(水平多效性证据)与 Cochran's Q 异质性显著。若 H2 被否证,说明报告完备性不是有效的质量筛选信号,则需另找预测子(如样本重叠比例、暴露的遗传力)。
4 · 量化验收标准
- 方法学校验(硬门槛):先做"同数据复现"——选 10 条原文明确给出所用 GWAS 数据集编号与工具 SNP 清单的宣称,在原文所用的同一版本 GWAS 上用自建管线重跑,要求 ≥ 8 条的 IVW 效应估计与原文报告值的相对偏差 ≤ 15%,且 95% 置信区间与原文区间重叠。若 < 8 条达标,说明管线或数据对齐有误,全部后续审计结论无效。
- 统计口径预先写死:(a) 主估计量为逆方差加权(IVW,随机效应),并强制同时报 MR-Egger、加权中位数、加权众数四种估计量,"重现"定义为 IVW 方向一致 + BH-FDR < 0.05 + 至少两种稳健估计量方向一致,定义在开工前冻结;(b) 多重检验一律报 BH-FDR,不报裸 p 值;(c) 每条分析必须报平均 F 统计量(工具强度)与 Cochran's Q(异质性),F < 10 的分析标记为弱工具并单独统计;(d) 工具选择阈值固定为 5×10⁻⁸ + 局部 LD 剪枝(r² < 0.001,10 Mb 窗),并另做 5×10⁻⁶ 的敏感性分析,两套结果都报;(e) 重现率的分档比较用 1,000 次自助法(按宣称重抽样)给 95% 置信区间;(f) 样本量为 60–100 条宣称,须先做检验力估计:在此规模下能以 80% 检验力检出的最小分档差值是多少,写入方案;若大于 25 个百分点,必须扩大宣称数。
- 样本重叠必须显式处理:两样本 MR 的核心假设之一是暴露与结局 GWAS 来自不重叠人群。每条分析必须估计并报告样本重叠比例(依据各 GWAS 的队列构成),重叠 > 20% 的分析单独标记并做偏倚方向讨论;这一项在大量已发表 MR 中被忽略,本项目必须做。
- 数据版本必须成对记录:每条宣称记录"原文所用 GWAS(编号、样本量、发表年)"与"更新版 GWAS(编号、样本量、发表年)"两行,样本量增幅 < 30% 的对不纳入"更新"分析(因为不构成有意义的独立性提升)。
- 发表文献与公开摘要统计的地位:所有 GWAS 摘要统计与已发表 MR 结论仅作为输入与对照,不计入本项目的数据贡献。
- 可复现性:宣称抽取的检索式与纳入/排除流程图(PRISMA 式)、每条分析的 GWAS 编号、工具 SNP 清单、随机种子与全部脚本开源;提供 10 条宣称的降规模复现包(≤ 30 分钟可跑完)。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| GWAS 摘要统计(主入口) | GWAS Catalog 摘要统计 FTP(https://www.ebi.ac.uk/gwas/downloads/summary-statistics ),完全开放,无需注册;FinnGen 公开数据释放(https://finngen.gitbook.io/documentation/ ,开放下载);UK Biobank Neale lab round 2(开放) |
| GWAS 摘要统计(便捷入口) | IEU OpenGWAS(https://gwas.mrcieu.ac.uk/ )+ R 包 ieugwasr。注意:OpenGWAS 已改为需要免费 API token 并设有速率限制,部分数据集访问受限,当前政策需核实;因此方案以 GWAS Catalog / FinnGen 的直接下载为主线,OpenGWAS 仅作加速手段 |
| 受控访问核查 | 本课题只使用聚合级(summary-level)统计量,不接触任何个体水平基因型或表型,因此完全不涉及 dbGaP/UK Biobank 的受控访问审批。数据为等位基因频率与回归系数的汇总,不涉及可识别个人信息,无需伦理审批 |
| MR 分析 | R 包 TwoSampleMR(IVW / MR-Egger / 加权中位数 / 加权众数 / 留一分析 / 漏斗图)、MRPRESSO(水平多效性离群检测,10,000 次置换在 50 个 SNP 上约数十秒)、MendelianRandomization 作为第二实现做交叉校验 |
| LD 剪枝参考面板 | 1000 Genomes EUR 子集(公开),配合本地 plink 1.9 做 clumping,避免依赖 OpenGWAS 的在线 clump 接口(该接口有配额)。参考面板约 1–2 GB |
| 已发表 MR 宣称的抽取 | PubMed 检索(英文检索式须写入论文),限定近五年、限定"two-sample Mendelian randomization"且摘要中给出明确因果方向宣称;按预先写死的纳入/排除规则由两名队员独立筛选,不一致处记录并裁决,报 Cohen's κ |
| 算力口径 | 纯 CPU。单条 MR 分析(harmonize + 5 种估计量 + MR-PRESSO)约 10 s–2 min;100 条约 1–3 小时。主要成本是摘要统计下载(单个全基因组摘要统计 100 MB–2 GB,20–40 个即 10–20 GB 磁盘)与数据整理。无算力风险,风险全部在文献抽取与数据对齐的工作量上 |
| 对照基准 | 各原文报告的效应量与置信区间;MR 方法基准论文(如 2024 AJHG 的 MR 方法基准)给出的方法特性。仅用于校验与对比,不计入本项目的数据贡献 |
6 · 方法路径
- 装环境(R + TwoSampleMR + plink),跑通包内示例(经典的 BMI → 冠心病算例),先完成验收标准第 1 条的 10 条同数据复现,把复现表写入
validation/。 - 按预先写死的检索式与纳入/排除规则抽取候选宣称,两人独立筛选并报 κ;生成 PRISMA 式流程图与"宣称–暴露–结局–原文 GWAS–效应量"总表并冻结。
- 为每条宣称配对"更新版 GWAS"(同性状、样本量增幅 ≥ 30%、发表晚于原文),配对规则写死;无法配对的宣称单独列出并统计比例。
- 核实数据对齐:效应等位基因、等位基因频率、链方向(palindromic SNP 处理规则)、基因组坐标版本必须逐条核对——这是 MR 中最常见且最隐蔽的错误源,须写成自动化检查脚本并留日志。
- 在更新版数据上统一重跑,记录五种估计量、F 统计量、Cochran's Q、MR-Egger 截距、MR-PRESSO 结果、样本重叠估计;按冻结的"重现"定义判定。
- 检验 H1 与 H2:按 F 统计量分档、按原文报告完备性分组比较重现率,自助法给区间,BH 校正。
- 独立交叉校验:其一,用
MendelianRandomization包(独立实现)重算全部 IVW 估计,验证结果不依赖单一软件;其二,做反向 MR(结局→暴露)检验反向因果;其三,用一组随机配对的"安慰剂"暴露–结局对(≥ 100 对)建立假阳性零模型,报本管线在无真实因果时的显著率,作为整套判定的基线。
7 · 新颖性边界
本课题不提出新的 MR 估计量、不声称任何新的因果关系、不声称"MR 方法对工具阈值敏感"或"弱工具会导致偏倚"为本项目发现——这些是 MR 方法学的既有共识,已由多篇基准论文与 STROBE-MR 规范确立。
已有工作具体完成了什么:方法学基准工作(如 2024 年 AJHG 的 MR 方法基准、2026 年关于工具强度的重评估)在模拟数据与少量示例上比较了各估计量在不同工具阈值下的一类错误率与功效,指出 MR-APSS 等方法对阈值不敏感;STROBE-MR 给出了报告清单。它们评估的是方法,不是已发表的具体宣称;也没有把"数据更新"当作自变量。
本项目的贡献(且是主结论):把评价对象从"方法"换成"已发表宣称",把自变量换成"GWAS 数据版本更新",交付一个可引用的重现率数字与一份可事前使用的风险因子清单(F 统计量分档、报告完备性、样本重叠)。这是研究手册所列"换样本做独立检验"这一最稳差异化轴在遗传流行病学中的应用。
为什么有价值:MR 结论已被大量综述与临床讨论引用。若重现率明显低于 60%,读者需要一把折扣尺与一份筛选规则;若重现率高,MR 这一低成本因果推断工具获得一次真正的外部验证。两种结果都构成有效结论。
风险声明:本课题的最大方法学困难是"更新版 GWAS 与原版 GWAS 存在样本重叠"——新版通常包含旧版样本,因此不是严格独立的复现。这个困难必须在论文中显式讨论并量化(报告每对的样本增量与重叠比例),把结论表述为"数据更新后的稳定性"而非"独立复现"。这个困难本身就是研究内容。
8 · 决策门槛(go / no-go)
- 第 6 周末(硬门槛):验收标准第 1 条必须通过。若 10 条同数据复现中 < 8 条达标,先排查等位基因对齐与 clumping 参数;四周内仍不通过则降级:把复现对象限制到"原文公开了完整工具 SNP 表(含 beta/se)"的宣称(这类文献比例较低但对齐无歧义),并把审计规模相应缩小到 40 条。主结论框架不变。
- 第 10 周末:确认可抽取且可配对更新 GWAS 的宣称数量。若 < 40 条,立即降级:其一,把"更新"定义放宽为"任一未被原文使用的独立 GWAS(如 FinnGen 对应性状),不要求样本量更大",此时问题从"数据更新稳定性"变为"跨队列可移植性",主结论框架完全保留;其二,把宣称范围收窄到单一疾病领域(如心血管或精神疾病)以提高配对成功率,并相应收窄推广范围。
- 第 16 周末:完成安慰剂零模型(第 7 步)。若本管线在随机配对上的假阳性率 > 10%(远高于名义 5%),立即降级:把判定标准从"FDR < 0.05"改为"经零模型经验校准后的阈值",并把零模型校准本身作为一条独立方法学结论报出。
- 第 28 周末:若 H1 与 H2 都未达阈值(重现率高且无分档差异),按风险声明写"MR 文献稳健"结论,并把安慰剂零模型与样本重叠量化作为核心证据支撑该结论的可信度。
- 第 36 周结果冻结,第 44 周英文 PPT 初稿。
- 需提前核实而非边做边发现:(a) OpenGWAS 的 API token 政策与配额(若不可用,主线必须完全走 GWAS Catalog/FinnGen 直接下载);(b) 目标性状在 GWAS Catalog 中是否有可下载的全基因组摘要统计(很多研究只公开显著位点,无法做 clumping 与 MR);(c) 各 GWAS 的队列构成文档是否足以估计样本重叠。三项在第 8 周前查清——其中 (b) 是本课题最可能致命的前置风险。
- 选择前提:适合能读懂英文方法学文献、有耐心做系统性文献筛选的两人小队(第 2 步需要两人独立筛选以算 κ)。本路线技术门槛低但文献工作量大,不适合只想写代码的学生。
- 预算裁剪顺序:先砍反向 MR,再砍 5×10⁻⁶ 阈值敏感性分析,再砍 MR-PRESSO(保留 MR-Egger 截距作为多效性证据),最后把宣称数从 60 降到 40。砍到只剩"40 条宣称 × IVW + 加权中位数 × F 分档重现率 + 安慰剂零模型"时,主结论仍成立。