Yau Awards Archive 2020 — 2025

B09

流感预测目标变量的选择如何改变模型排名:在 WHO FluNet 的 30 个无预测中心国家上,以绝对病例数 vs 阳性率为双目标的回顾性加权区间评分对照

优先级:中分族:流行病学建模参赛子类:传染病建模 / 预测评估资源需求:纯 CPU 笔记本,数据 < 200 MB,全流程数小时技能取向:Python/R 时间序列 + 预测评分规则

1 · 研究问题

在 WHO FluNet 覆盖但没有官方预测中心(forecasting hub)的 ≥ 30 个国家中,对同一批候选预测模型做 1–4 周提前期的回顾性预测评估,当把预测目标从"每周实验室确诊流感病例绝对数"换成"流感检测阳性率(percent positivity)"时,模型按加权区间评分(weighted interval score, WIS)的排名会发生多大改变?排名改变的幅度能否由该国检测量(tested specimens)的年际波动幅度解释?

2 · 研究背景与空白

背景。 传染病预测已高度制度化:美国 CDC 的 FluSight、欧洲的 RESPICAST 等预测中心每周汇集多家团队的概率预测,用 WIS 与覆盖率统一评分。FluSight 的评估结果(Nature Communications, 2024)显示,2021–22 季 23 个模型中只有 6 个跑赢基线模型,2022–23 季 18 个中有 12 个;集合模型(ensemble)分别排第 2 与第 5。基线模型构造极简:中位数取上周观测值,区间由历史一周差分的正负值生成。

但这些评估的前提是有一个质量稳定的目标变量——美国用的是实验室确诊住院数,报告体系统一。全球大多数国家没有这个条件:WHO FluNet 汇总各国国家流感中心(NIC)上报的每周检测数与阳性数,而各国的检测量随疫情关注度、财政与政策剧烈波动。同一波真实疫情,在检测量翻倍的年份会表现为病例数翻倍。

空白在于:预测中心的评估体系从未在"报告伪迹显著"的环境中被检验过,也没有人系统比较过"绝对计数"与"阳性率"这两个目标变量会给出多不一致的模型排名。 而全球绝大多数国家恰恰处在这种环境中,且 2020–2023 年的疫情扰动使检测量的波动达到历史极值。这个空白适合学生课题:数据完全开放且体积极小、算力可忽略、评分方法完全公开、结论正负都成立

3 · 可检验假设

  • H1:以国家为单位比较两个目标变量下的模型排名,Kendall τ 的中位数 ≤ 0.6;且在 ≥ 25% 的国家中,"最佳模型"在两个目标下不是同一个。
  • H2(机制假设):排名不一致度(1 − Kendall τ)与该国 2015–2025 年周检测量的变异系数呈正相关(Spearman ρ ≥ 0.5,BH-FDR < 0.05);且在检测量波动最小的四分位国家中,两目标排名基本一致(τ ≥ 0.8)。若 H2 被否证,说明不一致由疫情本身的动力学特征而非报告伪迹驱动,需另作解释。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用自建评分代码在 FluSight 公开数据仓库(模型预测与真实值均公开于 GitHub)上重算 2021–22 与 2022–23 两季的 WIS 与相对 WIS,要求:(a) 复现"2021–22 季 23 个模型中 6 个跑赢基线、2022–23 季 18 个中 12 个跑赢"这一已发表计数,误差 ≤ 1 个模型;(b) 复现集合模型的名次(2021–22 第 2、2022–23 第 5),名次偏差 ≤ 1 位;(c) 自建的 WIS 数值与官方评分文件在共有条目上的相对偏差 ≤ 1%。三项任一不达标,评分代码不可信,后续全部结论无效。
  2. 统计口径预先写死:(a) 主指标为 WIS 与相对 WIS(以基线模型归一化),并报 50%/95% 预测区间覆盖率;不报点预测的 MAE 作为主指标,原因是概率预测的质量必须用恰当评分规则(proper scoring rule)衡量,点误差会奖励过度自信的模型;(b) 时间序列必须按时间前后划分:所有模型只用预测时点之前的数据训练,且必须模拟"实时可得性"——若某国数据存在回溯修订,须使用可得的最早版本或明确说明不可得并列为限制;额外做一次"随机划分 vs 时间划分"对照,量化随机划分对性能的高估幅度;(c) 跨国比较报 BH-FDR;(d) 所有 WIS 汇总量给 ≥ 1,000 次自助法(按"国家-季"块重抽样)95% 置信区间;(e) 排名一致性用 Kendall τ 并给自助区间。
  3. 报告伪迹必须显式量化:每个国家逐年报告检测量、阳性率与两者的相关;检测量周报告缺失率 > 20% 的国家-季剔除并列出。
  4. 规模下限:≥ 30 个国家、≥ 5 个流感季(须同时含疫情前 2016–2019 与疫情后 2023–2026 两段)、≥ 5 个候选模型(须含 FluSight 式随机游走基线、历史同周中位数基线、ARIMA、带季节项的 GAM、一个简单机制模型如离散 SIR/SEIR 或 Serfling 回归)。每个国家-季的可评估周数 ≥ 20。
  5. 模型与数据的地位:FluNet 的病例计数、FluSight 公开的他人模型预测仅作为输入与校验对照,不计入本项目的数据贡献
  6. 可复现性:数据快照(含下载日期)、全部脚本、随机种子、逐国逐季评分表开源;提供 5 国的降规模复现包(≤ 30 分钟可跑完)。

5 · 数据与工具

用途 来源 / 工具
全球流感监测周数据 WHO FluNet / FluMart(https://www.who.int/tools/flunet ,经 GISRS 全球流感监测系统)。含各国每周处理标本数、A/B 型阳性数、分型结果,覆盖 2010 年至今、100+ 国家。可导出 CSV,全球全时段体积仅数十 MB,无算力压力。当前导出接口与字段名需核实(WHO 近年多次改版数据门户)
欧洲对照数据 ECDC ERVISS(European Respiratory Virus Surveillance Summary,开放 CSV),用于与 RESPICAST 覆盖区域做对照
校验用的预测与评分基准 FluSight 公开仓库(cdcepi/FluSight-forecast-hub,GitHub,含全部提交模型的概率预测、真实值与官方评分)。仅用于校验与对比,不计入本项目的数据贡献
评分实现 R 包 scoringutils(WIS、覆盖率、相对技巧的标准实现);同时自行实现一遍 WIS 公式做交叉校验(WIS 是分位数损失的加权平均,公式须在论文中写出)
预测模型 R forecast/fable(ARIMA、ETS)、mgcv(季节 GAM)、简单 SEIR(自行实现,欧拉离散,每次拟合毫秒级)、Serfling 回归。概率预测通过残差自助法或分位数回归产生
算力口径 纯 CPU。30 国 × 5 季 × 25 周 × 4 提前期 × 5 模型 ≈ 75,000 次预测,单次拟合 10–500 ms,合计 2–10 小时,可后台跑。数据体积 < 200 MB。无算力风险
伦理 FluNet/ERVISS 为国家层面聚合监测数据,不涉及个体、不涉及可识别个人信息、不涉及人体或动物实验,无需伦理审批

6 · 方法路径

  1. 装环境(R + scoringutils + fable + mgcv),下载 FluSight 公开仓库,先完成验收标准第 1 条的三项复现,把复现表与已发表数值并列写入 validation/
  2. 下载 FluNet 全量数据,按预先写死的规则筛选国家-季(缺失率 < 20%、可评估周数 ≥ 20、峰值阳性数 ≥ 50),生成"国家–季–检测量–阳性数–阳性率"总表并冻结;同步计算各国检测量变异系数。
  3. 构建实时预测框架:对每个国家-季、每个预测时点,只用该时点之前的数据拟合五个模型,输出 23 个分位数的概率预测(与 FluSight 格式一致),提前期 1–4 周。
  4. 绝对确诊数为目标做完整评分,得到每国的模型排名与相对 WIS。
  5. 阳性率为目标重跑第 3–4 步(模型族相同,仅目标变量与必要的变换不同),得到第二套排名。
  6. 比较两套排名:逐国 Kendall τ、最佳模型是否切换、相对 WIS 差值;自助法给区间,检验 H1。再把不一致度对检测量变异系数做回归,检验 H2。
  7. 独立交叉校验:其一,在 FluSight 覆盖的美国数据上做同样的双目标对照(美国报告体系稳定,预期不一致度应显著更低),作为"负对照";其二,把疫情前(2016–2019)与疫情后(2023–2026)两段分开报,检验不一致度是否在疫情后放大;其三,用 scoringutils 与自实现 WIS 双份计算全部得分,验证评分代码无误。

7 · 新颖性边界

本课题提出新的流行病学模型、声称任何关于流感传播机制的新发现、声称"WIS 是恰当评分规则"或"集合模型通常优于单模型"为本项目发现——这些是预测中心文献的既有结论。

已有工作具体完成了什么:FluSight 评估(Nature Communications, 2024)在美国、单一目标变量(实验室确诊住院数)上,用 WIS 系统评估了两季共 20 余个模型,报出跑赢基线的模型计数与集合模型名次;ECDC 的 RESPICAST 在欧洲做同类工作。这些评估都在报告体系稳定的高收入国家、都只用一个目标变量、都没有检验目标变量选择对模型排名的影响。

本项目的贡献(且是主结论):把评价维度从"哪个模型更准"换成"目标变量的选择会不会改变'哪个模型更准'这个答案",并在报告伪迹显著的 30 个国家上给出定量刻度与一条解释变量(检测量波动)。美国数据上的负对照使这个命题真正可被否证。

为什么有价值:随着预测中心模式向中低收入国家推广,目标变量的选择将成为一个必须在建制之初就定下的决策。若排名对目标变量高度敏感,则"照搬 FluSight 的目标定义"是有风险的;若不敏感,则推广障碍少一项。

风险声明:"两个目标下模型排名高度一致"同样是有效结论,但必须给出自助法误差棒证明本设计有能力分辨 τ = 0.6 与 τ = 0.9 的差异;同时必须报告本项目候选模型集合较小(5 个)这一限制——排名一致性在候选模型少时天然偏高,须在讨论中明确。

8 · 决策门槛(go / no-go)

  • 第 5 周末:确认 FluNet 的数据导出接口可用且字段满足需求(须同时含处理标本数与阳性数)。若阳性率无法计算(缺检测量字段),立即降级:其一,改用 ECDC ERVISS(明确提供检测量)+ 美国 CDC FluView(提供 percent positivity),国家数降到约 30 个欧洲国家 + 美国各州;其二,把第二个目标变量从"阳性率"换成"对数变换后的病例数",此时研究问题变为"目标变换(尺度选择)对模型排名的影响",主结论框架(双目标 + 排名一致性 + 解释变量)完全保留。
  • 第 8 周末(硬门槛):验收标准第 1 条必须通过。若 WIS 数值与官方评分偏差 > 1%,逐项排查分位数集合、缺失预测的处理规则与截断规则;四周内仍不通过则降级:放弃"复现模型计数"这一项,改为"自实现 WIS 与 scoringutils 在随机构造的预测上完全一致(相对偏差 ≤ 1e-6)"作为硬门槛,并在论文中说明未能复现官方计数的原因。
  • 第 14 周末:确认合格国家-季数量。若 < 20 个国家,立即降级:把可评估周数下限降到 15、峰值阳性数下限降到 30,并把国家数不足这一点写入结论的推广限制。
  • 第 22 周末:完成美国负对照。若美国数据上的不一致度与 FluNet 国家相当(即处处都不一致),说明现象与报告质量无关而是评分本身的性质,立即转向:把主结论改述为"WIS 排名对目标变量的普遍敏感性",并把检测量回归降为次要分析。框架不变。
  • 第 36 周结果冻结,第 44 周英文 PPT 初稿。
  • 需提前核实而非边做边发现:(a) FluNet 数据是否存在回溯修订(若有,"实时可得性"模拟无法严格实现,须明确列为限制);(b) 各国"季"的定义(南北半球流感季不同,须分半球处理);(c) FluSight 公开仓库中官方评分文件的字段与本项目评分口径是否可直接对齐。三项在第 7 周前查清。
  • 选择前提:适合对时间序列与预测评估有兴趣、且能接受"结论是一条方法学警示"的学生。本路线是全部十条中算力与数据风险最低的之一,主要风险在数据接口稳定性。
  • 预算裁剪顺序:先砍机制模型(SEIR),再砍疫情前后分段分析,再砍提前期(只留 1 周与 4 周),最后把国家数从 30 降到 20。砍到只剩"20 国 × 3 季 × 4 模型 × 双目标 WIS 排名对照 + 美国负对照"时,主结论仍成立。