Yau Awards Archive 2020 — 2025

K11

长时序预测中「线性基线 vs Transformer」争议在中国气象与电力新样本上的独立仲裁——兼量化随机划分导致的性能高估

优先级:最高分族:时间序列预测资源:纯 CPU / 零预算技能:Python + 统计类型:独立复检

1 · 研究问题

Zeng 等(2023)「单层线性模型 DLinear 在长时序预测(long-term time series forecasting, LTSF)上普遍优于 Transformer 类模型」的结论,在中国气象站点与电力负荷的独立新样本上是否成立?若在部分序列上反转,反转能否由序列的趋势/周期强度与平稳性等可预测性结构解释?

2 · 研究背景与空白

长时序预测指给定历史窗口预测未来 96–720 步。2020–2022 年 Informer、Autoformer 等 Transformer 模型在 ETT、Weather、Electricity 基准上刷榜;Zeng 等(AAAI 2023)用两个单层线性网络(DLinear)在这些基准上大幅反超,引发方向性争议;Nie 等(ICLR 2023, PatchTST)随后反驳称等规模设置下 Transformer 仍更优。争论双方给出的数字互相矛盾(同一 ETTh1-96 任务 MSE 报告差可达 10% 以上)。

空白在:正反双方都在同一批既有西方基准上互搏,尚无第三方在全新地理与时间覆盖的样本上做中立仲裁;且主流基准全部使用固定划分,随机划分(数据泄漏)造成的高估幅度在这批任务上缺少系统量化。方法全开源、纯 CPU 可跑、仲裁结论正反都成立,适合一年期学生课题。

3 · 可检验假设

  • H1:在 ≥12 条中国站点日尺度气象序列与 ≥2 条电力负荷序列上,DLinear 在 96 步与 336 步预测的 MSE 与最优 Transformer 基线(PatchTST)差距在 ±10% 以内,即「简单基线足够」在新样本上复现;若某类序列显著反转(配对差的 95% 置信区间不含 0),反转可由该序列的季节强度指标预测(logistic 回归 AUC ≥ 0.75)。
  • H2:随机划分相对按时间划分会使所有模型的测试 MSE 系统性偏低(性能高估)≥15%,且高估幅度与序列一阶自相关强度正相关(Spearman ρ > 0.5)。

4 · 量化验收标准

  1. 方法学校验(硬门槛):自建管线在 ETTh1 上重现 DLinear 论文报告的 96/336 步 MSE,偏差 ≤5%;同时重现 PatchTST 官方仓库结果偏差 ≤5%。不过关则后续全部结论无效。
  2. 每组实验 5 个随机种子,报均值 ± 标准差,不报单次最好结果。
  3. 模型对照采用双成本口径:等参数量、等 CPU 墙钟训练时间,两组都报。
  4. 主口径为按时间划分训练/测试;额外做一次随机划分对照,量化高估幅度(对应 H2)。
  5. 逐序列给出胜负表,配对差异用自助抽样(bootstrap,≥1000 次)给 95% 置信区间;「差异不显著」为有效结论。
  6. 全部脚本、配置与处理后数据开源,第三方可一键重跑。

5 · 数据与工具

用途 来源 / 工具
方法学校验与对照基准 ETT / Weather / Electricity(Autoformer 官方仓库统一下载)——仅用于校验与对比,不计入本项目数据贡献
新样本:中国气象 NOAA ISD / GSOD(含数百个中国站点,逐日温度/风速/气压,1950s–今),按站点切片下载,单站 MB 级
新样本:电力负荷 中国省级公开负荷序列需核实(备选:全国电工数学建模竞赛公开负荷数据;再备选 UCI ElectricityLoad 仅作对照)
模型实现 DLinear/NLinear(官方仓库)、PatchTST(官方仓库)、季节朴素与 SARIMA 基线(statsmodels)——预训练/官方代码不计入本项目方法贡献
算力量级 DLinear 在 ETTh1 单次训练 CPU 约 1–3 分钟;PatchTST 单数据集 CPU 约 20–60 分钟(第 0–2 周实测校准;若单次 >2 小时则缩短回看窗口至 336、减少输入通道)

6 · 方法路径

  1. 装环境,跑通 DLinear 与 PatchTST 官方算例,完成第 4 块第 1 条校验。
  2. 实测两模型在本机 CPU 的单位墙钟,写出能力边界表(哪些配置超出范围)。
  3. 下载并清洗 NOAA 中国站点序列与负荷序列,给出缺失处理的可复现判据。
  4. 统一评测协议(回看 336、预测 96/336、时间划分),跑全部模型 × 序列 × 5 种子。
  5. 加跑随机划分对照,计算逐序列高估幅度并与自相关强度做秩相关。
  6. 计算各序列季节强度/平稳性指标,检验其对胜负的预测力(H1 后半)。
  7. 交叉校验:用 statsmodels 独立实现的季节朴素基线核对自建评测代码的 MSE 计算。

7 · 新颖性边界

  • 本课题声称提出任何新预测模型,DLinear 与 PatchTST 的原始结论均已发表,不得声称为本项目发现。
  • 已有工作:Zeng et al. (AAAI 2023) 与 Nie et al. (ICLR 2023) 已在 ETT/Weather/Electricity/Traffic 上给出相反结论;历届丘奖中 C-TranAD(2025 优胜,复值 Transformer 异常检测)做的是异常检测新模型,与本题「基线仲裁」问题方向不同。
  • 本项目贡献(主结论):其一,在中立的新地理样本上对该争议做独立仲裁;其二,量化随机划分在 LTSF 任务上的高估幅度并给出与序列结构的关联判据。
  • 价值:争议双方都未在自身之外的样本上被检验,独立仲裁无论指向哪边都构成有效结论;泄漏高估的量化对社区实践有直接参考价值。

8 · 决策门槛(go / no-go)

  • 第 2 周末:ETTh1 校验偏差 >5% → 排查至第 4 周;仍不过则降级为「推理端复检」:加载官方 checkpoint 只做评测与新样本推理,保留仲裁与高估量化两条主结论框架。
  • 第 6 周末:核实中国电力负荷公开来源。拿不到 → 具名降级:全部换为 NOAA 中国站点气象序列并扩至 ≥20 条,主结论不变,仅应用面变窄。
  • 第 20 周:若 PatchTST 超参搜索 CPU 墙钟超 60 小时预算 → 冻结官方超参不搜索,并在论文限制一节明确声明。
  • 预算裁剪顺序:先砍 720 步预测长,再砍序列条数(下限 12 条),最后砍随机划分对照的重复次数(下限 3 种子)。