Yau Awards Archive 2020 — 2025

E18

居民屋顶光伏采纳的 Bass 扩散与基于主体模型对比:以美国 Tracking the Sun 分区县采纳曲线的留出期预测为判据

优先级:中低环境与能源经济族 + 基于主体建模族公开数据校准CPU 中量编程+数据拟合取向

1 · 研究问题

对居民屋顶光伏(rooftop PV)的县级累计采纳曲线,含同伴效应(peer effects)的基于主体模型(agent-based model, ABM)相对经典 Bass 扩散模型,在"用 2018 年前数据标定、预测 2019–2023 留出期"的任务上均方根误差能降低多少?同伴效应参数在县之间的异质性能否被收入与政策变量解释?

2 · 研究背景与空白

技术扩散的 Bass 模型(1969)有闭式解析解(创新系数 p、模仿系数 q),是一切扩散 ABM 的天然解析锚点。光伏采纳 ABM 已有成熟文献:Zhang 等(AAAI 2015)用 ABM 预测圣迭戈屋顶光伏采纳;加州部署预测(LBNL/OSTI 报告)与新加坡、社区微电网等 ABM 均已发表;同伴效应(邻近已装机数影响采纳概率)被反复证实。Kiesling 等对"经验立地的扩散 ABM"的批评性综述(arXiv 1608.08517)明确指出该领域痛点:多数 ABM 校准后从不做留出期预测检验

空白在评价维度:正面回应上述批评——把 Bass(2 参数)与 ABM(多参数)放在同一留出期预测任务上同台对比,回答"ABM 的复杂度是否换来预测力",用完全公开的 LBNL Tracking the Sun 逐系统安装数据(200 万+ 条记录、含安装日期与邮编)在多个县上系统执行。数据免费、Bass 解析解保证可校验、"ABM 不比 Bass 好"是有效且重要的结论。

3 · 可检验假设

  • H1:在 ≥20 个县上,含同伴效应 ABM 的留出期 RMSE 中位数比同数据标定的 Bass 模型低 ≥15%;若不低,"简单模型足够"为主结论。
  • H2:逐县拟合的模仿强度参数与县收入中位数(ACS 公开数据)的秩相关 |ρ|≥0.3,方向为正(高收入社区同伴效应更强,与已发表加州证据方向一致)。

4 · 量化验收标准

  1. 方法学校验(硬门槛):(i)ABM 在关闭异质性与空间结构的极限下退化为 Bass 过程——模拟均值曲线与 Bass 解析解逐点偏差 ≤2%(N=10^4 主体、20 种子均值);(ii)Bass 拟合代码在 Bass (1969) 原文耐用品数据(论文表格可得)上复现原文 p、q 估计,相对偏差 ≤5%。此步不过关,后续全部结论无效。
  2. 时间序列纪律:严格按时间划分——2007–2018 标定、2019–2023 留出;并做一次"随机划分 vs 时间划分"对照量化随机划分对 RMSE 的高估/低估幅度。
  3. 模拟口径:每县每参数点 ≥20 种子,报 RMSE 均值 ± 标准差与 95% 置信区间;模型对比用双成本口径(等参数自由度不可行时,报自由度差异并用 AIC/BIC 与留出 RMSE 双判据)。
  4. 参数敏感性:对 ABM 的(同伴半径、模仿权重、收益敏感度、异质性方差)做 Sobol 指数(Saltelli ≥512 组);县选择做敏感性(按规模分层抽样两套县集,结论须一致)。
  5. 县入选标准预先写死:累计安装 ≥1,000 套、时间序列 ≥12 年,达标县全取或分层随机抽 20 个,不得挑好拟合的县。
  6. 全部管道开源;单县单次 ABM 运行时长写入附录。

5 · 数据与工具

用途 来源 / 工具
逐系统安装记录 LBNL Tracking the Sun(emp.lbl.gov 免费公开数据集,>2×10^6 条,含安装日期、邮编、规模;最新版覆盖年份需核实
潜在采纳者基数 美国 Census/ACS 县级自有住房户数(免费 API)
收入与电价 ACS 县收入中位数(免费);EIA 州电价(免费)
政策变量 DSIRE 激励数据库(免费查询,结构化导出难度需核实,不可得则用州级虚拟变量)
建模 Python + NumPy/Numba 自写 ABM;Bass 拟合用 SciPy 非线性最小二乘
方法对照 Zhang et al. AAAI 2015、LBNL 加州预测报告——仅用于校验与对比,不计入本项目贡献

算力:单县 N≤10^5 主体(按户数缩放代理比例 1:10)、月步长 200 步、单种子约 10–60 秒(Numba);20 县 × Sobol 512 × 20 种子为上限口径,实际用"主分析全County + Sobol 只在 3 个代表县"控制在总机时 ≤5 天。全美 3,000 县 × 全 Sobol 超出范围;降规模版本:10 县 + 256 组 Sobol(<1 天)。中国分省数据(国家能源局分布式光伏统计)粒度与连续性需核实,作为可选外推讨论不作主数据。

6 · 方法路径

  1. 实现 Bass 拟合并复现原文估计;实现 ABM 并通过退化极限校验(第 1 条验收)。
  2. 下载 Tracking the Sun,清洗到县×月累计采纳面板(邮编→县映射用 HUD 免费对照表)。
  3. 按预写标准选县;封存 2019–2023 留出段。
  4. 逐县标定 Bass 与 ABM(标定只用 2018 前数据;ABM 校准用拉丁超立方 + 局部细化)。
  5. 开封留出段,计算双模型 RMSE 分布与配对差异检验(Wilcoxon,报效应量)。
  6. 跑 3 个代表县的 Sobol 敏感性与参数-收入相关分析(H2)。
  7. 独立交叉校验:Bass 用 R diffusion 包(能力需核实)复算 p、q 一致性 ≤2%。

7 · 新颖性边界

本课题不声称提出新扩散机制,不声称 ABM 结构是采纳行为的因果模型。已有工作:光伏采纳 ABM(圣迭戈 2015、加州、新加坡等)与同伴效应实证均已发表;"扩散 ABM 缺预测验证"的批评已由综述提出。本项目贡献是把该批评落实为系统审计:同一数据、同一留出任务上 Bass vs ABM 的预测力对比及其跨县分布——评价维度从"拟合优度"转换为"样本外预测增益",并以多县系统执行替代单城市案例(样本维度扩展)。丘奖历届相邻工作须点名:2025 入围"不确定光照下光伏最优定价机制"(机制设计,非扩散)、2021 金奖"燃油车监管的税收与配额理论"(理论模型);无扩散预测审计类工作。"ABM 无增益"结论有效且对政策模拟界有警示价值,须报配对置信区间证明可分辨 10% 的 RMSE 差。

8 · 决策门槛(go / no-go)

  • 第 4 周末:Tracking the Sun 下载成功且 ≥20 县达标。数据入口变更或达标县不足→降级 A:改用州级月度装机(EIA-861M,免费且稳定),县级异质性分析(H2)降为州级(n≈15 个高装机州),双模型对比框架不变。
  • 第 8 周末:ABM 退化极限校验通过。反复不过多为时间步长/配对方式偏差→改连续时间 Gillespie 化实现;第 11 周仍不过则降级 B:放弃 ABM,改为"Bass 及其 3 个解析扩展(Generalized Bass、含价格项)"的留出预测对比,保留"复杂度 vs 预测力"主结论框架。
  • 第 20 周末:单县全流程(标定+留出评估)≤2 小时。超时→代理比例降到 1:50 并重做规模收敛检查(三档代理比例主指标漂移 <2%)。
  • 已知困难:留出期含 2020–2022 疫情与利率冲击,两模型都会失准——把"结构性冲击期的模型脆弱性"写成分段分析(2019 vs 2020–2023 分开报),是研究内容而非障碍。
  • 预算裁剪顺序:先砍 H2 相关分析,再砍 Sobol 代表县数(保 1 县),最后砍县数到 10;主结论(双模型留出 RMSE 对比)在裁剪下成立。