Yau Awards Archive 2020 — 2025

M38

羽毛球每球得分制下冒险程度的 Markov 决策过程:最优策略的阈值结构定理

优先级 ★★★族E 应用建模与动力系统Markov 决策过程/运筹笔记本 CPU(动态规划)建模+结构定理

来源说明:本则出自独立撰写的第二批方案。它与前 20 则同样遵循八块结构与硬门槛要求,但撰写时未做英文文献检索,新颖性边界依据的是历届获奖图谱与既有知识,而非当轮查新。因此其「需核实」条目更多,启动前须自行补一轮英文检索。

1 · 研究问题

把羽毛球 21 分每球得分制(含 20 平后净胜 2 分、30 分封顶规则)建为 Markov 决策过程——每球运动员在"激进/保守"打法间选择(激进:得分概率高但失误概率也高)——最优策略是否关于比分差呈阈值(threshold)结构,即存在单调切换边界?该结构能否在明确的参数假设下严格证明,而非仅由数值表观察?

2 · 研究背景与空白

比分制运动的 Markov 分析是经典题材:i.i.d. 每球胜率 p 下整局获胜概率有封闭公式(网球/排球/羽毛球情形均为标准练习)。引入决策后问题升级为有限状态 MDP:状态 = (我方分, 对方分, 发球权),动作 = 打法风格,价值函数由逆向归纳精确解出(状态数 < 10³,笔记本毫秒级)。数学内核在结构定理:MDP 理论中"最优策略单调性"有成熟的充分条件框架(superadditivity / 单调价值差分论证,Puterman 教材第 4/6 章型技术),把它落到具体计分规则上需要真正的证明工作(deuce 规则破坏简单单调性,是本题的实质难点与亮点)。

已有工作:固定策略下的胜率公式(教材级);网球发球策略博弈、排球轮转等运筹文献存在(第 3 周核实清单:搜索关键词 badminton scoring Markov decision risk strategy;关键词 monotone optimal policy sports MDP)。丘奖相邻获奖论文:2024 金奖《Optimizing Dart Throwing Strategies for the Elderly Based on Markov Decision Process》(MDP + 运动策略,数值最优化为主)、2025 入围《A Mathematical Model for Measuring Sprinting Styles of 100-Meter Sprinters and Its Application》(运动风格量化)。

空白在:羽毛球现行计分制下"冒险度选择"的 MDP 建模 + 最优策略阈值结构的严格证明未见发表;相对 2024 金奖,本题把交付重心从数值最优解转移到结构定理(评价维度转换),这既是差异化也是数学含量的保证。

3 · 可检验假设

  • H1:参数满足"激进打法的得分概率增益与失误概率代价可交换排序"(论文中精确形式化)时,最优策略关于分差单调:落后越多越应激进,且切换边界是分差的阶梯函数(对全部发球权状态成立)。
  • H2:deuce 段(20 平后)的最优策略与常规段在同一参数下可以不同(存在参数区域使切换边界在 deuce 处跳变)——该现象可构造性证明(给出显式参数点)并刻画其参数区域。

4 · 量化验收标准

  1. 方法学校验(硬门槛):动态规划求解器先复现无决策退化情形——固定 p 下的整局胜率与封闭公式(含 deuce 几何级数项)在 p ∈ {0.4, 0.45, …, 0.6} 上零偏差(≤ 10⁻¹²,精确有理算术可做到严格相等);并复现 10⁶ 局 Monte Carlo 模拟与理论值的一致性(偏差在 3σ 内)。不过关则全线无效。
  2. 定理交付:H1 阈值定理的完整证明(明确假设、单调性引理链);H2 的构造性证明 + 参数区域数值刻画。
  3. 数值交付:参数网格(≥ 10⁴ 组)上最优策略全解,机器验证阈值结构在定理假设域内零反例、假设域外给出反例清单(反例本身是定理假设必要性的证据)。
  4. 稳健性:参数来自公开文献的羽毛球技术统计(多拍回合得失分率区间;第 4 周核实可得性,不可得则参数区间由敏感性分析覆盖并如实声明),主结论(结构定理)不依赖任何单一参数点。
  5. 统计口径:模拟对照报 95% 置信区间;不用任何拟合优度伪指标粉饰。
  6. 代码开源,一键复跑(全套 < 1 小时)。

5 · 数据与工具

用途 来源 / 工具
MDP 求解 自写逆向归纳(Python Fraction 精确算术版 + NumPy 浮点版互证)
模拟对照 自写 Monte Carlo(仅校验,不计入贡献)
参数区间 公开体育科学文献中的羽毛球回合统计(第 4 周核实:搜索关键词 badminton rally outcome statistics error rate;不可得则用敏感性区间)
结构定理技术 Puterman《Markov Decision Processes》单调策略章节(图书馆/公开讲义)
算力量级 状态数约 24×24×2,逆向归纳毫秒级;参数网格全解笔记本分钟级,纯 CPU

6 · 方法路径

  1. 写精确算术逆向归纳求解器,完成第 4 块第 1 条封闭公式复现。
  2. 形式化动作模型与参数假设(须给出明确、可复现的"激进/保守"参数化判据)。
  3. 参数网格全解,观察阈值结构与 deuce 跳变现象,圈定定理假设的候选形式。
  4. 证明单调性引理链(价值差分沿分差的符号传播),闭合 H1 定理;构造 H2 参数点。
  5. 文献参数标定 + 敏感性分析,检验结构在现实参数域内的稳健性。
  6. 独立交叉校验:Fraction 版与 NumPy 版全网格互证;Monte Carlo 抽检 100 参数点。

7 · 新颖性边界

  • 本课题声称固定策略胜率公式(教材级)与 MDP 单调性一般理论(Puterman 框架)为本项目结果;不声称对真实比赛做因果断言(模型结论限定在假设内,论文明确写出)。
  • 已有工作:计分制 Markov 分析(教材级);体育决策 MDP 文献(第 3 周核实清单)。丘奖相邻获奖论文:2024 金奖《Optimizing Dart Throwing Strategies for the Elderly Based on Markov Decision Process》——本题差异:运动不同(羽毛球对抗性计分 vs 飞镖非对抗)、状态结构不同(对抗比分 + deuce 规则)、交付重心不同(结构定理及其证明 vs 数值最优策略);2025 入围短跑模型为回归型风格量化,与本题 MDP 决策框架不同。
  • 本项目贡献(主结论):羽毛球计分 MDP 的阈值结构定理(含 deuce 跳变现象的构造性刻画)+ 全参数域数值验证。
  • 价值:把一条"人人可感"的竞技直觉(落后就该搏)变成带精确假设的定理;deuce 跳变是模型独有的可检验预言,英文答辩故事线完整。

8 · 决策门槛(go / no-go)

  • 第 4 周末:硬门槛复现 + 动作模型冻结。
  • 第 10 周末:网格全解完成。若阈值结构在大片合理参数域内不成立 → 这本身是结果:降级路径 A:主结论转为"阈值结构成立/失效的参数相图 + 失效机制分析"(保留 MDP 框架与定理目标,定理改为刻画失效边界)。
  • 第 22 周末:H1 证明若卡在 deuce 段,降级路径 B:定理范围收缩到常规段(0–20 分)严格证明 + deuce 段的穷尽数值验证(有限状态可全验,构成有限情形的机器证明)——主结论框架不变。
  • 第 4 周核实项:公开羽毛球统计的可得性;不可得不阻塞主线(定理不依赖数据)。
  • 预算裁剪顺序:真实数据标定章节 → H2 参数区域精细化;H1 定理与全网格验证不砍。