K17
LLM 评改中文议论文的偏差探针——长度、辞藻与错别字的受控扰动因果实验
1 · 研究问题
大语言模型作为作文评分者(LLM-as-a-judge)时,对与内容质量无关的表面特征——篇幅、成语/辞藻密度、模板化开头、错别字——存在多大的因果性评分偏差?这些偏差在中文议论文场景下的效应量与方向,与已发表的英文对话评测偏差是否一致?
2 · 研究背景与空白
LLM 评审已被大量用于模型对比与作文批改。已发表工作:Wang 等(2023)证明成对比较中的位置偏差(position bias);Zheng 等(NeurIPS 2023, MT-Bench)量化长度偏差与自我偏好;OffsetBias、CALM(2024)系统整理了 6–12 类偏差;arXiv:2506.22316(2025)明确指出打分型(scoring-based)偏差研究仍然稀少,且以上工作几乎全部基于英文对话/问答场景。
空白在:中文作文评分场景的 scoring 型偏差没有受控因果证据——「同一篇作文只改长度/辞藻,分数变多少」这一教师和学生最关心的量未被测过。实验为纯 API 评测 + 统计分析,零训练,结构性绕开算力墙。
3 · 可检验假设
- H1:内容保持不变时,扩写 30% 使 LLM 评分平均提升 ≥0.3 个标准分(标准化到人工分数的 SD),压缩 30% 使其下降幅度更大(损失厌恶不对称);成语密度加倍提升 ≥0.2 SD。
- H2:注入每百字 1 处错别字造成的扣分,超过人类评分者已发表扣分惯例的 2 倍(若无中文文献值则以本项目招募的教师小样本为对照),即 LLM 对表面错误过度敏感。
4 · 量化验收标准
- 方法学校验(硬门槛):先在英文公开基准 ASAP-AES(带人工分)上,用本项目提示词管线使所选 LLM 的评分与人工分的二次加权 Kappa(QWK)达到已发表 LLM 评分工作的水平(偏差 ≤0.05 QWK)。不过关说明评分管线本身不可靠,后续偏差测量全部无效。
- 因果设计预登记:每篇原文生成 5 类扰动版本(扩写 30% / 压缩 30% / 成语加密 / 模板化开头 / 每百字 1 错别字),扰动由脚本 + 人工核对完成,核对判据(内容命题不变)写成 checklist 并开源。
- 统计口径预先写死:配对设计,效应量用混合效应模型(作文为随机效应)估计,报点估计 + 95% CI;显著性检验用配对置换检验;不报 accuracy(评分是有序回归问题)。评审模型 ≥2 个、每个条件 3 次独立调用取均值并报调用间 SD。
- 可复现性硬要求:固定模型版本号(如 deepseek-chat 与 glm-4 的具体版本串)、temperature=0、记录每次调用日期;提示词全文、原文与扰动文本、全部原始返回开源。模型版本会变——版本与日期不记录则实验不可复现,视为不合格。
- 预算核算:100 篇 × 6 版本 × 2 模型 × 3 重复 = 3600 次调用,每次约 2k token,共约 7M token;按主流国产 API 单价估算 30–100 元,上限 200 元(含返工),≤500 元约束内。
- 样本量功效分析先行:按 SD=1 检出 0.2 SD 效应、power 0.8,需配对 n ≈ 100,故原文下限 100 篇。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 中文作文(带参考分) | 公开中文作文评分语料需核实(候选:HSK 动态作文语料库(需注册)、公开高考满分/范文集配教师评分);保底方案见 go/no-go |
| 英文校验基准 | ASAP-AES(Kaggle 公开,13k 篇带人工分)——仅用于管线校验,不计入本项目数据贡献 |
| 评审模型 | 2–3 个国产 LLM API(版本冻结);扰动生成可用 API 但须人工逐篇核对,AI 不得代写分析 |
| 统计 | statsmodels 混合效应模型 / R lme4(CPU 秒级) |
| 人类对照 | 本校语文教师 2–3 名对 30 篇子样本盲评(同校教师指导合规) |
6 · 方法路径
- 搭评分管线,在 ASAP-AES 上完成 QWK 硬门槛校验。
- 核实中文语料可得性(第 4 周截止),冻结 100 篇原文清单。
- 脚本生成 5 类扰动版本,人工按 checklist 逐篇核对内容不变性。
- 全因子调用 API(盲化、随机顺序),落盘全部原始返回。
- 拟合混合效应模型估计各扰动因果效应,检验 H1/H2。
- 教师小样本盲评同批扰动文本,对比人机偏差方向与幅度。
- 交叉校验:换一套改写提示词重生成 20 篇扰动文本,验证效应量稳健(差 ≤30%)。
7 · 新颖性边界
- 本课题不声称首次发现 LLM 评审偏差;位置/长度偏差由 Wang et al. (2023)、Zheng et al. (2023) 发表,偏差分类由 OffsetBias/CALM 完成,不得声称为本项目发现。
- 已有工作均为英文、以对话/问答为主、以成对比较为主;scoring 型偏差被 2506.22316 指为空白。历届丘奖 Hrbench(2024 优胜)是构建 LLM 历史推理能力基准,对象是模型能力而非评分者偏差,方向不同。
- 本项目贡献(主结论):中文议论文场景下 4–5 类表面特征对 LLM 打分的因果效应量表及其与人类评分者的对比。
- 价值:直接回答「学生投其所好写长文堆成语能骗到多少分」;效应不显著(偏差小)同样是对 LLM 批改可用性的正面有效结论,须以 CI 证明检出能力。
8 · 决策门槛(go / no-go)
- 第 4 周末:中文带分语料若不可得 → 具名降级 A:主实验改在 ASAP-AES 英文语料上做(扰动类型改为长度/连接词密度/拼写错误),中文部分缩为教师评分的 60 篇自建小语料;偏差探针框架与统计设计完全不变。
- 第 6 周末:QWK 校验不达标 → 迭代提示词至第 8 周;仍不过则降级 B:放弃「绝对分」改用同一作文扰动对的成对比较(偏差以胜率翻转度量),框架保留。
- 第 12 周末:预算消耗若超 50%(返工过多)→ 砍评审模型至 1 个 + 重复 2 次,效应量 CI 拉宽但主结论保留。
- 已知困难即研究内容:扰动「只改表面不改内容」的边界本身难判——checklist + 教师抽检的失败率要如实报告,作为方法学结果之一。