T1572–90
同一个人换个体裁写作,"风格指纹"还认得出来吗
1 · 研究问题
作者身份验证的实用场景是"这份提交的作业是不是这位学生写的"。但学生在不同任务下的写作风格差异可能很大——议论文、实验报告、反思日志、非正式邮件在句长、被动语态、连接词、标点习惯上系统不同。一个在同体裁样本上训练的"风格指纹",在跨体裁配对上的验证准确率是多少?跨体裁的同一作者,会不会被判为不同人(假阴性)? 在教育应用中,假阴性意味着诬告一名诚实的学生——这是比假阳性更严重的错误,而摘要报告的指标里看不出它。 在预先固定的样本、对照与统计口径下,主效应的方向、幅度和不确定度分别是多少,结论能否在独立留出数据或独立重复中成立?
2 · 研究背景与空白
背景。 这条课题研究的不是“能不能做出一个结果”,而是一个现有结论在测量误差、样本差异和外推条件改变后还能不能站住。核心逻辑是把观察量、真实目标量与混杂因素分开:先用已知答案校验工具,再固定对照和重复单位,最后用误差棒判断差异。只给一个最高分、一次演示或一条相关关系,不能说明方法在新样本上可靠。
已有工作到哪一步。 TECA020(2025 TECA Grand Award + Special Award)"VerifyMe"(与 T2 同源,此处针对另一组主张)——摘要原文的应用定位明确是学术场景:"OpenAI's ChatGPT has blurred the line between human and AI-written text, challenging academia's ability to verify authorship. Existing AI detection systems fail with paraphrased content or mimicked writing styles and misclassify human work."(注意最后半句:它明确把"误判人类作品"列为现有系统的缺陷之一——那么它自己的误判率是多少?摘要只给了准确率与 MCC/AUC,没有在教育基率下给出假阴性的绝对数量);训练语料是 BAWE(学术写作)与 Gutenberg(文学),两者内部体裁都相对单一;"When tested on unseen authors, VerifyMe achieved 85% accuracy on human-human verification from BAWE"。摘要未报告跨体裁验证。
空白在于:三个自产结果:(a) 体裁内 vs 体裁间的验证准确率对照(用带作者与体裁双标注的公开语料);(b) 假阴性率的绝对量——在教育场景的实际基率下(绝大多数提交是诚实的),一个 85% 准确率的系统每 100 名学生会误伤几个?这是一条基率曲线,也是本课题最有说服力的一张图;(c) 需要多少样本才能建立稳定指纹——每位作者的参考样本数从 1 篇到 20 篇,验证准确率的收敛曲线,直接对应"新学期开学时系统还没有足够样本"这个真实约束。 五字段原文的研究问句是:作者身份验证的实用场景是"这份提交的作业是不是这位学生写的"。但学生在不同任务下的写作风格差异可能很大——议论文、实验报告、反思日志、非正式邮件在句长、被动语态、连接词、标点习惯上系统不同。一个在同体裁样本上训练的"风格指纹",在跨体裁配对上的验证准确率是多少?跨体裁的同一作者,会不会被判为不同人(假阴性)? 在教育应用中,假阴性意味着诬告一名诚实的学生——这是比假阳性更严重的错误,而摘要报告的指标里看不出它。 这适合一年期学生课题,因为可以把主任务裁成一个对象、一个主指标和一个独立复核;即使预期差异不出现,只要校验与统计功效过关,零结果仍能界定已有结论的适用边界。
3 · 可检验假设
H1 在加入本课题预先规定的控制、校正或独立验证后,主指标将沿五字段框架所述预期方向变化,且相对基线变化 ≥ 10% 或标准化效应绝对值 ≥ 0.5;若 95% 置信区间同时排除这两个门槛,则 H1 被否证。两种尺度只选与主指标有意义的一种,并在预实验前写死。
H2 若 H1 被否证,备择机制是假定原观察主要由测量误差、样本构成、基础率、时间漂移或未控制混杂驱动;比较“仅含原变量”与“加入机制变量”的模型,若主效应方向改变或绝对值下降 ≥ 20%,则支持机制解释,否则报告当前分辨率下未找到证据。
4 · 量化验收标准
- 方法学校验硬门槛。 用自建管线、装置或代码重跑一个答案已知的合成算例/标准样;主量反算偏差须 ≤ 5%。不过关则停止,且后续全部结论无效。
- 统计口径预先写死。 独立样本、技术重复和连续观测分开计数;测量类每个关键条件至少 3 次独立重复,技术重复只估计仪器噪声,并用误差传播或方差分量合成不确定度。极不平衡分类主报 PR-AUC、precision、recall,不以 accuracy 为主,因为全猜多数类也会虚高;时间序列按时间划分并把随机划分仅作泄漏对照。
- 正式采集前固定主指标、排除规则、对照、效应方向与 10%(或标准化效应 0.5)判据;报告全部独立重复、效应量和 95% 置信区间,不只报 p 值或最佳一次。
- 至少完成一项阴性对照和一项敏感性分析;改变关键阈值、预处理或模型选择时,主结论不得仅由单一任意选择决定。
- 用独立批次、独立留出段或第二种原理不同的方法复核主量;不一致时优先报告不一致与误差预算,不平均成一个“更好看”的数字。
- 可复现性。 保存原始数据、清洗记录、参数、环境版本、随机种子、脚本和排除日志;第三方应能重建主表与主图。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 研究对象与主问题 | 作者身份验证的实用场景是"这份提交的作业是不是这位学生写的"。但学生在不同任务下的写作风格差异可能很大——议论文、实验报告、反思日志、非正式邮件在句长、被动语态、连接词、标点习惯上系统不同。一个在同体裁样本上训练的"风格指纹",在跨体裁配对上的验证准确率是多少?跨体裁的同一作者,会不会被判为不同人(假阴性)? 在教育应用中,假阴性意味着诬告一名诚实的学生——这是比假阳性更严重的错误,而摘要报告的指标里看不出它。 |
| 原创切口 | 三个自产结果:(a) 体裁内 vs 体裁间的验证准确率对照(用带作者与体裁双标注的公开语料);(b) 假阴性率的绝对量——在教育场景的实际基率下(绝大多数提交是诚实的),一个 85% 准确率的系统每 100 名学生会误伤几个?这是一条基率曲线,也是本课题最有说服力的一张图;(c) 需要多少样本才能建立稳定指纹——每位作者的参考样本数从 1 篇到 20 篇,验证准确率的收敛曲线,直接对应"新学期开学时系统还没有足够样本"这个真实约束。 |
| 前作与对照基准 | TECA020(2025 TECA Grand Award + Special Award)"VerifyMe"(与 T2 同源,此处针对另一组主张)——摘要原文的应用定位明确是学术场景:"OpenAI's ChatGPT has blurred the line between human and AI-written text, challenging academia's ability to verify authorship. Existing AI detection systems fail with paraphrased content or mimicked writing styles and misclassify human work."(注意最后半句:它明确把"误判人类作品"列为现有系统的缺陷之一——那么它自己的误判率是多少?摘要只给了准确率与 MCC/AUC,没有在教育基率下给出假阴性的绝对数量);训练语料是 BAWE(学术写作)与 Gutenberg(文学),两者内部体裁都相对单一;"When tested on unseen authors, VerifyMe achieved 85% accuracy on human-human verification from BAWE"。摘要未报告跨体裁验证。;仅用于校验与对比,不计入本项目的数据贡献 |
| 数据/样本 | 需核实:可取得数量、独立单位、标签/测量定义、许可与缺失情况;未确认内容不得写成已具备 |
| 分析工具 | 纯 CPU、16 GB 笔记本可运行的开源工具优先;需核实版本、许可、输入格式、分组/时序划分和不确定度输出能力 |
| 校验材料 | 已知答案的合成数据、标准样或公开基准;仅用于校验与对比,不计入本项目的数据贡献 |
| 风险边界 | 最可能死在语料——需要同一作者、多个体裁的标注语料。这是 go/no-go。 可能的来源:博客作者语料(同一博主的不同类型文章)、公开的学生写作语料、Gutenberg 中同时写小说与书信/散文的作者(后者完全公开且免费,是最稳妥的起点)。 与 T2 的区别必须写清楚:T2 问"跨作者的区分是否靠话题",T15 问"同作者的跨体裁是否仍被认作同一人"——一个是假阳性方向,一个是假阴性方向,实验设计与结论都不同。同时选这两条投同一个赛季会构成自我重复,只能选一条。 人类受试者:不触发(公开既有文本语料)。若使用任何真实学生写作,必须确认其为已公开发布的去标识化语料。 可行性高:特征提取 + 距离度量,纯 CPU。 |
6 · 方法路径
- 装环境或搭装置,跑通已知答案算例并完成校验。 锁定版本、单位、坐标/标签定义和误差计算;反算偏差 >5% 时只修方法,不进入正式样本。
- 核实工具能力边界并逐条排查静默失败点。 五字段原约束为:最可能死在语料——需要同一作者、多个体裁的标注语料。这是 go/no-go。 可能的来源:博客作者语料(同一博主的不同类型文章)、公开的学生写作语料、Gutenberg 中同时写小说与书信/散文的作者(后者完全公开且免费,是最稳妥的起点)。 与 T2 的区别必须写清楚:T2 问"跨作者的区分是否靠话题",T15 问"同作者的跨体裁是否仍被认作同一人"——一个是假阳性方向,一个是假阴性方向,实验设计与结论都不同。同时选这两条投同一个赛季会构成自我重复,只能选一条。 人类受试者:不触发(公开既有文本语料)。若使用任何真实学生写作,必须确认其为已公开发布的去标识化语料。 可行性高:特征提取 + 距离度量,纯 CPU。 此外检查单位或标签错位、全数据预处理泄漏、相关观测冒充独立 n、缺失值静默填 0、默认参数改变口径、输出正常但物理量方向或尺度错误;每项用最小反例测试,不能以“软件未报错”作为通过。
- 预注册最小设计。 把主问题收敛为一个对象、一个主指标、一个主要对照;写死样本单位、重复数、阈值、排除规则和降级触发条件。
- 采集或整理正式数据。 保留原始输入与时间戳/批次,盲化能盲化的标签;协议偏离当天登记,不覆盖原记录。
- 估计主效应与不确定度。 同时报原口径与校正口径,给出误差棒、效应量、失败样本和敏感性曲线;分类、时序或测量问题按 §4 执行。
- 检验 H2 与边界条件。 H1 不成立时不临时换题,而是量化测量误差、样本构成、基础率、时间漂移或混杂能解释多少。
- 独立交叉校验。 使用独立批次、留出时间段或第二种原理不同的方法复算主量;失败时以“不一致”为主结果,不选择性保留支持预期的路径。
7 · 新颖性边界
本课题不声称什么: 不声称首次进入该主题,不声称重新发现或推翻前作,也不把前作的项目编号、年份、奖级、引文和数字据为本项目结果;具体已有工作是:TECA020(2025 TECA Grand Award + Special Award)"VerifyMe"(与 T2 同源,此处针对另一组主张)——摘要原文的应用定位明确是学术场景:"OpenAI's ChatGPT has blurred the line between human and AI-written text, challenging academia's ability to verify authorship. Existing AI detection systems fail with paraphrased content or mimicked writing styles and misclassify human work."(注意最后半句:它明确把"误判人类作品"列为现有系统的缺陷之一——那么它自己的误判率是多少?摘要只给了准确率与 MCC/AUC,没有在教育基率下给出假阴性的绝对数量);训练语料是 BAWE(学术写作)与 Gutenberg(文学),两者内部体裁都相对单一;"When tested on unseen authors, VerifyMe achieved 85% accuracy on human-human verification from BAWE"。摘要未报告跨体裁验证。
已有工作做到哪一步: 五字段证据表明前作已完成其原始对象、方法或性能演示;本项目完整保留这条事实,不把摘要未写出的信息推断为“没有做”。数据集、器材规格、价格、货期或外部文献的任何补充均标为“需核实”。
本项目贡献(属「评价维度转换」;若使用全新独立对象则同时属「新样本独立检验」,若核心是校准与脚本则同时属「方法可复现性贡献」): 三个自产结果:(a) 体裁内 vs 体裁间的验证准确率对照(用带作者与体裁双标注的公开语料);(b) 假阴性率的绝对量——在教育场景的实际基率下(绝大多数提交是诚实的),一个 85% 准确率的系统每 100 名学生会误伤几个?这是一条基率曲线,也是本课题最有说服力的一张图;(c) 需要多少样本才能建立稳定指纹——每位作者的参考样本数从 1 篇到 20 篇,验证准确率的收敛曲线,直接对应"新学期开学时系统还没有足够样本"这个真实约束。 主结论是原结论在预注册控制与独立复核下的效应幅度及适用边界,不是附带造一个更复杂模型或装置。
为何有价值: 它把“看起来有效”转换为“在多大误差、何种样本和什么阈值下仍有效”。差异不显著同样是有效结论,但必须给出误差棒证明有能力分辨预注册的 10% 相对变化或标准化效应 0.5;置信区间过宽只能写“测不出来”。
8 · 决策门槛(go / no-go)
第 5 周末必须同时满足:校验偏差 ≤ 5%、至少取得计划独立样本的 20%、主指标能从原始输入稳定重算。任一不满足,立即启动具名降级路径 “单对象能力边界标定”:砍掉多对象/多模型比较,只保留最可得的一种对象、一个主指标和一个独立复核,转而报告误差、敏感性与最小可分辨效应;主结论仍是“原结论在什么条件下站得住”。
与“附属赛后不得修改”的冲突点:主指标、阈值、样本排除、对照、预处理和降级触发条件必须赛前定死。须提前核实: 最可能死在语料——需要同一作者、多个体裁的标注语料。这是 go/no-go。 可能的来源:博客作者语料(同一博主的不同类型文章)、公开的学生写作语料、Gutenberg 中同时写小说与书信/散文的作者(后者完全公开且免费,是最稳妥的起点)。 与 T2 的区别必须写清楚:T2 问"跨作者的区分是否靠话题",T15 问"同作者的跨体裁是否仍被认作同一人"——一个是假阳性方向,一个是假阴性方向,实验设计与结论都不同。同时选这两条投同一个赛季会构成自我重复,只能选一条。 人类受试者:不触发(公开既有文本语料)。若使用任何真实学生写作,必须确认其为已公开发布的去标识化语料。 可行性高:特征提取 + 距离度量,纯 CPU。 同时核实许可、设备/软件真实能力、场地、表格和采购可得性。已知困难及其定位:这些限制就是能力边界,不用未经核实的规格填补。选择前提:学生愿意做重复、校验和零结果解释。预算裁剪顺序:先砍多模型/多材料,再砍次要指标,再砍展示性装置;不得砍校验、主要对照、独立重复和交叉验证。
净实验窗口按 2026-08 至 12 月约 3–4 个月规划。按实际对象核实合规:附属赛后项目不得更改;展台禁液体(含水)、土壤、玻璃、锐器、化学品、干燥粉末、>100 Wh 电池和通电无人机,禁网址与二维码;家中不得培养任何潜在危险生物制剂;涉及脊椎动物、人类受试者、激光、高真空或 SDS 标注的致癌致畸化学品时,须在相应动作前确认审批。AI 不得用于撰写研究计划、摘要、展板或引文。
评分: O=8, W=8, F=8, S=7, Fit=10 → base=80.6,h=9 → [72, 90],置信度:中(跨体裁语料可及性未核实)
自己继续找题
bash
python3 analysis/mine_isef.py --cat TECA --awarded-only "你感兴趣的关键词"
python3 analysis/score_topics.py your_scores.tsv
但在 TECA,工具的价值有限——两届只有 40 个项目,你应该直接把 40 个摘要全部读一遍,这只需要一个下午,而且比任何关键词检索都可靠。本文件就是这么做的。
动作永远是同一个:拿一个近届获奖作品,问它没问的那个关于自身有效性的问题。
但在 TECA,还有两道前置筛子: 1. 这个结论能不能印在一张静态展板上? 展台禁液体、禁玻璃、禁锐器、禁网址与二维码。凡是"评委必须亲自试一下才懂"的课题,直接放弃。 2. 剥掉方法学之后,还剩下艺术/文化/表达这个对象吗? 如果没有,这个课题属于 SOFT 而不是 TECA。
本赛道最高产的五种问法:
- 这个指标度量的是艺术性吗。 T5、T6 都是这么来的。生成音乐、重建图像、评价发音——这个类目的评价问题是全 ISEF 最尖锐的,而没有一个获奖项目在做它。
- 金标准是谁,他们自己一致吗。 T7 是这么来的。凡是"与专家等效",先问专家之间等效吗。
- 谁在录音/演奏/签署/佩戴。 T3、T8、T9 都是这么来的。凡是感知类系统,先问"换一个人还行吗"。
- 链条上还有哪一环没报告误差。 T4 是这么来的。OMR → 音高追踪 → 比对,三环只报了一个总数。
- 两个耦合的主张,其中一个有数字吗。 T14 是这么来的。"融合达到高保真"与"用便宜设备省 330 倍成本"是两件事。
几条本文件核查过但没写成课题的线索,留给你: - TECA016T(2025 Grand,eiBraille) 报告"学习速度提升 9 倍,掌握时间从 3 年缩短到 6 个月"、"5 万次循环 100% 致动"、"96% 实时传输准确率"。9 倍的对照组是什么? "3 年"是一个人群统计量,不是同期对照。另外 5 万次循环的加速寿命测试与真实使用条件的对应关系也从未说明。这条没写成课题是因为重做需要硬件与人类受试者,但它的方法学问题非常清晰。 - TECA017(2026 Grand,EyeR) 报告"总材料成本约 138 美元、工作符合预期",但没有任何可测量的光学性能指标(视场角、eye box、调制传递函数、色差)。一副 AR 眼镜的价值恰恰在这些量上。 - TECA019(2026,未获奖) 用 35,182 条话语区分言语障碍与双语口音,多层感知器 97.6%——但数据来自"三个障碍数据集、两个双语数据集、两个对照数据集"共七个来源。如果障碍与非障碍来自不同的录音项目,模型完全可能在识别录音条件而非言语特征。这是一个几乎与 C1/B5 同构的数据集来源混杂问题,只是它没有获奖,所以本文件没有选它。 - TECA011(2026,未获奖) 用非谐性与品质因数检测琴弦损伤,自己诚实报告"若干数据组标准差很大,归因于仪器精度不足"——这是一个可以直接接手的、需要更精密测量的物理课题(但更适合 PHYS 类目)。 - TECA002(2025,未获奖,RestART) 在人工制造的损伤上评估艺术品修复模型——与 T10 完全同构的"合成损伤能否代理真实损伤"问题。
一条规矩
凡是"某项目做了/没做 X"的判断,必须回摘要原文核对。
本文件里有三条的核心前提尚待核实,已在各自"约束"栏写明退路:T10(SAMA 的"progressively degrading speech"是真实纵向录音还是人工合成)、T12(Kintsugi-Splitter 的开源代码是否能跑通、算力是否在 CPU 范围内)、T3(SmartStrings 的划分方式,摘要只说数据是"self-recorded")。
同时必须承认,TECA004(ArticuRace)与 TECA013(2025 年的 ASR 测试)在方法学上做得比多数同类严谨——前者设了人类对照组、用了等效性检验、并诚实报告 AI 在点估计上不如教师;后者用了方差分析与傅里叶分析并明确写出"需要更多研究"。你的课题针对它们时,措辞必须先承认这些。
每一条"它没做 X",你都要能当场翻到摘要的那一段。