Conrad Challenge Archive 2024 — 2026

C09

不上传录音的离线环境声音无障碍提醒器

Private Offline Sound Alerts for Deaf and Hard-of-Hearing Users

推荐优先级 ★★★☆☆本地隐私与数据主权族原型 B+G资源:约 $140 BOM技能:音频信号 + 无障碍设计建议 3 人

1 · 创新命题

面向住在宿舍或合租屋的聋人及重听者,做一个完全本地、可由用户示教的声音提醒器,只识别 其房间里的烟雾报警器、敲门、洗衣结束和水壶鸣叫,通过腕带振动给出不同模式;相对云端智能音箱, 不保存连续录音,并把漏报、误报、端到端延迟与待机功耗逐项公开。 EN A private, offline, user-trainable sound-alert device for deaf and hard-of-hearing people in dorms and shared homes, mapping alarms, knocks and appliance cues to distinct wrist vibrations without storing continuous audio or sending it to a cloud service.

2 · 背景与空白

Apple Sound Recognition、Android Sound Notifications 与 Amazon Alexa Sound Detection 已提供不同范围 的声音识别,能力、设备要求和本地/云处理边界随版本变化,需核实;开源 YAMNet 给通用音频类别, Edge Impulse 支持嵌入式训练部署。2026 Cyber 决赛 Robo Therapy 与 Echo/Pulse 聚焦震颤外骨骼、肌电语音, 本题不做治疗或语音恢复。空白在:用户能用少量自家样本增加一个极具体声音,同时设备给出隐私 可验证性与电池代价,而不是声称“AI 什么都能听懂”。

3 · 可检验假设

H1 对 4 类目标声音,在跨房间、跨距离和背景电视条件下,个性化轻量模型达到事件召回 ≥ 0.90、 每 24 小时误报 ≤ 3 次,端到端振动延迟 ≤ 2 秒;原始音频在推理后 10 秒内自动清除。 H2(机制)每类加入 10 个用户现场样本,相对通用预训练分类器使 PR-AUC 提升 ≥ 0.10,且不会让 待机功耗增加超过 10%。

4 · 量化验收标准

  1. 【方法学校验 · 硬门槛】 用自建采集链复现 AudioSet/YAMNet 官方至少 30 个公开音频片段 的类别与置信度排序,top-5 命中率与参考实现偏差 ≤ 5 个百分点;用标准音源校验录音幅度偏差 ≤ 3 dB。 此条不过,后续全部结论无效。
  2. ≥ 400 个事件、≥ 40 小时负样本,覆盖 3 个房间、3 个距离;仅用公开许可声音与团队自录非私人内容。
  3. 极不平衡事件检测报 PR-AUC、召回、精确率、每日误报,明确不报 accuracy;按录制 session 划分, 同一长录音切片不得跨集,并量化随机切片高估。
  4. 原始音频删除用 canary 文件与存储取证验证;断网 72 小时功能不变。
  5. 报功耗、预计续航区间、延迟 95 分位;烟雾报警不得声称替代认证报警辅助器。

5 · 数据与工具

用途 来源 / 工具
计算 Raspberry Pi Zero 2 W 或 ESP32-S3;YAMNet 未必适合 MCU,实际内存能力 需核实
音频 I2S MEMS 麦克风、公开 AudioSet 子集;授权与标签质量需复核
模型 TensorFlow Lite/YAMNet 或 Edge Impulse;个性化层与事件聚合需自己实现
提醒 BLE 振动腕带或自制 nRF52/振动马达;BOM 价格按地区 需核实
对照 YAMNet 官方推理、手机系统声音提醒 —— 仅用于校验与对比,不计入数据贡献

能力边界:通用数据集的“alarm”不代表用户家的声学环境。致命错误是用同一段长录音切片后随机 分集,模型会记住背景,必须按 session/房间留出。

无障碍设计部分不得由健听团队代替目标用户下结论。振动编码要测混淆矩阵:受试者在不看屏幕时是否 能区分敲门、报警和家电结束;若识别率低,增加模型类别反而降低安全性。烟雾报警事件可用公开录音与 低声级扬声器重放,绝不触发真实消防系统;隐私指示灯与物理静音键也要进入任务测试。 每个类别还要提供“我不确定”的振动/屏幕状态,低置信度时不得强行给出错误类别。用户能调阈值, 但界面同时显示预计漏报与误报变化,避免通过把阈值调高获得虚假的低误报。

6 · 赛季执行路径

  1. 第 1–2 周:采集链、30 片段与声级方法学校验。
  2. 第 3 周:与 2 名目标用户/无障碍顾问确认四类声音和振动编码。
  3. 第 4–6 周:采集 400 事件与 40 小时负样本,冻结切分。
  4. 第 7 周:通用基线;第 8 周个性化对照与消融。
  5. 第 9 周:72 小时断网、删除取证、功耗与延迟测试。
  6. 第 10 周:可用性走查;第 11–12 周单位经济、伦理边界和简述。

7 · 新颖性边界

不声称:不发明声音分类;不取代消防认证设备;不诊断听力;不覆盖所有环境声音。 已有工作:Apple Sound Recognition、Android Sound Notifications、Alexa Sound Detection 提供系统 功能;Google YAMNet/AudioSet 与 Edge Impulse 提供模型工具。本项目贡献是宿舍/合租场景的本地 示教、无录音留存验证,以及精度—功耗—隐私的公开权衡。护城河类型:零资源(B,零云连接)+ 极端具体(G);用户自定义声音模板在设备内积累,不售卖录音。

8 · go/no-go

第 3 周末:目标用户无法参与时,具名降级为 无障碍顾问评审 + 合成任务测试,不声称真实用户 采纳。 第 6 周末:每类有效事件 < 60,收窄到烟雾报警器与敲门两类;第 8 周若召回 < 0.75,则降级为 可调声学模板匹配器,不使用通用 AI,但保留离线、可示教和误报量化框架。