Dev Spec v2 · ← 返回文档首页

07 测试与验收

1. 测试集

名称 内容 用途
songs 20 首翻唱:干声 + 原曲;其中 5 首故意唱偏、3 首低八度、3 首带明显抢拍拖拍、3 首是用手机录的(带底噪) 唱歌流水线
songs_mixed 5 首用户人声里混有伴奏的录音 分离人声
genres 每种曲风 3 首 人声链与混音
podcast_zh / podcast_en / edit_gold / video_pod 沿用 v1 说话模式

素材来自自己录制、朋友授权或许可证允许的公开素材;不用用户文件做测试。

2. 验收指标

2.1 唱歌

项 目标
修音:与目标旋律的平均偏差 下降 ≥ 50%
八度错误 0
盲听:修音后更好 ≥ 70% 选择修音后的版本
盲听:"听得出处理痕迹" ≤ 30%
混音:"人声清楚又不突兀" ≥ 80%
母带 响度误差 ≤ ±0.5 LU;无削波
歌词对齐(粘贴歌词时) 误差 ≤ 150ms
端到端(4 分钟) P95 ≤ 3 分钟

盲听由开发阶段招募的 10 位听众完成(一次性,不属于运营中的人工)。

2.2 说话模式

沿用 05 文档与 v1 的指标:剪辑精确率(轻 ≥ 98%、标准 ≥ 95%、深度 ≥ 85%)、字幕时间误差 ≤ 100ms。

2.3 业务

时间 指标
第 16 周 免费转付费 ≥ 2%;每个活跃用户每周处理 ≥ 1 首;水印回流 ≥ 20%
第 24 周 付费订阅 ≥ 400
止损线 第 16 周免费转付费 < 2% 或每周处理 < 1 首

3. 许可证

组件 许可证 可商用 备注
DeepFilterNet MIT / Apache-2.0 ✅
Demucs MIT ✅
audio-separator 代码 MIT ✅ 模型权重逐个核查
音高检测模型(RMVPE / CREPE 一类) 逐个核查 待查
pyworld 修改版 BSD ✅
matchering GPL-3.0 ✅(仅服务器端运行) 随客户端分发时要遵守 GPL
pedalboard GPL-3.0 ✅(仅服务器端运行) 同上
faster-whisper / Whisper MIT ✅
FunASR 代码与模型分别核查 待查
思源黑体 / Noto Sans CJK OFL ✅ 视频字体

以各项目当前的 LICENSE 文件为准,接入时保存快照。

4. 上线清单

  • ☐ 20 首测试曲全部达到 2.1 的指标
  • ☐ 每种曲风的预设都有版本号和回归测试记录
  • ☐ 原曲伴奏作品:导出接口只允许发布安全版人声;导出人声与分离伴奏的互相关检查通过(伴奏残留测试 10 首)
  • ☐ 原曲分离的提示文案;"有权使用伴奏"勾选存证
  • ☐ 平台内搭配官方音源的操作指引已在抖音、TikTok 实测
  • ☐ 授权勾选:本人声音、伴奏用途
  • ☐ 水印在各平台的竖屏安全区内(在 TikTok、抖音界面上实际检查)
  • ☐ 失败自动退回额度
  • ☐ 隐私政策、条款、AI 披露
  • ☐ 国内版另加:公司主体、ICP、深度合成算法备案评估结果、显式 + 隐式标识