Dev Spec v2 · ← 返回文档首页
07 测试与验收
1. 测试集
| 名称 | 内容 | 用途 |
|---|---|---|
songs |
20 首翻唱:干声 + 原曲;其中 5 首故意唱偏、3 首低八度、3 首带明显抢拍拖拍、3 首是用手机录的(带底噪) | 唱歌流水线 |
songs_mixed |
5 首用户人声里混有伴奏的录音 | 分离人声 |
genres |
每种曲风 3 首 | 人声链与混音 |
podcast_zh / podcast_en / edit_gold / video_pod |
沿用 v1 | 说话模式 |
素材来自自己录制、朋友授权或许可证允许的公开素材;不用用户文件做测试。
2. 验收指标
2.1 唱歌
| 项 | 目标 |
|---|---|
| 修音:与目标旋律的平均偏差 | 下降 ≥ 50% |
| 八度错误 | 0 |
| 盲听:修音后更好 | ≥ 70% 选择修音后的版本 |
| 盲听:"听得出处理痕迹" | ≤ 30% |
| 混音:"人声清楚又不突兀" | ≥ 80% |
| 母带 | 响度误差 ≤ ±0.5 LU;无削波 |
| 歌词对齐(粘贴歌词时) | 误差 ≤ 150ms |
| 端到端(4 分钟) | P95 ≤ 3 分钟 |
盲听由开发阶段招募的 10 位听众完成(一次性,不属于运营中的人工)。
2.2 说话模式
沿用 05 文档与 v1 的指标:剪辑精确率(轻 ≥ 98%、标准 ≥ 95%、深度 ≥ 85%)、字幕时间误差 ≤ 100ms。
2.3 业务
| 时间 | 指标 |
|---|---|
| 第 16 周 | 免费转付费 ≥ 2%;每个活跃用户每周处理 ≥ 1 首;水印回流 ≥ 20% |
| 第 24 周 | 付费订阅 ≥ 400 |
| 止损线 | 第 16 周免费转付费 < 2% 或每周处理 < 1 首 |
3. 许可证
| 组件 | 许可证 | 可商用 | 备注 |
|---|---|---|---|
| DeepFilterNet | MIT / Apache-2.0 | ✅ | |
| Demucs | MIT | ✅ | |
| audio-separator | 代码 MIT | ✅ | 模型权重逐个核查 |
| 音高检测模型(RMVPE / CREPE 一类) | 逐个核查 | 待查 | |
| pyworld | 修改版 BSD | ✅ | |
| matchering | GPL-3.0 | ✅(仅服务器端运行) | 随客户端分发时要遵守 GPL |
| pedalboard | GPL-3.0 | ✅(仅服务器端运行) | 同上 |
| faster-whisper / Whisper | MIT | ✅ | |
| FunASR | 代码与模型分别核查 | 待查 | |
| 思源黑体 / Noto Sans CJK | OFL | ✅ | 视频字体 |
以各项目当前的 LICENSE 文件为准,接入时保存快照。
4. 上线清单
- ☐ 20 首测试曲全部达到 2.1 的指标
- ☐ 每种曲风的预设都有版本号和回归测试记录
- ☐ 原曲伴奏作品:导出接口只允许发布安全版人声;导出人声与分离伴奏的互相关检查通过(伴奏残留测试 10 首)
- ☐ 原曲分离的提示文案;"有权使用伴奏"勾选存证
- ☐ 平台内搭配官方音源的操作指引已在抖音、TikTok 实测
- ☐ 授权勾选:本人声音、伴奏用途
- ☐ 水印在各平台的竖屏安全区内(在 TikTok、抖音界面上实际检查)
- ☐ 失败自动退回额度
- ☐ 隐私政策、条款、AI 披露
- ☐ 国内版另加:公司主体、ICP、深度合成算法备案评估结果、显式 + 隐式标识