SonicFlow v2 开发 Spec(03 AI 修音一键成品)
版本v2.0(2026-09-27)上游《PRD_03_AI修音一键成品》《08_方案重构v2》《05_代码架构v2》
底座:[../00_共享底座_开发spec/README.md](../00_共享底座_开发spec/README.md)
v1(播客后期 + 人工服务)已归档到 `_archive_v1/03_音频_开发spec/`
文档索引
与 v1 相比
| v1 |
v2 |
| 主线是播客后期;翻唱修音被降级 |
主线回到唱歌修音(原始命题);说话模式为次线 |
| 利润靠人工服务(S 线)、Fiverr、包月 |
全部取消人工;卖订阅和单首 |
| 修音只作为工具的一个功能 |
修音 + 混音 + 母带 + 歌词视频,输出能直接发布的成品 |
| 获客靠 Fiverr、邮件、社群 |
水印传播循环 + 音准评分等免费工具 + SEO |
关键决策
| # |
决策 |
| D1 |
音频处理全部自部署(没有合适的 API);语音识别通过模型网关调用(可以是自部署的模型) |
| D2 |
中间文件统一为 48kHz / 32 位浮点 WAV;只在导出时编码 |
| D3 |
原曲分离得到的伴奏和原唱只用于该用户本次作品,不跨用户复用,不提供伴奏库;修音作品里的原曲伴奏不进入任何导出文件或视频,这类作品只导出"发布安全版人声"。工具箱的人声分离是独立的个人练习工具(见 06 文档第 3 节) |
| D4 |
所有处理都是非破坏性的:作品保存的是"源文件 + 参数",改参数即可重新渲染 |
| D5 |
免费档导出带水印,这是主要的获客渠道;水印只出现在授权伴奏或原创作品上,避免品牌和侵权内容绑定 |
| D6 |
年龄门槛 13 岁;13~17 岁不开放声音克隆 |