Dev Spec v2 · ← 返回文档首页

SonicFlow v2 开发 Spec(03 AI 修音一键成品)

版本v2.0(2026-09-27)上游《PRD_03_AI修音一键成品》《08_方案重构v2》《05_代码架构v2》

底座:[../00_共享底座_开发spec/README.md](../00_共享底座_开发spec/README.md)

v1(播客后期 + 人工服务)已归档到 `_archive_v1/03_音频_开发spec/`

文档索引

文件 内容
01_范围与里程碑.md 范围、期次、用户故事与验收
02_系统设计.md 模块、作品状态机、数据库、配方
03_接口规格.md 前端接口、回调、后台
04_唱歌流水线.md 分离、降噪、参考旋律修音、节奏对齐、人声链、自动混音、母带
05_说话模式_剪辑与字幕.md 说话模式:全自动剪辑三档、字幕、视频播客(沿用 v1,去掉人工)
06_视频与工具箱.md 竖屏歌词视频、水印、免费工具箱(音准评分等)
07_测试与验收.md 测试集、指标、许可证、上线清单

与 v1 相比

v1 v2
主线是播客后期;翻唱修音被降级 主线回到唱歌修音(原始命题);说话模式为次线
利润靠人工服务(S 线)、Fiverr、包月 全部取消人工;卖订阅和单首
修音只作为工具的一个功能 修音 + 混音 + 母带 + 歌词视频,输出能直接发布的成品
获客靠 Fiverr、邮件、社群 水印传播循环 + 音准评分等免费工具 + SEO

关键决策

# 决策
D1 音频处理全部自部署(没有合适的 API);语音识别通过模型网关调用(可以是自部署的模型)
D2 中间文件统一为 48kHz / 32 位浮点 WAV;只在导出时编码
D3 原曲分离得到的伴奏和原唱只用于该用户本次作品,不跨用户复用,不提供伴奏库;修音作品里的原曲伴奏不进入任何导出文件或视频,这类作品只导出"发布安全版人声"。工具箱的人声分离是独立的个人练习工具(见 06 文档第 3 节)
D4 所有处理都是非破坏性的:作品保存的是"源文件 + 参数",改参数即可重新渲染
D5 免费档导出带水印,这是主要的获客渠道;水印只出现在授权伴奏或原创作品上,避免品牌和侵权内容绑定
D6 年龄门槛 13 岁;13~17 岁不开放声音克隆