Product Requirements Document · ← 返回文档首页

AI 修音一键成品

工作代号SonicFlow v2文档版本v2.0(2026-09-27)状态待评审市场范围海外先行;国内在主体与备案确认后上线取代v1《一站式 AI 音频处理工具》,缺陷分析见 08_方案重构v2

产品形态:网页(海外)/ 小程序或 H5(国内);上传或在线录音 → 全自动修音、混音、母带 → 成品音频 + 竖屏字幕视频

1. 产品概述

1.1 一句话定位

唱完就能发。上传清唱录音,自动修音、混音、母带,同时生成带歌词字幕的竖屏视频。

1.2 为什么这样做

事实 推论
原始命题是"AI 修音全功能",调研结论是修音的钱在"剩下 30% 的手工微调",人工修音混音单首 100~500 元 做得够好的全自动成品,可以用人工 1/10 的价格承接这部分需求
Voloco(自动修音 App)下载 5000 万+,订阅 $9.99~11.99/月 普通唱歌用户愿意为修音订阅付费
旧方案的"吸附到最近音"不知道原本该唱哪个音,会越修越错 参考旋律修音:以原唱旋律作为目标,是本产品的技术差异点
翻唱的最终去处是抖音、TikTok、B 站、小红书;但多数用户没有授权伴奏,而原曲伴奏的录音版权属于唱片公司 成品分两种导出:用授权伴奏时直接生成竖屏字幕视频(带水印传播);用原曲分离的伴奏时只导出"发布安全版人声",让用户在平台内搭配官方音源发布
BandLab 母带、K 歌 App 修音都免费 只靠"修音"本身收费很难,要卖能直接发布的成品

1.3 业务目标

阶段 目标
第 10 周 海外上线唱歌模式 + 免费工具箱
第 16 周 免费转付费 ≥ 2%;每个活跃用户每周处理 ≥ 1 首
第 24 周 付费订阅 ≥ 400;说话模式上线;国内版视资质进度(深度合成备案评估完成后)

1.4 非目标

  • ❌ 用他人声音翻唱、变声、克隆(包括明星、主播)
  • ❌ AI 作曲、伴奏生成
  • ❌ 任何人工服务(人工精修、包月、Fiverr 接单)
  • ❌ 提供或托管有版权的伴奏库

2. 目标用户

画像 场景 付费点
P1 翻唱爱好者(主力) 每周发 1~3 条翻唱短视频 订阅:无水印、高清视频、每月不限首数(公平使用)
P2 独立音乐人 自己的歌做 demo 或发行前的母带 单首购买、分轨导出
P3 播客、网课、配音作者 说话模式:降噪、剪辑、字幕 Creator 订阅

3. 用户旅程(唱歌模式)

刷到带"Made with ..."角标的翻唱视频,或者搜索"auto tune my voice online"
  → 可选:先用免费的"你唱得准吗"测一下(音准评分 + 分享图)
  → 上传人声(或在浏览器里对着伴奏录)
  → 伴奏:上传伴奏;或上传原曲,由系统分离出伴奏和原唱旋律(页面提示仅限个人练习)
  → 选曲风(流行 / 抒情 / 说唱 / 摇滚 / 国风)和修音强度
  → 1~3 分钟后:前后对比试听
  → 导出方式由伴奏来源决定:
     · 用户自己的伴奏(勾选"有权使用")或原创:完整成品 + 竖屏歌词视频
       (免费档 720p 带水印,每月 3 首;付费无水印 1080p、wav、分轨)
     · 原曲分离的伴奏:只能在站内试听完整混音;导出"发布安全版人声"
       (处理好的人声 + 与原曲的对齐偏移),用户在抖音 / TikTok 里选平台曲库的官方音源、叠加这条人声发布
  → 一键分享 / 下载

4. 功能需求

4.1 唱歌模式(P0)

ID 需求 验收标准
S-01 输入:人声文件或浏览器录音(录音时播放伴奏,并自动做延迟补偿) 支持 wav/mp3/m4a;录音与伴奏的对齐误差 ≤ 20ms
S-02 伴奏来源:用户上传的伴奏(需勾选"有权使用");或原曲,自动分离出伴奏和原唱人声 分离结果只用于该用户本次作品,不进入任何共享库;原曲分离的伴奏不会出现在作品的任何导出文件或视频里
S-03 降噪:只处理人声轨,强度保守 盲听无"水声"伪影
S-04 参考旋律修音:有原唱时以原唱旋律为目标;没有时按调内音修正;按音符整体平移,保留颤音;强度 0~100% 与目标旋律的平均偏差降低 ≥ 50%;八度错误为 0
S-05 节奏对齐(P1):把明显抢拍、拖拍的字对齐到原唱 只动偏差 > 80ms 的字
S-06 人声处理链:按曲风预设(EQ、压缩、去齿音、饱和、混响、延迟) 每种曲风有标准测试曲和参数
S-07 自动混音:根据曲风确定人声与伴奏的响度比例,并对伴奏做人声频段的动态避让 盲听"人声清楚又不突兀"≥ 80%
S-08 母带:可选参考曲,否则按流媒体或短视频的响度预设 无削波;响度误差 ≤ ±0.5 LU
S-09 歌词字幕:识别人声得到带时间戳的歌词;用户可以粘贴正确歌词,系统自动对齐 对齐误差 ≤ 150ms
S-10 竖屏视频:封面图或波形动画 + 歌词字幕 + 曲名;免费档带水印角标。只对授权伴奏或原创作品生成 1080×1920;渲染 ≤ 2 分钟
S-10b 发布安全版人声:原曲伴奏的作品导出处理后的人声(wav/m4a)+ 对齐说明;附平台内搭配官方音源的操作指引 人声与原曲对齐误差 ≤ 20ms;文件内不含任何伴奏成分
S-11 前后对比试听 一键切换

4.2 说话模式(P1)

ID 需求
T-01 降噪、多人电平平衡、响度预设(播客、短视频、广播)
T-02 全自动剪辑(轻 / 标准 / 深度三档):收紧停顿、去口头禅、去结巴,深度档还会剪口误和重录;所有剪辑都能事后恢复
T-03 字幕:SRT/VTT/ASS、双语、烧录到视频
T-04 视频播客:剪辑同时作用于画面

说话模式的规格沿用 v1 spec 中已经设计好的"自动剪辑与字幕"部分(v2 spec 的 05 文档),去掉所有人工审听的内容。

4.3 免费工具箱(P0,获客用)

ID 工具 引导方向
X-01 你唱得准吗:上传一段清唱 + 原曲 → 音准评分、跑调位置、分享图 一键"帮我修好"
X-02 人声分离(每天限次,输出 128kbps) 付费得到无损和 4 轨
X-03 升降调、变速 —
X-04 调性和 BPM 检测 —

4.4 账户与计费(P0)

ID 需求
B-01 海外:代理商户收款,支持订阅和单首购买;国内:微信支付;早期可用卡密
B-02 免费额度:每月 3 首唱歌作品(带水印)+ 工具箱限次
B-03 公平使用:Pro 每月 30 首,超出后排队降级为低优先级,不额外扣费

4.5 第 3 期:本人声音克隆(仅海外)

  • 用户朗读系统随机生成的一段验证文本,确认是本人后才能训练
  • 只能用于该用户本人的配音;输出加显式提示和隐式标识

5. 非功能需求

类别 要求
性能 4 分钟歌曲从提交到出成品 ≤ 3 分钟(含视频)
成本 每首歌可变成本 ≤ $0.05
自动化 全程零人工;失败的任务自动重试后退回额度
隐私 免费用户的文件 7 天后删除;付费用户的源文件保留 90 天(保证可以重新导出);原曲分离结果不跨用户复用
年龄 13 岁以上;13~17 岁不开放声音克隆
合规 输出写入隐式标识;分离功能标注个人练习用途

6. 数据指标

指标 目标
上传 → 成品完成率 ≥ 90%
免费转付费 ≥ 2%(止损线)
每个活跃用户每周处理首数 ≥ 1
带水印视频的外部回流(通过水印进站的新用户占比) ≥ 20%
发布安全版人声的使用率(原曲作品中) 观察指标:比例过低说明操作太麻烦,要优化指引
音准评分工具 → 注册转化率 ≥ 10%
付费月留存 ≥ 80%

7. 里程碑

阶段 时间 交付
M0 第 1~6 周(与 02 并行打基础) 音频引擎脚本:分离、降噪、参考旋律修音、人声链、混音、母带;20 首测试曲达标
M1 第 7~10 周 海外上线:唱歌模式、歌词视频、免费工具箱、订阅
M2 第 11~18 周(与 01 交替,约 1/3 精力) 浏览器录音、节奏对齐、音准评分分享图、SEO 页面
M3 第 19~24 周 说话模式;国内版(资质确认后);本人声音克隆(海外)

8. 风险与合规

风险 应对
修音效果不及人工 页面如实说明能力边界;强度可调;持续用测试曲回归
伴奏版权 原曲分离的伴奏只在站内试听,不进入任何导出文件或带水印的视频;发布走"发布安全版人声 + 平台官方音源";不提供伴奏库
品牌与侵权内容绑定 水印只出现在授权伴奏或原创作品上,避免品牌角标出现在侵权视频里
用户谎报"有权使用" 勾选存证;收到权利人投诉时下架相关作品并暂停该账号的导出
国内合规 修音、变调可能属于"语音属性编辑"类深度合成服务,需要评估深度合成算法备案;要有主体;上线前确认
国内收费(iOS 小程序) 订阅属于虚拟商品,iOS 小程序不能直接用微信支付购买,需要接入微信"小程序虚拟支付"(有平台费)或引导到 App / 网页,以微信当期规则为准
声音克隆滥用 只允许本人克隆,需要验证;国内不上线