1. 产品概述
1.1 一句话定位
唱完就能发。上传清唱录音,自动修音、混音、母带,同时生成带歌词字幕的竖屏视频。
1.2 为什么这样做
| 事实 |
推论 |
| 原始命题是"AI 修音全功能",调研结论是修音的钱在"剩下 30% 的手工微调",人工修音混音单首 100~500 元 |
做得够好的全自动成品,可以用人工 1/10 的价格承接这部分需求 |
| Voloco(自动修音 App)下载 5000 万+,订阅 $9.99~11.99/月 |
普通唱歌用户愿意为修音订阅付费 |
| 旧方案的"吸附到最近音"不知道原本该唱哪个音,会越修越错 |
参考旋律修音:以原唱旋律作为目标,是本产品的技术差异点 |
| 翻唱的最终去处是抖音、TikTok、B 站、小红书;但多数用户没有授权伴奏,而原曲伴奏的录音版权属于唱片公司 |
成品分两种导出:用授权伴奏时直接生成竖屏字幕视频(带水印传播);用原曲分离的伴奏时只导出"发布安全版人声",让用户在平台内搭配官方音源发布 |
| BandLab 母带、K 歌 App 修音都免费 |
只靠"修音"本身收费很难,要卖能直接发布的成品 |
1.3 业务目标
| 阶段 |
目标 |
| 第 10 周 |
海外上线唱歌模式 + 免费工具箱 |
| 第 16 周 |
免费转付费 ≥ 2%;每个活跃用户每周处理 ≥ 1 首 |
| 第 24 周 |
付费订阅 ≥ 400;说话模式上线;国内版视资质进度(深度合成备案评估完成后) |
1.4 非目标
- ❌ 用他人声音翻唱、变声、克隆(包括明星、主播)
- ❌ AI 作曲、伴奏生成
- ❌ 任何人工服务(人工精修、包月、Fiverr 接单)
- ❌ 提供或托管有版权的伴奏库
2. 目标用户
| 画像 |
场景 |
付费点 |
| P1 翻唱爱好者(主力) |
每周发 1~3 条翻唱短视频 |
订阅:无水印、高清视频、每月不限首数(公平使用) |
| P2 独立音乐人 |
自己的歌做 demo 或发行前的母带 |
单首购买、分轨导出 |
| P3 播客、网课、配音作者 |
说话模式:降噪、剪辑、字幕 |
Creator 订阅 |
3. 用户旅程(唱歌模式)
刷到带"Made with ..."角标的翻唱视频,或者搜索"auto tune my voice online"
→ 可选:先用免费的"你唱得准吗"测一下(音准评分 + 分享图)
→ 上传人声(或在浏览器里对着伴奏录)
→ 伴奏:上传伴奏;或上传原曲,由系统分离出伴奏和原唱旋律(页面提示仅限个人练习)
→ 选曲风(流行 / 抒情 / 说唱 / 摇滚 / 国风)和修音强度
→ 1~3 分钟后:前后对比试听
→ 导出方式由伴奏来源决定:
· 用户自己的伴奏(勾选"有权使用")或原创:完整成品 + 竖屏歌词视频
(免费档 720p 带水印,每月 3 首;付费无水印 1080p、wav、分轨)
· 原曲分离的伴奏:只能在站内试听完整混音;导出"发布安全版人声"
(处理好的人声 + 与原曲的对齐偏移),用户在抖音 / TikTok 里选平台曲库的官方音源、叠加这条人声发布
→ 一键分享 / 下载
4. 功能需求
4.1 唱歌模式(P0)
| ID |
需求 |
验收标准 |
| S-01 |
输入:人声文件或浏览器录音(录音时播放伴奏,并自动做延迟补偿) |
支持 wav/mp3/m4a;录音与伴奏的对齐误差 ≤ 20ms |
| S-02 |
伴奏来源:用户上传的伴奏(需勾选"有权使用");或原曲,自动分离出伴奏和原唱人声 |
分离结果只用于该用户本次作品,不进入任何共享库;原曲分离的伴奏不会出现在作品的任何导出文件或视频里 |
| S-03 |
降噪:只处理人声轨,强度保守 |
盲听无"水声"伪影 |
| S-04 |
参考旋律修音:有原唱时以原唱旋律为目标;没有时按调内音修正;按音符整体平移,保留颤音;强度 0~100% |
与目标旋律的平均偏差降低 ≥ 50%;八度错误为 0 |
| S-05 |
节奏对齐(P1):把明显抢拍、拖拍的字对齐到原唱 |
只动偏差 > 80ms 的字 |
| S-06 |
人声处理链:按曲风预设(EQ、压缩、去齿音、饱和、混响、延迟) |
每种曲风有标准测试曲和参数 |
| S-07 |
自动混音:根据曲风确定人声与伴奏的响度比例,并对伴奏做人声频段的动态避让 |
盲听"人声清楚又不突兀"≥ 80% |
| S-08 |
母带:可选参考曲,否则按流媒体或短视频的响度预设 |
无削波;响度误差 ≤ ±0.5 LU |
| S-09 |
歌词字幕:识别人声得到带时间戳的歌词;用户可以粘贴正确歌词,系统自动对齐 |
对齐误差 ≤ 150ms |
| S-10 |
竖屏视频:封面图或波形动画 + 歌词字幕 + 曲名;免费档带水印角标。只对授权伴奏或原创作品生成 |
1080×1920;渲染 ≤ 2 分钟 |
| S-10b |
发布安全版人声:原曲伴奏的作品导出处理后的人声(wav/m4a)+ 对齐说明;附平台内搭配官方音源的操作指引 |
人声与原曲对齐误差 ≤ 20ms;文件内不含任何伴奏成分 |
| S-11 |
前后对比试听 |
一键切换 |
4.2 说话模式(P1)
| ID |
需求 |
| T-01 |
降噪、多人电平平衡、响度预设(播客、短视频、广播) |
| T-02 |
全自动剪辑(轻 / 标准 / 深度三档):收紧停顿、去口头禅、去结巴,深度档还会剪口误和重录;所有剪辑都能事后恢复 |
| T-03 |
字幕:SRT/VTT/ASS、双语、烧录到视频 |
| T-04 |
视频播客:剪辑同时作用于画面 |
说话模式的规格沿用 v1 spec 中已经设计好的"自动剪辑与字幕"部分(v2 spec 的 05 文档),去掉所有人工审听的内容。
4.3 免费工具箱(P0,获客用)
| ID |
工具 |
引导方向 |
| X-01 |
你唱得准吗:上传一段清唱 + 原曲 → 音准评分、跑调位置、分享图 |
一键"帮我修好" |
| X-02 |
人声分离(每天限次,输出 128kbps) |
付费得到无损和 4 轨 |
| X-03 |
升降调、变速 |
— |
| X-04 |
调性和 BPM 检测 |
— |
4.4 账户与计费(P0)
| ID |
需求 |
| B-01 |
海外:代理商户收款,支持订阅和单首购买;国内:微信支付;早期可用卡密 |
| B-02 |
免费额度:每月 3 首唱歌作品(带水印)+ 工具箱限次 |
| B-03 |
公平使用:Pro 每月 30 首,超出后排队降级为低优先级,不额外扣费 |
4.5 第 3 期:本人声音克隆(仅海外)
- 用户朗读系统随机生成的一段验证文本,确认是本人后才能训练
- 只能用于该用户本人的配音;输出加显式提示和隐式标识
5. 非功能需求
| 类别 |
要求 |
| 性能 |
4 分钟歌曲从提交到出成品 ≤ 3 分钟(含视频) |
| 成本 |
每首歌可变成本 ≤ $0.05 |
| 自动化 |
全程零人工;失败的任务自动重试后退回额度 |
| 隐私 |
免费用户的文件 7 天后删除;付费用户的源文件保留 90 天(保证可以重新导出);原曲分离结果不跨用户复用 |
| 年龄 |
13 岁以上;13~17 岁不开放声音克隆 |
| 合规 |
输出写入隐式标识;分离功能标注个人练习用途 |
6. 数据指标
| 指标 |
目标 |
| 上传 → 成品完成率 |
≥ 90% |
| 免费转付费 |
≥ 2%(止损线) |
| 每个活跃用户每周处理首数 |
≥ 1 |
| 带水印视频的外部回流(通过水印进站的新用户占比) |
≥ 20% |
| 发布安全版人声的使用率(原曲作品中) |
观察指标:比例过低说明操作太麻烦,要优化指引 |
| 音准评分工具 → 注册转化率 |
≥ 10% |
| 付费月留存 |
≥ 80% |
7. 里程碑
| 阶段 |
时间 |
交付 |
| M0 |
第 1~6 周(与 02 并行打基础) |
音频引擎脚本:分离、降噪、参考旋律修音、人声链、混音、母带;20 首测试曲达标 |
| M1 |
第 7~10 周 |
海外上线:唱歌模式、歌词视频、免费工具箱、订阅 |
| M2 |
第 11~18 周(与 01 交替,约 1/3 精力) |
浏览器录音、节奏对齐、音准评分分享图、SEO 页面 |
| M3 |
第 19~24 周 |
说话模式;国内版(资质确认后);本人声音克隆(海外) |
8. 风险与合规
| 风险 |
应对 |
| 修音效果不及人工 |
页面如实说明能力边界;强度可调;持续用测试曲回归 |
| 伴奏版权 |
原曲分离的伴奏只在站内试听,不进入任何导出文件或带水印的视频;发布走"发布安全版人声 + 平台官方音源";不提供伴奏库 |
| 品牌与侵权内容绑定 |
水印只出现在授权伴奏或原创作品上,避免品牌角标出现在侵权视频里 |
| 用户谎报"有权使用" |
勾选存证;收到权利人投诉时下架相关作品并暂停该账号的导出 |
| 国内合规 |
修音、变调可能属于"语音属性编辑"类深度合成服务,需要评估深度合成算法备案;要有主体;上线前确认 |
| 国内收费(iOS 小程序) |
订阅属于虚拟商品,iOS 小程序不能直接用微信支付购买,需要接入微信"小程序虚拟支付"(有平台费)或引导到 App / 网页,以微信当期规则为准 |
| 声音克隆滥用 |
只允许本人克隆,需要验证;国内不上线 |