Dev Spec v2 · ← 返回文档首页

01 范围与里程碑

1. 范围

编号 能力 期次
F1 唱歌模式:人声 + 伴奏(上传伴奏,或上传原曲自动分离)→ 降噪 → 参考旋律修音 → 人声链 → 自动混音 → 母带 P1
F2 歌词识别与对齐;竖屏歌词视频(免费档带水印,仅限授权伴奏或原创作品) P1
F2b 发布安全版人声导出(原曲伴奏的作品)+ 平台内搭配官方音源的指引 P1
F3 免费工具箱:音准评分、人声分离(限次)、升降调和变速、调性和 BPM 检测 P1
F4 订阅与单首购买;免费额度 P1
F5 浏览器录音(对着伴奏录,自动延迟补偿) P2
F6 节奏对齐 P2
F7 音准评分分享图、SEO 页面、邀请 P2
F8 说话模式:降噪、电平、响度、全自动剪辑、字幕、视频播客 P3
F9 国内版(小程序 / H5) P3(资质确认后)
F10 本人声音克隆(仅海外) P3

不做:他人声音翻唱或变声;AI 作曲;伴奏库;任何人工服务。

2. 期次

期次 时间 结束时必须做到
P0 第 1~6 周(与 02 并行,每周约 1/3 精力) 音频引擎命令行版本:20 首测试曲通过 07 文档的全部验收
P1 第 7~10 周 海外上线 F1~F4
P2 第 11~18 周(与 01 交替,约 1/3 精力) F5~F7
P3 第 19~24 周 F8、F10;F9 视国内资质进度

3. 用户故事与验收

P1

ID 用户故事 验收标准
US-01 我上传清唱和伴奏,3 分钟内拿到修好、混好的成品 4 分钟歌曲 P95 ≤ 3 分钟(含视频)
US-02 我只有原曲,没有伴奏 上传原曲 → 自动分离;站内可以试听完整混音;导出的是发布安全版人声(不含任何伴奏成分)和"在抖音 / TikTok 里选官方音源后叠加人声"的指引
US-03 修音后还是像我自己,不像机器 颤音保留;强度可调(默认 70%);盲听"听得出处理痕迹"≤ 30%
US-04 我能切换前后对比 同一位置无缝切换
US-05 我能选曲风 流行、抒情、说唱、摇滚、国风,每种都有独立的人声链和混音比例
US-06 我能拿到带歌词的竖屏视频 仅限用户自己的伴奏(勾选有权使用)或原创;1080×1920;歌词对齐误差 ≤ 150ms;可以粘贴正确歌词后自动重新对齐
US-07 免费试用 每月 3 首,720p,带水印角标
US-08 付费后无水印、高清、wav、分轨 订阅立即生效;源文件仍在保留期内的作品可以重新导出(免费期上传的作品在付费时自动延长到 90 天)
US-09 我想知道自己唱得准不准 音准评分:总分 + 跑调位置 + 一键"帮我修好"

P2~P3

ID 用户故事 验收标准
US-10 我在浏览器里对着伴奏直接录 自动测量并补偿录音延迟;对齐误差 ≤ 20ms
US-11 抢拍、拖拍的字被自动对齐 只调整偏差 > 80ms 的音符;不影响其他部分
US-12 我能把音准评分分享出去 分享图含回流链接
US-13 说话模式:上传一集播客,自动剪好并出字幕 见 05 文档

4. 非功能

类别 要求
性能 4 分钟歌曲 P95 ≤ 3 分钟;音准评分 ≤ 60 秒
成本 每首可变成本 ≤ $0.05
自动化 零人工;失败自动退回额度
隐私 免费用户的文件 7 天后删除;付费用户的源文件保留 90 天,中间文件 7 天;作品参数保留,删除账号时一并删除
年龄 13 岁以上;13~17 岁不开放声音克隆