取代:v1 的 PRD、04 深化分析的方案部分、05/06/07 架构与零人工文档、02/03 开发 spec(v1 已归档到 `_archive_v1/`,不再维护)
一、v1 的缺陷
1.1 总体问题
| # |
缺陷 |
具体表现 |
v2 怎么改 |
| 1 |
利润建立在卖人工时间上 |
02 主攻纪念照要人工挑图和沟通;03 的利润中心是人工精修、Fiverr 和包月服务 |
三个产品都做成自助产品:从下单到交付零人工,人只维护产品和模板 |
| 2 |
偏离原始命题 |
03 的命题是"修音",v1 却把翻唱修音降级、转去做播客后期;01 的"陪伴"变成纯陪练,MVP 还只有文字聊天 |
03 以唱歌修音一键成品为主线,说话类处理作为第二模式;01 做有角色、有记忆、有剧情的陪伴式陪练 |
| 3 |
没有正面回答"为什么不用免费的" |
ChatGPT 免费用户也有语音对话(据第三方报道每天约 15 分钟高级语音)、豆包免费;ChatGPT 也能免费把宠物照改成油画;BandLab 母带免费 |
每个方案都单独写"付费理由",只做免费工具做不到的部分(见第三节) |
| 4 |
单位经济没算透 |
01 按实时语音计费,重度用户会超过 $9.99 的订阅价;02、03 的月毛利没有扣除获客成本和运营时间 |
统一用"单位经济 + 获客成本(CAC)+ 止损线"来评估;01 的剧本和配音每集只生成一次,成本分摊到所有用户 |
| 5 |
获客靠手工 |
小红书日更、Reddit 发帖、Fiverr 攒评价、私信播客主 |
每个产品都有自动化的获客引擎:成品自带水印的传播循环、自动生成短视频切片、程序化生成 SEO 页面、免费小工具引流 |
| 6 |
关键合规路径放在最后 |
"自助页上线前请确认登记/备案"。但国内做自助生成必须有主体并完成登记,这才是真正卡进度的事 |
第 0 周就启动:注册公司、ICP 备案、微信支付商户、生成式 AI 登记;国内产品只接入已备案的模型 API,走较轻的"登记"路径 |
| 7 |
架构对一个人来说太重,且有许可证隐患 |
自己部署 ComfyUI、自己运维 GPU;依赖 InsightFace、CodeFormer、FLUX.1 [dev] 这类非商用模型;靠人脸模型做质检 |
优先调用商用 API,以后再考虑自部署;质检改用视觉大模型打分,并让客户自己挑图;只有音频处理这种没有合适 API 的部分才自己部署 |
| 8 |
三条线各自为战 |
三个产品没有复用。最初总览里提出的"写真的角色一致性 → 陪伴立绘,修音的语音能力 → 陪伴语音"丢掉了 |
一套底座 + 共享模型网关:01 直接复用 02 的图像引擎和 03 的语音引擎 |
| 9 |
产品线和渠道太多 |
03 一个产品就有工具/服务/自动剪辑三条线、两个区域、六个渠道 |
每个产品只保留 1 条主线 + 1 个次要模式,每个区域 1~2 个渠道 |
1.2 分方案的问题
| 方案 |
v1 的主要问题 |
| 01 陪练 |
口语练习的 MVP 却只有文字;定价 $9.99 和实时语音成本冲突;跟 Speak(约 $18/月、年化收入 1 亿美元)、Praktika(约 $8/月)和免费的 ChatGPT 语音正面竞争,没有差异点;获客靠社群发帖 |
| 02 写真 |
主攻品类(纪念照、全家福)恰恰最难自动化;国内实物代发没有接口,只能人工;只靠闲鱼一个渠道;自助平台在国内被合规卡住 |
| 03 修音 |
修音这个核心被砍;主要利润靠人工服务;Fiverr 禁止把客户带到站外,所以攒下的客户不归自己;产品线过多 |
二、v2 的设计原则
- 零人工交付:用户从付款到拿到成品,全程不需要人参与。人工只处理两类事:一是系统判定的异常,目标低于订单的 2%,而且不阻塞其他订单;二是产品本身的迭代
- 卖产品,不卖时间:定价方式是订阅、按次或实物,不按工时
- 赚钱逻辑的四项检查,每个方案都必须全部通过:
- ① 付费理由:免费替代品做不到的东西
- ② 单位经济:可变成本 ≤ 售价的 20%(实物类按贡献毛利算)
- ③ 可规模化获客:获客不靠人工,内容会越积越多
- ④ 复购或留存机制
- 同一产品,两套部署:
global 和 cn 共用代码。国内部署只调用已备案的模型 API,并完成登记;海外部署用效果最好的 API
- 先用 API,后自部署:只有 API 成本明显过高,或者没有可用 API(比如修音、人声分离)时才自己部署
- 按顺序上线,共用底座:02 → 03 → 01,后面的产品复用前面做好的能力
三、三个新方案
3.1 方案 01:剧情式 AI 语言陪练(命题:AI 陪伴 App 出海)
一句话:用户在一部连载故事里当主角,要用目标语言开口说话才能推进剧情;角色记得用户说过的事,剧集之间还会给用户发消息。
| 项 |
内容 |
| 首发 |
海外:面向英语用户的日语(动漫爱好者,对故事付费意愿强);国内:面向中文用户的英语口语 |
| 核心循环 |
看一幕(插画 + 角色配音 + 双语字幕)→ 口语关卡(跟读、选择或自由回答)→ 角色按你的回答作出反应 → 分支选择影响剧情和关系 → 集末复习词汇并给发音评分 |
| 陪伴感 |
记忆系统记住用户透露的信息;剧集之间角色主动发消息;关系只设定为朋友或同事(合规) |
| 内容生产 |
全自动流水线:季设定 → 分集大纲 → 按难度控制词汇的剧本 → 自动质检(词汇难度、安全、前后一致)→ 角色配音 → 角色插画(复用 02 的图像引擎)→ 打包上线 |
| 付费理由 |
ChatGPT 没有故事、插画、配音和进度体系;Speak 和 Praktika 是在上课,而这里是追剧;据社区消息,Duolingo Max 在 2026 年 9 月已从新用户购买页消失(未经官方确认) |
| 定价 |
海外:前 3 集免费;订阅 $9.99/月或 $59.99/年;单季买断 $14.99。国内:¥30/月、¥168/年,单季 ¥39(iOS 小程序需走微信"小程序虚拟支付") |
| 单位经济 |
每集内容成本约 $1 以内,只生成一次,分摊到所有用户;每个用户的可变成本只来自口语关卡,约 $0.01~0.02/集;自由对话采用"语音转文字 → 大模型 → 语音合成"的级联方案,每分钟约 $0.005,并设公平使用上限 |
| 获客引擎 |
每集自动剪出竖屏短视频(画面、配音、字幕都是现成的),通过官方接口发布到 TikTok、YouTube Shorts 和抖音;自动生成场景词汇的 SEO 页面;邀请好友 |
| 留存 |
每集结尾留悬念;角色消息;连续打卡 |
| 止损线 |
公测后第 6 周:次日留存 < 25%,或单集完成率 < 40%,或付费转化 < 1.5% → 更换题材或语言 |
3.2 方案 02:AI 照片礼物定制(命题:AI 写真 / 图像定制)
一句话:上传宠物或家人的照片,1 分钟看到 4 张风格预览,自己挑一张,买高清电子版,或者直接印成挂画、杯子寄到家。
| 项 |
内容 |
| 品类 |
宠物肖像(主力,约 20 种风格);老照片修复上色(兼顾引流,适合做成"送父母"的礼物);情侣/双人纪念照(第 2 期)。不做:多人全家福合成、已故亲人的"复活"类生成(难以全自动做好,情感风险高)、低价头像 |
| 全自动的关键 |
① 用编辑类模型,1~3 张照片就能保持宠物或人物的样子,不用训练 LoRA;② 客户自己挑图:预览实时生成,不满意可以免费重新生成 2 次,取代了人工挑图;③ 视觉大模型自动质检,发现畸形、违规或"不像"就自动重新生成;④ 按商品规格自动出印刷文件;⑤ 通过代发平台的接口自动下单和回传物流 |
| 付费理由 |
免费的 ChatGPT 或豆包也能改图,但做不到印刷级文件、实物寄送和送礼流程(寄给收件人、附礼物卡片、赶节日时限)。钱主要从实物赚 |
| 定价 |
海外:电子版 $12.99;帆布画 $59~129;杯子、毯子、挂饰 $24~79。国内:电子版 ¥19.9;实物 ¥69~299 |
| 单位经济(估算,需实测) |
12×16 英寸帆布画售价 $69,代发成本含运费按 $25~40 估算(以 Printify 后台报价为准),支付/平台费约 5%,AI 成本不到 $0.5 → 实物订单贡献毛利约 $25~40;电子版($12.99)贡献毛利约 $11,毛利率 > 90%。按实物占 40% 估算,全部订单平均贡献毛利约 $15~20,CAC 必须以这个平均值为上限 |
| 获客引擎 |
Pinterest 和 TikTok 的"前后对比"内容(由系统用获授权的订单自动生成);程序化 SEO 页面(每种风格、每个犬种都有落地页);抓住节日节点;第 2 期上 Etsy |
| 复购 |
多只宠物、节日、给亲友送礼;邮件列表 |
| 国内 |
微信小程序 + 微信支付(电子版属于虚拟商品,iOS 端需走微信"小程序虚拟支付",实物不受限);模型只用已备案的(如火山方舟 Seedream,约 ¥0.2~0.25/张);闲鱼卡密渠道只卖电子版。实物要接入有接口的柔性定制平台,没有接口之前只卖电子版(不做人工代发) |
| 止损线 |
累计 1,000 次预览后,预览到付款的转化率 < 2%,或者 CAC 高于全部订单的平均贡献毛利 → 调整品类或风格 |
3.3 方案 03:AI 修音一键成品(命题:AI 修音全功能)
一句话:唱完就能发。上传清唱录音,自动修音、混音、母带,同时生成带歌词字幕的竖屏视频。
| 项 |
内容 |
| 唱歌模式(主线) |
输入人声和伴奏(伴奏可以自己上传;也可以上传原曲,系统分离出伴奏和原唱旋律,仅限个人练习)→ 降噪 → 参考旋律修音(以原唱旋律为目标,保留颤音)→ 节奏对齐(第 2 期)→ 按曲风套用人声处理链 → 自动调整人声和伴奏的音量比例 → 母带 → 授权伴奏或原创:输出 wav/mp3 + 带歌词字幕的竖屏视频;原曲伴奏:输出发布安全版人声(见下方"伴奏版权") |
| 说话模式(次线,对应原始命题 ②) |
播客、网课、配音:降噪、多人电平平衡、响度、全自动剪辑(三档力度)、字幕、视频 |
| 工具箱(免费引流) |
人声分离、升降调和变速、调性和 BPM 检测、"你唱得准吗"音准评分 |
| 第 3 期 |
克隆用户本人的声音(海外,必须经过本人验证和同意) |
| 不做 |
用他人的声音翻唱或变声;AI 作曲;任何人工服务 |
| 付费理由 |
K 歌 App 的成品只能留在它自己的 App 里,BandLab 需要自己动手处理,Voloco 是实时效果;这里知道原唱旋律,直接给出能发布的成品视频 |
| 定价 |
海外:免费档每月 3 首,带水印,720p;Pro $9.99/月(参考 Voloco 的 $9.99~11.99);单首 $2.99;说话模式 Creator $14.99/月。国内:会员 ¥25/月,单首 ¥6.9,说话模式 ¥39/月(iOS 小程序需走微信"小程序虚拟支付",平台费计入成本) |
| 单位经济 |
每首歌:人声分离 GPU 几十秒 + CPU 修音和视频渲染,成本 < $0.03;说话模式 60 分钟节目约 ¥3 |
| 获客引擎 |
水印传播循环:用授权伴奏、清唱或原创的免费作品,导出的视频自带"Made with ..."角标;音准评分做成免费工具和分享图;工具箱的程序化 SEO 页面 |
| 伴奏版权 |
多数翻唱用户只有原曲。原曲分离的伴奏只在站内试听,不进入任何导出文件或带水印的视频;这类作品导出"发布安全版人声",用户在抖音 / TikTok 里搭配平台曲库的官方音源发布(平台负责音乐授权)。这样品牌水印不会和侵权内容绑定 |
| 留存 |
唱歌用户每周都会发作品,订阅制 |
| 止损线 |
上线后第 6 周(第 16 周):免费转付费 < 2%,或每个活跃用户每周处理的歌曲 < 1 首 |
四、共享底座与复用
┌────────────── 共享底座(一个仓库,两套部署:global / cn)──────────────┐
│ 账号 · 支付(海外代理商户 / 微信支付 / 卡密)· 存储 · 队列 · 通知 · AI 标识 │
│ 合规组件(年龄确认、内容安全、授权存证、数据删除)· 数据分析 │
│ ★ 模型网关:大模型 / 生图改图 / 语音合成 / 语音识别 / 视觉打分,按区域路由、计费、容灾 │
│ ★ 增长组件:邀请、水印分享、短视频自动发布、SEO 页面生成、邮件 │
└───────────────┬───────────────────────┬─────────────────────┬─────────┘
│ │ │
02 照片礼物(图像引擎) 03 修音(音频引擎 + 视频渲染) 01 剧情陪练
│ │ ▲ ▲
└──── 角色插画 ──────────┼─────────────────┘ │
└──── 配音、识别、发音评分 ──┘
模型按区域路由:
| 能力 |
global(示例) |
cn(只用已备案的) |
| 大模型 |
Gemini / OpenAI / Claude 等,可随时切换 |
豆包、通义千问等 |
| 生图和改图 |
Gemini 图像、Seedream(海外版)、fal 上的 FLUX 等 |
火山方舟 Seedream、通义万相等 |
| 语音合成 |
ElevenLabs、OpenAI 等 |
火山引擎、阿里云等 |
| 语音识别 |
Whisper 系列(自部署或 API) |
FunASR(自部署)/ 国内云 API |
| 视觉打分 |
视觉大模型 |
国内已备案的视觉大模型 |
具体模型版本写在配置里,不写死在代码中。例如 Gemini 2.5 Flash Image 已宣布在 2026-10-02 停用,这类变更只需要改配置。
五、路线图(全职一人,24 周)
| 周 |
海外 |
国内 |
底座 |
| 第 0 周 |
申请代理商户收款(Creem / Paddle / Lemon Squeezy,确认中国居民能否入驻);注册域名 |
注册公司;启动 ICP 备案;申请微信支付商户;准备生成式 AI 登记材料 |
仓库、CI、部署 |
| 1~2 |
|
资质办理跟进(不上线) |
账号、支付、存储、队列、模型网关、AI 标识 |
| 3~6 |
02 上线(官网 + Printify + 代理商户收款) |
同上 |
增长组件 v1(SEO 页面、水印分享) |
| 7~10 |
03 上线(唱歌模式 + 免费工具箱);02 迭代 |
同上;提交生成式 AI 登记 |
视频渲染、短视频自动发布 |
| 11~14 |
01 内容流水线 + 第一季前 3 集内测;03 第 2 期(约 1/3 精力) |
登记通过后开始 02 小程序开发 |
内容生产流水线 |
| 15~18 |
01 公测(网页版,日语第一季);03 第 2 期收尾 |
02 小程序上线(先卖电子版,前提:登记已完成) |
|
| 19~24 |
02 上 Etsy(可行性确认后);03 说话模式;01 第二季、上架应用商店 |
03 国内版(前提:深度合成备案评估完成);01 国内版视进度推到第 25 周以后 |
按数据扩容 |
资源约束:一个人同一时间只新建一个产品,已上线的产品只做小迭代。国内版的时间取决于资质办理进度(公司、ICP、登记),表中的周数是最早可能时间;资质没办下来就顺延,不影响海外节奏。
为什么按 02 → 03 → 01 的顺序:02 离收入最近,而且实物毛利能覆盖投放;03 复用 02 的队列和视频能力,自己再补上音频引擎;01 需要图像、语音、内容流水线三样都齐了才好做,放在最后。
六、第 24 周的检查目标(用来判断是否继续,不是收入承诺)
| 产品 |
目标 |
| 02 |
每月 ≥ 300 单,CAC ≤ 全部订单平均贡献毛利的 60% |
| 03 |
付费订阅 ≥ 400,免费转付费 ≥ 2% |
| 01 |
公测 6 周后:付费订阅 ≥ 150,次日留存 ≥ 30% |
达不到的产品按各自的止损线处理,资源集中到表现最好的那个。
七、文档对照
| 文档 |
v2 状态 |
| 00~03 原始调研 |
不变(原始命题与市场资料) |
| PRD_01 / 02 / 03 |
按 v2 重写 |
| 04 三方向深化分析 |
保留市场数据;方案部分标注为 v1 并指向本文 |
| 05 代码架构 v2 |
三个产品统一的架构总览(取代原来的 05、06) |
| 07 零人工 |
按 v2 重写:每个产品的自动化闭环与例外处理 |
| 开发 spec |
00_共享底座_开发spec/、01_陪练_开发spec/、02_写真_开发spec/、03_音频_开发spec/,全部按 v2 重写 |
八、修订记录
| 日期 |
修订 |
| 2026-09-27 |
v2.1 评审修复:① 03 原曲伴奏只导出"发布安全版人声",水印只用于授权伴奏或原创作品;② 国内 iOS 小程序的虚拟商品走微信"小程序虚拟支付"(新增资质 Q10);③ 路线图重排:一人同时只新建一个产品,国内版以资质进度为准,01 公测推到第 15~18 周;④ 03 付费用户源文件保留 90 天;⑤ 02 印刷文件保留到签收后 45 天;⑥ 02 贡献毛利拆成实物 / 平均两个口径;⑦ 低可信来源改为"据报道";⑧ 发音评分供应商确认 + 备选算法;⑨ 03 年龄门槛改为 13 岁;⑩ 录音格式、测试曲数量、阶段对齐、危机检测覆盖母语 |