Strategy v2 · ← 返回文档首页

方案重构 v2:缺陷复盘与三个新方案

编写日期2026-09-27

取代:v1 的 PRD、04 深化分析的方案部分、05/06/07 架构与零人工文档、02/03 开发 spec(v1 已归档到 `_archive_v1/`,不再维护)

约束(已与你确认):**全自动(零人工交付)**、**国内和海外都做**、**全职投入**、**回到最初三个命题**

原始命题:① AI 陪伴 App 出海 ② AI 写真 / 图像定制 ③ AI 修音(全功能)

一、v1 的缺陷

1.1 总体问题

# 缺陷 具体表现 v2 怎么改
1 利润建立在卖人工时间上 02 主攻纪念照要人工挑图和沟通;03 的利润中心是人工精修、Fiverr 和包月服务 三个产品都做成自助产品:从下单到交付零人工,人只维护产品和模板
2 偏离原始命题 03 的命题是"修音",v1 却把翻唱修音降级、转去做播客后期;01 的"陪伴"变成纯陪练,MVP 还只有文字聊天 03 以唱歌修音一键成品为主线,说话类处理作为第二模式;01 做有角色、有记忆、有剧情的陪伴式陪练
3 没有正面回答"为什么不用免费的" ChatGPT 免费用户也有语音对话(据第三方报道每天约 15 分钟高级语音)、豆包免费;ChatGPT 也能免费把宠物照改成油画;BandLab 母带免费 每个方案都单独写"付费理由",只做免费工具做不到的部分(见第三节)
4 单位经济没算透 01 按实时语音计费,重度用户会超过 $9.99 的订阅价;02、03 的月毛利没有扣除获客成本和运营时间 统一用"单位经济 + 获客成本(CAC)+ 止损线"来评估;01 的剧本和配音每集只生成一次,成本分摊到所有用户
5 获客靠手工 小红书日更、Reddit 发帖、Fiverr 攒评价、私信播客主 每个产品都有自动化的获客引擎:成品自带水印的传播循环、自动生成短视频切片、程序化生成 SEO 页面、免费小工具引流
6 关键合规路径放在最后 "自助页上线前请确认登记/备案"。但国内做自助生成必须有主体并完成登记,这才是真正卡进度的事 第 0 周就启动:注册公司、ICP 备案、微信支付商户、生成式 AI 登记;国内产品只接入已备案的模型 API,走较轻的"登记"路径
7 架构对一个人来说太重,且有许可证隐患 自己部署 ComfyUI、自己运维 GPU;依赖 InsightFace、CodeFormer、FLUX.1 [dev] 这类非商用模型;靠人脸模型做质检 优先调用商用 API,以后再考虑自部署;质检改用视觉大模型打分,并让客户自己挑图;只有音频处理这种没有合适 API 的部分才自己部署
8 三条线各自为战 三个产品没有复用。最初总览里提出的"写真的角色一致性 → 陪伴立绘,修音的语音能力 → 陪伴语音"丢掉了 一套底座 + 共享模型网关:01 直接复用 02 的图像引擎和 03 的语音引擎
9 产品线和渠道太多 03 一个产品就有工具/服务/自动剪辑三条线、两个区域、六个渠道 每个产品只保留 1 条主线 + 1 个次要模式,每个区域 1~2 个渠道

1.2 分方案的问题

方案 v1 的主要问题
01 陪练 口语练习的 MVP 却只有文字;定价 $9.99 和实时语音成本冲突;跟 Speak(约 $18/月、年化收入 1 亿美元)、Praktika(约 $8/月)和免费的 ChatGPT 语音正面竞争,没有差异点;获客靠社群发帖
02 写真 主攻品类(纪念照、全家福)恰恰最难自动化;国内实物代发没有接口,只能人工;只靠闲鱼一个渠道;自助平台在国内被合规卡住
03 修音 修音这个核心被砍;主要利润靠人工服务;Fiverr 禁止把客户带到站外,所以攒下的客户不归自己;产品线过多

二、v2 的设计原则

  1. 零人工交付:用户从付款到拿到成品,全程不需要人参与。人工只处理两类事:一是系统判定的异常,目标低于订单的 2%,而且不阻塞其他订单;二是产品本身的迭代
  2. 卖产品,不卖时间:定价方式是订阅、按次或实物,不按工时
  3. 赚钱逻辑的四项检查,每个方案都必须全部通过:
  4. ① 付费理由:免费替代品做不到的东西
  5. ② 单位经济:可变成本 ≤ 售价的 20%(实物类按贡献毛利算)
  6. ③ 可规模化获客:获客不靠人工,内容会越积越多
  7. ④ 复购或留存机制
  8. 同一产品,两套部署:global 和 cn 共用代码。国内部署只调用已备案的模型 API,并完成登记;海外部署用效果最好的 API
  9. 先用 API,后自部署:只有 API 成本明显过高,或者没有可用 API(比如修音、人声分离)时才自己部署
  10. 按顺序上线,共用底座:02 → 03 → 01,后面的产品复用前面做好的能力

三、三个新方案

3.1 方案 01:剧情式 AI 语言陪练(命题:AI 陪伴 App 出海)

一句话:用户在一部连载故事里当主角,要用目标语言开口说话才能推进剧情;角色记得用户说过的事,剧集之间还会给用户发消息。

项 内容
首发 海外:面向英语用户的日语(动漫爱好者,对故事付费意愿强);国内:面向中文用户的英语口语
核心循环 看一幕(插画 + 角色配音 + 双语字幕)→ 口语关卡(跟读、选择或自由回答)→ 角色按你的回答作出反应 → 分支选择影响剧情和关系 → 集末复习词汇并给发音评分
陪伴感 记忆系统记住用户透露的信息;剧集之间角色主动发消息;关系只设定为朋友或同事(合规)
内容生产 全自动流水线:季设定 → 分集大纲 → 按难度控制词汇的剧本 → 自动质检(词汇难度、安全、前后一致)→ 角色配音 → 角色插画(复用 02 的图像引擎)→ 打包上线
付费理由 ChatGPT 没有故事、插画、配音和进度体系;Speak 和 Praktika 是在上课,而这里是追剧;据社区消息,Duolingo Max 在 2026 年 9 月已从新用户购买页消失(未经官方确认)
定价 海外:前 3 集免费;订阅 $9.99/月或 $59.99/年;单季买断 $14.99。国内:¥30/月、¥168/年,单季 ¥39(iOS 小程序需走微信"小程序虚拟支付")
单位经济 每集内容成本约 $1 以内,只生成一次,分摊到所有用户;每个用户的可变成本只来自口语关卡,约 $0.01~0.02/集;自由对话采用"语音转文字 → 大模型 → 语音合成"的级联方案,每分钟约 $0.005,并设公平使用上限
获客引擎 每集自动剪出竖屏短视频(画面、配音、字幕都是现成的),通过官方接口发布到 TikTok、YouTube Shorts 和抖音;自动生成场景词汇的 SEO 页面;邀请好友
留存 每集结尾留悬念;角色消息;连续打卡
止损线 公测后第 6 周:次日留存 < 25%,或单集完成率 < 40%,或付费转化 < 1.5% → 更换题材或语言

3.2 方案 02:AI 照片礼物定制(命题:AI 写真 / 图像定制)

一句话:上传宠物或家人的照片,1 分钟看到 4 张风格预览,自己挑一张,买高清电子版,或者直接印成挂画、杯子寄到家。

项 内容
品类 宠物肖像(主力,约 20 种风格);老照片修复上色(兼顾引流,适合做成"送父母"的礼物);情侣/双人纪念照(第 2 期)。不做:多人全家福合成、已故亲人的"复活"类生成(难以全自动做好,情感风险高)、低价头像
全自动的关键 ① 用编辑类模型,1~3 张照片就能保持宠物或人物的样子,不用训练 LoRA;② 客户自己挑图:预览实时生成,不满意可以免费重新生成 2 次,取代了人工挑图;③ 视觉大模型自动质检,发现畸形、违规或"不像"就自动重新生成;④ 按商品规格自动出印刷文件;⑤ 通过代发平台的接口自动下单和回传物流
付费理由 免费的 ChatGPT 或豆包也能改图,但做不到印刷级文件、实物寄送和送礼流程(寄给收件人、附礼物卡片、赶节日时限)。钱主要从实物赚
定价 海外:电子版 $12.99;帆布画 $59~129;杯子、毯子、挂饰 $24~79。国内:电子版 ¥19.9;实物 ¥69~299
单位经济(估算,需实测) 12×16 英寸帆布画售价 $69,代发成本含运费按 $25~40 估算(以 Printify 后台报价为准),支付/平台费约 5%,AI 成本不到 $0.5 → 实物订单贡献毛利约 $25~40;电子版($12.99)贡献毛利约 $11,毛利率 > 90%。按实物占 40% 估算,全部订单平均贡献毛利约 $15~20,CAC 必须以这个平均值为上限
获客引擎 Pinterest 和 TikTok 的"前后对比"内容(由系统用获授权的订单自动生成);程序化 SEO 页面(每种风格、每个犬种都有落地页);抓住节日节点;第 2 期上 Etsy
复购 多只宠物、节日、给亲友送礼;邮件列表
国内 微信小程序 + 微信支付(电子版属于虚拟商品,iOS 端需走微信"小程序虚拟支付",实物不受限);模型只用已备案的(如火山方舟 Seedream,约 ¥0.2~0.25/张);闲鱼卡密渠道只卖电子版。实物要接入有接口的柔性定制平台,没有接口之前只卖电子版(不做人工代发)
止损线 累计 1,000 次预览后,预览到付款的转化率 < 2%,或者 CAC 高于全部订单的平均贡献毛利 → 调整品类或风格

3.3 方案 03:AI 修音一键成品(命题:AI 修音全功能)

一句话:唱完就能发。上传清唱录音,自动修音、混音、母带,同时生成带歌词字幕的竖屏视频。

项 内容
唱歌模式(主线) 输入人声和伴奏(伴奏可以自己上传;也可以上传原曲,系统分离出伴奏和原唱旋律,仅限个人练习)→ 降噪 → 参考旋律修音(以原唱旋律为目标,保留颤音)→ 节奏对齐(第 2 期)→ 按曲风套用人声处理链 → 自动调整人声和伴奏的音量比例 → 母带 → 授权伴奏或原创:输出 wav/mp3 + 带歌词字幕的竖屏视频;原曲伴奏:输出发布安全版人声(见下方"伴奏版权")
说话模式(次线,对应原始命题 ②) 播客、网课、配音:降噪、多人电平平衡、响度、全自动剪辑(三档力度)、字幕、视频
工具箱(免费引流) 人声分离、升降调和变速、调性和 BPM 检测、"你唱得准吗"音准评分
第 3 期 克隆用户本人的声音(海外,必须经过本人验证和同意)
不做 用他人的声音翻唱或变声;AI 作曲;任何人工服务
付费理由 K 歌 App 的成品只能留在它自己的 App 里,BandLab 需要自己动手处理,Voloco 是实时效果;这里知道原唱旋律,直接给出能发布的成品视频
定价 海外:免费档每月 3 首,带水印,720p;Pro $9.99/月(参考 Voloco 的 $9.99~11.99);单首 $2.99;说话模式 Creator $14.99/月。国内:会员 ¥25/月,单首 ¥6.9,说话模式 ¥39/月(iOS 小程序需走微信"小程序虚拟支付",平台费计入成本)
单位经济 每首歌:人声分离 GPU 几十秒 + CPU 修音和视频渲染,成本 < $0.03;说话模式 60 分钟节目约 ¥3
获客引擎 水印传播循环:用授权伴奏、清唱或原创的免费作品,导出的视频自带"Made with ..."角标;音准评分做成免费工具和分享图;工具箱的程序化 SEO 页面
伴奏版权 多数翻唱用户只有原曲。原曲分离的伴奏只在站内试听,不进入任何导出文件或带水印的视频;这类作品导出"发布安全版人声",用户在抖音 / TikTok 里搭配平台曲库的官方音源发布(平台负责音乐授权)。这样品牌水印不会和侵权内容绑定
留存 唱歌用户每周都会发作品,订阅制
止损线 上线后第 6 周(第 16 周):免费转付费 < 2%,或每个活跃用户每周处理的歌曲 < 1 首

四、共享底座与复用

                 ┌────────────── 共享底座(一个仓库,两套部署:global / cn)──────────────┐
                 │ 账号 · 支付(海外代理商户 / 微信支付 / 卡密)· 存储 · 队列 · 通知 · AI 标识   │
                 │ 合规组件(年龄确认、内容安全、授权存证、数据删除)· 数据分析                  │
                 │ ★ 模型网关:大模型 / 生图改图 / 语音合成 / 语音识别 / 视觉打分,按区域路由、计费、容灾 │
                 │ ★ 增长组件:邀请、水印分享、短视频自动发布、SEO 页面生成、邮件               │
                 └───────────────┬───────────────────────┬─────────────────────┬─────────┘
                                 │                       │                     │
                    02 照片礼物(图像引擎)   03 修音(音频引擎 + 视频渲染)   01 剧情陪练
                                 │                       │                 ▲       ▲
                                 └──── 角色插画 ──────────┼─────────────────┘       │
                                                         └──── 配音、识别、发音评分 ──┘

模型按区域路由:

能力 global(示例) cn(只用已备案的)
大模型 Gemini / OpenAI / Claude 等,可随时切换 豆包、通义千问等
生图和改图 Gemini 图像、Seedream(海外版)、fal 上的 FLUX 等 火山方舟 Seedream、通义万相等
语音合成 ElevenLabs、OpenAI 等 火山引擎、阿里云等
语音识别 Whisper 系列(自部署或 API) FunASR(自部署)/ 国内云 API
视觉打分 视觉大模型 国内已备案的视觉大模型

具体模型版本写在配置里,不写死在代码中。例如 Gemini 2.5 Flash Image 已宣布在 2026-10-02 停用,这类变更只需要改配置。


五、路线图(全职一人,24 周)

周 海外 国内 底座
第 0 周 申请代理商户收款(Creem / Paddle / Lemon Squeezy,确认中国居民能否入驻);注册域名 注册公司;启动 ICP 备案;申请微信支付商户;准备生成式 AI 登记材料 仓库、CI、部署
1~2 资质办理跟进(不上线) 账号、支付、存储、队列、模型网关、AI 标识
3~6 02 上线(官网 + Printify + 代理商户收款) 同上 增长组件 v1(SEO 页面、水印分享)
7~10 03 上线(唱歌模式 + 免费工具箱);02 迭代 同上;提交生成式 AI 登记 视频渲染、短视频自动发布
11~14 01 内容流水线 + 第一季前 3 集内测;03 第 2 期(约 1/3 精力) 登记通过后开始 02 小程序开发 内容生产流水线
15~18 01 公测(网页版,日语第一季);03 第 2 期收尾 02 小程序上线(先卖电子版,前提:登记已完成)
19~24 02 上 Etsy(可行性确认后);03 说话模式;01 第二季、上架应用商店 03 国内版(前提:深度合成备案评估完成);01 国内版视进度推到第 25 周以后 按数据扩容

资源约束:一个人同一时间只新建一个产品,已上线的产品只做小迭代。国内版的时间取决于资质办理进度(公司、ICP、登记),表中的周数是最早可能时间;资质没办下来就顺延,不影响海外节奏。

为什么按 02 → 03 → 01 的顺序:02 离收入最近,而且实物毛利能覆盖投放;03 复用 02 的队列和视频能力,自己再补上音频引擎;01 需要图像、语音、内容流水线三样都齐了才好做,放在最后。

六、第 24 周的检查目标(用来判断是否继续,不是收入承诺)

产品 目标
02 每月 ≥ 300 单,CAC ≤ 全部订单平均贡献毛利的 60%
03 付费订阅 ≥ 400,免费转付费 ≥ 2%
01 公测 6 周后:付费订阅 ≥ 150,次日留存 ≥ 30%

达不到的产品按各自的止损线处理,资源集中到表现最好的那个。


七、文档对照

文档 v2 状态
00~03 原始调研 不变(原始命题与市场资料)
PRD_01 / 02 / 03 按 v2 重写
04 三方向深化分析 保留市场数据;方案部分标注为 v1 并指向本文
05 代码架构 v2 三个产品统一的架构总览(取代原来的 05、06)
07 零人工 按 v2 重写:每个产品的自动化闭环与例外处理
开发 spec 00_共享底座_开发spec/、01_陪练_开发spec/、02_写真_开发spec/、03_音频_开发spec/,全部按 v2 重写

八、修订记录

日期 修订
2026-09-27 v2.1 评审修复:① 03 原曲伴奏只导出"发布安全版人声",水印只用于授权伴奏或原创作品;② 国内 iOS 小程序的虚拟商品走微信"小程序虚拟支付"(新增资质 Q10);③ 路线图重排:一人同时只新建一个产品,国内版以资质进度为准,01 公测推到第 15~18 周;④ 03 付费用户源文件保留 90 天;⑤ 02 印刷文件保留到签收后 45 天;⑥ 02 贡献毛利拆成实物 / 平均两个口径;⑦ 低可信来源改为"据报道";⑧ 发音评分供应商确认 + 备选算法;⑨ 03 年龄门槛改为 13 岁;⑩ 录音格式、测试曲数量、阶段对齐、危机检测覆盖母语