1. 产品概述
1.1 一句话定位
在一部连载故事里当主角,用目标语言开口推进剧情;角色记得你。
1.2 为什么这样做
| 事实 |
推论 |
| ChatGPT 免费用户也能语音对话(据第三方报道,高级语音每天约 15 分钟);豆包免费 |
"和 AI 聊天练口语"本身不值得付费,必须提供免费助手没有的东西 |
| Speak 约 $18/月、年化收入约 1 亿美元;Praktika 约 $8/月;据社区消息,Duolingo Max 在 2026 年 9 月已从新用户购买页消失(未经官方确认) |
愿意为 AI 口语练习付费的人很多,但"上课型"产品已经很拥挤 |
| 实时语音接口每分钟约 $0.02~0.11;一个重度用户每月语音 600 分钟 |
按实时语音做 $9.99 的订阅会亏本 |
| ReelShort 2025 年消费额约 12 亿美元;连载内容按集付费已被验证 |
剧情 + 追更可以带来留存和付费 |
| 原始命题是"AI 陪伴 App 出海",首推的垂直方向是语言陪练 |
保留"陪伴":角色有性格、有记忆,会主动联系用户 |
结论:做"能开口参与的连载剧"。剧本、配音、插画每集只生成一次,所有用户共享;每个用户的可变成本只来自口语关卡。
1.3 业务目标
| 阶段 |
目标 |
| 第 14 周 |
内测:第一季前 3 集 |
| 第 18 周 |
海外公测:日语第一季 12 集 |
| 第 24 周(公测 6 周后) |
次日留存 ≥ 30%;单集完成率 ≥ 60%;付费转化 ≥ 2%;付费订阅 ≥ 150 |
1.4 非目标
- ❌ 恋人、伴侣、亲属关系设定;任何成人内容
- ❌ 用户自建角色、用户生成内容(审核成本高)
- ❌ 实时视频通话
- ❌ 自由情感倾诉类功能(自伤干预责任重)
- ❌ 人工编剧、人工审稿(内容全部由流水线生成并自动质检)
2. 目标用户
| 画像 |
描述 |
付费理由 |
| P1 动漫爱好者学日语(海外主力) |
18~30 岁,Duolingo 用过但觉得无聊,想听懂动漫 |
追剧 + 能开口,比上课有趣 |
| P2 成人英语口语(国内) |
22~35 岁,职场或出国需求,不敢开口 |
在剧情里低压力地开口 |
3. 核心体验
3.1 一集的结构(8~12 分钟)
开场(上集回顾 + 角色对你打招呼,提到你上次说过的事)
→ 场景 1:插画 + 角色配音 + 双语字幕(可以只显示目标语言)
→ 口语关卡 A:跟读一句(发音评分)
→ 场景 2
→ 口语关卡 B:从 3 个选项里选一个说出来(选择影响剧情分支)
→ 场景 3
→ 口语关卡 C:自由回答角色的问题(大模型理解并由角色回应)
→ 结尾:悬念 + 本集词汇卡 + 发音得分 + 连续打卡
→ 剧集之间:角色发来 1~2 条消息(例如"明天店里有新品,你想吃吗?"),可以用语音回复
3.2 口语关卡
| 类型 |
做法 |
成本 |
| 跟读 |
语音识别 + 发音评分(音素级) |
极低 |
| 选择说出 |
识别用户说的是哪个选项(容错:大意对了就算) |
极低 |
| 自由回答 |
语音识别 → 大模型判断是否合理、是否用了本集目标句型 → 角色用预设语气回应(短回复现合成配音) |
约 $0.005/次 |
| 求助 |
说不出来时可以点"提示":显示关键词 → 再点显示整句 |
无 |
3.3 陪伴与记忆
- 从自由回答中抽取用户信息(名字、爱好、目标),下一集的开场和角色消息里会用到
- 关系只到"朋友 / 同事";角色会提醒用户休息,从不诱导用户延长使用
- 界面始终标注"AI 角色"
3.4 自由对话(Pro 功能)
- 在剧情之外,和角色进行自由语音对话
- 采用"语音识别 → 大模型 → 语音合成"的级联方式,不使用实时语音接口
- 公平使用:每天 30 分钟
4. 功能需求
4.1 学习端(P0)
| ID |
需求 |
验收标准 |
| L-01 |
剧集播放器:插画、配音、字幕切换(目标语言 / 双语 / 无) |
移动端流畅;预加载下一场景 |
| L-02 |
口语关卡:跟读、选择、自由回答、提示 |
从说完到出结果 ≤ 2.5 秒(P95) |
| L-03 |
发音评分:整句分 + 标出问题音 |
与人工评分的相关系数 ≥ 0.6(测试集) |
| L-04 |
分支与状态:选择会写入剧情变量,影响后续台词 |
每集至少 1 处分支 |
| L-05 |
记忆:抽取用户事实,下一集开场引用 |
引用正确率 ≥ 95%(自动评测) |
| L-06 |
词汇本、连续打卡、每周报告 |
— |
| L-07 |
角色消息:每集之间 1~2 条,定时推送(网页推送 / 邮件) |
可在设置中关闭 |
| L-08 |
难度设置:初级 / 中级(控制词汇和语速) |
— |
4.2 内容生产流水线(P0,全自动)
| ID |
步骤 |
自动质检 |
| P-01 |
季设定:世界观、角色卡(性格、口头禅、声线、立绘描述)、12 集故事线 |
与禁用题材清单比对 |
| P-02 |
分集大纲:每集的学习目标(3~5 个句型、10~15 个词) |
句型覆盖该难度的大纲 |
| P-03 |
剧本:场景、台词、分支、关卡、提示 |
词汇难度检查:超纲词占比 ≤ 5%;前后一致性检查(角色设定、剧情变量) |
| P-04 |
配音:每个角色固定一个声音,按台词合成 |
自动回听:识别出的文字与剧本一致 |
| P-05 |
插画:角色一致的场景插画(复用 02 的图像引擎) |
视觉大模型检查角色是否一致、有无违规 |
| P-06 |
打包与上线;自动生成 3 条竖屏宣传短视频 |
用户评分 < 3.5 的集自动重新生成 |
4.3 付费与账户(P0)
| ID |
需求 |
| B-01 |
免费:每季前 3 集 + 每天 1 集免费额度(限第一季) |
| B-02 |
订阅 $9.99/月、$59.99/年;单季买断 $14.99。国内:¥30/月、¥168/年、单季 ¥39 |
| B-03 |
海外用代理商户收款;国内用微信支付(iOS 小程序必须走微信"小程序虚拟支付");App 端用应用内购买 |
4.4 安全与合规(P0)
| ID |
需求 |
| S-01 |
首次进入确认年龄;13 岁以下不可用;未成年人不开放自由对话 |
| S-02 |
始终提示"AI 角色";连续使用每 3 小时提醒休息(国内按 2 小时) |
| S-03 |
自伤、自杀相关表达:检测到后停止剧情,给出当地求助资源 |
| S-04 |
输入和输出都做内容安全检查 |
| S-05 |
国内:生成式 AI 登记、未成年人模式、防沉迷;遵守《人工智能拟人化互动服务管理暂行办法》 |
5. 非功能需求与成本
| 类别 |
要求 |
| 单集内容成本 |
≤ $1(剧本 + 配音 + 插画),只生成一次 |
| 每个用户每集的可变成本 |
≤ $0.02 |
| Pro 用户每月可变成本上限 |
≤ $3(含自由对话公平使用) |
| 延迟 |
口语关卡 P95 ≤ 2.5 秒 |
6. 数据指标
| 指标 |
目标 |
止损线(公测后第 6 周) |
| 次日留存 |
≥ 30% |
< 25% |
| 单集完成率 |
≥ 60% |
< 40% |
| 付费转化 |
≥ 2% |
< 1.5% |
| 每集口语关卡完成数 |
≥ 3 |
— |
| 宣传短视频 → 进站转化 |
≥ 1% |
— |
7. 里程碑
| 阶段 |
时间 |
交付 |
| M0 |
第 11~14 周 |
内容流水线跑出第一季前 3 集;发音评分供应商确认;10 位测试用户内测 |
| M1 |
第 15~18 周 |
网页 PWA 公测:12 集、口语关卡、记忆、付费 |
| M2 |
第 19~22 周 |
角色消息、自由对话(Pro)、宣传视频自动发布 |
| M3 |
第 23~24 周起 |
第二季;App 上架;国内版(英语)视资质进度,最早第 25 周 |
8. 风险
| 风险 |
应对 |
| AI 生成的剧情质量不稳 |
多维度自动评测 + 用户评分低的自动重新生成;每季开始前先用 3 集做 A/B 测试 |
| 语音识别对初学者口音不友好 |
选择题采用宽松匹配;自由回答允许多次尝试和提示 |
| 合规(未成年人、拟人化) |
不做恋爱关系;年龄确认;休息提醒;国内按办法执行 |
| 模型成本变化 |
模型网关可以切换;关卡回复用小模型 |
| 日语发音评分无可用供应商 |
第 11 周前确认;没有合适供应商时用备选算法(识别置信度 + 与目标句的假名编辑距离),评分精度较低,界面上只显示"很好 / 还不错 / 再试一次"三档 |
| 学习者用母语表达危机 |
危机检测同时覆盖目标语言和界面语言(见 spec 05) |