Dev Spec v2 · ← 返回文档首页
04 内容生产流水线
全自动:从一句"季主题"到一季 12 集上线,不需要人工编剧或审稿。队列 tt.content。
1. 流程
季主题(例:"东京便利店夜班,第一季")
│
▼ ① 季设定 bible(网关.llm,结构化输出)
│ 世界观、3~4 个角色卡(性格、口头禅、关系=friend/colleague、边界、声线描述、外貌描述)
│ 12 集故事线(每集一句梗概 + 悬念)
│ ─ 质检:禁用题材清单、关系设定、年龄适宜
│
▼ ② 角色资产
│ 声线:从 TTS 声音库里按描述挑选,每个角色固定一个(按区域各选一个)
│ 参考图:网关.image_generate 生成角色设定图 → 视觉打分挑选 → 作为后续插画的参考
│
▼ ③ 分集大纲(每集)
│ 学习目标:3~5 个句型 + 10~15 个词(从该难度的词表里选)
│ 场景列表、关卡位置(每集 ≥ 3 个关卡,其中至少 1 个自由回答)、分支点(≥ 1 个)
│
▼ ④ 剧本(网关.llm,按 02 文档的 JSON 结构输出)
│ ─ 质检(见第 2 节);不通过 → 带着质检意见重写,最多 3 次
│
▼ ⑤ 配音(网关.tts)
│ 每句台词按角色声音合成
│ ─ 回听检查:网关.stt 识别合成的音频,与剧本对比(字错率 ≤ 5%);不通过换参数重合成
│
▼ ⑥ 插画(网关.image_edit,参考图 + 场景描述)
│ 每集 6~10 张
│ ─ 视觉打分:角色是否一致、有无违规、有无乱码文字;不通过重新生成
│
▼ ⑦ 打包:写入 episodes / assets,状态 live
│
▼ ⑧ 宣传短视频:从本集挑 3 段(开场、最有趣的关卡、结尾悬念)
→ media/video 渲染竖屏视频(插画 + 配音 + 双语字幕 + AI 标注)
→ 底座增长组件自动发布
2. 剧本质检
| 检查 | 方法 | 通过标准 |
|---|---|---|
| 结构 | JSON Schema 校验;节点可达性(从起点能走到结尾,没有死路) | 100% |
| 词汇难度 | 分词后与该难度的词表对照(日语:JLPT 分级词表;英语:CEFR 分级词表) | 超纲词占比 ≤ 5%(专有名词除外) |
| 学习目标覆盖 | 目标句型和词在台词中都出现,且至少在一个关卡里要求用户说出 | 100% |
| 语言正确性 | 另一个模型当"母语老师"逐句检查语法和自然度 | 问题句 ≤ 2 句,且全部已修正 |
| 前后一致 | 角色设定(口头禅、性格)、剧情变量、上集悬念是否被承接 | 大模型评测通过 |
| 安全 | 内容安全检查;关系设定检查(不得出现恋爱暗示);年龄适宜 | 100% |
| 时长 | 按台词数估算 8~12 分钟 | — |
3. 上线后自动迭代
| 触发 | 动作 |
|---|---|
| 某集评分 < 3.5 且样本 ≥ 30 | 读取用户反馈(评分 + 可选的一句话理由)→ 生成改进意见 → 从第 ④ 步重新生成该集 → 质检通过后作为新版本上线(已经看过的用户不受影响) |
| 某集完成率比前后两集低 20 个百分点以上 | 同上,并重点检查中途退出最多的节点 |
| 某个关卡的求助率 > 60% | 降低该关卡难度(换更短的目标句)后重新生成 |
新旧版本做 A/B 测试 7 天,保留表现更好的版本。
4. 成本(估算,以网关计量为准)
| 项 | 每集 |
|---|---|
| 剧本(含重写和质检) | $0.1~0.3 |
| 配音(约 1,500~2,500 字符) | $0.02~0.1 |
| 插画(6~10 张 + 补生成) | $0.3~0.6 |
| 宣传视频渲染 | CPU,可忽略 |
| 合计 | ≤ $1 |
一季 12 集约 $12;如果一季有 1,000 个用户看完,每个用户分摊约 $0.01。
5. 国内版差异
- 所有生成调用走
cn白名单模型 - 题材、角色、文化背景面向中文用户学英语(例如"在伦敦合租""硅谷实习")
- 宣传视频发布到抖音等平台时,按平台要求标注 AI 生成