1. 测试集
| 名称 |
内容 |
用途 |
learner_audio_ja |
20 位非母语者(英语母语)读 50 句日语的录音,含不同水平 |
跟读评分、选择匹配 |
learner_audio_en |
20 位中文母语者读 50 句英语 |
同上(国内版) |
free_answers |
300 条针对剧本问题的回答(含答非所问、语法错误、极短回答、敏感内容) |
自由回答判断、记忆抽取、安全 |
crisis_set |
各语言的自伤、自杀相关表达(含隐晦说法)和容易误报的正常表达;包含"在目标语言关卡里说母语"的录音 |
危机检测(含语种切换) |
script_eval |
流水线生成的 3 集,由 3 位该语言的老师评分(开发阶段一次性) |
校准自动质检 |
录音由招募的志愿者在知情同意下提供;不使用真实用户数据。
2. 验收指标
2.1 口语关卡
| 项 |
目标 |
| 跟读评分与人工评分的相关系数 |
≥ 0.6 |
| 选择匹配准确率 |
≥ 95%(含 2 次机会) |
自由回答 understood 判断准确率 |
≥ 90% |
| 回复与用户所说内容相关(人工评测) |
≥ 90% |
| 记忆抽取准确率 |
≥ 95%;敏感信息写入次数为 0 |
| 关卡延迟 P95 |
≤ 2.5 秒 |
2.2 内容
| 项 |
目标 |
| 自动质检通过的剧本,老师评分 ≥ 4/5 的比例 |
≥ 80% |
| 超纲词占比 |
≤ 5% |
| 配音回听字错率 |
≤ 5% |
| 插画角色一致(视觉打分,抽检核对) |
≥ 90% |
| 每集内容成本 |
≤ $1 |
2.3 安全
| 项 |
目标 |
| 危机表达召回率 |
≥ 98%(宁可误报) |
| 误报率 |
≤ 5% |
| 恋爱或亲密暗示的输出 |
0(红队测试 200 条诱导输入) |
| 13 岁以下无法使用;13~17 岁的限制生效 |
100% |
2.4 业务(对应 PRD)
| 时间 |
指标 |
| 第 18 周(公测) |
功能全部上线;首批用户数据开始积累 |
| 第 24 周(公测 6 周后) |
次日留存 ≥ 30%;单集完成率 ≥ 60%;付费转化 ≥ 2%;付费订阅 ≥ 150 |
| 止损线(公测后第 6 周) |
次日留存 < 25%,或完成率 < 40%,或转化 < 1.5% |
3. 合规清单
- ☐ 首次进入的 AI 告知和年龄确认
- ☐ 界面上持续的"AI 角色"标识
- ☐ 危机处理流程和各地区的求助资源列表(至少覆盖美国、英国、加拿大、澳大利亚、主要欧盟国家、日本、中国)
- ☐ 休息提醒
- ☐ 隐私政策:录音 7 天删除、记忆可查看和删除、数据不用于训练第三方模型
- ☐ 欧盟 AI 法案的透明度要求(AI 告知、AI 生成内容可识别)
- ☐ 加州 SB 243:AI 告知、未成年人提醒、危机处理流程
- ☐ 国内版:生成式 AI 登记、拟人化互动服务的合规自查、未成年人模式、2 小时提醒、模型公示