Dev Spec v2 · ← 返回文档首页

06 测试与验收

1. 测试集

名称 内容 用途
learner_audio_ja 20 位非母语者(英语母语)读 50 句日语的录音,含不同水平 跟读评分、选择匹配
learner_audio_en 20 位中文母语者读 50 句英语 同上(国内版)
free_answers 300 条针对剧本问题的回答(含答非所问、语法错误、极短回答、敏感内容) 自由回答判断、记忆抽取、安全
crisis_set 各语言的自伤、自杀相关表达(含隐晦说法)和容易误报的正常表达;包含"在目标语言关卡里说母语"的录音 危机检测(含语种切换)
script_eval 流水线生成的 3 集,由 3 位该语言的老师评分(开发阶段一次性) 校准自动质检

录音由招募的志愿者在知情同意下提供;不使用真实用户数据。

2. 验收指标

2.1 口语关卡

项 目标
跟读评分与人工评分的相关系数 ≥ 0.6
选择匹配准确率 ≥ 95%(含 2 次机会)
自由回答 understood 判断准确率 ≥ 90%
回复与用户所说内容相关(人工评测) ≥ 90%
记忆抽取准确率 ≥ 95%;敏感信息写入次数为 0
关卡延迟 P95 ≤ 2.5 秒

2.2 内容

项 目标
自动质检通过的剧本,老师评分 ≥ 4/5 的比例 ≥ 80%
超纲词占比 ≤ 5%
配音回听字错率 ≤ 5%
插画角色一致(视觉打分,抽检核对) ≥ 90%
每集内容成本 ≤ $1

2.3 安全

项 目标
危机表达召回率 ≥ 98%(宁可误报)
误报率 ≤ 5%
恋爱或亲密暗示的输出 0(红队测试 200 条诱导输入)
13 岁以下无法使用;13~17 岁的限制生效 100%

2.4 业务(对应 PRD)

时间 指标
第 18 周(公测) 功能全部上线;首批用户数据开始积累
第 24 周(公测 6 周后) 次日留存 ≥ 30%;单集完成率 ≥ 60%;付费转化 ≥ 2%;付费订阅 ≥ 150
止损线(公测后第 6 周) 次日留存 < 25%,或完成率 < 40%,或转化 < 1.5%

3. 合规清单

  • ☐ 首次进入的 AI 告知和年龄确认
  • ☐ 界面上持续的"AI 角色"标识
  • ☐ 危机处理流程和各地区的求助资源列表(至少覆盖美国、英国、加拿大、澳大利亚、主要欧盟国家、日本、中国)
  • ☐ 休息提醒
  • ☐ 隐私政策:录音 7 天删除、记忆可查看和删除、数据不用于训练第三方模型
  • ☐ 欧盟 AI 法案的透明度要求(AI 告知、AI 生成内容可识别)
  • ☐ 加州 SB 243:AI 告知、未成年人提醒、危机处理流程
  • ☐ 国内版:生成式 AI 登记、拟人化互动服务的合规自查、未成年人模式、2 小时提醒、模型公示