模板与工具
真实样本评测表模板
用真实业务样本评测 AI 效果的表格模板:样本记录、结果对比、错误分类、指标汇总。
怎么用这份模板
配合八步法的 评测步骤 使用。核心原则:样本必须真实、标准答案必须由业务专家确认、错误必须分类。
第一步:样本记录表
每个测试样本一行:
| 编号 | 样本描述 | 来源 | 类型(常见/边界) | 标准答案(业务专家填) |
|---|---|---|---|---|
| 001 | 某客户询价 A 产品 100 件 | 2024 年报 Email | 常见 | 报价 12,000 元,交期 2 周 |
| 002 | 含特殊折扣条款的合同 | 历史合同库 | 边界 | 需人工审核折扣条款 |
样本数量建议 30-100 个,常见情况和边界情况都要有。
第二步:结果记录表
| 编号 | AI 输出 | 结果(正确/部分正确/错误/无法处理) | 人工修正耗时 | 备注 |
|---|---|---|---|---|
| 001 | 报价 12,000 元 | 正确 | 0 | — |
| 002 | 直接给出折扣价 | 错误 | 10 分钟 | 未识别特殊条款 |
第三步:错误分类表
把"错误"和"部分正确"的样本归类:
| 错误类型 | 数量 | 例子 | 改进方向 |
|---|---|---|---|
| 数据缺失 | — | 查不到客户历史价 | 补数据源 |
| 规则未覆盖 | — | 特殊折扣条款 | 补充规则 / 转人工 |
| AI 理解错误 | — | 误解产品型号 | 改 prompt / 加示例 |
| 边界情况 | — | 金额超出范围 | 设定自动转人工条件 |
第四步:指标汇总表
| 指标 | 结果 | 成功标准 | 是否达标 |
|---|---|---|---|
| 完成率(正确+部分正确) | — | 开工前约定的值 | — |
| 错误率 | — | — | — |
| 单次节省时间 | — | — | — |
| 单次成本 | — | — | — |
第五步:评测结论
用三句话写结论:
- 这个方案在哪些场景下表现好?
- 在哪些场景下不可靠,怎么兜底?
- 建议:进入试点 / 改进后复测 / 停止?
常见错误
- 用编造的干净数据测试,上线后傻眼
- 只记录"对了多少",不分析"错在哪"
- 没有业务专家确认标准答案,评测变成自说自话
你现在可以做什么
- 向业务部门要 30 个真实历史案例
- 请业务专家标出标准答案
- 跑一遍批量测试,按上面的表格记录,得出评测结论