EVALUATION / INTERACTIVE
Jev 置信度阈值怎么定?用六条样本看覆盖率与误分
先用六条完全合成的工单理解权衡,再用自己的脱敏、人工标注数据验证。下列概率与判断结果不是 Jev 实测,也不能用这六条样本为生产环境挑阈值。
这里的六条数据只是教学样本。拖动滑块能解释指标之间的关系,不能证明 Jev 的准确率、校准或最佳阈值。
3 / 6自动处理
3 / 6人工复核
1 / 3自动处理中的误分
50%自动处理比例
示意 confidence · ✓ 自动处理 · ○ 人工复核
- 01合成样本 01人工标注: shipping · 示意预测: shipping0.94
- 02合成样本 02人工标注: billing · 示意预测: billing0.89
- 03合成样本 03人工标注: review · 示意预测: shipping0.83
- 04合成样本 04人工标注: shipping · 示意预测: shipping0.76
- 05合成样本 05人工标注: review · 示意预测: billing0.69
- 06合成样本 06人工标注: review · 示意预测: review0.58
真正上线时怎么做
- 先写清标签规则,分别标记正确队列及是否允许自动处理;把模糊、多诉求和资料缺失样本单独记录。
- 把数据分为调参集与最终测试集。只在调参集上选阈值;最终测试集锁定后只运行一次报告。
- 同时公布自动处理比例、自动处理中的错误数、严重误分、转人工比例、失败请求,以及 p50/p95 和总费用。
- 模型、候选集或业务规则改变后重新回归;高影响动作仍由代码权限与人工流程把关。
进阶阅读:Datawhale 的评测方法 Datawhale Jev Cookbook ↗