J•JEV 学习站
首页/Jev 置信度阈值怎么定?用六条样本看覆盖率与误分

EVALUATION / INTERACTIVE

Jev 置信度阈值怎么定?用六条样本看覆盖率与误分

先用六条完全合成的工单理解权衡,再用自己的脱敏、人工标注数据验证。下列概率与判断结果不是 Jev 实测,也不能用这六条样本为生产环境挑阈值。

这里的六条数据只是教学样本。拖动滑块能解释指标之间的关系,不能证明 Jev 的准确率、校准或最佳阈值。

3 / 6自动处理
3 / 6人工复核
1 / 3自动处理中的误分
50%自动处理比例

示意 confidence · ✓ 自动处理 · ○ 人工复核

  1. 01
    合成样本 01人工标注: shipping · 示意预测: shipping
    0.94
  2. 02
    合成样本 02人工标注: billing · 示意预测: billing
    0.89
  3. 03
    合成样本 03人工标注: review · 示意预测: shipping
    0.83
  4. 04
    合成样本 04人工标注: shipping · 示意预测: shipping
    0.76
  5. 05
    合成样本 05人工标注: review · 示意预测: billing
    0.69
  6. 06
    合成样本 06人工标注: review · 示意预测: review
    0.58

真正上线时怎么做

  1. 先写清标签规则,分别标记正确队列及是否允许自动处理;把模糊、多诉求和资料缺失样本单独记录。
  2. 把数据分为调参集与最终测试集。只在调参集上选阈值;最终测试集锁定后只运行一次报告。
  3. 同时公布自动处理比例、自动处理中的错误数、严重误分、转人工比例、失败请求,以及 p50/p95 和总费用。
  4. 模型、候选集或业务规则改变后重新回归;高影响动作仍由代码权限与人工流程把关。
进阶阅读:Datawhale 的评测方法 Datawhale Jev Cookbook ↗