EVALUATION / INTERACTIVE
Jev の信頼度しきい値:六つの例で自動処理率と誤りを見る
六つの架空の問い合わせで関係を理解し、自分の匿名化した正解付きデータで確認します。数値は Jev API の実測ではなく、運用しきい値の根拠にはできません。
この六件は指標の関係を説明する架空データです。Jev の正解率、校正、最適なしきい値を示すものではありません。
3 / 6自動処理
3 / 6人が確認
1 / 3自動処理の誤り
50%自動処理率
例示の confidence · ✓ 自動処理 · ○ 人が確認
- 01架空の例 01人の正解: shipping · 例示の予測: shipping0.94
- 02架空の例 02人の正解: billing · 例示の予測: billing0.89
- 03架空の例 03人の正解: review · 例示の予測: shipping0.83
- 04架空の例 04人の正解: shipping · 例示の予測: shipping0.76
- 05架空の例 05人の正解: review · 例示の予測: billing0.69
- 06架空の例 06人の正解: review · 例示の予測: review0.58
実際に評価する手順
- 正解の担当と自動処理の許可について、人によるラベルの規則を決めます。曖昧、複数意図、情報不足を分けます。
- しきい値を決める集合と最後のテスト集合を分離します。テストでしきい値を調整しません。
- 自動処理率、誤処理、重大な誤り、人の確認、失敗、p50/p95、総費用を一緒に報告します。
- モデルや候補、規則を変えたら再評価します。重要な動作にはコードの権限確認と人の手順を残します。
さらに読む:Datawhale の評価方法 Datawhale Jev Cookbook ↗