JEV / LESSON 08 · 12 分
Jev のデモから運用へ:サンプル、しきい値、引き継ぎ
再現できる評価表で重大な誤り、人の確認率、全体費用を調べます。
処理全体を定義する
問い合わせを読み、事実を取得し、state を作り、Jev を呼び、結果を検査し、振り分けまたは人に引き継ぎ、結果を記録します。各段階の失敗時も定義します。
サンプル表を作る
個人情報を除いた state、人の正解、場面、候補、モデル版、予測、確率、実行動作、人の確認、誤りの費用を記録します。通常例と重大な境界例を分けます。
誤りの費用からしきい値を決める
誤った振り分けと追加の人手確認では費用が違います。正解付きデータで調整し、別のデータで検証します。項目不足や API エラーには明確な引き継ぎを用意します。
処理全体を測る
正解率、重大な誤り、人の確認率、全体の p50/p95、千件当たりの費用、利用者体験を報告します。LLM との比較には同じ例と適切な構造化出力を使います。
段階的に公開し、再評価する
最初は取り消せる動作と抽出検査から始め、モデル版とリクエスト ID を記録します。候補や方針が変わったら再評価し、誤りが増えれば人へ戻します。
表の見出し
case_id, locale, scenario, state_redacted, expected_label, predicted_label, confidence_or_noul, model_version, action, human_review, error_cost, latency_ms。鍵や不要な個人情報は保存しません。
空の評価表をダウンロード
CSV は見出しだけで、個人情報やモデル結果は含みません。匿名化した例を入力し、正解と予測、動作と人の確認を比べます。
CSV ↓練習
練習
正解付きの例でしきい値を調整しました。次は?
担当者が最初に決めることは何か
問い合わせの原文から確認済みの事実、三つの質問、説明用の返り値、境界事例、公開前の評価まで順を追います。
実例で学ぶ:未着の荷物を Jev でどう振り分けるか進捗はこのブラウザーだけに保存されます