設計の手順
予測目標を決める
架空の課題は今週の注意が必要な問題票。作成時の情報だけを使い、後の結果は入力にしません。規則で解ける場合は先に使います。
説明できる特徴を作る
Noul で再現手順、Score で定義した影響度を判断します。ID、質問、段階、版、行結果を保存します。欠損を0にしません。
実体や時間で分ける
同じ問題票の更新や複製は同一組です。訓練と検証と最終テストを分け、提案者もテストの正解や誤りを見ません。
基準を作ってから反復する
多数クラス、キーワード、単純テキスト基準と比べます。予算と指標を固定し、開発用の誤りから提案します。似た質問の大量追加は情報を増やさないことがあります。
除去実験と範囲を報告する
特徴を外して寄与を調べます。不均衡、重要項目の見逃し、人の負担、費用を測ります。設計を固定して最終テストを行います。
具体例 · 本サイトの架空データ
| 観察した事実 | 判断 | コードでの処理 |
|---|---|---|
| 既に重要と判定された情報 | 後の結果の漏洩 | 入力から除く |
| 同じ票の更新が別集合 | 近重複の漏洩 | 票ごとに分割 |
| 検証で改善 | まだ汎化未確認 | 固定して最終テスト |
コピーできる設計例
独自の例です。JSON はリクエストや入力の形、Python は架空スコアの計算のみを示します。API は実行しません。接続前に公式仕様と処理方針を確認してください。
# Feature schema for an invented issue dataset.
{
"group_key": "issue_id",
"prediction_time": "issue_created_at",
"features": ["has_reproduction_steps", "impact_level"],
"missing_policy": "keep_missing_indicator",
"forbidden_inputs": ["future_maintainer_label", "closed_at"],
"split_roles": ["train", "validation", "untouched_test"]
}判断を設計するよくある失敗
- テストの誤りで特徴を作る。
- 欠損を偽とする。
- 基準や費用を報告しない。
TRY / THINK / COMPARE
先に考えてから解説へ
最終テストを見て特徴を直し、同じテストで改善を発表できますか?
解説を開く
開発に使った集合だと明記し、新しい独立テストか事前定義した評価が必要です。
提出前の確認
- 予測時の情報だけ使用。
- 実体と時間の漏洩を防止。
- 基準・版・予算・除去実験。
- 最終テストで特徴を作らない。
よくある質問
質問自動提案で研究完了ですか?
データ、訓練、検証、予算が必要です。ここでは訓練しません。
全プロジェクトへ移せますか?
新しい言語や分布で再検証します。
参考資料
公式パターンと Datawhale の実践テーマを参考に、説明・例・演習を独自に作成しています。API の実行結果や性能測定ではありません。