一步步设计
明确查询要得到什么
虚构问题:“不联网时,怎样把项目导出成 PDF?”相关证据至少要覆盖离线条件、目标格式和操作步骤。把“介绍 PDF”与“可离线导出 PDF”分开标注;词汇相同的页面不一定回答任务。
先便宜地召回候选
用关键词、向量或混合检索得到有限候选,并按版本与产品过滤。候选预算只是工程选择;本例假设最多十段,须用实际查询验证召回是否足够。Jev 重排只看到这些候选,漏掉的正确文档不会自动出现。
为每个查询片段对设统一档位
可用 Score:0=无关,1=只谈格式,2=谈导出但未覆盖离线,3=覆盖离线 PDF 步骤。同一查询下所有候选共享标准;保留源 ID 与原始判断。高排序分表示相对优先级,不能直接宣称已确认答案完整。
排好段落后再定位行
对前列文档保留稳定行 ID,使用 Choice 选择证据行或 none,再按需要扩展相邻上下文。逐行选择适合定位,不代表单独一行能解释所有限制。代码按 ID 取原文,不让模型重写按钮名称或命令。
固定标注集比较,不只看漂亮示例
记录所需证据是否进入候选、首个可用答案位置及最终无答案的回退。虚构候选初始顺序 A、B、C,其中 C 完整;重排把 C 放前只改善这次排序,不证明整个检索器可靠。增加无答案、版本错配和中文问句英文文档的例子。
完整走查 · 本站虚构样本
| 观察到什么 | 如何判断 | 代码怎么处理 |
|---|---|---|
| A:PDF 基本介绍 | 主题相关但无操作步骤 | 低优先级,不能回答离线操作 |
| B:在线云端导出说明 | 条件与查询冲突 | 标出在线限制,不当离线答案 |
| C:离线 PDF 操作及限制 | 覆盖主要要求 | 取原文行,并保留限制 |
可复制的设计草案
以下为本站原创示例。JSON 展示请求或输入形状;Python 仅计算虚构分数,不调用 API。真实接入仍需核对官方接口及任务策略。
# Offline ranking exercise: invented scores.
ratings = {"A": 1, "B": 2, "C": 3}
ranked = sorted(ratings, key=lambda item: (-ratings[item], item))
print(ranked) # ['C', 'B', 'A']
# Ranking changes order; it does not verify answer support.设计我的任务容易踩的坑
- 把重排当全库检索。
- 给不同候选使用不同评分含义。
- 找到了相似行就不再判断是否有答案。
TRY / THINK / COMPARE
先想一想,再看解析
正确教程没进前十候选,应该只调重排阈值吗?
展开解析
不应只调阈值。先查召回、版本过滤和查询表达;重排无法补回未输入的文档。
交付前检查
- 查询、候选与人工标注已固定。
- 所有候选使用同一评分标准。
- 行 ID 可映射到原文和版本。
- 无答案与条件冲突都有回退。
常见问题
逐行搜索能代替全文理解吗?
不能。定位后还需上下文和适用条件。
最高分片段就可以直接生成答案吗?
先检查它是否覆盖要求、有无冲突或缺失,排序与证据支持分开处理。
资料与延伸阅读
参考官方架构模式与 Datawhale 实战主题,本站独立编写讲解、案例与练习。示例为教学设计,未调用 API,不代表性能测试。