← 返回文章列表

AI 可以帮助出题,但谁来定义检索成功?

从 TraceWise 的80道开发材料出发,拆解标签来源、必要证据、任务分母与独立验收之间的关系。

返回 TraceWise 项目总览

检索策略变多以后,最难的问题未必是怎样组合模型,而是怎样判断组合确实有用。一个策略可能把最相关的段落排得更靠前,另一个策略可能找到更多侧面的资料,还有一个策略只是更好地定位节点。给它们统一套一个“准确率”,往往会把不同任务混在一起。

TraceWise 这轮开发选择先固定任务与成功条件,再比较策略。AI 帮助整理资料、编写候选问题、定位引文和检查分数;人的业务判断与未暴露的独立材料仍有独立位置。这里最重要的不是工具能生成多少题,而是每个数字究竟依据什么标签计算,以及标签允许我们得出多大的结论。

先说明题目从哪里来

2026 年 9 月 10 日的开发材料共 80 道:14 道工作流、61 道架构概念、5 道版本专题。它们由 AI 编写和复核,作者上下文存在历史暴露;材料身份保留为开发用途,human_reviewed=falseindependent_holdout=false。逐字引文、来源哈希和修订记录能够核验材料出处,却不能把这个身份升级成人工标准答案。

80 道材料也不是一个可以直接代入所有指标的分母。正文任务有 75 道,其中 71 道有明确支持,4 道保留为歧义诊断。节点与关系对照使用 17 道题,它们和正文任务重叠,不能相加得到 92 个独立问题。5 道版本题涉及同一组真实前后源码捕获,不等于 5 条独立版本链。

开发材料与评测分母矩阵

查看原图

分母矩阵:任务资产数、测量侧面与独立性是不同维度。相同资料从多个角度提问,可以提高诊断价值,但不会自动增加独立事实数量。

历史重合检查进一步发现,80 题中有 33 题与旧题引用了重叠的同源行区间。虽然没有完全相同的标准化问句,其余 47 题也不能因此被称为独立留出。把一个问题换个说法,或者换一个 AI 会话生成它,都不足以证明系统从未见过相关意图和依据。

标签首先应该表达“需要找到什么”

检索题不能只有一个自然语言问题和一段参考答案。参考答案里经常混有背景说明、限定条件、推论和补充材料;如果把每一句都当作必须召回的内容,系统会因为没有找到不必要的背景而失分。

本轮每题记录使用目的、必要要点、对应原文以及支持组合。必要要点来自用户任务本身。例如问题只问某条关系的方向,就不应强制检索整个系统的权限免责声明。相反,问题明确要求说明异常分支,仅找到正常流程也不算完整。

支持组合尤其重要。多段材料有时必须合用,有时只是彼此替代。这个区别如果没有写入标签,评分器只能按“命中了几个引用”猜测,重复提到同一结论的文档可能获得不合理优势。

把支持条件写成可检查契约

下面是一个专门用于解释口径的虚构例子,不是项目原题。问题是:“什么情况下可以重试请求,什么时候需要转交处理?”必要点 P1 讨论重试前提,P2 讨论转交条件。

假设 A 说明应确认请求结果,B 说明幂等约束;两者合用才能支撑 P1。另有 C 是完整操作规程,已经同时覆盖这两个条件,可以独立替代 A 与 B。D 说明转交条件,对 P2 必不可少。于是,P1 的支持条件是“(A 且 B)或 C”,P2 的支持条件是 D,而整题需要 P1 与 P2 都满足。

必要支持组合的教学示例

查看原图

教学示例,非实测案例:找到 A 与 D,看起来已有两段正确资料,却仍缺 P1 的另一项前提;找到 C 与 D 才是另一种充分组合。

实现中使用外层 OR、内层 AND 描述替代组;一题中的必要点共同成立才算完整。片段覆盖按固定原文字符区间合并,同一句话被多个切片命中不会重复得分。两个相邻命中若确实覆盖了完整引用,可以通过区间并集组成支持;只擦到开头的几个字符则不能算命中整段依据。

这也要求先统一坐标。索引里的位置不一定是原文位置,序列化字段和转义可能改变区间。评分前必须还原到固定来源,而不是拿切片编号与引用行号直接比较。

指标应与标签的覆盖程度匹配

这批标签明确了哪些原文支持是必要的,但没有穷尽所有相关材料。因此,本轮主要统计“已声明必要依据是否完整进入最终上下文”和“必要要点覆盖程度”。它们可以回答证据保留问题,不能直接改名为答案准确率。

同样,未标注的一段资料可能相关,也可能不相关。在没有适合本题集的相关性判定覆盖时,把所有未列入参考的结果一律当作错误,会扭曲 Precision;直接计算 nDCG,也会把有限的支持锚点伪装成完整的相关性等级。

这不意味着公开评测必须穷举每篇文档。NIST 对 TREC 的说明强调语料与 qrels 必须匹配;TREC 2023 概览进一步解释,实际评测可通过多系统结果池选择待判资料,但“未判即不相关”的近似依赖于池是否足够覆盖相关结果。我们的少量必要支持标签不等价于这样的相关性集合。TREC 相关性说明TREC 2023 概览

另一项参考是 BEIR。其 2021 年论文组织不同任务与领域的数据集,用于观察检索模型的跨分布表现。对 TraceWise 的启发是把工作流、概念定位与版本事实分开看,而不是照搬论文分数或宣称自己完成了同等规模的基准。BEIR 论文 v4

保留难题,比给难题错误打分更重要

4 道正文诊断题没有因为难以评分而被删掉。它们保留问题、歧义或不足的范围、需要补充的材料,但不进入 71 道明确支持题的主要分母。检索返回了结果,并不能证明问题可回答;系统没有结果,也不自动等于正确拒答。

版本专题也有类似边界。一组源码前后捕获可以支持“某个排序语句发生了变化”,却不能凭捕获时间推断生产上线时间。那些用来确认输入身份的日期与代码哈希是审计条件,不应变成模型必须召回的额外奖励词。否则,评分会鼓励系统匹配测试元数据,而非完成真实查询。

保留这些材料的用途,是检查系统何时需要更谨慎地陈述结果,以及还缺哪种业务判断;不是先人为写出一个拒答标签,再把“找不到”当成成功。

让对照回答一个具体问题

正文对照固定同一次查询的 30 个原始候选、最终 10 条和 8000 字符上下文预算。向量基线使用重排前顺序,增强条件对同一池重排。这样可以集中观察排序变化怎样影响证据保留,而不会把换语料、扩大候选池与重排的收益揉在一起。

本批 71 道支持题中,最终上下文完整保留必要依据的题数由 51 道变为 60 道。这个结果可以支持“同池重排值得保留为增强候选”。但工作流子集仍只有 7/13 完整,说明总分掩盖不了薄弱任务;结果也没有扩大为生成答案正确率或生产表现。

对节点定位则另列实体完整命中、首位命中和有向关系展示。一个模式可能把首个目标排得更靠前,同时漏掉另一个必要实体;这正是不能只用一个平均分决定默认策略的原因。开发对照的价值,是帮助做出这种有条件的产品选择。

AI 复核与独立验收各自解决什么

本轮又用独立于运行过程的区间并集实现,重算了 75 份响应的覆盖指标,结果一致。这能降低评分实现出错的风险,却没有改变题目作者与标签来源。独立重算和独立标注解决的是两个问题。

此前还有一批 8 道试做题,作者确认:本人独立编写、AI 辅助后逐题复核。它是一个有明确身份声明的有限案例,不应被推广成这 80 道材料都经过人审。

最终验收需要新作者只接收固定原文、来源说明与空模板,不携带旧题、标签、排名和失败分析;返稿后再检查意图重复、支持主题与暴露情况。真正需要人来判断的是任务是否符合业务、支持是否充分,以及模糊材料怎样解释。哈希核验、区间转换和重复检测可以交给工具,不能代替这些判断。

对于 AI 辅助评测,我更关心的边界是:自动化是否让判断依据更容易检查,而不是让题量看起来更多。开发题可以帮助比较和诊断;独立验收则要用另外的材料身份与决策过程来完成。

← 返回文章列表