← 返回文章列表

首位命中更好,完整覆盖却更差:为什么没有把节点搜索全部换成向量

同一142节点图上的小规模对照,出现了首位命中提高、完整实体覆盖下降。策略选择必须先回答用户究竟要找一个,还是找齐一组。

返回 TraceWise 项目总览

以下对照对应 2026 年 9 月 10 日的固定开发记录。

给检索接上在线向量模型,是否就应该替换原来的节点搜索?

TraceWise 这轮对照出现了一个不宜用单个总分概括的结果:语义模式更常把单个目标排到第一位,却少完成了一道要求目标完整进入前十条的题。两个指标都没有算错,它们回答的是不同问题。

这件事影响的不只是算法选择。节点搜索既可能是“帮我定位那个概念”,也可能是“找齐接下来分析关系所需的对象”。一种模式让单个结果更靠前,不等于它更适合所有任务。本文沿着一次固定开发对照,说明为什么当前保留多信号默认,并让语义模式作为显式选项。

先确定向量到底表示什么

正文检索的对象是能支持分析的文字,节点搜索的对象是图里的概念或业务对象。两者可以关联,却不能直接共用一个“语义分数”的含义。

这一轮新图包含142个节点。它们来自固定资料中的概念和流程声明,经公开治理接口写入并读回,不是按题目答案临时生成的候选。语义路径只使用节点公开字段 labelcategoryaliasessummary 来构造文本,再生成向量,与查询计算精确余弦相似度。它没有拿一段 Evidence 的向量冒充整个人、概念或业务对象的向量。

阿里云文本向量接口提供文本到向量的模型能力,并支持为相关模型选择维度;至于送进去哪些业务字段,以及怎样使用返回向量,是调用方需要确定的检索设计。通用文本向量 API是本轮模型接入的接口参考,本文后续数字均来自 TraceWise 自己的固定对照。

多信号路径继续使用已有的九信号评分,组合短语、名称、关键词、局部相似性、类型、关系和邻域等信息。这里的局部相似性使用既有随机索引机制,不是本轮新增的在线向量模型;它也并非只有词法匹配。语义路径则以节点文本余弦作为评分依据,没有同时叠加新的重排或融合规则。

两条路径输入同一份真实治理读回快照,合法节点范围相同,评分时不另读一套未经约束的原始图。需要区别的是:同一可用节点范围不等于同一个召回候选池。本轮比较的是两条完整节点策略在同一对象集合上的表现,不是只替换同池排序器的消融实验。

三个指标,两个方向

节点对照有12道实体题,其中10道只要求一个目标,另外2道需要实体组。第一项指标检查:每道题要求的实体是否全部进入前十条。多信号完成11道,语义完成10道。配对结果是语义0胜、1负、11平。

对其中10道单目标题,再看目标是否排在第一位:多信号4道,语义5道。截断 MRR@10 从0.4892提高到0.5743。这个指标按目标位置取倒数,第一名记1、第二名记1/2,前十条没有目标记0,再对单目标题平均;它会奖励目标前移,但不检查一组目标是否找齐。

多信号与语义:实体组完整11/12与10/12;单目标首位4/10与5/10;MRR为0.4892与0.5743

查看原图

图1:指标关注不同任务要求;10道单目标题属于12道实体题,不是额外样本。

如果产品主要让用户点开第一条结果,首位和倒数排名值得关注。如果产品需要凑齐实体才能继续查看关系或比较,遗漏一个关键对象可能比其余对象排得更靠前更影响任务完成。

这批样本很小,不能据此认定某种算法普遍更好。它们已经足以说明:用首位命中上升来支持全面替换,会忽略本次真实观察到的完整覆盖下降。

Resource:结果都在同一主题,目标却没出现

其中一道题希望给模型补充数据库结构,而不执行操作,需要定位相应 MCP 能力。题目指定的目标是 Resource。

多信号前四名依次是 MCP Server、MCP、MCP Prompt、Resource,目标在第四位。语义前四名是 MCP Prompt、MCP Server、MCP、Host;它返回了相关主题的节点,但 Resource 没有进入前十条。

Resource题:多信号前四为MCP Server、MCP、MCP Prompt、Resource;语义前四为MCP Prompt、MCP Server、MCP、Host,Resource未入前十

查看原图

图2:固定开发题的局部排序。主题相关不等于目标节点已被找到。

对人来说,“补上下文而不是执行”是区分这些概念的关键条件。返回一组同主题对象仍可能没有解决定位任务。这个案例指出的是观察到的失败形态:文本表示与查询之间的整体相似,并没有保证目标概念被选入前十条。

它还不能单独证明模型不懂 Resource,更不能证明具体哪一个字段或哪一个信号导致差异。要做这种归因,需要另外固定候选、表示字段和评分项进行对照。本轮没有在看到该题之后添加别名、调整权重,再用同一题重新计算收益。

Handoff:保留旧策略不等于旧策略没有问题

另一道题要求主流程把售后会话交给专门 Agent 继续处理,而不只是请求它回答子问题,目标是 Handoff。两种模式的前十条都没有命中它,而且第一名都是 Manager。

这条共同漏检很重要。保留多信号默认的含义是“目前没有全面替换依据”,不是“已有策略已经充分满足任务”。围绕相邻概念的区分仍有缺口,需要检查节点描述、别名和任务表达,也可能需要更明确的检索意图。但这些都只是下一次实验的问题,还不是已经验证有效的修复。

本轮还单独检查5道已声明直连关系题:两种模式都完整展示了目标有向引用,展示上限为20条。这里核验的是资料中已有的边及其引用,不是发现未知关系,也不证明多跳推理、因果判断或业务执行正确。

实体与关系这17道题和正文对照的75道题有重叠,不能把两轮相加说成92道独立问题。节点表示没有使用题目或答案字段,但评价材料仍是AI编写、AI复核且有历史暴露的开发题;独立人工验收尚未完成。

不急着把两个分数再混成一个

看到一边覆盖较好、另一边首位较好,很容易再加一次融合,希望同时保留所有优点。但这会引入新选择:候选各取多少、如何去重、哪些关系信号参与、最终仍只有十条时怎样分配位置。单看现有两组成绩,无法推导出某个融合配置一定更好。

因此当前选择保持窄一些:节点多信号默认不变,语义显式可选;Resource 的退步和 Handoff 的共同失败继续保留。正文重排在另一组对照中有收益,也不能直接推导出节点必须加重排,因为候选对象、评分文本和任务完成条件已经不同。

这不是把策略职责交给模型或平台自动决定。Foundation 负责本轮已登记对象的受治理读取与有效性约束;TraceWise 决定搜索哪个业务对象、提供哪种模式、展示什么结果,并对产品任务效果进行评价。更强的表示能力只是这里的一个组成部分。

实验采用 Foundation 0.1.0a20.post22 开发候选,现有正式基线和默认策略没有因为这份成绩表而切换。后续若要重新决定默认,应在未暴露材料上预先固定主指标,同时检查完整覆盖、首位体验和明确的退化容忍范围。

一次检索优化是否值得采用,最终取决于用户要完成什么。“更靠前”和“找得齐”都可能有价值,产品需要决定哪一个是必要条件,而不是等模型返回一个更高的分数后再解释目标。

← 返回文章列表