知行札记
专题数据与信息系统搜索、索引与检索

向量距离与混合检索

解释相似度、归一化、候选合并、分数融合和倒数排名融合的作用与边界。

距离定义怎样比较表示

嵌入把输入转换为固定维数的向量。模型训练使某些关系反映在空间位置上,实际“接近”由比较规则定义。常见规则是内积、余弦相似度与欧氏距离:

cos⁡(q,d)=qTd∥q∥∥d∥,∥q−d∥2=∥q∥2+∥d∥2−2qTd\operatorname{cos}(q,d)=\frac{q^\mathsf{T}d}{\|q\|\|d\|},\qquad \|q-d\|^2=\|q\|^2+\|d\|^2-2q^\mathsf{T}d

余弦除去向量模长的影响;内积同时受方向与模长影响;欧氏距离比较坐标差。若查询与文档都归一化为单位向量,平方欧氏距离等于 2−2qTd2-2q^\mathsf{T}d,按内积或余弦降序、按欧氏距离升序会得到相同排序。未归一化时通常没有这一等价关系。零向量的余弦未定义,需要明确处理。

Faiss 的索引说明和 MetricType 说明区分了这些度量。具体模型有自己的输入模板和归一化契约,不能为了换索引随意改度量。距离返回值还可能是平方距离或距离的变换,阈值需要匹配实际接口。

相似表示能连接部分同义或跨语言表达,也可能将否定、版本号和罕见代号编码得不够可分。表示是否适合当前查询分布,需要专门检查;相似度不能直接解释为相关概率或答案正确概率。

精确近邻与近似近邻回答的范围

精确近邻返回约定集合及度量下的真实前 kk 项。全扫描对每个允许向量计算分数是一种实现,也有其他等价的精确检索结构。近似近邻(ANN)通过有限图访问、区域探查或压缩距离等减少工作,允许和精确前 kk 项产生差别。完整机制见近似索引。

精确表示匹配只证明按当前表示排序正确。若嵌入模型把两种相反事实放得较近,精确搜索仍会忠实地取得这种空间中的近邻。评价时要分开表示的任务适合度和 ANN 对精确近邻的覆盖。

混合检索怎样取得候选

词法匹配保留明确词项和标识信号,学习表示可以提供不同表达之间的关系。先分别取得两路候选,按稳定单位 ID 求并集,再融合或重排,是一种混合检索管线。候选数、过滤、去重、源文档与片段的身份转换,需要在各路之间一致。

混合候选有机会补足某一路遗漏,也会带入该路的噪声。若两路返回的错误高度重合,新增一路未必改善;若融合将低质量一路的结果推到前列,最终指标还可能下降。评价应比较每路独立结果、合并后的覆盖及融合后的排序。

分数融合需要明确尺度

加权分数可以写成 S(d)=∑iwis~i(d)S(d)=\sum_i w_i\tilde s_i(d),其中 s~i\tilde s_i 是原始分数或经过变换的分数。BM25 与向量分数的范围、分布和含义不同,直接相加会让数值较大的一路主导。可用每查询范围归一化、固定校准或学习融合,但各自有条件。

按当前候选做最小—最大归一化时,最高与最低分决定尺度;极端值或候选数变化会改变同一记录的归一化分数,全体同分时还要处理零分母。固定变换较稳定,前提是模型和查询分布仍匹配。学习融合需要相关标注与独立验证集,并检查域外变化。

缺席候选不一定经过该路完整评分。将缺席当零分、使用已知下界或回算各路分数,分别改变融合含义,应明确采用哪种规则。BGE-M3 原论文 §3.2使用多路加权分数,是有具体模型与场景条件的实现;分数融合并没有在原理上被排除。

倒数排名融合保留名次

倒数排名融合(Reciprocal Rank Fusion,RRF)按各列表中的位置计算贡献。一种带权形式是:

RRF⁡(d)=∑i:d∈Liwic+rank⁡i(d)\operatorname{RRF}(d)=\sum_{i:d\in L_i}\frac{w_i}{c+\operatorname{rank}_i(d)}

LiL_i 是第 ii 路列表,名次从 1 开始,wiw_i 是非负权重,c>0c>0 是平滑常数。候选未出现在某路截断列表里,该路不贡献分数。原始等权形式见 Cormack 等人的 SIGIR 2009 论文。论文在预实验后固定 c=60c=60,这个取值和其效果属于该实验条件。

构造示例中,词法列表为 A、B、C,向量列表为 B、C、D,取等权、c=60c=60。B 的贡献为 1/62+1/611/62+1/61,C 为 1/63+1/621/63+1/62,A 与 D 分别只有 1/611/61 和 1/631/63。因此两路共同支持的 B、C 排在只有一路支持的 A、D 前。这个例子说明机制,不代表共同命中就更真实或更有用。

增大 cc 会减小高低名次之间的相对贡献差别;减小它更强调头部位置。RRF 不使用原分数差距,因此一个记录的巨大领先和微弱领先只要名次相同就得到相同贡献。各路质量不同可以赋予不同权重;重复添加同一路排名也会增加它的实际权重。候选截断位置同样影响哪些贡献可见。

RRF 省去了跨路原始分数校准,但仍需确定列表长度、平滑常数、权重和单位身份。分数融合、名次融合及后续重排分别保留不同信息,应在相同查询和语料上比较。没有一种融合公式能补回所有检索路都遗漏的候选。

最后更新于

本页目录