向量距离与混合检索
解释相似度、归一化、候选合并、分数融合和倒数排名融合的作用与边界。
距离定义怎样比较表示
嵌入把输入转换为固定维数的向量。模型训练使某些关系反映在空间位置上,实际“接近”由比较规则定义。常见规则是内积、余弦相似度与欧氏距离:
余弦除去向量模长的影响;内积同时受方向与模长影响;欧氏距离比较坐标差。若查询与文档都归一化为单位向量,平方欧氏距离等于 ,按内积或余弦降序、按欧氏距离升序会得到相同排序。未归一化时通常没有这一等价关系。零向量的余弦未定义,需要明确处理。
Faiss 的索引说明和 MetricType 说明区分了这些度量。具体模型有自己的输入模板和归一化契约,不能为了换索引随意改度量。距离返回值还可能是平方距离或距离的变换,阈值需要匹配实际接口。
相似表示能连接部分同义或跨语言表达,也可能将否定、版本号和罕见代号编码得不够可分。表示是否适合当前查询分布,需要专门检查;相似度不能直接解释为相关概率或答案正确概率。
精确近邻与近似近邻回答的范围
精确近邻返回约定集合及度量下的真实前 项。全扫描对每个允许向量计算分数是一种实现,也有其他等价的精确检索结构。近似近邻(ANN)通过有限图访问、区域探查或压缩距离等减少工作,允许和精确前 项产生差别。完整机制见近似索引。
精确表示匹配只证明按当前表示排序正确。若嵌入模型把两种相反事实放得较近,精确搜索仍会忠实地取得这种空间中的近邻。评价时要分开表示的任务适合度和 ANN 对精确近邻的覆盖。
混合检索怎样取得候选
词法匹配保留明确词项和标识信号,学习表示可以提供不同表达之间的关系。先分别取得两路候选,按稳定单位 ID 求并集,再融合或重排,是一种混合检索管线。候选数、过滤、去重、源文档与片段的身份转换,需要在各路之间一致。
混合候选有机会补足某一路遗漏,也会带入该路的噪声。若两路返回的错误高度重合,新增一路未必改善;若融合将低质量一路的结果推到前列,最终指标还可能下降。评价应比较每路独立结果、合并后的覆盖及融合后的排序。
分数融合需要明确尺度
加权分数可以写成 ,其中 是原始分数或经过变换的分数。BM25 与向量分数的范围、分布和含义不同,直接相加会让数值较大的一路主导。可用每查询范围归一化、固定校准或学习融合,但各自有条件。
按当前候选做最小—最大归一化时,最高与最低分决定尺度;极端值或候选数变化会改变同一记录的归一化分数,全体同分时还要处理零分母。固定变换较稳定,前提是模型和查询分布仍匹配。学习融合需要相关标注与独立验证集,并检查域外变化。
缺席候选不一定经过该路完整评分。将缺席当零分、使用已知下界或回算各路分数,分别改变融合含义,应明确采用哪种规则。BGE-M3 原论文 §3.2使用多路加权分数,是有具体模型与场景条件的实现;分数融合并没有在原理上被排除。
倒数排名融合保留名次
倒数排名融合(Reciprocal Rank Fusion,RRF)按各列表中的位置计算贡献。一种带权形式是:
是第 路列表,名次从 1 开始, 是非负权重, 是平滑常数。候选未出现在某路截断列表里,该路不贡献分数。原始等权形式见 Cormack 等人的 SIGIR 2009 论文。论文在预实验后固定 ,这个取值和其效果属于该实验条件。
构造示例中,词法列表为 A、B、C,向量列表为 B、C、D,取等权、。B 的贡献为 ,C 为 ,A 与 D 分别只有 和 。因此两路共同支持的 B、C 排在只有一路支持的 A、D 前。这个例子说明机制,不代表共同命中就更真实或更有用。
增大 会减小高低名次之间的相对贡献差别;减小它更强调头部位置。RRF 不使用原分数差距,因此一个记录的巨大领先和微弱领先只要名次相同就得到相同贡献。各路质量不同可以赋予不同权重;重复添加同一路排名也会增加它的实际权重。候选截断位置同样影响哪些贡献可见。
RRF 省去了跨路原始分数校准,但仍需确定列表长度、平滑常数、权重和单位身份。分数融合、名次融合及后续重排分别保留不同信息,应在相同查询和语料上比较。没有一种融合公式能补回所有检索路都遗漏的候选。
最后更新于