专题数据与信息系统搜索、索引与检索
搜索、索引与检索
从信息表示、候选匹配和排序建立检索模型,解释学习表示、近似索引、融合、更新与质量。
检索把一个查询接到一组候选信息。系统先决定搜索单位及其表示,建立访问结构,再解释查询、取得候选并排序。原文包含某个字面词、数值表示相似、结果对任务有用,各自需要相应规则与判断。
本专题从词项和倒排索引开始,说明 BM25 怎样打分、模型怎样学习稠密和稀疏表示、单向量与多向量怎样比较。随后解释距离、混合排名、HNSW、IVF、PQ 与磁盘图索引,最后处理查询扩展、索引变化、权限和评价。读者需要认识集合、向量与分数;公式中的符号在使用处说明,示例是构造的机制演示。
搜索单位、表示模型、候选规模、过滤方式和排序目标会相互影响。改进一层可能减少该层的错误,同时增加另一层的成本;后面的重排只能比较已经进入候选的信息。完整结果需要保留来源身份、位置和版本,便于返回原文核对。
本专题的解释对象到检索结果为止。证据怎样支持模型回答、生成怎样引用和处理冲突,属于检索增强生成;具体数据库和 AI 工程接口属于相应实践。检索排序靠前只表示当前规则给了较高分数,不能直接推出事实正确、权限允许或答案充分。
搜索单位、词项与倒排索引
解释原文怎样形成可检索表示,词项怎样连接到候选记录。
查询匹配、候选与排序
理解 BM25 的词频与长度规则,以及交叉编码、模型重排和结果去重的条件。
学习表示、双塔与多向量匹配
解释对比学习、稀疏词项扩展、嵌套维度和迟交互怎样改变检索表示及成本。
向量距离与混合检索
解释相似度、归一化、候选合并、分数融合和倒数排名融合的作用与边界。
近似近邻索引:图、分区与量化
解释 HNSW、IVF、PQ 和磁盘图检索怎样减少访问,并核对过滤与精确近邻覆盖。
查询扩展、改写与迭代检索
解释术语扩展、多查询、假设文档和逐步检索怎样改变候选,并保留约束与停止条件。
索引更新、权限与检索质量
保持原文和索引对应,区分近邻覆盖与相关性,并用任务、样本、排名和成本评价检索。
最后更新于