知行札记
专题数据与信息系统搜索、索引与检索

搜索、索引与检索

从信息表示、候选匹配和排序建立检索模型,解释学习表示、近似索引、融合、更新与质量。

检索把一个查询接到一组候选信息。系统先决定搜索单位及其表示,建立访问结构,再解释查询、取得候选并排序。原文包含某个字面词、数值表示相似、结果对任务有用,各自需要相应规则与判断。

本专题从词项和倒排索引开始,说明 BM25 怎样打分、模型怎样学习稠密和稀疏表示、单向量与多向量怎样比较。随后解释距离、混合排名、HNSW、IVF、PQ 与磁盘图索引,最后处理查询扩展、索引变化、权限和评价。读者需要认识集合、向量与分数;公式中的符号在使用处说明,示例是构造的机制演示。

搜索单位、表示模型、候选规模、过滤方式和排序目标会相互影响。改进一层可能减少该层的错误,同时增加另一层的成本;后面的重排只能比较已经进入候选的信息。完整结果需要保留来源身份、位置和版本,便于返回原文核对。

本专题的解释对象到检索结果为止。证据怎样支持模型回答、生成怎样引用和处理冲突,属于检索增强生成;具体数据库和 AI 工程接口属于相应实践。检索排序靠前只表示当前规则给了较高分数,不能直接推出事实正确、权限允许或答案充分。

最后更新于