知行札记
专题AI 模型与系统检索增强与知识生成

资料表示与证据单元

说明解析、切分、嵌入、语境补足、身份权限和索引更新。

解析质量决定后续能看见什么

PDF、网页、表格、代码和对话具有不同结构。提取时保留标题、页码、行列、代码块和附件身份;OCR 或转换可能改变字符、表格对应和阅读顺序。向量模型只能表示取得的内容,无法保证补回解析时丢掉的真实数字。

知识块同时是检索表示与证据定位单元。稳定身份可包含文档身份、版本和位置;原文、显示文本、嵌入输入与生成语境需要明确对应。引用应指向实际材料,不能只指搜索结果排名。

切分决定语境边界

固定长度易于预算,可能切断句子和指代。结构/递归切分优先标题、段落和句子,适应性依赖解析结构。语义切分比较相邻句子表示,增加嵌入成本,阈值随语料变化。overlap 可以保留交界,重复存储与重复证据也增加。

构造例子:第一段给出对象“材料A”,第二段写“其有效期为三个月”。单独编码第二段可能丢掉“其”的身份。补标题、父段或语境可以修复,不能凭空加入材料A未声明的条件。

late chunking 先对较长文本编码,再对已带上下文的 token 表示按块池化,要求编码器与输出接口支持。原方法 contextual retrieval 为每块生成全文位置和语境描述,再嵌入或建词法索引;这增加索引时模型工作,也可能产生错误前缀。方法说明

small-to-big 用较小单元匹配,命中后扩展父段或邻近内容,解耦检索粒度与回答语境。扩展需要映射、去重和预算;父文档更大也可能引入噪声。几种策略可组合,选择应测实际证据覆盖。

表示和索引各有自己的误差

双塔独立编码查询与文档,可预计算文档向量,在线用内积等相似度匹配。对比学习可使正例更接近负例,但它不强制所有模型只能采用双塔。稠密单向量压缩可能混淆型号和细节;词法、学习稀疏或多向量表示保留不同信号。

Matryoshka 训练在多个前缀维度施加目标,支持按训练范围截断,截断仍需重新验证。任意嵌入模型砍维度不具有相同保证。更换模型、维度、归一化或相似度规则通常需要重建或迁移索引,旧向量与新查询不能默认同空间。

ANN 用近似搜索减少访问,可能漏掉精确近邻;精确近邻又不一定是任务相关证据。索引召回与任务证据召回应分开测量。HNSW 用图导航、IVF 先选簇、PQ 压缩表示,它们会以不同方式改变访问量与距离误差;完整机制在 近似索引与过滤 维护。RAG 需要记录实际过滤、索引参数和候选覆盖,而不是只看向量维度。

表示训练会影响相似度含义:查询和文档可独立编码,正负例训练使相关材料更容易匹配;难负例和假负例又可能改变细节区分。双塔、训练目标、嵌套维度与多向量表示的完整机制在 神经检索表示 维护。回答管线需要验证表示在当前语料上是否找到正确证据。

例如查询“X100 的保修期”,两份文档分别写 X100 与 X100 Pro。语义接近可能让错误型号居前;精确型号词项、元数据过滤和重排都可以补充,但必须保存产品身份。这里的任务需要型号正确的证据,即使某段确实是向量空间的最近邻,也要经过身份判断。

更新、删除与权限

变更文档先形成新版本表示,再按系统一致性要求切换索引和原文映射。删除必须覆盖倒排、向量、缓存、图关系和派生摘要。后台异步更新需要记录可见版本,不能将收到变更事件写成已全面生效。

权限应进入取得、候选、扩展、重排和输出链。只在最后去掉一条引用,无法撤回模型已看到的敏感正文。缓存按主体/授权范围隔离,权限变化后失效。来源的真实性与当前性也需核查;权限正确的旧文档仍可能给出错误答案。

最后更新于

本页目录