引用、评价与方案选择
把证据覆盖、忠实度、事实准确和更新成本连接起来。
引用需要连接到声明
回答中的每个重要事实要能对应支持它的来源片段,引用身份、版本、位置和读取范围。来源包含某词不等于支持整句话;多来源共同支撑的关系需要交代推导。引用来自模型自行编写时,先检查来源存在及内容,不能仅因格式正确就公开。
忠实度衡量声明是否被给定语境支持,事实准确衡量它在声明条件下是否为真。旧版或错误资料可以支持一个高忠实却错误的回答。冲突材料应说明对象与时点差别,缺证据时返回未知或继续查询。
分层诊断
检索评价测真实任务所需证据的覆盖和排序,生成评价测答案正确、忠实、引用对应、完整与拒绝条件。可以用正确材料直接喂模型的 oracle-context 比較生成上限,再与真实检索结果比较,区分缺证据与不会用证据。
context precision/recall 有多种参考与裁判实现,应记录分母和判定。ANN recall@k 与任务相关文档 recall@k 也不同。将回答拆成原子声明再判断支持比例,是一种忠实度方法;原子化和蕴含裁判都会产生测量误差。RAGAS
构造诊断:十条问题中四条漏关键资料,另外两条资料齐全但引用错。只给一个“六成正确”无法定位缺陷。保留每题问题、所需证据、候选、语境、声明与原因,才能分别修解析、检索、上下文和生成。构造数量用于说明诊断,未代表实测。
长上下文、检索与适配
长上下文直接提供较多材料,省去部分索引设施,仍需选取权限范围、处理干扰、引用和更新。RAG 预计算资料并按问题取得部分语境,降低重复输入,但增加索引维护和漏证据风险。参数适配改变模型行为与表示,需要训练和保留能力验证,也不能自动给出事实来源。
小语料、低流量且长输入效果可靠时,直接上下文可能简单。大规模、频繁更新或明确检索任务可能需要 RAG。稳定重复的任务行为可能值得适配。三者可组合,固定“每月更新”或“数十万 token”的阈值无法替代实际费用、质量和约束。
某项长上下文与 RAG 比较的平均优势依模型、数据、路由和预算。按 query 自适应路由也有分类成本和误判。比较研究 应用于目标系统时要建立本地基线,不把论文平均值当作普遍选择。
总成本和维护
总账含解析、嵌入、索引/图、重排、模型输入输出、更新、存储、评价和运维。缓存、查询复用、更新频率和调用量改变摊销。成本低于替代方案,需要统一质量与服务目标后计算。
回归样本覆盖版本冲突、无答案、错前提、跨权限、精确身份、多跳、全局与数值任务。源变更后同时检查索引可见性与回答,而不仅确认更新任务完成。未在当前模型和数据上执行的收益,保持为设计假设。
最后更新于