知行札记
专题AI 模型与系统模型交互、上下文与输出约束

长上下文与内容治理

解释窗口预算、位置效应、摘要、编辑、记忆与输入来源隔离。

窗口容量与有效使用能力

上下文窗口限制一次调用可处理的位置数量,输入、生成、推理和工具描述的计数规则由接口确定。填得下只说明容量允许;模型能否找出证据、整合分散信息、保持约束,需要任务评价。

长上下文的效果受内容位置、干扰数量、文本相似度与任务复杂度影响。Lost in the Middle 在具体多文档问答和模型中发现明显位置差异;新模型的字面“找针”结果不能代替关联推理、否定条件和多来源综合。原研究、NoLiMa

结构标签与任务就近呈现能帮助识别用途,最优位置和格式需要在目标模型上比较。重要规则临近执行时回顾,可以防止遗漏,也增加重复 token;不要把一个历史模型的百分比改善当成普遍排版收益。

建立输入预算

先预留输出和推理需求,再分配任务、固定约束、工具定义、当前证据和历史。计数尽量使用对应分词器或服务估计,图片与音频也需计入接口实际口径。超限时明确移除了什么,不能静默截掉最早的用户约束。

持续循环若每轮增加固定长度 aa、初始输入为 bb,完整重传 nn 轮的输入量为 nb+an(n−1)/2nb+a n(n-1)/2。没有裁剪时累计 token 可二次增长;前缀缓存可能降低价格或计算,仍不删除逻辑长度。不同接口的会话状态、缓存和计费需要分别确认。

压缩需要保留回查入口

滚动摘要把旧历史换成较短文本,模型可能遗漏条件、合并身份或写入错误。再次摘要可能累积失真,但不存在所有任务固定“指数丢失”的关系。保留原材料与可定位身份,重要数字、否定、授权、已执行效果和未决项单独核对。

清除旧工具结果适用于可再取得的大载荷。原始结果已经失效或无法重跑时,需要先保留结论成立所需证据。token 筛选、潜表示压缩和结构化提取各有任务边界;更高压缩率不能单独证明信息有效。

构造例子:原记录“仅允许改 A,B 只读”,摘要变成“允许改配置”。后续计划就可能扩大范围。结构化保留对象 A/B、权限与来源,会使差异可审查;其正确性仍要由宿主规则或原文核对。

记忆、证据与事实来源

记忆是可以跨轮或跨会话重新取出的信息,可能存用户偏好、任务事实、事件或处理策略。它需要来源、作用对象、时点、有效条件和冲突处理。新工具观察与旧记忆冲突时,不能按检索排名直接决定真伪。

跨用户隔离、最少保存、删除和版本恢复属于应用设计。外部资料和工具结果不能自行改变用户授权。记忆写入错误会被重复检出,形成持续污染;“另一个模型确认”只能提供额外概率判断,无法自动成为真实来源。

按信息用途治理

当前任务与约束优先保持准确,历史过程可按需要摘要,证据按问题检索,大型原文保留来源并选取相关段落。摘要、检索与长输入可以组合。治理方案要测实际遗漏、引用、约束遵循、延迟和成本,避免只优化 token 数。

最后更新于

本页目录