知行札记
专题AI 模型与系统智能体执行与工具协作

记忆与多智能体协作

解释记忆写入、上下文隔离、委派、交接和证据整合的责任。

记忆的用途和风险

任务状态记录待办、已执行、回执和未决项;短期上下文提供当前决策信息;长期记忆保存可复用事实、偏好或策略。物理存储可以不同,必要身份和来源不能因跨层摘要丢失。检索式记忆是近似取得资料,与操作系统精确地址分页的保证不同。

显式记忆工具让模型选择写入,后台提取从轨迹总结,两者都可能写错。条目需范围、来源、时点、可信程度和失效条件。验证、版本恢复、冲突处理与用户隔离控制长期污染。仅由同类模型多数赞同的条目,证据仍可能相关。

反思资料可以帮助后续避免已知错误,没有改参数也能提高当前系统效果。它同时增加检索和上下文成本,不能称为零成本学习。是否需要参数更新,应比较任务成功、维护、调用量与容量,避免由知识标签直接决定。

从轨迹形成可复用策略

经历本身不自动成为有效记忆。一个可检查的学习循环先取得轨迹和终态,区分成功、失败与成功但低效;再定位关键决策和恢复点,提出带适用条件的策略;验证策略与原始事件的关系;最后按新任务检索,并根据后续结果更新或废弃。保存失败过程可以发现“遇到什么信号应换路径”,只保存最终答案会丢掉这类信息。

构造情境:一次任务因目标文件已移动而失败,恢复时通过稳定文件身份找到新位置。合理条目是“路径不存在时,先按身份核对当前位置”;将它写成“失败后一律扫描全部文件”会扩大开销与权限。条目应保留触发条件、适用对象、原始回执和替代原因,避免把一次偶然恢复当作所有任务的规则。

ReasoningBank 从成功和失败轨迹提炼策略,按任务检索再写回;其 MaTTS 比较同题的并行轨迹或串行改进,以增加提炼信号。该论文使用模型自判成功作为部分代理反馈,仍可能产生错误记忆,研究结果限定于其浏览与软件任务、模型和环境。ReasoningBank,2025 年第一版,第 3 节

增加尝试同时增加环境执行、总结、检索和审查成本。记忆数量增长后,需要测相关条目命中、冲突、过期和正常任务影响。攻击者写入的记录可能在未来被检索并转成行动依据,因此写入来源、租户范围和证据不能只靠语义相关性判断。

提示、记忆、工具和参数怎样改进

改进对象可以是输入提示、外部记忆、工具实现或模型参数。提示优化将某段文本视为候选策略,在任务上运行、用失败反馈提出变体,再用独立样本选择。GEPA 将轨迹反思、候选测试与互补策略组合用于这一过程;它对特定任务的结果支持这条路线的可行性,不支持所有任务都优于 RL。GEPA,2025 年研究

文本搜索没有常规参数梯度,仍要消费模型调用和评价预算。反复在同一验证集挑选提示会过拟合,底座或工具变化也会使已选策略失效。工具自改进还需要程序行为验证与隔离执行;参数更新则引入训练状态和保留能力评价。四类改进可以衔接:先将经验整理为可审计材料,再以足够覆盖的数据进行蒸馏;是否值得转换,应比较部署量、时延、维护和任务质量。

什么时候拆出多个执行者

可独立取得证据、使用不同工具或需要上下文隔离时,多个执行者可以并行。强耦合状态、频繁共享和共同修改同一对象会增加协调成本。使用同一模型的多个角色没有自动独立性,互相引用结论可能放大共同错误。

委派要说明目标、输入、可改对象、允许动作、交付内容与结束条件。编排者保持整体目标、处理依赖并核查汇总。结论、关键依据、成立条件和未完成项需一起返回;只回摘要会使关键事实难以复查。

调用、图编排与交接

子任务调用在逻辑上接收结果后回到主流程,显式图把节点、边、共享状态与持久化写在宿主中,handoff 将活动责任或运行控制转给另一执行者。具体框架可能保存历史、过滤输入或允许重新交接;不能仅由 handoff 名称推断原参与者永远无法干预。

同一对象由谁写、成果何时可见、冲突怎样处理和失败由谁接管,应明确到实际操作。独立任务并行不等于独立文件修改安全。状态可推导时应从实际记录取得,避免多份进度账漂移。

多次尝试与裁决

若单次错误概率为 ee,相互独立的 nn 次尝试全部错误的概率为 ene^n,至少一次正确为 1−en1-e^n。找到这个正确结果还需要裁决器。共享底座、数据和提示通常增加错误相关性,公式的独立假设不能默认满足。

客观测试、直接来源和真实状态能帮助裁决,辩论或角色扮演只是新增生成。开放任务也可以从不同视角得到有用覆盖,收益应从缺陷发现和最终质量测量,避免按参与者数量推定。

构造情境:两个执行者分别读独立合同与回执,编排者核对相同材料身份,能够增加证据覆盖。两个执行者都转述同一摘要,即使结论相同,也只有一条来源链。

最后更新于

本页目录