安全测量与红队
按攻击者可控面、任务效用和实际权限效果评价防御。
威胁模型先于攻击清单
说明攻击者能控制用户输入、网页、文件、检索文档、工具描述、工具结果或记忆,能重复尝试多少次,目标是错误内容、越权行动或泄漏。攻击目标与可控面改变后,原防御结果不能直接移用。
直接越狱通常试图改变模型的受限行为,间接提示注入通过资料通道影响任务。用户也可能没有真实对象权限,不能将直接输入统一视为可信。模型被诱导输出与外部效果发生是不同阶段。
同时测攻击成功与任务效用
全拒绝可以压低攻击成功,同时让正常任务失效。AgentDojo 在环境中结合良性任务与间接注入,使效用与攻击目标可共同观察。AgentDojo
评测记录攻击成功定义、正常基线、尝试预算、攻击者反馈、任务完成和无授权效果。拒绝率不能代替安全,错误地拒绝正常查询与放行风险动作需要分别统计。编码、多语言、分阶段和工具供应链输入等类别扩大覆盖,不代表已经穷尽。
模型行为与执行防御
拒绝方向干预研究在特定模型中显示安全行为可被中间表示改变;不能推出所有模型只有一条通用方向,或安全对齐仅是一块可删除区域。拒绝方向研究
输入/输出分类器、层级训练、资料标签、工具最少权限、沙箱与审批各处理不同层。分类器可能误报和漏报,提示加固不能直接限制实际能力,输出检查也可能发生在工具副作用之后。执行授权要在副作用发生前,以实际主体、目标和已批准范围判断。
工具权限可以给特定效果硬边界,例如受限身份无法写入不允许表,仍需核查系统确实强制。一个网关中间层、工具描述或“只读”标志都不能自动保证效果。性能、误拒绝、可审计和残余攻击面需随防御报告。
Constitutional Classifiers 把内容原则用于构造合成的允许与禁止样本,再训练输入和输出分类器。它与训练模型行为的 Constitutional AI 在部署位置上不同:分类器位于请求或结果路径,可以独立更换;重新适配规则仍需数据、训练与评测。输入分类器看不到后续所有效果,输出分类器可能在动作已经执行后才工作,所以工具权限需要单独实施。
Anthropic 在 2025 年报告的特定 Claude 3.5 Sonnet 自动评测中,10,000 个合成攻击的成功率从无分类器的 86% 降到 4.4%,额外计算成本为 23.7%;在 5,000 段正常对话样本上,拒绝率增加 0.38%,其差异未达统计显著。后续公开演示仍发现通用越狱。这些数字支持该实验条件下的防御收益和代价,不能作为其他模型或自适应攻击的保证。官方研究与演示更新
拒绝特征与有害知识表示也需要分别分析。表示干预让模型更愿意回答,不必然创造或删除完成任务的能力;稀疏自编码器等解释工具尝试分解相关特征,因果结论仍需干预实验和任务覆盖。防御评测因此同时保留能力、拒绝行为与实际授权效果三个维度。
红队与持续回归
固定基准如 HarmBench 帮助比较特定有害行为、攻击和判定器,自适应攻击允许根据防御反馈调整策略。HarmBench 两者都需要任务、攻击预算和评分版本,不因使用某个名字就成为完整安全认证。
人工探索可以发现自动生成器盲点,自动回归扩大已知类别覆盖。新失败先定位输入到执行链,修复后保存最小触发条件及正常对照。记录未成功的攻击与取得范围,“本次未攻破”限定于所测对象和预算。
长期记忆和跨工具通信需要额外测污染传播与恢复。外部效果测试必须使用隔离环境与对应授权,本文提供方法与来源,没有执行攻击或真实账户操作。
最后更新于