许多 Agent 把会议记录、邮件摘要、任务状态和用户偏好写进长期记忆。后续执行器读取这些内容时,往往只看到一句自然语言命令,却看不到是谁写的、写入时拥有什么权限。论文把这种现象称为 授权洗白 :不可信指令经过记忆层后,被重新包装成可信事实。
#五类写入者,两类执行器
EAL-Bench 覆盖采购、网络安全和金融等场景,设置五种记忆写入者与两种执行器。攻击并不需要修改系统提示,只要让低权限参与者留下“已获批准”“应当执行”之类记录,后续 Agent 就可能把历史描述当成当前授权。
实验中,错误授权形成率最高达到 50.2%;一旦污染的授权记录进入执行阶段,执行器采取行动的比例最高达 98.6%。危险之处在于,两个模型都可能局部“做对了”:写入器忠实总结文本,执行器忠实遵循记忆,但组合系统违反了真实权限边界。
#时间与措辞会放大可信感
记录越像近期系统事件,执行器越容易信任。清晰、确定的陈述也比带有来源和不确定性的笔记更危险。问题因此不是简单检索错误,而是记忆层丢失了授权语义与事件边界。
#修复需要数据结构,而不只是提醒模型
论文测试来源标记、有界事件溯源和提交前重新验证。它们都能降低错误行动,但也会拒绝更多合法请求,形成安全—可用性前沿。
工程上更可靠的做法,是把事实、建议、意图与授权分开存储;每条授权必须绑定主体、作用域、时间和可撤销状态。执行前重新向权威来源解析,而不是从自然语言记忆推断权限。记忆可以帮助 Agent 想起事情,但不应替代权限系统作决定。


