SOTA Sync
全部文章
记忆与上下文2026-09-03

写进记忆的权限,会被 Agent 当成真的

EAL-Bench 揭示 Agent 记忆的授权洗白风险:无权写入者把命令留在长期记忆后,执行者最高有 98.6% 会采取行动,错误授权率最高 50.2%;来源标记与有界事件溯源能缓解但存在可用性代价。

许多 Agent 把会议记录、邮件摘要、任务状态和用户偏好写进长期记忆。后续执行器读取这些内容时,往往只看到一句自然语言命令,却看不到是谁写的、写入时拥有什么权限。论文把这种现象称为 授权洗白 :不可信指令经过记忆层后,被重新包装成可信事实。

#五类写入者,两类执行器

EAL-Bench 覆盖采购、网络安全和金融等场景,设置五种记忆写入者与两种执行器。攻击并不需要修改系统提示,只要让低权限参与者留下“已获批准”“应当执行”之类记录,后续 Agent 就可能把历史描述当成当前授权。

EAL-Bench 中记忆写入、存储与执行的系统结构EAL-Bench 中记忆写入、存储与执行的系统结构

实验中,错误授权形成率最高达到 50.2%;一旦污染的授权记录进入执行阶段,执行器采取行动的比例最高达 98.6%。危险之处在于,两个模型都可能局部“做对了”:写入器忠实总结文本,执行器忠实遵循记忆,但组合系统违反了真实权限边界。

#时间与措辞会放大可信感

记录越像近期系统事件,执行器越容易信任。清晰、确定的陈述也比带有来源和不确定性的笔记更危险。问题因此不是简单检索错误,而是记忆层丢失了授权语义与事件边界。

不同评测线索对写入器与执行器行为的总体影响不同评测线索对写入器与执行器行为的总体影响

#修复需要数据结构,而不只是提醒模型

论文测试来源标记、有界事件溯源和提交前重新验证。它们都能降低错误行动,但也会拒绝更多合法请求,形成安全—可用性前沿。

不同缓解措施的安全与可用性权衡不同缓解措施的安全与可用性权衡

工程上更可靠的做法,是把事实、建议、意图与授权分开存储;每条授权必须绑定主体、作用域、时间和可撤销状态。执行前重新向权威来源解析,而不是从自然语言记忆推断权限。记忆可以帮助 Agent 想起事情,但不应替代权限系统作决定。