提示注入防御常在几十到几百 token 的测试上取得漂亮结果,可真实产品会让模型读取整篇论文、完整简历、代码差异与长邮件线程。LongPIBench 的核心问题是:当不可信文档增长到数千甚至数万 token,短输入上有效的防御还能成立吗?
研究构造四类决策型场景:论文评审、简历筛选、代码审查和邮件总结。每类同时包含合成数据与真实数据,并设置与业务后果一致的攻击目标,例如抬高论文评分、让不合格候选人入围、诱导批准问题代码,或在邮件摘要中加入攻击者控制的链接。
#长文档不是普通提示的放大版
在短上下文中,系统指令、分隔符或检测器产生的安全信号占输入较大比例。文档增长后,恶意指令只占极小片段,模型还需要跨大量内容完成真实任务。安全策略可能被位置、注意力分布和复杂推理共同削弱。
LongPIBench 为每个场景生成 100 个合成样本,并加入真实论文、简历、代码与邮件数据。研究测试六种启发式攻击、两种优化攻击、八个模型,以及检测型和预防型防御。主指标是攻击成功率,同时用无攻击条件估计模型自然产生目标行为的基线。
#简单攻击已经足够有效
常见攻击包括直接要求忽略前文、伪造对话完成、改变上下文边界,以及多种策略组合。研究还加入“权威冒充”:恶意文本声称来自会议主席、招聘经理、资深工程师或 IT 管理员,以组织权威要求模型执行攻击目标。
在无防御条件下,多种简单攻击的成功率经常接近 100%。权威冒充平均在 GPT-5.6 上达到 0.61,在 Qwen3.5-9B 上达到 0.98;对应的无攻击基线只有 0.08 和 0.10。它在真实数据上同样保持高成功率,并在多个场景超过单纯“忽略之前指令”。
优化型攻击通常更强。在邮件总结和代码审查等启发式攻击只获得中等成功率的任务上,优化攻击最多还能提高约 40 个百分点。一个触发串也可以迁移到多个样本,说明风险不局限于逐文档定制。
#防御随上下文变长而退化
研究控制论文、系统提示、攻击和模型不变,只增加无害论文内容:从摘要,到摘要加两个章节,再到全文。PromptLocate 的攻击成功率从 0.13 升到 0.45,MetaSecAlign 8B 从 0.00 升到 0.78。
在合成论文评审场景中,组合攻击对 MetaSecAlign 8B 的成功率达到 100%,尽管该防御在已有短上下文基准上接近零。真实数据也出现类似现象:论文评审、邮件总结和代码审查中,多种简单提示防御仍接近完全失守。
检测器同样面对取舍。把长文档切成小段检查,可以降低漏报,却会让误报迅速增加;段落变大则反过来提高漏报。论文没有找到一个在不同切片大小上同时保持低误报和低漏报的检测方法。
#攻击位置和格式并不能提供安全保证
研究更换论文与简历模板,攻击仍保持稳定。把注入放在文档开头、中间或末尾也都可能成功;在代码审查中,从开头移动到末尾,成功率甚至由 0.53 增至 0.87。
单条恶意提示还可以同时追求三个目标。多目标成功率在论文评审为 0.90、简历筛选为 1.00、邮件总结为 0.48、代码审查为 0.65。产品不能假设攻击者只会要求一个醒目的固定字符串。
#产品防线不能只靠模型“分清指令与数据”
LongPIBench 表明,提示词分隔、重复系统指令和单一检测器不足以成为安全边界。更稳妥的架构应把不可信文档视为数据源,而不是与高权限指令等价的自然语言。
具体来说,解析、检索和决策可以分阶段执行;高风险动作由结构化策略和确定性验证器约束;文档中的任何指令都不应直接获得工具权限;评分、录用、合并与发送等结果应暴露证据来源并保留人工确认。安全测试必须使用生产中的最大文档长度、真实格式和攻击位置,而不是只跑短 prompt 套件。
论文也有明确边界。它研究的是单次推理的静态长文档,没有覆盖多步工具调用、动态执行轨迹和跨轮传播。上下文增长为何削弱防御,可能来自信号稀释与位置效应,实验还不能分离内部机制。优化攻击也只覆盖 GCG 及其通用版本。
因此,它不是 Agent 提示注入的完整答案,却推翻了一个危险假设:短上下文安全测试可以代表长上下文部署。安全能力必须在真实信息密度、真实长度与真实决策后果下重新测量。