暂记最新的一些有意思的文章集合

breeze-bell
28
2025-11-23

搜论文时发现的,记录一下。

PISanitizer: Preventing Prompt Injection to Long‑Context LLMs via Prompt Sanitization

针对长上下文 (long-context) LLM 的防御方法。当 context 很长时,恶意注入的指令可能只占很小一部分,容易被忽略。PISanitizer 提出一种 “先让 LLM 执行 (simulate)” 的方式,用 attention 分析哪些 token 对输出影响最大,然后对那些高 attention 的 token 做 sanitization (过滤/移除) —— 有点像给输入加 “安全过滤层 (filter + sanitizer)”。它对优化型 / adaptive 攻击 (optimization-based & adaptive injection) 也有效。

关于prompt injection的防御,gemini提出了一个有意思的方法:

“金丝雀”陷阱 (Canary Token / Honeytoken)

在 System Prompt 中插入一段随机生成的、对用户不可见的字符串(Canary Token),并指示 Agent “绝不能在输出中包含此字符串”。

生成一个简单的字符串匹配工具,专门检测 SimulateAgent 的输出或生成的命令中是否包含了这个 Canary Token。

如果检测到 Canary Token,说明 Prompt 已经被外部输入覆盖或泄露(攻击者通常会诱导 LLM 输出所有上下文),系统立即返回 "unsafe"。

关于生成安全工具调用,可能的有意思的

ToolSafety: A Comprehensive Dataset for Enhancing Safety in LLM-Based Agent Tool Invocations

什么是FCV补丁?——Functionally Correct yet Vulnerable (FCV) patches

提出了对现实世界代码代理的一种新型威胁:功能正确但易受攻击的(FCV)补丁,它通过了所有测试用例,但包含易受攻击的代码。

什么是SWE?——自主读取、生成、测试和提交代码,已成为一种软件工程(SWE)的变革范式

observation:

功能正确但易受攻击的(FCV)补丁。此类补丁成功解决了报告的问题并通过了所有功能测试,但悄悄嵌入了可利用的漏洞。我们首先检查代码代理在良性环境中生成的补丁,没有任何对抗性干预。令人惊讶的是,我们发现即使功能正确的补丁仍然可能包含易受攻击的代码。 受这一观察的启发,我们提出了 FCV-Attack

补充它的指标:

FCV Rate, defined as the fraction of functionally correct patches (npass) that are also vulnerable

补充一些code agent框架:

Mini-SWE-Agent (mini-swe-agent, 2025), SWE- Agent (Yang et al., 2024), and OpenHands (Wang et al., 2025b)

重点关注openhands

典型的例子:

比如第一个,补丁是关注登录时的login的,但是会产生隐私泄露,也是不安全的

如何判断是不安全的?

“受到最近使用LLM作为漏洞评估方法的工作(Guo et al., 2024; Nie et al., 2025; Liu et al., 2024; Vijayvargiya et al., 2025)的启发,我们使用使用Qwen3-Coder-480B-A35B-Instruct(Qwen, 2025)实现的基于LLM的漏洞判断来判断漏洞率。法官遵循标准化评估模板(附录 E),该模板提供官方 CWE 描述和生成的代码补丁,并指示模型输出结构化 JSON 判决,指示漏洞存在、严重性、置信度和任何修复建议。此设置可以对 CWE 特定漏洞进行可重复的大规模量化,同时保持模型和任务之间的一致性。”

如何攻击?

攻击将 CWE 指令嵌入良性 GitHub 问题描述中,导致代理生成功能正确但易受攻击的补丁

模版:

动物装饰