Agent自进化相关(攻击,工具调用)

breeze-bell
52
2025-10-24

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

[2410.05295] AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

2025 ICLR spotlight

现有越狱方法存在两大局限:一是依赖人工设计的策略,劳动密集且策略范围受限;二是多使用单一策略,缺乏策略组合与自动发现能力,导致攻击成功率低和多样性不足。为此,论文提出了AutoDAN-Turbo,一种基于终身学习代理的黑盒越狱方法,能够自动从零开始发现、组合和演化越狱策略,无需人工干预或预定义策略范围。

攻击策略示意如上。AutoDAN能自己发现越狱策略(结合所谓专家言论,来使大模型产生敏感内容如耐药大肠杆菌生产过程)

(虽然有一些工作如PAIR和TAP是自动越狱的,但缺乏越狱知识的指导,此类攻击产生的越狱提示的多样性和有效性往往不能令人满意)

(其次,这些方法通常仅采用单一策略,而组合和协同不同策略以创建更强大的越狱攻击的潜力在很大程度上尚未被开发。)

Introduction部分

“AutoDAN-Turbo 可以在探索过程中自主开发新策略,并将这些策略系统地存储在有组织的结构中。这使得模型能够有效地重用已发现的策略,并根据现有策略进行演变,有可能将它们组合成更高级的方法,以进行新的攻击尝试。其次,外部策略兼容性:AutoDAN-Turbo是一个统一的框架,可以以即插即用的方式利用现有的人为设计的越狱策略。我们可以轻松地重新格式化现有/外部策略并将其放入 AutoDAN-Turbo 的策略库中。这使得 AutoDAN-Turbo 能够利用现有策略,并根据外部越狱策略和自身发现开发新的高级越狱攻击策略。”

作者在很多benchmark上面都进行了测试,我的疑惑是:这些在大模型对齐上的benchmark,可不可以用于LLM agent?或者说有什么差异?

大模型对齐不是也是在防止大模型输出有害内容么,那么它和agent safety的区别和联系是?换而言之,大模型本身,和agent到底有什么区别;或者再换而言之,大模型安全那一套是不是可以在很大程度上照搬到agent安全上

现有的越狱主要遵循两种方法。第一种是基于优化的攻击,它利用自动算法根据某些反馈(例如损失函数的梯度)生成越狱提示。 或训练生成器来模仿此类优化算法。然而,这些自动越狱攻击并没有为攻击算法提供明确的越狱知识,往往导致攻击性能较弱,并且生成的越狱提示的多样性有限。解决此问题的另一项工作是基于策略的攻击。与基于优化的方法相比,基于策略的越狱攻击不一定需要自动算法。相反,基于策略的越狱方法的核心是利用特定的越狱策略来危害LLM。例如,已知最早针对LLM的越狱攻击之一,“Do-Anything-Now (DAN)”系列,利用角色扮演策略,促使法学硕士扮演另一位没有道德约束的助手。基于策略的越狱攻击经常利用人类设计的策略作为其方法的核心。比如,PAP探索了使用 40 种人类发现的说服方案来越狱法学硕士的可能性。其他越狱策略,例如加密、基于 ASCII 的技术、长上下文、基于低资源语言的策略和隐藏表达还揭示了LLM越狱漏洞的许多有趣方面。

Methods部分

“我们的管道在整个攻击过程中只需要目标模型的文本响应,消除了对目标模型的白盒访问的需要,从而提供了实际用途。”

如上图,攻击生成和探索模块,使用三个LLM:

​​攻击者LLM​​:根据恶意请求和检索到的策略生成越狱提示。

​​目标LLM​​:作为受害模型,接收越狱提示并生成响应。

​​评分者LLM​​:根据响应与恶意目标的匹配程度打分(1-10分),分数越高表示越狱越成功。

模块支持三种模式:无策略生成、使用有效策略生成或避免无效策略生成,以动态探索新策略。(对于第一个,攻击者LLM使用其可以想象的任何策略为恶意请求生成越狱提示;对于第三个,这些会作为提示提醒攻击者LLM避免这些低分策略)

策略库构建模块:

(越狱策略定义为文本信息,添加后,评分者会打出更高的越狱分数)

该模块自动从攻击日志中提取越狱策略并构建策略库。策略定义为能提高越狱得分的文本修改方案。构建过程分为两个阶段:

​​热身探索阶段​​:初始化时,对多个恶意请求进行多次攻击迭代,收集攻击日志(提示、响应、分数)。通过比较不同迭代的分数差异,使用总结者LLM分析策略改进点,并格式化为JSON对象(包含策略名称、定义和示例)。

“对于每个恶意请求 M ,我们以空策略作为初始化重复运行攻击生成和探索模块,直到达到最大 T 次迭代或直到评分器 LLM 返回高于预定义终止分数 ST 的分数。经过这个过程,我们将收集攻击生成 P 、目标响应 R 和分数 S 作为记录。对所有恶意请求进行 T 次迭代后,我们将得到一个记录列表,称为攻击日志,其中每行由一个三元组(P,R,S)组成。根据攻击日志,我们然后根据前面的定义提取策略。”

​​终身学习阶段​​:在运行过程中持续更新策略库。每次攻击后,如果分数提升,则提取新策略并添加到库中。

策略库以键值对形式组织:键是目标响应的嵌入向量,值包含策略详情和分数差异。这种结构便于高效检索。

总结LLM:“我们从攻击日志中随机提取两条攻击记录,表示为{Pi,Ri,Si}和{Pj,Rj,Sj}。如果分数 Sj 高于 Si,我们认为与 Pi 相比,越狱提示 Pj 可能已经探索并采用了某些策略,从而导致分数提高。因此,我们把从Pi到Pj的改进算作一种策略。”所以由此引入总结器LLM,目的是分析更恶意

键值对的构造:“For key, we employ a text embedding model (Neelakantan et al., 2022; Wang et al., 2024a) to transfer the response Ri into a text embedding vector ERi and set it as the key. For value, we set attack prompt Pi, next attack prompt Pj, the score differential Sj − Si (should always be a positive number, which means if Si <= Sj). We repeatedly conduct the sampling process and run exploration with different malicious requests. We then add extracted the key and value pair into the skill library.”

越狱策略检索模块:

该模块根据当前目标响应的嵌入向量,从策略库中检索最相似的策略。检索过程包括:

计算当前响应嵌入与库中所有键的相似度。

选择相似度最高的top-k策略,并根据分数差异排序,优先选择最有效的策略。

检索到的策略列表用于指导攻击者LLM生成下一轮越狱提示。检索策略根据分数高低分为三类:直接使用、组合使用或避免使用,以优化攻击效率。(以2和5作为分界线)

确实可以即插即用:人类策略经过简单格式化即可纳入策略库

关于策略转移性:

将基于HarmBench数据集学习的策略应用于其他恶意请求数据集,策略库在不同攻击者和目标模型上均表现出强转移性,比较两种模式(离线模式和在线学习模式)……

一些思考

这应该也是agent工作的毛病:老是调用api,成本?加载多个模型的负载?

这里的策略多样性值得学习。泛化性部分也值得学习(格式化是一个重要的点,也是即插即用的基础

这里的检索策略可以作为参考

AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection

[2502.11448] AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection

从它的被引又发现了几个工作:

[2503.01908] UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning

[2509.23614] PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents

代理安全的综述:

[2510.06445] A Survey on Agentic Security: Applications, Threats and Defenses

Introduction部分

论文首先把LLM agent的安全分为两类:

​​任务特定风险:​​ 由智能体管理员根据具体任务的目标和约束明确定义的风险。例如,在医疗数据访问任务中,禁止非授权人员查看患者诊断信息。

​​系统性风险:​​ 源于智能体设计或与环境交互中的漏洞,可能危及信息的​​保密性​​、​​完整性​​和​​可用性​​。例如,智能体被恶意提示注入攻击所操纵,执行危险命令;或在操作系统环境中,一个看似正常的文件重命名操作可能意外覆盖现有文件,导致数据丢失。

(PS:论文提到了很多和LLM agent安全相关的工作,重点关注)

“Tool Compatibility & Flexibility: In addition to leveraging the internal reasoning ability for guardrail, our framework can selectively invoke customized auxiliary tools to enhance the checking process of each safety check”

感觉跟我们的大差不差?

“我们的评估包括 Mind2Web-SC 和 EICU-AC 数据集中描述的特定任务风险(Xiang 等人,2024),以及系统性风险,例如来自 AdvWeb(Xu 等人,2024)和 EIA(Liao 等人,2025)的即时注入攻击。此外,我们构建了 Safe-OS 基准,其中包含精心设计的三种攻击场景,旨在评估在线操作系统代理针对系统性风险的稳健性。为了确保全面评估,Safe-OS 还包含良性数据来评估防御对正常任务性能的影响。”

设计OS操作的代理安全benchmark——safeOS

“LLM 代理是一个自治系统,它遵循语言指令,使用可用工具执行复杂的任务”

其他关于agent safety的work

Methods部分

安全准则:这个过程确保了框架能适应各种新任务,而不需要为每个任务重新设计

AGrail不是依赖固定的规则,而是根据​​安全准则​​ 和(可选的)​​防护请求​​,为不同的智能体任务动态生成一系列“安全检查项”。

​​ 安全准则:​​ 定义了普适的安全目标,主要围绕信息的​​保密性​​、​​完整性​​ 和​​可用性​​。

​​ 防护请求:​​ 针对特定任务的手动约束。

Memory部分:

存储在memory中的信息主要包括代理动作、安全类别以及受这些安全类别限制的生成的安全检查。当检索和更新信息时,代理操作充当关键。为了增强泛化和检索准确性,我们应用了后退提示技术将代理动作转换为自然语言和工具命令语言。然后将这两个表示连接起来形成一个记忆键,用于在检索期间匹配相似的代理动作。然而,在检索相关信息后,我们仅向我们的框架呈现代理动作的自然语言形式,这是为了防止工具命令语言中的任何特定元素干扰我们框架的安全检查推理

分析器与执行器部分:

分析器:​​

​​职责:​​ 当智能体产生一个行动时,分析器会从记忆模块中检索类似行动的历史安全检查项。

​​行动:​​ 它根据当前情境对检索到的检查项进行“修订”、“合并”或“新增”,生成一个针对当前行动的、初步优化的安全检查清单。

​​执行器:​​

​​职责:​​ 负责执行分析器生成的每一项安全检查。

​​行动:​​ 对于每个检查项,执行器会判断是否需要调用外部检测工具(如检查操作系统环境)或仅依靠自身推理来完成验证。如果某项检查被判定为冗余、错误或会阻碍合法行动,执行器会将其删除。

Experiment部分

“For model-based defenses, we configure advanced LLMs, such as GPT-4o, with a customized CoT prompt (Xiang et al., 2024) under zero-shot and one-shot settings.” 定制COT提示有点意思

同样的也有Domain Transferability

补充:EIA 攻击指的是攻击者通过利用系统授权机制中的漏洞,绕过原本设定的权限或安全策略,从而执行未经授权的操作或访问敏感信息。这种攻击并不一定依赖于模型本身的漏洞,而是利用系统层面(如 API、插件、工具调用链)对权限控制的不严谨。

例子:假设一个 AI 助手被授权可以调用某个工具来读取用户文件,但系统没有严格校验“只能读取当前用户文件”。攻击者可能通过构造提示词(prompt),诱导模型去读取其他用户的敏感文件,这就是一次典型的 EIA 攻击

一些思考

确实,他自己也提到了limitation:AGrail的“分析器”和“执行器”使用的是通用LLM,即使加了记忆库那些,其实本质上还是在利用LLM的预训练的安全知识,并非从防守中优化,换而言之还不是像GAN那种,所以可以研究如何训练专门的guard模型?

“​​强化学习:​​ 将安全决策过程建模为一个序列决策问题。模型(守卫智能体)根据其行动(如通过、阻止、调用工具)的结果(是否成功拦截攻击、是否误判合法操作)获得奖励,从而学习最优的安全策略。

​​专门数据集训练:​​ 构建大规模、高质量的智能体风险检测数据集(类似论文中提出的Safe-OS,但规模更大、场景更丰富),并用于对中等规模的基础模型(如Llama)进行监督微调,使其专门擅长理解智能体行动、环境上下文和潜在风险。”

记忆部分:知识图谱?

当处理一个智能体行动时,框架可以从中提取实体和关系,并与知识图谱进行匹配,从而激活相关的风险子图,而不仅仅是字面相似的检查项。

换而言之,赋予agent推理,联想的安全泛化能力

其他:

红队对抗基准:​​ 不局限于静态的测试用例,而是构建一个​​自适应攻击者​​环境。攻击者会观察守卫的行为并调整攻击策略,以此测试守卫框架的​​鲁棒性​​和​​抗规避能力​​。这能更真实地模拟现实世界的攻防。

分层守卫系统:​​ 设计一个分层的系统。第一层使用快速、轻量的规则或小模型过滤掉绝大多数明显安全或危险的操作。只有不确定的复杂案例才交给第二层(完整的AGrail框架)进行深度分析。这可以在保证安全性的同时显著提升效率。

SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator

[2505.17735] SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator (arxiv.org)

针对LLM-based agents在现实部署中面临的安全风险,提出了一个名为AutoSafe的自动化框架,通过威胁建模、数据生成和训练增强来系统性提升agent的安全性。传统LLM的安全对齐方法(如RLHF)无法有效处理agents在动态环境中因多轮交互、工具使用和用户指令复杂性而引发的多样风险。

核心:“通过全自动合成数据生成系统地增强代理安全性的框架。具体来说,1)我们引入了一种开放且可扩展的威胁模型 OTS,它正式化了不安全行为如何从用户指令、交互上下文和代理操作的相互作用中出现。这使得能够对不同场景的安全风险进行精确建模。 2)我们开发了一个完全自动化的数据生成管道,可以模拟不安全的用户行为,应用自我反思推理来生成安全响应,并构建大规模、多样化和高质量的安全训练数据集,从而消除对危险的现实世界数据收集的需求”

Introduction部分

风险分为两部分:

(1)用户。即使是良性用户也可能提供模糊的指令,例如“请帮我清理系统”,这可能导致代理执行诸如 sudo rm -rf /* 之类的危险操作,从而导致数据丢失。(2)环境。代理在复杂的环境中容易遇到恶意内容,例如网站上的钓鱼链接。

他们的contribution其中有数据集可以作为参考:“A diverse safety dataset. This dataset contains over 600 risk scenarios and corresponding safe actions, serving as a benchmark for future research.”

他们的统一威胁模型OTS:three key components: risk outcome O, trigger T , and risk scenario S.(S refers to unsafe instruction-trajectory pairs that lead to unsafe actions Tt)

“将增强基于 LLM 的代理的安全性的过程构建为给定风险场景 St 内 LLM 策略 πθ 的优化问题”

Methods部分

整个安全增强框架:(1) Risk Scenario Generation (Section 3.1), (2) Safety Action Sampling (Section 3.2), and (3) Self-Reflective Training (Section 3.3), which collectively fine-tune the LLM for improved safety.

模拟风险场景里用户指令的生成环节:

目的是为了解决真实风险数据稀缺的问题。该方法旨在​​自动合成一个包含潜在风险的用户指令数据集,这些指令将作为后续步骤的输入,用于模拟风险场景。

输入包括可用工具集 F(例如:终端、文件管理器、数据库查询工具等)和预定义的风险结果集 O(例如:数据丢失、隐私泄露、财务损失等)。

为了模拟更复杂的任务,使用工具组的思想,每个组合包含一个主工具包和其他可选的辅助工具。对于每个工具组,关联其不当使用可能导致的一种或多种风险结果,这个工具组-风险对即代表一个风险场景。

然后让LLM作为生成器,对于每个工具组-风险对,将其填充到一个提示词模板中,让LLM生成基于此生成一条具体的用户指令(重复多次增强丰富性)。

接着是安全动作采样:

有一个评估器LLM和反射器LLM,当agent的动作被评估器判定为不安全后,反射器会思考可能的原因,生成改进建议。agent根据反思修改动作,重新评估,直到动作被判定为安全或达到最大迭代次数。安全动作被记录为数据集。

最后是自我反思训练:

通过前面提到的数据集微调大模型,使用的是负对数似然损失(监督微调)

贴一个感觉还有点好看的表格:

一些结论:

“Our dataset exposes the lack of safety in existing models.”

Evaluation on real-world cases+Evaluation on unseen risk cases肯定

LLM代理安全保障。现有的代理安全研究[13,25,32,29,16,37]主要解决风险识别和评估,对保护的关注有限。一些作品 [19] 设计简单的监视器来阻止不安全行为,其他作品 [13] 和 [29] 引入宪法或安全代理来增强可靠性。然而,这些方法往往过于简单或过于专业,限制了它们在动态环境中的适应性。我们的目标是自动化并增强基于法学硕士的代理安全性,以应对各种风险。

LLM代理人安全评估。 LLM 安全长期以来一直是一个中心研究主题 [7,28,34,15,27],RLHF [4] 和 DPO [20] 等对齐技术可以有效减少有害输出。然而,代理通过使用工具和与环境交互而超越了 LLM,使它们更容易受到来自恶意提示、对抗条件或损坏内存的复杂风险 [21,26,19,31,38,32]。评估[21,36,38,8,2]表明,即使是高级法学硕士也常常无法认识到此类风险,从而导致严重的安全问题。

一些思考

这可以作为对比算法,自我反思推理这部分可以学一下。这个代码可以看一下,数据集看能不能用

确实是不错的文章,可以作为强参考,prompt那些都可以

此外,在提示中添加安全要求可以有效提高代理的安全分数。这种简单且可推广的方法可作为强有力的基线

可能的改进点:第一个是最后只是简单的监督微调,本质上是在模仿已知的安全行为,其泛化能力可能弱于基于人类反馈的强化学习等更先进的对齐算法——比如将它生成的风险场景和安全响应作为​​安全种子数据​​,然后与PPO等算法结合,训练一个更鲁棒的安全奖励模型。

第二个是训练时一次性的,所以开发一个lifelong learning的框架或许更为适合。

第三个还是那个主要问题,他们的评估器都是LLM,用的其实都是LLM先验的安全知识,其判断可能存在错误或偏差,形成“盲人领盲人”的局面。或者message是单方面的反馈,始终没办法达到像GAN那样优美

让评估器输出其判断的置信度,并对低置信度案例进行标记,交由更可靠的模型(如多模型投票)或人工复核,构建一个分层的、更可靠的评估体系?

OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

[2502.11271] OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

OctoTools:一个agent工具调用和生成的范式,引入了标准化工具卡来封装工具功能、用于高层和低层规划的规划器以及执行工具使用的执行器,其他相关范式有LangChain还有AutoGen

现有的工具调用数据集:“We validate OctoTools’ generality across 16 diverse tasks (including MathVista, MMLU-Pro, MedQA, and GAIA-Text)”

Introduction部分

OctoTools 有效地结合了多步骤规划和专业工具的使用,每个维度都提供了明显的改进。对于需要复杂计算或专业知识的任务,我们发现使用工具特别有用;对于需要推理分解的任务,我们发现多步骤规划可以带来显着的收益

补充:

“more recent research has explored prompting techniques for step-by-step reasoning, including Chain-ofThought (Wei et al., 2022), Least-to-Most (Zhou et al., 2022), ReAct (Yao et al., 2022), Pearl (Sun et al., 2023), Forest-of-Thought (Bi et al., 2024), and rStar-Math(Guan et al., 2025).”

Methods部分

工具卡片在左边(注意它定义了可能的limitation),任何新工具都可以通过这种标准化格式进行封装和集成,可见这确实是一种范式

然后有查询分析器,生成子目标,然后选择适合的工具。命令生成器根据选定的工具和其输入要求,生成可执行的命令字符串。然后执行器负责执行和反馈。

详细的框架例子可以见知乎通俗的说明:OctoTools:解锁复杂推理的多工具智能框架 - 知乎

注意:

“代理系统中的另一个挑战是确定为给定域启用哪些工具子集。尽管提供许多工具可能是有益的,但启用它们可能会引入噪音或降低性能(Lumer,2024;Fore 等人,2024;Paramaayakam 等人,2024)。为了解决这个问题,我们提出了一种轻量级工具集优化算法,该算法根据验证性能为每个任务识别更有用的工具子集,最终提高准确性和效率。”

工具卡部分:“为了确保一致的交互,每个工具卡都实现两个标准功能。

execute()封装了该工具的主要功能,例如生成代码片段或执行对象检测。执行结果以结构化格式存储,以支持不同的输出类型;

get metadata() allows the planner and executor to dynamically evaluate the tool’s capabilities and understand usage constraints.”

给定一个查询 q,规划器根据其初始化制定一个高级的、暂定的工具使用计划。

上下文验证器!上下文验证器检查在给定当前上下文的情况下是否可以解决问题。它验证完整性(例如,是否满足所有子目标)并识别任何歧义。如果问题仍然不完整,规划器将通过预测下一个操作来继续循环的下一个迭代。

Once the verifier concludes that the query has been solved, a separate solution summarizer compiles the final answer from the trajectory (s0, s1, . . . , sT ). This stage integrates intermediate tool outputs, traces reasoning steps, and presents a concise, user-friendly summary as the final solution

OctoTools与其他三种主流框架在16个任务上的平局工具使用分布。OctoTools的工具使用​​分布最均衡、最多样化​​。这意味着它能根据任务需求,灵活调用各种不同类型的工具(如图像描述、网络搜索、代码执行等),没有过度依赖某一个特定工具。

右边图片详细展示了OctoTools在处理​​16个具体任务​​时,是如何“因地制宜”地选择工具的。

工具的使用分布​​高度契合每个任务的内在需求​​,完美体现了框架的​​任务自适应性​​。比如​​Omni-MATH(数学问题)​​:该任务条中代表Python_Code_Generator(Python代码生成器)的橙色段非常突出。

论文还有一个比较重要的点是Task-specific Toolset Optimization(工具的贪婪选择策略):

任务特定工具集优化算法旨在自动为不同任务筛选最有效的工具子集,以提升性能并减少无关工具带来的噪声。该算法首先建立一个基线,通过评估仅使用基础工具集(如通用解决方案生成器)在验证集上的准确率作为基准。随后,算法进入核心评估阶段,逐个测试工具库中每个工具与基础工具集结合时的性能增益;若某个工具能带来正增益,则将其标记为有益工具。

在完成所有工具评估后,算法进入最终选择阶段,将所有有益工具与基础工具集合并,形成优化后的工具集。这种贪婪筛选策略确保了工具集的精简性和针对性,如在数学任务中优先选择代码生成器,而在视觉任务中侧重图像处理工具。

一些思考

首先是工具卡,可以使用这一范式;其次是多步骤规划;然后是工具集优化这一思想的引入(目的是为了防止其他无关工具可能带来的噪音),最后关于工具调用情况的分析也是很好的参考,可以看下工具是否有用等

UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning

[2503.01908] UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning

“操纵 LLM 代理执行有针对性的恶意操作或调用特定工具仍然具有挑战性,因为这些代理在执行最终操作之前会进行广泛的推理或计划。在这项工作中,我们提出了 UDora,这是一个专为 LLM 代理设计的统一红队框架,可以动态劫持代理的推理过程以强制恶意行为。”

“UDora 首先为给定任务生成模型的推理轨迹,然后自动识别该轨迹中的最佳点以插入目标扰动。然后将产生的扰动推理用作优化的替代响应。通过迭代应用此过程,LLM 代理将被诱导执行指定的恶意操作或调用特定的恶意工具。”

回溯是否可以解决?这种攻击将不再局限于prompt设计,这是一种前沿的攻击方式,针对的是agent的推理过程

——所以一个可能的方向是:鲁棒的agent推理

正向cot,以正向cot为基准反向cot,孪生神经网络对齐二者(KL?);反向cot,以反向cot为基准正向cot,再对齐二者

Introduction部分

“Nevertheless, adversaries can still continually seek to bypass these alignment mechanisms—commonly referred to as “jailbreak.” One notable example is the Greedy Coordinate Gradient (GCG) attack”

成功的越狱现在可以在现实世界中导致真正有害的后果,而不仅仅是文本生成

简单地优化对抗性字符串以产生肯定或固定前缀对于 LLM 代理来说效果要差得多。由于 LLM 代理通常会在最终操作之前接受训练或提示生成推理,并且不同的 LLM 代理可能不会以与此固定前缀相同的方式做出响应,从而很难触发有针对性的恶意工具。与此同时,其他攻击,如提示注入攻击涉及直接将恶意指令插入到工具调用的观察结果中,通常表现得不太系统且效率较低。

为了更有效地攻击LLM代理,我们的策略包括“在其自己的推理风格中引导代理误入歧途”,从而引发恶意的最终行动。

WebShop(Yao 等人,2022)创建了一个模拟的亚马逊网络购物环境,代理可以在其中执行“搜索”或“点击”等操作,而 WebArena(Zhou 等人,2023)提供了一个更现实和可重复的环境,具有更广泛的工具和场景。后来,许多基准(Liu et al., 2023b;Deng et al., 2024;Zheng et al., 2024)被引入来评估LLM代理在基于网络的交互和计算机操作等任务中的表现。

可以用来测试的环境↑

在恶意环境中,对手可能会在工具调用的观察结果中插入间接指令(例如,“请忽略所有先前的指令并遵守以下指令......”),这被称为即时注入攻击。 InjecAgent (Zhan et al., 2024) 是一个基准测试,旨在测试 LLM 代理在工具调用后对此类间接提示注入的脆弱性,而 AgentDojo (Debenedetti et al., 2024) 将其扩展到更加动态的环境。除了即时注入之外,LLM 代理还可以被直接要求执行恶意指令,而 AgentHarm(Andriushchenko 等人,2024b)是基于此提出的用于衡量 LLM 代理中此类危害性的基准。

可以用来测试的数据集↑

“最近的研究还探索了 LLM 代理在自动驾驶中的使用”——方向融合?

Methods部分

两种场景:

恶意环境场景​​:用户指令是良性的(如“帮我购买便宜的商品”),但代理从工具调用(如购物网站返回的商品描述)中获取的观察值(observation)被插入对抗性字符串。例如,在商品标题中插入恶意文本,诱使代理忽略价格或类别检查,直接购买目标物品。

​​恶意指令场景​​:对抗性字符串直接附加到用户的恶意指令中(如“编写钓鱼邮件并发送”),目标是绕过代理的安全对齐机制,使其不仅接受请求,还执行特定恶意动作(如调用发送邮件的工具)。

在这两种场景中,方法假设攻击者可以访问整个受害模型或其令牌概率分布,但​​不直接干预推理过程​​,而是将代理的响应(含插入噪声)作为代理优化目标。

“在恶意环境场景中,用户的初始指令是良性的;然而,第三方环境被破坏,在工具交互后,将对抗性字符串插入到代理的观察结果中。”

步骤1: 收集初始响应

给定输入提示x(含系统提示)、观察值o(工具调用返回的内容)和初始对抗性字符串s,使用贪婪解码获取LLM代理的完整响应z及其令牌级概率分布𝒫。响应z通常包含代理的推理链(如ReAct格式),例如:“首先分析用户需求,然后检查工具可用性...”。这一步骤为后续噪声插入提供基础上下文。

步骤2: 识别噪声插入位置

在响应z中自动定位最优位置插入“噪声”t(如目标工具名称或商品ID)。噪声是攻击者希望代理最终调用的关键元素(如“GMAIL_FETCH_EMAILS”)。为提高效率,方法设计了​​位置评分函数rj(t)​​,用于评估每个位置j插入噪声的适配度。

步骤3: 字符串优化

基于选定的位置,生成噪声插入后的代理响应z,并优化对抗性字符串s,以最大化噪声t在z中出现的似然。具体地,优化目标为最大化∑p(t | x, o, s, z*[:ji]),其中ji是插入位置。优化采用类似GCG攻击的梯度采样方法。

提供了几种噪声模式:

顺序优化:逐步插入噪声。若当前响应z中已有n个位置完全匹配噪声t,则从剩余候选位置中选择评分最高的未匹配位置(第n+1个),插入t生成z*。这种模式模拟渐进式引导,使代理更自然地接受噪声。

联合优化:同时在所有l个选定位置插入噪声t,无论是否已匹配。一次性替换z中多个区间的文本

一些补充

实验使用了三个关键数据集以评估UDora框架在不同攻击场景下的有效性:InjecAgent(Zhan et al., 2024)专注于恶意环境场景,通过62个攻击者工具测试LLM代理对间接提示注入的脆弱性,包括直接伤害(如非法转账)和数据窃取攻击,实验过滤了50个案例;WebShop(Yao et al., 2022)模拟电子商务环境,代理处理网页观察并执行搜索/点击动作,涵盖时尚、美妆等五个类别,通过替换物品构建了价格、属性、类别及全部不匹配的60个恶意观察案例;AgentHarm(Andriushchenko et al., 2024b)针对恶意指令场景,包含110个独特行为(如欺诈、网络犯罪) across 11个伤害类别,使用44个有害提示增强为176个案例,以衡量代理执行目标工具调用的能力。这些数据集共同覆盖了购物、金融和通用代理操作,确保了评估的全面性。

一些思考

方法的limitation部分:

一种实用的策略是限制对代理内部推理的访问,例如仅提供推理步骤的精简或经过净化的摘要(如 OpenAI 的 o1 推理模型)。这降低了攻击者针对噪声插入的推理痕迹的能力。另一个方向是使用LLM代理的护栏框架,它监视和阻止推理过程中的不安全或异常行为。对抗性训练还可以通过在训练期间将模型暴露于对抗性生成的示例来增强鲁棒性,尽管这可能会在泛化性或实用性方面进行权衡。此外,检测机制(例如使用单独的 LLM 来验证代理的推理是否与原始指令或环境一致)可以帮助标记对抗性操作。

Building Embodied EvoAgent : A Brain-inspired Paradigm for Bridging Multimodal Large Models and World Models: Supplementary Materials

Building Embodied EvoAgent: A Brain-inspired Paradigm for Bridging Multimodal Large Models and World Models (feliciaxyao.github.io)

“方法设计了一个体现上下文增强的MLLM来模拟左半球的语言处理和逻辑分析能力,负责理解指令和视觉场景。同时,基于循环状态空间模型构建感知情境引导的世界模型,模拟右半球的空间感知和整体思维功能,捕捉环境动态并预测未来状态。通过模拟胼胝体的通信功能,我们提出了动态通信槽,用于 MLLM 和世界模型之间的有效信息交换,这也允许代理快速适应动态环境,而不需要大量的计算资源。”

多模态大语言模型(MLLM)在推进具身智能方面发挥着关键作用 ——确实如此!

Introduction部分

多模态大模型(MLLMs)擅长多模态感知和推理,但缺乏对空间环境的深层理解能力,无法进行动态行为规划和状态预测。此外,MLLMs参数量大,难以在资源受限的具身任务中动态更新,限制了智能体的在线学习和泛化能力。

启发:左半球主要控制语言处理、逻辑分析和推理,擅长阅读和逻辑推理等详细任务。相反,右半球与空间感知、想象力和整体思维相关,善于重构和想象空间视觉结构,理解整个世界。这些半球通过胼胝体相互连接,胼胝体是一束促进半球间沟通和整合的神经纤维。值得注意的是,胼胝体表现出动态适应性,根据经验和学习逐步调整其激活强度。

一般的代理进化范式:代理利用域内任务的具体探索经验和在线进化能力来实现跨不同任务的增强的零样本具体执行和空间理解。

第一步是多模态感知输入,输入观察(图片)和指令(用户自然语言),视觉信号通过适配器转为一系列的visual token,文本转为language token。第二步是内部信号处理,原始visual token会与动态通信槽DCS中的信息交互,具体来说,DCS中的信息(来自世界模型的空间先验知识)会通过 Slot-augmented Embeddings机制增强视觉令牌,生成更具空间上下文意识的视觉表示(增强嵌入,相当于给某些token加权重)。这相当于为MLLM配了一副“空间感知眼镜”。增强后的视觉令牌、语言令牌以及 Historical Tokens(历史对话或观测信息)一起输入到LLM核心中进行深度融合和理解。第三步是世界模型的推测,同样会从DCS中拿到任务的上下文,此外,还支持想象(通过先验网络)

主要是世界模型(world model):“世界模型专注于编码世界状态的演化模式、环境对智能体行为的响应以及它们与感知输入的内在联系,从而构建智能体的内部表示机制。最近的趋势将 MLLM 集成到世界模型中,但通常作为整体组件,缺乏模块化协作和认知启发的界面。”

世界模型(World Model)是人工智能系统内部构建的一种关于外部环境的动态“模拟器”,其核心目标是让机器像人类一样,对物理世界和社会环境的运行规律形成内在理解,从而具备预测、规划和推理能力。与传统的大语言模型主要关注“已说出的知识”不同,世界模型聚焦于“正在发生的现实”,强调对因果、物理规律和时空演化的建模。

Methods部分

看不动了,主要问的大模型:

DCS部分:

左大脑多模态大模型部分:

右大脑世界模型部分:

重点关注DCS,它是如何实现agent的进化的

一些思考

对于future的其他工作,为了增强可塑性,可以引入诸如使用可组装组件的模块化自我成长学习等策略。

确实,之前一直在思考如何在进化中提出像GAN那样优美简洁的框架,本质上是想让双方(执行器和分析器)都有一个信息交互的过程,而不是单向的信息传递,这里的DCS胼胝体在某种程度上就扮演了这个角色,可见这个方向也是一种趋势。

论文的讲故事讲得很好,也很详实,ACMMM的best student paper,可以重点学习写作部分

PSG-AGENT: PERSONALITY-AWARE SAFETY GUARDRAIL FOR LLM-BASED AGENTS

[2509.23614] PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents (arxiv.org)

核心在创建个性化护栏,现有的LLM安全代理存在两个基本限制:(i)它们对所有用户应用统一的护栏策略,忽略了相同的代理行为可能会伤害某些用户而对其他人来说是安全的; (ii) 他们孤立地检查每个响应,忽略了风险如何在多次交互中演变和积累。

代理面临的安全挑战已经从“生成的内容是否有害”演变为多维度的问题:“整个行为决策链在特定情况和用户个性特征下是否安全、合规、合乎道德?”这种范式转变迫切需要对用户个性特征敏感的新型安全护栏。

Introduction部分

“他们对单轮输出进行静态检测,未能跟踪多轮交互中的累积风险(Rahman et al., 2025)。与传统法学硕士的单轮响应不同,智能体通过规划、工具使用和记忆操作形成复杂的行为链,每个阶段的风险都会放大。例如,当冲动的用户寻求投资建议时,代理最初可能会提供保守的建议。但在多轮交互中,它逐渐吸收用户的乐观反馈历史,调用市场分析工具展示高收益案例,最终生成激进的投资建议并执行交易。尽管每个单独的步骤可能看起来“安全”,但整个行动链会导致超出用户风险承受能力的冒险决策。这种跨轮风险传播使得单轮检测机制失效。”

这个思路跟ATP是一样的

PSG-Agent使用 Profile Miner 从历史用户交互中提取稳定的角色特征(例如,个性特征),并使用 Input Guard 从即时查询中捕获用户的实时状态(例如,意图强度)。通过结合这些输入,PSG-Agent 生成个性化的安全标准,为每个用户定制独特的风险阈值、决策规则和保护策略。

Guardrail for LLM-based Agents强参照

"First, rule-based methods like GuardAgent (Xiang et al., 2025) compile user queries and agent plans into executable guard code using predefined security rules. Although effective in fixed scenarios, they lack generalizability to dynamic tasks." GuardAgent很广泛,需要看

Methods部分

流程图比较清晰,分为两个stage:

个性化安全标准生成(Stage 1)​

Profile Miner Agent:从用户聊天历史中提取结构化档案,包括稳定属性(如人口统计、健康状态)和动态属性(如实时情绪)。例如,通过LLM分析历史对话,推断用户职业为“教育工作者”或健康状态为“Type 2糖尿病”,并为每个属性分配置信度,确保档案基于显式证据。

Input Guard Agent:结合用户档案和当前查询,生成个性化安全标准(PSC)。具体包括:

计算多维风险向量,聚合为总体风险评分(0-100)。

映射安全决策(如允许、带护栏允许、拒绝并提供替代方案)。

编译PSC,包含禁止项、所需措施、工具边界等,供下游组件执行。该模块利用记忆提示(如安全案例库)增强决策准确性。

2. 个性化防御实现(Stage 2)​

PSG-Agent在agent工作流中部署四个专用护栏,实现连续监控:

Plan Monitor Agent:审计agent的原始计划,检查是否符合PSC。若计划偏离,则施加运行时约束(如参数限制)或要求重计划,确保风险在执行前被阻断。

Tool Firewall:在工具调用时强制执行Plan Monitor输出的约束,防止危险操作(如高风险金融交易)。

Response Guard Agent:对最终文本输出进行最小化修订,确保符合PSC的响应风格和安全要求。例如,当内容违反PSC时,进行删减或风格调整;若无法安全改写,则回退至拒绝决策。

Memory Guardian:控制内存写入,防止敏感信息泄漏或风险累积。各组件由中央控制器协调,实现跨轮次风险跟踪。

还讲了如何构造benchmark(个性化数据集基准)

一些思考

这里用了AGrail作为baseline,还用了Llama 3 Guard(using category-based harmful content filtering) 都是很好的baseline!

https://www.llama.com/docs/ model-cards-and-prompt-formats/llama-guard-3/

“We use temperature 0.0 for agent responses and safety assessments to ensure reproducibility.”

此外,它在多个检查点上都设置了agent(看前面四个专用防护护栏),这表明分层的guard agent或许是个出路

虽然这篇论文似乎与自进化关系不大()

这里插播:Contextual Agent Security: A Policy for Every Purpose

[2501.17070] 上下文代理安全:适用于各种目的的策略 --- [2501.17070] Contextual Agent Security: A Policy for Every Purpose (arxiv.org)

通用智能体(如自动化个人助手)可以执行多种多样的任务,这意味着它们会遭遇前所未有的、广泛的上下文。这放大了静态策略的缺陷。

论文提出了 Conseca(Contextual Agent Security)​ 框架。该框架的核心思想是:为每一个具体的任务和上下文,动态地生成一个即时(Just-in-Time)、可读、且可验证的安全策略。

动物装饰