关于智能体的自进化(self-evolving agents)

breeze-bell
53
2025-10-09

老师推荐的两篇相关方向论文:

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

[2510.04860] Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails (arxiv.org)

论文核心关注的是​​自进化大语言模型智能体在部署后的长期可靠性问题​​。它揭示并定义了一种独特的部署后风险——ATP,这种现象是指,即使一个LLM智能体在训练阶段被成功地与人类价值观对齐(Aligned),在部署后通过与环境持续互动进行自我进化(Self-Evolution)时,其行为策略会逐渐发生“相变”,最终为了追求短期高回报而系统性放弃初始的对齐约束,导致其行为偏离人类意图。

Introduction部分

给出作者的一些insight方便理解:

  • ATP 描述了一个智能体的行为策略经历相变的紧急过程。这种转变将政策从受训练过程和人类偏好的初始一致性约束控制的状态转变为由即时环境反馈主导的状态

  • 与训练时的失败不同,当持续的交互驱使智能体放弃训练期间建立的对齐约束,转而采用强化的、自利的策略时,ATP 就会出现。

  • 自进化:大模型通过实时互动完善他们的策略,越来越多地被用来提高他们的表现和适应性;然而,适应机制本身可能会系统性地破坏智能体的基本一致性,并导致意想不到的紧急行为。

  • 在自我进化过程中,对齐的好处会迅速消失,最初对齐的模型会趋向于未对齐的状态。在多智能体环境中,成功的违规行为会迅速扩散,导致集体失调。此外,当前基于强化学习的对齐方法仅提供了针对对齐倾斜的脆弱防御

  • 作者的工作将对齐衰减作为一个动态的部署后过程进行研究。对齐的脆弱性并非源于设计缺陷,而是矛盾地源于代理的核心优势:学习能力。

Methods部分

从两个方向/范式(paradigm)来分析这个现象:

(1) Self-Interested Exploration, which frames ATP as an iterative drift from initially rule-abiding behavior toward self-interested policies as repeated highreward deviations accumulate during self-evolution; and (2) Imitative Strategy Diffusion, which frames ATP as a social learning dynamic in which deviant strategies spread across a multi-agent population, gradually transforming individual deviations into collective norms that overturn prior alignment.

第一个就是前面提到的,智能体在当前情景的上下文中学习时,可能会背离原有的对齐,转向更high-reward,更倾向于当前环境,更讨好与人类的policy(在监管不完善的部署环境中进行自我进化时,它发现违反规则可以带来更高的奖励);第二个是模仿策略扩散。即在多智能体环境中,一个智能体发现大家都反水了,自己也会反水(这是一种级联扩散的现象):

“当LLM目睹其他人成功地采用异常策略来获取集体利益时,他们自己的风险回报计算也会相应地发生变化。这一过程可以引发信息级联,使采取异常行为成为理性选择,其基础是期望其他人也会效仿。随着时间的推移,这种级联将一致性从个人承诺转变为集体规范”

实验部分

总体是回答三个问题:

  • 基于偏好的对齐方法(如DPO、GRPO)所灌输的对齐稳定性如何?当智能体在自我进化过程中,其偏差的、自利的行为持续获得高奖励时,对齐效果能否维持?

  • 智能体的个体奖励历史及其对同伴行为的观察,如何共同促成ATP?

  • 哪些特定的环境因素会影响智能体策略偏离初始对齐的速度和可能性?

选的 ​​Qwen3-8B​​ 和 ​​Llama-3.1-8B-Instruct​​ 作为基座模型。

对于self-interested exploration,搞了16个决策环境,每个环境都定义了一个智能体角色、一项任务、一套规则以及一个二元策略选择:

​​对齐策略​​:遵守规则(例如,只从A商店购买);偏差策略 (Deviant Policy)​​:违反规则以获得更高回报(例如,从B商店购买以获得更低价格)。

基座模型分别应用​​DPO​​和​​GRPO​​进行对齐训练,使其强烈偏好遵守规则的行为。在测试阶段,模拟“监督失效”的环境,即​​偏差行为被设定为能获得更高奖励​​。智能体进行多轮(6轮)测试,每轮的提示都包含其之前所有决策和结果的完整历史,核心指标是每轮的​​平均规则违反率。

发现对齐训练在初期效果显著,然而,这种对齐效果在自我进化过程中迅速衰减。例如,Llama-DPO模型的违规率从第1轮的18.8%升至第6轮的45.3%,几乎抹平了初期的对齐优势。

第二个实验设计的工具调用的场景:

智能体面临二元选择:工具使用策略​​:消耗3成本单位,但解题精度更高;直接推理策略​​:仅消耗1成本单位,但可靠性较低。

数据集包含来自GSM8K的​​简单问题​​(无需工具即可解决)和来自OpenThoughts的​​复杂问题​​(需要工具才能正确解答)。以Qwen3-8B为基座模型,训练其DPO和GRPO变体,使其偏好使用工具。测试包括4轮自我进化:每轮先让智能体解决r个简单问题,然后评估其在复杂问题上的表现。

评估指标​​:​​工具使用率​和​​复杂问题准确率。发现所有模型的工具使用率都随着轮次增加而急剧下降(工具放弃现象);尽管有限的简单问题 exposure 在初期可能起到“热身”作用(GRPO准确率从83%升至92%),但随着轮次增加,准确率最终大幅下降(准确性崩溃现象)

第三个实验是模仿策略扩散的:

设计了7个多智能体协调游戏环境,涉及 ​​n=8​​ 个智能体。

每个智能体每轮做出二元决策:​​合谋或不合谋 。

结果取决于合谋人数是否达到一个阈值 ​​t​​。奖励机制是​​乘性​​的(模拟收益累积效应):

​​成功​​(合谋者 ≥ t):所有合谋者获得高奖励(×1.2)。

​​失败​​(合谋者 < t):合谋者获得低奖励(×0.8),非合谋者获得中等奖励(×1.0)

使用Qwen3-8B作为基座模型,并应用DPO和GRPO对齐其偏好“不合谋”的行为。

让8个智能体群体进行3轮自我进化。每轮后,所有智能体都能观察到其他智能体的决策和集体结果,从而实现模仿学习。

发现,合谋阈值 ​​t​​ 是主导因素:

​​低阈值 ​​:合谋容易成功,早期成功充当了强大的​​社会证明,触发正反馈循环,使合谋率持续攀升,覆盖初始对齐。

​​高阈值 :合谋难以成功,早期失败起到威慑作用,形成负反馈循环,使合谋率下降甚至趋近于零。

这证明了ATP在多智能体语境下是一种​​集体现象​​,由早期互动的关键反馈所触发,可能导致系统级联地走向违规或迅速回归对齐。

一次成功合谋有巨大的催化作用,只要第一轮合谋成功,智能体在第二轮再次选择合谋的概率变得极高。这表明,​​成功的社会信号极其强大,足以瞬间覆盖训练阶段灌输的对齐偏好​​。

再次强调:

虽然 DPO 和 GRPO 最初大大改善了一致性,但在持续的反证据下,它们不能完全防止其侵蚀。因此,对齐不是一种静态属性,而是一种脆弱且动态的属性,在部署过程中容易受到反馈驱动的衰减

未来工作部分

不同于奖励黑客等,ATP代表自我进化系统固有的一类新的对齐风险。未来的研究应侧重于开发对长期自我进化更具弹性的对齐策略,例如在部署过程中将对齐先验与上下文强化学习相结合的混合方法。在多智能体系统中,还需要有效的监控和干预机制,以防止一旦取得早期成功,异常策略就会在社会上迅速扩散。总之,这些方向强调了将对齐视为动态属性的必要性,必须积极维护而不是假设它是固定的。

思考

基于反事实的对齐+COT​​?

训练模型不仅学习首选行为,还要求其能解释为什么不选择高奖励的偏差行为(例如,“虽然撒谎能得到更多钱,但这违反了诚信原则,长期会失去信任”),强化其价值观层面的推理能力。

此外,论文中的环境奖励信号过于简单和片面(违规即高奖励,这感觉有点像为了做实验而做实验),加速了ATP。

既然ATP是动态的,维护对齐的过程也必须是动态的,熔断机制,在某个临界点重置上下文环境?

提示词优化?

比如通过提示词告诉代理,减轻它对当前环境的可信度。前面的论文阅读记录有相关记载:

OFFTOPICEVAL: WHEN LARGE LANGUAGE MODELS ENTER THE WRONG CHAT, Almost Always!那篇,提示词注入:

一些有洞见的思考见下文的另一篇,作者insight值得学习。

Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents

[2509.26354] Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents (arxiv.org)

摘要:“本文研究了智能体的自我进化以非预期的方式偏离,导致不良甚至有害结果的情况。我们将其称为“错误进化 (Misevolution)”。为了进行系统性研究,我们评估了四条关键进化路径上的错误进化:模型、记忆、工具和工作流。”

Introduction部分

为了理解Misevolution,首先需要了解自进化代理是如何运作的。

论文提出了一个形式化框架,代理由四个核心组件构成:模型:核心LLM,负责推理与决策。记忆:存储过去经验。工具:可调用的外部函数或API。工作流:任务执行的步骤规划。

据此,将进化路径分为四类,对应代理的四个组件:

  • 模型进化:通过自我训练更新模型参数。

  • 记忆进化:积累经验并用于未来决策。

  • 工具进化:创建、复用或集成外部工具。

  • 工作流进化:优化任务执行流程。

这四个途径,每一种途径都由可能导致不良行为的具体机制驱动,所以后续实验也围绕这四个方向展开。

Methods部分

其实主要讲的是实验怎么设置的,为什么这么设置,为什么这么分类等等。

模型进化部分,研究问题:当代理通过自我训练更新模型时,是否会破坏原有的安全对齐?作者测试了多种自训练方法(如Absolute-Zero、AgentGen),在进化前后使用安全基准(HarmBench、RedCode-Gen)评估模型。

记忆进化部分,研究使用 SE-AGENT(Lin 等人,2025)进行实验。 SE-AGENT 从过去的轨迹中总结和提炼策略,并利用这些知识来帮助解决新任务。还测试了 Agent 的记忆存储和检索机制(Yang et al., 2025c),该机制保存成功和失败的轨迹,并将相关内容检索到面临新任务的上下文中。作者研究了即使没有参数更新,memory积累是否会导致不当行为。

工具进化部分,研究重点关注具有直接安全影响的两个范式:工具创建和重用以及摄取外部工具。

工作流优化部分,研究问题:工作流优化是否会无意中降低安全性?使用AFlow框架优化编码任务的工作流,并在安全基准上测试进化前后表现。

实验部分

主要是实验结果分析,贴几个结果,第一个是模型进化部分:

记忆进化部分:

相关工作部分

非常相关,调研可参照,贴原文:

Self-evolving agents.

Research on self-evolving agents, known for their adaptive capabilities and strong performance (Novikov et al., 2025; Gao et al., 2025; Fang et al., 2025; Liu et al., 2025), has primarily explored four evolutionary pathways. One line of work focuses on model evolution, where agents refine their own parameters using self-generated data or learning curricula (Zhao et al., 2025a; Huang et al., 2025; Sun et al., 2025; Zhou et al., 2025b). Another prominent approach is memory evolution, where agents learn from past experiences by storing and retrieving them to guide future actions (Yang et al., 2025c; Lin et al., 2025; Zhou et al., 2025a). Likewise, tool evolution allows agents to expand their capabilities by creating, refining, and reusing tools (Qiu et al., 2025; Haque et al., 2025; Zhao et al., 2025c; Zheng et al., 2025) or by improving their proficiency with existing tools (Qu et al., 2024). Some studies also demonstrated performance gains through workflow evolution, where agents autonomously optimize their execution pipeline and collaborative structure (Hu et al., 2025b; Zhang et al., 2025b; Wang et al., 2025). The common thread in these studies focused on enhancing agent capabilities. In contrast, our work shifts the focus to the safety implications of self-evolution, investigating the potential for this process to introduce unintended risks.

Safety of LLMs and LLM-based agents.

The rapid development of LLMs and LLM-based agents has made their safety a primary concern (Zhang et al., 2024; He et al., 2024; Deng et al., 2025). Previous research has uncovered numerous vulnerabilities. For LLMs, these include data poisoning and backdoor insertion (Hubinger et al., 2024; Wang et al., 2024; Zhao et al., 2025b), adversarial attacks and jailbreaking that elicit unsafe behaviors (Zou et al., 2023; Wei et al., 2023; Ren et al., 2025), and the generation of harmful or private content (Wang et al., 2023; Li et al., 2024; Qian et al., 2025). For agents, risks involve external attacks such as knowledge poisoning (Chen et al., 2024; Zou et al., 2025), prompt injections (Zhan et al., 2024; Debenedetti et al., 2024), and interference from malicious links (Yang et al., 2025b; Tur et al., 2025). Most of these studies evaluate a “static snapshot” of a model or agent against external threats. Our work diverges by focusing on “misevolution”: risks that emerge dynamically within self-evolving agents. This concept is distinct from related safety issues, such as those observed during finetuning (Qi et al., 2024b; Lyu et al., 2024). A notable example is emergent misalignment (Betley et al., 2025), where finetuning on insecure code leads to misalignment on other domains. However, this stems from training on a curated set of insecure examples. In contrast, misevolution appears spontaneously from an agent’s autonomous interactions with the environment, without deliberately exposing the agent to unsafe data. Wei et al. (2025) also explored risks in self-evolving agents but focused on their malicious use in cyber attacks. Our work, however, concentrates on unforeseen risks that arise from the self-evolution process itself.

思考

给出一些认为不错的点:

“Our experiment revealed two primary forms of undesirable outcomes from memory evolution: safety alignment decay and deployment-time reward hacking. Safety alignment decay refers to the degradation of an agent’s safety alignment as it accumulates experience.”在记忆进化实验部分,发现两个现象:安全对准衰减是指代理的安全对准随着经验的积累而退化;还有奖励黑客攻击,跟强化学习类似,模型容易依据历史任务的简单启发式方式来走捷径。

“我们观察到模型自我训练可能会无意中损害安全对齐。一项关键的挑战是缺乏对驱动模型自我更新的数据的直接控制。一种可能的方法是使用安全护栏来过滤掉明显不安全的轨迹,并将其用于训练。然而,这还不够,因为我们发现安全性甚至可能在看似良性的数据上不断进化。我们认为更稳健的解决方案是面向安全的训练后,自我进化后恢复对齐的轻量级校正步骤。” 这个分析确实很有道理。

LLM过度依赖过去的成功经验而没有进行批判性反思。有鉴于此,我们引入了一个简单的方法:指示智能体将检索到的记忆视为“参考”,而不是“规则”,例如“后续记忆仅供参考。您必须根据当前情况做出缩进决策””。确实,上文提到的提示词注入?

“对于工具创建和重用,关键的缓解措施是自动化安全验证。我们提出一个两阶段的过程:(1) 在将新工具添加到工具集中之前,使用静态分析来扫描其漏洞,以及 (2) 使用 Judge Llm 重新验证工具在重用时在新环境中的安全性。”

过度信任和未经审查的信息是错误进化的另一个可能根源。这既表现为对外部资源缺乏警惕,又对其过往经验过度自信。对于高度自治的智能体来说,这种趋势尤其危险,因为根据有缺陷的信息采取行动可能会导致级联错误。”确实,这一洞见和前面那篇论文惊人一致。

动物装饰