智能体与强化学习

breeze-bell
8
2026-01-24

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning (arxiv.org)

Introduction部分

agent训练传统基于强化学习,但严重依赖高质量人工标注数据,这不仅成本高昂,还限制了AI系统的可扩展性,并将AI能力束缚在人类知识范围内。

Reinforcement Learning from Human Feedback (RLHF)

Reinforcement Learning from Verifiable Rewards (RLVR)

进化框架,包括自我博弈和自我挑战面临能力瓶颈(生成的任务复杂度受限于模型固有知识,难以超越当前水平)和交互单一(无法模拟现实世界中需要动态、多步推理)的问题。

Agent0 建立了两个由同一基础 LLM 初始化的代理之间的共生竞争:一个提出越来越具挑战性的前沿任务的课程代理,以及学习解决这些任务的执行代理。——工具集成+多轮共进

这里的自进化其实指的是数据的自我搭建:模型能够自主生成自身的训练数据

核心:

“这两个智能体通过一种共生竞争关系实现协同进化:课程代理接受强化学习训练,其目标是提出能够精准挑战执行代理当前能力的前沿任务,并将执行代理的不确定性(即多次回答间的自我一致性差异)及其工具使用频率作为奖励信号。与此同时,执行代理也通过强化学习进行训练,以成功解决这些任务;它在一个经过筛选的、由冻结的课程代理生成的挑战性问题集合上进行优化,并采用基于自身多数投票产生的伪标签进行学习。为执行代理配备工具(如代码解释器)增强了其问题解决能力,这进而促使同样配备了工具的课程代理去生成更复杂的、基于工具的教学内容。由此,一个良性循环得以建立,推动代理能力课程复杂性同步螺旋式上升。此外,我们将此范式扩展至支持多轮交互,从而能够生成语境更丰富、更贴近现实世界问题解决的对话式任务。”

所谓自我一致性差异,就是学生代理的答案不确定性(对一道题给出多个答案,且答案不一致比如一半对一半错,说明题目正好在其能力边界上),如果学生代理被迫使用工具解题,那么老师也会得到奖励

所谓“它在一个经过筛选的、由冻结的课程代理生成的挑战性问题集合上进行优化,并采用基于自身多数投票产生的伪标签进行学习”,即学生也使用强化学习来解题,但它只练习那些被过滤过的、难度适中的题目(即“解题学生”当前正确率在30%-80%之间的题目),没有标准答案,自己生成多个答案,然后采用“多数投票”的结果作为伪答案。

强化学习用的GRPO

一些可以关注的其他工作!

Evolvesearch: An iterative self-evolving search agent.

Reinforcement learning for strategic tool use in llms

R-zero: Self-evolving reasoning llm from zero data

Serl: Self-play reinforcement learning for large language models with limited data

Methods部分

伪代码部分说的倒挺详细的

首先是课程代理的进化:生成task(以prompt形式),然后用现在的executor生成k个回答,然后计算奖励,奖励包括不确定性奖励:

工具使用奖励(工具调用次数,并设置上限防止骗分),还有重复奖励(利用BLEU分数计算相似度),最终奖励:

R_format是一个门控(二进制0/1的判别函数):在强化学习中,智能体可能会“走捷径”,通过生成一些在格式上无效、但能意外触发高奖励信号的“乱码”或“作弊”任务来获取奖励。如果任务的格式符合需求,例如,是一个语法完整、结构清晰、可被解析的自然语言问题,那么为1

接着是执行代理的进化:(把上面的课程代理冻结了)

这个分数是衡量任务难度的标准,你想选多难自己设阈值

执行代理开始执行(这里是多轮交互的轨迹,是否调用工具,以及最终答案等都有tags检测触发! 这是个写prompt的trick!)

然后由工具调用次数和伪标签设置奖励

执行代理的强化学习是GRPO基础上的优化:ADPO

解决标签噪声:在模型自己也拿不准的任务上,多数投票得出的“伪答案”很可能是错的。如果用错误的答案作为目标来优化,模型就会“学坏”。所以,在训练时,区别对待不同置信度的样本,让模型更相信它自己确定的答案,更怀疑它自己不确定的答案。

还有就是关于裁剪部分(标准GRPO是静态的,这里搞成了动态:这种限制对于高模糊性任务(低 p^​(x))尤其不利,因为正确的推理路径通常位于当前策略分布的尾部,需要大幅度的更新才能浮现)

裁剪:对策略更新比率的限制。每次改变的幅度不能超过某个范围(比如ϵ)。如果计算出的最佳改变幅度超过了这个范围,我就把它‘裁剪’到这个范围内。

Experiment部分

一些可以学习或强参考的baseline:

前面的R-zero:A self-evolving framework that operates from zero data, but does not utilize external tools.

Absolute zero: Reinforced self-play reasoning with zero data (A self-play method that does use a code executor for verification, representing a strong tool-aware baseline.)

Socratic-zero: Bootstrapping reasoning via data-free agent co-evolution.

可学习部分:加一个定性的分析

思考

第一个是成本:框架涉及两个智能体(课程代理与执行代理)的交替训练,每一轮都需要进行大量的任务生成、采样(k=10)、评估和强化学习更新。这会导致极高的计算成本。

第二个是扩展:实验部分主要围绕数学推理,这类问题非常适合用代码工具解决。是否能有效集成其他类型的工具(如搜索引擎、API调用、专业软件)并驱动其他领域(如常识推理、创意写作)的进化?

从成本角度来想,大量的采样是为生成的任务质量本身服务的(计算不确定性分数),训练一个独立的评估器来直接判断课程代理生成的任务是否“优质”?

学习路线补充:

agent rl比较好的复现项目:agentgym,webarena,toolbench

综述:The landscape of agentic reinforcement learning for LLMS

强化学习框架,也是这篇论文用的:verl(火山引擎开源的) 可以看verl代码:

https://www.xiaohongshu.com/explore/69421c4d000000001d039d63?xsec_token=CBG2bKrj1NLa7YIY8e_NnyNX5q82GrEhgylrYplaOTZ7U=&xsec_source=app_share&wechatWid=3c3bdac1f2a3dbb7e85dfbd17e1fd28f&wechatOrigin=noteImg

关于强化学习,小红书经验:

⏱️ 方案一:一天速成版

1. 直接先在某站上找rethinkfun的PPO课程,主要了解PPO的大致原理,同时梳理on-policy和off-policy这两个概念。

2. 搜索《动手学强化学习》,找到PPO的代码,看懂代码,熟悉gae、td等等概念。时间充裕的话可以从策略梯度看起。

3. 学习rethinkfun的GRPO讲解,然后让AI生成GRPO的源码,结合源码进行学习。

✅ 效果: 这样突击下来,应付一般的面试基本没问题,剩下的可以在入职后再慢慢补。

📚 方案二:深入理解版

这个版本通常需要花费半年~一年,不过可以从数学->计算机全方位构建起对于RL的认知。

1. 某站找到赵世钰的《强化学习的数学原理》,把课程看完。这个过程还是比较痛苦的,主包去年学的飘飘欲仙。不过好处是构建起来了对RL的理解基石,后续理解新算法会非常快。

2. 在《动手学强化学习》网站,从《初探强化学习》开始,把每个章节都看懂,包括代码也要自己复写一遍。这个过程也比较消耗时间。在这个过程中,你会理解的更加深入。

3. 找到llm-related这个git仓库,把grpo等代码自己学习一遍,并复写一遍。这个时候你基本上就能应付工作中的RL使用了。

动物装饰