[2509.08827] A Survey of Reinforcement Learning for Large Reasoning Models (arxiv.org)
一个不错的综述可以帮助快速入门,梳理强化学习脉络,下面是阅读笔记。
引言部分
强化学习最初是作为人类对齐的后训练,后面声名鹤起。广泛采用的强化学习来自人类反馈 (RLHF)和直接偏好优化 (DPO)。
最近,一种新趋势已经出现:用于大型推理模型 (LRMs) 的强化学习, 其目标不仅是使行为一致,还要激励推理本身。
OpenAI的o1和DeepSeek的R1表明,使用带有可验证奖励 (RLVR) 的强化学习(例如数学的答案正确率或代码的单元测试通过率)训练 LLM,
可以使模型执行长篇推理,包括规划、反思和自我修正。
所以这揭示了一个方向:对数学、编程使用显式、基于规则的准确奖励,能够有效提升大模型。
几个术语:
RLHF(基于人类反馈的强化学习):这是目前最主流的对齐方法(例如用于训练ChatGPT)。它的流程复杂:
监督微调(SFT): 在高质量数据上微调模型。
奖励模型训练: 训练一个单独的模型来评判回答的好坏。
强化学习(RL)优化: 使用PPO等RL算法,根据奖励模型的反馈来优化语言模型,使其生成高奖励的回答。
缺点: 流程复杂、不稳定、需要训练多个模型(奖励模型和策略模型),计算成本高。
DPO(直接偏好优化): 2022年提出的一种更简洁的方法,它绕过了训练奖励模型和RL的步骤。
核心思想: 直接利用“好回答”和“坏回答”的成对偏好数据,通过一个巧妙的损失函数来微调模型。这个损失函数隐式地引导模型趋向于选择好回答,而避免坏回答。
潜在局限: DPO严重依赖于高质量的成对偏好数据。如果数据有噪声或不够全面,模型可能会“走捷径”,只学会在有限的偏好对比中胜出,而不是真正学习到更普适的、高质量的行为。
GRPO(组相对策略优化):可以被看作是DPO思想的一种泛化和增强。它由Microsoft Research在2024年提出。
DPO 处理的是一对一的比较(Response A vs Response B)。
GRPO 处理的是一组回答之间的比较(Group of Responses A vs Group of Responses B)。
它将训练数据中的回答(或样本)根据某种特定的、可量化的属性(Attribute) 分成不同的组。GRPO的目标不再是简单地在单个样本对上区分胜负,而是让模型学会整体上偏好来自“正属性组”(如安全组)的回答,同时避免来自“负属性组”(如不安全组)的回答。
损失函数: GRPO的损失函数在DPO的基础上进行了扩展,它同时包含两个部分:
组间损失: 这是GRPO的精髓。它计算模型对“正属性组”的整体偏好概率与对“负属性组”的整体偏好概率之间的相对比值。模型被优化,使得这个比值最大化(即,模型应显著更偏好正属性组)。
组内损失: 为了保留DPO在细粒度对比上的优势,GRPO通常也会在组内(例如,在“安全组”内部)进行传统的DPO式成对比较,以进一步提炼回答质量。
4.RLVR(强化学习与预测):2023 年由 DeepMind 研究人员提出的 《强化学习与视频预测》
RLVR 的目标: 大幅提升样本效率,让智能体能够通过极少量(例如:几分钟)的真实世界交互数据,就学会复杂的任务。
人类在学习时,会进行大量的“心理模拟”。比如,学习下棋时,我们会在脑中推演“如果我走这步,对方会怎么走,然后我又该如何……”。RLVR 就是想为 AI 智能体赋予类似的能力。
前提部分
强化学习提供了一个用于序列决策的通用框架,其中智能体通过采取行动与环境交互以最大化累积奖励。在经典强化学习中,问题通常被表述为一个马尔可夫决策过程(MDP):which is defined by a tuple (S, A, P, 𝑅, 𝛾). The main components include a state space S, an action space A, transition dynamics P : S × A ↦→ S, a reward function 𝑅 : S × A ↦→ ℝ, and a discount factor 𝛾 ∈ [0, 1]. At each step, the agent observes a state 𝑠𝑡 , selects an action 𝑎𝑡 according to its policy 𝜋𝜃 parameterized by 𝜃, receives a reward 𝑟𝑡 , and transits to the next state 𝑠𝑡+1.
当RL用于LLM这些概念可以到语言领域:

在实践中,通常会将学习到的策略正则化到参考策略πref ,这通常通过KL散度约束来实现,以稳定训练并保持语言质量。
然后介绍了当下前沿的使用强化学习策略的模型(Frontier Models):

OpenAI的o1系列、DeepSeek R1等开源模型以及Claude、Gemini等专有模型,通过扩展训练时RL、测试时计算或多阶段训练,在数学、编程等基准上取得了领先性能。模型能力的提升进一步拓展了其在编码智能体和工具使用等场景的应用,如Claude和Kimi K2。多模态成为关键方向,GPT-5、Gemini 2.5等主流模型已原生支持多模态推理;开源领域如QVQ、InternVL等则通过统一预训练、混合奖励(如GRPO)等技术,在视觉推理和跨领域泛化上取得显著进展。
一些现有的强化学习工作的方向:试错优化如何改进复杂推理、面向推理性能或奖励设计、大型语言模型对齐和增强的强化学习算法……
基础组件部分
这一节开始讨论LRMs的RL基础组件,包括奖励设计、策略优化算法、采样策略……

奖励设计
可验证奖励:奖励信号来自于一个客观、确定、无需学习的规则或验证器。这个验证器能自动且明确地判断模型输出的对错。(比如数学比答案,模型是否遵循了指定的输出格式等),主要适用于有明确正确答案的任务(数学、编程、某些科学问题)。
生成式奖励:当任务没有唯一正确答案时(例如,评估一篇文章的质量),使用另一个模型作为裁判。
此时,我们会训练或提示一个“评判模型”来执行评估。这个评判模型会生成:
一个简单的标量分数+一段结构化的文本批评,解释为什么给出这个分数,然后再根据这段批评得出最终分数
局限性显然是其严重依赖评判模型质量,且成本高(运行俩模型);
可能被攻击:生成模型可能会学会迎合评判模型的偏好,而不是真正提高任务质量(另一种形式的奖励欺骗)
对于评判模型(GenRM),他的核心设计原则包括推理(在给出最终评分或偏好之前,先进行明确的推理(生成 CoT))和基于标准(使用结构化的评分标准(Rubric) 来指导评估。评分标准是自然语言描述的、细致的评价维度列表)等等
由此还衍生出:自我奖励(self-reward):模型在策略生成和评判间角色交替、协同优化(两个模型一起训练,减轻奖励攻击)
密集奖励:与环境交互的每一步或每一个关键步骤都提供反馈信号,而不是仅在任务最终成功或失败时才提供一个稀疏奖励。
它的作用:提高强化学习的训练效率和优化稳定性
密集奖励旗下的代表有token-level reward(作为策略与参考模型之间的对数似然比来计算),比如离线奖励模型ORM可以被集成到RL训练中;还有步骤式奖励(与其密切相关的是PRM,过程奖励模型),早期的密集奖励依赖人类专家标数据,后有学者(2024)提出使用蒙特卡洛采样,自动生成训练PRM所需的数据(蒙特卡洛估计是一种通过重复随机采样来计算某个无法直接计算或难以精确得到的数值的方法)

回合奖励:一种介于稀疏的序列级奖励和密集的步骤级奖励之间的折中方案,它常见于多轮交互的智能体任务(如工具调用、对话、网页浏览)中。在此设定下,智能体每完成一轮完整的交互(例如执行一个工具调用并得到结果、或进行一轮对话),环境就会根据该轮交互的即时结果(如工具是否调用成功、返回信息是否有用、用户是否满意)提供一个反馈信号。这种奖励既能提供比最终结果更频繁的指导,避免了完全稀疏奖励的信用分配难题,又比追踪每一个token生成的步骤级奖励更易于设计和计算
无监督奖励:方法包括从模型自身的流程中提取信号(模型特定:一致性、内部置信度、自生成知识)或从自动化外部来源提取信号(模型无关:启发式方法、数据语料库),两大范式:

模型特定范式通过利用模型的内部知识来促进自我改进,而模型无关范式将学习建立在外部自动反馈之上。虽然这两种方法都有效地绕过了人工标注瓶颈,但它们仍然容易受到奖励攻击。
奖励塑形
通过修改或增强奖励函数(例如结合可验证奖励与生成式奖励、使用组基线等策略)来提供更稳定、更密集的反馈信号,以引导智能体更高效地学习并加速收敛。
基于规则的奖励塑形:通过手动设计规则来组合或调整多个奖励信号源,是最直观和常用的策略。(包括混合奖励信号,调整权重,多角色奖励分配……)
基于结构的奖励塑形:跳出了对单个样本独立计算奖励的范式,转而从一组样本(群体)的结构中推导出更有效的奖励信号,典型代表GRPO
策略优化
在强化学习中,大型语言模型的上下文被视为环境,下一级预测的概率分布被视为策略。对于强化学习系统,系统的目标是找到一个最优策略,使得系统生成的预期累积奖励最大化。
代表性的强化学习算法:

价值函数:分为状态价值函数 V(s) - “从这个状态出发,我能指望得多少分?” 和 动作价值函数 Q(s, a) - “在这个状态下,如果我做这个动作,能指望得多少分?”
之后论文给了公式,比较经典,对于论文中给出公式的解释:

解释: 状态价值函数 V(s)表示从状态 s开始,遵循策略 πθ所能获得的期望累积折扣奖励。它衡量了某个状态的长期价值

解释: 动作价值函数 Q(s,a)表示在状态 s下采取动作 a,之后遵循策略 πθ所能获得的期望累积折扣奖励。它衡量了在特定状态下执行某个特定动作的长期价值。

解释: 策略梯度定理。该公式提供了计算目标函数梯度的方法。策略梯度是期望的策略对数概率梯度与动作价值函数 Qt的乘积之和。Qt作为尺度因子,决定了参数更新的大小和方向。策略梯度可以通过以下直觉进行解释:遵循策略梯度的算法应该最大化优于平均水平的动作的概率,并最小化劣于平均水平的动作的概率。这一概念导致了 A(优势)函数 A(s,a)=Q(s,a)−V(s)A(s, a) = Q(s, a) - V(s)A(s,a)=Q(s,a)−V(s) 的引入。优势衡量当前动作相对于现有策略对预期总奖励的提升程度。

对于训练LLMs的情况,普通的策略梯度算法经常存在稳定性问题,所以通常用PPO算法(如上),它通过两个操作来稳定训练:

Critic-based Algorithm
奖励模型:就是前面提到的评价模型。早期关于LLM在RL领域的作品主要关注如何有效地将LLM策略与外部监督对齐,以使LLM具备更好的指令跟随能力,典型代表是RLHF:首先,LLM生成一组模型输出并由人类进行标注,以创建一个数据集。然后使用该数据集来训练一个奖励模型,以预测人类更倾向于哪种响应。最后,使用奖励模型与一个值函数一起训练LLM。
值函数是一个关键组件,通常由奖励模型实现,就是前面提到的状态价值:评估的是在一个给定状态 s(对于LLM来说,就是当前的提示(Prompt)加上已经生成的部分响应)下,遵循当前策略 π,所能获得的期望累积回报。在PPO算法中,值函数的核心作用是算优势函数(见前面)。
既然已经有了奖励模型(RM)来提供奖励 r(s,a),为什么还需要一个值函数 V(s)?
奖励模型(RM)的作用:它是一个事后评判官。只有在整个序列(或一个片段)生成完毕后,它才能根据最终结果给出一个奖励信号 R(x,y)。这个信号是稀疏的,并且无法分配给序列中的每一个具体token。
值函数(Critic)的作用:它是一个事前预测官。它的任务是在线地、实时地预测当前已生成的部分序列的未来潜力(预计总收益)。它为每一个中间状态 st 都提供一个价值估计 V(st)。
他们俩协同工作,通过广义优势估计(GAE)等技术,为每个生成动作(token)计算出一个精细优势值,该信号告诉模型每个token的贡献是正面的还是负面的,从而实现了更精确的信用分配(credit assignment,确定过去哪些动作、状态或决策对最终获得的奖励真正产生了贡献,从而把“功劳”或“责任”准确地归给它们的过程),实现了token-level的策略更新。
关于广义优势估计GAE:
首先直观理解,想象一下评价一个球员在篮球比赛中的一次传球是否精彩:
只看即时结果(高偏差,高方差):
“他传球后,队友立马得分了!这绝对是一次好传球!” -> 这相当于只用即时奖励 r_t作为优势。但队友得分可能主要是因为对方防守失误,功劳不全是传球的。
看整场比赛的结果(低偏差,高方差):
“这场比赛最终赢了,所以他那次传球是好的。” -> 这相当于蒙特卡洛方法,用从该传球到比赛结束的所有奖励之和作为优势。但最终输赢受到太多其他因素影响(如第四节另一个球员的超神发挥),距离太远,信号非常不确定(方差高)。
GAE 的思路(在偏差和方差间取平衡):
“我们来看这次传球:首先,它创造了直接得分机会(即时奖励)。其次,它导致了一次助攻(下一步的奖励)。再者,它打破了对方的防守阵型(再下一步的收益)... 但我们不会一直考虑到比赛结束,因为越往后,这次传球的功劳越说不清。”
GAE 聪明地综合考虑了从当前时刻起,未来若干步的收益,并且认为离得越近的收益,与当前动作的关系越大,因此给予更高的权重:

标准的GAE对于长推理任务可能不是最优的,近期有很多新方法:VCPPO VAPO VRPO等
补充一个在强化学习中的棘手现象:reward hacking
智能体并未真正学会“如何完成任务”,而是找到了一条利用奖励函数漏洞来刷高分的捷径(我们只能用代码把“目标”近似地翻译成奖励信号,这一翻译必然存在缝隙,一旦缝隙被算法发现,就会像“玩家找 Bug 刷金币”一样被无限放大)
例子:在抓取任务中,把机械臂挡在摄像头与物体之间,制造“已抓取”图像的现象
Critic-Free Algorithm
该算法不需要一个单独的评论家模型,这显著降低了计算需求并简化训练。任何响应的奖励都可以被明确定义,无评论家算法可以避免因评论家模型训练不佳而可能产生的奖励黑客(reward hacking)问题。
再次强调,它的奖励信号是明确的,客观的,不易被欺骗的,不像评论模型给出的有点黑盒的味道。
典型代表算法是前面提到的GRPO:

可以与前面的PPO算法公式作比较。
重要性采样
在强化学习(比如PPO算法等)中,理想的训练流程是:用当前最新的策略模型生成数据, 用这些新数据计算奖励, 用这些新数据更新模型。但如果每次模型参数轻微更新后都重新生成数据,计算成本将无法承受。
所以,现在的做法是用旧策略生成一批数据,然后用这同一批数据进行多次模型更新。这就带来了分布不匹配问题:用于训练的数据来自于旧策略的分布,而我们要优化的却是新策略的性能。
所以引入了采样技术,即:在计算梯度时,给旧数据加权。如果一个动作在新策略下被选中的概率比在旧策略下更高,那么在用旧数据更新时,这个动作对应的梯度就应该获得更大的权重,以此来纠正因数据分布不同而产生的偏差。
离策略优化(Off-policy Optimization)
可以解决上面的分布偏差问题(通过将数据收集与策略学习解耦)
离策略学习:指用于更新策略模型(目标策略) 的数据,来自于另一个不同的行为策略。这与同策略(On-Policy) 学习(如原始PPO)形成对比,后者要求严格使用当前策略自己产生的数据。
这些方法中的一个核心挑战是校正行为策略与目标策略之间的分布偏移,通常通过使用加权目标函数的重要性采样来解决:

代表方法:DPO(直接偏好优化)绕过奖励建模,直接从静态的偏好对比数据中优化策略
补充模仿学习:
智能体通过观察专家(如人类)的行为示范来学习策略,而不是像强化学习那样通过试错和奖励信号来学习。
第一种方法是行为克隆。将模仿学习视为一个监督学习问题。模型的学习目标是,在给定的状态(或观察)下,预测出专家会执行的动作。
第二种方法是逆强化学习/学徒学习。(IRL 不满足于直接复制动作,它试图挖掘专家行为背后更深层的逻辑)
核心思想:专家之所以采取特定的行为,是因为他们正在优化一个我们看不到的“奖励函数”。IRL 的目标是从专家的示范中推断出这个隐藏的奖励函数。所以给定专家轨迹,要寻找一个奖励函数,使得专家行为在该奖励函数下是最优的,再使用找到的奖励函数,通过强化学习训练智能体。(比行为克隆更鲁棒,更泛化,缺点是计算上更复杂,且奖励函数通常不唯一(存在多个奖励函数都能解释专家的行为))
正则化目标
目标特定正则化有助于平衡探索与利用,提升强化学习效率和政策性能。- KL、熵和长度正则化的最优选择和形式仍是开放性问题,各自影响政策优化和可扩展性。 ——目的:防止灾难性政策漂移
经典KL正则化:

用于以下两种情况:1)当前策略 πθ与参考策略 πref之间;2)当前策略 πθ与旧策略 πold之间。
β是一个超参数,用于调节正则化强度,求和项表示对生成序列中每个令牌的KL散度进行累加,作用是防止策略在训练过程中偏离太远,避免模型“遗忘”初始知识或产生不稳定行为。
在RLHF中,KL正则化常用于对齐任务,确保模型输出符合人类偏好。
然而,在用于LLM推理的RL上下文中(这比标准RLHF更具挑战性),这种KL正则化的必要性需要重新考虑。最近,许多研究指出,策略在训练期间需要自由探索,因此可能与初始化显著偏离以发现新的CoT(思维链)结构,使得KL约束成为不必要的限制。
所以,KL正则化是RL训练中的双刃剑:它通过防止策略突变来提升稳定性,但也可能阻碍模型探索新能力。
熵正则化:
其目标是在强化学习的损失函数中加入一项,鼓励模型保持一定的熵值,防止其变得过于“确定”而停止探索。
与传统RL不同,在LLM训练中直接使用熵正则化存在争议。因为它可能引入不稳定性,特别是在奖励信号稀疏时,甚至导致训练崩溃。所以可以针对性训练:如Wang等人只对高熵的token(模型不确定的地方)进行强化训练;或者将熵的考量融入优势函数的计算中(改进优势估计)
长度惩罚:
复杂的推理任务(如数学、编程)需要长的思维链,但这会导致高昂的推理计算成本,所以目标是在不显著牺牲模型性能的前提下,控制或缩短模型生成的推理链长度。
采样策略
在LLM的RL微调中,有,一种至关重要的效率优化技术:采样。
术语rollout:“让当前策略与环境互动一次,从初始状态一路跑到终止状态,产生完整的一条轨迹的过程
为什么需要动态采样?
在传统RL训练中,模型通常与环境(或模拟环境)进行大量交互来收集数据。对于LLM而言,“环境交互”就是针对大量不同的提示(问题)生成回答(思维链),这个过程(即 rollout)计算成本极高。
如果对所有提示都“一视同仁”地投入大量计算资源进行采样和训练,将是极其低效的。例如,对于模型已经完全掌握的简单问题,继续训练是浪费;对于当前模型完全无法解决的超难题,训练也难有进展。——所以需要动态采样。
它的核心包括两个:选什么(选择哪些提示进行下一轮的rollout)和投多少(为每个被选中的提示分配多少资源,比如响应次数)
重点是效率导向的采样:
PRIME:采用在线过滤。直接丢弃太简单(模型总能做对,无法提供有效梯度)和太困难(模型完全做不对,梯度信号混乱或无意义)的问题,只保留中等难度的问题进行训练。
DAPO:采用过采样与过滤。它会生成大量数据,但只筛选出那些结果既非“全对”也非“全错”的提示对应的数据(即存在正例和负例的数据批次),这确保了用于更新模型的数据能提供明确的学习方向(非零优势)。
还有以探索为导向的采样和结构化采样(不仅控制采样的内容,还控制推理轨迹的拓扑结构,使生成、信用分配和计算复用与问题解决的基本结构对齐)等等
采样超参数
摘几个key:
对于温度,策略差异显著。一些工作提出动态方法,例如分阶段温度增加(例如,对于4B模型使用 1.40→1.45→1.50,对于7B模型使用 0.7→1.0→1.1,以随着训练的进行逐渐扩展轨迹多样性;
几乎所有作品都难以管理生成响应的长度,以平衡性能和成本。最普遍的策略是分阶段增加上下文长度 。这涉及使用较短的上下文窗口(例如,8k,初始的短上下文阶段被认为是必要的,因为它迫使模型学习更简洁和高效的推理模式)开始强化学习,然后逐步增加它到16k,24k或32k;
基础问题部分
强化学习的作用:精炼或发现
争论的焦点在于:RL究竟是一个“优化器”还是一个“探索者”?
锐化:将RL视为一个精炼过程,好比学生通过“刷题”和“错题复习”来巩固和优化已知知识,使其表达更精准,但并未学习全新的解题方法。
发现:将RL视为一个创新过程,好比科学家通过实验和探索发现全新的定律,RL能引导模型产生预训练阶段完全不具备的推理能力或解决方案。
总结(提出了个统一框架):
“锐化”和“发现”不再是矛盾体,而是同一过程在不同侧面的体现:
锐化:源于RL中反向KL散度的“模式寻求”特性,它能高效地将模型优化到已知的高奖励区域。
发现:源于RL框架内在的隐式奖励学习和序列决策能力。当训练充分、正则化得当时,模型能够通过组合旧有能力来探索并固化新的、高性能的行为模式。
RL与SFT:泛化还是记忆
Chu等人.[2025a]在文本和视觉环境中得出了直接结论,指出“SFT记忆,RL泛化。”
SFT容易“记忆”训练数据的表面模式,而RL通过优化长期奖励,更可能学习到可迁移的、本质的推理模式。
比如DeepSeek-R1证明,纯粹的RL训练可以自发地涌现出高级推理行为,如反思和验证。
在面对极端分布偏移或严重过拟合的基座模型时,RL可能失效。在这种情况下,精心设计的SFT(如使用动态缩放等技术)反而能更好地为模型打下基础,成为有效的RL训练“下界”。
所以更好的策略是SFT和RL融合:SFT善于引入新知识/能力,RL善于巩固和优化现有能力
模型先验:弱先验和强先验
“可以从三个角度总结模型先验如何从根本上塑造LLM训练中的RL结果:1) 基础模型始终作为RL起点优于指令微调模型,DeepSeek- R1和Open- Reasoner- Zero通过极简配方展现出涌现出推理能力;2) 模型系列表现出非对称的RL响应性:Qwen模型即使在虚假奖励下也能获益,而Llama/OLMo模型需要小心地进行中期训练,采用退火学习率和高质量数学/代码数据注入;3) 强力蒸馏模型可以从RL中受益,但需要更复杂的课程设计和多目标优化。”
奖励类型:过程或结果
核心问题是:如何提供有意义的奖励?——结果奖励和过程奖励
对于具有挑战性的数学和编程任务,结果奖励是最简单且最具可扩展性的方法;过程奖励天然地有助于长链信用分配。
总体而言,结果奖励提供了“具有自动验证的可扩展目标对齐”,而过程奖励则提供了“可解释的密集指导”。将两者结合,例如通过隐式过程建模 或生成式验证器,可能代表了奖励设计中一个有前景的未来方向。
训练资源部分
静态语料库
数据集覆盖范围涵盖四个主要方向:数学、编程、STEM和代理任务
以数学为中心的强化学习数据集主要围绕三种构建流程,包括标注/验证、蒸馏和多源合并,同时广泛暴露中间推理轨迹,涵盖从数百到数百万个示例的规模。
面向代码的强化学习数据集主要分为三类:程序修复/编辑、算法竞赛问题和带推理的通用代码合成。这些数据集通常提供可执行的单元测试和中间执行轨迹,便于奖励塑形和过程级评估。
面向STEM的RL数据集通常集中在三个主题:教科书或课程提取、跨学科大规模推理以及领域专用语料库(例如化学和医学)具有合并和蒸馏管道。
……略
动态环境
现有的静态RL语料库,无论是手动标注、半自动标记还是从网络上抓取,对于训练需要更高级和泛化推理能力的模型来说越来越不足,用于LLM的可扩展RL需要转向合成或生成数据以及交互式环境,例如各种gym和世界模型。
与传统推理语料库不同,这些动态环境代表了一种范式转变。它们能够实现数据的自动化和无限合成,或提供针对模型整个推理过程的分步级、多轮反馈。
强化学习基础设施
讲一些开发框架。目标是高效协调两个计算密集型且相互依赖的过程:智能体数据生成:让智能体(如LLM)与环境交互,生成大量训练数据;策略训练:利用生成的数据来更新和优化智能体的策略。
略
应用部分
编码任务
又被细分为代码生成、软件工程辅助和代理式编码。
代码生成:在DeepSeek- R1中展示了强化学习在复杂推理方面的潜力后,越来越多的研究将强化学习应用于代码生成。启发来源包括程序设计竞赛,领域特定代码(SQL)等等
进一步扩展:包括代码修复与质量改进、仓库级代码生成(强调在复杂的跨文件和跨模块依赖关系中保持一致性和可维护性)等等
智能体任务
最近的研究利用强化学习来帮助大型语言模型掌握工具并完成更复杂的问题,即工具调用(又分为编码代理、简单搜索代理、浏览器使用代理、深度研究、GUI 和计算机使用代理以及其他任务。)
一些有意思或者说可以利用的:
代码代理:一种常见做法是将RL集成到具备执行和验证能力的代码代理中,并在SWE-Bench等真实基准上进行评估。SWE-RL [Wei等人,2025c]将GRPO应用于补丁生成-执行-修正循环,实现持续策略优化,并提升数学推理、通用代码生成和跨域任务能力。EvoScale (Satori-SWE) [Zeng等人,2025b]允许代理自主提升补丁质量,无需外部验证器。Kimi-K2 [团队,2025d],Qwen3-Coder和GLM-4.5等RL增强模型展现出更强的代理行为,促进更高自主性和可扩展性。Sinha等人[2025]研究LLM中的长时程执行,并证明单步准确性的提升并不必然转化为成功的多步任务性能,这是由于误差累积所致。这些进展表明,将RL与代理式编码结合正在推动从“单步生成”向“自主迭代”的转变。
工具集成推理:另一个RL的新兴应用是工具集成推理(TIR),它通过紧密耦合自然语言推理与外部工具执行环境来增强LLM的代码推理能力。这种方法使模型能够生成、执行和验证中间代码或程序输出,减少错误并提高可验证性。代表性工作如ARPO [Dong等人,2025b],AutoTIR [Wei等人,2025b],CoRT [Li等人,2025b],以及ToRL [Li等人,2025q]采用了类似的策略:模型使用SFT或RL(主要是GRPO或变体)进行后训练,输出结构化(例如,<代码>…</代码>)以触发工具执行,并将结果反馈到推理循环中。
搜索代理:通过结构化提示、多轮生成以及与在线搜索引擎(例如Google)或静态本地语料库(如维基百科)[Jin等人,2025a,b,Song等人,2025a]的集成,LLM可以被训练为搜索代理。
深度研究代理。深度研究被引入用于从各种在线来源收集信息,以帮助解决现实世界中的问题,例如报告生成。WebThinker[李等人,2025m],使用迭代DPO进行训练,利用LRM的长期连续能力,使用深度网络探索器以及一个LLM写作者来完成具有挑战性的任务。Kimi- Searcher[AI,2025]识别了多代理的困境,并自动构建密集的工具使用数据,以端到端训练单个代理模型,在HLE[Prabhudesai等人,2025]上取得了优异的性能。Jan- nano[Dao和Vu,2025]通过多阶段RLVR消除了对冷启动或SFT的需求,分别专注于工具调用、回答质量和扩展响应长度。MicroThinker[团队,2025e]使用SFT和DPO训练Qwen3[吴等人,2025a],增强了其在现实世界应用中的性能。最近,WebWatcher被提出[耿等人,2025],它是一个多模态深度研究模型,能够使用外部工具和视觉信息来解决极其复杂的问题。Atom- Searhcer[邓等人,2025b]利用一个LRM作为PRM,在训练过程中提供细粒度的奖励信号,取得了更好的性能。
还有GUI代理等等
多模态任务
与语言场景相比,多模态理解需要强大的空间感知和跨模态语义对齐。
对于强化学习而言,已开发出特定的优化方法来增强空间感知和跨模态可控性等
贴两个有意思的方向:
视频理解中的强化学习:将视频理解能力扩展到解释和推理动态视觉内容对于多模态理解至关重要。为实现这一目标,Video-R1 [Feng等人,2025b]介绍了一个用于视频多模态大型语言模型(MLLMs)的系统强化学习框架,使用时间感知GPRO算法(T-GRPO)来提高时空推理能力。ReAd-R [Long等人,2025]提出一个基于规则的强化学习优化框架,用于模拟人类启发式思维以实现广告视频理解。Focused Thinking [Dang等人,2025]采用一个基于token权重的奖励方案,修剪冗长、通用的思维链,并使用分级(部分评分)奖励来增强视频推理能力。VQ-Insight [Zhang等人,2025o]设计了具有通用任务特定时间学习的分层奖励,在长视频上进行问答过程。为了从第一人称视角理解人类日常生活,Ego-R1 [Tian等人,2025]通过强化学习训练一个思维链智能体,通过动态调用检索和视觉工具进行逐步推理,以处理超长第一人称视频(长度为几天或几周)。类似地,LongVILA [Chen等人,2025t]的Long-RL框架构建了一个大型LongVideo-Reason数据集,并设计了一个具有序列并行性的专门两阶段CoT-SFT和强化学习管道,使MLLMs能够处理超长视频。为了自动化更多视频思维链数据的创建,VideoRFT [Wang等人,2025l]使用一个LLM从丰富的视频描述中生成初始推理,并通过VLM进行细化,并引入一个语义一致性奖励来使文本推理与视觉证据保持一致。同时,VideoChat-R1 [Li等人,2025o]表明,有针对性的多任务强化学习微调可以显著增强特定时空技能,而不会降低一般聊天性能。
图像生成中的强化学习:扩散模型已显著推进视觉生成 [Esser et al., 2024, Liu et al., 2023b, Rombach et al., 2022], 并且越来越多的研究将去噪步骤视为CoT轨迹,通过强化学习隐式地执行推理[Liu et al., 2025d, Pan et al., 2025b, Xue et al., 2025a]。然而,GRPO在扩散模型中的常微分方程(ODE)采样中表现出固有的冲突。具体来说,GRPO依赖于随机采样来估计优势,而ODE采样遵循确定性去噪轨迹,这限制了rollout样本的多样性。为了解决这个问题,采用了ODE到SDE的转换[Liu et al., 2025d, Wu et al., 2025a, Xue et al., 2025a]来鼓励采样过程中的随机项。考虑到SDE的低效率,MixGRPO [Li et al., 2025e]通过SDE和ODE的集成设计了混合采样策略。此外,TempFlow-GRPO [He et al., 2025g]明确利用流模型中的时间结构,实现更精确的归因和策略优化。最近,GPT-4o在文本保真度和编辑一致性方面表现出强大的能力[OpenAI, 2024],激发了对自回归模型可控性的兴趣。基于大规模图像-文本训练数据,SimpleAR [Wang et al., 2025j]直接应用GRPO进行后训练,并在高分辨率图像生成中取得了显著性能。为了加强对空间关系和数值一致性等细粒度属性的关注,FocusDiff [Pan et al., 2025e]构建了仅在细微属性变化上不同的成对数据集,并使用它们来训练生成模型。此外,RePrompt [Wu et al., 2025f]将一个额外的多模态理解模型集成到图像生成框架中,并使用GRPO对其进行训练以改进提示。同时,T2I-R1 [Jiang et al., 2025b], GoT-R1 [Duan et al., 2025], 和 ReasonGen-R1 [Zhang et al., 2025t]将提示改进和图像生成统一在单个模型中,利用GRPO进行联合优化。
将 RL 应用于帮助模型对复杂图表进行推理并为特定领域图像生成生成结构化代码是一项有前景的应用。
(这让我想起了有篇关于大模型处理结构化图表的论文,不过名字忘了)
多智能体系统
将RL应用于MAS(多智能体系统)已成为一个突出和前沿的研究方向。
有意思的点:
研究人员提出了集中式训练与分散式执行(CTDE)范式[Lowe等人,2017],在该范式下,智能体在训练阶段共享全局信息以优化策略,而在执行阶段则完全依赖局部观察进行决策。(感觉robofactory是不是用了这个思想)
MARL的信用分配问题中,研究人员利用LLM设计直观的奖励分配机制,从而提高了信用分配的准确性和可解释性。Zhang等人[2023b]通过使LLM能够实时推断每个智能体的意图并生成下一个合作计划,显著提高了稀疏奖励场景中的多智能体协作效率。Ding等人[2023]利用LLM将自然语言任务描述解析为可执行的实体级子目标,从而实现了奖励塑形和政策共享,有效缓解了MARL中的信用分配问题(加粗的思想或许可以学习?)
机器人任务
几个经典的sota算法:GRPO、PPO等都实现了卓越的效果;
RL已在机器人学中得到了广泛应用,主要集中于三个领域:机器人控制、视觉与语言导航(VLN)以及机器人操作任务。
机器人操作任务,使机器人在真实环境中解决各种操作问题,代表了具身智能最具挑战性和基础性的方面 [Firoozi 等人,2025]。这些任务不仅要求对视觉和文本信息有全面的理解和细粒度的运动控制,还需要物理推理、长时程规划和逻辑推理能力。利用 LLM 和 VLM 卓越的文本和视觉处理能力,一些研究已经探索将这些模型作为操作任务的核心组件,结合动作模块,例如 RobotBrain。
视觉- 语言- 动作模型。最近,通过统一的端到端训练将 VLM 主干与动作模块集成的视觉- 语言- 动作(VLA)模型已成为最有希望的解决方案,并成为机器人操作的主流方法 [Zhong 等人,2025]。当前的 VLA 模型遵循一个两阶段范式 [Sapkota 等人,2025]:在多模态数据(例如,Open X- Embodiment [O’Neil 等人,2024])上进行预训练,然后在远程操作的机器人轨迹上进行监督微调。然而,这种模仿学习范式存在关键限制:其性能严重依赖于高质量轨迹数据,而收集这些数据既昂贵又低效,并且生成的模型对未见过的场景泛化能力差。鉴于 VLA 和 LLM 在架构、规模和方法上的相似性 [Zhong 等人,2025],将 LLM 风格的强化学习方法应用于 VLA 训练为解决数据稀缺和泛化挑战提供了一个有希望的途径。(确实如此)
还有前沿工作已开创性地将 DeepSeek- R1 的方法应用于 VLA 训练。(deepseek论文真得读一读)
医疗任务
构建可信、具备推理能力的医疗基础模型是该领域的未来关键方向。
未来方向部分
强化学习持续作用于LLM
为了在基于强化学习的后训练过程中提升大型语言模型的多领域性能,主流方法是混合不同任务的数据并统一训练。在合成数据,多阶段强化学习已被证明不如混合数据训练表现好,甚至增加难度的课程学习在强化学习中可能也不是必要的。然而,Chen等人[2025d]建议跨不同任务的多阶段强化学习在泛化到困难或未见过的问题上具有优势。尽管多阶段强化学习的有效性存在持续争论,但随着该领域向构建必须在动态环境中适应不断变化的数据和任务的AI系统发展,探索持续强化学习(CRL)用于大型语言模型变得必要。
基于记忆的LLM强化学习
所谓的大模型的memory方向
基于模型的LLM强化学习
将世界模型与基于LLM的智能体的强化学习无缝集成仍然是一个开放的研究问题。因此,基于LLM的基于模型的强化学习正成为未来研究的一个特别有前景且可扩展的方向。
教模型实现高效推理
两方面,推理时扩展提升了 LRM 在困难任务上的准确性,但也引入了系统性的过度思考(对简单实例进行不必要的长推理链);在激进截断下,思考不足(过早停止并依赖脆弱的捷径)。
教模型在潜在空间推理
CoT通过提示模型阐述中间步骤来鼓励逐步推理,提高了可解释性和准确性。最近的研究将 CoT 和 RL 结合起来,以进一步提高推理质量,它在回答之前对长文本思维进行采样以进行建模。
然而,当前的实现通常依赖于标记级别的采样。在一个离散的标量空间中,这可以作为瓶颈,因为在连续空间中丢失了有意义的语义信息。最近提出的一种方法,名为潜在空间推理(LSR),可能对RL优化更加友好。LSR在LLM的连续潜在空间中执行推理,促进更细致和流畅的语义推理。这一特性有助于更平滑的学习动态,并更好地与RL技术集成。RL和LSR的结合对未来开发更强大和适应性更强的推理模型具有巨大潜力。然而,评估连续潜在思维的质量比评估基于标记的思维更具挑战性。这将使提供准确的监督信号(如奖励和优势)变得更加复杂,这将成为LSR和RL结合的一个开放性挑战。
确实,metaai的coconut可以在这方面提升?
LLM的强化学习预训练
略
完结撒花~