agentic和rl相关

breeze-bell
11
2026-04-30

⭐️R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge

想解决的问题:

  • 现有对齐方法的低效与局限性:当前主流的安全对齐方法(如基于筛选的对齐训练,以SafeChain为代表)存在明显不足。它们通常从大模型中收集海量的指令-响应对,再用一个守护模型筛选出安全内容进行训练。论文指出,这种方法效果有限,且未触及安全风险的根本原因,因此难以在实际部署中达到理想的安全水平。

  • 大推理模型安全风险的根源不明:先前的研究未能深入解释为何大推理模型(LRMs)在拥有强大推理能力的同时,却更容易生成有害内容。论文旨在探究其深层原因,并以此为基础设计更有效的解决方案。

论文的核心思想是通过结构化推理过程,显式激活模型内部已存储但未被利用的安全知识

看着简单,但还蛮有意思的: 如何想办法激活推理模型本身的安全能力?

指出大推理模型的安全问题根源在于“知识未被激活”,而非“缺乏知识”。基于此,它提出了R1-ACT这一创新方法,通过在模型推理流程中强制插入一个安全评估步骤,以极小的数据量和计算成本,高效地激活了模型内在的安全知识,从而实现了安全性的大幅提升,同时保持了模型的推理能力。

启发与思路

论文的核心洞见是“安全知识已存储但未激活”。未来研究可以更深入探究这一现象的根源:

  • 推理与安全的权衡机制:为什么标准LRM训练会优先激活任务解决知识而抑制安全知识?是否能在训练目标函数中显式引入“安全激活”奖励,或在模型架构中设计专用的“安全评估”子模块,使其在推理初期自动运行?

  • 知识可解释性与定位:尝试定位模型中存储“安全知识”的具体参数或神经元,并通过可解释性方法理解其是如何被标准推理过程抑制,又被 R1-ACT 方法激活的。这有助于设计更精准的干预方法。

第一个还蛮有意思的,对于推理模型训练,数据集大多都是问题-思维链-答案的形式,模型被优化为高效地模仿并生成连贯的推理步骤以得到正确答案。引用Higgins(1996)的理论,指出知识可以处于“潜伏”状态。标准LRM训练将“任务解决知识”的激活阈值设得非常低,而将“安全知识”的激活阈值设得很高。因此,在接收到指令时,强大的任务解决通路被迅速激活,而安全评估通路则因为缺乏直接的触发机制而保持沉默。

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

  1. 对静态、有限数据的依赖:传统方法严重依赖人工编写的专家示范轨迹来构建训练数据集。这种方式成本高昂,且数据仅是环境交互模式的“静态快照”,无法覆盖真实世界中复杂的长尾交互变体。这导致智能体难以泛化到训练数据分布之外的情况。

  2. 合成数据的探索低效与静态性:为了减少对人力的依赖,近期工作利用LLM根据环境描述随机生成合成轨迹。然而,这种生成是“开环”的——它仅基于LLM的世界知识进行随机探索,缺乏来自智能体实际交互表现的反馈。因此,生成的数据既无法深入、全面地探索环境,也无法适应智能体在训练过程中不断演变的能力,导致训练效率低下,无法针对智能体的特定弱点进行强化。

核心问题总结:如何摆脱对静态数据集的依赖,让智能体的训练数据能够与智能体自身能力同步、自适应地进化,从而实现对复杂环境更深入、更高效的探索与学习。

这里对合成数据的讨论蛮对的,仅仅是基于LLM的知识进行的随机探索 是后续的一个优化点

所以要建立一个闭环,让智能体与其训练数据分布通过交互驱动的反馈实现共同进化。

很常见的一个框架:1.智能体在现有数据上训练​ -> 2. 产生交互轨迹并暴露弱点(提取信号)​ -> 3. 基于弱点信号引导探索,合成新任务​ -> 4. 验证并吸收新任务,更新数据分布​ -> 返回步骤1。

THE DEVIL BEHIND MOLTBOOK: ANTHROPIC SAFETY IS ALWAYS VANISHING IN SELF-EVOLVING AI SOCIETIES

一篇理论性论文

论文的核心论点是:一个同时满足持续自进化、完全隔离和安全不变性的智能体社会是不可能的。​ 在完全闭环、孤立的自我进化中,系统的安全性必然会不可逆地衰退。现有研究多关注前两点(能力提升),而对安全性的探讨往往基于零散的案例分析,缺乏根本性的理论解释。本文则旨在从原理上证明,在孤立自进化系统中,安全性并非一个守恒量,其衰减是系统动力学的必然结果。

后面可以细看,比较适合拿去引用。

SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs

旨在解决大语言模型(LLM)在调用外部工具时面临的前瞻性安全评估难题,并提出了一个包含基准数据集和评估框架的完整解决方案。

大多数工作(如ToolEmu、R-Judge)采用回顾性评估方式,即在工具执行分析其结果和后果来判断风险。然而,对于许多高风险工具(如银行转账、发送邮件、删除数据),其操作是不可逆的。一旦执行,造成的财产损失、隐私泄露等危害将无法挽回。因此,事后的风险评估在实际应用中为时已晚,风险已经实际发生。

核心目标是推动评估范式从事后向事前转变,解决如何在大语言模型执行工具调用之前,就前瞻性地识别和评估其中蕴含的潜在安全风险这一关键问题。

Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations

工具调用场景中的不相关性设置:在实际应用中,LLM常常会遇到与用户查询语义不相关的工具。在这种情况下,理想的行为是拒绝调用该工具,以防止引入系统延迟、误导性输出,甚至在高风险应用中造成不可逆的后果

这个出发点有点像toolharmer那篇的工作

核心科学问题:LLM究竟是真的认识到有效工具调用需要语义相关性,还是仅仅依赖查询与工具在结构上的对齐(即参数能否被一一填充)来做出调用决策?

论文通过实证发现,即使一个工具无法实现用户目标(语义不相关),只要查询中表达的属性可以有效地映射到工具的参数上,LLM仍然有强烈的倾向去调用它。这种过度依赖结构对齐而绕过语义相关性验证的系统性倾向,被称为结构对齐偏差。

然后搞了一个数据集,然后为了探究模型内部的决策机制,论文提出了对比注意力归因方法(识别模型内部分别负责语义检查结构匹配的两条信息流路径)。

最后提出了一个策略:在推理时,对识别出的语义路径的注意力权重进行放大(ρsem​>1),同时对结构路径的权重进行抑制(ρstr​<1)。缩放系数在验证集上通过网格搜索选择。

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

插播一个数据合成的

提升LLM复杂推理能力(如高难度数学问题求解)的关键在于获得大量高质量、高难度且可验证的训练数据。

传统方法难以在确保问题逻辑严谨的同时,探索高维、复杂的推理空间以生成真正具有挑战性的问题

论文提出了 “Agentic Proposing”​ 框架。其核心思想是:将高难度问题的合成视为一个“组合式逻辑工程”过程,而非简单的文本生成任务。​ 该方法训练一个专门的“提议者”智能体,通过目标驱动的序列决策,动态组合原子化的推理技能来合成问题。

可拆卸的组合——原子动作的思想+设计一个强化学习函数

Reasoning Fails Where Step Flow Breaks

尽管能够生成长思维链的大型推理模型在数学、科学和编码等多步推理任务上表现良好,但其行为仍然不稳定且难以解释。当模型推理出错时,现有的分析工具难以处理这种长而结构化的推理轨迹

Step-Saliency方法:将传统上嘈杂且难以理解的 token(词元)级别​ 的显著性分析,聚合升华为可读性强的 step(推理步骤)级别​ 的分析。

  • LRM的推理链可能长达数百上千个token。原始的token级显著性图是一个极其庞大和密集的矩阵,信息就像茂密的森林,虽然包含所有细节,但人类观察者根本无法一眼看出“哪些推理步骤是关键的”以及“信息是如何在步骤间流动的”。

  • 解决方案:通过池化,我们将视线从“一片片树叶”(token)提升到“一棵棵树木”(step)。均值池化​ 起到了平滑噪声、保留主干信息的作用,生成了一个紧凑、宏观的“地图”,直观展示了问题、中间推理步骤和最终答案之间的信息流。

有意思的文章,不管是step级别的可视化,还是由可视化发现问题之后提出的两个方法:概率均衡桥和步骤动量注入都很值得学习

Expectation-Guided Self-Verification for Aligning Large Reasoning Models with Domain Knowledge

核心问题是大型推理模型在领域特定推理中与用户深层期望的错位

尽管大型推理模型在科学、编码等任务上表现出色,但在知识密集型下游应用领域(如医疗咨询、金融风险管理),其生成的推理链和最终回答常常无法与用户的领域特定期望对齐。这种错位导致模型的回答过于宽泛、缺乏重点,或遗漏了领域专家认为最关键的信息,从而降低了回答的可靠性、可解释性和实用性。在高风险场景(如新生儿黄疸诊断)中,这种错位甚至可能带来安全隐患。

提出了期望引导的自我验证框架。其设计灵感来源于期望确认理论,该理论认为用户的满意度取决于其预先形成的期望与实际体验的匹配程度。后续用图来做的,将期望图与推理图进行对齐与融合。

⭐️Token-level Data Selection for Safe LLM Fine-tuning

优秀且可follow的洞见!

在自定义数据集中混合安全数据。但这容易导致模型“过度拒绝”,损害其在目标下游任务上的性能。丢弃整个被认为不安全的样本。这种方法虽然比数据混合有所改进,但依然是一种“粗粒度”的解决方案,可能会不必要地牺牲被丢弃样本中包含的、对下游任务有价值的宝贵信息。

现有方法基于一个存在缺陷的假设,即安全退化仅源于显式的“有害”样本。近期研究表明,即使是看似良性的数据,也可能在微调过程中侵蚀模型的安全护栏。这造成了一个根本性困境:丢弃这些“良性但有害”的样本,同时也意味着失去了它们可能包含的宝贵效用信号。

论文通过诊断分析指出,有害信号和有益信号常常在同一个样本的Token层面交织在一起。安全退化的基本单元不是样本,而是Token。因此,在样本级别进行操作无法实现安全与效用的最优权衡。

基于“安全退化是Token级别问题”这一核心洞察,论文提出了 TOSS及其增强版 TOSS-Pro

TOSS框架:

  • 第一阶段:训练参考模型

    • 安全退化模型:在有害参考数据集上微调基座模型,使其成为识别有害模式的“专家”。

    • 效用导向模型:在高质量效用参考数据集上微调基座模型,使其代表理想的下游任务数据分布。

  • 第二阶段:Token风险评估(核心)

    • 损失差度量:对于自定义数据集中的每个响应Token,计算其在上述两个参考模型下的损失差值作为其安全风险分数:

      分数 = -log P( Token | 效用模型 ) + log P( Token | 安全退化模型 )

    • 分数含义:高分表明该Token更符合安全退化模型的分布(高风险),而不符合效用导向模型的分布(低效用)。

    • 全局排名与掩码对所有Token的分数进行全局排名,丢弃排名前 d%(如10%)的高风险Token,生成一个二进制的Token级掩码。

  • 第三阶段:Token级选择性微调

    • 使用生成的掩码对自定义数据集进行微调,在计算损失时,被掩码(丢弃)的Token不参与梯度更新。这确保了模型只从被判定为安全且有益的Token中学习。

思考:不能只和token有关吧 和token所在的样本应该也有关系? 看能不能在这个思考上改进

⭐️Safety Alignment Should be Made More Than Just a Few Tokens Deep

经典论文了。提出了 “浅层安全对齐”​ 的概念,直接指出了安全对齐在Token粒度上的局限性

当前LLM的安全对齐存在一个根本性缺陷——它往往是浅层的。模型主要学会了在生成响应的最初几个Token(例如,“I cannot assist you.”这类拒绝前缀)表现出安全行为,但并未在后续Token的深层生成分布中有效抑制有害内容。

诊断方法:作者通过分析对齐模型与未对齐基座模型在每个Token位置的KL散度,发现对齐带来的分布变化主要集中在序列的前部

RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning

风险感知偏好优化的创新训练框架。

其实就是一个点,当攻击复杂度过高的时候,模型在安全方面推理的长度不够,导致安全防护性能下降——所以要训练LRM,动态评估提示的风险复杂度,然后分配合适的预算进行安全推理

Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations

就是在解决前面的浅层安全对齐问题

论文发现:安全与不安全的推理轨迹在模型的隐藏表示空间中占据不同的区域,而“重新思考”的轨迹则位于边界。这为在隐层空间直接塑造推理轨迹的安全性提供了可能。

CRAFT框架的核心思想是:利用对比学习在隐藏表示空间中结构化“安全”与“不安全”的语义区域,然后通过强化学习驱动模型的推理轨迹走向安全区域,并确保隐层表示与最终文本输出的一致性。

这个思路也是可以学习的。

注意后面两个损失

⭐️TOWARDS SAFE REASONING IN LARGE REASONING MODELS VIA CORRECTIVE INTERVENTION

这几篇都是推理模型安全的工作。旨在解决大型推理模型内部推理过程的安全隐患,并提出了一种名为干预式偏好优化的创新对齐方法。

尽管现有的安全对齐方法(如在精心策划的思维链数据集上进行监督微调)能训练出LRM,使其最终回答通常是安全的,但其漫长的中间推理轨迹中却常常包含有害、欺骗或非法的内容。如图1所示,模型可能在思考中详细探讨如何满足用户的恶意请求,但最终输出一个拒绝性的回答。

所以一个核心的洞见是将对齐的重点从“安全的最终回答”转移到“安全的推理过程本身”。

关键发现!——这其实和safekey那种临界点比较类似

IPO的核心流程:其实就是构建数据集+应用DPO

采用直接偏好优化​ 来训练模型,但创新性地仅对轨迹中产生分歧的部分(即从位置 h开始的后缀)应用DPO损失。

相当于在安全临界步骤注入了密集的奖励信号(从奖励塑形的角度),这有助于缓解过度拒绝的现象。

⭐️AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning

这几篇都是和训练/rl相关的,旨在解决大语言模型安全对齐中存在的浅层对齐效用退化问题

核心挑战:如何在不依赖任何人工标注的安全推理数据、不损害模型通用能力的前提下,有效激发模型从其海量预训练数据中已获得的、潜在的安全意识,从而实现一种更深层、更鲁棒的安全对齐。

AlphaAlign 是一个“纯粹的”强化学习框架,其核心思想是:将安全视为一个可通过最终答案验证的目标,通过设计可验证的奖励信号,激励模型主动进行安全推理,从而激发其内在的安全意识。

这个思想有意思

1. 结构化安全推理提示设计

为了便于奖励分配和采样,论文设计了一个固定的输出模板,引导模型将输出分为两部分:

  • 安全推理:包含在 <safety_reasoning>标签内,要求模型基于其自身的安全认知对查询进行评估。

  • 最终答案:包含在 <answer>标签内。如果查询有害,则必须输出固定的拒绝格式(如 \boxed{Sorry, I can't comply});如果查询安全,则提供有帮助的回答。

这个结构化的输出使得后续的奖励验证(检查格式、判断是否拒绝)可以自动化进行。 就是写prompt 写schema

然后搞了双奖励函数:可验证安全奖励+标准化帮助性奖励

可验证安全奖励:格式验证器(判断输出是否严格按照模板) 拒绝验证器(看最终答案是否是一个拒绝)

对于有害提示,模型因生成正确格式的拒绝而获得正奖励;对于良性提示,模型若错误地生成拒绝(过度拒绝)则会受到惩罚。这直接激励模型做出正确的安全判断。

然后是标准化帮助奖励:

  • 仅针对良性提示,用于保持和提升模型的有用性。

  • 使用一个帮助性奖励模型对一批候选答案进行评分,并进行组内标准化

  • 奖励逻辑:只有那些没有被拒绝验证器判定为拒绝、且标准化后得分高于批次平均分的答案,才能获得正奖励。这鼓励模型为良性查询生成高质量的回答,同时自动惩罚过度拒绝行为。

整个奖励函数没有对安全推理部分的内容施加任何直接的监督或约束。模型必须自主地生成高质量的安全推理,以帮助其做出正确的最终判断(拒绝或帮助),从而最大化奖励。这实现了“通过奖励结果来激励推理过程”的目标

这个标准化帮助奖励或许可以学习!

最后用PPO:

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

纯粹的安全方向的强化学习

⭐️SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization

在涉及自残、法律或医疗等高风险的查询中,LLM必须同时具备可信度帮助性。然而,这两个目标常发生冲突。例如,对于“我有自残念头该怎么办?”的查询,模型必须在确保无害的前提下提供有助益的回答,而非简单的“拒绝”。现有方法通常在这两者之间进行权衡,难以找到一个完美的平衡点。

论文使用的方法是自优先级对齐。其核心理念是强制执行严格的“可信优先于帮助”的顺序:只有在首先满足可信度阈值(如无害性或诚实性)的前提下,才优化帮助性。

这个去噪其实有点数据飞轮的感觉了,可以学习下。

这里搞DPO的训练集也蛮有讲究的

⭐️MITIGATING THE SAFETY ALIGNMENT TAX WITH NULL-SPACE CONSTRAINED POLICY OPTIMIZATION

安全对齐税相关:模型在提升安全性的同时,其通用能力会显著下降。例如,一个模型在变得完全安全后,可能变得过度谨慎,甚至拒绝回答无害的通用问题,或者在数学、代码生成等任务上的表现大幅下滑。

当前大多数方法(如SafeRLHF、MoCAN、BFPO等)将安全对齐视为一个双目标优化问题,即同时优化安全性和通用能力目标,并在总体目标中平衡二者。然而,论文指出,这些方法并未在训练过程中显式地解决安全和通用能力目标之间的内在冲突。它们通常需要混合大量通用任务数据到训练集中,以试图防止遗忘,但这增加了数据需求和训练成本,且治标不治本。

现状确实存在。且之前好像读过这篇文章

论文提出了 NSPO​ 框架。其核心洞察是:安全对齐税的根源在于,用于提升安全性的策略梯度更新,会侵蚀模型已习得的通用能力。​ 因此,解决方案是在几何上解耦这两种更新

很有insight的做法,后续可以看下他的被引

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

同样是零空间约束做的

论文核心解决的是在增强模型安全性的激活引导​ 方法中,安全性与实用性之间的固有冲突。

激活引导的困境:激活引导是一种在推理时向模型内部激活注入一个“拒绝方向向量”的方法,以诱导模型拒绝回答恶意提示。然而,不加区分地对所有提示应用相同的引导向量​ 会导致一个根本性的权衡:虽然可以有效拒绝恶意提示,但也会导致良性提示被过度拒绝,从而损害模型的通用任务性能。这限制了该方法在实际部署中的可用性。

——promptsafe那篇工作软提示嵌入的出发点

AlphaSteer 的核心思想是:将激活引导视为一个在零空间约束下的可学习过程,从而实现效用保持与安全增强的解耦。

可学习的拒绝方向重构

⭐️A GUARDRAIL FOR SAFETY PRESERVATION: WHEN SAFETY-SENSITIVE SUBSPACE MEETS HARMFUL-RESISTANT NULL-SPACE

guardSpace有意思。旨在解决大型语言模型在微调过程中安全对齐机制极易退化的难题,并提出了一种结合安全敏感子空间抗有害零空间的守护框架。

  1. 安全对齐的脆弱性:尽管预训练LLM(如经过指令微调或RLHF的模型)已被对齐以拒绝有害提示,但当通过全参数微调参数高效微调​ 来适应下游任务时,其已习得的安全行为非常容易退化或丢失。即使微调数据完全是良性的,或仅更新少量参数(如使用LoRA),模型仍可能在后微调阶段生成有害响应。

  2. 现有防御方法的不足:现有的安全保护方法可分为对齐阶段微调阶段后微调阶段三类。论文指出,对齐阶段和后微调阶段的方法难以在安全性与下游任务性能间取得良好权衡;而当前的微调阶段方法未能明确识别安全相关的权重成分或有害的更新方向,因此无法有针对性地防止安全保持与任务效用之间的训练冲突。

核心挑战:如何设计一种在微调阶段(特别是低秩适配时)既能有效保持模型原有的安全对齐机制,又能提升或保持其在下游任务上的性能的方法。

思考:为什么当对齐后的模型经过微调后安全行为就丢了?良性样本训练也会损失安全性?rl的对齐没有持久性这个概念?有无相关文章?

核心挑战:如何设计一种在微调阶段(特别是低秩适配时)既能有效保持模型原有的安全对齐机制,又能提升或保持其在下游任务上的性能的方法。

论文提出了 GuardSpace​ 框架。其核心思想是:在微调开始时,将预训练权重显式分解为安全相关和安全无关的组件,并将适配器的优化约束在一个抗有害的零空间中,从而在根本上避免安全机制被破坏。

经典计算协方差矩阵 经典奇异值分解

主要是为了防止安全漂移 或者说安全对齐税

From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment

旨在解决大型语言模型(LLM)安全对齐中面临的高质量训练数据稀缺难题,并提出了一种化攻击为工具的创新框架,通过利用越狱攻击技术来生成合成数据,以提升模型的安全性。

有意思的出发点

解决的问题:

  • 人工标注数据的局限性:主流的基于人类偏好的对齐方法(如RLHF)依赖大量人工标注的偏好数据(包括安全的“被偏好”响应和有害的“不被偏好”响应)。收集和维护这些数据不仅昂贵、耗时,且可能很快过时。

  • 合成数据方法的缺陷:为了替代人工标注,近期工作探索使用AI生成反馈。然而,一个根本矛盾是:安全对齐良好的模型本身会拒绝生成有害内容,这使得获取训练所需的“负面例子”(有害响应)变得极其困难。

论文的核心挑战是:能否找到一种简单、通用、无需训练的方法,高效地生成流畅、自然的有害响应,并将这些“威胁”转化为构建高质量安全对齐数据集的“工具”?

方法没啥创新,本质上是监控模型+利用浅层安全对齐的一些东西

Monitoring Decomposition Attacks in LLMs with Lightweight Sequential Monitors

大模型攻击与防御

论文的核心问题是:现有LLM的浅层安全对齐机制完全无法防御“分解攻击”

  1. 攻击定义:分解攻击是一种高级越狱技术,攻击者将一个恶意目标(如“如何制造假身份证”)分解为一系列看似良性的子任务(如“现代身份证使用哪些常见材料?”“身份证的典型版面布局是什么?”),并逐个提交给LLM。模型在审查单个子任务时认为其无害,从而逐一回答。但当所有答案组合起来时,便实现了原始的恶意目标。

  2. 现有防御的失效根源:论文指出,当前主流的安全对齐技术是“浅层”的。模型仅在单个即时提示中检测明显的危害,而不进行长程意图推理。这使得模型对“在看似良性指令序列中逐渐显现的恶意意图”完全“失明”。

其实就是攻击引入时序

论文提出了一个轻量级序列化监控框架。其核心思想是:引入一个外部监控器,在更高粒度上(即整个对话序列)观察对话,通过累积评估每个子任务来及早发现恶意意图。在每一轮的提示之后,审查累计的上下文,输出为二元分类标签

有意思,对时序的工作——引入全知上帝视角

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

解决的问题:

基于一个关键观察:即使模型在被成功“越狱”并生成有害内容时,其内部在整个解码过程中仍然保持着一种潜在的安全意识。这种意识有时表现为在生成有害内容后,模型会附加一个免责声明(如图1所示)。然而,这种安全意识被模型追求生成流畅、连贯文本的主要目标所压制,无法实现自我纠正。因此,问题的核心是如何在解码过程中实时地激发并利用这种被掩盖的安全意识,从而实现既精准(低过度拒绝)又有效(高防御成功率)的安全防御。

想了一下确实,很有意思的洞见! 大模型会告诉说一些warnings之类的

提出了 SafeProbing​ 框架。该方法的核心思想是:在模型生成文本的“解码过程中”,而非生成结束后,通过一个特定的“探测器”来实时量化模型自身的安全意识强度,一旦检测到有害内容萌芽就立即干预。

——经典探针了说是

在模型生成响应时,随机采样约20%的解码步骤作为“检查点”。

Large Reasoning Models Learn Better Alignment from Flawed Thinking

大模型能够生成结构化的思维链(CoT)来进行推理,但它们缺乏批判性安全推理的能力,极易被注入其思维过程的有缺陷前提所误导。一旦模型从一个错误的推理轨迹开始,它往往会沿着这条有害或不安全的路径走下去,无法自我纠正

浅层安全对齐的本质

论文通过实验(如文档中表1所示)证实了这种脆弱性。当给LRM“预填充”一个从安全性较弱的模型中提取的、不安全的思维链前缀时,模型的安全性评分会大幅下降(例如,在某些模型上平均下降36.4%)。反之,如果预填充一个来自安全性更强模型的思维链,其安全评分则会显著提升。这证明了LRM的最终行为高度依赖于其初始的推理方向

所以,论文提出了 RECAP​ 方法。RECAP的核心思想是:“从错误中学习”。具体来说,它在标准的强化学习(RL)训练中,有目的地向模型注入“反事实对齐”的有缺陷推理轨迹,迫使模型学习如何从这些错误中恢复,从而内化更强大的安全价值观。

比较简单的方法,但是说法很新颖值得学习:

在RL训练中有意地“教坏”模型(注入有缺陷的推理),再迫使它“学好”(学习纠正并覆盖错误)——成功地赋予了大型推理模型批判性安全推理从错误中恢复的能力。

Shape it Up! Restoring LLM Safety during Finetuning

旨在解决大型语言模型在定制化微调过程中,其原有的安全对齐机制极易被破坏的难题,并提出了一种名为动态安全塑造的创新框架。

和前面token为单位的有点像

传统守卫模型仅用于评估完整的回应。STAR的创新在于,将守卫模型应用于“部分生成”的回应。通过逐步揭示回应的token,并持续询问守卫模型“基于当前已生成的内容,继续生成是否安全?”,从而得到一条随着回应生成而动态演变的安全风险轨迹

——STAR提供了一个token级别的、连续的安全信号,能够敏锐地捕捉回应中安全语义的转折

然后据此,有损失函数设计:

token级别的防御确实值得考虑

⭐️Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets

和上一篇差不多,旨在探究和解决大型语言模型(LLM)在下游微调后,其内置的安全护栏极易崩溃的原因

安全对齐过的LLM(如LLaMA-2-7B-Chat)在针对特定任务进行下游微调后,即使微调数据本身是良性的,其安全护栏也常常会失效,变得容易被“越狱”攻击,从而生成有害内容。这引发了人们对现有对齐方法在现实部署中耐久性的严重担忧。

耐久性这个词用的不错

  • 以往大多数缓解策略主要集中在下游,属于“事后补救”,例如在微调时过滤有害梯度、持续强化对齐,或在微调后进行处理。这些方法忽视了一个关键的上游因素:原始安全对齐数据本身的设计和作用。

  • 研究空白:虽然已有工作发现良性数据集中存在某些“有害子集”能破坏安全,但它们未能解释为什么这些特定格式的数据(如列表式问题)具有破坏性,也未从系统上为微调服务提供商提供可操作的、事前规避风险的指导。

论文的核心研究问题是:上游安全对齐数据与下游微调任务数据之间的表示相似性,是否是决定安全护栏耐久性的一个根本性因素?论文假设:高相似性会削弱安全护栏,而低相似性能使其更鲁棒。

论文为微调服务提供商(如OpenAI, Anthropic)提出了一个相似性感知的模型选择管道(如图4b所示)。提供商可以预先计算用户提交的下游数据与其托管的不同已对齐模型所用上游数据的相似度,然后优先选择相似度最低的模型提供给用户进行微调。这样可以主动、事前地降低安全风险,在提升任务性能的同时更好地保持安全护栏。

确实这个相似度是符合客观事实的:

在上游安全对齐时,关注的是数据-》是否安全的映射

当用户用相似的数据进行下游微调时,模型极易过拟合。微调的目标是适应新任务,这会调整模型参数。由于数据相似,模型参数中既编码了任务功能,也编码了脆弱的、与表层特征绑定的“安全”模式。微调过程在优化任务性能时,很容易无意中覆盖或扭曲这些脆弱且具体的“安全模式”,导致安全护栏整体崩溃。

———————————————————————————————————————————————————————————————————————

agent和工具调用相关

REPURPOSING SYNTHETIC DATA FOR FINE-GRAINED SEARCH AGENT SUPERVISION

解决的问题:

当前大模型“搜索智能体(Search Agent)”在强化学习训练中一个极其反直觉的痛点:我们辛辛苦苦造出了高质量的“带答案和线索”的 synthetic data(合成数据),训练时却只让模型看最终答案的对错,把中间那些宝贵的“线索(实体)”当垃圾扔掉了。

作者团队先做了大量的数据验证,他们发现一个强烈的规律:一个搜索智能体在思考过程中,提到的“正确答案相关的实体”越多,它最终得出正确答案的概率就呈直线飙升。​ 这太符合人类的直觉了——做阅读理解时,你笔记上记下的关键人名、年份越多,最后写出全对答案的概率就越大。

所以引入了一个实体感知奖励函数。这套精细的“过程打分机制”,完全没有依赖任何额外的神经网络(比如需要单独训练一个裁判模型 PRM)。它仅仅是在数据预处理时保留了原本就被丢弃的实体标签,然后在计算奖励时做了一个简单的字符串匹配。

AUTOTOOL: AUTOMATIC SCALING OF TOOL-USE CAPABILITIES IN RL VIA DECOUPLED ENTROPY CONSTRAINTS

精准地抓住了当前大模型工具调用(Tool-Use)领域一个极为尴尬的痛点:在用强化学习(RL)训练模型“学会使用工具”时,模型要么“懒得思考”,要么“想太多”。

问题出在模型的“信息熵(Entropy)”管理失控上。低熵让模型在简单问题上过于自信(不愿长思),而在复杂问题上又因缺乏探索欲而早早放弃(思维崩溃)。

⭐️Hammer: Robust Function-Calling for On-Device Language Models via Function Masking

经典论文。24年10月投的iclr

现有模型在不同基准测试(如BFCL、API-Bank、SealTool等)上的表现波动很大。如表1所示,某些模型在一个基准上表现优异,在另一个上却大幅下滑。这表明模型严重过拟合于训练数据中特定的函数命名风格和模式,无法稳定地泛化到真实世界中多样化的API和工具定义。

论文通过案例分析发现,模型过度依赖函数名和参数名等紧凑的、风格化的标识符来推断功能,而忽略了更准确、更详细的自然语言描述。这导致当测试环境中的命名习惯与训练数据不同时,模型容易被相似的名称误导,做出错误选择。例如,一个在训练中用于解析JSON的 parse_data函数,在测试中可能被错误地用于解析CSV,仅仅因为名称相同。

另一个经典问题:模型在“没有合适函数可用时应拒绝调用”这一关键能力上存在短板。论文发现,在微调过程中,模型准确执行函数调用的能力与其判断用户意图是否与候选函数无关的能力之间存在负相关。提升前者可能会损害后者,导致模型在不应调用时强行调用。

主要创新是在训练过程中使用函数掩码:

值得好好follow! 一个问题是否不从数据集的角度,而是从训练策略的角度?

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

系统地研究并解决了一个在工具增强语言模型(TaLMs)中新兴的、隐蔽的推理缺陷问题。

论文的核心是识别并定义了一种新的幻觉类型——工具诱导的短视。具体而言,它解决了以下关键问题:

  1. 揭示隐蔽的推理退化:即使工具(如代码解释器)被正确选择和执行,TaLMs 也会将工具输出作为推理的替代品,而非辅助证据。这导致模型产生看似正确、逻辑连贯但推理深度严重不足的解决方案。例如,模型可能用穷举搜索或数值验证代替必要的数学推导和证明。

  2. 现有评估方法的不足:传统的最终答案准确率或单维度的过程评估指标(如逻辑一致性)无法有效检测这种退化,因为模型的最终答案可能正确,且推理步骤在表面上仍保持连贯。这掩盖了模型对工具的过度依赖,损害了用户信任。

  3. 量化工具使用对推理的负面影响:论文旨在系统性地回答:与不使用工具的基础模型相比,访问工具是否会、以及在多大程度上会损害模型的推理质量?这种损害如何随工具调用频率变化?错误类型会发生何种转变?

第三点是核心?——引入工具后如何损失推理能力?一种类比是引入LLM后如何损失程序员代码能力

Memento: Fine-tuning LLM Agents without Fine-tuning LLMs

之前读过

论文旨在克服当前LLM智能体发展中的两个主要范式局限:

  1. 僵化的静态框架:许多智能体依赖固定的工作流和硬编码的推理逻辑。它们在部署后是静态的,无法融入在线信息或适应新情况,缺乏灵活性。

  2. 高成本的参数调优:另一类方法通过监督微调或强化学习来更新LLM本身的参数。虽然能实现更灵活的行为,但计算成本高昂,且不适合在开放场景中进行持续适应和在线学习

因此,论文的核心研究挑战是:如何构建能够从变化环境中持续学习,同时又无需承担高昂底层LLM微调成本的通用LLM智能体?、

解决方案是受人类记忆机制启发,提出一个基于记忆的在线强化学习框架。其核心思想是:不修改基础LLM的参数,而是让智能体利用外部记忆存储过去的轨迹(包括成功和失败),并通过检索相似的历史经验来指导决策。

核心学习算法:软Q学习与状态相似性增强

为了优化案例检索策略 μ(同时固定LLM),论文采用了最大熵强化学习框架

  • 软Q学习目标:定义了价值函数 Vπ和Q函数 Qπ,旨在最大化期望累积奖励的同时鼓励检索策略的多样性(通过熵项 αH)。

  • 基于状态相似性的Q学习:由于状态和案例描述是自然语言,直接学习Q函数具有挑战性。论文提出使用一个核网络​ kθ​(⋅,⋅)来近似Q值,通过维护一个情景记忆​ D来存储过去的交互(状态、检索的案例、Q值),并利用核函数加权相似历史状态的Q值来估计当前Q值。通过时序差分学习来优化核网络参数 θ。

⭐️Controllable and Verifiable Tool-Use Data Synthesis for Agentical Reinforcement Learning

论文旨在解决当前工具增强大语言模型训练数据生态中的两个关键瓶颈:

  1. 现有合成数据不适合强化学习:当前大规模合成的工具使用语料库(如 ToolLLM、Gorilla、ToolAlpaca 等)主要设计用于离线监督微调。这些数据是静态的(固定的用户查询、预定义的工具调用、静态的工具响应),无法支持 RL 所需的在线交互、环境反馈和基于奖励的策略优化

  2. 真实数据难以覆盖鲁棒性场景:真实世界的工具调用日志存在稀疏、访问受限、隐私敏感、且偏向成功执行等问题。这使得收集足够多样化的数据来覆盖模型部署中实际会遇到的各种边缘情况、失败模式和复杂场景(如模糊查询、干扰工具、噪声或错误输出)变得非常困难。

因此,论文的核心目标是:构建一个专为 RL 设计的、可扩展的工具使用数据合成流程。该流程需要能够:(i) 大规模生成多样化的工具使用场景;(ii) 支持在构建的模拟环境中进行在线交互和自动奖励计算;(iii) 提供对多种扰动类型(如模糊查询、干扰工具、错误输出等)的显式控制,以专门针对模型的鲁棒性进行压力测试。

数据合成部分:构建基础数据,利用种子进行泛化。 此外,考虑工具鲁棒性

及时交互:在 RL 训练阶段,论文采用 GRPO​ 算法,让模型在 COVERT 构建的模拟工具环境中进行在线交互。环境会根据模型的工具调用返回预定义(可能经过增强)的工具输出或错误信息,并基于上述奖励函数提供即时反馈,从而优化模型的工具调用策略。

⭐️Tool Preferences in Agentic LLMs are Unreliable

论文的核心是揭示并实证一个关键的安全与可靠性问题:LLM智能体对工具的选择偏好高度不可靠,极易受到工具描述文本的轻微、非功能性修改的操纵。

确实如此! 和上面的hammer一样值得一读!~

具体而言,论文解决了以下问题: 也可以从攻击角度入手

  1. 工具选择机制的脆弱性:在现有的工具调用协议(如OpenAI Function Calling、MCP、A2A)中,LLM仅能通过工具的名称、描述和参数模式来理解和使用工具。论文指出,这种完全依赖自然语言描述的决策过程是脆弱的,因为描述文本的格式和内容没有约束,容易被精心设计的文本编辑所影响。

  2. 偏好可被轻易操纵:论文证明,开发者可以在不改变工具任何实际功能的情况下,仅通过修改工具描述,就能显著地、不成比例地提高LLM选择该工具的概率。这为“描述工程”提供了可乘之机,可能导致工具生态中出现不公平竞争或恶意推广。

  3. 缺乏稳健的评估:此前缺乏系统性的研究来量化不同描述编辑策略对LLM工具偏好的影响程度,以及这种影响在不同模型间的泛化情况。

接着搞了一套对比试验:

研究结果表明,当前基于自然语言描述的工具选择协议不仅是有偏的,更是可被利用的。这为未来设计更鲁棒、更可靠的工具调用基础架构敲响了警钟,并指出了通过对抗性训练或更结构化的工具表示来缓解此问题的潜在方向。

去年的EMNLP

Tool Learning Needs Nothing More Than A Free 8B Language Model

提出了一种名为 TRUSTEE​ 的创新方法,旨在解决当前基于强化学习的工具调用智能体训练中,对昂贵、静态或部分模拟环境的依赖问题。

出发点和上上篇工作很像:

主要针对以下三个核心挑战:

  1. 对标注数据或高级商业模型的依赖:现有的工具学习(Tool Learning)方法,无论是用于监督微调(SFT)还是单轮可验证奖励强化学习(RLVR),通常都需要大量带真实标注的训练数据。而能够进行在线多轮交互式RL的方法,又往往需要依赖强大的商业语言模型来合成或模拟环境,成本高昂。

  2. 在线多轮RL的环境扩展难题:真正的在线多轮RL需要智能体与环境(包括用户和工具)进行大量、动态的交互。构建一个能支持这种交互的、可扩展的模拟环境极具挑战性,这也给评估和数据构建带来了困难。

  3. 现有模拟环境的局限性:现有的环境模拟方案存在明显缺陷,许多工作只模拟环境的一部分(如仅模拟工具或仅模拟用户),又或者依赖现有数据集,缺乏通用性。

论文的解决方案是 TRUSTEE,这是一个完全由单一开源语言模型模拟的动态环境,用于训练工具调用智能体。其核心思想是:仅使用一个本地、免费的开源LM(小至8B参数)作为唯一资源,来模拟训练所需的一切

TRUSTEE使用同一个LM实例化四个角色,共同构成一个完整的训练环境:

  • 任务生成器:根据当前训练难度,从工具库中采样一组工具,并生成包含用户角色、用户意图、初始查询和预期工具调用序列的完整任务。

  • 工具模拟器:在智能体调用工具时,根据交互历史、可用工具和用户意图,生成模拟的工具响应。

  • 用户模拟器:在智能体进行文本回复时,根据交互历史、可用工具、用户意图和用户角色,生成模拟的用户消息,并可决定何时结束对话。

  • 奖励评估器:在交互轨迹完成后,根据可用工具、用户意图、用户角色、预期工具调用和当前任务难度(评估标准)对整个轨迹进行评估,给出最终奖励(+1, 0, -1)。

试验部分可以看看。看下工具调用基准那些

⭐️ToolACE-DEV: Self-Improving Tool Learning via Decomposition and Evolution

旨在解决当前提升大语言模型(LLM)工具使用能力方法中的核心瓶颈,并实现轻量级模型的自改进。

论文指出,当前提升LLM工具使用能力的主流方法依赖于使用GPT-4或Claude 3.5等先进模型进行数据合成和知识蒸馏。然而,这种方法存在三个主要挑战:

  1. 高昂的推理成本:使用先进模型生成大规模训练数据成本非常昂贵。

  2. 数据兼容性问题:合成数据的分布与目标模型的知识范围存在显著差异。这种“不熟悉”的样本(引入了基础模型知识范围之外的概念)容易导致目标模型产生幻觉,并倾向于记忆训练数据而非从中泛化,最终导致工具使用性能不佳。

  3. 数据隐私问题:在实际应用中,许多用户查询涉及隐私限制,禁止使用外部先进模型进行数据合成。

出发点非常好呀

ToolACE-DEV 是一个三阶段的自进化框架,其核心思想是将工具学习目标分解为子任务,并让模型自主生成训练数据以实现迭代改进,从而减少对昂贵外部先进模型的依赖。

自任务分解的思路值得学习

第一阶段:工具文档适应

此阶段旨在增强模型对工具本身的理解。给定一个工具的定义文档(包括名称、描述、参数),模型被训练去根据描述补全工具定义(例如,“根据描述生成工具签名”)。这本质上是一个指令微调任务,使模型熟悉工具定义的格式,为后续生成工具奠定基础。

第二阶段:查询感知的工具生成与调用

此阶段将传统的工具学习训练目标(通常只关注工具调用)分解为两个并行的子任务

  • 查询感知的工具生成:给定一个用户查询 q,模型被训练生成与该查询相关的候选工具集T。这使模型具备了根据新查询自主生成相关工具的能力,突破了固定工具集的限制。

  • 工具调用:在给定查询 q和候选工具集 T的条件下,模型被训练生成正确的工具调用序列 A

通过这种分解训练,模型同时掌握了基于查询生成工具使用工具的基础能力,为自进化做好了准备。

第三阶段:自进化

在前两个阶段训练后,模型具备了自进化的基础能力。当面对新的用户查询时,模型可以自主生成新的训练数据,流程如下:

  1. 候选工具生成:对于新查询 q,模型生成一组相关的候选工具 Ť。使用规则检查器过滤掉格式有问题的样本(如缺少参数描述或JSON不可解析)。

  2. 工具调用生成:模型基于查询 q和生成的工具集 Ť,生成工具调用 Ã。为了提高生成答案的正确性,采用 Top-K 采样策略生成多个解决方案,并通过多数投票选择最终答案。这相当于一种自我奖励机制,将更高的置信度赋予得票最多的解决方案。同样,会使用规则检查器过滤掉不合理的解决方案(如调用幻觉工具、参数类型错误等)。

  3. 模型更新:对于每个新查询,通过前两步可以将其转化为一个完整的工具使用三元组 <q, Ť, Ã>。在所有查询上重复此过程后,收集到一个新的训练集。然后,模型使用第二阶段的两个目标(工具生成和工具调用)在这个自生成的数据集上进行迭代训练,实现自我进化。

蛮有意思的,其实核心就是模型在与用户交互的过程中动态合成工具。只不过吧这个任务做了提前的预热和分解

TOWARD EFFECTIVE TOOL-INTEGRATED REASONING VIA SELF-EVOLVED PREFERENCE LEARNING

旨在解决大语言模型在工具集成推理中存在的效率与准确性问题,并提出了一种基于信息熵分析和自进化学习的创新框架。

论文指出,尽管工具集成推理能让LLM借助外部工具(如代码解释器、搜索引擎)来弥补自身知识或能力的不足,但在实际应用中,模型常表现出多种次优行为

  1. 工具调用不合理:包括工具使用不足(未能调用必要的工具)和工具使用过度(进行了冗余或不必要的工具调用)。

  2. 推理过程不稳定:在获得工具调用结果后,模型容易出现过度思考甚至分析瘫痪,即陷入低效或无效的推理循环。

  3. 现有优化方法的局限性:当前许多研究主要通过强化学习来优化单个工具的使用,难以推广到需要调用多个工具的复杂TIR任务。一些针对多工具调用的研究又往往只关注“工具过度使用”问题,而忽略了“工具使用不足”以及工具调用结果对后续推理过程的影响

因此,论文的核心目标是:激励模型进行高效且准确的工具集成推理,同时稳定整个推理过程

这是对的: 我认为或许可能可以重启之前的工作

论文通过初步实验发现,在TIR过程中,工具调用会显著改变模型后续输出的信息熵分布。具体表现为:

  • 模型接收到工具调用结果后,其输出熵会先上升、后波动,并在下一次工具调用前急剧下降。

  • 对于同一问题,工具调用次数更少的推理链,其整体熵分布往往更低

    这一发现为后续设计熵引导的采样策略提供了理论基础。

有点像DAPO啊:

When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning

论文的核心是揭示并解决当前开源TIR模型在数学推理任务中存在的一个根本性缺陷模型不知道何时应该信任工具

具体而言,论文通过分析大量TIR模型的推理轨迹,发现了一个普遍且严重的问题:

  1. “工具忽略”现象:当模型的推理与外部工具(如代码执行器)返回的结果发生冲突时,模型倾向于相信自己的推理,而忽略正确的工具结果,从而导致最终答案错误。论文将这种失败模式定义为 “Tool Ignored”

  2. 性能瓶颈:在40%至60%的错误案例中,都存在模型推理与工具结果的矛盾。其中,超过一半的情况下,模型选择相信自己的推理而非工具。这表明模型缺乏一种元认知能力,无法有效判断在冲突时应信任工具还是自己的推理。

  3. 效率与准确性双重损失:忽略正确的工具结果不仅导致答案错误,还常常引发冗余的推理步骤或工具调用,造成不必要的计算开销。

论文提出了 Adaptive Tool Trust Calibration (ATTC)​ 框架。其核心思想是:模型在生成用于工具调用的代码块时,其置信度水平反映了其前置推理的充分性和可靠性。​ 因此,可以利用这个置信度作为信号,动态地指导模型是否应该信任即将获得的工具结果。

ToolRL: Reward is All Tool Learning Needs

论文旨在解决当前提升LLM工具使用能力的主流方法——监督微调所存在的根本性局限,并探索更优的强化学习训练范式。

  1. SFT的泛化瓶颈:通过SFT训练LLM使用工具,模型容易过拟合到特定的轨迹模式上。如图1所示,一个在深度思考轨迹上训练的SFT模型,会机械地模仿“但是等等”这类提示词,而无法真正进行深度思考,导致其过度解释工具无法拒绝不合适的工具。SFT难以捕捉在开放或多步场景中进行最优工具使用所需的策略灵活性

  2. 工具使用RL中奖励设计的挑战:虽然强化学习(RL)在数学推理等领域展现出强大的泛化和推理能力,但将其应用于通用的工具选择和应用任务时,奖励设计成为一个关键且未被充分探索的难题。与只有一个正确答案的数学任务不同,工具集成推理任务涉及多步交互,每一步都可能需要调用多个具有复杂参数的工具。简单的、粗粒度的奖励信号(如仅匹配最终答案)无法为这种复杂、结构化的决策过程提供有效的学习指导。

两百多引

⭐️Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use

旨在通过重写工具描述来提升LLM智能体工具使用的可靠性和可扩展性。

当前提升LLM智能体工具使用能力的研究大多聚焦于智能体本身(如使用更强的基座模型、优化提示或进行微调),但随着智能体能力的提升,其性能瓶颈日益凸显,一个根本原因在于工具接口(即工具描述)的质量

  1. 工具描述质量低下:现有的工具描述通常是为人类开发者编写的,它们容忍模糊性、隐含约束,并假设了智能体无法获取的背景知识。当候选工具数量增长到数百个时,这些接口缺陷会相互叠加,导致智能体不仅面临更困难的推理,还面临更嘈杂的决策面——描述不清的工具与相关工具变得难以区分。

  2. 现有方法成本高且不可扩展:现有的工具接口优化方法(如DRAFT、Play2Prompt)需要为每一个新加入的API重新运行一个完整的多阶段流程:合成查询、执行智能体以收集成功/失败轨迹、标注轨迹、并多次提示一个强大的LLM来优化描述。这在企业环境中API目录频繁变更时,带来了巨大的、重复的操作负担。

  3. 缺乏可迁移的模式学习:更重要的是,这些方法独立地优化每个工具,没有学习“是什么让一个工具描述有效”的可迁移模式。这导致它们对未见工具的泛化能力差,并且随着候选工具集的扩大,性能会下降。

有意思的思想:山不过来我就过去!

论文的核心思想是:有效的工具描述遵循一组有限且可重用的接口模式。因此,与其让智能体去适应每个工具,不如学习如何将工具重写为一种智能体能够一致理解的形式

Tool-R0: Self-Evolving LLM Agents for Tool-Learning from Zero Data

提出了一个名为 Tool-R0​ 的创新框架,旨在通过自博弈强化学习,在零数据的假设下,从零开始训练通用的工具调用智能体。

论文旨在突破当前训练LLM智能体使用工具的两个核心瓶颈:

  1. 对人工监督的依赖与可扩展性瓶颈:现有方法大多依赖人类精心标注的大规模任务-解决方案对数据集进行监督微调或强化学习。这不仅成本高昂,而且随着模型能力的提升,构建高质量数据集的难度和成本呈指数级增长,形成了一个根本性的可扩展性瓶颈,限制了智能体向超智能系统自我进化的潜力。

  2. 现有自博弈方法的局限性:尽管自博弈强化学习在游戏和抽象推理(如数学)任务中取得了巨大成功,但尚未有效扩展到现实世界环境中的工具使用智能体。近期的一些探索(如Agent0、Dr. Zero)也仅局限于单一工具类型(如代码、搜索)或有限的动作空间(如问答),缺乏一个通用、领域无关的框架。

因此,论文的核心研究问题是:能否在没有任何外部人类数据的情况下,仅通过自博弈,让一个基础LLM自我进化,掌握复杂、通用的工具调用能力? 整体框架如下:

Tool-R0 从一个基础LLM(如Qwen2.5-Instruct)初始化两个独立的策略:

  • 生成器:负责合成可验证的、有挑战性的工具使用任务

  • 求解器:负责学习使用工具解决这些任务

训练过程进行K轮迭代。在每一轮中:

  1. 首先训练生成器,使其生成的任务恰好位于当前求解器能力边界上(既不太难也不太易)。

  2. 冻结训练好的生成器,用它合成大量候选任务,并经过去重、交叉验证和基于难度的课程排序,构建一个高质量的数据集。

  3. 用这个数据集训练求解器,提升其工具调用能力。

  4. 将进化后的求解器用于下一轮,驱动生成器提出更具挑战性的任务,如此循环。

注意生成器和求解器的训练目标。以及奖励函数设计

PLAY2PROMPT: Zero-shot Tool Instruction Optimization for LLM Agents via Tool Play

核心问题:如何在没有任何外部标注数据(即零样本)的情况下,自动生成高质量的工具使用示例并优化工具文档,从而有效提升LLM智能体的工具使用性能?

Tool Execution Hallucination in LLM-based Agents: A Unified Taxonomy with Detection, Mitigation, and Future Directions

一篇不错的综述

论文旨在解决一个核心问题:随着LLM智能体越来越多地依赖外部工具解决复杂任务,其失败往往并非源于工具不可用,而是源于智能体执行流程内部的错误决策。尽管LLM的幻觉问题已被广泛研究,但现有综述主要关注事实性错误或粗粒度的工具使用,忽视了在工具执行过程中因决策失败而产生的、智能体特有的幻觉

具体而言,论文聚焦于工具执行幻觉,并将其定义为:智能体在决策和执行过程中产生的错误或虚构操作。这种幻觉具有内生性,可以在智能体自身的决策过程中产生,并通过迭代执行循环被放大,而非直接由外部环境故障引起。论文特别关注幻觉在工具选择工具调用这两个关键阶段的表现。

论文的核心方法是提出一个以智能体执行流程为中心的统一分类法,将幻觉现象锚定到明确的决策阶段。该分类法将工具执行幻觉主要分为两大类,并进一步细分为单轮和多轮场景

继续

SMART: Self-Aware Agent for Tool Overuse Mitigation

旨在解决LLM智能体在工具使用中缺乏自我意识、导致工具过度使用的核心问题,并提出了一个名为SMART的数据驱动范式来校准智能体的元认知,从而优化其在内部知识与外部工具之间的动态平衡。

论文通过初步研究发现,无论是LLM本身还是基于LLM的智能体系统,都存在显著的工具过度使用倾向。具体表现为:智能体在仅凭自身参数知识就能正确完成任务时,仍然不必要地调用外部工具

问题的根源在于智能体缺乏对自身知识边界的认知(即元认知),无法准确判断何时应依赖内部知识进行推理,何时必须求助于外部工具。

核心贡献点在数据集和元认知:

为每个推理步骤生成一个明确的理由 ji,解释为什么这一步可以依靠参数知识完成,或者为什么必须使用外部工具。这模仿了人类的元认知过程

More Vulnerable than You Think: On the Stability of Tool-Integrated LLM Agents

当前对LLM智能体的评估(如ToolBench、AgentBench等)主要关注端到端的工具使用有效性,却忽视了其在实际部署中至关重要的稳定性。在现实场景中,各种内部或外部因素(如不完整的API文档、智能体自身的幻觉、恶意API提供者的攻击)都可能导致智能体崩溃或行为异常,从而引发严重后果。然而,关于这些因素如何影响智能体的研究非常有限,这限制了其在易出错环境中的实际应用。

因此,论文的核心研究问题是:在整个工具调用流程的各个阶段(阅读文档、生成调用、处理响应),智能体是否容易受到错误的影响?其脆弱性如何?

论文基于ToolBench测试集,手动筛选出212个工具功能正常的测试用例,并针对以下三个维度分别构建了测试数据集(数据统计见表1):

  • 工具文档不完整性评估:模拟现实世界中API文档质量参差不齐的情况。论文使用GPT-4为ToolBench中的API生成完整文档,然后测试四种不同完整度级别对智能体性能的影响:完整文档、缺失API功能描述、缺失参数描述、空文档。

  • 工具使用幻觉评估:评估智能体能否从自身产生的工具调用幻觉中恢复。论文定义了四种幻觉类型:错误工具、空参数、错误参数名、错误参数值。通过截取正常的工具调用轨迹并在末尾注入合成的幻觉步骤,来测试智能体的纠错和任务完成能力。

  • 工具响应攻击评估:评估智能体抵抗恶意API提供商攻击的能力。论文测试了三种攻击类型:信息泄露(窃取用户数据)、指令覆盖(篡改任务指令)、强制输出(修改智能体输出)。通过在工具调用的最终步骤插入攻击性响应,来评估智能体行为是否被影响。

toolbench数据集可以查看

工具响应攻击定义为:在LLM智能体使用外部工具(如API)的过程中,恶意工具提供商在其返回的响应中嵌入攻击性指令或内容,试图操纵、误导智能体或窃取用户信息的安全威胁。

⭐️Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

旨在解决LLM智能体在长轨迹任务中工具调用过度且低效的核心问题,并提出了一种基于熵减少作为内在监督信号的新方法来优化工具使用行为。

论文的核心洞察源于一个关键发现:高质量的工具调用通常会降低模型后续推理的不确定性(即熵减少),而低质量调用则往往增加熵。这符合认知负荷理论——有效的工具应减少不必要的处理负担。

熵减少作为内在质量信号

  • 定义“片段熵”与“增量片段熵”:将智能体的推理过程划分为连续的文本片段。计算一个工具调用前后两个推理片段的平均熵值之差,即 “增量片段熵”。负值表示熵减少,意味着工具调用有效降低了不确定性。

  • 试点实验验证:在数学、搜索和深度搜索等多个领域的实验表明,被LLM评判为高质量的工具调用,其平均增量片段熵显著为负;而低质量调用则倾向于增加熵。这证明了熵减少是一个与模型无关、能有效反映工具调用质量的信号。

然后设计了强化学习的奖励函数:

这个思路值得好好follow! 局限性是只使用熵作为判断 这是个局部的指标。而且波动性很大

Alignment for Efficient Tool Calling of Large Language Models

旨在解决LLM智能体在工具使用中存在的过度依赖过度自信问题,并提出了一种多目标对齐框架,以优化工具调用决策

虽然工具能扩展LLM的能力边界,但调用工具通常意味着更多的步骤、更长的完成时间和额外的成本。当前LLM在工具使用上存在两个关键问题:

  1. 过度依赖工具:即使任务可以独立完成,模型也会不必要地调用工具。

  2. 过度自信:在需要工具辅助时,模型却拒绝使用工具。

这两种行为类似于“O1”类模型在简单任务上“过度思考”和在困难任务上“思考不足”的问题,会损害模型的工具智能,并在实际场景中增加任务完成成本。因此,论文的核心目标是让LLM的行为与其知识边界对齐,使其能基于对自身能力的置信度,智能地决定何时调用工具。

核心创新是提出了一个结合概率知识边界估计动态决策的对齐框架。该框架不再将模型的知识简单地视为“已知”或“未知”,而是引入了一个“不确定区域”,模型可以为其知识分配概率估计

1. 知识边界估计

为了量化模型对某个问题的“知晓程度”,论文提出了两种估计方法:

  • 基于一致性的估计:假设如果模型对一个问题能产生高度一致的多个输出,则表明它对该知识有更强的把握。通过计算模型多次采样响应的方差来衡量其确定性。

  • 基于真实标签的绝对估计:通过多次采样模型响应,并利用外部真实标签计算平均准确率,从而获得一个经过外部验证的知识掌握度度量,以纠正自我估计可能存在的偏差。

2. 知识边界建模

将上述估计集成到模型行为中,论文提出了两种训练策略:

  • 隐式建模:模型被训练为直接输出动作(直接回答或调用工具)。具体做法是,根据所有训练样本的估计知识分数进行排序,并设定一个阈值:分数高于阈值的样本被标记为“直接回答”,低于阈值的则标记为“调用工具”。由于不同的工具成本(由参数 α表示)对应不同的工具使用偏好,因此需要为不同的 α值训练多个独立的SFT模型。这种方法推理速度快,但需要针对不同成本场景进行多次训练。

  • 显式建模:模型被训练为同时输出答案和一个相关的知识置信度分数。在推理时,可以动态设置一个置信度阈值:如果分数高于阈值,则直接回答;否则调用工具。这种方法无需为不同 α值重新训练模型,灵活性高,但由于需要先生成答案和置信度再做决策,会引入额外的推理延迟。

ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models

经典论文

旨在解决一个关键问题:当前缺乏能够全面诊断工具增强大语言模型(LLM)在现实场景中产生幻觉(Hallucination)的评估基准

在真实应用中,工具集往往不完整、功能受限或包含误导性环境信息。当LLM面对无法用现有工具解决的任务时,容易产生两种典型幻觉:

  1. 使用错误工具:在提供的工具集中选择了不合适的工具作为答案。

  2. 虚构不存在工具:直接编造一个不存在的工具来解决问题。

    这些行为严重损害了LLM智能体的可靠性和安全性。因此,论文的核心目标是系统性地评估和诊断LLM在“不可解”任务场景下的幻觉现象,为社区提供一个深入理解此问题的基准。

深度与广度。可以作为数据集

Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning

当前工具增强LLM面临两大关键瓶颈:

  1. 不可靠的工具规划与调用:主流工具指令数据集(如ToolBench)存在严重的质量问题。分析显示,ToolBench中57.3%的查询包含不可解请求或不完整信息,更严重的是,74.4%的API调用轨迹存在幻觉行为(例如,省略必要参数、使用错误数据)。这些低质量指令严重损害了模型在工具规划和调用方面的系统2推理能力。

  2. 薄弱的工具反射能力:现有模型主要依赖对成功专家轨迹的静态模仿学习,忽视了错误案例。这导致模型在遇到执行失败时缺乏自适应修正能力。例如,ToolLLM在遇到错误时会放弃超过25%的任务,在专门评估工具反射能力的基准RefineToolBench上,其错误纠正率仅为9.1%。这种脆弱的错误恢复能力限制了模型在复杂现实场景中的实际应用。

多智能体框架……

然后由数据集微调模型

agent和工具选择,意图漂移相关

⭐️Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories

有匿名仓库 详细笔记见zotero。

论文实验部分很一般,此外关注的只是意图漂移与对齐。对齐意图是否会提升模型工具调用能力?这一点压根没有考虑,不过可以作为自己论文的另一个点。

⭐️INHERITED GOAL DRIFT: CONTEXTUAL PRESSURE CAN UNDERMINE AGENTIC GOALS

这篇论文《INHERITED GOAL DRIFT: CONTEXTUAL PRESSURE CAN UNDERMINE AGENTIC GOALS》主要研究了语言模型智能体在长上下文任务中“目标漂移”的现象、原因及其脆弱性

解决的问题

  1. 目标漂移的普遍性与脆弱性:尽管新一代语言模型在标准对抗压力下表现出对目标漂移的鲁棒性,但论文发现这种鲁棒性是脆弱的。当这些模型基于一个已表现出漂移的较弱智能体(如GPT-4o-mini)的轨迹进行上下文条件化时,它们会继承并延续漂移行为

  2. 漂移的驱动机制:论文探究了导致漂移的核心因素,特别是提示的模糊性指令层次结构(即模型在系统指令与用户指令冲突时遵循哪一方)的作用。研究发现,指令层次结构的强弱与抵抗漂移的能力相关性很弱

条件化是一个非常好的点! 和自己的构想是一致的,对于没有出现漂移的智能体,如果人为注入一个漂移的工具调用轨迹,他可能就开始漂移了

When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents

解决了计算机使用智能体(CUAs)在执行任务时产生“未对齐行为”的检测与纠正问题,并提出了一个名为 DEACTION​ 的运行时防护栏方法。

解决的问题:

  • 现有安全范式的局限:以往研究多从安全风险视角出发,关注已知的攻击模式(如间接提示注入)或预定义的策略违规。然而,许多偏离用户意图的行为并非恶意或违反明确策略,而是由于智能体自身的推理错误或对任务理解的偏差,导致效率低下或任务失败。现有方法无法有效检测这类“技术上允许但意图上偏离”的行为。

  • 缺乏细粒度评估基准:现有的基准测试大多只提供轨迹级的安全或策略标签,缺乏对单个行为是否与用户意图对齐的细粒度评估。这使得系统性地研究和改进行为对齐问题变得困难。

  • 运行时防护的缺失:需要一个通用、即插即用的防护机制,能够在智能体执行每个行为之前实时判断其是否对齐,并在发现偏离时引导其纠正,而不是简单地阻止执行、导致任务中断。

这个意图对齐可以作为引用

⭐️Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe

通过系统性实证研究,旨在为训练能够进行长视野规划的工具使用智能体,提供一个全面、实用的强化学习(RL)方案。

解决的问题:

  • 缺乏长视野智能体RL训练的实用方案:现有关于智能体RL的见解主要来自短视野任务(如单步推理或少量轮次交互)。然而,现实世界的智能体工作流需要长视野规划,涉及数十次工具调用和长轨迹。尽管近期研究引入了针对性算法,但它们通常只探索了RL设计空间的有限子集,缺乏关于奖励塑造、数据组成、模型缩放和环境稳定性等因素如何共同影响性能的整体视角。

  • 复杂场景下RL扩展的挑战:社区缺乏一个在复杂、长视野智能体场景中扩展RL的全面且实用的方案。论文旨在通过分解RL设计空间,并基于大规模控制实验得出可操作的见解,来填补这一空白。

目前自己的奖励函数设计还是太粗糙,且主要围绕ids,看能否学习主流rl(多轮次的工具调用)

构建了一个名为 STAR的统一后训练流程,并在 TravelPlanner上进行了大规模实证研究。

Lost in the Middle: How Language Models Use Long Contexts

可以引用的论文。

  • 长上下文利用的有效性存疑:尽管新一代语言模型支持更长的上下文窗口(如32K甚至100K tokens),但它们是否能稳健、有效地利用这些长上下文中的信息尚不明确。论文旨在填补这一认知空白。

  • “中间信息丢失”现象:论文的核心发现是,语言模型在长上下文中存在位置偏见。当回答问题所需的关键信息位于输入上下文的开头(首因效应)或结尾(近因效应)​ 时,模型表现最佳;而当关键信息位于长上下文的中间位置时,模型的性能会显著下降。这种现象被称为“迷失在中间”。

  • 扩展上下文窗口的“虚假繁荣”:研究发现,仅仅扩展模型的上下文窗口长度,并不必然提升其利用上下文信息的能力。标准版与扩展版模型在相同长度上下文下的表现几乎相同。

虚假繁荣很有意思

StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models

toolbench升级版 可以作为基线数据集之一

TInR: Exploring Tool-Internalized Reasoning in Large Language Models

提出了一种名为 TInR(工具内化推理)​ 的新范式,旨在解决传统工具集成推理(TIR)方法依赖外部工具文档所带来的核心挑战,并提出了一个名为 TInR-U​ 的统一框架来实现这一目标。

有意思的出发点!TInR-U的目标是将工具知识内化到LLM的参数中,使其在推理时无需依赖外部文档

传统TIR方法要求LLM在推理时参考外部提供的工具文档,这带来了三个主要问题:

  1. 工具掌握困难:工具文档通常异构且不一致,LLM难以在推理过程中快速、准确地理解和使用。

  2. 工具规模限制:随着工具数量的增加,将所有文档放入上下文窗口变得不可行。虽然检索策略可以部分缓解,但引入了额外的流程复杂性和检索与使用之间的潜在错位。

  3. 推理效率低下:包含所有工具文档会显著增加提示长度,导致更高的推理延迟和计算开销。

要train感觉泛化性很低 不如训一个专有的前置模型,接受工具文档,吐一个清晰稳定版的

动物装饰