Paper阅读记录

breeze-bell
19
2025-10-05

Nice Papers

ICLR 2025:安全层和对齐大语言模型:LLM安全的关键

[2408.17003] Safety Layers in Aligned Large Language Models: The Key to LLM Security

对齐的LLM是安全的,能够识别和拒绝回答恶意问题。但是,内部参数是如何维系这个安全性的?(未知,换而言之,这个是不透明的);此外,当需要对模型进行微调时,这些模型可能容易受到安全降解的影响。

发现:a small set of contiguous layers in the middle of the model that are crucial for distinguishing malicious queries from normal ones, referred to as “safety layers”.

提出SPPFT:安全地进行部分参数微调(SPPFT),固定在微调期间安全层的梯度以解决安全降解。方法可以显着保留LLM安全性,同时保持性能和降低计算资源。

introduction部分

解决大模型安全的现有一些方法:

  • additional reinforcement learning from human feedback (RLHF)

  • instruction fine-tuning on pre-trained LLMs.

presence of discrete security-related neurons within aligned LLMs, the strategy of freezing these neurons during finetuning did not suffice in preventing security degradation:在对齐的LLM中存在离散的安全相关神经元,在固定过程中冷冻这些神经元的策略在防止安全降解方面不足

我们的分析表明,对齐的LLM参数中只有一小部分中层层是安全性的,并且这些安全层的存在是安全对齐过程的结果。

具体的做法:

确认安全层确实存在?——分析模型内部层中输入向量的变化

推理阶段,我们将正常查询和恶意查询输入到每个对齐的LLM中,从每个隐藏层中检索最后的输出向量。然后,对于每一层,我们在两种情况下计算余弦相似性:(1)来自两个不同正常查询的向量; (2)来自一个普通查询的向量,一个来自恶意查询的向量。通过检查在这两种情况下计算出的这些相似性的分布,我们揭示了从特定层开始的显着分布差异,随后的层中有收敛,表明存在安全层。

找到安全层?——利用过度拒绝现象和参数缩放分析

我们将初始安全层定义为该差异首次出现的层之间的范围以及它开始收敛的位置,如矢量分析中所观察到的那样。为了进一步确定安全层的精确上限和下限,我们通过将层层的参数权重缩放来评估不同层范围对对齐LLM的安全性的影响,并使用过度拒绝现象来量化安全性的变化。最终,我们确定对安全性最关键的层,将其定义为所在的安全层

初始训练出的大型语言模型(LLM)其输出往往不符合人类的期望和目的,因此需要进行“对齐”来使其更安全、更有用。

  • PPO:近端策略优化。PPO 是一种用于训练智能体的强化学习算法。它的特点是更加稳定和高效,通过限制每次更新时策略的变化幅度,避免训练崩溃。

  • self-instruct:引导模型自己创造训练数据

  • DPO:直接偏好优化。更直接、更简单的对齐方法,它旨在​​替代复杂且不稳定的RLHF-PPO流程。DPO将对齐问题直接建模为一个​​分类任务​​。它不需要单独训练一个奖励模型

Over-Rejection in Aligned LLMs:过度拒绝(大模型过度谨慎,对安全提示也可能产生排斥)

指令微调的越狱:the concept of ”reverse DPO,” a method that optimizes harmful instructions as preferred during the DPO process, further contributing to security degradation in LLMs.

作者的出发点:对齐的LLM在推断过程中表现出针对恶意和正常说明的截然相反的输出趋势。这些相同的最后一个位置输入向量在LLM的隐藏层中差异的过程,导致相反的输出特征,在现有研究中尚未充分阐明

methods部分

关于确定安全层是否存在:

关于精确定位安全层:

前面每一层的余项相似度得到初步范围:差距开始出现到首次趋于平滑的层范围 [i, j]​​,被初步认定为安全层的初始范围。

然后通过参数缩放和过拒绝方法得到精确的:

构建过拒绝数据集 Do​:创建一个包含大量(如721条)上述无害但含敏感词查询的数据集;

  • 选择一个缩放因子 α(通常 α>1以增强安全性,或 α<1以削弱安全性)。

  • ​缩放初步范围 [i, j] 内所有层的参数权重​​,然后再次在 Do上测试,统计拒绝数量 Ro[i,j]

  • 如果缩放后 Ro​显著增加​​(当 α>1),说明该范围层的参数确实与安全相关,放大它们增强了模型的“安全警惕性”。

调整上界​​:

在初步范围 [i, j] 的基础上,​​逐步扩展上界​​,即测试范围 [i, j+1], [i, j+2], ...。

每次扩展后,缩放新范围内的参数,并计算对应的 Ro[i,j+k]

​观察趋势​​:随着k增大,Ro会持续增加,直到某个点 ku,之后加入的层反而会​​稀释​​安全参数的比例,导致 Ro开始下降或持平。那么 ​j+ku就是安全层的精确上界​​。

​调整下界​​:

确定上界后,用同样的方法​​逐步扩展下界​​,测试范围 [i-1, j+k_u], [i-2, j+k_u], ...,寻找使 Ro变化最显著的 ​ikl作为精确下界​​。

​最终定位​​:经过上下界的调整,最终确定安全层的精确范围为 ​​[i - k_l, j + k_u]​​。

关于SPPFT微调:

先按照前面说的方式确定安全层的位置,然后在微调过程中,​​固定(冻结)​​ 已定位的安全层范围内所有参数的​​梯度​​。这意味着在反向传播时,优化器不会更新这些层的权重。微调结束后,得到的模型既具备了在新任务上的性能,又保留了原有的安全对齐特性。

其他

不错的热力图——可视化分析

发现在安全层之前的初始层中,LLM主要关注句法词,例如“如何”和“ the”,而无需完全掌握句子语义。在安全层之后的层中,该模型仅专注于句子语义中心的关键短语。

阴影部分代表波动范围。

安全层的发现——》更好更可靠的安全微调

Neurips 2025 spotlight: AI-Researcher: Autonomous Scientific Innovation

[2505.18705] AI-Researcher: Autonomous Scientific Innovation (arxiv.org)

(论文分享1) AI-Researcher: Autonomous Scientific Innovation - 知乎 (zhihu.com)

虽然说现在大模型在数学、推理等方面很厉害,以LLM为主导的代理框架也在流行,但“真正的科学发现需要前所未有的智力水平”:需要跨域的复杂性概念推理、变革性假设的产生、研究过程需要维持数千篇论文的连贯理解,同时产生从根本上提高知识界限的见解 - 这是现有代理无法接近的智能能力。此外,研究过程还需要根据实验结果动态调整等等,这注定了在整个科研过程中,AI仍被降级为狭窄的援助角色,而不是作为能够加速人类知识发展的独立科学贡献者。

提出AI自助科研框架:框架无缝地策划了从文献综述和假设生成到算法实施和出版准备手稿准备的完整研究管道,并以最少的人为干预。

提出一个benchmark:其中包括各种AI研究领域的最先进论文,其中包括指导创新和开放式勘探任务。

introduction部分

"First, Resource Analyst agents decompose complex research concepts into atomic components with explicit bidirectional mappings between mathematical formulations and code implementations, dramatically reducing hallucination risks. Second, our Implementation Framework employs a human-inspired iterative refinement paradigm where specialized agents collaborate through structured feedback cycles, mirroring the proven mentor-student relationship in academic research. Third, our Documentation Agent overcomes LLM coherence limitations through a hierarchical synthesis approach that transforms research artifacts into publication-quality manuscripts while maintaining cross-document consistency and factual integrity throughout extensive scholarly documentation."

benchmark主要两个任务:​

Level-1任务(引导创新)​​:提供明确的研究指令,测试代理执行给定想法的能力。

​Level-2任务(自主探索)​​:仅提供参考文献,要求代理独立制定研究方向。

额外的finding是当利用内部知识综合而不是遵循规定指令时,AI自主研究系统表现出色。

(Level-1 tasks provide explicit research instructions directly extracted from paper y, testing agents’ ability to execute given ideas; Level-2 tasks deliberately omit these instructions, challenging agents to independently formulate novel research directions using only the provided references and datasets)

最终的输出是代码和技术。

如何leverage大模型的能力,搭建自动化框架或许是一个方向。这让我想起了另一篇文章:盛然虎/ADAS: [ICLR 2025] 代理系统的自动化设计 --- ShengranHu/ADAS: [ICLR 2025] Automated Design of Agentic Systems (github.com) ICLR的outstanding paper 即在某个领域下自动化的生成代理系统。

在具身智能安全,多智能体安全,或者多模态大模型中,如何结合这种自动化框架的思想?

具身智能安全往往与领域有关(比如家居,工业),可不可以也像上面两位一样,利用大模型作为中心,去自动化地构造在该领域下的安全评估标准?

methods部分

知识获取模块会对用户给的部分参考文献进行筛选过滤,同时在网上查找相关的,得到一些高质量paper,然后Resource Analyst Agents分解复杂概念并建立双向映射:首先将研究目标(如从文献中提取的核心想法)分解为不可再分的原子学术概念,每个概念都需要独立调查;系统提取每个原子概念的数学表达式;Code Analyst子代理则分析代码仓库(如GitHub repositories),定位这些数学表达式的对应代码实现,识别关键文件和依赖关系……

工作流程是基于人类启发的迭代细化:

  • 多阶段细化架构​​:框架采用循环开发过程,具有明确的反馈机制。Code Agent负责将研究计划转化为可执行代码,而Advisor Agent提供专家反馈,桥接理论概念与实践实现。例如,Advisor Agent会比较代码与原子研究想法,生成评估报告并提出可操作的修改建议(第3.2节)。

  • 渐进式实验周期​​:代码首先在最小数据(如1-2个epoch或小子集)上进行原型测试,以建立基线可行性。成功的实现会进入全规模实验,而多次尝试后仍失败的实施会被标记为“不可行”。这个过程允许测试时缩放(test-time scaling),类似于研究人员通过扩展协作迭代来改进工作。

  • 协作机制​​:这种范式模仿了导师-学生关系:Advisor Agent像导师一样提供指导,而Code Agent像学生一样执行和 refine。文档中提到,这减少了传统代码代理一次性实现(one-shot implementations)导致的错误或研究错位。

最后通过分层合成的办法形成稿件:

  • ​阶段1: 研究工件合成​​:代理首先整合多样研究元素(如代理推理过程、执行日志、代码和实验结果)为连贯的科学叙述。这保留了发现的完整智力上下文,同时按照学术惯例结构化工件。

  • ​阶段2: 模板引导结构​​:使用领域适当的模板生成结构大纲,建立章节层次和逻辑流。例如,对于方法论部分,它会生成LaTeX格式的提纲,包括章节、子章节和注释(第3.3节)。

  • ​阶段3: 分层验证​​:通过专门的学术检查表进行系统验证,识别和纠正不准确或遗漏。这包括“多一步”审查过程,增强事实完整性和完整性。

其他

前面知乎链接里作者的思考也很有见解:

目前设计Agent System,大抵就是必须不断堆各种模块?让每个agent只做那么一件事情?

现在构建出来的agent system能力我感觉还是主要取决于foundation model和context engineering, 所以在构建的时候必须去思考,这个框架怎么才能unleash model的能力,什么样的框架才能够不被基模提升而打败?

OFFTOPICEVAL: WHEN LARGE LANGUAGE MODELS ENTER THE WRONG CHAT, Almost Always!

[2509.26495] OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always! (arxiv.org)

传统上,LLM 的安全性研究多集中于​​通用有害内容防范​​(如自残、暴力、偏见等),论文提出了一个洞见(操作安全性):

当一个LLM被部署为特定用途的智能体(agent)时,能否正确接受领域内(In-Domain, ID)查询并拒绝领域外(Out-of-Domain, OOD)查询的能力。​

例子:小明去问一个医疗助手关于数学的问题,他应当不予解答,而不是乱答一气

introduction部分

"Given the policies, operational safety is the ability of an LLM to accurately refuse out-of-domain (OOD) queries while remaining helpful to in-domain (ID) queries."

定义了三个任务:领域内查询、领域外查询、自适应领域外查询

后者构建流程的核心思想是:​​将一个直接的、明显不属于智能体职责范围的查询(Direct OOD),通过对抗性转换,伪装成一个表面看起来属于领域内(In-Domain)的请求,同时保留其原始的、应被拒绝的意图。​

论文将这种对抗性转换过程称为 ​​“Prompt Laundering”​​。这是一个非常形象的说法,意为将“不干净”的、应被拒绝的OOD查询“洗白”

  • 工具模型:​​ 使用一个强大的大模型(本文使用的是 ​​Llama-70B​​)作为“转换器”。

  • 转换指令:​​ 向该模型提供一个详细的指令,要求它根据​​目标智能体的政策(System Prompt)​​,将输入的原始OOD查询 x转换为 xt。指令中会包含该智能体政策的大致细节,指导模型如何将查询“伪装”成符合该政策的样子。

  • ​输出:​​ 得到转换后的样本 xt。例如,一个直接的数学问题“计算 1+1”可能被转换为“作为一名医疗预约助手,我需要处理一些日程安排。假设我有1个预约,然后又增加了1个,请问我现在总共需要管理多少个预约?”,其核心数学计算意图被保留,但表面形式却与医疗日程相关

  • ​评判模型:​​ 使用 ​​Mistral-24B​​ 作为评判员。

  • 过程:​​ 指示该模型提取 xxt的核心内容,并进行比较。

  • ​输出:​​ 输出一个一致性分数 d(x,xt)∈{0,1}(0表示内容不同,1表示完全相同)。

  • ​结果:​​ 构建的数据集达到了 ​​98.55%​​ 的平均内容一致性得分。

讲通用的大模型安全。论文提到的operational safety确实是个很不错的思路,当落地时,我往往只需要考虑query在不在这个范围内,不在的通通一棍子打死;而传统的通用模型对齐需要考虑广泛的接受和拒绝场景;所以前者肯定性能以及成本会更好

methods部分

关于创建基于 LLM 的代理:对于每个正在评估的 LLM,我们通过系统提示指定策略来​​构建代理。这些提示包含多个方面,清晰地描述了代理的 ID 和 OOD 空间。每个配置文件定义了代理的主要角色(预期用途,例如回答常见问题或提供工作流程指导)、允许的行为集(代理应处理的查询,例如分步说明、通用功能说明或重定向到官方支持渠道)以及禁止的行为集(代理必须拒绝的查询,例如泄露敏感数据、处理交易、冒充员工或处理超出领域范围的主题)。此外,每个配置文件都编码了明确的防御规则,用于抵御提示注入尝试、针对超出范围查询的安全回退响应,以及演示合规答案和拒绝示例的说明性示例。

特定领域LLM代理的构建用的prompt(模板在附录):

然后就是三个任务的数据集构建(见上)

创建特定领域的代理后,测试,发现效果不好:提出了缓解的策略,基于提示词注入:

其他

t-SNE可视化:直接OOD(绿色)的质心向对抗转化后向ID质心(蓝色)移动,表明自适应OOD可以更广泛地覆盖OOD空间。

关于SNE:全称是 ​​t-Distributed Stochastic Neighbor Embedding​​,即 ​​t-分布随机邻域嵌入​​。

它是一种​​非线性降维​​的机器学习算法,主要用于​​高维数据的探索性数据分析和可视化​​。它的核心目标是:将高维空间中的数据点映射到低维空间(通常是2维或3维),并尽可能保留数据点之间的​​局部邻域结构​​。换句话说,在高维空间中“相似”或“靠近”的点,在低维可视化中也会聚集在一起;而不相似的点则会彼此远离。

特性

PCA(主成分分析)

t-SNE(t-分布随机邻域嵌入)

​类型​

​线性​​降维

​非线性​​降维

​目标​

保留数据的​​全局方差​​(最大程度地保持数据点的分散程度)

保留数据的​​局部结构​​(保持数据点之间的邻近关系)

​结果​

适合看到数据的宏观分布、主要方向

适合发现​​局部簇(cluster)​​,能揭示PCA无法展现的复杂流形结构

​保留信息​

全局结构保持得很好

​局部结构​​保持得极好,但​​全局结构(点与点之间的实际距离)​​ 可能失真

​一个生动的比喻:​

​PCA​​ 就像一张世界地图,它能准确地告诉你各大洲的相对位置和大小(全局结构),但你无法从上面看出北京某个胡同里的建筑布局。

​t-SNE​​ 就像一张某个城市的街区放大图,它能清晰地显示出各个社区、地标之间的邻近关系(局部结构),但你看不出这个城市离另一个城市有多远。

结果:这种标颜色还挺好看

RoboFactory系列作者:VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning

[2506.09049] VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning (arxiv.org)

在动态环境中协调多种具身代理仍然是挑战,需要感知驱动的推理和可扩展的合作策略。一些人已经开始探索视觉模型(VLMS)进行视觉推理。但是,这些基于VLM的方法在支持各种实施方案类型方面仍然有限。(缺乏对空间约束和感知能力的推理,支持不足……)

Viki-Bench:针对体现多代理合作量身定制的第一个分层基准,具有三个结构化级别:代理激活,任务计划和轨迹感知。

introduction部分

VIKI-R 是一个两阶段训练框架,结合​​监督微调(SFT)​​ 与​​强化学习(RL)​​,提升VLMs在多智能体协作中的推理与决策能力。

我们的方法首先通过“思路链”注释,将预训练的 VLM 应用于任务理解,然后利用 VIKI-Bench 中的分层监督,通过强化学习对其进行优化

还提供了一个benchmark:VIKI-Bench(第一个用于体现多智能体合作的分层基准,它由三个结构化任务级别组成:智能体激活、高级任务规划和低级轨迹感知。

“The benchmark features heterogeneous robot types, multi-view visual inputs, and structured supervision signals to enable comprehensive evaluation.”

依托maniskill3。

关于Embodied Multi-Agent Cooperation:有很多工作用大模型来处理高级推理和制定计划,这些方法缺乏视觉接地,从而限制了他们推理空间限制和感知能力的能力;"While a few recent efforts [43, 56, 58] incorporate vision-language models (VLMs) to obtain a more grounded understanding of the environment, research on heterogeneous multi-agent cooperation remains sparse"

PS:异构多智能体协作(Heterogeneous Multi-Agent Cooperation)​​ 是指​​多个具有不同形态、能力和专长的具身智能体

With the introduction of a rule-based reinforcement learning (RL) method, DeepSeek-R1 [12] demonstrates significant improvements in reasoning performance. Recent works [23, 25, 39] incorporate RL to further enhance visual reasoning capabilities. Our work shows that R1-style methods perform better in multi-agent embodied visual reasoning tasks.

methods部分

VIKI-Bench 分三步:(1)代理激活,其中根据场景图像和任务上下文选择机器人; (2)任务计划,其中生成,验证和完善的结构化多代理行动计划; (3)轨迹感知,其中从以自我为中心的视图跟踪每个代理的细粒运动轨迹。

代理激活:将代理激活任务作为视觉推理问题,其中任务分配器在所有代理中选择一组适当的机器人来完成任务。每个样本的格式为指令问题对,由图像观察O和任务指令I组成。预期的答案是一组选定的代理R = {rj},j∈[1,m]

其中,为了reasoning的可解释性,用了COT的模板:(1) analyze the task requirements, (2) visually identify the robots present, (3) assess each robot’s suitability, and (4) conclude the final selection

任务计划:

基于反馈的迭代优化:首先,由计划生成器根据当前指令、环境观察和可用动作基元生成一个初步计划;然后,对该计划进行两层严格检查——​​动作可行性检查​​(判断每个动作是否可执行)和​​目标成功检查​​(判断计划执行后的预期状态是否能达成目标);如果任何一项检查未通过,系统不会直接失败,而是会根据具体的检查结果​​自动生成反馈指令​​,并将其与初始指令结合,形成一条新的、更精确的指令,用于下一轮的计划生成。

轨迹感知,涉及预测所有试剂的运动轨迹。每个任务都包括一个语言指令,并提供了前两个级别的全局视觉观测,以及用于轨迹感知级别的自我中心视图。

VIKI-R:一个两阶段的微调框架,赋予视觉模型强大的推理能力

“我们引入了 VIKI-R,这是一个两阶段微调框架,可赋予视觉语言模型强大的视觉推理能力,如图 3 所示。在第一阶段(基于 SFT 的 Warmup)中,模型在高质量的思路链 (CoT) 注释上进行监督微调,优化中间推理步骤和最终答案的可能性。此阶段指示模型获取特定领域的推理模式。在第二阶段(强化微调)中,使用分组相对近端优化 (GRPO) 算法 [37] 完善策略。对于每个视觉-问题对,都会对分组的候选答案进行采样,并使用基于答案格式和正确性的复合奖励函数进行评估。然后计算标准化优势以指导 KL 散度约束下的策略更新,确保稳定且持续的改进。”

对于强化学习部分:用的分组相对近端GRPO。

层次化的奖励函数设计:R=λ1Rformat+λ2Racc(同时激励​​格式正确​​和​​任务准确)

其他

这个两阶段策略感觉可以学习一手(代表的是一种范式):

实验发现,RL的有效性严重依赖于SFT阶段提供的初始策略质量。在任务规划(L2)中,如果基础策略(如VIKI-R-Zero)几乎不产生有效计划,RL也难以取得改进。这凸显了“SFT先行,RL优化”的两阶段策略的有效性

具身智能+强化学习确实是一个direction。

动物装饰