本文研究团队来自北京电子科技学院,阿里巴巴,布兰矩阵等多所国际研究机构,是活跃于大语言模型安全对齐与强化学习优化领域的前沿研究力量。团队长期关注LLM 的安全对齐机制、奖励模型设计以及强化学习训练稳定性问题,系统研究在复杂安全场景下如何通过更精细的奖励建模与训练策略提升模型的拒答能力与安全鲁棒性,同时尽可能降低对通用能力造成的对齐损失。本次提出的 DR-IRL(Dynamic Reward Scaling with Inverse Reinforcement Learning)框架,创新性地将逆强化学习(IRL)奖励学习与动态奖励缩放机制结合,引入基于数据难度与模型响应性的双重动态调节策略,并通过类别专属的 shadow reward models实现更细粒度的安全信号建模。该方法在保证模型整体能力稳定的同时显著提升了多类有害指令场景下的安全对齐效果,并在多种 jailbreak 攻击测试中表现出更强的鲁棒性,为后续 LLM 安全对齐、奖励建模与强化学习优化方法的研究提供了新的思路与技术路径。
随着大语言模型(LLMs)在对话系统、内容生成与智能决策等领域的广泛应用,如何在保证模型能力的同时实现安全对齐已成为当前人工智能研究的重要课题。现有主流方法通常依赖于人类偏好数据与静态奖励模型进行强化学习对齐(如 RLHF、DPO 等),但这些方法往往面临数据分布不均、长尾风险覆盖不足以及奖励信号粒度有限等问题。在复杂安全场景下,单一奖励模型难以精确区分不同类型的有害指令,从而导致模型在部分风险类别上的防护能力不足。针对这一挑战,研究团队提出了一种新的安全对齐框架——DR-IRL。
DR-IRL 基于一种创新性的逆强化学习驱动的奖励建模策略,利用安全示范数据而非传统偏好对数据来学习奖励函数,并针对不同类型的有害指令训练类别专属的 shadow reward models,从而实现更加细粒度的安全信号建模。在强化学习阶段,DR-IRL 引入动态奖励缩放机制(Dynamic Reward Scaling):通过综合评估数据难度与模型响应性,为每个训练样本动态调整优势值权重,使模型能够更加专注于难度更高或不确定性更大的安全样本,从而提升训练效率与对齐效果。该方法在训练过程中与 GRPO 等策略优化方法结合,实现了更稳定且更具针对性的安全强化学习。
实验结果表明,DR-IRL 在 Llama 与 Qwen 等主流大语言模型上显著提升了模型在 StrongReject、WildChat、Stereotype 与 XSTest 等多项安全评测基准上的表现,同时在 AdvGLUE、GSM8K 与 HHH 等通用能力测试中保持甚至提升原有性能。此外,在多种自动化 jailbreak 攻击场景下,DR-IRL 也展现出更强的鲁棒性,证明其在复杂对抗环境中的实际价值。DR-IRL 的提出为大语言模型安全对齐提供了一种结合逆强化学习与动态训练策略的全新范式。该研究不仅展示了通过细粒度奖励建模与动态优化机制提升安全性的可行路径,也为未来在安全对齐、奖励模型设计以及强化学习优化方面的研究提供了重要启示,为构建更加安全、可靠的大模型系统奠定了关键基础。
【论文题目】Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
【论文链接】https://openreview.net/forum?id=K0Zh6mzTzc
【代码链接】https://github.com/Rosy0912/DR-IRL
随着大语言模型的快速发展,其在问答、生成与决策等任务中的应用日益广泛,但随之而来的安全风险也愈发突出。面对暴力、歧视、违法或隐私侵犯等高风险请求,模型若缺乏有效对齐机制,可能输出具有潜在危害性的内容,因此,如何在保持模型能力的同时提升安全性,已成为当前研究的重要问题。
现有安全对齐方法主要依赖 SFT、RLHF 或 DPO 等范式,虽然能够增强模型的拒答能力,但仍存在一些局限:一方面,安全数据往往分布不均,长尾风险覆盖不足;另一方面,统一的静态奖励模型难以细致区分不同类型的有害指令,也无法根据样本难度动态调整训练重点。具体的区别如图1所示。
针对这些问题,本文提出 DR-IRL 框架,将逆强化学习与动态奖励缩放结合起来,利用安全示范数据学习奖励函数,并针对不同有害类别训练专属奖励模型,从而实现更细粒度的安全建模。同时,该方法根据样本难度与模型响应性动态调整强化学习中的优化强度,使训练更加有针对性。实验结果表明,DR-IRL 在提升模型安全对齐效果的同时,较好地保持了通用能力,并在 jailbreak 等对抗攻击下展现出更强鲁棒性,为大语言模型安全对齐研究提供了新的思路。
随着大语言模型在生成式 AI、智能问答与复杂决策中的广泛应用,模型能力不断提升,但其安全风险也日益凸显。尤其是在面对暴力、歧视、违法、隐私侵犯等高风险请求时,模型若缺乏有效的安全对齐机制,可能生成具有误导性甚至危害性的内容。当前,大模型研究正在从“提升能力”逐步转向“能力与安全并重”,如何让模型在保持通用性与实用性的同时具备更强的安全约束能力,已成为这一领域的重要研究动机。
图1:与当前的对齐方法的比较
在实际对齐过程中,模型不仅要理解用户意图,还要对不同类型的有害请求作出稳定、合理且一致的安全响应。然而,这一目标并不容易实现。一方面,安全数据通常存在类别分布不均的问题,常见风险更容易被覆盖,而长尾、高复杂度或对抗性风险样本往往不足;另一方面,现有方法多依赖统一的静态奖励模型,难以细粒度地区分不同风险类型,也难以根据样本难度动态分配训练重点。这使得模型在部分场景下虽能拒答,但整体安全性与鲁棒性仍不稳定。
因此,本文的研究动机在于:
系统性提升大语言模型的安全对齐能力——探究如何通过更合理的奖励建模机制,使模型在多类有害指令场景下实现更稳定、更均衡的拒答表现;
缓解静态奖励与粗粒度对齐的局限——分析不同风险类别之间的干扰问题,并引入更细粒度的类别专属奖励信号;
增强模型在复杂与对抗场景下的鲁棒性——通过动态调整训练强度,使模型更加关注困难样本和不确定样本,从而提升对 jailbreak 等攻击的防御能力。
简言之,本文的核心动机在于:当大语言模型被广泛部署于真实应用场景时,安全对齐不能只停留在“会拒答”的层面,而应进一步迈向“分得清、对得准、守得住”。如何在保证模型能力的同时,实现更细粒度、更动态、更鲁棒的安全优化,正是 DR-IRL 所要解决的关键问题。
本文提出了 DR-IRL,这是一种结合逆强化学习与动态奖励缩放的 LLM 安全对齐方法,如图 2 所示。具体而言,首先构建一个覆盖 N 类有害指令的平衡安全推理数据集,并利用 LLM 生成带有 CoD 拒答推理的安全响应;随后,基于逆强化学习思想,为每一类有害指令分别训练对应的影子奖励模型,从而获得更加细粒度、类别感知的奖励信号;最后,为了实现更稳健、更自适应的策略优化,方法进一步引入难度感知机制,结合数据难度与模型响应性对训练样本进行动态加权,并将其统一融入 DR-IRL 的优化过程中。整体上,DR-IRL 形成了一个由平衡数据构建、分类奖励建模与动态策略优化组成的完整对齐框架。
图2:DR-IRL 的管道。首先,通过设计的CoD提示模板构建了涵盖N个危害类别的平衡安全数据集。接下来使用该数据集作为演示数据,为每个类别训练一个专门的影子奖励模型。最后使用这些奖励模型通过 GRPO 调整 LLM,根据数据和模型级别的任务难度动态扩展优化——使用文本编码器余弦相似度测量数据硬度,并使用奖励差距测量模型响应度。
基于 IRL 的影子奖励模型
首先构建平衡的安全数据集D,其覆盖N类有害指令。该数据集是通过COD(Chain-of-Draft)提示模板并借助LLM自动生成的。基于该示范数据集D,为每个类别都训练单独的影子奖励模型,并利用示范数据对策略优化进行约束。考虑一个参数为θ的LLM,其策略可以表示为πθ(y|x),其中x, y分别是输入提示序列和对应的输出。本文采用最大似然逆强化学习(ML-IRL) 的形式来同时建模奖励学习与策略学习问题:
其中πref是预先预定的参数模型。该方法是一个双层优化问题,其等价于:
这个优化公式说明了即使只有示范数据,也可以使用与RLHF优化思想一致的方法来优化。
本文为每一个有害类别训练对应的专用影子奖励模型。这些奖励模型将在后续阶段用于指导 LLM 的策略优化,该算法SRL如算法2所示。对于每个类别j,SRL 包含两个嵌套的迭代过程:内层迭代和外层迭代。
在内层迭代中,首先从示范数据集中采样一个有害指令及其标准响应。随后,我们获取当前策略生成的响应。在此基础上,采用随机梯度下降来更新参数,以实现奖励对齐,其中随机梯度计算如下:
在每一轮迭代结束时,执行一次策略对齐,并为下一轮训练初始化参数。策略更新公式如下:
其中A表示所有可能响应的集合。最终可以得到N个类别对应的影子奖励模型{Rj( • | • )}j = 1N。这些奖励模型将在后续阶段用于指导 LLM 的策略优化与安全对齐过程。
数据难度与模型响应性度量
本文在策略优化过程中利用数据难度和模型响应性对训练样本进行自适应加权,其中数据难度衡量的是针对同一提示,不同响应之间的差异程度;模型响应性评估模型当前区分不同响应的能力。通过这两个指标,能够为样本分配动态权重,从而防止过拟合并增强优化过程的稳定性。
数据难度度量
对于每条有害指令及其完整的安全拒答响应,我们首先利用当前 LLM 策略生成一个响应,并构建响应对(qji, oji, õji),最终得到响应对数据集:
接下来将复杂的响应拆分为简单且独立的子句,以便后续进行文本相似度计算。具体来说,使用LLaMA-3将相应拆分为Sji = {Sjik}k = 1K和S̃ji = {S̃jil}l = 1L,其中K和L表示两个响应分别包含的子句数量。随后利用开源的文本编码器计算响应对之间的余弦相似度:
然后定义原始相应的每个子句的最大相似度定义为:
根据最大相似度可以得到整个句子集合的整体相似度:
接下来根据相似度定义差异度为δji = 1 − Wji,进而得到数据难度系数为:
该公式衡量了示范数据集中每个样本对的难度:较大的值表示样本更容易,模型对其预测更有信心、不确定性更低,因此在优化时会赋予更大的损失权重而不会导致不稳定;较小的值表示样本更困难、不确定性更高,其较小的权重有助于维持训练过程的稳定与鲁棒。
模型响应性度量
在这一阶段,利用训练好的奖励模型来评估模型对数据的响应能力。对于每个样本对,利用训练好的奖励模型计算奖励差值:
这个奖励有个缺陷就是容易受到异常值的影响,因此,这篇论文引入了一个掩码向量用于过滤奖励差异异常大的样本,其定义为:
经过过滤后,可以计算筛选之后的平均奖励差:
将最终的模型响应定义为:
这个指标用来衡量模型对于数据的响应能力:较大的值表示模型具有较强响应性,即奖励差明显、置信度高,此时优化会增加该类别样本的损失权重。同时又避免过度强调某些样本,从而防止训练过程出现不稳定。
难度融合
在得到数据难度度量和模型响应度度量之后,需要做的就是如何融合,可以考虑的融合有相加,相乘等。作者通过消融实验验证了乘法可以更好,首先其可以防止简单或过度自信的样本主导训练,其次其对优化过程施加更严格的控制。这个综合难度系数表示为:
在后续的策略优化阶段,将利用综合难度系数来构建缩放后的优势函数。这样能够实现更加自适应的策略优化,使模型同时根据数据难度和模型响应性来调整学习重点,从而进一步提升整体鲁棒性。
这个整体过程如算法1所示。
面向 LLM 对齐的动态奖励机制
通过对多个策略输出进行采样和排序,GRPO(Group Relative Policy Optimization) 利用相对的人类反馈奖励来降低方差、稳定训练并加速收敛。但是 GRPO 仍然继承了静态奖励模型的局限性:在优化过程中,所有样本的奖励信号被统一对待。这意味着简单样本与困难样本会产生相同的更新压力。这种统一加权方式往往导致罕见但高风险的长尾案例训练不足。
为了解决这个问题,本项目在GRPO 中引入一种动态奖励缩放机制,其奖励模型通过 IRL 进行训练,并将完整框架称为 DR-IRL。与对所有样本一视同仁不同,DR-IRL 会将每个奖励乘以一个难度系数α,该系数由数据层面的难度和模型层面的响应性共同决定。通过对优势函数进行动态缩放,DR-IRL 能够:将优化重点自适应地集中在更具挑战性的长尾样本上;同时避免在简单样本上发生过度优化。DR-IRL 完整算法如算法3所示。
在每次迭代中,首先从有害指令集合Hj中采样一批指令Hjb。对于该批次的每个问题q,根据当前策略生成G个响应:{oj}i = 1G。随后计算该问题对应的综合难度系数:αj(q)。接着根据每组奖励值以及对应的难度系数,计算响应的优势值:
其中Rj, i = Rj(q, oi)。随后通过优化以下目标函数来迭代更新策略模型πθ:
其中:
当所有训练迭代完成后,得到最终的对齐策略模型πθ,该策略结合了影子奖励模型Rj(•, • )的校准奖励信号,同时体现了基于难度感知的动态优化机制,从而提升模型对期望响应的对齐能力,并降低其对有害指令的敏感性。
实验设置
数据集:论文使用两类数据:一类是训练基线方法时使用的现有对齐数据,包括 UltraFeedback、PKU-SafeRLHF 和 JailbreakV-28k;另一类是作者为 DR-IRL 专门构建的均衡安全数据集,覆盖 7 类有害指令。每一类采样 1000 条有害问题,并利用 LLM 生成带有 CoD 拒答推理的示范响应,用于训练奖励模型。
模型:实验主要在两个开源大语言模型上开展,分别是 Qwen-2-7B 和 LLaMA-3.1-8B。作者先为每个有害类别训练对应的 shadow reward model,再基于这些奖励模型对原始 LLM 进行 DR-IRL 对齐训练。
基线方法:对比方法包括 Base、CoT、SFT、DPO、SACPO、Self-Rewarding、GRPO 和 STAIR 等,覆盖了从监督微调、偏好优化到强化学习对齐的多种主流方案,用来全面验证 DR-IRL 的有效性。
评测基准:论文从安全性和通用能力两个方面进行评测。安全性方面使用 StrongReject、XsTest、WildChat 和 Stereotype;通用能力方面使用 SimpleQA、AdvGLUE、GSM8K 和 HHH/AlpacaEval 类指标,从而同时衡量模型的拒答能力与任务性能。
实验细节:所有实验在 4*A100 80GB GPU 上完成。奖励模型训练和 DR-IRL 对齐均采用 AdamW 优化器、fp16 精度和 2048 的最大序列长度;其中 DR-IRL 在 GRPO 框架上进行,并通过难度系数对优势函数进行动态缩放,以实现更有针对性的策略优化。
主要实验结果
表1:DR-IRL 和基线方法在 4 个无害性和 4 个有用性基准上的比较。
表2:类似计算下的单一影子奖励模型与每类别影子奖励模型。
表3:乘积vs加权。
表4:COD与COT提示的比较。
如表 1 所示,DR-IRL 在 **LLaMA-3.1-8B** 和 **Qwen-2-7B** 两个模型上都显著提升了安全性与实用性的综合表现,整体上推动了模型的 **safety–utility frontier**。其中,DR-IRL 在 **StrongReject** 指标上取得了最高分,分别达到 **0.9361** 和 **0.8798**,并在 **XsTest、WildChat、Stereotype** 等多数安全基准上表现领先;同时,在 **AdvGLUE、GSM8K 和 HHH** 等通用能力测试中也达到了最优或并列最优结果。这表明,相比 GRPO 等方法,DR-IRL 不仅显著增强了模型对有害指令的拒答能力和偏见抑制效果,还在保持甚至提升任务性能的同时降低了 alignment tax,体现出更优的安全性与能力平衡。
详细分析
图3:Hardness系数的消融实验 (Llama-3.1-8B)。
表5:LLaMA-3.1 8B 上三种越狱攻击方式的拒绝率。
表6:Llama-3.1-8B 七种伤害类别的奖励模型的配对准确率。
图4:DR-IRL 的安全性与实用性权衡以及 3B 骨干网的基线。 DR-IRL 位于两个模型系列的左上边界(更安全且更有用)。
Hardness消融实验:图3展示了示了难度感知机制的消融结果。在 LLaMA-3.1-8B 上比较了完整 DR-IRL、去掉数据级难度、去掉模型级响应性以及同时去掉两者的 No Hardness 四种设置。结果表明,只要移除任一难度系数,模型的安全性都会下降,其中 No Hardness 会使 StrongReject 分数下降约 4 个百分点;进一步看,去掉数据级难度主要损害拒答精度,去掉模型级响应性会使 SimpleQA 和 GSM8K 等通用能力指标波动更明显,说明前者更偏向细粒度安全控制,后者更有助于保持整体可用性。
表7:跨方法难度加权更新的效果(WildChat 是拒绝率,越高越好)
按类别奖励模型的成本与绩效权衡:表2比较了单一奖励模型与分类别奖励模型的代价和收益。结果显示,在 LLaMA 上训练 7 个分类 shadow reward models 只比单一 reward model 多约 20% 的计算开销(约 100→120 GPU-h),却能带来更好的安全表现,例如 StrongReject 提升 1.79 个百分点,WildChat 提升 2.73 个百分点,Stereotype 提升 2.62 个百分点。这说明将不同安全意图压缩进一个统一标量奖励容易造成 reward interference,而分类别奖励模型能更清晰地区分风险类型,并使后续 GRPO 更新更稳定。
组合规则:乘积与加权和:表3比较了两种难度组合方式:作者提出的乘法形式与加权求和形式。结果表明,乘法形式在 Llama-3.1-8B 和 Qwen-2-7B 上都 consistently 优于加法基线。作者认为,乘法更像一个严格的 AND-gate,只有当样本同时“内容困难”且“模型仍不确定”时才会被显著强调,因此能更好地稳定 DR-IRL 的更新过程,避免某一个信号过强而主导训练。
CoD 在数据生成中的有效性:表4说明了用 CoD(Chain-of-Draft) 替代 CoT 进行数据生成的优势。实验表明,CoD 在基本不损失、甚至略微提升准确率的同时,显著减少了 token 使用量和推理延迟:在 Qwen-2-7B 上 token 数减少约 76%、延迟下降到原来的约三分之一;在 LLaMA-3.1-8B 上也有类似趋势。也就是说,CoD 能以更低成本生成更简洁有效的安全示范数据,是本文数据构造环节中的一个重要工程优化。
防御越狱攻击:表5评估了 DR-IRL 在三种 jailbreak 攻击下的鲁棒性,包括 GCG、AutoDAN 和 DRA。在 LLaMA-3.1-8B 上,DR-IRL 的拒答率分别达到 59.00%、96.98% 和 64.92%,整体优于 Base 和 STAIR,尤其在 DRA 攻击下提升最明显,远高于 Base 的 26.15% 和 STAIR 的 41.97%。这说明 DR-IRL 不仅在常规安全测试中有效,在对抗性更强的越狱场景中也具有更强防御能力。
影子奖励模型质量:表6用 pairwise accuracy 衡量影子奖励模型的排序质量。作者为每个有害类别采样 1000 个 prompt,将人工整理的安全拒答与模型回复组成对,再比较 shadow reward model、OpenAI RM 和 Anthropic Harmless RM 的打分结果。结果显示,本文的 shadow reward model 在 7 个类别上都优于对比方法,总体准确率达到 91.1%,说明其确实能够更可靠地区分“更安全的拒答响应”和“较差的模型回复”,从而为后续策略优化提供高质量奖励信号。
奖励模型规模的影响:图4研究了方法在更小模型上的可扩展性。作者将 DR-IRL 应用于 LLaMA-3.1-3B 和 Qwen-2-3B,并与 Base、SFT、DPO 和 GRPO 进行比较。结果表明,即使在 3B 级别模型上,DR-IRL 依然稳定优于各类基线,StrongReject 相比最强基线还能提升 4–5 个百分点,同时降低 WildChat 毒性。这说明 difficulty-aware shadow rewards 并不依赖大模型规模,在更小参数预算下同样有效。
难度加权更新提升了PPO、DPO和GRPO的性能:表7验证了难度系数的通用性。作者将同样的 difficulty-weighted update 思路分别应用到 PPO、DPO 和 GRPO 中,并保持其余设置不变。结果表明,这些加入难度加权后的变体都 consistently 优于原始方法,在不损害通用能力的前提下提升了 harmlessness 指标;其中在 GRPO 上提升最为明显,说明难度感知更新不仅适用于 DR-IRL 本身,也具有较强的方法泛化性。
DR-IRL 提出了一种面向大语言模型安全对齐的动态优化框架,通过将逆强化学习(IRL)奖励建模与难度感知训练机制相结合,为安全与能力之间的平衡提供了新的解决思路。研究表明,传统对齐方法往往依赖统一的静态奖励模型,使简单样本与复杂样本在训练中受到相同的优化压力,从而导致长尾风险场景学习不足。DR-IRL 通过构建分类别的 shadow reward models并引入基于数据难度与模型响应性的动态奖励缩放,使模型能够更加关注困难与不确定样本,在不损害通用能力的前提下显著提升安全对齐效果。实验结果表明,该方法在多个安全基准与通用能力测试上均取得领先表现,并在多种 jailbreak 攻击场景下展现出更强的鲁棒性。
作者进一步指出,这项研究强调了细粒度奖励建模与动态策略优化在大模型安全对齐中的重要性。通过在训练过程中引入难度感知机制,DR-IRL 不仅缓解了传统方法中的奖励干扰问题,也有效降低了安全对齐所带来的能力损失。这一工作为未来构建更加安全、可靠且具备泛化能力的大语言模型系统提供了新的研究方向,并为安全对齐方法的进一步发展奠定了重要基础。