Skip to main content
QUICK REVIEW

[论文解读] Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints

Chaoqi Wang, Yibo Jiang|arXiv (Cornell University)|Sep 28, 2023
Data Management and AlgorithmsComputer Science被引用 3
一句话总结

该论文提出了 f-DPO,一种广义的直接偏好优化(DPO)框架,通过引入多样化的 f-散度(如 Jensen-Shannon、前向 KL 和 α-散度)扩展了传统 DPO 的范围,突破了仅依赖反向 KL 散度的限制。通过严格求解 Karush–Kuhn–Tucker(KKT)条件,特别是互补松弛性条件,该方法消除了 Bradley-Terry 模型中对归一化常数的估计需求,实现了从奖励函数到最优策略的可计算、解析映射。与基于 PPO 的方法相比,该方法在对齐效率和校准误差控制方面表现更优,同时在对齐性能与生成多样性之间实现了更好的平衡。

ABSTRACT

The increasing capabilities of large language models (LLMs) raise opportunities for artificial general intelligence but concurrently amplify safety concerns, such as potential misuse of AI systems, necessitating effective AI alignment. Reinforcement Learning from Human Feedback (RLHF) has emerged as a promising pathway towards AI alignment but brings forth challenges due to its complexity and dependence on a separate reward model. Direct Preference Optimization (DPO) has been proposed as an alternative, and it remains equivalent to RLHF under the reverse KL regularization constraint. This paper presents $f$-DPO, a generalized approach to DPO by incorporating diverse divergence constraints. We show that under certain $f$-divergences, including Jensen-Shannon divergence, forward KL divergences and $α$-divergences, the complex relationship between the reward and optimal policy can also be simplified by addressing the Karush-Kuhn-Tucker conditions. This eliminates the need for estimating the normalizing constant in the Bradley-Terry model and enables a tractable mapping between the reward function and the optimal policy. Our approach optimizes LLMs to align with human preferences in a more efficient and supervised manner under a broad set of divergence constraints. Empirically, adopting these divergences ensures a balance between alignment performance and generation diversity. Importantly, $f$-DPO outperforms PPO-based methods in divergence efficiency, and divergence constraints directly influence expected calibration error (ECE).

研究动机与目标

  • 为解决现有 DPO 和 RLHF 方法仅依赖反向 KL 散度所带来的局限性,后者可能降低生成多样性并限制模型表达能力。
  • 将 DPO 扩展至反向 KL 之外的多种 f-散度,包括前向 KL、Jensen-Shannon 和 α-散度,以在不同约束条件下实现更丰富的策略优化。
  • 通过在特定散度族下解析求解 KKT 条件,特别是互补松弛性,消除 Bradley-Terry 模型中对归一化常数的估计需求。
  • 在无需奖励模型或强化学习的前提下,实现 LLM 更高效、稳定且可监督微调,以实现人类偏好对齐。
  • 通过实证验证,多样化散度约束可改善对齐性能与生成多样性之间的平衡,并直接影响预期校准误差(ECE)。

提出的方法

  • 该方法通过在包含 Jensen-Shannon、前向 KL 和 α-散度(α ∈ (0,1))的 f-散度族下,形式化偏好优化问题,实现对 DPO 的泛化。
  • 推导出约束优化问题中 KKT 条件的解析解,特别利用互补松弛性,消除了 Bradley-Terry 模型中难以处理的归一化常数。
  • 在这些散度下,建立了奖励函数与最优策略之间的闭式映射,实现无需迭代强化学习或奖励模型训练的直接优化。
  • 该框架支持使用偏好数据对 LLM 进行端到端的监督微调,通过显式施加散度约束来调控策略更新,以平衡对齐与多样性。
  • 支持将多种散度类型作为超参数使用,使实践者可根据安全、多样性与性能之间的特定权衡进行调优。
  • 该方法在凸优化与 f-散度理论基础上具有坚实的理论支撑,重点关注 LLM 对齐场景下的可计算性与可解释性。

实验结果

研究问题

  • RQ1DPO 框架能否被泛化至反向 KL 散度之外,纳入如前向 KL、Jensen-Shannon 和 α-散度等其他 f-散度?
  • RQ2通过 KKT 条件分析,在这些泛化的散度下,是否仍可实现 Bradley-Terry 模型中归一化常数的消除?
  • RQ3与基于 PPO 的 RLHF 方法相比,所提出的 f-DPO 框架是否能实现更高的对齐效率与更优的多样性平衡?
  • RQ4不同散度约束如何影响微调后 LLM 的预期校准误差(ECE)?
  • RQ5该泛化的 f-DPO 方法能否在保持强对齐性能的同时,实现更灵活且可解释的策略优化?

主要发现

  • f-DPO 通过解析求解 KKT 条件并消除对归一化常数的估计需求,成功将 DPO 泛化至包括 Jensen-Shannon、前向 KL 和 α-散度(α ∈ (0,1))在内的多种 f-散度。
  • 该方法在这些散度下实现了从奖励函数到最优策略的直接、解析映射,支持高效、可监督的微调,无需奖励模型或强化学习。
  • 实证结果表明,f-DPO 在散度效率方面优于基于 PPO 的方法,表现出更快的收敛速度和在相同偏好数据下的更优对齐性能。
  • 不同散度约束可直接影响预期校准误差(ECE),f-DPO 通过选择合适的散度可实现对模型校准性的显式控制。
  • 使用多样化散度可实现对齐性能与生成多样性的更好平衡,缓解反向 KL 的模式搜寻行为,提升模型表达能力。
  • 该框架可根据所选散度支持更广泛的建模行为(如质量覆盖或模式搜寻),为特定应用场景提供更大的灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。