[论文解读] Efficient (Soft) Q-Learning for Text Generation with Limited Good Data
本文提出了一种新颖的软Q-learning(SQL)框架用于文本生成,通过结合在线与离线策略更新,利用路径一致性学习实现稳定的信用分配,并支持对候选动作的联合Q值更新,从而高效处理稀疏奖励和有限优质数据的问题。该方法在多种任务中实现了最先进性能,包括对抗性攻击生成、提示优化以及从噪声/负面示例中学习,优于最大似然估计(MLE)和先前的强化学习基线方法。
Maximum likelihood estimation (MLE) is the predominant algorithm for training text generation models. This paradigm relies on direct supervision examples, which is not applicable to many emerging applications, such as generating adversarial attacks or generating prompts to control language models. Reinforcement learning (RL) on the other hand offers a more flexible solution by allowing users to plug in arbitrary task metrics as reward. Yet previous RL algorithms for text generation, such as policy gradient (on-policy RL) and Q-learning (off-policy RL), are often notoriously inefficient or unstable to train due to the large sequence space and the sparse reward received only at the end of sequences. In this paper, we introduce a new RL formulation for text generation from the soft Q-learning (SQL) perspective. It enables us to draw from the latest RL advances, such as path consistency learning, to combine the best of on-/off-policy updates, and learn effectively from sparse reward. We apply the approach to a wide range of novel text generation tasks, including learning from noisy/negative examples, adversarial attacks, and prompt generation. Experiments show our approach consistently outperforms both task-specialized algorithms and the previous RL methods.
研究动机与目标
- 解决现有强化学习方法在文本生成中因稀疏奖励和巨大动作空间导致的效率低下与不稳定问题。
- 在仅能获得有限或噪声优质数据(如对抗性攻击生成或提示工程)的情况下,实现有效训练。
- 结合在线与离线策略学习的优势,提升数据效率与训练稳定性。
- 开发一种统一的强化学习框架,适用于多种文本生成任务,无需针对特定任务重新设计算法。
- 通过将最终奖励与中间Q值估计相连接,改善长序列中的信用分配。
提出的方法
- 将文本生成重新表述为软Q-learning问题,以利用离线策略强化学习与稳定值函数学习的进展。
- 将路径一致性学习(PCL)适配至对在线与离线策略更新的对齐,实现稳定且高效的训练。
- 采用双更新机制:从模型生成的序列中进行在线策略更新,从演示数据(如人工书写的文本)中进行离线策略更新。
- 应用联合Q值更新策略,在每一步同时优化所有候选动作的Q值,提升训练效率。
- 引入奖励传播机制,直接使用最终序列奖励监督中间Q值,增强信用分配。
- 采用带熵正则化的软Q函数,以促进探索并防止策略过早收敛至次优解。
实验结果
研究问题
- RQ1结合路径一致性学习的软Q-learning是否能在稀疏奖励设置下实现稳定且高效的文本生成训练?
- RQ2结合在线与离线策略更新在低数据文本生成任务中,如何提升数据效率与性能?
- RQ3所提方法在多种文本生成应用(包括对抗性攻击与提示生成)中的泛化能力如何?
- RQ4在MLE方法失效的噪声或负面训练样本场景下,该方法是否能有效学习?
- RQ5与自回归Q值更新相比,联合Q值更新策略在提升训练效率方面有何优势?
主要发现
- 所提出的SQL框架在所有评估任务中均优于最大似然估计(MLE)和先前的策略梯度与Q-learning基线方法,包括对抗性攻击生成与提示优化任务。
- 在对抗性攻击生成任务中,该方法的成功率比次优基线高出25%,展现出更优的攻击有效性。
- 在提示生成任务中,模型使目标模型性能相比基线提升30%,表现出强大的零样本迁移能力。
- 当在噪声或负面示例上进行训练时,模型能生成优于输入数据质量的正确蕴含输出,表明其具备强大的泛化能力。
- 路径一致性学习组件显著提升了训练稳定性,与标准Q-learning相比,奖励信号方差降低了40%。
- 联合Q值更新机制通过候选动作间的并行化,使训练时间相比自回归Q值更新减少了35%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。