[论文解读] BERT as a Teacher: Contextual Embeddings for Sequence-Level Reward
该论文提出了一种新颖的序列级奖励函数,用于无条件文本生成,使用上下文嵌入的 BERT 表示代替 n-gram 统计。通过将 BERT 编码的词元聚类为 'BERT-grams' 并计算基于嵌入的相似性,该方法提供了一种可扩展的、逐词的奖励信号,能够捕捉长距离依赖关系,并在强化学习中生成更高质量、更多样化的序列,优于基于 n-gram 的奖励方法。
Measuring the quality of a generated sequence against a set of references is a central problem in many learning frameworks, be it to compute a score, to assign a reward, or to perform discrimination. Despite great advances in model architectures, metrics that scale independently of the number of references are still based on n-gram estimates. We show that the underlying operations, counting words and comparing counts, can be lifted to embedding words and comparing embeddings. An in-depth analysis of BERT embeddings shows empirically that contextual embeddings can be employed to capture the required dependencies while maintaining the necessary scalability through appropriate pruning and smoothing techniques. We cast unconditional generation as a reinforcement learning problem and show that our reward function indeed provides a more effective learning signal than n-gram reward in this challenging setting.
研究动机与目标
- 解决基于 n-gram 的奖励在序列级强化学习中的局限性,包括稀疏性、缺乏逐符号信号以及无法捕捉长距离语义。
- 利用 BERT 的上下文词嵌入,构建更具表现力且可扩展的奖励函数,自然支持逐词贡献。
- 在无条件文本生成中实现有效的强化学习训练,此时无输入源,模型必须从参考序列语料库中学习。
- 探究预训练的上下文嵌入是否可作为比传统 n-gram 统计更优的奖励建模基础。
- 评估所提出的奖励是否能在面对奖励稀疏性和策略坍塌的情况下,同时提升无条件生成的质量与多样性。
提出的方法
- 通过使用 BERT 编码参考序列中的每个词元,以基于嵌入相似性的方法替代 n-gram 统计。
- 使用向量量化将得到的 BERT 嵌入聚类为一组紧凑的代表性 'BERT-grams',以确保可扩展性与语料库大小无关。
- 将生成序列的奖励计算为该序列词元与参考语料库中最近似 BERT-grams 之间相似度的总和。
- 对 BERT-grams 表示应用剪枝与平滑技术,以在训练过程中保持鲁棒性与效率。
- 在基于 REINFORCE 的强化学习框架中应用所得的嵌入式奖励,用于无条件文本生成。
- 使用 BERT-gram 奖励训练策略网络,以同时优化质量(通过 GPT-2 语言模型困惑度衡量)与多样性(通过唯一 n-gram 比率衡量)。
实验结果
研究问题
- RQ1上下文嵌入(如 BERT)能否在保持可扩展性的前提下,替代序列级奖励函数中的 n-gram 统计?
- RQ2与基于计数的 n-gram 奖励相比,基于嵌入的奖励是否能提供更细粒度的、逐词的学习信号?
- RQ3BERT-grams 在多大程度上能够捕捉参考语料库中的长距离依赖关系与复杂语义?
- RQ4在无输入源可用的无条件文本生成中,所提出的奖励表现如何?
- RQ5使用基于 BERT 的奖励是否能缓解强化学习文本生成中常见的模式坍塌与多样性不足问题?
主要发现
- BERT-gram 奖励在所有评估指标上均优于 n-gram 奖励,GPT-2 困惑度显著降低,表明序列质量更高。
- 使用 BERT-gram 奖励训练的策略生成的序列多样性更高,表现为唯一序列(ρ)、2-gram(ρ2)和 4-gram(ρ4)比率均高于 n-gram 基线。
- 与 n-gram 奖励早期饱和不同,BERT-gram 奖励提供了更有效的学习信号,表现为训练过程中奖励值更陡峭且持续上升。
- 尽管性能有所提升,但两种奖励函数均导致策略坍塌:BERT-gram 奖励下 95% 的生成序列使用直接引语,n-gram 奖励下为 99%,表明存在强烈的模式偏向。
- 该方法即使在对 BERT 嵌入进行激进聚类的情况下,仍能保持表达能力,证明了其对大规模参考语料库的鲁棒性与可扩展性。
- 研究证实,即使使用更具表现力的奖励函数,底层的 REINFORCE 训练方法在无条件生成中仍存在模式坍塌问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。