QUICK REVIEW
[论文解读] Thank you BART! Rewarding Pre-Trained Models Improves Formality Style Transfer
Huiyuan Lai, Antonio Toral|arXiv (Cornell University)|May 14, 2021
Topic Modeling参考文献 26被引用 6
一句话总结
本文提出了一种基于预训练模型(GPT-2 和 BART)的奖励增强微调框架,用于正式风格转换,通过整合风格分类奖励与基于 BLEU 的奖励,同时提升风格转换准确率与内容保留能力。该方法实现了最先进性能,表明仅使用 10% 并行数据进行微调即可超越从头训练 100% 数据的性能,显著降低了对数据量的依赖。
ABSTRACT
Scarcity of parallel data causes formality style transfer models to have scarce success in preserving content. We show that fine-tuning pre-trained language (GPT-2) and sequence-to-sequence (BART) models boosts content preservation, and that this is possible even with limited amounts of parallel data. Augmenting these models with rewards that target style and content -- the two core aspects of the task -- we achieve a new state-of-the-art.
研究动机与目标
- 为解决在并行训练数据稀缺时内容保留的挑战。
- 探究在仅使用有限并行数据进行微调时,预训练模型是否能提升内容保留与风格转换性能。
- 评估结合风格分类与基于 BLEU 的奖励在提升风格强度与内容保真度方面的有效性。
- 证明仅使用 10% 并行数据对预训练模型进行微调,即可超越在 100% 数据上从头训练的性能。
- 减少对大规模并行数据的依赖,使监督式风格转换在更多领域与语言中得以广泛应用。
提出的方法
- 在形式化风格转换的并行语料上微调 GPT-2 和 BART 模型,采用序列到序列框架,并使用特殊标记 [BOS]、[SEP] 和 [EOS] 来结构化输入与输出。
- 引入两种奖励信号:基于预训练 TextCNN 分类器的风格分类奖励,以增强对目标风格预测的信心;以及基于 BLEU 的奖励,以提升内容保留能力。
- 使用强化学习优化模型,采用组合奖励函数:R_total = λ_cls × R_cls + λ_bleu × R_bleu,其中 R_cls 衡量风格置信度的变化,R_bleu 衡量与参考输出的 n-gram 重叠度。
- 端到端训练模型,采用双奖励目标,微调期间固定风格分类器的参数以稳定训练过程。
- 使用 BART large 和 GPT-2 base 模型,评估不同模型规模与架构下的性能表现。
- 在推理阶段采用束搜索与温度采样,以生成多样化且高质量的输出。
实验结果
研究问题
- RQ1当在有限并行数据上微调时,GPT-2 和 BART 等预训练语言模型是否能提升形式化风格转换中的内容保留能力?
- RQ2将风格与内容特定奖励结合是否优于单独使用任一奖励或不使用奖励?
- RQ3仅使用 10% 并行数据进行微调,是否能超越在 100% 数据上从头训练的性能?
- RQ4预训练模型在分离风格与内容方面表现如何?两者在最终输出质量中各自发挥什么作用?
- RQ5所提出方法在多大程度上减少了监督式风格转换对大规模并行数据的依赖?
主要发现
- BART large 模型在同时使用风格与内容奖励时,在 E&M 领域达到最高风格置信度(ACC = 0.825)与 BLEU 分数(0.800),显著优于所有基线模型。
- BART large + SC & BLEU 模型在 E&M 领域实现 BLEU 分数 0.800 与风格置信度 0.825,显著优于 OpenNMT 与 GPT-2 变体。
- 仅使用 10% 并行数据进行微调,其内容保留能力(BLEU: 0.657)与风格置信度(0.657)均优于在 100% 数据上从头训练的模型。
- 风格分类与 BLEU 奖励的结合在所有模型变体中均一致提升了风格强度与内容保真度,其中 BART 模型表现更优。
- GPT-2 模型在双奖励设置下实现 BLEU 分数 0.634 与风格置信度 0.634,表明其具备出色的内容保留能力与有效的风格转换性能。
- BART large + SC & BLEU 模型生成的输出最流畅且最准确,BLEU 分数达 1.000,风格置信度为 0.096,表明其具有高度流畅性与正确的风格转换能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。