Skip to main content
QUICK REVIEW

[论文解读] RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting

Lei Shu, Liangchen Luo|arXiv (Cornell University)|May 25, 2023
Topic Modeling被引用 4
一句话总结

该论文提出RewriteLM,一种专为跨句文本重写任务而优化的指令微调大语言模型,仅使用极少的人工标注数据。通过利用维基编辑挖掘、思维链提示和一种新颖的奖励建模排名函数,RewriteLM在新的OpenRewriteEval基准上实现了最先进性能,显著优于基础大语言模型和指令微调基线模型,涵盖多种重写类型。

ABSTRACT

Large Language Models (LLMs) have demonstrated impressive capabilities in creative tasks such as storytelling and E-mail generation. However, as LLMs are primarily trained on final text results rather than intermediate revisions, it might be challenging for them to perform text rewriting tasks. Most studies in the rewriting tasks focus on a particular transformation type within the boundaries of single sentences. In this work, we develop new strategies for instruction tuning and reinforcement learning to better align LLMs for cross-sentence rewriting tasks using diverse wording and structures expressed through natural languages including 1) generating rewriting instruction data from Wiki edits and public corpus through instruction generation and chain-of-thought prompting; 2) collecting comparison data for reward model training through a new ranking function. To facilitate this research, we introduce OpenRewriteEval, a novel benchmark covers a wide variety of rewriting types expressed through natural language instructions. Our results show significant improvements over a variety of baselines. The public repository is available on GitHub under Google Research (https://github.com/google-research/google-research/tree/master/rewritelm).

研究动机与目标

  • 解决大语言模型在跨句文本重写任务中的挑战,因为这些模型常常无法保持内容完整性或引入幻觉。
  • 通过开发自动化数据收集策略用于指令微调和奖励建模,减少对昂贵人工标注数据的依赖。
  • 创建一个综合性基准OpenRewriteEval,通过自然语言指令支持多种重写类型。
  • 通过整合强化学习与多维奖励函数,提升重写任务中的模型可控性和输出质量。
  • 证明指令微调与强化学习微调的大语言模型在开放式重写任务中可超越通用指令微调模型的性能。

提出的方法

  • 通过从维基百科修订中提取跨句编辑,并应用指令生成和思维链提示,生成多样化的重写示例,以生成指令数据。
  • 利用思维链提示和后处理技术,从公开语料库中生成合成的指令-重写对,以增强数据集多样性。
  • 设计一种新的排名函数,以自动收集用于奖励模型训练的比较数据,评估重写质量在内容保留、幻觉、语言多样性及长度变化方面的表现。
  • 使用自动生成的指令数据,对监督微调模型(Rewrite-PaLM)进行训练,使其与重写指令对齐。
  • 在监督微调模型的基础上应用强化学习,结合排名函数进一步优化输出质量。
  • 提出OpenRewriteEval,一个包含人工标注重写结果和自然语言指令的新基准,涵盖广泛的重写类型和跨句转换。

实验结果

研究问题

  • RQ1能否通过极少人工标注数据有效微调大语言模型,以实现跨句文本重写?
  • RQ2自动化数据生成技术(如维基编辑挖掘和思维链提示)在生成高质量指令微调数据方面对重写任务的有效性如何?
  • RQ3学习到的排名函数能否替代人工标注的比较数据,用于文本重写任务中的奖励模型训练?
  • RQ4当应用于指令微调的大语言模型时,强化学习在多大程度上能提升重写质量?
  • RQ5RewriteLM在涵盖多种重写类型的开放式、开放性重写基准上的表现,相较于最先进指令微调模型和基础大语言模型如何?

主要发现

  • Rewrite-RL${}_{\text{r/w}}$-PaLM 2-S在OpenRewriteEval上表现最佳,在'elaborate'类别中SARI得分为20.15,在'updated'类别中为26.32。
  • Rewrite-PaLM 2-S相比其基础模型PaLM 2-S有显著提升,在'elaborate'类别中SARI得分为18.13,在'updated'类别中为25.55。
  • 如Rewrite-Flan-PaLM-62B和Rewrite-PaLM-62B等指令微调模型显著优于其对应的基线模型,'elaborate'类别中SARI得分分别为17.92和16.44。
  • 所提出的使用排名函数的奖励模型训练策略在所有评估类别中均带来一致改进,最佳模型相比基线指令微调模型在SARI上实现了30%的相对提升。
  • 即使是最先进的指令微调模型如Flan-PaLM和Alpaca,在开放式重写任务中表现也有限,凸显了专用微调的必要性。
  • OpenRewriteEval基准揭示,当前大语言模型在跨句重写任务中仍存在困难,尤其是在内容保留和避免幻觉方面,验证了针对性训练的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。