[論文レビュー] RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting
この論文では、最小限の人的アノテーションデータを用いて、文間のテキスト再編集に特化した最適化が施された指令微調整大規模言語モデル、RewriteLMを紹介する。Wikipediaの編集履歴マイニング、チェーン・オブ・チョイスプロンプティング、および報酬モデル用の新しいランク付け関数を活用することで、RewriteLMは新しいOpenRewriteEvalベンチマークで最先端の性能を達成し、複数の再編集タイプにおいて、ベースLMMおよび指令微調整ベースラインを著しく上回った。
Large Language Models (LLMs) have demonstrated impressive capabilities in creative tasks such as storytelling and E-mail generation. However, as LLMs are primarily trained on final text results rather than intermediate revisions, it might be challenging for them to perform text rewriting tasks. Most studies in the rewriting tasks focus on a particular transformation type within the boundaries of single sentences. In this work, we develop new strategies for instruction tuning and reinforcement learning to better align LLMs for cross-sentence rewriting tasks using diverse wording and structures expressed through natural languages including 1) generating rewriting instruction data from Wiki edits and public corpus through instruction generation and chain-of-thought prompting; 2) collecting comparison data for reward model training through a new ranking function. To facilitate this research, we introduce OpenRewriteEval, a novel benchmark covers a wide variety of rewriting types expressed through natural language instructions. Our results show significant improvements over a variety of baselines. The public repository is available on GitHub under Google Research (https://github.com/google-research/google-research/tree/master/rewritelm).
研究の動機と目的
- 文間のテキスト再編集のためのLLMを訓練する課題に対処し、モデルが内容を保持しなかったり、幻覚を生じさせたりするのを防ぐ。
- 人的アノテーションデータへの依存度を低減するため、指令微調整および報酬モデルのための自動データ収集戦略を開発する。
- 自然言語指令を通じて多様な再編集タイプをカバーする、OpenRewriteEvalという包括的なベンチマークを構築する。
- 多様な次元の報酬関数を統合することで、強化学習を用いて再編集タスクにおけるモデルの制御性と出力品質を向上させる。
- 指令微調整およびRLファインチューニングを施したLLMが、汎用的な指令微調整モデルに比べ、オープンエンドの再編集タスクで優れた性能を発揮できることを示す。
提案手法
- Wikipediaの変更履歴から文間編集を抽出し、指令生成およびチェーン・オブ・チョイスプロンプティングを適用することで、多様な再編集例を生成した。
- 公開コーパスからチェーン・オブ・チョイスプロンプティングを用いて合成された指令-再編集ペアを生成し、後処理を施してデータセットの多様性を向上させた。
- 報酬モデルの学習のための比較データを自動収集するための新しいランク付け関数を設計し、内容の保持、幻覚、言語的多様性、長さの変化の各側面で再編集品質を評価した。
- 自動生成された指令データを用いて、教師あり微調整モデル(Rewrite-PaLM)を訓練し、モデルを再編集指令に一致させるようにした。
- ランク付け関数を用いて報酬関数を最適化し、教師あり微調整モデルの上位に強化学習を適用することで、出力品質をさらに最適化した。
- OpenRewriteEvalを新たに開発し、人間がアノテートした再編集例と自然言語指令を含む、幅広い再編集タイプと文間変換をカバーするベンチマークを提供した。
実験結果
リサーチクエスチョン
- RQ1最小限の人的アノテーションデータを用いて、大規模言語モデルを文間再編集タスクに効果的に微調整できるか?
- RQ2Wiki編集マイニングやチェーン・オブ・チョイスプロンプティングといった自動データ生成技術は、再編集タスクの高品質な指令微調整データの生成にどの程度有効か?
- RQ3学習されたランク付け関数は、報酬モデルの学習に人間がアノテートした比較データを置き換えることができるか?
- RQ4指令微調整LLMに強化学習を適用することで、再編集品質がどの程度向上するか?
- RQ5RewriteLMは、多様でオープンエンドの再編集ベンチマークにおいて、最先端の指令微調整モデルおよびベースLMMと比較してどの程度優れているか?
主な発見
- Rewrite-RL${}_{\text{r/w}}$-PaLM 2-Sは、OpenRewriteEvalで最高の性能を示し、'elaborate'カテゴリではSARIスコア20.15、'updated'カテゴリでは26.32を記録した。
- Rewrite-PaLM 2-Sは、そのベースモデルPaLM 2-Sを大きく上回り、'elaborate'カテゴリでSARIスコア18.13、'updated'カテゴリで25.55を達成した。
- 指令微調整モデルのRewrite-Flan-PaLM-62BおよびRewrite-PaLM-62Bは、それぞれ対応するベースモデルを著しく上回り、'elaborate'カテゴリでSARIスコア17.92および16.44を記録した。
- 本研究で提案された報酬モデルの学習戦略、特にランク付け関数を用いた戦略は、すべての評価カテゴリで一貫した改善をもたらし、最良のモデルではベースラインの指令微調整モデル比でSARIスコアが相対的に30%向上した。
- Flan-PaLM や Alpaca といった最先端の指令微調整モデルですら、オープンエンドの再編集タスクでは限界に達しており、専用の微調整の必要性が浮き彫りになった。
- OpenRewriteEvalベンチマークは、現在のLLMが文間再編集において、特に内容の保持や幻覚の回避という点で困難を抱えていることを明らかにした。これは、特化した訓練の必要性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。