Skip to main content
QUICK REVIEW

[論文レビュー] Personalized Abstractive Summarization by Tri-agent Generation Pipeline

Wen Xiao, Yujia Xie|arXiv (Cornell University)|May 4, 2023
Topic Modeling被引用数 7
ひとこと要約

この論文では、大規模言語モデルを用いたパーソナライズド要約のための三エージェントパイプライン—生成者、インstructer、エディタ—を提案する。小さなインストラクター・モデルを微調整し、ChatGPTからのフィードバックを用いたエディタ主導の強化学習で訓練することで、ユーザー固有の編集指示を生成する。この手法により、DeFactoおよびCNNDMデータセットにおいて、要約のユーザーの好みへの適合性が顕著に向上した。

ABSTRACT

Tailoring outputs from large language models, like ChatGPT, to implicit user preferences remains a challenge despite their impressive generative capabilities. In this paper, we propose a tri-agent generation pipeline comprising a generator, an instructor, and an editor to enhance output personalization. The generator produces an initial output, the instructor automatically generates editing instructions based on user preferences, and the editor refines the output to align with those preferences. The inference-only large language model (ChatGPT) serves as both the generator and editor, with a smaller model acting as the instructor to guide output generation. We train the instructor using editor-steered reinforcement learning, leveraging feedback from a large-scale editor model to optimize instruction generation. Experimental results on two abstractive summarization datasets demonstrate the effectiveness of our approach in generating outputs that better meet user expectations. Code is available at \url{https://github.com/Wendy-Xiao/chatgpt_editing_summ}

研究の動機と目的

  • 特定のユーザーのニーズに合わせたLLM生成要約のパーソナライズを解決すること。
  • 一度の生成に限界があるのを克服し、繰り返しの編集・最適化プロセスを導入すること。
  • 大規模モデルの微調整に依存するのを減らし、小規模なインストラクター・モデルによる指示生成を活用すること。
  • エディタ主導の強化学習により、インストラクターの指示をユーザー要件に適合させること。
  • カバレッジと事実整合性を主なユーザー基準とする要約生成のフレームワークを評価すること。

提案手法

  • 生成者(ChatGPT)が入力テキストから初期要約を生成する。
  • より小さなインストラクター・モデルがユーザー要件に基づいて自然言語の編集指示を生成する。
  • エディタ(ChatGPT)がインストラクターの指示に従って初期要約を再編集する。
  • インストラクターは、まず人間が作成した指示で教師あり微調整され、その後エディタ主導の強化学習でさらに最適化される。
  • 強化学習における報酬関数は、エディタ・モデルが評価した編集出力の質に基づき、ROUGE や事実整合性スコアなどの自動指標で測定される。
  • 複数ラウンドの指示と編集を繰り返すことで、ユーザー期待に適合するよう改善される繰り返しの最適化をサポートする。
Figure 1: Comparison between different generation paradigms. The middle one is from Welleck et al. ( 2022 ) .
Figure 1: Comparison between different generation paradigms. The middle one is from Welleck et al. ( 2022 ) .

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルのエディタに導かれた小さなインストラクター・モデルが、要約の質を顕著に向上させる編集指示を生成できるか?
  • RQ2エディタ主導の強化学習は、ユーザーの好みに適合するインストラクター生成指示をどれほど効果的に実現できるか?
  • RQ3三エージェントパイプラインにおける繰り返し編集は、ワンステップ生成に比べてユーザー要件への適合性をどれほど向上させるか?
  • RQ4ROUGEと事実整合性の観点から、三エージェントパイプラインの性能はベースライン手法と比べてどうか?
  • RQ5このフレームワークは、要約を超えた他のNLPタスク(例:ウィキ編集、数学的問題の生成)へも拡張可能か?

主な発見

  • 三エージェントパイプラインは、DeFactoおよびCNNDMデータセットの両方で、要約のユーザー要件への適合性を顕著に向上させた。
  • エディタ主導の強化学習によるインストラクターの訓練は、教師あり微調整のみに比べて、より効果的な指示生成を実現した。
  • 三エージェントパイプラインによる繰り返し編集は、要約の質をさらに向上させ、複数の最適化ステップの利点を示した。
  • 最終モデルは、教師ありベースラインと同等のROUGE-Lスコアを達成したが、大規模モデルの微調整は最小限に抑えられた。
  • フレームワークはChatGPTをエディタとして効果的に活用し、大規模モデルの直接微調整の必要性を回避することで、計算的・アクセス上の障壁を低減した。
  • このアプローチは、ウィキ編集や数学的問題生成などの編集を要する他のNLPタスクへの応用についても、有望であると示唆された。
Figure 2: An illustration of the proposed tri-agent pipeline.
Figure 2: An illustration of the proposed tri-agent pipeline.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。