Skip to main content
QUICK REVIEW

[論文レビュー] Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization

Weiran Yao, Shelby Heinecke|arXiv (Cornell University)|Aug 4, 2023
Topic Modeling被引用数 4
ひとこと要約

Retroformerは、過去の失敗を分析し、実行可能なフィードバックを生成することで、大規模言語モデルエージェントの性能を向上させるポリシー勾配に基づくフレームワークを導入する。エージェントのパラメータにアクセスせずに環境報酬から学習することで、HotPotQAで4回の試行内でタスク成功確率を18%向上させ、勾配ベースの最適化を欠いたベースラインを上回る。

ABSTRACT

Recent months have seen the emergence of a powerful new trend in which large language models (LLMs) are augmented to become autonomous language agents capable of performing objective oriented multi-step tasks on their own, rather than merely responding to queries from human users. Most existing language agents, however, are not optimized using environment-specific rewards. Although some agents enable iterative refinement through verbal feedback, they do not reason and plan in ways that are compatible with gradient-based learning from rewards. This paper introduces a principled framework for reinforcing large language agents by learning a retrospective model, which automatically tunes the language agent prompts from environment feedback through policy gradient. Specifically, our proposed agent architecture learns from rewards across multiple environments and tasks, for fine-tuning a pre-trained language model which refines the language agent prompt by summarizing the root cause of prior failed attempts and proposing action plans. Experimental results on various tasks demonstrate that the language agents improve over time and that our approach considerably outperforms baselines that do not properly leverage gradients from the environment. This demonstrates that using policy gradient optimization to improve language agents, for which we believe our work is one of the first, seems promising and can be applied to optimize other models in the agent architecture to enhance agent performances over time.

研究の動機と目的

  • 既存の言語エージェントにおける環境報酬最適化の欠如に取り組むこと。これは、微分不能な言語的フィードバックに依存する傾向がある。
  • アクター言語モデルのパラメータにアクセスせずに、勾配ベースの学習を可能にするために、失敗を分析し、実行可能なインサイトを生成する後向きモデルを訓練すること。
  • 主なアクター言語モデルへのアクセスや勾配計算を必要とせず、エージェントの性能を向上させるプラグインモジュールを開発すること。
  • ポリシー勾配最適化が、多様な環境やタスクにおいて言語エージェントの推論と計画能力を向上させられるかどうかを調査すること。
  • 自己反省において固定された言語モデルの限界を克服し、正確な責任帰属割り当てと根本原因分析を可能にする専用の後向きモデルを訓練すること。

提案手法

  • フレームワークは、環境からの報酬を用いてポリシー勾配最適化により微調整される後向きモデル $M_r$ を使用する。アクター言語モデルは環境の一部として扱われる。
  • 後向きモデルは、過去の失敗の根本原因を要約し、次の試行のための見直された行動計画を提案するテキストフィードバックを生成する。
  • アクター言語モデルをブラックボックスとして扱うことで、その内部に逆誤差伝搬を実行せず、後向きモデルでのみ勾配更新が行われる。
  • 後向きモデルは、HotPotQAのような環境からの報酬を用いて、オフラインの経験トラジェクトリに従って訓練され、効果的で構造化された自己反省を生成する能力を最適化する。
  • モデルは、失敗の反省と新たな実行可能計画の2部構成の応答を学習し、明示的な教師信号なしにこの構造を自然に獲得する。
  • このアプローチはモジュラで、GPT や Bard などの任意のクラウドベース言語モデルと統合可能であり、メモリや要約モジュールなどの他のコンponentsへも拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1ポリシー勾配最適化は、後向きフィードバックを通じて、大規模言語エージェントの推論と計画能力を向上させることができるか?
  • RQ2微調整された後向きモデルは、反復的タスク改善のための実行可能で責任帰属に配慮したフィードバックを生成する点で、固定された言語モデルを上回るか?
  • RQ3プラグイン型の後向きモジュールは、アクター言語モデルを変更せず、勾配をその内部に伝搬させずに、エージェント性能をどの程度向上させられるか?
  • RQ4後向きフィードバックの構造(例:反省と計画の分離)は、エージェントのパフォーマンスと学習効率にどのような影響を与えるか?
  • RQ5提案手法は、特にツール使用を含む高次元の状態行動空間を持つ質問応答タスクのような多様な環境やタスクに一般化可能か?

主な発見

  • Retroformerは、HotPotQAにおける検索ベースの質問応答タスクの成功確率を、4回の試行内で18%向上させ、ベースライン手法を顕著に上回る。
  • 微調整された後向きモデルは、正確な責任帰属割り当てを学習し、エージェントが思考の連鎖中に目的を忘れることによって失敗したことを特定する。
  • 固定された言語モデルとは異なり、繰り返しで役に立たない反省を生成するが、強化されたモデルは明確な反省と行動計画のセクションに分かれた構造化されたフィードバックを生成する。
  • 冗長または関係のない内容(例:'Next trial:')を排除することで、強化されたモデルは幻覚を回避し、より洗練され、実行可能である出力を得る。
  • この手法は、ベンチマークで5回の試行で53%の成功確率を達成し、はるかに大きな言語モデル(GPT-3)を用いた最先端手法の50%の成功確率を上回る。
  • ポリシー勾配アプローチにより、後向きモデルは環境フィードバックとの試行錯誤を通じて、根本原因分析や構造化された応答フォーマットといったエメrgentな行動を学習する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。