[論文レビュー] Adapting LLM Agents with Universal Feedback in Communication
本稿では、LTC(Communicationを介した学習)と呼ばれる新しいトレーニングパラダイムを提案する。この手法により、環境や他のエージェントとの反復的相互作用を通じて、LLMエージェントが継続的に新しいタスクに適応可能になる。構造化された通信パターン(モノローグ、対話、アナロジー)を活用し、収集したトラジェクトリを用いたPPOによる微調整により、意思決定、知識集約的推論、数値推論の各タスクで性能が向上し、指示微調整ベースラインを最大12%上回る成功確率を達成するとともに、推論時のプロンプト長を85%以上短縮する。
Recent advances in large language models (LLMs) have demonstrated potential for LLM agents. To facilitate the training for these agents with both linguistic feedback and non-linguistic reward signals, we introduce Learning through Communication (LTC). We design a universal buffer to store all the feedback, and an iterative pipeline to enable an LLM agent to explore and update its policy in an given environment. To optimize agent interactions for task-specific learning with our universal buffer and pipeline, we introduce diverse communication patterns tailored for both single-agent and multi-agent environments. We evaluate the efficacy of our LTC approach on four diverse datasets: ALFWorld (single-agent), HotpotQA (multi-agent collaboration), Chameleon (multi-agent competition), and GSM8k (multi-agent teacher-student). On these data sets, LTC outperforms the supervised instruction fine-tuning baselines by 3.6% to 12%. These results highlight the versatility and efficiency of LTC in facilitating online adaptation for LLM agents.
研究の動機と目的
- 最小限の人間の監視でLLMエージェントを新しいタスクに適応させる課題に対処すること。
- 反復的相互作用とフィードバックを通じて、継続的かつ自己改善型の適応を可能にすること。
- 推論時に長く手作業で作成されたfew-shotプロンプトに依存するのを減らすこと。
- 効果的なトレーニングに適した多様で構造化されたフィードバックを生成するためのタスク固有の通信パターンを設計すること。
- LTCパラダイムが多様な推論および意思決定タスクにおいて、有効性と効率性を示すことを実証すること。
提案手法
- LTCパラダイムは、探索段階とトレーニング段階を繰り返す反復的パイプラインを採用する。
- 探索段階では、3つの構造化された通信パターン(モノローグ(自己対話)、対話(複数エージェント間相互作用)、アナロジー(教師が生成した例から学習))を用いて、エージェントが環境や他のエージェントと相互作用する。
- 相互作用のトラジェクトリとフィードバック(例:報酬、エラーメッセージ)は、一元化されたリプレイバッファに格納され、トークンレベルのマスクによりシステム出力、エージェント出力、他のエージェント出力を区別する。
- トレーニング段階では、自然な表現のための言語モデリング損失と報酬に基づく方策最適化のためのPPO損失を組み合わせた損失関数をPPOで使用する。
- 各探索段階の後、リプレイバッファが更新され、そのうちのサブセットがトレーニングにサンプリングされ、継続的学習が可能になる。
- フレームワークは、各生成トークンを強化学習の文脈で行動とみなすことで、相互作用からのエンドツーエンドの方策学習を可能にする。

実験結果
リサーチクエスチョン
- RQ1静的微調整ではなく、継続的かつ通信ベースの学習により、LLMエージェントはより優れたタスクパフォーマンスを達成できるか?
- RQ2モノローグ、対話、アナロジーといった異なる通信パターンは、多様な推論タスクにおける学習効率とパフォーマンスにどのように影響するか?
- RQ3LTCは、推論時に長く手作業で作成されたfew-shotプロンプトの必要性をどの程度低減できるか?
- RQ4LLaMA-7Bなどの小さなLLMをLTCでトレーニングした場合、指示微調整でトレーニングされた大きなモデル(例:PaLM-62B)を上回ることができるか?
- RQ5環境と教師エージェント(例:GPT-4)からのフィードバックを統合することで、エージェントは複雑な推論パターンを学習する能力が向上するか?
主な発見
- ALFWorldでは、LTCは指示微調整ベースラインを12%上回る成功確率を達成し、特に挑戦的なPick 2タスクでも同様の優位性を示した。
- HotpotQAでは、LTCは指示微調整されたLLaMA-7BエージェントをEMスコアで5.1%上回り、指示微調整されたPaLM-62Bモデルを0.6%上回った。
- GSM8kでは、LTCはCoT-Tuningベースラインを3.6%上回る正確性を達成した。
- LTCはICL手法と比較して、入力プロンプトのトークン数を85–90%削減し、few-shotプロンプティングに必要なトークンの12.8%から10.8%にまで抑えた。
- アブレーションスタディの結果、構造化された通信パターンとPPO損失を、正例と負例に対して別々に適用することで、単純なデータサンプリングに比べてより高速かつ顕著なパフォーマンス向上が得られた。
- 事例スタディでは、LTCがエージェントにフィードバックから学習させ、教師モデル(例:GPT-4)が用いるショートカットを避ける能力を有していることが示され、模倣を超えた頑健な学習が可能であることが明らかになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。