[論文レビュー] Agent Instructs Large Language Models to be General Zero-Shot Reasoners
この論文では、自律的言語エージェントを用いてタスク固有の指示を生成するAgentInstructという手法を提案する。これにより、多様な自然言語処理タスクにおける大規模言語モデル(LLMs)のゼロショット推論能力が向上する。LLMの推論をウェブで検証されたタスク固有のガイダンスと一致させることで、29のデータセットのうち20で最先端のゼロショット性能を達成し、Llama-2-70b-chatでは23.2%向上、チェーン・オブ・トゥーク(CoT)プロンプティングより推論能力が平均10.5%向上した。
We introduce a method to improve the zero-shot reasoning abilities of large language models on general language understanding tasks. Specifically, we build an autonomous agent to instruct the reasoning process of large language models. We show this approach further unleashes the zero-shot reasoning abilities of large language models to more tasks. We study the performance of our method on a wide set of datasets spanning generation, classification, and reasoning. We show that our method generalizes to most tasks and obtains state-of-the-art zero-shot performance on 20 of the 29 datasets that we evaluate. For instance, our method boosts the performance of state-of-the-art large language models by a large margin, including Vicuna-13b (13.3%), Llama-2-70b-chat (23.2%), and GPT-3.5 Turbo (17.0%). Compared to zero-shot chain of thought, our improvement in reasoning is striking, with an average increase of 10.5%. With our method, Llama-2-70b-chat outperforms zero-shot GPT-3.5 Turbo by 10.2%.
研究の動機と目的
- 一般で多様な言語理解タスクにおける大規模言語モデルのゼロショット推論能力を向上させること。
- チェーン・オブ・トゥークのような既存のゼロショット手法が広範なタスク分布にわたって一般化しにくいという限界を解消すること。
- ファインチューニングやタスク固有の例示なしに、推論を解き放つスケーラブルで汎用的な手法を開発すること。
- 自律的エージェントが生成する高品質なタスク固有の推論指示を提供することで、LLMが未学習のタスクでもより良い性能を発揮できるようにすること。
提案手法
- 最小限の入力(例:データセット名と例示入力)に基づき、ウェブ検索を用いてタスク関連の知識にアクセスする自律的言語エージェントを展開する。
- LLMの推論プロセスを正しい解決へ導く、段階的でタスク固有的な指示を生成する。
- エージェントが生成した指示をLLMのチェーン・オブ・トゥーク推論と統合し、推論ステップをタスク固有の要件と一致させる。
- 推論エンジンとして1つのLLM、エージェントプランナとして別のLLMを用い、両者を構造的かつ実行可能な指示を生成するようにプロンプトする。
- ウェブで入手した事実と一貫性チェックを用いて、指示の品質を検証し、信頼性とタスク適合性を確保する。
- ファインチューニングやFew-shot例示なしに、生成、分類、推論タスクのすべてにわたるエンドツーエンドのゼロショット設定でこの手法を適用する。

実験結果
リサーチクエスチョン
- RQ1自律的エージェントが、多様な自然言語処理タスクにおけるLLMのゼロショット推論を顕著に向上させるタスク固有の指示を生成できるか?
- RQ2AgentInstructは、一般的な言語理解タスクにおける標準的ゼロショットおよびチェーン・オブ・トゥークプロンプティングと比較して、ゼロショット性能でどの程度優れているか?
- RQ3AgentInstructは狭義のタスクドメインを超えて一般化し、推論能力をどの程度向上できるか?
- RQ4AgentInstructは、生成、分類、推論をカバーする29のデータセットからなる広範なベンチマークで、最先端のゼロショット性能を達成できるか?
主な発見
- AgentInstructは、評価された29のデータセットのうち20で最先端のゼロショット性能を達成し、タスクタイプにわたる強力な一般化能力を示した。
- この手法により、Llama-2-70b-chatの平均ゼロショット性能が23.2%向上、Vicuna-13bでは13.3%、GPT-3.5 Turboでは17.0%向上した。
- AgentInstructは、ゼロショットチェーン・オブ・トゥークと比較して、平均で10.5%の推論性能向上を達成し、12の推論タスクのうち10でそれを上回った。
- Llama-2-70b-chatにAgentInstructを適用した結果、より強力なモデルであるGPT-3.5 Turboの標準的ゼロショット性能を平均で10.2%上回った。
- エージェントが生成した指示は非常に効果的であり、ウェブで取得した知識に基づき、一貫性とタスク関連性の両方で検証されている。
- この手法は、ファインチューニングやタスク固有の例示なしに、テキスト生成、分類、推論を含む多様な自然言語処理タスクにわたる強力でスケーラブルな性能を発揮する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。