[論文レビュー] Large Language Model Programs
この論文では、事前学習された言語モデル(LLM)を明示的なアルゴリズムに埋め込むことで、推論能力とアルゴリズム的機能を向上させる手法、Large Language Model Programs(LLM Programs)を紹介する。タスクを独立した部分問題に分解し、各ステップで関連するコンテキストのみをLLMに渡すことで、微調整を一切行わずに、チェーン・オブ・スティェートメント(chain-of-thought)プロンプティングより6.4%の精度向上を達成した。
In recent years, large pre-trained language models (LLMs) have demonstrated the ability to follow instructions and perform novel tasks from a few examples. The possibility to parameterise an LLM through such in-context examples widens their capability at a much lower cost than finetuning. We extend this line of reasoning and present a method which further expands the capabilities of an LLM by embedding it within an algorithm or program. To demonstrate the benefits of this approach, we present an illustrative example of evidence-supported question-answering. We obtain a 6.4\% improvement over the chain of thought baseline through a more algorithmic approach without any finetuning. Furthermore, we highlight recent work from this perspective and discuss the advantages and disadvantages in comparison to the standard approaches.
研究の動機と目的
- 微調整後でさえも、ソートや検索などのアルゴリズム的タスクを実行する能力に欠けるLLMの限界を解決すること。
- デコーダー・オンリーのトランスフォーマーのアーキテクチャ的制約(有限なコンテキスト長、分布外一般化性能の低さ)を克服すること。
- 微調整の代替手段として、スケーラブルで解釈可能かつモジュラーな手法を提供すること。LLMを明示的なプログラムに埋め込むことで実現する。
- モデルの再トレーニングを必要とせずに、構造的なプログラム的制御が複雑な推論タスクの性能を向上させることを示すこと。
- モジュラーな分解の利点が、LLMベースのシステムにおける信頼性、解釈可能性、一般化性能の向上に寄与することを強調すること。
提案手法
- 複雑なタスクを、各々が最小限で関連するコンテキストを持つ1回のLLM呼び出しで解決できる、より小さな独立した部分問題に分解する。
- 状態の管理とLLM呼び出しのオーケストレーションを制御するプログラム的フローマネジメントを用いることで、各ステップに必要な入力のみを供給する。
- 推論中に段落選択のツリー探索を適用し、各推論ステップに対して最も関連性の高い証拠を動的に選択する。
- 単一のモノリス的プロンプトに依存するのではなく、明確に定義された操作のシーケンスを経由してLLMを導く、高レベルのアルゴリズム的構造を維持する。
- LLMを大規模なプログラム内のサブルーチンとして統合することで、個々のコンponentのモジュラリティ、テスト可能性、合成可能性を実現する。
- 正しさと一貫性を保証する構造的なフレームワーク内でのLLMの生成機能を活用し、各ステップ間で整合性を確保する。

実験結果
リサーチクエスチョン
- RQ1標準的なイン・コンテキスト学習と比較して、明示的なプログラムにLLMを埋め込むことで、アルゴリズム的および推論的タスクにおける性能が向上するか?
- RQ2独立した部分問題の解決を伴うプログラム的アプローチは、単一プロンプトのチェーン・オブ・スティェートメント手法と比較して、より良い一般化性能と干渉の低減を達成するか?
- RQ3微調整なしで、特に証拠に基づく質問応答タスクにおいて、LLM Programsがどの程度の性能向上を達成できるか?
- RQ4LLM Programsのモジュラーでアルゴリズム的な構造は、エンドツーエンドのニューラルモデルと比較して、解釈可能性と信頼性をどのように向上させるか?
- RQ5専門家のデモンストレーションに基づく微調整と比較して、LLMをプログラミングする手法が、どのような状況でより優位な利点を示すか?
主な発見
- LLM Programsアプローチは、微調整を一切行わずに、チェーン・オブ・スティェートメントベースラインより、証拠に基づく質問応答の精度で6.4%の絶対的向上を達成した。
- 部分問題を隔離し、各LLM呼び出しに対して焦点を当てたコンテキストを提供することで、推論ステップ間の干渉が低減され、全体の推論品質が向上した。
- プログラム的アプローチにより、たとえばフィルタリングや検索のコンポーネントが、より大きな文書セットに対しても自然にスケーリングされるという、簡単な一般化保証が可能になった。
- LLMをアルゴリズムに埋め込むことで、関連情報の動的ロードと要約が可能になり、有限なコンテキスト長というアーキテクチャ的制限が緩和された。
- LLM呼び出しの間で外部制御メカニズム(例:フィルタリングや検証)を可能にすることで、より安全で信頼性の高い挙動が実現された。
- このアプローチは、既存のLLMの能力と互換性があり、再トレーニングを必要とせずに、推論、要約、テキスト生成など多様なタスクに適用可能である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。