[論文レビュー] Amortizing intractable inference in large language models
この論文は、生成フローネット(GFlowNets)を用いた大規模言語モデル(LLMs)のファインチューニングにより、計算が困難な事後分布からの効率的で多様なサンプリングを可能にする、アンモタイズドベイジアン推論を提案する。これは、チェーン・オブ・トゥークン(CoT)推論や制約付き生成に必要な分布を含む。本手法は教師ありファインチューニングおよびPPOを上回り、データ効率性とサンプルの多様性に優れ、50個のシード推論例を用いて分布内整数演算タスクで95.2%の精度を達成した。
Autoregressive large language models (LLMs) compress knowledge from their training data through next-token conditional distributions. This limits tractable querying of this knowledge to start-to-end autoregressive sampling. However, many tasks of interest -- including sequence continuation, infilling, and other forms of constrained generation -- involve sampling from intractable posterior distributions. We address this limitation by using amortized Bayesian inference to sample from these intractable posteriors. Such amortization is algorithmically achieved by fine-tuning LLMs via diversity-seeking reinforcement learning algorithms: generative flow networks (GFlowNets). We empirically demonstrate that this distribution-matching paradigm of LLM fine-tuning can serve as an effective alternative to maximum-likelihood training and reward-maximizing policy optimization. As an important application, we interpret chain-of-thought reasoning as a latent variable modeling problem and demonstrate that our approach enables data-efficient adaptation of LLMs to tasks that require multi-step rationalization and tool use.
研究の動機と目的
- 自己回帰的LLMが自己回帰的サンプリングを超える知識の容易な照会に限界を抱えることに対処する。
- シーケンス継続、インフィルディング、制約付き生成などのタスクにおいて、計算が困難な事後分布からの効率的で多様なサンプリングを可能にする。
- 標準的なファインチューニングおよび強化学習と比較して、少データ推論およびツール使用の適応において、データ効率性とサンプルの多様性を向上させる。
- チェーン・オブ・トゥークン推論を、アンモタイズドベイジアン推論に適した潜在変数モデリング問題として定式化する。
提案手法
- GFlowNets(報酬関数に比例する確率でオブジェクトをサンプリングする方策を訓練する多様性志向の強化学習アルゴリズム)を用いて事前学習済みLLMをファインチューニングする。
- 訓練中にシーケンスを評価するため、LLM自身の尤度を報酬関数として使用し、自己教師付き報酬モデリングを可能にする。
- 事前学習済みLLMでGFlowNet方策を初期化し、入力・推論・出力の同時確率に一致する報酬目的関数を用いて継続的に訓練する。
- 特に低データ環境下で探索性と初期方策の質を向上させるために、シード推論のバッファを活用する。
- 訓練の安定化と収束の改善のため、温度スケーリングおよびカリキュラム学習を適用する。
- サンプルの多様性および報酬最大化に最適化されたハイパーパrameterを調整したLoRAを用いて、効率的なファインチューニングを実施する。

実験結果
リサーチクエスチョン
- RQ1GFlowNetファインチューニングによるアンモタイズド推論は、LLMsにおける計算が困難な事後分布からの有効かつ多様なサンプリングを可能にするか?
- RQ2推論タスクにおけるデータ効率性とサンプルの多様性について、GFlowNetファインチューニングは教師ありファインチューニングおよびPPOを上回るか?
- RQ3限定的な監視のもとで、GFlowNetファインチューニングは算数的推論のための有効で正しい推論を効果的に学習できるか?
- RQ4推論例のシードバッファの使用は、低データの少データ推論シナリオにおいて顕著に性能を向上させるか?
- RQ5GFlowNetファインチューニングは、PPOベースの方策学習で一般的なモードコラプスや過剰最適化の問題を軽減できるか?
主な発見
- 50個の推論例をシードとして用いた場合、GFlowNetモデルは分布内整数演算タスクで95.2%のテスト精度を達成し、ゼロショットプロンプティングおよびベースラインファインチューニングを顕著に上回った。
- 50個のシード推論例を用いた場合、GFlowNetモデルは分布外(OOD)の算数問題においても75.4%の精度を達成し、学習分布を超えた強い一般化性能を示した。
- 本手法は、PPOがしばしば繰り返しや無効なシーケンスを生成するのに対し、有効で段階的な推論を正しく評価する推論を生成した。
- より多くのシード推論例を用いることで性能が単調に向上し、0個のシード例では僅か22.6%の精度にとどまり、探索のための初期監視の重要性を示した。
- PPOモデルは高報酬だが無効な推論(例:式の繰り返し)を生成する傾向にあったが、GFlowNetsは正しい、多様な推論チェーンを生成し、モードコラプスが低減していることが示された。
- アブレーションスタディにより、シード推論が性能に不可欠であることが確認された。それらが欠落すると性能が急激に低下し、事前の知識なしでは探索が困難であることが示唆された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。