[論文レビュー] Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models
本稿は、数学的推論における言語モデルの計算最適化推論を調査し、探索と pruning をバランスさせるノード品質に基づく報酬を用いる新しい木探索アルゴリズム REBASE を提案する。REBASE を用いることで、FLOPs を削減しながら精度を向上させることができ、特に計算リソースが制限された環境下で、Llemma-7B などの小規模モデルが Llemma-34B などの大規模モデルと同等の性能を達成できる。
While the scaling laws of large language models (LLMs) training have been extensively studied, optimal inference configurations of LLMs remain underexplored. We study inference scaling laws (aka test-time scaling laws) and compute-optimal inference, focusing on the trade-offs between model sizes and generating additional tokens with different inference strategies. As a first step towards understanding and designing compute-optimal inference methods, we studied cost-performance trade-offs for inference strategies such as greedy search, majority voting, best-of-$n$, weighted voting, and two different tree search algorithms, using different model sizes and compute budgets. Our findings suggest that scaling inference compute with inference strategies can be more computationally efficient than scaling model parameters. Additionally, smaller models combined with advanced inference algorithms offer Pareto-optimal trade-offs in cost and performance. For example, the Llemma-7B model, when paired with our novel tree search algorithm, consistently outperforms the Llemma-34B model across all tested inference strategies on the MATH benchmark. We hope these insights contribute to a deeper understanding of inference scaling laws (test-time scaling laws) for LLMs.
研究の動機と目的
- 推論時の計算予算が異なるモデルサイズに与える影響を理解すること。
- LLM を用いた問題解決において、推論計算量(FLOPs)と精度の最適なトレードオフを特定すること。
- 固定された計算予算下で、グリーディ検索、マジョリティ投票、ベストオブN、加重投票、および木探索の変種といったさまざまな推論戦略の効率を評価・比較すること。
- 性能を向上させつつ計算コストを最小限に抑える新しい木探索アルゴリズム REBASE を設計・検証すること。
- 小規模モデルに洗練された推論戦略を適用することで、計算制約下で大規模モデルを上回る性能を達成できるかを示すこと。
提案手法
- 数学的推論ベンチマーク(GSM8K および MATH500)上で、グリーディ検索、マジョリティ投票、ベストオブN、加重投票、および木探索の変種といった複数の推論戦略を実験的に評価する。
- トークン生成回数を制御することで推論計算量を調整し、報酬モデルを用いて候補解のスコア付けと順位付けを行う。
- ノード品質に基づく報酬を用いることで、探索と pruning をバランスさせる新しい木探索アルゴリズム REBASE を提案する。
- REBASE を加重投票と統合することで、不完全または低品質な候補に依存するのを軽減し、解の品質を向上させる。
- 精度と FLOPs の両面で性能を測定し、モデルサイズおよび推論戦略ごとのパレート最適なトレードオフを確立する。
- 標準的なサンプリングベースの手法および MCTS と比較して、REBASE の飽和点と計算効率を評価する。

実験結果
リサーチクエスチョン
- RQ1数学的推論タスクにおいて、異なる計算予算下で最適なモデルサイズはどのように変化するか?
- RQ2グリーディ検索、マジョリティ投票、ベストオブN、加重投票、または木探索のうち、どの推論戦略が最も高い精度/FLOPs比を達成するか?
- RQ3高度なデコード戦略(例:REBASE)を用いた小規模言語モデルが、同じ計算予算下で大規模モデルを上回ることができるか?
- RQ4REBASE は、標準的なサンプリング手法および MCTS と比較して、精度と計算効率の面でどのように異なるか?
- RQ5洗練された推論戦略による性能向上は、モデルサイズに応じて異なるスケーリングを示すか。特に、弱いモデル(グリーディ精度が低いモデル)においては?
主な発見
- Llemma-7B などの小規模モデルは、同じ推論戦略下で、Llemma-34B などの大規模モデルと同等の精度を達成するが、FLOPs は約半分で済む。
- MATH500 ベンチマークでは、Llemma-7B に REBASE を適用した場合、148.0 × 10^{12} FLOPs を使用して 46.8% の精度を達成し、Llemma-34B が 176.8 × 10^{12} FLOPs を使用して達成した 43.6% の精度と同等の性能を示した。
- REBASE は、サンプリングベースの手法および MCTS よりも高い精度を達成し、Mistral-7B では MATH タスクで 5.3% の性能向上、Llemma-34B では 2.6% の向上を示した。
- REBASE は、サンプリング手法よりも遅く飽和するため、計算量が増加する中でも持続的な性能向上が見られ、特に MATH のような難易度の高いタスクで顕著であった。
- 弱いモデル(グリーディ精度が低いモデル)は木探索による恩恵をより大きく受ける。REBASE による性能向上は、そのベースラインのグリーディ精度に反比例する。
- 推論に最適なモデルサイズは計算予算に依存する。低~中程度の FLOP 水平では、小規模モデルが大規模モデルを上回る性能を示す。これは、計算最適な設定の重要性を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。