Skip to main content
QUICK REVIEW

[論文レビュー] Making Large Language Models Better Reasoners with Alignment

Peiyi Wang, Lei Li|arXiv (Cornell University)|Sep 5, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、アセスメントミスアライメント問題(高品質なChain-of-Thought(COT)応答が低品質な応答よりも高いスコアを獲得しない問題)に対処することで、大規模言語モデルの推論性能を向上させる三段階のパラダイムであるアライメントファインチューニング(AFT)を提案する。AFTは、高品質なCOTに高いスコアが与えられるように保証するとともに、スコアの下限を制限する新しい制約アライメント損失を用いる。これにより、複数の推論ベンチマーク、特にマルチタスクおよびオフ分布設定においても顕著な性能向上が達成される。

ABSTRACT

Reasoning is a cognitive process of using evidence to reach a sound conclusion. The reasoning capability is essential for large language models (LLMs) to serve as the brain of the artificial general intelligence agent. Recent studies reveal that fine-tuning LLMs on data with the chain of thought (COT) reasoning process can significantly enhance their reasoning capabilities. However, we find that the fine-tuned LLMs suffer from an extit{Assessment Misalignment} problem, i.e., they frequently assign higher scores to subpar COTs, leading to potential limitations in their reasoning abilities. To address this problem, we introduce an extit{Alignment Fine-Tuning (AFT)} paradigm, which involves three steps: 1) fine-tuning LLMs with COT training data; 2) generating multiple COT responses for each question, and categorizing them into positive and negative ones based on whether they achieve the correct answer; 3) calibrating the scores of positive and negative responses given by LLMs with a novel constraint alignment loss. Specifically, the constraint alignment loss has two objectives: a) Alignment, which guarantees that positive scores surpass negative scores to encourage answers with high-quality COTs; b) Constraint, which keeps the negative scores confined to a reasonable range to prevent the model degradation. Beyond just the binary positive and negative feedback, the constraint alignment loss can be seamlessly adapted to the ranking situations when ranking feedback is accessible. Furthermore, we also delve deeply into recent ranking-based alignment methods, such as DPO, RRHF, and PRO, and discover that the constraint, which has been overlooked by these approaches, is also crucial for their performance. Extensive experiments on four reasoning benchmarks with both binary and ranking feedback demonstrate the effectiveness of AFT.

研究の動機と目的

  • ベーシックにファインチューニングされたLLMにおけるアセスメントミスアライメント問題を特定・解消すること。ここでの問題とは、モデルが高品質なCOTと低品質なCOTを区別できないことである。
  • モデルのCOT品質に対する自信を再キャリブレーションすることで、推論性能を向上させる三段階のアライメントファインチューニング(AFT)パラダイムを提案すること。
  • アライメント損失に制約項を組み込むことで、モデルの劣化を防ぎ、性能を向上させることの重要性を示すこと。
  • バウンデッドスコア制約を組み込むことで、バイナリフィードバックおよびランクフィードバックベースのアライメント手法の両方をAFTが向上させること。
  • AFTの有効性をドメイン内、マルチタスク、およびオフ分布の推論シナリオのすべてにおいて検証すること。

提案手法

  • 標準的な最大尤度推定を用いて、COTトレーニングデータ上でLLMをファインチューニングする。
  • 1つの質問に対して複数のCOT応答を生成し、正解の応答をポジティブ(正解)とし、不正解の応答をネガティブ(不正解)と分類する。
  • ポジティブスコアがネガティブスコアを上回ること(アライメント)を強制するとともに、ネガティブスコアの下限を合理的な値に制限する(制約)新しい制約アライメント(CA)損失を適用する。
  • CA損失は、バイナリフィードバックおよびランクフィードバックの両設定に適応可能であり、より広範な応用が可能である。
  • 境界制約は、ネガティブスコアの下限を調整するハイパーパrameter β を用い、スコアの識別力と生成能力のバランスを取る。
  • 本手法は、高品質なCOTがより高いスコアを得るため、高品質なCOTが選択されやすくなる自己一貫性推論と併用可能である。

実験結果

リサーチクエスチョン

  • RQ1ベーシックファインチューニング(VFT)では、低品質なCOTに高いスコアが割り当てられるというアセスメントミスアライメントが生じるか?
  • RQ2制約に配慮したアライメント損失は、高品質と低品質なCOTをよりよく区別できるようになり、LLMの推論性能を向上させられるか?
  • RQ3AFTは、標準的なVFTおよびDPO、RRHF、PROなどの他のアライメント手法と比較して、推論ベンチマークでどのように性能を発揮するか?
  • RQ4AFTは、高品質なCOTのサンプリング確率を高めることで、自己一貫性を向上させられるか?
  • RQ5AFTはマルチタスクおよびオフ分布の推論シナリオでも性能向上をもたらすか?

主な発見

  • AFTは4つの推論ベンチマークで顕著な性能向上を達成し、GSM8KではVFT比で最大2.29%、ECQAでは2.10%の向上を示した。
  • MMLUベンチマーク(ゼロショット、オフ分布)では、AFTがVFTを上回り、一般化性能およびトランスファービリティの向上を示した。
  • AFTは自己一貫性を向上させる:サンプリングされるCOTパスの数が増えるにつれて、AFTはVFTよりも顕著な性能向上を示し、高品質な推論パスの選択がより適切に行われていることを示している。
  • アブレーションスタディにより、境界制約項(β)が極めて重要であることが確認された。性能はβ ≈ 0.3でピークに達し、過大または過小な値では劣化するため、ハイパーパrameterの慎重なチューニングが不可欠であることが示された。
  • DPO、RRHF、PROなどのランクベースのアライメント手法に対しても、制約項は重要である。この制約が欠落すると、これらの手法は性能を発揮できない。
  • AFTはマルチタスク学習においても強力な性能を維持し、複数のデータセットを統合して学習することで、全評価テストセットの性能が同時に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。