[論文レビュー] RAIN: Your Language Models Can Align Themselves without Finetuning
RAIN は、自己評価と巻き戻し可能な生成プロセスを用いて、微調整や外部データを一切用いずに、固定された大規模言語モデルが人間の好みに自己整合性を持たせる、新しい推論専用の手法である。LLaMA 30B に対して、HH データセットで 97% の無害性を達成し、同時に役立たず性を維持するとともに、TruthfulQA で真実性が 5% 向上した。
Large language models (LLMs) often demonstrate inconsistencies with human preferences. Previous research typically gathered human preference data and then aligned the pre-trained models using reinforcement learning or instruction tuning, a.k.a. the finetuning step. In contrast, aligning frozen LLMs without requiring alignment data is more appealing. This work explores the potential of the latter setting. We discover that by integrating self-evaluation and rewind mechanisms, unaligned LLMs can directly produce responses consistent with human preferences via self-boosting. We introduce a novel inference method, Rewindable Auto-regressive INference (RAIN), that allows pre-trained LLMs to evaluate their own generation and use the evaluation results to guide rewind and generation for AI safety. Notably, RAIN operates without the need of extra data for model alignment and abstains from any training, gradient computation, or parameter updates. Experimental results evaluated by GPT-4 and humans demonstrate the effectiveness of RAIN: on the HH dataset, RAIN improves the harmlessness rate of LLaMA 30B from 82% of vanilla inference to 97%, while maintaining the helpfulness rate. On the TruthfulQA dataset, RAIN improves the truthfulness of the already-well-aligned LLaMA-2-chat 13B model by 5%.
研究の動機と目的
- 微調整、データ収集、パラメータ更新なしに、大規模言語モデルが人間の好みに一致するようにすること。
- 強化学習による人間の好みの適合(RLHF)や DPO などの従来の適合手法が、教師あり微調整や報酬モデルに依存するための非効率さと高コストを解消すること。
- 固定された LLM が推論時にのみ内部メカニズムを用いて自己適合を達成できるかどうかを検証すること。
- モデル重みを変更せずに安全性和と真実性を向上させる、即挿し可能な推論手法を開発すること。
- 自己評価と制御された生成の巻き戻しは、ランダムサンプリングや単純な拒否サンプリングを上回ることを示すこと。
提案手法
- RAIN は、自己評価に基づいて前向き生成と後退的巻き戻しを交互に繰り返す、巻き戻し可能な自己回帰的推論メカニズムを導入する。
- 各生成ステップの後、モデルは内部的推論を用いて自身の出力の質を評価する自己評価ステージを組み込む。
- 自己評価の結果に基づき、モデルは以前のトークン状態に巻き戻され、ヒューリスティックな属性更新に従ってより有望な経路から再生成される。
- 探索プロセスは、モデル自身の評価を用いて、より安全で、より役立たずで、より真実性の高い出力を指向する。ランダムサンプリングを避ける。
- このアプローチは推論時のみに作用し、勾配計算、パラメータ更新、外部報酬モデルへの依存なしに動作する。
- モデル重みを変更せずに、人間の認知的行動(振り返り、評価、修正)を模倣する。
実験結果
リサーチクエスチョン
- RQ1微調整や外部の適合データなしに、固定された大規模言語モデルが人間の好みに自己適合できるか?
- RQ2推論時に自己評価が、巻き戻し可能な生成プロセスを制御することで、安全性と役立たず性を向上させられるか?
- RQ3サンプル効率とパフォーマンスの観点から、RAIN は単純な拒否サンプリング(繰り返しサンプリングと選別)と比べてどの程度優れているか?
- RQ4自己評価の正確性が、誤りの可能性があるにもかかわらず、適合の結果にどの程度貢献できるか?
- RQ5RAIN は、再トレーニングなしに、LLaMA-2 70B などの well-aligned モデルの安全性と真実性を向上させられるか?
主な発見
- HH データセットにおいて、RAIN は LLaMA 30B の無害性を、通常の推論(vanilla)の 82% から GPT-4 評価で 97% まで向上させたが、役立たず性は維持された。
- 人的評価により、RAIN の有効性が確認され、無害性は 96.6%(通常の推論は 89.5%)を記録した。
- TruthfulQA において、RAIN は well-aligned モデルの LLaMA-2-chat 13B の真実性を、モデル更新なしで 5% 向上させた。
- 有害性検出における自己評価の正確性は、モデルごとに 52% から 98% の範囲にあり、ランダム確率(50%)を著しく上回っており、効果的な誘導が可能である。
- 500 回の繰り返しサンプリングに比べ、RAIN は LLaMA 30B でわずか 4.36 倍の時間オーバーヘッドで著しく優れたパフォーマンスを達成し、サンプル効率の優位性を示した。
- RAIN の時間オーバーヘッドは許容範囲であり、モデルサイズが大きくなると減少し、LLaMA-2 70B では 3.78 倍にとどまり、スケーラビリティが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。