[論文レビュー] R-Tuning: Instructing Large Language Models to Say `I Don't Know'
本稿では、パラメトリックな知識とインstructチューニングデータの間の知識ギャップを特定することで、大規模言語モデルが答えられない質問に対して拒否できるようにする、R-Tuningと呼ばれる新しいインstructチューニング手法を提案する。訓練データを確実な部分($D_1$)と不確実な部分($D_0$)に分割し、不確実な例に「私は知りません」といった表現を付加することで、R-Tuningは拒否の正確性と一般化性能を著しく向上させ、ドメイン内およびドメイン外の両設定において標準的なインストラクションチューニングを上回る。
Large language models (LLMs) have revolutionized numerous domains with their impressive performance but still face their challenges. A predominant issue is the propensity for these models to generate non-existent facts, a concern termed hallucination. Our research is motivated by the observation that previous instruction tuning methods force the model to complete a sentence no matter whether the model knows the knowledge or not. When the question is out of the parametric knowledge, it will try to make up something and fail to indicate when it lacks knowledge. In this paper, we present a new approach called Refusal-Aware Instruction Tuning (R-Tuning). This approach is formalized by first identifying the disparity in knowledge encompassed by pre-trained parameters compared to that of instruction tuning data. Then, we construct the refusal-aware data based on the knowledge intersection, to tune LLMs to refrain from responding to questions beyond its parametric knowledge. Experimental results demonstrate R-Tuning effectively improves a model's ability to answer known questions and refrain from answering unknown questions. Furthermore, when tested on out-of-domain datasets, the refusal ability was found to be a meta-skill that could be generalized to other tasks. Further analysis surprisingly finds that learning the uncertainty results in better calibration and an improved ability to estimate the uncertainty than uncertainty-based testing. Our code is available at https://github.com/shizhediao/R-Tuning.
研究の動機と目的
- 未知の質問に直面した際の大規模言語モデルによる事実の虚構(ホールーシュネーション)を是正すること。
- 事前学習中に学習されたパラメトリックな知識(パラメトリック知識)とインストラクションチューニングデータとの間の知識ギャップを特定すること。
- モデルが知識が不足していると認識し、それに応じて答えを拒否できるように訓練すること。
- 未知の質問に対して回答を控えることでモデルの信頼性を向上させ、ホールーシュネーションを低減すること。
- 複数のタスクにわたるマルチタスク学習を通じて、拒否能力がメタスキルとして一般化可能かどうかを調査すること。
提案手法
- インストラクションチューニングデータ上のモデル予測と正解ラベルを比較することで知識ギャップを測定し、例を確実($D_1$)または不確実($D_0$)に分類する。
- 不確実なセット $D_0$ のラベルに不確実性表現(例:「私は知りません」)を付加することで、拒否に対応した訓練データを構築する。
- $D_1$ には標準的な回答、$D_0$ には拒否に対応した応答を含む統合データセット上でLLMをファインチューニングする。
- データ分割および分析の段階で、予測分布のエントロピーを不確実性の代理指標として用いる。
- 複数のデータセットにわたるマルチタスク学習を適用し、拒否のメタスキルを抽象化・一般化する。
- ドメイン内およびドメイン外のベンチマークで、APスコア、精度、再現率を用いて性能を評価する。
実験結果
リサーチクエスチョン
- RQ1インストラクションチューニングを変更することで、モデルに未知の質問に対して拒否する能力を教えることは可能か?
- RQ2パラメトリック知識とインストラクションデータの間の知識ギャップを特定することで、拒否能力が向上するか?
- RQ3拒否能力は、メタスキルとしてマルチタスク学習によってドメイン外タスクに一般化可能か?
- RQ4訓練段階で不確実性を学習することは、推論時に不確実性フィルタリングを適用するのと比較して、より良い性能をもたらすか?
- RQ5R-Tuningは、標準的なインストラクションチューニングと比較して、精度、再現率、およびホローシュネーション低減の観点で優れているか?
主な発見
- R-Tuningは、未知の質問に対する拒否能力を著しく向上させ、OpenLLaMA-3BではParaRelベンチマークでAPスコアが最大0.426向上した。
- MMLUベンチマークでは、LLaMA-13Bの不確実な質問に対する拒否精度が0.457に達し、複雑な推論タスクでも優れた性能を示した。
- 本手法はドメイン外データセットに対しても良好に一般化され、拒否能力がマルチタスク学習によって学習可能なメタスキルであることを示した。
- 訓練段階で不確実性を学習することは、推論時に不確実性フィルタリングを適用するのと比較して、より良い不確実性推定と応答品質をもたらした。
- 訓練データにおける予測分布のエントロピーは不確実性と相関しており、データ分割アプローチの妥当性を裏付けた。
- R-Tuningは、標準的なインストラクションチューニングと比較して、精度と再現率のトレードオフをより良く制御し、既知の質問に対する精度を損なわず、ホローシュネーションを低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。