[論文レビュー] Beyond Answers: Transferring Reasoning Capabilities to Smaller LLMs Using Multi-Teacher Knowledge Distillation
TinyLLMは、推論能力を複数の大きな言語モデル(LLM)から、推論誘導型トレーニングを活用してより小さな学生モデルへ伝達するマルチティーチャー知識蒸留フレームワークを提案する。文脈例生成器とティーチャー・フォースティング・チェーン・オブ・トゥーク(Chain-of-Thought)を用いることで、学生モデルは高品質で文脈に根ざした推論過程を学習し、全微調整に比べて最大12.57%の性能向上を達成しながら、教師モデルの1.1%のサイズにとどめる。
Transferring the reasoning capability from stronger large language models (LLMs) to smaller ones has been quite appealing, as smaller LLMs are more flexible to deploy with less expense. Among the existing solutions, knowledge distillation stands out due to its outstanding efficiency and generalization. However, existing methods suffer from several drawbacks, including limited knowledge diversity and the lack of rich contextual information. To solve the problems and facilitate the learning of compact language models, we propose TinyLLM, a new knowledge distillation paradigm to learn a small student LLM from multiple large teacher LLMs. In particular, we encourage the student LLM to not only generate the correct answers but also understand the rationales behind these answers. Given that different LLMs possess diverse reasoning skills, we guide the student model to assimilate knowledge from various teacher LLMs. We further introduce an in-context example generator and a teacher-forcing Chain-of-Thought strategy to ensure that the rationales are accurate and grounded in contextually appropriate scenarios. Extensive experiments on six datasets across two reasoning tasks demonstrate the superiority of our method. Results show that TinyLLM can outperform large teacher LLMs significantly, despite a considerably smaller model size. The source code is available at: https://github.com/YikunHan42/TinyLLM.
研究の動機と目的
- 小規模なLLM向けの単一ティーチャー知識蒸留における知識多様性の不足と文脈的推論の欠如を解消すること。
- 複数の多様なティーチャーLLMから学習することで、コンactな学生モデルの一般化能力と推論能力を向上させること。
- 真値ラベルに依存するのではなく、豊富で文脈に根ざした推論過程を組み込むことで、蒸留品質を向上させること。
- 最小限のパラメータオーバーヘッドで高い性能を維持するスケーラブルで効率的な蒸留パイプラインの開発。
提案手法
- FLAN-T5 や LLaMA 2 などの複数の大きなLLM(例:FLAN-T5とLLaMA 2)を共同ティーチャーとして用い、多様な推論的視点と知識を提供する。
- 文脈例生成器を活用してタスクのデモンストレーションを提供し、ティーチャーが文脈に適した推論過程を生成できるようにする。
- 教師フォースティング・チェーン・オブ・トゥーク戦略を適用することで、教師が生成する推論過程が入力文脈と整合し、正確であることを保証する。
- 回答の正確性と推論の一貫性の両方を最適化するマルチタスクインstructチューニングにより、学生モデルを訓練する。
- 蒸留過程において、異なるティーチャーからの推論の寄与度を調整するためのトレードオフ重み係数(α)を導入する。
- LoRAとフル微調整ベースラインを比較するための軽量なトレーニング設定を用いる。
実験結果
リサーチクエスチョン
- RQ1複数の多様なLLMからの知識蒸留は、単一ティーチャー手法と比較して、小規模な学生モデルにおける推論一般化能力を向上させるか?
- RQ2複数のティーチャーからの推論信号を組み込むことで、真値ラベルに依存する場合と比較して性能が向上するか?
- RQ3文脈例生成器と教師フォースティング・チェーン・オブ・トゥークは、蒸留に適した文脈に根ざした推論過程をどれほど効果的に生成できるか?
- RQ4小規模な学生モデルは、その大きなティーチャー・モデルをどれほど上回る性能を発揮できるか?
- RQ5推論統合のためのトレードオフ重みαのようなハイパーパrameterに、性能はどれほど敏感か?
主な発見
- 780Mパラメータの学生モデルは、7Bの教師モデルの1.1%のサイズしか使用しないにもかかわらず、フル微調整に比べて平均で+12.57%の性能向上を達成した。
- 780Mの学生モデルは、6つのデータセット全体で3B教師モデルに対して+14.56%、7B教師モデルに対して+23.40%の性能向上を達成した。
- 250Mパラメータの学生モデルは、3B教師モデルに対して+0.70%、7B教師モデルに対して+16.82%の性能向上を達成し、それぞれ8.3%および3.6%のパラメータ量にとどまった。
- アブレーションスタディの結果、文脈例や教師の推論を除去すると性能が著しく低下し、これらが中心的な役割を果たしていることが裏付けられた。
- ハイパーパramータ分析の結果、最適なα値はタスクによって異なることが判明した:要約的で共通の常識的推論には高いαが有効であり、複雑な生物医学的質問には低いαで十分であった。
- 本手法は、共通の常識的(OBQA、ARC、PIQA、RiddleSense)および生物医学的(PubMedQA、BioASQ)推論タスクの両方で一貫して性能を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。