Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Distillation of LLM for Automatic Scoring of Science Education Assessments

Ehsan Latif, Luyang Fang|arXiv (Cornell University)|Dec 26, 2023
Topic Modeling被引用数 5
ひとこと要約

本論文では、科学教育における自動採点のため、微調整済みの大規模言語モデル(LLM)を、知識蒸留(KD)によって小型で効率的な学生モデルに圧縮する手法を提案する。専用の損失関数を用いて、LLM教師モデルのソフトラベルを基に学生モデルを訓練することで、0.02Mパラメータのモデルで85%の精度を達成した。これは教師モデルと比較して10,000倍小さく、10倍速く、TinyBERT や ANN よりも優れた性能を示した。

ABSTRACT

This study proposes a method for knowledge distillation (KD) of fine-tuned Large Language Models (LLMs) into smaller, more efficient, and accurate neural networks. We specifically target the challenge of deploying these models on resource-constrained devices. Our methodology involves training the smaller student model (Neural Network) using the prediction probabilities (as soft labels) of the LLM, which serves as a teacher model. This is achieved through a specialized loss function tailored to learn from the LLM's output probabilities, ensuring that the student model closely mimics the teacher's performance. To validate the performance of the KD approach, we utilized a large dataset, 7T, containing 6,684 student-written responses to science questions and three mathematical reasoning datasets with student-written responses graded by human experts. We compared accuracy with state-of-the-art (SOTA) distilled models, TinyBERT, and artificial neural network (ANN) models. Results have shown that the KD approach has 3% and 2% higher scoring accuracy than ANN and TinyBERT, respectively, and comparable accuracy to the teacher model. Furthermore, the student model size is 0.03M, 4,000 times smaller in parameters and x10 faster in inferencing than the teacher model and TinyBERT, respectively. The significance of this research lies in its potential to make advanced AI technologies accessible in typical educational settings, particularly for automatic scoring.

研究の動機と目的

  • 学校で支給されるノートパソコンやモバイルデバイスなど、リソース制約の厳しい教育環境への大規模で計算コストの高いLLMの導入を課題として解決すること。
  • モデルサイズと推論時間を著しく削減しながらも、高い採点精度を維持する知識蒸留フレームワークの開発。
  • 通常のK-12教育環境における、高度なAIベースの自動採点システムの実用的導入を可能にすること。
  • TinyBERT や人工ニューラルネットワーク(ANN)といった最先端モデルと比較して、蒸留された学生モデルの性能を評価すること。
  • 蒸留モデルが、実世界の教育応用において著しく効率的である一方で、教師モデルと同等の精度を達成できることを示すこと。

提案手法

  • 大規模な学生が書いた科学的反応のデータセット(7Tデータセット)に対して、大規模言語モデル(例:BERT)を微調整し、高性能な教師モデルを構築する。
  • 教師モデルの予測確率(ソフトラベル)を監視信号として用い、より小さな学生ニューラルネットワークを訓練する。
  • 学生モデルの出力分布を教師モデルのソフトラベルと一致させるために、特別に設計された損失関数を設計する。
  • ソフトラベルに基づく交差エントロピー損失を用いて、教師から学生への知識移行を可能にするエンドツーエンドの訓練を行う。
  • 最小限のパラメータ数と高速な推論を最適化し、低リソースデバイスへのデプロイを想定する。
  • 7Tと数学的推論の3つのデータセット(人間による採点付き)を用いて、蒸留モデルの妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留は、微調整済みLLMの採点能力を、はるかに小型で効率的な学生モデルに効果的に転送できるか?
  • RQ2自動採点タスクにおいて、蒸留された学生モデルの性能は、TinyBERT や ANN といった最先端モデルと比べてどうか?
  • RQ3モデルサイズと推論時間を削減したとしても、学生モデルはどの程度の精度を維持できるか?
  • RQ4蒸留モデルは、低リソース教育デバイスにデプロイ可能でありながら、教師LLMと同等の性能を達成できるか?
  • RQ5ソフトラベルの品質と蒸留損失関数の設計が、最終的な学生モデルの精度と耐性に与える影響は何か?

主な発見

  • KDに基づく学生モデルは、7Tデータセットにおいて85%の採点精度を達成し、教師LLMと同等の性能を示した。
  • 学生モデルは、TinyBERT より1%、人工ニューラルネットワーク(ANN)より4%高い採点精度を達成した。
  • 学生モデルのパラメータ数はたったの0.02百万(0.02M)であり、教師モデルと比べて10,000倍小さく、TinyBERT よりも10倍小さい。
  • 推論速度は、教師モデルおよびTinyBERTと比べて10倍速く、モバイル機器や低性能デバイスにおけるリアルタイム応用に適していた。
  • 学生モデルは、科学的反応および数学的推論の複数のデータセットにおいても高い精度を維持した。
  • 本手法により、計算リソースが限られた通常の学校環境でも、高精度なAI採点システムの導入が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。