Skip to main content
QUICK REVIEW

[論文レビュー] Self-Knowledge Distillation in Natural Language Processing

Sangchul Hahn, Heeyoul Choi|arXiv (Cornell University)|Aug 2, 2019
Topic Modeling参考文献 20被引用数 20
ひとこと要約

本稿では、自然言語処理における自己知識蒸留(SKD)と呼ばれる、新しい知識蒸留手法を提案する。この手法は、学習中のモデル自身の単語埋め込み空間(特にソフトマックスの直前)からのソフトターゲット確率を活用し、性能を向上させる。これらのソフトターゲットを埋め込み空間内のベクトル類似度によって近似することで、一般化性能が向上し、過学習が軽減され、言語モデル作成およびニューラル機械翻訳のタスクにおいて一貫した性能向上が達成される。

ABSTRACT

Since deep learning became a key player in natural language processing (NLP), many deep learning models have been showing remarkable performances in a variety of NLP tasks, and in some cases, they are even outperforming humans. Such high performance can be explained by efficient knowledge representation of deep learning models. While many methods have been proposed to learn more efficient representation, knowledge distillation from pretrained deep networks suggest that we can use more information from the soft target probability to train other neural networks. In this paper, we propose a new knowledge distillation method self-knowledge distillation, based on the soft target probabilities of the training model itself, where multimode information is distilled from the word embedding space right below the softmax layer. Due to the time complexity, our method approximates the soft target probabilities. In experiments, we applied the proposed method to two different and fundamental NLP tasks: language model and neural machine translation. The experiment results show that our proposed method improves performance on the tasks.

研究の動機と目的

  • 学習中のモデル自身の内部知識を活用することで、自然言語処理モデルにおける過学習の緩和と一般化性能の向上を図ること。
  • モデル自身の単語埋め込み空間から導出されるソフトターゲット確率が、有効な知識蒸留信号として機能するかを検証すること。
  • 外部の教師モデルを必要としない、軽量で自己教師型の蒸留メカニズムの開発。
  • SKDの有効性を、言語モデル作成やニューラル機械翻訳など多様な自然言語処理タスクにおいて評価すること。
  • ノイズ注入などのデータ拡張技術と組み合わせた場合のSKDの相乗効果を調査すること。

提案手法

  • SKDは、ソフトマックスの直前の単語埋め込み層を、ソフトターゲット確率の出力源として用いる。これらの確率は、予測された単語埋め込みとターゲット単語埋め込みの間のベクトル類似度によって近似される。
  • 予測単語ベクトル $ w_n $ とターゲット単語ベクトル $ w_t $ 間のコサイン類似度 $ \text{sim}(w_n, w_t) $ を用いて、近接性に基づくソフトターゲット確率 $ q_n $ を定義する。ここで $ q_n = \text{sim}(w_n, w_t) $ である。
  • 温度スケーリングを施した交差エントロピー損失が適用され、標準的な交差エントロピー損失に加えて、予測が内部ソフトターゲットと一致するようモデルを促す蒸留損失が組み込まれる。
  • 蒸留損失はハイパーパrameter $ \alpha $ によって重み付けされ、訓練中に 0 から 1 へ段階的に増加するようにスケジューリングされる。これにより、自己蒸留信号が徐々に組み込まれる。
  • 埋め込み空間の幾何的構造に依存することで、ソフトラベルの明示的計算を回避し、計算コストを低減する。
  • 言語モデル作成およびニューラル機械翻訳の標準的な訓練パイプラインにSKDを統合するが、アーキテクチャの変更は行わない。

実験結果

リサーチクエスチョン

  • RQ1モデル自身の単語埋め込み空間から導出されるソフトターゲット確率は、自然言語処理モデルの一般化性能を向上させることができるか?
  • RQ2標準的な交差エントロピー訓練と比較して、自己知識蒸留は過学習を軽減するか?
  • RQ3ノイズ注入などのデータ拡張技術と組み合わせた場合、SKDの性能はどのように変化するか?
  • RQ4言語モデル作成やニューラル機械翻訳などの異なる自然言語処理タスクにおいて、SKDの性能向上は一貫しているか?
  • RQ5訓練中に $ \alpha $ をスケジューリングすることで、最適な性能を得られるか、最適化の不安定化を避けることができるか?

主な発見

  • SKDは、評価されたすべての自然言語処理タスク(En-Fi、Fi-En、En-De翻訳タスク)でBLEUスコアを一貫して向上させた。
  • ビーム幅1のEn-Fi翻訳タスクでは、SKDがBLEUスコア8.36を達成(ベースライン7.29)、ビーム幅12では9.87(ベースライン9.01)を記録した。
  • ノイズ注入とSKDの組み合わせが最も高い性能を示し、ビーム幅12のEn-Fiタスクで10.13のBLEUスコアを達成し、ベースラインより0.92ポイント高い性能を発揮した。
  • 予測された単語ベクトルとターゲット単語ベクトルの間の類似度を表す $ q_n $ 値が時間経過とともに上昇した。これは、モデルがより正確で意味的に近い予測を学習したことを示している。
  • SKDモデルは、ベースラインやノイズのみのモデルと比較して、過学習が遅く発生した。これは、内部蒸留信号が一般化性能を向上させていることを示唆している。
  • 訓練中に $ \alpha $ を0から1へ段階的に増加させることで、モデルが十分な初期知識を獲得した後にのみ自己蒸留信号が導入されるようになり、最適化の不安定化を防ぐ効果があった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。