Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Sampled Softmax with Kernel Based Sampling

Guy Blanc, Steffen Rendle|arXiv (Cornell University)|Dec 2, 2017
Domain Adaptation and Few-Shot Learning被引用数 3
ひとこと要約

本稿では、2次カーネルを用いてソフトマックス分布を効率的に近似するカーネルベースのサンプリングを、適応的サンプリングソフトマックスのために提案する。これは、O(D log n)時間で動作する分割統治アルゴリズムにより、モデル出力に応じて適応することで、均一サンプリングと比較して1〜2桁少ないサンプル数で低バイアスの学習を可能にする。Dはカーネル空間の次元を表す。

ABSTRACT

Softmax is the most commonly used output function for multiclass problems and is widely used in areas such as vision, natural language processing, and recommendation. A softmax model has linear costs in the number of classes which makes it too expensive for many real-world problems. A common approach to speed up training involves sampling only some of the classes at each training step. It is known that this method is biased and that the bias increases the more the sampling distribution deviates from the output distribution. Nevertheless, almost any recent work uses simple sampling distributions that require a large sample size to mitigate the bias. In this work, we propose a new class of kernel based sampling methods and develop an efficient sampling algorithm. Kernel based sampling adapts to the model as it is trained, thus resulting in low bias. Kernel based sampling can be easily applied to many models because it relies only on the model's last hidden layer. We empirically study the trade-off of bias, sampling distribution and sample size and show that kernel based sampling results in low bias with few samples.

研究の動機と目的

  • 非ソフトマックスのサンプリング分布を用いたサンプリングソフトマックスにおける高いバイアスを是正すること、特にクラス数が多い場合に有効であるようにすること。
  • 均一または人気度ベースのサンプリングの非効率性を克服し、バイアスを低減するために大きなサンプルサイズを必要としないようにすること。
  • 学習中にモデル出力、モデル構造、パラメータに応じて適応するサンプリング手法を開発すること。
  • カーネル法と対数時間アルゴリズムを活用することで、大規模な多クラス問題における効率的なサンプリングを実現すること。
  • カーネルベースのサンプリングが、標準的手法と比較してはるかに少ないサンプル数で、完全なソフトマックスの性能に達することを実証すること。

提案手法

  • モデルの最終隠れ層出力に依存するカーネルベースのサンプリング分布を提案し、例、モデル、パラメータに依存するサンプリングを可能にする。
  • 2次カーネルを用いて指数関数的ソフトマックス関数を近似し、カーネル空間における正規化定数の計算を効率的に行う。
  • Dがカーネル空間の次元、nがクラス数であるとき、O(D log n)時間で実行される分割統治型サンプリングアルゴリズムを設計する。
  • カーネルベースのサンプリングは訓練時のみに適用し、損失計算には完全な指数関数的ソフトマックスを維持することで、モデルの品質を保つ。
  • 任意の最終層が隠れ表現とクラス埋め込みの内積であるモデルに一般化可能であることを保証する。
  • カーネルの性質を活用して、訓練ステップ中に完全なソフトマックス計算を必要とせずに高速なサンプリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1カーネルベースのサンプリングは、均一サンプリングや人気度ベースのサンプリングと比較して、サンプリングソフトマックスの学習におけるバイアスを低減できるか?
  • RQ2カーネルベースのサンプリングは、収束の質と速度の観点で、均一サンプリングと比較してどの程度のサンプル効率を示すか?
  • RQ3n ≫ 10^4クラスの大規模な多クラス問題において、カーネルベースのサンプリングは効率的に計算可能か?
  • RQ4モデル出力に基づく適応的サンプリングは、非適応的サンプリングと比較して、収束速度の向上や一般化性能の向上をもたらすか?
  • RQ5計算効率を維持しつつ、カーネルベースのサンプリングは完全なソフトマックス分布をどの程度正確に近似できるか?

主な発見

  • 特に2次カーネルを用いたカーネルベースのサンプリングは、均一サンプリングと比較してバイアスを顕著に低減し、1〜2桁少ないサンプル数で完全なソフトマックスの性能に達する。
  • 提案された分割統治型サンプリングアルゴリズムはO(D log n)時間で実行され、クラス数が非常に多い場合でもスケーラブルである。
  • モデル出力に応じて適応するサンプリング分布(たとえばカーネルに基づくもの)は、均一やグローバル人気度のような静的分布と比較して、サンプル効率が著しく向上する。
  • 最小限のサンプリング(例:m ≈ 10–50)ですでに完全なソフトマックスと同等の収束品質を達成するが、均一サンプリングでは同程度の性能に到達するにははるかに大きなmが必要となる。
  • バイアスが十分に低減された段階では、サンプルサイズをさらに増やしても収束速度の向上が得られなくなるため、mが大きい場合に限界効果が現れる。
  • カーネルはサンプリングにのみ使用し、損失計算には完全なソフトマックスを用いることで、モデルの高精度を維持しつつ、高品質な出力を保証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。