Skip to main content
QUICK REVIEW

[論文レビュー] On Controllable Sparse Alternatives to Softmax

Anirban Laha, Saneem Chemmengath|arXiv (Cornell University)|Oct 29, 2018
Domain Adaptation and Few-Shot Learning被引用数 20
ひとこと要約

本稿では、スパース確率マッピング関数を統一的に扱うフレームワークを提案する。これは、ソフトマックス、スパースマックス、およびその他の変種を一般化し、2つの新しい定式化—sparsegen-lin および sparsehourglass—を用いてスパarsityを明示的に制御可能にする。このフレームワークは閉形式解とバックプロパゲーションをサポートし、マルチラベル分類および機械翻訳や要約などのシーケンス・トゥ・シーケンスタスクにおいて、性能の向上を示している。

ABSTRACT

Converting an n-dimensional vector to a probability distribution over n objects is a commonly used component in many machine learning tasks like multiclass classification, multilabel classification, attention mechanisms etc. For this, several probability mapping functions have been proposed and employed in literature such as softmax, sum-normalization, spherical softmax, and sparsemax, but there is very little understanding in terms how they relate with each other. Further, none of the above formulations offer an explicit control over the degree of sparsity. To address this, we develop a unified framework that encompasses all these formulations as special cases. This framework ensures simple closed-form solutions and existence of sub-gradients suitable for learning via backpropagation. Within this framework, we propose two novel sparse formulations, sparsegen-lin and sparsehourglass, that seek to provide a control over the degree of desired sparsity. We further develop novel convex loss functions that help induce the behavior of aforementioned formulations in the multilabel classification setting, showing improved performance. We also demonstrate empirically that the proposed formulations, when used to compute attention weights, achieve better or comparable performance on standard seq2seq tasks like neural machine translation and abstractive summarization.

研究の動機と目的

  • ソフトマックス、スパースマックス、および和正規化などの既存の確率マッピング関数を、1つの理論的枠組みに統合すること。
  • 既存のスパースマッピングにおけるスパarsityの明示的制御の欠如を是正すること。
  • 提案された定式化を用いて、マルチラベル分類に特化した新しい凸損失関数を開発すること。
  • 閉形式解を介して、部分微分可能なサポートを備えたエンド・ツー・エンド学習を可能にすること。
  • 提案手法を、シーケンス・トゥ・シーケンスタスクにおけるアテンション機構で評価すること。

提案手法

  • フレームワークは、ソフトマックス、スパースマックス、および和正規化を特別なケースとして含むパラメータ化された関数族を導入することで、既存のマッピングを一般化する。
  • 提案された sparsegen-lin 定式化は、線形制約を用いてスパarsityを制御し、非ゼロ出力の数を明示的に調整可能にする。
  • sparsehourglass 定式化は、まず有効な成分を特定し、その後に正規化する2段階の最適化プロセスを導入し、柔軟なスパarsity制御を可能にする。
  • 凸最適化を通じて部分微分の存在を保証し、ディープラーニングモデルにおけるバックプロパゲーションを可能にする。
  • マルチラベル分類における望ましいスパarsity行動を誘導するため、新しい凸損失関数を設計する。
  • seq2seqモデルにおける標準的なソフトマックスを、提案されたスパース代替関数に置き換えることで、アテンション機構での手法の評価を行う。

実験結果

リサーチクエスチョン

  • RQ1ソフトマックスやスパースマックスなどの既存のスパース確率マッピングを、1つの理論的枠組みに統合することは可能か?
  • RQ2微分可能性や閉形式解を損なわず、確率マッピング関数におけるスパarsityの明示的制御が可能か?
  • RQ3提案された定式化—sparsegen-lin および sparsehourglass—は、既存の手法と比較してマルチラベル分類でどの程度の性能を示すか?
  • RQ4スパarsity制御は、ニューラル機械翻訳や要約生成などのシーケンス・トゥ・シーケンスモデルにおけるアテンション機構にどのような影響を与えるか?
  • RQ5マルチラベル学習における望ましいスパarsity行動を効果的に誘導できる新しい凸損失関数を設計できるか?

主な発見

  • 提案されたフレームワークは、ソフトマックス、スパースマックス、および和正規化などの既存のマッピングを特別なケースとして一般化し、統一的な視点を提供する。
  • sparsegen-lin および sparsehourglass は、調整可能なパラメータを介してスパarsityの度合いを明示的に制御可能である。
  • これらの定式化は、閉形式解と部分微分をサポートしており、バックプロパゲーションによるエンド・ツー・エンド学習を可能にする。
  • マルチラベル分類において、新規の凸損失関数は、標準的手法と比較して性能が向上する。
  • シーケンス・トゥ・シーケンスタスクにおいて、提案されたスパースアテンション機構は、標準的なソフトマックスと同等またはそれ以上の性能を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。