Skip to main content
QUICK REVIEW

[論文レビュー] On the Dimensionality of Embeddings for Sparse Features and Data

Maxim Naumov|arXiv (Cornell University)|Jan 7, 2019
Advanced Graph Neural Networks参考文献 25被引用数 12
ひとこと要約

この論文は、埋め込み表現が常に次元削減をもたらすという一般的な仮定に挑戦し、次元削減の代わりに情報エントロピーに基づいて埋め込み次元を決定すべきであることを示している。エントロピーに基づく上界と、埋め込み次元の選定に向けた明確なガイドラインを提示しており、スパース特徴量が次元削減の恩恵を受けるとは限らず、最適なサイズは入力データのスパarsityと分布に依存することを示している。

ABSTRACT

In this note we discuss a common misconception, namely that embeddings are always used to reduce the dimensionality of the item space. We show that when we measure dimensionality in terms of information entropy then the embedding of sparse probability distributions, that can be used to represent sparse features or data, may or not reduce the dimensionality of the item space. However, the embeddings do provide a different and often more meaningful representation of the items for a particular task at hand. Also, we give upper bounds and more precise guidelines for choosing the embedding dimension.

研究の動機と目的

  • スパース特徴量の埋め込み表現が inherently 次元削減をもたらすという広く信じられている信念に挑戦すること。
  • エントロピーに基づく情報理論的アプローチを用いて、埋め込み次元を選定する原則的な手法を提供すること。
  • 実世界のモデルにおける埋め込みサイズ選定のための上界と実用的ガイドラインを導出すること。
  • 次元削減が行われない場合でも、埋め込み表現が生のインデックスよりも意味のある表現を提供することを示すこと。

提案手法

  • 情報エントロピーを次元の尺度として用い、スパース特徴ベクトルの情報保持能力を評価する。
  • 組み合わせ的近似を用いて、さまざまなルックアップシグネチャ(例:nサイズのベクトルにk個の非ゼロ要素)のエントロピー式を導出する。
  • 漸近的近似(例:スターリングの公式)を適用し、スパース分布のエントロピーを推定し、上界を導出する。
  • 入力ルックアップのエントロピー(H)と埋め込みの情報容量(d × s、ここでsは要素あたりのビット数)を比較し、必要な埋め込みサイズを特定する。
  • 入力スパarsityを考慮したエントロピーに基づくルーフラインモデルを提案し、与えられた入力スパarsityに対する埋め込み次元の上界を設定する。
  • 表形式の例を用いてモデルを検証し、n(語彙サイズ)、k(非ゼロ要素数)、s(ビット精度)の変動に応じた情報同等性を満たすために必要なdを示している。

実験結果

リサーチクエスチョン

  • RQ1埋め込みはスパース特徴表現の次元を常に削減するのか?
  • RQ2スパース入力ベクトルに含まれる情報を保持するために、最小限必要な埋め込み次元は何か?
  • RQ3実際の応用において、情報エントロピーはどのようにして埋め込みサイズの選定をガイドするか?
  • RQ4スパースネスパターン(k)と語彙サイズ(n)は、必要な埋め込み次元にどの程度の影響を及ぼすか?

主な発見

  • 情報エントロピーで測定した場合、埋め込みが常に次元削減をもたらすわけではない。入力が非常に構造的またはスパースな場合、埋め込み空間の次元が入力のそれより大きくなることもある。
  • 語彙サイズ100万のルックアップでk=100の非ゼロ要素を持つ場合、エントロピーは約1324.1ビットに達し、8ビット精度では少なくとも168次元の埋め込みが必要となる。
  • k=1000でn=1億の場合は、エントロピーが約16,603.3ビットに達し、8ビット精度では少なくとも2076次元の埋め込みが必要となる。
  • k(非ゼロ要素数)の選択がn(語彙サイズ)よりもエントロピーに大きな影響を与えることが、エントロピー対kの対数プロットから明らかになった。
  • 32ビットの埋め込みで要素あたり8ビットの精度の場合、k=1でn=100万の場合はdが1にまで低下するが、k=1000でn=100万の場合はdが1248にまで増加する。
  • ミニバッチ学習はエントロピーや次元の計算に影響しない。各埋め込みルックアップは個別に処理されるためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。