Skip to main content
QUICK REVIEW

[論文レビュー] Sketching and Neural Networks

Amit Daniely, Nevena Lazic|arXiv (Cornell University)|Apr 19, 2016
Machine Learning and Algorithms参考文献 24被引用数 3
ひとこと要約

本稿では、高次元のバイナリデータ上のスパース多項式関数を効率的に学習するため、コンパクトな線形スケッチ手法とシングルレイヤーニューラルネットワークを組み合わせた手法を提案する。スケッチサイズが $O(k\log(d/\delta))$ の小さな不適切な学習を用いることで、$k$-スパース入力の $1-\delta$ 分数に対して、妥当に正確な分類を達成し、多項式次数に応じて指数関数的にスケッチサイズが増大する従来手法を上回る。

ABSTRACT

High-dimensional sparse data present computational and statistical challenges for supervised learning. We propose compact linear sketches for reducing the dimensionality of the input, followed by a single layer neural network. We show that any sparse polynomial function can be computed, on nearly all sparse binary vectors, by a single layer neural network that takes a compact sketch of the vector as input. Consequently, when a set of sparse binary vectors is approximately separable using a sparse polynomial, there exists a single-layer neural network that takes a short sketch as input and correctly classifies nearly all the points. Previous work has proposed using sketches to reduce dimensionality while preserving the hypothesis class. However, the sketch size has an exponential dependence on the degree in the case of polynomial classifiers. In stark contrast, our approach of using improper learning, using a larger hypothesis class allows the sketch size to have a logarithmic dependence on the degree. Even in the linear case, our approach allows us to improve on the pesky $O({1}/{γ^2})$ dependence of random projections, on the margin $γ$. We empirically show that our approach leads to more compact neural networks than related methods such as feature hashing at equal or better performance.

研究の動機と目的

  • 教師あり学習における高次元スパースデータの計算的・統計的課題に対処すること。
  • スパース多項式関数の分類精度を維持しつつ、モデルサイズと学習コストを削減すること。
  • 不適切な学習とニューラルネットワークを用いることで、従来手法が多項式次数に指数関数的に依存するスケッチサイズを克服すること。
  • スパーシティを保つスケッチ方式を設計し、スパース入力の効率的かつ低次元の表現を可能にすること。
  • 特徴ハッシュやランダムプロジェクションと比較して、スケッチとニューラルネットワークを組み合わせた手法が、より小型で高速かつ高精度なモデルを実現することを実験的に検証すること。

提案手法

  • スパースなバイナリ入力の次元を削減するため、サイズ $O(k\\log(d/\delta))$ のコンパクトな線形スケッチを用いる。
  • ReLU活性化関数を備えたシングルレイヤーニューラルネットワークを用いてスケッチを復号し、任意の $s$-スパース線形または多項式関数を計算する。
  • スパーシティを保持し、計算を効率化するため、スパーススケッチ行列を適用する。
  • より大きな仮説クラスを許容する不適切な学習を用いることで、多項式次数にたいして対数的依存性を実現し、指数的依存性を回避する。
  • ジョンソン=リンデンストラウスの補題およびスケッチ理論(例:Count-Min、Count-Sketch)を用い、内積の保存を保証する。
  • パラメータのスパーシティと高速な学習を実現するため、$\ell_1$-ノルム正則化とプロキシマル確率的勾配を用いる。

実験結果

リサーチクエスチョン

  • RQ1高次元スパースバイナリデータのコンパクトなスケッチは、任意のスパース多項式関数の計算能力を保持できるか?
  • RQ2スケッチをニューラルネットワークで復号することで、従来のスケッチやハッシュ手法と比較して顕著に小型なモデルサイズが達成できるか?
  • RQ3多項式次数にたいしてスケッチサイズを対数的依存性にまで低減しつつ、高い精度を維持できるか?
  • RQ4ニューラルネットワークによるスケッチは、特徴ハッシュやランダムプロジェクションと比較して、モデルサイズと性能の面で優れているか?
  • RQ5提案手法は、ラベル付きデータが限られた実世界のデータセットにおいても一般化性能を維持できるか?

主な発見

  • 本手法は、スケッチサイズ $O(k\log(d/\delta))$ を用いて、$k$-スパースバイナリ入力の $1-\delta$ 分数に対して分類精度を達成し、従来手法と比べて顕著に小さい。
  • 次数 $p$ の多項式関数に対して、スケッチサイズが $p$ に対して対数的依存性を示す一方で、従来手法は指数的依存性を示す。
  • 実験結果から、ニューラルネットワークによるスケッチは、特徴ハッシュやガウスプロジェクションと比較して、非ゼロパラメータ数が少なく、同等またはより高い精度を達成するモデルを実現することが示された。
  • エンティティタイプタグ付きタスクでは、スケッチは単一の500,000サイズのハッシュ関数を上回る精度とパラメータ効率を達成した。
  • ReutersおよびAG Newsデータセットでは、最初のレイヤーのパラメータ数を最大50%まで削減しながら、同等またはより良い性能を達成した。
  • 複数のスケッチブロック($t \geq 2$)は、同程度のモデルサイズにおいて一括ブロックスケッチを常に上回り、冗長性と多様性の利点が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。