Skip to main content
QUICK REVIEW

[論文レビュー] Incremental dimension reduction of tensors with random index

Fredrik Sandin, Blerim Emruli|arXiv (Cornell University)|Mar 18, 2011
Tensor decomposition and applications参考文献 27被引用数 8
ひとこと要約

本稿では、スパースなランダム線形符号化を用いた、テンソルにおける新しいインクリメンタルでスケーラブルかつ効率的な次元削減手法、N方向ランダムインデキング(NRI)を紹介する。この手法により、再処理を伴わずにオンラインでの符号化・復号化が可能となり、テンソルのインデックス範囲の動的拡張が可能であり、高次元(n > 10³)においても高い精度を維持する。信号対雑音比性能は、約1000の臨界次元閾値を超えると安定する。

ABSTRACT

We present an incremental, scalable and efficient dimension reduction technique for tensors that is based on sparse random linear coding. Data is stored in a compactified representation with fixed size, which makes memory requirements low and predictable. Component encoding and decoding are performed on-line without computationally expensive re-analysis of the data set. The range of tensor indices can be extended dynamically without modifying the component representation. This idea originates from a mathematical model of semantic memory and a method known as random indexing in natural language processing. We generalize the random-indexing algorithm to tensors and present signal-to-noise-ratio simulations for representations of vectors and matrices. We present also a mathematical analysis of the approximate orthogonality of high-dimensional ternary vectors, which is a property that underpins this and other similar random-coding approaches to dimension reduction. To further demonstrate the properties of random indexing we present results of a synonym identification task. The method presented here has some similarities with random projection and Tucker decomposition, but it performs well at high dimensionality only (n>10^3). Random indexing is useful for a range of complex practical problems, e.g., in natural language processing, data mining, pattern recognition, event detection, graph searching and search engines. Prototype software is provided. It supports encoding and decoding of tensors of order >= 1 in a unified framework, i.e., vectors, matrices and higher order tensors.

研究の動機と目的

  • 新しいデータが追加された際に再分析が不要な、インクリメンタルでメモリ効率の良いテンソル向け次元削減手法の開発。
  • 従来自然言語処理におけるベクトルに用いられていたランダムインデキングを、行列および高次元テンソルへ一般化し、統一的なフレームワークで扱う。
  • コンポーネント表現やランクを変更せずに、テンソルのインデックス範囲を動的に拡張可能にする。
  • 高次元の三値ベクトル間の近似的直交性を分析し、この性質が手法の信号対雑音比性能に与える基盤的役割を解明する。
  • 実世界のタスク、例えば同義語同定やベクトル・行列表現における信号対雑音比性能を評価する。

提案手法

  • 本手法は、三値インデックスベクトル(値は{-1, 0, +1})を用いたスパースなランダム線形符号化を採用し、コンポーネントを固定サイズのコンact表現に射影する。
  • コンポーネントの符号化は、ランダムインデックスベクトルを用いてオンラインで実行され、全データセットの再処理なしに段階的更新が可能である。
  • 復号化は、同じインデックスベクトルを用いて符号化されたテンソルを再び射影することで実現され、高い確率で特徴を回復可能である。
  • 一様な数学的定式化により、ランダムインデキングをベクトル、行列、および高次元テンソル(N方向テンソル)へ一般化する。
  • 本手法は、高次元の三値ベクトル間の近似的直交性に依存しており、これによりコンポーネント間の干渉が低減される。
  • プロトタイプソフトウェアライブラリ(RITensor)により、1次以上のテンソルの符号化・復号化を統合されたフレームワークでサポートする。

実験結果

リサーチクエスチョン

  • RQ1N方向ランダムインデキングにおけるインデックスベクトルの次元が、復号特徴の信号対雑音比にどのように影響するか?
  • RQ2インデックスベクトルの密度(非ゼロの三値数)が、テンソル表現の精度および干渉に与える影響は何か?
  • RQ3同等のパrameter設定下で、二方向ランダムインデキング(行列用)と一方向インデキング(ベクトル集合用)の性能にどのような差が生じるか?
  • RQ4NRIの性能が安定化する次元閾値は何か?また、この閾値が復号特徴の標準偏差に与える影響は?
  • RQ5特徴の大きさに顕著な差がある場合でも、非スパースなテンソルにおいてNRIは低信号対雑音比下でも高い精度を維持できるか?

主な発見

  • 正しく復号された特徴の平均数は、n ≈ 1000の臨界次元閾値を超えると、次元のさらなる増加に関係なく安定する。
  • 正しく復号された特徴の標準偏差は次元が増加するにつれて顕著に減少し、高次元での一貫性の向上を示している。
  • インデックスベクトルの非ゼロ三値数が2から4に増加すると性能が顕著に向上するが、8を超えてもさらなる向上は最小限にとどまる。
  • 同等のパrameter下で、一方向ランダムインデキング(ベクトル用)は二方向インデキング(行列用)よりも高い信号対雑音比を達成する。これは干渉が低減されているためである。
  • 本手法は、コンポーネント表現やランクを変更せずに、テンソルのインデックス範囲を動的に拡張可能であり、スケーラブルかつインクリメンタルな処理を可能にする。
  • 顕著な特徴がバックグラウンドノイズよりも少なくとも1桁以上強い限り、非スパース表現に対してもロバストである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。