Skip to main content
QUICK REVIEW

[論文レビュー] Speeding up Word Mover's Distance and its variants via properties of distances between embeddings

Matheus Werner, Eduardo Sany Laber|arXiv (Cornell University)|Dec 1, 2019
Topic Modeling参考文献 20被引用数 11
ひとこと要約

本稿では、単語埋め込み間の距離が2つのグループに集約されるという経験的性質に着目し、意味的に関連する単語の間では小さい距離、関連のない単語の間では一様な値をとることを特徴として、Word Mover's Distance (WMD) 及びその緩和版 (RWMD) の高速化手法を提案する。この構造をモデル化することで、計算複雑性とメモリ使用量を削減でき、10のデータセットにおいて分類精度に損失を生じさせることなく、最大15倍の高速化を達成する。

ABSTRACT

The Word Mover's Distance (WMD) proposed by Kusner et al. is a distance between documents that takes advantage of semantic relations among words that are captured by their embeddings. This distance proved to be quite effective, obtaining state-of-art error rates for classification tasks, but is also impracticable for large collections/documents due to its computational complexity. For circumventing this problem, variants of WMD have been proposed. Among them, Relaxed Word Mover's Distance (RWMD) is one of the most successful due to its simplicity, effectiveness, and also because of its fast implementations. Relying on assumptions that are supported by empirical properties of the distances between embeddings, we propose an approach to speed up both WMD and RWMD. Experiments over 10 datasets suggest that our approach leads to a significant speed-up in document classification tasks while maintaining the same error rates.

研究の動機と目的

  • 大規模ドキュメント分類における Word Mover's Distance (WMD) 及びその変種の高い計算コストを軽減すること。
  • 単語埋め込み距離の構造的性質を活用することで、メモリ使用量を削減し、距離計算の高速化を実現すること。
  • 著しく高速化された実行時間の下で、最先端の分類性能を維持すること。
  • 実世界のアプリケーションで高速なドキュメント類似度計算を必要とする WMD に類似する距離の実用的導入を可能とすること。

提案手法

  • 単語埋め込み間の距離が2つの明確なグループに分かれるものと仮定する:関連する単語の間では小さい値、関連のない単語の間では一定値。
  • この2グループの仮定を用いて、WMD および RWMD の輸送問題を再定式化し、非ゼロエッジコストの数を削減する。
  • 大規模な語彙を対象とした、k-means を用いたクラスタリングに基づくキャッシュ構築法を導入し、距離を事前計算する。
  • 語彙全体のペairではなく、クラスタ数に比例するサイズのコンactなキャッシュを用いる、Rel-RWMD(S) という変種を提案する。
  • 各単語が関連する単語を何個まで考慮するかを制御するパrameter $ r $ を導入し、速度と精度のトレードオフを可能にする。
  • キャッシュを用いた RWMD の線形時間実装を採用し、クラスタリングによる最適化により、前処理およびストレージコストを削減する。

実験結果

リサーチクエスチョン

  • RQ1単語埋め込み間の距離の分布を活用することで、WMD や RWMD の複雑性を低減できるか?
  • RQ2関連のない単語ペairに一様な距離を仮定することで、分類精度を維持しつつ計算を高速化できるか?
  • RQ3埋め込みをクラスタリングし、関連する距離のみをキャッシュすることで、メモリ使用量と計算時間はどの程度削減できるか?
  • RQ4実世界のドキュメント分類タスクにおいて、提案手法は標準の WMD や RWMD よりも速度と精度で優れているか?

主な発見

  • 提案手法は、1つの分類タスクでは RWMD よりも平均でほぼ5倍の高速化を達成し、別のタスクでは15倍の高速化を実現したが、テスト誤差に劣化は認められなかった。
  • Arxiv データセットでは、Rel-RWMD(S) は RWMD(S) よりも27倍高速であり、テスト誤差は 23.16% に対し、RWMD(S) は 23.43% であった。
  • Wikipedia データセットでは、Rel-RWMD(S) は RWMD(S) よりも3倍高速であり、テスト誤差は 26.90% に対し、RWMD(S) は 27.01% であった。
  • Rel-RWMD(S) の前処理フェーズが実行時間の大部分を占めるが、キャッシュが構築されれば、距離計算は RWMD(S) よりも25〜60倍高速になる。
  • 本手法は WMD や RWMD と同等の性能を維持し、すべてのデータセットで最良のベースラインと0.5%以内のテスト誤差差で推定された。
  • 特に大規模な語彙に対して顕著な効果を示し、全ペア距離ではなくクラスタベースの距離のみをキャッシュすることで、メモリ使用量を大幅に削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。