Skip to main content
QUICK REVIEW

[論文レビュー] A new simple and effective measure for bag-of-word inter-document similarity measurement

Sunil Aryal, Kai Ming Ting|arXiv (Cornell University)|Feb 9, 2019
Topic Modeling参考文献 18被引用数 16
ひとこと要約

本稿では、従来の語句重み付けを回避するため、袋-語モデルベクトル内の語レベルの類似度を確率的アプローチで評価する、新しい文書間類似度測定法Spを提案する。二値BoW表現では優れた性能を発揮し、語頻度に基づく表現ではコサイン類似度やさまざまな重み付けスキームを用いたBM25と比較して、競争力があり、より一貫性のある結果を得た。

ABSTRACT

To measure the similarity of two documents in the bag-of-words (BoW) vector representation, different term weighting schemes are used to improve the performance of cosine similarity---the most widely used inter-document similarity measure in text mining. In this paper, we identify the shortcomings of the underlying assumptions of term weighting in the inter-document similarity measurement task; and provide a more fit-to-the-purpose alternative. Based on this new assumption, we introduce a new simple but effective similarity measure which does not require explicit term weighting. The proposed measure employs a more nuanced probabilistic approach than those used in term weighting to measure the similarity of two documents w.r.t each term occurring in the two documents. Our empirical comparison with the existing similarity measures using different term weighting schemes shows that the new measure produces (i) better results in the binary BoW representation; and (ii) competitive and more consistent results in the term-frequency-based BoW representation.

研究の動機と目的

  • 文書間類似度測定における既存の語句重み付け仮定の限界を特定すること。
  • 明示的な語句重み付けに依存しない新しい類似度測定法を提案し、一貫性と性能を向上させること。
  • 多様なデータセットおよびBoW表現(特にプライバシーに配慮が必要な分野)において、新しい測定法を評価すること。
  • Spが語句重み付けの調整を必要とせずに、最先端の手法と同等またはそれ以上の結果を達成できることを示すこと。

提案手法

  • 提案されたSp測定法は、共起および分布パターンに基づき、2つのドキュメント間の語レベル類似度を確率的フレームワークで計算する。
  • tf や idf 因子に依存せず、共有の関連性の確率を反映する語固有の類似度スコアを計算する。
  • 全般的なドキュメント類似度は、正規化された集約を用いて、語ごとの類似度の重み付き和として導出される。これによりスケール不変性が保証される。
  • tf-idf や BM25 で一般的に見られる複雑なパrameterチューニングを回避するシンプルで効果的な手法である。
  • 前処理や重み付けを必要とせず、生のBoWベクトル(二値および語頻度表現)に直接適用可能である。
  • 本手法は、類似度は語の文脈における確率的関連性を反映すべきである、という新しい仮定に基づいている。

実験結果

リサーチクエスチョン

  • RQ1クエリ・バイ・エクサムプルタスクに適用した場合、tf-idf などの既存の語句重み付けスキームは文書間類似度測定でどの程度の性能を示すか?
  • RQ2明示的な語句重み付けを回避しつつ、性能を維持または向上させられる類似度測定法を設計できるか?
  • RQ3提案されたSp測定法は、二値および語頻度ベースのBoW表現において、コサイン類似度およびBM25を上回るか?
  • RQ4Spは、さまざまなデータセットにおいて、重み付けスキームが異なる従来の測定法と比較して、より一貫性があるか?
  • RQ5語頻度情報が非表示であるプライバシー保護が必要なアプリケーションにおいて、Spは頑健な代替手段として機能できるか?

主な発見

  • Spは、二値BoW表現において、任意の語句重み付けスキームを用いたコサイン類似度やBM25よりも顕著に優れた性能を発揮した。
  • 語頻度ベースのBoW表現において、Spは複数のデータセットにおいて、既存の測定法と比較して競争力があり、より一貫性のある結果をもたらした。
  • Spの性能は、語句重み付けパrameterのチューニングに依存せず安定しており、コサイン類似度やBM25とは対照的であった。
  • Spはtf-idfを組み合わせた重み付きジャッカード類似度を上回った。これは、Spが語レベルの関連性をより優れた方法でモデル化できることを示している。
  • 語頻度情報が利用不可であっても、Spは強力な性能を維持したため、プライバシー保護アプリケーションに適している。
  • 実証的評価により、Spがさまざまなテキストマイニングタスク、特にクエリ・バイ・エクサムプルのシナリオにおいて頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。