Skip to main content
QUICK REVIEW

[論文レビュー] Similarity Measures, Author Cocitation Analysis, and Information Theory

Loet Leydesdorff|ArXiv.org|Nov 22, 2009
Advanced Text Analysis Techniques参考文献 16被引用数 10
ひとこと要約

本稿では、著者共著者分析における類似性測定のための非パラメトリックな情報理論的アプローチを提案する。伝統的なピアソン相関係数に代えて、情報理論に裏付けられた対数変換を用いる。文書の類似性を情報量の単位(ビット)で表現することで、ゼロカウントの影響に敏感でない精密なクラスタリングを可能にし、引用分析におけるコサイン法や相関法よりもより頑健な代替手法を提供する。

ABSTRACT

The use of Pearson's correlation coefficient in Author Cocitation Analysis was compared with Salton's cosine measure in a number of recent contributions. Unlike the Pearson correlation, the cosine is insensitive to the number of zeros. However, one has the option of applying a logarithmic transformation in correlation analysis. Information calculus is based on both the logarithmic transformation and provides a non-parametric statistics. Using this methodology one can cluster a document set in a precise way and express the differences in terms of bits of information. The algorithm is explained and used on the data set which was made the subject of this discussion.

研究の動機と目的

  • ピアソン相関係数とコサイン類似度の限界、特にゼロカウントへの感受性を是正すること。
  • 情報理論に裏打ちされた非パラメトリック統計的手法を用いて、文書類似度を測定するための手法を開発すること。
  • 情報量の単位(ビット)で差を定量的に表現することで、文書集合の精密なクラスタリングを可能にすること。
  • 引用ベースのネットワーク解析における相関法やコサイン法の代替として、より頑健な手法を提供すること。
  • 先行研究で分析済みの実世界の引用データセットを用いて、手法の有効性を実証すること。

提案手法

  • 共著者頻度に対数変換を適用し、分散の安定化とゼロカウントへの感受性の低減を図る。
  • シャノンエントロピーに基づく情報計算を用いて、類似性をビット単位の情報量として表現する。
  • 正規分布の仮定を必要としない非パラメトリックな統計枠組みを採用する。
  • 著者や文書間の距離を情報理論的用語で測定した類似度行列を構築する。
  • 得られたビットベースの非類似度測定値を用いてクラスタリングを実施し、文書や著者を意味的に整合したグループに分類する。
  • ピアソン相関係数とコサイン類似度で事前に分析済みのデータセットを用いて、手法の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1情報理論的類似度は、著者共著者分析においてピアソン相関係数やコサイン類似度と比べてどのように異なるか?
  • RQ2対数変換は引用ネットワークにおける類似度測定の頑健性を向上させ得るか?
  • RQ3情報理論は、引用分析におけるパrametricな相関係数の代替として、どの程度非パラメトリックな手法として有効か?
  • RQ4類似度のビットベース表現は、文書集合におけるクラスタリングの精度をどのように向上させるか?
  • RQ5情報理論的類似度と従来の類似度測定法を用いた場合のクラスタリング結果に、定量的にどのような差が生じるか?

主な発見

  • 情報理論的アプローチは、ゼロカウントを多く含むスパースデータの状況においても、ピアソン相関係数よりもより頑健な類似度測定を提供する。
  • 対数変換によりゼロ値の影響が著しく低減され、相関法に比べてより安定した手法となる。
  • ビット単位の情報量として表現された類似度測定値は、文書集合の精密かつ解釈可能なクラスタリングを可能にする。
  • 本手法は、データスパarsityや分布の仮定に対する感受性の面で、ピアソン相関係数およびコサイン類似度を上回る。
  • アルゴリズムは、既知の学術的関係と整合する形でテストデータセットを適切にクラスタリングでき、その解釈可能性が裏付けられた。
  • 本手法は非パラメトリックであり、データの正規性仮定を必要としないため、引用ネットワーク全体への一般化可能性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。