Skip to main content
QUICK REVIEW

[論文レビュー] Social Network Extraction: Superficial Method and Information Retrieval

Mahyuddin K. M. Nasution, Shahrul Azman Mohd Noah|arXiv (Cornell University)|Jan 12, 2016
Information Retrieval and Data Mining参考文献 9被引用数 15
ひとこと要約

本稿では、URL構造とTF-IDF重み付きキーワードを活用して、単なる共起を超えた関係抽出を向上させる、情報検索駆動型の教師なし手法を提案する。URLベースの類似度(USR)を用いることで、70%の再現率と9%の正確率を達成し、キーワードのみの手法を上回る性能を示した。また、URL解析により、非構造的Webデータからの社会的関係の同定における曖昧さを低減できることを示した。

ABSTRACT

Social network has become one of the themes of government issues, mainly dealing with the chaos. The use of web is steadily gaining ground in these issues. However, most of the web documents are unstructured and lack of semantic. In this paper we proposed an Information Retrieval driven method for dealing with heterogeneity of features in the web. The proposed solution is to compare some approaches have shown the capacity to extract social relation: strength relations and relations based on online academic database.

研究の動機と目的

  • 非構造的かつ意味的に曖昧なWebドキュメントから社会的ネットワークを抽出する課題に対処すること。
  • 同義語や曖昧さを低減するため、キーワードの共起に基づく従来手法を、URL構造とTF-IDFの統合によって改善すること。
  • 学術的ソーシャルネットワークにおける関係抽出において、キーワード類似度とURLベースのマッチングを組み合わせた有効性を評価すること。
  • 標準的な情報検索メトリクスを用いて、手動で整備されたDBLPベースの社会的ネットワークと比較して性能をベンチマークすること。
  • 教師なしネットワーク抽出において、URLパターンを意味的関係の代理として使用する可能性を検討すること。

提案手法

  • Webスニペットから関連するキーワードを選択するため、TF-IDFを用い、最大TF-IDFスコアの30%を超える値を持つものをフィルタリングする。
  • キーワードクラスタに対して、共起と類似度測定を用いたしきい値ベースの関係抽出手法(SRS)を適用する。
  • WebページのURL間の類似度を計算して社会的関係を推定する、URLベースの類似度手法(USR)を導入する。
  • 抽出されたネットワークとベンチマークネットワークの類似度を測定するためにJaccard係数を用い、再現率、正確率、F-measureを評価指標とする。
  • 結果の妥当性を検証するため、DBLPの著者-共同著者関係に基づいて作成されたベンチマークグラフを用いる。
  • 比較のための基準となるネットワークを生成するために、関連ルールマイニング(ARS)を適用する。

実験結果

リサーチクエスチョン

  • RQ1URL構造は、キーワードの共起を越えて、社会的関係抽出を効果的に向上させることができるか?
  • RQ2キーワードベースの類似度と比較して、URLベースの類似度は学術的ソーシャルネットワーク抽出においてどのように性能を示すか?
  • RQ3TF-IDFとURL解析を統合することで、教師なし社会的ネットワーク抽出における再現率と正確率はどの程度向上するか?
  • RQ4提案手法は、Webベースの関係抽出における同義語や多義語に起因する曖昧さを低減するか?
  • RQ5多数の人物名と潜在的関係を対象とした場合、本手法はスケーラビリティを保っているか?

主な発見

  • URLベースの類似度手法(USR)は70%の再現率と9%の正確率を達成し、キーワードのみの手法(SRS)の47%再現率と10%正確率を顕著に上回った。
  • USRはα=0.01で19,513の関係(潜在的関係の86%)を同定したのに対し、SRSはα=0.0001で12,621の関係(53%)を同定した。
  • USRとベンチマークネットワーク間のJaccard類似度は0.009であり、SRSの0.0094よりもわずかに高く、基準となる真値との整合性が優れていることを示した。
  • 1つのクラスタあたりのキーワード数を制限することで、低品質または関連のない語のノイズを低減し、F-measureが向上した。
  • 本手法は、キーワードベース手法における同義語や曖昧さの問題を軽減する安定的かつ曖昧でない信号としてURLが機能することを示した。
  • 結果から、URL構造は、Webドキュメントからの教師なし社会的ネットワーク抽出において、価値あるが未活用の信号であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。