Skip to main content
QUICK REVIEW

[論文レビュー] Document Retrieval for Large Scale Content Analysis using Contextualized Dictionaries

Gregor Wiedemann, Andreas Niekler|arXiv (Cornell University)|Jul 11, 2017
Advanced Text Analysis Techniques参考文献 14被引用数 6
ひとこと要約

本稿では、大規模コンテンツ分析における文書検索のための文脈に応じた辞書手法を提案する。トピックモデルと共起データを用いて、類型的基準文書から重み付き語彙を生成し、意味的文脈を組み込むことで、ベースラインの語彙重み付け手法を上回る検索性能を達成した。トピックモデルに基づく辞書と共起照合を用いることで、MAPが0.861に達した。

ABSTRACT

This paper presents a procedure to retrieve subsets of relevant documents from large text collections for Content Analysis, e.g. in social sciences. Document retrieval for this purpose needs to take account of the fact that analysts often cannot describe their research objective with a small set of key terms, especially when dealing with theoretical or rather abstract research interests. Instead, it is much easier to define a set of paradigmatic documents which reflect topics of interest as well as targeted manner of speech. Thus, in contrast to classic information retrieval tasks we employ manually compiled collections of reference documents to compose large queries of several hundred key terms, called dictionaries. We extract dictionaries via Topic Models and also use co-occurrence data from reference collections. Evaluations show that the procedure improves retrieval results for this purpose compared to alternative methods of key term extraction as well as neglecting co-occurrence data.

研究の動機と目的

  • 研究的関心が抽象的で、単純なキーワード検索では捉えきれない場合に、大規模テキストコレクションから関連文書を効果的に検索する課題に対処すること。
  • 孤立したキーワードに依存するのではなく、手動で整備された基準文書を基盤としてクエリを構築する検索手法を開発すること。
  • 共起データとトピックモデルに基づく辞書重み付けを統合することで、文脈的情報を組み込み、検索性能を向上させること。
  • tf/idf やユニグラム照合といった標準的な語彙重み付け手法と比較して、本手法の有効性を評価すること。
  • 特に、特定のイデオロギー的または弁証的特徴を有する文書を同定する文脈において、本手法の有用性を示すこと。

提案手法

  • 本手法は、類型的基準文書のコレクションに対してLatent Dirichlet Allocation (LDA)を用いた半教師あり辞書抽出プロセスから出発し、トピック関連語を同定する。
  • 辞書内の語の重みは、すべてのトピックにおける確率の合計として計算され、各語が基準コレクションの意味的構造に寄与する程度を反映する。
  • 語の間の文脈的関係をモデル化するため、基準コレクションおよび一般語彙コーパスから共起データを抽出する。
  • 文書の関連度スコアは、ユニグラム照合と文脈ベースの類似度を組み合わせたハイブリッド類似度測度を用い、パラメータαで重み付けされる。
  • 複数の検索システム間の対比較に基づき、候補文書をランク付けするためのコンドルセ法を適用し、評価用に堅牢な偽関連文書の集合を特定する。
  • 性能評価には平均平均精度(MAP)とk番目までの精度を用い、上位ランクの文書について手動による関連度ラベル付けを実施する。

実験結果

リサーチクエスチョン

  • RQ1トピックモデルと共起データから導出された辞書は、コンテンツ分析において抽象的で理論的関心が強い研究テーマの文書検索性能を向上させることができるか?
  • RQ2共起データを含めることで、単に語頻度を用いる場合と比較して、検索品質はどのように向上するか?
  • RQ3コンテンツ分析タスクにおける検索に用いる場合、トピックモデルに基づく辞書はtf/idfに基づく辞書を上回る性能を示すか?
  • RQ4特に結果リストの下位ランクにおいて、検索性能はどの程度頑健であるか?
  • RQ5ゴールスタンダードの関連度ラベルが存在しない状況下で、コンドルセ法によるコンSENSUSランク付けは、信頼性のある偽関連文書の集合を効果的に特定できるか?

主な発見

  • ユニグラム照合と共起照合を組み合わせ、α=14とした最良の検索システムは、トピックモデルに基づく辞書を用いて、平均平均精度(MAP)が0.861に達した。
  • 共起データを含めた場合、トピックモデルに基づく辞書を用いたシステムは、tf/idfに基づく辞書を用いたシステムを上回り、MAPは0.861対0.823であった。
  • k番目までの精度評価では、最良のシステムの上位10件の精度が1.0に達した一方で、ランク501でも精度が0.9を維持しており、下位ランクでも高い性能を示した。
  • 共起データの使用は、検索品質を顕著に向上させた。ユニグラム照合に依存するシステムは、精度とMAPの両方で低い値を示した。
  • コンドルセ法に基づく偽関連文書の選定は、54件の安定した文書集合を生成し、複数のシステム間で一貫したランク付けを達成した。これにより、評価手法の妥当性が裏付けられた。
  • 本手法は、トピックモデルと共起データから導出された文脈に応じた辞書が、コンテンツ分析における抽象的または理論的関心に合致する文書の検索に有効であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。