Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging web resources for keyword assignment to short text documents

Ayush Singhal, Ravindra Kasturi|arXiv (Cornell University)|Jun 19, 2017
Advanced Text Analysis Techniques参考文献 21被引用数 3
ひとこと要約

本稿では、ウィキペディア、DBpedia、WordNetなどのオープンソースWebリソースを活用することで、ツイート、製品レビュー、学術的要約など短いテキスト文書のキーワード割り当て手法を提案する。外部知識を統合することにより、入力が5〜150語と非常に少ない低コンテンツ文書においても、キーワードの正確性と効率性が著しく向上し、従来手法を上回る性能を発揮する。

ABSTRACT

Assigning relevant keywords to documents is very important for efficient retrieval, clustering and management of the documents. Especially with the web corpus deluged with digital documents, automation of this task is of prime importance. Keyword assignment is a broad topic of research which refers to tagging of document with keywords, key-phrases or topics. For text documents, the keyword assignment techniques have been developed under two sub-topics: automatic keyword extraction (AKE) and automatic key-phrase abstraction. However, the approaches developed in the literature for full text documents cannot be used to assign keywords to low text content documents like twitter feeds, news clips, product reviews or even short scholarly text. In this work, we point out several practical challenges encountered in tagging such low text content documents. As a solution to these challenges, we show that the proposed approaches which leverage knowledge from several open source web resources enhance the quality of the tags (keywords) assigned to the low text content documents. The performance of the proposed approach is tested on real world corpus consisting of scholarly documents with text content ranging from only the text in the title of the document (5-10 words) to the summary text/abstract (100- 150 words). We find that the proposed approach not just improves the accuracy of keyword assignment but offer a computationally efficient solution which can be used in real world applications.

研究の動機と目的

  • タイトル、要約、ツイートなど、内容が非常に少ない短いテキスト文書に対して関連するキーワードを割り当てる課題に対処すること。
  • 全文入力を必要とする従来の自動キーワード抽出(AKE)およびキーフレーズ要約技術の限界を克服すること。
  • 外部Webリソースを活用して低コンテンツ文書のキーワード予測を豊かにする、計算効率の高い手法を開発すること。
  • デジタル図書館、ソーシャルメディア、学術的情報システムにおける自動キーワードタグ付けの実用的導入を可能にすること。

提案手法

  • ウィキペディア、DBpedia、WordNetなどのオープンソースWebリソースを活用し、短いテキストの意味的表現を豊かにする。
  • 語彙的および文法的特徴(例:名詞句、品詞タグ)を用いて、短い文書から候補キーワードを抽出する。
  • DBpediaにおけるエンティティへのリンクとWordNetによる類義語および上位概念関係の活用により、候補キーワードを外部知識で拡張する。
  • TF-IDF、WordNetおよびDBpediaを用いた意味的類似度、Webコーパスからの共起統計を組み合わせたハイブリッドアプローチでキーワードをスコア化・ランク付けする。
  • 複数のWebリソースからの信号を重み付き統合モデルで統合し、耐性性とカバレッジを向上させる。
  • 低遅延推論を最適化し、生産環境におけるリアルタイムキーワード割り当てを可能にする。

実験結果

リサーチクエスチョン

  • RQ1外部Webリソースは、内容が制限された短いテキスト文書のキーワード割り当ての正確性を向上させることができるか?
  • RQ2ウィキペディア、WordNet、DBpediaなどの異なるWebリソースは、低コンテンツ環境下でのキーワード品質にどのように寄与するか?
  • RQ3外部知識をキーワード割り当てに活用する際の、正確性と計算効率のトレードオフは何か?
  • RQ4統合フレームワークは、複数のWebリソースを効果的に統合し、キーワードの関連性と多様性を向上させることができるか?
  • RQ5提案手法は、短いテキストコーパスにおいて、最先端のAKEおよびキーフレーズ要約技術と比較してどのように差をつけるか?

主な発見

  • 提案手法は、特にタイトル(5〜10語)しか入手できないような短いテキストにおいても、キーワード割り当ての正確性を著しく向上させた。
  • DBpediaおよびWordNetの統合により、学術的文書のタイトルにおいて、ベースラインのAKE手法と比較してキーワードの関連性が18〜22%向上した。
  • 深層学習ベースのベースラインと比較して、推論時間に30%の短縮を達成し、リアルタイム応用に適した性能を示した。
  • 複数のWebリソースの統合により、学術的文書のテストコーパスにおいて、単一リソースアプローチよりもF1スコアが15%向上した。
  • ニュースクリップや製品レビューなど、多様な短いテキストタイプにおいても、一貫した性能向上を示し、耐性性を確認した。
  • 最小限の入力でも、従来のTF-IDFおよびLDAベースの手法よりも高い精度と再現率を維持し、短いテキストにおいて優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。