Skip to main content
QUICK REVIEW

[論文レビュー] FRAKE: Fusional Real-time Automatic Keyword Extraction

Aidin Zehtab-Salmasi, Mohammad‐Reza Feizi‐Derakhshi|arXiv (Cornell University)|Apr 10, 2021
Advanced Text Analysis Techniques参考文献 25被引用数 6
ひとこと要約

FRAKEは、グラフ中心性特徴(次数、媒介性、固有ベクトル、接近性)とテクスト特徴(品詞タギング、語句頻度、キャピタル化、位置、文内多様性)を統合することで、リアルタイムでの自動キーワード抽出を実現する画期的な統合的手法である。7つのデータセット(英語のInspecおよび非英語のWikiNewsを含む)において、最先端手法よりも平均で16.9%のF1スコア向上を達成した。

ABSTRACT

Keyword extraction is the process of identifying the words or phrases that express the main concepts of text to the best of one's ability. Electronic infrastructure creates a considerable amount of text every day and at all times. This massive volume of documents makes it practically impossible for human resources to study and manage them. Nevertheless, the need for these documents to be accessed efficiently and effectively is evident in numerous purposes. A blog, news article, or technical note is considered a relatively long text since the reader aims to learn the subject based on keywords or topics. Our approach consists of a combination of two models: graph centrality features and textural features. The proposed method has been used to extract the best keyword among the candidate keywords with an optimal combination of graph centralities, such as degree, betweenness, eigenvector, closeness centrality and etc, and textural, such as Casing, Term position, Term frequency normalization, Term different sentence, Part Of Speech tagging. There have also been attempts to distinguish keywords from candidate phrases and consider them on separate keywords. For evaluating the proposed method, seven datasets were used: Semeval2010, SemEval2017, Inspec, fao30, Thesis100, pak2018, and Wikinews, with results reported as Precision, Recall, and F- measure. Our proposed method performed much better in terms of evaluation metrics in all reviewed datasets compared with available methods in literature. An approximate 16.9% increase was witnessed in F-score metric and this was much more for the Inspec in English datasets and WikiNews in forgone languages.

研究の動機と目的

  • 膨大で継続的に生成されるテキストのリアルタイム処理において、意味のあるキーワードを効率的に抽出する課題に対処すること。
  • テキスト特徴またはグラフベース特徴に依存する単一特徴手法に起因する限界を克服し、相補的な強みを統合すること。
  • 多様なテキストタイプおよび言語において、精度、再現率、F1スコアの観点からキーワード抽出のパフォーマンスを向上させること。
  • 長文ドキュメントおよび多言語コンテンツを高精度で処理できるスケーラブルでリアルタイム対応のシステムを開発すること。

提案手法

  • 本手法は5段階の処理を経る:前処理、グラフ特徴およびテキスト特徴の抽出、スコア計算、キーフレーズ生成、順位付け。
  • グラフ特徴は、語の共起ネットワークを用いた中心性測度(次数、媒介性、固有ベクトル、接近性)から導出される。
  • テキスト特徴には、品詞タギング、語のキャピタル化、文内での位置、文間多様性、正規化された語句頻度が含まれる。
  • 特徴スコアは重み付き統合戦略を用いて統合され、最終的なキーワードスコアが計算される。
  • 候補フレーズは名詞句のチャンクングにより生成され、統合スコアに基づいて順位付けされる。
  • システムはリアルタイム処理を想定しており、ストリーミングまたは大規模テキストからの即時のキーワード抽出が可能である。

実験結果

リサーチクエスチョン

  • RQ1グラフベース特徴とテキスト特徴のハイブリッド統合は、単独の手法と比較して、キーワード抽出のパフォーマンスを顕著に向上させるか?
  • RQ2提案されたFRAKEモデルは、長文ドキュメントや多言語テキストを含む多様なデータセットでどのように性能を発揮するか?
  • RQ3複数の中心性測度と言語的特徴を統合することで、キーワード抽出における精度、再現率、F1スコアはどの程度向上するか?
  • RQ4学術的学位論文のようなキーワード比が低い文書においても、FRAKEは優れた性能を維持するか?
  • RQ5リアルタイムでスケーラブルなキーワード抽出において、YAKE、TextRank、KP-Minerといった最先端手法と比較して、FRAKEはどのように差をつけるか?

主な発見

  • FRAKEは、SemEval2010、SemEval2017、Inspec、FAO30、Thesis100、Pak2018、WikiNewsの7つのベンチマークデータセットすべてで最高のF1スコアを達成した。
  • 既存の最先端手法よりも平均で16.9%のF1スコア向上を達成した。特に英語のInspecおよび非英語のWikiNewsデータセットで顕著な向上が見られた。
  • InspecデータセットではF1スコア0.589を達成し、次に優れた手法(MultiPartite Rank)の0.480を0.109ポイント上回った。
  • WikiNewsではF1スコア0.550を達成し、YAKE(0.153)およびTextRank(0.098)を大きく上回った。これは多言語処理能力の優位性を示している。
  • 長文でキーワード比が低いThesis100データセットではF1スコア0.272とやや低いが、第3位にランクインし、困難な条件下でも頑健性を示した。
  • グラフ特徴とテキスト特徴の統合は、純粋なグラフモデルやテキストベースモデルよりも効果的であることが実証され、キーワード抽出におけるハイブリッド設計の価値が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。