Skip to main content
QUICK REVIEW

[論文レビュー] Open Domain Web Keyphrase Extraction Beyond Language Modeling

Lee Xiong, Chuan Hu|arXiv (Cornell University)|Nov 6, 2019
Advanced Text Analysis Techniques参考文献 27被引用数 4
ひとこと要約

本稿では、10万件のウェブドキュメントと専門家がアノテートしたキーフレーズを備えた大規模なオープンドメインキーフレーズ抽出データセット「OpenKP」と、視覚的ドキュメント特徴量と検索クエリのクリックから得られる弱い監督を統合することで、言語モデリングをはるかに超えてキーフレーズ抽出を向上させる神経モデル「BLING-KPE」を提案する。BLING-KPEは既存の手法を著しく上回り、ニュースなど未学習のドメインに対しても強いゼロショット一般化性能を示し、科学的データで微調整された専門的なニューラルモデルですら上回る性能を発揮する。

ABSTRACT

This paper studies keyphrase extraction in real-world scenarios where documents are from diverse domains and have variant content quality. We curate and release OpenKP, a large scale open domain keyphrase extraction dataset with near one hundred thousand web documents and expert keyphrase annotations. To handle the variations of domain and content quality, we develop BLING-KPE, a neural keyphrase extraction model that goes beyond language understanding using visual presentations of documents and weak supervision from search queries. Experimental results on OpenKP confirm the effectiveness of BLING-KPE and the contributions of its neural architecture, visual features, and search log weak supervision. Zero-shot evaluations on DUC-2001 demonstrate the improved generalization ability of learning from the open domain data compared to a specific domain.

研究の動機と目的

  • 非科学的ドメインにおけるキーフレーズ抽出のための、大規模で多様な実世界のウェブドキュメントデータセットが不足している問題に対処すること。
  • 多様なコンテンツ品質や構造を有する低リソースで高変動性のウェブドキュメントにおけるキーフレーズ抽出性能を向上させること。
  • 純粋な言語理解を超えて、視覚的レイアウトと検索行動の信号を活用することで、ドメイン間で良好に一般化するモデルを開発すること。
  • 検索クリックログからの弱い監督と視覚的特徴量が、オープンドメイン設定におけるキーフレーズ抽出を著しく向上させることを実証すること。

提案手法

  • 多様なドメインから抽出した約10万件のウェブドキュメントと専門家がアノテートしたキーフレーズを備えたデータセット「OpenKP」をキュレートし、aka.ms/BLING で公開した。
  • ウェブドキュメントの言語的および視覚的特徴を統合的にモデル化するため、畳み込みトランスフォーマー構造を採用した神経モデル「BLING-KPE」を提案した。
  • フォントサイズ、位置、HTML構造などの視覚的特徴量を単語埋め込みに統合し、ドキュメントのレイアウトの顕著さを捉えた。
  • 検索クリックログを用いた「クエリ予測」という事前学習タスクを導入し、スケールの大きな弱い監督をキーフレーズの関連性に与えた。
  • 文脈的埋め込み(例:ELMo)、視覚的特徴量、クリックベースの監督を統合することで、言語モデリングをはるかに超えるキーフレーズ検出を向上させた。
  • DUC-2001におけるゼロショット評価の際、ドキュメントチャンクからのキーフレーズを統合するために、重み付き和と重複除去のヒューリスティクスを適用した。

実験結果

リサーチクエスチョン

  • RQ1多様で実世界のウェブドキュメントで学習したキーフレーズ抽出モデルは、微調整なしに未学習のドメイン(例:ニュース)に対しても効果的に一般化できるか?
  • RQ2言語モデリングを超えて、視覚的ドキュメント特徴量と検索クリックログがキーフレーズ抽出性能にどの程度寄与しているか?
  • RQ3オープンドメインおよびニュースデータセットにおいて、BLING-KPEは最先端のニューラルおよび非ニューラルキーフレーズ抽出手法と比較してどのように差をつけるか?
  • RQ4検索クリックログを弱い監督として事前学習することで、キーフレーズ抽出の正確性とドメイン横断的耐性が向上するか?
  • RQ5BLING-KPE全体の性能における、言語モデリング、視覚的特徴量、クリックベースの監督の相対的寄与度はどの程度か?

主な発見

  • BLING-KPEは、OpenKPデータセットにおいて、標準的なKPEベースライン、最近のニューラルモデル、および高度に最適化された商用システムを大幅に上回る性能を発揮した。
  • アブレーションスタディの結果、視覚的特徴量やクリックログによる事前学習を削除するとモデルの正確性が著しく低下し、これらが重要な役割を果たしていることが確認された。
  • OpenKPで学習したBLING-KPEは、DUC-2001におけるゼロショット評価でF1@10スコアが最高を記録し、TFIDFや他のすべてのニューラルモデルを上回った。
  • 科学的ドメインデータで学習したモデルとは異なり、OpenKPで学習したモデルはニュースドキュメントへの一般化性能が優れており、科学的ドメイン特化モデルが失敗するのとは対照的だった。
  • 視覚的特徴量は、フォントサイズや強調表示によって目立つ製品名やタイプなどの顕著なフレーズを特定するのを助け、言語モデル単体では上位にランク付けされない場合でも有効だった。
  • 「クエリ予測」という事前学習タスクは、大規模な検索ログを活用して意味のある監督信号を効果的に得られ、キーフレーズの関連性検出を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。