Skip to main content
QUICK REVIEW

[論文レビュー] Open Domain Suggestion Mining: Problem Definition and Datasets

Sapna Negi, Maarten de Rijke|arXiv (Cornell University)|Jun 6, 2018
Sentiment Analysis and Opinion Mining参考文献 17被引用数 21
ひとこと要約

本稿は、オープンドメイン応用を想定した、形式的かつ文脈依存的な提案抽出の定義を提唱し、一般ユーザーと専門家による二段階のアノテーション手法を組み合わせて、公開可能なベンチマークデータセットを構築した。主な貢献は、旅行、電子機器、ソフトウェアなど多様な分野において、構造的なアノテーション手順とリリースされたデータセットを用いて、一貫性が向上し、曖昧さが低減された、実証的に検証された新しいフレームワークの確立である。

ABSTRACT

We propose a formal definition for the task of suggestion mining in the context of a wide range of open domain applications. Human perception of the term \emph{suggestion} is subjective and this effects the preparation of hand labeled datasets for the task of suggestion mining. Existing work either lacks a formal problem definition and annotation procedure, or provides domain and application specific definitions. Moreover, many previously used manually labeled datasets remain proprietary. We first present an annotation study, and based on our observations propose a formal task definition and annotation procedure for creating benchmark datasets for suggestion mining. With this study, we also provide publicly available labeled datasets for suggestion mining in multiple domains.

研究の動機と目的

  • 提案抽出に正式なオープンドメイン定義が存在しない現状、曖昧でアプリケーション固有の解釈に依存している問題に対処すること。
  • 一般ユーザーが「提案」という語をどのように解釈するかを調査することで、既存のデータセットにおける一貫性の欠如を是正すること。
  • クラウドソーシングと専門家アノテーターを組み合わせたスケーラブルで信頼性の高いアノテーションパイプラインを設計し、高いアノテータ間一貫性を持つベンチマークデータセットを構築すること。
  • 再現可能な研究とモデル開発を支援するため、公開可能なドメイン多様な提案抽出用データセットをリリースすること。

提案手法

  • 一般ユーザーのアノテーターを対象に、さまざまな文脈における「提案」という語の解釈を理解するための認知調査を実施する。
  • 言語的手がかりと文脈に基づき、明示的提案、暗黙的提案、明示的非提案、暗黙的非提案の四カテゴリー分類を提唱する。
  • 二段階のアノテーションプロセスを採用する:第1段階では文単位の文脈を提示したクラウドソーシングアノテーターが処理し、第2段階では文脈なしで専門家アノテーターが処理する。
  • 両段階で「提案」とラベル付けされた文のみを陽性インスタンスとして保持し、信頼性と一貫性を高める。
  • トロピカル(ホテル)、アマゾン(電子機器)、UserVoice(ソフトウェア)、Fodors/InsightVacations(旅行)、Microsoftのツイートから、多様なソースのベンチマークデータセットを構築する。
  • データセット間でCohenの kappa スコアが0.72から1.0の範囲で変動し、Microsoftのツイートデータセットでは1.0を記録した。これは、全文の文脈とハッシュタグの明確さにより、曖昧さが低減したためである。

実験結果

リサーチクエスチョン

  • RQ1一般ユーザーは、オープンドメインの文脈において、「提案」という語をどのように認識しているか?
  • RQ2実証的アノテーション研究から導き出される形式的で文脈に配慮した「提案」の定義は何か?
  • RQ3主観性を最小限に抑え、一貫性を最大化するための信頼性の高いスケーラブルなアノテーションパイプラインは、どのように設計できるか?
  • RQ4非構造的テキストにおいて、提案と非提案を区別する言語的および文脈的特徴は何か?

主な発見

  • 調査では、一般ユーザーが「提案」と関連付ける語として、助言、推薦、ヒント、警告を挙げることが多いが、これらはしばしば非提案的な文脈に現れ、曖昧さを生じさせていることが明らかになった。
  • 明示的/暗黙的提案および非提案の四カテゴリー枠組みは、提案認識のニュアンスを効果的に捉え、アノテーションの一貫性を向上させた。
  • 二段階アノテーション手法はデータセット品質を顕著に向上させ、ホテルデータセットではアノテータ間一致度が0.86、Microsoftツイートでは1.0を記録し、高い信頼性を示した。
  • リリースされたデータセットは5つのドメインをカバーしており、CC BY-NC-SA 4.0 ライセンスで公開されており、提案抽出分野における再現可能な研究を可能にしている。
  • Microsoftツイートデータセットでは、全文の文脈とハッシュタグの存在により、100%のアノテータ間一致度が達成された。
  • 本手法は、既存のデータセット(旅行フォーラム:kappa = 0.76、Microsoftツイート)を再ラベル付け・検証し、アプローチの強固さを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。