Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Opinion Aspect Extraction by Exploiting Past Extraction Results

Lei Shu, Bing Liu|arXiv (Cornell University)|Dec 23, 2016
Sentiment Analysis and Opinion Mining参考文献 32被引用数 6
ひとこと要約

本稿では、履歴ドメインから抽出された信頼性の高いアスペクトを事前知識として活用することで、条件付きランダムフィールド(CRF)を用いた教師あり意見アスペクト抽出を向上させる、Lifelong-CRFという新規手法を提案する。複数ドメインにまたがる頻出アスペクトを抽出し、それらを従属関係に基づく特徴としてエンコードすることで、クロスドメイン設定においてF1スコアを6.2ポイント(64.3から70.5へ)顕著に向上させた。標準CRFやCRF+R(過去のアスペクトを辞書として扱うがモデル統合を行わない)を上回る性能を示した。

ABSTRACT

One of the key tasks of sentiment analysis of product reviews is to extract product aspects or features that users have expressed opinions on. In this work, we focus on using supervised sequence labeling as the base approach to performing the task. Although several extraction methods using sequence labeling methods such as Conditional Random Fields (CRF) and Hidden Markov Models (HMM) have been proposed, we show that this supervised approach can be significantly improved by exploiting the idea of concept sharing across multiple domains. For example, "screen" is an aspect in iPhone, but not only iPhone has a screen, many electronic devices have screens too. When "screen" appears in a review of a new domain (or product), it is likely to be an aspect too. Knowing this information enables us to do much better extraction in the new domain. This paper proposes a novel extraction method exploiting this idea in the context of supervised sequence labeling. Experimental results show that it produces markedly better results than without using the past information.

研究の動機と目的

  • ラベル付きデータが乏しい低リソースまたはクロスドメイン設定における教師あり意見アスペクト抽出の向上を図ること。
  • 過去に処理されたドメインからの知識を活用しない標準CRFモデルの限界を解消すること。
  • 過去の抽出結果が、将来のアスペクト抽出性能の向上に体系的かつ再利用可能かどうかを検討すること。
  • ドメインをまたいで知識を保持・適用できる、意見抽出における順序ラベル付けのための生涯学習フレームワークの構築。
  • 特徴工学による過去知識の統合が、単純な辞書ベースの統合よりも優れているかどうかを評価すること。

提案手法

  • 2段階のプロセスを採用:まずラベル付きデータを用いたCRFによるモデル構築、次に履歴抽出からの生涯的知識蓄積。
  • 信頼性の高いアスペクトは、少なくともλ=2の過去ドメインに出現するものと定義し、それらを知識集合Kとして構築し、将来の学習を支援する。
  • 訓練済みCRFモデルMを変更するのではなく、Kから導出された従属関係に基づく特徴と、新しいテキスト内の句構造的関係を統合してCRF特徴を拡張する。
  • 従属関係のパターンは、テスト文の従属解析から生成され、Kと組み合わせて、CRF推論用の情報豊富な特徴ベクトルを生成する。
  • 新しいドメインが処理されるたびにKが動的に拡大され、ドメインをまたいで継続的な改善が可能になる。
  • 本手法は生涯機械学習の理論的枠組みに基づいており、過去のタスクからの事前知識を用いて新しいタスクでの性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1複数ドメインからの過去の抽出結果を、未観測の新しいドメインにおけるアスペクト抽出に活用できるか?
  • RQ2ドメインをまたいで頻出するアスペクトからの知識統合が、標準CRFよりも優れた性能をもたらすか?
  • RQ3特徴工学による過去知識の統合が、単純な辞書としての統合よりも効果的か?
  • RQ4提案手法の性能は、インドメイン設定とクロスドメイン設定でどのように異なるか?
  • RQ5過去の知識から導出された従属関係に基づくパターンの使用が、CRFのラベル付け精度に与える影響は何か?

主な発見

  • クロスドメイン設定において、Lifelong-CRFは平均F1スコア70.5を達成し、標準CRFの64.3を大きく上回り、6.2ポイントの向上を示した。
  • この向上は主に再現率の向上に起因しており、新しいドメインにおける真のアスペクトの検出能力が向上していることを示している。
  • 信頼性の高いアスペクト集合Kを辞書として扱うCRF+Rは、精度が低いため性能が悪く、単純な辞書統合では効果がないことが示された。
  • インドメイン設定では、期待通りに改善は小さい(F1: 70.5 vs. 64.3)が、多くのアスペクトが既に訓練データに含まれているためである。
  • 従属関係に基づくパターンによる特徴レベルでの過去知識統合が、直接的な辞書照合よりも効果的であることが確認された。
  • 本手法は、意見抽出における教師あり順序ラベル付けにおいて生涯学習を実現し、この分野で初めての手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。