Skip to main content
QUICK REVIEW

[論文レビュー] An Automatic Contextual Analysis and Clustering Classifiers Ensemble approach to Sentiment Analysis

Murtadha Talib AL-Sharuee, Fei Liu|arXiv (Cornell University)|May 29, 2017
Sentiment Analysis and Opinion Mining参考文献 29被引用数 3
ひとこと要約

本稿では、自動的文脈分析と修正済みk-means分類器のアンサンブルを組み合わせた、教師なしでドメインに依存しない感情分析手法ACACCEを提案する。SentWordNetを用いた極性ベースの重心初期化と、多数決投票を用いた複数の語句重み付け方式の適用により、人為的ラベルデータや学習を一切不要とすることで、多様なデータセットにおいて高い精度、安定性、一般化性能を達成する。

ABSTRACT

Products reviews are one of the major resources to determine the public sentiment. The existing literature on reviews sentiment analysis mainly utilizes supervised paradigm, which needs labeled data to be trained on and suffers from domain-dependency. This article addresses these issues by describes a completely automatic approach for sentiment analysis based on unsupervised ensemble learning. The method consists of two phases. The first phase is contextual analysis, which has five processes, namely (1) data preparation; (2) spelling correction; (3) intensifier handling; (4) negation handling and (5) contrast handling. The second phase comprises the unsupervised learning approach, which is an ensemble of clustering classifiers using a majority voting mechanism with different weight schemes. The base classifier of the ensemble method is a modified k-means algorithm. The base classifier is modified by extracting initial centroids from the feature set via using SentWordNet (SWN). We also introduce new sentiment analysis problems of Australian airlines and home builders which offer potential benchmark problems in the sentiment analysis field. Our experiments on datasets from different domains show that contextual analysis and the ensemble phases improve the clustering performance in term of accuracy, stability and generalization ability.

研究の動機と目的

  • 教師あり感情分析の限界、特に高コストなラベル付けとドメイン依存性を解消すること。
  • 人為的ラベル付き学習データを一切不要とする完全自動で教師なしの手法を開発すること。
  • 言語的文脈処理とアンサンブル学習を統合することで、感情分析におけるクラスタリングの安定性と精度を向上させること。
  • 感情分析研究における新しいベンチマークデータセット(オーストラリアの航空会社および住宅建設業者)を提供すること。
  • 複数の重み付け方式の統合と確率的でない重心初期化により、多様なドメインにわたる一般化性能と頑健性を向上させること。

提案手法

  • 本手法は二段階アーキテクチャを採用する:(1) 否定、強調語、対比、綴り訂正のための文脈的処理を、言語的ルールを用いてテキストを前処理する。
  • 綴り訂正によりテキストを正規化し、感情辞書のSentWordNet 3.0を用いて形容詞および副詞に極性を割り当てる。
  • k-meansベース分類器は、SentWordNetからの事前クラスタリングにより得られた正例および負例の特徴を用いて重心を初期化することで、確率的でない安定した初期化を実現する。
  • 異なる語句重み付け方式(例:TF-IDF、バイナリー、頻度)を用いて複数のベクトル空間モデルを構築し、ドキュメントを表現する。
  • 複数のk-means分類器を多数決メカニズムと適応的重み付け方式を用いてアンサンブル化し、分類の信頼性を向上させる。
  • クラスタ出力を解釈するためにシードアセンブリ戦略を用い、グループ判断の精度と結果の解釈可能性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1教師なしで完全自動の感情分析手法が、ラベル付き学習データを一切必要とせずに競争力ある精度を達成できるか。
  • RQ2否定、強調語、対比の処理を含む文脈的分析が、感情分類におけるクラスタリング性能にどのように影響を与えるか。
  • RQ3複数の重み付け方式を用いたアンサンブル学習が、教師なし感情クラスタリングにおける安定性と一般化性能をどの程度向上させるか。
  • RQ4提案手法が、製品レビュー、航空会社、住宅建設業者など多様なドメインにおいて一貫した性能を維持できるか。
  • RQ5確率的でない重心初期化が、k-meansの感情クラスタリングにおける安定性と再現可能性にどのように影響を与えるか。

主な発見

  • ACACCEは、キッチン関連データセットにおいてベースライン手法を上回る高い精度を達成し、挑戦的なドメインでも優れた性能を示す。
  • 本手法は複数のデータセットで安定した性能を発揮し、確率的でない重心初期化のおかげで繰り返し実行時にも一貫した結果を示す。
  • 文脈的分析により、否定や強調語などの感情修飾子を正しく処理することで、クラスタリング精度が顕著に向上する。
  • 多様な重み付け方式を用いた分類器のアンサンブルは、特にドキュメント固有の重み付けよりもグローバル語句重み付けを用いることで、一般化性能が向上する。
  • SentWordNetを用いて特徴を正例、負例、中立例に事前クラスタリングすることで、k-meansの重心初期化が効果的かつ解釈可能になる。
  • 本手法は頑健でドメインに依存せず、ラベル付きデータに依存しないため、大規模かつリアルタイムの感情分析応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。