Skip to main content
QUICK REVIEW

[論文レビュー] Entity-Specific Sentiment Classification of Yahoo News Comments

Prakhar Biyani, Cornelia Caragea|arXiv (Cornell University)|Jun 11, 2015
Sentiment Analysis and Opinion Mining参考文献 21被引用数 3
ひとこと要約

本稿は、Yahooニュースのコメントにおけるエンティティ固有のセンチメント分類のための2段階的手法を提案する。文脈に配慮したエンティティ抽出と、エンティティの種別や文法的役割といった新しい非語彙的特徴(例:エンティティタイプ、文法的役割)を用いることで、センチメント検出の精度を向上させる。この手法は強力なベースラインを上回り、センチメント極性分類においてF-1スコア0.700を達成した。特にIsPersonおよびIsSubjObj特徴が最も有用であることが示された。

ABSTRACT

Sentiment classification is widely used for product reviews and in online social media such as forums, Twitter, and blogs. However, the problem of classifying the sentiment of user comments on news sites has not been addressed yet. News sites cover a wide range of domains including politics, sports, technology, and entertainment, in contrast to other online social sites such as forums and review sites, which are specific to a particular domain. A user associated with a news site is likely to post comments on diverse topics (e.g., politics, smartphones, and sports) or diverse entities (e.g., Obama, iPhone, or Google). Classifying the sentiment of users tied to various entities may help obtain a holistic view of their personality, which could be useful in applications such as online advertising, content personalization, and political campaign planning. In this paper, we formulate the problem of entity-specific sentiment classification of comments posted on news articles in Yahoo News and propose novel features that are specific to news comments. Experimental results show that our models outperform state-of-the-art baselines.

研究の動機と目的

  • Yahooニュースのようなマルチドメインのニュースプラットフォームにおけるユーザーのコメントのセンチメント分析の分野において、センチメントが特定のエンティティに結びついているが、固定されたターゲットではないというギャップを埋める。
  • コメント分類において、関係のないエンティティや、皮肉や修辞的疑問文といった暗黙のセンチメント(例:皮肉、反語的疑問)といった課題を克服する。
  • センチメント検出の向上を図るため、エンティティタイプ(人物/非人物)や文法的役割(主語/目的語)といった新しい非語彙的特徴を設計・評価する。
  • コメント内に関連するエンティティを特定し、センチメント表現に関係のないエンティティを除外する文脈抽出アルゴリズムを開発する。
  • コメント固有の特徴(例:センチメント強度、疑問符の有無)が極性分類性能をさらに向上させることを実証する。

提案手法

  • 2段階分類パイプラインを用いる:まずセンチメントに関連するエンティティを特定し、その後そのエンティティに対するセンチメント極性を分類する。
  • 文脈抽出アルゴリズムにより、コメント内のエンティティとその周辺文脈を特定することで、特徴の関連性を高め、関係のないエンティティによるノイズを低減する。
  • エンティティが人物かどうか(IsPerson)や、主語または目的語かどうか(IsSubjObj)といった非語彙的特徴を導入し、文法的・意味的役割を捉える。
  • コメント固有の特徴(例:NumNeg(否定語の数)、PosVsNeg(肯定語と否定語の比)、IsQuesMark(疑問符の有無))を用いて、センチメント強度や修辞的手がかりをモデル化する。
  • ボック・オブ・ワーズ(BoW)特徴、品詞(POS)タグ、センチメントリソーススコア(SentiStrength)を組み合わせることで、極性分類の精度を向上させる。
  • 情報ゲイン(IG)を用いて特徴の重要度を評価した結果、IsPersonおよびIsSubjObjが最も情報量が多く、語彙ベースの特徴(例:HasCluesやSentiStrength)を上回ることが判明した。

実験結果

リサーチクエスチョン

  • RQ1文脈に配慮したエンティティ抽出は、ニュースコメントにおけるセンチメント関連エンティティの特定を向上させるか?
  • RQ2エンティティタイプや文法的役割といった非語彙的特徴は、関連するエンティティと関係のないエンティティを区別するのにどの程度有効か?
  • RQ3コメント固有の特徴(例:センチメント強度、疑問符の有無)は、従来の語彙的特徴やPOS特徴を上回って極性分類性能を向上させるか?
  • RQ4暗黙のセンチメント表現(例:皮肉、修辞的疑問)はセンチメント分類にどのような影響を及ぼすか?また、モデルはそれらを効果的に検出できるか?
  • RQ5さまざまな特徴の相対的な寄与度は何か?特に、どの特徴が最も情報量が多いか?

主な発見

  • 提案手法は、センチメント極性分類においてF-1スコア0.700を達成し、SentiStrength(特徴ベース)を含むすべてのベースライン(F-1 = 0.674)を顕著に上回った。
  • IsPerson特徴を除外するとF-1スコアは0.574に低下し、これはIsPersonが最も情報量の多い特徴であることを示しており、次にIsSubjObj(F-1 = 0.636)が続く。
  • 情報ゲインによる特徴順位付けにより、IsPerson > IsSubjObj > SentiNeg > HasClues > SentiPos と確認され、語彙的特徴よりも非語彙的特徴のほうが情報量が多いことが示された。
  • コメント固有特徴(CSF)を追加することで、F-1スコアは0.687から0.700に向上し、修辞的およびセンチメント強度の手がかりを捉える価値があることが示された。
  • NaiveContextExtractionより性能が優れており、F-1 = 0.491にとどまるため、正確な文脈抽出の重要性が裏付けられた。
  • 皮肉や修辞的疑問文を含む例においても、モデルは高い性能を示しており、従来のモデルが失敗する状況でもモデルの性能が安定していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。