Skip to main content
QUICK REVIEW

[論文レビュー] Learning Emoji Embeddings using Emoji Co-occurrence Network Graph

Anurag Illendula, Manish Reddy Yedulla|arXiv (Cornell University)|Jun 20, 2018
Sentiment Analysis and Opinion Mining参考文献 23被引用数 9
ひとこと要約

本稿では、1億4700万件の絵文字を含むツイートから構築した大規模な絵文字共起ネットワークを用いて、絵文字の埋め込み表現を学習する手法を提案する。ネットワーク埋め込みモデルを適用することで、低次元のベクトル表現を学習し、感情分析タスクで最先端の性能を達成するとともに、人間がアノテートした絵文字類似度と強い相関を示した。従来の手法に比べ、共起パターンを意味的・感情的類似度の代理指標として活用することで優れた性能を発揮した。

ABSTRACT

Usage of emoji in social media platforms has seen a rapid increase over the last few years. Majority of the social media posts are laden with emoji and users often use more than one emoji in a single social media post to express their emotions and to emphasize certain words in a message. Utilizing the emoji co-occurrence can be helpful to understand how emoji are used in social media posts and their meanings in the context of social media posts. In this paper, we investigate whether emoji co-occurrences can be used as a feature to learn emoji embeddings which can be used in many downstream applications such sentiment analysis and emotion identification in social media text. We utilize 147 million tweets which have emojis in them and build an emoji co-occurrence network. Then, we train a network embedding model to embed emojis into a low dimensional vector space. We evaluate our embeddings using sentiment analysis and emoji similarity experiments, and experimental results show that our embeddings outperform the current state-of-the-art results for sentiment analysis tasks.

研究の動機と目的

  • ソーシャルメディアにおける絵文字の共起パターンが、意味的な絵文字埋め込み表現を学習するための頑健な特徴として機能するかどうかを調査すること。
  • 感情分析などの下流NLPタスクにおける絵文字表現学習の課題を解決すること。
  • 現実世界のソーシャルメディアデータから得た大規模な絵文字共起グラフを学習対象とするスケーラブルなネットワーク埋め込みモデルの開発。
  • 感情分類および絵文字類似度タスクにおけるゴールドスタンダードベンチマークを用いて、学習済み埋め込み表現の有効性を評価すること。

提案手法

  • 1億4700万件の絵文字を含むツイートのコーパスから、同じツイート内に同時に出現する絵文字ペアを抽出することで、大規模な絵文字共起ネットワークを構築する。
  • ノード2ベクトル(node2vec)を具体的に適用し、共起グラフ内の構造的役割に基づいて絵文字の低次元ベクトル表現を学習する。
  • 直接共起(第一階層)と高階近接性(第二階層)の2種類の埋め込み表現を学習し、異なるレベルの意味的関係を捉える。
  • 学習済みの絵文字埋め込み表現を用いて、標準ベンチマークを用いて感情分類および絵文字類似度タスクの性能を評価する。
  • 本手法の性能を、EmojiNetからの意味的埋め込みを含む、既存の最先端の絵文字埋め込み手法と比較する。
  • スピアマンの順位相関係数を用いて、人間がアノテートしたゴールドスタンダードデータと照らし合わせ、絵文字類似度予測の品質を評価する。

実験結果

リサーチクエスチョン

  • RQ1ソーシャルメディア投稿における絵文字の共起は、意味的な埋め込み表現を学習するための信頼できるシグナルとして機能するか?
  • RQ2共起ネットワークからの埋め込み表現学習は、既存手法に比べ感情分析タスクの性能向上をもたらすか?
  • RQ3人間がアノテートした順位付けに基づく測定において、学習済み埋め込み表現は絵文字間の意味的類似度をどれほど適切に捉えているか?
  • RQ4第一階層と第二階層の近接性の相対的な貢献度は、絵文字の意味を捉える上でどのように異なるか?
  • RQ5EmojiNetからの外部知識を統合することで、共起ベースの埋め込みモデルの性能をさらに向上させられるか?

主な発見

  • 提案手法の絵文字埋め込み表現は、感情分類タスクで最先端の性能を達成し、現在のSOTA手法を上回った。
  • 第一階層埋め込み表現は、ゴールドスタンダードの絵文字類似度順位付けと74%のスピアマンの順位相関を示し、人間の認識と強い整合性を示した。
  • モデルが特定した類似度が最も高い絵文字ペアは(🔥, 💥)で、類似度スコアは0.921であった。これは、両者とも「強烈さ」や「興奮」を表現するのによく使われる共通の文脈を示している。
  • 第二階層埋め込み表現は66%の相関を達成し、高階近接性も意味的な関係を適切に捉えていることが示された。
  • モデルは文脈的・感情的類似性を的確に捉えており、(🔔, 🎉)が祝祭的文脈で共に使われるため類似度が高いと認識された。
  • 結果から、ツイート内での共起する絵文字はしばしば同じ感情を共有しており、共起は感情的・意味的類似度の強力な代理指標であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。