Skip to main content
QUICK REVIEW

[論文レビュー] Sharing emotions at scale: The Vent dataset

Nikolaos Lykousas, Constantinos Patsakis|arXiv (Cornell University)|Jan 15, 2019
Complex Network Analysis Techniques被引用数 4
ひとこと要約

本論文は、705種類の感情に細分化された63のカテゴリに分類された、100万人に近いユーザーが投稿した3300万件のユーザー生成テキストを含む、感情の詳細なラベルが付与された最大級の公開データセット「Ventデータセット」を紹介する。このデータセットは、感情の表現様式、時間的ダイナミクス、ソーシャルネットワーク構造のパターンを明らかにし、EmoLexなどの既存の感情語彙と強い整合性を示す自己報告感情ラベルを提供することで、感情計算分野における大規模研究を可能にする。

ABSTRACT

The continuous and increasing use of social media has enabled the expression of human thoughts, opinions, and everyday actions publicly at an unprecedented scale. We present the Vent dataset, the largest annotated dataset of text, emotions, and social connections to date. It comprises more than 33 millions of posts by nearly a million of users together with their social connections. Each post has an associated emotion. There are 705 different emotions, organized in 63 "emotion categories", forming a two-level taxonomy of affects. Our initial statistical analysis describes the global patterns of activity in the Vent platform, revealing large heterogenities and certain remarkable regularities regarding the use of the different emotions. We focus on the aggregated use of emotions, the temporal activity, and the social network of users, and outline possible methods to infer emotion networks based on the user activity. We also analyze the text and describe the affective landscape of Vent, finding agreements with existing (small scale) annotated corpus in terms of emotion categories and positive/negative valences. Finally, we discuss possible research questions that can be addressed from this unique dataset.

研究の動機と目的

  • 感情計算分野における大規模かつ高品質な感情ラベル付きデータセットの不足を解消すること。
  • ユーザー生成コンテンツにおける感情表現、時間的パターン、ソーシャルネットワークダイナミクスを研究する包括的リソースを提供すること。
  • 特にディープラーニングアプローチを想定した、高度な感情認識モデルの開発と評価を可能にすること。
  • 実際のユーザーデータを用いて、オンラインソーシャルネットワークにおける感情の同型性(ホモフィリー)とコンタギオンを調査すること。
  • 感情分析のベンチマークを、二値のセンチメントを超えて、人間の感情の全範囲を捉えるものに確立すること。

提案手法

  • Ventデータセットは、ユーザーが自発的に感情を共有し、事前に定義された705種類の感情ラベルから感情を割り当てる、Ventと呼ばれるソーシャルネットワーキングアプリから収集された。
  • 感情は63の感情カテゴリに分類される二段階の分類体系を採用しており、感情表現の階層的分析を可能にする。
  • テキストコンテンツはEmoLex語彙を用いて価値(valence)の分析が行われ、既存の感情リソースと比較可能である。
  • 統計的およびネットワーク解析を用いて、時間的活動パターン、感情の分布、ユーザー間の接続性を分析した。
  • データセットには、ユーザーのフォローリレーションシップや相互作用パターン(例:「ハグ」「同じ」「h4u」などの反応)を含むソーシャルグラフデータが含まれている。
  • 深層ニューラルネットワークベースのモデルが、本データセットのスケールと多様性を活用した感情認識のための手法的道筋として提案されている。

実験結果

リサーチクエスチョン

  • RQ1大規模なソーシャルメディアコンテンツにおいて、異なる感情カテゴリごとに感情表現はどのように変化するか?
  • RQ2ユーザーはどの程度、類似した感情を表現する人々とつながりを形成する(感情的同型性)か?
  • RQ3実際のユーザーデータを用いて、オンラインソーシャルネットワークにおける感情のコンタギオンを検出・モデル化できるか?
  • RQ4Ventの感情カテゴリの価値スコアは、EmoLexなどの既存の感情語彙と比較してどのように一致するか?
  • RQ5異なるユーザー集団や感情タイプにおいて、感情表現の時間的パターンと規則性は何か?

主な発見

  • Ventデータセットには、100万人に近いユーザーが投稿した3300万件の投稿が含まれており、705種類の異なる感情ラベルが63の感情カテゴリに分類され、感情の包括的な二段階分類体系を形成している。
  • 「幸せ」および「愛情」カテゴリの価値スコアの分布には明確な正の歪みが見られ、それらの肯定的価値感情と整合的である一方、他のカテゴリは主に否定的または中立的である。
  • Ventの感情カテゴリとEmoLexでアノテートされたコーパスとの間に強い一致が確認され、特に肯定的および否定的価値グループの整合性が顕著である。
  • 時間的分析から、ユーザー活動に顕著な不均一性が判明し、特定の感情が1日の中での時間帯や週の曜日ごとに明確な規則性を示している。
  • ソーシャルネットワーク構造には、感情的同型性の証拠が示されており、ユーザーは類似した感情を表現する人々を好んでフォローし、相互作用している。
  • 本データセットにより、感情のコンタギオンの研究が可能となり、ユーザー活動とネットワーク構造の両方のデータが利用可能であるため、感情がどのようにソーシャルリンクを通じて広がるかをモデル化できる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。