Skip to main content
QUICK REVIEW

[论文解读] Learning Emoji Embeddings using Emoji Co-occurrence Network Graph

Anurag Illendula, Manish Reddy Yedulla|arXiv (Cornell University)|Jun 20, 2018
Sentiment Analysis and Opinion Mining参考文献 23被引用 9
一句话总结

本文通过从1.47亿条含表情符号的推文中构建大规模的表情符号共现网络,并应用网络嵌入模型来学习低维向量表示,提出了一种学习表情符号嵌入的方法。该方法在情感分析任务中达到最先进性能,并与人工标注的表情符号相似度表现出强相关性,通过利用共现模式作为语义和情感相似性的代理,优于先前的方法。

ABSTRACT

Usage of emoji in social media platforms has seen a rapid increase over the last few years. Majority of the social media posts are laden with emoji and users often use more than one emoji in a single social media post to express their emotions and to emphasize certain words in a message. Utilizing the emoji co-occurrence can be helpful to understand how emoji are used in social media posts and their meanings in the context of social media posts. In this paper, we investigate whether emoji co-occurrences can be used as a feature to learn emoji embeddings which can be used in many downstream applications such sentiment analysis and emotion identification in social media text. We utilize 147 million tweets which have emojis in them and build an emoji co-occurrence network. Then, we train a network embedding model to embed emojis into a low dimensional vector space. We evaluate our embeddings using sentiment analysis and emoji similarity experiments, and experimental results show that our embeddings outperform the current state-of-the-art results for sentiment analysis tasks.

研究动机与目标

  • 探究社交媒体中表情符号共现模式是否可作为学习有意义表情符号嵌入的稳健特征。
  • 解决提升表情符号表示学习以用于下游自然语言处理任务(如情感分析和表情符号相似度)的挑战。
  • 开发一种基于真实社交媒体数据构建的大规模表情符号共现图训练的可扩展网络嵌入模型。
  • 在情感分类和表情符号相似度的金标准基准上评估所学嵌入的有效性。

提出的方法

  • 从包含1.47亿条表情符号的推文语料中提取同时出现在同一则推文中的所有表情符号对,构建大规模的表情符号共现网络。
  • 应用网络嵌入模型(具体为node2vec)基于表情符号在共现图中的结构角色学习其低维向量表示。
  • 训练两种类型的嵌入:一阶(直接共现)和二阶(高阶接近性),以捕捉不同层次的语义关系。
  • 使用所学的表情符号嵌入在标准基准上评估情感分类和表情符号相似度任务的性能。
  • 将所提嵌入方法与现有最先进表情符号嵌入方法(包括EmojiNet的语义嵌入)进行性能比较。
  • 利用斯皮尔曼等级相关系数评估表情符号相似度预测质量与人工标注的金标准数据的一致性。

实验结果

研究问题

  • RQ1社交媒体帖子中的表情符号共现能否作为学习有意义表情符号表示的可靠信号?
  • RQ2从共现网络学习表情符号嵌入是否能提升情感分析任务的性能,优于现有方法?
  • RQ3所学嵌入在人类标注的排名中,对表情符号语义相似度的捕捉能力如何?
  • RQ4一阶与二阶接近性在捕捉表情符号语义方面各自贡献如何?
  • RQ5结合EmojiNet的外部知识是否能进一步提升基于共现的嵌入模型性能?

主要发现

  • 所提出的表情符号嵌入在情感分析任务中达到最先进性能,优于当前SOTA方法。
  • 一阶嵌入与金标准表情符号相似度排名的斯皮尔曼等级相关系数达到74%,表明与人类感知高度一致。
  • 模型识别出的最相似表情符号对为(🔥, 💥),相似度得分为0.921,反映出二者在表达强度或兴奋感方面的共用。
  • 二阶嵌入的相关系数达到66%,表明高阶接近性也能捕捉到有意义的语义关系。
  • 该模型成功捕捉了语境和情感上的相似性,例如(🔔, 🎉)因在庆祝场景中共同使用而被识别为相似。
  • 结果表明,推文中共现的表情符号通常具有相同的情感倾向,使共现成为情感和语义相似性的有力代理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。