Skip to main content
QUICK REVIEW

[论文解读] Predict Emoji Combination with Retrieval Strategy

Weitsung Lin, Ting-Hsuan Chao|arXiv (Cornell University)|Aug 21, 2019
Natural Language Processing Techniques参考文献 8被引用 5
一句话总结

本文提出一种基于检索的策略,用于从文本语境中预测多emoji组合,将emoji序列视为语言中的短语。通过利用微调的BERT模型预测emoji概率,并基于频率和顺序对预先挖掘的emoji组合进行排序,该方法将F1分数从0.141提升至0.204,显著优于朴素和贪婪基线方法。

ABSTRACT

As emojis are widely used in social media, people not only use an emoji to express their emotions or mention things but also extend its usage to represent complicate emotions, concepts or activities by combining multiple emojis. In this work, we study how emoji combination, a consecutive emoji sequence, is used like a new language. We propose a novel algorithm called Retrieval Strategy to predict what emoji combination follows given a short text as context. Our algorithm treats emoji combinations as phrase in language, ranking sets of emoji combinations like retrieving words from dictionary. We show that our algorithm largely improves the F1 score from 0.141 to 0.204 on emoji combination prediction task.

研究动机与目标

  • 解决在社交媒体文本中预测有意义的emoji组合而非单个emoji的挑战。
  • 将emoji组合建模为语言短语,捕捉超越单个emoji使用的语义和结构意义。
  • 通过减少对贪婪或top-k选择策略的依赖,提升多emoji序列的预测性能。
  • 开发一种基于检索的方法,利用频率和顺序对现有emoji组合进行排序,以增强相关性和多样性。
  • 通过可学习的惩罚机制,在emoji组合预测中实现更高的精确率与召回率之间的平衡。

提出的方法

  • 在1000万条基于美国的英文推文(含emoji)上微调基于BERT的模型,使用掩码语言建模和字符级嵌入以处理未登录词和拼写错误。
  • 通过一元语言模型近似条件概率:P(Y|W) ≈ ∏P(y_i|W),实现对一至三个emoji序列的高效计算。
  • 应用基于检索的策略,根据其频率和顺序对训练数据中预先挖掘的emoji组合进行排序,将每个组合视为语言中的短语。
  • 使用加权得分对每个候选emoji组合进行评分:S = log(频率) - λ × (emoji数量),其中λ为控制精确率与召回率平衡的惩罚超参数。
  • 在检索得分中引入惩罚项,以抑制过短或过长的组合,通过偏好平衡预测来提升F1分数。
  • 使用交叉熵损失在500个emoji类别上训练emoji预测模型,采用更小的网络结构(L=10, H=256, A=4)以提升计算效率。

实验结果

研究问题

  • RQ1如何将emoji组合建模为语言短语,以实现超越单个emoji输出的预测改进?
  • RQ2与直接基于概率的选择相比,基于检索的排序对预测emoji组合质量有何影响?
  • RQ3一种能平衡精确率与召回率的惩罚机制是否能提升多emoji预测任务中的F1分数?
  • RQ4使用Twitter特定的预训练BERT模型对emoji组合预测性能有何影响?
  • RQ5emoji序列的频率和顺序在有意义的组合预测中起到多大作用?

主要发现

  • 检索策略将F1分数从基线方法的0.141(朴素Top-3)提升至0.204,显著提升了性能。
  • 当惩罚超参数为0.3时,检索策略达到最高的F1分数23.6,表明精确率与召回率达到了最佳平衡。
  • 通过利用训练语料库中的真实使用模式,检索方法生成了更多有意义的emoji组合,包括罕见emoji。
  • 采用不同阈值的贪婪Top-3策略F1分数较低(18.1–18.5),表明其在建模语义顺序方面存在局限。
  • 模型使用Twitter特定的预训练和字符级嵌入,增强了对推文中未登录词和非正式语言的鲁棒性。
  • 检索策略在所有评估指标上均优于所有基线方法,证明其在捕捉复杂emoji语义方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。