Skip to main content
QUICK REVIEW

[论文解读] :telephone::person::sailboat::whale::okhand:; or "Call me Ishmael" - How do you translate emoji?

Will Radford, Andrew M. Chisholm|arXiv (Cornell University)|Nov 7, 2016
Digital Communication and Language参考文献 11被引用 3
一句话总结

本文利用自然语言处理技术(如统计词对齐和词性标注)分析了《白鲸记》的群智翻译作品《Emoji Dick》,研究表情符号作为通信系统的功能。研究发现,表情符号偏重名词和动词,重复率高,尽管词汇多样性低,仍能保留语义内容,表明表情符号在受限语境下可能像简化版的皮钦语一样运作。

ABSTRACT

We report on an exploratory analysis of Emoji Dick, a project that leverages crowdsourcing to translate Melville's Moby Dick into emoji. This distinctive use of emoji removes textual context, and leads to a varying translation quality. In this paper, we use statistical word alignment and part-of-speech tagging to explore how people use emoji. Despite these simple methods, we observed differences in token and part-of-speech distributions. Experiments also suggest that semantics are preserved in the translation, and repetition is more common in emoji.

研究动机与目标

  • 探究表情符号在高风险、无上下文的文学翻译任务中如何被使用。
  • 检验表情符号在翻译复杂文学文本时是否能保留语义内容。
  • 比较表情符号与文本语料的统计特性,重点关注分布、重复率及词性对齐。
  • 探讨表情符号是否通过词性分布与对齐模式表现出与皮钦语言的结构相似性。

提出的方法

  • 使用IBM Model 1对英文词元与表情符号进行统计词对齐,训练数据包含9,734对对齐的句子。
  • 对文本与表情符号均进行词性标注,以分析词性角色的分布,重点关注NN(名词)、VB(动词)及其他词性。
  • 计算频率分布并绘制秩频图(log-counts vs. rank),以比较词汇多样性和齐普夫特性。
  • 通过二元组分析测量表情符号的重复率,比较表情符号与文本语料中的重复频率。
  • 过滤停用词与标点符号,使用NLTK的默认分词器与词性标注器进行文本预处理。
  • 通过排名最高概率的表情符号-词元对齐结果并分析特定词性的概率,评估对齐置信度。

实验结果

研究问题

  • RQ1在高对比度、无上下文的语境下,表情符号的分布与频率如何与自然语言相比较?
  • RQ2在复杂文学文本的表情符号翻译中,语义内容在多大程度上得以保留?
  • RQ3表情符号是否表现出类似皮钦语言的句法模式,特别是在词性分布方面?
  • RQ4重复在表情符号交流中扮演何种角色,其作用与自然语言有何不同?

主要发现

  • 表情符号语料的词汇多样性显著较低,仅有470种独特的表情符号,而文本语料中为16,454种。
  • 表情符号句子的长度约为文本句子的一半,平均每句含9.4个表情符号词元,而文本句子为20.8个词元。
  • 最常用的表情符号与人物(如 🧍‍♂️)、鲸鱼(如 🐋)和动作(如 🛶)相关,且与名词和动词有强烈对齐。
  • 表情符号的重复二元组比例为3.2%,远高于文本语料的0.4%,表明重复被系统性地用作语言手段。
  • 词性分布分析显示,70%的高概率表情符号对齐对应名词(NN),56%对应动词(VB),表明其具有强烈的句法角色。
  • 尽管存在较高噪声与主观性,对齐模型仍识别出一致的映射关系——例如 🐋与'whale'、'sperm'和'whales'的强关联,表明其共享语义指代。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。