[论文解读] Studying Politeness across Cultures Using English Twitter and Mandarin Weibo
本研究为英语推特和中文微博开发了跨语言的礼貌特征集 PoliteLex,并结合心理语言学词典对礼貌的文化差异进行建模。研究发现,在微博中,关注未来的语言、群体认同和感激表达更显礼貌,而中文中除敬语外的代词使用和禁忌话题则增加不礼貌程度,微博和推特的F1分数分别达到0.886和0.774。
Modeling politeness across cultures helps to improve intercultural communication by uncovering what is considered appropriate and polite. We study the linguistic features associated with politeness across US English and Mandarin Chinese. First, we annotate 5,300 Twitter posts from the US and 5,300 Sina Weibo posts from China for politeness scores. Next, we develop an English and Chinese politeness feature set, `PoliteLex'. Combining it with validated psycholinguistic dictionaries, we then study the correlations between linguistic features and perceived politeness across cultures. We find that on Mandarin Weibo, future-focusing conversations, identifying with a group affiliation, and gratitude are considered to be more polite than on English Twitter. Death-related taboo topics, lack of or poor choice of pronouns, and informal language are associated with higher impoliteness on Mandarin Weibo compared to English Twitter. Finally, we build language-based machine learning models to predict politeness with an F1 score of 0.886 on Mandarin Weibo and a 0.774 on English Twitter.
研究动机与目标
- 通过社交媒体中的自然语言探究跨文化礼貌表达的差异。
- 为英语和中文开发与文化相契合、语言特定的礼貌词典(PoliteLex)。
- 比较PoliteLex与现有心理语言学工具(如LIWC、EmoLex)在预测礼貌性方面的有效性。
- 利用真实世界微博数据,构建并评估跨文化礼貌预测的机器学习模型。
- 通过基于数据的洞察,为跨文化交流、机器翻译和社会媒体平台设计提供支持。
提出的方法
- 使用母语标注者对5,300条英语推特和5,300条中文微博进行礼貌评分标注。
- 设计PoliteLex,一种自定义礼貌词典,捕捉英语和中文中与(不)礼貌相关的文化特异性语言标记。
- 将PoliteLex与经过验证的心理语言学词典(LIWC、EmoLex)结合,构建混合特征集用于建模。
- 使用这些特征集在两个语料库上训练并评估多种机器学习模型(如逻辑回归、SVM)。
- 使用F1分数、精确率、召回率、ROCAUC和准确率评估跨平台的模型性能。
- 进行统计分析,识别在每种文化中与感知礼貌性显著相关的语言特征。
实验结果
研究问题
- RQ1在斯坦福礼貌语料库和社会媒体语料库中,心理语言学词典(包括PoliteLex)与斯坦福API相比,在预测(不)礼貌性方面表现如何?
- RQ2美式英语推特与中文微博中,与礼貌和不礼貌相关的关键语言特征是什么?
- RQ3沟通规范中的文化差异如何映射到这两种语言的(不)礼貌特定语言标记上?
- RQ4在某一平台训练的机器学习模型,在预测另一文化与语言背景下的礼貌性时,其泛化能力如何?
- RQ5情感效价、社会身份和禁忌话题在跨文化礼貌感知中起到何种作用?
主要发现
- LIWC与PoliteLex的组合在微博上达到最高F1分数0.802,在推特上达到0.772,优于单一词典和斯坦福API。
- PoliteLex单独使用在微博上达到F1分数0.801,在推特上达到0.771,显示出在跨语言礼貌建模中的强大性能。
- 在微博中,关注未来的语言、群体归属感以及感激表达与更高的礼貌评分显著相关。
- 在微博中,使用代词(不包括敬语)、与死亡相关的禁忌话题以及非正式语言与更高的不礼貌程度显著相关,而这些在英语推特中不明显。
- 在微博数据上训练的模型F1分数达到0.886,而推特模型为0.774,表明中文微博中礼貌性更具可预测性。
- PoliteLex有效捕捉了文化特异的礼貌标记,例如中文中对间接、群体导向表达的文化偏好,这些在英语中不那么显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。