[論文レビュー] Studying Politeness across Cultures Using English Twitter and Mandarin Weibo
本研究は、英語のTwitterおよび中国語のWeiboを対象に、文化的に適合したポリテネス特徴セット「PoliteLex」を構築し、心理言語的辞書と組み合わせて、ポリテネスにおける文化的差をモデル化した。その結果、Weiboでは将来志向の言語、集団への帰属意識、感謝の表明がよりポリテックであるのに対し、中国語では敬語でない代名詞やタブーとされる話題が不躾を増すことが判明。F1スコアはWeiboで0.886、Twitterで0.774を達成した。
Modeling politeness across cultures helps to improve intercultural communication by uncovering what is considered appropriate and polite. We study the linguistic features associated with politeness across US English and Mandarin Chinese. First, we annotate 5,300 Twitter posts from the US and 5,300 Sina Weibo posts from China for politeness scores. Next, we develop an English and Chinese politeness feature set, `PoliteLex'. Combining it with validated psycholinguistic dictionaries, we then study the correlations between linguistic features and perceived politeness across cultures. We find that on Mandarin Weibo, future-focusing conversations, identifying with a group affiliation, and gratitude are considered to be more polite than on English Twitter. Death-related taboo topics, lack of or poor choice of pronouns, and informal language are associated with higher impoliteness on Mandarin Weibo compared to English Twitter. Finally, we build language-based machine learning models to predict politeness with an F1 score of 0.886 on Mandarin Weibo and a 0.774 on English Twitter.
研究の動機と目的
- ソーシャルメディアからの自然言語を用いて、文化的な違いによるポリテネス表現の違いを調査すること。
- 英語および中国語向けに文化的に適合した、言語特化型のポリテネス語彙(PoliteLex)を構築すること。
- PoliteLexと既存の心理言語的ツール(例:LIWC、EmoLex)の、ポリテネス予測における有効性を比較すること。
- 実世界のマイクロブログデータを用いて、文化的な違いを考慮したポリテネス予測のための機械学習モデルを構築・評価すること。
- データ駆動型の知見を通じて、文化的なコミュニケーション、機械翻訳、ソーシャルメディアプラットフォーム設計を支援すること。
提案手法
- ネイティブスピーカーのアノテーターを用いて、5,300件の英語のTwitter投稿および5,300件の中華語のWeibo投稿をポリテネススコアでアノテートした。
- 英語および中国語における(不)ポリテックな表現の文化的に特化した言語的マーカーを捉えるために、独自のポリテネス語彙「PoliteLex」を設計した。
- 検証済みの心理言語的辞書(LIWC、EmoLex)とPoliteLexを組み合わせ、モデル化のためのハイブリッド特徴セットを構築した。
- これらの特徴セットを用いて、両コーパスで複数の機械学習モデル(例:ロジスティック回帰、SVM)を訓練・評価した。
- F1スコア、適合率、再現率、ROCAUC、正答率を用いて、プラットフォームごとのモデル性能を評価した。
- 各文化における認識されたポリテネスと相関する顕著な言語的特徴を特定するために、統計的分析を実施した。
実験結果
リサーチクエスチョン
- RQ1Stanford Politeness Corpusおよびソーシャルメディアコーパスにおいて、LIWCやPoliteLexなどの心理言語的語彙は、Stanford APIと比較して(不)ポリテネスを予測する上でどのように異なるか?
- RQ2米国英語のTwitterと中国語のWeiboにおいて、ポリテネスおよび不躾に関連する主な言語的特徴は何か?
- RQ3これらの2言語における、コミュニケーションの文化的な違いが、(不)ポリテネスの具体的な言語的マーカーにどのように反映されるか?
- RQ41つのプラットフォームで訓練された機械学習モデルが、他の文化的・言語的文脈におけるポリテネス予測にどの程度一般化可能か?
- RQ5感情の正負、社会的アイデンティティ、タブーとされる話題は、文化的にポリテネスの認識にどのような役割を果たすか?
主な発見
- LIWCとPoliteLexの組み合わせが、WeiboでF1スコア0.802、Twitterで0.772を記録し、個別の語彙やStanford APIを上回った。
- PoliteLex単体でも、WeiboでF1スコア0.801、Twitterで0.771を達成し、文化的に異なる言語間のポリテネスモデリングにおいて優れた性能を示した。
- Weiboでは、将来志向の言語、集団への帰属意識、感謝の表明が、顕著に高いポリテネススコアと関連していた。
- Weiboでは、敬語でない代名詞、死に関連するタブーとされる話題、および非形式的な言語の使用が、英語のTwitterと比較して不躾を強く示唆した。
- Weiboデータで訓練されたモデルはF1スコア0.886を達成したのに対し、Twitterモデルは0.774を記録し、中国語のマイクロブログにおけるポリテネスの予測可能性がより高いことが示された。
- PoliteLexは、中国語において間接的で集団志向の表現が好まれるという文化的特徴を的確に捉えており、英語とは対照的にその特徴が顕著でないことを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。