[論文レビュー] How COVID-19 Is Changing Our Language : Detecting Semantic Shift in Twitter Word Embeddings
本研究は、回転マッピングを用いたアライメントによる月次単位の単語埋め込みの訓練を通じて、初期の新型コロナウイルスパンデミック期におけるツイッター言語の意味的シフトを検出する。顕著な意味的変化が確認され、特にパンデミック前後における言語に顕著である。また、パンデミック関連ツイートにおける頻度が高い語ほど意味的シフトにかかりやすいという新しい法則を同定する。
Words are malleable objects, influenced by events that are reflected in written texts. Situated in the global outbreak of COVID-19, our research aims at detecting semantic shifts in social media language triggered by the health crisis. With COVID-19 related big data extracted from Twitter, we train separate word embedding models for different time periods after the outbreak. We employ an alignment-based approach to compare these embeddings with a general-purpose Twitter embedding unrelated to COVID-19. We also compare our trained embeddings among them to observe diachronic evolution. Carrying out case studies on a set of words chosen by topic detection, we verify that our alignment approach is valid. Finally, we quantify the size of global semantic shift by a stability measure based on back-and-forth rotational alignment.
研究の動機と目的
- グローバルな新型コロナウイルスパンデミックによって引き起こされたソーシャルメディア言語における意味的シフトを検出し、定量化すること。
- 分布的意味論と単語埋め込みを用いて、パンデミックが時間経過とともに語の意味に与えた影響を調査すること。
- 異なる時間帯における単語埋め込みを比較するためのアライメントベースの手法の有効性を検証すること。
- ハミルトンら(2016)の「適合の法則」を含む、既存の意味的変化の法則が危機的要因による言語進化の過程でも成り立つかどうかを検証すること。
- パンデミック固有の言語における頻度と安定性の相関関係を分析することで、意味的シフトの新たなパターンを発見すること。
提案手法
- ツイッターから3か月分の新型コロナウイルス関連ツイートを収集・処理し、月単位のバッチに分割した。
- 2020年4月、5月、6月の各月について、分布的意味論を用いて個別の単語埋め込みモデルを訓練した。
- 比較のため、パンデミック以前の一般用途のツイッター単語埋め込みモデルを事前に訓練した。
- 時間的・コーパス的差異を補うために、最適な線形変換に基づく回転アライメント法を用いて埋め込み空間をアライメントした。
- アライメントのためのアンカーポイントとして、最も頻度の高い1000語を用い、ハミルトンら(2016)の「適合の法則」を活用した。
- 意味的安定性を、前後方向の回転アライメント測定法を用いて定量化した。
実験結果
リサーチクエスチョン
- RQ1新型コロナウイルスパンデミックは、ツイッター言語における意味的シフトをどの程度引き起こしたか?
- RQ2パンデミック初期段階(2020年4月〜6月)において、意味的シフトはどのように時間経過とともに変化したか?
- RQ3「適合の法則」のような既存の意味的変化の法則は、危機的要因による言語的シフトの過程でも成り立つか?
- RQ4イベント固有コーパスにおける語の頻度と意味的安定性・変化の間には、新たなパターンが存在するか?
- RQ5クロスコーパス(パンデミック前 vs. パンデミック後)と縦断的(月次)比較において、安定性分布はどのように異なるか?
主な発見
- パンデミック前とパンデミック後の埋め込み間の安定性分布は、0に偏って右に裾を引かせた形状を示し、顕著なクロスコーパス的意味的シフトが確認された。
- 4月から6月にかけての縦断的安定性分布は、およそ平均0.4の正規分布に近く、時間経過に伴う連続的だが、それほど顕著ではないシフトを示した。
- パンデミック以前の語の頻度に関して、「適合の法則」が成り立っていた:頻度が低い語ほど安定性が高かった。これは先行研究と整合的である。
- 意味的変化の新しい法則が同定された:パンデミック固有のデータセットで頻度が高い語ほど、意味的シフトが顕著であった。これは、パンデミック後の頻度と安定性の間で負の相関関係があることを示唆している。
- 事例研究により、「隔離」「ヒーロー」「差別」「AI」などの語が顕著な意味的シフトを経験したことが確認された。特に「差別」は4月にアジア系差別感情と関連づけられる傾向が顕著に上昇した。
- アライメント手法は有効であった。事例研究の語とその意味的近傍語の類似性トレンドが、時間経過に伴い一貫して維持された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。