[論文レビュー] Finding Social Media Trolls: Dynamic Keyword Selection Methods for Rapidly-Evolving Online Debates
本稿では、GloVe埋め込みを用いて、#MeToo運動のような急速に変化するソーシャルメディアの議論における進化するオンラインいじめやトロール行為を検出する動的キーワード選択手法を提案する。シードキーワードのGloVe埋め込みを活用することで、意味的に関連する新規キーワードを同定し、ドメイン固有の言語的差異を検出可能となる。これにより、Twitter や Reddit などのプラットフォームにおける嫌がらせ発言や攻撃的コンテンツの監視が、より効果的かつ適応的に行えるようになる。
Online harassment is a significant social problem. Prevention of online harassment requires rapid detection of harassing, offensive, and negative social media posts. In this paper, we propose the use of word embedding models to identify offensive and harassing social media messages in two aspects: detecting fast-changing topics for more effective data collection and representing word semantics in different domains. We demonstrate with preliminary results that using the GloVe (Global Vectors for Word Representation) model facilitates the discovery of new and relevant keywords to use for data collection and trolling detection. Our paper concludes with a discussion of a research agenda to further develop and test word embedding models for identification of social media harassment and trolling.
研究の動機と目的
- 嫌がらせやトロール行為を含む急速に変化するオンライン議論を捉えるために、静的キーワード検索の限界を克服すること。
- 手動ラベル付けへの依存を減らし、攻撃的コンテンツを分析する際の倫理的懸念を回避する透明性があり、準自動化された動的キーワード発見手法を開発すること。
- 意味的シフトやプラットフォーム(Twitter や Reddit など)におけるドメイン固有の用語を捉える単語埋め込みを活用することで、攻撃的言語の検出を向上させること。
- 研究者が、用語の変化を事前に把握していない状態でも、新しい関連キーワードを同定することで、リアルタイムで進化する議論を追跡できるようにすること。
- 将来的なネットワークベースの感情分析や相互作用パターンの分析の基盤を築くこと。これにより、オンラインコミュニティにおける支援的行動と攻撃的行動を区別できるようになる。
提案手法
- ソーシャルメディアのテキストにおける語の意味的関係を表現するために、事前学習済みの GloVe 単語埋め込みを用いる。
- コサイン類似度と K-means クラスタリングを適用し、シードキーワード群(例:'MeToo'、'survivor'、'harassment')から意味的に関連するキーワードを同定する。
- 異なるコミュニティ(例:Twitter の #MeToo と Reddit の Red Pill サブレディット)のデータを用いてドメイン固有の単語埋め込みを学習し、'female' や 'male' といった語の意味的表現の対照を捉える。
- シード語との類似度の高い語を用いて、語彙的マッチのみに依存しない意味的関連性に基づいた動的キーワードリスト拡張を実施する。
- Wikipedia、Gigaword5、Twitter の #MeToo、Reddit の Red Pill といった異なるドメインの埋め込みを比較することで、ジェンダーとパワーがどのように概念的にフレームされているかを検出する。
- 意味的類似度とクラスタリングを用いて新しい候補をランク付けするパイプラインを構築し、キーワード爆発を回避するための体系的なランク付けを計画して、継続的なキーワード拡張を可能にする。
実験結果
リサーチクエスチョン
- RQ1単語埋め込みモデルは、#MeToo運動のような急速に進化するオンライン議論において、新たな関連キーワードを効果的に同定できるか?
- RQ2Twitter や Red Pill サブレディットといった異なるオンラインコミュニティにおいて、'female' や 'male' といったキーワードの意味的表現はどのように異なるか?
- RQ3埋め込みを用いた動的キーワード選択は、静的キーワード手法に比べて、進化するトロール行為や嫌がらせ発言の検出においてどの程度優れているか?
- RQ4ドメイン固有の単語埋め込みは、差別的・敵対的コミュニティとマイノリティコミュニティがオンラインディスコースにおいてジェンダーやパワーをどのように構造的にフレームしているかを明らかにできるか?
- RQ5半自動的で透明性のあるキーワード発見手法は、人為的ラベル付けへの依存を減らしつつ、攻撃的コンテンツの検出精度を維持できるか?
主な発見
- Twitter の #MeToo データで学習した単語埋め込みは、元のシードセットに含まれていなかった意味的に関連するキーワード(例:'survivor'、'harassment'、'abuse'、'support')を効果的に同定した。
- K-means クラスタリングにより、'Epstein' を中心とするクラスタと、'Kavanaugh' を中心とするクラスタが明確に分離され、#MeToo運動中の議論トピックの進化を反映していた。
- ドメイン固有の埋め込みでは顕著な意味的差が観察された。Red Pill サブレディットでは 'female' は 'plight'、'negative'、'sexual' と関連づけられていたが、#MeToo では 'survivor'、'victim'、'abuse' と関連づけられていた。
- Red Pill サブレディットの埋め込みでは、'male' が 'alpha'、'beta'、'physical'、'emotional' と関連づけられ、中立的または #MeToo のコーパスとは対照的な特異なイデオロギー的・言語的構造を示していた。
- Wikipedia や Gigaword5 の事前学習済み埋め込みは有用なベースラインを提供し、コミュニティ固有の埋め込みと比較してより中立的かつ一般的な意味的関連性を示していた。
- 本手法は、以前に観察されていなかったキーワードや言語的パターンを同定する可能性を示しており、オンラインいじめのスケーラブルで適応可能な監視に強い潜在的価値を有している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。