[論文レビュー] Measuring Offensive Speech in Online Political Discourse
本稿は、2015年1月から2017年1月までの1億6800万件のRedditコメントを用いて、オンライン政治的議論における不遜さを測定する攻撃的発言分類器を開発および評価する。2016年米国大統領選挙期間中に、政治的サブレdditでは攻撃的発言が著しく増加し、コメント全体のほぼ10%に達したが、非政治的サブレdditでは同様の傾向は認められず、オンライン政治的不遜さの増加が選挙キャンペーンに起因することを示している。
The Internet and online forums such as Reddit have become an increasingly popular medium for citizens to engage in political conversations. However, the online disinhibition effect resulting from the ability to use pseudonymous identities may manifest in the form of offensive speech, consequently making political discussions more aggressive and polarizing than they already are. Such environments may result in harassment and self-censorship from its targets. In this paper, we present preliminary results from a large-scale temporal measurement aimed at quantifying offensiveness in online political discussions. To enable our measurements, we develop and evaluate an offensive speech classifier. We then use this classifier to quantify and compare offensiveness in the political and general contexts. We perform our study using a database of over 168M Reddit comments made by over 7M pseudonyms between January 2015 and January 2017 -- a period covering several divisive political events including the 2016 US presidential elections.
研究の動機と目的
- 2016年米国大統領選挙期間中にオンライン政治的議論における攻撃的発言の増加を定量化すること。
- 高水準の政治的出来事の際、政治的議論が非政治的議論よりも攻撃的になるかどうかを調査すること。
- 選挙終了後も政治フォーラムにおける攻撃的発言が持続するかどうかを検討すること。
- 異なるオンラインコミュニティにおける攻撃的コメント投稿者の行動パターンを分析すること。
- 大規模な測定を可能にするために、複数のデータソースを用いたトレーニングデータを活用した強固な攻撃的発言分類器の開発および検証すること。
提案手法
- CrowdFlowerのハラスメント発言データセットを用いて、二値分類器をトレーニングし、'攻撃的'と'憎悪的'のラベルを統合して1つの攻撃的クラスにした。
- 外部の攻撃的語彙リスト2種類(Hatebase:1,122語、GoogleのWhat Do You Loveプロジェクト:422語)を補助特徴として統合した。
- トレーニング済み分類器を用いて、2015年1月から2017年1月までの1億6800万件のRedditコメントのサンプルに適用したが、短いコメント、削除済みコメント、および偽名でないコメントは除外した。
- 時間的分析を用いて、政治的および非政治的サブレddit間での攻撃的コメント率の推移を比較した。
- 攻撃的コメント投稿者がサブレddit間を移動する様子を追跡し、攻撃的投稿者の出所となるコミュニティを同定した。
- ホールドアウトテストセットを用いて、標準的な指標(適合率、再現率、F1スコア)で分類器の性能を評価し、攻撃的発言検出において信頼性の高い性能を達成した。
実験結果
リサーチクエスチョン
- RQ12016年米国大統領選挙キャンペーン中に、オンライン政治フォーラムにおける攻撃的発言の発生率は上昇したか?
- RQ2同じ期間に、政治的サブレdditにおける攻撃的発言の水準は非政治的サブレdditと比べてどの程度か?
- RQ3政治的議論における攻撃的発言は、非攻撃的コメントよりもコミュニティからのアップボートや関与度が高いか?
- RQ4攻撃的コメント投稿者は、特定のタイプのサブレddit(例:デフォルト型または候補者固有のもの)から政治フォーラムに移動する傾向が強いのか?
- RQ52016年選挙が終了した後も、政治的議論における攻撃的発言の水準は依然として高止まりしているか?
主な発見
- 2016年米国大統領選挙期間中、政治的サブレdditの全コメントのほぼ10%が攻撃的と分類され、不遜さの著しい増加を示した。
- 政治的サブレdditにおける攻撃的コメントは、非攻撃的コメントよりも高いアップボート数を記録しており、コミュニティの関与度が高かったことを示唆している。
- 選挙キャンペーンが激しくなるにつれ、政治的サブレdditにおける攻撃的コメントの割合は着実に増加したが、非政治的サブレdditでは同様の上昇傾向は観察されなかった。
- 2016年選挙から3か月後も、政治的サブレdditにおける攻撃的コメントの割合は著しく高い水準を維持しており、不遜さの持続的増加を示している。
- 多数の攻撃的コメント投稿者は、r/worldnews や r/askreddit、r/news などのデフォルト型サブレddit、および r/the_donald や r/sandersforpresident などの候補者固有サブレdditに由来していた。
- r/conspiracy や r/nfl、r/imgoingtohellforthis などのサブレdditも、攻撃的政治的コメント投稿者の主要な出所であり、不遜さのコミュニティ間移動を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。