Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid Approaches to Detect Comments Violating Macro Norms on Reddit

Eshwar Chandrasekharan, Éric Gilbert|arXiv (Cornell University)|Apr 7, 2019
Hate Speech and Cyberbullying Detection被引用数 10
ひとこと要約

本論文では、分類、トピックモデリング、オープンコーディングを組み合わせることで、モデレータによって削除された40,000件のRedditコメントを8つの広く遵守されているマクロ規範(いじめ、スパム、自己宣伝など)に識別・ラベル付けするハイブリッド手法を提示する。主な貢献は、200万件以上の削除済みコメントと詳細な規範違反ラベルを含む公開データセットの提供であり、オンラインモデレーションのためのより洗練された機械学習モデルの開発を可能にする。

ABSTRACT

In this dataset paper, we present a three-stage process to collect Reddit comments that are removed comments by moderators of several subreddits, for violating subreddit rules and guidelines. Other than the fact that these comments were flagged by moderators for violating community norms, we do not have any other information regarding the nature of the violations. Through this procedure, we collect over 2M comments removed by moderators of 100 different Reddit communities, and publicly release the data. Working with this dataset of removed comments, we identify 8 macro norms---norms that are widely enforced on most parts of Reddit. We extract these macro norms by employing a hybrid approach---classification, topic modeling, and open-coding---on comments identified to be norm violations within at least 85 out of the 100 study subreddits. Finally, we label over 40K Reddit comments removed by moderators according to the specific type of macro norm being violated, and make this dataset publicly available. By breaking down a collection of removed comments into more granular types of macro norm violation, our dataset can be used to train more nuanced machine learning classifiers for online moderation.

研究の動機と目的

  • モデレータによってコミュニティ規範に違反して削除されたRedditコメントのスケールの大きなデータセットを収集・公開すること。
  • 分類、トピックモデリング、および手動コーディングを組み合わせたハイブリッドアプローチを用いて、Redditのサブレディット間で広く遵守されているマクロ規範を同定すること。
  • 40,000件を超える削除済みコメントに、具体的な規範違反の種別をラベル付けすることで、オンラインモデレーションのためのより洗練された機械学習分類器のトレーニングを支援すること。
  • オンラインコミュニティにおける規範違反の状況を理解するためのスケーラブルで計算可能なフレームワークを提供すること。
  • 詳細な文脈に配慮した削除コンテンツのラベル付けを提供することで、今後の混合意思決定モデレーションツールに関する研究を可能にすること。

提案手法

  • r/allに投稿されたすべてのコメントを収集するためのRedditストリーミングAPIを用いた3段階のデータ収集プロセスを実施し、モデレータの対応を許容するため24時間の遅延を設けた。
  • 各サブレディットから削除されたコメントを同定するため、100のサブレディット固有のバイナリ分類器をトレーニングし、平均F1スコアは71.4%を達成した。
  • マクロ規範違反コメントから10の潜在的トピックを抽出するためにトピックモデリングを適用し、その後オープンコーディングを用いて各トピックを特定のマクロ規範に割り当てた。
  • コメントの適合度に基づいて、最も適したトピックにラベルを割り当て、信頼性の低い割り当てを低減するため、各トピックの上位5,000件のコメントを優先してラベル付けした。
  • 自動分類、非監督的トピックモデリング、および手動検証を組み合わせたハイブリッドパイプラインを用いることで、ラベルの信頼性とスケーラビリティを確保した。
  • 研究利用を目的として、200万件の削除済みコメントと40,000件のラベル付き規範違反を含む完全なデータセットを、公開用DOIを通じてリリースした。

実験結果

リサーチクエスチョン

  • RQ1Redditコミュニティ全体にわたり、最も広く遵守されているマクロ規範は何か。また、これらを大規模に体系的に同定するにはどうすればよいか?
  • RQ2分類、トピックモデリング、オープンコーディングを組み合わせたハイブリッドアプローチを、大規模で計算可能な方法で規範違反をラベル付けするためにどのように活用できるか?
  • RQ3自動ラベル付けされた削除コメントが、人間のモデレータが意図した実際の規範違反をどの程度反映しているか?
  • RQ4異なるサブレディットにおいて、同定されたマクロ規範は、違反の頻度や種別においてどのように比較できるか?
  • RQ5オンラインコミュニティにおける削除コンテンツの自動ラベル付けに際して、どのような制限やリスクが存在するか?

主な発見

  • 本研究では、いじめ、自己宣伝、スパム、いじめなど8つの広く遵守されているマクロ規範を同定した。これらは多様なサブレディットにおいて一貫して適用されている。
  • 削除されたコメントを同定するためのサブレディット分類器は、平均10分割交差検証F1スコア71.4%を達成し、大規模データ収集において中程度ではあるが受け入れ可能な性能を示した。
  • トピックモデリングにより、規範違反コメントの次元を圧縮でき、その後オープンコーディングを用いて10の潜在的トピックを同定し、マクロ規範にマッピングした。
  • 適合度の高いトピックに基づき、各トピックの上位5,000件のコメントを選別することで、誤検出を低減し、規範違反の高信頼ラベル付けを実現した。
  • 最終的なデータセットには200万件を超える削除済みコメントと、40,000件の特定のマクロ規範違反ラベルが含まれており、すべて研究目的で公開された。
  • このデータセットにより、オンラインモデレーションのためのより洗練された機械学習モデルのトレーニングが可能となり、コミュニティが一般的なバイナリ分類器に依存するのではなく、特定の違反タイプに焦点を当てた対応が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。