Skip to main content
QUICK REVIEW

[論文レビュー] Toxicity in the Decentralized Web and the Potential for Model Sharing

Haris Bin Zia, Aravindh. Raman|arXiv (Cornell University)|Apr 27, 2022
Advanced Malware Detection Techniques被引用数 8
ひとこと要約

本稿では、分散型ウェブ(DW)における有害コンテンツ検出のための分散型モデル共有システム、ModPairを提案する。Pleromaインスタンスが事前学習済みモデルを共有することで協働的にモデレーションを改善できる。990万件のトゥートを含むデータセットを用いて、有害コンテンツが全トゥートの12.15%を占め、かつインスタンス間を迅速に拡散することを示した。ModPairは、インスタンスがモデルを共有しアンサンブル投票を実施することで、マクロ-F1スコア0.89を達成し、手動モデレーションの負担を顕著に軽減した。

ABSTRACT

The "Decentralised Web" (DW) is an evolving concept, which encompasses technologies aimed at providing greater transparency and openness on the web. The DW relies on independent servers (aka instances) that mesh together in a peer-to-peer fashion to deliver a range of services (e.g. micro-blogs, image sharing, video streaming). However, toxic content moderation in this decentralised context is challenging. This is because there is no central entity that can define toxicity, nor a large central pool of data that can be used to build universal classifiers. It is therefore unsurprising that there have been several high-profile cases of the DW being misused to coordinate and disseminate harmful material. Using a dataset of 9.9M posts from 117K users on Pleroma (a popular DW microblogging service), we quantify the presence of toxic content. We find that toxic content is prevalent and spreads rapidly between instances. We show that automating per-instance content moderation is challenging due to the lack of sufficient training data available and the effort required in labelling. We therefore propose and evaluate ModPair, a model sharing system that effectively detects toxic content, gaining an average per-instance macro-F1 score 0.89.

研究の動機と目的

  • Pleromaのような分散型ソーシャルプラットフォームにおける有害コンテンツの広がりとその普及度を調査すること。
  • 限られたデータとラベリング作業の制約のもとで、個々のインスタンスにおける自動モデレーションの実現可能性を評価すること。
  • 独立したインスタンス同士が協働してモデルを共有することで、中央集権的インフラに依存せずにコンテンツモデレーションを実現する課題に取り組むこと。
  • 中央集権的インfraストラクチャを必要とせず、検出精度を向上させるスケーラブルで軽量なシステムの設計と評価を行うこと。

提案手法

  • 著者らは、3年間にわたり30のPleromaインスタンスから収集した990万件のトゥートを含む大規模データセットを構築した。このデータセットには11万7千人のユーザーが含まれる。
  • TF-IDF特徴量を用いたロジスティック回帰による個々のインスタンスごとのバイナリ分類器を訓練し、ローカルモデレーションのベースラインを確立した。
  • ModPairは、インスタンス間で事前学習済みモデルを交換し、アンサンブル投票を用いることで、連携ネットワーク全体での検出精度を向上させる。
  • システムは、言語的類似度が高いため、動的にリモートインスタンスを選択するための事前サンプリングを採用し、モデル共有の効率を最適化する。
  • データ漏洩を回避し、分散化の原則を尊重する軽量プロトコルを用いて、モデル共有を実装した。
  • リソースを大量に消費するファインチューニングや推論を避けるために、軽量なモデルと協働推論に依存するアプローチを採用した。

実験結果

リサーチクエスチョン

  • RQ1分散型ウェブ(DW)では、特にPleromaにおいて、どれほどの量の有害コンテンツが存在するのか?
  • RQ2有害コンテンツは、Fediverse連携メカニズムを通じてインスタンス間でどのように拡散するのか?
  • RQ3限られたデータとラベリング作業の制約のもとで、個々のインスタンスが効果的に自動モデレーションモデルを訓練できるのか?
  • RQ4中央当局に依存せずに、分散型インスタンスがどのようにして有害コンテンツ検出を改善できるのか?

主な発見

  • 有害コンテンツはDWに広く存在しており、データセット全体の12.15%が有害と分類された。
  • 有害コンテンツはインスタンス間を広範囲にわたって拡散している:30のインスタンスのうち26が、連携により平均して10万5千件以上のリモート由来の有害トゥートを受信した。
  • インスタンスは、自ら生成するよりもリモートソースからの有害コンテンツを多く受信しており、手動モデレーションはスケールでは実現不可能である。
  • 個々のインスタンスで学習したモデルは中程度の性能を示すが、その実現には多大な手動ラベリング作業が必要であり、多くの管理者にとっては現実的ではない。
  • ModPairは、協働的モデル共有により検出精度を向上させ、インスタンス全体で平均してマクロ-F1スコア0.89を達成した。
  • 言語的類似度が高いための事前サンプリングにより、モデル共有の効率と検出性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。