Skip to main content
QUICK REVIEW

[論文レビュー] Tracking and Quantifying Censorship on a Chinese Microblogging Site

Tao Zhu, David Phipps|arXiv (Cornell University)|Nov 26, 2012
Spam and Phishing Detection参考文献 2被引用数 10
ひとこと要約

本研究は、中国のマイクロブログプラットフォームWeiboにおける検閲の動きとその定量的評価を、感受性の高いユーザーを特定し、コンテンツの拡散を分析することで行っている。非公式な、造語的な中国語テキストにおける傾向を検出するため、再帰的ソーシャルクローリングと自然言語処理(NLP)技術を用い、検閲が極めて有効であることが判明した。感受性の高いトピックは短命であり、しばしばコアユーザー群にとどまり、拡散はほとんどない。リアルタイムおよび後向きのフィルタリングによって、ウイルス的拡散は抑止されている。

ABSTRACT

We present measurements and analysis of censorship on Weibo, a popular microblogging site in China. Since we were limited in the rate at which we could download posts, we identified users likely to participate in sensitive topics and recursively followed their social contacts. We also leveraged new natural language processing techniques to pick out trending topics despite the use of neologisms, named entities, and informal language usage in Chinese social media. We found that Weibo dynamically adapts to the changing interests of its users through multiple layers of filtering. The filtering includes both retroactively searching posts by keyword or repost links to delete them, and rejecting posts as they are posted. The trend of sensitive topics is short-lived, suggesting that the censorship is effective in stopping the "viral" spread of sensitive issues. We also give evidence that sensitive topics in Weibo only scarcely propagate beyond a core of sensitive posters.

研究の動機と目的

  • Weibo、中国の大手マイクロブログサイトにおける検閲の仕組みを調査すること。
  • 国家によるコンテンツフィルタリング下での感受性の高いトピックの拡散ダイナミクスを理解すること。
  • 口語的表現、造語、急速なトピックの変化にかかわらず、感受性の高いトピックを検出・追跡するための手法を開発すること。
  • 感受性の高いコンテンツの拡散を制限する検閲の有効性を定量化すること。

提案手法

  • レート制限の下で、感受性の高いトピックを投稿する可能性の高いユーザーのソーシャルネットワークを再帰的にたどることで、データ収集を拡大した。
  • 非公式な中国語、造語、標準でない表現を含む、トレンドトピックを同定するための新規な自然言語処理(NLP)技術を適用した。
  • キーワードおよびリンクベースのフィルタリングを用いて、リアルタイムでの投稿拒否と、後から削除される投稿の両方をモニタリングした。
  • Weiboのユーザーネットワーク全体における感受性の高いトピックの寿命と拡散パターンを追跡した。
  • ユーザーレベルのエンゲージメント指標とコンテンツ分析を組み合わせて、検閲の影響を評価した。
  • レート制限の下でWeibo APIとウェブスクレイピングを活用し、投稿の可視性および削除に関する縦断的データを収集した。

実験結果

リサーチクエスチョン

  • RQ1検閲の下で、Weiboにおける感受性の高いトピックはどのようにして出現し、拡散するのか?
  • RQ2Weiboは、感受性の高いコンテンツを抑止するために、リアルタイムでのブロッキングか、後から削除する仕組みのどちらを採用しているのか?
  • RQ3感受性の高いトピックは、コアユーザー群を超えてどれほど広がるのか?
  • RQ4検閲は、Weiboにおける感受性の高いコンテンツのウイルス的拡散をどれほど効果的に制限しているのか?
  • RQ5口語的表現や造語は、感受性の高いトピックの検出および追跡にどのように影響を与えるのか?

主な発見

  • Weiboにおける感受性の高いトピックは非常に短命であり、通常1日未塔で終わることから、迅速な抑止が行われていることが示された。
  • 検閲は複数の段階で機能している:リアルタイムでの投稿拒否と、既存コンテンツの後向き削除。
  • 感受性の高いトピックについて一貫して投稿を行うのは、小さな、密接に接続されたコアユーザー群に限られ、このグループを超えての拡散は限定的である。
  • 造語や口語的表現を用いても、提案されたNLP技術を用いることでトレンドトピックの検出に著しい障害は生じなかった。
  • システムはユーザーの関心に応じて動的に適応しており、応答的かつ能動的なフィルタリング戦略をとっていることが示唆された。
  • 感受性の高いコンテンツを追跡する努力にもかかわらず、データ収集レートの制限により範囲が限定されたが、標本のターゲティングにより、主な発見は依然として堅牢であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。