Skip to main content
QUICK REVIEW

[論文レビュー] Automatically Generating a Large, Culture-Specific Blocklist for China

Austin Hounsel, Prateek Mittal|arXiv (Cornell University)|Jun 4, 2018
Internet Traffic Analysis and Secure E-voting参考文献 8被引用数 3
ひとこと要約

本稿では、中国語のテキストに対して自然言語処理(NLP)を適用し、感受性の高いフレーズを抽出することで、中国における1,125の検閲済みウェブサイトを自動的に生成するブロックリスト作成手法を提示する。これらのフレーズを検索クエリとして使用し、検閲済みドメインを同定する。本手法は、英語以外の文化的に関連性の高いコンテンツに焦点を当てることで、既存のブロックリストを大幅に拡張しており、最大の既存ブロックリストに含まれないサイトが多数発見された。これにより、検閲測定の網羅性が向上する。

ABSTRACT

Internet censorship measurements rely on lists of websites to be tested, or "block lists" that are curated by third parties. Unfortunately, many of these lists are not public, and those that are tend to focus on a small group of topics, leaving other types of sites and services untested. To increase and diversify the set of sites on existing block lists, we use natural language processing and search engines to automatically discover a much wider range of websites that are censored in China. Using these techniques, we create a list of 1125 websites outside the Alexa Top 1,000 that cover Chinese politics, minority human rights organizations, oppressed religions, and more. Importantly, $ extit{none of the sites we discover are present on the current largest block list}$. The list that we develop not only vastly expands the set of sites that current Internet measurement tools can test, but it also deepens our understanding of the nature of content that is censored in China. We have released both this new block list and the code for generating it.

研究の動機と目的

  • 中国におけるインターネット検閲を測定するための包括的で文化的に特化したブロックリストの不足に対処すること。
  • 既存のブロックリストが英語コンテンツに偏っており、中国語で書かれた検閲済みウェブサイトを漏れなく捉えていないという限界を克服すること。
  • NLPで処理された中国語フレーズを検索クエリとして使用し、検閲済みウェブサイトを自動で発見するシステムを開発すること。
  • 一般に公開可能な大規模ブロックリストを整備し、中国の視点から見たマイノリティの声や文化的に関連性のあるコンテンツを含めること。
  • 政治的センシティブキーワードにとどまらず、中国におけるコンテンツ検閲の範囲と性質をより深く理解すること。

提案手法

  • 中国語テキストに特化したNLP技術を用いて、既存の検閲済みウェブページから意味的・感受性の高い中国語フレーズ(語の区切りがないため特に注意が必要)を抽出する。
  • 抽出された多語語フレーズ(バイグラム、トライグラム)を中国語検索エンジン(例:Bing)での検索クエリとして使用し、関連する検閲済みウェブサイトを同定する。
  • 中国国内でのDNS操作の有無を確認するため、非DNS IPアドレスを用いて干渉の有無をテストする。
  • 新しく発見された検閲済みドメインを繰り返しシステムにフィードバックし、関連コンテンツの探索を拡大する。
  • 初期クエリ生成のため、Citizen LabブロックリストからのTF-IDFを適用し、高インパクトキーワードを特定する。
  • 中国語テキストの解析を徹底することで、簡体字中国語で書かれた検閲済みウェブサイトが、先行研究では見過ごされがちな点を補う。

実験結果

リサーチクエスチョン

  • RQ1単一語のクエリに比べ、NLPで処理された中国語フレーズが、中国における検閲済みウェブサイト発見に、より効果的で文脈に即した検索クエリを提供できるか?
  • RQ2中国におけるウェブサイトブロッキングと、歴史的出来事や政府関係者を指す政治的センシティブフレーズ(例:"1989年民主化運動")の相関関係はどの程度強いのか?
  • RQ3英語以外の文化的に特化したコンテンツを含めることで、検閲ブロックリストの包括性と代表性はどの程度向上するか?
  • RQ4多語語で文脈を含むフレーズを用いたシステムは、既存の大規模ブロックリストに存在しない検閲済みウェブサイトを発見できるか?
  • RQ5人権、宗教、政治的反発といった分野のうち、フレーズベースの発見手法によって、中国のインターネットフィルタリングで最も頻繁に標的とされるコンテンツはどれか?

主な発見

  • 本システムは、最大の既存ブロックリストに存在しない1,125の検閲済みドメインを発見し、検閲測定の範囲を顕著に拡大した。
  • 本ブロックリストは、検閲研究で最も広く使われているブロックリストの12.5倍の規模であり、テスト可能なウェブサイトの多様性とカバー範囲を大幅に向上させた。
  • 「1989年民主化運動」と「天安門広場デモ」などのフレーズは、それぞれ30%および32%のブロック率を示し、検閲と強い相関があることを示した。
  • バイグラム「中国共産党の宗教政策」と「違法拘禁」は、それぞれ42%および36%のブロック率を示し、政治的および人権関連コンテンツに対する体系的な標的化を示した。
  • 多語語中国語フレーズ(例:「中国の人権侵害」)の使用により、単語クエリでは発見できなかった文化的に関連性のあるウェブサイト(活動家や亡命者運営のサイトを含む)が発見された。
  • 本ブロックリストには、マイノリティの権利、宗教的自由、政治的反発、プライバシー強化技術など、多様なマイノリティの視点を反映した検閲済みコンテンツが含まれており、包括的なカバーを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。