Skip to main content
QUICK REVIEW

[论文解读] Automatically Generating a Large, Culture-Specific Blocklist for China

Austin Hounsel, Prateek Mittal|arXiv (Cornell University)|Jun 4, 2018
Internet Traffic Analysis and Secure E-voting参考文献 8被引用 3
一句话总结

本文提出一种方法,通过在中文文本上应用自然语言处理(NLP)技术提取敏感短语,并将这些短语作为搜索查询,自动生成一个包含1,125个被中国屏蔽网站的、具有文化特异性的大型黑名单。该方法聚焦于文化相关且非英文的内容,显著扩展了现有黑名单,所发现的网站均未出现在最大规模的先前黑名单中,从而实现了更全面的网络审查测量。

ABSTRACT

Internet censorship measurements rely on lists of websites to be tested, or "block lists" that are curated by third parties. Unfortunately, many of these lists are not public, and those that are tend to focus on a small group of topics, leaving other types of sites and services untested. To increase and diversify the set of sites on existing block lists, we use natural language processing and search engines to automatically discover a much wider range of websites that are censored in China. Using these techniques, we create a list of 1125 websites outside the Alexa Top 1,000 that cover Chinese politics, minority human rights organizations, oppressed religions, and more. Importantly, $ extit{none of the sites we discover are present on the current largest block list}$. The list that we develop not only vastly expands the set of sites that current Internet measurement tools can test, but it also deepens our understanding of the nature of content that is censored in China. We have released both this new block list and the code for generating it.

研究动机与目标

  • 为测量中国互联网审查而解决缺乏全面、具有文化特异性的黑名单的问题。
  • 克服现有黑名单仅关注英文内容、因而遗漏中文被屏蔽网站的局限性。
  • 开发一种自动化系统,利用经过NLP处理的中文短语作为搜索查询,发现被屏蔽的网站。
  • 创建一个公开可获取的大规模黑名单,涵盖来自中文视角的边缘化声音和文化相关的内容。
  • 在政治敏感关键词之外,深化对内容审查范围和性质的理解。

提出的方法

  • 使用专为无空格分隔的中文文本设计的NLP技术,从现有被屏蔽网页中提取内容丰富且敏感的中文短语。
  • 将这些多词短语(如双词短语、三词短语)作为搜索查询,在百度等中文搜索引擎中使用,以发现相关的被屏蔽网站。
  • 通过使用非DNS的IP地址检测干扰,测试每个搜索结果在中国是否存在DNS篡改,以确定其是否被屏蔽。
  • 将新发现的被屏蔽域名迭代反馈至系统,以扩展对相关内容的搜索。
  • 应用TF-IDF从公民实验室黑名单中识别高影响力关键词,用于初始查询生成。
  • 解析中文文本,以确保完全用简体中文书写的被屏蔽网站不会被遗漏,这与先前研究不同。

实验结果

研究问题

  • RQ1与单字查询相比,经过NLP处理的中文短语是否能产生更有效、更具上下文相关性的搜索查询,以发现中国境内的被屏蔽网站?
  • RQ2中文中具有政治敏感性的短语,如对历史事件或政府人物的提及,与中国网站屏蔽之间有多大程度的相关性?
  • RQ3在黑名单中纳入非英文、具有文化特异性的内容,能在多大程度上提升审查黑名单的全面性和代表性?
  • RQ4使用多词、富含上下文的短语的系统,能否发现现有大规模黑名单中未包含的被屏蔽网站?
  • RQ5基于短语驱动的发现方法,中国网络过滤最常针对哪些类型的内容,如人权、宗教或政治异议?

主要发现

  • 该系统发现了1,125个未出现在最大现有黑名单中的被屏蔽域名,显著扩展了审查测量的范围。
  • 该黑名单规模是目前广泛使用的审查研究黑名单的12.5倍,显著提升了可测试网站的多样性与覆盖范围。
  • 如"1989年民主运动"和"天安门广场示威"等短语的屏蔽率分别达到30%和32%,表明与审查存在强烈相关性。
  • 双词短语如"中国共产党宗教政策"和"非法拘禁"的屏蔽率分别为42%和36%,表明政治与人权相关内容受到系统性针对。
  • 使用多词中文短语(如"中国人权侵犯")可发现通过单字查询无法找到的文化相关网站,包括活动人士和海外人士运营的站点。
  • 该黑名单涵盖了广泛被屏蔽的内容,包括少数群体权利、宗教自由、政治异议以及增强隐私的技术,充分反映了多样化的边缘化视角。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。