Skip to main content
QUICK REVIEW

[论文解读] Censorship in the Wild: Analyzing Internet Filtering in Syria

Abdelberi Chaabane, Terence Chen|arXiv (Cornell University)|Feb 14, 2014
Internet Traffic Analysis and Secure E-voting参考文献 17被引用 18
一句话总结

本文利用2011年7月至8月期间泄露的600GB蓝冠(Blue Coat)代理日志,首次对叙利亚的互联网审查进行了大规模分析。通过分析实际流量日志而非依赖探测手段,研究揭示了一套有针对性且隐蔽的审查系统,该系统会封锁整个子网(如以色列)、特定域名和关键词——尤其是与反审查工具相关的关键词——造成严重的附带损害。同时,研究也显示用户广泛使用了诸如Tor、代理和BitTorrent等绕过工具。

ABSTRACT

Internet censorship is enforced by numerous governments worldwide, however, due to the lack of publicly available information, as well as the inherent risks of performing active measurements, it is often hard for the research community to investigate censorship practices in the wild. Thus, the leak of 600GB worth of logs from 7 Blue Coat SG-9000 proxies, deployed in Syria to filter Internet traffic at a country scale, represents a unique opportunity to provide a detailed snapshot of a real-world censorship ecosystem. This paper presents the methodology and the results of a measurement analysis of the leaked Blue Coat logs, revealing a relatively stealthy, yet quite targeted, censorship. We find that traffic is filtered in several ways: using IP addresses and domain names to block subnets or websites, and keywords or categories to target specific content. We show that keyword-based censorship produces some collateral damage as many requests are blocked even if they do not relate to sensitive content. We also discover that Instant Messaging is heavily censored, while filtering of social media is limited to specific pages. Finally, we show that Syrian users try to evade censorship by using web/socks proxies, Tor, VPNs, and BitTorrent. To the best of our knowledge, our work provides the first analytical look into Internet filtering in Syria.

研究动机与目标

  • 提供叙利亚互联网过滤实践的首个详细、基于数据的快照,该国关于其审查基础设施的公开信息极为有限。
  • 分析实际代理日志,而非依赖探测方法,后者往往导致对审查政策的不完整或偏差的呈现。
  • 理解审查的技术机制,包括基于IP、基于域名、基于关键词和基于类别的过滤,及其在现实世界中的影响。
  • 调查叙利亚用户如何绕过审查,以及各种规避工具(如Tor、代理和BitTorrent)的有效性。
  • 评估基于关键词的过滤所造成的附带损害程度,并识别出非敏感内容被误封锁的情况。

提出的方法

  • 分析2011年7月至8月期间在叙利亚部署的七台蓝冠SG-9000代理设备的真实日志,数据通过黑客组织Telecomix的泄露获得。
  • 对所有日志中的请求模式进行统计分析,以识别过滤技术,包括基于IP的子网封锁、基于域名的过滤以及基于关键词/类别的封锁。
  • 对审查事件进行时间序列分析,以检测模式,例如代理设备的专门化行为(如某一代理连续数天封锁Tor,而其他代理则未封锁)。
  • 基于URL、查询参数和关键词对被封锁内容进行识别与分类,包括分析Google缓存的使用情况以访问被封锁内容。
  • 通过分析对已知规避审查服务(如Hotspot Shield、Tor、UltraSurf)和BitTorrent等P2P网络的请求,关联用户行为与绕过工具的使用。
  • 评估HTTPS保护的Google缓存作为潜在绕过机制的可能性,通过检查对webcache.googleusercontent.com的允许与被封锁请求。

实验结果

研究问题

  • RQ1叙利亚互联网过滤的主要技术机制是什么?这些机制如何应用于不同类型流量?
  • RQ2基于关键词的审查在多大程度上造成附带损害,例如封锁非敏感内容(如广告或工具查询)?
  • RQ3叙利亚用户如何尝试绕过审查?基于日志数据,哪些工具(如Tor、代理、BitTorrent)最为有效?
  • RQ4不同代理设备之间的过滤行为是否存在差异?是否存在某些代理专门封锁特定类型的流量(如Tor、即时通讯)?
  • RQ5广泛使用的服务(如Google缓存)能否被用来访问被封锁内容?在何种条件下可行?

主要发现

  • 叙利亚的基于关键词的审查导致了显著的附带损害:共处理了4,860次Google缓存请求,其中12次因关键词黑名单被封锁,其中包括一个被缓存的政治敏感Facebook页面的请求。
  • 即时通讯服务(如Skype)受到严重审查,而更广泛的社交媒体平台(如Facebook和Twitter)则基本保持可访问,仅特定页面(如“叙利亚革命”群组)被封锁。
  • 一台蓝冠代理设备连续数天封锁了Tor流量,而其他代理设备则未封锁,表明存在代理设备专门化行为,且网络中审查执行不一致。
  • 共有4,860次请求访问Google缓存,仅12次因关键词过滤被封锁,表明Google缓存可作为可行但有限的被封锁内容绕过手段。
  • 用户积极使用多种工具进行绕过:包括Web/Socks代理、Tor、VPN以及BitTorrent,后者被用于下载反审查软件(如UltraSurf)。
  • 叙利亚的审查系统相对隐蔽且具有针对性,主要聚焦于政治反对内容、以色列子网以及反审查工具,而非广泛封锁整个平台。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。