Skip to main content
QUICK REVIEW

[논문 리뷰] Automatically Generating a Large, Culture-Specific Blocklist for China

Austin Hounsel, Prateek Mittal|arXiv (Cornell University)|2018. 06. 04.
Internet Traffic Analysis and Secure E-voting참고 문헌 8인용 수 3
한 줄 요약

이 논문은 중국 내 1,125개의 검열된 웹사이트를 자동으로 생성하는 방법을 제시한다. 이는 중국어 텍스트에 자연어 처리(NLP)를 적용해 민감한 어휘를 추출하고, 이를 검색 쿼리로 사용해 검열된 도메인을 탐색하는 방식이다. 이 접근법은 영어 중심의 기존 블록리스트를 뛰어넘어 문화적으로 관련성이 높은 비영어 콘텐츠에 초점을 맞춰 기존 블록리스트에 포함되지 않은 모든 발견된 사이트를 포함함으로써, 더 포괄적인 검열 측정을 가능하게 한다.

ABSTRACT

Internet censorship measurements rely on lists of websites to be tested, or "block lists" that are curated by third parties. Unfortunately, many of these lists are not public, and those that are tend to focus on a small group of topics, leaving other types of sites and services untested. To increase and diversify the set of sites on existing block lists, we use natural language processing and search engines to automatically discover a much wider range of websites that are censored in China. Using these techniques, we create a list of 1125 websites outside the Alexa Top 1,000 that cover Chinese politics, minority human rights organizations, oppressed religions, and more. Importantly, $ extit{none of the sites we discover are present on the current largest block list}$. The list that we develop not only vastly expands the set of sites that current Internet measurement tools can test, but it also deepens our understanding of the nature of content that is censored in China. We have released both this new block list and the code for generating it.

연구 동기 및 목표

  • 중국의 인터넷 검열을 측정하기 위한 종합적이고 문화적으로 특화된 블록리스트의 부족을 해결하기 위해.
  • 기존 블록리스트가 영어 콘텐츠에 집중하여 중국어로 작성된 검열된 웹사이트를 놓치는 한계를 극복하기 위해.
  • NLP로 처리한 중국어 어휘를 검색 쿼리로 사용해 검열된 웹사이트를 자동으로 탐지하는 시스템을 개발하기 위해.
  • 소수자 및 중국어 관점에서 문화적으로 관련성이 높은 콘텐츠를 포함한 공개 가능한 대규모 블록리스트를 만들기 위해.
  • 정치적으로 민감한 키워드를 뛰어나 상황에 따라 더 넓은 범위의 콘텐츠 검열의 범위와 성격을 깊이 이해하기 위해.

제안 방법

  • 자연어 처리(NLP) 기법을 사용해 중국어 텍스트에 특화된, 공백이 없는 특성 덕분에 어려움을 겪는 중국어 텍스트에 적합한 방식으로 기존 검열 웹페이지에서 콘텐츠가 풍부한 민감한 중국어 어휘를 추출한다.
  • 이러한 다단어 어휘(이어진어, 삼어어)를 중국어 검색 엔진(예: 빙)에서 검색 쿼리로 사용해 관련된 검열된 웹사이트를 찾는다.
  • 중국 내 DNS 조작 여부를 확인하기 위해 비-DNS IP 주소를 사용해 각 검색 결과를 테스트하여 블로킹 여부를 판단한다.
  • 새로 발견된 검열된 도메인을 반복적으로 시스템에 피드백하여 관련 콘텐츠 탐색 범위를 확장한다.
  • 초기 쿼리 생성을 위해 시티즌 랩 블록리스트에서 TF-IDF를 적용해 고영향도 키워드를 식별한다.
  • 기존 연구에서 간과되었던, 간단한 중국어로만 작성된 검열된 웹사이트를 놓치지 않도록 중국어 텍스트를 분석한다.

실험 결과

연구 질문

  • RQ1단일어어 쿼리에 비해 NLP로 처리한 중국어 어휘가 중국 내 검열된 웹사이트를 탐색하는 데 더 효과적이고 맥락적으로 관련성이 높은 검색 쿼리로 기능할 수 있는가?
  • RQ2역사적 사건이나 정부 인물에 대한 언급을 포함한 중국어 정치적 민감어휘가 중국 내 웹사이트 블로킹과 어느 정도 상관관계가 있는가?
  • RQ3비영어 및 문화적으로 특화된 콘텐츠를 포함함으로써 검열 블록리스트의 포괄성과 대표성은 어떻게 향상되는가?
  • RQ4다단어, 맥락이 풍부한 어휘를 사용하는 시스템이 기존 대규모 블록리스트에 포함되지 않은 검열된 웹사이트를 탐지할 수 있는가?
  • RQ5인권, 종교, 정치적 이단행위 등의 콘텐츠 유형 중, 기반 어휘 기반 탐색을 통해 중국의 인터넷 필터링에서 가장 빈번하게 타깃으로 삼는 것은 무엇인가?

주요 결과

  • 시스템은 기존에 가장 큰 블록리스트에 포함되지 않은 1,125개의 중국 내 검열 도메인을 발견하여 검열 측정의 범위를 크게 확장했다.
  • 이 블록리스트의 크기는 검열 연구에 가장 널리 사용되는 블록리스트보다 12.5배 크며, 테스트 가능한 웹사이트의 다양성과 커버리지가 향상되었다.
  • "1989 민주화 운동"과 "티안안먼 광장 시위"와 같은 어휘는 각각 30%와 32%의 높은 블로킹 비율을 보이며 검열과의 강한 상관관계를 시사한다.
  • "중국 공산당의 종교 정책"과 "불법 구금"과 같은 이어진어는 각각 42%와 36%의 블로킹 비율을 보이며 정치 및 인권 콘텐츠에 대한 체계적인 타깃팅을 나타낸다.
  • "중국의 인권 침해"와 같은 다단어 중국어 어휘의 사용은 단일어어 쿼리로는 발견되지 않았던 문화적으로 관련성이 높은 웹사이트, 특히 활동가나 해외 이주민이 운영하는 사이트를 탐지하는 데 기여했다.
  • 블록리스트에는 少数民族 권리, 종교의 자유, 정치적 이단행위, 개인정보 보호 기술 등 다양한 소수자 시각을 반영한 다양한 검열 콘텐츠가 포함되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.