Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Feature Extraction for Website Fingerprinting through Deep Learning.

Vera Rimmer, Davy Preuveneers|arXiv (Cornell University)|2017. 08. 21.
Internet Traffic Analysis and Secure E-voting인용 수 12
한 줄 요약

이 논문은 수작업 특징 공학을 제거하고, Tor에서 웹사이트 포인터링의 자동화된 특징 추출을 위한 딥러닝 기반 방법을 제안한다. 300만 건이 넘는 트레이스로 구성된 데이터셋에서 평가한 결과, 수작업으로 설계된 특징과 유사한 성능을 달성하면서도 더 높은 내구성과 유연성을 제공한다.

ABSTRACT

Several studies have shown that the network traffic that is generated by a visit to a website over Tor reveals information specific to the website through the timing and sizes of network packets. By capturing traffic traces between users and their Tor entry guard, a network eavesdropper can leverage this meta-data to reveal which website Tor users are visiting. The success of such attacks heavily depends on the particular set of traffic features that are used to construct the fingerprint. Typically, these features are manually engineered and, as such, any change introduced to the Tor network can render these carefully constructed features ineffective. In this paper, we show that an adversary can automate the feature engineering process, and thus automatically deanonymize Tor traffic by applying our novel method based on deep learning. We evaluate our approach on a dataset comprised of more than three million network traces, which is the largest dataset of web traffic ever gathered for website fingerprinting, and find that the performance achieved by deep learning techniques is comparable to known approaches which include various research efforts spanning over multiple years. Furthermore, it eliminates the need for feature design and selection which is a tedious work and has been one of the main focus of prior work. We conclude that the ability to automatically construct the most relevant traffic features and perform accurate traffic recognition makes our deep learning based approach an efficient, flexible and robust technique for website fingerprinting.

연구 동기 및 목표

  • Tor 네트워크의 변화에 따라 오래된 수작업 특징 설계의 한계를 해결하기 위해.
  • 원시 네트워크 트레이스에서 관련된 트래픽 특징을 동적으로 학습할 수 있는 자동화된 방법을 개발하기 위해.
  • 기존 문헌에서 확보되지 않은 대규모 데이터셋을 기반으로 딥러닝의 웹사이트 포인터링 성능을 평가하기 위해.
  • 자동화된 특징 학습이 다년간의 수작업 최적화 특징 공학의 정확도를 도달하거나 초월할 수 있음을 입증하기 위해.

제안 방법

  • 이 방법은 딥 네ural 네트워크를 사용하여 원시 네트워크 트래픽 트레이스에서, 패킷 간격과 크기 등을 포함한 분별 가능한 특징을 자동으로 추출한다.
  • 모델은 Tor 사용자가 다양한 웹사이트를 방문할 때 수집한 네트워크 트레이스를 엔드 투 엔드로 훈련하여, 트래픽 패턴을 웹사이트 식별자로 매핑하도록 학습한다.
  • 고정된 특징 설계 없이도 패킷 시퀀스의 시간적 및 통계적 패턴을 활용하여 웹사이트 고유의 지문을 식별하는 아키텍처를 구현한다.
  • 다양한 웹사이트와 사용자 행동을 반영한 300만 건 이상의 네트워크 트레이스로 구성된 데이터셋에서 방법을 평가한다.
  • 분류 정확도를 측정하여, 딥러닝 모델을 최신 수준의 수작업 특징 집합과 비교한다.
  • 특징을 데이터에서 직접 학습하므로 고정된 히وري스틱에 의존하지 않아, 경량 프rotocol 변경에도 내구성이 있도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1딥러닝은 수작업으로 설계된 특징에 의존하지 않고도 웹사이트 포인터링의 특징 공학 과정을 자동화할 수 있는가?
  • RQ2딥러닝 기반 접근법은 기존의 수작업 특징 집합과 비교해 웹사이트 포인터링에서 어떤 성능을 보이는가?
  • RQ3딥러닝 모델은 Tor 네트워크의 다양한 웹사이트와 네트워크 조건에 대해 얼마나 일반화할 수 있는가?
  • RQ4수작업 특징에 비해 자동 특징 학습이 Tor 네트워크의 변화에 대해 더 높은 내구성을 보이는가?

주요 결과

  • 딥러닝 모델은 다년간의 수작업 최적화 특징 공학이 필요한 최신 수준의 방법과 유사한 분류 정확도를 달성한다.
  • 메모리 소모가 크고 시간이 오래 소요되는 수작업 특징 선택 및 설계의 필요성을 제거한다.
  • 특징을 데이터에서 직접 학습하므로 고정된 히وري스틱에 의존하지 않아 네트워크 변동에 대해 높은 내구성을 보인다.
  • 모델은 알려진 바에선 가장 큰 Tor 웹 트래픽 데이터셋, 즉 300만 건 이상의 네트워크 트레이스에서 평가되었다.
  • 딥러닝을 통한 자동 특징 학습이 전통적인 포인터링 기법에 비해 실용적이고 효과적인 대안임을 확인한다.
  • 네트워크 조건이나 트래픽 패턴이 약간 변화하더라도 딥러닝 모델의 성능은 안정적으로 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.