Skip to main content
QUICK REVIEW

[논문 리뷰] I Spy with My Little Eye: Analysis and Detection of Spying Browser Extensions

Anupama Aggarwal, Bimal Viswanath|arXiv (Cornell University)|2016. 12. 02.
Spam and Phishing Detection인용 수 4
한 줄 요약

이 논문은 브라우저 확장 프로그램이 브라우저 기록, 소셜 네트워크(SNS) 토큰, 지리정보 등 민감한 사용자 데이터를 유출하는 것을 탐지하기 위한 기계학습 기반 접근법을 제시한다. 순환 신경망(RNN)을 사용해 브라우저 API 호출 시퀀스를 모델링함으로써, 악성 확장 프로그램을 식별하는 데 90.02%의 정밀도와 93.31%의 재현율을 달성하였으며, 기존의 수작업으로 설계된 특징 기반 방법보다 뛰어난 성능을 보였다.

ABSTRACT

Several studies have been conducted on understanding third-party user tracking on the web. However, web trackers can only track users on sites where they are embedded by the publisher, thus obtaining a fragmented view of a user's online footprint. In this work, we investigate a different form of user tracking, where browser extensions are repurposed to capture the complete online activities of a user and communicate the collected sensitive information to a third-party domain. We conduct an empirical study of spying browser extensions on the Chrome Web Store. First, we present an in-depth analysis of the spying behavior of these extensions. We observe that these extensions steal a variety of sensitive user information, such as the complete browsing history (e.g., the sequence of web traversals), online social network (OSN) access tokens, IP address, and user geolocation. Second, we investigate the potential for automatically detecting spying extensions by applying machine learning schemes. We show that using a Recurrent Neural Network (RNN), the sequences of browser API calls can be a robust feature, outperforming hand-crafted features (used in prior work on malicious extensions) to detect spying extensions. Our RNN based detection scheme achieves a high precision (90.02%) and recall (93.31%) in detecting spying extensions.

연구 동기 및 목표

  • 브라우저 확장 프로그램이 브라우저 기록, 소셜 네트워크(SNS) 토큰, 지리정보 등 민감한 사용자 데이터를 도용하는 현상의 보편성과 행동 양상을 이해하기 위해.
  • 복잡한 수작업 특징 설계에 의존하지 않고, 자동으로 이러한 확장 프로그램을 탐지할 수 있는지의 가능성을 조사하기 위해.
  • 순차적인 브라우저 API 호출 패턴이 스파이 행동을 탐지하기 위한 강력하고 높은 성능을 보이는 특징로 기능할 수 있는지 평가하기 위해.
  • 기존의 특징 설계 방법보다 뛰어난 성능을 보이는 RNN 기반 탐지 모델을 개발하고 검증하기 위해.

제안 방법

  • 저자는 크롬 웹 스토어의 1,000개 이상의 확장 프로그램에서 수동으로 행동 로그(네트워크, 스토리지, API 요청)를 분석하여 218개의 스파이 확장 프로그램을 식별하고, 기준 데이터셋을 구축하였다.
  • 후보 확장 프로그램 43,521개 중에서 히وري스틱을 적용해 수작업 분석의 부담을 줄였으며, 동시에 탐지 정확도를 유지하였다.
  • 핵심 방법은 브라우저 API 호출 시퀀스를 순차적 데이터로 모델링하고, 스파이 행동을 나타내는 복잡한 시간적 패턴을 학습하기 위해 순환 신경망(RNN)을 사용하는 것이다.
  • RNN은 API 호출 시퀀스를 기반으로 훈련되어, 스파이 확장 프로그램에서 흔히 볼 수 있는 오브스컬레이션 및 상태 전환 동작과 같은 동적 행동을 포착한다.
  • 이 방법은 복잡한 수작업 특징 설계가 필요 없이 순수하게 원시 API 호출 시퀀스에 의존하므로, 기존의 특징 설계 기반 방법보다 뛰어난 성능을 보인다.
  • 모델은 사전에 포함되지 않은 65개의 새로운 확장 프로그램으로 구성된 검증 세트에서 성공적으로 악성 확장 프로그램을 식별하였다.

실험 결과

연구 질문

  • RQ1스파이 브라우저 확장 프로그램은 일반적으로 어떤 종류의 민감한 사용자 정보를 도용하며, 크롬 웹 스토어에서 얼마나 보편적인가?
  • RQ2순차적인 브라우저 API 호출 패턴이 수작업 특징보다 스파이 확장 프로그램 탐지에 더 효과적인 특징이 될 수 있는가?
  • RQ3수작업 특징에 의존하는 전통적인 기계학습 방법과 비교할 때, RNN 기반 모델은 스파이 확장 프로그램 탐지에서 어떤 성능을 보이는가?
  • RQ4RNN 모델은 기존에 보지 못한 스파이 확장 프로그램을 얼마나 잘 일반화하여 탐지할 수 있는가?

주요 결과

  • 연구에서 크롬 웹 스토어에서 218개의 스파이 확장 프로그램을 식별하였으며, 이들 중 다수는 양호한 확장 프로그램와 유사한 인기와 평점 수준을 기록하여 사용자들이 이를 인지하지 못하고 있음을 시사한다.
  • 스팸 확장 프로그램은 완전한 브라우저 기록, 소셜 네트워크(SNS) 접근 토큰, IP 주소, 지리정보 등 다양한 민감한 데이터를 도용하며, 종종 제3자 도메인으로 데이터를 유출한다.
  • RNN 기반 탐지 모델은 93.31%의 재현율과 90.02%의 정밀도를 달성하여, 스파이 행동 탐지에서 수작업 특징 기반 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • API 호출 시퀀스가 가장 예측 능력이 높은 특징로 확인되었으며, 이는 복잡한 특징 설계나 정적 코드 분석에 의존하지 않고도 탐지가 가능하다는 것을 의미한다.
  • 모델은 훈련 세트에 포함되지 않은 65개의 새로운 스파이 확장 프로그램을 성공적으로 탐지하여, 높은 일반화 능력과 실제 적용 가능성의 가능성을 입증하였다.
  • 일부 확장 프로그램에서는 오브스컬레이션 및 스파이 동작과 비스파이 동작 간의 동적 전환을 관찰하였으며, 이는 탐지의 어려움을 보여주고, 행동 기반 분석의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.