Skip to main content
QUICK REVIEW

[논문 리뷰] Limitless HTTP in an HTTPS World: Inferring the Semantics of the HTTPS Protocol without Decryption

Blake Anderson, Andrew Chi|arXiv (Cornell University)|2018. 05. 29.
Internet Traffic Analysis and Secure E-voting참고 문헌 20인용 수 3
한 줄 요약

이 논문은 암호 해독 없이 수동 HTTPS 트래픽에서 메서드, 상태 코드, Content-Type, 헤더 존재 여부와 같은 HTTP 의미를 추론하기 위한 새로운 프레임워크를 제시한다. 브라우저와 악성코드 샌드박스에서 유입된 TLS 암호화 트래픽을 대상으로 반복적 다중 분류 및 이진 분류를 수행한 결과, 대부분의 필드에서 F₁ 스코어가 0.900을 초과하여 암호화된 환경에서도 상당한 프로토콜 수준의 정보를 추출할 수 있음을 입증하였으며, 이는 악성코드 탐지 및 프라이버시 갈등에 대한 영향을 미친다.

ABSTRACT

We present new analytic techniques for inferring HTTP semantics from passive observations of HTTPS that can infer the value of important fields including the status-code, Content-Type, and Server, and the presence or absence of several additional HTTP header fields, e.g., Cookie and Referer. Our goals are twofold: to better understand the limitations of the confidentiality of HTTPS, and to explore benign uses of traffic analysis such as application troubleshooting and malware detection that could replace HTTPS interception and static private keys in some scenarios. We found that our techniques improve the efficacy of malware detection, but they do not enable more powerful website fingerprinting attacks against Tor. Our broader set of results raises concerns about the confidentiality goals of TLS relative to a user's expectation of privacy, warranting future research. We apply our methods to the semantics of both HTTP/1.1 and HTTP/2 on data collected from automated runs of Firefox 58.0, Chrome 63.0, and Tor Browser 7.0.11 in a lab setting, and from applications running in a malware sandbox. We obtain ground truth plaintext for a diverse set of applications from the malware sandbox by extracting the key material needed for decryption from RAM post-execution. We developed an iterative approach to simultaneously solve several multi-class (field values) and binary (field presence) classification problems, and we show that our inference algorithm achieves an unweighted $F_1$ score greater than 0.900 for most HTTP fields examined.

연구 동기 및 목표

  • 암호 해독 없이도 수동 HTTPS 트래픽에서 의미 있는 HTTP 프로토콜 의미를 추론할 수 있는지 조사하기 위해.
  • 네트워크 모니터링 및 보안 작업에서 TLS 해독을 대체할 수 있는 트래픽 분석의 실현 가능성을 평가하기 위해.
  • 이러한 추론 기법이 웹사이트 지문 분석 및 익명성 해제와 같은 악성 환경에서 프라이버시에 미치는 영향을 평가하기 위해.
  • 암호화된 트래픽 분석을 활용한 악성코드 탐지, 네트워크 디버깅, 정책 시행 등의 실용적 응용을 탐색하기 위해.
  • Tor와 같은 프라이버시 보호 시스템(고정 길이 셀 및 멀티플렉싱 등 방어 수단을 포함)에 대해 이러한 기법의 강건성을 평가하기 위해.

제안 방법

  • 저자는 메서드, 상태 코드, Content-Type, 헤더 존재 여부(예: Cookie, Referer)와 같은 HTTP 필드에 대해 별개의 다중 분류 및 이진 분류 작업으로 문제를 정의한다.
  • 유사한 TLS 연결 내의 관련 트랜잭션에서의 추론 결과를 활용해 정확도를 향상시키는 반복적 분류 전략을 사용한다.
  • Firefox 58.0, Chrome 63.0, Tor Browser 7.0.11, 악성코드 샌드박스에서 수집한 암호화된 HTTPS 트래픽을 기반으로 학습하며, 데이터는 학습(1주차) 및 테스트(2주차) 세트로 분할된다.
  • 악성코드 데이터의 기준 진위 정보는 실행 후 메모리에서 TLS 키 물질을 추출함으로써 확보되어 실제 암호화된 트래픽에서의 지도 학습이 가능해진다.
  • 먼저 HTTP/1.1 및 HTTP/2 레코드를 TLS 스트림 내에서 식별하며, 각각 F₁ > 0.99 및 F₁ > 0.98를 달성한 후, 필드 값과 존재 여부를 분류한다.
  • 특성 중요도 및 모델 강건성은 시간에 따라 평가되며, 특성의 관련성이 변화할 수 있으므로 지속적인 재학습이 필요하다고 인정한다.

실험 결과

연구 질문

  • RQ1암호 해독 없이도 수동 HTTPS 트래픽에서 메서드, 상태 코드, 헤더 필드와 같은 HTTP 프로토콜 의미를 정확히 추론할 수 있는가?
  • RQ2이러한 추론 기법이 암호화된 트래픽에서 악성코드 탐지 성능을 얼마나 향상시키며, 일반적인 오버클로징 기법에 의해 회피될 수 있는가?
  • RQ3이러한 추론 방법은 Tor 네트워크에서 웹사이트 지문 분석 공격을 향상시키는가? 만약 그렇지 않다면 그 이유는 무엇인가?
  • RQ4이러한 추론 시스템의 성능은 다양한 브라우저 및 네트워크 환경(동적 및 샌드박스 트래픽 포함)에서 어떻게 변하는가?
  • RQ5특히 사용자 익명성 해제 및 정책 시행과 관련하여, 암호화된 트래픽에서 HTTP 의미를 추론하는 데서 발생하는 윤리적 및 프라이버시적 영향은 무엇인가?

주요 결과

  • 이 추론 프레임워크는 Content-Type, Server, 상태 코드와 같은 대부분의 HTTP 필드에서 무게 조정되지 않은 F₁ 스코어가 0.900을 초과하며, 메서드 필드는 0.717, 상태 코드 필드는 0.492를 기록한다.
  • 시스템은 TLS 스트림 내에서 HTTP/1.1 및 HTTP/2 레코드를 각각 F₁ 스코어 0.99 및 0.98로 식별하여 레코드 경계 탐지의 높은 정확도를 입증한다.
  • 악성 트래픽에서 HTTP 헤더 필드의 분포가 뚜렷하게 다름을 활용해 악성코드 탐지 성능을 향상시키지만, 오버클로징 전략은 그 효과를 감소시킬 수 있다.
  • Tor 네트워크에서의 웹사이트 지문 분석 공격은 향상되지 않았으며, 이는 Tor의 고정 길이 셀 및 멀티플렉싱 사용이 이러한 추론 기법을 효과적으로 완화하기 때문이다.
  • 이 방법은 활성 스캐닝이나 TLS 종료 없이도 수동 네트워크 모니터링 및 디버깅을 가능하게 하여 네트워크 관리자에게 확장 가능한 대안을 제공한다.
  • 이 프레임워크는 타임스탬프와 함께 Referer/Origin/Cookie 필드 존재 여부를 관련지어 NAT 사용자 익명성 해제에 활용할 수 있으며, HTTP/2 프레임 유형을 통해 파일 크기를 추론해 정책 위반 파일 전송을 탐지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.