Skip to main content
QUICK REVIEW

[논문 리뷰] Active TLS Stack Fingerprinting: Characterizing TLS Server Deployments at Scale

Markus Sosnowski, Johannes Zirngibl|arXiv (Cornell University)|2022. 06. 27.
Internet Traffic Analysis and Secure E-voting인용 수 6
한 줄 요약

이 논문은 최적화된 Client Hello 프로브를 사용하여 대규모 환경에서 TLS 서버를 분류하는 능동적 TLS 스택 지문화 기법을 제안한다. 이 방법은 2,800만 대의 서버에서 명령 및 제어(C2) 서버와 콘텐츠 배포 네트워크(CDN) 인프라스트럭처를 99% 이상의 정밀도로 식별하는 데 성공하였다. 이 접근법은 10종의 일반 목적 프로브를 경험적으로 최적화하여 정보 수확량을 극대화하고 측정 비용과 윤리적 영향을 최소화한다.

ABSTRACT

Active measurements can be used to collect server characteristics on a large scale. This kind of metadata can help discovering hidden relations and commonalities among server deployments offering new possibilities to cluster and classify them. As an example, identifying a previously-unknown cybercriminal infrastructures can be a valuable source for cyber-threat intelligence. We propose herein an active measurement-based methodology for acquiring Transport Layer Security (TLS) metadata from servers and leverage it for their fingerprinting. Our fingerprints capture the characteristic behavior of the TLS stack primarily caused by the implementation, configuration, and hardware support of the underlying server. Using an empirical optimization strategy that maximizes information gain from every handshake to minimize measurement costs, we generated 10 general-purpose Client Hellos used as scanning probes to create a large database of TLS configurations used for classifying servers. We fingerprinted 28 million servers from the Alexa and Majestic toplists and two Command and Control (C2) blocklists over a period of 30 weeks with weekly snapshots as foundation for two long-term case studies: classification of Content Delivery Network and C2 servers. The proposed methodology shows a precision of more than 99 % and enables a stable identification of new servers over time. This study describes a new opportunity for active measurements to provide valuable insights into the Internet that can be used in security-relevant use cases.

연구 동기 및 목표

  • TLS 메타데이터 수집을 위한 확장성 있고 능동적인 측정 방법론을 개발하기 위해.
  • 정보 수확량을 극대화하고 측정 오버헤드를 최소화하는 데 최적화된 Client Hello 설정 조합을 식별하고 최적화하기 위해.
  • 실세계 서버 인프라스트럭처, 특히 C2 및 CDN 서버를 분류하는 데 있어 능동적 TLS 지문화의 효과성을 평가하기 위해.
  • 사이버 위협 지능 및 인프라 모니터링을 지원하기 위한 재현 가능하고 오픈소스 프레임워크를 제공하기 위해.

제안 방법

  • 저자는 정보 수확량을 극대화하고 측정 비용을 최소화하기 위해 경험적 최적화를 통해 10종의 일반 목적 Client Hello(CH) 프로브를 선정하였다.
  • TLS 핸드셰이크 기능 15종—예를 들어 지원하는 암호 스위트, 확장 기능, 타원 곡선 등—을 추출하여 TLS 스택 동작을 표현하였다.
  • 이러한 기능을 기반으로 유사도 기반 지문화 모델을 구축하여 TLS 스택 특성에 따라 서버를 분류할 수 있도록 하였다.
  • 이 방법론은 30주 동안 Alexa 및 Majestic 톱리스트의 주간 스냅샷과 두 개의 C2 블록리스트에 적용되었다.
  • 필요에 따라 추가 프로브를 보낼 수 있도록 적응형 스캐닝 전략을 제안하였다.
  • 이 방법은 한 개의 관측 지점에서의 능동적 프로빙에 의존하여 시간에 따라 일관되고 반복 가능한 측정이 가능하다.

실험 결과

연구 질문

  • RQ1최소한의 프로브로 최대한의 정보를 추출하면서 윤리적 영향도 최소화할 수 있는 능동적 TLS 지문화는 어떻게 최적화될 수 있는가?
  • RQ2TLS 서버 구현체를 구분하는 데 가장 유용한 정보를 제공하는 Client Hello 설정 조합은 무엇인가?
  • RQ3능동적 TLS 지문화는 C2 및 CDN 서버와 같은 대규모 서버 인프라스트럭처 분류에 높은 정밀도와 재현율을 달성할 수 있는가?
  • RQ4TLS 지문은 시간이 지남에 따라 얼마나 안정적인가? 지문화 결과에 일관성 없음을 초래하는 요인들은 무엇인가?

주요 결과

  • 블록리스트에 새로 추가된 명령 및 제어(C2) 서버를 식별하는 데 99% 이상의 정밀도를 달성하였다.
  • CDN 검출 정밀도는 Akamai, Alibaba의 경우 85%에서부터 Cloudflare, Fastly의 경우 99% 이상으로 다양했으며, 주요 제공자들 간 높은 정확도를 보였다.
  • 최적화된 10종의 Client Hello 프로브를 사용함으로써 측정 비용을 최소화하면서도 높은 정보 수확량을 확보하여 2,800만 대의 서버를 분류할 수 있었다.
  • 351개의 IP 주소가 자체 소속 자율 시스템(AS) 외부에서 CDN 콘텐츠를 제공하고 있음을 밝혀내어 제3자 또는 외부 AS 캐시의 광범위한 사용을 확인하였다.
  • HTTP Server 헤더에서 로드 밸런서 지표가 1.5%의 경우에 관찰되어 동적 라우팅으로 인한 지문 불안정성의 가능성을 시사하였다.
  • 외부 AS CDN 캐시로 해석되는 도메인의 80%가 VTC Digicom, Amazon, 또는 Render에서 운영하는 AS에 호스팅되어 있었으며, 일부는 Meta-CDN 유사 구조로 운영되고 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.