Skip to main content
QUICK REVIEW

[논문 리뷰] Construction of Two Statistical Anomaly Features for Small-Sample APT Attack Traffic Classification

Ru Zhang, Wenxin Sun|arXiv (Cornell University)|2020. 10. 27.
Network Security and Intrusion Detection참고 문헌 61인용 수 5
한 줄 요약

이 논문은 소규모 샘플 APT 공격 트래픽 분류를 향상시키기 위해 두 가지 새로운 통계적 이상 특징—C2Load_fluct(응답 패킷 로드 변동)과 Bad_rate(불량 패킷 비율)—을 제안한다. 기존 특징들과 결합하고, AdaBoost와 함께 개선된 PADASYN 데이터 균형화 방법을 사용함으로써, 두 데이터셋에서 F1-스코어가 각각 0.98과 0.94를 초과하여 성능이 크게 향상되었으며, APT C2 트래픽 탐지 정확도가 향상되었다.

ABSTRACT

Advanced Persistent Threat (APT) attack, also known as directed threat attack, refers to the continuous and effective attack activities carried out by an organization on a specific object. They are covert, persistent and targeted, which are difficult to capture by traditional intrusion detection system(IDS). The traffic generated by the APT organization, which is the organization that launch the APT attack, has a high similarity, especially in the Command and Control(C2) stage. The addition of features for APT organizations can effectively improve the accuracy of traffic detection for APT attacks. This paper analyzes the DNS and TCP traffic of the APT attack, and constructs two new features, C2Load_fluct (response packet load fluctuation) and Bad_rate (bad packet rate). The analysis showed APT attacks have obvious statistical laws in these two features. This article combines two new features with common features to classify APT attack traffic. Aiming at the problem of data loss and boundary samples, we improve the Adaptive Synthetic(ADASYN) Sampling Approach and propose the PADASYN algorithm to achieve data balance. A traffic classification scheme is designed based on the AdaBoost algorithm. Experiments show that the classification accuracy of APT attack traffic is improved after adding new features to the two datasets so that 10 DNS features, 11 TCP and HTTP/HTTPS features are used to construct a Features set. On the two datasets, F1-score can reach above 0.98 and 0.94 respectively, which proves that the two new features in this paper are effective for APT traffic detection.

연구 동기 및 목표

  • 기존의 IDS가 도용성과 지속성으로 인해 실패하는 소규모 샘플 데이터셋에서 APT 공격 탐지를 해결한다.
  • 정상 트래픽과 APT C2 통신을 구분할 수 있는 DNS 및 TCP 트래픽의 통계적 이상을 식별한다.
  • APT 트래픽 패턴에 맞게 조정된 두 가지 새로운 통계적 특징을 도입하여 분류 정확도를 향상시킨다.
  • 개선된 ADASYN 기반 샘플링 기법(PADASYN)을 사용해 APT 트래픽 데이터셋의 데이터 불균형 문제를 해결한다.
  • 새로운 특징과 AdaBoost를 조합한 효과적인 트래픽 분류 프레임워크를 설계하여 고정확도 APT 탐지 성능을 달성한다.

제안 방법

  • APT C2 트래픽에서 응답 패킷 페이로드 크기의 변동성을 측정하는 C2Load_fluct을 구성하여, APT 명령-제어 채널의 특징적인 비정상적 로드 변동성을 포착한다.
  • APT 트래픽에서 손상되거나 의심스러운 패킷의 비율로 Bad_rate를 정의하여, 정상 프로토콜 동작과의 이탈을 식별한다.
  • 두 새로운 특징을 10개의 DNS 및 11개의 TCP/HTTP/HTTPS 특징과 통합하여 분류를 위한 확장된 특징 세트를 구성한다.
  • 소규모 데이터셋에서 경계 샘플과 데이터 손실 문제를 더 잘 다루는 방식으로 ADASYN을 개선한 PADASYN을 제안한다.
  • 균형 잡힌 특징이 풍부한 데이터셋을 기반으로 AdaBoost 알고리즘을 적용하여 강력한 앙상블 분류기를 훈련시킨다.
  • 실제 APT 트래픽 데이터셋 두 개를 대상으로 모델 성능을 평가하여 소규모 샘플 조건 하에서의 성능을 검증한다.

실험 결과

연구 질문

  • RQ1패킷 페이로드 변동성과 불량 패킷 비율의 통계적 이상은 정상 트래픽과 APT C2 트래픽을 효과적으로 구분할 수 있는가?
  • RQ2제안된 특징인 C2Load_fluct과 Bad_rate는 소규모 샘플 APT 탐지 환경에서 어떻게 성능을 발휘하는가?
  • RQ3PADASYN 알고리즘이 표준 ADASYN 대비 APT 데이터셋에서 데이터 균형 및 분류 성능 향상에 얼마나 기여하는가?
  • RQ4기존 특징과 함께 두 새로운 특징을 조합할 경우 전체 APT 트래픽 분류 정확도에 어떤 영향을 미치는가?
  • RQ5PADASYN과 새로운 특징으로 향상된 AdaBoost 기반 분류기는 불균형 APT 트래픽 데이터셋에서도 높은 F1-스코어를 달성할 수 있는가?

주요 결과

  • C2Load_fluct과 Bad_rate 특징은 APT 트래픽에서 강력한 통계적 패턴을 보이며, 특히 C2 단계에서 신뢰할 수 있는 탐지가 가능하다.
  • 두 새로운 특징의 통합으로 분류 성능이 크게 향상되어, 한 데이터셋에선 F1-스코어 0.98, 다른 데이터셋에선 0.94를 달성하였다.
  • PADASYN은 데이터 불균형과 경계 샘플 문제를 효과적으로 완화하여 소규모 APT 데이터셋에서 모델 일반화 능력을 향상시켰다.
  • 강화된 특징 세트를 사용한 AdaBoost 분류기는 베이스라인 모델보다 뛰어난 성능을 보이며, APT 탐지에서 뛰어난 강건성과 정밀도를 입증하였다.
  • 통계적 이상 특징과 개선된 샘플링 기법의 조합은 소규모 샘플 APT 트래픽 분류에서 최신 기술 수준의 성능을 달성하였다.
  • 결과는 제안된 두 특징이 제한된 학습 데이터 조건에서도 APT C2 트래픽을 식별하는 데 매우 효과적임을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.