Skip to main content
QUICK REVIEW

[논문 리뷰] Securing Your Transactions: Detecting Anomalous Patterns In XML Documents

Eitan Menahem, Alon Schclar|arXiv (Cornell University)|2012. 09. 09.
Network Security and Intrusion Detection참고 문헌 34인용 수 5
한 줄 요약

이 논문은 XML 문서의 구조적 특성과 내용 기반 특성을 추출하여 고정 길이의 벡터로 변환함으로써 비정상적인 XML 트랜잭션을 탐지하기 위한 기계학습 프레임워크인 XML-AD를 제안한다. 이 프레임워크는 새로운 다변량 알고리즘인 ADIFA를 사용하여 네 개의 실세계 XML 데이터셋에서 89% 이상의 참 양성 탐지율과 0.2% 미만의 거짓 양성 비율을 달성한다.

ABSTRACT

XML transactions are used in many information systems to store data and interact with other systems. Abnormal transactions, the result of either an on-going cyber attack or the actions of a benign user, can potentially harm the interacting systems and therefore they are regarded as a threat. In this paper we address the problem of anomaly detection and localization in XML transactions using machine learning techniques. We present a new XML anomaly detection framework, XML-AD. Within this framework, an automatic method for extracting features from XML transactions was developed as well as a practical method for transforming XML features into vectors of fixed dimensionality. With these two methods in place, the XML-AD framework makes it possible to utilize general learning algorithms for anomaly detection. Central to the functioning of the framework is a novel multi-univariate anomaly detection algorithm, ADIFA. The framework was evaluated on four XML transactions datasets, captured from real information systems, in which it achieved over 89% true positive detection rate with less than a 0.2% false positive rate.

연구 동기 및 목표

  • 사이버 공격 또는 일반적인 오류로 인해 발생할 수 있는 비정상적인 XML 트랜잭션으로 인한 보안 위협을 해결하기 위해.
  • 실세계 정보 시스템 내 XML 문서에 적용 가능한 일반 목적의 이상 탐지 프레임워크를 개발하기 위해.
  • 기존 XML 보안 프로토콜을 보완하여 처리 이전에 악성 또는 오류가 있는 XML 트랜잭션의 엔드포인트 탐지를 가능하게 하기 위해.
  • 고차원 XML 특성 공간에서 기존 다변량 이상 탐지 방법의 한계를 극복하기 위해.
  • XML-파이어월 시스템이나 보안 모니터링 파이프라인에 통합 가능한 실용적이고 확장 가능한 솔루션을 만들기 위해.

제안 방법

  • XML 문서에서 구조적 특성과 내용 기반 특성을 모두 반영하는 자동 특성 추출 방법을 제안한다.
  • 복잡한 XML 특성을 일반 목적의 이상 탐지 알고리즘과 호환되는 형식으로 변환하기 위해 고정 길이의 특성 벡터 변환(인스턴스 평탄화)을 도입한다.
  • 단변량 모델을 집계 함수(AM, GM, HM)를 사용해 통합하는 방식으로 개선된 내성적 복원력을 확보한 새로운 다변량 이상 탐지 알고리즘인 ADIFA를 개발한다.
  • 정보 손실을 최소화하기 위해 평탄화 과정 동안 중요한 값을 유지하는 계층적 특성 표현 방식을 적용한다.
  • 변환된 특성 벡터에 표준 기계학습 이상 탐지 알고리즘(예: 1-SVM, LOF, OC-GDE, OC-PGA)을 적용한다.
  • UCI 기준 데이터셋에서 AUC 및 순위 기반 평가를 통해 ADIFA를 다변량 기준과 비교한다.

실험 결과

연구 질문

  • RQ1일반 목적의 프레임워크는 악성 공격과 일반적인 오류로 인한 XML 트랜잭션의 이상을 탐지할 수 있는가?
  • RQ2제안된 특성 추출 및 평탄화 방법은 이상 탐지에 유의미한 정보를 유지하는 데 얼마나 효과적인가?
  • RQ3다변량 이상 탐지 방법에 비해 다변량 ADIFA 알고리즘이 고차원 XML 특성 공간에서 더 우수한 성능을 보이는가?
  • RQ4실세계 XML 트랜잭션 데이터셋에서 XML-AD의 탐지 성능은 참 양성 비율과 거짓 양성 비율 측면에서 어떻게 되는가?
  • RQ5ADIFA는 다양한 데이터 도메인 간에서 일반화되어 높은 탐지 정확도를 유지할 수 있는가?

주요 결과

  • XML-AD 프레임워크는 네 개의 실세계 XML 트랜잭션 데이터셋에서 참 양성 탐지율이 89%를 초과하는 성과를 달성했다.
  • 프레임워크는 거짓 양성 비율이 0.2% 이하를 유지하여 정상 트랜잭션과 비정상 트랜잭션를 구분하는 데 높은 정밀도를 보였다.
  • ADIFA는 AUC 측면에서 네 가지 다변량 이상 탐지 알고리즘(1-SVM, OC-PGA, OC-GDE, LOF)을 모두 초월했으며, ADIA-GM가 통계적으로 유의미하게 뛰어난 성능을 보였다.
  • 비모수적 Bonferroni-Dunn 검정을 통해 ADIFA 변종이 다변량 기준보다 유의미하게 뛰어난 성능을 보였으며, ADIFA 변종 간 유의미한 차이는 없었다.
  • 고정 길이의 특성 변환 방식은 차원 축소에도 불구하고 핵심적인 구분 정보를 유지하여 정보 손실를 최소화했다.
  • 프레임워크는 다양한 UCI 기준 데이터셋에서 강력한 일반화 성능을 보였으며, 특정 XML 응용 도메인을 초월한 안정성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.