Skip to main content
QUICK REVIEW

[논문 리뷰] Cost-Aware Robust Tree Ensembles for Security Applications

Yizheng Chen, Shiqi Wang|arXiv (Cornell University)|2019. 12. 03.
Network Security and Intrusion Detection참고 문헌 59인용 수 6
한 줄 요약

이 논문은 트리 앙상블 모델의 보안 응용 분야에서 비대칭적이고 특성별로 다를 수 있는 조작 비용을 노드 분할 과정에 제약 조건으로 모델링함으로써 비용 인지적 강건한 훈련 방법을 제안한다. 기울기 부스팅 결정 트리와 랜덤 포레스트에 도메인 전문 지식을 통합함으로써, 기준 모델 대비 악성 회피 비용을 10.6배 높이며 정확도를 향상시키고 가짜 경고 수를 감소시킨다.

ABSTRACT

There are various costs for attackers to manipulate the features of security classifiers. The costs are asymmetric across features and to the directions of changes, which cannot be precisely captured by existing cost models based on $L_p$-norm robustness. In this paper, we utilize such domain knowledge to increase the attack cost of evading classifiers, specifically, tree ensemble models that are widely used by security tasks. We propose a new cost modeling method to capture the feature manipulation cost as constraint, and then we integrate the cost-driven constraint into the node construction process to train robust tree ensembles. During the training process, we use the constraint to find data points that are likely to be perturbed given the feature manipulation cost, and we use a new robust training algorithm to optimize the quality of the trees. Our cost-aware training method can be applied to different types of tree ensembles, including gradient boosted decision trees and random forest models. Using Twitter spam detection as the case study, our evaluation results show that we can increase the attack cost by 10.6X compared to the baseline. Moreover, our robust training method using cost-driven constraint can achieve higher accuracy, lower false positive rate, and stronger cost-aware robustness than the state-of-the-art training method using $L_\infty$-norm cost model. Our code is available at https://github.com/surrealyz/growtrees.

연구 동기 및 목표

  • 일관되고 대칭적인 특성 변형 비용을 가정하는 기존의 $L_p$-노름 강건성 모델의 한계를 해결하기 위해, 현실 세계의 보안 시나리오를 반영하지 못하는 점을 다루기 위해.
  • 스팸 검출과 같은 보안 응용 분야에서 특정 특성(예: 도메인 이름)을 변경하는 데 드는 비용이 다른 특성(예: 서버 호스팅)보다 낮을 수 있는 비대칭적이고 특성별로 다를 수 있는 조작 비용을 모델링하기 위해.
  • 비용 기반 제약 조건을 트리 노드 분할 과정에 통합하여 실제 공격자에 대비한 강건성을 향상시키는 강건한 훈련 프레임워크를 개발하기 위해.
  • 비용 인지적 훈련이 트리 앙상블 모델에서 $L_\infty$-기반 방법에 비해 더 높은 정확도, 더 낮은 가짜 경고 비율, 더 강력한 강건성을 제공함을 입증하기 위해.

제안 방법

  • 특성 조작 비용에 대한 도메인 지식을 개별 데이터 포인트의 변형 제약 조건으로 변환하는 비용 모델링 방법을 제안하여, 특성 간 및 방향 간의 비대칭 비용을 포괄한다.
  • 이론적 손실 지표(예: 지니 불순도, 정보 이득)의 최대화 문제를 정의함과 동시에, 제한된 비용 인지적 변형에 대한 제약 조건을 충족하도록 노드 분할 과정에 비용 기반 제약 조건을 통합한다.
  • 기울기 부스팅 결정 트리 및 랜덤 포레스트를 포함한 다양한 트리 앙상블 유형에 적용 가능한 효율적인 강건한 훈련 알고리즘을 설계한다.
  • 비용 제약 조건 하에서 가장 강력한 화이트박스 공격자를 시뮬레이션하기 위해 혼합 정수 선형 프로그래밍(MILP) 공격자를 사용하여 적응형 회피 비용 평가를 가능하게 한다.
  • 비용 기반 제약 조건을 공격 대상으로 삼는 강력한 공격자의 최소화 목표로 적응형 공격 비용 함수를 정의하여 실질적인 강건성 측정을 가능하게 한다.
  • 분할 수준에서 제약 조건을 적용함으로써 다양한 트리 기반 모델에 일반화 가능하게 하여 AdaBoost, GBM 등 다양한 트리 앙상블 프레임워크에 통합할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1비대칭적이고 특성별로 다를 수 있는 조작 비용을 반영하는 비용 인지적 제약 조건이 보안 응용 분야에서 트리 앙상블 모델의 강건성을 향상시킬 수 있는가?
  • RQ2비용 인지적 강건한 훈련 방식은 정확도, 가짜 경고 비율, 그리고 악성 공격에 대한 강건성 측면에서 $L_\infty$-노름 기반 훈련 방식과 비교해 어떻게 다를까?
  • RQ3비용 인지적 훈련이 실제 위협 모델에서 공격자가 필요한 최소 회피 비용을 얼마나 높일 수 있는가?
  • RQ4제안된 방법은 랜덤 포레스트와 기울기 부스팅 결정 트리와 같은 다양한 트리 앙상블 모델 유형으로 일반화될 수 있는가?
  • RQ5비용 기반 제약 조건을 조정할 때 정확도, 가짜 경고 비율, 강건성 간의 상호 보완적 관계는 어떻게 나타나는가?

주요 결과

  • 제안된 비용 인지적 강건한 훈련 방법은 트위터 스팸 검출에서 기준 모델 대비 적응형 회피 비용을 10.6배 높였다.
  • 기울기 부스팅 결정 트리에서는 최신 기술인 $L_\infty$-기반 방법 대비 1.25배 더 높은 강건성을 달성했으며, 랜덤 포레스트에서는 1.7배 더 높은 강건성을 확보했다.
  • $L_\infty$-기반 모델에 비해 비용 인지적 접근 방식은 더 높은 정확도와 더 낮은 가짜 경고 비율을 확보하면서도 비용 인지적 공격자에 대한 강건성을 유지했다.
  • 이 방법은 기울기 부스팅 결정 트리와 랜덤 포레스트 모두에 효과적으로 일반화되어 다양한 모델 유형에서 일관된 성능 향상을 보였다.
  • 네 가지 벤치마크 데이터셋에서의 평가 결과, 비용 인지적 모델은 $L_1$ 및 $L_2$-기반 기준 모델보다 강건성과 모델 성능에서 뛰어난 성능을 보였으며, M6 및 M19에서는 $L_1$/$L_2$ 회피 거리가 더 크게 나타났다.
  • 비용 기반 제약 조건의 초모수 조정을 통해 정확도, 가짜 경고 비율, 강건성 간의 더 나은 트레이드오���을 달성할 수 있었으며, 최적의 성능을 달성할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.