Skip to main content
QUICK REVIEW

[論文レビュー] Cost-Aware Robust Tree Ensembles for Security Applications

Yizheng Chen, Shiqi Wang|arXiv (Cornell University)|Dec 3, 2019
Network Security and Intrusion Detection参考文献 59被引用数 6
ひとこと要約

本稿では、ノード分割時の制約として非対称で特徴量別に異なる操作コストをモデル化することにより、セキュリティ応用における木アンサンブルモデル向けのコストを考慮したロバストトレーニング手法を提案する。勾配ブースティング決定木およびランダムフォレストにドメイン固有のコスト知識を統合することで、ベースラインと比較して敵対的回避コストを10.6倍に向上させつつ、正解率を向上させ、偽陽性を低減した。

ABSTRACT

There are various costs for attackers to manipulate the features of security classifiers. The costs are asymmetric across features and to the directions of changes, which cannot be precisely captured by existing cost models based on $L_p$-norm robustness. In this paper, we utilize such domain knowledge to increase the attack cost of evading classifiers, specifically, tree ensemble models that are widely used by security tasks. We propose a new cost modeling method to capture the feature manipulation cost as constraint, and then we integrate the cost-driven constraint into the node construction process to train robust tree ensembles. During the training process, we use the constraint to find data points that are likely to be perturbed given the feature manipulation cost, and we use a new robust training algorithm to optimize the quality of the trees. Our cost-aware training method can be applied to different types of tree ensembles, including gradient boosted decision trees and random forest models. Using Twitter spam detection as the case study, our evaluation results show that we can increase the attack cost by 10.6X compared to the baseline. Moreover, our robust training method using cost-driven constraint can achieve higher accuracy, lower false positive rate, and stronger cost-aware robustness than the state-of-the-art training method using $L_\infty$-norm cost model. Our code is available at https://github.com/surrealyz/growtrees.

研究の動機と目的

  • 均一で対称的な特徴量摂動コストを仮定する既存の$L_p$-ノルムロバストネスモデルの限界を解決すること。これは現実のセキュリティシナリオを反映していない。
  • スパム検出などのセキュリティ応用において、特定の特徴量(例:ドメイン名)を変更するコストが他の特徴量(例:サーバホスティング)よりも低いなど、非対称で特徴量別に異なる操作コストをモデル化すること。
  • コスト駆動の制約を木のノード分割プロセスに統合するロバストトレーニングフレームワークを開発し、現実的な攻撃者に対してより耐性を持つようにすること。
  • コストを考慮したトレーニングが、木アンサンブルモデルにおいて$L_\infty$-ベースの手法と比較して、より高い正解率、低い偽陽性率、および強固なロバストネスを達成することを実証すること。

提案手法

  • ドメイン知識に基づく特徴量操作コストを、データポイントごとの摂動制約に変換するコストモデリング手法を提案。これにより、特徴量間および方向ごとの非対称コストを捉える。
  • ゲイン指標(例:ジニ不純度、情報ゲイン)の最大化問題を、制限付きでコストを考慮した摂動の下で定式化することにより、コスト駆動の制約をノード分割プロセスに統合する。
  • 勾配ブースティング決定木およびランダムフォレストを含む、さまざまな木アンサンブルタイプに対応する、効率的なロバストトレーニングアルゴリズムを設計する。
  • 混合整数線形計画法(MILP)アタッカーを用いて、コスト制約下での最強のホワイトボックス攻撃をシミュレートし、適応的回避コストの評価を可能にする。
  • 最強の攻撃者をターゲットとするコスト駆動制約の最小化を目的関数として定義し、実際のロバストネスを測定するための適応的攻撃コスト関数を定義する。
  • スプリットレベルに制約を適用することで、AdaBoost、GBM、その他の木アンサンブルフレームワークへの統合を可能とし、さまざまな木ベースのモデルへの一般化を支援する。

実験結果

リサーチクエスチョン

  • RQ1非対称で特徴量別に異なる操作コストを反映するコストを考慮した制約は、セキュリティ応用における木アンサンブルモデルのロバストネスを向上させることができるか?
  • RQ2コストを考慮したロバストトレーニングは、$L_\infty$-ノルムに基づくロバストトレーニングと比較して、正解率、偽陽性率、および敵対的ロバストネスの観点でどのように異なるか?
  • RQ3コストを考慮したトレーニングは、現実的な脅威モデルにおいて、攻撃者が必要な最小回避コストをどの程度まで向上させられるか?
  • RQ4提案手法は、ランダムフォレストや勾配ブースティング決定木などの異なる種類の木アンサンブルモデルに一般化可能か?
  • RQ5コスト駆動の制約をチューニングする際、正解率、偽陽性率、ロバストネスの間にはどのようなトレードオフが生じるか?

主な発見

  • 提案手法は、Twitterスパム検出において、ベースラインモデルと比較して適応的回避コストを10.6倍に向上させた。
  • 勾配ブースティング決定木では、最先端の$L_\infty$-ベース手法と比較して1.25倍高いロバストネスを達成し、ランダムフォレストでは1.7倍高いロバストネスを示した。
  • $L_\infty$-ベースのモデルと比較して、コストを考慮したアプローチは、より高い正解率と低い偽陽性率を達成しながら、コストを考慮した攻撃者に対する強いロバストネスを維持した。
  • 本手法は勾配ブースティング決定木およびランダムフォレストの両方に対して効果的に一般化され、モデルタイプを問わず一貫した性能向上を示した。
  • 4つのベンチマークデータセットにおける評価では、コストを考慮したモデルが$L_1$および$L_2$-ベースのベースラインを上回るロバストネスとモデルパフォーマンスを達成した。特にM6およびM19では、$L_1$/$L_2$の回避距離が大きく向上した。
  • 制約ハイパーパrameterのチューニングにより、正解率、偽陽性率、ロバストネスの間のより良いトレードオフを実現でき、最適なパフォーマンスが達成可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。