Skip to main content
QUICK REVIEW

[論文レビュー] An Efficient Adversarial Attack for Tree Ensembles

Chong Zhang, Huan Zhang|arXiv (Cornell University)|Oct 22, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用数 7
ひとこと要約

本稿では、XGBoost やランダムフォレストのようなツリーエンsemble向けに、離散的探索に基づく新たな敵対的攻撃手法 LT-Attack を提案する。この手法は、最小の摂動を求めるために、ハミング距離1の近傍内でのリーフタプル最適化に攻撃を再定式化する。MILP より最大 80,000 倍の高速化を達成し、意思決定ベースの攻撃よりも小さな摂動を生成する。ツリーエンsembleのロバストネスを評価するための実用的ベンチマークを提供する。

ABSTRACT

We study the problem of efficient adversarial attacks on tree based ensembles such as gradient boosting decision trees (GBDTs) and random forests (RFs). Since these models are non-continuous step functions and gradient does not exist, most existing efficient adversarial attacks are not applicable. Although decision-based black-box attacks can be applied, they cannot utilize the special structure of trees. In our work, we transform the attack problem into a discrete search problem specially designed for tree ensembles, where the goal is to find a valid "leaf tuple" that leads to mis-classification while having the shortest distance to the original input. With this formulation, we show that a simple yet effective greedy algorithm can be applied to iteratively optimize the adversarial example by moving the leaf tuple to its neighborhood within hamming distance 1. Experimental results on several large GBDT and RF models with up to hundreds of trees demonstrate that our method can be thousands of times faster than the previous mixed-integer linear programming (MILP) based approach, while also providing smaller (better) adversarial examples than decision-based black-box attacks on general $\ell_p$ ($p=1, 2, \infty$) norm perturbations. Our code is available at https://github.com/chong-z/tree-ensemble-attack.

研究の動機と目的

  • GBDT やランダムフォレストのようなツリーベースのアンサンブルに対する、効率的で高品質な敵対的攻撃手法の不足を解消すること。
  • 微分不能で区分的定数関数であるツリーモデルに対して、勾配ベースおよび意思決定ベースの攻撃の限界を克服すること。
  • 離散的構造を活用しながら、最小の敵対的摂動を効率的かつスケーラブルに特定する実用的でスケーラブルな手法を開発すること。
  • ニューラルネットワークの FGSM や PGD に類似した、ツリーエンsembleモデルのロバストネスを評価するためのベンチマークツールを提供すること。

提案手法

  • 入力空間を、各ツリーのリーフ数 N とツリー数 K に基づく離散的 {1,2,...,N}^K リーフタプル空間に変換する。
  • 入力間の距離を、それらのリーフタプル間のハミング距離として定義することで、離散最適化を可能にする。
  • ハミング距離1の近傍内での最良の隣接タプルにリーフタプルを逐次移動させることで、敵対的例を改善する。
  • ツリーサイズの独立性を活用し、近傍空間をグリーディー戦略で探索する。
  • 誤分類を保証しつつ、最小の ℓp(p=1,2,∞)ノルム摂動を最適化する。
  • 勾配計算や数値推定を回避する離散的探索フレームワークを採用することで、効率的かつ効果的な手法を実現する。

実験結果

リサーチクエスチョン

  • RQ1離散的探索ベースの手法は、ツリーエンsembleに対する既存の勾配ベースおよび意思決定ベースの攻撃と比較して、効率性と摂動品質の両面で優れているか?
  • RQ2軽量でグリーディーなアルゴリズムを用いて、離散的リーフタプル空間上でツリーエンsembleの近似的最適な敵対的例を達成することは可能か?
  • RQ3MILPに基づく正確なソルバーや意思決定ベースのブラックボックス攻撃と比較して、本手法の速度と摂動サイズはどのように異なるか?
  • RQ4本手法は、複雑さやサイズが異なる多様なツリーエンsembleモデルやデータセットに一般化可能か?
  • RQ5初期例の数が攻撃の品質と効率に与える影響は何か?

主な発見

  • HIGGS などの大規模モデルでは、MILPと比較して最大 80,000 倍の高速化を達成。1テスト例あたり 0.237 秒(MILP は 375 秒)。
  • MNIST では、LT-Attack は最適な MILP 解に対して ℓ∞ 摂動が 2.07 倍に留まり、MILP よりも 1,580 倍高速であった。
  • ℓ2 ノルムでは、9つのデータセットのうち7つで ¯r/r∗ 確率比が 1.00 を達成し、近似的最適な摂動品質を示した。
  • Fashion-MNIST では、最適 ℓ2 摂動の 1.33 倍(HSJA は 2.15 倍、Cube は 4.59 倍)で、MILP よりも 93 倍高速であった。
  • すべてのデータセットで摂動サイズにきびしいバウンダリーを維持し、covtype や HIGGS のような大規模モデルでも ℓ2 確率比は 1.00 に近く、良好な性能を発揮した。
  • 実行時間解析から、LT-Attack はすべてのデータセットで SignOPT や HSJA、Cube よりも一貫して高速であり、14 倍から 80,000 倍の高速化を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。