[論文レビュー] Untargeted Backdoor Attack against Object Detection
本稿では、トリガーを注入した後、物体のバウンディングボックスを削除することで、デジタルおよび物理的環境においても高い有効性を示し、一般的な防御に対しても耐性を示す、狙いを定めないバックドア攻撃を提案している。攻撃は、トリガーが付加された物体の検出を失敗させるが、悪意のないサンプルでは通常の性能を維持する。
Recent studies revealed that deep neural networks (DNNs) are exposed to backdoor threats when training with third-party resources (such as training samples or backbones). The backdoored model has promising performance in predicting benign samples, whereas its predictions can be maliciously manipulated by adversaries based on activating its backdoors with pre-defined trigger patterns. Currently, most of the existing backdoor attacks were conducted on the image classification under the targeted manner. In this paper, we reveal that these threats could also happen in object detection, posing threatening risks to many mission-critical applications ($e.g.$, pedestrian detection and intelligent surveillance systems). Specifically, we design a simple yet effective poison-only backdoor attack in an untargeted manner, based on task characteristics. We show that, once the backdoor is embedded into the target model by our attack, it can trick the model to lose detection of any object stamped with our trigger patterns. We conduct extensive experiments on the benchmark dataset, showing its effectiveness in both digital and physical-world settings and its resistance to potential defenses.
研究の動機と目的
- 第三者または信頼できないデータで訓練されたオブジェクト検出モデルがバックドア攻撃に対して脆弱であることを明らかにすること。
- モデルアーキテクチャや学習手順にアクセスできない状況でも、データ汚染のみで実行可能な、狙いを定めないバックドア攻撃を設計すること。
- 悪意のないサンプルでのモデル精度を維持しながら、汚染されたサンプルでの性能を低下させることで、攻撃の隠蔽性を確保すること。
- デジタルおよび物理的環境での攻撃の有効性を評価し、印刷されたトリガーを用いた実世界での展開も含めること。
- ファインチューニングやモデルプルーニングなどの一般的なバックドア防御手法に対する耐性をテストすること。
提案手法
- 攻撃は、訓練画像内のランダムに選択された物体の中心に事前に定義されたトリガーパattersを挿入する。
- トリガーパターンの挿入後、その物体のバウンディングボックスのアノテーションを、幅と高さをゼロに設定することで削除する。
- これにより、モデルがトリガーを含む物体を無視するように学習する潜在的なバックドアが形成され、モデルアーキテクチャや損失関数に変更を加えずに済む。
- 汚染された訓練データセットを用いて被害者の検出器を再訓練し、悪意のないデータでの性能を維持する。
- 推論時、トリガーがバックドアを活性化させ、モデルが物体の検出に失敗する。
- 本手法は、デジタル(直接的な画像変更)および物理的(印刷されたトリガーパッチ)の両設定で評価される。

実験結果
リサーチクエスチョン
- RQ1モデルアーキテクチャや学習手順にアクセスできない状況でも、データ汚染のみでオブジェクト検出モデルに対して効果的なバックドア攻撃を実行できるか?
- RQ2攻撃はデジタルおよび物理的環境の両方でどの程度有効か?
- RQ3攻撃はどの程度隠蔽性を保っているか?悪意のないサンプルでは高い精度を維持しながら、汚染されたサンプルでの性能を著しく低下させているか?
- RQ4ファインチューニングやモデルプルーニングなどの一般的なバックドア防御手法に対して、攻撃はどの程度耐性を示すか?
- RQ5トリガーパターンの選択が攻撃の成功率に顕著な影響を与えるか?
主な発見
- 評価されたすべてのモデルで、汚染されたデータセットにおけるmAPが11%未満に低下した一方、悪意のないデータセットでは元のモデルと比較して1〜2%の差にとどまった。
- 汚染されたデータセットにおけるAP50が30%以上低下したが、汚染されたテストセットでのモデル性能は安定したままだった。
- 物理的環境でも攻撃は有効であり、スマートフォンカメラで撮影された印刷されたトリガーパッチが付加された物体をモデルが検出しなかった。
- 四角形、十字、円、星などの異なるトリガーパターンでも、類似した攻撃成功率を示し、トリガーデザインに対して高い耐性があることが示された。
- ファインチューニングに対しても攻撃は耐性を示し、10%の悪意のないサンプルでファインチューニングを行った後でも、汚染されたmAPは15%未満に保たれた。
- モデルプルーニングにより、汚染されたmAPはさらに低下し、攻撃は耐性を示すだけでなく、プルーニング防御によって強化される可能性があることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。