Skip to main content
QUICK REVIEW

[論文レビュー] Can Domain Knowledge Alleviate Adversarial Attacks in Multi-Label Classifiers?

Stefano Melacci, Gabriele Ciravegna|arXiv (Cornell University)|Oct 19, 2020
Adversarial Robustness in Machine Learning参考文献 47被引用数 9
ひとこと要約

本稿では、敵対的攻撃に対して頑健性を向上させるために、1階論理の知識を制約として組み込む半教師ありマルチラベル分類フレームワークを提案する。周辺分布にドメイン知識を強制することで、予測の整合性が保たれ、しばしば敵対的例を示す不整合な予測が検出・除外される。攻撃に関する事前知識がなくても、強力な防御能力を示す。

ABSTRACT

Adversarial attacks on machine learning-based classifiers, along with defense mechanisms, have been widely studied in the context of single-label classification problems. In this paper, we shift the attention to multi-label classification, where the availability of domain knowledge on the relationships among the considered classes may offer a natural way to spot incoherent predictions, i.e., predictions associated to adversarial examples lying outside of the training data distribution. We explore this intuition in a framework in which first-order logic knowledge is converted into constraints and injected into a semi-supervised learning problem. Within this setting, the constrained classifier learns to fulfill the domain knowledge over the marginal distribution, and can naturally reject samples with incoherent predictions. Even though our method does not exploit any knowledge of attacks during training, our experimental analysis surprisingly unveils that domain-knowledge constraints can help detect adversarial examples effectively, especially if such constraints are not known to the attacker. While we also show that an adaptive attack exploiting knowledge of the constraints may still deceive our classifier, it remains an open issue to understand how hard for an attacker would be to infer such constraints in practical cases. For this reason, we believe that our approach may provide a significant step towards designing robust multi-label classifiers.

研究の動機と目的

  • ドメイン知識がマルチラベル分類器の敵対的攻撃に対する頑健性を向上させられるかどうかを調査すること。
  • 分布のずれによって予測が整合性を欠く可能性があるマルチラベル設定における敵対的例の検出の課題に対処すること。
  • 既知のドメイン関係に整合するように、1階論理の制約を組み込んだ半教師あり学習フレームワークを構築すること。
  • このような制約が、敵対的データのトレーニングを明示的に行わずに、自然に敵対入力を拒否できるかどうかを評価すること。
  • 攻撃者が制約の存在を知っている場合に、その方法がどれほど耐性を示すかを評価すること。

提案手法

  • クラス間の関係に関するドメイン知識を表す1階論理ルールを、モデルの学習に適した微分可能制約に変換する。
  • 半教師あり学習フレームワークを採用し、分類器がラベルの周辺分布上でこれらの制約を満たすように最適化する。
  • 論理的制約に違反する予測をモデルが学習して排除する。これは、しばしば訓練データ分布外にある敵対的入力に対応する。
  • トレーニング中に敵対的例を必要とせず、ドメイン制約下での予測の不整合性に依存して敵対的入力を検出する。
  • 訓練時および推論時の両方で制約を適用し、既知のドメイン関係に一貫性を保つ。
  • 非適応的攻撃と適応的攻撃の両方のシナリオでフレームワークを評価し、頑健性を検証する。

実験結果

リサーチクエスチョン

  • RQ1半教師あり学習フレームワークにおけるドメイン知識制約は、マルチラベル分類における敵対的例の検出に有効に機能するか?
  • RQ2攻撃者が制約を把握していない状況でも、この手法は敵対的例の検出にどの程度効果的か?
  • RQ3適応的攻撃者が制約を学習することで、防御を回避できる程度はどの程度か?
  • RQ4敵対的データをトレーニングに使用せずに、論理的制約の統合が頑健性を向上させられるか?
  • RQ5制約構造を標的とする適応的攻撃に対して、モデルの性能はどの程度低下するか?

主な発見

  • 提案手法は、ドメイン知識制約に違反する不整合な予測を特定することで、マルチラベル分類における敵対的例を効果的に検出する。
  • トレーニング中に敵対的例に事前にさらされていなくても、特に攻撃者が制約を知らない場合に強い防御性能を示す。
  • 制約を把握している適応的攻撃者でさえも、成功する攻撃を実行できるため、制約の知識は脆弱性であることが示された。
  • 攻撃者が制約の完全なセットを推論する可能性が低い実用的状況では、この手法は依然として頑健性を保つ。
  • 半教師あり学習に論理的制約を統合することで、分布外の敵対的予測を自然に拒否するメカニズムが得られる。
  • 結果から、ドメイン知識はマルチラベル設定において有望な軽量な防御メカニズムとなり得ることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。