Skip to main content
QUICK REVIEW

[論文レビュー] SoK: Applying Machine Learning in Security - A Survey

Heju Jiang, Jasvir Nagra|arXiv (Cornell University)|Nov 10, 2016
Advanced Malware Detection Techniques参考文献 44被引用数 20
ひとこと要約

本サーベイは2008年から2016年までのサイバーセキュリティ分野における機械学習(ML)の応用を体系的に分析し、トップセキュリティおよびML会議で発表された関連研究の98%を統合している。MLパラダイムとセキュリティ分野の分類法を提示し、主な課題を特定するとともに、従来のMLタスクではなく、戦略的で適応的な敵対的モデリングを重視するゲーム理論的問題としてセキュリティを捉えるべきだと提言している。

ABSTRACT

The idea of applying machine learning(ML) to solve problems in security domains is almost 3 decades old. As information and communications grow more ubiquitous and more data become available, many security risks arise as well as appetite to manage and mitigate such risks. Consequently, research on applying and designing ML algorithms and systems for security has grown fast, ranging from intrusion detection systems(IDS) and malware classification to security policy management(SPM) and information leak checking. In this paper, we systematically study the methods, algorithms, and system designs in academic publications from 2008-2015 that applied ML in security domains. 98 percent of the surveyed papers appeared in the 6 highest-ranked academic security conferences and 1 conference known for pioneering ML applications in security. We examine the generalized system designs, underlying assumptions, measurements, and use cases in active research. Our examinations lead to 1) a taxonomy on ML paradigms and security domains for future exploration and exploitation, and 2) an agenda detailing open and upcoming challenges. Based on our survey, we also suggest a point of view that treats security as a game theory problem instead of a batch-trained ML problem.

研究の動機と目的

  • 2008年から2016年までの機械学習を用いたセキュリティ分野への応用の最先端状況を体系化し、分類すること。
  • MLベースのセキュリティシステムに共通するシステム設計、仮定、評価指標を特定すること。
  • 特に敵対的かつ動的環境において顕在化する課題を強調する新しい研究アジェンダを提言すること。
  • 攻撃者と防御者の相互作用を静的分類問題ではなく、戦略的で適応的なゲームと捉えるゲーム理論的視点を提唱すること。
  • 今後の研究開発を支援するため、MLパラダイムとセキュリティユースケースの構造的分類を提供すること。

提案手法

  • 2008年から2016年のはじめまでに、CCS、NDSS、KDD、SP、AISecなどのトップクラスのセキュリティおよびML会議で発表された関連論文の98%を対象とした体系的文献レビューを実施した。
  • セキュリティ分野(例:ネットワークセキュリティ、マルウェア検出、IDS)とMLパラダイム(教師あり、半教師あり、教師なし、HITL、ゲーム理論)に応じてML応用を分類した。
  • 100件以上の研究において、システムアーキテクチャ、特徴工学技術、モデル選択(例:SVM、LR、ランダムフォレスト、ベイジアンモデル、オートエンコーダ)を分析した。
  • AUC、F1スコア、正答率といった標準指標を用いて性能を評価するとともに、データ、ラベル付け、脅威モデルに関する仮定の妥当性も評価した。
  • 防御者が適応的攻撃者から学習するスタッケルベルクに基づくゲーム理論的フレームワークを提案した。戦略的相互作用は損失関数と予測ゲームを通じてモデル化された。
  • 学習者とデータ生成を目的とする敵対的攻撃者との間の動的ゲームとしてセキュリティを捉える画期的な視点を導入した。これは、従来のバッチ学習モデルとは対照的である。

実験結果

リサーチクエスチョン

  • RQ12008年から2016年までのMLベースのセキュリティ応用で、主流となったMLパラダイムとシステム設計は何か?
  • RQ2データ、ラベル付け、攻撃者行動に関する仮定が、セキュリティ分野におけるMLシステムの設計と性能にどのように影響を与えるか?
  • RQ3マルウェア検出、侵入検知、不正検出といった実世界のセキュリティ問題にMLを適用するにあたり、主な課題は何か?
  • RQ4ゲーム理論をMLシステム設計に統合することで、従来のバッチ学習に比べて、敵対的相互作用をより効果的にモデル化できるか?
  • RQ5ゼロデイ攻撃や進化を続ける脅威に対処するにあたり、MLにおける未解決の研究課題と今後の方向性は何か?

主な発見

  • 調査された論文の98%が、トップクラスのセキュリティまたはML会議に掲載されており、2016年時点でこの分野に強い学術的関心と成熟度があることが示された。
  • 教師あり学習がマルウェア検出およびURLスパム検出で支配的であり、SVM-SMO、ロジスティック回帰、カスタムのアクティブラーニングアルゴリズムといったモデルが、高いAUCスコアを達成した。
  • スタッケルベルク予測ゲームやベイジアンゲームを含むゲーム理論的手法は、攻撃者と防御者の間の戦略的行動をモデル化することで、従来のモデルに比べて敵対的環境下で優れた性能を示した。
  • 教師なしおよび半教師あり手法は、ラベル付きデータが不足する状況においても、異常検知(例:PCAによるユーザ行動、n-gramによるネットワークトラフィック)において不可欠な役割を果たした。
  • ラベル付けの負荷を軽減し、リアルタイム環境におけるスケーラビリティを向上させるために、アクティブラーニングやコスト感受性学習が次第にシステム設計に組み込まれるようになった。
  • 本サーベイでは、多くのシステムが攻撃者を静的または受動的であると仮定しているが、現実の脅威は適応的であるという重要なギャップを特定した。これにより、耐性を高めるためにゲーム理論的モデリングの導入が不可欠であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。