Skip to main content
QUICK REVIEW

[論文レビュー] Assembling a Cyber Range to Evaluate Artificial Intelligence / Machine Learning (AI/ML) Security Tools

Jeffrey A. Nichols, Kevin D. Spakes|arXiv (Cornell University)|Jan 20, 2022
Network Security and Intrusion Detection被引用数 4
ひとこと要約

本論文では、オールドリッジ国立研究所で開発されたスケーラブルでプログラマブルなサイバーレンジを紹介する。このレーンジは、繰り返し可能で制御された実験を通じて、AI/MLベースのサイバーセキュリティツールの評価を可能にする。自動化された高忠実度のシミュレーションを大規模なネットワーク環境で実行可能であり、10万件のファイルサンプルとマルチステージのサイバー攻撃を含む2つの国際的チャレンジで実証された。政府規模のネットワークを想定した現実的で標準化された環境において、AI/MLツールのパフォーマンスと運用コストの繰り返し可能な評価を提供する。

ABSTRACT

In this case study, we describe the design and assembly of a cyber security testbed at Oak Ridge National Laboratory in Oak Ridge, TN, USA. The range is designed to provide agile reconfigurations to facilitate a wide variety of experiments for evaluations of cyber security tools -- particularly those involving AI/ML. In particular, the testbed provides realistic test environments while permitting control and programmatic observations/data collection during the experiments. We have designed in the ability to repeat the evaluations, so additional tools can be evaluated and compared at a later time. The system is one that can be scaled up or down for experiment sizes. At the time of the conference we will have completed two full-scale, national, government challenges on this range. These challenges are evaluating the performance and operating costs for AI/ML-based cyber security tools for application into large, government-sized networks. These evaluations will be described as examples providing motivation and context for various design decisions and adaptations we have made. The first challenge measured end-point security tools against 100K file samples (benignware and malware) chosen across a range of file types. The second is an evaluation of network intrusion detection systems efficacy in identifying multi-step adversarial campaigns -- involving reconnaissance, penetration and exploitations, lateral movement, etc. -- with varying levels of covertness in a high-volume business network. The scale of each of these challenges requires automation systems to repeat, or simultaneously mirror identical the experiments for each ML tool under test. Providing an array of easy-to-difficult malicious activity for sussing out the true abilities of the AI/ML tools has been a particularly interesting and challenging aspect of designing and executing these challenge events.

研究の動機と目的

  • AI/MLベースのサイバーセキュリティツールを現実的なネットワーク環境で評価できる柔軟で再構成可能なサイバーレンジの設計および展開を目的とする。
  • 公平で標準化されたベンチマーク評価を可能にするために、プログラム可能なデータ収集と繰り返し可能な実験を可能とする。
  • マルチステージのサイバー攻撃を含む多様な脅威シナリオにおいて、AI/MLツールのスケーラブルかつ高ボリュームの評価を支援する。
  • 自動化とモジュラー・アーキテクチャを通じて運用の負荷を低減し、再現性を向上させる。
  • 政府規模のネットワークと現実世界の脅威プロファイルを想定した、国レベルのサイバーセキュリティチャレンジのためのスケーラブルなテストベッドを提供する。

提案手法

  • 仮想化およびコンテナ化された環境を用いて、設定可能なトポロジーを持つエンタープライズ規模のネットワークをシミュレートする。
  • ネットワークトラフィック、システム状態、脅威の注入をプログラムで制御可能にすることで、繰り返し可能な実験を可能にする。
  • 評価中にツールの挙動、検出率、パフォーマンスメトリクスをログ記録するための自動化されたデータ収集パイプラインを統合する。
  • 一貫したベンチマーク評価を可能にするために、良性ソフトウェアとマルウェアを含む10万件のファイルサンプルを含む、合成的だが現実的なデータセットを活用する。
  • 同じ実験を複数のAI/MLツールで並列実行できるアーキテクチャを備え、直接比較を可能にする。
  • 実験のニーズに応じてスケールアップまたはスケールダウンが可能な設計となっており、小規模な検証から大規模な国際的チャレンジまで対応可能。

実験結果

リサーチクエスチョン

  • RQ1どのようにすれば、現実的なネットワーク環境において、AI/MLベースのセキュリティツールの繰り返し可能で大規模な評価を可能にするサイバーレンジをアーキテクチャ設計できるか?
  • RQ2多様なAI/ML評価シナリオに対応するための、迅速な再構成とプログラムによる制御を可能にするシステム設計パターンは何か?
  • RQ3高忠実度でスケーラブルなマルチステージのサイバー攻撃シミュレーションをどのように生成・スケーリングし、AI/MLツールの検出能力を評価できるか?
  • RQ4公平なベンチマーク評価を実現するため、複数のAI/MLツールに対して同時に同一条件で実験を実行するための自動化メカニズムは何か?
  • RQ5政府規模のネットワークシミュレーションにおいて、AI/MLツールの運用コストとパフォーマンスを一貫して測定するにはどのような仕組みが必要か?

主な発見

  • サイバーレンジは、AI/MLツールを対象とした2回の本格的国際チャレンジを成功裏に支援し、スケーラビリティと再利用可能性を実証した。
  • 複数のAI/MLツールにわたる一貫したデータ収集が可能な、繰り返し可能でプログラム可能な実験実行を可能にした。
  • 10万件のファイルサンプルを用いたエンドポイントセキュリティツールの評価により、マルウェア検出性能の標準化ベンチマークが得られた。
  • ネットワークイントラーショントラフィック検知のチャレンジでは、隠蔽度の異なる多段階の敵対的キャンペーンをシミュレートし、AI/MLツールの検出限界をテストした。
  • 自動化インfraにより、同一条件下で複数のAI/MLツールを同時に実行・比較可能となり、公平で再現可能な結果が得られた。
  • テストベッドのモジュラー設計により、新たな脅威モデルや評価要件に迅速に再構成・適応可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。