[論文レビュー] Automated Machine Learning for Deep Learning based Malware Detection
本稿では、マルウェア検出のためのディープラーニングモデルの設計およびハイパーパramータチューニングを自動化するために、自動機械学習(AutoML)の使用を提案している。この手法は、最先端の手作業で設計されたモデルと同等またはそれ以上の性能を達成している。静的解析(SOREL-20MおよびEMBER-2018)およびクラウドIaaS環境におけるオンライン型マルウェア検出において、AutoMLの有効性を示しており、ノイズが多く、現実世界の条件に近い状況下でも優れた耐障害性を示し、熟練者の介入を最小限に抑えている。
Deep learning (DL) has proven to be effective in detecting sophisticated malware that is constantly evolving. Even though deep learning has alleviated the feature engineering problem, finding the most optimal DL model, in terms of neural architecture search (NAS) and the model's optimal set of hyper-parameters, remains a challenge that requires domain expertise. In addition, many of the proposed state-of-the-art models are very complex and may not be the best fit for different datasets. A promising approach, known as Automated Machine Learning (AutoML), can reduce the domain expertise required to implement a custom DL model. AutoML reduces the amount of human trial-and-error involved in designing DL models, and in more recent implementations can find new model architectures with relatively low computational overhead. This work provides a comprehensive analysis and insights on using AutoML for static and online malware detection. For static, our analysis is performed on two widely used malware datasets: SOREL-20M to demonstrate efficacy on large datasets; and EMBER-2018, a smaller dataset specifically curated to hinder the performance of machine learning models. In addition, we show the effects of tuning the NAS process parameters on finding a more optimal malware detection model on these static analysis datasets. Further, we also demonstrate that AutoML is performant in online malware detection scenarios using Convolutional Neural Networks (CNNs) for cloud IaaS. We compare an AutoML technique to six existing state-of-the-art CNNs using a newly generated online malware dataset with and without other applications running in the background during malware execution.In general, our experimental results show that the performance of AutoML based static and online malware detection models are on par or even better than state-of-the-art models or hand-designed models presented in literature.
研究の動機と目的
- AutoMLを用いたマルウェア検出におけるディープラーニングモデル開発の実現可能性を評価すること。
- アーキテクチャ探索およびハイパーパramータチューニングの自動化により、機械学習およびマルウェア分析分野におけるドメイン知識への依存を低減すること。
- 大規模な静的マルウェアデータセット(SOREL-20M)および困難な、敵対的に選別されたデータセット(EMBER-2018)におけるAutoMLの性能を評価すること。
- クラウドIaaS環境におけるリアルタイム実行データを用いたオンラインマルウェア検出シナリオでのAutoMLの評価。
- NASおよびハイパーパramータチューニングのパラメータが、ノイズのある条件下でのモデル性能および耐障害性に与える影響を調査すること。
提案手法
- 静的マルウェアデータセット(SOREL-20MおよびEMBER-2018)において、ニューラルアーキテクチャサーチ(NAS)およびハイパーパramータ最適化を実施するため、AutoMLフレームワークを採用した。
- AutoMLパイプライン内で、フィードフォワードニューラルネットワーク(FFNN)および畳み込みニューラルネットワーク(CNN)を基本アーキテクチャとして使用した。
- クラウドIaaS環境におけるオンラインマルウェア検出のため、ワンショットAutoMLを用いてカスタムCNNアーキテクチャを発見した。
- NASプロセスのパラメータをチューニングし、その影響がモデル性能および耐障害性に与える影響を評価した。
- 背景アプリケーションのノイズあり・なしの両状態で、新たに収集したオンラインマルウェアデータセットに対して、AutoMLが生成したモデルと6つの最先端CNNモデルを比較した。
- モデルの汎化性能を向上させるために、補助ラベルおよびマルチオブジェクティブ最適化(例:微分可能進化)を組み込んだ。

実験結果
リサーチクエスチョン
- RQ1大規模かつ困難なデータセットにおける静的マルウェア検出のためのAutoMLによるディープラーニングモデル設計の自動化は、実際に効果的であるか?
- RQ2静的マルウェア検出において、異なるNASおよびハイパーパramータチューニング設定におけるAutoMLの性能はどのように変化するか?
- RQ3現実世界のノイズ環境下において、AutoMLは手作業で設計された最先端のCNNよりも、より耐障害性が高く、性能の優れたモデルを生成できるか?
- RQ4補助ラベルの導入が、AutoMLプロセスおよび最終的なモデル性能にどのような影響を与えるか?
- RQ5AutoMLは、マルウェアおよびディープラーニング分野における熟練知識の必要性をどの程度低減できるか、かつ、検出精度を維持または向上させることができるか?
主な発見
- AutoMLが生成したモデルは、SOREL-20MおよびEMBER-2018の両データセットで、最先端の手作業で設計されたモデルと同等またはそれ以上の性能を達成した。
- オンラインマルウェア検出において、特に現実世界のノイズ環境に近い条件下で、AutoMLアプローチが優れた耐障害性を示した。
- AutoMLは、人手で設計するのは困難な複雑なセル構造を持つCNNアーキテクチャを発見し、既存の最先端CNNを上回る性能を発揮した。
- 入力データのノイズが増加するにつれて、AutoMLモデルと手作業モデルの性能差が拡大したため、現実的な条件下での汎化性能の向上が示された。
- NASパラメータのチューニングがモデル性能に顕著な影響を与えたため、マルウェア検出におけるAutoMLパイプラインの構成が重要であることがわかった。
- AutoMLは、モデル設計およびハイパーパramータチューニングにおける熟練者の介入を低減しながらも、高い検出精度を維持した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。