[論文レビュー] New Datasets for Dynamic Malware Classification
本論文は、APIコールベースの分析を用いた動的マルウェア分類のための、2つの新しいアップデート済みデータセット—VirusSamplesから9,795件のサンプル、VirusShareから14,616件のサンプルを紹介する。4つの機械学習モデル(SVM、XGBoost、ランダムフォレスト、ヒストグラムベース勾配ブースティング)を、バランス型とアンバランス型のバージョンで評価し、アンバランス型のVirusSampleデータセットではSVMが94%の精度を達成、VirusShareデータセットの両バージョンではXGBoostが90%の精度を記録した。これにより、今後の研究のためのベースライン結果が確立された。
Nowadays, malware and malware incidents are increasing daily, even with various anti-viruses systems and malware detection or classification methodologies. Many static, dynamic, and hybrid techniques have been presented to detect malware and classify them into malware families. Dynamic and hybrid malware classification methods have advantages over static malware classification methods by being highly efficient. Since it is difficult to mask malware behavior while executing than its underlying code in static malware classification, machine learning techniques have been the main focus of the security experts to detect malware and determine their families dynamically. The rapid increase of malware also brings the necessity of recent and updated datasets of malicious software. We introduce two new, updated datasets in this work: One with 9,795 samples obtained and compiled from VirusSamples and the one with 14,616 samples from VirusShare. This paper also analyzes multi-class malware classification performance of the balanced and imbalanced version of these two datasets by using Histogram-based gradient boosting, Random Forest, Support Vector Machine, and XGBoost models with API call-based dynamic malware classification. Results show that Support Vector Machine, achieves the highest score of 94% in the imbalanced VirusSample dataset, whereas the same model has 91% accuracy in the balanced VirusSample dataset. While XGBoost, one of the most common gradient boosting-based models, achieves the highest score of 90% and 80%.in both versions of the VirusShare dataset. This paper also presents the baseline results of VirusShare and VirusSample datasets by using the four most widely known machine learning techniques in dynamic malware classification literature. We believe that these two datasets and baseline results enable researchers in this field to test and validate their methods and approaches.
研究の動機と目的
- 効果的な動的マルウェア分類を支援するため、最新で更新されたマルウェアデータセットの需要が高まっていることを踏まえ、それに対応する。
- 再現性のある研究を可能にするために、2つの新しいデータセット(VirusSamples:9,795件、VirusShare:14,616件)のバランス型およびアンバランス型のバージョンを提供する。
- APIコールベースの動的分析を用いて、4つの広く使われている機械学習モデル(SVM、XGBoost、ランダムフォレスト、ヒストグラムベース勾配ブースティング)の性能を、これらのデータセット上で評価する。
- 今後の新しい動的マルウェア検出手法の比較や検証のためのベースライン分類精度スコアを確立する。
- 研究コミュニティが、最新で実世界のデータセットを用いて、新規の動的マルウェア分類手法のテストとベンチマークを可能にするために支援する。
提案手法
- VirusSamplesから9,795件のマルウェアサンプル、VirusShareから14,616件のマルウェアサンプルを収集し、2つの新しいアップデート済みデータセットを構築した。
- 各マルウェアサンプルの動的分析からシステムコール(APIコール)のシーケンスを抽出し、行動特徴を表現した。
- クラス分布の変動に対するモデルのロバストネスを評価するため、各データセットのバランス型およびアンバランス型のバージョンを構築した。
- 多クラスマルウェアファミリー分類の目的で、サポートベクターマシン(SVM)、XGBoost、ランダムフォレスト、ヒストグラムベース勾配ブースティングの4つの機械学習モデルを適用した。
- 実行時動作を捉えるために、APIコールベースの動的分析を入力表現として用い、難読化に強いマルウェアの検出を可能にした。
- 標準的な分類指標を用いてモデルの性能を評価し、バランス型およびアンバランス型のデータセット構成の両方で精度に注目した。
実験結果
リサーチクエスチョン
- RQ1最新で収集された、最新のマルウェアデータセットを用いたAPIコールベースの動的分析において、最先端の機械学習モデルの分類精度はどの程度か?
- RQ2データセットのアンバランス性は、実世界のマルウェアサンプルにおける動的マルウェア分類モデルの性能にどのように影響するか?
- RQ3VirusSamplesおよびVirusShareデータセットのバランス型およびアンバランス型の両バージョンにおいて、どの機械学習モデルがマルウェアファミリー分類で最も高い精度を達成するか?
- RQ4提案されたデータセットとベースライン結果は、今後の動的マルウェア分類分野の研究における信頼できるベンチマークとして機能できるか?
- RQ5SVM、XGBoost、ランダムフォレスト、ヒストグラムベース勾配ブースティングの性能特性は、APIコールシーケンスを用いた動的マルウェア分類の文脈でどのように比較されるか?
主な発見
- サポートベクターマシン(SVM)は、アンバランス型のVirusSampleデータセットで94%の最高精度を達成し、この構成で他のモデルを上回った。
- バランス型のVirusSampleデータセットでは、SVMは91%の精度を記録し、クラス分布の調整にもかかわらず良好な一般化性能を示した。
- XGBoostは、VirusShareデータセットのバランス型およびアンバランス型の両方で90%の精度を達成し、データ分布の変化に関わらず一貫した性能を示した。
- ランダムフォレストおよびヒストグラムベース勾配ブースティングモデルは、SVMおよびXGBoostに比べて低い性能を示し、VirusShareデータセットの両バージョンで80%の精度を記録した。
- これらの結果により、今後の研究のための信頼できるベースラインが確立された。SVMおよびXGBoostは、APIコールシーケンスを用いた動的マルウェア分類において、上位のパフォーマンスを示した。
- 2つの新しいデータセット(VirusSamples:9,795件、VirusShare:14,616件)は、最新で実世界のデータを提供し、動的マルウェア検出システムの学習および評価に役立つ。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。