Skip to main content
QUICK REVIEW

[論文レビュー] Emulating malware authors for proactive protection using GANs over a distributed image visualization of dynamic file behavior

Vineeth S. Bhaskara, Debanjan Bhattacharyya|arXiv (Cornell University)|Jul 19, 2018
Advanced Malware Detection Techniques被引用数 8
ひとこと要約

この論文は、動的ファイル動作の分散RGB画像表現を学習データとして用いるGANベースのフレームワークを提案し、合成マルウェアを生成することで、事前の脅威検出を可能にする。APIコールn-gramを画像にエンコードすることで、ノイズベクトルの算術操作を用いて、新たな意味的に整合性のあるマルウェアバージョンを生成し、未知の脅威の検出を向上させる。

ABSTRACT

Malware authors have always been at an advantage of being able to adversarially test and augment their malicious code, before deploying the payload, using anti-malware products at their disposal. The anti-malware developers and threat experts, on the other hand, do not have such a privilege of tuning anti-malware products against zero-day attacks pro-actively. This allows the malware authors to being a step ahead of the anti-malware products, fundamentally biasing the cat and mouse game played by the two parties. In this paper, we propose a way that would enable machine learning based threat prevention models to bridge that gap by being able to tune against a deep generative adversarial network (GAN), which takes up the role of a malware author and generates new types of malware. The GAN is trained over a reversible distributed RGB image representation of known malware behaviors, encoding the sequence of API call ngrams and the corresponding term frequencies. The generated images represent synthetic malware that can be decoded back to the underlying API call sequence information. The image representation is not only demonstrated as a general technique of incorporating necessary priors for exploiting convolutional neural network architectures for generative or discriminative modeling, but also as a visualization method for easy manual software or malware categorization, by having individual API ngram information distributed across the image space. In addition, we also propose using smart-definitions for detecting malwares based on perceptual hashing of these images. Such hashes are potentially more effective than cryptographic hashes that do not carry any meaningful similarity metric, and hence, do not generalize well.

研究の動機と目的

  • 悪意あるテストの不均衡に対処するため、アンチマルウェアシステムが事前にマルウェア作成者を模倣できるようにすること。
  • 暗号的ハッシュ化の限界を克服し、ファイル署名ではなく動作パターンをモデル化することで、ゼロデイマルウェアの検出を可能にすること。
  • 深層学習モデルが、現実的な動作意味論を備えた合成マルウェアを生成することで、未知の脆弱性を事前に発見できるようにすること。
  • 可視化と機械学習の両方で意味的構造を保持する、逆引き可能なマルウェア動作の画像表現を開発すること。
  • 潜在空間におけるベクトル算術を用いて、既知のマルウェアの動作的特徴を組み合わせ、新たなハイブリッドマルウェアパターンを生成すること。

提案手法

  • APIコールn-gramと単語頻度符号化を用いて、動的ファイル動作を逆引き可能な分散RGB画像表現に変換する。
  • 画像表現を学習データとして、深層畳み込みGANを訓練し、悪意ある動作の分布を学習し、新たな合成マルウェア画像を生成する。
  • 生成器ネットワークを用いて、潜在ノイズベクトルから新たなマルウェア表現をサンプリングし、制御された形での新規マルウェア動作の生成を可能にする。
  • 潜在空間におけるノイズベクトル算術(例:$ \vec{z}_{\text{A}} - \vec{z}_{\text{B}} + \vec{z}_{\text{C}} $)を用いて、複数のマルウェアサンプルからの意味的特徴を組み合わせ、ハイブリッドバージョンを生成する。
  • 生成された画像を再びAPIコールシーケンスにデコードし、意味的整合性と動作の妥当性を検証する。
  • 画像表現に知覚的ハッシュを適用し、暗号的ハッシュよりも優れた一般化性能を実現するマルウェアファミリー検出を実現する。

実験結果

リサーチクエスチョン

  • RQ1GANのような深層生成モデルが、画像で可視化された動的マルウェア動作を効果的に学習し、現実的な合成マルウェアを生成できるか?
  • RQ2画像表現が十分な意味的情報を保持しているか、APIコールシーケンスと動作パターンの正確な復元が可能か?
  • RQ3GANの潜在空間におけるベクトル算術が、複数のマルウェアサンプルからの特徴を組み合わせることで、整合性のあるハイブリッドマルウェア動作を生成できるか?
  • RQ4画像表現の知覚的ハッシュが、従来の暗号的ハッシュと比較して、マルウェアファミリー検出を向上させられるか?
  • RQ5このフレームワークが、実世界への展開前に悪意あるテストをシミュレートすることで、どの程度まで前向きな脅威検出を可能にするか?

主な発見

  • 画像表現は、APIコールn-gramと単語頻度を畳み込みニューラルネットワークと互換性のある形式に効果的にエンコードでき、生成的および判別的モデリングに有効であることを示した。
  • GANの生成器は、意味的なAPIコールシーケンスに復号可能な合成マルウェア画像を生成でき、生成された動作の意味的整合性を裏付けた。
  • 潜在空間におけるノイズベクトル算術により、レジストリの変更やリモートコマンド実行といった、整合性のある悪意ある意味的特徴を保持するハイブリッドマルウェア表現が得られた。
  • 画像表現の知覚的ハッシュにより、視覚的類似性に基づいたマルウェアファミリー検出が可能になり、暗号的ハッシュよりも優れた一般化性能を示した。
  • 合成マルウェア生成による悪意あるテストのシミュレーションを通じて、ゼロデイ脅威に対する露出期間を短縮する前向きな脅威検出が可能になった。
  • このアプローチは、直接的なソースコードへのアクセスがなくても、深層学習のアーキテクチャ設計を実行可能動作モデリングに応用可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。