Skip to main content
QUICK REVIEW

[論文レビュー] Towards Learning Representations of Binary Executable Files for Security Tasks.

Shushan Arakelyan, Christophe Hauser|arXiv (Cornell University)|Feb 9, 2020
Software Engineering Research参考文献 14被引用数 4
ひとこと要約

本稿では、低レベル構造から計算グラフを構築することで、二進実行可能ファイルの分散表現を学習するグラフ畳み込みニューラルネットワーク(GCN)ベースの手法を提案する。この手法は、アルゴリズム分類と脆弱性発見という2つの異なるセキュリティタスクにおいて、強力なベースラインおよび先行手法を上回る最先端の性能を達成する。

ABSTRACT

Tackling binary analysis problems has traditionally implied manually defining rules and heuristics. As an alternative, we are suggesting using machine learning models for learning distributed representations of binaries that can be applicable for a number of downstream tasks. We construct a computational graph from the binary executable and use it with a graph convolutional neural network to learn a high dimensional representation of the program. We show the versatility of this approach by using our representations to solve two semantically different binary analysis tasks -- algorithm classification and vulnerability discovery. We compare the proposed approach to our own strong baseline as well as published results and demonstrate improvement on the state of the art methods for both tasks.

研究の動機と目的

  • ルールベースおよびヒューリスティック手法のバイナリ解析における限界を克服し、自動的でデータ駆動型の表現学習を可能にする。
  • 多様なバイナリセキュリティタスクに適用可能な汎用的表現学習フレームワークを構築する。
  • 学習された埋め込みを用いて、アルゴリズム分類や脆弱性発見などのバイナリ解析タスクのパフォーマンスを向上させる。
  • グラフベースの表現がバイナリの意味的および構造的特徴を効果的に捉えることの汎用性と有効性を示す。

提案手法

  • 命令や制御フローなどの低レベルプログラム構造を用いて、二進実行可能ファイルから計算グラフを構築する。
  • グラフ畳み込みニューラルネットワーク(GCN)を適用し、計算グラフから高次元の分散表現を学習する。
  • 学習された表現を下流のバイナリ解析タスクの入力特徴として使用する。
  • 下流タスクのパフォーマンス最適化を目的として、GCNをエンドツーエンドで訓練する。
  • GCNの構造的インダクティブバイアスを活用し、バイナリコード内の意味的および文法的関係を捉える。

実験結果

リサーチクエスチョン

  • RQ1グラフベースのニューラルネットワークは、二進実行可能ファイルの意味のある表現を効果的に学習できるか?
  • RQ2これらの学習された表現は、多様なバイナリ解析タスクに一般化可能か?
  • RQ3精度およびロバスト性の観点から、本手法はルールベースおよびヒューリスティックアプローチと比べてどのように差をつけるか?
  • RQ4表現がアルゴリズム分類および脆弱性発見のパフォーマンス向上にどの程度寄与するか?

主な発見

  • 提案手法であるGCNベースのアプローチは、アルゴリズム分類において、先行手法を上回る最先端の性能を達成した。
  • 公表されたベースラインと比較して、脆弱性発見タスクにおいて顕著な改善が見られた。
  • 学習された表現は、意味的に異なるバイナリ解析タスクに対しても効果的であることが示された。
  • 両評価タスクにおいて、強力なカスタムベースラインを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。