Skip to main content
QUICK REVIEW

[論文レビュー] Path-Based Function Embedding and its Application to Specification Mining

Daniel DeFreez, Aditya Thakur|arXiv (Cornell University)|Feb 21, 2018
Software Engineering Research参考文献 22被引用数 16
ひとこと要約

この論文では、コードのラベル付きプッシュダウンシステム(ℓ-PDS)表現を基にランダムウォークから文を生成することで、分散関数埋め込みを学習するニューラルネットワークベースの手法func2vecを紹介する。この手法は、名前が異なっていても意味的に類似した関数(関数の類義語)を効果的にクラスタリングでき、Linuxカーネルのゴールドスタンダードにおいて87%の精度と71%の再現率を達成し、ファイルシステムやドライバにおいて高サポートのエラー処理仕様の抽出を可能にする。

ABSTRACT

Identifying the relationships among program elements is useful for program understanding, debugging, and analysis. One such relationship is synonymy. Function synonyms are functions that play a similar role in code, e.g. functions that perform initialization for different device drivers, or functions that implement different symmetric-key encryption schemes. Function synonyms are not necessarily semantically equivalent and can be syntactically dissimilar; consequently, approaches for identifying code clones or functional equivalence cannot be used to identify them. This paper presents func2vec, an algorithm that maps each function to a vector in a vector space such that function synonyms are grouped together. We compute the function embedding by training a neural network on sentences generated from random walks over an encoding of the program as a labeled pushdown system (l-PDS). We demonstrate that func2vec is effective at identifying function synonyms in the Linux kernel. Furthermore, we show how function synonyms enable mining error-handling specifications with high support in Linux file systems and drivers.

研究の動機と目的

  • Linuxカーネルのような低レベルのシステムコードにおいて、命名規則が信頼できない中で、構文的にも意味的にも異なる関数同士の類義語を特定する課題に対処すること。
  • 名前の付与や意味的同等性に関する事前知識が不要な、階層的なプログラム構造を捉えたスケーラブルで自己教師ありの関数埋め込み学習手法を開発すること。
  • 複数の実装における関数の類義語を活用することで、エラー処理仕様の抽出におけるサポートを向上させ、Linuxにおけるエラー処理仕様の抽出を改善すること。
  • 従来のアプローチが、エラー経路の出現頻度が低いために失敗する大規模で低レベルのコードベースにおいて、関数埋め込みが仕様抽出をどのように向上させるかを示すこと。

提案手法

  • プログラムを、ノードがプログラム要素(関数、命令、型、エラーコードなど)を表し、エッジが意味的タイプでラベル付けされたラベル付きプッシュダウンシステム(ℓ-PDS)として表現する。
  • ℓ-PDS上でランダムウォークを生成し、ラベルの系列を生成する。この系列をニューラルネットワークの学習用に文として扱う。
  • word2vecにインspiredされたスキップグラムモデルを用いて、これらのラベル系列を学習し、300次元空間における関数の密なベクトル表現(埋め込み)を学習する。
  • t-SNEを用いて、学習済みのR³⁰⁰埋め込みを2次元に射影し、可視化およびクラスタ分析を行う。
  • 学習済みの埋め込みを用いて、関数ベクトル間のコサイン類似度を測定することで、関数の類義語を特定する。
  • 特定された関数の類義語を活用して、異なる実装間のエラー処理パターンを統一し、より高いサポートを持つクロス実装の仕様抽出を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きプッシュダウンシステム(ℓ-PDS)上でランダムウォークを学習したニューラルネットワークが、Linuxカーネルのような大規模で低レベルのシステムコードにおいて、関数の類義語を効果的にグループ化できるか。
  • RQ2手作業で作成されたゴールドスタンダードと比較して、func2vecが関数の類義語を特定する際の精度と再現率はどの程度高いか。
  • RQ3func2vecから得られる関数埋め込みは、Linuxのファイルシステムやドライバにおけるエラー処理仕様の抽出のサポートと品質を向上させられるか。
  • RQ4意味的に類似した関数に跨る希少なエラー処理パターンを集約することで、func2vecが仕様抽出における誤検出(ファルスポジティブ)をどの程度低減できるか。

主な発見

  • 手作業で作成された683個のLinuxカーネル関数(127の類義語クラスに分類)からなるゴールドスタンダードにおいて、func2vecは関数の類義語特定で87%の精度と71%の再現率を達成した。
  • t-SNEの射影による可視化により、Linuxカーネルにおいて関数の類義語が意味的役割(例:probe, open, free)に基づいて正しくクラスタリングされていることが確認された。
  • 複数の実装に跨る関数の類義語を特定することで、func2vecは個々の実装では達成できないほど高いサポートを持つクロス実装のエラー処理仕様の抽出を可能にした。
  • 5つのLinuxファイルシステムおよび48のデバイスドライバにおける評価により、func2vecを用いることで、抽出されたエラー処理仕様の品質と信頼性が向上することが確認された。
  • func2vecは、Linuxカーネル(200万行)のような大規模なシステムコードにニューラルネットワークベースの関数埋め込みを適用した初の手法であり、スケーラビリティと有効性を示した。
  • 通常の実行パスや個別のエラートレースに依存する従来の仕様抽出手法に比べ、特に希少または実装固有のエラー処理パターンに対して優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。