Skip to main content
QUICK REVIEW

[論文レビュー] Improved Recognition of Security Bugs via Dual Hyperparameter Optimization.

Rui Shu, Tianpei Xia|arXiv (Cornell University)|Nov 4, 2019
Machine Learning and Data Classification被引用数 6
ひとこと要約

本稿では、機械学習の学習器とデータ前処理手法の両方を同時に最適化することで、バグレポートにおけるレアなセキュリティバグの検出を向上させる、SWIFTと呼ばれる二重ハイパーパramータ最適化フレームワークを提案する。ε-優位性を用いることで不要な計算を削減し、SWIFTは、Chromiumでは77.1%、Ambariでは83.9%という顕著な高い再現率を達成した一方で、22%未満の低誤検出率を維持しており、FARSECのような先行する最先端手法を上回っている。

ABSTRACT

Background: Security bugs need to be handled by small groups of engineers before being widely discussed (otherwise the general public becomes vulnerable to hackers that exploit those bugs). But learning how to separate the security bugs from other bugs is challenging since they may occur very rarely. Data mining that can find such scarce targets required extensive tuning effort. Goal: The goal of this research is to aid practitioners as they struggle to tune methods that try to distinguish security-related bug reports in a product's bug database, through the use of a dual hyperparameter optimizer that learns good settings for both learners and for data pre-processing methods. Method: The proposed method, named SWIFT, combines learner hyperparameter optimization and pre-processor hyperparameter optimization. SWIFT uses a technique called epsilon-dominance, the main idea of which is to ignore operations that do not significantly improve the performance. As a result, the optimization effort can be efficiently reduced. Result: When compared to recent state-of-the-art results (from FARSEC which is published in TSE'18), we find that SWIFT's dual optimization of both pre-processor and learner is more useful than optimizing each of them individually. For example, in a 10-way cross-validation study looking for security bugs from the Chromium web-browser, the FARSEC and SWIFT recalls were 20.4% and 77.1%, respectively, with false alarm rates under 20%. For another example, in experiments with data from the Ambari software project, recalls improved from 30.4 to 83.9% while false alarms remained under 22%. Conclusion: Overall, our approach shows advantages in achieving better performance in a fast way than existing stat-of-the-art method. Therefore, this encourages us in solving similar problems with dual optimization in the future work.

研究の動機と目的

  • バグデータベースにおける稀なセキュリティバグの検出という課題に取り組む。これは、その頻度が低いために同定が困難であるためである。
  • 機械学習モデルとデータ前処理技術の両方を最適化するために従来から必要とされてきた膨大な手作業のチューニング作業を軽減すること。
  • 学習器と前処理のハイパーパramータを同時に最適化することで、セキュリティバグ検出の性能を向上させること。
  • ε-優位性を用いることで、微小な改善をスキップし、より速く効率的なハイパーパramータ探索を可能にすること。
  • 学習器や前処理を別々に最適化するのと比較して、二重最適化が優れた結果をもたらすことを示すこと。

提案手法

  • SWIFTは、機械学習の学習器とデータ前処理手法の両方のハイパーパramータを同時に最適化する二重最適化戦略を採用する。
  • ε-優位性を用いて、事前に定義されたしきい値未満の性能向上をフィルタリングすることで、無駄な評価を削減し、収束を早める。
  • フレームワークは、データ前処理(例:特徴工学、フィルタリング)とモデル学習(例:分類器選択、正則化)の2段階にわたりハイパーパramータ探索を統合する。
  • ε-優位性により、ユーザーが定義したεを超える改善のみが考慮され、探索は意味のある性能向上に集中する。
  • 実世界のバグデータベース(ChromiumおよびAmbari)を用いた10分割交差検証によって評価される。
  • 再現率や誤検出率といったパフォーマンス指標に従って最適化が行われ、セキュリティバグ検出の最大化と誤検出の最小化を焦点に置く。

実験結果

リサーチクエスチョン

  • RQ1前処理と学習器のハイパーパramータを同時に最適化することで、それらを別々に最適化するのと比較して、稀なセキュリティバグの検出が顕著に向上するか?
  • RQ2ε-優位性の使用が、セキュリティバグ検出におけるハイパーパramータ探索の効率性と有効性に与える影響は何か?
  • RQ3実世界のバグデータベースにおいて、SWIFTはFARSECのような最先端手法に比べて、再現率と誤検出率の点でどの程度優れているか?
  • RQ4二重最適化アプローチは、多様なソフトウェアプロジェクトにおいて、顕著な再現率の向上を達成する一方で、低誤検出率を維持できるか?
  • RQ5提案手法は、ラベル付きセキュリティレポートが限られている実世界の産業用バグデータベースに対しても、効果的にスケーリングできるか?

主な発見

  • Chromiumウェブブラウザデータセットにおける10分割交差検証において、SWIFTは再現率77.1%を達成した。これに対してFARSECは20.4%であったが、誤検出率は20%未満で維持された。
  • Ambariソフトウェアプロジェクトでは、SWIFTが再現率をFARSECの30.4%から83.9%まで向上させ、誤検出率は22%未満で維持された。
  • 学習器と前処理の両方を同時に最適化することで、それぞれを別々に最適化するのと比較して顕著に優れたパフォーマンスが得られた。
  • ε-優位性は、必要な評価回数を効果的に削減し、最適化プロセスをより速く、より効率的なものにした。
  • SWIFTは、さまざまなソフトウェアプロジェクトにおいて一貫した改善を示しており、実世界の産業用バグデータベースへの一般化可能性を示している。
  • 標準的手法では通常困難とされる極めて稀なセキュリティバグに対しても、高い検出性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。