Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Level Fine-Tuning, Data Augmentation, and Few-Shot Learning for Specialized Cyber Threat Intelligence

Markus Bayer, Tobias Frey|arXiv (Cornell University)|Jul 22, 2022
Network Security and Intrusion Detection被引用数 6
ひとこと要約

本論文は、マルチレベルのファインチューニング、GPT-3ベースのデータ拡張、およびFew-shot学習を組み合わせた新規パイプラインを提案し、32件のラベル付きインスタンスのみで高精度なサイバー脅威インテリジェンス(CTI)分類器を訓練することを可能にする。このアプローチは、1,800件のインスタンスで訓練されたモデルに匹敵するF1スコアを達成し、標準的手法よりも21ポイント以上、最先端のFew-shotモデルよりも18ポイント以上優れている。これは、2021年マイクロソフトExchange Serverの侵害から得られた新規のエキスパートアノテート済みデータセット上で評価された結果である。

ABSTRACT

Gathering cyber threat intelligence from open sources is becoming increasingly important for maintaining and achieving a high level of security as systems become larger and more complex. However, these open sources are often subject to information overload. It is therefore useful to apply machine learning models that condense the amount of information to what is necessary. Yet, previous studies and applications have shown that existing classifiers are not able to extract specific information about emerging cybersecurity events due to their low generalization ability. Therefore, we propose a system to overcome this problem by training a new classifier for each new incident. Since this requires a lot of labelled data using standard training methods, we combine three different low-data regime techniques - transfer learning, data augmentation, and few-shot learning - to train a high-quality classifier from very few labelled instances. We evaluated our approach using a novel dataset derived from the Microsoft Exchange Server data breach of 2021 which was labelled by three experts. Our findings reveal an increase in F1 score of more than 21 points compared to standard training methods and more than 18 points compared to a state-of-the-art method in few-shot learning. Furthermore, the classifier trained with this method and 32 instances is only less than 5 F1 score points worse than a classifier trained with 1800 instances.

研究の動機と目的

  • 新規で動的なサイバー脅威に直面した際、既存のサイバー脅威インテリジェンス(CTI)分類器の一般化性能が低いという課題に対処すること。
  • 専用CTIモデルを訓練する際のラベル付け負荷を軽減し、最小限のラベル付きデータで高い性能を達成すること。
  • 低データレジーム技術を活用して、新規のサイバー脅威に対して迅速に正確な分類器を展開できる、堅牢で再利用可能なフレームワークを構築すること。
  • 実際のサイバーインシデントに基づいた新規のエキスパートアノテート済みCTIデータセットを構築し、今後の研究を支援すること。

提案手法

  • 本手法は、大規模な汎用言語モデルから出発し、段階的に特定のサイバー脅威ドメインへとファインチューニングを進めるマルチレベルのトランスファー学習を採用する。
  • データ拡張はGPT-3を用い、プロンプト戦略を適用した後、人間のフィルタリングを組み合わせて実施し、ラベルの整合性と意味的関連性を維持する。
  • Few-shot学習は、各脅威クラスに対してわずか32件のラベル付きインスタンスでの学習に依存し、メタラーニングの原則を活用して最小限の例から一般化を実現する。
  • トランスファー学習、データ拡張、Few-shot学習を段階的に統合することで、モデル性能を段階的に向上させるパイプラインを構築する。
  • 人間のエキスパートが生成されたインスタンスをフィルタリングする境界を定義し、元のラベル付きデータからあまりにかけ離れたものを除外することで、ラベルの一貫性を保つ。
  • 本手法は、2021年マイクロソフトExchange Serverの侵害から抽出された新規データセット上で評価され、3名のエキスパートによるアノテーションが行われ、高いインターコデア信頼性を示した。

実験結果

リサーチクエスチョン

  • RQ1マルチレベルファインチューニング、データ拡張、Few-shot学習の組み合わせが、極めて少ないラベル付きデータで専用のサイバー脅威インテリジェンス分類のF1スコアを顕著に向上させ得るか?
  • RQ2ラベル付きデータが極めて限られた状況下で、人間を介したフィルタリングを施したGPT-3ベースのデータ拡張は、モデルの頑健性と性能向上にどの程度効果的か?
  • RQ3低データレジームにおいて、マルチレベルファインチューニングが標準的なファインチューニングや最先端のFew-shot学習手法をどの程度上回るか?
  • RQ4データ拡張の導入が、高度なファインチューニングとFew-shot学習と組み合わせた際、モデルの分散と一般化性能にどのような影響を与えるか?
  • RQ5実際のサイバーインシデントに基づいた新規のエキスパートアノテート済みデータセットが、今後の低データCTI研究の信頼できるベンチマークとして機能できるか?

主な発見

  • 提案手法は、マイクロソフトExchange Serverの侵害データセットにおいて、標準的なトレーニング手法と比較してF1スコアが21ポイント以上向上した。
  • 最先端のFew-shot学習モデルと比較して18ポイント以上のF1スコアの向上を達成し、少数の例から優れた一般化性能を示した。
  • 本パイプラインを用いてわずか32件のラベル付きインスタンスでの学習を実施した分類器は、1,800件のインスタンスで学習したモデルのF1スコアと5ポイント以内の差に収まった。
  • GPT-3ベースのデータ拡張の導入により、モデルの標準偏差が低下し、頑健性が向上したが、マルチレベルファインチューニングと組み合わせた際のF1スコアへの影響は限定的であった。
  • エキスパートアノテート済みデータセットは高いインターコデア信頼性を示し、今後の専用CTI研究における品質と有用性を裏付けた。
  • データ拡張を省いた場合でも、本手法は有効であることが示された。これは、マルチレベルファインチューニングとFew-shot学習が、性能向上の主な要因であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。