[論文レビュー] A Deep Learning Approach for Ontology Enrichment from Unstructured Text
本稿では、Bidirectional LSTMs と Universal Sentence Encoder を用いた深層学習アプローチを提案し、非構造化テキストから ISO 27001ベースの情報セキュリティオントロジーを拡張する。2.8 GB の Wikipedia および DBpedia データで学習されたモデルは、概念、関係、インスタンスの抽出において80%のテスト精度を達成し、動的で現実世界のテキスト環境においても高い頑健性を示した。
Information Security in the cyber world is a major cause for concern, with a significant increase in the number of attack surfaces. Existing information on vulnerabilities, attacks, controls, and advisories available on the web provides an opportunity to represent knowledge and perform security analytics to mitigate some of the concerns. Representing security knowledge in the form of ontology facilitates anomaly detection, threat intelligence, reasoning and relevance attribution of attacks, and many more. This necessitates dynamic and automated enrichment of information security ontologies. However, existing ontology enrichment algorithms based on natural language processing and ML models have issues with contextual extraction of concepts in words, phrases, and sentences. This motivates the need for sequential Deep Learning architectures that traverse through dependency paths in text and extract embedded vulnerabilities, threats, controls, products, and other security-related concepts and instances from learned path representations. In the proposed approach, Bidirectional LSTMs trained on a large DBpedia dataset and Wikipedia corpus of 2.8 GB along with Universal Sentence Encoder is deployed to enrich ISO 27001-based information security ontology. The model is trained and tested on a high-performance computing (HPC) environment to handle Wiki text dimensionality. The approach yielded a test accuracy of over 80% when tested with knocked-out concepts from ontology and web page instances to validate the robustness.
研究の動機と目的
- 公開ソースからの進化する非構造化脅威インテリジェンスを動的に情報セキュリティオントロジーに統合する課題に対処すること。
- 既存の NLP や ML メソッドがセキュリティテキストにおける文脈的関係や複数語の概念を捉えることの限界を克服すること。
- Web ページからの概念、関係、現実世界のインスタンスを自動的かつスケーラブルに ISO 27001ベースのオントロジーに拡張すること。
- 順序モデリングと文脈的埋め込みを活用することで、オントロジー拡張の頑健性と一般化性能を向上させること。
- 拡張されたオントロジカル構造を活用した、脆弱性評価、アタックグラフ生成、脅威インテリジェンス相関などの実用的ユースケースを支援すること。
提案手法
- 非構造化テキストから抽出した依存パスにおける順序的依存関係をモデル化するために、双方向LSTM(Bi-LSTM)ネットワークを採用する。
- 文やフレーズの文脈的で密なベクトル表現を生成するために、Universal Sentence Encoder を活用する。
- 広範なドメインカバレッジを捉えるために、97,425 個の DBpedia 項目と 2.8 GB の Wikipedia アーティクルを組み合わせたデータセットでモデルを学習する。
- ISO 27001ベースの情報セキュリティオントロジーからの 408 個のシード用語を用いて微調整し、予測結果をターゲットオントロジー概念と一致させる。
- 既知のオントロジー概念をテストインスタンスから削除するノックアウトテストを実施し、頑健性と一般化性能を評価する。
- 大規模なテキスト処理とモデル学習の計算的要件を管理するため、高性能コンピューティング(HPC)インfrastrucutureを活用する。
実験結果
リサーチクエスチョン
- RQ1深層学習モデルは、非構造化Webテキストからセキュリティ関連の概念、関係、インスタンスを効果的に抽出・拡張できるか?
- RQ2既知のオントロジー用語が欠落している現実世界のWebページでテストした場合、モデルの一般化性能はどの程度か?
- RQ3文脈的埋め込み(Universal Sentence Encoder)を用いることで、非文脈的メソッドに比べてオントロジー拡張の精度がどの程度向上するか?
- RQ4脆弱性、脅威、対策などの異なる種類のセキュリティ概念において、正確性(precision)、再現率(recall)、F1スコアの観点からモデルの性能はいかがなっているか?
- RQ5本アプローチは、情報セキュリティ以外の分野へも最小限の再設定で拡張可能か?
主な発見
- 20個のランダムに選択された情報セキュリティ関連Webページに、オントロジー概念をノックアウトした状態でテストしたところ、提案モデルは80%のテスト精度を達成した。
- 全体の拡張タスクにおけるF1スコアは78%に達し、精度と再現率のバランスの取れた性能を示した。
- ハイパニミーや関係性など、異なる概念クラスにおいて一貫した性能を示し、ハイパニミーや関係性の抽出で相対的に高い正確性を示した。
- Webページの上位20件の検索結果における精度(P@20)の平均は0.84であり、関連する概念の信頼性の高い検出を示している。
- 多くの先行システムが捉えきれていない複数語の概念や現実世界のインスタンスの処理において、本手法は優れた性能を発揮した。
- ピザオントロジー拡張の結果(F1: 0.86–0.88)は、セキュリティ結果よりも高かったことから、ドメインの特異性と概念の明確さが性能に顕著に影響することが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。