[논문 리뷰] OntoEnricher: A Deep Learning Approach for Ontology Enrichment from Unstructured Text.
OntoEnricher는 양방향 LSTM와 Universal Sentence Encoder를 사용한 딥러닝 접근법을 제안하여, 비구조화된 텍스트에서 보안 개념(예: 취약성, 위협, 통제 조치)을 자동으로 추출함으로써 정보보안 온톨로지의 정보를 풍부화한다. 이 방법은 온톨로지 개념을 제거한 테스트에서 80% 이상의 정확도를 달성하여 맥락 기반 개념 추출의 강건성을 입증한다.
Information Security in the cyber world is a major cause for concern, with significant increase in the number of attack surfaces. Existing information on vulnerabilities, attacks, controls, and advisories available on the web provides an opportunity to represent knowledge and perform security analytics to mitigate some of the concerns. Representing security knowledge in the form of ontology facilitates anomaly detection, threat intelligence, reasoning and relevance attribution of attacks, and many more. This necessitates dynamic and automated enrichment of information security ontologies. However, existing ontology enrichment algorithms based on natural language processing and ML models have issues with the contextual extraction of concepts in words, phrases and sentences. This motivates the need for sequential Deep Learning architectures that traverse through dependency paths in text and extract embedded vulnerabilities, threats, controls, products and other security related concepts and instances from learned path representations. In the proposed approach, Bidirectional LSTMs trained on a large DBpedia dataset and Wikipedia corpus of 2.8 GB along with Universal Sentence Encoder was deployed to enrich ISO 27001 based information security ontology. The approach yielded a test accuracy of over 80\% when tested with knocked out concepts from ontology and web page instances to validate the robustness.
연구 동기 및 목표
- 사이버 공간의 공격 표면이 확장됨에 따라 동적이고 자동화된 정보보안 온톨로지 풍부화의 증가하는 수요를 해결하기 위해.
- 기존의 NLP 및 ML 기반 온톨로지 풍부화 방법이 단어, 어구, 문장의 맥락적 관계를 포착하는 데에 한계가 있음을 극복하기 위해.
- 비구조화된 웹 텍스트에서 취약성, 위협, 통제 조치, 제품과 같은 보안 관련 개념을 강력하게 추출할 수 있도록 하기 위해.
- 텍스트 내 의존성 경로를 기반으로 한 순차적 딥러닝을 활용하여 온톨로지 풍부화의 확장성과 맥락 정확도를 향상시키기 위해.
제안 방법
- DBpedia와 2.8GB의 위키피디아 데이터셋을 포함한 대규모 코퍼스에서 훈련된 양방향 장기 단기 기억망(LSTM) 네트워크를 활용한다.
- 유니버설 문장 인코더를 사용하여 입력 텍스트의 의미적 이해를 향상시키는 맥락 기반 문장 임베딩을 생성한다.
- 텍스트 내 의존성 경로를 처리하여 단어와 어구 간의 순차적 관계를 모델링함으로써 보다 깊이 있는 맥락 기반 보안 개념 추출을 가능하게 한다.
- 모델을 훈련시켜 취약성, 위협, 통제 조치, 제품과 같은 엔티티를 ISO 27001 기반 정보보안 온톨로지의 사전 정의된 클래스에 매핑하도록 한다.
- 의도적으로 온톨로지 개념을 제거한 인스턴스를 테스트하여 복구 정확도를 평가함으로써 모델의 강건성을 검증한다.
실험 결과
연구 질문
- RQ1딥러닝 모델은 높은 맥락 정확도로 비구조화된 텍스트에서 보안 관련 개념을 효과적으로 추출할 수 있는가?
- RQ2사전 훈련된 문장 인코더와 함께 사용된 양방향 LSTMs가 전통적인 NLP 방법에 비해 정보보안 온톨로지 풍부화에 얼마나 잘 작동하는가?
- RQ3실제 웹 텍스트에서 온톨로지의 누락되거나 제거된 개념을 복구할 수 있는 정도는 어느 정도인가?
- RQ4의존성 경로 탐색의 사용이 온톨로지 풍부화에 필수적인 의미 관계를 포착하는 데 얼마나 효과적인가?
주요 결과
- OntoEnricher 모델은 ISO 27001 기반 정보보안 온톨로지에서 제거된 개념을 복구하는 평가에서 80% 이상의 테스트 정확도를 달성했다.
- 양방향 LSTMs와 유니버설 문장 인코더의 통합은 보안 관련 텍스트의 맥락 이해를 크게 향상시켰다.
- 의존성 경로의 순차적 처리를 통해 모델은 용어 간 미세한 의미 관계를 포착할 수 있었으며, 이는 개념 추출 정밀도를 향상시켰다.
- 모델는 실제 비구조화된 웹 콘텐츠를 처리하는 데 있어 강건성을 입증하여 사이버 위협 지능 응용 분야에서 동적 온톨로지 풍부화에 적합함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.