[논문 리뷰] A Deep Learning Approach for Ontology Enrichment from Unstructured Text
이 논문은 비구조화된 텍스트에서 ISO 27001 기반 정보보안 온톨로지의 정보를 풍부하게 하기 위해 양방향 LSTM과 유니버설 문장 인코더를 사용한 딥러닝 접근법을 제안한다. 위키피디아 및 DBpedia 데이터 총 2.8GB로 훈련된 모델은 개념, 관계, 인스턴스 추출에서 테스트 정확도 80%를 달성하여 실세계의 동적 텍스트 환경에서도 뛰어난 견고성을 입증한다.
Information Security in the cyber world is a major cause for concern, with a significant increase in the number of attack surfaces. Existing information on vulnerabilities, attacks, controls, and advisories available on the web provides an opportunity to represent knowledge and perform security analytics to mitigate some of the concerns. Representing security knowledge in the form of ontology facilitates anomaly detection, threat intelligence, reasoning and relevance attribution of attacks, and many more. This necessitates dynamic and automated enrichment of information security ontologies. However, existing ontology enrichment algorithms based on natural language processing and ML models have issues with contextual extraction of concepts in words, phrases, and sentences. This motivates the need for sequential Deep Learning architectures that traverse through dependency paths in text and extract embedded vulnerabilities, threats, controls, products, and other security-related concepts and instances from learned path representations. In the proposed approach, Bidirectional LSTMs trained on a large DBpedia dataset and Wikipedia corpus of 2.8 GB along with Universal Sentence Encoder is deployed to enrich ISO 27001-based information security ontology. The model is trained and tested on a high-performance computing (HPC) environment to handle Wiki text dimensionality. The approach yielded a test accuracy of over 80% when tested with knocked-out concepts from ontology and web page instances to validate the robustness.
연구 동기 및 목표
- 공개 소스에서 유형이 변화하는 비구조화된 위협 인텔리전스를 동적으로 정보보안 온톨로지에 통합하는 과제를 해결한다.
- 기존의 NLP 및 머신러닝 방법이 보안 텍스트 내의 맥락적 관계와 다단어 개념을 포착하는 데 한계를 보이는 문제를 극복한다.
- 웹 페이지에서의 실제 개념, 관계, 실세계 인스턴스를 자동으로 스케일링 가능한 방식으로 ISO 27001 기반 온톨로지에 통합할 수 있도록 한다.
- 순차적 모델링과 맥락 기반 임bedding을 활용해 온톨로지 통합의 견고성과 일반화 능력을 향상시킨다.
- 풍부한 온톨로지 구조를 통해 취약성 평가, 공격 그래프 생성, 위협 인텔리전스 상관관계 분석 등의 실용적 사례를 지원한다.
제안 방법
- 비구조화된 텍스트에서 추출한 의존성 경로의 순차적 의존성을 모델링하기 위해 양방향 장기 단기 기억망(Bi-LSTM)을 활용한다.
- 문장과 어구의 맥락 기반 밀도 벡터 표현을 생성하기 위해 유니버설 문장 인코더를 사용하여 의미 이해를 향상시킨다.
- 넓은 도메인 커버리지를 확보하기 위해 DBpedia 용어 97,425개와 위키피디아 기사 2.8GB로 구성된 병합 데이터셋을 훈련에 활용한다.
- ISO 27001 기반 정보보안 온톨로지에서 유래한 408개의 시드 용어로 모델을 피지컬 튜닝하여 예측 결과를 대상 온톨로지 개념과 일치시킨다.
- 기존 온톨로지 개념을 테스트 인스턴스에서 제거하여 정확도와 일반화 능력을 평가하기 위해 컨드-아웃 테스트를 적용한다.
- 대규모 텍스트 처리 및 모델 훈련의 계산 요구 사항을 관리하기 위해 고성능 컴퓨팅(HPC) 인프라를 활용한다.
실험 결과
연구 질문
- RQ1딥러닝 모델은 비구조화된 웹 텍스트에서 보안 관련 개념, 관계, 인스턴스를 효과적으로 추출하고 풍부화시킬 수 있는가?
- RQ2기존 온톨로지 용어가 누락되거나 제거된 실세계 웹 페이지에서 테스트할 경우 모델의 일반화 능력은 어느 정도인가?
- RQ3맥락 기반 임베딩(유니버설 문장 인코더)을 사용할 경우, 비맥락 기반 방법 대비 온톨로지 통합 정확도가 얼마나 향상되는가?
- RQ4정밀도, 재현율, F1 점수 측면에서 다양한 보안 개념 유형(예: 취약성, 위협, 통제 조치)에 대해 모델의 성능은 어떠한가?
- RQ5이 방법은 최소한의 재구성으로 정보보안 외의 다른 도메인으로도 확장 가능한가?
주요 결과
- 모델은 20개의 랜덤으로 선택된 정보보안 웹 페이지에서 온톨로지 개념이 제거된 상태에서 테스트한 결과, 정확도 80%를 달성했다.
- 전반적인 통합 작업에 대한 F1 점수는 78%에 도달하여 정밀도와 재현율 간 균형 잡힌 성능을 보였다.
- 모델은 다양한 개념 클래스에서 일관된 성능을 보였으며, 초위계 관계에서 상대적으로 높은 정확도를 기록했다.
- 웹 페이지에서 검색된 상위 20개 결과의 정밀도 평균(P@20)은 0.84로, 관련 개념의 신뢰할 수 있는 검색을 보여주었다.
- 기존 시스템이 포착하지 못하는 다단어 개념과 실세계 인스턴스 처리에서 이 방법이 뛰어난 성능을 보였으며, 이는 많은 이전 시스템이 이를 실패하는 데 기인한다.
- 피자 온톨로지 통합 결과(F1: 0.86–0.88)는 보안 결과보다 높았으며, 이는 도메인 특이성과 개념 명확성이 성능에 상당한 영향을 미친다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.