[논문 리뷰] NLP Methods in Host-based Intrusion Detection Systems: A Systematic Review and Future Directions
이 체계적 리뷰는 자연어 처리(NLP) 기법을 호스트 기반 침입 탐지 시스템(HIDS)에 적용하여 복잡한, 저발자국의, 제로데이 공격을 향상된 방식으로 탐지하는 데 초점을 맞춘다. 시스템 호출 시퀀스를 자연어 문장으로 간주함으로써, 딥러닝 모델인 BiLSTM, CNN, 주의 메커니즘 등을 포함한 NLP 기반 방법을 평가하여 기존의 패턴 매칭 기반 접근 방식에 비해 임의의 경고 수를 줄이고 이상 탐지 정확도를 향상시키는 데 성공함을 입증한다.
Host based Intrusion Detection System (HIDS) is an effective last line of defense for defending against cyber security attacks after perimeter defenses (e.g., Network based Intrusion Detection System and Firewall) have failed or been bypassed. HIDS is widely adopted in the industry as HIDS is ranked among the top two most used security tools by Security Operation Centers (SOC) of organizations. Although effective and efficient HIDS is highly desirable for industrial organizations, the evolution of increasingly complex attack patterns causes several challenges resulting in performance degradation of HIDS (e.g., high false alert rate creating alert fatigue for SOC staff). Since Natural Language Processing (NLP) methods are better suited for identifying complex attack patterns, an increasing number of HIDS are leveraging the advances in NLP that have shown effective and efficient performance in precisely detecting low footprint, zero day attacks and predicting the next steps of attackers. This active research trend of using NLP in HIDS demands a synthesized and comprehensive body of knowledge of NLP based HIDS. Thus, we conducted a systematic review of the literature on the end to end pipeline of the use of NLP in HIDS development. For the end to end NLP based HIDS development pipeline, we identify, taxonomically categorize and systematically compare the state of the art of NLP methods usage in HIDS, attacks detected by these NLP methods, datasets and evaluation metrics which are used to evaluate the NLP based HIDS. We highlight the relevant prevalent practices, considerations, advantages and limitations to support the HIDS developers. We also outline the future research directions for the NLP based HIDS development.
연구 동기 및 목표
- 복잡한 공격 패턴을 탐지하기 위해 HIDS에서 사용되는 최신 NLP 기법을 식별하고 분류하는 것.
- NLP 기반 HIDS 접근 방식이 대상으로 삼는 데이터셋, 평가 지표, 공격 유형을 분석하는 것.
- NLP 기반 HIDS 개발에서의 이점, 한계점, 실용적 고려사항을 평가하는 것.
- 침입 탐지에 시스템 호출 시퀀스에 적용된 NLP 기법의 종합적 분류 체계를 수립하는 것.
- 실제 사이버 방어 응용 분야에서 NLP 기반 HIDS를 발전시키기 위한 향후 연구 방향을 제시하는 것.
제안 방법
- PRISMA 지침을 따르며, NLP를 활용한 HIDS 분야의 동료 심사 논문을 체계적으로 문헌 리뷰 수행.
- 시스템 호출 시퀀스 표현, 임bedding, 이상 탐지 모델 등을 포함한 HIDS 파이프라인에 NLP 기법을 매핑.
- 워드 임베딩(예: Word2Vec), 시퀀스 모델(예: BiLSTM, GRU), 주의 메커니즘 등 카테고리로 NLP 방법을 분류.
- 다양한 데이터셋에서 표준 평가 지표(감지율, 임의의 경고율(FAR), F1 점수)를 사용해 모델 성능 평가.
- n-그램, 시퀀스-투-시퀀스 모델, 임베딩 기반 표현 등 시스템 호출 표현 기법 분석.
- 65篇의 인용 논문에서의 통합적 발견을 통해 NLP 기반 HIDS 개발 분야의 추세, 격차, 최선의 실천 방법 식별.
실험 결과
연구 질문
- RQ1HIDS에서 가장 흔하게 사용되는 NLP 기법은 무엇이며, 시스템 호출 시퀀스에 어떻게 적용되는가?
- RQ2NLP 기반 HIDS 연구에서 널리 사용되는 데이터셋과 평가 지표는 무엇이며, 이는 모델 성능에 어떻게 영향을 미치는가?
- RQ3감지 정확도와 임의의 경고 감소 측면에서 NLP 기반 HIDS는 기존의 HIDS와 비교해 어떻게 다른가?
- RQ4특히 데이터 불균형과 실시간 처리 문제에 있어서 NLP를 HIDS에 적용할 때의 주요 과제와 한계는 무엇인가?
- RQ5NLP 기반 호스트 기반 침입 탐지 시스템의 발전을 위한 향후 연구 방향은 무엇인가?
주요 결과
- 시스템 호출 시퀀스의 맥락적 이해 덕분에 NLP 기반 HIDS는 복잡한, 저발자국의, 제로데이 공격 탐지에서 기존의 패턴 매칭 기반 HIDS보다 뛰어난 성능을 보인다.
- BiLSTM, CNN-BiLSTM 하이브리드 모델, 주의 메커니즘 등 딥러닝 모델은 일부 연구에서 최대 98.7%까지 감지율을 달성하고 기존 방법에 비해 더 낮은 임의의 경고율을 기록한다.
- 시스템 호출에 대한 임베딩 기반 표현(예: Word2Vec, GloVe)은 의미적 유사도 탐지에 기여하여 정상 및 비정상 행동의 모델링을 향상시킨다.
- 시퀀스-투-시퀀스 모델과 오토에인코더는 스트리밍 시스템 호출 데이터에서 이상 예측 및 재구성 기반 탐지에 강력한 잠재력을 보이고 있다.
- GAN과 시퀀스 생성 모델 등의 데이터 증강 기법은 클래스 불균형 문제를 완화하고 저자료 환경에서의 모델 일반화 능력을 향상시킨다.
- 다양한 발전에도 불구하고, 높은 계산 오버헤드와 분야 내 표준화된 벤치마크 및 데이터셋 부족으로 인해 실시간 구현에 어려움이 남.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.