Skip to main content
QUICK REVIEW

[논문 리뷰] SecureBERT and LLAMA 2 Empowered Control Area Network Intrusion Detection and Classification

Xuemei Li, Huirong Fu|arXiv (Cornell University)|2023. 11. 19.
Network Security and Intrusion Detection인용 수 6
한 줄 요약

이 논문은 원시 텍스트 기반의 CAN 메시지 로그를 사용하여 직접적인 침입 탐지 및 공격 분류를 위한 트랜스포머 기반 모델인 CAN-SecureBERT와 CAN-Llama2를 제안한다. CAN-Llama2 모델은 균형 정확도 0.999993과 3.1e-6의 위양성 비율을 기록하며, 최신 기술인 MTH-IDS보다 52배 낮은 위양성 비율을 보이며 특성 공학 없이도 뛰어난 성능을 입증한다.

ABSTRACT

Numerous studies have proved their effective strength in detecting Control Area Network (CAN) attacks. In the realm of understanding the human semantic space, transformer-based models have demonstrated remarkable effectiveness. Leveraging pre-trained transformers has become a common strategy in various language-related tasks, enabling these models to grasp human semantics more comprehensively. To delve into the adaptability evaluation on pre-trained models for CAN intrusion detection, we have developed two distinct models: CAN-SecureBERT and CAN-LLAMA2. Notably, our CAN-LLAMA2 model surpasses the state-of-the-art models by achieving an exceptional performance 0.999993 in terms of balanced accuracy, precision detection rate, F1 score, and a remarkably low false alarm rate of 3.10e-6. Impressively, the false alarm rate is 52 times smaller than that of the leading model, MTH-IDS (Multitiered Hybrid Intrusion Detection System). Our study underscores the promise of employing a Large Language Model as the foundational model, while incorporating adapters for other cybersecurity-related tasks and maintaining the model's inherent language-related capabilities.

연구 동기 및 목표

  • 기존의 CAN 침입 탐지 시스템이 요구하는 광범위한 사전 처리, 룰 기반 워크플로우 및 특성 공학의 한계를 해결한다.
  • 특히 대규모 언어 모델을 활용한 사전 훈련된 트랜스포머 모델의 적응성과 CAN 네트워크 침입 탐지 및 공격 분류에 대한 적용 가능성을 평가한다.
  • 고도의 탐지 정확도와 낮은 위양성 비율을 유지하면서도 원시 CAN 메시지 로그를 직접 처리할 수 있는 모델을 개발한다.
  • 사전 훈련된 도메인 지식(예: 사이버보안 전문 데이터)과 모델 규모(예: Llama2 대비 BERT)가 IDS 성능에 미치는 영향을 평가한다.
  • 파arameter 효율적인 방법(예: LoRA)으로 미세조정된 대규모 사전 훈련된 LLM이 전통적인 기계학습 기반 IDS 시스템보다 정확도와 내구성 면에서 뛰어나다는 것을 입증한다.

제안 방법

  • 원시 CAN 메시지 로그의 사전 균형 잡힌 데이터셋에 대해 사전 훈련된 트랜스포머 모델인 CAN-C-BERT, CAN-SecureBERT, CAN-Llama2를 미세조정한다.
  • LoRA(Low-Rank Adaptation)를 활용하여 대규모 Llama2 모델의 4000만 개 파라미터만 미세조정하고, 나머지 54배 더 큰 파라미터 기반은 동결한다.
  • 수동적인 특성 추출이나 사전 처리 없이 원시 텍스트 기반의 CAN 메시지를 직접 처리하며, 모델의 어텐션 메커니즘을 활용해 내재된 패턴을 학습한다.
  • 멀티헤드 스레드 어텐션과 위치 인코딩을 적용하여 CAN 메시지 시퀀스의 장거리 종속성과 의미 관계를 모델링한다.
  • 다섯 가지 공격 유형(Dos, Fuzzy, Gear Spoofing, RPM Spoofing)의 균형 잡힌 데이터셋을 기반으로 모델을 종단 간(end-to-end)으로 훈련한다.
  • 표준 평가 지표를 사용해 성능을 평가한다: 균형 정확도(BA), 정밀도(PREC), 탐지율(DR), F1 점수, 위양성 비율(FAR).

실험 결과

연구 질문

  • RQ1Llama2와 같은 사전 훈련된 대규모 언어 모델이 특성 공학 없이도 원시 메시지 로그를 사용하여 직접적인 CAN 침입 탐지에 효과적으로 미세조정될 수 있는가?
  • RQ2트랜스포머 모델의 규모와 사전 훈련 도메인(예: Llama2 대비 BERT 또는 SecureBERT)이 CAN IDS 작업에서 성능에 미치는 영향은 어떠한가?
  • RQ3파라미터 효율적인 미세조정(예: LoRA)이 자원 제약이 있는 차량 환경에서 고성능 추론을 얼마나 잘 가능하게 하는가?
  • RQ4훈련 데이터 크기에 따라 모델 성능은 어떻게 변화하며, 더 큰 모델은 제한된 데이터에서 더 빨리 수렴하고 일반화 성능이 더 뛰어나게 되는가?
  • RQ5LLM 기반 모델은 MTH-IDS와 같은 최신 기술 시스템보다 유의미하게 낮은 위양성 비율을 달성할 수 있는가, 동시에 거의 완벽한 탐지 정확도를 유지할 수 있는가?

주요 결과

  • CAN-Llama2는 균형 정확도 0.999993, 정밀도 1.0, 탐지율 1.0, F1 점수 1.0을 기록하며 위양성 비율은 3.1e-6이다.
  • CAN-Llama2의 위양성 비율(3.1e-6)은 최신 기술인 MTH-IDS 모델보다 52배 낮다.
  • 1%의 데이터만으로도 다른 모델보다 빠르게 수렴함으로써, 대규모 사전 훈련에서 유도된 더 우수한 인덕티브 바이어스와 패턴 인식 능력을 보여준다.
  • 미세조정된 파라미터 수가 적음에도 불구하고, 더 큰 사전 훈련된 파라미터 기반과 도메인 최적화된 아키텍처 덕분에 CAN-SecureBERT와 CAN-C-BERT를 능가한다.
  • 10%의 데이터로 훈련된 모델는 항상 1% 데이터로 훈련된 모델보다 성능이 뛰어나며, 더 큰 데이터 스케일에서 더 우수한 일반화 능력을 보임을 시사한다.
  • 보안 전문 데이터로 사전 훈련된 CAN-SecureBERT는 CAN-Llama2만큼 뛰어나지 않지만, CAN-C-BERT를 능가하는 성능을 기록함으로써 도메인 특화 사전 훈련이 IDS 성능 향상에 기여한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.