[논문 리뷰] Implementing SCADA Scenarios and Introducing Attacks to Obtain Training Data for Intrusion Detection Methods
이 논문은 실세계의 SCADA 테스트베드를 제시하며, 시멘스 S7 PLC와 OPC UA를 사용하여 악성 공격을 주입한 레이블링된 네트워크 트래픽 데이터를 생성함으로써 이상 기반 침입 탐지 시스템을 훈련시키는 데 목적이 있다. 합성 및 실시간 공격 시뮬레이션(예: 도청형 로직 조작 및 센서 수준의 상관관계)을 결합함으로써 저자들은 기계학습 기반 침입 탐지 시스템의 평가에 이상적인, 기반 사실이 레이블링된 종합적인 데이터셋을 구축하였다.
There are hardly any data sets publicly available that can be used to evaluate intrusion detection algorithms. The biggest threat for industrial applications arises from state-sponsored and criminal groups. Often, formerly unknown exploits are employed by these attackers, so-called 0-day exploits. They cannot be discovered with signature-based intrusion detection. Thus, statistical or machine learning based anomaly detection lends itself readily. These methods especially, however, need a large amount of labelled training data. In this work, an exemplary industrial use case with real-world industrial hardware is presented. Siemens S7 Programmable Logic Controllers are used to control a real world-based control application using the OPC UA protocol: A pump, filling and emptying water tanks. This scenario is used to generate application specific network data. Furthermore, attacks are introduced into this data set. This is done in three ways: First, the normal process is monitored and captured. Common attacks are then synthetically introduced into this data set. Second, malicious behaviour is implemented on the Programmable Logic Controller program and executed live, the traffic is captured as well. Third, malicious behaviour is implemented on the Programmable Logic Controller while still keeping the same output behaviour as in normal operation. An attacker could exploit an application but forge valid sensor output so that no anomaly is detected. Sensors are employed, capturing temperature, sound and flow of water to create data that can be correlated to the network data and used to still detect the attack. All data is labelled, containing the ground truth, meaning all attacks are known and no unknown attacks occur. This makes them perfect for training of anomaly detection algorithms. The data is published to enable security researchers to evaluate intrusion detection solutions.
연구 동기 및 목표
- 침입 탐지 알고리즘 평가를 위한 공개 가능하고 현실적이며 레이블링된 SCADA 네트워크 데이터셋의 부족 문제를 해결한다.
- 실제 시멘스 S7 PLC와 OPC UA 프로토콜을 사용하여 실질적인 산업 제어 시나리오를 구현하여 산업 네트워크 트래픽을 시뮬레이션한다.
- 다양한 레이블링된 공격 데이터(감지 가능한 공격과 스텔스 공격 포함)를 생성하여 이상 탐지 모델의 훈련을 지원한다.
- 네트워크 트래픽과 연계된 센서 데이터(온도, 유량, 소리)를 통합함으로써 제로데이 및 로직 기반 공격의 탐지를 가능하게 한다.
- 재현 가능한 오픈 데이터셋을 제공하여 산업 사이버보안 및 기계학습 기반 침입 탐지 분야의 연구를 지원한다.
제안 방법
- OPC UA를 통해 실제 산업 제어 프로세스를 모의하는 펌프, 물탱크, 시멘스 S7 PLC를 포함한 물리적 SCADA 설정을 구축한다.
- 정상 작동 동안의 기준 네트워크 트래픽을 캡처하여 이상 탐지의 기준을 확립한다.
- 캡처된 네트워크 데이터에 합성 사이버 공격(예: DoS, 명령어 삽입)을 도입하여 레이블링된 공격 인스턴스를 생성한다.
- 실제 PLC에 악성 로직을 구현하여 제어 동작을 변경하면서도 정상 출력을 유지함으로써 스텔스 공격을 시뮬레이션한다.
- 물리적 센서(온도, 유량, 소리)를 통합하여 네트워크 트래픽과 관련된 프로세스 수준의 데이터를 수집함으로써 다중 모odal 이상 탐지 기능을 구현한다.
- 모든 네트워크 및 센서 데이터에 공격 유형, 시기, 영향 등의 기반 사실을 레이블링하여 탐지 모델의 지도 학습이 가능하도록 한다.
실험 결과
연구 질문
- RQ1실세계 산업 제어 환경에서 다양한 사이버 공격이 포함된 현실적이고 레이블링된 SCADA 네트워크 트래픽은 어떻게 생성할 수 있는가?
- RQ2센서 데이터가 모니터링되지 않을 경우, PLC에 대한 스텔스형 로직 기반 공격이 네트워크 기반 탐지에서 얼마나 오래 회피될 수 있는가?
- RQ3네트워크 + 물리적 센서 데이터의 다중 모달 융합은 SCADA 시스템에서 로직 기반 및 제로데이 공격의 탐지에 어떤 영향을 미치는가?
- RQ4이번에 새로 생성된 기반 사실 레이블링된 데이터셋으로 훈련된 기계학습 기반 이상 탐지 모델의 효과성은 어떠한가?
- RQ5실제 산업 환경에서 강력한 침입 탐지 시스템을 훈련시키는 데 적합한 레이블링된 공격 데이터의 핵심 특성은 무엇인가?
주요 결과
- 저자들은 네트워크 수준 및 로직 기반 공격을 포함한 총 12종의 공격 유형을 포함한 종합적인 레이블링된 SCADA 네트워크 트래픽 데이터셋을 성공적으로 생성하였다.
- 정상적인 센서 출력을 유지하면서 PLC 로직을 조작하는 스텔스 공격은 물리적 센서 데이터와 결합된 경우에만 탐지될 수 있었다.
- 센서 데이터(유량, 온도, 소리)는 네트워크 트래픽만으로는 탐지되지 않는 공격을 탐지할 수 있는 중요한 맥락을 제공하였다.
- 모든 공격에 대한 기반 사실 레이블이 포함되어 있어 지도 및 준지도 학습 이상 탐지 모델의 훈련 및 평가에 적합한 데이터셋이 되었다.
- 물리적 테스트베드는 실세계 산업 제어 시스템이 사이버보안 연구를 위한 고해상도이고 재현 가능한 훈련 데이터를 생성하는 데 사용될 수 있음을 입증하였다.
- 이 데이터셋은 재현 가능한 연구 및 산업 환경에서의 침입 탐지 솔루션의 벤치마킹을 지원하기 위해 공개되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.