[论文解读] On the Elements of Datasets for Cyber Physical Systems Security
本文提出了一种针对网络物理系统(CPS)安全的综合性数据集架构,整合了物理、网络和攻击数据元素,以支持稳健的AI驱动安全解决方案。通过分析现有数据集和测试平台的局限性,识别出在标注、攻击多样性及可扩展性方面的关键缺口,并倡导采用虚拟化测试平台,以克服CPS安全研究中可重复性和可重用性方面的挑战。
Datasets are essential to apply AI algorithms to Cyber Physical System (CPS) Security. Due to scarcity of real CPS datasets, researchers elected to generate their own datasets using either real or virtualized testbeds. However, unlike other AI domains, a CPS is a complex system with many interfaces that determine its behavior. A dataset that comprises merely a collection of sensor measurements and network traffic may not be sufficient to develop resilient AI defensive or offensive agents. In this paper, we study the \emph{elements} of CPS security datasets required to capture the system behavior and interactions, and propose a dataset architecture that has the potential to enhance the performance of AI algorithms in securing cyber physical systems. The framework includes dataset elements, attack representation, and required dataset features. We compare existing datasets to the proposed architecture to identify the current limitations and discuss the future of CPS dataset generation using testbeds.
研究动机与目标
- 识别有效基于AI的CPS安全所必需的数据元素。
- 解决现有CPS安全数据集稀缺且存在局限的问题,这些数据集通常缺乏物理动态、攻击上下文和适当的标注。
- 提出一种标准化的数据集架构,以支持CPS安全中的防御性和进攻性AI研究。
- 指出当前数据集的不足之处,如缺少系统故障模式、文档不全以及类别不平衡,并倡导采用虚拟化测试平台作为可扩展的替代方案。
- 通过结构良好、文档完整且可扩展的数据集,消除重复的测试平台开发,从而实现更广泛的研究重用。
提出的方法
- 将CPS分解为核心组件——物理系统、网络系统和攻击者,以从其交互中提取相关数据集元素。
- 定义三种主要数据集元素:物理数据(传感器/执行器测量值)、网络数据(网络流量、日志)和攻击数据(攻击类型、向量和时间)。
- 提出一种攻击表示框架,包含攻击语义、隐蔽性以及对物理过程的影响,与MITRE ATT&CK等框架保持一致。
- 提出关键数据集特征,如完整攻击向量的标注、类别平衡和可扩展性,以支持训练鲁棒的AI模型。
- 将现有数据集(如WADI、HAI、S4X15CTF、DEFCON23)与所提出的架构进行对比评估,以识别覆盖缺口。
- 倡导采用虚拟化测试平台作为未来数据集生成的可扩展、可重用且成本效益高的替代方案,替代物理测试平台。
实验结果
研究问题
- RQ1CPS安全数据集必须包含哪些核心数据元素,才能准确反映系统行为和网络物理交互?
- RQ2如何在数据集中有意义地表示攻击数据,以支持防御性和进攻性AI研究?
- RQ3为何现有CPS安全数据集无法支持鲁棒AI模型的训练?其结构性缺陷是什么?
- RQ4虚拟化测试平台在多大程度上可以克服物理测试平台在CPS安全研究中可扩展性和可重用性方面的局限?
- RQ5哪些数据集特征——如标注粒度、类别平衡和文档完整性——对于实现可重复和可重用的研究至关重要?
主要发现
- 现有CPS安全数据集缺少关键元素,如系统故障模式、全面的攻击标注和主机日志,限制了其在AI训练中的实用性。
- 大多数数据集未包含拒绝服务(DoS)攻击或多样化的攻击场景,且许多数据集的标注仅限于单个网络记录,缺乏完整的攻击向量上下文。
- 由于在测试平台上手动注入真实网络攻击的过程繁琐费力,类别不平衡问题尤为严重。
- 物理测试平台难以扩展以支持大规模AI研究,导致各研究团队重复进行孤立的、冗余的开发工作。
- 虚拟化测试平台通过提供可扩展、可重复且可重用的数据集生成方式,并辅以一致的文档,为未来发展提供了有希望的路径。
- 现有公开数据集中缺乏标准化的文档和元数据,迫使研究人员不得不重新构建测试平台,从而拖慢了集体研究的进展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。