[论文解读] Intelligence-based Cybersecurity Awareness Training- an Exploratory Project
本文提出了InCAT,一种基于智能的网络安全意识培训模型,通过整合网络威胁情报与人类响应数据,实现敏捷、威胁驱动的培训。利用IBM Watson Knowledge Studio构建领域特定本体,并对100份威胁报告和127份评估结果进行标注,系统实现了66%的实体覆盖率和75%的准确率,为风险与事件管理提供可操作的情报。
Cybersecurity training should be adaptable to evolving the cyber threat landscape, cost effective and integrated well with other enterprise management components. Unfortunately, very few cybersecurity training platforms can satisfy such requirements. This paper proposes a new and novel model for conducting cybersecurity training with three main objectives: (i) training should be initiated by emerging relevant threats and delivered first to the most vulnerable members (ii) the process has to be agile (iii) training results must be able to provide actionable intelligence. For the first time, this paper establishes a type system (ontology and associated relationships) that links the domain of cybersecurity awareness training with that of cyber threat intelligence. Powered by IBM Watson Knowledge Studio platform, the proposed method was found to be practical and scalable. Main contributions such as exports of the type system, the manually annotated corpus of 100 threat reports and 127 cybersecurity assessment results, the dictionaries for pre-annotation, etc were made publicly available.
研究动机与目标
- 弥合现有自适应、威胁响应型网络安全意识培训与企业风险及威胁管理系统的整合缺口。
- 克服传统以合规性或知识为基础的培训模式的局限性,这些模式无法有效模拟真实世界的人类行为与不断演变的威胁。
- 开发一种可扩展的、基于本体的框架,将网络安全意识培训与网络威胁情报相连接,以提升组织的韧性。
- 创建公开可获取的资源,如标注语料库、类型系统和预标注词典,以支持未来研究与定制化需求。
- 建立技术威胁分析与人类脆弱性检测之间的反馈回路,从培训结果中生成可操作的情报。
提出的方法
- 使用IBM Watson Knowledge Studio构建一个领域特定的类型系统(本体),将网络安全意识培训、威胁情报与系统日志关联起来。
- 手动标注100份网络安全威胁报告和127份网络安全评估结果,以构建高质量的训练语料库。
- 开发预标注词典,以提高语料库中实体与关系标注的效率与一致性。
- 利用IBM Watson的自然语言处理流水线,从非结构化文本中提取实体、关系与指代关系,重点关注攻防主题。
- 实施双重视角分析:'技术视角'(以威胁情报驱动的主题)与'人类视角'(用户响应分析),以识别组织中的脆弱性。
- 将机器学习模型与潜在的基于规则的逻辑(如Prolog)结合,以提升准确性,并实现超越训练数据的推理能力。
实验结果
研究问题
- RQ1如何通过与实时威胁情报的集成,使网络安全意识培训能够适应新兴威胁?
- RQ2共享类型系统(本体)在多大程度上能有效连接网络安全意识培训数据、网络威胁情报与系统日志?
- RQ3基于机器学习的标注流水线(使用IBM Watson)在从网络安全报告与评估中提取可操作实体与关系方面的性能如何?
- RQ4如何将培训结果转化为企业风险与威胁管理系统的可操作情报?
- RQ5当前本体设计在处理网络安全语境中自然语言歧义与罕见实体出现方面存在哪些局限性?
主要发现
- 所提出的InCAT模型成功构建了一个将网络安全意识培训与网络威胁情报相连接的类型系统,形成了跨领域数据集成的基础本体。
- 对100份威胁报告和127份评估结果的手动标注语料库,为未来研究与模型训练提供了高质量、公开可获取的数据集。
- 系统利用IBM Watson实现了66%的实体标记覆盖率与75%的实体识别准确率,证明了其在实际部署中的可扩展性。
- 实体提及的标注者间一致性达到加权F1分数0.61,表明尽管面临歧义与罕见实体的挑战,仍具备中等至较强的标注一致性。
- 本项目识别出刚性层级本体设计的关键局限,建议采用更具灵活性、语法感知的模型,以提升性能并减少标注冲突。
- 建议将基于规则的逻辑(如Prolog)与机器学习模型结合,以增强推理能力,并降低对大规模标注数据集的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。