Skip to main content
QUICK REVIEW

[论文解读] Machine Learning in Access Control: A Taxonomy and Survey

Mohammad Nur Nobi, Maanak Gupta|arXiv (Cornell University)|Jul 4, 2022
Access Control and Trust被引用 7
一句话总结

本文提出了访问控制中机器学习应用的全面分类法与综述,涵盖属性提取、策略挖掘、决策制定和验证等方向。文章识别了数据稀缺、模型可解释性及偏见等关键挑战,并提出了未来研究方向,以推动安全、可靠的机器学习驱动访问控制系统的发展。

ABSTRACT

An increasing body of work has recognized the importance of exploiting machine learning (ML) advancements to address the need for efficient automation in extracting access control attributes, policy mining, policy verification, access decisions, etc. In this work, we survey and summarize various ML approaches to solve different access control problems. We propose a novel taxonomy of the ML model's application in the access control domain. We highlight current limitations and open challenges such as lack of public real-world datasets, administration of ML-based access control systems, understanding a black-box ML model's decision, etc., and enumerate future research directions.

研究动机与目标

  • 提供对访问控制中机器学习应用在多个子领域内全面且最新的综述。
  • 通过提出一种新颖的、按时间顺序排列的分类法,解决在访问控制中应用机器学习缺乏统一框架的问题。
  • 识别并分析关键挑战,如真实世界数据集不足、模型可解释性以及基于机器学习的访问控制系统中的公平性问题。
  • 总结公开可用的真实世界数据集,用于机器学习驱动的访问控制研究,以支持可复现性和基准测试。
  • 概述开放性挑战,并提出切实可行的未来研究方向,以推动安全可信的机器学习增强型访问控制系统的进步。

提出的方法

  • 利用Google Scholar、ACM Digital Library、IEEE Xplore和Springer等主要学术数据库,对2006年至2022年第一季度的同行评审出版物进行了系统性文献综述。
  • 提出了一个新颖的、多维的访问控制中机器学习应用的分类法,按时间顺序和主题组织,涵盖属性提取、策略挖掘、决策制定和验证等关键问题领域。
  • 基于其使用的机器学习技术、目标访问控制任务和评估方法,对100多项研究工作进行了分类与分析。
  • 评估了在基于机器学习的访问控制研究中使用的公开数据集,包括合成数据和真实世界数据源(如Amazon访问日志数据集,Kaggle, 2013),并评估了其对建模访问控制状态的适用性。
  • 识别并讨论了诸如训练数据中类别不平衡(例如,超过90%的授权请求)、缺乏标准化评估指标以及用于访问控制中机器学习模型的验证工具不足等局限性。
  • 提出了一个系统性验证与测试机器学习驱动访问控制系统的框架,强调需要领域特定的成本建模和反馈回路,以确保公平性与正确性。

实验结果

研究问题

  • RQ1机器学习技术在访问控制的不同子领域(如属性提取、策略挖掘和访问决策制定)中目前如何应用?
  • RQ2哪些关键挑战阻碍了基于机器学习的访问控制系统的采用与可靠性,特别是数据质量、模型可解释性和公平性方面?
  • RQ3目前在基于机器学习的访问控制研究中使用了哪些公开可用的数据集?它们在多大程度上反映了真实世界中的访问控制状态?
  • RQ4现有访问控制中机器学习驱动系统的验证与测试方法存在哪些局限性?如何改进?
  • RQ5为解决开放性挑战并推进机器学习在安全可扩展访问控制系统中的集成,需要哪些未来研究方向?

主要发现

  • 机器学习正越来越多地应用于自动化和增强访问控制任务,包括从自然语言中提取属性、角色-权限映射、从日志中挖掘策略以及访问决策制定。
  • Amazon访问日志数据集(Kaggle, 2013)是最广泛使用的真实世界数据集之一,但其存在严重的类别不平衡(超过90%的授权请求),可能导致模型预测偏向于授予访问权限。
  • 尽管技术有所进步,但目前仍缺乏用于评估基于机器学习的访问控制系统的标准化基准框架,且大多数模型仅在未见的测试集上进行测试,缺乏全面的验证。
  • 模型可解释性仍是主要挑战,因为访问控制中的黑箱机器学习模型缺乏透明度,使得审计决策或检测对抗性行为变得困难。
  • 当前的验证实践不足以确保正确性与公平性;迫切需要考虑误分类不对称成本(如向未经授权用户授予访问权限)的领域特定验证框架。
  • 研究社区缺乏高质量、公开可用的数据集,无法全面反映企业系统中完整的访问控制状态,限制了可复现性与模型泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。