Skip to main content
QUICK REVIEW

[论文解读] Machine Learning and Deep Learning for Fixed-Text Keystroke Dynamics

Han-Chih Chang, Jianwei Li|arXiv (Cornell University)|Jul 1, 2021
Hand Gesture Recognition Systems被引用 5
一句话总结

本论文评估了用于固定文本击键动态认证的机器学习与深度学习模型,采用按键和释放时长等时间特征。通过数据增强的极端梯度提升(XGBoost)模型实现了96.39%的最高准确率,优于先前研究,且训练时间高效。

ABSTRACT

Keystroke dynamics can be used to analyze the way that users type by measuring various aspects of keyboard input. Previous work has demonstrated the feasibility of user authentication and identification utilizing keystroke dynamics. In this research, we consider a wide variety of machine learning and deep learning techniques based on fixed-text keystroke-derived features, we optimize the resulting models, and we compare our results to those obtained in related research. We find that models based on extreme gradient boosting (XGBoost) and multi-layer perceptrons (MLP)perform well in our experiments. Our best models outperform previous comparable research.

研究动机与目标

  • 评估一系列机器学习与深度学习模型在基于固定文本击键动态的用户认证中的表现。
  • 通过数据增强与超参数调优等技术优化模型性能。
  • 与先前研究对比,确立在CMU固定文本数据集上的最先进性能。
  • 评估采用被动、连续击键监控实现实时入侵检测的可行性。
  • 探索在生物特征认证中模型准确率、训练效率与鲁棒性之间的权衡。

提出的方法

  • 收集了包括按键时长、释放时长、飞行时间及键间间隔在内的击键时间特征。
  • 应用数据增强技术以提升模型泛化能力,并减少在有限用户数据上的过拟合。
  • 训练并比较了多种模型:k-NN、SVM、随机森林、XGBoost、MLP、CNN、RNN与LSTM。
  • 使用准确率与混淆矩阵等标准评估指标来衡量模型性能。
  • 采用注意力机制可视化(热力图)以解释模型决策,尤其针对基于RNN的模型。
  • 通过网格搜索与交叉验证优化模型,以确定每种算法的最佳超参数。

实验结果

研究问题

  • RQ1哪些机器学习与深度学习模型在固定文本击键动态认证中达到最高准确率?
  • RQ2在低数据环境下,数据增强如何影响模型性能与泛化能力?
  • RQ3不同算法之间,模型准确率与训练效率的权衡关系如何?
  • RQ4XGBoost与MLP相较于先前最先进模型在相同基准数据集上的表现如何?
  • RQ5RNN中的注意力机制在多大程度上能为击键模式识别提供可解释性洞察?

主要发现

  • XGBoost结合数据增强在CMU固定文本数据集上实现了96.39%的最高准确率,优于所有先前可比方法。
  • 多层感知机(MLP)以95.67%的准确率接近最优性能,表明其尽管结构简单,仍具备强大泛化能力。
  • XGBoost结合数据增强的训练时间仅需18分钟,显著短于MLP的30分钟,显示出更优的训练效率。
  • 表现最佳的模型(XGBoost-augment与MLP)在不同用户间保持一致性能,表明对个体打字差异具有鲁棒性。
  • 注意力热力图可视化显示,基于RNN的模型聚焦于关键击键时间间隔,表明其有效学习了时间模式。
  • 本研究证实,在低数据生物特征认证场景中,模型优化与数据增强对提升性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。