Skip to main content
QUICK REVIEW

[论文解读] Generative Deep Learning Techniques for Password Generation

David Biesner, Kostadin Cvejoski|arXiv (Cornell University)|Dec 10, 2020
User Authentication and Security Systems参考文献 26被引用 5
一句话总结

本文评估了深度学习模型(包括基于注意力的Transformer、生成对抗网络(GAN)以及一种新型变分自编码器(VAE))在生成真实感密码候选方面的表现。所提出的VAE在密码匹配方面达到最先进性能,并支持插值和定向生成等高级采样技术,优于以往的自编码与基于GAN的方法。

ABSTRACT

Password guessing approaches via deep learning have recently been investigated with significant breakthroughs in their ability to generate novel, realistic password candidates. In the present work we study a broad collection of deep learning and probabilistic based models in the light of password guessing: attention-based deep neural networks, autoencoding mechanisms and generative adversarial networks. We provide novel generative deep-learning models in terms of variational autoencoders exhibiting state-of-art sampling performance, yielding additional latent-space features such as interpolations and targeted sampling. Lastly, we perform a thorough empirical analysis in a unified controlled framework over well-known datasets (RockYou, LinkedIn, Youku, Zomato, Pwnd). Our results not only identify the most promising schemes driven by deep neural networks, but also illustrate the strengths of each approach in terms of generation variability and sample uniqueness.

研究动机与目标

  • 评估并比较深度学习与概率模型在生成真实感密码候选方面的有效性。
  • 开发并分析一种新型变分自编码器(VAE)模型,用于密码生成,具备增强的潜在空间能力。
  • 评估在通用语言数据上预训练与在纯密码数据上训练对深度学习模型性能的影响。
  • 为跨标准密码数据集比较多种生成模型提供统一的实证框架。
  • 研究不同模型在恢复独特密码方面的互补性,以提升整体恢复性能。

提出的方法

  • 采用在密码数据集上微调的基于注意力的Transformer(如GPT-2变体),生成具备上下文感知能力的序列。
  • 应用生成对抗网络(GAN)与Wasserstein GAN,通过对抗训练学习真实密码的分布。
  • 提出一种新型变分自编码器(VAE),具备改进的潜在空间建模能力,支持插值与条件采样。
  • 在五个基准数据集(RockYou、LinkedIn、Youku、Zomato、Pwnd)上采用统一的评估框架。
  • 在密码专用数据与通用语言数据上训练模型,以比较预训练对性能的影响。
  • 采用标准指标,如密码匹配率(测试密码被恢复的百分比),并评估生成样本的多样性与唯一性。

实验结果

研究问题

  • RQ1基于注意力的Transformer与自编码器及GAN在生成真实感密码候选方面表现如何比较?
  • RQ2与仅在密码数据上训练相比,在通用语言数据上预训练在多大程度上能提升密码生成性能?
  • RQ3变分自编码器(VAE)是否能在实现最先进密码匹配性能的同时,支持高级采样能力?
  • RQ4通过组合多个模型能恢复多少独特密码?各模型间恢复密码的重叠程度如何?
  • RQ5VAE的潜在空间几何结构对训练与正则化有多敏感?这对定向采样有何影响?

主要发现

  • 所提出的VAE模型在密码匹配性能上达到最先进水平,在RockYou数据集中恢复了118万条密码,优于以往的自编码方法。
  • VAE支持高级采样技术,如潜在空间插值与定向采样,相比标准自编码器更具灵活性。
  • 在RockYou数据上微调的GPT-2模型恢复了约40%的测试集密码,各模型间存在显著重叠,但也实现了大量独特恢复。
  • 通过组合多个模型(如GPT2F、GPT2S、VAE、PassGAN),在RockYou测试集中恢复了150万条唯一密码——比表现最佳的单个模型多30%。
  • 在Pwnd数据集上测试时,模型集成恢复了1310万条唯一密码——比表现最佳的单个模型(VAE,恢复845万条)多55%。
  • 在RockYou数据上训练的模型显著优于在Pwnd数据上训练的模型,RockYou训练模型恢复了39.1万条Pwnd训练模型未能恢复的独特密码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。