Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Deep Learning Techniques for Password Generation

David Biesner, Kostadin Cvejoski|arXiv (Cornell University)|2020. 12. 10.
User Authentication and Security Systems참고 문헌 26인용 수 5
한 줄 요약

이 논문은 주목적 기반 트랜스포머, GAN, 그리고 새로운 변동형 오토인코더(VAE)를 포함한 딥러닝 모델들을 사용하여 현실적인 비밀번호 후보를 생성하는 것을 평가한다. 제안된 VAE는 비밀번호 일치 성능에서 최고 수준의 성능을 달성하며, 보간 및 타겟 설정 생성과 같은 고급 샘플링 기법을 가능하게 하여 이전의 오토인코딩 및 GAN 기반 방법들을 능가한다.

ABSTRACT

Password guessing approaches via deep learning have recently been investigated with significant breakthroughs in their ability to generate novel, realistic password candidates. In the present work we study a broad collection of deep learning and probabilistic based models in the light of password guessing: attention-based deep neural networks, autoencoding mechanisms and generative adversarial networks. We provide novel generative deep-learning models in terms of variational autoencoders exhibiting state-of-art sampling performance, yielding additional latent-space features such as interpolations and targeted sampling. Lastly, we perform a thorough empirical analysis in a unified controlled framework over well-known datasets (RockYou, LinkedIn, Youku, Zomato, Pwnd). Our results not only identify the most promising schemes driven by deep neural networks, but also illustrate the strengths of each approach in terms of generation variability and sample uniqueness.

연구 동기 및 목표

  • 딥러닝 및 확률적 모델이 현실적인 비밀번호 후보를 생성하는 데 얼마나 효과적인지 평가하고 비교하는 것.
  • 향상된 잠재 공간 기능을 갖춘 새로운 변동형 오토인코더(VAE) 모델을 개발하고 분석하는 것.
  • 일반 언어 데이터에서의 사전 훈련과 순수 비밀번호 데이터에서의 훈련 간에 딥러닝 모델의 성능에 미치는 영향을 평가하는 것.
  • 표준 비밀번호 데이터셋을 기반으로 다양한 생성 모델을 통합적으로 비교할 수 있는 경험적 프레임워크를 제공하는 것.
  • 다양한 모델 간의 상호보완성이 고유한 비밀번호 복구에 미치는 영향을 조사하여 전체 복구 성능을 향상시키는 것.

제안 방법

  • 비밀번호 데이터셋에 맞추어 미세조정된 주목적 기반 트랜스포머(GPT-2 변종 등)를 사용하여 맥락 인식 능력을 갖춘 시퀀스를 생성한다.
  • 생성적 적대적 네트워크(GAN)와 워샤프스키 GAN을 적용하여 적대적 훈련을 통해 실제 비밀번호의 분포를 학습한다.
  • 향상된 잠재 공간 모델링 기능을 갖춘 새로운 변동형 오토인코더(VAE)를 도입하여 보간 및 조건부 샘플링을 가능하게 한다.
  • RockYou, LinkedIn, Youku, Zomato, Pwnd의 다섯 가지 벤치마크 데이터셋에서 통합 평가 프레임워크를 사용한다.
  • 사전 훈련의 영향을 평가하기 위해 비밀번호 전용 데이터와 일반 언어 데이터 양쪽에서 모델을 훈련한다.
  • 비밀번호 일치율(테스트 비밀번호의 백분율)과 유사도 및 유일성 등을 평가하는 표준 지표를 사용한다.

실험 결과

연구 질문

  • RQ1주목적 기반 트랜스포머가 오토인코더 및 GAN보다 현실적인 비밀번호 후보를 생성하는 데 얼마나 효과적인가?
  • RQ2일반 언어 데이터에서의 사전 훈련이 순수 비밀번호 데이터에서의 훈련보다 비밀번호 생성 성능을 얼마나 향상시키는가?
  • RQ3변동형 오토인코더(VAE)가 비밀번호 일치 성능에서 최고 수준의 성능을 달성하면서도 고급 샘플링 기능을 제공할 수 있는가?
  • RQ4다양한 모델을 조합했을 때 얼마나 많은 고유한 비밀번호를 복구할 수 있으며, 각 모델 간에 복구된 비밀번호의 중복 정도는 어떠한가?
  • RQ5VAE의 잠재 공간 기하학적 성질은 훈련 및 정규화에 얼마나 민감한가, 그리고 이는 타겟 설정 샘플링에 어떤 영향을 미치는가?

주요 결과

  • 제안된 VAE 모델은 최고 수준의 비밀번호 일치 성능을 달성하여 RockYou 데이터셋에서 118만 개의 비밀번호를 복구했으며, 이는 이전의 오토인코딩 방법들을 능가한다.
  • VAE는 잠재 공간 보간 및 타겟 설정 샘플링과 같은 고급 샘플링 기법을 가능하게 하여 표준 오토인코더보다 더 큰 유연성을 제공한다.
  • RockYou 데이터에서 훈련된 GPT-2 기반 모델들은 약 40%의 테스트 세트 비밀번호를 복구했으며, 중복은 있었지만 모델 간에 상당한 고유한 복구 성과도 기록했다.
  • 여러 모델을 조합(예: GPT2F, GPT2S, VAE, PassGAN)했을 때 RockYou 테스트 세트에서 150만 개의 고유한 비밀번호를 복구했으며, 최고의 단일 모델보다 30% 더 많았다.
  • Pwnd 데이터셋에서 테스트한 결과, 모델 앙상블은 1310만 개의 고유한 비밀번호를 복구했으며, 최고의 단일 모델(VAE, 845만 개 복구)보다 55% 더 많았다.
  • RockYou 데이터에서 훈련된 모델들이 Pwnd 데이터에서 훈련된 모델들보다 유의미하게 뛰어난 성능을 보였으며, RockYou에서 훈련된 모델들이 Pwnd에서 훈련된 모델들이 놓친 39만 개의 고유한 비밀번호를 복구했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.