[논문 리뷰] Empirical Analysis of Password Reuse and Modification across Online Service
이 대규모 연구는 107개의 온라인 서비스를 통해 2,880만 명의 사용자를 분석하여, 38%가 동일한 암호를 재사용하고, 21%는 매우 예측 가능성이 높은 패턴을 사용해 기존 암호를 수정하는 것으로 밝혀냈다. 훈련 기반 추측 알고리즘을 사용하여 저자들은 10회 시도 이내에 수정된 암호의 30%와 모든 재사용 암호를 해독할 수 있음을 입증했으며, 이는 암호 재사용과 예측 가능한 수정 방식으로 인한 심각한 보안 위험을 드러낸다.
Leaked passwords from data breaches can pose a serious threat to users if the password is reused elsewhere. With more online services getting breached today, there is still a lack of large-scale quantitative understanding of the risks of password reuse across services. In this paper, we analyze a large collection of 28.8 million users and their 61.5 million passwords across 107 services. We find that 38% of the users have reused exactly the same password across different sites, while 20% have modified an existing password to create new ones. In addition, we find that the password modification patterns are highly consistent across different user demographics, indicating a high predictability. To quantify the risk, we build a new training-based guessing algorithm, and show that more than 16 million password pairs can be cracked within just 10 attempts (30% of the modified passwords and all the reused passwords).
연구 동기 및 목표
- 다양한 온라인 서비스에서 대규모로 암호 재사용 및 수정의 빈도와 패턴을 이해하기 위해.
- 실제 데이터 유출 사례에서 암호 재사용 및 예측 가능한 수정 패턴이 초래하는 보안 위험을 정량화하기 위해.
- 일致한 변환 패턴을 활용해 수정된 암호를 효율적으로 예측할 수 있는 훈련 기반 암호 추측 알고리즘을 개발하고 평가하기 위해.
- 사용자 수정 행동의 변동성이 낮다는 점을 감안할 때, 최소한의 훈련 데이터로 온라인 암호 추측 공격의 가능성을 평가하기 위해.
제안 방법
- Gmail, Yahoo, LinkedIn과 같은 주요 플랫폼을 포함한 107개의 온라인 서비스에서 2,880만 명의 사용자로부터 6,150만 개의 암호를 수집하고 분석하였다.
- 암호 수정 패턴을 모델링하기 위해 8개의 고수준 전환 규칙(예: 숫자 추가, 대문자화 등)을 식별하고 분류하였다.
- 훈련 데이터 기반으로 유력한 전환 규칙를 우선순위 정렬하는 베이지안 기반 암호 추측 알고리즘을 개발하였으며, 순환 추측을 통해 효율성을 향상시켰다.
- 수정된 암호 쌍 720만 개를 레이블링한 데이터셋을 대상으로 알고리즘 성능을 평가하였으며, 전체 및 최소한의 훈련 데이터(최소 0.1%)를 사용하여 테스트하였다.
- 10회, 100회, 5,000회 시도 이내 성공률을 측정하였으며, 기준 도구인 John the Ripper(JtR)와의 비교 분석을 수행하였다.
- 해당 알고리즘이 암호 해시를 해독하지 못한 데이터셋에서 소금이 첨가된 암호 해시를 복구할 수 있는 능력을 테스트하여, 평문 추측을 넘어서는 실용성도 입증하였다.
실험 결과
연구 질문
- RQ1다양한 온라인 서비스에서 대규모로 암호 재사용 및 수정이 얼마나 퍼져 있는가?
- RQ2직업, 국적 등 다양한 사용자 인구통계학적 특성 간 암호 수정 패턴은 얼마나 일관성 있는가?
- RQ3최소한의 훈련 데이터로 공격자가 수정된 암호를 얼마나 정확히 예측할 수 있는가?
- RQ4제한된 수의 온라인 시도 내에서 훈련 기반 추측 알고리즘이 수정된 암호를 얼마나 효과적으로 해독할 수 있는가?
- RQ5암호 재사용과 예측 가능한 수정이 함께 작용할 경우 계정 해킹의 총합 위험은 얼마나 증가하는가?
주요 결과
- 38%의 사용자가 다른 서비스 간에 동일한 암호를 재사용하였으며, 이메일 서비스에서는 이 비율이 60.4%에 달해 특히 높은 재사용률을 보였다.
- 21%의 사용자가 기존 암호를 수정하여 새로운 암호를 생성하였고, 이러한 수정 패턴은 다양한 사용자 인구통계학적 특성 간에 매우 일관성이 있었다.
- 제안된 훈련 기반 추측 알고리즘은 10회 시도 이내에 수정된 암호의 30%를, 100회 시도 이내에 46.5%를 해독했으며, 기준 도구보다 뚜렷이 뛰어난 성능을 보였다.
- 단지 전체 데이터의 0.1%만을 훈련 데이터로 사용해도, 전체 데이터의 50%를 훈련 데이터로 사용한 모델과 거의 동일한 성능를 달성하여 사용자 행동의 변동성이 매우 낮음을 확인하였다.
- 1,600만 개 이상의 암호 쌍(재사용된 1,280만 개, 수정된 380만 개 포함)이 10회 시도 이내에 해독 가능했으며, 이는 막대한 온라인 공격 표면을 노출시켰다.
- 기존에 해독되지 못한 암호 해시 중 15.1%(939,400개)가 5,000회 시도 이내에 성공적으로 복구되었으며, 이는 강력한 실생활 적용 가능성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.