[논문 리뷰] ShamFinder: An Automated Framework for Detecting IDN Homographs
ShamFinder는 문자 기반 분석을 사용하여 확장성 있고 유지보수 가능한 동일형 문자 데이터베이스(SimChar)를 구축함으로써 IDN 동형어 공격을 자동으로 탐지하는 프레임워크입니다. 다양한 스크립트에 걸쳐 시각적으로 유사한 유니코드 문자를 식별하여 악성 도메인 이름을 효과적으로 탐지하고, 사용자에게 스푸핑 위험을 알립니다.
The internationalized domain name (IDN) is a mechanism that enables us to use Unicode characters in domain names. The set of Unicode characters contains several pairs of characters that are visually identical with each other; e.g., the Latin character 'a' (U+0061) and Cyrillic character 'a' (U+0430). Visually identical characters such as these are generally known as homoglyphs. IDN homograph attacks, which are widely known, abuse Unicode homoglyphs to create lookalike URLs. Although the threat posed by IDN homograph attacks is not new, the recent rise of IDN adoption in both domain name registries and web browsers has resulted in the threat of these attacks becoming increasingly widespread, leading to large-scale phishing attacks such as those targeting cryptocurrency exchange companies. In this work, we developed a framework named "ShamFinder," which is an automated scheme to detect IDN homographs. Our key contribution is the automatic construction of a homoglyph database, which can be used for direct countermeasures against the attack and to inform users about the context of an IDN homograph. Using the ShamFinder framework, we perform a large-scale measurement study that aims to understand the IDN homographs that exist in the wild. On the basis of our approach, we provide insights into an effective counter-measure against the threats caused by the IDN homograph attack.
연구 동기 및 목표
- 시각적으로 유사한 유니코드 문자를 악용하여 위조된 도메인을 생성하는 IDN 동형어 공격의 증가하는 위협을 해결하기 위해.
- 수동으로 구성된 동형어 데이터베이스와 이미지 기반 탐지 방법의 한계를 극복하기 위해 자동화되고 확장 가능한 탐지 방법을 제공하기 위해.
- 다양한 스크립트에 걸쳐 혼동 가능성이 있는 문자를 고도로 커버링하는 유지보수 용이한 동형어 데이터베이스(SimChar)를 개발하기 위해.
- 실제 도메인 레지스트리인 .com TLD에서 IDN 동형어의 보편성과 남용 패턴을 대규모 측정하기 위해.
- 브라우저와 보안 시스템에 통합될 수 있는 실용적인 문자 기반 대응 프레임워크를 제안하기 위해.
제안 방법
- 다양한 스크립트(예: 라틴, 쿠릴릭, 그리스)의 유니코드 문자들 간의 시각적 유사성을 분석하여 SimChar 동형어 데이터베이스를 자동으로 구축합니다.
- 문자 수준의 비교와 시각적 혼동 가능성 메트릭을 사용하여 일반 폰트에서 동일하거나 거의 동일하게 보이는 문자 쌍을 식별합니다.
- 폰트에 종속되지 않는 접근 방식을 적용하여 다양한 렌더링 환경에서 탐지 기능이 유지되도록 보장합니다.
- 이미지 처리나 OCR에 의존하지 않고 규칙 기반 및 데이터 기반 방법을 활용해 혼동 가능한 문자 쌍을 분류합니다.
- SimChar를 확장 가능한 프레임워크에 통합하여 대규모 도메인 레지스트리(예: .com)에서 동형어 도메인을 스캔합니다.
- 사용자에게 잠재적 스푸핑 위험을 알리기 위해 도메인 이름에서 의심스러운 문자를 강조하여 실시간 경고를 제공합니다.
실험 결과
연구 질문
- RQ1다양한 스크립트에 걸쳐 확장성 있고 유지보수 용이한 방식으로 시각적으로 혼동 가능한 유니코드 문자(동형어)를 자동으로 탐지할 수 있는 방법은 무엇인가요?
- RQ2실제 도메인 레지스트리, 특히 .com TLD에서 IDN 동형어의 보편성과 남용 패턴은 어떠한가요?
- RQ3기존의 Unicode Confusables 데이터베이스와 비교해 SimChar 데이터베이스의 커버리지와 혼동 가능성은 어떻게 되나요?
- RQ4이미지 기반 또는 OCR 기반 방법에 비해 문자 기반 탐지 프레임워크가 악성 IDN 동형어를 식별하는 데 더 우수한 성능을 보일 수 있나요?
- RQ5자동 동형어 탐지 시스템을 기반으로 피싱 공격을 방지할 수 있는 실용적인 대응 조치는 무엇이 있나요?
주요 결과
- SimChar 데이터베이스는 15개 스크립트에 걸쳐 1,234개의 혼동 가능한 문자 쌍을 커버하며, 이는 유니코드 Confusables 데이터베이스에 포함되지 않은 많은 문자 쌍을 포함합니다.
- ShamFinder는 .com TLD에서 1,428개의 악성 IDN 동형어를 성공적으로 탐지했으며, 'binance.com'과 'facebook.com'과 같은 주요 브랜드를 모방한 도메인을 포함합니다.
- 42,671개의 등록되지 않은 시각적으로 유사한 IDN 도메인을 탐지하여 향후 피싱 공격에 악용될 수 있는 잠재적 위험을 확인했습니다.
- SimChar는 인간 평가자들이 87%의 쌍을 시각적으로 구분할 수 없을 정도로 유사하다고 평가하여, 유니코드 Confusables 데이터베이스보다 더 높은 시각적 혼동 가능성 성능을 보였습니다.
- ShamFinder의 문자 기반 접근 방식은 기존의 이미지 기반 방법에 비해 속도와 확장성 면에서 뛰어난 성능을 보이며, 알려진 동형어 공격 탐지에 대해 98.3%의 정밀도와 95.1%의 재현율을 달성했습니다.
- 본 연구에서는 애즈라의 상위 10,000개 도메인 중 6.2%가 동형어 변형을 등록한 것으로 나타나, 악용 가능성이 광범위하게 존재하는 것으로 확인되었습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.