[논문 리뷰] Detecting Malicious URLs of COVID-19 Pandemic using ML technologies
이 논문은 사전 처리된 오픈소스 데이터와 특성 공학(특히 엔트로피 계산 포함)을 활용하여 코로나19 패닉과 관련된 악성 URL을 탐지하기 위한 기계학습 기반 접근법을 제안한다. 모델는 불안감을 반영한 악성 위협 가중치를 통합함으로써 검출 정확도를 향상시켜 팬데믹 관련 사이버 위협에 대한 조기 대응 잠재력을 입증한다.
Throughout the COVID-19 outbreak, malicious attacks have become more pervasive and damaging than ever. Malicious intruders have been responsible for most cybercrimes committed recently and are the cause for a growing number of cyber threats, including identity and IP thefts, financial crimes, and cyber-attacks to critical infrastructures. Machine learning (ML) has proven itself as a prominent field of study over the past decade by solving many highly complex and sophisticated real-world problems. This paper proposes an ML-based classification technique to detect the growing number of malicious URLs, due to the COVID-19 pandemic, which is currently considered a threat to IT users. We have used a large volume of Open Source data and preprocessed it using our developed tool to generate feature vectors and we trained the ML model using the apprehensive malicious threat weight. Our ML model has been tested, with and without entropy to forecast the threatening factors of COVID-19 URLs. The empirical evidence proves our methods to be a promising mechanism to mitigate COVID-19 related threats early in the attack lifecycle.
연구 동기 및 목표
- 코로나19 패닉을 악용한 사이버 공격의 급증을 다루기 위해 악성 URL과 관련된 문제를 해결한다.
- 팬데믹과 관련된 악성 URL과 정상 URL을 구분할 수 있는 기계학습 모델을 개발한다.
- 엔트로피와 새로운 불안감을 반영한 악성 위협 가중치를 특성 표현에 통합하여 검출 정확도를 향상시킨다.
- 엔트로피를 포함하거나 제거한 상태에서 모델의 성능을 평가하여 그 영향을 위협 예측에 미치는 영향을 분석한다.
- 조기 팬데믹 관련 사이버 위협 탐지를 위한 확장 가능한 데이터 기반 솔루션을 제공한다.
제안 방법
- 저자들은 특수 개발된 도구를 사용하여 대량의 오픈소스 데이터를 수집하고 사전 처리하여 URL 특성 정보를 추출한다.
- URL의 구조적 및 통계적 특성(문자 빈도, 길이, 특수문자 포함 여부 등)을 기반으로 특성 벡터를 생성한다.
- 엔트로피를 계산하여 무작위성 수준을 측정함으로써 가려진 또는 의심스러운 URL을 식별한다.
- 높은 위험도 패턴을 우선시하기 위해 불안감을 반영한 악성 위협 가중치를 사용하여 기계학습 모델을 학습시킨다.
- 가려짐 기법에 대한 민감도를 평가하기 위해 엔트로피 포함 여부에 따라 모델을 평가한다.
- 사전 처리, 특성 추출, 지도 학습을 통합한 분류 파이프라인을 구축하여 악성 URL을 탐지한다.
실험 결과
연구 질문
- RQ1기계학습 모델은 코로나19 패닉과 관련된 악성 URL 탐지에 얼마나 효과적인가?
- RQ2엔트로피를 통합할 경우, 가려진 악성 URL 탐지 능력은 얼마나 향상되는가?
- RQ3불안감을 반영한 악성 위협 가중치는 고위험도 URL 패턴 식별 능력 향상에 어떻게 기여하는가?
- RQ4엔트로피를 포함하거나 제거한 상태에서 모델의 패닉 관련 악성 URL 분류 성능는 어떻게 비교되는가?
- RQ5제안된 방법은 사이버 공격 초기 단계에서 악성 URL을 조기에 탐지하는 데 기여할 수 있는가?
주요 결과
- 제안된 기계학습 모델은 코로나19 팬데믹과 관련된 악성 URL에 대해 향상된 검출 정확도를 보였다.
- 엔트로피를 통합함으로써 모델은 가려진 또는 의심스러운 URL 식별 능력이 크게 향상되었다.
- 불안감을 반영한 악성 위협 가중치는 고위험도 URL 패턴 우선순위 설정에 기여하였다.
- 모델는 강력한 경험적 성능을 보였으며, 팬데믹 관련 사이버 위협에 대한 조기 대응 가능성을 시사했다.
- 결과는 엔트로피와 위협 가중치를 활용한 특성 공학이 검출 신뢰도 향상에 기여함을 시사한다.
- 이 방법은 확장 가능하며 실시간 보안 시스템에 통합될 잠재력을 지닌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.