Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Device User Matching Based on Massive Browse Logs: The Runner-Up Solution for the 2016 CIKM Cup

Jianxun Lian, Xing Xie|arXiv (Cornell University)|2016. 10. 13.
Spam and Phishing Detection참고 문헌 7인용 수 11
한 줄 요약

이 논문은 2016년 CIKM 컵 크로스디바이스 사용자 매칭 챌린지의 2위 솔루션을 제시하며, 포괄적인 특징 공학, 반복적 음성 샘플링, 그리고 하이브리드 GBDT + 로지스틱 회귀 모델을 활용하여 F1-스코어 0.41669를 달성한다. 이 방법은 사용자 매칭을 이진 분류 문제로 간주하며, TF-IDF 기반 문서 유사도, 시간적 상관관계, URL 수준의 특징을 활용하여 거대한 브라우즈 로그에서의 모델 일반화 능력과 성능을 향상시킨다.

ABSTRACT

As the number and variety of smart devices increase, users may use myriad devices in their daily lives and the online activities become highly fragmented. Building an accurate user identity becomes a difficult and important problem for advertising companies. The task for the CIKM Cup 2016 Track 1 was to find the same user cross multiple devices. This paper discusses our solution to the challenge. It is mainly comprised of three parts: comprehensive feature engineering, negative sampling, and model selection. For each part we describe our special steps and demonstrate how the performance is boosted. We took the second prize of the competition with an F1-score of 0.41669.

연구 동기 및 목표

  • 익명화된 브라우즈 로그를 사용하여 동일한 사용자를 여러 기기 간에 연결하는 데 도전한다.
  • 크로스디바이스 활동 패턴을 모델링하여 분산된 디지털 행동에서 사용자 신원 해석 능력을 향상시킨다.
  • 대규모 사용자 매칭을 위한 확장 가능하고 정확한 이진 분류 프레임워크를 개발한다.
  • 효과적인 특징 설계, 음성 샘플링, 앙상블 모델링을 통해 모델 성능을 최적화한다.

제안 방법

  • 일치하는 사용자 쌍에 대해 양성 레이블, 일치하지 않는 쌍에 대해 음성 레이블을 부여하여 사용자 매칭을 이진 분류 문제로 공식화한다.
  • 문서 유사도(DocSim, TF-IDF 가중 단어 유사도), 이벤트 ID 유사도(FidSim), URL 경로 유사도(URLSim), 시간적 행동 상관관계(HourCor) 등을 포함한 포괄적인 특징을 설계한다.
  • 약한 학습기(weak learner)를 사용하여 하드 음성 예제를 반복적으로 선택하는 반복적 음성 샘플링을 구현하여 모델의 강건성을 향상시켰다.
  • 이중 단계 모델 파이프라인을 적용: 로지스틱 회귀로 상위 후보 쌍을 필터링한 후, 축소된 후보 집합에 대해 GBDT를 사용하여 최종 예측을 수행한다.
  • 로지스틱 회귀가 후보를 사전에 필터링한 후 GBDT 추론을 수행하는 하이브리드 앙상블 전략을 활용하여 계산 부담을 줄이고 정밀도를 향상시켰다.
  • 제출 제약 조건을 고려하여 F1-스코어 최적화를 위해 알고리즘 2를 통해 후처리를 수행하여 사용자별 상위-n 및 근접 순위 쌍을 선택했다.

실험 결과

연구 질문

  • RQ1브라우즈 로그만을 사용할 때 포괄적인 특징 공학이 크로스디바이스 사용자 매칭 성능에 어떻게 기여하는가?
  • RQ2거대하고 흐린 후보 공간에서 학습할 경우, 어떤 음성 샘플링 전략이 모델 일반화 능력을 최대화하는가?
  • RQ3로지스틱 회귀와 GBDT를 조합한 하이브리드 모델이 사용자 연결 작업에서 단일 모델 기반 모델을 능가할 수 있는가?
  • RQ4약한 학습기를 활용한 반복적 음성 샘플링이 대규모 분류 작업에서 모델 수렴과 F1-스코어에 어떤 영향을 미치는가?
  • RQ5제출 크기 제약 조건 하에서 F1-스코어 최적화 시 정밀도와 재현율 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • 로지스틱 회귀로 후보를 사전 필터링한 후 GBDT로 예측하는 하이브리드 모델이 이중 단계 접근 방식의 효과를 입증하며, F1-스코어를 0.3782에서 0.6193으로 크게 향상시켰다.
  • 최종 제출 결과 F1-스코어는 0.41669를 기록하여 CIKM 컵 2016 대회에서 2위를 차지했다.
  • 약한 학습기를 활용한 음성 샘플링을 통해 하드 음성 예제를 반복적으로 선택함으로써 모델 성능이 향상되었으며, 이는 음성 인스턴스 선택이 모델 일반화에 핵심적임을 시사한다.
  • 시간적 상관관계(HourCor)와 URL 수준의 유사도(URLSim) 특징의 활용이 기기 간 사용자 행동 패턴을 구분하는 데 기여하였다.
  • 사용자별 상위-n 및 근접 순위 쌍을 포함하는 후처리 알고리즘(알고리즘 2)이 제출 크기 제한을 초과하지 않으면서도 최고의 F1-스코어를 달성하는 데 기여했다.
  • 로컬 검증 결과와 온라인 F1-스코어가 유사하게 나타나 과적합이 심각하지 않으며, 테스트 세트 샘플링이 효과적임을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.