Skip to main content
QUICK REVIEW

[논문 리뷰] Classification and Learning-to-rank Approaches for Cross-Device Matching at CIKM Cup 2016

Nam Khanh Tran|arXiv (Cornell University)|2016. 12. 20.
Industrial Vision Systems and Defect Detection참고 문헌 5인용 수 6
한 줄 요약

이 논문은 크로스디바이스 사용자 매칭을 위한 두 가지 접근법을 제안한다: 앙상블 학습을 사용한 이진 분류 방법과 근사 예측 알고리즘을 갖춘 러닝-투-랭크 방법. 특히 예측 세트 크기를 조정한 러닝-투-랭크 접근법이 분류 기반 방법을 능가하며, CIKM 컵 2016 테스트 리더보드에서 F1 스코어 0.36110을 기록하여 브라우징 및 클릭 데이터를 활용해 여러 디바이스 간 사용자를 식별하는 데 뛰어난 성능을 보였다.

ABSTRACT

In this paper, we propose two methods for tackling the problem of cross-device matching for online advertising at CIKM Cup 2016. The first method considers the matching problem as a binary classification task and solve it by utilizing ensemble learning techniques. The second method defines the matching problem as a ranking task and effectively solve it with using learning-to-rank algorithms. The results show that the proposed methods obtain promising results, in which the ranking-based method outperforms the classification-based method for the task.

연구 동기 및 목표

  • 온라인 광고에서 여러 디바이스 간 사용자 정체성을 정확히 연결하는 데 도전하는 것.
  • 익명화된 브라우징 로그와 클릭 데이터에서 매칭되는 사용자 프로파일을 식별하기 위한 확장성 있고 효율적인 방법을 개발하는 것.
  • 크로스디바이스 매칭에서 이진 분류 대비 러닝-투-랭크 접근법의 효과성을 비교하는 것.
  • 공유된 사실과 도메인을 활용하여 예측 세트 생성을 최적화하여 계산 비용을 줄이는 것.
  • 앙상블 학습과 탐욕 알고리즘 기반 예측 랭킹을 통해 모델 성능을 향상시키는 것.

제안 방법

  • 공유된 사실과 도메인에서 파생된 특징을 사용하여 크로스디바이스 매칭을 이진 분류 작업으로 설정하고, xgboost, 신경망, 랜덤 포레스트를 사용한 앙상블 학습을 적용한다.
  • 전체 사용자 풀에서 무작위 샘플링을 피하기 위해 공유된 사실/도메인 기반의 음성 샘플링 전략을 적용하여 현실적인 음성 학습 쌍을 생성한다.
  • 사용자 쌍을 유사도 기반으로 랭킹하는 러닝-투-랭크 문제로 문제를 표현하며, URL 및 제목 토큰에서 파생된 특징을 사용하여 xgboost를 활용한 랭킹을 수행한다.
  • 각 테스트 사용자가 최소한 한 명 이상의 다른 사용자와 연결되어야 하며, 연결된 컴포넌트의 분포가 훈련 데이터와 유사해야 하는 두 가지 조건을 충족시키는 탐욕 알고리즘을 제안하여 최종 예측을 생성한다.
  • 공유된 사실(URL 및 제목)과 공유된 도메인을 기반으로 특징 공학을 수행하여 분류 및 랭킹 모델의 입력 벡터를 구성한다.
  • 검증 세트와 테스트 세트에 각각 167,055개와 215,307개의 양성 쌍을 사용하며, F1 스코어를 최대화하기 위해 예측 세트 크기를 최적화한다.

실험 결과

연구 질문

  • RQ1공유된 브라우징 행동을 사용하여 앙상블 학습이 이진 분류 성능을 향상시킬 수 있는가?
  • RQ2러닝-투-랭크 접근법이 이진 분류 방법보다 크로스디바이스 사용자 정체성을 식별하는 데 더 우수한가?
  • RQ3탐욕 알고리즘이 훈련 그래프의 구조적 특성을 유지하는 예측 세트 생성에 얼마나 효과적인가?
  • RQ4예측 쌍의 수를 최적화하는 것이 최종 리더보드 랭킹의 F1 스코어 향상에 얼마나 기여하는가?
  • RQ5공유된 사실과 도메인은 어떻게 매칭되지 않은 사용자 쌍을 식별하는 데 기여하는가?

주요 결과

  • 러닝-투-랭크 방법은 CIKM 컵 2016 테스트 리더보드에서 F1 스코어 0.36110을 기록하여 모든 분류 기반 방법을 능가했다.
  • 조정된 예측 쌍 수를 가진 탐욕 예측 알고리즘(rank2-tuned)이 모든 제출물 중에서 가장 높은 F1 스코어를 기록하여 예측 세트 크기 최적화의 중요성을 입증했다.
  • 분류 접근법에서 앙상블 학습을 적용함으로써 개별 모델 대비 F1 스코어가 향상되었으며, 레이어 2에서 xgboost가 가장 우수한 성능을 보였다.
  • 랭킹 기반 방법이 분류 기반 방법보다 뛰어나며, F1 스코어는 랭킹 기반(0.42038, Rank1) 대비 분류 기반 기준(0.29229)으로 나타났다.
  • 훈련 데이터에서 공유된 사실과 도메인의 분포를 분석한 결과, 98.5%의 사용자 쌍이 적어도 하나의 사실 또는 도메인을 공유하고 있어 이러한 특징을 모델링에 활용할 수 있음을 뒷받침했다.
  • 제안된 음성 샘플링 방법은 공유된 사실 또는 도메인을 공유하는 사용자에 국한하여 음성 샘플을 제한함으로써 350만 개의 학습 쌍을 효율적으로 생성하여 계산 비용을 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.