Skip to main content
QUICK REVIEW

[논문 리뷰] RecSys Challenge 2016: job recommendations based on preselection of offers and gradient boosting

Andrzej Pacuk, Piotr Sankowski|arXiv (Cornell University)|2016. 12. 03.
Data Mining Algorithms and Applications참고 문헌 3인용 수 16
한 줄 요약

이 논문은 Xing.com에서의 직업 추천을 위해 후보 일자리 제안을 사전에 선별한 후 기울기 부스팅(XGBoost)을 사용하여 사용자 상호작용 확률을 예측하는 이단계적 접근법을 제시한다. 이 방법은 RecSys Challenge 2016에서 2등을 차지하여 공개 리더보드에서 675,985.03점, 비공개 리더보드에서 2,035,964.16점을 기록했으며, 복잡한 특징의 융합과 모델 블렌딩을 효과적으로 활용하여 사용자당 상위 30개의 추천을 랭킹하는 데 성공했다.

ABSTRACT

We present the Mim-Solution's approach to the RecSys Challenge 2016, which ranked 2nd. The goal of the competition was to prepare job recommendations for the users of the website Xing.com. Our two phase algorithm consists of candidate selection followed by the candidate ranking. We ranked the candidates by the predicted probability that the user will positively interact with the job offer. We have used Gradient Boosting Decision Trees as the regression tool.

연구 동기 및 목표

  • 익명화된 상호작용 및 노출 데이터를 기반으로 Xing.com 사용자를 위한 확장성 있고 정확한 직업 추천 시스템을 개발하기 위해.
  • 많은 수의 가능한 사용자-아이템 쌍이 존재함에도 불구하고 대규모로 사용자 상호작용을 효율적으로 예측하는 데 도전하기 위해.
  • 기계학습 모델을 적용하기 전에 후보 일자리 제안의 하위집합에 집중하여 추천 품질을 향상시키기 위해.
  • 상위 순위에서의 정밀도와 사용자 성공을 강조하는 경쟁의 맞춤형 평가 지표에 최적화하기 위해.
  • 콘텐츠 기반, 협업 필터링, 시간적, 인기 기반 특징의 다양성이 상호작용 예측 성능에 미치는 영향을 탐색하기 위해.

제안 방법

  • 해결책은 이단계 파이프라인을 사용한다: 첫째, 사용자 및 아이템 속성 기반 히우리스틱 필터를 사용하여 각 사용자별 후보 일자리 제안을 사전에 선별하여 검색 공간을 150K×327K에서 다룰 수 있는 하위집합으로 줄인다.
  • 둘째, 다양한 특징을 사용하여 기울기 부스팅 결정트리(XGBoost)를 훈련시켜 사용자가 각 후보 일자리 제안에 긍정적으로 상호작용할 확률을 예측한다.
  • 특징으로는 콘텐츠 기반 유사도(예: 경력 수준 차이, 직무 역할 및 제목 겹침), 협업 필터링 신호(예: 클릭한 아이템과의 최대 유사도), 시간적 특징(예: 마지막 상호작용 이후 경과 시간), 인기 추세 등이 포함된다.
  • 훈련 데이터와 테스트 데이터 간의 시간적 특징을 일치시키기 위해 타임스탬프를 이동시켜 일관된 분포를 확보하였다.
  • 다중 XGBoost 모델의 예측 확률을 평균화하여 블렌딩 전략을 적용함으로써 정밀도와 일반화 능력을 향상시켰다.
  • 최종적으로, 평균 예측 확률에 따라 후보 아이템을 정렬하고 사용자가 삭제한 항목을 제외한 후 상위 30개를 선택하여 추천을 생성하였다.

실험 결과

연구 질문

  • RQ1확장성 있는 이단계 추천 파이프라인은 희소한 상호작용 데이터를 가진 대규모 직업 추천 작업에서 성능을 어떻게 향상시킬 수 있는가?
  • RQ2특히 시간적, 협업 필터링, 콘텐츠 기반 신호와 같은 공학된 특징은 기울기 부스팅 모델의 예측 능력에 얼마나 기여하는가?
  • RQ3사전에 후보 일자리 제안을 선별하는 것이 훈련 및 추론 비용을 크게 줄일 수 있을까, 동시에 높은 추천 정확도를 유지할 수 있을까?
  • RQ4예측 확률의 평균화를 통한 모델 블렌딩 전략은 RecSys Challenge 평가 지표에서 일반화 능력과 랭킹 성능을 얼마나 향상시키는가?
  • RQ5전반적인 추천 시스템 성능에서 후보 선별와 후보 랭킹의 상대적 기여도는 어떠한가?

주요 결과

  • 이 방법은 RecSys Challenge 2016에서 2등을 차지하여 공개 리더보드에서 675,985.03점, 비공개 리더보드에서 2,035,964.16점을 기록했다.
  • 후보 랭킹 단계에서 최고의 가능한 점수의 77.5%를 달성하여 추천 순서 정렬 성능가 매우 우수함을 시사한다.
  • 후보 선별 단계에서는 최고의 가능한 점수의 37%에 그쳐 사전 선별 전략의 향상 여지가 크다는 것을 시사한다.
  • 다중 XGBoost 예측 결과의 산술 평균을 통한 모델 블렌딩이 정밀도를 향상시키고 상위 성능 달성에 기여했다.
  • 시간적 및 협업 필터링 특징, 예를 들어 마지막 상호작용 이후 경과 시간, 이전에 클릭한 항목과의 유사도 등이 가장 예측 능력 있는 특징들 중 하나였다.
  • 사전 선별 전략을 사용함으로써 사용자-아이템 쌍의 수를 150K×327K에서 다룰 수 있는 크기로 줄여, 복잡한 특징 세트를 활용한 효율적인 훈련과 추론을 가능케 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.