[논문 리뷰] Candidate Generation with Binary Codes for Large-Scale Top-N Recommendation
이 논문은 대규모 Top-N 추천에서 효율적인 후보 생성을 위한 학습된 이진 코드와 고정밀도 재순서 모델을 사용하는 새로운 프레임워크인 CIGAR를 제안한다. 해시 기반 검색을 위한 빠른 이진 임베딩과 정교한 재순서를 위한 실수값 모델을 동시에 최적화함으로써, CIGAR는 성능을 희생시키지 않은 채 순차적보다 수개의 속도로 빠른 추론을 달성하며, 성능을 유지하면서도 확장성을 크게 향상시킨다.
Generating the Top-N recommendations from a large corpus is computationally expensive to perform at scale. Candidate generation and re-ranking based approaches are often adopted in industrial settings to alleviate efficiency problems. However it remains to be fully studied how well such schemes approximate complete rankings (or how many candidates are required to achieve a good approximation), or to develop systematic approaches to generate high-quality candidates efficiently. In this paper, we seek to investigate these questions via proposing a candidate generation and re-ranking based framework (CIGAR), which first learns a preference-preserving binary embedding for building a hash table to retrieve candidates, and then learns to re-rank the candidates using real-valued ranking models with a candidate-oriented objective. We perform a comprehensive study on several large-scale real-world datasets consisting of millions of users/items and hundreds of millions of interactions. Our results show that CIGAR significantly boosts the Top-N accuracy against state-of-the-art recommendation models, while reducing the query time by orders of magnitude. We hope that this work could draw more attention to the candidate generation problem in recommender systems.
연구 동기 및 목표
- 후보 생성과 재순서를 분리함으로써 대규모 Top-N 추천에서의 확장성-효율성 트레이드오���을 해결하기 위해.
- 선호도를 유지하는 이진 코드를 학습시켜 정확도를 훼손하지 않은 채 후보 생성의 효율성을 향상시키기 위해.
- 기존의 고정밀도 재순서 모델을 실시간 시스템에서 효율적으로 사용할 수 있도록 통합 프레임워크를 개발하기 위해.
- 후보 중심의 샘플링과 재순서가 전체 추천 품질을 어떻게 향상시키는지 탐구하기 위해.
- 적절한 재순서와 결합할 경우, 이진 코드 학습이 실수값 모델의 성능을 따라하거나 능가할 수 있는지 증명하기 위해.
제안 방법
- CIGAR는 두 단계 파이프라인을 사용한다: 먼저, HashRec을 통해 이진 코드를 학습하여 후보 검색을 위한 빠른 해시 테이블 검색을 가능하게 한다.
- HashRec은 음성 피드백에서 이진 임베딩을 학습하는 미분 가능 해싱 방법으로, 히프먼 공간 내에서 사용자-아이템 선호 관계를 유지한다.
- 학습된 이진 코드를 이용해 근사 최대 내적 곱 검색을 통해 후보를 검색하며, 이로 인해 일정하거나 서브라인 시간 내에 쿼리가 처리된다.
- 두 번째 단계로, 후보 인식 샘플링 전략을 사용해 후보를 재순서하기 위해 실수값 재순서 모델을 훈련한다.
- 재순서 모델은 가중 샘플링을 사용하여 훈련 중에 관련 후보를 우선순위에 두어 최종 추천 목표와의 일치도를 향상시킨다.
- 전체 프레임워크는 엔드 투 엔드로 훈련되며, 이진 코드와 재순서 모델이 최종 Top-N 정확도를 위해 공동 최적화된다.
실험 결과
연구 질문
- RQ1학습된 이진 코드가 히우리스틱 또는 규칙 기반 후보 생성을 효과적으로 대체할 수 있을까? 이때 정확도는 유지되는가?
- RQ2표준 샘플링 대비 재순서 단계에서 후보 중심 샘플링이 최종 추천 품질을 얼마나 향상시키는가?
- RQ3이진 코드 기반 검색이 정확도를 유지하면서 쿼리 시간을 얼마나 줄일 수 있는가?
- RQ4이진 코드 기반 검색과 실수값 재순서를 조합했을 때, 순수 이진 모델이나 순수 실수값 모델보다 정확도와 효율성 면에서 뛰어나지 않는가?
- RQ5제안된 프레임워크를 사용할 경우, 근사 최적의 Top-N 성능를 달성하기 위해 얼마나 많은 후보가 필요한가?
주요 결과
- CIGAR는 Movielens, Pinterest, Flipkart를 포함한 여러 대규모 데이터셋에서 최신 기술(SOTA) 수준의 Top-N 추천 정확도를 달성한다.
- 전체 순서 기반 베이스라인 대비 쿼리 시간을 수개의 속도로 줄여 실시간 추론을 가능하게 한다.
- 재순서 단계에서 후보 인식 샘플링을 사용함으로써, 표준 샘플링 대비 정규화 할인 수익(NDCG)에서 최대 15% 향상된 성능을 기록한다.
- HashRec을 사용한 이진 코드 학습은 코드 길이가 짧을 때조차도 효율적인 검색을 가능하게 하며, 정확도 손실가 최소한이다.
- 이진 코드 기반 검색과 실수값 재순서의 조합은 정확도와 효율성 면에서 순수 이진 모델과 순수 실수값 모델 모두를 능가한다.
- 실험 결과, 이진 코드를 통해 100개의 후보만 검색해도 근사 최적의 성능를 달성할 수 있음을 확인했으며, 이는 높은 검색 효율성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.