Skip to main content
QUICK REVIEW

[논문 리뷰] On Sampling Strategies for Neural Network-based Collaborative Filtering

Ting Chen, Yizhou Sun|arXiv (Cornell University)|2017. 06. 23.
Recommender Systems and Techniques참고 문헌 34인용 수 4
한 줄 요약

이 논문은 사용자-항목 상호작용과 콘텐츠 특징에 대한 딥러닝을 결합함으로써 최신 추천 모델을 통합하는 일반적인 신경망 기반 공동 필터링 프레임워크를 제안한다. 높은 계산 비용 문제를 해결하기 위해, 샘플링 전략을 세 가지 새로 도입한다—층화 샘플링, 음성 공유, 그리고 그 조합 전략—이를 통해 샘플링된 링크 간에 비용이 많이 드는 노드 계산을 재사용함으로써 학습 시간을 최대 30배까지 단축시키며, 더 나은 그래디언트 추정과 수렴을 통해 추천 성능을 향상시킨다.

ABSTRACT

Recent advances in neural networks have inspired people to design hybrid recommendation algorithms that can incorporate both (1) user-item interaction information and (2) content information including image, audio, and text. Despite their promising results, neural network-based recommendation algorithms pose extensive computational costs, making it challenging to scale and improve upon. In this paper, we propose a general neural network-based recommendation framework, which subsumes several existing state-of-the-art recommendation algorithms, and address the efficiency issue by investigating sampling strategies in the stochastic gradient descent training for the framework. We tackle this issue by first establishing a connection between the loss functions and the user-item interaction bipartite graph, where the loss function terms are defined on links while major computation burdens are located at nodes. We call this type of loss functions "graph-based" loss functions, for which varied mini-batch sampling strategies can have different computational costs. Based on the insight, three novel sampling strategies are proposed, which can significantly improve the training efficiency of the proposed framework (up to $ imes 30$ times speedup in our experiments), as well as improving the recommendation performance. Theoretical analysis is also provided for both the computational cost and the convergence. We believe the study of sampling strategies have further implications on general graph-based loss functions, and would also enable more research under the neural network-based recommendation framework.

연구 동기 및 목표

  • 사용자-항목 상호작용과 콘텐츠 특징에 대한 딥러닝을 통합하는 하이브리드 신경망 기반 공동 필터링 모델의 높은 학습 계산 비용 문제를 해결하기 위해.
  • 그래프 구조 모델에서 링크 기반 손실 함수와 노드 수준 계산 간의 괴리 문제를 규명하기 위해, 여기서 샘플링 전략이 학습 효율성에 미치는 영향이 크다는 점을 밝히기 위해.
  • 다양한 사용자-항목 상호작용 간에 비용이 많이 드는 신경망 연산(예: CNNs)의 중복 계산을 최소화하는 샘플링 전략을 설계하기 위해.
  • 이론적 및 실증적으로 최적화된 샘플링 전략이 학습 속도와 추천 정확도를 모두 향상시킬 수 있음을 검증하기 위해.
  • 이러한 통찰을 추천 시스템을 넘어 다른 그래프 기반 손실 함수로 일반화하기 위해.

제안 방법

  • 프레임워크는 이원 그래프 형태의 사용자-항목 상호작용 그래프를 통해 사용자 선호도를 모델링하며, 손실 함수는 링크(사용자-항목 쌍)에 정의되지만 주요 계산 비용은 노드 수준의 연산(예: 항목 이미지에 대한 CNNs 또는 텍스트에 대한 RNNs)에 기인한다.
  • 저자들은 층화 샘플링을 도입하여, 공유된 노드를 가진 링크를 기반으로 스트라타로 분할하고, 각 스트라타 내에서 샘플링하여 고비용의 노드 계산을 공유함으로써 비용을 분산시킨다.
  • 음성 공유 전략은 미니배치 내에서 동일한 노드를 여러 음성 링크에 재사용함으로써, 기존 노드로부터 추가 음성 샘플을 생성함으로써 중복된 순방향 전파를 줄인다.
  • 층화 샘플링과 음성 공유를 조합한 하이브리드 전략은 계산 절감과 그래디언트 품질 사이의 균형을 이루며, 두 전략의 장점을 모두 활용한다.
  • 계산 비용과 수렴성에 대한 이론적 분석을 제공하여, 제안된 전략이 표준 IID 샘플링과 비교해 수렴 속도를 유지하거나 향상시킴을 보여준다.
  • 기존의 오토인코더, RNNs, 또는 CNNs를 사용한 콘텐츠 표현 모델을 일반화하며, 쌍별 순위 매기기 및 대비 학습과 같은 다양한 손실 함수를 지원한다.

실험 결과

연구 질문

  • RQ1사용자-항목 상호작용 그래프의 구조가 신경 공동 필터링에서 확률적 경사 하강법의 계산 비용에 어떤 영향을 미치는가?
  • RQ2링크 간에 공유되는 노드 계산을 활용하는 샘플링 전략이 모델 성능 저하 없이 학습 시간을 크게 단축시킬 수 있는가?
  • RQ3층화 샘플링과 음성 공유와 같은 다양한 샘플링 전략이 그래프 기반 손실 함수의 수렴성과 효율성에 미치는 영향은 어떠한가?
  • RQ4제안된 샘플링 전략은 표준 IID 샘플링과 비교해 학습 속도와 추천 정확도 측면에서 어떻게 성능을 냈는가?
  • RQ5이러한 샘플링 전략은 추천 시스템을 넘어 다른 그래프 기반 기계학습 작업으로 얼마나 일반화될 수 있는가?

주요 결과

  • 저자들의 실험 결과, 제안된 샘플링 전략은 표준 IID 샘플링 대비 학습 시간을 최대 30배까지 단축시켰으며, 학습 효율성이 크게 향상되었다.
  • 층화 샘플링은 공유된 노드를 가진 링크를 그룹화함으로써 고비용 신경망 순방향 전파를 여러 링크 간에 재사용함으로써 계산 오버헤드를 줄였다.
  • 음성 공유 전략은 미니배치 내에서 동일한 노드 특징을 기반으로 추가 음성 링크를 생성함으로써 중복 계산을 최소화하여 효율성을 향상시켰다.
  • 층화 샘플링과 음성 공유를 조합한 하이브리드 전략은 계산 절감과 모델 수렴성 사이에서 최적의 균형을 이룩하여, 개별 전략보다 뛰어난 성능을 보였다.
  • 이론적 분석을 통해 제안된 샘플링 방법이 계산 부담이 감소한 상황에서도 IID 샘플링과 비교해 수렴 성질을 유지하거나 향상시킴을 확인했다.
  • 실증 결과는 개선된 샘플링 전략이 표준 IID 샘플링을 사용한 학습 대비 더 나은 추천 성능(예: 높은 AUC 및 NDCG 점수)을 달성함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.