Skip to main content
QUICK REVIEW

[논문 리뷰] Discrete Factorization Machines for Fast Feature-based Recommendation

Han Liu, Xiangnan He|arXiv (Cornell University)|2018. 05. 06.
Recommender Systems and Techniques참고 문헌 16인용 수 9
한 줄 요약

이 논문은 자원이 제한된 장치에서 빠르고 메모리 효율적인 추천을 가능하게 하기 위해 특징 임베딩을 이진화하는 새로운 바이너리 임베딩 모델인 이산 인수분해 기계(DFM)를 제안한다. 이중 균형화 및 상관관계 제거 조건을 갖는 교차 최적화 알고리즘을 통해 실수값 FM 성능에 근접하면서도 추론 속도를 최대 17.5배로 향상시킨다.

ABSTRACT

User and item features of side information are crucial for accurate recommendation. However, the large number of feature dimensions, e.g., usually larger than 10^7, results in expensive storage and computational cost. This prohibits fast recommendation especially on mobile applications where the computational resource is very limited. In this paper, we develop a generic feature-based recommendation model, called Discrete Factorization Machine (DFM), for fast and accurate recommendation. DFM binarizes the real-valued model parameters (e.g., float32) of every feature embedding into binary codes (e.g., boolean), and thus supports efficient storage and fast user-item score computation. To avoid the severe quantization loss of the binarization, we propose a convergent updating rule that resolves the challenging discrete optimization of DFM. Through extensive experiments on two real-world datasets, we show that 1) DFM consistently outperforms state-of-the-art binarized recommendation models, and 2) DFM shows very competitive performance compared to its real-valued version (FM), demonstrating the minimized quantization loss. This work is accepted by IJCAI 2018.

연구 동기 및 목표

  • 대규모이고 특징이 풍부한 추천 시스템에서 실수값 인수분해 기계(FM)의 높은 계산 및 저장 비용을 해결하기 위해.
  • 모바일 및 자원이 제한된 추천 응용 프로그램을 위한 빠른 현장 내 추론을 가능하게 하기 위해.
  • 이진화 시 양자화 손실을 최소화하여 모델 정확도를 유지하기 위해.
  • 이산적이고 균형 잡히며 상관관계가 없는 바이너리 임베딩을 위한 종단 간 최적화 프레임워크를 개발하기 위해.
  • 기존의 해시 기반 및 이진화된 추천 모델보다 효율성과 정확도 측면에서 뛰어나도록 하기 위해.

제안 방법

  • 실수값 특징 임베딩 행렬 V ∈ ℝ^{k×n}을 바이너리 행렬 B ∈ {±1}^{k×n}로 이진화하여 비트 수준 연산과 압축된 저장을 가능하게 한다.
  • 이진, 균형, 상관관계 제거 조건 하에서 이산 최적화 문제를 동시에 해결하기 위한 교차 최적화 알고리즘을 제안한다.
  • 실수값 매개변수를 학습한 후 반올림하는 두 단계 방식을 피하기 위해 직접 바이너리 매개변수를 종단 간 최적화하는 수렴 가능한 갱신 규칙을 도입한다.
  • 이진 공간에서 사용자-아이템 점수 계산을 위해 부동소수점 곱셈 대신 XOR 기반 연산을 사용한다.
  • 압축되고 정보가 풍부한 바이너리 코드를 확보하기 위해 상관관계 제거 및 균형 조건을 적용한다.
  • 동일한 컴파일러와 하드웨어를 사용하여 libFM와의 공정한 효율성 비교를 위해 C++로 모델을 구현한다.

실험 결과

연구 질문

  • RQ1FM 매개변수를 이진화함으로써 추론 시간과 메모리 사용량을 크게 줄일 수 있으며, 높은 추천 정확도를 유지할 수 있는가?
  • RQ2실수값 매개변수를 학습한 후 이진화하는 표준 두 단계 방식과 비교해 종단 간 이산 최적화 방식이 어떻게 성능에 영향을 미치는가?
  • RQ3이산 인수분해 기계가 실수값 FM과 비교해 얼마나 높은 성능을 낼 수 있는가?
  • RQ4기존 모델과 비교해 탈상관성 제약 및 정규화와 같은 하이퍼파라미터 설정에 대해 DFM의 민감도는 어느 정도인가?
  • RQ5실세계 추천 워크로드에서 DFM이 실수값 FM 대비 실제 속도 향상은 어느 정도인가?

주요 결과

  • Yelp 및 Amazon 데이터셋에서 DFM은 각각 libFM 대비 평균 15.99배, 16.04배의 속도 향상을 기록했으며, 코드 길이가 8에서 64까지 다양하더라도 약 16배의 안정적인 가속 비율을 확보했다.
  • Yelp 및 Amazon 양 쪽 모두에서 DFM은 최신 이진화된 추천 모델보다 NDCG@10에서 뛰어난 일반화 및 강건성을 보였다.
  • 탈상관성 및 L2 정규화를 0으로 설정했을 때, DFM은 Yelp와 Amazon에서 각각 1.91%, 2.05%만 성능 저하를 보였지만, libFM는 각각 10.44%, 6.56%의 저하를 보여 DFM의 하이퍼파라미터 설정에 대한 강건성을 입증했다.
  • 두 데이터셋 모두에서 DFM은 실수값 FM 기준선 대비 2% 이내의 추천 성능을 달성하여 전체 이진화에도 불구하고 최소한의 양자화 손실을 보였다.
  • 제안된 교차 최적화 알고리즘이 수렴하며 예측 능력을 유지하는 균형 잡히고 상관관계가 없는 바이너리 코드를 성공적으로 학습했다.
  • DFM의 효율성과 정확도 간 상호 보완적 특성은 대규모 모바일 및 실시간 추천 시스템에의 구현에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.