[논문 리뷰] Differentiable Neural Input Search for Recommender Systems
이 논문은 특성 임bedding 차원과 모델 성능을 함께 최적화하기 위해 차원의 중요도를 제어하는 소프트 선택 레이어를 도입한, 미분 가능하고 기울기 기반인 Differentiable Neural Input Search (DNIS)를 제안한다. DNIS는 임베딩 차원에 대한 민감하고 연속적인 탐색을 가능하게 하여, 이전의 신경망 입력 탐색 방법보다 더 적은 파라미터 수와 더 짧은 학습 시간으로 최신 기술 수준의 추천 성능를 달성한다.
Latent factor models are the driving forces of the state-of-the-art recommender systems, with an important insight of vectorizing raw input features into dense embeddings. The dimensions of different feature embeddings are often set to a same value empirically, which limits the predictive performance of latent factor models. Existing works have proposed heuristic or reinforcement learning-based methods to search for mixed feature embedding dimensions. For efficiency concern, these methods typically choose embedding dimensions from a restricted set of candidate dimensions. However, this restriction will hurt the flexibility of dimension selection, leading to suboptimal performance of search results. In this paper, we propose Differentiable Neural Input Search (DNIS), a method that searches for mixed feature embedding dimensions in a more flexible space through continuous relaxation and differentiable optimization. The key idea is to introduce a soft selection layer that controls the significance of each embedding dimension, and optimize this layer according to model's validation performance. DNIS is model-agnostic and thus can be seamlessly incorporated with existing latent factor models for recommendation. We conduct experiments with various architectures of latent factor models on three public real-world datasets for rating prediction, Click-Through-Rate (CTR) prediction, and top-k item recommendation. The results demonstrate that our method achieves the best predictive performance compared with existing neural input search approaches with fewer embedding parameters and less time cost.
연구 동기 및 목표
- 잠재 요인 모델에서 고정된 균일한 임베딩 차원의 한계를 해결하기 위해, 고주파 특성은 활용이 부족하고 저주파 특성은 과적합이 발생할 수 있도록 방지한다.
- 신경망 입력 탐색(NIS)에서 이산 후보 기반 탐색 방법의 비효율성과 최적화되지 않은 점을 해결하기 위해, 사전에 정의된 집합에 국한된 차원 선택을 제한한다.
- 검증 성능 기반으로 연속적이고 기울기 기반 최적화가 가능한 모델에 종속되지 않는, 미분 가능한 접근 방식을 개발한다.
- 최적화 이후 세밀한 프루닝 절차를 통해 여분의 임베딩 차원을 제거하여 모델 크기와 파라미터 수를 줄인다.
제안 방법
- 특성 임베딩과 학습 가능한 스케일링 벡터 간의 원소별 곱셈을 수행하는 소프트 선택 레이어를 도입하여, 각 임베딩 차원의 중요도를 연속적으로 제어할 수 있도록 한다.
- 검증 손실을 목적 함수로 사용하여 기울기 하강법을 통해 소프트 선택 레이어를 최적화함으로써 엔드 투 엔드로 미분 가능한 학습을 가능하게 한다.
- 소프트 선택 레이어 최적화 중 기울기의 높은 분산을 줄이기 위해 기울기 정규화 기법을 제안한다.
- 학습 후 소프트 선택 레이어를 임베딩 레이어와 병합하고, 세밀한 프루닝을 적용하여 각 특성에 대한 혼합 임베딩 차원 구조를 도출한다.
- 기본 차원 공간 $ K $ 를 사용하고 특성을 $ L $ 개의 블록으로 나누어 차원 할당에 대한 세밀한 제어를 가능하게 한다.
- 이 방법은 모델에 종속되지 않으며, 추천을 위한 기존 잠재 요인 모델과 원활하게 통합될 수 있다.
실험 결과
연구 질문
- RQ1이산적이고 히우리스틱적이거나 강화학습 기반 방법과 비교해, 임베딩 차원 탐색의 미분 가능하고 연속적인 리프래시가 추천 성능 향상에 기여하는가?
- RQ2학습된 임베딩 차원 분포는 특성의 빈도와 예측 유용성과 어떻게 관련이 있는가?
- RQ3제안된 기울기 정규화 기법이 소프트 선택 레이어의 학습을 안정화시키고 수렴을 향상시키는가?
- RQ4DNIS는 기존의 신경망 입력 탐색 방법보다 더 적은 파라미터 수와 더 적은 시간 비용으로 더 뛰어난 성능을 달성하는가?
주요 결과
- DNIS는 세 가지 공개 데이터셋에서 평점 예측, CTR 예측, 상위-k 아이템 추천 작업 전반에서 최신 기술 수준의 성능를 달성한다.
- 여러분 임베딩 파라미터를 제거하는 프루닝을 통해 모델 크기를 줄였으며, 기준 방법보다 더 적은 파라미터 수로 더 뛰어난 성능를 달성했다.
- 빈도가 높은 특성은 더 큰 임베딩 차원이 할당되고, 저주파 특성은 더 작은 차원이 할당되며, 이는 학습된 $ \bm{\alpha} $ 파라미터와 프루닝 후 차원에 반영된다.
- 저주파 특성에 대해 소프트 선택 레이어 파라미터 $ \bm{\alpha} $ 가 더 작은 값으로 수렴함으로써, 해당 특성에 대해 차원 할당이 감소함을 나타낸다.
- 모든 프루닝 비율에서 DNIS는 네트워크 프루닝 방법보다 AUC와 Logloss 모두에서 뛰어난 성능를 보이며, 기울기 기반 최적화를 통한 우수한 특성 차원 선택 능력을 입증한다.
- 기본 차원 $ K $ 와 특성 블록 수 $ L $ 를 증가시키면 성능 향상이 이루어지나, 특정 값 이상에서는 성능 향상의 폭이 점점 줄어들며, 이는 고수준 설정에서 수익 감소 현상을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.