Skip to main content
QUICK REVIEW

[논문 리뷰] AdaMCT: Adaptive Mixture of CNN-Transformer for Sequential Recommendation

Juyong Jiang, Zhang, Peiyan|arXiv (Cornell University)|2022. 05. 18.
Recommender Systems and Techniques인용 수 4
한 줄 요약

AdaMCT는 순차적 추천에서 장기적이고 단기적인 사용자 선호도를 함께 모델링하기 위해 CNN과 Transformer 아키텍처를 융합하는 새로운 적응형 혼합 모델을 제안한다. 복합 필터를 통한 국소성 인덕티브 바이어스 통합과 Squeeze-Excitation Attention를 활용한 계층 인식 적응형 혼합을 통해, 개선된 효율성과 다수의 관련 항목에 대한 개인화된 주의를 실현하며 최신 기술 성능을 달성한다.

ABSTRACT

Sequential recommendation (SR) aims to model users dynamic preferences from a series of interactions. A pivotal challenge in user modeling for SR lies in the inherent variability of user preferences. An effective SR model is expected to capture both the long-term and short-term preferences exhibited by users, wherein the former can offer a comprehensive understanding of stable interests that impact the latter. To more effectively capture such information, we incorporate locality inductive bias into the Transformer by amalgamating its global attention mechanism with a local convolutional filter, and adaptively ascertain the mixing importance on a personalized basis through layer-aware adaptive mixture units, termed as AdaMCT. Moreover, as users may repeatedly browse potential purchases, it is expected to consider multiple relevant items concurrently in long-/short-term preferences modeling. Given that softmax-based attention may promote unimodal activation, we propose the Squeeze-Excitation Attention (with sigmoid activation) into SR models to capture multiple pertinent items (keys) simultaneously. Extensive experiments on three widely employed benchmarks substantiate the effectiveness and efficiency of our proposed approach. Source code is available at https://github.com/juyongjiang/AdaMCT.

연구 동기 및 목표

  • 순차적 추천에서 장기적 안정된 관심사와 동적 단기 선호도를 함께 모델링하는 과제를 해결하기 위해.
  • 학습 가능한 혼합 메커니즘을 통해 장기적 및 단기적 선호도의 개인화된 적응형 융합을 가능하게 하기 위해.
  • softmax 기반 주의의 한계를 극복하기 위해 동시에 여러 관련 항목을 포착함으로써 순차적 의존성 모델링을 향상시키기 위해.
  • 복합 필터를 통한 국소성 인덕티브 바이어스 통합과 함께 전역 주의 능력을 유지하면서 Transformer에 국소성 인덕티브 바이어스를 통합하기 위해.
  • 실세계 순차적 추천 벤치마크에서 높은 효율성과 효과성을 달성하기 위해.

제안 방법

  • AdaMCT는 순차적 패턴을 모델링하기 위해 국소적 복합 필터 브랜치($\mathcal{L}_{\text{Conv}}$)와 전역 자기주목 브랜치($\mathcal{G}_{\text{Trm}}$)를 융합한 하이브리드 아키텍처를 사용한다.
  • 계층 인식 적응형 혼합 유닛은 각 계층 및 사용자 기반으로 CNN 및 Transformer 브랜치의 표현을 융합하기 위한 주의 가중치($\alpha$, $\beta$)를 동적으로 계산한다.
  • 표준 softmax 주의를 대체하기 위해 Squeeze-Excitation Attention(SEAtt)을 도입하여 다중 항목 활성화 및 다수의 관련 항목 모델링 능력을 향상시킨다.
  • 감소 비율 $r$과 비선형 활성화($\Phi$)를 갖는 학습 가능한 게이트 메커니즘을 사용해 주의 메커니즘 내 특징 중요도를 재조정한다.
  • 모델은 표준 추천 손실을 기반으로 엔드 투 엔드로 훈련되며, 최종 출력은 각 항목에 대한 개인화된 추천 점수이다.
  • 커널 크기 $k$, 헤드 수 $h$, 모델 차원 $d_{\text{model}}$와 같은 하이퍼파라미터는 추론 실험을 통해 최적화된다.

실험 결과

연구 질문

  • RQ1장기적 및 단기적 사용자 선호도를 어떻게 함께 모델링하여 상호 강화를 이룰 수 있는가?
  • RQ2CNN과 Transformer 구성 요소의 적응형 개인화된 융합이 순차적 추천 성능 향상에 기여하는가?
  • RQ3표준 softmax 주의를 Squeeze-Excitation 주의로 대체하면 다수의 관련 항목을 포착하는 데 모델의 능력이 향상되는가?
  • RQ4CNN를 통한 국소성 인덕티브 바이어스 통합이 순수 Transformer 모델에 비해 성능 향상에 기여하는가?
  • RQ5순차적 추천에서 모델 효율성(FLOPs, 메모리, 추론 시간)과 성능 사이의 상충 관계는 어떠한가?

주요 결과

  • AdaMCT는 세 가지 공개 벤치마크에서 최신 기술 성능을 달성했으며, Toys 데이터셋에서 NDCG@10이 0.3511, Sports 데이터셋에서 0.3444를 기록했다.
  • Toys 데이터셋에서 Caser 대비 91% FLOPs 감소, SASRec 대비 79% 감소를 기록했으며, 파라미터 수는 오직 0.41M에 불과했다.
  • Toys 데이터셋에서 AdaMCT는 훈련 비용을 Caser 대비 84% 감소시키고, 추론 비용은 79% 감소시켰다.
  • 추론 실험 결과, 커널 크기 $k=3$와 감소 비율 $r=1$가 최고의 성능을 보였으며, GELU 활성화 함수가 ReLU와 Swish보다 우수한 성능을 보였다.
  • 시각화 결과, AdaMCT는 기존 베이스라인 모델보다 더 일관되고 개인화된 항목 상관 관계 패턴을 학습하는 것으로 확인되었다.
  • 적응형 계수 시각화 결과, 모델이 사용자 및 계층 기반으로 주의 가중치를 동적으로 조정함으로써 개인화된 선호도 동적 변화를 반영하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.