[논문 리뷰] Improving Sequential Recommendations via Bidirectional Temporal Data Augmentation with Pre-training
이 논문은 순차적 추천을 위한 이중순서 시간적 데이터 증강 방법인 BiCAT을 제안한다. BiCAT은 역순 아이템 생성 중에도 정방향 순차적 일致성을 유지함으로써 짧은 시퀀스에서 모델의 강건성을 향상시킨다. 자기 지식 정착과 정보성 샘플링을 통합함으로써 BiCAT은 매우 짧은 시퀀스(L ≤ 3)에서 SOTA 대비 평균 Recall@5에서 35.04% 향상된 성능을 달성하며, 짧은 시퀀스와 긴 시퀀스 모두에서 ASReP 및 SASRec를 능가한다.
Sequential recommendation systems are integral to discerning temporal user preferences. Yet, the task of learning from abbreviated user interaction sequences poses a notable challenge. Data augmentation has been identified as a potent strategy to enhance the informational richness of these sequences. Traditional augmentation techniques, such as item randomization, may disrupt the inherent temporal dynamics. Although recent advancements in reverse chronological pseudo-item generation have shown promise, they can introduce temporal discrepancies when assessed in a natural chronological context. In response, we introduce a sophisticated approach, Bidirectional temporal data Augmentation with pre-training (BARec). Our approach leverages bidirectional temporal augmentation and knowledge-enhanced fine-tuning to synthesize authentic pseudo-prior items that retain user preferences and capture deeper item semantic correlations, thus boosting the model's expressive power. Our comprehensive experimental analysis on five benchmark datasets confirms the superiority of BARec across both short and elongated sequence contexts. Moreover, theoretical examination and case study offer further insight into the model's logical processes and interpretability. The source code for our study is publicly available at https://github.com/juyongjiang/BARec.
연구 동기 및 목표
- 매우 짧은 사용자 시퀀스(L ≤ 3)에서 기존 방법이 성능을 내지 못하는 순차적 추천의 쿨스타트 문제를 해결한다.
- ASReP와 같은 역순 전용 데이터 증강 기법이 가짜 사전 아이템 생성 중 정방향 순차적 상관관계를 유지하지 못하는 한계를 극복한다.
- 증강된 시퀀스와 원본 시퀀스 간의 자기 지식 정착을 통해 증강과 모델 표현 간의 일치도를 향상시킨다.
- 과적합을 방지하기 위해 관련성과 다양성을 기반으로 한 정보성 양성 및 부정 샘플링 전략을 도입함으로써 학습 효율성과 일반화 능력을 향상시킨다.
- BiCAT을 사용한 사전학습 프레임워크를 개발하여 피니튜닝 단계에서 더 빠른 수렴과 향상된 성능을 가능하게 한다.
제안 방법
- 역순서로 가짜 사전 아이템을 생성하면서도 정방향 학습 제약 조건을 강제 적용함으로써 정방향 순차적 의존성을 유지하는 이중순서 시간적 증강 기반 트랜스포머(BiCAT)를 제안한다.
- 역순 생성 손실에 정방향 제약 조건을 통합하여 생성된 아이템이 역순에서만 타당한 것이 아니라 정방향에서 다음 아이템 예측과도 일치함을 보장한다.
- 증강된 시퀀스와 원본 시퀀스 간의 자기 지식 정착을 적용하여 '선생' 모델(증강된 시퀀스)에서 '학생' 모델(원본 시퀀스)로 맥락 지식을 전달함으로써 표현 학습을 향상시킨다.
- 관련성과 다양성을 기반으로 한 정보성 샘플링 전략을 설계하여 최적화 속도를 가속화하고 과적합을 감소시킨다.
- 원본 시퀀스와 증강된 시퀀스의 출력 분포를 정렬하기 위해 이중방향 쿨백-라이블러(KL) 발산을 사용하여 모델의 강건성과 일반화 능력을 향상시킨다.
- SASRec을 백본으로 사용하여 엔드 투 엔드로 모델을 학습하며, BiCAT을 사전학습 단계에 적용하여 최종 추천 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1정방향 순차적 일치성을 강제하는 역순 데이터 증강이 짧은 순차적 추천 성능 향상에 기여하는가?
- RQ2증강된 시퀀스와 원본 시퀀스 간의 자기 지식 정착이 순차적 추천에서 모델의 강건성과 표현 학습을 향상시키는가?
- RQ3제안된 정보성 샘플링 전략은 균일 샘플링 대비 최적화 속도와 일반화 능력에 어떤 영향을 미치는가?
- RQ4BiCAT 사전학습이 순차적 추천 작업의 피니튜닝 단계에서 수렴성과 성능 향상에 얼마나 기여하는가?
- RQ5Mask, Crop, Replace, Add와 같은 전통적 데이터 증강 방법과 비교해 BiCAT은 순차적 구조 유지 및 추천 정확도 측면에서 어떤가?
주요 결과
- BiCAT은 매우 짧은 시퀀스(L ≤ 3)에서 SOTA 모델 대비 평균 Recall@5 기준 35.04% 향상된 성능을 달성하며, ASReP 및 SASRec를 크게 능가한다.
- 긴 시퀀스(20 < L ≤ 50)에서도 BiCAT은 SOTA 모델 대비 Recall@5 기준 8.76% 향상되어 다양한 시퀀스 길이에 걸쳐 일반화 능력을 입증한다.
- BiCAT의 정방향 제약이 있는 역순 생성은 더 높은 품질의 가짜 사전 아이템 생성을 이끌어내며, 정방향 순차적 상관관계와의 일치도 향상 및 t-SNE 시각화에서 개선된 클러스터 형성으로써 이를 뒷받침한다.
- 이중방향 KL 발산을 통한 자기 지식 정착은 증강된 시퀀스와 원본 시퀀스 간의 분포 격차를 감소시켜, BiCAT과 정보성 샘플링을 조합했을 때 SASRec 대비 평균 25.49% 성능 향상을 이룬다.
- Mask, Crop, Replace, Add와 같은 전통적 데이터 증강 방법은 Beauty 및 Phones 데이터셋에서 성능을 떨어뜨리는 반면, 생성 기반 방법인 ASReP 및 BiCAT은 성능 향상을 이룬다. 특히 BiCAT이 가장 효과적이다.
- t-SNE 시각화 결과 BiCAT이 유사 아이템의 의미적 클러스터링을 향상시켜 더 정확한 다음 아이템 예측과 뛰어난 전체 추천 품질을 이끌어낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.