[논문 리뷰] Uniform Sequence Better: Time Interval Aware Data Augmentation for Sequential Recommendation
이 논문은 비균일한 아이템 시계열을 균일하게 분포시키는 데에 특화된 시간 간격 인식 데이터 증강 프레임워크인 TiCoSeRec을 제안한다. 다섯 가지 새로운 연산자(Ti-Crop, Ti-Reorder, Ti-Mask, Ti-Substitute, Ti-Insert)를 사용하여 비균일한 시계열을 균일하게 변환한다. 원본 시계열과 높은 유사성을 유지하면서도 시계열 길이에 따라 제어 전략을 적용함으로써, 네 개의 실세계 데이터셋에서 11개의 베이스라인(최첨단 모델 포함)을 능가하는 성능 향상을 달성한다.
Sequential recommendation is an important task to predict the next-item to access based on a sequence of interacted items. Most existing works learn user preference as the transition pattern from the previous item to the next one, ignoring the time interval between these two items. However, we observe that the time interval in a sequence may vary significantly different, and thus result in the ineffectiveness of user modeling due to the issue of \emph{preference drift}. In fact, we conducted an empirical study to validate this observation, and found that a sequence with uniformly distributed time interval (denoted as uniform sequence) is more beneficial for performance improvement than that with greatly varying time interval. Therefore, we propose to augment sequence data from the perspective of time interval, which is not studied in the literature. Specifically, we design five operators (Ti-Crop, Ti-Reorder, Ti-Mask, Ti-Substitute, Ti-Insert) to transform the original non-uniform sequence to uniform sequence with the consideration of variance of time intervals. Then, we devise a control strategy to execute data augmentation on item sequences in different lengths. Finally, we implement these improvements on a state-of-the-art model CoSeRec and validate our approach on four real datasets. The experimental results show that our approach reaches significantly better performance than the other 11 competing methods. Our implementation is available: https://github.com/KingGugu/TiCoSeRec.
연구 동기 및 목표
- 사용자 상호작용 시계열의 시간 간격 분포가 순차적 추천 성능에 미치는 영향을 조사하는 것.
- 아이템 상호작용 간의 시간 간격이 매우 변동성이 클 경우 발생하는 선호도 이탈 문제를 해결하는 것.
- 시간 간격 인식 연산자를 사용하여 비균일한 시계열을 균일하게 분포시키는 데이터 증강 프레임워크를 제안하는 것.
- 증강된 시계열이 원본 시계열과 높은 유사성을 유지하면서도 모델의 일반화 능력을 향상시키는 것.
- 제안된 방법의 효과성을 실세계 순차적 추천 벤치마크에서 검증하는 것.
제안 방법
- 비균일한 시계열을 균일하게 변환하기 위해 시간 간격 인식 데이터 증강 연산자 다섯 가지(Ti-Crop, Ti-Reorder, Ti-Mask, Ti-Substitute, Ti-Insert)를 설계한다.
- 원본 시계열과 증강된 시계열 간의 의미적 유사성을 유지하기 위해 대비 학습을 통합한다.
- 특히 짧은 시계열에 대해 시계열 길이에 따라 데이터 증강 방식을 다르게 적용하는 제어 전략을 구현한다.
- CoSeRec 모델에 증강 프레임워크를 적용하여 시간 간격 인식 순차적 추천 모델인 TiCoSeRec을 구축한다.
- 다양한 데이터셋 간의 성능를 비교하기 위해 HR@k 및 NDCG@k(여기서 k ∈ {10,20})와 같은 표준 평가 지표를 사용한다.
- 성능 최적화를 위해 균일하게 간주되는 시계열 비율을 제어하는 파라미터 σ를 튜닝한다.
실험 결과
연구 질문
- RQ1사용자 상호작용 시계열에서 시간 간격이 균일하게 분포되어 있을 경우 비균일한 간격에 비해 더 나은 순차적 추천 성능을 보이는가?
- RQ2시간 간격 분포에 기반한 데이터 증강이 순차적 추천 모델의 일반화 능력과 내성 강도를 향상시킬 수 있는가?
- RQ3다양한 시간 간격 인식 데이터 증강 연산자가 각각 추천 성능에 어떤 기여를 하는가?
- RQ4성능을 최대화하기 위해 균일하게 간주하는 시계열의 최적 비율(σ로 제어)은 얼마인가?
- RQ5기존 최첨단 모델들과 비교했을 때 제안된 방법은 순차적 추천에서 어떤 성능을 보이는가?
주요 결과
- 실험적 연구 결과, 균일한 시계열이 비균일한 시계열보다 유의미하게 더 좋은 추천 성능을 보이며, 본 논문의 핵심 가설을 확인한다.
- TiCoSeRec은 네 개의 실세계 데이터셋에서 최첨단 성능을 달성하였으며, 두 번째로 좋은 성능을 보인 방법 대비 상대적 향상률이 5%에서 18%에 이르렀다.
- TS(Ti-Substitute) 연산자가 성능 향상에 가장 큰 기여를 하였고, TR(Ti-Reorder) 연산자가 가장 작은 영향을 미쳤으며, 이는 각 연산자의 기여도가 다름을 시사한다.
- σ의 최적 값은 0.2로, 상위 20%의 시계열을 균일하게 간주할 경우로, 이보다 높은 값(예: σ > 0.4)은 성능 저하를 초래한다.
- 시간 간격 인식 연산자를 사용한 TiCoSeRec의 모든 변종은 베이스라인인 CoSeRec을 능가하며, 한 가지 연산자를 기존 전통적 방식으로 대체한 경우에도 여전히 성능 향상을 보여, 제안된 연산자의 효과를 확인한다.
- 모든 데이터셋과 평가 지표(HR@k 및 NDCG@k)에서 일관되게 성능 향상을 보이며, 이는 강건성과 일반화 능력을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.