[논문 리뷰] Data Augmentation Strategies for Improving Sequential Recommender Systems
이 논문은 딥러닝 기반 순차 추천 시스템의 성능을 향상시키기 위해 직접적인 시퀀스 수준의 데이터 증강 전략—소음 주입, 중복 주입, 아이템 마스킹, 동의어 교체—을 제안한다. 실험 결과, 이러한 방법들은 특히 훈련 데이터가 제한된 경우 성능을 크게 향상시키며, 일반화 능력 향상과 이전 접근 방식에 비해 경쟁적인 성능을 달성한다.
Sequential recommender systems have recently achieved significant performance improvements with the exploitation of deep learning (DL) based methods. However, although various DL-based methods have been introduced, most of them only focus on the transformations of network structure, neglecting the importance of other influential factors including data augmentation. Obviously, DL-based models require a large amount of training data in order to estimate parameters well and achieve high performances, which leads to the early efforts to increase the training data through data augmentation in computer vision and speech domains. In this paper, we seek to figure out that various data augmentation strategies can improve the performance of sequential recommender systems, especially when the training dataset is not large enough. To this end, we propose a simple set of data augmentation strategies, all of which transform original item sequences in the way of direct corruption and describe how data augmentation changes the performance. Extensive experiments on the latest DL-based model show that applying data augmentation can help the model generalize better, and it can be significantly effective to boost model performances especially when the amount of training data is small. Furthermore, it is shown that our proposed strategies can improve performances to a better or competitive level to existing strategies suggested in the prior works.
연구 동기 및 목표
- 훈련 데이터가 제한된 상황에서 데이터 증강이 딥러닝 기반 순차 추천 시스템의 성능 향상에 기여하는지 조사하기 위해.
- 손상 기반 변환을 통해 원본 아이템 시퀀스를 직접 조작하는 단순하면서도 효과적인 데이터 증강 전략 세트를 제안하기 위해.
- 다양한 데이터셋과 모델 아키텍처에서 다양한 증강 기법이 모델의 일반화 능력과 성능에 미치는 영향을 평가하기 위해.
- 데이터 증강이 냉시작 상황에서 특히 유용한 보편적인 사전처리 기법이 될 수 있음을 입증하기 위해.
제안 방법
- 소음 주입(랜덤으로 아이템 삽입), 중복 주입(아이템 복제), 아이템 마스킹(특수 토큰으로 아이템 교체), 동의어 교체(공동 발생 기반으로 의미적으로 유사한 아이템으로 교체)를 포함한 네 가지 직접적인 시퀀스 수준의 데이터 증강 전략을 제안한다.
- 최신 순차 추천 모델에 입력하기 전에 원본 사용자 상호작용 시퀀스를 수정함으로써 이러한 전략을 원본 시퀀스에 적용한다.
- 비교를 위해 슬라이딩 윈도우(SW) 및 서브셋 선택(SS) 전략을 베이스라인으로 사용하며, SW 전략이 더 안정적인 성능 향상을 보였다.
- 다양한 데이터셋(MovieLens-1M, Amazon Games 등)에서 Recall@K 및 MRR@K와 같은 표준 평가 지표를 사용하여 성능을 측정한다.
- 증강 크기의 영향을 분석하기 위해, 각 원본 시퀀스당 증강 샘플 수를 변화시켜 성능에 미치는 영향을 분석하는 분할 연구를 수행한다.
- 모델 아키텍처를 고정하고 증강을 통해 훈련 데이터만 수정함으로써 사전처리의 영향을 성능에 고립시키는 방식을 취한다.
실험 결과
연구 질문
- RQ1딥러닝 기반 순차 추천 시스템의 성능을 데이터 증강으로 향상시킬 수 있는가?
- RQ2다양한 데이터 증강 전략이 저데이터 조건에서 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
- RQ3데이터 증강의 크기가 성능 향상에 영향을 미치며, 성능 포화가 발생하는 지점은 언제인가?
- RQ4이전의 부분시퀀스 선택 기반 방법과 비교해, 제안된 직접적인 시퀀스 조작 전략은 어떤가?
주요 결과
- 데이터 증강은 특히 훈련 데이터가 적은 경우 모델 성능을 크게 향상시키며, 소음 주입을 사용해 Amazon Games 데이터셋에서 10% 데이터 크기일 때 최대 +34.6%의 성능 향상을 기록했다.
- 성능 향상은 데이터 증강 크기와 비례하며, 데이터셋 크기가 증가함에 따라 수익 감소 현상이 나타나, 대규모 데이터에서는 성능 향상의 효과가 점점 줄어든다.
- 소음 주입(NI)과 슬라이딩 윈도우(SW) 전략이 다양한 데이터셋에서 가장 일관되고 뚜렷한 성능 향상을 보였으며, NI는 10% 데이터 크기에서 Amazon Games에서 +34.6%의 성능 향상을 달성했다.
- 아이템 마스킹(IM)과 동의어 교체(SR)는 결과가 더 다양하게 나타났으며, IM은 정보 손실로 인해 성능이 열등했고, SR은 중간 정도의 성능 향상을 보였다.
- 전체 데이터셋의 100%에서도 데이터 증강이 측정 가능한 성능 향상을 제공했으며(예: MovieLens-1M에서 MRR@10 기준 +2.5%), 이는 대규모 데이터 환경에서도 여전히 유용함을 시사한다.
- 제안된 전략들은 이전의 부분시퀀스 기반 방법에 비해 성능이 동등하거나 뛰어나, 보편적인 사전처리 기법으로서의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.