[논문 리뷰] Diffusion Augmentation for Sequential Recommendation
이 논문은 순차적 추천 시스템을 위한 새로운 확산 기반 데이터 증강 프레임워크인 DiffuASR를 제안한다. 이는 데이터 부족 문제와 장꼬리 사용자 문제를 완화하기 위해 고품질의 선호도 인식 항목 시퀀스를 생성한다. 순차적 U-Net을 활용해 이산 시퀀스 생성을 모델링하고, 선호도 일치를 위한 두 가지 가이드 전략을 적용함으로써, 복잡한 학습 절차 없이도 SRS 모델의 성능을 직접 향상시키는 증강 데이터를 생성한다. 이는 세 가지 데이터셋과 모델에서 일관된 성능 향상을 보이며, 성능 향상이 지속됨을 입증한다.
Sequential recommendation (SRS) has become the technical foundation in many applications recently, which aims to recommend the next item based on the user's historical interactions. However, sequential recommendation often faces the problem of data sparsity, which widely exists in recommender systems. Besides, most users only interact with a few items, but existing SRS models often underperform these users. Such a problem, named the long-tail user problem, is still to be resolved. Data augmentation is a distinct way to alleviate these two problems, but they often need fabricated training strategies or are hindered by poor-quality generated interactions. To address these problems, we propose a Diffusion Augmentation for Sequential Recommendation (DiffuASR) for a higher quality generation. The augmented dataset by DiffuASR can be used to train the sequential recommendation models directly, free from complex training procedures. To make the best of the generation ability of the diffusion model, we first propose a diffusion-based pseudo sequence generation framework to fill the gap between image and sequence generation. Then, a sequential U-Net is designed to adapt the diffusion noise prediction model U-Net to the discrete sequence generation task. At last, we develop two guide strategies to assimilate the preference between generated and origin sequences. To validate the proposed DiffuASR, we conduct extensive experiments on three real-world datasets with three sequential recommendation models. The experimental results illustrate the effectiveness of DiffuASR. As far as we know, DiffuASR is one pioneer that introduce the diffusion model to the recommendation.
연구 동기 및 목표
- 순차적 추천 시스템에서 데이터 부족 문제와 장꼬리 사용자 문제의 이중적 과제를 해결한다.
- 저품질의 생성 시퀀스 또는 복잡한 학습 절차가 필요한 기존 데이터 증강 방법의 한계를 극복한다.
- 확산 모델의 생성 능력을 이산 순차적 데이터에 적용함으로써, 추천 시스템 분야에서 새로운 응용을 실현한다.
- 사용자 선호도를 유지하면서도 자연스러운 다음 항목을 생성할 수 있는 시퀀스 인식 확산 프레임워크를 설계한다.
- 실제로 생성된 시퀀스가 의미적으로 일관되고 고품질임을 보장함으로써, 증강 데이터를 복잡한 반복적 또는 최적화된 학습 절차 없이도 SRS 모델의 직접 학습에 활용할 수 있도록 한다.
제안 방법
- 이미지와 시퀀스 간의 확산 모델 생성 갭을 메우기 위해 확산 기반 가짜 시퀀스 생성 프레임워크를 제안한다.
- 상호작용 시퀀스의 장거리 의존성을 포착할 수 있도록, 이산 시퀀스 노이즈 예측을 위한 U-Net 아키텍처를 변형한 순차적 U-Net 아키텍처를 설계한다.
- 분류기 자유 가이드를 활용해 선호도 기반 가이드 및 시퀀스 기반 가이드라는 두 가지 가이드 전략을 도입하여 생성된 시퀀스가 사용자의 이전 선호도와 일치하도록 한다.
- 짧은 상호작용 이력에 대해, 실제적인, 다양한, 선호도 일관성을 유지하는 항목 시퀀스를 생성할 수 있도록 확산 모델을 엔드 투 엔드로 학습한다.
- 표준 SRS 모델의 학습 파이프라인을 수정하지 않고도, 생성된 시퀀스를 추가 학습 데이터로 활용하여 모델을 미세조정한다.
- 확산 모델의 강력한 모델링 능력을 활용하고 실제 시퀀스와의 분포 이탈을 최소화함으로써 고품질 생성을 보장한다.
실험 결과
연구 질문
- RQ1확산 모델이 추천을 위한 고품질의 이산 순차적 데이터 생성에 효과적으로 적용될 수 있는가?
- RQ2증강 시퀀스 생성 과정에서 사용자의 이전 시퀀스 선호도를 어떻게 유지할 수 있는가?
- RQ3확산 기반 생성을 통한 데이터 증강이 순차적 추천에서 데이터가 적은 사용자 및 장꼬리 사용자 시나리오에서 성능 향상에 기여하는가?
- RQ4다양한 가이드 전략이 생성된 시퀀스의 품질과 관련성에 어떤 영향을 미치는가?
- RQ5증강 데이터는 복잡한 반복적 또는 최적화된 학습 절차 없이도 SRS 모델의 직접 학습에 사용될 수 있는가?
주요 결과
- DiffuASR는 뷰티, 스포츠, 타오바오의 세 개의 실세계 데이터셋에서 순차적 추천 성능을 크게 향상시켰다.
- Bert4Rec, SASRec, TransRec의 세 가지 벤치마크 SRS 모델에서 일관된 성능 향상을 달성하여, 이 방법의 일반화 능력을 입증한다.
- 이전 상호작용 수가 10건 미만인 장꼬리 사용자들이 가장 뚜렷한 성능 향상을 보이며, 이는 본 방법이 희소 사용자에게 효과적임을 확인한다.
- 시퀀스당 증강 항목 수가 모델 성능에 강한 영향을 미치며, 중간 수준의 증강 수준에서 최적의 성능 향상이 관찰된다.
- 제안된 가이드 전략은 생성된 항목의 관련성을 크게 향상시키며, 분포 이탈을 감소시키고 사용자 선호도와의 일치도 향상시킨다.
- 제거 실험을 통해 순차적 U-Net과 가이드 메커니즘이 고품질 시퀀스 생성 및 후속 추천 정확도 향상에 필수적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.