[논문 리뷰] Adversarial Training Towards Robust Multimedia Recommender System
이 논문은 이미지 특징에 대한 소규모이고 타겟된 변형에 저항하도록 훈련시켜 딥러닝 기반의 멀티미디어 추천 시스템의 강건성을 향상시키는 새로운 프레임워크인 적대적 멀티미디어 추천(AMR)을 제안한다. 기울기 기반의 적대자와 함께 추천 모델을 공동 최적화함으로써, AMR는 이미지 및 제품 추천 작업에서 강건성과 추천 정확도를 동시에 향상시킨다.
With the prevalence of multimedia content on the Web, developing recommender solutions that can effectively leverage the rich signal in multimedia data is in urgent need. Owing to the success of deep neural networks in representation learning, recent advance on multimedia recommendation has largely focused on exploring deep learning methods to improve the recommendation accuracy. To date, however, there has been little effort to investigate the robustness of multimedia representation and its impact on the performance of multimedia recommendation. In this paper, we shed light on the robustness of multimedia recommender system. Using the state-of-the-art recommendation framework and deep image features, we demonstrate that the overall system is not robust, such that a small (but purposeful) perturbation on the input image will severely decrease the recommendation accuracy. This implies the possible weakness of multimedia recommender system in predicting user preference, and more importantly, the potential of improvement by enhancing its robustness. To this end, we propose a novel solution named Adversarial Multimedia Recommendation (AMR), which can lead to a more robust multimedia recommender model by using adversarial learning. The idea is to train the model to defend an adversary, which adds perturbations to the target image with the purpose of decreasing the model's accuracy. We conduct experiments on two representative multimedia recommendation tasks, namely, image recommendation and visually-aware product recommendation. Extensive results verify the positive effect of adversarial learning and demonstrate the effectiveness of our AMR method. Source codes are available in https://github.com/duxy-me/AMR.
연구 동기 및 목표
- 딥러닝 기반의 멀티미디어 추천 시스템이 시각적 특징에 대한 적대적 변형에 얼마나 취약한지 조사하기 위해.
- 사람의 눈으로는 인식하기 어려운 소규모 이미지 변형이 최신 모델인 VBPR의 추천 성능을 심각하게 떨어뜨릴 수 있음을 입증하기 위해.
- 추천 정확도를 희생시키지 않은 채 일반화 가능한 강건성 향상 방법을 개발하기 위해.
- 일반 딥러닝 분야의 적대적 훈련을 rich visual signals를 갖는 멀티미디어 추천의 특수한 맥락으로 확장하기 위해.
- 시각적 입력에 대한 적대적 훈련을 통해 어떤 콘텐츠 기반 추천 시스템의 성능을 향상시킬 수 있는 청사진을 제공하기 위해.
제안 방법
- 빠른 기울기 부호 방법(FGSM)을 사용하여 입력 이미지에 변형을 생성함으로써 모델 예측 오차를 최대화하는 적대적 훈련을 적용한다.
- 모델은 추천 손실를 최소화하면서 동시에 이러한 적대적 예제에 대비하는 방식으로 공동 최적화된다.
- 프레임워크는 적대적 학습을 Visual Bayesian Personalized Ranking(VBPR) 모델에 통합하여, 손실 함수에 적대적 예제를 포함하도록 수정한다.
- 잠재 임bedding이 아닌 딥 이미지 특징(예: ResNet-50)에 직접 변형을 적용함으로써 입력 수준의 강건성을 중시한다.
- 추천 모델과 적대자 간의 갱신을 번갈아가며 수행함으로써, 강건성을 향상시키기 위해 최소-최대 게임을 시뮬레이션한다.
- 이 방법은 손실 함수를 적절히 수정함으로써 다른 pointwise 또는 pairwise 추천 모델에 일반화하여 적용할 수 있다.
실험 결과
연구 질문
- RQ1최신 멀티미디어 추천 시스템은 이미지 입력에 대한 소규모이고 타겟된 변형에 얼마나 취약한가?
- RQ2적대적 훈련이 추천 정확도를 떨어뜨리지 않으면서도 딥러닝 기반 멀티미디어 추천 시스템의 강건성을 향상시킬 수 있는가?
- RQ3이미지 특징에 대한 적대적 학습이 멀티미디어 추천에서 더 안정적이고 일반화 가능한 표현을 만들어낼 수 있는가?
- RQ4제안된 AMR 프레임워크는 표준 훈련 및 기존의 추천 분야의 적대적 방법과 비교해 어떻게 다른가?
- RQ5적대적 훈련 철학은 rich visual features에 의존하는 콘텐츠 기반 추천 시스템으로 효과적으로 확장될 수 있는가?
주요 결과
- 사람의 눈으로는 인식하기 어려운 소규모 적대적 변형(ε = 0.007)은 VBPR의 랭킹 성능을 극적으로 떨어뜨리며, 양성 이미지가 음성 이미지보다 낮은 순위로 평가될 수 있다.
- 제안된 AMR 프레임워크는 강건성을 크게 향상시켜, 적대적 공격 조건에서도 높은 추천 정확도를 유지한다.
- Pinterest와 제품 추천 데이터셋을 포함한 두 개의 실세계 데이터셋에서 실시한 광범위한 실험 결과, AMR는 표준 VBPR 및 기타 베이스라인 모델보다 정확도와 강건성 측면에서 뛰어난 성능을 보였다.
- 적대적 훈련 과정은 다양한 평가 지표에서 일관된 성능 향상을 보이며, 더 안정적이고 일반화 가능한 표현을 만들어낸다는 점에서 뚜렷하다.
- 이 방법은 다양한 추천 모델에 효과적이며, 다양한 콘텐츠 기반 추천 프레임워크에 적용 가능한 일반성과 적응성을 입증하였다.
- 소스 코드는 https://github.com/duxy-me/AMR 에 공개되어 있어 재현성과 적대적 멀티미디어 추천 분야의 향후 연구를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.