Skip to main content
QUICK REVIEW

[논문 리뷰] Pre-training Graph Transformer with Multimodal Side Information for Recommendation

Yong Liu, Susen Yang|arXiv (Cornell University)|2020. 10. 23.
Topic Modeling참고 문헌 44인용 수 5
한 줄 요약

이 논문은 다중모달 보조 정보(텍스트, 이미지)와 사용자 기반 항목 간 관계를 동일한 동종 항목 그래프를 통해 공동으로 모델링함으로써 항목 표현을 학습하는 자기지도 학습 프레임워크인 사전 훈련된 다중모달 그래프 트랜스포머(PMGT)를 제안한다. 그래프 구조 복원 및 마스킹된 노드 특성 복원을 통해 PMGT는 실제 데이터셋에서 항목 추천, 클릭스루율 예측, 항목 분류 작업에서 최고 성능을 달성하며, 온라인 A/B 테스트에서 영상 재생 수가 6.80% 증가함을 확인하였다.

ABSTRACT

Side information of items, e.g., images and text description, has shown to be effective in contributing to accurate recommendations. Inspired by the recent success of pre-training models on natural language and images, we propose a pre-training strategy to learn item representations by considering both item side information and their relationships. We relate items by common user activities, e.g., co-purchase, and construct a homogeneous item graph. This graph provides a unified view of item relations and their associated side information in multimodality. We develop a novel sampling algorithm named MCNSampling to select contextual neighbors for each item. The proposed Pre-trained Multimodal Graph Transformer (PMGT) learns item representations with two objectives: 1) graph structure reconstruction, and 2) masked node feature reconstruction. Experimental results on real datasets demonstrate that the proposed PMGT model effectively exploits the multimodality side information to achieve better accuracies in downstream tasks including item recommendation, item classification, and click-through ratio prediction. We also report a case study of testing the proposed PMGT model in an online setting with 600 thousand users.

연구 동기 및 목표

  • 기존 추천 모델이 다중모달 보조 정보(예: 텍스트, 이미지)를 충분히 활용하지 못하고 있으며, 항목 간 관계를 독립적으로 다루는 데에 한계가 있음을 해결하고자 한다.
  • 동일한 그래프 구조 내에서 항목의 다중모달 특징과 사용자 기반 항목 간 관계(예: 동시 구매)를 통합적으로 모델링하는 유일한 프레임워크를 개발하고자 한다.
  • 이러한 통합된 다중모달 그래프에서 그래프 신경망을 자기지도 학습 목표를 사용하여 사전 훈련함으로써 후속 추천 작업의 성능을 향상시키고자 한다.
  • 제안된 사전 훈련 전략이 오프라인 벤치마크와 실제 온라인 배포 환경 모두에서 효과적인지 검증하고자 한다.

제안 방법

  • 사용자 상호작용에서 발생하는 공존 관계(예: 동시 구매)를 간선으로 하여 노드가 항목을 나타내는 동종 항목 그래프를 구축하며, 간선의 가중치는 상호작용 빈도에 기반한다.
  • 대부분의 표현 학습을 향상시키기 위해 각 항목의 맥락적 이웃을 선택하는 새로운 샘플링 알고리즘인 MCNSampling을 제안한다.
  • 다중모달 특징(텍스트, 이미지), 위치-ID 임베딩, 역할 레이블 임베딩을 사용하여 입력 표현을 풍부하게 한다.
  • 두 가지 자기지도 학습 목표인 그래프 구조 복원 및 마스킹된 노드 특성 복원을 사용하여 모델을 훈련한다.
  • 고정된 백본과 학습 가능한 분류기 헤드를 사용하여 항목 추천, CTR 예측, 항목 분류와 같은 후속 작업에서 사전 훈련된 모델을 미세조정한다.
  • 온라인 사례 연구에서 영상 검색을 위해 사전 훈련된 표현 간 코사인 유사도를 사용하며, 최종 랭킹에는 ItemKNN과 통합한다.

실험 결과

연구 질문

  • RQ1통합된 다중모달 항목 그래프에서의 사전 훈련이 추천 시스템의 표현 학습을 향상시킬 수 있는가?
  • RQ2제안된 자기지도 사전 훈련 전략(그래프 구조 복원 및 마스킹된 특성 복원)이 항목의 내용 정보와 관계 정보를 동시에 효과적으로 포착하는가?
  • RQ3PMGT 모델은 항목 추천, CTR 예측, 항목 분류와 같은 다양한 후속 작업에 대해 일반화되는가?
  • RQ4사전 훈련된 표현이 실제 온라인 추천 시스템에서 기존 베이스라인을 초월하는가?

주요 결과

  • PMGT는 세 개의 실세계 데이터셋(MI, IS, ML)에서 항목 추천, CTR 예측, 항목 분류 작업 전반에서 최고 성능을 기록하였다.
  • 분류 목표로 사전 훈련 목표를 대체한 PMGT-NP와 비교하여 사전 훈련된 PMGT가 우수한 성능을 보이며 자기지도 사전 훈련의 가치를 입증하였다.
  • 타오바오의 영상 추천 시스템에서 실시한 온라인 A/B 테스트에서, PMGT는 UNITER 임베딩을 사용한 베이스라인 대비 신규 영상 재생 수를 6.80% 증가시켰다.
  • 사례 연구 결과, PMGT 기반 영상 검색은 UNITER 기반 검색보다 더 다양한 추천을 제공함을 확인하였으며, 이는 더 나은 의미적 이해와 관계 인식 능력을 지닌 것을 시사한다.
  • 모델의 성능는 다양한 데이터 모odal과 작업에 걸쳐 뛰어난 안정성을 보이며, 다중모달 특징과 사용자 기반 항목 간 관계를 통합적으로 모델링하는 것이 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.