[논문 리뷰] MM-Rec: Multimodal News Recommendation
MM-Rec는 사전 훈련된 시각어휘 모델을 사용하여 뉴스 제목과 이미지의 관심 영역(ROIs)을 공동으로 인코딩함으로써 공액주의 트랜스포머를 통해 이질적 모odal 간의 관련성을 포착하는 다중모달 뉴스 추천 프레임워크를 제안한다. 또한 다중모달 관련성에 기반해 관련된 이전 클릭 뉴스를 선택함으로써 사용자 관심을 모델링하기 위해 다중모달 후보 인식 주의 네트워크를 추가로 활용하여, 실제 데이터에서 텍스트 중심 기준 모델 대비 추천 성능을 크게 향상시킨다.
Accurate news representation is critical for news recommendation. Most of existing news representation methods learn news representations only from news texts while ignore the visual information in news like images. In fact, users may click news not only because of the interest in news titles but also due to the attraction of news images. Thus, images are useful for representing news and predicting user behaviors. In this paper, we propose a multimodal news recommendation method, which can incorporate both textual and visual information of news to learn multimodal news representations. We first extract region-of-interests (ROIs) from news images via object detection. Then we use a pre-trained visiolinguistic model to encode both news texts and news image ROIs and model their inherent relatedness using co-attentional Transformers. In addition, we propose a crossmodal candidate-aware attention network to select relevant historical clicked news for accurate user modeling by measuring the crossmodal relatedness between clicked news and candidate news. Experiments validate that incorporating multimodal news information can effectively improve news recommendation.
연구 동기 및 목표
- 기존 뉴스 추천 시스템이 텍스트 콘텐츠에만 의존하고 뉴스 이미지의 시각적 정보를 忽시하는 한계를 해결하기 위해.
- 뉴스 제목과 이미지 영역 간의 이질적 모달 간 관련성을 모델링하여 뉴스 표현 학습을 향상시키기 위해.
- 후보 뉴스와 관련된 다중모달 관련성을 기반으로 이전에 클릭한 뉴스 중에서 관련성을 선별함으로써 사용자 모델링 메커니즘을 개발하기 위해.
- 시각 정보를 통합함으로써 클릭 예측 및 추천 정확도가 향상되는지 검증하기 위해.
- 사전 훈련된 시각어휘 모델이 뉴스 추천을 위한 공동 텍스트 및 시각적 표현을 학습하는 데 효과적인지 입증하기 위해.
제안 방법
- 객체 검출을 위한 사전 훈련된 Mask R-CNN 모델을 사용하여 뉴스 이미지에서 관심 영역(ROIs)을 추출한다.
- 사전 훈련된 시각어휘 모델(ViLBERT)을 사용하여 뉴스 제목과 이미지 ROIs를 인코딩하여 다중모달 표현을 학습한다.
- 뉴스 텍스트와 이미지 ROIs 간의 본질적 이질적 모달 간 관련성을 모델링하기 위해 공액주의 트랜스포머를 적용한다.
- 다중모달 임베딩을 사용하여 후보 뉴스와 각 클릭된 뉴스 간의 관련성을 계산하는 다중모달 후보 인식 주의 네트워크를 설계한다.
- 선택된 관련 클릭 뉴스를 사용하여 후보 뉴스에 대한 사용자 관심을 모델링함으로써 정밀한 개인화를 가능하게 한다.
- 클릭 예측을 최적화하기 위해 랭킹 손실을 사용하여 엔드 투 엔드 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1뉴스 이미지에서 시각 정보를 통합하면 뉴스 표현 및 추천 성능이 향상되는가?
- RQ2뉴스 텍스트와 이미지 ROIs 간의 이질적 모달 간 관련성 모델링이 표현 품질과 추천 정확도에 어떤 영향을 미치는가?
- RQ3다중모달 관련성을 활용하는 후보 인식 주의 메커니즘이 표준 주의 메커니즘에 비해 사용자 관심 모델링을 향상시키는가?
- RQ4다중모달 뉴스 표현 학습에서 텍스트 특징와 시각적 특징의 상대 기여도는 어떻게 되는가?
- RQ5공액주의 기반 메커니즘과 다중모달 주의 네트워크가 기준 모델 대비 이질적 모달 상호작용을 어떻게 더 효과적으로 포착하는가?
주요 결과
- MM-Rec는 MIND 데이터셋에서 64.96%의 히트 레이트를 기록하며, NRMS 및 PLM-NR와 같은 텍스트 중심 기준 모델에 비해 유의미하게 뛰어난 최신 기술 성능을 달성한다.
- 제거 실험 결과, 텍스트 및 시각 모달 모두가 필수적임을 확인하였으며, 어느 한 모달도 제거할 경우 성능 저하가 발생한다.
- 공액주의 트랜스포머 메커니즘은 뉴스 제목과 이미지 영역 간의 상호작용을 효과적으로 모델링하여 성능 향상을 이룬다.
- 다중모달 후보 인식 주의 네트워크는 다중모달 유사도 기반으로 가장 관련성이 높은 클릭 뉴스만을 선별함으로써 사용자 관심 모델링을 향상시킨다.
- 이미지 입력이 없더라도 MM-Rec의 변형 버전이 PLM-NR 기준 모델을 능가함을 확인하였으며, 이는 시각 신호 통합을 통해 사전 훈련된 시각어휘 모델이 텍스트 이해 능력을 향상시킨다는 것을 시사한다.
- 사례 연구 결과, MM-Rec는 텍스트 중심 모델이 제목만으로는 이를 감지하지 못하는 바이오모달 관련 뉴스(예: NFL 관련)를 더 높은 순위로 랭킹함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.