Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Multi-Interest Network with Stable Learning

Zhaocheng Liu, Yingtao Luo|arXiv (Cornell University)|2022. 07. 14.
Recommender Systems and Techniques인용 수 4
한 줄 요약

이 논문은 사용자 관심사 간 미세한 종속성에서 기인하는 유사 상관관계를 줄임으로써 순차 추천에서 일반화 성능을 향상시키는 딥 스테이블 멀티인트레스트 러닝 프레임워크인 DESMIL을 제안한다. 힐버트-슈미트 독립성 기준(HSIC)을 사용해 상호 관심사 간 종속성을 측정하고, 불필요한 종속성을 억제하기 위해 학습 샘플의 가중치를 학습함으로써 DESMIL은 분포 외 데이터에서 뛰어난 일반화 성능을 달성하며, 공개, 산업, 합성 데이터셋에서 최신 기술을 초월하는 성능을 보인다.

ABSTRACT

Modeling users' dynamic preferences from historical behaviors lies at the core of modern recommender systems. Due to the diverse nature of user interests, recent advances propose the multi-interest networks to encode historical behaviors into multiple interest vectors. In real scenarios, the corresponding items of captured interests are usually retrieved together to get exposure and collected into training data, which produces dependencies among interests. Unfortunately, multi-interest networks may incorrectly concentrate on subtle dependencies among captured interests. Misled by these dependencies, the spurious correlations between irrelevant interests and targets are captured, resulting in the instability of prediction results when training and test distributions do not match. In this paper, we introduce the widely used Hilbert-Schmidt Independence Criterion (HSIC) to measure the degree of independence among captured interests and empirically show that the continuous increase of HSIC may harm model performance. Based on this, we propose a novel multi-interest network, named DEep Stable Multi-Interest Learning (DESMIL), which tries to eliminate the influence of subtle dependencies among captured interests via learning weights for training samples and make model concentrate more on underlying true causation. We conduct extensive experiments on public recommendation datasets, a large-scale industrial dataset and the synthetic datasets which simulate the out-of-distribution data. Experimental results demonstrate that our proposed DESMIL outperforms state-of-the-art models by a significant margin. Besides, we also conduct comprehensive model analysis to reveal the reason why DESMIL works to a certain extent.

연구 동기 및 목표

  • 다양한 관심사를 캡처한 다중 관심사 네트워크의 분포 외(OOD) 설정에서의 불안정성을, 캡처된 관심사 간 종속성에서 기인하는 유사 상관관계로 인해 해결한다.
  • HSIC로 측정한 상호 관심사 간 종속성 증가와 학습 중 성능 저하 간의 상관관계를 조사한다.
  • 사용자 행동 시퀀스에서 유사 종속성 대신 진정한 인과 패턴에 초점을 맞추도록 모델을 유도하는 방법을 개발한다.
  • 미세한 상호 관심사 간 종속성의 영향을 줄이는 샘플 가중치를 학습하여 순차 추천의 일반화 성능을 향상시킨다.

제안 방법

  • 다중 관심사 네트워크가 캡처한 다수의 사용자 관심사 벡터 간의 독립성 정도를 정량화하기 위해 통계적 측정 도구로 HSIC를 도입한다.
  • 학습 샘플의 종속성 증가에 기여하는 샘플을 동적으로 가중치를 낮추기 위해 손실 함수에 샘플 가중치 기반 메커니즘을 제안한다.
  • 학습 중 관련 없는 관심사 간의 유사 상관관계를 최소화하도록 유도하기 위해 HSIC 기반 정규화 항을 설계한다.
  • 부드럽고 미분 가능한 가중치 전략을 활용해 모델이 인과적으로 관련된 상호작용에 집중하면서도, 관련 없지만 상관관계가 있는 잡음은 억제할 수 있도록 한다.
  • 수렴성과 일반화를 균형 잡기 위해 조기 정지와 적응적 학습률을 사용하며, 안정적인 학습을 위해 고정된 λ=1.0을 사용한다.
  • 사용자당 관심사 벡터 수(c)를 튜닝하여, Book, CDs and Vinyl 및 Movies and TV 데이터셋에서는 c=2가 최적임을 발견하였고, 산업용 데이터셋에서는 c=6이 최적임을 확인하였다.

실험 결과

연구 질문

  • RQ1HSIC로 측정한 상호 관심사 간 종속성 정도는 학습 과정에서 어떻게 변화하며, 성능 저하와 관련이 있는가?
  • RQ2샘플 가중치를 통해 상호 관심사 간 종속성을 제어하면 분포 이탈 상황에서의 모델 일반화 성능 향상에 기여하는가?
  • RQ3관련 없는 관심사 간의 유사 상관관계를 줄이면 분포 외 테스트 데이터에서 성능 향상이 이루어지는가?
  • RQ4학습률 및 관심사 벡터 수와 같은 하이퍼파rameter 설정에 대해 제안된 방법의 탄력성은 어떠한가?

주요 결과

  • 학습 과정에서 HSIC가 지속적으로 증가함에 따라 성능 포화 또는 저하가 발생함을 확인하였으며, 이는 상호 관심사 간 종속성 증가가 모델 일반화에 악영향을 준다는 것을 시사한다.
  • 공개 벤치마크인 Book, CDs and Vinyl, Movies and TV 데이터셋에서 DESMIL은 최신 기술 모델들을 뛰어넘는 유의미한 성능 향상을 달성하였다.
  • 대규모 산업용 데이터셋에서 DESMIL는 분포 이탈 상황에서도 뛰어난 강건성과 일반화 능력을 보였으며, 특히 이러한 상황에서 뛰어난 성능을 발휘하였다.
  • 합성된 OOD 데이터에서 모델은 더 높은 성능을 기록하였으며, 이는 인과 패턴을 유사 상관관계가 아닌 방식으로 학습할 수 있음을 확인한다.
  • 샘플 가중치 히스토GRAM을 분석한 결과, 대부분의 샘플은 가중치가 1.0 근처로 할당되었고, 소수의 샘플만이 근처 0에 가까운 가중치를 받음으로써, 잡음이 되거나 관련 없는 상호작용을 효과적으로 무시함을 나타낸다.
  • 특히 λ=1.0 및 최적의 c 값 범위에서 다양한 하이퍼파rameter 설정에 대해 안정적인 성능을 유지함으로써, 하이퍼파rameter 튜닝의 부담을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.