Skip to main content
QUICK REVIEW

[논문 리뷰] Selective Transfer Learning for Cross Domain Recommendation

Zhongqi Lu, Erheng Zhong|arXiv (Cornell University)|2012. 10. 26.
Recommender Systems and Techniques인용 수 6
한 줄 요약

이 논문은 소스 도메인에서 일致하는 지식만 추출하여 이전하는 선택적 전이 학습 프레임워크인 STLCF를 제안한다. 이는 평점 예측 정확도를 향상시키기 위해 설계되었으며, 예측 오차의 분산을 통합한 방법으로 인스턴스 선택을 유도함으로써 과적합을 줄이고, 특히 극도로 희박한 데이터 상황에서 최신 기술보다 뛰어난 성능을 보인다.

ABSTRACT

Collaborative filtering (CF) aims to predict users' ratings on items according to historical user-item preference data. In many real-world applications, preference data are usually sparse, which would make models overfit and fail to give accurate predictions. Recently, several research works show that by transferring knowledge from some manually selected source domains, the data sparseness problem could be mitigated. However for most cases, parts of source domain data are not consistent with the observations in the target domain, which may misguide the target domain model building. In this paper, we propose a novel criterion based on empirical prediction error and its variance to better capture the consistency across domains in CF settings. Consequently, we embed this criterion into a boosting framework to perform selective knowledge transfer. Comparing to several state-of-the-art methods, we show that our proposed selective transfer learning framework can significantly improve the accuracy of rating prediction tasks on several real-world recommendation tasks.

연구 동기 및 목표

  • 관련된 소스 도메인의 지식을 활용하여 협업 필터링에서 데이터 희박성 문제를 해결한다.
  • 기존 전이 학습 방법이 소스 데이터가 타겟 도메인과 일치한다고 가정하는 한계를 극복한다.
  • 실제 오차 외의 기준으로 소스 도메인과 타겟 도메인 간의 일致성 측정 기준을 개발한다.
  • 신뢰할 수 있는 소스 인스턴스만 자동으로 가중하고 선택하여 모델 훈련에 활용하는 선택적 전이 학습 프레임워크를 설계한다.
  • 분산 인식 인스턴스 선택을 통해 장미니어 사용자와 희박한 타겟 도메인에서의 강인성과 성능을 향상시킨다.

제안 방법

  • 실제 예측 오차와 그 분산을 모두 기반으로 한 새로운 일치성 기준을 제안하여 소스 도메인 데이터의 신뢰성을 평가한다.
  • 일치성 기준을 부스팅 프레임워크에 통합하여 오차와 분산을 기반으로 반복적으로 소스 인스턴스의 가중치를 재조정한다.
  • STLCF 프레임워크 내에서 희박한 사용자-아이템 상호작용을 처리하기 위해 가우시안 프로세스 잠재의미분석(GPLSA)을 기본 모델로 사용한다.
  • 부스팅 과정에서 반복적인 재가중을 적용하여 오차가 낮고 분산이 낮은 소스 인스턴스(안정적이고 일관된 선호도를 나타냄)를 우선순위로 지정한다.
  • 일관되지 않거나 노이즈가 많은 소스 데이터를 필터링함으로써 잘못된 지식 이전을 방지하는 선택적 지식 이전을 가능하게 한다.
  • 다양한 기본 모델을 지원하도록 프레임워크를 일반화하였으며, GPLSA와 TGPLSA를 포함한 다양한 모델에서 효과를 입증하였다.

실험 결과

연구 질문

  • RQ1어떻게 하면 소스 도메인 인스턴스 중 타겟 도메인과 일치하는 것을 효과적으로 식별하여 잘못된 지식 이전을 방지할 수 있는가?
  • RQ2실제 오차의 분산을 통합함으로써 협업 필터링에서 지식 이전의 신뢰성은 어느 정도 향상되는가?
  • RQ3분산 인식 인스턴스 선택을 통합한 부스팅 기반 프레임워크는 희박한 추천 환경에서 비선택적 전이 학습보다 뛰어난 성능을 보일 수 있는가?
  • RQ4장미니어 사용자(특히 데이터 희박성에 취약한 사용자)에 대해서는 제안된 방법이 어떻게 성능을 발휘하는가?
  • RQ5타겟 도메인이 극도로 낮은 데이터 밀도를 가질 경우, 프레임워크는 과적합에 대해 강인한가?

주요 결과

  • STLCF는 다양한 실세계 데이터셋에서 최신 기술보다 뛰어난 평점 예측 정확도를 확보하였다.
  • STLCF의 테스트 RMSE는 잠재 주제 수 k가 125에 이르기까지 계속 감소하는 반면, GPLSA와 TGPLSA는 각각 k=50과 k=75를 초과하면서 과적합 현상이 발생하고 RMSE가 증가하기 시작한다.
  • 극도로 희박한 타겟 도메인(예: 0.3% 희박성)에서도 STLCF는 낮은 일반화 오차를 유지하며 과적합에 대한 뛰어난 강인성을 보였다.
  • 일치성 기준에 분산을 통합함으로써 일관된 선호도를 보이는 사용자에게 특히 신뢰할 수 있는 소스 인스턴스를 보다 정확히 식별할 수 있었다.
  • 장미니어 사용자에 대해서도 STLCF는 비선택적 전이 방법에 비해 특히 뛰어난 성능을 발휘하였다.
  • 프레임워크는 일반화 능력이 뛰어나며, GPLSA와 TGPLSA를 포함한 다양한 기본 모델과 조합해도 일관되게 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.