Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Data Splitting Strategies for the Evaluation of Recommendation Models

Zaiqiao Meng, Richard McCreadie|arXiv (Cornell University)|2020. 07. 26.
Recommender Systems and Techniques참고 문헌 26인용 수 4
한 줄 요약

이 논문은 다양한 데이터 분할 전략이 추천 모델의 평가 및 랭킹에 미치는 영향을 조사하며, 동일한 데이터셋과 메트릭을 사용하더라도 동일한 모델이 서로 다른 전략에서 다른 순위를 기록할 수 있음을 보여준다. 저자들은 라스트 아이템 제거 및 시간적 사용자 분할 전략이 향후 정보를 유출할 수 있어 신뢰할 수 없는 비교를 초래할 수 있음을 입증하고, 공정한 평가를 위한 표준화된 시간적 글로벌 분할 전략을 기본으로 사용할 것을 주장한다.

ABSTRACT

Effective methodologies for evaluating recommender systems are critical, so that such systems can be compared in a sound manner. A commonly overlooked aspect of recommender system evaluation is the selection of the data splitting strategy. In this paper, we both show that there is no standard splitting strategy and that the selection of splitting strategy can have a strong impact on the ranking of recommender systems. In particular, we perform experiments comparing three common splitting strategies, examining their impact over seven state-of-the-art recommendation models for two datasets. Our results demonstrate that the splitting strategy employed is an important confounding variable that can markedly alter the ranking of state-of-the-art systems, making much of the currently published literature non-comparable, even when the same dataset and metrics are used.

연구 동기 및 목표

  • 데이터 분할 전략이 추천 모델의 성능 및 랭킹에 미치는 영향을 조사하는 것.
  • 특히 데이터 분할 방법론 측면에서 문헌 내 평가 관행의 일관성 없는 점을 규명하는 것.
  • 동일한 데이터셋과 메트릭을 사용하더라도 다양한 분할 전략이 최신 모델의 랭킹을 크게 달리 유도할 수 있음을 입증하는 것.
  • 향후 연구를 위한 최선의 실천 방안을 제안하는 것—예: 데이터 분할 공유 및 보고

제안 방법

  • 저자들은 BPR, NMF, VAECF, NGCF, NeuMF, VBCAR, Triple2Vec 등 7종의 최신 추천 모델을 시간적 글로벌, 라스트 아이템 제거, 라스트 바구니 제거 전략을 통해 평가한다.
  • 일관된 전처리 및 하이퍼파라미터 튜닝을 보장하기 위해 두 개의 실세계 데이터셋인 Amazon과 Dunnhumby에 이러한 전략을 적용한다.
  • 모든 분할 전략에서 표준 메트릭인 NDCG@10과 Recall@10을 사용해 성능을 측정한다.
  • 세 핵심 모델(NeuMF, VBCAR, Triple2Vec)의 하이퍼파라미터 튜닝을 통해 생성된 230개의 모델 변형을 활용한 대규모 상관관계 실험을 수행하여 전략 간 랭킹 안정성을 평가한다.
  • 각 분할 전략 쌍 간의 점수 분포 간 페어와이즈 Kendall’s τ 상관계수를 계산하여 랭킹 일관성 수준을 정량화한다.
  • 라스트 아이템 제거 및 시간적 사용자 분할 전략에서의 정보 유출를 분석하여, 훈련 과정에서 향후 상호작용 정보가 간접적으로 제공되어 평가가 왜곡됨을 규명한다.

실험 결과

연구 질문

  • RQ1데이터 분할 전략의 선택이 최신 추천 모델의 랭킹에 유의미한 영향을 미치는가?
  • RQ2동일한 데이터셋과 메트릭을 사용할 때, 다양한 분할 전략이 성능 랭킹에 얼마나 큰 불일치를 초래하는가?
  • RQ3어느 분할 전략이 정보 유출를 최소화하고 모델 성능 평가에 가장 현실적인가?
  • RQ4특정 데이터 분포나 유출로 인해 일부 추천 모델이 특정 분할 전략에 의해 체계적으로 유리하게 평가되는가?
  • RQ5향후 추천 시스템 평가에서 재현 가능성과 공정성을 확보하기 위해 어떤 최선의 실천 방안을 채택해야 하는가?

주요 결과

  • 시간적 글로벌 분할 전략이 가장 일관되고 현실적인 평가를 제공하며, 공정한 비교를 위한 기본 전략으로 사용되어야 한다.
  • 라스트 아이템 제거 및 시간적 사용자 분할 전략은 심각한 정보 유출를 보이며, 훈련 과정에서 향후 상호작용 정보가 간접적으로 제공되어 성능 평가가 왜곡된다.
  • 분할 전략 간 Kendall’s τ 상관계수는 0.5284에서 0.7630 사이로, 고성능 모델 간에도 랭킹 전환 현상이 뚜렷하게 나타나는 것으로 확인된다.
  • 라스트 아이템 제거 전략은 NDCG@10과 Recall@10에서 점수 분산이 더 넓어, 더 구조화된 전략과는 다른 모델 행동 측면을 평가하는 것으로 나타났다.
  • Triple2Vec 및 VBCAR와 같은 일부 모델은 특정 분할 전략에서 더 높은 성능을 보이며, 이는 모델 랭킹이 데이터 분할 설계에 민감함을 시사한다.
  • 이 연구는 데이터 분할 전략이 모델 평가에서 중요한 혼동 변수임을 확인하였으며, 동일한 데이터셋과 메트릭을 사용하더라도 연구 간 비교성이 떨어질 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.