Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Biases in ChatGPT-based Recommender Systems: Provider Fairness, Temporal Stability, and Recency

Yashar Deldjoo|arXiv (Cornell University)|2024. 01. 19.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 ChatGPT 기반 추천 시스템의 편향을 조사하며, 특히 역할 기반 프롬프트가 영화 추천의 공정성, 다양성 및 최신성에 크게 기여함을 입증한다. GPT 기반 모델이 기존의 협업 필터링보다 신작 및 장르가 다양한 영화(특히 2000년 이후 드라마 및 코미디)를 더 잘 추천함을 확인했으며, 사용자 평점 포함이 정확성과 안정성을 높인다.

ABSTRACT

This paper explores the biases in ChatGPT-based recommender systems, focusing on provider fairness (item-side fairness). Through extensive experiments and over a thousand API calls, we investigate the impact of prompt design strategies-including structure, system role, and intent-on evaluation metrics such as provider fairness, catalog coverage, temporal stability, and recency. The first experiment examines these strategies in classical top-K recommendations, while the second evaluates sequential in-context learning (ICL). In the first experiment, we assess seven distinct prompt scenarios on top-K recommendation accuracy and fairness. Accuracy-oriented prompts, like Simple and Chain-of-Thought (COT), outperform diversification prompts, which, despite enhancing temporal freshness, reduce accuracy by up to 50%. Embedding fairness into system roles, such as "act as a fair recommender," proved more effective than fairness directives within prompts. Diversification prompts led to recommending newer movies, offering broader genre distribution compared to traditional collaborative filtering (CF) models. The second experiment explores sequential ICL, comparing zero-shot and few-shot ICL. Results indicate that including user demographic information in prompts affects model biases and stereotypes. However, ICL did not consistently improve item fairness and catalog coverage over zero-shot learning. Zero-shot learning achieved higher NDCG and coverage, while ICL-2 showed slight improvements in hit rate (HR) when age-group context was included. Our study provides insights into biases of RecLLMs, particularly in provider fairness and catalog coverage. By examining prompt design, learning strategies, and system roles, we highlight the potential and challenges of integrating LLMs into recommendation systems. Further details can be found at https://github.com/yasdel/Benchmark_RecLLM_Fairness.

연구 동기 및 목표

  • 프롬프트 설계 전략이 ChatGPT 기반 추천 시스템의 추천 품질에 미치는 영향을 조사하는 것.
  • 정확성, 공정성, 다양성 및 시간적 안정성 측면에서 GPT 기반 모델과 기존의 협업 필터링(CF) 기반 모델 간의 성능을 비교하는 것.
  • 프롬프트에 사용자 평점을 포함함으로써 추천의 개인화 및 신뢰성에 미치는 영향을 분석하는 것.
  • GPT 기반 모델이 협업 필터링 모델보다 신작 및 더 다양한 장르를 선호하는 이유를 이해하는 것.
  • 제약된 프롬프트, 소수 샘플 학습 및 하이브리드 RAG 프레임워크를 통해 RecLLM 성능 향상 기회를 규명하는 것.

제안 방법

  • 역할 기반 프롬프트(예: '당신은 공정한 추천자입니다') 및 추론 패러다임(예: 체인 오브 토우트)을 포함한 다양한 프롬프트 설계 전략을 적용.
  • 개인화 영향을 평가하기 위해 암시적(평가 없음) 및 명시적(평가 포함) 프롬프트 시나리오에서 GPT 기반 모델을 평가.
  • NDCG, 리콜, 제공자 공정성, 장르 다양성 및 시간적 신선도(2000년 이후 영화 선호도) 등의 다수 지표를 통해 추천 결과를 비교.
  • 성능의 통계적 안정성을 평가하기 위해 신뢰구간을 사용.
  • 정확성과 관련성 평가를 위해 GPT 출력을 사전에 정의된 테스트 세트의 항목에만 제한.
  • 개인화와 탐색의 균형을 위해 향후 GPT와 CF를 Retrieval-Augmented Generation(RAG) 프레임워크를 통해 통합할 것을 제안.
Figure 1 . Conceptual idea behind our work
Figure 1 . Conceptual idea behind our work

실험 결과

연구 질문

  • RQ1다양한 프롬프트 설계 전략은 GPT 기반 영화 추천 시스템에서 공정성, 다양성 및 정확성에 어떤 영향을 미치는가?
  • RQ2GPT 기반 모델이 새로운 영화와 더 다양한 영화를 추천하는 데서 기존의 협업 필터링 모델보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ3프롬프트에 명시적 사용자 평점을 포함함으로써 GPT 기반 추천의 안정성과 정확성에 어떤 영향을 미치는가?
  • RQ4왜 GPT 기반 모델은 액션 및 어드벤처 장르보다 '드라마', '코미디' 장르를 선호하는가?
  • RQ5프롬프트 제약 조건과 소수 샘플 학습은 GPT 기반 추천의 관련성과 정확성을 어떻게 향상시킬 수 있는가?

주요 결과

  • 역할 기반 프롬프트는 제공자 공정성과 다양성을 크게 향상시켜 추천에서 인기 편향을 효과적으로 완화했다.
  • '평가 포함' GPT 모델은 NDCG 0.013230과 리콜 0.014721을 기록하며 다른 GPT 기반 시나리오보다 가장 높은 성능을 보였다.
  • GPT 기반 모델은 신작 영화, 특히 2000년 이후에 제작된 영화를 강하게 선호하여 추천의 시간적 신선도를 보였다.
  • GPT 모델은 '드라마', '코미디', '로맨스' 장르에 편향을 보였으며, 이는 CF 모델이 '액션'과 '어드벤처' 장르를 선호하는 것과 대조된다. 이는 최근 문화 트렌드에 노출된 학습 데이터 때문일 수 있다.
  • 체인 오브 토우트(CoT) 및 단순 프롬프트 전략이 테스트된 모든 GPT 기반 접근 방식 중에서 가장 높은 정확도를 기록했다.
  • '평가 포함' 모델의 NDCG(0.009737–0.017012) 및 리콜(0.010261–0.019795) 신뢰구간은 안정적이고 신뢰할 수 있는 성능을 확인했다.
(a) NDCG@10.
(a) NDCG@10.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.