Skip to main content
QUICK REVIEW

[논문 리뷰] Is ChatGPT Fair for Recommendation? Evaluating Fairness in Large Language Model Recommendation

Jizhi Zhang, Keqin Bao|arXiv (Cornell University)|2023. 05. 12.
Topic Modeling참고 문헌 41인용 수 17
한 줄 요약

논문은 FaiRLLM을 RecLLM용 공정성 벤치마크로 도입하고 ChatGPT를 평가하여 음악 및 영화 추천에서 여러 사용자 민감 속성에 걸친 불공정을 드러낸다.

ABSTRACT

The remarkable achievements of Large Language Models (LLMs) have led to the emergence of a novel recommendation paradigm -- Recommendation via LLM (RecLLM). Nevertheless, it is important to note that LLMs may contain social prejudices, and therefore, the fairness of recommendations made by RecLLM requires further investigation. To avoid the potential risks of RecLLM, it is imperative to evaluate the fairness of RecLLM with respect to various sensitive attributes on the user side. Due to the differences between the RecLLM paradigm and the traditional recommendation paradigm, it is problematic to directly use the fairness benchmark of traditional recommendation. To address the dilemma, we propose a novel benchmark called Fairness of Recommendation via LLM (FaiRLLM). This benchmark comprises carefully crafted metrics and a dataset that accounts for eight sensitive attributes1 in two recommendation scenarios: music and movies. By utilizing our FaiRLLM benchmark, we conducted an evaluation of ChatGPT and discovered that it still exhibits unfairness to some sensitive attributes when generating recommendations. Our code and dataset can be found at https://github.com/jizhi-zhang/FaiRLLM.

연구 동기 및 목표

  • RecLLM 패러다임에서 LLM이 사용자 지시에 따라 추천을 생성할 때 공정성에 대한 우려를 제기한다.
  • 두 도메인(음악, 영화)에서 여덟 가지 민감한 사용자 속성을 다루는 지표와 데이터셋을 포함한 벤치마크인 FaiRLLM을 제안한다.
  • 후보 점수를 필요로 하지 않고 공정성을 평가하는 중립-대 민감한 지시 유사성 프레임워크를 정의한다.
  • 편향을 드러내고 완화 방향을 제시하기 위해 ChatGPT를 사용한 재현 가능한 평가 결과를 제공한다.

제안 방법

  • 민감 속성이 제공되지 않을 때 사용자 그룹에 대한 편견이 없는 것을 RecLLM의 공정성 차원으로 정의한다.
  • 중립 지시와 민감 지시 변형 간의 top-K 추천 유사성을 계산한다.
  • 랭킹을 고려하면서 중립 목록과 민감 목록을 비교하기 위해 세 가지 유사성 지표(Jaccard@K, SERP*@K, PRAG*@K)를 도입한다.
  • 민감 속성 값 전반에 걸친 집계 유사성의 발산을 정량화하는 두 가지 공정성 지표(SNSR@K, SNSV@K)를 개발한다.
  • 여덟 가지 민감 속성 값과 템플릿 기반 지시 형식을 가진 두 벤치마크 데이터셋(Music, Movie)을 구축한다.
  • 상위-K 목록 생성을 재현 가능하게 하기 위해 ChatGPT에 그리디 디코딩 설정을 사용한다.

실험 결과

연구 질문

  • RQ1RQ1: 다양한 민감한 사용자 속성에 대해 추천자로서 작동할 때 LLM은 얼마나 불공정한가?
  • RQ2RQ2: 관찰된 불공정성이 프롬프트의 오탈자나 다른 언어와 같은 조건에서 강인한가?
  • RQ3RQ3: 공정성 측정이 음악 도메인과 영화 도메인에서 일관된 패턴을 반영하는가?

주요 결과

  • ChatGPT는 음악과 영화 추천 모두에서 여러 민감 속성에 대해 불공정성을 보인다.
  • 공정성 지표인 SNSR과 SNSV는 속성 의존적 불공정성 수준을 드러낸다; 종교, 대륙, 직업, 국가, 인종 등은 다양한 영향을 보인다.
  • 추천 목록을 서로 다른 길이(K)로 잘라낼 때도 불공정성이 지속된다.
  • 민감 속성 값의 오탈자는 불리한 그룹에 대한 근접성에 따라 불공정성을 악화시키거나 유지시킬 수 있다.
  • 중국어 프롬프트에서도 지속적인 불공정성이 나타나며, 일부 도메인(영화)은 번역 시나리오에서 유사성이 낮아지는 경향을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.