[論文レビュー] Understanding Biases in ChatGPT-based Recommender Systems: Provider Fairness, Temporal Stability, and Recency
この論文は、ChatGPTベースのレコメンデーションシステムにおけるバイアスを調査し、特にロールベースのプロンプトが映画推薦における公平性、多様性、新鮮さを顕著に向上させることを示している。GPTベースのモデルは、特に2000年以降のドラマやコメディなど、新しいジャンルに富んだ映画の推薦において、従来の協調フィルタリングより優れた性能を示しており、ユーザーの評価を含めることで精度と安定性が向上することがわかった。
This paper explores the biases in ChatGPT-based recommender systems, focusing on provider fairness (item-side fairness). Through extensive experiments and over a thousand API calls, we investigate the impact of prompt design strategies-including structure, system role, and intent-on evaluation metrics such as provider fairness, catalog coverage, temporal stability, and recency. The first experiment examines these strategies in classical top-K recommendations, while the second evaluates sequential in-context learning (ICL). In the first experiment, we assess seven distinct prompt scenarios on top-K recommendation accuracy and fairness. Accuracy-oriented prompts, like Simple and Chain-of-Thought (COT), outperform diversification prompts, which, despite enhancing temporal freshness, reduce accuracy by up to 50%. Embedding fairness into system roles, such as "act as a fair recommender," proved more effective than fairness directives within prompts. Diversification prompts led to recommending newer movies, offering broader genre distribution compared to traditional collaborative filtering (CF) models. The second experiment explores sequential ICL, comparing zero-shot and few-shot ICL. Results indicate that including user demographic information in prompts affects model biases and stereotypes. However, ICL did not consistently improve item fairness and catalog coverage over zero-shot learning. Zero-shot learning achieved higher NDCG and coverage, while ICL-2 showed slight improvements in hit rate (HR) when age-group context was included. Our study provides insights into biases of RecLLMs, particularly in provider fairness and catalog coverage. By examining prompt design, learning strategies, and system roles, we highlight the potential and challenges of integrating LLMs into recommendation systems. Further details can be found at https://github.com/yasdel/Benchmark_RecLLM_Fairness.
研究の動機と目的
- プロンプト設計戦略がChatGPTベースのレコメンデーションシステムにおける推薦品質に与える影響を調査すること。
- GPTベースのモデルと従来の協調フィルタリング(CF)ベースラインとの間で、精度、公平性、多様性、時間的安定性の観点から性能を比較すること。
- プロンプトにユーザー評価を含めることによる推薦のパーソナライゼーションおよび信頼性への影響を分析すること。
- GPTベースのモデルが、CFモデルと比較してなぜ新しい映画や多様なジャンルを好むのかを理解すること。
- 制約付きプロンプト、少数-shot学習、ハイブリッドRAGフレームワークを用いた手法によるRecLLM性能の向上機会を同定すること。
提案手法
- ロールベースのプロンプト(例:「あなたは公平なレコメンダーです」)や推論パラダイム(例:Chain-of-Thought)を含む、多様なプロンプト設計戦略を採用した。
- パーソナライゼーションへの影響を評価するため、ユーザー評価なし(implicit)と評価あり(explicit)のプロンプト状況を比較評価した。
- NDCG、Recall、プロバイダーの公平性、ジャンルの多様性、および時間的新鮮度(2000年以降の映画への好まれる傾向)といった複数の指標を用いて、推薦結果を比較した。
- 複数回の実行における性能の統計的安定性を評価するために信頼区間を用いた。
- GPTの出力を事前に定義されたテストセットのアイテムに限定することで、データセットの境界内での精度と関連性を評価した。
- 将来の統合として、GPTとCFをRetrieval-Augmented Generation(RAG)フレームワークを用いて統合し、パーソナライゼーションと探索のバランスを取ることを提案した。

実験結果
リサーチクエスチョン
- RQ1異なるプロンプト設計戦略は、GPTベースの映画レコメンデーションシステムにおける公平性、多様性、精度にどのように影響するか?
- RQ2GPTベースのモデルは、新しい映画や多様なジャンルの映画を推薦する際に、従来の協調フィルタリングモデルをどの程度凌駆するか?
- RQ3プロンプトに明示的なユーザー評価を含めることで、GPTベースの推薦の安定性と精度にどのような影響が生じるか?
- RQ4なぜGPTベースのモデルは『ドラマ』や『コメディ』、『ロマンス』といったジャンルを好むのか、『アクション』や『アドベンチャー』よりも好まれるのか?
- RQ5プロンプトの制約と少数-shot学習を用いることで、GPTベースの推薦の関連性と精度をどのように向上させられるか?
主な発見
- ロールベースのプロンプトは、レコメンダーにおけるプロバイダーの公平性と多様性を顕著に向上させ、人気バイアスの緩和に効果的であった。
- 「Include-rating」GPTモデルは、NDCGが0.013230、Recallが0.014721を記録し、他のGPTベースのシナリオを上回る最高の性能を示した。
- GPTベースのモデルは、特に2000年以降に公開された映画を強く好む傾向を示しており、推薦の時間的新鮮さが顕著に表れた。
- GPTモデルは『ドラマ』、『コメディ』、『ロマンス』へのジャンルバイアスを示したが、これはトレーニングデータが最近の文化的トレンドにさらされた結果、CFモデルとは対照的に『アクション』や『アドベンチャー』を好まない傾向に起因していると考えられる。
- Chain-of-Thought(COT)とシンプルプロンプト戦略が、全テスト済みのGPTベースのアプローチの中で最も高い精度を達成した。
- 「Include-rating」モデルにおけるNDCG(0.009737–0.017012)およびRecall(0.010261–0.019795)の信頼区間は、その性能が堅牢で信頼できるものであることを裏付けた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。