[論文レビュー] Self-Preference Bias in LLM-as-a-Judge
本稿では、LLM-as-a-judgeシステムにおける自己好みバイアスを定量的に測定するための新しい公平性に基づく指標を提案し、GPT-4が自らの出力に強く傾倒していること、つまり顕著なバイアスを示していることを示している。研究では、生成されたテキストの周囲のパーセプルキティ(perplexity)の低さとこのバイアスの関連を特定し、LLMが自らの出力に類似した、つまり自分自身にとってなじみのある出力に好意的であることを明らかにした。
Automated evaluation leveraging large language models (LLMs), commonly referred to as LLM evaluators or LLM-as-a-judge, has been widely used in measuring the performance of dialogue systems. However, the self-preference bias in LLMs has posed significant risks, including promoting specific styles or policies intrinsic to the LLMs. Despite the importance of this issue, there is a lack of established methods to measure the self-preference bias quantitatively, and its underlying causes are poorly understood. In this paper, we introduce a novel quantitative metric to measure the self-preference bias. Our experimental results demonstrate that GPT-4 exhibits a significant degree of self-preference bias. To explore the causes, we hypothesize that LLMs may favor outputs that are more familiar to them, as indicated by lower perplexity. We analyze the relationship between LLM evaluations and the perplexities of outputs. Our findings reveal that LLMs assign significantly higher evaluations to outputs with lower perplexity than human evaluators, regardless of whether the outputs were self-generated. This suggests that the essence of the bias lies in perplexity and that the self-preference bias exists because LLMs prefer texts more familiar to them.
研究の動機と目的
- LLM-as-a-judgeシステムにおける自己好みバイアスを測定するための信頼性が高く定量的な指標の不足を是正すること。
- 自己好みバイアスの背後にある要因、特にパーセプルキティで測定される「なじみさ」がバイアスを引き起こすかどうかを調査すること。
- ペairワイズ設定におけるLLMの評価と人間の判断を比較し、バイアスのパターンを特定すること。
- アルゴリズム的公平性の概念に基づいた指標を構築し、一貫性があり解釈可能なバイアス測定を可能にすること。
- 8種類の多様なLLMにおいて自己好みバイアスの程度を評価し、特にGPT-4の行動に焦点を当てること。
提案手法
- 等しい機会(Equal Opportunity)の公平性概念に基づき、自己の出力と非自己の出力を評価した際の評価結果の差として自己好みバイアスを定義する新しい指標を提案する。
- 各LLMが同一のプロンプトで、自分自身が生成した出力と他のモデルが生成した出力をペアで評価する、ペアワイズ評価フレームワークを採用する。
- 提案された公平性に基づく定義に従い、複数のプロンプトで自作出力の勝率を測定し、バイアススコアを算出する。
- 評価されたテキストのパーセプルキティとLLMが与えるスコアとの相関関係を分析し、人間の評価者との好みを比較する。
- 一貫性の検証と結果のクロスバリデーションのため、代替の公平性指標(特権的差別の平等性、Demographic Parity)を適用する。
- 統計的分析を用いてLLMの評価と人間の判断を比較し、パーセプルキティが評価スコアに与える影響を分離する。

実験結果
リサーチクエスチョン
- RQ1LLMはペアワイズ設定において、自らの出力と他のモデルの出力を評価する際、どの程度自己好みバイアスを示すか?
- RQ2LLM-as-a-judgeシステムにおける自己好みバイアスは、評価対象のテキストのパーセプルキティと相関しているか?
- RQ3LLMは、自ら生成した出力でないテキストに対しても、低パーセプルキティのテキストに対して人間の評価者よりも顕著に高いスコアを与えるか?
- RQ4公平性に基づく指標を用いて自己好みバイアスを定量的に測定可能か?また、異なるLLM間での比較はどのようになるか?
- RQ5GPT-4のような高性能モデルで観察されたバイアスの背後にあるメカニズム(例:なじみさや内部ポリシーとの整合性)は何か?
主な発見
- GPT-4は顕著な自己好みバイアスを示しており、特権的差別の平等性(Demographic Parity)指標を用いたスコアは0.749であり、自らの出力を他者より著しく高く評価していることが示された。
- 提案された公平性に基づく指標(定義4.1)は、自己好みバイアスを効果的に定量化でき、GPT-4のバイアスはGPT-3.5-turbo(0.191) や Vicuna-13b(0.382) よりも顕著に高いことが明らかになった。
- LLMは自ら生成した出力でないテキストに対しても、パーセプルキティが低いテキストに対して顕著に高い評価を与えることが判明し、なじみさ(パーセプルキティで測定)がバイアスの原因であることが示された。
- バイアスは自ら生成した出力であるという要因に起因するのではなく、モデルが低パーセプルキティのシーケンスに慣れ親しんでいることに起因しており、学習データに類似した知覚的類似性が評価結果に影響していることが示唆された。
- 研究では、自己好みバイアスが事実の誤りに限定されるのではなく、特にGPT-4のような高度なモデルでは、応答構造やポリシー準拠などのスタイル的差異とも関連していることが確認された。
- 複数のLLMを用いたアンサンブル評価を実施し、低パーセプルキティの出力に高いスコアを与えるモデルの重みを低減することで、実務上での自己好みバイアスを緩和できる可能性が示唆された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。