[論文レビュー] Are Emily and Greg Still More Employable than Lakisha and Jamal? Investigating Algorithmic Hiring Bias in the Era of ChatGPT
本研究では、GPT-3.5、Bard、Claudeの最先端大規模言語モデル(LLM)が、Bertrand & Mullainathan(2003)にインspiredされた再現可能な現地実験を基に、アルゴリズムによる採用タスクにおけるバイアスを評価している。人種および性別に関するバイアスは最小限であるが、妊娠状態および政治的帰属に関するバイアスは顕著であり、特にフルレジュメ分類において顕著で、LLMによる要約作成ではバイアスが低減されていることが判明した。
Large Language Models (LLMs) such as GPT-3.5, Bard, and Claude exhibit applicability across numerous tasks. One domain of interest is their use in algorithmic hiring, specifically in matching resumes with job categories. Yet, this introduces issues of bias on protected attributes like gender, race and maternity status. The seminal work of Bertrand & Mullainathan (2003) set the gold-standard for identifying hiring bias via field experiments where the response rate for identical resumes that differ only in protected attributes, e.g., racially suggestive names such as Emily or Lakisha, is compared. We replicate this experiment on state-of-art LLMs (GPT-3.5, Bard, Claude and Llama) to evaluate bias (or lack thereof) on gender, race, maternity status, pregnancy status, and political affiliation. We evaluate LLMs on two tasks: (1) matching resumes to job categories; and (2) summarizing resumes with employment relevant information. Overall, LLMs are robust across race and gender. They differ in their performance on pregnancy status and political affiliation. We use contrastive input decoding on open-source LLMs to uncover potential sources of bias.
研究の動機と目的
- 現代のLLMが、人種、性別、妊娠状態、政治的帰属といった保護属性に関して、アルゴリズムによる採用においてバイアスを継続しているかどうかを調査すること。
- Bertrand & Mullainathan(2003)の画期的な現地実験手法をLLMベースの採用システムに拡張し、バイアスの実証的評価を可能にすること。
- フルレジュメ分類とレジュメ要約タスクにおけるバイアスレベルを比較し、要約作成がバイアスを低減するかどうかを評価すること。
- LLM生成要約に含まれる感受性のある属性の保持状況を分析し、対照的デコードを用いてバイアスの原因となる言語的・構造的要因を同定すること。
- LLMの採用システムにおける監査を支援する方法論的フレームワークを提供し、規制適合性およびAI駆動型HRツールにおける公平性を促進すること。
提案手法
- 労働統計における性別比率の顕著な差が見られる3つの職業分野(IT、教員、建設)から、334件の匿名化済みレジュメからなるコーパスを構築した。
- 名前、性別、人種、妊娠状態、政治的帰属といった感受性のある属性をレジュメに付与し、「フラグ付き」バージョンを作成した。職業分野の真値は保持された。
- 2つのLLMタスクを適用した:(1) 分類プロンプトを用いたレジュメから職業分野への分類、(2) 要約プロンプトを用いたレジュメ要約作成。
- オープンソースLLMを用い、感受性のある属性フラグに対するモデルの反応を分析することで、バイアスの原因を特定する目的で対照的入力デコードを実施した。
- 等しい機会ギャップなどの指標を用いて公平性を評価し、保護属性グループ間の予測率の差を比較した。
- 観察されたバイアス差の統計的有意性を検証し、p-hackingを回避するため、事前に実験設定を明示した。
実験結果
リサーチクエスチョン
- RQ1最先端のLLMは、人種、性別、妊娠状態、政治的帰属といった保護属性に関して、レジュメを職業分野に分類する際、採用バイアスを示すか?
- RQ2フルテキストレジュメとLLM生成要約との間で、LLMベースのレジュメ分類におけるバイアスはどのように異なるか?
- RQ3妊娠状態や政治的帰属といった感受性のある属性が、LLM生成レジュメ要約にどの程度保持されているか?
- RQ4GPT-3.5、Bard、ClaudeといったLLM間で、バイアス行動に顕著な差が見られるか?
- RQ5対照的入力デコードを用いることで、レジュメ処理中のLLM出力におけるバイアスの具体的な言語的・構造的要因を同定できるか?
主な発見
- LLMは、フルレジュメ分類および要約タスクの両方において、人種および性別に関して最小限または統計的に有意なバイアスを示さなかった。
- Claudeは、妊娠状態または政治的帰属のフラグが付いたレジュメを分類する際、統計的に有意な等しい機会ギャップ(p < 0.05)を示した。
- GPT-3.5も妊娠および政治的帰属に関する測定可能なバイアスを示したが、Claudeほど顕著ではなかった。
- Bardは、感受性のある属性フラグ(例:妊娠、政治的帰属)が存在する場合、要約を生成できなかった。これは過剰なクリーニングまたはセーフティハードニングを示唆している。
- 感受性のある属性フラグは、LLM生成レジュメ要約の最大94%で保持されており、保護情報の高い漏洩が示唆された。
- バイアスは、フルレジュメ分類において、LLM生成要約の分類よりも常に顕著に高かった。これは、要約作成がバイアスの露出を低減する可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。