[論文レビュー] Moral Foundations of Large Language Models
この論文は、大規模言語モデル(LLM)における道徳的バイアスを分析するために道徳基盤理論(MFT)を適用し、LLMが訓練データによって形作られる、一貫したイデオロギー連関型の道徳基盤(例:思いやり/害、忠誠心)を示していることを明らかにした。また、プロンプトによってこれらの道徳的重みを体系的に変更できることを示し、害を強調した場合に寄付行動が39%減少するなど、下流タスクへの顕著な影響を及ぼすことを示した。
Moral foundations theory (MFT) is a psychological assessment tool that decomposes human moral reasoning into five factors, including care/harm, liberty/oppression, and sanctity/degradation (Graham et al., 2009). People vary in the weight they place on these dimensions when making moral decisions, in part due to their cultural upbringing and political ideology. As large language models (LLMs) are trained on datasets collected from the internet, they may reflect the biases that are present in such corpora. This paper uses MFT as a lens to analyze whether popular LLMs have acquired a bias towards a particular set of moral values. We analyze known LLMs and find they exhibit particular moral foundations, and show how these relate to human moral foundations and political affiliations. We also measure the consistency of these biases, or whether they vary strongly depending on the context of how the model is prompted. Finally, we show that we can adversarially select prompts that encourage the moral to exhibit a particular set of moral foundations, and that this can affect the model's behavior on downstream tasks. These findings help illustrate the potential risks and unintended consequences of LLMs assuming a particular moral stance.
研究の動機と目的
- 大規模言語モデル(LLM)がインターネット規模の訓練データから特定の道徳基盤を内包・反映しているかどうかを調査すること。
- これらの道徳基盤が多様な会話的プロンプトや文脈において一貫しているかどうかを評価すること。
- 敵対的プロンプトが、リベラルまたはコンservativeな政治的イデオロギーに関連する特定の道徳的立場を取らせるようにLLMを操作できるかどうかを評価すること。
- このような道徳的操作が、寄付意思決定などのタスクにおける下流行動に及ぼす影響を測定すること。
- LLMが現実世界の応用において政治的または道徳的バイアスを強化・強制するリスクを浮き彫りにすること。
提案手法
- 5つの道徳的次元(思いやり/害、公正/不正、忠誠心/裏切り、権威/反逆、聖性/劣化)を評価する30項目のインベントリである道徳基盤質問票(MFQ)を採用し、LLMの道徳的次元をスコア化した。
- LLMのMFQへの反応を人間の心理的研究と比較し、道徳基盤の重みの類似性と相違点を同定した。
- 一貫性分析として、同じLLMに多様な会話的文脈を提示し、道徳基盤スコアの安定性をテストした。
- 特定の道徳基盤(例:思いやり/害、忠誠心)を強調させるように設計された敵対的プロンプトを用意した。
- 下流の対話ベースの寄付意思決定ベンチマークを用いて、これらの道徳的プロンプトの行動的影響を評価した。
- 道徳基盤の重み付けが寄付行動に与える影響を数量化し、プロンプトごとの寄付額の差を測定した。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、道徳基盤理論で測定された訓練データから派生する一貫した道徳基盤を示すのか?
- RQ2これらの道徳基盤は、さまざまな会話的プロンプトや文脈においてどれほど安定しているのか?
- RQ3敵対的プロンプトによって、LLMが特定の道徳基盤や政治的イデオロギーに適合させられる程度はどの程度か?
- RQ4プロンプトによる道徳基盤のシフトが、下流タスクにおける行動に測定可能な変化をもたらすのか?
- RQ5LLMが特定の道徳的立場を示し、かつその立場を操作可能であるという事実の倫理的含意は何か?
主な発見
- LLMは、GPT-3がリベラル政治的イデオロギーと一致する思いやり/害および公正に著しく偏った道徳基盤を示すなど、一貫した特定の道徳基盤へのバイアスを示している。
- LLMの道徳基盤スコアは、多様な会話的プロンプトにおいても比較的安定しており、内部的な道徳フレーミングの一貫性が示された。
- 敵対的プロンプトは、忠誠心/裏切りや聖性/劣化といった特定の道徳基盤を強調させるようにLLMを効果的にシフトでき、コンservativeな政治的ステイタスを模倣した。
- 害の基盤を優先させるようにプロンプトした場合、LLMは忠誠心を強調した場合と比較して、寄付タスクで39%少ない寄付を行った。
- LLMの道徳バイアスは、質問票への反応を超えて、下流タスクにおける行動に直接影響を与えることが判明し、現実世界の行動的結果を示している。
- 強化学習による安全性の最適化を経た微調整済みLLMは、MFQ反応において感受性が低下し、人間の分布とは乖離した結果を示し、バイアスの測定を複雑にしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。