[論文レビュー] On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning
この論文は、大規模言語モデルにおけるゼロショットチェーン・オブ・チョイス(CoT)プロンプティングの意図しない結果を調査し、モデルに「段階的に考える」ように促すことで、社会的に敏感なタスクにおいて偏見と有毒性が顕著に増加することを示している。研究では、CoT推論がステレオタイプや有毒な質問のベンチマークで有害な出力を拡大することを発見しており、特に大規模モデルで悪化し、価値の整合性を高めることでのみ緩和されることが分かった。
Generating a Chain of Thought (CoT) has been shown to consistently improve large language model (LLM) performance on a wide range of NLP tasks. However, prior work has mainly focused on logical reasoning tasks (e.g. arithmetic, commonsense QA); it remains unclear whether improvements hold for more diverse types of reasoning, especially in socially situated contexts. Concretely, we perform a controlled evaluation of zero-shot CoT across two socially sensitive domains: harmful questions and stereotype benchmarks. We find that zero-shot CoT reasoning in sensitive domains significantly increases a model's likelihood to produce harmful or undesirable output, with trends holding across different prompt formats and model variants. Furthermore, we show that harmful CoTs increase with model size, but decrease with improved instruction following. Our work suggests that zero-shot CoT should be used with caution on socially important tasks, especially when marginalized groups or sensitive topics are involved.
研究の動機と目的
- ゼロショットCoTプロンプティングが、一般的に推論の向上に用いられるが、社会的に感受的な文脈において意図しないバイアスや有毒な出力を引き起こすかどうかを調査すること。
- 複数のベンチマークとモデルバリアントを対象に、CoTがステレオタイプバイアスおよび有害行動生成に与える影響を評価すること。
- モデルの規模と指示従いの質が、CoTに起因するバイアスと有毒性の深刻さにどのように影響するかを分析すること。
- 改善された価値の整合性が、ゼロショットCoTプロンプティングの負の副作用を軽減できるかどうかを評価すること。
提案手法
- CrowS-Pairs、StereoSet、BBQの3つの既存バイアスベンチマークを、ゼロショット推論タスクに再定式化し、CoTプロンプティング下での表象バイアスを評価した。
- 有害な行動の実行手順を明示的に要求する質問を含む、HarmfulQと呼ばれる新しいベンチマークを構築し、推論出力における有毒性を評価した。
- 標準プロンプティングと『段階的に考える』というフレーズを用いたゼロショットCoTプロンプティングの2条件でのモデル出力を比較した。
- 複数のGPT-3バリアント(text-davinci-001からtext-davinci-003まで)を、異なるプロンプト形式とモデルサイズで評価し、バイアストレンドの一貫性を測定した。
- 失敗事例の定性的分析を実施し、定量的結果と、マイナリティグループに対する現実世界の表象的害悪を結びつけた。
- 指示従いの質と価値の整合性の向上がもたらす影響を、整合性の改善が施されたモデルとそうでないモデルを比較することで測定した。
実験結果
リサーチクエスチョン
- RQ1ゼロショットCoTプロンプティングは、社会的に感受的な推論タスクにおいて、有害または偏った出力を生成する確率を高めるか?
- RQ2モデルの規模は、ゼロショットCoTプロンプティングによって引き起こされるバイアスと有毒性の程度にどのように影響するか?
- RQ3改善された指示従いと価値の整合性は、CoTプロンプティングの負の副作用をどの程度軽減できるか?
- RQ4CoTに起因するバイアスを軽減しつつ、推論の利点を維持できるプロンプトのバリエーションは存在するか?
主な発見
- HarmfulQベンチマークにおいて、ゼロショットCoTプロンプティングは標準プロンプティングに比べて有害出力の可能性を19.4パーセンテージポイント上昇させた。
- CoT推論は、CrowS-Pairs、StereoSet、BBQベンチマーク全体で平均8.8パーセンテージポイントのステレオタイプ的推論の増加をもたらした。
- CoTに起因するバイアスと有毒性の深刻さは、モデルの規模が大きくなるにつれて増大し、特にtext-davinci-003のような大規模GPT-3バリアントで顕著だった。
- 価値の整合性が向上したモデルや明示的な緩和指示が施されたモデルでは、バイアスと有毒性が低減しており、整合性がCoTの副作用を相殺できることを示している。
- 異なるプロンプト形式においても、CoTの負の影響は一貫しており、これは問題が形式特有ではなく、システム的であることを示唆している。
- 定性的分析により、CoT推論が、最終的な答えが正しかろうと、しばしば有害なステレオタイプを強化する正当化や危険な行動を促す内容を生成することが判明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。