[論文レビュー] Capturing Failures of Large Language Models via Human Cognitive Biases
この論文は、認知バイアスに触発された枠組みを用いて大規模言語モデルの定性的な故障モードを誘発し、Codex、CodeGen、および GPT-3 に適用し、誤ってファイル削除するなどの高影響エラーを実証します。
Large language models generate complex, open-ended outputs: instead of outputting a class label they write summaries, generate dialogue, or produce working code. In order to asses the reliability of these open-ended generation systems, we aim to identify qualitative categories of erroneous behavior, beyond identifying individual errors. To hypothesize and test for such qualitative errors, we draw inspiration from human cognitive biases -- systematic patterns of deviation from rational judgement. Specifically, we use cognitive biases as motivation to (i) generate hypotheses for problems that models may have, and (ii) develop experiments that elicit these problems. Using code generation as a case study, we find that OpenAI's Codex errs predictably based on how the input prompt is framed, adjusts outputs towards anchors, and is biased towards outputs that mimic frequent training examples. We then use our framework to elicit high-impact errors such as incorrectly deleting files. Our results indicate that experimental methodology from cognitive science can help characterize how machine learning systems behave.
研究の動機と目的
- コードや言語モデルのようなオープンエンド生成システムの信頼性の課題を調べることで研究の動機づけを行う。
- 認知バイアスに基づく方法論を導入し、定性的なエラーモードを仮説検証する。
- Codex、CodeGen、および GPT-3 全体で故障モードを喚起・特徴づけることでフレームワークを実証する。
- フレーミング、アンカリング、可用性、属性置換バイアスが高影響エラーを引き起こす可能性を示す。
提案手法
- 認知バイアスを、意味を保ちながら標的とする故障を誘発するプロンプト変換へと翻訳する。
- 変換後の機能的精度の低下によってモデル感度を測定する。
- 出力が対象の故障の明示的な指標を示すかを確認する(例:無関係な情報への依存、アンカリング効果)。
- フレーミング、アンカリング、可用性ヒューリスティック、属性置換を codemodels および GPT-3 に適用して特定のエラーを喚起する。
- ブラックボックスのプロンプトベースのアプローチを使用する。訓練データやモデルパラメータへのアクセスは不要。
実験結果
リサーチクエスチョン
- RQ1認知バイアスは、オープンエンド生成モデルにおける定性的な故障モードについての仮説を導く動機となり得るか?
- RQ2フレーミング、アンカリング、可用性、属性置換に触発されたプロンプト変換は、Codex、CodeGen、GPT-3 における特定の故障を体系的に明らかにするか?
- RQ3このフレームワークを通じて高影響エラー(例:破壊的なコード挙動)を見つけ出すことができるか?
主な発見
- コード生成モデル(Codex と CodeGen)は、フレーミングされたり、アンカリングされたり、関連しているが不正確なプロンプトと提示されたときに、無関係なプロンプト情報に依存する。
- アンカリングと可用性に触発されたプロンプトは、関連する解法や訓練データの頻度パターンへと出力を偏らせ、精度を低下させる。
- 属性置換プロンプトは、生成された解を偏らせる簡単なヒューリスティックス(例:関数名の使用)を明らかにする。
- GPT-3 は人間と類似した定性的なフレーミングとアンカリング効果を示し、フレーミング下で推定値や選択の予測可能なシフトを裏付ける。
- このフレームワークは、Codex におけるファイル削除のような高影響エラーを体系的に生成できる,危険な不正行為の可能性を浮き彫りにする。
- 全体として、認知科学に基づく実験的方法論は、オープンエンドなMLシステムの定性的な故障を特徴づける実用的でモデル非依存の方法を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。