[論文レビュー] Despite "super-human" performance, current LLMs are unsuited for decisions about ethics and safety
この論文は、ETHICS-C-Sなどの倫理的推論ベンチマークで「超人的」な正確性を達成しているにもかかわらず、現在の大規模言語モデル(LLMs)が倫理的・安全に重要な意思決定には根本的に不適切であることを示している。著者らは、類似度プロンプティング(SimPrompting)と呼ばれる新しいプロンプティング戦略を用い、94.5%の正確性を達成(人間の性能を上回る)したが、LLMsが真の道徳的推論ではなく表面的な語彙的パターンに依存していることが判明した。その結果、敵対的言い換えや逆スケーリング、意味のない正当化でさえも、意思決定の理由を説明するようにプロンプトされた際には脆弱になる。
Large language models (LLMs) have exploded in popularity in the past few years and have achieved undeniably impressive results on benchmarks as varied as question answering and text summarization. We provide a simple new prompting strategy that leads to yet another supposedly "super-human" result, this time outperforming humans at common sense ethical reasoning (as measured by accuracy on a subset of the ETHICS dataset). Unfortunately, we find that relying on average performance to judge capabilities can be highly misleading. LLM errors differ systematically from human errors in ways that make it easy to craft adversarial examples, or even perturb existing examples to flip the output label. We also observe signs of inverse scaling with model size on some examples, and show that prompting models to "explain their reasoning" often leads to alarming justifications of unethical actions. Our results highlight how human-like performance does not necessarily imply human-like understanding or reasoning.
研究の動機と目的
- 高精度なLLMsが倫理的推論ベンチマークで人間と同様の理解を真正に持っているかどうかを調査すること。
- LLMsが入力シナリオの敵対的言い換えに対してどれほど頑健であるかを評価すること。
- スケーリングとチェーン・オブ・トゥーク・プロンプティングが、倫理的推論の失敗を改善するか悪化させるかを検討すること。
- 人間とLLMsの倫理的判断における誤りの系統的差異を明らかにすること。
- 高精度であっても、倫理的文脈における意思決定が信頼的または安全でないことを示すこと。
提案手法
- 入力シナリオとの語彙的オーバーラップに基づいて、コンテキスト例を選択する、類似度プロンプティング(SimPrompting)を導入する。
- GPT-3(2019年版および最新版)を用いてETHICS-C-Sデータセット上で予測を生成し、モデル間での性能を比較する。
- 正しくラベル付けされた例を敵対的に言い換えることで、予測ラベルを反転させつつも人間の理解可能性を維持する。
- 意思決定の根拠を説明するようにプロンプトした際のモデルの自信スコアと推論チェーンを評価する。
- Mechanical Turkを用いて人間の判断を収集し、人間とモデルの誤りパターンを比較する。
- 誤りの種類と正当化内容を分析し、架空の事実や倫理的に正当でない理屈の構築といった、LLMsの系統的失敗を特定する。
実験結果
リサーチクエスチョン
- RQ1LLMsが真の道徳的理解を持たずに、倫理的推論ベンチマークで『超人的』なパフォーマンスを達成できるか?
- RQ2入力シナリオの敵対的言い換えがLLMsの予測に与える影響は何か?また、人間の理解可能性は保持されるか?
- RQ3モデルサイズの増大が、特にエッジ・ケースにおいて、倫理的推論の信頼性を向上させるか、悪化させるか?
- RQ4チェーン・オブ・トゥーク・プロンプティングが、LLMsの倫理的推論をどれほど向上または歪曲させるか?
- RQ5LLMsが倫理的判断タスクで犯す誤りの種類は、人間が犯す誤りと系統的に異なるか?
主な発見
- SimPromptingを用いることで、GPT-3はETHICS-C-Sで94.5%の正確性を達成し、人間の性能(93.7% ± 0.6%)を上回った。
- モデルが正しく分類していたシナリオを言い換えると、予測ラベルが頻繁に反転したが、人間は言い換え後のバージョンを同一と判断した。
- 特定の例では、モデルサイズが増大するにつれて、誤った回答に対してより自信を持つようになった(逆スケーリング)。
- チェーン・オブ・トゥーク・プロンプティングは、明らかに誤った回答に対して、まぎれもなく妥当に聞こえるが事実誤りまたは倫理的に正当でない正当化を頻繁に生成した。
- 人間の誤りの主な原因は仮定の違い(44.2%)や単純なミス(10.9%および7.2%)であったが、LLMsの誤りは概念的推論ではなく語彙的パターンマッチングに起因していた。
- 『私は壮大な説教をしたことで、教会を炎上させた』といった極めて深刻な害を伴うシナリオに対しても、モデルは架空の事実や正当でない理屈を生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。