[論文レビュー] Are Language Models Worse than Humans at Following Prompts? It's Complicated
この論文は、言語モデル(LMs)が人間のようにプロンプトに従えないという仮定に挑戦し、先行するLM研究で用いられた同様の病理的プロンプトを用いて人間の行動を実証的にテストする。その結果、LMと同様に不要なプロンプトを無視するが、誤解を招くプロンプトには忠実に従うことが判明。これは、人間がこのような指示を無意味とみなして拒否すると想定されるのとは対照的であり、人間とモデルの行動に欺瞞の下で顕著な乖離が生じることを示している。
Prompts have been the center of progress in advancing language models' zero-shot and few-shot performance. However, recent work finds that models can perform surprisingly well when given intentionally irrelevant or misleading prompts. Such results may be interpreted as evidence that model behavior is not "human like". In this study, we challenge a central assumption in such work: that humans would perform badly when given pathological instructions. We find that humans are able to reliably ignore irrelevant instructions and thus, like models, perform well on the underlying task despite an apparent lack of signal regarding the task they are being asked to do. However, when given deliberately misleading instructions, humans follow the instructions faithfully, whereas models do not. Our findings caution that future research should not idealize human behaviors as a monolith and should not train or evaluate models to mimic assumptions about these behaviors without first validating humans' behaviors empirically.
研究の動機と目的
- 先行研究が言語モデルが人間のようにプロンプトに従えないという仮定を検証するために、人間の行動を実証的にテストすること。
- 人間が、言語モデルの行動評価で想定されているように、無関係または誤解を招くプロンプトを一貫して無視できるかどうかを調査すること。
- 人間らしくプロンプトに従うことが、言語モデルの評価の有効なベンチマークであるという仮定に挑戦すること。
- 人間の行動をモデル評価の基準として用いる前に、その実証的妥当性を強調すること。
提案手法
- Webson & Pavlick (2022) の実験設定を改変し、同じNLIおよび共参照解決タスクにおいて、指示的、誤解を招く、無関係、およびヌルプロンプトを用いて人間のパフォーマンスをテストした。
- 参加者にゼロショットおよびフェイワショット実験を実施し、事前のNLP経験に関する制御を設けた。
- 先行するLM研究と同一のプロンプトカテゴリ(指示的、誤解を招く、無関係、ヌル)を用いて、直接的な比較を可能にした。
- 参加者の推論およびプロンプトの解釈を理解するために、自由記述回答を収集した。
- プロンプトタイプごとのパフォーマンスを比較し、同じ刺激に対して人間の正確性とモデルのパフォーマンスを分析した。
- プロンプトタイプごとの人間のパフォーマンスに有意な差が生じるかどうかを評価する統計的分析を実施した。
実験結果
リサーチクエスチョン
- RQ1先行するLM評価で想定されているように、誤解を招くプロンプトを与えられた場合、人間はNLIタスクでパフォーマンスを低下させるか?
- RQ2人間は、言語モデルが行うのと同様に、無関係なプロンプトを一貫して無視できるか?
- RQ3人間は誤解を招くプロンプトを、言語モデルと同様に解釈・従うのか、それとも無意味とみなして拒否するのか?
- RQ4NLPタスクへの事前の露出が、病理的プロンプトに対する人間のパフォーマンスにどのように影響するか?
- RQ5人間のプロンプト解釈は、意図されたタスクと一致するのか、それとも表面的な語彙的キーワードに依存するのか?
主な発見
- 人間は、指示的プロンプトと同程度に、無関係なプロンプトを用いたNLIタスクでもほぼ同等のパフォーマンスを示しており、不要な内容を無視できることを示している。
- 誤解を招くプロンプトを与えられた場合、人間は顕著にパフォーマンスを低下させる—これは、人間がこのようなプロンプトを無意味とみなして拒否すると想定されるのとは対照的である。
- 表面的な指示が別のタスク(例:文法的正しさ)を示唆している場合でさえ、人間は誤解を招くプロンプトに忠実に従う。
- 誤解を招くプロンプトのパフォーマンスは、参加者の表面的タスクの解釈と強く相関しており、本質的なNLI論理とは無関係である。
- NLP経験のない参加者でさえ、誤解を招くプロンプトでパフォーマンスが著しく低下しており、これは分野特有の知識によるものではないことを示している。
- 自由記述回答の分析から、多くの参加者が誤解を招くプロンプトを別のタスク(例:文法的正しさや言い換え)を求めていると解釈しており、その結果、実際のNLIタスクに対して誤った回答をしたことが判明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。