[論文レビュー] The Turking Test: Can Language Models Understand Instructions?
本稿では、大規模言語モデルが自然言語の指示を理解し、それに従う能力を評価するためのベンチマーク「ターキング・テスト」を紹介する。評価は緩めであり、繰り返しの指示の最適化が行われたが、GPT-2はn番目の単語を抽出するタスクでわずか2%の正確度にとどまり、n番目の文字を抽出するタスクでは1.3%にとどまり、微細なタスクですら指示に従う能力に欠けることが示された。
Supervised machine learning provides the learner with a set of input-output examples of the target task. Humans, however, can also learn to perform new tasks from instructions in natural language. Can machines learn to understand instructions as well? We present the Turking Test, which examines a model's ability to follow natural language instructions of varying complexity. These range from simple tasks, like retrieving the nth word of a sentence, to ones that require creativity, such as generating examples for SNLI and SQuAD in place of human intelligence workers ("turkers"). Despite our lenient evaluation methodology, we observe that a large pretrained language model performs poorly across all tasks. Analyzing the model's error patterns reveals that the model tends to ignore explicit instructions and often generates outputs that cannot be construed as an attempt to solve the task. While it is not yet clear whether instruction understanding can be captured by traditional language models, the sheer expressivity of instruction understanding makes it an appealing alternative to the rising few-shot inference paradigm.
研究の動機と目的
- 大規模言語モデルが、入力-出力例に依存するのではなく、自然言語の指示を理解し、それに従うことができるかどうかを調査すること。
- 自然言語の指示に基づく学習が、NLPにおける少数の例提示(few-shot prompting)の代替として実現可能かどうかを評価すること。
- 言語モデルが指示に明示された制約や条件をどれだけ正しく解釈できるかを評価すること。
- 指示理解が、少数の例提示よりも表現力が高く、一般化しやすいパラダイムであるかどうかを検討すること。
- 明確で構造化された指示に直面した際の、モデルの挙動における失敗パターンを同定すること。
提案手法
- 3つのタスクタイプ(データセットアノテーション(SNLI, SQuAD, NewsQA)、条件付き名詞リスト作成、インデックスによる要素抽出)を対象とした、指示従いをテストするベンチマーク「ターキング・テスト」を提案する。
- すべての実験で、Hugging Faceの実装を介してGPT-2(1.5Bパラメータ)を用い、グリーディデコードとヌクレアスサンプリング(p=0.9)の両方を適用する。
- 人間のフィードバックを用いた繰り返しの指示最適化により、明確さと性能を向上させ、事後的に最も高い性能を示した指示バージョンを選択する。
- 簡単なタスクには自動チェック、複雑なタスクには手動の人的評価を含む、緩めの評価戦略を採用する。
- 生成ごとに最大| x |+20トークンを許容し、EOSトークンで早期終了を実施。ヌクレアスサンプリングでは一貫した性能低下が見られたため、グリーディデコードでのみ評価を行う。
- GLUEの診断データセットから抽出した832文を対象とし、単語のインデックスは20まで、文字のインデックスは40までに制限する。
実験結果
リサーチクエスチョン
- RQ1GPT-2のような大規模言語モデルは、複雑度が増すタスクにおいても、自然言語の指示を理解し、正しく従うことができるか?
- RQ2基本的なタスクにおいて、指示に従う性能は、たとえば最も頻出する単語('the')を生成するような単純なベースライン(6.4%)と比べてどうか?
- RQ3明確に述べられた制約や条件を、モデルがどれほど無視するのか?
- RQ4モデル出力における繰り返しパターンは、指示の誤解やパースの失敗をどのように反映しているか?
- RQ5指示パラダイムは、少数の例提示パラダイムの厳密な一般化と見なせるか?また、どのような利点があるのか?
主な発見
- GPT-2は、文からn番目の単語を抽出するタスクで2.0%の正確度にとどまり、最も一般的な単語('the')を生成するベースライン(6.4%)よりも著しく低い。
- n番目の文字を抽出するタスクでは、1.3%の正確度にとどまり、最も頻出する文字('e')を生成するベースライン(13.8%)よりも著しく低い。
- n番目の単語出力の46%、n番目の文字出力の59%で、入力文や指示が繰り返されており、常に誤った答えとなっている。
- モデルは指示の表現に極めて敏感であることが示された:単語タスクと文字タスクでは、ほぼ同一の指示でも、繰り返しパターンが顕著に異なっていた。
- 明確に定義された正解が1つであるタスクよりも、オープンエンドなタスクの方が性能がよかった。これは、モデルが明確な制約に苦労していることを示している。
- 繰り返しの指示最適化と緩めの評価を行ったにもかかわらず、モデルは最も単純な指示でさえ理解できず、指示理解の根本的な制限が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。