[論文レビュー] Reframing Human-AI Collaboration for Generating Free-Text Explanations
本稿では、GPT-3を活用して入力ごとに複数の自由形式の説明を生成し、その後に人間による承認フィルタを適用する「過剰生成・フィルタリング」パイプラインを提案する。このフィルタは二値判断に基づいて学習された人間による承認性を評価するものであり、人間の承認性に基づいて高品質な出力を選別することで、説明の質が著しく向上する。これは、直接のGPT-3出力やクラウドソーシングによる説明を上回る。本手法は、CommonsenseQAおよびSNLIの両データセットで優れた性能を示した。
Large language models are increasingly capable of generating fluent-appearing text with relatively little task-specific supervision. But can these models accurately explain classification decisions? We consider the task of generating free-text explanations using human-written examples in a few-shot manner. We find that (1) authoring higher quality prompts results in higher quality generations; and (2) surprisingly, in a head-to-head comparison, crowdworkers often prefer explanations generated by GPT-3 to crowdsourced explanations in existing datasets. Our human studies also show, however, that while models often produce factual, grammatical, and sufficient explanations, they have room to improve along axes such as providing novel information and supporting the label. We create a pipeline that combines GPT-3 with a supervised filter that incorporates binary acceptability judgments from humans in the loop. Despite the intrinsic subjectivity of acceptability judgments, we demonstrate that acceptability is partially correlated with various fine-grained attributes of explanations. Our approach is able to consistently filter GPT-3-generated explanations deemed acceptable by humans.
研究の動機と目的
- GPT-3が生成する説明が、自由形式の説明タスクにおいて人間が作成した説明を上回るかを調査すること。
- プロンプト工学がGPT-3が生成する説明の質を向上させられるかを検討すること。
- 人間の承認判断と相関する説明の細分化された特徴(例:独創性、ラベル支持力度)を同定すること。
- GPT-3の出力から高品質で承認可能な説明をスケーラブルに選別する、人間を含むフィルタリングメカニズムを開発すること。
- 少数の二値承認判断から学習可能な教師ありフィルタが、直接のGPT-3出力よりも性能を向上させられることを実証すること。
提案手法
- GPT-3を用いて、注意深く設計されたFew-shotプロンプトを用いて、各入力インスタンスに対して5つの候補説明を生成する。
- クラウドワーカーを対象に、生成された各説明について二値の承認判断を人間によるフィードバックを通じて収集する(人間を含むラベル付け)。
- 二値判断に基づいて、教師ありの承認分類器(例:T0-3B)を学習し、GPT-3の出力のうちどの説明が承認可能かを予測する。
- 学習済みフィルタを適用して、GPT-3の出力から最高品質の説明を選別し、パイプラインとして「過剰生成 → フィルタリング」を構築する。
- 人間による評価を用いて、フィルタの性能を承認性、事実的整合性、独創性、ラベル支持力度の観点から評価する。
- フィルタを用いて、CommonsenseQAおよびSNLIにおける説明レベルおよびインスタンスレベルの性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1人間の好みの選択において、GPT-3が生成する説明が、既存のクラウドソーシングによる説明を上回るか?
- RQ2プロンプトの質を向上させることで、GPT-3が生成する説明の質が向上するか?
- RQ3説明の細分化された特徴(例:独創性、ラベル支持力度)のうち、人間の承認判断と相関するものは何か?
- RQ4少数の二値承認判断から、GPT-3の出力から一貫して高品質な説明を選別できるフィルタを学習できるか?
- RQ5過剰生成・フィルタリングパイプラインは、直接のGPT-3出力よりも承認性やその他の質的次元を向上させるか?
主な発見
- 対面比較において、クラウドワーカーは60〜70%の割合でGPT-3が生成する説明を、既存のクラウドソーシングによる説明よりも好む傾向を示した。
- 高い文語的流暢さと文法的整合性を示しても、GPT-3がグリーディにデコードした説明のうち、100%の合意で承認可能なものは半数未満であった。
- 二値判断に基づいて学習された承認フィルタは、選別性能を著しく向上させ、CommonsenseQAの開発セットでは86.6%、テストセットでは87.0%のselect-1正答率を達成した。
- SNLIでは、開発セットで57.8%、テストセットで60.3%のselect-1正答率を達成し、強力なベースラインを上回った。
- フィルタリング済みの出力は、ラベル支持力度(CommonsenseQAで0.5から0.9に向上)と独創性(CommonsenseQAで0.3から0.6に向上)の両面で性能が向上した。
- パイプラインは一貫して人間が承認可能な説明を選別しており、複数のランダムシードおよびデータセットにわたり、フィルタの性能が安定していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。