Skip to main content
QUICK REVIEW

[論文レビュー] Wisdom of Instruction-Tuned Language Model Crowds. Exploring Model Label Variation

Flor Miriam Plaza-del-Arco, Debora Nozza|arXiv (Cornell University)|Jul 24, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本稿では、5つの最先端の指令微調整済み言語モデルにおけるラベルのばらつきを、ゼロショットテキスト分類の性能向上を目的とした集団アノテーションの一種として活用する手法を提案する。ベイジアン重み付けを用いた予測値の集約—人間のコンSENSUSに類似—により、モデルアンサンブルは平均して個々のモデルよりも8.3 F1ポイント優れるが、単純な教師ありモデルでさえも下回る性能にとどまる。

ABSTRACT

Large Language Models (LLMs) exhibit remarkable text classification capabilities, excelling in zero- and few-shot learning (ZSL and FSL) scenarios. However, since they are trained on different datasets, performance varies widely across tasks between those models. Recent studies emphasize the importance of considering human label variation in data annotation. However, how this human label variation also applies to LLMs remains unexplored. Given this likely model specialization, we ask: Do aggregate LLM labels improve over individual models (as for human annotators)? We evaluate four recent instruction-tuned LLMs as annotators on five subjective tasks across four languages. We use ZSL and FSL setups and label aggregation from human annotation. Aggregations are indeed substantially better than any individual model, benefiting from specialization in diverse tasks or languages. Surprisingly, FSL does not surpass ZSL, as it depends on the quality of the selected examples. However, there seems to be no good information-theoretical strategy to select those. We find that no LLM method rivals even simple supervised models. We also discuss the tradeoffs in accuracy, cost, and moral/ethical considerations between LLM and human annotation.

研究の動機と目的

  • 複数の自然言語処理タスクにわたり、複数の大規模言語モデル(LLM)をゼロショットアノテーターとして用いる有効性を評価すること。
  • 人間のアノテーターの不一致に類似したLLM間のラベルばらつき—すなわち、予測の信頼性向上に活用可能な要因—が、どのように利用可能かを調査すること。
  • 複数の言語およびタスクにおいて、集約されたLLM予測の性能を個々のモデルおよび教師ありベースラインと比較すること。
  • LLMベースのアノテーションと人間アノテーションの間の、コスト、速度、正確性、バイアスのトレードオフを分析すること。
  • 特に感受性の高いまたは主観的なタスクにおいて、人間アノテーションをLLMアンサンブルに置き換えることの倫理的・実務的影響を検討すること。

提案手法

  • GPT-3.5、PaLM、Flan-T5を含む5つの最先端の指令微調整済みLLMを、ゼロショット設定で、事前に定義されたラベルにテキストを分類するようにプロンプトする。
  • 各モデルを独立したアノテーターとみなして、正解ラベルにアクセスせずに同じ入力に対して予測を生成する。
  • 正解ラベルが不要なように、推定された信頼性に基づいて個々のモデル予測を重み付けるベイジアンアノテーションモデルを適用する。
  • 集約手法には多数決投票とベイジアン分類器結合を用い、後者は耐性と正確性の向上に用いられる。
  • 5つのタスク—感情分析、トピック分類、年齢予測、性別予測、嫌がらせ発話検出—について、英語、フランス語、ドイツ語、スペイン語の多言語データセットを用いて評価する。
  • トレーニング分布外のデータを用いたホールドアウトテストセット(TrustpilotおよびHatEvalから)を用いて評価を行い、モデルが訓練データとは異なる分布のデータに対してテストされることを保証する。

実験結果

リサーチクエスチョン

  • RQ1複数の指令微調整済みLLMの予測値を集約することで、個々のモデルを上回るゼロショットテキスト分類性能を達成できるか?
  • RQ2モデルの性能は、異なるタスクや言語でどのように変動するか? また、特定のLLMが一貫して優れているか?
  • RQ3LLM間のラベルばらつきは、人間のアノテーターの不一致とどの程度類似しているか? そして、同様に活用可能か?
  • RQ4集約されたLLM予測の性能は、単純な教師ありモデルおよび人間アノテートベースラインと比べてどの程度か?
  • RQ5特にバイアスおよび人的労働の置き換えに関する観点から、人間アノテーションをLLMアンサンブルに置き換えることの倫理的・実務的影響は何か?

主な発見

  • どの単一のLLMも、すべてのタスク、言語、ラベルタイプで優れているわけではない。性能は顕著に変動し、一部のタスクではランダムベースラインでさえも下回るモデルがある。
  • ベイジアン重み付けを用いた集約予測は、タスク全体で平均して個々のモデルよりも8.3 F1ポイント優れることが示され、アンサンブル手法の価値が裏付けられた。
  • 最良の集約LLM性能でさえ、単純な教師ありモデルの性能を大きく下回っており、平均して10 F1ポイント以上の差がある。
  • リソースが乏しい言語(フランス語、ドイツ語など)では性能が著しく低下しており、現在の多言語一般化能力の限界が示された。
  • ラベル集約は一部の個々のモデルバイアスを軽減できるが、基礎となるモデルに共通して存在する広範なバイアスを完全に排除することはできない。
  • 本研究は、LLMの集約は人間アノテーションに比べてコスト効率が高く、迅速であるが、高精度かつ倫理的に責任あるNLPアプリケーションでは、依然として人間アノテーションが不可欠であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。