[論文レビュー] Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark
本稿では、最小限のトレーニングを受けるクラウドワーカーを用いて、GLUEベンチマークにおける保守的な人間のパフォーマンスベースラインを提供し、平均スコア87.1を達成した。これは、9つのタスクのうち6つでBERT(80.5)およびBigBird(83.9)を上回った。しかし、その性能差はわずかであり、今後の進歩の余地が限られ、ニューラルモデルの低リソース学習における挑戦を浮き彫りにしている。
The GLUE benchmark (Wang et al., 2019b) is a suite of language understanding tasks which has seen dramatic progress in the past year, with average performance moving from 70.0 at launch to 83.9, state of the art at the time of writing (May 24, 2019). Here, we measure human performance on the benchmark, in order to learn whether significant headroom remains for further progress. We provide a conservative estimate of human performance on the benchmark through crowdsourcing: Our annotators are non-experts who must learn each task from a brief set of instructions and 20 examples. In spite of limited training, these annotators robustly outperform the state of the art on six of the nine GLUE tasks and achieve an average score of 87.1. Given the fast pace of progress however, the headroom we observe is quite limited. To reproduce the data-poor setting that our annotators must learn in, we also train the BERT model (Devlin et al., 2019) in limited-data regimes, and conclude that low-resource sentence classification remains a challenge for modern neural network approaches to text understanding.
研究の動機と目的
- 非専門家のクラウドワーカーを用いて、GLUEベンチマークにおける人間パフォーマンスの信頼性が高く保守的な推定値を確立すること。
- ニューラルモデルが文理解タスクにおいて人間のパフォーマンスを上回る余地が依然としてあるかどうかを評価すること。
- 限定的なトレーニングデータがBERTのパフォーマンスに与える影響、特に低リソース環境における影響を評価すること。
- WNLIのようなタスクが、人間のパフォーマンスが高水準であるにもかかわらず、なぜニューラルモデルにとって困難であるのかを調査すること。
提案手法
- クラウドワーカーは各GLUEタスクの概要と20例の例示を短時間で提示され、その後、テストセットのランダムサブセットをラベル付けした。
- 各例に対して5名のアノテーターがラベル付けを行い、多数決によるラベルを用いて人間パフォーマンススコアを算出した。
- 人間パフォーマンスは、完全なトレーニングセットで微調整されたBERTおよびBigBirdモデルと比較され、差分(デルタ)として報告された。
- 低リソースパフォーマンスを評価するために、縮小されたデータレジーム(5k、1k、500例)で追加のBERT微調整実験が実施された。
- 標準的なGLUEメトリクス(正解率、F1スコア、マシューフェアコリレーション、ピアソン・スピアマン相関)を用いてパフォーマンスを評価した。
- 5名のアノテーターが合意した例のサブセットを分析し、人間の信頼性および高合意度ケースにおけるモデルパフォーマンスを評価した。
実験結果
リサーチクエスチョン
- RQ1GLUEベンチマークにおける人間パフォーマンスは、BERTやBigBirdなどの最先端ニューラルモデルと比べてどのように異なるか?
- RQ2GLUEタスクにおける人間と機械のパフォーマンスの差は、どの程度の余地があるか?
- RQ3BERTが限定的なトレーニングデータで微調整された場合、パフォーマンスはどの程度低下するのか?これは低リソースNLPにどのような示唆をもたらすか?
- RQ4WNLIのようなタスクが、人間のパフォーマンスが高いにもかかわらず、なぜニューラルモデルにとって困難なままであるのか?
- RQ5MRPC や QQP のようなタスクにおいて、曖昧または不正確なアノテーションガイドラインが人間およびモデルのパフォーマンスに与える影響はどの程度か?
主な発見
- GLUEベンチマーク全体における人間パフォーマンスの平均は87.1であり、BERTの80.5およびBigBirdの83.9を上回った。
- 9つのタスクのうち6つでクラウドワーカーのパフォーマンスがBERTおよびBigBirdを上回った。特にSST-2(97.8 vs. 94.9)、QNLI(91.2 vs. 92.7)、RTE(93.6 vs. 70.1)で顕著だった。
- 低リソース環境ではBERTのパフォーマンスが著しく低下した。500例のトレーニング例でのみ微調整した場合、CoLAでは68.5、MRPCでは37.2を記録し、人間のパフォーマンスを下回った。
- CoLA(Δ = 6.6)、MRPC(Δ = 5.9)、QQP(Δ = 5.1)、WNLI(Δ = 30.8)において、BERTと人間のパフォーマンス差が拡大した。これは、BERTが洗練された理解を要するタスクに苦戦していることを示している。
- 5名のアノテーターが合意したサブセットでは、CoLAで人間パフォーマンスは93.7、WNLIでは97.5に達したが、BERTはそれぞれ83.5および59.3にとどまり、高合意度・高難易度例においてBERTが失敗していることが明らかになった。
- BigBirdはほとんどのタスクでBERTを上回り、特にRTE(95.8* vs. 70.1)で顕著だった。これは、マルチタスク微調整が低データレジームにおいて有効であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。