Skip to main content
QUICK REVIEW

[論文レビュー] BERT memorisation and pitfalls in low-resource scenarios.

Michael Tänzer, Sebastian Ruder|arXiv (Cornell University)|Apr 16, 2021
Topic Modeling参考文献 24被引用数 4
ひとこと要約

本論文は、低リソースおよびノイズが多い設定下におけるBERTの記憶化と一般化を調査し、ラベルノイズに対しては頑健であるが、少サンプルおよびレアエンティティ認識では失敗することを発見した。これを解決するために、プロトタイプネットワークを組み合わせた新しいBERTベースのアーキテクチャを提案し、低リソース named entity recognition タスクにおける性能を顕著に向上させた。

ABSTRACT

State-of-the-art pre-trained models have been shown to memorise facts and perform well with limited amounts of training data. To gain a better understanding of how these models learn, we study their generalisation and memorisation capabilities in noisy and low-resource scenarios. We find that the training of these models is almost unaffected by label noise and that it is possible to reach near-optimal performances even on extremely noisy datasets. Conversely, we also find that they completely fail when tested on low-resource tasks such as few-shot learning and rare entity recognition. To mitigate such limitations, we propose a novel architecture based on BERT and prototypical networks that improves performance in low-resource named entity recognition tasks.

研究の動機と目的

  • 事前学習モデル(例:BERT)が低リソースおよびノイズが多い学習状況下で、どのように一般化し、事実を記憶するかを理解すること。
  • BERTが少サンプル学習およびレアエンティティ認識タスクにおいて示す限界を調査すること。
  • BERTが低リソース設定で失敗する問題を解決するために、BERTとプロトタイプネットワークを組み合わせた新しいアーキテクチャを提案すること。
  • 限られた例またはレアな例しか利用できない状況での named entity recognition における性能を向上させること。

提案手法

  • 提案モデルは、少サンプルのサポートセットからクラスプロトタイプを学習するためにBERTとプロトタイプネットワークを統合する。
  • サポートサンプルの平均プーリングにより、BERTの文脈的表現を入力としてクラスプロトタイプを計算する。
  • 分類のため、クエリ埋め込みとクラスプロトタイプ間のアテンションベースの類似度をモデルが計算する。
  • トレーニング中に、異なるクラスプロトタイプ間の分離を促進するために対照的損失が適用される。
  • エンドツーエンドで、少サンプルおよびレアエンティティ例を含む低リソース named entity recognition データセット上でアーキテクチャが微調整される。
  • BERT表現から導出されたプロトタイプ埋め込みを活用することで、効果的な少サンプルおよびゼロショット推論が可能になる。

実験結果

リサーチクエスチョン

  • RQ1低リソース設定下で高レベルのラベルノイズがかかる状況下で、BERTはどのように動作するか?
  • RQ2標準ベンチマークで優れた性能を示すにもかかわらず、なぜBERTは少サンプルおよびレアエンティティ認識で失敗するのか?
  • RQ3BERTとプロトタイプネットワークを組み合わせることで、低リソース named entity recognition における一般化性能が向上するか?
  • RQ4提案されたアーキテクチャは、低リソース状況下での記憶化の問題をどの程度軽減できるか?

主な発見

  • BERTはラベルノイズに対して強く頑健であり、極めてノイズの強いデータセットでもほぼ最適な性能を達成している。
  • この頑健性にもかかわらず、BERTは少サンプルおよびレアエンティティ認識タスクで一般化に失敗しており、低リソース設定における深刻な限界を示している。
  • 提案された BERT-プロトタイプネットワークアーキテクチャは、低リソース named entity recognition ベンチマークにおける性能を顕著に向上させた。
  • モデルは少サンプルおよびレアエンティティ認識で最先端の結果を達成し、標準的な微調整BERTよりも優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。