Skip to main content
QUICK REVIEW

[論文レビュー] PnPOOD : Out-Of-Distribution Detection for Text Classification via Plug andPlay Data Augmentation

Mrinal Rawat, Ramya Hebbalaguppe|arXiv (Cornell University)|Oct 31, 2021
Anomaly Detection Techniques and Applications被引用数 6
ひとこと要約

PnPOODは、クラス境界付近に高品質なOODサンプルを生成するためのプラグアンドプレイ型データ拡張手法を提案する。この手法は、Plug and Play Language Model (PPLM) を用いて、テキスト分類における分布外(OOD)検出の性能とモデルのキャリブレーションを著しく向上させ、SSTおよび20 Newsgroupデータセットで先行手法を上回る性能を示す。また、既存ベンチマークにおけるデータ漏洩問題に対処する。

ABSTRACT

While Out-of-distribution (OOD) detection has been well explored in computer vision, there have been relatively few prior attempts in OOD detection for NLP classification. In this paper we argue that these prior attempts do not fully address the OOD problem and may suffer from data leakage and poor calibration of the resulting models. We present PnPOOD, a data augmentation technique to perform OOD detection via out-of-domain sample generation using the recently proposed Plug and Play Language Model (Dathathri et al., 2020). Our method generates high quality discriminative samples close to the class boundaries, resulting in accurate OOD detection at test time. We demonstrate that our model outperforms prior models on OOD sample detection, and exhibits lower calibration error on the 20 newsgroup text and Stanford Sentiment Treebank dataset (Lang, 1995; Socheret al., 2013). We further highlight an important data leakage issue with datasets used in prior attempts at OOD detection, and share results on a new dataset for OOD detection that does not suffer from the same problem.

研究の動機と目的

  • 対話型エージェントにおける意図分類を想定し、NLP分野における堅牢なOOD検出手法の不足を解消すること。
  • 訓練済みOOD分布とテスト済みOOD分布の重複によるデータ漏洩の問題に加え、モデルキャリブレーションの低さといった、先行OOD検出手法の限界を克服すること。
  • 高品質で境界に配備されたOODサンプルを生成する、プラグアンドプレイ型のデータ拡張ベースの手法を開発し、OOD検出性能を向上させること。
  • 20 Newsgroupデータセットから抽出したデータをもとに、データ漏洩のない新しいOODベンチマークデータセットを提供することで、公平な評価を実現すること。
  • 最先端手法と比較して、OOD検出指標(AUROC、AUPR)の優れた性能と、低減されたキャリブレーション誤差を示すこと。

提案手法

  • インドメイン(ID)テキスト埋め込みを条件として、Plug and Play Language Model (PPLM) を用いて分布外(OOD)サンプルを生成する。
  • トレーニング中にエントロピー正則化を適用し、OODサンプルが高エントロピーとなるよう促進することで、一様性に近づけ、識別能を向上させる。
  • ID分類器の意思決定境界付近に集中するOODサンプルを生成することで、検出感度を向上させる。
  • 最終的な検出スコアとしてMaximum Softmax Probability (MSP) を採用し、IDデータとPPLMで生成されたOODデータの両方を用いてモデルのファインチューニングを実施する。
  • Gutenbergなどの汎用OODデータセットに代えて、20 Newsgroupデータセットからドメイン特化されたOODデータを用いることで、データ漏洩を排除する。
  • さらに、期待キャリブレーション誤差(ECE)を低減するために、後処理型のディリクレキャリブレーションを適用する。

実験結果

リサーチクエスチョン

  • RQ1PPLMを用いたデータ拡張は、ID分類器の意思決定境界に近い高品質なOODサンプルを生成できるか?
  • RQ2提案手法PnPOODは、標準的なNLPベンチマーク上での先行最先端手法と比較して、OOD検出性能を向上させられるか?
  • RQ3PnPOODは、先行手法と比較して、モデルのキャリブレーション誤差をどの程度低減できるか?
  • RQ4先行OOD検出ベンチマークにおけるデータ漏洩の影響は何か?また、新しいベンチマークはこの問題を緩和できるか?
  • RQ5本手法は、ゼロショットOOD検出設定において、複数のドメイン組み合わせに一般化可能か?

主な発見

  • SST-2データセットにおいて、PnPOODは『Politics』ドメインのOODサンプル検出でAUROC 0.89、AUPR 0.51を達成し、最先端性能を記録した。
  • 20 Newsgroupデータセットでは、『Sports』および『Politics』ドメインのOODサンプル検出でAUROC 0.89、AUPR 0.51を達成し、MSPおよびMSP+ERベースラインを上回った。
  • 期待キャリブレーション誤差(ECE)は、MSPおよびMSP+ERベースラインと比較して最大30%低減され、モデルキャリブレーションの向上が確認された。
  • FPR@90TPRにおいて、PnPOODは『Politics』ドメインで0.31を達成し、MSP+ERの0.33を大きく上回った。
  • 著者らは、先行OODベンチマークに深刻なデータ漏洩問題が存在することを特定し、これを解消した。これにより、先行研究の結果がOODとIDデータの重複により誇張されている可能性が示された。
  • 後処理型ディリクレキャリブレーションによりECEがさらに低減され、PnPOODがキャリブレーション後のモデルでさえも良好にキャリブレートされることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。