[論文レビュー] CAPT: Contrastive Pre-Training for Learning Denoised Sequence Representations
CAPTは、元の入力シーケンスと汚染された入力シーケンスの間で意味的整合性を強制することで、ノイズに不変なシーケンス表現を学ぶ対照的事前学習フレームワークを提案する。インスタンス単位の対照的損失を適用することで、事前学習と微調整の乖離を低減し、グローバルな意味的モデリングを向上させ、自然言語処理およびビジョン・ランゲージタスクの両方でGLUEで0.6%、NLVR²で0.8%の一貫した向上を達成した。
Pre-trained self-supervised models such as BERT have achieved striking success in learning sequence representations, especially for natural language processing. These models typically corrupt the given sequences with certain types of noise, such as masking, shuffling, or substitution, and then try to recover the original input. However, such pre-training approaches are prone to learning representations that are covariant with the noise, leading to the discrepancy between the pre-training and fine-tuning stage. To remedy this, we present ContrAstive Pre-Training (CAPT) to learn noise invariant sequence representations. The proposed CAPT encourages the consistency between representations of the original sequence and its corrupted version via unsupervised instance-wise training signals. In this way, it not only alleviates the pretrain-finetune discrepancy induced by the noise of pre-training, but also aids the pre-trained model in better capturing global semantics of the input via more effective sentence-level supervision. Different from most prior work that focuses on a particular modality, comprehensive empirical evidence on 11 natural language understanding and cross-modal tasks illustrates that CAPT is applicable for both language and vision-language tasks, and obtains surprisingly consistent improvement, including 0.6\% absolute gain on GLUE benchmarks and 0.8\% absolute increment on $ ext{NLVR}^2$.
研究の動機と目的
- 自己教師付き事前学習におけるノイズに依存する表現によって引き起こされる事前学習と微調整の乖離を解消すること。
- より効果的な文単位の監督を導入することで、グローバルな意味的モデリングを向上させること。
- 自然言語処理およびビジョン・ランゲージタスクの両方に適用可能な汎用的な事前学習手法を開発すること。
- 位置依存の監督(例:次文予測)に依存することを減らし、弱いか紛らわしい勾配を生じさせることを避けること。
- マスキングやシャッフルなどの一般的な汚染操作に対して不変な表現を学習できるようにすること。
提案手法
- 入力シーケンスに標準的な汚染操作(例:マスキング)を適用して汚染されたバージョンを生成する。
- 事前学習済みモデル(例:BERT、RoBERTa)を用いて、元のシーケンスおよび汚染されたシーケンスを隠れ表現にエンコードする。
- グローバルなシーケンスレベルの表現を取得するために、アグリゲーション層(例:平均プーリングまたは分類トークン)を適用する。
- 同じインスタンス(元のシーケンスと汚染されたシーケンス)の表現を埋め込み空間内で近づける対照的損失を定式化する。
- 異なるインスタンス(ネガティブペア)の表現を離すことで、識別的な特徴抽出を促進する。
- ノイズに集中した特徴および多様な特徴の学習を向上させる2つの補助手法を導入し、モデルの頑健性と一般化性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1対照的学習は、自己教師付き事前学習におけるノイズに依存する表現によって引き起こされる事前学習と微調整の乖離を低減できるか?
- RQ2インスタンス単位の対照的監督は、トークンレベルやセグメントレベルのタスクと比較して、グローバルな意味的モデリングを向上させられるか?
- RQ3提案されたCAPTフレームワークは、自然言語処理およびビジョン・ランゲージタスクの両方で汎用的に適用可能か?
- RQ4下流タスクのパフォーマンスの観点から、CAPTは標準的な事前学習目的(例:MLM、MRM)と比較して優れているか?
- RQ5CAPTは、訓練コストを著しく増加させることなく、モデルの頑健性と一般化性能を向上させられるか?
主な発見
- CAPTは、RoBERTaのGLUE開発セットパフォーマンスを88.9%から89.5%に向上させ、0.6%の絶対的向上を達成した。
- NLVR²ベンチマークでは、LXMERTを0.8%上回り、ビジョン・ランゲージ理解において顕著な向上を示した。
- CAPTは、8つのNLUおよび3つのクロスモーダルタスクを含む11の多様なタスクで一貫した向上を達成した。
- マスキングなどの一般的な汚染操作に対して不変な表現を学習することで、事前学習と微調整の乖離を低減した。
- 次文予測のような位置依存タスクよりも強い文単位の監督を提供することで、グローバルな意味的モデリングを強化した。
- 対照的損失により、追加のラベル付きデータを必要とせず、訓練コストを著しく増加させることなく、より良い特徴抽出が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。