Skip to main content
QUICK REVIEW

[論文レビュー] Visually Grounded Continual Learning of Compositional Phrases

Xisen Jin, Junyi Du|arXiv (Cornell University)|May 2, 2020
Multimodal Machine Learning Applications参考文献 53被引用数 4
ひとこと要約

本論文は、変化するオブジェクト分布を伴うストリーミング視覚言語データから構成的フレーズを習得するための視覚的根拠付き連続学習ベンチマーク、VisCOLLを提案する。モデルはキャプション内のマスクされたトークンを予測するように学習するが、オブジェクト分布の変化に直面する。最先端の連続学習手法を用いても、モデルの性能向上は限定的で、新しいフレーズ構成への一般化能力も低く、連続学習設定下での構成的一般化における巨大な探索空間の課題を浮き彫りにしている。

ABSTRACT

Humans acquire language continually with much more limited access to data samples at a time, as compared to contemporary NLP systems. To study this human-like language acquisition ability, we present VisCOLL, a visually grounded language learning task, which simulates the continual acquisition of compositional phrases from streaming visual scenes. In the task, models are trained on a paired image-caption stream which has shifting object distribution; while being constantly evaluated by a visually-grounded masked language prediction task on held-out test sets. VisCOLL compounds the challenges of continual learning (i.e., learning from continuously shifting data distribution) and compositional generalization (i.e., generalizing to novel compositions). To facilitate research on VisCOLL, we construct two datasets, COCO-shift and Flickr-shift, and benchmark them using different continual learning methods. Results reveal that SoTA continual learning approaches provide little to no improvements on VisCOLL, since storing examples of all possible compositions is infeasible. We conduct further ablations and analysis to guide future work.

研究の動機と目的

  • 変化するオブジェクト分布を伴うストリーミング視覚言語データを用いて、人間のような連続的言語習得を模擬する。
  • 根拠付けられた言語理解における連続学習と構成的一般化の二重の課題を調査する。
  • 現実的で継続的に変化するデータセット(COCO-shift および Flickr-shift)を構築し、これらの課題をベンチマーク化する。
  • メモリ制約下で、既存の連続学習アルゴリズムが新しいフレーズ構成を学習する効果を評価する。
  • 失敗モードの分析を通じて、現在のアプローチの主な制限を特定し、今後の研究を導く。

提案手法

  • オブジェクト分布が段階的に変化するペアド画像キャプションデータのストリーム上でオンライン学習を実施する。
  • モデルの評価は、既存のものと新しい構成的フレーズを含むホールドアウトテストセットにおけるマスクトークン予測を通じて行う。
  • COCO-shift および Flickr-shift の2つのデータセットを、時間経過に伴うオブジェクト頻度および構成の制御された分布シフトを導入することで構築する。
  • ベンチマークでは、メモリベース、正則化ベース、リプレイベースの手法を含む、マルチモーダルトランスフォーマーをランダム初期化から訓練する連続学習アルゴリズムを用いる。
  • 多様性やフォールトリスクの高い例の保存を最適化するため、Balanced-sqrt および Balanced-forget といったメモリ管理戦略を導入する。
  • 性能は、過去の構成におけるパープレキシティと、新しい構成における正解率の両方で測定され、忘却と構成的一般化の両面を評価する。

実験結果

リサーチクエスチョン

  • RQ1最先端の連続学習アルゴリズムは、視覚的根拠付きのストリーミング言語学習設定において、崩壊的忘却を効果的に防げるか?
  • RQ2継続的に変化するデータストリームで学習したモデルは、未観測の名詞+形容詞や名詞+動詞の組み合わせといった新しい構成的フレーズにどの程度一般化できるか?
  • RQ3異なるメモリ管理戦略は、大規模な構成的フレーズ学習タスクにおける性能と忘却にどのように影響するか?
  • RQ4なぜ、記憶容量を増やしても、既存の連続学習手法は VisCOLL で性能向上を達成できないのか?
  • RQ5オフライン学習(1回のパス)は、構成的一般化においてオンライン連続学習を上回るか?

主な発見

  • 最先端の連続学習手法は、すべての可能なフレーズ構成を保存することが現実的でないため、VisCOLL においては記憶容量を増やしてもほとんど改善が見られない。
  • すべてのモデルで新しい構成の性能が著しく低下しており、構成一般化が依然として大きな課題であることが示された。
  • 驚くべきことに、オフライン学習(1パス)がオンライン連続学習を上回り、オンライン設定では既存のケースに過剰適合している可能性を示唆している。
  • 多様性を重視する戦略(Balanced-sqrt)は初期段階でのパフォーマンスを向上させるが、長期的には効果がない。一方、忘却リスクを重視する戦略(Balanced-forget)は効果がなかった。
  • マスクトークン予測の性能低下は、使用される基本語に強く依存しており、頻度の高い語(例:'black')は頻度の低い語(例:'big')よりも忘却が少ない傾向を示した。
  • 結果から、現在の連続学習アプローチは、可能なフレーズ組み合わせの指数的増加する探索空間を考慮すると、視覚的根拠付き言語学習における構成的一般化には不適切であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。