Skip to main content
QUICK REVIEW

[論文レビュー] Improving Continual Relation Extraction through Prototypical Contrastive Learning

Chengwei Hu, Deqing Yang|arXiv (Cornell University)|Oct 10, 2022
Topic Modeling被引用数 12
ひとこと要約

本稿では、災難的忘却を軽減するため、分類ネットワークとプロトタイプ対照的ネットワークを組み合わせた新しい継続的関係抽出フレームワークであるCRECLを提案する。各インスタンスをすべての候補関係の学習済みプロトタイプと対照することで、CRECLはタスク間の特徴の識別性を向上させ、TACREDおよびFewRelにおいてSOTAベースラインを大きく上回る性能を達成する。

ABSTRACT

Continual relation extraction (CRE) aims to extract relations towards the continuous and iterative arrival of new data, of which the major challenge is the catastrophic forgetting of old tasks. In order to alleviate this critical problem for enhanced CRE performance, we propose a novel Continual Relation Extraction framework with Contrastive Learning, namely CRECL, which is built with a classification network and a prototypical contrastive network to achieve the incremental-class learning of CRE. Specifically, in the contrastive network a given instance is contrasted with the prototype of each candidate relations stored in the memory module. Such contrastive learning scheme ensures the data distributions of all tasks more distinguishable, so as to alleviate the catastrophic forgetting further. Our experiment results not only demonstrate our CRECL's advantage over the state-of-the-art baselines on two public datasets, but also verify the effectiveness of CRECL's contrastive learning on improving CRE performance.

研究の動機と目的

  • 新しい関係を学習する際、以前のタスクでモデル性能が低下する継続的関係抽出(CRE)における災難的忘却を解消すること。
  • 旧タスクと新タスクのデータ分布の分離性を向上させ、長期的なモデル性能を向上させること。
  • 過去のデータを再トレーニングせずに、新規関係を追加する実用的なクラスインクリメンタル学習を可能にすること。
  • 従来のメモリベースや正則化手法よりも、負の関係情報の効果的活用を可能にすること。
  • 知識の保持を安定化させつつ、現在のタスクでの精度を維持する対照的学習メカニズムを設計すること。

提案手法

  • 分類ネットワークと対照的ネットワークを統合し、関係分類と特徴の識別性を同時に最適化する。
  • 各関係の代表的インスタンス $ L $ 個の平均埋め込みとして、メモリモジュールに関係プロトタイプを保存し、K-meansクラスタリングで学習する。
  • 各入力インスタンスをすべての関係プロトタイプと対照することで、プロトタイプ対照的学習を適用し、クラス内凝集性とクラス間分離性を促進する。
  • 正例ペア(インスタンスとその真の関係プロトタイプ)を近づけ、負例ペアを遠ざけるように、対照損失 $ \\_\mathcal{L}_{contrast} $ を適用する。
  • 分類と対照の両ブランチでエンコーディングネットワークの重みを共有することで、一貫性を維持し、パrameterのオーバーヘッドを削減する。
  • 最適な予測と不適切な予測のギャップを広げるために、マージン損失 $ \\_\mathcal{L}_{mag} $ を適用し、一般化性能をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1プロトタイプ対照的学習は、継続的関係抽出における災難的忘却を効果的に軽減できるか?
  • RQ2対照的学習は、旧タスクと新タスクのデータ分布の分離性をどのように向上させるか?
  • RQ3提案されたCRECLフレームワークは、TACREDやFewRelといったベンチマークデータセットでSOTA手法を上回る性能を達成するか?
  • RQ4メモリサイズ $ L $ やプロトタイプ選択戦略に、CRECLの性能はどれほど敏感か?
  • RQ5対照的学習は、過去のタスクの保持性を向上させる一方で、現在のタスクの精度をどの程度維持できるか?

主な発見

  • CRECLは、TACREDおよびFewRelの両方ですべてのSOTAベースラインを上回り、すべての継続的学習設定において最高の平均F1スコアを達成する。
  • プロトタイプ対照的学習機構により、t-SNEで可視化したように、データ分布の分離性が顕著に向上し、旧タスクと新タスクの関係の重なりが減少する。
  • K-meansベースのプロトタイプ選択により、ロバストなプロトタイプ表現が得られるため、CRECLはRP-CREのような先行手法よりも、メモリサイズ $ L $ にあまり依存せず、$ L \geq 8 $ でも安定した性能を維持する。
  • アブレーションスタディの結果、ランダムサンプリングに比べ、K-meansベースのプロトタイプ選択が優れていることが確認され、CRECL-Kは低い精度と高い不安定性を示す。
  • 対照損失 $ \\_\mathcal{L}_{contrast} $ とマージン損失 $ \\_\mathcal{L}_{mag} $ が併用されることで、現在のタスクの精度を劣化させることなく、性能が向上する。
  • マージン損失と対照的学習を統合したCRECL-MAGは、現在のタスクおよび履歴タスクの両方で最も安定した性能を示し、低下が最小限に抑えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。