Skip to main content
QUICK REVIEW

[論文レビュー] DomBERT: Domain-oriented Language Model for Aspect-based Sentiment Analysis

Hu Xu, Bing Liu|arXiv (Cornell University)|Apr 28, 2020
Topic Modeling参考文献 44被引用数 5
ひとこと要約

DomBERT は、ターゲットドメインと関連ドメインの両方から学習することで、低リソースドメインにおけるアスペクトベースセンチメント分析(ABSA)を向上させる BERT ベースの言語モデルである。動的サンプリングによりドメイン関連のトレーニング例を効果的に選択することで、従来手法よりもはるかに少ないドメイン固有データで、AE、ASC、E2E-ABSA タスクにおいて最先端の性能を達成した。

ABSTRACT

This paper focuses on learning domain-oriented language models driven by end tasks, which aims to combine the worlds of both general-purpose language models (such as ELMo and BERT) and domain-specific language understanding. We propose DomBERT, an extension of BERT to learn from both in-domain corpus and relevant domain corpora. This helps in learning domain language models with low-resources. Experiments are conducted on an assortment of tasks in aspect-based sentiment analysis, demonstrating promising results.

研究の動機と目的

  • 一般向け言語モデル(例:BERT)が混合ドメインでの事前学習によって、微細なドメイン固有のセンチメントパターンを捉えきれないという制限を解消する。
  • 関連する多様なソースドメインからの知識を活用することで、低リソースドメインにおけるデータ不足を克服する。
  • ドメイン固有の注目を保ちつつ、意味的に関連するドメインからの知識移転をバランスさせるドメイン指向の学習フレームワークを開発する。
  • 人為的アノテーションが不要なドメイン固有データを用いずに、低リソース環境下でのアスペクトベースセンチメント分析(ABSA)の性能を向上させる。

提案手法

  • ターゲットドメインに対するドメイン関連度に基づいてトレーニング例の重みを再調整するドメインに配慮したトレーニング目的を BERT に拡張する。
  • 補助的なドメイン分類タスクにより学習されたドメイン埋め込みを用い、事前学習中に関連するソースドメインを特定・優先する。
  • RoBERTa の改善を踏まえ、動的マスキングを導入し、次文予測(NSP)タスクを削除する。
  • ALBERT と同様にドロップアウトを削除し、低リソース環境における過学習を軽減する。
  • ドメインタグでセグメント化された混合ドメインコーパス上で DomBERT をトレーニングし、ターゲットドメインと関連ソースドメインの両方からサンプリング可能にする。
  • タスク固有のアノテーションが不要な弱い監督信号としてドメインタグを用いた自己教師付き学習を適用する。

実験結果

リサーチクエスチョン

  • RQ1ターゲットドメインと関連ソースドメインの混合で事前学習された言語モデルは、一般向けモデルやドメイン固有のみのモデルに比べ、低リソース ABSA で優れた性能を発揮できるか?
  • RQ2一様またはランダムなサンプリングと比較して、ドメインに配慮したサンプリングは、アスペクトベースセンチメントタスクの性能向上にどの程度効果的か?
  • RQ3意味的に関連するドメイン(例:ラップトップ用のデスクトップ)からの知識は、限られたドメイン固有データを補完するためにどの程度有効か?
  • RQ4提案されたドメイン指向の学習フレームワークは、異なる ABSA サブタスク(AE、ASC、E2E-ABSA)に一般化可能か?
  • RQ5DomBERT のサンプリング機構が特定した上位 20 個のソースドメインは、人間の直感的なドメイン関連性とどの程度一致するか?

主な発見

  • DomBERT は、ラップトップドメインで F1 スコア 83.89、レストランドメインで 77.21 を記録し、アスペクト抽出(AE)で最先端の性能を達成した。これは、わずか 100 MB のドメイン固有データしか使用していないにもかかわらず、BERT-DK を上回った。
  • アスペクトセンチメント分類(ASC)では、ラップトップで 73.46 MF1、レストランで 75.00 MF1 を達成し、ドメイン固有データが限られた状況でも強力な性能を示した。
  • エンドツーエンド ABSA では、ラップトップで 66.21 F1、レストランで 73.45 F1 を達成し、BERT-Review や BERT-DK を上回った。これは、汎用的知識とドメイン固有知識の有効な統合を示している。
  • ラップトップおよびレストランドメインの上位 20 個のソースドメイン(例:'Computers & Accessories'、'Electronics Warranties'、'Coffee & Tea')は、いずれも非常に関連性が高く、モデルが意味的なドメイン関係を正しく学習できていることを裏付けた。
  • BERT-Review は、'Books' のような関連性の低いドメインが過剰に含まれていたため、E2E-ABSA で性能を発揮できなかった。これは、DomBERT がドメインに配慮したサンプリングにより、著しい利点を得られることを示している。
  • モデルの性能向上は、特にドメイン特化が強い AE および E2E-ABSA で顕著であり、微細なアスペクトレベルタスクに対してドメイン指向の学習が最も効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。