[論文レビュー] Customer Sentiment Analysis using Weak Supervision for Customer-Agent Chat
本稿では、事前学習された感情分析モデルとドメイン固有の語彙ルールを組み合わせたラベル関数としての弱い教師付き手法を提案し、顧客・エージェント間チャットのRoBERTaベースの感情分類器を訓練する。この手法は、文脈や用語が重要なニュアンスのあるカスタマーサービスの文脈において、Google Cloud NLPなどのオフザシェルAPIよりも優れた性能を発揮する。
Prior work on sentiment analysis using weak supervision primarily focuses on different reviews such as movies (IMDB), restaurants (Yelp), products (Amazon).~One under-explored field in this regard is customer chat data for a customer-agent chat in customer support due to the lack of availability of free public data. Here, we perform sentiment analysis on customer chat using weak supervision on our in-house dataset. We fine-tune the pre-trained language model (LM) RoBERTa as a sentiment classifier using weak supervision. Our contribution is as follows:1) We show that by using weak sentiment classifiers along with domain-specific lexicon-based rules as Labeling Functions (LF), we can train a fairly accurate customer chat sentiment classifier using weak supervision. 2) We compare the performance of our custom-trained model with off-the-shelf google cloud NLP API for sentiment analysis. We show that by injecting domain-specific knowledge using LFs, even with weak supervision, we can train a model to handle some domain-specific use cases better than off-the-shelf google cloud NLP API. 3) We also present an analysis of how customer sentiment in a chat relates to problem resolution.
研究の動機と目的
- 大規模なラベル付きデータに依存せずに、顧客・エージェント間チャットのための感情分析モデルを開発すること。
- 事前学習された感情分析モデルとカスタム語彙ルールを用いた弱い教師付き手法が、ドメイン特化された感情分類に効果的であるかを評価すること。
- 実際のカスタマーサービスの場面において、Google Cloud NLP API などのオフザシェルNLP APIと比較して、弱い教師付きモデルの性能を評価すること。
- チャット中の感情の変化と問題解決結果との関係を分析すること。
提案手法
- 5つのラベル関数を採用:一般向けの感情分析モデル3つ(Textblob、AFINN、VADER)と、肯定的および否定的センチメントを処理するドメイン特化語彙ベースのルール2つ。
- Snorkelのラベルモデルを用いて、ラベル関数の正確性や相関関係を考慮し、各インスタンスに対して1つのより信頼性の高いラベルに弱いラベルを集約する。
- 弱いラベル付きデータ上で、対照的正則化付き自己訓練(COSINE)を用いてRoBERTaを微調整し、モデルの一般化性能を向上させる。
- Snorkelパイプラインを用いて、スケーラブルな弱い教師付きとラベル集約を可能にするエンドツーエンドのモデル訓練を実施する。
- 保留されたテストセット上で、微調整されたRoBERTaモデルの予測結果とGoogle Cloud NLP APIの予測結果を比較する。
実験結果
リサーチクエスチョン
- RQ1オフザシェルAPIと比較して、ドメイン特化されたラベル関数を用いた弱い教師付き手法が、顧客・エージェント間チャットにおける感情分類の正確性を向上させることができるか?
- RQ2ドメイン特化語彙ルールの統合が、ニュアンスのある感情表現の分類性能にどのように影響を与えるか?
- RQ3チャット中の感情の傾向と顧客の問題解決状況との間にどのような関係があるか?
- RQ4Textblob、AFINN、およびカスタムルールなどの複数のソースから得られる弱いラベルが、最終的なモデル性能をどの程度向上させるか?
主な発見
- 5つのラベル関数を用いたSnorkelラベルモデルは、RoBERTaを微調整後、マクロF1スコア0.65を達成し、Textblobのみ(0.53)やAFINNのみ(0.58)で学習したモデルを上回った。
- 弱い教師付きで微調整されたRoBERTaモデルは、Google Cloud NLP APIが失敗したドメイン特化された感情表現(例:競合他社の言及、丁寧な別れの言葉)を100%正しく分類した。
- チャット終了時に肯定的センチメントを示した会話は、問題解決と強く関連していたが、肯定的でない感情は未解決の問題を示していた。
- エージェントが通話の転送や技術者訪問の予約を提示した場合、チャット終了時の感情は肯定的、中立的、否定的のいずれにもなることがあり、感情が解決状況の直接的な指標ではないことが示された。
- 弱い教師付きで学習したモデルは、ドメイン特化された感情表現(例:「ATTのファイバーは月80ドルで、Comcastの文脈では否定的と解釈される」)において、Google Cloud NLP APIよりも高い正確性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。