Skip to main content
QUICK REVIEW

[論文レビュー] Polite Dialogue Generation Without Parallel Data

Tong Niu, Mohit Bansal|arXiv (Cornell University)|May 8, 2018
Topic Modeling参考文献 63被引用数 5
ひとこと要約

本稿では、平行データを必要とせず、事前学習された丁寧さ分類器を活用することで、丁寧または不遽数の会話応答を生成する3つの弱教師付きモデル—Fusion、ラベル微調整(LFT)、Polite-RL—を提案する。LFTおよびPolite-RLモデルは、会話品質を維持したまま顕著に高い丁寧さを達成し、人間評価においてもFusionモデルおよびリtrievalベースラインを上回っている。

ABSTRACT

Stylistic dialogue response generation, with valuable applications in personality-based conversational agents, is a challenging task because the response needs to be fluent, contextually-relevant, as well as paralinguistically accurate. Moreover, parallel datasets for regular-to-stylistic pairs are usually unavailable. We present three weakly-supervised models that can generate diverse polite (or rude) dialogue responses without parallel data. Our late fusion model (Fusion) merges the decoder of an encoder-attention-decoder dialogue model with a language model trained on stand-alone polite utterances. Our label-fine-tuning (LFT) model prepends to each source sequence a politeness-score scaled label (predicted by our state-of-the-art politeness classifier) during training, and at test time is able to generate polite, neutral, and rude responses by simply scaling the label embedding by the corresponding score. Our reinforcement learning model (Polite-RL) encourages politeness generation by assigning rewards proportional to the politeness classifier score of the sampled response. We also present two retrieval-based polite dialogue model baselines. Human evaluation validates that while the Fusion and the retrieval-based models achieve politeness with poorer context-relevance, the LFT and Polite-RL models can produce significantly more polite responses without sacrificing dialogue quality.

研究の動機と目的

  • 平行データを必要とせず、スタイルとしての丁寧さまたは不遽数の会話応答を生成するモデルの開発を目的とする。
  • オープンドメイン会話において、丁寧さのスタイルを移転する際、文脈的関連性と流暢さを維持することを目的とする。
  • 事前学習された丁寧さ分類器と非ペaired会話データのみを用いた弱教師付き手法の探求を目的とする。
  • 生成モデルにおける丁寧さと会話品質のトレードオフを評価することを目的とする。
  • 連続的な丁寧さスケールに沿った制御可能な応答生成を可能とすることを目的とする。

提案手法

  • Fusionモデルは、会話モデルのデコーダーと、単独の丁寧な発話で学習された言語モデルを後段で融合することで、遅延統合を実現する。
  • ラベル微調整(LFT)モデルは、学習時に入力系列の先頭に連続的な丁寧さスコアにスケーリングされたラベル埋め込みを付加し、推論時にラベルスケーリングにより制御を可能にする。
  • Polite-RLモデルは、分類器の連続的丁寧さスコアに基づく報酬を用いた方策勾配強化学習を用い、応答生成を最適化する。
  • すべてのモデルは、seq2seq会話モデルと最先端の丁寧さ分類器に基づいて構築されており、新しいアーキテクチャへのモジュール結合を可能としている。
  • 比較のための2つのリtrievalベースラインを用いる:1つは分類器が選択した丁寧な応答からリtrievalするもの、もう1つは手動で整備された丁寧な発話からリtrievalするもの。
  • Polite-RLモデルの報酬に寄与する主なトークンを解釈するため、類似度可視化を用いる。

実験結果

リサーチクエスチョン

  • RQ1平行データがなくても、多様で文脈的に関連性のある丁寧な会話応答を生成することは可能か?
  • RQ2スタイル分類器のみを用いて、生成応答の丁寧さレベルをどのように制御できるか?
  • RQ3丁寧さに重点を置くモデルは、会話の品質や一貫性を犠牲にしているのか?
  • RQ4生成モデルとリtrievalベースラインのどちらが、丁寧さと文脈的関連性のバランスを最も効果的にとっているか?
  • RQ5分類器に基づく報酬を用いた強化学習は、スタイルに応じた応答生成を効果的にガイドできるか?

主な発見

  • LFTおよびPolite-RLモデルは、ベースラインのSeq2seqモデルに比べて顕著に丁寧な応答を生成し、会話品質を損なわない。
  • 人間評価では、LFTおよびPolite-RLモデルが高水準の会話の一貫性と関連性を維持しているのに対し、Fusionモデルおよびリtrievalベースラインはそれらを欠いている。
  • Fusionモデルおよびリtrievalベースラインは、文脈的関連性と流暢さの低下を伴いながら丁寧さを向上させている。
  • LFTモデルは、推論時にラベル埋め込みのスケーリングにより、丁寧さレベルの微調整制御を可能としている。
  • 類似度可視化により、Polite-RLモデルが「すみません」「先輩」「賢い」などのキーポイントとなる丁寧さマーカーに注目するよう学習していることが確認された。
  • モデルは心理言語学的文献で定義された、婉曲的表現、肯定的語彙、謙遜の戦略を含む、複数の丁寧さ戦略を効果的に学習・適用している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。