[論文レビュー] Will I Sound Like Me? Improving Persona Consistency in Dialogues through Pragmatic Self-Consciousness
本稿では、合理的な言語行為理論フレームワークにインspiredされた、仮想の聴衆を介した実用的自己認識を用いて、会話エージェントの自己一貫性メカニズムを提案する。エージェントがどのように認識されるかをモデル化することで、追加のラベルや訓練を必要とせず、矛盾を低減し、パーソナ一貫性を向上させ、PersonaChatおよび対話的NLIベンチマークでベースモデルを上回る性能を達成する。
We explore the task of improving persona consistency of dialogue agents. Recent models tackling consistency often train with additional Natural Language Inference (NLI) labels or attach trained extra modules to the generative agent for maintaining consistency. However, such additional labels and training can be demanding. Also, we find even the best-performing persona-based agents are insensitive to contradictory words. Inspired by social cognition and pragmatics, we endow existing dialogue agents with public self-consciousness on the fly through an imaginary listener. Our approach, based on the Rational Speech Acts framework (Frank and Goodman, 2012), can enforce dialogue agents to refrain from uttering contradiction. We further extend the framework by learning the distractor selection, which has been usually done manually or randomly. Results on Dialogue NLI (Welleck et al., 2019) and PersonaChat (Zhang et al., 2018) dataset show that our approach reduces contradiction and improves consistency of existing dialogue models. Moreover, we show that it can be generalized to improve context-consistency beyond persona in dialogues.
研究の動機と目的
- 会話エージェントにおけるパーソナ一貫性の問題、特に矛盾する発話への感受性の欠如という継続的な課題に取り組む。
- 訓練における高コストなNLIラベルや補助的一貫性モデルへの依存を排除する。
- 仮想の聴衆がどのようにエージェントを認識するかをシミュレートすることで、会話エージェントに自己認識を付与する。
- パーソナ一貫性を超えて、対話全体の文脈的一貫性を向上させる一般化を図る。
- 学習可能なドライバ選択メカニズムと、より良い世界の事前分布更新を実現する。
提案手法
- 合理的な言語行為理論(RSA)フレームワークを応用し、エージェントの発話に対する仮想の聴衆の認識をシミュレートすることで、公的な自己認識をモデル化する。
- 累積的な事前情報の保持を図るため、$ L_1^t $ の代わりに $ L_0^t $ を用いた新しい聴衆更新ルールを導入する。
- 手動またはランダムに選択される非ターゲットパーソナ候補に代わる、学習可能なドライバ選択メカニズム(ドライバメモリ)を提案する。
- 発話の自然さ、一貫性、パーソナへの適合性のバランスを制御するために、発話者の合理性 $ \alpha $ と聴衆の合理性 $ \beta $ を用いる。
- 再訓練を必要とせず、既存の生成モデルに自己認識推論を統合することで、直交的かつ柔軟な適用を可能にする。
- エージェントが自らの発話を聴衆がどのように解釈するかを予測するベイジアン推論プロセスを採用し、一貫性のある応答生成をガイドする。
実験結果
リサーチクエスチョン
- RQ1NLIラベルや追加のトレーニングコンponentsに依存せずに、会話エージェントがより優れたパーソナ一貫性を達成できるか。
- RQ2仮想の聴衆を通じた公的な自己認識のモデル化が、対話生成における一貫性にどのように影響するか。
- RQ3提案手法がパーソナ一貫性を超えて、対話全体の一般的な文脈的一貫性を向上させられるか。
- RQ4聴衆の合理性 $ \beta $ と発話者の合理性 $ \alpha $ が、一貫性と自然さのトレードオフに与える影響は何か。
- RQ5学習可能なドライバ選択メカニズムは、自己認識推論のロバスト性向上にどの程度効果的か。
主な発見
- 提案手法は、追加のラベルやトレーニングを一切必要とせず、特に対話的NLIベンチマークで発話の矛盾を顕著に低減した。
- 自己認識を持つエージェントは、PersonaChatおよび対話的NLIの両方で発話の正確性が向上し、ベースモデルに比べてGT正確性が顕著に向上した。
- 世界の事前分布更新に $ L_0^t $ を用いることで、$ L_1^t $ よりも累積的なパーソナ情報の保持がより良くなる。これは、時間経過に伴うより安定的かつ一貫性のある推論を可能にする。
- $ \beta \leq 1 $ に設定することで、聴衆モデルが過去の文脈を効果的に組み込むことができ、性能を低下させる短絡的な更新を回避する。
- 最適な $ \alpha $ 値により、パーソナコンテンツが応答に滑らかに統合されるが、$ \alpha $ を過剰にするとパーソナ断片への過剰依存と文法的劣化が生じる。
- この手法はパーソナ一貫性を超えて一般化可能であり、文脈に依存する対話生成における一貫性向上に寄与し、対話の整合性向上への広範な適用可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。