[論文レビュー] Controlling Personality Style in Dialogue with Zero-Shot Prompt-Based Learning
本稿では、大規模言語モデルを用いたタスク指向対話生成におけるパーソナリティスタイルと意味的正確性のゼロショットプロンプトベースの制御手法を提案する。テキストスタイル変換(TST)プロンプトを用い、オーバー生成と指標ベースのランク付けを行うことで、ビデオゲーム対話において100%のパーソナリティ正確性と87.6%の意味的正確性を達成し、データからテキストへのプロンプトを上回り、強力なクロスドメイン移行性を示した。
Prompt-based or in-context learning has achieved high zero-shot performance on many natural language generation (NLG) tasks. Here we explore the performance of prompt-based learning for simultaneously controlling the personality and the semantic accuracy of an NLG for task-oriented dialogue. We experiment with prompt-based learning on the PERSONAGE restaurant recommendation corpus to generate semantically and stylistically-controlled text for 5 different Big-5 personality types: agreeable, disagreeable, conscientious, unconscientious, and extravert. We test two different classes of discrete prompts to generate utterances for a particular personality style: (1) prompts that demonstrate generating directly from a meaning representation that includes a personality specification; and (2) prompts that rely on first converting the meaning representation to a textual pseudo-reference, and then using the pseudo-reference in a textual style transfer (TST) prompt. In each case, we show that we can vastly improve performance by over-generating outputs and ranking them, testing several ranking functions based on automatic metrics for semantic accuracy, personality-match, and fluency. We also test whether NLG personality demonstrations from the restaurant domain can be used with meaning representations for the video game domain to generate personality stylized utterances about video games. Our findings show that the TST prompts produces the highest semantic accuracy (78.46% for restaurants and 87.6% for video games) and personality accuracy (100% for restaurants and 97% for video games). Our results on transferring personality style to video game utterances are surprisingly good. To our knowledge, there is no previous work testing the application of prompt-based learning to simultaneously controlling both style and semantic accuracy in NLG.
研究の動機と目的
- タスク指向対話の自然言語生成における、パーソナリティスタイルと意味的正確性を同時に制御するプロンプトベースの学習の検討。
- 直接的なデータからテキスト(D2T)プロンプトとテキストスタイル変換(TST)プロンプトの2種類のプロンプトタイプを、パーソナリティスタイル化の観点から比較する。
- 少数ショットのデモの影響を評価する。具体的には、1つの例対複数の例、多様なサンプリング戦略の影響を検討する。
- 意味表現を用いて、レストランドメインで学習したパーソナリティスタイルをビデオゲームドメインにゼロショットで移行可能かどうかをテストする。
- 自動指標(文の流暢さ、意味的正確性、パーソナリティ一致)を用いて性能を評価し、最適なランク付け関数を同定する。
提案手法
- 本手法は2種類の離散的プロンプトタイプを用いる。(1) 意味表現に埋め込まれたパーソナリティ仕様に基づき、直接生成するD2Tプロンプト、(2) 意味表現を一時的参照に変換した後、スタイル変換を適用するTSTプロンプト。
- 各入力に対して、高品質な出力を得る可能性を高めるために、複数の候補発話(オーバー生成)を生成する。
- 出力を、自動指標の重み付き組み合わせによるランク付けで評価する:文の流暢さにBLEURT、意味的正確性にパーソナリティ固有のスロット誤差率、パーソナリティ一致に訓練済みのパーソナリティ分類器を用いる。
- 最も優れた設定は、TSTプロンプトに1つのパーソナリティ例と多様性を考慮したサンプリングを組み合わせたもので、意味的正確性とスタイル正確性の両方を向上させた。
- 本手法は、レストランドメインのPersonageコーパスで評価され、その後、後者の意味表現を用いてビデオゲームドメインのViGGOコーパスに移行された。
- 最終出力を選択するため、パーソナリティ正確性、意味的正確性、文の流暢さを統合したランク付け関数が用いられ、RF3(BLEURTとスロット誤差率を統合)が顕著な改善を示した。

実験結果
リサーチクエスチョン
- RQ1微調整なしで、プロンプトベースの学習がタスク指向対話生成において、パーソナリティスタイルと意味的正確性を同時に制御可能か?
- RQ2D2TプロンプトとTSTプロンプトのどちらが、意味的正確性とパーソナリティ一致の観点で優れた性能を示すか?
- RQ3少数ショットデモの数と多様性は、未学習のパーソナリティスタイルへの一般化能力にどのように影響するか?
- RQ4レストランドメインで学習したパーソナリティスタイルは、ターゲットドメインの意味表現を用いて、どの程度ビデオゲームドメインに移行可能か?
- RQ5文の流暢さ、意味的忠実性、パーソナリティ正確性のバランスをとる上で、どの自動指標の組み合わせが最も効果的な出力ランク付けを生むか?
主な発見
- TSTプロンプトアプローチは、ViGGOビデオゲームデータセットで100%のパーソナリティ正確性と87.6%の意味的正確性を達成し、D2Tプロンプトを顕著に上回った。
- Personageレストランデータセットでは、TSTプロンプトが78.46%の意味的正確性と100%のパーソナリティ正確性を達成し、出発ドメインでも強力な性能を示した。
- 複数の出力を生成し、複合指標(RF3)によるランク付けを施した結果、単純なランク付け関数よりも意味的正確性が統計的に有意に向上した(p = 0)。
- 1つのプロンプトに複数のパーソナリティ例を含めると性能が低下したため、ゼロショットスタイル制御においては、1つのスタイルデモがより効果的であると考えられる。
- モデルは、レストランドメインからビデオゲームドメインへのパーソナリティスタイルを成功裏に移行させ、『Hey』が協調性のマークとして、『Mmhm...』が外向性のマークとして、未学習のドメインでも言語的に一貫したパーソナリティの兆候を生成した。
- レストランドメインとビデオゲームドメインの性能差は、Personageコーパスの脱語彙化された名前によるものであり、ViGGOに実世界の知識があるため、意味的忠実性が向上したと考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。