Skip to main content
QUICK REVIEW

[論文レビュー] The Adapter-Bot: All-In-One Controllable Conversational Model

Andrea Madotto, Zhaojiang Lin|arXiv (Cornell University)|Aug 28, 2020
Topic Modeling被引用数 5
ひとこと要約

Adapter-Bot は、応答スタイル、知識の根拠づけ、目的志向応答などの会話スキルをオンデマンドで制御できるモジュラーで制御可能な会話モデルを導入する。固定バックボーン言語モデル(例:DialGPT)に、軽量でタスク固有のアダプタを追加することで実現され、各アダプタは独立して訓練され、 catastrophic forgetting を回避しながら継続的なスキル統合が可能である。システムは自動(会話マネージャードライブ)および手動(ユーザー制御)の両モードをサポートし、最小限のパラメータ更新で多様な会話タスクにおいて競争力ある性能を達成する。

ABSTRACT

Considerable progress has been made towards conversational models that generate coherent and fluent responses by training large language models on large dialogue datasets. These models have little or no control of the generated responses and miss two important features: continuous dialogue skills integration and seamlessly leveraging diverse knowledge sources. In this paper, we propose the Adapter-Bot, a dialogue model that uses a fixed backbone conversational model such as DialGPT (Zhang et al., 2019) and triggers on-demand dialogue skills (e.g., emphatic response, weather information, movie recommendation) via different adapters (Houlsby et al., 2019). Each adapter can be trained independently, thus allowing a continual integration of skills without retraining the entire model. Depending on the skills, the model is able to process multiple knowledge types, such as text, tables, and graphs, in a seamless manner. The dialogue skills can be triggered automatically via a dialogue manager, or manually, thus allowing high-level control of the generated responses. At the current stage, we have implemented 12 response styles (e.g., positive, negative etc.), 8 goal-oriented skills (e.g. weather information, movie recommendation, etc.), and personalized and emphatic responses. We evaluate our model using automatic evaluation by comparing it with existing state-of-the-art conversational models, and we have released an interactive system at adapter.bot.ust.hk.

研究の動機と目的

  • 大規模な会話モデルにおけるオンデマンド制御の欠如、特に特定の応答スタイルやスキルの選択を改善すること。
  • バックボーンモデルの完全な微調整なしに、継続的に新しい会話スキルを統合できるようにすること。
  • テキスト、テーブル、知識グラフを含む多様な知識ソースへの応答のシームレスな根拠づけを可能にすること。
  • ユーザー主導またはシステム予測による会話行動を可能にする、自動および手動の制御メカニズムを提供すること。
  • 非生成的スキル(例:事実確認、QA)を同じ統合フレームワーク内にデプロイする可能性を実証すること。

提案手法

  • モデルは、主な生成エンジンとして固定事前学習済み会話バックボーン(例:DialGPT)を用いる。
  • 各会話スキル(例:天気、映画推薦、共感)は、Transformer層に挿入された軽量でトレーニング可能なアダプタモジュールによって実装される。
  • アダプタはタスク固有のデータセットを用いて独立して訓練され、バックボーンの再トレーニングなしに継続的なスキル追加が可能になる。
  • 自動モードでは、BERTベースの会話マネージャーが会話履歴に基づいて適切なアダプタを選択するように訓練される。
  • 手動制御は、ユーザーがスキルIDを指定して特定のアダプタを起動できるようにすることで実現される。
  • 感情認識(顔・テキスト)、毒性検出、動的知識取得(例:天気API、Covid-19 QA)などの補助機能を統合する。

実験結果

リサーチクエスチョン

  • RQ1固定会話バックボーンにモジュラーなアダプタを追加することで、catastrophic forgetting を回避しつつ、多様なオンデマンド会話スキルをサポートできるか?
  • RQ2アダプタベースのアプローチは、複数の会話スタイルや知識タイプにおいて、応答の流暢さと一貫性を効果的に維持できるか?
  • RQ3会話マネージャーは会話履歴に基づいて適切なスキルを正確に予測できるか?これにより、文脈に応じた自動応答制御が可能か?
  • RQ4同じアーキテクチャが、生成的スキルに加えて非生成的スキル(例:事実確認)を統合的にサポートできるか、その範囲はどの程度か?
  • RQ5Adapter-Bot の性能は、オープンドメインおよびタスク志向の会話ベンチマークにおいて、最先端モデルと比較してどの程度か?

主な発見

  • オープンドメインタスク(例:ED、WoW、Per)において、強力なベースライン(BST、DDD)と比較して1%〜3%以内の perplexity を達成し、最小限のパラメータ更新で優れた流暢さを示している。
  • 目的志向タスク(例:WEA、POI、SCH)において、文法的流暢さ(BLEU)ではタスク特化モデルと同等の性能を示し、F1スコアではわずかに低いが、中程度の性能の妥協で優れた汎化性能を示している。
  • BERTベースの会話マネージャーは、複数ターンの会話履歴選択で95.35%、単一ターンで92.92%の精度を達成し、効果的な自動スキル選択が可能であることを示している。
  • アダプタベースのアプローチにより、バックボーンの再トレーニングなしに、22種類の異なる会話スキル(個人化、共感、応答スタイル制御など)を継続的に統合可能である。
  • Covid-19 QA や事実確認などの非生成的スキルが、アダプタまたはAPIを介して正常にデプロイされ、アーキテクチャの柔軟性が実証された。
  • adapterbot.emos.ai に実装されたWebベースのデモは、感情認識、絵文字生成、毒性フィルタリングなどの機能をサポートし、ユーザーの関与度と安全性を向上させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。