Skip to main content
QUICK REVIEW

[論文レビュー] Neural model robustness for skill routing in large-scale conversational AI systems: A design choice exploration

Han Li, Sunghyun Park|arXiv (Cornell University)|Mar 4, 2021
Topic Modeling参考文献 17被引用数 9
ひとこと要約

本論文は、大規模な会話型AIシステムにおけるスキルルーティングにおけるモデルのロバスト性を調査し、モデルデプロイ後におけるスキルのインテントへのサブスクリプションの動的変化に注目している。データ増強が仮説リストの変更、特に挿入に対して顕著にロバスト性を向上させることを示している。一方、Bi-LSTMアーキテクチャは、増強で緩和されても、このようなシフトに対して性能が低下する。

ABSTRACT

Current state-of-the-art large-scale conversational AI or intelligent digital assistant systems in industry comprises a set of components such as Automatic Speech Recognition (ASR) and Natural Language Understanding (NLU). For some of these systems that leverage a shared NLU ontology (e.g., a centralized intent/slot schema), there exists a separate skill routing component to correctly route a request to an appropriate skill, which is either a first-party or third-party application that actually executes on a user request. The skill routing component is needed as there are thousands of skills that can either subscribe to the same intent and/or subscribe to an intent under specific contextual conditions (e.g., device has a screen). Ensuring model robustness or resilience in the skill routing component is an important problem since skills may dynamically change their subscription in the ontology after the skill routing model has been deployed to production. We show how different modeling design choices impact the model robustness in the context of skill routing on a state-of-the-art commercial conversational AI system, specifically on the choices around data augmentation, model architecture, and optimization method. We show that applying data augmentation can be a very effective and practical way to drastically improve model robustness.

研究の動機と目的

  • モデルデプロイ後、スキルのインテントへのサブスクリプションが動的に変化する状況において、スキルルーティングシステムのモデル性能を維持する課題に対処すること。
  • データ増強、モデルアーキテクチャ、最適化手法といった異なるモデリング設計選択が、動的仮説リスト変更下でのロバスト性に与える影響を調査すること。
  • 仮説の削除と挿入がモデル性能に与える影響を評価し、大規模なプロダクション環境における会話型AIシステムの現実世界のロバスト性を理解すること。
  • 進化を続けるスキルオントロジーにかかわらず、一貫したモデル性能を確保する最適な設計選択を特定すること。

提案手法

  • トレーニング段階で、ノイズ注入や仮説リストの摂動を含むデータ増強技術を適用し、スキルサブスクリプションの動的変化をシミュレートする。
  • 3つのモデルアーキテクチャ(Bi-LSTM、トランスフォーマー基盤のアテンション、単純なアグリゲーションベースのモデル)を比較し、リストワイズランク付けにおけるクロス仮説コンテキストのエンコーディングを行う。
  • 2つの最適化手法(バイナリクロスエントロピー(BCE)とマージンベースのクロスエントロピー(MCE))を、オフラインおよびオンライン評価プロトコルを用いて評価する。
  • 仮説の削除および挿入の割合を変化させることで、制御されたマイクロベンチマークを実施し、リストのダイナミクスがモデルのロバスト性に与える影響を分離する。
  • ホールドアウトテストセットを用いたオフライン評価と、変化する仮説リストを想定したシミュレーテッドプロダクション環境下でのオンライン評価を実施する。
  • 動的条件下でのモデル精度を測定し、さまざまな設計選択における性能低下の程度を比較することで、ロバスト性を評価する。

実験結果

リサーチクエスチョン

  • RQ1推論時における候補スキル(仮説)リストの変更がある状況下で、データ増強はスキルルーティングにおけるモデルのロバスト性にどのように影響するか?
  • RQ2Bi-LSTM、アテンションベース、アグリゲーションベースの3つの異なるモデルアーキテクチャは、仮説リストの動的変更下でどのように性能を発揮するか?
  • RQ3動的スキルサブスクリプションの存在下で、バイナリクロスエントロピー(BCE)とマージンベースのクロスエントロピー(MCE)のどちらの最適化手法がより優れたロバスト性を示すか?
  • RQ4オンライン評価環境において、仮説の削除と挿入のどちらがモデル性能により大きな影響を与えるか?
  • RQ5データ増強は、スキルルーティングの候補リストにおける動的変更によって引き起こされる性能低下を効果的に緩和できるか?

主な発見

  • データ増強により、すべてのモデルバージョンでオンライン精度の低下がゼロにまで低下し、10個の新しい仮説が挿入されても性能が維持される。
  • Bi-LSTMモデルは、10個の新しい仮説が挿入された場合に56.74%の精度低下を示し、リストの順序や長さの変化に対して非常に感受性が高いことが判明した。
  • アテンションベースのモデルが、動的条件下で最も優れたオンライン性能を発揮し、Bi-LSTMおよびアグリゲーションベースのモデルを上回った。
  • 6つの評価ケースのうち4つでバイナリクロスエントロピー(BCE)損失がマージンベースのクロスエントロピー(MCE)を上回り、このタスクにおいてより優れた一般化性能を示している。
  • 同じオフライン精度であっても、Bi-LSTMモデルはアテンションベースのモデルに比べて顕著に悪いオンラインロバスト性を示しており、アーキテクチャ上の制限が顕在化している。
  • データ増強を適用した後、すべてのモデルがオフライン性能と同等のオンライン精度を達成しており、動的入力変化への一般化性能が向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。