Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Attend, Copy, and Generate for Session-Based Query Suggestion

Mostafa Dehghani, Sascha Rothe|arXiv (Cornell University)|Aug 11, 2017
Topic Modeling参考文献 29被引用数 7
ひとこと要約

本稿では、セッション構造をモデル化し、未知語や頻繁に保持される語を処理するためのコピーメカニズムを統合した、セッションベースのクエリ提案のための新しいシーケンス・ツー・シーケンスモデルを提案する。モデルは、生成と候補スコアリングの両面でベースラインを著しく上回り、階層的アテンションとソース語の的を絞ったコピーより、クエリ再定式化パターンの改善を示している。

ABSTRACT

Users try to articulate their complex information needs during search sessions by reformulating their queries. To make this process more effective, search engines provide related queries to help users in specifying the information need in their search process. In this paper, we propose a customized sequence-to-sequence model for session-based query suggestion. In our model, we employ a query-aware attention mechanism to capture the structure of the session context. is enables us to control the scope of the session from which we infer the suggested next query, which helps not only handle the noisy data but also automatically detect session boundaries. Furthermore, we observe that, based on the user query reformulation behavior, within a single session a large portion of query terms is retained from the previously submitted queries and consists of mostly infrequent or unseen terms that are usually not included in the vocabulary. We therefore empower the decoder of our model to access the source words from the session context during decoding by incorporating a copy mechanism. Moreover, we propose evaluation metrics to assess the quality of the generative models for query suggestion. We conduct an extensive set of experiments and analysis. e results suggest that our model outperforms the baselines both in terms of the generating queries and scoring candidate queries for the task of query suggestion.

研究の動機と目的

  • 一般的なseq2seqモデルがセッションベースのクエリ提案において、セッション構造をモデル化できないことや、レア語や未知語を処理できないという限界を是正すること。
  • クエリに特化したアテンションメカニズムを用いて、階層的なクエリレベルおよび語レベルの文脈を捉えることで、クエリ提案の改善を図ること。
  • コピーメカニズムを組み込むことで、特に語の保持を含むクエリ再定式化パターンのモデリングを強化し、デコーダーがセッションコンテキストからの語を直接コピーライズできるようにすること。
  • 生成型クエリ提案モデルに特化した新しい評価指標を提案し、生成品質と候補スコアリング性能の両面でのより良い評価を可能にすること。

提案手法

  • モデルは、セッション内の各クエリを別々に処理する階層的エンコーダーを採用し、クエリレベルの表現を捕捉した後、それをセッションレベルのコンテキストに集約する。
  • クエリに特化したアテンションメカニズムは、クエリレベルと語レベルの表現に対して別々のアテンション重みを計算し、デコーダーがセッションコンテキストの関連部分に選択的に注目できるようにする。
  • デコーダーは、注目された表現を統合し、入力セッションクエリからの語を直接コピーライズするか、新しい語を生成するかを決定するコピーメカニズムを用いる。
  • コピーや生成の意思決定は、生成とコピーディスカッションの両方を同時に最適化できる多目的学習フレームワークを用いて、学習可能なゲートとしてモデル化する。
  • モデルはエンド・ツー・エンドで訓練され、生成にはクロスエントロピー損失、コピーディスカッションには別個の損失が用いられ、デコード中にアテンション重みが動的に更新される。
  • 自動評価指標(例:BLEU、ROUGE、コピーや生成に特化した新指標)と、実際の検索ログを用いた人的評価の両方を用いて、アプローチを評価する。

実験結果

リサーチクエスチョン

  • RQ1クエリに特化したアテンションメカニズムは、クエリ提案のためのシーケンス・ツー・シーケンスモデルにおけるセッション構造のモデリングを改善できるか?
  • RQ2コピーメカニズムを組み込むことで、クエリ再定式化における未知語や頻繁に保持される語の処理能力がどの程度向上するか?
  • RQ3提案された評価指標は、高品質な生成型クエリ提案とベースラインモデルの差を的確に区別できるか?
  • RQ4階層的アテンションとコピーメカニズムの統合により、既存のベースラインと比較して生成品質および候補スコアリングの両面で測定可能な改善が得られるか?

主な発見

  • 提案モデルは、BLEU や ROUGE といった標準指標において、強力なベースラインを上回る優れた性能を示し、クエリ生成と候補スコアリングの両面で優れた性能を発揮した。
  • 語の保持処理において顕著な改善が得られ、提案クエリ内の60%以上がセッションコンテキストから直接コピーライズされた。これは、観察されたユーザー行動と整合的である。
  • クエリに特化したアテンションメカニズムにより、セッションの範囲をより的確に制御でき、ノイズの多いまたは長いセッションに対してもロバスト性が向上し、自動的なセッション境界検出を支援した。
  • コピーメカニズムの導入により、稀な語や未知語の生成が顕著に増加し、正確なクエリ提案に不可欠な要素が強化された。
  • 提案された評価指標は、高品質と低品質の提案を効果的に区別でき、標準指標のみに依存する評価よりも、より洗練された評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。