Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Modal Generative Adversarial Network for Short Product Title Generation in Mobile E-Commerce

Jianguo Zhang, Pengcheng Zou|arXiv (Cornell University)|Apr 3, 2019
Topic Modeling参考文献 34被引用数 7
ひとこと要約

本稿では、テキスト、視覚的特徴、属性情報の統合を活用して、モバイルEC向けに簡潔で人間らしい製品タイトルを生成するマルチモーダル生成的対抗ネットワークMM-GANを提案する。生成されたタイトルの品質を人間と同様に評価するディスクライマを用いた強化学習の枠組みとしてタイトル生成を定式化することで、最先端手法を上回り、実世界のA/Bテストにおいてクリックスルーレートを1.66%、クリックコンVERSIONレートを1.87%向上させた。

ABSTRACT

Nowadays, more and more customers browse and purchase products in favor of using mobile E-Commerce Apps such as Taobao and Amazon. Since merchants are usually inclined to describe redundant and over-informative product titles to attract attentions from customers, it is important to concisely display short product titles on limited screen of mobile phones. To address this discrepancy, previous studies mainly consider textual information of long product titles and lacks of human-like view during training and evaluation process. In this paper, we propose a Multi-Modal Generative Adversarial Network (MM-GAN) for short product title generation in E-Commerce, which innovatively incorporates image information and attribute tags from product, as well as textual information from original long titles. MM-GAN poses short title generation as a reinforcement learning process, where the generated titles are evaluated by the discriminator in a human-like view. Extensive experiments on a large-scale E-Commerce dataset demonstrate that our algorithm outperforms other state-of-the-art methods. Moreover, we deploy our model into a real-world online E-Commerce environment and effectively boost the performance of click through rate and click conversion rate by 1.66% and 1.87%, respectively.

研究の動機と目的

  • モバイルECアプリケーションにおける限られたスクリーンスペースを考慮し、簡潔で情報豊富な製品タイトルを生成する課題に対処すること。
  • 露出バイアスに苦しむことや包括的評価が欠如するテキストのみのモデルの限界を克服すること。
  • テキスト、製品画像、属性タグというマルチモーダル入力を統合した一貫した生成フレームワークを構築し、タイトル品質の向上を図ること。
  • 実世界のオンライン環境でモデルを評価し、CTRやCVRのような重要なビジネス指標に与える影響を検証すること。

提案手法

  • MM-GANのジェネレータは、長めのタイトル、製品画像からの視覚的特徴、属性タグを入力として用い、短い製品タイトルを生成する。
  • ジェネレータは強化学習によって訓練され、報酬信号は、生成されたタイトルが人間のものか機械生成かを評価するディスクライマから得られる。
  • ディスクライマは、人間が書いたタイトルと機械生成されたタイトルを区別できるように訓練され、ジェネレータが人間らしい流暢さと一貫性を学習できるようにする。
  • 視覚的特徴は畳み込みニューラルネットワーク(CNN)を用いて抽出され、テキストおよび属性特徴は深層ニューラルネットワークによって符号化される。
  • モデルはアテンション機構を備えたシーケンス・ツー・シーケンスアーキテクチャを採用し、流暢で情報豊富な短いタイトルを生成する。
  • 訓練プロセスでは、MLEによる自己回帰的予測ではなく、完全なシーケンスを評価することで露出バイアスを回避する。

実験結果

リサーチクエスチョン

  • RQ1テキスト、画像、属性というマルチモーダル入力は、テキストのみのモデルと比較して、短い製品タイトル生成の質を向上させることができるか?
  • RQ2人間と同様のディスクライマを用いた強化学習の枠組みとしてタイトル生成を定式化することで、露出バイアスが軽減され、流暢さと情報性が向上するか?
  • RQ3視覚的および属性情報の統合により、長めのタイトルからの不要または冗長な語のフィルタリングにどのように寄与するか?
  • RQ4提案されたモデルは、クリックスルーレートやクリックコンVERSIONレートといった実世界のEC指標をどの程度向上させるか?

主な発見

  • 実世界のA/Bテストにおいて、MM-GANはタオバオアプリでベースラインシステムと比較して1.66%のCTR向上を達成した。
  • 同じA/Bテストで、CVR(クリックコンVERSIONレート)は1.87%向上し、ユーザーの関与度と購入意欲の向上を示した。
  • 定性的な分析から、MM-GANが生成したタイトルは、より流暢で情報豊かであり、「Artka」や「レトロ」のようなコアな製品属性を的確に捉えていた。
  • FE-Net や Agree-MTL といったベースラインモデルと比較して、MM-GANは長めのタイトルからの過剰に情報量の多いまたは関係のない語を正しく除外できた。
  • モデルは、女性用・男性用衣料品を含む7つの多様な製品カテゴリで堅牢な性能を示し、広範な適用可能性を示した。
  • 強力な性能を発揮したが、一部の生成タイトルには繰り返しや関係のない語が含まれており、さらなる改善の余地があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。