Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Learning for Interactive Recommendation in Fashion

Karin Sevegnani, Arjun Seshadri|arXiv (Cornell University)|Jul 25, 2022
Recommender Systems and Techniques被引用数 4
ひとこと要約

本稿では、履歴ユーザーデータに依存せずに、ユーザーが提供するテキスト要請からパーソナライズされたファッションアイテムを推薦する、対照学習に基づくモデルWhisperLiteを提案する。CLIP埋め込みと、バイナリ交差エントロピーと対照学習損失を組み合わせた複合損失を活用することで、実世界のファッションデータセットにおいて最先端の性能を達成し、ランダムベースラインと比較して人間評価でも優れた関連性を示した。

ABSTRACT

Recommender systems and search are both indispensable in facilitating personalization and ease of browsing in online fashion platforms. However, the two tools often operate independently, failing to combine the strengths of recommender systems to accurately capture user tastes with search systems' ability to process user queries. We propose a novel remedy to this problem by automatically recommending personalized fashion items based on a user-provided text request. Our proposed model, WhisperLite, uses contrastive learning to capture user intent from natural language text and improves the recommendation quality of fashion products. WhisperLite combines the strength of CLIP embeddings with additional neural network layers for personalization, and is trained using a composite loss function based on binary cross entropy and contrastive loss. The model demonstrates a significant improvement in offline recommendation retrieval metrics when tested on a real-world dataset collected from an online retail fashion store, as well as widely used open-source datasets in different e-commerce domains, such as restaurants, movies and TV shows, clothing and shoe reviews. We additionally conduct a user study that captures user judgements on the relevance of the model's recommended items, confirming the relevancy of WhisperLite's recommendations in an online setting.

研究の動機と目的

  • ファッションECにおける単体のレコメンデーションシステムと検索ツールの間のギャップを埋めるために、自由形式のユーザーのテキスト要請からパーソナライズされたレコメンデーションを可能にする。
  • 特にコールドスタートユーザーを想定し、履歴クリックストリームや購入データに依存せずに、自然言語記述からユーザーの意図をモデル化する。
  • ノイズが多い、曖昧な、あるいは矛盾するユーザー要請やスタイリストがアノテートしたデータにおけるラベルノイズの影響を受ける状況でも、レコメンデーション品質を向上させる。
  • 実世界およびオープンソースのデータセットを用いて、多様なドメインにわたるモデルの一般化能力を検証する。
  • アマゾンMechanical Turkを用いた人間による研究を通じて、モデルの実世界でのパフォーマンスを評価する。

提案手法

  • WhisperLiteは、事前学習済みのCLIP画像およびテキストエンコーダーと、微調整されたフィードフォワードネットワークを組み合わせ、ユーザーのテキスト要請とファッション製品の特徴を共通の埋め込み空間にマップする。
  • モデルは、アイテム関連性予測のためのバイナリ交差エントロピーと、関連するテキスト-製品ペアを整列させるための対照学習損失を組み合わせた複合損失関数を用いて学習される。
  • 対照学習により、関連するペア(関連するテキスト要請と製品)を埋め込み空間で近づけ、関連のないペア(関連のない組み合わせ)を遠ざける。
  • CLIPモデルの下位層の微調整を避ける。代わりにそれらを固定し、上位2つのパーセプトロンのみを訓練することで、一般化性能を維持し、ノイズの干渉を低減する。
  • モデルは複数のデータセットを用いたオフライン評価と、資格を有するMTurkワーカーが5段階スケールで関連性を評価する人間による研究を通じてオンライン評価も行う。
  • アブレーションスタディでは、完全微調整ベースライン(Whisper)と比較し、CLIP層の固定がノイズの多い実世界データにおけるパフォーマンス向上に寄与することが示された。

実験結果

リサーチクエスチョン

  • RQ1自由形式のユーザーのテキスト要請を関連するファッション製品レコメンデーションに効果的にマッピングできる対照学習アプローチは、履歴ユーザーデータに依存せずに実現可能か?
  • RQ2微調整戦略の選択(完全 vs. 局所的)が、ノイズの多い実世界のファッションレコメンデーションデータにおけるパフォーマンスにどのように影響するか?
  • RQ3提案されたモデルは、衣類、映画、レストラン、靴など多様なECドメインにどの程度一般化できるか?
  • RQ4オンライン環境下で、人間ユーザーはWhisperLiteが生成するレコメンデーションの関連性をランダムベースラインと比較してどのように評価するか?
  • RQ5CLIP埋め込みに対照学習損失を適用することで、複雑で曖昧なユーザー要請における検索パフォーマンスが向上するか?

主な発見

  • 人間評価において、WhisperLiteはランダムベースラインを著しく上回り、平均関連性スコアがk=3で0.52、k=5で0.72、k=7で0.59を記録した。これらはいずれもランダムベースラインのスコア(約0.31–0.38)よりも顕著に高い。
  • 人間評価における誤差棒が小さいことから、モデルのパフォーマンスはより一貫性があり信頼性が高く、特にk=5およびk=7において、ランダムベースラインの標準偏差が平均値を下回っていることが示された。
  • 実世界のWhisperDデータセットにおいて、WhisperLiteは完全微調整ベースラインであるWhisperを上回った。これは、CLIPの下位層を固定することで、ノイズによる特徴学習の劣化を防げたことを示唆している。
  • WhisperLiteはドメインにわたる一般化性能が高く、Yelp、Amazon衣料品、Amazon映画などのオープンソースデータセットにおいても強力な結果を達成した。特に、より挑戦的なWhisperDセットよりも、Amazon映画データセットに近いパフォーマンスを示した。
  • バイナリ交差エントロピーと対照学習損失を組み合わせた複合損失関数は、曖昧または不完全なユーザー要請の処理において、検索指標の向上に効果的であった。
  • 人間による研究では、WhisperLiteのレコメンデーションがユーザーにより関連性が高く、一貫性があると認識され、すべてのk値においてモデル出力がランダムな提案よりも好まれることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。