Skip to main content
QUICK REVIEW

[論文レビュー] Personalized Showcases: Generating Multi-Modal Explanations for Recommendations

Yan An, Zhankui He|arXiv (Cornell University)|Jun 30, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、ユーザー固有の画像と自然言語を組み合わせることで推薦のためのマルチモーダルな説明を生成する、新しいタスクであるパーソナライズド・ショーケースを紹介する。視覚的および言語的出力を整列させるために対照的学習を用いることで、本稿で提案するPC²Lフレームワークは、テキストのみのベースラインと比較して、より多様で表現力があり、視覚的に根拠のある説明を生成する。Google Localから得た大規模データセットを用いた検証により、その有効性が裏付けられている。

ABSTRACT

Existing explanation models generate only text for recommendations but still struggle to produce diverse contents. In this paper, to further enrich explanations, we propose a new task named personalized showcases, in which we provide both textual and visual information to explain our recommendations. Specifically, we first select a personalized image set that is the most relevant to a user's interest toward a recommended item. Then, natural language explanations are generated accordingly given our selected images. For this new task, we collect a large-scale dataset from Google Local (i.e.,~maps) and construct a high-quality subset for generating multi-modal explanations. We propose a personalized multi-modal framework which can generate diverse and visually-aligned explanations via contrastive learning. Experiments show that our framework benefits from different modalities as inputs, and is able to produce more diverse and expressive explanations compared to previous methods on a variety of evaluation metrics.

研究の動機と目的

  • テキストのみの推薦説明における多様性の欠如と根拠の不足を是正すること。
  • 自然言語に加えて、パーソナライズされた視覚的コンテンツを統合することで、推薦説明を豊かにすること。
  • 多様で視覚的に整合性があり、ユーザーに特化した説明を生成するフレームワークの開発。
  • パーソナライズド説明生成のための高品質で大規模なマルチモーダルデータセットの構築。
  • クロスモーダル対照的学習を通じて、モデルの汎化性能とユーザーの関与度を向上させること。

提案手法

  • 推薦のための視覚的および言語的説明を生成する新しいタスク、パーソナライズド・ショーケースの提案。
  • Google Local(マップ)から得たビジネスレビュー、画像、ユーザープロフィールを含む大規模なマルチモーダルデータセットGestを構築。
  • 人間によるラベル付けを用いて高品質な画像-文ペアのサブセットをアノテートし、CLIPベースの分類器を訓練してラベルを全データセットに伝搬。
  • ハードネガティブサンプリングを用いて、生成されたテキストと選択された画像を整列させるパーソナライズドクロスモーダル対照的学習(PC²L)フレームワークを設計。
  • ユーザーのレビュー類似度に基づいてネガティブサンプルの重みを再設定するパーソナライズド対照的損失を導入。
  • CLIP埋め込みをマルチモーダルエンコーダーとして使用し、画像セットと生成された説明の間の視覚的整合性を評価するCLIPベースの指標を定義。

実験結果

リサーチクエスチョン

  • RQ1画像とテキストを組み合わせたマルチモーダルな説明は、推薦説明の多様性と情報量を向上させることができるか?
  • RQ2パーソナライズド推薦のための条件付きテキスト生成において、視覚的および言語的モダリティを効果的に整列させる方法は何か?
  • RQ3対照的学習は、マルチモーダルな設定において生成された説明の多様性と表現力にどの程度寄与するか?
  • RQ4ユーザー固有の画像選択は、生成された説明の関連性とパーソナライズ度を向上させることができるか?
  • RQ5提案されたPC²Lフレームワークは、テキストのみのベースラインおよび非対照的マルチモーダルベースラインをどの程度上回るか?

主な発見

  • PC²Lフレームワークは、テキストのみのベースラインおよび非対照的ベースラインと比較して、説明の多様性と視覚的整合性が顕著に向上している。
  • 人間による評価により、PC²Lは既存の手法と比較してより表現力があり、関与度の高い説明を生成することが確認された。
  • 自動評価では、ROUGE、BLEU、およびCLIPベースの視覚的整合性スコアを含む複数の指標で、PC²Lがベースラインを上回っていることが示された。
  • 対照的学習機構のおかげで、繰り返しや一般的なフレーズ(例:「食べ物は最高だ」)の生成が減少した。
  • パーソナライズド対照的損失は、ユーザーのレビュー類似度を活用してネガティブサンプルの重みを再設定することで、性能向上に寄与した。
  • 構築されたGestデータセットには95,270人のユーザーが含まれており、1事業所あたり平均35.63枚の画像を含んでおり、高品質なマルチモーダル学習を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。