Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Heterogeneous Metadata for Video Recommendation with Two-tower Model

Jianling Wang, Ainur Yessenalina|arXiv (Cornell University)|Sep 22, 2021
Recommender Systems and Techniques参考文献 20被引用数 7
ひとこと要約

本論文は、注目メカニズムを用いた融合層を通じて、カテゴリカル特徴、テキストのあらまし、カバーアート画像といった異種のメタデータを活用する2タワーニューラルネットワークモデルを提案する。このモデルは、メタデータモダリティの重みを動的に調整することで、新規追加(コールドスタート)動画およびウォームスタート動画の推薦性能を向上させ、最先端の性能を達成する。特にコールドスタートコンテンツにおいて、精度と再現率の両面でベースラインを著しく上回る。

ABSTRACT

Online video services acquire new content on a daily basis to increase engagement, and improve the user experience. Traditional recommender systems solely rely on watch history, delaying the recommendation of newly added titles to the right customer. However, one can use the metadata information of a cold-start title to bootstrap the personalization. In this work, we propose to adopt a two-tower model, in which one tower is to learn the user representation based on their watch history, and the other tower is to learn the effective representations for titles using metadata. The contribution of this work can be summarized as: (1) we show the feasibility of using two-tower model for recommendations and conduct a series of offline experiments to show its performance for cold-start titles; (2) we explore different types of metadata (categorical features, text description, cover-art image) and an attention layer to fuse them; (3) with our Amazon proprietary data, we show that the attention layer can assign weights adaptively to different metadata with improved recommendation for warm- and cold-start items.

研究の動機と目的

  • ウォッチ履歴のない新規追加動画(コールドスタート)の推薦課題に対処すること。
  • カテゴリカル特徴、テキストのあらまし、カバーアート画像といった多様なメタデータタイプが、動画表現学習の向上に寄与するかを検証すること。
  • コールドスタートおよびウォームスタートの両方の推薦に効率的なユーザーおよびアイテム表現学習を可能にする統一された2タワーアーキテクチャを設計すること。
  • 異種のメタデータモダリティを統合する際の注目ベースの統合と単純な連結の効果を評価すること。
  • コールドスタート状況におけるID埋め込みとメタデータ表現の間のトレードオフを分析すること。

提案手法

  • 2タワーニューラルネットワークアーキテクチャを採用し、一方のタワーはウォッチ履歴からユーザー表現を学習し、もう一方はメタデータからアイテム表現を学習する。
  • アイテムタワーは3つの異なるメタデータモダリティを処理する:カテゴリカル特徴(例:ジャンル、出演者)、テキストのあらまし(BERTベースの符号化による)、カバーアート画像(事前学習済みCNN埋め込みによる)。
  • 異なるメタデータモダリティからの表現を動的に統合するための注目層を導入し、推薦タスクへの関連性に基づいて重みを適応的に割り当てる。
  • 最終的なアイテム表現は、モダリティ固有の埋め込みの重み付き和として計算され、注目重みは学習中に学習される。
  • ユーザー埋め込みとアイテム埋め込みはドット積を用いて結合され、ユーザー-アイテム相互作用スコアが予測される。
  • モデルは、固定された埋め込みサイズ512および学習率0.001を用いたAdam最適化アルゴリズムで訓練される。

実験結果

リサーチクエスチョン

  • RQ12タワーモデルは、異種のメタデータを効果的に活用してコールドスタート動画の推薦性能を向上させることができるか?
  • RQ2カテゴリカル特徴、テキストのあらまし、カバーアート画像といった異なるメタデータタイプは、アイテム表現学習にどのように寄与するか?
  • RQ3注目ベースの統合機構は、メタデータ表現の単純な連結よりも優れているか?
  • RQ4ID埋め込みはコールドスタート推薦性能にどのような影響を及ぼし、メタデータ表現とどのように相互作用するか?
  • RQ5注目重みはメタデータモダリティ間でどのように分布するか?これは、それらの相対的な重要性を何を示唆するか?

主な発見

  • 注目ベースの統合モデルは、単一のメタデータタイプのみを用いたモデルを著しく上回り、モダリティ間での適応的重み付けの有効性を示している。
  • カテゴリカル特徴が表現学習に最も寄与し、次にテキストのあらまし、カバーアート画像が最も低い注目重みを受ける。
  • コールドスタート推薦において、ID埋め込みを含まないモデルがID埋め込みを含むバージョンよりも精度@6および再現率@6が優れている。これは、ID埋め込みが注目を支配し、有用なメタデータ信号を抑制する可能性があることを示唆している。
  • 注目統合を備えたモデルは、コールドスタート映画において、ランダムベースライン比で精度@6を1221.73%、再現率@6を368.75%向上させた。テレビ番組では、それぞれ486.36%および57.69%の向上を達成した。
  • ID埋め込みを含めた場合、カバレッジ指標(Coverage@6およびConCov@6)がわずかに高くなるが、これはコールドスタート設定における多様性と正確性のトレードオフを示唆している。
  • 可視化結果から、カテゴリカル特徴が最も高い注目重みを受ける一方、カバーアート特徴は一貫して低減されていることが確認され、現在の設定下では情報量が低いことが裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。