Skip to main content
QUICK REVIEW

[論文レビュー] LiveBot: Generating Live Video Comments Based on Visual and Textual Contexts

Shuming Ma, Lei Cui|arXiv (Cornell University)|Sep 13, 2018
Multimodal Machine Learning Applications参考文献 33被引用数 7
ひとこと要約

本稿では、視覚的および文脈的文脈を活用してリアルタイムで文脈的に適切なコメントを生成する、自動ライブ動画コメントのための最初のタスクおよびシステムであるLiveBotを紹介する。Fusional RNNおよびUnified Transformerの2つのニューラルモデルを提案し、動画フレームと周辺コメントを統合的に符号化することで、自動評価(MRR)および人間評価の両面でベースラインを上回り、Unified Transformerは人間の水準に近い流暢さと関連性スコアを達成した。

ABSTRACT

We introduce the task of automatic live commenting. Live commenting, which is also called `video barrage', is an emerging feature on online video sites that allows real-time comments from viewers to fly across the screen like bullets or roll at the right side of the screen. The live comments are a mixture of opinions for the video and the chit chats with other comments. Automatic live commenting requires AI agents to comprehend the videos and interact with human viewers who also make the comments, so it is a good testbed of an AI agent's ability of dealing with both dynamic vision and language. In this work, we construct a large-scale live comment dataset with 2,361 videos and 895,929 live comments. Then, we introduce two neural models to generate live comments based on the visual and textual contexts, which achieve better performance than previous neural baselines such as the sequence-to-sequence model. Finally, we provide a retrieval-based evaluation protocol for automatic live commenting where the model is asked to sort a set of candidate comments based on the log-likelihood score, and evaluated on metrics such as mean-reciprocal-rank. Putting it all together, we demonstrate the first `LiveBot'.

研究の動機と目的

  • オンライン動画向けの自動ライブコメントという新規タスクの提案および定義。
  • 研究用に2,361本の動画およびBilibiliから収集した895,929件のライブコメントを含む大規模データセットの構築。
  • 視覚的および文脈的文脈を統合的に符号化することで、文脈的に適切なライブコメントを生成するニューラルモデルの開発。
  • 平均逆順位(MRR)などのメトリクスを用いたリトリーブベースの評価プロトコルの確立による、モデル間の堅牢な比較。
  • 流暢さ、関連性、正しさの3つの次元における人間アノテーションを含む、自動メトリクスと併用したモデル性能の評価。

提案手法

  • タスクは、動画フレーム、そのタイムスタンプ、周辺コメント、および近隣の動画フレームを条件としてコメントを生成することとして定式化される。
  • Bilibiliから大規模なライブコメントデータセットを収集し、時間的・文脈的アノテーションを備えた2,361本の動画と895,929件のコメントを含む。
  • Fusional RNNおよびUnified Transformerの2つのニューラルモデルを提案し、動画フレームからの視覚的特徴と周辺コメントからの文脈的特徴を統合的に符号化する。
  • 注目メカニズムを用いて関連する視覚的領域およびコメント履歴に注目することで、文脈に配慮したコメント生成を可能にする。
  • モデルが候補コメントを対数尤度に基づいてランク付けするリトリーブベースの評価プロトコルを導入し、MRRおよびその他のリトリーブメトリクスを用いて性能を測定する。
  • 人間評価は、流暢さ、関連性、正しさの3つの次元で実施され、3名のアノテーターのスコアを平均化する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルモデルは、動画コンテンツおよび周辺コメントの両方の文脈的関連性を持つライブ動画コメントを効果的に生成できるか?
  • RQ2視覚的および文脈的文脈を統合的に符号化することで、単一モodal入力と比較してライブコメント生成がどの程度向上するか?
  • RQ3周辺コメントは、生成されたライブコメントの質および関連性をどの程度向上させるか?
  • RQ4自動メトリクス(BLEU や ROUGE)と比較して、提案されたリトリーブベースの評価プロトコルはコメント品質の評価においてどの程度有効か?
  • RQ5Unified Transformerモデルは、ライブコメント生成において人間と同等の流暢さと関連性を達成できるか?

主な発見

  • 提案されたFusional RNNおよびUnified Transformerモデルは、自動MRR評価および人間評価の両面で強いS2S-ICベースラインを顕著に上回った。
  • Unified Transformerは5段階スケールで関連性4.27、流暢さ4.43、正しさ4.31の平均スコアを達成し、人間生成コメントの品質(関連性4.12、流暢さ4.50、正しさ4.40)に近い水準に達した。
  • 視覚的および文脈的文脈の両方を用いたモデルは、動画のみまたはコメントのみを用いたモデルよりも優れた性能を示し、マルチモーダル統合の重要性を示した。
  • 周辺コメントのみを入力として用いたモデルは、動画のみを入力としたモデルよりも優れた性能を示し、コメント履歴が次回のコメント予測に直接的な手がかりを提供していることを示した。
  • 人間評価では、平均スピアマン相関係数0.63の高いアノテーター間一貫性が確認され、アノテーションプロセスの信頼性が裏付けられた。
  • リトリーブベースの評価プロトコルは、高品質と低品質のコメントを効果的に区別でき、Unified Transformerがテスト済みのすべてのモデルの中で最高のMRRを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。