Skip to main content
QUICK REVIEW

[論文レビュー] Learning event representations for temporal segmentation of image sequences by dynamic graph embedding

Mariella Dimiccoli, Herwig Wendt|arXiv (Cornell University)|Oct 8, 2019
Human Pose and Action Recognition参考文献 73被引用数 10
ひとこと要約

本論文では、動的グラフ埋め込み(DGE)を提案する。DGEは、自己教師あり学習手法であり、低フレームレートの画像系列における時間的セグメンテーションのためのイベント表現を、動的グラフ構造とその低次元埋め込みを同時に最適化することで学習する。従来の自己教師ありアプローチとは異なり、DGEはトレーニングデータを必要とせず、グラフベースの類似度と埋め込みを繰り返し精緻化することで、意味的関係と時間的関係の両方を捉える。EDUBSegおよびEDUBSeg-Descベンチマークにおいて、それぞれFスコア0.72および0.80を達成し、最先端性能を実現した。

ABSTRACT

Recently, self-supervised learning has proved to be effective to learn representations of events suitable for temporal segmentation in image sequences, where events are understood as sets of temporally adjacent images that are semantically perceived as a whole. However, although this approach does not require expensive manual annotations, it is data hungry and suffers from domain adaptation problems. As an alternative, in this work, we propose a novel approach for learning event representations named Dynamic Graph Embedding (DGE). The assumption underlying our model is that a sequence of images can be represented by a graph that encodes both semantic and temporal similarity. The key novelty of DGE is to learn jointly the graph and its graph embedding. At its core, DGE works by iterating over two steps: 1) updating the graph representing the semantic and temporal similarity of the data based on the current data representation, and 2) updating the data representation to take into account the current data graph structure. The main advantage of DGE over state-of-the-art self-supervised approaches is that it does not require any training set, but instead learns iteratively from the data itself a low-dimensional embedding that reflects their temporal and semantic similarity. Experimental results on two benchmark datasets of real image sequences captured at regular time intervals demonstrate that the proposed DGE leads to event representations effective for temporal segmentation. In particular, it achieves robust temporal segmentation on the EDUBSeg and EDUBSeg-Desc benchmark datasets, outperforming the state of the art. Additional experiments on two Human Motion Segmentation benchmark datasets demonstrate the generalization capabilities of the proposed DGE.

研究の動機と目的

  • 自己教師あり学習における時間的セグメンテーションの限界、特にデータの大量消費とファーストパーソン視点の画像系列におけるドメイン適応の問題を解決すること。
  • 任意のアノテーション付きトレーニングデータを必要とせず、単一の画像系列から直接イベント表現を学習する手法を開発すること。
  • 共同で学習されたグラフ構造と低次元埋め込みを通じて、画像系列内の意味的類似性と時間的類似性の両方をモデル化すること。
  • エゴセントリック動画を超えた一般化を示すために、本手法を人間の動きセグメンテーションベンチマークに適用すること。

提案手法

  • DGEは、フレームをノードとし、時間的近接性と高レベルの視覚的特徴に基づく意味的類似性をエッジで表現する動的グラフとして画像系列をモデル化する。
  • 本手法は、現在のフレーム表現に基づいてグラフ構造を繰り返し更新し、現在のグラフ構造を用いてフレーム埋め込みを精緻化する。
  • グラフ構築にはk近傍法を用い、時間的類似性と意味的類似性の組み合わせを採用する。意味的類似性は深層特徴を用いて計算される。
  • 埋め込み学習ステップでは、グラフ構造を保持する正則化された目的関数を最小化する。この目的関数には、グラフラプラシアンに基づく損失関数が用いられる。
  • アルゴリズムは、収束するまで、グラフ更新ステップと埋め込み更新ステップを交互に繰り返す。ハイパーパrameterにより、時間的類似性と意味的類似性のバランスを制御する。
  • 意味的類似性推定にはk-meansの変種が用いられ、各コンponentの寄与度をアブレーションスタディで検証した。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり手法が、トレーニングデータやアノテーションを一切必要とせず、効果的なイベント表現を学習できるか?
  • RQ2グラフ構造とその埋め込みを同時に学習することで、固定グラフや事前学習済み埋め込みアプローチと比較して、表現品質がどのように向上するか?
  • RQ3提案されたDGEモデルが、人間の動きセグメンテーションなどの異なる動画ドメインにどの程度一般化できるか?
  • RQ4グラフ構築における時間的類似性と意味的類似性の相対的寄与度は、ロバストなセグメンテーションにどの程度寄与するか?
  • RQ5ベンチマークデータセットにおける境界検出精度の観点から、DGEは最先端手法と比較してどの程度優れているか?

主な発見

  • EDUBSegデータセットではFスコア0.72、EDUBSeg-Descでは0.80を達成し、それぞれ前回の最先端手法より1ポイントおよび8ポイントの向上を示した。
  • アブレーションスタディの結果、時間的プライアーや意味的類似性、グラフ正則化といったDGEの主要コンponentをいずれも削除すると、最大3ポイントの性能低下が生じることがわかった。
  • KeckおよびMADの人間の動きセグメンテーションベンチマークにおいて、DGEはクラスタリング精度(0.72および0.67)と正規化相互情報量(0.83および0.82)の両方で最先端性能を達成し、強力な一般化能力を示した。
  • EDUBSegデータセット(18,735フレーム)に対して、標準デスクトップPC上での実行時間は約2分であり、実用的な計算可能性を示した。
  • ドメイン特化のトレーニングデータに依存しないため、カメラの視点やライフスタイルの変化に対してもロバストである。
  • グラフと埋め込みの共同最適化により、埋め込み空間内に意味的に類似したフレームが密集するクラスタを形成するなど、より一貫性のあるイベント表現が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。