Skip to main content
QUICK REVIEW

[論文レビュー] Conversational Group Detection With Deep Convolutional Networks

Mason Swofford, John Peruzzi|arXiv (Cornell University)|Oct 7, 2018
Video Surveillance and Tracking Methods参考文献 7被引用数 5
ひとこと要約

本稿では、人物レベルの特徴(位置、向き)と2次元上空マップから抽出した部屋のレイアウト特徴を用いて、o-space(社会的集まりの領域)を特定することで、会話グループを検出する深層畳み込みニューラルネットワークを提案する。モデルは順序なし空間入力を処理するPointNetベースのアーキテクチャを採用し、訓練および検証性能において最先端を記録するが、データの不均衡と困難なテスト分割のおかげでテスト性能は遅れをとる。

ABSTRACT

Detection of interacting and conversational groups from images has applications in video surveillance and social robotics. In this paper we build on prior attempts to find conversational groups by detection of social gathering spaces called o-spaces used to assign people to groups. As our contributions to the task, we are the first paper to incorporate features extracted from the room layout image, and the first to incorporate a deep network to generate an image representation of the proposed o-spaces. Specifically, this novel network builds on the PointNet architecture which allows unordered inputs of variable sizes. We present accuracies which demonstrate the ability to rival and sometimes outperform the best models, but due to a data imbalance issue we do not yet outperform existing models in our test results.

研究の動機と目的

  • 会話グループ検出を動画監視および社会的ロボット分野で向上させるために、o-spaceを社会的集まりの領域としてモデル化すること。
  • 従来のアルゴリズム的手法の限界を克服するため、このタスクに深層学習を導入することで、エンドツーエンドの特徴学習を可能にすること。
  • 壁やテーブルなどの部屋のレイアウト特徴をモデルに組み込むことで、o-space検出のための空間的推論を向上させること。
  • グループ検出におけるデータの不均衡問題を軽減するため、訓練時にクラスウェイトを適用すること。
  • Cocktail Partyデータセット上でモデルを評価し、最先端の非学習ベースのベースラインと性能を比較すること。

提案手法

  • 人物特徴(x, y, yaw)と部屋のレイアウト特徴の無順序かつ可変サイズの集合を処理するPointNetを模倣した深層ネットワークを用いる。
  • 3次元から2次元へのキャリブレーションを用いてカメラ画像を部屋の2次元上空マップに変換し、空間的レイアウト特徴の抽出を可能にする。
  • 上空マップに深層畳み込みネットワークを適用して、部屋全体におけるo-spaceの可能性の空間的表現を生成する。
  • 予測されたo-spaceヒートマップに対して非最大抑制としきい値処理を施し、候補となるo-spaceを局所化する。
  • 人物を最も近い検出済みo-spaceに貪欲なアサインメントで割り当てることで、会話グループを形成する。
  • 2つの訓練レジームを採用:1つは均一なクラスウェイト、もう1つはクラスバランスのとれたウェイトを用い、多グループシーンの不足を是正する。

実験結果

リサーチクエスチョン

  • RQ1人物レベルの特徴と部屋のレイアウト特徴を併用することで、深層学習モデルが画像内でのo-space検出を効果的に行えるか?
  • RQ2部屋のレイアウト特徴を組み込むことで、人物特徴のみに依存するモデルと比較して、o-space検出の正確性が向上するか?
  • RQ3特に多グループシーンの不足に起因するデータの不均衡が、モデルの一般化性能およびテスト性能に与える影響は何か?
  • RQ4過学習が検証データで発生しているにもかかわらず、深層ネットワークが非学習ベースのベースライン(例:グラフカット)を上回れるか?
  • RQ5データ拡張や多様なデータセットでのモデル再訓練によって、テスト性能と一般化能力がどの程度向上するか?

主な発見

  • 検証F1スコアはT=1で0.69、T=2/3で0.82を達成し、先行する最良モデルのF1(0.64および0.85)を上回った。
  • 訓練および検証の正確性は、最先端のグラフカットアルゴリズムを含むすべての先行モデルを上回っており、強力な学習能力を示している。
  • テスト性能は訓練および検証と比べて著しく遅れており、その要因はデータの不均衡と多数の難易度の高いケースを含む困難なテスト分割にある。
  • クラスウェイトの適用によりテストF1スコアはわずかに向上したが、最も優れた非学習モデルとの差を埋めるには不十分だった。
  • 一部のケースでは2つの近接するo-spaceを検出できる能力を示したが、空間的に近接または重複するグループの処理には苦労している。
  • 著者らは、より代表的なデータ分割または多様な環境からの追加学習データがあれば、テスト性能が向上すると仮説を立てている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。