Skip to main content
QUICK REVIEW

[論文レビュー] HAKE: A Knowledge Engine Foundation for Human Activity Understanding

Yong–Lu Li, Xinpeng Liu|arXiv (Cornell University)|Feb 14, 2022
Context-Aware Activity Recognition Systems被引用数 9
ひとこと要約

HAKEは、画像から原子的活動プリミティブを検出する段階と、解釈可能な論理規則を用いて高レベルの意味を推論する段階に分けた二段階のニューラル記号的フレームワークを提案する。2600万以上のプリミティブラベルと規則を含む大規模な知識ベースを活用することで、ベンチマークデータセットにおいて従来手法を上回る一般化性能と性能を達成し、疎でごみだらけの活動パターンの認識において優れた耐障害性を示している。

ABSTRACT

Human activity understanding is of widespread interest in artificial intelligence and spans diverse applications like health care and behavior analysis. Although there have been advances in deep learning, it remains challenging. The object recognition-like solutions usually try to map pixels to semantics directly, but activity patterns are much different from object patterns, thus hindering success. In this work, we propose a novel paradigm to reformulate this task in two stages: first mapping pixels to an intermediate space spanned by atomic activity primitives, then programming detected primitives with interpretable logic rules to infer semantics. To afford a representative primitive space, we build a knowledge base including 26+ M primitive labels and logic rules from human priors or automatic discovering. Our framework, the Human Activity Knowledge Engine (HAKE), exhibits superior generalization ability and performance upon canonical methods on challenging benchmarks. Code and data are available at http://hake-mvig.cn/.

研究の動機と目的

  • ピxlsから意味への直接的なマッピングが、意味の密度が低いことにより失敗する複雑でごみだらけのシーンにおける人間の活動理解の課題に対処すること。
  • 活動認識を二段階のプロセスに再定式化すること:プリミティブ検出の後、論理に基づく推論を行うこと。
  • 一般化を実現するため、人間と機械が発見した2600万以上の活動プリミティブと論理規則の包括的知識ベースを構築すること。
  • 全体像の意味ではなく、疎で意味のある視覚的手がかりに焦点を当てることで、ベンチマークでの一般化性能と性能を向上させること。
  • 人間の知覚とAIの間のギャップを埋めるために、活動認識をプリミティブの発見と構成的推論としてモデル化すること。

提案手法

  • 微分可能検出ヘッドを介して入力画像を原子的活動プリミティブの間接的空間にマッピングする二段階フレームワークを導入する。
  • クラウドソーシングと自動発見により収集された2600万以上のプリミティブラベルを用いて、疎で代表的なプリミティブ空間を定義する。
  • 検出されたプリミティブを明示的かつ解釈可能な論理規則(例:ブール結合)を用いてプログラミングするニューラル記号的推論エンジンを採用する。
  • シンボリック規則を逆誤差伝搬で通して微分可能である推論モジュールを適用し、エンドツーエンドの学習を可能にする。
  • 活動認識とオブジェクト認識における意味的コンテンツの疎らかさを測定する指標として、意味的カバレッジレート(SCR)を用いる。
  • 人間とHAKEが生成したマスク領域を用いて、重要な意味的領域の局在化の質を評価・比較する。

実験結果

リサーチクエスチョン

  • RQ1プリミティブ検出と論理に基づく推論の二段階パラダイムは、直接的なピxlsから意味へのマッピングを上回る性能を発揮できるか?
  • RQ2活動画像における意味的コンテンツの疎らかさ(SCRで測定)は、エンドツーエンドのディープラーニングモデルの性能にどのように影響するか?
  • RQ3原子的活動プリミティブと論理規則の知識ベースが、ゼロショットまたはフェイントショットの設定において一般化性能と耐障害性をどの程度向上できるか?
  • RQ4HAKEが生成した重要な領域マスクは、人間がアノテートしたマスクと比べて、意味的関連性とカバレッジの点でどの程度優れているか?
  • RQ5解釈可能な論理規則を用いたニューラル記号的推論は、人間のような構成的一般化を活動認識の知覚においてモデル化できるか?

主な発見

  • HAKEは、従来手法と比較して、挑戦的なベンチマークで優れた性能を達成しており、直接マッピング手法と比べてはるかに高い水準で性能が飽和している。
  • 活動画像の平均的な意味的カバレッジレート(SCR)は12.2%にとどまり、オブジェクト画像の61.0%と比べて著しく低いことが確認され、新たなパラダイムの必要性が裏付けられた。
  • 人間参加者が「ピザを食べる」という行動に対してマスクする領域は平均で15.3%にとどまり、活動認識が疎で明確でない手がかりに依存していることを示している。
  • 人間による分類テストでは、参加者がHAKEが生成したマスクと人間がアノテートしたマスクを59.55%の正確さでしか区別できず、強い意味的整合性があることが示された。
  • HAKEは、人間がしばしば見過ごす間接的だが重要な身体部位(例:『スケートボードでジャンプ』の際の腕と股関節)を検出する『抽象的』な能力を示している。
  • 複数の同時進行する行動がある曖昧なシーンにおいて、HAKEは人間が物体のみをマスクして相互作用の意味を失うのとは異なり、より多くの構成的意味を保持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。