[論文レビュー] Out-of-Distribution Detection for Generalized Zero-Shot Action Recognition
本論文は、一般化ゼロショット行動認識(GZSL)のための新しい分布外(OD)検出器を提案する。この検出器は、見たことのある行動カテゴリと見ることのない行動カテゴリの分類を分離することで、見慣れたクラスに偏る内在的バイアスを軽減する。見ることのない行動特徴を、コサイン損失およびサイクル整合性損失を用いて最適化された条件付きワサーライン生成対抗ネットワーク(CEWGAN)で合成し、OD検出器はエントロピー最大化を用いて見ることのない特徴を識別し、それらを専用の見ることのない分類器にルーティングする。これにより、オリンピックスポーツ、HMDB51、UCF101でそれぞれ7.0%、3.4%、4.9%の絶対的精度向上を達成し、最先端の性能を実現した。
Generalized zero-shot action recognition is a challenging problem, where the task is to recognize new action categories that are unavailable during the training stage, in addition to the seen action categories. Existing approaches suffer from the inherent bias of the learned classifier towards the seen action categories. As a consequence, unseen category samples are incorrectly classified as belonging to one of the seen action categories. In this paper, we set out to tackle this issue by arguing for a separate treatment of seen and unseen action categories in generalized zero-shot action recognition. We introduce an out-of-distribution detector that determines whether the video features belong to a seen or unseen action category. To train our out-of-distribution detector, video features for unseen action categories are synthesized using generative adversarial networks trained on seen action category features. To the best of our knowledge, we are the first to propose an out-of-distribution detector based GZSL framework for action recognition in videos. Experiments are performed on three action recognition datasets: Olympic Sports, HMDB51 and UCF101. For generalized zero-shot action recognition, our proposed approach outperforms the baseline (f-CLSWGAN) with absolute gains (in classification accuracy) of 7.0%, 3.4%, and 4.9%, respectively, on these datasets.
研究の動機と目的
- 一般化ゼロショット学習(GZSL)モデルにおける、分類時に見慣れた行動カテゴリに偏る内在的バイアスを是正すること。
- 実際の見ることのない特徴が入手できない状況下で、見ることのない行動サンプルが見慣れたカテゴリに誤って分類されるのを防ぐために、専用の分布外(OD)検出器を導入すること。
- 実際の見ることのない特徴が入手できない状況下で、条件付きGANを用いてそれらを合成することで、OD検出器の有効な訓練を可能にすること。
- OD検出の結果に基づき、見慣れたクラス分類器または見ることのないクラス分類器に特徴を動的にルーティングすることで、GZSLの性能を向上させること。
- 属性の有無や動画特徴の種類が異なる複数のデータセットにおいて、本フレームワークの有効性を実証すること。
提案手法
- OD検出器は、見慣れた行動カテゴリの実際の特徴と、見ることのないカテゴリのGANで生成された特徴を用いて訓練される。
- 見ることのない行動特徴の合成には、クラス埋め込み(属性)を条件として用いる条件付きワサーライン生成対抗ネットワーク(CEWGAN)が用いられ、意味的整合性を保証する。
- CEWGANは、特徴の多様性と質を向上させるために、コサイン埋め込み損失およびサイクル整合性損失を追加で最適化に組み込む。
- OD検出器は、見ることのない特徴に対して出力のエントロピーを最大化することで、見慣れたカテゴリに対してはピークが現れる非一様分布、見ることのないカテゴリに対しては一様な分布を生成する。
- 推論時においては、OD検出器の出力エントロピーをしきい値と比較し、特徴を見慣れた分類器または見ることのない分類器にルーティングする。
- 最終的な予測は、検出された分布タイプ(見慣れたものか見ることのないものか)に対応する分類器によって行われる。
実験結果
リサーチクエスチョン
- RQ1GZSL動画認識において、分布外検出器は見慣れた行動カテゴリと見ることのない行動カテゴリを効果的に区別できるか?
- RQ2実際の見ることのない特徴が入手できない状況下で、どのようにして見ることのない行動特徴を効果的に合成できるか?
- RQ3見慣れたクラスと見ることのないクラスの分類パスを分離することで、GZSLにおける見慣れたクラスへのバイアスを軽減できるか?
- RQ4コサイン損失およびサイクル整合性損失といった追加の正則化を用いた特徴の合成により、OD検出性能がどの程度向上するか?
- RQ5本提案フレームワークは、手動でアノテートされた属性がある・ないにかかわらず、さまざまなデータセットに一般化可能か?
主な発見
- 提案されたCEWGAN-ODフレームワークは、オリンピックスポーツデータセットにおいてベースライン比で7.0%の絶対的精度向上を達成した。
- HMDB51では、word2vec埋め込みを用いたベースラインと比較して、3.4%のGZSL精度向上を達成した。
- UCF101では、ベースライン比で4.9%の絶対的精度向上を達成した。
- HMDB51において、word2vec単体よりも、word2vecから学習した転送された手動属性を用いた特徴合成の方が高い性能を示した。
- I3Dの外観+流れ特徴(I3D af)は、C3DやI3D単体の変種よりも、すべてのデータセットで最も優れた性能を示した。
- OD検出器のエントロピーに基づくルーティング機構は、特に高精度な設定下で、見ることのない行動が見慣れた行動に誤って分類されるのを効果的に低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。