Skip to main content
QUICK REVIEW

[論文レビュー] Optimization Planning for 3D ConvNets

Zhaofan Qiu, Ting Yao|arXiv (Cornell University)|Jan 11, 2022
Human Pose and Action Recognition参考文献 38被引用数 6
ひとこと要約

本稿では、3D ConvNetsのための最適化計画フレームワークを提案する。訓練プロセスを固定されたハイパーパrameter(学習率、クリップ長、サンプリング戦略)を持つ状態の系列としてモデル化し、動的計画法と膝点推定を用いて最適な状態遷移を決定することで、訓練中のハイパーパrameterスケジューリングを自動化する。この手法は最先端の性能を達成し、Kinetics-400では80.5%、Kinetics-600では82.7%のトップ1精度を達成した。

ABSTRACT

It is not trivial to optimally learn a 3D Convolutional Neural Networks (3D ConvNets) due to high complexity and various options of the training scheme. The most common hand-tuning process starts from learning 3D ConvNets using short video clips and then is followed by learning long-term temporal dependency using lengthy clips, while gradually decaying the learning rate from high to low as training progresses. The fact that such process comes along with several heuristic settings motivates the study to seek an optimal "path" to automate the entire training. In this paper, we decompose the path into a series of training "states" and specify the hyper-parameters, e.g., learning rate and the length of input clips, in each state. The estimation of the knee point on the performance-epoch curve triggers the transition from one state to another. We perform dynamic programming over all the candidate states to plan the optimal permutation of states, i.e., optimization path. Furthermore, we devise a new 3D ConvNets with a unique design of dual-head classifier to improve spatial and temporal discrimination. Extensive experiments on seven public video recognition benchmarks demonstrate the advantages of our proposal. With the optimization planning, our 3D ConvNets achieves superior results when comparing to the state-of-the-art recognition methods. More remarkably, we obtain the top-1 accuracy of 80.5% and 82.7% on Kinetics-400 and Kinetics-600 datasets, respectively. Source code is available at https://github.com/ZhaofanQiu/Optimization-Planning-for-3D-ConvNets.

研究の動機と目的

  • 3D ConvNetの訓練における手動で行われるヒューリスティックなハイパーパrameterチューニングの課題に取り組む。これは、クリップ長、サンプリング戦略、学習率の減衰の間で複雑なトレードオフを伴う。
  • 固定されたハイパーパrameterを持つ離散的な訓練状態の系列として訓練プロセスを定式化し、経路計画問題として扱うことで、訓練を自動化する。
  • パフォーマンス-エポック曲線の膝点に基づいて、状態間を適応的に遷移させることで、モデルの汎化性能と性能を向上させる。
  • 空間的および時間的特徴の区別を高めるために、新しい3D ConvNetアーキテクチャであるDG-P3Dを設計し、二重ヘッド分類器を導入する。
  • 多様な動画認識ベンチマークにおいて、一貫した性能向上を示すことで、最適化計画フレームワークの有効性を検証する。

提案手法

  • 訓練プロセスを、クリップ長、サンプリング戦略(均等または連続的)、および学習率を固定した状態に分解する。
  • 有効な状態遷移を符号化するための候補遷移グラフを構築し、動的計画法を用いて最適な経路を探索する。
  • パフォーマンス-エポック曲線の変曲点に基づき、1つの状態から別の状態に遷移する最適なエポックを特定するための膝点推定法を用いる。
  • 最適化パスは検証セット上で事前に学習され、最終的なモデルの訓練に適用される。これにより、適応的かつデータ駆動型のハイパーパrameterスケジューリングが実現される。
  • 空間的および時間的特徴を別々に最適化できるように、DG-P3Dアーキテクチャに新しい二重ヘッド分類器を導入する。
  • 同じ最適化パスをKinetics-400およびKinetics-600の両方で再利用することで、効率を高めながら複数のデータセットで3D ConvNetsを訓練する。

実験結果

リサーチクエスチョン

  • RQ13D ConvNetの訓練において、ヒューリスティックなハイパーパrameterチューニングに代わる、原理的かつ自動化された戦略を開発可能か?
  • RQ2訓練中に、最適なクリップ長、サンプリング戦略、および学習率の順序をどのように特定できるか?
  • RQ3パフォーマンス曲線の動的膝点検出は、訓練状態間の遷移を適切に示唆できるか?
  • RQ4二重ヘッド分類器は、動画認識のための3D ConvNetにおける空間的および時間的特徴学習を向上させるか?
  • RQ51つの学習済み最適化パスは、異なる動画データセットやモodalitiesに一般化可能か?

主な発見

  • 提案された最適化計画フレームワークは、Kinetics-400でトップ1精度80.5%を達成し、以前の最先端手法LGD-3Dを1.1%上回った。
  • Kinetics-600では82.7%のトップ1精度を達成し、最高の競合手法X3D-XLを0.8%上回った。
  • 二重ストリームのDG-P3Dモデルは、RGBおよびフォローアウト入力を用いてKinetics-600で84.3%のトップ1精度を達成し、二重ストリームLGD-3Dを1.2%上回った。
  • Kinetics-400で学習した最適化パスは、Kinetics-600へも効果的に一般化され、データセット間での転送性を示した。
  • SS-V1およびSS-V2では、それぞれ52.8%および65.5%のトップ1精度を達成し、以前の最良手法を0.9%および1.3%上回った。
  • テストされた7つのベンチマークすべてで一貫した性能向上が得られ、本手法の頑健性と一般化能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。