[論文レビュー] Disjoint Multi-task Learning between Heterogeneous Human-centric Tasks
本稿では、別々の単一タスクデータセットを用いた、異種のヒューマンセンティックなタスク(行動分類と動画キャプション生成)間の不連続なマルチタスク学習のための新しい交互方向最適化手法を提案する。知識蒸留と温度スケーリングを活用し、継続的忘却を軽減することで、両タスクにおいて最先端の性能を達成し、単一タスクおよび標準的なマルチタスクベースラインを上回る。
Human behavior understanding is arguably one of the most important mid-level components in artificial intelligence. In order to efficiently make use of data, multi-task learning has been studied in diverse computer vision tasks including human behavior understanding. However, multi-task learning relies on task specific datasets and constructing such datasets can be cumbersome. It requires huge amounts of data, labeling efforts, statistical consideration etc. In this paper, we leverage existing single-task datasets for human action classification and captioning data for efficient human behavior learning. Since the data in each dataset has respective heterogeneous annotations, traditional multi-task learning is not effective in this scenario. To this end, we propose a novel alternating directional optimization method to efficiently learn from the heterogeneous data. We demonstrate the effectiveness of our model and show performance improvements on both classification and sentence retrieval tasks in comparison to the models trained on each of the single-task datasets.
研究の動機と目的
- 共有アノテーションのない不連続で異種のデータセット上でマルチタスクモデルを学習する課題に対処すること。
- 1つのサンプルに1つのタスクのラベルしか存在しないデータセットで学習する際の継続的忘却を軽減すること。
- 別々の行動分類とキャプション生成データセットから共同で学習することで、行動分類と文の検索の両方の性能を向上させること。
- 異なる理解レベルを持つヒューマンセンティックなタスクが共有表現学習を通じて相互に利益をもたらす可能性を検証すること。
提案手法
- 1つのタスクのデータで学習しながら、もう1つのタスクの知識を知識蒸留に基づく損失関数で保持する、交互方向最適化フレームワークを提案する。
- 温度ハイパーパrameter T=2 を用いた知識蒸留により、タスク間でのソフトラベル分布の転送を実現し、特徴の整合性を向上させる。
- 特徴抽出に共有トランクネットワークを、分類とキャプション生成にタスク固有のヘッドを用いる。
- 交差エントロピー損失と蒸留損失の重み付き組み合わせを適用し、mAPの最適な λ 値は λC=0.5 と λS=0.7 であることが特定された。
- 2段階の訓練プロセスを導入:まず1つのデータセットで学習し、その後、知識蒸留による保持を伴いながらデータセットを交互に切り替えながら学習を継続する。
- キャプション検索にはコントラスト損失、行動分類には交差エントロピー損失を適用し、交互更新により共同最適化を実現する。
実験結果
リサーチクエスチョン
- RQ1共有アノテーションのない異種のヒューマンセンティックなタスク間で不連続なマルチタスク学習が、単一タスク学習を上回る性能を達成できるか?
- RQ21つのサンプルに1つのタスクのラベルしか存在しないデータセットで学習する際、継続的忘却をどのように軽減できるか?
- RQ3共同学習設定において、行動分類とキャプション生成の損失の最適なバランスは何か?
- RQ4共有アノテーションが存在しない状況でも、行動認識から得た表現がキャプション検索を向上させられ、逆にキャプションの表現が行動分類を向上させられるか?
主な発見
- 提案手法は、単一タスクおよび標準的なマルチタスクベースラインを上回り、行動分類およびキャプション検索の両タスクで高いmAPを達成した。
- T=2 で知識蒸留を適用した場合が、L1、L2、交差エントロピー損失を上回る性能を示し、全指標で最良の結果を出した。
- タスク間予測の結果から、行動データから意味的に関連するキャプションを生成でき、キャプション埋め込みから正確な行動を予測できることが示された。
- 最適な損失重みは、キャプション生成に対して λC=0.5、行動分類に対して λS=0.7 であり、非一様なトレードオフが性能向上に寄与することが示された。
- 定性的な結果から、モデルが良好に一般化しており、行動データから妥当なキャプションを生成し、キャプション埋め込みから正しく行動を特定できることを示した。
- 本手法は汎用的かつ効果的であり、異なるデータモodalitiyに対しても有効である。異種のヒューマンセンティックなタスクが共有表現学習を通じて互いに補完しあえることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。