Skip to main content
QUICK REVIEW

[論文レビュー] Federated Action Recognition on Heterogeneous Embedded Devices

Pranjal Jain, Shreyas Goenka|arXiv (Cornell University)|Jul 18, 2021
Privacy-Preserving Technologies in Data参考文献 60被引用数 5
ひとこと要約

本稿では、異種の埋め込みデバイスにおける行動認識のための非同期フラグメンテッドラーニングフレームワークを提案する。大規模な Kinetics モデルからの知識蒸留を用いて、小規模なローカルデータセットにおける高精度なファインチューニングを可能にする。HMDB51 では 55.6% のトップ1 per-clip 正答率、UCF101 では 89.5% を達成し、中央サーバーでのファインチューニングと 2% 以内の差に抑えられるとともに、同期手法と比較して 40% の訓練時間短縮を達成した。

ABSTRACT

Federated learning allows a large number of devices to jointly learn a model without sharing data. In this work, we enable clients with limited computing power to perform action recognition, a computationally heavy task. We first perform model compression at the central server through knowledge distillation on a large dataset. This allows the model to learn complex features and serves as an initialization for model fine-tuning. The fine-tuning is required because the limited data present in smaller datasets is not adequate for action recognition models to learn complex spatio-temporal features. Because the clients present are often heterogeneous in their computing resources, we use an asynchronous federated optimization and we further show a convergence bound. We compare our approach to two baseline approaches: fine-tuning at the central server (no clients) and fine-tuning using (heterogeneous) clients using synchronous federated averaging. We empirically show on a testbed of heterogeneous embedded devices that we can perform action recognition with comparable accuracy to the two baselines above, while our asynchronous learning strategy reduces the training time by 40%, relative to synchronous learning.

研究の動機と目的

  • ローカルデータセットが小さすぎるため、有効な訓練が困難なリソース制限のある埋め込みデバイスにおける行動認識を可能にすること。
  • HMDB51 や UCF101 のような小規模データセットにおけるモデルの過学習問題に対処するため、知識蒸留を用いて事前学習済みモデルを活用すること。
  • ストレグラー(遅延する)デバイスが訓練を遅らせるため、異種エッジ環境における同期フラグメンテッドラーニングの制限を克服すること。
  • 実世界のエッジデプロイメントにおける可変なデバイス能力を想定した、非同期フラグメンテッド最適化戦略の開発と理論的バウンディング。
  • エッジベースのフラグメンテッドラーニングが、生動画データの共有なしに中央集約学習と同等の精度を達成できることを実証すること。

提案手法

  • 中央サーバーで、ResNet-34 を教師モデルとして用い、Kinetics-400 データセット上でより小さな ResNet-18 の学生モデルを知識蒸留により訓練する。
  • 蒸留された ResNet-18 を、ローカルクライアントデータセット(HMDB51 および UCF101)におけるファインチューニングの初期化に用い、小規模データにおける一般化性能を向上させる。
  • すべてのデバイスが待機しない非同期フラグメンテッド平均化アルゴリズムを実装し、クライントが独立してグローバルモデルを更新できるようにする。
  • 更新の影響を制御するための混合ハイパーパramータ β と、適応的集約重み a を導入し、収束安定性を向上させる。
  • 非 i.i.d. かつ異種クライアント条件下での非同期フラグメンテッド最適化の収束バウンディングを理論的に分析する。
  • ハイパーパramータのチューニングを経験的に実施し、HMDB51 および UCF101 の両データセットで最高の精度を達成する最適設定(a=0.5, β=0.7)を同定する。

実験結果

リサーチクエスチョン

  • RQ1大規模な事前学習済みモデルからの知識蒸留は、エッジデバイスにおける小規模ローカルデータセットにおける行動認識の精度向上に寄与するか?
  • RQ2非同期フラグメンテッドラーニングは、異種の埋め込みデバイス環境において、同期フラグメンテッド平均化と比較して収束速度と精度の点で優れているか?
  • RQ3非同期フラグメンテッドトレーニングにおいて、収束速度とモデル精度の最良のトレードオフをもたらすハイパーパramータ設定(a と β)は何か?
  • RQ4エッジデバイス上でのフラグメンテッドラーニングは、データ共有なしに中央集約学習と同等の精度にまで到達できるか、その程度はどの程度か?
  • RQ5提案されたフレームワークは、Jetson Nano や AGX Xavier のような実世界の埋め込みデバイスの計算およびストレージ制限を効果的に処理できるか?

主な発見

  • 提案された非同期フラグメンテッドラーニングフレームワークは、異種の埋め込みデバイスのテストベッドにおいて、同期フラグメンテッド平均化と比較して訓練時間を 40% 短縮した。
  • ハイパーパramータ a=0.5 および β=0.7 を用いることで、HMDB51 で 55.6% のトップ1 per-clip 正答率、UCF101 で 89.5% を達成し、中央サーバーでのファインチューニングベースライン(HMDB51 で 57.3%)と 2% 以内の差に抑えられた。
  • 教師アシスタント(TA)を介した知識蒸留により得られた ResNet-18 モデルは、Kinetics-400 で 54.6% の per-clip 正答率を達成し、ResNet-34 からの直接蒸留(53.8%)およびトレーニングから初期化した場合(50.2%)を上回った。
  • 1エポックあたりの訓練時間はデバイス間で顕著に異なる:Jetson Nano は AGX Xavier より 4.7 倍時間がかかっており、ストレグラーのボトルネックを回避するための非同期学習の必要性が浮き彫りになった。
  • 非同期トレーニングにおける収束速度は、β の値が小さい場合が最も遅く、これは入ってくるクライアント更新の重みが小さいためであり、結果の経験的妥当性が裏付けられた。
  • 知識蒸留中に 1 つより多くの教師アシスタントを追加しても、精度の向上はわずかであり、訓練時間の増加に見合う利益は得られず、収益逓減の兆候が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。