Skip to main content
QUICK REVIEW

[論文レビュー] Rate-Adaptive Neural Networks for Spatial Multiplexers

Suhas Lohit, Rajhans Singh|arXiv (Cornell University)|Sep 8, 2018
Video Surveillance and Tracking Methods参考文献 6被引用数 12
ひとこと要約

本論文は、測定演算子とニューラルネットワークを同時に学習できる、新規の3段階訓練アルゴリズムを提案する。これにより、微調整なしに、1つのモデルでさまざまな測定レートにおいて高品質な画像再構成と認識を実現するレート適応型圧縮センシングが可能になる。この手法は、単一レートベースラインと比較して最大15 dBのPSNR向上を達成し、オブジェクト追跡や画像認識といった動的応用においても、さまざまなレートで安定した性能を維持する。

ABSTRACT

In resource-constrained environments, one can employ spatial multiplexing cameras to acquire a small number of measurements of a scene, and perform effective reconstruction or high-level inference using purely data-driven neural networks. However, once trained, the measurement matrix and the network are valid only for a single measurement rate (MR) chosen at training time. To overcome this drawback, we answer the following question: How can we jointly design the measurement operator and the reconstruction/inference network so that the system can operate over a extit{range} of MRs? To this end, we present a novel training algorithm, for learning extbf{ extit{rate-adaptive}} networks. Using standard datasets, we demonstrate that, when tested over a range of MRs, a rate-adaptive network can provide high quality reconstruction over a the entire range, resulting in up to about 15 dB improvement over previous methods, where the network is valid for only one MR. We demonstrate the effectiveness of our approach for sample-efficient object tracking where video frames are acquired at dynamically varying MRs. We also extend this algorithm to learn the measurement operator in conjunction with image recognition networks. Experiments on MNIST and CIFAR-10 confirm the applicability of our algorithm to different tasks.

研究の動機と目的

  • トレーニング後に1つの測定レートに固定される既存の深層学習ベースの圧縮センシング手法の制限を解消すること。
  • テスト時に連続的な測定レートの範囲で、1つのニューラルネットワークが高品質な再構成と推論を実行できることを可能にすること。
  • 測定行列と再構成/推論ネットワークの両方を、レートに一般化可能なエンドツーエンドの共同最適化フレームワークとして学習すること。
  • モバイルデバイスやドローンなどのリソース制約のある環境で、レート適応型システムの実用的有用性を示すこと。
  • 再構成を完全に回避する高レベルのビジョンタスク、たとえば画像認識へのフレームワークの拡張

提案手法

  • 3段階の訓練アルゴリズムを提案:まず、1つのレート用に測定行列と再構成ネットワークを訓練する。次に、共有された潜在空間を用いて、複数のレートにわたってネットワークをファインチューニングする。最後に、レート適応性を実現するため、測定行列とネットワークを共同で最適化する。
  • 測定行列は、ネットワークの入力部に学習可能な全結合層としてパrameter化され、システム全体にエンドツーエンドのバックプロパゲーションが可能になる。
  • フレームワークは、各訓練バッチで事前に定義された範囲からランダムに測定レートをサンプリングするマルチレート訓練戦略を採用し、すべてのレートで再構成または分類損失を最小化するようにネットワークを最適化する。
  • 画像認識の場合は、再構成を回避し、圧縮測定値から直接分類を学習する。測定行列と分類器を共同で最適化する。
  • 最適化には標準的な手法(Adam、モーメンタム)を用い、学習率スケジューリングと重み減衰を適用。TensorFlowを用いて実装し、自動微分を活用。
  • MNISTおよびCIFAR-10を用いた分類、自然画像データセットを用いた再構成の両方で検証を行い、CNNおよびオートエンコーダアーキテクチャを用いる。

実験結果

リサーチクエスチョン

  • RQ1再トレーニングやファインチューニングなしに、広範な測定レートの範囲で高品質な画像再構成が可能な1つのニューラルネットワークを訓練できるか?
  • RQ2測定演算子と再構成ネットワークを共同で学習することで、固定レートでの学習と比較して性能がどのように向上するか?
  • RQ3レート適応型フレームワークを再構成を完全に回避する高レベルのビジョンタスク、たとえば画像認識に拡張できるか?
  • RQ4帯域、エネルギー、コンテンツ制約によって測定レートが変動する動的環境において、システムの性能はいかがなるか?
  • RQ5さまざまな測定レートでテストした場合、レート適応型ネットワークと単一レートベースラインとの間の性能差はどの程度か?

主な発見

  • 測定レート0.04で再構成する際、0.25でトレーニングされた単一レートベースラインと比較して、レート適応型ネットワークは最大15 dB高いPSNRを達成した。
  • CIFAR-10の画像認識において、0.10~0.25のテスト範囲で、0.25でトレーニングされたバニラネットワークと比較して、最大29.12ポイントの性能向上を示した。
  • MNISTでは、0.10~0.25の全測定レートで98%以上の精度を維持したが、単一レートベースラインはMR=0.10で66.13%まで低下した。
  • オブジェクト追跡のタスクでは、測定レートが動的に変化する状況でも、レート適応型ネットワークは競争力のある性能を維持し、リソース制約のあるシステムにおけるリアルタイム適応性を示した。
  • アーキテクチャの観点からも汎用性を示し、再構成タスクにおいてCNNおよびオートエンコーダの両方で優れた性能を発揮した。
  • 圧縮測定値からの直接認識の場合は、レート適応型フレームワークが測定レートの全範囲で安定した精度を達成したが、バニラモデルはトレーニングレート外では急激に性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。