[論文レビュー] AutoSoC: Automating Algorithm-SOC Co-design for Aerial Robots
AutoSoC は、空中ロボットにおける自動アルゴリズム-SOC共同設計を可能にするフレームワークであり、ハードウェアアクセラレータ生成を伴うエンドツーエンドの学習ベースのナビゲーションを実現する。複雑な環境でも91%の成功率を達成し、4.8–60.2 μs の遅延と 0.142–1.09 W の消費電力を持つアクセラレータ候補を生成し、性能、面積、エネルギーのトレードオフを最適化する。
Aerial autonomous machines (Drones) has a plethora of promising applications and use cases. While the popularity of these autonomous machines continues to grow, there are many challenges, such as endurance and agility, that could hinder the practical deployment of these machines. The closed-loop control frequency must be high to achieve high agility. However, given the resource-constrained nature of the aerial robot, achieving high control loop frequency is hugely challenging and requires careful co-design of algorithm and onboard computer. Such an effort requires infrastructures that bridge various domains, namely robotics, machine learning, and system architecture design. To that end, we present AutoSoC, a framework for co-designing algorithms as well as hardware accelerator systems for end-to-end learning-based aerial autonomous machines. We demonstrate the efficacy of the framework by training an obstacle avoidance algorithm for aerial robots to navigate in a densely cluttered environment. For the best performing algorithm, our framework generates various accelerator design candidates with varying performance, area, and power consumption. The framework also runs the ASIC flow of place and route and generates a layout of the floor-planed accelerator, which can be used to tape-out the final hardware chip.
研究の動機と目的
- リソース制約のある空中ロボットにおける低飛行時間と限界のある機動性の課題を、制御ループにおける高い計算遅延に起因して解決する。
- 複雑な環境における自律ナビゲーションのためのエンドツーエンド(E2E)ディープ強化学習モデルの効率的デプロイメントを可能にする。
- 性能、消費電力、面積効率の観点から、ニューラルネットワークアーキテクチャとハードウェアアクセラレータ設計を共同最適化する。
- Tape-out準備の整った設計を実現するため、配置・配線フローを介してASIC適合のアクセラレータレイアウトを自動生成する。
提案手法
- フレームワークは、シミュレーテッドで密度の高い障害物環境において、障害物回避のためのエンドツーエンドポリシーを学習するため、カリキュラム学習に基づくDQNエージェントを用いる。
- PE数、MACランの幅、精度(8ビット/4ビット)を含む多次元設計空間を探索することで、E2Eモデルとハードウェアアクセラレータを共同設計する。
- パラレリズムと精度を設定可能にした、カスタムアクセラレータテンプレート「FlexACL」を生成し、性能、消費電力、面積のトレードオフをサポートする。
- ハイレベル合成(HLS)を用いてアクセラレータ候補を合成し、300MHzで16nmスタンダードセルライブラリを用いて評価する。
- HLS後のVerilog RTLを用いて、性能、消費電力、面積を推定し、最終設計は配置・配線を経てTape-out準備の整ったフロアプランを生成する。
実験結果
リサーチクエスチョン
- RQ1E2E学習モデルとハードウェアアクセラレータの自動共同設計は、空中ロボットの制御ループ周波数を向上させるとともに、エネルギー消費を低減できるか?
- RQ2性能、消費電力、面積のトレードオフを効率的に探索できる統合フレームワークは、ロボット制御用途のアクセラレータ設計においてどのように実現できるか?
- RQ3エンドツーエンド学習は、複雑で混雑したナビゲーションタスクにおいて高い成功率を達成できるが、リソース制約のあるプラットフォームへのデプロイ可能性はどの程度保たれるか?
- RQ4精度(8ビット対4ビット)と並列性(PE数、MACラン数)を変化させた場合、ロボット制御ワークロードにおけるアクセラレータ効率にどのような影響を与えるか?
主な発見
- E2E DQNモデルは、100件のテストトラジェクトリで密度の高い障害物環境を通過する際に91%の成功率を達成した。
- 学習が約2000エポックで進行した後、累積報酬が1000に安定に plateau に達したため、ポリシーの収束が確認された。
- 生成されたFlexACLアクセラレータ候補は、4.8 μs から 60.2 μs の遅延範囲、0.142 W から 1.09 W の消費電力範囲を示した。
- 8PEs-16MACランの構成が、性能・消費電力・面積のバランスを最適にした最適な妥協点であり、効率曲線の「膝」に位置した。
- 4PEs-16MACランのバージョンは、最小の消費電力と面積を達成したが、32PEs-16MACランのバージョンは最短の遅延を達成したが、リソースコストが最も高かった。
- フレームワークは、4PE FlexACLアクセラレータの配置・配線済みレイアウトを正常に生成し、ASIC Tape-outに向けた準備が整っていることを実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。