Skip to main content
QUICK REVIEW

[論文レビュー] XCloud: Design and Implementation of AI Cloud Platform with RESTful API Service

Lu Xu, Yating Wang|arXiv (Cornell University)|Dec 14, 2019
IoT and Edge/Fog Computing参考文献 19被引用数 5
ひとこと要約

XCloud は、RESTful API を介して一般的なコンピュータ ビジョンおよびデータマイニング サービスを公開するオープンソースの AI クラウド プラットフォームであり、研究者や開発者がアプリケーションに事前学習済みモデルを簡単に統合できるようにします。PyTorch および Django に基づいて構築されており、低遅延推論(例:皮膚疾患認識の平均遅延 16ms)を実現し、モジュラー設計と TensorRT 最適化により、ハイパフォーマンスなデプロイメントをサポートします。

ABSTRACT

In recent years, artificial intelligence (AI) has aroused much attention among both industrial and academic areas. However, building and maintaining efficient AI systems are quite difficult for many small business companies and researchers if they are not familiar with machine learning and AI. In this paper, we first evaluate the difficulties and challenges in building AI systems. Then an cloud platform termed XCloud, which provides several common AI services in form of RESTful APIs, is constructed. Technical details are discussed in Section 2. This project is released as open-source software and can be easily accessed for late research. Code is available at https://github.com/lucasxlu/XCloud.git.

研究の動機と目的

  • 機械学習パイプラインに不慣れな研究者や中小企業が AI システムを構築・デプロイする難易度を軽減すること。
  • 学術的な AI リサーチ モデルと本番環境向けアプリケーションの間のギャップを埋めるために、アクセス可能でオープンソースのクラウド サービスを提供すること。
  • 標準化され、パフォーマンスに優れた RESTful API を通じて、多様なアプリケーションへの AI 機能の迅速統合を可能にすること。
  • モジュラー コントローラー アーキテクチャにより、開発者がカスタム モデルをプラグインとして挿入できるようにすることで、拡張性を支援すること。
  • 負荷分散、ストレス テスト、および TensorRT を用いた推論最適化を通じて、高いパフォーマンスと安定性を確保すること。

提案手法

  • XCloud は、バックエンド フレームワークとして Django を、モデルのトレーニングおよび推論に PyTorch を使用して実装されている。
  • HTTP POST および GET メソッドを用いて、画像の URL や画像データそのものを入力として受け取ることで、RESTful API を介して AI サービスを公開している。
  • プラットフォームはモジュラーな MVC アーキテクチャを採用しており、ビュー、コントローラー、モデルを分離することで保守性と拡張性を向上させている。
  • 事前学習済みモデルには ResNet18、ResNet50、DenseNet121、HMTNet が含まれており、植物および疾患認識などのタスク向けに特定データセットでファインチューニングされている。
  • 推論の高速化には TensorRT を使用しており、2 枚の 2080TI GPU で 97.63 FPS を達成した(ネイティブ PyTorch 推論の 29.45 FPS よりも顕著に高速)。
  • ユーザーおよび API 使用データは、監視および分析の目的で、MySQL のリレーショナル テーブルにログ記録されている。

実験結果

リサーチクエスチョン

  • RQ1非エキスパートのユーザーが研究や中小企業で AI モデルを簡単にデプロイできるようにするためのクラウド プラットフォームは、どのように設計すべきか?
  • RQ2RESTful API を介して AI サービスを効率的でスケーラブルかつ拡張可能に公開するためのアーキテクチャパターンは何か?
  • RQ3TensorRT を用いたモデル最適化は、本番環境に近い条件下で推論遅延およびスループットにどのように影響を与えるか?
  • RQ4統合されたプラットフォームが、画像分類、顔貌属性予測、コンテンツフィルタリングなどの多様な AI タスクをどの程度サポートできるか?
  • RQ5標準的なハードウェアを用いた実際の負荷条件下で、どのようなパフォーマンスおよび安定性のメトリクスを達成できるか?

主な発見

  • 皮膚疾患認識の平均遅延は 16ms、顔の美しさ予測は 25ms であり、ストレス テストでは 100% の成功率を達成した。
  • JMeter を用いたストレス テストにより、負荷下でもすべてのテスト済み API でエラーがゼロであることが確認され、高い安定性を示した。
  • 2 枚の 2080TI GPU で TensorRT を使用した推論により、DenseNet169 で 97.63 FPS を達成し、ネイティブ PyTorch 推論(29.45 FPS)と比較して 3.3 倍の高速化を実現した。
  • 標準的なハードウェア(2080TI GPU と Intel Xeon CPU)でも、1 秒あたり 20 クエリ(QPS)の処理が可能であり、高いスケーラビリティの可能性を示した。
  • プラグイン コントローラー アーキテクチャにより、新しい AI モデルの統合がスムーズに行えるようになり、カスタム モデルのデプロイの煩わしさが軽減された。
  • GitHub でのオープンソース公開により、研究者がシステムにアクセスし、拡張・再現可能となるようになり、再現性と協働の促進が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。