[論文レビュー] Light-YOLOv5: A Lightweight Algorithm for Improved YOLOv5 in Complex Fire Scenarios
Light-YOLOv5 は、複雑な火災シナリオに最適化された軽量で高精度な YOLOv5 ベースの火災検出モデルを提案する。C3 モジュールを分離型ビジョントランスフォーマー(SepViT)に置き換え、軽量なバイフラット特徴フュージョンネットワーク(Light-BiFPN)を統合し、グローバルアテンション機構(GAM)を適用し、Mish活性化関数と SIoU 損失関数を用いることで、mAP が 3.3% 向上し、パラメータ数が 27.1% 減少し、FLOPs が 19.1% 減少し、リアルタイム推論で 91.1 FPS を達成した。
Fire-detection technology is of great importance for successful fire-prevention measures. Image-based fire detection is one effective method. At present, object-detection algorithms are deficient in performing detection speed and accuracy tasks when they are applied in complex fire scenarios. In this study, a lightweight fire-detection algorithm, Light-YOLOv5 (You Only Look Once version five), is presented. First, a separable vision transformer (SepViT) block is used to replace several C3 modules in the final layer of a backbone network to enhance both the contact of the backbone network to global in-formation and the extraction of flame and smoke features; second, a light bidirectional feature pyramid network (Light-BiFPN) is designed to lighten the model while improving the feature extraction and balancing speed and accuracy features during a fire-detection procedure; third, a global attention mechanism (GAM) is fused into the network to cause the model to focus more on the global dimensional features and further improve the detection accuracy of the model; and finally, the Mish activation function and SIoU loss are utilized to simultaneously increase the convergence speed and enhance the accuracy. The experimental results show that compared to the original algorithm, the mean average accuracy (mAP) of Light-YOLOv5 increases by 3.3%, the number of parameters decreases by 27.1%, and the floating point operations (FLOPs) decrease by 19.1%. The detection speed reaches 91.1 FPS, which can detect targets in complex fire scenarios in real time.
研究の動機と目的
- YOLOv5 が複雑な火災シナリオにおいて、炎や煙の検出に低精度と高い計算コストの制限を受ける問題に対処する。
- バックボーンネットワークにおけるグローバルコンテキスト認識の向上により、炎や煙の特徴抽出を改善する。
- 軽量で効率的な特徴フュージョン機構を通じて、検出速度と精度のバランスを取る。
- 高度な活性化関数と損失関数を用いて、モデルの収束速度と検出精度を向上させる。
- リソース制限のある環境でのデプロイメントに適した、リアルタイム性・軽量性・高精度性を兼ね備えた火災検出を実現する。
提案手法
- 炎や煙のパターンにおける長距離依存関係を捉えるために、YOLOv5 バックボーン内の複数の C3 モジュールを分離型ビジョントランスフォーマー(SepViT)ブロックに置き換えることで、グローバル特徴表現を向上させる。
- モデルの複雑さを低減しつつ特徴フュージョン効率を向上させるために、軽量なバイフラット特徴フュージョンネットワーク(Light-BiFPN)を設計する。
- 重要なグローバル特徴を強調することで検出精度を向上させるために、グローバルアテンション機構(GAM)を統合する。
- 学習中の収束速度を向上させ、モデルの学習能力を向上させるために、Mish 活性化関数を採用する。
- 複雑な火災シナリオにおける局所化精度とロバスト性を向上させるために、SIoU 損失関数を適用する。
- 検出性能を損なわせることなく、パラメータ数と FLOPs を削減するため、全体的なアーキテクチャを最適化する。
実験結果
リサーチクエスチョン
- RQ1分離型ビジョントランスフォーマー(SepViT)ブロックは、複雑な火災シナリオにおける炎や煙の検出に向け、YOLOv5 のグローバル特徴表現を向上させることができるか?
- RQ2軽量な特徴フュージョンネットワークは、高い推論速度を維持しつつ、特徴フュージョンをどのように向上させることができるか?
- RQ3グローバルアテンション機構を統合することで、火災検出タスクにおける検出精度はどの程度向上するか?
- RQ4Mish 活性化関数と SIoU 損失関数を組み合わせることで、火災検出において収束が速まり、mAP が向上するか?
- RQ5全体的なモデルは、顕著に減少した FLOPs とパラメータ数を維持しながら、リアルタイム推論(≥90 FPS)を達成できるか?
主な発見
- Light-YOLOv5 は、元の YOLOv5 と比較して平均平均精度(mAP)が 3.3% 向上した。
- モデルは、ベースラインの YOLOv5 と比較して、パラメータ数を 27.1% 減少させた。
- 浮動小数点演算(FLOPs)は 19.1% 減少し、計算効率の向上を示した。
- モデルはリアルタイム推論速度 91.1 FPS を達成し、動的火災検出アプリケーションに適した性能を示した。
- SepViT、Light-BiFPN、GAM、Mish、SIoU の統合により、複雑な火災シナリオに適した強固で効率的な検出システムが実現された。
- 提案されたアーキテクチャは、モデルサイズと計算コストを顕著に低減しながらも、高い精度を維持しており、エッジデバイスへのデプロイメントを可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。