Skip to main content
QUICK REVIEW

[論文レビュー] Analysis on DeepLabV3+ Performance for Automatic Steel Defects Detection

Zheng Nie, Jiachen Xu|arXiv (Cornell University)|Apr 9, 2020
Industrial Vision Systems and Defect Detection参考文献 12被引用数 6
ひとこと要約

この論文は、Severstalのデータセットにおける自動鋼鉄欠陊分類のため、DeepLabV3+にResNet101、EfficientNet-B1、DenseNet201をバックボーンとして用いて評価している。クラスの不均衡を解消するためにランダム加重データ拡張を適用し、ResNet101およびEfficientNet-B1ではmIoUが0.57を達成し、DenseNet201(0.325)を上回った。また、ResNet101は訓練時間も最も速く、実用的な産業応用に適している。

ABSTRACT

Our works experimented DeepLabV3+ with different backbones on a large volume of steel images aiming to automatically detect different types of steel defects. Our methods applied random weighted augmentation to balance different defects types in the training set. And then applied DeeplabV3+ model three different backbones, ResNet, DenseNet and EfficientNet, on segmenting defection regions on the steel images. Based on experiments, we found that applying ResNet101 or EfficientNet as backbones could reach the best IoU scores on the test set, which is around 0.57, comparing with 0.325 for using DenseNet. Also, DeepLabV3+ model with ResNet101 as backbone has the fewest training time.

研究の動機と目的

  • 産業的応用を想定した鋼鉄欠陊検出における、異なるバックボーン(ResNet、DenseNet、EfficientNet)を用いたDeepLabV3+の性能を調査すること。
  • 鋼鉄欠陊データセットに顕著なクラスの不均衡が存在するため、独自のランダム加重データ拡張戦略を用いてこれを是正すること。
  • 実際の鋼鉄表面画像を用いた、mIoUと訓練効率という観点からモデルの性能を評価すること。
  • 特に、小さなまたは断片的な欠陊の検出が困難であるため、人為的ラベリングが難しい点を含めたモデルの限界を分析すること。

提案手法

  • Severstal Kaggleコンペティションの大型鋼鉄欠陊データセットを用い、事前学習済みの3つのバックボーン(ResNet101、DenseNet201、EfficientNet-B1)を搭載したDeepLabV3+を適用した。
  • クラス頻度に反比例する確率で加重されるランダム加重データ拡張を用い、欠陊クラスの頻度をバランスさせた。
  • ランダムクロップ、垂直反転、ランダム回転の3種類の拡張法を用い、クラスに特化した重みを設定することで、拡張後の画像とマスクの空間的・意味的整合性を保った。
  • 訓練用に256×1700から256×256へのリサイズを実施したが、推論時にも元の解像度(256×1700)を用いて比較評価を実施した。
  • mIoUを評価指標として用い、全テストサンプルにおけるIoUスコアの平均値として算出した。
  • エンコーダ・デコーダ構造の有無を比較するアブレーションスタディを実施し、エンコーダモジュールの影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1異なるバックボーンアーキテクチャ(ResNet101、DenseNet201、EfficientNet-B1)は、鋼鉄欠陊分類におけるDeepLabV3+のmIoU性能にどのように影響を与えるか?
  • RQ2ランダム加重データ拡張は、不均衡な鋼鉄欠陊データセットにおけるモデルの一般化性能をどの程度向上させるか?
  • RQ3どのバックボーンが、分類精度(mIoU)と訓練効率の間で最も良いトレードオフを達成するか?
  • RQ4平均的なmIoUは高いにもかかわらず、一部のスコアが低くなるのはなぜか?また、データの不均衡やラベル品質がその要因である可能性は何か?
  • RQ5人為ラベルの閾値より小さな欠陊をモデルが検出できるか?その場合、mIoU評価にどのような影響を与えるか?

主な発見

  • ResNet101およびEfficientNet-B1バックボーンは、mIoUが約0.57と最高を記録し、ベースライン(0.29)およびDenseNet201(0.325)を大きく上回った。
  • ResNet101は全バックボーンの中で最も短い訓練時間を記録し、リアルタイム産業応用に最も適した選択肢であった。
  • DenseNet201は性能が低く、mIoUが0.325にとどまった。これは、クラス1および2に多く見られる小さな欠陊や断片的な欠陊に対して、アーキテクチャの感度が高いためと推測される。
  • 低スコアのIoUは、しばしばカウントおよび面積の両方で不足している小さなまたは極めて断片的な欠陊(特にクラス1)と関連していた。
  • モデルは人為ラベルの閾値より小さな欠陊を検出しており、これは正解ラベルに含まれていなかったが正しく予測された。今後のラベル付けの改善に貢献する可能性がある。
  • 可視化解析から、エンコーダ・デコーダ構造がベースラインモデルに比べてエッジの局所化と分類精度を著しく向上させたことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。