Skip to main content
QUICK REVIEW

[論文レビュー] Vision Transformers For Weeds and Crops Classification Of High Resolution UAV Images

Reenul Reedha, Eric Dericquebourg|arXiv (Cornell University)|Sep 6, 2021
Smart Agriculture and AI参考文献 43被引用数 8
ひとこと要約

本稿では、畳み込み演算を用いずに、赤ホウレンソウ、雑種ホウレンソウ、パセリ、ホウレンソウの高分解能ドローン画像(UAV)を分類するためにビジョントランスフォーマー(ViT)を提案する。限られたラベル付きデータで学習させた結果、ViTは、ResNet や EfficientNet などの最先端の畳み込みニューラルネットワーク(CNN)を上回り、特に小規模なデータセットにおいて優れた汎化性能と効率性を示し、農業分野における画像分類の分野でViTの優位性を実証した。

ABSTRACT

Crop and weed monitoring is an important challenge for agriculture and food production nowadays. Thanks to recent advances in data acquisition and computation technologies, agriculture is evolving to a more smart and precision farming to meet with the high yield and high quality crop production. Classification and recognition in Unmanned Aerial Vehicles (UAV) images are important phases for crop monitoring. Advances in deep learning models relying on Convolutional Neural Network (CNN) have achieved high performances in image classification in the agricultural domain. Despite the success of this architecture, CNN still faces many challenges such as high computation cost, the need of large labelled datasets, ... Natural language processing's transformer architecture can be an alternative approach to deal with CNN's limitations. Making use of the self-attention paradigm, Vision Transformer (ViT) models can achieve competitive or better results without applying any convolution operations. In this paper, we adopt the self-attention mechanism via the ViT models for plant classification of weeds and crops: red beet, off-type beet (green leaves), parsley and spinach. Our experiments show that with small set of labelled training data, ViT models perform better compared to state-of-the-art CNN-based models EfficientNet and ResNet, with a top accuracy of 99.8\% achieved by the ViT model.

研究の動機と目的

  • 精密農業における高分解能UAV画像における雑草および作物の正確な分類の課題に取り組む。
  • 高コストな計算と大規模なラベル付きデータセットに依存するCNNベースのモデルの限界を克服する。
  • 自己注意機構を用いたトランスフォーマー型モデルであるViTの、小規模で実世界の農業画像データセットにおける性能を評価する。
  • データが限られた状況下でもViTが植物分類タスクにおいて実用的で優れた性能を示す可能性を実証する。
  • 今後の自動雑草制御システムにおけるオブジェクト検出パイプラインへのViT統合の基盤を提供する。

提案手法

  • 高分解像UAV RGB画像を重複のないパッチ(16×16ピクセル)に分割し、ビジョントランスフォーマーの入力とする。
  • 各パッチにクラス埋め込みと位置埋め込みを適用し、シーケンス入力における空間的および分類的情報を保持する。
  • マルチヘッド自己注意機構とフィードフォワードネットワークを用いた標準的なトランスフォーマー符号化器でパッチシーケンスを処理する。
  • [CLS]トークンの出力を分類ヘッドに接続し、植物種別(赤ホウレンソウ、雑種ホウレンソウ、パセリ、ホウレンソウ)を予測する。
  • 交差検証(5分割)を用い、エンドツーエンドで学習を実行し、モデルの頑健性を確保する。
  • 同じ学習および評価プロトコル下で、ViT-B/16 と最先端のCNN(ResNet50、EfficientNet-B0、EfficientNet-B1)を比較する。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーは、高分解像UAV画像における作物および雑草分類において、CNNベースのモデルを上回る分類正確性を達成できるか?
  • RQ2ラベル付き学習データ量が減少するに従って、ViTの性能はCNNと比べてどのように変化するか?
  • RQ3ViTに内蔵された自己注意機構は、局所的な畳み込み演算に比べ、農業画像分類においてより優れた特徴学習と汎化能力を実現できるか?
  • RQ4限られた学習データでもViTは高い正確性を維持できるか。これは、データが不足する農業応用分野に適しているか?
  • RQ5学習データが減少した場合、ViT-B/16 はResNet やEfficientNetの各バージョンと比べて相対的にどの程度の頑健性を示すか?

主な発見

  • 12,844枚のラベル付き画像で学習させたViT-B/16は、テストセットで99.8%のトップ1正確度を達成し、ResNet50(99.50%)、EfficientNet-B0(98.78%)、EfficientNet-B1(98.98%)を上回った。
  • 学習画像を3,211枚に減らした場合、ViT-B/16はF1スコア99.63%を維持したが、これはResNet50(97.54%)、EfficientNet-B0(96.53%)、EfficientNet-B1(95.91%)を大きく上回った。
  • 学習データを12,844枚から4,535枚に減らした際、ViT-B/16の性能低下は最小限(99.80%から99.14%)に抑えられたが、CNNはより急激な低下を示した。
  • EfficientNet-B1は、学習データを12,844枚から3,211枚に減らした際、3.07%の性能低下を示し、データ効率が低いことが明らかになった。
  • ViT-B/16は、すべてのデータ環境において最も安定した性能を示し、特にデータが少ない状況下でも優れたデータ効率と頑健性を示した。
  • 結果から、ラベル付きデータが限られる状況下でも、ViT-B/16がCNNよりも優れた汎化性能を示すことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。