Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Hashing Learning for Visual and Semantic Retrieval of Remote Sensing Images

Weiwei Song, Shutao Li|arXiv (Cornell University)|2019. 09. 10.
Advanced Image and Video Retrieval Techniques참고 문헌 48인용 수 5
한 줄 요약

이 논문은 원격 감지 이미지의 동시에 시각적 검색과 의미적 검색을 수행하는 통합된 딥 해싱 컨volution 신경망(DHCNN)을 제안한다. 단일 엔드 투 엔드 프레임워크 내에서 압축된 이진 코드를 위한 해시 레이어와 의미 분류를 위한 소프트맥스 기반 완전 연결 레이어를 통합함으로써, 검색 정확도(mAP)와 분류 정확도(OA)에서 최신 기술 수준(SOTA) 성능을 달성하였으며, UCMD 및 AID 데이터셋에서 각각 97.68%와 93.48%의 정확도를 기록하였다.

ABSTRACT

Driven by the urgent demand for managing remote sensing big data, large-scale remote sensing image retrieval (RSIR) attracts increasing attention in the remote sensing field. In general, existing retrieval methods can be regarded as visual-based retrieval approaches which search and return a set of similar images from a database to a given query image. Although retrieval methods have achieved great success, there is still a question that needs to be responded to: Can we obtain the accurate semantic labels of the returned similar images to further help analyzing and processing imagery? Inspired by the above question, in this paper, we redefine the image retrieval problem as visual and semantic retrieval of images. Specifically, we propose a novel deep hashing convolutional neural network (DHCNN) to simultaneously retrieve the similar images and classify their semantic labels in a unified framework. In more detail, a convolutional neural network (CNN) is used to extract high-dimensional deep features. Then, a hash layer is perfectly inserted into the network to transfer the deep features into compact hash codes. In addition, a fully connected layer with a softmax function is performed on hash layer to generate class distribution. Finally, a loss function is elaborately designed to simultaneously consider the label loss of each image and similarity loss of pairs of images. Experimental results on two remote sensing datasets demonstrate that the proposed method achieves the state-of-art retrieval and classification performance.

연구 동기 및 목표

  • 기존의 원격 감지 이미지 검색 방법이 유사한 이미지만 반환하는 한계를 해결하기 위해.
  • 시각적 검색과 의미 분류를 하나의 딥 러닝 프레임워크로 통합하여 분석적 유용성을 향상시키기 위해.
  • 이미지 유사성과 의미 레이블 정확도를 동시에 최적화하는 손실 함수를 설계하기 위해.
  • 고성능의 의미 이해를 유지하면서도 효율적인 실시간 검색을 가능하게 하는 압축된 이진 해시 코드를 활용하기 위해.

제안 방법

  • 원시 원격 감지 이미지에서 고차원의 깊은 특징을 추출하기 위해 사전 훈련된 CNN을 사용한다.
  • 효율적인 검색을 위해 네트워크에 해시 레이어를 삽입하여 깊은 특징을 저차원의 이진 해시 코드로 매핑한다.
  • 의미 분류를 위해 해시 레이어 위에 소프트맥스 활성화 함수를 갖는 완전 연결 레이어를 추가한다.
  • 의미 레이블 손실과 쌍별 이미지 유사성 손실을 동시에 최소화하는 복합 손실 함수를 설계한다.
  • 레이블 감독과 유사성 유지 간의 균형 잡힌 조합을 사용하여 네트워크를 엔드 투 엔드로 훈련한다.
  • 해시 코드의 압축성과 의미 및 유사성 제약 간의 트레이드오프를 제어하기 위해 하이퍼파rameter β와 η를 조정한다.

실험 결과

연구 질문

  • RQ1통합된 딥 러닝 프레임워크를 통해 원격 감지 이미지를 동시에 시각적으로 유사한 이미지로 검색하고 의미 레이블을 분류할 수 있는가?
  • RQ2이미지 간 유사성과 이미지 내 의미 정확도를 모두 유지하면서 해시 코드를 효과적으로 학습할 수 있는가?
  • RQ3의미 분류 손실과 이미지 유사성 손실 간의 최적의 균형은 무엇인가?
  • RQ4하이퍼파rameter β와 η는 제안된 DHCNN의 검색 및 분류 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 DHCNN은 UCMD 데이터셋에서 평균 평균 정밀도(mAP) 97.68%를 기록하여 기존 최신 기술 수준의 방법들을 초월하였다.
  • AID 데이터셋에서는 분류 정확도 93.48%를 달성하여 강력한 의미 분류 능력을 입증하였다.
  • β의 최적 값은 25이며, 이는 성능 저하 없이 압축된 해시 코드를 보장한다.
  • η의 최적 값은 0.2이며, 이는 의미와 유사성 손실 간의 균형 잡힌 트레이드오프가 최고의 성능을 낳음을 시사한다.
  • CaffeNet, GoogLeNet, VGG-VD16 등의 베이스라인 모델에 비해 검색 및 분류 작업 전반에서 뚜렷한 성능 향상을 보였다.
  • 제거 실험 결과, 의미와 유사성 손실을 모두 통합한 경우가 각각 별도로 사용할 경우보다 열등한 성능을 보이지 않았음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.