Skip to main content
QUICK REVIEW

[논문 리뷰] Object-to-Scene: Learning to Transfer Object Knowledge to Indoor Scene Recognition

Bo Miao, Liguang Zhou|arXiv (Cornell University)|2021. 08. 01.
Advanced Image and Video Retrieval Techniques인용 수 4
한 줄 요약

이 논문은 객체 분할 네트워크와 객체 특징 집합 모듈(OFAM)을 통해 고수준 객체 특징을 추출하고, 객체 관계를 객체 주의 모듈(OAM)과 글로벌 관계 집합 모듈(GRAM)을 사용해 모델링함으로써 실내 환경 인식을 향상시키는 일체형 아키텍처인 Object-to-Scene(OTS)를 제안한다. OTS는 추가 스트림 없이도 최신 기술보다 2% 이상의 정확도 향상을 달성하여 명시적인 객체 수준 표현과 관계 학습을 통해 뛰어난 성능을 입증한다.

ABSTRACT

Accurate perception of the surrounding scene is helpful for robots to make reasonable judgments and behaviours. Therefore, developing effective scene representation and recognition methods are of significant importance in robotics. Currently, a large body of research focuses on developing novel auxiliary features and networks to improve indoor scene recognition ability. However, few of them focus on directly constructing object features and relations for indoor scene recognition. In this paper, we analyze the weaknesses of current methods and propose an Object-to-Scene (OTS) method, which extracts object features and learns object relations to recognize indoor scenes. The proposed OTS first extracts object features based on the segmentation network and the proposed object feature aggregation module (OFAM). Afterwards, the object relations are calculated and the scene representation is constructed based on the proposed object attention module (OAM) and global relation aggregation module (GRAM). The final results in this work show that OTS successfully extracts object features and learns object relations from the segmentation network. Moreover, OTS outperforms the state-of-the-art methods by more than 2\% on indoor scene recognition without using any additional streams. Code is publicly available at: https://github.com/FreeformRobotics/OTS.

연구 동기 및 목표

  • 현재 실내 환경 인식 방법들이 객체 수준의 특징과 관계를 효과적으로 활용하지 못하는 한계를 해결하기 위해.
  • 직접적으로 객체 수준 특징에서 환경 수준 인식으로 지식을 전이할 수 있는 통합적이고 일체형의 단일 스트림 프레임워크를 개발하기 위해.
  • 주의 기반 메커니즘을 사용해 장거리 객체 관계를 모델링함으로써 환경 표현을 향상시키기 위해.
  • 다중 스트림 아키텍처나 수작업 특징에 의존하지 않고도 기존 방법보다 높은 정확도를 달성하기 위해.

제안 방법

  • 이 방법은 입력 이미지에서 고수준의 의미적 풍부한 객체 특징을 추출하기 위해 분할 네트워크와 객체 특징 집합 모듈(OFAM)을 결합한다.
  • 유연한 주의 메커니즘을 사용해 검출된 객체 간의 장거리 의존성과 동시에 발생하는 관계를 암묵적으로 학습하는 객체 주의 모듈(OAM)을 제안한다.
  • 깊이 분할 및 포인트 와이드 컨볼루션을 사용해 객체 특징과 관계를 융합하여 고수준의 환경 표현 벡터를 생성하는 글로벌 관계 집합 모듈(GRAM)을 제안한다.
  • 완전 연결 층은 집합된 환경 표현 기반으로 최종 환경 분류를 수행한다.
  • 전체 프레임워크는 엔드 투 엔드로 훈련 가능하며, 추가적인 특징 스트림이 필요 없이 단일 스트림 모델로 작동한다.
  • 모델은 교차 엔트로피 손실을 사용해 훈련되고, 표준 실내 환경 인식 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1명시적인 객체 특징 및 그 관계 모델링이 기존의 특징 기반 또는 전역 특징 기반 방법을 초월해 실내 환경 인식 성능을 향상시킬 수 있는가?
  • RQ2추가 스트림 없이 분할 기반 객체 특징을 활용하는 단일 스트림 아키텍처의 효과는 어떠한가?
  • RQ3OAM과 같은 주의 기반 모듈이 장거리 객체 관계를 얼마나 잘 포착하여 더 나은 환경 표현을 가능하게 하는가?
  • RQ4완전 연결 층이나 풀링과 같은 전통적인 융합 방법에 비해 GRAM은 정확도와 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • OTS는 실내 환경 인식 벤치마크에서 85.9%의 top-1 정확도를 달성하여, 추가 스트림 없이도 최신 기술보다 2% 이상 높은 성능을 기록한다.
  • 제거 실험 결과, 두 개의 객체 주의 블록(OAB)이 최고 성능(85.9%)을 내며, 블록을 더 추가할수록 모델 복잡도 증가로 인해 정확도가 떨어지는 것을 확인했다.
  • 제안된 객체 주의 블록은 단지 120만 파라미터와 21150만 FLOPs로 85.9%의 정확도를 달성했으며, 자체 주의(84.7%)와 비국소 주의(82.3%) 모듈을 모두 초월한다.
  • GRAM은 최소한의 파라미터(230만)와 FLOPs(230만)로도 85.9%의 최고 정확도를 기록했으며, 완전 연결 층과 풀링 층에 비해 정확도와 효율성 측면에서 뚜렷한 우월성을 보였다.
  • 실패 사례의 주요 원인은 객체 검출 오류에 기인한다 — 예를 들어, 주전자를 화장실로 잘못 검출할 경우 주방을 화장실로 잘못 인식하는 식이다. 이는 성능이 분할 품질에 민감하게 의존함을 시사한다.
  • 분할 네트워크에서 추출한 백본 특징만으로도 강력한 환경 인식이 가능함을 확인했으며, 적절한 객체 수준 특징 학습이 이루어진다면 추가 스트림이 필요하지 않다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.