Skip to main content
QUICK REVIEW

[논문 리뷰] Value of Temporal Dynamics Information in Driving Scene Segmentation

Li Ding, Jack Terwilliger|arXiv (Cornell University)|2019. 03. 21.
Visual Attention and Saliency Detection참고 문헌 52인용 수 5
한 줄 요약

이 논문은 메모리 증강 네트워크를 사용하여 외관 및 시공간 특징을 함께 학습하여 운전 차량 환경 분할에서 시간적 동역학의 가치를 조사한다. 배경 'stuff' 클래스(예: 도로, 보도, 지형)는 시간적 맥락에서 크게 이득을 보이며, 전경 객체는 외관 기반 특징만으로도 더 잘 분할된다. 제안된 방법은 새로 공개된 MIT 운전 차량 환경 분할 데이터셋에서 경계 노이즈 제거 및 맥락 모델링을 향상시킨다.

ABSTRACT

Semantic scene segmentation has primarily been addressed by forming representations of single images both with supervised and unsupervised methods. The problem of semantic segmentation in dynamic scenes has begun to recently receive attention with video object segmentation approaches. What is not known is how much extra information the temporal dynamics of the visual scene carries that is complimentary to the information available in the individual frames of the video. There is evidence that the human visual system can effectively perceive the scene from temporal dynamics information of the scene's changing visual characteristics without relying on the visual characteristics of individual snapshots themselves. Our work takes steps to explore whether machine perception can exhibit similar properties by combining appearance-based representations and temporal dynamics representations in a joint-learning problem that reveals the contribution of each toward successful dynamic scene segmentation. Additionally, we provide the MIT Driving Scene Segmentation dataset, which is a large-scale full driving scene segmentation dataset, densely annotated for every pixel and every one of 5,000 video frames. This dataset is intended to help further the exploration of the value of temporal dynamics information for semantic segmentation in video.

연구 동기 및 목표

  • 비디오의 시간적 동역학이 정적 프레임 외관을 초월해 의미 분할에 얼마나 보완 정보를 제공하는지 조사하기 위해.
  • 동적 환경 이해에서 외관 기반 표현과 시공간 표현의 상대적 기여를 이해하기 위해.
  • 공간적 및 시공간적 특징을 동시에 모델링하는 공동 학습 프레임워크를 개발하기 위해.
  • 향후 연구를 지원하기 위해 대규모로 완전히 애너테이션된 운전 차량 환경 분할 데이터셋을 공개하기 위해.

제안 방법

  • 외관 스트림(DeepLabV3)과 순환 메모리 모듈을 사용한 메모리 강화 시간 스트림을 갖춘 이중 브랜치 네트워크를 제안한다.
  • 학습된 신뢰도에 기반해 외관 및 메모리 네트워크 예측의 융합을 동적으로 가중하기 위해 신뢰도 게이트를 도입한다.
  • 5,000개의 정밀하게 애너테이션된 비디오 프레임을 포함하는 MIT 운전 차량 환경 분할 데이터셋에서 모델을 엔드 투 엔드로 훈련시킨다.
  • 메모리 네트워크에서 유도된 시공간 맥락을 활용해 도로나 보도와 같은 맥락 의존적 'stuff' 클래스의 분할을 향상시킨다.
  • 외관 스트림에서 공간 표현을 향상시키기 위해 확장 컨볼루션과 다중 스케일 특징 집합을 활용한다.
  • 학습된 신뢰도 게이트를 통해 공간적 또는 시공간적 특징이 각 클래스에 대해 더 신뢰할 만한지 결정하기 위해 공간적 및 시간적 주의를 적용한다.

실험 결과

연구 질문

  • RQ1정적 이미지 외관을 초월해 운전 차량 환경 분할에 시간적 동역학 정보가 얼마나 더 많은 가치를 제공하는가?
  • RQ2운전 차량 환경에서(예: 전경 대비 배경) 시공간 모델링과 외관 모델링 중 어느 것이 더 유익한가?
  • RQ3학습 가능한 융합 메커니즘(신뢰도 게이트)이 외관 및 메모리 기반 예측을 효과적으로 균형 조절하여 분할의 강건성을 향상시킬 수 있는가?
  • RQ4메모리 네트워크가 도로나 보도와 같은 'stuff' 클래스의 경계 노이즈 제거 및 맥락 모델링을 얼마나 향상시키는가?
  • RQ5실제 운전 차량 영상에서 다양한 의미 카테고리에 따라 외관 및 시간적 특징의 기여도는 어떻게 변화하는가?

주요 결과

  • 메모리 네트워크는 도로, 보도, 지형와 같은 'stuff' 클래스의 분할을 크게 향상시키며, 특히 외관 신호가 모호한 경계 영역에서 두드러진다.
  • 자동차나 보행자와 같은 전경 객체는 외관 기반 특징을 사용할 때 더 정확하게 분할되며, 시간 모델링의 도움은 미미하다.
  • 훈련 중에 학습된 신뢰도 게이트는 전경 객체에 대해서는 외관 스트림에 더 의존하는 경향을 보이며, 배경 'stuff' 클래스에 대해서는 메모리 스트림에 더 의존한다.
  • 제안된 방법은 기준 모델인 DeepLabV3에 비해 일관된 향상을 이룩하였으며, 특히 맥락 의존적 클래스에서 오류를 줄이는 데 효과적이다.
  • MIT 운전 차량 환경 분할 데이터셋은 향후 자율주행 시나리오에서 장기적 및 단기적 시공간 맥락 모델링 연구를 지원한다.
  • 정성적 분석을 통해 시간적 맥락이 운동 블러나 카메라 효과로 인한 모호성을 해소하는 데 도움이 되며, 특히 배경 영역에서 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.