[논문 리뷰] Background subtraction using the factored 3-way restricted Boltzmann machines
이 논문은 순차적 영상에서 전역 운동 패턴을 학습하기 위해 요인화된 3방향 제한된 봄볼트 막대기 모델(RBM)을 제안한다. 이는 예측된 운동에서의 이탈을 탐지함으로써 배경 제거를 가능하게 한다. 학습된 유동 필드를 통해 이동과 회전을 모델링함으로써, 전역 운동에서 어긋나는 영역으로서의 전경 물체를 식별하며, 기존의 컴퓨터 비전 기법에 의존하지 않고도 강력한 운동 기반 분할을 달성한다.
In this paper, we proposed a method for reconstructing the 3D model based on continuous sensory input. The robot can draw on extremely large data from the real world using various sensors. However, the sensory inputs are usually too noisy and high-dimensional data. It is very difficult and time consuming for robot to process using such raw data when the robot tries to construct 3D model. Hence, there needs to be a method that can extract useful information from such sensory inputs. To address this problem our method utilizes the concept of Object Semantic Hierarchy (OSH). Different from the previous work that used this hierarchy framework, we extract the motion information using the Deep Belief Network technique instead of applying classical computer vision approaches. We have trained on two large sets of random dot images (10,000) which are translated and rotated, respectively, and have successfully extracted several bases that explain the translation and rotation motion. Based on this translation and rotation bases, background subtraction have become possible using Object Semantic Hierarchy.
연구 동기 및 목표
- 로봇의 3차원 환경 인식에서 고차원적이고 노이즈가 많은 시각 센서 데이터로부터 의미 있는 운동 정보를 추출하는 데 도전한다.
- 전통적인 컴퓨터 비전 기법(예: SIFT 또는 HOG)에 의존하지 않고, 전역 운동 패턴을 학습함으로써 영상 시퀀스에서의 배경 제거를 향상시킨다.
- 딥 베리프 네트워크(DBNs)를 오브제кт 의미 계층 구조(OSH) 프레임워크와 통합하여 운동 인식 가능 시나리오 이해를 가능하게 한다.
- 요인화된 3방향 RBM이 이미지 쌍으로부터 이동 및 회전 기반을 추출할 수 있음을 입증한다. 이를 통해 운동 유동 추정 및 전경 탐지가 가능하다.
제안 방법
- 2개의 순차적 영상을 가시 단위로 수용하도록 3방향 요인화 RBM을 적응시켜, 그 사이의 변환을 모델링한다.
- 가시 편향, 은닉 편향, 가중치 행렬을 사용한 에너지 기반 모델링을 통해 입력과 출력 이미지 쌍 간의 공동 확률 분포를 학습한다.
- 이동을 위한 10,000개의 무작위 점 이미지와 회전을 위한 1,000개의 MNIST 이미지를 사용하여 운동 불변 기반을 학습한다.
- 각 입력 픽셀에 대해 가장 활성화된 출력 픽셀을 식별함으로써 최대 유동 필드를 추출하고, 운동 유동을 시각화한다.
- 유추된 유동 필드를 사용하여 미리 보지 않은 입력에서 출력 이미지를 유추 기반으로 재구성함으로써 운동 일반화 능력을 검증한다.
- 전역 운동 모델을 사용하여 OSH 프레임워크 내에서 운동 일관성을 보이는 배경 영역과 운동 위반 영역인 전경 영역을 분할한다.
실험 결과
연구 질문
- RQ1요인화된 3방향 RBM은 순차적 이미지 쌍으로부터 이동 및 회전 운동 패턴을 효과적으로 학습할 수 있는가?
- RQ2학습된 운동 유동 필드는 전역 운동에서의 이탈을 탐지함으로써 정확한 배경 제거를 가능하게 하는가?
- RQ3DBNs를 OSH 프레임워크와 통합함으로써 기존 컴퓨터 비전 접근 방식에 비해 운동 기반 시나리오 이해 능력이 향상되는가?
- RQ4유추된 운동 필드를 사용하여 미리 보지 않은 이미지를 재구성하는 데 모델이 일반화할 수 있는가?
주요 결과
- 모델은 이진 임의 점 이미지와 MNIST 이미지 시퀀스에서 9개의 별도된 이동 패턴(예: 위, 아래, 대각선)과 360° 회전 패턴을 성공적으로 학습하였다.
- 최대 유동 필드는 균일한 상향 운동이나 원형 회전과 같은 주요 전역 운동 방향을 명확히 시각화하여 운동 패턴 추출이 확인되었다.
- 유추된 운동 필드를 사용하여 미리 보지 않은 입력에서 출력 이미지를 정확하게 재구성함으로써 일반화 능력이 입증되었다.
- 예측된 전역 운동에서 어긋나는 영역가 신뢰성 있게 전경으로 식별되었으며, 이는 배경 제거 메커니즘이 검증됨을 의미한다.
- SIFT나 HOG와 같은 수작업 특징에 의존하지 않고 데이터에서 운동을 학습함으로써 기존 방법에 비해 우수한 성능을 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.