[논문 리뷰] Temporal Memory Attention for Video Semantic Segmentation
이 논문은 비디오 세분화를 위한 새로운 비광학유속 기반 방법인 시간 메모리 어텐션 네트워크(TMANet)를 제안한다. 이는 과거 프레임의 메모리와 자기어텐션 메커니즘을 사용하여 장거리 시간적 종속성을 모델링한다. 이전 프레임에서 관련 특징을 적응적으로 집계함으로써, TMANet는 ResNet-50를 사용하여 Cityscapes에서 80.3% mIoU, CamVid에서 76.5% mIoU의 최신 기술 수준(SOTA) 성능을 달성하며, 이는 이전 방법보다 낮은 계산 비용으로도 성능을 뛰어넘는다.
Video semantic segmentation requires to utilize the complex temporal relations between frames of the video sequence. Previous works usually exploit accurate optical flow to leverage the temporal relations, which suffer much from heavy computational cost. In this paper, we propose a Temporal Memory Attention Network (TMANet) to adaptively integrate the long-range temporal relations over the video sequence based on the self-attention mechanism without exhaustive optical flow prediction. Specially, we construct a memory using several past frames to store the temporal information of the current frame. We then propose a temporal memory attention module to capture the relation between the current frame and the memory to enhance the representation of the current frame. Our method achieves new state-of-the-art performances on two challenging video semantic segmentation datasets, particularly 80.3% mIoU on Cityscapes and 76.5% mIoU on CamVid with ResNet-50.
연구 동기 및 목표
- 광학유속 예측에 의존하지 않고 비디오 세분화에서 장거리 시간적 종속성을 모델링하는 데 도전하는 것.
- 적응형 어텐션 메커니즘을 통해 다수의 과거 프레임에서 시간적 맥락을 활용하여 세분화 정확도를 향상시키는 것.
- 광학유속 기반 방법과 비교해 계산 오버헤드를 줄이면서 성능을 유지하거나 향상시키는 것.
- 메모리 네트워크와 자기어텐션을 비디오 세분화에 도입하는 것으로, 이 분야에서의 새로운 적용을 제안하는 것.
제안 방법
- 모델은 현재 쿼리 프레임를 위한 시간적 맥락을 저장하기 위해 다수의 과거 레이블이 없는 프레임에서 메모리 백을 구성한다.
- 공유 백본 네트워크가 현재 프레임와 메모리 프레임 양쪽에서 특징을 추출한다.
- 시간 메모리 어텐션 모듈은 쿼리 특징과 메모리 키/밸류 간의 크로스 어텐션을 계산하여 현재 프레임 표현을 향상시킨다.
- 이 모듈은 쿼리-키-밸류 어텐션 메커니즘을 사용하여 메모리 내 관련된 공간-시간 특징에 동적으로 주목한다.
- 현재 프레임의 특징과 향상된 메모리 특징을 연결하여 분류 헤드를 통해 픽셀 단위 분류를 수행한다.
- 모델은 교차 엔트로피 손실로 훈련되며, 인코딩 레이어에 1x1 및 3x3 컨볼루션을 사용한 다중 척도 특징 집합 전략을 적용한다.

실험 결과
연구 질문
- RQ1광학유속 없이도 메모리 증강 자기어텐션 메커니즘이 비디오 세분화에서 장거리 시간적 종속성을 효과적으로 모델링할 수 있는가?
- RQ2과거 프레임 선택 전략(무작위 대비 연속적)이 성능과 특징 표현에 어떤 영향을 미치는가?
- RQ3성능과 계산 비용의 균형을 고려할 때, 메모리에 포함할 적절한 과거 프레임 수는 얼마인가?
- RQ4특징 집합 전략(연결 대비 합산)의 선택이 세분화 정확도에 어떤 영향을 미치는가?
- RQ5메모리 기반 어텐션 메커니즘이 정확도와 효율성 측면에서 기존의 광학유속 기반 및 비광학유속 기반 방법을 능가할 수 있는가?
주요 결과
- TMANet는 Cityscapes 검증 세트에서 80.3% mIoU를 기록하여 ResNet-50를 사용해 새로운 최신 기술 수준 성능을 달성했다.
- CamVid 데이터셋에서는 76.5% mIoU를 기록하여 이전 방법들을 모두 뛰어넘었다.
- 연속적 프레임 선택 전략이 무작위 선택 전략보다 성능이 뛰어나며, 이는 메모리 내 더 강한 국소 시간적 일관성 때문일 것이다.
- 특징 연결이 합산보다 더 높은 성능을 내며, 채널 단위 정보를 더 잘 유지하기 때문이다.
- 인코딩 모듈에서 1x1 및 3x3 컨볼루션 층의 조합이 단일 레이어 구성보다 더 나은 결과를 내며, 최적의 성능을 달성한다.
- 모델는 단지 754 GFLOPs의 계산량으로도 뛰어난 성능을 내며, 많은 이전의 광학유속 기반 방법보다 크게 낮은 계산 비용을 기록했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.