Skip to main content
QUICK REVIEW

[논문 리뷰] CRAFT: Cross-Attentional Flow Transformer for Robust Optical Flow

Xiuchao Sui, Shaohua Li|arXiv (Cornell University)|2022. 03. 31.
Advanced Vision and Imaging인용 수 8
한 줄 요약

CRAFT는 큰 이동과 운동 왜곡 상황에서 노이즈를 줄이고 강건성을 향상시키기 위해 의미적 스무딩 트랜스포머와 크로스프레임 어텐션을 사용하여 상관 범위 계산을 향상시키는 새로운 광학 흐름 네트워크를 제안한다. 이는 Sintel (Final)과 KITTI (전경)에서 최신 기술 수준의 성능을 달성하며, 큰 운동을 시뮬레이션하는 적대적 이미지 이동 공격 상황에서도 RAFT와 GMA를 능가한다.

ABSTRACT

Optical flow estimation aims to find the 2D motion field by identifying corresponding pixels between two images. Despite the tremendous progress of deep learning-based optical flow methods, it remains a challenge to accurately estimate large displacements with motion blur. This is mainly because the correlation volume, the basis of pixel matching, is computed as the dot product of the convolutional features of the two images. The locality of convolutional features makes the computed correlations susceptible to various noises. On large displacements with motion blur, noisy correlations could cause severe errors in the estimated flow. To overcome this challenge, we propose a new architecture "CRoss-Attentional Flow Transformer" (CRAFT), aiming to revitalize the correlation volume computation. In CRAFT, a Semantic Smoothing Transformer layer transforms the features of one frame, making them more global and semantically stable. In addition, the dot-product correlations are replaced with transformer Cross-Frame Attention. This layer filters out feature noises through the Query and Key projections, and computes more accurate correlations. On Sintel (Final) and KITTI (foreground) benchmarks, CRAFT has achieved new state-of-the-art performance. Moreover, to test the robustness of different models on large motions, we designed an image shifting attack that shifts input images to generate large artificial motions. Under this attack, CRAFT performs much more robustly than two representative methods, RAFT and GMA. The code of CRAFT is is available at https://github.com/askerlee/craft.

연구 동기 및 목표

  • 큰 이동과 운동 왜곡 상황에서 상관 범위가 노이즈가 많고 허위 매칭으로 인해 손상되는 문제를 해결하기 위해.
  • 매칭 이전에 특징의 의미적 정교화와 노이즈 필터링을 통해 상관 범위 계산의 강건성을 향상시키기 위해.
  • 지역적 무늬 손실과 왜곡에 민감한 컨volution 특징 매칭에서의 도트곱 상관관계의 한계를 극복하기 위해.
  • 트랜스포머 기반 특징 스무딩과 크로스어텐션 메커니즘이 광학 흐름 추정에서 허위 상관관계를 크게 감소시킬 수 있음을 검증하기 위해.

제안 방법

  • 단일 프레임 내에서 전역적으로 특징을 스무딩하고 의미적으로 안정화시키기 위해 자기어텐션을 적용하는 의미적 스무딩 트랜스포머(SST) 레이어를 도입한다. 이는 상관 계산 이전에 수행된다.
  • 기존의 도트곱 상관관계를 대체하여 쿼리와 키 프로젝션을 사용해 노이즈가 많은 특징을 필터링하고 더 정확한 프레임 간 유사도를 계산하는 크로스프레임 어텐션 메커니즘을 도입한다.
  • 절연 연구 결과에 따르면, 두 프레임 모두에 SST를 적용할 경우 추가 노이즈가 유입될 수 있으므로, 한 프레임에만 SST를 적용하여 성능 저하를 방지한다.
  • RAFT와 유사한 다중 척도 흐름 정밀화 헤드를 사용하지만, 제안된 구성 요소로 개선된 상관 범위를 활용한다.
  • 큰 인위적 운동을 시뮬레이션하기 위해 새로운 이미지 이동 공격을 도입하여 극단적인 이동과 왜곡 상황에서의 강건성을 평가한다.
  • 비전 트랜스포머의 특성을 활용하여 이미지 전반에 걸쳐 의미적으로 유사하고 맥락적으로 관련된 픽셀을 참조함으로써 특징를 노이즈 제거한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 특징 스무딩 메커니즘이 광학 흐름 상관 범위의 노이즈를 줄이고, 흐릿하거나 무늬가 있는 이미지에서 매칭 정확도를 향상시킬 수 있는가?
  • RQ2도트곱 상관관계를 크로스프레임 어텐션으로 대체할 경우, 운동 왜곡과 큰 이동 상황에서 더 강건하고 정확한 흐름 추정이 가능한가?
  • RQ3RAFT와 GMA와 같은 최신 기술 수준의 방법들과 비교할 때, 제안된 CRAFT 아키텍처는 인위적 큰 운동과 이미지 열화에 대한 강건성에서 어떻게 성능을 내는가?
  • RQ4두 입력 프레임 모두에 의미적 스무딩 트랜스포머를 적용할 경우의 영향은 무엇이며, 왜 성능 저하가 발생하는가?
  • RQ5시각화된 히트맵을 통해 제안된 구성 요소가 상관 범위에서 허위 상관관계를 얼마나 줄이는가?

주요 결과

  • CRAFT는 Sintel (Final) 벤치마크에서 새로운 최신 기술 수준의 성능을 달성하며, 평균 종점 오차 (AEPE) 측면에서 RAFT와 GMA를 크게 능가한다.
  • KITTI (전경) 벤치마크에서는 평가된 모든 방법들 중에서 최고의 성능을 기록하여 실제 환경에 대한 강력한 일반화 능력을 입증한다.
  • 큰 이동을 시뮬레이션하는 이미지 이동 공격 상황에서 (Δu ∈ [100,300]), CRAFT는 낮은 AEPE를 유지하는 반면, RAFT와 GMA는 Δu = 160를 초과하면 심각한 성능 저하를 보인다.
  • Sintel (Final)에서 운동 왜곡 상황을 시각화한 결과, CRAFT가 계산한 상관 범위는 RAFT와 GMA보다 훨씬 적은 수의 허위 매칭을 포함하고 있음을 확인할 수 있다.
  • 두 프레임 모두에 의미적 스무딩 트랜스포머를 적용한 (Double SST) 경우, 허위 상관관계가 증가하고 성능이 저하됨을 확인하여, 단일 프레임 스무딩이 최적임을 입증한다.
  • 운동 왜곡이 있는 Slow Flow 데이터셋에서 CRAFT의 AEPE는 Sintel에서의 성능보다 뿐만 아니라, RAFT와 GMA는 80–100 픽셀 증가를 겪는 반면, CRAFT는 뿐다. 이는 CRAFT의 왜곡에 대한 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.