[논문 리뷰] High-Resolution Optical Flow from 1D Attention and Correlation
이 논문은 고해상도 광학 흐름 추정을 위한 새로운 1D 어텐션과 상관관계 기반 비용 볼륨 구성 방법인 Flow1D를 제안한다. 2D 대응 매칭을 수직 및 수평 방향의 1D 어텐션과 상관관계 연산으로 분해함으로써 계산 복잡도를 O(H²W²)에서 O(HW(H+W))로 감소시켜, RAFT 대비 6배 낮은 메모리 소비로 8K 해상도 영상에서도 효율적인 추론을 가능하게 하며, Sintel 및 KITTI 벤치마크에서 경쟁력 있는 정확도를 유지한다.
Optical flow is inherently a 2D search problem, and thus the computational complexity grows quadratically with respect to the search window, making large displacements matching infeasible for high-resolution images. In this paper, we take inspiration from Transformers and propose a new method for high-resolution optical flow estimation with significantly less computation. Specifically, a 1D attention operation is first applied in the vertical direction of the target image, and then a simple 1D correlation in the horizontal direction of the attended image is able to achieve 2D correspondence modeling effect. The directions of attention and correlation can also be exchanged, resulting in two 3D cost volumes that are concatenated for optical flow estimation. The novel 1D formulation empowers our method to scale to very high-resolution input images while maintaining competitive performance. Extensive experiments on Sintel, KITTI and real-world 4K ($2160 imes 3840$) resolution images demonstrated the effectiveness and superiority of our proposed method. Code and models are available at \url{https://github.com/haofeixu/flow1d}.
연구 동기 및 목표
- RAFT와 같은 최신 광학 흐름 방법에서 4D 비용 볼륨의 이차적 계산 복잡도 문제를 해결하여 고해상도 입력에 대한 확장성 향상
- 4K 및 8K와 같은 고해상도 영상 처리 시 기존 4D 비용 볼륨 구성의 비효율성과 메모리 제약을 극복
- 경쟁력 있는 정확도를 유지하면서 실시간 추론이 가능한 컴act하고 효율적인 비용 볼륨 정식화 개발
- 소비자 수준의 고해상도 비디오에서 실용적인 광학 흐름 추정을 가능하게 하기 위해 핵심 대응 모델링을 훼손하지 않고 메모리와 계산량을 감소
제안 방법
- 목표 이미지 특징 맵에 수직으로 적용된 1D 어텐션 메커니즘을 통해 행 간 장거리 의존성 전파
- 어텐션 처리된 특징에 수평으로 1D 상관관계를 적용하여 수평 대응을 모델링하는 3D 비용 볼륨 구축
- 2D 매칭을 효과적으로 시뮬레이션하기 위해 어텐션과 상관관계 방향을 뒤바꿔 두 번째 3D 비용 볼륨 생성 후 첫 번째 비용 볼륨과 연결
- 크기가 H×W×W와 H×W×H인 두 개의 3D 비용 볼륨을 구성하여 표준 4D 상관관계 대비 전체 복잡도를 O(H²W²)에서 O(HW(H+W))로 감소
- 결과로 생성된 컴act한 비용 볼륨을 흐름 헤드 네트워크의 입력으로 사용해 엔드 투 엔드 광학 흐름 회귀 수행
- Transformer에 영감을 받은 자기어텐션 및 교차어텐션 메커니즘을 활용해 1D 정식화에서 특징 전파와 매칭 정확도 향상

실험 결과
연구 질문
- RQ12D 광학 흐름 대응 모델링이 정확도 손실 없이 수직 및 수평 1D 연산으로 분해될 수 있는가?
- RQ21D 어텐션과 상관관계가 계산 비용을 크게 감소시키면서도 표준 벤치마크에서 경쟁력 있는 성능을 달성할 수 있는가?
- RQ3기존 4D 비용 볼륨 방법 대비 이 방법이 초고해상도 영상(예: 4K 및 8K) 처리에 얼마나 잘 확장되는가?
- RQ4고해상도 입력에서 RAFT와 같은 최신 모델 대비 이 방법의 메모리 효율성과 추론 속도는 어떠한가?
주요 결과
- Sintel 테스트 스플릿에서 Flow1D는 최종 엔드포인트 오차 1.25로 두 번째로 높은 성능 기록, RAFT(1.27)에 이어지며 PWC-Net+(2.34)를 앞서나간다.
- KITTI 2015 벤치마크에서 Flow1D는 F1-all 점수 6.27을 기록해 PWC-Net+(7.72)를 앞서나가며 MaskFlowNet(6.10)에 가까이 다가가지만 RAFT(5.10)에는 약간 뒤진다.
- 1080p 해상도에서 Flow1D는 RAFT 대비 6배 낮은 메모리 소비를 기록하며, 비용 볼륨 계산 감소로 인해 훨씬 빠른 추론 속도를 보인다.
- Flow1D는 4K(2160×3840) 해상도 영상도 단지 5.8GB 메모리로 성공적으로 처리할 수 있으며, RAFT는 메모리 초과로 실패한다.
- 8K 해상도(4320×7680)에서도 21.81GB 메모리 소비로 처리 가능하여 현재 최신 기술을 뛰어넘는 강력한 확장성 입증
- DAVIS 1080p 및 4K 데이터셋에서의 시각적 비교 결과 Flow1D는 RAFT와 유사한 결과를 내보내며 눈에 띄는 잡음이나 구조적 일관성 저하 없이 우수한 성능 유지

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.