[논문 리뷰] FlowFormer: A Transformer Architecture for Optical Flow
FlowFormer는 4차원 비용 볼륨을 교대 그룹 자기주의를 통해 압축되고 전역적으로 인지하는 잠재 토큰으로 인코딩하고, 동적 위치 쿼리를 갖춘 반복적 트랜스포머를 통해 플로우 예측을 디코딩하는 새로운 트랜스포머 기반 아키텍처를 제안한다. 이는 Sintel(클리어 패스에서 1.159 AEPE)에서 최신 기술 수준의 성능을 달성하고, Sintel 미세조정 없이도 강력한 제로샷 일반화 성능을 보이며, 이전 방법보다 15.5%의 오차 감소를 기록한다.
We introduce optical Flow transFormer, dubbed as FlowFormer, a transformer-based neural network architecture for learning optical flow. FlowFormer tokenizes the 4D cost volume built from an image pair, encodes the cost tokens into a cost memory with alternate-group transformer (AGT) layers in a novel latent space, and decodes the cost memory via a recurrent transformer decoder with dynamic positional cost queries. On the Sintel benchmark, FlowFormer achieves 1.159 and 2.088 average end-point-error (AEPE) on the clean and final pass, a 16.5% and 15.5% error reduction from the best published result (1.388 and 2.47). Besides, FlowFormer also achieves strong generalization performance. Without being trained on Sintel, FlowFormer achieves 1.01 AEPE on the clean pass of Sintel training set, outperforming the best published result (1.29) by 21.7%.
연구 동기 및 목표
- 기존 방법에서 널리 사용되는 비용 볼륨 표현을 효과적으로 활용하는 트랜스포머 기반 플로우 추정 네트워크를 설계하는 것.
- 표준 트랜스포머를 4차원 비용 볼륨에 직접 적용할 수 없는 계산 비용 문제를 해결하기 위해 압축되고 효율적인 토큰화 및 주목력 메커니즘을 도입하는 것.
- 새로운 교대 그룹 주목력 메커니즘을 통해 비용 특징 내 장거리 의존성을 모델링하여 플로우 추정 정확도와 일반화 능력을 향상시키는 것.
- 원시 픽셀을 처리하는 것보다 비용 볼륨과 트랜스포머를 통합하는 것이 더 뛰어난 성능과 파rameter 효율성을 이끌어내는지 입증하는 것.
제안 방법
- 4차원 비용 볼륨 내 각 2차원 비용 맵을 패치로 토큰화한 후, 각 패치를 K개의 잠재 토큰으로 변환하여 4차원 볼륨을 H×W×K개의 토큰으로 압축한다.
- 동일한 소스 픽셀의 비용 맵 내에서 자기주목력을 번갈아 적용하고, 서로 다른 소스 픽셀 간에도 주목력을 적용하는 교대 그룹 트랜스포머(AGT) 레이어를 활용하여 전역적 맥락 모델링을 가능하게 한다.
- AGT 레이어에 의해 생성된 비용 메모리는 전체 비용 볼륨의 압축되고 전역적으로 인지된 표현으로, 흐름 관련 핵심 정보를 유지한다.
- 반복적 트랜스포머 디코더는 현재 플로우 추정에 기반해 업데이트되는 동적 위치 비용 쿼리를 사용하여 비용 메모리 위에서의 교차 주목력을 유도한다.
- 디코더는 공유된 게이팅 순환 단위(GRU) 헤드를 사용하여 반복적으로 플로우 잔차를 회귀함으로써 정밀도를 향상시킨다.
- 이미지 특징 인코더는 옵션으로 ImageNet 미사전 훈련된 비전 트랜스포머(Twins-SVT)로 교체 가능하며, 이는 표준 CNN보다 성능 향상을 이끈다.
실험 결과
연구 질문
- RQ1표준 트랜스포머를 4차원 비용 볼륨에 효과적으로 적용하면서도 계산 비용을 효율적으로 유지할 수 있는가?
- RQ2장거리 의존성을 새로운 주목력 메커니즘을 통해 모델링하면 국소 윈도우 기반 방법에 비해 플로우 추정 정확도가 향상되는가?
- RQ3비용 볼륨의 압축된 잠재 표현이 정확한 플로우 예측을 위해 충분한 정보를 유지할 수 있는가, 이는 대규모 파ram터화의 필요성을 줄일 수 있는가?
- RQ4비용 볼륨과 트랜스포머를 통합하면 이전 방법보다 더 나은 제로샷 일반화 성능을 달성할 수 있는가?
주요 결과
- FlowFormer는 Sintel 클리어 패스에서 1.159 평균 종점 오차(AEPE)를 기록하여 이전 최고 성능(1.388) 대비 16.5%의 오차 감소를 달성했다.
- Sintel 파이널 패스에서는 2.088 AEPE를 기록하여 이전 최고 기록(2.47) 대비 15.5%의 오차 감소를 기록했다.
- Sintel에서의 미세조정 없이도 FlowFormer는 Sintel 클리어 패스에서 1.01 AEPE를 기록하여 최고의 공개 결과(1.29)보다 21.7%의 오차 감소를 달성했다.
- 더 작은 설정(K=4, D=32, AGT×1)에서도 GMA를 모든 지표에서 능가하여, 파ram터 수를 초월한 아키텍처적 우월성을 입증했다.
- GMA의 CNN 인코더를 FlowFormer에서 사용한 동일한 ImageNet 미사전 훈련된 Twins-SVT로 교체했을 때 Sintel 클리어 패스에서 오직 15%의 오차 감소에 그쳤지만, FlowFormer는 여전히 15% 낮은 오차를 기록하여, 설계의 우수성을 입증했다.
- 제거 분석 결과, AGT 레이어와 비용 메모리 표현이 성능 향상에 크게 기여하며, AGT 레이어 수가 0에서 3으로 증가함에 따라 AEPE가 감소하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.