Skip to main content
QUICK REVIEW

[논문 리뷰] FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow Estimation

Xiaoyu Shi, Zhaoyang Huang|arXiv (Cornell University)|2023. 03. 02.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 마스크된 커스텀 볼륨 오토인코딩(MCVA)을 사용한 자기지도 학습 사전훈련 방법인 FlowFormer++을 제안한다. 블록 공유 마스킹과 장거리 복원 사전과제를 도입함으로써 MCVA는 커스텀 볼륨 인코더가 전반적인 맥락을 더 잘 포착할 수 있도록 강화하여, Sintel Clean에서 1.07 AEPE, KITTI-2015에서 4.52 F1-all을 기록하며 최신 기술 수준(SOTA) 성능을 달성한다. 이는 FlowFormer 대비 오차 감소율이 각각 7.76%와 7.18% 높은 성능이다.

ABSTRACT

FlowFormer introduces a transformer architecture into optical flow estimation and achieves state-of-the-art performance. The core component of FlowFormer is the transformer-based cost-volume encoder. Inspired by the recent success of masked autoencoding (MAE) pretraining in unleashing transformers' capacity of encoding visual representation, we propose Masked Cost Volume Autoencoding (MCVA) to enhance FlowFormer by pretraining the cost-volume encoder with a novel MAE scheme. Firstly, we introduce a block-sharing masking strategy to prevent masked information leakage, as the cost maps of neighboring source pixels are highly correlated. Secondly, we propose a novel pre-text reconstruction task, which encourages the cost-volume encoder to aggregate long-range information and ensures pretraining-finetuning consistency. We also show how to modify the FlowFormer architecture to accommodate masks during pretraining. Pretrained with MCVA, FlowFormer++ ranks 1st among published methods on both Sintel and KITTI-2015 benchmarks. Specifically, FlowFormer++ achieves 1.07 and 1.94 average end-point error (AEPE) on the clean and final pass of Sintel benchmark, leading to 7.76\% and 7.18\% error reductions from FlowFormer. FlowFormer++ obtains 4.52 F1-all on the KITTI-2015 test set, improving FlowFormer by 0.16.

연구 동기 및 목표

  • 비용 볼륨에 적용할 때 랜덤 마스킹이 가지는 한계를 해결하기 위해, 이웃한 원천 픽셀의 비용 맵 간 높은 상관관계로 인해 발생하는 정보 泄漏 문제를 해결하고자 한다.
  • 실제 플로우 추정의 디코딩 과정을 모방하는 복원 과제를 설계하여 사전훈련-피팅 간 괴리감을 줄이고자 한다.
  • 과제 특화의 마스킹 및 복원 전략을 통해 커스텀 볼륨 인코더의 장거리 정보 집계 능력을 향상시키고자 한다.
  • 감독 학습이나 비감독 손실에 의존하지 않고도 비용 볼륨 인코더의 효과적인 자기지도 사전훈련을 가능하게 하고자 한다.
  • 사전훈련 중 이미지 인코더를 동결하는 것이 훈련 붕괴를 방지하고 일정한 복원 타겟을 유지하기 위해 필수적임을 입증하고자 한다.

제안 방법

  • 이웃한 원천 픽셀을 블록으로 묶고, 각 블록 내 모든 비용 맵에 동일한 마스크 패턴을 적용하는 블록 공유 마스킹 전략을 도입하여, 공간적으로 관련성이 높은 비용 값으로 인한 정보 泄漏를 감소시킨다.
  • 사전훈련에서 사용하는 새로운 사전과제를 제안하며, 모델이 더 큰 $15\times15$ 비용 패치를 더 작은 $9\times9$ 자르기 패치에서 복원하도록 한다. 이는 피팅 단계에서 사용하는 동적 쿼리 메커니즘과 일치시킨다.
  • 사전훈련 중 마스킹된 입력을 처리할 수 있도록 플로우포터 아키텍처를 수정하여, 트랜스포머 기반의 비용 볼륨 인코더에 마스킹된 비용 볼륨을 통합한다.
  • 복원 타겟(원시 비용 값)을 안정화하기 위해 사전훈련 중 이미지 인코더를 동결한다.
  • 전체 성능 향상과 비용 볼륨 학습 목표에 대한 간섭 방지를 위해 사전훈련 중 컨텍스트 인코더도 동결한다.
  • 복원 과제를 설계하여, 인코더가 마스킹된 영역을 비마스킹된 먼 비용 특징을 사용해 추론하도록 유도함으로써 장거리 특징 추상화를 장려한다.

실험 결과

연구 질문

  • RQ1비용 볼륨 내 높은 공간적 상관관계로 인해 마스킹된 오토인코딩이 비용 볼륨 인코더의 사전훈련에 효과적으로 적용될 수 있는가?
  • RQ2블록 공유 마스킹 전략이 랜덤 마스킹에 비해 정보 泄漏를 방지하고 장거리 특징 학습을 향상시키는가?
  • RQ3실제 디코딩 과정을 모방하는 복원 과제가 사전훈련-피팅 간 괴리감을 줄이고 최종 성능을 향상시키는가?
  • RQ4사전훈련 중 이미지 인코더를 동결하는 것이 훈련 안정성과 성능을 유지하기 위해 필수적인가?
  • RQ5광학적 피크셀 및 스무스니스 손실을 사용한 비감독 사전훈련과 비교했을 때, 제안된 MCVA 사전훈련 방식이 최종 플로우 추정 정확도에서 어떻게 성능을 내는가?

주요 결과

  • FlowFormer++는 Sintel Clean 벤치마크에서 평균 종단점 오차(AEPE) 1.07을 기록하며, FlowFormer 대비 7.76% 상대 오차 감소를 달성한다.
  • Sintel Final 패assing에서 FlowFormer++는 1.94 AEPE를 기록하며, FlowFormer 대비 7.18% 상대적 개선을 이룬다.
  • KITTI-2015 테스트 세트에서 FlowFormer++는 4.52 F1-all을 달성하며, FlowFormer 대비 0.16 개선을 기록한다.
  • 블록 공유 마스킹 전략은 랜덤 마스킹보다 우수한 성능을 보이며, Sintel Clean에서 블록 공유 마스킹은 0.90 AEPE, 랜덤 마스킹은 0.93 AEPE를 기록한다.
  • 50% 마스킹 비율이 복원 난이도와 특징 추상화 능력 간 균형을 잘 맞춰 최적의 전반적 성능을 낸다.
  • 사전훈련 중 이미지 및 컨텍스트 인코더를 모두 동결하면 안정적인 훈련과 향상된 성능을 달성하며, 이미지 인코더의 동결이 붕괴를 방지하는 데 필수적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.