[논문 리뷰] Real-Time End-to-End Action Detection with Two-Stream Networks
이 논문은 광학 흐름 계산에 Flownet2를 통합하고 두 스트림 간에 특징을 조기에 융합함으로써 실시간, 엔드 투 엔드로 학습 가능한 두 스트림 YOLOv2 네트워크를 제안한다. Kinetics에서 유연하게 흐름 네트워크를 미세조정하고 양 스트림을 함께 학습함으로써, 31 fps에서 최신 기술 성능을 달성하며, 엔드 투 엔드 최적화와 전이 학습을 통해 효율성과 정확도를 향상시킨다.
Two-stream networks have been very successful for solving the problem of action detection. However, prior work using two-stream networks train both streams separately, which prevents the network from exploiting regularities between the two streams. Moreover, unlike the visual stream, the dominant forms of optical flow computation typically do not maximally exploit GPU parallelism. We present a real-time end-to-end trainable two-stream network for action detection. First, we integrate the optical flow computation in our framework by using Flownet2. Second, we apply early fusion for the two streams and train the whole pipeline jointly end-to-end. Finally, for better network initialization, we transfer from the task of action recognition to action detection by pre-training our framework using the recently released large-scale Kinetics dataset. Our experimental results show that training the pipeline jointly end-to-end with fine-tuning the optical flow for the objective of action detection improves detection performance significantly. Additionally, we observe an improvement when initializing with parameters pre-trained using Kinetics. Last, we show that by integrating the optical flow computation, our framework is more efficient, running at real-time speeds (up to 31 fps).
연구 동기 및 목표
- 두 스트림을 별도로 학습하고 제3자 광학 흐름 알고리즘을 사용하는 기존 이중 스트림 동작 감지 방법의 비효율성과 최적화되지 않은 성능을 해결하기 위해.
- 광학 흐름 계산을 신경망 파이프라인에 직접 통합하여 GPU 활용도를 높이고 지연 시간을 줄여 실시간 추론을 가능하게 하기 위해.
- 특징의 조기 융합을 통해 외관 및 운동 스트림을 함께 학습함으로써 정확도를 향상시키고, 특징의 상호 적응을 가능하게 하기 위해.
- 작은 동작 감지 데이터셋에서의 과적합을 줄이기 위해 대규모 Kinetics 동작 인식 사전학습을 활용하여 전이 학습을 수행하기 위해.
- 신경망 기반 광학 흐름 추정기(예: Flownet2)를 동작 감지 목적에 맞게 미세조정하면 기존 EPE 최적화된 흐름보다 더 나은 운동 표현을 제공할 수 있음을 보여주기 위해.
제안 방법
- 두 스트림 네트워크 내부에 미분 가능한 광학 흐름 모듈로 Flownet2를 통합하여, 외관 및 운동 스트림의 엔드 투 엔드 학습을 가능하게 한다.
- RGB 스트림과 광학 흐름 스트림의 최종 활성화를 결합하여 예측 헤드 이전에 조기 특징 융합을 적용한다.
- 공유된 백본과 공동 최적화를 갖춘 YOLOv2 기반 아키텍처를 두 스트림 영상 동작 감지에 적응시킨다.
- 동작 감지에 대해 UCF-101-24에서 미세조정하기 전에 전체 프레임워크를 Kinetics 데이터셋에서 동작 인식에 대해 사전학습한다.
- 기존의 EPE 최적화된 가중치에 의존하지 않고, 동작 감지 목적에 맞게 Flownet2 컴ponent를 특별히 미세조정한다.
- 배치 정규화와 스킵 연결을 사용하여 깊은 두 스트림 아키텍처에서 학습 안정성과 기울기 흐름을 향상시킨다.
실험 결과
연구 질문
- RQ1두 스트림 네트워크에 광학 흐름 계산을 직접 통합하면 실시간 성능과 엔드 투 엔드 학습 효율성이 향상되는가?
- RQ2조기 융합을 통한 외관 및 운동 스트림의 공동 학습은 별도 학습보다 더 나은 동작 감지 정확도를 제공하는가?
- RQ3대규모 동작 인식(Kinetics) 사전학습에서의 전이 학습이 더 작은 동작 감지 데이터셋에서의 성능 향상에 기여하는가?
- RQ4동작 감지 목적에 맞게 신경망 기반 광학 흐름 네트워크(예: Flownet2)를 미세조정하면 고정된 사전 계산된 흐름을 사용할 때보다 더 나은 운동 표현을 얻을 수 있는가?
- RQ5제안된 프레임워크는 UCF-101-24에서 최신 기술 성능을 유지하면서도 실시간 추론(≥30 fps)을 달성할 수 있는가?
주요 결과
- 제안된 엔드 투 엔드 프레임워크는 배치 크기가 4일 때 31 fps를 기록하며, 흐름 계산 오버헤드를 고려해도 Singh 등 [18]보다 3 fps 높은 성능을 달성한다.
- Flownet2를 동작 감지 목적에 맞게 미세조정하면 사전학습된 Flownet2를 그대로 사용할 때보다 mAP가 0.89 포인트 향상된다.
- Kinetics 사전학습을 적용하면 IoU 임계치 0.5일 때 UCF-101-24에서 f-mAP가 6.91 포인트 향상되어 67.18에서 74.07로 상승한다.
- 미세조정된 Flownet2와 Kinetics 사전학습을 적용한 모델은 IoU=0.5일 때 f-mAP 74.07을 기록하며, 정렬된 UCF-101-24 영상에서 보고된 모든 다른 방법을 능가한다.
- 양 스트림의 특징을 조기에 융합하는 것은 후기 융합이나 별도 학습보다 더 나은 성능을 보이며, 상호 보완적 학습이 가능함을 시사한다.
- 흐름 계산을 네트워크에 통합함으로써 메모리 전송 오버헤드를 줄이고 GPU 병렬 처리 효율성을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.