[논문 리뷰] SF-Net: Single-Frame Supervision for Temporal Action Localization
이 논문은 단일 프레임 감독(행동 인스턴스당 한 프레임만 레이블링됨)을 활용하여 주로 감독받는 방법에 비해 레이블링 비용을 크게 줄이고, 성능은 완전 감독 방법에 근접한 새로운 프레임워크인 SF-Net을 제안한다. 레이블이 없는 데이터에서 가짜 행동 프레임과 가짜 배경 프레임을 채굴하고, 프레임 수준의 행동도 점수를 예측함으로써, THUMOS14, GTEA, BEOID에서 세그먼트 및 단일 프레임 레이블링 정확도를 향상시킨다. 이는 최신의 약한 감독 방법을 초월하며 완전 감독 성능에 가까워진다.
In this paper, we study an intermediate form of supervision, i.e., single-frame supervision, for temporal action localization (TAL). To obtain the single-frame supervision, the annotators are asked to identify only a single frame within the temporal window of an action. This can significantly reduce the labor cost of obtaining full supervision which requires annotating the action boundary. Compared to the weak supervision that only annotates the video-level label, the single-frame supervision introduces extra temporal action signals while maintaining low annotation overhead. To make full use of such single-frame supervision, we propose a unified system called SF-Net. First, we propose to predict an actionness score for each video frame. Along with a typical category score, the actionness score can provide comprehensive information about the occurrence of a potential action and aid the temporal boundary refinement during inference. Second, we mine pseudo action and background frames based on the single-frame annotations. We identify pseudo action frames by adaptively expanding each annotated single frame to its nearby, contextual frames and we mine pseudo background frames from all the unannotated frames across multiple videos. Together with the ground-truth labeled frames, these pseudo-labeled frames are further used for training the classifier. In extensive experiments on THUMOS14, GTEA, and BEOID, SF-Net significantly improves upon state-of-the-art weakly-supervised methods in terms of both segment localization and single-frame localization. Notably, SF-Net achieves comparable results to its fully-supervised counterpart which requires much more resource intensive annotations. The code is available at https://github.com/Flowerfan/SF-Net.
연구 동기 및 목표
- 완전 감독 기반 시계열 행동 로컬라이제이션의 높은 레이블링 비용을 줄이면서 기존의 약한 감독 방법보다 성능을 향상시키기.
- 행동 인스턴스당 한 프레임만 레이블링하는 단일 프레임 감독이 정확한 경계 로컬라이제이션을 위한 충분한 시계열 신호를 제공할 수 있는지 조사하기.
- 가장자리 단일 프레임 레이블을 효과적으로 활용하기 위해 가짜 레이블링과 행동도 예측을 통합한 통합 프레임워크 개발하기.
- 단일 프레임 레이블링만 필요로 하는 새로운 작업인 '단일 프레임 로컬라이제이션'을 도입하고 평가하기.
- 최소한이지만 정보성 있는 감독을 통해 약한 감독과 완전 감독 간의 성능 격차를 줄이기.
제안 방법
- 모든 프레임에 대해 행동도 점수를 예측하여 행동 발생 가능성을 나타내어, 시계열 경계 정밀도 향상에 기여하기.
- 다중 비디오의 모든 레이블이 없는 프레임에서 새로운 배경 채굴 알고리즘을 사용해 가짜 배경 프레임을 채굴하기.
- 시간적으로 인접하고 높은 신뢰도를 가진 문맥 프레임을 적응적으로 포함하여 레이블이 있는 단일 프레임을 가짜 행동 프레임으로 확장하기.
- 정답 레이블 프레임, 채굴된 가짜 행동 프레임, 채굴된 가짜 배경 프레임을 조합하여 분류기 학습하기.
- 회귀 헤드 없이도 추론 시 행동도 점수 시퀀스에 임계값 전략을 적용하여 행동 경계 예측하기.
- 로컬라이제이션 정확도 향상을 위해 통합 네트워크 아키텍처에서 카테고리 점수와 행동도 점수를 통합하기.
실험 결과
연구 질문
- RQ1행동 인스턴스당 한 프레임만 레이블링하는 단일 프레임 감독이 레이블링 비용을 크게 줄이면서도 높은 로컬라이제이션 정확도를 유지할 수 있는가?
- RQ2희박한 단일 프레임 레이블링만 존재할 때, 행동 및 배경 프레임에 대한 가짜 레이블링을 효과적으로 활용하여 모델 일반화 성능을 향상시킬 수 있는가?
- RQ3프레임 수준의 행동도 점수 예측이 배경과 행동을 구분하고 시계열 경계를 정밀하게 보정하는 데 기여하는가?
- RQ4SF-Net이 훨씬 적은 레이블링 노력으로도 완전 감독 방법과 유사한 성능을 달성할 수 있는가?
- RQ5다양한 데이터셋에서 단일 프레임 감독가 약한 감독 방식의 로컬라이제이션 성능를 비교했을 때 어떤가?
주요 결과
- THUMOS14 데이터셋에서 SF-Net은 인간이 레이블링한 단일 프레임으로 훈련했을 때 IoU=0.5 기준 mAP 51.5를 달성하여 이전의 모든 약한 감독 방법을 뛰어넘었다.
- 실제 정답 레이블에서 단일 프레임 레이블을 시뮬레이션했을 때 SF-Net은 mAP 51.2를 기록하여 최소한의 감독으로도 뛰어난 성능을 보였다.
- BEOID 및 GTEA에서 SF-Net은 약한 감독 기반 모델을 크게 앞서며, 비디오당 다수의 행동 클래스가 존재하는 데이터셋에서 가장 큰 성과 향상을 보였다.
- 행동도 모듈과 가짜 배경 채굴 전략은 THUMOS14와 BEOID에서 성능 향상을 이끌었지만, GTEA에서는 배경 프레임이 극히 적어 제한된 효과를 보였다.
- SF-Net은 훨씬 적은 레이블링 노력으로 BMN 및 P-GCN와 같은 완전 감독 모델과 유사한 성능을 달성했다.
- 인간이 레이블링한 단일 프레임으로 훈련한 모델가 균일하게 샘플링된 행동 세그먼트의 프레임으로 훈련한 모델보다 성능이 뛰어나, 인간 레이블링의 시간적 신호가 가치가 있음을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.