[논문 리뷰] Proposal-Based Multiple Instance Learning for Weakly-Supervised Temporal Action Localization
이 논문은 약한 감독을 받는 시계열 행동 탐지를 위한 제안 기반 다중 인스턴스 학습(P-MIL) 프레임워크를 제안한다. 이는 학습 시 세그먼트 수준에서의 분류와 테스트 시 제안 제안 수준에서의 분류 간의 일관성 문제를 직접적으로 해결하며, 훈련 및 추론 모두에서 후보 제안을 직접 분류한다. 이 방법은 주변 대비 특징 추출 모듈, 제안 완전성 평가 모듈, 인스턴스 수준 순서 일관성 손실을 도입하여, THUMOS14와 ActivityNet에서 평균 mAP 46.5%의 최신 기술 수준 성능을 달성한다.
Weakly-supervised temporal action localization aims to localize and recognize actions in untrimmed videos with only video-level category labels during training. Without instance-level annotations, most existing methods follow the Segment-based Multiple Instance Learning (S-MIL) framework, where the predictions of segments are supervised by the labels of videos. However, the objective for acquiring segment-level scores during training is not consistent with the target for acquiring proposal-level scores during testing, leading to suboptimal results. To deal with this problem, we propose a novel Proposal-based Multiple Instance Learning (P-MIL) framework that directly classifies the candidate proposals in both the training and testing stages, which includes three key designs: 1) a surrounding contrastive feature extraction module to suppress the discriminative short proposals by considering the surrounding contrastive information, 2) a proposal completeness evaluation module to inhibit the low-quality proposals with the guidance of the completeness pseudo labels, and 3) an instance-level rank consistency loss to achieve robust detection by leveraging the complementarity of RGB and FLOW modalities. Extensive experimental results on two challenging benchmarks including THUMOS14 and ActivityNet demonstrate the superior performance of our method.
연구 동기 및 목표
- 기존 S-MIL 프레임워크에서 약한 감독을 받는 시계열 행동 탐지에 대해 학습 시 세그먼트 수준의 점수 평가와 테스트 시 제안 수준의 점수 평가 간의 일관성 문제를 해결하기 위해.
- 특징 추출 과정에서 주변 문맥 정보를 활용하여 분류가 빠르게 이루어지는 짧은 제안에 대한 과적합을 억제하기 위해.
- 완전성 허위 레이블과 모odal 간 상보성을 활용하여 저품질 제안을 개선함으로써 탐지의 강건성을 향상시키기 위해.
- 동일한 행동 인스턴스에 속하는 제안들 간의 상대적 점수 일관성을 향상시키기 위해 인스턴스 수준 순서 일관성 손실을 도입하기 위해.
- 전체 파ip라인에서 제안을 직접 분류함으로써 훈련 및 테스트 목표를 통합하기 위해.
제안 방법
- 두 단계 훈련 파이프라인을 제안한다: 먼저 S-MIL 모델을 미리 훈련하여 후보 제안을 생성하고, 이후 P-MIL 모델을 미세조정하여 이 제안들을 직접 분류한다.
- 제안 경계를 확장하고 외부-내부 대비 특징을 계산함으로써 과신뢰도가 높은 짧은 제안을 억제하는 주변 대비 특징 추출(SCFE) 모듈을 도입한다.
- 고신뢰도 제안을 허위 인스턴스로 사용하여 IoU 기반으로 완전성 허위 레이블을 생성함으로써 저품질 제안을 억제하는 제안 완전성 평가(PCE) 모듈을 활용한다.
- RGB 및 FLOW 모달 간 상보성을 활용하여 동일한 행동 인스턴스의 제안 클러스터 내 상대적 점수를 안정화시키는 인스턴스 수준 순서 일관성(IRC) 손실을 설계한다.
- 분류, 완전성, 순서 일관성 목표를 통합한 손실 함수를 사용하며, 균형 조절을 위해 하이퍼파ram터 λcomp 및 λIRC를 사용한다.
- 일반화를 향상시키기 위해 훈련 중 추가 배경 제안을 통합하여 전경-배경 분리 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1제안을 직접 분류하는 P-MIL 프레임워크가 훈련 및 테스트 목표를 통합함으로써 탐지 성능을 향상시키는가?
- RQ2주변 대비 특징 추출이 분류가 빠르게 이루어지는 짧은 제안을 억제하고 특징 표현을 향상시키는 데 얼마나 효과적인가?
- RQ3완전성 허위 레이블링이 제안 점수 평가 및 탐지 정확도 향상에 얼마나 기여하는가?
- RQ4동일한 행동에 속하는 제안들 간에 인스턴스 수준 순서 일관성을 강제로 적용하면 탐지 강건성과 mAP가 향상되는가?
- RQ5P-MIL 모델은 하이퍼파ram터 설정에 얼마나 민감한가? 다양한 설정에서도 안정된 성능을 유지할 수 있는가?
주요 결과
- P-MIL 프레임워크는 THUMOS14 및 ActivityNet 벤치마크에서 평균 mAP 46.5%를 달성하여 S-MIL 기반 모델보다 mAP 2.9% 높은 성능을 보였다.
- 훈련 중 배경 제안을 추가함으로써 mAP가 41.2%에서 46.5%로 향상되었으며, 전경-배경 분리 능력 향상의 효과를 입증했다.
- 주변 대비 특징 추출(SCFE) 모듈을 도입함으로써 기준 특징 추출 대비 mAP가 5.5% 향상되었으며, 짧고 분류가 빠른 제안 억제에 효과적임을 입증했다.
- 제안 완전성 평가(PCE) 모듈은 mAP를 0.7% 향상시키고, 인스턴스 수준 순서 일관성(IRC) 손실은 0.8% 향상시켰으며, 병합된 성과 향상은 총 1.3%였다.
- 모델는 하이퍼파ram터 λcomp 및 λirc에 대해 낮은 민감도를 보이며, 다양한 설정에서 mAP@0.5 변동 폭이 2% 이내로 안정된 성능을 유지함을 보였다.
- S-MIL 및 P-MIL 모델의 예측을 융합함으로써 mAP는 47.0%로 추가로 향상되었으며, 두 접근법 간 상호 보완적 강점이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.