[논문 리뷰] IIP-Transformer: Intra-Inter-Part Transformer for Skeleton-Based Action Recognition
IIP-Transformer는 뼈대 기반 행동 인식을 위한 새로운 Transformer 기반 아키텍처를 제안하며, 동시에 관절 수준(내부 부위) 및 신체 부위 수준(외부 부위) 간의 상관관계를 모델링함으로써 기존 최고 성능(SOTA) 방법 대비 최대 36배의 계산 비용 절감을 달성한다. 부위 수준의 토큰화와 학습 가능한 클래스 토큰을 활용하여 효율성과 노이즈가 있는 관절에 대한 강건성을 향상시켜 NTU RGB+D 60/120에서 최고 성능을 기록하며, FLOPs가 크게 감소한 상태로 구현된다.
Recently, Transformer-based networks have shown great promise on skeleton-based action recognition tasks. The ability to capture global and local dependencies is the key to success while it also brings quadratic computation and memory cost. Another problem is that previous studies mainly focus on the relationships among individual joints, which often suffers from the noisy skeleton joints introduced by the noisy inputs of sensors or inaccurate estimations. To address the above issues, we propose a novel Transformer-based network (IIP-Transformer). Instead of exploiting interactions among individual joints, our IIP-Transformer incorporates body joints and parts interactions simultaneously and thus can capture both joint-level (intra-part) and part-level (inter-part) dependencies efficiently and effectively. From the data aspect, we introduce a part-level skeleton data encoding that significantly reduces the computational complexity and is more robust to joint-level skeleton noise. Besides, a new part-level data augmentation is proposed to improve the performance of the model. On two large-scale datasets, NTU-RGB+D 60 and NTU RGB+D 120, the proposed IIP-Transformer achieves the-state-of-art performance with more than 8x less computational complexity than DSTA-Net, which is the SOTA Transformer-based method.
연구 동기 및 목표
- Transformer 기반 뼈대 행동 인식에서 높은 계산 비용과 노이즈가 있는 관절에 대한 민감성 문제를 해결하기 위해.
- 동시에 관절 수준(내부 부위)과 신체 부위 수준(외부 부위) 간의 상호작용을 모델링하여 모델의 강건성을 향상시키기 위해.
- 부위 수준의 토큰화와 공간-시간 분리 기반의 Transformer 아키텍처를 통해 계산 복잡도를 감소시키기 위해.
- 신규로 제안된 부위 수준의 데이터 증강 전략(Part-Mask)을 통해 일반화 능력을 향상시키고 전역적 추론을 장려하기 위해.
- 기존 방법들과 비교해 훨씬 낮은 FLOPs와 모델 크기를 유지하면서 최고 성능를 달성하기 위해.
제안 방법
- 계산 비용 증가 없이도 내부 부위와 외부 부위 간의 상관관계를 동시에 모델링할 수 있는 새로운 Intra-Inter-Part 자기어텐션 메커니즘을 도입한다.
- 관절을 신체 부위(예: 사지, 흉부 등)로 그룹화하여 부위 수준의 뼈대 인코딩을 제안함으로써, 시퀀스 길이와 자기어텐션 복잡도를 v²/p² 비율로 감소시킨다.
- 글로벌 평균 풀링 대신 BERT와 유사하게 학습 가능한 클래스 토큰을 사용하여 특징을 집약함으로써 표현 학습을 향상시킨다.
- 공통된 공간-시간 Transformer 아키텍처를 설계하여 공간적 및 시간적 모델링을 분리함으로써 모델 크기를 감소시키고 일반화 능력을 향상시킨다.
- 학습 중에 전체 신체 부위를 무작위로 마스킹하는 Part-Mask 데이터 증강 기법을 도입하여 특정 부위에 대한 의존도를 줄인다.
- 정확한 SOTA 방법과의 비교를 위해 관절, 뼈대, 관절 운동, 뼈대 운동 모odalities의 다중 스트림 융합을 사용한다.
실험 결과
연구 질문
- RQ1통합된 Transformer 아키텍처에서 내부 부위와 외부 부위 간의 상관관계를 동시에 모델링하면 행동 인식 정확도 향상에 기여하는가?
- RQ2부위 수준의 토큰화가 계산 복잡도를 감소시키면서도 노이즈가 있는 뼈대 관절에 대한 강건성을 유지하거나 향상시키는가?
- RQ3Part-Mask와 같은 부위 수준의 데이터 증강 전략이 모델의 일반화 능력을 향상시키고 특정 부위에 대한 과도한 의존도를 줄이는가?
- RQ4대규모 뼈대 데이터셋에서 제안된 IIP-Transformer는 기존 SOTA 방법과 비교해 정확도와 효율성 면에서 어떻게 성능을 내는가?
- RQ5Transformer 아키텍처 내의 공간-시간 분리 설계가 성능을 훼손하지 않으면서 FLOPs를 얼마나 감소시키는가?
주요 결과
- NTU RGB+D 60(X-Sub)에서 IIP-Transformer는 92.3%의 Top-1 정확도를 기록하여 이전 SOTA 방법인 DSTA보다 0.8% 높다.
- NTU RGB+D 120(X-Set)에서 IIP-Transformer는 89.7%의 정확도를 달성하여 DSTA보다 0.7% 높다.
- DSTA-Net 대비 FLOPs를 36배 감소시켰으며, 7.2G FLOPs 대비 259.4G로, 유사한 파라미터 수를 유지한다.
- Part-Mask 데이터 증강 전략은 기준 모델 대비 X-Sub에서 정확도를 1.3% 향상시켰으며, 가우시안 노이즈나 관절 수준의 마스킹과 같은 기존 증강 기법보다 뛰어난 성능을 보였다.
- 절단 분석 결과, 부위 수준의 인코딩이 v²/p² 비율로 계산 비용을 감소시키며, 공간-시간 Transformer 설계가 모델 크기를 줄이고 일반화 능력을 향상시킨다는 것이 확인되었다.
- 관절, 뼈대, 관절 운동, 뼈대 운동의 네 가지 모달리티를 활용한 다중 스트림 융합은 모든 벤치마크에서 일관된 성능 향상을 이끌어냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.