[논문 리뷰] Adversarial Attack on Skeleton-based Human Action Recognition
이 논문은 그래프 컨volution 네트워크를 사용한 스켈레톤 기반 인간 동작 인식을 위한 최초의 적대적 공격 프레임워크인 CIASA를 제안한다. 시공간 제약 조건, 공간적 스켈레톤 재정렬, GAN 기반 정규화를 통해, 인식 불가능하고 자연스러운 외관을 띠는 변형을 생성함으로써 최신 모델을 높은 전이성으로 성공적으로 속임으로써 렌더링된 RGB 비디오에서 적대적 행동을 유도한다.
Deep learning models achieve impressive performance for skeleton-based human action recognition. However, the robustness of these models to adversarial attacks remains largely unexplored due to their complex spatio-temporal nature that must represent sparse and discrete skeleton joints. This work presents the first adversarial attack on skeleton-based action recognition with graph convolutional networks. The proposed targeted attack, termed Constrained Iterative Attack for Skeleton Actions (CIASA), perturbs joint locations in an action sequence such that the resulting adversarial sequence preserves the temporal coherence, spatial integrity, and the anthropomorphic plausibility of the skeletons. CIASA achieves this feat by satisfying multiple physical constraints, and employing spatial skeleton realignments for the perturbed skeletons along with regularization of the adversarial skeletons with Generative networks. We also explore the possibility of semantically imperceptible localized attacks with CIASA, and succeed in fooling the state-of-the-art skeleton action recognition models with high confidence. CIASA perturbations show high transferability for black-box attacks. We also show that the perturbed skeleton sequences are able to induce adversarial behavior in the RGB videos created with computer graphics. A comprehensive evaluation with NTU and Kinetics datasets ascertains the effectiveness of CIASA for graph-based skeleton action recognition and reveals the imminent threat to the spatio-temporal deep learning tasks in general.
연구 동기 및 목표
- 스켈레톤 기반 행동 인식 분야에서 적대적 견고성 연구의 부족을 해결하기 위해, 특히 그래프 신경망에 초점을 맞춘다.
- 변형된 스켈레톤 시퀀스에서 시간적 일관성, 공간적 통합성, 인간형 타당성을 유지하는 공격을 개발한다.
- 전체 동작 역학을 손상시키지 않으면서 특정 관절만을 변형시켜 의미적으로 인식 불가능하고 국소적인 공격을 가능하게 한다.
- 다양한 인식 모델과 모odal리티(예: RGB 비디오 포함) 간에 적대적 예제의 전이성을 평가한다.
- 스켈레톤에 대해 생성된 변형이 동일한 스켈레톤에서 렌더링된 컴퓨터 그래픽스 기반 RGB 비디오 스트림에서 적대적 행동을 유도할 수 있음을 보여준다.
제안 방법
- CIASA는 목표 클래스의 손실을 최소화하면서도 작은 단위로 관절 위치를 반복적으로 변형하는 최적화 기반의 반복적 접근 방식을 사용한다.
- 공간적 스켈레톤 재정렬(Spatial Skeleton Re-alignment, SSR)을 통해 시공간 제약 조건을 강제로 적용하여, 프레임 간에 스켈레톤 내 관절 연결 및 뼈 길이를 유지한다.
- 연속된 프레임 간의 관절 가속도를 벌어지지 않도록 제약함으로써 시간적 매끄러움을 유지하여 자연스러운 운동 변화를 확보한다.
- 적대적 변형은 GAN 기반 프레임워크를 사용해 정규화되며, 변형된 스켈레톤의 분포를 실제 세계 스켈레톤 데이터와 일치시킨다.
- 공격는 전역(모든 관절), 국소(일부 관절), 계층적(구조화된 관절 변형)의 여러 모드로 작동하여 침투의 정교함을 높인다.
- 다양한 모델 간 전이성 평가를 수행하며, 그래픽스 렌더링 파이프라인을 통해 RGB 비디오에 대한 영향도 테스트한다.

실험 결과
연구 질문
- RQ1그래프 컨volution 네트워크를 사용한 스켈레톤 기반 행동 인식 모델에 대해 적대적 공격가 효과적으로 적용될 수 있는가?
- RQ2적대적 변형은 스켈레톤 시퀀스에서 시간적 일관성과 공간적 통합성을 어떻게 유지할 수 있는가?
- RQ3변형은 어느 정도 인간형 타당성과 의미적 인식 불가능성을 유지할 수 있는가?
- RQ4생성된 적대적 예제는 다양한 인식 모델 간에 얼마나 높은 전이성을 가지는가?
- RQ5스켈레톤에 대한 적대적 변형이 동일한 스켈레톤에서 생성된 RGB 비디오 스트림에서 오분류를 유도할 수 있는가?
주요 결과
- CIASA는 VNect와 같은 강력한 방어 기법이 적용된 경우에도 NTU 및 Kinetics 데이터셋에서 최신 스켈레톤 행동 인식 모델을 높은 신뢰도로 성공적으로 속인다.
- CIASA가 생성한 변형은 다양한 모델 간에 높은 전이성을 보이며, 그래프 기반 스켈레톤 인식 시스템의 광범위한 취약성을 시사한다.
- 공간적 스켈레톤 재정렬과 GAN 정규화의 사용은 정성적 비교를 통해 변형된 스켈레톤의 현실성과 타당성을 크게 향상시킴을 입증한다.
- 시간적 스무스닝 제약 조건은 비자연스러운 운동 아티팩트를 감소시켜 더 매끄럽고 자연스러운 적대적 시퀀스를 만들어낸다.
- 컴퓨터 그래픽스 렌더링을 통해 RGB 비디오 모odal리티로 변환되었을 때도 스켈레톤에 대한 적대적 변형이 성공적으로 전이되어 실제 위협 가능성을 입증한다.
- CIASA의 국소적 공격는 일부 관절만을 변형시킴으로써 주된 동작 패tern을 유지하면서도 탐지 회피를 성공적으로 이룬다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.