[논문 리뷰] Pose Recognition with Cascade Transformers
이 논문은 캐스케이드 트랜스포머를 사용한 새로운 엔드 투 엔드 회귀 기반 2D 인간 자세 추정 방법인 포즈 회귀 트랜스포머(_PRTR_)를 제안한다. 이는 다중 스케일 특징과 디코더 레이어 간 쿼리 기반 정밀 조정을 활용하여 COCO 데이터셋에서 기존의 회귀 기반 방법들 대비 최고 성능을 달성하며, 히우리스틱 설계를 최소화하고 쿼리 시각화를 통해 해석 가능성을 향상시킨다.
In this paper, we present a regression-based pose recognition method using cascade Transformers. One way to categorize the existing approaches in this domain is to separate them into 1). heatmap-based and 2). regression-based. In general, heatmap-based methods achieve higher accuracy but are subject to various heuristic designs (not end-to-end mostly), whereas regression-based approaches attain relatively lower accuracy but they have less intermediate non-differentiable steps. Here we utilize the encoder-decoder structure in Transformers to perform regression-based person and keypoint detection that is general-purpose and requires less heuristic design compared with the existing approaches. We demonstrate the keypoint hypothesis (query) refinement process across different self-attention layers to reveal the recursive self-attention mechanism in Transformers. In the experiments, we report competitive results for pose recognition when compared with the competing regression-based methods.
연구 동기 및 목표
- 히트맵 기반 자세 추정 방법의 한계를 해결하기 위해, 비가역적이고 히우리스틱적인 사전/사후 처리 단계에 의존하는 문제를 해결하고자 한다.
- 다중 인물 2D 인간 자세 추정을 위한 일반적인 목적의 엔드 투 엔드 회귀 기반 접근법을 개발하여 아키텍처의 복잡성을 감소시키고자 한다.
- 디코더 레이어를 거쳐 쿼리 정밀 조정을 통해 트랜스포머의 내부 메커니즘을 키포인트 검출 측면에서 시각화함으로써 분석하고자 한다.
- 학습 목표와 손실 계산의 투명성을 유지하면서도 기존의 회귀 기반 방법들과 경쟁 가능한 성능을 달성하고자 한다.
제안 방법
- 두 단계의 캐스케이드 트랜스포머 아키텍처를 제안한다: DETR 프레임워크 기반의 사람 검출 트랜스포머와 키포인트 검출 트랜스포머로 구성된다.
- 공간 트랜스포머 네트워크(STN)를 사용하여 바운딩 박스를 예측하고 키포인트 쿼리를 동시에 정밀 조정하는 순차적 엔드 투 엔드 변형을 도입한다.
- 키포인트 검출 트랜스포머에서 학습 가능한 객체 쿼리를 사용하여 17개의 키포인트 좌표를 직접 예측하며, 어텐션 레이어에서 클래스별 쿼리 전문화가 관찰된다.
- 다양한 객체 크기에서 정확도를 향상시키기 위해 키포인트 검출 헤드에서 다중 스케일 특징 융합을 적용한다.
- 신뢰도 기반 매칭을 사용하는 허그리안 매처를 사용하며, 추론 시 배경 클래스 로짓을 제외하여 후보의 다양성을 향상시킨다.
- 디코더 레이어 전반에 걸쳐 쿼리 분포와 정밀 조정 궤적을 시각화하여 재귀적 자기 어텐션 메커니즘과 점진적인 공간 정밀 조정을 밝혀낸다.
실험 결과
연구 질문
- RQ1캐스케이드 트랜스포머 아키텍처는 복잡한 히트맵 기반 사후 처리 히우리스틱을 제거하면서도 경쟁 가능한 자세 추정 정확도를 달성할 수 있는가?
- RQ2트랜스포머 디코더의 쿼리가 레이어를 거쳐 어떻게 진화하여 무작위 초기화 상태에서 정확한 위치로 예측을 정밀 조정하는가?
- RQ3직접 좌표 회귀를 통한 엔드 투 엔드 학습이 기존의 회귀 기반 방법들과 비교해 정확도와 일반화 능력 측면에서 우월하거나 유사한 성능을 내는가?
- RQ4피드백 증강(flip augmentation)이 히트맵 기반 프레임워크와 비교해 회귀 기반 트랜스포머 프레임워크에서 성능에 어떤 영향을 미치는가?
- RQ5디코더의 쿼리 기반 어텐션 메커니즘은 특정 키포인트 클래스를 자연스럽게 전문화시킬 수 있으며, 이는 공간 어텐션 패턴과 어떻게 관련이 있는가?
주요 결과
- PRTR는 두 단계 캐스케이드 설계를 사용하여 COCO val2017에서 73.2%의 AP를 달성하며, 다른 회귀 기반 방법들을 능가하고 히트맵 기반 SOTA에 근접한다.
- 추론 시 배경 클래스 로짓을 제외함으로써 AP가 0.9~1.5점 향상되었으며, 이는 배경 간섭이 매칭 품질을 떨어뜨린다는 것을 시사한다.
- 피드백 테스트는 일관되게 성능 향상을 이끌었으며, 히트맵 기반 모델과 달리 연속적인 좌표 공간 덕분에 정렬 오류가 발생하지 않았다.
- 오라클 결과에서는 예측된 사람 바운딩 박스를 진짜 바운딩 박스로 교체함으로써 AP가 2.0~2.5점 향상되었으며, 이는 사람 검출 성능 향상 여력이 있음을 시사한다.
- 시각화 결과 89번째 쿼리의 92.3%가 코 키포인트임을 확인하여 특정 키포인트 클래스에 대해 강력한 쿼리 전문화가 이루어졌음을 입증한다.
- 쿼리 예측은 디코더 레이어를 거치며 무작위 초기 위치에서 점차 정확한 위치로 진화하며, 기존에 진짜 위치에 가까운 경우 변화가 최소한이 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.