[논문 리뷰] Hulk: A Universal Knowledge Translator for Human-Centric Tasks
Hulk는 2D 시각, 3D 시각, 스켈레톤 기반, 시각-언어 작업을 별도의 작업별 미세조정 없이 하나의 프레임워크로 통합하는 최초의 다중모odal 인간 중심 일반화 모델이다. 이는 작업별 헤드를 이산(예: 언어) 및 연속(예: 좌표)이라는 두 가지 일반 헤드로 압축하여 모odal 간 지식 전이가 가능하게 하고, 12개의 벤치마크에서 최신 기술 성능을 달성한다.
Human-centric perception tasks, e.g., pedestrian detection, skeleton-based action recognition, and pose estimation, have wide industrial applications, such as metaverse and sports analysis. There is a recent surge to develop human-centric foundation models that can benefit a broad range of human-centric perception tasks. While many human-centric foundation models have achieved success, they did not explore 3D and vision-language tasks for human-centric and required task-specific finetuning. These limitations restrict their application to more downstream tasks and situations. To tackle these problems, we present Hulk, the first multimodal human-centric generalist model, capable of addressing 2D vision, 3D vision, skeleton-based, and vision-language tasks without task-specific finetuning. The key to achieving this is condensing various task-specific heads into two general heads, one for discrete representations, \emph{e.g.,} languages, and the other for continuous representations, \emph{e.g.,} location coordinates. The outputs of two heads can be further stacked into four distinct input and output modalities. This uniform representation enables Hulk to treat diverse human-centric tasks as modality translation, integrating knowledge across a wide range of tasks. Comprehensive evaluations of Hulk on 12 benchmarks covering 8 human-centric tasks demonstrate the superiority of our proposed method, achieving state-of-the-art performance in 11 benchmarks. The code will be available on https://github.com/OpenGVLab/Hulk.
연구 동기 및 목표
- 2D/3D 시각, 스켈레톤 기반, 시각-언어 작업을 포함한 다양한 인간 중심 인식 작업을 위한 통합 모델의 부족을 해결한다.
- 기존 기초 모델이 각 하류 작업에 대해 작업별 미세조정이 필요로 하는 한계를 극복한다.
- 공유된 파rameter를 사용하여 이질적인 입력 및 출력(예: 이미지, 텍스트, 키포인트 좌표, 세그멘테이션 맵)을 처리할 수 있는 일반화 아키텍처를 개발한다.
- 재학습이나 프롬프트 튜닝 없이도 여러 인간 중심 작업 간 제로샷 또는 희소샷 전이를 가능하게 한다.
- 모든 인간 중심 작업을 모달리티 번역으로 간주하는 통합 프레임워크를 구축하여 다양한 모달리티와 작업 간 지식 통합을 실현한다.
제안 방법
- 이산 표현(예: 토큰, 클래스 레이블)을 위한 하나, 연속 표현(예: 2D/3D 좌표, 임베딩)을 위한 하나의 이중 헤드 아키텍처를 설계한다.
- 모든 입력 및 출력 모달리티를 두 일반 헤드의 네 가지 조합으로 매핑하여 다양한 작업 간 통합 처리를 가능하게 한다.
- 8개의 인간 중심 작업을 포함하는 대규모 다중 작업 데이터셋(170만~3000만 샘플)에서 모델을 엔드 투 엔드로 훈련한다.
- 세그멘테이션, 디텍션, 캡션, 포즈 추정과 같은 다양한 작업 유형을 동시에 최적화할 수 있는 통합 손실 함수를 사용한다.
- 일반화 성능 향상과 도메인 분포 이탈 감소를 위해 다양한 인간 중심 데이터에서의 사전 훈련을 활용한다.
- 특화된 인간 중심 사전 훈련 모델(HAP, PATH 등)을 사용한 파rameter 효율적 초기화를 적용하여 성능 향상을 이끌어내되, 비교의 공정성을 손상시키지 않는다.
실험 결과
연구 질문
- RQ1작업별 미세조정 없이도 2D/3D 시각, 스켈레톤 기반, 시각-언어 작업을 포함한 다양한 인간 중심 작업을 하나의 통합 모델이 처리할 수 있는가?
- RQ2이중 헤드 아키텍처(이산 및 연속)는 다중모달 인간 중심 작업 간 이질적인 입력 및 출력을 얼마나 효과적으로 통합하는가?
- RQ3일반화 모델 환경에서 다양한 인간 중심 작업의 성능 향상을 위해 훈련 데이터를 확장할 경우 성능 향상 정도는 어느 정도인가?
- RQ4특화된 인간 중심 사전 훈련 모델에서의 초기화가 Hulk와 같은 일반화 모델의 성능에 미치는 영향은 어떠한가?
- RQ5작업별 적응 없이도 다수의 벤치마크에서 최신 기술 성능을 달성할 수 있는가?
주요 결과
- Hulk는 평가된 12개의 벤치마크 중 11개에서 최신 기술 성능을 기록하며 강력한 일반화 능력과 제로샷 전이 능력을 입증한다.
- 170만에서 3000만 샘플로 훈련 데이터를 확장함에 따라 평균 성능이 7.1점 향상(48.9에서 56.0 mIoU/AP), 특히 2D 포즈 추정(+2.3% AP)과 보행자 검출(+1.6% AP)에서 뚜렷한 성능 향상이 있었다.
- HAP 및 PATH의 사전 훈련 가중치를 통합함으로써 Hulk의 정확도가 향상되었으며, MAE 초기화 대비 평균 성능에서 5.0점의 절대 향상(52.2 vs. 47.2)을 기록했다.
- 더 큰 데이터셋에서 훈련할 경우 3D 메시 복원에서 26.0 MPVPE 감소, 3D 포즈 추정에서 24.5 MPJPE 감소를 기록하여 강력한 3D 일반화 능력을 입증했다.
- 이중 헤드 설계 덕분에 다양한 모달리티 간 효과적인 제로샷 전이가 가능했으며, 이미지 캡션(+2.1 B@4) 및 스켈레톤 기반 동작 인식(93.8% 정확도) 등 다양한 작업에서 일관된 성능 향상이 관찰되었다.
- 확장된 데이터셋(예: 스켈레톤 작업용 Kinetics-400)의 도메인 갭이 존재하더라도 성능이 안정적으로 유지되어, 다양한 데이터로 훈련된 경우 분포 이탈에 대한 강건성이 뛰어나다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.