Skip to main content
QUICK REVIEW

[논문 리뷰] Obj2Seq: Formatting Objects as Sequences with Class Prompt for Visual Tasks

Zhiyang Chen, Yousong Zhu|arXiv (Cornell University)|2022. 09. 28.
Advanced Neural Network Applications인용 수 8
한 줄 요약

Obj2Seq는 다양한 시각적 작업—검출, 분류, 자세 추정 등을 포함—을 클래스 프롬프트에 조건화된 시퀀스 생성 문제로 재구성하는 통합적이고 객체 중심의 프레임워크를 제안한다. 객체를 시퀀스 단위로 간주하고, 프롬프티드 뷰얼 인디케이터와 일반 시퀀스 예측기(General Sequence Predictor)를 사용함으로써 COCO 객체 검출에서 45.7% AP, 다중 레이블 분류에서 89.0% AP, 인간 자세 추정에서 65.0% AP를 달성하여, 최소한의 작업별 특화 적응을 통해 다양한 작업 간 강력한 일반화 능력을 입증한다.

ABSTRACT

Visual tasks vary a lot in their output formats and concerned contents, therefore it is hard to process them with an identical structure. One main obstacle lies in the high-dimensional outputs in object-level visual tasks. In this paper, we propose an object-centric vision framework, Obj2Seq. Obj2Seq takes objects as basic units, and regards most object-level visual tasks as sequence generation problems of objects. Therefore, these visual tasks can be decoupled into two steps. First recognize objects of given categories, and then generate a sequence for each of these objects. The definition of the output sequences varies for different tasks, and the model is supervised by matching these sequences with ground-truth targets. Obj2Seq is able to flexibly determine input categories to satisfy customized requirements, and be easily extended to different visual tasks. When experimenting on MS COCO, Obj2Seq achieves 45.7% AP on object detection, 89.0% AP on multi-label classification and 65.0% AP on human pose estimation. These results demonstrate its potential to be generally applied to different visual tasks. Code has been made available at: https://github.com/CASIA-IVA-Lab/Obj2Seq.

연구 동기 및 목표

  • 다양한 출력 형식과 고차원 객체 수준 출력을 가진 이질적인 시각적 작업을 통합하는 데 도전한다.
  • 사용자가 클래스 프롬프트를 통해 대상 카테고리를 지정할 수 있도록 유연하고 작업에 종속되지 않는 추론을 가능하게 한다.
  • 다양한 시각적 작업을 위한 객체 인식과 속성 시퀀스 생성을 분리하는 통합 프레임워크를 설계한다.
  • 작업별 헤드 설계나 미세조정 없이도 모델의 제어성과 작업 간 일반화 능력을 향상시킨다.
  • 자연어 처리에서의 시퀀스 투 시퀀스 패러다임을 시각 분야, 특히 객체 수준 작업에 확장하는 것이 가능한지 탐색한다.

제안 방법

  • 프레임워크는 이미지와 클래스 프롬프트를 입력으로 받아, 프롬프티드 뷰얼 인디케이터를 사용해 지정된 카테고리의 객체를 검출한다.
  • 프롬프티드 뷰얼 인디케이터는 학습 가능한 또는 CLIP 초기화된 클래스 프롬프트 벡터를 사용해 객체 검출과 객체 쿼리 초기화를 유도한다.
  • 객체 특징은 객체 트랜스포머 디코더를 통해 각 검출된 객체에 대한 맥락 인식 표현을 생성한다.
  • 일반 시퀀스 예측기(General Sequence Predictor)는 각 객체에 대해 작업별 속성 시퀀스(예: 바운딩 박스, 키포인트, 레이블)를 통합적이고 자동회귀적으로 생성한다.
  • 모델은 각 작업의 예측 시퀀스와 진짜 타겟을 일치시키기 위해 시퀀스 매칭 손실을 사용해 엔드 투 엔드로 훈련된다.
  • 유지 정책 메커니즘은 추론 시 불필요한 카테고리의 필터링을 가능하게 하며, 클래스 존재 스코어는 정책 변경 상황에서 예측의 안정성을 높이는 데 기여한다.

실험 결과

연구 질문

  • RQ1최소한의 아키텍처 변경으로도 객체 수준의 시각적 작업을 단일 시퀀스 생성 프레임워크로 통합할 수 있는가?
  • RQ2클래스 프롬프트의 사용이 모델의 제어성과 사용자가 정의한 대상 카테고리에 대한 적응성 향상에 어떻게 기여하는가?
  • RQ3단일 모델이 검출, 분류, 자세 추정과 같은 다양한 시각적 작업에서 경쟁적인 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4추론 시 유지 정책의 변화에 대해 프레임워크는 얼마나 강건한가?
  • RQ5작업별 헤드 설계 없이도 비디오에서의 시퀀스 기반 모델링이 작업별 특화 모델과 비교해 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • Obj2Seq는 검출 작업을 위한 훈련을 통해 MS COCO 객체 검출에서 45.7% AP를 달성하여 표준 벤치마크에서 뛰어난 성능을 보였다.
  • 다중 레이블 이미지 분류에서 89.0% AP를 기록하여 다중 클래스 출력 형식으로의 강력한 일반화 능력을 입증했다.
  • 키포인트 애너테이션을 사용한 인간 자세 추정에서 65.0% AP를 달성하여 구조적 속성 시퀀스의 효과적인 모델링 능력을 보였다.
  • CLIP 초기화된 프롬프트 벡터를 사용할 경우 무작위 초기화 대비 성능이 0.3% 향상되었지만, 최적의 일치를 위해 미세조정이 필요했다.
  • 추론 시 다양한 유지 정책에 대해 모델은 강건하게 유지되었으며, 다양한 상위-K 및 임계값 기반 필터링 전략 간 mAP 변동 폭이 0.2% 이내로 안정적이었다.
  • 객체 존재 스코어를 객체성 분기에서 포함함으로써, 훈련과 추론 시 유지 정책가 다를 경우에도 모델의 강건성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.