Skip to main content
QUICK REVIEW

[논문 리뷰] Pix2seq: A Language Modeling Framework for Object Detection

Ting Chen, Saurabh Saxena|arXiv (Cornell University)|2021. 09. 22.
Multimodal Machine Learning Applications참고 문헌 58인용 수 128
한 줄 요약

Pix2Seq는 객체 탐지를 이미지 입력으로부터 경계 상자와 클래스 레이블을 나타내는 이산 토큰 시퀀스를 생성하는 언어 모델링 작업으로 재구성하며, 간단하고 일반적인 아키텍처로 COCO 결과와 경쟁력을 달성합니다.

ABSTRACT

We present Pix2Seq, a simple and generic framework for object detection. Unlike existing approaches that explicitly integrate prior knowledge about the task, we cast object detection as a language modeling task conditioned on the observed pixel inputs. Object descriptions (e.g., bounding boxes and class labels) are expressed as sequences of discrete tokens, and we train a neural network to perceive the image and generate the desired sequence. Our approach is based mainly on the intuition that if a neural network knows about where and what the objects are, we just need to teach it how to read them out. Beyond the use of task-specific data augmentations, our approach makes minimal assumptions about the task, yet it achieves competitive results on the challenging COCO dataset, compared to highly specialized and well optimized detection algorithms.

연구 동기 및 목표

  • 손으로 만든 아키텍처 및 손실 설계 minimization을 지향하는 일반적이고 작업에 구애받지 않는 객체 탐지 접근 방식의 동기를 제시합니다.
  • 객체 설명(경계 상자 및 클래스 레이블)을 이산 토큰 시퀀스로 표현합니다.
  • 최대 가능도(maximum likelihood)로 학습된 인코더–디코더 모델이 작업 특화 사전 지식 없이 픽셀 입력에서 객체를 탐지할 수 있음을 보여줍니다.
  • 시퀀스 증강 및 토큰 기반 양자화가 COCO에서 경쟁력 있는 성능을 가능하게 하며, 더 큰 데이터셋에서의 사전 학습의 이점을 제시합니다.

제안 방법

  • 공유 bin 어휘와 클래스 토큰을 사용하여 경계 상자를 다섯 토큰 시퀀스 [y_min, x_min, y_max, x_max, c]로 양자화합니다.
  • 임의의 객체 순서와 EOS 토큰으로 단일 시퀀스로 여러 객체 설명을 직렬화합니다.
  • 이미지 인식용 인코더 + Transformer 디코더를 사용하여 토큰을 자기회귀적으로 생성하고 토큰 가능도를 최대화합니다.
  • 이미지와 선행 토큰들에 조건화된 토큰에 대해 간단한 소프트맥스 교차 엔트로피 손실로 학습합니다(최대 가능도).
  • 입력 시퀀스에 합성 노이즈 객체를 주입하고 타깃에서 이를 노이즈로 라벨링하여 재현성과 강건성을 향상시키는 시퀀스 증강을 적용합니다.
  • 추론 시에는 EOS가 생성될 때까지 토큰을 샘플링합니다(예: nucleus sampling); 생성된 토큰 시퀀스에서 경계 상자와 레이블을 추출하고 양자화 해제합니다.

실험 결과

연구 질문

  • RQ1이미지 입력에 조건화된 언어 모델링 문제로 객체 탐지가 효과적으로 재구성될 수 있는가?
  • RQ2토큰 기반 경계 상자 및 클래스 표현을 갖는 일반적인 인코더–디코더가 작업 특화 객체 제안이나 손실 없이 COCO 결과를 경쟁력 있게 달성하는가?
  • RQ3시퀀스 증강과 객체 순서 무작위성이 탐지 리콜 및 정밀도에 어떤 영향을 미치는가?
  • RQ4더 큰 탐지 데이터셋에서의 사전 학습이 COCO에서의 성능에 어떤 영향을 주는가?
  • RQ5경계 상자를 위한 토큰 기반 양자화의 정밀도 및 모델 용량 측면에서의 트레이드오프는 무엇인가?

주요 결과

  • Pix2Seq는 COCO에서 Faster R-CNN 및 DETR과 여러 백본 및 설정에서 경쟁적 결과를 달성합니다.
  • ResNet-50일 때, Pix2Seq는 AP 43.0 및 AP75 45.6을 달성하여 특정 지표에서 일부 기준선을 능가합니다; ResNet-101일 때는 AP 44.5 및 AP75 47.5가 관찰됩니다.
  • Objects365에서의 사전 학습 후 COCO로 미세 조정하면 ViT-L이 미세 조정 시 1333x1333에서 AP 50.0에 도달하는 등 강력한 이득이 확인됩니다(나열된 미세 조정 구성 중 최상).
  • 500개 이상의 bin으로의 양자화는 고정밀 경계 상자를 제공하고(640의 최장 변에서 bin당 1.3 픽셀) 손실 없이 작동하며, 학습 중 무작위 객체 순서는 결정적 순서보다 AP와 AR을 향상시킵니다.
  • 시퀀스 증강은 재현율을 크게 향상시키며(AP 영향은 미미하거나 약간), 가능도 오프셋을 통해 EOS를 지연시키면 재현율에 도움을 줍니다.
  • 추론 전략 중에서 nucleus sampling은 argmax보다 재현율을 향상시킵니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.