Skip to main content
QUICK REVIEW

[논문 리뷰] GRIT: General Robust Image Task Benchmark

Tanmay Gupta, Ryan Marten|arXiv (Cornell University)|2022. 04. 28.
Domain Adaptation and Few-Shot Learning인용 수 11
한 줄 요약

GRIT는 다양한 데이터 소스, 개념 및 이미지 편향을 포함한 7개의 핵심 시각 및 시각언어 작업—객체 분류, 국소화, 언어 기반 참조 표현, VQA, 세분화, 관절점 검출, 표면 법선 추정—에 걸쳐 시각 모델의 일반성, 내구성, 校정 능력을 평가하기 위한 통합 벤치마크를 소개한다. 이 벤치마크는 모델 간 공정한 비교를 가능하게 하기 위해 두 가지 트랙을 제공한다: 제한된(제로샷 전이 및 데이터 효율성에 적합) 및 비제한된(대규모 기초 모델에 적합). 주요 결과로는 분포 이탈 상황에서의 성능 저하와 강력한 校정 트레이드오프가 확인되었다.

ABSTRACT

Computer vision models excel at making predictions when the test distribution closely resembles the training distribution. Such models have yet to match the ability of biological vision to learn from multiple sources and generalize to new data sources and tasks. To facilitate the development and evaluation of more general vision systems, we introduce the General Robust Image Task (GRIT) benchmark. GRIT evaluates the performance, robustness, and calibration of a vision system across a variety of image prediction tasks, concepts, and data sources. The seven tasks in GRIT are selected to cover a range of visual skills: object categorization, object localization, referring expression grounding, visual question answering, segmentation, human keypoint detection, and surface normal estimation. GRIT is carefully designed to enable the evaluation of robustness under image perturbations, image source distribution shift, and concept distribution shift. By providing a unified platform for thorough assessment of skills and concepts learned by a vision model, we hope GRIT catalyzes the development of performant and robust general purpose vision systems.

연구 동기 및 목표

  • i.i.d. 설정을 초월한 시각 모델 평가를 위한 통합 벤치마크 부족 문제를 해결하기 위해, 특히 분포 이탈 및 개념 전이 상황에서의 평가를 목적으로 한다.
  • JPEG, 블러, 적대적 편향 등 총 20종의 이미지 왜곡에 대한 모델의 내구성을 평가하기 위해 설계된다.
  • 제한된 훈련 데이터 접근을 통해 효율적이고 데이터 효율적인 모델(제한된 트랙)과 대규모 기초 모델(비제한된 트랙)을 모두 지원한다.
  • 예측의 신뢰도와 자기 인식 능력을 측정하기 위해 예측에 대한 신뢰도 점수를 출력함으로써 校정 능력을 평가한다.
  • 인간의 시각 이해 수준과 유사한 일반 목적의 시각 시스템 개발을 촉진하기 위해, 다양한 작업, 개념 및 데이터 소스 간의 일반화 능력을 향상시키는 데 목적이 있다.

제안 방법

  • GRIT는 광범위한 시각 능력을 다루는 7개의 핵심 작업—객체 분류, 국소화, 언어 기반 참조 표현 기반 정렬, VQA, 의미적 세분화, 인체 관절점 검출, 표면 법선 추정—기반으로 구성된다.
  • 평가의 일관성과 모호성 감소를 위해 모호하지 않은 기존 데이터셋과 표준화된 애너테이션을 사용한다.
  • 평가에는 세 가지 핵심 축이 포함된다: (1) 새로운 데이터 소스에서의 성능(분포 이탈), (2) 새로운 개념에서의 성능(개념 이탈), (3) 20종의 이미지 편향 유형에 대한 내구성.
  • 모델는 RMSE 및 자기 인식 메트릭을 활용한 校정 평가를 가능하게 하기 위해 각 예측에 대해 신뢰도 점수를 출력하도록 요구된다.
  • 두 가지 평가 트랙이 정의되어 있다: 제한된 트랙(특정 공개 데이터 소스에 국한) 및 비제한된 트랙(분석/시험 세트를 제외한 모든 데이터), 이는 컴퓨팅 규모에 관계없이 공정한 비교를 가능하게 한다.
  • 샘플 단위 평가 지표를 계산하고, 새로운 소스, 새로운 개념 등의 서브셋에 대해 평균을 내어 일반화 및 내구성에 대한 세밀한 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1시각 모델은 훈련 중에 볼 수 없었던 새로운 데이터 소스와 개념으로 일반화하는 데 얼마나 잘 성과를 내는가?
  • RQ2JPEG 압축, 노이즈, 적대적 공격 등 다양한 이미지 왜곡 상황에서 모델의 성능 유지 능력은 어느 정도인가?
  • RQ3다양한 작업 및 분포 이탈 상황에서 모델의 신뢰도 점수는 얼마나 잘 校정되어 있는가?
  • RQ4제한된 데이터 소스에서 훈련된 모델도 여전히 새로운 개념과 데이터 소스에서 강력한 제로샷 전이 성능를 달성할 수 있는가?
  • RQ5다양한 시각 작업에서 내구성과 일반화 능력 측면에서 서로 다른 모델 아키텍처 및 크기 간의 성능 비교는 어떻게 이루어지는가?

주요 결과

  • 모든 모델가 이미지 왜곡 상황에서 성능 저하를 경험했으며, 참조 표현 작업에서 제로샷 GPV-1만 저수준의 기준 성능 덕분에 예외였다.
  • 비제한된 트랙에서 GPV-2가 GRIT 분석 세트에서 전체적으로 가장 높은 정확도(31.9%)를 기록했으며, Mask R-CNN(20.2%)와 Bae et al.(7.1%)를 앞서나갔다.
  • 새로운 데이터 소스와 새로운 개념에서 모델의 성능 저하가 심각하게 나타나, 제로샷 일반화 능력의 한계를 드러냈다.
  • 교정 메트릭 분석 결과 트레이드오프가 확인되었으며, 자기 인식 능력을 극대화하는 모델일수록 RMSE가 악화되는 경향을 보여, 신뢰도의 안정성과 교정 능력 간 균형이 필요함을 시사했다.
  • 제한된 트랙은 동일한 공개 데이터 소스에 국한된 훈련 데이터를 통해 계산 자원이 제한된 모델 간의 공정한 비교를 성공적으로 가능하게 했다.
  • 표면 법선 추정 및 인체 관절점 검출 작업은 데이터에 개념 태그가 없어 새로운 개념 성능을 보고하지 못했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.