Skip to main content
QUICK REVIEW

[논문 리뷰] INTERN: A New Learning Paradigm Towards General Vision

Jing Shao, Siyu Chen|arXiv (Cornell University)|2021. 11. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 43인용 수 10
한 줄 요약

이 논문은 일반 시각 분야를 위한 새로운 다단계 학습 프레임워크인 INTERN을 제안한다. 이는 한 개의 모델이 다양한 컴퓨터 비전 작업으로 일반화할 수 있도록, 여러 단계에서 다중 감독 신호를 활용함으로써 학습한다 — 즉, 초보자(광범위한 사전학습), 전문가(과제별 맞춤형 미세조정), 일반인(다중 과제 적응) 단계이다. 이 모델은 단지 10%의 후행 학습 데이터만을 사용하여 26개의 벤치마크에서 최신 기술 수준의 성능을 달성하며, 기존의 CLIP와 같은 방법들을 크게 능가한다.

ABSTRACT

Enormous waves of technological innovations over the past several years, marked by the advances in AI technologies, are profoundly reshaping the industry and the society. However, down the road, a key challenge awaits us, that is, our capability of meeting rapidly-growing scenario-specific demands is severely limited by the cost of acquiring a commensurate amount of training data. This difficult situation is in essence due to limitations of the mainstream learning paradigm: we need to train a new model for each new scenario, based on a large quantity of well-annotated data and commonly from scratch. In tackling this fundamental problem, we move beyond and develop a new learning paradigm named INTERN. By learning with supervisory signals from multiple sources in multiple stages, the model being trained will develop strong generalizability. We evaluate our model on 26 well-known datasets that cover four categories of tasks in computer vision. In most cases, our models, adapted with only 10% of the training data in the target domain, outperform the counterparts trained with the full set of data, often by a significant margin. This is an important step towards a promising prospect where such a model with general vision capability can dramatically reduce our reliance on data, thus expediting the adoption of AI technologies. Furthermore, revolving around our new paradigm, we also introduce a new data system, a new architecture, and a new benchmark, which, together, form a general vision ecosystem to support its future development in an open and inclusive manner. See project website at https://opengvlab.shlab.org.cn .

연구 동기 및 목표

  • 각 새로운 시각 응용 프로그램을 위한 과제별 모델 학습에 필요한 높은 데이터 및 계산 자원 비용을 해결하기 위해.
  • 단일 감독 신호 사전학습의 한계를 극복하여, 오직 좁은 범위의 과제에만 일반화되는 것을 방지하기 위해.
  • 다양한, 심지어 알려지지 않은 시각 과제들에 효과적으로 적응할 수 있도록, 단일 모델이 작동하는 가용성 있고 통합된 파이프라인을 개발하기 위해.
  • 대규모 레이블이 부여된 데이터셋에 대한 의존도를 줄이기 위해, 효율적인 피셔트 샷 적응을 가능하게 하기 위해.
  • 개방적이고 포괄적인 일반 시각 모델 개발을 위한 완전한 생태계 — 데이터, 아키텍처, 벤치마크 — 를 구축하기 위해.

제안 방법

  • INTERN는 세 단계 사전학습 파이프라인을 활용한다: (I) 상游-초보자, (II) 상유-전문가, (III) 일반인으로서, 인간 인턴의 학습 과정을 모방한다.
  • 상유-초보자 단계는 다량의 소스 감독 신호(예: 이미지 수준 레이블, 바운딩 박스, 세그멘테이션 마스크, 자연어 등)를 사용하여 광범위한 표현 학습을 수행한다.
  • 상유-전문가 단계는 분류, 검출, 세그멘테이션 등의 특정 과제에 대해 강력한 감독을 통해 모델을 미세조정하여 과제별 전문 지식을 구축한다.
  • 일반인 단계는 이전 모든 단계의 지식을 통합하여, 통합적이고 민감한 적응 헤드를 통해 새로운 과제에 빠르게 적응할 수 있도록 한다.
  • 다양한 감독 신호를 지원하기 위한 새로운 데이터 시스템을 설계하였으며, 정제된 레이블 시스템과 고품질, 확장 가능한 데이터 수집을 위한 데이터 파이프라인을 포함한다.
  • 26개의 다양한 시각 과제에 걸쳐 일반화 능력을 평가하고 재현 가능성을 확보하기 위해 새로운 벤치마크인 General Vision Benchmark를 도입한다.

실험 결과

연구 질문

  • RQ1다단계 학습 프레임워크를 사용할 경우, 단일 시각 모델이 다양한, 심지어 알려지지 않은 시각 과제들에 대해 강력한 일반화를 달성할 수 있는가?
  • RQ2다양한 감독 신호(예: 카테고리, 바운딩 박스, 마스크, 언어 등)를 활용한 다중 감독 신호 학습이 단일 감독 사전학습 대비 모델의 일반화 능력을 얼마나 향상시키는가?
  • RQ310%의 후행 데이터만을 사용하여 미세조정된 INTERN로 사전학습된 모델이, 과제별 모델과 비교해 유사하거나 더 높은 성능을 달성할 수 있는가?
  • RQ4제안된 프레임워크는 다양한 과제에서 성능을 유지하거나 향상시키면서도, 시각 AI의 데이터 의존도를 줄일 수 있는가?
  • RQ5미래에 새로운 모odal(예: 비디오, 오디오)이나 과제들 통합을 위해 INTERN 프레임워크는 얼마나 확장 가능하고 유연한가?

주요 결과

  • 가장 큰 INTERN 모델인 Up-G MN-B15는 평가된 26개의 시각 과제 중 대부분에서 공개적으로 이용 가능한 최고의 모델인 CLIP-R50×16를 능가하며, 후행 학습 데이터의 10%만을 사용함에도 불구하고 성능을 냈다.
  • 평균적으로, INTERN 모델은 분류, 검출, 세그멘테이션, 검색의 네 가지 과제 유형 전반에서 뛰어난 성능을 보이며, 강력한 제로샷 및 피셔트 샷 일반화 능력을 입증했다.
  • 후행 데이터의 10%만을 사용한 모델의 성능이 이전 연구에서 전체 데이터셋으로 학습된 모델의 성능을 뛰어넘는 경우가 많아, 데이터 효율성에서 극적인 향상을 보였다.
  • 다단계 사전학습 방식은 다양한 감독 신호를 효과적으로 학습할 수 있도록 하여, 강력하고 민감한 표현을 만들어냈다.
  • 제안된 General Vision Benchmark는 향후 일반 시각 모델 연구를 위한 표준화되고 종합적인 평가 플랫폼을 제공한다.
  • 데이터 시스템, 아키텍처(메타넷 패밀리), 벤치마크를 포함한 생태계는 일반 시각 모델의 재현 가능하고 확장 가능한 개발을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.