Skip to main content
QUICK REVIEW

[논문 리뷰] Composing Ensembles of Pre-trained Models via Iterative Consensus

Shuang Li, Yilun Du|arXiv (Cornell University)|2022. 10. 20.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 반복적 공감을 통해 사전 훈련된 모델의 앙상블을 구성하는 제로샷 프레임워크를 제안한다. 생성자 모델이 제안을 생성하고, 앙상블 형태의 평가자들이 피드백을 제공하는 폐쇄형 피드백 개선 과정을 거친다. 이 방법은 피팅 트레이닝 없이도 다양한 다중모달 작업—예를 들어 이미지 생성, 수학 추론, 로봇 조작—에서 성능을 크게 향상시키며, GSM8K에서 7.5%의 정확도 향상을 기록하고, 피팅 트레이닝된 기준 모델을 능가한다. 이는 다수의 전문 모델이 제공하는 집단적 피드백을 활용한 결과이다.

ABSTRACT

Large pre-trained models exhibit distinct and complementary capabilities dependent on the data they are trained on. Language models such as GPT-3 are capable of textual reasoning but cannot understand visual information, while vision models such as DALL-E can generate photorealistic photos but fail to understand complex language descriptions. In this work, we propose a unified framework for composing ensembles of different pre-trained models -- combining the strengths of each individual model to solve various multimodal problems in a zero-shot manner. We use pre-trained models as "generators" or "scorers" and compose them via closed-loop iterative consensus optimization. The generator constructs proposals and the scorers iteratively provide feedback to refine the generated result. Such closed-loop communication enables models to correct errors caused by other models, significantly boosting performance on downstream tasks, e.g. improving accuracy on grade school math problems by 7.5%, without requiring any model finetuning. We demonstrate that consensus achieved by an ensemble of scorers outperforms the feedback of a single scorer, by leveraging the strengths of each expert model. Results show that the proposed method can be used as a general purpose framework for a wide range of zero-shot multimodal tasks, such as image generation, video question answering, mathematical reasoning, and robotic manipulation. Project page: https://energy-based-model.github.io/composing-pretrained-models.

연구 동기 및 목표

  • 기존의 모델 조합 방법이 폐쇄형 피드백 부족, 언어 기반 고정 인터페이스 의존, 또는 공동 피팅 트레이닝 필요성 등의 한계를 해결하기 위해.
  • 추가 학습 없이도 다양한 작업에서 제로샷 다중모달 추론을 가능하게 하기 위해, 사전 훈련된 모델들만을 사용하기 위해.
  • 서로 보완적인 피드백을 제공하는 다수의 평가자들을 조합하여 성능을 향상시키고, 강인성과 오류 수정 능력을 향상시키기 위해.
  • 반복적 개선과 앙상블 평가가 효과적인 제로샷 일반화를 위해 필수적임을 입증하기 위해.
  • 다양한 사전 훈련된 모델들을 폐쇄형 피드백 기반으로 통합할 수 있는 확장 가능하고 일반적인 프레임워크를 구축하기 위해.

제안 방법

  • 프레임워크는 주어진 작업에 대해 반복적으로 제안을 생성하는 단일 생성자 모델을 사용한다.
  • 사전 훈련된 모델들의 앙상블이 평가자로 기능하며, 각각 현재 제안에 대한 일치도 점수를 제공한다.
  • 피드백은 생성자 모델이 모든 평가자들의 집단적 공감에 기반해 출력을 개선하는 폐쇄형 피드백 프로세스에서 사용된다.
  • 반복적 개선은 다수의 단계를 거쳐 이루어지며, 평가자들이 각 단계에서 출력을 평가하고 생성자 모델을 이끌며, 최종 단계에서만 평가하지는 않는다.
  • 다양한 사전 훈련된 모델들(예: CLIP, CLS, CLS-FREE)을 평가자로 선택하여 상호 보완적인 강점과 편향 감소를 확보한다.
  • 이 방법은 피팅 트레이닝이나 작업별 적응 없이 제로샷 방식으로 작동한다.

실험 결과

연구 질문

  • RQ1생성자와 평가자 앙상블 간의 반복적 공감이 피팅 트레이닝 없이 다양한 다중모달 작업에서 제로샷 성능을 향상시킬 수 있는가?
  • RQ2단일 평가자나 일방적 피드백에 비해, 다수의 평가자로부터 온 폐쇄형 피드백은 모델 오류를 얼마나 효과적으로 수정하는가?
  • RQ3앙상블 평가와 반복적 개선 중 어느 것이 제로샷 일반화 달성에 더 기여하는가?
  • RQ4이 프레임워크는 수학 추론 및 로봇 조작과 같은 작업에서 피팅 트레이닝된 모델을 능가할 수 있는가?
  • RQ5평가자 앙상블에 포함된 사전 훈련된 모델들의 다양성이 최종 성능과 강인성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 최종 점수 선택 기반 기준 모델 대비 GSM8K 초등학교 수학 벤치마크에서 정확도를 7.5% 향상시켰다.
  • 반복적 개선과 앙상블 평가자(PICTURE with G+E1+E2+E3)를 사용한 결과, 이미지 생성에서 프리셰트 인ception 거리(Fréchet Inception Distance, FID)가 3.766으로 나타나 단일 평가자 기반 기준 모델보다 유의미하게 뛰어났다.
  • 피팅 트레이닝된 GPT-2 모델(GPT-FT+E)을 능가하는 성능을 보였으며, 이는 제로샷 앙상블 피드백의 힘을 입증한다.
  • 로봇 조작 작업에서 다섯 명의 평가자(PICTURE with ∑₅Eₙ)를 사용한 반복적 개선이 3-Relations 작업에서 75.0%의 성공률을 기록했으며, 비반복 기준 모델 대비 37.5% 향상되었다.
  • 제거 실험 결과, 반복적 개선과 앙상블 평가 모두 필수적임을 확인했으며, 둘 중 하나를 제거하면 성능이 유의미하게 떨어졌다.
  • 이 프레임워크는 이미지 생성, 영상 질의응답, 수학 추론, 로봇 제어 분야에서 최고 수준의 제로샷 성능을 달성했으며, 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.