[논문 리뷰] A survey on Self Supervised learning approaches for improving Multimodal representation learning
이 종합 검토에서는 다중모달 표현 학습을 향상시키기 위해 교차 모달 생성, 교차 모달 미사전학습, 순환 번역, 자기지도형 단모달 레이블 생성의 네 가지 자기지도 학습 방법을 제시한다. 데이터의 구조를 활용해 감독 신호를 생성함으로써, 인간의 레이블링이 필요 없이 공동 표현을 향상시키며, 다중모달 감성 분석과 같은 작업에서 뛰어난 성능을 달성한다.
Recently self supervised learning has seen explosive growth and use in variety of machine learning tasks because of its ability to avoid the cost of annotating large-scale datasets. This paper gives an overview for best self supervised learning approaches for multimodal learning. The presented approaches have been aggregated by extensive study of the literature and tackle the application of self supervised learning in different ways. The approaches discussed are cross modal generation, cross modal pretraining, cyclic translation, and generating unimodal labels in self supervised fashion.
연구 동기 및 목표
- 다중모달 표현 학습에서 레이블이 부족한 문제를 해결하기 위해.
- 인간의 레이블링이 아닌 데이터 구조에서 감독 신호를 생성하는 자기지도 학습 기법을 탐색하기 위해.
- 다중모달 데이터로부터 파생된 단모달 감독을 통합하여 다중모달 표현 학습을 향상시키기 위해.
- 자기지도 학습 방법이 하류 작업을 위한 강력한 공동 다중모달 표현을 학습하는 데 얼마나 효과적인지 평가하기 위해.
- 최신 자기지도 접근법의 종합적 개요를 제공하여 표현 학습에 집중하기 위해.
제안 방법
- 이미지에서 텍스트로, 텍스트에서 이미지로의 교차 모달 생성을 통해 기반화되고 지역 수준의 표현을 생성한다.
- 고수준의 추상적 특징과 저수준의 기반화된 특징을 갖춘 이중 브랜치 아키텍처를 사용하여 정렬을 향상시킨다.
- Seq2Seq 네트워크를 사용해 모달 간 순환 번역(예: 언어 → 시각 → 청각)을 적용하여 공동 표현을 학습한다.
- 비모수적 단모달 레이블 생성 모듈을 도입하여 클래스 중심까지의 상대적 거리 기반으로 단모달 레이블을 추정한다.
- 다중 작업 학습을 통해 가중치가 부여된 손실 전략을 사용하여 다중모달 및 자기지도형 단모달 예측 헤드를 동시에 최적화한다.
- 순환 번역과 작업별 예측 목표를 결합한 결합 번역-예측 손실을 사용해 엔드 투 엔드로 훈련한다.
실험 결과
연구 질문
- RQ1자기지도 학습이 비용이 많이 드는 인간의 레이블링에 의존하지 않고 다중모달 표현 학습을 어떻게 향상시킬 수 있는가?
- RQ2교차 모달 생성이 이미지와 텍스트 표현 간의 정렬과 기반화를 얼마나 향상시킬 수 있는가?
- RQ3표준 미사전학습과 비교해 모달 간 순환 번역이 더 강력한 공동 표현을 생성할 수 있는가?
- RQ4자기지도형 단모달 레이블 생성이 다중모달 모델 성능 향상에 얼마나 효과적인가?
- RQ5자기지도형 단모달 감독을 통한 다중 작업 학습이 하류 작업 정확도에 어떤 영향을 미치는가?
주요 결과
- 기반화된 특징과 추상적 특징을 함께 사용한 교차 모달 생성은 국소적 및 전반적 표현을 정렬함으로써 검색 성능을 향상시킨다.
- 모달 간 순환 번역은 모든 모달에서 최대한의 정보를 포괄하는 공동 표현을 엔드 투 엔드로 학습할 수 있도록 한다.
- 클래스 중심까지의 상대적 거리 기반 자기지도형 단모달 레이블 생성은 의미 있는 감독 신호를 생성하여 모델 일반화를 향상시킨다.
- 균형 잡힌 손실 가중치를 사용한 다중 작업 학습은 다중모달 및 단모달 헤드 양쪽에서 학습 효율성과 성능을 향상시킨다.
- 제안된 방법들은 유일하게 소스 모달 입력만 필요로 하는 다중모달 감성 분석에서 뛰어난 성능을 달성한다.
- 이 프레임워크는 특히 인간의 레이블링 레이블이 부족한 저자원 환경에서 강건성과 이식 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.