[논문 리뷰] OmniNet: A unified architecture for multi-modal multi-task learning
OmniNet는 시공간 캐시와 주목적 기반 중심 처리를 통합하여 다양한 입력(텍스트, 이미지, 영상 포함) 간의 다중 모odal, 다중 작업 학습을 지원하는 통합 신경망 아키텍처를 제안한다. 동시에 네 가지 작업(POS 태깅, 이미지 캡션 생성, VQA, 영상 활동 인식)을 공동으로 학습할 경우 성능을 유지하면서도 모델 크기를 3배로 압축하며, 영상 캡션 및 영상 질의응답과 같은 미사용된 작업으로의 제로샷 전이를 입증한다.
Transformer is a popularly used neural network architecture, especially for language understanding. We introduce an extended and unified architecture that can be used for tasks involving a variety of modalities like image, text, videos, etc. We propose a spatio-temporal cache mechanism that enables learning spatial dimension of the input in addition to the hidden states corresponding to the temporal input sequence. The proposed architecture further enables a single model to support tasks with multiple input modalities as well as asynchronous multi-task learning, thus we refer to it as OmniNet. For example, a single instance of OmniNet can concurrently learn to perform the tasks of part-of-speech tagging, image captioning, visual question answering and video activity recognition. We demonstrate that training these four tasks together results in about three times compressed model while retaining the performance in comparison to training them individually. We also show that using this neural network pre-trained on some modalities assists in learning unseen tasks such as video captioning and video question answering. This illustrates the generalization capacity of the self-attention mechanism on the spatio-temporal cache present in OmniNet.
연구 동기 및 목표
- 텍스트, 이미지, 영상 등 다양한 입력 모odal(예: 텍스트, 이미지, 영상)을 동시에 네이티브로 지원하는 단일 통합 딥 러닝 아키텍처의 부재를 해결하기 위해.
- 동일한 모델이 다양한 작업을 서로 다른 입력 모달로 가로질러 아키텍처 재구성 없이 비동기적으로 다중 작업 학습을 가능하게 하기 위해.
- 다양한 모달 간에 학습된 공유 표현이 영상 캡션 및 영상 질의응답과 같은 새로운 작업으로 일반화될 수 있는지 탐색하기 위해.
- 작업 및 모달 간의 파라미터 공유를 통해 모델 크기와 파라미터 수를 줄여 성능 손실 없이 효율성을 향상시키기 위해.
제안 방법
- OmniNet는 트랜스포머 아키텍처를 기반으로 한 중심 신경 프로세서(CNP)를 사용하며, 이는 다수의 주변 네트워크로부터 온 시공간 표현을 처리한다.
- 각 주변 네트워크(예: 이미지, 텍스트, 영상용)는 자신의 모달 특화된 입력을 $ t \times s \times d_{\text{model}} $ 의 형태를 가진 시공간 텐서로 인코딩한다. 여기서 $ t $, $ s $, $ d_{\text{model}} $ 는 각각 시간적, 공간적, 모델 차원을 나타낸다.
- 새로운 시공간 캐시 메커니즘이 공간 및 시간 표현을 저장하여, 자기 주목적(self-attention)을 통해 양 차원에 걸쳐 주목적을 수행할 수 있도록 한다.
- 링크 어레이 컴ponent는 주로 영상 입력에서의 주목적 효율성을 향상시키기 위해 도입되었으며, 주목할 만한 프레임과 공간 영역에 집중함으로써 계산 부담을 줄인다.
- CNP는 모든 모달의 표현을 처리하고 저장하기 위한 일반화된 encode() 함수를 사용한 후, 다중 작업의 예측을 생성하기 위해 decode() 함수를 사용한다.
- 다양한 입력 모달과 출력 형식을 가진 작업 간에 엔드 투 엔드 학습을 지원하며, 공동 최적화를 가능하게 한다.
실험 결과
연구 질문
- RQ1단일 신경망 아키텍처가 텍스트, 이미지, 영상 등 다양한 모달과 다수의 작업 간에 효과적으로 표현을 학습하고 공유할 수 있는가?
- RQ2시공간 캐시 메커니즘의 통합이 다중 모달, 다중 작업 학습에서 성능 및 효율성 향상에 기여하는가?
- RQ3사전에 다양한 작업 조합으로 사전 학습된 모델이 영상 캡션 또는 영상 질의응답과 같은 새로운 작업으로 얼마나 일반화되는가?
- RQ4작업 간의 파라미터 공유가 개별 모델을 학습시키는 것과 비교해 모델 크기와 성능에 어떤 영향을 미치는가?
주요 결과
- POS 태깅, 이미지 캡션 생성, 시각적 질의응답, 영상 활동 인식의 네 가지 다양한 작업을 공동으로 학습할 경우 OmniNet는 성능을 유지하거나 略로 향상시키면서도 모델 크기를 약 3배로 압축한다.
- 제거 실험 결과, 공간 캐시를 제거하면 독립 학습에서 이미지 캡션 성능이 거의 전면 붕괴된다(_BLEU-4_ 28.9에서 0으로 하락), 이는 공간 표현에서의 핵심적 역할을 확인한다.
- 링크 어레이 컴ponent는 영상 기반 작업에서 가장 큰 영향을 미친다: 제거 시 HMDB 정확도는 55.29%에서 45.94%로 하락하여, 시공간 복잡성을 관리하는 데서의 가치를 입증한다.
- OmniNet는 영상 전용 데이터에 대한 피지테이닝 없이도 영상 캡션 및 영상 질의응답으로의 제로샷 전이를 달성하며, 이미지 캡션 및 VQA에서 사전 학습된 지식을 활용한다.
- 공간 캐시나 링크 어레이 컴ponent를 제거해도 POS 태깅의 정확도는 높은 수준(95.61%)을 유지하여, 시간적 전용 작업은 공간 또는 시공간 수정에 영향을 받지 않음을 확인한다.
- 다중 작업 학습에서 공간 캐시 제거 후에도 캡션 작업은 여전히 11.9 _BLEU-4_ 점수를 유지하여, 시간 캐시가 이미지 수준의 특징을 저장함으로써 부분적으로 보완하고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.