[논문 리뷰] Transferring Domain-Agnostic Knowledge in Video Question Answering
이 논문은 도메인에 관계없이 적용 가능한 지식(예: 일반 지식 추론)과 도메인 특화 지식을 분리하여 다양한 데이터셋 간 효과적인 전이를 가능하게 하는 지식 기반 전이 학습 프레임워크를 제안한다. 도메인에 관계없이 적용 가능한 지식을 중개로 사용하여 사전 훈련된 모델을 미세 조정하고, 새로운 데이터셋 KnowIT-X(21,412개의 인간 레이블링 QA 쌍과 지식을 포함)를 도입함으로써 성능 향상이 크게 이루어졌으며, 도메인에 관계없이 적용 가능한 지식이 전이 가능하고, 미지의 도메인에서 VideoQA 정확도를 최대 10.5% 향상시킨다는 것을 입증한다.
Video question answering (VideoQA) is designed to answer a given question based on a relevant video clip. The current available large-scale datasets have made it possible to formulate VideoQA as the joint understanding of visual and language information. However, this training procedure is costly and still less competent with human performance. In this paper, we investigate a transfer learning method by the introduction of domain-agnostic knowledge and domain-specific knowledge. First, we develop a novel transfer learning framework, which finetunes the pre-trained model by applying domain-agnostic knowledge as the medium. Second, we construct a new VideoQA dataset with 21,412 human-generated question-answer samples for comparable transfer of knowledge. Our experiments show that: (i) domain-agnostic knowledge is transferable and (ii) our proposed transfer learning framework can boost VideoQA performance effectively.
연구 동기 및 목표
- VideoQA에서 도메인에 관계없이 적용 가능한 지식이 서로 다른 비디오 도메인 간에 전이 가능한지 조사하기.
- 원천 도메인과 타겟 도메인 간의 성능 격차를 줄이기 위해 도메인 특화 지식 간섭을 완화하기.
- 도메인에 관계없이 적용 가능한 지식 전달을 통해 모델의 일반화 능력을 향상시키는 지식 중심의 전이 학습 프레임워크 개발하기.
- 효과적인 전이 학습을 위해 인간 레이블링된 QA 쌍과 관련 지식을 포함한 새로운 대규모 VideoQA 데이터셋 KnowIT-X 구축하기.
- 검출(DET) 및 정렬(DA) 모듈을 결합함으로써 지식 기반 및 추론 성능 향상 여부 평가하기.
제안 방법
- 프레임워크는 지식을 도메인에 관계없이 적용 가능한 지식과 도메인 특화 지식으로 분리하며, 도메인에 관계없이 적용 가능한 지식이 데이터셋 간 전이 가능한 중개 역할을 한다.
- 새로운 VideoQA 데이터셋인 KnowIT-X는 21,412개의 인간이 생성한 QA 쌍과 관련 지식을 포함하며, 원천 데이터셋의 도메인과 다를 바 있는 TV 시리즈 'Friends'에서 유래되었고, 원천 데이터셋의 도메인('The Big Bang Theory')과는 다릅니다.
- 이 방법은 원천 데이터셋(KnowIT)에서의 사전 훈련과 타겟 데이터셋(KnowIT-X)에서의 미세 조정을 통해 이루어지며, 검색된 지식과 진짜 지식을 모두 활용하여 지도 학습을 수행한다.
- 검출(DET) 모듈은 질문과 비디오 클립 내의 고유명사 엔티티를 식별하고, 정렬(DA) 모듈은 이러한 엔티티를 관련 지식과 일치시켜 지식 기반 및 추론 능력을 향상시킨다.
- 모델은 이미지, 캡션, 얼굴 특징을 시각적 입력으로 사용하며, 지식은 외부 소스나 진짜 지식에서 검색하고, 소규모 설정에서는 데이터 증강을 위해 역번역을 적용한다.
- 전이 학습은 원천 모델의 가중치로 타겟 모델을 초기화하고, 도메인에 관계없이 적용 가능한 지식을 사용하여 미세 조정함으로써 도메인 특화 편향을 최소화한다.
실험 결과
연구 질문
- RQ1VideoQA에서 도메인에 관계없이 적용 가능한 지식이 서로 다른 비디오 도메인 간에 효과적으로 전이될 수 있는가?
- RQ2도메인에 관계없이 적용 가능한 지식의 포함 여부가 다른 도메인을 가진 타겟 데이터셋에서 VideoQA 성능에 어떤 영향을 미치는가?
- RQ3검출(DET) 및 정렬(DA) 모듈을 결합함으로써 지식 기반 및 정답 정확도에 어떤 영향을 미치는가?
- RQ4훈련 데이터의 크기가 VideoQA에서 전이 학습 성능에 어느 정도의 영향을 미치는가?
- RQ5검색된 지식과 진짜 지식을 사용할 경우 모델의 일반화 능력과 견고성에 어떤 영향을 미치는가?
주요 결과
- 제안된 전이 학습 프레임워크는 직접 학습 대비 KnowIT-X에서 최대 10.5% 향상된 VideoQA 정확도를 달성하며, DET 및 DA 모듈을 모두 사용할 경우 최고 성능를 기록한다.
- KnowIT에서 사전 훈련하고 KnowIT-X에서 미세 조정한 모델은 진짜 지식을 사용할 경우 전체 KnowIT-X 데이터셋에서 0.850의 비디오 추론 정확도를 달성하여 직접 학습보다 10.5% 높은 성능를 보였다.
- 모든 설정에서 캡션을 시각적 입력으로 사용할 경우 가장 높은 성능를 기록했으며, 전이 학습과 함께 DET 및 DA 모듈을 모두 활성화했을 경우 정확도 0.758을 달성했다.
- DET 및 DA 모듈을 모두 포함할 경우 한 개 또는 둘 다 사용하지 않을 경우보다 정확도가 3.5~5.5%p 향상되어 지식 기반에서 상호 보완적인 역할을 한다는 것을 입증했다.
- 전체 KnowIT-X 데이터셋(v-full)에서 훈련한 모델는 진짜 지식을 사용할 경우 0.850의 정확도를 기록했으며, 충분한 데이터와 지식 주입이 높은 성능를 확보하는 데 핵심적임을 보여주었다.
- 정성적 분석을 통해 전이 학습은 지식을 질문과 정답에 더 잘 맞추는 데 성공했고, 직접 학습은 도메인 특화 엔티티인 '모자'와 같은 요소에 과도하게 집중하는 경향이 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.