[논문 리뷰] KG-SP: Knowledge Guided Simple Primitives for Open World Compositional Zero-Shot Learning
KG-SP는 별개의 비선형 특징 추출기로 객체와 상태 레이블을 독립적으로 예측하면서 외부 지식(ConceptNet)을 활용해 비현실적인 조합을 걸러내는 지식 기반 접근 방식을 제안한다. 이는 개방형 복합 제로샷 학습(OW-CZSL)과 훈련 중에 부분적 지시만 제공되는 새로운 pCZSL 설정에서 최고 성능을 달성한다.
The goal of open-world compositional zero-shot learning (OW-CZSL) is to recognize compositions of state and objects in images, given only a subset of them during training and no prior on the unseen compositions. In this setting, models operate on a huge output space, containing all possible state-object compositions. While previous works tackle the problem by learning embeddings for the compositions jointly, here we revisit a simple CZSL baseline and predict the primitives, i.e. states and objects, independently. To ensure that the model develops primitive-specific features, we equip the state and object classifiers with separate, non-linear feature extractors. Moreover, we estimate the feasibility of each composition through external knowledge, using this prior to remove unfeasible compositions from the output space. Finally, we propose a new setting, i.e. CZSL under partial supervision (pCZSL), where either only objects or state labels are available during training, and we can use our prior to estimate the missing labels. Our model, Knowledge-Guided Simple Primitives (KG-SP), achieves state of the art in both OW-CZSL and pCZSL, surpassing most recent competitors even when coupled with semi-supervised learning techniques. Code available at: https://github.com/ExplainableML/KG-SP.
연구 동기 및 목표
- 모델이 사전에 조합 공간에 대한 지식 없이도 알려지지 않은 상태-객체 조합을 인식해야 하는 개방형 복합 제로샷 학습(OW-CZSL) 문제에 대응하기 위해.
- 외부 지식를 활용한 타당성 필터링을 통해 출력 공간의 효과적 크기를 줄여 OW-CZSL에서 일반화 성능을 향상시키기 위해.
- 훈련 중에 객체 또는 상태 레이블만 제공되는 새로운 설정인 부분적 지도 학습 하에 적용 가능한 CZSL(pCZSL)을 도입하고 평가하기 위해.
- 독립적인 원소 예측과 지식 기반 필터링의 조합이 OW-CZSL 및 pCZSL 모두에서 공동 조합 모델링을 능가하는지 확인하기 위해.
- ConceptNet에서 유도한 지식 기반 타당성 점수가 제로샷 일반화 및 약한 지도 학습 설정에서의 가짜 레이블 생성에 효과적인지 검증하기 위해.
제안 방법
- KG-SP는 객체와 상태 인식을 위해 별개의 비선형 특징 추출기를 사용하여 공유 표현 없이 작업에 특화된 특징 학습을 가능하게 한다.
- 모델은 추론 시 객체와 상태 레이블을 독립적으로 예측하여, 전체 조합에서의 탐색 공간을 개별 원소로 줄임으로써 문제를 단순화한다.
- 추론 중에 ConceptNet을 활용해 각 상태-객체 조합의 타당성을 평가하고, 낮은 점수를 받는 비합리적인 쌍을 출력 공간에서 걸러낸다.
- pCZSL 설정에서 훈련 중에 객체 또는 상태 레이블만 제공될 경우, KG-SP는 타당성 점수를 활용해 누락된 모odal의 가짜 레이블을 생성한다.
- 모델은 추론 및 훈련 모두에서 지식 기반 필터링을 적용하여 제로샷 일반화의 정확성과 강인성을 향상시킨다.
- 이 프레임워크는 준지도 학습과도 호환되며, 실험 결과 최근의 베이스라인과 비교해도 성능이 뛰어나다는 것을 보여준다.
실험 결과
연구 질문
- RQ1독립적인 객체 및 상태 원소 예측에 지식 기반 타당성 필터링을 조합하면 개방형 CZSL에서 공동 조합 모델링을 능가할 수 있는가?
- RQ2외부 지식(ConceptNet)이 비합리적인 상태-객체 조합을 걸러내어 제로샷 인식 성능을 향상시키는 데 얼마나 효과적인가?
- RQ3제안된 방법은 훈련 중에 부분적 지도(객체 또는 상태 레이블)만 제공되는 새로운 pCZSL 설정에 일반화될 수 있는가?
- RQ4지식 기반 필터링이 약한 지도 학습 환경에서 가짜 레이블의 질을 향상시켜 pCZSL에서 성능 향상에 기여하는가?
- RQ5특히 높은 복합적 복잡도를 가진 설정에서 KG-SP는 최고 성능 기반 방법들과 비교해 제로샷 일반화 성능에서 어떤가?
주요 결과
- KG-SP는 OW-CZSL 벤치마크에서 최고 성능을 달성했으며, 준지도 학습 기법을 사용하는 최근의 방법들조차도 뛰어넘었다.
- ConceptNet 기반의 타당성 점수를 활용해 비현실적인 조합을 걸러내어 출력 공간의 효과적 크기를 줄임으로써 제로샷 인식 정확도가 크게 향상되었다.
- pCZSL 설정에서는 최근의 접근 방식을 능가하며, 누락된 모달 예측을 위한 지식 기반 가짜 레이블 생성의 효과성을 입증했다.
- 객체와 상태에 대해 별개의 특징 추출기를 사용함으로써 공유 표현보다 더 나은 특징 학습이 가능했으며, 이는 각 작업이 다른 시각적 신호를 필요로 하기 때문이다.
- 정성적 분석 결과, ConceptNet 타당성 점수는 실제 세계의 타당성과 잘 일치하며, 일반적인 조합(예: 밝은 튤립,焦당화된 설탕)을 올바르게 식별하고 비합리적인 조합(예: 뜨거운 팔찌)을 거부하는 데 성공했다.
- 강력한 성능에도 불구하고 OW-CZSL 벤치마크에서의 절대 정확도는 여전히 낮다(예: C-GQA에서 2.9%의 미관측 정확도), 이는 이 과제의 본질적 어려움을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.