Skip to main content
QUICK REVIEW

[논문 리뷰] Solving Bongard Problems with a Visual Language and Pragmatic Reasoning

Stefan Depeweg, Constantin A. Rothkopf|arXiv (Cornell University)|2018. 04. 12.
Multimodal Machine Learning Applications참고 문헌 43인용 수 16
한 줄 요약

이 논문은 시각적 특징 추출과 상징적 시각 언어, 실용적 추론을 조합하여 Bongard 문제를 해결하는 새로운 접근법을 제시한다. 형식적 시각 언어 위에서 베이지안 추론을 적용하여 철저히 선택된 양성 및 부정성 예제들로부터 복잡한 개념을 유추함으로써, 실용적 해석을 통한 Bongard의 자신의 해답과 일치함으로써 현재까지 가장 높은 정확도를 달성한다.

ABSTRACT

More than 50 years ago Bongard introduced 100 visual concept learning problems as a testbed for intelligent vision systems. These problems are now known as Bongard problems. Although they are well known in the cognitive science and AI communities only moderate progress has been made towards building systems that can solve a substantial subset of them. In the system presented here, visual features are extracted through image processing and then translated into a symbolic visual vocabulary. We introduce a formal language that allows representing complex visual concepts based on this vocabulary. Using this language and Bayesian inference, complex visual concepts can be induced from the examples that are provided in each Bongard problem. Contrary to other concept learning problems the examples from which concepts are induced are not random in Bongard problems, instead they are carefully chosen to communicate the concept, hence requiring pragmatic reasoning. Taking pragmatic reasoning into account we find good agreement between the concepts with high posterior probability and the solutions formulated by Bongard himself. While this approach is far from solving all Bongard problems, it solves the biggest fraction yet.

연구 동기 및 목표

  • 최소한의 비랜덤으로 선택된 예제들로부터 추론이 필요한 시각적 개념 학습 과제인 Bongard 문제를 해결하는 데 도전한다.
  • 추출된 이미지 특징들로부터 형식적 시각 언어를 구성하여 비기호적 시각 처리와 기호적 추론을 연결한다.
  • Bongard 문제에서 예제들이 목표 개념을 효과적으로 전달하기 위해 의도적으로 선택됨을 인지함으로써 개념 유도에 실용적 추론을 통합한다.
  • 예제 선택의 의사소통 의도를 모델링하여 이전 시스템을 초월해 Bongard 문제의 성능을 향상시킨다.
  • 구조화된 시각 언어 위에서의 베이지안 추론이 Bongard가 직접 제시한 해법과 밀도 있게 일치하는 해답을 도출함을 보여준다.

제안 방법

  • 형태, 위치, 크기, 공간적 관계 등을 탐지하는 이미지 처리 기법을 사용하여 이미지에서 시각적 특징을 추출한다.
  • 논리적 및 공간적 관계를 통해 복잡한 시각적 개념을 표현하는 형식 언어를 사용하여 이러한 특징들을 상징적 시각 어휘로 변환한다.
  • 주어진 양성 및 부정성 예제들로부터 가장 가능성이 높은 개념을 도출하기 위해 베이지안 추론 기반의 확률 모델을 정의한다.
  • 예제들이 무작위로 선택된 것이 아니라 목표 개념을 가장 잘 전달하기 위해 선택되었음을 가정함으로써 실용적 추론을 통합한다.
  • 가능한 개념들의 공간을 탐색하고 후행 확률을 추정하기 위해 마르코프 체인 몬테카를로(Markov Chain Monte Carlo, MCMC) 샘플링을 사용한다.
  • 후행 확률이 Bongard의 원래 해답과 얼마나 일치하는지 비교함으로써 후보 개념을 평가하고, 의사소통 의도를 고려해 조정한다.

실험 결과

연구 질문

  • RQ1형식적 시각 언어와 베이지안 추론을 조합하면 Bongard 문제의 복잡한 시각적 개념을 효과적으로 모델링할 수 있는가?
  • RQ2예제 선택의 의도적 성격을 고려한 실용적 추론을 통합할 경우, Bongard 문제에서의 개념 유도 성능은 어떻게 향상되는가?
  • RQ3기호적 시각 추론은 이 과제에서 순수 비기호적 딥러닝 접근법을 얼마나 뛰어넘을 수 있는가?
  • RQ4구조화된 표현 방식과 논리적 관계는 최소 데이터로 시각적 개념 학습 문제를 해결하는 데 어떤 역할을 하는가?
  • RQ5시스템이 추론한 개념들이 Bongard가 직접 제공한 원래 해답과 얼마나 잘 일치하는가?

주요 결과

  • 형식적 시각 언어와 실용적 추론을 활용하여 이전까지 가장 높은 비율의 Bongard 문제를 해결함으로써 성과를 달성했다.
  • 후행 확률이 가장 높은 개념들이 Bongard의 직접 제시한 해답과 밀도 있게 일치하여 인간이 구성한 개념과의 강한 일치를 보여준다.
  • Bongard 문제 #71의 경우, 시스템은 '왼쪽: 두 번째 순서의 내부 도형이 존재한다'는 규칙를 가장 가능성 높은 규칙로 식별했으며, 후행 확률은 0.20이었다.
  • Bongard 문제 #79의 경우, 시스템은 '어두운 원이 삼각형보다 외곽 원에 더 가까이 있다'는 핵심 구분 특징을 정확히 식별했으며, 후행 확률은 0.12였다.
  • 실용적 추론을 통합함으로써 성능 향상이 뚜렷하게 나타났으며, 비실용적 기반 모델 대비 Bongard의 원래 해답과의 일치도가 높았다.
  • 심지어 중첩된 포함 관계나 상대적 거리와 같은 복잡한 공간적 및 관계적 특징을 상징적 조합을 통해 잘 처리하는 데에 우수한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.