Skip to main content
QUICK REVIEW

[논문 리뷰] Solving Raven's Progressive Matrices with Neural Networks

Tao Zhuo, Mohan Kankanhalli|arXiv (Cornell University)|2020. 02. 05.
Neural Networks and Applications참고 문헌 30인용 수 17
한 줄 요약

이 논문은 사전 훈련된 ResNet-50을 사용하는 지도 학습 접근법과 새로운 비지도 학습 방법인 다중 레이블 분류를 위한 가짜 타깃(MCPT)을 결합하여 레이븐의 진행성 매트릭스(RPM) 문제를 해결한다. 지도 학습 방법은 86.26%의 정확도를 기록하며 인간 수준 성능(84.41%)을 초월했고, 레이블이 없는 데이터를 사용할 때 MCPT는 무작위 추측 정확도를 두 배로 끌어올려 28.50%에 도달하여 인공지능에서 인간 수준의 추론에 가까운 진전을 보였다.

ABSTRACT

Raven's Progressive Matrices (RPM) have been widely used for Intelligence Quotient (IQ) test of humans. In this paper, we aim to solve RPM with neural networks in both supervised and unsupervised manners. First, we investigate strategies to reduce over-fitting in supervised learning. We suggest the use of a neural network with deep layers and pre-training on large-scale datasets to improve model generalization. Experiments on the RAVEN dataset show that the overall accuracy of our supervised approach surpasses human-level performance. Second, as an intelligent agent requires to automatically learn new skills to solve new problems, we propose the first unsupervised method, Multilabel Classification with Pseudo Target (MCPT), for RPM problems. Based on the design of the pseudo target, MCPT converts the unsupervised learning problem to a supervised task. Experiments show that MCPT doubles the testing accuracy of random guessing e.g. 28.50% vs. 12.5%. Finally, we discuss the problem of solving RPM with unsupervised and explainable strategies in the future.

연구 동기 및 목표

  • 딥 신경망과 ImageNet 사전 훈련을 활용하여 지도 학습 RPM 해결에서 일반화 능력을 향상시키고 과적합을 줄이기 위해.
  • 레이블이 없는 데이터를 사용하여 인간 수준의 추론을 모방할 수 있는 비지도 학습 방법을 개발하기 위해.
  • 추상적 시각 추론 과제에서 기계 성능와 인간 수준의 추론 간 격차를 좁히기 위해.
  • 인공지능에서 시각 추론을 위한 비지도, 해석 가능한 표현 학습의 가능성 탐색을 위해.

제안 방법

  • ImageNet 사전 훈련을 사용한 깊은 잔차 신경망(ResNet-50)을 활용하여 지도 학습 RPM 분류에서 일반화 능력을 향상시키고 과적합을 줄인다.
  • 가짜 타깃 벡터를 사용한 다중 클래스 분류를 적용하여 비지도 RPM 해결 문제를 지도 학습 기반의 다중 레이블 학습 과제로 전환한다.
  • 10차원의 두 개의 원소가 1인 가짜 타깃 벡터를 설계하여, 첫 번째 및 두 번째 원소가 올바른 규칙 매칭 행(첫 번째 및 두 번째 행)과 정답 행에 해당하는 것을 보장한다.
  • 각 후보 정답에 대해 모델은 완전한 행을 생성하고, 가짜 타깃을 사용하여 정답 행을 첫 번째 두 행과 동일한 레이블로 분류하도록 학습한다.
  • 동일한 논리적 규칙을 공유하는 행들 간에 일관된 표현을 학습하도록 콘트라스트 학습 전략을 적용한다.
  • 평가를 위해 RAVEN 데이터셋을 사용하며, 다양한 그림 구성에서 테스트 세트의 상위 1 정확도로 성능을 측정한다.

실험 결과

연구 질문

  • RQ1ImageNet 사전 훈련과 깊은 아키텍처를 갖춘 딥 신경망이 과적합을 줄이며 기존 방법보다 RPM 해결에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ2레이블이 전혀 없는 비지도 학습 방법이 인간 수준의 추론에 가까운 의미 있는 성능를 달성할 수 있는가?
  • RQ3비지도 학습 방법의 성능가 무작위 추측과 인간 수준의 성능를 비교해보면 어떻게 되는가?
  • RQ4비지도 모델이 시각 추론 과제에서 설명 가능한 규칙 기반 표현을 어느 정도 학습할 수 있는가?

주요 결과

  • ResNet-50와 ImageNet 사전 훈련을 사용한 지도 학습 방법은 RAVEN 데이터셋에서 86.26%의 정확도를 기록하여 인간 수준의 성능(84.41%)을 초월했다.
  • 제안된 비지도 학습 방법인 MCPT는 테스트 정확도 28.50%를 기록했으며, 이는 무작위 추측 정확도 12.5%의 두 배에 해당한다.
  • L-R 및 O-IC와 같은 특정 그림 구성에서는 지도 학습 방법이 인간을 10퍼센트 이상 초월하는 성능를 보였다.
  • 일반화 능력은 여전히 제한되어 있다: 단순한 구성에서 훈련된 모델들은 복잡한 구성에서는 성능가 떨어지며, 인간은 더 효과적으로 일반화하는 것과 대비된다.
  • 비지도 MCPT 방법은 Center 및 O-IC 구성에서 특히 뛰어난 성능를 보였으며, 33% 이상의 정확도를 기록했다.
  • 높은 정확도에도 불구하고 현재 모델들은 설명 가능성이 결여되어 있다: 인간과 달리 예측의 논리적 규칙를 설명할 수 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.