Skip to main content
QUICK REVIEW

[논문 리뷰] What comes after transformers? -- A selective survey connecting ideas in deep learning

Johannes Schneider|arXiv (Cornell University)|2024. 08. 01.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 트랜스포머를 초월한 딥러닝의 최근 혁신을 조사하며, 상태공간 모델, 캡슐 네트워크, 그리고 새로운 레이어 설계와 같은 대체 아키텍처에 초점을 맞춘다. 다수의 설계 패턴—다양한 X, 고차원 레이어, 데이터 제어형 게이팅, 이동 평균, 행렬 분해—이 성공적인 발전을 통합하고, 현재 트랜스포머 패러다임을 넘어서 비차별적이고 비누적적 진전을 이끌어내는 향후 연구를 이끌어낸다.

ABSTRACT

Transformers have become the de-facto standard model in artificial intelligence since 2017 despite numerous shortcomings ranging from energy inefficiency to hallucinations. Research has made a lot of progress in improving elements of transformers, and, more generally, deep learning manifesting in many proposals for architectures, layers, optimization objectives, and optimization techniques. For researchers it is difficult to keep track of such developments on a broader level. We provide a comprehensive overview of the many important, recent works in these areas to those who already have a basic understanding of deep learning. Our focus differs from other works, as we target specifically novel, alternative potentially disruptive approaches to transformers as well as successful ideas of recent deep learning. We hope that such a holistic and unified treatment of influential, recent works and novel ideas helps researchers to form new connections between diverse areas of deep learning. We identify and discuss multiple patterns that summarize the key strategies for successful innovations over the last decade as well as works that can be seen as rising stars. Especially, we discuss attempts on how to improve on transformers covering (partially) proven methods such as state space models but also including far-out ideas in deep learning that seem promising despite not achieving state-of-the-art results. We also cover a discussion on recent state-of-the-art models such as OpenAI's GPT series and Meta's LLama models and, Google's Gemini model family.

연구 동기 및 목표

  • 딥러닝에서 트랜스포머를 대체하거나 그 성공을 이어갈 수 있는 유망한 비트랜스포머 아키텍처와 구성요소를 식별하고 통합한다.
  • 최근 딥러닝 발전에서 성공을 이끄는 공통의 설계 패턴을 밝혀내는 것.
  • 연구자들이 최근 모델 아키텍처, 레이어, 최적화 기법에 대한 통합적이고 통합적인 개요를 제공함으로써, 좁은 영역에 국한된 작업 중심의 조사에서 벗어나도록 한다.
  • 실험적으로 입증된 방법(예: 상태공간 모델)과 아직 최상위 성능을 내지 못하더라도 미래에 영향을 미칠 잠재력이 있는 먼 훌륭한 아이디어를 모두 강조한다.
  • 공통된 설계 원칙을 통해 자연어 처리, 컴퓨터 비전, 일반 딥러닝 분야 간 아이디어를 연결함으로써 새로운 연구를 자극한다.

제안 방법

  • 2016년 이후 영향력 있는 논문들을 종합적으로 분석하며, Paperswithcode.com의 높은 사용 지표와 연구 커뮤니티 내 빠른 수용도를 우선 고려한다.
  • 다양한 주목적 메커니즘, 상태공간 모델, 그리고 미시, 게이트 유형 레이어(예: 미시, 게이트 유형 레이어)를 포함한 주요 아키텍처 혁신을 분류하고 분석한다.
  • 저자들은 다섯 가지 반복적인 설계 패턴—다양한 X, 고차원 레이어, 데이터 제어형 게이팅, 이동 평균, 행렬 분해—을 식별하고 체계화한다.
  • 메서드론은 벤치마크 랭킹과 인용 분석을 통한 경험적 검증에 기반하며, 구글 색색 및 서베이 문헌을 통한 수동 검증으로 보완된다.
  • 기존의 트랜스포머 기반 모델(예: GPT, 라마, 지미)과 새로운 대안을 대조하여 이론적 및 실용적 잠재력을 평가한다.
  • 연구의 초점을 유지하기 위해 데이터/데이터 증강, 모델 압축, 분산 학습 분야의 커버리지에서 벗어난다.
Figure 1 : Overview: Part 1 deals with transformers, Part 2 with deep learning (Lower graph based on [ 103 ] )
Figure 1 : Overview: Part 1 deals with transformers, Part 2 with deep learning (Lower graph based on [ 103 ] )

실험 결과

연구 질문

  • RQ1트랜스포머의 현재 딥러닝 환경을 뒤흔들 수 있는 가장 유망한 아키텍처적 대안은 무엇인가?
  • RQ2최근 딥러닝 혁신의 성공을 이끄는 공통의 설계 패턴은 무엇이며, 이는 단순한 개선을 넘어서는가?
  • RQ3상태공간 모델이나 캡슐 네트워크와 같은 신규 모델들이 효율성, 표현력, 확장성 측면에서 트랜스포머와 어떻게 비교되는가?
  • RQ4최상위 성능을 내지 못하더라도, 일부 먼 훌륭한 아이디어들이 왜 향후 돌파구를 이끌 수 있는 잠재력을 지닌가?
  • RQ5현재의 딥러닝 발전은 단순한 개선인지, 아니면 근본적인 패러다임 전환인가?

주요 결과

  • 이 논문은 성공적인 딥러닝 혁신의 배경에 반복적으로 나타나는 다섯 가지 핵심 설계 패턴—다양한 X, 고차원 레이어, 데이터 제어형 게이팅, 이동 평균, 행렬 분해—을 식별한다.
  • 상태공간 모델은 주목적 메커니즘의 주요 대안으로 떠오르며, 선형 복잡도와 시퀀스 모델링에서 뛰어난 성능을 보인다.
  • 데이터 제어형 게이팅 메커니즘(예: 주목적, LSTM, GELU, 전문가의 혼합)은 동적 정보 흐름을 위한 강력한 추상화로 입증된다.
  • 그들의 지배적 위치에도 불구하고, 트랜스포머는 다양한 작업에서 잘 작동하기 때문에 '무료 점심' 정리에 위배됨을 발견했으며, 이는 특정 영역에서 전문화된 아키텍처가 그들을 능가할 수 있음을 시사한다.
  • 연구에서 '승자독점' 동적이 드러나며, 플랫폼 기반 지표가 덜 인기 있는 혁신적인 아이디어를 간과할 수 있어, 진정으로 혁신적인 발전이 정체될 위험이 있음을 밝혀냈다.
  • 저자들은 최근 진전이 매우 창의적이라도 대부분이 여전히 점진적인 발전이며, 향후 돌파구는 현재의 아키텍처 추세를 넘어서 근본적으로 새로운 접근이 필요하다고 결론 내린다.
Figure 2 : Transformer with the four basic blocks on top and the encoder and decoder at the bottom Figure from [ 103 ]
Figure 2 : Transformer with the four basic blocks on top and the encoder and decoder at the bottom Figure from [ 103 ]

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.