[논문 리뷰] Can Transformers Learn to Solve Problems Recursively?
이 논문은 소형 트랜스포머 모델이 입력-출력 예제를 통해 구조적 재귀 함수를 모방할 수 있는지 조사한다. 이는 프로그램 합성과 형식적 검증의 핵심 요소이다. 기계적 해석 기법을 사용하여 모델이 학습한 '단축' 알고리즘을 재구성함으로써, 실패 케이스의 최대 91퍼센트를 예측할 수 있었으며, 트랜스포머가 진정한 의미 일반화가 아닌 결함 있는, 깊이에 따라 달라지는 히وري스틱을 통해 재귀를 근사하고 있음을 드러냈다.
Neural networks have in recent years shown promise for helping software engineers write programs and even formally verify them. While semantic information plays a crucial part in these processes, it remains unclear to what degree popular neural architectures like transformers are capable of modeling that information. This paper examines the behavior of neural networks learning algorithms relevant to programs and formal verification proofs through the lens of mechanistic interpretability, focusing in particular on structural recursion. Structural recursion is at the heart of tasks on which symbolic tools currently outperform neural models, like inferring semantic relations between datatypes and emulating program behavior. We evaluate the ability of transformer models to learn to emulate the behavior of structurally recursive functions from input-output examples. Our evaluation includes empirical and conceptual analyses of the limitations and capabilities of transformer models in approximating these functions, as well as reconstructions of the ``shortcut" algorithms the model learns. By reconstructing these algorithms, we are able to correctly predict 91 percent of failure cases for one of the approximated functions. Our work provides a new foundation for understanding the behavior of neural networks that fail to solve the very tasks they are trained for.
연구 동기 및 목표
- 트랜스포머 모델이 프로그램 합성과 형식적 검증의 핵심 클래스인 구조적 재귀 함수를 입력-출력 예제로부터 모방할 수 있는지 조사하는 것.
- 트랜스포머 모델이 명시적으로 훈련된 작업에서 재귀 의미를 모델링하는 데 실패하는 방식과 이유를 분석하는 것.
- 기계적 해석 기법을 사용하여 트랜스포머가 학습한 '단축' 알고리즘을 역공학하는 것.
- 어 attention 메커니즘과 모델 깊이가 이러한 학습된, 최적화되지 않은 행동 양식을 어떻게 형성하는지 이해하는 것.
- 재귀적이고 의미론적 추론 작업에 대해 신경망 모델의 훈련, 프롬프팅, 평가를 향상시키기 위한 기반을 마련하는 것.
제안 방법
- 구조적 재귀를 포함한 합성 작업에서 소형 트랜스포머 모델을 처음부터 훈련하는 것.
- 트랜스포머의 계산적 행동을 모델링하고 분석하기 위한 공식적 프레임워크로 추상 상태 기계(ASMs)를 사용하는 것.
- 역공학적 알고리즘을 역공학하기 위해 반사적 패치, 회로 추적, 어텐션 헤드 분석과 같은 기계적 해석 기법을 적용하는 것.
- 레이어와 헤드를 가로질러 어텐션 패턴을 추적하여 모델이 재귀 하위구조, 괄호 신호, 노드 복사 작업을 어떻게 처리하는지 파악하는 것.
- 재귀 감소 및 하위트리 복사 과정에서 모델 행동을 추적하기 위해 UNROLL 및 EMPTY 토큰을 상징적 마커로 사용하는 것.
- 괄호 닫힘과 같은 중요한 지점에서 어텐션 종속성과 행동 변화를 분석하여 '단축' 알고리즘을 재구성하는 것.

실험 결과
연구 질문
- RQ1소형 트랜스포머 모델은 재귀적 구조에 대한 명시적 지시 없이도 입력-출력 예제로부터 구조적 재귀 함수를 모방할 수 있는가?
- RQ2트랜스포머는 진정한 재귀 일반화 대신 어떤 종류의 '단축' 알고리즘을 학습하며, 그로 인해 어떻게 실패하는가?
- RQ3트랜스포머의 어텐션 메커니즘은 추론 중에 재귀 하위구조를 어떻게 인코딩하고 조작하는가?
- RQ4기계적 해석 기법을 통해 재귀 작업에 훈련된 트랜스포머 모델의 실패 사례를 어느 정도 예측할 수 있는가?
- RQ5모델 깊이와 하이퍼파rameter 설정은 재귀 추론에서 깊이에 따라 달라지는 히وري스틱의 발생에 어떤 영향을 미치는가?
주요 결과
- 모델들은 진정한 재귀 일반화가 아니라 학습된 단축 알고리즘을 통해 구조적 재귀 함수를 성공적으로 근사한다.
- 한 함수에 대해 최대 91퍼센트의 실패 케이스가 모델이 학습한 단축 알고리즘을 재구성함으로써 정확히 예측될 수 있었다.
- 초기 레이어의 어텐션 메커니즘은 작업에 특화된 패턴을 보이며, 한 헤드는 괄호와 같은 전진 기호를 추적하고, 다른 헤드는 인코딩된 토큰에 선형적으로 주목한다.
- 더 깊은 트리에서는 모델이 디코더 자기어텐션을 사용해 부모 노드를 추적하고, UNROLL 기호를 재귀 조합의 신호로 사용한다.
- 모델들은 루트 노드를 하위트리 펼침 후 복사하는 등의 깊이에 따라 달라지는 기교를 학습하지만, 이는 더 복잡하거나 깊은 재귀적 구조에서는 실패한다.
- 다른 하이퍼파rameter 설정은 서로 다른 학습된 알고리즘을 초래하며, 이는 단순한 재귀 작업에서도 모델 행동이 훈련 설정에 민감함을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.