1. 개요
본 논문은 2017년 Google Brain 연구진에 의해 발표되었으며,
기존의 RNN, LSTM 기반 시퀀스 모델을 대체하는 Transformer 구조를 처음 제안하였다.
핵심 주장:
- “시퀀스 처리에 순환 구조(RNN)는 필요 없다”
- “Attention 메커니즘만으로도 충분하다”
즉, 모델 설계의 중심을 Recurrent → Attention 중심 구조로 전환한 연구이다.
2. 문제 정의
기존 시퀀스 모델의 한계는 다음과 같다.
- 순차 처리 구조
→ 병렬화 불가능 (속도 저하) - 장기 의존성 문제
→ 멀리 떨어진 정보 연결 어려움 - 정보 병목 현상
→ Encoder → Decoder로 압축되는 과정에서 정보 손실
이 논문은 위 문제를 해결하기 위해 다음과 같은 방향을 제시한다.
- 전체 시퀀스를 동시에 처리
- 모든 토큰 간 관계를 직접 계산
- 정보 흐름을 제한하지 않음
3. 핵심 아이디어
3.1 Self-Attention 중심 구조
각 토큰이 다른 모든 토큰과의 관계를 계산하여
자기 자신을 재표현하는 방식이다.
즉,
- 입력 전체를 한 번에 보고
- 중요한 토큰에 더 집중
3.2 Attention만으로 모델 구성
기존 구조:
- RNN (순환)
- CNN (지역적 처리)
제안 구조:
- Self-Attention + Feed Forward Network
즉, 순환이나 합성곱 없이도 시퀀스 모델링이 가능함을 증명하였다.
4. Transformer 구조
논문에서 제안된 Transformer는 다음 두 부분으로 구성된다.
4.1 Encoder
역할:
- 입력 문장의 의미를 표현 벡터로 변환
구성 (반복 블록):
- Multi-Head Self-Attention
- Feed Forward Network
- Residual Connection
- Layer Normalization
4.2 Decoder
역할:
- 출력 시퀀스를 생성
구성:
- Masked Self-Attention
- Encoder-Decoder Attention
- Feed Forward Network
특징:
- 미래 토큰을 보지 못하도록 masking 적용
5. 핵심 수식 (Scaled Dot-Product Attention)
Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V
구성 요소:
- Q (Query): 현재 토큰의 질의
- K (Key): 각 토큰의 특징
- V (Value): 실제 전달 정보
의미:
- Query와 Key의 유사도를 기반으로
- Value를 가중합하여 출력 생성
6. Multi-Head Attention
하나의 Attention이 아니라 여러 개의 Attention을 병렬로 수행한다.
목적:
- 다양한 관계를 동시에 학습
- 문법 관계
- 의미 관계
- 장기 의존성
구조:
- 여러 head → 결과 concat → 선형 변환
효과:
- 표현력 증가
- 다양한 관점의 정보 반영
7. Positional Encoding
문제:
- Transformer는 순서를 자동으로 인식하지 못함
해결:
- 위치 정보를 벡터로 추가
방법:
- sine / cosine 함수 기반 encoding
의미:
- 토큰의 상대적/절대적 위치 반영
8. 논문의 주요 기여
8.1 RNN 제거
- 순환 구조 없이도 시퀀스 모델링 가능함을 입증
- 병렬 처리 가능
8.2 Attention의 일반화
- Attention을 보조 메커니즘이 아닌 핵심 연산으로 승격
8.3 성능 개선
- 기계 번역(task)에서 기존 모델 대비 성능 향상
- 학습 속도 대폭 개선
8.4 확장성 확보
- 모델을 깊게 쌓아도 안정적
- 대규모 학습 가능
9. 기존 모델과 비교
RNN / LSTM 대비
- 순차 처리 → 병렬 처리 가능
- 긴 문장 처리 성능 향상
- gradient 문제 완화
CNN 대비
- 지역 정보 → 전역 정보 직접 접근
- 모든 토큰 간 관계 계산 가능
10. 복잡도 분석
Attention의 연산 복잡도:
- O(n²)
의미:
- 시퀀스 길이가 길어질수록 비용 증가
그러나:
- 병렬 처리 가능
- 실제 학습 속도는 RNN보다 빠른 경우 많음
11. 이후 영향
이 논문은 현대 AI 구조의 기반이 되었다.
대표 모델:
- BERT
- GPT
- Vision Transformer (ViT)
- Multimodal Transformer
즉, Transformer는 현재 대부분의 대형 모델의 핵심 구조이다.
12. 핵심 요약
- Transformer는 Attention만으로 시퀀스를 처리하는 구조이다.
- Self-Attention을 통해 모든 토큰 간 관계를 직접 계산한다.
- RNN의 순차 처리 한계를 해결하고 병렬화를 가능하게 하였다.
- Multi-Head Attention, Positional Encoding 등이 핵심 구성 요소이다.
- 이후 NLP 및 AI 전반의 표준 아키텍처로 자리 잡았다.
13. 결론
Attention Is All You Need는 단순한 모델 제안이 아니라,
시퀀스 처리 패러다임 자체를 변화시킨 연구이다.
- 기존: 순차적 처리 (RNN 중심)
- 이후: 관계 기반 처리 (Attention 중심)
이 전환이 BERT, GPT, 그리고 현재의 대형 언어 모델로 이어졌다.
'AL,ML 학부연구생 > 논문 분석' 카테고리의 다른 글
| Cross Entropy Loss는 무엇인가? (1) | 2026.05.20 |
|---|