AL,ML 학부연구생/논문 분석

Attention Is All You Need - Google Brain (2017)

김형준 2026. 3. 23. 17:27
반응형

1. 개요

본 논문은 2017년 Google Brain 연구진에 의해 발표되었으며,
기존의 RNN, LSTM 기반 시퀀스 모델을 대체하는 Transformer 구조를 처음 제안하였다.

핵심 주장:

  • “시퀀스 처리에 순환 구조(RNN)는 필요 없다”
  • “Attention 메커니즘만으로도 충분하다”

즉, 모델 설계의 중심을 Recurrent → Attention 중심 구조로 전환한 연구이다.


2. 문제 정의

기존 시퀀스 모델의 한계는 다음과 같다.

  1. 순차 처리 구조
    → 병렬화 불가능 (속도 저하)
  2. 장기 의존성 문제
    → 멀리 떨어진 정보 연결 어려움
  3. 정보 병목 현상
    → Encoder → Decoder로 압축되는 과정에서 정보 손실

이 논문은 위 문제를 해결하기 위해 다음과 같은 방향을 제시한다.

  • 전체 시퀀스를 동시에 처리
  • 모든 토큰 간 관계를 직접 계산
  • 정보 흐름을 제한하지 않음

3. 핵심 아이디어

3.1 Self-Attention 중심 구조

각 토큰이 다른 모든 토큰과의 관계를 계산하여
자기 자신을 재표현하는 방식이다.

즉,

  • 입력 전체를 한 번에 보고
  • 중요한 토큰에 더 집중

3.2 Attention만으로 모델 구성

기존 구조:

  • RNN (순환)
  • CNN (지역적 처리)

제안 구조:

  • Self-Attention + Feed Forward Network

즉, 순환이나 합성곱 없이도 시퀀스 모델링이 가능함을 증명하였다.


4. Transformer 구조

논문에서 제안된 Transformer는 다음 두 부분으로 구성된다.

4.1 Encoder

역할:

  • 입력 문장의 의미를 표현 벡터로 변환

구성 (반복 블록):

  • Multi-Head Self-Attention
  • Feed Forward Network
  • Residual Connection
  • Layer Normalization

4.2 Decoder

역할:

  • 출력 시퀀스를 생성

구성:

  • Masked Self-Attention
  • Encoder-Decoder Attention
  • Feed Forward Network

특징:

  • 미래 토큰을 보지 못하도록 masking 적용

5. 핵심 수식 (Scaled Dot-Product Attention)

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

구성 요소:

  • Q (Query): 현재 토큰의 질의
  • K (Key): 각 토큰의 특징
  • V (Value): 실제 전달 정보

의미:

  • Query와 Key의 유사도를 기반으로
  • Value를 가중합하여 출력 생성

6. Multi-Head Attention

하나의 Attention이 아니라 여러 개의 Attention을 병렬로 수행한다.

목적:

  • 다양한 관계를 동시에 학습
    • 문법 관계
    • 의미 관계
    • 장기 의존성

구조:

  • 여러 head → 결과 concat → 선형 변환

효과:

  • 표현력 증가
  • 다양한 관점의 정보 반영

7. Positional Encoding

문제:

  • Transformer는 순서를 자동으로 인식하지 못함

해결:

  • 위치 정보를 벡터로 추가

방법:

  • sine / cosine 함수 기반 encoding

의미:

  • 토큰의 상대적/절대적 위치 반영

8. 논문의 주요 기여

8.1 RNN 제거

  • 순환 구조 없이도 시퀀스 모델링 가능함을 입증
  • 병렬 처리 가능

8.2 Attention의 일반화

  • Attention을 보조 메커니즘이 아닌 핵심 연산으로 승격

8.3 성능 개선

  • 기계 번역(task)에서 기존 모델 대비 성능 향상
  • 학습 속도 대폭 개선

8.4 확장성 확보

  • 모델을 깊게 쌓아도 안정적
  • 대규모 학습 가능

9. 기존 모델과 비교

RNN / LSTM 대비

  • 순차 처리 → 병렬 처리 가능
  • 긴 문장 처리 성능 향상
  • gradient 문제 완화

CNN 대비

  • 지역 정보 → 전역 정보 직접 접근
  • 모든 토큰 간 관계 계산 가능

10. 복잡도 분석

Attention의 연산 복잡도:

  • O(n²)

의미:

  • 시퀀스 길이가 길어질수록 비용 증가

그러나:

  • 병렬 처리 가능
  • 실제 학습 속도는 RNN보다 빠른 경우 많음

11. 이후 영향

이 논문은 현대 AI 구조의 기반이 되었다.

대표 모델:

  • BERT
  • GPT
  • Vision Transformer (ViT)
  • Multimodal Transformer

즉, Transformer는 현재 대부분의 대형 모델의 핵심 구조이다.


12. 핵심 요약

  • Transformer는 Attention만으로 시퀀스를 처리하는 구조이다.
  • Self-Attention을 통해 모든 토큰 간 관계를 직접 계산한다.
  • RNN의 순차 처리 한계를 해결하고 병렬화를 가능하게 하였다.
  • Multi-Head Attention, Positional Encoding 등이 핵심 구성 요소이다.
  • 이후 NLP 및 AI 전반의 표준 아키텍처로 자리 잡았다.

13. 결론

Attention Is All You Need는 단순한 모델 제안이 아니라,
시퀀스 처리 패러다임 자체를 변화시킨 연구이다.

  • 기존: 순차적 처리 (RNN 중심)
  • 이후: 관계 기반 처리 (Attention 중심)

이 전환이 BERT, GPT, 그리고 현재의 대형 언어 모델로 이어졌다.

반응형

'AL,ML 학부연구생 > 논문 분석' 카테고리의 다른 글

Cross Entropy Loss는 무엇인가?  (1) 2026.05.20