AL,ML 학부연구생/공부 기록

BERT 와 GPT 는 무엇이고, 어떻게 활용될까?

김형준 2026. 3. 23. 17:49
반응형

1. BERT의 정의

BERT는
Transformer의 Encoder 구조만을 사용하는 언어 모델로,
문장의 의미를 양방향으로 이해하는 데 특화된 모델이다.

핵심 개념:

  • Bidirectional (양방향 문맥 이해)
  • Contextual Embedding (문맥 기반 의미 표현)

즉, 단어 하나를 볼 때 앞뒤 문맥을 모두 고려하여 의미를 결정한다.


2. BERT의 구조

BERT는 다음 구조를 가진다.

  • Transformer Encoder stack
  • Self-Attention 기반
  • 여러 층(layer)으로 구성 (Base, Large 등)

특징:

  • 입력 문장을 한 번에 전체 처리
  • 각 단어가 모든 단어를 참고

3. BERT의 학습 방식

BERT는 사전학습(pre-training) 단계에서 다음 두 가지 task를 사용한다.

3.1 Masked Language Model (MLM)

문장의 일부 단어를 가리고 맞추는 방식

예:
“I love [MASK]”

→ model이 “you” 또는 “AI” 예측

특징:

  • 양방향 문맥 사용 가능

3.2 Next Sentence Prediction (NSP)

두 문장이 이어지는지 판단

예:
문장 A → 문장 B
→ 실제 이어지는 문장인지 판단


4. BERT의 역할

BERT는 “생성”이 아니라 “이해”에 특화되어 있다.

주요 역할:

  • 문장 의미 분석
  • 문맥 기반 표현 생성
  • 입력 문장을 벡터로 인코딩

5. BERT의 활용 분야

대표 활용:

  1. 텍스트 분류
    • 감정 분석, 스팸 분류
  2. 질의응답 (QA)
    • 문장에서 정답 위치 찾기
  3. 개체명 인식 (NER)
    • 사람, 장소, 기관 인식
  4. 문장 유사도 분석
    • 의미 비교
  5. 검색 시스템
    • semantic search

6. GPT의 정의

GPT (Generatice Pre-trained Transformer) 는
Transformer의 Decoder 구조를 사용하는 생성형 언어 모델이다.

핵심 개념:

  • Generative (생성 중심)
  • Autoregressive (자기회귀 방식)

즉, 이전 단어를 기반으로 다음 단어를 예측하며 문장을 생성한다.


7. GPT의 구조

  • Transformer Decoder stack
  • Masked Self-Attention 사용
  • 한 방향(left-to-right) 처리

특징:

  • 미래 토큰을 보지 않음
  • 순차적으로 문장 생성

8. GPT의 학습 방식

GPT는 다음 방식으로 학습된다.

8.1 Language Modeling

다음 단어를 예측하는 방식

P(wt∣w1,w2,...,wt−1)P(w_t | w_1, w_2, ..., w_{t-1})

즉:

  • 이전 단어들을 보고
  • 다음 단어 확률을 예측

9. GPT의 역할

GPT는 텍스트를 이해하는 동시에 생성하는 데 특화된 모델이다.

역할:

  • 문장 생성
  • 대화 생성
  • 글쓰기
  • 코드 생성

10. GPT의 활용 분야

  1. 챗봇 / 대화 시스템
  2. 자동 글쓰기
  3. 코드 생성
  4. 번역
  5. 요약
  6. 질문 응답

즉, 입력을 기반으로 새로운 텍스트를 만들어내는 모든 작업


11. BERT vs GPT 핵심 차이

11.1 구조

  • BERT: Encoder
  • GPT: Decoder

11.2 문맥 처리

  • BERT: 양방향 (Bidirectional)
  • GPT: 단방향 (Left-to-right)

11.3 목적

  • BERT: 이해 (Understanding)
  • GPT: 생성 (Generation)

11.4 학습 방식

  • BERT: MLM + NSP
  • GPT: Next token prediction

11.5 출력 방식

  • BERT: 전체 문장 representation
  • GPT: 한 단어씩 생성

12. 직관적 비교

BERT:

  • “문장을 읽고 이해하는 모델”

GPT:

  • “문장을 이어서 쓰는 모델”

13. 관계 정리

두 모델 모두 Transformer 기반이다.

  • BERT = Transformer Encoder
  • GPT = Transformer Decoder

즉, 같은 구조에서 출발했지만
목적에 따라 서로 다른 방향으로 발전하였다.


14. 핵심 요약

  • BERT는 문맥을 양방향으로 이해하는 모델
  • GPT는 이전 문맥을 기반으로 텍스트를 생성하는 모델
  • 둘 다 Transformer 기반이지만 목적과 구조가 다름

15. 최종 한 줄 정리

  • BERT: “이해하는 모델”
  • GPT: “생성하는 모델”
반응형