반응형
1. BERT의 정의
BERT는
Transformer의 Encoder 구조만을 사용하는 언어 모델로,
문장의 의미를 양방향으로 이해하는 데 특화된 모델이다.
핵심 개념:
- Bidirectional (양방향 문맥 이해)
- Contextual Embedding (문맥 기반 의미 표현)
즉, 단어 하나를 볼 때 앞뒤 문맥을 모두 고려하여 의미를 결정한다.
2. BERT의 구조
BERT는 다음 구조를 가진다.
- Transformer Encoder stack
- Self-Attention 기반
- 여러 층(layer)으로 구성 (Base, Large 등)
특징:
- 입력 문장을 한 번에 전체 처리
- 각 단어가 모든 단어를 참고
3. BERT의 학습 방식
BERT는 사전학습(pre-training) 단계에서 다음 두 가지 task를 사용한다.
3.1 Masked Language Model (MLM)
문장의 일부 단어를 가리고 맞추는 방식
예:
“I love [MASK]”
→ model이 “you” 또는 “AI” 예측
특징:
- 양방향 문맥 사용 가능
3.2 Next Sentence Prediction (NSP)
두 문장이 이어지는지 판단
예:
문장 A → 문장 B
→ 실제 이어지는 문장인지 판단
4. BERT의 역할
BERT는 “생성”이 아니라 “이해”에 특화되어 있다.
주요 역할:
- 문장 의미 분석
- 문맥 기반 표현 생성
- 입력 문장을 벡터로 인코딩
5. BERT의 활용 분야
대표 활용:
- 텍스트 분류
- 감정 분석, 스팸 분류
- 질의응답 (QA)
- 문장에서 정답 위치 찾기
- 개체명 인식 (NER)
- 사람, 장소, 기관 인식
- 문장 유사도 분석
- 의미 비교
- 검색 시스템
- semantic search
6. GPT의 정의
GPT (Generatice Pre-trained Transformer) 는
Transformer의 Decoder 구조를 사용하는 생성형 언어 모델이다.
핵심 개념:
- Generative (생성 중심)
- Autoregressive (자기회귀 방식)
즉, 이전 단어를 기반으로 다음 단어를 예측하며 문장을 생성한다.
7. GPT의 구조
- Transformer Decoder stack
- Masked Self-Attention 사용
- 한 방향(left-to-right) 처리
특징:
- 미래 토큰을 보지 않음
- 순차적으로 문장 생성
8. GPT의 학습 방식
GPT는 다음 방식으로 학습된다.
8.1 Language Modeling
다음 단어를 예측하는 방식
P(wt∣w1,w2,...,wt−1)P(w_t | w_1, w_2, ..., w_{t-1})
즉:
- 이전 단어들을 보고
- 다음 단어 확률을 예측
9. GPT의 역할
GPT는 텍스트를 이해하는 동시에 생성하는 데 특화된 모델이다.
역할:
- 문장 생성
- 대화 생성
- 글쓰기
- 코드 생성
10. GPT의 활용 분야
- 챗봇 / 대화 시스템
- 자동 글쓰기
- 코드 생성
- 번역
- 요약
- 질문 응답
즉, 입력을 기반으로 새로운 텍스트를 만들어내는 모든 작업
11. BERT vs GPT 핵심 차이
11.1 구조
- BERT: Encoder
- GPT: Decoder
11.2 문맥 처리
- BERT: 양방향 (Bidirectional)
- GPT: 단방향 (Left-to-right)
11.3 목적
- BERT: 이해 (Understanding)
- GPT: 생성 (Generation)
11.4 학습 방식
- BERT: MLM + NSP
- GPT: Next token prediction
11.5 출력 방식
- BERT: 전체 문장 representation
- GPT: 한 단어씩 생성
12. 직관적 비교
BERT:
- “문장을 읽고 이해하는 모델”
GPT:
- “문장을 이어서 쓰는 모델”
13. 관계 정리
두 모델 모두 Transformer 기반이다.
- BERT = Transformer Encoder
- GPT = Transformer Decoder
즉, 같은 구조에서 출발했지만
목적에 따라 서로 다른 방향으로 발전하였다.
14. 핵심 요약
- BERT는 문맥을 양방향으로 이해하는 모델
- GPT는 이전 문맥을 기반으로 텍스트를 생성하는 모델
- 둘 다 Transformer 기반이지만 목적과 구조가 다름
15. 최종 한 줄 정리
- BERT: “이해하는 모델”
- GPT: “생성하는 모델”
반응형
'AL,ML 학부연구생 > 공부 기록' 카테고리의 다른 글
| Softmax와 Sigmoid 함수란 무엇인가? (0) | 2026.03.23 |
|---|---|
| Cross Entropy 란 무엇인가? (0) | 2026.03.23 |
| RNN(Recurrent Neural Network)는 무엇이고, FNN과 어떻게 다른가? (0) | 2026.03.23 |
| FeedForward Neural Network (FNN)이란 무엇인가? (0) | 2026.03.23 |
| Query, Key, Value (Q, K, V)란 무엇인가? (0) | 2026.03.23 |