반응형
1. Precision (정밀도)
정의
모델이 맞다고 예측한 것 중 실제로 맞은 비율
수식
Precision=TP / TP+FP
- TP (True Positive): 맞게 예측한 정답
- FP (False Positive): 틀렸는데 맞다고 예측
의미
- “모델이 얼마나 정확하게 맞추는가”
- 오탐(false positive)을 얼마나 줄였는지 평가
해석
- 높을수록: 잘못된 예측이 적음
- 낮을수록: 틀린 것을 많이 맞다고 판단
2. Recall (재현율)
정의
실제 정답 중에서 모델이 얼마나 많이 찾아냈는가
수식
Recall=TP/TP+FN
- FN (False Negative): 맞는 것을 놓침
의미
- “모델이 얼마나 빠짐없이 찾는가”
해석
- 높을수록: 정답을 잘 놓치지 않음
- 낮을수록: 중요한 것을 많이 놓침
3. F1 Score
정의
Precision과 Recall의 조화 평균
수식
F1=2⋅Precision⋅Recall / Precision+Recall
의미
- Precision과 Recall을 균형 있게 평가
- 둘 중 하나라도 낮으면 F1도 낮아짐
해석
- 불균형 데이터에서 매우 중요
- classification 성능의 대표 지표
4. BLEU (Bilingual Evaluation Understudy)
정의
기계번역에서 생성 문장이 얼마나 정답 문장과 n-gram 수준에서 일치하는지 평가
계산 방식
- n-gram (보통 1~4-gram) 일치율 계산
- precision 기반 계산
- brevity penalty 적용 (짧은 문장 패널티)
핵심 수식 개념
BLEU= BP ⋅ exp(∑ wn logpn)
- pnp_n: n-gram precision
- BP: 길이 패널티
의미
- “표면적으로 얼마나 비슷한가”
- 단어 순서와 부분 일치 중요
한계
- 의미적 유사성 반영 부족
5. ROUGE-L
정의
요약 평가에서 사용되며 Longest Common Subsequence (LCS) 기반
핵심 개념
- 두 문장 간 가장 긴 공통 부분 수열 길이 사용
수식 개념
ROUGE-L= LCS / reference length
또는 precision/recall 기반 F-score 형태 사용
의미
- “문장의 구조적 유사성 평가”
- 순서 유지된 유사성 반영
특징
- BLEU보다 recall 중심
- 요약 평가에 적합
6. BERTScore
정의
BERT 임베딩을 활용하여 문장 간 의미 유사도 평가
계산 방식
- 각 단어를 BERT로 임베딩
- 후보 문장과 정답 문장 간 코사인 유사도 계산
- Precision / Recall / F1 형태로 계산
의미
- “단어 수준이 아닌 의미 수준 유사성 평가”
특징
- 동의어, 문장 변형에도 강함
- 기존 BLEU/ROUGE보다 semantic 평가 우수
7. ROUGE vs BLEU vs BERTScore 비교
항목BLEUROUGEBERTScore
| 기준 | precision | recall | semantic |
| 단위 | n-gram | subsequence | embedding |
| 의미 반영 | 낮음 | 중간 | 높음 |
| 사용 분야 | 번역 | 요약 | 생성 전체 |
8. SemScore (Semantic Score)
정의
임베딩 기반 모델을 활용한 의미적 유사도 평가 지표 (일반 개념)
※ 특정 하나의 공식 표준 지표라기보다
여러 semantic similarity 방법을 포괄하는 개념
계산 방식 (일반적)
- 문장을 embedding vector로 변환 (BERT, SBERT 등)
- cosine similarity 계산
Sim=A⋅B∣∣A∣∣⋅∣∣B∣∣Sim = \frac{A \cdot B}{||A|| \cdot ||B||}
의미
- “두 문장이 의미적으로 얼마나 가까운가”
9. 전체 요약
- Precision: 맞다고 한 것 중 정확한 비율
- Recall: 실제 정답을 얼마나 찾았는가
- F1: 둘의 균형
- BLEU: n-gram 기반 정확도 (번역)
- ROUGE-L: 구조 기반 유사성 (요약)
- BERTScore: 의미 기반 유사성
- SemScore: embedding 기반 의미 유사도
핵심 비교 관점
- 정확도 중심: Precision, BLEU
- 커버리지 중심: Recall, ROUGE
- 균형 평가: F1
- 의미 평가: BERTScore, SemScore
반응형
'AL,ML 학부연구생 > 공부 기록' 카테고리의 다른 글
| 인터넷 쿠키(Cookie)란 무엇인가 (0) | 2026.03.31 |
|---|---|
| 인터넷 캐시(Cache)란 무엇인가 (0) | 2026.03.31 |
| HuggingFace 은 어떤 플랫폼이고, 활용하여 무엇이 가능한가? (0) | 2026.03.24 |
| Llama, GPT, T5, BERT, RoBERTa, DeBERTa 는 각각 어떤 모델이고 어떤 작업에 특화되어 있나요? (0) | 2026.03.24 |
| AI나 인공지능을 '학습한다'라는 것은 어떤것을 의미할까? (0) | 2026.03.23 |