AL,ML 학부연구생/공부 기록

Precision(정밀도), Recall(재현율), F1score, ROUGE-L, BELU, BERTscore, SEMscore 은 각각 무엇인가?

김형준 2026. 3. 30. 18:55
반응형

1. Precision (정밀도)

정의

모델이 맞다고 예측한 것 중 실제로 맞은 비율

수식

Precision=TP / TP+FP

  • TP (True Positive): 맞게 예측한 정답
  • FP (False Positive): 틀렸는데 맞다고 예측

의미

  • “모델이 얼마나 정확하게 맞추는가”
  • 오탐(false positive)을 얼마나 줄였는지 평가

해석

  • 높을수록: 잘못된 예측이 적음
  • 낮을수록: 틀린 것을 많이 맞다고 판단

2. Recall (재현율)

정의

실제 정답 중에서 모델이 얼마나 많이 찾아냈는가

수식

Recall=TP/TP+FN

  • FN (False Negative): 맞는 것을 놓침

의미

  • “모델이 얼마나 빠짐없이 찾는가”

해석

  • 높을수록: 정답을 잘 놓치지 않음
  • 낮을수록: 중요한 것을 많이 놓침

3. F1 Score

정의

Precision과 Recall의 조화 평균

수식

F1=2⋅Precision⋅Recall / Precision+Recall

의미

  • Precision과 Recall을 균형 있게 평가
  • 둘 중 하나라도 낮으면 F1도 낮아짐

해석

  • 불균형 데이터에서 매우 중요
  • classification 성능의 대표 지표

4. BLEU (Bilingual Evaluation Understudy)

정의

기계번역에서 생성 문장이 얼마나 정답 문장과 n-gram 수준에서 일치하는지 평가

계산 방식

  1. n-gram (보통 1~4-gram) 일치율 계산
  2. precision 기반 계산
  3. brevity penalty 적용 (짧은 문장 패널티)

핵심 수식 개념

BLEU= BP ⋅ exp(∑ wn log⁡pn)

  • pnp_n: n-gram precision
  • BP: 길이 패널티

의미

  • “표면적으로 얼마나 비슷한가”
  • 단어 순서와 부분 일치 중요

한계

  • 의미적 유사성 반영 부족

5. ROUGE-L

정의

요약 평가에서 사용되며 Longest Common Subsequence (LCS) 기반

핵심 개념

  • 두 문장 간 가장 긴 공통 부분 수열 길이 사용

수식 개념

ROUGE-L= LCS / reference length

또는 precision/recall 기반 F-score 형태 사용

의미

  • “문장의 구조적 유사성 평가”
  • 순서 유지된 유사성 반영

특징

  • BLEU보다 recall 중심
  • 요약 평가에 적합

6. BERTScore

정의

BERT 임베딩을 활용하여 문장 간 의미 유사도 평가

계산 방식

  1. 각 단어를 BERT로 임베딩
  2. 후보 문장과 정답 문장 간 코사인 유사도 계산
  3. Precision / Recall / F1 형태로 계산

의미

  • “단어 수준이 아닌 의미 수준 유사성 평가”

특징

  • 동의어, 문장 변형에도 강함
  • 기존 BLEU/ROUGE보다 semantic 평가 우수

7. ROUGE vs BLEU vs BERTScore 비교

항목BLEUROUGEBERTScore
기준 precision recall semantic
단위 n-gram subsequence embedding
의미 반영 낮음 중간 높음
사용 분야 번역 요약 생성 전체

8. SemScore (Semantic Score)

정의

임베딩 기반 모델을 활용한 의미적 유사도 평가 지표 (일반 개념)

※ 특정 하나의 공식 표준 지표라기보다
여러 semantic similarity 방법을 포괄하는 개념

계산 방식 (일반적)

  1. 문장을 embedding vector로 변환 (BERT, SBERT 등)
  2. cosine similarity 계산

Sim=A⋅B∣∣A∣∣⋅∣∣B∣∣Sim = \frac{A \cdot B}{||A|| \cdot ||B||}

의미

  • “두 문장이 의미적으로 얼마나 가까운가”

9. 전체 요약

  • Precision: 맞다고 한 것 중 정확한 비율
  • Recall: 실제 정답을 얼마나 찾았는가
  • F1: 둘의 균형
  • BLEU: n-gram 기반 정확도 (번역)
  • ROUGE-L: 구조 기반 유사성 (요약)
  • BERTScore: 의미 기반 유사성
  • SemScore: embedding 기반 의미 유사도

핵심 비교 관점

  • 정확도 중심: Precision, BLEU
  • 커버리지 중심: Recall, ROUGE
  • 균형 평가: F1
  • 의미 평가: BERTScore, SemScore
반응형