AL,ML 학부연구생/공부 기록

Llama, GPT, T5, BERT, RoBERTa, DeBERTa 는 각각 어떤 모델이고 어떤 작업에 특화되어 있나요?

김형준 2026. 3. 24. 17:18
반응형
  • BERT, RoBERTa, DeBERTa는 주로 Transformer Encoder 계열이다.
  • GPT, Llama는 Transformer Decoder 계열이다.
  • T5는 Encoder-Decoder를 모두 사용하는 구조이다.

 

  • BERT 계열은 문장을 “이해”하는 데 강하다.
  • GPT, Llama는 다음 토큰을 생성하며 “텍스트를 만들어내는” 데 강하다.
  • T5는 모든 작업을 “텍스트 입력 → 텍스트 출력”으로 통합하려는 철학을 가진다.

 

1. BERT

정의
BERT는 Bidirectional Encoder Representations from Transformers의 약자이다.
구글이 제안한 사전학습 언어모델로, 문장의 좌우 문맥을 동시에 참고하여 단어 의미를 이해하도록 설계된 모델이다.

어떤 모델인가
BERT는 대표적인 자연어 이해(NLU, Natural Language Understanding) 모델이다.
즉, 텍스트를 읽고 그 의미를 파악하는 데 매우 강한 모델이다.
문장 분류, 감성 분석, 개체명 인식, 질의응답 등에서 큰 성과를 냈다.

핵심 원리
BERT의 가장 중요한 특징은 양방향 문맥 이해이다.
기존의 많은 언어모델은 왼쪽에서 오른쪽으로만 읽거나, 반대로 오른쪽에서 왼쪽으로만 읽는 경우가 많았다.
하지만 BERT는 한 단어를 이해할 때 그 앞 단어와 뒤 단어를 동시에 본다.

예를 들어 “은행”이라는 단어는

  • “돈을 맡기는 은행”
  • “강가의 둑”
    처럼 의미가 다를 수 있다.
    BERT는 앞뒤 문맥을 동시에 반영하기 때문에 이런 다의어 해석에 강하다.

학습 방식
BERT는 대표적으로 두 가지 사전학습 과제를 사용했다.

첫째, MLM(Masked Language Modeling)
문장 일부 단어를 가리고, 그 가려진 단어를 예측한다.
예를 들어 “나는 오늘 [MASK]을 먹었다” 라는 문장에서 [MASK]가 “밥”, “빵”, “라면” 중 무엇이 적절한지 맞히도록 훈련한다.

 

둘째, NSP(Next Sentence Prediction)
두 문장이 실제로 이어지는 문장인지 아닌지를 맞히는 과제이다.
예를 들어
문장 A: “나는 병원에 갔다.”
문장 B: “의사가 약을 처방해 주었다.”
이 두 문장이 자연스럽게 이어지는지 학습한다.

구조
BERT는 Transformer Encoder만 여러 층 쌓은 구조이다.
주요 구성 요소는 다음과 같다.

  • Token Embedding: 각 단어를 벡터로 변환
  • Position Embedding: 단어 순서 정보 반영
  • Segment Embedding: 문장 A/B 구분
  • Multi-Head Self-Attention: 문장 전체 단어 간 관계 파악
  • Feed Forward Network: 비선형 변환
  • Layer Normalization, Residual Connection: 학습 안정화

입력 형식
BERT는 보통 다음 특수 토큰을 사용한다.

  • [CLS]: 문장 전체 대표 벡터
  • [SEP]: 문장 구분
  • [MASK]: 가려진 단어 표시

예를 들어 문장 분류 시 [CLS] 벡터를 최종 분류기에 넣는다.

특화 작업
BERT는 생성보다 이해에 특화되어 있다.
대표 작업은 다음과 같다.

  • 텍스트 분류
  • 감성 분석
  • 스팸 탐지
  • 의도 분류
  • 개체명 인식(NER)
  • 문장 유사도 판별
  • 질의응답
  • 의료/법률 문서 정보 추출

장점
BERT는 문맥 이해력이 높고, 파인튜닝만으로 다양한 다운스트림 태스크에 적용 가능하다.
특히 라벨이 적은 환경에서도 사전학습 효과를 크게 본다.

한계
BERT는 본질적으로 생성 모델이 아니므로 긴 자연어 생성에는 적합하지 않다.
또한 MLM은 학습 시 [MASK]를 쓰지만 실제 추론에서는 [MASK]가 없기 때문에 학습-추론 간 차이가 존재한다.

 

2. RoBERTa

정의
RoBERTa는 Robustly Optimized BERT Approach의 약자이다.
이름 그대로 BERT를 더 강하게, 더 안정적으로 학습하도록 최적화한 모델이다.

어떤 모델인가
RoBERTa는 구조적으로는 거의 BERT와 동일한 Encoder 기반 모델이다.
하지만 학습 데이터, 학습 방식, 하이퍼파라미터를 재설계하여 BERT보다 더 좋은 성능을 낸다.

핵심 아이디어
RoBERTa의 핵심은 “BERT 학습 전략이 덜 최적화되어 있었던 것 아니냐”는 문제의식이다.
즉, BERT를 더 오래, 더 큰 데이터로, 더 적절한 방식으로 학습하면 성능이 올라간다는 접근이다.

주요 개선점
RoBERTa는 다음과 같은 차이를 가진다.

첫째, 더 많은 데이터로 학습한다.
둘째, 더 긴 시간 동안 학습한다.
셋째, 더 큰 배치 크기와 더 적절한 하이퍼파라미터를 사용한다.
넷째, NSP를 제거한다.
다섯째, Dynamic Masking을 사용한다.

Dynamic Masking이란 BERT는 학습 데이터에서 특정 단어를 한 번 가리면 계속 같은 위치를 가리는 경향이 있었다.
RoBERTa는 학습할 때마다 마스킹 위치를 다르게 바꾼다.
그래서 다양한 문맥 패턴을 더 잘 익힌다.

구조
구조는 거의 BERT와 같다.
즉, Transformer Encoder stack이다.
차이는 주로 학습 절차와 데이터 규모에 있다.

특화 작업
RoBERTa 역시 자연어 이해 작업에 매우 강하다.

  • 문서 분류
  • 감성 분석
  • 개체명 인식
  • 관계 추출
  • 문장 쌍 분류
  • 검색 랭킹용 텍스트 인코딩
  • 질의응답

장점
같은 BERT 계열이라도 일반적으로 BERT보다 더 높은 정확도를 보인다.
실무에서는 “BERT를 쓸지 RoBERTa를 쓸지”라면 RoBERTa를 우선 검토하는 경우가 많다.

한계
생성 모델이 아니고, BERT 계열의 한계를 그대로 가진다.
또한 모델이 커질수록 추론 비용이 늘어난다.

 

3. DeBERTa

정의
DeBERTa는 Decoding-enhanced BERT with Disentangled Attention의 약자이다.
마이크로소프트가 제안한 BERT 계열 개선 모델이다.

어떤 모델인가
DeBERTa는 BERT/RoBERTa 계열의 언어 이해 모델이지만, 단순히 학습량만 늘린 것이 아니라 attention 구조 자체를 개선했다.

핵심 원리
DeBERTa의 가장 중요한 개념은 disentangled attention, 즉 분리된 attention 표현이다.

기존 BERT 계열에서는 단어의 의미 정보와 위치 정보가 비교적 한 벡터 안에 섞여 들어간다.
반면 DeBERTa는 이 둘을 분리해서 다룬다.

즉, 각 토큰에 대해

  • content information: 단어 자체 의미
  • position information: 위치 관계
    를 따로 표현한 뒤 attention 계산에 반영한다.

왜 중요한가
문장에서 의미는 같아도 위치가 다르면 역할이 달라질 수 있다.
예를 들어
“의사가 환자에게 약을 처방했다”
“환자가 의사에게 약을 처방했다”
는 단어 구성이 유사해도 의미가 완전히 달라진다.
DeBERTa는 위치 관계를 더 정교하게 반영해 이런 차이를 더 잘 잡아낸다.

추가 특징
DeBERTa는 enhanced mask decoder도 제안했다.
즉, 마스킹된 단어를 복원할 때 위치 정보와 문맥 정보를 더 정교하게 활용하도록 설계했다.

구조
기본 뼈대는 여전히 Transformer Encoder 계열이다.
그러나 Self-Attention 계산에서 content-to-content, content-to-position 등의 관계를 더 세밀하게 분리해 반영한다.

특화 작업
DeBERTa는 특히 정교한 문장 이해가 필요한 작업에서 매우 강하다.

  • 자연어 추론(NLI)
  • 문장 의미 비교
  • 독해
  • 질의응답
  • 정밀 분류
  • 문장 관계 판단
  • 정보 추출

장점
BERT와 RoBERTa보다 더 정교한 표현 학습이 가능하며, 벤치마크에서 매우 높은 성능을 보인 경우가 많다.
특히 미세한 의미 차이, 문장 간 관계 판별에 강하다.

한계
모델 구조가 조금 더 복잡하고, 실무 적용 시 단순 BERT보다 구현 및 최적화 부담이 있을 수 있다.
역시 생성형 모델은 아니다.

 

4. GPT

정의
GPT는 Generative Pre-trained Transformer의 약자이다.
OpenAI가 개발한 대표적인 생성형 언어모델 계열이다.

어떤 모델인가
GPT는 자연어를 이해도 하지만, 본질적으로는 “다음 단어를 예측하면서 문장을 생성하는 모델”이다.
즉, 문장을 읽고 의미를 파악한 뒤 새로운 텍스트를 이어서 만드는 데 강하다.

핵심 원리
GPT는 autoregressive language modeling을 사용한다.
쉽게 말하면 앞의 토큰들만 보고 다음 토큰을 맞히는 방식이다.

예를 들어
“오늘 날씨가 매우”
까지 주어지면 다음으로 “좋다”, “춥다”, “맑다” 같은 후보 중 가장 그럴듯한 단어를 예측한다.
그다음 그 결과를 다시 입력으로 삼아 다음 단어를 계속 생성한다.

이 방식은 사람의 문장 작성 과정과 비슷하다.
앞에서 쓴 내용을 바탕으로 뒤를 계속 이어 쓰는 방식이다.

구조
GPT는 Transformer Decoder-only 구조이다.
중요한 특징은 masked self-attention이다.
현재 토큰은 미래 토큰을 볼 수 없고, 오직 이전 토큰들만 참고할 수 있다.

이것이 필요한 이유는
다음 단어 예측 문제에서 정답을 미리 보면 안 되기 때문이다.

구성 요소는 대략 다음과 같다.

  • Token Embedding
  • Positional Encoding 또는 Position Embedding
  • Masked Multi-Head Self-Attention
  • Feed Forward Network
  • Residual Connection
  • Layer Normalization

학습 방식
대규모 텍스트 데이터를 이용해 다음 토큰 예측을 반복한다.
이렇게 사전학습된 후, 필요에 따라 instruction tuning, RLHF, SFT 같은 추가 정렬 과정을 거친다.

특화 작업
GPT는 생성 중심 작업에 특히 강하다.

  • 대화형 응답 생성
  • 요약
  • 번역
  • 문서 작성
  • 코드 생성
  • 아이디어 생성
  • 질문응답
  • 문장 재작성
  • 긴 문맥 기반 생성

장점
범용성이 매우 높다.
한 모델이 다양한 생성형 작업을 거의 통합적으로 처리할 수 있다.
few-shot, zero-shot 성능도 강하다.

한계
기본적으로 생성 중심이기 때문에, 분류나 정보 추출 같은 세밀한 판별 작업에서는 전용 encoder 모델보다 비효율적일 수 있다.
또한 사실과 다른 내용을 그럴듯하게 생성하는 hallucination 문제가 존재한다.

 

5. Llama

정의
Llama는 Meta가 공개한 대규모 언어모델 계열이다.
Large Language Model Meta AI의 약자이다.

어떤 모델인가
Llama는 GPT와 매우 유사한 Decoder-only 생성형 언어모델 계열이다.
즉, 구조적으로는 GPT 스타일이지만, 공개 연구와 오픈 모델 생태계에서 널리 활용된다는 점이 특징이다.

핵심 원리
원리는 GPT와 동일하게 다음 토큰 예측 기반의 autoregressive generation이다.
입력 문맥을 바탕으로 다음 단어를 순차적으로 생성한다.

구조적 특징
Llama 계열은 Decoder-only Transformer이지만, 세부 설계에서는 효율성과 성능을 개선하기 위한 여러 요소가 반영된다.
버전별 차이는 있으나 일반적으로 다음과 같은 특징들이 언급된다.

  • RMSNorm 사용
  • SwiGLU 같은 개선된 활성화 함수
  • Rotary Positional Embedding(RoPE)
  • 효율적 토크나이저 설계
  • 긴 문맥 처리 개선
  • 학습 데이터 품질 강화

RoPE는 위치 정보를 절대값이 아니라 회전 기반 방식으로 반영하는 기법으로, 긴 문맥 일반화에 유리하다고 알려져 있다.

왜 많이 쓰이는가
Llama 계열은 공개 가중치 또는 접근 가능한 형태로 배포된 경우가 많아 연구, 실험, 파인튜닝, 도메인 특화 모델 개발에 매우 널리 사용된다.
특히 LoRA, QLoRA 같은 경량 미세조정 기법과 결합되어 실무에서 활용도가 높다.

특화 작업
Llama는 생성형 작업 전반에 강하다.

  • 챗봇
  • 요약
  • 질의응답
  • 문서 생성
  • 코드 생성
  • 도메인 특화 어시스턴트
  • RAG 기반 응답 시스템
  • 지시사항 수행형 모델

장점
개방형 생태계와 튜닝 편의성이 매우 큰 장점이다.
기업이나 연구자가 자체 데이터로 재학습하거나, 폐쇄형 API에 의존하지 않고 내부 시스템에 탑재하기 좋다.

한계
기본 구조상 GPT와 유사하게 hallucination 가능성이 있고, 분류 전용 태스크에서는 Encoder 기반 모델보다 비효율적일 수 있다.
또한 실제 성능은 버전, 파인튜닝 품질, 정렬 수준에 따라 크게 달라진다.

 

6. T5

정의
T5는 Text-To-Text Transfer Transformer의 약자이다.
구글이 제안한 모델로, 모든 자연어처리 문제를 “텍스트 입력을 받아 텍스트를 출력하는 문제”로 통일한 것이 핵심이다.

어떤 모델인가
T5는 Encoder-Decoder 구조의 Transformer 모델이다.
즉, 입력 텍스트를 Encoder가 이해하고, Decoder가 그 결과를 바탕으로 출력 텍스트를 생성한다.

핵심 철학
T5의 매우 중요한 철학은 task unification이다.
분류, 번역, 요약, 질의응답을 전부 하나의 형식으로 바꾼다.

예를 들어

  • 감성분석: “sentiment: 이 영화는 정말 재미있다” → “positive”
  • 번역: “translate English to Korean: hello” → “안녕하세요”
  • 요약: “summarize: ...” → “요약문”
  • 질의응답: “question: ... context: ...” → “정답”

즉, 모든 작업을 텍스트-투-텍스트로 처리한다.

학습 방식
T5는 span corruption 또는 text infilling 방식으로 학습한다.
문장 일부 연속 구간을 가리고 그 부분을 복원하는 식이다.

예를 들어
“나는 <extra_id_0> 먹고 학교에 갔다”
처럼 입력을 만들고,
출력으로 가려진 부분을 생성하게 한다.

이 방식은 단일 단어 마스킹보다 더 긴 문맥 복원 능력을 길러준다.

구조
T5는 Transformer Encoder-Decoder 구조이다.

  • Encoder: 입력 문장 이해
  • Decoder: 출력 문장 생성
  • Encoder-Decoder Attention: 입력과 출력 사이 관계 학습

즉, BERT처럼 이해만 하는 것도 아니고, GPT처럼 생성만 하는 것도 아니라, 이해 후 생성하는 완전한 시퀀스 변환 구조라고 볼 수 있다.

특화 작업
T5는 입력을 받아 다른 텍스트로 변환하는 작업에 특히 강하다.

  • 번역
  • 요약
  • 질의응답
  • 문장 재구성
  • 문장 교정
  • 텍스트 변환
  • 생성형 정보 추출
  • 분류를 텍스트 출력으로 변환한 작업

장점
작업을 하나의 프레임으로 통합하기 쉬우며, 생성과 이해를 모두 다룰 수 있다.
특히 “입력 문장을 다른 형식의 출력 문장으로 바꾸는” 문제에 적합하다.

한계
단순 분류 문제에서는 Encoder-only 모델보다 계산량이 더 들 수 있다.
또한 초대형 생성 모델 경쟁에서는 GPT/Llama 계열이 더 주목받는 경우가 많다.

 

 

7. 모델 간 구조적 차이 정리

이 부분이 매우 중요하다.
위 모델들을 제대로 구분하려면 구조를 기준으로 보면 된다.

BERT / RoBERTa / DeBERTa
이 세 모델은 Encoder-only 계열이다.
텍스트를 잘 읽고 이해하는 데 초점이 맞춰져 있다.
대표적으로 분류, 추출, 판별에 강하다.

GPT / Llama
이 두 모델은 Decoder-only 계열이다.
앞 문맥을 보고 다음 단어를 생성하는 데 초점이 맞춰져 있다.
대표적으로 대화, 작성, 요약, 생성형 질의응답에 강하다.

T5
이 모델은 Encoder-Decoder 계열이다.
입력을 이해하고 그에 맞는 출력을 생성하는 구조이다.
대표적으로 번역, 요약, 질의응답, 텍스트 변환에 강하다.

 

8. 모델별 특화 분야 비교

BERT
문장 이해, 문서 분류, 개체명 인식, 관계 추출, 질의응답

RoBERTa
BERT보다 강화된 자연어 이해, 분류, 추론, 검색 랭킹

DeBERTa
정교한 의미 차이 판별, 자연어 추론, 고정밀 독해, 고성능 분류

GPT
생성형 대화, 글쓰기, 코드 생성, 요약, 범용 생성

Llama
오픈 생태계 기반 생성형 모델, 챗봇, 사내 모델 구축, 파인튜닝

T5
텍스트 변환형 작업, 번역, 요약, 질의응답, 생성형 분류

 

9. 어떤 상황에서 어떤 모델이 더 적합한가

텍스트를 분류하고 싶다면
BERT, RoBERTa, DeBERTa 계열이 우선이다.
특히 정확도가 중요하면 RoBERTa 또는 DeBERTa가 강력하다.

대화형 응답이나 문장 생성을 하고 싶다면
GPT나 Llama가 더 적합하다.

입력을 받아 출력 텍스트로 바꾸는 문제, 예를 들어
“긴 문서를 짧게 요약”
“영어를 한국어로 번역”
“질문과 문맥을 입력하면 정답 문장을 생성”
같은 작업은 T5가 구조적으로 잘 맞는다.

도메인 특화 파인튜닝을 저비용으로 하고 싶다면
Llama 계열이 실무에서 자주 선택된다.

의료 대화, 법률 문서, 고객상담 로그에서
개체 추출, 분류, 태깅 같은 구조화 작업을 하고 싶다면
DeBERTa나 RoBERTa가 매우 적합하다.

 

10. 모델 선정 예시

의사-환자 대화에서

  • 증상
  • 치료
  • 약물
  • 복용법
    등을 추출하려는 목적이라면, 이 작업은 기본적으로 “생성”보다 “이해와 추출”에 가깝다.

따라서 일반적으로는
BERT < RoBERTa ≈ DeBERTa
순으로 검토하는 경우가 많다.

왜냐하면 이 문제는
문장을 예쁘게 길게 생성하는 것보다,
대화 속 특정 정보 조각을 정확히 찾아 구조화하는 것이 더 중요하기 때문이다.

반면 GPT나 Llama는
“대화를 요약해서 자연스러운 보고서 작성”
“의료 상담 내용을 설명문으로 정리”
같이 생성이 필요한 경우 강점이 있다.

T5는 중간 성격이다.
예를 들어
입력: 환자-의사 대화
출력: “증상: 목아픔, 콧물 / 치료: 감기약 / 복용: 하루 3회 식후”
처럼 아예 텍스트 생성 방식으로 구조화 결과를 만들 수도 있다.

 

11. 한 줄 요약

BERT는 양방향 문맥 이해에 강한 기본형 이해 모델이다.
RoBERTa는 BERT를 더 강하게 학습시켜 성능을 높인 모델이다.
DeBERTa는 attention 구조를 개선해 더 정교한 이해를 수행하는 모델이다.
GPT는 다음 단어 예측 기반의 대표적 생성형 모델이다.
Llama는 GPT와 유사한 Decoder-only 계열의 개방형 생성 모델이다.
T5는 모든 작업을 텍스트 입력-출력 문제로 통합한 Encoder-Decoder 모델이다.

 

 


 

NER 과 후처리 과정이 무엇인가?

RoBERTa / DeBERTa → NER → 후처리”

이는 단일 모델로 끝내는 것이 아니라,
① 개체 추출(NER) → ② 구조화(Post-processing)
의 2단계 정보추출 시스템을 의미한다.

아래에서 각각을 정의, 역할, 실제 구현 방법까지 단계적으로 설명한다.


  1. NER (Named Entity Recognition)

정의
NER은 텍스트에서 의미 있는 개체(entity)를 찾아내고,
각 개체에 타입(label)을 붙이는 작업이다.

즉,
“무엇이 중요한 정보인지”를 식별하는 단계이다.


의미 (이 문제에서)

의사-환자 대화에서 NER은 다음 역할을 수행한다.

입력
“목이 아프고 콧물이 나요. 콜대원 하루 세 번 드세요.”

NER 출력 (예시)

  • “목이 아프다” → 증상(SYMPTOM)
  • “콧물” → 증상(SYMPTOM)
  • “콜대원” → 약물(MEDICATION)
  • “하루 세 번” → 복용빈도(DOSAGE)

즉, 문장에서 중요한 정보를 “태깅”하는 작업이다.


어떻게 동작하는가 (원리)

RoBERTa / DeBERTa 같은 모델을 NER용으로 fine-tuning하면
각 토큰마다 label을 예측한다.

대표적인 방식은 BIO tagging이다.

예시

문장:
“목이 아프고 콧물이 나요”

토큰 단위 라벨:

  • 목 → B-SYMPTOM
  • 이 → I-SYMPTOM
  • 아프고 → I-SYMPTOM
  • 콧물 → B-SYMPTOM
  • 이 → I-SYMPTOM
  • 나요 → O

설명

  • B: 개체 시작
  • I: 개체 내부
  • O: 개체 아님

구조

입력 → Transformer (RoBERTa/DeBERTa) → 각 토큰별 분류 → 라벨 출력

즉,
“문장 분류”가 아니라
“토큰 단위 분류” 문제이다.


어떻게 구현하는가

실제 구현 흐름

  1. 데이터 준비
    • 문장 + 각 토큰의 라벨
    • 예:
      (“목이 아프다”, [B-SYMPTOM, I-SYMPTOM, …])
  2. 모델 구성
    • RoBERTa/DeBERTa + Token Classification Head
  3. 학습
    • Cross Entropy loss로 각 토큰 라벨 학습
  4. 추론
    • 문장 입력 → 토큰별 라벨 출력
  5. 결과
    • 개체 리스트 생성

정리
NER = “문장에서 중요한 정보(증상, 약, 시간 등)를 찾아내는 단계”

후처리는 NER 결과를 사람이 쓰거나 시스템이 쓰기 좋은 “구조화된 형태”로 변환하는 단계이다.

“추출된 정보를 정리하고 가공하는 단계”이다.


왜 필요한가

NER 결과는 보통 아래처럼 나온다.

  • (“목이 아프다”, SYMPTOM)
  • (“콧물”, SYMPTOM)
  • (“콜대원”, MEDICATION)
  • (“하루 세 번”, DOSAGE)

하지만 우리가 원하는 출력은 보통 이런 형태이다.

“증상: 목아픔, 콧물 / 치료: 감기약 / 복용: 하루 3회”

 

즉,NER 결과는 “조각”이고, 후처리는 “구조화”이다.

 

(1) 엔티티 그룹화

(2) 정규화 (Normalization)

 

(3) 카테고리 재구성

(4) 중복 제거

(5) 규칙 기반 보완

NER이 놓친 정보 보완

(6) 최종 포맷 생성

원하는 출력 형태로 변환


어떻게 구현하는가

대표적인 방법 3가지

방법 1. Rule-based (가장 일반적)

방법 2. Dictionary 기반

방법 3. 모델 기반 후처리 (고급)

 

 

전체 파이프라인 정리

실제 시스템은 다음처럼 구성된다.

입력 (대화)
↓
RoBERTa / DeBERTa (NER)
↓
개체 리스트
↓
후처리
↓
구조화된 결과

 

 

 

왜 RoBERTa / DeBERTa + NER + 후처리가 좋은가

이 구조가 추천되는 이유는 명확하다.

첫째, 정확도
DeBERTa/RoBERTa는 토큰 단위 의미 이해가 매우 강함
→ 개체 추출 정확도 높음

둘째, 통제 가능성
후처리를 통해 결과를 완전히 원하는 형태로 강제 가능

셋째, 안정성
생성형 모델(GPT 등)은 출력이 흔들릴 수 있음
→ NER + 규칙 기반은 일관성 높음

넷째, 확장성
새로운 라벨(SYMPTOM, DRUG 등)을 추가하기 쉬움

 

 

핵심 요약

NER은 문장에서 “무엇이 중요한 정보인지”를 찾아내고 라벨을 붙이는 단계이다.

후처리는 그 결과를 사람이 쓰거나 시스템이 쓰기 좋은 “정리된 형태”로 변환하는 단계이다.

즉, NER = 추출, 후처리 = 정리 및 구조화

반응형