GPT
개요
GPT(Generative Pre-trained Transformer)는 오픈AI(OpenAI)에서발한 자연어 처리(NLP) 분야의 대표적인 언어 모델 시리즈로, 트랜스포머(Transformer) 아키텍처를 기반으로 한 생성형 사전 훈련 모델입니다. GPT는 대량의 텍스트 데이터를 이용해 사전 훈련된 후, 특정 작업에 맞게 미세 조정(fine-tuning)하거나 프롬프트 기반으로 추론하는 방식으로 자연어 생성, 번역, 질문 응답, 요약 등 다양한 언어 과제를 수행할 수 있습니다. GPT의 등장은 자연어처리 기술의 패러다임을 바꾸었으며, 특히 대규모 언어 모델(LLM, Large Language Model)의 발전을 주도하였습니다.
GPT 시리즈는 GPT-1에서 시작하여 GPT-2, GPT-3, 그리고 최신 버전인 GPT-4까지 진화하며 모델의 규모, 성능, 응용 범위가 급격히 확장되었습니다. 이 문서에서는 GPT의 구조, 발전 과정, 핵심 기술, 응용 분야 및 사회적 영향에 대해 다룹니다.
GPT의 아키텍처와 핵심 기술
트랜스포머 기반 구조
GPT는 트랜스포머(Transformer) 아키텍처의 디코더(Decoder) 부분만을 사용하는 구조를 가집니다. 트랜스포머는 2017년 Vaswani 등이 제안한 모델로, 순차적 처리가 필요한 순환 신경망(RNN)과 달리 자기 주의(Self-Attention) 메커니즘을 통해 문장 내 단어 간의 관계를 병렬적으로 분석할 수 있습니다.
GPT는 특히 자기 회귀형(autoregressive) 모델로, 주어진 문맥에서 다음 단어를 예측하는 방식으로 작동합니다. 이는 왼쪽에서 오른쪽으로 토큰을 하나씩 생성하며, 이전에 생성된 토큰들을 기반으로 다음 토큰을 확률적으로 선택합니다.
사전 훈련과 미세 조정
GPT의 학습 과정은 크게 두 단계로 나뉩니다:
-
사전 훈련(Pre-training):
방대한 양의 비정형 텍스트 데이터(예: 웹 페이지, 책, 기사 등)를 사용해 언어 모델을 학습합니다. 목표는 주어진 문맥에서 다음 단어를 정확히 예측하는 것이며, 이 과정에서 모델은 문법, 사실 지식, 추론 능력 등을 익힙니다.
-
미세 조정(Fine-tuning):
특정 과제(예: 감성 분석, 질의 응답)에 맞춰 사전 훈련된 모델을 추가로 학습시킵니다. 이후 GPT-3부터는 제로샷(zero-shot), 원샷(one-shot), 페샷(few-shot) 학습이 가능해져, 미세 조정 없이도 프롬프트만으로 과제를 수행할 수 있게 되었습니다.
GPT 시리즈의 발전
| 버전 |
발표 연도 |
파라미터 수 |
주요 특징 |
| GPT-1 |
2018 |
1.17억 |
트랜스포머 디코더 기반, 사전 훈련 + 미세 조정 방식 도입 |
| GPT-2 |
2019 |
최대 15억 |
스케일 확장, 제로샷 성능 향상, 오픈소스 배포 제한 |
| GPT-3 |
2020 |
1750억 |
극대규모 모델, few-shot 학습 가능, 광범위한 응용 |
| GPT-4 |
2023 |
공개되지 않음 (추정 수천억) |
멀티모달 지원, 향상된 추론 및 정확도, 상업적 서비스 통합 |
주요 진화 요소
- 모델 규모 증가: 파라미터 수가 급격히 증가하며, 더 복잡한 언어 패턴과 지식을 학습할 수 있게 되었습니다.
- 프롬프트 기반 인터페이스: 사용자가 자연어로 명령을 입력하면 모델이 이를 해석하고 응답하는 방식이 일반화되었습니다.
- 멀티모달 기능: GPT-4는 텍스트 외에도 이미지 입력을 처리할 수 있는 능력을 갖추며, 시각 정보와 언어를 통합하는 방향으로 발전했습니다.
응용 분야
GPT 기반 모델은 다음과 같은 다양한 분야에서 활용되고 있습니다:
- 대화형 AI: 챗봇, 가상 비서, 고객 지원 시스템
- 콘텐츠 생성: 뉴스 기사, 블로그, 시나리오, 코드 생성
- 교육: 학습 보조, 문제 생성, 해설 제공
- 프로그래밍 보조: GitHub Copilot 등에서 코드 자동 완성 및 버그 수정 지원
- 번역 및 요약: 다국어 번역, 긴 문서 요약
특히 ChatGPT는 GPT-3.5 및 GPT-4 기반의 대화형 인터페이스로, 일반 사용자에게도 널리 보급되며 AI 기술의 대중화를 이끌었습니다.
사회적 영향과 논의
GPT의 등장은 기술적 성과 외에도 여러 사회적 논의를 촉발했습니다:
- 윤리적 문제: 허위 정보 생성, 저작권 침해, 편향성(bias) 문제
- 직업 대체 우려: 콘텐츠 제작, 번역, 고객 서비스 등 일부 직무 자동화 가능성
- 환경적 영향: 대규모 모델 훈련에 따른 막대한 에너지 소비
- 접근성과 공정성: 고성능 AI 서비스의 상업화로 인한 접근 격차
이에 따라 연구자와 기업들은 안전한 AI 개발, 투명성 확보, 공정한 사용 정책 수립을 위한 노력을 지속하고 있습니다.
참고 자료 및 관련 문서
GPT는 자연어처리 기술의 정점 중 하나로, 인간과 기계 간의 언어 소통을 혁신적으로 변화시켰습니다. 앞으로도 더욱 정교하고 안전한 AI 시스템 개발을 위한 연구와 규제가 병행되어야 할 것입니다.
한계와 논란
- 허구 생성(Hallucination): 사실이 아닌 정보를 사실처럼 생성할 수 있음
관련 기술 및 모델
- BERT: 구글의 인코더 기반 변환기 모델 (이중 방향 언어 모델)
- PaLM, Llama, Falcon: GPT와 유사한 대규모 언어 모델
- LangChain: GPT 기반 애플리케이션 구축을 위한 프레임워크
주요 버전 및 발전 상세
| 버전 |
발표 연도 |
파라미터 수 |
특징 |
| GPT-1 |
2018 |
약 1.17억 |
트랜스포머 기반 최초의 GPT 모델, 12개의 어텐션 레이어 |
| GPT-3.5 |
2022 |
비공개 |
ChatGPT의 기반 모델, 대화형 AI 최적화 |
| GPT-4 |
2023 |
비공개 (추정 1조 이상) |
멀티모달 지원, 향상된 정확성 및 추론 능력 |
- GPT-4의 파라미터 규모는 추정치로 1조 개 이상으로 언급됨.
한계 및 논란
- 허구 생성(Hallucination): 사실이 아닌 내용을 자연스럽게 생성할 수 있음.
- 윤리적 문제: 가짜 뉴스, 학술 부정, 개인정보 유출 등의 위험.
GPT 시리즈의 상세 버전 및 특징
| 버전 |
발표 연도 |
파라미터 수 |
특징 |
| GPT-3.5 |
2022 |
비공개 |
GPT-3의 개선 버전이며 ChatGPT의 기반 모델로 활용됨 |
| GPT-4 |
2023 |
추정 수조 |
이전 버전보다 정교한 추론 및 사실 기반 응답, 긴 문맥 처리(32,768토큰 이상) 가능 |
GPT-3의 혁신적 측면
학습 데이터 양과 모델 크기의 증가가 자연어 이해 및 생성 능력에 직접적인 영향을 준다는 사실을 입증하였으며, 사용자가 예시를 몇 개만 제시하면 별도의 재학습 없이 과제를 수행하는 few-shot 학습의 전환점이 되었습니다.
GPT-4의 기술적 진화
이미지 입력을 처리할 수 있는 멀티모달 기능과 더불어 높은 일관성, 안전성, 정확성을 제공하여 기업 및 전문 분야에서의 활용도를 높였습니다.
추가 응용 분야
- 의료 보조: 진단 보조, 환자 상담 예시 생성 등 의사 결정 지원
- 법률 및 행정: 계약서 초안 작성, 법률 자문 보조
모델의 한계와 대응 방안
- 환각 현상(Hallucination): 모델이 자신 있게 틀린 정보를 생성하는 문제
- 대응 기술: 이러한 문제를 해결하기 위해 오픈AI는 모델 카드(Model Cards), 안전성 필터, 콘텐츠 정책 등을 도입하여 운영하고 있습니다.
토큰화와 BPE 알고리즘
GPT는 텍스트를 직접 처리하는 대신, 이를 작은 단위인 토큰(Token)으로 나누어 처리합니다. 이때 사용되는 핵심 알고리즘이 BPE(Byte Pair Encoding, 바이트 쌍 인코딩)입니다. BPE는 문자 단위(Character-level)와 단어 단위(Word-level)의 중간 형태인 서브워드(Subword) 분절 방식을 사용하여, 희귀 단어(Out-of-Vocabulary) 문제를 해결하고 효율적인 사전 크기를 유지합니다.
BPE 작동 예시:
1. 초기화: 모든 문자를 개별 토큰으로 분리합니다. (예: low: 5, lower: 2, newest: 6, widest: 3)
2. 빈도 계산: 데이터셋에서 가장 빈번하게 연속해서 등장하는 문자 쌍을 찾습니다.
3. 병합: 가장 빈번한 쌍을 하나의 새로운 토큰으로 병합합니다.
- 예: e와 s가 가장 많이 붙어 나온다면 $\rightarrow$ es라는 새로운 토큰 생성
- 이후 es와 t가 많이 나온다면 $\rightarrow$ est라는 새로운 토큰 생성
4. 반복: 미리 정해진 사전 크기에 도달할 때까지 이 과정을 반복합니다.
결과적으로 lowest라는 단어는 low + est와 같이 의미 있는 단위로 쪼개져 모델이 효율적으로 학습할 수 있게 됩니다.
최신 멀티모달 진화: GPT-4o
최신 모델인 GPT-4o(Omni)는 텍스트, 오디오, 이미지를 단일 신경망에서 동시에 처리하는 네이티브 멀티모달(Native Multimodal) 아키텍처를 채택하였습니다. 기존 모델들이 각 모달리티별로 별도의 인코더를 거쳐 텍스트로 변환해 처리했던 것과 달리, GPT-4o는 모든 입력을 동일한 토큰 공간에서 처리하여 응답 속도를 획기적으로 줄이고 감정 표현 및 실시간 상호작용 능력을 극대화했습니다.
GPT-4o 멀티모달 성능 비교
| 비교 항목 |
GPT-4 (with Vision) |
GPT-4o |
비고 |
| 처리 방식 |
모달리티별 개별 모델 결합 |
단일 엔드-투-엔드 모델 |
통합 아키텍처 |
| 응답 속도 |
상대적으로 느림 (단계적 처리) |
실시간 수준 (Low Latency) |
오디오 응답 속도 대폭 개선 |
| 오디오 이해 |
텍스트 변환(STT) 후 처리 |
오디오 파형 직접 처리 |
억양, 감정, 배경음 인식 가능 |
| 시각 처리 |
이미지 캡셔닝 기반 분석 |
실시간 비디오/이미지 스트리밍 |
화면 공유를 통한 실시간 대화 가능 |
검색 증강 생성 (RAG)
RAG(Retrieval-Augmented Generation)는 모델의 내부 파라미터에 저장된 지식에만 의존하지 않고, 외부의 신뢰할 수 있는 지식 베이스(DB, 문서 등)에서 관련 정보를 먼저 검색(Retrieval)한 뒤, 그 내용을 바탕으로 답변을 생성(Generation)하는 기술입니다. 이는 GPT의 고질적인 문제인 환각(Hallucination) 현상을 억제하고 최신 정보를 반영하는 데 매우 효과적입니다.
RAG 작동 원리 도식도
사용자 질문 $\rightarrow$ 질문 임베딩(Vectorization) $\rightarrow$ <a href="/doc/%EA%B8%B0%EC%88%A0/%EB%8D%B0%EC%9D%B4%ED%84%B0%EA%B3%BC%ED%95%99/%EB%B6%84%EC%84%9D/%EB%B2%A1%ED%84%B0%20DB" class="wiki-link wiki-link-missing">벡터 DB</a>에서 관련 문서 검색 $\rightarrow$ [질문 + 검색된 문서]를 프롬프트로 구성 $\rightarrow$ GPT 모델 입력 $\rightarrow$ 근거 기반 답변 생성
적용 사례:
- 기업 내부 문서 챗봇: 사내 규정집이나 매뉴얼을 DB화하여 정확한 사내 정보 제공
- 최신 뉴스 기반 분석: 실시간 뉴스 API를 연결하여 최신 시사 이슈에 대해 답변
RLHF와 정렬(Alignment)
RLHF(Reinforcement Learning from Human Feedback, 인간 피드백 기반 강화학습)는 사전 훈련된 모델이 인간의 가치관, 윤리, 의도에 부합하는 응답을 하도록 미세 조정하는 핵심 기술입니다. 단순히 다음 단어를 예측하는 것을 넘어, '유용한지', '안전한지', '정직한지'를 학습시키는 정렬(Alignment) 과정입니다.
- 비교 데이터 수집: 모델이 생성한 여러 개의 답변 중 인간이 더 선호하는 답변을 선택합니다.
- 보상 모델(Reward Model) 학습: 인간의 선호도를 예측하는 별도의 보상 모델을 만듭니다.
- 강화학습(PPO 등): 보상 모델로부터 높은 점수를 받는 방향으로 GPT 모델의 가중치를 업데이트합니다.
이 과정을 통해 모델은 유해한 요청을 거절하거나, 더 정중하고 도움이 되는 말투를 습득하게 됩니다.
추론 최적화 및 효율화 기술
거대 모델의 막대한 연산 비용과 메모리 요구량을 해결하기 위해 다음과 같은 최적화 기법들이 적용되고 있습니다.
- KV 캐싱 (KV Caching): 자기 회귀 생성 시, 이전 토큰들의 Key-Value 값을 매번 다시 계산하지 않고 메모리에 저장해 두어 추론 속도를 비약적으로 높이는 기술입니다.
- 양자화 (Quantization): 모델의 가중치(Weight)를 고정밀도(예: FP32)에서 저정밀도(예: INT8, FP8, NF4)로 변환하여 메모리 사용량을 줄이고 연산 속도를 높이는 기법입니다.
- LoRA (Low-Rank Adaptation): 전체 파라미터를 업데이트하는 대신, 매우 작은 크기의 행렬(Low-rank matrices)만을 추가하여 학습시키는 효율적인 미세 조정 기법입니다. 이를 통해 적은 컴퓨팅 자원으로도 특정 도메인에 최적화된 모델을 만들 수 있습니다.
# GPT
## 개요
**GPT**(Generative Pre-trained Transformer)는 오픈AI(OpenAI)에서발한 자연어 처리(NLP) 분야의 대표적인 언어 모델 시리즈로, 트랜스포머(Transformer) 아키텍처를 기반으로 한 생성형 사전 훈련 모델입니다. GPT는 대량의 텍스트 데이터를 이용해 사전 훈련된 후, 특정 작업에 맞게 미세 조정(fine-tuning)하거나 프롬프트 기반으로 추론하는 방식으로 자연어 생성, 번역, 질문 응답, 요약 등 다양한 언어 과제를 수행할 수 있습니다. GPT의 등장은 자연어처리 기술의 패러다임을 바꾸었으며, 특히 **대규모 언어 모델**(LLM, Large Language Model)의 발전을 주도하였습니다.
GPT 시리즈는 GPT-1에서 시작하여 GPT-2, GPT-3, 그리고 최신 버전인 GPT-4까지 진화하며 모델의 규모, 성능, 응용 범위가 급격히 확장되었습니다. 이 문서에서는 GPT의 구조, 발전 과정, 핵심 기술, 응용 분야 및 사회적 영향에 대해 다룹니다.
---
## GPT의 아키텍처와 핵심 기술
### 트랜스포머 기반 구조
GPT는 **트랜스포머**(Transformer) 아키텍처의 **디코더**(Decoder) 부분만을 사용하는 구조를 가집니다. 트랜스포머는 2017년 Vaswani 등이 제안한 모델로, 순차적 처리가 필요한 순환 신경망(RNN)과 달리 **자기 주의**(Self-Attention) 메커니즘을 통해 문장 내 단어 간의 관계를 병렬적으로 분석할 수 있습니다.
GPT는 특히 **자기 회귀형**(autoregressive) 모델로, 주어진 문맥에서 다음 단어를 예측하는 방식으로 작동합니다. 이는 왼쪽에서 오른쪽으로 토큰을 하나씩 생성하며, 이전에 생성된 토큰들을 기반으로 다음 토큰을 확률적으로 선택합니다.
### 사전 훈련과 미세 조정
GPT의 학습 과정은 크게 두 단계로 나뉩니다:
1. **사전 훈련**(Pre-training):
방대한 양의 비정형 텍스트 데이터(예: 웹 페이지, 책, 기사 등)를 사용해 언어 모델을 학습합니다. 목표는 주어진 문맥에서 다음 단어를 정확히 예측하는 것이며, 이 과정에서 모델은 문법, 사실 지식, 추론 능력 등을 익힙니다.
2. **미세 조정**(Fine-tuning):
특정 과제(예: 감성 분석, 질의 응답)에 맞춰 사전 훈련된 모델을 추가로 학습시킵니다. 이후 GPT-3부터는 **제로샷**(zero-shot), **원샷**(one-shot), **페샷**(few-shot) 학습이 가능해져, 미세 조정 없이도 프롬프트만으로 과제를 수행할 수 있게 되었습니다.
---
## GPT 시리즈의 발전
| 버전 | 발표 연도 | 파라미터 수 | 주요 특징 |
|------|----------|--------------|-----------|
| GPT-1 | 2018 | 1.17억 | 트랜스포머 디코더 기반, 사전 훈련 + 미세 조정 방식 도입 |
| GPT-2 | 2019 | 최대 15억 | 스케일 확장, 제로샷 성능 향상, 오픈소스 배포 제한 |
| GPT-3 | 2020 | 1750억 | 극대규모 모델, few-shot 학습 가능, 광범위한 응용 |
| GPT-4 | 2023 | 공개되지 않음 (추정 수천억) | 멀티모달 지원, 향상된 추론 및 정확도, 상업적 서비스 통합 |
### 주요 진화 요소
- **모델 규모 증가**: 파라미터 수가 급격히 증가하며, 더 복잡한 언어 패턴과 지식을 학습할 수 있게 되었습니다.
- **프롬프트 기반 인터페이스**: 사용자가 자연어로 명령을 입력하면 모델이 이를 해석하고 응답하는 방식이 일반화되었습니다.
- **멀티모달 기능**: GPT-4는 텍스트 외에도 이미지 입력을 처리할 수 있는 능력을 갖추며, 시각 정보와 언어를 통합하는 방향으로 발전했습니다.
---
## 응용 분야
GPT 기반 모델은 다음과 같은 다양한 분야에서 활용되고 있습니다:
- **대화형 AI**: 챗봇, 가상 비서, 고객 지원 시스템
- **콘텐츠 생성**: 뉴스 기사, 블로그, 시나리오, 코드 생성
- **교육**: 학습 보조, 문제 생성, 해설 제공
- **프로그래밍 보조**: GitHub Copilot 등에서 코드 자동 완성 및 버그 수정 지원
- **번역 및 요약**: 다국어 번역, 긴 문서 요약
특히 **ChatGPT**는 GPT-3.5 및 GPT-4 기반의 대화형 인터페이스로, 일반 사용자에게도 널리 보급되며 AI 기술의 대중화를 이끌었습니다.
---
## 사회적 영향과 논의
GPT의 등장은 기술적 성과 외에도 여러 사회적 논의를 촉발했습니다:
- **윤리적 문제**: 허위 정보 생성, 저작권 침해, 편향성(bias) 문제
- **직업 대체 우려**: 콘텐츠 제작, 번역, 고객 서비스 등 일부 직무 자동화 가능성
- **환경적 영향**: 대규모 모델 훈련에 따른 막대한 에너지 소비
- **접근성과 공정성**: 고성능 AI 서비스의 상업화로 인한 접근 격차
이에 따라 연구자와 기업들은 **안전한 AI 개발**, **투명성 확보**, **공정한 사용 정책** 수립을 위한 노력을 지속하고 있습니다.
---
## 참고 자료 및 관련 문서
- Vaswani, A. et al. (2017). [Attention is All You Need](https://arxiv.org/abs/1706.03762)
- Radford, A. et al. (2018). [Improving Language Understanding by Generative Pre-Training](https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf)
- Brown, T. et al. (2020). [Language Models are Few-Shot Learners](https://arxiv.org/abs/2005.14165)
- OpenAI 공식 웹사이트: [https://openai.com](https://openai.com)
- 관련 문서: [트랜스포머 (Transformer)], [대규모 언어 모델 (LLM)], [자연어 생성 (NLG)]
---
GPT는 자연어처리 기술의 정점 중 하나로, 인간과 기계 간의 언어 소통을 혁신적으로 변화시켰습니다. 앞으로도 더욱 정교하고 안전한 AI 시스템 개발을 위한 연구와 규제가 병행되어야 할 것입니다.
## 한계와 논란
- **허구 생성(Hallucination)**: 사실이 아닌 정보를 사실처럼 생성할 수 있음
## 관련 기술 및 모델
- **BERT**: 구글의 인코더 기반 변환기 모델 (이중 방향 언어 모델)
- **PaLM, Llama, Falcon**: GPT와 유사한 대규모 언어 모델
- **LangChain**: GPT 기반 애플리케이션 구축을 위한 프레임워크
## 주요 버전 및 발전 상세
| 버전 | 발표 연도 | 파라미터 수 | 특징 |
|------|----------|-------------|------|
| GPT-1 | 2018 | 약 1.17억 | 트랜스포머 기반 최초의 GPT 모델, 12개의 어텐션 레이어 |
| GPT-3.5 | 2022 | 비공개 | ChatGPT의 기반 모델, 대화형 AI 최적화 |
| GPT-4 | 2023 | 비공개 (추정 1조 이상) | 멀티모달 지원, 향상된 정확성 및 추론 능력 |
- **GPT-4**의 파라미터 규모는 추정치로 1조 개 이상으로 언급됨.
## 한계 및 논란
- **허구 생성(Hallucination)**: 사실이 아닌 내용을 자연스럽게 생성할 수 있음.
- **윤리적 문제**: 가짜 뉴스, 학술 부정, 개인정보 유출 등의 위험.
## GPT 시리즈의 상세 버전 및 특징
| 버전 | 발표 연도 | 파라미터 수 | 특징 |
|------|----------|--------------|------|
| GPT-3.5 | 2022 | 비공개 | GPT-3의 개선 버전이며 ChatGPT의 기반 모델로 활용됨 |
| GPT-4 | 2023 | 추정 수조 | 이전 버전보다 정교한 추론 및 사실 기반 응답, 긴 문맥 처리(32,768토큰 이상) 가능 |
### GPT-3의 혁신적 측면
학습 데이터 양과 모델 크기의 증가가 자연어 이해 및 생성 능력에 직접적인 영향을 준다는 사실을 입증하였으며, 사용자가 예시를 몇 개만 제시하면 별도의 재학습 없이 과제를 수행하는 few-shot 학습의 전환점이 되었습니다.
### GPT-4의 기술적 진화
이미지 입력을 처리할 수 있는 멀티모달 기능과 더불어 높은 일관성, 안전성, 정확성을 제공하여 기업 및 전문 분야에서의 활용도를 높였습니다.
## 추가 응용 분야
- **의료 보조**: 진단 보조, 환자 상담 예시 생성 등 의사 결정 지원
- **법률 및 행정**: 계약서 초안 작성, 법률 자문 보조
## 모델의 한계와 대응 방안
- **환각 현상(Hallucination)**: 모델이 자신 있게 틀린 정보를 생성하는 문제
- **대응 기술**: 이러한 문제를 해결하기 위해 오픈AI는 모델 카드(Model Cards), 안전성 필터, 콘텐츠 정책 등을 도입하여 운영하고 있습니다.
## 토큰화와 BPE 알고리즘
GPT는 텍스트를 직접 처리하는 대신, 이를 작은 단위인 **토큰(Token)**으로 나누어 처리합니다. 이때 사용되는 핵심 알고리즘이 **BPE(Byte Pair Encoding, 바이트 쌍 인코딩)**입니다. BPE는 문자 단위(Character-level)와 단어 단위(Word-level)의 중간 형태인 서브워드(Subword) 분절 방식을 사용하여, 희귀 단어(Out-of-Vocabulary) 문제를 해결하고 효율적인 사전 크기를 유지합니다.
**BPE 작동 예시:**
1. **초기화**: 모든 문자를 개별 토큰으로 분리합니다. (예: `low: 5`, `lower: 2`, `newest: 6`, `widest: 3`)
2. **빈도 계산**: 데이터셋에서 가장 빈번하게 연속해서 등장하는 문자 쌍을 찾습니다.
3. **병합**: 가장 빈번한 쌍을 하나의 새로운 토큰으로 병합합니다.
- 예: `e`와 `s`가 가장 많이 붙어 나온다면 $\rightarrow$ `es`라는 새로운 토큰 생성
- 이후 `es`와 `t`가 많이 나온다면 $\rightarrow$ `est`라는 새로운 토큰 생성
4. **반복**: 미리 정해진 사전 크기에 도달할 때까지 이 과정을 반복합니다.
결과적으로 `lowest`라는 단어는 `low` + `est`와 같이 의미 있는 단위로 쪼개져 모델이 효율적으로 학습할 수 있게 됩니다.
## 최신 멀티모달 진화: GPT-4o
최신 모델인 **GPT-4o**(Omni)는 텍스트, 오디오, 이미지를 단일 신경망에서 동시에 처리하는 **네이티브 멀티모달(Native Multimodal)** 아키텍처를 채택하였습니다. 기존 모델들이 각 모달리티별로 별도의 인코더를 거쳐 텍스트로 변환해 처리했던 것과 달리, GPT-4o는 모든 입력을 동일한 토큰 공간에서 처리하여 응답 속도를 획기적으로 줄이고 감정 표현 및 실시간 상호작용 능력을 극대화했습니다.
**GPT-4o 멀티모달 성능 비교**
| 비교 항목 | GPT-4 (with Vision) | GPT-4o | 비고 |
| :--- | :--- | :--- | :--- |
| **처리 방식** | 모달리티별 개별 모델 결합 | 단일 엔드-투-엔드 모델 | 통합 아키텍처 |
| **응답 속도** | 상대적으로 느림 (단계적 처리) | 실시간 수준 (Low Latency) | 오디오 응답 속도 대폭 개선 |
| **오디오 이해** | 텍스트 변환(STT) 후 처리 | 오디오 파형 직접 처리 | 억양, 감정, 배경음 인식 가능 |
| **시각 처리** | 이미지 캡셔닝 기반 분석 | 실시간 비디오/이미지 스트리밍 | 화면 공유를 통한 실시간 대화 가능 |
## 검색 증강 생성 (RAG)
**RAG(Retrieval-Augmented Generation)**는 모델의 내부 파라미터에 저장된 지식에만 의존하지 않고, 외부의 신뢰할 수 있는 지식 베이스(DB, 문서 등)에서 관련 정보를 먼저 **검색(Retrieval)**한 뒤, 그 내용을 바탕으로 답변을 **생성(Generation)**하는 기술입니다. 이는 GPT의 고질적인 문제인 환각(Hallucination) 현상을 억제하고 최신 정보를 반영하는 데 매우 효과적입니다.
**RAG 작동 원리 도식도**
`사용자 질문` $\rightarrow$ `질문 임베딩(Vectorization)` $\rightarrow$ `벡터 DB에서 관련 문서 검색` $\rightarrow$ `[질문 + 검색된 문서]를 프롬프트로 구성` $\rightarrow$ `GPT 모델 입력` $\rightarrow$ `근거 기반 답변 생성`
**적용 사례:**
- **기업 내부 문서 챗봇**: 사내 규정집이나 매뉴얼을 DB화하여 정확한 사내 정보 제공
- **최신 뉴스 기반 분석**: 실시간 뉴스 API를 연결하여 최신 시사 이슈에 대해 답변
## RLHF와 정렬(Alignment)
**RLHF(Reinforcement Learning from Human Feedback, 인간 피드백 기반 강화학습)**는 사전 훈련된 모델이 인간의 가치관, 윤리, 의도에 부합하는 응답을 하도록 미세 조정하는 핵심 기술입니다. 단순히 다음 단어를 예측하는 것을 넘어, '유용한지', '안전한지', '정직한지'를 학습시키는 **정렬(Alignment)** 과정입니다.
1. **비교 데이터 수집**: 모델이 생성한 여러 개의 답변 중 인간이 더 선호하는 답변을 선택합니다.
2. **보상 모델(Reward Model) 학습**: 인간의 선호도를 예측하는 별도의 보상 모델을 만듭니다.
3. **강화학습(PPO 등)**: 보상 모델로부터 높은 점수를 받는 방향으로 GPT 모델의 가중치를 업데이트합니다.
이 과정을 통해 모델은 유해한 요청을 거절하거나, 더 정중하고 도움이 되는 말투를 습득하게 됩니다.
## 추론 최적화 및 효율화 기술
거대 모델의 막대한 연산 비용과 메모리 요구량을 해결하기 위해 다음과 같은 최적화 기법들이 적용되고 있습니다.
- **KV 캐싱 (KV Caching)**: 자기 회귀 생성 시, 이전 토큰들의 Key-Value 값을 매번 다시 계산하지 않고 메모리에 저장해 두어 추론 속도를 비약적으로 높이는 기술입니다.
- **양자화 (Quantization)**: 모델의 가중치(Weight)를 고정밀도(예: FP32)에서 저정밀도(예: INT8, FP8, NF4)로 변환하여 메모리 사용량을 줄이고 연산 속도를 높이는 기법입니다.
- **LoRA (Low-Rank Adaptation)**: 전체 파라미터를 업데이트하는 대신, 매우 작은 크기의 행렬(Low-rank matrices)만을 추가하여 학습시키는 효율적인 미세 조정 기법입니다. 이를 통해 적은 컴퓨팅 자원으로도 특정 도메인에 최적화된 모델을 만들 수 있습니다.